Transformers
TensorBoard
Safetensors
t5
text2text-generation
Generated from Trainer
text-generation-inference
Instructions to use Plasmoxy/flan-t5-small-gigatrue-layercut-D5 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Plasmoxy/flan-t5-small-gigatrue-layercut-D5 with Transformers:
# Load model directly from transformers import AutoTokenizer, AutoModelForSeq2SeqLM tokenizer = AutoTokenizer.from_pretrained("Plasmoxy/flan-t5-small-gigatrue-layercut-D5") model = AutoModelForSeq2SeqLM.from_pretrained("Plasmoxy/flan-t5-small-gigatrue-layercut-D5", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 3000, | |
| "global_step": 44343, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 6.76544212164265e-05, | |
| "grad_norm": 5.0, | |
| "learning_rate": 0.0002999932345578783, | |
| "loss": 3.5938, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.20296326364927947, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 0.000279703673635072, | |
| "loss": 2.6416, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.20296326364927947, | |
| "eval_loss": 2.220994234085083, | |
| "eval_runtime": 59.2323, | |
| "eval_samples_per_second": 1593.809, | |
| "eval_steps_per_second": 6.23, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.40592652729855894, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 0.0002594073472701441, | |
| "loss": 2.5493, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.40592652729855894, | |
| "eval_loss": 2.1989541053771973, | |
| "eval_runtime": 59.05, | |
| "eval_samples_per_second": 1598.731, | |
| "eval_steps_per_second": 6.249, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.6088897909478385, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 0.0002391110209052161, | |
| "loss": 2.5262, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.6088897909478385, | |
| "eval_loss": 2.185298204421997, | |
| "eval_runtime": 59.1009, | |
| "eval_samples_per_second": 1597.354, | |
| "eval_steps_per_second": 6.244, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.8118530545971179, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.0002188146945402882, | |
| "loss": 2.5175, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 0.8118530545971179, | |
| "eval_loss": 2.1791369915008545, | |
| "eval_runtime": 59.0761, | |
| "eval_samples_per_second": 1598.025, | |
| "eval_steps_per_second": 6.246, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 1.0148163182463974, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 0.00019851836817536025, | |
| "loss": 2.5115, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.0148163182463974, | |
| "eval_loss": 2.175283670425415, | |
| "eval_runtime": 59.0895, | |
| "eval_samples_per_second": 1597.662, | |
| "eval_steps_per_second": 6.245, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.217779581895677, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 0.0001782220418104323, | |
| "loss": 2.5073, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.217779581895677, | |
| "eval_loss": 2.1722984313964844, | |
| "eval_runtime": 59.2348, | |
| "eval_samples_per_second": 1593.743, | |
| "eval_steps_per_second": 6.229, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.4207428455449564, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 0.00015792571544550436, | |
| "loss": 2.505, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 1.4207428455449564, | |
| "eval_loss": 2.1715786457061768, | |
| "eval_runtime": 59.0551, | |
| "eval_samples_per_second": 1598.592, | |
| "eval_steps_per_second": 6.248, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 1.6237061091942357, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 0.0001376293890805764, | |
| "loss": 2.5018, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 1.6237061091942357, | |
| "eval_loss": 2.173018217086792, | |
| "eval_runtime": 59.0498, | |
| "eval_samples_per_second": 1598.734, | |
| "eval_steps_per_second": 6.249, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 1.8266693728435153, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.00011733306271564845, | |
| "loss": 2.5013, | |
| "step": 27000 | |
| }, | |
| { | |
| "epoch": 1.8266693728435153, | |
| "eval_loss": 2.169842481613159, | |
| "eval_runtime": 59.0564, | |
| "eval_samples_per_second": 1598.558, | |
| "eval_steps_per_second": 6.248, | |
| "step": 27000 | |
| }, | |
| { | |
| "epoch": 2.029632636492795, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 9.703673635072052e-05, | |
| "loss": 2.5016, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 2.029632636492795, | |
| "eval_loss": 2.1703505516052246, | |
| "eval_runtime": 59.0576, | |
| "eval_samples_per_second": 1598.523, | |
| "eval_steps_per_second": 6.248, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 2.232595900142074, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 7.674040998579256e-05, | |
| "loss": 2.4996, | |
| "step": 33000 | |
| }, | |
| { | |
| "epoch": 2.232595900142074, | |
| "eval_loss": 2.1704564094543457, | |
| "eval_runtime": 59.0291, | |
| "eval_samples_per_second": 1599.296, | |
| "eval_steps_per_second": 6.251, | |
| "step": 33000 | |
| }, | |
| { | |
| "epoch": 2.435559163791354, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 5.644408362086462e-05, | |
| "loss": 2.5016, | |
| "step": 36000 | |
| }, | |
| { | |
| "epoch": 2.435559163791354, | |
| "eval_loss": 2.1700754165649414, | |
| "eval_runtime": 59.045, | |
| "eval_samples_per_second": 1598.866, | |
| "eval_steps_per_second": 6.249, | |
| "step": 36000 | |
| }, | |
| { | |
| "epoch": 2.638522427440633, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 3.614775725593667e-05, | |
| "loss": 2.5006, | |
| "step": 39000 | |
| }, | |
| { | |
| "epoch": 2.638522427440633, | |
| "eval_loss": 2.169651985168457, | |
| "eval_runtime": 58.9122, | |
| "eval_samples_per_second": 1602.47, | |
| "eval_steps_per_second": 6.264, | |
| "step": 39000 | |
| }, | |
| { | |
| "epoch": 2.841485691089913, | |
| "grad_norm": 0.83203125, | |
| "learning_rate": 1.5851430891008727e-05, | |
| "loss": 2.5013, | |
| "step": 42000 | |
| }, | |
| { | |
| "epoch": 2.841485691089913, | |
| "eval_loss": 2.169821262359619, | |
| "eval_runtime": 59.0486, | |
| "eval_samples_per_second": 1598.768, | |
| "eval_steps_per_second": 6.249, | |
| "step": 42000 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "step": 44343, | |
| "total_flos": 4.3758285331164365e+17, | |
| "train_loss": 2.5180485786933677, | |
| "train_runtime": 21885.4497, | |
| "train_samples_per_second": 518.676, | |
| "train_steps_per_second": 2.026 | |
| } | |
| ], | |
| "logging_steps": 3000, | |
| "max_steps": 44343, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 3000, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.3758285331164365e+17, | |
| "train_batch_size": 256, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |