{ "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 3000, "global_step": 44343, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 6.76544212164265e-05, "grad_norm": 5.0, "learning_rate": 0.0002999932345578783, "loss": 3.5938, "step": 1 }, { "epoch": 0.20296326364927947, "grad_norm": 0.99609375, "learning_rate": 0.000279703673635072, "loss": 2.6416, "step": 3000 }, { "epoch": 0.20296326364927947, "eval_loss": 2.220994234085083, "eval_runtime": 59.2323, "eval_samples_per_second": 1593.809, "eval_steps_per_second": 6.23, "step": 3000 }, { "epoch": 0.40592652729855894, "grad_norm": 0.85546875, "learning_rate": 0.0002594073472701441, "loss": 2.5493, "step": 6000 }, { "epoch": 0.40592652729855894, "eval_loss": 2.1989541053771973, "eval_runtime": 59.05, "eval_samples_per_second": 1598.731, "eval_steps_per_second": 6.249, "step": 6000 }, { "epoch": 0.6088897909478385, "grad_norm": 0.85546875, "learning_rate": 0.0002391110209052161, "loss": 2.5262, "step": 9000 }, { "epoch": 0.6088897909478385, "eval_loss": 2.185298204421997, "eval_runtime": 59.1009, "eval_samples_per_second": 1597.354, "eval_steps_per_second": 6.244, "step": 9000 }, { "epoch": 0.8118530545971179, "grad_norm": 1.0546875, "learning_rate": 0.0002188146945402882, "loss": 2.5175, "step": 12000 }, { "epoch": 0.8118530545971179, "eval_loss": 2.1791369915008545, "eval_runtime": 59.0761, "eval_samples_per_second": 1598.025, "eval_steps_per_second": 6.246, "step": 12000 }, { "epoch": 1.0148163182463974, "grad_norm": 0.79296875, "learning_rate": 0.00019851836817536025, "loss": 2.5115, "step": 15000 }, { "epoch": 1.0148163182463974, "eval_loss": 2.175283670425415, "eval_runtime": 59.0895, "eval_samples_per_second": 1597.662, "eval_steps_per_second": 6.245, "step": 15000 }, { "epoch": 1.217779581895677, "grad_norm": 0.79296875, "learning_rate": 0.0001782220418104323, "loss": 2.5073, "step": 18000 }, { "epoch": 1.217779581895677, "eval_loss": 2.1722984313964844, "eval_runtime": 59.2348, "eval_samples_per_second": 1593.743, "eval_steps_per_second": 6.229, "step": 18000 }, { "epoch": 1.4207428455449564, "grad_norm": 0.921875, "learning_rate": 0.00015792571544550436, "loss": 2.505, "step": 21000 }, { "epoch": 1.4207428455449564, "eval_loss": 2.1715786457061768, "eval_runtime": 59.0551, "eval_samples_per_second": 1598.592, "eval_steps_per_second": 6.248, "step": 21000 }, { "epoch": 1.6237061091942357, "grad_norm": 0.85546875, "learning_rate": 0.0001376293890805764, "loss": 2.5018, "step": 24000 }, { "epoch": 1.6237061091942357, "eval_loss": 2.173018217086792, "eval_runtime": 59.0498, "eval_samples_per_second": 1598.734, "eval_steps_per_second": 6.249, "step": 24000 }, { "epoch": 1.8266693728435153, "grad_norm": 0.953125, "learning_rate": 0.00011733306271564845, "loss": 2.5013, "step": 27000 }, { "epoch": 1.8266693728435153, "eval_loss": 2.169842481613159, "eval_runtime": 59.0564, "eval_samples_per_second": 1598.558, "eval_steps_per_second": 6.248, "step": 27000 }, { "epoch": 2.029632636492795, "grad_norm": 0.9609375, "learning_rate": 9.703673635072052e-05, "loss": 2.5016, "step": 30000 }, { "epoch": 2.029632636492795, "eval_loss": 2.1703505516052246, "eval_runtime": 59.0576, "eval_samples_per_second": 1598.523, "eval_steps_per_second": 6.248, "step": 30000 }, { "epoch": 2.232595900142074, "grad_norm": 0.796875, "learning_rate": 7.674040998579256e-05, "loss": 2.4996, "step": 33000 }, { "epoch": 2.232595900142074, "eval_loss": 2.1704564094543457, "eval_runtime": 59.0291, "eval_samples_per_second": 1599.296, "eval_steps_per_second": 6.251, "step": 33000 }, { "epoch": 2.435559163791354, "grad_norm": 0.8984375, "learning_rate": 5.644408362086462e-05, "loss": 2.5016, "step": 36000 }, { "epoch": 2.435559163791354, "eval_loss": 2.1700754165649414, "eval_runtime": 59.045, "eval_samples_per_second": 1598.866, "eval_steps_per_second": 6.249, "step": 36000 }, { "epoch": 2.638522427440633, "grad_norm": 0.80078125, "learning_rate": 3.614775725593667e-05, "loss": 2.5006, "step": 39000 }, { "epoch": 2.638522427440633, "eval_loss": 2.169651985168457, "eval_runtime": 58.9122, "eval_samples_per_second": 1602.47, "eval_steps_per_second": 6.264, "step": 39000 }, { "epoch": 2.841485691089913, "grad_norm": 0.83203125, "learning_rate": 1.5851430891008727e-05, "loss": 2.5013, "step": 42000 }, { "epoch": 2.841485691089913, "eval_loss": 2.169821262359619, "eval_runtime": 59.0486, "eval_samples_per_second": 1598.768, "eval_steps_per_second": 6.249, "step": 42000 }, { "epoch": 3.0, "step": 44343, "total_flos": 4.3758285331164365e+17, "train_loss": 2.5180485786933677, "train_runtime": 21885.4497, "train_samples_per_second": 518.676, "train_steps_per_second": 2.026 } ], "logging_steps": 3000, "max_steps": 44343, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.3758285331164365e+17, "train_batch_size": 256, "trial_name": null, "trial_params": null }