{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.998891762098264, "eval_steps": 339, "global_step": 1016, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "eval_loss": 11.850272178649902, "eval_runtime": 7.1659, "eval_samples_per_second": 19.956, "eval_steps_per_second": 19.956, "memory/device_reserved (GiB)": 3.2, "memory/max_active (GiB)": 3.1, "memory/max_allocated (GiB)": 3.1, "step": 0 }, { "epoch": 0.1477650535648319, "grad_norm": 9.9116792678833, "learning_rate": 0.00019925925947187668, "loss": 7.2742, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 50, "tokens_per_second_per_gpu": 2082.96, "total_tokens": 164572 }, { "epoch": 0.2955301071296638, "grad_norm": 12.538771629333496, "learning_rate": 0.0001961624298837552, "loss": 5.6623, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 100, "tokens_per_second_per_gpu": 1546.73, "total_tokens": 287922 }, { "epoch": 0.44329516069449576, "grad_norm": 25.31467628479004, "learning_rate": 0.00019072586525126637, "loss": 5.3752, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 150, "tokens_per_second_per_gpu": 1524.55, "total_tokens": 410915 }, { "epoch": 0.5910602142593276, "grad_norm": 25.589689254760742, "learning_rate": 0.00018308184302213046, "loss": 5.0362, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 200, "tokens_per_second_per_gpu": 1390.99, "total_tokens": 533959 }, { "epoch": 0.7388252678241596, "grad_norm": 26.41189956665039, "learning_rate": 0.00017341635045468791, "loss": 4.8371, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 250, "tokens_per_second_per_gpu": 1552.5, "total_tokens": 656838 }, { "epoch": 0.8865903213889915, "grad_norm": 23.636552810668945, "learning_rate": 0.00016196455934844978, "loss": 4.7248, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 300, "tokens_per_second_per_gpu": 1489.9, "total_tokens": 779045 }, { "epoch": 1.0, "eval_loss": 4.642312526702881, "eval_runtime": 7.0402, "eval_samples_per_second": 20.312, "eval_steps_per_second": 20.312, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 339 }, { "epoch": 1.032508311784263, "grad_norm": 29.976333618164062, "learning_rate": 0.00014900510406201564, "loss": 4.6412, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 350, "tokens_per_second_per_gpu": 346.62, "total_tokens": 945548 }, { "epoch": 1.1802733653490949, "grad_norm": 28.489376068115234, "learning_rate": 0.00013485330204031937, "loss": 4.4916, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 400, "tokens_per_second_per_gpu": 1511.66, "total_tokens": 1067762 }, { "epoch": 1.328038418913927, "grad_norm": 25.01222038269043, "learning_rate": 0.0001198534818030452, "loss": 4.4404, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 450, "tokens_per_second_per_gpu": 1375.01, "total_tokens": 1188747 }, { "epoch": 1.4758034724787588, "grad_norm": 19.93057632446289, "learning_rate": 0.00010437060506248341, "loss": 4.4182, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 500, "tokens_per_second_per_gpu": 1540.13, "total_tokens": 1312791 }, { "epoch": 1.6235685260435906, "grad_norm": 20.955829620361328, "learning_rate": 8.878138681368239e-05, "loss": 4.3869, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 550, "tokens_per_second_per_gpu": 1544.52, "total_tokens": 1437766 }, { "epoch": 1.7713335796084226, "grad_norm": 27.51922035217285, "learning_rate": 7.346512945462767e-05, "loss": 4.359, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 600, "tokens_per_second_per_gpu": 1525.07, "total_tokens": 1560469 }, { "epoch": 1.9190986331732547, "grad_norm": 18.944068908691406, "learning_rate": 5.879449395213175e-05, "loss": 4.3688, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 650, "tokens_per_second_per_gpu": 1526.23, "total_tokens": 1681459 }, { "epoch": 2.0, "eval_loss": 4.463651657104492, "eval_runtime": 6.8792, "eval_samples_per_second": 20.787, "eval_steps_per_second": 20.787, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 678 }, { "epoch": 2.065016623568526, "grad_norm": 18.91043472290039, "learning_rate": 4.512643260086751e-05, "loss": 4.294, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 700, "tokens_per_second_per_gpu": 492.11, "total_tokens": 1847089 }, { "epoch": 2.212781677133358, "grad_norm": 22.407855987548828, "learning_rate": 3.279350399124066e-05, "loss": 4.2329, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 750, "tokens_per_second_per_gpu": 1508.42, "total_tokens": 1969141 }, { "epoch": 2.3605467306981898, "grad_norm": 22.668535232543945, "learning_rate": 2.209578150224645e-05, "loss": 4.2312, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 800, "tokens_per_second_per_gpu": 1531.3, "total_tokens": 2090972 }, { "epoch": 2.5083117842630216, "grad_norm": 18.202590942382812, "learning_rate": 1.3293552194358238e-05, "loss": 4.222, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 850, "tokens_per_second_per_gpu": 1544.96, "total_tokens": 2213097 }, { "epoch": 2.656076837827854, "grad_norm": 18.34627914428711, "learning_rate": 6.600983746212319e-06, "loss": 4.2271, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 900, "tokens_per_second_per_gpu": 1515.29, "total_tokens": 2335026 }, { "epoch": 2.8038418913926857, "grad_norm": 21.71125030517578, "learning_rate": 2.1809135253115565e-06, "loss": 4.2248, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 950, "tokens_per_second_per_gpu": 1450.1, "total_tokens": 2458575 }, { "epoch": 2.9516069449575175, "grad_norm": 16.12077522277832, "learning_rate": 1.4088658024622448e-07, "loss": 4.2186, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 1000, "tokens_per_second_per_gpu": 1481.33, "total_tokens": 2582586 } ], "logging_steps": 50, "max_steps": 1016, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.7850881269039104e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }