{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.7713335796084226, "eval_steps": 339, "global_step": 600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "eval_loss": 11.850272178649902, "eval_runtime": 7.1659, "eval_samples_per_second": 19.956, "eval_steps_per_second": 19.956, "memory/device_reserved (GiB)": 3.2, "memory/max_active (GiB)": 3.1, "memory/max_allocated (GiB)": 3.1, "step": 0 }, { "epoch": 0.1477650535648319, "grad_norm": 9.9116792678833, "learning_rate": 0.00019925925947187668, "loss": 7.2742, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 50, "tokens_per_second_per_gpu": 2082.96, "total_tokens": 164572 }, { "epoch": 0.2955301071296638, "grad_norm": 12.538771629333496, "learning_rate": 0.0001961624298837552, "loss": 5.6623, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 100, "tokens_per_second_per_gpu": 1546.73, "total_tokens": 287922 }, { "epoch": 0.44329516069449576, "grad_norm": 25.31467628479004, "learning_rate": 0.00019072586525126637, "loss": 5.3752, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 150, "tokens_per_second_per_gpu": 1524.55, "total_tokens": 410915 }, { "epoch": 0.5910602142593276, "grad_norm": 25.589689254760742, "learning_rate": 0.00018308184302213046, "loss": 5.0362, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 200, "tokens_per_second_per_gpu": 1390.99, "total_tokens": 533959 }, { "epoch": 0.7388252678241596, "grad_norm": 26.41189956665039, "learning_rate": 0.00017341635045468791, "loss": 4.8371, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 250, "tokens_per_second_per_gpu": 1552.5, "total_tokens": 656838 }, { "epoch": 0.8865903213889915, "grad_norm": 23.636552810668945, "learning_rate": 0.00016196455934844978, "loss": 4.7248, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 300, "tokens_per_second_per_gpu": 1489.9, "total_tokens": 779045 }, { "epoch": 1.0, "eval_loss": 4.642312526702881, "eval_runtime": 7.0402, "eval_samples_per_second": 20.312, "eval_steps_per_second": 20.312, "memory/device_reserved (GiB)": 7.67, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 339 }, { "epoch": 1.032508311784263, "grad_norm": 29.976333618164062, "learning_rate": 0.00014900510406201564, "loss": 4.6412, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 350, "tokens_per_second_per_gpu": 346.62, "total_tokens": 945548 }, { "epoch": 1.1802733653490949, "grad_norm": 28.489376068115234, "learning_rate": 0.00013485330204031937, "loss": 4.4916, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 400, "tokens_per_second_per_gpu": 1511.66, "total_tokens": 1067762 }, { "epoch": 1.328038418913927, "grad_norm": 25.01222038269043, "learning_rate": 0.0001198534818030452, "loss": 4.4404, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 450, "tokens_per_second_per_gpu": 1375.01, "total_tokens": 1188747 }, { "epoch": 1.4758034724787588, "grad_norm": 19.93057632446289, "learning_rate": 0.00010437060506248341, "loss": 4.4182, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 500, "tokens_per_second_per_gpu": 1540.13, "total_tokens": 1312791 }, { "epoch": 1.6235685260435906, "grad_norm": 20.955829620361328, "learning_rate": 8.878138681368239e-05, "loss": 4.3869, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 550, "tokens_per_second_per_gpu": 1544.52, "total_tokens": 1437766 }, { "epoch": 1.7713335796084226, "grad_norm": 27.51922035217285, "learning_rate": 7.346512945462767e-05, "loss": 4.359, "memory/device_reserved (GiB)": 7.62, "memory/max_active (GiB)": 7.2, "memory/max_allocated (GiB)": 7.2, "step": 600, "tokens_per_second_per_gpu": 1525.07, "total_tokens": 1560469 } ], "logging_steps": 50, "max_steps": 1016, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.054385017061376e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }