{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 112, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.008968609865470852, "grad_norm": 53.086448669433594, "learning_rate": 8.333333333333333e-08, "loss": 1.8832473754882812, "step": 1, "token_acc": 0.7904509283819628 }, { "epoch": 0.04484304932735426, "grad_norm": 50.739845275878906, "learning_rate": 4.1666666666666667e-07, "loss": 1.9631423950195312, "step": 5, "token_acc": 0.7811925400577883 }, { "epoch": 0.08968609865470852, "grad_norm": 57.77216339111328, "learning_rate": 4.982452740033792e-07, "loss": 1.917200469970703, "step": 10, "token_acc": 0.7826272088567171 }, { "epoch": 0.13452914798206278, "grad_norm": 45.45051956176758, "learning_rate": 4.911588954770896e-07, "loss": 1.6417181015014648, "step": 15, "token_acc": 0.7838668645325418 }, { "epoch": 0.17937219730941703, "grad_norm": 29.748525619506836, "learning_rate": 4.787864043107546e-07, "loss": 1.3956175804138184, "step": 20, "token_acc": 0.7983138780804151 }, { "epoch": 0.2242152466367713, "grad_norm": 18.36032485961914, "learning_rate": 4.613990008754565e-07, "loss": 1.0362204551696776, "step": 25, "token_acc": 0.823134328358209 }, { "epoch": 0.26905829596412556, "grad_norm": 12.634122848510742, "learning_rate": 4.39377810540405e-07, "loss": 0.9633771896362304, "step": 30, "token_acc": 0.8259674349756819 }, { "epoch": 0.31390134529147984, "grad_norm": 12.553196907043457, "learning_rate": 4.1320552954763037e-07, "loss": 0.9026593208312989, "step": 35, "token_acc": 0.8319409786264511 }, { "epoch": 0.35874439461883406, "grad_norm": 10.537694931030273, "learning_rate": 3.834558444911977e-07, "loss": 0.6936460494995117, "step": 40, "token_acc": 0.8529003311612007 }, { "epoch": 0.40358744394618834, "grad_norm": 8.851151466369629, "learning_rate": 3.5078085732199307e-07, "loss": 0.5532908916473389, "step": 45, "token_acc": 0.8564440663547427 }, { "epoch": 0.4484304932735426, "grad_norm": 8.047605514526367, "learning_rate": 3.158967915172669e-07, "loss": 0.4655792236328125, "step": 50, "token_acc": 0.8672489082969432 }, { "epoch": 0.49327354260089684, "grad_norm": 5.037430286407471, "learning_rate": 2.7956829273034146e-07, "loss": 0.4132298469543457, "step": 55, "token_acc": 0.8758526603001364 }, { "epoch": 0.5381165919282511, "grad_norm": 4.6973795890808105, "learning_rate": 2.4259166804436003e-07, "loss": 0.37035222053527833, "step": 60, "token_acc": 0.8859882791688866 }, { "epoch": 0.5829596412556054, "grad_norm": 4.15280818939209, "learning_rate": 2.0577743121935682e-07, "loss": 0.36975529193878176, "step": 65, "token_acc": 0.8918689706350048 }, { "epoch": 0.6278026905829597, "grad_norm": 3.9701106548309326, "learning_rate": 1.6993253653429062e-07, "loss": 0.341289758682251, "step": 70, "token_acc": 0.8945971765205393 }, { "epoch": 0.672645739910314, "grad_norm": 4.165452480316162, "learning_rate": 1.3584269065157172e-07, "loss": 0.3513831615447998, "step": 75, "token_acc": 0.8890205796789139 }, { "epoch": 0.7174887892376681, "grad_norm": 3.6079013347625732, "learning_rate": 1.0425513022138202e-07, "loss": 0.32526259422302245, "step": 80, "token_acc": 0.8964762301918265 }, { "epoch": 0.7623318385650224, "grad_norm": 4.192943096160889, "learning_rate": 7.586224273425081e-08, "loss": 0.3390298366546631, "step": 85, "token_acc": 0.8946101517530088 }, { "epoch": 0.8071748878923767, "grad_norm": 4.325422763824463, "learning_rate": 5.1286389646661654e-08, "loss": 0.32544262409210206, "step": 90, "token_acc": 0.8968119022316684 }, { "epoch": 0.852017937219731, "grad_norm": 4.034622669219971, "learning_rate": 3.106626445109081e-08, "loss": 0.3152462005615234, "step": 95, "token_acc": 0.9032049206863062 }, { "epoch": 0.8968609865470852, "grad_norm": 3.9629170894622803, "learning_rate": 1.5645084716469776e-08, "loss": 0.31574268341064454, "step": 100, "token_acc": 0.8994632535094963 }, { "epoch": 0.9417040358744395, "grad_norm": 3.703305959701538, "learning_rate": 5.360876925123992e-09, "loss": 0.3193276166915894, "step": 105, "token_acc": 0.9001921434671221 }, { "epoch": 0.9865470852017937, "grad_norm": 4.387911796569824, "learning_rate": 4.390670589196621e-10, "loss": 0.30874266624450686, "step": 110, "token_acc": 0.9005263157894737 } ], "logging_steps": 5, "max_steps": 112, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.826709255104758e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }