{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 345, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.6703570872545241, "epoch": 0.087527352297593, "grad_norm": 0.65625, "learning_rate": 0.00019478260869565218, "loss": 2.0278825759887695, "mean_token_accuracy": 0.612476097419858, "num_tokens": 18728.0, "step": 10 }, { "entropy": 1.2492346689105034, "epoch": 0.175054704595186, "grad_norm": 0.75, "learning_rate": 0.0001889855072463768, "loss": 1.2333297729492188, "mean_token_accuracy": 0.7266808465123177, "num_tokens": 37328.0, "step": 20 }, { "entropy": 1.1282426938414574, "epoch": 0.26258205689277897, "grad_norm": 0.6796875, "learning_rate": 0.00018318840579710147, "loss": 1.1297640800476074, "mean_token_accuracy": 0.7533167637884617, "num_tokens": 56036.0, "step": 30 }, { "entropy": 0.9922276919707655, "epoch": 0.350109409190372, "grad_norm": 0.640625, "learning_rate": 0.0001773913043478261, "loss": 1.033622646331787, "mean_token_accuracy": 0.7703150801360608, "num_tokens": 75072.0, "step": 40 }, { "entropy": 1.0213249990716577, "epoch": 0.437636761487965, "grad_norm": 0.53125, "learning_rate": 0.00017159420289855073, "loss": 1.042306900024414, "mean_token_accuracy": 0.7690192483365536, "num_tokens": 93505.0, "step": 50 }, { "entropy": 0.9650674186646938, "epoch": 0.5251641137855579, "grad_norm": 0.56640625, "learning_rate": 0.00016579710144927536, "loss": 1.0220633506774903, "mean_token_accuracy": 0.7742902040481567, "num_tokens": 112039.0, "step": 60 }, { "entropy": 1.0567748602479696, "epoch": 0.612691466083151, "grad_norm": 0.59765625, "learning_rate": 0.00016, "loss": 1.0543122291564941, "mean_token_accuracy": 0.7587149851024151, "num_tokens": 131322.0, "step": 70 }, { "entropy": 0.9168455514125526, "epoch": 0.700218818380744, "grad_norm": 0.6328125, "learning_rate": 0.00015420289855072464, "loss": 0.95663423538208, "mean_token_accuracy": 0.78614791482687, "num_tokens": 149646.0, "step": 80 }, { "entropy": 0.9514417068101466, "epoch": 0.787746170678337, "grad_norm": 0.68359375, "learning_rate": 0.00014840579710144927, "loss": 0.9753911972045899, "mean_token_accuracy": 0.781362334638834, "num_tokens": 168182.0, "step": 90 }, { "entropy": 0.9971431667916477, "epoch": 0.87527352297593, "grad_norm": 0.6015625, "learning_rate": 0.00014260869565217393, "loss": 1.0196686744689942, "mean_token_accuracy": 0.7682865738868714, "num_tokens": 187221.0, "step": 100 }, { "entropy": 0.9537320947274566, "epoch": 0.962800875273523, "grad_norm": 0.515625, "learning_rate": 0.00013681159420289856, "loss": 0.9510069847106933, "mean_token_accuracy": 0.782170583307743, "num_tokens": 205633.0, "step": 110 }, { "entropy": 0.907145096643551, "epoch": 1.0437636761487965, "grad_norm": 0.484375, "learning_rate": 0.00013101449275362319, "loss": 0.9373687744140625, "mean_token_accuracy": 0.7886275141625791, "num_tokens": 222954.0, "step": 120 }, { "entropy": 0.8457014967687428, "epoch": 1.1312910284463895, "grad_norm": 0.6328125, "learning_rate": 0.00012521739130434784, "loss": 0.8454959869384766, "mean_token_accuracy": 0.7963103860616684, "num_tokens": 241678.0, "step": 130 }, { "entropy": 0.8462455681525171, "epoch": 1.2188183807439825, "grad_norm": 0.703125, "learning_rate": 0.00011942028985507247, "loss": 0.8574352264404297, "mean_token_accuracy": 0.8001780763268471, "num_tokens": 260144.0, "step": 140 }, { "entropy": 0.8343841714784503, "epoch": 1.3063457330415755, "grad_norm": 0.703125, "learning_rate": 0.00011362318840579711, "loss": 0.8432804107666015, "mean_token_accuracy": 0.7991413235664367, "num_tokens": 279020.0, "step": 150 }, { "entropy": 0.7861125588417053, "epoch": 1.3938730853391685, "grad_norm": 0.7578125, "learning_rate": 0.00010782608695652174, "loss": 0.8140290260314942, "mean_token_accuracy": 0.8104772590100765, "num_tokens": 297696.0, "step": 160 }, { "entropy": 0.8265796534717083, "epoch": 1.4814004376367615, "grad_norm": 0.7421875, "learning_rate": 0.00010202898550724637, "loss": 0.8296893119812012, "mean_token_accuracy": 0.8040477402508259, "num_tokens": 315741.0, "step": 170 }, { "entropy": 0.7689724578522146, "epoch": 1.5689277899343543, "grad_norm": 0.80859375, "learning_rate": 9.623188405797103e-05, "loss": 0.7881460189819336, "mean_token_accuracy": 0.808928444236517, "num_tokens": 334515.0, "step": 180 }, { "entropy": 0.7925019094720482, "epoch": 1.6564551422319473, "grad_norm": 0.7890625, "learning_rate": 9.043478260869566e-05, "loss": 0.8049691200256348, "mean_token_accuracy": 0.8096396245062352, "num_tokens": 352933.0, "step": 190 }, { "entropy": 0.7968289134092629, "epoch": 1.7439824945295404, "grad_norm": 0.859375, "learning_rate": 8.463768115942029e-05, "loss": 0.8357898712158203, "mean_token_accuracy": 0.8038821592926979, "num_tokens": 371642.0, "step": 200 }, { "entropy": 0.8211181129328906, "epoch": 1.8315098468271334, "grad_norm": 0.80078125, "learning_rate": 7.884057971014493e-05, "loss": 0.8084160804748535, "mean_token_accuracy": 0.8103035606443882, "num_tokens": 390297.0, "step": 210 }, { "entropy": 0.8177960739005357, "epoch": 1.9190371991247264, "grad_norm": 0.73828125, "learning_rate": 7.304347826086957e-05, "loss": 0.8264873504638672, "mean_token_accuracy": 0.8067296646535397, "num_tokens": 409295.0, "step": 220 }, { "entropy": 0.8154785256530788, "epoch": 2.0, "grad_norm": 1.6171875, "learning_rate": 6.72463768115942e-05, "loss": 0.82596435546875, "mean_token_accuracy": 0.8030677026993519, "num_tokens": 426750.0, "step": 230 }, { "entropy": 0.6059559936635196, "epoch": 2.087527352297593, "grad_norm": 1.6796875, "learning_rate": 6.144927536231884e-05, "loss": 0.6000402450561524, "mean_token_accuracy": 0.8544376268982887, "num_tokens": 445112.0, "step": 240 }, { "entropy": 0.6742822146276012, "epoch": 2.175054704595186, "grad_norm": 0.9453125, "learning_rate": 5.565217391304348e-05, "loss": 0.6495694160461426, "mean_token_accuracy": 0.8368013821542263, "num_tokens": 464055.0, "step": 250 }, { "entropy": 0.6670764476526528, "epoch": 2.262582056892779, "grad_norm": 1.21875, "learning_rate": 4.985507246376812e-05, "loss": 0.6383417129516602, "mean_token_accuracy": 0.8340263485908508, "num_tokens": 483243.0, "step": 260 }, { "entropy": 0.6482093236874789, "epoch": 2.350109409190372, "grad_norm": 1.0390625, "learning_rate": 4.405797101449275e-05, "loss": 0.6531811237335206, "mean_token_accuracy": 0.8335508003830909, "num_tokens": 501911.0, "step": 270 }, { "entropy": 0.6858879348263145, "epoch": 2.437636761487965, "grad_norm": 1.0546875, "learning_rate": 3.8260869565217395e-05, "loss": 0.6682425498962402, "mean_token_accuracy": 0.8321790546178818, "num_tokens": 520579.0, "step": 280 }, { "entropy": 0.6361387457232922, "epoch": 2.525164113785558, "grad_norm": 1.1171875, "learning_rate": 3.246376811594203e-05, "loss": 0.628416633605957, "mean_token_accuracy": 0.8387672163546085, "num_tokens": 539205.0, "step": 290 }, { "entropy": 0.6545329387299716, "epoch": 2.612691466083151, "grad_norm": 1.015625, "learning_rate": 2.6666666666666667e-05, "loss": 0.6523668766021729, "mean_token_accuracy": 0.8395993508398533, "num_tokens": 557726.0, "step": 300 }, { "entropy": 0.5724413711111993, "epoch": 2.700218818380744, "grad_norm": 1.09375, "learning_rate": 2.0869565217391303e-05, "loss": 0.5660404682159423, "mean_token_accuracy": 0.860739403963089, "num_tokens": 575763.0, "step": 310 }, { "entropy": 0.6278647107072175, "epoch": 2.787746170678337, "grad_norm": 1.0859375, "learning_rate": 1.5072463768115944e-05, "loss": 0.6288604736328125, "mean_token_accuracy": 0.8464278854429722, "num_tokens": 594054.0, "step": 320 }, { "entropy": 0.6267774282023311, "epoch": 2.87527352297593, "grad_norm": 1.03125, "learning_rate": 9.27536231884058e-06, "loss": 0.6052563190460205, "mean_token_accuracy": 0.8475193127989769, "num_tokens": 613053.0, "step": 330 }, { "entropy": 0.6937473515979946, "epoch": 2.962800875273523, "grad_norm": 1.0625, "learning_rate": 3.4782608695652175e-06, "loss": 0.6603917121887207, "mean_token_accuracy": 0.8315372362732887, "num_tokens": 632039.0, "step": 340 } ], "logging_steps": 10, "max_steps": 345, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.7311532200064e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }