{ "best_global_step": null, "best_metric": Infinity, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 40, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.8637090027332306, "epoch": 0.02531645569620253, "grad_norm": 99.94273376464844, "learning_rate": 0.0, "loss": 15.196868896484375, "mean_token_accuracy": 0.28961846977472305, "num_tokens": 7286.0, "step": 1 }, { "entropy": 0.9094592481851578, "epoch": 0.05063291139240506, "grad_norm": 95.93968200683594, "learning_rate": 5e-05, "loss": 14.926185607910156, "mean_token_accuracy": 0.27897340804338455, "num_tokens": 14954.0, "step": 2 }, { "entropy": 1.1258608400821686, "epoch": 0.0759493670886076, "grad_norm": 64.25172424316406, "learning_rate": 0.0001, "loss": 12.606666564941406, "mean_token_accuracy": 0.35700511932373047, "num_tokens": 21366.0, "step": 3 }, { "entropy": 1.0687015354633331, "epoch": 0.10126582278481013, "grad_norm": 36.90766906738281, "learning_rate": 0.00015000000000000001, "loss": 9.619781494140625, "mean_token_accuracy": 0.540277749300003, "num_tokens": 28250.0, "step": 4 }, { "entropy": 1.1662852466106415, "epoch": 0.12658227848101267, "grad_norm": 29.526512145996094, "learning_rate": 0.0002, "loss": 8.147899627685547, "mean_token_accuracy": 0.567672997713089, "num_tokens": 34914.0, "step": 5 }, { "entropy": 0.727982223033905, "epoch": 0.1518987341772152, "grad_norm": 13.896689414978027, "learning_rate": 0.0001999145758387301, "loss": 7.228446006774902, "mean_token_accuracy": 0.6021915972232819, "num_tokens": 42532.0, "step": 6 }, { "entropy": 1.246531367301941, "epoch": 0.17721518987341772, "grad_norm": 19.760786056518555, "learning_rate": 0.000199658449300667, "loss": 6.584984302520752, "mean_token_accuracy": 0.6384725868701935, "num_tokens": 49872.0, "step": 7 }, { "entropy": 1.175276130437851, "epoch": 0.20253164556962025, "grad_norm": 12.119710922241211, "learning_rate": 0.0001992320579737045, "loss": 6.310988426208496, "mean_token_accuracy": 0.6375854164361954, "num_tokens": 55639.0, "step": 8 }, { "entropy": 1.0149184465408325, "epoch": 0.22784810126582278, "grad_norm": 7.977464199066162, "learning_rate": 0.00019863613034027224, "loss": 6.036639213562012, "mean_token_accuracy": 0.666093721985817, "num_tokens": 61649.0, "step": 9 }, { "entropy": 1.022455170750618, "epoch": 0.25316455696202533, "grad_norm": 7.014733791351318, "learning_rate": 0.00019787168453273544, "loss": 5.827225685119629, "mean_token_accuracy": 0.6803832501173019, "num_tokens": 69689.0, "step": 10 }, { "entropy": 1.1049264669418335, "epoch": 0.27848101265822783, "grad_norm": 5.545648574829102, "learning_rate": 0.00019694002659393305, "loss": 5.525129795074463, "mean_token_accuracy": 0.704516813158989, "num_tokens": 77528.0, "step": 11 }, { "entropy": 0.8492173552513123, "epoch": 0.3037974683544304, "grad_norm": 6.59067964553833, "learning_rate": 0.0001958427482458253, "loss": 5.324199199676514, "mean_token_accuracy": 0.8436015695333481, "num_tokens": 85064.0, "step": 12 }, { "entropy": 0.6838414371013641, "epoch": 0.3291139240506329, "grad_norm": 3.6837315559387207, "learning_rate": 0.00019458172417006347, "loss": 5.420000076293945, "mean_token_accuracy": 0.816602423787117, "num_tokens": 91009.0, "step": 13 }, { "entropy": 0.6191327422857285, "epoch": 0.35443037974683544, "grad_norm": 3.5020408630371094, "learning_rate": 0.0001931591088051279, "loss": 5.348326683044434, "mean_token_accuracy": 0.8181768357753754, "num_tokens": 97909.0, "step": 14 }, { "entropy": 0.5245884731411934, "epoch": 0.379746835443038, "grad_norm": 3.6154603958129883, "learning_rate": 0.00019157733266550575, "loss": 5.308533191680908, "mean_token_accuracy": 0.8219696879386902, "num_tokens": 104187.0, "step": 15 }, { "entropy": 0.4121474325656891, "epoch": 0.4050632911392405, "grad_norm": 2.822946071624756, "learning_rate": 0.0001898390981891979, "loss": 5.135751247406006, "mean_token_accuracy": 0.8321253657341003, "num_tokens": 110300.0, "step": 16 }, { "entropy": 0.392690971493721, "epoch": 0.43037974683544306, "grad_norm": 5.22876501083374, "learning_rate": 0.0001879473751206489, "loss": 5.34346866607666, "mean_token_accuracy": 0.8164242208003998, "num_tokens": 117157.0, "step": 17 }, { "entropy": 0.3356513977050781, "epoch": 0.45569620253164556, "grad_norm": 3.489384412765503, "learning_rate": 0.00018590539543698854, "loss": 4.941544532775879, "mean_token_accuracy": 0.8337943404912949, "num_tokens": 123378.0, "step": 18 }, { "entropy": 0.32025614380836487, "epoch": 0.4810126582278481, "grad_norm": 2.2713074684143066, "learning_rate": 0.00018371664782625287, "loss": 5.1571879386901855, "mean_token_accuracy": 0.8307176530361176, "num_tokens": 129042.0, "step": 19 }, { "entropy": 0.3084551766514778, "epoch": 0.5063291139240507, "grad_norm": 1.9176894426345825, "learning_rate": 0.0001813848717270195, "loss": 5.014953136444092, "mean_token_accuracy": 0.8466087132692337, "num_tokens": 135747.0, "step": 20 }, { "entropy": 0.26904235407710075, "epoch": 0.5316455696202531, "grad_norm": 1.4043225049972534, "learning_rate": 0.00017891405093963938, "loss": 4.949811935424805, "mean_token_accuracy": 0.8474528640508652, "num_tokens": 141848.0, "step": 21 }, { "entropy": 0.2922343239188194, "epoch": 0.5569620253164557, "grad_norm": 1.2163947820663452, "learning_rate": 0.00017630840681998066, "loss": 5.169545650482178, "mean_token_accuracy": 0.8475807756185532, "num_tokens": 147566.0, "step": 22 }, { "entropy": 0.2782471589744091, "epoch": 0.5822784810126582, "grad_norm": 1.0059943199157715, "learning_rate": 0.00017357239106731317, "loss": 5.164263725280762, "mean_token_accuracy": 0.8462631553411484, "num_tokens": 154620.0, "step": 23 }, { "entropy": 0.2586139217019081, "epoch": 0.6075949367088608, "grad_norm": 1.22340726852417, "learning_rate": 0.00017071067811865476, "loss": 5.076096534729004, "mean_token_accuracy": 0.8611445128917694, "num_tokens": 161701.0, "step": 24 }, { "entropy": 0.28559913113713264, "epoch": 0.6329113924050633, "grad_norm": 2.1334292888641357, "learning_rate": 0.00016772815716257412, "loss": 5.121291160583496, "mean_token_accuracy": 0.8396630734205246, "num_tokens": 168435.0, "step": 25 }, { "entropy": 0.26606928184628487, "epoch": 0.6582278481012658, "grad_norm": 0.8918235301971436, "learning_rate": 0.00016462992378609407, "loss": 5.148040771484375, "mean_token_accuracy": 0.8437058180570602, "num_tokens": 175650.0, "step": 26 }, { "entropy": 0.23234782740473747, "epoch": 0.6835443037974683, "grad_norm": 1.8136335611343384, "learning_rate": 0.0001614212712689668, "loss": 5.150457382202148, "mean_token_accuracy": 0.8433783650398254, "num_tokens": 181490.0, "step": 27 }, { "entropy": 0.24661532044410706, "epoch": 0.7088607594936709, "grad_norm": 1.321523904800415, "learning_rate": 0.00015810768154019385, "loss": 5.084752082824707, "mean_token_accuracy": 0.8424803614616394, "num_tokens": 188582.0, "step": 28 }, { "entropy": 0.19287967681884766, "epoch": 0.7341772151898734, "grad_norm": 0.9798034429550171, "learning_rate": 0.00015469481581224272, "loss": 5.147141456604004, "mean_token_accuracy": 0.866110622882843, "num_tokens": 193783.0, "step": 29 }, { "entropy": 0.23315827921032906, "epoch": 0.759493670886076, "grad_norm": 3.1756558418273926, "learning_rate": 0.00015118850490896012, "loss": 5.3330183029174805, "mean_token_accuracy": 0.8204634040594101, "num_tokens": 200686.0, "step": 30 }, { "entropy": 0.1938694752752781, "epoch": 0.7848101265822784, "grad_norm": 1.9134807586669922, "learning_rate": 0.00014759473930370736, "loss": 5.052967071533203, "mean_token_accuracy": 0.8582398444414139, "num_tokens": 208440.0, "step": 31 }, { "entropy": 0.22125443816184998, "epoch": 0.810126582278481, "grad_norm": 1.5088441371917725, "learning_rate": 0.00014391965888473703, "loss": 5.049187660217285, "mean_token_accuracy": 0.8358375877141953, "num_tokens": 215131.0, "step": 32 }, { "entropy": 0.20639389753341675, "epoch": 0.8354430379746836, "grad_norm": 1.491873860359192, "learning_rate": 0.00014016954246529696, "loss": 5.055438041687012, "mean_token_accuracy": 0.8552371561527252, "num_tokens": 222195.0, "step": 33 }, { "entropy": 0.20158018916845322, "epoch": 0.8607594936708861, "grad_norm": 1.46501624584198, "learning_rate": 0.00013635079705638298, "loss": 5.16477108001709, "mean_token_accuracy": 0.8602638840675354, "num_tokens": 229926.0, "step": 34 }, { "entropy": 0.21367954835295677, "epoch": 0.8860759493670886, "grad_norm": 1.7227668762207031, "learning_rate": 0.00013246994692046836, "loss": 5.240202903747559, "mean_token_accuracy": 0.8288360238075256, "num_tokens": 235766.0, "step": 35 }, { "entropy": 0.2060464285314083, "epoch": 0.9113924050632911, "grad_norm": 1.615714192390442, "learning_rate": 0.00012853362242491053, "loss": 5.13973331451416, "mean_token_accuracy": 0.8528883457183838, "num_tokens": 242731.0, "step": 36 }, { "entropy": 0.2112499214708805, "epoch": 0.9367088607594937, "grad_norm": 1.70606529712677, "learning_rate": 0.00012454854871407994, "loss": 5.105003833770752, "mean_token_accuracy": 0.8559168428182602, "num_tokens": 249818.0, "step": 37 }, { "entropy": 0.1963396780192852, "epoch": 0.9620253164556962, "grad_norm": 1.8689205646514893, "learning_rate": 0.00012052153421956342, "loss": 5.083700180053711, "mean_token_accuracy": 0.8450468629598618, "num_tokens": 256043.0, "step": 38 }, { "entropy": 0.17459847778081894, "epoch": 0.9873417721518988, "grad_norm": 1.3199875354766846, "learning_rate": 0.00011645945902807341, "loss": 5.136896133422852, "mean_token_accuracy": 0.8544726371765137, "num_tokens": 263628.0, "step": 39 }, { "entropy": 0.19893981516361237, "epoch": 1.0, "grad_norm": 2.03135347366333, "learning_rate": 0.00011236926312693479, "loss": 5.0191426277160645, "mean_token_accuracy": 0.8476890921592712, "num_tokens": 266935.0, "step": 40 }, { "epoch": 1.0, "eval_entropy": 0.0, "eval_loss": NaN, "eval_mean_token_accuracy": 0.0, "eval_num_tokens": 266935.0, "eval_runtime": 5.2068, "eval_samples_per_second": 42.637, "eval_steps_per_second": 10.755, "step": 40 } ], "logging_steps": 1, "max_steps": 80, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 558442705059840.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }