{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.282051282051282, "eval_steps": 50.0, "global_step": 150, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.008547008547008548, "grad_norm": 13.935976028442383, "learning_rate": 1.25e-06, "loss": 1.2302496433258057, "step": 1, "token_acc": 0.7555120910384068 }, { "epoch": 0.042735042735042736, "grad_norm": 12.733538627624512, "learning_rate": 6.25e-06, "loss": 1.1761837005615234, "step": 5, "token_acc": 0.7647914645974782 }, { "epoch": 0.08547008547008547, "grad_norm": 3.3333914279937744, "learning_rate": 9.998067787472772e-06, "loss": 0.896819019317627, "step": 10, "token_acc": 0.7896966517032977 }, { "epoch": 0.1282051282051282, "grad_norm": 3.5416104793548584, "learning_rate": 9.976347543410487e-06, "loss": 0.7495913505554199, "step": 15, "token_acc": 0.8130858441520439 }, { "epoch": 0.17094017094017094, "grad_norm": 3.1907875537872314, "learning_rate": 9.930597024496933e-06, "loss": 0.6861935615539551, "step": 20, "token_acc": 0.8265455118441095 }, { "epoch": 0.21367521367521367, "grad_norm": 3.0737252235412598, "learning_rate": 9.861037155322777e-06, "loss": 0.6162723064422607, "step": 25, "token_acc": 0.8381843560978132 }, { "epoch": 0.2564102564102564, "grad_norm": 3.321166753768921, "learning_rate": 9.768003833403278e-06, "loss": 0.5933701515197753, "step": 30, "token_acc": 0.8392482419056003 }, { "epoch": 0.29914529914529914, "grad_norm": 2.5869693756103516, "learning_rate": 9.651946307163417e-06, "loss": 0.6245723724365234, "step": 35, "token_acc": 0.8400627408615442 }, { "epoch": 0.3418803418803419, "grad_norm": 3.3702032566070557, "learning_rate": 9.51342500656308e-06, "loss": 0.5320750713348389, "step": 40, "token_acc": 0.8597009626829829 }, { "epoch": 0.38461538461538464, "grad_norm": 2.5714972019195557, "learning_rate": 9.353108836837907e-06, "loss": 0.6000706672668457, "step": 45, "token_acc": 0.8455385915790586 }, { "epoch": 0.42735042735042733, "grad_norm": 2.7259583473205566, "learning_rate": 9.171771948424138e-06, "loss": 0.4976496696472168, "step": 50, "token_acc": 0.8652953087066456 }, { "epoch": 0.4700854700854701, "grad_norm": 1.6538729667663574, "learning_rate": 8.970289998665083e-06, "loss": 0.5108413696289062, "step": 55, "token_acc": 0.8643437786086937 }, { "epoch": 0.5128205128205128, "grad_norm": 1.9930307865142822, "learning_rate": 8.749635923351108e-06, "loss": 0.5116062164306641, "step": 60, "token_acc": 0.8584137276609205 }, { "epoch": 0.5555555555555556, "grad_norm": 1.778527021408081, "learning_rate": 8.510875238511911e-06, "loss": 0.4901996612548828, "step": 65, "token_acc": 0.8642093487261697 }, { "epoch": 0.5982905982905983, "grad_norm": 2.789698362350464, "learning_rate": 8.255160895148263e-06, "loss": 0.49276137351989746, "step": 70, "token_acc": 0.8632728710522414 }, { "epoch": 0.6410256410256411, "grad_norm": 2.4906489849090576, "learning_rate": 7.983727711749194e-06, "loss": 0.46578373908996584, "step": 75, "token_acc": 0.8713921087941244 }, { "epoch": 0.6837606837606838, "grad_norm": 2.1418581008911133, "learning_rate": 7.697886411479422e-06, "loss": 0.46045923233032227, "step": 80, "token_acc": 0.8719648648325216 }, { "epoch": 0.7264957264957265, "grad_norm": 1.8900772333145142, "learning_rate": 7.399017292830848e-06, "loss": 0.49722442626953123, "step": 85, "token_acc": 0.861450770602471 }, { "epoch": 0.7692307692307693, "grad_norm": 9.884895324707031, "learning_rate": 7.088563564301874e-06, "loss": 0.4920672416687012, "step": 90, "token_acc": 0.8587491425333293 }, { "epoch": 0.811965811965812, "grad_norm": 2.0830328464508057, "learning_rate": 6.768024375290747e-06, "loss": 0.5075239181518555, "step": 95, "token_acc": 0.8566905419232774 }, { "epoch": 0.8547008547008547, "grad_norm": 2.6918821334838867, "learning_rate": 6.4389475768559675e-06, "loss": 0.4198714256286621, "step": 100, "token_acc": 0.8777022792164509 }, { "epoch": 0.8974358974358975, "grad_norm": 2.4037363529205322, "learning_rate": 6.1029222473013705e-06, "loss": 0.44579553604125977, "step": 105, "token_acc": 0.8723411714183048 }, { "epoch": 0.9401709401709402, "grad_norm": 2.708740234375, "learning_rate": 5.761571018679025e-06, "loss": 0.46126999855041506, "step": 110, "token_acc": 0.8693372368665406 }, { "epoch": 0.9829059829059829, "grad_norm": 1.4541316032409668, "learning_rate": 5.416542241264524e-06, "loss": 0.41992721557617185, "step": 115, "token_acc": 0.8794615180232043 }, { "epoch": 1.0256410256410255, "grad_norm": 1.3620638847351074, "learning_rate": 5.069502023841576e-06, "loss": 0.37786569595336916, "step": 120, "token_acc": 0.890482741876745 }, { "epoch": 1.0683760683760684, "grad_norm": 1.4797122478485107, "learning_rate": 4.722126188232586e-06, "loss": 0.2962369441986084, "step": 125, "token_acc": 0.911854977939766 }, { "epoch": 1.1111111111111112, "grad_norm": 1.6938647031784058, "learning_rate": 4.3760921769259585e-06, "loss": 0.26640729904174804, "step": 130, "token_acc": 0.9200576903265685 }, { "epoch": 1.1538461538461537, "grad_norm": 1.6591416597366333, "learning_rate": 4.033070952877362e-06, "loss": 0.32262775897979734, "step": 135, "token_acc": 0.9023160952065692 }, { "epoch": 1.1965811965811965, "grad_norm": 1.874250054359436, "learning_rate": 3.694718930600012e-06, "loss": 0.2847463607788086, "step": 140, "token_acc": 0.913816095518685 }, { "epoch": 1.2393162393162394, "grad_norm": 3.5652880668640137, "learning_rate": 3.3626699775078884e-06, "loss": 0.3009438753128052, "step": 145, "token_acc": 0.9092695643455156 }, { "epoch": 1.282051282051282, "grad_norm": 2.1268937587738037, "learning_rate": 3.0385275241365965e-06, "loss": 0.27616229057312014, "step": 150, "token_acc": 0.9170621396948753 } ], "logging_steps": 5, "max_steps": 234, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.8955203096294195e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }