{ "best_global_step": null, "best_metric": Infinity, "best_model_checkpoint": null, "epoch": 0.6097560975609756, "eval_steps": 200, "global_step": 400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.0894674882292747, "epoch": 0.001524390243902439, "grad_norm": 0.2451171875, "learning_rate": 0.0, "loss": 1.1132, "mean_token_accuracy": 0.737787663936615, "num_tokens": 31096.0, "step": 1 }, { "entropy": 1.1255738629322303, "epoch": 0.03048780487804878, "grad_norm": 0.259765625, "learning_rate": 8.260869565217392e-07, "loss": 1.0807, "mean_token_accuracy": 0.7315414132256257, "num_tokens": 610285.0, "step": 20 }, { "entropy": 1.116651164740324, "epoch": 0.06097560975609756, "grad_norm": 0.2060546875, "learning_rate": 1.6956521739130435e-06, "loss": 1.0829, "mean_token_accuracy": 0.7415120448917151, "num_tokens": 1213808.0, "step": 40 }, { "entropy": 1.136062316596508, "epoch": 0.09146341463414634, "grad_norm": 0.255859375, "learning_rate": 2.5652173913043484e-06, "loss": 1.0719, "mean_token_accuracy": 0.7423151686787606, "num_tokens": 1820350.0, "step": 60 }, { "entropy": 1.131455584987998, "epoch": 0.12195121951219512, "grad_norm": 0.2490234375, "learning_rate": 3.4347826086956526e-06, "loss": 1.0751, "mean_token_accuracy": 0.7383749138563871, "num_tokens": 2425417.0, "step": 80 }, { "entropy": 1.1437791034579277, "epoch": 0.1524390243902439, "grad_norm": 0.2451171875, "learning_rate": 4.304347826086957e-06, "loss": 1.0587, "mean_token_accuracy": 0.7454101398587227, "num_tokens": 3028789.0, "step": 100 }, { "entropy": 1.1516818165779115, "epoch": 0.18292682926829268, "grad_norm": 0.267578125, "learning_rate": 5.173913043478262e-06, "loss": 1.0153, "mean_token_accuracy": 0.7389566078782082, "num_tokens": 3633111.0, "step": 120 }, { "entropy": 1.1731348514556885, "epoch": 0.21341463414634146, "grad_norm": 0.2119140625, "learning_rate": 6.043478260869565e-06, "loss": 0.9987, "mean_token_accuracy": 0.7419542625546456, "num_tokens": 4238255.0, "step": 140 }, { "entropy": 1.172143243253231, "epoch": 0.24390243902439024, "grad_norm": 0.224609375, "learning_rate": 6.91304347826087e-06, "loss": 0.9389, "mean_token_accuracy": 0.7644132591784001, "num_tokens": 4832556.0, "step": 160 }, { "entropy": 1.2004285369068384, "epoch": 0.27439024390243905, "grad_norm": 0.17578125, "learning_rate": 7.782608695652174e-06, "loss": 0.9192, "mean_token_accuracy": 0.7614704228937625, "num_tokens": 5432124.0, "step": 180 }, { "entropy": 1.2147842556238175, "epoch": 0.3048780487804878, "grad_norm": 0.21484375, "learning_rate": 8.65217391304348e-06, "loss": 0.8948, "mean_token_accuracy": 0.7692887011915446, "num_tokens": 6037582.0, "step": 200 }, { "epoch": 0.3048780487804878, "eval_entropy": 1.2062757316433237, "eval_loss": NaN, "eval_mean_token_accuracy": 0.7701100997653296, "eval_num_tokens": 6037582.0, "eval_runtime": 226.3543, "eval_samples_per_second": 2.483, "eval_steps_per_second": 1.241, "step": 200 }, { "entropy": 1.209118977189064, "epoch": 0.3353658536585366, "grad_norm": 0.166015625, "learning_rate": 9.521739130434784e-06, "loss": 0.8307, "mean_token_accuracy": 0.7851326018571854, "num_tokens": 6638022.0, "step": 220 }, { "entropy": 1.2081195436418057, "epoch": 0.36585365853658536, "grad_norm": 0.154296875, "learning_rate": 1.0391304347826088e-05, "loss": 0.8054, "mean_token_accuracy": 0.775788264721632, "num_tokens": 7242603.0, "step": 240 }, { "entropy": 1.218064185231924, "epoch": 0.39634146341463417, "grad_norm": 0.1572265625, "learning_rate": 1.1260869565217392e-05, "loss": 0.8023, "mean_token_accuracy": 0.7786701653152704, "num_tokens": 7854134.0, "step": 260 }, { "entropy": 1.222281923890114, "epoch": 0.4268292682926829, "grad_norm": 0.2080078125, "learning_rate": 1.2130434782608698e-05, "loss": 0.7419, "mean_token_accuracy": 0.7926970385015011, "num_tokens": 8456300.0, "step": 280 }, { "entropy": 1.1952788300812245, "epoch": 0.4573170731707317, "grad_norm": 0.1982421875, "learning_rate": 1.3000000000000001e-05, "loss": 0.7198, "mean_token_accuracy": 0.800191256031394, "num_tokens": 9058721.0, "step": 300 }, { "entropy": 1.2105496317148208, "epoch": 0.4878048780487805, "grad_norm": 0.228515625, "learning_rate": 1.3869565217391305e-05, "loss": 0.6962, "mean_token_accuracy": 0.8068932801485061, "num_tokens": 9662758.0, "step": 320 }, { "entropy": 1.2259060773998498, "epoch": 0.5182926829268293, "grad_norm": 0.189453125, "learning_rate": 1.473913043478261e-05, "loss": 0.7312, "mean_token_accuracy": 0.8055971477180719, "num_tokens": 10271738.0, "step": 340 }, { "entropy": 1.2056082211434842, "epoch": 0.5487804878048781, "grad_norm": 0.1826171875, "learning_rate": 1.5608695652173914e-05, "loss": 0.6527, "mean_token_accuracy": 0.7986662428826093, "num_tokens": 10879740.0, "step": 360 }, { "entropy": 1.225981270521879, "epoch": 0.5792682926829268, "grad_norm": 0.259765625, "learning_rate": 1.6478260869565218e-05, "loss": 0.682, "mean_token_accuracy": 0.7959255930036306, "num_tokens": 11483336.0, "step": 380 }, { "entropy": 1.1928005013614893, "epoch": 0.6097560975609756, "grad_norm": 0.201171875, "learning_rate": 1.7347826086956522e-05, "loss": 0.6594, "mean_token_accuracy": 0.8185551591217518, "num_tokens": 12085058.0, "step": 400 }, { "epoch": 0.6097560975609756, "eval_entropy": 1.1817513504910724, "eval_loss": NaN, "eval_mean_token_accuracy": 0.806651482590577, "eval_num_tokens": 12085058.0, "eval_runtime": 229.1412, "eval_samples_per_second": 2.453, "eval_steps_per_second": 1.226, "step": 400 } ], "logging_steps": 20, "max_steps": 4592, "num_input_tokens_seen": 0, "num_train_epochs": 7, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.5195257431906304e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }