{ "best_metric": null, "best_model_checkpoint": null, "epoch": 4.849557522123893, "eval_steps": 30, "global_step": 140, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.17699115044247787, "grad_norm": 5.151245594024658, "learning_rate": 4.989935734988098e-05, "loss": 4.7686, "num_input_tokens_seen": 239360, "step": 5 }, { "epoch": 0.35398230088495575, "grad_norm": 11.76759147644043, "learning_rate": 4.9491884960580894e-05, "loss": 3.5672, "num_input_tokens_seen": 478720, "step": 10 }, { "epoch": 0.5309734513274337, "grad_norm": 7.127159118652344, "learning_rate": 4.877641290737884e-05, "loss": 3.3447, "num_input_tokens_seen": 718080, "step": 15 }, { "epoch": 0.7079646017699115, "grad_norm": 11.316607475280762, "learning_rate": 4.7761938666470403e-05, "loss": 2.9905, "num_input_tokens_seen": 957440, "step": 20 }, { "epoch": 0.8849557522123894, "grad_norm": 8.864629745483398, "learning_rate": 4.6461219840046654e-05, "loss": 2.4303, "num_input_tokens_seen": 1196800, "step": 25 }, { "epoch": 1.0353982300884956, "grad_norm": 10.300582885742188, "learning_rate": 4.489061372204453e-05, "loss": 1.6583, "num_input_tokens_seen": 1400256, "step": 30 }, { "epoch": 1.0353982300884956, "eval_loss": 0.22562175989151, "eval_runtime": 112.57, "eval_samples_per_second": 1.004, "eval_steps_per_second": 0.506, "num_input_tokens_seen": 1400256, "step": 30 }, { "epoch": 1.2123893805309733, "grad_norm": 10.661843299865723, "learning_rate": 4.306987159568479e-05, "loss": 1.4066, "num_input_tokens_seen": 1639616, "step": 35 }, { "epoch": 1.3893805309734513, "grad_norm": 19.031333923339844, "learning_rate": 4.144846814849282e-05, "loss": 2.0231, "num_input_tokens_seen": 1878976, "step": 40 }, { "epoch": 1.5663716814159292, "grad_norm": 3.0498855113983154, "learning_rate": 3.92371123292113e-05, "loss": 1.3326, "num_input_tokens_seen": 2118336, "step": 45 }, { "epoch": 1.7433628318584071, "grad_norm": 10.98171615600586, "learning_rate": 3.7337705451608674e-05, "loss": 1.3365, "num_input_tokens_seen": 2357696, "step": 50 }, { "epoch": 1.920353982300885, "grad_norm": 8.286742210388184, "learning_rate": 3.4825625791348096e-05, "loss": 1.0757, "num_input_tokens_seen": 2597056, "step": 55 }, { "epoch": 2.0707964601769913, "grad_norm": 9.307785987854004, "learning_rate": 3.218998318580043e-05, "loss": 0.6975, "num_input_tokens_seen": 2800512, "step": 60 }, { "epoch": 2.0707964601769913, "eval_loss": 0.122890904545784, "eval_runtime": 112.5005, "eval_samples_per_second": 1.004, "eval_steps_per_second": 0.507, "num_input_tokens_seen": 2800512, "step": 60 }, { "epoch": 2.247787610619469, "grad_norm": 15.803374290466309, "learning_rate": 2.9463922369965917e-05, "loss": 0.823, "num_input_tokens_seen": 3039872, "step": 65 }, { "epoch": 2.4247787610619467, "grad_norm": 21.673105239868164, "learning_rate": 2.6681725140300997e-05, "loss": 1.2483, "num_input_tokens_seen": 3279232, "step": 70 }, { "epoch": 2.601769911504425, "grad_norm": 12.51755428314209, "learning_rate": 2.3878379241237136e-05, "loss": 1.2269, "num_input_tokens_seen": 3518592, "step": 75 }, { "epoch": 2.7787610619469025, "grad_norm": 12.325953483581543, "learning_rate": 2.1089138373994223e-05, "loss": 0.8036, "num_input_tokens_seen": 3757952, "step": 80 }, { "epoch": 2.9557522123893807, "grad_norm": 13.16337776184082, "learning_rate": 1.8349078860833123e-05, "loss": 0.994, "num_input_tokens_seen": 3997312, "step": 85 }, { "epoch": 3.106194690265487, "grad_norm": 12.360128402709961, "learning_rate": 1.5692658539951372e-05, "loss": 0.72, "num_input_tokens_seen": 4200768, "step": 90 }, { "epoch": 3.106194690265487, "eval_loss": 0.1203799694776535, "eval_runtime": 112.2274, "eval_samples_per_second": 1.007, "eval_steps_per_second": 0.508, "num_input_tokens_seen": 4200768, "step": 90 }, { "epoch": 3.2831858407079646, "grad_norm": 2.5878424644470215, "learning_rate": 1.3153283438175034e-05, "loss": 0.4563, "num_input_tokens_seen": 4440128, "step": 95 }, { "epoch": 3.4601769911504423, "grad_norm": 5.434853553771973, "learning_rate": 1.0762887670788702e-05, "loss": 0.7728, "num_input_tokens_seen": 4679488, "step": 100 }, { "epoch": 3.6371681415929205, "grad_norm": 28.99522590637207, "learning_rate": 8.551531851507186e-06, "loss": 0.799, "num_input_tokens_seen": 4918848, "step": 105 }, { "epoch": 3.814159292035398, "grad_norm": 8.98515510559082, "learning_rate": 6.547025062816486e-06, "loss": 0.5341, "num_input_tokens_seen": 5158208, "step": 110 }, { "epoch": 3.991150442477876, "grad_norm": 19.345624923706055, "learning_rate": 4.7745751406263165e-06, "loss": 0.7853, "num_input_tokens_seen": 5397568, "step": 115 }, { "epoch": 4.1415929203539825, "grad_norm": 12.641897201538086, "learning_rate": 3.2564716711076167e-06, "loss": 0.1667, "num_input_tokens_seen": 5601024, "step": 120 }, { "epoch": 4.1415929203539825, "eval_loss": 0.11977627128362656, "eval_runtime": 112.3249, "eval_samples_per_second": 1.006, "eval_steps_per_second": 0.507, "num_input_tokens_seen": 5601024, "step": 120 }, { "epoch": 4.31858407079646, "grad_norm": 27.25510597229004, "learning_rate": 2.0118056862137357e-06, "loss": 0.862, "num_input_tokens_seen": 5840384, "step": 125 }, { "epoch": 4.495575221238938, "grad_norm": 8.840839385986328, "learning_rate": 1.0562295828767387e-06, "loss": 0.6083, "num_input_tokens_seen": 6079744, "step": 130 }, { "epoch": 4.672566371681416, "grad_norm": 3.672297954559326, "learning_rate": 4.0176028503425835e-07, "loss": 0.3353, "num_input_tokens_seen": 6319104, "step": 135 }, { "epoch": 4.849557522123893, "grad_norm": 50.150081634521484, "learning_rate": 5.662812383859795e-08, "loss": 0.6499, "num_input_tokens_seen": 6558464, "step": 140 }, { "epoch": 4.849557522123893, "num_input_tokens_seen": 6558464, "step": 140, "total_flos": 2.735467646854103e+17, "train_loss": 1.3720276079007558, "train_runtime": 8129.8997, "train_samples_per_second": 0.278, "train_steps_per_second": 0.017 } ], "logging_steps": 5, "max_steps": 140, "num_input_tokens_seen": 6558464, "num_train_epochs": 5, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.735467646854103e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }