{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 100, "global_step": 625, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.927482557296753, "epoch": 0.016, "grad_norm": 1.3331365585327148, "learning_rate": 4.736842105263158e-05, "loss": 2.9205, "mean_token_accuracy": 0.42432610020041467, "num_tokens": 21466.0, "step": 10 }, { "entropy": 2.7787948846817017, "epoch": 0.032, "grad_norm": 1.0274778604507446, "learning_rate": 0.0001, "loss": 2.7193, "mean_token_accuracy": 0.4424279421567917, "num_tokens": 44204.0, "step": 20 }, { "entropy": 2.7391002118587493, "epoch": 0.048, "grad_norm": 0.9975764751434326, "learning_rate": 0.00015263157894736845, "loss": 2.6235, "mean_token_accuracy": 0.46106590032577516, "num_tokens": 63982.0, "step": 30 }, { "entropy": 2.69979213476181, "epoch": 0.064, "grad_norm": 0.9850704669952393, "learning_rate": 0.00019999966405802826, "loss": 2.5825, "mean_token_accuracy": 0.4666088931262493, "num_tokens": 84531.0, "step": 40 }, { "entropy": 2.6038752436637878, "epoch": 0.08, "grad_norm": 0.9963482022285461, "learning_rate": 0.00019995935375248606, "loss": 2.5338, "mean_token_accuracy": 0.4776237912476063, "num_tokens": 104496.0, "step": 50 }, { "entropy": 2.6396988570690154, "epoch": 0.096, "grad_norm": 0.8940117955207825, "learning_rate": 0.000199851886084842, "loss": 2.5631, "mean_token_accuracy": 0.4724681057035923, "num_tokens": 125055.0, "step": 60 }, { "entropy": 2.624293786287308, "epoch": 0.112, "grad_norm": 0.7860824465751648, "learning_rate": 0.0001996773332568941, "loss": 2.5196, "mean_token_accuracy": 0.47606254518032076, "num_tokens": 145437.0, "step": 70 }, { "entropy": 2.523421919345856, "epoch": 0.128, "grad_norm": 0.7847617268562317, "learning_rate": 0.0001994358125413841, "loss": 2.438, "mean_token_accuracy": 0.4916156314313412, "num_tokens": 164918.0, "step": 80 }, { "entropy": 2.5297053515911103, "epoch": 0.144, "grad_norm": 0.8938744068145752, "learning_rate": 0.00019912748620320794, "loss": 2.477, "mean_token_accuracy": 0.4871461518108845, "num_tokens": 186602.0, "step": 90 }, { "entropy": 2.549694550037384, "epoch": 0.16, "grad_norm": 0.8062200546264648, "learning_rate": 0.00019875256139039902, "loss": 2.4538, "mean_token_accuracy": 0.48964215591549876, "num_tokens": 208334.0, "step": 100 }, { "epoch": 0.16, "eval_entropy": 2.5797194150777965, "eval_loss": 2.5428755283355713, "eval_mean_token_accuracy": 0.48654096172406125, "eval_num_tokens": 208334.0, "eval_runtime": 0.7687, "eval_samples_per_second": 130.09, "eval_steps_per_second": 16.912, "step": 100 }, { "entropy": 2.5369359493255614, "epoch": 0.176, "grad_norm": 0.7858350276947021, "learning_rate": 0.00019831128999495606, "loss": 2.451, "mean_token_accuracy": 0.49068020582199096, "num_tokens": 229573.0, "step": 110 }, { "entropy": 2.622505843639374, "epoch": 0.192, "grad_norm": 0.853503942489624, "learning_rate": 0.0001978039684836106, "loss": 2.513, "mean_token_accuracy": 0.4789179593324661, "num_tokens": 250739.0, "step": 120 }, { "entropy": 2.538061708211899, "epoch": 0.208, "grad_norm": 0.701422393321991, "learning_rate": 0.00019723093769864663, "loss": 2.4881, "mean_token_accuracy": 0.485482332110405, "num_tokens": 274310.0, "step": 130 }, { "entropy": 2.633000612258911, "epoch": 0.224, "grad_norm": 0.8620439171791077, "learning_rate": 0.00019659258262890683, "loss": 2.5312, "mean_token_accuracy": 0.4774567261338234, "num_tokens": 295034.0, "step": 140 }, { "entropy": 2.501206773519516, "epoch": 0.24, "grad_norm": 0.8027399778366089, "learning_rate": 0.00019588933215113926, "loss": 2.4184, "mean_token_accuracy": 0.4926304392516613, "num_tokens": 315487.0, "step": 150 }, { "entropy": 2.51069019138813, "epoch": 0.256, "grad_norm": 0.7904124855995178, "learning_rate": 0.00019512165874185767, "loss": 2.4492, "mean_token_accuracy": 0.49440020844340327, "num_tokens": 336958.0, "step": 160 }, { "entropy": 2.5472387611865996, "epoch": 0.272, "grad_norm": 0.8189327120780945, "learning_rate": 0.00019429007815990993, "loss": 2.4559, "mean_token_accuracy": 0.48381901159882545, "num_tokens": 358616.0, "step": 170 }, { "entropy": 2.547665923833847, "epoch": 0.288, "grad_norm": 0.7772969603538513, "learning_rate": 0.00019339514909996706, "loss": 2.4706, "mean_token_accuracy": 0.4824284970760345, "num_tokens": 379872.0, "step": 180 }, { "entropy": 2.504627192020416, "epoch": 0.304, "grad_norm": 0.6993403434753418, "learning_rate": 0.000192437472817166, "loss": 2.4443, "mean_token_accuracy": 0.4916023284196854, "num_tokens": 400768.0, "step": 190 }, { "entropy": 2.5959001183509827, "epoch": 0.32, "grad_norm": 0.8900535106658936, "learning_rate": 0.00019141769272315858, "loss": 2.5256, "mean_token_accuracy": 0.4826003320515156, "num_tokens": 420318.0, "step": 200 }, { "epoch": 0.32, "eval_entropy": 2.615577771113469, "eval_loss": 2.544278144836426, "eval_mean_token_accuracy": 0.4823318009193127, "eval_num_tokens": 420318.0, "eval_runtime": 0.6723, "eval_samples_per_second": 148.739, "eval_steps_per_second": 19.336, "step": 200 }, { "entropy": 2.5907178699970244, "epoch": 0.336, "grad_norm": 0.7852405309677124, "learning_rate": 0.00019033649395383702, "loss": 2.5025, "mean_token_accuracy": 0.48569325879216196, "num_tokens": 440493.0, "step": 210 }, { "entropy": 2.5373390048742293, "epoch": 0.352, "grad_norm": 0.8513323664665222, "learning_rate": 0.00018919460290902826, "loss": 2.4644, "mean_token_accuracy": 0.48737777322530745, "num_tokens": 460347.0, "step": 220 }, { "entropy": 2.5982253909111024, "epoch": 0.368, "grad_norm": 0.7951892614364624, "learning_rate": 0.00018799278676446423, "loss": 2.5088, "mean_token_accuracy": 0.4845408618450165, "num_tokens": 479686.0, "step": 230 }, { "entropy": 2.5408327341079713, "epoch": 0.384, "grad_norm": 0.818739652633667, "learning_rate": 0.0001867318529563574, "loss": 2.4453, "mean_token_accuracy": 0.49112383723258973, "num_tokens": 499382.0, "step": 240 }, { "entropy": 2.566703599691391, "epoch": 0.4, "grad_norm": 0.8289343118667603, "learning_rate": 0.00018541264863892754, "loss": 2.5047, "mean_token_accuracy": 0.48281258195638654, "num_tokens": 520865.0, "step": 250 }, { "entropy": 2.522556847333908, "epoch": 0.416, "grad_norm": 0.9309546947479248, "learning_rate": 0.000184036060115244, "loss": 2.4434, "mean_token_accuracy": 0.4828334227204323, "num_tokens": 540616.0, "step": 260 }, { "entropy": 2.5191095739603044, "epoch": 0.432, "grad_norm": 0.7696341276168823, "learning_rate": 0.00018260301224176558, "loss": 2.4318, "mean_token_accuracy": 0.4892562575638294, "num_tokens": 561098.0, "step": 270 }, { "entropy": 2.5569592356681823, "epoch": 0.448, "grad_norm": 0.7310771346092224, "learning_rate": 0.00018111446780697929, "loss": 2.505, "mean_token_accuracy": 0.476550355553627, "num_tokens": 581527.0, "step": 280 }, { "entropy": 2.6550574243068694, "epoch": 0.464, "grad_norm": 0.8539873957633972, "learning_rate": 0.00017957142688455362, "loss": 2.5309, "mean_token_accuracy": 0.479371577501297, "num_tokens": 601002.0, "step": 290 }, { "entropy": 2.5720873057842253, "epoch": 0.48, "grad_norm": 0.7261855006217957, "learning_rate": 0.00017797492616144256, "loss": 2.5289, "mean_token_accuracy": 0.4779372848570347, "num_tokens": 621836.0, "step": 300 }, { "epoch": 0.48, "eval_entropy": 2.58707464658297, "eval_loss": 2.5298879146575928, "eval_mean_token_accuracy": 0.4877227544784546, "eval_num_tokens": 621836.0, "eval_runtime": 0.6775, "eval_samples_per_second": 147.608, "eval_steps_per_second": 19.189, "step": 300 }, { "entropy": 2.56911381483078, "epoch": 0.496, "grad_norm": 0.8215358257293701, "learning_rate": 0.00017632603824139085, "loss": 2.4587, "mean_token_accuracy": 0.4831582002341747, "num_tokens": 642910.0, "step": 310 }, { "entropy": 2.518597739934921, "epoch": 0.512, "grad_norm": 0.7745339274406433, "learning_rate": 0.00017462587092430875, "loss": 2.4552, "mean_token_accuracy": 0.48742511570453645, "num_tokens": 665281.0, "step": 320 }, { "entropy": 2.5539629220962525, "epoch": 0.528, "grad_norm": 1.3013852834701538, "learning_rate": 0.00017287556646200018, "loss": 2.5049, "mean_token_accuracy": 0.48348471373319624, "num_tokens": 686496.0, "step": 330 }, { "entropy": 2.549721211194992, "epoch": 0.544, "grad_norm": 0.9040252566337585, "learning_rate": 0.00017107630079074478, "loss": 2.4749, "mean_token_accuracy": 0.49018326848745347, "num_tokens": 708041.0, "step": 340 }, { "entropy": 2.5657508850097654, "epoch": 0.56, "grad_norm": 0.7486541867256165, "learning_rate": 0.00016922928274124886, "loss": 2.496, "mean_token_accuracy": 0.4882775545120239, "num_tokens": 729373.0, "step": 350 }, { "entropy": 2.49460369348526, "epoch": 0.576, "grad_norm": 0.7519723176956177, "learning_rate": 0.00016733575322649657, "loss": 2.4358, "mean_token_accuracy": 0.4897538281977177, "num_tokens": 751428.0, "step": 360 }, { "entropy": 2.485343414545059, "epoch": 0.592, "grad_norm": 0.7465973496437073, "learning_rate": 0.00016539698440804661, "loss": 2.4446, "mean_token_accuracy": 0.4956702694296837, "num_tokens": 773898.0, "step": 370 }, { "entropy": 2.5664760768413544, "epoch": 0.608, "grad_norm": 0.792957603931427, "learning_rate": 0.0001634142788413346, "loss": 2.4411, "mean_token_accuracy": 0.49218829050660134, "num_tokens": 793921.0, "step": 380 }, { "entropy": 2.4981964468955993, "epoch": 0.624, "grad_norm": 0.9188303351402283, "learning_rate": 0.00016138896860055555, "loss": 2.4527, "mean_token_accuracy": 0.4891628086566925, "num_tokens": 814549.0, "step": 390 }, { "entropy": 2.5058595299720765, "epoch": 0.64, "grad_norm": 0.8261463642120361, "learning_rate": 0.0001593224143837142, "loss": 2.3825, "mean_token_accuracy": 0.49732586443424226, "num_tokens": 835738.0, "step": 400 }, { "epoch": 0.64, "eval_entropy": 2.5427963917072, "eval_loss": 2.528325080871582, "eval_mean_token_accuracy": 0.48722161238010114, "eval_num_tokens": 835738.0, "eval_runtime": 0.6794, "eval_samples_per_second": 147.184, "eval_steps_per_second": 19.134, "step": 400 }, { "entropy": 2.549647295475006, "epoch": 0.656, "grad_norm": 0.9669468402862549, "learning_rate": 0.00015721600459844468, "loss": 2.4992, "mean_token_accuracy": 0.4811323322355747, "num_tokens": 856308.0, "step": 410 }, { "entropy": 2.50358769595623, "epoch": 0.672, "grad_norm": 0.7736469507217407, "learning_rate": 0.0001550711544292131, "loss": 2.4233, "mean_token_accuracy": 0.4960208125412464, "num_tokens": 877984.0, "step": 420 }, { "entropy": 2.513987493515015, "epoch": 0.688, "grad_norm": 1.0335294008255005, "learning_rate": 0.00015288930488653094, "loss": 2.4349, "mean_token_accuracy": 0.490431859344244, "num_tokens": 899593.0, "step": 430 }, { "entropy": 2.5122825741767882, "epoch": 0.704, "grad_norm": 1.0326985120773315, "learning_rate": 0.00015067192183881658, "loss": 2.4435, "mean_token_accuracy": 0.49002100676298144, "num_tokens": 919549.0, "step": 440 }, { "entropy": 2.5058334708213805, "epoch": 0.72, "grad_norm": 0.8282021284103394, "learning_rate": 0.0001484204950275565, "loss": 2.3755, "mean_token_accuracy": 0.49881314411759375, "num_tokens": 938371.0, "step": 450 }, { "entropy": 2.5388923943042756, "epoch": 0.736, "grad_norm": 0.8473682403564453, "learning_rate": 0.0001461365370664276, "loss": 2.4695, "mean_token_accuracy": 0.48638317435979844, "num_tokens": 959081.0, "step": 460 }, { "entropy": 2.4723076283931733, "epoch": 0.752, "grad_norm": 0.964932918548584, "learning_rate": 0.00014382158242505234, "loss": 2.4151, "mean_token_accuracy": 0.4942440494894981, "num_tokens": 980709.0, "step": 470 }, { "entropy": 2.4699651658535005, "epoch": 0.768, "grad_norm": 0.8604968190193176, "learning_rate": 0.0001414771863980707, "loss": 2.4249, "mean_token_accuracy": 0.49896738603711127, "num_tokens": 998177.0, "step": 480 }, { "entropy": 2.5598580718040465, "epoch": 0.784, "grad_norm": 0.8044160604476929, "learning_rate": 0.00013910492406022033, "loss": 2.5119, "mean_token_accuracy": 0.48558894991874696, "num_tokens": 1019231.0, "step": 490 }, { "entropy": 2.5347262740135195, "epoch": 0.8, "grad_norm": 0.989012598991394, "learning_rate": 0.000136706389208128, "loss": 2.457, "mean_token_accuracy": 0.48754729256033896, "num_tokens": 1039963.0, "step": 500 }, { "epoch": 0.8, "eval_entropy": 2.5207965007195106, "eval_loss": 2.532066822052002, "eval_mean_token_accuracy": 0.4870225145266606, "eval_num_tokens": 1039963.0, "eval_runtime": 0.6776, "eval_samples_per_second": 147.573, "eval_steps_per_second": 19.185, "step": 500 }, { "entropy": 2.4576663255691527, "epoch": 0.816, "grad_norm": 0.8774695992469788, "learning_rate": 0.00013428319328952253, "loss": 2.3836, "mean_token_accuracy": 0.4995129629969597, "num_tokens": 1061370.0, "step": 510 }, { "entropy": 2.5250146806240084, "epoch": 0.832, "grad_norm": 0.7958005666732788, "learning_rate": 0.00013183696432058888, "loss": 2.4315, "mean_token_accuracy": 0.4982760787010193, "num_tokens": 1081842.0, "step": 520 }, { "entropy": 2.4409106403589247, "epoch": 0.848, "grad_norm": 0.7063387036323547, "learning_rate": 0.00012936934579219094, "loss": 2.3816, "mean_token_accuracy": 0.5006642855703831, "num_tokens": 1103737.0, "step": 530 }, { "entropy": 2.503674066066742, "epoch": 0.864, "grad_norm": 0.712315559387207, "learning_rate": 0.00012688199556569753, "loss": 2.4427, "mean_token_accuracy": 0.4878311850130558, "num_tokens": 1124676.0, "step": 540 }, { "entropy": 2.4937715351581575, "epoch": 0.88, "grad_norm": 0.7796215415000916, "learning_rate": 0.00012437658475915377, "loss": 2.4148, "mean_token_accuracy": 0.4976658411324024, "num_tokens": 1147148.0, "step": 550 }, { "entropy": 2.458594244718552, "epoch": 0.896, "grad_norm": 0.8076977133750916, "learning_rate": 0.00012185479662454595, "loss": 2.414, "mean_token_accuracy": 0.4989797443151474, "num_tokens": 1167948.0, "step": 560 }, { "entropy": 2.5129783391952514, "epoch": 0.912, "grad_norm": 0.9025003910064697, "learning_rate": 0.00011931832541691418, "loss": 2.4198, "mean_token_accuracy": 0.4928160272538662, "num_tokens": 1187896.0, "step": 570 }, { "entropy": 2.429825708270073, "epoch": 0.928, "grad_norm": 0.9303080439567566, "learning_rate": 0.00011676887525607271, "loss": 2.336, "mean_token_accuracy": 0.507265867292881, "num_tokens": 1207963.0, "step": 580 }, { "entropy": 2.483963069319725, "epoch": 0.944, "grad_norm": 0.9662640690803528, "learning_rate": 0.0001142081589817027, "loss": 2.4441, "mean_token_accuracy": 0.4951579734683037, "num_tokens": 1228312.0, "step": 590 }, { "entropy": 2.5128854513168335, "epoch": 0.96, "grad_norm": 0.7802348732948303, "learning_rate": 0.00011163789700258655, "loss": 2.481, "mean_token_accuracy": 0.4941797606647015, "num_tokens": 1250029.0, "step": 600 }, { "epoch": 0.96, "eval_entropy": 2.5629419730259824, "eval_loss": 2.526008367538452, "eval_mean_token_accuracy": 0.4862596323856941, "eval_num_tokens": 1250029.0, "eval_runtime": 0.6764, "eval_samples_per_second": 147.833, "eval_steps_per_second": 19.218, "step": 600 }, { "entropy": 2.45339612364769, "epoch": 0.976, "grad_norm": 0.7918068766593933, "learning_rate": 0.00010905981614075693, "loss": 2.3798, "mean_token_accuracy": 0.5059582263231277, "num_tokens": 1273572.0, "step": 610 }, { "entropy": 2.5436563432216643, "epoch": 0.992, "grad_norm": 0.9120656847953796, "learning_rate": 0.000106475648471337, "loss": 2.4771, "mean_token_accuracy": 0.49086978659033775, "num_tokens": 1295353.0, "step": 620 } ], "logging_steps": 10, "max_steps": 1250, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.76891183669248e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }