{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 100, "global_step": 625, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.0092181354761123, "epoch": 0.016, "grad_norm": 1.508150339126587, "learning_rate": 4.736842105263158e-05, "loss": 2.2481, "mean_token_accuracy": 0.5437881387770176, "num_tokens": 10218.0, "step": 10 }, { "entropy": 2.0736056357622146, "epoch": 0.032, "grad_norm": 1.2320566177368164, "learning_rate": 0.0001, "loss": 2.0578, "mean_token_accuracy": 0.5636145301163197, "num_tokens": 20480.0, "step": 20 }, { "entropy": 1.958076971769333, "epoch": 0.048, "grad_norm": 0.867118239402771, "learning_rate": 0.00015263157894736845, "loss": 1.9242, "mean_token_accuracy": 0.5743255637586117, "num_tokens": 30543.0, "step": 30 }, { "entropy": 1.9567744851112365, "epoch": 0.064, "grad_norm": 0.7917498350143433, "learning_rate": 0.00019999966405802826, "loss": 1.9526, "mean_token_accuracy": 0.5756677143275738, "num_tokens": 40658.0, "step": 40 }, { "entropy": 1.8826423227787017, "epoch": 0.08, "grad_norm": 0.8305525183677673, "learning_rate": 0.00019995935375248606, "loss": 1.8509, "mean_token_accuracy": 0.5996200643479824, "num_tokens": 50792.0, "step": 50 }, { "entropy": 1.9008120864629745, "epoch": 0.096, "grad_norm": 0.9713864326477051, "learning_rate": 0.000199851886084842, "loss": 1.9109, "mean_token_accuracy": 0.5911510705947876, "num_tokens": 60899.0, "step": 60 }, { "entropy": 1.880544126033783, "epoch": 0.112, "grad_norm": 0.9007127285003662, "learning_rate": 0.0001996773332568941, "loss": 1.8743, "mean_token_accuracy": 0.5929530031979084, "num_tokens": 71221.0, "step": 70 }, { "entropy": 1.952101269364357, "epoch": 0.128, "grad_norm": 0.78743577003479, "learning_rate": 0.0001994358125413841, "loss": 1.9528, "mean_token_accuracy": 0.5812688320875168, "num_tokens": 81172.0, "step": 80 }, { "entropy": 1.9294454216957093, "epoch": 0.144, "grad_norm": 0.7737237215042114, "learning_rate": 0.00019912748620320794, "loss": 1.9409, "mean_token_accuracy": 0.5753811992704868, "num_tokens": 91264.0, "step": 90 }, { "entropy": 1.9249590784311295, "epoch": 0.16, "grad_norm": 0.8270857334136963, "learning_rate": 0.00019875256139039902, "loss": 1.9009, "mean_token_accuracy": 0.5813618630170823, "num_tokens": 101877.0, "step": 100 }, { "epoch": 0.16, "eval_entropy": 1.8299660499279315, "eval_loss": 1.7842161655426025, "eval_mean_token_accuracy": 0.6030518962786748, "eval_num_tokens": 101877.0, "eval_runtime": 0.8408, "eval_samples_per_second": 118.935, "eval_steps_per_second": 15.462, "step": 100 }, { "entropy": 1.8542533993721009, "epoch": 0.176, "grad_norm": 0.8512797355651855, "learning_rate": 0.00019831128999495606, "loss": 1.8219, "mean_token_accuracy": 0.5989311248064041, "num_tokens": 112259.0, "step": 110 }, { "entropy": 1.7832964926958084, "epoch": 0.192, "grad_norm": 0.7618836760520935, "learning_rate": 0.0001978039684836106, "loss": 1.7925, "mean_token_accuracy": 0.6045975714921952, "num_tokens": 122294.0, "step": 120 }, { "entropy": 1.880309948325157, "epoch": 0.208, "grad_norm": 0.7805933952331543, "learning_rate": 0.00019723093769864663, "loss": 1.8632, "mean_token_accuracy": 0.5855595611035824, "num_tokens": 132251.0, "step": 130 }, { "entropy": 1.8512971937656402, "epoch": 0.224, "grad_norm": 0.926387369632721, "learning_rate": 0.00019659258262890683, "loss": 1.8367, "mean_token_accuracy": 0.5898601979017257, "num_tokens": 142542.0, "step": 140 }, { "entropy": 1.9222039520740508, "epoch": 0.24, "grad_norm": 0.8940110802650452, "learning_rate": 0.00019588933215113926, "loss": 1.9201, "mean_token_accuracy": 0.5759184911847115, "num_tokens": 152806.0, "step": 150 }, { "entropy": 1.9089818447828293, "epoch": 0.256, "grad_norm": 0.7893499732017517, "learning_rate": 0.00019512165874185767, "loss": 1.8895, "mean_token_accuracy": 0.5838948510587215, "num_tokens": 162706.0, "step": 160 }, { "entropy": 1.8353556275367737, "epoch": 0.272, "grad_norm": 1.2676271200180054, "learning_rate": 0.00019429007815990993, "loss": 1.7889, "mean_token_accuracy": 0.5981082618236542, "num_tokens": 173501.0, "step": 170 }, { "entropy": 1.823873969912529, "epoch": 0.288, "grad_norm": 0.7941910028457642, "learning_rate": 0.00019339514909996706, "loss": 1.8137, "mean_token_accuracy": 0.597452136874199, "num_tokens": 183521.0, "step": 180 }, { "entropy": 1.7840645104646682, "epoch": 0.304, "grad_norm": 0.8442012071609497, "learning_rate": 0.000192437472817166, "loss": 1.8134, "mean_token_accuracy": 0.6012439027428627, "num_tokens": 193753.0, "step": 190 }, { "entropy": 1.8204753398895264, "epoch": 0.32, "grad_norm": 0.636513888835907, "learning_rate": 0.00019141769272315858, "loss": 1.7482, "mean_token_accuracy": 0.6097412109375, "num_tokens": 204430.0, "step": 200 }, { "epoch": 0.32, "eval_entropy": 1.7530423127687895, "eval_loss": 1.7683205604553223, "eval_mean_token_accuracy": 0.60484268115117, "eval_num_tokens": 204430.0, "eval_runtime": 0.5699, "eval_samples_per_second": 175.459, "eval_steps_per_second": 22.81, "step": 200 }, { "entropy": 1.8239326030015945, "epoch": 0.336, "grad_norm": 0.8120871782302856, "learning_rate": 0.00019033649395383702, "loss": 1.8557, "mean_token_accuracy": 0.5853650733828545, "num_tokens": 214577.0, "step": 210 }, { "entropy": 1.8361420631408691, "epoch": 0.352, "grad_norm": 0.9607922434806824, "learning_rate": 0.00018919460290902826, "loss": 1.8244, "mean_token_accuracy": 0.5930058181285858, "num_tokens": 224970.0, "step": 220 }, { "entropy": 1.922423180937767, "epoch": 0.368, "grad_norm": 0.9304735064506531, "learning_rate": 0.00018799278676446423, "loss": 1.8917, "mean_token_accuracy": 0.5863452732563019, "num_tokens": 234866.0, "step": 230 }, { "entropy": 1.7584299921989441, "epoch": 0.384, "grad_norm": 0.8348444104194641, "learning_rate": 0.0001867318529563574, "loss": 1.7554, "mean_token_accuracy": 0.6109944336116314, "num_tokens": 244776.0, "step": 240 }, { "entropy": 1.816238895058632, "epoch": 0.4, "grad_norm": 0.6481600999832153, "learning_rate": 0.00018541264863892754, "loss": 1.8336, "mean_token_accuracy": 0.5937890991568565, "num_tokens": 255035.0, "step": 250 }, { "entropy": 1.8480711460113526, "epoch": 0.416, "grad_norm": 0.781286895275116, "learning_rate": 0.000184036060115244, "loss": 1.8261, "mean_token_accuracy": 0.5947530373930932, "num_tokens": 265072.0, "step": 260 }, { "entropy": 1.8989493697881699, "epoch": 0.432, "grad_norm": 0.8746325969696045, "learning_rate": 0.00018260301224176558, "loss": 1.8927, "mean_token_accuracy": 0.5771610237658024, "num_tokens": 275332.0, "step": 270 }, { "entropy": 1.859290638566017, "epoch": 0.448, "grad_norm": 0.7687608599662781, "learning_rate": 0.00018111446780697929, "loss": 1.8285, "mean_token_accuracy": 0.5923414275050163, "num_tokens": 285283.0, "step": 280 }, { "entropy": 1.7830641388893127, "epoch": 0.464, "grad_norm": 0.8059773445129395, "learning_rate": 0.00017957142688455362, "loss": 1.7907, "mean_token_accuracy": 0.5985377252101898, "num_tokens": 295429.0, "step": 290 }, { "entropy": 1.7804506599903107, "epoch": 0.48, "grad_norm": 0.9017696380615234, "learning_rate": 0.00017797492616144256, "loss": 1.7849, "mean_token_accuracy": 0.6041601061820984, "num_tokens": 305778.0, "step": 300 }, { "epoch": 0.48, "eval_entropy": 1.7502480378517737, "eval_loss": 1.7552363872528076, "eval_mean_token_accuracy": 0.6089264658781198, "eval_num_tokens": 305778.0, "eval_runtime": 0.5719, "eval_samples_per_second": 174.868, "eval_steps_per_second": 22.733, "step": 300 }, { "entropy": 1.70162413418293, "epoch": 0.496, "grad_norm": 0.6979867219924927, "learning_rate": 0.00017632603824139085, "loss": 1.7008, "mean_token_accuracy": 0.6215453043580055, "num_tokens": 316331.0, "step": 310 }, { "entropy": 1.815586867928505, "epoch": 0.512, "grad_norm": 0.8245130777359009, "learning_rate": 0.00017462587092430875, "loss": 1.8283, "mean_token_accuracy": 0.6016101613640785, "num_tokens": 326634.0, "step": 320 }, { "entropy": 1.9167057573795319, "epoch": 0.528, "grad_norm": 0.8274908065795898, "learning_rate": 0.00017287556646200018, "loss": 1.885, "mean_token_accuracy": 0.5891454972326755, "num_tokens": 336975.0, "step": 330 }, { "entropy": 1.806039023399353, "epoch": 0.544, "grad_norm": 1.0455838441848755, "learning_rate": 0.00017107630079074478, "loss": 1.7743, "mean_token_accuracy": 0.5969359435141086, "num_tokens": 347323.0, "step": 340 }, { "entropy": 1.8411190688610077, "epoch": 0.56, "grad_norm": 1.0417566299438477, "learning_rate": 0.00016922928274124886, "loss": 1.861, "mean_token_accuracy": 0.5893909811973572, "num_tokens": 357656.0, "step": 350 }, { "entropy": 1.868698662519455, "epoch": 0.576, "grad_norm": 0.7351287603378296, "learning_rate": 0.00016733575322649657, "loss": 1.8244, "mean_token_accuracy": 0.5993935190141201, "num_tokens": 367692.0, "step": 360 }, { "entropy": 1.8023948460817336, "epoch": 0.592, "grad_norm": 0.8541484475135803, "learning_rate": 0.00016539698440804661, "loss": 1.818, "mean_token_accuracy": 0.5955550998449326, "num_tokens": 377994.0, "step": 370 }, { "entropy": 1.9064868450164796, "epoch": 0.608, "grad_norm": 0.8737623691558838, "learning_rate": 0.0001634142788413346, "loss": 1.8982, "mean_token_accuracy": 0.5769180566072464, "num_tokens": 387844.0, "step": 380 }, { "entropy": 1.848566684126854, "epoch": 0.624, "grad_norm": 0.7124635577201843, "learning_rate": 0.00016138896860055555, "loss": 1.8218, "mean_token_accuracy": 0.5997274614870548, "num_tokens": 398009.0, "step": 390 }, { "entropy": 1.7892296761274338, "epoch": 0.64, "grad_norm": 1.0577216148376465, "learning_rate": 0.0001593224143837142, "loss": 1.8346, "mean_token_accuracy": 0.5980690255761146, "num_tokens": 408155.0, "step": 400 }, { "epoch": 0.64, "eval_entropy": 1.7474457025527954, "eval_loss": 1.7562793493270874, "eval_mean_token_accuracy": 0.6087833138612601, "eval_num_tokens": 408155.0, "eval_runtime": 0.556, "eval_samples_per_second": 179.852, "eval_steps_per_second": 23.381, "step": 400 }, { "entropy": 1.765562105178833, "epoch": 0.656, "grad_norm": 0.8375977873802185, "learning_rate": 0.00015721600459844468, "loss": 1.7165, "mean_token_accuracy": 0.6151046514511108, "num_tokens": 418669.0, "step": 410 }, { "entropy": 1.8461785107851028, "epoch": 0.672, "grad_norm": 0.8062698841094971, "learning_rate": 0.0001550711544292131, "loss": 1.8239, "mean_token_accuracy": 0.5912051677703858, "num_tokens": 428586.0, "step": 420 }, { "entropy": 1.724032711982727, "epoch": 0.688, "grad_norm": 0.9207695126533508, "learning_rate": 0.00015288930488653094, "loss": 1.7222, "mean_token_accuracy": 0.6095151364803314, "num_tokens": 438852.0, "step": 430 }, { "entropy": 1.8236116498708725, "epoch": 0.704, "grad_norm": 0.8827204704284668, "learning_rate": 0.00015067192183881658, "loss": 1.8165, "mean_token_accuracy": 0.5982112549245358, "num_tokens": 448800.0, "step": 440 }, { "entropy": 1.8432465463876724, "epoch": 0.72, "grad_norm": 0.8164684772491455, "learning_rate": 0.0001484204950275565, "loss": 1.822, "mean_token_accuracy": 0.6006790846586227, "num_tokens": 459455.0, "step": 450 }, { "entropy": 1.819486153125763, "epoch": 0.736, "grad_norm": 0.9052107930183411, "learning_rate": 0.0001461365370664276, "loss": 1.8213, "mean_token_accuracy": 0.594074235111475, "num_tokens": 470403.0, "step": 460 }, { "entropy": 1.825221198797226, "epoch": 0.752, "grad_norm": 0.9059354662895203, "learning_rate": 0.00014382158242505234, "loss": 1.8018, "mean_token_accuracy": 0.5954498581588268, "num_tokens": 480402.0, "step": 470 }, { "entropy": 1.8063141599297523, "epoch": 0.768, "grad_norm": 0.8374266028404236, "learning_rate": 0.0001414771863980707, "loss": 1.7355, "mean_token_accuracy": 0.6036714628338814, "num_tokens": 490673.0, "step": 480 }, { "entropy": 1.7501532822847365, "epoch": 0.784, "grad_norm": 0.880260169506073, "learning_rate": 0.00013910492406022033, "loss": 1.7516, "mean_token_accuracy": 0.6063065364956856, "num_tokens": 501198.0, "step": 490 }, { "entropy": 1.7936234265565871, "epoch": 0.8, "grad_norm": 1.014539361000061, "learning_rate": 0.000136706389208128, "loss": 1.7999, "mean_token_accuracy": 0.5939958959817886, "num_tokens": 511342.0, "step": 500 }, { "epoch": 0.8, "eval_entropy": 1.755663092319782, "eval_loss": 1.732832670211792, "eval_mean_token_accuracy": 0.6125743526678818, "eval_num_tokens": 511342.0, "eval_runtime": 0.5702, "eval_samples_per_second": 175.363, "eval_steps_per_second": 22.797, "step": 500 }, { "entropy": 1.7916649729013443, "epoch": 0.816, "grad_norm": 0.8876123428344727, "learning_rate": 0.00013428319328952253, "loss": 1.7903, "mean_token_accuracy": 0.6008384607732296, "num_tokens": 521786.0, "step": 510 }, { "entropy": 1.7850607708096504, "epoch": 0.832, "grad_norm": 0.8096923828125, "learning_rate": 0.00013183696432058888, "loss": 1.7517, "mean_token_accuracy": 0.602414033561945, "num_tokens": 532299.0, "step": 520 }, { "entropy": 1.8719337031245231, "epoch": 0.848, "grad_norm": 0.9576754570007324, "learning_rate": 0.00012936934579219094, "loss": 1.8609, "mean_token_accuracy": 0.5931283295154571, "num_tokens": 542782.0, "step": 530 }, { "entropy": 1.9048831015825272, "epoch": 0.864, "grad_norm": 0.7667029500007629, "learning_rate": 0.00012688199556569753, "loss": 1.8724, "mean_token_accuracy": 0.5880887821316719, "num_tokens": 552890.0, "step": 540 }, { "entropy": 1.7590193003416061, "epoch": 0.88, "grad_norm": 0.9162896275520325, "learning_rate": 0.00012437658475915377, "loss": 1.7175, "mean_token_accuracy": 0.6152773804962635, "num_tokens": 563354.0, "step": 550 }, { "entropy": 1.808611199259758, "epoch": 0.896, "grad_norm": 0.8291792273521423, "learning_rate": 0.00012185479662454595, "loss": 1.7864, "mean_token_accuracy": 0.5958017274737358, "num_tokens": 573757.0, "step": 560 }, { "entropy": 1.7611112475395203, "epoch": 0.912, "grad_norm": 0.909171998500824, "learning_rate": 0.00011931832541691418, "loss": 1.7679, "mean_token_accuracy": 0.602883157134056, "num_tokens": 583662.0, "step": 570 }, { "entropy": 1.781042018532753, "epoch": 0.928, "grad_norm": 0.9129692912101746, "learning_rate": 0.00011676887525607271, "loss": 1.8436, "mean_token_accuracy": 0.5947870224714279, "num_tokens": 593910.0, "step": 580 }, { "entropy": 1.836389735341072, "epoch": 0.944, "grad_norm": 0.826946496963501, "learning_rate": 0.0001142081589817027, "loss": 1.802, "mean_token_accuracy": 0.5981609359383583, "num_tokens": 604072.0, "step": 590 }, { "entropy": 1.7494287639856339, "epoch": 0.96, "grad_norm": 0.8292899131774902, "learning_rate": 0.00011163789700258655, "loss": 1.7124, "mean_token_accuracy": 0.6123683467507363, "num_tokens": 614766.0, "step": 600 }, { "epoch": 0.96, "eval_entropy": 1.7274914796535785, "eval_loss": 1.7254457473754883, "eval_mean_token_accuracy": 0.6123642738048847, "eval_num_tokens": 614766.0, "eval_runtime": 0.561, "eval_samples_per_second": 178.238, "eval_steps_per_second": 23.171, "step": 600 }, { "entropy": 1.8243329256772995, "epoch": 0.976, "grad_norm": 0.874477207660675, "learning_rate": 0.00010905981614075693, "loss": 1.8293, "mean_token_accuracy": 0.5974094405770302, "num_tokens": 624956.0, "step": 610 }, { "entropy": 1.7830285251140594, "epoch": 0.992, "grad_norm": 0.8535038232803345, "learning_rate": 0.000106475648471337, "loss": 1.741, "mean_token_accuracy": 0.6073737636208534, "num_tokens": 635175.0, "step": 620 } ], "logging_steps": 10, "max_steps": 1250, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.465314573775667e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }