{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5983724269985639, "eval_steps": 500, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.14264454692602158, "epoch": 0.0023934897079942556, "grad_norm": 6.1329498291015625, "learning_rate": 1.9985639061752036e-05, "loss": 8.6363, "mean_token_accuracy": 0.6116024732589722, "num_tokens": 77533.0, "step": 10 }, { "entropy": 0.13887472450733185, "epoch": 0.004786979415988511, "grad_norm": 11.192473411560059, "learning_rate": 1.996968246369874e-05, "loss": 7.3158, "mean_token_accuracy": 0.6413674414157867, "num_tokens": 163156.0, "step": 20 }, { "entropy": 0.1928814619779587, "epoch": 0.007180469123982767, "grad_norm": 14.501362800598145, "learning_rate": 1.9953725865645446e-05, "loss": 5.8909, "mean_token_accuracy": 0.6312316954135895, "num_tokens": 247959.0, "step": 30 }, { "entropy": 0.2716422751545906, "epoch": 0.009573958831977022, "grad_norm": 9.751401901245117, "learning_rate": 1.993776926759215e-05, "loss": 4.1374, "mean_token_accuracy": 0.6447562038898468, "num_tokens": 336213.0, "step": 40 }, { "entropy": 0.40589025914669036, "epoch": 0.011967448539971278, "grad_norm": 5.346670627593994, "learning_rate": 1.9921812669538856e-05, "loss": 3.0977, "mean_token_accuracy": 0.6462277293205261, "num_tokens": 418841.0, "step": 50 }, { "entropy": 0.6163419902324676, "epoch": 0.014360938247965534, "grad_norm": 2.4319427013397217, "learning_rate": 1.990585607148556e-05, "loss": 2.5241, "mean_token_accuracy": 0.6265762448310852, "num_tokens": 498137.0, "step": 60 }, { "entropy": 0.8075001418590546, "epoch": 0.01675442795595979, "grad_norm": 1.5138881206512451, "learning_rate": 1.9889899473432266e-05, "loss": 2.3184, "mean_token_accuracy": 0.6205335795879364, "num_tokens": 572657.0, "step": 70 }, { "entropy": 0.9711024582386016, "epoch": 0.019147917663954045, "grad_norm": 0.987091064453125, "learning_rate": 1.987394287537897e-05, "loss": 2.0481, "mean_token_accuracy": 0.6290253281593323, "num_tokens": 658058.0, "step": 80 }, { "entropy": 1.1067683815956115, "epoch": 0.0215414073719483, "grad_norm": 0.8901429176330566, "learning_rate": 1.9857986277325675e-05, "loss": 1.8676, "mean_token_accuracy": 0.6413214862346649, "num_tokens": 738189.0, "step": 90 }, { "entropy": 1.2711581468582154, "epoch": 0.023934897079942556, "grad_norm": 0.639988362789154, "learning_rate": 1.984202967927238e-05, "loss": 1.7424, "mean_token_accuracy": 0.6481096923351288, "num_tokens": 820981.0, "step": 100 }, { "entropy": 1.3605278491973878, "epoch": 0.026328386787936812, "grad_norm": 0.4999433755874634, "learning_rate": 1.9826073081219085e-05, "loss": 1.6153, "mean_token_accuracy": 0.6676276981830597, "num_tokens": 900515.0, "step": 110 }, { "entropy": 1.398988461494446, "epoch": 0.028721876495931067, "grad_norm": 0.5294203758239746, "learning_rate": 1.981011648316579e-05, "loss": 1.5254, "mean_token_accuracy": 0.6777714610099792, "num_tokens": 982502.0, "step": 120 }, { "entropy": 1.317799985408783, "epoch": 0.031115366203925323, "grad_norm": 0.4618872404098511, "learning_rate": 1.9794159885112495e-05, "loss": 1.4234, "mean_token_accuracy": 0.6953792750835419, "num_tokens": 1062881.0, "step": 130 }, { "entropy": 1.3724075078964233, "epoch": 0.03350885591191958, "grad_norm": 0.4770592153072357, "learning_rate": 1.97782032870592e-05, "loss": 1.4941, "mean_token_accuracy": 0.6818542718887329, "num_tokens": 1143353.0, "step": 140 }, { "entropy": 1.3332514762878418, "epoch": 0.03590234561991384, "grad_norm": 0.39026322960853577, "learning_rate": 1.9762246689005908e-05, "loss": 1.4662, "mean_token_accuracy": 0.68500617146492, "num_tokens": 1229053.0, "step": 150 }, { "entropy": 1.1989752531051636, "epoch": 0.03829583532790809, "grad_norm": 0.3791215121746063, "learning_rate": 1.9746290090952613e-05, "loss": 1.3299, "mean_token_accuracy": 0.7075082182884216, "num_tokens": 1313803.0, "step": 160 }, { "entropy": 1.172585916519165, "epoch": 0.04068932503590235, "grad_norm": 0.36965620517730713, "learning_rate": 1.9730333492899317e-05, "loss": 1.2716, "mean_token_accuracy": 0.7190541923046112, "num_tokens": 1401959.0, "step": 170 }, { "entropy": 1.1395128607749938, "epoch": 0.0430828147438966, "grad_norm": 0.3217441439628601, "learning_rate": 1.9714376894846022e-05, "loss": 1.2274, "mean_token_accuracy": 0.723137640953064, "num_tokens": 1478396.0, "step": 180 }, { "entropy": 1.2055456280708312, "epoch": 0.04547630445189086, "grad_norm": 0.3278598487377167, "learning_rate": 1.9698420296792727e-05, "loss": 1.2786, "mean_token_accuracy": 0.7123579025268555, "num_tokens": 1569299.0, "step": 190 }, { "entropy": 1.1748578429222107, "epoch": 0.04786979415988511, "grad_norm": 0.51478111743927, "learning_rate": 1.9682463698739432e-05, "loss": 1.2394, "mean_token_accuracy": 0.7217173218727112, "num_tokens": 1643993.0, "step": 200 }, { "entropy": 1.227055060863495, "epoch": 0.05026328386787937, "grad_norm": 0.38209617137908936, "learning_rate": 1.9666507100686137e-05, "loss": 1.2844, "mean_token_accuracy": 0.7089298486709594, "num_tokens": 1720490.0, "step": 210 }, { "entropy": 1.211005163192749, "epoch": 0.052656773575873624, "grad_norm": 0.35681259632110596, "learning_rate": 1.9650550502632842e-05, "loss": 1.2571, "mean_token_accuracy": 0.718545663356781, "num_tokens": 1796696.0, "step": 220 }, { "entropy": 1.2637357115745544, "epoch": 0.05505026328386788, "grad_norm": 0.2849113345146179, "learning_rate": 1.9634593904579543e-05, "loss": 1.321, "mean_token_accuracy": 0.7037886202335357, "num_tokens": 1882534.0, "step": 230 }, { "entropy": 1.2149217486381532, "epoch": 0.057443752991862135, "grad_norm": 0.3721363842487335, "learning_rate": 1.9618637306526248e-05, "loss": 1.264, "mean_token_accuracy": 0.7126233696937561, "num_tokens": 1966536.0, "step": 240 }, { "entropy": 1.1745641827583313, "epoch": 0.059837242699856394, "grad_norm": 0.338847279548645, "learning_rate": 1.9602680708472953e-05, "loss": 1.2195, "mean_token_accuracy": 0.7231896340847015, "num_tokens": 2052917.0, "step": 250 }, { "entropy": 1.130018949508667, "epoch": 0.062230732407850646, "grad_norm": 0.3460768163204193, "learning_rate": 1.9586724110419658e-05, "loss": 1.1682, "mean_token_accuracy": 0.7333509624004364, "num_tokens": 2133662.0, "step": 260 }, { "entropy": 1.2339953660964966, "epoch": 0.0646242221158449, "grad_norm": 0.5184815526008606, "learning_rate": 1.9570767512366363e-05, "loss": 1.2837, "mean_token_accuracy": 0.7122360646724701, "num_tokens": 2210171.0, "step": 270 }, { "entropy": 1.1672921299934387, "epoch": 0.06701771182383916, "grad_norm": 0.33685940504074097, "learning_rate": 1.955481091431307e-05, "loss": 1.1869, "mean_token_accuracy": 0.7300077021121979, "num_tokens": 2285278.0, "step": 280 }, { "entropy": 1.278721535205841, "epoch": 0.06941120153183342, "grad_norm": 0.45780664682388306, "learning_rate": 1.9538854316259776e-05, "loss": 1.3093, "mean_token_accuracy": 0.7067837238311767, "num_tokens": 2367086.0, "step": 290 }, { "entropy": 1.179729688167572, "epoch": 0.07180469123982768, "grad_norm": 0.3800657391548157, "learning_rate": 1.952289771820648e-05, "loss": 1.1871, "mean_token_accuracy": 0.7227078795433044, "num_tokens": 2452656.0, "step": 300 }, { "entropy": 1.2450039386749268, "epoch": 0.07419818094782192, "grad_norm": 0.2955397367477417, "learning_rate": 1.9506941120153186e-05, "loss": 1.2723, "mean_token_accuracy": 0.7101258218288422, "num_tokens": 2539006.0, "step": 310 }, { "entropy": 1.1539593100547791, "epoch": 0.07659167065581618, "grad_norm": 0.36999160051345825, "learning_rate": 1.949098452209989e-05, "loss": 1.1753, "mean_token_accuracy": 0.7302987039089203, "num_tokens": 2619986.0, "step": 320 }, { "entropy": 1.2736897230148316, "epoch": 0.07898516036381044, "grad_norm": 0.32264092564582825, "learning_rate": 1.9475027924046595e-05, "loss": 1.2877, "mean_token_accuracy": 0.7095052599906921, "num_tokens": 2704320.0, "step": 330 }, { "entropy": 1.1782316148281098, "epoch": 0.0813786500718047, "grad_norm": 0.315851092338562, "learning_rate": 1.94590713259933e-05, "loss": 1.184, "mean_token_accuracy": 0.7285471856594086, "num_tokens": 2788595.0, "step": 340 }, { "entropy": 1.180445098876953, "epoch": 0.08377213977979894, "grad_norm": 0.32032349705696106, "learning_rate": 1.9443114727940005e-05, "loss": 1.1802, "mean_token_accuracy": 0.7264943718910217, "num_tokens": 2870216.0, "step": 350 }, { "entropy": 1.1832275629043578, "epoch": 0.0861656294877932, "grad_norm": 0.33831459283828735, "learning_rate": 1.942715812988671e-05, "loss": 1.1976, "mean_token_accuracy": 0.7220143854618073, "num_tokens": 2954044.0, "step": 360 }, { "entropy": 1.2671967267990112, "epoch": 0.08855911919578746, "grad_norm": 0.33935675024986267, "learning_rate": 1.9411201531833415e-05, "loss": 1.2961, "mean_token_accuracy": 0.7084427297115325, "num_tokens": 3031830.0, "step": 370 }, { "entropy": 1.1417800307273864, "epoch": 0.09095260890378172, "grad_norm": 0.3180742561817169, "learning_rate": 1.939524493378012e-05, "loss": 1.1531, "mean_token_accuracy": 0.7325368881225586, "num_tokens": 3110145.0, "step": 380 }, { "entropy": 1.1399097561836242, "epoch": 0.09334609861177597, "grad_norm": 0.3661193251609802, "learning_rate": 1.9379288335726824e-05, "loss": 1.1473, "mean_token_accuracy": 0.7271141648292542, "num_tokens": 3188932.0, "step": 390 }, { "entropy": 1.1624513387680053, "epoch": 0.09573958831977022, "grad_norm": 0.3623553514480591, "learning_rate": 1.936333173767353e-05, "loss": 1.1982, "mean_token_accuracy": 0.7235555469989776, "num_tokens": 3274683.0, "step": 400 }, { "entropy": 1.1469115734100341, "epoch": 0.09813307802776448, "grad_norm": 0.42979690432548523, "learning_rate": 1.9347375139620234e-05, "loss": 1.1691, "mean_token_accuracy": 0.7302775263786316, "num_tokens": 3362254.0, "step": 410 }, { "entropy": 1.2337151288986206, "epoch": 0.10052656773575874, "grad_norm": 0.35702192783355713, "learning_rate": 1.933141854156694e-05, "loss": 1.2656, "mean_token_accuracy": 0.7132411658763885, "num_tokens": 3445794.0, "step": 420 }, { "entropy": 1.106970739364624, "epoch": 0.10292005744375299, "grad_norm": 0.3846401274204254, "learning_rate": 1.9315461943513644e-05, "loss": 1.1229, "mean_token_accuracy": 0.7359513640403748, "num_tokens": 3527793.0, "step": 430 }, { "entropy": 1.1119951069355012, "epoch": 0.10531354715174725, "grad_norm": 0.40356433391571045, "learning_rate": 1.929950534546035e-05, "loss": 1.1475, "mean_token_accuracy": 0.7323212623596191, "num_tokens": 3608380.0, "step": 440 }, { "entropy": 1.1829931259155273, "epoch": 0.1077070368597415, "grad_norm": 0.3817615211009979, "learning_rate": 1.9283548747407054e-05, "loss": 1.194, "mean_token_accuracy": 0.726850563287735, "num_tokens": 3688343.0, "step": 450 }, { "entropy": 1.1868076264858245, "epoch": 0.11010052656773577, "grad_norm": 0.3502326011657715, "learning_rate": 1.926759214935376e-05, "loss": 1.2123, "mean_token_accuracy": 0.7224819004535675, "num_tokens": 3764808.0, "step": 460 }, { "entropy": 1.2451523780822753, "epoch": 0.11249401627573001, "grad_norm": 0.43315961956977844, "learning_rate": 1.9251635551300463e-05, "loss": 1.2767, "mean_token_accuracy": 0.713153749704361, "num_tokens": 3850906.0, "step": 470 }, { "entropy": 1.1267979145050049, "epoch": 0.11488750598372427, "grad_norm": 0.3926289975643158, "learning_rate": 1.923567895324717e-05, "loss": 1.1317, "mean_token_accuracy": 0.7387243270874023, "num_tokens": 3931991.0, "step": 480 }, { "entropy": 1.1515992522239684, "epoch": 0.11728099569171853, "grad_norm": 0.42953503131866455, "learning_rate": 1.9219722355193876e-05, "loss": 1.1842, "mean_token_accuracy": 0.7252130150794983, "num_tokens": 4011051.0, "step": 490 }, { "entropy": 1.138441789150238, "epoch": 0.11967448539971279, "grad_norm": 0.5039691925048828, "learning_rate": 1.920376575714058e-05, "loss": 1.1704, "mean_token_accuracy": 0.7336141228675842, "num_tokens": 4087105.0, "step": 500 }, { "entropy": 1.1398205399513244, "epoch": 0.12206797510770703, "grad_norm": 0.431519091129303, "learning_rate": 1.9187809159087286e-05, "loss": 1.1557, "mean_token_accuracy": 0.7311812996864319, "num_tokens": 4171612.0, "step": 510 }, { "entropy": 1.2045225858688355, "epoch": 0.12446146481570129, "grad_norm": 0.3644827902317047, "learning_rate": 1.917185256103399e-05, "loss": 1.2212, "mean_token_accuracy": 0.7185820639133453, "num_tokens": 4254590.0, "step": 520 }, { "entropy": 1.0943529725074768, "epoch": 0.12685495452369555, "grad_norm": 0.3654193580150604, "learning_rate": 1.9155895962980696e-05, "loss": 1.1163, "mean_token_accuracy": 0.7362634301185608, "num_tokens": 4334608.0, "step": 530 }, { "entropy": 1.113824737071991, "epoch": 0.1292484442316898, "grad_norm": 0.4767385721206665, "learning_rate": 1.91399393649274e-05, "loss": 1.1309, "mean_token_accuracy": 0.732136869430542, "num_tokens": 4421216.0, "step": 540 }, { "entropy": 1.1436684787273408, "epoch": 0.13164193393968407, "grad_norm": 0.4919729232788086, "learning_rate": 1.9123982766874102e-05, "loss": 1.1811, "mean_token_accuracy": 0.7301218271255493, "num_tokens": 4502726.0, "step": 550 }, { "entropy": 1.1604778051376343, "epoch": 0.13403542364767831, "grad_norm": 0.4208875894546509, "learning_rate": 1.9108026168820807e-05, "loss": 1.1568, "mean_token_accuracy": 0.7322458744049072, "num_tokens": 4587371.0, "step": 560 }, { "entropy": 1.1452993869781494, "epoch": 0.13642891335567256, "grad_norm": 0.47862178087234497, "learning_rate": 1.9092069570767512e-05, "loss": 1.1664, "mean_token_accuracy": 0.7321425914764405, "num_tokens": 4670884.0, "step": 570 }, { "entropy": 1.1043135583400727, "epoch": 0.13882240306366683, "grad_norm": 0.44380509853363037, "learning_rate": 1.9076112972714217e-05, "loss": 1.1261, "mean_token_accuracy": 0.7356089949607849, "num_tokens": 4752436.0, "step": 580 }, { "entropy": 1.1199235320091248, "epoch": 0.14121589277166108, "grad_norm": 0.3798796832561493, "learning_rate": 1.906015637466092e-05, "loss": 1.1352, "mean_token_accuracy": 0.7339802384376526, "num_tokens": 4834426.0, "step": 590 }, { "entropy": 1.2029297947883606, "epoch": 0.14360938247965535, "grad_norm": 0.445160448551178, "learning_rate": 1.9044199776607626e-05, "loss": 1.2249, "mean_token_accuracy": 0.7229050159454345, "num_tokens": 4919118.0, "step": 600 }, { "entropy": 1.1414318084716797, "epoch": 0.1460028721876496, "grad_norm": 0.3705262243747711, "learning_rate": 1.9028243178554335e-05, "loss": 1.1564, "mean_token_accuracy": 0.7287187993526458, "num_tokens": 5006195.0, "step": 610 }, { "entropy": 1.1510895013809204, "epoch": 0.14839636189564384, "grad_norm": 0.3825203776359558, "learning_rate": 1.901228658050104e-05, "loss": 1.1644, "mean_token_accuracy": 0.728028291463852, "num_tokens": 5085225.0, "step": 620 }, { "entropy": 1.1984870433807373, "epoch": 0.15078985160363811, "grad_norm": 0.45023053884506226, "learning_rate": 1.8996329982447744e-05, "loss": 1.2109, "mean_token_accuracy": 0.7187324345111847, "num_tokens": 5166008.0, "step": 630 }, { "entropy": 1.0969820857048034, "epoch": 0.15318334131163236, "grad_norm": 0.4414844810962677, "learning_rate": 1.898037338439445e-05, "loss": 1.1029, "mean_token_accuracy": 0.7383518695831299, "num_tokens": 5244644.0, "step": 640 }, { "entropy": 1.1387382984161376, "epoch": 0.1555768310196266, "grad_norm": 0.5475702285766602, "learning_rate": 1.8964416786341154e-05, "loss": 1.1626, "mean_token_accuracy": 0.7259968459606171, "num_tokens": 5328328.0, "step": 650 }, { "entropy": 1.1580329537391663, "epoch": 0.15797032072762088, "grad_norm": 0.504128634929657, "learning_rate": 1.894846018828786e-05, "loss": 1.1581, "mean_token_accuracy": 0.7270308196544647, "num_tokens": 5409787.0, "step": 660 }, { "entropy": 1.1716572701931, "epoch": 0.16036381043561512, "grad_norm": 0.44866034388542175, "learning_rate": 1.8932503590234564e-05, "loss": 1.1903, "mean_token_accuracy": 0.7269732773303985, "num_tokens": 5485086.0, "step": 670 }, { "entropy": 1.1826915740966797, "epoch": 0.1627573001436094, "grad_norm": 0.5264368057250977, "learning_rate": 1.891654699218127e-05, "loss": 1.2096, "mean_token_accuracy": 0.7235718369483948, "num_tokens": 5560967.0, "step": 680 }, { "entropy": 1.1117774069309234, "epoch": 0.16515078985160364, "grad_norm": 0.3255954086780548, "learning_rate": 1.8900590394127974e-05, "loss": 1.1182, "mean_token_accuracy": 0.7342773914337158, "num_tokens": 5647128.0, "step": 690 }, { "entropy": 1.1096196174621582, "epoch": 0.1675442795595979, "grad_norm": 0.4005047380924225, "learning_rate": 1.888463379607468e-05, "loss": 1.114, "mean_token_accuracy": 0.737242442369461, "num_tokens": 5728810.0, "step": 700 }, { "entropy": 1.1606119513511657, "epoch": 0.16993776926759216, "grad_norm": 0.4264616072177887, "learning_rate": 1.8868677198021383e-05, "loss": 1.1786, "mean_token_accuracy": 0.7281650364398956, "num_tokens": 5810170.0, "step": 710 }, { "entropy": 1.112518960237503, "epoch": 0.1723312589755864, "grad_norm": 0.4914409816265106, "learning_rate": 1.8852720599968088e-05, "loss": 1.1331, "mean_token_accuracy": 0.7338595867156983, "num_tokens": 5891497.0, "step": 720 }, { "entropy": 1.1373264729976653, "epoch": 0.17472474868358065, "grad_norm": 0.45702746510505676, "learning_rate": 1.8836764001914793e-05, "loss": 1.166, "mean_token_accuracy": 0.7291199922561645, "num_tokens": 5968740.0, "step": 730 }, { "entropy": 1.1402511954307557, "epoch": 0.17711823839157492, "grad_norm": 0.43656495213508606, "learning_rate": 1.8820807403861498e-05, "loss": 1.1371, "mean_token_accuracy": 0.7335954666137695, "num_tokens": 6043075.0, "step": 740 }, { "entropy": 1.1422988772392273, "epoch": 0.17951172809956917, "grad_norm": 0.38513317704200745, "learning_rate": 1.8804850805808203e-05, "loss": 1.1664, "mean_token_accuracy": 0.7298018157482147, "num_tokens": 6129707.0, "step": 750 }, { "entropy": 1.08004851937294, "epoch": 0.18190521780756344, "grad_norm": 0.4508156478404999, "learning_rate": 1.8788894207754908e-05, "loss": 1.086, "mean_token_accuracy": 0.740784329175949, "num_tokens": 6205785.0, "step": 760 }, { "entropy": 1.1543840169906616, "epoch": 0.18429870751555769, "grad_norm": 0.4366827607154846, "learning_rate": 1.8772937609701612e-05, "loss": 1.1706, "mean_token_accuracy": 0.7310328662395478, "num_tokens": 6283981.0, "step": 770 }, { "entropy": 1.1501765966415405, "epoch": 0.18669219722355193, "grad_norm": 0.4135178327560425, "learning_rate": 1.8756981011648317e-05, "loss": 1.1577, "mean_token_accuracy": 0.730017501115799, "num_tokens": 6365464.0, "step": 780 }, { "entropy": 1.114385050535202, "epoch": 0.1890856869315462, "grad_norm": 0.4548529088497162, "learning_rate": 1.8741024413595022e-05, "loss": 1.1328, "mean_token_accuracy": 0.7312047243118286, "num_tokens": 6455090.0, "step": 790 }, { "entropy": 1.150389266014099, "epoch": 0.19147917663954045, "grad_norm": 0.5956313014030457, "learning_rate": 1.8725067815541727e-05, "loss": 1.1584, "mean_token_accuracy": 0.7284776091575622, "num_tokens": 6539862.0, "step": 800 }, { "entropy": 1.1701642751693726, "epoch": 0.1938726663475347, "grad_norm": 0.47608885169029236, "learning_rate": 1.8709111217488435e-05, "loss": 1.1786, "mean_token_accuracy": 0.7253443360328674, "num_tokens": 6619025.0, "step": 810 }, { "entropy": 1.173157000541687, "epoch": 0.19626615605552897, "grad_norm": 0.4210651218891144, "learning_rate": 1.869315461943514e-05, "loss": 1.1904, "mean_token_accuracy": 0.7227234840393066, "num_tokens": 6703630.0, "step": 820 }, { "entropy": 1.1706862688064574, "epoch": 0.1986596457635232, "grad_norm": 0.7524719834327698, "learning_rate": 1.8677198021381845e-05, "loss": 1.1905, "mean_token_accuracy": 0.7265216827392578, "num_tokens": 6783967.0, "step": 830 }, { "entropy": 1.1662927329540254, "epoch": 0.20105313547151749, "grad_norm": 0.5453492403030396, "learning_rate": 1.866124142332855e-05, "loss": 1.1699, "mean_token_accuracy": 0.7259662568569183, "num_tokens": 6870805.0, "step": 840 }, { "entropy": 1.1356736063957213, "epoch": 0.20344662517951173, "grad_norm": 0.44763392210006714, "learning_rate": 1.8645284825275255e-05, "loss": 1.1501, "mean_token_accuracy": 0.7307538330554962, "num_tokens": 6956283.0, "step": 850 }, { "entropy": 1.1026572406291961, "epoch": 0.20584011488750598, "grad_norm": 0.422983855009079, "learning_rate": 1.862932822722196e-05, "loss": 1.1267, "mean_token_accuracy": 0.7333247244358063, "num_tokens": 7034837.0, "step": 860 }, { "entropy": 1.1422979474067687, "epoch": 0.20823360459550025, "grad_norm": 0.4250401258468628, "learning_rate": 1.861337162916866e-05, "loss": 1.1449, "mean_token_accuracy": 0.7318553447723388, "num_tokens": 7117834.0, "step": 870 }, { "entropy": 1.0403048276901246, "epoch": 0.2106270943034945, "grad_norm": 0.4412606358528137, "learning_rate": 1.8597415031115366e-05, "loss": 1.0463, "mean_token_accuracy": 0.7481624603271484, "num_tokens": 7196257.0, "step": 880 }, { "entropy": 1.1827841997146606, "epoch": 0.21302058401148874, "grad_norm": 0.4300619661808014, "learning_rate": 1.858145843306207e-05, "loss": 1.1906, "mean_token_accuracy": 0.723038399219513, "num_tokens": 7277903.0, "step": 890 }, { "entropy": 1.1414884567260741, "epoch": 0.215414073719483, "grad_norm": 0.4286167323589325, "learning_rate": 1.8565501835008776e-05, "loss": 1.1554, "mean_token_accuracy": 0.7324569940567016, "num_tokens": 7362480.0, "step": 900 }, { "entropy": 1.0790764927864074, "epoch": 0.21780756342747726, "grad_norm": 0.5234811902046204, "learning_rate": 1.854954523695548e-05, "loss": 1.0969, "mean_token_accuracy": 0.7386617481708526, "num_tokens": 7440012.0, "step": 910 }, { "entropy": 1.1535210132598877, "epoch": 0.22020105313547153, "grad_norm": 0.37154629826545715, "learning_rate": 1.8533588638902185e-05, "loss": 1.166, "mean_token_accuracy": 0.7290057837963104, "num_tokens": 7525930.0, "step": 920 }, { "entropy": 1.1074342250823974, "epoch": 0.22259454284346578, "grad_norm": 0.46574974060058594, "learning_rate": 1.851763204084889e-05, "loss": 1.1132, "mean_token_accuracy": 0.73510040640831, "num_tokens": 7612026.0, "step": 930 }, { "entropy": 1.0925402879714965, "epoch": 0.22498803255146002, "grad_norm": 0.5284107327461243, "learning_rate": 1.85016754427956e-05, "loss": 1.0982, "mean_token_accuracy": 0.7392546772956848, "num_tokens": 7695379.0, "step": 940 }, { "entropy": 1.1203206062316895, "epoch": 0.2273815222594543, "grad_norm": 0.4579569399356842, "learning_rate": 1.8485718844742303e-05, "loss": 1.137, "mean_token_accuracy": 0.7334638714790345, "num_tokens": 7777583.0, "step": 950 }, { "entropy": 1.098641002178192, "epoch": 0.22977501196744854, "grad_norm": 0.43879202008247375, "learning_rate": 1.8469762246689008e-05, "loss": 1.1177, "mean_token_accuracy": 0.7360766649246215, "num_tokens": 7852209.0, "step": 960 }, { "entropy": 1.0046986997127534, "epoch": 0.23216850167544278, "grad_norm": 0.49049076437950134, "learning_rate": 1.8453805648635713e-05, "loss": 1.006, "mean_token_accuracy": 0.7516354858875275, "num_tokens": 7935280.0, "step": 970 }, { "entropy": 1.158735889196396, "epoch": 0.23456199138343706, "grad_norm": 0.4842958450317383, "learning_rate": 1.8437849050582418e-05, "loss": 1.1701, "mean_token_accuracy": 0.7276633143424988, "num_tokens": 8016426.0, "step": 980 }, { "entropy": 1.1089605867862702, "epoch": 0.2369554810914313, "grad_norm": 0.4378778636455536, "learning_rate": 1.8421892452529123e-05, "loss": 1.1193, "mean_token_accuracy": 0.7394879758358002, "num_tokens": 8101358.0, "step": 990 }, { "entropy": 1.1790334105491638, "epoch": 0.23934897079942558, "grad_norm": 0.3953637182712555, "learning_rate": 1.8405935854475828e-05, "loss": 1.1922, "mean_token_accuracy": 0.7241828083992005, "num_tokens": 8182849.0, "step": 1000 }, { "entropy": 1.060250174999237, "epoch": 0.24174246050741982, "grad_norm": 0.5230845808982849, "learning_rate": 1.8389979256422532e-05, "loss": 1.0676, "mean_token_accuracy": 0.7449507713317871, "num_tokens": 8261297.0, "step": 1010 }, { "entropy": 1.1369280517101288, "epoch": 0.24413595021541407, "grad_norm": 0.460395872592926, "learning_rate": 1.8374022658369237e-05, "loss": 1.1408, "mean_token_accuracy": 0.7317798137664795, "num_tokens": 8346814.0, "step": 1020 }, { "entropy": 1.1554837226867676, "epoch": 0.24652943992340834, "grad_norm": 0.49037691950798035, "learning_rate": 1.8358066060315942e-05, "loss": 1.1736, "mean_token_accuracy": 0.7271105825901032, "num_tokens": 8432664.0, "step": 1030 }, { "entropy": 1.0856216609477998, "epoch": 0.24892292963140258, "grad_norm": 0.5764221549034119, "learning_rate": 1.8342109462262647e-05, "loss": 1.0928, "mean_token_accuracy": 0.7418696939945221, "num_tokens": 8510307.0, "step": 1040 }, { "entropy": 1.1276116609573363, "epoch": 0.25131641933939686, "grad_norm": 0.4118581712245941, "learning_rate": 1.8326152864209352e-05, "loss": 1.1538, "mean_token_accuracy": 0.7313674926757813, "num_tokens": 8592223.0, "step": 1050 }, { "entropy": 1.1677935779094697, "epoch": 0.2537099090473911, "grad_norm": 0.5074272155761719, "learning_rate": 1.8310196266156057e-05, "loss": 1.1762, "mean_token_accuracy": 0.7262083709239959, "num_tokens": 8671470.0, "step": 1060 }, { "entropy": 1.1634832084178925, "epoch": 0.25610339875538535, "grad_norm": 0.5505145788192749, "learning_rate": 1.829423966810276e-05, "loss": 1.1685, "mean_token_accuracy": 0.7255993783473969, "num_tokens": 8748843.0, "step": 1070 }, { "entropy": 1.1505753695964813, "epoch": 0.2584968884633796, "grad_norm": 0.41146954894065857, "learning_rate": 1.8278283070049466e-05, "loss": 1.1591, "mean_token_accuracy": 0.7274834334850311, "num_tokens": 8828379.0, "step": 1080 }, { "entropy": 1.112020456790924, "epoch": 0.26089037817137384, "grad_norm": 0.615053653717041, "learning_rate": 1.826232647199617e-05, "loss": 1.1312, "mean_token_accuracy": 0.7352388620376586, "num_tokens": 8914585.0, "step": 1090 }, { "entropy": 1.143721067905426, "epoch": 0.26328386787936814, "grad_norm": 0.5205114483833313, "learning_rate": 1.8246369873942876e-05, "loss": 1.1547, "mean_token_accuracy": 0.7253860235214233, "num_tokens": 8998808.0, "step": 1100 }, { "entropy": 1.0884106397628783, "epoch": 0.2656773575873624, "grad_norm": 0.5011736750602722, "learning_rate": 1.823041327588958e-05, "loss": 1.0933, "mean_token_accuracy": 0.738983541727066, "num_tokens": 9082538.0, "step": 1110 }, { "entropy": 1.1211643397808075, "epoch": 0.26807084729535663, "grad_norm": 0.5459955930709839, "learning_rate": 1.8214456677836286e-05, "loss": 1.1216, "mean_token_accuracy": 0.7338890194892883, "num_tokens": 9160021.0, "step": 1120 }, { "entropy": 1.0946745038032533, "epoch": 0.2704643370033509, "grad_norm": 0.4615417420864105, "learning_rate": 1.8198500079782994e-05, "loss": 1.112, "mean_token_accuracy": 0.7379445254802703, "num_tokens": 9244536.0, "step": 1130 }, { "entropy": 1.0817080974578857, "epoch": 0.2728578267113451, "grad_norm": 0.5138433575630188, "learning_rate": 1.81825434817297e-05, "loss": 1.0912, "mean_token_accuracy": 0.7364392399787902, "num_tokens": 9326725.0, "step": 1140 }, { "entropy": 1.124049973487854, "epoch": 0.2752513164193394, "grad_norm": 1.1013171672821045, "learning_rate": 1.8166586883676404e-05, "loss": 1.1361, "mean_token_accuracy": 0.7332423567771912, "num_tokens": 9400056.0, "step": 1150 }, { "entropy": 1.227579951286316, "epoch": 0.27764480612733367, "grad_norm": 0.4477737545967102, "learning_rate": 1.815063028562311e-05, "loss": 1.2311, "mean_token_accuracy": 0.7192757904529572, "num_tokens": 9477840.0, "step": 1160 }, { "entropy": 1.0108287751674652, "epoch": 0.2800382958353279, "grad_norm": 0.5158432722091675, "learning_rate": 1.8134673687569814e-05, "loss": 1.0087, "mean_token_accuracy": 0.7559822559356689, "num_tokens": 9555470.0, "step": 1170 }, { "entropy": 1.0718107998371125, "epoch": 0.28243178554332216, "grad_norm": 0.5826597213745117, "learning_rate": 1.811871708951652e-05, "loss": 1.1079, "mean_token_accuracy": 0.7415627300739288, "num_tokens": 9635793.0, "step": 1180 }, { "entropy": 1.1753923535346984, "epoch": 0.2848252752513164, "grad_norm": 0.5123017430305481, "learning_rate": 1.810276049146322e-05, "loss": 1.1678, "mean_token_accuracy": 0.7245855867862702, "num_tokens": 9718455.0, "step": 1190 }, { "entropy": 1.0536331057548523, "epoch": 0.2872187649593107, "grad_norm": 0.515906035900116, "learning_rate": 1.8086803893409925e-05, "loss": 1.0539, "mean_token_accuracy": 0.746714061498642, "num_tokens": 9798227.0, "step": 1200 }, { "entropy": 1.0995701193809508, "epoch": 0.28961225466730495, "grad_norm": 0.5043840408325195, "learning_rate": 1.807084729535663e-05, "loss": 1.1141, "mean_token_accuracy": 0.7365080714225769, "num_tokens": 9881529.0, "step": 1210 }, { "entropy": 1.1067807972431183, "epoch": 0.2920057443752992, "grad_norm": 0.5044357776641846, "learning_rate": 1.8054890697303335e-05, "loss": 1.114, "mean_token_accuracy": 0.7387550234794616, "num_tokens": 9962408.0, "step": 1220 }, { "entropy": 1.1084092378616333, "epoch": 0.29439923408329344, "grad_norm": 0.539025604724884, "learning_rate": 1.803893409925004e-05, "loss": 1.1234, "mean_token_accuracy": 0.7368146061897278, "num_tokens": 10047556.0, "step": 1230 }, { "entropy": 1.1232216238975525, "epoch": 0.2967927237912877, "grad_norm": 0.5782031416893005, "learning_rate": 1.8022977501196744e-05, "loss": 1.118, "mean_token_accuracy": 0.7328577399253845, "num_tokens": 10134677.0, "step": 1240 }, { "entropy": 1.0230436742305755, "epoch": 0.29918621349928193, "grad_norm": 0.5231150388717651, "learning_rate": 1.800702090314345e-05, "loss": 1.0415, "mean_token_accuracy": 0.7487457931041718, "num_tokens": 10213876.0, "step": 1250 }, { "entropy": 1.173479026556015, "epoch": 0.30157970320727623, "grad_norm": 0.5498600006103516, "learning_rate": 1.7991064305090157e-05, "loss": 1.1829, "mean_token_accuracy": 0.7260289549827575, "num_tokens": 10292884.0, "step": 1260 }, { "entropy": 1.1466880917549134, "epoch": 0.3039731929152705, "grad_norm": 0.46151983737945557, "learning_rate": 1.7975107707036862e-05, "loss": 1.1394, "mean_token_accuracy": 0.7284374833106995, "num_tokens": 10377210.0, "step": 1270 }, { "entropy": 1.0677096903324128, "epoch": 0.3063666826232647, "grad_norm": 0.5466307997703552, "learning_rate": 1.7959151108983567e-05, "loss": 1.0858, "mean_token_accuracy": 0.7383745372295379, "num_tokens": 10459196.0, "step": 1280 }, { "entropy": 1.109909290075302, "epoch": 0.30876017233125896, "grad_norm": 0.6939959526062012, "learning_rate": 1.7943194510930272e-05, "loss": 1.1233, "mean_token_accuracy": 0.7348092496395111, "num_tokens": 10541884.0, "step": 1290 }, { "entropy": 1.0882596015930175, "epoch": 0.3111536620392532, "grad_norm": 0.48167234659194946, "learning_rate": 1.7927237912876977e-05, "loss": 1.0874, "mean_token_accuracy": 0.7419361233711242, "num_tokens": 10624600.0, "step": 1300 }, { "entropy": 1.0614607214927674, "epoch": 0.3135471517472475, "grad_norm": 0.4936775863170624, "learning_rate": 1.791128131482368e-05, "loss": 1.0661, "mean_token_accuracy": 0.740717351436615, "num_tokens": 10702252.0, "step": 1310 }, { "entropy": 1.0592714846134186, "epoch": 0.31594064145524176, "grad_norm": 0.8975985646247864, "learning_rate": 1.7895324716770387e-05, "loss": 1.086, "mean_token_accuracy": 0.7410467028617859, "num_tokens": 10774660.0, "step": 1320 }, { "entropy": 1.1287354588508607, "epoch": 0.318334131163236, "grad_norm": 0.8397033214569092, "learning_rate": 1.787936811871709e-05, "loss": 1.1272, "mean_token_accuracy": 0.7296611070632935, "num_tokens": 10859939.0, "step": 1330 }, { "entropy": 1.0429444849491118, "epoch": 0.32072762087123025, "grad_norm": 0.4758578836917877, "learning_rate": 1.7863411520663796e-05, "loss": 1.0455, "mean_token_accuracy": 0.7479507088661194, "num_tokens": 10945756.0, "step": 1340 }, { "entropy": 1.0388957977294921, "epoch": 0.3231211105792245, "grad_norm": 0.48702606558799744, "learning_rate": 1.78474549226105e-05, "loss": 1.0541, "mean_token_accuracy": 0.7459675371646881, "num_tokens": 11025527.0, "step": 1350 }, { "entropy": 1.1503496289253234, "epoch": 0.3255146002872188, "grad_norm": 0.464547336101532, "learning_rate": 1.7831498324557206e-05, "loss": 1.1437, "mean_token_accuracy": 0.7314624607563018, "num_tokens": 11106478.0, "step": 1360 }, { "entropy": 1.116293078660965, "epoch": 0.32790808999521304, "grad_norm": 0.49953344464302063, "learning_rate": 1.781554172650391e-05, "loss": 1.1364, "mean_token_accuracy": 0.7377607464790344, "num_tokens": 11187937.0, "step": 1370 }, { "entropy": 1.1121998131275177, "epoch": 0.3303015797032073, "grad_norm": 0.5883446335792542, "learning_rate": 1.7799585128450616e-05, "loss": 1.1227, "mean_token_accuracy": 0.7302426040172577, "num_tokens": 11274073.0, "step": 1380 }, { "entropy": 1.0967606782913208, "epoch": 0.3326950694112015, "grad_norm": 0.5348601341247559, "learning_rate": 1.778362853039732e-05, "loss": 1.1049, "mean_token_accuracy": 0.7353415608406066, "num_tokens": 11358174.0, "step": 1390 }, { "entropy": 1.2084548234939576, "epoch": 0.3350885591191958, "grad_norm": 0.5608245730400085, "learning_rate": 1.7767671932344025e-05, "loss": 1.2129, "mean_token_accuracy": 0.7224825620651245, "num_tokens": 11449700.0, "step": 1400 }, { "entropy": 1.0699814438819886, "epoch": 0.33748204882719, "grad_norm": 0.5325828790664673, "learning_rate": 1.775171533429073e-05, "loss": 1.0801, "mean_token_accuracy": 0.74050452709198, "num_tokens": 11542684.0, "step": 1410 }, { "entropy": 1.0742067635059356, "epoch": 0.3398755385351843, "grad_norm": 0.5795136094093323, "learning_rate": 1.7735758736237435e-05, "loss": 1.0895, "mean_token_accuracy": 0.7408529937267303, "num_tokens": 11624818.0, "step": 1420 }, { "entropy": 1.1562271177768708, "epoch": 0.34226902824317856, "grad_norm": 0.501658022403717, "learning_rate": 1.771980213818414e-05, "loss": 1.1557, "mean_token_accuracy": 0.7292845904827118, "num_tokens": 11703713.0, "step": 1430 }, { "entropy": 1.1149949967861175, "epoch": 0.3446625179511728, "grad_norm": 0.5859589576721191, "learning_rate": 1.7703845540130845e-05, "loss": 1.1314, "mean_token_accuracy": 0.7346829295158386, "num_tokens": 11784387.0, "step": 1440 }, { "entropy": 1.1393958926200867, "epoch": 0.34705600765916705, "grad_norm": 0.6459059715270996, "learning_rate": 1.768788894207755e-05, "loss": 1.1481, "mean_token_accuracy": 0.7314362764358521, "num_tokens": 11864013.0, "step": 1450 }, { "entropy": 1.1156118392944336, "epoch": 0.3494494973671613, "grad_norm": 0.5335090160369873, "learning_rate": 1.7671932344024258e-05, "loss": 1.1327, "mean_token_accuracy": 0.7320908427238464, "num_tokens": 11943448.0, "step": 1460 }, { "entropy": 1.1601254105567933, "epoch": 0.3518429870751556, "grad_norm": 0.5655401945114136, "learning_rate": 1.7655975745970963e-05, "loss": 1.1687, "mean_token_accuracy": 0.7263648569583893, "num_tokens": 12027368.0, "step": 1470 }, { "entropy": 1.0911331295967102, "epoch": 0.35423647678314985, "grad_norm": 0.5665701031684875, "learning_rate": 1.7640019147917668e-05, "loss": 1.093, "mean_token_accuracy": 0.7388573408126831, "num_tokens": 12103515.0, "step": 1480 }, { "entropy": 1.0512312710285188, "epoch": 0.3566299664911441, "grad_norm": 0.5473869442939758, "learning_rate": 1.7624062549864373e-05, "loss": 1.0725, "mean_token_accuracy": 0.7439163744449615, "num_tokens": 12190253.0, "step": 1490 }, { "entropy": 1.10569007396698, "epoch": 0.35902345619913834, "grad_norm": 0.5401135087013245, "learning_rate": 1.7608105951811077e-05, "loss": 1.1048, "mean_token_accuracy": 0.7423075079917908, "num_tokens": 12270470.0, "step": 1500 }, { "entropy": 1.1149644315242768, "epoch": 0.3614169459071326, "grad_norm": 0.5855125784873962, "learning_rate": 1.759214935375778e-05, "loss": 1.1207, "mean_token_accuracy": 0.7331575155258179, "num_tokens": 12347521.0, "step": 1510 }, { "entropy": 1.1357326567173005, "epoch": 0.3638104356151269, "grad_norm": 0.6087114214897156, "learning_rate": 1.7576192755704484e-05, "loss": 1.1527, "mean_token_accuracy": 0.731180077791214, "num_tokens": 12433888.0, "step": 1520 }, { "entropy": 1.13399178981781, "epoch": 0.3662039253231211, "grad_norm": 0.559622049331665, "learning_rate": 1.756023615765119e-05, "loss": 1.1448, "mean_token_accuracy": 0.726129674911499, "num_tokens": 12514766.0, "step": 1530 }, { "entropy": 1.140819215774536, "epoch": 0.36859741503111537, "grad_norm": 0.5918214321136475, "learning_rate": 1.7544279559597893e-05, "loss": 1.1442, "mean_token_accuracy": 0.7298588156700134, "num_tokens": 12595540.0, "step": 1540 }, { "entropy": 1.0882207870483398, "epoch": 0.3709909047391096, "grad_norm": 0.5943206548690796, "learning_rate": 1.7528322961544598e-05, "loss": 1.0974, "mean_token_accuracy": 0.7369262516498566, "num_tokens": 12685850.0, "step": 1550 }, { "entropy": 1.049841034412384, "epoch": 0.37338439444710386, "grad_norm": 0.6741575598716736, "learning_rate": 1.7512366363491303e-05, "loss": 1.0546, "mean_token_accuracy": 0.7472926259040833, "num_tokens": 12765335.0, "step": 1560 }, { "entropy": 1.1476511836051941, "epoch": 0.3757778841550981, "grad_norm": 0.5215249061584473, "learning_rate": 1.7496409765438008e-05, "loss": 1.1574, "mean_token_accuracy": 0.7313296914100647, "num_tokens": 12843331.0, "step": 1570 }, { "entropy": 1.1424257516860963, "epoch": 0.3781713738630924, "grad_norm": 0.42422813177108765, "learning_rate": 1.7480453167384713e-05, "loss": 1.1468, "mean_token_accuracy": 0.7322757124900818, "num_tokens": 12926479.0, "step": 1580 }, { "entropy": 1.1224781215190887, "epoch": 0.38056486357108665, "grad_norm": 0.5699655413627625, "learning_rate": 1.746449656933142e-05, "loss": 1.1348, "mean_token_accuracy": 0.7340908408164978, "num_tokens": 13008395.0, "step": 1590 }, { "entropy": 1.1242433786392212, "epoch": 0.3829583532790809, "grad_norm": 0.5160660743713379, "learning_rate": 1.7448539971278126e-05, "loss": 1.1415, "mean_token_accuracy": 0.7333247721195221, "num_tokens": 13092858.0, "step": 1600 }, { "entropy": 1.093923270702362, "epoch": 0.38535184298707514, "grad_norm": 0.7464497089385986, "learning_rate": 1.743258337322483e-05, "loss": 1.0964, "mean_token_accuracy": 0.7392175436019898, "num_tokens": 13174733.0, "step": 1610 }, { "entropy": 1.10646812915802, "epoch": 0.3877453326950694, "grad_norm": 0.5711216330528259, "learning_rate": 1.7416626775171536e-05, "loss": 1.1139, "mean_token_accuracy": 0.7354251325130463, "num_tokens": 13261918.0, "step": 1620 }, { "entropy": 1.041162359714508, "epoch": 0.3901388224030637, "grad_norm": 0.6076639294624329, "learning_rate": 1.740067017711824e-05, "loss": 1.0475, "mean_token_accuracy": 0.7487479627132416, "num_tokens": 13338814.0, "step": 1630 }, { "entropy": 1.0727667212486267, "epoch": 0.39253231211105793, "grad_norm": 0.46674367785453796, "learning_rate": 1.7384713579064945e-05, "loss": 1.0752, "mean_token_accuracy": 0.7416320621967316, "num_tokens": 13424594.0, "step": 1640 }, { "entropy": 1.080169862508774, "epoch": 0.3949258018190522, "grad_norm": 3.994786262512207, "learning_rate": 1.736875698101165e-05, "loss": 1.0911, "mean_token_accuracy": 0.7385109722614288, "num_tokens": 13500390.0, "step": 1650 }, { "entropy": 1.0480771601200103, "epoch": 0.3973192915270464, "grad_norm": 0.5100842118263245, "learning_rate": 1.7352800382958355e-05, "loss": 1.0525, "mean_token_accuracy": 0.7464718580245971, "num_tokens": 13582647.0, "step": 1660 }, { "entropy": 1.0785650134086608, "epoch": 0.39971278123504067, "grad_norm": 0.5472614765167236, "learning_rate": 1.733684378490506e-05, "loss": 1.0833, "mean_token_accuracy": 0.7412976503372193, "num_tokens": 13671194.0, "step": 1670 }, { "entropy": 1.0455707967281342, "epoch": 0.40210627094303497, "grad_norm": 2.5722084045410156, "learning_rate": 1.7320887186851765e-05, "loss": 1.0528, "mean_token_accuracy": 0.7453463256359101, "num_tokens": 13753751.0, "step": 1680 }, { "entropy": 1.0688288927078247, "epoch": 0.4044997606510292, "grad_norm": 0.5685151219367981, "learning_rate": 1.730493058879847e-05, "loss": 1.0803, "mean_token_accuracy": 0.7423784971237183, "num_tokens": 13836887.0, "step": 1690 }, { "entropy": 1.0849794149398804, "epoch": 0.40689325035902346, "grad_norm": 0.7111828923225403, "learning_rate": 1.7288973990745175e-05, "loss": 1.0816, "mean_token_accuracy": 0.7410798668861389, "num_tokens": 13911144.0, "step": 1700 }, { "entropy": 1.0746318578720093, "epoch": 0.4092867400670177, "grad_norm": 0.47197631001472473, "learning_rate": 1.727301739269188e-05, "loss": 1.0958, "mean_token_accuracy": 0.7405313014984131, "num_tokens": 13994518.0, "step": 1710 }, { "entropy": 1.1007722556591033, "epoch": 0.41168022977501195, "grad_norm": 0.6988211274147034, "learning_rate": 1.7257060794638584e-05, "loss": 1.1122, "mean_token_accuracy": 0.7361564874649048, "num_tokens": 14077901.0, "step": 1720 }, { "entropy": 1.1553027510643006, "epoch": 0.4140737194830062, "grad_norm": 0.5971831679344177, "learning_rate": 1.724110419658529e-05, "loss": 1.169, "mean_token_accuracy": 0.7279999256134033, "num_tokens": 14160956.0, "step": 1730 }, { "entropy": 1.1167118430137635, "epoch": 0.4164672091910005, "grad_norm": 0.6331872344017029, "learning_rate": 1.7225147598531994e-05, "loss": 1.106, "mean_token_accuracy": 0.7389692306518555, "num_tokens": 14246870.0, "step": 1740 }, { "entropy": 1.07000989317894, "epoch": 0.41886069889899474, "grad_norm": 0.6542571783065796, "learning_rate": 1.72091910004787e-05, "loss": 1.0985, "mean_token_accuracy": 0.7383829712867737, "num_tokens": 14325211.0, "step": 1750 }, { "entropy": 1.1347588062286378, "epoch": 0.421254188606989, "grad_norm": 0.6905112862586975, "learning_rate": 1.7193234402425404e-05, "loss": 1.132, "mean_token_accuracy": 0.7278760671615601, "num_tokens": 14411713.0, "step": 1760 }, { "entropy": 1.0780755043029786, "epoch": 0.42364767831498323, "grad_norm": 0.5749602913856506, "learning_rate": 1.717727780437211e-05, "loss": 1.0921, "mean_token_accuracy": 0.7410579800605774, "num_tokens": 14496205.0, "step": 1770 }, { "entropy": 1.0782687783241272, "epoch": 0.4260411680229775, "grad_norm": 0.5854172110557556, "learning_rate": 1.7161321206318813e-05, "loss": 1.0831, "mean_token_accuracy": 0.7435673117637634, "num_tokens": 14579678.0, "step": 1780 }, { "entropy": 1.0986156225204469, "epoch": 0.4284346577309718, "grad_norm": 0.6664464473724365, "learning_rate": 1.714536460826552e-05, "loss": 1.1006, "mean_token_accuracy": 0.7404700219631195, "num_tokens": 14661038.0, "step": 1790 }, { "entropy": 1.053427791595459, "epoch": 0.430828147438966, "grad_norm": 0.6061694622039795, "learning_rate": 1.7129408010212227e-05, "loss": 1.0693, "mean_token_accuracy": 0.7474850475788116, "num_tokens": 14738447.0, "step": 1800 }, { "entropy": 1.117923903465271, "epoch": 0.43322163714696027, "grad_norm": 0.7042562961578369, "learning_rate": 1.711345141215893e-05, "loss": 1.1162, "mean_token_accuracy": 0.7414107978343963, "num_tokens": 14821337.0, "step": 1810 }, { "entropy": 1.0853823006153107, "epoch": 0.4356151268549545, "grad_norm": 0.6966001987457275, "learning_rate": 1.7097494814105636e-05, "loss": 1.1008, "mean_token_accuracy": 0.7390415370464325, "num_tokens": 14897475.0, "step": 1820 }, { "entropy": 1.1424123167991638, "epoch": 0.43800861656294876, "grad_norm": 0.5323998928070068, "learning_rate": 1.7081538216052338e-05, "loss": 1.1454, "mean_token_accuracy": 0.7323163211345672, "num_tokens": 14985446.0, "step": 1830 }, { "entropy": 1.042124879360199, "epoch": 0.44040210627094306, "grad_norm": 0.6735746264457703, "learning_rate": 1.7065581617999043e-05, "loss": 1.0437, "mean_token_accuracy": 0.7483052670955658, "num_tokens": 15065538.0, "step": 1840 }, { "entropy": 1.061891108751297, "epoch": 0.4427955959789373, "grad_norm": 0.7179056406021118, "learning_rate": 1.7049625019945747e-05, "loss": 1.0768, "mean_token_accuracy": 0.7440852046012878, "num_tokens": 15145043.0, "step": 1850 }, { "entropy": 1.033814686536789, "epoch": 0.44518908568693155, "grad_norm": 0.670626163482666, "learning_rate": 1.7033668421892452e-05, "loss": 1.0314, "mean_token_accuracy": 0.7532525777816772, "num_tokens": 15221022.0, "step": 1860 }, { "entropy": 1.0369441986083985, "epoch": 0.4475825753949258, "grad_norm": 0.6771154403686523, "learning_rate": 1.7017711823839157e-05, "loss": 1.0475, "mean_token_accuracy": 0.7451251745223999, "num_tokens": 15299009.0, "step": 1870 }, { "entropy": 1.115807294845581, "epoch": 0.44997606510292004, "grad_norm": 0.622519850730896, "learning_rate": 1.7001755225785862e-05, "loss": 1.1308, "mean_token_accuracy": 0.7329511046409607, "num_tokens": 15382425.0, "step": 1880 }, { "entropy": 1.0232145309448242, "epoch": 0.4523695548109143, "grad_norm": 0.6011036038398743, "learning_rate": 1.6985798627732567e-05, "loss": 1.034, "mean_token_accuracy": 0.7500796377658844, "num_tokens": 15464291.0, "step": 1890 }, { "entropy": 1.0658549070358276, "epoch": 0.4547630445189086, "grad_norm": 5.619943618774414, "learning_rate": 1.6969842029679272e-05, "loss": 1.0715, "mean_token_accuracy": 0.7470685422420502, "num_tokens": 15539663.0, "step": 1900 }, { "entropy": 1.137593150138855, "epoch": 0.45715653422690283, "grad_norm": 0.5702992081642151, "learning_rate": 1.6953885431625977e-05, "loss": 1.1402, "mean_token_accuracy": 0.7303393661975861, "num_tokens": 15625502.0, "step": 1910 }, { "entropy": 1.0707310140132904, "epoch": 0.4595500239348971, "grad_norm": 0.6284565329551697, "learning_rate": 1.6937928833572685e-05, "loss": 1.0714, "mean_token_accuracy": 0.7435721397399903, "num_tokens": 15707483.0, "step": 1920 }, { "entropy": 1.122710120677948, "epoch": 0.4619435136428913, "grad_norm": 0.5178508758544922, "learning_rate": 1.692197223551939e-05, "loss": 1.1387, "mean_token_accuracy": 0.7373745322227478, "num_tokens": 15793807.0, "step": 1930 }, { "entropy": 1.0189306616783143, "epoch": 0.46433700335088557, "grad_norm": 0.7075283527374268, "learning_rate": 1.6906015637466095e-05, "loss": 1.0254, "mean_token_accuracy": 0.7500097513198852, "num_tokens": 15876177.0, "step": 1940 }, { "entropy": 1.0296615958213806, "epoch": 0.46673049305887987, "grad_norm": 0.655680775642395, "learning_rate": 1.68900590394128e-05, "loss": 1.0336, "mean_token_accuracy": 0.7511914551258088, "num_tokens": 15965790.0, "step": 1950 }, { "entropy": 1.0647503197193147, "epoch": 0.4691239827668741, "grad_norm": 0.6232638359069824, "learning_rate": 1.6874102441359504e-05, "loss": 1.0793, "mean_token_accuracy": 0.7438226282596588, "num_tokens": 16050434.0, "step": 1960 }, { "entropy": 1.0943642377853393, "epoch": 0.47151747247486836, "grad_norm": 0.6169235706329346, "learning_rate": 1.685814584330621e-05, "loss": 1.101, "mean_token_accuracy": 0.7388047873973846, "num_tokens": 16135646.0, "step": 1970 }, { "entropy": 0.9858994007110595, "epoch": 0.4739109621828626, "grad_norm": 0.771087110042572, "learning_rate": 1.6842189245252914e-05, "loss": 0.9905, "mean_token_accuracy": 0.7570463836193084, "num_tokens": 16207202.0, "step": 1980 }, { "entropy": 1.0939780235290528, "epoch": 0.47630445189085685, "grad_norm": 1.2727882862091064, "learning_rate": 1.682623264719962e-05, "loss": 1.1023, "mean_token_accuracy": 0.7375462532043457, "num_tokens": 16288759.0, "step": 1990 }, { "entropy": 1.0276434659957885, "epoch": 0.47869794159885115, "grad_norm": 0.6156533360481262, "learning_rate": 1.6810276049146324e-05, "loss": 1.0344, "mean_token_accuracy": 0.7529487133026123, "num_tokens": 16376517.0, "step": 2000 }, { "entropy": 1.0436306655406953, "epoch": 0.4810914313068454, "grad_norm": 0.8076905012130737, "learning_rate": 1.679431945109303e-05, "loss": 1.0422, "mean_token_accuracy": 0.7471736788749694, "num_tokens": 16457929.0, "step": 2010 }, { "entropy": 1.0113335013389588, "epoch": 0.48348492101483964, "grad_norm": 0.5823526978492737, "learning_rate": 1.6778362853039733e-05, "loss": 1.0238, "mean_token_accuracy": 0.7553565919399261, "num_tokens": 16544849.0, "step": 2020 }, { "entropy": 1.111458420753479, "epoch": 0.4858784107228339, "grad_norm": 0.4666674733161926, "learning_rate": 1.676240625498644e-05, "loss": 1.1183, "mean_token_accuracy": 0.7348304867744446, "num_tokens": 16631944.0, "step": 2030 }, { "entropy": 1.1391419231891633, "epoch": 0.48827190043082813, "grad_norm": 0.6024052500724792, "learning_rate": 1.6746449656933143e-05, "loss": 1.1519, "mean_token_accuracy": 0.731666499376297, "num_tokens": 16722399.0, "step": 2040 }, { "entropy": 1.0513649940490724, "epoch": 0.4906653901388224, "grad_norm": 0.8297297954559326, "learning_rate": 1.6730493058879848e-05, "loss": 1.061, "mean_token_accuracy": 0.7470701456069946, "num_tokens": 16800897.0, "step": 2050 }, { "entropy": 1.1298478245735168, "epoch": 0.4930588798468167, "grad_norm": 0.663592517375946, "learning_rate": 1.6714536460826553e-05, "loss": 1.1243, "mean_token_accuracy": 0.7326838731765747, "num_tokens": 16875372.0, "step": 2060 }, { "entropy": 1.0739252805709838, "epoch": 0.4954523695548109, "grad_norm": 0.5974112749099731, "learning_rate": 1.6698579862773258e-05, "loss": 1.0834, "mean_token_accuracy": 0.7434284806251525, "num_tokens": 16956515.0, "step": 2070 }, { "entropy": 1.1313821852207184, "epoch": 0.49784585926280517, "grad_norm": 0.5157338380813599, "learning_rate": 1.6682623264719963e-05, "loss": 1.15, "mean_token_accuracy": 0.7329830229282379, "num_tokens": 17032455.0, "step": 2080 }, { "entropy": 1.0915243804454804, "epoch": 0.5002393489707995, "grad_norm": 0.5727088451385498, "learning_rate": 1.6666666666666667e-05, "loss": 1.0871, "mean_token_accuracy": 0.7376357674598694, "num_tokens": 17111537.0, "step": 2090 }, { "entropy": 1.0860334396362306, "epoch": 0.5026328386787937, "grad_norm": 1.131248950958252, "learning_rate": 1.6650710068613372e-05, "loss": 1.0958, "mean_token_accuracy": 0.7394561052322388, "num_tokens": 17199367.0, "step": 2100 }, { "entropy": 1.0895774960517883, "epoch": 0.505026328386788, "grad_norm": 0.6308713555335999, "learning_rate": 1.6634753470560077e-05, "loss": 1.0994, "mean_token_accuracy": 0.7413264513015747, "num_tokens": 17286069.0, "step": 2110 }, { "entropy": 1.042851161956787, "epoch": 0.5074198180947822, "grad_norm": 0.6670368909835815, "learning_rate": 1.6618796872506785e-05, "loss": 1.0481, "mean_token_accuracy": 0.7471791267395019, "num_tokens": 17365360.0, "step": 2120 }, { "entropy": 1.0485999524593352, "epoch": 0.5098133078027764, "grad_norm": 0.6198334097862244, "learning_rate": 1.660284027445349e-05, "loss": 1.0648, "mean_token_accuracy": 0.7454506397247315, "num_tokens": 17439869.0, "step": 2130 }, { "entropy": 1.1252771377563477, "epoch": 0.5122067975107707, "grad_norm": 0.8398559093475342, "learning_rate": 1.6586883676400195e-05, "loss": 1.1281, "mean_token_accuracy": 0.731948834657669, "num_tokens": 17526143.0, "step": 2140 }, { "entropy": 1.0755485057830811, "epoch": 0.5146002872187649, "grad_norm": 0.6819499135017395, "learning_rate": 1.6570927078346897e-05, "loss": 1.0815, "mean_token_accuracy": 0.7402812361717224, "num_tokens": 17607490.0, "step": 2150 }, { "entropy": 1.0722748279571532, "epoch": 0.5169937769267592, "grad_norm": 0.8138436675071716, "learning_rate": 1.65549704802936e-05, "loss": 1.0765, "mean_token_accuracy": 0.7441859841346741, "num_tokens": 17695308.0, "step": 2160 }, { "entropy": 1.1051388561725617, "epoch": 0.5193872666347534, "grad_norm": 0.8223373293876648, "learning_rate": 1.6539013882240306e-05, "loss": 1.1184, "mean_token_accuracy": 0.735604465007782, "num_tokens": 17779682.0, "step": 2170 }, { "entropy": 1.145215743780136, "epoch": 0.5217807563427477, "grad_norm": 0.6529273986816406, "learning_rate": 1.652305728418701e-05, "loss": 1.1329, "mean_token_accuracy": 0.7334801733493805, "num_tokens": 17859679.0, "step": 2180 }, { "entropy": 0.963028508424759, "epoch": 0.524174246050742, "grad_norm": 0.6153014898300171, "learning_rate": 1.6507100686133716e-05, "loss": 0.9805, "mean_token_accuracy": 0.7606176972389221, "num_tokens": 17935802.0, "step": 2190 }, { "entropy": 1.0729603230953217, "epoch": 0.5265677357587363, "grad_norm": 1.7113527059555054, "learning_rate": 1.649114408808042e-05, "loss": 1.0881, "mean_token_accuracy": 0.741437292098999, "num_tokens": 18011548.0, "step": 2200 }, { "entropy": 1.0923176765441895, "epoch": 0.5289612254667305, "grad_norm": 0.6712521910667419, "learning_rate": 1.6475187490027126e-05, "loss": 1.0847, "mean_token_accuracy": 0.7404011368751526, "num_tokens": 18093062.0, "step": 2210 }, { "entropy": 1.0267192900180817, "epoch": 0.5313547151747248, "grad_norm": 0.8290082216262817, "learning_rate": 1.645923089197383e-05, "loss": 1.0312, "mean_token_accuracy": 0.7513166487216949, "num_tokens": 18169463.0, "step": 2220 }, { "entropy": 1.0343119144439696, "epoch": 0.533748204882719, "grad_norm": 0.8802976608276367, "learning_rate": 1.6443274293920535e-05, "loss": 1.0378, "mean_token_accuracy": 0.7520385146141052, "num_tokens": 18245259.0, "step": 2230 }, { "entropy": 1.1066267848014832, "epoch": 0.5361416945907133, "grad_norm": 0.5967556834220886, "learning_rate": 1.642731769586724e-05, "loss": 1.1279, "mean_token_accuracy": 0.7345916450023651, "num_tokens": 18327091.0, "step": 2240 }, { "entropy": 1.1284412324428559, "epoch": 0.5385351842987075, "grad_norm": 0.687362551689148, "learning_rate": 1.641136109781395e-05, "loss": 1.1253, "mean_token_accuracy": 0.7369785964488983, "num_tokens": 18410490.0, "step": 2250 }, { "entropy": 1.0592759251594543, "epoch": 0.5409286740067017, "grad_norm": 1.7939339876174927, "learning_rate": 1.6395404499760653e-05, "loss": 1.07, "mean_token_accuracy": 0.7426570773124694, "num_tokens": 18485447.0, "step": 2260 }, { "entropy": 1.0785628974437713, "epoch": 0.543322163714696, "grad_norm": 1.1665188074111938, "learning_rate": 1.637944790170736e-05, "loss": 1.092, "mean_token_accuracy": 0.7401333570480346, "num_tokens": 18574821.0, "step": 2270 }, { "entropy": 1.0812392115592957, "epoch": 0.5457156534226902, "grad_norm": 0.8480959534645081, "learning_rate": 1.6363491303654063e-05, "loss": 1.0826, "mean_token_accuracy": 0.7413488388061523, "num_tokens": 18653584.0, "step": 2280 }, { "entropy": 1.0245578348636628, "epoch": 0.5481091431306845, "grad_norm": 0.5554677844047546, "learning_rate": 1.6347534705600768e-05, "loss": 1.0256, "mean_token_accuracy": 0.7527715682983398, "num_tokens": 18733982.0, "step": 2290 }, { "entropy": 1.1428353428840636, "epoch": 0.5505026328386788, "grad_norm": 0.5947005152702332, "learning_rate": 1.6331578107547473e-05, "loss": 1.1498, "mean_token_accuracy": 0.7300264656543731, "num_tokens": 18822343.0, "step": 2300 }, { "entropy": 1.084150779247284, "epoch": 0.5528961225466731, "grad_norm": 0.6712626218795776, "learning_rate": 1.6315621509494178e-05, "loss": 1.0906, "mean_token_accuracy": 0.7372301578521728, "num_tokens": 18909625.0, "step": 2310 }, { "entropy": 1.0455949902534485, "epoch": 0.5552896122546673, "grad_norm": 0.7032175064086914, "learning_rate": 1.6299664911440883e-05, "loss": 1.0544, "mean_token_accuracy": 0.7434102296829224, "num_tokens": 18990307.0, "step": 2320 }, { "entropy": 1.1317045211791992, "epoch": 0.5576831019626616, "grad_norm": 0.7299635410308838, "learning_rate": 1.6283708313387587e-05, "loss": 1.1315, "mean_token_accuracy": 0.7348020315170288, "num_tokens": 19065995.0, "step": 2330 }, { "entropy": 1.0656555056571961, "epoch": 0.5600765916706558, "grad_norm": 0.8328961730003357, "learning_rate": 1.6267751715334292e-05, "loss": 1.0798, "mean_token_accuracy": 0.7406236708164216, "num_tokens": 19147268.0, "step": 2340 }, { "entropy": 1.0884394943714142, "epoch": 0.5624700813786501, "grad_norm": 1.196860909461975, "learning_rate": 1.6251795117280997e-05, "loss": 1.0987, "mean_token_accuracy": 0.7410864651203155, "num_tokens": 19232016.0, "step": 2350 }, { "entropy": 1.1457077085971832, "epoch": 0.5648635710866443, "grad_norm": 0.5326634645462036, "learning_rate": 1.6235838519227702e-05, "loss": 1.1475, "mean_token_accuracy": 0.7297524213790894, "num_tokens": 19316268.0, "step": 2360 }, { "entropy": 1.0890101790428162, "epoch": 0.5672570607946386, "grad_norm": 0.7511252760887146, "learning_rate": 1.6219881921174407e-05, "loss": 1.1012, "mean_token_accuracy": 0.7405222654342651, "num_tokens": 19398123.0, "step": 2370 }, { "entropy": 1.013045358657837, "epoch": 0.5696505505026328, "grad_norm": 0.6571887135505676, "learning_rate": 1.6203925323121112e-05, "loss": 1.019, "mean_token_accuracy": 0.7532030701637268, "num_tokens": 19478937.0, "step": 2380 }, { "entropy": 1.0578601121902467, "epoch": 0.572044040210627, "grad_norm": 0.7799140214920044, "learning_rate": 1.6187968725067817e-05, "loss": 1.0626, "mean_token_accuracy": 0.747768622636795, "num_tokens": 19564031.0, "step": 2390 }, { "entropy": 1.0582027733325958, "epoch": 0.5744375299186214, "grad_norm": 0.9500547051429749, "learning_rate": 1.617201212701452e-05, "loss": 1.048, "mean_token_accuracy": 0.7498915076255799, "num_tokens": 19638358.0, "step": 2400 }, { "entropy": 1.0389926135540009, "epoch": 0.5768310196266156, "grad_norm": 0.650881826877594, "learning_rate": 1.6156055528961226e-05, "loss": 1.0605, "mean_token_accuracy": 0.7405982375144958, "num_tokens": 19717962.0, "step": 2410 }, { "entropy": 0.9749106526374817, "epoch": 0.5792245093346099, "grad_norm": 0.69362872838974, "learning_rate": 1.614009893090793e-05, "loss": 0.9837, "mean_token_accuracy": 0.7568762242794037, "num_tokens": 19801772.0, "step": 2420 }, { "entropy": 1.0389947533607482, "epoch": 0.5816179990426041, "grad_norm": 0.8371346592903137, "learning_rate": 1.6124142332854636e-05, "loss": 1.0396, "mean_token_accuracy": 0.7515539228916168, "num_tokens": 19880716.0, "step": 2430 }, { "entropy": 1.0958311080932617, "epoch": 0.5840114887505984, "grad_norm": 0.7574942111968994, "learning_rate": 1.610818573480134e-05, "loss": 1.1041, "mean_token_accuracy": 0.7367929995059967, "num_tokens": 19958372.0, "step": 2440 }, { "entropy": 1.0276429772377014, "epoch": 0.5864049784585926, "grad_norm": 0.6537715792655945, "learning_rate": 1.609222913674805e-05, "loss": 1.0355, "mean_token_accuracy": 0.7487654328346253, "num_tokens": 20038953.0, "step": 2450 }, { "entropy": 1.050876259803772, "epoch": 0.5887984681665869, "grad_norm": 0.6600715517997742, "learning_rate": 1.6076272538694754e-05, "loss": 1.0614, "mean_token_accuracy": 0.7478480696678161, "num_tokens": 20121410.0, "step": 2460 }, { "entropy": 1.0625569701194764, "epoch": 0.5911919578745811, "grad_norm": 0.7250789403915405, "learning_rate": 1.6060315940641456e-05, "loss": 1.0555, "mean_token_accuracy": 0.7494634866714478, "num_tokens": 20201415.0, "step": 2470 }, { "entropy": 1.006362384557724, "epoch": 0.5935854475825754, "grad_norm": 0.8562338352203369, "learning_rate": 1.604435934258816e-05, "loss": 1.0178, "mean_token_accuracy": 0.7520220935344696, "num_tokens": 20283377.0, "step": 2480 }, { "entropy": 1.0587669372558595, "epoch": 0.5959789372905696, "grad_norm": 1.034611701965332, "learning_rate": 1.6028402744534865e-05, "loss": 1.0628, "mean_token_accuracy": 0.7472517371177674, "num_tokens": 20370012.0, "step": 2490 }, { "entropy": 1.0843224465847014, "epoch": 0.5983724269985639, "grad_norm": 2.8688549995422363, "learning_rate": 1.601244614648157e-05, "loss": 1.0896, "mean_token_accuracy": 0.737509822845459, "num_tokens": 20448279.0, "step": 2500 } ], "logging_steps": 10, "max_steps": 12534, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.570634216601551e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }