{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 820, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.8716129064559937, "epoch": 0.0024390243902439024, "grad_norm": 2.1505093574523926, "learning_rate": 0.0, "loss": 2.6919, "mean_token_accuracy": 0.5286247730255127, "num_tokens": 12872.0, "step": 1 }, { "entropy": 0.8612800240516663, "epoch": 0.004878048780487805, "grad_norm": 2.0426065921783447, "learning_rate": 1.2195121951219514e-07, "loss": 2.6919, "mean_token_accuracy": 0.5243263244628906, "num_tokens": 26248.0, "step": 2 }, { "entropy": 0.8617479801177979, "epoch": 0.007317073170731708, "grad_norm": 1.9424431324005127, "learning_rate": 2.439024390243903e-07, "loss": 2.639, "mean_token_accuracy": 0.5316513180732727, "num_tokens": 39502.0, "step": 3 }, { "entropy": 0.8756797909736633, "epoch": 0.00975609756097561, "grad_norm": 2.1382882595062256, "learning_rate": 3.6585365853658536e-07, "loss": 2.7627, "mean_token_accuracy": 0.5206302404403687, "num_tokens": 52339.0, "step": 4 }, { "entropy": 0.8642444610595703, "epoch": 0.012195121951219513, "grad_norm": 2.020120143890381, "learning_rate": 4.878048780487805e-07, "loss": 2.718, "mean_token_accuracy": 0.5269583463668823, "num_tokens": 65542.0, "step": 5 }, { "entropy": 0.8727173805236816, "epoch": 0.014634146341463415, "grad_norm": 2.0316474437713623, "learning_rate": 6.097560975609757e-07, "loss": 2.6628, "mean_token_accuracy": 0.527190089225769, "num_tokens": 78982.0, "step": 6 }, { "entropy": 0.8731244206428528, "epoch": 0.01707317073170732, "grad_norm": 2.113321304321289, "learning_rate": 7.317073170731707e-07, "loss": 2.6782, "mean_token_accuracy": 0.52106773853302, "num_tokens": 91885.0, "step": 7 }, { "entropy": 0.8809671401977539, "epoch": 0.01951219512195122, "grad_norm": 1.8974612951278687, "learning_rate": 8.53658536585366e-07, "loss": 2.6159, "mean_token_accuracy": 0.5320430994033813, "num_tokens": 105180.0, "step": 8 }, { "entropy": 0.8630732297897339, "epoch": 0.02195121951219512, "grad_norm": 2.0424561500549316, "learning_rate": 9.75609756097561e-07, "loss": 2.5871, "mean_token_accuracy": 0.5326229929924011, "num_tokens": 118898.0, "step": 9 }, { "entropy": 0.8593544363975525, "epoch": 0.024390243902439025, "grad_norm": 1.9281632900238037, "learning_rate": 1.0975609756097562e-06, "loss": 2.5685, "mean_token_accuracy": 0.5355057120323181, "num_tokens": 132785.0, "step": 10 }, { "entropy": 0.8840179443359375, "epoch": 0.026829268292682926, "grad_norm": 1.9911386966705322, "learning_rate": 1.2195121951219514e-06, "loss": 2.6835, "mean_token_accuracy": 0.5258385539054871, "num_tokens": 146366.0, "step": 11 }, { "entropy": 0.8695968389511108, "epoch": 0.02926829268292683, "grad_norm": 1.922995924949646, "learning_rate": 1.3414634146341465e-06, "loss": 2.6168, "mean_token_accuracy": 0.5292648077011108, "num_tokens": 159589.0, "step": 12 }, { "entropy": 0.8798849582672119, "epoch": 0.03170731707317073, "grad_norm": 1.9930217266082764, "learning_rate": 1.4634146341463414e-06, "loss": 2.6339, "mean_token_accuracy": 0.5334321856498718, "num_tokens": 172422.0, "step": 13 }, { "entropy": 0.8729078769683838, "epoch": 0.03414634146341464, "grad_norm": 1.8291631937026978, "learning_rate": 1.5853658536585368e-06, "loss": 2.6239, "mean_token_accuracy": 0.53228360414505, "num_tokens": 185711.0, "step": 14 }, { "entropy": 0.8857439160346985, "epoch": 0.036585365853658534, "grad_norm": 1.8444254398345947, "learning_rate": 1.707317073170732e-06, "loss": 2.6283, "mean_token_accuracy": 0.5282639265060425, "num_tokens": 199154.0, "step": 15 }, { "entropy": 0.8875442743301392, "epoch": 0.03902439024390244, "grad_norm": 1.9070334434509277, "learning_rate": 1.8292682926829268e-06, "loss": 2.6719, "mean_token_accuracy": 0.5216583013534546, "num_tokens": 212075.0, "step": 16 }, { "entropy": 0.8761826753616333, "epoch": 0.041463414634146344, "grad_norm": 1.828985571861267, "learning_rate": 1.951219512195122e-06, "loss": 2.6031, "mean_token_accuracy": 0.5246410965919495, "num_tokens": 225605.0, "step": 17 }, { "entropy": 0.8728659749031067, "epoch": 0.04390243902439024, "grad_norm": 1.8210647106170654, "learning_rate": 2.073170731707317e-06, "loss": 2.4953, "mean_token_accuracy": 0.5386132597923279, "num_tokens": 239308.0, "step": 18 }, { "entropy": 0.8789602518081665, "epoch": 0.046341463414634146, "grad_norm": 1.940412163734436, "learning_rate": 2.1951219512195125e-06, "loss": 2.6284, "mean_token_accuracy": 0.5310542583465576, "num_tokens": 252575.0, "step": 19 }, { "entropy": 0.875320315361023, "epoch": 0.04878048780487805, "grad_norm": 1.8743823766708374, "learning_rate": 2.317073170731708e-06, "loss": 2.5582, "mean_token_accuracy": 0.5299984812736511, "num_tokens": 265825.0, "step": 20 }, { "entropy": 0.8594653606414795, "epoch": 0.05121951219512195, "grad_norm": 1.8117427825927734, "learning_rate": 2.4390243902439027e-06, "loss": 2.5562, "mean_token_accuracy": 0.5371906757354736, "num_tokens": 279218.0, "step": 21 }, { "entropy": 0.8692665696144104, "epoch": 0.05365853658536585, "grad_norm": 1.8945330381393433, "learning_rate": 2.5609756097560977e-06, "loss": 2.558, "mean_token_accuracy": 0.5370146632194519, "num_tokens": 292472.0, "step": 22 }, { "entropy": 0.8777738809585571, "epoch": 0.05609756097560976, "grad_norm": 1.7756246328353882, "learning_rate": 2.682926829268293e-06, "loss": 2.5399, "mean_token_accuracy": 0.5344337224960327, "num_tokens": 306544.0, "step": 23 }, { "entropy": 0.8751537799835205, "epoch": 0.05853658536585366, "grad_norm": 1.8381223678588867, "learning_rate": 2.8048780487804884e-06, "loss": 2.5104, "mean_token_accuracy": 0.5305012464523315, "num_tokens": 320166.0, "step": 24 }, { "entropy": 0.8838329315185547, "epoch": 0.06097560975609756, "grad_norm": 1.9993051290512085, "learning_rate": 2.926829268292683e-06, "loss": 2.5373, "mean_token_accuracy": 0.5335705280303955, "num_tokens": 333393.0, "step": 25 }, { "entropy": 0.8722259998321533, "epoch": 0.06341463414634146, "grad_norm": 1.7992353439331055, "learning_rate": 3.0487804878048782e-06, "loss": 2.5252, "mean_token_accuracy": 0.5407407283782959, "num_tokens": 346909.0, "step": 26 }, { "entropy": 0.8720287084579468, "epoch": 0.06585365853658537, "grad_norm": 1.8377394676208496, "learning_rate": 3.1707317073170736e-06, "loss": 2.4664, "mean_token_accuracy": 0.544649600982666, "num_tokens": 360139.0, "step": 27 }, { "entropy": 0.8602600693702698, "epoch": 0.06829268292682927, "grad_norm": 1.7901852130889893, "learning_rate": 3.292682926829269e-06, "loss": 2.4281, "mean_token_accuracy": 0.5409996509552002, "num_tokens": 373460.0, "step": 28 }, { "entropy": 0.8788866996765137, "epoch": 0.07073170731707316, "grad_norm": 1.8166674375534058, "learning_rate": 3.414634146341464e-06, "loss": 2.4646, "mean_token_accuracy": 0.5414108037948608, "num_tokens": 386830.0, "step": 29 }, { "entropy": 0.863952100276947, "epoch": 0.07317073170731707, "grad_norm": 1.743186354637146, "learning_rate": 3.5365853658536588e-06, "loss": 2.4102, "mean_token_accuracy": 0.5462642908096313, "num_tokens": 400431.0, "step": 30 }, { "entropy": 0.865651547908783, "epoch": 0.07560975609756097, "grad_norm": 1.7701572179794312, "learning_rate": 3.6585365853658537e-06, "loss": 2.4892, "mean_token_accuracy": 0.5413939356803894, "num_tokens": 413432.0, "step": 31 }, { "entropy": 0.8686628341674805, "epoch": 0.07804878048780488, "grad_norm": 1.8279269933700562, "learning_rate": 3.780487804878049e-06, "loss": 2.4728, "mean_token_accuracy": 0.5418347120285034, "num_tokens": 427085.0, "step": 32 }, { "entropy": 0.8562468886375427, "epoch": 0.08048780487804878, "grad_norm": 1.8034300804138184, "learning_rate": 3.902439024390244e-06, "loss": 2.5066, "mean_token_accuracy": 0.5384673476219177, "num_tokens": 440372.0, "step": 33 }, { "entropy": 0.8735157251358032, "epoch": 0.08292682926829269, "grad_norm": 1.7519137859344482, "learning_rate": 4.024390243902439e-06, "loss": 2.3914, "mean_token_accuracy": 0.5398162603378296, "num_tokens": 453448.0, "step": 34 }, { "entropy": 0.8666555881500244, "epoch": 0.08536585365853659, "grad_norm": 1.7969316244125366, "learning_rate": 4.146341463414634e-06, "loss": 2.3763, "mean_token_accuracy": 0.5528104901313782, "num_tokens": 467145.0, "step": 35 }, { "entropy": 0.8785781264305115, "epoch": 0.08780487804878048, "grad_norm": 1.888017177581787, "learning_rate": 4.268292682926829e-06, "loss": 2.4335, "mean_token_accuracy": 0.5460895895957947, "num_tokens": 480331.0, "step": 36 }, { "entropy": 0.8501675724983215, "epoch": 0.09024390243902439, "grad_norm": 1.7441424131393433, "learning_rate": 4.390243902439025e-06, "loss": 2.3185, "mean_token_accuracy": 0.5568350553512573, "num_tokens": 493807.0, "step": 37 }, { "entropy": 0.8716937303543091, "epoch": 0.09268292682926829, "grad_norm": 1.8410546779632568, "learning_rate": 4.51219512195122e-06, "loss": 2.3366, "mean_token_accuracy": 0.5552944540977478, "num_tokens": 507441.0, "step": 38 }, { "entropy": 0.8760689496994019, "epoch": 0.0951219512195122, "grad_norm": 1.8491054773330688, "learning_rate": 4.634146341463416e-06, "loss": 2.3352, "mean_token_accuracy": 0.5513505935668945, "num_tokens": 521303.0, "step": 39 }, { "entropy": 0.8930657505989075, "epoch": 0.0975609756097561, "grad_norm": 1.794344186782837, "learning_rate": 4.75609756097561e-06, "loss": 2.274, "mean_token_accuracy": 0.5474337935447693, "num_tokens": 534685.0, "step": 40 }, { "entropy": 0.8910093903541565, "epoch": 0.1, "grad_norm": 1.7851758003234863, "learning_rate": 4.8780487804878055e-06, "loss": 2.2718, "mean_token_accuracy": 0.5464914441108704, "num_tokens": 547940.0, "step": 41 }, { "entropy": 0.8795550465583801, "epoch": 0.1024390243902439, "grad_norm": 1.6806493997573853, "learning_rate": 5e-06, "loss": 2.1691, "mean_token_accuracy": 0.5671883821487427, "num_tokens": 562140.0, "step": 42 }, { "entropy": 0.8985618352890015, "epoch": 0.1048780487804878, "grad_norm": 1.847882866859436, "learning_rate": 5.121951219512195e-06, "loss": 2.2579, "mean_token_accuracy": 0.5494333505630493, "num_tokens": 575568.0, "step": 43 }, { "entropy": 0.9023619890213013, "epoch": 0.1073170731707317, "grad_norm": 1.875916838645935, "learning_rate": 5.243902439024391e-06, "loss": 2.2653, "mean_token_accuracy": 0.5583165287971497, "num_tokens": 588985.0, "step": 44 }, { "entropy": 0.8863162398338318, "epoch": 0.10975609756097561, "grad_norm": 1.9038965702056885, "learning_rate": 5.365853658536586e-06, "loss": 2.2634, "mean_token_accuracy": 0.5584648847579956, "num_tokens": 602368.0, "step": 45 }, { "entropy": 0.8825463056564331, "epoch": 0.11219512195121951, "grad_norm": 1.9453665018081665, "learning_rate": 5.487804878048781e-06, "loss": 2.1974, "mean_token_accuracy": 0.5623090863227844, "num_tokens": 615480.0, "step": 46 }, { "entropy": 0.9041008353233337, "epoch": 0.11463414634146342, "grad_norm": 1.8884116411209106, "learning_rate": 5.609756097560977e-06, "loss": 2.129, "mean_token_accuracy": 0.5642023086547852, "num_tokens": 628860.0, "step": 47 }, { "entropy": 0.9142757654190063, "epoch": 0.11707317073170732, "grad_norm": 1.8844501972198486, "learning_rate": 5.731707317073171e-06, "loss": 2.1263, "mean_token_accuracy": 0.5588369369506836, "num_tokens": 642014.0, "step": 48 }, { "entropy": 0.9239153861999512, "epoch": 0.11951219512195121, "grad_norm": 1.7458008527755737, "learning_rate": 5.853658536585366e-06, "loss": 2.0406, "mean_token_accuracy": 0.5653674006462097, "num_tokens": 655653.0, "step": 49 }, { "entropy": 0.8941378593444824, "epoch": 0.12195121951219512, "grad_norm": 1.8360707759857178, "learning_rate": 5.9756097560975615e-06, "loss": 2.0686, "mean_token_accuracy": 0.5699096322059631, "num_tokens": 668836.0, "step": 50 }, { "entropy": 0.9041756987571716, "epoch": 0.12439024390243902, "grad_norm": 1.7880253791809082, "learning_rate": 6.0975609756097564e-06, "loss": 2.0037, "mean_token_accuracy": 0.5757826566696167, "num_tokens": 682140.0, "step": 51 }, { "entropy": 0.9205608367919922, "epoch": 0.12682926829268293, "grad_norm": 1.7444533109664917, "learning_rate": 6.219512195121951e-06, "loss": 1.979, "mean_token_accuracy": 0.5779402852058411, "num_tokens": 695692.0, "step": 52 }, { "entropy": 0.9216024875640869, "epoch": 0.12926829268292683, "grad_norm": 1.731343150138855, "learning_rate": 6.341463414634147e-06, "loss": 1.9391, "mean_token_accuracy": 0.5785799026489258, "num_tokens": 709172.0, "step": 53 }, { "entropy": 0.940102756023407, "epoch": 0.13170731707317074, "grad_norm": 1.6420127153396606, "learning_rate": 6.463414634146342e-06, "loss": 1.9096, "mean_token_accuracy": 0.5771420001983643, "num_tokens": 722715.0, "step": 54 }, { "entropy": 0.9335538744926453, "epoch": 0.13414634146341464, "grad_norm": 1.5793882608413696, "learning_rate": 6.585365853658538e-06, "loss": 1.8691, "mean_token_accuracy": 0.5772127509117126, "num_tokens": 736142.0, "step": 55 }, { "entropy": 0.9485749006271362, "epoch": 0.13658536585365855, "grad_norm": 1.5499825477600098, "learning_rate": 6.707317073170733e-06, "loss": 1.8778, "mean_token_accuracy": 0.5797693133354187, "num_tokens": 750117.0, "step": 56 }, { "entropy": 0.9361413717269897, "epoch": 0.13902439024390245, "grad_norm": 1.6096574068069458, "learning_rate": 6.829268292682928e-06, "loss": 1.8691, "mean_token_accuracy": 0.5884116888046265, "num_tokens": 763474.0, "step": 57 }, { "entropy": 0.9481914639472961, "epoch": 0.14146341463414633, "grad_norm": 1.5803636312484741, "learning_rate": 6.951219512195122e-06, "loss": 1.8303, "mean_token_accuracy": 0.5844748616218567, "num_tokens": 776630.0, "step": 58 }, { "entropy": 0.9388015270233154, "epoch": 0.14390243902439023, "grad_norm": 1.3934180736541748, "learning_rate": 7.0731707317073175e-06, "loss": 1.744, "mean_token_accuracy": 0.5921754837036133, "num_tokens": 790142.0, "step": 59 }, { "entropy": 0.9618735313415527, "epoch": 0.14634146341463414, "grad_norm": 1.424424409866333, "learning_rate": 7.1951219512195125e-06, "loss": 1.7299, "mean_token_accuracy": 0.5924223065376282, "num_tokens": 803645.0, "step": 60 }, { "entropy": 0.9727312326431274, "epoch": 0.14878048780487804, "grad_norm": 1.2729369401931763, "learning_rate": 7.317073170731707e-06, "loss": 1.7138, "mean_token_accuracy": 0.600612461566925, "num_tokens": 817049.0, "step": 61 }, { "entropy": 0.9681069254875183, "epoch": 0.15121951219512195, "grad_norm": 1.2588528394699097, "learning_rate": 7.439024390243903e-06, "loss": 1.689, "mean_token_accuracy": 0.6010857820510864, "num_tokens": 830143.0, "step": 62 }, { "entropy": 1.0009177923202515, "epoch": 0.15365853658536585, "grad_norm": 1.2635364532470703, "learning_rate": 7.560975609756098e-06, "loss": 1.6665, "mean_token_accuracy": 0.5937312245368958, "num_tokens": 843495.0, "step": 63 }, { "entropy": 0.9910491704940796, "epoch": 0.15609756097560976, "grad_norm": 1.1177386045455933, "learning_rate": 7.682926829268293e-06, "loss": 1.6223, "mean_token_accuracy": 0.6033629179000854, "num_tokens": 857249.0, "step": 64 }, { "entropy": 1.0137639045715332, "epoch": 0.15853658536585366, "grad_norm": 1.0478475093841553, "learning_rate": 7.804878048780489e-06, "loss": 1.5789, "mean_token_accuracy": 0.6136430501937866, "num_tokens": 870825.0, "step": 65 }, { "entropy": 1.0203578472137451, "epoch": 0.16097560975609757, "grad_norm": 0.9052762389183044, "learning_rate": 7.926829268292685e-06, "loss": 1.5095, "mean_token_accuracy": 0.613807737827301, "num_tokens": 884500.0, "step": 66 }, { "entropy": 1.0393266677856445, "epoch": 0.16341463414634147, "grad_norm": 0.9190409779548645, "learning_rate": 8.048780487804879e-06, "loss": 1.5473, "mean_token_accuracy": 0.6107198596000671, "num_tokens": 898005.0, "step": 67 }, { "entropy": 1.0291173458099365, "epoch": 0.16585365853658537, "grad_norm": 0.83433598279953, "learning_rate": 8.170731707317073e-06, "loss": 1.466, "mean_token_accuracy": 0.624069094657898, "num_tokens": 911449.0, "step": 68 }, { "entropy": 1.0759785175323486, "epoch": 0.16829268292682928, "grad_norm": 0.8013431429862976, "learning_rate": 8.292682926829268e-06, "loss": 1.4757, "mean_token_accuracy": 0.6221522688865662, "num_tokens": 924809.0, "step": 69 }, { "entropy": 1.0588490962982178, "epoch": 0.17073170731707318, "grad_norm": 0.7442017197608948, "learning_rate": 8.414634146341464e-06, "loss": 1.4679, "mean_token_accuracy": 0.6220347881317139, "num_tokens": 938104.0, "step": 70 }, { "entropy": 1.0712034702301025, "epoch": 0.17317073170731706, "grad_norm": 0.6614459156990051, "learning_rate": 8.536585365853658e-06, "loss": 1.4075, "mean_token_accuracy": 0.6332119703292847, "num_tokens": 951850.0, "step": 71 }, { "entropy": 1.088219404220581, "epoch": 0.17560975609756097, "grad_norm": 0.7117521166801453, "learning_rate": 8.658536585365854e-06, "loss": 1.4387, "mean_token_accuracy": 0.6288971304893494, "num_tokens": 965113.0, "step": 72 }, { "entropy": 1.1224637031555176, "epoch": 0.17804878048780487, "grad_norm": 0.5708485245704651, "learning_rate": 8.78048780487805e-06, "loss": 1.3922, "mean_token_accuracy": 0.6311355233192444, "num_tokens": 978779.0, "step": 73 }, { "entropy": 1.1288890838623047, "epoch": 0.18048780487804877, "grad_norm": 0.5456262826919556, "learning_rate": 8.902439024390244e-06, "loss": 1.3848, "mean_token_accuracy": 0.6382190585136414, "num_tokens": 992024.0, "step": 74 }, { "entropy": 1.1250863075256348, "epoch": 0.18292682926829268, "grad_norm": 0.5261056423187256, "learning_rate": 9.02439024390244e-06, "loss": 1.3867, "mean_token_accuracy": 0.6402657628059387, "num_tokens": 1005436.0, "step": 75 }, { "entropy": 1.1720695495605469, "epoch": 0.18536585365853658, "grad_norm": 0.4624958336353302, "learning_rate": 9.146341463414635e-06, "loss": 1.3784, "mean_token_accuracy": 0.636989414691925, "num_tokens": 1018672.0, "step": 76 }, { "entropy": 1.1629294157028198, "epoch": 0.1878048780487805, "grad_norm": 0.46797341108322144, "learning_rate": 9.268292682926831e-06, "loss": 1.355, "mean_token_accuracy": 0.6373533010482788, "num_tokens": 1031640.0, "step": 77 }, { "entropy": 1.1572749614715576, "epoch": 0.1902439024390244, "grad_norm": 0.3808497488498688, "learning_rate": 9.390243902439025e-06, "loss": 1.3303, "mean_token_accuracy": 0.6452391743659973, "num_tokens": 1044910.0, "step": 78 }, { "entropy": 1.1750357151031494, "epoch": 0.1926829268292683, "grad_norm": 0.34629523754119873, "learning_rate": 9.51219512195122e-06, "loss": 1.3324, "mean_token_accuracy": 0.6452615857124329, "num_tokens": 1058116.0, "step": 79 }, { "entropy": 1.1967684030532837, "epoch": 0.1951219512195122, "grad_norm": 0.34349682927131653, "learning_rate": 9.634146341463415e-06, "loss": 1.322, "mean_token_accuracy": 0.6471808552742004, "num_tokens": 1071150.0, "step": 80 }, { "entropy": 1.2120548486709595, "epoch": 0.1975609756097561, "grad_norm": 0.32455945014953613, "learning_rate": 9.756097560975611e-06, "loss": 1.2859, "mean_token_accuracy": 0.657558262348175, "num_tokens": 1084853.0, "step": 81 }, { "entropy": 1.2008144855499268, "epoch": 0.2, "grad_norm": 0.30691349506378174, "learning_rate": 9.878048780487805e-06, "loss": 1.305, "mean_token_accuracy": 0.6493477821350098, "num_tokens": 1098438.0, "step": 82 }, { "entropy": 1.232369065284729, "epoch": 0.20243902439024392, "grad_norm": 0.32630908489227295, "learning_rate": 1e-05, "loss": 1.3101, "mean_token_accuracy": 0.6437846422195435, "num_tokens": 1111623.0, "step": 83 }, { "entropy": 1.2427518367767334, "epoch": 0.2048780487804878, "grad_norm": 0.3173503279685974, "learning_rate": 9.986449864498647e-06, "loss": 1.3054, "mean_token_accuracy": 0.6477247476577759, "num_tokens": 1125066.0, "step": 84 }, { "entropy": 1.1999444961547852, "epoch": 0.2073170731707317, "grad_norm": 0.29154670238494873, "learning_rate": 9.972899728997291e-06, "loss": 1.2631, "mean_token_accuracy": 0.6559225916862488, "num_tokens": 1138826.0, "step": 85 }, { "entropy": 1.2297258377075195, "epoch": 0.2097560975609756, "grad_norm": 0.3280792236328125, "learning_rate": 9.959349593495936e-06, "loss": 1.2839, "mean_token_accuracy": 0.6533303260803223, "num_tokens": 1152114.0, "step": 86 }, { "entropy": 1.2501524686813354, "epoch": 0.2121951219512195, "grad_norm": 0.3305222988128662, "learning_rate": 9.94579945799458e-06, "loss": 1.3045, "mean_token_accuracy": 0.642970085144043, "num_tokens": 1165409.0, "step": 87 }, { "entropy": 1.2506544589996338, "epoch": 0.2146341463414634, "grad_norm": 0.3272988796234131, "learning_rate": 9.932249322493226e-06, "loss": 1.2882, "mean_token_accuracy": 0.6515557169914246, "num_tokens": 1178506.0, "step": 88 }, { "entropy": 1.2083759307861328, "epoch": 0.21707317073170732, "grad_norm": 0.29003989696502686, "learning_rate": 9.91869918699187e-06, "loss": 1.2796, "mean_token_accuracy": 0.6522111296653748, "num_tokens": 1192542.0, "step": 89 }, { "entropy": 1.2205573320388794, "epoch": 0.21951219512195122, "grad_norm": 0.3061564564704895, "learning_rate": 9.905149051490516e-06, "loss": 1.2584, "mean_token_accuracy": 0.6538350582122803, "num_tokens": 1206404.0, "step": 90 }, { "entropy": 1.2132331132888794, "epoch": 0.22195121951219512, "grad_norm": 0.2983347475528717, "learning_rate": 9.89159891598916e-06, "loss": 1.2618, "mean_token_accuracy": 0.6545613408088684, "num_tokens": 1220133.0, "step": 91 }, { "entropy": 1.1786279678344727, "epoch": 0.22439024390243903, "grad_norm": 0.2982328534126282, "learning_rate": 9.878048780487805e-06, "loss": 1.2286, "mean_token_accuracy": 0.6618372201919556, "num_tokens": 1233332.0, "step": 92 }, { "entropy": 1.1757036447525024, "epoch": 0.22682926829268293, "grad_norm": 0.2842158079147339, "learning_rate": 9.864498644986451e-06, "loss": 1.2393, "mean_token_accuracy": 0.6610386967658997, "num_tokens": 1246615.0, "step": 93 }, { "entropy": 1.1978955268859863, "epoch": 0.22926829268292684, "grad_norm": 0.2821376323699951, "learning_rate": 9.850948509485095e-06, "loss": 1.2549, "mean_token_accuracy": 0.6564176082611084, "num_tokens": 1259868.0, "step": 94 }, { "entropy": 1.1675746440887451, "epoch": 0.23170731707317074, "grad_norm": 0.2966885268688202, "learning_rate": 9.837398373983741e-06, "loss": 1.2118, "mean_token_accuracy": 0.6594321131706238, "num_tokens": 1273338.0, "step": 95 }, { "entropy": 1.159611701965332, "epoch": 0.23414634146341465, "grad_norm": 0.2769213914871216, "learning_rate": 9.823848238482386e-06, "loss": 1.2249, "mean_token_accuracy": 0.6568121314048767, "num_tokens": 1286918.0, "step": 96 }, { "entropy": 1.172745943069458, "epoch": 0.23658536585365852, "grad_norm": 0.2758103013038635, "learning_rate": 9.81029810298103e-06, "loss": 1.2585, "mean_token_accuracy": 0.6483401656150818, "num_tokens": 1300339.0, "step": 97 }, { "entropy": 1.170766830444336, "epoch": 0.23902439024390243, "grad_norm": 0.2661439776420593, "learning_rate": 9.796747967479675e-06, "loss": 1.2254, "mean_token_accuracy": 0.6616303324699402, "num_tokens": 1313923.0, "step": 98 }, { "entropy": 1.177963376045227, "epoch": 0.24146341463414633, "grad_norm": 0.26802775263786316, "learning_rate": 9.78319783197832e-06, "loss": 1.2445, "mean_token_accuracy": 0.6533701419830322, "num_tokens": 1327351.0, "step": 99 }, { "entropy": 1.15558922290802, "epoch": 0.24390243902439024, "grad_norm": 0.2651721239089966, "learning_rate": 9.769647696476967e-06, "loss": 1.2158, "mean_token_accuracy": 0.6576597094535828, "num_tokens": 1340468.0, "step": 100 }, { "entropy": 1.1425437927246094, "epoch": 0.24634146341463414, "grad_norm": 0.25243017077445984, "learning_rate": 9.756097560975611e-06, "loss": 1.2187, "mean_token_accuracy": 0.660866916179657, "num_tokens": 1353703.0, "step": 101 }, { "entropy": 1.1315678358078003, "epoch": 0.24878048780487805, "grad_norm": 0.25873032212257385, "learning_rate": 9.742547425474255e-06, "loss": 1.1975, "mean_token_accuracy": 0.6670178174972534, "num_tokens": 1367008.0, "step": 102 }, { "entropy": 1.1415460109710693, "epoch": 0.25121951219512195, "grad_norm": 0.26438820362091064, "learning_rate": 9.7289972899729e-06, "loss": 1.211, "mean_token_accuracy": 0.6611496806144714, "num_tokens": 1380558.0, "step": 103 }, { "entropy": 1.1473474502563477, "epoch": 0.25365853658536586, "grad_norm": 0.2560437023639679, "learning_rate": 9.715447154471546e-06, "loss": 1.2108, "mean_token_accuracy": 0.6570150852203369, "num_tokens": 1394216.0, "step": 104 }, { "entropy": 1.1478271484375, "epoch": 0.25609756097560976, "grad_norm": 0.26183217763900757, "learning_rate": 9.70189701897019e-06, "loss": 1.2186, "mean_token_accuracy": 0.6576521992683411, "num_tokens": 1407470.0, "step": 105 }, { "entropy": 1.1295911073684692, "epoch": 0.25853658536585367, "grad_norm": 0.25204378366470337, "learning_rate": 9.688346883468836e-06, "loss": 1.1837, "mean_token_accuracy": 0.6604463458061218, "num_tokens": 1420883.0, "step": 106 }, { "entropy": 1.125402808189392, "epoch": 0.26097560975609757, "grad_norm": 0.26209568977355957, "learning_rate": 9.67479674796748e-06, "loss": 1.1919, "mean_token_accuracy": 0.662480354309082, "num_tokens": 1434276.0, "step": 107 }, { "entropy": 1.1191213130950928, "epoch": 0.2634146341463415, "grad_norm": 0.2613905668258667, "learning_rate": 9.661246612466125e-06, "loss": 1.1838, "mean_token_accuracy": 0.6658087968826294, "num_tokens": 1447503.0, "step": 108 }, { "entropy": 1.1112308502197266, "epoch": 0.2658536585365854, "grad_norm": 0.25403350591659546, "learning_rate": 9.64769647696477e-06, "loss": 1.1703, "mean_token_accuracy": 0.6672566533088684, "num_tokens": 1461079.0, "step": 109 }, { "entropy": 1.1137951612472534, "epoch": 0.2682926829268293, "grad_norm": 0.26483258605003357, "learning_rate": 9.634146341463415e-06, "loss": 1.1691, "mean_token_accuracy": 0.6706117391586304, "num_tokens": 1474614.0, "step": 110 }, { "entropy": 1.0933289527893066, "epoch": 0.2707317073170732, "grad_norm": 0.2698538601398468, "learning_rate": 9.620596205962061e-06, "loss": 1.1605, "mean_token_accuracy": 0.6701310276985168, "num_tokens": 1487908.0, "step": 111 }, { "entropy": 1.1143202781677246, "epoch": 0.2731707317073171, "grad_norm": 0.2627071142196655, "learning_rate": 9.607046070460706e-06, "loss": 1.1438, "mean_token_accuracy": 0.6680628061294556, "num_tokens": 1501294.0, "step": 112 }, { "entropy": 1.127140760421753, "epoch": 0.275609756097561, "grad_norm": 0.273106187582016, "learning_rate": 9.59349593495935e-06, "loss": 1.1985, "mean_token_accuracy": 0.6580502390861511, "num_tokens": 1514850.0, "step": 113 }, { "entropy": 1.0913937091827393, "epoch": 0.2780487804878049, "grad_norm": 0.2593974769115448, "learning_rate": 9.579945799457996e-06, "loss": 1.1618, "mean_token_accuracy": 0.6630794405937195, "num_tokens": 1528154.0, "step": 114 }, { "entropy": 1.1081091165542603, "epoch": 0.2804878048780488, "grad_norm": 0.2798754870891571, "learning_rate": 9.56639566395664e-06, "loss": 1.1377, "mean_token_accuracy": 0.6722344756126404, "num_tokens": 1540862.0, "step": 115 }, { "entropy": 1.1191236972808838, "epoch": 0.28292682926829266, "grad_norm": 0.2535606920719147, "learning_rate": 9.552845528455286e-06, "loss": 1.1376, "mean_token_accuracy": 0.6760023832321167, "num_tokens": 1554196.0, "step": 116 }, { "entropy": 1.1165391206741333, "epoch": 0.28536585365853656, "grad_norm": 0.25735312700271606, "learning_rate": 9.53929539295393e-06, "loss": 1.1408, "mean_token_accuracy": 0.6719987392425537, "num_tokens": 1567090.0, "step": 117 }, { "entropy": 1.106642484664917, "epoch": 0.28780487804878047, "grad_norm": 0.2398259937763214, "learning_rate": 9.525745257452575e-06, "loss": 1.145, "mean_token_accuracy": 0.6701483726501465, "num_tokens": 1580318.0, "step": 118 }, { "entropy": 1.0864262580871582, "epoch": 0.29024390243902437, "grad_norm": 0.2223978489637375, "learning_rate": 9.51219512195122e-06, "loss": 1.1119, "mean_token_accuracy": 0.6760355234146118, "num_tokens": 1593854.0, "step": 119 }, { "entropy": 1.094162940979004, "epoch": 0.2926829268292683, "grad_norm": 0.23250681161880493, "learning_rate": 9.498644986449865e-06, "loss": 1.1139, "mean_token_accuracy": 0.6825433373451233, "num_tokens": 1606908.0, "step": 120 }, { "entropy": 1.0955393314361572, "epoch": 0.2951219512195122, "grad_norm": 0.21376796066761017, "learning_rate": 9.485094850948512e-06, "loss": 1.108, "mean_token_accuracy": 0.6783738136291504, "num_tokens": 1620477.0, "step": 121 }, { "entropy": 1.1169179677963257, "epoch": 0.2975609756097561, "grad_norm": 0.2168598771095276, "learning_rate": 9.471544715447156e-06, "loss": 1.1403, "mean_token_accuracy": 0.6717775464057922, "num_tokens": 1633798.0, "step": 122 }, { "entropy": 1.1065254211425781, "epoch": 0.3, "grad_norm": 0.20749054849147797, "learning_rate": 9.4579945799458e-06, "loss": 1.1324, "mean_token_accuracy": 0.6725362539291382, "num_tokens": 1647614.0, "step": 123 }, { "entropy": 1.0934035778045654, "epoch": 0.3024390243902439, "grad_norm": 0.2093004733324051, "learning_rate": 9.444444444444445e-06, "loss": 1.1156, "mean_token_accuracy": 0.6740745902061462, "num_tokens": 1661354.0, "step": 124 }, { "entropy": 1.1130709648132324, "epoch": 0.3048780487804878, "grad_norm": 0.2131703943014145, "learning_rate": 9.43089430894309e-06, "loss": 1.1447, "mean_token_accuracy": 0.669326901435852, "num_tokens": 1674652.0, "step": 125 }, { "entropy": 1.080055594444275, "epoch": 0.3073170731707317, "grad_norm": 0.20652315020561218, "learning_rate": 9.417344173441735e-06, "loss": 1.105, "mean_token_accuracy": 0.6778402924537659, "num_tokens": 1688003.0, "step": 126 }, { "entropy": 1.0850718021392822, "epoch": 0.3097560975609756, "grad_norm": 0.19275838136672974, "learning_rate": 9.403794037940381e-06, "loss": 1.1143, "mean_token_accuracy": 0.6753328442573547, "num_tokens": 1702289.0, "step": 127 }, { "entropy": 1.0820226669311523, "epoch": 0.3121951219512195, "grad_norm": 0.21166393160820007, "learning_rate": 9.390243902439025e-06, "loss": 1.1253, "mean_token_accuracy": 0.6773277521133423, "num_tokens": 1715687.0, "step": 128 }, { "entropy": 1.0830371379852295, "epoch": 0.3146341463414634, "grad_norm": 0.21370024979114532, "learning_rate": 9.37669376693767e-06, "loss": 1.1021, "mean_token_accuracy": 0.6788139343261719, "num_tokens": 1728957.0, "step": 129 }, { "entropy": 1.0973628759384155, "epoch": 0.3170731707317073, "grad_norm": 0.21937358379364014, "learning_rate": 9.363143631436316e-06, "loss": 1.1162, "mean_token_accuracy": 0.6790520548820496, "num_tokens": 1742349.0, "step": 130 }, { "entropy": 1.0636382102966309, "epoch": 0.3195121951219512, "grad_norm": 0.21198157966136932, "learning_rate": 9.34959349593496e-06, "loss": 1.0773, "mean_token_accuracy": 0.6862117648124695, "num_tokens": 1755804.0, "step": 131 }, { "entropy": 1.0731333494186401, "epoch": 0.32195121951219513, "grad_norm": 0.2029760479927063, "learning_rate": 9.336043360433606e-06, "loss": 1.0861, "mean_token_accuracy": 0.6837157011032104, "num_tokens": 1769115.0, "step": 132 }, { "entropy": 1.0707873106002808, "epoch": 0.32439024390243903, "grad_norm": 0.20230601727962494, "learning_rate": 9.32249322493225e-06, "loss": 1.0817, "mean_token_accuracy": 0.6842864751815796, "num_tokens": 1782298.0, "step": 133 }, { "entropy": 1.0774948596954346, "epoch": 0.32682926829268294, "grad_norm": 0.20387127995491028, "learning_rate": 9.308943089430895e-06, "loss": 1.086, "mean_token_accuracy": 0.6792807579040527, "num_tokens": 1795606.0, "step": 134 }, { "entropy": 1.0700063705444336, "epoch": 0.32926829268292684, "grad_norm": 0.20648805797100067, "learning_rate": 9.29539295392954e-06, "loss": 1.0602, "mean_token_accuracy": 0.6847176551818848, "num_tokens": 1809010.0, "step": 135 }, { "entropy": 1.0678541660308838, "epoch": 0.33170731707317075, "grad_norm": 0.20196370780467987, "learning_rate": 9.281842818428185e-06, "loss": 1.0767, "mean_token_accuracy": 0.6867226362228394, "num_tokens": 1822372.0, "step": 136 }, { "entropy": 1.0628666877746582, "epoch": 0.33414634146341465, "grad_norm": 0.1941923052072525, "learning_rate": 9.268292682926831e-06, "loss": 1.0941, "mean_token_accuracy": 0.6836166381835938, "num_tokens": 1835859.0, "step": 137 }, { "entropy": 1.0489256381988525, "epoch": 0.33658536585365856, "grad_norm": 0.19842347502708435, "learning_rate": 9.254742547425476e-06, "loss": 1.0761, "mean_token_accuracy": 0.6827327013015747, "num_tokens": 1849444.0, "step": 138 }, { "entropy": 1.0854852199554443, "epoch": 0.33902439024390246, "grad_norm": 0.19903236627578735, "learning_rate": 9.24119241192412e-06, "loss": 1.0873, "mean_token_accuracy": 0.6775000095367432, "num_tokens": 1863460.0, "step": 139 }, { "entropy": 1.0722227096557617, "epoch": 0.34146341463414637, "grad_norm": 0.19855357706546783, "learning_rate": 9.227642276422764e-06, "loss": 1.0847, "mean_token_accuracy": 0.6859818696975708, "num_tokens": 1877144.0, "step": 140 }, { "entropy": 1.0752365589141846, "epoch": 0.3439024390243902, "grad_norm": 0.19797125458717346, "learning_rate": 9.21409214092141e-06, "loss": 1.099, "mean_token_accuracy": 0.6804720163345337, "num_tokens": 1890295.0, "step": 141 }, { "entropy": 1.0549845695495605, "epoch": 0.3463414634146341, "grad_norm": 0.18283385038375854, "learning_rate": 9.200542005420055e-06, "loss": 1.0662, "mean_token_accuracy": 0.6898062825202942, "num_tokens": 1903319.0, "step": 142 }, { "entropy": 1.0448575019836426, "epoch": 0.348780487804878, "grad_norm": 0.17837047576904297, "learning_rate": 9.1869918699187e-06, "loss": 1.0748, "mean_token_accuracy": 0.6830585598945618, "num_tokens": 1917224.0, "step": 143 }, { "entropy": 1.0477330684661865, "epoch": 0.35121951219512193, "grad_norm": 0.18431058526039124, "learning_rate": 9.173441734417345e-06, "loss": 1.057, "mean_token_accuracy": 0.6876409649848938, "num_tokens": 1930542.0, "step": 144 }, { "entropy": 1.0347704887390137, "epoch": 0.35365853658536583, "grad_norm": 0.18002833425998688, "learning_rate": 9.15989159891599e-06, "loss": 1.062, "mean_token_accuracy": 0.6917096376419067, "num_tokens": 1943935.0, "step": 145 }, { "entropy": 1.0429667234420776, "epoch": 0.35609756097560974, "grad_norm": 0.1801144927740097, "learning_rate": 9.146341463414635e-06, "loss": 1.0623, "mean_token_accuracy": 0.6872867941856384, "num_tokens": 1957142.0, "step": 146 }, { "entropy": 1.0446667671203613, "epoch": 0.35853658536585364, "grad_norm": 0.18068258464336395, "learning_rate": 9.13279132791328e-06, "loss": 1.0737, "mean_token_accuracy": 0.6836559176445007, "num_tokens": 1970539.0, "step": 147 }, { "entropy": 1.0441868305206299, "epoch": 0.36097560975609755, "grad_norm": 0.17684251070022583, "learning_rate": 9.119241192411926e-06, "loss": 1.0487, "mean_token_accuracy": 0.6862218379974365, "num_tokens": 1983953.0, "step": 148 }, { "entropy": 1.037201166152954, "epoch": 0.36341463414634145, "grad_norm": 0.170819953083992, "learning_rate": 9.10569105691057e-06, "loss": 1.0587, "mean_token_accuracy": 0.6860895156860352, "num_tokens": 1997218.0, "step": 149 }, { "entropy": 1.0491631031036377, "epoch": 0.36585365853658536, "grad_norm": 0.18243585526943207, "learning_rate": 9.092140921409215e-06, "loss": 1.0699, "mean_token_accuracy": 0.6834457516670227, "num_tokens": 2010723.0, "step": 150 }, { "entropy": 1.029181957244873, "epoch": 0.36829268292682926, "grad_norm": 0.18266521394252777, "learning_rate": 9.07859078590786e-06, "loss": 1.0574, "mean_token_accuracy": 0.6896981000900269, "num_tokens": 2024387.0, "step": 151 }, { "entropy": 1.0140658617019653, "epoch": 0.37073170731707317, "grad_norm": 0.17179487645626068, "learning_rate": 9.065040650406505e-06, "loss": 1.0406, "mean_token_accuracy": 0.6913700103759766, "num_tokens": 2037775.0, "step": 152 }, { "entropy": 1.0303168296813965, "epoch": 0.37317073170731707, "grad_norm": 0.1785237044095993, "learning_rate": 9.051490514905151e-06, "loss": 1.0363, "mean_token_accuracy": 0.6900920867919922, "num_tokens": 2051366.0, "step": 153 }, { "entropy": 1.019331693649292, "epoch": 0.375609756097561, "grad_norm": 0.17573611438274384, "learning_rate": 9.037940379403795e-06, "loss": 1.0413, "mean_token_accuracy": 0.6888290047645569, "num_tokens": 2064738.0, "step": 154 }, { "entropy": 1.041901707649231, "epoch": 0.3780487804878049, "grad_norm": 0.17206346988677979, "learning_rate": 9.02439024390244e-06, "loss": 1.0615, "mean_token_accuracy": 0.6894234418869019, "num_tokens": 2077849.0, "step": 155 }, { "entropy": 1.0418643951416016, "epoch": 0.3804878048780488, "grad_norm": 0.17650866508483887, "learning_rate": 9.010840108401084e-06, "loss": 1.0688, "mean_token_accuracy": 0.6822457313537598, "num_tokens": 2091366.0, "step": 156 }, { "entropy": 1.0257384777069092, "epoch": 0.3829268292682927, "grad_norm": 0.17796455323696136, "learning_rate": 8.99728997289973e-06, "loss": 1.0436, "mean_token_accuracy": 0.6862221956253052, "num_tokens": 2104882.0, "step": 157 }, { "entropy": 1.0320515632629395, "epoch": 0.3853658536585366, "grad_norm": 0.17598049342632294, "learning_rate": 8.983739837398374e-06, "loss": 1.0419, "mean_token_accuracy": 0.6948973536491394, "num_tokens": 2118146.0, "step": 158 }, { "entropy": 1.019339919090271, "epoch": 0.3878048780487805, "grad_norm": 0.19084501266479492, "learning_rate": 8.970189701897019e-06, "loss": 1.0391, "mean_token_accuracy": 0.6915437579154968, "num_tokens": 2131454.0, "step": 159 }, { "entropy": 1.0261130332946777, "epoch": 0.3902439024390244, "grad_norm": 0.17102600634098053, "learning_rate": 8.956639566395665e-06, "loss": 1.025, "mean_token_accuracy": 0.6942394971847534, "num_tokens": 2144889.0, "step": 160 }, { "entropy": 1.0434393882751465, "epoch": 0.3926829268292683, "grad_norm": 0.17654499411582947, "learning_rate": 8.94308943089431e-06, "loss": 1.0519, "mean_token_accuracy": 0.6885669827461243, "num_tokens": 2158436.0, "step": 161 }, { "entropy": 1.0071184635162354, "epoch": 0.3951219512195122, "grad_norm": 0.17178241908550262, "learning_rate": 8.929539295392955e-06, "loss": 1.0156, "mean_token_accuracy": 0.693914532661438, "num_tokens": 2172239.0, "step": 162 }, { "entropy": 1.0304242372512817, "epoch": 0.3975609756097561, "grad_norm": 0.16800439357757568, "learning_rate": 8.9159891598916e-06, "loss": 1.0366, "mean_token_accuracy": 0.6918449997901917, "num_tokens": 2185388.0, "step": 163 }, { "entropy": 1.0210349559783936, "epoch": 0.4, "grad_norm": 0.1748812049627304, "learning_rate": 8.902439024390244e-06, "loss": 1.0313, "mean_token_accuracy": 0.6942216753959656, "num_tokens": 2198747.0, "step": 164 }, { "entropy": 1.0305485725402832, "epoch": 0.4024390243902439, "grad_norm": 0.17672093212604523, "learning_rate": 8.888888888888888e-06, "loss": 1.0314, "mean_token_accuracy": 0.6892403364181519, "num_tokens": 2212230.0, "step": 165 }, { "entropy": 1.0268189907073975, "epoch": 0.40487804878048783, "grad_norm": 0.16995690762996674, "learning_rate": 8.875338753387534e-06, "loss": 1.0279, "mean_token_accuracy": 0.6927863359451294, "num_tokens": 2225263.0, "step": 166 }, { "entropy": 1.0141714811325073, "epoch": 0.4073170731707317, "grad_norm": 0.1733706146478653, "learning_rate": 8.86178861788618e-06, "loss": 1.0209, "mean_token_accuracy": 0.6984298825263977, "num_tokens": 2238208.0, "step": 167 }, { "entropy": 1.015406608581543, "epoch": 0.4097560975609756, "grad_norm": 0.175829216837883, "learning_rate": 8.848238482384825e-06, "loss": 1.0377, "mean_token_accuracy": 0.6940392255783081, "num_tokens": 2250974.0, "step": 168 }, { "entropy": 1.0115768909454346, "epoch": 0.4121951219512195, "grad_norm": 0.16748936474323273, "learning_rate": 8.834688346883469e-06, "loss": 1.027, "mean_token_accuracy": 0.6916769742965698, "num_tokens": 2264771.0, "step": 169 }, { "entropy": 1.003655195236206, "epoch": 0.4146341463414634, "grad_norm": 0.16363762319087982, "learning_rate": 8.821138211382113e-06, "loss": 0.9975, "mean_token_accuracy": 0.6990435123443604, "num_tokens": 2278274.0, "step": 170 }, { "entropy": 1.0265607833862305, "epoch": 0.4170731707317073, "grad_norm": 0.1725579798221588, "learning_rate": 8.80758807588076e-06, "loss": 1.0406, "mean_token_accuracy": 0.6887966990470886, "num_tokens": 2291786.0, "step": 171 }, { "entropy": 1.0243334770202637, "epoch": 0.4195121951219512, "grad_norm": 0.17333285510540009, "learning_rate": 8.794037940379404e-06, "loss": 1.0251, "mean_token_accuracy": 0.6909435987472534, "num_tokens": 2305505.0, "step": 172 }, { "entropy": 1.0068650245666504, "epoch": 0.4219512195121951, "grad_norm": 0.17407289147377014, "learning_rate": 8.78048780487805e-06, "loss": 0.9931, "mean_token_accuracy": 0.6996558904647827, "num_tokens": 2318889.0, "step": 173 }, { "entropy": 1.0199451446533203, "epoch": 0.424390243902439, "grad_norm": 0.17032553255558014, "learning_rate": 8.766937669376694e-06, "loss": 1.0338, "mean_token_accuracy": 0.6946343779563904, "num_tokens": 2332361.0, "step": 174 }, { "entropy": 1.0083736181259155, "epoch": 0.4268292682926829, "grad_norm": 0.17206445336341858, "learning_rate": 8.753387533875339e-06, "loss": 1.0215, "mean_token_accuracy": 0.6917036771774292, "num_tokens": 2345877.0, "step": 175 }, { "entropy": 1.0085593461990356, "epoch": 0.4292682926829268, "grad_norm": 0.1674298793077469, "learning_rate": 8.739837398373985e-06, "loss": 1.0097, "mean_token_accuracy": 0.6976450681686401, "num_tokens": 2359354.0, "step": 176 }, { "entropy": 1.0162107944488525, "epoch": 0.4317073170731707, "grad_norm": 0.1732998937368393, "learning_rate": 8.726287262872629e-06, "loss": 1.0413, "mean_token_accuracy": 0.688483476638794, "num_tokens": 2372525.0, "step": 177 }, { "entropy": 1.0145041942596436, "epoch": 0.43414634146341463, "grad_norm": 0.16612009704113007, "learning_rate": 8.712737127371275e-06, "loss": 1.0258, "mean_token_accuracy": 0.6966949105262756, "num_tokens": 2386217.0, "step": 178 }, { "entropy": 1.0364079475402832, "epoch": 0.43658536585365854, "grad_norm": 0.16687557101249695, "learning_rate": 8.69918699186992e-06, "loss": 1.0329, "mean_token_accuracy": 0.689834475517273, "num_tokens": 2399887.0, "step": 179 }, { "entropy": 1.000331163406372, "epoch": 0.43902439024390244, "grad_norm": 0.17682859301567078, "learning_rate": 8.685636856368564e-06, "loss": 1.0069, "mean_token_accuracy": 0.6982501745223999, "num_tokens": 2412990.0, "step": 180 }, { "entropy": 1.0094903707504272, "epoch": 0.44146341463414634, "grad_norm": 0.17109999060630798, "learning_rate": 8.67208672086721e-06, "loss": 0.9865, "mean_token_accuracy": 0.7004877924919128, "num_tokens": 2426331.0, "step": 181 }, { "entropy": 1.001022219657898, "epoch": 0.44390243902439025, "grad_norm": 0.17116393148899078, "learning_rate": 8.658536585365854e-06, "loss": 1.0041, "mean_token_accuracy": 0.6996858716011047, "num_tokens": 2439400.0, "step": 182 }, { "entropy": 1.0060547590255737, "epoch": 0.44634146341463415, "grad_norm": 0.17257100343704224, "learning_rate": 8.6449864498645e-06, "loss": 1.0233, "mean_token_accuracy": 0.6987658143043518, "num_tokens": 2452542.0, "step": 183 }, { "entropy": 0.9930256605148315, "epoch": 0.44878048780487806, "grad_norm": 0.16270838677883148, "learning_rate": 8.631436314363144e-06, "loss": 0.9916, "mean_token_accuracy": 0.7055611610412598, "num_tokens": 2466476.0, "step": 184 }, { "entropy": 1.0109392404556274, "epoch": 0.45121951219512196, "grad_norm": 0.16337797045707703, "learning_rate": 8.617886178861789e-06, "loss": 0.9938, "mean_token_accuracy": 0.7032565474510193, "num_tokens": 2479911.0, "step": 185 }, { "entropy": 1.0034139156341553, "epoch": 0.45365853658536587, "grad_norm": 0.16562442481517792, "learning_rate": 8.604336043360433e-06, "loss": 1.0043, "mean_token_accuracy": 0.6976569294929504, "num_tokens": 2493243.0, "step": 186 }, { "entropy": 1.0120468139648438, "epoch": 0.4560975609756098, "grad_norm": 0.16520871222019196, "learning_rate": 8.59078590785908e-06, "loss": 0.9956, "mean_token_accuracy": 0.6959730982780457, "num_tokens": 2506942.0, "step": 187 }, { "entropy": 1.0021930932998657, "epoch": 0.4585365853658537, "grad_norm": 0.16627825796604156, "learning_rate": 8.577235772357724e-06, "loss": 1.0007, "mean_token_accuracy": 0.7009619474411011, "num_tokens": 2520264.0, "step": 188 }, { "entropy": 1.0003260374069214, "epoch": 0.4609756097560976, "grad_norm": 0.17842690646648407, "learning_rate": 8.56368563685637e-06, "loss": 1.0258, "mean_token_accuracy": 0.6934998631477356, "num_tokens": 2533249.0, "step": 189 }, { "entropy": 0.998503565788269, "epoch": 0.4634146341463415, "grad_norm": 0.17247022688388824, "learning_rate": 8.550135501355014e-06, "loss": 0.9917, "mean_token_accuracy": 0.7048850059509277, "num_tokens": 2546182.0, "step": 190 }, { "entropy": 1.0056812763214111, "epoch": 0.4658536585365854, "grad_norm": 0.17095550894737244, "learning_rate": 8.536585365853658e-06, "loss": 1.001, "mean_token_accuracy": 0.698594868183136, "num_tokens": 2559791.0, "step": 191 }, { "entropy": 1.0053273439407349, "epoch": 0.4682926829268293, "grad_norm": 0.17117735743522644, "learning_rate": 8.523035230352304e-06, "loss": 0.998, "mean_token_accuracy": 0.7012236714363098, "num_tokens": 2572964.0, "step": 192 }, { "entropy": 1.0028555393218994, "epoch": 0.47073170731707314, "grad_norm": 0.16437511146068573, "learning_rate": 8.509485094850949e-06, "loss": 1.0107, "mean_token_accuracy": 0.6982872486114502, "num_tokens": 2586642.0, "step": 193 }, { "entropy": 0.9957489967346191, "epoch": 0.47317073170731705, "grad_norm": 0.16638755798339844, "learning_rate": 8.495934959349595e-06, "loss": 1.0016, "mean_token_accuracy": 0.6981272101402283, "num_tokens": 2600114.0, "step": 194 }, { "entropy": 1.0133684873580933, "epoch": 0.47560975609756095, "grad_norm": 0.1650749295949936, "learning_rate": 8.482384823848239e-06, "loss": 1.0037, "mean_token_accuracy": 0.7015370726585388, "num_tokens": 2613532.0, "step": 195 }, { "entropy": 0.9839978218078613, "epoch": 0.47804878048780486, "grad_norm": 0.1746927946805954, "learning_rate": 8.468834688346883e-06, "loss": 0.9846, "mean_token_accuracy": 0.7021719813346863, "num_tokens": 2626992.0, "step": 196 }, { "entropy": 0.9965272545814514, "epoch": 0.48048780487804876, "grad_norm": 0.16948050260543823, "learning_rate": 8.45528455284553e-06, "loss": 0.9919, "mean_token_accuracy": 0.7043160200119019, "num_tokens": 2640678.0, "step": 197 }, { "entropy": 0.9951333999633789, "epoch": 0.48292682926829267, "grad_norm": 0.17663675546646118, "learning_rate": 8.441734417344174e-06, "loss": 0.9898, "mean_token_accuracy": 0.6999698281288147, "num_tokens": 2653946.0, "step": 198 }, { "entropy": 0.9917622804641724, "epoch": 0.4853658536585366, "grad_norm": 0.16705453395843506, "learning_rate": 8.42818428184282e-06, "loss": 0.9863, "mean_token_accuracy": 0.7023406624794006, "num_tokens": 2667548.0, "step": 199 }, { "entropy": 0.9877250790596008, "epoch": 0.4878048780487805, "grad_norm": 0.1668422818183899, "learning_rate": 8.414634146341464e-06, "loss": 0.9898, "mean_token_accuracy": 0.6997197270393372, "num_tokens": 2680765.0, "step": 200 }, { "entropy": 0.9894189834594727, "epoch": 0.4902439024390244, "grad_norm": 0.16777603328227997, "learning_rate": 8.401084010840109e-06, "loss": 0.9858, "mean_token_accuracy": 0.7059915065765381, "num_tokens": 2694250.0, "step": 201 }, { "entropy": 1.0040414333343506, "epoch": 0.4926829268292683, "grad_norm": 0.15866151452064514, "learning_rate": 8.387533875338753e-06, "loss": 1.003, "mean_token_accuracy": 0.6997585892677307, "num_tokens": 2707522.0, "step": 202 }, { "entropy": 0.9769632816314697, "epoch": 0.4951219512195122, "grad_norm": 0.1801648736000061, "learning_rate": 8.373983739837399e-06, "loss": 0.9734, "mean_token_accuracy": 0.7056036591529846, "num_tokens": 2721047.0, "step": 203 }, { "entropy": 0.9782701134681702, "epoch": 0.4975609756097561, "grad_norm": 0.1702914983034134, "learning_rate": 8.360433604336045e-06, "loss": 0.9915, "mean_token_accuracy": 0.7058641314506531, "num_tokens": 2733955.0, "step": 204 }, { "entropy": 0.9618117809295654, "epoch": 0.5, "grad_norm": 0.17133237421512604, "learning_rate": 8.34688346883469e-06, "loss": 0.9788, "mean_token_accuracy": 0.7108246684074402, "num_tokens": 2746849.0, "step": 205 }, { "entropy": 0.9704866409301758, "epoch": 0.5024390243902439, "grad_norm": 0.16161450743675232, "learning_rate": 8.333333333333334e-06, "loss": 0.9652, "mean_token_accuracy": 0.7115023136138916, "num_tokens": 2760158.0, "step": 206 }, { "entropy": 0.9772287607192993, "epoch": 0.5048780487804878, "grad_norm": 0.16217578947544098, "learning_rate": 8.319783197831978e-06, "loss": 0.9722, "mean_token_accuracy": 0.704070508480072, "num_tokens": 2773907.0, "step": 207 }, { "entropy": 0.9927241802215576, "epoch": 0.5073170731707317, "grad_norm": 0.16909728944301605, "learning_rate": 8.306233062330624e-06, "loss": 0.9958, "mean_token_accuracy": 0.7050141096115112, "num_tokens": 2787744.0, "step": 208 }, { "entropy": 0.97894287109375, "epoch": 0.5097560975609756, "grad_norm": 0.163661390542984, "learning_rate": 8.292682926829268e-06, "loss": 0.9846, "mean_token_accuracy": 0.698600172996521, "num_tokens": 2801476.0, "step": 209 }, { "entropy": 0.961266279220581, "epoch": 0.5121951219512195, "grad_norm": 0.16647972166538239, "learning_rate": 8.279132791327915e-06, "loss": 0.9514, "mean_token_accuracy": 0.7096498608589172, "num_tokens": 2814373.0, "step": 210 }, { "entropy": 0.9882842898368835, "epoch": 0.5146341463414634, "grad_norm": 0.1674662083387375, "learning_rate": 8.265582655826559e-06, "loss": 0.9814, "mean_token_accuracy": 0.701384425163269, "num_tokens": 2828330.0, "step": 211 }, { "entropy": 0.9803353548049927, "epoch": 0.5170731707317073, "grad_norm": 0.16690295934677124, "learning_rate": 8.252032520325203e-06, "loss": 0.9887, "mean_token_accuracy": 0.707240104675293, "num_tokens": 2841343.0, "step": 212 }, { "entropy": 0.986532986164093, "epoch": 0.5195121951219512, "grad_norm": 0.16405653953552246, "learning_rate": 8.23848238482385e-06, "loss": 0.9875, "mean_token_accuracy": 0.7040362358093262, "num_tokens": 2854837.0, "step": 213 }, { "entropy": 0.9744679927825928, "epoch": 0.5219512195121951, "grad_norm": 0.16172032058238983, "learning_rate": 8.224932249322494e-06, "loss": 0.9852, "mean_token_accuracy": 0.7052052617073059, "num_tokens": 2868666.0, "step": 214 }, { "entropy": 0.9497202634811401, "epoch": 0.524390243902439, "grad_norm": 0.16827084124088287, "learning_rate": 8.21138211382114e-06, "loss": 0.9593, "mean_token_accuracy": 0.7130415439605713, "num_tokens": 2882001.0, "step": 215 }, { "entropy": 0.9834163188934326, "epoch": 0.526829268292683, "grad_norm": 0.16540959477424622, "learning_rate": 8.197831978319784e-06, "loss": 0.9887, "mean_token_accuracy": 0.7012408971786499, "num_tokens": 2895717.0, "step": 216 }, { "entropy": 0.9932485818862915, "epoch": 0.5292682926829269, "grad_norm": 0.16657041013240814, "learning_rate": 8.184281842818428e-06, "loss": 0.9775, "mean_token_accuracy": 0.7028895020484924, "num_tokens": 2909334.0, "step": 217 }, { "entropy": 0.9768931865692139, "epoch": 0.5317073170731708, "grad_norm": 0.1715688705444336, "learning_rate": 8.170731707317073e-06, "loss": 0.989, "mean_token_accuracy": 0.7002978920936584, "num_tokens": 2922443.0, "step": 218 }, { "entropy": 0.9682226181030273, "epoch": 0.5341463414634147, "grad_norm": 0.16455644369125366, "learning_rate": 8.157181571815719e-06, "loss": 0.9792, "mean_token_accuracy": 0.6996614933013916, "num_tokens": 2936047.0, "step": 219 }, { "entropy": 0.967424750328064, "epoch": 0.5365853658536586, "grad_norm": 0.1654297411441803, "learning_rate": 8.143631436314365e-06, "loss": 0.9522, "mean_token_accuracy": 0.710684061050415, "num_tokens": 2949073.0, "step": 220 }, { "entropy": 0.978946328163147, "epoch": 0.5390243902439025, "grad_norm": 0.16667896509170532, "learning_rate": 8.130081300813009e-06, "loss": 0.98, "mean_token_accuracy": 0.7056810259819031, "num_tokens": 2962238.0, "step": 221 }, { "entropy": 0.9638472199440002, "epoch": 0.5414634146341464, "grad_norm": 0.16370747983455658, "learning_rate": 8.116531165311653e-06, "loss": 0.9453, "mean_token_accuracy": 0.7188960313796997, "num_tokens": 2975733.0, "step": 222 }, { "entropy": 0.9723875522613525, "epoch": 0.5439024390243903, "grad_norm": 0.16714785993099213, "learning_rate": 8.102981029810298e-06, "loss": 0.9875, "mean_token_accuracy": 0.698201596736908, "num_tokens": 2988983.0, "step": 223 }, { "entropy": 0.9673885107040405, "epoch": 0.5463414634146342, "grad_norm": 0.1624123454093933, "learning_rate": 8.089430894308944e-06, "loss": 0.9644, "mean_token_accuracy": 0.708252489566803, "num_tokens": 3002401.0, "step": 224 }, { "entropy": 0.9567648768424988, "epoch": 0.5487804878048781, "grad_norm": 0.16196352243423462, "learning_rate": 8.075880758807588e-06, "loss": 0.9497, "mean_token_accuracy": 0.7132189869880676, "num_tokens": 3015943.0, "step": 225 }, { "entropy": 0.9580562114715576, "epoch": 0.551219512195122, "grad_norm": 0.15929940342903137, "learning_rate": 8.062330623306234e-06, "loss": 0.9428, "mean_token_accuracy": 0.7144014835357666, "num_tokens": 3029534.0, "step": 226 }, { "entropy": 0.9454320669174194, "epoch": 0.5536585365853659, "grad_norm": 0.16950178146362305, "learning_rate": 8.048780487804879e-06, "loss": 0.9408, "mean_token_accuracy": 0.7093318700790405, "num_tokens": 3042527.0, "step": 227 }, { "entropy": 0.9679467678070068, "epoch": 0.5560975609756098, "grad_norm": 0.1640005111694336, "learning_rate": 8.035230352303523e-06, "loss": 0.9704, "mean_token_accuracy": 0.7116739153862, "num_tokens": 3055889.0, "step": 228 }, { "entropy": 0.9547273516654968, "epoch": 0.5585365853658537, "grad_norm": 0.16052336990833282, "learning_rate": 8.021680216802169e-06, "loss": 0.934, "mean_token_accuracy": 0.7157609462738037, "num_tokens": 3069559.0, "step": 229 }, { "entropy": 0.9567209482192993, "epoch": 0.5609756097560976, "grad_norm": 0.16757436096668243, "learning_rate": 8.008130081300813e-06, "loss": 0.9744, "mean_token_accuracy": 0.7066189646720886, "num_tokens": 3082991.0, "step": 230 }, { "entropy": 0.9696470499038696, "epoch": 0.5634146341463414, "grad_norm": 0.15978163480758667, "learning_rate": 7.99457994579946e-06, "loss": 0.9766, "mean_token_accuracy": 0.7067956924438477, "num_tokens": 3096854.0, "step": 231 }, { "entropy": 0.9619528651237488, "epoch": 0.5658536585365853, "grad_norm": 0.1610889881849289, "learning_rate": 7.981029810298104e-06, "loss": 0.9522, "mean_token_accuracy": 0.7112933397293091, "num_tokens": 3110285.0, "step": 232 }, { "entropy": 0.9486234188079834, "epoch": 0.5682926829268292, "grad_norm": 0.16641642153263092, "learning_rate": 7.967479674796748e-06, "loss": 0.9275, "mean_token_accuracy": 0.7189168334007263, "num_tokens": 3123411.0, "step": 233 }, { "entropy": 0.95262610912323, "epoch": 0.5707317073170731, "grad_norm": 0.1619957685470581, "learning_rate": 7.953929539295394e-06, "loss": 0.9668, "mean_token_accuracy": 0.7126327157020569, "num_tokens": 3137082.0, "step": 234 }, { "entropy": 0.9534478783607483, "epoch": 0.573170731707317, "grad_norm": 0.16168786585330963, "learning_rate": 7.940379403794039e-06, "loss": 0.964, "mean_token_accuracy": 0.7050497531890869, "num_tokens": 3150663.0, "step": 235 }, { "entropy": 0.9454038143157959, "epoch": 0.5756097560975609, "grad_norm": 0.16300973296165466, "learning_rate": 7.926829268292685e-06, "loss": 0.9401, "mean_token_accuracy": 0.7151955366134644, "num_tokens": 3164025.0, "step": 236 }, { "entropy": 0.9535937309265137, "epoch": 0.5780487804878048, "grad_norm": 0.16334660351276398, "learning_rate": 7.913279132791329e-06, "loss": 0.9503, "mean_token_accuracy": 0.7116466760635376, "num_tokens": 3177195.0, "step": 237 }, { "entropy": 1.0005275011062622, "epoch": 0.5804878048780487, "grad_norm": 0.16791778802871704, "learning_rate": 7.899728997289973e-06, "loss": 1.0015, "mean_token_accuracy": 0.7042770385742188, "num_tokens": 3190842.0, "step": 238 }, { "entropy": 0.9564257860183716, "epoch": 0.5829268292682926, "grad_norm": 0.15814629197120667, "learning_rate": 7.886178861788618e-06, "loss": 0.9487, "mean_token_accuracy": 0.7144843935966492, "num_tokens": 3204521.0, "step": 239 }, { "entropy": 0.9540543556213379, "epoch": 0.5853658536585366, "grad_norm": 0.1548798680305481, "learning_rate": 7.872628726287264e-06, "loss": 0.9506, "mean_token_accuracy": 0.711961030960083, "num_tokens": 3217872.0, "step": 240 }, { "entropy": 0.9536082744598389, "epoch": 0.5878048780487805, "grad_norm": 0.16294530034065247, "learning_rate": 7.859078590785908e-06, "loss": 0.9498, "mean_token_accuracy": 0.7111994624137878, "num_tokens": 3231219.0, "step": 241 }, { "entropy": 0.9481508731842041, "epoch": 0.5902439024390244, "grad_norm": 0.15385769307613373, "learning_rate": 7.845528455284554e-06, "loss": 0.9323, "mean_token_accuracy": 0.7128936052322388, "num_tokens": 3244986.0, "step": 242 }, { "entropy": 0.935053825378418, "epoch": 0.5926829268292683, "grad_norm": 0.15816359221935272, "learning_rate": 7.831978319783198e-06, "loss": 0.9247, "mean_token_accuracy": 0.7194153070449829, "num_tokens": 3258342.0, "step": 243 }, { "entropy": 0.9509957432746887, "epoch": 0.5951219512195122, "grad_norm": 0.16170227527618408, "learning_rate": 7.818428184281843e-06, "loss": 0.9558, "mean_token_accuracy": 0.7063164114952087, "num_tokens": 3271910.0, "step": 244 }, { "entropy": 0.9488095045089722, "epoch": 0.5975609756097561, "grad_norm": 0.16762597858905792, "learning_rate": 7.804878048780489e-06, "loss": 0.9325, "mean_token_accuracy": 0.7141220569610596, "num_tokens": 3285019.0, "step": 245 }, { "entropy": 0.9412808418273926, "epoch": 0.6, "grad_norm": 0.1669067144393921, "learning_rate": 7.791327913279133e-06, "loss": 0.9304, "mean_token_accuracy": 0.7160465717315674, "num_tokens": 3298097.0, "step": 246 }, { "entropy": 0.9411801099777222, "epoch": 0.6024390243902439, "grad_norm": 0.16510054469108582, "learning_rate": 7.77777777777778e-06, "loss": 0.952, "mean_token_accuracy": 0.7096559405326843, "num_tokens": 3311628.0, "step": 247 }, { "entropy": 0.9391855001449585, "epoch": 0.6048780487804878, "grad_norm": 0.16120120882987976, "learning_rate": 7.764227642276424e-06, "loss": 0.9299, "mean_token_accuracy": 0.7161240577697754, "num_tokens": 3324544.0, "step": 248 }, { "entropy": 0.9606072902679443, "epoch": 0.6073170731707317, "grad_norm": 0.1596563309431076, "learning_rate": 7.750677506775068e-06, "loss": 0.98, "mean_token_accuracy": 0.7059526443481445, "num_tokens": 3337949.0, "step": 249 }, { "entropy": 0.959593653678894, "epoch": 0.6097560975609756, "grad_norm": 0.16428229212760925, "learning_rate": 7.737127371273714e-06, "loss": 0.9731, "mean_token_accuracy": 0.7107242941856384, "num_tokens": 3351523.0, "step": 250 }, { "entropy": 0.9481107592582703, "epoch": 0.6121951219512195, "grad_norm": 0.15851643681526184, "learning_rate": 7.723577235772358e-06, "loss": 0.9415, "mean_token_accuracy": 0.7170389890670776, "num_tokens": 3365237.0, "step": 251 }, { "entropy": 0.9265803098678589, "epoch": 0.6146341463414634, "grad_norm": 0.16618311405181885, "learning_rate": 7.710027100271004e-06, "loss": 0.9122, "mean_token_accuracy": 0.7207344174385071, "num_tokens": 3378434.0, "step": 252 }, { "entropy": 0.9509798288345337, "epoch": 0.6170731707317073, "grad_norm": 0.16133299469947815, "learning_rate": 7.696476964769649e-06, "loss": 0.947, "mean_token_accuracy": 0.713214099407196, "num_tokens": 3391648.0, "step": 253 }, { "entropy": 0.92350172996521, "epoch": 0.6195121951219512, "grad_norm": 0.16066798567771912, "learning_rate": 7.682926829268293e-06, "loss": 0.9029, "mean_token_accuracy": 0.7265830636024475, "num_tokens": 3404977.0, "step": 254 }, { "entropy": 0.9618203639984131, "epoch": 0.6219512195121951, "grad_norm": 0.15734082460403442, "learning_rate": 7.669376693766937e-06, "loss": 0.9437, "mean_token_accuracy": 0.7111424207687378, "num_tokens": 3418491.0, "step": 255 }, { "entropy": 0.9390702247619629, "epoch": 0.624390243902439, "grad_norm": 0.15325915813446045, "learning_rate": 7.655826558265583e-06, "loss": 0.9392, "mean_token_accuracy": 0.7145180106163025, "num_tokens": 3432035.0, "step": 256 }, { "entropy": 0.9358468055725098, "epoch": 0.6268292682926829, "grad_norm": 0.1554923802614212, "learning_rate": 7.64227642276423e-06, "loss": 0.928, "mean_token_accuracy": 0.7181775569915771, "num_tokens": 3444935.0, "step": 257 }, { "entropy": 0.9481029510498047, "epoch": 0.6292682926829268, "grad_norm": 0.15726210176944733, "learning_rate": 7.628726287262873e-06, "loss": 0.9564, "mean_token_accuracy": 0.7126176953315735, "num_tokens": 3458654.0, "step": 258 }, { "entropy": 0.9535932540893555, "epoch": 0.6317073170731707, "grad_norm": 0.15442681312561035, "learning_rate": 7.615176151761519e-06, "loss": 0.9514, "mean_token_accuracy": 0.7092245817184448, "num_tokens": 3472134.0, "step": 259 }, { "entropy": 0.9278210401535034, "epoch": 0.6341463414634146, "grad_norm": 0.16804730892181396, "learning_rate": 7.601626016260163e-06, "loss": 0.9326, "mean_token_accuracy": 0.7159616947174072, "num_tokens": 3485106.0, "step": 260 }, { "entropy": 0.9546136856079102, "epoch": 0.6365853658536585, "grad_norm": 0.15850891172885895, "learning_rate": 7.5880758807588085e-06, "loss": 0.9725, "mean_token_accuracy": 0.705976128578186, "num_tokens": 3498291.0, "step": 261 }, { "entropy": 0.928404688835144, "epoch": 0.6390243902439025, "grad_norm": 0.1619364470243454, "learning_rate": 7.574525745257453e-06, "loss": 0.9357, "mean_token_accuracy": 0.7146782875061035, "num_tokens": 3511408.0, "step": 262 }, { "entropy": 0.9354878067970276, "epoch": 0.6414634146341464, "grad_norm": 0.16030831634998322, "learning_rate": 7.560975609756098e-06, "loss": 0.9349, "mean_token_accuracy": 0.7133307456970215, "num_tokens": 3524439.0, "step": 263 }, { "entropy": 0.9242296814918518, "epoch": 0.6439024390243903, "grad_norm": 0.1562914103269577, "learning_rate": 7.547425474254744e-06, "loss": 0.9303, "mean_token_accuracy": 0.7126427888870239, "num_tokens": 3537759.0, "step": 264 }, { "entropy": 0.9220150709152222, "epoch": 0.6463414634146342, "grad_norm": 0.14866940677165985, "learning_rate": 7.5338753387533885e-06, "loss": 0.922, "mean_token_accuracy": 0.7132981419563293, "num_tokens": 3551228.0, "step": 265 }, { "entropy": 0.9343201518058777, "epoch": 0.6487804878048781, "grad_norm": 0.1494896113872528, "learning_rate": 7.520325203252034e-06, "loss": 0.9373, "mean_token_accuracy": 0.7129477262496948, "num_tokens": 3565231.0, "step": 266 }, { "entropy": 0.9533241987228394, "epoch": 0.651219512195122, "grad_norm": 0.15667204558849335, "learning_rate": 7.506775067750678e-06, "loss": 0.9589, "mean_token_accuracy": 0.7093436121940613, "num_tokens": 3578775.0, "step": 267 }, { "entropy": 0.9355111122131348, "epoch": 0.6536585365853659, "grad_norm": 0.15565158426761627, "learning_rate": 7.493224932249323e-06, "loss": 0.9295, "mean_token_accuracy": 0.7132697701454163, "num_tokens": 3592009.0, "step": 268 }, { "entropy": 0.9118462800979614, "epoch": 0.6560975609756098, "grad_norm": 0.15243865549564362, "learning_rate": 7.4796747967479676e-06, "loss": 0.9183, "mean_token_accuracy": 0.7204574346542358, "num_tokens": 3605404.0, "step": 269 }, { "entropy": 0.9283488988876343, "epoch": 0.6585365853658537, "grad_norm": 0.15385380387306213, "learning_rate": 7.466124661246613e-06, "loss": 0.926, "mean_token_accuracy": 0.7187360525131226, "num_tokens": 3618838.0, "step": 270 }, { "entropy": 0.9379990100860596, "epoch": 0.6609756097560976, "grad_norm": 0.15456515550613403, "learning_rate": 7.452574525745257e-06, "loss": 0.9381, "mean_token_accuracy": 0.7181525230407715, "num_tokens": 3632191.0, "step": 271 }, { "entropy": 0.9382643103599548, "epoch": 0.6634146341463415, "grad_norm": 0.15582406520843506, "learning_rate": 7.439024390243903e-06, "loss": 0.9367, "mean_token_accuracy": 0.7143399119377136, "num_tokens": 3645387.0, "step": 272 }, { "entropy": 0.9416444301605225, "epoch": 0.6658536585365854, "grad_norm": 0.1587027907371521, "learning_rate": 7.425474254742548e-06, "loss": 0.9521, "mean_token_accuracy": 0.7076588273048401, "num_tokens": 3659178.0, "step": 273 }, { "entropy": 0.9447643756866455, "epoch": 0.6682926829268293, "grad_norm": 0.16017645597457886, "learning_rate": 7.411924119241193e-06, "loss": 0.9442, "mean_token_accuracy": 0.7130175232887268, "num_tokens": 3672261.0, "step": 274 }, { "entropy": 0.9379363059997559, "epoch": 0.6707317073170732, "grad_norm": 0.14899934828281403, "learning_rate": 7.398373983739838e-06, "loss": 0.9324, "mean_token_accuracy": 0.7158769965171814, "num_tokens": 3685743.0, "step": 275 }, { "entropy": 0.9268349409103394, "epoch": 0.6731707317073171, "grad_norm": 0.15139304101467133, "learning_rate": 7.384823848238482e-06, "loss": 0.9269, "mean_token_accuracy": 0.7169948816299438, "num_tokens": 3699469.0, "step": 276 }, { "entropy": 0.9546395540237427, "epoch": 0.675609756097561, "grad_norm": 0.16162307560443878, "learning_rate": 7.371273712737128e-06, "loss": 0.9587, "mean_token_accuracy": 0.7085087299346924, "num_tokens": 3712789.0, "step": 277 }, { "entropy": 0.9113729000091553, "epoch": 0.6780487804878049, "grad_norm": 0.15460745990276337, "learning_rate": 7.357723577235773e-06, "loss": 0.9004, "mean_token_accuracy": 0.7206665873527527, "num_tokens": 3725947.0, "step": 278 }, { "entropy": 0.9525165557861328, "epoch": 0.6804878048780488, "grad_norm": 0.15463463962078094, "learning_rate": 7.344173441734418e-06, "loss": 0.9383, "mean_token_accuracy": 0.7162497043609619, "num_tokens": 3739274.0, "step": 279 }, { "entropy": 0.9366529583930969, "epoch": 0.6829268292682927, "grad_norm": 0.15342386066913605, "learning_rate": 7.330623306233063e-06, "loss": 0.9483, "mean_token_accuracy": 0.7094659209251404, "num_tokens": 3752865.0, "step": 280 }, { "entropy": 0.935637354850769, "epoch": 0.6853658536585366, "grad_norm": 0.15574605762958527, "learning_rate": 7.317073170731707e-06, "loss": 0.9274, "mean_token_accuracy": 0.7157266736030579, "num_tokens": 3766463.0, "step": 281 }, { "entropy": 0.9355779886245728, "epoch": 0.6878048780487804, "grad_norm": 0.1519261598587036, "learning_rate": 7.303523035230353e-06, "loss": 0.9327, "mean_token_accuracy": 0.7185456156730652, "num_tokens": 3779323.0, "step": 282 }, { "entropy": 0.952324390411377, "epoch": 0.6902439024390243, "grad_norm": 0.1669672280550003, "learning_rate": 7.289972899728998e-06, "loss": 0.9357, "mean_token_accuracy": 0.7216391563415527, "num_tokens": 3792297.0, "step": 283 }, { "entropy": 0.9187766313552856, "epoch": 0.6926829268292682, "grad_norm": 0.14877188205718994, "learning_rate": 7.276422764227643e-06, "loss": 0.9125, "mean_token_accuracy": 0.7230643033981323, "num_tokens": 3805706.0, "step": 284 }, { "entropy": 0.9129336476325989, "epoch": 0.6951219512195121, "grad_norm": 0.15119393169879913, "learning_rate": 7.262872628726287e-06, "loss": 0.9191, "mean_token_accuracy": 0.7201807498931885, "num_tokens": 3819220.0, "step": 285 }, { "entropy": 0.9101721048355103, "epoch": 0.697560975609756, "grad_norm": 0.1465786248445511, "learning_rate": 7.2493224932249325e-06, "loss": 0.9127, "mean_token_accuracy": 0.7222345471382141, "num_tokens": 3832751.0, "step": 286 }, { "entropy": 0.9107828736305237, "epoch": 0.7, "grad_norm": 0.15555697679519653, "learning_rate": 7.2357723577235786e-06, "loss": 0.8996, "mean_token_accuracy": 0.7236950397491455, "num_tokens": 3846158.0, "step": 287 }, { "entropy": 0.9074515104293823, "epoch": 0.7024390243902439, "grad_norm": 0.15076883137226105, "learning_rate": 7.222222222222223e-06, "loss": 0.8957, "mean_token_accuracy": 0.723412275314331, "num_tokens": 3859479.0, "step": 288 }, { "entropy": 0.917039155960083, "epoch": 0.7048780487804878, "grad_norm": 0.14963188767433167, "learning_rate": 7.208672086720868e-06, "loss": 0.9132, "mean_token_accuracy": 0.7183962464332581, "num_tokens": 3873188.0, "step": 289 }, { "entropy": 0.9054569602012634, "epoch": 0.7073170731707317, "grad_norm": 0.15667130053043365, "learning_rate": 7.1951219512195125e-06, "loss": 0.9072, "mean_token_accuracy": 0.7192850708961487, "num_tokens": 3886520.0, "step": 290 }, { "entropy": 0.92705237865448, "epoch": 0.7097560975609756, "grad_norm": 0.15387941896915436, "learning_rate": 7.181571815718158e-06, "loss": 0.9132, "mean_token_accuracy": 0.7153183817863464, "num_tokens": 3899540.0, "step": 291 }, { "entropy": 0.9047387838363647, "epoch": 0.7121951219512195, "grad_norm": 0.148861825466156, "learning_rate": 7.168021680216802e-06, "loss": 0.9001, "mean_token_accuracy": 0.7203510403633118, "num_tokens": 3912887.0, "step": 292 }, { "entropy": 0.924647867679596, "epoch": 0.7146341463414634, "grad_norm": 0.15873289108276367, "learning_rate": 7.154471544715448e-06, "loss": 0.9227, "mean_token_accuracy": 0.7200701832771301, "num_tokens": 3926017.0, "step": 293 }, { "entropy": 0.9390074014663696, "epoch": 0.7170731707317073, "grad_norm": 0.1504705548286438, "learning_rate": 7.140921409214093e-06, "loss": 0.9383, "mean_token_accuracy": 0.7134274244308472, "num_tokens": 3939848.0, "step": 294 }, { "entropy": 0.9174056649208069, "epoch": 0.7195121951219512, "grad_norm": 0.1560080498456955, "learning_rate": 7.127371273712738e-06, "loss": 0.9205, "mean_token_accuracy": 0.7206430435180664, "num_tokens": 3953549.0, "step": 295 }, { "entropy": 0.9219064712524414, "epoch": 0.7219512195121951, "grad_norm": 0.1586093157529831, "learning_rate": 7.113821138211383e-06, "loss": 0.9438, "mean_token_accuracy": 0.7093410491943359, "num_tokens": 3967086.0, "step": 296 }, { "entropy": 0.9237949848175049, "epoch": 0.724390243902439, "grad_norm": 0.14479567110538483, "learning_rate": 7.100271002710027e-06, "loss": 0.9207, "mean_token_accuracy": 0.7216541171073914, "num_tokens": 3980499.0, "step": 297 }, { "entropy": 0.9169784784317017, "epoch": 0.7268292682926829, "grad_norm": 0.1539381593465805, "learning_rate": 7.086720867208673e-06, "loss": 0.927, "mean_token_accuracy": 0.7158411145210266, "num_tokens": 3993557.0, "step": 298 }, { "entropy": 0.9099527597427368, "epoch": 0.7292682926829268, "grad_norm": 0.1458337903022766, "learning_rate": 7.0731707317073175e-06, "loss": 0.9104, "mean_token_accuracy": 0.7185899615287781, "num_tokens": 4007048.0, "step": 299 }, { "entropy": 0.9373666048049927, "epoch": 0.7317073170731707, "grad_norm": 0.15674933791160583, "learning_rate": 7.059620596205963e-06, "loss": 0.9331, "mean_token_accuracy": 0.7143380641937256, "num_tokens": 4020706.0, "step": 300 }, { "entropy": 0.9198070764541626, "epoch": 0.7341463414634146, "grad_norm": 0.15851294994354248, "learning_rate": 7.046070460704607e-06, "loss": 0.9139, "mean_token_accuracy": 0.7180051803588867, "num_tokens": 4033896.0, "step": 301 }, { "entropy": 0.9198285341262817, "epoch": 0.7365853658536585, "grad_norm": 0.15451189875602722, "learning_rate": 7.032520325203252e-06, "loss": 0.9197, "mean_token_accuracy": 0.7124741673469543, "num_tokens": 4047476.0, "step": 302 }, { "entropy": 0.9247706532478333, "epoch": 0.7390243902439024, "grad_norm": 0.16229675710201263, "learning_rate": 7.018970189701898e-06, "loss": 0.9205, "mean_token_accuracy": 0.7124660611152649, "num_tokens": 4060760.0, "step": 303 }, { "entropy": 0.914578914642334, "epoch": 0.7414634146341463, "grad_norm": 0.1586454063653946, "learning_rate": 7.005420054200543e-06, "loss": 0.9105, "mean_token_accuracy": 0.7220610976219177, "num_tokens": 4074225.0, "step": 304 }, { "entropy": 0.9418405294418335, "epoch": 0.7439024390243902, "grad_norm": 0.15731269121170044, "learning_rate": 6.991869918699188e-06, "loss": 0.9215, "mean_token_accuracy": 0.7197117805480957, "num_tokens": 4087563.0, "step": 305 }, { "entropy": 0.9367963075637817, "epoch": 0.7463414634146341, "grad_norm": 0.15139515697956085, "learning_rate": 6.978319783197832e-06, "loss": 0.9353, "mean_token_accuracy": 0.7137369513511658, "num_tokens": 4100595.0, "step": 306 }, { "entropy": 0.928600549697876, "epoch": 0.748780487804878, "grad_norm": 0.15391124784946442, "learning_rate": 6.964769647696477e-06, "loss": 0.9175, "mean_token_accuracy": 0.7180485129356384, "num_tokens": 4113975.0, "step": 307 }, { "entropy": 0.9189996719360352, "epoch": 0.751219512195122, "grad_norm": 0.14990229904651642, "learning_rate": 6.951219512195122e-06, "loss": 0.9219, "mean_token_accuracy": 0.7203125953674316, "num_tokens": 4127810.0, "step": 308 }, { "entropy": 0.9270630478858948, "epoch": 0.7536585365853659, "grad_norm": 0.15296263992786407, "learning_rate": 6.937669376693768e-06, "loss": 0.9238, "mean_token_accuracy": 0.7191330194473267, "num_tokens": 4141206.0, "step": 309 }, { "entropy": 0.9125182628631592, "epoch": 0.7560975609756098, "grad_norm": 0.14483878016471863, "learning_rate": 6.924119241192413e-06, "loss": 0.9108, "mean_token_accuracy": 0.7178426384925842, "num_tokens": 4155239.0, "step": 310 }, { "entropy": 0.9118213057518005, "epoch": 0.7585365853658537, "grad_norm": 0.15586057305335999, "learning_rate": 6.910569105691057e-06, "loss": 0.8996, "mean_token_accuracy": 0.7207787036895752, "num_tokens": 4168456.0, "step": 311 }, { "entropy": 0.9187057018280029, "epoch": 0.7609756097560976, "grad_norm": 0.14583183825016022, "learning_rate": 6.8970189701897025e-06, "loss": 0.9137, "mean_token_accuracy": 0.7201070785522461, "num_tokens": 4181920.0, "step": 312 }, { "entropy": 0.9076229333877563, "epoch": 0.7634146341463415, "grad_norm": 0.14867785573005676, "learning_rate": 6.883468834688347e-06, "loss": 0.9095, "mean_token_accuracy": 0.7186159491539001, "num_tokens": 4195693.0, "step": 313 }, { "entropy": 0.9289067983627319, "epoch": 0.7658536585365854, "grad_norm": 0.15520809590816498, "learning_rate": 6.869918699186993e-06, "loss": 0.9205, "mean_token_accuracy": 0.7182366251945496, "num_tokens": 4208979.0, "step": 314 }, { "entropy": 0.912957489490509, "epoch": 0.7682926829268293, "grad_norm": 0.1523636430501938, "learning_rate": 6.856368563685637e-06, "loss": 0.9227, "mean_token_accuracy": 0.7217300534248352, "num_tokens": 4222428.0, "step": 315 }, { "entropy": 0.8968350887298584, "epoch": 0.7707317073170732, "grad_norm": 0.16188141703605652, "learning_rate": 6.8428184281842825e-06, "loss": 0.9074, "mean_token_accuracy": 0.722152590751648, "num_tokens": 4236009.0, "step": 316 }, { "entropy": 0.9147211313247681, "epoch": 0.7731707317073171, "grad_norm": 0.1570591777563095, "learning_rate": 6.829268292682928e-06, "loss": 0.9246, "mean_token_accuracy": 0.716189444065094, "num_tokens": 4249157.0, "step": 317 }, { "entropy": 0.9082373976707458, "epoch": 0.775609756097561, "grad_norm": 0.15219484269618988, "learning_rate": 6.815718157181572e-06, "loss": 0.884, "mean_token_accuracy": 0.729555070400238, "num_tokens": 4262636.0, "step": 318 }, { "entropy": 0.9198713898658752, "epoch": 0.7780487804878049, "grad_norm": 0.1499103456735611, "learning_rate": 6.802168021680218e-06, "loss": 0.9166, "mean_token_accuracy": 0.714636504650116, "num_tokens": 4276091.0, "step": 319 }, { "entropy": 0.894140362739563, "epoch": 0.7804878048780488, "grad_norm": 0.15162697434425354, "learning_rate": 6.788617886178862e-06, "loss": 0.8845, "mean_token_accuracy": 0.7299917936325073, "num_tokens": 4289514.0, "step": 320 }, { "entropy": 0.9078084230422974, "epoch": 0.7829268292682927, "grad_norm": 0.1546027660369873, "learning_rate": 6.775067750677508e-06, "loss": 0.9118, "mean_token_accuracy": 0.717620849609375, "num_tokens": 4303451.0, "step": 321 }, { "entropy": 0.909231424331665, "epoch": 0.7853658536585366, "grad_norm": 0.1494377702474594, "learning_rate": 6.761517615176152e-06, "loss": 0.8964, "mean_token_accuracy": 0.722392737865448, "num_tokens": 4316824.0, "step": 322 }, { "entropy": 0.920364260673523, "epoch": 0.7878048780487805, "grad_norm": 0.16057001054286957, "learning_rate": 6.747967479674797e-06, "loss": 0.9136, "mean_token_accuracy": 0.7145892977714539, "num_tokens": 4330487.0, "step": 323 }, { "entropy": 0.9032753705978394, "epoch": 0.7902439024390244, "grad_norm": 0.15743280947208405, "learning_rate": 6.734417344173443e-06, "loss": 0.9009, "mean_token_accuracy": 0.7194689512252808, "num_tokens": 4343760.0, "step": 324 }, { "entropy": 0.9105545282363892, "epoch": 0.7926829268292683, "grad_norm": 0.1525033861398697, "learning_rate": 6.7208672086720876e-06, "loss": 0.9065, "mean_token_accuracy": 0.7208117842674255, "num_tokens": 4357129.0, "step": 325 }, { "entropy": 0.906657338142395, "epoch": 0.7951219512195122, "grad_norm": 0.1705314815044403, "learning_rate": 6.707317073170733e-06, "loss": 0.9237, "mean_token_accuracy": 0.7187808752059937, "num_tokens": 4370302.0, "step": 326 }, { "entropy": 0.9039660692214966, "epoch": 0.7975609756097561, "grad_norm": 0.15754637122154236, "learning_rate": 6.693766937669377e-06, "loss": 0.8871, "mean_token_accuracy": 0.7259286046028137, "num_tokens": 4384048.0, "step": 327 }, { "entropy": 0.9237337708473206, "epoch": 0.8, "grad_norm": 0.16106484830379486, "learning_rate": 6.680216802168022e-06, "loss": 0.9221, "mean_token_accuracy": 0.7178065776824951, "num_tokens": 4397413.0, "step": 328 }, { "entropy": 0.8977658152580261, "epoch": 0.802439024390244, "grad_norm": 0.16258393228054047, "learning_rate": 6.666666666666667e-06, "loss": 0.9158, "mean_token_accuracy": 0.7205637097358704, "num_tokens": 4410627.0, "step": 329 }, { "entropy": 0.9091554880142212, "epoch": 0.8048780487804879, "grad_norm": 0.16257335245609283, "learning_rate": 6.653116531165313e-06, "loss": 0.905, "mean_token_accuracy": 0.7194573283195496, "num_tokens": 4423985.0, "step": 330 }, { "entropy": 0.9025290012359619, "epoch": 0.8073170731707318, "grad_norm": 0.15430954098701477, "learning_rate": 6.639566395663957e-06, "loss": 0.9082, "mean_token_accuracy": 0.7190539240837097, "num_tokens": 4437573.0, "step": 331 }, { "entropy": 0.9192676544189453, "epoch": 0.8097560975609757, "grad_norm": 0.1551608443260193, "learning_rate": 6.626016260162602e-06, "loss": 0.9148, "mean_token_accuracy": 0.7191833257675171, "num_tokens": 4450715.0, "step": 332 }, { "entropy": 0.9210897088050842, "epoch": 0.8121951219512196, "grad_norm": 0.15126371383666992, "learning_rate": 6.6124661246612474e-06, "loss": 0.9272, "mean_token_accuracy": 0.7119234204292297, "num_tokens": 4464519.0, "step": 333 }, { "entropy": 0.9274299144744873, "epoch": 0.8146341463414634, "grad_norm": 0.15113505721092224, "learning_rate": 6.598915989159892e-06, "loss": 0.911, "mean_token_accuracy": 0.7139639854431152, "num_tokens": 4477855.0, "step": 334 }, { "entropy": 0.9136286973953247, "epoch": 0.8170731707317073, "grad_norm": 0.1449194997549057, "learning_rate": 6.585365853658538e-06, "loss": 0.9097, "mean_token_accuracy": 0.7178084254264832, "num_tokens": 4491578.0, "step": 335 }, { "entropy": 0.8942598700523376, "epoch": 0.8195121951219512, "grad_norm": 0.15594850480556488, "learning_rate": 6.571815718157182e-06, "loss": 0.8835, "mean_token_accuracy": 0.725902259349823, "num_tokens": 4505060.0, "step": 336 }, { "entropy": 0.8936731815338135, "epoch": 0.8219512195121951, "grad_norm": 0.15950734913349152, "learning_rate": 6.558265582655827e-06, "loss": 0.8879, "mean_token_accuracy": 0.7259511351585388, "num_tokens": 4518008.0, "step": 337 }, { "entropy": 0.9004725217819214, "epoch": 0.824390243902439, "grad_norm": 0.14698483049869537, "learning_rate": 6.544715447154472e-06, "loss": 0.9086, "mean_token_accuracy": 0.7235898375511169, "num_tokens": 4531551.0, "step": 338 }, { "entropy": 0.8944765329360962, "epoch": 0.8268292682926829, "grad_norm": 0.15387873351573944, "learning_rate": 6.531165311653117e-06, "loss": 0.8977, "mean_token_accuracy": 0.7176317572593689, "num_tokens": 4545400.0, "step": 339 }, { "entropy": 0.9095175266265869, "epoch": 0.8292682926829268, "grad_norm": 0.15829972922801971, "learning_rate": 6.517615176151762e-06, "loss": 0.8969, "mean_token_accuracy": 0.723007082939148, "num_tokens": 4559077.0, "step": 340 }, { "entropy": 0.9253937005996704, "epoch": 0.8317073170731707, "grad_norm": 0.1539793163537979, "learning_rate": 6.504065040650407e-06, "loss": 0.9268, "mean_token_accuracy": 0.7156819701194763, "num_tokens": 4572803.0, "step": 341 }, { "entropy": 0.8887916803359985, "epoch": 0.8341463414634146, "grad_norm": 0.16268229484558105, "learning_rate": 6.4905149051490525e-06, "loss": 0.8854, "mean_token_accuracy": 0.7258303761482239, "num_tokens": 4586307.0, "step": 342 }, { "entropy": 0.9081874489784241, "epoch": 0.8365853658536585, "grad_norm": 0.15919581055641174, "learning_rate": 6.476964769647697e-06, "loss": 0.9098, "mean_token_accuracy": 0.7165588140487671, "num_tokens": 4599458.0, "step": 343 }, { "entropy": 0.906166136264801, "epoch": 0.8390243902439024, "grad_norm": 0.15650396049022675, "learning_rate": 6.463414634146342e-06, "loss": 0.902, "mean_token_accuracy": 0.7163677215576172, "num_tokens": 4612854.0, "step": 344 }, { "entropy": 0.8984540700912476, "epoch": 0.8414634146341463, "grad_norm": 0.1492290049791336, "learning_rate": 6.449864498644986e-06, "loss": 0.8879, "mean_token_accuracy": 0.7269256711006165, "num_tokens": 4626229.0, "step": 345 }, { "entropy": 0.9049922227859497, "epoch": 0.8439024390243902, "grad_norm": 0.15556073188781738, "learning_rate": 6.436314363143632e-06, "loss": 0.8954, "mean_token_accuracy": 0.7196219563484192, "num_tokens": 4639577.0, "step": 346 }, { "entropy": 0.8850518465042114, "epoch": 0.8463414634146341, "grad_norm": 0.1551712155342102, "learning_rate": 6.422764227642278e-06, "loss": 0.8819, "mean_token_accuracy": 0.7270249724388123, "num_tokens": 4652803.0, "step": 347 }, { "entropy": 0.8971195220947266, "epoch": 0.848780487804878, "grad_norm": 0.16061030328273773, "learning_rate": 6.409214092140922e-06, "loss": 0.9152, "mean_token_accuracy": 0.7229515910148621, "num_tokens": 4666073.0, "step": 348 }, { "entropy": 0.8811110258102417, "epoch": 0.8512195121951219, "grad_norm": 0.16647042334079742, "learning_rate": 6.395663956639567e-06, "loss": 0.892, "mean_token_accuracy": 0.728188693523407, "num_tokens": 4679190.0, "step": 349 }, { "entropy": 0.8929190039634705, "epoch": 0.8536585365853658, "grad_norm": 0.16059380769729614, "learning_rate": 6.3821138211382115e-06, "loss": 0.8903, "mean_token_accuracy": 0.7205564975738525, "num_tokens": 4692647.0, "step": 350 }, { "entropy": 0.8734034299850464, "epoch": 0.8560975609756097, "grad_norm": 0.15726624429225922, "learning_rate": 6.368563685636857e-06, "loss": 0.8663, "mean_token_accuracy": 0.7282682061195374, "num_tokens": 4705996.0, "step": 351 }, { "entropy": 0.9022495746612549, "epoch": 0.8585365853658536, "grad_norm": 0.16244319081306458, "learning_rate": 6.355013550135501e-06, "loss": 0.9039, "mean_token_accuracy": 0.7216587066650391, "num_tokens": 4719420.0, "step": 352 }, { "entropy": 0.8873569965362549, "epoch": 0.8609756097560975, "grad_norm": 0.15533290803432465, "learning_rate": 6.341463414634147e-06, "loss": 0.8872, "mean_token_accuracy": 0.7262784838676453, "num_tokens": 4732694.0, "step": 353 }, { "entropy": 0.9040166139602661, "epoch": 0.8634146341463415, "grad_norm": 0.1683635264635086, "learning_rate": 6.3279132791327915e-06, "loss": 0.9086, "mean_token_accuracy": 0.7204293012619019, "num_tokens": 4745755.0, "step": 354 }, { "entropy": 0.8856945633888245, "epoch": 0.8658536585365854, "grad_norm": 0.16074056923389435, "learning_rate": 6.314363143631437e-06, "loss": 0.885, "mean_token_accuracy": 0.7246061563491821, "num_tokens": 4759101.0, "step": 355 }, { "entropy": 0.905910849571228, "epoch": 0.8682926829268293, "grad_norm": 0.15096408128738403, "learning_rate": 6.300813008130082e-06, "loss": 0.899, "mean_token_accuracy": 0.7240304350852966, "num_tokens": 4772912.0, "step": 356 }, { "entropy": 0.9093368649482727, "epoch": 0.8707317073170732, "grad_norm": 0.15921390056610107, "learning_rate": 6.287262872628726e-06, "loss": 0.9007, "mean_token_accuracy": 0.7238253355026245, "num_tokens": 4786166.0, "step": 357 }, { "entropy": 0.8879554271697998, "epoch": 0.8731707317073171, "grad_norm": 0.16032229363918304, "learning_rate": 6.273712737127372e-06, "loss": 0.8967, "mean_token_accuracy": 0.7268417477607727, "num_tokens": 4799471.0, "step": 358 }, { "entropy": 0.891460657119751, "epoch": 0.875609756097561, "grad_norm": 0.16416114568710327, "learning_rate": 6.260162601626017e-06, "loss": 0.8902, "mean_token_accuracy": 0.7235052585601807, "num_tokens": 4813386.0, "step": 359 }, { "entropy": 0.8875571489334106, "epoch": 0.8780487804878049, "grad_norm": 0.1605481505393982, "learning_rate": 6.246612466124662e-06, "loss": 0.8898, "mean_token_accuracy": 0.7255409955978394, "num_tokens": 4826526.0, "step": 360 }, { "entropy": 0.8935996294021606, "epoch": 0.8804878048780488, "grad_norm": 0.16389435529708862, "learning_rate": 6.233062330623306e-06, "loss": 0.91, "mean_token_accuracy": 0.7174138426780701, "num_tokens": 4840060.0, "step": 361 }, { "entropy": 0.8958407640457153, "epoch": 0.8829268292682927, "grad_norm": 0.16387997567653656, "learning_rate": 6.219512195121951e-06, "loss": 0.8974, "mean_token_accuracy": 0.72060626745224, "num_tokens": 4853140.0, "step": 362 }, { "entropy": 0.8770266771316528, "epoch": 0.8853658536585366, "grad_norm": 0.1663968414068222, "learning_rate": 6.205962059620597e-06, "loss": 0.8814, "mean_token_accuracy": 0.7238948941230774, "num_tokens": 4866209.0, "step": 363 }, { "entropy": 0.904643177986145, "epoch": 0.8878048780487805, "grad_norm": 0.15112806856632233, "learning_rate": 6.192411924119242e-06, "loss": 0.9089, "mean_token_accuracy": 0.7163041830062866, "num_tokens": 4879743.0, "step": 364 }, { "entropy": 0.89634770154953, "epoch": 0.8902439024390244, "grad_norm": 0.1654719114303589, "learning_rate": 6.178861788617887e-06, "loss": 0.894, "mean_token_accuracy": 0.7259781360626221, "num_tokens": 4893382.0, "step": 365 }, { "entropy": 0.9034420251846313, "epoch": 0.8926829268292683, "grad_norm": 0.15709993243217468, "learning_rate": 6.165311653116531e-06, "loss": 0.907, "mean_token_accuracy": 0.7218876481056213, "num_tokens": 4906515.0, "step": 366 }, { "entropy": 0.8903079032897949, "epoch": 0.8951219512195122, "grad_norm": 0.17142841219902039, "learning_rate": 6.1517615176151765e-06, "loss": 0.8922, "mean_token_accuracy": 0.7258428931236267, "num_tokens": 4919374.0, "step": 367 }, { "entropy": 0.9114763140678406, "epoch": 0.8975609756097561, "grad_norm": 0.16571395099163055, "learning_rate": 6.138211382113821e-06, "loss": 0.9181, "mean_token_accuracy": 0.7214821577072144, "num_tokens": 4932452.0, "step": 368 }, { "entropy": 0.8874707818031311, "epoch": 0.9, "grad_norm": 0.16487263143062592, "learning_rate": 6.124661246612467e-06, "loss": 0.8915, "mean_token_accuracy": 0.7204229831695557, "num_tokens": 4946085.0, "step": 369 }, { "entropy": 0.8861266374588013, "epoch": 0.9024390243902439, "grad_norm": 0.1598166823387146, "learning_rate": 6.111111111111112e-06, "loss": 0.8735, "mean_token_accuracy": 0.7311769127845764, "num_tokens": 4958838.0, "step": 370 }, { "entropy": 0.8907301425933838, "epoch": 0.9048780487804878, "grad_norm": 0.1626753956079483, "learning_rate": 6.0975609756097564e-06, "loss": 0.9115, "mean_token_accuracy": 0.7186935544013977, "num_tokens": 4972142.0, "step": 371 }, { "entropy": 0.895031213760376, "epoch": 0.9073170731707317, "grad_norm": 0.15703290700912476, "learning_rate": 6.084010840108402e-06, "loss": 0.8925, "mean_token_accuracy": 0.7240086793899536, "num_tokens": 4985499.0, "step": 372 }, { "entropy": 0.8968839645385742, "epoch": 0.9097560975609756, "grad_norm": 0.15938685834407806, "learning_rate": 6.070460704607046e-06, "loss": 0.8922, "mean_token_accuracy": 0.7231118083000183, "num_tokens": 4998755.0, "step": 373 }, { "entropy": 0.8882355690002441, "epoch": 0.9121951219512195, "grad_norm": 0.1686704307794571, "learning_rate": 6.056910569105692e-06, "loss": 0.8867, "mean_token_accuracy": 0.7230345010757446, "num_tokens": 5011834.0, "step": 374 }, { "entropy": 0.9107680320739746, "epoch": 0.9146341463414634, "grad_norm": 0.15755151212215424, "learning_rate": 6.043360433604336e-06, "loss": 0.9115, "mean_token_accuracy": 0.7232315540313721, "num_tokens": 5025280.0, "step": 375 }, { "entropy": 0.876611590385437, "epoch": 0.9170731707317074, "grad_norm": 0.16388185322284698, "learning_rate": 6.0298102981029816e-06, "loss": 0.8723, "mean_token_accuracy": 0.7300817966461182, "num_tokens": 5038500.0, "step": 376 }, { "entropy": 0.8733739852905273, "epoch": 0.9195121951219513, "grad_norm": 0.16187280416488647, "learning_rate": 6.016260162601627e-06, "loss": 0.8635, "mean_token_accuracy": 0.7310600280761719, "num_tokens": 5052006.0, "step": 377 }, { "entropy": 0.8965020179748535, "epoch": 0.9219512195121952, "grad_norm": 0.16080215573310852, "learning_rate": 6.002710027100271e-06, "loss": 0.8937, "mean_token_accuracy": 0.721447229385376, "num_tokens": 5065427.0, "step": 378 }, { "entropy": 0.8970279097557068, "epoch": 0.9243902439024391, "grad_norm": 0.1639380156993866, "learning_rate": 5.989159891598917e-06, "loss": 0.883, "mean_token_accuracy": 0.727632999420166, "num_tokens": 5079068.0, "step": 379 }, { "entropy": 0.8991611003875732, "epoch": 0.926829268292683, "grad_norm": 0.16831153631210327, "learning_rate": 5.9756097560975615e-06, "loss": 0.9014, "mean_token_accuracy": 0.7194920182228088, "num_tokens": 5092392.0, "step": 380 }, { "entropy": 0.8883278369903564, "epoch": 0.9292682926829269, "grad_norm": 0.1687973588705063, "learning_rate": 5.962059620596207e-06, "loss": 0.8735, "mean_token_accuracy": 0.7264938354492188, "num_tokens": 5105830.0, "step": 381 }, { "entropy": 0.8809381723403931, "epoch": 0.9317073170731708, "grad_norm": 0.16963472962379456, "learning_rate": 5.948509485094851e-06, "loss": 0.882, "mean_token_accuracy": 0.7262528538703918, "num_tokens": 5119395.0, "step": 382 }, { "entropy": 0.9021738767623901, "epoch": 0.9341463414634147, "grad_norm": 0.16875696182250977, "learning_rate": 5.934959349593496e-06, "loss": 0.9195, "mean_token_accuracy": 0.718323290348053, "num_tokens": 5133033.0, "step": 383 }, { "entropy": 0.8832775950431824, "epoch": 0.9365853658536586, "grad_norm": 0.16139884293079376, "learning_rate": 5.921409214092141e-06, "loss": 0.8663, "mean_token_accuracy": 0.7280119061470032, "num_tokens": 5146454.0, "step": 384 }, { "entropy": 0.9056813716888428, "epoch": 0.9390243902439024, "grad_norm": 0.16711100935935974, "learning_rate": 5.907859078590787e-06, "loss": 0.89, "mean_token_accuracy": 0.723343551158905, "num_tokens": 5160144.0, "step": 385 }, { "entropy": 0.8854928016662598, "epoch": 0.9414634146341463, "grad_norm": 0.15719208121299744, "learning_rate": 5.894308943089432e-06, "loss": 0.8874, "mean_token_accuracy": 0.7249353528022766, "num_tokens": 5173695.0, "step": 386 }, { "entropy": 0.9151058197021484, "epoch": 0.9439024390243902, "grad_norm": 0.17206765711307526, "learning_rate": 5.880758807588076e-06, "loss": 0.9246, "mean_token_accuracy": 0.7111825942993164, "num_tokens": 5187384.0, "step": 387 }, { "entropy": 0.8885694742202759, "epoch": 0.9463414634146341, "grad_norm": 0.15557175874710083, "learning_rate": 5.867208672086721e-06, "loss": 0.8783, "mean_token_accuracy": 0.7255944013595581, "num_tokens": 5201321.0, "step": 388 }, { "entropy": 0.8794446587562561, "epoch": 0.948780487804878, "grad_norm": 0.16666075587272644, "learning_rate": 5.853658536585366e-06, "loss": 0.8845, "mean_token_accuracy": 0.7247271537780762, "num_tokens": 5214622.0, "step": 389 }, { "entropy": 0.8968200087547302, "epoch": 0.9512195121951219, "grad_norm": 0.17773029208183289, "learning_rate": 5.840108401084012e-06, "loss": 0.9077, "mean_token_accuracy": 0.7226738929748535, "num_tokens": 5227922.0, "step": 390 }, { "entropy": 0.8937841653823853, "epoch": 0.9536585365853658, "grad_norm": 0.16367283463478088, "learning_rate": 5.826558265582656e-06, "loss": 0.8809, "mean_token_accuracy": 0.7214851975440979, "num_tokens": 5241808.0, "step": 391 }, { "entropy": 0.8804587125778198, "epoch": 0.9560975609756097, "grad_norm": 0.1632731407880783, "learning_rate": 5.813008130081301e-06, "loss": 0.8683, "mean_token_accuracy": 0.7282600998878479, "num_tokens": 5255451.0, "step": 392 }, { "entropy": 0.8958999514579773, "epoch": 0.9585365853658536, "grad_norm": 0.17145903408527374, "learning_rate": 5.7994579945799465e-06, "loss": 0.8949, "mean_token_accuracy": 0.7235816121101379, "num_tokens": 5268545.0, "step": 393 }, { "entropy": 0.8910573124885559, "epoch": 0.9609756097560975, "grad_norm": 0.17792750895023346, "learning_rate": 5.785907859078591e-06, "loss": 0.8947, "mean_token_accuracy": 0.7218443155288696, "num_tokens": 5281791.0, "step": 394 }, { "entropy": 0.8853224515914917, "epoch": 0.9634146341463414, "grad_norm": 0.1683335304260254, "learning_rate": 5.772357723577237e-06, "loss": 0.8731, "mean_token_accuracy": 0.7287229895591736, "num_tokens": 5295284.0, "step": 395 }, { "entropy": 0.894146740436554, "epoch": 0.9658536585365853, "grad_norm": 0.1783977597951889, "learning_rate": 5.758807588075881e-06, "loss": 0.8843, "mean_token_accuracy": 0.7266537547111511, "num_tokens": 5308225.0, "step": 396 }, { "entropy": 0.8935642242431641, "epoch": 0.9682926829268292, "grad_norm": 0.18579219281673431, "learning_rate": 5.7452574525745265e-06, "loss": 0.9289, "mean_token_accuracy": 0.7102810740470886, "num_tokens": 5321440.0, "step": 397 }, { "entropy": 0.868985652923584, "epoch": 0.9707317073170731, "grad_norm": 0.1684473305940628, "learning_rate": 5.731707317073171e-06, "loss": 0.85, "mean_token_accuracy": 0.7313686013221741, "num_tokens": 5334418.0, "step": 398 }, { "entropy": 0.8838146924972534, "epoch": 0.973170731707317, "grad_norm": 0.1632496416568756, "learning_rate": 5.718157181571816e-06, "loss": 0.8864, "mean_token_accuracy": 0.7268916964530945, "num_tokens": 5347795.0, "step": 399 }, { "entropy": 0.882776141166687, "epoch": 0.975609756097561, "grad_norm": 0.16958434879779816, "learning_rate": 5.704607046070462e-06, "loss": 0.8898, "mean_token_accuracy": 0.7269032001495361, "num_tokens": 5361341.0, "step": 400 }, { "entropy": 0.8883211016654968, "epoch": 0.9780487804878049, "grad_norm": 0.15948385000228882, "learning_rate": 5.691056910569106e-06, "loss": 0.8854, "mean_token_accuracy": 0.7242578864097595, "num_tokens": 5374866.0, "step": 401 }, { "entropy": 0.8896247744560242, "epoch": 0.9804878048780488, "grad_norm": 0.1636204868555069, "learning_rate": 5.677506775067752e-06, "loss": 0.8869, "mean_token_accuracy": 0.7276943325996399, "num_tokens": 5388466.0, "step": 402 }, { "entropy": 0.9205676317214966, "epoch": 0.9829268292682927, "grad_norm": 0.18203061819076538, "learning_rate": 5.663956639566396e-06, "loss": 0.9197, "mean_token_accuracy": 0.7194843888282776, "num_tokens": 5402524.0, "step": 403 }, { "entropy": 0.875140905380249, "epoch": 0.9853658536585366, "grad_norm": 0.17026175558567047, "learning_rate": 5.650406504065041e-06, "loss": 0.8884, "mean_token_accuracy": 0.7227595448493958, "num_tokens": 5415774.0, "step": 404 }, { "entropy": 0.8699055910110474, "epoch": 0.9878048780487805, "grad_norm": 0.15694531798362732, "learning_rate": 5.6368563685636855e-06, "loss": 0.8806, "mean_token_accuracy": 0.7257359623908997, "num_tokens": 5429514.0, "step": 405 }, { "entropy": 0.8878951072692871, "epoch": 0.9902439024390244, "grad_norm": 0.16797906160354614, "learning_rate": 5.6233062330623315e-06, "loss": 0.8888, "mean_token_accuracy": 0.7275060415267944, "num_tokens": 5442778.0, "step": 406 }, { "entropy": 0.876734733581543, "epoch": 0.9926829268292683, "grad_norm": 0.17915265262126923, "learning_rate": 5.609756097560977e-06, "loss": 0.8878, "mean_token_accuracy": 0.724197268486023, "num_tokens": 5456155.0, "step": 407 }, { "entropy": 0.8894374370574951, "epoch": 0.9951219512195122, "grad_norm": 0.16572211682796478, "learning_rate": 5.596205962059621e-06, "loss": 0.89, "mean_token_accuracy": 0.7255958318710327, "num_tokens": 5469724.0, "step": 408 }, { "entropy": 0.8932273387908936, "epoch": 0.9975609756097561, "grad_norm": 0.15642738342285156, "learning_rate": 5.582655826558266e-06, "loss": 0.8877, "mean_token_accuracy": 0.7234919667243958, "num_tokens": 5483566.0, "step": 409 }, { "entropy": 0.8865507245063782, "epoch": 1.0, "grad_norm": 0.17557752132415771, "learning_rate": 5.569105691056911e-06, "loss": 0.8676, "mean_token_accuracy": 0.729709267616272, "num_tokens": 5496790.0, "step": 410 }, { "entropy": 0.883284866809845, "epoch": 1.002439024390244, "grad_norm": 0.15459215641021729, "learning_rate": 5.555555555555557e-06, "loss": 0.8867, "mean_token_accuracy": 0.7233609557151794, "num_tokens": 5510564.0, "step": 411 }, { "entropy": 0.873902440071106, "epoch": 1.0048780487804878, "grad_norm": 0.17083869874477386, "learning_rate": 5.542005420054201e-06, "loss": 0.8604, "mean_token_accuracy": 0.7324744462966919, "num_tokens": 5523775.0, "step": 412 }, { "entropy": 0.8813484311103821, "epoch": 1.0073170731707317, "grad_norm": 0.17701290547847748, "learning_rate": 5.528455284552846e-06, "loss": 0.873, "mean_token_accuracy": 0.7278922200202942, "num_tokens": 5536852.0, "step": 413 }, { "entropy": 0.8950551748275757, "epoch": 1.0097560975609756, "grad_norm": 0.18133288621902466, "learning_rate": 5.5149051490514906e-06, "loss": 0.8765, "mean_token_accuracy": 0.7292779684066772, "num_tokens": 5549970.0, "step": 414 }, { "entropy": 0.881912350654602, "epoch": 1.0121951219512195, "grad_norm": 0.1715339571237564, "learning_rate": 5.501355013550136e-06, "loss": 0.8937, "mean_token_accuracy": 0.7215859889984131, "num_tokens": 5563782.0, "step": 415 }, { "entropy": 0.8737983703613281, "epoch": 1.0146341463414634, "grad_norm": 0.17756839096546173, "learning_rate": 5.487804878048781e-06, "loss": 0.8851, "mean_token_accuracy": 0.7261270880699158, "num_tokens": 5577129.0, "step": 416 }, { "entropy": 0.883063793182373, "epoch": 1.0170731707317073, "grad_norm": 0.1765228509902954, "learning_rate": 5.474254742547425e-06, "loss": 0.8864, "mean_token_accuracy": 0.7223793864250183, "num_tokens": 5590577.0, "step": 417 }, { "entropy": 0.8849365711212158, "epoch": 1.0195121951219512, "grad_norm": 0.1792328804731369, "learning_rate": 5.460704607046071e-06, "loss": 0.8766, "mean_token_accuracy": 0.7255821228027344, "num_tokens": 5603821.0, "step": 418 }, { "entropy": 0.8823648691177368, "epoch": 1.0219512195121951, "grad_norm": 0.173680379986763, "learning_rate": 5.447154471544716e-06, "loss": 0.8822, "mean_token_accuracy": 0.7273980975151062, "num_tokens": 5616889.0, "step": 419 }, { "entropy": 0.8869985342025757, "epoch": 1.024390243902439, "grad_norm": 0.17492908239364624, "learning_rate": 5.433604336043361e-06, "loss": 0.9018, "mean_token_accuracy": 0.7217662334442139, "num_tokens": 5630063.0, "step": 420 }, { "entropy": 0.8956865072250366, "epoch": 1.026829268292683, "grad_norm": 0.16189217567443848, "learning_rate": 5.420054200542005e-06, "loss": 0.887, "mean_token_accuracy": 0.7262184619903564, "num_tokens": 5643703.0, "step": 421 }, { "entropy": 0.8691190481185913, "epoch": 1.0292682926829269, "grad_norm": 0.17272132635116577, "learning_rate": 5.4065040650406504e-06, "loss": 0.8765, "mean_token_accuracy": 0.7276405096054077, "num_tokens": 5657315.0, "step": 422 }, { "entropy": 0.8758895397186279, "epoch": 1.0317073170731708, "grad_norm": 0.17333146929740906, "learning_rate": 5.3929539295392965e-06, "loss": 0.8742, "mean_token_accuracy": 0.7282917499542236, "num_tokens": 5671070.0, "step": 423 }, { "entropy": 0.8903429508209229, "epoch": 1.0341463414634147, "grad_norm": 0.1801253706216812, "learning_rate": 5.379403794037941e-06, "loss": 0.8842, "mean_token_accuracy": 0.7301153540611267, "num_tokens": 5684262.0, "step": 424 }, { "entropy": 0.8774839639663696, "epoch": 1.0365853658536586, "grad_norm": 0.1836852729320526, "learning_rate": 5.365853658536586e-06, "loss": 0.8781, "mean_token_accuracy": 0.7317860722541809, "num_tokens": 5697592.0, "step": 425 }, { "entropy": 0.898011326789856, "epoch": 1.0390243902439025, "grad_norm": 0.17385412752628326, "learning_rate": 5.35230352303523e-06, "loss": 0.8899, "mean_token_accuracy": 0.724575936794281, "num_tokens": 5710991.0, "step": 426 }, { "entropy": 0.885576069355011, "epoch": 1.0414634146341464, "grad_norm": 0.16952155530452728, "learning_rate": 5.338753387533876e-06, "loss": 0.8831, "mean_token_accuracy": 0.7247596383094788, "num_tokens": 5724319.0, "step": 427 }, { "entropy": 0.8738988041877747, "epoch": 1.0439024390243903, "grad_norm": 0.18119633197784424, "learning_rate": 5.32520325203252e-06, "loss": 0.8629, "mean_token_accuracy": 0.7306736707687378, "num_tokens": 5737620.0, "step": 428 }, { "entropy": 0.8968448638916016, "epoch": 1.0463414634146342, "grad_norm": 0.189066544175148, "learning_rate": 5.311653116531166e-06, "loss": 0.8896, "mean_token_accuracy": 0.7251328825950623, "num_tokens": 5750806.0, "step": 429 }, { "entropy": 0.8695570230484009, "epoch": 1.048780487804878, "grad_norm": 0.16916069388389587, "learning_rate": 5.298102981029811e-06, "loss": 0.8897, "mean_token_accuracy": 0.7256984710693359, "num_tokens": 5764566.0, "step": 430 }, { "entropy": 0.8742542266845703, "epoch": 1.051219512195122, "grad_norm": 0.1751270592212677, "learning_rate": 5.2845528455284555e-06, "loss": 0.882, "mean_token_accuracy": 0.727017879486084, "num_tokens": 5778136.0, "step": 431 }, { "entropy": 0.8784512281417847, "epoch": 1.053658536585366, "grad_norm": 0.16934418678283691, "learning_rate": 5.271002710027101e-06, "loss": 0.8728, "mean_token_accuracy": 0.729217529296875, "num_tokens": 5791661.0, "step": 432 }, { "entropy": 0.8749353885650635, "epoch": 1.0560975609756098, "grad_norm": 0.18582025170326233, "learning_rate": 5.257452574525745e-06, "loss": 0.8637, "mean_token_accuracy": 0.7266749143600464, "num_tokens": 5804603.0, "step": 433 }, { "entropy": 0.8723912239074707, "epoch": 1.0585365853658537, "grad_norm": 0.18588410317897797, "learning_rate": 5.243902439024391e-06, "loss": 0.8872, "mean_token_accuracy": 0.7275745272636414, "num_tokens": 5817874.0, "step": 434 }, { "entropy": 0.8809516429901123, "epoch": 1.0609756097560976, "grad_norm": 0.174485445022583, "learning_rate": 5.2303523035230355e-06, "loss": 0.878, "mean_token_accuracy": 0.7257272601127625, "num_tokens": 5831125.0, "step": 435 }, { "entropy": 0.8659344911575317, "epoch": 1.0634146341463415, "grad_norm": 0.17202284932136536, "learning_rate": 5.216802168021681e-06, "loss": 0.8644, "mean_token_accuracy": 0.731433629989624, "num_tokens": 5844687.0, "step": 436 }, { "entropy": 0.885354220867157, "epoch": 1.0658536585365854, "grad_norm": 0.1710902750492096, "learning_rate": 5.203252032520326e-06, "loss": 0.8919, "mean_token_accuracy": 0.7240340709686279, "num_tokens": 5858317.0, "step": 437 }, { "entropy": 0.8834629654884338, "epoch": 1.0682926829268293, "grad_norm": 0.17878998816013336, "learning_rate": 5.18970189701897e-06, "loss": 0.8884, "mean_token_accuracy": 0.724520742893219, "num_tokens": 5871844.0, "step": 438 }, { "entropy": 0.8910503387451172, "epoch": 1.0707317073170732, "grad_norm": 0.17803862690925598, "learning_rate": 5.176151761517616e-06, "loss": 0.8887, "mean_token_accuracy": 0.7292178869247437, "num_tokens": 5885694.0, "step": 439 }, { "entropy": 0.8749967813491821, "epoch": 1.0731707317073171, "grad_norm": 0.18004469573497772, "learning_rate": 5.162601626016261e-06, "loss": 0.8691, "mean_token_accuracy": 0.7276826500892639, "num_tokens": 5898794.0, "step": 440 }, { "entropy": 0.8866884708404541, "epoch": 1.075609756097561, "grad_norm": 0.1842956691980362, "learning_rate": 5.149051490514906e-06, "loss": 0.8972, "mean_token_accuracy": 0.724666953086853, "num_tokens": 5912172.0, "step": 441 }, { "entropy": 0.878664493560791, "epoch": 1.078048780487805, "grad_norm": 0.18605175614356995, "learning_rate": 5.13550135501355e-06, "loss": 0.8696, "mean_token_accuracy": 0.7282981276512146, "num_tokens": 5925309.0, "step": 442 }, { "entropy": 0.8751529455184937, "epoch": 1.0804878048780489, "grad_norm": 0.1772121638059616, "learning_rate": 5.121951219512195e-06, "loss": 0.8758, "mean_token_accuracy": 0.7304328083992004, "num_tokens": 5938357.0, "step": 443 }, { "entropy": 0.8884094953536987, "epoch": 1.0829268292682928, "grad_norm": 0.17419125139713287, "learning_rate": 5.10840108401084e-06, "loss": 0.8761, "mean_token_accuracy": 0.7276250720024109, "num_tokens": 5952306.0, "step": 444 }, { "entropy": 0.8670481443405151, "epoch": 1.0853658536585367, "grad_norm": 0.18553416430950165, "learning_rate": 5.094850948509486e-06, "loss": 0.8756, "mean_token_accuracy": 0.7303195595741272, "num_tokens": 5966435.0, "step": 445 }, { "entropy": 0.8847004771232605, "epoch": 1.0878048780487806, "grad_norm": 0.17910823225975037, "learning_rate": 5.081300813008131e-06, "loss": 0.8986, "mean_token_accuracy": 0.7208833694458008, "num_tokens": 5979356.0, "step": 446 }, { "entropy": 0.8879530429840088, "epoch": 1.0902439024390245, "grad_norm": 0.19892668724060059, "learning_rate": 5.067750677506775e-06, "loss": 0.8864, "mean_token_accuracy": 0.7233535647392273, "num_tokens": 5993220.0, "step": 447 }, { "entropy": 0.8809808492660522, "epoch": 1.0926829268292684, "grad_norm": 0.17457018792629242, "learning_rate": 5.0542005420054205e-06, "loss": 0.8767, "mean_token_accuracy": 0.7264518737792969, "num_tokens": 6007080.0, "step": 448 }, { "entropy": 0.8835265636444092, "epoch": 1.0951219512195123, "grad_norm": 0.17747731506824493, "learning_rate": 5.040650406504065e-06, "loss": 0.8768, "mean_token_accuracy": 0.7282616496086121, "num_tokens": 6020701.0, "step": 449 }, { "entropy": 0.8794373273849487, "epoch": 1.0975609756097562, "grad_norm": 0.18246370553970337, "learning_rate": 5.027100271002711e-06, "loss": 0.8808, "mean_token_accuracy": 0.7193954586982727, "num_tokens": 6034612.0, "step": 450 }, { "entropy": 0.8770255446434021, "epoch": 1.1, "grad_norm": 0.16051927208900452, "learning_rate": 5.013550135501355e-06, "loss": 0.8782, "mean_token_accuracy": 0.726668119430542, "num_tokens": 6048161.0, "step": 451 }, { "entropy": 0.9005379676818848, "epoch": 1.102439024390244, "grad_norm": 0.17038728296756744, "learning_rate": 5e-06, "loss": 0.8964, "mean_token_accuracy": 0.7211425304412842, "num_tokens": 6061761.0, "step": 452 }, { "entropy": 0.8716856837272644, "epoch": 1.104878048780488, "grad_norm": 0.18405020236968994, "learning_rate": 4.986449864498646e-06, "loss": 0.871, "mean_token_accuracy": 0.7311229705810547, "num_tokens": 6075259.0, "step": 453 }, { "entropy": 0.8855595588684082, "epoch": 1.1073170731707318, "grad_norm": 0.1729445457458496, "learning_rate": 4.97289972899729e-06, "loss": 0.8739, "mean_token_accuracy": 0.7265796661376953, "num_tokens": 6088917.0, "step": 454 }, { "entropy": 0.8742420673370361, "epoch": 1.1097560975609757, "grad_norm": 0.17936216294765472, "learning_rate": 4.959349593495935e-06, "loss": 0.8636, "mean_token_accuracy": 0.7290731072425842, "num_tokens": 6102516.0, "step": 455 }, { "entropy": 0.8735711574554443, "epoch": 1.1121951219512196, "grad_norm": 0.18746447563171387, "learning_rate": 4.94579945799458e-06, "loss": 0.8505, "mean_token_accuracy": 0.7305099368095398, "num_tokens": 6116180.0, "step": 456 }, { "entropy": 0.8641989231109619, "epoch": 1.1146341463414635, "grad_norm": 0.1635252684354782, "learning_rate": 4.9322493224932255e-06, "loss": 0.8549, "mean_token_accuracy": 0.732119619846344, "num_tokens": 6130038.0, "step": 457 }, { "entropy": 0.8750979900360107, "epoch": 1.1170731707317074, "grad_norm": 0.1839144378900528, "learning_rate": 4.918699186991871e-06, "loss": 0.8908, "mean_token_accuracy": 0.7277798652648926, "num_tokens": 6143319.0, "step": 458 }, { "entropy": 0.8701959252357483, "epoch": 1.1195121951219513, "grad_norm": 0.1786291003227234, "learning_rate": 4.905149051490515e-06, "loss": 0.8599, "mean_token_accuracy": 0.7290351390838623, "num_tokens": 6156798.0, "step": 459 }, { "entropy": 0.8633676171302795, "epoch": 1.1219512195121952, "grad_norm": 0.16640040278434753, "learning_rate": 4.89159891598916e-06, "loss": 0.8629, "mean_token_accuracy": 0.7302494645118713, "num_tokens": 6170282.0, "step": 460 }, { "entropy": 0.8711209297180176, "epoch": 1.1243902439024391, "grad_norm": 0.19053176045417786, "learning_rate": 4.8780487804878055e-06, "loss": 0.8654, "mean_token_accuracy": 0.7281391620635986, "num_tokens": 6183518.0, "step": 461 }, { "entropy": 0.8640310764312744, "epoch": 1.126829268292683, "grad_norm": 0.17878729104995728, "learning_rate": 4.86449864498645e-06, "loss": 0.8617, "mean_token_accuracy": 0.7309045791625977, "num_tokens": 6197176.0, "step": 462 }, { "entropy": 0.8896546363830566, "epoch": 1.129268292682927, "grad_norm": 0.18125811219215393, "learning_rate": 4.850948509485095e-06, "loss": 0.9083, "mean_token_accuracy": 0.7183119058609009, "num_tokens": 6210888.0, "step": 463 }, { "entropy": 0.8741787672042847, "epoch": 1.1317073170731708, "grad_norm": 0.17769162356853485, "learning_rate": 4.83739837398374e-06, "loss": 0.8768, "mean_token_accuracy": 0.7282008528709412, "num_tokens": 6224127.0, "step": 464 }, { "entropy": 0.8620750904083252, "epoch": 1.1341463414634148, "grad_norm": 0.19808581471443176, "learning_rate": 4.823848238482385e-06, "loss": 0.8799, "mean_token_accuracy": 0.7266132235527039, "num_tokens": 6237238.0, "step": 465 }, { "entropy": 0.8672773838043213, "epoch": 1.1365853658536587, "grad_norm": 0.18568822741508484, "learning_rate": 4.810298102981031e-06, "loss": 0.8891, "mean_token_accuracy": 0.7204229235649109, "num_tokens": 6250778.0, "step": 466 }, { "entropy": 0.8523983359336853, "epoch": 1.1390243902439026, "grad_norm": 0.17448151111602783, "learning_rate": 4.796747967479675e-06, "loss": 0.8647, "mean_token_accuracy": 0.7291819453239441, "num_tokens": 6264412.0, "step": 467 }, { "entropy": 0.8495972156524658, "epoch": 1.1414634146341462, "grad_norm": 0.16932238638401031, "learning_rate": 4.78319783197832e-06, "loss": 0.8446, "mean_token_accuracy": 0.7364223599433899, "num_tokens": 6277593.0, "step": 468 }, { "entropy": 0.881886899471283, "epoch": 1.1439024390243901, "grad_norm": 0.1763680875301361, "learning_rate": 4.769647696476965e-06, "loss": 0.8899, "mean_token_accuracy": 0.7244584560394287, "num_tokens": 6290950.0, "step": 469 }, { "entropy": 0.8751710057258606, "epoch": 1.146341463414634, "grad_norm": 0.19120320677757263, "learning_rate": 4.75609756097561e-06, "loss": 0.886, "mean_token_accuracy": 0.7226884365081787, "num_tokens": 6304193.0, "step": 470 }, { "entropy": 0.876998782157898, "epoch": 1.148780487804878, "grad_norm": 0.1712970733642578, "learning_rate": 4.742547425474256e-06, "loss": 0.8769, "mean_token_accuracy": 0.7278986573219299, "num_tokens": 6317862.0, "step": 471 }, { "entropy": 0.8527517318725586, "epoch": 1.1512195121951219, "grad_norm": 0.18993927538394928, "learning_rate": 4.7289972899729e-06, "loss": 0.8733, "mean_token_accuracy": 0.7293280363082886, "num_tokens": 6330661.0, "step": 472 }, { "entropy": 0.8713936805725098, "epoch": 1.1536585365853658, "grad_norm": 0.18412742018699646, "learning_rate": 4.715447154471545e-06, "loss": 0.8874, "mean_token_accuracy": 0.7243731021881104, "num_tokens": 6344315.0, "step": 473 }, { "entropy": 0.874845027923584, "epoch": 1.1560975609756097, "grad_norm": 0.16824601590633392, "learning_rate": 4.7018970189701905e-06, "loss": 0.8768, "mean_token_accuracy": 0.7322383522987366, "num_tokens": 6357421.0, "step": 474 }, { "entropy": 0.8650723695755005, "epoch": 1.1585365853658536, "grad_norm": 0.18967200815677643, "learning_rate": 4.688346883468835e-06, "loss": 0.8619, "mean_token_accuracy": 0.731358528137207, "num_tokens": 6371143.0, "step": 475 }, { "entropy": 0.8843879699707031, "epoch": 1.1609756097560975, "grad_norm": 0.1760745793581009, "learning_rate": 4.67479674796748e-06, "loss": 0.8785, "mean_token_accuracy": 0.7255582213401794, "num_tokens": 6384415.0, "step": 476 }, { "entropy": 0.8725862503051758, "epoch": 1.1634146341463414, "grad_norm": 0.18959973752498627, "learning_rate": 4.661246612466125e-06, "loss": 0.8468, "mean_token_accuracy": 0.732191801071167, "num_tokens": 6397571.0, "step": 477 }, { "entropy": 0.860714316368103, "epoch": 1.1658536585365853, "grad_norm": 0.1788821965456009, "learning_rate": 4.64769647696477e-06, "loss": 0.8572, "mean_token_accuracy": 0.7313535809516907, "num_tokens": 6410619.0, "step": 478 }, { "entropy": 0.8556495904922485, "epoch": 1.1682926829268292, "grad_norm": 0.19264046847820282, "learning_rate": 4.634146341463416e-06, "loss": 0.8415, "mean_token_accuracy": 0.7346753478050232, "num_tokens": 6423849.0, "step": 479 }, { "entropy": 0.879152238368988, "epoch": 1.170731707317073, "grad_norm": 0.17785273492336273, "learning_rate": 4.62059620596206e-06, "loss": 0.8609, "mean_token_accuracy": 0.733600378036499, "num_tokens": 6437097.0, "step": 480 }, { "entropy": 0.8685513734817505, "epoch": 1.173170731707317, "grad_norm": 0.1842828094959259, "learning_rate": 4.607046070460705e-06, "loss": 0.8557, "mean_token_accuracy": 0.7308443784713745, "num_tokens": 6450425.0, "step": 481 }, { "entropy": 0.8665934801101685, "epoch": 1.175609756097561, "grad_norm": 0.18133185803890228, "learning_rate": 4.59349593495935e-06, "loss": 0.8542, "mean_token_accuracy": 0.7300595045089722, "num_tokens": 6463555.0, "step": 482 }, { "entropy": 0.8803141117095947, "epoch": 1.1780487804878048, "grad_norm": 0.1882920265197754, "learning_rate": 4.579945799457995e-06, "loss": 0.8695, "mean_token_accuracy": 0.7308064699172974, "num_tokens": 6477000.0, "step": 483 }, { "entropy": 0.8705790042877197, "epoch": 1.1804878048780487, "grad_norm": 0.16724060475826263, "learning_rate": 4.56639566395664e-06, "loss": 0.8696, "mean_token_accuracy": 0.7313664555549622, "num_tokens": 6490540.0, "step": 484 }, { "entropy": 0.8668768405914307, "epoch": 1.1829268292682926, "grad_norm": 0.18207673728466034, "learning_rate": 4.552845528455285e-06, "loss": 0.8706, "mean_token_accuracy": 0.7298742532730103, "num_tokens": 6504394.0, "step": 485 }, { "entropy": 0.857469916343689, "epoch": 1.1853658536585365, "grad_norm": 0.17468515038490295, "learning_rate": 4.53929539295393e-06, "loss": 0.8595, "mean_token_accuracy": 0.7317895293235779, "num_tokens": 6518358.0, "step": 486 }, { "entropy": 0.868085503578186, "epoch": 1.1878048780487804, "grad_norm": 0.18118400871753693, "learning_rate": 4.5257452574525755e-06, "loss": 0.8822, "mean_token_accuracy": 0.7288097143173218, "num_tokens": 6531682.0, "step": 487 }, { "entropy": 0.875089704990387, "epoch": 1.1902439024390243, "grad_norm": 0.19479995965957642, "learning_rate": 4.51219512195122e-06, "loss": 0.898, "mean_token_accuracy": 0.7220537066459656, "num_tokens": 6545215.0, "step": 488 }, { "entropy": 0.8687515258789062, "epoch": 1.1926829268292682, "grad_norm": 0.18653246760368347, "learning_rate": 4.498644986449865e-06, "loss": 0.8582, "mean_token_accuracy": 0.7328128814697266, "num_tokens": 6558424.0, "step": 489 }, { "entropy": 0.8572927713394165, "epoch": 1.1951219512195121, "grad_norm": 0.17981292307376862, "learning_rate": 4.485094850948509e-06, "loss": 0.8593, "mean_token_accuracy": 0.7302917242050171, "num_tokens": 6571810.0, "step": 490 }, { "entropy": 0.8861751556396484, "epoch": 1.197560975609756, "grad_norm": 0.1817339062690735, "learning_rate": 4.471544715447155e-06, "loss": 0.8928, "mean_token_accuracy": 0.7191566824913025, "num_tokens": 6584965.0, "step": 491 }, { "entropy": 0.8445186614990234, "epoch": 1.2, "grad_norm": 0.17858710885047913, "learning_rate": 4.4579945799458e-06, "loss": 0.8465, "mean_token_accuracy": 0.7365540266036987, "num_tokens": 6598684.0, "step": 492 }, { "entropy": 0.8746671676635742, "epoch": 1.2024390243902439, "grad_norm": 0.17243576049804688, "learning_rate": 4.444444444444444e-06, "loss": 0.8859, "mean_token_accuracy": 0.7267000079154968, "num_tokens": 6612509.0, "step": 493 }, { "entropy": 0.8706621527671814, "epoch": 1.2048780487804878, "grad_norm": 0.19680029153823853, "learning_rate": 4.43089430894309e-06, "loss": 0.8837, "mean_token_accuracy": 0.7250975370407104, "num_tokens": 6626108.0, "step": 494 }, { "entropy": 0.8592489957809448, "epoch": 1.2073170731707317, "grad_norm": 0.17318998277187347, "learning_rate": 4.4173441734417345e-06, "loss": 0.8403, "mean_token_accuracy": 0.7346216440200806, "num_tokens": 6639682.0, "step": 495 }, { "entropy": 0.8765473365783691, "epoch": 1.2097560975609756, "grad_norm": 0.19630788266658783, "learning_rate": 4.40379403794038e-06, "loss": 0.8858, "mean_token_accuracy": 0.7274890542030334, "num_tokens": 6652725.0, "step": 496 }, { "entropy": 0.8659340143203735, "epoch": 1.2121951219512195, "grad_norm": 0.18291766941547394, "learning_rate": 4.390243902439025e-06, "loss": 0.853, "mean_token_accuracy": 0.7339065670967102, "num_tokens": 6666116.0, "step": 497 }, { "entropy": 0.8639433979988098, "epoch": 1.2146341463414634, "grad_norm": 0.19510066509246826, "learning_rate": 4.376693766937669e-06, "loss": 0.8537, "mean_token_accuracy": 0.7323106527328491, "num_tokens": 6679756.0, "step": 498 }, { "entropy": 0.8815720081329346, "epoch": 1.2170731707317073, "grad_norm": 0.1966511309146881, "learning_rate": 4.3631436314363145e-06, "loss": 0.8854, "mean_token_accuracy": 0.7242141962051392, "num_tokens": 6692880.0, "step": 499 }, { "entropy": 0.8695896863937378, "epoch": 1.2195121951219512, "grad_norm": 0.17670577764511108, "learning_rate": 4.34959349593496e-06, "loss": 0.8709, "mean_token_accuracy": 0.731483519077301, "num_tokens": 6706519.0, "step": 500 }, { "entropy": 0.8815171718597412, "epoch": 1.221951219512195, "grad_norm": 0.18315380811691284, "learning_rate": 4.336043360433605e-06, "loss": 0.8811, "mean_token_accuracy": 0.7204508185386658, "num_tokens": 6720021.0, "step": 501 }, { "entropy": 0.8691625595092773, "epoch": 1.224390243902439, "grad_norm": 0.18377022445201874, "learning_rate": 4.32249322493225e-06, "loss": 0.8559, "mean_token_accuracy": 0.7272188067436218, "num_tokens": 6733524.0, "step": 502 }, { "entropy": 0.8703157305717468, "epoch": 1.226829268292683, "grad_norm": 0.19667857885360718, "learning_rate": 4.308943089430894e-06, "loss": 0.8677, "mean_token_accuracy": 0.7263264060020447, "num_tokens": 6746413.0, "step": 503 }, { "entropy": 0.9045153856277466, "epoch": 1.2292682926829268, "grad_norm": 0.18945592641830444, "learning_rate": 4.29539295392954e-06, "loss": 0.9142, "mean_token_accuracy": 0.7132720947265625, "num_tokens": 6759818.0, "step": 504 }, { "entropy": 0.8753666281700134, "epoch": 1.2317073170731707, "grad_norm": 0.18175500631332397, "learning_rate": 4.281842818428185e-06, "loss": 0.8755, "mean_token_accuracy": 0.728762686252594, "num_tokens": 6773501.0, "step": 505 }, { "entropy": 0.876529335975647, "epoch": 1.2341463414634146, "grad_norm": 0.17408494651317596, "learning_rate": 4.268292682926829e-06, "loss": 0.878, "mean_token_accuracy": 0.7268484234809875, "num_tokens": 6787015.0, "step": 506 }, { "entropy": 0.8460504412651062, "epoch": 1.2365853658536585, "grad_norm": 0.1703876405954361, "learning_rate": 4.254742547425474e-06, "loss": 0.8404, "mean_token_accuracy": 0.7368658781051636, "num_tokens": 6800317.0, "step": 507 }, { "entropy": 0.887944757938385, "epoch": 1.2390243902439024, "grad_norm": 0.1907789558172226, "learning_rate": 4.2411924119241196e-06, "loss": 0.8899, "mean_token_accuracy": 0.7258834838867188, "num_tokens": 6813944.0, "step": 508 }, { "entropy": 0.8727298974990845, "epoch": 1.2414634146341463, "grad_norm": 0.20074300467967987, "learning_rate": 4.227642276422765e-06, "loss": 0.8858, "mean_token_accuracy": 0.7224164605140686, "num_tokens": 6827401.0, "step": 509 }, { "entropy": 0.8581738471984863, "epoch": 1.2439024390243902, "grad_norm": 0.18092957139015198, "learning_rate": 4.21409214092141e-06, "loss": 0.8584, "mean_token_accuracy": 0.7286903262138367, "num_tokens": 6840756.0, "step": 510 }, { "entropy": 0.8607147932052612, "epoch": 1.2463414634146341, "grad_norm": 0.17750075459480286, "learning_rate": 4.200542005420054e-06, "loss": 0.873, "mean_token_accuracy": 0.7288525700569153, "num_tokens": 6854237.0, "step": 511 }, { "entropy": 0.879986584186554, "epoch": 1.248780487804878, "grad_norm": 0.17938187718391418, "learning_rate": 4.1869918699186995e-06, "loss": 0.8704, "mean_token_accuracy": 0.7252417206764221, "num_tokens": 6867905.0, "step": 512 }, { "entropy": 0.8603850603103638, "epoch": 1.251219512195122, "grad_norm": 0.1875443160533905, "learning_rate": 4.173441734417345e-06, "loss": 0.8487, "mean_token_accuracy": 0.7376420497894287, "num_tokens": 6881738.0, "step": 513 }, { "entropy": 0.8875347375869751, "epoch": 1.2536585365853659, "grad_norm": 0.1712435483932495, "learning_rate": 4.159891598915989e-06, "loss": 0.8811, "mean_token_accuracy": 0.7265061140060425, "num_tokens": 6894917.0, "step": 514 }, { "entropy": 0.8665733337402344, "epoch": 1.2560975609756098, "grad_norm": 0.19203098118305206, "learning_rate": 4.146341463414634e-06, "loss": 0.862, "mean_token_accuracy": 0.734067440032959, "num_tokens": 6908192.0, "step": 515 }, { "entropy": 0.8782904148101807, "epoch": 1.2585365853658537, "grad_norm": 0.18738849461078644, "learning_rate": 4.1327913279132794e-06, "loss": 0.8662, "mean_token_accuracy": 0.7297396659851074, "num_tokens": 6921769.0, "step": 516 }, { "entropy": 0.8696860074996948, "epoch": 1.2609756097560976, "grad_norm": 0.18507178127765656, "learning_rate": 4.119241192411925e-06, "loss": 0.8569, "mean_token_accuracy": 0.7358604073524475, "num_tokens": 6935081.0, "step": 517 }, { "entropy": 0.853559136390686, "epoch": 1.2634146341463415, "grad_norm": 0.1817474067211151, "learning_rate": 4.10569105691057e-06, "loss": 0.8708, "mean_token_accuracy": 0.7304454445838928, "num_tokens": 6948994.0, "step": 518 }, { "entropy": 0.8644067049026489, "epoch": 1.2658536585365854, "grad_norm": 0.18193352222442627, "learning_rate": 4.092140921409214e-06, "loss": 0.8687, "mean_token_accuracy": 0.7295045256614685, "num_tokens": 6962452.0, "step": 519 }, { "entropy": 0.8609942197799683, "epoch": 1.2682926829268293, "grad_norm": 0.18788494169712067, "learning_rate": 4.078590785907859e-06, "loss": 0.8493, "mean_token_accuracy": 0.729697048664093, "num_tokens": 6975705.0, "step": 520 }, { "entropy": 0.8733319044113159, "epoch": 1.2707317073170732, "grad_norm": 0.17995619773864746, "learning_rate": 4.0650406504065046e-06, "loss": 0.8664, "mean_token_accuracy": 0.7323063015937805, "num_tokens": 6988833.0, "step": 521 }, { "entropy": 0.8484479188919067, "epoch": 1.273170731707317, "grad_norm": 0.1766081154346466, "learning_rate": 4.051490514905149e-06, "loss": 0.8423, "mean_token_accuracy": 0.7349044680595398, "num_tokens": 7002512.0, "step": 522 }, { "entropy": 0.8707907795906067, "epoch": 1.275609756097561, "grad_norm": 0.1928197741508484, "learning_rate": 4.037940379403794e-06, "loss": 0.8637, "mean_token_accuracy": 0.7341483235359192, "num_tokens": 7016107.0, "step": 523 }, { "entropy": 0.8589579463005066, "epoch": 1.278048780487805, "grad_norm": 0.17874617874622345, "learning_rate": 4.024390243902439e-06, "loss": 0.8523, "mean_token_accuracy": 0.7354934811592102, "num_tokens": 7029548.0, "step": 524 }, { "entropy": 0.868780255317688, "epoch": 1.2804878048780488, "grad_norm": 0.17817656695842743, "learning_rate": 4.0108401084010845e-06, "loss": 0.8679, "mean_token_accuracy": 0.7251309156417847, "num_tokens": 7043316.0, "step": 525 }, { "entropy": 0.8748735189437866, "epoch": 1.2829268292682927, "grad_norm": 0.17905448377132416, "learning_rate": 3.99728997289973e-06, "loss": 0.8801, "mean_token_accuracy": 0.7233904600143433, "num_tokens": 7057218.0, "step": 526 }, { "entropy": 0.8642637729644775, "epoch": 1.2853658536585366, "grad_norm": 0.1892337054014206, "learning_rate": 3.983739837398374e-06, "loss": 0.8672, "mean_token_accuracy": 0.7301107048988342, "num_tokens": 7070784.0, "step": 527 }, { "entropy": 0.8635598421096802, "epoch": 1.2878048780487805, "grad_norm": 0.1739298403263092, "learning_rate": 3.970189701897019e-06, "loss": 0.8588, "mean_token_accuracy": 0.729408323764801, "num_tokens": 7084422.0, "step": 528 }, { "entropy": 0.8527634739875793, "epoch": 1.2902439024390244, "grad_norm": 0.1835845410823822, "learning_rate": 3.9566395663956644e-06, "loss": 0.8617, "mean_token_accuracy": 0.726246178150177, "num_tokens": 7097899.0, "step": 529 }, { "entropy": 0.8675320148468018, "epoch": 1.2926829268292683, "grad_norm": 0.18817897140979767, "learning_rate": 3.943089430894309e-06, "loss": 0.8732, "mean_token_accuracy": 0.7264676690101624, "num_tokens": 7111014.0, "step": 530 }, { "entropy": 0.8717451095581055, "epoch": 1.2951219512195122, "grad_norm": 0.18769040703773499, "learning_rate": 3.929539295392954e-06, "loss": 0.8794, "mean_token_accuracy": 0.7313988208770752, "num_tokens": 7124470.0, "step": 531 }, { "entropy": 0.8724467754364014, "epoch": 1.2975609756097561, "grad_norm": 0.19329647719860077, "learning_rate": 3.915989159891599e-06, "loss": 0.8889, "mean_token_accuracy": 0.7284098863601685, "num_tokens": 7137837.0, "step": 532 }, { "entropy": 0.8455716967582703, "epoch": 1.3, "grad_norm": 0.18541646003723145, "learning_rate": 3.902439024390244e-06, "loss": 0.8288, "mean_token_accuracy": 0.7398167252540588, "num_tokens": 7150840.0, "step": 533 }, { "entropy": 0.854907751083374, "epoch": 1.302439024390244, "grad_norm": 0.18639497458934784, "learning_rate": 3.88888888888889e-06, "loss": 0.8579, "mean_token_accuracy": 0.7294135093688965, "num_tokens": 7164275.0, "step": 534 }, { "entropy": 0.8669297695159912, "epoch": 1.3048780487804879, "grad_norm": 0.20313623547554016, "learning_rate": 3.875338753387534e-06, "loss": 0.8625, "mean_token_accuracy": 0.7300493121147156, "num_tokens": 7178075.0, "step": 535 }, { "entropy": 0.8517297506332397, "epoch": 1.3073170731707318, "grad_norm": 0.19427485764026642, "learning_rate": 3.861788617886179e-06, "loss": 0.8439, "mean_token_accuracy": 0.7385932207107544, "num_tokens": 7191526.0, "step": 536 }, { "entropy": 0.8521525859832764, "epoch": 1.3097560975609757, "grad_norm": 0.1958754062652588, "learning_rate": 3.848238482384824e-06, "loss": 0.8523, "mean_token_accuracy": 0.7323172688484192, "num_tokens": 7205058.0, "step": 537 }, { "entropy": 0.8587372303009033, "epoch": 1.3121951219512196, "grad_norm": 0.1967170685529709, "learning_rate": 3.834688346883469e-06, "loss": 0.8648, "mean_token_accuracy": 0.7314472198486328, "num_tokens": 7218576.0, "step": 538 }, { "entropy": 0.8489270210266113, "epoch": 1.3146341463414635, "grad_norm": 0.20891073346138, "learning_rate": 3.821138211382115e-06, "loss": 0.8588, "mean_token_accuracy": 0.7309644818305969, "num_tokens": 7231594.0, "step": 539 }, { "entropy": 0.8510292768478394, "epoch": 1.3170731707317074, "grad_norm": 0.17983919382095337, "learning_rate": 3.8075880758807595e-06, "loss": 0.8438, "mean_token_accuracy": 0.7355894446372986, "num_tokens": 7245055.0, "step": 540 }, { "entropy": 0.8718546032905579, "epoch": 1.3195121951219513, "grad_norm": 0.18964819610118866, "learning_rate": 3.7940379403794043e-06, "loss": 0.8706, "mean_token_accuracy": 0.7269119620323181, "num_tokens": 7258931.0, "step": 541 }, { "entropy": 0.8766772150993347, "epoch": 1.3219512195121952, "grad_norm": 0.17909395694732666, "learning_rate": 3.780487804878049e-06, "loss": 0.8769, "mean_token_accuracy": 0.7309192419052124, "num_tokens": 7272534.0, "step": 542 }, { "entropy": 0.8771216869354248, "epoch": 1.324390243902439, "grad_norm": 0.18655753135681152, "learning_rate": 3.7669376693766942e-06, "loss": 0.8908, "mean_token_accuracy": 0.7244673371315002, "num_tokens": 7285739.0, "step": 543 }, { "entropy": 0.8514188528060913, "epoch": 1.326829268292683, "grad_norm": 0.1860886812210083, "learning_rate": 3.753387533875339e-06, "loss": 0.8579, "mean_token_accuracy": 0.7302050590515137, "num_tokens": 7298776.0, "step": 544 }, { "entropy": 0.8441017866134644, "epoch": 1.329268292682927, "grad_norm": 0.187427818775177, "learning_rate": 3.7398373983739838e-06, "loss": 0.8512, "mean_token_accuracy": 0.7347075343132019, "num_tokens": 7312230.0, "step": 545 }, { "entropy": 0.8616207838058472, "epoch": 1.3317073170731708, "grad_norm": 0.18081805109977722, "learning_rate": 3.7262872628726286e-06, "loss": 0.8603, "mean_token_accuracy": 0.7315198183059692, "num_tokens": 7325774.0, "step": 546 }, { "entropy": 0.8618036508560181, "epoch": 1.3341463414634147, "grad_norm": 0.20267686247825623, "learning_rate": 3.712737127371274e-06, "loss": 0.862, "mean_token_accuracy": 0.7296164035797119, "num_tokens": 7338668.0, "step": 547 }, { "entropy": 0.8625529408454895, "epoch": 1.3365853658536586, "grad_norm": 0.19352561235427856, "learning_rate": 3.699186991869919e-06, "loss": 0.8553, "mean_token_accuracy": 0.732282280921936, "num_tokens": 7352131.0, "step": 548 }, { "entropy": 0.868601381778717, "epoch": 1.3390243902439025, "grad_norm": 0.1874302625656128, "learning_rate": 3.685636856368564e-06, "loss": 0.8714, "mean_token_accuracy": 0.7254257798194885, "num_tokens": 7365535.0, "step": 549 }, { "entropy": 0.8333048820495605, "epoch": 1.3414634146341464, "grad_norm": 0.1842752993106842, "learning_rate": 3.672086720867209e-06, "loss": 0.8236, "mean_token_accuracy": 0.7369009256362915, "num_tokens": 7378968.0, "step": 550 }, { "entropy": 0.8596416115760803, "epoch": 1.34390243902439, "grad_norm": 0.19583648443222046, "learning_rate": 3.6585365853658537e-06, "loss": 0.8421, "mean_token_accuracy": 0.7383792996406555, "num_tokens": 7391892.0, "step": 551 }, { "entropy": 0.8696916103363037, "epoch": 1.346341463414634, "grad_norm": 0.19787564873695374, "learning_rate": 3.644986449864499e-06, "loss": 0.8675, "mean_token_accuracy": 0.724095344543457, "num_tokens": 7404869.0, "step": 552 }, { "entropy": 0.8838014602661133, "epoch": 1.348780487804878, "grad_norm": 0.19168251752853394, "learning_rate": 3.6314363143631437e-06, "loss": 0.8767, "mean_token_accuracy": 0.7258371114730835, "num_tokens": 7418563.0, "step": 553 }, { "entropy": 0.8391138315200806, "epoch": 1.3512195121951218, "grad_norm": 0.1764480471611023, "learning_rate": 3.6178861788617893e-06, "loss": 0.8354, "mean_token_accuracy": 0.7345172762870789, "num_tokens": 7431755.0, "step": 554 }, { "entropy": 0.8448973894119263, "epoch": 1.3536585365853657, "grad_norm": 0.19826233386993408, "learning_rate": 3.604336043360434e-06, "loss": 0.8473, "mean_token_accuracy": 0.7349461317062378, "num_tokens": 7445040.0, "step": 555 }, { "entropy": 0.8632727861404419, "epoch": 1.3560975609756096, "grad_norm": 0.19437728822231293, "learning_rate": 3.590785907859079e-06, "loss": 0.8647, "mean_token_accuracy": 0.7322266101837158, "num_tokens": 7458489.0, "step": 556 }, { "entropy": 0.8689159154891968, "epoch": 1.3585365853658535, "grad_norm": 0.19678860902786255, "learning_rate": 3.577235772357724e-06, "loss": 0.8827, "mean_token_accuracy": 0.7263685464859009, "num_tokens": 7471676.0, "step": 557 }, { "entropy": 0.8646066188812256, "epoch": 1.3609756097560974, "grad_norm": 0.1897372454404831, "learning_rate": 3.563685636856369e-06, "loss": 0.8534, "mean_token_accuracy": 0.732787013053894, "num_tokens": 7484749.0, "step": 558 }, { "entropy": 0.8650884628295898, "epoch": 1.3634146341463413, "grad_norm": 0.1903863549232483, "learning_rate": 3.5501355013550136e-06, "loss": 0.8616, "mean_token_accuracy": 0.7318161725997925, "num_tokens": 7498431.0, "step": 559 }, { "entropy": 0.8552368879318237, "epoch": 1.3658536585365852, "grad_norm": 0.19023962318897247, "learning_rate": 3.5365853658536588e-06, "loss": 0.8501, "mean_token_accuracy": 0.729788601398468, "num_tokens": 7512214.0, "step": 560 }, { "entropy": 0.8545181751251221, "epoch": 1.3682926829268292, "grad_norm": 0.18914692103862762, "learning_rate": 3.5230352303523035e-06, "loss": 0.8479, "mean_token_accuracy": 0.7299030423164368, "num_tokens": 7525951.0, "step": 561 }, { "entropy": 0.871481716632843, "epoch": 1.370731707317073, "grad_norm": 0.21258091926574707, "learning_rate": 3.509485094850949e-06, "loss": 0.8593, "mean_token_accuracy": 0.7324293851852417, "num_tokens": 7539242.0, "step": 562 }, { "entropy": 0.8490629196166992, "epoch": 1.373170731707317, "grad_norm": 0.20024360716342926, "learning_rate": 3.495934959349594e-06, "loss": 0.8496, "mean_token_accuracy": 0.7306812405586243, "num_tokens": 7552807.0, "step": 563 }, { "entropy": 0.8514649271965027, "epoch": 1.3756097560975609, "grad_norm": 0.17793771624565125, "learning_rate": 3.4823848238482387e-06, "loss": 0.8587, "mean_token_accuracy": 0.7358647584915161, "num_tokens": 7566017.0, "step": 564 }, { "entropy": 0.8559709787368774, "epoch": 1.3780487804878048, "grad_norm": 0.18806791305541992, "learning_rate": 3.468834688346884e-06, "loss": 0.8437, "mean_token_accuracy": 0.7373141050338745, "num_tokens": 7579079.0, "step": 565 }, { "entropy": 0.8687812089920044, "epoch": 1.3804878048780487, "grad_norm": 0.1876194328069687, "learning_rate": 3.4552845528455287e-06, "loss": 0.8727, "mean_token_accuracy": 0.7246053218841553, "num_tokens": 7592523.0, "step": 566 }, { "entropy": 0.8511624336242676, "epoch": 1.3829268292682926, "grad_norm": 0.18997825682163239, "learning_rate": 3.4417344173441734e-06, "loss": 0.8521, "mean_token_accuracy": 0.7291620373725891, "num_tokens": 7606012.0, "step": 567 }, { "entropy": 0.8713839054107666, "epoch": 1.3853658536585365, "grad_norm": 0.19520047307014465, "learning_rate": 3.4281842818428186e-06, "loss": 0.8737, "mean_token_accuracy": 0.7267184853553772, "num_tokens": 7619150.0, "step": 568 }, { "entropy": 0.8599538803100586, "epoch": 1.3878048780487804, "grad_norm": 0.20235277712345123, "learning_rate": 3.414634146341464e-06, "loss": 0.8757, "mean_token_accuracy": 0.7303602695465088, "num_tokens": 7632239.0, "step": 569 }, { "entropy": 0.8565975427627563, "epoch": 1.3902439024390243, "grad_norm": 0.1819470226764679, "learning_rate": 3.401084010840109e-06, "loss": 0.865, "mean_token_accuracy": 0.729332447052002, "num_tokens": 7645452.0, "step": 570 }, { "entropy": 0.8241442441940308, "epoch": 1.3926829268292682, "grad_norm": 0.1833989918231964, "learning_rate": 3.387533875338754e-06, "loss": 0.8213, "mean_token_accuracy": 0.7422797679901123, "num_tokens": 7658680.0, "step": 571 }, { "entropy": 0.8508949279785156, "epoch": 1.395121951219512, "grad_norm": 0.18061420321464539, "learning_rate": 3.3739837398373986e-06, "loss": 0.8511, "mean_token_accuracy": 0.735736608505249, "num_tokens": 7672122.0, "step": 572 }, { "entropy": 0.8487075567245483, "epoch": 1.397560975609756, "grad_norm": 0.186850905418396, "learning_rate": 3.3604336043360438e-06, "loss": 0.8382, "mean_token_accuracy": 0.738534152507782, "num_tokens": 7685482.0, "step": 573 }, { "entropy": 0.869383692741394, "epoch": 1.4, "grad_norm": 0.1888049691915512, "learning_rate": 3.3468834688346886e-06, "loss": 0.8702, "mean_token_accuracy": 0.7279847860336304, "num_tokens": 7698648.0, "step": 574 }, { "entropy": 0.8390681147575378, "epoch": 1.4024390243902438, "grad_norm": 0.17867664992809296, "learning_rate": 3.3333333333333333e-06, "loss": 0.8283, "mean_token_accuracy": 0.7399199604988098, "num_tokens": 7711660.0, "step": 575 }, { "entropy": 0.8469206094741821, "epoch": 1.4048780487804877, "grad_norm": 0.19395941495895386, "learning_rate": 3.3197831978319785e-06, "loss": 0.8485, "mean_token_accuracy": 0.7336561679840088, "num_tokens": 7724892.0, "step": 576 }, { "entropy": 0.8645744919776917, "epoch": 1.4073170731707316, "grad_norm": 0.2073330581188202, "learning_rate": 3.3062330623306237e-06, "loss": 0.8804, "mean_token_accuracy": 0.7230904698371887, "num_tokens": 7738537.0, "step": 577 }, { "entropy": 0.8457903861999512, "epoch": 1.4097560975609755, "grad_norm": 0.19049414992332458, "learning_rate": 3.292682926829269e-06, "loss": 0.8494, "mean_token_accuracy": 0.7300188541412354, "num_tokens": 7751828.0, "step": 578 }, { "entropy": 0.8619527816772461, "epoch": 1.4121951219512194, "grad_norm": 0.17878854274749756, "learning_rate": 3.2791327913279137e-06, "loss": 0.8704, "mean_token_accuracy": 0.7315168976783752, "num_tokens": 7765167.0, "step": 579 }, { "entropy": 0.8565795421600342, "epoch": 1.4146341463414633, "grad_norm": 0.19386078417301178, "learning_rate": 3.2655826558265585e-06, "loss": 0.8827, "mean_token_accuracy": 0.7268211841583252, "num_tokens": 7779075.0, "step": 580 }, { "entropy": 0.8594475984573364, "epoch": 1.4170731707317072, "grad_norm": 0.19009767472743988, "learning_rate": 3.2520325203252037e-06, "loss": 0.8575, "mean_token_accuracy": 0.7269622087478638, "num_tokens": 7792558.0, "step": 581 }, { "entropy": 0.856437087059021, "epoch": 1.4195121951219511, "grad_norm": 0.18176284432411194, "learning_rate": 3.2384823848238484e-06, "loss": 0.8519, "mean_token_accuracy": 0.735020637512207, "num_tokens": 7806126.0, "step": 582 }, { "entropy": 0.8499815464019775, "epoch": 1.421951219512195, "grad_norm": 0.17889046669006348, "learning_rate": 3.224932249322493e-06, "loss": 0.8459, "mean_token_accuracy": 0.7320988774299622, "num_tokens": 7819535.0, "step": 583 }, { "entropy": 0.8566194176673889, "epoch": 1.424390243902439, "grad_norm": 0.19046318531036377, "learning_rate": 3.211382113821139e-06, "loss": 0.8539, "mean_token_accuracy": 0.73642498254776, "num_tokens": 7832295.0, "step": 584 }, { "entropy": 0.874726414680481, "epoch": 1.4268292682926829, "grad_norm": 0.19308649003505707, "learning_rate": 3.1978319783197836e-06, "loss": 0.857, "mean_token_accuracy": 0.7281978130340576, "num_tokens": 7845578.0, "step": 585 }, { "entropy": 0.8651847839355469, "epoch": 1.4292682926829268, "grad_norm": 0.18000152707099915, "learning_rate": 3.1842818428184284e-06, "loss": 0.8575, "mean_token_accuracy": 0.7298014163970947, "num_tokens": 7858788.0, "step": 586 }, { "entropy": 0.8516252636909485, "epoch": 1.4317073170731707, "grad_norm": 0.18842175602912903, "learning_rate": 3.1707317073170736e-06, "loss": 0.8558, "mean_token_accuracy": 0.7326483726501465, "num_tokens": 7871944.0, "step": 587 }, { "entropy": 0.8462690114974976, "epoch": 1.4341463414634146, "grad_norm": 0.1798364222049713, "learning_rate": 3.1571815718157183e-06, "loss": 0.8264, "mean_token_accuracy": 0.7403327226638794, "num_tokens": 7885304.0, "step": 588 }, { "entropy": 0.8627457022666931, "epoch": 1.4365853658536585, "grad_norm": 0.19561219215393066, "learning_rate": 3.143631436314363e-06, "loss": 0.8646, "mean_token_accuracy": 0.7325738072395325, "num_tokens": 7898662.0, "step": 589 }, { "entropy": 0.8492992520332336, "epoch": 1.4390243902439024, "grad_norm": 0.18039856851100922, "learning_rate": 3.1300813008130083e-06, "loss": 0.8353, "mean_token_accuracy": 0.7358734607696533, "num_tokens": 7911827.0, "step": 590 }, { "entropy": 0.8460092544555664, "epoch": 1.4414634146341463, "grad_norm": 0.19393689930438995, "learning_rate": 3.116531165311653e-06, "loss": 0.8282, "mean_token_accuracy": 0.7371993064880371, "num_tokens": 7925104.0, "step": 591 }, { "entropy": 0.8655027747154236, "epoch": 1.4439024390243902, "grad_norm": 0.19649480283260345, "learning_rate": 3.1029810298102987e-06, "loss": 0.8843, "mean_token_accuracy": 0.7273722887039185, "num_tokens": 7938820.0, "step": 592 }, { "entropy": 0.8631415963172913, "epoch": 1.446341463414634, "grad_norm": 0.19127148389816284, "learning_rate": 3.0894308943089435e-06, "loss": 0.8568, "mean_token_accuracy": 0.7302283644676208, "num_tokens": 7952062.0, "step": 593 }, { "entropy": 0.8497236967086792, "epoch": 1.448780487804878, "grad_norm": 0.18874233961105347, "learning_rate": 3.0758807588075882e-06, "loss": 0.86, "mean_token_accuracy": 0.7315238118171692, "num_tokens": 7965636.0, "step": 594 }, { "entropy": 0.856023907661438, "epoch": 1.451219512195122, "grad_norm": 0.18885262310504913, "learning_rate": 3.0623306233062334e-06, "loss": 0.8447, "mean_token_accuracy": 0.7383915185928345, "num_tokens": 7978832.0, "step": 595 }, { "entropy": 0.8641533851623535, "epoch": 1.4536585365853658, "grad_norm": 0.19485171139240265, "learning_rate": 3.0487804878048782e-06, "loss": 0.8548, "mean_token_accuracy": 0.7297952175140381, "num_tokens": 7992471.0, "step": 596 }, { "entropy": 0.8497927188873291, "epoch": 1.4560975609756097, "grad_norm": 0.18832214176654816, "learning_rate": 3.035230352303523e-06, "loss": 0.8484, "mean_token_accuracy": 0.735218346118927, "num_tokens": 8006068.0, "step": 597 }, { "entropy": 0.8550186157226562, "epoch": 1.4585365853658536, "grad_norm": 0.1983252912759781, "learning_rate": 3.021680216802168e-06, "loss": 0.868, "mean_token_accuracy": 0.7317743897438049, "num_tokens": 8019170.0, "step": 598 }, { "entropy": 0.8382817506790161, "epoch": 1.4609756097560975, "grad_norm": 0.1967770755290985, "learning_rate": 3.0081300813008134e-06, "loss": 0.8349, "mean_token_accuracy": 0.7366904020309448, "num_tokens": 8032372.0, "step": 599 }, { "entropy": 0.8516252040863037, "epoch": 1.4634146341463414, "grad_norm": 0.18903858959674835, "learning_rate": 2.9945799457994586e-06, "loss": 0.8647, "mean_token_accuracy": 0.7299439907073975, "num_tokens": 8046137.0, "step": 600 }, { "entropy": 0.8517444729804993, "epoch": 1.4658536585365853, "grad_norm": 0.19564732909202576, "learning_rate": 2.9810298102981034e-06, "loss": 0.8586, "mean_token_accuracy": 0.7297217845916748, "num_tokens": 8059776.0, "step": 601 }, { "entropy": 0.8595305681228638, "epoch": 1.4682926829268292, "grad_norm": 0.20328737795352936, "learning_rate": 2.967479674796748e-06, "loss": 0.8787, "mean_token_accuracy": 0.7226027250289917, "num_tokens": 8073516.0, "step": 602 }, { "entropy": 0.8476274013519287, "epoch": 1.4707317073170731, "grad_norm": 0.1782613843679428, "learning_rate": 2.9539295392953933e-06, "loss": 0.851, "mean_token_accuracy": 0.7361205220222473, "num_tokens": 8086807.0, "step": 603 }, { "entropy": 0.8445456027984619, "epoch": 1.473170731707317, "grad_norm": 0.20236928761005402, "learning_rate": 2.940379403794038e-06, "loss": 0.8381, "mean_token_accuracy": 0.7368095517158508, "num_tokens": 8099749.0, "step": 604 }, { "entropy": 0.8485767841339111, "epoch": 1.475609756097561, "grad_norm": 0.20927858352661133, "learning_rate": 2.926829268292683e-06, "loss": 0.8596, "mean_token_accuracy": 0.7299847602844238, "num_tokens": 8112905.0, "step": 605 }, { "entropy": 0.8670172691345215, "epoch": 1.4780487804878049, "grad_norm": 0.18927742540836334, "learning_rate": 2.913279132791328e-06, "loss": 0.8631, "mean_token_accuracy": 0.7319460511207581, "num_tokens": 8126713.0, "step": 606 }, { "entropy": 0.8468033075332642, "epoch": 1.4804878048780488, "grad_norm": 0.1939922720193863, "learning_rate": 2.8997289972899733e-06, "loss": 0.8571, "mean_token_accuracy": 0.7332726716995239, "num_tokens": 8139911.0, "step": 607 }, { "entropy": 0.8749080300331116, "epoch": 1.4829268292682927, "grad_norm": 0.19756527245044708, "learning_rate": 2.8861788617886185e-06, "loss": 0.8602, "mean_token_accuracy": 0.7331797480583191, "num_tokens": 8152947.0, "step": 608 }, { "entropy": 0.8337868452072144, "epoch": 1.4853658536585366, "grad_norm": 0.18436206877231598, "learning_rate": 2.8726287262872632e-06, "loss": 0.8309, "mean_token_accuracy": 0.7352545857429504, "num_tokens": 8166357.0, "step": 609 }, { "entropy": 0.8511760830879211, "epoch": 1.4878048780487805, "grad_norm": 0.19367781281471252, "learning_rate": 2.859078590785908e-06, "loss": 0.8483, "mean_token_accuracy": 0.7363938093185425, "num_tokens": 8179639.0, "step": 610 }, { "entropy": 0.840193510055542, "epoch": 1.4902439024390244, "grad_norm": 0.18650898337364197, "learning_rate": 2.845528455284553e-06, "loss": 0.8523, "mean_token_accuracy": 0.7330692410469055, "num_tokens": 8193033.0, "step": 611 }, { "entropy": 0.8553098440170288, "epoch": 1.4926829268292683, "grad_norm": 0.19180989265441895, "learning_rate": 2.831978319783198e-06, "loss": 0.8457, "mean_token_accuracy": 0.7340659499168396, "num_tokens": 8206244.0, "step": 612 }, { "entropy": 0.8556879758834839, "epoch": 1.4951219512195122, "grad_norm": 0.19618037343025208, "learning_rate": 2.8184281842818427e-06, "loss": 0.8627, "mean_token_accuracy": 0.7297991514205933, "num_tokens": 8219502.0, "step": 613 }, { "entropy": 0.8604175448417664, "epoch": 1.497560975609756, "grad_norm": 0.1963457465171814, "learning_rate": 2.8048780487804884e-06, "loss": 0.8478, "mean_token_accuracy": 0.733389675617218, "num_tokens": 8232537.0, "step": 614 }, { "entropy": 0.843771755695343, "epoch": 1.5, "grad_norm": 0.18628379702568054, "learning_rate": 2.791327913279133e-06, "loss": 0.8372, "mean_token_accuracy": 0.7395327687263489, "num_tokens": 8245737.0, "step": 615 }, { "entropy": 0.8475285768508911, "epoch": 1.502439024390244, "grad_norm": 0.1898878812789917, "learning_rate": 2.7777777777777783e-06, "loss": 0.8499, "mean_token_accuracy": 0.7381895780563354, "num_tokens": 8258877.0, "step": 616 }, { "entropy": 0.8462591171264648, "epoch": 1.5048780487804878, "grad_norm": 0.19080275297164917, "learning_rate": 2.764227642276423e-06, "loss": 0.8333, "mean_token_accuracy": 0.7345710396766663, "num_tokens": 8272682.0, "step": 617 }, { "entropy": 0.8637003898620605, "epoch": 1.5073170731707317, "grad_norm": 0.21446824073791504, "learning_rate": 2.750677506775068e-06, "loss": 0.8834, "mean_token_accuracy": 0.7266576290130615, "num_tokens": 8286000.0, "step": 618 }, { "entropy": 0.8389323353767395, "epoch": 1.5097560975609756, "grad_norm": 0.18551738560199738, "learning_rate": 2.7371273712737127e-06, "loss": 0.8489, "mean_token_accuracy": 0.7319799065589905, "num_tokens": 8299168.0, "step": 619 }, { "entropy": 0.8565845489501953, "epoch": 1.5121951219512195, "grad_norm": 0.19202789664268494, "learning_rate": 2.723577235772358e-06, "loss": 0.8554, "mean_token_accuracy": 0.7329407930374146, "num_tokens": 8312432.0, "step": 620 }, { "entropy": 0.8483622074127197, "epoch": 1.5146341463414634, "grad_norm": 0.19737857580184937, "learning_rate": 2.7100271002710026e-06, "loss": 0.8596, "mean_token_accuracy": 0.7318035960197449, "num_tokens": 8325871.0, "step": 621 }, { "entropy": 0.8586803674697876, "epoch": 1.5170731707317073, "grad_norm": 0.18837496638298035, "learning_rate": 2.6964769647696482e-06, "loss": 0.8543, "mean_token_accuracy": 0.7367194890975952, "num_tokens": 8339196.0, "step": 622 }, { "entropy": 0.8477186560630798, "epoch": 1.5195121951219512, "grad_norm": 0.19471576809883118, "learning_rate": 2.682926829268293e-06, "loss": 0.8331, "mean_token_accuracy": 0.7372268438339233, "num_tokens": 8352208.0, "step": 623 }, { "entropy": 0.8441017866134644, "epoch": 1.5219512195121951, "grad_norm": 0.19018323719501495, "learning_rate": 2.669376693766938e-06, "loss": 0.8321, "mean_token_accuracy": 0.7384440302848816, "num_tokens": 8365399.0, "step": 624 }, { "entropy": 0.8366572856903076, "epoch": 1.524390243902439, "grad_norm": 0.1984400749206543, "learning_rate": 2.655826558265583e-06, "loss": 0.846, "mean_token_accuracy": 0.734561562538147, "num_tokens": 8378985.0, "step": 625 }, { "entropy": 0.8450554609298706, "epoch": 1.526829268292683, "grad_norm": 0.19116923213005066, "learning_rate": 2.6422764227642278e-06, "loss": 0.8538, "mean_token_accuracy": 0.7278881072998047, "num_tokens": 8392444.0, "step": 626 }, { "entropy": 0.8557592034339905, "epoch": 1.5292682926829269, "grad_norm": 0.1939450055360794, "learning_rate": 2.6287262872628725e-06, "loss": 0.8738, "mean_token_accuracy": 0.7258123755455017, "num_tokens": 8406093.0, "step": 627 }, { "entropy": 0.8385140895843506, "epoch": 1.5317073170731708, "grad_norm": 0.19521206617355347, "learning_rate": 2.6151761517615177e-06, "loss": 0.8562, "mean_token_accuracy": 0.7332026362419128, "num_tokens": 8419370.0, "step": 628 }, { "entropy": 0.8567601442337036, "epoch": 1.5341463414634147, "grad_norm": 0.18665672838687897, "learning_rate": 2.601626016260163e-06, "loss": 0.8566, "mean_token_accuracy": 0.7314379811286926, "num_tokens": 8432787.0, "step": 629 }, { "entropy": 0.851043701171875, "epoch": 1.5365853658536586, "grad_norm": 0.20015431940555573, "learning_rate": 2.588075880758808e-06, "loss": 0.8497, "mean_token_accuracy": 0.7346607446670532, "num_tokens": 8446363.0, "step": 630 }, { "entropy": 0.855539083480835, "epoch": 1.5390243902439025, "grad_norm": 0.19007694721221924, "learning_rate": 2.574525745257453e-06, "loss": 0.8449, "mean_token_accuracy": 0.7352513670921326, "num_tokens": 8460143.0, "step": 631 }, { "entropy": 0.8558579683303833, "epoch": 1.5414634146341464, "grad_norm": 0.1872863471508026, "learning_rate": 2.5609756097560977e-06, "loss": 0.8565, "mean_token_accuracy": 0.7286000847816467, "num_tokens": 8474131.0, "step": 632 }, { "entropy": 0.8450092673301697, "epoch": 1.5439024390243903, "grad_norm": 0.19050945341587067, "learning_rate": 2.547425474254743e-06, "loss": 0.8447, "mean_token_accuracy": 0.735329270362854, "num_tokens": 8487541.0, "step": 633 }, { "entropy": 0.8530290722846985, "epoch": 1.5463414634146342, "grad_norm": 0.20085333287715912, "learning_rate": 2.5338753387533876e-06, "loss": 0.8343, "mean_token_accuracy": 0.7410814166069031, "num_tokens": 8500928.0, "step": 634 }, { "entropy": 0.8755598068237305, "epoch": 1.548780487804878, "grad_norm": 0.21024124324321747, "learning_rate": 2.5203252032520324e-06, "loss": 0.8705, "mean_token_accuracy": 0.7288838028907776, "num_tokens": 8513979.0, "step": 635 }, { "entropy": 0.849466860294342, "epoch": 1.551219512195122, "grad_norm": 0.19688434898853302, "learning_rate": 2.5067750677506776e-06, "loss": 0.8623, "mean_token_accuracy": 0.7304276823997498, "num_tokens": 8527509.0, "step": 636 }, { "entropy": 0.8681310415267944, "epoch": 1.553658536585366, "grad_norm": 0.1976250261068344, "learning_rate": 2.493224932249323e-06, "loss": 0.8484, "mean_token_accuracy": 0.7330136895179749, "num_tokens": 8540874.0, "step": 637 }, { "entropy": 0.8659052848815918, "epoch": 1.5560975609756098, "grad_norm": 0.18264448642730713, "learning_rate": 2.4796747967479676e-06, "loss": 0.859, "mean_token_accuracy": 0.7320760488510132, "num_tokens": 8554517.0, "step": 638 }, { "entropy": 0.8266971111297607, "epoch": 1.5585365853658537, "grad_norm": 0.17848636209964752, "learning_rate": 2.4661246612466128e-06, "loss": 0.8289, "mean_token_accuracy": 0.7398349642753601, "num_tokens": 8567863.0, "step": 639 }, { "entropy": 0.8521214127540588, "epoch": 1.5609756097560976, "grad_norm": 0.18783526122570038, "learning_rate": 2.4525745257452575e-06, "loss": 0.8587, "mean_token_accuracy": 0.7322368025779724, "num_tokens": 8581376.0, "step": 640 }, { "entropy": 0.8435356616973877, "epoch": 1.5634146341463415, "grad_norm": 0.18920935690402985, "learning_rate": 2.4390243902439027e-06, "loss": 0.8505, "mean_token_accuracy": 0.7323869466781616, "num_tokens": 8594706.0, "step": 641 }, { "entropy": 0.8567894697189331, "epoch": 1.5658536585365854, "grad_norm": 0.19047923386096954, "learning_rate": 2.4254742547425475e-06, "loss": 0.8514, "mean_token_accuracy": 0.7303991317749023, "num_tokens": 8608127.0, "step": 642 }, { "entropy": 0.8464937806129456, "epoch": 1.5682926829268293, "grad_norm": 0.19749760627746582, "learning_rate": 2.4119241192411927e-06, "loss": 0.8645, "mean_token_accuracy": 0.7283561825752258, "num_tokens": 8621484.0, "step": 643 }, { "entropy": 0.8501962423324585, "epoch": 1.5707317073170732, "grad_norm": 0.19121719896793365, "learning_rate": 2.3983739837398375e-06, "loss": 0.8575, "mean_token_accuracy": 0.736571729183197, "num_tokens": 8634737.0, "step": 644 }, { "entropy": 0.8764846324920654, "epoch": 1.5731707317073171, "grad_norm": 0.1958206743001938, "learning_rate": 2.3848238482384827e-06, "loss": 0.8697, "mean_token_accuracy": 0.7286435961723328, "num_tokens": 8648016.0, "step": 645 }, { "entropy": 0.8585939407348633, "epoch": 1.575609756097561, "grad_norm": 0.19487060606479645, "learning_rate": 2.371273712737128e-06, "loss": 0.8702, "mean_token_accuracy": 0.7259446978569031, "num_tokens": 8661449.0, "step": 646 }, { "entropy": 0.8674750328063965, "epoch": 1.578048780487805, "grad_norm": 0.20030128955841064, "learning_rate": 2.3577235772357727e-06, "loss": 0.8756, "mean_token_accuracy": 0.7257105112075806, "num_tokens": 8675082.0, "step": 647 }, { "entropy": 0.8603734970092773, "epoch": 1.5804878048780489, "grad_norm": 0.18645605444908142, "learning_rate": 2.3441734417344174e-06, "loss": 0.8616, "mean_token_accuracy": 0.7309102416038513, "num_tokens": 8687919.0, "step": 648 }, { "entropy": 0.8567901849746704, "epoch": 1.5829268292682928, "grad_norm": 0.18722356855869293, "learning_rate": 2.3306233062330626e-06, "loss": 0.8556, "mean_token_accuracy": 0.7300856113433838, "num_tokens": 8701606.0, "step": 649 }, { "entropy": 0.8658725023269653, "epoch": 1.5853658536585367, "grad_norm": 0.19841359555721283, "learning_rate": 2.317073170731708e-06, "loss": 0.8607, "mean_token_accuracy": 0.7348301410675049, "num_tokens": 8715251.0, "step": 650 }, { "entropy": 0.864837110042572, "epoch": 1.5878048780487806, "grad_norm": 0.20387713611125946, "learning_rate": 2.3035230352303526e-06, "loss": 0.8672, "mean_token_accuracy": 0.7283127307891846, "num_tokens": 8728466.0, "step": 651 }, { "entropy": 0.8558300733566284, "epoch": 1.5902439024390245, "grad_norm": 0.18569935858249664, "learning_rate": 2.2899728997289974e-06, "loss": 0.8529, "mean_token_accuracy": 0.7360357046127319, "num_tokens": 8741927.0, "step": 652 }, { "entropy": 0.8700096607208252, "epoch": 1.5926829268292684, "grad_norm": 0.21747605502605438, "learning_rate": 2.2764227642276426e-06, "loss": 0.8637, "mean_token_accuracy": 0.7255343794822693, "num_tokens": 8755697.0, "step": 653 }, { "entropy": 0.8406076431274414, "epoch": 1.5951219512195123, "grad_norm": 0.20201769471168518, "learning_rate": 2.2628726287262878e-06, "loss": 0.8232, "mean_token_accuracy": 0.7413987517356873, "num_tokens": 8768996.0, "step": 654 }, { "entropy": 0.870011031627655, "epoch": 1.5975609756097562, "grad_norm": 0.20148082077503204, "learning_rate": 2.2493224932249325e-06, "loss": 0.8811, "mean_token_accuracy": 0.7248213291168213, "num_tokens": 8782585.0, "step": 655 }, { "entropy": 0.8453396558761597, "epoch": 1.6, "grad_norm": 0.20931822061538696, "learning_rate": 2.2357723577235773e-06, "loss": 0.8421, "mean_token_accuracy": 0.7329903244972229, "num_tokens": 8795623.0, "step": 656 }, { "entropy": 0.8622744083404541, "epoch": 1.602439024390244, "grad_norm": 0.19886784255504608, "learning_rate": 2.222222222222222e-06, "loss": 0.8635, "mean_token_accuracy": 0.730383038520813, "num_tokens": 8809084.0, "step": 657 }, { "entropy": 0.8559050559997559, "epoch": 1.604878048780488, "grad_norm": 0.1918165683746338, "learning_rate": 2.2086720867208673e-06, "loss": 0.8609, "mean_token_accuracy": 0.7311277985572815, "num_tokens": 8822400.0, "step": 658 }, { "entropy": 0.8488461971282959, "epoch": 1.6073170731707318, "grad_norm": 0.19921588897705078, "learning_rate": 2.1951219512195125e-06, "loss": 0.8483, "mean_token_accuracy": 0.7353887557983398, "num_tokens": 8835779.0, "step": 659 }, { "entropy": 0.881496250629425, "epoch": 1.6097560975609757, "grad_norm": 0.21144771575927734, "learning_rate": 2.1815718157181572e-06, "loss": 0.8823, "mean_token_accuracy": 0.7272259593009949, "num_tokens": 8849396.0, "step": 660 }, { "entropy": 0.8597643971443176, "epoch": 1.6121951219512196, "grad_norm": 0.19742603600025177, "learning_rate": 2.1680216802168024e-06, "loss": 0.8718, "mean_token_accuracy": 0.7294816970825195, "num_tokens": 8863034.0, "step": 661 }, { "entropy": 0.865936815738678, "epoch": 1.6146341463414635, "grad_norm": 0.2040947675704956, "learning_rate": 2.154471544715447e-06, "loss": 0.866, "mean_token_accuracy": 0.727960467338562, "num_tokens": 8876401.0, "step": 662 }, { "entropy": 0.8746140003204346, "epoch": 1.6170731707317074, "grad_norm": 0.19248297810554504, "learning_rate": 2.1409214092140924e-06, "loss": 0.8701, "mean_token_accuracy": 0.7300986647605896, "num_tokens": 8889896.0, "step": 663 }, { "entropy": 0.8540151715278625, "epoch": 1.6195121951219513, "grad_norm": 0.21466383337974548, "learning_rate": 2.127371273712737e-06, "loss": 0.8496, "mean_token_accuracy": 0.7361807227134705, "num_tokens": 8902883.0, "step": 664 }, { "entropy": 0.8697842955589294, "epoch": 1.6219512195121952, "grad_norm": 0.1929200142621994, "learning_rate": 2.1138211382113824e-06, "loss": 0.8525, "mean_token_accuracy": 0.7341955304145813, "num_tokens": 8916740.0, "step": 665 }, { "entropy": 0.8582409620285034, "epoch": 1.6243902439024391, "grad_norm": 0.18925856053829193, "learning_rate": 2.100271002710027e-06, "loss": 0.8587, "mean_token_accuracy": 0.7289534211158752, "num_tokens": 8929846.0, "step": 666 }, { "entropy": 0.8528343439102173, "epoch": 1.626829268292683, "grad_norm": 0.19603484869003296, "learning_rate": 2.0867208672086723e-06, "loss": 0.8583, "mean_token_accuracy": 0.7347631454467773, "num_tokens": 8942824.0, "step": 667 }, { "entropy": 0.8672012090682983, "epoch": 1.629268292682927, "grad_norm": 0.1923493593931198, "learning_rate": 2.073170731707317e-06, "loss": 0.8721, "mean_token_accuracy": 0.7292376756668091, "num_tokens": 8955748.0, "step": 668 }, { "entropy": 0.8548610806465149, "epoch": 1.6317073170731708, "grad_norm": 0.2052767127752304, "learning_rate": 2.0596205962059623e-06, "loss": 0.8421, "mean_token_accuracy": 0.7371867895126343, "num_tokens": 8968895.0, "step": 669 }, { "entropy": 0.8442499041557312, "epoch": 1.6341463414634148, "grad_norm": 0.18734319508075714, "learning_rate": 2.046070460704607e-06, "loss": 0.8509, "mean_token_accuracy": 0.7343496680259705, "num_tokens": 8982489.0, "step": 670 }, { "entropy": 0.8563357591629028, "epoch": 1.6365853658536587, "grad_norm": 0.18925635516643524, "learning_rate": 2.0325203252032523e-06, "loss": 0.8626, "mean_token_accuracy": 0.7292543649673462, "num_tokens": 8995809.0, "step": 671 }, { "entropy": 0.8476035594940186, "epoch": 1.6390243902439026, "grad_norm": 0.18875564634799957, "learning_rate": 2.018970189701897e-06, "loss": 0.8388, "mean_token_accuracy": 0.7343665957450867, "num_tokens": 9008858.0, "step": 672 }, { "entropy": 0.8399662375450134, "epoch": 1.6414634146341465, "grad_norm": 0.1930282562971115, "learning_rate": 2.0054200542005423e-06, "loss": 0.8437, "mean_token_accuracy": 0.7364839911460876, "num_tokens": 9022543.0, "step": 673 }, { "entropy": 0.8500676155090332, "epoch": 1.6439024390243904, "grad_norm": 0.20816656947135925, "learning_rate": 1.991869918699187e-06, "loss": 0.8573, "mean_token_accuracy": 0.7287561893463135, "num_tokens": 9035857.0, "step": 674 }, { "entropy": 0.8518763780593872, "epoch": 1.6463414634146343, "grad_norm": 0.20092223584651947, "learning_rate": 1.9783197831978322e-06, "loss": 0.8554, "mean_token_accuracy": 0.732020378112793, "num_tokens": 9049430.0, "step": 675 }, { "entropy": 0.8682869672775269, "epoch": 1.6487804878048782, "grad_norm": 0.20551393926143646, "learning_rate": 1.964769647696477e-06, "loss": 0.8746, "mean_token_accuracy": 0.7290708422660828, "num_tokens": 9063147.0, "step": 676 }, { "entropy": 0.8445431590080261, "epoch": 1.651219512195122, "grad_norm": 0.1954556405544281, "learning_rate": 1.951219512195122e-06, "loss": 0.8474, "mean_token_accuracy": 0.7327855229377747, "num_tokens": 9076306.0, "step": 677 }, { "entropy": 0.8518280982971191, "epoch": 1.653658536585366, "grad_norm": 0.19159460067749023, "learning_rate": 1.937669376693767e-06, "loss": 0.8466, "mean_token_accuracy": 0.734912633895874, "num_tokens": 9089661.0, "step": 678 }, { "entropy": 0.8668668270111084, "epoch": 1.65609756097561, "grad_norm": 0.20159472525119781, "learning_rate": 1.924119241192412e-06, "loss": 0.876, "mean_token_accuracy": 0.7221975326538086, "num_tokens": 9103165.0, "step": 679 }, { "entropy": 0.8498247265815735, "epoch": 1.6585365853658538, "grad_norm": 0.17916780710220337, "learning_rate": 1.9105691056910574e-06, "loss": 0.8398, "mean_token_accuracy": 0.7360494136810303, "num_tokens": 9116460.0, "step": 680 }, { "entropy": 0.8593329191207886, "epoch": 1.6609756097560977, "grad_norm": 0.20385178923606873, "learning_rate": 1.8970189701897021e-06, "loss": 0.8743, "mean_token_accuracy": 0.7305371165275574, "num_tokens": 9129565.0, "step": 681 }, { "entropy": 0.8521544933319092, "epoch": 1.6634146341463416, "grad_norm": 0.1913313865661621, "learning_rate": 1.8834688346883471e-06, "loss": 0.8418, "mean_token_accuracy": 0.7370095252990723, "num_tokens": 9142783.0, "step": 682 }, { "entropy": 0.8547897338867188, "epoch": 1.6658536585365855, "grad_norm": 0.19753193855285645, "learning_rate": 1.8699186991869919e-06, "loss": 0.8581, "mean_token_accuracy": 0.7303997278213501, "num_tokens": 9156434.0, "step": 683 }, { "entropy": 0.859555721282959, "epoch": 1.6682926829268294, "grad_norm": 0.21616385877132416, "learning_rate": 1.856368563685637e-06, "loss": 0.8586, "mean_token_accuracy": 0.7308056950569153, "num_tokens": 9170165.0, "step": 684 }, { "entropy": 0.8644682168960571, "epoch": 1.6707317073170733, "grad_norm": 0.20613378286361694, "learning_rate": 1.842818428184282e-06, "loss": 0.8729, "mean_token_accuracy": 0.727326512336731, "num_tokens": 9183699.0, "step": 685 }, { "entropy": 0.8454245924949646, "epoch": 1.6731707317073172, "grad_norm": 0.18449188768863678, "learning_rate": 1.8292682926829268e-06, "loss": 0.8407, "mean_token_accuracy": 0.7404232025146484, "num_tokens": 9196663.0, "step": 686 }, { "entropy": 0.8595112562179565, "epoch": 1.6756097560975611, "grad_norm": 0.2021973878145218, "learning_rate": 1.8157181571815718e-06, "loss": 0.8369, "mean_token_accuracy": 0.735076904296875, "num_tokens": 9209947.0, "step": 687 }, { "entropy": 0.8636391162872314, "epoch": 1.678048780487805, "grad_norm": 0.19267405569553375, "learning_rate": 1.802168021680217e-06, "loss": 0.8637, "mean_token_accuracy": 0.7290427088737488, "num_tokens": 9223574.0, "step": 688 }, { "entropy": 0.8558269143104553, "epoch": 1.680487804878049, "grad_norm": 0.1942630261182785, "learning_rate": 1.788617886178862e-06, "loss": 0.8593, "mean_token_accuracy": 0.7335766553878784, "num_tokens": 9237016.0, "step": 689 }, { "entropy": 0.8581171035766602, "epoch": 1.6829268292682928, "grad_norm": 0.20008458197116852, "learning_rate": 1.7750677506775068e-06, "loss": 0.8462, "mean_token_accuracy": 0.7356287837028503, "num_tokens": 9250653.0, "step": 690 }, { "entropy": 0.8696762323379517, "epoch": 1.6853658536585368, "grad_norm": 0.20756582915782928, "learning_rate": 1.7615176151761518e-06, "loss": 0.8521, "mean_token_accuracy": 0.734020471572876, "num_tokens": 9264155.0, "step": 691 }, { "entropy": 0.8596901893615723, "epoch": 1.6878048780487804, "grad_norm": 0.19614450633525848, "learning_rate": 1.747967479674797e-06, "loss": 0.8596, "mean_token_accuracy": 0.7338370680809021, "num_tokens": 9278200.0, "step": 692 }, { "entropy": 0.8524608016014099, "epoch": 1.6902439024390243, "grad_norm": 0.20042568445205688, "learning_rate": 1.734417344173442e-06, "loss": 0.8657, "mean_token_accuracy": 0.7275142073631287, "num_tokens": 9291391.0, "step": 693 }, { "entropy": 0.8588581085205078, "epoch": 1.6926829268292682, "grad_norm": 0.195918470621109, "learning_rate": 1.7208672086720867e-06, "loss": 0.8752, "mean_token_accuracy": 0.72524493932724, "num_tokens": 9304677.0, "step": 694 }, { "entropy": 0.8536249399185181, "epoch": 1.6951219512195121, "grad_norm": 0.1939048022031784, "learning_rate": 1.707317073170732e-06, "loss": 0.8585, "mean_token_accuracy": 0.7366573810577393, "num_tokens": 9318371.0, "step": 695 }, { "entropy": 0.8678462505340576, "epoch": 1.697560975609756, "grad_norm": 0.19590549170970917, "learning_rate": 1.693766937669377e-06, "loss": 0.8602, "mean_token_accuracy": 0.7325801849365234, "num_tokens": 9331576.0, "step": 696 }, { "entropy": 0.8561972379684448, "epoch": 1.7, "grad_norm": 0.197646364569664, "learning_rate": 1.6802168021680219e-06, "loss": 0.8623, "mean_token_accuracy": 0.7266197204589844, "num_tokens": 9345792.0, "step": 697 }, { "entropy": 0.8263330459594727, "epoch": 1.7024390243902439, "grad_norm": 0.1956222802400589, "learning_rate": 1.6666666666666667e-06, "loss": 0.8296, "mean_token_accuracy": 0.7327542304992676, "num_tokens": 9359507.0, "step": 698 }, { "entropy": 0.8621451258659363, "epoch": 1.7048780487804878, "grad_norm": 0.18726736307144165, "learning_rate": 1.6531165311653119e-06, "loss": 0.855, "mean_token_accuracy": 0.7335154414176941, "num_tokens": 9373066.0, "step": 699 }, { "entropy": 0.8437690734863281, "epoch": 1.7073170731707317, "grad_norm": 0.19272619485855103, "learning_rate": 1.6395663956639568e-06, "loss": 0.8333, "mean_token_accuracy": 0.7366671562194824, "num_tokens": 9386620.0, "step": 700 }, { "entropy": 0.859840989112854, "epoch": 1.7097560975609756, "grad_norm": 0.19936420023441315, "learning_rate": 1.6260162601626018e-06, "loss": 0.8591, "mean_token_accuracy": 0.7266056537628174, "num_tokens": 9399855.0, "step": 701 }, { "entropy": 0.8391731977462769, "epoch": 1.7121951219512195, "grad_norm": 0.19459789991378784, "learning_rate": 1.6124661246612466e-06, "loss": 0.8414, "mean_token_accuracy": 0.7338288426399231, "num_tokens": 9413460.0, "step": 702 }, { "entropy": 0.8309324979782104, "epoch": 1.7146341463414634, "grad_norm": 0.21322514116764069, "learning_rate": 1.5989159891598918e-06, "loss": 0.8442, "mean_token_accuracy": 0.7402694225311279, "num_tokens": 9426913.0, "step": 703 }, { "entropy": 0.8639693856239319, "epoch": 1.7170731707317073, "grad_norm": 0.19077976047992706, "learning_rate": 1.5853658536585368e-06, "loss": 0.8737, "mean_token_accuracy": 0.7287358045578003, "num_tokens": 9440661.0, "step": 704 }, { "entropy": 0.8579573631286621, "epoch": 1.7195121951219512, "grad_norm": 0.196372851729393, "learning_rate": 1.5718157181571816e-06, "loss": 0.86, "mean_token_accuracy": 0.7288172841072083, "num_tokens": 9454273.0, "step": 705 }, { "entropy": 0.8493719100952148, "epoch": 1.721951219512195, "grad_norm": 0.1844881922006607, "learning_rate": 1.5582655826558265e-06, "loss": 0.8393, "mean_token_accuracy": 0.735931396484375, "num_tokens": 9467812.0, "step": 706 }, { "entropy": 0.850537896156311, "epoch": 1.724390243902439, "grad_norm": 0.19616253674030304, "learning_rate": 1.5447154471544717e-06, "loss": 0.837, "mean_token_accuracy": 0.738007128238678, "num_tokens": 9481336.0, "step": 707 }, { "entropy": 0.852540135383606, "epoch": 1.726829268292683, "grad_norm": 0.19334371387958527, "learning_rate": 1.5311653116531167e-06, "loss": 0.8326, "mean_token_accuracy": 0.7419998645782471, "num_tokens": 9494883.0, "step": 708 }, { "entropy": 0.8625578880310059, "epoch": 1.7292682926829268, "grad_norm": 0.19667640328407288, "learning_rate": 1.5176151761517615e-06, "loss": 0.8684, "mean_token_accuracy": 0.726330578327179, "num_tokens": 9508408.0, "step": 709 }, { "entropy": 0.8546831607818604, "epoch": 1.7317073170731707, "grad_norm": 0.19391046464443207, "learning_rate": 1.5040650406504067e-06, "loss": 0.8679, "mean_token_accuracy": 0.7256612181663513, "num_tokens": 9522527.0, "step": 710 }, { "entropy": 0.8476510047912598, "epoch": 1.7341463414634146, "grad_norm": 0.17655602097511292, "learning_rate": 1.4905149051490517e-06, "loss": 0.8377, "mean_token_accuracy": 0.7392624616622925, "num_tokens": 9536373.0, "step": 711 }, { "entropy": 0.844441294670105, "epoch": 1.7365853658536585, "grad_norm": 0.20517893135547638, "learning_rate": 1.4769647696476967e-06, "loss": 0.8428, "mean_token_accuracy": 0.7325944900512695, "num_tokens": 9549833.0, "step": 712 }, { "entropy": 0.8518630266189575, "epoch": 1.7390243902439024, "grad_norm": 0.1965651959180832, "learning_rate": 1.4634146341463414e-06, "loss": 0.8452, "mean_token_accuracy": 0.727881669998169, "num_tokens": 9563435.0, "step": 713 }, { "entropy": 0.8457773923873901, "epoch": 1.7414634146341463, "grad_norm": 0.19006958603858948, "learning_rate": 1.4498644986449866e-06, "loss": 0.8275, "mean_token_accuracy": 0.7393438816070557, "num_tokens": 9576894.0, "step": 714 }, { "entropy": 0.8564866781234741, "epoch": 1.7439024390243902, "grad_norm": 0.2010202705860138, "learning_rate": 1.4363143631436316e-06, "loss": 0.8597, "mean_token_accuracy": 0.7363360524177551, "num_tokens": 9590742.0, "step": 715 }, { "entropy": 0.8455218076705933, "epoch": 1.7463414634146341, "grad_norm": 0.19736050069332123, "learning_rate": 1.4227642276422766e-06, "loss": 0.8473, "mean_token_accuracy": 0.730883002281189, "num_tokens": 9604280.0, "step": 716 }, { "entropy": 0.8673247694969177, "epoch": 1.748780487804878, "grad_norm": 0.19236670434474945, "learning_rate": 1.4092140921409214e-06, "loss": 0.8689, "mean_token_accuracy": 0.7293338179588318, "num_tokens": 9617881.0, "step": 717 }, { "entropy": 0.8403637409210205, "epoch": 1.751219512195122, "grad_norm": 0.19086958467960358, "learning_rate": 1.3956639566395666e-06, "loss": 0.8454, "mean_token_accuracy": 0.7351208329200745, "num_tokens": 9631137.0, "step": 718 }, { "entropy": 0.8552924394607544, "epoch": 1.7536585365853659, "grad_norm": 0.2235487997531891, "learning_rate": 1.3821138211382116e-06, "loss": 0.8365, "mean_token_accuracy": 0.7410858273506165, "num_tokens": 9644783.0, "step": 719 }, { "entropy": 0.8442793488502502, "epoch": 1.7560975609756098, "grad_norm": 0.20413640141487122, "learning_rate": 1.3685636856368563e-06, "loss": 0.8441, "mean_token_accuracy": 0.7311614751815796, "num_tokens": 9658428.0, "step": 720 }, { "entropy": 0.856056809425354, "epoch": 1.7585365853658537, "grad_norm": 0.19709528982639313, "learning_rate": 1.3550135501355013e-06, "loss": 0.8378, "mean_token_accuracy": 0.7371993064880371, "num_tokens": 9671705.0, "step": 721 }, { "entropy": 0.84223872423172, "epoch": 1.7609756097560976, "grad_norm": 0.21388745307922363, "learning_rate": 1.3414634146341465e-06, "loss": 0.8407, "mean_token_accuracy": 0.7297487258911133, "num_tokens": 9684535.0, "step": 722 }, { "entropy": 0.8511770963668823, "epoch": 1.7634146341463415, "grad_norm": 0.18245741724967957, "learning_rate": 1.3279132791327915e-06, "loss": 0.8523, "mean_token_accuracy": 0.7327352166175842, "num_tokens": 9697815.0, "step": 723 }, { "entropy": 0.853592038154602, "epoch": 1.7658536585365854, "grad_norm": 0.1975676268339157, "learning_rate": 1.3143631436314363e-06, "loss": 0.8479, "mean_token_accuracy": 0.7345311045646667, "num_tokens": 9711245.0, "step": 724 }, { "entropy": 0.8440106511116028, "epoch": 1.7682926829268293, "grad_norm": 0.20077702403068542, "learning_rate": 1.3008130081300815e-06, "loss": 0.8317, "mean_token_accuracy": 0.7399922609329224, "num_tokens": 9724226.0, "step": 725 }, { "entropy": 0.8635171055793762, "epoch": 1.7707317073170732, "grad_norm": 0.1960218995809555, "learning_rate": 1.2872628726287264e-06, "loss": 0.8681, "mean_token_accuracy": 0.7306538820266724, "num_tokens": 9737578.0, "step": 726 }, { "entropy": 0.8365871906280518, "epoch": 1.773170731707317, "grad_norm": 0.19658249616622925, "learning_rate": 1.2737127371273714e-06, "loss": 0.8307, "mean_token_accuracy": 0.7418926954269409, "num_tokens": 9751162.0, "step": 727 }, { "entropy": 0.8456725478172302, "epoch": 1.775609756097561, "grad_norm": 0.2136267125606537, "learning_rate": 1.2601626016260162e-06, "loss": 0.8405, "mean_token_accuracy": 0.7332991361618042, "num_tokens": 9764815.0, "step": 728 }, { "entropy": 0.8460253477096558, "epoch": 1.778048780487805, "grad_norm": 0.2026556134223938, "learning_rate": 1.2466124661246614e-06, "loss": 0.8378, "mean_token_accuracy": 0.7357039451599121, "num_tokens": 9777964.0, "step": 729 }, { "entropy": 0.8548044562339783, "epoch": 1.7804878048780488, "grad_norm": 0.19436872005462646, "learning_rate": 1.2330623306233064e-06, "loss": 0.8654, "mean_token_accuracy": 0.7290599346160889, "num_tokens": 9791256.0, "step": 730 }, { "entropy": 0.8560187816619873, "epoch": 1.7829268292682927, "grad_norm": 0.19585715234279633, "learning_rate": 1.2195121951219514e-06, "loss": 0.854, "mean_token_accuracy": 0.7302951216697693, "num_tokens": 9804657.0, "step": 731 }, { "entropy": 0.8435602188110352, "epoch": 1.7853658536585366, "grad_norm": 0.19885797798633575, "learning_rate": 1.2059620596205964e-06, "loss": 0.8428, "mean_token_accuracy": 0.7359856963157654, "num_tokens": 9818070.0, "step": 732 }, { "entropy": 0.8532072305679321, "epoch": 1.7878048780487805, "grad_norm": 0.20609894394874573, "learning_rate": 1.1924119241192413e-06, "loss": 0.8622, "mean_token_accuracy": 0.7294403314590454, "num_tokens": 9831255.0, "step": 733 }, { "entropy": 0.8447146415710449, "epoch": 1.7902439024390244, "grad_norm": 0.1939428597688675, "learning_rate": 1.1788617886178863e-06, "loss": 0.8482, "mean_token_accuracy": 0.7313094735145569, "num_tokens": 9844513.0, "step": 734 }, { "entropy": 0.8524222373962402, "epoch": 1.7926829268292683, "grad_norm": 0.20892949402332306, "learning_rate": 1.1653116531165313e-06, "loss": 0.8452, "mean_token_accuracy": 0.7328373193740845, "num_tokens": 9857566.0, "step": 735 }, { "entropy": 0.8320717811584473, "epoch": 1.7951219512195122, "grad_norm": 0.18978025019168854, "learning_rate": 1.1517615176151763e-06, "loss": 0.8349, "mean_token_accuracy": 0.7377734780311584, "num_tokens": 9870975.0, "step": 736 }, { "entropy": 0.8415433168411255, "epoch": 1.7975609756097561, "grad_norm": 0.21102409064769745, "learning_rate": 1.1382113821138213e-06, "loss": 0.8452, "mean_token_accuracy": 0.7326037287712097, "num_tokens": 9884514.0, "step": 737 }, { "entropy": 0.850642204284668, "epoch": 1.8, "grad_norm": 0.204196959733963, "learning_rate": 1.1246612466124663e-06, "loss": 0.8672, "mean_token_accuracy": 0.724947988986969, "num_tokens": 9897513.0, "step": 738 }, { "entropy": 0.8529345393180847, "epoch": 1.802439024390244, "grad_norm": 0.18976934254169464, "learning_rate": 1.111111111111111e-06, "loss": 0.8653, "mean_token_accuracy": 0.7342261672019958, "num_tokens": 9910969.0, "step": 739 }, { "entropy": 0.848357617855072, "epoch": 1.8048780487804879, "grad_norm": 0.22443044185638428, "learning_rate": 1.0975609756097562e-06, "loss": 0.8514, "mean_token_accuracy": 0.7322797775268555, "num_tokens": 9923767.0, "step": 740 }, { "entropy": 0.8451347947120667, "epoch": 1.8073170731707318, "grad_norm": 0.21177564561367035, "learning_rate": 1.0840108401084012e-06, "loss": 0.8534, "mean_token_accuracy": 0.7316635251045227, "num_tokens": 9937158.0, "step": 741 }, { "entropy": 0.8371709585189819, "epoch": 1.8097560975609757, "grad_norm": 0.2079295665025711, "learning_rate": 1.0704607046070462e-06, "loss": 0.8444, "mean_token_accuracy": 0.7338888645172119, "num_tokens": 9950255.0, "step": 742 }, { "entropy": 0.8622915744781494, "epoch": 1.8121951219512196, "grad_norm": 0.20502783358097076, "learning_rate": 1.0569105691056912e-06, "loss": 0.8726, "mean_token_accuracy": 0.7261030673980713, "num_tokens": 9963484.0, "step": 743 }, { "entropy": 0.8526772260665894, "epoch": 1.8146341463414632, "grad_norm": 0.21239180862903595, "learning_rate": 1.0433604336043362e-06, "loss": 0.8581, "mean_token_accuracy": 0.7288627624511719, "num_tokens": 9976936.0, "step": 744 }, { "entropy": 0.8445687890052795, "epoch": 1.8170731707317072, "grad_norm": 0.20623742043972015, "learning_rate": 1.0298102981029812e-06, "loss": 0.8522, "mean_token_accuracy": 0.7347913980484009, "num_tokens": 9990760.0, "step": 745 }, { "entropy": 0.8608044385910034, "epoch": 1.819512195121951, "grad_norm": 0.19621485471725464, "learning_rate": 1.0162601626016261e-06, "loss": 0.8718, "mean_token_accuracy": 0.7230565547943115, "num_tokens": 10004360.0, "step": 746 }, { "entropy": 0.8496952056884766, "epoch": 1.821951219512195, "grad_norm": 0.19843044877052307, "learning_rate": 1.0027100271002711e-06, "loss": 0.8541, "mean_token_accuracy": 0.7331779599189758, "num_tokens": 10017677.0, "step": 747 }, { "entropy": 0.8300923109054565, "epoch": 1.8243902439024389, "grad_norm": 0.19320283830165863, "learning_rate": 9.891598915989161e-07, "loss": 0.8226, "mean_token_accuracy": 0.7383586764335632, "num_tokens": 10030707.0, "step": 748 }, { "entropy": 0.862189769744873, "epoch": 1.8268292682926828, "grad_norm": 0.19311180710792542, "learning_rate": 9.75609756097561e-07, "loss": 0.8502, "mean_token_accuracy": 0.7346285581588745, "num_tokens": 10044466.0, "step": 749 }, { "entropy": 0.8316363096237183, "epoch": 1.8292682926829267, "grad_norm": 0.2041832059621811, "learning_rate": 9.62059620596206e-07, "loss": 0.8221, "mean_token_accuracy": 0.7383882999420166, "num_tokens": 10058132.0, "step": 750 }, { "entropy": 0.8450522422790527, "epoch": 1.8317073170731706, "grad_norm": 0.199119433760643, "learning_rate": 9.485094850948511e-07, "loss": 0.824, "mean_token_accuracy": 0.7412486672401428, "num_tokens": 10071346.0, "step": 751 }, { "entropy": 0.84795081615448, "epoch": 1.8341463414634145, "grad_norm": 0.2036094069480896, "learning_rate": 9.349593495934959e-07, "loss": 0.8574, "mean_token_accuracy": 0.7317926287651062, "num_tokens": 10084516.0, "step": 752 }, { "entropy": 0.8715170621871948, "epoch": 1.8365853658536584, "grad_norm": 0.2116577923297882, "learning_rate": 9.21409214092141e-07, "loss": 0.8351, "mean_token_accuracy": 0.7349324226379395, "num_tokens": 10097706.0, "step": 753 }, { "entropy": 0.8570759296417236, "epoch": 1.8390243902439023, "grad_norm": 0.20559139549732208, "learning_rate": 9.078590785907859e-07, "loss": 0.861, "mean_token_accuracy": 0.7247146368026733, "num_tokens": 10111475.0, "step": 754 }, { "entropy": 0.8573019504547119, "epoch": 1.8414634146341462, "grad_norm": 0.20710168778896332, "learning_rate": 8.94308943089431e-07, "loss": 0.8701, "mean_token_accuracy": 0.7320393919944763, "num_tokens": 10124784.0, "step": 755 }, { "entropy": 0.8414781093597412, "epoch": 1.84390243902439, "grad_norm": 0.19474507868289948, "learning_rate": 8.807588075880759e-07, "loss": 0.8389, "mean_token_accuracy": 0.7376715540885925, "num_tokens": 10138062.0, "step": 756 }, { "entropy": 0.8562086820602417, "epoch": 1.846341463414634, "grad_norm": 0.18625088036060333, "learning_rate": 8.67208672086721e-07, "loss": 0.8406, "mean_token_accuracy": 0.7356444001197815, "num_tokens": 10152184.0, "step": 757 }, { "entropy": 0.8786016702651978, "epoch": 1.848780487804878, "grad_norm": 0.20720075070858002, "learning_rate": 8.53658536585366e-07, "loss": 0.8872, "mean_token_accuracy": 0.723919153213501, "num_tokens": 10165754.0, "step": 758 }, { "entropy": 0.8555569648742676, "epoch": 1.8512195121951218, "grad_norm": 0.20634230971336365, "learning_rate": 8.401084010840109e-07, "loss": 0.8515, "mean_token_accuracy": 0.7339683771133423, "num_tokens": 10178682.0, "step": 759 }, { "entropy": 0.8689761757850647, "epoch": 1.8536585365853657, "grad_norm": 0.19764046370983124, "learning_rate": 8.265582655826559e-07, "loss": 0.865, "mean_token_accuracy": 0.7301658987998962, "num_tokens": 10191958.0, "step": 760 }, { "entropy": 0.8437796235084534, "epoch": 1.8560975609756096, "grad_norm": 0.19624987244606018, "learning_rate": 8.130081300813009e-07, "loss": 0.8435, "mean_token_accuracy": 0.735300600528717, "num_tokens": 10205597.0, "step": 761 }, { "entropy": 0.8480662703514099, "epoch": 1.8585365853658535, "grad_norm": 0.20579519867897034, "learning_rate": 7.994579945799459e-07, "loss": 0.8641, "mean_token_accuracy": 0.734367847442627, "num_tokens": 10218759.0, "step": 762 }, { "entropy": 0.8355182409286499, "epoch": 1.8609756097560974, "grad_norm": 0.2053273767232895, "learning_rate": 7.859078590785908e-07, "loss": 0.8409, "mean_token_accuracy": 0.7342787384986877, "num_tokens": 10232244.0, "step": 763 }, { "entropy": 0.8215388655662537, "epoch": 1.8634146341463413, "grad_norm": 0.207631453871727, "learning_rate": 7.723577235772359e-07, "loss": 0.8198, "mean_token_accuracy": 0.7401138544082642, "num_tokens": 10245258.0, "step": 764 }, { "entropy": 0.8489701747894287, "epoch": 1.8658536585365852, "grad_norm": 0.19653555750846863, "learning_rate": 7.588075880758807e-07, "loss": 0.8665, "mean_token_accuracy": 0.7305497527122498, "num_tokens": 10259117.0, "step": 765 }, { "entropy": 0.8704265356063843, "epoch": 1.8682926829268292, "grad_norm": 0.18554694950580597, "learning_rate": 7.452574525745258e-07, "loss": 0.8681, "mean_token_accuracy": 0.7264304757118225, "num_tokens": 10272625.0, "step": 766 }, { "entropy": 0.8253329992294312, "epoch": 1.870731707317073, "grad_norm": 0.1967262178659439, "learning_rate": 7.317073170731707e-07, "loss": 0.827, "mean_token_accuracy": 0.7363318204879761, "num_tokens": 10286359.0, "step": 767 }, { "entropy": 0.845137357711792, "epoch": 1.873170731707317, "grad_norm": 0.1927618682384491, "learning_rate": 7.181571815718158e-07, "loss": 0.8374, "mean_token_accuracy": 0.7362507581710815, "num_tokens": 10299903.0, "step": 768 }, { "entropy": 0.8345843553543091, "epoch": 1.8756097560975609, "grad_norm": 0.19964925944805145, "learning_rate": 7.046070460704607e-07, "loss": 0.8322, "mean_token_accuracy": 0.7415523529052734, "num_tokens": 10312970.0, "step": 769 }, { "entropy": 0.8438344597816467, "epoch": 1.8780487804878048, "grad_norm": 0.19649818539619446, "learning_rate": 6.910569105691058e-07, "loss": 0.833, "mean_token_accuracy": 0.7362222671508789, "num_tokens": 10325978.0, "step": 770 }, { "entropy": 0.8615357875823975, "epoch": 1.8804878048780487, "grad_norm": 0.19380824267864227, "learning_rate": 6.775067750677507e-07, "loss": 0.8682, "mean_token_accuracy": 0.7287015318870544, "num_tokens": 10339610.0, "step": 771 }, { "entropy": 0.8343783617019653, "epoch": 1.8829268292682926, "grad_norm": 0.2009415328502655, "learning_rate": 6.639566395663957e-07, "loss": 0.8262, "mean_token_accuracy": 0.7381997108459473, "num_tokens": 10352613.0, "step": 772 }, { "entropy": 0.8724961280822754, "epoch": 1.8853658536585365, "grad_norm": 0.21221604943275452, "learning_rate": 6.504065040650407e-07, "loss": 0.8996, "mean_token_accuracy": 0.718626081943512, "num_tokens": 10365992.0, "step": 773 }, { "entropy": 0.8535772562026978, "epoch": 1.8878048780487804, "grad_norm": 0.20168307423591614, "learning_rate": 6.368563685636857e-07, "loss": 0.8313, "mean_token_accuracy": 0.7387219667434692, "num_tokens": 10379419.0, "step": 774 }, { "entropy": 0.8459309935569763, "epoch": 1.8902439024390243, "grad_norm": 0.1862184703350067, "learning_rate": 6.233062330623307e-07, "loss": 0.847, "mean_token_accuracy": 0.7340514659881592, "num_tokens": 10392524.0, "step": 775 }, { "entropy": 0.8495763540267944, "epoch": 1.8926829268292682, "grad_norm": 0.19959184527397156, "learning_rate": 6.097560975609757e-07, "loss": 0.849, "mean_token_accuracy": 0.7358462810516357, "num_tokens": 10406017.0, "step": 776 }, { "entropy": 0.855975329875946, "epoch": 1.895121951219512, "grad_norm": 0.20276881754398346, "learning_rate": 5.962059620596207e-07, "loss": 0.8426, "mean_token_accuracy": 0.7363553047180176, "num_tokens": 10419115.0, "step": 777 }, { "entropy": 0.8373376727104187, "epoch": 1.897560975609756, "grad_norm": 0.20193855464458466, "learning_rate": 5.826558265582657e-07, "loss": 0.8356, "mean_token_accuracy": 0.7349722385406494, "num_tokens": 10432473.0, "step": 778 }, { "entropy": 0.8574913740158081, "epoch": 1.9, "grad_norm": 0.1951507329940796, "learning_rate": 5.691056910569106e-07, "loss": 0.8454, "mean_token_accuracy": 0.7371317744255066, "num_tokens": 10445389.0, "step": 779 }, { "entropy": 0.8459637761116028, "epoch": 1.9024390243902438, "grad_norm": 0.21754737198352814, "learning_rate": 5.555555555555555e-07, "loss": 0.8479, "mean_token_accuracy": 0.7290775179862976, "num_tokens": 10458955.0, "step": 780 }, { "entropy": 0.8668469786643982, "epoch": 1.9048780487804877, "grad_norm": 0.19004595279693604, "learning_rate": 5.420054200542006e-07, "loss": 0.8651, "mean_token_accuracy": 0.7281619310379028, "num_tokens": 10472262.0, "step": 781 }, { "entropy": 0.8526676893234253, "epoch": 1.9073170731707316, "grad_norm": 0.20260126888751984, "learning_rate": 5.284552845528456e-07, "loss": 0.8451, "mean_token_accuracy": 0.7369789481163025, "num_tokens": 10485737.0, "step": 782 }, { "entropy": 0.8564171195030212, "epoch": 1.9097560975609755, "grad_norm": 0.21006231009960175, "learning_rate": 5.149051490514906e-07, "loss": 0.8525, "mean_token_accuracy": 0.7312126159667969, "num_tokens": 10499459.0, "step": 783 }, { "entropy": 0.8616898655891418, "epoch": 1.9121951219512194, "grad_norm": 0.22315165400505066, "learning_rate": 5.013550135501356e-07, "loss": 0.8616, "mean_token_accuracy": 0.7301322221755981, "num_tokens": 10513241.0, "step": 784 }, { "entropy": 0.8496356010437012, "epoch": 1.9146341463414633, "grad_norm": 0.1904105544090271, "learning_rate": 4.878048780487805e-07, "loss": 0.8492, "mean_token_accuracy": 0.7327806949615479, "num_tokens": 10526527.0, "step": 785 }, { "entropy": 0.8355883359909058, "epoch": 1.9170731707317072, "grad_norm": 0.20292788743972778, "learning_rate": 4.7425474254742553e-07, "loss": 0.8419, "mean_token_accuracy": 0.7367938756942749, "num_tokens": 10539643.0, "step": 786 }, { "entropy": 0.8364092111587524, "epoch": 1.9195121951219511, "grad_norm": 0.20216518640518188, "learning_rate": 4.607046070460705e-07, "loss": 0.819, "mean_token_accuracy": 0.7400240302085876, "num_tokens": 10552991.0, "step": 787 }, { "entropy": 0.8569232821464539, "epoch": 1.921951219512195, "grad_norm": 0.21923497319221497, "learning_rate": 4.471544715447155e-07, "loss": 0.8679, "mean_token_accuracy": 0.7307437658309937, "num_tokens": 10566600.0, "step": 788 }, { "entropy": 0.8531014323234558, "epoch": 1.924390243902439, "grad_norm": 0.20161768794059753, "learning_rate": 4.336043360433605e-07, "loss": 0.8558, "mean_token_accuracy": 0.7282842397689819, "num_tokens": 10580097.0, "step": 789 }, { "entropy": 0.8500542640686035, "epoch": 1.9268292682926829, "grad_norm": 0.187560573220253, "learning_rate": 4.2005420054200547e-07, "loss": 0.8403, "mean_token_accuracy": 0.7343399524688721, "num_tokens": 10593491.0, "step": 790 }, { "entropy": 0.8405550718307495, "epoch": 1.9292682926829268, "grad_norm": 0.19617001712322235, "learning_rate": 4.0650406504065046e-07, "loss": 0.8227, "mean_token_accuracy": 0.7386794090270996, "num_tokens": 10606713.0, "step": 791 }, { "entropy": 0.8317885994911194, "epoch": 1.9317073170731707, "grad_norm": 0.20573502779006958, "learning_rate": 3.929539295392954e-07, "loss": 0.82, "mean_token_accuracy": 0.7416048049926758, "num_tokens": 10619802.0, "step": 792 }, { "entropy": 0.8333207368850708, "epoch": 1.9341463414634146, "grad_norm": 0.19632014632225037, "learning_rate": 3.794037940379404e-07, "loss": 0.8522, "mean_token_accuracy": 0.7321804761886597, "num_tokens": 10633581.0, "step": 793 }, { "entropy": 0.8593798875808716, "epoch": 1.9365853658536585, "grad_norm": 0.19296619296073914, "learning_rate": 3.6585365853658536e-07, "loss": 0.8544, "mean_token_accuracy": 0.730027973651886, "num_tokens": 10646828.0, "step": 794 }, { "entropy": 0.8579990267753601, "epoch": 1.9390243902439024, "grad_norm": 0.19028954207897186, "learning_rate": 3.5230352303523034e-07, "loss": 0.8397, "mean_token_accuracy": 0.7340456247329712, "num_tokens": 10660602.0, "step": 795 }, { "entropy": 0.8487682938575745, "epoch": 1.9414634146341463, "grad_norm": 0.2062513530254364, "learning_rate": 3.3875338753387533e-07, "loss": 0.8554, "mean_token_accuracy": 0.736031711101532, "num_tokens": 10673737.0, "step": 796 }, { "entropy": 0.8565185070037842, "epoch": 1.9439024390243902, "grad_norm": 0.22061142325401306, "learning_rate": 3.2520325203252037e-07, "loss": 0.8529, "mean_token_accuracy": 0.7323763966560364, "num_tokens": 10686293.0, "step": 797 }, { "entropy": 0.84625244140625, "epoch": 1.946341463414634, "grad_norm": 0.213920459151268, "learning_rate": 3.1165311653116535e-07, "loss": 0.8391, "mean_token_accuracy": 0.7343069314956665, "num_tokens": 10699388.0, "step": 798 }, { "entropy": 0.862379789352417, "epoch": 1.948780487804878, "grad_norm": 0.2047111839056015, "learning_rate": 2.9810298102981034e-07, "loss": 0.865, "mean_token_accuracy": 0.7316440939903259, "num_tokens": 10713296.0, "step": 799 }, { "entropy": 0.8566243648529053, "epoch": 1.951219512195122, "grad_norm": 0.19687318801879883, "learning_rate": 2.845528455284553e-07, "loss": 0.841, "mean_token_accuracy": 0.7335733771324158, "num_tokens": 10726644.0, "step": 800 }, { "entropy": 0.8384063243865967, "epoch": 1.9536585365853658, "grad_norm": 0.18069839477539062, "learning_rate": 2.710027100271003e-07, "loss": 0.8471, "mean_token_accuracy": 0.7319970726966858, "num_tokens": 10740380.0, "step": 801 }, { "entropy": 0.8644918203353882, "epoch": 1.9560975609756097, "grad_norm": 0.19222773611545563, "learning_rate": 2.574525745257453e-07, "loss": 0.8728, "mean_token_accuracy": 0.728790283203125, "num_tokens": 10753515.0, "step": 802 }, { "entropy": 0.8495630025863647, "epoch": 1.9585365853658536, "grad_norm": 0.19031932950019836, "learning_rate": 2.439024390243903e-07, "loss": 0.8469, "mean_token_accuracy": 0.7325720191001892, "num_tokens": 10766929.0, "step": 803 }, { "entropy": 0.8337970972061157, "epoch": 1.9609756097560975, "grad_norm": 0.20217815041542053, "learning_rate": 2.3035230352303526e-07, "loss": 0.8368, "mean_token_accuracy": 0.7349351644515991, "num_tokens": 10779972.0, "step": 804 }, { "entropy": 0.8449347019195557, "epoch": 1.9634146341463414, "grad_norm": 0.1968362182378769, "learning_rate": 2.1680216802168024e-07, "loss": 0.8309, "mean_token_accuracy": 0.7364509701728821, "num_tokens": 10793310.0, "step": 805 }, { "entropy": 0.8543494939804077, "epoch": 1.9658536585365853, "grad_norm": 0.19359824061393738, "learning_rate": 2.0325203252032523e-07, "loss": 0.8437, "mean_token_accuracy": 0.7330183386802673, "num_tokens": 10806870.0, "step": 806 }, { "entropy": 0.8296524882316589, "epoch": 1.9682926829268292, "grad_norm": 0.19010023772716522, "learning_rate": 1.897018970189702e-07, "loss": 0.825, "mean_token_accuracy": 0.743084192276001, "num_tokens": 10820225.0, "step": 807 }, { "entropy": 0.8526460528373718, "epoch": 1.9707317073170731, "grad_norm": 0.19789716601371765, "learning_rate": 1.7615176151761517e-07, "loss": 0.8656, "mean_token_accuracy": 0.7355901002883911, "num_tokens": 10833357.0, "step": 808 }, { "entropy": 0.8426751494407654, "epoch": 1.973170731707317, "grad_norm": 0.20161619782447815, "learning_rate": 1.6260162601626018e-07, "loss": 0.8276, "mean_token_accuracy": 0.7407682538032532, "num_tokens": 10846832.0, "step": 809 }, { "entropy": 0.855075478553772, "epoch": 1.975609756097561, "grad_norm": 0.21478648483753204, "learning_rate": 1.4905149051490517e-07, "loss": 0.8653, "mean_token_accuracy": 0.7304821014404297, "num_tokens": 10859708.0, "step": 810 }, { "entropy": 0.8732905387878418, "epoch": 1.9780487804878049, "grad_norm": 0.19577589631080627, "learning_rate": 1.3550135501355015e-07, "loss": 0.8699, "mean_token_accuracy": 0.7293443083763123, "num_tokens": 10873328.0, "step": 811 }, { "entropy": 0.8290870189666748, "epoch": 1.9804878048780488, "grad_norm": 0.22332845628261566, "learning_rate": 1.2195121951219514e-07, "loss": 0.8305, "mean_token_accuracy": 0.7437856793403625, "num_tokens": 10886298.0, "step": 812 }, { "entropy": 0.8486424088478088, "epoch": 1.9829268292682927, "grad_norm": 0.1950785368680954, "learning_rate": 1.0840108401084012e-07, "loss": 0.8481, "mean_token_accuracy": 0.7326783537864685, "num_tokens": 10899953.0, "step": 813 }, { "entropy": 0.8452553749084473, "epoch": 1.9853658536585366, "grad_norm": 0.19996321201324463, "learning_rate": 9.48509485094851e-08, "loss": 0.8512, "mean_token_accuracy": 0.7341687083244324, "num_tokens": 10913376.0, "step": 814 }, { "entropy": 0.8601592183113098, "epoch": 1.9878048780487805, "grad_norm": 0.19899865984916687, "learning_rate": 8.130081300813009e-08, "loss": 0.8585, "mean_token_accuracy": 0.7343636751174927, "num_tokens": 10927174.0, "step": 815 }, { "entropy": 0.8372820019721985, "epoch": 1.9902439024390244, "grad_norm": 0.19347034394741058, "learning_rate": 6.775067750677508e-08, "loss": 0.8281, "mean_token_accuracy": 0.7355829477310181, "num_tokens": 10940733.0, "step": 816 }, { "entropy": 0.8477611541748047, "epoch": 1.9926829268292683, "grad_norm": 0.19224300980567932, "learning_rate": 5.420054200542006e-08, "loss": 0.8319, "mean_token_accuracy": 0.7393810749053955, "num_tokens": 10953933.0, "step": 817 }, { "entropy": 0.8453364372253418, "epoch": 1.9951219512195122, "grad_norm": 0.18883691728115082, "learning_rate": 4.0650406504065046e-08, "loss": 0.8244, "mean_token_accuracy": 0.7396546602249146, "num_tokens": 10967385.0, "step": 818 }, { "entropy": 0.8373251557350159, "epoch": 1.997560975609756, "grad_norm": 0.20955298840999603, "learning_rate": 2.710027100271003e-08, "loss": 0.8206, "mean_token_accuracy": 0.74117112159729, "num_tokens": 10980568.0, "step": 819 }, { "entropy": 0.8374952673912048, "epoch": 2.0, "grad_norm": 0.18724212050437927, "learning_rate": 1.3550135501355015e-08, "loss": 0.8354, "mean_token_accuracy": 0.7327674627304077, "num_tokens": 10994250.0, "step": 820 }, { "epoch": 2.0, "step": 820, "total_flos": 1.0323202908744581e+18, "train_loss": 1.0359788402551557, "train_runtime": 4829.1249, "train_samples_per_second": 2.713, "train_steps_per_second": 0.17 } ], "logging_steps": 1, "max_steps": 820, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.0323202908744581e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }