lhkhiem28's picture
Model save
ce3fcb1 verified
Raw
History Blame Contribute Delete
239 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 820,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.8716129064559937,
"epoch": 0.0024390243902439024,
"grad_norm": 2.1505093574523926,
"learning_rate": 0.0,
"loss": 2.6919,
"mean_token_accuracy": 0.5286247730255127,
"num_tokens": 12872.0,
"step": 1
},
{
"entropy": 0.8612800240516663,
"epoch": 0.004878048780487805,
"grad_norm": 2.0426065921783447,
"learning_rate": 1.2195121951219514e-07,
"loss": 2.6919,
"mean_token_accuracy": 0.5243263244628906,
"num_tokens": 26248.0,
"step": 2
},
{
"entropy": 0.8617479801177979,
"epoch": 0.007317073170731708,
"grad_norm": 1.9424431324005127,
"learning_rate": 2.439024390243903e-07,
"loss": 2.639,
"mean_token_accuracy": 0.5316513180732727,
"num_tokens": 39502.0,
"step": 3
},
{
"entropy": 0.8756797909736633,
"epoch": 0.00975609756097561,
"grad_norm": 2.1382882595062256,
"learning_rate": 3.6585365853658536e-07,
"loss": 2.7627,
"mean_token_accuracy": 0.5206302404403687,
"num_tokens": 52339.0,
"step": 4
},
{
"entropy": 0.8642444610595703,
"epoch": 0.012195121951219513,
"grad_norm": 2.020120143890381,
"learning_rate": 4.878048780487805e-07,
"loss": 2.718,
"mean_token_accuracy": 0.5269583463668823,
"num_tokens": 65542.0,
"step": 5
},
{
"entropy": 0.8727173805236816,
"epoch": 0.014634146341463415,
"grad_norm": 2.0316474437713623,
"learning_rate": 6.097560975609757e-07,
"loss": 2.6628,
"mean_token_accuracy": 0.527190089225769,
"num_tokens": 78982.0,
"step": 6
},
{
"entropy": 0.8731244206428528,
"epoch": 0.01707317073170732,
"grad_norm": 2.113321304321289,
"learning_rate": 7.317073170731707e-07,
"loss": 2.6782,
"mean_token_accuracy": 0.52106773853302,
"num_tokens": 91885.0,
"step": 7
},
{
"entropy": 0.8809671401977539,
"epoch": 0.01951219512195122,
"grad_norm": 1.8974612951278687,
"learning_rate": 8.53658536585366e-07,
"loss": 2.6159,
"mean_token_accuracy": 0.5320430994033813,
"num_tokens": 105180.0,
"step": 8
},
{
"entropy": 0.8630732297897339,
"epoch": 0.02195121951219512,
"grad_norm": 2.0424561500549316,
"learning_rate": 9.75609756097561e-07,
"loss": 2.5871,
"mean_token_accuracy": 0.5326229929924011,
"num_tokens": 118898.0,
"step": 9
},
{
"entropy": 0.8593544363975525,
"epoch": 0.024390243902439025,
"grad_norm": 1.9281632900238037,
"learning_rate": 1.0975609756097562e-06,
"loss": 2.5685,
"mean_token_accuracy": 0.5355057120323181,
"num_tokens": 132785.0,
"step": 10
},
{
"entropy": 0.8840179443359375,
"epoch": 0.026829268292682926,
"grad_norm": 1.9911386966705322,
"learning_rate": 1.2195121951219514e-06,
"loss": 2.6835,
"mean_token_accuracy": 0.5258385539054871,
"num_tokens": 146366.0,
"step": 11
},
{
"entropy": 0.8695968389511108,
"epoch": 0.02926829268292683,
"grad_norm": 1.922995924949646,
"learning_rate": 1.3414634146341465e-06,
"loss": 2.6168,
"mean_token_accuracy": 0.5292648077011108,
"num_tokens": 159589.0,
"step": 12
},
{
"entropy": 0.8798849582672119,
"epoch": 0.03170731707317073,
"grad_norm": 1.9930217266082764,
"learning_rate": 1.4634146341463414e-06,
"loss": 2.6339,
"mean_token_accuracy": 0.5334321856498718,
"num_tokens": 172422.0,
"step": 13
},
{
"entropy": 0.8729078769683838,
"epoch": 0.03414634146341464,
"grad_norm": 1.8291631937026978,
"learning_rate": 1.5853658536585368e-06,
"loss": 2.6239,
"mean_token_accuracy": 0.53228360414505,
"num_tokens": 185711.0,
"step": 14
},
{
"entropy": 0.8857439160346985,
"epoch": 0.036585365853658534,
"grad_norm": 1.8444254398345947,
"learning_rate": 1.707317073170732e-06,
"loss": 2.6283,
"mean_token_accuracy": 0.5282639265060425,
"num_tokens": 199154.0,
"step": 15
},
{
"entropy": 0.8875442743301392,
"epoch": 0.03902439024390244,
"grad_norm": 1.9070334434509277,
"learning_rate": 1.8292682926829268e-06,
"loss": 2.6719,
"mean_token_accuracy": 0.5216583013534546,
"num_tokens": 212075.0,
"step": 16
},
{
"entropy": 0.8761826753616333,
"epoch": 0.041463414634146344,
"grad_norm": 1.828985571861267,
"learning_rate": 1.951219512195122e-06,
"loss": 2.6031,
"mean_token_accuracy": 0.5246410965919495,
"num_tokens": 225605.0,
"step": 17
},
{
"entropy": 0.8728659749031067,
"epoch": 0.04390243902439024,
"grad_norm": 1.8210647106170654,
"learning_rate": 2.073170731707317e-06,
"loss": 2.4953,
"mean_token_accuracy": 0.5386132597923279,
"num_tokens": 239308.0,
"step": 18
},
{
"entropy": 0.8789602518081665,
"epoch": 0.046341463414634146,
"grad_norm": 1.940412163734436,
"learning_rate": 2.1951219512195125e-06,
"loss": 2.6284,
"mean_token_accuracy": 0.5310542583465576,
"num_tokens": 252575.0,
"step": 19
},
{
"entropy": 0.875320315361023,
"epoch": 0.04878048780487805,
"grad_norm": 1.8743823766708374,
"learning_rate": 2.317073170731708e-06,
"loss": 2.5582,
"mean_token_accuracy": 0.5299984812736511,
"num_tokens": 265825.0,
"step": 20
},
{
"entropy": 0.8594653606414795,
"epoch": 0.05121951219512195,
"grad_norm": 1.8117427825927734,
"learning_rate": 2.4390243902439027e-06,
"loss": 2.5562,
"mean_token_accuracy": 0.5371906757354736,
"num_tokens": 279218.0,
"step": 21
},
{
"entropy": 0.8692665696144104,
"epoch": 0.05365853658536585,
"grad_norm": 1.8945330381393433,
"learning_rate": 2.5609756097560977e-06,
"loss": 2.558,
"mean_token_accuracy": 0.5370146632194519,
"num_tokens": 292472.0,
"step": 22
},
{
"entropy": 0.8777738809585571,
"epoch": 0.05609756097560976,
"grad_norm": 1.7756246328353882,
"learning_rate": 2.682926829268293e-06,
"loss": 2.5399,
"mean_token_accuracy": 0.5344337224960327,
"num_tokens": 306544.0,
"step": 23
},
{
"entropy": 0.8751537799835205,
"epoch": 0.05853658536585366,
"grad_norm": 1.8381223678588867,
"learning_rate": 2.8048780487804884e-06,
"loss": 2.5104,
"mean_token_accuracy": 0.5305012464523315,
"num_tokens": 320166.0,
"step": 24
},
{
"entropy": 0.8838329315185547,
"epoch": 0.06097560975609756,
"grad_norm": 1.9993051290512085,
"learning_rate": 2.926829268292683e-06,
"loss": 2.5373,
"mean_token_accuracy": 0.5335705280303955,
"num_tokens": 333393.0,
"step": 25
},
{
"entropy": 0.8722259998321533,
"epoch": 0.06341463414634146,
"grad_norm": 1.7992353439331055,
"learning_rate": 3.0487804878048782e-06,
"loss": 2.5252,
"mean_token_accuracy": 0.5407407283782959,
"num_tokens": 346909.0,
"step": 26
},
{
"entropy": 0.8720287084579468,
"epoch": 0.06585365853658537,
"grad_norm": 1.8377394676208496,
"learning_rate": 3.1707317073170736e-06,
"loss": 2.4664,
"mean_token_accuracy": 0.544649600982666,
"num_tokens": 360139.0,
"step": 27
},
{
"entropy": 0.8602600693702698,
"epoch": 0.06829268292682927,
"grad_norm": 1.7901852130889893,
"learning_rate": 3.292682926829269e-06,
"loss": 2.4281,
"mean_token_accuracy": 0.5409996509552002,
"num_tokens": 373460.0,
"step": 28
},
{
"entropy": 0.8788866996765137,
"epoch": 0.07073170731707316,
"grad_norm": 1.8166674375534058,
"learning_rate": 3.414634146341464e-06,
"loss": 2.4646,
"mean_token_accuracy": 0.5414108037948608,
"num_tokens": 386830.0,
"step": 29
},
{
"entropy": 0.863952100276947,
"epoch": 0.07317073170731707,
"grad_norm": 1.743186354637146,
"learning_rate": 3.5365853658536588e-06,
"loss": 2.4102,
"mean_token_accuracy": 0.5462642908096313,
"num_tokens": 400431.0,
"step": 30
},
{
"entropy": 0.865651547908783,
"epoch": 0.07560975609756097,
"grad_norm": 1.7701572179794312,
"learning_rate": 3.6585365853658537e-06,
"loss": 2.4892,
"mean_token_accuracy": 0.5413939356803894,
"num_tokens": 413432.0,
"step": 31
},
{
"entropy": 0.8686628341674805,
"epoch": 0.07804878048780488,
"grad_norm": 1.8279269933700562,
"learning_rate": 3.780487804878049e-06,
"loss": 2.4728,
"mean_token_accuracy": 0.5418347120285034,
"num_tokens": 427085.0,
"step": 32
},
{
"entropy": 0.8562468886375427,
"epoch": 0.08048780487804878,
"grad_norm": 1.8034300804138184,
"learning_rate": 3.902439024390244e-06,
"loss": 2.5066,
"mean_token_accuracy": 0.5384673476219177,
"num_tokens": 440372.0,
"step": 33
},
{
"entropy": 0.8735157251358032,
"epoch": 0.08292682926829269,
"grad_norm": 1.7519137859344482,
"learning_rate": 4.024390243902439e-06,
"loss": 2.3914,
"mean_token_accuracy": 0.5398162603378296,
"num_tokens": 453448.0,
"step": 34
},
{
"entropy": 0.8666555881500244,
"epoch": 0.08536585365853659,
"grad_norm": 1.7969316244125366,
"learning_rate": 4.146341463414634e-06,
"loss": 2.3763,
"mean_token_accuracy": 0.5528104901313782,
"num_tokens": 467145.0,
"step": 35
},
{
"entropy": 0.8785781264305115,
"epoch": 0.08780487804878048,
"grad_norm": 1.888017177581787,
"learning_rate": 4.268292682926829e-06,
"loss": 2.4335,
"mean_token_accuracy": 0.5460895895957947,
"num_tokens": 480331.0,
"step": 36
},
{
"entropy": 0.8501675724983215,
"epoch": 0.09024390243902439,
"grad_norm": 1.7441424131393433,
"learning_rate": 4.390243902439025e-06,
"loss": 2.3185,
"mean_token_accuracy": 0.5568350553512573,
"num_tokens": 493807.0,
"step": 37
},
{
"entropy": 0.8716937303543091,
"epoch": 0.09268292682926829,
"grad_norm": 1.8410546779632568,
"learning_rate": 4.51219512195122e-06,
"loss": 2.3366,
"mean_token_accuracy": 0.5552944540977478,
"num_tokens": 507441.0,
"step": 38
},
{
"entropy": 0.8760689496994019,
"epoch": 0.0951219512195122,
"grad_norm": 1.8491054773330688,
"learning_rate": 4.634146341463416e-06,
"loss": 2.3352,
"mean_token_accuracy": 0.5513505935668945,
"num_tokens": 521303.0,
"step": 39
},
{
"entropy": 0.8930657505989075,
"epoch": 0.0975609756097561,
"grad_norm": 1.794344186782837,
"learning_rate": 4.75609756097561e-06,
"loss": 2.274,
"mean_token_accuracy": 0.5474337935447693,
"num_tokens": 534685.0,
"step": 40
},
{
"entropy": 0.8910093903541565,
"epoch": 0.1,
"grad_norm": 1.7851758003234863,
"learning_rate": 4.8780487804878055e-06,
"loss": 2.2718,
"mean_token_accuracy": 0.5464914441108704,
"num_tokens": 547940.0,
"step": 41
},
{
"entropy": 0.8795550465583801,
"epoch": 0.1024390243902439,
"grad_norm": 1.6806493997573853,
"learning_rate": 5e-06,
"loss": 2.1691,
"mean_token_accuracy": 0.5671883821487427,
"num_tokens": 562140.0,
"step": 42
},
{
"entropy": 0.8985618352890015,
"epoch": 0.1048780487804878,
"grad_norm": 1.847882866859436,
"learning_rate": 5.121951219512195e-06,
"loss": 2.2579,
"mean_token_accuracy": 0.5494333505630493,
"num_tokens": 575568.0,
"step": 43
},
{
"entropy": 0.9023619890213013,
"epoch": 0.1073170731707317,
"grad_norm": 1.875916838645935,
"learning_rate": 5.243902439024391e-06,
"loss": 2.2653,
"mean_token_accuracy": 0.5583165287971497,
"num_tokens": 588985.0,
"step": 44
},
{
"entropy": 0.8863162398338318,
"epoch": 0.10975609756097561,
"grad_norm": 1.9038965702056885,
"learning_rate": 5.365853658536586e-06,
"loss": 2.2634,
"mean_token_accuracy": 0.5584648847579956,
"num_tokens": 602368.0,
"step": 45
},
{
"entropy": 0.8825463056564331,
"epoch": 0.11219512195121951,
"grad_norm": 1.9453665018081665,
"learning_rate": 5.487804878048781e-06,
"loss": 2.1974,
"mean_token_accuracy": 0.5623090863227844,
"num_tokens": 615480.0,
"step": 46
},
{
"entropy": 0.9041008353233337,
"epoch": 0.11463414634146342,
"grad_norm": 1.8884116411209106,
"learning_rate": 5.609756097560977e-06,
"loss": 2.129,
"mean_token_accuracy": 0.5642023086547852,
"num_tokens": 628860.0,
"step": 47
},
{
"entropy": 0.9142757654190063,
"epoch": 0.11707317073170732,
"grad_norm": 1.8844501972198486,
"learning_rate": 5.731707317073171e-06,
"loss": 2.1263,
"mean_token_accuracy": 0.5588369369506836,
"num_tokens": 642014.0,
"step": 48
},
{
"entropy": 0.9239153861999512,
"epoch": 0.11951219512195121,
"grad_norm": 1.7458008527755737,
"learning_rate": 5.853658536585366e-06,
"loss": 2.0406,
"mean_token_accuracy": 0.5653674006462097,
"num_tokens": 655653.0,
"step": 49
},
{
"entropy": 0.8941378593444824,
"epoch": 0.12195121951219512,
"grad_norm": 1.8360707759857178,
"learning_rate": 5.9756097560975615e-06,
"loss": 2.0686,
"mean_token_accuracy": 0.5699096322059631,
"num_tokens": 668836.0,
"step": 50
},
{
"entropy": 0.9041756987571716,
"epoch": 0.12439024390243902,
"grad_norm": 1.7880253791809082,
"learning_rate": 6.0975609756097564e-06,
"loss": 2.0037,
"mean_token_accuracy": 0.5757826566696167,
"num_tokens": 682140.0,
"step": 51
},
{
"entropy": 0.9205608367919922,
"epoch": 0.12682926829268293,
"grad_norm": 1.7444533109664917,
"learning_rate": 6.219512195121951e-06,
"loss": 1.979,
"mean_token_accuracy": 0.5779402852058411,
"num_tokens": 695692.0,
"step": 52
},
{
"entropy": 0.9216024875640869,
"epoch": 0.12926829268292683,
"grad_norm": 1.731343150138855,
"learning_rate": 6.341463414634147e-06,
"loss": 1.9391,
"mean_token_accuracy": 0.5785799026489258,
"num_tokens": 709172.0,
"step": 53
},
{
"entropy": 0.940102756023407,
"epoch": 0.13170731707317074,
"grad_norm": 1.6420127153396606,
"learning_rate": 6.463414634146342e-06,
"loss": 1.9096,
"mean_token_accuracy": 0.5771420001983643,
"num_tokens": 722715.0,
"step": 54
},
{
"entropy": 0.9335538744926453,
"epoch": 0.13414634146341464,
"grad_norm": 1.5793882608413696,
"learning_rate": 6.585365853658538e-06,
"loss": 1.8691,
"mean_token_accuracy": 0.5772127509117126,
"num_tokens": 736142.0,
"step": 55
},
{
"entropy": 0.9485749006271362,
"epoch": 0.13658536585365855,
"grad_norm": 1.5499825477600098,
"learning_rate": 6.707317073170733e-06,
"loss": 1.8778,
"mean_token_accuracy": 0.5797693133354187,
"num_tokens": 750117.0,
"step": 56
},
{
"entropy": 0.9361413717269897,
"epoch": 0.13902439024390245,
"grad_norm": 1.6096574068069458,
"learning_rate": 6.829268292682928e-06,
"loss": 1.8691,
"mean_token_accuracy": 0.5884116888046265,
"num_tokens": 763474.0,
"step": 57
},
{
"entropy": 0.9481914639472961,
"epoch": 0.14146341463414633,
"grad_norm": 1.5803636312484741,
"learning_rate": 6.951219512195122e-06,
"loss": 1.8303,
"mean_token_accuracy": 0.5844748616218567,
"num_tokens": 776630.0,
"step": 58
},
{
"entropy": 0.9388015270233154,
"epoch": 0.14390243902439023,
"grad_norm": 1.3934180736541748,
"learning_rate": 7.0731707317073175e-06,
"loss": 1.744,
"mean_token_accuracy": 0.5921754837036133,
"num_tokens": 790142.0,
"step": 59
},
{
"entropy": 0.9618735313415527,
"epoch": 0.14634146341463414,
"grad_norm": 1.424424409866333,
"learning_rate": 7.1951219512195125e-06,
"loss": 1.7299,
"mean_token_accuracy": 0.5924223065376282,
"num_tokens": 803645.0,
"step": 60
},
{
"entropy": 0.9727312326431274,
"epoch": 0.14878048780487804,
"grad_norm": 1.2729369401931763,
"learning_rate": 7.317073170731707e-06,
"loss": 1.7138,
"mean_token_accuracy": 0.600612461566925,
"num_tokens": 817049.0,
"step": 61
},
{
"entropy": 0.9681069254875183,
"epoch": 0.15121951219512195,
"grad_norm": 1.2588528394699097,
"learning_rate": 7.439024390243903e-06,
"loss": 1.689,
"mean_token_accuracy": 0.6010857820510864,
"num_tokens": 830143.0,
"step": 62
},
{
"entropy": 1.0009177923202515,
"epoch": 0.15365853658536585,
"grad_norm": 1.2635364532470703,
"learning_rate": 7.560975609756098e-06,
"loss": 1.6665,
"mean_token_accuracy": 0.5937312245368958,
"num_tokens": 843495.0,
"step": 63
},
{
"entropy": 0.9910491704940796,
"epoch": 0.15609756097560976,
"grad_norm": 1.1177386045455933,
"learning_rate": 7.682926829268293e-06,
"loss": 1.6223,
"mean_token_accuracy": 0.6033629179000854,
"num_tokens": 857249.0,
"step": 64
},
{
"entropy": 1.0137639045715332,
"epoch": 0.15853658536585366,
"grad_norm": 1.0478475093841553,
"learning_rate": 7.804878048780489e-06,
"loss": 1.5789,
"mean_token_accuracy": 0.6136430501937866,
"num_tokens": 870825.0,
"step": 65
},
{
"entropy": 1.0203578472137451,
"epoch": 0.16097560975609757,
"grad_norm": 0.9052762389183044,
"learning_rate": 7.926829268292685e-06,
"loss": 1.5095,
"mean_token_accuracy": 0.613807737827301,
"num_tokens": 884500.0,
"step": 66
},
{
"entropy": 1.0393266677856445,
"epoch": 0.16341463414634147,
"grad_norm": 0.9190409779548645,
"learning_rate": 8.048780487804879e-06,
"loss": 1.5473,
"mean_token_accuracy": 0.6107198596000671,
"num_tokens": 898005.0,
"step": 67
},
{
"entropy": 1.0291173458099365,
"epoch": 0.16585365853658537,
"grad_norm": 0.83433598279953,
"learning_rate": 8.170731707317073e-06,
"loss": 1.466,
"mean_token_accuracy": 0.624069094657898,
"num_tokens": 911449.0,
"step": 68
},
{
"entropy": 1.0759785175323486,
"epoch": 0.16829268292682928,
"grad_norm": 0.8013431429862976,
"learning_rate": 8.292682926829268e-06,
"loss": 1.4757,
"mean_token_accuracy": 0.6221522688865662,
"num_tokens": 924809.0,
"step": 69
},
{
"entropy": 1.0588490962982178,
"epoch": 0.17073170731707318,
"grad_norm": 0.7442017197608948,
"learning_rate": 8.414634146341464e-06,
"loss": 1.4679,
"mean_token_accuracy": 0.6220347881317139,
"num_tokens": 938104.0,
"step": 70
},
{
"entropy": 1.0712034702301025,
"epoch": 0.17317073170731706,
"grad_norm": 0.6614459156990051,
"learning_rate": 8.536585365853658e-06,
"loss": 1.4075,
"mean_token_accuracy": 0.6332119703292847,
"num_tokens": 951850.0,
"step": 71
},
{
"entropy": 1.088219404220581,
"epoch": 0.17560975609756097,
"grad_norm": 0.7117521166801453,
"learning_rate": 8.658536585365854e-06,
"loss": 1.4387,
"mean_token_accuracy": 0.6288971304893494,
"num_tokens": 965113.0,
"step": 72
},
{
"entropy": 1.1224637031555176,
"epoch": 0.17804878048780487,
"grad_norm": 0.5708485245704651,
"learning_rate": 8.78048780487805e-06,
"loss": 1.3922,
"mean_token_accuracy": 0.6311355233192444,
"num_tokens": 978779.0,
"step": 73
},
{
"entropy": 1.1288890838623047,
"epoch": 0.18048780487804877,
"grad_norm": 0.5456262826919556,
"learning_rate": 8.902439024390244e-06,
"loss": 1.3848,
"mean_token_accuracy": 0.6382190585136414,
"num_tokens": 992024.0,
"step": 74
},
{
"entropy": 1.1250863075256348,
"epoch": 0.18292682926829268,
"grad_norm": 0.5261056423187256,
"learning_rate": 9.02439024390244e-06,
"loss": 1.3867,
"mean_token_accuracy": 0.6402657628059387,
"num_tokens": 1005436.0,
"step": 75
},
{
"entropy": 1.1720695495605469,
"epoch": 0.18536585365853658,
"grad_norm": 0.4624958336353302,
"learning_rate": 9.146341463414635e-06,
"loss": 1.3784,
"mean_token_accuracy": 0.636989414691925,
"num_tokens": 1018672.0,
"step": 76
},
{
"entropy": 1.1629294157028198,
"epoch": 0.1878048780487805,
"grad_norm": 0.46797341108322144,
"learning_rate": 9.268292682926831e-06,
"loss": 1.355,
"mean_token_accuracy": 0.6373533010482788,
"num_tokens": 1031640.0,
"step": 77
},
{
"entropy": 1.1572749614715576,
"epoch": 0.1902439024390244,
"grad_norm": 0.3808497488498688,
"learning_rate": 9.390243902439025e-06,
"loss": 1.3303,
"mean_token_accuracy": 0.6452391743659973,
"num_tokens": 1044910.0,
"step": 78
},
{
"entropy": 1.1750357151031494,
"epoch": 0.1926829268292683,
"grad_norm": 0.34629523754119873,
"learning_rate": 9.51219512195122e-06,
"loss": 1.3324,
"mean_token_accuracy": 0.6452615857124329,
"num_tokens": 1058116.0,
"step": 79
},
{
"entropy": 1.1967684030532837,
"epoch": 0.1951219512195122,
"grad_norm": 0.34349682927131653,
"learning_rate": 9.634146341463415e-06,
"loss": 1.322,
"mean_token_accuracy": 0.6471808552742004,
"num_tokens": 1071150.0,
"step": 80
},
{
"entropy": 1.2120548486709595,
"epoch": 0.1975609756097561,
"grad_norm": 0.32455945014953613,
"learning_rate": 9.756097560975611e-06,
"loss": 1.2859,
"mean_token_accuracy": 0.657558262348175,
"num_tokens": 1084853.0,
"step": 81
},
{
"entropy": 1.2008144855499268,
"epoch": 0.2,
"grad_norm": 0.30691349506378174,
"learning_rate": 9.878048780487805e-06,
"loss": 1.305,
"mean_token_accuracy": 0.6493477821350098,
"num_tokens": 1098438.0,
"step": 82
},
{
"entropy": 1.232369065284729,
"epoch": 0.20243902439024392,
"grad_norm": 0.32630908489227295,
"learning_rate": 1e-05,
"loss": 1.3101,
"mean_token_accuracy": 0.6437846422195435,
"num_tokens": 1111623.0,
"step": 83
},
{
"entropy": 1.2427518367767334,
"epoch": 0.2048780487804878,
"grad_norm": 0.3173503279685974,
"learning_rate": 9.986449864498647e-06,
"loss": 1.3054,
"mean_token_accuracy": 0.6477247476577759,
"num_tokens": 1125066.0,
"step": 84
},
{
"entropy": 1.1999444961547852,
"epoch": 0.2073170731707317,
"grad_norm": 0.29154670238494873,
"learning_rate": 9.972899728997291e-06,
"loss": 1.2631,
"mean_token_accuracy": 0.6559225916862488,
"num_tokens": 1138826.0,
"step": 85
},
{
"entropy": 1.2297258377075195,
"epoch": 0.2097560975609756,
"grad_norm": 0.3280792236328125,
"learning_rate": 9.959349593495936e-06,
"loss": 1.2839,
"mean_token_accuracy": 0.6533303260803223,
"num_tokens": 1152114.0,
"step": 86
},
{
"entropy": 1.2501524686813354,
"epoch": 0.2121951219512195,
"grad_norm": 0.3305222988128662,
"learning_rate": 9.94579945799458e-06,
"loss": 1.3045,
"mean_token_accuracy": 0.642970085144043,
"num_tokens": 1165409.0,
"step": 87
},
{
"entropy": 1.2506544589996338,
"epoch": 0.2146341463414634,
"grad_norm": 0.3272988796234131,
"learning_rate": 9.932249322493226e-06,
"loss": 1.2882,
"mean_token_accuracy": 0.6515557169914246,
"num_tokens": 1178506.0,
"step": 88
},
{
"entropy": 1.2083759307861328,
"epoch": 0.21707317073170732,
"grad_norm": 0.29003989696502686,
"learning_rate": 9.91869918699187e-06,
"loss": 1.2796,
"mean_token_accuracy": 0.6522111296653748,
"num_tokens": 1192542.0,
"step": 89
},
{
"entropy": 1.2205573320388794,
"epoch": 0.21951219512195122,
"grad_norm": 0.3061564564704895,
"learning_rate": 9.905149051490516e-06,
"loss": 1.2584,
"mean_token_accuracy": 0.6538350582122803,
"num_tokens": 1206404.0,
"step": 90
},
{
"entropy": 1.2132331132888794,
"epoch": 0.22195121951219512,
"grad_norm": 0.2983347475528717,
"learning_rate": 9.89159891598916e-06,
"loss": 1.2618,
"mean_token_accuracy": 0.6545613408088684,
"num_tokens": 1220133.0,
"step": 91
},
{
"entropy": 1.1786279678344727,
"epoch": 0.22439024390243903,
"grad_norm": 0.2982328534126282,
"learning_rate": 9.878048780487805e-06,
"loss": 1.2286,
"mean_token_accuracy": 0.6618372201919556,
"num_tokens": 1233332.0,
"step": 92
},
{
"entropy": 1.1757036447525024,
"epoch": 0.22682926829268293,
"grad_norm": 0.2842158079147339,
"learning_rate": 9.864498644986451e-06,
"loss": 1.2393,
"mean_token_accuracy": 0.6610386967658997,
"num_tokens": 1246615.0,
"step": 93
},
{
"entropy": 1.1978955268859863,
"epoch": 0.22926829268292684,
"grad_norm": 0.2821376323699951,
"learning_rate": 9.850948509485095e-06,
"loss": 1.2549,
"mean_token_accuracy": 0.6564176082611084,
"num_tokens": 1259868.0,
"step": 94
},
{
"entropy": 1.1675746440887451,
"epoch": 0.23170731707317074,
"grad_norm": 0.2966885268688202,
"learning_rate": 9.837398373983741e-06,
"loss": 1.2118,
"mean_token_accuracy": 0.6594321131706238,
"num_tokens": 1273338.0,
"step": 95
},
{
"entropy": 1.159611701965332,
"epoch": 0.23414634146341465,
"grad_norm": 0.2769213914871216,
"learning_rate": 9.823848238482386e-06,
"loss": 1.2249,
"mean_token_accuracy": 0.6568121314048767,
"num_tokens": 1286918.0,
"step": 96
},
{
"entropy": 1.172745943069458,
"epoch": 0.23658536585365852,
"grad_norm": 0.2758103013038635,
"learning_rate": 9.81029810298103e-06,
"loss": 1.2585,
"mean_token_accuracy": 0.6483401656150818,
"num_tokens": 1300339.0,
"step": 97
},
{
"entropy": 1.170766830444336,
"epoch": 0.23902439024390243,
"grad_norm": 0.2661439776420593,
"learning_rate": 9.796747967479675e-06,
"loss": 1.2254,
"mean_token_accuracy": 0.6616303324699402,
"num_tokens": 1313923.0,
"step": 98
},
{
"entropy": 1.177963376045227,
"epoch": 0.24146341463414633,
"grad_norm": 0.26802775263786316,
"learning_rate": 9.78319783197832e-06,
"loss": 1.2445,
"mean_token_accuracy": 0.6533701419830322,
"num_tokens": 1327351.0,
"step": 99
},
{
"entropy": 1.15558922290802,
"epoch": 0.24390243902439024,
"grad_norm": 0.2651721239089966,
"learning_rate": 9.769647696476967e-06,
"loss": 1.2158,
"mean_token_accuracy": 0.6576597094535828,
"num_tokens": 1340468.0,
"step": 100
},
{
"entropy": 1.1425437927246094,
"epoch": 0.24634146341463414,
"grad_norm": 0.25243017077445984,
"learning_rate": 9.756097560975611e-06,
"loss": 1.2187,
"mean_token_accuracy": 0.660866916179657,
"num_tokens": 1353703.0,
"step": 101
},
{
"entropy": 1.1315678358078003,
"epoch": 0.24878048780487805,
"grad_norm": 0.25873032212257385,
"learning_rate": 9.742547425474255e-06,
"loss": 1.1975,
"mean_token_accuracy": 0.6670178174972534,
"num_tokens": 1367008.0,
"step": 102
},
{
"entropy": 1.1415460109710693,
"epoch": 0.25121951219512195,
"grad_norm": 0.26438820362091064,
"learning_rate": 9.7289972899729e-06,
"loss": 1.211,
"mean_token_accuracy": 0.6611496806144714,
"num_tokens": 1380558.0,
"step": 103
},
{
"entropy": 1.1473474502563477,
"epoch": 0.25365853658536586,
"grad_norm": 0.2560437023639679,
"learning_rate": 9.715447154471546e-06,
"loss": 1.2108,
"mean_token_accuracy": 0.6570150852203369,
"num_tokens": 1394216.0,
"step": 104
},
{
"entropy": 1.1478271484375,
"epoch": 0.25609756097560976,
"grad_norm": 0.26183217763900757,
"learning_rate": 9.70189701897019e-06,
"loss": 1.2186,
"mean_token_accuracy": 0.6576521992683411,
"num_tokens": 1407470.0,
"step": 105
},
{
"entropy": 1.1295911073684692,
"epoch": 0.25853658536585367,
"grad_norm": 0.25204378366470337,
"learning_rate": 9.688346883468836e-06,
"loss": 1.1837,
"mean_token_accuracy": 0.6604463458061218,
"num_tokens": 1420883.0,
"step": 106
},
{
"entropy": 1.125402808189392,
"epoch": 0.26097560975609757,
"grad_norm": 0.26209568977355957,
"learning_rate": 9.67479674796748e-06,
"loss": 1.1919,
"mean_token_accuracy": 0.662480354309082,
"num_tokens": 1434276.0,
"step": 107
},
{
"entropy": 1.1191213130950928,
"epoch": 0.2634146341463415,
"grad_norm": 0.2613905668258667,
"learning_rate": 9.661246612466125e-06,
"loss": 1.1838,
"mean_token_accuracy": 0.6658087968826294,
"num_tokens": 1447503.0,
"step": 108
},
{
"entropy": 1.1112308502197266,
"epoch": 0.2658536585365854,
"grad_norm": 0.25403350591659546,
"learning_rate": 9.64769647696477e-06,
"loss": 1.1703,
"mean_token_accuracy": 0.6672566533088684,
"num_tokens": 1461079.0,
"step": 109
},
{
"entropy": 1.1137951612472534,
"epoch": 0.2682926829268293,
"grad_norm": 0.26483258605003357,
"learning_rate": 9.634146341463415e-06,
"loss": 1.1691,
"mean_token_accuracy": 0.6706117391586304,
"num_tokens": 1474614.0,
"step": 110
},
{
"entropy": 1.0933289527893066,
"epoch": 0.2707317073170732,
"grad_norm": 0.2698538601398468,
"learning_rate": 9.620596205962061e-06,
"loss": 1.1605,
"mean_token_accuracy": 0.6701310276985168,
"num_tokens": 1487908.0,
"step": 111
},
{
"entropy": 1.1143202781677246,
"epoch": 0.2731707317073171,
"grad_norm": 0.2627071142196655,
"learning_rate": 9.607046070460706e-06,
"loss": 1.1438,
"mean_token_accuracy": 0.6680628061294556,
"num_tokens": 1501294.0,
"step": 112
},
{
"entropy": 1.127140760421753,
"epoch": 0.275609756097561,
"grad_norm": 0.273106187582016,
"learning_rate": 9.59349593495935e-06,
"loss": 1.1985,
"mean_token_accuracy": 0.6580502390861511,
"num_tokens": 1514850.0,
"step": 113
},
{
"entropy": 1.0913937091827393,
"epoch": 0.2780487804878049,
"grad_norm": 0.2593974769115448,
"learning_rate": 9.579945799457996e-06,
"loss": 1.1618,
"mean_token_accuracy": 0.6630794405937195,
"num_tokens": 1528154.0,
"step": 114
},
{
"entropy": 1.1081091165542603,
"epoch": 0.2804878048780488,
"grad_norm": 0.2798754870891571,
"learning_rate": 9.56639566395664e-06,
"loss": 1.1377,
"mean_token_accuracy": 0.6722344756126404,
"num_tokens": 1540862.0,
"step": 115
},
{
"entropy": 1.1191236972808838,
"epoch": 0.28292682926829266,
"grad_norm": 0.2535606920719147,
"learning_rate": 9.552845528455286e-06,
"loss": 1.1376,
"mean_token_accuracy": 0.6760023832321167,
"num_tokens": 1554196.0,
"step": 116
},
{
"entropy": 1.1165391206741333,
"epoch": 0.28536585365853656,
"grad_norm": 0.25735312700271606,
"learning_rate": 9.53929539295393e-06,
"loss": 1.1408,
"mean_token_accuracy": 0.6719987392425537,
"num_tokens": 1567090.0,
"step": 117
},
{
"entropy": 1.106642484664917,
"epoch": 0.28780487804878047,
"grad_norm": 0.2398259937763214,
"learning_rate": 9.525745257452575e-06,
"loss": 1.145,
"mean_token_accuracy": 0.6701483726501465,
"num_tokens": 1580318.0,
"step": 118
},
{
"entropy": 1.0864262580871582,
"epoch": 0.29024390243902437,
"grad_norm": 0.2223978489637375,
"learning_rate": 9.51219512195122e-06,
"loss": 1.1119,
"mean_token_accuracy": 0.6760355234146118,
"num_tokens": 1593854.0,
"step": 119
},
{
"entropy": 1.094162940979004,
"epoch": 0.2926829268292683,
"grad_norm": 0.23250681161880493,
"learning_rate": 9.498644986449865e-06,
"loss": 1.1139,
"mean_token_accuracy": 0.6825433373451233,
"num_tokens": 1606908.0,
"step": 120
},
{
"entropy": 1.0955393314361572,
"epoch": 0.2951219512195122,
"grad_norm": 0.21376796066761017,
"learning_rate": 9.485094850948512e-06,
"loss": 1.108,
"mean_token_accuracy": 0.6783738136291504,
"num_tokens": 1620477.0,
"step": 121
},
{
"entropy": 1.1169179677963257,
"epoch": 0.2975609756097561,
"grad_norm": 0.2168598771095276,
"learning_rate": 9.471544715447156e-06,
"loss": 1.1403,
"mean_token_accuracy": 0.6717775464057922,
"num_tokens": 1633798.0,
"step": 122
},
{
"entropy": 1.1065254211425781,
"epoch": 0.3,
"grad_norm": 0.20749054849147797,
"learning_rate": 9.4579945799458e-06,
"loss": 1.1324,
"mean_token_accuracy": 0.6725362539291382,
"num_tokens": 1647614.0,
"step": 123
},
{
"entropy": 1.0934035778045654,
"epoch": 0.3024390243902439,
"grad_norm": 0.2093004733324051,
"learning_rate": 9.444444444444445e-06,
"loss": 1.1156,
"mean_token_accuracy": 0.6740745902061462,
"num_tokens": 1661354.0,
"step": 124
},
{
"entropy": 1.1130709648132324,
"epoch": 0.3048780487804878,
"grad_norm": 0.2131703943014145,
"learning_rate": 9.43089430894309e-06,
"loss": 1.1447,
"mean_token_accuracy": 0.669326901435852,
"num_tokens": 1674652.0,
"step": 125
},
{
"entropy": 1.080055594444275,
"epoch": 0.3073170731707317,
"grad_norm": 0.20652315020561218,
"learning_rate": 9.417344173441735e-06,
"loss": 1.105,
"mean_token_accuracy": 0.6778402924537659,
"num_tokens": 1688003.0,
"step": 126
},
{
"entropy": 1.0850718021392822,
"epoch": 0.3097560975609756,
"grad_norm": 0.19275838136672974,
"learning_rate": 9.403794037940381e-06,
"loss": 1.1143,
"mean_token_accuracy": 0.6753328442573547,
"num_tokens": 1702289.0,
"step": 127
},
{
"entropy": 1.0820226669311523,
"epoch": 0.3121951219512195,
"grad_norm": 0.21166393160820007,
"learning_rate": 9.390243902439025e-06,
"loss": 1.1253,
"mean_token_accuracy": 0.6773277521133423,
"num_tokens": 1715687.0,
"step": 128
},
{
"entropy": 1.0830371379852295,
"epoch": 0.3146341463414634,
"grad_norm": 0.21370024979114532,
"learning_rate": 9.37669376693767e-06,
"loss": 1.1021,
"mean_token_accuracy": 0.6788139343261719,
"num_tokens": 1728957.0,
"step": 129
},
{
"entropy": 1.0973628759384155,
"epoch": 0.3170731707317073,
"grad_norm": 0.21937358379364014,
"learning_rate": 9.363143631436316e-06,
"loss": 1.1162,
"mean_token_accuracy": 0.6790520548820496,
"num_tokens": 1742349.0,
"step": 130
},
{
"entropy": 1.0636382102966309,
"epoch": 0.3195121951219512,
"grad_norm": 0.21198157966136932,
"learning_rate": 9.34959349593496e-06,
"loss": 1.0773,
"mean_token_accuracy": 0.6862117648124695,
"num_tokens": 1755804.0,
"step": 131
},
{
"entropy": 1.0731333494186401,
"epoch": 0.32195121951219513,
"grad_norm": 0.2029760479927063,
"learning_rate": 9.336043360433606e-06,
"loss": 1.0861,
"mean_token_accuracy": 0.6837157011032104,
"num_tokens": 1769115.0,
"step": 132
},
{
"entropy": 1.0707873106002808,
"epoch": 0.32439024390243903,
"grad_norm": 0.20230601727962494,
"learning_rate": 9.32249322493225e-06,
"loss": 1.0817,
"mean_token_accuracy": 0.6842864751815796,
"num_tokens": 1782298.0,
"step": 133
},
{
"entropy": 1.0774948596954346,
"epoch": 0.32682926829268294,
"grad_norm": 0.20387127995491028,
"learning_rate": 9.308943089430895e-06,
"loss": 1.086,
"mean_token_accuracy": 0.6792807579040527,
"num_tokens": 1795606.0,
"step": 134
},
{
"entropy": 1.0700063705444336,
"epoch": 0.32926829268292684,
"grad_norm": 0.20648805797100067,
"learning_rate": 9.29539295392954e-06,
"loss": 1.0602,
"mean_token_accuracy": 0.6847176551818848,
"num_tokens": 1809010.0,
"step": 135
},
{
"entropy": 1.0678541660308838,
"epoch": 0.33170731707317075,
"grad_norm": 0.20196370780467987,
"learning_rate": 9.281842818428185e-06,
"loss": 1.0767,
"mean_token_accuracy": 0.6867226362228394,
"num_tokens": 1822372.0,
"step": 136
},
{
"entropy": 1.0628666877746582,
"epoch": 0.33414634146341465,
"grad_norm": 0.1941923052072525,
"learning_rate": 9.268292682926831e-06,
"loss": 1.0941,
"mean_token_accuracy": 0.6836166381835938,
"num_tokens": 1835859.0,
"step": 137
},
{
"entropy": 1.0489256381988525,
"epoch": 0.33658536585365856,
"grad_norm": 0.19842347502708435,
"learning_rate": 9.254742547425476e-06,
"loss": 1.0761,
"mean_token_accuracy": 0.6827327013015747,
"num_tokens": 1849444.0,
"step": 138
},
{
"entropy": 1.0854852199554443,
"epoch": 0.33902439024390246,
"grad_norm": 0.19903236627578735,
"learning_rate": 9.24119241192412e-06,
"loss": 1.0873,
"mean_token_accuracy": 0.6775000095367432,
"num_tokens": 1863460.0,
"step": 139
},
{
"entropy": 1.0722227096557617,
"epoch": 0.34146341463414637,
"grad_norm": 0.19855357706546783,
"learning_rate": 9.227642276422764e-06,
"loss": 1.0847,
"mean_token_accuracy": 0.6859818696975708,
"num_tokens": 1877144.0,
"step": 140
},
{
"entropy": 1.0752365589141846,
"epoch": 0.3439024390243902,
"grad_norm": 0.19797125458717346,
"learning_rate": 9.21409214092141e-06,
"loss": 1.099,
"mean_token_accuracy": 0.6804720163345337,
"num_tokens": 1890295.0,
"step": 141
},
{
"entropy": 1.0549845695495605,
"epoch": 0.3463414634146341,
"grad_norm": 0.18283385038375854,
"learning_rate": 9.200542005420055e-06,
"loss": 1.0662,
"mean_token_accuracy": 0.6898062825202942,
"num_tokens": 1903319.0,
"step": 142
},
{
"entropy": 1.0448575019836426,
"epoch": 0.348780487804878,
"grad_norm": 0.17837047576904297,
"learning_rate": 9.1869918699187e-06,
"loss": 1.0748,
"mean_token_accuracy": 0.6830585598945618,
"num_tokens": 1917224.0,
"step": 143
},
{
"entropy": 1.0477330684661865,
"epoch": 0.35121951219512193,
"grad_norm": 0.18431058526039124,
"learning_rate": 9.173441734417345e-06,
"loss": 1.057,
"mean_token_accuracy": 0.6876409649848938,
"num_tokens": 1930542.0,
"step": 144
},
{
"entropy": 1.0347704887390137,
"epoch": 0.35365853658536583,
"grad_norm": 0.18002833425998688,
"learning_rate": 9.15989159891599e-06,
"loss": 1.062,
"mean_token_accuracy": 0.6917096376419067,
"num_tokens": 1943935.0,
"step": 145
},
{
"entropy": 1.0429667234420776,
"epoch": 0.35609756097560974,
"grad_norm": 0.1801144927740097,
"learning_rate": 9.146341463414635e-06,
"loss": 1.0623,
"mean_token_accuracy": 0.6872867941856384,
"num_tokens": 1957142.0,
"step": 146
},
{
"entropy": 1.0446667671203613,
"epoch": 0.35853658536585364,
"grad_norm": 0.18068258464336395,
"learning_rate": 9.13279132791328e-06,
"loss": 1.0737,
"mean_token_accuracy": 0.6836559176445007,
"num_tokens": 1970539.0,
"step": 147
},
{
"entropy": 1.0441868305206299,
"epoch": 0.36097560975609755,
"grad_norm": 0.17684251070022583,
"learning_rate": 9.119241192411926e-06,
"loss": 1.0487,
"mean_token_accuracy": 0.6862218379974365,
"num_tokens": 1983953.0,
"step": 148
},
{
"entropy": 1.037201166152954,
"epoch": 0.36341463414634145,
"grad_norm": 0.170819953083992,
"learning_rate": 9.10569105691057e-06,
"loss": 1.0587,
"mean_token_accuracy": 0.6860895156860352,
"num_tokens": 1997218.0,
"step": 149
},
{
"entropy": 1.0491631031036377,
"epoch": 0.36585365853658536,
"grad_norm": 0.18243585526943207,
"learning_rate": 9.092140921409215e-06,
"loss": 1.0699,
"mean_token_accuracy": 0.6834457516670227,
"num_tokens": 2010723.0,
"step": 150
},
{
"entropy": 1.029181957244873,
"epoch": 0.36829268292682926,
"grad_norm": 0.18266521394252777,
"learning_rate": 9.07859078590786e-06,
"loss": 1.0574,
"mean_token_accuracy": 0.6896981000900269,
"num_tokens": 2024387.0,
"step": 151
},
{
"entropy": 1.0140658617019653,
"epoch": 0.37073170731707317,
"grad_norm": 0.17179487645626068,
"learning_rate": 9.065040650406505e-06,
"loss": 1.0406,
"mean_token_accuracy": 0.6913700103759766,
"num_tokens": 2037775.0,
"step": 152
},
{
"entropy": 1.0303168296813965,
"epoch": 0.37317073170731707,
"grad_norm": 0.1785237044095993,
"learning_rate": 9.051490514905151e-06,
"loss": 1.0363,
"mean_token_accuracy": 0.6900920867919922,
"num_tokens": 2051366.0,
"step": 153
},
{
"entropy": 1.019331693649292,
"epoch": 0.375609756097561,
"grad_norm": 0.17573611438274384,
"learning_rate": 9.037940379403795e-06,
"loss": 1.0413,
"mean_token_accuracy": 0.6888290047645569,
"num_tokens": 2064738.0,
"step": 154
},
{
"entropy": 1.041901707649231,
"epoch": 0.3780487804878049,
"grad_norm": 0.17206346988677979,
"learning_rate": 9.02439024390244e-06,
"loss": 1.0615,
"mean_token_accuracy": 0.6894234418869019,
"num_tokens": 2077849.0,
"step": 155
},
{
"entropy": 1.0418643951416016,
"epoch": 0.3804878048780488,
"grad_norm": 0.17650866508483887,
"learning_rate": 9.010840108401084e-06,
"loss": 1.0688,
"mean_token_accuracy": 0.6822457313537598,
"num_tokens": 2091366.0,
"step": 156
},
{
"entropy": 1.0257384777069092,
"epoch": 0.3829268292682927,
"grad_norm": 0.17796455323696136,
"learning_rate": 8.99728997289973e-06,
"loss": 1.0436,
"mean_token_accuracy": 0.6862221956253052,
"num_tokens": 2104882.0,
"step": 157
},
{
"entropy": 1.0320515632629395,
"epoch": 0.3853658536585366,
"grad_norm": 0.17598049342632294,
"learning_rate": 8.983739837398374e-06,
"loss": 1.0419,
"mean_token_accuracy": 0.6948973536491394,
"num_tokens": 2118146.0,
"step": 158
},
{
"entropy": 1.019339919090271,
"epoch": 0.3878048780487805,
"grad_norm": 0.19084501266479492,
"learning_rate": 8.970189701897019e-06,
"loss": 1.0391,
"mean_token_accuracy": 0.6915437579154968,
"num_tokens": 2131454.0,
"step": 159
},
{
"entropy": 1.0261130332946777,
"epoch": 0.3902439024390244,
"grad_norm": 0.17102600634098053,
"learning_rate": 8.956639566395665e-06,
"loss": 1.025,
"mean_token_accuracy": 0.6942394971847534,
"num_tokens": 2144889.0,
"step": 160
},
{
"entropy": 1.0434393882751465,
"epoch": 0.3926829268292683,
"grad_norm": 0.17654499411582947,
"learning_rate": 8.94308943089431e-06,
"loss": 1.0519,
"mean_token_accuracy": 0.6885669827461243,
"num_tokens": 2158436.0,
"step": 161
},
{
"entropy": 1.0071184635162354,
"epoch": 0.3951219512195122,
"grad_norm": 0.17178241908550262,
"learning_rate": 8.929539295392955e-06,
"loss": 1.0156,
"mean_token_accuracy": 0.693914532661438,
"num_tokens": 2172239.0,
"step": 162
},
{
"entropy": 1.0304242372512817,
"epoch": 0.3975609756097561,
"grad_norm": 0.16800439357757568,
"learning_rate": 8.9159891598916e-06,
"loss": 1.0366,
"mean_token_accuracy": 0.6918449997901917,
"num_tokens": 2185388.0,
"step": 163
},
{
"entropy": 1.0210349559783936,
"epoch": 0.4,
"grad_norm": 0.1748812049627304,
"learning_rate": 8.902439024390244e-06,
"loss": 1.0313,
"mean_token_accuracy": 0.6942216753959656,
"num_tokens": 2198747.0,
"step": 164
},
{
"entropy": 1.0305485725402832,
"epoch": 0.4024390243902439,
"grad_norm": 0.17672093212604523,
"learning_rate": 8.888888888888888e-06,
"loss": 1.0314,
"mean_token_accuracy": 0.6892403364181519,
"num_tokens": 2212230.0,
"step": 165
},
{
"entropy": 1.0268189907073975,
"epoch": 0.40487804878048783,
"grad_norm": 0.16995690762996674,
"learning_rate": 8.875338753387534e-06,
"loss": 1.0279,
"mean_token_accuracy": 0.6927863359451294,
"num_tokens": 2225263.0,
"step": 166
},
{
"entropy": 1.0141714811325073,
"epoch": 0.4073170731707317,
"grad_norm": 0.1733706146478653,
"learning_rate": 8.86178861788618e-06,
"loss": 1.0209,
"mean_token_accuracy": 0.6984298825263977,
"num_tokens": 2238208.0,
"step": 167
},
{
"entropy": 1.015406608581543,
"epoch": 0.4097560975609756,
"grad_norm": 0.175829216837883,
"learning_rate": 8.848238482384825e-06,
"loss": 1.0377,
"mean_token_accuracy": 0.6940392255783081,
"num_tokens": 2250974.0,
"step": 168
},
{
"entropy": 1.0115768909454346,
"epoch": 0.4121951219512195,
"grad_norm": 0.16748936474323273,
"learning_rate": 8.834688346883469e-06,
"loss": 1.027,
"mean_token_accuracy": 0.6916769742965698,
"num_tokens": 2264771.0,
"step": 169
},
{
"entropy": 1.003655195236206,
"epoch": 0.4146341463414634,
"grad_norm": 0.16363762319087982,
"learning_rate": 8.821138211382113e-06,
"loss": 0.9975,
"mean_token_accuracy": 0.6990435123443604,
"num_tokens": 2278274.0,
"step": 170
},
{
"entropy": 1.0265607833862305,
"epoch": 0.4170731707317073,
"grad_norm": 0.1725579798221588,
"learning_rate": 8.80758807588076e-06,
"loss": 1.0406,
"mean_token_accuracy": 0.6887966990470886,
"num_tokens": 2291786.0,
"step": 171
},
{
"entropy": 1.0243334770202637,
"epoch": 0.4195121951219512,
"grad_norm": 0.17333285510540009,
"learning_rate": 8.794037940379404e-06,
"loss": 1.0251,
"mean_token_accuracy": 0.6909435987472534,
"num_tokens": 2305505.0,
"step": 172
},
{
"entropy": 1.0068650245666504,
"epoch": 0.4219512195121951,
"grad_norm": 0.17407289147377014,
"learning_rate": 8.78048780487805e-06,
"loss": 0.9931,
"mean_token_accuracy": 0.6996558904647827,
"num_tokens": 2318889.0,
"step": 173
},
{
"entropy": 1.0199451446533203,
"epoch": 0.424390243902439,
"grad_norm": 0.17032553255558014,
"learning_rate": 8.766937669376694e-06,
"loss": 1.0338,
"mean_token_accuracy": 0.6946343779563904,
"num_tokens": 2332361.0,
"step": 174
},
{
"entropy": 1.0083736181259155,
"epoch": 0.4268292682926829,
"grad_norm": 0.17206445336341858,
"learning_rate": 8.753387533875339e-06,
"loss": 1.0215,
"mean_token_accuracy": 0.6917036771774292,
"num_tokens": 2345877.0,
"step": 175
},
{
"entropy": 1.0085593461990356,
"epoch": 0.4292682926829268,
"grad_norm": 0.1674298793077469,
"learning_rate": 8.739837398373985e-06,
"loss": 1.0097,
"mean_token_accuracy": 0.6976450681686401,
"num_tokens": 2359354.0,
"step": 176
},
{
"entropy": 1.0162107944488525,
"epoch": 0.4317073170731707,
"grad_norm": 0.1732998937368393,
"learning_rate": 8.726287262872629e-06,
"loss": 1.0413,
"mean_token_accuracy": 0.688483476638794,
"num_tokens": 2372525.0,
"step": 177
},
{
"entropy": 1.0145041942596436,
"epoch": 0.43414634146341463,
"grad_norm": 0.16612009704113007,
"learning_rate": 8.712737127371275e-06,
"loss": 1.0258,
"mean_token_accuracy": 0.6966949105262756,
"num_tokens": 2386217.0,
"step": 178
},
{
"entropy": 1.0364079475402832,
"epoch": 0.43658536585365854,
"grad_norm": 0.16687557101249695,
"learning_rate": 8.69918699186992e-06,
"loss": 1.0329,
"mean_token_accuracy": 0.689834475517273,
"num_tokens": 2399887.0,
"step": 179
},
{
"entropy": 1.000331163406372,
"epoch": 0.43902439024390244,
"grad_norm": 0.17682859301567078,
"learning_rate": 8.685636856368564e-06,
"loss": 1.0069,
"mean_token_accuracy": 0.6982501745223999,
"num_tokens": 2412990.0,
"step": 180
},
{
"entropy": 1.0094903707504272,
"epoch": 0.44146341463414634,
"grad_norm": 0.17109999060630798,
"learning_rate": 8.67208672086721e-06,
"loss": 0.9865,
"mean_token_accuracy": 0.7004877924919128,
"num_tokens": 2426331.0,
"step": 181
},
{
"entropy": 1.001022219657898,
"epoch": 0.44390243902439025,
"grad_norm": 0.17116393148899078,
"learning_rate": 8.658536585365854e-06,
"loss": 1.0041,
"mean_token_accuracy": 0.6996858716011047,
"num_tokens": 2439400.0,
"step": 182
},
{
"entropy": 1.0060547590255737,
"epoch": 0.44634146341463415,
"grad_norm": 0.17257100343704224,
"learning_rate": 8.6449864498645e-06,
"loss": 1.0233,
"mean_token_accuracy": 0.6987658143043518,
"num_tokens": 2452542.0,
"step": 183
},
{
"entropy": 0.9930256605148315,
"epoch": 0.44878048780487806,
"grad_norm": 0.16270838677883148,
"learning_rate": 8.631436314363144e-06,
"loss": 0.9916,
"mean_token_accuracy": 0.7055611610412598,
"num_tokens": 2466476.0,
"step": 184
},
{
"entropy": 1.0109392404556274,
"epoch": 0.45121951219512196,
"grad_norm": 0.16337797045707703,
"learning_rate": 8.617886178861789e-06,
"loss": 0.9938,
"mean_token_accuracy": 0.7032565474510193,
"num_tokens": 2479911.0,
"step": 185
},
{
"entropy": 1.0034139156341553,
"epoch": 0.45365853658536587,
"grad_norm": 0.16562442481517792,
"learning_rate": 8.604336043360433e-06,
"loss": 1.0043,
"mean_token_accuracy": 0.6976569294929504,
"num_tokens": 2493243.0,
"step": 186
},
{
"entropy": 1.0120468139648438,
"epoch": 0.4560975609756098,
"grad_norm": 0.16520871222019196,
"learning_rate": 8.59078590785908e-06,
"loss": 0.9956,
"mean_token_accuracy": 0.6959730982780457,
"num_tokens": 2506942.0,
"step": 187
},
{
"entropy": 1.0021930932998657,
"epoch": 0.4585365853658537,
"grad_norm": 0.16627825796604156,
"learning_rate": 8.577235772357724e-06,
"loss": 1.0007,
"mean_token_accuracy": 0.7009619474411011,
"num_tokens": 2520264.0,
"step": 188
},
{
"entropy": 1.0003260374069214,
"epoch": 0.4609756097560976,
"grad_norm": 0.17842690646648407,
"learning_rate": 8.56368563685637e-06,
"loss": 1.0258,
"mean_token_accuracy": 0.6934998631477356,
"num_tokens": 2533249.0,
"step": 189
},
{
"entropy": 0.998503565788269,
"epoch": 0.4634146341463415,
"grad_norm": 0.17247022688388824,
"learning_rate": 8.550135501355014e-06,
"loss": 0.9917,
"mean_token_accuracy": 0.7048850059509277,
"num_tokens": 2546182.0,
"step": 190
},
{
"entropy": 1.0056812763214111,
"epoch": 0.4658536585365854,
"grad_norm": 0.17095550894737244,
"learning_rate": 8.536585365853658e-06,
"loss": 1.001,
"mean_token_accuracy": 0.698594868183136,
"num_tokens": 2559791.0,
"step": 191
},
{
"entropy": 1.0053273439407349,
"epoch": 0.4682926829268293,
"grad_norm": 0.17117735743522644,
"learning_rate": 8.523035230352304e-06,
"loss": 0.998,
"mean_token_accuracy": 0.7012236714363098,
"num_tokens": 2572964.0,
"step": 192
},
{
"entropy": 1.0028555393218994,
"epoch": 0.47073170731707314,
"grad_norm": 0.16437511146068573,
"learning_rate": 8.509485094850949e-06,
"loss": 1.0107,
"mean_token_accuracy": 0.6982872486114502,
"num_tokens": 2586642.0,
"step": 193
},
{
"entropy": 0.9957489967346191,
"epoch": 0.47317073170731705,
"grad_norm": 0.16638755798339844,
"learning_rate": 8.495934959349595e-06,
"loss": 1.0016,
"mean_token_accuracy": 0.6981272101402283,
"num_tokens": 2600114.0,
"step": 194
},
{
"entropy": 1.0133684873580933,
"epoch": 0.47560975609756095,
"grad_norm": 0.1650749295949936,
"learning_rate": 8.482384823848239e-06,
"loss": 1.0037,
"mean_token_accuracy": 0.7015370726585388,
"num_tokens": 2613532.0,
"step": 195
},
{
"entropy": 0.9839978218078613,
"epoch": 0.47804878048780486,
"grad_norm": 0.1746927946805954,
"learning_rate": 8.468834688346883e-06,
"loss": 0.9846,
"mean_token_accuracy": 0.7021719813346863,
"num_tokens": 2626992.0,
"step": 196
},
{
"entropy": 0.9965272545814514,
"epoch": 0.48048780487804876,
"grad_norm": 0.16948050260543823,
"learning_rate": 8.45528455284553e-06,
"loss": 0.9919,
"mean_token_accuracy": 0.7043160200119019,
"num_tokens": 2640678.0,
"step": 197
},
{
"entropy": 0.9951333999633789,
"epoch": 0.48292682926829267,
"grad_norm": 0.17663675546646118,
"learning_rate": 8.441734417344174e-06,
"loss": 0.9898,
"mean_token_accuracy": 0.6999698281288147,
"num_tokens": 2653946.0,
"step": 198
},
{
"entropy": 0.9917622804641724,
"epoch": 0.4853658536585366,
"grad_norm": 0.16705453395843506,
"learning_rate": 8.42818428184282e-06,
"loss": 0.9863,
"mean_token_accuracy": 0.7023406624794006,
"num_tokens": 2667548.0,
"step": 199
},
{
"entropy": 0.9877250790596008,
"epoch": 0.4878048780487805,
"grad_norm": 0.1668422818183899,
"learning_rate": 8.414634146341464e-06,
"loss": 0.9898,
"mean_token_accuracy": 0.6997197270393372,
"num_tokens": 2680765.0,
"step": 200
},
{
"entropy": 0.9894189834594727,
"epoch": 0.4902439024390244,
"grad_norm": 0.16777603328227997,
"learning_rate": 8.401084010840109e-06,
"loss": 0.9858,
"mean_token_accuracy": 0.7059915065765381,
"num_tokens": 2694250.0,
"step": 201
},
{
"entropy": 1.0040414333343506,
"epoch": 0.4926829268292683,
"grad_norm": 0.15866151452064514,
"learning_rate": 8.387533875338753e-06,
"loss": 1.003,
"mean_token_accuracy": 0.6997585892677307,
"num_tokens": 2707522.0,
"step": 202
},
{
"entropy": 0.9769632816314697,
"epoch": 0.4951219512195122,
"grad_norm": 0.1801648736000061,
"learning_rate": 8.373983739837399e-06,
"loss": 0.9734,
"mean_token_accuracy": 0.7056036591529846,
"num_tokens": 2721047.0,
"step": 203
},
{
"entropy": 0.9782701134681702,
"epoch": 0.4975609756097561,
"grad_norm": 0.1702914983034134,
"learning_rate": 8.360433604336045e-06,
"loss": 0.9915,
"mean_token_accuracy": 0.7058641314506531,
"num_tokens": 2733955.0,
"step": 204
},
{
"entropy": 0.9618117809295654,
"epoch": 0.5,
"grad_norm": 0.17133237421512604,
"learning_rate": 8.34688346883469e-06,
"loss": 0.9788,
"mean_token_accuracy": 0.7108246684074402,
"num_tokens": 2746849.0,
"step": 205
},
{
"entropy": 0.9704866409301758,
"epoch": 0.5024390243902439,
"grad_norm": 0.16161450743675232,
"learning_rate": 8.333333333333334e-06,
"loss": 0.9652,
"mean_token_accuracy": 0.7115023136138916,
"num_tokens": 2760158.0,
"step": 206
},
{
"entropy": 0.9772287607192993,
"epoch": 0.5048780487804878,
"grad_norm": 0.16217578947544098,
"learning_rate": 8.319783197831978e-06,
"loss": 0.9722,
"mean_token_accuracy": 0.704070508480072,
"num_tokens": 2773907.0,
"step": 207
},
{
"entropy": 0.9927241802215576,
"epoch": 0.5073170731707317,
"grad_norm": 0.16909728944301605,
"learning_rate": 8.306233062330624e-06,
"loss": 0.9958,
"mean_token_accuracy": 0.7050141096115112,
"num_tokens": 2787744.0,
"step": 208
},
{
"entropy": 0.97894287109375,
"epoch": 0.5097560975609756,
"grad_norm": 0.163661390542984,
"learning_rate": 8.292682926829268e-06,
"loss": 0.9846,
"mean_token_accuracy": 0.698600172996521,
"num_tokens": 2801476.0,
"step": 209
},
{
"entropy": 0.961266279220581,
"epoch": 0.5121951219512195,
"grad_norm": 0.16647972166538239,
"learning_rate": 8.279132791327915e-06,
"loss": 0.9514,
"mean_token_accuracy": 0.7096498608589172,
"num_tokens": 2814373.0,
"step": 210
},
{
"entropy": 0.9882842898368835,
"epoch": 0.5146341463414634,
"grad_norm": 0.1674662083387375,
"learning_rate": 8.265582655826559e-06,
"loss": 0.9814,
"mean_token_accuracy": 0.701384425163269,
"num_tokens": 2828330.0,
"step": 211
},
{
"entropy": 0.9803353548049927,
"epoch": 0.5170731707317073,
"grad_norm": 0.16690295934677124,
"learning_rate": 8.252032520325203e-06,
"loss": 0.9887,
"mean_token_accuracy": 0.707240104675293,
"num_tokens": 2841343.0,
"step": 212
},
{
"entropy": 0.986532986164093,
"epoch": 0.5195121951219512,
"grad_norm": 0.16405653953552246,
"learning_rate": 8.23848238482385e-06,
"loss": 0.9875,
"mean_token_accuracy": 0.7040362358093262,
"num_tokens": 2854837.0,
"step": 213
},
{
"entropy": 0.9744679927825928,
"epoch": 0.5219512195121951,
"grad_norm": 0.16172032058238983,
"learning_rate": 8.224932249322494e-06,
"loss": 0.9852,
"mean_token_accuracy": 0.7052052617073059,
"num_tokens": 2868666.0,
"step": 214
},
{
"entropy": 0.9497202634811401,
"epoch": 0.524390243902439,
"grad_norm": 0.16827084124088287,
"learning_rate": 8.21138211382114e-06,
"loss": 0.9593,
"mean_token_accuracy": 0.7130415439605713,
"num_tokens": 2882001.0,
"step": 215
},
{
"entropy": 0.9834163188934326,
"epoch": 0.526829268292683,
"grad_norm": 0.16540959477424622,
"learning_rate": 8.197831978319784e-06,
"loss": 0.9887,
"mean_token_accuracy": 0.7012408971786499,
"num_tokens": 2895717.0,
"step": 216
},
{
"entropy": 0.9932485818862915,
"epoch": 0.5292682926829269,
"grad_norm": 0.16657041013240814,
"learning_rate": 8.184281842818428e-06,
"loss": 0.9775,
"mean_token_accuracy": 0.7028895020484924,
"num_tokens": 2909334.0,
"step": 217
},
{
"entropy": 0.9768931865692139,
"epoch": 0.5317073170731708,
"grad_norm": 0.1715688705444336,
"learning_rate": 8.170731707317073e-06,
"loss": 0.989,
"mean_token_accuracy": 0.7002978920936584,
"num_tokens": 2922443.0,
"step": 218
},
{
"entropy": 0.9682226181030273,
"epoch": 0.5341463414634147,
"grad_norm": 0.16455644369125366,
"learning_rate": 8.157181571815719e-06,
"loss": 0.9792,
"mean_token_accuracy": 0.6996614933013916,
"num_tokens": 2936047.0,
"step": 219
},
{
"entropy": 0.967424750328064,
"epoch": 0.5365853658536586,
"grad_norm": 0.1654297411441803,
"learning_rate": 8.143631436314365e-06,
"loss": 0.9522,
"mean_token_accuracy": 0.710684061050415,
"num_tokens": 2949073.0,
"step": 220
},
{
"entropy": 0.978946328163147,
"epoch": 0.5390243902439025,
"grad_norm": 0.16667896509170532,
"learning_rate": 8.130081300813009e-06,
"loss": 0.98,
"mean_token_accuracy": 0.7056810259819031,
"num_tokens": 2962238.0,
"step": 221
},
{
"entropy": 0.9638472199440002,
"epoch": 0.5414634146341464,
"grad_norm": 0.16370747983455658,
"learning_rate": 8.116531165311653e-06,
"loss": 0.9453,
"mean_token_accuracy": 0.7188960313796997,
"num_tokens": 2975733.0,
"step": 222
},
{
"entropy": 0.9723875522613525,
"epoch": 0.5439024390243903,
"grad_norm": 0.16714785993099213,
"learning_rate": 8.102981029810298e-06,
"loss": 0.9875,
"mean_token_accuracy": 0.698201596736908,
"num_tokens": 2988983.0,
"step": 223
},
{
"entropy": 0.9673885107040405,
"epoch": 0.5463414634146342,
"grad_norm": 0.1624123454093933,
"learning_rate": 8.089430894308944e-06,
"loss": 0.9644,
"mean_token_accuracy": 0.708252489566803,
"num_tokens": 3002401.0,
"step": 224
},
{
"entropy": 0.9567648768424988,
"epoch": 0.5487804878048781,
"grad_norm": 0.16196352243423462,
"learning_rate": 8.075880758807588e-06,
"loss": 0.9497,
"mean_token_accuracy": 0.7132189869880676,
"num_tokens": 3015943.0,
"step": 225
},
{
"entropy": 0.9580562114715576,
"epoch": 0.551219512195122,
"grad_norm": 0.15929940342903137,
"learning_rate": 8.062330623306234e-06,
"loss": 0.9428,
"mean_token_accuracy": 0.7144014835357666,
"num_tokens": 3029534.0,
"step": 226
},
{
"entropy": 0.9454320669174194,
"epoch": 0.5536585365853659,
"grad_norm": 0.16950178146362305,
"learning_rate": 8.048780487804879e-06,
"loss": 0.9408,
"mean_token_accuracy": 0.7093318700790405,
"num_tokens": 3042527.0,
"step": 227
},
{
"entropy": 0.9679467678070068,
"epoch": 0.5560975609756098,
"grad_norm": 0.1640005111694336,
"learning_rate": 8.035230352303523e-06,
"loss": 0.9704,
"mean_token_accuracy": 0.7116739153862,
"num_tokens": 3055889.0,
"step": 228
},
{
"entropy": 0.9547273516654968,
"epoch": 0.5585365853658537,
"grad_norm": 0.16052336990833282,
"learning_rate": 8.021680216802169e-06,
"loss": 0.934,
"mean_token_accuracy": 0.7157609462738037,
"num_tokens": 3069559.0,
"step": 229
},
{
"entropy": 0.9567209482192993,
"epoch": 0.5609756097560976,
"grad_norm": 0.16757436096668243,
"learning_rate": 8.008130081300813e-06,
"loss": 0.9744,
"mean_token_accuracy": 0.7066189646720886,
"num_tokens": 3082991.0,
"step": 230
},
{
"entropy": 0.9696470499038696,
"epoch": 0.5634146341463414,
"grad_norm": 0.15978163480758667,
"learning_rate": 7.99457994579946e-06,
"loss": 0.9766,
"mean_token_accuracy": 0.7067956924438477,
"num_tokens": 3096854.0,
"step": 231
},
{
"entropy": 0.9619528651237488,
"epoch": 0.5658536585365853,
"grad_norm": 0.1610889881849289,
"learning_rate": 7.981029810298104e-06,
"loss": 0.9522,
"mean_token_accuracy": 0.7112933397293091,
"num_tokens": 3110285.0,
"step": 232
},
{
"entropy": 0.9486234188079834,
"epoch": 0.5682926829268292,
"grad_norm": 0.16641642153263092,
"learning_rate": 7.967479674796748e-06,
"loss": 0.9275,
"mean_token_accuracy": 0.7189168334007263,
"num_tokens": 3123411.0,
"step": 233
},
{
"entropy": 0.95262610912323,
"epoch": 0.5707317073170731,
"grad_norm": 0.1619957685470581,
"learning_rate": 7.953929539295394e-06,
"loss": 0.9668,
"mean_token_accuracy": 0.7126327157020569,
"num_tokens": 3137082.0,
"step": 234
},
{
"entropy": 0.9534478783607483,
"epoch": 0.573170731707317,
"grad_norm": 0.16168786585330963,
"learning_rate": 7.940379403794039e-06,
"loss": 0.964,
"mean_token_accuracy": 0.7050497531890869,
"num_tokens": 3150663.0,
"step": 235
},
{
"entropy": 0.9454038143157959,
"epoch": 0.5756097560975609,
"grad_norm": 0.16300973296165466,
"learning_rate": 7.926829268292685e-06,
"loss": 0.9401,
"mean_token_accuracy": 0.7151955366134644,
"num_tokens": 3164025.0,
"step": 236
},
{
"entropy": 0.9535937309265137,
"epoch": 0.5780487804878048,
"grad_norm": 0.16334660351276398,
"learning_rate": 7.913279132791329e-06,
"loss": 0.9503,
"mean_token_accuracy": 0.7116466760635376,
"num_tokens": 3177195.0,
"step": 237
},
{
"entropy": 1.0005275011062622,
"epoch": 0.5804878048780487,
"grad_norm": 0.16791778802871704,
"learning_rate": 7.899728997289973e-06,
"loss": 1.0015,
"mean_token_accuracy": 0.7042770385742188,
"num_tokens": 3190842.0,
"step": 238
},
{
"entropy": 0.9564257860183716,
"epoch": 0.5829268292682926,
"grad_norm": 0.15814629197120667,
"learning_rate": 7.886178861788618e-06,
"loss": 0.9487,
"mean_token_accuracy": 0.7144843935966492,
"num_tokens": 3204521.0,
"step": 239
},
{
"entropy": 0.9540543556213379,
"epoch": 0.5853658536585366,
"grad_norm": 0.1548798680305481,
"learning_rate": 7.872628726287264e-06,
"loss": 0.9506,
"mean_token_accuracy": 0.711961030960083,
"num_tokens": 3217872.0,
"step": 240
},
{
"entropy": 0.9536082744598389,
"epoch": 0.5878048780487805,
"grad_norm": 0.16294530034065247,
"learning_rate": 7.859078590785908e-06,
"loss": 0.9498,
"mean_token_accuracy": 0.7111994624137878,
"num_tokens": 3231219.0,
"step": 241
},
{
"entropy": 0.9481508731842041,
"epoch": 0.5902439024390244,
"grad_norm": 0.15385769307613373,
"learning_rate": 7.845528455284554e-06,
"loss": 0.9323,
"mean_token_accuracy": 0.7128936052322388,
"num_tokens": 3244986.0,
"step": 242
},
{
"entropy": 0.935053825378418,
"epoch": 0.5926829268292683,
"grad_norm": 0.15816359221935272,
"learning_rate": 7.831978319783198e-06,
"loss": 0.9247,
"mean_token_accuracy": 0.7194153070449829,
"num_tokens": 3258342.0,
"step": 243
},
{
"entropy": 0.9509957432746887,
"epoch": 0.5951219512195122,
"grad_norm": 0.16170227527618408,
"learning_rate": 7.818428184281843e-06,
"loss": 0.9558,
"mean_token_accuracy": 0.7063164114952087,
"num_tokens": 3271910.0,
"step": 244
},
{
"entropy": 0.9488095045089722,
"epoch": 0.5975609756097561,
"grad_norm": 0.16762597858905792,
"learning_rate": 7.804878048780489e-06,
"loss": 0.9325,
"mean_token_accuracy": 0.7141220569610596,
"num_tokens": 3285019.0,
"step": 245
},
{
"entropy": 0.9412808418273926,
"epoch": 0.6,
"grad_norm": 0.1669067144393921,
"learning_rate": 7.791327913279133e-06,
"loss": 0.9304,
"mean_token_accuracy": 0.7160465717315674,
"num_tokens": 3298097.0,
"step": 246
},
{
"entropy": 0.9411801099777222,
"epoch": 0.6024390243902439,
"grad_norm": 0.16510054469108582,
"learning_rate": 7.77777777777778e-06,
"loss": 0.952,
"mean_token_accuracy": 0.7096559405326843,
"num_tokens": 3311628.0,
"step": 247
},
{
"entropy": 0.9391855001449585,
"epoch": 0.6048780487804878,
"grad_norm": 0.16120120882987976,
"learning_rate": 7.764227642276424e-06,
"loss": 0.9299,
"mean_token_accuracy": 0.7161240577697754,
"num_tokens": 3324544.0,
"step": 248
},
{
"entropy": 0.9606072902679443,
"epoch": 0.6073170731707317,
"grad_norm": 0.1596563309431076,
"learning_rate": 7.750677506775068e-06,
"loss": 0.98,
"mean_token_accuracy": 0.7059526443481445,
"num_tokens": 3337949.0,
"step": 249
},
{
"entropy": 0.959593653678894,
"epoch": 0.6097560975609756,
"grad_norm": 0.16428229212760925,
"learning_rate": 7.737127371273714e-06,
"loss": 0.9731,
"mean_token_accuracy": 0.7107242941856384,
"num_tokens": 3351523.0,
"step": 250
},
{
"entropy": 0.9481107592582703,
"epoch": 0.6121951219512195,
"grad_norm": 0.15851643681526184,
"learning_rate": 7.723577235772358e-06,
"loss": 0.9415,
"mean_token_accuracy": 0.7170389890670776,
"num_tokens": 3365237.0,
"step": 251
},
{
"entropy": 0.9265803098678589,
"epoch": 0.6146341463414634,
"grad_norm": 0.16618311405181885,
"learning_rate": 7.710027100271004e-06,
"loss": 0.9122,
"mean_token_accuracy": 0.7207344174385071,
"num_tokens": 3378434.0,
"step": 252
},
{
"entropy": 0.9509798288345337,
"epoch": 0.6170731707317073,
"grad_norm": 0.16133299469947815,
"learning_rate": 7.696476964769649e-06,
"loss": 0.947,
"mean_token_accuracy": 0.713214099407196,
"num_tokens": 3391648.0,
"step": 253
},
{
"entropy": 0.92350172996521,
"epoch": 0.6195121951219512,
"grad_norm": 0.16066798567771912,
"learning_rate": 7.682926829268293e-06,
"loss": 0.9029,
"mean_token_accuracy": 0.7265830636024475,
"num_tokens": 3404977.0,
"step": 254
},
{
"entropy": 0.9618203639984131,
"epoch": 0.6219512195121951,
"grad_norm": 0.15734082460403442,
"learning_rate": 7.669376693766937e-06,
"loss": 0.9437,
"mean_token_accuracy": 0.7111424207687378,
"num_tokens": 3418491.0,
"step": 255
},
{
"entropy": 0.9390702247619629,
"epoch": 0.624390243902439,
"grad_norm": 0.15325915813446045,
"learning_rate": 7.655826558265583e-06,
"loss": 0.9392,
"mean_token_accuracy": 0.7145180106163025,
"num_tokens": 3432035.0,
"step": 256
},
{
"entropy": 0.9358468055725098,
"epoch": 0.6268292682926829,
"grad_norm": 0.1554923802614212,
"learning_rate": 7.64227642276423e-06,
"loss": 0.928,
"mean_token_accuracy": 0.7181775569915771,
"num_tokens": 3444935.0,
"step": 257
},
{
"entropy": 0.9481029510498047,
"epoch": 0.6292682926829268,
"grad_norm": 0.15726210176944733,
"learning_rate": 7.628726287262873e-06,
"loss": 0.9564,
"mean_token_accuracy": 0.7126176953315735,
"num_tokens": 3458654.0,
"step": 258
},
{
"entropy": 0.9535932540893555,
"epoch": 0.6317073170731707,
"grad_norm": 0.15442681312561035,
"learning_rate": 7.615176151761519e-06,
"loss": 0.9514,
"mean_token_accuracy": 0.7092245817184448,
"num_tokens": 3472134.0,
"step": 259
},
{
"entropy": 0.9278210401535034,
"epoch": 0.6341463414634146,
"grad_norm": 0.16804730892181396,
"learning_rate": 7.601626016260163e-06,
"loss": 0.9326,
"mean_token_accuracy": 0.7159616947174072,
"num_tokens": 3485106.0,
"step": 260
},
{
"entropy": 0.9546136856079102,
"epoch": 0.6365853658536585,
"grad_norm": 0.15850891172885895,
"learning_rate": 7.5880758807588085e-06,
"loss": 0.9725,
"mean_token_accuracy": 0.705976128578186,
"num_tokens": 3498291.0,
"step": 261
},
{
"entropy": 0.928404688835144,
"epoch": 0.6390243902439025,
"grad_norm": 0.1619364470243454,
"learning_rate": 7.574525745257453e-06,
"loss": 0.9357,
"mean_token_accuracy": 0.7146782875061035,
"num_tokens": 3511408.0,
"step": 262
},
{
"entropy": 0.9354878067970276,
"epoch": 0.6414634146341464,
"grad_norm": 0.16030831634998322,
"learning_rate": 7.560975609756098e-06,
"loss": 0.9349,
"mean_token_accuracy": 0.7133307456970215,
"num_tokens": 3524439.0,
"step": 263
},
{
"entropy": 0.9242296814918518,
"epoch": 0.6439024390243903,
"grad_norm": 0.1562914103269577,
"learning_rate": 7.547425474254744e-06,
"loss": 0.9303,
"mean_token_accuracy": 0.7126427888870239,
"num_tokens": 3537759.0,
"step": 264
},
{
"entropy": 0.9220150709152222,
"epoch": 0.6463414634146342,
"grad_norm": 0.14866940677165985,
"learning_rate": 7.5338753387533885e-06,
"loss": 0.922,
"mean_token_accuracy": 0.7132981419563293,
"num_tokens": 3551228.0,
"step": 265
},
{
"entropy": 0.9343201518058777,
"epoch": 0.6487804878048781,
"grad_norm": 0.1494896113872528,
"learning_rate": 7.520325203252034e-06,
"loss": 0.9373,
"mean_token_accuracy": 0.7129477262496948,
"num_tokens": 3565231.0,
"step": 266
},
{
"entropy": 0.9533241987228394,
"epoch": 0.651219512195122,
"grad_norm": 0.15667204558849335,
"learning_rate": 7.506775067750678e-06,
"loss": 0.9589,
"mean_token_accuracy": 0.7093436121940613,
"num_tokens": 3578775.0,
"step": 267
},
{
"entropy": 0.9355111122131348,
"epoch": 0.6536585365853659,
"grad_norm": 0.15565158426761627,
"learning_rate": 7.493224932249323e-06,
"loss": 0.9295,
"mean_token_accuracy": 0.7132697701454163,
"num_tokens": 3592009.0,
"step": 268
},
{
"entropy": 0.9118462800979614,
"epoch": 0.6560975609756098,
"grad_norm": 0.15243865549564362,
"learning_rate": 7.4796747967479676e-06,
"loss": 0.9183,
"mean_token_accuracy": 0.7204574346542358,
"num_tokens": 3605404.0,
"step": 269
},
{
"entropy": 0.9283488988876343,
"epoch": 0.6585365853658537,
"grad_norm": 0.15385380387306213,
"learning_rate": 7.466124661246613e-06,
"loss": 0.926,
"mean_token_accuracy": 0.7187360525131226,
"num_tokens": 3618838.0,
"step": 270
},
{
"entropy": 0.9379990100860596,
"epoch": 0.6609756097560976,
"grad_norm": 0.15456515550613403,
"learning_rate": 7.452574525745257e-06,
"loss": 0.9381,
"mean_token_accuracy": 0.7181525230407715,
"num_tokens": 3632191.0,
"step": 271
},
{
"entropy": 0.9382643103599548,
"epoch": 0.6634146341463415,
"grad_norm": 0.15582406520843506,
"learning_rate": 7.439024390243903e-06,
"loss": 0.9367,
"mean_token_accuracy": 0.7143399119377136,
"num_tokens": 3645387.0,
"step": 272
},
{
"entropy": 0.9416444301605225,
"epoch": 0.6658536585365854,
"grad_norm": 0.1587027907371521,
"learning_rate": 7.425474254742548e-06,
"loss": 0.9521,
"mean_token_accuracy": 0.7076588273048401,
"num_tokens": 3659178.0,
"step": 273
},
{
"entropy": 0.9447643756866455,
"epoch": 0.6682926829268293,
"grad_norm": 0.16017645597457886,
"learning_rate": 7.411924119241193e-06,
"loss": 0.9442,
"mean_token_accuracy": 0.7130175232887268,
"num_tokens": 3672261.0,
"step": 274
},
{
"entropy": 0.9379363059997559,
"epoch": 0.6707317073170732,
"grad_norm": 0.14899934828281403,
"learning_rate": 7.398373983739838e-06,
"loss": 0.9324,
"mean_token_accuracy": 0.7158769965171814,
"num_tokens": 3685743.0,
"step": 275
},
{
"entropy": 0.9268349409103394,
"epoch": 0.6731707317073171,
"grad_norm": 0.15139304101467133,
"learning_rate": 7.384823848238482e-06,
"loss": 0.9269,
"mean_token_accuracy": 0.7169948816299438,
"num_tokens": 3699469.0,
"step": 276
},
{
"entropy": 0.9546395540237427,
"epoch": 0.675609756097561,
"grad_norm": 0.16162307560443878,
"learning_rate": 7.371273712737128e-06,
"loss": 0.9587,
"mean_token_accuracy": 0.7085087299346924,
"num_tokens": 3712789.0,
"step": 277
},
{
"entropy": 0.9113729000091553,
"epoch": 0.6780487804878049,
"grad_norm": 0.15460745990276337,
"learning_rate": 7.357723577235773e-06,
"loss": 0.9004,
"mean_token_accuracy": 0.7206665873527527,
"num_tokens": 3725947.0,
"step": 278
},
{
"entropy": 0.9525165557861328,
"epoch": 0.6804878048780488,
"grad_norm": 0.15463463962078094,
"learning_rate": 7.344173441734418e-06,
"loss": 0.9383,
"mean_token_accuracy": 0.7162497043609619,
"num_tokens": 3739274.0,
"step": 279
},
{
"entropy": 0.9366529583930969,
"epoch": 0.6829268292682927,
"grad_norm": 0.15342386066913605,
"learning_rate": 7.330623306233063e-06,
"loss": 0.9483,
"mean_token_accuracy": 0.7094659209251404,
"num_tokens": 3752865.0,
"step": 280
},
{
"entropy": 0.935637354850769,
"epoch": 0.6853658536585366,
"grad_norm": 0.15574605762958527,
"learning_rate": 7.317073170731707e-06,
"loss": 0.9274,
"mean_token_accuracy": 0.7157266736030579,
"num_tokens": 3766463.0,
"step": 281
},
{
"entropy": 0.9355779886245728,
"epoch": 0.6878048780487804,
"grad_norm": 0.1519261598587036,
"learning_rate": 7.303523035230353e-06,
"loss": 0.9327,
"mean_token_accuracy": 0.7185456156730652,
"num_tokens": 3779323.0,
"step": 282
},
{
"entropy": 0.952324390411377,
"epoch": 0.6902439024390243,
"grad_norm": 0.1669672280550003,
"learning_rate": 7.289972899728998e-06,
"loss": 0.9357,
"mean_token_accuracy": 0.7216391563415527,
"num_tokens": 3792297.0,
"step": 283
},
{
"entropy": 0.9187766313552856,
"epoch": 0.6926829268292682,
"grad_norm": 0.14877188205718994,
"learning_rate": 7.276422764227643e-06,
"loss": 0.9125,
"mean_token_accuracy": 0.7230643033981323,
"num_tokens": 3805706.0,
"step": 284
},
{
"entropy": 0.9129336476325989,
"epoch": 0.6951219512195121,
"grad_norm": 0.15119393169879913,
"learning_rate": 7.262872628726287e-06,
"loss": 0.9191,
"mean_token_accuracy": 0.7201807498931885,
"num_tokens": 3819220.0,
"step": 285
},
{
"entropy": 0.9101721048355103,
"epoch": 0.697560975609756,
"grad_norm": 0.1465786248445511,
"learning_rate": 7.2493224932249325e-06,
"loss": 0.9127,
"mean_token_accuracy": 0.7222345471382141,
"num_tokens": 3832751.0,
"step": 286
},
{
"entropy": 0.9107828736305237,
"epoch": 0.7,
"grad_norm": 0.15555697679519653,
"learning_rate": 7.2357723577235786e-06,
"loss": 0.8996,
"mean_token_accuracy": 0.7236950397491455,
"num_tokens": 3846158.0,
"step": 287
},
{
"entropy": 0.9074515104293823,
"epoch": 0.7024390243902439,
"grad_norm": 0.15076883137226105,
"learning_rate": 7.222222222222223e-06,
"loss": 0.8957,
"mean_token_accuracy": 0.723412275314331,
"num_tokens": 3859479.0,
"step": 288
},
{
"entropy": 0.917039155960083,
"epoch": 0.7048780487804878,
"grad_norm": 0.14963188767433167,
"learning_rate": 7.208672086720868e-06,
"loss": 0.9132,
"mean_token_accuracy": 0.7183962464332581,
"num_tokens": 3873188.0,
"step": 289
},
{
"entropy": 0.9054569602012634,
"epoch": 0.7073170731707317,
"grad_norm": 0.15667130053043365,
"learning_rate": 7.1951219512195125e-06,
"loss": 0.9072,
"mean_token_accuracy": 0.7192850708961487,
"num_tokens": 3886520.0,
"step": 290
},
{
"entropy": 0.92705237865448,
"epoch": 0.7097560975609756,
"grad_norm": 0.15387941896915436,
"learning_rate": 7.181571815718158e-06,
"loss": 0.9132,
"mean_token_accuracy": 0.7153183817863464,
"num_tokens": 3899540.0,
"step": 291
},
{
"entropy": 0.9047387838363647,
"epoch": 0.7121951219512195,
"grad_norm": 0.148861825466156,
"learning_rate": 7.168021680216802e-06,
"loss": 0.9001,
"mean_token_accuracy": 0.7203510403633118,
"num_tokens": 3912887.0,
"step": 292
},
{
"entropy": 0.924647867679596,
"epoch": 0.7146341463414634,
"grad_norm": 0.15873289108276367,
"learning_rate": 7.154471544715448e-06,
"loss": 0.9227,
"mean_token_accuracy": 0.7200701832771301,
"num_tokens": 3926017.0,
"step": 293
},
{
"entropy": 0.9390074014663696,
"epoch": 0.7170731707317073,
"grad_norm": 0.1504705548286438,
"learning_rate": 7.140921409214093e-06,
"loss": 0.9383,
"mean_token_accuracy": 0.7134274244308472,
"num_tokens": 3939848.0,
"step": 294
},
{
"entropy": 0.9174056649208069,
"epoch": 0.7195121951219512,
"grad_norm": 0.1560080498456955,
"learning_rate": 7.127371273712738e-06,
"loss": 0.9205,
"mean_token_accuracy": 0.7206430435180664,
"num_tokens": 3953549.0,
"step": 295
},
{
"entropy": 0.9219064712524414,
"epoch": 0.7219512195121951,
"grad_norm": 0.1586093157529831,
"learning_rate": 7.113821138211383e-06,
"loss": 0.9438,
"mean_token_accuracy": 0.7093410491943359,
"num_tokens": 3967086.0,
"step": 296
},
{
"entropy": 0.9237949848175049,
"epoch": 0.724390243902439,
"grad_norm": 0.14479567110538483,
"learning_rate": 7.100271002710027e-06,
"loss": 0.9207,
"mean_token_accuracy": 0.7216541171073914,
"num_tokens": 3980499.0,
"step": 297
},
{
"entropy": 0.9169784784317017,
"epoch": 0.7268292682926829,
"grad_norm": 0.1539381593465805,
"learning_rate": 7.086720867208673e-06,
"loss": 0.927,
"mean_token_accuracy": 0.7158411145210266,
"num_tokens": 3993557.0,
"step": 298
},
{
"entropy": 0.9099527597427368,
"epoch": 0.7292682926829268,
"grad_norm": 0.1458337903022766,
"learning_rate": 7.0731707317073175e-06,
"loss": 0.9104,
"mean_token_accuracy": 0.7185899615287781,
"num_tokens": 4007048.0,
"step": 299
},
{
"entropy": 0.9373666048049927,
"epoch": 0.7317073170731707,
"grad_norm": 0.15674933791160583,
"learning_rate": 7.059620596205963e-06,
"loss": 0.9331,
"mean_token_accuracy": 0.7143380641937256,
"num_tokens": 4020706.0,
"step": 300
},
{
"entropy": 0.9198070764541626,
"epoch": 0.7341463414634146,
"grad_norm": 0.15851294994354248,
"learning_rate": 7.046070460704607e-06,
"loss": 0.9139,
"mean_token_accuracy": 0.7180051803588867,
"num_tokens": 4033896.0,
"step": 301
},
{
"entropy": 0.9198285341262817,
"epoch": 0.7365853658536585,
"grad_norm": 0.15451189875602722,
"learning_rate": 7.032520325203252e-06,
"loss": 0.9197,
"mean_token_accuracy": 0.7124741673469543,
"num_tokens": 4047476.0,
"step": 302
},
{
"entropy": 0.9247706532478333,
"epoch": 0.7390243902439024,
"grad_norm": 0.16229675710201263,
"learning_rate": 7.018970189701898e-06,
"loss": 0.9205,
"mean_token_accuracy": 0.7124660611152649,
"num_tokens": 4060760.0,
"step": 303
},
{
"entropy": 0.914578914642334,
"epoch": 0.7414634146341463,
"grad_norm": 0.1586454063653946,
"learning_rate": 7.005420054200543e-06,
"loss": 0.9105,
"mean_token_accuracy": 0.7220610976219177,
"num_tokens": 4074225.0,
"step": 304
},
{
"entropy": 0.9418405294418335,
"epoch": 0.7439024390243902,
"grad_norm": 0.15731269121170044,
"learning_rate": 6.991869918699188e-06,
"loss": 0.9215,
"mean_token_accuracy": 0.7197117805480957,
"num_tokens": 4087563.0,
"step": 305
},
{
"entropy": 0.9367963075637817,
"epoch": 0.7463414634146341,
"grad_norm": 0.15139515697956085,
"learning_rate": 6.978319783197832e-06,
"loss": 0.9353,
"mean_token_accuracy": 0.7137369513511658,
"num_tokens": 4100595.0,
"step": 306
},
{
"entropy": 0.928600549697876,
"epoch": 0.748780487804878,
"grad_norm": 0.15391124784946442,
"learning_rate": 6.964769647696477e-06,
"loss": 0.9175,
"mean_token_accuracy": 0.7180485129356384,
"num_tokens": 4113975.0,
"step": 307
},
{
"entropy": 0.9189996719360352,
"epoch": 0.751219512195122,
"grad_norm": 0.14990229904651642,
"learning_rate": 6.951219512195122e-06,
"loss": 0.9219,
"mean_token_accuracy": 0.7203125953674316,
"num_tokens": 4127810.0,
"step": 308
},
{
"entropy": 0.9270630478858948,
"epoch": 0.7536585365853659,
"grad_norm": 0.15296263992786407,
"learning_rate": 6.937669376693768e-06,
"loss": 0.9238,
"mean_token_accuracy": 0.7191330194473267,
"num_tokens": 4141206.0,
"step": 309
},
{
"entropy": 0.9125182628631592,
"epoch": 0.7560975609756098,
"grad_norm": 0.14483878016471863,
"learning_rate": 6.924119241192413e-06,
"loss": 0.9108,
"mean_token_accuracy": 0.7178426384925842,
"num_tokens": 4155239.0,
"step": 310
},
{
"entropy": 0.9118213057518005,
"epoch": 0.7585365853658537,
"grad_norm": 0.15586057305335999,
"learning_rate": 6.910569105691057e-06,
"loss": 0.8996,
"mean_token_accuracy": 0.7207787036895752,
"num_tokens": 4168456.0,
"step": 311
},
{
"entropy": 0.9187057018280029,
"epoch": 0.7609756097560976,
"grad_norm": 0.14583183825016022,
"learning_rate": 6.8970189701897025e-06,
"loss": 0.9137,
"mean_token_accuracy": 0.7201070785522461,
"num_tokens": 4181920.0,
"step": 312
},
{
"entropy": 0.9076229333877563,
"epoch": 0.7634146341463415,
"grad_norm": 0.14867785573005676,
"learning_rate": 6.883468834688347e-06,
"loss": 0.9095,
"mean_token_accuracy": 0.7186159491539001,
"num_tokens": 4195693.0,
"step": 313
},
{
"entropy": 0.9289067983627319,
"epoch": 0.7658536585365854,
"grad_norm": 0.15520809590816498,
"learning_rate": 6.869918699186993e-06,
"loss": 0.9205,
"mean_token_accuracy": 0.7182366251945496,
"num_tokens": 4208979.0,
"step": 314
},
{
"entropy": 0.912957489490509,
"epoch": 0.7682926829268293,
"grad_norm": 0.1523636430501938,
"learning_rate": 6.856368563685637e-06,
"loss": 0.9227,
"mean_token_accuracy": 0.7217300534248352,
"num_tokens": 4222428.0,
"step": 315
},
{
"entropy": 0.8968350887298584,
"epoch": 0.7707317073170732,
"grad_norm": 0.16188141703605652,
"learning_rate": 6.8428184281842825e-06,
"loss": 0.9074,
"mean_token_accuracy": 0.722152590751648,
"num_tokens": 4236009.0,
"step": 316
},
{
"entropy": 0.9147211313247681,
"epoch": 0.7731707317073171,
"grad_norm": 0.1570591777563095,
"learning_rate": 6.829268292682928e-06,
"loss": 0.9246,
"mean_token_accuracy": 0.716189444065094,
"num_tokens": 4249157.0,
"step": 317
},
{
"entropy": 0.9082373976707458,
"epoch": 0.775609756097561,
"grad_norm": 0.15219484269618988,
"learning_rate": 6.815718157181572e-06,
"loss": 0.884,
"mean_token_accuracy": 0.729555070400238,
"num_tokens": 4262636.0,
"step": 318
},
{
"entropy": 0.9198713898658752,
"epoch": 0.7780487804878049,
"grad_norm": 0.1499103456735611,
"learning_rate": 6.802168021680218e-06,
"loss": 0.9166,
"mean_token_accuracy": 0.714636504650116,
"num_tokens": 4276091.0,
"step": 319
},
{
"entropy": 0.894140362739563,
"epoch": 0.7804878048780488,
"grad_norm": 0.15162697434425354,
"learning_rate": 6.788617886178862e-06,
"loss": 0.8845,
"mean_token_accuracy": 0.7299917936325073,
"num_tokens": 4289514.0,
"step": 320
},
{
"entropy": 0.9078084230422974,
"epoch": 0.7829268292682927,
"grad_norm": 0.1546027660369873,
"learning_rate": 6.775067750677508e-06,
"loss": 0.9118,
"mean_token_accuracy": 0.717620849609375,
"num_tokens": 4303451.0,
"step": 321
},
{
"entropy": 0.909231424331665,
"epoch": 0.7853658536585366,
"grad_norm": 0.1494377702474594,
"learning_rate": 6.761517615176152e-06,
"loss": 0.8964,
"mean_token_accuracy": 0.722392737865448,
"num_tokens": 4316824.0,
"step": 322
},
{
"entropy": 0.920364260673523,
"epoch": 0.7878048780487805,
"grad_norm": 0.16057001054286957,
"learning_rate": 6.747967479674797e-06,
"loss": 0.9136,
"mean_token_accuracy": 0.7145892977714539,
"num_tokens": 4330487.0,
"step": 323
},
{
"entropy": 0.9032753705978394,
"epoch": 0.7902439024390244,
"grad_norm": 0.15743280947208405,
"learning_rate": 6.734417344173443e-06,
"loss": 0.9009,
"mean_token_accuracy": 0.7194689512252808,
"num_tokens": 4343760.0,
"step": 324
},
{
"entropy": 0.9105545282363892,
"epoch": 0.7926829268292683,
"grad_norm": 0.1525033861398697,
"learning_rate": 6.7208672086720876e-06,
"loss": 0.9065,
"mean_token_accuracy": 0.7208117842674255,
"num_tokens": 4357129.0,
"step": 325
},
{
"entropy": 0.906657338142395,
"epoch": 0.7951219512195122,
"grad_norm": 0.1705314815044403,
"learning_rate": 6.707317073170733e-06,
"loss": 0.9237,
"mean_token_accuracy": 0.7187808752059937,
"num_tokens": 4370302.0,
"step": 326
},
{
"entropy": 0.9039660692214966,
"epoch": 0.7975609756097561,
"grad_norm": 0.15754637122154236,
"learning_rate": 6.693766937669377e-06,
"loss": 0.8871,
"mean_token_accuracy": 0.7259286046028137,
"num_tokens": 4384048.0,
"step": 327
},
{
"entropy": 0.9237337708473206,
"epoch": 0.8,
"grad_norm": 0.16106484830379486,
"learning_rate": 6.680216802168022e-06,
"loss": 0.9221,
"mean_token_accuracy": 0.7178065776824951,
"num_tokens": 4397413.0,
"step": 328
},
{
"entropy": 0.8977658152580261,
"epoch": 0.802439024390244,
"grad_norm": 0.16258393228054047,
"learning_rate": 6.666666666666667e-06,
"loss": 0.9158,
"mean_token_accuracy": 0.7205637097358704,
"num_tokens": 4410627.0,
"step": 329
},
{
"entropy": 0.9091554880142212,
"epoch": 0.8048780487804879,
"grad_norm": 0.16257335245609283,
"learning_rate": 6.653116531165313e-06,
"loss": 0.905,
"mean_token_accuracy": 0.7194573283195496,
"num_tokens": 4423985.0,
"step": 330
},
{
"entropy": 0.9025290012359619,
"epoch": 0.8073170731707318,
"grad_norm": 0.15430954098701477,
"learning_rate": 6.639566395663957e-06,
"loss": 0.9082,
"mean_token_accuracy": 0.7190539240837097,
"num_tokens": 4437573.0,
"step": 331
},
{
"entropy": 0.9192676544189453,
"epoch": 0.8097560975609757,
"grad_norm": 0.1551608443260193,
"learning_rate": 6.626016260162602e-06,
"loss": 0.9148,
"mean_token_accuracy": 0.7191833257675171,
"num_tokens": 4450715.0,
"step": 332
},
{
"entropy": 0.9210897088050842,
"epoch": 0.8121951219512196,
"grad_norm": 0.15126371383666992,
"learning_rate": 6.6124661246612474e-06,
"loss": 0.9272,
"mean_token_accuracy": 0.7119234204292297,
"num_tokens": 4464519.0,
"step": 333
},
{
"entropy": 0.9274299144744873,
"epoch": 0.8146341463414634,
"grad_norm": 0.15113505721092224,
"learning_rate": 6.598915989159892e-06,
"loss": 0.911,
"mean_token_accuracy": 0.7139639854431152,
"num_tokens": 4477855.0,
"step": 334
},
{
"entropy": 0.9136286973953247,
"epoch": 0.8170731707317073,
"grad_norm": 0.1449194997549057,
"learning_rate": 6.585365853658538e-06,
"loss": 0.9097,
"mean_token_accuracy": 0.7178084254264832,
"num_tokens": 4491578.0,
"step": 335
},
{
"entropy": 0.8942598700523376,
"epoch": 0.8195121951219512,
"grad_norm": 0.15594850480556488,
"learning_rate": 6.571815718157182e-06,
"loss": 0.8835,
"mean_token_accuracy": 0.725902259349823,
"num_tokens": 4505060.0,
"step": 336
},
{
"entropy": 0.8936731815338135,
"epoch": 0.8219512195121951,
"grad_norm": 0.15950734913349152,
"learning_rate": 6.558265582655827e-06,
"loss": 0.8879,
"mean_token_accuracy": 0.7259511351585388,
"num_tokens": 4518008.0,
"step": 337
},
{
"entropy": 0.9004725217819214,
"epoch": 0.824390243902439,
"grad_norm": 0.14698483049869537,
"learning_rate": 6.544715447154472e-06,
"loss": 0.9086,
"mean_token_accuracy": 0.7235898375511169,
"num_tokens": 4531551.0,
"step": 338
},
{
"entropy": 0.8944765329360962,
"epoch": 0.8268292682926829,
"grad_norm": 0.15387873351573944,
"learning_rate": 6.531165311653117e-06,
"loss": 0.8977,
"mean_token_accuracy": 0.7176317572593689,
"num_tokens": 4545400.0,
"step": 339
},
{
"entropy": 0.9095175266265869,
"epoch": 0.8292682926829268,
"grad_norm": 0.15829972922801971,
"learning_rate": 6.517615176151762e-06,
"loss": 0.8969,
"mean_token_accuracy": 0.723007082939148,
"num_tokens": 4559077.0,
"step": 340
},
{
"entropy": 0.9253937005996704,
"epoch": 0.8317073170731707,
"grad_norm": 0.1539793163537979,
"learning_rate": 6.504065040650407e-06,
"loss": 0.9268,
"mean_token_accuracy": 0.7156819701194763,
"num_tokens": 4572803.0,
"step": 341
},
{
"entropy": 0.8887916803359985,
"epoch": 0.8341463414634146,
"grad_norm": 0.16268229484558105,
"learning_rate": 6.4905149051490525e-06,
"loss": 0.8854,
"mean_token_accuracy": 0.7258303761482239,
"num_tokens": 4586307.0,
"step": 342
},
{
"entropy": 0.9081874489784241,
"epoch": 0.8365853658536585,
"grad_norm": 0.15919581055641174,
"learning_rate": 6.476964769647697e-06,
"loss": 0.9098,
"mean_token_accuracy": 0.7165588140487671,
"num_tokens": 4599458.0,
"step": 343
},
{
"entropy": 0.906166136264801,
"epoch": 0.8390243902439024,
"grad_norm": 0.15650396049022675,
"learning_rate": 6.463414634146342e-06,
"loss": 0.902,
"mean_token_accuracy": 0.7163677215576172,
"num_tokens": 4612854.0,
"step": 344
},
{
"entropy": 0.8984540700912476,
"epoch": 0.8414634146341463,
"grad_norm": 0.1492290049791336,
"learning_rate": 6.449864498644986e-06,
"loss": 0.8879,
"mean_token_accuracy": 0.7269256711006165,
"num_tokens": 4626229.0,
"step": 345
},
{
"entropy": 0.9049922227859497,
"epoch": 0.8439024390243902,
"grad_norm": 0.15556073188781738,
"learning_rate": 6.436314363143632e-06,
"loss": 0.8954,
"mean_token_accuracy": 0.7196219563484192,
"num_tokens": 4639577.0,
"step": 346
},
{
"entropy": 0.8850518465042114,
"epoch": 0.8463414634146341,
"grad_norm": 0.1551712155342102,
"learning_rate": 6.422764227642278e-06,
"loss": 0.8819,
"mean_token_accuracy": 0.7270249724388123,
"num_tokens": 4652803.0,
"step": 347
},
{
"entropy": 0.8971195220947266,
"epoch": 0.848780487804878,
"grad_norm": 0.16061030328273773,
"learning_rate": 6.409214092140922e-06,
"loss": 0.9152,
"mean_token_accuracy": 0.7229515910148621,
"num_tokens": 4666073.0,
"step": 348
},
{
"entropy": 0.8811110258102417,
"epoch": 0.8512195121951219,
"grad_norm": 0.16647042334079742,
"learning_rate": 6.395663956639567e-06,
"loss": 0.892,
"mean_token_accuracy": 0.728188693523407,
"num_tokens": 4679190.0,
"step": 349
},
{
"entropy": 0.8929190039634705,
"epoch": 0.8536585365853658,
"grad_norm": 0.16059380769729614,
"learning_rate": 6.3821138211382115e-06,
"loss": 0.8903,
"mean_token_accuracy": 0.7205564975738525,
"num_tokens": 4692647.0,
"step": 350
},
{
"entropy": 0.8734034299850464,
"epoch": 0.8560975609756097,
"grad_norm": 0.15726624429225922,
"learning_rate": 6.368563685636857e-06,
"loss": 0.8663,
"mean_token_accuracy": 0.7282682061195374,
"num_tokens": 4705996.0,
"step": 351
},
{
"entropy": 0.9022495746612549,
"epoch": 0.8585365853658536,
"grad_norm": 0.16244319081306458,
"learning_rate": 6.355013550135501e-06,
"loss": 0.9039,
"mean_token_accuracy": 0.7216587066650391,
"num_tokens": 4719420.0,
"step": 352
},
{
"entropy": 0.8873569965362549,
"epoch": 0.8609756097560975,
"grad_norm": 0.15533290803432465,
"learning_rate": 6.341463414634147e-06,
"loss": 0.8872,
"mean_token_accuracy": 0.7262784838676453,
"num_tokens": 4732694.0,
"step": 353
},
{
"entropy": 0.9040166139602661,
"epoch": 0.8634146341463415,
"grad_norm": 0.1683635264635086,
"learning_rate": 6.3279132791327915e-06,
"loss": 0.9086,
"mean_token_accuracy": 0.7204293012619019,
"num_tokens": 4745755.0,
"step": 354
},
{
"entropy": 0.8856945633888245,
"epoch": 0.8658536585365854,
"grad_norm": 0.16074056923389435,
"learning_rate": 6.314363143631437e-06,
"loss": 0.885,
"mean_token_accuracy": 0.7246061563491821,
"num_tokens": 4759101.0,
"step": 355
},
{
"entropy": 0.905910849571228,
"epoch": 0.8682926829268293,
"grad_norm": 0.15096408128738403,
"learning_rate": 6.300813008130082e-06,
"loss": 0.899,
"mean_token_accuracy": 0.7240304350852966,
"num_tokens": 4772912.0,
"step": 356
},
{
"entropy": 0.9093368649482727,
"epoch": 0.8707317073170732,
"grad_norm": 0.15921390056610107,
"learning_rate": 6.287262872628726e-06,
"loss": 0.9007,
"mean_token_accuracy": 0.7238253355026245,
"num_tokens": 4786166.0,
"step": 357
},
{
"entropy": 0.8879554271697998,
"epoch": 0.8731707317073171,
"grad_norm": 0.16032229363918304,
"learning_rate": 6.273712737127372e-06,
"loss": 0.8967,
"mean_token_accuracy": 0.7268417477607727,
"num_tokens": 4799471.0,
"step": 358
},
{
"entropy": 0.891460657119751,
"epoch": 0.875609756097561,
"grad_norm": 0.16416114568710327,
"learning_rate": 6.260162601626017e-06,
"loss": 0.8902,
"mean_token_accuracy": 0.7235052585601807,
"num_tokens": 4813386.0,
"step": 359
},
{
"entropy": 0.8875571489334106,
"epoch": 0.8780487804878049,
"grad_norm": 0.1605481505393982,
"learning_rate": 6.246612466124662e-06,
"loss": 0.8898,
"mean_token_accuracy": 0.7255409955978394,
"num_tokens": 4826526.0,
"step": 360
},
{
"entropy": 0.8935996294021606,
"epoch": 0.8804878048780488,
"grad_norm": 0.16389435529708862,
"learning_rate": 6.233062330623306e-06,
"loss": 0.91,
"mean_token_accuracy": 0.7174138426780701,
"num_tokens": 4840060.0,
"step": 361
},
{
"entropy": 0.8958407640457153,
"epoch": 0.8829268292682927,
"grad_norm": 0.16387997567653656,
"learning_rate": 6.219512195121951e-06,
"loss": 0.8974,
"mean_token_accuracy": 0.72060626745224,
"num_tokens": 4853140.0,
"step": 362
},
{
"entropy": 0.8770266771316528,
"epoch": 0.8853658536585366,
"grad_norm": 0.1663968414068222,
"learning_rate": 6.205962059620597e-06,
"loss": 0.8814,
"mean_token_accuracy": 0.7238948941230774,
"num_tokens": 4866209.0,
"step": 363
},
{
"entropy": 0.904643177986145,
"epoch": 0.8878048780487805,
"grad_norm": 0.15112806856632233,
"learning_rate": 6.192411924119242e-06,
"loss": 0.9089,
"mean_token_accuracy": 0.7163041830062866,
"num_tokens": 4879743.0,
"step": 364
},
{
"entropy": 0.89634770154953,
"epoch": 0.8902439024390244,
"grad_norm": 0.1654719114303589,
"learning_rate": 6.178861788617887e-06,
"loss": 0.894,
"mean_token_accuracy": 0.7259781360626221,
"num_tokens": 4893382.0,
"step": 365
},
{
"entropy": 0.9034420251846313,
"epoch": 0.8926829268292683,
"grad_norm": 0.15709993243217468,
"learning_rate": 6.165311653116531e-06,
"loss": 0.907,
"mean_token_accuracy": 0.7218876481056213,
"num_tokens": 4906515.0,
"step": 366
},
{
"entropy": 0.8903079032897949,
"epoch": 0.8951219512195122,
"grad_norm": 0.17142841219902039,
"learning_rate": 6.1517615176151765e-06,
"loss": 0.8922,
"mean_token_accuracy": 0.7258428931236267,
"num_tokens": 4919374.0,
"step": 367
},
{
"entropy": 0.9114763140678406,
"epoch": 0.8975609756097561,
"grad_norm": 0.16571395099163055,
"learning_rate": 6.138211382113821e-06,
"loss": 0.9181,
"mean_token_accuracy": 0.7214821577072144,
"num_tokens": 4932452.0,
"step": 368
},
{
"entropy": 0.8874707818031311,
"epoch": 0.9,
"grad_norm": 0.16487263143062592,
"learning_rate": 6.124661246612467e-06,
"loss": 0.8915,
"mean_token_accuracy": 0.7204229831695557,
"num_tokens": 4946085.0,
"step": 369
},
{
"entropy": 0.8861266374588013,
"epoch": 0.9024390243902439,
"grad_norm": 0.1598166823387146,
"learning_rate": 6.111111111111112e-06,
"loss": 0.8735,
"mean_token_accuracy": 0.7311769127845764,
"num_tokens": 4958838.0,
"step": 370
},
{
"entropy": 0.8907301425933838,
"epoch": 0.9048780487804878,
"grad_norm": 0.1626753956079483,
"learning_rate": 6.0975609756097564e-06,
"loss": 0.9115,
"mean_token_accuracy": 0.7186935544013977,
"num_tokens": 4972142.0,
"step": 371
},
{
"entropy": 0.895031213760376,
"epoch": 0.9073170731707317,
"grad_norm": 0.15703290700912476,
"learning_rate": 6.084010840108402e-06,
"loss": 0.8925,
"mean_token_accuracy": 0.7240086793899536,
"num_tokens": 4985499.0,
"step": 372
},
{
"entropy": 0.8968839645385742,
"epoch": 0.9097560975609756,
"grad_norm": 0.15938685834407806,
"learning_rate": 6.070460704607046e-06,
"loss": 0.8922,
"mean_token_accuracy": 0.7231118083000183,
"num_tokens": 4998755.0,
"step": 373
},
{
"entropy": 0.8882355690002441,
"epoch": 0.9121951219512195,
"grad_norm": 0.1686704307794571,
"learning_rate": 6.056910569105692e-06,
"loss": 0.8867,
"mean_token_accuracy": 0.7230345010757446,
"num_tokens": 5011834.0,
"step": 374
},
{
"entropy": 0.9107680320739746,
"epoch": 0.9146341463414634,
"grad_norm": 0.15755151212215424,
"learning_rate": 6.043360433604336e-06,
"loss": 0.9115,
"mean_token_accuracy": 0.7232315540313721,
"num_tokens": 5025280.0,
"step": 375
},
{
"entropy": 0.876611590385437,
"epoch": 0.9170731707317074,
"grad_norm": 0.16388185322284698,
"learning_rate": 6.0298102981029816e-06,
"loss": 0.8723,
"mean_token_accuracy": 0.7300817966461182,
"num_tokens": 5038500.0,
"step": 376
},
{
"entropy": 0.8733739852905273,
"epoch": 0.9195121951219513,
"grad_norm": 0.16187280416488647,
"learning_rate": 6.016260162601627e-06,
"loss": 0.8635,
"mean_token_accuracy": 0.7310600280761719,
"num_tokens": 5052006.0,
"step": 377
},
{
"entropy": 0.8965020179748535,
"epoch": 0.9219512195121952,
"grad_norm": 0.16080215573310852,
"learning_rate": 6.002710027100271e-06,
"loss": 0.8937,
"mean_token_accuracy": 0.721447229385376,
"num_tokens": 5065427.0,
"step": 378
},
{
"entropy": 0.8970279097557068,
"epoch": 0.9243902439024391,
"grad_norm": 0.1639380156993866,
"learning_rate": 5.989159891598917e-06,
"loss": 0.883,
"mean_token_accuracy": 0.727632999420166,
"num_tokens": 5079068.0,
"step": 379
},
{
"entropy": 0.8991611003875732,
"epoch": 0.926829268292683,
"grad_norm": 0.16831153631210327,
"learning_rate": 5.9756097560975615e-06,
"loss": 0.9014,
"mean_token_accuracy": 0.7194920182228088,
"num_tokens": 5092392.0,
"step": 380
},
{
"entropy": 0.8883278369903564,
"epoch": 0.9292682926829269,
"grad_norm": 0.1687973588705063,
"learning_rate": 5.962059620596207e-06,
"loss": 0.8735,
"mean_token_accuracy": 0.7264938354492188,
"num_tokens": 5105830.0,
"step": 381
},
{
"entropy": 0.8809381723403931,
"epoch": 0.9317073170731708,
"grad_norm": 0.16963472962379456,
"learning_rate": 5.948509485094851e-06,
"loss": 0.882,
"mean_token_accuracy": 0.7262528538703918,
"num_tokens": 5119395.0,
"step": 382
},
{
"entropy": 0.9021738767623901,
"epoch": 0.9341463414634147,
"grad_norm": 0.16875696182250977,
"learning_rate": 5.934959349593496e-06,
"loss": 0.9195,
"mean_token_accuracy": 0.718323290348053,
"num_tokens": 5133033.0,
"step": 383
},
{
"entropy": 0.8832775950431824,
"epoch": 0.9365853658536586,
"grad_norm": 0.16139884293079376,
"learning_rate": 5.921409214092141e-06,
"loss": 0.8663,
"mean_token_accuracy": 0.7280119061470032,
"num_tokens": 5146454.0,
"step": 384
},
{
"entropy": 0.9056813716888428,
"epoch": 0.9390243902439024,
"grad_norm": 0.16711100935935974,
"learning_rate": 5.907859078590787e-06,
"loss": 0.89,
"mean_token_accuracy": 0.723343551158905,
"num_tokens": 5160144.0,
"step": 385
},
{
"entropy": 0.8854928016662598,
"epoch": 0.9414634146341463,
"grad_norm": 0.15719208121299744,
"learning_rate": 5.894308943089432e-06,
"loss": 0.8874,
"mean_token_accuracy": 0.7249353528022766,
"num_tokens": 5173695.0,
"step": 386
},
{
"entropy": 0.9151058197021484,
"epoch": 0.9439024390243902,
"grad_norm": 0.17206765711307526,
"learning_rate": 5.880758807588076e-06,
"loss": 0.9246,
"mean_token_accuracy": 0.7111825942993164,
"num_tokens": 5187384.0,
"step": 387
},
{
"entropy": 0.8885694742202759,
"epoch": 0.9463414634146341,
"grad_norm": 0.15557175874710083,
"learning_rate": 5.867208672086721e-06,
"loss": 0.8783,
"mean_token_accuracy": 0.7255944013595581,
"num_tokens": 5201321.0,
"step": 388
},
{
"entropy": 0.8794446587562561,
"epoch": 0.948780487804878,
"grad_norm": 0.16666075587272644,
"learning_rate": 5.853658536585366e-06,
"loss": 0.8845,
"mean_token_accuracy": 0.7247271537780762,
"num_tokens": 5214622.0,
"step": 389
},
{
"entropy": 0.8968200087547302,
"epoch": 0.9512195121951219,
"grad_norm": 0.17773029208183289,
"learning_rate": 5.840108401084012e-06,
"loss": 0.9077,
"mean_token_accuracy": 0.7226738929748535,
"num_tokens": 5227922.0,
"step": 390
},
{
"entropy": 0.8937841653823853,
"epoch": 0.9536585365853658,
"grad_norm": 0.16367283463478088,
"learning_rate": 5.826558265582656e-06,
"loss": 0.8809,
"mean_token_accuracy": 0.7214851975440979,
"num_tokens": 5241808.0,
"step": 391
},
{
"entropy": 0.8804587125778198,
"epoch": 0.9560975609756097,
"grad_norm": 0.1632731407880783,
"learning_rate": 5.813008130081301e-06,
"loss": 0.8683,
"mean_token_accuracy": 0.7282600998878479,
"num_tokens": 5255451.0,
"step": 392
},
{
"entropy": 0.8958999514579773,
"epoch": 0.9585365853658536,
"grad_norm": 0.17145903408527374,
"learning_rate": 5.7994579945799465e-06,
"loss": 0.8949,
"mean_token_accuracy": 0.7235816121101379,
"num_tokens": 5268545.0,
"step": 393
},
{
"entropy": 0.8910573124885559,
"epoch": 0.9609756097560975,
"grad_norm": 0.17792750895023346,
"learning_rate": 5.785907859078591e-06,
"loss": 0.8947,
"mean_token_accuracy": 0.7218443155288696,
"num_tokens": 5281791.0,
"step": 394
},
{
"entropy": 0.8853224515914917,
"epoch": 0.9634146341463414,
"grad_norm": 0.1683335304260254,
"learning_rate": 5.772357723577237e-06,
"loss": 0.8731,
"mean_token_accuracy": 0.7287229895591736,
"num_tokens": 5295284.0,
"step": 395
},
{
"entropy": 0.894146740436554,
"epoch": 0.9658536585365853,
"grad_norm": 0.1783977597951889,
"learning_rate": 5.758807588075881e-06,
"loss": 0.8843,
"mean_token_accuracy": 0.7266537547111511,
"num_tokens": 5308225.0,
"step": 396
},
{
"entropy": 0.8935642242431641,
"epoch": 0.9682926829268292,
"grad_norm": 0.18579219281673431,
"learning_rate": 5.7452574525745265e-06,
"loss": 0.9289,
"mean_token_accuracy": 0.7102810740470886,
"num_tokens": 5321440.0,
"step": 397
},
{
"entropy": 0.868985652923584,
"epoch": 0.9707317073170731,
"grad_norm": 0.1684473305940628,
"learning_rate": 5.731707317073171e-06,
"loss": 0.85,
"mean_token_accuracy": 0.7313686013221741,
"num_tokens": 5334418.0,
"step": 398
},
{
"entropy": 0.8838146924972534,
"epoch": 0.973170731707317,
"grad_norm": 0.1632496416568756,
"learning_rate": 5.718157181571816e-06,
"loss": 0.8864,
"mean_token_accuracy": 0.7268916964530945,
"num_tokens": 5347795.0,
"step": 399
},
{
"entropy": 0.882776141166687,
"epoch": 0.975609756097561,
"grad_norm": 0.16958434879779816,
"learning_rate": 5.704607046070462e-06,
"loss": 0.8898,
"mean_token_accuracy": 0.7269032001495361,
"num_tokens": 5361341.0,
"step": 400
},
{
"entropy": 0.8883211016654968,
"epoch": 0.9780487804878049,
"grad_norm": 0.15948385000228882,
"learning_rate": 5.691056910569106e-06,
"loss": 0.8854,
"mean_token_accuracy": 0.7242578864097595,
"num_tokens": 5374866.0,
"step": 401
},
{
"entropy": 0.8896247744560242,
"epoch": 0.9804878048780488,
"grad_norm": 0.1636204868555069,
"learning_rate": 5.677506775067752e-06,
"loss": 0.8869,
"mean_token_accuracy": 0.7276943325996399,
"num_tokens": 5388466.0,
"step": 402
},
{
"entropy": 0.9205676317214966,
"epoch": 0.9829268292682927,
"grad_norm": 0.18203061819076538,
"learning_rate": 5.663956639566396e-06,
"loss": 0.9197,
"mean_token_accuracy": 0.7194843888282776,
"num_tokens": 5402524.0,
"step": 403
},
{
"entropy": 0.875140905380249,
"epoch": 0.9853658536585366,
"grad_norm": 0.17026175558567047,
"learning_rate": 5.650406504065041e-06,
"loss": 0.8884,
"mean_token_accuracy": 0.7227595448493958,
"num_tokens": 5415774.0,
"step": 404
},
{
"entropy": 0.8699055910110474,
"epoch": 0.9878048780487805,
"grad_norm": 0.15694531798362732,
"learning_rate": 5.6368563685636855e-06,
"loss": 0.8806,
"mean_token_accuracy": 0.7257359623908997,
"num_tokens": 5429514.0,
"step": 405
},
{
"entropy": 0.8878951072692871,
"epoch": 0.9902439024390244,
"grad_norm": 0.16797906160354614,
"learning_rate": 5.6233062330623315e-06,
"loss": 0.8888,
"mean_token_accuracy": 0.7275060415267944,
"num_tokens": 5442778.0,
"step": 406
},
{
"entropy": 0.876734733581543,
"epoch": 0.9926829268292683,
"grad_norm": 0.17915265262126923,
"learning_rate": 5.609756097560977e-06,
"loss": 0.8878,
"mean_token_accuracy": 0.724197268486023,
"num_tokens": 5456155.0,
"step": 407
},
{
"entropy": 0.8894374370574951,
"epoch": 0.9951219512195122,
"grad_norm": 0.16572211682796478,
"learning_rate": 5.596205962059621e-06,
"loss": 0.89,
"mean_token_accuracy": 0.7255958318710327,
"num_tokens": 5469724.0,
"step": 408
},
{
"entropy": 0.8932273387908936,
"epoch": 0.9975609756097561,
"grad_norm": 0.15642738342285156,
"learning_rate": 5.582655826558266e-06,
"loss": 0.8877,
"mean_token_accuracy": 0.7234919667243958,
"num_tokens": 5483566.0,
"step": 409
},
{
"entropy": 0.8865507245063782,
"epoch": 1.0,
"grad_norm": 0.17557752132415771,
"learning_rate": 5.569105691056911e-06,
"loss": 0.8676,
"mean_token_accuracy": 0.729709267616272,
"num_tokens": 5496790.0,
"step": 410
},
{
"entropy": 0.883284866809845,
"epoch": 1.002439024390244,
"grad_norm": 0.15459215641021729,
"learning_rate": 5.555555555555557e-06,
"loss": 0.8867,
"mean_token_accuracy": 0.7233609557151794,
"num_tokens": 5510564.0,
"step": 411
},
{
"entropy": 0.873902440071106,
"epoch": 1.0048780487804878,
"grad_norm": 0.17083869874477386,
"learning_rate": 5.542005420054201e-06,
"loss": 0.8604,
"mean_token_accuracy": 0.7324744462966919,
"num_tokens": 5523775.0,
"step": 412
},
{
"entropy": 0.8813484311103821,
"epoch": 1.0073170731707317,
"grad_norm": 0.17701290547847748,
"learning_rate": 5.528455284552846e-06,
"loss": 0.873,
"mean_token_accuracy": 0.7278922200202942,
"num_tokens": 5536852.0,
"step": 413
},
{
"entropy": 0.8950551748275757,
"epoch": 1.0097560975609756,
"grad_norm": 0.18133288621902466,
"learning_rate": 5.5149051490514906e-06,
"loss": 0.8765,
"mean_token_accuracy": 0.7292779684066772,
"num_tokens": 5549970.0,
"step": 414
},
{
"entropy": 0.881912350654602,
"epoch": 1.0121951219512195,
"grad_norm": 0.1715339571237564,
"learning_rate": 5.501355013550136e-06,
"loss": 0.8937,
"mean_token_accuracy": 0.7215859889984131,
"num_tokens": 5563782.0,
"step": 415
},
{
"entropy": 0.8737983703613281,
"epoch": 1.0146341463414634,
"grad_norm": 0.17756839096546173,
"learning_rate": 5.487804878048781e-06,
"loss": 0.8851,
"mean_token_accuracy": 0.7261270880699158,
"num_tokens": 5577129.0,
"step": 416
},
{
"entropy": 0.883063793182373,
"epoch": 1.0170731707317073,
"grad_norm": 0.1765228509902954,
"learning_rate": 5.474254742547425e-06,
"loss": 0.8864,
"mean_token_accuracy": 0.7223793864250183,
"num_tokens": 5590577.0,
"step": 417
},
{
"entropy": 0.8849365711212158,
"epoch": 1.0195121951219512,
"grad_norm": 0.1792328804731369,
"learning_rate": 5.460704607046071e-06,
"loss": 0.8766,
"mean_token_accuracy": 0.7255821228027344,
"num_tokens": 5603821.0,
"step": 418
},
{
"entropy": 0.8823648691177368,
"epoch": 1.0219512195121951,
"grad_norm": 0.173680379986763,
"learning_rate": 5.447154471544716e-06,
"loss": 0.8822,
"mean_token_accuracy": 0.7273980975151062,
"num_tokens": 5616889.0,
"step": 419
},
{
"entropy": 0.8869985342025757,
"epoch": 1.024390243902439,
"grad_norm": 0.17492908239364624,
"learning_rate": 5.433604336043361e-06,
"loss": 0.9018,
"mean_token_accuracy": 0.7217662334442139,
"num_tokens": 5630063.0,
"step": 420
},
{
"entropy": 0.8956865072250366,
"epoch": 1.026829268292683,
"grad_norm": 0.16189217567443848,
"learning_rate": 5.420054200542005e-06,
"loss": 0.887,
"mean_token_accuracy": 0.7262184619903564,
"num_tokens": 5643703.0,
"step": 421
},
{
"entropy": 0.8691190481185913,
"epoch": 1.0292682926829269,
"grad_norm": 0.17272132635116577,
"learning_rate": 5.4065040650406504e-06,
"loss": 0.8765,
"mean_token_accuracy": 0.7276405096054077,
"num_tokens": 5657315.0,
"step": 422
},
{
"entropy": 0.8758895397186279,
"epoch": 1.0317073170731708,
"grad_norm": 0.17333146929740906,
"learning_rate": 5.3929539295392965e-06,
"loss": 0.8742,
"mean_token_accuracy": 0.7282917499542236,
"num_tokens": 5671070.0,
"step": 423
},
{
"entropy": 0.8903429508209229,
"epoch": 1.0341463414634147,
"grad_norm": 0.1801253706216812,
"learning_rate": 5.379403794037941e-06,
"loss": 0.8842,
"mean_token_accuracy": 0.7301153540611267,
"num_tokens": 5684262.0,
"step": 424
},
{
"entropy": 0.8774839639663696,
"epoch": 1.0365853658536586,
"grad_norm": 0.1836852729320526,
"learning_rate": 5.365853658536586e-06,
"loss": 0.8781,
"mean_token_accuracy": 0.7317860722541809,
"num_tokens": 5697592.0,
"step": 425
},
{
"entropy": 0.898011326789856,
"epoch": 1.0390243902439025,
"grad_norm": 0.17385412752628326,
"learning_rate": 5.35230352303523e-06,
"loss": 0.8899,
"mean_token_accuracy": 0.724575936794281,
"num_tokens": 5710991.0,
"step": 426
},
{
"entropy": 0.885576069355011,
"epoch": 1.0414634146341464,
"grad_norm": 0.16952155530452728,
"learning_rate": 5.338753387533876e-06,
"loss": 0.8831,
"mean_token_accuracy": 0.7247596383094788,
"num_tokens": 5724319.0,
"step": 427
},
{
"entropy": 0.8738988041877747,
"epoch": 1.0439024390243903,
"grad_norm": 0.18119633197784424,
"learning_rate": 5.32520325203252e-06,
"loss": 0.8629,
"mean_token_accuracy": 0.7306736707687378,
"num_tokens": 5737620.0,
"step": 428
},
{
"entropy": 0.8968448638916016,
"epoch": 1.0463414634146342,
"grad_norm": 0.189066544175148,
"learning_rate": 5.311653116531166e-06,
"loss": 0.8896,
"mean_token_accuracy": 0.7251328825950623,
"num_tokens": 5750806.0,
"step": 429
},
{
"entropy": 0.8695570230484009,
"epoch": 1.048780487804878,
"grad_norm": 0.16916069388389587,
"learning_rate": 5.298102981029811e-06,
"loss": 0.8897,
"mean_token_accuracy": 0.7256984710693359,
"num_tokens": 5764566.0,
"step": 430
},
{
"entropy": 0.8742542266845703,
"epoch": 1.051219512195122,
"grad_norm": 0.1751270592212677,
"learning_rate": 5.2845528455284555e-06,
"loss": 0.882,
"mean_token_accuracy": 0.727017879486084,
"num_tokens": 5778136.0,
"step": 431
},
{
"entropy": 0.8784512281417847,
"epoch": 1.053658536585366,
"grad_norm": 0.16934418678283691,
"learning_rate": 5.271002710027101e-06,
"loss": 0.8728,
"mean_token_accuracy": 0.729217529296875,
"num_tokens": 5791661.0,
"step": 432
},
{
"entropy": 0.8749353885650635,
"epoch": 1.0560975609756098,
"grad_norm": 0.18582025170326233,
"learning_rate": 5.257452574525745e-06,
"loss": 0.8637,
"mean_token_accuracy": 0.7266749143600464,
"num_tokens": 5804603.0,
"step": 433
},
{
"entropy": 0.8723912239074707,
"epoch": 1.0585365853658537,
"grad_norm": 0.18588410317897797,
"learning_rate": 5.243902439024391e-06,
"loss": 0.8872,
"mean_token_accuracy": 0.7275745272636414,
"num_tokens": 5817874.0,
"step": 434
},
{
"entropy": 0.8809516429901123,
"epoch": 1.0609756097560976,
"grad_norm": 0.174485445022583,
"learning_rate": 5.2303523035230355e-06,
"loss": 0.878,
"mean_token_accuracy": 0.7257272601127625,
"num_tokens": 5831125.0,
"step": 435
},
{
"entropy": 0.8659344911575317,
"epoch": 1.0634146341463415,
"grad_norm": 0.17202284932136536,
"learning_rate": 5.216802168021681e-06,
"loss": 0.8644,
"mean_token_accuracy": 0.731433629989624,
"num_tokens": 5844687.0,
"step": 436
},
{
"entropy": 0.885354220867157,
"epoch": 1.0658536585365854,
"grad_norm": 0.1710902750492096,
"learning_rate": 5.203252032520326e-06,
"loss": 0.8919,
"mean_token_accuracy": 0.7240340709686279,
"num_tokens": 5858317.0,
"step": 437
},
{
"entropy": 0.8834629654884338,
"epoch": 1.0682926829268293,
"grad_norm": 0.17878998816013336,
"learning_rate": 5.18970189701897e-06,
"loss": 0.8884,
"mean_token_accuracy": 0.724520742893219,
"num_tokens": 5871844.0,
"step": 438
},
{
"entropy": 0.8910503387451172,
"epoch": 1.0707317073170732,
"grad_norm": 0.17803862690925598,
"learning_rate": 5.176151761517616e-06,
"loss": 0.8887,
"mean_token_accuracy": 0.7292178869247437,
"num_tokens": 5885694.0,
"step": 439
},
{
"entropy": 0.8749967813491821,
"epoch": 1.0731707317073171,
"grad_norm": 0.18004469573497772,
"learning_rate": 5.162601626016261e-06,
"loss": 0.8691,
"mean_token_accuracy": 0.7276826500892639,
"num_tokens": 5898794.0,
"step": 440
},
{
"entropy": 0.8866884708404541,
"epoch": 1.075609756097561,
"grad_norm": 0.1842956691980362,
"learning_rate": 5.149051490514906e-06,
"loss": 0.8972,
"mean_token_accuracy": 0.724666953086853,
"num_tokens": 5912172.0,
"step": 441
},
{
"entropy": 0.878664493560791,
"epoch": 1.078048780487805,
"grad_norm": 0.18605175614356995,
"learning_rate": 5.13550135501355e-06,
"loss": 0.8696,
"mean_token_accuracy": 0.7282981276512146,
"num_tokens": 5925309.0,
"step": 442
},
{
"entropy": 0.8751529455184937,
"epoch": 1.0804878048780489,
"grad_norm": 0.1772121638059616,
"learning_rate": 5.121951219512195e-06,
"loss": 0.8758,
"mean_token_accuracy": 0.7304328083992004,
"num_tokens": 5938357.0,
"step": 443
},
{
"entropy": 0.8884094953536987,
"epoch": 1.0829268292682928,
"grad_norm": 0.17419125139713287,
"learning_rate": 5.10840108401084e-06,
"loss": 0.8761,
"mean_token_accuracy": 0.7276250720024109,
"num_tokens": 5952306.0,
"step": 444
},
{
"entropy": 0.8670481443405151,
"epoch": 1.0853658536585367,
"grad_norm": 0.18553416430950165,
"learning_rate": 5.094850948509486e-06,
"loss": 0.8756,
"mean_token_accuracy": 0.7303195595741272,
"num_tokens": 5966435.0,
"step": 445
},
{
"entropy": 0.8847004771232605,
"epoch": 1.0878048780487806,
"grad_norm": 0.17910823225975037,
"learning_rate": 5.081300813008131e-06,
"loss": 0.8986,
"mean_token_accuracy": 0.7208833694458008,
"num_tokens": 5979356.0,
"step": 446
},
{
"entropy": 0.8879530429840088,
"epoch": 1.0902439024390245,
"grad_norm": 0.19892668724060059,
"learning_rate": 5.067750677506775e-06,
"loss": 0.8864,
"mean_token_accuracy": 0.7233535647392273,
"num_tokens": 5993220.0,
"step": 447
},
{
"entropy": 0.8809808492660522,
"epoch": 1.0926829268292684,
"grad_norm": 0.17457018792629242,
"learning_rate": 5.0542005420054205e-06,
"loss": 0.8767,
"mean_token_accuracy": 0.7264518737792969,
"num_tokens": 6007080.0,
"step": 448
},
{
"entropy": 0.8835265636444092,
"epoch": 1.0951219512195123,
"grad_norm": 0.17747731506824493,
"learning_rate": 5.040650406504065e-06,
"loss": 0.8768,
"mean_token_accuracy": 0.7282616496086121,
"num_tokens": 6020701.0,
"step": 449
},
{
"entropy": 0.8794373273849487,
"epoch": 1.0975609756097562,
"grad_norm": 0.18246370553970337,
"learning_rate": 5.027100271002711e-06,
"loss": 0.8808,
"mean_token_accuracy": 0.7193954586982727,
"num_tokens": 6034612.0,
"step": 450
},
{
"entropy": 0.8770255446434021,
"epoch": 1.1,
"grad_norm": 0.16051927208900452,
"learning_rate": 5.013550135501355e-06,
"loss": 0.8782,
"mean_token_accuracy": 0.726668119430542,
"num_tokens": 6048161.0,
"step": 451
},
{
"entropy": 0.9005379676818848,
"epoch": 1.102439024390244,
"grad_norm": 0.17038728296756744,
"learning_rate": 5e-06,
"loss": 0.8964,
"mean_token_accuracy": 0.7211425304412842,
"num_tokens": 6061761.0,
"step": 452
},
{
"entropy": 0.8716856837272644,
"epoch": 1.104878048780488,
"grad_norm": 0.18405020236968994,
"learning_rate": 4.986449864498646e-06,
"loss": 0.871,
"mean_token_accuracy": 0.7311229705810547,
"num_tokens": 6075259.0,
"step": 453
},
{
"entropy": 0.8855595588684082,
"epoch": 1.1073170731707318,
"grad_norm": 0.1729445457458496,
"learning_rate": 4.97289972899729e-06,
"loss": 0.8739,
"mean_token_accuracy": 0.7265796661376953,
"num_tokens": 6088917.0,
"step": 454
},
{
"entropy": 0.8742420673370361,
"epoch": 1.1097560975609757,
"grad_norm": 0.17936216294765472,
"learning_rate": 4.959349593495935e-06,
"loss": 0.8636,
"mean_token_accuracy": 0.7290731072425842,
"num_tokens": 6102516.0,
"step": 455
},
{
"entropy": 0.8735711574554443,
"epoch": 1.1121951219512196,
"grad_norm": 0.18746447563171387,
"learning_rate": 4.94579945799458e-06,
"loss": 0.8505,
"mean_token_accuracy": 0.7305099368095398,
"num_tokens": 6116180.0,
"step": 456
},
{
"entropy": 0.8641989231109619,
"epoch": 1.1146341463414635,
"grad_norm": 0.1635252684354782,
"learning_rate": 4.9322493224932255e-06,
"loss": 0.8549,
"mean_token_accuracy": 0.732119619846344,
"num_tokens": 6130038.0,
"step": 457
},
{
"entropy": 0.8750979900360107,
"epoch": 1.1170731707317074,
"grad_norm": 0.1839144378900528,
"learning_rate": 4.918699186991871e-06,
"loss": 0.8908,
"mean_token_accuracy": 0.7277798652648926,
"num_tokens": 6143319.0,
"step": 458
},
{
"entropy": 0.8701959252357483,
"epoch": 1.1195121951219513,
"grad_norm": 0.1786291003227234,
"learning_rate": 4.905149051490515e-06,
"loss": 0.8599,
"mean_token_accuracy": 0.7290351390838623,
"num_tokens": 6156798.0,
"step": 459
},
{
"entropy": 0.8633676171302795,
"epoch": 1.1219512195121952,
"grad_norm": 0.16640040278434753,
"learning_rate": 4.89159891598916e-06,
"loss": 0.8629,
"mean_token_accuracy": 0.7302494645118713,
"num_tokens": 6170282.0,
"step": 460
},
{
"entropy": 0.8711209297180176,
"epoch": 1.1243902439024391,
"grad_norm": 0.19053176045417786,
"learning_rate": 4.8780487804878055e-06,
"loss": 0.8654,
"mean_token_accuracy": 0.7281391620635986,
"num_tokens": 6183518.0,
"step": 461
},
{
"entropy": 0.8640310764312744,
"epoch": 1.126829268292683,
"grad_norm": 0.17878729104995728,
"learning_rate": 4.86449864498645e-06,
"loss": 0.8617,
"mean_token_accuracy": 0.7309045791625977,
"num_tokens": 6197176.0,
"step": 462
},
{
"entropy": 0.8896546363830566,
"epoch": 1.129268292682927,
"grad_norm": 0.18125811219215393,
"learning_rate": 4.850948509485095e-06,
"loss": 0.9083,
"mean_token_accuracy": 0.7183119058609009,
"num_tokens": 6210888.0,
"step": 463
},
{
"entropy": 0.8741787672042847,
"epoch": 1.1317073170731708,
"grad_norm": 0.17769162356853485,
"learning_rate": 4.83739837398374e-06,
"loss": 0.8768,
"mean_token_accuracy": 0.7282008528709412,
"num_tokens": 6224127.0,
"step": 464
},
{
"entropy": 0.8620750904083252,
"epoch": 1.1341463414634148,
"grad_norm": 0.19808581471443176,
"learning_rate": 4.823848238482385e-06,
"loss": 0.8799,
"mean_token_accuracy": 0.7266132235527039,
"num_tokens": 6237238.0,
"step": 465
},
{
"entropy": 0.8672773838043213,
"epoch": 1.1365853658536587,
"grad_norm": 0.18568822741508484,
"learning_rate": 4.810298102981031e-06,
"loss": 0.8891,
"mean_token_accuracy": 0.7204229235649109,
"num_tokens": 6250778.0,
"step": 466
},
{
"entropy": 0.8523983359336853,
"epoch": 1.1390243902439026,
"grad_norm": 0.17448151111602783,
"learning_rate": 4.796747967479675e-06,
"loss": 0.8647,
"mean_token_accuracy": 0.7291819453239441,
"num_tokens": 6264412.0,
"step": 467
},
{
"entropy": 0.8495972156524658,
"epoch": 1.1414634146341462,
"grad_norm": 0.16932238638401031,
"learning_rate": 4.78319783197832e-06,
"loss": 0.8446,
"mean_token_accuracy": 0.7364223599433899,
"num_tokens": 6277593.0,
"step": 468
},
{
"entropy": 0.881886899471283,
"epoch": 1.1439024390243901,
"grad_norm": 0.1763680875301361,
"learning_rate": 4.769647696476965e-06,
"loss": 0.8899,
"mean_token_accuracy": 0.7244584560394287,
"num_tokens": 6290950.0,
"step": 469
},
{
"entropy": 0.8751710057258606,
"epoch": 1.146341463414634,
"grad_norm": 0.19120320677757263,
"learning_rate": 4.75609756097561e-06,
"loss": 0.886,
"mean_token_accuracy": 0.7226884365081787,
"num_tokens": 6304193.0,
"step": 470
},
{
"entropy": 0.876998782157898,
"epoch": 1.148780487804878,
"grad_norm": 0.1712970733642578,
"learning_rate": 4.742547425474256e-06,
"loss": 0.8769,
"mean_token_accuracy": 0.7278986573219299,
"num_tokens": 6317862.0,
"step": 471
},
{
"entropy": 0.8527517318725586,
"epoch": 1.1512195121951219,
"grad_norm": 0.18993927538394928,
"learning_rate": 4.7289972899729e-06,
"loss": 0.8733,
"mean_token_accuracy": 0.7293280363082886,
"num_tokens": 6330661.0,
"step": 472
},
{
"entropy": 0.8713936805725098,
"epoch": 1.1536585365853658,
"grad_norm": 0.18412742018699646,
"learning_rate": 4.715447154471545e-06,
"loss": 0.8874,
"mean_token_accuracy": 0.7243731021881104,
"num_tokens": 6344315.0,
"step": 473
},
{
"entropy": 0.874845027923584,
"epoch": 1.1560975609756097,
"grad_norm": 0.16824601590633392,
"learning_rate": 4.7018970189701905e-06,
"loss": 0.8768,
"mean_token_accuracy": 0.7322383522987366,
"num_tokens": 6357421.0,
"step": 474
},
{
"entropy": 0.8650723695755005,
"epoch": 1.1585365853658536,
"grad_norm": 0.18967200815677643,
"learning_rate": 4.688346883468835e-06,
"loss": 0.8619,
"mean_token_accuracy": 0.731358528137207,
"num_tokens": 6371143.0,
"step": 475
},
{
"entropy": 0.8843879699707031,
"epoch": 1.1609756097560975,
"grad_norm": 0.1760745793581009,
"learning_rate": 4.67479674796748e-06,
"loss": 0.8785,
"mean_token_accuracy": 0.7255582213401794,
"num_tokens": 6384415.0,
"step": 476
},
{
"entropy": 0.8725862503051758,
"epoch": 1.1634146341463414,
"grad_norm": 0.18959973752498627,
"learning_rate": 4.661246612466125e-06,
"loss": 0.8468,
"mean_token_accuracy": 0.732191801071167,
"num_tokens": 6397571.0,
"step": 477
},
{
"entropy": 0.860714316368103,
"epoch": 1.1658536585365853,
"grad_norm": 0.1788821965456009,
"learning_rate": 4.64769647696477e-06,
"loss": 0.8572,
"mean_token_accuracy": 0.7313535809516907,
"num_tokens": 6410619.0,
"step": 478
},
{
"entropy": 0.8556495904922485,
"epoch": 1.1682926829268292,
"grad_norm": 0.19264046847820282,
"learning_rate": 4.634146341463416e-06,
"loss": 0.8415,
"mean_token_accuracy": 0.7346753478050232,
"num_tokens": 6423849.0,
"step": 479
},
{
"entropy": 0.879152238368988,
"epoch": 1.170731707317073,
"grad_norm": 0.17785273492336273,
"learning_rate": 4.62059620596206e-06,
"loss": 0.8609,
"mean_token_accuracy": 0.733600378036499,
"num_tokens": 6437097.0,
"step": 480
},
{
"entropy": 0.8685513734817505,
"epoch": 1.173170731707317,
"grad_norm": 0.1842828094959259,
"learning_rate": 4.607046070460705e-06,
"loss": 0.8557,
"mean_token_accuracy": 0.7308443784713745,
"num_tokens": 6450425.0,
"step": 481
},
{
"entropy": 0.8665934801101685,
"epoch": 1.175609756097561,
"grad_norm": 0.18133185803890228,
"learning_rate": 4.59349593495935e-06,
"loss": 0.8542,
"mean_token_accuracy": 0.7300595045089722,
"num_tokens": 6463555.0,
"step": 482
},
{
"entropy": 0.8803141117095947,
"epoch": 1.1780487804878048,
"grad_norm": 0.1882920265197754,
"learning_rate": 4.579945799457995e-06,
"loss": 0.8695,
"mean_token_accuracy": 0.7308064699172974,
"num_tokens": 6477000.0,
"step": 483
},
{
"entropy": 0.8705790042877197,
"epoch": 1.1804878048780487,
"grad_norm": 0.16724060475826263,
"learning_rate": 4.56639566395664e-06,
"loss": 0.8696,
"mean_token_accuracy": 0.7313664555549622,
"num_tokens": 6490540.0,
"step": 484
},
{
"entropy": 0.8668768405914307,
"epoch": 1.1829268292682926,
"grad_norm": 0.18207673728466034,
"learning_rate": 4.552845528455285e-06,
"loss": 0.8706,
"mean_token_accuracy": 0.7298742532730103,
"num_tokens": 6504394.0,
"step": 485
},
{
"entropy": 0.857469916343689,
"epoch": 1.1853658536585365,
"grad_norm": 0.17468515038490295,
"learning_rate": 4.53929539295393e-06,
"loss": 0.8595,
"mean_token_accuracy": 0.7317895293235779,
"num_tokens": 6518358.0,
"step": 486
},
{
"entropy": 0.868085503578186,
"epoch": 1.1878048780487804,
"grad_norm": 0.18118400871753693,
"learning_rate": 4.5257452574525755e-06,
"loss": 0.8822,
"mean_token_accuracy": 0.7288097143173218,
"num_tokens": 6531682.0,
"step": 487
},
{
"entropy": 0.875089704990387,
"epoch": 1.1902439024390243,
"grad_norm": 0.19479995965957642,
"learning_rate": 4.51219512195122e-06,
"loss": 0.898,
"mean_token_accuracy": 0.7220537066459656,
"num_tokens": 6545215.0,
"step": 488
},
{
"entropy": 0.8687515258789062,
"epoch": 1.1926829268292682,
"grad_norm": 0.18653246760368347,
"learning_rate": 4.498644986449865e-06,
"loss": 0.8582,
"mean_token_accuracy": 0.7328128814697266,
"num_tokens": 6558424.0,
"step": 489
},
{
"entropy": 0.8572927713394165,
"epoch": 1.1951219512195121,
"grad_norm": 0.17981292307376862,
"learning_rate": 4.485094850948509e-06,
"loss": 0.8593,
"mean_token_accuracy": 0.7302917242050171,
"num_tokens": 6571810.0,
"step": 490
},
{
"entropy": 0.8861751556396484,
"epoch": 1.197560975609756,
"grad_norm": 0.1817339062690735,
"learning_rate": 4.471544715447155e-06,
"loss": 0.8928,
"mean_token_accuracy": 0.7191566824913025,
"num_tokens": 6584965.0,
"step": 491
},
{
"entropy": 0.8445186614990234,
"epoch": 1.2,
"grad_norm": 0.17858710885047913,
"learning_rate": 4.4579945799458e-06,
"loss": 0.8465,
"mean_token_accuracy": 0.7365540266036987,
"num_tokens": 6598684.0,
"step": 492
},
{
"entropy": 0.8746671676635742,
"epoch": 1.2024390243902439,
"grad_norm": 0.17243576049804688,
"learning_rate": 4.444444444444444e-06,
"loss": 0.8859,
"mean_token_accuracy": 0.7267000079154968,
"num_tokens": 6612509.0,
"step": 493
},
{
"entropy": 0.8706621527671814,
"epoch": 1.2048780487804878,
"grad_norm": 0.19680029153823853,
"learning_rate": 4.43089430894309e-06,
"loss": 0.8837,
"mean_token_accuracy": 0.7250975370407104,
"num_tokens": 6626108.0,
"step": 494
},
{
"entropy": 0.8592489957809448,
"epoch": 1.2073170731707317,
"grad_norm": 0.17318998277187347,
"learning_rate": 4.4173441734417345e-06,
"loss": 0.8403,
"mean_token_accuracy": 0.7346216440200806,
"num_tokens": 6639682.0,
"step": 495
},
{
"entropy": 0.8765473365783691,
"epoch": 1.2097560975609756,
"grad_norm": 0.19630788266658783,
"learning_rate": 4.40379403794038e-06,
"loss": 0.8858,
"mean_token_accuracy": 0.7274890542030334,
"num_tokens": 6652725.0,
"step": 496
},
{
"entropy": 0.8659340143203735,
"epoch": 1.2121951219512195,
"grad_norm": 0.18291766941547394,
"learning_rate": 4.390243902439025e-06,
"loss": 0.853,
"mean_token_accuracy": 0.7339065670967102,
"num_tokens": 6666116.0,
"step": 497
},
{
"entropy": 0.8639433979988098,
"epoch": 1.2146341463414634,
"grad_norm": 0.19510066509246826,
"learning_rate": 4.376693766937669e-06,
"loss": 0.8537,
"mean_token_accuracy": 0.7323106527328491,
"num_tokens": 6679756.0,
"step": 498
},
{
"entropy": 0.8815720081329346,
"epoch": 1.2170731707317073,
"grad_norm": 0.1966511309146881,
"learning_rate": 4.3631436314363145e-06,
"loss": 0.8854,
"mean_token_accuracy": 0.7242141962051392,
"num_tokens": 6692880.0,
"step": 499
},
{
"entropy": 0.8695896863937378,
"epoch": 1.2195121951219512,
"grad_norm": 0.17670577764511108,
"learning_rate": 4.34959349593496e-06,
"loss": 0.8709,
"mean_token_accuracy": 0.731483519077301,
"num_tokens": 6706519.0,
"step": 500
},
{
"entropy": 0.8815171718597412,
"epoch": 1.221951219512195,
"grad_norm": 0.18315380811691284,
"learning_rate": 4.336043360433605e-06,
"loss": 0.8811,
"mean_token_accuracy": 0.7204508185386658,
"num_tokens": 6720021.0,
"step": 501
},
{
"entropy": 0.8691625595092773,
"epoch": 1.224390243902439,
"grad_norm": 0.18377022445201874,
"learning_rate": 4.32249322493225e-06,
"loss": 0.8559,
"mean_token_accuracy": 0.7272188067436218,
"num_tokens": 6733524.0,
"step": 502
},
{
"entropy": 0.8703157305717468,
"epoch": 1.226829268292683,
"grad_norm": 0.19667857885360718,
"learning_rate": 4.308943089430894e-06,
"loss": 0.8677,
"mean_token_accuracy": 0.7263264060020447,
"num_tokens": 6746413.0,
"step": 503
},
{
"entropy": 0.9045153856277466,
"epoch": 1.2292682926829268,
"grad_norm": 0.18945592641830444,
"learning_rate": 4.29539295392954e-06,
"loss": 0.9142,
"mean_token_accuracy": 0.7132720947265625,
"num_tokens": 6759818.0,
"step": 504
},
{
"entropy": 0.8753666281700134,
"epoch": 1.2317073170731707,
"grad_norm": 0.18175500631332397,
"learning_rate": 4.281842818428185e-06,
"loss": 0.8755,
"mean_token_accuracy": 0.728762686252594,
"num_tokens": 6773501.0,
"step": 505
},
{
"entropy": 0.876529335975647,
"epoch": 1.2341463414634146,
"grad_norm": 0.17408494651317596,
"learning_rate": 4.268292682926829e-06,
"loss": 0.878,
"mean_token_accuracy": 0.7268484234809875,
"num_tokens": 6787015.0,
"step": 506
},
{
"entropy": 0.8460504412651062,
"epoch": 1.2365853658536585,
"grad_norm": 0.1703876405954361,
"learning_rate": 4.254742547425474e-06,
"loss": 0.8404,
"mean_token_accuracy": 0.7368658781051636,
"num_tokens": 6800317.0,
"step": 507
},
{
"entropy": 0.887944757938385,
"epoch": 1.2390243902439024,
"grad_norm": 0.1907789558172226,
"learning_rate": 4.2411924119241196e-06,
"loss": 0.8899,
"mean_token_accuracy": 0.7258834838867188,
"num_tokens": 6813944.0,
"step": 508
},
{
"entropy": 0.8727298974990845,
"epoch": 1.2414634146341463,
"grad_norm": 0.20074300467967987,
"learning_rate": 4.227642276422765e-06,
"loss": 0.8858,
"mean_token_accuracy": 0.7224164605140686,
"num_tokens": 6827401.0,
"step": 509
},
{
"entropy": 0.8581738471984863,
"epoch": 1.2439024390243902,
"grad_norm": 0.18092957139015198,
"learning_rate": 4.21409214092141e-06,
"loss": 0.8584,
"mean_token_accuracy": 0.7286903262138367,
"num_tokens": 6840756.0,
"step": 510
},
{
"entropy": 0.8607147932052612,
"epoch": 1.2463414634146341,
"grad_norm": 0.17750075459480286,
"learning_rate": 4.200542005420054e-06,
"loss": 0.873,
"mean_token_accuracy": 0.7288525700569153,
"num_tokens": 6854237.0,
"step": 511
},
{
"entropy": 0.879986584186554,
"epoch": 1.248780487804878,
"grad_norm": 0.17938187718391418,
"learning_rate": 4.1869918699186995e-06,
"loss": 0.8704,
"mean_token_accuracy": 0.7252417206764221,
"num_tokens": 6867905.0,
"step": 512
},
{
"entropy": 0.8603850603103638,
"epoch": 1.251219512195122,
"grad_norm": 0.1875443160533905,
"learning_rate": 4.173441734417345e-06,
"loss": 0.8487,
"mean_token_accuracy": 0.7376420497894287,
"num_tokens": 6881738.0,
"step": 513
},
{
"entropy": 0.8875347375869751,
"epoch": 1.2536585365853659,
"grad_norm": 0.1712435483932495,
"learning_rate": 4.159891598915989e-06,
"loss": 0.8811,
"mean_token_accuracy": 0.7265061140060425,
"num_tokens": 6894917.0,
"step": 514
},
{
"entropy": 0.8665733337402344,
"epoch": 1.2560975609756098,
"grad_norm": 0.19203098118305206,
"learning_rate": 4.146341463414634e-06,
"loss": 0.862,
"mean_token_accuracy": 0.734067440032959,
"num_tokens": 6908192.0,
"step": 515
},
{
"entropy": 0.8782904148101807,
"epoch": 1.2585365853658537,
"grad_norm": 0.18738849461078644,
"learning_rate": 4.1327913279132794e-06,
"loss": 0.8662,
"mean_token_accuracy": 0.7297396659851074,
"num_tokens": 6921769.0,
"step": 516
},
{
"entropy": 0.8696860074996948,
"epoch": 1.2609756097560976,
"grad_norm": 0.18507178127765656,
"learning_rate": 4.119241192411925e-06,
"loss": 0.8569,
"mean_token_accuracy": 0.7358604073524475,
"num_tokens": 6935081.0,
"step": 517
},
{
"entropy": 0.853559136390686,
"epoch": 1.2634146341463415,
"grad_norm": 0.1817474067211151,
"learning_rate": 4.10569105691057e-06,
"loss": 0.8708,
"mean_token_accuracy": 0.7304454445838928,
"num_tokens": 6948994.0,
"step": 518
},
{
"entropy": 0.8644067049026489,
"epoch": 1.2658536585365854,
"grad_norm": 0.18193352222442627,
"learning_rate": 4.092140921409214e-06,
"loss": 0.8687,
"mean_token_accuracy": 0.7295045256614685,
"num_tokens": 6962452.0,
"step": 519
},
{
"entropy": 0.8609942197799683,
"epoch": 1.2682926829268293,
"grad_norm": 0.18788494169712067,
"learning_rate": 4.078590785907859e-06,
"loss": 0.8493,
"mean_token_accuracy": 0.729697048664093,
"num_tokens": 6975705.0,
"step": 520
},
{
"entropy": 0.8733319044113159,
"epoch": 1.2707317073170732,
"grad_norm": 0.17995619773864746,
"learning_rate": 4.0650406504065046e-06,
"loss": 0.8664,
"mean_token_accuracy": 0.7323063015937805,
"num_tokens": 6988833.0,
"step": 521
},
{
"entropy": 0.8484479188919067,
"epoch": 1.273170731707317,
"grad_norm": 0.1766081154346466,
"learning_rate": 4.051490514905149e-06,
"loss": 0.8423,
"mean_token_accuracy": 0.7349044680595398,
"num_tokens": 7002512.0,
"step": 522
},
{
"entropy": 0.8707907795906067,
"epoch": 1.275609756097561,
"grad_norm": 0.1928197741508484,
"learning_rate": 4.037940379403794e-06,
"loss": 0.8637,
"mean_token_accuracy": 0.7341483235359192,
"num_tokens": 7016107.0,
"step": 523
},
{
"entropy": 0.8589579463005066,
"epoch": 1.278048780487805,
"grad_norm": 0.17874617874622345,
"learning_rate": 4.024390243902439e-06,
"loss": 0.8523,
"mean_token_accuracy": 0.7354934811592102,
"num_tokens": 7029548.0,
"step": 524
},
{
"entropy": 0.868780255317688,
"epoch": 1.2804878048780488,
"grad_norm": 0.17817656695842743,
"learning_rate": 4.0108401084010845e-06,
"loss": 0.8679,
"mean_token_accuracy": 0.7251309156417847,
"num_tokens": 7043316.0,
"step": 525
},
{
"entropy": 0.8748735189437866,
"epoch": 1.2829268292682927,
"grad_norm": 0.17905448377132416,
"learning_rate": 3.99728997289973e-06,
"loss": 0.8801,
"mean_token_accuracy": 0.7233904600143433,
"num_tokens": 7057218.0,
"step": 526
},
{
"entropy": 0.8642637729644775,
"epoch": 1.2853658536585366,
"grad_norm": 0.1892337054014206,
"learning_rate": 3.983739837398374e-06,
"loss": 0.8672,
"mean_token_accuracy": 0.7301107048988342,
"num_tokens": 7070784.0,
"step": 527
},
{
"entropy": 0.8635598421096802,
"epoch": 1.2878048780487805,
"grad_norm": 0.1739298403263092,
"learning_rate": 3.970189701897019e-06,
"loss": 0.8588,
"mean_token_accuracy": 0.729408323764801,
"num_tokens": 7084422.0,
"step": 528
},
{
"entropy": 0.8527634739875793,
"epoch": 1.2902439024390244,
"grad_norm": 0.1835845410823822,
"learning_rate": 3.9566395663956644e-06,
"loss": 0.8617,
"mean_token_accuracy": 0.726246178150177,
"num_tokens": 7097899.0,
"step": 529
},
{
"entropy": 0.8675320148468018,
"epoch": 1.2926829268292683,
"grad_norm": 0.18817897140979767,
"learning_rate": 3.943089430894309e-06,
"loss": 0.8732,
"mean_token_accuracy": 0.7264676690101624,
"num_tokens": 7111014.0,
"step": 530
},
{
"entropy": 0.8717451095581055,
"epoch": 1.2951219512195122,
"grad_norm": 0.18769040703773499,
"learning_rate": 3.929539295392954e-06,
"loss": 0.8794,
"mean_token_accuracy": 0.7313988208770752,
"num_tokens": 7124470.0,
"step": 531
},
{
"entropy": 0.8724467754364014,
"epoch": 1.2975609756097561,
"grad_norm": 0.19329647719860077,
"learning_rate": 3.915989159891599e-06,
"loss": 0.8889,
"mean_token_accuracy": 0.7284098863601685,
"num_tokens": 7137837.0,
"step": 532
},
{
"entropy": 0.8455716967582703,
"epoch": 1.3,
"grad_norm": 0.18541646003723145,
"learning_rate": 3.902439024390244e-06,
"loss": 0.8288,
"mean_token_accuracy": 0.7398167252540588,
"num_tokens": 7150840.0,
"step": 533
},
{
"entropy": 0.854907751083374,
"epoch": 1.302439024390244,
"grad_norm": 0.18639497458934784,
"learning_rate": 3.88888888888889e-06,
"loss": 0.8579,
"mean_token_accuracy": 0.7294135093688965,
"num_tokens": 7164275.0,
"step": 534
},
{
"entropy": 0.8669297695159912,
"epoch": 1.3048780487804879,
"grad_norm": 0.20313623547554016,
"learning_rate": 3.875338753387534e-06,
"loss": 0.8625,
"mean_token_accuracy": 0.7300493121147156,
"num_tokens": 7178075.0,
"step": 535
},
{
"entropy": 0.8517297506332397,
"epoch": 1.3073170731707318,
"grad_norm": 0.19427485764026642,
"learning_rate": 3.861788617886179e-06,
"loss": 0.8439,
"mean_token_accuracy": 0.7385932207107544,
"num_tokens": 7191526.0,
"step": 536
},
{
"entropy": 0.8521525859832764,
"epoch": 1.3097560975609757,
"grad_norm": 0.1958754062652588,
"learning_rate": 3.848238482384824e-06,
"loss": 0.8523,
"mean_token_accuracy": 0.7323172688484192,
"num_tokens": 7205058.0,
"step": 537
},
{
"entropy": 0.8587372303009033,
"epoch": 1.3121951219512196,
"grad_norm": 0.1967170685529709,
"learning_rate": 3.834688346883469e-06,
"loss": 0.8648,
"mean_token_accuracy": 0.7314472198486328,
"num_tokens": 7218576.0,
"step": 538
},
{
"entropy": 0.8489270210266113,
"epoch": 1.3146341463414635,
"grad_norm": 0.20891073346138,
"learning_rate": 3.821138211382115e-06,
"loss": 0.8588,
"mean_token_accuracy": 0.7309644818305969,
"num_tokens": 7231594.0,
"step": 539
},
{
"entropy": 0.8510292768478394,
"epoch": 1.3170731707317074,
"grad_norm": 0.17983919382095337,
"learning_rate": 3.8075880758807595e-06,
"loss": 0.8438,
"mean_token_accuracy": 0.7355894446372986,
"num_tokens": 7245055.0,
"step": 540
},
{
"entropy": 0.8718546032905579,
"epoch": 1.3195121951219513,
"grad_norm": 0.18964819610118866,
"learning_rate": 3.7940379403794043e-06,
"loss": 0.8706,
"mean_token_accuracy": 0.7269119620323181,
"num_tokens": 7258931.0,
"step": 541
},
{
"entropy": 0.8766772150993347,
"epoch": 1.3219512195121952,
"grad_norm": 0.17909395694732666,
"learning_rate": 3.780487804878049e-06,
"loss": 0.8769,
"mean_token_accuracy": 0.7309192419052124,
"num_tokens": 7272534.0,
"step": 542
},
{
"entropy": 0.8771216869354248,
"epoch": 1.324390243902439,
"grad_norm": 0.18655753135681152,
"learning_rate": 3.7669376693766942e-06,
"loss": 0.8908,
"mean_token_accuracy": 0.7244673371315002,
"num_tokens": 7285739.0,
"step": 543
},
{
"entropy": 0.8514188528060913,
"epoch": 1.326829268292683,
"grad_norm": 0.1860886812210083,
"learning_rate": 3.753387533875339e-06,
"loss": 0.8579,
"mean_token_accuracy": 0.7302050590515137,
"num_tokens": 7298776.0,
"step": 544
},
{
"entropy": 0.8441017866134644,
"epoch": 1.329268292682927,
"grad_norm": 0.187427818775177,
"learning_rate": 3.7398373983739838e-06,
"loss": 0.8512,
"mean_token_accuracy": 0.7347075343132019,
"num_tokens": 7312230.0,
"step": 545
},
{
"entropy": 0.8616207838058472,
"epoch": 1.3317073170731708,
"grad_norm": 0.18081805109977722,
"learning_rate": 3.7262872628726286e-06,
"loss": 0.8603,
"mean_token_accuracy": 0.7315198183059692,
"num_tokens": 7325774.0,
"step": 546
},
{
"entropy": 0.8618036508560181,
"epoch": 1.3341463414634147,
"grad_norm": 0.20267686247825623,
"learning_rate": 3.712737127371274e-06,
"loss": 0.862,
"mean_token_accuracy": 0.7296164035797119,
"num_tokens": 7338668.0,
"step": 547
},
{
"entropy": 0.8625529408454895,
"epoch": 1.3365853658536586,
"grad_norm": 0.19352561235427856,
"learning_rate": 3.699186991869919e-06,
"loss": 0.8553,
"mean_token_accuracy": 0.732282280921936,
"num_tokens": 7352131.0,
"step": 548
},
{
"entropy": 0.868601381778717,
"epoch": 1.3390243902439025,
"grad_norm": 0.1874302625656128,
"learning_rate": 3.685636856368564e-06,
"loss": 0.8714,
"mean_token_accuracy": 0.7254257798194885,
"num_tokens": 7365535.0,
"step": 549
},
{
"entropy": 0.8333048820495605,
"epoch": 1.3414634146341464,
"grad_norm": 0.1842752993106842,
"learning_rate": 3.672086720867209e-06,
"loss": 0.8236,
"mean_token_accuracy": 0.7369009256362915,
"num_tokens": 7378968.0,
"step": 550
},
{
"entropy": 0.8596416115760803,
"epoch": 1.34390243902439,
"grad_norm": 0.19583648443222046,
"learning_rate": 3.6585365853658537e-06,
"loss": 0.8421,
"mean_token_accuracy": 0.7383792996406555,
"num_tokens": 7391892.0,
"step": 551
},
{
"entropy": 0.8696916103363037,
"epoch": 1.346341463414634,
"grad_norm": 0.19787564873695374,
"learning_rate": 3.644986449864499e-06,
"loss": 0.8675,
"mean_token_accuracy": 0.724095344543457,
"num_tokens": 7404869.0,
"step": 552
},
{
"entropy": 0.8838014602661133,
"epoch": 1.348780487804878,
"grad_norm": 0.19168251752853394,
"learning_rate": 3.6314363143631437e-06,
"loss": 0.8767,
"mean_token_accuracy": 0.7258371114730835,
"num_tokens": 7418563.0,
"step": 553
},
{
"entropy": 0.8391138315200806,
"epoch": 1.3512195121951218,
"grad_norm": 0.1764480471611023,
"learning_rate": 3.6178861788617893e-06,
"loss": 0.8354,
"mean_token_accuracy": 0.7345172762870789,
"num_tokens": 7431755.0,
"step": 554
},
{
"entropy": 0.8448973894119263,
"epoch": 1.3536585365853657,
"grad_norm": 0.19826233386993408,
"learning_rate": 3.604336043360434e-06,
"loss": 0.8473,
"mean_token_accuracy": 0.7349461317062378,
"num_tokens": 7445040.0,
"step": 555
},
{
"entropy": 0.8632727861404419,
"epoch": 1.3560975609756096,
"grad_norm": 0.19437728822231293,
"learning_rate": 3.590785907859079e-06,
"loss": 0.8647,
"mean_token_accuracy": 0.7322266101837158,
"num_tokens": 7458489.0,
"step": 556
},
{
"entropy": 0.8689159154891968,
"epoch": 1.3585365853658535,
"grad_norm": 0.19678860902786255,
"learning_rate": 3.577235772357724e-06,
"loss": 0.8827,
"mean_token_accuracy": 0.7263685464859009,
"num_tokens": 7471676.0,
"step": 557
},
{
"entropy": 0.8646066188812256,
"epoch": 1.3609756097560974,
"grad_norm": 0.1897372454404831,
"learning_rate": 3.563685636856369e-06,
"loss": 0.8534,
"mean_token_accuracy": 0.732787013053894,
"num_tokens": 7484749.0,
"step": 558
},
{
"entropy": 0.8650884628295898,
"epoch": 1.3634146341463413,
"grad_norm": 0.1903863549232483,
"learning_rate": 3.5501355013550136e-06,
"loss": 0.8616,
"mean_token_accuracy": 0.7318161725997925,
"num_tokens": 7498431.0,
"step": 559
},
{
"entropy": 0.8552368879318237,
"epoch": 1.3658536585365852,
"grad_norm": 0.19023962318897247,
"learning_rate": 3.5365853658536588e-06,
"loss": 0.8501,
"mean_token_accuracy": 0.729788601398468,
"num_tokens": 7512214.0,
"step": 560
},
{
"entropy": 0.8545181751251221,
"epoch": 1.3682926829268292,
"grad_norm": 0.18914692103862762,
"learning_rate": 3.5230352303523035e-06,
"loss": 0.8479,
"mean_token_accuracy": 0.7299030423164368,
"num_tokens": 7525951.0,
"step": 561
},
{
"entropy": 0.871481716632843,
"epoch": 1.370731707317073,
"grad_norm": 0.21258091926574707,
"learning_rate": 3.509485094850949e-06,
"loss": 0.8593,
"mean_token_accuracy": 0.7324293851852417,
"num_tokens": 7539242.0,
"step": 562
},
{
"entropy": 0.8490629196166992,
"epoch": 1.373170731707317,
"grad_norm": 0.20024360716342926,
"learning_rate": 3.495934959349594e-06,
"loss": 0.8496,
"mean_token_accuracy": 0.7306812405586243,
"num_tokens": 7552807.0,
"step": 563
},
{
"entropy": 0.8514649271965027,
"epoch": 1.3756097560975609,
"grad_norm": 0.17793771624565125,
"learning_rate": 3.4823848238482387e-06,
"loss": 0.8587,
"mean_token_accuracy": 0.7358647584915161,
"num_tokens": 7566017.0,
"step": 564
},
{
"entropy": 0.8559709787368774,
"epoch": 1.3780487804878048,
"grad_norm": 0.18806791305541992,
"learning_rate": 3.468834688346884e-06,
"loss": 0.8437,
"mean_token_accuracy": 0.7373141050338745,
"num_tokens": 7579079.0,
"step": 565
},
{
"entropy": 0.8687812089920044,
"epoch": 1.3804878048780487,
"grad_norm": 0.1876194328069687,
"learning_rate": 3.4552845528455287e-06,
"loss": 0.8727,
"mean_token_accuracy": 0.7246053218841553,
"num_tokens": 7592523.0,
"step": 566
},
{
"entropy": 0.8511624336242676,
"epoch": 1.3829268292682926,
"grad_norm": 0.18997825682163239,
"learning_rate": 3.4417344173441734e-06,
"loss": 0.8521,
"mean_token_accuracy": 0.7291620373725891,
"num_tokens": 7606012.0,
"step": 567
},
{
"entropy": 0.8713839054107666,
"epoch": 1.3853658536585365,
"grad_norm": 0.19520047307014465,
"learning_rate": 3.4281842818428186e-06,
"loss": 0.8737,
"mean_token_accuracy": 0.7267184853553772,
"num_tokens": 7619150.0,
"step": 568
},
{
"entropy": 0.8599538803100586,
"epoch": 1.3878048780487804,
"grad_norm": 0.20235277712345123,
"learning_rate": 3.414634146341464e-06,
"loss": 0.8757,
"mean_token_accuracy": 0.7303602695465088,
"num_tokens": 7632239.0,
"step": 569
},
{
"entropy": 0.8565975427627563,
"epoch": 1.3902439024390243,
"grad_norm": 0.1819470226764679,
"learning_rate": 3.401084010840109e-06,
"loss": 0.865,
"mean_token_accuracy": 0.729332447052002,
"num_tokens": 7645452.0,
"step": 570
},
{
"entropy": 0.8241442441940308,
"epoch": 1.3926829268292682,
"grad_norm": 0.1833989918231964,
"learning_rate": 3.387533875338754e-06,
"loss": 0.8213,
"mean_token_accuracy": 0.7422797679901123,
"num_tokens": 7658680.0,
"step": 571
},
{
"entropy": 0.8508949279785156,
"epoch": 1.395121951219512,
"grad_norm": 0.18061420321464539,
"learning_rate": 3.3739837398373986e-06,
"loss": 0.8511,
"mean_token_accuracy": 0.735736608505249,
"num_tokens": 7672122.0,
"step": 572
},
{
"entropy": 0.8487075567245483,
"epoch": 1.397560975609756,
"grad_norm": 0.186850905418396,
"learning_rate": 3.3604336043360438e-06,
"loss": 0.8382,
"mean_token_accuracy": 0.738534152507782,
"num_tokens": 7685482.0,
"step": 573
},
{
"entropy": 0.869383692741394,
"epoch": 1.4,
"grad_norm": 0.1888049691915512,
"learning_rate": 3.3468834688346886e-06,
"loss": 0.8702,
"mean_token_accuracy": 0.7279847860336304,
"num_tokens": 7698648.0,
"step": 574
},
{
"entropy": 0.8390681147575378,
"epoch": 1.4024390243902438,
"grad_norm": 0.17867664992809296,
"learning_rate": 3.3333333333333333e-06,
"loss": 0.8283,
"mean_token_accuracy": 0.7399199604988098,
"num_tokens": 7711660.0,
"step": 575
},
{
"entropy": 0.8469206094741821,
"epoch": 1.4048780487804877,
"grad_norm": 0.19395941495895386,
"learning_rate": 3.3197831978319785e-06,
"loss": 0.8485,
"mean_token_accuracy": 0.7336561679840088,
"num_tokens": 7724892.0,
"step": 576
},
{
"entropy": 0.8645744919776917,
"epoch": 1.4073170731707316,
"grad_norm": 0.2073330581188202,
"learning_rate": 3.3062330623306237e-06,
"loss": 0.8804,
"mean_token_accuracy": 0.7230904698371887,
"num_tokens": 7738537.0,
"step": 577
},
{
"entropy": 0.8457903861999512,
"epoch": 1.4097560975609755,
"grad_norm": 0.19049414992332458,
"learning_rate": 3.292682926829269e-06,
"loss": 0.8494,
"mean_token_accuracy": 0.7300188541412354,
"num_tokens": 7751828.0,
"step": 578
},
{
"entropy": 0.8619527816772461,
"epoch": 1.4121951219512194,
"grad_norm": 0.17878854274749756,
"learning_rate": 3.2791327913279137e-06,
"loss": 0.8704,
"mean_token_accuracy": 0.7315168976783752,
"num_tokens": 7765167.0,
"step": 579
},
{
"entropy": 0.8565795421600342,
"epoch": 1.4146341463414633,
"grad_norm": 0.19386078417301178,
"learning_rate": 3.2655826558265585e-06,
"loss": 0.8827,
"mean_token_accuracy": 0.7268211841583252,
"num_tokens": 7779075.0,
"step": 580
},
{
"entropy": 0.8594475984573364,
"epoch": 1.4170731707317072,
"grad_norm": 0.19009767472743988,
"learning_rate": 3.2520325203252037e-06,
"loss": 0.8575,
"mean_token_accuracy": 0.7269622087478638,
"num_tokens": 7792558.0,
"step": 581
},
{
"entropy": 0.856437087059021,
"epoch": 1.4195121951219511,
"grad_norm": 0.18176284432411194,
"learning_rate": 3.2384823848238484e-06,
"loss": 0.8519,
"mean_token_accuracy": 0.735020637512207,
"num_tokens": 7806126.0,
"step": 582
},
{
"entropy": 0.8499815464019775,
"epoch": 1.421951219512195,
"grad_norm": 0.17889046669006348,
"learning_rate": 3.224932249322493e-06,
"loss": 0.8459,
"mean_token_accuracy": 0.7320988774299622,
"num_tokens": 7819535.0,
"step": 583
},
{
"entropy": 0.8566194176673889,
"epoch": 1.424390243902439,
"grad_norm": 0.19046318531036377,
"learning_rate": 3.211382113821139e-06,
"loss": 0.8539,
"mean_token_accuracy": 0.73642498254776,
"num_tokens": 7832295.0,
"step": 584
},
{
"entropy": 0.874726414680481,
"epoch": 1.4268292682926829,
"grad_norm": 0.19308649003505707,
"learning_rate": 3.1978319783197836e-06,
"loss": 0.857,
"mean_token_accuracy": 0.7281978130340576,
"num_tokens": 7845578.0,
"step": 585
},
{
"entropy": 0.8651847839355469,
"epoch": 1.4292682926829268,
"grad_norm": 0.18000152707099915,
"learning_rate": 3.1842818428184284e-06,
"loss": 0.8575,
"mean_token_accuracy": 0.7298014163970947,
"num_tokens": 7858788.0,
"step": 586
},
{
"entropy": 0.8516252636909485,
"epoch": 1.4317073170731707,
"grad_norm": 0.18842175602912903,
"learning_rate": 3.1707317073170736e-06,
"loss": 0.8558,
"mean_token_accuracy": 0.7326483726501465,
"num_tokens": 7871944.0,
"step": 587
},
{
"entropy": 0.8462690114974976,
"epoch": 1.4341463414634146,
"grad_norm": 0.1798364222049713,
"learning_rate": 3.1571815718157183e-06,
"loss": 0.8264,
"mean_token_accuracy": 0.7403327226638794,
"num_tokens": 7885304.0,
"step": 588
},
{
"entropy": 0.8627457022666931,
"epoch": 1.4365853658536585,
"grad_norm": 0.19561219215393066,
"learning_rate": 3.143631436314363e-06,
"loss": 0.8646,
"mean_token_accuracy": 0.7325738072395325,
"num_tokens": 7898662.0,
"step": 589
},
{
"entropy": 0.8492992520332336,
"epoch": 1.4390243902439024,
"grad_norm": 0.18039856851100922,
"learning_rate": 3.1300813008130083e-06,
"loss": 0.8353,
"mean_token_accuracy": 0.7358734607696533,
"num_tokens": 7911827.0,
"step": 590
},
{
"entropy": 0.8460092544555664,
"epoch": 1.4414634146341463,
"grad_norm": 0.19393689930438995,
"learning_rate": 3.116531165311653e-06,
"loss": 0.8282,
"mean_token_accuracy": 0.7371993064880371,
"num_tokens": 7925104.0,
"step": 591
},
{
"entropy": 0.8655027747154236,
"epoch": 1.4439024390243902,
"grad_norm": 0.19649480283260345,
"learning_rate": 3.1029810298102987e-06,
"loss": 0.8843,
"mean_token_accuracy": 0.7273722887039185,
"num_tokens": 7938820.0,
"step": 592
},
{
"entropy": 0.8631415963172913,
"epoch": 1.446341463414634,
"grad_norm": 0.19127148389816284,
"learning_rate": 3.0894308943089435e-06,
"loss": 0.8568,
"mean_token_accuracy": 0.7302283644676208,
"num_tokens": 7952062.0,
"step": 593
},
{
"entropy": 0.8497236967086792,
"epoch": 1.448780487804878,
"grad_norm": 0.18874233961105347,
"learning_rate": 3.0758807588075882e-06,
"loss": 0.86,
"mean_token_accuracy": 0.7315238118171692,
"num_tokens": 7965636.0,
"step": 594
},
{
"entropy": 0.856023907661438,
"epoch": 1.451219512195122,
"grad_norm": 0.18885262310504913,
"learning_rate": 3.0623306233062334e-06,
"loss": 0.8447,
"mean_token_accuracy": 0.7383915185928345,
"num_tokens": 7978832.0,
"step": 595
},
{
"entropy": 0.8641533851623535,
"epoch": 1.4536585365853658,
"grad_norm": 0.19485171139240265,
"learning_rate": 3.0487804878048782e-06,
"loss": 0.8548,
"mean_token_accuracy": 0.7297952175140381,
"num_tokens": 7992471.0,
"step": 596
},
{
"entropy": 0.8497927188873291,
"epoch": 1.4560975609756097,
"grad_norm": 0.18832214176654816,
"learning_rate": 3.035230352303523e-06,
"loss": 0.8484,
"mean_token_accuracy": 0.735218346118927,
"num_tokens": 8006068.0,
"step": 597
},
{
"entropy": 0.8550186157226562,
"epoch": 1.4585365853658536,
"grad_norm": 0.1983252912759781,
"learning_rate": 3.021680216802168e-06,
"loss": 0.868,
"mean_token_accuracy": 0.7317743897438049,
"num_tokens": 8019170.0,
"step": 598
},
{
"entropy": 0.8382817506790161,
"epoch": 1.4609756097560975,
"grad_norm": 0.1967770755290985,
"learning_rate": 3.0081300813008134e-06,
"loss": 0.8349,
"mean_token_accuracy": 0.7366904020309448,
"num_tokens": 8032372.0,
"step": 599
},
{
"entropy": 0.8516252040863037,
"epoch": 1.4634146341463414,
"grad_norm": 0.18903858959674835,
"learning_rate": 2.9945799457994586e-06,
"loss": 0.8647,
"mean_token_accuracy": 0.7299439907073975,
"num_tokens": 8046137.0,
"step": 600
},
{
"entropy": 0.8517444729804993,
"epoch": 1.4658536585365853,
"grad_norm": 0.19564732909202576,
"learning_rate": 2.9810298102981034e-06,
"loss": 0.8586,
"mean_token_accuracy": 0.7297217845916748,
"num_tokens": 8059776.0,
"step": 601
},
{
"entropy": 0.8595305681228638,
"epoch": 1.4682926829268292,
"grad_norm": 0.20328737795352936,
"learning_rate": 2.967479674796748e-06,
"loss": 0.8787,
"mean_token_accuracy": 0.7226027250289917,
"num_tokens": 8073516.0,
"step": 602
},
{
"entropy": 0.8476274013519287,
"epoch": 1.4707317073170731,
"grad_norm": 0.1782613843679428,
"learning_rate": 2.9539295392953933e-06,
"loss": 0.851,
"mean_token_accuracy": 0.7361205220222473,
"num_tokens": 8086807.0,
"step": 603
},
{
"entropy": 0.8445456027984619,
"epoch": 1.473170731707317,
"grad_norm": 0.20236928761005402,
"learning_rate": 2.940379403794038e-06,
"loss": 0.8381,
"mean_token_accuracy": 0.7368095517158508,
"num_tokens": 8099749.0,
"step": 604
},
{
"entropy": 0.8485767841339111,
"epoch": 1.475609756097561,
"grad_norm": 0.20927858352661133,
"learning_rate": 2.926829268292683e-06,
"loss": 0.8596,
"mean_token_accuracy": 0.7299847602844238,
"num_tokens": 8112905.0,
"step": 605
},
{
"entropy": 0.8670172691345215,
"epoch": 1.4780487804878049,
"grad_norm": 0.18927742540836334,
"learning_rate": 2.913279132791328e-06,
"loss": 0.8631,
"mean_token_accuracy": 0.7319460511207581,
"num_tokens": 8126713.0,
"step": 606
},
{
"entropy": 0.8468033075332642,
"epoch": 1.4804878048780488,
"grad_norm": 0.1939922720193863,
"learning_rate": 2.8997289972899733e-06,
"loss": 0.8571,
"mean_token_accuracy": 0.7332726716995239,
"num_tokens": 8139911.0,
"step": 607
},
{
"entropy": 0.8749080300331116,
"epoch": 1.4829268292682927,
"grad_norm": 0.19756527245044708,
"learning_rate": 2.8861788617886185e-06,
"loss": 0.8602,
"mean_token_accuracy": 0.7331797480583191,
"num_tokens": 8152947.0,
"step": 608
},
{
"entropy": 0.8337868452072144,
"epoch": 1.4853658536585366,
"grad_norm": 0.18436206877231598,
"learning_rate": 2.8726287262872632e-06,
"loss": 0.8309,
"mean_token_accuracy": 0.7352545857429504,
"num_tokens": 8166357.0,
"step": 609
},
{
"entropy": 0.8511760830879211,
"epoch": 1.4878048780487805,
"grad_norm": 0.19367781281471252,
"learning_rate": 2.859078590785908e-06,
"loss": 0.8483,
"mean_token_accuracy": 0.7363938093185425,
"num_tokens": 8179639.0,
"step": 610
},
{
"entropy": 0.840193510055542,
"epoch": 1.4902439024390244,
"grad_norm": 0.18650898337364197,
"learning_rate": 2.845528455284553e-06,
"loss": 0.8523,
"mean_token_accuracy": 0.7330692410469055,
"num_tokens": 8193033.0,
"step": 611
},
{
"entropy": 0.8553098440170288,
"epoch": 1.4926829268292683,
"grad_norm": 0.19180989265441895,
"learning_rate": 2.831978319783198e-06,
"loss": 0.8457,
"mean_token_accuracy": 0.7340659499168396,
"num_tokens": 8206244.0,
"step": 612
},
{
"entropy": 0.8556879758834839,
"epoch": 1.4951219512195122,
"grad_norm": 0.19618037343025208,
"learning_rate": 2.8184281842818427e-06,
"loss": 0.8627,
"mean_token_accuracy": 0.7297991514205933,
"num_tokens": 8219502.0,
"step": 613
},
{
"entropy": 0.8604175448417664,
"epoch": 1.497560975609756,
"grad_norm": 0.1963457465171814,
"learning_rate": 2.8048780487804884e-06,
"loss": 0.8478,
"mean_token_accuracy": 0.733389675617218,
"num_tokens": 8232537.0,
"step": 614
},
{
"entropy": 0.843771755695343,
"epoch": 1.5,
"grad_norm": 0.18628379702568054,
"learning_rate": 2.791327913279133e-06,
"loss": 0.8372,
"mean_token_accuracy": 0.7395327687263489,
"num_tokens": 8245737.0,
"step": 615
},
{
"entropy": 0.8475285768508911,
"epoch": 1.502439024390244,
"grad_norm": 0.1898878812789917,
"learning_rate": 2.7777777777777783e-06,
"loss": 0.8499,
"mean_token_accuracy": 0.7381895780563354,
"num_tokens": 8258877.0,
"step": 616
},
{
"entropy": 0.8462591171264648,
"epoch": 1.5048780487804878,
"grad_norm": 0.19080275297164917,
"learning_rate": 2.764227642276423e-06,
"loss": 0.8333,
"mean_token_accuracy": 0.7345710396766663,
"num_tokens": 8272682.0,
"step": 617
},
{
"entropy": 0.8637003898620605,
"epoch": 1.5073170731707317,
"grad_norm": 0.21446824073791504,
"learning_rate": 2.750677506775068e-06,
"loss": 0.8834,
"mean_token_accuracy": 0.7266576290130615,
"num_tokens": 8286000.0,
"step": 618
},
{
"entropy": 0.8389323353767395,
"epoch": 1.5097560975609756,
"grad_norm": 0.18551738560199738,
"learning_rate": 2.7371273712737127e-06,
"loss": 0.8489,
"mean_token_accuracy": 0.7319799065589905,
"num_tokens": 8299168.0,
"step": 619
},
{
"entropy": 0.8565845489501953,
"epoch": 1.5121951219512195,
"grad_norm": 0.19202789664268494,
"learning_rate": 2.723577235772358e-06,
"loss": 0.8554,
"mean_token_accuracy": 0.7329407930374146,
"num_tokens": 8312432.0,
"step": 620
},
{
"entropy": 0.8483622074127197,
"epoch": 1.5146341463414634,
"grad_norm": 0.19737857580184937,
"learning_rate": 2.7100271002710026e-06,
"loss": 0.8596,
"mean_token_accuracy": 0.7318035960197449,
"num_tokens": 8325871.0,
"step": 621
},
{
"entropy": 0.8586803674697876,
"epoch": 1.5170731707317073,
"grad_norm": 0.18837496638298035,
"learning_rate": 2.6964769647696482e-06,
"loss": 0.8543,
"mean_token_accuracy": 0.7367194890975952,
"num_tokens": 8339196.0,
"step": 622
},
{
"entropy": 0.8477186560630798,
"epoch": 1.5195121951219512,
"grad_norm": 0.19471576809883118,
"learning_rate": 2.682926829268293e-06,
"loss": 0.8331,
"mean_token_accuracy": 0.7372268438339233,
"num_tokens": 8352208.0,
"step": 623
},
{
"entropy": 0.8441017866134644,
"epoch": 1.5219512195121951,
"grad_norm": 0.19018323719501495,
"learning_rate": 2.669376693766938e-06,
"loss": 0.8321,
"mean_token_accuracy": 0.7384440302848816,
"num_tokens": 8365399.0,
"step": 624
},
{
"entropy": 0.8366572856903076,
"epoch": 1.524390243902439,
"grad_norm": 0.1984400749206543,
"learning_rate": 2.655826558265583e-06,
"loss": 0.846,
"mean_token_accuracy": 0.734561562538147,
"num_tokens": 8378985.0,
"step": 625
},
{
"entropy": 0.8450554609298706,
"epoch": 1.526829268292683,
"grad_norm": 0.19116923213005066,
"learning_rate": 2.6422764227642278e-06,
"loss": 0.8538,
"mean_token_accuracy": 0.7278881072998047,
"num_tokens": 8392444.0,
"step": 626
},
{
"entropy": 0.8557592034339905,
"epoch": 1.5292682926829269,
"grad_norm": 0.1939450055360794,
"learning_rate": 2.6287262872628725e-06,
"loss": 0.8738,
"mean_token_accuracy": 0.7258123755455017,
"num_tokens": 8406093.0,
"step": 627
},
{
"entropy": 0.8385140895843506,
"epoch": 1.5317073170731708,
"grad_norm": 0.19521206617355347,
"learning_rate": 2.6151761517615177e-06,
"loss": 0.8562,
"mean_token_accuracy": 0.7332026362419128,
"num_tokens": 8419370.0,
"step": 628
},
{
"entropy": 0.8567601442337036,
"epoch": 1.5341463414634147,
"grad_norm": 0.18665672838687897,
"learning_rate": 2.601626016260163e-06,
"loss": 0.8566,
"mean_token_accuracy": 0.7314379811286926,
"num_tokens": 8432787.0,
"step": 629
},
{
"entropy": 0.851043701171875,
"epoch": 1.5365853658536586,
"grad_norm": 0.20015431940555573,
"learning_rate": 2.588075880758808e-06,
"loss": 0.8497,
"mean_token_accuracy": 0.7346607446670532,
"num_tokens": 8446363.0,
"step": 630
},
{
"entropy": 0.855539083480835,
"epoch": 1.5390243902439025,
"grad_norm": 0.19007694721221924,
"learning_rate": 2.574525745257453e-06,
"loss": 0.8449,
"mean_token_accuracy": 0.7352513670921326,
"num_tokens": 8460143.0,
"step": 631
},
{
"entropy": 0.8558579683303833,
"epoch": 1.5414634146341464,
"grad_norm": 0.1872863471508026,
"learning_rate": 2.5609756097560977e-06,
"loss": 0.8565,
"mean_token_accuracy": 0.7286000847816467,
"num_tokens": 8474131.0,
"step": 632
},
{
"entropy": 0.8450092673301697,
"epoch": 1.5439024390243903,
"grad_norm": 0.19050945341587067,
"learning_rate": 2.547425474254743e-06,
"loss": 0.8447,
"mean_token_accuracy": 0.735329270362854,
"num_tokens": 8487541.0,
"step": 633
},
{
"entropy": 0.8530290722846985,
"epoch": 1.5463414634146342,
"grad_norm": 0.20085333287715912,
"learning_rate": 2.5338753387533876e-06,
"loss": 0.8343,
"mean_token_accuracy": 0.7410814166069031,
"num_tokens": 8500928.0,
"step": 634
},
{
"entropy": 0.8755598068237305,
"epoch": 1.548780487804878,
"grad_norm": 0.21024124324321747,
"learning_rate": 2.5203252032520324e-06,
"loss": 0.8705,
"mean_token_accuracy": 0.7288838028907776,
"num_tokens": 8513979.0,
"step": 635
},
{
"entropy": 0.849466860294342,
"epoch": 1.551219512195122,
"grad_norm": 0.19688434898853302,
"learning_rate": 2.5067750677506776e-06,
"loss": 0.8623,
"mean_token_accuracy": 0.7304276823997498,
"num_tokens": 8527509.0,
"step": 636
},
{
"entropy": 0.8681310415267944,
"epoch": 1.553658536585366,
"grad_norm": 0.1976250261068344,
"learning_rate": 2.493224932249323e-06,
"loss": 0.8484,
"mean_token_accuracy": 0.7330136895179749,
"num_tokens": 8540874.0,
"step": 637
},
{
"entropy": 0.8659052848815918,
"epoch": 1.5560975609756098,
"grad_norm": 0.18264448642730713,
"learning_rate": 2.4796747967479676e-06,
"loss": 0.859,
"mean_token_accuracy": 0.7320760488510132,
"num_tokens": 8554517.0,
"step": 638
},
{
"entropy": 0.8266971111297607,
"epoch": 1.5585365853658537,
"grad_norm": 0.17848636209964752,
"learning_rate": 2.4661246612466128e-06,
"loss": 0.8289,
"mean_token_accuracy": 0.7398349642753601,
"num_tokens": 8567863.0,
"step": 639
},
{
"entropy": 0.8521214127540588,
"epoch": 1.5609756097560976,
"grad_norm": 0.18783526122570038,
"learning_rate": 2.4525745257452575e-06,
"loss": 0.8587,
"mean_token_accuracy": 0.7322368025779724,
"num_tokens": 8581376.0,
"step": 640
},
{
"entropy": 0.8435356616973877,
"epoch": 1.5634146341463415,
"grad_norm": 0.18920935690402985,
"learning_rate": 2.4390243902439027e-06,
"loss": 0.8505,
"mean_token_accuracy": 0.7323869466781616,
"num_tokens": 8594706.0,
"step": 641
},
{
"entropy": 0.8567894697189331,
"epoch": 1.5658536585365854,
"grad_norm": 0.19047923386096954,
"learning_rate": 2.4254742547425475e-06,
"loss": 0.8514,
"mean_token_accuracy": 0.7303991317749023,
"num_tokens": 8608127.0,
"step": 642
},
{
"entropy": 0.8464937806129456,
"epoch": 1.5682926829268293,
"grad_norm": 0.19749760627746582,
"learning_rate": 2.4119241192411927e-06,
"loss": 0.8645,
"mean_token_accuracy": 0.7283561825752258,
"num_tokens": 8621484.0,
"step": 643
},
{
"entropy": 0.8501962423324585,
"epoch": 1.5707317073170732,
"grad_norm": 0.19121719896793365,
"learning_rate": 2.3983739837398375e-06,
"loss": 0.8575,
"mean_token_accuracy": 0.736571729183197,
"num_tokens": 8634737.0,
"step": 644
},
{
"entropy": 0.8764846324920654,
"epoch": 1.5731707317073171,
"grad_norm": 0.1958206743001938,
"learning_rate": 2.3848238482384827e-06,
"loss": 0.8697,
"mean_token_accuracy": 0.7286435961723328,
"num_tokens": 8648016.0,
"step": 645
},
{
"entropy": 0.8585939407348633,
"epoch": 1.575609756097561,
"grad_norm": 0.19487060606479645,
"learning_rate": 2.371273712737128e-06,
"loss": 0.8702,
"mean_token_accuracy": 0.7259446978569031,
"num_tokens": 8661449.0,
"step": 646
},
{
"entropy": 0.8674750328063965,
"epoch": 1.578048780487805,
"grad_norm": 0.20030128955841064,
"learning_rate": 2.3577235772357727e-06,
"loss": 0.8756,
"mean_token_accuracy": 0.7257105112075806,
"num_tokens": 8675082.0,
"step": 647
},
{
"entropy": 0.8603734970092773,
"epoch": 1.5804878048780489,
"grad_norm": 0.18645605444908142,
"learning_rate": 2.3441734417344174e-06,
"loss": 0.8616,
"mean_token_accuracy": 0.7309102416038513,
"num_tokens": 8687919.0,
"step": 648
},
{
"entropy": 0.8567901849746704,
"epoch": 1.5829268292682928,
"grad_norm": 0.18722356855869293,
"learning_rate": 2.3306233062330626e-06,
"loss": 0.8556,
"mean_token_accuracy": 0.7300856113433838,
"num_tokens": 8701606.0,
"step": 649
},
{
"entropy": 0.8658725023269653,
"epoch": 1.5853658536585367,
"grad_norm": 0.19841359555721283,
"learning_rate": 2.317073170731708e-06,
"loss": 0.8607,
"mean_token_accuracy": 0.7348301410675049,
"num_tokens": 8715251.0,
"step": 650
},
{
"entropy": 0.864837110042572,
"epoch": 1.5878048780487806,
"grad_norm": 0.20387713611125946,
"learning_rate": 2.3035230352303526e-06,
"loss": 0.8672,
"mean_token_accuracy": 0.7283127307891846,
"num_tokens": 8728466.0,
"step": 651
},
{
"entropy": 0.8558300733566284,
"epoch": 1.5902439024390245,
"grad_norm": 0.18569935858249664,
"learning_rate": 2.2899728997289974e-06,
"loss": 0.8529,
"mean_token_accuracy": 0.7360357046127319,
"num_tokens": 8741927.0,
"step": 652
},
{
"entropy": 0.8700096607208252,
"epoch": 1.5926829268292684,
"grad_norm": 0.21747605502605438,
"learning_rate": 2.2764227642276426e-06,
"loss": 0.8637,
"mean_token_accuracy": 0.7255343794822693,
"num_tokens": 8755697.0,
"step": 653
},
{
"entropy": 0.8406076431274414,
"epoch": 1.5951219512195123,
"grad_norm": 0.20201769471168518,
"learning_rate": 2.2628726287262878e-06,
"loss": 0.8232,
"mean_token_accuracy": 0.7413987517356873,
"num_tokens": 8768996.0,
"step": 654
},
{
"entropy": 0.870011031627655,
"epoch": 1.5975609756097562,
"grad_norm": 0.20148082077503204,
"learning_rate": 2.2493224932249325e-06,
"loss": 0.8811,
"mean_token_accuracy": 0.7248213291168213,
"num_tokens": 8782585.0,
"step": 655
},
{
"entropy": 0.8453396558761597,
"epoch": 1.6,
"grad_norm": 0.20931822061538696,
"learning_rate": 2.2357723577235773e-06,
"loss": 0.8421,
"mean_token_accuracy": 0.7329903244972229,
"num_tokens": 8795623.0,
"step": 656
},
{
"entropy": 0.8622744083404541,
"epoch": 1.602439024390244,
"grad_norm": 0.19886784255504608,
"learning_rate": 2.222222222222222e-06,
"loss": 0.8635,
"mean_token_accuracy": 0.730383038520813,
"num_tokens": 8809084.0,
"step": 657
},
{
"entropy": 0.8559050559997559,
"epoch": 1.604878048780488,
"grad_norm": 0.1918165683746338,
"learning_rate": 2.2086720867208673e-06,
"loss": 0.8609,
"mean_token_accuracy": 0.7311277985572815,
"num_tokens": 8822400.0,
"step": 658
},
{
"entropy": 0.8488461971282959,
"epoch": 1.6073170731707318,
"grad_norm": 0.19921588897705078,
"learning_rate": 2.1951219512195125e-06,
"loss": 0.8483,
"mean_token_accuracy": 0.7353887557983398,
"num_tokens": 8835779.0,
"step": 659
},
{
"entropy": 0.881496250629425,
"epoch": 1.6097560975609757,
"grad_norm": 0.21144771575927734,
"learning_rate": 2.1815718157181572e-06,
"loss": 0.8823,
"mean_token_accuracy": 0.7272259593009949,
"num_tokens": 8849396.0,
"step": 660
},
{
"entropy": 0.8597643971443176,
"epoch": 1.6121951219512196,
"grad_norm": 0.19742603600025177,
"learning_rate": 2.1680216802168024e-06,
"loss": 0.8718,
"mean_token_accuracy": 0.7294816970825195,
"num_tokens": 8863034.0,
"step": 661
},
{
"entropy": 0.865936815738678,
"epoch": 1.6146341463414635,
"grad_norm": 0.2040947675704956,
"learning_rate": 2.154471544715447e-06,
"loss": 0.866,
"mean_token_accuracy": 0.727960467338562,
"num_tokens": 8876401.0,
"step": 662
},
{
"entropy": 0.8746140003204346,
"epoch": 1.6170731707317074,
"grad_norm": 0.19248297810554504,
"learning_rate": 2.1409214092140924e-06,
"loss": 0.8701,
"mean_token_accuracy": 0.7300986647605896,
"num_tokens": 8889896.0,
"step": 663
},
{
"entropy": 0.8540151715278625,
"epoch": 1.6195121951219513,
"grad_norm": 0.21466383337974548,
"learning_rate": 2.127371273712737e-06,
"loss": 0.8496,
"mean_token_accuracy": 0.7361807227134705,
"num_tokens": 8902883.0,
"step": 664
},
{
"entropy": 0.8697842955589294,
"epoch": 1.6219512195121952,
"grad_norm": 0.1929200142621994,
"learning_rate": 2.1138211382113824e-06,
"loss": 0.8525,
"mean_token_accuracy": 0.7341955304145813,
"num_tokens": 8916740.0,
"step": 665
},
{
"entropy": 0.8582409620285034,
"epoch": 1.6243902439024391,
"grad_norm": 0.18925856053829193,
"learning_rate": 2.100271002710027e-06,
"loss": 0.8587,
"mean_token_accuracy": 0.7289534211158752,
"num_tokens": 8929846.0,
"step": 666
},
{
"entropy": 0.8528343439102173,
"epoch": 1.626829268292683,
"grad_norm": 0.19603484869003296,
"learning_rate": 2.0867208672086723e-06,
"loss": 0.8583,
"mean_token_accuracy": 0.7347631454467773,
"num_tokens": 8942824.0,
"step": 667
},
{
"entropy": 0.8672012090682983,
"epoch": 1.629268292682927,
"grad_norm": 0.1923493593931198,
"learning_rate": 2.073170731707317e-06,
"loss": 0.8721,
"mean_token_accuracy": 0.7292376756668091,
"num_tokens": 8955748.0,
"step": 668
},
{
"entropy": 0.8548610806465149,
"epoch": 1.6317073170731708,
"grad_norm": 0.2052767127752304,
"learning_rate": 2.0596205962059623e-06,
"loss": 0.8421,
"mean_token_accuracy": 0.7371867895126343,
"num_tokens": 8968895.0,
"step": 669
},
{
"entropy": 0.8442499041557312,
"epoch": 1.6341463414634148,
"grad_norm": 0.18734319508075714,
"learning_rate": 2.046070460704607e-06,
"loss": 0.8509,
"mean_token_accuracy": 0.7343496680259705,
"num_tokens": 8982489.0,
"step": 670
},
{
"entropy": 0.8563357591629028,
"epoch": 1.6365853658536587,
"grad_norm": 0.18925635516643524,
"learning_rate": 2.0325203252032523e-06,
"loss": 0.8626,
"mean_token_accuracy": 0.7292543649673462,
"num_tokens": 8995809.0,
"step": 671
},
{
"entropy": 0.8476035594940186,
"epoch": 1.6390243902439026,
"grad_norm": 0.18875564634799957,
"learning_rate": 2.018970189701897e-06,
"loss": 0.8388,
"mean_token_accuracy": 0.7343665957450867,
"num_tokens": 9008858.0,
"step": 672
},
{
"entropy": 0.8399662375450134,
"epoch": 1.6414634146341465,
"grad_norm": 0.1930282562971115,
"learning_rate": 2.0054200542005423e-06,
"loss": 0.8437,
"mean_token_accuracy": 0.7364839911460876,
"num_tokens": 9022543.0,
"step": 673
},
{
"entropy": 0.8500676155090332,
"epoch": 1.6439024390243904,
"grad_norm": 0.20816656947135925,
"learning_rate": 1.991869918699187e-06,
"loss": 0.8573,
"mean_token_accuracy": 0.7287561893463135,
"num_tokens": 9035857.0,
"step": 674
},
{
"entropy": 0.8518763780593872,
"epoch": 1.6463414634146343,
"grad_norm": 0.20092223584651947,
"learning_rate": 1.9783197831978322e-06,
"loss": 0.8554,
"mean_token_accuracy": 0.732020378112793,
"num_tokens": 9049430.0,
"step": 675
},
{
"entropy": 0.8682869672775269,
"epoch": 1.6487804878048782,
"grad_norm": 0.20551393926143646,
"learning_rate": 1.964769647696477e-06,
"loss": 0.8746,
"mean_token_accuracy": 0.7290708422660828,
"num_tokens": 9063147.0,
"step": 676
},
{
"entropy": 0.8445431590080261,
"epoch": 1.651219512195122,
"grad_norm": 0.1954556405544281,
"learning_rate": 1.951219512195122e-06,
"loss": 0.8474,
"mean_token_accuracy": 0.7327855229377747,
"num_tokens": 9076306.0,
"step": 677
},
{
"entropy": 0.8518280982971191,
"epoch": 1.653658536585366,
"grad_norm": 0.19159460067749023,
"learning_rate": 1.937669376693767e-06,
"loss": 0.8466,
"mean_token_accuracy": 0.734912633895874,
"num_tokens": 9089661.0,
"step": 678
},
{
"entropy": 0.8668668270111084,
"epoch": 1.65609756097561,
"grad_norm": 0.20159472525119781,
"learning_rate": 1.924119241192412e-06,
"loss": 0.876,
"mean_token_accuracy": 0.7221975326538086,
"num_tokens": 9103165.0,
"step": 679
},
{
"entropy": 0.8498247265815735,
"epoch": 1.6585365853658538,
"grad_norm": 0.17916780710220337,
"learning_rate": 1.9105691056910574e-06,
"loss": 0.8398,
"mean_token_accuracy": 0.7360494136810303,
"num_tokens": 9116460.0,
"step": 680
},
{
"entropy": 0.8593329191207886,
"epoch": 1.6609756097560977,
"grad_norm": 0.20385178923606873,
"learning_rate": 1.8970189701897021e-06,
"loss": 0.8743,
"mean_token_accuracy": 0.7305371165275574,
"num_tokens": 9129565.0,
"step": 681
},
{
"entropy": 0.8521544933319092,
"epoch": 1.6634146341463416,
"grad_norm": 0.1913313865661621,
"learning_rate": 1.8834688346883471e-06,
"loss": 0.8418,
"mean_token_accuracy": 0.7370095252990723,
"num_tokens": 9142783.0,
"step": 682
},
{
"entropy": 0.8547897338867188,
"epoch": 1.6658536585365855,
"grad_norm": 0.19753193855285645,
"learning_rate": 1.8699186991869919e-06,
"loss": 0.8581,
"mean_token_accuracy": 0.7303997278213501,
"num_tokens": 9156434.0,
"step": 683
},
{
"entropy": 0.859555721282959,
"epoch": 1.6682926829268294,
"grad_norm": 0.21616385877132416,
"learning_rate": 1.856368563685637e-06,
"loss": 0.8586,
"mean_token_accuracy": 0.7308056950569153,
"num_tokens": 9170165.0,
"step": 684
},
{
"entropy": 0.8644682168960571,
"epoch": 1.6707317073170733,
"grad_norm": 0.20613378286361694,
"learning_rate": 1.842818428184282e-06,
"loss": 0.8729,
"mean_token_accuracy": 0.727326512336731,
"num_tokens": 9183699.0,
"step": 685
},
{
"entropy": 0.8454245924949646,
"epoch": 1.6731707317073172,
"grad_norm": 0.18449188768863678,
"learning_rate": 1.8292682926829268e-06,
"loss": 0.8407,
"mean_token_accuracy": 0.7404232025146484,
"num_tokens": 9196663.0,
"step": 686
},
{
"entropy": 0.8595112562179565,
"epoch": 1.6756097560975611,
"grad_norm": 0.2021973878145218,
"learning_rate": 1.8157181571815718e-06,
"loss": 0.8369,
"mean_token_accuracy": 0.735076904296875,
"num_tokens": 9209947.0,
"step": 687
},
{
"entropy": 0.8636391162872314,
"epoch": 1.678048780487805,
"grad_norm": 0.19267405569553375,
"learning_rate": 1.802168021680217e-06,
"loss": 0.8637,
"mean_token_accuracy": 0.7290427088737488,
"num_tokens": 9223574.0,
"step": 688
},
{
"entropy": 0.8558269143104553,
"epoch": 1.680487804878049,
"grad_norm": 0.1942630261182785,
"learning_rate": 1.788617886178862e-06,
"loss": 0.8593,
"mean_token_accuracy": 0.7335766553878784,
"num_tokens": 9237016.0,
"step": 689
},
{
"entropy": 0.8581171035766602,
"epoch": 1.6829268292682928,
"grad_norm": 0.20008458197116852,
"learning_rate": 1.7750677506775068e-06,
"loss": 0.8462,
"mean_token_accuracy": 0.7356287837028503,
"num_tokens": 9250653.0,
"step": 690
},
{
"entropy": 0.8696762323379517,
"epoch": 1.6853658536585368,
"grad_norm": 0.20756582915782928,
"learning_rate": 1.7615176151761518e-06,
"loss": 0.8521,
"mean_token_accuracy": 0.734020471572876,
"num_tokens": 9264155.0,
"step": 691
},
{
"entropy": 0.8596901893615723,
"epoch": 1.6878048780487804,
"grad_norm": 0.19614450633525848,
"learning_rate": 1.747967479674797e-06,
"loss": 0.8596,
"mean_token_accuracy": 0.7338370680809021,
"num_tokens": 9278200.0,
"step": 692
},
{
"entropy": 0.8524608016014099,
"epoch": 1.6902439024390243,
"grad_norm": 0.20042568445205688,
"learning_rate": 1.734417344173442e-06,
"loss": 0.8657,
"mean_token_accuracy": 0.7275142073631287,
"num_tokens": 9291391.0,
"step": 693
},
{
"entropy": 0.8588581085205078,
"epoch": 1.6926829268292682,
"grad_norm": 0.195918470621109,
"learning_rate": 1.7208672086720867e-06,
"loss": 0.8752,
"mean_token_accuracy": 0.72524493932724,
"num_tokens": 9304677.0,
"step": 694
},
{
"entropy": 0.8536249399185181,
"epoch": 1.6951219512195121,
"grad_norm": 0.1939048022031784,
"learning_rate": 1.707317073170732e-06,
"loss": 0.8585,
"mean_token_accuracy": 0.7366573810577393,
"num_tokens": 9318371.0,
"step": 695
},
{
"entropy": 0.8678462505340576,
"epoch": 1.697560975609756,
"grad_norm": 0.19590549170970917,
"learning_rate": 1.693766937669377e-06,
"loss": 0.8602,
"mean_token_accuracy": 0.7325801849365234,
"num_tokens": 9331576.0,
"step": 696
},
{
"entropy": 0.8561972379684448,
"epoch": 1.7,
"grad_norm": 0.197646364569664,
"learning_rate": 1.6802168021680219e-06,
"loss": 0.8623,
"mean_token_accuracy": 0.7266197204589844,
"num_tokens": 9345792.0,
"step": 697
},
{
"entropy": 0.8263330459594727,
"epoch": 1.7024390243902439,
"grad_norm": 0.1956222802400589,
"learning_rate": 1.6666666666666667e-06,
"loss": 0.8296,
"mean_token_accuracy": 0.7327542304992676,
"num_tokens": 9359507.0,
"step": 698
},
{
"entropy": 0.8621451258659363,
"epoch": 1.7048780487804878,
"grad_norm": 0.18726736307144165,
"learning_rate": 1.6531165311653119e-06,
"loss": 0.855,
"mean_token_accuracy": 0.7335154414176941,
"num_tokens": 9373066.0,
"step": 699
},
{
"entropy": 0.8437690734863281,
"epoch": 1.7073170731707317,
"grad_norm": 0.19272619485855103,
"learning_rate": 1.6395663956639568e-06,
"loss": 0.8333,
"mean_token_accuracy": 0.7366671562194824,
"num_tokens": 9386620.0,
"step": 700
},
{
"entropy": 0.859840989112854,
"epoch": 1.7097560975609756,
"grad_norm": 0.19936420023441315,
"learning_rate": 1.6260162601626018e-06,
"loss": 0.8591,
"mean_token_accuracy": 0.7266056537628174,
"num_tokens": 9399855.0,
"step": 701
},
{
"entropy": 0.8391731977462769,
"epoch": 1.7121951219512195,
"grad_norm": 0.19459789991378784,
"learning_rate": 1.6124661246612466e-06,
"loss": 0.8414,
"mean_token_accuracy": 0.7338288426399231,
"num_tokens": 9413460.0,
"step": 702
},
{
"entropy": 0.8309324979782104,
"epoch": 1.7146341463414634,
"grad_norm": 0.21322514116764069,
"learning_rate": 1.5989159891598918e-06,
"loss": 0.8442,
"mean_token_accuracy": 0.7402694225311279,
"num_tokens": 9426913.0,
"step": 703
},
{
"entropy": 0.8639693856239319,
"epoch": 1.7170731707317073,
"grad_norm": 0.19077976047992706,
"learning_rate": 1.5853658536585368e-06,
"loss": 0.8737,
"mean_token_accuracy": 0.7287358045578003,
"num_tokens": 9440661.0,
"step": 704
},
{
"entropy": 0.8579573631286621,
"epoch": 1.7195121951219512,
"grad_norm": 0.196372851729393,
"learning_rate": 1.5718157181571816e-06,
"loss": 0.86,
"mean_token_accuracy": 0.7288172841072083,
"num_tokens": 9454273.0,
"step": 705
},
{
"entropy": 0.8493719100952148,
"epoch": 1.721951219512195,
"grad_norm": 0.1844881922006607,
"learning_rate": 1.5582655826558265e-06,
"loss": 0.8393,
"mean_token_accuracy": 0.735931396484375,
"num_tokens": 9467812.0,
"step": 706
},
{
"entropy": 0.850537896156311,
"epoch": 1.724390243902439,
"grad_norm": 0.19616253674030304,
"learning_rate": 1.5447154471544717e-06,
"loss": 0.837,
"mean_token_accuracy": 0.738007128238678,
"num_tokens": 9481336.0,
"step": 707
},
{
"entropy": 0.852540135383606,
"epoch": 1.726829268292683,
"grad_norm": 0.19334371387958527,
"learning_rate": 1.5311653116531167e-06,
"loss": 0.8326,
"mean_token_accuracy": 0.7419998645782471,
"num_tokens": 9494883.0,
"step": 708
},
{
"entropy": 0.8625578880310059,
"epoch": 1.7292682926829268,
"grad_norm": 0.19667640328407288,
"learning_rate": 1.5176151761517615e-06,
"loss": 0.8684,
"mean_token_accuracy": 0.726330578327179,
"num_tokens": 9508408.0,
"step": 709
},
{
"entropy": 0.8546831607818604,
"epoch": 1.7317073170731707,
"grad_norm": 0.19391046464443207,
"learning_rate": 1.5040650406504067e-06,
"loss": 0.8679,
"mean_token_accuracy": 0.7256612181663513,
"num_tokens": 9522527.0,
"step": 710
},
{
"entropy": 0.8476510047912598,
"epoch": 1.7341463414634146,
"grad_norm": 0.17655602097511292,
"learning_rate": 1.4905149051490517e-06,
"loss": 0.8377,
"mean_token_accuracy": 0.7392624616622925,
"num_tokens": 9536373.0,
"step": 711
},
{
"entropy": 0.844441294670105,
"epoch": 1.7365853658536585,
"grad_norm": 0.20517893135547638,
"learning_rate": 1.4769647696476967e-06,
"loss": 0.8428,
"mean_token_accuracy": 0.7325944900512695,
"num_tokens": 9549833.0,
"step": 712
},
{
"entropy": 0.8518630266189575,
"epoch": 1.7390243902439024,
"grad_norm": 0.1965651959180832,
"learning_rate": 1.4634146341463414e-06,
"loss": 0.8452,
"mean_token_accuracy": 0.727881669998169,
"num_tokens": 9563435.0,
"step": 713
},
{
"entropy": 0.8457773923873901,
"epoch": 1.7414634146341463,
"grad_norm": 0.19006958603858948,
"learning_rate": 1.4498644986449866e-06,
"loss": 0.8275,
"mean_token_accuracy": 0.7393438816070557,
"num_tokens": 9576894.0,
"step": 714
},
{
"entropy": 0.8564866781234741,
"epoch": 1.7439024390243902,
"grad_norm": 0.2010202705860138,
"learning_rate": 1.4363143631436316e-06,
"loss": 0.8597,
"mean_token_accuracy": 0.7363360524177551,
"num_tokens": 9590742.0,
"step": 715
},
{
"entropy": 0.8455218076705933,
"epoch": 1.7463414634146341,
"grad_norm": 0.19736050069332123,
"learning_rate": 1.4227642276422766e-06,
"loss": 0.8473,
"mean_token_accuracy": 0.730883002281189,
"num_tokens": 9604280.0,
"step": 716
},
{
"entropy": 0.8673247694969177,
"epoch": 1.748780487804878,
"grad_norm": 0.19236670434474945,
"learning_rate": 1.4092140921409214e-06,
"loss": 0.8689,
"mean_token_accuracy": 0.7293338179588318,
"num_tokens": 9617881.0,
"step": 717
},
{
"entropy": 0.8403637409210205,
"epoch": 1.751219512195122,
"grad_norm": 0.19086958467960358,
"learning_rate": 1.3956639566395666e-06,
"loss": 0.8454,
"mean_token_accuracy": 0.7351208329200745,
"num_tokens": 9631137.0,
"step": 718
},
{
"entropy": 0.8552924394607544,
"epoch": 1.7536585365853659,
"grad_norm": 0.2235487997531891,
"learning_rate": 1.3821138211382116e-06,
"loss": 0.8365,
"mean_token_accuracy": 0.7410858273506165,
"num_tokens": 9644783.0,
"step": 719
},
{
"entropy": 0.8442793488502502,
"epoch": 1.7560975609756098,
"grad_norm": 0.20413640141487122,
"learning_rate": 1.3685636856368563e-06,
"loss": 0.8441,
"mean_token_accuracy": 0.7311614751815796,
"num_tokens": 9658428.0,
"step": 720
},
{
"entropy": 0.856056809425354,
"epoch": 1.7585365853658537,
"grad_norm": 0.19709528982639313,
"learning_rate": 1.3550135501355013e-06,
"loss": 0.8378,
"mean_token_accuracy": 0.7371993064880371,
"num_tokens": 9671705.0,
"step": 721
},
{
"entropy": 0.84223872423172,
"epoch": 1.7609756097560976,
"grad_norm": 0.21388745307922363,
"learning_rate": 1.3414634146341465e-06,
"loss": 0.8407,
"mean_token_accuracy": 0.7297487258911133,
"num_tokens": 9684535.0,
"step": 722
},
{
"entropy": 0.8511770963668823,
"epoch": 1.7634146341463415,
"grad_norm": 0.18245741724967957,
"learning_rate": 1.3279132791327915e-06,
"loss": 0.8523,
"mean_token_accuracy": 0.7327352166175842,
"num_tokens": 9697815.0,
"step": 723
},
{
"entropy": 0.853592038154602,
"epoch": 1.7658536585365854,
"grad_norm": 0.1975676268339157,
"learning_rate": 1.3143631436314363e-06,
"loss": 0.8479,
"mean_token_accuracy": 0.7345311045646667,
"num_tokens": 9711245.0,
"step": 724
},
{
"entropy": 0.8440106511116028,
"epoch": 1.7682926829268293,
"grad_norm": 0.20077702403068542,
"learning_rate": 1.3008130081300815e-06,
"loss": 0.8317,
"mean_token_accuracy": 0.7399922609329224,
"num_tokens": 9724226.0,
"step": 725
},
{
"entropy": 0.8635171055793762,
"epoch": 1.7707317073170732,
"grad_norm": 0.1960218995809555,
"learning_rate": 1.2872628726287264e-06,
"loss": 0.8681,
"mean_token_accuracy": 0.7306538820266724,
"num_tokens": 9737578.0,
"step": 726
},
{
"entropy": 0.8365871906280518,
"epoch": 1.773170731707317,
"grad_norm": 0.19658249616622925,
"learning_rate": 1.2737127371273714e-06,
"loss": 0.8307,
"mean_token_accuracy": 0.7418926954269409,
"num_tokens": 9751162.0,
"step": 727
},
{
"entropy": 0.8456725478172302,
"epoch": 1.775609756097561,
"grad_norm": 0.2136267125606537,
"learning_rate": 1.2601626016260162e-06,
"loss": 0.8405,
"mean_token_accuracy": 0.7332991361618042,
"num_tokens": 9764815.0,
"step": 728
},
{
"entropy": 0.8460253477096558,
"epoch": 1.778048780487805,
"grad_norm": 0.2026556134223938,
"learning_rate": 1.2466124661246614e-06,
"loss": 0.8378,
"mean_token_accuracy": 0.7357039451599121,
"num_tokens": 9777964.0,
"step": 729
},
{
"entropy": 0.8548044562339783,
"epoch": 1.7804878048780488,
"grad_norm": 0.19436872005462646,
"learning_rate": 1.2330623306233064e-06,
"loss": 0.8654,
"mean_token_accuracy": 0.7290599346160889,
"num_tokens": 9791256.0,
"step": 730
},
{
"entropy": 0.8560187816619873,
"epoch": 1.7829268292682927,
"grad_norm": 0.19585715234279633,
"learning_rate": 1.2195121951219514e-06,
"loss": 0.854,
"mean_token_accuracy": 0.7302951216697693,
"num_tokens": 9804657.0,
"step": 731
},
{
"entropy": 0.8435602188110352,
"epoch": 1.7853658536585366,
"grad_norm": 0.19885797798633575,
"learning_rate": 1.2059620596205964e-06,
"loss": 0.8428,
"mean_token_accuracy": 0.7359856963157654,
"num_tokens": 9818070.0,
"step": 732
},
{
"entropy": 0.8532072305679321,
"epoch": 1.7878048780487805,
"grad_norm": 0.20609894394874573,
"learning_rate": 1.1924119241192413e-06,
"loss": 0.8622,
"mean_token_accuracy": 0.7294403314590454,
"num_tokens": 9831255.0,
"step": 733
},
{
"entropy": 0.8447146415710449,
"epoch": 1.7902439024390244,
"grad_norm": 0.1939428597688675,
"learning_rate": 1.1788617886178863e-06,
"loss": 0.8482,
"mean_token_accuracy": 0.7313094735145569,
"num_tokens": 9844513.0,
"step": 734
},
{
"entropy": 0.8524222373962402,
"epoch": 1.7926829268292683,
"grad_norm": 0.20892949402332306,
"learning_rate": 1.1653116531165313e-06,
"loss": 0.8452,
"mean_token_accuracy": 0.7328373193740845,
"num_tokens": 9857566.0,
"step": 735
},
{
"entropy": 0.8320717811584473,
"epoch": 1.7951219512195122,
"grad_norm": 0.18978025019168854,
"learning_rate": 1.1517615176151763e-06,
"loss": 0.8349,
"mean_token_accuracy": 0.7377734780311584,
"num_tokens": 9870975.0,
"step": 736
},
{
"entropy": 0.8415433168411255,
"epoch": 1.7975609756097561,
"grad_norm": 0.21102409064769745,
"learning_rate": 1.1382113821138213e-06,
"loss": 0.8452,
"mean_token_accuracy": 0.7326037287712097,
"num_tokens": 9884514.0,
"step": 737
},
{
"entropy": 0.850642204284668,
"epoch": 1.8,
"grad_norm": 0.204196959733963,
"learning_rate": 1.1246612466124663e-06,
"loss": 0.8672,
"mean_token_accuracy": 0.724947988986969,
"num_tokens": 9897513.0,
"step": 738
},
{
"entropy": 0.8529345393180847,
"epoch": 1.802439024390244,
"grad_norm": 0.18976934254169464,
"learning_rate": 1.111111111111111e-06,
"loss": 0.8653,
"mean_token_accuracy": 0.7342261672019958,
"num_tokens": 9910969.0,
"step": 739
},
{
"entropy": 0.848357617855072,
"epoch": 1.8048780487804879,
"grad_norm": 0.22443044185638428,
"learning_rate": 1.0975609756097562e-06,
"loss": 0.8514,
"mean_token_accuracy": 0.7322797775268555,
"num_tokens": 9923767.0,
"step": 740
},
{
"entropy": 0.8451347947120667,
"epoch": 1.8073170731707318,
"grad_norm": 0.21177564561367035,
"learning_rate": 1.0840108401084012e-06,
"loss": 0.8534,
"mean_token_accuracy": 0.7316635251045227,
"num_tokens": 9937158.0,
"step": 741
},
{
"entropy": 0.8371709585189819,
"epoch": 1.8097560975609757,
"grad_norm": 0.2079295665025711,
"learning_rate": 1.0704607046070462e-06,
"loss": 0.8444,
"mean_token_accuracy": 0.7338888645172119,
"num_tokens": 9950255.0,
"step": 742
},
{
"entropy": 0.8622915744781494,
"epoch": 1.8121951219512196,
"grad_norm": 0.20502783358097076,
"learning_rate": 1.0569105691056912e-06,
"loss": 0.8726,
"mean_token_accuracy": 0.7261030673980713,
"num_tokens": 9963484.0,
"step": 743
},
{
"entropy": 0.8526772260665894,
"epoch": 1.8146341463414632,
"grad_norm": 0.21239180862903595,
"learning_rate": 1.0433604336043362e-06,
"loss": 0.8581,
"mean_token_accuracy": 0.7288627624511719,
"num_tokens": 9976936.0,
"step": 744
},
{
"entropy": 0.8445687890052795,
"epoch": 1.8170731707317072,
"grad_norm": 0.20623742043972015,
"learning_rate": 1.0298102981029812e-06,
"loss": 0.8522,
"mean_token_accuracy": 0.7347913980484009,
"num_tokens": 9990760.0,
"step": 745
},
{
"entropy": 0.8608044385910034,
"epoch": 1.819512195121951,
"grad_norm": 0.19621485471725464,
"learning_rate": 1.0162601626016261e-06,
"loss": 0.8718,
"mean_token_accuracy": 0.7230565547943115,
"num_tokens": 10004360.0,
"step": 746
},
{
"entropy": 0.8496952056884766,
"epoch": 1.821951219512195,
"grad_norm": 0.19843044877052307,
"learning_rate": 1.0027100271002711e-06,
"loss": 0.8541,
"mean_token_accuracy": 0.7331779599189758,
"num_tokens": 10017677.0,
"step": 747
},
{
"entropy": 0.8300923109054565,
"epoch": 1.8243902439024389,
"grad_norm": 0.19320283830165863,
"learning_rate": 9.891598915989161e-07,
"loss": 0.8226,
"mean_token_accuracy": 0.7383586764335632,
"num_tokens": 10030707.0,
"step": 748
},
{
"entropy": 0.862189769744873,
"epoch": 1.8268292682926828,
"grad_norm": 0.19311180710792542,
"learning_rate": 9.75609756097561e-07,
"loss": 0.8502,
"mean_token_accuracy": 0.7346285581588745,
"num_tokens": 10044466.0,
"step": 749
},
{
"entropy": 0.8316363096237183,
"epoch": 1.8292682926829267,
"grad_norm": 0.2041832059621811,
"learning_rate": 9.62059620596206e-07,
"loss": 0.8221,
"mean_token_accuracy": 0.7383882999420166,
"num_tokens": 10058132.0,
"step": 750
},
{
"entropy": 0.8450522422790527,
"epoch": 1.8317073170731706,
"grad_norm": 0.199119433760643,
"learning_rate": 9.485094850948511e-07,
"loss": 0.824,
"mean_token_accuracy": 0.7412486672401428,
"num_tokens": 10071346.0,
"step": 751
},
{
"entropy": 0.84795081615448,
"epoch": 1.8341463414634145,
"grad_norm": 0.2036094069480896,
"learning_rate": 9.349593495934959e-07,
"loss": 0.8574,
"mean_token_accuracy": 0.7317926287651062,
"num_tokens": 10084516.0,
"step": 752
},
{
"entropy": 0.8715170621871948,
"epoch": 1.8365853658536584,
"grad_norm": 0.2116577923297882,
"learning_rate": 9.21409214092141e-07,
"loss": 0.8351,
"mean_token_accuracy": 0.7349324226379395,
"num_tokens": 10097706.0,
"step": 753
},
{
"entropy": 0.8570759296417236,
"epoch": 1.8390243902439023,
"grad_norm": 0.20559139549732208,
"learning_rate": 9.078590785907859e-07,
"loss": 0.861,
"mean_token_accuracy": 0.7247146368026733,
"num_tokens": 10111475.0,
"step": 754
},
{
"entropy": 0.8573019504547119,
"epoch": 1.8414634146341462,
"grad_norm": 0.20710168778896332,
"learning_rate": 8.94308943089431e-07,
"loss": 0.8701,
"mean_token_accuracy": 0.7320393919944763,
"num_tokens": 10124784.0,
"step": 755
},
{
"entropy": 0.8414781093597412,
"epoch": 1.84390243902439,
"grad_norm": 0.19474507868289948,
"learning_rate": 8.807588075880759e-07,
"loss": 0.8389,
"mean_token_accuracy": 0.7376715540885925,
"num_tokens": 10138062.0,
"step": 756
},
{
"entropy": 0.8562086820602417,
"epoch": 1.846341463414634,
"grad_norm": 0.18625088036060333,
"learning_rate": 8.67208672086721e-07,
"loss": 0.8406,
"mean_token_accuracy": 0.7356444001197815,
"num_tokens": 10152184.0,
"step": 757
},
{
"entropy": 0.8786016702651978,
"epoch": 1.848780487804878,
"grad_norm": 0.20720075070858002,
"learning_rate": 8.53658536585366e-07,
"loss": 0.8872,
"mean_token_accuracy": 0.723919153213501,
"num_tokens": 10165754.0,
"step": 758
},
{
"entropy": 0.8555569648742676,
"epoch": 1.8512195121951218,
"grad_norm": 0.20634230971336365,
"learning_rate": 8.401084010840109e-07,
"loss": 0.8515,
"mean_token_accuracy": 0.7339683771133423,
"num_tokens": 10178682.0,
"step": 759
},
{
"entropy": 0.8689761757850647,
"epoch": 1.8536585365853657,
"grad_norm": 0.19764046370983124,
"learning_rate": 8.265582655826559e-07,
"loss": 0.865,
"mean_token_accuracy": 0.7301658987998962,
"num_tokens": 10191958.0,
"step": 760
},
{
"entropy": 0.8437796235084534,
"epoch": 1.8560975609756096,
"grad_norm": 0.19624987244606018,
"learning_rate": 8.130081300813009e-07,
"loss": 0.8435,
"mean_token_accuracy": 0.735300600528717,
"num_tokens": 10205597.0,
"step": 761
},
{
"entropy": 0.8480662703514099,
"epoch": 1.8585365853658535,
"grad_norm": 0.20579519867897034,
"learning_rate": 7.994579945799459e-07,
"loss": 0.8641,
"mean_token_accuracy": 0.734367847442627,
"num_tokens": 10218759.0,
"step": 762
},
{
"entropy": 0.8355182409286499,
"epoch": 1.8609756097560974,
"grad_norm": 0.2053273767232895,
"learning_rate": 7.859078590785908e-07,
"loss": 0.8409,
"mean_token_accuracy": 0.7342787384986877,
"num_tokens": 10232244.0,
"step": 763
},
{
"entropy": 0.8215388655662537,
"epoch": 1.8634146341463413,
"grad_norm": 0.207631453871727,
"learning_rate": 7.723577235772359e-07,
"loss": 0.8198,
"mean_token_accuracy": 0.7401138544082642,
"num_tokens": 10245258.0,
"step": 764
},
{
"entropy": 0.8489701747894287,
"epoch": 1.8658536585365852,
"grad_norm": 0.19653555750846863,
"learning_rate": 7.588075880758807e-07,
"loss": 0.8665,
"mean_token_accuracy": 0.7305497527122498,
"num_tokens": 10259117.0,
"step": 765
},
{
"entropy": 0.8704265356063843,
"epoch": 1.8682926829268292,
"grad_norm": 0.18554694950580597,
"learning_rate": 7.452574525745258e-07,
"loss": 0.8681,
"mean_token_accuracy": 0.7264304757118225,
"num_tokens": 10272625.0,
"step": 766
},
{
"entropy": 0.8253329992294312,
"epoch": 1.870731707317073,
"grad_norm": 0.1967262178659439,
"learning_rate": 7.317073170731707e-07,
"loss": 0.827,
"mean_token_accuracy": 0.7363318204879761,
"num_tokens": 10286359.0,
"step": 767
},
{
"entropy": 0.845137357711792,
"epoch": 1.873170731707317,
"grad_norm": 0.1927618682384491,
"learning_rate": 7.181571815718158e-07,
"loss": 0.8374,
"mean_token_accuracy": 0.7362507581710815,
"num_tokens": 10299903.0,
"step": 768
},
{
"entropy": 0.8345843553543091,
"epoch": 1.8756097560975609,
"grad_norm": 0.19964925944805145,
"learning_rate": 7.046070460704607e-07,
"loss": 0.8322,
"mean_token_accuracy": 0.7415523529052734,
"num_tokens": 10312970.0,
"step": 769
},
{
"entropy": 0.8438344597816467,
"epoch": 1.8780487804878048,
"grad_norm": 0.19649818539619446,
"learning_rate": 6.910569105691058e-07,
"loss": 0.833,
"mean_token_accuracy": 0.7362222671508789,
"num_tokens": 10325978.0,
"step": 770
},
{
"entropy": 0.8615357875823975,
"epoch": 1.8804878048780487,
"grad_norm": 0.19380824267864227,
"learning_rate": 6.775067750677507e-07,
"loss": 0.8682,
"mean_token_accuracy": 0.7287015318870544,
"num_tokens": 10339610.0,
"step": 771
},
{
"entropy": 0.8343783617019653,
"epoch": 1.8829268292682926,
"grad_norm": 0.2009415328502655,
"learning_rate": 6.639566395663957e-07,
"loss": 0.8262,
"mean_token_accuracy": 0.7381997108459473,
"num_tokens": 10352613.0,
"step": 772
},
{
"entropy": 0.8724961280822754,
"epoch": 1.8853658536585365,
"grad_norm": 0.21221604943275452,
"learning_rate": 6.504065040650407e-07,
"loss": 0.8996,
"mean_token_accuracy": 0.718626081943512,
"num_tokens": 10365992.0,
"step": 773
},
{
"entropy": 0.8535772562026978,
"epoch": 1.8878048780487804,
"grad_norm": 0.20168307423591614,
"learning_rate": 6.368563685636857e-07,
"loss": 0.8313,
"mean_token_accuracy": 0.7387219667434692,
"num_tokens": 10379419.0,
"step": 774
},
{
"entropy": 0.8459309935569763,
"epoch": 1.8902439024390243,
"grad_norm": 0.1862184703350067,
"learning_rate": 6.233062330623307e-07,
"loss": 0.847,
"mean_token_accuracy": 0.7340514659881592,
"num_tokens": 10392524.0,
"step": 775
},
{
"entropy": 0.8495763540267944,
"epoch": 1.8926829268292682,
"grad_norm": 0.19959184527397156,
"learning_rate": 6.097560975609757e-07,
"loss": 0.849,
"mean_token_accuracy": 0.7358462810516357,
"num_tokens": 10406017.0,
"step": 776
},
{
"entropy": 0.855975329875946,
"epoch": 1.895121951219512,
"grad_norm": 0.20276881754398346,
"learning_rate": 5.962059620596207e-07,
"loss": 0.8426,
"mean_token_accuracy": 0.7363553047180176,
"num_tokens": 10419115.0,
"step": 777
},
{
"entropy": 0.8373376727104187,
"epoch": 1.897560975609756,
"grad_norm": 0.20193855464458466,
"learning_rate": 5.826558265582657e-07,
"loss": 0.8356,
"mean_token_accuracy": 0.7349722385406494,
"num_tokens": 10432473.0,
"step": 778
},
{
"entropy": 0.8574913740158081,
"epoch": 1.9,
"grad_norm": 0.1951507329940796,
"learning_rate": 5.691056910569106e-07,
"loss": 0.8454,
"mean_token_accuracy": 0.7371317744255066,
"num_tokens": 10445389.0,
"step": 779
},
{
"entropy": 0.8459637761116028,
"epoch": 1.9024390243902438,
"grad_norm": 0.21754737198352814,
"learning_rate": 5.555555555555555e-07,
"loss": 0.8479,
"mean_token_accuracy": 0.7290775179862976,
"num_tokens": 10458955.0,
"step": 780
},
{
"entropy": 0.8668469786643982,
"epoch": 1.9048780487804877,
"grad_norm": 0.19004595279693604,
"learning_rate": 5.420054200542006e-07,
"loss": 0.8651,
"mean_token_accuracy": 0.7281619310379028,
"num_tokens": 10472262.0,
"step": 781
},
{
"entropy": 0.8526676893234253,
"epoch": 1.9073170731707316,
"grad_norm": 0.20260126888751984,
"learning_rate": 5.284552845528456e-07,
"loss": 0.8451,
"mean_token_accuracy": 0.7369789481163025,
"num_tokens": 10485737.0,
"step": 782
},
{
"entropy": 0.8564171195030212,
"epoch": 1.9097560975609755,
"grad_norm": 0.21006231009960175,
"learning_rate": 5.149051490514906e-07,
"loss": 0.8525,
"mean_token_accuracy": 0.7312126159667969,
"num_tokens": 10499459.0,
"step": 783
},
{
"entropy": 0.8616898655891418,
"epoch": 1.9121951219512194,
"grad_norm": 0.22315165400505066,
"learning_rate": 5.013550135501356e-07,
"loss": 0.8616,
"mean_token_accuracy": 0.7301322221755981,
"num_tokens": 10513241.0,
"step": 784
},
{
"entropy": 0.8496356010437012,
"epoch": 1.9146341463414633,
"grad_norm": 0.1904105544090271,
"learning_rate": 4.878048780487805e-07,
"loss": 0.8492,
"mean_token_accuracy": 0.7327806949615479,
"num_tokens": 10526527.0,
"step": 785
},
{
"entropy": 0.8355883359909058,
"epoch": 1.9170731707317072,
"grad_norm": 0.20292788743972778,
"learning_rate": 4.7425474254742553e-07,
"loss": 0.8419,
"mean_token_accuracy": 0.7367938756942749,
"num_tokens": 10539643.0,
"step": 786
},
{
"entropy": 0.8364092111587524,
"epoch": 1.9195121951219511,
"grad_norm": 0.20216518640518188,
"learning_rate": 4.607046070460705e-07,
"loss": 0.819,
"mean_token_accuracy": 0.7400240302085876,
"num_tokens": 10552991.0,
"step": 787
},
{
"entropy": 0.8569232821464539,
"epoch": 1.921951219512195,
"grad_norm": 0.21923497319221497,
"learning_rate": 4.471544715447155e-07,
"loss": 0.8679,
"mean_token_accuracy": 0.7307437658309937,
"num_tokens": 10566600.0,
"step": 788
},
{
"entropy": 0.8531014323234558,
"epoch": 1.924390243902439,
"grad_norm": 0.20161768794059753,
"learning_rate": 4.336043360433605e-07,
"loss": 0.8558,
"mean_token_accuracy": 0.7282842397689819,
"num_tokens": 10580097.0,
"step": 789
},
{
"entropy": 0.8500542640686035,
"epoch": 1.9268292682926829,
"grad_norm": 0.187560573220253,
"learning_rate": 4.2005420054200547e-07,
"loss": 0.8403,
"mean_token_accuracy": 0.7343399524688721,
"num_tokens": 10593491.0,
"step": 790
},
{
"entropy": 0.8405550718307495,
"epoch": 1.9292682926829268,
"grad_norm": 0.19617001712322235,
"learning_rate": 4.0650406504065046e-07,
"loss": 0.8227,
"mean_token_accuracy": 0.7386794090270996,
"num_tokens": 10606713.0,
"step": 791
},
{
"entropy": 0.8317885994911194,
"epoch": 1.9317073170731707,
"grad_norm": 0.20573502779006958,
"learning_rate": 3.929539295392954e-07,
"loss": 0.82,
"mean_token_accuracy": 0.7416048049926758,
"num_tokens": 10619802.0,
"step": 792
},
{
"entropy": 0.8333207368850708,
"epoch": 1.9341463414634146,
"grad_norm": 0.19632014632225037,
"learning_rate": 3.794037940379404e-07,
"loss": 0.8522,
"mean_token_accuracy": 0.7321804761886597,
"num_tokens": 10633581.0,
"step": 793
},
{
"entropy": 0.8593798875808716,
"epoch": 1.9365853658536585,
"grad_norm": 0.19296619296073914,
"learning_rate": 3.6585365853658536e-07,
"loss": 0.8544,
"mean_token_accuracy": 0.730027973651886,
"num_tokens": 10646828.0,
"step": 794
},
{
"entropy": 0.8579990267753601,
"epoch": 1.9390243902439024,
"grad_norm": 0.19028954207897186,
"learning_rate": 3.5230352303523034e-07,
"loss": 0.8397,
"mean_token_accuracy": 0.7340456247329712,
"num_tokens": 10660602.0,
"step": 795
},
{
"entropy": 0.8487682938575745,
"epoch": 1.9414634146341463,
"grad_norm": 0.2062513530254364,
"learning_rate": 3.3875338753387533e-07,
"loss": 0.8554,
"mean_token_accuracy": 0.736031711101532,
"num_tokens": 10673737.0,
"step": 796
},
{
"entropy": 0.8565185070037842,
"epoch": 1.9439024390243902,
"grad_norm": 0.22061142325401306,
"learning_rate": 3.2520325203252037e-07,
"loss": 0.8529,
"mean_token_accuracy": 0.7323763966560364,
"num_tokens": 10686293.0,
"step": 797
},
{
"entropy": 0.84625244140625,
"epoch": 1.946341463414634,
"grad_norm": 0.213920459151268,
"learning_rate": 3.1165311653116535e-07,
"loss": 0.8391,
"mean_token_accuracy": 0.7343069314956665,
"num_tokens": 10699388.0,
"step": 798
},
{
"entropy": 0.862379789352417,
"epoch": 1.948780487804878,
"grad_norm": 0.2047111839056015,
"learning_rate": 2.9810298102981034e-07,
"loss": 0.865,
"mean_token_accuracy": 0.7316440939903259,
"num_tokens": 10713296.0,
"step": 799
},
{
"entropy": 0.8566243648529053,
"epoch": 1.951219512195122,
"grad_norm": 0.19687318801879883,
"learning_rate": 2.845528455284553e-07,
"loss": 0.841,
"mean_token_accuracy": 0.7335733771324158,
"num_tokens": 10726644.0,
"step": 800
},
{
"entropy": 0.8384063243865967,
"epoch": 1.9536585365853658,
"grad_norm": 0.18069839477539062,
"learning_rate": 2.710027100271003e-07,
"loss": 0.8471,
"mean_token_accuracy": 0.7319970726966858,
"num_tokens": 10740380.0,
"step": 801
},
{
"entropy": 0.8644918203353882,
"epoch": 1.9560975609756097,
"grad_norm": 0.19222773611545563,
"learning_rate": 2.574525745257453e-07,
"loss": 0.8728,
"mean_token_accuracy": 0.728790283203125,
"num_tokens": 10753515.0,
"step": 802
},
{
"entropy": 0.8495630025863647,
"epoch": 1.9585365853658536,
"grad_norm": 0.19031932950019836,
"learning_rate": 2.439024390243903e-07,
"loss": 0.8469,
"mean_token_accuracy": 0.7325720191001892,
"num_tokens": 10766929.0,
"step": 803
},
{
"entropy": 0.8337970972061157,
"epoch": 1.9609756097560975,
"grad_norm": 0.20217815041542053,
"learning_rate": 2.3035230352303526e-07,
"loss": 0.8368,
"mean_token_accuracy": 0.7349351644515991,
"num_tokens": 10779972.0,
"step": 804
},
{
"entropy": 0.8449347019195557,
"epoch": 1.9634146341463414,
"grad_norm": 0.1968362182378769,
"learning_rate": 2.1680216802168024e-07,
"loss": 0.8309,
"mean_token_accuracy": 0.7364509701728821,
"num_tokens": 10793310.0,
"step": 805
},
{
"entropy": 0.8543494939804077,
"epoch": 1.9658536585365853,
"grad_norm": 0.19359824061393738,
"learning_rate": 2.0325203252032523e-07,
"loss": 0.8437,
"mean_token_accuracy": 0.7330183386802673,
"num_tokens": 10806870.0,
"step": 806
},
{
"entropy": 0.8296524882316589,
"epoch": 1.9682926829268292,
"grad_norm": 0.19010023772716522,
"learning_rate": 1.897018970189702e-07,
"loss": 0.825,
"mean_token_accuracy": 0.743084192276001,
"num_tokens": 10820225.0,
"step": 807
},
{
"entropy": 0.8526460528373718,
"epoch": 1.9707317073170731,
"grad_norm": 0.19789716601371765,
"learning_rate": 1.7615176151761517e-07,
"loss": 0.8656,
"mean_token_accuracy": 0.7355901002883911,
"num_tokens": 10833357.0,
"step": 808
},
{
"entropy": 0.8426751494407654,
"epoch": 1.973170731707317,
"grad_norm": 0.20161619782447815,
"learning_rate": 1.6260162601626018e-07,
"loss": 0.8276,
"mean_token_accuracy": 0.7407682538032532,
"num_tokens": 10846832.0,
"step": 809
},
{
"entropy": 0.855075478553772,
"epoch": 1.975609756097561,
"grad_norm": 0.21478648483753204,
"learning_rate": 1.4905149051490517e-07,
"loss": 0.8653,
"mean_token_accuracy": 0.7304821014404297,
"num_tokens": 10859708.0,
"step": 810
},
{
"entropy": 0.8732905387878418,
"epoch": 1.9780487804878049,
"grad_norm": 0.19577589631080627,
"learning_rate": 1.3550135501355015e-07,
"loss": 0.8699,
"mean_token_accuracy": 0.7293443083763123,
"num_tokens": 10873328.0,
"step": 811
},
{
"entropy": 0.8290870189666748,
"epoch": 1.9804878048780488,
"grad_norm": 0.22332845628261566,
"learning_rate": 1.2195121951219514e-07,
"loss": 0.8305,
"mean_token_accuracy": 0.7437856793403625,
"num_tokens": 10886298.0,
"step": 812
},
{
"entropy": 0.8486424088478088,
"epoch": 1.9829268292682927,
"grad_norm": 0.1950785368680954,
"learning_rate": 1.0840108401084012e-07,
"loss": 0.8481,
"mean_token_accuracy": 0.7326783537864685,
"num_tokens": 10899953.0,
"step": 813
},
{
"entropy": 0.8452553749084473,
"epoch": 1.9853658536585366,
"grad_norm": 0.19996321201324463,
"learning_rate": 9.48509485094851e-08,
"loss": 0.8512,
"mean_token_accuracy": 0.7341687083244324,
"num_tokens": 10913376.0,
"step": 814
},
{
"entropy": 0.8601592183113098,
"epoch": 1.9878048780487805,
"grad_norm": 0.19899865984916687,
"learning_rate": 8.130081300813009e-08,
"loss": 0.8585,
"mean_token_accuracy": 0.7343636751174927,
"num_tokens": 10927174.0,
"step": 815
},
{
"entropy": 0.8372820019721985,
"epoch": 1.9902439024390244,
"grad_norm": 0.19347034394741058,
"learning_rate": 6.775067750677508e-08,
"loss": 0.8281,
"mean_token_accuracy": 0.7355829477310181,
"num_tokens": 10940733.0,
"step": 816
},
{
"entropy": 0.8477611541748047,
"epoch": 1.9926829268292683,
"grad_norm": 0.19224300980567932,
"learning_rate": 5.420054200542006e-08,
"loss": 0.8319,
"mean_token_accuracy": 0.7393810749053955,
"num_tokens": 10953933.0,
"step": 817
},
{
"entropy": 0.8453364372253418,
"epoch": 1.9951219512195122,
"grad_norm": 0.18883691728115082,
"learning_rate": 4.0650406504065046e-08,
"loss": 0.8244,
"mean_token_accuracy": 0.7396546602249146,
"num_tokens": 10967385.0,
"step": 818
},
{
"entropy": 0.8373251557350159,
"epoch": 1.997560975609756,
"grad_norm": 0.20955298840999603,
"learning_rate": 2.710027100271003e-08,
"loss": 0.8206,
"mean_token_accuracy": 0.74117112159729,
"num_tokens": 10980568.0,
"step": 819
},
{
"entropy": 0.8374952673912048,
"epoch": 2.0,
"grad_norm": 0.18724212050437927,
"learning_rate": 1.3550135501355015e-08,
"loss": 0.8354,
"mean_token_accuracy": 0.7327674627304077,
"num_tokens": 10994250.0,
"step": 820
},
{
"epoch": 2.0,
"step": 820,
"total_flos": 1.0323202908744581e+18,
"train_loss": 1.0359788402551557,
"train_runtime": 4829.1249,
"train_samples_per_second": 2.713,
"train_steps_per_second": 0.17
}
],
"logging_steps": 1,
"max_steps": 820,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.0323202908744581e+18,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}