{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 5697, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.5241050124168396, "epoch": 0.000526592943654555, "grad_norm": 111.6484146118164, "learning_rate": 0.0, "loss": 7.630620002746582, "mean_token_accuracy": 0.16127368062734604, "num_tokens": 12336.0, "step": 1 }, { "entropy": 1.5055236518383026, "epoch": 0.00105318588730911, "grad_norm": 111.12712097167969, "learning_rate": 5.012531328320802e-07, "loss": 7.332417964935303, "mean_token_accuracy": 0.17185717076063156, "num_tokens": 24672.0, "step": 2 }, { "entropy": 1.5026952624320984, "epoch": 0.001579778830963665, "grad_norm": 112.11380767822266, "learning_rate": 1.0025062656641603e-06, "loss": 7.473679542541504, "mean_token_accuracy": 0.1643187664449215, "num_tokens": 37008.0, "step": 3 }, { "entropy": 1.5194158256053925, "epoch": 0.00210637177461822, "grad_norm": 114.23673248291016, "learning_rate": 1.5037593984962406e-06, "loss": 7.426502704620361, "mean_token_accuracy": 0.1571561936289072, "num_tokens": 49344.0, "step": 4 }, { "entropy": 1.496931940317154, "epoch": 0.0026329647182727752, "grad_norm": 118.40357208251953, "learning_rate": 2.0050125313283207e-06, "loss": 7.894323348999023, "mean_token_accuracy": 0.1548401154577732, "num_tokens": 61680.0, "step": 5 }, { "entropy": 1.5049863159656525, "epoch": 0.00315955766192733, "grad_norm": 104.21913146972656, "learning_rate": 2.506265664160401e-06, "loss": 6.593452453613281, "mean_token_accuracy": 0.20564104989171028, "num_tokens": 74016.0, "step": 6 }, { "entropy": 1.4925725162029266, "epoch": 0.003686150605581885, "grad_norm": 114.10234069824219, "learning_rate": 3.007518796992481e-06, "loss": 7.3693318367004395, "mean_token_accuracy": 0.16597539372742176, "num_tokens": 86352.0, "step": 7 }, { "entropy": 1.5191607773303986, "epoch": 0.00421274354923644, "grad_norm": 115.99723815917969, "learning_rate": 3.5087719298245615e-06, "loss": 7.358461856842041, "mean_token_accuracy": 0.16679511591792107, "num_tokens": 98688.0, "step": 8 }, { "entropy": 1.5183644592761993, "epoch": 0.004739336492890996, "grad_norm": 106.1409912109375, "learning_rate": 4.010025062656641e-06, "loss": 6.668917655944824, "mean_token_accuracy": 0.18950679898262024, "num_tokens": 111024.0, "step": 9 }, { "entropy": 1.5116282999515533, "epoch": 0.0052659294365455505, "grad_norm": 110.57721710205078, "learning_rate": 4.511278195488722e-06, "loss": 6.99241304397583, "mean_token_accuracy": 0.18210845813155174, "num_tokens": 123360.0, "step": 10 }, { "entropy": 1.5269342362880707, "epoch": 0.005792522380200105, "grad_norm": 120.43307495117188, "learning_rate": 5.012531328320802e-06, "loss": 7.586757659912109, "mean_token_accuracy": 0.1462114453315735, "num_tokens": 135696.0, "step": 11 }, { "entropy": 1.5252384543418884, "epoch": 0.00631911532385466, "grad_norm": 111.8587875366211, "learning_rate": 5.5137844611528826e-06, "loss": 7.363627910614014, "mean_token_accuracy": 0.17107644863426685, "num_tokens": 148032.0, "step": 12 }, { "entropy": 1.5224651992321014, "epoch": 0.006845708267509215, "grad_norm": 107.8873291015625, "learning_rate": 6.015037593984962e-06, "loss": 6.356827735900879, "mean_token_accuracy": 0.19671257957816124, "num_tokens": 160368.0, "step": 13 }, { "entropy": 1.5416274964809418, "epoch": 0.00737230121116377, "grad_norm": 115.19085693359375, "learning_rate": 6.516290726817042e-06, "loss": 6.221941947937012, "mean_token_accuracy": 0.2142542451620102, "num_tokens": 172704.0, "step": 14 }, { "entropy": 1.5107212960720062, "epoch": 0.007898894154818325, "grad_norm": 110.73648834228516, "learning_rate": 7.017543859649123e-06, "loss": 6.397078514099121, "mean_token_accuracy": 0.20885847136378288, "num_tokens": 185040.0, "step": 15 }, { "entropy": 1.5597798526287079, "epoch": 0.00842548709847288, "grad_norm": 99.72173309326172, "learning_rate": 7.518796992481203e-06, "loss": 5.646764278411865, "mean_token_accuracy": 0.24349310994148254, "num_tokens": 197376.0, "step": 16 }, { "entropy": 1.5534575581550598, "epoch": 0.008952080042127435, "grad_norm": 104.43334197998047, "learning_rate": 8.020050125313283e-06, "loss": 5.892775535583496, "mean_token_accuracy": 0.22073492035269737, "num_tokens": 209712.0, "step": 17 }, { "entropy": 1.5676631033420563, "epoch": 0.009478672985781991, "grad_norm": 99.27777099609375, "learning_rate": 8.521303258145363e-06, "loss": 5.239416599273682, "mean_token_accuracy": 0.26043422892689705, "num_tokens": 222048.0, "step": 18 }, { "entropy": 1.5712612569332123, "epoch": 0.010005265929436546, "grad_norm": 94.56501770019531, "learning_rate": 9.022556390977444e-06, "loss": 5.018033981323242, "mean_token_accuracy": 0.2874941825866699, "num_tokens": 234384.0, "step": 19 }, { "entropy": 1.5856993794441223, "epoch": 0.010531858873091101, "grad_norm": 103.30012512207031, "learning_rate": 9.523809523809523e-06, "loss": 5.112401485443115, "mean_token_accuracy": 0.26686083525419235, "num_tokens": 246720.0, "step": 20 }, { "entropy": 1.542406052350998, "epoch": 0.011058451816745656, "grad_norm": 73.81751251220703, "learning_rate": 1.0025062656641604e-05, "loss": 3.298715353012085, "mean_token_accuracy": 0.42641731351614, "num_tokens": 259056.0, "step": 21 }, { "entropy": 1.5376673340797424, "epoch": 0.01158504476040021, "grad_norm": 74.847900390625, "learning_rate": 1.0526315789473684e-05, "loss": 3.5809030532836914, "mean_token_accuracy": 0.40752222388982773, "num_tokens": 271392.0, "step": 22 }, { "entropy": 1.548084020614624, "epoch": 0.012111637704054766, "grad_norm": 63.552825927734375, "learning_rate": 1.1027568922305765e-05, "loss": 3.100147247314453, "mean_token_accuracy": 0.45311493426561356, "num_tokens": 283728.0, "step": 23 }, { "entropy": 1.5953525304794312, "epoch": 0.01263823064770932, "grad_norm": 60.015655517578125, "learning_rate": 1.1528822055137844e-05, "loss": 2.783557176589966, "mean_token_accuracy": 0.47465962916612625, "num_tokens": 296064.0, "step": 24 }, { "entropy": 1.5308564603328705, "epoch": 0.013164823591363875, "grad_norm": 40.24797821044922, "learning_rate": 1.2030075187969925e-05, "loss": 2.171975612640381, "mean_token_accuracy": 0.5734862834215164, "num_tokens": 308400.0, "step": 25 }, { "entropy": 1.5149377882480621, "epoch": 0.01369141653501843, "grad_norm": 31.702476501464844, "learning_rate": 1.2531328320802006e-05, "loss": 1.907788634300232, "mean_token_accuracy": 0.6134172528982162, "num_tokens": 320736.0, "step": 26 }, { "entropy": 1.4917882978916168, "epoch": 0.014218009478672985, "grad_norm": 20.41485023498535, "learning_rate": 1.3032581453634085e-05, "loss": 1.6917057037353516, "mean_token_accuracy": 0.6387842893600464, "num_tokens": 333072.0, "step": 27 }, { "entropy": 1.4882407486438751, "epoch": 0.01474460242232754, "grad_norm": 15.065500259399414, "learning_rate": 1.3533834586466165e-05, "loss": 1.4968407154083252, "mean_token_accuracy": 0.6677049100399017, "num_tokens": 345408.0, "step": 28 }, { "entropy": 1.4370096921920776, "epoch": 0.015271195365982097, "grad_norm": 10.740882873535156, "learning_rate": 1.4035087719298246e-05, "loss": 1.3545355796813965, "mean_token_accuracy": 0.698340117931366, "num_tokens": 357744.0, "step": 29 }, { "entropy": 1.341864824295044, "epoch": 0.01579778830963665, "grad_norm": 3.3069381713867188, "learning_rate": 1.4536340852130325e-05, "loss": 1.0850293636322021, "mean_token_accuracy": 0.7386660128831863, "num_tokens": 370080.0, "step": 30 }, { "entropy": 1.4095737040042877, "epoch": 0.016324381253291206, "grad_norm": 2.9421474933624268, "learning_rate": 1.5037593984962406e-05, "loss": 1.1328743696212769, "mean_token_accuracy": 0.7404871881008148, "num_tokens": 382416.0, "step": 31 }, { "entropy": 1.4024023413658142, "epoch": 0.01685097419694576, "grad_norm": 2.5040762424468994, "learning_rate": 1.5538847117794486e-05, "loss": 1.1228951215744019, "mean_token_accuracy": 0.7428316622972488, "num_tokens": 394752.0, "step": 32 }, { "entropy": 1.3549567759037018, "epoch": 0.017377567140600316, "grad_norm": 1.7973337173461914, "learning_rate": 1.6040100250626565e-05, "loss": 1.0077903270721436, "mean_token_accuracy": 0.766022652387619, "num_tokens": 407088.0, "step": 33 }, { "entropy": 1.3836270570755005, "epoch": 0.01790416008425487, "grad_norm": 1.7406286001205444, "learning_rate": 1.6541353383458648e-05, "loss": 1.0222362279891968, "mean_token_accuracy": 0.7626231610774994, "num_tokens": 419424.0, "step": 34 }, { "entropy": 1.3947510421276093, "epoch": 0.018430753027909426, "grad_norm": 1.8865187168121338, "learning_rate": 1.7042606516290727e-05, "loss": 1.0371894836425781, "mean_token_accuracy": 0.7562028616666794, "num_tokens": 431760.0, "step": 35 }, { "entropy": 1.3465319573879242, "epoch": 0.018957345971563982, "grad_norm": 1.7011761665344238, "learning_rate": 1.7543859649122806e-05, "loss": 0.9494946599006653, "mean_token_accuracy": 0.7783531844615936, "num_tokens": 444096.0, "step": 36 }, { "entropy": 1.4580606818199158, "epoch": 0.019483938915218536, "grad_norm": 1.9021601676940918, "learning_rate": 1.8045112781954888e-05, "loss": 1.0398352146148682, "mean_token_accuracy": 0.7636931091547012, "num_tokens": 456432.0, "step": 37 }, { "entropy": 1.4095810949802399, "epoch": 0.020010531858873092, "grad_norm": 1.6176142692565918, "learning_rate": 1.8546365914786967e-05, "loss": 0.9648343324661255, "mean_token_accuracy": 0.763045608997345, "num_tokens": 468768.0, "step": 38 }, { "entropy": 1.4290408492088318, "epoch": 0.020537124802527645, "grad_norm": 1.802105188369751, "learning_rate": 1.9047619047619046e-05, "loss": 0.9583951234817505, "mean_token_accuracy": 0.7706119865179062, "num_tokens": 481104.0, "step": 39 }, { "entropy": 1.4769366383552551, "epoch": 0.021063717746182202, "grad_norm": 1.8512225151062012, "learning_rate": 1.954887218045113e-05, "loss": 1.0114065408706665, "mean_token_accuracy": 0.7521056234836578, "num_tokens": 493440.0, "step": 40 }, { "entropy": 1.508185237646103, "epoch": 0.021590310689836755, "grad_norm": 2.076702356338501, "learning_rate": 2.0050125313283208e-05, "loss": 0.9636508226394653, "mean_token_accuracy": 0.7661653459072113, "num_tokens": 505776.0, "step": 41 }, { "entropy": 1.459254652261734, "epoch": 0.022116903633491312, "grad_norm": 2.349229335784912, "learning_rate": 2.0551378446115287e-05, "loss": 0.9206173419952393, "mean_token_accuracy": 0.7662864923477173, "num_tokens": 518112.0, "step": 42 }, { "entropy": 1.5238048434257507, "epoch": 0.022643496577145865, "grad_norm": 2.185512065887451, "learning_rate": 2.105263157894737e-05, "loss": 0.9314085245132446, "mean_token_accuracy": 0.7649829983711243, "num_tokens": 530448.0, "step": 43 }, { "entropy": 1.5003608763217926, "epoch": 0.02317008952080042, "grad_norm": 2.0811667442321777, "learning_rate": 2.1553884711779448e-05, "loss": 0.8671697974205017, "mean_token_accuracy": 0.7754391133785248, "num_tokens": 542784.0, "step": 44 }, { "entropy": 1.591546893119812, "epoch": 0.023696682464454975, "grad_norm": 2.0840373039245605, "learning_rate": 2.205513784461153e-05, "loss": 0.872833251953125, "mean_token_accuracy": 0.7740741670131683, "num_tokens": 555120.0, "step": 45 }, { "entropy": 1.6416102647781372, "epoch": 0.02422327540810953, "grad_norm": 2.033761501312256, "learning_rate": 2.255639097744361e-05, "loss": 0.8919705152511597, "mean_token_accuracy": 0.7629313617944717, "num_tokens": 567456.0, "step": 46 }, { "entropy": 1.6393465399742126, "epoch": 0.024749868351764088, "grad_norm": 1.7740504741668701, "learning_rate": 2.3057644110275688e-05, "loss": 0.8117689490318298, "mean_token_accuracy": 0.7816901206970215, "num_tokens": 579792.0, "step": 47 }, { "entropy": 1.6808819770812988, "epoch": 0.02527646129541864, "grad_norm": 1.4741381406784058, "learning_rate": 2.355889724310777e-05, "loss": 0.8110437393188477, "mean_token_accuracy": 0.7762878388166428, "num_tokens": 592128.0, "step": 48 }, { "entropy": 1.7813679873943329, "epoch": 0.025803054239073198, "grad_norm": 1.135923147201538, "learning_rate": 2.406015037593985e-05, "loss": 0.8597409129142761, "mean_token_accuracy": 0.7689527124166489, "num_tokens": 604464.0, "step": 49 }, { "entropy": 1.7125210165977478, "epoch": 0.02632964718272775, "grad_norm": 1.0037126541137695, "learning_rate": 2.456140350877193e-05, "loss": 0.7560303807258606, "mean_token_accuracy": 0.7888963371515274, "num_tokens": 616800.0, "step": 50 }, { "entropy": 1.7505145072937012, "epoch": 0.026856240126382307, "grad_norm": 0.9906253218650818, "learning_rate": 2.506265664160401e-05, "loss": 0.7666164636611938, "mean_token_accuracy": 0.7822892367839813, "num_tokens": 629136.0, "step": 51 }, { "entropy": 1.8206515610218048, "epoch": 0.02738283307003686, "grad_norm": 1.0637407302856445, "learning_rate": 2.556390977443609e-05, "loss": 0.7570075988769531, "mean_token_accuracy": 0.7857469767332077, "num_tokens": 641472.0, "step": 52 }, { "entropy": 1.9179592430591583, "epoch": 0.027909426013691417, "grad_norm": 0.994309663772583, "learning_rate": 2.606516290726817e-05, "loss": 0.8264732956886292, "mean_token_accuracy": 0.7659910470247269, "num_tokens": 653808.0, "step": 53 }, { "entropy": 1.8192859292030334, "epoch": 0.02843601895734597, "grad_norm": 1.283566951751709, "learning_rate": 2.656641604010025e-05, "loss": 0.7167642712593079, "mean_token_accuracy": 0.7935251444578171, "num_tokens": 666144.0, "step": 54 }, { "entropy": 1.8640032410621643, "epoch": 0.028962611901000527, "grad_norm": 0.993376612663269, "learning_rate": 2.706766917293233e-05, "loss": 0.732735276222229, "mean_token_accuracy": 0.7889553904533386, "num_tokens": 678480.0, "step": 55 }, { "entropy": 1.9309577941894531, "epoch": 0.02948920484465508, "grad_norm": 0.952996551990509, "learning_rate": 2.756892230576441e-05, "loss": 0.7183045148849487, "mean_token_accuracy": 0.7865996956825256, "num_tokens": 690816.0, "step": 56 }, { "entropy": 1.9969252347946167, "epoch": 0.030015797788309637, "grad_norm": 0.9141530990600586, "learning_rate": 2.8070175438596492e-05, "loss": 0.7127647399902344, "mean_token_accuracy": 0.7965414077043533, "num_tokens": 703152.0, "step": 57 }, { "entropy": 1.9162320494651794, "epoch": 0.030542390731964193, "grad_norm": 1.0311601161956787, "learning_rate": 2.857142857142857e-05, "loss": 0.6988133788108826, "mean_token_accuracy": 0.7964022308588028, "num_tokens": 715488.0, "step": 58 }, { "entropy": 1.9365825355052948, "epoch": 0.031068983675618746, "grad_norm": 0.8333176374435425, "learning_rate": 2.907268170426065e-05, "loss": 0.6844547986984253, "mean_token_accuracy": 0.8021096438169479, "num_tokens": 727824.0, "step": 59 }, { "entropy": 1.9246950447559357, "epoch": 0.0315955766192733, "grad_norm": 0.8664101362228394, "learning_rate": 2.9573934837092732e-05, "loss": 0.6528723239898682, "mean_token_accuracy": 0.8053467720746994, "num_tokens": 740160.0, "step": 60 }, { "entropy": 1.929794728755951, "epoch": 0.032122169562927856, "grad_norm": 0.9577063918113708, "learning_rate": 3.007518796992481e-05, "loss": 0.678918719291687, "mean_token_accuracy": 0.7989283800125122, "num_tokens": 752496.0, "step": 61 }, { "entropy": 1.826391577720642, "epoch": 0.03264876250658241, "grad_norm": 0.8492108583450317, "learning_rate": 3.0576441102756894e-05, "loss": 0.6723799109458923, "mean_token_accuracy": 0.7983379364013672, "num_tokens": 764832.0, "step": 62 }, { "entropy": 1.9241991639137268, "epoch": 0.03317535545023697, "grad_norm": 0.928464412689209, "learning_rate": 3.107769423558897e-05, "loss": 0.6530962586402893, "mean_token_accuracy": 0.8008216470479965, "num_tokens": 777168.0, "step": 63 }, { "entropy": 1.8967448770999908, "epoch": 0.03370194839389152, "grad_norm": 1.0670896768569946, "learning_rate": 3.157894736842105e-05, "loss": 0.6292267441749573, "mean_token_accuracy": 0.8003135621547699, "num_tokens": 789504.0, "step": 64 }, { "entropy": 1.8847980499267578, "epoch": 0.034228541337546076, "grad_norm": 1.0110414028167725, "learning_rate": 3.208020050125313e-05, "loss": 0.6133747100830078, "mean_token_accuracy": 0.8148374855518341, "num_tokens": 801840.0, "step": 65 }, { "entropy": 1.930319905281067, "epoch": 0.03475513428120063, "grad_norm": 1.023224949836731, "learning_rate": 3.258145363408521e-05, "loss": 0.6123053431510925, "mean_token_accuracy": 0.8167780637741089, "num_tokens": 814176.0, "step": 66 }, { "entropy": 1.9471323192119598, "epoch": 0.03528172722485519, "grad_norm": 1.1810884475708008, "learning_rate": 3.3082706766917295e-05, "loss": 0.6039740443229675, "mean_token_accuracy": 0.8179137706756592, "num_tokens": 826512.0, "step": 67 }, { "entropy": 1.8890258967876434, "epoch": 0.03580832016850974, "grad_norm": 0.9907887578010559, "learning_rate": 3.3583959899749374e-05, "loss": 0.599247932434082, "mean_token_accuracy": 0.8207112550735474, "num_tokens": 838848.0, "step": 68 }, { "entropy": 1.9326116144657135, "epoch": 0.036334913112164295, "grad_norm": 1.0037294626235962, "learning_rate": 3.4085213032581453e-05, "loss": 0.5630755424499512, "mean_token_accuracy": 0.8216072916984558, "num_tokens": 851184.0, "step": 69 }, { "entropy": 1.925311028957367, "epoch": 0.03686150605581885, "grad_norm": 1.1875734329223633, "learning_rate": 3.458646616541353e-05, "loss": 0.5733011364936829, "mean_token_accuracy": 0.8164849728345871, "num_tokens": 863520.0, "step": 70 }, { "entropy": 2.051402121782303, "epoch": 0.03738809899947341, "grad_norm": 1.162881851196289, "learning_rate": 3.508771929824561e-05, "loss": 0.550703763961792, "mean_token_accuracy": 0.8178133964538574, "num_tokens": 875856.0, "step": 71 }, { "entropy": 1.9634678363800049, "epoch": 0.037914691943127965, "grad_norm": 0.9865695834159851, "learning_rate": 3.55889724310777e-05, "loss": 0.5769374966621399, "mean_token_accuracy": 0.8114093840122223, "num_tokens": 888192.0, "step": 72 }, { "entropy": 1.9920983016490936, "epoch": 0.038441284886782515, "grad_norm": 1.0162739753723145, "learning_rate": 3.6090225563909776e-05, "loss": 0.5818509459495544, "mean_token_accuracy": 0.8134536445140839, "num_tokens": 900528.0, "step": 73 }, { "entropy": 1.9029254913330078, "epoch": 0.03896787783043707, "grad_norm": 0.9538004398345947, "learning_rate": 3.6591478696741855e-05, "loss": 0.5178959369659424, "mean_token_accuracy": 0.8257192969322205, "num_tokens": 912864.0, "step": 74 }, { "entropy": 1.967795580625534, "epoch": 0.03949447077409163, "grad_norm": 0.9578227996826172, "learning_rate": 3.7092731829573934e-05, "loss": 0.5342862010002136, "mean_token_accuracy": 0.8278465121984482, "num_tokens": 925200.0, "step": 75 }, { "entropy": 1.9465965926647186, "epoch": 0.040021063717746184, "grad_norm": 1.0253666639328003, "learning_rate": 3.759398496240601e-05, "loss": 0.5030800104141235, "mean_token_accuracy": 0.83804552257061, "num_tokens": 937536.0, "step": 76 }, { "entropy": 1.8636894226074219, "epoch": 0.040547656661400734, "grad_norm": 0.8184434771537781, "learning_rate": 3.809523809523809e-05, "loss": 0.45680901408195496, "mean_token_accuracy": 0.8485544174909592, "num_tokens": 949872.0, "step": 77 }, { "entropy": 1.928781270980835, "epoch": 0.04107424960505529, "grad_norm": 0.8536883592605591, "learning_rate": 3.859649122807018e-05, "loss": 0.4830615818500519, "mean_token_accuracy": 0.8397646248340607, "num_tokens": 962208.0, "step": 78 }, { "entropy": 1.8684503734111786, "epoch": 0.04160084254870985, "grad_norm": 0.868567168712616, "learning_rate": 3.909774436090226e-05, "loss": 0.49555566906929016, "mean_token_accuracy": 0.8393678069114685, "num_tokens": 974544.0, "step": 79 }, { "entropy": 1.832389086484909, "epoch": 0.042127435492364404, "grad_norm": 0.7834892868995667, "learning_rate": 3.9598997493734336e-05, "loss": 0.4530882239341736, "mean_token_accuracy": 0.8548341691493988, "num_tokens": 986880.0, "step": 80 }, { "entropy": 1.8249096870422363, "epoch": 0.04265402843601896, "grad_norm": 0.7752470374107361, "learning_rate": 4.0100250626566415e-05, "loss": 0.4578617215156555, "mean_token_accuracy": 0.8508521616458893, "num_tokens": 999216.0, "step": 81 }, { "entropy": 1.9078024625778198, "epoch": 0.04318062137967351, "grad_norm": 0.7781356573104858, "learning_rate": 4.0601503759398494e-05, "loss": 0.43578821420669556, "mean_token_accuracy": 0.8600046187639236, "num_tokens": 1011552.0, "step": 82 }, { "entropy": 1.8074560463428497, "epoch": 0.04370721432332807, "grad_norm": 0.7703754305839539, "learning_rate": 4.110275689223057e-05, "loss": 0.4543125629425049, "mean_token_accuracy": 0.8561971783638, "num_tokens": 1023888.0, "step": 83 }, { "entropy": 1.7470267415046692, "epoch": 0.044233807266982623, "grad_norm": 0.6839037537574768, "learning_rate": 4.160401002506266e-05, "loss": 0.4043883681297302, "mean_token_accuracy": 0.8632047474384308, "num_tokens": 1036224.0, "step": 84 }, { "entropy": 1.8056954443454742, "epoch": 0.04476040021063718, "grad_norm": 0.8745210766792297, "learning_rate": 4.210526315789474e-05, "loss": 0.4576418101787567, "mean_token_accuracy": 0.8515569567680359, "num_tokens": 1048560.0, "step": 85 }, { "entropy": 1.7271961271762848, "epoch": 0.04528699315429173, "grad_norm": 0.7987569570541382, "learning_rate": 4.260651629072682e-05, "loss": 0.4062059819698334, "mean_token_accuracy": 0.8644601851701736, "num_tokens": 1060896.0, "step": 86 }, { "entropy": 1.7829216122627258, "epoch": 0.045813586097946286, "grad_norm": 0.8260216116905212, "learning_rate": 4.3107769423558896e-05, "loss": 0.4285086989402771, "mean_token_accuracy": 0.8619498312473297, "num_tokens": 1073232.0, "step": 87 }, { "entropy": 1.720045566558838, "epoch": 0.04634017904160084, "grad_norm": 0.8638037443161011, "learning_rate": 4.3609022556390975e-05, "loss": 0.42514118552207947, "mean_token_accuracy": 0.8556364923715591, "num_tokens": 1085568.0, "step": 88 }, { "entropy": 1.749743402004242, "epoch": 0.0468667719852554, "grad_norm": 0.6750407218933105, "learning_rate": 4.411027568922306e-05, "loss": 0.3981553912162781, "mean_token_accuracy": 0.8708555996417999, "num_tokens": 1097904.0, "step": 89 }, { "entropy": 1.785173624753952, "epoch": 0.04739336492890995, "grad_norm": 0.7802124619483948, "learning_rate": 4.461152882205514e-05, "loss": 0.3845086097717285, "mean_token_accuracy": 0.8747637271881104, "num_tokens": 1110240.0, "step": 90 }, { "entropy": 1.7087633907794952, "epoch": 0.047919957872564506, "grad_norm": 0.8488918542861938, "learning_rate": 4.511278195488722e-05, "loss": 0.3644571006298065, "mean_token_accuracy": 0.8757548332214355, "num_tokens": 1122576.0, "step": 91 }, { "entropy": 1.6821248829364777, "epoch": 0.04844655081621906, "grad_norm": 0.7744936943054199, "learning_rate": 4.56140350877193e-05, "loss": 0.40767285227775574, "mean_token_accuracy": 0.8596755862236023, "num_tokens": 1134912.0, "step": 92 }, { "entropy": 1.7099383771419525, "epoch": 0.04897314375987362, "grad_norm": 0.9390520453453064, "learning_rate": 4.6115288220551377e-05, "loss": 0.4450380802154541, "mean_token_accuracy": 0.8517685830593109, "num_tokens": 1147248.0, "step": 93 }, { "entropy": 1.6644540429115295, "epoch": 0.049499736703528176, "grad_norm": 0.9382246136665344, "learning_rate": 4.6616541353383456e-05, "loss": 0.37574899196624756, "mean_token_accuracy": 0.8736520707607269, "num_tokens": 1159584.0, "step": 94 }, { "entropy": 1.7045432031154633, "epoch": 0.050026329647182725, "grad_norm": 0.784248948097229, "learning_rate": 4.711779448621554e-05, "loss": 0.39656203985214233, "mean_token_accuracy": 0.8673653900623322, "num_tokens": 1171920.0, "step": 95 }, { "entropy": 1.6858630180358887, "epoch": 0.05055292259083728, "grad_norm": 0.7153828144073486, "learning_rate": 4.761904761904762e-05, "loss": 0.3821033835411072, "mean_token_accuracy": 0.870804488658905, "num_tokens": 1184256.0, "step": 96 }, { "entropy": 1.5798078775405884, "epoch": 0.05107951553449184, "grad_norm": 0.6857785582542419, "learning_rate": 4.81203007518797e-05, "loss": 0.3593214452266693, "mean_token_accuracy": 0.8746844828128815, "num_tokens": 1196592.0, "step": 97 }, { "entropy": 1.670957088470459, "epoch": 0.051606108478146395, "grad_norm": 0.7506043910980225, "learning_rate": 4.862155388471178e-05, "loss": 0.3727911412715912, "mean_token_accuracy": 0.8756437748670578, "num_tokens": 1208928.0, "step": 98 }, { "entropy": 1.5233455896377563, "epoch": 0.052132701421800945, "grad_norm": 0.7735759019851685, "learning_rate": 4.912280701754386e-05, "loss": 0.37093132734298706, "mean_token_accuracy": 0.8704032748937607, "num_tokens": 1221264.0, "step": 99 }, { "entropy": 1.6192973852157593, "epoch": 0.0526592943654555, "grad_norm": 0.7478036880493164, "learning_rate": 4.9624060150375936e-05, "loss": 0.3426092863082886, "mean_token_accuracy": 0.8861435055732727, "num_tokens": 1233600.0, "step": 100 }, { "entropy": 1.493833750486374, "epoch": 0.05318588730911006, "grad_norm": 0.7044211030006409, "learning_rate": 5.012531328320802e-05, "loss": 0.35205507278442383, "mean_token_accuracy": 0.8778510093688965, "num_tokens": 1245936.0, "step": 101 }, { "entropy": 1.4939774870872498, "epoch": 0.053712480252764615, "grad_norm": 0.7720161080360413, "learning_rate": 5.06265664160401e-05, "loss": 0.3975054621696472, "mean_token_accuracy": 0.8641460090875626, "num_tokens": 1258272.0, "step": 102 }, { "entropy": 1.6101951897144318, "epoch": 0.05423907319641917, "grad_norm": 0.669315755367279, "learning_rate": 5.112781954887218e-05, "loss": 0.34713947772979736, "mean_token_accuracy": 0.8790434300899506, "num_tokens": 1270608.0, "step": 103 }, { "entropy": 1.5196483135223389, "epoch": 0.05476566614007372, "grad_norm": 0.8516085743904114, "learning_rate": 5.162907268170426e-05, "loss": 0.3601211607456207, "mean_token_accuracy": 0.8756401091814041, "num_tokens": 1282944.0, "step": 104 }, { "entropy": 1.4721749424934387, "epoch": 0.05529225908372828, "grad_norm": 0.8156314492225647, "learning_rate": 5.213032581453634e-05, "loss": 0.3697987198829651, "mean_token_accuracy": 0.8728637546300888, "num_tokens": 1295280.0, "step": 105 }, { "entropy": 1.4663786590099335, "epoch": 0.055818852027382834, "grad_norm": 0.6453195810317993, "learning_rate": 5.2631578947368424e-05, "loss": 0.3338157534599304, "mean_token_accuracy": 0.8864734172821045, "num_tokens": 1307616.0, "step": 106 }, { "entropy": 1.497151494026184, "epoch": 0.05634544497103739, "grad_norm": 0.7146667242050171, "learning_rate": 5.31328320802005e-05, "loss": 0.34923166036605835, "mean_token_accuracy": 0.8819292187690735, "num_tokens": 1319952.0, "step": 107 }, { "entropy": 1.5161625444889069, "epoch": 0.05687203791469194, "grad_norm": 0.8290141820907593, "learning_rate": 5.363408521303258e-05, "loss": 0.3371197581291199, "mean_token_accuracy": 0.8877773582935333, "num_tokens": 1332288.0, "step": 108 }, { "entropy": 1.4333459436893463, "epoch": 0.0573986308583465, "grad_norm": 0.8022440671920776, "learning_rate": 5.413533834586466e-05, "loss": 0.31702953577041626, "mean_token_accuracy": 0.8909593671560287, "num_tokens": 1344624.0, "step": 109 }, { "entropy": 1.4444147646427155, "epoch": 0.057925223802001054, "grad_norm": 0.7960955500602722, "learning_rate": 5.463659147869674e-05, "loss": 0.3525749742984772, "mean_token_accuracy": 0.8755318969488144, "num_tokens": 1356960.0, "step": 110 }, { "entropy": 1.469768613576889, "epoch": 0.05845181674565561, "grad_norm": 0.8183742165565491, "learning_rate": 5.513784461152882e-05, "loss": 0.3398601710796356, "mean_token_accuracy": 0.8840423971414566, "num_tokens": 1369296.0, "step": 111 }, { "entropy": 1.4481310844421387, "epoch": 0.05897840968931016, "grad_norm": 0.6801962852478027, "learning_rate": 5.5639097744360905e-05, "loss": 0.34869900345802307, "mean_token_accuracy": 0.877396434545517, "num_tokens": 1381632.0, "step": 112 }, { "entropy": 1.4586880207061768, "epoch": 0.05950500263296472, "grad_norm": 0.7105273008346558, "learning_rate": 5.6140350877192984e-05, "loss": 0.32431477308273315, "mean_token_accuracy": 0.8829907327890396, "num_tokens": 1393968.0, "step": 113 }, { "entropy": 1.4191592037677765, "epoch": 0.06003159557661927, "grad_norm": 0.8621596097946167, "learning_rate": 5.664160401002506e-05, "loss": 0.29889625310897827, "mean_token_accuracy": 0.8882533758878708, "num_tokens": 1406304.0, "step": 114 }, { "entropy": 1.431228756904602, "epoch": 0.06055818852027383, "grad_norm": 0.662341833114624, "learning_rate": 5.714285714285714e-05, "loss": 0.34662240743637085, "mean_token_accuracy": 0.8789393156766891, "num_tokens": 1418640.0, "step": 115 }, { "entropy": 1.317075937986374, "epoch": 0.061084781463928386, "grad_norm": 0.6940162777900696, "learning_rate": 5.764411027568922e-05, "loss": 0.3154875636100769, "mean_token_accuracy": 0.886825367808342, "num_tokens": 1430976.0, "step": 116 }, { "entropy": 1.3747568726539612, "epoch": 0.061611374407582936, "grad_norm": 0.6974264979362488, "learning_rate": 5.81453634085213e-05, "loss": 0.36218538880348206, "mean_token_accuracy": 0.8753509372472763, "num_tokens": 1443312.0, "step": 117 }, { "entropy": 1.3549829423427582, "epoch": 0.06213796735123749, "grad_norm": 0.7157356142997742, "learning_rate": 5.8646616541353386e-05, "loss": 0.32229024171829224, "mean_token_accuracy": 0.8855572938919067, "num_tokens": 1455648.0, "step": 118 }, { "entropy": 1.4570170640945435, "epoch": 0.06266456029489205, "grad_norm": 0.7710041999816895, "learning_rate": 5.9147869674185465e-05, "loss": 0.3285849094390869, "mean_token_accuracy": 0.8840549886226654, "num_tokens": 1467984.0, "step": 119 }, { "entropy": 1.4027460813522339, "epoch": 0.0631911532385466, "grad_norm": 0.6999377012252808, "learning_rate": 5.9649122807017544e-05, "loss": 0.3464536666870117, "mean_token_accuracy": 0.8799307644367218, "num_tokens": 1480320.0, "step": 120 }, { "entropy": 1.3301794826984406, "epoch": 0.06371774618220116, "grad_norm": 0.7836945056915283, "learning_rate": 6.015037593984962e-05, "loss": 0.3436964750289917, "mean_token_accuracy": 0.8764877319335938, "num_tokens": 1492656.0, "step": 121 }, { "entropy": 1.3585115671157837, "epoch": 0.06424433912585571, "grad_norm": 0.7850233316421509, "learning_rate": 6.06516290726817e-05, "loss": 0.35563230514526367, "mean_token_accuracy": 0.8757744282484055, "num_tokens": 1504992.0, "step": 122 }, { "entropy": 1.2973756194114685, "epoch": 0.06477093206951026, "grad_norm": 0.7351557612419128, "learning_rate": 6.115288220551379e-05, "loss": 0.3156384527683258, "mean_token_accuracy": 0.886470839381218, "num_tokens": 1517328.0, "step": 123 }, { "entropy": 1.3591448068618774, "epoch": 0.06529752501316483, "grad_norm": 0.7262402176856995, "learning_rate": 6.165413533834587e-05, "loss": 0.27420130372047424, "mean_token_accuracy": 0.904089480638504, "num_tokens": 1529664.0, "step": 124 }, { "entropy": 1.253787875175476, "epoch": 0.06582411795681938, "grad_norm": 0.6739073991775513, "learning_rate": 6.215538847117795e-05, "loss": 0.34957295656204224, "mean_token_accuracy": 0.879968523979187, "num_tokens": 1542000.0, "step": 125 }, { "entropy": 1.261105090379715, "epoch": 0.06635071090047394, "grad_norm": 0.7828674912452698, "learning_rate": 6.265664160401002e-05, "loss": 0.3064384460449219, "mean_token_accuracy": 0.8853085935115814, "num_tokens": 1554336.0, "step": 126 }, { "entropy": 1.2267013192176819, "epoch": 0.06687730384412849, "grad_norm": 0.9648973345756531, "learning_rate": 6.31578947368421e-05, "loss": 0.3406292498111725, "mean_token_accuracy": 0.8785828351974487, "num_tokens": 1566672.0, "step": 127 }, { "entropy": 1.2064116597175598, "epoch": 0.06740389678778304, "grad_norm": 0.8842466473579407, "learning_rate": 6.365914786967418e-05, "loss": 0.3578197658061981, "mean_token_accuracy": 0.8797773271799088, "num_tokens": 1579008.0, "step": 128 }, { "entropy": 1.1993357837200165, "epoch": 0.0679304897314376, "grad_norm": 0.8396037817001343, "learning_rate": 6.416040100250626e-05, "loss": 0.32377177476882935, "mean_token_accuracy": 0.8842920362949371, "num_tokens": 1591344.0, "step": 129 }, { "entropy": 1.2047476172447205, "epoch": 0.06845708267509215, "grad_norm": 0.6860671043395996, "learning_rate": 6.466165413533834e-05, "loss": 0.29577356576919556, "mean_token_accuracy": 0.896445706486702, "num_tokens": 1603680.0, "step": 130 }, { "entropy": 1.2046065032482147, "epoch": 0.06898367561874671, "grad_norm": 0.6543269157409668, "learning_rate": 6.516290726817042e-05, "loss": 0.2779792845249176, "mean_token_accuracy": 0.9030982404947281, "num_tokens": 1616016.0, "step": 131 }, { "entropy": 1.1669755578041077, "epoch": 0.06951026856240126, "grad_norm": 0.7457153797149658, "learning_rate": 6.566416040100251e-05, "loss": 0.3149452209472656, "mean_token_accuracy": 0.8876487761735916, "num_tokens": 1628352.0, "step": 132 }, { "entropy": 1.2609427571296692, "epoch": 0.07003686150605581, "grad_norm": 0.7485870122909546, "learning_rate": 6.616541353383459e-05, "loss": 0.31902027130126953, "mean_token_accuracy": 0.8813460171222687, "num_tokens": 1640688.0, "step": 133 }, { "entropy": 1.2575346231460571, "epoch": 0.07056345444971038, "grad_norm": 0.7213554382324219, "learning_rate": 6.666666666666667e-05, "loss": 0.2797701358795166, "mean_token_accuracy": 0.8987373113632202, "num_tokens": 1653024.0, "step": 134 }, { "entropy": 1.186894565820694, "epoch": 0.07109004739336493, "grad_norm": 0.7020873427391052, "learning_rate": 6.716791979949875e-05, "loss": 0.2995363771915436, "mean_token_accuracy": 0.8897402882575989, "num_tokens": 1665360.0, "step": 135 }, { "entropy": 1.161018431186676, "epoch": 0.07161664033701948, "grad_norm": 0.7155889868736267, "learning_rate": 6.766917293233083e-05, "loss": 0.2925366759300232, "mean_token_accuracy": 0.8951611965894699, "num_tokens": 1677696.0, "step": 136 }, { "entropy": 1.2650261223316193, "epoch": 0.07214323328067404, "grad_norm": 0.7642542123794556, "learning_rate": 6.817042606516291e-05, "loss": 0.2801384925842285, "mean_token_accuracy": 0.8974052667617798, "num_tokens": 1690032.0, "step": 137 }, { "entropy": 1.2530198991298676, "epoch": 0.07266982622432859, "grad_norm": 0.8588266372680664, "learning_rate": 6.867167919799499e-05, "loss": 0.3360725939273834, "mean_token_accuracy": 0.8794126808643341, "num_tokens": 1702368.0, "step": 138 }, { "entropy": 1.2518652081489563, "epoch": 0.07319641916798315, "grad_norm": 0.6655072569847107, "learning_rate": 6.917293233082706e-05, "loss": 0.2788892388343811, "mean_token_accuracy": 0.8994075357913971, "num_tokens": 1714704.0, "step": 139 }, { "entropy": 1.1829611957073212, "epoch": 0.0737230121116377, "grad_norm": 0.7172735333442688, "learning_rate": 6.967418546365914e-05, "loss": 0.2918061316013336, "mean_token_accuracy": 0.8959014713764191, "num_tokens": 1727040.0, "step": 140 }, { "entropy": 1.2773233950138092, "epoch": 0.07424960505529225, "grad_norm": 0.697880208492279, "learning_rate": 7.017543859649122e-05, "loss": 0.3217264711856842, "mean_token_accuracy": 0.8819008469581604, "num_tokens": 1739376.0, "step": 141 }, { "entropy": 1.2314070761203766, "epoch": 0.07477619799894682, "grad_norm": 0.701502799987793, "learning_rate": 7.06766917293233e-05, "loss": 0.29351311922073364, "mean_token_accuracy": 0.8908087462186813, "num_tokens": 1751712.0, "step": 142 }, { "entropy": 1.2544872462749481, "epoch": 0.07530279094260137, "grad_norm": 0.7028551697731018, "learning_rate": 7.11779448621554e-05, "loss": 0.3528595566749573, "mean_token_accuracy": 0.8716742098331451, "num_tokens": 1764048.0, "step": 143 }, { "entropy": 1.1984558403491974, "epoch": 0.07582938388625593, "grad_norm": 0.6910477876663208, "learning_rate": 7.167919799498747e-05, "loss": 0.3136734366416931, "mean_token_accuracy": 0.8870812356472015, "num_tokens": 1776384.0, "step": 144 }, { "entropy": 1.2033996284008026, "epoch": 0.07635597682991048, "grad_norm": 0.7239225506782532, "learning_rate": 7.218045112781955e-05, "loss": 0.2979337275028229, "mean_token_accuracy": 0.8915670961141586, "num_tokens": 1788720.0, "step": 145 }, { "entropy": 1.1562331318855286, "epoch": 0.07688256977356503, "grad_norm": 0.7481216192245483, "learning_rate": 7.268170426065163e-05, "loss": 0.2653358280658722, "mean_token_accuracy": 0.8980085849761963, "num_tokens": 1801056.0, "step": 146 }, { "entropy": 1.2064136862754822, "epoch": 0.07740916271721959, "grad_norm": 0.7776615023612976, "learning_rate": 7.318295739348371e-05, "loss": 0.2848292589187622, "mean_token_accuracy": 0.8949488550424576, "num_tokens": 1813392.0, "step": 147 }, { "entropy": 1.1387107968330383, "epoch": 0.07793575566087414, "grad_norm": 0.8243488669395447, "learning_rate": 7.368421052631579e-05, "loss": 0.31445616483688354, "mean_token_accuracy": 0.887312263250351, "num_tokens": 1825728.0, "step": 148 }, { "entropy": 1.0903229415416718, "epoch": 0.0784623486045287, "grad_norm": 0.775776207447052, "learning_rate": 7.418546365914787e-05, "loss": 0.2984585762023926, "mean_token_accuracy": 0.8886806517839432, "num_tokens": 1838064.0, "step": 149 }, { "entropy": 1.1340011656284332, "epoch": 0.07898894154818326, "grad_norm": 0.7941513657569885, "learning_rate": 7.468671679197995e-05, "loss": 0.27699777483940125, "mean_token_accuracy": 0.9033427834510803, "num_tokens": 1850400.0, "step": 150 }, { "entropy": 1.084587723016739, "epoch": 0.0795155344918378, "grad_norm": 0.7044249773025513, "learning_rate": 7.518796992481203e-05, "loss": 0.2815166711807251, "mean_token_accuracy": 0.8928717374801636, "num_tokens": 1862736.0, "step": 151 }, { "entropy": 1.0816469937562943, "epoch": 0.08004212743549237, "grad_norm": 0.8506439328193665, "learning_rate": 7.56892230576441e-05, "loss": 0.3135736584663391, "mean_token_accuracy": 0.8835454434156418, "num_tokens": 1875072.0, "step": 152 }, { "entropy": 1.037431538105011, "epoch": 0.08056872037914692, "grad_norm": 0.6357259750366211, "learning_rate": 7.619047619047618e-05, "loss": 0.2715918719768524, "mean_token_accuracy": 0.9003684967756271, "num_tokens": 1887408.0, "step": 153 }, { "entropy": 1.101006418466568, "epoch": 0.08109531332280147, "grad_norm": 0.7176199555397034, "learning_rate": 7.669172932330826e-05, "loss": 0.3140455186367035, "mean_token_accuracy": 0.8868316859006882, "num_tokens": 1899744.0, "step": 154 }, { "entropy": 1.048825979232788, "epoch": 0.08162190626645603, "grad_norm": 0.8264813423156738, "learning_rate": 7.719298245614036e-05, "loss": 0.27318042516708374, "mean_token_accuracy": 0.8995131105184555, "num_tokens": 1912080.0, "step": 155 }, { "entropy": 1.0369156897068024, "epoch": 0.08214849921011058, "grad_norm": 0.7105727791786194, "learning_rate": 7.769423558897244e-05, "loss": 0.287497341632843, "mean_token_accuracy": 0.8940722495317459, "num_tokens": 1924416.0, "step": 156 }, { "entropy": 1.0527066588401794, "epoch": 0.08267509215376515, "grad_norm": 0.7094339728355408, "learning_rate": 7.819548872180451e-05, "loss": 0.31165987253189087, "mean_token_accuracy": 0.8851522654294968, "num_tokens": 1936752.0, "step": 157 }, { "entropy": 1.018677532672882, "epoch": 0.0832016850974197, "grad_norm": 0.6412932276725769, "learning_rate": 7.869674185463659e-05, "loss": 0.28470396995544434, "mean_token_accuracy": 0.8961537182331085, "num_tokens": 1949088.0, "step": 158 }, { "entropy": 1.011895701289177, "epoch": 0.08372827804107424, "grad_norm": 0.6732510924339294, "learning_rate": 7.919799498746867e-05, "loss": 0.28573673963546753, "mean_token_accuracy": 0.8944952934980392, "num_tokens": 1961424.0, "step": 159 }, { "entropy": 1.011293813586235, "epoch": 0.08425487098472881, "grad_norm": 0.6785159707069397, "learning_rate": 7.969924812030075e-05, "loss": 0.30068039894104004, "mean_token_accuracy": 0.8911136984825134, "num_tokens": 1973760.0, "step": 160 }, { "entropy": 1.020560160279274, "epoch": 0.08478146392838336, "grad_norm": 0.7218092679977417, "learning_rate": 8.020050125313283e-05, "loss": 0.30739086866378784, "mean_token_accuracy": 0.885330468416214, "num_tokens": 1986096.0, "step": 161 }, { "entropy": 1.0597094595432281, "epoch": 0.08530805687203792, "grad_norm": 0.7374167442321777, "learning_rate": 8.070175438596491e-05, "loss": 0.31700241565704346, "mean_token_accuracy": 0.8844025731086731, "num_tokens": 1998432.0, "step": 162 }, { "entropy": 1.0140591859817505, "epoch": 0.08583464981569247, "grad_norm": 0.6328212022781372, "learning_rate": 8.120300751879699e-05, "loss": 0.282073050737381, "mean_token_accuracy": 0.9006371796131134, "num_tokens": 2010768.0, "step": 163 }, { "entropy": 1.0362461507320404, "epoch": 0.08636124275934702, "grad_norm": 0.6613935828208923, "learning_rate": 8.170426065162907e-05, "loss": 0.2826480567455292, "mean_token_accuracy": 0.8936625272035599, "num_tokens": 2023104.0, "step": 164 }, { "entropy": 1.0381528735160828, "epoch": 0.08688783570300158, "grad_norm": 0.6834626197814941, "learning_rate": 8.220551378446115e-05, "loss": 0.2852419912815094, "mean_token_accuracy": 0.8987163454294205, "num_tokens": 2035440.0, "step": 165 }, { "entropy": 1.0698944479227066, "epoch": 0.08741442864665613, "grad_norm": 0.7904614806175232, "learning_rate": 8.270676691729324e-05, "loss": 0.2937854826450348, "mean_token_accuracy": 0.8909425586462021, "num_tokens": 2047776.0, "step": 166 }, { "entropy": 1.040902853012085, "epoch": 0.08794102159031068, "grad_norm": 0.7362328767776489, "learning_rate": 8.320802005012532e-05, "loss": 0.2914920449256897, "mean_token_accuracy": 0.898249089717865, "num_tokens": 2060112.0, "step": 167 }, { "entropy": 1.028788536787033, "epoch": 0.08846761453396525, "grad_norm": 0.8054221868515015, "learning_rate": 8.37092731829574e-05, "loss": 0.3018620014190674, "mean_token_accuracy": 0.8883562982082367, "num_tokens": 2072448.0, "step": 168 }, { "entropy": 1.0401608049869537, "epoch": 0.0889942074776198, "grad_norm": 0.6363168954849243, "learning_rate": 8.421052631578948e-05, "loss": 0.2924948036670685, "mean_token_accuracy": 0.8931814581155777, "num_tokens": 2084784.0, "step": 169 }, { "entropy": 1.0388599783182144, "epoch": 0.08952080042127436, "grad_norm": 1.0536071062088013, "learning_rate": 8.471177944862155e-05, "loss": 0.3022274971008301, "mean_token_accuracy": 0.8892710357904434, "num_tokens": 2097120.0, "step": 170 }, { "entropy": 1.0794771611690521, "epoch": 0.09004739336492891, "grad_norm": 0.7485163807868958, "learning_rate": 8.521303258145363e-05, "loss": 0.28198155760765076, "mean_token_accuracy": 0.8907860517501831, "num_tokens": 2109456.0, "step": 171 }, { "entropy": 1.0737251937389374, "epoch": 0.09057398630858346, "grad_norm": 0.7381237745285034, "learning_rate": 8.571428571428571e-05, "loss": 0.2523871660232544, "mean_token_accuracy": 0.9074936509132385, "num_tokens": 2121792.0, "step": 172 }, { "entropy": 1.003856584429741, "epoch": 0.09110057925223802, "grad_norm": 0.7226340770721436, "learning_rate": 8.621553884711779e-05, "loss": 0.27109643816947937, "mean_token_accuracy": 0.9041073471307755, "num_tokens": 2134128.0, "step": 173 }, { "entropy": 1.1186200976371765, "epoch": 0.09162717219589257, "grad_norm": 0.7579658627510071, "learning_rate": 8.671679197994987e-05, "loss": 0.3053061366081238, "mean_token_accuracy": 0.8858212381601334, "num_tokens": 2146464.0, "step": 174 }, { "entropy": 1.1462504863739014, "epoch": 0.09215376513954714, "grad_norm": 0.6947624087333679, "learning_rate": 8.721804511278195e-05, "loss": 0.3097134232521057, "mean_token_accuracy": 0.8846383690834045, "num_tokens": 2158800.0, "step": 175 }, { "entropy": 1.1312821209430695, "epoch": 0.09268035808320169, "grad_norm": 0.6850878596305847, "learning_rate": 8.771929824561403e-05, "loss": 0.26429426670074463, "mean_token_accuracy": 0.8986905962228775, "num_tokens": 2171136.0, "step": 176 }, { "entropy": 1.146384358406067, "epoch": 0.09320695102685624, "grad_norm": 0.7358205914497375, "learning_rate": 8.822055137844612e-05, "loss": 0.2753527760505676, "mean_token_accuracy": 0.8983759731054306, "num_tokens": 2183472.0, "step": 177 }, { "entropy": 1.2575857639312744, "epoch": 0.0937335439705108, "grad_norm": 0.6449548006057739, "learning_rate": 8.87218045112782e-05, "loss": 0.2840855121612549, "mean_token_accuracy": 0.8939386010169983, "num_tokens": 2195808.0, "step": 178 }, { "entropy": 1.190169095993042, "epoch": 0.09426013691416535, "grad_norm": 0.7093657851219177, "learning_rate": 8.922305764411028e-05, "loss": 0.2701612114906311, "mean_token_accuracy": 0.9016707092523575, "num_tokens": 2208144.0, "step": 179 }, { "entropy": 1.229299396276474, "epoch": 0.0947867298578199, "grad_norm": 0.7190297245979309, "learning_rate": 8.972431077694236e-05, "loss": 0.25798100233078003, "mean_token_accuracy": 0.9037416577339172, "num_tokens": 2220480.0, "step": 180 }, { "entropy": 1.2668792605400085, "epoch": 0.09531332280147446, "grad_norm": 0.7405722737312317, "learning_rate": 9.022556390977444e-05, "loss": 0.2883971929550171, "mean_token_accuracy": 0.8925597667694092, "num_tokens": 2232816.0, "step": 181 }, { "entropy": 1.1805595457553864, "epoch": 0.09583991574512901, "grad_norm": 0.6785654425621033, "learning_rate": 9.072681704260652e-05, "loss": 0.2622534930706024, "mean_token_accuracy": 0.9043945819139481, "num_tokens": 2245152.0, "step": 182 }, { "entropy": 1.24412140250206, "epoch": 0.09636650868878358, "grad_norm": 0.6113075017929077, "learning_rate": 9.12280701754386e-05, "loss": 0.30303800106048584, "mean_token_accuracy": 0.8807209581136703, "num_tokens": 2257488.0, "step": 183 }, { "entropy": 1.1531569063663483, "epoch": 0.09689310163243813, "grad_norm": 0.6058000922203064, "learning_rate": 9.172932330827067e-05, "loss": 0.2888239622116089, "mean_token_accuracy": 0.8989417850971222, "num_tokens": 2269824.0, "step": 184 }, { "entropy": 1.1511635780334473, "epoch": 0.09741969457609267, "grad_norm": 0.6023234128952026, "learning_rate": 9.223057644110275e-05, "loss": 0.2515050172805786, "mean_token_accuracy": 0.9097182005643845, "num_tokens": 2282160.0, "step": 185 }, { "entropy": 1.1716180443763733, "epoch": 0.09794628751974724, "grad_norm": 0.6153926253318787, "learning_rate": 9.273182957393483e-05, "loss": 0.2679345905780792, "mean_token_accuracy": 0.8987378627061844, "num_tokens": 2294496.0, "step": 186 }, { "entropy": 1.1668370068073273, "epoch": 0.09847288046340179, "grad_norm": 0.6524267196655273, "learning_rate": 9.323308270676691e-05, "loss": 0.28671011328697205, "mean_token_accuracy": 0.8961494415998459, "num_tokens": 2306832.0, "step": 187 }, { "entropy": 1.1817428171634674, "epoch": 0.09899947340705635, "grad_norm": 0.6342366337776184, "learning_rate": 9.373433583959899e-05, "loss": 0.2956732511520386, "mean_token_accuracy": 0.8947313278913498, "num_tokens": 2319168.0, "step": 188 }, { "entropy": 1.118630200624466, "epoch": 0.0995260663507109, "grad_norm": 0.6613883972167969, "learning_rate": 9.423558897243108e-05, "loss": 0.24410809576511383, "mean_token_accuracy": 0.9081003367900848, "num_tokens": 2331504.0, "step": 189 }, { "entropy": 1.1118974089622498, "epoch": 0.10005265929436545, "grad_norm": 0.6532029509544373, "learning_rate": 9.473684210526316e-05, "loss": 0.2677920162677765, "mean_token_accuracy": 0.8997665196657181, "num_tokens": 2343840.0, "step": 190 }, { "entropy": 1.1150999963283539, "epoch": 0.10057925223802001, "grad_norm": 0.6919822692871094, "learning_rate": 9.523809523809524e-05, "loss": 0.2759622633457184, "mean_token_accuracy": 0.896903395652771, "num_tokens": 2356176.0, "step": 191 }, { "entropy": 1.0659538507461548, "epoch": 0.10110584518167456, "grad_norm": 0.6363855600357056, "learning_rate": 9.573934837092732e-05, "loss": 0.2608574628829956, "mean_token_accuracy": 0.8995112329721451, "num_tokens": 2368512.0, "step": 192 }, { "entropy": 1.0789634585380554, "epoch": 0.10163243812532911, "grad_norm": 0.7043361067771912, "learning_rate": 9.62406015037594e-05, "loss": 0.27143171429634094, "mean_token_accuracy": 0.897380143404007, "num_tokens": 2380848.0, "step": 193 }, { "entropy": 1.1381100416183472, "epoch": 0.10215903106898368, "grad_norm": 0.6552066206932068, "learning_rate": 9.674185463659148e-05, "loss": 0.26525720953941345, "mean_token_accuracy": 0.9070263504981995, "num_tokens": 2393184.0, "step": 194 }, { "entropy": 1.1865114271640778, "epoch": 0.10268562401263823, "grad_norm": 0.634785532951355, "learning_rate": 9.724310776942356e-05, "loss": 0.26738592982292175, "mean_token_accuracy": 0.9013326019048691, "num_tokens": 2405520.0, "step": 195 }, { "entropy": 1.1835360527038574, "epoch": 0.10321221695629279, "grad_norm": 0.7315617799758911, "learning_rate": 9.774436090225564e-05, "loss": 0.29927945137023926, "mean_token_accuracy": 0.8894186317920685, "num_tokens": 2417856.0, "step": 196 }, { "entropy": 1.1675716638565063, "epoch": 0.10373880989994734, "grad_norm": 0.5887401700019836, "learning_rate": 9.824561403508771e-05, "loss": 0.2657887935638428, "mean_token_accuracy": 0.9044163674116135, "num_tokens": 2430192.0, "step": 197 }, { "entropy": 1.2119200527668, "epoch": 0.10426540284360189, "grad_norm": 0.7186099290847778, "learning_rate": 9.87468671679198e-05, "loss": 0.24999147653579712, "mean_token_accuracy": 0.9089571237564087, "num_tokens": 2442528.0, "step": 198 }, { "entropy": 1.1587353944778442, "epoch": 0.10479199578725645, "grad_norm": 0.6930050253868103, "learning_rate": 9.924812030075187e-05, "loss": 0.28423306345939636, "mean_token_accuracy": 0.8938881307840347, "num_tokens": 2454864.0, "step": 199 }, { "entropy": 1.1999735534191132, "epoch": 0.105318588730911, "grad_norm": 0.6575484871864319, "learning_rate": 9.974937343358397e-05, "loss": 0.25892868638038635, "mean_token_accuracy": 0.9065304547548294, "num_tokens": 2467200.0, "step": 200 }, { "entropy": 1.1664292514324188, "epoch": 0.10584518167456557, "grad_norm": 0.6501355767250061, "learning_rate": 0.00010025062656641604, "loss": 0.2730686068534851, "mean_token_accuracy": 0.8991207629442215, "num_tokens": 2479536.0, "step": 201 }, { "entropy": 1.2156886756420135, "epoch": 0.10637177461822012, "grad_norm": 1.1883974075317383, "learning_rate": 0.00010075187969924814, "loss": 0.2882535755634308, "mean_token_accuracy": 0.8935256004333496, "num_tokens": 2491872.0, "step": 202 }, { "entropy": 1.1884984374046326, "epoch": 0.10689836756187467, "grad_norm": 0.6555978655815125, "learning_rate": 0.0001012531328320802, "loss": 0.2524234354496002, "mean_token_accuracy": 0.9072889387607574, "num_tokens": 2504208.0, "step": 203 }, { "entropy": 1.204279750585556, "epoch": 0.10742496050552923, "grad_norm": 0.6422716379165649, "learning_rate": 0.0001017543859649123, "loss": 0.2662729322910309, "mean_token_accuracy": 0.9040449559688568, "num_tokens": 2516544.0, "step": 204 }, { "entropy": 1.2619583904743195, "epoch": 0.10795155344918378, "grad_norm": 0.7150806188583374, "learning_rate": 0.00010225563909774436, "loss": 0.2756538689136505, "mean_token_accuracy": 0.8975429385900497, "num_tokens": 2528880.0, "step": 205 }, { "entropy": 1.265720009803772, "epoch": 0.10847814639283834, "grad_norm": 0.6873537302017212, "learning_rate": 0.00010275689223057645, "loss": 0.25472116470336914, "mean_token_accuracy": 0.9096198529005051, "num_tokens": 2541216.0, "step": 206 }, { "entropy": 1.269091546535492, "epoch": 0.10900473933649289, "grad_norm": 0.6951980590820312, "learning_rate": 0.00010325814536340852, "loss": 0.26120638847351074, "mean_token_accuracy": 0.9050850421190262, "num_tokens": 2553552.0, "step": 207 }, { "entropy": 1.269478291273117, "epoch": 0.10953133228014744, "grad_norm": 0.556747555732727, "learning_rate": 0.00010375939849624061, "loss": 0.25462740659713745, "mean_token_accuracy": 0.9035714715719223, "num_tokens": 2565888.0, "step": 208 }, { "entropy": 1.261308342218399, "epoch": 0.110057925223802, "grad_norm": 0.6084737777709961, "learning_rate": 0.00010426065162907268, "loss": 0.28605493903160095, "mean_token_accuracy": 0.8935003876686096, "num_tokens": 2578224.0, "step": 209 }, { "entropy": 1.3189480602741241, "epoch": 0.11058451816745656, "grad_norm": 0.5886352062225342, "learning_rate": 0.00010476190476190477, "loss": 0.24048885703086853, "mean_token_accuracy": 0.9100839495658875, "num_tokens": 2590560.0, "step": 210 }, { "entropy": 1.3389763832092285, "epoch": 0.1111111111111111, "grad_norm": 0.6794092059135437, "learning_rate": 0.00010526315789473685, "loss": 0.2771369516849518, "mean_token_accuracy": 0.890377551317215, "num_tokens": 2602896.0, "step": 211 }, { "entropy": 1.3012954592704773, "epoch": 0.11163770405476567, "grad_norm": 0.6500777006149292, "learning_rate": 0.00010576441102756893, "loss": 0.26194366812705994, "mean_token_accuracy": 0.9035488367080688, "num_tokens": 2615232.0, "step": 212 }, { "entropy": 1.3287411630153656, "epoch": 0.11216429699842022, "grad_norm": 0.7444258332252502, "learning_rate": 0.000106265664160401, "loss": 0.25705063343048096, "mean_token_accuracy": 0.8985376209020615, "num_tokens": 2627568.0, "step": 213 }, { "entropy": 1.3762761354446411, "epoch": 0.11269088994207478, "grad_norm": 0.6778383255004883, "learning_rate": 0.0001067669172932331, "loss": 0.26562660932540894, "mean_token_accuracy": 0.8980493247509003, "num_tokens": 2639904.0, "step": 214 }, { "entropy": 1.3341316282749176, "epoch": 0.11321748288572933, "grad_norm": 0.5709004998207092, "learning_rate": 0.00010726817042606516, "loss": 0.22839783132076263, "mean_token_accuracy": 0.9137850105762482, "num_tokens": 2652240.0, "step": 215 }, { "entropy": 1.397248774766922, "epoch": 0.11374407582938388, "grad_norm": 0.6649454236030579, "learning_rate": 0.00010776942355889726, "loss": 0.2758176624774933, "mean_token_accuracy": 0.8951268941164017, "num_tokens": 2664576.0, "step": 216 }, { "entropy": 1.3985490798950195, "epoch": 0.11427066877303844, "grad_norm": 0.6822545528411865, "learning_rate": 0.00010827067669172932, "loss": 0.2714245021343231, "mean_token_accuracy": 0.9002304524183273, "num_tokens": 2676912.0, "step": 217 }, { "entropy": 1.4322108924388885, "epoch": 0.114797261716693, "grad_norm": 0.6045425534248352, "learning_rate": 0.00010877192982456141, "loss": 0.27720269560813904, "mean_token_accuracy": 0.8973477184772491, "num_tokens": 2689248.0, "step": 218 }, { "entropy": 1.412218064069748, "epoch": 0.11532385466034756, "grad_norm": 0.5996334552764893, "learning_rate": 0.00010927318295739348, "loss": 0.2552666962146759, "mean_token_accuracy": 0.9052979648113251, "num_tokens": 2701584.0, "step": 219 }, { "entropy": 1.4080830514431, "epoch": 0.11585044760400211, "grad_norm": 0.5775550007820129, "learning_rate": 0.00010977443609022557, "loss": 0.26107677817344666, "mean_token_accuracy": 0.902474120259285, "num_tokens": 2713920.0, "step": 220 }, { "entropy": 1.4139901399612427, "epoch": 0.11637704054765666, "grad_norm": 0.5853016972541809, "learning_rate": 0.00011027568922305764, "loss": 0.2802305519580841, "mean_token_accuracy": 0.8949225097894669, "num_tokens": 2726256.0, "step": 221 }, { "entropy": 1.354727566242218, "epoch": 0.11690363349131122, "grad_norm": 0.6593271493911743, "learning_rate": 0.00011077694235588973, "loss": 0.25806909799575806, "mean_token_accuracy": 0.9009847342967987, "num_tokens": 2738592.0, "step": 222 }, { "entropy": 1.363867849111557, "epoch": 0.11743022643496577, "grad_norm": 0.5569132566452026, "learning_rate": 0.00011127819548872181, "loss": 0.2619836926460266, "mean_token_accuracy": 0.9014725536108017, "num_tokens": 2750928.0, "step": 223 }, { "entropy": 1.4332265555858612, "epoch": 0.11795681937862032, "grad_norm": 0.6189314723014832, "learning_rate": 0.00011177944862155389, "loss": 0.26161426305770874, "mean_token_accuracy": 0.8975115269422531, "num_tokens": 2763264.0, "step": 224 }, { "entropy": 1.3454554677009583, "epoch": 0.11848341232227488, "grad_norm": 0.6003779768943787, "learning_rate": 0.00011228070175438597, "loss": 0.2651001214981079, "mean_token_accuracy": 0.9023340046405792, "num_tokens": 2775600.0, "step": 225 }, { "entropy": 1.3587769269943237, "epoch": 0.11901000526592943, "grad_norm": 0.7411830425262451, "learning_rate": 0.00011278195488721806, "loss": 0.2888566851615906, "mean_token_accuracy": 0.895685225725174, "num_tokens": 2787936.0, "step": 226 }, { "entropy": 1.4554640650749207, "epoch": 0.119536598209584, "grad_norm": 0.6714136004447937, "learning_rate": 0.00011328320802005013, "loss": 0.2898600101470947, "mean_token_accuracy": 0.8905848562717438, "num_tokens": 2800272.0, "step": 227 }, { "entropy": 1.4274349808692932, "epoch": 0.12006319115323855, "grad_norm": 0.5972358584403992, "learning_rate": 0.00011378446115288222, "loss": 0.2719231843948364, "mean_token_accuracy": 0.8995204567909241, "num_tokens": 2812608.0, "step": 228 }, { "entropy": 1.3975107669830322, "epoch": 0.1205897840968931, "grad_norm": 0.7388063073158264, "learning_rate": 0.00011428571428571428, "loss": 0.2811048924922943, "mean_token_accuracy": 0.8961653858423233, "num_tokens": 2824944.0, "step": 229 }, { "entropy": 1.41668900847435, "epoch": 0.12111637704054766, "grad_norm": 0.6408892273902893, "learning_rate": 0.00011478696741854638, "loss": 0.23900066316127777, "mean_token_accuracy": 0.9131550490856171, "num_tokens": 2837280.0, "step": 230 }, { "entropy": 1.4389840960502625, "epoch": 0.12164296998420221, "grad_norm": 0.6279134154319763, "learning_rate": 0.00011528822055137844, "loss": 0.27471503615379333, "mean_token_accuracy": 0.8994272202253342, "num_tokens": 2849616.0, "step": 231 }, { "entropy": 1.3705064952373505, "epoch": 0.12216956292785677, "grad_norm": 0.7351282835006714, "learning_rate": 0.00011578947368421053, "loss": 0.2829359471797943, "mean_token_accuracy": 0.8966951966285706, "num_tokens": 2861952.0, "step": 232 }, { "entropy": 1.4880229830741882, "epoch": 0.12269615587151132, "grad_norm": 0.6098307371139526, "learning_rate": 0.0001162907268170426, "loss": 0.25372314453125, "mean_token_accuracy": 0.901044175028801, "num_tokens": 2874288.0, "step": 233 }, { "entropy": 1.4908549189567566, "epoch": 0.12322274881516587, "grad_norm": 0.6075619459152222, "learning_rate": 0.00011679197994987469, "loss": 0.2654881477355957, "mean_token_accuracy": 0.8972955793142319, "num_tokens": 2886624.0, "step": 234 }, { "entropy": 1.3783467411994934, "epoch": 0.12374934175882044, "grad_norm": 0.6030115485191345, "learning_rate": 0.00011729323308270677, "loss": 0.25111234188079834, "mean_token_accuracy": 0.902543842792511, "num_tokens": 2898960.0, "step": 235 }, { "entropy": 1.3683518171310425, "epoch": 0.12427593470247499, "grad_norm": 0.6671847105026245, "learning_rate": 0.00011779448621553886, "loss": 0.25656643509864807, "mean_token_accuracy": 0.9067094326019287, "num_tokens": 2911296.0, "step": 236 }, { "entropy": 1.4006175696849823, "epoch": 0.12480252764612954, "grad_norm": 0.5684525370597839, "learning_rate": 0.00011829573934837093, "loss": 0.2626839876174927, "mean_token_accuracy": 0.9033264219760895, "num_tokens": 2923632.0, "step": 237 }, { "entropy": 1.335418850183487, "epoch": 0.1253291205897841, "grad_norm": 0.5542851090431213, "learning_rate": 0.00011879699248120302, "loss": 0.24251079559326172, "mean_token_accuracy": 0.9084768146276474, "num_tokens": 2935968.0, "step": 238 }, { "entropy": 1.3918206691741943, "epoch": 0.12585571353343866, "grad_norm": 0.7893558740615845, "learning_rate": 0.00011929824561403509, "loss": 0.2818213999271393, "mean_token_accuracy": 0.8929243236780167, "num_tokens": 2948304.0, "step": 239 }, { "entropy": 1.3344398736953735, "epoch": 0.1263823064770932, "grad_norm": 0.62665194272995, "learning_rate": 0.00011979949874686718, "loss": 0.24543407559394836, "mean_token_accuracy": 0.9088149815797806, "num_tokens": 2960640.0, "step": 240 }, { "entropy": 1.362634390592575, "epoch": 0.12690889942074776, "grad_norm": 0.6178820133209229, "learning_rate": 0.00012030075187969925, "loss": 0.24784636497497559, "mean_token_accuracy": 0.9079759418964386, "num_tokens": 2972976.0, "step": 241 }, { "entropy": 1.3410207033157349, "epoch": 0.12743549236440233, "grad_norm": 0.6127734780311584, "learning_rate": 0.00012080200501253134, "loss": 0.276973694562912, "mean_token_accuracy": 0.900666818022728, "num_tokens": 2985312.0, "step": 242 }, { "entropy": 1.3882217109203339, "epoch": 0.12796208530805686, "grad_norm": 0.6211519837379456, "learning_rate": 0.0001213032581453634, "loss": 0.29095229506492615, "mean_token_accuracy": 0.8922038376331329, "num_tokens": 2997648.0, "step": 243 }, { "entropy": 1.3064784407615662, "epoch": 0.12848867825171142, "grad_norm": 0.6020708084106445, "learning_rate": 0.0001218045112781955, "loss": 0.25750190019607544, "mean_token_accuracy": 0.8979595750570297, "num_tokens": 3009984.0, "step": 244 }, { "entropy": 1.3404588103294373, "epoch": 0.129015271195366, "grad_norm": 0.5311986804008484, "learning_rate": 0.00012230576441102757, "loss": 0.2417442798614502, "mean_token_accuracy": 0.9036334156990051, "num_tokens": 3022320.0, "step": 245 }, { "entropy": 1.3250301778316498, "epoch": 0.12954186413902052, "grad_norm": 0.6158598065376282, "learning_rate": 0.00012280701754385965, "loss": 0.28592783212661743, "mean_token_accuracy": 0.8968044072389603, "num_tokens": 3034656.0, "step": 246 }, { "entropy": 1.2895326018333435, "epoch": 0.1300684570826751, "grad_norm": 0.5133572816848755, "learning_rate": 0.00012330827067669173, "loss": 0.26722657680511475, "mean_token_accuracy": 0.899601012468338, "num_tokens": 3046992.0, "step": 247 }, { "entropy": 1.2834957540035248, "epoch": 0.13059505002632965, "grad_norm": 0.5774098038673401, "learning_rate": 0.0001238095238095238, "loss": 0.2552984654903412, "mean_token_accuracy": 0.9021749496459961, "num_tokens": 3059328.0, "step": 248 }, { "entropy": 1.28067284822464, "epoch": 0.13112164296998421, "grad_norm": 0.5813867449760437, "learning_rate": 0.0001243107769423559, "loss": 0.26484355330467224, "mean_token_accuracy": 0.8958484381437302, "num_tokens": 3071664.0, "step": 249 }, { "entropy": 1.3292741775512695, "epoch": 0.13164823591363875, "grad_norm": 0.5437096357345581, "learning_rate": 0.00012481203007518797, "loss": 0.25312983989715576, "mean_token_accuracy": 0.9083140790462494, "num_tokens": 3084000.0, "step": 250 }, { "entropy": 1.217045933008194, "epoch": 0.1321748288572933, "grad_norm": 0.5642932057380676, "learning_rate": 0.00012531328320802005, "loss": 0.24098949134349823, "mean_token_accuracy": 0.9082589000463486, "num_tokens": 3096336.0, "step": 251 }, { "entropy": 1.3332138061523438, "epoch": 0.13270142180094788, "grad_norm": 0.5955415368080139, "learning_rate": 0.00012581453634085213, "loss": 0.2849401831626892, "mean_token_accuracy": 0.8916681408882141, "num_tokens": 3108672.0, "step": 252 }, { "entropy": 1.295847773551941, "epoch": 0.1332280147446024, "grad_norm": 0.6146616339683533, "learning_rate": 0.0001263157894736842, "loss": 0.2735283076763153, "mean_token_accuracy": 0.8989967852830887, "num_tokens": 3121008.0, "step": 253 }, { "entropy": 1.2074873447418213, "epoch": 0.13375460768825698, "grad_norm": 0.5243288278579712, "learning_rate": 0.0001268170426065163, "loss": 0.24956879019737244, "mean_token_accuracy": 0.9056222587823868, "num_tokens": 3133344.0, "step": 254 }, { "entropy": 1.2322421371936798, "epoch": 0.13428120063191154, "grad_norm": 0.5780612230300903, "learning_rate": 0.00012731829573934836, "loss": 0.22142812609672546, "mean_token_accuracy": 0.9111984372138977, "num_tokens": 3145680.0, "step": 255 }, { "entropy": 1.2550228536128998, "epoch": 0.13480779357556608, "grad_norm": 0.5654560923576355, "learning_rate": 0.00012781954887218047, "loss": 0.2577667236328125, "mean_token_accuracy": 0.9028536081314087, "num_tokens": 3158016.0, "step": 256 }, { "entropy": 1.2815439105033875, "epoch": 0.13533438651922064, "grad_norm": 0.5860424041748047, "learning_rate": 0.00012832080200501252, "loss": 0.24961405992507935, "mean_token_accuracy": 0.9073447585105896, "num_tokens": 3170352.0, "step": 257 }, { "entropy": 1.3496994376182556, "epoch": 0.1358609794628752, "grad_norm": 0.5496608018875122, "learning_rate": 0.00012882205513784463, "loss": 0.23788216710090637, "mean_token_accuracy": 0.913466677069664, "num_tokens": 3182688.0, "step": 258 }, { "entropy": 1.2379789352416992, "epoch": 0.13638757240652974, "grad_norm": 0.5407847166061401, "learning_rate": 0.00012932330827067668, "loss": 0.242479607462883, "mean_token_accuracy": 0.9110987186431885, "num_tokens": 3195024.0, "step": 259 }, { "entropy": 1.2678188979625702, "epoch": 0.1369141653501843, "grad_norm": 0.6954227089881897, "learning_rate": 0.0001298245614035088, "loss": 0.3035907447338104, "mean_token_accuracy": 0.8935103565454483, "num_tokens": 3207360.0, "step": 260 }, { "entropy": 1.2501021325588226, "epoch": 0.13744075829383887, "grad_norm": 0.6763582825660706, "learning_rate": 0.00013032581453634084, "loss": 0.2833873927593231, "mean_token_accuracy": 0.8930742889642715, "num_tokens": 3219696.0, "step": 261 }, { "entropy": 1.2093367278575897, "epoch": 0.13796735123749343, "grad_norm": 0.5583021640777588, "learning_rate": 0.00013082706766917294, "loss": 0.23031063377857208, "mean_token_accuracy": 0.9110294431447983, "num_tokens": 3232032.0, "step": 262 }, { "entropy": 1.2286772429943085, "epoch": 0.13849394418114797, "grad_norm": 0.5849270224571228, "learning_rate": 0.00013132832080200502, "loss": 0.27444857358932495, "mean_token_accuracy": 0.8965310454368591, "num_tokens": 3244368.0, "step": 263 }, { "entropy": 1.2541997134685516, "epoch": 0.13902053712480253, "grad_norm": 0.5210989713668823, "learning_rate": 0.0001318295739348371, "loss": 0.24464797973632812, "mean_token_accuracy": 0.9072559326887131, "num_tokens": 3256704.0, "step": 264 }, { "entropy": 1.2401838898658752, "epoch": 0.1395471300684571, "grad_norm": 0.5357401371002197, "learning_rate": 0.00013233082706766918, "loss": 0.24787980318069458, "mean_token_accuracy": 0.9098693877458572, "num_tokens": 3269040.0, "step": 265 }, { "entropy": 1.2660530507564545, "epoch": 0.14007372301211163, "grad_norm": 0.5940161943435669, "learning_rate": 0.00013283208020050126, "loss": 0.27411437034606934, "mean_token_accuracy": 0.8980700373649597, "num_tokens": 3281376.0, "step": 266 }, { "entropy": 1.241824746131897, "epoch": 0.1406003159557662, "grad_norm": 0.604097306728363, "learning_rate": 0.00013333333333333334, "loss": 0.2866377830505371, "mean_token_accuracy": 0.8919961899518967, "num_tokens": 3293712.0, "step": 267 }, { "entropy": 1.1769486963748932, "epoch": 0.14112690889942076, "grad_norm": 0.7264558672904968, "learning_rate": 0.00013383458646616542, "loss": 0.26414263248443604, "mean_token_accuracy": 0.8967715352773666, "num_tokens": 3306048.0, "step": 268 }, { "entropy": 1.2283678948879242, "epoch": 0.1416535018430753, "grad_norm": 0.5465900301933289, "learning_rate": 0.0001343358395989975, "loss": 0.2366294264793396, "mean_token_accuracy": 0.9092733561992645, "num_tokens": 3318384.0, "step": 269 }, { "entropy": 1.262256383895874, "epoch": 0.14218009478672985, "grad_norm": 0.5315939784049988, "learning_rate": 0.00013483709273182958, "loss": 0.22708219289779663, "mean_token_accuracy": 0.914520725607872, "num_tokens": 3330720.0, "step": 270 }, { "entropy": 1.175988882780075, "epoch": 0.14270668773038442, "grad_norm": 0.5613946318626404, "learning_rate": 0.00013533834586466166, "loss": 0.22835803031921387, "mean_token_accuracy": 0.9081931263208389, "num_tokens": 3343056.0, "step": 271 }, { "entropy": 1.2391490042209625, "epoch": 0.14323328067403895, "grad_norm": 0.5381202101707458, "learning_rate": 0.00013583959899749373, "loss": 0.25535333156585693, "mean_token_accuracy": 0.9033481776714325, "num_tokens": 3355392.0, "step": 272 }, { "entropy": 1.2381133437156677, "epoch": 0.14375987361769352, "grad_norm": 0.6545175909996033, "learning_rate": 0.00013634085213032581, "loss": 0.268245667219162, "mean_token_accuracy": 0.9008642733097076, "num_tokens": 3367728.0, "step": 273 }, { "entropy": 1.2534950375556946, "epoch": 0.14428646656134808, "grad_norm": 0.6084462404251099, "learning_rate": 0.0001368421052631579, "loss": 0.241957426071167, "mean_token_accuracy": 0.9131230562925339, "num_tokens": 3380064.0, "step": 274 }, { "entropy": 1.2566357254981995, "epoch": 0.14481305950500264, "grad_norm": 0.5803132057189941, "learning_rate": 0.00013734335839598997, "loss": 0.24542784690856934, "mean_token_accuracy": 0.9083303511142731, "num_tokens": 3392400.0, "step": 275 }, { "entropy": 1.3298097252845764, "epoch": 0.14533965244865718, "grad_norm": 0.5581626296043396, "learning_rate": 0.00013784461152882208, "loss": 0.2682327330112457, "mean_token_accuracy": 0.8970459997653961, "num_tokens": 3404736.0, "step": 276 }, { "entropy": 1.2984472513198853, "epoch": 0.14586624539231174, "grad_norm": 0.5797234177589417, "learning_rate": 0.00013834586466165413, "loss": 0.2551107406616211, "mean_token_accuracy": 0.9025808274745941, "num_tokens": 3417072.0, "step": 277 }, { "entropy": 1.232091337442398, "epoch": 0.1463928383359663, "grad_norm": 0.56398606300354, "learning_rate": 0.00013884711779448624, "loss": 0.2523190379142761, "mean_token_accuracy": 0.9042512625455856, "num_tokens": 3429408.0, "step": 278 }, { "entropy": 1.364453375339508, "epoch": 0.14691943127962084, "grad_norm": 0.5884234309196472, "learning_rate": 0.0001393483709273183, "loss": 0.2788117229938507, "mean_token_accuracy": 0.90156190097332, "num_tokens": 3441744.0, "step": 279 }, { "entropy": 1.2391767501831055, "epoch": 0.1474460242232754, "grad_norm": 0.5528289079666138, "learning_rate": 0.0001398496240601504, "loss": 0.2562858760356903, "mean_token_accuracy": 0.905647337436676, "num_tokens": 3454080.0, "step": 280 }, { "entropy": 1.3013744056224823, "epoch": 0.14797261716692997, "grad_norm": 0.5353385806083679, "learning_rate": 0.00014035087719298245, "loss": 0.24675647914409637, "mean_token_accuracy": 0.9100503474473953, "num_tokens": 3466416.0, "step": 281 }, { "entropy": 1.2755855023860931, "epoch": 0.1484992101105845, "grad_norm": 0.5495297908782959, "learning_rate": 0.00014085213032581455, "loss": 0.2519223690032959, "mean_token_accuracy": 0.8966221362352371, "num_tokens": 3478752.0, "step": 282 }, { "entropy": 1.303219497203827, "epoch": 0.14902580305423907, "grad_norm": 0.5309876203536987, "learning_rate": 0.0001413533834586466, "loss": 0.24427109956741333, "mean_token_accuracy": 0.9075532704591751, "num_tokens": 3491088.0, "step": 283 }, { "entropy": 1.2614858448505402, "epoch": 0.14955239599789363, "grad_norm": 0.5807812809944153, "learning_rate": 0.0001418546365914787, "loss": 0.26809874176979065, "mean_token_accuracy": 0.899653896689415, "num_tokens": 3503424.0, "step": 284 }, { "entropy": 1.2611050605773926, "epoch": 0.1500789889415482, "grad_norm": 0.5592539310455322, "learning_rate": 0.0001423558897243108, "loss": 0.26588040590286255, "mean_token_accuracy": 0.8970725983381271, "num_tokens": 3515760.0, "step": 285 }, { "entropy": 1.2830645143985748, "epoch": 0.15060558188520273, "grad_norm": 0.5146520733833313, "learning_rate": 0.00014285714285714287, "loss": 0.24322782456874847, "mean_token_accuracy": 0.9055588096380234, "num_tokens": 3528096.0, "step": 286 }, { "entropy": 1.2292780876159668, "epoch": 0.1511321748288573, "grad_norm": 0.588441789150238, "learning_rate": 0.00014335839598997495, "loss": 0.2558269202709198, "mean_token_accuracy": 0.8964600563049316, "num_tokens": 3540432.0, "step": 287 }, { "entropy": 1.2410956919193268, "epoch": 0.15165876777251186, "grad_norm": 0.5761001706123352, "learning_rate": 0.00014385964912280703, "loss": 0.2511615455150604, "mean_token_accuracy": 0.9040048718452454, "num_tokens": 3552768.0, "step": 288 }, { "entropy": 1.3154540359973907, "epoch": 0.1521853607161664, "grad_norm": 0.6528503894805908, "learning_rate": 0.0001443609022556391, "loss": 0.2512635290622711, "mean_token_accuracy": 0.9024206399917603, "num_tokens": 3565104.0, "step": 289 }, { "entropy": 1.2947738468647003, "epoch": 0.15271195365982096, "grad_norm": 0.6061785221099854, "learning_rate": 0.00014486215538847118, "loss": 0.25342220067977905, "mean_token_accuracy": 0.9054669588804245, "num_tokens": 3577440.0, "step": 290 }, { "entropy": 1.2879831790924072, "epoch": 0.15323854660347552, "grad_norm": 0.5570182800292969, "learning_rate": 0.00014536340852130326, "loss": 0.27056393027305603, "mean_token_accuracy": 0.8992442786693573, "num_tokens": 3589776.0, "step": 291 }, { "entropy": 1.3449256420135498, "epoch": 0.15376513954713006, "grad_norm": 0.4950920045375824, "learning_rate": 0.00014586466165413534, "loss": 0.24097028374671936, "mean_token_accuracy": 0.9014376401901245, "num_tokens": 3602112.0, "step": 292 }, { "entropy": 1.4016221165657043, "epoch": 0.15429173249078462, "grad_norm": 0.554709792137146, "learning_rate": 0.00014636591478696742, "loss": 0.2270800769329071, "mean_token_accuracy": 0.9162011295557022, "num_tokens": 3614448.0, "step": 293 }, { "entropy": 1.514324426651001, "epoch": 0.15481832543443919, "grad_norm": 0.5531271696090698, "learning_rate": 0.0001468671679197995, "loss": 0.24683888256549835, "mean_token_accuracy": 0.9074130207300186, "num_tokens": 3626784.0, "step": 294 }, { "entropy": 1.471198707818985, "epoch": 0.15534491837809372, "grad_norm": 0.6712215542793274, "learning_rate": 0.00014736842105263158, "loss": 0.281759113073349, "mean_token_accuracy": 0.8955343812704086, "num_tokens": 3639120.0, "step": 295 }, { "entropy": 1.4630400836467743, "epoch": 0.15587151132174829, "grad_norm": 0.561416506767273, "learning_rate": 0.00014786967418546366, "loss": 0.275588721036911, "mean_token_accuracy": 0.8987540155649185, "num_tokens": 3651456.0, "step": 296 }, { "entropy": 1.491294264793396, "epoch": 0.15639810426540285, "grad_norm": 0.5332501530647278, "learning_rate": 0.00014837092731829574, "loss": 0.2502642273902893, "mean_token_accuracy": 0.9047496467828751, "num_tokens": 3663792.0, "step": 297 }, { "entropy": 1.3809879124164581, "epoch": 0.1569246972090574, "grad_norm": 0.499104768037796, "learning_rate": 0.00014887218045112784, "loss": 0.23079532384872437, "mean_token_accuracy": 0.909051313996315, "num_tokens": 3676128.0, "step": 298 }, { "entropy": 1.3202951848506927, "epoch": 0.15745129015271195, "grad_norm": 0.5114240646362305, "learning_rate": 0.0001493734335839599, "loss": 0.26147356629371643, "mean_token_accuracy": 0.9033501297235489, "num_tokens": 3688464.0, "step": 299 }, { "entropy": 1.3542028069496155, "epoch": 0.1579778830963665, "grad_norm": 0.492830753326416, "learning_rate": 0.000149874686716792, "loss": 0.2421473264694214, "mean_token_accuracy": 0.9081345945596695, "num_tokens": 3700800.0, "step": 300 }, { "entropy": 1.2910203635692596, "epoch": 0.15850447604002108, "grad_norm": 0.4862864911556244, "learning_rate": 0.00015037593984962405, "loss": 0.24877643585205078, "mean_token_accuracy": 0.9057342112064362, "num_tokens": 3713136.0, "step": 301 }, { "entropy": 1.3562625646591187, "epoch": 0.1590310689836756, "grad_norm": 0.6064998507499695, "learning_rate": 0.00015087719298245616, "loss": 0.2678510546684265, "mean_token_accuracy": 0.895992174744606, "num_tokens": 3725472.0, "step": 302 }, { "entropy": 1.3357418477535248, "epoch": 0.15955766192733017, "grad_norm": 0.5504618883132935, "learning_rate": 0.0001513784461152882, "loss": 0.24523413181304932, "mean_token_accuracy": 0.9103363454341888, "num_tokens": 3737808.0, "step": 303 }, { "entropy": 1.3335883915424347, "epoch": 0.16008425487098474, "grad_norm": 0.73444664478302, "learning_rate": 0.00015187969924812032, "loss": 0.2613740563392639, "mean_token_accuracy": 0.8996832072734833, "num_tokens": 3750144.0, "step": 304 }, { "entropy": 1.3423579335212708, "epoch": 0.16061084781463927, "grad_norm": 0.5342377424240112, "learning_rate": 0.00015238095238095237, "loss": 0.27072861790657043, "mean_token_accuracy": 0.8979348689317703, "num_tokens": 3762480.0, "step": 305 }, { "entropy": 1.2893436253070831, "epoch": 0.16113744075829384, "grad_norm": 0.49320632219314575, "learning_rate": 0.00015288220551378448, "loss": 0.24137352406978607, "mean_token_accuracy": 0.9123422801494598, "num_tokens": 3774816.0, "step": 306 }, { "entropy": 1.3107283115386963, "epoch": 0.1616640337019484, "grad_norm": 0.5037325620651245, "learning_rate": 0.00015338345864661653, "loss": 0.28284943103790283, "mean_token_accuracy": 0.8933527320623398, "num_tokens": 3787152.0, "step": 307 }, { "entropy": 1.2858748137950897, "epoch": 0.16219062664560294, "grad_norm": 0.7596031427383423, "learning_rate": 0.00015388471177944863, "loss": 0.2364031970500946, "mean_token_accuracy": 0.9070021212100983, "num_tokens": 3799488.0, "step": 308 }, { "entropy": 1.2649638950824738, "epoch": 0.1627172195892575, "grad_norm": 0.4712359607219696, "learning_rate": 0.0001543859649122807, "loss": 0.25866541266441345, "mean_token_accuracy": 0.8989972174167633, "num_tokens": 3811824.0, "step": 309 }, { "entropy": 1.1775002479553223, "epoch": 0.16324381253291206, "grad_norm": 0.47527384757995605, "learning_rate": 0.0001548872180451128, "loss": 0.22686654329299927, "mean_token_accuracy": 0.9112849235534668, "num_tokens": 3824160.0, "step": 310 }, { "entropy": 1.1848091185092926, "epoch": 0.16377040547656663, "grad_norm": 0.5009036064147949, "learning_rate": 0.00015538847117794487, "loss": 0.23199157416820526, "mean_token_accuracy": 0.9103835225105286, "num_tokens": 3836496.0, "step": 311 }, { "entropy": 1.1879796385765076, "epoch": 0.16429699842022116, "grad_norm": 0.530559778213501, "learning_rate": 0.00015588972431077695, "loss": 0.2687099277973175, "mean_token_accuracy": 0.9024157524108887, "num_tokens": 3848832.0, "step": 312 }, { "entropy": 1.1956203877925873, "epoch": 0.16482359136387573, "grad_norm": 0.5160781145095825, "learning_rate": 0.00015639097744360903, "loss": 0.24907854199409485, "mean_token_accuracy": 0.9046753495931625, "num_tokens": 3861168.0, "step": 313 }, { "entropy": 1.1685654819011688, "epoch": 0.1653501843075303, "grad_norm": 0.5312115550041199, "learning_rate": 0.0001568922305764411, "loss": 0.2576726973056793, "mean_token_accuracy": 0.9074427336454391, "num_tokens": 3873504.0, "step": 314 }, { "entropy": 1.1273577511310577, "epoch": 0.16587677725118483, "grad_norm": 0.6181286573410034, "learning_rate": 0.00015739348370927319, "loss": 0.23891520500183105, "mean_token_accuracy": 0.9119571298360825, "num_tokens": 3885840.0, "step": 315 }, { "entropy": 1.2541460990905762, "epoch": 0.1664033701948394, "grad_norm": 0.4766935408115387, "learning_rate": 0.00015789473684210527, "loss": 0.25483545660972595, "mean_token_accuracy": 0.8961910307407379, "num_tokens": 3898176.0, "step": 316 }, { "entropy": 1.1125807464122772, "epoch": 0.16692996313849395, "grad_norm": 0.5105007886886597, "learning_rate": 0.00015839598997493734, "loss": 0.2685958445072174, "mean_token_accuracy": 0.8989451825618744, "num_tokens": 3910512.0, "step": 317 }, { "entropy": 1.2121298015117645, "epoch": 0.1674565560821485, "grad_norm": 0.44646549224853516, "learning_rate": 0.00015889724310776942, "loss": 0.253686785697937, "mean_token_accuracy": 0.9083440899848938, "num_tokens": 3922848.0, "step": 318 }, { "entropy": 1.1011106967926025, "epoch": 0.16798314902580305, "grad_norm": 0.46656280755996704, "learning_rate": 0.0001593984962406015, "loss": 0.2927643060684204, "mean_token_accuracy": 0.8931492418050766, "num_tokens": 3935184.0, "step": 319 }, { "entropy": 1.1864506900310516, "epoch": 0.16850974196945762, "grad_norm": 0.4583514332771301, "learning_rate": 0.00015989974937343358, "loss": 0.22579318284988403, "mean_token_accuracy": 0.9128856211900711, "num_tokens": 3947520.0, "step": 320 }, { "entropy": 1.113357663154602, "epoch": 0.16903633491311215, "grad_norm": 0.5008531212806702, "learning_rate": 0.00016040100250626566, "loss": 0.2566073536872864, "mean_token_accuracy": 0.9067006707191467, "num_tokens": 3959856.0, "step": 321 }, { "entropy": 1.1666322350502014, "epoch": 0.16956292785676672, "grad_norm": 0.5016852021217346, "learning_rate": 0.00016090225563909777, "loss": 0.24807997047901154, "mean_token_accuracy": 0.9074774533510208, "num_tokens": 3972192.0, "step": 322 }, { "entropy": 1.0860579013824463, "epoch": 0.17008952080042128, "grad_norm": 0.5153301358222961, "learning_rate": 0.00016140350877192982, "loss": 0.2500810921192169, "mean_token_accuracy": 0.9049581736326218, "num_tokens": 3984528.0, "step": 323 }, { "entropy": 1.0754130184650421, "epoch": 0.17061611374407584, "grad_norm": 0.5485661625862122, "learning_rate": 0.00016190476190476192, "loss": 0.3087775707244873, "mean_token_accuracy": 0.8840746134519577, "num_tokens": 3996864.0, "step": 324 }, { "entropy": 1.097093939781189, "epoch": 0.17114270668773038, "grad_norm": 0.4524535834789276, "learning_rate": 0.00016240601503759398, "loss": 0.2556874454021454, "mean_token_accuracy": 0.9040686786174774, "num_tokens": 4009200.0, "step": 325 }, { "entropy": 1.0161993354558945, "epoch": 0.17166929963138494, "grad_norm": 0.5920532941818237, "learning_rate": 0.00016290726817042608, "loss": 0.2545970678329468, "mean_token_accuracy": 0.9038624912500381, "num_tokens": 4021536.0, "step": 326 }, { "entropy": 1.045365571975708, "epoch": 0.1721958925750395, "grad_norm": 0.5128290057182312, "learning_rate": 0.00016340852130325813, "loss": 0.23849724233150482, "mean_token_accuracy": 0.9063487350940704, "num_tokens": 4033872.0, "step": 327 }, { "entropy": 1.0524345636367798, "epoch": 0.17272248551869404, "grad_norm": 0.5058865547180176, "learning_rate": 0.00016390977443609024, "loss": 0.25231170654296875, "mean_token_accuracy": 0.9029942154884338, "num_tokens": 4046208.0, "step": 328 }, { "entropy": 1.1274868845939636, "epoch": 0.1732490784623486, "grad_norm": 0.5103746652603149, "learning_rate": 0.0001644110275689223, "loss": 0.26119422912597656, "mean_token_accuracy": 0.8970126211643219, "num_tokens": 4058544.0, "step": 329 }, { "entropy": 1.13772451877594, "epoch": 0.17377567140600317, "grad_norm": 0.463789701461792, "learning_rate": 0.0001649122807017544, "loss": 0.23172324895858765, "mean_token_accuracy": 0.9090371131896973, "num_tokens": 4070880.0, "step": 330 }, { "entropy": 1.1093823909759521, "epoch": 0.1743022643496577, "grad_norm": 0.4940638542175293, "learning_rate": 0.00016541353383458648, "loss": 0.25032839179039, "mean_token_accuracy": 0.9061925411224365, "num_tokens": 4083216.0, "step": 331 }, { "entropy": 1.0906598567962646, "epoch": 0.17482885729331227, "grad_norm": 0.5244042873382568, "learning_rate": 0.00016591478696741856, "loss": 0.2559994161128998, "mean_token_accuracy": 0.9056536555290222, "num_tokens": 4095552.0, "step": 332 }, { "entropy": 1.0064781606197357, "epoch": 0.17535545023696683, "grad_norm": 0.5328090786933899, "learning_rate": 0.00016641604010025064, "loss": 0.2423868030309677, "mean_token_accuracy": 0.9023227244615555, "num_tokens": 4107888.0, "step": 333 }, { "entropy": 0.9421130269765854, "epoch": 0.17588204318062137, "grad_norm": 0.4938746392726898, "learning_rate": 0.00016691729323308271, "loss": 0.2487686276435852, "mean_token_accuracy": 0.9072201699018478, "num_tokens": 4120224.0, "step": 334 }, { "entropy": 0.8471245914697647, "epoch": 0.17640863612427593, "grad_norm": 0.4719039499759674, "learning_rate": 0.0001674185463659148, "loss": 0.2677307426929474, "mean_token_accuracy": 0.89954973757267, "num_tokens": 4132560.0, "step": 335 }, { "entropy": 0.7532882988452911, "epoch": 0.1769352290679305, "grad_norm": 0.4836346209049225, "learning_rate": 0.00016791979949874687, "loss": 0.2508479356765747, "mean_token_accuracy": 0.9021095633506775, "num_tokens": 4144896.0, "step": 336 }, { "entropy": 0.6489329487085342, "epoch": 0.17746182201158506, "grad_norm": 0.5742446184158325, "learning_rate": 0.00016842105263157895, "loss": 0.2582406997680664, "mean_token_accuracy": 0.9013715237379074, "num_tokens": 4157232.0, "step": 337 }, { "entropy": 0.6537502855062485, "epoch": 0.1779884149552396, "grad_norm": 0.5390785336494446, "learning_rate": 0.00016892230576441103, "loss": 0.2649543881416321, "mean_token_accuracy": 0.8998610377311707, "num_tokens": 4169568.0, "step": 338 }, { "entropy": 0.6827399134635925, "epoch": 0.17851500789889416, "grad_norm": 0.507554829120636, "learning_rate": 0.0001694235588972431, "loss": 0.27018067240715027, "mean_token_accuracy": 0.8985839486122131, "num_tokens": 4181904.0, "step": 339 }, { "entropy": 0.7333462089300156, "epoch": 0.17904160084254872, "grad_norm": 0.4551506042480469, "learning_rate": 0.0001699248120300752, "loss": 0.25013625621795654, "mean_token_accuracy": 0.9111319333314896, "num_tokens": 4194240.0, "step": 340 }, { "entropy": 0.7495439946651459, "epoch": 0.17956819378620326, "grad_norm": 0.48456624150276184, "learning_rate": 0.00017042606516290727, "loss": 0.2707773745059967, "mean_token_accuracy": 0.8947316855192184, "num_tokens": 4206576.0, "step": 341 }, { "entropy": 0.7812775671482086, "epoch": 0.18009478672985782, "grad_norm": 0.4550190269947052, "learning_rate": 0.00017092731829573935, "loss": 0.2396947741508484, "mean_token_accuracy": 0.910267636179924, "num_tokens": 4218912.0, "step": 342 }, { "entropy": 0.9400374740362167, "epoch": 0.18062137967351238, "grad_norm": 0.5784738659858704, "learning_rate": 0.00017142857142857143, "loss": 0.26176217198371887, "mean_token_accuracy": 0.9009139388799667, "num_tokens": 4231248.0, "step": 343 }, { "entropy": 0.937469407916069, "epoch": 0.18114797261716692, "grad_norm": 0.5101773738861084, "learning_rate": 0.00017192982456140353, "loss": 0.222784623503685, "mean_token_accuracy": 0.9079811573028564, "num_tokens": 4243584.0, "step": 344 }, { "entropy": 0.9701919555664062, "epoch": 0.18167456556082148, "grad_norm": 0.4810556471347809, "learning_rate": 0.00017243107769423558, "loss": 0.25527724623680115, "mean_token_accuracy": 0.8977989107370377, "num_tokens": 4255920.0, "step": 345 }, { "entropy": 1.0421793162822723, "epoch": 0.18220115850447605, "grad_norm": 0.49446040391921997, "learning_rate": 0.0001729323308270677, "loss": 0.24790042638778687, "mean_token_accuracy": 0.9076082557439804, "num_tokens": 4268256.0, "step": 346 }, { "entropy": 1.0526159405708313, "epoch": 0.18272775144813058, "grad_norm": 0.5106586217880249, "learning_rate": 0.00017343358395989974, "loss": 0.258137047290802, "mean_token_accuracy": 0.9013570845127106, "num_tokens": 4280592.0, "step": 347 }, { "entropy": 1.0377429127693176, "epoch": 0.18325434439178515, "grad_norm": 0.5372883677482605, "learning_rate": 0.00017393483709273185, "loss": 0.2536155879497528, "mean_token_accuracy": 0.9079491943120956, "num_tokens": 4292928.0, "step": 348 }, { "entropy": 1.1226612329483032, "epoch": 0.1837809373354397, "grad_norm": 0.506536066532135, "learning_rate": 0.0001744360902255639, "loss": 0.2503521740436554, "mean_token_accuracy": 0.9043506681919098, "num_tokens": 4305264.0, "step": 349 }, { "entropy": 1.0955768823623657, "epoch": 0.18430753027909427, "grad_norm": 0.450717031955719, "learning_rate": 0.000174937343358396, "loss": 0.2611716687679291, "mean_token_accuracy": 0.9029702991247177, "num_tokens": 4317600.0, "step": 350 }, { "entropy": 1.1000354140996933, "epoch": 0.1848341232227488, "grad_norm": 0.5249627828598022, "learning_rate": 0.00017543859649122806, "loss": 0.23257189989089966, "mean_token_accuracy": 0.9120175540447235, "num_tokens": 4329936.0, "step": 351 }, { "entropy": 1.086414873600006, "epoch": 0.18536071616640337, "grad_norm": 0.488702654838562, "learning_rate": 0.00017593984962406016, "loss": 0.246709406375885, "mean_token_accuracy": 0.9029638320207596, "num_tokens": 4342272.0, "step": 352 }, { "entropy": 1.0042328536510468, "epoch": 0.18588730911005794, "grad_norm": 0.41849616169929504, "learning_rate": 0.00017644110275689224, "loss": 0.21574650704860687, "mean_token_accuracy": 0.9175253808498383, "num_tokens": 4354608.0, "step": 353 }, { "entropy": 1.0020455569028854, "epoch": 0.18641390205371247, "grad_norm": 0.46401116251945496, "learning_rate": 0.00017694235588972432, "loss": 0.2567673325538635, "mean_token_accuracy": 0.9054214805364609, "num_tokens": 4366944.0, "step": 354 }, { "entropy": 1.0092186033725739, "epoch": 0.18694049499736703, "grad_norm": 0.47048723697662354, "learning_rate": 0.0001774436090225564, "loss": 0.24711501598358154, "mean_token_accuracy": 0.9056050777435303, "num_tokens": 4379280.0, "step": 355 }, { "entropy": 0.9878545552492142, "epoch": 0.1874670879410216, "grad_norm": 0.47208353877067566, "learning_rate": 0.00017794486215538848, "loss": 0.2748403549194336, "mean_token_accuracy": 0.8964878469705582, "num_tokens": 4391616.0, "step": 356 }, { "entropy": 0.9895420670509338, "epoch": 0.18799368088467613, "grad_norm": 0.503665566444397, "learning_rate": 0.00017844611528822056, "loss": 0.24393996596336365, "mean_token_accuracy": 0.9081792533397675, "num_tokens": 4403952.0, "step": 357 }, { "entropy": 0.983001708984375, "epoch": 0.1885202738283307, "grad_norm": 0.5069933533668518, "learning_rate": 0.00017894736842105264, "loss": 0.2519129514694214, "mean_token_accuracy": 0.9055497497320175, "num_tokens": 4416288.0, "step": 358 }, { "entropy": 0.9950737804174423, "epoch": 0.18904686677198526, "grad_norm": 0.4974028766155243, "learning_rate": 0.00017944862155388472, "loss": 0.26243290305137634, "mean_token_accuracy": 0.8986903131008148, "num_tokens": 4428624.0, "step": 359 }, { "entropy": 1.0079210847616196, "epoch": 0.1895734597156398, "grad_norm": 0.5110583901405334, "learning_rate": 0.0001799498746867168, "loss": 0.2294146716594696, "mean_token_accuracy": 0.9131651520729065, "num_tokens": 4440960.0, "step": 360 }, { "entropy": 1.0026690363883972, "epoch": 0.19010005265929436, "grad_norm": 0.4598653316497803, "learning_rate": 0.00018045112781954887, "loss": 0.2722235321998596, "mean_token_accuracy": 0.8976626545190811, "num_tokens": 4453296.0, "step": 361 }, { "entropy": 1.0199629068374634, "epoch": 0.19062664560294892, "grad_norm": 0.4637596905231476, "learning_rate": 0.00018095238095238095, "loss": 0.2665867507457733, "mean_token_accuracy": 0.9000826925039291, "num_tokens": 4465632.0, "step": 362 }, { "entropy": 1.0425358265638351, "epoch": 0.1911532385466035, "grad_norm": 0.47371116280555725, "learning_rate": 0.00018145363408521303, "loss": 0.261046439409256, "mean_token_accuracy": 0.8978727906942368, "num_tokens": 4477968.0, "step": 363 }, { "entropy": 1.0688822865486145, "epoch": 0.19167983149025802, "grad_norm": 0.588598370552063, "learning_rate": 0.0001819548872180451, "loss": 0.2722393274307251, "mean_token_accuracy": 0.8954607844352722, "num_tokens": 4490304.0, "step": 364 }, { "entropy": 1.0311770141124725, "epoch": 0.1922064244339126, "grad_norm": 0.6127772331237793, "learning_rate": 0.0001824561403508772, "loss": 0.26557645201683044, "mean_token_accuracy": 0.898269534111023, "num_tokens": 4502640.0, "step": 365 }, { "entropy": 1.023191675543785, "epoch": 0.19273301737756715, "grad_norm": 0.4277988076210022, "learning_rate": 0.0001829573934837093, "loss": 0.25198060274124146, "mean_token_accuracy": 0.9041500091552734, "num_tokens": 4514976.0, "step": 366 }, { "entropy": 0.992491751909256, "epoch": 0.1932596103212217, "grad_norm": 0.4713631272315979, "learning_rate": 0.00018345864661654135, "loss": 0.25175848603248596, "mean_token_accuracy": 0.9065804481506348, "num_tokens": 4527312.0, "step": 367 }, { "entropy": 0.9969351142644882, "epoch": 0.19378620326487625, "grad_norm": 0.4729400873184204, "learning_rate": 0.00018395989974937345, "loss": 0.2526015341281891, "mean_token_accuracy": 0.9010139107704163, "num_tokens": 4539648.0, "step": 368 }, { "entropy": 1.0536664575338364, "epoch": 0.1943127962085308, "grad_norm": 0.5235168933868408, "learning_rate": 0.0001844611528822055, "loss": 0.292032927274704, "mean_token_accuracy": 0.8931012600660324, "num_tokens": 4551984.0, "step": 369 }, { "entropy": 1.042996197938919, "epoch": 0.19483938915218535, "grad_norm": 0.48083820939064026, "learning_rate": 0.0001849624060150376, "loss": 0.26578348875045776, "mean_token_accuracy": 0.9036569446325302, "num_tokens": 4564320.0, "step": 370 }, { "entropy": 1.0278095752000809, "epoch": 0.1953659820958399, "grad_norm": 0.39684435725212097, "learning_rate": 0.00018546365914786966, "loss": 0.23184379935264587, "mean_token_accuracy": 0.9090972989797592, "num_tokens": 4576656.0, "step": 371 }, { "entropy": 1.0532077848911285, "epoch": 0.19589257503949448, "grad_norm": 0.40189671516418457, "learning_rate": 0.00018596491228070177, "loss": 0.22099974751472473, "mean_token_accuracy": 0.9153455793857574, "num_tokens": 4588992.0, "step": 372 }, { "entropy": 1.090534657239914, "epoch": 0.196419167983149, "grad_norm": 0.4149918258190155, "learning_rate": 0.00018646616541353382, "loss": 0.26646703481674194, "mean_token_accuracy": 0.8960744440555573, "num_tokens": 4601328.0, "step": 373 }, { "entropy": 1.1020061373710632, "epoch": 0.19694576092680358, "grad_norm": 0.4702380299568176, "learning_rate": 0.00018696741854636593, "loss": 0.221252903342247, "mean_token_accuracy": 0.9114280194044113, "num_tokens": 4613664.0, "step": 374 }, { "entropy": 1.0703049004077911, "epoch": 0.19747235387045814, "grad_norm": 0.3877512216567993, "learning_rate": 0.00018746867167919798, "loss": 0.2393355667591095, "mean_token_accuracy": 0.9077306538820267, "num_tokens": 4626000.0, "step": 375 }, { "entropy": 1.1242592930793762, "epoch": 0.1979989468141127, "grad_norm": 0.4995574355125427, "learning_rate": 0.00018796992481203009, "loss": 0.26316261291503906, "mean_token_accuracy": 0.9027625322341919, "num_tokens": 4638336.0, "step": 376 }, { "entropy": 1.1577873229980469, "epoch": 0.19852553975776724, "grad_norm": 0.5234032273292542, "learning_rate": 0.00018847117794486217, "loss": 0.27375704050064087, "mean_token_accuracy": 0.8979371786117554, "num_tokens": 4650672.0, "step": 377 }, { "entropy": 1.1344494223594666, "epoch": 0.1990521327014218, "grad_norm": 0.5000519752502441, "learning_rate": 0.00018897243107769424, "loss": 0.26018521189689636, "mean_token_accuracy": 0.9034091979265213, "num_tokens": 4663008.0, "step": 378 }, { "entropy": 1.2858175039291382, "epoch": 0.19957872564507637, "grad_norm": 0.4786364436149597, "learning_rate": 0.00018947368421052632, "loss": 0.2609444260597229, "mean_token_accuracy": 0.8963579833507538, "num_tokens": 4675344.0, "step": 379 }, { "entropy": 1.205563873052597, "epoch": 0.2001053185887309, "grad_norm": 0.49225375056266785, "learning_rate": 0.0001899749373433584, "loss": 0.2702328562736511, "mean_token_accuracy": 0.89518603682518, "num_tokens": 4687680.0, "step": 380 }, { "entropy": 1.2623814940452576, "epoch": 0.20063191153238547, "grad_norm": 0.4847429692745209, "learning_rate": 0.00019047619047619048, "loss": 0.23678088188171387, "mean_token_accuracy": 0.9141177982091904, "num_tokens": 4700016.0, "step": 381 }, { "entropy": 1.2621397376060486, "epoch": 0.20115850447604003, "grad_norm": 0.42388200759887695, "learning_rate": 0.00019097744360902256, "loss": 0.22780729830265045, "mean_token_accuracy": 0.9121877998113632, "num_tokens": 4712352.0, "step": 382 }, { "entropy": 1.292501300573349, "epoch": 0.20168509741969456, "grad_norm": 0.4779922366142273, "learning_rate": 0.00019147869674185464, "loss": 0.2594977915287018, "mean_token_accuracy": 0.9015758037567139, "num_tokens": 4724688.0, "step": 383 }, { "entropy": 1.2592476904392242, "epoch": 0.20221169036334913, "grad_norm": 0.5031237006187439, "learning_rate": 0.00019197994987468672, "loss": 0.2655055820941925, "mean_token_accuracy": 0.8991453051567078, "num_tokens": 4737024.0, "step": 384 }, { "entropy": 1.2670154571533203, "epoch": 0.2027382833070037, "grad_norm": 0.43786391615867615, "learning_rate": 0.0001924812030075188, "loss": 0.2638092637062073, "mean_token_accuracy": 0.9021878391504288, "num_tokens": 4749360.0, "step": 385 }, { "entropy": 1.2625199258327484, "epoch": 0.20326487625065823, "grad_norm": 0.6012351512908936, "learning_rate": 0.00019298245614035088, "loss": 0.25398504734039307, "mean_token_accuracy": 0.9037431925535202, "num_tokens": 4761696.0, "step": 386 }, { "entropy": 1.2534445226192474, "epoch": 0.2037914691943128, "grad_norm": 0.48004376888275146, "learning_rate": 0.00019348370927318296, "loss": 0.24518710374832153, "mean_token_accuracy": 0.9088338762521744, "num_tokens": 4774032.0, "step": 387 }, { "entropy": 1.2239902317523956, "epoch": 0.20431806213796735, "grad_norm": 0.40316712856292725, "learning_rate": 0.00019398496240601503, "loss": 0.22658605873584747, "mean_token_accuracy": 0.9146187752485275, "num_tokens": 4786368.0, "step": 388 }, { "entropy": 1.236211746931076, "epoch": 0.20484465508162192, "grad_norm": 0.4805733859539032, "learning_rate": 0.0001944862155388471, "loss": 0.2645362615585327, "mean_token_accuracy": 0.899237260222435, "num_tokens": 4798704.0, "step": 389 }, { "entropy": 1.2168347239494324, "epoch": 0.20537124802527645, "grad_norm": 0.4017006754875183, "learning_rate": 0.00019498746867167922, "loss": 0.23945499956607819, "mean_token_accuracy": 0.9106440991163254, "num_tokens": 4811040.0, "step": 390 }, { "entropy": 1.2192648351192474, "epoch": 0.20589784096893102, "grad_norm": 0.4144308269023895, "learning_rate": 0.00019548872180451127, "loss": 0.24552568793296814, "mean_token_accuracy": 0.9093390554189682, "num_tokens": 4823376.0, "step": 391 }, { "entropy": 1.2436101734638214, "epoch": 0.20642443391258558, "grad_norm": 0.4212309420108795, "learning_rate": 0.00019598997493734338, "loss": 0.23153892159461975, "mean_token_accuracy": 0.9111403673887253, "num_tokens": 4835712.0, "step": 392 }, { "entropy": 1.255335807800293, "epoch": 0.20695102685624012, "grad_norm": 0.40789833664894104, "learning_rate": 0.00019649122807017543, "loss": 0.22183379530906677, "mean_token_accuracy": 0.9136195629835129, "num_tokens": 4848048.0, "step": 393 }, { "entropy": 1.2751134932041168, "epoch": 0.20747761979989468, "grad_norm": 0.4400269091129303, "learning_rate": 0.00019699248120300754, "loss": 0.24014121294021606, "mean_token_accuracy": 0.9085260182619095, "num_tokens": 4860384.0, "step": 394 }, { "entropy": 1.360796719789505, "epoch": 0.20800421274354924, "grad_norm": 0.4804284870624542, "learning_rate": 0.0001974937343358396, "loss": 0.25582095980644226, "mean_token_accuracy": 0.9006912261247635, "num_tokens": 4872720.0, "step": 395 }, { "entropy": 1.3161850571632385, "epoch": 0.20853080568720378, "grad_norm": 0.43244144320487976, "learning_rate": 0.0001979949874686717, "loss": 0.2349988967180252, "mean_token_accuracy": 0.9116800725460052, "num_tokens": 4885056.0, "step": 396 }, { "entropy": 1.3374731242656708, "epoch": 0.20905739863085834, "grad_norm": 0.4748205840587616, "learning_rate": 0.00019849624060150375, "loss": 0.22185081243515015, "mean_token_accuracy": 0.9125295132398605, "num_tokens": 4897392.0, "step": 397 }, { "entropy": 1.3775228261947632, "epoch": 0.2095839915745129, "grad_norm": 0.4581362307071686, "learning_rate": 0.00019899749373433585, "loss": 0.2567383646965027, "mean_token_accuracy": 0.9047663658857346, "num_tokens": 4909728.0, "step": 398 }, { "entropy": 1.4304566085338593, "epoch": 0.21011058451816747, "grad_norm": 0.5330026149749756, "learning_rate": 0.00019949874686716793, "loss": 0.24410131573677063, "mean_token_accuracy": 0.9004727154970169, "num_tokens": 4922064.0, "step": 399 }, { "entropy": 1.4176018834114075, "epoch": 0.210637177461822, "grad_norm": 0.5187347531318665, "learning_rate": 0.0002, "loss": 0.2622545063495636, "mean_token_accuracy": 0.8981441259384155, "num_tokens": 4934400.0, "step": 400 }, { "entropy": 1.3980787992477417, "epoch": 0.21116377040547657, "grad_norm": 0.4053288400173187, "learning_rate": 0.0001999999973286123, "loss": 0.23980936408042908, "mean_token_accuracy": 0.912782147526741, "num_tokens": 4946736.0, "step": 401 }, { "entropy": 1.4483689367771149, "epoch": 0.21169036334913113, "grad_norm": 0.45620113611221313, "learning_rate": 0.00019999998931444929, "loss": 0.25808754563331604, "mean_token_accuracy": 0.9030732810497284, "num_tokens": 4959072.0, "step": 402 }, { "entropy": 1.4470272064208984, "epoch": 0.21221695629278567, "grad_norm": 0.45807719230651855, "learning_rate": 0.0001999999759575115, "loss": 0.258093923330307, "mean_token_accuracy": 0.9026659429073334, "num_tokens": 4971408.0, "step": 403 }, { "entropy": 1.425654649734497, "epoch": 0.21274354923644023, "grad_norm": 0.4397832751274109, "learning_rate": 0.0001999999572577997, "loss": 0.24665014445781708, "mean_token_accuracy": 0.9062764793634415, "num_tokens": 4983744.0, "step": 404 }, { "entropy": 1.5687190890312195, "epoch": 0.2132701421800948, "grad_norm": 0.5367022156715393, "learning_rate": 0.00019999993321531494, "loss": 0.24174389243125916, "mean_token_accuracy": 0.9081769734621048, "num_tokens": 4996080.0, "step": 405 }, { "entropy": 1.405859649181366, "epoch": 0.21379673512374933, "grad_norm": 0.4007917046546936, "learning_rate": 0.00019999990383005872, "loss": 0.25402745604515076, "mean_token_accuracy": 0.9025277644395828, "num_tokens": 5008416.0, "step": 406 }, { "entropy": 1.4313717782497406, "epoch": 0.2143233280674039, "grad_norm": 0.4160802662372589, "learning_rate": 0.00019999986910203282, "loss": 0.24924606084823608, "mean_token_accuracy": 0.9043161869049072, "num_tokens": 5020752.0, "step": 407 }, { "entropy": 1.4701331555843353, "epoch": 0.21484992101105846, "grad_norm": 0.4316672086715698, "learning_rate": 0.00019999982903123921, "loss": 0.2638508379459381, "mean_token_accuracy": 0.8981801271438599, "num_tokens": 5033088.0, "step": 408 }, { "entropy": 1.4392390549182892, "epoch": 0.215376513954713, "grad_norm": 0.4544552266597748, "learning_rate": 0.00019999978361768031, "loss": 0.23990359902381897, "mean_token_accuracy": 0.9076667875051498, "num_tokens": 5045424.0, "step": 409 }, { "entropy": 1.4876410961151123, "epoch": 0.21590310689836756, "grad_norm": 0.4295142889022827, "learning_rate": 0.00019999973286135886, "loss": 0.21840089559555054, "mean_token_accuracy": 0.9214875847101212, "num_tokens": 5057760.0, "step": 410 }, { "entropy": 1.50434610247612, "epoch": 0.21642969984202212, "grad_norm": 0.4359295070171356, "learning_rate": 0.00019999967676227775, "loss": 0.2510741353034973, "mean_token_accuracy": 0.9052848815917969, "num_tokens": 5070096.0, "step": 411 }, { "entropy": 1.4829690754413605, "epoch": 0.21695629278567669, "grad_norm": 0.42792809009552, "learning_rate": 0.00019999961532044045, "loss": 0.2551060616970062, "mean_token_accuracy": 0.9011600762605667, "num_tokens": 5082432.0, "step": 412 }, { "entropy": 1.4852145910263062, "epoch": 0.21748288572933122, "grad_norm": 0.4182438850402832, "learning_rate": 0.00019999954853585052, "loss": 0.24789488315582275, "mean_token_accuracy": 0.9069723039865494, "num_tokens": 5094768.0, "step": 413 }, { "entropy": 1.4210355281829834, "epoch": 0.21800947867298578, "grad_norm": 0.42366713285446167, "learning_rate": 0.00019999947640851195, "loss": 0.24643118679523468, "mean_token_accuracy": 0.9047895669937134, "num_tokens": 5107104.0, "step": 414 }, { "entropy": 1.525164395570755, "epoch": 0.21853607161664035, "grad_norm": 0.4372459352016449, "learning_rate": 0.00019999939893842905, "loss": 0.2424328625202179, "mean_token_accuracy": 0.9087924510240555, "num_tokens": 5119440.0, "step": 415 }, { "entropy": 1.4822115898132324, "epoch": 0.21906266456029488, "grad_norm": 0.4659183919429779, "learning_rate": 0.00019999931612560637, "loss": 0.22431665658950806, "mean_token_accuracy": 0.9165952354669571, "num_tokens": 5131776.0, "step": 416 }, { "entropy": 1.5467821657657623, "epoch": 0.21958925750394945, "grad_norm": 0.44125568866729736, "learning_rate": 0.00019999922797004884, "loss": 0.23688746988773346, "mean_token_accuracy": 0.9075507670640945, "num_tokens": 5144112.0, "step": 417 }, { "entropy": 1.4780353605747223, "epoch": 0.220115850447604, "grad_norm": 0.43714895844459534, "learning_rate": 0.00019999913447176174, "loss": 0.24803104996681213, "mean_token_accuracy": 0.9086460769176483, "num_tokens": 5156448.0, "step": 418 }, { "entropy": 1.442844033241272, "epoch": 0.22064244339125855, "grad_norm": 0.5062248110771179, "learning_rate": 0.00019999903563075051, "loss": 0.2509956657886505, "mean_token_accuracy": 0.9084739983081818, "num_tokens": 5168784.0, "step": 419 }, { "entropy": 1.472544252872467, "epoch": 0.2211690363349131, "grad_norm": 0.44560346007347107, "learning_rate": 0.00019999893144702116, "loss": 0.2571001648902893, "mean_token_accuracy": 0.9050741344690323, "num_tokens": 5181120.0, "step": 420 }, { "entropy": 1.4741449654102325, "epoch": 0.22169562927856767, "grad_norm": 0.468660444021225, "learning_rate": 0.00019999882192057975, "loss": 0.2654499113559723, "mean_token_accuracy": 0.9030983746051788, "num_tokens": 5193456.0, "step": 421 }, { "entropy": 1.4696997106075287, "epoch": 0.2222222222222222, "grad_norm": 0.42363062500953674, "learning_rate": 0.0001999987070514329, "loss": 0.2351139783859253, "mean_token_accuracy": 0.9069055020809174, "num_tokens": 5205792.0, "step": 422 }, { "entropy": 1.452900618314743, "epoch": 0.22274881516587677, "grad_norm": 0.45147648453712463, "learning_rate": 0.00019999858683958726, "loss": 0.236272394657135, "mean_token_accuracy": 0.9084236770868301, "num_tokens": 5218128.0, "step": 423 }, { "entropy": 1.5096050798892975, "epoch": 0.22327540810953134, "grad_norm": 0.4349573850631714, "learning_rate": 0.00019999846128505015, "loss": 0.21908816695213318, "mean_token_accuracy": 0.9153110533952713, "num_tokens": 5230464.0, "step": 424 }, { "entropy": 1.5504009425640106, "epoch": 0.2238020010531859, "grad_norm": 0.40080899000167847, "learning_rate": 0.00019999833038782897, "loss": 0.21589110791683197, "mean_token_accuracy": 0.9171598702669144, "num_tokens": 5242800.0, "step": 425 }, { "entropy": 1.4936735033988953, "epoch": 0.22432859399684044, "grad_norm": 0.4071311056613922, "learning_rate": 0.0001999981941479314, "loss": 0.2125779092311859, "mean_token_accuracy": 0.9237974286079407, "num_tokens": 5255136.0, "step": 426 }, { "entropy": 1.5081810355186462, "epoch": 0.224855186940495, "grad_norm": 0.4242808222770691, "learning_rate": 0.0001999980525653656, "loss": 0.2447715699672699, "mean_token_accuracy": 0.9042525738477707, "num_tokens": 5267472.0, "step": 427 }, { "entropy": 1.5077386796474457, "epoch": 0.22538177988414956, "grad_norm": 0.5070521235466003, "learning_rate": 0.00019999790564014, "loss": 0.26209956407546997, "mean_token_accuracy": 0.9026446640491486, "num_tokens": 5279808.0, "step": 428 }, { "entropy": 1.4962070286273956, "epoch": 0.2259083728278041, "grad_norm": 0.6017259955406189, "learning_rate": 0.00019999775337226327, "loss": 0.3165000081062317, "mean_token_accuracy": 0.8868077397346497, "num_tokens": 5292144.0, "step": 429 }, { "entropy": 1.4911207258701324, "epoch": 0.22643496577145866, "grad_norm": 0.47006961703300476, "learning_rate": 0.00019999759576174448, "loss": 0.22799812257289886, "mean_token_accuracy": 0.9069435149431229, "num_tokens": 5304480.0, "step": 430 }, { "entropy": 1.5028018951416016, "epoch": 0.22696155871511323, "grad_norm": 0.4170990288257599, "learning_rate": 0.00019999743280859296, "loss": 0.21681472659111023, "mean_token_accuracy": 0.9184076339006424, "num_tokens": 5316816.0, "step": 431 }, { "entropy": 1.6698609590530396, "epoch": 0.22748815165876776, "grad_norm": 0.6547060012817383, "learning_rate": 0.0001999972645128184, "loss": 0.24768398702144623, "mean_token_accuracy": 0.9032211750745773, "num_tokens": 5329152.0, "step": 432 }, { "entropy": 1.549822211265564, "epoch": 0.22801474460242233, "grad_norm": 0.433370441198349, "learning_rate": 0.00019999709087443083, "loss": 0.24651046097278595, "mean_token_accuracy": 0.9072823375463486, "num_tokens": 5341488.0, "step": 433 }, { "entropy": 1.5724502205848694, "epoch": 0.2285413375460769, "grad_norm": 0.5081071853637695, "learning_rate": 0.00019999691189344045, "loss": 0.2539141774177551, "mean_token_accuracy": 0.901251494884491, "num_tokens": 5353824.0, "step": 434 }, { "entropy": 1.580730140209198, "epoch": 0.22906793048973143, "grad_norm": 0.4615112841129303, "learning_rate": 0.000199996727569858, "loss": 0.23179525136947632, "mean_token_accuracy": 0.9096536040306091, "num_tokens": 5366160.0, "step": 435 }, { "entropy": 1.6549272239208221, "epoch": 0.229594523433386, "grad_norm": 0.6388656497001648, "learning_rate": 0.00019999653790369438, "loss": 0.29721513390541077, "mean_token_accuracy": 0.8857980072498322, "num_tokens": 5378496.0, "step": 436 }, { "entropy": 1.6025878190994263, "epoch": 0.23012111637704055, "grad_norm": 0.49696317315101624, "learning_rate": 0.0001999963428949608, "loss": 0.2271474003791809, "mean_token_accuracy": 0.9138942360877991, "num_tokens": 5390832.0, "step": 437 }, { "entropy": 1.5836864113807678, "epoch": 0.23064770932069512, "grad_norm": 0.4876512289047241, "learning_rate": 0.00019999614254366895, "loss": 0.24330684542655945, "mean_token_accuracy": 0.9093976020812988, "num_tokens": 5403168.0, "step": 438 }, { "entropy": 1.5200332999229431, "epoch": 0.23117430226434965, "grad_norm": 0.6539078950881958, "learning_rate": 0.00019999593684983058, "loss": 0.2600172460079193, "mean_token_accuracy": 0.8999185413122177, "num_tokens": 5415504.0, "step": 439 }, { "entropy": 1.4733262360095978, "epoch": 0.23170089520800422, "grad_norm": 0.42358288168907166, "learning_rate": 0.000199995725813458, "loss": 0.22544077038764954, "mean_token_accuracy": 0.9120991379022598, "num_tokens": 5427840.0, "step": 440 }, { "entropy": 1.414179265499115, "epoch": 0.23222748815165878, "grad_norm": 0.49307864904403687, "learning_rate": 0.00019999550943456375, "loss": 0.24960950016975403, "mean_token_accuracy": 0.9004078656435013, "num_tokens": 5440176.0, "step": 441 }, { "entropy": 1.429827481508255, "epoch": 0.23275408109531331, "grad_norm": 0.505660891532898, "learning_rate": 0.00019999528771316057, "loss": 0.25559940934181213, "mean_token_accuracy": 0.9029601365327835, "num_tokens": 5452512.0, "step": 442 }, { "entropy": 1.4452406466007233, "epoch": 0.23328067403896788, "grad_norm": 0.5408805012702942, "learning_rate": 0.00019999506064926175, "loss": 0.2864495515823364, "mean_token_accuracy": 0.8919995576143265, "num_tokens": 5464848.0, "step": 443 }, { "entropy": 1.441390186548233, "epoch": 0.23380726698262244, "grad_norm": 0.49373185634613037, "learning_rate": 0.0001999948282428807, "loss": 0.2585368752479553, "mean_token_accuracy": 0.8959326446056366, "num_tokens": 5477184.0, "step": 444 }, { "entropy": 1.386150062084198, "epoch": 0.23433385992627698, "grad_norm": 0.4148918390274048, "learning_rate": 0.0001999945904940312, "loss": 0.2401098757982254, "mean_token_accuracy": 0.9103811830282211, "num_tokens": 5489520.0, "step": 445 }, { "entropy": 1.4309166073799133, "epoch": 0.23486045286993154, "grad_norm": 0.46061956882476807, "learning_rate": 0.00019999434740272743, "loss": 0.2515195310115814, "mean_token_accuracy": 0.9047931730747223, "num_tokens": 5501856.0, "step": 446 }, { "entropy": 1.4778549373149872, "epoch": 0.2353870458135861, "grad_norm": 0.543989896774292, "learning_rate": 0.00019999409896898372, "loss": 0.23118984699249268, "mean_token_accuracy": 0.9122479408979416, "num_tokens": 5514192.0, "step": 447 }, { "entropy": 1.3631019592285156, "epoch": 0.23591363875724064, "grad_norm": 0.39872297644615173, "learning_rate": 0.00019999384519281494, "loss": 0.23500953614711761, "mean_token_accuracy": 0.9080264270305634, "num_tokens": 5526528.0, "step": 448 }, { "entropy": 1.4472846686840057, "epoch": 0.2364402317008952, "grad_norm": 0.4705425500869751, "learning_rate": 0.00019999358607423608, "loss": 0.2556760609149933, "mean_token_accuracy": 0.903324156999588, "num_tokens": 5538864.0, "step": 449 }, { "entropy": 1.4216105043888092, "epoch": 0.23696682464454977, "grad_norm": 0.42123982310295105, "learning_rate": 0.00019999332161326253, "loss": 0.24162599444389343, "mean_token_accuracy": 0.906711995601654, "num_tokens": 5551200.0, "step": 450 }, { "entropy": 1.3214130699634552, "epoch": 0.23749341758820433, "grad_norm": 0.4052497148513794, "learning_rate": 0.00019999305180991002, "loss": 0.23021447658538818, "mean_token_accuracy": 0.9166329354047775, "num_tokens": 5563536.0, "step": 451 }, { "entropy": 1.2956161499023438, "epoch": 0.23802001053185887, "grad_norm": 0.4208316206932068, "learning_rate": 0.0001999927766641945, "loss": 0.25906720757484436, "mean_token_accuracy": 0.8939131498336792, "num_tokens": 5575872.0, "step": 452 }, { "entropy": 1.2186987400054932, "epoch": 0.23854660347551343, "grad_norm": 0.423001766204834, "learning_rate": 0.00019999249617613237, "loss": 0.2634647488594055, "mean_token_accuracy": 0.8950765579938889, "num_tokens": 5588208.0, "step": 453 }, { "entropy": 1.1696477234363556, "epoch": 0.239073196419168, "grad_norm": 0.7100384831428528, "learning_rate": 0.00019999221034574028, "loss": 0.2620895504951477, "mean_token_accuracy": 0.901919424533844, "num_tokens": 5600544.0, "step": 454 }, { "entropy": 1.1881844103336334, "epoch": 0.23959978936282253, "grad_norm": 0.40986204147338867, "learning_rate": 0.00019999191917303513, "loss": 0.23100420832633972, "mean_token_accuracy": 0.9076221436262131, "num_tokens": 5612880.0, "step": 455 }, { "entropy": 1.0672442317008972, "epoch": 0.2401263823064771, "grad_norm": 0.9633269309997559, "learning_rate": 0.0001999916226580343, "loss": 0.2286304533481598, "mean_token_accuracy": 0.9094352871179581, "num_tokens": 5625216.0, "step": 456 }, { "entropy": 1.0725638568401337, "epoch": 0.24065297525013166, "grad_norm": 0.5792625546455383, "learning_rate": 0.0001999913208007553, "loss": 0.21992720663547516, "mean_token_accuracy": 0.9132383912801743, "num_tokens": 5637552.0, "step": 457 }, { "entropy": 1.0756218880414963, "epoch": 0.2411795681937862, "grad_norm": 0.4889819622039795, "learning_rate": 0.0001999910136012161, "loss": 0.22047317028045654, "mean_token_accuracy": 0.9096969217061996, "num_tokens": 5649888.0, "step": 458 }, { "entropy": 1.025196298956871, "epoch": 0.24170616113744076, "grad_norm": 0.43335074186325073, "learning_rate": 0.00019999070105943494, "loss": 0.23299942910671234, "mean_token_accuracy": 0.9110541045665741, "num_tokens": 5662224.0, "step": 459 }, { "entropy": 1.0740464180707932, "epoch": 0.24223275408109532, "grad_norm": 0.4134856164455414, "learning_rate": 0.00019999038317543036, "loss": 0.2113601118326187, "mean_token_accuracy": 0.9125392287969589, "num_tokens": 5674560.0, "step": 460 }, { "entropy": 1.0400484502315521, "epoch": 0.24275934702474986, "grad_norm": 0.3933151364326477, "learning_rate": 0.00019999005994922125, "loss": 0.23023052513599396, "mean_token_accuracy": 0.9128931611776352, "num_tokens": 5686896.0, "step": 461 }, { "entropy": 1.033817708492279, "epoch": 0.24328593996840442, "grad_norm": 0.4203343093395233, "learning_rate": 0.00019998973138082675, "loss": 0.23599188029766083, "mean_token_accuracy": 0.9099869877099991, "num_tokens": 5699232.0, "step": 462 }, { "entropy": 1.0623035430908203, "epoch": 0.24381253291205898, "grad_norm": 0.41818881034851074, "learning_rate": 0.00019998939747026644, "loss": 0.23520024120807648, "mean_token_accuracy": 0.9101691842079163, "num_tokens": 5711568.0, "step": 463 }, { "entropy": 1.0741385221481323, "epoch": 0.24433912585571355, "grad_norm": 0.4350592792034149, "learning_rate": 0.00019998905821756006, "loss": 0.26694831252098083, "mean_token_accuracy": 0.8980891853570938, "num_tokens": 5723904.0, "step": 464 }, { "entropy": 1.1385951340198517, "epoch": 0.24486571879936808, "grad_norm": 0.4376484155654907, "learning_rate": 0.00019998871362272784, "loss": 0.25515180826187134, "mean_token_accuracy": 0.9086296558380127, "num_tokens": 5736240.0, "step": 465 }, { "entropy": 1.0884679853916168, "epoch": 0.24539231174302265, "grad_norm": 0.42011401057243347, "learning_rate": 0.00019998836368579013, "loss": 0.2314184159040451, "mean_token_accuracy": 0.9099607318639755, "num_tokens": 5748576.0, "step": 466 }, { "entropy": 1.09638212621212, "epoch": 0.2459189046866772, "grad_norm": 0.39627403020858765, "learning_rate": 0.0001999880084067678, "loss": 0.21417196094989777, "mean_token_accuracy": 0.9153980165719986, "num_tokens": 5760912.0, "step": 467 }, { "entropy": 1.091229110956192, "epoch": 0.24644549763033174, "grad_norm": 0.4235895872116089, "learning_rate": 0.00019998764778568192, "loss": 0.2682695686817169, "mean_token_accuracy": 0.9011466205120087, "num_tokens": 5773248.0, "step": 468 }, { "entropy": 1.1204252541065216, "epoch": 0.2469720905739863, "grad_norm": 0.43689507246017456, "learning_rate": 0.00019998728182255381, "loss": 0.24578194320201874, "mean_token_accuracy": 0.9062277525663376, "num_tokens": 5785584.0, "step": 469 }, { "entropy": 1.1320042610168457, "epoch": 0.24749868351764087, "grad_norm": 0.4219723641872406, "learning_rate": 0.0001999869105174053, "loss": 0.22462952136993408, "mean_token_accuracy": 0.9171530902385712, "num_tokens": 5797920.0, "step": 470 }, { "entropy": 1.1340222358703613, "epoch": 0.2480252764612954, "grad_norm": 0.3906649351119995, "learning_rate": 0.00019998653387025842, "loss": 0.2314276546239853, "mean_token_accuracy": 0.9133926779031754, "num_tokens": 5810256.0, "step": 471 }, { "entropy": 1.148337960243225, "epoch": 0.24855186940494997, "grad_norm": 0.435470312833786, "learning_rate": 0.00019998615188113547, "loss": 0.27237382531166077, "mean_token_accuracy": 0.8951744884252548, "num_tokens": 5822592.0, "step": 472 }, { "entropy": 1.084697663784027, "epoch": 0.24907846234860453, "grad_norm": 0.3843922019004822, "learning_rate": 0.00019998576455005918, "loss": 0.21877625584602356, "mean_token_accuracy": 0.9148665964603424, "num_tokens": 5834928.0, "step": 473 }, { "entropy": 1.1236861050128937, "epoch": 0.24960505529225907, "grad_norm": 0.3693842887878418, "learning_rate": 0.0001999853718770525, "loss": 0.24262937903404236, "mean_token_accuracy": 0.9089461863040924, "num_tokens": 5847264.0, "step": 474 }, { "entropy": 1.0875613689422607, "epoch": 0.25013164823591366, "grad_norm": 0.36348292231559753, "learning_rate": 0.0001999849738621388, "loss": 0.22801700234413147, "mean_token_accuracy": 0.9149875193834305, "num_tokens": 5859600.0, "step": 475 }, { "entropy": 1.1611447632312775, "epoch": 0.2506582411795682, "grad_norm": 0.3937731683254242, "learning_rate": 0.00019998457050534165, "loss": 0.2227628082036972, "mean_token_accuracy": 0.9130124449729919, "num_tokens": 5871936.0, "step": 476 }, { "entropy": 1.18001389503479, "epoch": 0.25118483412322273, "grad_norm": 0.38412168622016907, "learning_rate": 0.00019998416180668505, "loss": 0.25140437483787537, "mean_token_accuracy": 0.9021612256765366, "num_tokens": 5884272.0, "step": 477 }, { "entropy": 1.1783344447612762, "epoch": 0.2517114270668773, "grad_norm": 0.4068759083747864, "learning_rate": 0.00019998374776619316, "loss": 0.2507692575454712, "mean_token_accuracy": 0.9036175757646561, "num_tokens": 5896608.0, "step": 478 }, { "entropy": 1.2171072959899902, "epoch": 0.25223802001053186, "grad_norm": 0.38274940848350525, "learning_rate": 0.00019998332838389068, "loss": 0.23562754690647125, "mean_token_accuracy": 0.9149611443281174, "num_tokens": 5908944.0, "step": 479 }, { "entropy": 1.2112184464931488, "epoch": 0.2527646129541864, "grad_norm": 0.4171972870826721, "learning_rate": 0.00019998290365980247, "loss": 0.26383018493652344, "mean_token_accuracy": 0.8946961760520935, "num_tokens": 5921280.0, "step": 480 }, { "entropy": 1.1482765674591064, "epoch": 0.253291205897841, "grad_norm": 0.3705795407295227, "learning_rate": 0.0001999824735939537, "loss": 0.23539453744888306, "mean_token_accuracy": 0.9124044477939606, "num_tokens": 5933616.0, "step": 481 }, { "entropy": 1.1225126087665558, "epoch": 0.2538177988414955, "grad_norm": 0.38258257508277893, "learning_rate": 0.00019998203818636997, "loss": 0.24310466647148132, "mean_token_accuracy": 0.9069766700267792, "num_tokens": 5945952.0, "step": 482 }, { "entropy": 1.1831683218479156, "epoch": 0.25434439178515006, "grad_norm": 0.4023701548576355, "learning_rate": 0.00019998159743707706, "loss": 0.22924776375293732, "mean_token_accuracy": 0.910895898938179, "num_tokens": 5958288.0, "step": 483 }, { "entropy": 1.2125089168548584, "epoch": 0.25487098472880465, "grad_norm": 0.391679972410202, "learning_rate": 0.0001999811513461012, "loss": 0.23159608244895935, "mean_token_accuracy": 0.91130131483078, "num_tokens": 5970624.0, "step": 484 }, { "entropy": 1.1657118201255798, "epoch": 0.2553975776724592, "grad_norm": 0.36009886860847473, "learning_rate": 0.00019998069991346878, "loss": 0.22824552655220032, "mean_token_accuracy": 0.9051208347082138, "num_tokens": 5982960.0, "step": 485 }, { "entropy": 1.1666974127292633, "epoch": 0.2559241706161137, "grad_norm": 0.4200109839439392, "learning_rate": 0.00019998024313920668, "loss": 0.22612211108207703, "mean_token_accuracy": 0.9098036587238312, "num_tokens": 5995296.0, "step": 486 }, { "entropy": 1.1931614875793457, "epoch": 0.2564507635597683, "grad_norm": 0.3996848165988922, "learning_rate": 0.00019997978102334195, "loss": 0.23149043321609497, "mean_token_accuracy": 0.915941908955574, "num_tokens": 6007632.0, "step": 487 }, { "entropy": 1.2029556334018707, "epoch": 0.25697735650342285, "grad_norm": 0.381720632314682, "learning_rate": 0.00019997931356590212, "loss": 0.20601031184196472, "mean_token_accuracy": 0.9207601994276047, "num_tokens": 6019968.0, "step": 488 }, { "entropy": 1.286322921514511, "epoch": 0.2575039494470774, "grad_norm": 0.3947739601135254, "learning_rate": 0.00019997884076691484, "loss": 0.23165327310562134, "mean_token_accuracy": 0.9127722233533859, "num_tokens": 6032304.0, "step": 489 }, { "entropy": 1.1862512528896332, "epoch": 0.258030542390732, "grad_norm": 0.4733010232448578, "learning_rate": 0.00019997836262640825, "loss": 0.23455524444580078, "mean_token_accuracy": 0.9086931645870209, "num_tokens": 6044640.0, "step": 490 }, { "entropy": 1.2432229220867157, "epoch": 0.2585571353343865, "grad_norm": 0.5269920229911804, "learning_rate": 0.00019997787914441067, "loss": 0.25063106417655945, "mean_token_accuracy": 0.903441533446312, "num_tokens": 6056976.0, "step": 491 }, { "entropy": 1.1587136387825012, "epoch": 0.25908372827804105, "grad_norm": 0.3660036325454712, "learning_rate": 0.0001999773903209509, "loss": 0.23804998397827148, "mean_token_accuracy": 0.9118834733963013, "num_tokens": 6069312.0, "step": 492 }, { "entropy": 1.2006062865257263, "epoch": 0.25961032122169564, "grad_norm": 0.4517950117588043, "learning_rate": 0.00019997689615605785, "loss": 0.24688124656677246, "mean_token_accuracy": 0.9041164964437485, "num_tokens": 6081648.0, "step": 493 }, { "entropy": 1.2588125467300415, "epoch": 0.2601369141653502, "grad_norm": 0.3569098114967346, "learning_rate": 0.0001999763966497609, "loss": 0.22678923606872559, "mean_token_accuracy": 0.9117091447114944, "num_tokens": 6093984.0, "step": 494 }, { "entropy": 1.3271512985229492, "epoch": 0.26066350710900477, "grad_norm": 0.3427906036376953, "learning_rate": 0.00019997589180208972, "loss": 0.2427246868610382, "mean_token_accuracy": 0.91063092648983, "num_tokens": 6106320.0, "step": 495 }, { "entropy": 1.320880800485611, "epoch": 0.2611901000526593, "grad_norm": 0.41021794080734253, "learning_rate": 0.00019997538161307425, "loss": 0.24322479963302612, "mean_token_accuracy": 0.9047645032405853, "num_tokens": 6118656.0, "step": 496 }, { "entropy": 1.2419660687446594, "epoch": 0.26171669299631384, "grad_norm": 0.4706597328186035, "learning_rate": 0.00019997486608274478, "loss": 0.24686744809150696, "mean_token_accuracy": 0.9022967517375946, "num_tokens": 6130992.0, "step": 497 }, { "entropy": 1.2451711893081665, "epoch": 0.26224328593996843, "grad_norm": 0.37942013144493103, "learning_rate": 0.00019997434521113193, "loss": 0.2456897497177124, "mean_token_accuracy": 0.9084974527359009, "num_tokens": 6143328.0, "step": 498 }, { "entropy": 1.363191157579422, "epoch": 0.26276987888362296, "grad_norm": 0.4037798047065735, "learning_rate": 0.00019997381899826663, "loss": 0.24723505973815918, "mean_token_accuracy": 0.9025511145591736, "num_tokens": 6155664.0, "step": 499 }, { "entropy": 1.3585219979286194, "epoch": 0.2632964718272775, "grad_norm": 0.4076964855194092, "learning_rate": 0.0001999732874441801, "loss": 0.231999009847641, "mean_token_accuracy": 0.9121885448694229, "num_tokens": 6168000.0, "step": 500 }, { "entropy": 1.3322370648384094, "epoch": 0.2638230647709321, "grad_norm": 0.38084790110588074, "learning_rate": 0.0001999727505489039, "loss": 0.26456475257873535, "mean_token_accuracy": 0.9003604352474213, "num_tokens": 6180336.0, "step": 501 }, { "entropy": 1.3225562274456024, "epoch": 0.2643496577145866, "grad_norm": 0.3669094145298004, "learning_rate": 0.00019997220831246987, "loss": 0.22636903822422028, "mean_token_accuracy": 0.9135940670967102, "num_tokens": 6192672.0, "step": 502 }, { "entropy": 1.24677973985672, "epoch": 0.26487625065824116, "grad_norm": 0.36622145771980286, "learning_rate": 0.00019997166073491027, "loss": 0.2442116141319275, "mean_token_accuracy": 0.903778612613678, "num_tokens": 6205008.0, "step": 503 }, { "entropy": 1.2564740180969238, "epoch": 0.26540284360189575, "grad_norm": 0.37914055585861206, "learning_rate": 0.00019997110781625754, "loss": 0.250071257352829, "mean_token_accuracy": 0.905722975730896, "num_tokens": 6217344.0, "step": 504 }, { "entropy": 1.266231119632721, "epoch": 0.2659294365455503, "grad_norm": 0.4232172966003418, "learning_rate": 0.00019997054955654456, "loss": 0.22360444068908691, "mean_token_accuracy": 0.9164858758449554, "num_tokens": 6229680.0, "step": 505 }, { "entropy": 1.2842857539653778, "epoch": 0.2664560294892048, "grad_norm": 0.40517833828926086, "learning_rate": 0.0001999699859558044, "loss": 0.24367284774780273, "mean_token_accuracy": 0.906918466091156, "num_tokens": 6242016.0, "step": 506 }, { "entropy": 1.3325933814048767, "epoch": 0.2669826224328594, "grad_norm": 0.3894166648387909, "learning_rate": 0.00019996941701407058, "loss": 0.21899431943893433, "mean_token_accuracy": 0.9159570783376694, "num_tokens": 6254352.0, "step": 507 }, { "entropy": 1.2919807434082031, "epoch": 0.26750921537651395, "grad_norm": 0.3554909825325012, "learning_rate": 0.00019996884273137686, "loss": 0.22241441905498505, "mean_token_accuracy": 0.9181459695100784, "num_tokens": 6266688.0, "step": 508 }, { "entropy": 1.311550348997116, "epoch": 0.2680358083201685, "grad_norm": 0.36536744236946106, "learning_rate": 0.0001999682631077573, "loss": 0.2456498146057129, "mean_token_accuracy": 0.9058470577001572, "num_tokens": 6279024.0, "step": 509 }, { "entropy": 1.3708328008651733, "epoch": 0.2685624012638231, "grad_norm": 0.4042948782444, "learning_rate": 0.00019996767814324637, "loss": 0.266501247882843, "mean_token_accuracy": 0.900126188993454, "num_tokens": 6291360.0, "step": 510 }, { "entropy": 1.3850271105766296, "epoch": 0.2690889942074776, "grad_norm": 0.39048540592193604, "learning_rate": 0.00019996708783787874, "loss": 0.24780599772930145, "mean_token_accuracy": 0.9016763418912888, "num_tokens": 6303696.0, "step": 511 }, { "entropy": 1.3151749074459076, "epoch": 0.26961558715113215, "grad_norm": 0.37497779726982117, "learning_rate": 0.0001999664921916895, "loss": 0.23127570748329163, "mean_token_accuracy": 0.9075058400630951, "num_tokens": 6316032.0, "step": 512 }, { "entropy": 1.3835597038269043, "epoch": 0.27014218009478674, "grad_norm": 0.3880425691604614, "learning_rate": 0.00019996589120471392, "loss": 0.23898069560527802, "mean_token_accuracy": 0.9100230634212494, "num_tokens": 6328368.0, "step": 513 }, { "entropy": 1.4238722920417786, "epoch": 0.2706687730384413, "grad_norm": 0.36198124289512634, "learning_rate": 0.0001999652848769878, "loss": 0.22968879342079163, "mean_token_accuracy": 0.906474158167839, "num_tokens": 6340704.0, "step": 514 }, { "entropy": 1.517054557800293, "epoch": 0.2711953659820958, "grad_norm": 0.3657878637313843, "learning_rate": 0.00019996467320854703, "loss": 0.22068339586257935, "mean_token_accuracy": 0.9112901985645294, "num_tokens": 6353040.0, "step": 515 }, { "entropy": 1.5027157366275787, "epoch": 0.2717219589257504, "grad_norm": 0.34945791959762573, "learning_rate": 0.000199964056199428, "loss": 0.25596681237220764, "mean_token_accuracy": 0.9006428420543671, "num_tokens": 6365376.0, "step": 516 }, { "entropy": 1.5874098539352417, "epoch": 0.27224855186940494, "grad_norm": 0.3800085783004761, "learning_rate": 0.00019996343384966732, "loss": 0.25539156794548035, "mean_token_accuracy": 0.901904970407486, "num_tokens": 6377712.0, "step": 517 }, { "entropy": 1.5508817732334137, "epoch": 0.2727751448130595, "grad_norm": 0.3190958797931671, "learning_rate": 0.00019996280615930186, "loss": 0.235137477517128, "mean_token_accuracy": 0.9069496989250183, "num_tokens": 6390048.0, "step": 518 }, { "entropy": 1.5596497654914856, "epoch": 0.27330173775671407, "grad_norm": 0.35837146639823914, "learning_rate": 0.000199962173128369, "loss": 0.24638012051582336, "mean_token_accuracy": 0.9043673276901245, "num_tokens": 6402384.0, "step": 519 }, { "entropy": 1.544301688671112, "epoch": 0.2738283307003686, "grad_norm": 0.3943609595298767, "learning_rate": 0.00019996153475690623, "loss": 0.24823732674121857, "mean_token_accuracy": 0.9039914757013321, "num_tokens": 6414720.0, "step": 520 }, { "entropy": 1.4979600608348846, "epoch": 0.2743549236440232, "grad_norm": 0.3533165156841278, "learning_rate": 0.00019996089104495148, "loss": 0.21794329583644867, "mean_token_accuracy": 0.9170633852481842, "num_tokens": 6427056.0, "step": 521 }, { "entropy": 1.5348587334156036, "epoch": 0.27488151658767773, "grad_norm": 0.3516184091567993, "learning_rate": 0.00019996024199254295, "loss": 0.21856778860092163, "mean_token_accuracy": 0.9159553945064545, "num_tokens": 6439392.0, "step": 522 }, { "entropy": 1.5593447387218475, "epoch": 0.27540810953133227, "grad_norm": 0.3706720173358917, "learning_rate": 0.0001999595875997192, "loss": 0.24685126543045044, "mean_token_accuracy": 0.9023942798376083, "num_tokens": 6451728.0, "step": 523 }, { "entropy": 1.5938279330730438, "epoch": 0.27593470247498686, "grad_norm": 0.4374881088733673, "learning_rate": 0.00019995892786651905, "loss": 0.24188384413719177, "mean_token_accuracy": 0.904677078127861, "num_tokens": 6464064.0, "step": 524 }, { "entropy": 1.469886839389801, "epoch": 0.2764612954186414, "grad_norm": 0.46137046813964844, "learning_rate": 0.00019995826279298166, "loss": 0.23798640072345734, "mean_token_accuracy": 0.9109133780002594, "num_tokens": 6476400.0, "step": 525 }, { "entropy": 1.5873245596885681, "epoch": 0.27698788836229593, "grad_norm": 0.416920006275177, "learning_rate": 0.00019995759237914656, "loss": 0.25300133228302, "mean_token_accuracy": 0.9008941799402237, "num_tokens": 6488736.0, "step": 526 }, { "entropy": 1.5558778047561646, "epoch": 0.2775144813059505, "grad_norm": 0.36363670229911804, "learning_rate": 0.0001999569166250535, "loss": 0.22929418087005615, "mean_token_accuracy": 0.9127305895090103, "num_tokens": 6501072.0, "step": 527 }, { "entropy": 1.5871147811412811, "epoch": 0.27804107424960506, "grad_norm": 0.3830122947692871, "learning_rate": 0.00019995623553074258, "loss": 0.2472982108592987, "mean_token_accuracy": 0.9040207862854004, "num_tokens": 6513408.0, "step": 528 }, { "entropy": 1.6365769505500793, "epoch": 0.2785676671932596, "grad_norm": 0.3964959383010864, "learning_rate": 0.00019995554909625428, "loss": 0.25368693470954895, "mean_token_accuracy": 0.9007250666618347, "num_tokens": 6525744.0, "step": 529 }, { "entropy": 1.7017327845096588, "epoch": 0.2790942601369142, "grad_norm": 0.391290545463562, "learning_rate": 0.00019995485732162934, "loss": 0.2360502928495407, "mean_token_accuracy": 0.9084432125091553, "num_tokens": 6538080.0, "step": 530 }, { "entropy": 1.6393355131149292, "epoch": 0.2796208530805687, "grad_norm": 0.38507914543151855, "learning_rate": 0.0001999541602069088, "loss": 0.23786881566047668, "mean_token_accuracy": 0.9061485677957535, "num_tokens": 6550416.0, "step": 531 }, { "entropy": 1.6275135576725006, "epoch": 0.28014744602422326, "grad_norm": 0.37895116209983826, "learning_rate": 0.0001999534577521341, "loss": 0.23145025968551636, "mean_token_accuracy": 0.9090943783521652, "num_tokens": 6562752.0, "step": 532 }, { "entropy": 1.598475605249405, "epoch": 0.28067403896787785, "grad_norm": 0.4161452054977417, "learning_rate": 0.00019995274995734686, "loss": 0.2727176547050476, "mean_token_accuracy": 0.8956159949302673, "num_tokens": 6575088.0, "step": 533 }, { "entropy": 1.5213307440280914, "epoch": 0.2812006319115324, "grad_norm": 0.43801331520080566, "learning_rate": 0.00019995203682258915, "loss": 0.22940769791603088, "mean_token_accuracy": 0.9128211736679077, "num_tokens": 6587424.0, "step": 534 }, { "entropy": 1.634105533361435, "epoch": 0.2817272248551869, "grad_norm": 0.4054886996746063, "learning_rate": 0.0001999513183479033, "loss": 0.23942533135414124, "mean_token_accuracy": 0.9082587212324142, "num_tokens": 6599760.0, "step": 535 }, { "entropy": 1.4907733798027039, "epoch": 0.2822538177988415, "grad_norm": 0.40736711025238037, "learning_rate": 0.00019995059453333194, "loss": 0.22832639515399933, "mean_token_accuracy": 0.9135842621326447, "num_tokens": 6612096.0, "step": 536 }, { "entropy": 1.5832161009311676, "epoch": 0.28278041074249605, "grad_norm": 0.3980075418949127, "learning_rate": 0.0001999498653789181, "loss": 0.24887777864933014, "mean_token_accuracy": 0.9017034024000168, "num_tokens": 6624432.0, "step": 537 }, { "entropy": 1.4983101785182953, "epoch": 0.2833070036861506, "grad_norm": 0.3781083822250366, "learning_rate": 0.00019994913088470498, "loss": 0.23180519044399261, "mean_token_accuracy": 0.9052098244428635, "num_tokens": 6636768.0, "step": 538 }, { "entropy": 1.5062950551509857, "epoch": 0.2838335966298052, "grad_norm": 0.4003005623817444, "learning_rate": 0.00019994839105073623, "loss": 0.22549505531787872, "mean_token_accuracy": 0.9140617251396179, "num_tokens": 6649104.0, "step": 539 }, { "entropy": 1.5416783392429352, "epoch": 0.2843601895734597, "grad_norm": 0.39962485432624817, "learning_rate": 0.00019994764587705574, "loss": 0.2179470807313919, "mean_token_accuracy": 0.9161404520273209, "num_tokens": 6661440.0, "step": 540 }, { "entropy": 1.660192757844925, "epoch": 0.28488678251711425, "grad_norm": 0.42626917362213135, "learning_rate": 0.0001999468953637078, "loss": 0.26295173168182373, "mean_token_accuracy": 0.8983173221349716, "num_tokens": 6673776.0, "step": 541 }, { "entropy": 1.5149348974227905, "epoch": 0.28541337546076884, "grad_norm": 0.36926260590553284, "learning_rate": 0.00019994613951073692, "loss": 0.2277842015028, "mean_token_accuracy": 0.9144963473081589, "num_tokens": 6686112.0, "step": 542 }, { "entropy": 1.5601712763309479, "epoch": 0.2859399684044234, "grad_norm": 0.35751771926879883, "learning_rate": 0.00019994537831818799, "loss": 0.2134617567062378, "mean_token_accuracy": 0.9172465950250626, "num_tokens": 6698448.0, "step": 543 }, { "entropy": 1.629770964384079, "epoch": 0.2864665613480779, "grad_norm": 0.3708803951740265, "learning_rate": 0.00019994461178610617, "loss": 0.22911599278450012, "mean_token_accuracy": 0.9093553721904755, "num_tokens": 6710784.0, "step": 544 }, { "entropy": 1.5735207796096802, "epoch": 0.2869931542917325, "grad_norm": 0.3979873061180115, "learning_rate": 0.00019994383991453702, "loss": 0.2454529106616974, "mean_token_accuracy": 0.9057244658470154, "num_tokens": 6723120.0, "step": 545 }, { "entropy": 1.556952327489853, "epoch": 0.28751974723538704, "grad_norm": 0.36042284965515137, "learning_rate": 0.0001999430627035263, "loss": 0.22943763434886932, "mean_token_accuracy": 0.9095467925071716, "num_tokens": 6735456.0, "step": 546 }, { "entropy": 1.5784813165664673, "epoch": 0.2880463401790416, "grad_norm": 0.4354793131351471, "learning_rate": 0.0001999422801531202, "loss": 0.23101268708705902, "mean_token_accuracy": 0.9098020642995834, "num_tokens": 6747792.0, "step": 547 }, { "entropy": 1.6356432437896729, "epoch": 0.28857293312269616, "grad_norm": 0.38589903712272644, "learning_rate": 0.00019994149226336514, "loss": 0.2551157772541046, "mean_token_accuracy": 0.9008017480373383, "num_tokens": 6760128.0, "step": 548 }, { "entropy": 1.484334021806717, "epoch": 0.2890995260663507, "grad_norm": 0.3685605823993683, "learning_rate": 0.0001999406990343079, "loss": 0.21177145838737488, "mean_token_accuracy": 0.9134591519832611, "num_tokens": 6772464.0, "step": 549 }, { "entropy": 1.5352662205696106, "epoch": 0.2896261190100053, "grad_norm": 0.43439221382141113, "learning_rate": 0.00019993990046599555, "loss": 0.21738113462924957, "mean_token_accuracy": 0.9168129861354828, "num_tokens": 6784800.0, "step": 550 }, { "entropy": 1.4901257157325745, "epoch": 0.2901527119536598, "grad_norm": 0.40765848755836487, "learning_rate": 0.00019993909655847554, "loss": 0.2299802005290985, "mean_token_accuracy": 0.9086113125085831, "num_tokens": 6797136.0, "step": 551 }, { "entropy": 1.5647250413894653, "epoch": 0.29067930489731436, "grad_norm": 0.3714927136898041, "learning_rate": 0.0001999382873117956, "loss": 0.23209913074970245, "mean_token_accuracy": 0.912913978099823, "num_tokens": 6809472.0, "step": 552 }, { "entropy": 1.5570427775382996, "epoch": 0.29120589784096895, "grad_norm": 0.3235602080821991, "learning_rate": 0.0001999374727260037, "loss": 0.20470383763313293, "mean_token_accuracy": 0.9178998619318008, "num_tokens": 6821808.0, "step": 553 }, { "entropy": 1.6096443831920624, "epoch": 0.2917324907846235, "grad_norm": 0.3791026473045349, "learning_rate": 0.00019993665280114824, "loss": 0.23357072472572327, "mean_token_accuracy": 0.9100991189479828, "num_tokens": 6834144.0, "step": 554 }, { "entropy": 1.7047458291053772, "epoch": 0.292259083728278, "grad_norm": 0.4588649272918701, "learning_rate": 0.00019993582753727792, "loss": 0.23484769463539124, "mean_token_accuracy": 0.9089436531066895, "num_tokens": 6846480.0, "step": 555 }, { "entropy": 1.6045478284358978, "epoch": 0.2927856766719326, "grad_norm": 0.38022348284721375, "learning_rate": 0.00019993499693444168, "loss": 0.24132560193538666, "mean_token_accuracy": 0.9133987128734589, "num_tokens": 6858816.0, "step": 556 }, { "entropy": 1.5578656792640686, "epoch": 0.29331226961558715, "grad_norm": 0.3959854543209076, "learning_rate": 0.00019993416099268888, "loss": 0.2288515269756317, "mean_token_accuracy": 0.9094084948301315, "num_tokens": 6871152.0, "step": 557 }, { "entropy": 1.5771779716014862, "epoch": 0.2938388625592417, "grad_norm": 0.41283491253852844, "learning_rate": 0.00019993331971206911, "loss": 0.25233519077301025, "mean_token_accuracy": 0.8999712020158768, "num_tokens": 6883488.0, "step": 558 }, { "entropy": 1.5294803977012634, "epoch": 0.2943654555028963, "grad_norm": 0.41696879267692566, "learning_rate": 0.0001999324730926323, "loss": 0.2409447431564331, "mean_token_accuracy": 0.9075838178396225, "num_tokens": 6895824.0, "step": 559 }, { "entropy": 1.557918757200241, "epoch": 0.2948920484465508, "grad_norm": 0.8365952372550964, "learning_rate": 0.00019993162113442873, "loss": 0.26256802678108215, "mean_token_accuracy": 0.8970607817173004, "num_tokens": 6908160.0, "step": 560 }, { "entropy": 1.5486240088939667, "epoch": 0.29541864139020535, "grad_norm": 0.36394545435905457, "learning_rate": 0.000199930763837509, "loss": 0.23241116106510162, "mean_token_accuracy": 0.9164627194404602, "num_tokens": 6920496.0, "step": 561 }, { "entropy": 1.5366742312908173, "epoch": 0.29594523433385994, "grad_norm": 0.3717273771762848, "learning_rate": 0.00019992990120192393, "loss": 0.2316376268863678, "mean_token_accuracy": 0.9116377085447311, "num_tokens": 6932832.0, "step": 562 }, { "entropy": 1.6174998581409454, "epoch": 0.2964718272775145, "grad_norm": 0.3976577818393707, "learning_rate": 0.00019992903322772483, "loss": 0.2560444474220276, "mean_token_accuracy": 0.8992763608694077, "num_tokens": 6945168.0, "step": 563 }, { "entropy": 1.5432467758655548, "epoch": 0.296998420221169, "grad_norm": 0.32837730646133423, "learning_rate": 0.00019992815991496318, "loss": 0.2185848504304886, "mean_token_accuracy": 0.9149428755044937, "num_tokens": 6957504.0, "step": 564 }, { "entropy": 1.5321990847587585, "epoch": 0.2975250131648236, "grad_norm": 0.36741021275520325, "learning_rate": 0.00019992728126369078, "loss": 0.24631758034229279, "mean_token_accuracy": 0.9008835554122925, "num_tokens": 6969840.0, "step": 565 }, { "entropy": 1.6573955416679382, "epoch": 0.29805160610847814, "grad_norm": 0.40060925483703613, "learning_rate": 0.00019992639727395983, "loss": 0.24705615639686584, "mean_token_accuracy": 0.9055600762367249, "num_tokens": 6982176.0, "step": 566 }, { "entropy": 1.6146283447742462, "epoch": 0.2985781990521327, "grad_norm": 0.36694321036338806, "learning_rate": 0.00019992550794582282, "loss": 0.2382228970527649, "mean_token_accuracy": 0.9077549129724503, "num_tokens": 6994512.0, "step": 567 }, { "entropy": 1.608702838420868, "epoch": 0.29910479199578727, "grad_norm": 0.36138370633125305, "learning_rate": 0.00019992461327933252, "loss": 0.2497398406267166, "mean_token_accuracy": 0.9065199494361877, "num_tokens": 7006848.0, "step": 568 }, { "entropy": 1.5681868195533752, "epoch": 0.2996313849394418, "grad_norm": 0.3718649744987488, "learning_rate": 0.00019992371327454204, "loss": 0.22592690587043762, "mean_token_accuracy": 0.9139988124370575, "num_tokens": 7019184.0, "step": 569 }, { "entropy": 1.5541615784168243, "epoch": 0.3001579778830964, "grad_norm": 0.3475581407546997, "learning_rate": 0.00019992280793150485, "loss": 0.218974769115448, "mean_token_accuracy": 0.9153032898902893, "num_tokens": 7031520.0, "step": 570 }, { "entropy": 1.5086607038974762, "epoch": 0.30068457082675093, "grad_norm": 0.336376428604126, "learning_rate": 0.00019992189725027466, "loss": 0.2033504694700241, "mean_token_accuracy": 0.9149883091449738, "num_tokens": 7043856.0, "step": 571 }, { "entropy": 1.5713791847229004, "epoch": 0.30121116377040547, "grad_norm": 0.4335557520389557, "learning_rate": 0.0001999209812309055, "loss": 0.2449672371149063, "mean_token_accuracy": 0.9020196795463562, "num_tokens": 7056192.0, "step": 572 }, { "entropy": 1.5503774285316467, "epoch": 0.30173775671406006, "grad_norm": 0.3847261071205139, "learning_rate": 0.0001999200598734518, "loss": 0.23619771003723145, "mean_token_accuracy": 0.9090457707643509, "num_tokens": 7068528.0, "step": 573 }, { "entropy": 1.5812987089157104, "epoch": 0.3022643496577146, "grad_norm": 0.4005545675754547, "learning_rate": 0.00019991913317796825, "loss": 0.22766467928886414, "mean_token_accuracy": 0.9142022579908371, "num_tokens": 7080864.0, "step": 574 }, { "entropy": 1.5593630969524384, "epoch": 0.30279094260136913, "grad_norm": 0.3692858815193176, "learning_rate": 0.00019991820114450984, "loss": 0.24361425638198853, "mean_token_accuracy": 0.909025177359581, "num_tokens": 7093200.0, "step": 575 }, { "entropy": 1.639871895313263, "epoch": 0.3033175355450237, "grad_norm": 0.3423769176006317, "learning_rate": 0.0001999172637731319, "loss": 0.1989578753709793, "mean_token_accuracy": 0.9223005324602127, "num_tokens": 7105536.0, "step": 576 }, { "entropy": 1.5683670938014984, "epoch": 0.30384412848867826, "grad_norm": 0.3434232771396637, "learning_rate": 0.0001999163210638901, "loss": 0.23291000723838806, "mean_token_accuracy": 0.9105765074491501, "num_tokens": 7117872.0, "step": 577 }, { "entropy": 1.6403064131736755, "epoch": 0.3043707214323328, "grad_norm": 0.3877623975276947, "learning_rate": 0.00019991537301684037, "loss": 0.2589385509490967, "mean_token_accuracy": 0.9013812988996506, "num_tokens": 7130208.0, "step": 578 }, { "entropy": 1.577894926071167, "epoch": 0.3048973143759874, "grad_norm": 0.3848702013492584, "learning_rate": 0.00019991441963203906, "loss": 0.2235189825296402, "mean_token_accuracy": 0.9132665693759918, "num_tokens": 7142544.0, "step": 579 }, { "entropy": 1.594813734292984, "epoch": 0.3054239073196419, "grad_norm": 0.37452247738838196, "learning_rate": 0.00019991346090954268, "loss": 0.2309045046567917, "mean_token_accuracy": 0.9061081409454346, "num_tokens": 7154880.0, "step": 580 }, { "entropy": 1.6004383862018585, "epoch": 0.30595050026329645, "grad_norm": 0.36386990547180176, "learning_rate": 0.0001999124968494082, "loss": 0.22697995603084564, "mean_token_accuracy": 0.9153416603803635, "num_tokens": 7167216.0, "step": 581 }, { "entropy": 1.5263923108577728, "epoch": 0.30647709320695105, "grad_norm": 0.3861697316169739, "learning_rate": 0.00019991152745169283, "loss": 0.23612037301063538, "mean_token_accuracy": 0.9100482612848282, "num_tokens": 7179552.0, "step": 582 }, { "entropy": 1.4913224875926971, "epoch": 0.3070036861506056, "grad_norm": 0.37040355801582336, "learning_rate": 0.00019991055271645412, "loss": 0.2453731894493103, "mean_token_accuracy": 0.9096489399671555, "num_tokens": 7191888.0, "step": 583 }, { "entropy": 1.5870050489902496, "epoch": 0.3075302790942601, "grad_norm": 0.3563641309738159, "learning_rate": 0.00019990957264374992, "loss": 0.2088014781475067, "mean_token_accuracy": 0.9178295880556107, "num_tokens": 7204224.0, "step": 584 }, { "entropy": 1.5673131942749023, "epoch": 0.3080568720379147, "grad_norm": 0.42992061376571655, "learning_rate": 0.00019990858723363842, "loss": 0.22837956249713898, "mean_token_accuracy": 0.9150240123271942, "num_tokens": 7216560.0, "step": 585 }, { "entropy": 1.5697237253189087, "epoch": 0.30858346498156924, "grad_norm": 0.34907442331314087, "learning_rate": 0.00019990759648617814, "loss": 0.2061898112297058, "mean_token_accuracy": 0.9186743050813675, "num_tokens": 7228896.0, "step": 586 }, { "entropy": 1.5203896760940552, "epoch": 0.3091100579252238, "grad_norm": 0.3814384639263153, "learning_rate": 0.00019990660040142787, "loss": 0.23518475890159607, "mean_token_accuracy": 0.9073454886674881, "num_tokens": 7241232.0, "step": 587 }, { "entropy": 1.5959535539150238, "epoch": 0.30963665086887837, "grad_norm": 0.410187304019928, "learning_rate": 0.00019990559897944675, "loss": 0.2526550590991974, "mean_token_accuracy": 0.9053095877170563, "num_tokens": 7253568.0, "step": 588 }, { "entropy": 1.4929281175136566, "epoch": 0.3101632438125329, "grad_norm": 0.3563387989997864, "learning_rate": 0.00019990459222029422, "loss": 0.2284306138753891, "mean_token_accuracy": 0.9153739362955093, "num_tokens": 7265904.0, "step": 589 }, { "entropy": 1.5385482907295227, "epoch": 0.31068983675618744, "grad_norm": 0.3958924412727356, "learning_rate": 0.00019990358012403009, "loss": 0.25064951181411743, "mean_token_accuracy": 0.9019092172384262, "num_tokens": 7278240.0, "step": 590 }, { "entropy": 1.5795462429523468, "epoch": 0.31121642969984203, "grad_norm": 0.4616306722164154, "learning_rate": 0.00019990256269071435, "loss": 0.25259649753570557, "mean_token_accuracy": 0.9031090140342712, "num_tokens": 7290576.0, "step": 591 }, { "entropy": 1.5900325179100037, "epoch": 0.31174302264349657, "grad_norm": 0.36789095401763916, "learning_rate": 0.0001999015399204075, "loss": 0.239149808883667, "mean_token_accuracy": 0.9080104380846024, "num_tokens": 7302912.0, "step": 592 }, { "entropy": 1.595876008272171, "epoch": 0.3122696155871511, "grad_norm": 0.3929153084754944, "learning_rate": 0.0001999005118131702, "loss": 0.2852938175201416, "mean_token_accuracy": 0.8941920101642609, "num_tokens": 7315248.0, "step": 593 }, { "entropy": 1.616676688194275, "epoch": 0.3127962085308057, "grad_norm": 0.3501856327056885, "learning_rate": 0.00019989947836906346, "loss": 0.24000589549541473, "mean_token_accuracy": 0.9087683409452438, "num_tokens": 7327584.0, "step": 594 }, { "entropy": 1.6581095457077026, "epoch": 0.31332280147446023, "grad_norm": 0.42188331484794617, "learning_rate": 0.0001998984395881487, "loss": 0.24285097420215607, "mean_token_accuracy": 0.9076326787471771, "num_tokens": 7339920.0, "step": 595 }, { "entropy": 1.6323899328708649, "epoch": 0.3138493944181148, "grad_norm": 0.38462045788764954, "learning_rate": 0.00019989739547048753, "loss": 0.25823602080345154, "mean_token_accuracy": 0.9016465842723846, "num_tokens": 7352256.0, "step": 596 }, { "entropy": 1.648387372493744, "epoch": 0.31437598736176936, "grad_norm": 0.3550112545490265, "learning_rate": 0.00019989634601614198, "loss": 0.23165376484394073, "mean_token_accuracy": 0.9123150110244751, "num_tokens": 7364592.0, "step": 597 }, { "entropy": 1.541102021932602, "epoch": 0.3149025803054239, "grad_norm": 0.32691195607185364, "learning_rate": 0.0001998952912251743, "loss": 0.2173168659210205, "mean_token_accuracy": 0.9170237630605698, "num_tokens": 7376928.0, "step": 598 }, { "entropy": 1.5581879019737244, "epoch": 0.3154291732490785, "grad_norm": 0.37725362181663513, "learning_rate": 0.00019989423109764714, "loss": 0.22197510302066803, "mean_token_accuracy": 0.9138648211956024, "num_tokens": 7389264.0, "step": 599 }, { "entropy": 1.5590221285820007, "epoch": 0.315955766192733, "grad_norm": 0.36627396941185, "learning_rate": 0.0001998931656336234, "loss": 0.23069526255130768, "mean_token_accuracy": 0.9046057909727097, "num_tokens": 7401600.0, "step": 600 }, { "entropy": 1.617866188287735, "epoch": 0.31648235913638756, "grad_norm": 0.40031948685646057, "learning_rate": 0.00019989209483316637, "loss": 0.2336081862449646, "mean_token_accuracy": 0.9123480021953583, "num_tokens": 7413936.0, "step": 601 }, { "entropy": 1.53180992603302, "epoch": 0.31700895208004215, "grad_norm": 0.49535101652145386, "learning_rate": 0.00019989101869633962, "loss": 0.22568359971046448, "mean_token_accuracy": 0.9089675545692444, "num_tokens": 7426272.0, "step": 602 }, { "entropy": 1.5532157719135284, "epoch": 0.3175355450236967, "grad_norm": 0.4378284811973572, "learning_rate": 0.00019988993722320703, "loss": 0.2375514954328537, "mean_token_accuracy": 0.9061621576547623, "num_tokens": 7438608.0, "step": 603 }, { "entropy": 1.5265016555786133, "epoch": 0.3180621379673512, "grad_norm": 0.3522114157676697, "learning_rate": 0.0001998888504138327, "loss": 0.23949339985847473, "mean_token_accuracy": 0.9073717594146729, "num_tokens": 7450944.0, "step": 604 }, { "entropy": 1.61136794090271, "epoch": 0.3185887309110058, "grad_norm": 0.37977924942970276, "learning_rate": 0.00019988775826828133, "loss": 0.2230483740568161, "mean_token_accuracy": 0.9096570760011673, "num_tokens": 7463280.0, "step": 605 }, { "entropy": 1.593753159046173, "epoch": 0.31911532385466035, "grad_norm": 0.6494004130363464, "learning_rate": 0.0001998866607866176, "loss": 0.22851543128490448, "mean_token_accuracy": 0.9144780784845352, "num_tokens": 7475616.0, "step": 606 }, { "entropy": 1.5087667405605316, "epoch": 0.3196419167983149, "grad_norm": 0.3527071177959442, "learning_rate": 0.00019988555796890674, "loss": 0.20573341846466064, "mean_token_accuracy": 0.9186414480209351, "num_tokens": 7487952.0, "step": 607 }, { "entropy": 1.5721814334392548, "epoch": 0.3201685097419695, "grad_norm": 0.3536371886730194, "learning_rate": 0.00019988444981521418, "loss": 0.20877021551132202, "mean_token_accuracy": 0.9166864901781082, "num_tokens": 7500288.0, "step": 608 }, { "entropy": 1.5660102665424347, "epoch": 0.320695102685624, "grad_norm": 0.4063898026943207, "learning_rate": 0.00019988333632560572, "loss": 0.25388604402542114, "mean_token_accuracy": 0.9036387950181961, "num_tokens": 7512624.0, "step": 609 }, { "entropy": 1.5472122132778168, "epoch": 0.32122169562927855, "grad_norm": 0.3346962630748749, "learning_rate": 0.00019988221750014747, "loss": 0.2217264026403427, "mean_token_accuracy": 0.9168782234191895, "num_tokens": 7524960.0, "step": 610 }, { "entropy": 1.557081937789917, "epoch": 0.32174828857293314, "grad_norm": 0.37367674708366394, "learning_rate": 0.00019988109333890584, "loss": 0.21202939748764038, "mean_token_accuracy": 0.9218468219041824, "num_tokens": 7537296.0, "step": 611 }, { "entropy": 1.4869562089443207, "epoch": 0.3222748815165877, "grad_norm": 0.4604549705982208, "learning_rate": 0.00019987996384194755, "loss": 0.2245841920375824, "mean_token_accuracy": 0.9145530760288239, "num_tokens": 7549632.0, "step": 612 }, { "entropy": 1.515323966741562, "epoch": 0.3228014744602422, "grad_norm": 0.39376160502433777, "learning_rate": 0.0001998788290093397, "loss": 0.26140767335891724, "mean_token_accuracy": 0.8977334201335907, "num_tokens": 7561968.0, "step": 613 }, { "entropy": 1.487097293138504, "epoch": 0.3233280674038968, "grad_norm": 0.40344923734664917, "learning_rate": 0.00019987768884114962, "loss": 0.21170933544635773, "mean_token_accuracy": 0.9142201244831085, "num_tokens": 7574304.0, "step": 614 }, { "entropy": 1.4696341156959534, "epoch": 0.32385466034755134, "grad_norm": 0.3404286801815033, "learning_rate": 0.00019987654333744498, "loss": 0.2107430100440979, "mean_token_accuracy": 0.9169973582029343, "num_tokens": 7586640.0, "step": 615 }, { "entropy": 1.4763599038124084, "epoch": 0.3243812532912059, "grad_norm": 0.4449232518672943, "learning_rate": 0.00019987539249829381, "loss": 0.22219976782798767, "mean_token_accuracy": 0.9147885292768478, "num_tokens": 7598976.0, "step": 616 }, { "entropy": 1.4189346730709076, "epoch": 0.32490784623486046, "grad_norm": 0.33330264687538147, "learning_rate": 0.00019987423632376444, "loss": 0.20641736686229706, "mean_token_accuracy": 0.9154144078493118, "num_tokens": 7611312.0, "step": 617 }, { "entropy": 1.5400767922401428, "epoch": 0.325434439178515, "grad_norm": 0.3576372563838959, "learning_rate": 0.00019987307481392544, "loss": 0.21838723123073578, "mean_token_accuracy": 0.9165307581424713, "num_tokens": 7623648.0, "step": 618 }, { "entropy": 1.4934936463832855, "epoch": 0.32596103212216954, "grad_norm": 0.3858436942100525, "learning_rate": 0.00019987190796884582, "loss": 0.2230948656797409, "mean_token_accuracy": 0.9111486077308655, "num_tokens": 7635984.0, "step": 619 }, { "entropy": 1.5231453776359558, "epoch": 0.3264876250658241, "grad_norm": 0.3916998505592346, "learning_rate": 0.0001998707357885949, "loss": 0.2513001561164856, "mean_token_accuracy": 0.9021778851747513, "num_tokens": 7648320.0, "step": 620 }, { "entropy": 1.529598742723465, "epoch": 0.32701421800947866, "grad_norm": 0.768818736076355, "learning_rate": 0.00019986955827324215, "loss": 0.23995141685009003, "mean_token_accuracy": 0.9082267880439758, "num_tokens": 7660656.0, "step": 621 }, { "entropy": 1.56441992521286, "epoch": 0.32754081095313325, "grad_norm": 0.3836771249771118, "learning_rate": 0.0001998683754228575, "loss": 0.2571730613708496, "mean_token_accuracy": 0.905523344874382, "num_tokens": 7672992.0, "step": 622 }, { "entropy": 1.5032837986946106, "epoch": 0.3280674038967878, "grad_norm": 0.3536396920681, "learning_rate": 0.00019986718723751122, "loss": 0.2316400706768036, "mean_token_accuracy": 0.9121131896972656, "num_tokens": 7685328.0, "step": 623 }, { "entropy": 1.5374043881893158, "epoch": 0.3285939968404423, "grad_norm": 0.43927958607673645, "learning_rate": 0.00019986599371727383, "loss": 0.2222973108291626, "mean_token_accuracy": 0.9122229516506195, "num_tokens": 7697664.0, "step": 624 }, { "entropy": 1.5948379039764404, "epoch": 0.3291205897840969, "grad_norm": 0.3739503026008606, "learning_rate": 0.00019986479486221618, "loss": 0.23531857132911682, "mean_token_accuracy": 0.9108096957206726, "num_tokens": 7710000.0, "step": 625 }, { "entropy": 1.5133698880672455, "epoch": 0.32964718272775145, "grad_norm": 0.37042292952537537, "learning_rate": 0.00019986359067240942, "loss": 0.2119014859199524, "mean_token_accuracy": 0.9210023730993271, "num_tokens": 7722336.0, "step": 626 }, { "entropy": 1.565012902021408, "epoch": 0.330173775671406, "grad_norm": 0.36645272374153137, "learning_rate": 0.00019986238114792505, "loss": 0.22745972871780396, "mean_token_accuracy": 0.9089792966842651, "num_tokens": 7734672.0, "step": 627 }, { "entropy": 1.5374813377857208, "epoch": 0.3307003686150606, "grad_norm": 0.3918452858924866, "learning_rate": 0.00019986116628883485, "loss": 0.22233808040618896, "mean_token_accuracy": 0.91575026512146, "num_tokens": 7747008.0, "step": 628 }, { "entropy": 1.5814277529716492, "epoch": 0.3312269615587151, "grad_norm": 0.3956620395183563, "learning_rate": 0.00019985994609521098, "loss": 0.23237353563308716, "mean_token_accuracy": 0.9120265543460846, "num_tokens": 7759344.0, "step": 629 }, { "entropy": 1.607151210308075, "epoch": 0.33175355450236965, "grad_norm": 0.4154573380947113, "learning_rate": 0.00019985872056712585, "loss": 0.23763325810432434, "mean_token_accuracy": 0.9039438813924789, "num_tokens": 7771680.0, "step": 630 }, { "entropy": 1.5939337015151978, "epoch": 0.33228014744602424, "grad_norm": 0.5367919206619263, "learning_rate": 0.0001998574897046522, "loss": 0.22427549958229065, "mean_token_accuracy": 0.9124085754156113, "num_tokens": 7784016.0, "step": 631 }, { "entropy": 1.6544562876224518, "epoch": 0.3328067403896788, "grad_norm": 0.49991947412490845, "learning_rate": 0.00019985625350786313, "loss": 0.26143935322761536, "mean_token_accuracy": 0.8970800191164017, "num_tokens": 7796352.0, "step": 632 }, { "entropy": 1.567628562450409, "epoch": 0.3333333333333333, "grad_norm": 0.43659552931785583, "learning_rate": 0.00019985501197683202, "loss": 0.22153861820697784, "mean_token_accuracy": 0.9091014564037323, "num_tokens": 7808688.0, "step": 633 }, { "entropy": 1.6360341310501099, "epoch": 0.3338599262769879, "grad_norm": 0.406440794467926, "learning_rate": 0.00019985376511163255, "loss": 0.23250769078731537, "mean_token_accuracy": 0.9082053154706955, "num_tokens": 7821024.0, "step": 634 }, { "entropy": 1.617436408996582, "epoch": 0.33438651922064244, "grad_norm": 0.4746139347553253, "learning_rate": 0.00019985251291233872, "loss": 0.2448023557662964, "mean_token_accuracy": 0.9019272774457932, "num_tokens": 7833360.0, "step": 635 }, { "entropy": 1.5576602518558502, "epoch": 0.334913112164297, "grad_norm": 0.37426477670669556, "learning_rate": 0.00019985125537902497, "loss": 0.24818755686283112, "mean_token_accuracy": 0.9056387394666672, "num_tokens": 7845696.0, "step": 636 }, { "entropy": 1.5108153223991394, "epoch": 0.33543970510795157, "grad_norm": 0.36447635293006897, "learning_rate": 0.00019984999251176582, "loss": 0.23007383942604065, "mean_token_accuracy": 0.9102648496627808, "num_tokens": 7858032.0, "step": 637 }, { "entropy": 1.6435940563678741, "epoch": 0.3359662980516061, "grad_norm": 0.4201553165912628, "learning_rate": 0.00019984872431063632, "loss": 0.2524194121360779, "mean_token_accuracy": 0.9026057571172714, "num_tokens": 7870368.0, "step": 638 }, { "entropy": 1.5785358846187592, "epoch": 0.33649289099526064, "grad_norm": 0.34197092056274414, "learning_rate": 0.00019984745077571175, "loss": 0.22064879536628723, "mean_token_accuracy": 0.9168655872344971, "num_tokens": 7882704.0, "step": 639 }, { "entropy": 1.5749069154262543, "epoch": 0.33701948393891523, "grad_norm": 0.35670214891433716, "learning_rate": 0.00019984617190706768, "loss": 0.210345059633255, "mean_token_accuracy": 0.9159483909606934, "num_tokens": 7895040.0, "step": 640 }, { "entropy": 1.648300975561142, "epoch": 0.33754607688256977, "grad_norm": 0.5585328936576843, "learning_rate": 0.00019984488770478004, "loss": 0.26494815945625305, "mean_token_accuracy": 0.9005215167999268, "num_tokens": 7907376.0, "step": 641 }, { "entropy": 1.5516612827777863, "epoch": 0.3380726698262243, "grad_norm": 0.3812706172466278, "learning_rate": 0.0001998435981689251, "loss": 0.23725152015686035, "mean_token_accuracy": 0.9066549986600876, "num_tokens": 7919712.0, "step": 642 }, { "entropy": 1.538433849811554, "epoch": 0.3385992627698789, "grad_norm": 0.345907598733902, "learning_rate": 0.00019984230329957937, "loss": 0.21600767970085144, "mean_token_accuracy": 0.913017600774765, "num_tokens": 7932048.0, "step": 643 }, { "entropy": 1.5793551802635193, "epoch": 0.33912585571353343, "grad_norm": 0.375407874584198, "learning_rate": 0.00019984100309681973, "loss": 0.2297327220439911, "mean_token_accuracy": 0.9100670218467712, "num_tokens": 7944384.0, "step": 644 }, { "entropy": 1.6768275797367096, "epoch": 0.33965244865718797, "grad_norm": 0.3743014931678772, "learning_rate": 0.00019983969756072337, "loss": 0.23133614659309387, "mean_token_accuracy": 0.9111513495445251, "num_tokens": 7956720.0, "step": 645 }, { "entropy": 1.5642622113227844, "epoch": 0.34017904160084256, "grad_norm": 0.3964219093322754, "learning_rate": 0.00019983838669136782, "loss": 0.25138217210769653, "mean_token_accuracy": 0.9010957926511765, "num_tokens": 7969056.0, "step": 646 }, { "entropy": 1.562336266040802, "epoch": 0.3407056345444971, "grad_norm": 0.33525609970092773, "learning_rate": 0.00019983707048883083, "loss": 0.21662499010562897, "mean_token_accuracy": 0.9179873615503311, "num_tokens": 7981392.0, "step": 647 }, { "entropy": 1.5184325873851776, "epoch": 0.3412322274881517, "grad_norm": 0.36040404438972473, "learning_rate": 0.0001998357489531906, "loss": 0.21142053604125977, "mean_token_accuracy": 0.9129342883825302, "num_tokens": 7993728.0, "step": 648 }, { "entropy": 1.525155395269394, "epoch": 0.3417588204318062, "grad_norm": 0.37644830346107483, "learning_rate": 0.00019983442208452553, "loss": 0.24553003907203674, "mean_token_accuracy": 0.9037658125162125, "num_tokens": 8006064.0, "step": 649 }, { "entropy": 1.5811420381069183, "epoch": 0.34228541337546076, "grad_norm": 0.4055664837360382, "learning_rate": 0.00019983308988291446, "loss": 0.24890564382076263, "mean_token_accuracy": 0.9027184396982193, "num_tokens": 8018400.0, "step": 650 }, { "entropy": 1.5781408250331879, "epoch": 0.34281200631911535, "grad_norm": 0.37236547470092773, "learning_rate": 0.0001998317523484364, "loss": 0.2316565066576004, "mean_token_accuracy": 0.9119908362627029, "num_tokens": 8030736.0, "step": 651 }, { "entropy": 1.470947027206421, "epoch": 0.3433385992627699, "grad_norm": 0.3868812918663025, "learning_rate": 0.00019983040948117078, "loss": 0.2534410059452057, "mean_token_accuracy": 0.9021570980548859, "num_tokens": 8043072.0, "step": 652 }, { "entropy": 1.5348678827285767, "epoch": 0.3438651922064244, "grad_norm": 0.4387357234954834, "learning_rate": 0.00019982906128119732, "loss": 0.22310803830623627, "mean_token_accuracy": 0.9145376235246658, "num_tokens": 8055408.0, "step": 653 }, { "entropy": 1.6187977194786072, "epoch": 0.344391785150079, "grad_norm": 0.3973976671695709, "learning_rate": 0.00019982770774859608, "loss": 0.24628473818302155, "mean_token_accuracy": 0.9026829153299332, "num_tokens": 8067744.0, "step": 654 }, { "entropy": 1.552239865064621, "epoch": 0.34491837809373355, "grad_norm": 0.35203489661216736, "learning_rate": 0.00019982634888344737, "loss": 0.2246260643005371, "mean_token_accuracy": 0.9107431769371033, "num_tokens": 8080080.0, "step": 655 }, { "entropy": 1.5582615733146667, "epoch": 0.3454449710373881, "grad_norm": 0.35882458090782166, "learning_rate": 0.00019982498468583187, "loss": 0.24929207563400269, "mean_token_accuracy": 0.9079926460981369, "num_tokens": 8092416.0, "step": 656 }, { "entropy": 1.5417989492416382, "epoch": 0.3459715639810427, "grad_norm": 0.3812078833580017, "learning_rate": 0.00019982361515583056, "loss": 0.23627105355262756, "mean_token_accuracy": 0.9105822741985321, "num_tokens": 8104752.0, "step": 657 }, { "entropy": 1.5216515362262726, "epoch": 0.3464981569246972, "grad_norm": 0.425227552652359, "learning_rate": 0.00019982224029352477, "loss": 0.24528373777866364, "mean_token_accuracy": 0.9078731536865234, "num_tokens": 8117088.0, "step": 658 }, { "entropy": 1.5206952691078186, "epoch": 0.34702474986835175, "grad_norm": 0.33637750148773193, "learning_rate": 0.0001998208600989961, "loss": 0.2107471525669098, "mean_token_accuracy": 0.9135650843381882, "num_tokens": 8129424.0, "step": 659 }, { "entropy": 1.4702115952968597, "epoch": 0.34755134281200634, "grad_norm": 0.39711427688598633, "learning_rate": 0.00019981947457232646, "loss": 0.2600536048412323, "mean_token_accuracy": 0.900258481502533, "num_tokens": 8141760.0, "step": 660 }, { "entropy": 1.4251591563224792, "epoch": 0.34807793575566087, "grad_norm": 0.3307092487812042, "learning_rate": 0.00019981808371359816, "loss": 0.20669502019882202, "mean_token_accuracy": 0.9150898307561874, "num_tokens": 8154096.0, "step": 661 }, { "entropy": 1.4800917506217957, "epoch": 0.3486045286993154, "grad_norm": 0.3357905447483063, "learning_rate": 0.00019981668752289372, "loss": 0.21784240007400513, "mean_token_accuracy": 0.9145694226026535, "num_tokens": 8166432.0, "step": 662 }, { "entropy": 1.4939378798007965, "epoch": 0.34913112164297, "grad_norm": 0.3817315101623535, "learning_rate": 0.00019981528600029598, "loss": 0.23391678929328918, "mean_token_accuracy": 0.9120414704084396, "num_tokens": 8178768.0, "step": 663 }, { "entropy": 1.46476212143898, "epoch": 0.34965771458662454, "grad_norm": 0.38629287481307983, "learning_rate": 0.00019981387914588822, "loss": 0.2348746955394745, "mean_token_accuracy": 0.9141973257064819, "num_tokens": 8191104.0, "step": 664 }, { "entropy": 1.488828182220459, "epoch": 0.35018430753027907, "grad_norm": 0.43263551592826843, "learning_rate": 0.00019981246695975396, "loss": 0.24639199674129486, "mean_token_accuracy": 0.9060526490211487, "num_tokens": 8203440.0, "step": 665 }, { "entropy": 1.4127525091171265, "epoch": 0.35071090047393366, "grad_norm": 0.3648802936077118, "learning_rate": 0.00019981104944197698, "loss": 0.21946357190608978, "mean_token_accuracy": 0.9159405082464218, "num_tokens": 8215776.0, "step": 666 }, { "entropy": 1.4903503954410553, "epoch": 0.3512374934175882, "grad_norm": 0.34730279445648193, "learning_rate": 0.00019980962659264144, "loss": 0.2281692773103714, "mean_token_accuracy": 0.9098831713199615, "num_tokens": 8228112.0, "step": 667 }, { "entropy": 1.5247552990913391, "epoch": 0.35176408636124273, "grad_norm": 0.6796702742576599, "learning_rate": 0.00019980819841183185, "loss": 0.2541208267211914, "mean_token_accuracy": 0.899626687169075, "num_tokens": 8240448.0, "step": 668 }, { "entropy": 1.489711880683899, "epoch": 0.3522906793048973, "grad_norm": 0.33805036544799805, "learning_rate": 0.00019980676489963294, "loss": 0.2260848581790924, "mean_token_accuracy": 0.9087798148393631, "num_tokens": 8252784.0, "step": 669 }, { "entropy": 1.5027905106544495, "epoch": 0.35281727224855186, "grad_norm": 0.350353479385376, "learning_rate": 0.00019980532605612985, "loss": 0.21086406707763672, "mean_token_accuracy": 0.9210447818040848, "num_tokens": 8265120.0, "step": 670 }, { "entropy": 1.5674294233322144, "epoch": 0.35334386519220645, "grad_norm": 0.3340439200401306, "learning_rate": 0.00019980388188140798, "loss": 0.20525240898132324, "mean_token_accuracy": 0.922586515545845, "num_tokens": 8277456.0, "step": 671 }, { "entropy": 1.5054379403591156, "epoch": 0.353870458135861, "grad_norm": 0.3567858934402466, "learning_rate": 0.00019980243237555304, "loss": 0.2413492202758789, "mean_token_accuracy": 0.9065290242433548, "num_tokens": 8289792.0, "step": 672 }, { "entropy": 1.458409994840622, "epoch": 0.3543970510795155, "grad_norm": 0.3392413854598999, "learning_rate": 0.00019980097753865108, "loss": 0.21458403766155243, "mean_token_accuracy": 0.915942057967186, "num_tokens": 8302128.0, "step": 673 }, { "entropy": 1.5474618673324585, "epoch": 0.3549236440231701, "grad_norm": 0.3782627582550049, "learning_rate": 0.00019979951737078853, "loss": 0.24051563441753387, "mean_token_accuracy": 0.905216172337532, "num_tokens": 8314464.0, "step": 674 }, { "entropy": 1.453640639781952, "epoch": 0.35545023696682465, "grad_norm": 0.3473234474658966, "learning_rate": 0.000199798051872052, "loss": 0.22346456348896027, "mean_token_accuracy": 0.9117260426282883, "num_tokens": 8326800.0, "step": 675 }, { "entropy": 1.4625252783298492, "epoch": 0.3559768299104792, "grad_norm": 0.3387875258922577, "learning_rate": 0.0001997965810425285, "loss": 0.23459070920944214, "mean_token_accuracy": 0.9097730964422226, "num_tokens": 8339136.0, "step": 676 }, { "entropy": 1.4122467339038849, "epoch": 0.3565034228541338, "grad_norm": 0.3719231188297272, "learning_rate": 0.0001997951048823054, "loss": 0.21170935034751892, "mean_token_accuracy": 0.9177156686782837, "num_tokens": 8351472.0, "step": 677 }, { "entropy": 1.3950088024139404, "epoch": 0.3570300157977883, "grad_norm": 0.346206933259964, "learning_rate": 0.00019979362339147026, "loss": 0.24381937086582184, "mean_token_accuracy": 0.9096541851758957, "num_tokens": 8363808.0, "step": 678 }, { "entropy": 1.392151266336441, "epoch": 0.35755660874144285, "grad_norm": 0.4163087010383606, "learning_rate": 0.00019979213657011106, "loss": 0.23680301010608673, "mean_token_accuracy": 0.9078295677900314, "num_tokens": 8376144.0, "step": 679 }, { "entropy": 1.272907316684723, "epoch": 0.35808320168509744, "grad_norm": 0.4227026104927063, "learning_rate": 0.00019979064441831606, "loss": 0.2319648414850235, "mean_token_accuracy": 0.9085201323032379, "num_tokens": 8388480.0, "step": 680 }, { "entropy": 1.3540238738059998, "epoch": 0.358609794628752, "grad_norm": 0.41346514225006104, "learning_rate": 0.00019978914693617383, "loss": 0.228549063205719, "mean_token_accuracy": 0.9105959385633469, "num_tokens": 8400816.0, "step": 681 }, { "entropy": 1.360448271036148, "epoch": 0.3591363875724065, "grad_norm": 0.3442930281162262, "learning_rate": 0.0001997876441237733, "loss": 0.23922371864318848, "mean_token_accuracy": 0.9045034646987915, "num_tokens": 8413152.0, "step": 682 }, { "entropy": 1.2645371556282043, "epoch": 0.3596629805160611, "grad_norm": 0.3163891136646271, "learning_rate": 0.00019978613598120362, "loss": 0.23533323407173157, "mean_token_accuracy": 0.9094915986061096, "num_tokens": 8425488.0, "step": 683 }, { "entropy": 1.23646479845047, "epoch": 0.36018957345971564, "grad_norm": 0.3051406741142273, "learning_rate": 0.00019978462250855439, "loss": 0.23106315732002258, "mean_token_accuracy": 0.908999964594841, "num_tokens": 8437824.0, "step": 684 }, { "entropy": 1.2108670771121979, "epoch": 0.3607161664033702, "grad_norm": 0.3296745717525482, "learning_rate": 0.00019978310370591545, "loss": 0.21918885409832, "mean_token_accuracy": 0.9144444465637207, "num_tokens": 8450160.0, "step": 685 }, { "entropy": 1.2031162977218628, "epoch": 0.36124275934702477, "grad_norm": 0.34492868185043335, "learning_rate": 0.0001997815795733769, "loss": 0.23954619467258453, "mean_token_accuracy": 0.9077229052782059, "num_tokens": 8462496.0, "step": 686 }, { "entropy": 1.186975747346878, "epoch": 0.3617693522906793, "grad_norm": 0.3709777593612671, "learning_rate": 0.00019978005011102925, "loss": 0.2437351793050766, "mean_token_accuracy": 0.908468559384346, "num_tokens": 8474832.0, "step": 687 }, { "entropy": 1.2189928591251373, "epoch": 0.36229594523433384, "grad_norm": 0.39078283309936523, "learning_rate": 0.00019977851531896335, "loss": 0.23512142896652222, "mean_token_accuracy": 0.9079535007476807, "num_tokens": 8487168.0, "step": 688 }, { "entropy": 1.1402603685855865, "epoch": 0.36282253817798843, "grad_norm": 0.44031041860580444, "learning_rate": 0.00019977697519727025, "loss": 0.22278329730033875, "mean_token_accuracy": 0.9095389991998672, "num_tokens": 8499504.0, "step": 689 }, { "entropy": 1.2126906514167786, "epoch": 0.36334913112164297, "grad_norm": 0.4217199385166168, "learning_rate": 0.00019977542974604137, "loss": 0.2309587299823761, "mean_token_accuracy": 0.9086143374443054, "num_tokens": 8511840.0, "step": 690 }, { "entropy": 1.2279771864414215, "epoch": 0.3638757240652975, "grad_norm": 0.38159534335136414, "learning_rate": 0.00019977387896536847, "loss": 0.22851325571537018, "mean_token_accuracy": 0.9110317975282669, "num_tokens": 8524176.0, "step": 691 }, { "entropy": 1.1451427340507507, "epoch": 0.3644023170089521, "grad_norm": 0.38951390981674194, "learning_rate": 0.00019977232285534364, "loss": 0.22088123857975006, "mean_token_accuracy": 0.9204992055892944, "num_tokens": 8536512.0, "step": 692 }, { "entropy": 1.2615329325199127, "epoch": 0.36492890995260663, "grad_norm": 0.4139882028102875, "learning_rate": 0.0001997707614160592, "loss": 0.24705028533935547, "mean_token_accuracy": 0.9034076929092407, "num_tokens": 8548848.0, "step": 693 }, { "entropy": 1.283850759267807, "epoch": 0.36545550289626116, "grad_norm": 0.369973361492157, "learning_rate": 0.00019976919464760793, "loss": 0.22415512800216675, "mean_token_accuracy": 0.9107316434383392, "num_tokens": 8561184.0, "step": 694 }, { "entropy": 1.2292048037052155, "epoch": 0.36598209583991576, "grad_norm": 0.38250577449798584, "learning_rate": 0.00019976762255008277, "loss": 0.23568174242973328, "mean_token_accuracy": 0.9063956588506699, "num_tokens": 8573520.0, "step": 695 }, { "entropy": 1.2365350425243378, "epoch": 0.3665086887835703, "grad_norm": 0.3148071765899658, "learning_rate": 0.00019976604512357706, "loss": 0.1988360434770584, "mean_token_accuracy": 0.9224959909915924, "num_tokens": 8585856.0, "step": 696 }, { "entropy": 1.3029758036136627, "epoch": 0.3670352817272249, "grad_norm": 0.3744061589241028, "learning_rate": 0.00019976446236818444, "loss": 0.20495107769966125, "mean_token_accuracy": 0.9228791147470474, "num_tokens": 8598192.0, "step": 697 }, { "entropy": 1.2882287502288818, "epoch": 0.3675618746708794, "grad_norm": 0.36938560009002686, "learning_rate": 0.00019976287428399888, "loss": 0.21769095957279205, "mean_token_accuracy": 0.9142359048128128, "num_tokens": 8610528.0, "step": 698 }, { "entropy": 1.3306386470794678, "epoch": 0.36808846761453395, "grad_norm": 0.34892189502716064, "learning_rate": 0.00019976128087111468, "loss": 0.22379228472709656, "mean_token_accuracy": 0.910999983549118, "num_tokens": 8622864.0, "step": 699 }, { "entropy": 1.422240823507309, "epoch": 0.36861506055818855, "grad_norm": 0.4013206660747528, "learning_rate": 0.00019975968212962637, "loss": 0.24196377396583557, "mean_token_accuracy": 0.9052925109863281, "num_tokens": 8635200.0, "step": 700 }, { "entropy": 1.4155401587486267, "epoch": 0.3691416535018431, "grad_norm": 0.353211373090744, "learning_rate": 0.0001997580780596289, "loss": 0.23057395219802856, "mean_token_accuracy": 0.9112053066492081, "num_tokens": 8647536.0, "step": 701 }, { "entropy": 1.3654289841651917, "epoch": 0.3696682464454976, "grad_norm": 0.3298124372959137, "learning_rate": 0.0001997564686612175, "loss": 0.23379994928836823, "mean_token_accuracy": 0.9082982391119003, "num_tokens": 8659872.0, "step": 702 }, { "entropy": 1.4584643244743347, "epoch": 0.3701948393891522, "grad_norm": 0.3759617805480957, "learning_rate": 0.00019975485393448764, "loss": 0.23104792833328247, "mean_token_accuracy": 0.9065845310688019, "num_tokens": 8672208.0, "step": 703 }, { "entropy": 1.444229632616043, "epoch": 0.37072143233280674, "grad_norm": 0.3501303791999817, "learning_rate": 0.00019975323387953528, "loss": 0.2252783626317978, "mean_token_accuracy": 0.9078841656446457, "num_tokens": 8684544.0, "step": 704 }, { "entropy": 1.4961676001548767, "epoch": 0.3712480252764613, "grad_norm": 0.37864333391189575, "learning_rate": 0.00019975160849645656, "loss": 0.248760387301445, "mean_token_accuracy": 0.9001511335372925, "num_tokens": 8696880.0, "step": 705 }, { "entropy": 1.42547208070755, "epoch": 0.37177461822011587, "grad_norm": 0.34873253107070923, "learning_rate": 0.00019974997778534793, "loss": 0.21211083233356476, "mean_token_accuracy": 0.9166723936796188, "num_tokens": 8709216.0, "step": 706 }, { "entropy": 1.5042538046836853, "epoch": 0.3723012111637704, "grad_norm": 0.3550424873828888, "learning_rate": 0.00019974834174630622, "loss": 0.23886847496032715, "mean_token_accuracy": 0.907848909497261, "num_tokens": 8721552.0, "step": 707 }, { "entropy": 1.5081537961959839, "epoch": 0.37282780410742494, "grad_norm": 0.41367873549461365, "learning_rate": 0.00019974670037942855, "loss": 0.22889745235443115, "mean_token_accuracy": 0.9153233766555786, "num_tokens": 8733888.0, "step": 708 }, { "entropy": 1.3966407477855682, "epoch": 0.37335439705107953, "grad_norm": 0.3816620707511902, "learning_rate": 0.00019974505368481238, "loss": 0.22411897778511047, "mean_token_accuracy": 0.9170472025871277, "num_tokens": 8746224.0, "step": 709 }, { "entropy": 1.3528437912464142, "epoch": 0.37388098999473407, "grad_norm": 0.3909305930137634, "learning_rate": 0.00019974340166255543, "loss": 0.24883610010147095, "mean_token_accuracy": 0.9069965332746506, "num_tokens": 8758560.0, "step": 710 }, { "entropy": 1.3574591279029846, "epoch": 0.3744075829383886, "grad_norm": 0.3753831088542938, "learning_rate": 0.00019974174431275582, "loss": 0.21758557856082916, "mean_token_accuracy": 0.9138903617858887, "num_tokens": 8770896.0, "step": 711 }, { "entropy": 1.3783180713653564, "epoch": 0.3749341758820432, "grad_norm": 0.3737315833568573, "learning_rate": 0.0001997400816355119, "loss": 0.21359983086585999, "mean_token_accuracy": 0.9189057648181915, "num_tokens": 8783232.0, "step": 712 }, { "entropy": 1.3974202573299408, "epoch": 0.37546076882569773, "grad_norm": 0.349575012922287, "learning_rate": 0.00019973841363092232, "loss": 0.2197628617286682, "mean_token_accuracy": 0.910584107041359, "num_tokens": 8795568.0, "step": 713 }, { "entropy": 1.4738838374614716, "epoch": 0.37598736176935227, "grad_norm": 0.39151832461357117, "learning_rate": 0.0001997367402990862, "loss": 0.22688592970371246, "mean_token_accuracy": 0.9129604697227478, "num_tokens": 8807904.0, "step": 714 }, { "entropy": 1.4208093285560608, "epoch": 0.37651395471300686, "grad_norm": 0.41211023926734924, "learning_rate": 0.00019973506164010284, "loss": 0.20385678112506866, "mean_token_accuracy": 0.9227319210767746, "num_tokens": 8820240.0, "step": 715 }, { "entropy": 1.4047819375991821, "epoch": 0.3770405476566614, "grad_norm": 0.4299006164073944, "learning_rate": 0.00019973337765407187, "loss": 0.23750200867652893, "mean_token_accuracy": 0.9077501893043518, "num_tokens": 8832576.0, "step": 716 }, { "entropy": 1.374906837940216, "epoch": 0.37756714060031593, "grad_norm": 0.36846232414245605, "learning_rate": 0.00019973168834109327, "loss": 0.23285596072673798, "mean_token_accuracy": 0.9094402939081192, "num_tokens": 8844912.0, "step": 717 }, { "entropy": 1.4372902512550354, "epoch": 0.3780937335439705, "grad_norm": 0.3780461549758911, "learning_rate": 0.00019972999370126737, "loss": 0.23158109188079834, "mean_token_accuracy": 0.9099433869123459, "num_tokens": 8857248.0, "step": 718 }, { "entropy": 1.3874932825565338, "epoch": 0.37862032648762506, "grad_norm": 0.34537607431411743, "learning_rate": 0.00019972829373469467, "loss": 0.21864044666290283, "mean_token_accuracy": 0.9146191030740738, "num_tokens": 8869584.0, "step": 719 }, { "entropy": 1.374584138393402, "epoch": 0.3791469194312796, "grad_norm": 0.33857598900794983, "learning_rate": 0.00019972658844147621, "loss": 0.20933406054973602, "mean_token_accuracy": 0.917707160115242, "num_tokens": 8881920.0, "step": 720 }, { "entropy": 1.3695291578769684, "epoch": 0.3796735123749342, "grad_norm": 0.5717244148254395, "learning_rate": 0.0001997248778217131, "loss": 0.22078999876976013, "mean_token_accuracy": 0.9167369604110718, "num_tokens": 8894256.0, "step": 721 }, { "entropy": 1.26867213845253, "epoch": 0.3802001053185887, "grad_norm": 0.36367470026016235, "learning_rate": 0.000199723161875507, "loss": 0.23508650064468384, "mean_token_accuracy": 0.90509033203125, "num_tokens": 8906592.0, "step": 722 }, { "entropy": 1.3050034940242767, "epoch": 0.3807266982622433, "grad_norm": 0.3631988763809204, "learning_rate": 0.0001997214406029597, "loss": 0.22164851427078247, "mean_token_accuracy": 0.9132580459117889, "num_tokens": 8918928.0, "step": 723 }, { "entropy": 1.3181822001934052, "epoch": 0.38125329120589785, "grad_norm": 0.4014921486377716, "learning_rate": 0.00019971971400417342, "loss": 0.220194011926651, "mean_token_accuracy": 0.9143774807453156, "num_tokens": 8931264.0, "step": 724 }, { "entropy": 1.2655711770057678, "epoch": 0.3817798841495524, "grad_norm": 0.34297892451286316, "learning_rate": 0.00019971798207925063, "loss": 0.21592603623867035, "mean_token_accuracy": 0.9114037603139877, "num_tokens": 8943600.0, "step": 725 }, { "entropy": 1.3559162318706512, "epoch": 0.382306477093207, "grad_norm": 0.39595136046409607, "learning_rate": 0.00019971624482829415, "loss": 0.2135222852230072, "mean_token_accuracy": 0.9156046807765961, "num_tokens": 8955936.0, "step": 726 }, { "entropy": 1.4213075637817383, "epoch": 0.3828330700368615, "grad_norm": 0.35875996947288513, "learning_rate": 0.00019971450225140716, "loss": 0.22025166451931, "mean_token_accuracy": 0.9119539260864258, "num_tokens": 8968272.0, "step": 727 }, { "entropy": 1.2975660860538483, "epoch": 0.38335966298051605, "grad_norm": 0.33709245920181274, "learning_rate": 0.00019971275434869302, "loss": 0.2429068237543106, "mean_token_accuracy": 0.9056646823883057, "num_tokens": 8980608.0, "step": 728 }, { "entropy": 1.3944336771965027, "epoch": 0.38388625592417064, "grad_norm": 0.3580012321472168, "learning_rate": 0.0001997110011202556, "loss": 0.228425070643425, "mean_token_accuracy": 0.9088682681322098, "num_tokens": 8992944.0, "step": 729 }, { "entropy": 1.386294186115265, "epoch": 0.3844128488678252, "grad_norm": 0.5559288859367371, "learning_rate": 0.00019970924256619888, "loss": 0.22206491231918335, "mean_token_accuracy": 0.9095857888460159, "num_tokens": 9005280.0, "step": 730 }, { "entropy": 1.3968450129032135, "epoch": 0.3849394418114797, "grad_norm": 0.38346561789512634, "learning_rate": 0.0001997074786866273, "loss": 0.2516261637210846, "mean_token_accuracy": 0.9072631448507309, "num_tokens": 9017616.0, "step": 731 }, { "entropy": 1.3758391439914703, "epoch": 0.3854660347551343, "grad_norm": 0.4184466302394867, "learning_rate": 0.00019970570948164555, "loss": 0.2083946019411087, "mean_token_accuracy": 0.915515810251236, "num_tokens": 9029952.0, "step": 732 }, { "entropy": 1.3424640595912933, "epoch": 0.38599262769878884, "grad_norm": 0.3482263684272766, "learning_rate": 0.00019970393495135868, "loss": 0.23488564789295197, "mean_token_accuracy": 0.9109048992395401, "num_tokens": 9042288.0, "step": 733 }, { "entropy": 1.3400058150291443, "epoch": 0.3865192206424434, "grad_norm": 0.4521651268005371, "learning_rate": 0.00019970215509587205, "loss": 0.24672454595565796, "mean_token_accuracy": 0.9039757996797562, "num_tokens": 9054624.0, "step": 734 }, { "entropy": 1.3971166908740997, "epoch": 0.38704581358609796, "grad_norm": 0.3671362102031708, "learning_rate": 0.0001997003699152913, "loss": 0.22332459688186646, "mean_token_accuracy": 0.9150716066360474, "num_tokens": 9066960.0, "step": 735 }, { "entropy": 1.3570407629013062, "epoch": 0.3875724065297525, "grad_norm": 0.4007357358932495, "learning_rate": 0.00019969857940972235, "loss": 0.22975003719329834, "mean_token_accuracy": 0.9176786690950394, "num_tokens": 9079296.0, "step": 736 }, { "entropy": 1.3730257153511047, "epoch": 0.38809899947340704, "grad_norm": 0.3905254602432251, "learning_rate": 0.00019969678357927158, "loss": 0.22929853200912476, "mean_token_accuracy": 0.909871906042099, "num_tokens": 9091632.0, "step": 737 }, { "entropy": 1.3547758758068085, "epoch": 0.3886255924170616, "grad_norm": 0.36366337537765503, "learning_rate": 0.00019969498242404556, "loss": 0.22672298550605774, "mean_token_accuracy": 0.9105400443077087, "num_tokens": 9103968.0, "step": 738 }, { "entropy": 1.322388231754303, "epoch": 0.38915218536071616, "grad_norm": 0.3948267698287964, "learning_rate": 0.0001996931759441512, "loss": 0.21981076896190643, "mean_token_accuracy": 0.9127620607614517, "num_tokens": 9116304.0, "step": 739 }, { "entropy": 1.3535179495811462, "epoch": 0.3896787783043707, "grad_norm": 0.39007002115249634, "learning_rate": 0.00019969136413969577, "loss": 0.23180383443832397, "mean_token_accuracy": 0.9031165540218353, "num_tokens": 9128640.0, "step": 740 }, { "entropy": 1.395143300294876, "epoch": 0.3902053712480253, "grad_norm": 0.39624056220054626, "learning_rate": 0.00019968954701078678, "loss": 0.21380290389060974, "mean_token_accuracy": 0.9165746420621872, "num_tokens": 9140976.0, "step": 741 }, { "entropy": 1.3894523680210114, "epoch": 0.3907319641916798, "grad_norm": 0.37505805492401123, "learning_rate": 0.00019968772455753218, "loss": 0.21238526701927185, "mean_token_accuracy": 0.9176094681024551, "num_tokens": 9153312.0, "step": 742 }, { "entropy": 1.3369868099689484, "epoch": 0.39125855713533436, "grad_norm": 0.364109605550766, "learning_rate": 0.00019968589678004008, "loss": 0.2217993289232254, "mean_token_accuracy": 0.9145223498344421, "num_tokens": 9165648.0, "step": 743 }, { "entropy": 1.4128968715667725, "epoch": 0.39178515007898895, "grad_norm": 0.37613528966903687, "learning_rate": 0.00019968406367841903, "loss": 0.2087160050868988, "mean_token_accuracy": 0.9174602627754211, "num_tokens": 9177984.0, "step": 744 }, { "entropy": 1.3632179498672485, "epoch": 0.3923117430226435, "grad_norm": 0.3908347189426422, "learning_rate": 0.00019968222525277785, "loss": 0.24387134611606598, "mean_token_accuracy": 0.9096127450466156, "num_tokens": 9190320.0, "step": 745 }, { "entropy": 1.3598384857177734, "epoch": 0.392838335966298, "grad_norm": 0.4070599377155304, "learning_rate": 0.00019968038150322564, "loss": 0.22589103877544403, "mean_token_accuracy": 0.9176203459501266, "num_tokens": 9202656.0, "step": 746 }, { "entropy": 1.2700338661670685, "epoch": 0.3933649289099526, "grad_norm": 0.3903157711029053, "learning_rate": 0.0001996785324298719, "loss": 0.27620363235473633, "mean_token_accuracy": 0.89641934633255, "num_tokens": 9214992.0, "step": 747 }, { "entropy": 1.3561755120754242, "epoch": 0.39389152185360715, "grad_norm": 0.3912152647972107, "learning_rate": 0.00019967667803282637, "loss": 0.20860803127288818, "mean_token_accuracy": 0.918526291847229, "num_tokens": 9227328.0, "step": 748 }, { "entropy": 1.2694224119186401, "epoch": 0.39441811479726174, "grad_norm": 0.36671656370162964, "learning_rate": 0.00019967481831219917, "loss": 0.23243974149227142, "mean_token_accuracy": 0.9083072245121002, "num_tokens": 9239664.0, "step": 749 }, { "entropy": 1.2892687618732452, "epoch": 0.3949447077409163, "grad_norm": 0.33213678002357483, "learning_rate": 0.0001996729532681006, "loss": 0.22482578456401825, "mean_token_accuracy": 0.9108980298042297, "num_tokens": 9252000.0, "step": 750 }, { "entropy": 1.2784943878650665, "epoch": 0.3954713006845708, "grad_norm": 0.311139851808548, "learning_rate": 0.0001996710829006415, "loss": 0.22491638362407684, "mean_token_accuracy": 0.9146853238344193, "num_tokens": 9264336.0, "step": 751 }, { "entropy": 1.3392630815505981, "epoch": 0.3959978936282254, "grad_norm": 0.31522372364997864, "learning_rate": 0.00019966920720993286, "loss": 0.19653388857841492, "mean_token_accuracy": 0.9204227477312088, "num_tokens": 9276672.0, "step": 752 }, { "entropy": 1.3383756875991821, "epoch": 0.39652448657187994, "grad_norm": 0.353919118642807, "learning_rate": 0.00019966732619608598, "loss": 0.23490512371063232, "mean_token_accuracy": 0.9106432646512985, "num_tokens": 9289008.0, "step": 753 }, { "entropy": 1.3619754612445831, "epoch": 0.3970510795155345, "grad_norm": 0.40393969416618347, "learning_rate": 0.00019966543985921258, "loss": 0.25288036465644836, "mean_token_accuracy": 0.8984902203083038, "num_tokens": 9301344.0, "step": 754 }, { "entropy": 1.2913717925548553, "epoch": 0.39757767245918907, "grad_norm": 0.3196253478527069, "learning_rate": 0.00019966354819942462, "loss": 0.20618736743927002, "mean_token_accuracy": 0.9167482256889343, "num_tokens": 9313680.0, "step": 755 }, { "entropy": 1.3224665522575378, "epoch": 0.3981042654028436, "grad_norm": 0.32193470001220703, "learning_rate": 0.0001996616512168344, "loss": 0.21416081488132477, "mean_token_accuracy": 0.9158345758914948, "num_tokens": 9326016.0, "step": 756 }, { "entropy": 1.3358683288097382, "epoch": 0.39863085834649814, "grad_norm": 0.3324636220932007, "learning_rate": 0.00019965974891155458, "loss": 0.23043948411941528, "mean_token_accuracy": 0.9085040837526321, "num_tokens": 9338352.0, "step": 757 }, { "entropy": 1.3305124342441559, "epoch": 0.39915745129015273, "grad_norm": 0.34178489446640015, "learning_rate": 0.00019965784128369798, "loss": 0.22156858444213867, "mean_token_accuracy": 0.9111177027225494, "num_tokens": 9350688.0, "step": 758 }, { "entropy": 1.3993423879146576, "epoch": 0.39968404423380727, "grad_norm": 0.35117653012275696, "learning_rate": 0.00019965592833337797, "loss": 0.24540282785892487, "mean_token_accuracy": 0.9031884074211121, "num_tokens": 9363024.0, "step": 759 }, { "entropy": 1.363684356212616, "epoch": 0.4002106371774618, "grad_norm": 0.3588322699069977, "learning_rate": 0.000199654010060708, "loss": 0.23427176475524902, "mean_token_accuracy": 0.9089349061250687, "num_tokens": 9375360.0, "step": 760 }, { "entropy": 1.3599910140037537, "epoch": 0.4007372301211164, "grad_norm": 0.3444473147392273, "learning_rate": 0.000199652086465802, "loss": 0.2288491129875183, "mean_token_accuracy": 0.909742534160614, "num_tokens": 9387696.0, "step": 761 }, { "entropy": 1.3465708196163177, "epoch": 0.40126382306477093, "grad_norm": 0.3881551921367645, "learning_rate": 0.00019965015754877419, "loss": 0.21851959824562073, "mean_token_accuracy": 0.911541685461998, "num_tokens": 9400032.0, "step": 762 }, { "entropy": 1.3606258928775787, "epoch": 0.40179041600842547, "grad_norm": 0.3825187683105469, "learning_rate": 0.00019964822330973902, "loss": 0.24844150245189667, "mean_token_accuracy": 0.905233234167099, "num_tokens": 9412368.0, "step": 763 }, { "entropy": 1.4477742910385132, "epoch": 0.40231700895208006, "grad_norm": 0.4269307553768158, "learning_rate": 0.00019964628374881133, "loss": 0.21143238246440887, "mean_token_accuracy": 0.914307177066803, "num_tokens": 9424704.0, "step": 764 }, { "entropy": 1.4273262321949005, "epoch": 0.4028436018957346, "grad_norm": 0.477578341960907, "learning_rate": 0.0001996443388661063, "loss": 0.21041172742843628, "mean_token_accuracy": 0.9194318652153015, "num_tokens": 9437040.0, "step": 765 }, { "entropy": 1.42348974943161, "epoch": 0.40337019483938913, "grad_norm": 0.42482423782348633, "learning_rate": 0.00019964238866173933, "loss": 0.22475981712341309, "mean_token_accuracy": 0.9095583707094193, "num_tokens": 9449376.0, "step": 766 }, { "entropy": 1.3782070577144623, "epoch": 0.4038967877830437, "grad_norm": 0.3717379570007324, "learning_rate": 0.00019964043313582626, "loss": 0.2339317947626114, "mean_token_accuracy": 0.9064943641424179, "num_tokens": 9461712.0, "step": 767 }, { "entropy": 1.3753153681755066, "epoch": 0.40442338072669826, "grad_norm": 0.32700079679489136, "learning_rate": 0.00019963847228848312, "loss": 0.2289605587720871, "mean_token_accuracy": 0.9136441200971603, "num_tokens": 9474048.0, "step": 768 }, { "entropy": 1.3423367142677307, "epoch": 0.4049499736703528, "grad_norm": 0.4840228855609894, "learning_rate": 0.00019963650611982636, "loss": 0.24808013439178467, "mean_token_accuracy": 0.9013350456953049, "num_tokens": 9486384.0, "step": 769 }, { "entropy": 1.388725221157074, "epoch": 0.4054765666140074, "grad_norm": 0.3298131823539734, "learning_rate": 0.0001996345346299726, "loss": 0.21849092841148376, "mean_token_accuracy": 0.9153172671794891, "num_tokens": 9498720.0, "step": 770 }, { "entropy": 1.362036794424057, "epoch": 0.4060031595576619, "grad_norm": 0.423976331949234, "learning_rate": 0.00019963255781903902, "loss": 0.2337607443332672, "mean_token_accuracy": 0.9124665558338165, "num_tokens": 9511056.0, "step": 771 }, { "entropy": 1.321341723203659, "epoch": 0.40652975250131645, "grad_norm": 0.39548537135124207, "learning_rate": 0.00019963057568714288, "loss": 0.2241300493478775, "mean_token_accuracy": 0.9098886847496033, "num_tokens": 9523392.0, "step": 772 }, { "entropy": 1.2956216037273407, "epoch": 0.40705634544497105, "grad_norm": 0.36130490899086, "learning_rate": 0.00019962858823440184, "loss": 0.22631655633449554, "mean_token_accuracy": 0.9111677557229996, "num_tokens": 9535728.0, "step": 773 }, { "entropy": 1.3697873950004578, "epoch": 0.4075829383886256, "grad_norm": 0.3786010444164276, "learning_rate": 0.00019962659546093395, "loss": 0.22168497741222382, "mean_token_accuracy": 0.9110663533210754, "num_tokens": 9548064.0, "step": 774 }, { "entropy": 1.3025212287902832, "epoch": 0.4081095313322802, "grad_norm": 0.3891861140727997, "learning_rate": 0.00019962459736685745, "loss": 0.2645792067050934, "mean_token_accuracy": 0.8977373838424683, "num_tokens": 9560400.0, "step": 775 }, { "entropy": 1.3207987844944, "epoch": 0.4086361242759347, "grad_norm": 0.40660449862480164, "learning_rate": 0.000199622593952291, "loss": 0.23059073090553284, "mean_token_accuracy": 0.9096915870904922, "num_tokens": 9572736.0, "step": 776 }, { "entropy": 1.2878498435020447, "epoch": 0.40916271721958924, "grad_norm": 0.35745811462402344, "learning_rate": 0.00019962058521735346, "loss": 0.21263521909713745, "mean_token_accuracy": 0.9142482280731201, "num_tokens": 9585072.0, "step": 777 }, { "entropy": 1.2785497307777405, "epoch": 0.40968931016324384, "grad_norm": 0.3724184036254883, "learning_rate": 0.00019961857116216415, "loss": 0.2524154484272003, "mean_token_accuracy": 0.8991471230983734, "num_tokens": 9597408.0, "step": 778 }, { "entropy": 1.2408149540424347, "epoch": 0.41021590310689837, "grad_norm": 0.3448520600795746, "learning_rate": 0.00019961655178684263, "loss": 0.20971742272377014, "mean_token_accuracy": 0.9130227416753769, "num_tokens": 9609744.0, "step": 779 }, { "entropy": 1.2202830016613007, "epoch": 0.4107424960505529, "grad_norm": 0.37864333391189575, "learning_rate": 0.0001996145270915087, "loss": 0.23903977870941162, "mean_token_accuracy": 0.9029916822910309, "num_tokens": 9622080.0, "step": 780 }, { "entropy": 1.1748075485229492, "epoch": 0.4112690889942075, "grad_norm": 0.36790093779563904, "learning_rate": 0.0001996124970762827, "loss": 0.24326302111148834, "mean_token_accuracy": 0.9089493155479431, "num_tokens": 9634416.0, "step": 781 }, { "entropy": 1.1609198153018951, "epoch": 0.41179568193786203, "grad_norm": 0.3445703685283661, "learning_rate": 0.00019961046174128496, "loss": 0.22028180956840515, "mean_token_accuracy": 0.9107068032026291, "num_tokens": 9646752.0, "step": 782 }, { "entropy": 1.1026230156421661, "epoch": 0.41232227488151657, "grad_norm": 0.3440577983856201, "learning_rate": 0.00019960842108663644, "loss": 0.19753555953502655, "mean_token_accuracy": 0.9187215715646744, "num_tokens": 9659088.0, "step": 783 }, { "entropy": 1.1320343911647797, "epoch": 0.41284886782517116, "grad_norm": 0.38988834619522095, "learning_rate": 0.00019960637511245823, "loss": 0.24359619617462158, "mean_token_accuracy": 0.9055552929639816, "num_tokens": 9671424.0, "step": 784 }, { "entropy": 1.1358483731746674, "epoch": 0.4133754607688257, "grad_norm": 0.34981632232666016, "learning_rate": 0.0001996043238188718, "loss": 0.24487480521202087, "mean_token_accuracy": 0.9070784449577332, "num_tokens": 9683760.0, "step": 785 }, { "entropy": 1.1212266087532043, "epoch": 0.41390205371248023, "grad_norm": 0.3241615891456604, "learning_rate": 0.0001996022672059989, "loss": 0.2086082100868225, "mean_token_accuracy": 0.9190200418233871, "num_tokens": 9696096.0, "step": 786 }, { "entropy": 1.1631585955619812, "epoch": 0.4144286466561348, "grad_norm": 0.36856940388679504, "learning_rate": 0.00019960020527396165, "loss": 0.20457178354263306, "mean_token_accuracy": 0.9173056781291962, "num_tokens": 9708432.0, "step": 787 }, { "entropy": 1.1695051193237305, "epoch": 0.41495523959978936, "grad_norm": 0.3899996876716614, "learning_rate": 0.00019959813802288245, "loss": 0.24216774106025696, "mean_token_accuracy": 0.9103662818670273, "num_tokens": 9720768.0, "step": 788 }, { "entropy": 1.1804447770118713, "epoch": 0.4154818325434439, "grad_norm": 0.3940189778804779, "learning_rate": 0.000199596065452884, "loss": 0.2604479491710663, "mean_token_accuracy": 0.8987935930490494, "num_tokens": 9733104.0, "step": 789 }, { "entropy": 1.2298611104488373, "epoch": 0.4160084254870985, "grad_norm": 0.3992246687412262, "learning_rate": 0.00019959398756408937, "loss": 0.24308446049690247, "mean_token_accuracy": 0.9046371877193451, "num_tokens": 9745440.0, "step": 790 }, { "entropy": 1.130595326423645, "epoch": 0.416535018430753, "grad_norm": 0.32028424739837646, "learning_rate": 0.00019959190435662186, "loss": 0.21361656486988068, "mean_token_accuracy": 0.9175485223531723, "num_tokens": 9757776.0, "step": 791 }, { "entropy": 1.2031766474246979, "epoch": 0.41706161137440756, "grad_norm": 0.3323441445827484, "learning_rate": 0.00019958981583060518, "loss": 0.22529007494449615, "mean_token_accuracy": 0.9116253554821014, "num_tokens": 9770112.0, "step": 792 }, { "entropy": 1.1709198653697968, "epoch": 0.41758820431806215, "grad_norm": 0.3305797874927521, "learning_rate": 0.0001995877219861633, "loss": 0.21258684992790222, "mean_token_accuracy": 0.9117163866758347, "num_tokens": 9782448.0, "step": 793 }, { "entropy": 1.2462036609649658, "epoch": 0.4181147972617167, "grad_norm": 0.32563477754592896, "learning_rate": 0.00019958562282342056, "loss": 0.22679030895233154, "mean_token_accuracy": 0.9114914387464523, "num_tokens": 9794784.0, "step": 794 }, { "entropy": 1.1364922225475311, "epoch": 0.4186413902053712, "grad_norm": 0.3199447989463806, "learning_rate": 0.0001995835183425015, "loss": 0.22316469252109528, "mean_token_accuracy": 0.9091953933238983, "num_tokens": 9807120.0, "step": 795 }, { "entropy": 1.2300072014331818, "epoch": 0.4191679831490258, "grad_norm": 0.3554495871067047, "learning_rate": 0.0001995814085435311, "loss": 0.2148018628358841, "mean_token_accuracy": 0.9172432273626328, "num_tokens": 9819456.0, "step": 796 }, { "entropy": 1.2751358449459076, "epoch": 0.41969457609268035, "grad_norm": 0.3625534772872925, "learning_rate": 0.00019957929342663457, "loss": 0.217167928814888, "mean_token_accuracy": 0.9148837774991989, "num_tokens": 9831792.0, "step": 797 }, { "entropy": 1.2123389542102814, "epoch": 0.42022116903633494, "grad_norm": 0.3511140048503876, "learning_rate": 0.00019957717299193752, "loss": 0.21881210803985596, "mean_token_accuracy": 0.9147087782621384, "num_tokens": 9844128.0, "step": 798 }, { "entropy": 1.2617943584918976, "epoch": 0.4207477619799895, "grad_norm": 0.3321590721607208, "learning_rate": 0.0001995750472395658, "loss": 0.22508296370506287, "mean_token_accuracy": 0.9119736105203629, "num_tokens": 9856464.0, "step": 799 }, { "entropy": 1.2528738677501678, "epoch": 0.421274354923644, "grad_norm": 0.3493482768535614, "learning_rate": 0.00019957291616964565, "loss": 0.234869584441185, "mean_token_accuracy": 0.9126180708408356, "num_tokens": 9868800.0, "step": 800 }, { "entropy": 1.263050615787506, "epoch": 0.4218009478672986, "grad_norm": 0.33217278122901917, "learning_rate": 0.00019957077978230347, "loss": 0.22601178288459778, "mean_token_accuracy": 0.9101445376873016, "num_tokens": 9881136.0, "step": 801 }, { "entropy": 1.279297262430191, "epoch": 0.42232754081095314, "grad_norm": 0.3346133232116699, "learning_rate": 0.00019956863807766618, "loss": 0.22423239052295685, "mean_token_accuracy": 0.9134156703948975, "num_tokens": 9893472.0, "step": 802 }, { "entropy": 1.342239260673523, "epoch": 0.4228541337546077, "grad_norm": 0.32531458139419556, "learning_rate": 0.00019956649105586088, "loss": 0.23583942651748657, "mean_token_accuracy": 0.9080929756164551, "num_tokens": 9905808.0, "step": 803 }, { "entropy": 1.301451414823532, "epoch": 0.42338072669826227, "grad_norm": 0.3336106240749359, "learning_rate": 0.00019956433871701508, "loss": 0.23021520674228668, "mean_token_accuracy": 0.9132036864757538, "num_tokens": 9918144.0, "step": 804 }, { "entropy": 1.294978141784668, "epoch": 0.4239073196419168, "grad_norm": 0.36648303270339966, "learning_rate": 0.00019956218106125648, "loss": 0.216038778424263, "mean_token_accuracy": 0.9193701446056366, "num_tokens": 9930480.0, "step": 805 }, { "entropy": 1.3323890268802643, "epoch": 0.42443391258557134, "grad_norm": 0.5710987448692322, "learning_rate": 0.00019956001808871322, "loss": 0.21820521354675293, "mean_token_accuracy": 0.9192979484796524, "num_tokens": 9942816.0, "step": 806 }, { "entropy": 1.3704762756824493, "epoch": 0.42496050552922593, "grad_norm": 0.3389364778995514, "learning_rate": 0.00019955784979951366, "loss": 0.20125524699687958, "mean_token_accuracy": 0.9225403815507889, "num_tokens": 9955152.0, "step": 807 }, { "entropy": 1.361533671617508, "epoch": 0.42548709847288047, "grad_norm": 0.36687371134757996, "learning_rate": 0.00019955567619378653, "loss": 0.22097808122634888, "mean_token_accuracy": 0.9130203276872635, "num_tokens": 9967488.0, "step": 808 }, { "entropy": 1.3404709100723267, "epoch": 0.426013691416535, "grad_norm": 0.3457012474536896, "learning_rate": 0.00019955349727166088, "loss": 0.21268591284751892, "mean_token_accuracy": 0.9194072186946869, "num_tokens": 9979824.0, "step": 809 }, { "entropy": 1.3375678360462189, "epoch": 0.4265402843601896, "grad_norm": 0.3357281982898712, "learning_rate": 0.0001995513130332661, "loss": 0.21844780445098877, "mean_token_accuracy": 0.9134986102581024, "num_tokens": 9992160.0, "step": 810 }, { "entropy": 1.373364269733429, "epoch": 0.42706687730384413, "grad_norm": 0.3841971457004547, "learning_rate": 0.00019954912347873175, "loss": 0.2078622281551361, "mean_token_accuracy": 0.9202176630496979, "num_tokens": 10004496.0, "step": 811 }, { "entropy": 1.3305988311767578, "epoch": 0.42759347024749866, "grad_norm": 0.3852640986442566, "learning_rate": 0.0001995469286081879, "loss": 0.2230588048696518, "mean_token_accuracy": 0.9157514870166779, "num_tokens": 10016832.0, "step": 812 }, { "entropy": 1.3437947630882263, "epoch": 0.42812006319115326, "grad_norm": 0.390927791595459, "learning_rate": 0.0001995447284217648, "loss": 0.22504432499408722, "mean_token_accuracy": 0.911404550075531, "num_tokens": 10029168.0, "step": 813 }, { "entropy": 1.4292974174022675, "epoch": 0.4286466561348078, "grad_norm": 0.3649219274520874, "learning_rate": 0.00019954252291959313, "loss": 0.22576412558555603, "mean_token_accuracy": 0.9123170077800751, "num_tokens": 10041504.0, "step": 814 }, { "entropy": 1.3408824503421783, "epoch": 0.4291732490784623, "grad_norm": 0.4012393355369568, "learning_rate": 0.00019954031210180371, "loss": 0.2239188551902771, "mean_token_accuracy": 0.9098076522350311, "num_tokens": 10053840.0, "step": 815 }, { "entropy": 1.3955635130405426, "epoch": 0.4296998420221169, "grad_norm": 0.31125685572624207, "learning_rate": 0.00019953809596852786, "loss": 0.21482022106647491, "mean_token_accuracy": 0.9152773320674896, "num_tokens": 10066176.0, "step": 816 }, { "entropy": 1.372936338186264, "epoch": 0.43022643496577145, "grad_norm": 0.3509393632411957, "learning_rate": 0.00019953587451989712, "loss": 0.2275184839963913, "mean_token_accuracy": 0.9097452610731125, "num_tokens": 10078512.0, "step": 817 }, { "entropy": 1.2875484228134155, "epoch": 0.430753027909426, "grad_norm": 0.32160601019859314, "learning_rate": 0.00019953364775604336, "loss": 0.22542208433151245, "mean_token_accuracy": 0.9094801992177963, "num_tokens": 10090848.0, "step": 818 }, { "entropy": 1.387698233127594, "epoch": 0.4312796208530806, "grad_norm": 0.3713604807853699, "learning_rate": 0.00019953141567709878, "loss": 0.2560008466243744, "mean_token_accuracy": 0.9061192125082016, "num_tokens": 10103184.0, "step": 819 }, { "entropy": 1.3468024134635925, "epoch": 0.4318062137967351, "grad_norm": 0.30053895711898804, "learning_rate": 0.00019952917828319587, "loss": 0.21902483701705933, "mean_token_accuracy": 0.9183452129364014, "num_tokens": 10115520.0, "step": 820 }, { "entropy": 1.2196392714977264, "epoch": 0.43233280674038965, "grad_norm": 0.3135424256324768, "learning_rate": 0.00019952693557446748, "loss": 0.2191144973039627, "mean_token_accuracy": 0.9174018204212189, "num_tokens": 10127856.0, "step": 821 }, { "entropy": 1.341955155134201, "epoch": 0.43285939968404424, "grad_norm": 0.31046387553215027, "learning_rate": 0.00019952468755104672, "loss": 0.19744142889976501, "mean_token_accuracy": 0.9225213825702667, "num_tokens": 10140192.0, "step": 822 }, { "entropy": 1.2434613406658173, "epoch": 0.4333859926276988, "grad_norm": 0.3251499831676483, "learning_rate": 0.00019952243421306708, "loss": 0.22867801785469055, "mean_token_accuracy": 0.9065830409526825, "num_tokens": 10152528.0, "step": 823 }, { "entropy": 1.2479578852653503, "epoch": 0.43391258557135337, "grad_norm": 0.33372238278388977, "learning_rate": 0.0001995201755606622, "loss": 0.24028503894805908, "mean_token_accuracy": 0.9034052640199661, "num_tokens": 10164864.0, "step": 824 }, { "entropy": 1.2929136455059052, "epoch": 0.4344391785150079, "grad_norm": 0.3748015761375427, "learning_rate": 0.00019951791159396635, "loss": 0.22330275177955627, "mean_token_accuracy": 0.9107150882482529, "num_tokens": 10177200.0, "step": 825 }, { "entropy": 1.1717173159122467, "epoch": 0.43496577145866244, "grad_norm": 0.32337212562561035, "learning_rate": 0.00019951564231311382, "loss": 0.20805582404136658, "mean_token_accuracy": 0.9200474917888641, "num_tokens": 10189536.0, "step": 826 }, { "entropy": 1.2089639604091644, "epoch": 0.43549236440231703, "grad_norm": 0.3620331883430481, "learning_rate": 0.00019951336771823936, "loss": 0.24102292954921722, "mean_token_accuracy": 0.9084760844707489, "num_tokens": 10201872.0, "step": 827 }, { "entropy": 1.2690958082675934, "epoch": 0.43601895734597157, "grad_norm": 0.3436319828033447, "learning_rate": 0.00019951108780947793, "loss": 0.2396576702594757, "mean_token_accuracy": 0.9085531234741211, "num_tokens": 10214208.0, "step": 828 }, { "entropy": 1.1895755529403687, "epoch": 0.4365455502896261, "grad_norm": 0.3198072612285614, "learning_rate": 0.00019950880258696495, "loss": 0.21371476352214813, "mean_token_accuracy": 0.9214041531085968, "num_tokens": 10226544.0, "step": 829 }, { "entropy": 1.2306865453720093, "epoch": 0.4370721432332807, "grad_norm": 0.33646130561828613, "learning_rate": 0.00019950651205083607, "loss": 0.22665852308273315, "mean_token_accuracy": 0.9108365774154663, "num_tokens": 10238880.0, "step": 830 }, { "entropy": 1.2199313044548035, "epoch": 0.43759873617693523, "grad_norm": 0.2950493395328522, "learning_rate": 0.00019950421620122726, "loss": 0.19776280224323273, "mean_token_accuracy": 0.922358974814415, "num_tokens": 10251216.0, "step": 831 }, { "entropy": 1.2803155779838562, "epoch": 0.43812532912058977, "grad_norm": 0.3180263638496399, "learning_rate": 0.00019950191503827477, "loss": 0.2287098914384842, "mean_token_accuracy": 0.9091289192438126, "num_tokens": 10263552.0, "step": 832 }, { "entropy": 1.278805285692215, "epoch": 0.43865192206424436, "grad_norm": 0.30920109152793884, "learning_rate": 0.00019949960856211526, "loss": 0.22083017230033875, "mean_token_accuracy": 0.915079653263092, "num_tokens": 10275888.0, "step": 833 }, { "entropy": 1.255694329738617, "epoch": 0.4391785150078989, "grad_norm": 0.3112378716468811, "learning_rate": 0.00019949729677288568, "loss": 0.22883734107017517, "mean_token_accuracy": 0.9063798487186432, "num_tokens": 10288224.0, "step": 834 }, { "entropy": 1.2695356905460358, "epoch": 0.43970510795155343, "grad_norm": 0.36405643820762634, "learning_rate": 0.00019949497967072314, "loss": 0.25639811158180237, "mean_token_accuracy": 0.8983906358480453, "num_tokens": 10300560.0, "step": 835 }, { "entropy": 1.1852473616600037, "epoch": 0.440231700895208, "grad_norm": 0.3179355561733246, "learning_rate": 0.00019949265725576534, "loss": 0.2258102297782898, "mean_token_accuracy": 0.911256417632103, "num_tokens": 10312896.0, "step": 836 }, { "entropy": 1.2247830629348755, "epoch": 0.44075829383886256, "grad_norm": 0.30152472853660583, "learning_rate": 0.00019949032952815002, "loss": 0.22182312607765198, "mean_token_accuracy": 0.9133886694908142, "num_tokens": 10325232.0, "step": 837 }, { "entropy": 1.2358119487762451, "epoch": 0.4412848867825171, "grad_norm": 0.3537450134754181, "learning_rate": 0.00019948799648801546, "loss": 0.23890867829322815, "mean_token_accuracy": 0.9061432033777237, "num_tokens": 10337568.0, "step": 838 }, { "entropy": 1.255542904138565, "epoch": 0.4418114797261717, "grad_norm": 0.3185861110687256, "learning_rate": 0.00019948565813550012, "loss": 0.2323358654975891, "mean_token_accuracy": 0.910455733537674, "num_tokens": 10349904.0, "step": 839 }, { "entropy": 1.2060716450214386, "epoch": 0.4423380726698262, "grad_norm": 0.2943599820137024, "learning_rate": 0.00019948331447074282, "loss": 0.1973709762096405, "mean_token_accuracy": 0.9198663532733917, "num_tokens": 10362240.0, "step": 840 }, { "entropy": 1.23261758685112, "epoch": 0.44286466561348076, "grad_norm": 0.3526243269443512, "learning_rate": 0.00019948096549388269, "loss": 0.2500985562801361, "mean_token_accuracy": 0.9066997915506363, "num_tokens": 10374576.0, "step": 841 }, { "entropy": 1.237447440624237, "epoch": 0.44339125855713535, "grad_norm": 0.3191603422164917, "learning_rate": 0.00019947861120505914, "loss": 0.21682989597320557, "mean_token_accuracy": 0.914885938167572, "num_tokens": 10386912.0, "step": 842 }, { "entropy": 1.2385708093643188, "epoch": 0.4439178515007899, "grad_norm": 0.31065261363983154, "learning_rate": 0.000199476251604412, "loss": 0.22177095711231232, "mean_token_accuracy": 0.9108449369668961, "num_tokens": 10399248.0, "step": 843 }, { "entropy": 1.209405928850174, "epoch": 0.4444444444444444, "grad_norm": 0.3202918767929077, "learning_rate": 0.0001994738866920813, "loss": 0.23262163996696472, "mean_token_accuracy": 0.906676635146141, "num_tokens": 10411584.0, "step": 844 }, { "entropy": 1.2493412792682648, "epoch": 0.444971037388099, "grad_norm": 0.3377321660518646, "learning_rate": 0.00019947151646820745, "loss": 0.25681400299072266, "mean_token_accuracy": 0.9044294059276581, "num_tokens": 10423920.0, "step": 845 }, { "entropy": 1.2441616654396057, "epoch": 0.44549763033175355, "grad_norm": 0.3140577971935272, "learning_rate": 0.00019946914093293115, "loss": 0.23581147193908691, "mean_token_accuracy": 0.9107285887002945, "num_tokens": 10436256.0, "step": 846 }, { "entropy": 1.2595540583133698, "epoch": 0.4460242232754081, "grad_norm": 0.32932135462760925, "learning_rate": 0.00019946676008639343, "loss": 0.2249414175748825, "mean_token_accuracy": 0.9159797579050064, "num_tokens": 10448592.0, "step": 847 }, { "entropy": 1.2226338982582092, "epoch": 0.4465508162190627, "grad_norm": 0.3085028827190399, "learning_rate": 0.00019946437392873555, "loss": 0.22729279100894928, "mean_token_accuracy": 0.914769247174263, "num_tokens": 10460928.0, "step": 848 }, { "entropy": 1.2365905344486237, "epoch": 0.4470774091627172, "grad_norm": 0.33299946784973145, "learning_rate": 0.00019946198246009928, "loss": 0.23490425944328308, "mean_token_accuracy": 0.9082431495189667, "num_tokens": 10473264.0, "step": 849 }, { "entropy": 1.4061111807823181, "epoch": 0.4476040021063718, "grad_norm": 0.3621409833431244, "learning_rate": 0.00019945958568062656, "loss": 0.22818249464035034, "mean_token_accuracy": 0.9102335572242737, "num_tokens": 10485600.0, "step": 850 }, { "entropy": 1.2550583481788635, "epoch": 0.44813059505002634, "grad_norm": 0.33583348989486694, "learning_rate": 0.0001994571835904596, "loss": 0.2311660647392273, "mean_token_accuracy": 0.9055789560079575, "num_tokens": 10497936.0, "step": 851 }, { "entropy": 1.306765854358673, "epoch": 0.4486571879936809, "grad_norm": 0.34734323620796204, "learning_rate": 0.00019945477618974104, "loss": 0.24055415391921997, "mean_token_accuracy": 0.9080438315868378, "num_tokens": 10510272.0, "step": 852 }, { "entropy": 1.3021958768367767, "epoch": 0.44918378093733546, "grad_norm": 0.35933780670166016, "learning_rate": 0.00019945236347861383, "loss": 0.22972102463245392, "mean_token_accuracy": 0.9099899232387543, "num_tokens": 10522608.0, "step": 853 }, { "entropy": 1.2393949925899506, "epoch": 0.44971037388099, "grad_norm": 0.33583781123161316, "learning_rate": 0.00019944994545722115, "loss": 0.19537097215652466, "mean_token_accuracy": 0.9247924536466599, "num_tokens": 10534944.0, "step": 854 }, { "entropy": 1.2775700390338898, "epoch": 0.45023696682464454, "grad_norm": 0.33388838171958923, "learning_rate": 0.00019944752212570658, "loss": 0.20106476545333862, "mean_token_accuracy": 0.9226871877908707, "num_tokens": 10547280.0, "step": 855 }, { "entropy": 1.2714512348175049, "epoch": 0.4507635597682991, "grad_norm": 0.3518841862678528, "learning_rate": 0.00019944509348421394, "loss": 0.24091394245624542, "mean_token_accuracy": 0.9107283055782318, "num_tokens": 10559616.0, "step": 856 }, { "entropy": 1.3004609048366547, "epoch": 0.45129015271195366, "grad_norm": 0.31591442227363586, "learning_rate": 0.00019944265953288746, "loss": 0.22405283153057098, "mean_token_accuracy": 0.9140247255563736, "num_tokens": 10571952.0, "step": 857 }, { "entropy": 1.2649115324020386, "epoch": 0.4518167456556082, "grad_norm": 0.34270599484443665, "learning_rate": 0.00019944022027187157, "loss": 0.2242221236228943, "mean_token_accuracy": 0.9118231236934662, "num_tokens": 10584288.0, "step": 858 }, { "entropy": 1.20332869887352, "epoch": 0.4523433385992628, "grad_norm": 0.33847615122795105, "learning_rate": 0.0001994377757013111, "loss": 0.22582295536994934, "mean_token_accuracy": 0.9115125685930252, "num_tokens": 10596624.0, "step": 859 }, { "entropy": 1.2661672830581665, "epoch": 0.4528699315429173, "grad_norm": 0.34885501861572266, "learning_rate": 0.00019943532582135116, "loss": 0.2379041314125061, "mean_token_accuracy": 0.9074203372001648, "num_tokens": 10608960.0, "step": 860 }, { "entropy": 1.2014594674110413, "epoch": 0.45339652448657186, "grad_norm": 0.29767417907714844, "learning_rate": 0.0001994328706321372, "loss": 0.20825329422950745, "mean_token_accuracy": 0.9220836907625198, "num_tokens": 10621296.0, "step": 861 }, { "entropy": 1.1979358792304993, "epoch": 0.45392311743022645, "grad_norm": 0.33858057856559753, "learning_rate": 0.000199430410133815, "loss": 0.21688413619995117, "mean_token_accuracy": 0.9154618680477142, "num_tokens": 10633632.0, "step": 862 }, { "entropy": 1.1113716661930084, "epoch": 0.454449710373881, "grad_norm": 0.32101956009864807, "learning_rate": 0.00019942794432653053, "loss": 0.20722433924674988, "mean_token_accuracy": 0.9159047454595566, "num_tokens": 10645968.0, "step": 863 }, { "entropy": 1.1962774693965912, "epoch": 0.4549763033175355, "grad_norm": 0.34402385354042053, "learning_rate": 0.00019942547321043027, "loss": 0.2361735999584198, "mean_token_accuracy": 0.9091803878545761, "num_tokens": 10658304.0, "step": 864 }, { "entropy": 1.2290304005146027, "epoch": 0.4555028962611901, "grad_norm": 0.35236313939094543, "learning_rate": 0.00019942299678566086, "loss": 0.21090444922447205, "mean_token_accuracy": 0.9149055033922195, "num_tokens": 10670640.0, "step": 865 }, { "entropy": 1.1575745642185211, "epoch": 0.45602948920484465, "grad_norm": 0.34065473079681396, "learning_rate": 0.00019942051505236936, "loss": 0.2252214103937149, "mean_token_accuracy": 0.9156748950481415, "num_tokens": 10682976.0, "step": 866 }, { "entropy": 1.216041624546051, "epoch": 0.4565560821484992, "grad_norm": 0.34139883518218994, "learning_rate": 0.00019941802801070303, "loss": 0.2223672717809677, "mean_token_accuracy": 0.9103764742612839, "num_tokens": 10695312.0, "step": 867 }, { "entropy": 1.210105150938034, "epoch": 0.4570826750921538, "grad_norm": 0.33792680501937866, "learning_rate": 0.00019941553566080956, "loss": 0.21836510300636292, "mean_token_accuracy": 0.9169131815433502, "num_tokens": 10707648.0, "step": 868 }, { "entropy": 1.2123220264911652, "epoch": 0.4576092680358083, "grad_norm": 0.33836740255355835, "learning_rate": 0.0001994130380028369, "loss": 0.22877393662929535, "mean_token_accuracy": 0.9094105064868927, "num_tokens": 10719984.0, "step": 869 }, { "entropy": 1.2113963067531586, "epoch": 0.45813586097946285, "grad_norm": 0.3214447796344757, "learning_rate": 0.00019941053503693329, "loss": 0.22401154041290283, "mean_token_accuracy": 0.9101571440696716, "num_tokens": 10732320.0, "step": 870 }, { "entropy": 1.2003886699676514, "epoch": 0.45866245392311744, "grad_norm": 0.32083162665367126, "learning_rate": 0.00019940802676324734, "loss": 0.22345268726348877, "mean_token_accuracy": 0.909741148352623, "num_tokens": 10744656.0, "step": 871 }, { "entropy": 1.2443215548992157, "epoch": 0.459189046866772, "grad_norm": 0.32810378074645996, "learning_rate": 0.00019940551318192796, "loss": 0.22558192908763885, "mean_token_accuracy": 0.911412313580513, "num_tokens": 10756992.0, "step": 872 }, { "entropy": 1.2517528235912323, "epoch": 0.4597156398104265, "grad_norm": 0.2983804941177368, "learning_rate": 0.00019940299429312437, "loss": 0.22902357578277588, "mean_token_accuracy": 0.9084698557853699, "num_tokens": 10769328.0, "step": 873 }, { "entropy": 1.331667423248291, "epoch": 0.4602422327540811, "grad_norm": 0.33570387959480286, "learning_rate": 0.00019940047009698605, "loss": 0.21841317415237427, "mean_token_accuracy": 0.9151860028505325, "num_tokens": 10781664.0, "step": 874 }, { "entropy": 1.2408846318721771, "epoch": 0.46076882569773564, "grad_norm": 0.3269551992416382, "learning_rate": 0.00019939794059366294, "loss": 0.21816705167293549, "mean_token_accuracy": 0.9179367125034332, "num_tokens": 10794000.0, "step": 875 }, { "entropy": 1.2641226053237915, "epoch": 0.46129541864139023, "grad_norm": 0.31645506620407104, "learning_rate": 0.0001993954057833051, "loss": 0.22259601950645447, "mean_token_accuracy": 0.9116221219301224, "num_tokens": 10806336.0, "step": 876 }, { "entropy": 1.2864770293235779, "epoch": 0.46182201158504477, "grad_norm": 0.36219751834869385, "learning_rate": 0.0001993928656660631, "loss": 0.23597069084644318, "mean_token_accuracy": 0.9075523316860199, "num_tokens": 10818672.0, "step": 877 }, { "entropy": 1.284227877855301, "epoch": 0.4623486045286993, "grad_norm": 0.33684641122817993, "learning_rate": 0.00019939032024208762, "loss": 0.23688027262687683, "mean_token_accuracy": 0.90504090487957, "num_tokens": 10831008.0, "step": 878 }, { "entropy": 1.2863526940345764, "epoch": 0.4628751974723539, "grad_norm": 0.3741551637649536, "learning_rate": 0.0001993877695115299, "loss": 0.26197415590286255, "mean_token_accuracy": 0.8967071026563644, "num_tokens": 10843344.0, "step": 879 }, { "entropy": 1.3029287159442902, "epoch": 0.46340179041600843, "grad_norm": 0.33679425716400146, "learning_rate": 0.00019938521347454127, "loss": 0.2334819734096527, "mean_token_accuracy": 0.9123462438583374, "num_tokens": 10855680.0, "step": 880 }, { "entropy": 1.2353507280349731, "epoch": 0.46392838335966297, "grad_norm": 0.3251015543937683, "learning_rate": 0.00019938265213127344, "loss": 0.24127048254013062, "mean_token_accuracy": 0.9032625257968903, "num_tokens": 10868016.0, "step": 881 }, { "entropy": 1.2318426966667175, "epoch": 0.46445497630331756, "grad_norm": 0.3128981292247772, "learning_rate": 0.0001993800854818786, "loss": 0.23091557621955872, "mean_token_accuracy": 0.910790741443634, "num_tokens": 10880352.0, "step": 882 }, { "entropy": 1.1969189643859863, "epoch": 0.4649815692469721, "grad_norm": 0.2763598561286926, "learning_rate": 0.000199377513526509, "loss": 0.19723600149154663, "mean_token_accuracy": 0.9164901375770569, "num_tokens": 10892688.0, "step": 883 }, { "entropy": 1.3742352426052094, "epoch": 0.46550816219062663, "grad_norm": 0.36182069778442383, "learning_rate": 0.00019937493626531733, "loss": 0.23250778019428253, "mean_token_accuracy": 0.910800889134407, "num_tokens": 10905024.0, "step": 884 }, { "entropy": 1.287173181772232, "epoch": 0.4660347551342812, "grad_norm": 0.37185028195381165, "learning_rate": 0.00019937235369845666, "loss": 0.2612641453742981, "mean_token_accuracy": 0.8980638682842255, "num_tokens": 10917360.0, "step": 885 }, { "entropy": 1.256176471710205, "epoch": 0.46656134807793576, "grad_norm": 0.3193638026714325, "learning_rate": 0.00019936976582608023, "loss": 0.2168237864971161, "mean_token_accuracy": 0.9117200374603271, "num_tokens": 10929696.0, "step": 886 }, { "entropy": 1.3229191601276398, "epoch": 0.4670879410215903, "grad_norm": 0.3389144241809845, "learning_rate": 0.00019936717264834166, "loss": 0.22236081957817078, "mean_token_accuracy": 0.9158815294504166, "num_tokens": 10942032.0, "step": 887 }, { "entropy": 1.3444121778011322, "epoch": 0.4676145339652449, "grad_norm": 0.30865800380706787, "learning_rate": 0.00019936457416539497, "loss": 0.22498130798339844, "mean_token_accuracy": 0.9109358042478561, "num_tokens": 10954368.0, "step": 888 }, { "entropy": 1.3391337096691132, "epoch": 0.4681411269088994, "grad_norm": 0.34072619676589966, "learning_rate": 0.00019936197037739433, "loss": 0.25583821535110474, "mean_token_accuracy": 0.9030615091323853, "num_tokens": 10966704.0, "step": 889 }, { "entropy": 1.3236074447631836, "epoch": 0.46866771985255395, "grad_norm": 0.30708205699920654, "learning_rate": 0.00019935936128449437, "loss": 0.2282828986644745, "mean_token_accuracy": 0.9107722789049149, "num_tokens": 10979040.0, "step": 890 }, { "entropy": 1.3548866510391235, "epoch": 0.46919431279620855, "grad_norm": 0.3132648766040802, "learning_rate": 0.00019935674688684993, "loss": 0.21266606450080872, "mean_token_accuracy": 0.9191526621580124, "num_tokens": 10991376.0, "step": 891 }, { "entropy": 1.3176174461841583, "epoch": 0.4697209057398631, "grad_norm": 0.2955908477306366, "learning_rate": 0.00019935412718461625, "loss": 0.21996596455574036, "mean_token_accuracy": 0.9133886098861694, "num_tokens": 11003712.0, "step": 892 }, { "entropy": 1.3978124856948853, "epoch": 0.4702474986835176, "grad_norm": 0.29386526346206665, "learning_rate": 0.00019935150217794887, "loss": 0.21586540341377258, "mean_token_accuracy": 0.913035660982132, "num_tokens": 11016048.0, "step": 893 }, { "entropy": 1.3344171047210693, "epoch": 0.4707740916271722, "grad_norm": 0.307434618473053, "learning_rate": 0.00019934887186700352, "loss": 0.19684919714927673, "mean_token_accuracy": 0.9249100238084793, "num_tokens": 11028384.0, "step": 894 }, { "entropy": 1.2738686203956604, "epoch": 0.47130068457082674, "grad_norm": 0.30784371495246887, "learning_rate": 0.00019934623625193646, "loss": 0.23357078433036804, "mean_token_accuracy": 0.906443789601326, "num_tokens": 11040720.0, "step": 895 }, { "entropy": 1.3004032373428345, "epoch": 0.4718272775144813, "grad_norm": 0.3604377806186676, "learning_rate": 0.0001993435953329041, "loss": 0.23538318276405334, "mean_token_accuracy": 0.910987451672554, "num_tokens": 11053056.0, "step": 896 }, { "entropy": 1.349770426750183, "epoch": 0.47235387045813587, "grad_norm": 0.371415913105011, "learning_rate": 0.00019934094911006322, "loss": 0.23594705760478973, "mean_token_accuracy": 0.9082933962345123, "num_tokens": 11065392.0, "step": 897 }, { "entropy": 1.3280587792396545, "epoch": 0.4728804634017904, "grad_norm": 0.3518844544887543, "learning_rate": 0.0001993382975835709, "loss": 0.22077634930610657, "mean_token_accuracy": 0.9151550680398941, "num_tokens": 11077728.0, "step": 898 }, { "entropy": 1.2467398941516876, "epoch": 0.473407056345445, "grad_norm": 0.3485780358314514, "learning_rate": 0.00019933564075358455, "loss": 0.21681727468967438, "mean_token_accuracy": 0.917348250746727, "num_tokens": 11090064.0, "step": 899 }, { "entropy": 1.2497498095035553, "epoch": 0.47393364928909953, "grad_norm": 0.2795222997665405, "learning_rate": 0.0001993329786202619, "loss": 0.19592691957950592, "mean_token_accuracy": 0.92547307908535, "num_tokens": 11102400.0, "step": 900 }, { "entropy": 1.3175421953201294, "epoch": 0.47446024223275407, "grad_norm": 0.34323444962501526, "learning_rate": 0.00019933031118376097, "loss": 0.23341751098632812, "mean_token_accuracy": 0.9069218635559082, "num_tokens": 11114736.0, "step": 901 }, { "entropy": 1.2457618713378906, "epoch": 0.47498683517640866, "grad_norm": 0.3164939284324646, "learning_rate": 0.00019932763844424017, "loss": 0.2065175175666809, "mean_token_accuracy": 0.9177182614803314, "num_tokens": 11127072.0, "step": 902 }, { "entropy": 1.2637942731380463, "epoch": 0.4755134281200632, "grad_norm": 0.3504999279975891, "learning_rate": 0.00019932496040185808, "loss": 0.21458998322486877, "mean_token_accuracy": 0.9221720099449158, "num_tokens": 11139408.0, "step": 903 }, { "entropy": 1.2935825884342194, "epoch": 0.47604002106371773, "grad_norm": 0.37840691208839417, "learning_rate": 0.00019932227705677372, "loss": 0.227766752243042, "mean_token_accuracy": 0.9137209206819534, "num_tokens": 11151744.0, "step": 904 }, { "entropy": 1.3187288045883179, "epoch": 0.4765666140073723, "grad_norm": 0.35070836544036865, "learning_rate": 0.00019931958840914635, "loss": 0.23313553631305695, "mean_token_accuracy": 0.9072595983743668, "num_tokens": 11164080.0, "step": 905 }, { "entropy": 1.2109759449958801, "epoch": 0.47709320695102686, "grad_norm": 0.3268450200557709, "learning_rate": 0.00019931689445913564, "loss": 0.21801263093948364, "mean_token_accuracy": 0.9163070619106293, "num_tokens": 11176416.0, "step": 906 }, { "entropy": 1.2274765968322754, "epoch": 0.4776197998946814, "grad_norm": 0.3167557120323181, "learning_rate": 0.00019931419520690147, "loss": 0.21107861399650574, "mean_token_accuracy": 0.9160606116056442, "num_tokens": 11188752.0, "step": 907 }, { "entropy": 1.1903901398181915, "epoch": 0.478146392838336, "grad_norm": 0.3267144560813904, "learning_rate": 0.00019931149065260413, "loss": 0.20752331614494324, "mean_token_accuracy": 0.9146323353052139, "num_tokens": 11201088.0, "step": 908 }, { "entropy": 1.2301645576953888, "epoch": 0.4786729857819905, "grad_norm": 0.3323666751384735, "learning_rate": 0.0001993087807964041, "loss": 0.20132845640182495, "mean_token_accuracy": 0.9229601621627808, "num_tokens": 11213424.0, "step": 909 }, { "entropy": 1.2413881123065948, "epoch": 0.47919957872564506, "grad_norm": 0.3245013356208801, "learning_rate": 0.00019930606563846234, "loss": 0.19781675934791565, "mean_token_accuracy": 0.9200431853532791, "num_tokens": 11225760.0, "step": 910 }, { "entropy": 1.180581659078598, "epoch": 0.47972617166929965, "grad_norm": 0.31535807251930237, "learning_rate": 0.00019930334517893991, "loss": 0.2060268521308899, "mean_token_accuracy": 0.9165100157260895, "num_tokens": 11238096.0, "step": 911 }, { "entropy": 1.233038753271103, "epoch": 0.4802527646129542, "grad_norm": 0.32888907194137573, "learning_rate": 0.0001993006194179984, "loss": 0.22726945579051971, "mean_token_accuracy": 0.9112953692674637, "num_tokens": 11250432.0, "step": 912 }, { "entropy": 1.262090653181076, "epoch": 0.4807793575566087, "grad_norm": 0.3833845555782318, "learning_rate": 0.00019929788835579962, "loss": 0.23385398089885712, "mean_token_accuracy": 0.9076380431652069, "num_tokens": 11262768.0, "step": 913 }, { "entropy": 1.2252440452575684, "epoch": 0.4813059505002633, "grad_norm": 0.3054254949092865, "learning_rate": 0.00019929515199250565, "loss": 0.21175538003444672, "mean_token_accuracy": 0.91593237221241, "num_tokens": 11275104.0, "step": 914 }, { "entropy": 1.2347098588943481, "epoch": 0.48183254344391785, "grad_norm": 0.32731181383132935, "learning_rate": 0.00019929241032827898, "loss": 0.21469083428382874, "mean_token_accuracy": 0.9144894182682037, "num_tokens": 11287440.0, "step": 915 }, { "entropy": 1.2054485082626343, "epoch": 0.4823591363875724, "grad_norm": 0.3010466694831848, "learning_rate": 0.0001992896633632823, "loss": 0.2065753936767578, "mean_token_accuracy": 0.9242510497570038, "num_tokens": 11299776.0, "step": 916 }, { "entropy": 1.2271296083927155, "epoch": 0.482885729331227, "grad_norm": 0.42679160833358765, "learning_rate": 0.00019928691109767876, "loss": 0.23648393154144287, "mean_token_accuracy": 0.9071210771799088, "num_tokens": 11312112.0, "step": 917 }, { "entropy": 1.233128011226654, "epoch": 0.4834123222748815, "grad_norm": 0.3018331229686737, "learning_rate": 0.00019928415353163173, "loss": 0.20864740014076233, "mean_token_accuracy": 0.9222661405801773, "num_tokens": 11324448.0, "step": 918 }, { "entropy": 1.2823042571544647, "epoch": 0.48393891521853605, "grad_norm": 0.44017431139945984, "learning_rate": 0.00019928139066530487, "loss": 0.23257723450660706, "mean_token_accuracy": 0.9054065048694611, "num_tokens": 11336784.0, "step": 919 }, { "entropy": 1.2760326564311981, "epoch": 0.48446550816219064, "grad_norm": 0.3077127933502197, "learning_rate": 0.00019927862249886222, "loss": 0.22436192631721497, "mean_token_accuracy": 0.9136722385883331, "num_tokens": 11349120.0, "step": 920 }, { "entropy": 1.3157328069210052, "epoch": 0.4849921011058452, "grad_norm": 0.29968273639678955, "learning_rate": 0.0001992758490324681, "loss": 0.20738902688026428, "mean_token_accuracy": 0.9168381989002228, "num_tokens": 11361456.0, "step": 921 }, { "entropy": 1.3066685795783997, "epoch": 0.4855186940494997, "grad_norm": 0.31207534670829773, "learning_rate": 0.00019927307026628715, "loss": 0.2138848602771759, "mean_token_accuracy": 0.9126945734024048, "num_tokens": 11373792.0, "step": 922 }, { "entropy": 1.3030335009098053, "epoch": 0.4860452869931543, "grad_norm": 0.3280918598175049, "learning_rate": 0.00019927028620048438, "loss": 0.23367798328399658, "mean_token_accuracy": 0.9077742546796799, "num_tokens": 11386128.0, "step": 923 }, { "entropy": 1.2811558842658997, "epoch": 0.48657187993680884, "grad_norm": 0.376886248588562, "learning_rate": 0.00019926749683522502, "loss": 0.20860403776168823, "mean_token_accuracy": 0.9099331349134445, "num_tokens": 11398464.0, "step": 924 }, { "entropy": 1.2956900000572205, "epoch": 0.48709847288046343, "grad_norm": 0.2849150598049164, "learning_rate": 0.00019926470217067463, "loss": 0.20377135276794434, "mean_token_accuracy": 0.9249068945646286, "num_tokens": 11410800.0, "step": 925 }, { "entropy": 1.3335639834403992, "epoch": 0.48762506582411796, "grad_norm": 0.30451253056526184, "learning_rate": 0.00019926190220699916, "loss": 0.2137700468301773, "mean_token_accuracy": 0.9165246337652206, "num_tokens": 11423136.0, "step": 926 }, { "entropy": 1.3315201103687286, "epoch": 0.4881516587677725, "grad_norm": 0.31507113575935364, "learning_rate": 0.0001992590969443648, "loss": 0.22226491570472717, "mean_token_accuracy": 0.9110458046197891, "num_tokens": 11435472.0, "step": 927 }, { "entropy": 1.3439573049545288, "epoch": 0.4886782517114271, "grad_norm": 0.3123377561569214, "learning_rate": 0.00019925628638293815, "loss": 0.2124030739068985, "mean_token_accuracy": 0.9143670797348022, "num_tokens": 11447808.0, "step": 928 }, { "entropy": 1.373394101858139, "epoch": 0.4892048446550816, "grad_norm": 0.38396134972572327, "learning_rate": 0.00019925347052288594, "loss": 0.21086710691452026, "mean_token_accuracy": 0.9174065738916397, "num_tokens": 11460144.0, "step": 929 }, { "entropy": 1.3038064241409302, "epoch": 0.48973143759873616, "grad_norm": 0.3282279074192047, "learning_rate": 0.00019925064936437544, "loss": 0.19842374324798584, "mean_token_accuracy": 0.9203700721263885, "num_tokens": 11472480.0, "step": 930 }, { "entropy": 1.39743971824646, "epoch": 0.49025803054239075, "grad_norm": 0.3458907902240753, "learning_rate": 0.00019924782290757403, "loss": 0.21870574355125427, "mean_token_accuracy": 0.9133100211620331, "num_tokens": 11484816.0, "step": 931 }, { "entropy": 1.3737529814243317, "epoch": 0.4907846234860453, "grad_norm": 0.35361558198928833, "learning_rate": 0.0001992449911526496, "loss": 0.2228592187166214, "mean_token_accuracy": 0.908146470785141, "num_tokens": 11497152.0, "step": 932 }, { "entropy": 1.373944640159607, "epoch": 0.4913112164296998, "grad_norm": 0.3263792097568512, "learning_rate": 0.0001992421540997702, "loss": 0.19889512658119202, "mean_token_accuracy": 0.9241671562194824, "num_tokens": 11509488.0, "step": 933 }, { "entropy": 1.3812199532985687, "epoch": 0.4918378093733544, "grad_norm": 0.30469757318496704, "learning_rate": 0.00019923931174910421, "loss": 0.20764592289924622, "mean_token_accuracy": 0.9166074395179749, "num_tokens": 11521824.0, "step": 934 }, { "entropy": 1.3702083230018616, "epoch": 0.49236440231700895, "grad_norm": 0.3094841539859772, "learning_rate": 0.00019923646410082045, "loss": 0.22583043575286865, "mean_token_accuracy": 0.9111629873514175, "num_tokens": 11534160.0, "step": 935 }, { "entropy": 1.4550175070762634, "epoch": 0.4928909952606635, "grad_norm": 0.3479791581630707, "learning_rate": 0.0001992336111550879, "loss": 0.22404024004936218, "mean_token_accuracy": 0.9125335812568665, "num_tokens": 11546496.0, "step": 936 }, { "entropy": 1.369890809059143, "epoch": 0.4934175882043181, "grad_norm": 0.33549702167510986, "learning_rate": 0.00019923075291207595, "loss": 0.22361691296100616, "mean_token_accuracy": 0.9108781665563583, "num_tokens": 11558832.0, "step": 937 }, { "entropy": 1.4506123065948486, "epoch": 0.4939441811479726, "grad_norm": 0.31795117259025574, "learning_rate": 0.00019922788937195432, "loss": 0.20908354222774506, "mean_token_accuracy": 0.916689082980156, "num_tokens": 11571168.0, "step": 938 }, { "entropy": 1.4594894349575043, "epoch": 0.49447077409162715, "grad_norm": 0.3958785831928253, "learning_rate": 0.0001992250205348929, "loss": 0.22291752696037292, "mean_token_accuracy": 0.9057322442531586, "num_tokens": 11583504.0, "step": 939 }, { "entropy": 1.4367193281650543, "epoch": 0.49499736703528174, "grad_norm": 0.38530445098876953, "learning_rate": 0.00019922214640106207, "loss": 0.21757692098617554, "mean_token_accuracy": 0.9140817075967789, "num_tokens": 11595840.0, "step": 940 }, { "entropy": 1.4827219545841217, "epoch": 0.4955239599789363, "grad_norm": 0.36136746406555176, "learning_rate": 0.00019921926697063244, "loss": 0.245650514960289, "mean_token_accuracy": 0.9077811390161514, "num_tokens": 11608176.0, "step": 941 }, { "entropy": 1.4725195467472076, "epoch": 0.4960505529225908, "grad_norm": 0.3393801748752594, "learning_rate": 0.00019921638224377493, "loss": 0.22296787798404694, "mean_token_accuracy": 0.912161722779274, "num_tokens": 11620512.0, "step": 942 }, { "entropy": 1.5998758971691132, "epoch": 0.4965771458662454, "grad_norm": 0.31578320264816284, "learning_rate": 0.00019921349222066083, "loss": 0.21946173906326294, "mean_token_accuracy": 0.9090907126665115, "num_tokens": 11632848.0, "step": 943 }, { "entropy": 1.5493124723434448, "epoch": 0.49710373880989994, "grad_norm": 0.3594050705432892, "learning_rate": 0.00019921059690146165, "loss": 0.25090494751930237, "mean_token_accuracy": 0.899459958076477, "num_tokens": 11645184.0, "step": 944 }, { "entropy": 1.4591304063796997, "epoch": 0.4976303317535545, "grad_norm": 0.3398474454879761, "learning_rate": 0.0001992076962863493, "loss": 0.22868260741233826, "mean_token_accuracy": 0.9120910316705704, "num_tokens": 11657520.0, "step": 945 }, { "entropy": 1.5574268996715546, "epoch": 0.49815692469720907, "grad_norm": 0.37178367376327515, "learning_rate": 0.00019920479037549595, "loss": 0.24399921298027039, "mean_token_accuracy": 0.9063628762960434, "num_tokens": 11669856.0, "step": 946 }, { "entropy": 1.4919456243515015, "epoch": 0.4986835176408636, "grad_norm": 0.344330757856369, "learning_rate": 0.0001992018791690741, "loss": 0.2234281301498413, "mean_token_accuracy": 0.9139427691698074, "num_tokens": 11682192.0, "step": 947 }, { "entropy": 1.486481934785843, "epoch": 0.49921011058451814, "grad_norm": 0.3283190429210663, "learning_rate": 0.00019919896266725663, "loss": 0.21686026453971863, "mean_token_accuracy": 0.9156758487224579, "num_tokens": 11694528.0, "step": 948 }, { "entropy": 1.4495719075202942, "epoch": 0.49973670352817273, "grad_norm": 0.3260519802570343, "learning_rate": 0.00019919604087021664, "loss": 0.21722926199436188, "mean_token_accuracy": 0.9189446866512299, "num_tokens": 11706864.0, "step": 949 }, { "entropy": 1.5058691203594208, "epoch": 0.5002632964718273, "grad_norm": 0.34286144375801086, "learning_rate": 0.00019919311377812756, "loss": 0.2165110558271408, "mean_token_accuracy": 0.9119018763303757, "num_tokens": 11719200.0, "step": 950 }, { "entropy": 1.4864198863506317, "epoch": 0.5007898894154819, "grad_norm": 0.3339075446128845, "learning_rate": 0.00019919018139116318, "loss": 0.22437581419944763, "mean_token_accuracy": 0.9123266935348511, "num_tokens": 11731536.0, "step": 951 }, { "entropy": 1.5294865667819977, "epoch": 0.5013164823591364, "grad_norm": 0.3746489882469177, "learning_rate": 0.00019918724370949754, "loss": 0.2426229566335678, "mean_token_accuracy": 0.9112533032894135, "num_tokens": 11743872.0, "step": 952 }, { "entropy": 1.4867128133773804, "epoch": 0.5018430753027909, "grad_norm": 0.3308849036693573, "learning_rate": 0.00019918430073330513, "loss": 0.2087199091911316, "mean_token_accuracy": 0.919797733426094, "num_tokens": 11756208.0, "step": 953 }, { "entropy": 1.5136871337890625, "epoch": 0.5023696682464455, "grad_norm": 0.34608909487724304, "learning_rate": 0.00019918135246276052, "loss": 0.22718098759651184, "mean_token_accuracy": 0.9114474952220917, "num_tokens": 11768544.0, "step": 954 }, { "entropy": 1.5160588324069977, "epoch": 0.5028962611901, "grad_norm": 0.3665941655635834, "learning_rate": 0.00019917839889803884, "loss": 0.21780604124069214, "mean_token_accuracy": 0.9177397042512894, "num_tokens": 11780880.0, "step": 955 }, { "entropy": 1.4711733162403107, "epoch": 0.5034228541337546, "grad_norm": 0.3232526183128357, "learning_rate": 0.00019917544003931537, "loss": 0.20783714950084686, "mean_token_accuracy": 0.9170488715171814, "num_tokens": 11793216.0, "step": 956 }, { "entropy": 1.5061227977275848, "epoch": 0.5039494470774092, "grad_norm": 0.3460804522037506, "learning_rate": 0.00019917247588676582, "loss": 0.22913217544555664, "mean_token_accuracy": 0.9122664779424667, "num_tokens": 11805552.0, "step": 957 }, { "entropy": 1.4881491363048553, "epoch": 0.5044760400210637, "grad_norm": 0.38591158390045166, "learning_rate": 0.00019916950644056607, "loss": 0.2197885662317276, "mean_token_accuracy": 0.9077084809541702, "num_tokens": 11817888.0, "step": 958 }, { "entropy": 1.4673264026641846, "epoch": 0.5050026329647183, "grad_norm": 0.33065465092658997, "learning_rate": 0.00019916653170089246, "loss": 0.2319866120815277, "mean_token_accuracy": 0.9126220494508743, "num_tokens": 11830224.0, "step": 959 }, { "entropy": 1.4641340970993042, "epoch": 0.5055292259083728, "grad_norm": 0.36219480633735657, "learning_rate": 0.00019916355166792155, "loss": 0.23807652294635773, "mean_token_accuracy": 0.9052844792604446, "num_tokens": 11842560.0, "step": 960 }, { "entropy": 1.4770829379558563, "epoch": 0.5060558188520273, "grad_norm": 0.3402878940105438, "learning_rate": 0.00019916056634183027, "loss": 0.23622629046440125, "mean_token_accuracy": 0.9105163961648941, "num_tokens": 11854896.0, "step": 961 }, { "entropy": 1.510101705789566, "epoch": 0.506582411795682, "grad_norm": 0.38479122519493103, "learning_rate": 0.00019915757572279584, "loss": 0.26114726066589355, "mean_token_accuracy": 0.901023805141449, "num_tokens": 11867232.0, "step": 962 }, { "entropy": 1.462478369474411, "epoch": 0.5071090047393365, "grad_norm": 0.30232900381088257, "learning_rate": 0.0001991545798109958, "loss": 0.21362073719501495, "mean_token_accuracy": 0.9150588363409042, "num_tokens": 11879568.0, "step": 963 }, { "entropy": 1.4567637145519257, "epoch": 0.507635597682991, "grad_norm": 0.3392339050769806, "learning_rate": 0.00019915157860660797, "loss": 0.229543536901474, "mean_token_accuracy": 0.9123556017875671, "num_tokens": 11891904.0, "step": 964 }, { "entropy": 1.4373153448104858, "epoch": 0.5081621906266456, "grad_norm": 0.3237869441509247, "learning_rate": 0.00019914857210981052, "loss": 0.222116619348526, "mean_token_accuracy": 0.9098070710897446, "num_tokens": 11904240.0, "step": 965 }, { "entropy": 1.4922161400318146, "epoch": 0.5086887835703001, "grad_norm": 0.3090606927871704, "learning_rate": 0.00019914556032078198, "loss": 0.22452594339847565, "mean_token_accuracy": 0.9133640974760056, "num_tokens": 11916576.0, "step": 966 }, { "entropy": 1.4847496449947357, "epoch": 0.5092153765139548, "grad_norm": 0.31530138850212097, "learning_rate": 0.00019914254323970108, "loss": 0.21454353630542755, "mean_token_accuracy": 0.9175532162189484, "num_tokens": 11928912.0, "step": 967 }, { "entropy": 1.481870412826538, "epoch": 0.5097419694576093, "grad_norm": 0.3098122775554657, "learning_rate": 0.00019913952086674696, "loss": 0.21168866753578186, "mean_token_accuracy": 0.9122080057859421, "num_tokens": 11941248.0, "step": 968 }, { "entropy": 1.5705283880233765, "epoch": 0.5102685624012638, "grad_norm": 0.32009753584861755, "learning_rate": 0.000199136493202099, "loss": 0.20256565511226654, "mean_token_accuracy": 0.9237568825483322, "num_tokens": 11953584.0, "step": 969 }, { "entropy": 1.5321417450904846, "epoch": 0.5107951553449184, "grad_norm": 0.33614546060562134, "learning_rate": 0.000199133460245937, "loss": 0.2249448001384735, "mean_token_accuracy": 0.9105825424194336, "num_tokens": 11965920.0, "step": 970 }, { "entropy": 1.5060743689537048, "epoch": 0.5113217482885729, "grad_norm": 0.3201083540916443, "learning_rate": 0.00019913042199844097, "loss": 0.22582277655601501, "mean_token_accuracy": 0.9086000770330429, "num_tokens": 11978256.0, "step": 971 }, { "entropy": 1.5098620057106018, "epoch": 0.5118483412322274, "grad_norm": 0.739696204662323, "learning_rate": 0.00019912737845979126, "loss": 0.20600268244743347, "mean_token_accuracy": 0.9227887839078903, "num_tokens": 11990592.0, "step": 972 }, { "entropy": 1.5500882267951965, "epoch": 0.5123749341758821, "grad_norm": 0.3458639681339264, "learning_rate": 0.00019912432963016855, "loss": 0.23240959644317627, "mean_token_accuracy": 0.9070769846439362, "num_tokens": 12002928.0, "step": 973 }, { "entropy": 1.5514563918113708, "epoch": 0.5129015271195366, "grad_norm": 0.33823850750923157, "learning_rate": 0.0001991212755097539, "loss": 0.21927812695503235, "mean_token_accuracy": 0.9085335284471512, "num_tokens": 12015264.0, "step": 974 }, { "entropy": 1.4905177056789398, "epoch": 0.5134281200631912, "grad_norm": 0.3308093547821045, "learning_rate": 0.0001991182160987285, "loss": 0.22249096632003784, "mean_token_accuracy": 0.9114507138729095, "num_tokens": 12027600.0, "step": 975 }, { "entropy": 1.5092821419239044, "epoch": 0.5139547130068457, "grad_norm": 0.35571059584617615, "learning_rate": 0.0001991151513972741, "loss": 0.23242917656898499, "mean_token_accuracy": 0.9118809998035431, "num_tokens": 12039936.0, "step": 976 }, { "entropy": 1.426015704870224, "epoch": 0.5144813059505002, "grad_norm": 0.2942444086074829, "learning_rate": 0.0001991120814055725, "loss": 0.2060171216726303, "mean_token_accuracy": 0.9149444848299026, "num_tokens": 12052272.0, "step": 977 }, { "entropy": 1.4646040201187134, "epoch": 0.5150078988941548, "grad_norm": 0.36998897790908813, "learning_rate": 0.00019910900612380605, "loss": 0.23340070247650146, "mean_token_accuracy": 0.9063846617937088, "num_tokens": 12064608.0, "step": 978 }, { "entropy": 1.4659819900989532, "epoch": 0.5155344918378094, "grad_norm": 0.3255058526992798, "learning_rate": 0.00019910592555215725, "loss": 0.20911140739917755, "mean_token_accuracy": 0.9192948192358017, "num_tokens": 12076944.0, "step": 979 }, { "entropy": 1.5005815625190735, "epoch": 0.516061084781464, "grad_norm": 0.35735374689102173, "learning_rate": 0.000199102839690809, "loss": 0.2287176251411438, "mean_token_accuracy": 0.9081791937351227, "num_tokens": 12089280.0, "step": 980 }, { "entropy": 1.4197439849376678, "epoch": 0.5165876777251185, "grad_norm": 0.30643951892852783, "learning_rate": 0.00019909974853994452, "loss": 0.19968025386333466, "mean_token_accuracy": 0.9234030842781067, "num_tokens": 12101616.0, "step": 981 }, { "entropy": 1.4192424714565277, "epoch": 0.517114270668773, "grad_norm": 0.337433785200119, "learning_rate": 0.00019909665209974723, "loss": 0.23955072462558746, "mean_token_accuracy": 0.9109057635068893, "num_tokens": 12113952.0, "step": 982 }, { "entropy": 1.4805451035499573, "epoch": 0.5176408636124276, "grad_norm": 0.34595102071762085, "learning_rate": 0.00019909355037040104, "loss": 0.23975268006324768, "mean_token_accuracy": 0.9099203199148178, "num_tokens": 12126288.0, "step": 983 }, { "entropy": 1.4859175980091095, "epoch": 0.5181674565560821, "grad_norm": 0.33112627267837524, "learning_rate": 0.00019909044335209003, "loss": 0.23115341365337372, "mean_token_accuracy": 0.9144714772701263, "num_tokens": 12138624.0, "step": 984 }, { "entropy": 1.4870480000972748, "epoch": 0.5186940494997367, "grad_norm": 0.2882140576839447, "learning_rate": 0.00019908733104499868, "loss": 0.2003549188375473, "mean_token_accuracy": 0.9193922579288483, "num_tokens": 12150960.0, "step": 985 }, { "entropy": 1.5195731818675995, "epoch": 0.5192206424433913, "grad_norm": 0.33627068996429443, "learning_rate": 0.00019908421344931173, "loss": 0.2529386878013611, "mean_token_accuracy": 0.8942808210849762, "num_tokens": 12163296.0, "step": 986 }, { "entropy": 1.480097621679306, "epoch": 0.5197472353870458, "grad_norm": 1.469023585319519, "learning_rate": 0.0001990810905652142, "loss": 0.24130460619926453, "mean_token_accuracy": 0.9022433310747147, "num_tokens": 12175632.0, "step": 987 }, { "entropy": 1.498535007238388, "epoch": 0.5202738283307003, "grad_norm": 0.29503491520881653, "learning_rate": 0.00019907796239289154, "loss": 0.21136939525604248, "mean_token_accuracy": 0.9171615391969681, "num_tokens": 12187968.0, "step": 988 }, { "entropy": 1.5154505968093872, "epoch": 0.5208004212743549, "grad_norm": 0.29515334963798523, "learning_rate": 0.00019907482893252945, "loss": 0.22373729944229126, "mean_token_accuracy": 0.9104124307632446, "num_tokens": 12200304.0, "step": 989 }, { "entropy": 1.5455197095870972, "epoch": 0.5213270142180095, "grad_norm": 0.36879390478134155, "learning_rate": 0.00019907169018431394, "loss": 0.23778440058231354, "mean_token_accuracy": 0.9108938276767731, "num_tokens": 12212640.0, "step": 990 }, { "entropy": 1.5229522287845612, "epoch": 0.5218536071616641, "grad_norm": 0.33947938680648804, "learning_rate": 0.0001990685461484313, "loss": 0.22162161767482758, "mean_token_accuracy": 0.9117240607738495, "num_tokens": 12224976.0, "step": 991 }, { "entropy": 1.5108350217342377, "epoch": 0.5223802001053186, "grad_norm": 0.3344981074333191, "learning_rate": 0.00019906539682506823, "loss": 0.20931261777877808, "mean_token_accuracy": 0.9169653207063675, "num_tokens": 12237312.0, "step": 992 }, { "entropy": 1.508901059627533, "epoch": 0.5229067930489731, "grad_norm": 0.3136521279811859, "learning_rate": 0.00019906224221441168, "loss": 0.22339576482772827, "mean_token_accuracy": 0.9082980453968048, "num_tokens": 12249648.0, "step": 993 }, { "entropy": 1.5110598504543304, "epoch": 0.5234333859926277, "grad_norm": 0.3550313413143158, "learning_rate": 0.0001990590823166489, "loss": 0.2181922197341919, "mean_token_accuracy": 0.913140058517456, "num_tokens": 12261984.0, "step": 994 }, { "entropy": 1.4990539252758026, "epoch": 0.5239599789362822, "grad_norm": 0.3551686108112335, "learning_rate": 0.00019905591713196747, "loss": 0.21492283046245575, "mean_token_accuracy": 0.917353168129921, "num_tokens": 12274320.0, "step": 995 }, { "entropy": 1.6208187341690063, "epoch": 0.5244865718799369, "grad_norm": 0.3526499271392822, "learning_rate": 0.0001990527466605553, "loss": 0.2129640281200409, "mean_token_accuracy": 0.913350835442543, "num_tokens": 12286656.0, "step": 996 }, { "entropy": 1.5281141996383667, "epoch": 0.5250131648235914, "grad_norm": 0.33227595686912537, "learning_rate": 0.00019904957090260056, "loss": 0.21114130318164825, "mean_token_accuracy": 0.9172855019569397, "num_tokens": 12298992.0, "step": 997 }, { "entropy": 1.4690798819065094, "epoch": 0.5255397577672459, "grad_norm": 0.30048811435699463, "learning_rate": 0.00019904638985829187, "loss": 0.20892660319805145, "mean_token_accuracy": 0.9182561188936234, "num_tokens": 12311328.0, "step": 998 }, { "entropy": 1.6034342348575592, "epoch": 0.5260663507109005, "grad_norm": 0.3628803491592407, "learning_rate": 0.000199043203527818, "loss": 0.21608318388462067, "mean_token_accuracy": 0.913134828209877, "num_tokens": 12323664.0, "step": 999 }, { "entropy": 1.4999005496501923, "epoch": 0.526592943654555, "grad_norm": 0.3294629454612732, "learning_rate": 0.0001990400119113681, "loss": 0.21117916703224182, "mean_token_accuracy": 0.917900949716568, "num_tokens": 12336000.0, "step": 1000 }, { "entropy": 1.596118301153183, "epoch": 0.5271195365982095, "grad_norm": 0.3512589931488037, "learning_rate": 0.00019903681500913167, "loss": 0.20125192403793335, "mean_token_accuracy": 0.921380877494812, "num_tokens": 12348336.0, "step": 1001 }, { "entropy": 1.4794040620326996, "epoch": 0.5276461295418642, "grad_norm": 0.3046097457408905, "learning_rate": 0.0001990336128212985, "loss": 0.2075495421886444, "mean_token_accuracy": 0.9140082001686096, "num_tokens": 12360672.0, "step": 1002 }, { "entropy": 1.5259474217891693, "epoch": 0.5281727224855187, "grad_norm": 0.3376280963420868, "learning_rate": 0.00019903040534805866, "loss": 0.22057998180389404, "mean_token_accuracy": 0.9114288538694382, "num_tokens": 12373008.0, "step": 1003 }, { "entropy": 1.5479835271835327, "epoch": 0.5286993154291733, "grad_norm": 0.3668357729911804, "learning_rate": 0.00019902719258960253, "loss": 0.24602656066417694, "mean_token_accuracy": 0.9003023505210876, "num_tokens": 12385344.0, "step": 1004 }, { "entropy": 1.5563693940639496, "epoch": 0.5292259083728278, "grad_norm": 0.33542895317077637, "learning_rate": 0.0001990239745461209, "loss": 0.22432827949523926, "mean_token_accuracy": 0.9152787178754807, "num_tokens": 12397680.0, "step": 1005 }, { "entropy": 1.5360921025276184, "epoch": 0.5297525013164823, "grad_norm": 0.34227633476257324, "learning_rate": 0.00019902075121780473, "loss": 0.24711929261684418, "mean_token_accuracy": 0.9043864160776138, "num_tokens": 12410016.0, "step": 1006 }, { "entropy": 1.5392629504203796, "epoch": 0.5302790942601369, "grad_norm": 0.31668519973754883, "learning_rate": 0.00019901752260484545, "loss": 0.24319474399089813, "mean_token_accuracy": 0.9046953171491623, "num_tokens": 12422352.0, "step": 1007 }, { "entropy": 1.608776479959488, "epoch": 0.5308056872037915, "grad_norm": 0.3281152844429016, "learning_rate": 0.00019901428870743466, "loss": 0.2047930210828781, "mean_token_accuracy": 0.9202082604169846, "num_tokens": 12434688.0, "step": 1008 }, { "entropy": 1.6915300488471985, "epoch": 0.531332280147446, "grad_norm": 0.38227638602256775, "learning_rate": 0.0001990110495257644, "loss": 0.23451298475265503, "mean_token_accuracy": 0.9067147076129913, "num_tokens": 12447024.0, "step": 1009 }, { "entropy": 1.5676094889640808, "epoch": 0.5318588730911006, "grad_norm": 0.3091145157814026, "learning_rate": 0.0001990078050600269, "loss": 0.21618413925170898, "mean_token_accuracy": 0.9121405184268951, "num_tokens": 12459360.0, "step": 1010 }, { "entropy": 1.6247548460960388, "epoch": 0.5323854660347551, "grad_norm": 0.3261072337627411, "learning_rate": 0.0001990045553104148, "loss": 0.2148750126361847, "mean_token_accuracy": 0.9210677593946457, "num_tokens": 12471696.0, "step": 1011 }, { "entropy": 1.5738478302955627, "epoch": 0.5329120589784097, "grad_norm": 0.32214832305908203, "learning_rate": 0.00019900130027712099, "loss": 0.23918862640857697, "mean_token_accuracy": 0.9062842279672623, "num_tokens": 12484032.0, "step": 1012 }, { "entropy": 1.474539339542389, "epoch": 0.5334386519220643, "grad_norm": 0.346766859292984, "learning_rate": 0.00019899803996033876, "loss": 0.21119186282157898, "mean_token_accuracy": 0.918285146355629, "num_tokens": 12496368.0, "step": 1013 }, { "entropy": 1.5115889310836792, "epoch": 0.5339652448657188, "grad_norm": 0.3021303117275238, "learning_rate": 0.00019899477436026157, "loss": 0.19445011019706726, "mean_token_accuracy": 0.9237413257360458, "num_tokens": 12508704.0, "step": 1014 }, { "entropy": 1.492755115032196, "epoch": 0.5344918378093734, "grad_norm": 0.3711804449558258, "learning_rate": 0.00019899150347708335, "loss": 0.21977633237838745, "mean_token_accuracy": 0.9105686545372009, "num_tokens": 12521040.0, "step": 1015 }, { "entropy": 1.4154399931430817, "epoch": 0.5350184307530279, "grad_norm": 0.34001612663269043, "learning_rate": 0.00019898822731099827, "loss": 0.1881294697523117, "mean_token_accuracy": 0.924776166677475, "num_tokens": 12533376.0, "step": 1016 }, { "entropy": 1.41116601228714, "epoch": 0.5355450236966824, "grad_norm": 0.33592158555984497, "learning_rate": 0.00019898494586220077, "loss": 0.22032563388347626, "mean_token_accuracy": 0.9117150008678436, "num_tokens": 12545712.0, "step": 1017 }, { "entropy": 1.416001707315445, "epoch": 0.536071616640337, "grad_norm": 0.3635656535625458, "learning_rate": 0.00019898165913088568, "loss": 0.2379489541053772, "mean_token_accuracy": 0.9045498371124268, "num_tokens": 12558048.0, "step": 1018 }, { "entropy": 1.346794456243515, "epoch": 0.5365982095839916, "grad_norm": 0.41112419962882996, "learning_rate": 0.0001989783671172481, "loss": 0.24667346477508545, "mean_token_accuracy": 0.9044399708509445, "num_tokens": 12570384.0, "step": 1019 }, { "entropy": 1.417405605316162, "epoch": 0.5371248025276462, "grad_norm": 0.3971119821071625, "learning_rate": 0.00019897506982148353, "loss": 0.19713318347930908, "mean_token_accuracy": 0.9267271012067795, "num_tokens": 12582720.0, "step": 1020 }, { "entropy": 1.4534864723682404, "epoch": 0.5376513954713007, "grad_norm": 0.3351125717163086, "learning_rate": 0.00019897176724378762, "loss": 0.22281871736049652, "mean_token_accuracy": 0.9098447114229202, "num_tokens": 12595056.0, "step": 1021 }, { "entropy": 1.3609624803066254, "epoch": 0.5381779884149552, "grad_norm": 0.3119547665119171, "learning_rate": 0.00019896845938435642, "loss": 0.2145942896604538, "mean_token_accuracy": 0.9176490157842636, "num_tokens": 12607392.0, "step": 1022 }, { "entropy": 1.373078614473343, "epoch": 0.5387045813586098, "grad_norm": 0.3335905075073242, "learning_rate": 0.00019896514624338633, "loss": 0.20780502259731293, "mean_token_accuracy": 0.9145664125680923, "num_tokens": 12619728.0, "step": 1023 }, { "entropy": 1.45356023311615, "epoch": 0.5392311743022643, "grad_norm": 0.321328729391098, "learning_rate": 0.00019896182782107408, "loss": 0.21474064886569977, "mean_token_accuracy": 0.914635494351387, "num_tokens": 12632064.0, "step": 1024 }, { "entropy": 1.3756296038627625, "epoch": 0.539757767245919, "grad_norm": 0.3236009180545807, "learning_rate": 0.0001989585041176166, "loss": 0.19574275612831116, "mean_token_accuracy": 0.9214889109134674, "num_tokens": 12644400.0, "step": 1025 }, { "entropy": 1.374951332807541, "epoch": 0.5402843601895735, "grad_norm": 0.33436882495880127, "learning_rate": 0.00019895517513321125, "loss": 0.2343987077474594, "mean_token_accuracy": 0.9015287011861801, "num_tokens": 12656736.0, "step": 1026 }, { "entropy": 1.3473423719406128, "epoch": 0.540810953133228, "grad_norm": 0.30872446298599243, "learning_rate": 0.0001989518408680556, "loss": 0.23760074377059937, "mean_token_accuracy": 0.9077365547418594, "num_tokens": 12669072.0, "step": 1027 }, { "entropy": 1.4245812594890594, "epoch": 0.5413375460768826, "grad_norm": 0.32098084688186646, "learning_rate": 0.0001989485013223476, "loss": 0.22173723578453064, "mean_token_accuracy": 0.9116310328245163, "num_tokens": 12681408.0, "step": 1028 }, { "entropy": 1.357390284538269, "epoch": 0.5418641390205371, "grad_norm": 0.3540545701980591, "learning_rate": 0.0001989451564962855, "loss": 0.22398629784584045, "mean_token_accuracy": 0.914269283413887, "num_tokens": 12693744.0, "step": 1029 }, { "entropy": 1.4113155901432037, "epoch": 0.5423907319641916, "grad_norm": 0.3349270224571228, "learning_rate": 0.00019894180639006787, "loss": 0.23276042938232422, "mean_token_accuracy": 0.905420333147049, "num_tokens": 12706080.0, "step": 1030 }, { "entropy": 1.3748076260089874, "epoch": 0.5429173249078463, "grad_norm": 0.31247857213020325, "learning_rate": 0.0001989384510038936, "loss": 0.2479267716407776, "mean_token_accuracy": 0.8999170660972595, "num_tokens": 12718416.0, "step": 1031 }, { "entropy": 1.4230112135410309, "epoch": 0.5434439178515008, "grad_norm": 0.31677430868148804, "learning_rate": 0.0001989350903379619, "loss": 0.2388826310634613, "mean_token_accuracy": 0.9079335629940033, "num_tokens": 12730752.0, "step": 1032 }, { "entropy": 1.341791033744812, "epoch": 0.5439705107951553, "grad_norm": 0.30199915170669556, "learning_rate": 0.0001989317243924722, "loss": 0.21240849792957306, "mean_token_accuracy": 0.9131926447153091, "num_tokens": 12743088.0, "step": 1033 }, { "entropy": 1.3770472407341003, "epoch": 0.5444971037388099, "grad_norm": 0.28729885816574097, "learning_rate": 0.00019892835316762437, "loss": 0.20151323080062866, "mean_token_accuracy": 0.9193004071712494, "num_tokens": 12755424.0, "step": 1034 }, { "entropy": 1.3323063850402832, "epoch": 0.5450236966824644, "grad_norm": 0.3478204607963562, "learning_rate": 0.00019892497666361848, "loss": 0.22956590354442596, "mean_token_accuracy": 0.910034716129303, "num_tokens": 12767760.0, "step": 1035 }, { "entropy": 1.2777645885944366, "epoch": 0.545550289626119, "grad_norm": 0.32218146324157715, "learning_rate": 0.00019892159488065506, "loss": 0.2523505985736847, "mean_token_accuracy": 0.8999349474906921, "num_tokens": 12780096.0, "step": 1036 }, { "entropy": 1.3476167619228363, "epoch": 0.5460768825697736, "grad_norm": 0.3297399580478668, "learning_rate": 0.00019891820781893485, "loss": 0.24944739043712616, "mean_token_accuracy": 0.8990609049797058, "num_tokens": 12792432.0, "step": 1037 }, { "entropy": 1.3680584728717804, "epoch": 0.5466034755134281, "grad_norm": 0.31413063406944275, "learning_rate": 0.00019891481547865887, "loss": 0.23303711414337158, "mean_token_accuracy": 0.9072806537151337, "num_tokens": 12804768.0, "step": 1038 }, { "entropy": 1.2887639105319977, "epoch": 0.5471300684570827, "grad_norm": 0.30452004075050354, "learning_rate": 0.00019891141786002853, "loss": 0.20885013043880463, "mean_token_accuracy": 0.91634900867939, "num_tokens": 12817104.0, "step": 1039 }, { "entropy": 1.427742451429367, "epoch": 0.5476566614007372, "grad_norm": 0.3391040563583374, "learning_rate": 0.00019890801496324554, "loss": 0.21363744139671326, "mean_token_accuracy": 0.9168877154588699, "num_tokens": 12829440.0, "step": 1040 }, { "entropy": 1.4079940021038055, "epoch": 0.5481832543443917, "grad_norm": 0.34792712330818176, "learning_rate": 0.00019890460678851187, "loss": 0.23039647936820984, "mean_token_accuracy": 0.9067210853099823, "num_tokens": 12841776.0, "step": 1041 }, { "entropy": 1.362496793270111, "epoch": 0.5487098472880464, "grad_norm": 0.3340260684490204, "learning_rate": 0.00019890119333602988, "loss": 0.21935522556304932, "mean_token_accuracy": 0.9152266681194305, "num_tokens": 12854112.0, "step": 1042 }, { "entropy": 1.3945021033287048, "epoch": 0.5492364402317009, "grad_norm": 0.31123343110084534, "learning_rate": 0.00019889777460600221, "loss": 0.2165759801864624, "mean_token_accuracy": 0.9149927645921707, "num_tokens": 12866448.0, "step": 1043 }, { "entropy": 1.3361455798149109, "epoch": 0.5497630331753555, "grad_norm": 0.30849552154541016, "learning_rate": 0.0001988943505986318, "loss": 0.23334844410419464, "mean_token_accuracy": 0.9073198139667511, "num_tokens": 12878784.0, "step": 1044 }, { "entropy": 1.353363960981369, "epoch": 0.55028962611901, "grad_norm": 0.30394431948661804, "learning_rate": 0.00019889092131412188, "loss": 0.21873678267002106, "mean_token_accuracy": 0.9092230349779129, "num_tokens": 12891120.0, "step": 1045 }, { "entropy": 1.3730317652225494, "epoch": 0.5508162190626645, "grad_norm": 0.3051231801509857, "learning_rate": 0.0001988874867526761, "loss": 0.2074829638004303, "mean_token_accuracy": 0.9159383773803711, "num_tokens": 12903456.0, "step": 1046 }, { "entropy": 1.348529189825058, "epoch": 0.5513428120063191, "grad_norm": 0.34162041544914246, "learning_rate": 0.00019888404691449828, "loss": 0.20376741886138916, "mean_token_accuracy": 0.9213349372148514, "num_tokens": 12915792.0, "step": 1047 }, { "entropy": 1.3659497201442719, "epoch": 0.5518694049499737, "grad_norm": 0.3287021219730377, "learning_rate": 0.00019888060179979266, "loss": 0.22284625470638275, "mean_token_accuracy": 0.9160720854997635, "num_tokens": 12928128.0, "step": 1048 }, { "entropy": 1.39521923661232, "epoch": 0.5523959978936283, "grad_norm": 0.33031636476516724, "learning_rate": 0.00019887715140876373, "loss": 0.2400185465812683, "mean_token_accuracy": 0.9030187875032425, "num_tokens": 12940464.0, "step": 1049 }, { "entropy": 1.4470847249031067, "epoch": 0.5529225908372828, "grad_norm": 0.37168604135513306, "learning_rate": 0.00019887369574161633, "loss": 0.22982707619667053, "mean_token_accuracy": 0.9084116071462631, "num_tokens": 12952800.0, "step": 1050 }, { "entropy": 1.3384085595607758, "epoch": 0.5534491837809373, "grad_norm": 0.32396450638771057, "learning_rate": 0.00019887023479855565, "loss": 0.24000367522239685, "mean_token_accuracy": 0.9041632562875748, "num_tokens": 12965136.0, "step": 1051 }, { "entropy": 1.3531986474990845, "epoch": 0.5539757767245919, "grad_norm": 0.319603830575943, "learning_rate": 0.00019886676857978707, "loss": 0.23166413605213165, "mean_token_accuracy": 0.9047738164663315, "num_tokens": 12977472.0, "step": 1052 }, { "entropy": 1.3648565709590912, "epoch": 0.5545023696682464, "grad_norm": 0.3087165057659149, "learning_rate": 0.00019886329708551642, "loss": 0.21422043442726135, "mean_token_accuracy": 0.9170399606227875, "num_tokens": 12989808.0, "step": 1053 }, { "entropy": 1.4327314496040344, "epoch": 0.555028962611901, "grad_norm": 0.31154927611351013, "learning_rate": 0.00019885982031594973, "loss": 0.23706527054309845, "mean_token_accuracy": 0.9066223204135895, "num_tokens": 13002144.0, "step": 1054 }, { "entropy": 1.401264727115631, "epoch": 0.5555555555555556, "grad_norm": 0.30120137333869934, "learning_rate": 0.00019885633827129343, "loss": 0.21149972081184387, "mean_token_accuracy": 0.9169722944498062, "num_tokens": 13014480.0, "step": 1055 }, { "entropy": 1.4713716506958008, "epoch": 0.5560821484992101, "grad_norm": 0.39476147294044495, "learning_rate": 0.00019885285095175422, "loss": 0.26564526557922363, "mean_token_accuracy": 0.8999374806880951, "num_tokens": 13026816.0, "step": 1056 }, { "entropy": 1.4001291990280151, "epoch": 0.5566087414428647, "grad_norm": 0.3243412971496582, "learning_rate": 0.00019884935835753914, "loss": 0.2307104468345642, "mean_token_accuracy": 0.9069186598062515, "num_tokens": 13039152.0, "step": 1057 }, { "entropy": 1.4063750207424164, "epoch": 0.5571353343865192, "grad_norm": 0.3205982446670532, "learning_rate": 0.0001988458604888555, "loss": 0.2200152724981308, "mean_token_accuracy": 0.9117906540632248, "num_tokens": 13051488.0, "step": 1058 }, { "entropy": 1.4639129042625427, "epoch": 0.5576619273301737, "grad_norm": 0.35051432251930237, "learning_rate": 0.00019884235734591096, "loss": 0.21262915432453156, "mean_token_accuracy": 0.9155555963516235, "num_tokens": 13063824.0, "step": 1059 }, { "entropy": 1.3807141780853271, "epoch": 0.5581885202738284, "grad_norm": 0.31436532735824585, "learning_rate": 0.00019883884892891348, "loss": 0.23192916810512543, "mean_token_accuracy": 0.9132644683122635, "num_tokens": 13076160.0, "step": 1060 }, { "entropy": 1.4159002602100372, "epoch": 0.5587151132174829, "grad_norm": 0.35557860136032104, "learning_rate": 0.00019883533523807131, "loss": 0.2557951807975769, "mean_token_accuracy": 0.9019583463668823, "num_tokens": 13088496.0, "step": 1061 }, { "entropy": 1.4077826738357544, "epoch": 0.5592417061611374, "grad_norm": 0.35081014037132263, "learning_rate": 0.00019883181627359305, "loss": 0.21151600778102875, "mean_token_accuracy": 0.914755642414093, "num_tokens": 13100832.0, "step": 1062 }, { "entropy": 1.3742648661136627, "epoch": 0.559768299104792, "grad_norm": 0.28598442673683167, "learning_rate": 0.00019882829203568764, "loss": 0.21076026558876038, "mean_token_accuracy": 0.9148049652576447, "num_tokens": 13113168.0, "step": 1063 }, { "entropy": 1.4464651346206665, "epoch": 0.5602948920484465, "grad_norm": 0.29035648703575134, "learning_rate": 0.00019882476252456428, "loss": 0.20042768120765686, "mean_token_accuracy": 0.9182227253913879, "num_tokens": 13125504.0, "step": 1064 }, { "entropy": 1.3639024496078491, "epoch": 0.5608214849921012, "grad_norm": 0.3004502058029175, "learning_rate": 0.00019882122774043243, "loss": 0.2036202847957611, "mean_token_accuracy": 0.9217555373907089, "num_tokens": 13137840.0, "step": 1065 }, { "entropy": 1.3562072217464447, "epoch": 0.5613480779357557, "grad_norm": 0.29948773980140686, "learning_rate": 0.000198817687683502, "loss": 0.20943708717823029, "mean_token_accuracy": 0.9172091037034988, "num_tokens": 13150176.0, "step": 1066 }, { "entropy": 1.4171293675899506, "epoch": 0.5618746708794102, "grad_norm": 0.32766589522361755, "learning_rate": 0.00019881414235398313, "loss": 0.22548557817935944, "mean_token_accuracy": 0.9138119965791702, "num_tokens": 13162512.0, "step": 1067 }, { "entropy": 1.494034618139267, "epoch": 0.5624012638230648, "grad_norm": 0.3495429754257202, "learning_rate": 0.00019881059175208624, "loss": 0.24128882586956024, "mean_token_accuracy": 0.9064372777938843, "num_tokens": 13174848.0, "step": 1068 }, { "entropy": 1.4479554295539856, "epoch": 0.5629278567667193, "grad_norm": 0.3285626769065857, "learning_rate": 0.0001988070358780222, "loss": 0.1992790549993515, "mean_token_accuracy": 0.922189861536026, "num_tokens": 13187184.0, "step": 1069 }, { "entropy": 1.36091148853302, "epoch": 0.5634544497103738, "grad_norm": 0.29997125267982483, "learning_rate": 0.00019880347473200197, "loss": 0.19809836149215698, "mean_token_accuracy": 0.9212192296981812, "num_tokens": 13199520.0, "step": 1070 }, { "entropy": 1.4168705940246582, "epoch": 0.5639810426540285, "grad_norm": 0.320639044046402, "learning_rate": 0.0001987999083142371, "loss": 0.21112670004367828, "mean_token_accuracy": 0.9181769639253616, "num_tokens": 13211856.0, "step": 1071 }, { "entropy": 1.3809196650981903, "epoch": 0.564507635597683, "grad_norm": 0.36394959688186646, "learning_rate": 0.0001987963366249392, "loss": 0.23442226648330688, "mean_token_accuracy": 0.9071120172739029, "num_tokens": 13224192.0, "step": 1072 }, { "entropy": 1.3890978693962097, "epoch": 0.5650342285413376, "grad_norm": 0.34244871139526367, "learning_rate": 0.00019879275966432037, "loss": 0.22117844223976135, "mean_token_accuracy": 0.9115606546401978, "num_tokens": 13236528.0, "step": 1073 }, { "entropy": 1.3886411488056183, "epoch": 0.5655608214849921, "grad_norm": 0.35859042406082153, "learning_rate": 0.00019878917743259292, "loss": 0.21675634384155273, "mean_token_accuracy": 0.9194170236587524, "num_tokens": 13248864.0, "step": 1074 }, { "entropy": 1.4300493896007538, "epoch": 0.5660874144286466, "grad_norm": 0.34859365224838257, "learning_rate": 0.00019878558992996947, "loss": 0.24318671226501465, "mean_token_accuracy": 0.9037031382322311, "num_tokens": 13261200.0, "step": 1075 }, { "entropy": 1.3681704699993134, "epoch": 0.5666140073723012, "grad_norm": 0.3271603286266327, "learning_rate": 0.00019878199715666305, "loss": 0.2319377213716507, "mean_token_accuracy": 0.9129595458507538, "num_tokens": 13273536.0, "step": 1076 }, { "entropy": 1.395903766155243, "epoch": 0.5671406003159558, "grad_norm": 0.29173579812049866, "learning_rate": 0.00019877839911288693, "loss": 0.20177659392356873, "mean_token_accuracy": 0.9242661744356155, "num_tokens": 13285872.0, "step": 1077 }, { "entropy": 1.4401375949382782, "epoch": 0.5676671932596103, "grad_norm": 0.3181249499320984, "learning_rate": 0.0001987747957988547, "loss": 0.22763216495513916, "mean_token_accuracy": 0.907039076089859, "num_tokens": 13298208.0, "step": 1078 }, { "entropy": 1.3585200309753418, "epoch": 0.5681937862032649, "grad_norm": 0.2902856171131134, "learning_rate": 0.00019877118721478026, "loss": 0.19510802626609802, "mean_token_accuracy": 0.9210563600063324, "num_tokens": 13310544.0, "step": 1079 }, { "entropy": 1.3690218329429626, "epoch": 0.5687203791469194, "grad_norm": 0.31650200486183167, "learning_rate": 0.00019876757336087782, "loss": 0.23386812210083008, "mean_token_accuracy": 0.9065526723861694, "num_tokens": 13322880.0, "step": 1080 }, { "entropy": 1.4170444905757904, "epoch": 0.569246972090574, "grad_norm": 0.39458808302879333, "learning_rate": 0.00019876395423736192, "loss": 0.21256215870380402, "mean_token_accuracy": 0.9154652059078217, "num_tokens": 13335216.0, "step": 1081 }, { "entropy": 1.3711142838001251, "epoch": 0.5697735650342285, "grad_norm": 0.3102315366268158, "learning_rate": 0.00019876032984444744, "loss": 0.2107260674238205, "mean_token_accuracy": 0.9209572970867157, "num_tokens": 13347552.0, "step": 1082 }, { "entropy": 1.3468361794948578, "epoch": 0.5703001579778831, "grad_norm": 0.3204945921897888, "learning_rate": 0.00019875670018234946, "loss": 0.21677452325820923, "mean_token_accuracy": 0.9137840569019318, "num_tokens": 13359888.0, "step": 1083 }, { "entropy": 1.3397773206233978, "epoch": 0.5708267509215377, "grad_norm": 0.30542871356010437, "learning_rate": 0.00019875306525128354, "loss": 0.20801898837089539, "mean_token_accuracy": 0.9187730103731155, "num_tokens": 13372224.0, "step": 1084 }, { "entropy": 1.3542706668376923, "epoch": 0.5713533438651922, "grad_norm": 0.39070987701416016, "learning_rate": 0.00019874942505146542, "loss": 0.23829345405101776, "mean_token_accuracy": 0.9077901542186737, "num_tokens": 13384560.0, "step": 1085 }, { "entropy": 1.3789608180522919, "epoch": 0.5718799368088467, "grad_norm": 0.31589949131011963, "learning_rate": 0.00019874577958311124, "loss": 0.23594669997692108, "mean_token_accuracy": 0.9101516306400299, "num_tokens": 13396896.0, "step": 1086 }, { "entropy": 1.2831343114376068, "epoch": 0.5724065297525013, "grad_norm": 0.31056761741638184, "learning_rate": 0.00019874212884643733, "loss": 0.22809851169586182, "mean_token_accuracy": 0.9048083126544952, "num_tokens": 13409232.0, "step": 1087 }, { "entropy": 1.343775451183319, "epoch": 0.5729331226961558, "grad_norm": 0.35355332493782043, "learning_rate": 0.00019873847284166047, "loss": 0.24591763317584991, "mean_token_accuracy": 0.9045094102621078, "num_tokens": 13421568.0, "step": 1088 }, { "entropy": 1.3326263129711151, "epoch": 0.5734597156398105, "grad_norm": 0.30252182483673096, "learning_rate": 0.00019873481156899769, "loss": 0.2264258861541748, "mean_token_accuracy": 0.9123017936944962, "num_tokens": 13433904.0, "step": 1089 }, { "entropy": 1.4111762046813965, "epoch": 0.573986308583465, "grad_norm": 0.30441656708717346, "learning_rate": 0.00019873114502866633, "loss": 0.20945101976394653, "mean_token_accuracy": 0.9133919775485992, "num_tokens": 13446240.0, "step": 1090 }, { "entropy": 1.3507026731967926, "epoch": 0.5745129015271195, "grad_norm": 0.29725486040115356, "learning_rate": 0.00019872747322088405, "loss": 0.22033721208572388, "mean_token_accuracy": 0.9093347936868668, "num_tokens": 13458576.0, "step": 1091 }, { "entropy": 1.3604736626148224, "epoch": 0.5750394944707741, "grad_norm": 0.2988698482513428, "learning_rate": 0.00019872379614586884, "loss": 0.20934537053108215, "mean_token_accuracy": 0.919558510184288, "num_tokens": 13470912.0, "step": 1092 }, { "entropy": 1.2718960344791412, "epoch": 0.5755660874144286, "grad_norm": 0.296278178691864, "learning_rate": 0.00019872011380383896, "loss": 0.2263902723789215, "mean_token_accuracy": 0.9120451807975769, "num_tokens": 13483248.0, "step": 1093 }, { "entropy": 1.3046118319034576, "epoch": 0.5760926803580833, "grad_norm": 0.2931486666202545, "learning_rate": 0.00019871642619501302, "loss": 0.22945842146873474, "mean_token_accuracy": 0.9100485295057297, "num_tokens": 13495584.0, "step": 1094 }, { "entropy": 1.3241084516048431, "epoch": 0.5766192733017378, "grad_norm": 0.3063081204891205, "learning_rate": 0.00019871273331960996, "loss": 0.2523494362831116, "mean_token_accuracy": 0.9037816673517227, "num_tokens": 13507920.0, "step": 1095 }, { "entropy": 1.3798290491104126, "epoch": 0.5771458662453923, "grad_norm": 0.3451617956161499, "learning_rate": 0.00019870903517784898, "loss": 0.2181454300880432, "mean_token_accuracy": 0.9167459905147552, "num_tokens": 13520256.0, "step": 1096 }, { "entropy": 1.292254477739334, "epoch": 0.5776724591890469, "grad_norm": 0.29267409443855286, "learning_rate": 0.0001987053317699496, "loss": 0.2220621407032013, "mean_token_accuracy": 0.9128179252147675, "num_tokens": 13532592.0, "step": 1097 }, { "entropy": 1.2694779932498932, "epoch": 0.5781990521327014, "grad_norm": 0.2939811646938324, "learning_rate": 0.0001987016230961317, "loss": 0.21204796433448792, "mean_token_accuracy": 0.9153830707073212, "num_tokens": 13544928.0, "step": 1098 }, { "entropy": 1.301151692867279, "epoch": 0.5787256450763559, "grad_norm": 0.3276446461677551, "learning_rate": 0.0001986979091566154, "loss": 0.20669840276241302, "mean_token_accuracy": 0.9193602800369263, "num_tokens": 13557264.0, "step": 1099 }, { "entropy": 1.2780292332172394, "epoch": 0.5792522380200106, "grad_norm": 0.31635478138923645, "learning_rate": 0.00019869418995162124, "loss": 0.22475430369377136, "mean_token_accuracy": 0.9149479269981384, "num_tokens": 13569600.0, "step": 1100 }, { "entropy": 1.3376207053661346, "epoch": 0.5797788309636651, "grad_norm": 0.3281361162662506, "learning_rate": 0.00019869046548136996, "loss": 0.2165728509426117, "mean_token_accuracy": 0.9121999144554138, "num_tokens": 13581936.0, "step": 1101 }, { "entropy": 1.2792271375656128, "epoch": 0.5803054239073197, "grad_norm": 0.34059932827949524, "learning_rate": 0.00019868673574608266, "loss": 0.2282489687204361, "mean_token_accuracy": 0.9086829572916031, "num_tokens": 13594272.0, "step": 1102 }, { "entropy": 1.312345266342163, "epoch": 0.5808320168509742, "grad_norm": 0.3228605389595032, "learning_rate": 0.00019868300074598076, "loss": 0.22286418080329895, "mean_token_accuracy": 0.912465900182724, "num_tokens": 13606608.0, "step": 1103 }, { "entropy": 1.3179580569267273, "epoch": 0.5813586097946287, "grad_norm": 0.3180788457393646, "learning_rate": 0.000198679260481286, "loss": 0.2119407206773758, "mean_token_accuracy": 0.9113909304141998, "num_tokens": 13618944.0, "step": 1104 }, { "entropy": 1.3403850197792053, "epoch": 0.5818852027382833, "grad_norm": 0.3467418849468231, "learning_rate": 0.00019867551495222042, "loss": 0.23494362831115723, "mean_token_accuracy": 0.9045893847942352, "num_tokens": 13631280.0, "step": 1105 }, { "entropy": 1.3972817361354828, "epoch": 0.5824117956819379, "grad_norm": 0.289737343788147, "learning_rate": 0.00019867176415900635, "loss": 0.22767332196235657, "mean_token_accuracy": 0.9065064936876297, "num_tokens": 13643616.0, "step": 1106 }, { "entropy": 1.3646803498268127, "epoch": 0.5829383886255924, "grad_norm": 0.30822867155075073, "learning_rate": 0.00019866800810186644, "loss": 0.22304248809814453, "mean_token_accuracy": 0.9127557724714279, "num_tokens": 13655952.0, "step": 1107 }, { "entropy": 1.3917404413223267, "epoch": 0.583464981569247, "grad_norm": 0.3238813579082489, "learning_rate": 0.0001986642467810237, "loss": 0.23602177202701569, "mean_token_accuracy": 0.9076020121574402, "num_tokens": 13668288.0, "step": 1108 }, { "entropy": 1.4159584939479828, "epoch": 0.5839915745129015, "grad_norm": 0.3269672989845276, "learning_rate": 0.00019866048019670144, "loss": 0.22922644019126892, "mean_token_accuracy": 0.9118731915950775, "num_tokens": 13680624.0, "step": 1109 }, { "entropy": 1.426487773656845, "epoch": 0.584518167456556, "grad_norm": 0.33397728204727173, "learning_rate": 0.00019865670834912316, "loss": 0.21286353468894958, "mean_token_accuracy": 0.921152800321579, "num_tokens": 13692960.0, "step": 1110 }, { "entropy": 1.4119893908500671, "epoch": 0.5850447604002106, "grad_norm": 0.29753443598747253, "learning_rate": 0.00019865293123851288, "loss": 0.2373121976852417, "mean_token_accuracy": 0.9035847336053848, "num_tokens": 13705296.0, "step": 1111 }, { "entropy": 1.380676507949829, "epoch": 0.5855713533438652, "grad_norm": 0.2954482436180115, "learning_rate": 0.00019864914886509475, "loss": 0.21925240755081177, "mean_token_accuracy": 0.9149321764707565, "num_tokens": 13717632.0, "step": 1112 }, { "entropy": 1.382420837879181, "epoch": 0.5860979462875198, "grad_norm": 0.3165317177772522, "learning_rate": 0.00019864536122909336, "loss": 0.20962990820407867, "mean_token_accuracy": 0.9176686257123947, "num_tokens": 13729968.0, "step": 1113 }, { "entropy": 1.4016212224960327, "epoch": 0.5866245392311743, "grad_norm": 0.3741922974586487, "learning_rate": 0.00019864156833073352, "loss": 0.21471966803073883, "mean_token_accuracy": 0.9138137102127075, "num_tokens": 13742304.0, "step": 1114 }, { "entropy": 1.330253154039383, "epoch": 0.5871511321748288, "grad_norm": 0.30213749408721924, "learning_rate": 0.00019863777017024042, "loss": 0.21769596636295319, "mean_token_accuracy": 0.9100621193647385, "num_tokens": 13754640.0, "step": 1115 }, { "entropy": 1.353569656610489, "epoch": 0.5876777251184834, "grad_norm": 0.37241899967193604, "learning_rate": 0.00019863396674783953, "loss": 0.2180408537387848, "mean_token_accuracy": 0.9123483598232269, "num_tokens": 13766976.0, "step": 1116 }, { "entropy": 1.3220522999763489, "epoch": 0.588204318062138, "grad_norm": 0.33360689878463745, "learning_rate": 0.00019863015806375662, "loss": 0.21166455745697021, "mean_token_accuracy": 0.9151635468006134, "num_tokens": 13779312.0, "step": 1117 }, { "entropy": 1.4124476611614227, "epoch": 0.5887309110057926, "grad_norm": 0.35278213024139404, "learning_rate": 0.0001986263441182178, "loss": 0.24385729432106018, "mean_token_accuracy": 0.9091434925794601, "num_tokens": 13791648.0, "step": 1118 }, { "entropy": 1.3624746203422546, "epoch": 0.5892575039494471, "grad_norm": 0.303867906332016, "learning_rate": 0.00019862252491144954, "loss": 0.20682811737060547, "mean_token_accuracy": 0.9137058258056641, "num_tokens": 13803984.0, "step": 1119 }, { "entropy": 1.4214110970497131, "epoch": 0.5897840968931016, "grad_norm": 0.29519587755203247, "learning_rate": 0.00019861870044367844, "loss": 0.1955740600824356, "mean_token_accuracy": 0.9222785979509354, "num_tokens": 13816320.0, "step": 1120 }, { "entropy": 1.332068532705307, "epoch": 0.5903106898367562, "grad_norm": 0.31455355882644653, "learning_rate": 0.0001986148707151316, "loss": 0.22069820761680603, "mean_token_accuracy": 0.9075255244970322, "num_tokens": 13828656.0, "step": 1121 }, { "entropy": 1.288136750459671, "epoch": 0.5908372827804107, "grad_norm": 0.3047003448009491, "learning_rate": 0.0001986110357260364, "loss": 0.23481610417366028, "mean_token_accuracy": 0.9039241820573807, "num_tokens": 13840992.0, "step": 1122 }, { "entropy": 1.3215467631816864, "epoch": 0.5913638757240653, "grad_norm": 0.2980950176715851, "learning_rate": 0.0001986071954766205, "loss": 0.20938631892204285, "mean_token_accuracy": 0.9155066460371017, "num_tokens": 13853328.0, "step": 1123 }, { "entropy": 1.3901076912879944, "epoch": 0.5918904686677199, "grad_norm": 0.3429953455924988, "learning_rate": 0.0001986033499671118, "loss": 0.24023953080177307, "mean_token_accuracy": 0.9067379236221313, "num_tokens": 13865664.0, "step": 1124 }, { "entropy": 1.3358671963214874, "epoch": 0.5924170616113744, "grad_norm": 0.2808769643306732, "learning_rate": 0.00019859949919773866, "loss": 0.20975762605667114, "mean_token_accuracy": 0.9166984409093857, "num_tokens": 13878000.0, "step": 1125 }, { "entropy": 1.3196144104003906, "epoch": 0.592943654555029, "grad_norm": 0.3139532506465912, "learning_rate": 0.0001985956431687296, "loss": 0.23033276200294495, "mean_token_accuracy": 0.9116202145814896, "num_tokens": 13890336.0, "step": 1126 }, { "entropy": 1.3117577731609344, "epoch": 0.5934702474986835, "grad_norm": 0.27732840180397034, "learning_rate": 0.0001985917818803136, "loss": 0.20888479053974152, "mean_token_accuracy": 0.9136437624692917, "num_tokens": 13902672.0, "step": 1127 }, { "entropy": 1.3565605282783508, "epoch": 0.593996840442338, "grad_norm": 0.3072391152381897, "learning_rate": 0.00019858791533271993, "loss": 0.2347339540719986, "mean_token_accuracy": 0.9031410962343216, "num_tokens": 13915008.0, "step": 1128 }, { "entropy": 1.3418332636356354, "epoch": 0.5945234333859927, "grad_norm": 0.306152880191803, "learning_rate": 0.000198584043526178, "loss": 0.21512483060359955, "mean_token_accuracy": 0.913850799202919, "num_tokens": 13927344.0, "step": 1129 }, { "entropy": 1.2864646911621094, "epoch": 0.5950500263296472, "grad_norm": 0.272443026304245, "learning_rate": 0.0001985801664609177, "loss": 0.19553211331367493, "mean_token_accuracy": 0.9215691983699799, "num_tokens": 13939680.0, "step": 1130 }, { "entropy": 1.3621837496757507, "epoch": 0.5955766192733017, "grad_norm": 0.30602437257766724, "learning_rate": 0.00019857628413716923, "loss": 0.2275530993938446, "mean_token_accuracy": 0.9101060777902603, "num_tokens": 13952016.0, "step": 1131 }, { "entropy": 1.3566639721393585, "epoch": 0.5961032122169563, "grad_norm": 0.3048968017101288, "learning_rate": 0.00019857239655516302, "loss": 0.20348000526428223, "mean_token_accuracy": 0.9176989495754242, "num_tokens": 13964352.0, "step": 1132 }, { "entropy": 1.3097732663154602, "epoch": 0.5966298051606108, "grad_norm": 0.2780429720878601, "learning_rate": 0.00019856850371512987, "loss": 0.21352221071720123, "mean_token_accuracy": 0.9180653989315033, "num_tokens": 13976688.0, "step": 1133 }, { "entropy": 1.3601540923118591, "epoch": 0.5971563981042654, "grad_norm": 0.28900468349456787, "learning_rate": 0.00019856460561730086, "loss": 0.21711350977420807, "mean_token_accuracy": 0.9169211685657501, "num_tokens": 13989024.0, "step": 1134 }, { "entropy": 1.3538919687271118, "epoch": 0.59768299104792, "grad_norm": 0.34999901056289673, "learning_rate": 0.00019856070226190745, "loss": 0.24132667481899261, "mean_token_accuracy": 0.9076129645109177, "num_tokens": 14001360.0, "step": 1135 }, { "entropy": 1.3285188376903534, "epoch": 0.5982095839915745, "grad_norm": 0.3087072968482971, "learning_rate": 0.00019855679364918125, "loss": 0.21430730819702148, "mean_token_accuracy": 0.911715641617775, "num_tokens": 14013696.0, "step": 1136 }, { "entropy": 1.3584640622138977, "epoch": 0.5987361769352291, "grad_norm": 0.34012794494628906, "learning_rate": 0.00019855287977935438, "loss": 0.22795352339744568, "mean_token_accuracy": 0.9065137207508087, "num_tokens": 14026032.0, "step": 1137 }, { "entropy": 1.337429255247116, "epoch": 0.5992627698788836, "grad_norm": 0.30005964636802673, "learning_rate": 0.0001985489606526592, "loss": 0.22258292138576508, "mean_token_accuracy": 0.9104499816894531, "num_tokens": 14038368.0, "step": 1138 }, { "entropy": 1.3470830917358398, "epoch": 0.5997893628225381, "grad_norm": 0.33669254183769226, "learning_rate": 0.0001985450362693283, "loss": 0.24716174602508545, "mean_token_accuracy": 0.9071019142866135, "num_tokens": 14050704.0, "step": 1139 }, { "entropy": 1.3219377994537354, "epoch": 0.6003159557661928, "grad_norm": 0.28407081961631775, "learning_rate": 0.0001985411066295947, "loss": 0.2014906108379364, "mean_token_accuracy": 0.9218366146087646, "num_tokens": 14063040.0, "step": 1140 }, { "entropy": 1.3444631695747375, "epoch": 0.6008425487098473, "grad_norm": 0.3870190978050232, "learning_rate": 0.00019853717173369163, "loss": 0.231156125664711, "mean_token_accuracy": 0.9088256508111954, "num_tokens": 14075376.0, "step": 1141 }, { "entropy": 1.308059424161911, "epoch": 0.6013691416535019, "grad_norm": 0.2819710373878479, "learning_rate": 0.0001985332315818527, "loss": 0.20217713713645935, "mean_token_accuracy": 0.9211951047182083, "num_tokens": 14087712.0, "step": 1142 }, { "entropy": 1.3603175282478333, "epoch": 0.6018957345971564, "grad_norm": 0.2916105389595032, "learning_rate": 0.00019852928617431186, "loss": 0.21151602268218994, "mean_token_accuracy": 0.9143334627151489, "num_tokens": 14100048.0, "step": 1143 }, { "entropy": 1.4045506119728088, "epoch": 0.6024223275408109, "grad_norm": 0.33014437556266785, "learning_rate": 0.00019852533551130324, "loss": 0.2289315164089203, "mean_token_accuracy": 0.9064499735832214, "num_tokens": 14112384.0, "step": 1144 }, { "entropy": 1.3394192457199097, "epoch": 0.6029489204844655, "grad_norm": 0.28447818756103516, "learning_rate": 0.00019852137959306144, "loss": 0.21860811114311218, "mean_token_accuracy": 0.9082520753145218, "num_tokens": 14124720.0, "step": 1145 }, { "entropy": 1.391217827796936, "epoch": 0.6034755134281201, "grad_norm": 0.28422555327415466, "learning_rate": 0.00019851741841982128, "loss": 0.19729138910770416, "mean_token_accuracy": 0.9245949536561966, "num_tokens": 14137056.0, "step": 1146 }, { "entropy": 1.3858129382133484, "epoch": 0.6040021063717746, "grad_norm": 0.29647180438041687, "learning_rate": 0.00019851345199181793, "loss": 0.22420856356620789, "mean_token_accuracy": 0.9095530211925507, "num_tokens": 14149392.0, "step": 1147 }, { "entropy": 1.3382080793380737, "epoch": 0.6045286993154292, "grad_norm": 0.3809289336204529, "learning_rate": 0.0001985094803092868, "loss": 0.23012962937355042, "mean_token_accuracy": 0.9103907644748688, "num_tokens": 14161728.0, "step": 1148 }, { "entropy": 1.252241313457489, "epoch": 0.6050552922590837, "grad_norm": 0.28908881545066833, "learning_rate": 0.00019850550337246366, "loss": 0.21694348752498627, "mean_token_accuracy": 0.9180784374475479, "num_tokens": 14174064.0, "step": 1149 }, { "entropy": 1.3115107417106628, "epoch": 0.6055818852027383, "grad_norm": 0.30919113755226135, "learning_rate": 0.00019850152118158472, "loss": 0.22491689026355743, "mean_token_accuracy": 0.9089210480451584, "num_tokens": 14186400.0, "step": 1150 }, { "entropy": 1.2686559855937958, "epoch": 0.6061084781463928, "grad_norm": 0.27780571579933167, "learning_rate": 0.0001984975337368862, "loss": 0.18563629686832428, "mean_token_accuracy": 0.9245605766773224, "num_tokens": 14198736.0, "step": 1151 }, { "entropy": 1.272880494594574, "epoch": 0.6066350710900474, "grad_norm": 0.31458860635757446, "learning_rate": 0.00019849354103860495, "loss": 0.21442924439907074, "mean_token_accuracy": 0.9128790646791458, "num_tokens": 14211072.0, "step": 1152 }, { "entropy": 1.2540790140628815, "epoch": 0.607161664033702, "grad_norm": 0.32044321298599243, "learning_rate": 0.000198489543086978, "loss": 0.20413605868816376, "mean_token_accuracy": 0.9179537445306778, "num_tokens": 14223408.0, "step": 1153 }, { "entropy": 1.3018059134483337, "epoch": 0.6076882569773565, "grad_norm": 0.3418496251106262, "learning_rate": 0.00019848553988224254, "loss": 0.2165253758430481, "mean_token_accuracy": 0.9125253260135651, "num_tokens": 14235744.0, "step": 1154 }, { "entropy": 1.2327319979667664, "epoch": 0.608214849921011, "grad_norm": 0.3597237467765808, "learning_rate": 0.0001984815314246364, "loss": 0.235613614320755, "mean_token_accuracy": 0.9087760597467422, "num_tokens": 14248080.0, "step": 1155 }, { "entropy": 1.3383413255214691, "epoch": 0.6087414428646656, "grad_norm": 0.36206018924713135, "learning_rate": 0.00019847751771439738, "loss": 0.2203393429517746, "mean_token_accuracy": 0.9124666899442673, "num_tokens": 14260416.0, "step": 1156 }, { "entropy": 1.2537713646888733, "epoch": 0.6092680358083201, "grad_norm": 0.314043253660202, "learning_rate": 0.00019847349875176383, "loss": 0.18635031580924988, "mean_token_accuracy": 0.924136608839035, "num_tokens": 14272752.0, "step": 1157 }, { "entropy": 1.2804813086986542, "epoch": 0.6097946287519748, "grad_norm": 0.3333822786808014, "learning_rate": 0.00019846947453697436, "loss": 0.24032224714756012, "mean_token_accuracy": 0.9084908664226532, "num_tokens": 14285088.0, "step": 1158 }, { "entropy": 1.2433983385562897, "epoch": 0.6103212216956293, "grad_norm": 0.3367704451084137, "learning_rate": 0.0001984654450702678, "loss": 0.21996420621871948, "mean_token_accuracy": 0.9129030555486679, "num_tokens": 14297424.0, "step": 1159 }, { "entropy": 1.2872591018676758, "epoch": 0.6108478146392838, "grad_norm": 0.3126697838306427, "learning_rate": 0.00019846141035188334, "loss": 0.22938281297683716, "mean_token_accuracy": 0.9084669649600983, "num_tokens": 14309760.0, "step": 1160 }, { "entropy": 1.2282376289367676, "epoch": 0.6113744075829384, "grad_norm": 0.3045027554035187, "learning_rate": 0.0001984573703820606, "loss": 0.21839705109596252, "mean_token_accuracy": 0.9129580110311508, "num_tokens": 14322096.0, "step": 1161 }, { "entropy": 1.296276867389679, "epoch": 0.6119010005265929, "grad_norm": 0.3050879240036011, "learning_rate": 0.00019845332516103933, "loss": 0.21910154819488525, "mean_token_accuracy": 0.9160716086626053, "num_tokens": 14334432.0, "step": 1162 }, { "entropy": 1.2552114129066467, "epoch": 0.6124275934702474, "grad_norm": 0.3606356978416443, "learning_rate": 0.0001984492746890597, "loss": 0.23291565477848053, "mean_token_accuracy": 0.9024920612573624, "num_tokens": 14346768.0, "step": 1163 }, { "entropy": 1.2350418269634247, "epoch": 0.6129541864139021, "grad_norm": 0.30588603019714355, "learning_rate": 0.00019844521896636213, "loss": 0.22299546003341675, "mean_token_accuracy": 0.9098654091358185, "num_tokens": 14359104.0, "step": 1164 }, { "entropy": 1.2168787717819214, "epoch": 0.6134807793575566, "grad_norm": 0.30036792159080505, "learning_rate": 0.00019844115799318743, "loss": 0.2024330198764801, "mean_token_accuracy": 0.9177137911319733, "num_tokens": 14371440.0, "step": 1165 }, { "entropy": 1.2549520134925842, "epoch": 0.6140073723012112, "grad_norm": 0.38305899500846863, "learning_rate": 0.00019843709176977666, "loss": 0.2291533648967743, "mean_token_accuracy": 0.912639394402504, "num_tokens": 14383776.0, "step": 1166 }, { "entropy": 1.235708236694336, "epoch": 0.6145339652448657, "grad_norm": 0.34467607736587524, "learning_rate": 0.0001984330202963712, "loss": 0.22410570085048676, "mean_token_accuracy": 0.9121714979410172, "num_tokens": 14396112.0, "step": 1167 }, { "entropy": 1.1345283687114716, "epoch": 0.6150605581885202, "grad_norm": 0.3024910092353821, "learning_rate": 0.0001984289435732127, "loss": 0.22202812135219574, "mean_token_accuracy": 0.913068488240242, "num_tokens": 14408448.0, "step": 1168 }, { "entropy": 1.154352843761444, "epoch": 0.6155871511321749, "grad_norm": 0.3543850779533386, "learning_rate": 0.00019842486160054327, "loss": 0.24754247069358826, "mean_token_accuracy": 0.9041948169469833, "num_tokens": 14420784.0, "step": 1169 }, { "entropy": 1.1256769597530365, "epoch": 0.6161137440758294, "grad_norm": 0.31246209144592285, "learning_rate": 0.00019842077437860517, "loss": 0.23024949431419373, "mean_token_accuracy": 0.9097237884998322, "num_tokens": 14433120.0, "step": 1170 }, { "entropy": 1.2304538488388062, "epoch": 0.616640337019484, "grad_norm": 0.35418546199798584, "learning_rate": 0.00019841668190764106, "loss": 0.23257943987846375, "mean_token_accuracy": 0.9058277457952499, "num_tokens": 14445456.0, "step": 1171 }, { "entropy": 1.1736994087696075, "epoch": 0.6171669299631385, "grad_norm": 0.29421883821487427, "learning_rate": 0.0001984125841878939, "loss": 0.2265184223651886, "mean_token_accuracy": 0.9127582311630249, "num_tokens": 14457792.0, "step": 1172 }, { "entropy": 1.210179328918457, "epoch": 0.617693522906793, "grad_norm": 0.3278239667415619, "learning_rate": 0.0001984084812196069, "loss": 0.2220735400915146, "mean_token_accuracy": 0.9109156280755997, "num_tokens": 14470128.0, "step": 1173 }, { "entropy": 1.1588793694972992, "epoch": 0.6182201158504476, "grad_norm": 0.27815452218055725, "learning_rate": 0.00019840437300302366, "loss": 0.22251342236995697, "mean_token_accuracy": 0.9095259606838226, "num_tokens": 14482464.0, "step": 1174 }, { "entropy": 1.1791687309741974, "epoch": 0.6187467087941022, "grad_norm": 0.2694774270057678, "learning_rate": 0.00019840025953838804, "loss": 0.2061459869146347, "mean_token_accuracy": 0.9203435033559799, "num_tokens": 14494800.0, "step": 1175 }, { "entropy": 1.1984158754348755, "epoch": 0.6192733017377567, "grad_norm": 0.29139313101768494, "learning_rate": 0.00019839614082594424, "loss": 0.22982501983642578, "mean_token_accuracy": 0.911991760134697, "num_tokens": 14507136.0, "step": 1176 }, { "entropy": 1.1957634687423706, "epoch": 0.6197998946814113, "grad_norm": 0.2952525019645691, "learning_rate": 0.0001983920168659368, "loss": 0.20150825381278992, "mean_token_accuracy": 0.9190460294485092, "num_tokens": 14519472.0, "step": 1177 }, { "entropy": 1.2356001436710358, "epoch": 0.6203264876250658, "grad_norm": 0.3485545516014099, "learning_rate": 0.0001983878876586105, "loss": 0.22730165719985962, "mean_token_accuracy": 0.9079895615577698, "num_tokens": 14531808.0, "step": 1178 }, { "entropy": 1.2191669344902039, "epoch": 0.6208530805687204, "grad_norm": 0.31337442994117737, "learning_rate": 0.00019838375320421046, "loss": 0.2090841382741928, "mean_token_accuracy": 0.9179579317569733, "num_tokens": 14544144.0, "step": 1179 }, { "entropy": 1.1627593338489532, "epoch": 0.6213796735123749, "grad_norm": 0.3373863995075226, "learning_rate": 0.00019837961350298213, "loss": 0.22159543633460999, "mean_token_accuracy": 0.9035765677690506, "num_tokens": 14556480.0, "step": 1180 }, { "entropy": 1.244479089975357, "epoch": 0.6219062664560295, "grad_norm": 0.2939426898956299, "learning_rate": 0.0001983754685551713, "loss": 0.20940116047859192, "mean_token_accuracy": 0.9177102446556091, "num_tokens": 14568816.0, "step": 1181 }, { "entropy": 1.2316089570522308, "epoch": 0.6224328593996841, "grad_norm": 0.3053775727748871, "learning_rate": 0.00019837131836102396, "loss": 0.21764273941516876, "mean_token_accuracy": 0.9150272458791733, "num_tokens": 14581152.0, "step": 1182 }, { "entropy": 1.2752362787723541, "epoch": 0.6229594523433386, "grad_norm": 0.3304329812526703, "learning_rate": 0.00019836716292078647, "loss": 0.23420026898384094, "mean_token_accuracy": 0.9085260033607483, "num_tokens": 14593488.0, "step": 1183 }, { "entropy": 1.2659085094928741, "epoch": 0.6234860452869931, "grad_norm": 0.3893950879573822, "learning_rate": 0.00019836300223470562, "loss": 0.2608282268047333, "mean_token_accuracy": 0.9021032303571701, "num_tokens": 14605824.0, "step": 1184 }, { "entropy": 1.3032302856445312, "epoch": 0.6240126382306477, "grad_norm": 0.3007699251174927, "learning_rate": 0.00019835883630302836, "loss": 0.20315539836883545, "mean_token_accuracy": 0.9167050868272781, "num_tokens": 14618160.0, "step": 1185 }, { "entropy": 1.2084311544895172, "epoch": 0.6245392311743022, "grad_norm": 0.32948681712150574, "learning_rate": 0.00019835466512600197, "loss": 0.23484407365322113, "mean_token_accuracy": 0.9104520976543427, "num_tokens": 14630496.0, "step": 1186 }, { "entropy": 1.2006751894950867, "epoch": 0.6250658241179569, "grad_norm": 0.2981775104999542, "learning_rate": 0.00019835048870387405, "loss": 0.22286085784435272, "mean_token_accuracy": 0.9095976203680038, "num_tokens": 14642832.0, "step": 1187 }, { "entropy": 1.3096867799758911, "epoch": 0.6255924170616114, "grad_norm": 0.3300210237503052, "learning_rate": 0.0001983463070368926, "loss": 0.22102200984954834, "mean_token_accuracy": 0.9119229018688202, "num_tokens": 14655168.0, "step": 1188 }, { "entropy": 1.2840961813926697, "epoch": 0.6261190100052659, "grad_norm": 0.31997406482696533, "learning_rate": 0.00019834212012530579, "loss": 0.23797491192817688, "mean_token_accuracy": 0.9043692797422409, "num_tokens": 14667504.0, "step": 1189 }, { "entropy": 1.2393836975097656, "epoch": 0.6266456029489205, "grad_norm": 0.30698251724243164, "learning_rate": 0.00019833792796936222, "loss": 0.20287004113197327, "mean_token_accuracy": 0.9166252613067627, "num_tokens": 14679840.0, "step": 1190 }, { "entropy": 1.3439719676971436, "epoch": 0.627172195892575, "grad_norm": 0.32229262590408325, "learning_rate": 0.00019833373056931072, "loss": 0.23332646489143372, "mean_token_accuracy": 0.9090562462806702, "num_tokens": 14692176.0, "step": 1191 }, { "entropy": 1.2390953600406647, "epoch": 0.6276987888362296, "grad_norm": 0.3261661231517792, "learning_rate": 0.00019832952792540054, "loss": 0.22384727001190186, "mean_token_accuracy": 0.9121635258197784, "num_tokens": 14704512.0, "step": 1192 }, { "entropy": 1.3028371036052704, "epoch": 0.6282253817798842, "grad_norm": 0.31324324011802673, "learning_rate": 0.00019832532003788108, "loss": 0.2185819447040558, "mean_token_accuracy": 0.9167534857988358, "num_tokens": 14716848.0, "step": 1193 }, { "entropy": 1.1885470747947693, "epoch": 0.6287519747235387, "grad_norm": 0.46663784980773926, "learning_rate": 0.00019832110690700213, "loss": 0.21501871943473816, "mean_token_accuracy": 0.9109776020050049, "num_tokens": 14729184.0, "step": 1194 }, { "entropy": 1.2453204691410065, "epoch": 0.6292785676671933, "grad_norm": 0.3183780014514923, "learning_rate": 0.00019831688853301388, "loss": 0.22543299198150635, "mean_token_accuracy": 0.910496860742569, "num_tokens": 14741520.0, "step": 1195 }, { "entropy": 1.2583057284355164, "epoch": 0.6298051606108478, "grad_norm": 0.3381344676017761, "learning_rate": 0.0001983126649161667, "loss": 0.214624285697937, "mean_token_accuracy": 0.9137195497751236, "num_tokens": 14753856.0, "step": 1196 }, { "entropy": 1.2429248094558716, "epoch": 0.6303317535545023, "grad_norm": 0.30227339267730713, "learning_rate": 0.00019830843605671131, "loss": 0.2062695324420929, "mean_token_accuracy": 0.9234135448932648, "num_tokens": 14766192.0, "step": 1197 }, { "entropy": 1.220680981874466, "epoch": 0.630858346498157, "grad_norm": 0.3083505630493164, "learning_rate": 0.00019830420195489877, "loss": 0.2090727537870407, "mean_token_accuracy": 0.9170975387096405, "num_tokens": 14778528.0, "step": 1198 }, { "entropy": 1.248794138431549, "epoch": 0.6313849394418115, "grad_norm": 0.3802277743816376, "learning_rate": 0.00019829996261098046, "loss": 0.2367159128189087, "mean_token_accuracy": 0.9018937945365906, "num_tokens": 14790864.0, "step": 1199 }, { "entropy": 1.3259137272834778, "epoch": 0.631911532385466, "grad_norm": 0.414235919713974, "learning_rate": 0.00019829571802520803, "loss": 0.2376767247915268, "mean_token_accuracy": 0.9016633927822113, "num_tokens": 14803200.0, "step": 1200 }, { "entropy": 1.3644030392169952, "epoch": 0.6324381253291206, "grad_norm": 0.3521367013454437, "learning_rate": 0.0001982914681978334, "loss": 0.23597122728824615, "mean_token_accuracy": 0.9043200761079788, "num_tokens": 14815536.0, "step": 1201 }, { "entropy": 1.3481078147888184, "epoch": 0.6329647182727751, "grad_norm": 0.2994113266468048, "learning_rate": 0.000198287213129109, "loss": 0.21383647620677948, "mean_token_accuracy": 0.9209251701831818, "num_tokens": 14827872.0, "step": 1202 }, { "entropy": 1.3808801472187042, "epoch": 0.6334913112164297, "grad_norm": 0.2982345223426819, "learning_rate": 0.00019828295281928727, "loss": 0.2155206948518753, "mean_token_accuracy": 0.9116237312555313, "num_tokens": 14840208.0, "step": 1203 }, { "entropy": 1.418733924627304, "epoch": 0.6340179041600843, "grad_norm": 0.3023967742919922, "learning_rate": 0.00019827868726862117, "loss": 0.23393575847148895, "mean_token_accuracy": 0.9095605909824371, "num_tokens": 14852544.0, "step": 1204 }, { "entropy": 1.5514957010746002, "epoch": 0.6345444971037388, "grad_norm": 0.40304750204086304, "learning_rate": 0.00019827441647736393, "loss": 0.26255497336387634, "mean_token_accuracy": 0.9011336117982864, "num_tokens": 14864880.0, "step": 1205 }, { "entropy": 1.4219785034656525, "epoch": 0.6350710900473934, "grad_norm": 0.291746586561203, "learning_rate": 0.00019827014044576912, "loss": 0.21620029211044312, "mean_token_accuracy": 0.9115499705076218, "num_tokens": 14877216.0, "step": 1206 }, { "entropy": 1.3420428931713104, "epoch": 0.6355976829910479, "grad_norm": 0.3108786940574646, "learning_rate": 0.0001982658591740905, "loss": 0.23703286051750183, "mean_token_accuracy": 0.9016107618808746, "num_tokens": 14889552.0, "step": 1207 }, { "entropy": 1.4392370581626892, "epoch": 0.6361242759347024, "grad_norm": 0.27034372091293335, "learning_rate": 0.00019826157266258232, "loss": 0.21097946166992188, "mean_token_accuracy": 0.9190766364336014, "num_tokens": 14901888.0, "step": 1208 }, { "entropy": 1.4509558379650116, "epoch": 0.636650868878357, "grad_norm": 0.29659944772720337, "learning_rate": 0.000198257280911499, "loss": 0.22469229996204376, "mean_token_accuracy": 0.913391038775444, "num_tokens": 14914224.0, "step": 1209 }, { "entropy": 1.3904311954975128, "epoch": 0.6371774618220116, "grad_norm": 0.2719598412513733, "learning_rate": 0.00019825298392109529, "loss": 0.18848726153373718, "mean_token_accuracy": 0.9262688905000687, "num_tokens": 14926560.0, "step": 1210 }, { "entropy": 1.4359396994113922, "epoch": 0.6377040547656662, "grad_norm": 0.3138201832771301, "learning_rate": 0.00019824868169162631, "loss": 0.24162685871124268, "mean_token_accuracy": 0.9020742177963257, "num_tokens": 14938896.0, "step": 1211 }, { "entropy": 1.3890084326267242, "epoch": 0.6382306477093207, "grad_norm": 0.2986134886741638, "learning_rate": 0.00019824437422334744, "loss": 0.22484566271305084, "mean_token_accuracy": 0.9077206701040268, "num_tokens": 14951232.0, "step": 1212 }, { "entropy": 1.378806233406067, "epoch": 0.6387572406529752, "grad_norm": 0.29134130477905273, "learning_rate": 0.00019824006151651443, "loss": 0.2171209454536438, "mean_token_accuracy": 0.9133529961109161, "num_tokens": 14963568.0, "step": 1213 }, { "entropy": 1.363432914018631, "epoch": 0.6392838335966298, "grad_norm": 0.3041214346885681, "learning_rate": 0.00019823574357138323, "loss": 0.24093735218048096, "mean_token_accuracy": 0.903191551566124, "num_tokens": 14975904.0, "step": 1214 }, { "entropy": 1.432945430278778, "epoch": 0.6398104265402843, "grad_norm": 0.30195045471191406, "learning_rate": 0.00019823142038821027, "loss": 0.20907755196094513, "mean_token_accuracy": 0.9161103218793869, "num_tokens": 14988240.0, "step": 1215 }, { "entropy": 1.3210029900074005, "epoch": 0.640337019483939, "grad_norm": 0.29575979709625244, "learning_rate": 0.00019822709196725208, "loss": 0.21090644598007202, "mean_token_accuracy": 0.9149498790502548, "num_tokens": 15000576.0, "step": 1216 }, { "entropy": 1.3699910044670105, "epoch": 0.6408636124275935, "grad_norm": 0.2982396185398102, "learning_rate": 0.00019822275830876568, "loss": 0.2054290473461151, "mean_token_accuracy": 0.9217698276042938, "num_tokens": 15012912.0, "step": 1217 }, { "entropy": 1.41866934299469, "epoch": 0.641390205371248, "grad_norm": 0.3208104968070984, "learning_rate": 0.00019821841941300834, "loss": 0.24424780905246735, "mean_token_accuracy": 0.9118457287549973, "num_tokens": 15025248.0, "step": 1218 }, { "entropy": 1.399036020040512, "epoch": 0.6419167983149026, "grad_norm": 0.3094969689846039, "learning_rate": 0.00019821407528023758, "loss": 0.23681235313415527, "mean_token_accuracy": 0.9031997323036194, "num_tokens": 15037584.0, "step": 1219 }, { "entropy": 1.3915925920009613, "epoch": 0.6424433912585571, "grad_norm": 0.2973760962486267, "learning_rate": 0.00019820972591071131, "loss": 0.19640693068504333, "mean_token_accuracy": 0.9181762486696243, "num_tokens": 15049920.0, "step": 1220 }, { "entropy": 1.4664425551891327, "epoch": 0.6429699842022117, "grad_norm": 0.7199912667274475, "learning_rate": 0.0001982053713046878, "loss": 0.2480940818786621, "mean_token_accuracy": 0.9039055407047272, "num_tokens": 15062256.0, "step": 1221 }, { "entropy": 1.4178178012371063, "epoch": 0.6434965771458663, "grad_norm": 0.3677431643009186, "learning_rate": 0.00019820101146242547, "loss": 0.22347916662693024, "mean_token_accuracy": 0.9104437232017517, "num_tokens": 15074592.0, "step": 1222 }, { "entropy": 1.3942118883132935, "epoch": 0.6440231700895208, "grad_norm": 0.3363230228424072, "learning_rate": 0.00019819664638418314, "loss": 0.23758456110954285, "mean_token_accuracy": 0.9113318026065826, "num_tokens": 15086928.0, "step": 1223 }, { "entropy": 1.3070717453956604, "epoch": 0.6445497630331753, "grad_norm": 0.3119392693042755, "learning_rate": 0.00019819227607021996, "loss": 0.1808784306049347, "mean_token_accuracy": 0.9277928322553635, "num_tokens": 15099264.0, "step": 1224 }, { "entropy": 1.3485881388187408, "epoch": 0.6450763559768299, "grad_norm": 0.2953029274940491, "learning_rate": 0.00019818790052079542, "loss": 0.21690060198307037, "mean_token_accuracy": 0.9107033312320709, "num_tokens": 15111600.0, "step": 1225 }, { "entropy": 1.3310377597808838, "epoch": 0.6456029489204844, "grad_norm": 0.30317792296409607, "learning_rate": 0.0001981835197361692, "loss": 0.21382620930671692, "mean_token_accuracy": 0.9134241938591003, "num_tokens": 15123936.0, "step": 1226 }, { "entropy": 1.3547466397285461, "epoch": 0.6461295418641391, "grad_norm": 0.31380537152290344, "learning_rate": 0.00019817913371660136, "loss": 0.23309272527694702, "mean_token_accuracy": 0.9060655981302261, "num_tokens": 15136272.0, "step": 1227 }, { "entropy": 1.359354555606842, "epoch": 0.6466561348077936, "grad_norm": 0.3240332007408142, "learning_rate": 0.00019817474246235233, "loss": 0.2206256240606308, "mean_token_accuracy": 0.9170451760292053, "num_tokens": 15148608.0, "step": 1228 }, { "entropy": 1.3810060322284698, "epoch": 0.6471827277514481, "grad_norm": 0.28998929262161255, "learning_rate": 0.00019817034597368276, "loss": 0.20593759417533875, "mean_token_accuracy": 0.9143964052200317, "num_tokens": 15160944.0, "step": 1229 }, { "entropy": 1.3853793740272522, "epoch": 0.6477093206951027, "grad_norm": 0.3167085349559784, "learning_rate": 0.00019816594425085365, "loss": 0.214578315615654, "mean_token_accuracy": 0.9154220819473267, "num_tokens": 15173280.0, "step": 1230 }, { "entropy": 1.3485651314258575, "epoch": 0.6482359136387572, "grad_norm": 0.32996588945388794, "learning_rate": 0.00019816153729412627, "loss": 0.227751225233078, "mean_token_accuracy": 0.9076825082302094, "num_tokens": 15185616.0, "step": 1231 }, { "entropy": 1.2957139611244202, "epoch": 0.6487625065824117, "grad_norm": 0.2826898396015167, "learning_rate": 0.0001981571251037623, "loss": 0.2006268948316574, "mean_token_accuracy": 0.9202533811330795, "num_tokens": 15197952.0, "step": 1232 }, { "entropy": 1.42320716381073, "epoch": 0.6492890995260664, "grad_norm": 0.3413523733615875, "learning_rate": 0.00019815270768002357, "loss": 0.2385195791721344, "mean_token_accuracy": 0.9027537554502487, "num_tokens": 15210288.0, "step": 1233 }, { "entropy": 1.3331094086170197, "epoch": 0.6498156924697209, "grad_norm": 0.3069290220737457, "learning_rate": 0.00019814828502317245, "loss": 0.2170781046152115, "mean_token_accuracy": 0.9153832644224167, "num_tokens": 15222624.0, "step": 1234 }, { "entropy": 1.365331083536148, "epoch": 0.6503422854133755, "grad_norm": 0.2763271629810333, "learning_rate": 0.0001981438571334714, "loss": 0.21132177114486694, "mean_token_accuracy": 0.9158383458852768, "num_tokens": 15234960.0, "step": 1235 }, { "entropy": 1.3776979446411133, "epoch": 0.65086887835703, "grad_norm": 0.3232009708881378, "learning_rate": 0.0001981394240111833, "loss": 0.23016487061977386, "mean_token_accuracy": 0.9127575606107712, "num_tokens": 15247296.0, "step": 1236 }, { "entropy": 1.42231023311615, "epoch": 0.6513954713006845, "grad_norm": 0.2981938421726227, "learning_rate": 0.00019813498565657127, "loss": 0.22353443503379822, "mean_token_accuracy": 0.9140705019235611, "num_tokens": 15259632.0, "step": 1237 }, { "entropy": 1.4192762076854706, "epoch": 0.6519220642443391, "grad_norm": 0.30204325914382935, "learning_rate": 0.00019813054206989884, "loss": 0.22629618644714355, "mean_token_accuracy": 0.9069414585828781, "num_tokens": 15271968.0, "step": 1238 }, { "entropy": 1.4479241073131561, "epoch": 0.6524486571879937, "grad_norm": 0.2993687689304352, "learning_rate": 0.00019812609325142982, "loss": 0.22675678133964539, "mean_token_accuracy": 0.9094991534948349, "num_tokens": 15284304.0, "step": 1239 }, { "entropy": 1.4620944261550903, "epoch": 0.6529752501316483, "grad_norm": 0.3134925961494446, "learning_rate": 0.00019812163920142827, "loss": 0.22805798053741455, "mean_token_accuracy": 0.9107698351144791, "num_tokens": 15296640.0, "step": 1240 }, { "entropy": 1.495926171541214, "epoch": 0.6535018430753028, "grad_norm": 0.3140438199043274, "learning_rate": 0.00019811717992015862, "loss": 0.2086748480796814, "mean_token_accuracy": 0.9102585017681122, "num_tokens": 15308976.0, "step": 1241 }, { "entropy": 1.4446808993816376, "epoch": 0.6540284360189573, "grad_norm": 0.30744868516921997, "learning_rate": 0.00019811271540788556, "loss": 0.22943398356437683, "mean_token_accuracy": 0.9074350297451019, "num_tokens": 15321312.0, "step": 1242 }, { "entropy": 1.5100261270999908, "epoch": 0.6545550289626119, "grad_norm": 0.3204497694969177, "learning_rate": 0.00019810824566487417, "loss": 0.22844550013542175, "mean_token_accuracy": 0.9073818922042847, "num_tokens": 15333648.0, "step": 1243 }, { "entropy": 1.4075362086296082, "epoch": 0.6550816219062665, "grad_norm": 0.32697567343711853, "learning_rate": 0.00019810377069138976, "loss": 0.23277214169502258, "mean_token_accuracy": 0.9124523550271988, "num_tokens": 15345984.0, "step": 1244 }, { "entropy": 1.474784404039383, "epoch": 0.655608214849921, "grad_norm": 0.31703367829322815, "learning_rate": 0.000198099290487698, "loss": 0.2128317952156067, "mean_token_accuracy": 0.9103437811136246, "num_tokens": 15358320.0, "step": 1245 }, { "entropy": 1.3723844587802887, "epoch": 0.6561348077935756, "grad_norm": 0.3136475384235382, "learning_rate": 0.0001980948050540648, "loss": 0.2106158286333084, "mean_token_accuracy": 0.9139569699764252, "num_tokens": 15370656.0, "step": 1246 }, { "entropy": 1.4297202229499817, "epoch": 0.6566614007372301, "grad_norm": 0.31566086411476135, "learning_rate": 0.00019809031439075653, "loss": 0.22323954105377197, "mean_token_accuracy": 0.912299782037735, "num_tokens": 15382992.0, "step": 1247 }, { "entropy": 1.404792070388794, "epoch": 0.6571879936808847, "grad_norm": 0.30582812428474426, "learning_rate": 0.00019808581849803972, "loss": 0.19535206258296967, "mean_token_accuracy": 0.926054835319519, "num_tokens": 15395328.0, "step": 1248 }, { "entropy": 1.365869253873825, "epoch": 0.6577145866245392, "grad_norm": 0.32905054092407227, "learning_rate": 0.00019808131737618126, "loss": 0.206635981798172, "mean_token_accuracy": 0.9179205745458603, "num_tokens": 15407664.0, "step": 1249 }, { "entropy": 1.4380927085876465, "epoch": 0.6582411795681938, "grad_norm": 0.3363628685474396, "learning_rate": 0.00019807681102544834, "loss": 0.23559972643852234, "mean_token_accuracy": 0.9073036760091782, "num_tokens": 15420000.0, "step": 1250 }, { "entropy": 1.4528064727783203, "epoch": 0.6587677725118484, "grad_norm": 0.3616321384906769, "learning_rate": 0.00019807229944610854, "loss": 0.23041245341300964, "mean_token_accuracy": 0.9012827575206757, "num_tokens": 15432336.0, "step": 1251 }, { "entropy": 1.4460172951221466, "epoch": 0.6592943654555029, "grad_norm": 0.305955171585083, "learning_rate": 0.00019806778263842964, "loss": 0.21666109561920166, "mean_token_accuracy": 0.9198573529720306, "num_tokens": 15444672.0, "step": 1252 }, { "entropy": 1.500756323337555, "epoch": 0.6598209583991574, "grad_norm": 0.29015445709228516, "learning_rate": 0.00019806326060267977, "loss": 0.21642570197582245, "mean_token_accuracy": 0.9154843240976334, "num_tokens": 15457008.0, "step": 1253 }, { "entropy": 1.4731870293617249, "epoch": 0.660347551342812, "grad_norm": 0.3006648123264313, "learning_rate": 0.00019805873333912739, "loss": 0.20880235731601715, "mean_token_accuracy": 0.924048438668251, "num_tokens": 15469344.0, "step": 1254 }, { "entropy": 1.5191810727119446, "epoch": 0.6608741442864665, "grad_norm": 0.290721595287323, "learning_rate": 0.00019805420084804124, "loss": 0.21848249435424805, "mean_token_accuracy": 0.9141736477613449, "num_tokens": 15481680.0, "step": 1255 }, { "entropy": 1.521433562040329, "epoch": 0.6614007372301212, "grad_norm": 0.3009195327758789, "learning_rate": 0.00019804966312969046, "loss": 0.20721524953842163, "mean_token_accuracy": 0.9165780544281006, "num_tokens": 15494016.0, "step": 1256 }, { "entropy": 1.5230248272418976, "epoch": 0.6619273301737757, "grad_norm": 0.2907300293445587, "learning_rate": 0.00019804512018434432, "loss": 0.2220079004764557, "mean_token_accuracy": 0.9127085506916046, "num_tokens": 15506352.0, "step": 1257 }, { "entropy": 1.4415357112884521, "epoch": 0.6624539231174302, "grad_norm": 0.27609995007514954, "learning_rate": 0.00019804057201227259, "loss": 0.19916732609272003, "mean_token_accuracy": 0.9211323857307434, "num_tokens": 15518688.0, "step": 1258 }, { "entropy": 1.5071959793567657, "epoch": 0.6629805160610848, "grad_norm": 0.3255380690097809, "learning_rate": 0.0001980360186137452, "loss": 0.23832152783870697, "mean_token_accuracy": 0.9030174165964127, "num_tokens": 15531024.0, "step": 1259 }, { "entropy": 1.544082134962082, "epoch": 0.6635071090047393, "grad_norm": 0.31669536232948303, "learning_rate": 0.00019803145998903253, "loss": 0.2193489968776703, "mean_token_accuracy": 0.9140938073396683, "num_tokens": 15543360.0, "step": 1260 }, { "entropy": 1.5186286568641663, "epoch": 0.6640337019483938, "grad_norm": 0.3087945282459259, "learning_rate": 0.00019802689613840514, "loss": 0.2145516723394394, "mean_token_accuracy": 0.9134328663349152, "num_tokens": 15555696.0, "step": 1261 }, { "entropy": 1.4552082121372223, "epoch": 0.6645602948920485, "grad_norm": 0.3144809901714325, "learning_rate": 0.000198022327062134, "loss": 0.22542014718055725, "mean_token_accuracy": 0.9080185741186142, "num_tokens": 15568032.0, "step": 1262 }, { "entropy": 1.4759101569652557, "epoch": 0.665086887835703, "grad_norm": 0.28055956959724426, "learning_rate": 0.00019801775276049035, "loss": 0.19411805272102356, "mean_token_accuracy": 0.9219205677509308, "num_tokens": 15580368.0, "step": 1263 }, { "entropy": 1.5172317326068878, "epoch": 0.6656134807793576, "grad_norm": 0.28847187757492065, "learning_rate": 0.00019801317323374574, "loss": 0.1965804398059845, "mean_token_accuracy": 0.9217233210802078, "num_tokens": 15592704.0, "step": 1264 }, { "entropy": 1.4631735682487488, "epoch": 0.6661400737230121, "grad_norm": 0.3277401924133301, "learning_rate": 0.000198008588482172, "loss": 0.23770709335803986, "mean_token_accuracy": 0.9039840698242188, "num_tokens": 15605040.0, "step": 1265 }, { "entropy": 1.5213152170181274, "epoch": 0.6666666666666666, "grad_norm": 0.31430521607398987, "learning_rate": 0.00019800399850604129, "loss": 0.23058706521987915, "mean_token_accuracy": 0.9074577987194061, "num_tokens": 15617376.0, "step": 1266 }, { "entropy": 1.4705300331115723, "epoch": 0.6671932596103213, "grad_norm": 0.3256817162036896, "learning_rate": 0.0001979994033056261, "loss": 0.25320321321487427, "mean_token_accuracy": 0.9007576107978821, "num_tokens": 15629712.0, "step": 1267 }, { "entropy": 1.530697613954544, "epoch": 0.6677198525539758, "grad_norm": 0.30975228548049927, "learning_rate": 0.00019799480288119927, "loss": 0.23081722855567932, "mean_token_accuracy": 0.9080140292644501, "num_tokens": 15642048.0, "step": 1268 }, { "entropy": 1.495768964290619, "epoch": 0.6682464454976303, "grad_norm": 0.29344475269317627, "learning_rate": 0.00019799019723303388, "loss": 0.2015610784292221, "mean_token_accuracy": 0.9178611040115356, "num_tokens": 15654384.0, "step": 1269 }, { "entropy": 1.5803856551647186, "epoch": 0.6687730384412849, "grad_norm": 0.3023964464664459, "learning_rate": 0.00019798558636140333, "loss": 0.2174011915922165, "mean_token_accuracy": 0.9140703827142715, "num_tokens": 15666720.0, "step": 1270 }, { "entropy": 1.4897505939006805, "epoch": 0.6692996313849394, "grad_norm": 0.2858726978302002, "learning_rate": 0.0001979809702665813, "loss": 0.20024171471595764, "mean_token_accuracy": 0.9191962629556656, "num_tokens": 15679056.0, "step": 1271 }, { "entropy": 1.5215353667736053, "epoch": 0.669826224328594, "grad_norm": 0.27068790793418884, "learning_rate": 0.00019797634894884184, "loss": 0.21988946199417114, "mean_token_accuracy": 0.9098561853170395, "num_tokens": 15691392.0, "step": 1272 }, { "entropy": 1.5361709892749786, "epoch": 0.6703528172722486, "grad_norm": 0.3324735164642334, "learning_rate": 0.00019797172240845935, "loss": 0.2674825191497803, "mean_token_accuracy": 0.8955648243427277, "num_tokens": 15703728.0, "step": 1273 }, { "entropy": 1.5240019261837006, "epoch": 0.6708794102159031, "grad_norm": 0.3050387501716614, "learning_rate": 0.00019796709064570842, "loss": 0.22774918377399445, "mean_token_accuracy": 0.9072832018136978, "num_tokens": 15716064.0, "step": 1274 }, { "entropy": 1.4996045529842377, "epoch": 0.6714060031595577, "grad_norm": 0.2832599878311157, "learning_rate": 0.00019796245366086404, "loss": 0.21256539225578308, "mean_token_accuracy": 0.9113875329494476, "num_tokens": 15728400.0, "step": 1275 }, { "entropy": 1.537344366312027, "epoch": 0.6719325961032122, "grad_norm": 0.28976351022720337, "learning_rate": 0.00019795781145420148, "loss": 0.2061801552772522, "mean_token_accuracy": 0.9169371575117111, "num_tokens": 15740736.0, "step": 1276 }, { "entropy": 1.5299006402492523, "epoch": 0.6724591890468667, "grad_norm": 0.2772320806980133, "learning_rate": 0.0001979531640259963, "loss": 0.20862804353237152, "mean_token_accuracy": 0.9104678928852081, "num_tokens": 15753072.0, "step": 1277 }, { "entropy": 1.5044286847114563, "epoch": 0.6729857819905213, "grad_norm": 0.3096766769886017, "learning_rate": 0.0001979485113765244, "loss": 0.23148494958877563, "mean_token_accuracy": 0.9055089354515076, "num_tokens": 15765408.0, "step": 1278 }, { "entropy": 1.492220789194107, "epoch": 0.6735123749341759, "grad_norm": 0.2892164885997772, "learning_rate": 0.00019794385350606198, "loss": 0.2099100798368454, "mean_token_accuracy": 0.9140574485063553, "num_tokens": 15777744.0, "step": 1279 }, { "entropy": 1.5607218742370605, "epoch": 0.6740389678778305, "grad_norm": 0.3277181088924408, "learning_rate": 0.00019793919041488555, "loss": 0.22673308849334717, "mean_token_accuracy": 0.9092708230018616, "num_tokens": 15790080.0, "step": 1280 }, { "entropy": 1.5162492990493774, "epoch": 0.674565560821485, "grad_norm": 0.3172418475151062, "learning_rate": 0.00019793452210327194, "loss": 0.23533746600151062, "mean_token_accuracy": 0.9022314250469208, "num_tokens": 15802416.0, "step": 1281 }, { "entropy": 1.4783676862716675, "epoch": 0.6750921537651395, "grad_norm": 0.2982933521270752, "learning_rate": 0.00019792984857149826, "loss": 0.21463748812675476, "mean_token_accuracy": 0.9117985665798187, "num_tokens": 15814752.0, "step": 1282 }, { "entropy": 1.5162720084190369, "epoch": 0.6756187467087941, "grad_norm": 0.2976648211479187, "learning_rate": 0.000197925169819842, "loss": 0.21266265213489532, "mean_token_accuracy": 0.9171696603298187, "num_tokens": 15827088.0, "step": 1283 }, { "entropy": 1.5761696994304657, "epoch": 0.6761453396524486, "grad_norm": 0.32240986824035645, "learning_rate": 0.00019792048584858082, "loss": 0.22523874044418335, "mean_token_accuracy": 0.9125792235136032, "num_tokens": 15839424.0, "step": 1284 }, { "entropy": 1.4458520412445068, "epoch": 0.6766719325961033, "grad_norm": 0.2936963140964508, "learning_rate": 0.00019791579665799286, "loss": 0.20535065233707428, "mean_token_accuracy": 0.9165598750114441, "num_tokens": 15851760.0, "step": 1285 }, { "entropy": 1.4983311593532562, "epoch": 0.6771985255397578, "grad_norm": 0.34449514746665955, "learning_rate": 0.0001979111022483565, "loss": 0.21712952852249146, "mean_token_accuracy": 0.9153823703527451, "num_tokens": 15864096.0, "step": 1286 }, { "entropy": 1.562139093875885, "epoch": 0.6777251184834123, "grad_norm": 0.31743091344833374, "learning_rate": 0.00019790640261995034, "loss": 0.219345360994339, "mean_token_accuracy": 0.9084994047880173, "num_tokens": 15876432.0, "step": 1287 }, { "entropy": 1.5375787019729614, "epoch": 0.6782517114270669, "grad_norm": 0.27115342020988464, "learning_rate": 0.00019790169777305345, "loss": 0.19260238111019135, "mean_token_accuracy": 0.9227229058742523, "num_tokens": 15888768.0, "step": 1288 }, { "entropy": 1.4687424898147583, "epoch": 0.6787783043707214, "grad_norm": 0.302287220954895, "learning_rate": 0.00019789698770794506, "loss": 0.24450846016407013, "mean_token_accuracy": 0.9040905237197876, "num_tokens": 15901104.0, "step": 1289 }, { "entropy": 1.5125727355480194, "epoch": 0.6793048973143759, "grad_norm": 0.3316330313682556, "learning_rate": 0.00019789227242490481, "loss": 0.23443403840065002, "mean_token_accuracy": 0.9077270179986954, "num_tokens": 15913440.0, "step": 1290 }, { "entropy": 1.457822471857071, "epoch": 0.6798314902580306, "grad_norm": 0.3082807958126068, "learning_rate": 0.00019788755192421266, "loss": 0.2276977300643921, "mean_token_accuracy": 0.907697319984436, "num_tokens": 15925776.0, "step": 1291 }, { "entropy": 1.5687705874443054, "epoch": 0.6803580832016851, "grad_norm": 0.3347495198249817, "learning_rate": 0.00019788282620614877, "loss": 0.23658336699008942, "mean_token_accuracy": 0.9071597903966904, "num_tokens": 15938112.0, "step": 1292 }, { "entropy": 1.4747570753097534, "epoch": 0.6808846761453397, "grad_norm": 0.31832975149154663, "learning_rate": 0.0001978780952709937, "loss": 0.19530466198921204, "mean_token_accuracy": 0.9262362122535706, "num_tokens": 15950448.0, "step": 1293 }, { "entropy": 1.5592786967754364, "epoch": 0.6814112690889942, "grad_norm": 0.29860836267471313, "learning_rate": 0.00019787335911902835, "loss": 0.21259617805480957, "mean_token_accuracy": 0.9156482219696045, "num_tokens": 15962784.0, "step": 1294 }, { "entropy": 1.590408980846405, "epoch": 0.6819378620326487, "grad_norm": 0.33426377177238464, "learning_rate": 0.0001978686177505338, "loss": 0.250851035118103, "mean_token_accuracy": 0.9034130126237869, "num_tokens": 15975120.0, "step": 1295 }, { "entropy": 1.520596295595169, "epoch": 0.6824644549763034, "grad_norm": 0.31754234433174133, "learning_rate": 0.00019786387116579155, "loss": 0.23741202056407928, "mean_token_accuracy": 0.9074528068304062, "num_tokens": 15987456.0, "step": 1296 }, { "entropy": 1.589228630065918, "epoch": 0.6829910479199579, "grad_norm": 0.334957480430603, "learning_rate": 0.0001978591193650834, "loss": 0.2431160807609558, "mean_token_accuracy": 0.9039677083492279, "num_tokens": 15999792.0, "step": 1297 }, { "entropy": 1.5251929759979248, "epoch": 0.6835176408636124, "grad_norm": 0.26925790309906006, "learning_rate": 0.00019785436234869138, "loss": 0.18518362939357758, "mean_token_accuracy": 0.9277700483798981, "num_tokens": 16012128.0, "step": 1298 }, { "entropy": 1.49588942527771, "epoch": 0.684044233807267, "grad_norm": 0.2995278835296631, "learning_rate": 0.00019784960011689793, "loss": 0.21347451210021973, "mean_token_accuracy": 0.9186176806688309, "num_tokens": 16024464.0, "step": 1299 }, { "entropy": 1.5090012848377228, "epoch": 0.6845708267509215, "grad_norm": 0.2900152802467346, "learning_rate": 0.00019784483266998575, "loss": 0.20770123600959778, "mean_token_accuracy": 0.9164092987775803, "num_tokens": 16036800.0, "step": 1300 }, { "entropy": 1.524385005235672, "epoch": 0.685097419694576, "grad_norm": 0.2801123857498169, "learning_rate": 0.00019784006000823787, "loss": 0.1997857242822647, "mean_token_accuracy": 0.9173883497714996, "num_tokens": 16049136.0, "step": 1301 }, { "entropy": 1.5324156284332275, "epoch": 0.6856240126382307, "grad_norm": 0.30303382873535156, "learning_rate": 0.0001978352821319376, "loss": 0.21537630259990692, "mean_token_accuracy": 0.9123150855302811, "num_tokens": 16061472.0, "step": 1302 }, { "entropy": 1.538516879081726, "epoch": 0.6861506055818852, "grad_norm": 0.2965938448905945, "learning_rate": 0.00019783049904136855, "loss": 0.20010440051555634, "mean_token_accuracy": 0.9172840118408203, "num_tokens": 16073808.0, "step": 1303 }, { "entropy": 1.4958137571811676, "epoch": 0.6866771985255398, "grad_norm": 0.29906049370765686, "learning_rate": 0.0001978257107368147, "loss": 0.20351183414459229, "mean_token_accuracy": 0.921799048781395, "num_tokens": 16086144.0, "step": 1304 }, { "entropy": 1.4531968832015991, "epoch": 0.6872037914691943, "grad_norm": 0.31886446475982666, "learning_rate": 0.0001978209172185603, "loss": 0.21320727467536926, "mean_token_accuracy": 0.9105631560087204, "num_tokens": 16098480.0, "step": 1305 }, { "entropy": 1.3787581324577332, "epoch": 0.6877303844128488, "grad_norm": 0.2898115813732147, "learning_rate": 0.0001978161184868899, "loss": 0.2124798595905304, "mean_token_accuracy": 0.9114013463258743, "num_tokens": 16110816.0, "step": 1306 }, { "entropy": 1.4378518164157867, "epoch": 0.6882569773565034, "grad_norm": 0.31470921635627747, "learning_rate": 0.00019781131454208833, "loss": 0.19701991975307465, "mean_token_accuracy": 0.9186731576919556, "num_tokens": 16123152.0, "step": 1307 }, { "entropy": 1.4289041459560394, "epoch": 0.688783570300158, "grad_norm": 0.3303619921207428, "learning_rate": 0.0001978065053844409, "loss": 0.23253998160362244, "mean_token_accuracy": 0.9104226678609848, "num_tokens": 16135488.0, "step": 1308 }, { "entropy": 1.458989679813385, "epoch": 0.6893101632438126, "grad_norm": 0.30710119009017944, "learning_rate": 0.00019780169101423295, "loss": 0.2202616184949875, "mean_token_accuracy": 0.9115623980760574, "num_tokens": 16147824.0, "step": 1309 }, { "entropy": 1.5141521096229553, "epoch": 0.6898367561874671, "grad_norm": 0.3152952194213867, "learning_rate": 0.0001977968714317504, "loss": 0.19381463527679443, "mean_token_accuracy": 0.9204765856266022, "num_tokens": 16160160.0, "step": 1310 }, { "entropy": 1.4804642498493195, "epoch": 0.6903633491311216, "grad_norm": 0.3526984751224518, "learning_rate": 0.0001977920466372793, "loss": 0.22401507198810577, "mean_token_accuracy": 0.9142041653394699, "num_tokens": 16172496.0, "step": 1311 }, { "entropy": 1.4126333594322205, "epoch": 0.6908899420747762, "grad_norm": 0.2999390661716461, "learning_rate": 0.00019778721663110603, "loss": 0.212639719247818, "mean_token_accuracy": 0.9140689373016357, "num_tokens": 16184832.0, "step": 1312 }, { "entropy": 1.4407996237277985, "epoch": 0.6914165350184307, "grad_norm": 0.3175979554653168, "learning_rate": 0.00019778238141351744, "loss": 0.23567378520965576, "mean_token_accuracy": 0.9058562517166138, "num_tokens": 16197168.0, "step": 1313 }, { "entropy": 1.4304053783416748, "epoch": 0.6919431279620853, "grad_norm": 0.32357415556907654, "learning_rate": 0.00019777754098480047, "loss": 0.23323741555213928, "mean_token_accuracy": 0.9068403393030167, "num_tokens": 16209504.0, "step": 1314 }, { "entropy": 1.4463219940662384, "epoch": 0.6924697209057399, "grad_norm": 0.32085898518562317, "learning_rate": 0.0001977726953452425, "loss": 0.25303539633750916, "mean_token_accuracy": 0.9010388404130936, "num_tokens": 16221840.0, "step": 1315 }, { "entropy": 1.5001619458198547, "epoch": 0.6929963138493944, "grad_norm": 0.30218154191970825, "learning_rate": 0.0001977678444951312, "loss": 0.20458348095417023, "mean_token_accuracy": 0.9198221117258072, "num_tokens": 16234176.0, "step": 1316 }, { "entropy": 1.4169287383556366, "epoch": 0.693522906793049, "grad_norm": 0.2987150549888611, "learning_rate": 0.0001977629884347545, "loss": 0.20915895700454712, "mean_token_accuracy": 0.914911612868309, "num_tokens": 16246512.0, "step": 1317 }, { "entropy": 1.4708910584449768, "epoch": 0.6940494997367035, "grad_norm": 0.2975226938724518, "learning_rate": 0.00019775812716440073, "loss": 0.21582108736038208, "mean_token_accuracy": 0.916588231921196, "num_tokens": 16258848.0, "step": 1318 }, { "entropy": 1.395564466714859, "epoch": 0.6945760926803581, "grad_norm": 0.26800790429115295, "learning_rate": 0.00019775326068435843, "loss": 0.19701655209064484, "mean_token_accuracy": 0.9204675257205963, "num_tokens": 16271184.0, "step": 1319 }, { "entropy": 1.4954661428928375, "epoch": 0.6951026856240127, "grad_norm": 0.3218332529067993, "learning_rate": 0.00019774838899491647, "loss": 0.20654654502868652, "mean_token_accuracy": 0.9205126464366913, "num_tokens": 16283520.0, "step": 1320 }, { "entropy": 1.475353330373764, "epoch": 0.6956292785676672, "grad_norm": 0.29199621081352234, "learning_rate": 0.00019774351209636413, "loss": 0.22376279532909393, "mean_token_accuracy": 0.9100230783224106, "num_tokens": 16295856.0, "step": 1321 }, { "entropy": 1.5148694515228271, "epoch": 0.6961558715113217, "grad_norm": 0.30520734190940857, "learning_rate": 0.00019773862998899086, "loss": 0.2176750898361206, "mean_token_accuracy": 0.9201380461454391, "num_tokens": 16308192.0, "step": 1322 }, { "entropy": 1.5539270341396332, "epoch": 0.6966824644549763, "grad_norm": 0.32190483808517456, "learning_rate": 0.00019773374267308653, "loss": 0.2056635320186615, "mean_token_accuracy": 0.914083868265152, "num_tokens": 16320528.0, "step": 1323 }, { "entropy": 1.4479952156543732, "epoch": 0.6972090573986308, "grad_norm": 0.3086356222629547, "learning_rate": 0.00019772885014894125, "loss": 0.19541175663471222, "mean_token_accuracy": 0.9208300113677979, "num_tokens": 16332864.0, "step": 1324 }, { "entropy": 1.4255986511707306, "epoch": 0.6977356503422855, "grad_norm": 0.29759716987609863, "learning_rate": 0.00019772395241684547, "loss": 0.22268646955490112, "mean_token_accuracy": 0.9130487442016602, "num_tokens": 16345200.0, "step": 1325 }, { "entropy": 1.417414665222168, "epoch": 0.69826224328594, "grad_norm": 0.30235084891319275, "learning_rate": 0.00019771904947708991, "loss": 0.19872839748859406, "mean_token_accuracy": 0.9202670305967331, "num_tokens": 16357536.0, "step": 1326 }, { "entropy": 1.462871015071869, "epoch": 0.6987888362295945, "grad_norm": 0.330930233001709, "learning_rate": 0.00019771414132996565, "loss": 0.21214503049850464, "mean_token_accuracy": 0.9157495498657227, "num_tokens": 16369872.0, "step": 1327 }, { "entropy": 1.4870843291282654, "epoch": 0.6993154291732491, "grad_norm": 0.33824852108955383, "learning_rate": 0.00019770922797576407, "loss": 0.23521599173545837, "mean_token_accuracy": 0.9104333966970444, "num_tokens": 16382208.0, "step": 1328 }, { "entropy": 1.4692321121692657, "epoch": 0.6998420221169036, "grad_norm": 0.2853015959262848, "learning_rate": 0.0001977043094147768, "loss": 0.21163907647132874, "mean_token_accuracy": 0.9183786511421204, "num_tokens": 16394544.0, "step": 1329 }, { "entropy": 1.4160318076610565, "epoch": 0.7003686150605581, "grad_norm": 0.3194182217121124, "learning_rate": 0.00019769938564729585, "loss": 0.22332850098609924, "mean_token_accuracy": 0.9086870551109314, "num_tokens": 16406880.0, "step": 1330 }, { "entropy": 1.5249937772750854, "epoch": 0.7008952080042128, "grad_norm": 0.2979271709918976, "learning_rate": 0.00019769445667361358, "loss": 0.20148411393165588, "mean_token_accuracy": 0.919349730014801, "num_tokens": 16419216.0, "step": 1331 }, { "entropy": 1.475309818983078, "epoch": 0.7014218009478673, "grad_norm": 0.31436359882354736, "learning_rate": 0.00019768952249402252, "loss": 0.2226470410823822, "mean_token_accuracy": 0.9143447577953339, "num_tokens": 16431552.0, "step": 1332 }, { "entropy": 1.45591801404953, "epoch": 0.7019483938915219, "grad_norm": 0.3134812116622925, "learning_rate": 0.00019768458310881557, "loss": 0.239861398935318, "mean_token_accuracy": 0.9030255079269409, "num_tokens": 16443888.0, "step": 1333 }, { "entropy": 1.4746840596199036, "epoch": 0.7024749868351764, "grad_norm": 0.2945224642753601, "learning_rate": 0.00019767963851828604, "loss": 0.2150000035762787, "mean_token_accuracy": 0.9179409146308899, "num_tokens": 16456224.0, "step": 1334 }, { "entropy": 1.4820148646831512, "epoch": 0.7030015797788309, "grad_norm": 0.30797162652015686, "learning_rate": 0.00019767468872272737, "loss": 0.22350315749645233, "mean_token_accuracy": 0.9135662913322449, "num_tokens": 16468560.0, "step": 1335 }, { "entropy": 1.5698617100715637, "epoch": 0.7035281727224855, "grad_norm": 0.3179170489311218, "learning_rate": 0.00019766973372243343, "loss": 0.20203739404678345, "mean_token_accuracy": 0.9202521592378616, "num_tokens": 16480896.0, "step": 1336 }, { "entropy": 1.5165068209171295, "epoch": 0.7040547656661401, "grad_norm": 0.282023549079895, "learning_rate": 0.0001976647735176984, "loss": 0.2072068601846695, "mean_token_accuracy": 0.9170822501182556, "num_tokens": 16493232.0, "step": 1337 }, { "entropy": 1.5599988996982574, "epoch": 0.7045813586097947, "grad_norm": 0.32171323895454407, "learning_rate": 0.0001976598081088167, "loss": 0.2177916020154953, "mean_token_accuracy": 0.9149684607982635, "num_tokens": 16505568.0, "step": 1338 }, { "entropy": 1.566039115190506, "epoch": 0.7051079515534492, "grad_norm": 0.2976767420768738, "learning_rate": 0.00019765483749608313, "loss": 0.20423297584056854, "mean_token_accuracy": 0.9218804687261581, "num_tokens": 16517904.0, "step": 1339 }, { "entropy": 1.5926516354084015, "epoch": 0.7056345444971037, "grad_norm": 0.3847099244594574, "learning_rate": 0.00019764986167979275, "loss": 0.22431136667728424, "mean_token_accuracy": 0.9091393053531647, "num_tokens": 16530240.0, "step": 1340 }, { "entropy": 1.5083985030651093, "epoch": 0.7061611374407583, "grad_norm": 0.3162590563297272, "learning_rate": 0.0001976448806602409, "loss": 0.2287883162498474, "mean_token_accuracy": 0.9064637273550034, "num_tokens": 16542576.0, "step": 1341 }, { "entropy": 1.4989595413208008, "epoch": 0.7066877303844129, "grad_norm": 0.3000263571739197, "learning_rate": 0.00019763989443772337, "loss": 0.21327601373195648, "mean_token_accuracy": 0.9155562520027161, "num_tokens": 16554912.0, "step": 1342 }, { "entropy": 1.5128290951251984, "epoch": 0.7072143233280674, "grad_norm": 0.2836988568305969, "learning_rate": 0.00019763490301253608, "loss": 0.19906045496463776, "mean_token_accuracy": 0.9238555133342743, "num_tokens": 16567248.0, "step": 1343 }, { "entropy": 1.5032199919223785, "epoch": 0.707740916271722, "grad_norm": 0.2904132306575775, "learning_rate": 0.0001976299063849754, "loss": 0.21531090140342712, "mean_token_accuracy": 0.9095672369003296, "num_tokens": 16579584.0, "step": 1344 }, { "entropy": 1.587888479232788, "epoch": 0.7082675092153765, "grad_norm": 0.3187963664531708, "learning_rate": 0.00019762490455533792, "loss": 0.21344661712646484, "mean_token_accuracy": 0.9137663394212723, "num_tokens": 16591920.0, "step": 1345 }, { "entropy": 1.5427050590515137, "epoch": 0.708794102159031, "grad_norm": 0.2940306067466736, "learning_rate": 0.00019761989752392053, "loss": 0.1942479908466339, "mean_token_accuracy": 0.9190978854894638, "num_tokens": 16604256.0, "step": 1346 }, { "entropy": 1.5427431166172028, "epoch": 0.7093206951026856, "grad_norm": 0.3436744809150696, "learning_rate": 0.00019761488529102057, "loss": 0.2245483100414276, "mean_token_accuracy": 0.909973606467247, "num_tokens": 16616592.0, "step": 1347 }, { "entropy": 1.4897418022155762, "epoch": 0.7098472880463402, "grad_norm": 0.34564313292503357, "learning_rate": 0.0001976098678569355, "loss": 0.23059901595115662, "mean_token_accuracy": 0.9069952964782715, "num_tokens": 16628928.0, "step": 1348 }, { "entropy": 1.5078385174274445, "epoch": 0.7103738809899948, "grad_norm": 0.32199203968048096, "learning_rate": 0.0001976048452219632, "loss": 0.22921977937221527, "mean_token_accuracy": 0.9082883149385452, "num_tokens": 16641264.0, "step": 1349 }, { "entropy": 1.5083224773406982, "epoch": 0.7109004739336493, "grad_norm": 0.3183170258998871, "learning_rate": 0.00019759981738640185, "loss": 0.22415608167648315, "mean_token_accuracy": 0.9100949168205261, "num_tokens": 16653600.0, "step": 1350 }, { "entropy": 1.5398178398609161, "epoch": 0.7114270668773038, "grad_norm": 0.30399900674819946, "learning_rate": 0.0001975947843505499, "loss": 0.22306974232196808, "mean_token_accuracy": 0.9138671904802322, "num_tokens": 16665936.0, "step": 1351 }, { "entropy": 1.535412222146988, "epoch": 0.7119536598209584, "grad_norm": 0.2907712757587433, "learning_rate": 0.00019758974611470615, "loss": 0.2197205275297165, "mean_token_accuracy": 0.9130839556455612, "num_tokens": 16678272.0, "step": 1352 }, { "entropy": 1.4855974614620209, "epoch": 0.7124802527646129, "grad_norm": 0.28864648938179016, "learning_rate": 0.0001975847026791697, "loss": 0.21561571955680847, "mean_token_accuracy": 0.9168848842382431, "num_tokens": 16690608.0, "step": 1353 }, { "entropy": 1.453218251466751, "epoch": 0.7130068457082676, "grad_norm": 0.3135017454624176, "learning_rate": 0.00019757965404423994, "loss": 0.2011297047138214, "mean_token_accuracy": 0.9190320074558258, "num_tokens": 16702944.0, "step": 1354 }, { "entropy": 1.4790661036968231, "epoch": 0.7135334386519221, "grad_norm": 0.3001917004585266, "learning_rate": 0.00019757460021021655, "loss": 0.23639211058616638, "mean_token_accuracy": 0.9105001240968704, "num_tokens": 16715280.0, "step": 1355 }, { "entropy": 1.496882289648056, "epoch": 0.7140600315955766, "grad_norm": 0.31785574555397034, "learning_rate": 0.00019756954117739956, "loss": 0.2306048721075058, "mean_token_accuracy": 0.9150114953517914, "num_tokens": 16727616.0, "step": 1356 }, { "entropy": 1.4668599963188171, "epoch": 0.7145866245392312, "grad_norm": 0.29470139741897583, "learning_rate": 0.00019756447694608932, "loss": 0.21168065071105957, "mean_token_accuracy": 0.9137952625751495, "num_tokens": 16739952.0, "step": 1357 }, { "entropy": 1.422877013683319, "epoch": 0.7151132174828857, "grad_norm": 0.27277153730392456, "learning_rate": 0.00019755940751658643, "loss": 0.20774061977863312, "mean_token_accuracy": 0.9166775196790695, "num_tokens": 16752288.0, "step": 1358 }, { "entropy": 1.4244271516799927, "epoch": 0.7156398104265402, "grad_norm": 0.31778132915496826, "learning_rate": 0.00019755433288919187, "loss": 0.231976717710495, "mean_token_accuracy": 0.9075390994548798, "num_tokens": 16764624.0, "step": 1359 }, { "entropy": 1.4513772428035736, "epoch": 0.7161664033701949, "grad_norm": 0.30516210198402405, "learning_rate": 0.0001975492530642069, "loss": 0.20754879713058472, "mean_token_accuracy": 0.9216670095920563, "num_tokens": 16776960.0, "step": 1360 }, { "entropy": 1.4767080545425415, "epoch": 0.7166929963138494, "grad_norm": 0.3156355917453766, "learning_rate": 0.00019754416804193298, "loss": 0.20898932218551636, "mean_token_accuracy": 0.9173450469970703, "num_tokens": 16789296.0, "step": 1361 }, { "entropy": 1.4257088005542755, "epoch": 0.717219589257504, "grad_norm": 0.33443206548690796, "learning_rate": 0.0001975390778226721, "loss": 0.237446129322052, "mean_token_accuracy": 0.9077172726392746, "num_tokens": 16801632.0, "step": 1362 }, { "entropy": 1.393272042274475, "epoch": 0.7177461822011585, "grad_norm": 0.30247074365615845, "learning_rate": 0.00019753398240672637, "loss": 0.21317076683044434, "mean_token_accuracy": 0.9131140112876892, "num_tokens": 16813968.0, "step": 1363 }, { "entropy": 1.431013286113739, "epoch": 0.718272775144813, "grad_norm": 0.29114142060279846, "learning_rate": 0.0001975288817943983, "loss": 0.19287830591201782, "mean_token_accuracy": 0.9247073382139206, "num_tokens": 16826304.0, "step": 1364 }, { "entropy": 1.3813497424125671, "epoch": 0.7187993680884676, "grad_norm": 0.2997731566429138, "learning_rate": 0.00019752377598599067, "loss": 0.2021138221025467, "mean_token_accuracy": 0.9203190356492996, "num_tokens": 16838640.0, "step": 1365 }, { "entropy": 1.4252038598060608, "epoch": 0.7193259610321222, "grad_norm": 0.3252887725830078, "learning_rate": 0.0001975186649818066, "loss": 0.20873992145061493, "mean_token_accuracy": 0.912327915430069, "num_tokens": 16850976.0, "step": 1366 }, { "entropy": 1.4511545896530151, "epoch": 0.7198525539757767, "grad_norm": 0.34324178099632263, "learning_rate": 0.00019751354878214946, "loss": 0.21222266554832458, "mean_token_accuracy": 0.9157299846410751, "num_tokens": 16863312.0, "step": 1367 }, { "entropy": 1.3630057871341705, "epoch": 0.7203791469194313, "grad_norm": 0.37623706459999084, "learning_rate": 0.00019750842738732304, "loss": 0.2201295793056488, "mean_token_accuracy": 0.9165831059217453, "num_tokens": 16875648.0, "step": 1368 }, { "entropy": 1.3505005836486816, "epoch": 0.7209057398630858, "grad_norm": 0.30142372846603394, "learning_rate": 0.0001975033007976313, "loss": 0.22212043404579163, "mean_token_accuracy": 0.9122855514287949, "num_tokens": 16887984.0, "step": 1369 }, { "entropy": 1.4169504642486572, "epoch": 0.7214323328067404, "grad_norm": 0.3326164782047272, "learning_rate": 0.0001974981690133786, "loss": 0.22192654013633728, "mean_token_accuracy": 0.9108520150184631, "num_tokens": 16900320.0, "step": 1370 }, { "entropy": 1.367185264825821, "epoch": 0.721958925750395, "grad_norm": 0.33256617188453674, "learning_rate": 0.00019749303203486958, "loss": 0.24168333411216736, "mean_token_accuracy": 0.9047919362783432, "num_tokens": 16912656.0, "step": 1371 }, { "entropy": 1.3614123463630676, "epoch": 0.7224855186940495, "grad_norm": 0.3197641670703888, "learning_rate": 0.00019748788986240917, "loss": 0.23665747046470642, "mean_token_accuracy": 0.9026706665754318, "num_tokens": 16924992.0, "step": 1372 }, { "entropy": 1.3906526267528534, "epoch": 0.7230121116377041, "grad_norm": 0.29753339290618896, "learning_rate": 0.00019748274249630269, "loss": 0.19765980541706085, "mean_token_accuracy": 0.9235783219337463, "num_tokens": 16937328.0, "step": 1373 }, { "entropy": 1.3462652564048767, "epoch": 0.7235387045813586, "grad_norm": 0.2804873585700989, "learning_rate": 0.00019747758993685568, "loss": 0.22064946591854095, "mean_token_accuracy": 0.9110289812088013, "num_tokens": 16949664.0, "step": 1374 }, { "entropy": 1.4082630276679993, "epoch": 0.7240652975250131, "grad_norm": 0.3095674216747284, "learning_rate": 0.000197472432184374, "loss": 0.20987483859062195, "mean_token_accuracy": 0.9188564568758011, "num_tokens": 16962000.0, "step": 1375 }, { "entropy": 1.304635614156723, "epoch": 0.7245918904686677, "grad_norm": 0.2778051197528839, "learning_rate": 0.00019746726923916387, "loss": 0.21651524305343628, "mean_token_accuracy": 0.9125857651233673, "num_tokens": 16974336.0, "step": 1376 }, { "entropy": 1.3015822768211365, "epoch": 0.7251184834123223, "grad_norm": 0.2806200683116913, "learning_rate": 0.00019746210110153172, "loss": 0.22142334282398224, "mean_token_accuracy": 0.911768451333046, "num_tokens": 16986672.0, "step": 1377 }, { "entropy": 1.3526243567466736, "epoch": 0.7256450763559769, "grad_norm": 0.3183799684047699, "learning_rate": 0.0001974569277717844, "loss": 0.2256852686405182, "mean_token_accuracy": 0.9073309451341629, "num_tokens": 16999008.0, "step": 1378 }, { "entropy": 1.3906278908252716, "epoch": 0.7261716692996314, "grad_norm": 0.2876151204109192, "learning_rate": 0.00019745174925022904, "loss": 0.2028118073940277, "mean_token_accuracy": 0.923457607626915, "num_tokens": 17011344.0, "step": 1379 }, { "entropy": 1.350665271282196, "epoch": 0.7266982622432859, "grad_norm": 0.33748704195022583, "learning_rate": 0.00019744656553717305, "loss": 0.2175031304359436, "mean_token_accuracy": 0.9140133857727051, "num_tokens": 17023680.0, "step": 1380 }, { "entropy": 1.3705949485301971, "epoch": 0.7272248551869405, "grad_norm": 0.3174329400062561, "learning_rate": 0.00019744137663292412, "loss": 0.20505183935165405, "mean_token_accuracy": 0.916661724448204, "num_tokens": 17036016.0, "step": 1381 }, { "entropy": 1.3908927738666534, "epoch": 0.727751448130595, "grad_norm": 0.31065794825553894, "learning_rate": 0.00019743618253779033, "loss": 0.23529362678527832, "mean_token_accuracy": 0.910541832447052, "num_tokens": 17048352.0, "step": 1382 }, { "entropy": 1.3258641958236694, "epoch": 0.7282780410742496, "grad_norm": 0.26997655630111694, "learning_rate": 0.00019743098325207995, "loss": 0.18447992205619812, "mean_token_accuracy": 0.9224408715963364, "num_tokens": 17060688.0, "step": 1383 }, { "entropy": 1.3685748875141144, "epoch": 0.7288046340179042, "grad_norm": 0.3111379146575928, "learning_rate": 0.00019742577877610173, "loss": 0.22453925013542175, "mean_token_accuracy": 0.9133676290512085, "num_tokens": 17073024.0, "step": 1384 }, { "entropy": 1.42083340883255, "epoch": 0.7293312269615587, "grad_norm": 0.331272691488266, "learning_rate": 0.00019742056911016456, "loss": 0.23528197407722473, "mean_token_accuracy": 0.9075358361005783, "num_tokens": 17085360.0, "step": 1385 }, { "entropy": 1.4835380911827087, "epoch": 0.7298578199052133, "grad_norm": 0.30057939887046814, "learning_rate": 0.0001974153542545777, "loss": 0.19702467322349548, "mean_token_accuracy": 0.9221197068691254, "num_tokens": 17097696.0, "step": 1386 }, { "entropy": 1.412318229675293, "epoch": 0.7303844128488678, "grad_norm": 0.314919650554657, "learning_rate": 0.00019741013420965077, "loss": 0.22496280074119568, "mean_token_accuracy": 0.9107683897018433, "num_tokens": 17110032.0, "step": 1387 }, { "entropy": 1.5203742980957031, "epoch": 0.7309110057925223, "grad_norm": 0.4578418433666229, "learning_rate": 0.00019740490897569366, "loss": 0.22902803122997284, "mean_token_accuracy": 0.9130762368440628, "num_tokens": 17122368.0, "step": 1388 }, { "entropy": 1.496030032634735, "epoch": 0.731437598736177, "grad_norm": 0.29055219888687134, "learning_rate": 0.00019739967855301652, "loss": 0.21085382997989655, "mean_token_accuracy": 0.9122315496206284, "num_tokens": 17134704.0, "step": 1389 }, { "entropy": 1.4665674567222595, "epoch": 0.7319641916798315, "grad_norm": 0.2788514494895935, "learning_rate": 0.0001973944429419299, "loss": 0.20301197469234467, "mean_token_accuracy": 0.9215195178985596, "num_tokens": 17147040.0, "step": 1390 }, { "entropy": 1.5158916115760803, "epoch": 0.732490784623486, "grad_norm": 0.3139953315258026, "learning_rate": 0.00019738920214274454, "loss": 0.20764051377773285, "mean_token_accuracy": 0.915527880191803, "num_tokens": 17159376.0, "step": 1391 }, { "entropy": 1.5249950289726257, "epoch": 0.7330173775671406, "grad_norm": 0.30590322613716125, "learning_rate": 0.00019738395615577161, "loss": 0.22601057589054108, "mean_token_accuracy": 0.9111659973859787, "num_tokens": 17171712.0, "step": 1392 }, { "entropy": 1.468850463628769, "epoch": 0.7335439705107951, "grad_norm": 0.311515212059021, "learning_rate": 0.00019737870498132248, "loss": 0.2210465669631958, "mean_token_accuracy": 0.9097635447978973, "num_tokens": 17184048.0, "step": 1393 }, { "entropy": 1.5013999938964844, "epoch": 0.7340705634544498, "grad_norm": 0.3101951479911804, "learning_rate": 0.00019737344861970896, "loss": 0.21400384604930878, "mean_token_accuracy": 0.9109934121370316, "num_tokens": 17196384.0, "step": 1394 }, { "entropy": 1.4603233933448792, "epoch": 0.7345971563981043, "grad_norm": 0.26839688420295715, "learning_rate": 0.00019736818707124303, "loss": 0.1959075927734375, "mean_token_accuracy": 0.9210042357444763, "num_tokens": 17208720.0, "step": 1395 }, { "entropy": 1.513748586177826, "epoch": 0.7351237493417588, "grad_norm": 0.3097459673881531, "learning_rate": 0.00019736292033623704, "loss": 0.2226242572069168, "mean_token_accuracy": 0.9143490940332413, "num_tokens": 17221056.0, "step": 1396 }, { "entropy": 1.4970153272151947, "epoch": 0.7356503422854134, "grad_norm": 0.3178339898586273, "learning_rate": 0.00019735764841500368, "loss": 0.22419294714927673, "mean_token_accuracy": 0.9115694165229797, "num_tokens": 17233392.0, "step": 1397 }, { "entropy": 1.4637455344200134, "epoch": 0.7361769352290679, "grad_norm": 0.3103068768978119, "learning_rate": 0.0001973523713078559, "loss": 0.2213975489139557, "mean_token_accuracy": 0.908700242638588, "num_tokens": 17245728.0, "step": 1398 }, { "entropy": 1.4048950970172882, "epoch": 0.7367035281727224, "grad_norm": 0.3316826820373535, "learning_rate": 0.00019734708901510695, "loss": 0.22181765735149384, "mean_token_accuracy": 0.9124202877283096, "num_tokens": 17258064.0, "step": 1399 }, { "entropy": 1.400584727525711, "epoch": 0.7372301211163771, "grad_norm": 0.30288171768188477, "learning_rate": 0.0001973418015370704, "loss": 0.23632709681987762, "mean_token_accuracy": 0.903136819601059, "num_tokens": 17270400.0, "step": 1400 }, { "entropy": 1.4175618290901184, "epoch": 0.7377567140600316, "grad_norm": 0.2811354696750641, "learning_rate": 0.00019733650887406018, "loss": 0.21318787336349487, "mean_token_accuracy": 0.9126076847314835, "num_tokens": 17282736.0, "step": 1401 }, { "entropy": 1.4151119589805603, "epoch": 0.7382833070036862, "grad_norm": 0.2701869010925293, "learning_rate": 0.00019733121102639048, "loss": 0.21690967679023743, "mean_token_accuracy": 0.9093466997146606, "num_tokens": 17295072.0, "step": 1402 }, { "entropy": 1.3918836414813995, "epoch": 0.7388098999473407, "grad_norm": 0.27023303508758545, "learning_rate": 0.00019732590799437577, "loss": 0.18338678777217865, "mean_token_accuracy": 0.9283169507980347, "num_tokens": 17307408.0, "step": 1403 }, { "entropy": 1.4320692718029022, "epoch": 0.7393364928909952, "grad_norm": 0.26482948660850525, "learning_rate": 0.00019732059977833088, "loss": 0.2143803983926773, "mean_token_accuracy": 0.9123003780841827, "num_tokens": 17319744.0, "step": 1404 }, { "entropy": 1.4552482962608337, "epoch": 0.7398630858346498, "grad_norm": 0.3084104359149933, "learning_rate": 0.00019731528637857094, "loss": 0.21455544233322144, "mean_token_accuracy": 0.9187665581703186, "num_tokens": 17332080.0, "step": 1405 }, { "entropy": 1.362955391407013, "epoch": 0.7403896787783044, "grad_norm": 0.2885385751724243, "learning_rate": 0.00019730996779541133, "loss": 0.2053847312927246, "mean_token_accuracy": 0.9195720255374908, "num_tokens": 17344416.0, "step": 1406 }, { "entropy": 1.3902620077133179, "epoch": 0.740916271721959, "grad_norm": 0.31122514605522156, "learning_rate": 0.0001973046440291678, "loss": 0.24145708978176117, "mean_token_accuracy": 0.9063299000263214, "num_tokens": 17356752.0, "step": 1407 }, { "entropy": 1.3320231139659882, "epoch": 0.7414428646656135, "grad_norm": 0.285426527261734, "learning_rate": 0.00019729931508015647, "loss": 0.202953040599823, "mean_token_accuracy": 0.9166394174098969, "num_tokens": 17369088.0, "step": 1408 }, { "entropy": 1.3167757391929626, "epoch": 0.741969457609268, "grad_norm": 0.3052743375301361, "learning_rate": 0.00019729398094869358, "loss": 0.23250755667686462, "mean_token_accuracy": 0.909424439072609, "num_tokens": 17381424.0, "step": 1409 }, { "entropy": 1.3000437319278717, "epoch": 0.7424960505529226, "grad_norm": 0.33441463112831116, "learning_rate": 0.00019728864163509583, "loss": 0.2160688042640686, "mean_token_accuracy": 0.9094254523515701, "num_tokens": 17393760.0, "step": 1410 }, { "entropy": 1.3271216750144958, "epoch": 0.7430226434965771, "grad_norm": 0.2913570702075958, "learning_rate": 0.00019728329713968016, "loss": 0.1972869336605072, "mean_token_accuracy": 0.9217556267976761, "num_tokens": 17406096.0, "step": 1411 }, { "entropy": 1.3546923398971558, "epoch": 0.7435492364402317, "grad_norm": 0.31364765763282776, "learning_rate": 0.00019727794746276391, "loss": 0.21945282816886902, "mean_token_accuracy": 0.9129824340343475, "num_tokens": 17418432.0, "step": 1412 }, { "entropy": 1.3115905821323395, "epoch": 0.7440758293838863, "grad_norm": 0.29262346029281616, "learning_rate": 0.00019727259260466458, "loss": 0.22911304235458374, "mean_token_accuracy": 0.9053215533494949, "num_tokens": 17430768.0, "step": 1413 }, { "entropy": 1.2379891574382782, "epoch": 0.7446024223275408, "grad_norm": 0.3259003162384033, "learning_rate": 0.0001972672325657001, "loss": 0.19887758791446686, "mean_token_accuracy": 0.9181624054908752, "num_tokens": 17443104.0, "step": 1414 }, { "entropy": 1.3647005259990692, "epoch": 0.7451290152711953, "grad_norm": 0.4454919695854187, "learning_rate": 0.00019726186734618867, "loss": 0.22842802107334137, "mean_token_accuracy": 0.9110278934240341, "num_tokens": 17455440.0, "step": 1415 }, { "entropy": 1.3383563160896301, "epoch": 0.7456556082148499, "grad_norm": 0.30020466446876526, "learning_rate": 0.00019725649694644876, "loss": 0.22231580317020416, "mean_token_accuracy": 0.9075456112623215, "num_tokens": 17467776.0, "step": 1416 }, { "entropy": 1.3714047372341156, "epoch": 0.7461822011585044, "grad_norm": 0.29304370284080505, "learning_rate": 0.0001972511213667992, "loss": 0.21095791459083557, "mean_token_accuracy": 0.9166263341903687, "num_tokens": 17480112.0, "step": 1417 }, { "entropy": 1.3512816727161407, "epoch": 0.7467087941021591, "grad_norm": 0.3256070613861084, "learning_rate": 0.0001972457406075591, "loss": 0.20153497159481049, "mean_token_accuracy": 0.9194765239953995, "num_tokens": 17492448.0, "step": 1418 }, { "entropy": 1.3885486125946045, "epoch": 0.7472353870458136, "grad_norm": 0.3231737017631531, "learning_rate": 0.00019724035466904788, "loss": 0.2227013111114502, "mean_token_accuracy": 0.9109441936016083, "num_tokens": 17504784.0, "step": 1419 }, { "entropy": 1.3755838871002197, "epoch": 0.7477619799894681, "grad_norm": 0.29787546396255493, "learning_rate": 0.0001972349635515853, "loss": 0.216201514005661, "mean_token_accuracy": 0.9155356884002686, "num_tokens": 17517120.0, "step": 1420 }, { "entropy": 1.437903732061386, "epoch": 0.7482885729331227, "grad_norm": 0.33993855118751526, "learning_rate": 0.00019722956725549138, "loss": 0.21523010730743408, "mean_token_accuracy": 0.9125061631202698, "num_tokens": 17529456.0, "step": 1421 }, { "entropy": 1.333466112613678, "epoch": 0.7488151658767772, "grad_norm": 0.33743515610694885, "learning_rate": 0.00019722416578108642, "loss": 0.22355730831623077, "mean_token_accuracy": 0.9136557281017303, "num_tokens": 17541792.0, "step": 1422 }, { "entropy": 1.360717535018921, "epoch": 0.7493417588204319, "grad_norm": 0.2994014024734497, "learning_rate": 0.00019721875912869118, "loss": 0.19619853794574738, "mean_token_accuracy": 0.9230263978242874, "num_tokens": 17554128.0, "step": 1423 }, { "entropy": 1.2954363822937012, "epoch": 0.7498683517640864, "grad_norm": 0.29989591240882874, "learning_rate": 0.0001972133472986265, "loss": 0.2181311547756195, "mean_token_accuracy": 0.9170015305280685, "num_tokens": 17566464.0, "step": 1424 }, { "entropy": 1.380856215953827, "epoch": 0.7503949447077409, "grad_norm": 0.28764021396636963, "learning_rate": 0.00019720793029121377, "loss": 0.21031011641025543, "mean_token_accuracy": 0.9177572429180145, "num_tokens": 17578800.0, "step": 1425 }, { "entropy": 1.3035545349121094, "epoch": 0.7509215376513955, "grad_norm": 0.2988784611225128, "learning_rate": 0.00019720250810677446, "loss": 0.20998632907867432, "mean_token_accuracy": 0.9130989611148834, "num_tokens": 17591136.0, "step": 1426 }, { "entropy": 1.289101094007492, "epoch": 0.75144813059505, "grad_norm": 0.49617183208465576, "learning_rate": 0.0001971970807456305, "loss": 0.21026289463043213, "mean_token_accuracy": 0.9138355553150177, "num_tokens": 17603472.0, "step": 1427 }, { "entropy": 1.3593553006649017, "epoch": 0.7519747235387045, "grad_norm": 0.3344785273075104, "learning_rate": 0.0001971916482081041, "loss": 0.20339743793010712, "mean_token_accuracy": 0.9177296459674835, "num_tokens": 17615808.0, "step": 1428 }, { "entropy": 1.3161483705043793, "epoch": 0.7525013164823592, "grad_norm": 0.3118573725223541, "learning_rate": 0.00019718621049451772, "loss": 0.2201179563999176, "mean_token_accuracy": 0.9167029410600662, "num_tokens": 17628144.0, "step": 1429 }, { "entropy": 1.3809407949447632, "epoch": 0.7530279094260137, "grad_norm": 0.3208526074886322, "learning_rate": 0.00019718076760519423, "loss": 0.23530805110931396, "mean_token_accuracy": 0.9093427956104279, "num_tokens": 17640480.0, "step": 1430 }, { "entropy": 1.3892112076282501, "epoch": 0.7535545023696683, "grad_norm": 0.2703491747379303, "learning_rate": 0.00019717531954045663, "loss": 0.2121361941099167, "mean_token_accuracy": 0.916591003537178, "num_tokens": 17652816.0, "step": 1431 }, { "entropy": 1.464809536933899, "epoch": 0.7540810953133228, "grad_norm": 0.2980828285217285, "learning_rate": 0.00019716986630062842, "loss": 0.21547271311283112, "mean_token_accuracy": 0.9138219356536865, "num_tokens": 17665152.0, "step": 1432 }, { "entropy": 1.4611221253871918, "epoch": 0.7546076882569773, "grad_norm": 0.3190062642097473, "learning_rate": 0.00019716440788603332, "loss": 0.22262822091579437, "mean_token_accuracy": 0.9171289652585983, "num_tokens": 17677488.0, "step": 1433 }, { "entropy": 1.4677778780460358, "epoch": 0.7551342812006319, "grad_norm": 0.2803551256656647, "learning_rate": 0.00019715894429699537, "loss": 0.2030690461397171, "mean_token_accuracy": 0.9211814850568771, "num_tokens": 17689824.0, "step": 1434 }, { "entropy": 1.546930730342865, "epoch": 0.7556608741442865, "grad_norm": 0.3004758954048157, "learning_rate": 0.00019715347553383888, "loss": 0.21929655969142914, "mean_token_accuracy": 0.9147268533706665, "num_tokens": 17702160.0, "step": 1435 }, { "entropy": 1.458657145500183, "epoch": 0.756187467087941, "grad_norm": 0.2918381094932556, "learning_rate": 0.00019714800159688852, "loss": 0.20412471890449524, "mean_token_accuracy": 0.9208769351243973, "num_tokens": 17714496.0, "step": 1436 }, { "entropy": 1.4661605954170227, "epoch": 0.7567140600315956, "grad_norm": 0.28824299573898315, "learning_rate": 0.00019714252248646924, "loss": 0.19737893342971802, "mean_token_accuracy": 0.9271862953901291, "num_tokens": 17726832.0, "step": 1437 }, { "entropy": 1.4540847837924957, "epoch": 0.7572406529752501, "grad_norm": 0.2962500751018524, "learning_rate": 0.00019713703820290634, "loss": 0.21638396382331848, "mean_token_accuracy": 0.9159590601921082, "num_tokens": 17739168.0, "step": 1438 }, { "entropy": 1.4231859147548676, "epoch": 0.7577672459189047, "grad_norm": 0.29495999217033386, "learning_rate": 0.00019713154874652532, "loss": 0.2159111201763153, "mean_token_accuracy": 0.9145191609859467, "num_tokens": 17751504.0, "step": 1439 }, { "entropy": 1.3984394371509552, "epoch": 0.7582938388625592, "grad_norm": 0.3085009753704071, "learning_rate": 0.0001971260541176521, "loss": 0.2231639325618744, "mean_token_accuracy": 0.9079516977071762, "num_tokens": 17763840.0, "step": 1440 }, { "entropy": 1.4092283248901367, "epoch": 0.7588204318062138, "grad_norm": 0.31046876311302185, "learning_rate": 0.00019712055431661286, "loss": 0.21453410387039185, "mean_token_accuracy": 0.916040763258934, "num_tokens": 17776176.0, "step": 1441 }, { "entropy": 1.3918389678001404, "epoch": 0.7593470247498684, "grad_norm": 0.3046187460422516, "learning_rate": 0.00019711504934373408, "loss": 0.20514801144599915, "mean_token_accuracy": 0.9181930124759674, "num_tokens": 17788512.0, "step": 1442 }, { "entropy": 1.3869245946407318, "epoch": 0.7598736176935229, "grad_norm": 0.31358590722084045, "learning_rate": 0.00019710953919934256, "loss": 0.22413912415504456, "mean_token_accuracy": 0.9102539569139481, "num_tokens": 17800848.0, "step": 1443 }, { "entropy": 1.3643006086349487, "epoch": 0.7604002106371774, "grad_norm": 0.27224990725517273, "learning_rate": 0.00019710402388376544, "loss": 0.20147213339805603, "mean_token_accuracy": 0.9196710139513016, "num_tokens": 17813184.0, "step": 1444 }, { "entropy": 1.39336559176445, "epoch": 0.760926803580832, "grad_norm": 0.3104258179664612, "learning_rate": 0.00019709850339733008, "loss": 0.21504773199558258, "mean_token_accuracy": 0.9135936945676804, "num_tokens": 17825520.0, "step": 1445 }, { "entropy": 1.3767728209495544, "epoch": 0.7614533965244866, "grad_norm": 0.3152048587799072, "learning_rate": 0.0001970929777403642, "loss": 0.221971333026886, "mean_token_accuracy": 0.911506250500679, "num_tokens": 17837856.0, "step": 1446 }, { "entropy": 1.4271937906742096, "epoch": 0.7619799894681412, "grad_norm": 0.3253970444202423, "learning_rate": 0.00019708744691319588, "loss": 0.2253606915473938, "mean_token_accuracy": 0.9094466418027878, "num_tokens": 17850192.0, "step": 1447 }, { "entropy": 1.3933376669883728, "epoch": 0.7625065824117957, "grad_norm": 0.3199850022792816, "learning_rate": 0.00019708191091615343, "loss": 0.21662366390228271, "mean_token_accuracy": 0.9175620973110199, "num_tokens": 17862528.0, "step": 1448 }, { "entropy": 1.433942288160324, "epoch": 0.7630331753554502, "grad_norm": 0.2839816212654114, "learning_rate": 0.00019707636974956546, "loss": 0.20464417338371277, "mean_token_accuracy": 0.9186283946037292, "num_tokens": 17874864.0, "step": 1449 }, { "entropy": 1.3883062601089478, "epoch": 0.7635597682991048, "grad_norm": 0.3059125542640686, "learning_rate": 0.00019707082341376093, "loss": 0.21790815889835358, "mean_token_accuracy": 0.9127152860164642, "num_tokens": 17887200.0, "step": 1450 }, { "entropy": 1.4840424954891205, "epoch": 0.7640863612427593, "grad_norm": 0.317634642124176, "learning_rate": 0.0001970652719090691, "loss": 0.22078271210193634, "mean_token_accuracy": 0.9099593609571457, "num_tokens": 17899536.0, "step": 1451 }, { "entropy": 1.373614490032196, "epoch": 0.764612954186414, "grad_norm": 0.2764304280281067, "learning_rate": 0.00019705971523581957, "loss": 0.20861467719078064, "mean_token_accuracy": 0.9210799187421799, "num_tokens": 17911872.0, "step": 1452 }, { "entropy": 1.4546839594841003, "epoch": 0.7651395471300685, "grad_norm": 0.30617302656173706, "learning_rate": 0.00019705415339434212, "loss": 0.21506822109222412, "mean_token_accuracy": 0.9104336351156235, "num_tokens": 17924208.0, "step": 1453 }, { "entropy": 1.46762016415596, "epoch": 0.765666140073723, "grad_norm": 0.33141979575157166, "learning_rate": 0.000197048586384967, "loss": 0.23449833691120148, "mean_token_accuracy": 0.909214973449707, "num_tokens": 17936544.0, "step": 1454 }, { "entropy": 1.3759736120700836, "epoch": 0.7661927330173776, "grad_norm": 0.28817251324653625, "learning_rate": 0.00019704301420802467, "loss": 0.2031758576631546, "mean_token_accuracy": 0.9166503101587296, "num_tokens": 17948880.0, "step": 1455 }, { "entropy": 1.4604673385620117, "epoch": 0.7667193259610321, "grad_norm": 0.28507548570632935, "learning_rate": 0.0001970374368638459, "loss": 0.21905720233917236, "mean_token_accuracy": 0.9121448248624802, "num_tokens": 17961216.0, "step": 1456 }, { "entropy": 1.4368546605110168, "epoch": 0.7672459189046866, "grad_norm": 0.3244202435016632, "learning_rate": 0.00019703185435276179, "loss": 0.21986661851406097, "mean_token_accuracy": 0.9103575944900513, "num_tokens": 17973552.0, "step": 1457 }, { "entropy": 1.4183049201965332, "epoch": 0.7677725118483413, "grad_norm": 0.3483145833015442, "learning_rate": 0.00019702626667510376, "loss": 0.2258511334657669, "mean_token_accuracy": 0.9121571332216263, "num_tokens": 17985888.0, "step": 1458 }, { "entropy": 1.4387763142585754, "epoch": 0.7682991047919958, "grad_norm": 0.30231183767318726, "learning_rate": 0.00019702067383120352, "loss": 0.20727157592773438, "mean_token_accuracy": 0.9170671254396439, "num_tokens": 17998224.0, "step": 1459 }, { "entropy": 1.3991906344890594, "epoch": 0.7688256977356503, "grad_norm": 0.3081129789352417, "learning_rate": 0.00019701507582139304, "loss": 0.2180902510881424, "mean_token_accuracy": 0.916274681687355, "num_tokens": 18010560.0, "step": 1460 }, { "entropy": 1.4099707305431366, "epoch": 0.7693522906793049, "grad_norm": 0.27477627992630005, "learning_rate": 0.00019700947264600466, "loss": 0.19322465360164642, "mean_token_accuracy": 0.9191512167453766, "num_tokens": 18022896.0, "step": 1461 }, { "entropy": 1.4558897018432617, "epoch": 0.7698788836229594, "grad_norm": 0.2677430212497711, "learning_rate": 0.00019700386430537105, "loss": 0.21823228895664215, "mean_token_accuracy": 0.9123710244894028, "num_tokens": 18035232.0, "step": 1462 }, { "entropy": 1.4174329936504364, "epoch": 0.770405476566614, "grad_norm": 0.2713851034641266, "learning_rate": 0.00019699825079982512, "loss": 0.19724853336811066, "mean_token_accuracy": 0.9200254529714584, "num_tokens": 18047568.0, "step": 1463 }, { "entropy": 1.4575957953929901, "epoch": 0.7709320695102686, "grad_norm": 0.30220046639442444, "learning_rate": 0.00019699263212970007, "loss": 0.20754371583461761, "mean_token_accuracy": 0.9198533892631531, "num_tokens": 18059904.0, "step": 1464 }, { "entropy": 1.450849562883377, "epoch": 0.7714586624539231, "grad_norm": 0.28346338868141174, "learning_rate": 0.0001969870082953295, "loss": 0.19828161597251892, "mean_token_accuracy": 0.9172644019126892, "num_tokens": 18072240.0, "step": 1465 }, { "entropy": 1.4658414423465729, "epoch": 0.7719852553975777, "grad_norm": 0.3004949986934662, "learning_rate": 0.00019698137929704724, "loss": 0.20767343044281006, "mean_token_accuracy": 0.9210254102945328, "num_tokens": 18084576.0, "step": 1466 }, { "entropy": 1.4050607681274414, "epoch": 0.7725118483412322, "grad_norm": 0.2896452248096466, "learning_rate": 0.00019697574513518747, "loss": 0.20795601606369019, "mean_token_accuracy": 0.914929062128067, "num_tokens": 18096912.0, "step": 1467 }, { "entropy": 1.4351738393306732, "epoch": 0.7730384412848867, "grad_norm": 0.34425756335258484, "learning_rate": 0.00019697010581008463, "loss": 0.21601206064224243, "mean_token_accuracy": 0.9149073958396912, "num_tokens": 18109248.0, "step": 1468 }, { "entropy": 1.3905524611473083, "epoch": 0.7735650342285414, "grad_norm": 0.3009505271911621, "learning_rate": 0.00019696446132207353, "loss": 0.19988638162612915, "mean_token_accuracy": 0.9213133901357651, "num_tokens": 18121584.0, "step": 1469 }, { "entropy": 1.4411927461624146, "epoch": 0.7740916271721959, "grad_norm": 0.3239229619503021, "learning_rate": 0.0001969588116714892, "loss": 0.2117571234703064, "mean_token_accuracy": 0.9106622785329819, "num_tokens": 18133920.0, "step": 1470 }, { "entropy": 1.4064708650112152, "epoch": 0.7746182201158505, "grad_norm": 0.3362599015235901, "learning_rate": 0.00019695315685866707, "loss": 0.23721855878829956, "mean_token_accuracy": 0.9070688337087631, "num_tokens": 18146256.0, "step": 1471 }, { "entropy": 1.4237781167030334, "epoch": 0.775144813059505, "grad_norm": 0.3095615804195404, "learning_rate": 0.00019694749688394281, "loss": 0.2411169707775116, "mean_token_accuracy": 0.9083186686038971, "num_tokens": 18158592.0, "step": 1472 }, { "entropy": 1.3879849016666412, "epoch": 0.7756714060031595, "grad_norm": 0.28509050607681274, "learning_rate": 0.00019694183174765245, "loss": 0.22019074857234955, "mean_token_accuracy": 0.911543145775795, "num_tokens": 18170928.0, "step": 1473 }, { "entropy": 1.3992516100406647, "epoch": 0.7761979989468141, "grad_norm": 0.3135905861854553, "learning_rate": 0.00019693616145013227, "loss": 0.2088148593902588, "mean_token_accuracy": 0.9130579680204391, "num_tokens": 18183264.0, "step": 1474 }, { "entropy": 1.3637616336345673, "epoch": 0.7767245918904687, "grad_norm": 0.26418524980545044, "learning_rate": 0.00019693048599171887, "loss": 0.20479831099510193, "mean_token_accuracy": 0.916004553437233, "num_tokens": 18195600.0, "step": 1475 }, { "entropy": 1.4390030205249786, "epoch": 0.7772511848341233, "grad_norm": 0.290937215089798, "learning_rate": 0.0001969248053727492, "loss": 0.21481530368328094, "mean_token_accuracy": 0.9162030220031738, "num_tokens": 18207936.0, "step": 1476 }, { "entropy": 1.4204131364822388, "epoch": 0.7777777777777778, "grad_norm": 0.3285602331161499, "learning_rate": 0.00019691911959356044, "loss": 0.19588018953800201, "mean_token_accuracy": 0.9232761710882187, "num_tokens": 18220272.0, "step": 1477 }, { "entropy": 1.4693542420864105, "epoch": 0.7783043707214323, "grad_norm": 0.3064950704574585, "learning_rate": 0.0001969134286544902, "loss": 0.20760740339756012, "mean_token_accuracy": 0.9132848978042603, "num_tokens": 18232608.0, "step": 1478 }, { "entropy": 1.3828904628753662, "epoch": 0.7788309636650869, "grad_norm": 0.3061995506286621, "learning_rate": 0.00019690773255587625, "loss": 0.2265746295452118, "mean_token_accuracy": 0.9108180850744247, "num_tokens": 18244944.0, "step": 1479 }, { "entropy": 1.3849403858184814, "epoch": 0.7793575566087414, "grad_norm": 0.3251616656780243, "learning_rate": 0.00019690203129805672, "loss": 0.2233261615037918, "mean_token_accuracy": 0.9125779420137405, "num_tokens": 18257280.0, "step": 1480 }, { "entropy": 1.3147023022174835, "epoch": 0.779884149552396, "grad_norm": 0.31116747856140137, "learning_rate": 0.00019689632488137016, "loss": 0.24036768078804016, "mean_token_accuracy": 0.906961664557457, "num_tokens": 18269616.0, "step": 1481 }, { "entropy": 1.3186087906360626, "epoch": 0.7804107424960506, "grad_norm": 0.30934205651283264, "learning_rate": 0.0001968906133061552, "loss": 0.21348203718662262, "mean_token_accuracy": 0.9163684844970703, "num_tokens": 18281952.0, "step": 1482 }, { "entropy": 1.3171938359737396, "epoch": 0.7809373354397051, "grad_norm": 0.3076079487800598, "learning_rate": 0.00019688489657275103, "loss": 0.22806760668754578, "mean_token_accuracy": 0.9050341248512268, "num_tokens": 18294288.0, "step": 1483 }, { "entropy": 1.331948697566986, "epoch": 0.7814639283833597, "grad_norm": 0.3263510465621948, "learning_rate": 0.0001968791746814969, "loss": 0.2278282344341278, "mean_token_accuracy": 0.9075683802366257, "num_tokens": 18306624.0, "step": 1484 }, { "entropy": 1.3975997269153595, "epoch": 0.7819905213270142, "grad_norm": 0.37345680594444275, "learning_rate": 0.00019687344763273255, "loss": 0.22596792876720428, "mean_token_accuracy": 0.913162499666214, "num_tokens": 18318960.0, "step": 1485 }, { "entropy": 1.3315426707267761, "epoch": 0.7825171142706687, "grad_norm": 0.28193777799606323, "learning_rate": 0.00019686771542679797, "loss": 0.1983056217432022, "mean_token_accuracy": 0.9222036451101303, "num_tokens": 18331296.0, "step": 1486 }, { "entropy": 1.4003748893737793, "epoch": 0.7830437072143234, "grad_norm": 0.30775102972984314, "learning_rate": 0.00019686197806403343, "loss": 0.22822785377502441, "mean_token_accuracy": 0.9109926074743271, "num_tokens": 18343632.0, "step": 1487 }, { "entropy": 1.3931090831756592, "epoch": 0.7835703001579779, "grad_norm": 0.2824244201183319, "learning_rate": 0.0001968562355447795, "loss": 0.20619836449623108, "mean_token_accuracy": 0.9165951460599899, "num_tokens": 18355968.0, "step": 1488 }, { "entropy": 1.3029468953609467, "epoch": 0.7840968931016324, "grad_norm": 0.26663464307785034, "learning_rate": 0.00019685048786937713, "loss": 0.2070493847131729, "mean_token_accuracy": 0.91603122651577, "num_tokens": 18368304.0, "step": 1489 }, { "entropy": 1.4118830561637878, "epoch": 0.784623486045287, "grad_norm": 0.2948478162288666, "learning_rate": 0.00019684473503816746, "loss": 0.2121935933828354, "mean_token_accuracy": 0.9169209152460098, "num_tokens": 18380640.0, "step": 1490 }, { "entropy": 1.5040743947029114, "epoch": 0.7851500789889415, "grad_norm": 0.33927392959594727, "learning_rate": 0.00019683897705149208, "loss": 0.23608259856700897, "mean_token_accuracy": 0.9112606197595596, "num_tokens": 18392976.0, "step": 1491 }, { "entropy": 1.388082355260849, "epoch": 0.785676671932596, "grad_norm": 0.2748982012271881, "learning_rate": 0.0001968332139096927, "loss": 0.21956929564476013, "mean_token_accuracy": 0.9111993908882141, "num_tokens": 18405312.0, "step": 1492 }, { "entropy": 1.419054538011551, "epoch": 0.7862032648762507, "grad_norm": 0.2975718379020691, "learning_rate": 0.00019682744561311163, "loss": 0.20622003078460693, "mean_token_accuracy": 0.91482774913311, "num_tokens": 18417648.0, "step": 1493 }, { "entropy": 1.3681580722332, "epoch": 0.7867298578199052, "grad_norm": 0.30167657136917114, "learning_rate": 0.00019682167216209106, "loss": 0.22527143359184265, "mean_token_accuracy": 0.9118600189685822, "num_tokens": 18429984.0, "step": 1494 }, { "entropy": 1.3992347717285156, "epoch": 0.7872564507635598, "grad_norm": 0.3023481070995331, "learning_rate": 0.00019681589355697394, "loss": 0.20631316304206848, "mean_token_accuracy": 0.9144344329833984, "num_tokens": 18442320.0, "step": 1495 }, { "entropy": 1.2978556156158447, "epoch": 0.7877830437072143, "grad_norm": 0.275492399930954, "learning_rate": 0.00019681010979810318, "loss": 0.2021515965461731, "mean_token_accuracy": 0.9172556847333908, "num_tokens": 18454656.0, "step": 1496 }, { "entropy": 1.2966987490653992, "epoch": 0.7883096366508688, "grad_norm": 0.3461536169052124, "learning_rate": 0.00019680432088582217, "loss": 0.22693704068660736, "mean_token_accuracy": 0.9091721177101135, "num_tokens": 18466992.0, "step": 1497 }, { "entropy": 1.304772973060608, "epoch": 0.7888362295945235, "grad_norm": 0.32779547572135925, "learning_rate": 0.00019679852682047457, "loss": 0.21427524089813232, "mean_token_accuracy": 0.9151846766471863, "num_tokens": 18479328.0, "step": 1498 }, { "entropy": 1.2882267534732819, "epoch": 0.789362822538178, "grad_norm": 0.3116947114467621, "learning_rate": 0.00019679272760240435, "loss": 0.20784853398799896, "mean_token_accuracy": 0.9149093627929688, "num_tokens": 18491664.0, "step": 1499 }, { "entropy": 1.263739138841629, "epoch": 0.7898894154818326, "grad_norm": 0.443194717168808, "learning_rate": 0.0001967869232319557, "loss": 0.23977030813694, "mean_token_accuracy": 0.9084160029888153, "num_tokens": 18504000.0, "step": 1500 }, { "entropy": 1.2093487679958344, "epoch": 0.7904160084254871, "grad_norm": 0.29420503973960876, "learning_rate": 0.0001967811137094733, "loss": 0.22335118055343628, "mean_token_accuracy": 0.909618929028511, "num_tokens": 18516336.0, "step": 1501 }, { "entropy": 1.271395206451416, "epoch": 0.7909426013691416, "grad_norm": 0.5013836026191711, "learning_rate": 0.00019677529903530197, "loss": 0.2110762596130371, "mean_token_accuracy": 0.9183898121118546, "num_tokens": 18528672.0, "step": 1502 }, { "entropy": 1.2578312754631042, "epoch": 0.7914691943127962, "grad_norm": 0.37272414565086365, "learning_rate": 0.0001967694792097869, "loss": 0.22164121270179749, "mean_token_accuracy": 0.9116562008857727, "num_tokens": 18541008.0, "step": 1503 }, { "entropy": 1.2144514918327332, "epoch": 0.7919957872564508, "grad_norm": 0.3145962059497833, "learning_rate": 0.0001967636542332736, "loss": 0.22305795550346375, "mean_token_accuracy": 0.9156023114919662, "num_tokens": 18553344.0, "step": 1504 }, { "entropy": 1.2401383221149445, "epoch": 0.7925223802001053, "grad_norm": 0.2835533022880554, "learning_rate": 0.00019675782410610778, "loss": 0.19279327988624573, "mean_token_accuracy": 0.926255002617836, "num_tokens": 18565680.0, "step": 1505 }, { "entropy": 1.2049389481544495, "epoch": 0.7930489731437599, "grad_norm": 0.2632310092449188, "learning_rate": 0.00019675198882863567, "loss": 0.2010316103696823, "mean_token_accuracy": 0.91452956199646, "num_tokens": 18578016.0, "step": 1506 }, { "entropy": 1.249726414680481, "epoch": 0.7935755660874144, "grad_norm": 0.30521342158317566, "learning_rate": 0.0001967461484012036, "loss": 0.23277787864208221, "mean_token_accuracy": 0.9076357632875443, "num_tokens": 18590352.0, "step": 1507 }, { "entropy": 1.1978009939193726, "epoch": 0.794102159031069, "grad_norm": 0.2853034734725952, "learning_rate": 0.00019674030282415826, "loss": 0.2127259522676468, "mean_token_accuracy": 0.9155232310295105, "num_tokens": 18602688.0, "step": 1508 }, { "entropy": 1.25815749168396, "epoch": 0.7946287519747235, "grad_norm": 0.28645238280296326, "learning_rate": 0.00019673445209784677, "loss": 0.22002597153186798, "mean_token_accuracy": 0.9130334705114365, "num_tokens": 18615024.0, "step": 1509 }, { "entropy": 1.3180667161941528, "epoch": 0.7951553449183781, "grad_norm": 0.2906380891799927, "learning_rate": 0.00019672859622261633, "loss": 0.22877947986125946, "mean_token_accuracy": 0.912013441324234, "num_tokens": 18627360.0, "step": 1510 }, { "entropy": 1.2853264808654785, "epoch": 0.7956819378620327, "grad_norm": 0.28856080770492554, "learning_rate": 0.00019672273519881465, "loss": 0.2222394347190857, "mean_token_accuracy": 0.9078328162431717, "num_tokens": 18639696.0, "step": 1511 }, { "entropy": 1.2696054577827454, "epoch": 0.7962085308056872, "grad_norm": 0.30683693289756775, "learning_rate": 0.0001967168690267896, "loss": 0.22363853454589844, "mean_token_accuracy": 0.9149999022483826, "num_tokens": 18652032.0, "step": 1512 }, { "entropy": 1.272040843963623, "epoch": 0.7967351237493417, "grad_norm": 0.3236723840236664, "learning_rate": 0.0001967109977068895, "loss": 0.21476420760154724, "mean_token_accuracy": 0.9179616123437881, "num_tokens": 18664368.0, "step": 1513 }, { "entropy": 1.260970801115036, "epoch": 0.7972617166929963, "grad_norm": 0.30413469672203064, "learning_rate": 0.00019670512123946284, "loss": 0.22492626309394836, "mean_token_accuracy": 0.9107203483581543, "num_tokens": 18676704.0, "step": 1514 }, { "entropy": 1.2300290167331696, "epoch": 0.7977883096366508, "grad_norm": 0.2895817458629608, "learning_rate": 0.00019669923962485847, "loss": 0.2138168066740036, "mean_token_accuracy": 0.9164409637451172, "num_tokens": 18689040.0, "step": 1515 }, { "entropy": 1.2246987521648407, "epoch": 0.7983149025803055, "grad_norm": 0.30868765711784363, "learning_rate": 0.0001966933528634256, "loss": 0.2062627673149109, "mean_token_accuracy": 0.9158836156129837, "num_tokens": 18701376.0, "step": 1516 }, { "entropy": 1.24353489279747, "epoch": 0.79884149552396, "grad_norm": 0.2896019518375397, "learning_rate": 0.00019668746095551364, "loss": 0.2127014845609665, "mean_token_accuracy": 0.9154282063245773, "num_tokens": 18713712.0, "step": 1517 }, { "entropy": 1.219551146030426, "epoch": 0.7993680884676145, "grad_norm": 0.5301105380058289, "learning_rate": 0.0001966815639014724, "loss": 0.20765289664268494, "mean_token_accuracy": 0.9193731993436813, "num_tokens": 18726048.0, "step": 1518 }, { "entropy": 1.2230626046657562, "epoch": 0.7998946814112691, "grad_norm": 0.2891480624675751, "learning_rate": 0.00019667566170165194, "loss": 0.20567816495895386, "mean_token_accuracy": 0.9149514883756638, "num_tokens": 18738384.0, "step": 1519 }, { "entropy": 1.1955215632915497, "epoch": 0.8004212743549236, "grad_norm": 0.3952074646949768, "learning_rate": 0.00019666975435640258, "loss": 0.23236501216888428, "mean_token_accuracy": 0.910706028342247, "num_tokens": 18750720.0, "step": 1520 }, { "entropy": 1.1208319664001465, "epoch": 0.8009478672985783, "grad_norm": 0.3569393455982208, "learning_rate": 0.00019666384186607506, "loss": 0.2112501859664917, "mean_token_accuracy": 0.9126569777727127, "num_tokens": 18763056.0, "step": 1521 }, { "entropy": 1.1377290189266205, "epoch": 0.8014744602422328, "grad_norm": 0.2929931879043579, "learning_rate": 0.00019665792423102037, "loss": 0.22051754593849182, "mean_token_accuracy": 0.9091715216636658, "num_tokens": 18775392.0, "step": 1522 }, { "entropy": 1.1271924078464508, "epoch": 0.8020010531858873, "grad_norm": 0.3465351164340973, "learning_rate": 0.0001966520014515898, "loss": 0.22917094826698303, "mean_token_accuracy": 0.9075794517993927, "num_tokens": 18787728.0, "step": 1523 }, { "entropy": 1.1986294984817505, "epoch": 0.8025276461295419, "grad_norm": 0.32447630167007446, "learning_rate": 0.00019664607352813494, "loss": 0.23350387811660767, "mean_token_accuracy": 0.9076796770095825, "num_tokens": 18800064.0, "step": 1524 }, { "entropy": 1.1514316499233246, "epoch": 0.8030542390731964, "grad_norm": 0.3304944932460785, "learning_rate": 0.00019664014046100775, "loss": 0.21476618945598602, "mean_token_accuracy": 0.913004919886589, "num_tokens": 18812400.0, "step": 1525 }, { "entropy": 1.1340425908565521, "epoch": 0.8035808320168509, "grad_norm": 0.5441511869430542, "learning_rate": 0.00019663420225056035, "loss": 0.22214046120643616, "mean_token_accuracy": 0.9116765111684799, "num_tokens": 18824736.0, "step": 1526 }, { "entropy": 1.0562350451946259, "epoch": 0.8041074249605056, "grad_norm": 0.3077342212200165, "learning_rate": 0.00019662825889714533, "loss": 0.21319684386253357, "mean_token_accuracy": 0.918745294213295, "num_tokens": 18837072.0, "step": 1527 }, { "entropy": 1.0274389684200287, "epoch": 0.8046340179041601, "grad_norm": 0.3354491889476776, "learning_rate": 0.0001966223104011155, "loss": 0.2296486645936966, "mean_token_accuracy": 0.9057023078203201, "num_tokens": 18849408.0, "step": 1528 }, { "entropy": 1.0815512537956238, "epoch": 0.8051606108478147, "grad_norm": 0.3144749402999878, "learning_rate": 0.00019661635676282394, "loss": 0.229911670088768, "mean_token_accuracy": 0.9100077450275421, "num_tokens": 18861744.0, "step": 1529 }, { "entropy": 1.0930194556713104, "epoch": 0.8056872037914692, "grad_norm": 0.300818532705307, "learning_rate": 0.00019661039798262415, "loss": 0.20994170010089874, "mean_token_accuracy": 0.9187563508749008, "num_tokens": 18874080.0, "step": 1530 }, { "entropy": 1.0869486331939697, "epoch": 0.8062137967351237, "grad_norm": 0.28593873977661133, "learning_rate": 0.00019660443406086984, "loss": 0.20231741666793823, "mean_token_accuracy": 0.918257012963295, "num_tokens": 18886416.0, "step": 1531 }, { "entropy": 1.0835871398448944, "epoch": 0.8067403896787783, "grad_norm": 0.7419033050537109, "learning_rate": 0.000196598464997915, "loss": 0.2157197892665863, "mean_token_accuracy": 0.9135694205760956, "num_tokens": 18898752.0, "step": 1532 }, { "entropy": 1.1274356842041016, "epoch": 0.8072669826224329, "grad_norm": 0.31080278754234314, "learning_rate": 0.00019659249079411405, "loss": 0.22466787695884705, "mean_token_accuracy": 0.9107064604759216, "num_tokens": 18911088.0, "step": 1533 }, { "entropy": 1.0774615406990051, "epoch": 0.8077935755660874, "grad_norm": 0.28806376457214355, "learning_rate": 0.00019658651144982163, "loss": 0.2336619794368744, "mean_token_accuracy": 0.9125310033559799, "num_tokens": 18923424.0, "step": 1534 }, { "entropy": 1.0493130534887314, "epoch": 0.808320168509742, "grad_norm": 0.2861652672290802, "learning_rate": 0.0001965805269653927, "loss": 0.20115122199058533, "mean_token_accuracy": 0.919718474149704, "num_tokens": 18935760.0, "step": 1535 }, { "entropy": 1.0706775784492493, "epoch": 0.8088467614533965, "grad_norm": 0.29678940773010254, "learning_rate": 0.0001965745373411825, "loss": 0.21643559634685516, "mean_token_accuracy": 0.9111261665821075, "num_tokens": 18948096.0, "step": 1536 }, { "entropy": 1.0705525279045105, "epoch": 0.809373354397051, "grad_norm": 0.3051356077194214, "learning_rate": 0.0001965685425775466, "loss": 0.2151341289281845, "mean_token_accuracy": 0.9130971729755402, "num_tokens": 18960432.0, "step": 1537 }, { "entropy": 1.0797742903232574, "epoch": 0.8098999473407056, "grad_norm": 0.29696813225746155, "learning_rate": 0.0001965625426748409, "loss": 0.22983068227767944, "mean_token_accuracy": 0.9089944660663605, "num_tokens": 18972768.0, "step": 1538 }, { "entropy": 1.0420788824558258, "epoch": 0.8104265402843602, "grad_norm": 0.29141098260879517, "learning_rate": 0.00019655653763342155, "loss": 0.20703990757465363, "mean_token_accuracy": 0.9171910136938095, "num_tokens": 18985104.0, "step": 1539 }, { "entropy": 1.0945038497447968, "epoch": 0.8109531332280148, "grad_norm": 0.30959945917129517, "learning_rate": 0.00019655052745364509, "loss": 0.24617335200309753, "mean_token_accuracy": 0.9053667187690735, "num_tokens": 18997440.0, "step": 1540 }, { "entropy": 1.0674882233142853, "epoch": 0.8114797261716693, "grad_norm": 0.29151442646980286, "learning_rate": 0.00019654451213586824, "loss": 0.202132448554039, "mean_token_accuracy": 0.9202746897935867, "num_tokens": 19009776.0, "step": 1541 }, { "entropy": 1.1482883095741272, "epoch": 0.8120063191153238, "grad_norm": 0.3008717894554138, "learning_rate": 0.00019653849168044815, "loss": 0.2195252776145935, "mean_token_accuracy": 0.9127016216516495, "num_tokens": 19022112.0, "step": 1542 }, { "entropy": 1.0573867559432983, "epoch": 0.8125329120589784, "grad_norm": 0.2779742479324341, "learning_rate": 0.00019653246608774215, "loss": 0.20425541698932648, "mean_token_accuracy": 0.9176970571279526, "num_tokens": 19034448.0, "step": 1543 }, { "entropy": 1.1284627318382263, "epoch": 0.8130595050026329, "grad_norm": 0.3272855281829834, "learning_rate": 0.00019652643535810803, "loss": 0.2418060004711151, "mean_token_accuracy": 0.9060062915086746, "num_tokens": 19046784.0, "step": 1544 }, { "entropy": 1.160320371389389, "epoch": 0.8135860979462876, "grad_norm": 0.28571900725364685, "learning_rate": 0.00019652039949190372, "loss": 0.19945061206817627, "mean_token_accuracy": 0.9213592410087585, "num_tokens": 19059120.0, "step": 1545 }, { "entropy": 1.0708126425743103, "epoch": 0.8141126908899421, "grad_norm": 0.28214171528816223, "learning_rate": 0.00019651435848948762, "loss": 0.21407712996006012, "mean_token_accuracy": 0.9169910848140717, "num_tokens": 19071456.0, "step": 1546 }, { "entropy": 1.071442037820816, "epoch": 0.8146392838335966, "grad_norm": 0.27851834893226624, "learning_rate": 0.00019650831235121824, "loss": 0.20925593376159668, "mean_token_accuracy": 0.9159252196550369, "num_tokens": 19083792.0, "step": 1547 }, { "entropy": 1.1155974566936493, "epoch": 0.8151658767772512, "grad_norm": 0.3253529369831085, "learning_rate": 0.00019650226107745461, "loss": 0.21849502623081207, "mean_token_accuracy": 0.9110303372144699, "num_tokens": 19096128.0, "step": 1548 }, { "entropy": 1.0896004736423492, "epoch": 0.8156924697209057, "grad_norm": 0.28845205903053284, "learning_rate": 0.0001964962046685559, "loss": 0.22848929464817047, "mean_token_accuracy": 0.9086662530899048, "num_tokens": 19108464.0, "step": 1549 }, { "entropy": 1.0635098963975906, "epoch": 0.8162190626645603, "grad_norm": 0.3507218658924103, "learning_rate": 0.00019649014312488164, "loss": 0.22886288166046143, "mean_token_accuracy": 0.9107942432165146, "num_tokens": 19120800.0, "step": 1550 }, { "entropy": 1.0771049559116364, "epoch": 0.8167456556082149, "grad_norm": 0.3061995506286621, "learning_rate": 0.0001964840764467917, "loss": 0.22587770223617554, "mean_token_accuracy": 0.907668799161911, "num_tokens": 19133136.0, "step": 1551 }, { "entropy": 1.0604461431503296, "epoch": 0.8172722485518694, "grad_norm": 0.29044315218925476, "learning_rate": 0.00019647800463464622, "loss": 0.2082800567150116, "mean_token_accuracy": 0.9161125719547272, "num_tokens": 19145472.0, "step": 1552 }, { "entropy": 1.0522086769342422, "epoch": 0.817798841495524, "grad_norm": 0.301567405462265, "learning_rate": 0.0001964719276888056, "loss": 0.20523683726787567, "mean_token_accuracy": 0.9130432307720184, "num_tokens": 19157808.0, "step": 1553 }, { "entropy": 1.02540722489357, "epoch": 0.8183254344391785, "grad_norm": 0.29618892073631287, "learning_rate": 0.00019646584560963065, "loss": 0.22347863018512726, "mean_token_accuracy": 0.9131524860858917, "num_tokens": 19170144.0, "step": 1554 }, { "entropy": 1.0311861038208008, "epoch": 0.818852027382833, "grad_norm": 0.27861911058425903, "learning_rate": 0.00019645975839748244, "loss": 0.182900071144104, "mean_token_accuracy": 0.9252242147922516, "num_tokens": 19182480.0, "step": 1555 }, { "entropy": 1.0627757012844086, "epoch": 0.8193786203264877, "grad_norm": 0.3110608458518982, "learning_rate": 0.00019645366605272228, "loss": 0.23385684192180634, "mean_token_accuracy": 0.9053423404693604, "num_tokens": 19194816.0, "step": 1556 }, { "entropy": 1.0807601511478424, "epoch": 0.8199052132701422, "grad_norm": 0.31477105617523193, "learning_rate": 0.00019644756857571186, "loss": 0.22126808762550354, "mean_token_accuracy": 0.9116723388433456, "num_tokens": 19207152.0, "step": 1557 }, { "entropy": 1.079503744840622, "epoch": 0.8204318062137967, "grad_norm": 0.314552366733551, "learning_rate": 0.00019644146596681312, "loss": 0.22594426572322845, "mean_token_accuracy": 0.9112756550312042, "num_tokens": 19219488.0, "step": 1558 }, { "entropy": 1.0542688369750977, "epoch": 0.8209583991574513, "grad_norm": 0.30733972787857056, "learning_rate": 0.0001964353582263884, "loss": 0.22227591276168823, "mean_token_accuracy": 0.9121880233287811, "num_tokens": 19231824.0, "step": 1559 }, { "entropy": 1.0992242991924286, "epoch": 0.8214849921011058, "grad_norm": 0.29605984687805176, "learning_rate": 0.0001964292453548002, "loss": 0.22202306985855103, "mean_token_accuracy": 0.9160446226596832, "num_tokens": 19244160.0, "step": 1560 }, { "entropy": 1.1573190689086914, "epoch": 0.8220115850447604, "grad_norm": 0.3093453347682953, "learning_rate": 0.00019642312735241148, "loss": 0.22188301384449005, "mean_token_accuracy": 0.9117791652679443, "num_tokens": 19256496.0, "step": 1561 }, { "entropy": 1.0756475329399109, "epoch": 0.822538177988415, "grad_norm": 0.29175224900245667, "learning_rate": 0.00019641700421958543, "loss": 0.20454362034797668, "mean_token_accuracy": 0.9208622127771378, "num_tokens": 19268832.0, "step": 1562 }, { "entropy": 1.1309452950954437, "epoch": 0.8230647709320695, "grad_norm": 0.3055620789527893, "learning_rate": 0.00019641087595668547, "loss": 0.24093538522720337, "mean_token_accuracy": 0.9080805480480194, "num_tokens": 19281168.0, "step": 1563 }, { "entropy": 1.0666328370571136, "epoch": 0.8235913638757241, "grad_norm": 0.26273226737976074, "learning_rate": 0.00019640474256407545, "loss": 0.18816737830638885, "mean_token_accuracy": 0.9207744300365448, "num_tokens": 19293504.0, "step": 1564 }, { "entropy": 1.1276142299175262, "epoch": 0.8241179568193786, "grad_norm": 0.3050276041030884, "learning_rate": 0.0001963986040421195, "loss": 0.21849283576011658, "mean_token_accuracy": 0.9142372459173203, "num_tokens": 19305840.0, "step": 1565 }, { "entropy": 1.0887978076934814, "epoch": 0.8246445497630331, "grad_norm": 0.2735901176929474, "learning_rate": 0.00019639246039118198, "loss": 0.20344410836696625, "mean_token_accuracy": 0.9216662347316742, "num_tokens": 19318176.0, "step": 1566 }, { "entropy": 1.0880299508571625, "epoch": 0.8251711427066877, "grad_norm": 0.2992630898952484, "learning_rate": 0.00019638631161162761, "loss": 0.20155635476112366, "mean_token_accuracy": 0.9177606403827667, "num_tokens": 19330512.0, "step": 1567 }, { "entropy": 1.0990647375583649, "epoch": 0.8256977356503423, "grad_norm": 0.29473257064819336, "learning_rate": 0.00019638015770382142, "loss": 0.20519070327281952, "mean_token_accuracy": 0.9206506013870239, "num_tokens": 19342848.0, "step": 1568 }, { "entropy": 1.0590737760066986, "epoch": 0.8262243285939969, "grad_norm": 0.28194659948349, "learning_rate": 0.00019637399866812873, "loss": 0.20845578610897064, "mean_token_accuracy": 0.9180682003498077, "num_tokens": 19355184.0, "step": 1569 }, { "entropy": 1.1114600002765656, "epoch": 0.8267509215376514, "grad_norm": 0.3110455870628357, "learning_rate": 0.00019636783450491517, "loss": 0.2090432196855545, "mean_token_accuracy": 0.9182581901550293, "num_tokens": 19367520.0, "step": 1570 }, { "entropy": 1.159915953874588, "epoch": 0.8272775144813059, "grad_norm": 0.3254052400588989, "learning_rate": 0.00019636166521454668, "loss": 0.21491852402687073, "mean_token_accuracy": 0.9105751514434814, "num_tokens": 19379856.0, "step": 1571 }, { "entropy": 1.1465847194194794, "epoch": 0.8278041074249605, "grad_norm": 0.28690120577812195, "learning_rate": 0.00019635549079738946, "loss": 0.21204861998558044, "mean_token_accuracy": 0.9141225218772888, "num_tokens": 19392192.0, "step": 1572 }, { "entropy": 1.1238433420658112, "epoch": 0.8283307003686151, "grad_norm": 0.3004522919654846, "learning_rate": 0.0001963493112538101, "loss": 0.22797521948814392, "mean_token_accuracy": 0.9102497845888138, "num_tokens": 19404528.0, "step": 1573 }, { "entropy": 1.1517022848129272, "epoch": 0.8288572933122696, "grad_norm": 0.3072613477706909, "learning_rate": 0.00019634312658417538, "loss": 0.2027738243341446, "mean_token_accuracy": 0.9213471561670303, "num_tokens": 19416864.0, "step": 1574 }, { "entropy": 1.1321575045585632, "epoch": 0.8293838862559242, "grad_norm": 0.33203771710395813, "learning_rate": 0.0001963369367888525, "loss": 0.23440833389759064, "mean_token_accuracy": 0.9052640497684479, "num_tokens": 19429200.0, "step": 1575 }, { "entropy": 1.1507805287837982, "epoch": 0.8299104791995787, "grad_norm": 0.28893306851387024, "learning_rate": 0.00019633074186820886, "loss": 0.21041327714920044, "mean_token_accuracy": 0.9186779856681824, "num_tokens": 19441536.0, "step": 1576 }, { "entropy": 1.1217812597751617, "epoch": 0.8304370721432333, "grad_norm": 0.286567747592926, "learning_rate": 0.00019632454182261228, "loss": 0.20225471258163452, "mean_token_accuracy": 0.9235644489526749, "num_tokens": 19453872.0, "step": 1577 }, { "entropy": 1.1518227756023407, "epoch": 0.8309636650868878, "grad_norm": 0.30317631363868713, "learning_rate": 0.00019631833665243075, "loss": 0.22191138565540314, "mean_token_accuracy": 0.9106118381023407, "num_tokens": 19466208.0, "step": 1578 }, { "entropy": 1.164818674325943, "epoch": 0.8314902580305424, "grad_norm": 0.3264894187450409, "learning_rate": 0.0001963121263580327, "loss": 0.22096458077430725, "mean_token_accuracy": 0.9108817130327225, "num_tokens": 19478544.0, "step": 1579 }, { "entropy": 1.0784786641597748, "epoch": 0.832016850974197, "grad_norm": 0.2952364683151245, "learning_rate": 0.0001963059109397868, "loss": 0.2409459352493286, "mean_token_accuracy": 0.9058417230844498, "num_tokens": 19490880.0, "step": 1580 }, { "entropy": 1.0973447263240814, "epoch": 0.8325434439178515, "grad_norm": 0.2781769931316376, "learning_rate": 0.00019629969039806195, "loss": 0.2172403782606125, "mean_token_accuracy": 0.9110274314880371, "num_tokens": 19503216.0, "step": 1581 }, { "entropy": 1.1422053277492523, "epoch": 0.833070036861506, "grad_norm": 0.2971686124801636, "learning_rate": 0.0001962934647332275, "loss": 0.21011781692504883, "mean_token_accuracy": 0.9153971076011658, "num_tokens": 19515552.0, "step": 1582 }, { "entropy": 1.1796616911888123, "epoch": 0.8335966298051606, "grad_norm": 0.29507434368133545, "learning_rate": 0.000196287233945653, "loss": 0.19983485341072083, "mean_token_accuracy": 0.9158152490854263, "num_tokens": 19527888.0, "step": 1583 }, { "entropy": 1.1146294176578522, "epoch": 0.8341232227488151, "grad_norm": 0.275584876537323, "learning_rate": 0.00019628099803570837, "loss": 0.2035273015499115, "mean_token_accuracy": 0.9163656979799271, "num_tokens": 19540224.0, "step": 1584 }, { "entropy": 1.1470642983913422, "epoch": 0.8346498156924698, "grad_norm": 0.2765231430530548, "learning_rate": 0.00019627475700376374, "loss": 0.22747623920440674, "mean_token_accuracy": 0.9137639552354813, "num_tokens": 19552560.0, "step": 1585 }, { "entropy": 1.1012212336063385, "epoch": 0.8351764086361243, "grad_norm": 0.28456148505210876, "learning_rate": 0.00019626851085018964, "loss": 0.2105616182088852, "mean_token_accuracy": 0.9195501506328583, "num_tokens": 19564896.0, "step": 1586 }, { "entropy": 1.106357455253601, "epoch": 0.8357030015797788, "grad_norm": 0.32695838809013367, "learning_rate": 0.00019626225957535684, "loss": 0.22337135672569275, "mean_token_accuracy": 0.9134061336517334, "num_tokens": 19577232.0, "step": 1587 }, { "entropy": 1.169274091720581, "epoch": 0.8362295945234334, "grad_norm": 0.336927205324173, "learning_rate": 0.0001962560031796365, "loss": 0.2262648195028305, "mean_token_accuracy": 0.9084394127130508, "num_tokens": 19589568.0, "step": 1588 }, { "entropy": 1.1865193247795105, "epoch": 0.8367561874670879, "grad_norm": 0.3452165722846985, "learning_rate": 0.00019624974166339998, "loss": 0.24824325740337372, "mean_token_accuracy": 0.9022375047206879, "num_tokens": 19601904.0, "step": 1589 }, { "entropy": 1.1062462031841278, "epoch": 0.8372827804107424, "grad_norm": 0.3023000955581665, "learning_rate": 0.000196243475027019, "loss": 0.23354491591453552, "mean_token_accuracy": 0.9097914397716522, "num_tokens": 19614240.0, "step": 1590 }, { "entropy": 1.1293524503707886, "epoch": 0.8378093733543971, "grad_norm": 0.2942156195640564, "learning_rate": 0.00019623720327086557, "loss": 0.22122958302497864, "mean_token_accuracy": 0.9109482020139694, "num_tokens": 19626576.0, "step": 1591 }, { "entropy": 1.124775916337967, "epoch": 0.8383359662980516, "grad_norm": 0.315075546503067, "learning_rate": 0.00019623092639531198, "loss": 0.22557595372200012, "mean_token_accuracy": 0.9101526886224747, "num_tokens": 19638912.0, "step": 1592 }, { "entropy": 1.148577243089676, "epoch": 0.8388625592417062, "grad_norm": 0.43819931149482727, "learning_rate": 0.0001962246444007309, "loss": 0.22852541506290436, "mean_token_accuracy": 0.9057890176773071, "num_tokens": 19651248.0, "step": 1593 }, { "entropy": 1.14993816614151, "epoch": 0.8393891521853607, "grad_norm": 0.31310200691223145, "learning_rate": 0.00019621835728749525, "loss": 0.2385086715221405, "mean_token_accuracy": 0.9071990847587585, "num_tokens": 19663584.0, "step": 1594 }, { "entropy": 1.1644853949546814, "epoch": 0.8399157451290152, "grad_norm": 0.2970283031463623, "learning_rate": 0.00019621206505597823, "loss": 0.2200639396905899, "mean_token_accuracy": 0.9170584827661514, "num_tokens": 19675920.0, "step": 1595 }, { "entropy": 1.1328399777412415, "epoch": 0.8404423380726699, "grad_norm": 0.3323354125022888, "learning_rate": 0.0001962057677065534, "loss": 0.22121144831180573, "mean_token_accuracy": 0.9114271998405457, "num_tokens": 19688256.0, "step": 1596 }, { "entropy": 1.0829459726810455, "epoch": 0.8409689310163244, "grad_norm": 0.28420135378837585, "learning_rate": 0.0001961994652395946, "loss": 0.2405356764793396, "mean_token_accuracy": 0.9100402593612671, "num_tokens": 19700592.0, "step": 1597 }, { "entropy": 1.0924118757247925, "epoch": 0.841495523959979, "grad_norm": 0.25400787591934204, "learning_rate": 0.00019619315765547594, "loss": 0.18612799048423767, "mean_token_accuracy": 0.9215864688158035, "num_tokens": 19712928.0, "step": 1598 }, { "entropy": 1.1357889473438263, "epoch": 0.8420221169036335, "grad_norm": 0.2727976143360138, "learning_rate": 0.00019618684495457188, "loss": 0.22136437892913818, "mean_token_accuracy": 0.9126606434583664, "num_tokens": 19725264.0, "step": 1599 }, { "entropy": 1.0817617177963257, "epoch": 0.842548709847288, "grad_norm": 0.2677607238292694, "learning_rate": 0.0001961805271372572, "loss": 0.20533126592636108, "mean_token_accuracy": 0.9148357510566711, "num_tokens": 19737600.0, "step": 1600 }, { "entropy": 1.1030884683132172, "epoch": 0.8430753027909426, "grad_norm": 0.2927640378475189, "learning_rate": 0.0001961742042039069, "loss": 0.22252412140369415, "mean_token_accuracy": 0.9111676663160324, "num_tokens": 19749936.0, "step": 1601 }, { "entropy": 1.1529828608036041, "epoch": 0.8436018957345972, "grad_norm": 0.30727458000183105, "learning_rate": 0.00019616787615489635, "loss": 0.2029101848602295, "mean_token_accuracy": 0.9227928221225739, "num_tokens": 19762272.0, "step": 1602 }, { "entropy": 1.0316384136676788, "epoch": 0.8441284886782517, "grad_norm": 0.27791184186935425, "learning_rate": 0.00019616154299060122, "loss": 0.21758908033370972, "mean_token_accuracy": 0.9157789200544357, "num_tokens": 19774608.0, "step": 1603 }, { "entropy": 1.0185693204402924, "epoch": 0.8446550816219063, "grad_norm": 0.2891453504562378, "learning_rate": 0.00019615520471139749, "loss": 0.19542157649993896, "mean_token_accuracy": 0.9184477776288986, "num_tokens": 19786944.0, "step": 1604 }, { "entropy": 1.010437250137329, "epoch": 0.8451816745655608, "grad_norm": 0.29489409923553467, "learning_rate": 0.00019614886131766137, "loss": 0.2418351173400879, "mean_token_accuracy": 0.9019056260585785, "num_tokens": 19799280.0, "step": 1605 }, { "entropy": 1.0607281923294067, "epoch": 0.8457082675092154, "grad_norm": 0.2774660587310791, "learning_rate": 0.00019614251280976948, "loss": 0.1955130398273468, "mean_token_accuracy": 0.9208610653877258, "num_tokens": 19811616.0, "step": 1606 }, { "entropy": 1.0406393706798553, "epoch": 0.8462348604528699, "grad_norm": 0.3048405647277832, "learning_rate": 0.00019613615918809868, "loss": 0.24297615885734558, "mean_token_accuracy": 0.9006519466638565, "num_tokens": 19823952.0, "step": 1607 }, { "entropy": 0.9977871924638748, "epoch": 0.8467614533965245, "grad_norm": 0.29823529720306396, "learning_rate": 0.00019612980045302617, "loss": 0.22520115971565247, "mean_token_accuracy": 0.9101865142583847, "num_tokens": 19836288.0, "step": 1608 }, { "entropy": 0.9967030137777328, "epoch": 0.8472880463401791, "grad_norm": 0.30385443568229675, "learning_rate": 0.0001961234366049294, "loss": 0.2113213837146759, "mean_token_accuracy": 0.9132890105247498, "num_tokens": 19848624.0, "step": 1609 }, { "entropy": 0.9831344783306122, "epoch": 0.8478146392838336, "grad_norm": 0.2813466787338257, "learning_rate": 0.00019611706764418617, "loss": 0.20107880234718323, "mean_token_accuracy": 0.9161145985126495, "num_tokens": 19860960.0, "step": 1610 }, { "entropy": 1.0240805000066757, "epoch": 0.8483412322274881, "grad_norm": 0.3142811954021454, "learning_rate": 0.00019611069357117455, "loss": 0.20909224450588226, "mean_token_accuracy": 0.9144964218139648, "num_tokens": 19873296.0, "step": 1611 }, { "entropy": 0.9786220341920853, "epoch": 0.8488678251711427, "grad_norm": 0.2860144376754761, "learning_rate": 0.00019610431438627296, "loss": 0.20540790259838104, "mean_token_accuracy": 0.9215816557407379, "num_tokens": 19885632.0, "step": 1612 }, { "entropy": 1.0295808017253876, "epoch": 0.8493944181147972, "grad_norm": 0.2819706201553345, "learning_rate": 0.00019609793008986003, "loss": 0.2058688849210739, "mean_token_accuracy": 0.9158887714147568, "num_tokens": 19897968.0, "step": 1613 }, { "entropy": 1.0835894644260406, "epoch": 0.8499210110584519, "grad_norm": 0.2932409346103668, "learning_rate": 0.00019609154068231486, "loss": 0.2193165421485901, "mean_token_accuracy": 0.9130483567714691, "num_tokens": 19910304.0, "step": 1614 }, { "entropy": 1.0591089725494385, "epoch": 0.8504476040021064, "grad_norm": 0.3336801528930664, "learning_rate": 0.00019608514616401668, "loss": 0.2534202039241791, "mean_token_accuracy": 0.9020056575536728, "num_tokens": 19922640.0, "step": 1615 }, { "entropy": 1.0837358832359314, "epoch": 0.8509741969457609, "grad_norm": 0.2906700372695923, "learning_rate": 0.00019607874653534513, "loss": 0.21131698787212372, "mean_token_accuracy": 0.9210411906242371, "num_tokens": 19934976.0, "step": 1616 }, { "entropy": 1.0396023094654083, "epoch": 0.8515007898894155, "grad_norm": 0.29053011536598206, "learning_rate": 0.0001960723417966801, "loss": 0.21710500121116638, "mean_token_accuracy": 0.914475828409195, "num_tokens": 19947312.0, "step": 1617 }, { "entropy": 1.0233092904090881, "epoch": 0.85202738283307, "grad_norm": 0.26935815811157227, "learning_rate": 0.00019606593194840177, "loss": 0.22018460929393768, "mean_token_accuracy": 0.9134867042303085, "num_tokens": 19959648.0, "step": 1618 }, { "entropy": 1.0701540112495422, "epoch": 0.8525539757767245, "grad_norm": 0.28057801723480225, "learning_rate": 0.00019605951699089075, "loss": 0.21612004935741425, "mean_token_accuracy": 0.9129879325628281, "num_tokens": 19971984.0, "step": 1619 }, { "entropy": 1.012107402086258, "epoch": 0.8530805687203792, "grad_norm": 0.2693917155265808, "learning_rate": 0.00019605309692452774, "loss": 0.2114534080028534, "mean_token_accuracy": 0.9149720519781113, "num_tokens": 19984320.0, "step": 1620 }, { "entropy": 1.0413274019956589, "epoch": 0.8536071616640337, "grad_norm": 0.27927207946777344, "learning_rate": 0.00019604667174969394, "loss": 0.21135683357715607, "mean_token_accuracy": 0.9143811762332916, "num_tokens": 19996656.0, "step": 1621 }, { "entropy": 0.9798619896173477, "epoch": 0.8541337546076883, "grad_norm": 0.2772925794124603, "learning_rate": 0.00019604024146677079, "loss": 0.19996821880340576, "mean_token_accuracy": 0.9175093472003937, "num_tokens": 20008992.0, "step": 1622 }, { "entropy": 0.9713831841945648, "epoch": 0.8546603475513428, "grad_norm": 0.2909282445907593, "learning_rate": 0.00019603380607613994, "loss": 0.21484866738319397, "mean_token_accuracy": 0.9112430512905121, "num_tokens": 20021328.0, "step": 1623 }, { "entropy": 0.9760904163122177, "epoch": 0.8551869404949973, "grad_norm": 0.2880821228027344, "learning_rate": 0.0001960273655781835, "loss": 0.21467523276805878, "mean_token_accuracy": 0.9168452471494675, "num_tokens": 20033664.0, "step": 1624 }, { "entropy": 1.0048719644546509, "epoch": 0.855713533438652, "grad_norm": 0.3039538860321045, "learning_rate": 0.00019602091997328376, "loss": 0.21055804193019867, "mean_token_accuracy": 0.9170923382043839, "num_tokens": 20046000.0, "step": 1625 }, { "entropy": 0.95078045129776, "epoch": 0.8562401263823065, "grad_norm": 0.28427428007125854, "learning_rate": 0.00019601446926182335, "loss": 0.2352895438671112, "mean_token_accuracy": 0.9064240008592606, "num_tokens": 20058336.0, "step": 1626 }, { "entropy": 0.9472018629312515, "epoch": 0.856766719325961, "grad_norm": 0.2894728183746338, "learning_rate": 0.00019600801344418526, "loss": 0.2225104421377182, "mean_token_accuracy": 0.913215383887291, "num_tokens": 20070672.0, "step": 1627 }, { "entropy": 1.0047412514686584, "epoch": 0.8572933122696156, "grad_norm": 0.30747485160827637, "learning_rate": 0.00019600155252075268, "loss": 0.2196165919303894, "mean_token_accuracy": 0.9105159193277359, "num_tokens": 20083008.0, "step": 1628 }, { "entropy": 1.0216589123010635, "epoch": 0.8578199052132701, "grad_norm": 0.2717617452144623, "learning_rate": 0.0001959950864919092, "loss": 0.20522895455360413, "mean_token_accuracy": 0.9180753976106644, "num_tokens": 20095344.0, "step": 1629 }, { "entropy": 1.0321899056434631, "epoch": 0.8583464981569247, "grad_norm": 0.30837494134902954, "learning_rate": 0.00019598861535803863, "loss": 0.21629376709461212, "mean_token_accuracy": 0.9151955991983414, "num_tokens": 20107680.0, "step": 1630 }, { "entropy": 1.0596579015254974, "epoch": 0.8588730911005793, "grad_norm": 0.3152981996536255, "learning_rate": 0.00019598213911952515, "loss": 0.24829894304275513, "mean_token_accuracy": 0.9071104824542999, "num_tokens": 20120016.0, "step": 1631 }, { "entropy": 1.027356281876564, "epoch": 0.8593996840442338, "grad_norm": 0.2758905589580536, "learning_rate": 0.00019597565777675324, "loss": 0.20423409342765808, "mean_token_accuracy": 0.919173076748848, "num_tokens": 20132352.0, "step": 1632 }, { "entropy": 1.0339451730251312, "epoch": 0.8599262769878884, "grad_norm": 0.2790839672088623, "learning_rate": 0.0001959691713301076, "loss": 0.20338216423988342, "mean_token_accuracy": 0.916516900062561, "num_tokens": 20144688.0, "step": 1633 }, { "entropy": 1.0149255990982056, "epoch": 0.8604528699315429, "grad_norm": 0.2958633005619049, "learning_rate": 0.00019596267977997332, "loss": 0.22986331582069397, "mean_token_accuracy": 0.9077225029468536, "num_tokens": 20157024.0, "step": 1634 }, { "entropy": 0.9824042469263077, "epoch": 0.8609794628751974, "grad_norm": 0.2640792429447174, "learning_rate": 0.0001959561831267358, "loss": 0.20994797348976135, "mean_token_accuracy": 0.9186595976352692, "num_tokens": 20169360.0, "step": 1635 }, { "entropy": 0.9684455096721649, "epoch": 0.861506055818852, "grad_norm": 0.2797081768512726, "learning_rate": 0.00019594968137078068, "loss": 0.21638056635856628, "mean_token_accuracy": 0.9145815968513489, "num_tokens": 20181696.0, "step": 1636 }, { "entropy": 0.9729262888431549, "epoch": 0.8620326487625066, "grad_norm": 0.2565400004386902, "learning_rate": 0.0001959431745124939, "loss": 0.20372052490711212, "mean_token_accuracy": 0.9224633723497391, "num_tokens": 20194032.0, "step": 1637 }, { "entropy": 0.9809018820524216, "epoch": 0.8625592417061612, "grad_norm": 0.3174954354763031, "learning_rate": 0.0001959366625522618, "loss": 0.2331572026014328, "mean_token_accuracy": 0.9117663353681564, "num_tokens": 20206368.0, "step": 1638 }, { "entropy": 0.9628456979990005, "epoch": 0.8630858346498157, "grad_norm": 0.2894734740257263, "learning_rate": 0.0001959301454904709, "loss": 0.2223999798297882, "mean_token_accuracy": 0.9094413071870804, "num_tokens": 20218704.0, "step": 1639 }, { "entropy": 1.0126699656248093, "epoch": 0.8636124275934702, "grad_norm": 0.2930248975753784, "learning_rate": 0.0001959236233275081, "loss": 0.21124093234539032, "mean_token_accuracy": 0.9162924438714981, "num_tokens": 20231040.0, "step": 1640 }, { "entropy": 0.9787211865186691, "epoch": 0.8641390205371248, "grad_norm": 0.30070269107818604, "learning_rate": 0.00019591709606376059, "loss": 0.21121284365653992, "mean_token_accuracy": 0.9159329831600189, "num_tokens": 20243376.0, "step": 1641 }, { "entropy": 1.010118991136551, "epoch": 0.8646656134807793, "grad_norm": 0.28400495648384094, "learning_rate": 0.00019591056369961586, "loss": 0.21099403500556946, "mean_token_accuracy": 0.9190017580986023, "num_tokens": 20255712.0, "step": 1642 }, { "entropy": 0.9496536999940872, "epoch": 0.865192206424434, "grad_norm": 0.2675454914569855, "learning_rate": 0.00019590402623546167, "loss": 0.2049626260995865, "mean_token_accuracy": 0.9156690835952759, "num_tokens": 20268048.0, "step": 1643 }, { "entropy": 0.9466981887817383, "epoch": 0.8657187993680885, "grad_norm": 0.30046844482421875, "learning_rate": 0.00019589748367168612, "loss": 0.21190345287322998, "mean_token_accuracy": 0.9161060154438019, "num_tokens": 20280384.0, "step": 1644 }, { "entropy": 1.0232085585594177, "epoch": 0.866245392311743, "grad_norm": 0.3621319532394409, "learning_rate": 0.00019589093600867763, "loss": 0.2193715125322342, "mean_token_accuracy": 0.9074915945529938, "num_tokens": 20292720.0, "step": 1645 }, { "entropy": 0.993518516421318, "epoch": 0.8667719852553976, "grad_norm": 0.28956446051597595, "learning_rate": 0.00019588438324682488, "loss": 0.21250395476818085, "mean_token_accuracy": 0.9168424904346466, "num_tokens": 20305056.0, "step": 1646 }, { "entropy": 0.9817381650209427, "epoch": 0.8672985781990521, "grad_norm": 0.34931275248527527, "learning_rate": 0.00019587782538651687, "loss": 0.2343052327632904, "mean_token_accuracy": 0.9059536755084991, "num_tokens": 20317392.0, "step": 1647 }, { "entropy": 0.9840113967657089, "epoch": 0.8678251711427067, "grad_norm": 0.304169237613678, "learning_rate": 0.00019587126242814288, "loss": 0.20760950446128845, "mean_token_accuracy": 0.9196920245885849, "num_tokens": 20329728.0, "step": 1648 }, { "entropy": 0.99486044049263, "epoch": 0.8683517640863613, "grad_norm": 0.3464246094226837, "learning_rate": 0.00019586469437209256, "loss": 0.25210103392601013, "mean_token_accuracy": 0.9036094397306442, "num_tokens": 20342064.0, "step": 1649 }, { "entropy": 0.9775729477405548, "epoch": 0.8688783570300158, "grad_norm": 0.27859246730804443, "learning_rate": 0.00019585812121875577, "loss": 0.21410948038101196, "mean_token_accuracy": 0.9136857688426971, "num_tokens": 20354400.0, "step": 1650 }, { "entropy": 1.0246230065822601, "epoch": 0.8694049499736703, "grad_norm": 0.28361114859580994, "learning_rate": 0.00019585154296852277, "loss": 0.19681544601917267, "mean_token_accuracy": 0.9178670197725296, "num_tokens": 20366736.0, "step": 1651 }, { "entropy": 0.9918327033519745, "epoch": 0.8699315429173249, "grad_norm": 0.2778252065181732, "learning_rate": 0.00019584495962178403, "loss": 0.20562246441841125, "mean_token_accuracy": 0.9203788787126541, "num_tokens": 20379072.0, "step": 1652 }, { "entropy": 1.0197946578264236, "epoch": 0.8704581358609794, "grad_norm": 0.2764199674129486, "learning_rate": 0.0001958383711789304, "loss": 0.2005048245191574, "mean_token_accuracy": 0.9199100285768509, "num_tokens": 20391408.0, "step": 1653 }, { "entropy": 0.946838304400444, "epoch": 0.8709847288046341, "grad_norm": 0.318099707365036, "learning_rate": 0.00019583177764035295, "loss": 0.18645739555358887, "mean_token_accuracy": 0.9281531125307083, "num_tokens": 20403744.0, "step": 1654 }, { "entropy": 0.9969734102487564, "epoch": 0.8715113217482886, "grad_norm": 0.330425888299942, "learning_rate": 0.00019582517900644313, "loss": 0.2349887192249298, "mean_token_accuracy": 0.9082667678594589, "num_tokens": 20416080.0, "step": 1655 }, { "entropy": 0.9850341528654099, "epoch": 0.8720379146919431, "grad_norm": 0.30549484491348267, "learning_rate": 0.00019581857527759265, "loss": 0.22454282641410828, "mean_token_accuracy": 0.9096111208200455, "num_tokens": 20428416.0, "step": 1656 }, { "entropy": 0.9726726412773132, "epoch": 0.8725645076355977, "grad_norm": 0.26101022958755493, "learning_rate": 0.00019581196645419358, "loss": 0.18027372658252716, "mean_token_accuracy": 0.9280071556568146, "num_tokens": 20440752.0, "step": 1657 }, { "entropy": 1.045421838760376, "epoch": 0.8730911005792522, "grad_norm": 0.31144458055496216, "learning_rate": 0.0001958053525366382, "loss": 0.22132211923599243, "mean_token_accuracy": 0.9151443690061569, "num_tokens": 20453088.0, "step": 1658 }, { "entropy": 1.0683381259441376, "epoch": 0.8736176935229067, "grad_norm": 0.34451693296432495, "learning_rate": 0.0001957987335253191, "loss": 0.2497258186340332, "mean_token_accuracy": 0.9017534852027893, "num_tokens": 20465424.0, "step": 1659 }, { "entropy": 1.0424925982952118, "epoch": 0.8741442864665614, "grad_norm": 0.305476576089859, "learning_rate": 0.00019579210942062932, "loss": 0.21568341553211212, "mean_token_accuracy": 0.913795217871666, "num_tokens": 20477760.0, "step": 1660 }, { "entropy": 1.077263206243515, "epoch": 0.8746708794102159, "grad_norm": 0.28648725152015686, "learning_rate": 0.00019578548022296203, "loss": 0.18887600302696228, "mean_token_accuracy": 0.9262412637472153, "num_tokens": 20490096.0, "step": 1661 }, { "entropy": 1.0266597121953964, "epoch": 0.8751974723538705, "grad_norm": 0.31522682309150696, "learning_rate": 0.00019577884593271076, "loss": 0.21652202308177948, "mean_token_accuracy": 0.907884418964386, "num_tokens": 20502432.0, "step": 1662 }, { "entropy": 1.0532887279987335, "epoch": 0.875724065297525, "grad_norm": 0.25786280632019043, "learning_rate": 0.00019577220655026938, "loss": 0.18014520406723022, "mean_token_accuracy": 0.9304206520318985, "num_tokens": 20514768.0, "step": 1663 }, { "entropy": 1.0302300453186035, "epoch": 0.8762506582411795, "grad_norm": 0.27384263277053833, "learning_rate": 0.000195765562076032, "loss": 0.19573301076889038, "mean_token_accuracy": 0.9229860901832581, "num_tokens": 20527104.0, "step": 1664 }, { "entropy": 1.0142173171043396, "epoch": 0.8767772511848341, "grad_norm": 0.2829652428627014, "learning_rate": 0.0001957589125103931, "loss": 0.19770190119743347, "mean_token_accuracy": 0.9212857335805893, "num_tokens": 20539440.0, "step": 1665 }, { "entropy": 1.030619502067566, "epoch": 0.8773038441284887, "grad_norm": 0.31889650225639343, "learning_rate": 0.0001957522578537474, "loss": 0.21395039558410645, "mean_token_accuracy": 0.9180440455675125, "num_tokens": 20551776.0, "step": 1666 }, { "entropy": 1.0783992409706116, "epoch": 0.8778304370721433, "grad_norm": 0.31347182393074036, "learning_rate": 0.00019574559810648994, "loss": 0.23077845573425293, "mean_token_accuracy": 0.9107988774776459, "num_tokens": 20564112.0, "step": 1667 }, { "entropy": 1.0769988298416138, "epoch": 0.8783570300157978, "grad_norm": 0.30257898569107056, "learning_rate": 0.00019573893326901607, "loss": 0.18793995678424835, "mean_token_accuracy": 0.9216104596853256, "num_tokens": 20576448.0, "step": 1668 }, { "entropy": 1.041060984134674, "epoch": 0.8788836229594523, "grad_norm": 0.29523128271102905, "learning_rate": 0.0001957322633417215, "loss": 0.20431648194789886, "mean_token_accuracy": 0.9192978888750076, "num_tokens": 20588784.0, "step": 1669 }, { "entropy": 1.0586915016174316, "epoch": 0.8794102159031069, "grad_norm": 0.29364022612571716, "learning_rate": 0.0001957255883250021, "loss": 0.22029076516628265, "mean_token_accuracy": 0.9125624299049377, "num_tokens": 20601120.0, "step": 1670 }, { "entropy": 1.0633411705493927, "epoch": 0.8799368088467614, "grad_norm": 0.2905363440513611, "learning_rate": 0.00019571890821925417, "loss": 0.19489197432994843, "mean_token_accuracy": 0.9242742508649826, "num_tokens": 20613456.0, "step": 1671 }, { "entropy": 1.135309487581253, "epoch": 0.880463401790416, "grad_norm": 0.3044449985027313, "learning_rate": 0.0001957122230248743, "loss": 0.19300708174705505, "mean_token_accuracy": 0.9245816022157669, "num_tokens": 20625792.0, "step": 1672 }, { "entropy": 1.0445529222488403, "epoch": 0.8809899947340706, "grad_norm": 0.28844696283340454, "learning_rate": 0.00019570553274225928, "loss": 0.20883029699325562, "mean_token_accuracy": 0.9140314012765884, "num_tokens": 20638128.0, "step": 1673 }, { "entropy": 1.1107747852802277, "epoch": 0.8815165876777251, "grad_norm": 0.32846325635910034, "learning_rate": 0.00019569883737180634, "loss": 0.24370679259300232, "mean_token_accuracy": 0.901743620634079, "num_tokens": 20650464.0, "step": 1674 }, { "entropy": 1.1209677755832672, "epoch": 0.8820431806213797, "grad_norm": 0.2889225482940674, "learning_rate": 0.0001956921369139129, "loss": 0.21621105074882507, "mean_token_accuracy": 0.9143183678388596, "num_tokens": 20662800.0, "step": 1675 }, { "entropy": 1.0856188535690308, "epoch": 0.8825697735650342, "grad_norm": 0.27882513403892517, "learning_rate": 0.00019568543136897675, "loss": 0.21793431043624878, "mean_token_accuracy": 0.9142801910638809, "num_tokens": 20675136.0, "step": 1676 }, { "entropy": 1.0983311533927917, "epoch": 0.8830963665086888, "grad_norm": 0.272402822971344, "learning_rate": 0.00019567872073739595, "loss": 0.20574277639389038, "mean_token_accuracy": 0.9181714653968811, "num_tokens": 20687472.0, "step": 1677 }, { "entropy": 1.0844581425189972, "epoch": 0.8836229594523434, "grad_norm": 0.27611178159713745, "learning_rate": 0.0001956720050195689, "loss": 0.2087741196155548, "mean_token_accuracy": 0.9139288067817688, "num_tokens": 20699808.0, "step": 1678 }, { "entropy": 1.12508624792099, "epoch": 0.8841495523959979, "grad_norm": 0.29753515124320984, "learning_rate": 0.0001956652842158942, "loss": 0.20983164012432098, "mean_token_accuracy": 0.9156063199043274, "num_tokens": 20712144.0, "step": 1679 }, { "entropy": 1.1237779259681702, "epoch": 0.8846761453396524, "grad_norm": 0.2853649854660034, "learning_rate": 0.00019565855832677086, "loss": 0.20436659455299377, "mean_token_accuracy": 0.9203456342220306, "num_tokens": 20724480.0, "step": 1680 }, { "entropy": 1.1044580936431885, "epoch": 0.885202738283307, "grad_norm": 0.2854003608226776, "learning_rate": 0.00019565182735259822, "loss": 0.2195129096508026, "mean_token_accuracy": 0.9125242233276367, "num_tokens": 20736816.0, "step": 1681 }, { "entropy": 1.084385484457016, "epoch": 0.8857293312269615, "grad_norm": 0.29433006048202515, "learning_rate": 0.0001956450912937758, "loss": 0.2089007943868637, "mean_token_accuracy": 0.9135125875473022, "num_tokens": 20749152.0, "step": 1682 }, { "entropy": 1.0872920453548431, "epoch": 0.8862559241706162, "grad_norm": 0.2716350555419922, "learning_rate": 0.00019563835015070348, "loss": 0.20034612715244293, "mean_token_accuracy": 0.9140070527791977, "num_tokens": 20761488.0, "step": 1683 }, { "entropy": 1.0698755085468292, "epoch": 0.8867825171142707, "grad_norm": 0.263379842042923, "learning_rate": 0.00019563160392378144, "loss": 0.2013968825340271, "mean_token_accuracy": 0.920297846198082, "num_tokens": 20773824.0, "step": 1684 }, { "entropy": 1.0688921809196472, "epoch": 0.8873091100579252, "grad_norm": 0.2941676676273346, "learning_rate": 0.00019562485261341017, "loss": 0.222881019115448, "mean_token_accuracy": 0.9110155403614044, "num_tokens": 20786160.0, "step": 1685 }, { "entropy": 1.0462908446788788, "epoch": 0.8878357030015798, "grad_norm": 0.2833232581615448, "learning_rate": 0.00019561809621999047, "loss": 0.2037080079317093, "mean_token_accuracy": 0.9212964028120041, "num_tokens": 20798496.0, "step": 1686 }, { "entropy": 1.0370090901851654, "epoch": 0.8883622959452343, "grad_norm": 0.299941748380661, "learning_rate": 0.0001956113347439234, "loss": 0.21904562413692474, "mean_token_accuracy": 0.9075719863176346, "num_tokens": 20810832.0, "step": 1687 }, { "entropy": 1.0448128283023834, "epoch": 0.8888888888888888, "grad_norm": 0.2878952920436859, "learning_rate": 0.0001956045681856104, "loss": 0.2038077563047409, "mean_token_accuracy": 0.9187713265419006, "num_tokens": 20823168.0, "step": 1688 }, { "entropy": 1.0190322399139404, "epoch": 0.8894154818325435, "grad_norm": 0.34769734740257263, "learning_rate": 0.0001955977965454531, "loss": 0.213621124625206, "mean_token_accuracy": 0.9181492775678635, "num_tokens": 20835504.0, "step": 1689 }, { "entropy": 1.0234404504299164, "epoch": 0.889942074776198, "grad_norm": 0.2829277813434601, "learning_rate": 0.00019559101982385356, "loss": 0.20716841518878937, "mean_token_accuracy": 0.9201241731643677, "num_tokens": 20847840.0, "step": 1690 }, { "entropy": 1.0015476644039154, "epoch": 0.8904686677198526, "grad_norm": 0.26036950945854187, "learning_rate": 0.000195584238021214, "loss": 0.18766967952251434, "mean_token_accuracy": 0.9250665605068207, "num_tokens": 20860176.0, "step": 1691 }, { "entropy": 1.032362923026085, "epoch": 0.8909952606635071, "grad_norm": 0.4818808138370514, "learning_rate": 0.00019557745113793704, "loss": 0.19411087036132812, "mean_token_accuracy": 0.921613797545433, "num_tokens": 20872512.0, "step": 1692 }, { "entropy": 0.9709571003913879, "epoch": 0.8915218536071616, "grad_norm": 0.2804003655910492, "learning_rate": 0.0001955706591744256, "loss": 0.21858839690685272, "mean_token_accuracy": 0.9120522737503052, "num_tokens": 20884848.0, "step": 1693 }, { "entropy": 1.0739005506038666, "epoch": 0.8920484465508162, "grad_norm": 0.2946876585483551, "learning_rate": 0.00019556386213108288, "loss": 0.19359217584133148, "mean_token_accuracy": 0.925596609711647, "num_tokens": 20897184.0, "step": 1694 }, { "entropy": 1.0181286334991455, "epoch": 0.8925750394944708, "grad_norm": 0.3197228014469147, "learning_rate": 0.00019555706000831235, "loss": 0.2175355702638626, "mean_token_accuracy": 0.9139997512102127, "num_tokens": 20909520.0, "step": 1695 }, { "entropy": 1.0345196276903152, "epoch": 0.8931016324381253, "grad_norm": 0.29833653569221497, "learning_rate": 0.00019555025280651786, "loss": 0.2255219966173172, "mean_token_accuracy": 0.9102495014667511, "num_tokens": 20921856.0, "step": 1696 }, { "entropy": 0.9587903320789337, "epoch": 0.8936282253817799, "grad_norm": 0.2722357511520386, "learning_rate": 0.00019554344052610348, "loss": 0.19479139149188995, "mean_token_accuracy": 0.9188268184661865, "num_tokens": 20934192.0, "step": 1697 }, { "entropy": 0.9713253229856491, "epoch": 0.8941548183254344, "grad_norm": 0.2900646924972534, "learning_rate": 0.0001955366231674736, "loss": 0.20535482466220856, "mean_token_accuracy": 0.9150903820991516, "num_tokens": 20946528.0, "step": 1698 }, { "entropy": 1.020512416958809, "epoch": 0.894681411269089, "grad_norm": 0.2782817780971527, "learning_rate": 0.00019552980073103297, "loss": 0.20126226544380188, "mean_token_accuracy": 0.9161560386419296, "num_tokens": 20958864.0, "step": 1699 }, { "entropy": 0.9827070981264114, "epoch": 0.8952080042127436, "grad_norm": 0.2738768458366394, "learning_rate": 0.00019552297321718658, "loss": 0.19939669966697693, "mean_token_accuracy": 0.9180780202150345, "num_tokens": 20971200.0, "step": 1700 }, { "entropy": 0.9992471039295197, "epoch": 0.8957345971563981, "grad_norm": 0.31194329261779785, "learning_rate": 0.0001955161406263397, "loss": 0.23202218115329742, "mean_token_accuracy": 0.9068114459514618, "num_tokens": 20983536.0, "step": 1701 }, { "entropy": 0.9976187497377396, "epoch": 0.8962611901000527, "grad_norm": 0.29019710421562195, "learning_rate": 0.00019550930295889803, "loss": 0.21963413059711456, "mean_token_accuracy": 0.9133173823356628, "num_tokens": 20995872.0, "step": 1702 }, { "entropy": 1.0274995416402817, "epoch": 0.8967877830437072, "grad_norm": 0.2910099923610687, "learning_rate": 0.00019550246021526736, "loss": 0.20295658707618713, "mean_token_accuracy": 0.9164696484804153, "num_tokens": 21008208.0, "step": 1703 }, { "entropy": 1.0305428206920624, "epoch": 0.8973143759873617, "grad_norm": 0.3525075912475586, "learning_rate": 0.000195495612395854, "loss": 0.20155680179595947, "mean_token_accuracy": 0.9174475073814392, "num_tokens": 21020544.0, "step": 1704 }, { "entropy": 1.0068664401769638, "epoch": 0.8978409689310163, "grad_norm": 0.33528581261634827, "learning_rate": 0.00019548875950106448, "loss": 0.22776372730731964, "mean_token_accuracy": 0.906059592962265, "num_tokens": 21032880.0, "step": 1705 }, { "entropy": 1.0565652251243591, "epoch": 0.8983675618746709, "grad_norm": 0.29654526710510254, "learning_rate": 0.00019548190153130553, "loss": 0.23316293954849243, "mean_token_accuracy": 0.9070921689271927, "num_tokens": 21045216.0, "step": 1706 }, { "entropy": 0.9845771491527557, "epoch": 0.8988941548183255, "grad_norm": 0.3172268271446228, "learning_rate": 0.00019547503848698435, "loss": 0.22646287083625793, "mean_token_accuracy": 0.9135229587554932, "num_tokens": 21057552.0, "step": 1707 }, { "entropy": 1.014034628868103, "epoch": 0.89942074776198, "grad_norm": 0.27241358160972595, "learning_rate": 0.00019546817036850827, "loss": 0.21421730518341064, "mean_token_accuracy": 0.9127627313137054, "num_tokens": 21069888.0, "step": 1708 }, { "entropy": 1.044843077659607, "epoch": 0.8999473407056345, "grad_norm": 0.27422401309013367, "learning_rate": 0.00019546129717628512, "loss": 0.22259175777435303, "mean_token_accuracy": 0.90959133207798, "num_tokens": 21082224.0, "step": 1709 }, { "entropy": 1.0896000117063522, "epoch": 0.9004739336492891, "grad_norm": 0.31072503328323364, "learning_rate": 0.00019545441891072283, "loss": 0.21754461526870728, "mean_token_accuracy": 0.9161411225795746, "num_tokens": 21094560.0, "step": 1710 }, { "entropy": 1.0415829718112946, "epoch": 0.9010005265929436, "grad_norm": 0.261515736579895, "learning_rate": 0.00019544753557222975, "loss": 0.1926898956298828, "mean_token_accuracy": 0.9213140159845352, "num_tokens": 21106896.0, "step": 1711 }, { "entropy": 1.0076445639133453, "epoch": 0.9015271195365983, "grad_norm": 0.26134979724884033, "learning_rate": 0.00019544064716121452, "loss": 0.20023104548454285, "mean_token_accuracy": 0.9194119721651077, "num_tokens": 21119232.0, "step": 1712 }, { "entropy": 1.007362276315689, "epoch": 0.9020537124802528, "grad_norm": 0.2691597044467926, "learning_rate": 0.00019543375367808604, "loss": 0.19764183461666107, "mean_token_accuracy": 0.9207281470298767, "num_tokens": 21131568.0, "step": 1713 }, { "entropy": 1.0264256298542023, "epoch": 0.9025803054239073, "grad_norm": 0.2841010093688965, "learning_rate": 0.00019542685512325357, "loss": 0.19019414484500885, "mean_token_accuracy": 0.9279275834560394, "num_tokens": 21143904.0, "step": 1714 }, { "entropy": 1.0494853258132935, "epoch": 0.9031068983675619, "grad_norm": 0.2881733477115631, "learning_rate": 0.00019541995149712662, "loss": 0.19694221019744873, "mean_token_accuracy": 0.9203800857067108, "num_tokens": 21156240.0, "step": 1715 }, { "entropy": 1.029950574040413, "epoch": 0.9036334913112164, "grad_norm": 0.2856560945510864, "learning_rate": 0.00019541304280011498, "loss": 0.208457350730896, "mean_token_accuracy": 0.9130570143461227, "num_tokens": 21168576.0, "step": 1716 }, { "entropy": 1.036653459072113, "epoch": 0.9041600842548709, "grad_norm": 0.35959112644195557, "learning_rate": 0.00019540612903262887, "loss": 0.2388800084590912, "mean_token_accuracy": 0.909120500087738, "num_tokens": 21180912.0, "step": 1717 }, { "entropy": 1.00953871011734, "epoch": 0.9046866771985256, "grad_norm": 0.3067711293697357, "learning_rate": 0.00019539921019507862, "loss": 0.2145732194185257, "mean_token_accuracy": 0.9115498811006546, "num_tokens": 21193248.0, "step": 1718 }, { "entropy": 0.9901564866304398, "epoch": 0.9052132701421801, "grad_norm": 0.3036840856075287, "learning_rate": 0.00019539228628787501, "loss": 0.2193184792995453, "mean_token_accuracy": 0.9104121774435043, "num_tokens": 21205584.0, "step": 1719 }, { "entropy": 0.9771833568811417, "epoch": 0.9057398630858347, "grad_norm": 0.32093900442123413, "learning_rate": 0.00019538535731142907, "loss": 0.23529593646526337, "mean_token_accuracy": 0.9093421250581741, "num_tokens": 21217920.0, "step": 1720 }, { "entropy": 1.011559009552002, "epoch": 0.9062664560294892, "grad_norm": 0.2692308723926544, "learning_rate": 0.00019537842326615215, "loss": 0.20593476295471191, "mean_token_accuracy": 0.9199935644865036, "num_tokens": 21230256.0, "step": 1721 }, { "entropy": 1.073755070567131, "epoch": 0.9067930489731437, "grad_norm": 0.3065417408943176, "learning_rate": 0.00019537148415245582, "loss": 0.23454323410987854, "mean_token_accuracy": 0.9069335609674454, "num_tokens": 21242592.0, "step": 1722 }, { "entropy": 1.0648082047700882, "epoch": 0.9073196419167984, "grad_norm": 0.32037290930747986, "learning_rate": 0.0001953645399707521, "loss": 0.2138725221157074, "mean_token_accuracy": 0.9131258726119995, "num_tokens": 21254928.0, "step": 1723 }, { "entropy": 1.0663966238498688, "epoch": 0.9078462348604529, "grad_norm": 0.2899954915046692, "learning_rate": 0.00019535759072145318, "loss": 0.204481303691864, "mean_token_accuracy": 0.9170624017715454, "num_tokens": 21267264.0, "step": 1724 }, { "entropy": 1.020171880722046, "epoch": 0.9083728278041074, "grad_norm": 0.29145675897598267, "learning_rate": 0.0001953506364049716, "loss": 0.21512804925441742, "mean_token_accuracy": 0.9173563122749329, "num_tokens": 21279600.0, "step": 1725 }, { "entropy": 1.0235641449689865, "epoch": 0.908899420747762, "grad_norm": 0.27262571454048157, "learning_rate": 0.00019534367702172016, "loss": 0.22479593753814697, "mean_token_accuracy": 0.9110193848609924, "num_tokens": 21291936.0, "step": 1726 }, { "entropy": 0.9845803081989288, "epoch": 0.9094260136914165, "grad_norm": 0.2786709666252136, "learning_rate": 0.00019533671257211205, "loss": 0.2018449455499649, "mean_token_accuracy": 0.9166059494018555, "num_tokens": 21304272.0, "step": 1727 }, { "entropy": 0.9907389134168625, "epoch": 0.909952606635071, "grad_norm": 0.2637747526168823, "learning_rate": 0.00019532974305656075, "loss": 0.211765855550766, "mean_token_accuracy": 0.9151495099067688, "num_tokens": 21316608.0, "step": 1728 }, { "entropy": 1.0142314583063126, "epoch": 0.9104791995787257, "grad_norm": 0.2817028760910034, "learning_rate": 0.0001953227684754799, "loss": 0.19784370064735413, "mean_token_accuracy": 0.9207914024591446, "num_tokens": 21328944.0, "step": 1729 }, { "entropy": 1.0088147670030594, "epoch": 0.9110057925223802, "grad_norm": 0.2688204050064087, "learning_rate": 0.00019531578882928357, "loss": 0.20449689030647278, "mean_token_accuracy": 0.9207023978233337, "num_tokens": 21341280.0, "step": 1730 }, { "entropy": 0.9528838694095612, "epoch": 0.9115323854660348, "grad_norm": 0.27442365884780884, "learning_rate": 0.00019530880411838616, "loss": 0.21661211550235748, "mean_token_accuracy": 0.9121255576610565, "num_tokens": 21353616.0, "step": 1731 }, { "entropy": 0.9663679003715515, "epoch": 0.9120589784096893, "grad_norm": 0.2818276584148407, "learning_rate": 0.00019530181434320224, "loss": 0.21009200811386108, "mean_token_accuracy": 0.9155483096837997, "num_tokens": 21365952.0, "step": 1732 }, { "entropy": 0.9394736588001251, "epoch": 0.9125855713533438, "grad_norm": 0.3315548598766327, "learning_rate": 0.0001952948195041468, "loss": 0.21075570583343506, "mean_token_accuracy": 0.9181785732507706, "num_tokens": 21378288.0, "step": 1733 }, { "entropy": 0.9442544430494308, "epoch": 0.9131121642969984, "grad_norm": 0.3284794092178345, "learning_rate": 0.000195287819601635, "loss": 0.23087412118911743, "mean_token_accuracy": 0.9092219769954681, "num_tokens": 21390624.0, "step": 1734 }, { "entropy": 0.9372933954000473, "epoch": 0.913638757240653, "grad_norm": 0.29973915219306946, "learning_rate": 0.0001952808146360825, "loss": 0.2058921754360199, "mean_token_accuracy": 0.9160513281822205, "num_tokens": 21402960.0, "step": 1735 }, { "entropy": 0.9260263890028, "epoch": 0.9141653501843076, "grad_norm": 0.2917967438697815, "learning_rate": 0.00019527380460790508, "loss": 0.2268896996974945, "mean_token_accuracy": 0.9107523709535599, "num_tokens": 21415296.0, "step": 1736 }, { "entropy": 0.9555350244045258, "epoch": 0.9146919431279621, "grad_norm": 0.2836836874485016, "learning_rate": 0.0001952667895175189, "loss": 0.21083997189998627, "mean_token_accuracy": 0.9108854085206985, "num_tokens": 21427632.0, "step": 1737 }, { "entropy": 0.9710684269666672, "epoch": 0.9152185360716166, "grad_norm": 0.3263842761516571, "learning_rate": 0.00019525976936534035, "loss": 0.19704914093017578, "mean_token_accuracy": 0.9213050603866577, "num_tokens": 21439968.0, "step": 1738 }, { "entropy": 0.920185998082161, "epoch": 0.9157451290152712, "grad_norm": 0.3038593828678131, "learning_rate": 0.00019525274415178626, "loss": 0.2302832156419754, "mean_token_accuracy": 0.9091469496488571, "num_tokens": 21452304.0, "step": 1739 }, { "entropy": 0.9555569142103195, "epoch": 0.9162717219589257, "grad_norm": 0.3209346532821655, "learning_rate": 0.00019524571387727365, "loss": 0.2268507480621338, "mean_token_accuracy": 0.9097347557544708, "num_tokens": 21464640.0, "step": 1740 }, { "entropy": 0.9613929092884064, "epoch": 0.9167983149025803, "grad_norm": 0.28639957308769226, "learning_rate": 0.0001952386785422199, "loss": 0.22456036508083344, "mean_token_accuracy": 0.9144959151744843, "num_tokens": 21476976.0, "step": 1741 }, { "entropy": 0.9676374346017838, "epoch": 0.9173249078462349, "grad_norm": 0.29118600487709045, "learning_rate": 0.00019523163814704253, "loss": 0.21779820322990417, "mean_token_accuracy": 0.9170442819595337, "num_tokens": 21489312.0, "step": 1742 }, { "entropy": 0.9580910950899124, "epoch": 0.9178515007898894, "grad_norm": 0.28892767429351807, "learning_rate": 0.0001952245926921596, "loss": 0.1965646892786026, "mean_token_accuracy": 0.9236303865909576, "num_tokens": 21501648.0, "step": 1743 }, { "entropy": 1.0211364477872849, "epoch": 0.918378093733544, "grad_norm": 0.2978745996952057, "learning_rate": 0.00019521754217798935, "loss": 0.2231602966785431, "mean_token_accuracy": 0.9130188077688217, "num_tokens": 21513984.0, "step": 1744 }, { "entropy": 0.9940465688705444, "epoch": 0.9189046866771985, "grad_norm": 0.2930096685886383, "learning_rate": 0.00019521048660495026, "loss": 0.19159580767154694, "mean_token_accuracy": 0.9195211082696915, "num_tokens": 21526320.0, "step": 1745 }, { "entropy": 0.9247337281703949, "epoch": 0.919431279620853, "grad_norm": 0.2832118570804596, "learning_rate": 0.00019520342597346125, "loss": 0.21378204226493835, "mean_token_accuracy": 0.9141468554735184, "num_tokens": 21538656.0, "step": 1746 }, { "entropy": 0.9416433870792389, "epoch": 0.9199578725645077, "grad_norm": 0.3025250732898712, "learning_rate": 0.00019519636028394148, "loss": 0.21570643782615662, "mean_token_accuracy": 0.9150727838277817, "num_tokens": 21550992.0, "step": 1747 }, { "entropy": 0.9537800550460815, "epoch": 0.9204844655081622, "grad_norm": 0.29714229702949524, "learning_rate": 0.00019518928953681032, "loss": 0.22764158248901367, "mean_token_accuracy": 0.9034122675657272, "num_tokens": 21563328.0, "step": 1748 }, { "entropy": 0.9719788879156113, "epoch": 0.9210110584518167, "grad_norm": 0.2960829734802246, "learning_rate": 0.00019518221373248756, "loss": 0.2084151953458786, "mean_token_accuracy": 0.9151151925325394, "num_tokens": 21575664.0, "step": 1749 }, { "entropy": 0.9682374745607376, "epoch": 0.9215376513954713, "grad_norm": 0.2902142405509949, "learning_rate": 0.00019517513287139326, "loss": 0.19477756321430206, "mean_token_accuracy": 0.9197756201028824, "num_tokens": 21588000.0, "step": 1750 }, { "entropy": 0.9519971162080765, "epoch": 0.9220642443391258, "grad_norm": 0.28657373785972595, "learning_rate": 0.00019516804695394777, "loss": 0.23340506851673126, "mean_token_accuracy": 0.9101651012897491, "num_tokens": 21600336.0, "step": 1751 }, { "entropy": 0.9670501947402954, "epoch": 0.9225908372827805, "grad_norm": 0.2798555791378021, "learning_rate": 0.00019516095598057174, "loss": 0.2065662145614624, "mean_token_accuracy": 0.9186369478702545, "num_tokens": 21612672.0, "step": 1752 }, { "entropy": 0.9457984417676926, "epoch": 0.923117430226435, "grad_norm": 0.2589358985424042, "learning_rate": 0.00019515385995168608, "loss": 0.1857452392578125, "mean_token_accuracy": 0.9278716593980789, "num_tokens": 21625008.0, "step": 1753 }, { "entropy": 0.923014685511589, "epoch": 0.9236440231700895, "grad_norm": 0.29148226976394653, "learning_rate": 0.00019514675886771207, "loss": 0.21651901304721832, "mean_token_accuracy": 0.9152826964855194, "num_tokens": 21637344.0, "step": 1754 }, { "entropy": 0.95480976998806, "epoch": 0.9241706161137441, "grad_norm": 0.28343141078948975, "learning_rate": 0.00019513965272907128, "loss": 0.2175363004207611, "mean_token_accuracy": 0.9101854413747787, "num_tokens": 21649680.0, "step": 1755 }, { "entropy": 0.9613447189331055, "epoch": 0.9246972090573986, "grad_norm": 0.3009392023086548, "learning_rate": 0.0001951325415361855, "loss": 0.22403854131698608, "mean_token_accuracy": 0.9168571084737778, "num_tokens": 21662016.0, "step": 1756 }, { "entropy": 0.9929066747426987, "epoch": 0.9252238020010531, "grad_norm": 0.3036598563194275, "learning_rate": 0.00019512542528947696, "loss": 0.22976119816303253, "mean_token_accuracy": 0.9101551920175552, "num_tokens": 21674352.0, "step": 1757 }, { "entropy": 0.968064159154892, "epoch": 0.9257503949447078, "grad_norm": 0.28782951831817627, "learning_rate": 0.00019511830398936809, "loss": 0.21798846125602722, "mean_token_accuracy": 0.9074330925941467, "num_tokens": 21686688.0, "step": 1758 }, { "entropy": 0.9647489339113235, "epoch": 0.9262769878883623, "grad_norm": 0.2734207212924957, "learning_rate": 0.00019511117763628156, "loss": 0.209343820810318, "mean_token_accuracy": 0.9190388172864914, "num_tokens": 21699024.0, "step": 1759 }, { "entropy": 0.9990984350442886, "epoch": 0.9268035808320169, "grad_norm": 0.26921236515045166, "learning_rate": 0.00019510404623064053, "loss": 0.21170470118522644, "mean_token_accuracy": 0.9162604361772537, "num_tokens": 21711360.0, "step": 1760 }, { "entropy": 0.9623449593782425, "epoch": 0.9273301737756714, "grad_norm": 0.2714099884033203, "learning_rate": 0.00019509690977286825, "loss": 0.21800348162651062, "mean_token_accuracy": 0.9147970378398895, "num_tokens": 21723696.0, "step": 1761 }, { "entropy": 1.0402387380599976, "epoch": 0.9278567667193259, "grad_norm": 0.2736240327358246, "learning_rate": 0.00019508976826338844, "loss": 0.22173887491226196, "mean_token_accuracy": 0.9075192958116531, "num_tokens": 21736032.0, "step": 1762 }, { "entropy": 1.0271132439374924, "epoch": 0.9283833596629805, "grad_norm": 0.2877287268638611, "learning_rate": 0.00019508262170262502, "loss": 0.21932274103164673, "mean_token_accuracy": 0.915712833404541, "num_tokens": 21748368.0, "step": 1763 }, { "entropy": 1.034477338194847, "epoch": 0.9289099526066351, "grad_norm": 0.2779938280582428, "learning_rate": 0.0001950754700910023, "loss": 0.207020103931427, "mean_token_accuracy": 0.9147273898124695, "num_tokens": 21760704.0, "step": 1764 }, { "entropy": 0.9738915860652924, "epoch": 0.9294365455502897, "grad_norm": 0.25146281719207764, "learning_rate": 0.00019506831342894473, "loss": 0.1815354973077774, "mean_token_accuracy": 0.9243048876523972, "num_tokens": 21773040.0, "step": 1765 }, { "entropy": 0.9640511274337769, "epoch": 0.9299631384939442, "grad_norm": 0.2794640362262726, "learning_rate": 0.0001950611517168772, "loss": 0.222852423787117, "mean_token_accuracy": 0.9066295772790909, "num_tokens": 21785376.0, "step": 1766 }, { "entropy": 0.9703959077596664, "epoch": 0.9304897314375987, "grad_norm": 0.2606351971626282, "learning_rate": 0.00019505398495522487, "loss": 0.1913529932498932, "mean_token_accuracy": 0.9248643219470978, "num_tokens": 21797712.0, "step": 1767 }, { "entropy": 0.9996339529752731, "epoch": 0.9310163243812533, "grad_norm": 0.310641884803772, "learning_rate": 0.00019504681314441323, "loss": 0.22644834220409393, "mean_token_accuracy": 0.9118537902832031, "num_tokens": 21810048.0, "step": 1768 }, { "entropy": 0.9964617937803268, "epoch": 0.9315429173249078, "grad_norm": 0.2875900864601135, "learning_rate": 0.00019503963628486793, "loss": 0.2038813978433609, "mean_token_accuracy": 0.9186841398477554, "num_tokens": 21822384.0, "step": 1769 }, { "entropy": 0.9495928287506104, "epoch": 0.9320695102685624, "grad_norm": 0.2897108495235443, "learning_rate": 0.00019503245437701508, "loss": 0.20874524116516113, "mean_token_accuracy": 0.9164410084486008, "num_tokens": 21834720.0, "step": 1770 }, { "entropy": 1.0277469605207443, "epoch": 0.932596103212217, "grad_norm": 0.31645241379737854, "learning_rate": 0.00019502526742128104, "loss": 0.2254372090101242, "mean_token_accuracy": 0.9089788496494293, "num_tokens": 21847056.0, "step": 1771 }, { "entropy": 1.041675180196762, "epoch": 0.9331226961558715, "grad_norm": 0.3042741119861603, "learning_rate": 0.00019501807541809243, "loss": 0.21151864528656006, "mean_token_accuracy": 0.9152505397796631, "num_tokens": 21859392.0, "step": 1772 }, { "entropy": 1.0295332968235016, "epoch": 0.933649289099526, "grad_norm": 0.32914313673973083, "learning_rate": 0.00019501087836787623, "loss": 0.2500017285346985, "mean_token_accuracy": 0.8985483199357986, "num_tokens": 21871728.0, "step": 1773 }, { "entropy": 1.0453828126192093, "epoch": 0.9341758820431806, "grad_norm": 0.2983553111553192, "learning_rate": 0.00019500367627105965, "loss": 0.21561893820762634, "mean_token_accuracy": 0.9130748361349106, "num_tokens": 21884064.0, "step": 1774 }, { "entropy": 1.002024069428444, "epoch": 0.9347024749868352, "grad_norm": 0.28427883982658386, "learning_rate": 0.00019499646912807023, "loss": 0.22381159663200378, "mean_token_accuracy": 0.9057275652885437, "num_tokens": 21896400.0, "step": 1775 }, { "entropy": 1.0608263909816742, "epoch": 0.9352290679304898, "grad_norm": 0.27167659997940063, "learning_rate": 0.00019498925693933584, "loss": 0.1875414401292801, "mean_token_accuracy": 0.9234858453273773, "num_tokens": 21908736.0, "step": 1776 }, { "entropy": 1.0062582045793533, "epoch": 0.9357556608741443, "grad_norm": 0.2636836767196655, "learning_rate": 0.00019498203970528462, "loss": 0.21502971649169922, "mean_token_accuracy": 0.919221356511116, "num_tokens": 21921072.0, "step": 1777 }, { "entropy": 1.006988525390625, "epoch": 0.9362822538177988, "grad_norm": 0.26056134700775146, "learning_rate": 0.00019497481742634503, "loss": 0.201970174908638, "mean_token_accuracy": 0.9196654409170151, "num_tokens": 21933408.0, "step": 1778 }, { "entropy": 1.0629092454910278, "epoch": 0.9368088467614534, "grad_norm": 0.29083991050720215, "learning_rate": 0.00019496759010294577, "loss": 0.22228607535362244, "mean_token_accuracy": 0.9100936055183411, "num_tokens": 21945744.0, "step": 1779 }, { "entropy": 1.0019027441740036, "epoch": 0.9373354397051079, "grad_norm": 0.2699200212955475, "learning_rate": 0.00019496035773551592, "loss": 0.22549045085906982, "mean_token_accuracy": 0.9094872325658798, "num_tokens": 21958080.0, "step": 1780 }, { "entropy": 1.0057822614908218, "epoch": 0.9378620326487626, "grad_norm": 0.28440120816230774, "learning_rate": 0.00019495312032448485, "loss": 0.22345775365829468, "mean_token_accuracy": 0.9118607193231583, "num_tokens": 21970416.0, "step": 1781 }, { "entropy": 1.0094308406114578, "epoch": 0.9383886255924171, "grad_norm": 0.2834523320198059, "learning_rate": 0.00019494587787028216, "loss": 0.22185727953910828, "mean_token_accuracy": 0.9113683104515076, "num_tokens": 21982752.0, "step": 1782 }, { "entropy": 0.9964211732149124, "epoch": 0.9389152185360716, "grad_norm": 0.2954987585544586, "learning_rate": 0.00019493863037333778, "loss": 0.20775803923606873, "mean_token_accuracy": 0.9154636561870575, "num_tokens": 21995088.0, "step": 1783 }, { "entropy": 1.0346784442663193, "epoch": 0.9394418114797262, "grad_norm": 0.2964785695075989, "learning_rate": 0.000194931377834082, "loss": 0.2272047996520996, "mean_token_accuracy": 0.9083570241928101, "num_tokens": 22007424.0, "step": 1784 }, { "entropy": 1.0281512439250946, "epoch": 0.9399684044233807, "grad_norm": 0.26846325397491455, "learning_rate": 0.00019492412025294534, "loss": 0.20067930221557617, "mean_token_accuracy": 0.9195989966392517, "num_tokens": 22019760.0, "step": 1785 }, { "entropy": 0.9764789193868637, "epoch": 0.9404949973670352, "grad_norm": 0.26383689045906067, "learning_rate": 0.0001949168576303586, "loss": 0.2051767259836197, "mean_token_accuracy": 0.92010198533535, "num_tokens": 22032096.0, "step": 1786 }, { "entropy": 1.078786700963974, "epoch": 0.9410215903106899, "grad_norm": 0.3011668920516968, "learning_rate": 0.000194909589966753, "loss": 0.221777081489563, "mean_token_accuracy": 0.9121461063623428, "num_tokens": 22044432.0, "step": 1787 }, { "entropy": 0.9719114750623703, "epoch": 0.9415481832543444, "grad_norm": 0.27153825759887695, "learning_rate": 0.0001949023172625599, "loss": 0.21883930265903473, "mean_token_accuracy": 0.913441613316536, "num_tokens": 22056768.0, "step": 1788 }, { "entropy": 0.9923989027738571, "epoch": 0.942074776197999, "grad_norm": 0.3212338984012604, "learning_rate": 0.00019489503951821107, "loss": 0.22175338864326477, "mean_token_accuracy": 0.9168316125869751, "num_tokens": 22069104.0, "step": 1789 }, { "entropy": 0.9783156663179398, "epoch": 0.9426013691416535, "grad_norm": 0.273110568523407, "learning_rate": 0.00019488775673413857, "loss": 0.21147552132606506, "mean_token_accuracy": 0.9130014330148697, "num_tokens": 22081440.0, "step": 1790 }, { "entropy": 0.9893038272857666, "epoch": 0.943127962085308, "grad_norm": 0.2790793478488922, "learning_rate": 0.00019488046891077474, "loss": 0.22615540027618408, "mean_token_accuracy": 0.9109261482954025, "num_tokens": 22093776.0, "step": 1791 }, { "entropy": 1.0380553901195526, "epoch": 0.9436545550289626, "grad_norm": 0.27198460698127747, "learning_rate": 0.00019487317604855212, "loss": 0.205999955534935, "mean_token_accuracy": 0.9175222963094711, "num_tokens": 22106112.0, "step": 1792 }, { "entropy": 1.0116278380155563, "epoch": 0.9441811479726172, "grad_norm": 0.2635519504547119, "learning_rate": 0.00019486587814790377, "loss": 0.21772751212120056, "mean_token_accuracy": 0.9136025160551071, "num_tokens": 22118448.0, "step": 1793 }, { "entropy": 1.0237055569887161, "epoch": 0.9447077409162717, "grad_norm": 0.2741040289402008, "learning_rate": 0.00019485857520926288, "loss": 0.20760180056095123, "mean_token_accuracy": 0.9132292419672012, "num_tokens": 22130784.0, "step": 1794 }, { "entropy": 1.0196455419063568, "epoch": 0.9452343338599263, "grad_norm": 0.27313318848609924, "learning_rate": 0.00019485126723306292, "loss": 0.18969658017158508, "mean_token_accuracy": 0.9258754402399063, "num_tokens": 22143120.0, "step": 1795 }, { "entropy": 1.0403377711772919, "epoch": 0.9457609268035808, "grad_norm": 0.2604946494102478, "learning_rate": 0.00019484395421973783, "loss": 0.2132149338722229, "mean_token_accuracy": 0.9197222590446472, "num_tokens": 22155456.0, "step": 1796 }, { "entropy": 0.9670400768518448, "epoch": 0.9462875197472354, "grad_norm": 0.24395477771759033, "learning_rate": 0.00019483663616972165, "loss": 0.19094271957874298, "mean_token_accuracy": 0.9200141131877899, "num_tokens": 22167792.0, "step": 1797 }, { "entropy": 1.0197023451328278, "epoch": 0.94681411269089, "grad_norm": 0.2558318078517914, "learning_rate": 0.00019482931308344888, "loss": 0.19818465411663055, "mean_token_accuracy": 0.9231192022562027, "num_tokens": 22180128.0, "step": 1798 }, { "entropy": 1.0280962586402893, "epoch": 0.9473407056345445, "grad_norm": 0.28250062465667725, "learning_rate": 0.00019482198496135417, "loss": 0.22149549424648285, "mean_token_accuracy": 0.9105774611234665, "num_tokens": 22192464.0, "step": 1799 }, { "entropy": 1.004937931895256, "epoch": 0.9478672985781991, "grad_norm": 0.2890641391277313, "learning_rate": 0.00019481465180387264, "loss": 0.2117823362350464, "mean_token_accuracy": 0.9159420728683472, "num_tokens": 22204800.0, "step": 1800 }, { "entropy": 0.9912999272346497, "epoch": 0.9483938915218536, "grad_norm": 0.2721498906612396, "learning_rate": 0.00019480731361143955, "loss": 0.19752754271030426, "mean_token_accuracy": 0.9188252538442612, "num_tokens": 22217136.0, "step": 1801 }, { "entropy": 0.9911512136459351, "epoch": 0.9489204844655081, "grad_norm": 0.2967390716075897, "learning_rate": 0.00019479997038449054, "loss": 0.2183246612548828, "mean_token_accuracy": 0.908792570233345, "num_tokens": 22229472.0, "step": 1802 }, { "entropy": 1.0003108382225037, "epoch": 0.9494470774091627, "grad_norm": 0.281955748796463, "learning_rate": 0.00019479262212346153, "loss": 0.20015354454517365, "mean_token_accuracy": 0.9192506521940231, "num_tokens": 22241808.0, "step": 1803 }, { "entropy": 1.005830705165863, "epoch": 0.9499736703528173, "grad_norm": 0.29906165599823, "learning_rate": 0.00019478526882878876, "loss": 0.2205047309398651, "mean_token_accuracy": 0.9138208776712418, "num_tokens": 22254144.0, "step": 1804 }, { "entropy": 0.9975222796201706, "epoch": 0.9505002632964719, "grad_norm": 0.297961950302124, "learning_rate": 0.00019477791050090875, "loss": 0.21634206175804138, "mean_token_accuracy": 0.9120276570320129, "num_tokens": 22266480.0, "step": 1805 }, { "entropy": 0.9912213832139969, "epoch": 0.9510268562401264, "grad_norm": 0.3019638955593109, "learning_rate": 0.00019477054714025832, "loss": 0.21199895441532135, "mean_token_accuracy": 0.9165389537811279, "num_tokens": 22278816.0, "step": 1806 }, { "entropy": 0.9327168315649033, "epoch": 0.9515534491837809, "grad_norm": 0.288906991481781, "learning_rate": 0.00019476317874727456, "loss": 0.23043318092823029, "mean_token_accuracy": 0.9077083468437195, "num_tokens": 22291152.0, "step": 1807 }, { "entropy": 0.9759026318788528, "epoch": 0.9520800421274355, "grad_norm": 0.2820807993412018, "learning_rate": 0.00019475580532239497, "loss": 0.21610046923160553, "mean_token_accuracy": 0.914526030421257, "num_tokens": 22303488.0, "step": 1808 }, { "entropy": 1.01944038271904, "epoch": 0.95260663507109, "grad_norm": 0.29718121886253357, "learning_rate": 0.00019474842686605716, "loss": 0.2213006466627121, "mean_token_accuracy": 0.9078305512666702, "num_tokens": 22315824.0, "step": 1809 }, { "entropy": 0.9788577258586884, "epoch": 0.9531332280147446, "grad_norm": 0.2710515558719635, "learning_rate": 0.00019474104337869924, "loss": 0.19855360686779022, "mean_token_accuracy": 0.9186171144247055, "num_tokens": 22328160.0, "step": 1810 }, { "entropy": 0.9749794155359268, "epoch": 0.9536598209583992, "grad_norm": 0.2699875235557556, "learning_rate": 0.00019473365486075944, "loss": 0.20002411305904388, "mean_token_accuracy": 0.917415052652359, "num_tokens": 22340496.0, "step": 1811 }, { "entropy": 1.0002324134111404, "epoch": 0.9541864139020537, "grad_norm": 0.2768368422985077, "learning_rate": 0.00019472626131267646, "loss": 0.2179412692785263, "mean_token_accuracy": 0.9109683334827423, "num_tokens": 22352832.0, "step": 1812 }, { "entropy": 1.0184978395700455, "epoch": 0.9547130068457083, "grad_norm": 0.2990346848964691, "learning_rate": 0.00019471886273488915, "loss": 0.22559918463230133, "mean_token_accuracy": 0.911268338561058, "num_tokens": 22365168.0, "step": 1813 }, { "entropy": 0.9672580063343048, "epoch": 0.9552395997893628, "grad_norm": 0.258120059967041, "learning_rate": 0.00019471145912783671, "loss": 0.19848020374774933, "mean_token_accuracy": 0.9207747876644135, "num_tokens": 22377504.0, "step": 1814 }, { "entropy": 1.0332013070583344, "epoch": 0.9557661927330173, "grad_norm": 0.27658164501190186, "learning_rate": 0.00019470405049195876, "loss": 0.22540630400180817, "mean_token_accuracy": 0.909706637263298, "num_tokens": 22389840.0, "step": 1815 }, { "entropy": 1.0286743193864822, "epoch": 0.956292785676672, "grad_norm": 0.30504515767097473, "learning_rate": 0.00019469663682769491, "loss": 0.22958287596702576, "mean_token_accuracy": 0.90970279276371, "num_tokens": 22402176.0, "step": 1816 }, { "entropy": 1.0396344661712646, "epoch": 0.9568193786203265, "grad_norm": 0.3122229278087616, "learning_rate": 0.00019468921813548546, "loss": 0.21201902627944946, "mean_token_accuracy": 0.912709191441536, "num_tokens": 22414512.0, "step": 1817 }, { "entropy": 0.9904589354991913, "epoch": 0.957345971563981, "grad_norm": 0.2821761667728424, "learning_rate": 0.00019468179441577073, "loss": 0.21789240837097168, "mean_token_accuracy": 0.9137752056121826, "num_tokens": 22426848.0, "step": 1818 }, { "entropy": 0.9968847781419754, "epoch": 0.9578725645076356, "grad_norm": 0.2896675765514374, "learning_rate": 0.0001946743656689914, "loss": 0.19366274774074554, "mean_token_accuracy": 0.9199696481227875, "num_tokens": 22439184.0, "step": 1819 }, { "entropy": 0.9972859472036362, "epoch": 0.9583991574512901, "grad_norm": 0.2833546996116638, "learning_rate": 0.00019466693189558852, "loss": 0.20901280641555786, "mean_token_accuracy": 0.9163765460252762, "num_tokens": 22451520.0, "step": 1820 }, { "entropy": 1.0221098363399506, "epoch": 0.9589257503949447, "grad_norm": 0.30042803287506104, "learning_rate": 0.00019465949309600334, "loss": 0.20722414553165436, "mean_token_accuracy": 0.9166164398193359, "num_tokens": 22463856.0, "step": 1821 }, { "entropy": 0.9847268313169479, "epoch": 0.9594523433385993, "grad_norm": 0.29877185821533203, "learning_rate": 0.00019465204927067754, "loss": 0.22702287137508392, "mean_token_accuracy": 0.910624086856842, "num_tokens": 22476192.0, "step": 1822 }, { "entropy": 1.0212393552064896, "epoch": 0.9599789362822538, "grad_norm": 0.3099231421947479, "learning_rate": 0.00019464460042005293, "loss": 0.23366589844226837, "mean_token_accuracy": 0.9104152172803879, "num_tokens": 22488528.0, "step": 1823 }, { "entropy": 1.0240531265735626, "epoch": 0.9605055292259084, "grad_norm": 0.2815970182418823, "learning_rate": 0.00019463714654457172, "loss": 0.19396552443504333, "mean_token_accuracy": 0.9191655963659286, "num_tokens": 22500864.0, "step": 1824 }, { "entropy": 0.9908776879310608, "epoch": 0.9610321221695629, "grad_norm": 0.25329092144966125, "learning_rate": 0.00019462968764467648, "loss": 0.19574449956417084, "mean_token_accuracy": 0.9221374094486237, "num_tokens": 22513200.0, "step": 1825 }, { "entropy": 1.0275763273239136, "epoch": 0.9615587151132174, "grad_norm": 0.29698899388313293, "learning_rate": 0.00019462222372080992, "loss": 0.23368221521377563, "mean_token_accuracy": 0.9036354571580887, "num_tokens": 22525536.0, "step": 1826 }, { "entropy": 1.0337569862604141, "epoch": 0.9620853080568721, "grad_norm": 0.3343221843242645, "learning_rate": 0.00019461475477341512, "loss": 0.21144059300422668, "mean_token_accuracy": 0.9137226939201355, "num_tokens": 22537872.0, "step": 1827 }, { "entropy": 1.0447833985090256, "epoch": 0.9626119010005266, "grad_norm": 0.3130665421485901, "learning_rate": 0.0001946072808029355, "loss": 0.2065916359424591, "mean_token_accuracy": 0.9174522012472153, "num_tokens": 22550208.0, "step": 1828 }, { "entropy": 1.0395597666502, "epoch": 0.9631384939441812, "grad_norm": 0.26665323972702026, "learning_rate": 0.00019459980180981478, "loss": 0.21482327580451965, "mean_token_accuracy": 0.9130977690219879, "num_tokens": 22562544.0, "step": 1829 }, { "entropy": 1.0779733955860138, "epoch": 0.9636650868878357, "grad_norm": 0.28825950622558594, "learning_rate": 0.0001945923177944969, "loss": 0.21779173612594604, "mean_token_accuracy": 0.9156653732061386, "num_tokens": 22574880.0, "step": 1830 }, { "entropy": 1.0036635249853134, "epoch": 0.9641916798314902, "grad_norm": 0.2941460907459259, "learning_rate": 0.0001945848287574262, "loss": 0.2330627739429474, "mean_token_accuracy": 0.9059428721666336, "num_tokens": 22587216.0, "step": 1831 }, { "entropy": 0.9797258973121643, "epoch": 0.9647182727751448, "grad_norm": 0.25932562351226807, "learning_rate": 0.00019457733469904715, "loss": 0.2051321119070053, "mean_token_accuracy": 0.9192904084920883, "num_tokens": 22599552.0, "step": 1832 }, { "entropy": 1.039179965853691, "epoch": 0.9652448657187994, "grad_norm": 0.26872527599334717, "learning_rate": 0.0001945698356198047, "loss": 0.21343429386615753, "mean_token_accuracy": 0.9149598628282547, "num_tokens": 22611888.0, "step": 1833 }, { "entropy": 1.0027782917022705, "epoch": 0.965771458662454, "grad_norm": 0.27663007378578186, "learning_rate": 0.00019456233152014406, "loss": 0.19677159190177917, "mean_token_accuracy": 0.9209509938955307, "num_tokens": 22624224.0, "step": 1834 }, { "entropy": 1.0312834680080414, "epoch": 0.9662980516061085, "grad_norm": 0.28490519523620605, "learning_rate": 0.00019455482240051064, "loss": 0.21659842133522034, "mean_token_accuracy": 0.9108777791261673, "num_tokens": 22636560.0, "step": 1835 }, { "entropy": 1.012413963675499, "epoch": 0.966824644549763, "grad_norm": 0.27517637610435486, "learning_rate": 0.00019454730826135022, "loss": 0.22000275552272797, "mean_token_accuracy": 0.9186523258686066, "num_tokens": 22648896.0, "step": 1836 }, { "entropy": 0.9954932332038879, "epoch": 0.9673512374934176, "grad_norm": 0.27069538831710815, "learning_rate": 0.0001945397891031089, "loss": 0.19973544776439667, "mean_token_accuracy": 0.9211115539073944, "num_tokens": 22661232.0, "step": 1837 }, { "entropy": 1.0200046300888062, "epoch": 0.9678778304370721, "grad_norm": 0.2899874150753021, "learning_rate": 0.00019453226492623305, "loss": 0.22812676429748535, "mean_token_accuracy": 0.9122350364923477, "num_tokens": 22673568.0, "step": 1838 }, { "entropy": 0.9972085207700729, "epoch": 0.9684044233807267, "grad_norm": 0.29899537563323975, "learning_rate": 0.0001945247357311693, "loss": 0.2259579598903656, "mean_token_accuracy": 0.9079723209142685, "num_tokens": 22685904.0, "step": 1839 }, { "entropy": 1.0059181898832321, "epoch": 0.9689310163243813, "grad_norm": 0.29635098576545715, "learning_rate": 0.00019451720151836467, "loss": 0.23771284520626068, "mean_token_accuracy": 0.9140820056200027, "num_tokens": 22698240.0, "step": 1840 }, { "entropy": 1.0503579378128052, "epoch": 0.9694576092680358, "grad_norm": 0.29462575912475586, "learning_rate": 0.00019450966228826635, "loss": 0.19687220454216003, "mean_token_accuracy": 0.9218025654554367, "num_tokens": 22710576.0, "step": 1841 }, { "entropy": 0.9612717479467392, "epoch": 0.9699842022116903, "grad_norm": 0.27696606516838074, "learning_rate": 0.00019450211804132196, "loss": 0.19762445986270905, "mean_token_accuracy": 0.9190530776977539, "num_tokens": 22722912.0, "step": 1842 }, { "entropy": 0.9952682256698608, "epoch": 0.9705107951553449, "grad_norm": 0.2652910053730011, "learning_rate": 0.00019449456877797933, "loss": 0.21299602091312408, "mean_token_accuracy": 0.9156957715749741, "num_tokens": 22735248.0, "step": 1843 }, { "entropy": 0.9986753612756729, "epoch": 0.9710373880989994, "grad_norm": 0.2620997726917267, "learning_rate": 0.00019448701449868662, "loss": 0.1993142068386078, "mean_token_accuracy": 0.9197477102279663, "num_tokens": 22747584.0, "step": 1844 }, { "entropy": 0.9899931252002716, "epoch": 0.9715639810426541, "grad_norm": 0.29060348868370056, "learning_rate": 0.0001944794552038923, "loss": 0.2212766706943512, "mean_token_accuracy": 0.9078968465328217, "num_tokens": 22759920.0, "step": 1845 }, { "entropy": 1.0022216588258743, "epoch": 0.9720905739863086, "grad_norm": 0.30724501609802246, "learning_rate": 0.00019447189089404513, "loss": 0.2398059368133545, "mean_token_accuracy": 0.9064589291810989, "num_tokens": 22772256.0, "step": 1846 }, { "entropy": 0.997131809592247, "epoch": 0.9726171669299631, "grad_norm": 0.286475270986557, "learning_rate": 0.0001944643215695941, "loss": 0.21739161014556885, "mean_token_accuracy": 0.9086156636476517, "num_tokens": 22784592.0, "step": 1847 }, { "entropy": 0.9620841443538666, "epoch": 0.9731437598736177, "grad_norm": 0.2802620828151703, "learning_rate": 0.00019445674723098864, "loss": 0.18609827756881714, "mean_token_accuracy": 0.9273043125867844, "num_tokens": 22796928.0, "step": 1848 }, { "entropy": 0.9614392817020416, "epoch": 0.9736703528172722, "grad_norm": 0.2547474205493927, "learning_rate": 0.0001944491678786783, "loss": 0.20111055672168732, "mean_token_accuracy": 0.9191482216119766, "num_tokens": 22809264.0, "step": 1849 }, { "entropy": 0.9734077900648117, "epoch": 0.9741969457609269, "grad_norm": 0.2975533902645111, "learning_rate": 0.00019444158351311308, "loss": 0.20715618133544922, "mean_token_accuracy": 0.9150333106517792, "num_tokens": 22821600.0, "step": 1850 }, { "entropy": 0.9761214107275009, "epoch": 0.9747235387045814, "grad_norm": 0.28768840432167053, "learning_rate": 0.0001944339941347432, "loss": 0.18795141577720642, "mean_token_accuracy": 0.9215870052576065, "num_tokens": 22833936.0, "step": 1851 }, { "entropy": 0.9937604367733002, "epoch": 0.9752501316482359, "grad_norm": 0.29926928877830505, "learning_rate": 0.00019442639974401923, "loss": 0.21389541029930115, "mean_token_accuracy": 0.917677566409111, "num_tokens": 22846272.0, "step": 1852 }, { "entropy": 0.9756381958723068, "epoch": 0.9757767245918905, "grad_norm": 0.298100084066391, "learning_rate": 0.00019441880034139198, "loss": 0.21645361185073853, "mean_token_accuracy": 0.91536945104599, "num_tokens": 22858608.0, "step": 1853 }, { "entropy": 0.9328114837408066, "epoch": 0.976303317535545, "grad_norm": 0.27972036600112915, "learning_rate": 0.0001944111959273126, "loss": 0.20870962738990784, "mean_token_accuracy": 0.9177060127258301, "num_tokens": 22870944.0, "step": 1854 }, { "entropy": 0.9690214693546295, "epoch": 0.9768299104791995, "grad_norm": 0.28668034076690674, "learning_rate": 0.00019440358650223244, "loss": 0.20322152972221375, "mean_token_accuracy": 0.9198893010616302, "num_tokens": 22883280.0, "step": 1855 }, { "entropy": 0.9374023228883743, "epoch": 0.9773565034228542, "grad_norm": 0.2798213064670563, "learning_rate": 0.00019439597206660336, "loss": 0.20974165201187134, "mean_token_accuracy": 0.9153610616922379, "num_tokens": 22895616.0, "step": 1856 }, { "entropy": 0.988965705037117, "epoch": 0.9778830963665087, "grad_norm": 0.2775600254535675, "learning_rate": 0.00019438835262087728, "loss": 0.19997943937778473, "mean_token_accuracy": 0.9216296821832657, "num_tokens": 22907952.0, "step": 1857 }, { "entropy": 1.0289342552423477, "epoch": 0.9784096893101633, "grad_norm": 0.3432585299015045, "learning_rate": 0.00019438072816550654, "loss": 0.22643734514713287, "mean_token_accuracy": 0.9054546356201172, "num_tokens": 22920288.0, "step": 1858 }, { "entropy": 0.9867872446775436, "epoch": 0.9789362822538178, "grad_norm": 0.29411035776138306, "learning_rate": 0.0001943730987009438, "loss": 0.22154730558395386, "mean_token_accuracy": 0.9093334376811981, "num_tokens": 22932624.0, "step": 1859 }, { "entropy": 1.0116321295499802, "epoch": 0.9794628751974723, "grad_norm": 0.25875324010849, "learning_rate": 0.00019436546422764198, "loss": 0.19839854538440704, "mean_token_accuracy": 0.9156231582164764, "num_tokens": 22944960.0, "step": 1860 }, { "entropy": 1.0039302557706833, "epoch": 0.9799894681411269, "grad_norm": 0.29284337162971497, "learning_rate": 0.00019435782474605423, "loss": 0.2374696135520935, "mean_token_accuracy": 0.905433177947998, "num_tokens": 22957296.0, "step": 1861 }, { "entropy": 1.0000396072864532, "epoch": 0.9805160610847815, "grad_norm": 0.24808640778064728, "learning_rate": 0.00019435018025663412, "loss": 0.18588939309120178, "mean_token_accuracy": 0.9234057366847992, "num_tokens": 22969632.0, "step": 1862 }, { "entropy": 1.0562945902347565, "epoch": 0.981042654028436, "grad_norm": 0.2809024453163147, "learning_rate": 0.00019434253075983543, "loss": 0.19566890597343445, "mean_token_accuracy": 0.9169919043779373, "num_tokens": 22981968.0, "step": 1863 }, { "entropy": 1.066685050725937, "epoch": 0.9815692469720906, "grad_norm": 0.2744297385215759, "learning_rate": 0.0001943348762561123, "loss": 0.21286125481128693, "mean_token_accuracy": 0.911152720451355, "num_tokens": 22994304.0, "step": 1864 }, { "entropy": 1.0672977268695831, "epoch": 0.9820958399157451, "grad_norm": 0.30773451924324036, "learning_rate": 0.00019432721674591906, "loss": 0.22466342151165009, "mean_token_accuracy": 0.9027170091867447, "num_tokens": 23006640.0, "step": 1865 }, { "entropy": 0.9817476272583008, "epoch": 0.9826224328593997, "grad_norm": 0.25929689407348633, "learning_rate": 0.00019431955222971048, "loss": 0.20428617298603058, "mean_token_accuracy": 0.9160020500421524, "num_tokens": 23018976.0, "step": 1866 }, { "entropy": 1.0060690939426422, "epoch": 0.9831490258030542, "grad_norm": 0.3303799629211426, "learning_rate": 0.00019431188270794153, "loss": 0.22543492913246155, "mean_token_accuracy": 0.9112392216920853, "num_tokens": 23031312.0, "step": 1867 }, { "entropy": 0.9948325008153915, "epoch": 0.9836756187467088, "grad_norm": 0.2678799331188202, "learning_rate": 0.00019430420818106753, "loss": 0.19793486595153809, "mean_token_accuracy": 0.9236938953399658, "num_tokens": 23043648.0, "step": 1868 }, { "entropy": 1.0155895799398422, "epoch": 0.9842022116903634, "grad_norm": 0.32058584690093994, "learning_rate": 0.00019429652864954403, "loss": 0.22886891663074493, "mean_token_accuracy": 0.9127451777458191, "num_tokens": 23055984.0, "step": 1869 }, { "entropy": 1.0170871764421463, "epoch": 0.9847288046340179, "grad_norm": 0.2957039177417755, "learning_rate": 0.00019428884411382694, "loss": 0.21584120392799377, "mean_token_accuracy": 0.9092356264591217, "num_tokens": 23068320.0, "step": 1870 }, { "entropy": 1.0231945216655731, "epoch": 0.9852553975776724, "grad_norm": 0.2651207149028778, "learning_rate": 0.00019428115457437249, "loss": 0.18167884647846222, "mean_token_accuracy": 0.9309497475624084, "num_tokens": 23080656.0, "step": 1871 }, { "entropy": 0.9718558192253113, "epoch": 0.985781990521327, "grad_norm": 0.29894301295280457, "learning_rate": 0.0001942734600316371, "loss": 0.20839130878448486, "mean_token_accuracy": 0.9109772592782974, "num_tokens": 23092992.0, "step": 1872 }, { "entropy": 1.0036133825778961, "epoch": 0.9863085834649815, "grad_norm": 0.28074634075164795, "learning_rate": 0.00019426576048607754, "loss": 0.21850639581680298, "mean_token_accuracy": 0.9151745438575745, "num_tokens": 23105328.0, "step": 1873 }, { "entropy": 1.0208822190761566, "epoch": 0.9868351764086362, "grad_norm": 0.27776047587394714, "learning_rate": 0.00019425805593815094, "loss": 0.1931566298007965, "mean_token_accuracy": 0.9207221418619156, "num_tokens": 23117664.0, "step": 1874 }, { "entropy": 0.9643638432025909, "epoch": 0.9873617693522907, "grad_norm": 0.28227487206459045, "learning_rate": 0.00019425034638831466, "loss": 0.2174389511346817, "mean_token_accuracy": 0.9123106747865677, "num_tokens": 23130000.0, "step": 1875 }, { "entropy": 1.0151402354240417, "epoch": 0.9878883622959452, "grad_norm": 0.3007744252681732, "learning_rate": 0.00019424263183702634, "loss": 0.23054783046245575, "mean_token_accuracy": 0.9074221700429916, "num_tokens": 23142336.0, "step": 1876 }, { "entropy": 1.023296281695366, "epoch": 0.9884149552395998, "grad_norm": 0.2875635623931885, "learning_rate": 0.000194234912284744, "loss": 0.2183448076248169, "mean_token_accuracy": 0.9146157503128052, "num_tokens": 23154672.0, "step": 1877 }, { "entropy": 1.025291085243225, "epoch": 0.9889415481832543, "grad_norm": 0.2833808660507202, "learning_rate": 0.00019422718773192584, "loss": 0.2020779550075531, "mean_token_accuracy": 0.9207105487585068, "num_tokens": 23167008.0, "step": 1878 }, { "entropy": 1.0463321805000305, "epoch": 0.989468141126909, "grad_norm": 0.27166518568992615, "learning_rate": 0.0001942194581790305, "loss": 0.21112844347953796, "mean_token_accuracy": 0.9151988327503204, "num_tokens": 23179344.0, "step": 1879 }, { "entropy": 1.0174481570720673, "epoch": 0.9899947340705635, "grad_norm": 0.28479474782943726, "learning_rate": 0.00019421172362651677, "loss": 0.2219792902469635, "mean_token_accuracy": 0.9093788266181946, "num_tokens": 23191680.0, "step": 1880 }, { "entropy": 1.068659245967865, "epoch": 0.990521327014218, "grad_norm": 0.27825888991355896, "learning_rate": 0.00019420398407484383, "loss": 0.2115180492401123, "mean_token_accuracy": 0.913215160369873, "num_tokens": 23204016.0, "step": 1881 }, { "entropy": 1.0102509111166, "epoch": 0.9910479199578726, "grad_norm": 0.2567676901817322, "learning_rate": 0.00019419623952447113, "loss": 0.1962418258190155, "mean_token_accuracy": 0.9181914627552032, "num_tokens": 23216352.0, "step": 1882 }, { "entropy": 1.0041260570287704, "epoch": 0.9915745129015271, "grad_norm": 0.2607569992542267, "learning_rate": 0.00019418848997585842, "loss": 0.18007442355155945, "mean_token_accuracy": 0.9283247590065002, "num_tokens": 23228688.0, "step": 1883 }, { "entropy": 1.0119262784719467, "epoch": 0.9921011058451816, "grad_norm": 0.2691285312175751, "learning_rate": 0.00019418073542946577, "loss": 0.2185424566268921, "mean_token_accuracy": 0.9108522534370422, "num_tokens": 23241024.0, "step": 1884 }, { "entropy": 1.0200906693935394, "epoch": 0.9926276987888363, "grad_norm": 0.2762972414493561, "learning_rate": 0.0001941729758857535, "loss": 0.21047905087471008, "mean_token_accuracy": 0.921312689781189, "num_tokens": 23253360.0, "step": 1885 }, { "entropy": 1.0015190541744232, "epoch": 0.9931542917324908, "grad_norm": 0.2789957523345947, "learning_rate": 0.0001941652113451822, "loss": 0.22564658522605896, "mean_token_accuracy": 0.9052274376153946, "num_tokens": 23265696.0, "step": 1886 }, { "entropy": 1.0212842226028442, "epoch": 0.9936808846761453, "grad_norm": 0.2787906527519226, "learning_rate": 0.00019415744180821293, "loss": 0.19954261183738708, "mean_token_accuracy": 0.9225759655237198, "num_tokens": 23278032.0, "step": 1887 }, { "entropy": 1.0256837606430054, "epoch": 0.9942074776197999, "grad_norm": 0.3047766089439392, "learning_rate": 0.0001941496672753068, "loss": 0.22101764380931854, "mean_token_accuracy": 0.9100571721792221, "num_tokens": 23290368.0, "step": 1888 }, { "entropy": 1.0017095357179642, "epoch": 0.9947340705634544, "grad_norm": 0.3079693913459778, "learning_rate": 0.00019414188774692542, "loss": 0.23877866566181183, "mean_token_accuracy": 0.9044640958309174, "num_tokens": 23302704.0, "step": 1889 }, { "entropy": 0.9979955106973648, "epoch": 0.995260663507109, "grad_norm": 0.28942957520484924, "learning_rate": 0.00019413410322353055, "loss": 0.21703916788101196, "mean_token_accuracy": 0.911283403635025, "num_tokens": 23315040.0, "step": 1890 }, { "entropy": 1.000881314277649, "epoch": 0.9957872564507636, "grad_norm": 0.2723085582256317, "learning_rate": 0.00019412631370558433, "loss": 0.2083275318145752, "mean_token_accuracy": 0.9137948602437973, "num_tokens": 23327376.0, "step": 1891 }, { "entropy": 0.9760307371616364, "epoch": 0.9963138493944181, "grad_norm": 0.28710952401161194, "learning_rate": 0.00019411851919354925, "loss": 0.2206597775220871, "mean_token_accuracy": 0.913771316409111, "num_tokens": 23339712.0, "step": 1892 }, { "entropy": 1.0313685238361359, "epoch": 0.9968404423380727, "grad_norm": 0.2784387767314911, "learning_rate": 0.00019411071968788792, "loss": 0.20836740732192993, "mean_token_accuracy": 0.9158921986818314, "num_tokens": 23352048.0, "step": 1893 }, { "entropy": 0.9972709268331528, "epoch": 0.9973670352817272, "grad_norm": 0.2760670781135559, "learning_rate": 0.00019410291518906337, "loss": 0.215082049369812, "mean_token_accuracy": 0.9125083088874817, "num_tokens": 23364384.0, "step": 1894 }, { "entropy": 0.9749780297279358, "epoch": 0.9978936282253817, "grad_norm": 0.2756492793560028, "learning_rate": 0.00019409510569753897, "loss": 0.19914628565311432, "mean_token_accuracy": 0.9158760160207748, "num_tokens": 23376720.0, "step": 1895 }, { "entropy": 0.9882865399122238, "epoch": 0.9984202211690363, "grad_norm": 0.3229084610939026, "learning_rate": 0.00019408729121377828, "loss": 0.21740438044071198, "mean_token_accuracy": 0.9149737656116486, "num_tokens": 23389056.0, "step": 1896 }, { "entropy": 0.979081466794014, "epoch": 0.9989468141126909, "grad_norm": 0.2839930057525635, "learning_rate": 0.00019407947173824522, "loss": 0.20839889347553253, "mean_token_accuracy": 0.9204780906438828, "num_tokens": 23401392.0, "step": 1897 }, { "entropy": 0.9407005459070206, "epoch": 0.9994734070563455, "grad_norm": 0.28035539388656616, "learning_rate": 0.00019407164727140396, "loss": 0.2062290906906128, "mean_token_accuracy": 0.9152461290359497, "num_tokens": 23413728.0, "step": 1898 }, { "entropy": 0.9624819904565811, "epoch": 1.0, "grad_norm": 0.29015156626701355, "learning_rate": 0.00019406381781371902, "loss": 0.21500550210475922, "mean_token_accuracy": 0.915779635310173, "num_tokens": 23425036.0, "step": 1899 }, { "epoch": 1.0, "eval_entropy": 0.925739836008565, "eval_loss": 0.21148517727851868, "eval_mean_token_accuracy": 0.9153817107703826, "eval_num_tokens": 23425036.0, "eval_runtime": 664.4914, "eval_samples_per_second": 8.573, "eval_steps_per_second": 2.858, "step": 1899 }, { "entropy": 0.9483114928007126, "epoch": 1.0005265929436546, "grad_norm": 0.28408128023147583, "learning_rate": 0.00019405598336565518, "loss": 0.2106991708278656, "mean_token_accuracy": 0.9160860329866409, "num_tokens": 23437372.0, "step": 1900 }, { "entropy": 0.898838147521019, "epoch": 1.001053185887309, "grad_norm": 0.27440792322158813, "learning_rate": 0.00019404814392767753, "loss": 0.21290592849254608, "mean_token_accuracy": 0.9125117361545563, "num_tokens": 23449708.0, "step": 1901 }, { "entropy": 0.9791853725910187, "epoch": 1.0015797788309637, "grad_norm": 0.28151366114616394, "learning_rate": 0.00019404029950025143, "loss": 0.19366838037967682, "mean_token_accuracy": 0.9241389185190201, "num_tokens": 23462044.0, "step": 1902 }, { "entropy": 0.9103992432355881, "epoch": 1.0021063717746181, "grad_norm": 0.29249274730682373, "learning_rate": 0.00019403245008384255, "loss": 0.21274180710315704, "mean_token_accuracy": 0.9132009893655777, "num_tokens": 23474380.0, "step": 1903 }, { "entropy": 0.9207734614610672, "epoch": 1.0026329647182728, "grad_norm": 0.29525914788246155, "learning_rate": 0.00019402459567891694, "loss": 0.20322710275650024, "mean_token_accuracy": 0.9193697869777679, "num_tokens": 23486716.0, "step": 1904 }, { "entropy": 0.9738444536924362, "epoch": 1.0031595576619274, "grad_norm": 0.28035998344421387, "learning_rate": 0.00019401673628594078, "loss": 0.1997321993112564, "mean_token_accuracy": 0.915515661239624, "num_tokens": 23499052.0, "step": 1905 }, { "entropy": 0.9290015399456024, "epoch": 1.0036861506055819, "grad_norm": 0.2815547287464142, "learning_rate": 0.00019400887190538068, "loss": 0.20885860919952393, "mean_token_accuracy": 0.9181715399026871, "num_tokens": 23511388.0, "step": 1906 }, { "entropy": 0.9481154382228851, "epoch": 1.0042127435492365, "grad_norm": 0.2717452645301819, "learning_rate": 0.0001940010025377035, "loss": 0.20289872586727142, "mean_token_accuracy": 0.9163729101419449, "num_tokens": 23523724.0, "step": 1907 }, { "entropy": 0.9266571402549744, "epoch": 1.004739336492891, "grad_norm": 0.3059215843677521, "learning_rate": 0.00019399312818337637, "loss": 0.20683327317237854, "mean_token_accuracy": 0.9123108834028244, "num_tokens": 23536060.0, "step": 1908 }, { "entropy": 0.9232073873281479, "epoch": 1.0052659294365456, "grad_norm": 0.2654300034046173, "learning_rate": 0.00019398524884286678, "loss": 0.18700408935546875, "mean_token_accuracy": 0.9244769513607025, "num_tokens": 23548396.0, "step": 1909 }, { "entropy": 0.9462733566761017, "epoch": 1.0057925223802, "grad_norm": 0.28558823466300964, "learning_rate": 0.0001939773645166425, "loss": 0.20201043784618378, "mean_token_accuracy": 0.9207958728075027, "num_tokens": 23560732.0, "step": 1910 }, { "entropy": 0.9496246725320816, "epoch": 1.0063191153238547, "grad_norm": 0.27963462471961975, "learning_rate": 0.00019396947520517154, "loss": 0.20976471900939941, "mean_token_accuracy": 0.9165468662977219, "num_tokens": 23573068.0, "step": 1911 }, { "entropy": 0.9894253462553024, "epoch": 1.0068457082675093, "grad_norm": 0.2891998291015625, "learning_rate": 0.00019396158090892224, "loss": 0.2190844714641571, "mean_token_accuracy": 0.9077310711145401, "num_tokens": 23585404.0, "step": 1912 }, { "entropy": 1.0001903474330902, "epoch": 1.0073723012111637, "grad_norm": 0.2947920560836792, "learning_rate": 0.00019395368162836323, "loss": 0.21794044971466064, "mean_token_accuracy": 0.9169338941574097, "num_tokens": 23597740.0, "step": 1913 }, { "entropy": 0.9664654582738876, "epoch": 1.0078988941548184, "grad_norm": 0.270565390586853, "learning_rate": 0.00019394577736396346, "loss": 0.19095301628112793, "mean_token_accuracy": 0.9217241108417511, "num_tokens": 23610076.0, "step": 1914 }, { "entropy": 0.9208107441663742, "epoch": 1.0084254870984728, "grad_norm": 0.27241528034210205, "learning_rate": 0.0001939378681161922, "loss": 0.18645267188549042, "mean_token_accuracy": 0.9272374659776688, "num_tokens": 23622412.0, "step": 1915 }, { "entropy": 1.0111596435308456, "epoch": 1.0089520800421274, "grad_norm": 0.3164159655570984, "learning_rate": 0.00019392995388551888, "loss": 0.22077365219593048, "mean_token_accuracy": 0.9118006080389023, "num_tokens": 23634748.0, "step": 1916 }, { "entropy": 0.944818839430809, "epoch": 1.009478672985782, "grad_norm": 0.28582748770713806, "learning_rate": 0.00019392203467241342, "loss": 0.2104344218969345, "mean_token_accuracy": 0.9131231158971786, "num_tokens": 23647084.0, "step": 1917 }, { "entropy": 1.0247685611248016, "epoch": 1.0100052659294365, "grad_norm": 0.2851823568344116, "learning_rate": 0.00019391411047734589, "loss": 0.21748843789100647, "mean_token_accuracy": 0.9151061922311783, "num_tokens": 23659420.0, "step": 1918 }, { "entropy": 0.9971954673528671, "epoch": 1.0105318588730912, "grad_norm": 0.2717190682888031, "learning_rate": 0.00019390618130078673, "loss": 0.2043081521987915, "mean_token_accuracy": 0.9173936247825623, "num_tokens": 23671756.0, "step": 1919 }, { "entropy": 0.9666483253240585, "epoch": 1.0110584518167456, "grad_norm": 0.2750032842159271, "learning_rate": 0.00019389824714320658, "loss": 0.19933579862117767, "mean_token_accuracy": 0.9193840771913528, "num_tokens": 23684092.0, "step": 1920 }, { "entropy": 0.997409462928772, "epoch": 1.0115850447604002, "grad_norm": 0.2951802611351013, "learning_rate": 0.0001938903080050765, "loss": 0.2241615653038025, "mean_token_accuracy": 0.9114827215671539, "num_tokens": 23696428.0, "step": 1921 }, { "entropy": 1.0097313821315765, "epoch": 1.0121116377040547, "grad_norm": 0.29612311720848083, "learning_rate": 0.00019388236388686783, "loss": 0.2130715399980545, "mean_token_accuracy": 0.9157524257898331, "num_tokens": 23708764.0, "step": 1922 }, { "entropy": 1.029169887304306, "epoch": 1.0126382306477093, "grad_norm": 0.28184011578559875, "learning_rate": 0.00019387441478905206, "loss": 0.20634552836418152, "mean_token_accuracy": 0.9152942299842834, "num_tokens": 23721100.0, "step": 1923 }, { "entropy": 1.0215208977460861, "epoch": 1.013164823591364, "grad_norm": 0.2626985013484955, "learning_rate": 0.00019386646071210118, "loss": 0.18794600665569305, "mean_token_accuracy": 0.9244592189788818, "num_tokens": 23733436.0, "step": 1924 }, { "entropy": 1.03949436545372, "epoch": 1.0136914165350184, "grad_norm": 0.2628861665725708, "learning_rate": 0.00019385850165648733, "loss": 0.2007792592048645, "mean_token_accuracy": 0.9187650829553604, "num_tokens": 23745772.0, "step": 1925 }, { "entropy": 0.9779924899339676, "epoch": 1.014218009478673, "grad_norm": 0.28041279315948486, "learning_rate": 0.000193850537622683, "loss": 0.1995813548564911, "mean_token_accuracy": 0.9189839065074921, "num_tokens": 23758108.0, "step": 1926 }, { "entropy": 1.0496584177017212, "epoch": 1.0147446024223274, "grad_norm": 0.30866992473602295, "learning_rate": 0.00019384256861116096, "loss": 0.2425222247838974, "mean_token_accuracy": 0.9028880447149277, "num_tokens": 23770444.0, "step": 1927 }, { "entropy": 1.0065599381923676, "epoch": 1.015271195365982, "grad_norm": 0.26788726449012756, "learning_rate": 0.0001938345946223943, "loss": 0.1882321834564209, "mean_token_accuracy": 0.9198320806026459, "num_tokens": 23782780.0, "step": 1928 }, { "entropy": 1.0039747208356857, "epoch": 1.0157977883096367, "grad_norm": 0.2758983373641968, "learning_rate": 0.00019382661565685638, "loss": 0.20896543562412262, "mean_token_accuracy": 0.9133927524089813, "num_tokens": 23795116.0, "step": 1929 }, { "entropy": 0.9877621978521347, "epoch": 1.0163243812532912, "grad_norm": 0.27864596247673035, "learning_rate": 0.00019381863171502088, "loss": 0.18458585441112518, "mean_token_accuracy": 0.9242655336856842, "num_tokens": 23807452.0, "step": 1930 }, { "entropy": 1.00676129758358, "epoch": 1.0168509741969458, "grad_norm": 0.27991485595703125, "learning_rate": 0.00019381064279736174, "loss": 0.21812650561332703, "mean_token_accuracy": 0.915228009223938, "num_tokens": 23819788.0, "step": 1931 }, { "entropy": 0.9534656554460526, "epoch": 1.0173775671406002, "grad_norm": 0.2649945914745331, "learning_rate": 0.00019380264890435324, "loss": 0.21227021515369415, "mean_token_accuracy": 0.9195111691951752, "num_tokens": 23832124.0, "step": 1932 }, { "entropy": 1.000964567065239, "epoch": 1.0179041600842549, "grad_norm": 0.268867164850235, "learning_rate": 0.0001937946500364699, "loss": 0.20481450855731964, "mean_token_accuracy": 0.9178451746702194, "num_tokens": 23844460.0, "step": 1933 }, { "entropy": 1.000000774860382, "epoch": 1.0184307530279095, "grad_norm": 0.27489760518074036, "learning_rate": 0.00019378664619418653, "loss": 0.20561310648918152, "mean_token_accuracy": 0.915080651640892, "num_tokens": 23856796.0, "step": 1934 }, { "entropy": 0.9716245830059052, "epoch": 1.018957345971564, "grad_norm": 0.306060791015625, "learning_rate": 0.00019377863737797839, "loss": 0.21995992958545685, "mean_token_accuracy": 0.910162016749382, "num_tokens": 23869132.0, "step": 1935 }, { "entropy": 0.9378920793533325, "epoch": 1.0194839389152186, "grad_norm": 0.26929163932800293, "learning_rate": 0.00019377062358832083, "loss": 0.18971963226795197, "mean_token_accuracy": 0.921707347035408, "num_tokens": 23881468.0, "step": 1936 }, { "entropy": 0.9584116488695145, "epoch": 1.020010531858873, "grad_norm": 0.27198344469070435, "learning_rate": 0.0001937626048256896, "loss": 0.19669067859649658, "mean_token_accuracy": 0.9219775944948196, "num_tokens": 23893804.0, "step": 1937 }, { "entropy": 0.9765763580799103, "epoch": 1.0205371248025277, "grad_norm": 0.2800286114215851, "learning_rate": 0.0001937545810905607, "loss": 0.20201562345027924, "mean_token_accuracy": 0.9161263704299927, "num_tokens": 23906140.0, "step": 1938 }, { "entropy": 0.9443774819374084, "epoch": 1.021063717746182, "grad_norm": 0.28303396701812744, "learning_rate": 0.0001937465523834105, "loss": 0.19613805413246155, "mean_token_accuracy": 0.9168961495161057, "num_tokens": 23918476.0, "step": 1939 }, { "entropy": 0.9929839223623276, "epoch": 1.0215903106898367, "grad_norm": 0.317105770111084, "learning_rate": 0.00019373851870471562, "loss": 0.20963701605796814, "mean_token_accuracy": 0.9184058755636215, "num_tokens": 23930812.0, "step": 1940 }, { "entropy": 0.9796905666589737, "epoch": 1.0221169036334914, "grad_norm": 0.29658782482147217, "learning_rate": 0.0001937304800549529, "loss": 0.2231239676475525, "mean_token_accuracy": 0.9108584076166153, "num_tokens": 23943148.0, "step": 1941 }, { "entropy": 0.9595655649900436, "epoch": 1.0226434965771458, "grad_norm": 0.25836655497550964, "learning_rate": 0.00019372243643459963, "loss": 0.18731528520584106, "mean_token_accuracy": 0.9224317222833633, "num_tokens": 23955484.0, "step": 1942 }, { "entropy": 0.9837910383939743, "epoch": 1.0231700895208005, "grad_norm": 0.2838844060897827, "learning_rate": 0.0001937143878441333, "loss": 0.21538090705871582, "mean_token_accuracy": 0.9147688299417496, "num_tokens": 23967820.0, "step": 1943 }, { "entropy": 1.002283364534378, "epoch": 1.0236966824644549, "grad_norm": 0.2761163115501404, "learning_rate": 0.00019370633428403164, "loss": 0.17965167760849, "mean_token_accuracy": 0.9276806563138962, "num_tokens": 23980156.0, "step": 1944 }, { "entropy": 0.9750987738370895, "epoch": 1.0242232754081095, "grad_norm": 0.2677707374095917, "learning_rate": 0.00019369827575477282, "loss": 0.1916501522064209, "mean_token_accuracy": 0.9206420630216599, "num_tokens": 23992492.0, "step": 1945 }, { "entropy": 1.0182987600564957, "epoch": 1.0247498683517642, "grad_norm": 0.2850121259689331, "learning_rate": 0.00019369021225683518, "loss": 0.2081344723701477, "mean_token_accuracy": 0.9149588048458099, "num_tokens": 24004828.0, "step": 1946 }, { "entropy": 0.9728025048971176, "epoch": 1.0252764612954186, "grad_norm": 0.2776131331920624, "learning_rate": 0.00019368214379069745, "loss": 0.20609930157661438, "mean_token_accuracy": 0.9178636223077774, "num_tokens": 24017164.0, "step": 1947 }, { "entropy": 0.9742907732725143, "epoch": 1.0258030542390733, "grad_norm": 0.29074424505233765, "learning_rate": 0.0001936740703568386, "loss": 0.21784421801567078, "mean_token_accuracy": 0.9106293469667435, "num_tokens": 24029500.0, "step": 1948 }, { "entropy": 0.9815188944339752, "epoch": 1.0263296471827277, "grad_norm": 0.2835097908973694, "learning_rate": 0.0001936659919557378, "loss": 0.20473387837409973, "mean_token_accuracy": 0.9137338846921921, "num_tokens": 24041836.0, "step": 1949 }, { "entropy": 0.9593153893947601, "epoch": 1.0268562401263823, "grad_norm": 0.27597561478614807, "learning_rate": 0.00019365790858787477, "loss": 0.21293160319328308, "mean_token_accuracy": 0.9137197583913803, "num_tokens": 24054172.0, "step": 1950 }, { "entropy": 1.006902426481247, "epoch": 1.0273828330700367, "grad_norm": 0.29685065150260925, "learning_rate": 0.00019364982025372925, "loss": 0.21124479174613953, "mean_token_accuracy": 0.9155112355947495, "num_tokens": 24066508.0, "step": 1951 }, { "entropy": 0.9826443940401077, "epoch": 1.0279094260136914, "grad_norm": 0.28184542059898376, "learning_rate": 0.0001936417269537815, "loss": 0.18985268473625183, "mean_token_accuracy": 0.9251315295696259, "num_tokens": 24078844.0, "step": 1952 }, { "entropy": 0.9592526108026505, "epoch": 1.028436018957346, "grad_norm": 0.2665354013442993, "learning_rate": 0.00019363362868851186, "loss": 0.17802020907402039, "mean_token_accuracy": 0.923170417547226, "num_tokens": 24091180.0, "step": 1953 }, { "entropy": 0.9736118167638779, "epoch": 1.0289626119010005, "grad_norm": 0.2990165650844574, "learning_rate": 0.00019362552545840121, "loss": 0.21102318167686462, "mean_token_accuracy": 0.918361246585846, "num_tokens": 24103516.0, "step": 1954 }, { "entropy": 0.9543041735887527, "epoch": 1.0294892048446551, "grad_norm": 0.2993450462818146, "learning_rate": 0.00019361741726393048, "loss": 0.20676571130752563, "mean_token_accuracy": 0.9157939106225967, "num_tokens": 24115852.0, "step": 1955 }, { "entropy": 0.9188299477100372, "epoch": 1.0300157977883095, "grad_norm": 0.28595927357673645, "learning_rate": 0.00019360930410558107, "loss": 0.20469802618026733, "mean_token_accuracy": 0.9192691892385483, "num_tokens": 24128188.0, "step": 1956 }, { "entropy": 0.9500316083431244, "epoch": 1.0305423907319642, "grad_norm": 0.3056456744670868, "learning_rate": 0.00019360118598383454, "loss": 0.21120858192443848, "mean_token_accuracy": 0.9139054864645004, "num_tokens": 24140524.0, "step": 1957 }, { "entropy": 0.9614865332841873, "epoch": 1.0310689836756188, "grad_norm": 0.3015027642250061, "learning_rate": 0.00019359306289917292, "loss": 0.19627857208251953, "mean_token_accuracy": 0.9196411669254303, "num_tokens": 24152860.0, "step": 1958 }, { "entropy": 0.9348547607660294, "epoch": 1.0315955766192733, "grad_norm": 0.2926042377948761, "learning_rate": 0.00019358493485207833, "loss": 0.1929434835910797, "mean_token_accuracy": 0.9180857390165329, "num_tokens": 24165196.0, "step": 1959 }, { "entropy": 0.8882603049278259, "epoch": 1.032122169562928, "grad_norm": 0.2788626551628113, "learning_rate": 0.00019357680184303334, "loss": 0.2019919753074646, "mean_token_accuracy": 0.9170414507389069, "num_tokens": 24177532.0, "step": 1960 }, { "entropy": 0.9481528550386429, "epoch": 1.0326487625065823, "grad_norm": 0.30911776423454285, "learning_rate": 0.00019356866387252076, "loss": 0.20932908356189728, "mean_token_accuracy": 0.9150265455245972, "num_tokens": 24189868.0, "step": 1961 }, { "entropy": 0.9632448703050613, "epoch": 1.033175355450237, "grad_norm": 0.29422178864479065, "learning_rate": 0.00019356052094102367, "loss": 0.1939503401517868, "mean_token_accuracy": 0.9227122515439987, "num_tokens": 24202204.0, "step": 1962 }, { "entropy": 0.9328284412622452, "epoch": 1.0337019483938916, "grad_norm": 0.3035720884799957, "learning_rate": 0.0001935523730490255, "loss": 0.21952201426029205, "mean_token_accuracy": 0.9107953608036041, "num_tokens": 24214540.0, "step": 1963 }, { "entropy": 0.9676711559295654, "epoch": 1.034228541337546, "grad_norm": 0.2915896773338318, "learning_rate": 0.0001935442201970099, "loss": 0.19596201181411743, "mean_token_accuracy": 0.9193816781044006, "num_tokens": 24226876.0, "step": 1964 }, { "entropy": 0.9730495363473892, "epoch": 1.0347551342812007, "grad_norm": 0.28182631731033325, "learning_rate": 0.0001935360623854609, "loss": 0.20961566269397736, "mean_token_accuracy": 0.9185821712017059, "num_tokens": 24239212.0, "step": 1965 }, { "entropy": 1.023067906498909, "epoch": 1.0352817272248551, "grad_norm": 0.30114588141441345, "learning_rate": 0.00019352789961486273, "loss": 0.23333251476287842, "mean_token_accuracy": 0.9085756540298462, "num_tokens": 24251548.0, "step": 1966 }, { "entropy": 0.9701975286006927, "epoch": 1.0358083201685098, "grad_norm": 0.2716124355792999, "learning_rate": 0.00019351973188570004, "loss": 0.20822694897651672, "mean_token_accuracy": 0.9222011566162109, "num_tokens": 24263884.0, "step": 1967 }, { "entropy": 0.9808885604143143, "epoch": 1.0363349131121642, "grad_norm": 0.26052355766296387, "learning_rate": 0.0001935115591984576, "loss": 0.1830577850341797, "mean_token_accuracy": 0.9277938008308411, "num_tokens": 24276220.0, "step": 1968 }, { "entropy": 1.0236380398273468, "epoch": 1.0368615060558188, "grad_norm": 0.2982364296913147, "learning_rate": 0.00019350338155362066, "loss": 0.19804757833480835, "mean_token_accuracy": 0.9196522831916809, "num_tokens": 24288556.0, "step": 1969 }, { "entropy": 1.0457386374473572, "epoch": 1.0373880989994735, "grad_norm": 0.30198392271995544, "learning_rate": 0.00019349519895167468, "loss": 0.20456969738006592, "mean_token_accuracy": 0.9179401248693466, "num_tokens": 24300892.0, "step": 1970 }, { "entropy": 1.0371754169464111, "epoch": 1.037914691943128, "grad_norm": 0.2852479815483093, "learning_rate": 0.00019348701139310537, "loss": 0.22744318842887878, "mean_token_accuracy": 0.9061823189258575, "num_tokens": 24313228.0, "step": 1971 }, { "entropy": 1.0361986309289932, "epoch": 1.0384412848867826, "grad_norm": 0.29646071791648865, "learning_rate": 0.00019347881887839878, "loss": 0.22257165610790253, "mean_token_accuracy": 0.9108520895242691, "num_tokens": 24325564.0, "step": 1972 }, { "entropy": 1.043959766626358, "epoch": 1.038967877830437, "grad_norm": 0.3205704092979431, "learning_rate": 0.00019347062140804126, "loss": 0.21183185279369354, "mean_token_accuracy": 0.9146294444799423, "num_tokens": 24337900.0, "step": 1973 }, { "entropy": 1.0562986433506012, "epoch": 1.0394944707740916, "grad_norm": 0.31516483426094055, "learning_rate": 0.00019346241898251945, "loss": 0.222466379404068, "mean_token_accuracy": 0.912394255399704, "num_tokens": 24350236.0, "step": 1974 }, { "entropy": 0.9892242848873138, "epoch": 1.0400210637177463, "grad_norm": 0.27365726232528687, "learning_rate": 0.0001934542116023203, "loss": 0.18739140033721924, "mean_token_accuracy": 0.924969956278801, "num_tokens": 24362572.0, "step": 1975 }, { "entropy": 1.006972685456276, "epoch": 1.0405476566614007, "grad_norm": 0.2618653178215027, "learning_rate": 0.00019344599926793098, "loss": 0.2140425145626068, "mean_token_accuracy": 0.9133986085653305, "num_tokens": 24374908.0, "step": 1976 }, { "entropy": 1.0172683149576187, "epoch": 1.0410742496050553, "grad_norm": 0.29427164793014526, "learning_rate": 0.00019343778197983912, "loss": 0.22519932687282562, "mean_token_accuracy": 0.9123007953166962, "num_tokens": 24387244.0, "step": 1977 }, { "entropy": 1.01324824988842, "epoch": 1.0416008425487098, "grad_norm": 0.2959752678871155, "learning_rate": 0.00019342955973853236, "loss": 0.2103637009859085, "mean_token_accuracy": 0.9110966324806213, "num_tokens": 24399580.0, "step": 1978 }, { "entropy": 0.9949903935194016, "epoch": 1.0421274354923644, "grad_norm": 0.26972147822380066, "learning_rate": 0.00019342133254449898, "loss": 0.19294336438179016, "mean_token_accuracy": 0.9218278974294662, "num_tokens": 24411916.0, "step": 1979 }, { "entropy": 1.003416359424591, "epoch": 1.042654028436019, "grad_norm": 0.29061558842658997, "learning_rate": 0.00019341310039822725, "loss": 0.1943337321281433, "mean_token_accuracy": 0.9220097661018372, "num_tokens": 24424252.0, "step": 1980 }, { "entropy": 1.0185414999723434, "epoch": 1.0431806213796735, "grad_norm": 0.2810025215148926, "learning_rate": 0.00019340486330020595, "loss": 0.1928320974111557, "mean_token_accuracy": 0.9200875461101532, "num_tokens": 24436588.0, "step": 1981 }, { "entropy": 1.0032877922058105, "epoch": 1.0437072143233281, "grad_norm": 0.27209043502807617, "learning_rate": 0.00019339662125092403, "loss": 0.19464010000228882, "mean_token_accuracy": 0.9196325391530991, "num_tokens": 24448924.0, "step": 1982 }, { "entropy": 1.0001914203166962, "epoch": 1.0442338072669826, "grad_norm": 0.3038516342639923, "learning_rate": 0.00019338837425087078, "loss": 0.21659797430038452, "mean_token_accuracy": 0.9114441424608231, "num_tokens": 24461260.0, "step": 1983 }, { "entropy": 0.9755618721246719, "epoch": 1.0447604002106372, "grad_norm": 0.27092164754867554, "learning_rate": 0.00019338012230053574, "loss": 0.19371184706687927, "mean_token_accuracy": 0.9238433092832565, "num_tokens": 24473596.0, "step": 1984 }, { "entropy": 0.9904940128326416, "epoch": 1.0452869931542916, "grad_norm": 0.29529231786727905, "learning_rate": 0.00019337186540040885, "loss": 0.20442527532577515, "mean_token_accuracy": 0.9141305983066559, "num_tokens": 24485932.0, "step": 1985 }, { "entropy": 0.9658221155405045, "epoch": 1.0458135860979463, "grad_norm": 0.27508610486984253, "learning_rate": 0.00019336360355098024, "loss": 0.21024343371391296, "mean_token_accuracy": 0.9153925180435181, "num_tokens": 24498268.0, "step": 1986 }, { "entropy": 0.9924428313970566, "epoch": 1.046340179041601, "grad_norm": 0.28747668862342834, "learning_rate": 0.00019335533675274037, "loss": 0.18813030421733856, "mean_token_accuracy": 0.9244283735752106, "num_tokens": 24510604.0, "step": 1987 }, { "entropy": 1.0350338965654373, "epoch": 1.0468667719852554, "grad_norm": 0.28181594610214233, "learning_rate": 0.00019334706500617998, "loss": 0.18969137966632843, "mean_token_accuracy": 0.9228011220693588, "num_tokens": 24522940.0, "step": 1988 }, { "entropy": 1.017800748348236, "epoch": 1.04739336492891, "grad_norm": 0.2933719754219055, "learning_rate": 0.00019333878831179012, "loss": 0.2083795666694641, "mean_token_accuracy": 0.9186853021383286, "num_tokens": 24535276.0, "step": 1989 }, { "entropy": 1.0671946704387665, "epoch": 1.0479199578725644, "grad_norm": 0.28361761569976807, "learning_rate": 0.00019333050667006213, "loss": 0.20133714377880096, "mean_token_accuracy": 0.9176107496023178, "num_tokens": 24547612.0, "step": 1990 }, { "entropy": 1.0133258700370789, "epoch": 1.048446550816219, "grad_norm": 0.2936132550239563, "learning_rate": 0.00019332222008148765, "loss": 0.23258453607559204, "mean_token_accuracy": 0.9048744589090347, "num_tokens": 24559948.0, "step": 1991 }, { "entropy": 1.1020651161670685, "epoch": 1.0489731437598737, "grad_norm": 0.29475727677345276, "learning_rate": 0.0001933139285465586, "loss": 0.23158571124076843, "mean_token_accuracy": 0.90408755838871, "num_tokens": 24572284.0, "step": 1992 }, { "entropy": 1.0560840368270874, "epoch": 1.0494997367035281, "grad_norm": 0.2781185805797577, "learning_rate": 0.00019330563206576725, "loss": 0.21855907142162323, "mean_token_accuracy": 0.9118623584508896, "num_tokens": 24584620.0, "step": 1993 }, { "entropy": 1.1237812638282776, "epoch": 1.0500263296471828, "grad_norm": 0.3516911268234253, "learning_rate": 0.000193297330639606, "loss": 0.21132902801036835, "mean_token_accuracy": 0.9161721616983414, "num_tokens": 24596956.0, "step": 1994 }, { "entropy": 1.0761407017707825, "epoch": 1.0505529225908372, "grad_norm": 0.2794252038002014, "learning_rate": 0.00019328902426856776, "loss": 0.20890802145004272, "mean_token_accuracy": 0.920161560177803, "num_tokens": 24609292.0, "step": 1995 }, { "entropy": 1.049127846956253, "epoch": 1.0510795155344919, "grad_norm": 0.2529737651348114, "learning_rate": 0.00019328071295314557, "loss": 0.1920773684978485, "mean_token_accuracy": 0.9240875691175461, "num_tokens": 24621628.0, "step": 1996 }, { "entropy": 1.1565322875976562, "epoch": 1.0516061084781465, "grad_norm": 0.28871044516563416, "learning_rate": 0.00019327239669383287, "loss": 0.21732774376869202, "mean_token_accuracy": 0.9144384115934372, "num_tokens": 24633964.0, "step": 1997 }, { "entropy": 1.0519833862781525, "epoch": 1.052132701421801, "grad_norm": 0.25382453203201294, "learning_rate": 0.00019326407549112332, "loss": 0.2088373750448227, "mean_token_accuracy": 0.9129265993833542, "num_tokens": 24646300.0, "step": 1998 }, { "entropy": 1.0678929388523102, "epoch": 1.0526592943654556, "grad_norm": 0.2656494081020355, "learning_rate": 0.0001932557493455109, "loss": 0.19079969823360443, "mean_token_accuracy": 0.9278986901044846, "num_tokens": 24658636.0, "step": 1999 }, { "entropy": 1.074799358844757, "epoch": 1.05318588730911, "grad_norm": 0.27760738134384155, "learning_rate": 0.00019324741825748988, "loss": 0.18772991001605988, "mean_token_accuracy": 0.9245434403419495, "num_tokens": 24670972.0, "step": 2000 }, { "entropy": 1.0773050487041473, "epoch": 1.0537124802527646, "grad_norm": 0.27600982785224915, "learning_rate": 0.0001932390822275549, "loss": 0.20754915475845337, "mean_token_accuracy": 0.9160582423210144, "num_tokens": 24683308.0, "step": 2001 }, { "entropy": 1.0425165295600891, "epoch": 1.054239073196419, "grad_norm": 0.2946891188621521, "learning_rate": 0.0001932307412562007, "loss": 0.1997680515050888, "mean_token_accuracy": 0.9208045303821564, "num_tokens": 24695644.0, "step": 2002 }, { "entropy": 1.0058126598596573, "epoch": 1.0547656661400737, "grad_norm": 0.29050102829933167, "learning_rate": 0.00019322239534392253, "loss": 0.20790837705135345, "mean_token_accuracy": 0.9103892594575882, "num_tokens": 24707980.0, "step": 2003 }, { "entropy": 0.9951896965503693, "epoch": 1.0552922590837284, "grad_norm": 0.3011538088321686, "learning_rate": 0.0001932140444912158, "loss": 0.20860427618026733, "mean_token_accuracy": 0.9159162491559982, "num_tokens": 24720316.0, "step": 2004 }, { "entropy": 1.0219779312610626, "epoch": 1.0558188520273828, "grad_norm": 0.2890591323375702, "learning_rate": 0.00019320568869857623, "loss": 0.22163572907447815, "mean_token_accuracy": 0.911671981215477, "num_tokens": 24732652.0, "step": 2005 }, { "entropy": 1.0054317712783813, "epoch": 1.0563454449710374, "grad_norm": 0.31731894612312317, "learning_rate": 0.00019319732796649992, "loss": 0.21079890429973602, "mean_token_accuracy": 0.9145800471305847, "num_tokens": 24744988.0, "step": 2006 }, { "entropy": 0.9920244216918945, "epoch": 1.0568720379146919, "grad_norm": 0.26154065132141113, "learning_rate": 0.00019318896229548313, "loss": 0.1758606880903244, "mean_token_accuracy": 0.9275805801153183, "num_tokens": 24757324.0, "step": 2007 }, { "entropy": 1.013138324022293, "epoch": 1.0573986308583465, "grad_norm": 0.2615264058113098, "learning_rate": 0.00019318059168602251, "loss": 0.18549133837223053, "mean_token_accuracy": 0.9265227019786835, "num_tokens": 24769660.0, "step": 2008 }, { "entropy": 1.0628323256969452, "epoch": 1.0579252238020012, "grad_norm": 0.3117140233516693, "learning_rate": 0.000193172216138615, "loss": 0.22904282808303833, "mean_token_accuracy": 0.9080474376678467, "num_tokens": 24781996.0, "step": 2009 }, { "entropy": 1.061298355460167, "epoch": 1.0584518167456556, "grad_norm": 0.2991147041320801, "learning_rate": 0.00019316383565375777, "loss": 0.19954919815063477, "mean_token_accuracy": 0.9186259061098099, "num_tokens": 24794332.0, "step": 2010 }, { "entropy": 1.0400668680667877, "epoch": 1.0589784096893102, "grad_norm": 0.29817700386047363, "learning_rate": 0.00019315545023194835, "loss": 0.21616995334625244, "mean_token_accuracy": 0.912378340959549, "num_tokens": 24806668.0, "step": 2011 }, { "entropy": 1.0405495166778564, "epoch": 1.0595050026329647, "grad_norm": 0.2854476571083069, "learning_rate": 0.0001931470598736845, "loss": 0.2017708569765091, "mean_token_accuracy": 0.91714146733284, "num_tokens": 24819004.0, "step": 2012 }, { "entropy": 1.0748549401760101, "epoch": 1.0600315955766193, "grad_norm": 0.30470097064971924, "learning_rate": 0.00019313866457946433, "loss": 0.20843440294265747, "mean_token_accuracy": 0.917302206158638, "num_tokens": 24831340.0, "step": 2013 }, { "entropy": 1.0435102880001068, "epoch": 1.0605581885202737, "grad_norm": 0.29722654819488525, "learning_rate": 0.0001931302643497862, "loss": 0.2125845104455948, "mean_token_accuracy": 0.9157662689685822, "num_tokens": 24843676.0, "step": 2014 }, { "entropy": 1.0407266318798065, "epoch": 1.0610847814639284, "grad_norm": 0.27866822481155396, "learning_rate": 0.0001931218591851488, "loss": 0.1866873800754547, "mean_token_accuracy": 0.9244244992733002, "num_tokens": 24856012.0, "step": 2015 }, { "entropy": 1.0343786031007767, "epoch": 1.061611374407583, "grad_norm": 0.29595327377319336, "learning_rate": 0.00019311344908605108, "loss": 0.21080759167671204, "mean_token_accuracy": 0.9200511127710342, "num_tokens": 24868348.0, "step": 2016 }, { "entropy": 1.0134167224168777, "epoch": 1.0621379673512374, "grad_norm": 0.2973070740699768, "learning_rate": 0.0001931050340529923, "loss": 0.21294423937797546, "mean_token_accuracy": 0.9145906716585159, "num_tokens": 24880684.0, "step": 2017 }, { "entropy": 1.129615068435669, "epoch": 1.062664560294892, "grad_norm": 0.29881370067596436, "learning_rate": 0.00019309661408647207, "loss": 0.20720480382442474, "mean_token_accuracy": 0.9196062386035919, "num_tokens": 24893020.0, "step": 2018 }, { "entropy": 1.0598470270633698, "epoch": 1.0631911532385465, "grad_norm": 0.26026830077171326, "learning_rate": 0.00019308818918699016, "loss": 0.17674966156482697, "mean_token_accuracy": 0.9275426715612411, "num_tokens": 24905356.0, "step": 2019 }, { "entropy": 1.045887529850006, "epoch": 1.0637177461822012, "grad_norm": 0.25472280383110046, "learning_rate": 0.00019307975935504672, "loss": 0.17633673548698425, "mean_token_accuracy": 0.9277019053697586, "num_tokens": 24917692.0, "step": 2020 }, { "entropy": 1.0263851881027222, "epoch": 1.0642443391258558, "grad_norm": 0.2858225107192993, "learning_rate": 0.00019307132459114222, "loss": 0.20337790250778198, "mean_token_accuracy": 0.9162404388189316, "num_tokens": 24930028.0, "step": 2021 }, { "entropy": 1.0703861713409424, "epoch": 1.0647709320695102, "grad_norm": 0.3153981566429138, "learning_rate": 0.00019306288489577734, "loss": 0.217787504196167, "mean_token_accuracy": 0.9114295095205307, "num_tokens": 24942364.0, "step": 2022 }, { "entropy": 1.0497725158929825, "epoch": 1.0652975250131649, "grad_norm": 0.29816338419914246, "learning_rate": 0.0001930544402694531, "loss": 0.21639864146709442, "mean_token_accuracy": 0.9137828648090363, "num_tokens": 24954700.0, "step": 2023 }, { "entropy": 1.0218316316604614, "epoch": 1.0658241179568193, "grad_norm": 0.32789114117622375, "learning_rate": 0.00019304599071267082, "loss": 0.22291415929794312, "mean_token_accuracy": 0.9094216227531433, "num_tokens": 24967036.0, "step": 2024 }, { "entropy": 1.0307366997003555, "epoch": 1.066350710900474, "grad_norm": 0.2897968888282776, "learning_rate": 0.0001930375362259321, "loss": 0.20538388192653656, "mean_token_accuracy": 0.9126376360654831, "num_tokens": 24979372.0, "step": 2025 }, { "entropy": 1.0069323182106018, "epoch": 1.0668773038441284, "grad_norm": 0.258139044046402, "learning_rate": 0.00019302907680973888, "loss": 0.19350063800811768, "mean_token_accuracy": 0.9235964566469193, "num_tokens": 24991708.0, "step": 2026 }, { "entropy": 0.9675715416669846, "epoch": 1.067403896787783, "grad_norm": 0.28487148880958557, "learning_rate": 0.00019302061246459325, "loss": 0.2119164764881134, "mean_token_accuracy": 0.9105935990810394, "num_tokens": 25004044.0, "step": 2027 }, { "entropy": 1.0363286584615707, "epoch": 1.0679304897314377, "grad_norm": 0.30349263548851013, "learning_rate": 0.00019301214319099774, "loss": 0.20691387355327606, "mean_token_accuracy": 0.9157197773456573, "num_tokens": 25016380.0, "step": 2028 }, { "entropy": 1.0630298554897308, "epoch": 1.068457082675092, "grad_norm": 0.30097535252571106, "learning_rate": 0.0001930036689894551, "loss": 0.20818623900413513, "mean_token_accuracy": 0.9164175242185593, "num_tokens": 25028716.0, "step": 2029 }, { "entropy": 0.996089369058609, "epoch": 1.0689836756187467, "grad_norm": 0.28663763403892517, "learning_rate": 0.0001929951898604685, "loss": 0.2216407209634781, "mean_token_accuracy": 0.9137296378612518, "num_tokens": 25041052.0, "step": 2030 }, { "entropy": 1.0333895981311798, "epoch": 1.0695102685624012, "grad_norm": 0.2872811555862427, "learning_rate": 0.00019298670580454114, "loss": 0.19668258726596832, "mean_token_accuracy": 0.9209001511335373, "num_tokens": 25053388.0, "step": 2031 }, { "entropy": 1.050906777381897, "epoch": 1.0700368615060558, "grad_norm": 0.29872143268585205, "learning_rate": 0.00019297821682217676, "loss": 0.21886757016181946, "mean_token_accuracy": 0.9144444167613983, "num_tokens": 25065724.0, "step": 2032 }, { "entropy": 0.9869663417339325, "epoch": 1.0705634544497105, "grad_norm": 0.26373037695884705, "learning_rate": 0.00019296972291387926, "loss": 0.21317996084690094, "mean_token_accuracy": 0.913250133395195, "num_tokens": 25078060.0, "step": 2033 }, { "entropy": 0.996940404176712, "epoch": 1.0710900473933649, "grad_norm": 0.27339690923690796, "learning_rate": 0.00019296122408015294, "loss": 0.21194380521774292, "mean_token_accuracy": 0.9130052775144577, "num_tokens": 25090396.0, "step": 2034 }, { "entropy": 1.0184991508722305, "epoch": 1.0716166403370195, "grad_norm": 0.2744937539100647, "learning_rate": 0.00019295272032150224, "loss": 0.19760127365589142, "mean_token_accuracy": 0.9164283275604248, "num_tokens": 25102732.0, "step": 2035 }, { "entropy": 1.0074135214090347, "epoch": 1.072143233280674, "grad_norm": 0.28469040989875793, "learning_rate": 0.00019294421163843203, "loss": 0.2201453596353531, "mean_token_accuracy": 0.9090453386306763, "num_tokens": 25115068.0, "step": 2036 }, { "entropy": 0.9988047778606415, "epoch": 1.0726698262243286, "grad_norm": 0.26611679792404175, "learning_rate": 0.00019293569803144743, "loss": 0.21755945682525635, "mean_token_accuracy": 0.9131471365690231, "num_tokens": 25127404.0, "step": 2037 }, { "entropy": 0.9802228659391403, "epoch": 1.0731964191679833, "grad_norm": 0.27171045541763306, "learning_rate": 0.00019292717950105382, "loss": 0.21177193522453308, "mean_token_accuracy": 0.9141269624233246, "num_tokens": 25139740.0, "step": 2038 }, { "entropy": 1.0224299430847168, "epoch": 1.0737230121116377, "grad_norm": 0.304115355014801, "learning_rate": 0.00019291865604775688, "loss": 0.21834969520568848, "mean_token_accuracy": 0.9116663038730621, "num_tokens": 25152076.0, "step": 2039 }, { "entropy": 1.0109304785728455, "epoch": 1.0742496050552923, "grad_norm": 0.2777882218360901, "learning_rate": 0.00019291012767206261, "loss": 0.19935154914855957, "mean_token_accuracy": 0.9226459413766861, "num_tokens": 25164412.0, "step": 2040 }, { "entropy": 1.0325984209775925, "epoch": 1.0747761979989467, "grad_norm": 0.3269108235836029, "learning_rate": 0.00019290159437447733, "loss": 0.23336344957351685, "mean_token_accuracy": 0.9101394861936569, "num_tokens": 25176748.0, "step": 2041 }, { "entropy": 1.0169707685709, "epoch": 1.0753027909426014, "grad_norm": 0.2711583077907562, "learning_rate": 0.00019289305615550754, "loss": 0.19230744242668152, "mean_token_accuracy": 0.9222860485315323, "num_tokens": 25189084.0, "step": 2042 }, { "entropy": 0.9706145972013474, "epoch": 1.0758293838862558, "grad_norm": 0.26547273993492126, "learning_rate": 0.0001928845130156602, "loss": 0.20648162066936493, "mean_token_accuracy": 0.9119333028793335, "num_tokens": 25201420.0, "step": 2043 }, { "entropy": 1.017429158091545, "epoch": 1.0763559768299105, "grad_norm": 0.2850116491317749, "learning_rate": 0.00019287596495544233, "loss": 0.2100791037082672, "mean_token_accuracy": 0.9145694822072983, "num_tokens": 25213756.0, "step": 2044 }, { "entropy": 0.9998975098133087, "epoch": 1.0768825697735651, "grad_norm": 0.2765794098377228, "learning_rate": 0.0001928674119753615, "loss": 0.2017804980278015, "mean_token_accuracy": 0.9189972132444382, "num_tokens": 25226092.0, "step": 2045 }, { "entropy": 1.041368529200554, "epoch": 1.0774091627172195, "grad_norm": 0.2918790280818939, "learning_rate": 0.00019285885407592542, "loss": 0.20694515109062195, "mean_token_accuracy": 0.9102893173694611, "num_tokens": 25238428.0, "step": 2046 }, { "entropy": 0.9665294885635376, "epoch": 1.0779357556608742, "grad_norm": 0.2802746891975403, "learning_rate": 0.0001928502912576421, "loss": 0.2127482146024704, "mean_token_accuracy": 0.9124037772417068, "num_tokens": 25250764.0, "step": 2047 }, { "entropy": 1.009907528758049, "epoch": 1.0784623486045286, "grad_norm": 0.3065343201160431, "learning_rate": 0.0001928417235210199, "loss": 0.23531584441661835, "mean_token_accuracy": 0.9090160578489304, "num_tokens": 25263100.0, "step": 2048 }, { "entropy": 1.0422001481056213, "epoch": 1.0789889415481833, "grad_norm": 0.295613169670105, "learning_rate": 0.00019283315086656737, "loss": 0.20345695316791534, "mean_token_accuracy": 0.9175281077623367, "num_tokens": 25275436.0, "step": 2049 }, { "entropy": 1.0016635805368423, "epoch": 1.079515534491838, "grad_norm": 0.27219337224960327, "learning_rate": 0.0001928245732947935, "loss": 0.19025292992591858, "mean_token_accuracy": 0.9241680800914764, "num_tokens": 25287772.0, "step": 2050 }, { "entropy": 0.9872867614030838, "epoch": 1.0800421274354923, "grad_norm": 0.2815146744251251, "learning_rate": 0.00019281599080620741, "loss": 0.2239912748336792, "mean_token_accuracy": 0.9086337685585022, "num_tokens": 25300108.0, "step": 2051 }, { "entropy": 1.0149886310100555, "epoch": 1.080568720379147, "grad_norm": 0.2981141209602356, "learning_rate": 0.0001928074034013187, "loss": 0.21916988492012024, "mean_token_accuracy": 0.9091440141201019, "num_tokens": 25312444.0, "step": 2052 }, { "entropy": 0.9956868588924408, "epoch": 1.0810953133228014, "grad_norm": 0.28481054306030273, "learning_rate": 0.00019279881108063705, "loss": 0.21595682203769684, "mean_token_accuracy": 0.912951722741127, "num_tokens": 25324780.0, "step": 2053 }, { "entropy": 1.0007793605327606, "epoch": 1.081621906266456, "grad_norm": 0.281215637922287, "learning_rate": 0.00019279021384467255, "loss": 0.21096494793891907, "mean_token_accuracy": 0.9124733507633209, "num_tokens": 25337116.0, "step": 2054 }, { "entropy": 1.0316517055034637, "epoch": 1.0821484992101107, "grad_norm": 0.4712248742580414, "learning_rate": 0.00019278161169393563, "loss": 0.21723365783691406, "mean_token_accuracy": 0.9101579338312149, "num_tokens": 25349452.0, "step": 2055 }, { "entropy": 1.036922350525856, "epoch": 1.0826750921537651, "grad_norm": 0.27001330256462097, "learning_rate": 0.0001927730046289369, "loss": 0.2058403491973877, "mean_token_accuracy": 0.9116992652416229, "num_tokens": 25361788.0, "step": 2056 }, { "entropy": 1.043273389339447, "epoch": 1.0832016850974198, "grad_norm": 0.29966092109680176, "learning_rate": 0.0001927643926501873, "loss": 0.2038857638835907, "mean_token_accuracy": 0.9206432849168777, "num_tokens": 25374124.0, "step": 2057 }, { "entropy": 1.1009390354156494, "epoch": 1.0837282780410742, "grad_norm": 0.295094758272171, "learning_rate": 0.0001927557757581981, "loss": 0.21461978554725647, "mean_token_accuracy": 0.9137238711118698, "num_tokens": 25386460.0, "step": 2058 }, { "entropy": 1.0440688282251358, "epoch": 1.0842548709847288, "grad_norm": 0.2719572186470032, "learning_rate": 0.00019274715395348085, "loss": 0.19468249380588531, "mean_token_accuracy": 0.9245257526636124, "num_tokens": 25398796.0, "step": 2059 }, { "entropy": 1.095595896244049, "epoch": 1.0847814639283833, "grad_norm": 0.30201783776283264, "learning_rate": 0.00019273852723654736, "loss": 0.2008979767560959, "mean_token_accuracy": 0.9223850518465042, "num_tokens": 25411132.0, "step": 2060 }, { "entropy": 1.072413593530655, "epoch": 1.085308056872038, "grad_norm": 0.3010813891887665, "learning_rate": 0.00019272989560790974, "loss": 0.1963309794664383, "mean_token_accuracy": 0.9216117411851883, "num_tokens": 25423468.0, "step": 2061 }, { "entropy": 1.0537616908550262, "epoch": 1.0858346498156926, "grad_norm": 0.4835893213748932, "learning_rate": 0.00019272125906808038, "loss": 0.2151128351688385, "mean_token_accuracy": 0.9163444191217422, "num_tokens": 25435804.0, "step": 2062 }, { "entropy": 1.0696274489164352, "epoch": 1.086361242759347, "grad_norm": 0.2978211045265198, "learning_rate": 0.00019271261761757202, "loss": 0.19762234389781952, "mean_token_accuracy": 0.9217347949743271, "num_tokens": 25448140.0, "step": 2063 }, { "entropy": 1.0669613778591156, "epoch": 1.0868878357030016, "grad_norm": 0.27142512798309326, "learning_rate": 0.00019270397125689765, "loss": 0.20439964532852173, "mean_token_accuracy": 0.9173642098903656, "num_tokens": 25460476.0, "step": 2064 }, { "entropy": 1.0918617248535156, "epoch": 1.087414428646656, "grad_norm": 0.2899603545665741, "learning_rate": 0.00019269531998657055, "loss": 0.2081996202468872, "mean_token_accuracy": 0.916422575712204, "num_tokens": 25472812.0, "step": 2065 }, { "entropy": 1.0441029965877533, "epoch": 1.0879410215903107, "grad_norm": 0.2680945098400116, "learning_rate": 0.00019268666380710425, "loss": 0.19378285109996796, "mean_token_accuracy": 0.9220094531774521, "num_tokens": 25485148.0, "step": 2066 }, { "entropy": 1.0455826669931412, "epoch": 1.0884676145339653, "grad_norm": 0.2643810212612152, "learning_rate": 0.0001926780027190127, "loss": 0.19173350930213928, "mean_token_accuracy": 0.9210256785154343, "num_tokens": 25497484.0, "step": 2067 }, { "entropy": 1.169319897890091, "epoch": 1.0889942074776198, "grad_norm": 0.3351131081581116, "learning_rate": 0.00019266933672280998, "loss": 0.20055952668190002, "mean_token_accuracy": 0.9239787012338638, "num_tokens": 25509820.0, "step": 2068 }, { "entropy": 0.9933416992425919, "epoch": 1.0895208004212744, "grad_norm": 0.2722816467285156, "learning_rate": 0.00019266066581901056, "loss": 0.18528851866722107, "mean_token_accuracy": 0.925559476017952, "num_tokens": 25522156.0, "step": 2069 }, { "entropy": 1.0143402963876724, "epoch": 1.0900473933649288, "grad_norm": 0.2853977680206299, "learning_rate": 0.00019265199000812922, "loss": 0.20564962923526764, "mean_token_accuracy": 0.918012797832489, "num_tokens": 25534492.0, "step": 2070 }, { "entropy": 1.0507995039224625, "epoch": 1.0905739863085835, "grad_norm": 0.2650372385978699, "learning_rate": 0.00019264330929068098, "loss": 0.19438353180885315, "mean_token_accuracy": 0.9210219085216522, "num_tokens": 25546828.0, "step": 2071 }, { "entropy": 1.0700190365314484, "epoch": 1.0911005792522381, "grad_norm": 0.2895369529724121, "learning_rate": 0.00019263462366718112, "loss": 0.20609940588474274, "mean_token_accuracy": 0.9171310365200043, "num_tokens": 25559164.0, "step": 2072 }, { "entropy": 1.0044712573289871, "epoch": 1.0916271721958926, "grad_norm": 0.2867662310600281, "learning_rate": 0.0001926259331381453, "loss": 0.1890471875667572, "mean_token_accuracy": 0.9236837476491928, "num_tokens": 25571500.0, "step": 2073 }, { "entropy": 1.0000011622905731, "epoch": 1.0921537651395472, "grad_norm": 0.2822493612766266, "learning_rate": 0.00019261723770408942, "loss": 0.20667140185832977, "mean_token_accuracy": 0.9199023395776749, "num_tokens": 25583836.0, "step": 2074 }, { "entropy": 0.966169461607933, "epoch": 1.0926803580832016, "grad_norm": 0.28859975934028625, "learning_rate": 0.00019260853736552963, "loss": 0.21461637318134308, "mean_token_accuracy": 0.909663125872612, "num_tokens": 25596172.0, "step": 2075 }, { "entropy": 1.0433668792247772, "epoch": 1.0932069510268563, "grad_norm": 0.2675197422504425, "learning_rate": 0.0001925998321229825, "loss": 0.20010057091712952, "mean_token_accuracy": 0.9186754375696182, "num_tokens": 25608508.0, "step": 2076 }, { "entropy": 1.08010932803154, "epoch": 1.0937335439705107, "grad_norm": 0.2648799419403076, "learning_rate": 0.00019259112197696473, "loss": 0.1912347376346588, "mean_token_accuracy": 0.923126220703125, "num_tokens": 25620844.0, "step": 2077 }, { "entropy": 1.0481482297182083, "epoch": 1.0942601369141653, "grad_norm": 0.26581716537475586, "learning_rate": 0.00019258240692799342, "loss": 0.2124476432800293, "mean_token_accuracy": 0.9156401306390762, "num_tokens": 25633180.0, "step": 2078 }, { "entropy": 0.991655707359314, "epoch": 1.09478672985782, "grad_norm": 0.24418914318084717, "learning_rate": 0.00019257368697658597, "loss": 0.1879653036594391, "mean_token_accuracy": 0.9245227575302124, "num_tokens": 25645516.0, "step": 2079 }, { "entropy": 1.029534325003624, "epoch": 1.0953133228014744, "grad_norm": 0.27712008357048035, "learning_rate": 0.00019256496212326, "loss": 0.19567881524562836, "mean_token_accuracy": 0.9220569729804993, "num_tokens": 25657852.0, "step": 2080 }, { "entropy": 1.0455122739076614, "epoch": 1.095839915745129, "grad_norm": 0.25748133659362793, "learning_rate": 0.0001925562323685334, "loss": 0.19087985157966614, "mean_token_accuracy": 0.9210804253816605, "num_tokens": 25670188.0, "step": 2081 }, { "entropy": 1.053975835442543, "epoch": 1.0963665086887835, "grad_norm": 0.2648088037967682, "learning_rate": 0.0001925474977129245, "loss": 0.20259462296962738, "mean_token_accuracy": 0.9170144945383072, "num_tokens": 25682524.0, "step": 2082 }, { "entropy": 1.1167932152748108, "epoch": 1.0968931016324381, "grad_norm": 0.3016040325164795, "learning_rate": 0.0001925387581569518, "loss": 0.2160032093524933, "mean_token_accuracy": 0.9073923379182816, "num_tokens": 25694860.0, "step": 2083 }, { "entropy": 1.0568408221006393, "epoch": 1.0974196945760926, "grad_norm": 0.29051339626312256, "learning_rate": 0.0001925300137011341, "loss": 0.1947801113128662, "mean_token_accuracy": 0.9265160709619522, "num_tokens": 25707196.0, "step": 2084 }, { "entropy": 1.0293535590171814, "epoch": 1.0979462875197472, "grad_norm": 0.28292426466941833, "learning_rate": 0.00019252126434599046, "loss": 0.20448973774909973, "mean_token_accuracy": 0.9163498878479004, "num_tokens": 25719532.0, "step": 2085 }, { "entropy": 0.9932720512151718, "epoch": 1.0984728804634019, "grad_norm": 0.268726110458374, "learning_rate": 0.00019251251009204037, "loss": 0.20217624306678772, "mean_token_accuracy": 0.9180169999599457, "num_tokens": 25731868.0, "step": 2086 }, { "entropy": 1.03742016851902, "epoch": 1.0989994734070563, "grad_norm": 0.2555520534515381, "learning_rate": 0.00019250375093980346, "loss": 0.19689497351646423, "mean_token_accuracy": 0.922407329082489, "num_tokens": 25744204.0, "step": 2087 }, { "entropy": 1.0640356242656708, "epoch": 1.099526066350711, "grad_norm": 0.28077611327171326, "learning_rate": 0.00019249498688979973, "loss": 0.2088557481765747, "mean_token_accuracy": 0.9098563194274902, "num_tokens": 25756540.0, "step": 2088 }, { "entropy": 1.059511423110962, "epoch": 1.1000526592943654, "grad_norm": 0.27445870637893677, "learning_rate": 0.00019248621794254944, "loss": 0.20993183553218842, "mean_token_accuracy": 0.916303813457489, "num_tokens": 25768876.0, "step": 2089 }, { "entropy": 1.0723062455654144, "epoch": 1.10057925223802, "grad_norm": 0.2826826274394989, "learning_rate": 0.00019247744409857316, "loss": 0.20269325375556946, "mean_token_accuracy": 0.9222795218229294, "num_tokens": 25781212.0, "step": 2090 }, { "entropy": 1.0870884507894516, "epoch": 1.1011058451816746, "grad_norm": 0.27127087116241455, "learning_rate": 0.00019246866535839173, "loss": 0.20817485451698303, "mean_token_accuracy": 0.916502445936203, "num_tokens": 25793548.0, "step": 2091 }, { "entropy": 1.037529081106186, "epoch": 1.101632438125329, "grad_norm": 0.28745195269584656, "learning_rate": 0.0001924598817225263, "loss": 0.22985900938510895, "mean_token_accuracy": 0.9097397327423096, "num_tokens": 25805884.0, "step": 2092 }, { "entropy": 1.0101779103279114, "epoch": 1.1021590310689837, "grad_norm": 0.26528680324554443, "learning_rate": 0.00019245109319149833, "loss": 0.19186118245124817, "mean_token_accuracy": 0.923490360379219, "num_tokens": 25818220.0, "step": 2093 }, { "entropy": 1.0416104793548584, "epoch": 1.1026856240126381, "grad_norm": 0.2599078118801117, "learning_rate": 0.0001924422997658295, "loss": 0.2087230086326599, "mean_token_accuracy": 0.9174604564905167, "num_tokens": 25830556.0, "step": 2094 }, { "entropy": 1.071406990289688, "epoch": 1.1032122169562928, "grad_norm": 0.27701428532600403, "learning_rate": 0.00019243350144604185, "loss": 0.21016359329223633, "mean_token_accuracy": 0.9129587262868881, "num_tokens": 25842892.0, "step": 2095 }, { "entropy": 1.0269631147384644, "epoch": 1.1037388098999474, "grad_norm": 0.28013738989830017, "learning_rate": 0.00019242469823265769, "loss": 0.20927533507347107, "mean_token_accuracy": 0.9170541018247604, "num_tokens": 25855228.0, "step": 2096 }, { "entropy": 1.076466590166092, "epoch": 1.1042654028436019, "grad_norm": 0.2795049548149109, "learning_rate": 0.00019241589012619953, "loss": 0.20179404318332672, "mean_token_accuracy": 0.9215785712003708, "num_tokens": 25867564.0, "step": 2097 }, { "entropy": 1.097602665424347, "epoch": 1.1047919957872565, "grad_norm": 0.2958826720714569, "learning_rate": 0.00019240707712719042, "loss": 0.22175639867782593, "mean_token_accuracy": 0.9060819000005722, "num_tokens": 25879900.0, "step": 2098 }, { "entropy": 1.074698805809021, "epoch": 1.105318588730911, "grad_norm": 0.26773980259895325, "learning_rate": 0.0001923982592361534, "loss": 0.18457193672657013, "mean_token_accuracy": 0.923177182674408, "num_tokens": 25892236.0, "step": 2099 }, { "entropy": 1.1188512742519379, "epoch": 1.1058451816745656, "grad_norm": 0.2522232234477997, "learning_rate": 0.000192389436453612, "loss": 0.19157402217388153, "mean_token_accuracy": 0.921467125415802, "num_tokens": 25904572.0, "step": 2100 }, { "entropy": 1.101550132036209, "epoch": 1.10637177461822, "grad_norm": 0.268435537815094, "learning_rate": 0.00019238060878008995, "loss": 0.1853233426809311, "mean_token_accuracy": 0.9239556342363358, "num_tokens": 25916908.0, "step": 2101 }, { "entropy": 1.1288717091083527, "epoch": 1.1068983675618747, "grad_norm": 0.30907148122787476, "learning_rate": 0.00019237177621611134, "loss": 0.21557700634002686, "mean_token_accuracy": 0.912951648235321, "num_tokens": 25929244.0, "step": 2102 }, { "entropy": 1.0122136920690536, "epoch": 1.1074249605055293, "grad_norm": 0.2754114866256714, "learning_rate": 0.00019236293876220042, "loss": 0.22462958097457886, "mean_token_accuracy": 0.9148844480514526, "num_tokens": 25941580.0, "step": 2103 }, { "entropy": 1.0024352222681046, "epoch": 1.1079515534491837, "grad_norm": 0.28880998492240906, "learning_rate": 0.0001923540964188819, "loss": 0.19037997722625732, "mean_token_accuracy": 0.9214117079973221, "num_tokens": 25953916.0, "step": 2104 }, { "entropy": 1.090283751487732, "epoch": 1.1084781463928384, "grad_norm": 0.3156434893608093, "learning_rate": 0.0001923452491866807, "loss": 0.22172510623931885, "mean_token_accuracy": 0.9104326665401459, "num_tokens": 25966252.0, "step": 2105 }, { "entropy": 1.0386274009943008, "epoch": 1.1090047393364928, "grad_norm": 0.28844019770622253, "learning_rate": 0.00019233639706612196, "loss": 0.19381242990493774, "mean_token_accuracy": 0.920799121260643, "num_tokens": 25978588.0, "step": 2106 }, { "entropy": 1.0614490807056427, "epoch": 1.1095313322801474, "grad_norm": 0.2973669767379761, "learning_rate": 0.00019232754005773123, "loss": 0.206210196018219, "mean_token_accuracy": 0.9167844653129578, "num_tokens": 25990924.0, "step": 2107 }, { "entropy": 1.0339891910552979, "epoch": 1.110057925223802, "grad_norm": 0.29104986786842346, "learning_rate": 0.00019231867816203428, "loss": 0.20842497050762177, "mean_token_accuracy": 0.9144662916660309, "num_tokens": 26003260.0, "step": 2108 }, { "entropy": 1.0249072164297104, "epoch": 1.1105845181674565, "grad_norm": 0.28756386041641235, "learning_rate": 0.0001923098113795572, "loss": 0.2018943727016449, "mean_token_accuracy": 0.9205996543169022, "num_tokens": 26015596.0, "step": 2109 }, { "entropy": 1.017577350139618, "epoch": 1.1111111111111112, "grad_norm": 0.30264243483543396, "learning_rate": 0.0001923009397108264, "loss": 0.20579789578914642, "mean_token_accuracy": 0.9167483001947403, "num_tokens": 26027932.0, "step": 2110 }, { "entropy": 1.0238764435052872, "epoch": 1.1116377040547656, "grad_norm": 0.27734920382499695, "learning_rate": 0.00019229206315636845, "loss": 0.19919277727603912, "mean_token_accuracy": 0.9176904708147049, "num_tokens": 26040268.0, "step": 2111 }, { "entropy": 1.002189740538597, "epoch": 1.1121642969984202, "grad_norm": 0.2930961847305298, "learning_rate": 0.00019228318171671035, "loss": 0.19597947597503662, "mean_token_accuracy": 0.9197946488857269, "num_tokens": 26052604.0, "step": 2112 }, { "entropy": 0.9857950955629349, "epoch": 1.1126908899420749, "grad_norm": 0.28313517570495605, "learning_rate": 0.00019227429539237935, "loss": 0.2069045752286911, "mean_token_accuracy": 0.9212967753410339, "num_tokens": 26064940.0, "step": 2113 }, { "entropy": 1.0099002569913864, "epoch": 1.1132174828857293, "grad_norm": 0.2959808111190796, "learning_rate": 0.00019226540418390293, "loss": 0.21741098165512085, "mean_token_accuracy": 0.9100223034620285, "num_tokens": 26077276.0, "step": 2114 }, { "entropy": 0.9958448708057404, "epoch": 1.113744075829384, "grad_norm": 0.2769598364830017, "learning_rate": 0.00019225650809180897, "loss": 0.20837773382663727, "mean_token_accuracy": 0.918271854519844, "num_tokens": 26089612.0, "step": 2115 }, { "entropy": 1.014888659119606, "epoch": 1.1142706687730384, "grad_norm": 0.29256078600883484, "learning_rate": 0.00019224760711662555, "loss": 0.20603659749031067, "mean_token_accuracy": 0.9164493978023529, "num_tokens": 26101948.0, "step": 2116 }, { "entropy": 1.005908653140068, "epoch": 1.114797261716693, "grad_norm": 0.2789181172847748, "learning_rate": 0.00019223870125888108, "loss": 0.19784985482692719, "mean_token_accuracy": 0.9218984693288803, "num_tokens": 26114284.0, "step": 2117 }, { "entropy": 1.0451974421739578, "epoch": 1.1153238546603474, "grad_norm": 0.27004557847976685, "learning_rate": 0.0001922297905191042, "loss": 0.19614283740520477, "mean_token_accuracy": 0.9270102232694626, "num_tokens": 26126620.0, "step": 2118 }, { "entropy": 1.091399073600769, "epoch": 1.115850447604002, "grad_norm": 0.28412166237831116, "learning_rate": 0.000192220874897824, "loss": 0.18808285892009735, "mean_token_accuracy": 0.9227005243301392, "num_tokens": 26138956.0, "step": 2119 }, { "entropy": 1.0639157593250275, "epoch": 1.1163770405476567, "grad_norm": 0.29297924041748047, "learning_rate": 0.0001922119543955696, "loss": 0.20654083788394928, "mean_token_accuracy": 0.9152026325464249, "num_tokens": 26151292.0, "step": 2120 }, { "entropy": 1.0102118253707886, "epoch": 1.1169036334913112, "grad_norm": 0.27283284068107605, "learning_rate": 0.0001922030290128707, "loss": 0.19149716198444366, "mean_token_accuracy": 0.9258815199136734, "num_tokens": 26163628.0, "step": 2121 }, { "entropy": 1.0362121015787125, "epoch": 1.1174302264349658, "grad_norm": 0.28490447998046875, "learning_rate": 0.00019219409875025705, "loss": 0.1954336166381836, "mean_token_accuracy": 0.9174920916557312, "num_tokens": 26175964.0, "step": 2122 }, { "entropy": 1.0734621286392212, "epoch": 1.1179568193786202, "grad_norm": 0.289915531873703, "learning_rate": 0.0001921851636082588, "loss": 0.20870134234428406, "mean_token_accuracy": 0.9131461679935455, "num_tokens": 26188300.0, "step": 2123 }, { "entropy": 1.1021492779254913, "epoch": 1.1184834123222749, "grad_norm": 0.30639079213142395, "learning_rate": 0.0001921762235874064, "loss": 0.21529828011989594, "mean_token_accuracy": 0.9132403880357742, "num_tokens": 26200636.0, "step": 2124 }, { "entropy": 1.041254460811615, "epoch": 1.1190100052659295, "grad_norm": 0.24776063859462738, "learning_rate": 0.00019216727868823062, "loss": 0.19100171327590942, "mean_token_accuracy": 0.9220355451107025, "num_tokens": 26212972.0, "step": 2125 }, { "entropy": 1.0897882282733917, "epoch": 1.119536598209584, "grad_norm": 0.28905171155929565, "learning_rate": 0.00019215832891126237, "loss": 0.19190385937690735, "mean_token_accuracy": 0.9242671728134155, "num_tokens": 26225308.0, "step": 2126 }, { "entropy": 1.1073324233293533, "epoch": 1.1200631911532386, "grad_norm": 0.2728095054626465, "learning_rate": 0.000192149374257033, "loss": 0.2034318745136261, "mean_token_accuracy": 0.9145397841930389, "num_tokens": 26237644.0, "step": 2127 }, { "entropy": 1.1713103353977203, "epoch": 1.120589784096893, "grad_norm": 0.31770387291908264, "learning_rate": 0.00019214041472607408, "loss": 0.22776833176612854, "mean_token_accuracy": 0.9096698760986328, "num_tokens": 26249980.0, "step": 2128 }, { "entropy": 1.169573962688446, "epoch": 1.1211163770405477, "grad_norm": 0.3100426495075226, "learning_rate": 0.00019213145031891747, "loss": 0.19859901070594788, "mean_token_accuracy": 0.9183387011289597, "num_tokens": 26262316.0, "step": 2129 }, { "entropy": 1.0875117480754852, "epoch": 1.1216429699842023, "grad_norm": 0.27162665128707886, "learning_rate": 0.00019212248103609537, "loss": 0.20907218754291534, "mean_token_accuracy": 0.9196607321500778, "num_tokens": 26274652.0, "step": 2130 }, { "entropy": 1.084071934223175, "epoch": 1.1221695629278567, "grad_norm": 0.2759605944156647, "learning_rate": 0.00019211350687814023, "loss": 0.18926078081130981, "mean_token_accuracy": 0.9211393296718597, "num_tokens": 26286988.0, "step": 2131 }, { "entropy": 1.1398064196109772, "epoch": 1.1226961558715114, "grad_norm": 0.28818970918655396, "learning_rate": 0.00019210452784558478, "loss": 0.20041367411613464, "mean_token_accuracy": 0.9223820567131042, "num_tokens": 26299324.0, "step": 2132 }, { "entropy": 1.0466588735580444, "epoch": 1.1232227488151658, "grad_norm": 0.29245075583457947, "learning_rate": 0.000192095543938962, "loss": 0.20363174378871918, "mean_token_accuracy": 0.9165193289518356, "num_tokens": 26311660.0, "step": 2133 }, { "entropy": 1.0405475795269012, "epoch": 1.1237493417588205, "grad_norm": 0.2925106883049011, "learning_rate": 0.00019208655515880532, "loss": 0.1999765932559967, "mean_token_accuracy": 0.9169381856918335, "num_tokens": 26323996.0, "step": 2134 }, { "entropy": 1.04118974506855, "epoch": 1.1242759347024749, "grad_norm": 0.26943859457969666, "learning_rate": 0.0001920775615056483, "loss": 0.19177857041358948, "mean_token_accuracy": 0.9220841228961945, "num_tokens": 26336332.0, "step": 2135 }, { "entropy": 1.0740750879049301, "epoch": 1.1248025276461295, "grad_norm": 0.2784332036972046, "learning_rate": 0.0001920685629800248, "loss": 0.18828029930591583, "mean_token_accuracy": 0.9239522963762283, "num_tokens": 26348668.0, "step": 2136 }, { "entropy": 1.032617449760437, "epoch": 1.1253291205897842, "grad_norm": 0.28828391432762146, "learning_rate": 0.00019205955958246905, "loss": 0.20189997553825378, "mean_token_accuracy": 0.9197202920913696, "num_tokens": 26361004.0, "step": 2137 }, { "entropy": 1.1041496396064758, "epoch": 1.1258557135334386, "grad_norm": 0.3010398745536804, "learning_rate": 0.00019205055131351557, "loss": 0.20388422906398773, "mean_token_accuracy": 0.9182727336883545, "num_tokens": 26373340.0, "step": 2138 }, { "entropy": 1.0780200958251953, "epoch": 1.1263823064770933, "grad_norm": 0.30870407819747925, "learning_rate": 0.00019204153817369905, "loss": 0.21839921176433563, "mean_token_accuracy": 0.9158252775669098, "num_tokens": 26385676.0, "step": 2139 }, { "entropy": 1.090522974729538, "epoch": 1.1269088994207477, "grad_norm": 0.3072364330291748, "learning_rate": 0.00019203252016355458, "loss": 0.1994020640850067, "mean_token_accuracy": 0.9187403917312622, "num_tokens": 26398012.0, "step": 2140 }, { "entropy": 1.1098020374774933, "epoch": 1.1274354923644023, "grad_norm": 0.2888351082801819, "learning_rate": 0.00019202349728361754, "loss": 0.2039174735546112, "mean_token_accuracy": 0.9148209691047668, "num_tokens": 26410348.0, "step": 2141 }, { "entropy": 1.1232051849365234, "epoch": 1.1279620853080567, "grad_norm": 0.2976013123989105, "learning_rate": 0.0001920144695344235, "loss": 0.2292768359184265, "mean_token_accuracy": 0.9084900766611099, "num_tokens": 26422684.0, "step": 2142 }, { "entropy": 1.1429337561130524, "epoch": 1.1284886782517114, "grad_norm": 0.2777968645095825, "learning_rate": 0.00019200543691650845, "loss": 0.19244031608104706, "mean_token_accuracy": 0.9237828403711319, "num_tokens": 26435020.0, "step": 2143 }, { "entropy": 1.096487671136856, "epoch": 1.129015271195366, "grad_norm": 0.25569429993629456, "learning_rate": 0.00019199639943040856, "loss": 0.1880742460489273, "mean_token_accuracy": 0.924060508608818, "num_tokens": 26447356.0, "step": 2144 }, { "entropy": 1.1004936397075653, "epoch": 1.1295418641390205, "grad_norm": 0.25819581747055054, "learning_rate": 0.00019198735707666036, "loss": 0.18885719776153564, "mean_token_accuracy": 0.9271882772445679, "num_tokens": 26459692.0, "step": 2145 }, { "entropy": 1.1160069704055786, "epoch": 1.1300684570826751, "grad_norm": 0.28844067454338074, "learning_rate": 0.00019197830985580064, "loss": 0.2207649052143097, "mean_token_accuracy": 0.9111542254686356, "num_tokens": 26472028.0, "step": 2146 }, { "entropy": 1.1166575253009796, "epoch": 1.1305950500263298, "grad_norm": 0.26548051834106445, "learning_rate": 0.00019196925776836644, "loss": 0.20018815994262695, "mean_token_accuracy": 0.9172813147306442, "num_tokens": 26484364.0, "step": 2147 }, { "entropy": 1.1224709153175354, "epoch": 1.1311216429699842, "grad_norm": 0.26083195209503174, "learning_rate": 0.00019196020081489517, "loss": 0.19701796770095825, "mean_token_accuracy": 0.9212660789489746, "num_tokens": 26496700.0, "step": 2148 }, { "entropy": 1.1387836039066315, "epoch": 1.1316482359136388, "grad_norm": 0.2727262079715729, "learning_rate": 0.00019195113899592446, "loss": 0.18492068350315094, "mean_token_accuracy": 0.9268793612718582, "num_tokens": 26509036.0, "step": 2149 }, { "entropy": 1.1890142858028412, "epoch": 1.1321748288572933, "grad_norm": 0.28917086124420166, "learning_rate": 0.0001919420723119923, "loss": 0.21750162541866302, "mean_token_accuracy": 0.9132700264453888, "num_tokens": 26521372.0, "step": 2150 }, { "entropy": 1.1991948783397675, "epoch": 1.132701421800948, "grad_norm": 0.3479141294956207, "learning_rate": 0.00019193300076363688, "loss": 0.21669164299964905, "mean_token_accuracy": 0.9105279594659805, "num_tokens": 26533708.0, "step": 2151 }, { "entropy": 1.166500449180603, "epoch": 1.1332280147446023, "grad_norm": 0.27059152722358704, "learning_rate": 0.00019192392435139676, "loss": 0.1777915358543396, "mean_token_accuracy": 0.9269713759422302, "num_tokens": 26546044.0, "step": 2152 }, { "entropy": 1.1897345781326294, "epoch": 1.133754607688257, "grad_norm": 0.27053096890449524, "learning_rate": 0.00019191484307581075, "loss": 0.1803973764181137, "mean_token_accuracy": 0.9253678023815155, "num_tokens": 26558380.0, "step": 2153 }, { "entropy": 1.1454325318336487, "epoch": 1.1342812006319116, "grad_norm": 0.3126206696033478, "learning_rate": 0.00019190575693741794, "loss": 0.20110175013542175, "mean_token_accuracy": 0.9191780984401703, "num_tokens": 26570716.0, "step": 2154 }, { "entropy": 1.1290227174758911, "epoch": 1.134807793575566, "grad_norm": 0.2912094295024872, "learning_rate": 0.0001918966659367577, "loss": 0.19985133409500122, "mean_token_accuracy": 0.9185344576835632, "num_tokens": 26583052.0, "step": 2155 }, { "entropy": 1.1607117354869843, "epoch": 1.1353343865192207, "grad_norm": 0.3160911202430725, "learning_rate": 0.00019188757007436978, "loss": 0.21099629998207092, "mean_token_accuracy": 0.914495974779129, "num_tokens": 26595388.0, "step": 2156 }, { "entropy": 1.1428423523902893, "epoch": 1.1358609794628751, "grad_norm": 0.30592912435531616, "learning_rate": 0.00019187846935079405, "loss": 0.20286978781223297, "mean_token_accuracy": 0.919879361987114, "num_tokens": 26607724.0, "step": 2157 }, { "entropy": 1.1966476142406464, "epoch": 1.1363875724065298, "grad_norm": 0.305442750453949, "learning_rate": 0.00019186936376657085, "loss": 0.19738367199897766, "mean_token_accuracy": 0.9184410721063614, "num_tokens": 26620060.0, "step": 2158 }, { "entropy": 1.1541268825531006, "epoch": 1.1369141653501842, "grad_norm": 0.32751592993736267, "learning_rate": 0.00019186025332224068, "loss": 0.22538770735263824, "mean_token_accuracy": 0.9071175456047058, "num_tokens": 26632396.0, "step": 2159 }, { "entropy": 1.1819856464862823, "epoch": 1.1374407582938388, "grad_norm": 0.3354586958885193, "learning_rate": 0.00019185113801834438, "loss": 0.2322450429201126, "mean_token_accuracy": 0.9149561524391174, "num_tokens": 26644732.0, "step": 2160 }, { "entropy": 1.2278803288936615, "epoch": 1.1379673512374935, "grad_norm": 0.39081871509552, "learning_rate": 0.0001918420178554231, "loss": 0.2215672731399536, "mean_token_accuracy": 0.9058908820152283, "num_tokens": 26657068.0, "step": 2161 }, { "entropy": 1.1993200778961182, "epoch": 1.138493944181148, "grad_norm": 0.30215588212013245, "learning_rate": 0.00019183289283401821, "loss": 0.21090206503868103, "mean_token_accuracy": 0.9153352379798889, "num_tokens": 26669404.0, "step": 2162 }, { "entropy": 1.2832166850566864, "epoch": 1.1390205371248026, "grad_norm": 0.28006455302238464, "learning_rate": 0.00019182376295467143, "loss": 0.19265320897102356, "mean_token_accuracy": 0.9220689386129379, "num_tokens": 26681740.0, "step": 2163 }, { "entropy": 1.2227767407894135, "epoch": 1.1395471300684572, "grad_norm": 0.2612974941730499, "learning_rate": 0.0001918146282179248, "loss": 0.19369927048683167, "mean_token_accuracy": 0.9246975183486938, "num_tokens": 26694076.0, "step": 2164 }, { "entropy": 1.2275767028331757, "epoch": 1.1400737230121116, "grad_norm": 0.2888461649417877, "learning_rate": 0.00019180548862432047, "loss": 0.22057251632213593, "mean_token_accuracy": 0.9090530127286911, "num_tokens": 26706412.0, "step": 2165 }, { "entropy": 1.3238163888454437, "epoch": 1.1406003159557663, "grad_norm": 0.2778269350528717, "learning_rate": 0.0001917963441744011, "loss": 0.21366479992866516, "mean_token_accuracy": 0.9129827171564102, "num_tokens": 26718748.0, "step": 2166 }, { "entropy": 1.2234577536582947, "epoch": 1.1411269088994207, "grad_norm": 0.2672150135040283, "learning_rate": 0.0001917871948687096, "loss": 0.20926086604595184, "mean_token_accuracy": 0.9146319776773453, "num_tokens": 26731084.0, "step": 2167 }, { "entropy": 1.285551905632019, "epoch": 1.1416535018430753, "grad_norm": 0.2621254026889801, "learning_rate": 0.00019177804070778893, "loss": 0.19555458426475525, "mean_token_accuracy": 0.9218839704990387, "num_tokens": 26743420.0, "step": 2168 }, { "entropy": 1.2906259596347809, "epoch": 1.1421800947867298, "grad_norm": 0.2878972291946411, "learning_rate": 0.00019176888169218265, "loss": 0.20401382446289062, "mean_token_accuracy": 0.9181995242834091, "num_tokens": 26755756.0, "step": 2169 }, { "entropy": 1.2635590136051178, "epoch": 1.1427066877303844, "grad_norm": 0.27613574266433716, "learning_rate": 0.0001917597178224345, "loss": 0.1996793895959854, "mean_token_accuracy": 0.9244147539138794, "num_tokens": 26768092.0, "step": 2170 }, { "entropy": 1.2653245031833649, "epoch": 1.143233280674039, "grad_norm": 0.26447412371635437, "learning_rate": 0.00019175054909908838, "loss": 0.19309335947036743, "mean_token_accuracy": 0.9219875186681747, "num_tokens": 26780428.0, "step": 2171 }, { "entropy": 1.2837787866592407, "epoch": 1.1437598736176935, "grad_norm": 0.27839452028274536, "learning_rate": 0.00019174137552268865, "loss": 0.19706347584724426, "mean_token_accuracy": 0.9179331064224243, "num_tokens": 26792764.0, "step": 2172 }, { "entropy": 1.284653127193451, "epoch": 1.1442864665613481, "grad_norm": 0.31177014112472534, "learning_rate": 0.0001917321970937799, "loss": 0.20646242797374725, "mean_token_accuracy": 0.9135401993989944, "num_tokens": 26805100.0, "step": 2173 }, { "entropy": 1.2473564743995667, "epoch": 1.1448130595050026, "grad_norm": 0.29228970408439636, "learning_rate": 0.00019172301381290696, "loss": 0.19468794763088226, "mean_token_accuracy": 0.9253511428833008, "num_tokens": 26817436.0, "step": 2174 }, { "entropy": 1.2133914828300476, "epoch": 1.1453396524486572, "grad_norm": 0.27723586559295654, "learning_rate": 0.000191713825680615, "loss": 0.19811224937438965, "mean_token_accuracy": 0.9239038378000259, "num_tokens": 26829772.0, "step": 2175 }, { "entropy": 1.2187740504741669, "epoch": 1.1458662453923116, "grad_norm": 0.32399874925613403, "learning_rate": 0.0001917046326974495, "loss": 0.21336714923381805, "mean_token_accuracy": 0.9163462072610855, "num_tokens": 26842108.0, "step": 2176 }, { "entropy": 1.1896620392799377, "epoch": 1.1463928383359663, "grad_norm": 0.2760239541530609, "learning_rate": 0.00019169543486395612, "loss": 0.19351127743721008, "mean_token_accuracy": 0.920502170920372, "num_tokens": 26854444.0, "step": 2177 }, { "entropy": 1.3020657300949097, "epoch": 1.146919431279621, "grad_norm": 0.33600714802742004, "learning_rate": 0.00019168623218068098, "loss": 0.19245027005672455, "mean_token_accuracy": 0.9246270656585693, "num_tokens": 26866780.0, "step": 2178 }, { "entropy": 1.2935131192207336, "epoch": 1.1474460242232754, "grad_norm": 0.28109049797058105, "learning_rate": 0.00019167702464817032, "loss": 0.18623016774654388, "mean_token_accuracy": 0.9251067191362381, "num_tokens": 26879116.0, "step": 2179 }, { "entropy": 1.2790460288524628, "epoch": 1.14797261716693, "grad_norm": 0.3010100722312927, "learning_rate": 0.00019166781226697077, "loss": 0.20548678934574127, "mean_token_accuracy": 0.9172774851322174, "num_tokens": 26891452.0, "step": 2180 }, { "entropy": 1.3008805811405182, "epoch": 1.1484992101105844, "grad_norm": 0.32880863547325134, "learning_rate": 0.00019165859503762918, "loss": 0.19846193492412567, "mean_token_accuracy": 0.9145328849554062, "num_tokens": 26903788.0, "step": 2181 }, { "entropy": 1.2794018983840942, "epoch": 1.149025803054239, "grad_norm": 0.3064977526664734, "learning_rate": 0.00019164937296069275, "loss": 0.20974700152873993, "mean_token_accuracy": 0.9109003394842148, "num_tokens": 26916124.0, "step": 2182 }, { "entropy": 1.2440880835056305, "epoch": 1.1495523959978937, "grad_norm": 0.27806052565574646, "learning_rate": 0.00019164014603670896, "loss": 0.19501592218875885, "mean_token_accuracy": 0.9204808473587036, "num_tokens": 26928460.0, "step": 2183 }, { "entropy": 1.3518921732902527, "epoch": 1.1500789889415481, "grad_norm": 0.321502149105072, "learning_rate": 0.0001916309142662255, "loss": 0.22053658962249756, "mean_token_accuracy": 0.9092803299427032, "num_tokens": 26940796.0, "step": 2184 }, { "entropy": 1.2679640352725983, "epoch": 1.1506055818852028, "grad_norm": 0.2918587625026703, "learning_rate": 0.00019162167764979048, "loss": 0.21362480521202087, "mean_token_accuracy": 0.9154315143823624, "num_tokens": 26953132.0, "step": 2185 }, { "entropy": 1.3025008738040924, "epoch": 1.1511321748288572, "grad_norm": 0.38866928219795227, "learning_rate": 0.00019161243618795213, "loss": 0.27079999446868896, "mean_token_accuracy": 0.896030992269516, "num_tokens": 26965468.0, "step": 2186 }, { "entropy": 1.2515160739421844, "epoch": 1.1516587677725119, "grad_norm": 0.2795846462249756, "learning_rate": 0.00019160318988125917, "loss": 0.20014791190624237, "mean_token_accuracy": 0.9226631373167038, "num_tokens": 26977804.0, "step": 2187 }, { "entropy": 1.2235470414161682, "epoch": 1.1521853607161665, "grad_norm": 0.27590784430503845, "learning_rate": 0.0001915939387302604, "loss": 0.1861528754234314, "mean_token_accuracy": 0.9201293885707855, "num_tokens": 26990140.0, "step": 2188 }, { "entropy": 1.222849279642105, "epoch": 1.152711953659821, "grad_norm": 0.2712383568286896, "learning_rate": 0.00019158468273550508, "loss": 0.19584113359451294, "mean_token_accuracy": 0.9204514920711517, "num_tokens": 27002476.0, "step": 2189 }, { "entropy": 1.2125034630298615, "epoch": 1.1532385466034756, "grad_norm": 0.2759631872177124, "learning_rate": 0.00019157542189754268, "loss": 0.19963940978050232, "mean_token_accuracy": 0.9220093786716461, "num_tokens": 27014812.0, "step": 2190 }, { "entropy": 1.1839116215705872, "epoch": 1.15376513954713, "grad_norm": 0.25730669498443604, "learning_rate": 0.00019156615621692292, "loss": 0.18340635299682617, "mean_token_accuracy": 0.9252117276191711, "num_tokens": 27027148.0, "step": 2191 }, { "entropy": 1.202635020017624, "epoch": 1.1542917324907846, "grad_norm": 0.2737926244735718, "learning_rate": 0.00019155688569419586, "loss": 0.206609845161438, "mean_token_accuracy": 0.9209761023521423, "num_tokens": 27039484.0, "step": 2192 }, { "entropy": 1.168206125497818, "epoch": 1.154818325434439, "grad_norm": 0.26999542117118835, "learning_rate": 0.00019154761032991185, "loss": 0.20011095702648163, "mean_token_accuracy": 0.9189373552799225, "num_tokens": 27051820.0, "step": 2193 }, { "entropy": 1.2162071764469147, "epoch": 1.1553449183780937, "grad_norm": 0.25214529037475586, "learning_rate": 0.00019153833012462148, "loss": 0.19554975628852844, "mean_token_accuracy": 0.9181893914937973, "num_tokens": 27064156.0, "step": 2194 }, { "entropy": 1.1848547458648682, "epoch": 1.1558715113217484, "grad_norm": 0.2536722719669342, "learning_rate": 0.00019152904507887573, "loss": 0.19084079563617706, "mean_token_accuracy": 0.9256320744752884, "num_tokens": 27076492.0, "step": 2195 }, { "entropy": 1.1943599879741669, "epoch": 1.1563981042654028, "grad_norm": 0.2896130084991455, "learning_rate": 0.00019151975519322576, "loss": 0.19871902465820312, "mean_token_accuracy": 0.9247763454914093, "num_tokens": 27088828.0, "step": 2196 }, { "entropy": 1.2219892144203186, "epoch": 1.1569246972090574, "grad_norm": 0.287672221660614, "learning_rate": 0.00019151046046822305, "loss": 0.20714130997657776, "mean_token_accuracy": 0.918072521686554, "num_tokens": 27101164.0, "step": 2197 }, { "entropy": 1.2384284734725952, "epoch": 1.1574512901527119, "grad_norm": 0.2936769425868988, "learning_rate": 0.00019150116090441938, "loss": 0.21063557267189026, "mean_token_accuracy": 0.9142559766769409, "num_tokens": 27113500.0, "step": 2198 }, { "entropy": 1.2583527266979218, "epoch": 1.1579778830963665, "grad_norm": 0.30406489968299866, "learning_rate": 0.00019149185650236682, "loss": 0.2245735228061676, "mean_token_accuracy": 0.9095106869935989, "num_tokens": 27125836.0, "step": 2199 }, { "entropy": 1.2499944269657135, "epoch": 1.1585044760400212, "grad_norm": 0.30430343747138977, "learning_rate": 0.0001914825472626177, "loss": 0.21744973957538605, "mean_token_accuracy": 0.9074316918849945, "num_tokens": 27138172.0, "step": 2200 }, { "entropy": 1.1596157252788544, "epoch": 1.1590310689836756, "grad_norm": 0.29872894287109375, "learning_rate": 0.00019147323318572466, "loss": 0.20363301038742065, "mean_token_accuracy": 0.9211505800485611, "num_tokens": 27150508.0, "step": 2201 }, { "entropy": 1.2048721611499786, "epoch": 1.1595576619273302, "grad_norm": 0.28121620416641235, "learning_rate": 0.00019146391427224063, "loss": 0.20417368412017822, "mean_token_accuracy": 0.9163524359464645, "num_tokens": 27162844.0, "step": 2202 }, { "entropy": 1.2005835473537445, "epoch": 1.1600842548709847, "grad_norm": 0.2875327169895172, "learning_rate": 0.00019145459052271883, "loss": 0.1831551492214203, "mean_token_accuracy": 0.9263263195753098, "num_tokens": 27175180.0, "step": 2203 }, { "entropy": 1.1740988194942474, "epoch": 1.1606108478146393, "grad_norm": 0.30328717827796936, "learning_rate": 0.00019144526193771275, "loss": 0.2115185409784317, "mean_token_accuracy": 0.9105354696512222, "num_tokens": 27187516.0, "step": 2204 }, { "entropy": 1.1883420646190643, "epoch": 1.161137440758294, "grad_norm": 0.3002709448337555, "learning_rate": 0.00019143592851777617, "loss": 0.1997799128293991, "mean_token_accuracy": 0.9204158633947372, "num_tokens": 27199852.0, "step": 2205 }, { "entropy": 1.186734914779663, "epoch": 1.1616640337019484, "grad_norm": 0.2615937888622284, "learning_rate": 0.00019142659026346315, "loss": 0.20187148451805115, "mean_token_accuracy": 0.9159397482872009, "num_tokens": 27212188.0, "step": 2206 }, { "entropy": 1.1872017085552216, "epoch": 1.162190626645603, "grad_norm": 0.26249435544013977, "learning_rate": 0.00019141724717532802, "loss": 0.18397313356399536, "mean_token_accuracy": 0.9237561523914337, "num_tokens": 27224524.0, "step": 2207 }, { "entropy": 1.1571813225746155, "epoch": 1.1627172195892574, "grad_norm": 0.27942758798599243, "learning_rate": 0.0001914078992539255, "loss": 0.18515753746032715, "mean_token_accuracy": 0.9259720593690872, "num_tokens": 27236860.0, "step": 2208 }, { "entropy": 1.1432051360607147, "epoch": 1.163243812532912, "grad_norm": 0.2963655889034271, "learning_rate": 0.00019139854649981048, "loss": 0.21573269367218018, "mean_token_accuracy": 0.9100171327590942, "num_tokens": 27249196.0, "step": 2209 }, { "entropy": 1.188007116317749, "epoch": 1.1637704054765665, "grad_norm": 0.31860122084617615, "learning_rate": 0.00019138918891353817, "loss": 0.2418171912431717, "mean_token_accuracy": 0.9069865345954895, "num_tokens": 27261532.0, "step": 2210 }, { "entropy": 1.1004420518875122, "epoch": 1.1642969984202212, "grad_norm": 0.2776052951812744, "learning_rate": 0.00019137982649566407, "loss": 0.2053711712360382, "mean_token_accuracy": 0.9153793305158615, "num_tokens": 27273868.0, "step": 2211 }, { "entropy": 1.1410734951496124, "epoch": 1.1648235913638758, "grad_norm": 0.28460225462913513, "learning_rate": 0.00019137045924674402, "loss": 0.21728798747062683, "mean_token_accuracy": 0.9123410433530807, "num_tokens": 27286204.0, "step": 2212 }, { "entropy": 1.1587063372135162, "epoch": 1.1653501843075302, "grad_norm": 0.2642859220504761, "learning_rate": 0.0001913610871673341, "loss": 0.18721605837345123, "mean_token_accuracy": 0.9224630892276764, "num_tokens": 27298540.0, "step": 2213 }, { "entropy": 1.1271196007728577, "epoch": 1.1658767772511849, "grad_norm": 0.28819388151168823, "learning_rate": 0.00019135171025799056, "loss": 0.18717646598815918, "mean_token_accuracy": 0.9211658984422684, "num_tokens": 27310876.0, "step": 2214 }, { "entropy": 1.1337847411632538, "epoch": 1.1664033701948393, "grad_norm": 0.2941300570964813, "learning_rate": 0.0001913423285192702, "loss": 0.21211886405944824, "mean_token_accuracy": 0.9153169095516205, "num_tokens": 27323212.0, "step": 2215 }, { "entropy": 1.1438775956630707, "epoch": 1.166929963138494, "grad_norm": 0.2863110303878784, "learning_rate": 0.0001913329419517299, "loss": 0.2077072560787201, "mean_token_accuracy": 0.9118431657552719, "num_tokens": 27335548.0, "step": 2216 }, { "entropy": 1.1338017284870148, "epoch": 1.1674565560821484, "grad_norm": 0.2920835316181183, "learning_rate": 0.0001913235505559268, "loss": 0.19436489045619965, "mean_token_accuracy": 0.9221871793270111, "num_tokens": 27347884.0, "step": 2217 }, { "entropy": 1.142452985048294, "epoch": 1.167983149025803, "grad_norm": 0.26582619547843933, "learning_rate": 0.00019131415433241855, "loss": 0.19146628677845, "mean_token_accuracy": 0.9218153953552246, "num_tokens": 27360220.0, "step": 2218 }, { "entropy": 1.1075855195522308, "epoch": 1.1685097419694577, "grad_norm": 0.2855731248855591, "learning_rate": 0.0001913047532817629, "loss": 0.20022396743297577, "mean_token_accuracy": 0.919172614812851, "num_tokens": 27372556.0, "step": 2219 }, { "entropy": 1.161133885383606, "epoch": 1.169036334913112, "grad_norm": 0.2820180356502533, "learning_rate": 0.0001912953474045179, "loss": 0.2025647759437561, "mean_token_accuracy": 0.9174589961767197, "num_tokens": 27384892.0, "step": 2220 }, { "entropy": 1.145233541727066, "epoch": 1.1695629278567667, "grad_norm": 0.2780614495277405, "learning_rate": 0.00019128593670124198, "loss": 0.20629477500915527, "mean_token_accuracy": 0.9178284406661987, "num_tokens": 27397228.0, "step": 2221 }, { "entropy": 1.1302664279937744, "epoch": 1.1700895208004214, "grad_norm": 0.28989875316619873, "learning_rate": 0.00019127652117249374, "loss": 0.20143242180347443, "mean_token_accuracy": 0.9146946966648102, "num_tokens": 27409564.0, "step": 2222 }, { "entropy": 1.145494520664215, "epoch": 1.1706161137440758, "grad_norm": 0.280318945646286, "learning_rate": 0.0001912671008188322, "loss": 0.18556565046310425, "mean_token_accuracy": 0.9243800044059753, "num_tokens": 27421900.0, "step": 2223 }, { "entropy": 1.122549831867218, "epoch": 1.1711427066877305, "grad_norm": 0.28058454394340515, "learning_rate": 0.0001912576756408165, "loss": 0.19919465482234955, "mean_token_accuracy": 0.9234228730201721, "num_tokens": 27434236.0, "step": 2224 }, { "entropy": 1.1942664980888367, "epoch": 1.1716692996313849, "grad_norm": 0.3011435866355896, "learning_rate": 0.00019124824563900622, "loss": 0.2100905328989029, "mean_token_accuracy": 0.9161610305309296, "num_tokens": 27446572.0, "step": 2225 }, { "entropy": 1.1235324144363403, "epoch": 1.1721958925750395, "grad_norm": 0.2678482234477997, "learning_rate": 0.00019123881081396113, "loss": 0.18935970962047577, "mean_token_accuracy": 0.9210453182458878, "num_tokens": 27458908.0, "step": 2226 }, { "entropy": 1.1233053505420685, "epoch": 1.172722485518694, "grad_norm": 0.3001168966293335, "learning_rate": 0.00019122937116624133, "loss": 0.1962110847234726, "mean_token_accuracy": 0.9216617047786713, "num_tokens": 27471244.0, "step": 2227 }, { "entropy": 1.1534164547920227, "epoch": 1.1732490784623486, "grad_norm": 0.3095707893371582, "learning_rate": 0.00019121992669640726, "loss": 0.2072276473045349, "mean_token_accuracy": 0.9137547612190247, "num_tokens": 27483580.0, "step": 2228 }, { "entropy": 1.1193904280662537, "epoch": 1.1737756714060033, "grad_norm": 0.26677873730659485, "learning_rate": 0.00019121047740501947, "loss": 0.20390596985816956, "mean_token_accuracy": 0.9185405522584915, "num_tokens": 27495916.0, "step": 2229 }, { "entropy": 1.1349280178546906, "epoch": 1.1743022643496577, "grad_norm": 0.2756739854812622, "learning_rate": 0.000191201023292639, "loss": 0.2036488950252533, "mean_token_accuracy": 0.9196960180997849, "num_tokens": 27508252.0, "step": 2230 }, { "entropy": 1.1713554561138153, "epoch": 1.1748288572933123, "grad_norm": 0.30103445053100586, "learning_rate": 0.00019119156435982703, "loss": 0.20072484016418457, "mean_token_accuracy": 0.925217941403389, "num_tokens": 27520588.0, "step": 2231 }, { "entropy": 1.1370952129364014, "epoch": 1.1753554502369667, "grad_norm": 0.32296401262283325, "learning_rate": 0.00019118210060714512, "loss": 0.23248368501663208, "mean_token_accuracy": 0.9066440016031265, "num_tokens": 27532924.0, "step": 2232 }, { "entropy": 1.152237057685852, "epoch": 1.1758820431806214, "grad_norm": 0.2729482650756836, "learning_rate": 0.00019117263203515504, "loss": 0.19771021604537964, "mean_token_accuracy": 0.9137565195560455, "num_tokens": 27545260.0, "step": 2233 }, { "entropy": 1.175236165523529, "epoch": 1.1764086361242758, "grad_norm": 0.27823638916015625, "learning_rate": 0.00019116315864441897, "loss": 0.20588554441928864, "mean_token_accuracy": 0.9182644933462143, "num_tokens": 27557596.0, "step": 2234 }, { "entropy": 1.19709312915802, "epoch": 1.1769352290679305, "grad_norm": 0.2955763041973114, "learning_rate": 0.00019115368043549916, "loss": 0.1897638589143753, "mean_token_accuracy": 0.9216989874839783, "num_tokens": 27569932.0, "step": 2235 }, { "entropy": 1.2332687377929688, "epoch": 1.1774618220115851, "grad_norm": 0.3177914023399353, "learning_rate": 0.00019114419740895837, "loss": 0.23029568791389465, "mean_token_accuracy": 0.906041145324707, "num_tokens": 27582268.0, "step": 2236 }, { "entropy": 1.1908305287361145, "epoch": 1.1779884149552395, "grad_norm": 0.2913646996021271, "learning_rate": 0.00019113470956535952, "loss": 0.20150071382522583, "mean_token_accuracy": 0.9204053580760956, "num_tokens": 27594604.0, "step": 2237 }, { "entropy": 1.2038147449493408, "epoch": 1.1785150078988942, "grad_norm": 0.28544673323631287, "learning_rate": 0.00019112521690526583, "loss": 0.18555422127246857, "mean_token_accuracy": 0.924328088760376, "num_tokens": 27606940.0, "step": 2238 }, { "entropy": 1.2000732123851776, "epoch": 1.1790416008425488, "grad_norm": 0.2675821781158447, "learning_rate": 0.00019111571942924085, "loss": 0.19991934299468994, "mean_token_accuracy": 0.9188268631696701, "num_tokens": 27619276.0, "step": 2239 }, { "entropy": 1.206215888261795, "epoch": 1.1795681937862033, "grad_norm": 0.2979394495487213, "learning_rate": 0.00019110621713784842, "loss": 0.19255416095256805, "mean_token_accuracy": 0.9227475672960281, "num_tokens": 27631612.0, "step": 2240 }, { "entropy": 1.1973096132278442, "epoch": 1.180094786729858, "grad_norm": 0.27704933285713196, "learning_rate": 0.0001910967100316526, "loss": 0.18796265125274658, "mean_token_accuracy": 0.9225670397281647, "num_tokens": 27643948.0, "step": 2241 }, { "entropy": 1.2093007564544678, "epoch": 1.1806213796735123, "grad_norm": 0.29337137937545776, "learning_rate": 0.00019108719811121772, "loss": 0.193947434425354, "mean_token_accuracy": 0.9231081902980804, "num_tokens": 27656284.0, "step": 2242 }, { "entropy": 1.2430245876312256, "epoch": 1.181147972617167, "grad_norm": 0.3377665579319, "learning_rate": 0.00019107768137710852, "loss": 0.21937604248523712, "mean_token_accuracy": 0.9147068560123444, "num_tokens": 27668620.0, "step": 2243 }, { "entropy": 1.247610479593277, "epoch": 1.1816745655608214, "grad_norm": 0.32605549693107605, "learning_rate": 0.00019106815982988996, "loss": 0.22798651456832886, "mean_token_accuracy": 0.9099006354808807, "num_tokens": 27680956.0, "step": 2244 }, { "entropy": 1.1888035833835602, "epoch": 1.182201158504476, "grad_norm": 0.30127960443496704, "learning_rate": 0.00019105863347012724, "loss": 0.21623851358890533, "mean_token_accuracy": 0.9116876125335693, "num_tokens": 27693292.0, "step": 2245 }, { "entropy": 1.1904528439044952, "epoch": 1.1827277514481307, "grad_norm": 0.26522204279899597, "learning_rate": 0.0001910491022983859, "loss": 0.19360768795013428, "mean_token_accuracy": 0.9212395548820496, "num_tokens": 27705628.0, "step": 2246 }, { "entropy": 1.190793126821518, "epoch": 1.1832543443917851, "grad_norm": 0.28089118003845215, "learning_rate": 0.00019103956631523177, "loss": 0.20212800800800323, "mean_token_accuracy": 0.918514221906662, "num_tokens": 27717964.0, "step": 2247 }, { "entropy": 1.1978855729103088, "epoch": 1.1837809373354398, "grad_norm": 0.29225775599479675, "learning_rate": 0.00019103002552123087, "loss": 0.21059700846672058, "mean_token_accuracy": 0.913848802447319, "num_tokens": 27730300.0, "step": 2248 }, { "entropy": 1.1586676836013794, "epoch": 1.1843075302790942, "grad_norm": 0.2872113287448883, "learning_rate": 0.00019102047991694966, "loss": 0.21480488777160645, "mean_token_accuracy": 0.9116514921188354, "num_tokens": 27742636.0, "step": 2249 }, { "entropy": 1.1448751091957092, "epoch": 1.1848341232227488, "grad_norm": 0.29005923867225647, "learning_rate": 0.00019101092950295478, "loss": 0.2099185287952423, "mean_token_accuracy": 0.9138695448637009, "num_tokens": 27754972.0, "step": 2250 }, { "entropy": 1.137921154499054, "epoch": 1.1853607161664033, "grad_norm": 0.27500849962234497, "learning_rate": 0.0001910013742798132, "loss": 0.1960453987121582, "mean_token_accuracy": 0.9165975153446198, "num_tokens": 27767308.0, "step": 2251 }, { "entropy": 1.0970045328140259, "epoch": 1.185887309110058, "grad_norm": 0.26834315061569214, "learning_rate": 0.0001909918142480921, "loss": 0.2065771222114563, "mean_token_accuracy": 0.9169502705335617, "num_tokens": 27779644.0, "step": 2252 }, { "entropy": 1.1106819808483124, "epoch": 1.1864139020537126, "grad_norm": 0.29660072922706604, "learning_rate": 0.0001909822494083591, "loss": 0.19244039058685303, "mean_token_accuracy": 0.9193838387727737, "num_tokens": 27791980.0, "step": 2253 }, { "entropy": 1.0947784334421158, "epoch": 1.186940494997367, "grad_norm": 0.3122023642063141, "learning_rate": 0.0001909726797611819, "loss": 0.2027546465396881, "mean_token_accuracy": 0.916048526763916, "num_tokens": 27804316.0, "step": 2254 }, { "entropy": 1.077293038368225, "epoch": 1.1874670879410216, "grad_norm": 0.29647305607795715, "learning_rate": 0.00019096310530712865, "loss": 0.19166618585586548, "mean_token_accuracy": 0.9190387576818466, "num_tokens": 27816652.0, "step": 2255 }, { "entropy": 1.0975450575351715, "epoch": 1.187993680884676, "grad_norm": 0.30608993768692017, "learning_rate": 0.00019095352604676775, "loss": 0.20418736338615417, "mean_token_accuracy": 0.9154408276081085, "num_tokens": 27828988.0, "step": 2256 }, { "entropy": 1.0858297049999237, "epoch": 1.1885202738283307, "grad_norm": 0.2871757447719574, "learning_rate": 0.00019094394198066784, "loss": 0.20662033557891846, "mean_token_accuracy": 0.9137272536754608, "num_tokens": 27841324.0, "step": 2257 }, { "entropy": 1.098552942276001, "epoch": 1.1890468667719853, "grad_norm": 0.31691616773605347, "learning_rate": 0.0001909343531093979, "loss": 0.19544214010238647, "mean_token_accuracy": 0.9170811921358109, "num_tokens": 27853660.0, "step": 2258 }, { "entropy": 1.0465008020401, "epoch": 1.1895734597156398, "grad_norm": 0.274053156375885, "learning_rate": 0.00019092475943352708, "loss": 0.18214793503284454, "mean_token_accuracy": 0.9284517616033554, "num_tokens": 27865996.0, "step": 2259 }, { "entropy": 1.0639517903327942, "epoch": 1.1901000526592944, "grad_norm": 0.3095509111881256, "learning_rate": 0.000190915160953625, "loss": 0.21801498532295227, "mean_token_accuracy": 0.9145664125680923, "num_tokens": 27878332.0, "step": 2260 }, { "entropy": 1.0542739927768707, "epoch": 1.1906266456029488, "grad_norm": 0.29980573058128357, "learning_rate": 0.0001909055576702614, "loss": 0.21734799444675446, "mean_token_accuracy": 0.9118731617927551, "num_tokens": 27890668.0, "step": 2261 }, { "entropy": 1.0719305872917175, "epoch": 1.1911532385466035, "grad_norm": 0.29808852076530457, "learning_rate": 0.00019089594958400638, "loss": 0.19167831540107727, "mean_token_accuracy": 0.9198271036148071, "num_tokens": 27903004.0, "step": 2262 }, { "entropy": 1.083087533712387, "epoch": 1.1916798314902581, "grad_norm": 0.2985793948173523, "learning_rate": 0.00019088633669543035, "loss": 0.20173481106758118, "mean_token_accuracy": 0.9191490411758423, "num_tokens": 27915340.0, "step": 2263 }, { "entropy": 1.0608322620391846, "epoch": 1.1922064244339126, "grad_norm": 0.3635084927082062, "learning_rate": 0.00019087671900510394, "loss": 0.19898994266986847, "mean_token_accuracy": 0.9207655042409897, "num_tokens": 27927676.0, "step": 2264 }, { "entropy": 1.0396868586540222, "epoch": 1.1927330173775672, "grad_norm": 0.2880086898803711, "learning_rate": 0.00019086709651359817, "loss": 0.2001173496246338, "mean_token_accuracy": 0.9208283871412277, "num_tokens": 27940012.0, "step": 2265 }, { "entropy": 1.0880854725837708, "epoch": 1.1932596103212216, "grad_norm": 0.30705323815345764, "learning_rate": 0.00019085746922148413, "loss": 0.22503894567489624, "mean_token_accuracy": 0.9097017347812653, "num_tokens": 27952348.0, "step": 2266 }, { "entropy": 1.0872746706008911, "epoch": 1.1937862032648763, "grad_norm": 0.27415189146995544, "learning_rate": 0.00019084783712933345, "loss": 0.19403532147407532, "mean_token_accuracy": 0.9209066331386566, "num_tokens": 27964684.0, "step": 2267 }, { "entropy": 1.0447344183921814, "epoch": 1.1943127962085307, "grad_norm": 0.2834930121898651, "learning_rate": 0.0001908382002377179, "loss": 0.2041846364736557, "mean_token_accuracy": 0.919536292552948, "num_tokens": 27977020.0, "step": 2268 }, { "entropy": 1.0546895861625671, "epoch": 1.1948393891521853, "grad_norm": 0.2582406997680664, "learning_rate": 0.00019082855854720955, "loss": 0.19313426315784454, "mean_token_accuracy": 0.920450747013092, "num_tokens": 27989356.0, "step": 2269 }, { "entropy": 1.1272867023944855, "epoch": 1.19536598209584, "grad_norm": 0.28488391637802124, "learning_rate": 0.0001908189120583808, "loss": 0.22456082701683044, "mean_token_accuracy": 0.9063926041126251, "num_tokens": 28001692.0, "step": 2270 }, { "entropy": 1.071615993976593, "epoch": 1.1958925750394944, "grad_norm": 0.262404203414917, "learning_rate": 0.00019080926077180425, "loss": 0.18905514478683472, "mean_token_accuracy": 0.9255506098270416, "num_tokens": 28014028.0, "step": 2271 }, { "entropy": 1.0979838967323303, "epoch": 1.196419167983149, "grad_norm": 0.2802709639072418, "learning_rate": 0.00019079960468805293, "loss": 0.1837414801120758, "mean_token_accuracy": 0.9260729998350143, "num_tokens": 28026364.0, "step": 2272 }, { "entropy": 1.0705920308828354, "epoch": 1.1969457609268035, "grad_norm": 0.2867828607559204, "learning_rate": 0.00019078994380769998, "loss": 0.2067106068134308, "mean_token_accuracy": 0.9144153445959091, "num_tokens": 28038700.0, "step": 2273 }, { "entropy": 1.0631752610206604, "epoch": 1.1974723538704581, "grad_norm": 0.2956964075565338, "learning_rate": 0.000190780278131319, "loss": 0.22864574193954468, "mean_token_accuracy": 0.9114911556243896, "num_tokens": 28051036.0, "step": 2274 }, { "entropy": 1.0306233167648315, "epoch": 1.1979989468141128, "grad_norm": 0.27961382269859314, "learning_rate": 0.00019077060765948368, "loss": 0.2214936763048172, "mean_token_accuracy": 0.910724937915802, "num_tokens": 28063372.0, "step": 2275 }, { "entropy": 1.0444636046886444, "epoch": 1.1985255397577672, "grad_norm": 0.2704748511314392, "learning_rate": 0.00019076093239276813, "loss": 0.1987978219985962, "mean_token_accuracy": 0.9210948199033737, "num_tokens": 28075708.0, "step": 2276 }, { "entropy": 1.0565994679927826, "epoch": 1.1990521327014219, "grad_norm": 0.2979368269443512, "learning_rate": 0.00019075125233174674, "loss": 0.20775671303272247, "mean_token_accuracy": 0.915656104683876, "num_tokens": 28088044.0, "step": 2277 }, { "entropy": 1.0443108528852463, "epoch": 1.1995787256450763, "grad_norm": 0.28842073678970337, "learning_rate": 0.0001907415674769942, "loss": 0.2142159640789032, "mean_token_accuracy": 0.9145304262638092, "num_tokens": 28100380.0, "step": 2278 }, { "entropy": 1.0332957953214645, "epoch": 1.200105318588731, "grad_norm": 0.2912449538707733, "learning_rate": 0.00019073187782908538, "loss": 0.20978567004203796, "mean_token_accuracy": 0.9145148694515228, "num_tokens": 28112716.0, "step": 2279 }, { "entropy": 1.0637232959270477, "epoch": 1.2006319115323856, "grad_norm": 0.27986404299736023, "learning_rate": 0.0001907221833885955, "loss": 0.20642036199569702, "mean_token_accuracy": 0.9175934493541718, "num_tokens": 28125052.0, "step": 2280 }, { "entropy": 1.0875510275363922, "epoch": 1.20115850447604, "grad_norm": 0.2697252333164215, "learning_rate": 0.00019071248415610008, "loss": 0.17736025154590607, "mean_token_accuracy": 0.9242502599954605, "num_tokens": 28137388.0, "step": 2281 }, { "entropy": 1.0523739904165268, "epoch": 1.2016850974196946, "grad_norm": 0.28700074553489685, "learning_rate": 0.0001907027801321749, "loss": 0.19527116417884827, "mean_token_accuracy": 0.9207979440689087, "num_tokens": 28149724.0, "step": 2282 }, { "entropy": 1.0521668642759323, "epoch": 1.202211690363349, "grad_norm": 0.33191800117492676, "learning_rate": 0.00019069307131739608, "loss": 0.20707619190216064, "mean_token_accuracy": 0.9119413197040558, "num_tokens": 28162060.0, "step": 2283 }, { "entropy": 1.0997390151023865, "epoch": 1.2027382833070037, "grad_norm": 0.2936375141143799, "learning_rate": 0.00019068335771233987, "loss": 0.1859363317489624, "mean_token_accuracy": 0.925885409116745, "num_tokens": 28174396.0, "step": 2284 }, { "entropy": 1.0267358273267746, "epoch": 1.2032648762506581, "grad_norm": 0.31446945667266846, "learning_rate": 0.000190673639317583, "loss": 0.20978572964668274, "mean_token_accuracy": 0.9154664278030396, "num_tokens": 28186732.0, "step": 2285 }, { "entropy": 1.0447548627853394, "epoch": 1.2037914691943128, "grad_norm": 0.26753443479537964, "learning_rate": 0.0001906639161337024, "loss": 0.18991108238697052, "mean_token_accuracy": 0.9253087639808655, "num_tokens": 28199068.0, "step": 2286 }, { "entropy": 1.019596055150032, "epoch": 1.2043180621379674, "grad_norm": 0.2849011719226837, "learning_rate": 0.00019065418816127517, "loss": 0.19186937808990479, "mean_token_accuracy": 0.9237010776996613, "num_tokens": 28211404.0, "step": 2287 }, { "entropy": 1.0712246000766754, "epoch": 1.2048446550816219, "grad_norm": 0.3231803774833679, "learning_rate": 0.0001906444554008789, "loss": 0.21262578666210175, "mean_token_accuracy": 0.9131361246109009, "num_tokens": 28223740.0, "step": 2288 }, { "entropy": 1.0217514485120773, "epoch": 1.2053712480252765, "grad_norm": 0.27426403760910034, "learning_rate": 0.00019063471785309136, "loss": 0.19608943164348602, "mean_token_accuracy": 0.9183037132024765, "num_tokens": 28236076.0, "step": 2289 }, { "entropy": 1.0533497035503387, "epoch": 1.205897840968931, "grad_norm": 0.31602412462234497, "learning_rate": 0.0001906249755184906, "loss": 0.20852188766002655, "mean_token_accuracy": 0.9144260287284851, "num_tokens": 28248412.0, "step": 2290 }, { "entropy": 1.0375554859638214, "epoch": 1.2064244339125856, "grad_norm": 0.2901093065738678, "learning_rate": 0.00019061522839765495, "loss": 0.20651787519454956, "mean_token_accuracy": 0.9151993989944458, "num_tokens": 28260748.0, "step": 2291 }, { "entropy": 1.047476589679718, "epoch": 1.20695102685624, "grad_norm": 0.28905728459358215, "learning_rate": 0.00019060547649116304, "loss": 0.18046444654464722, "mean_token_accuracy": 0.924500435590744, "num_tokens": 28273084.0, "step": 2292 }, { "entropy": 1.0409999787807465, "epoch": 1.2074776197998947, "grad_norm": 0.26790550351142883, "learning_rate": 0.00019059571979959382, "loss": 0.182978093624115, "mean_token_accuracy": 0.9302794337272644, "num_tokens": 28285420.0, "step": 2293 }, { "entropy": 0.9823900163173676, "epoch": 1.2080042127435493, "grad_norm": 0.29670295119285583, "learning_rate": 0.00019058595832352647, "loss": 0.19820117950439453, "mean_token_accuracy": 0.9207546710968018, "num_tokens": 28297756.0, "step": 2294 }, { "entropy": 1.0482214242219925, "epoch": 1.2085308056872037, "grad_norm": 0.2754944860935211, "learning_rate": 0.00019057619206354042, "loss": 0.1841028481721878, "mean_token_accuracy": 0.9217727184295654, "num_tokens": 28310092.0, "step": 2295 }, { "entropy": 0.979021742939949, "epoch": 1.2090573986308584, "grad_norm": 0.2850244641304016, "learning_rate": 0.00019056642102021555, "loss": 0.19173939526081085, "mean_token_accuracy": 0.920306608080864, "num_tokens": 28322428.0, "step": 2296 }, { "entropy": 1.0073926001787186, "epoch": 1.209583991574513, "grad_norm": 0.2759486734867096, "learning_rate": 0.00019055664519413177, "loss": 0.19916388392448425, "mean_token_accuracy": 0.9175459295511246, "num_tokens": 28334764.0, "step": 2297 }, { "entropy": 0.9477061033248901, "epoch": 1.2101105845181674, "grad_norm": 0.3503093719482422, "learning_rate": 0.00019054686458586952, "loss": 0.20742762088775635, "mean_token_accuracy": 0.9118971973657608, "num_tokens": 28347100.0, "step": 2298 }, { "entropy": 1.0388128459453583, "epoch": 1.210637177461822, "grad_norm": 0.3258967697620392, "learning_rate": 0.00019053707919600938, "loss": 0.22573794424533844, "mean_token_accuracy": 0.9091981053352356, "num_tokens": 28359436.0, "step": 2299 }, { "entropy": 0.9342583864927292, "epoch": 1.2111637704054765, "grad_norm": 0.2741185426712036, "learning_rate": 0.00019052728902513224, "loss": 0.1891242414712906, "mean_token_accuracy": 0.920941025018692, "num_tokens": 28371772.0, "step": 2300 }, { "entropy": 0.9953952133655548, "epoch": 1.2116903633491312, "grad_norm": 0.29077091813087463, "learning_rate": 0.00019051749407381934, "loss": 0.2002788484096527, "mean_token_accuracy": 0.9163627922534943, "num_tokens": 28384108.0, "step": 2301 }, { "entropy": 0.9766784757375717, "epoch": 1.2122169562927856, "grad_norm": 0.301318496465683, "learning_rate": 0.00019050769434265206, "loss": 0.20140445232391357, "mean_token_accuracy": 0.9168388992547989, "num_tokens": 28396444.0, "step": 2302 }, { "entropy": 0.9402145892381668, "epoch": 1.2127435492364402, "grad_norm": 0.2892124056816101, "learning_rate": 0.00019049788983221223, "loss": 0.19553864002227783, "mean_token_accuracy": 0.9176475703716278, "num_tokens": 28408780.0, "step": 2303 }, { "entropy": 0.9864234030246735, "epoch": 1.2132701421800949, "grad_norm": 0.2760343551635742, "learning_rate": 0.00019048808054308183, "loss": 0.18409714102745056, "mean_token_accuracy": 0.9212307929992676, "num_tokens": 28421116.0, "step": 2304 }, { "entropy": 1.0085313767194748, "epoch": 1.2137967351237493, "grad_norm": 0.31804919242858887, "learning_rate": 0.00019047826647584324, "loss": 0.21396562457084656, "mean_token_accuracy": 0.9174764901399612, "num_tokens": 28433452.0, "step": 2305 }, { "entropy": 0.9060227423906326, "epoch": 1.214323328067404, "grad_norm": 0.26906898617744446, "learning_rate": 0.000190468447631079, "loss": 0.1767490655183792, "mean_token_accuracy": 0.9256879538297653, "num_tokens": 28445788.0, "step": 2306 }, { "entropy": 0.9600940495729446, "epoch": 1.2148499210110584, "grad_norm": 0.31325221061706543, "learning_rate": 0.00019045862400937207, "loss": 0.2050899714231491, "mean_token_accuracy": 0.915095791220665, "num_tokens": 28458124.0, "step": 2307 }, { "entropy": 0.9618964791297913, "epoch": 1.215376513954713, "grad_norm": 0.28453946113586426, "learning_rate": 0.00019044879561130553, "loss": 0.19918674230575562, "mean_token_accuracy": 0.9192324429750443, "num_tokens": 28470460.0, "step": 2308 }, { "entropy": 0.9584704488515854, "epoch": 1.2159031068983674, "grad_norm": 0.27916356921195984, "learning_rate": 0.00019043896243746292, "loss": 0.20780225098133087, "mean_token_accuracy": 0.9173972904682159, "num_tokens": 28482796.0, "step": 2309 }, { "entropy": 0.9718508273363113, "epoch": 1.216429699842022, "grad_norm": 0.3944566249847412, "learning_rate": 0.00019042912448842794, "loss": 0.20700976252555847, "mean_token_accuracy": 0.9170730262994766, "num_tokens": 28495132.0, "step": 2310 }, { "entropy": 0.9472010433673859, "epoch": 1.2169562927856767, "grad_norm": 0.27791833877563477, "learning_rate": 0.0001904192817647846, "loss": 0.19973602890968323, "mean_token_accuracy": 0.9199665784835815, "num_tokens": 28507468.0, "step": 2311 }, { "entropy": 0.9158832877874374, "epoch": 1.2174828857293312, "grad_norm": 0.2705928385257721, "learning_rate": 0.00019040943426711725, "loss": 0.1925109326839447, "mean_token_accuracy": 0.922896683216095, "num_tokens": 28519804.0, "step": 2312 }, { "entropy": 0.9301202595233917, "epoch": 1.2180094786729858, "grad_norm": 0.29519709944725037, "learning_rate": 0.00019039958199601044, "loss": 0.2137046456336975, "mean_token_accuracy": 0.9163611382246017, "num_tokens": 28532140.0, "step": 2313 }, { "entropy": 0.9268923699855804, "epoch": 1.2185360716166405, "grad_norm": 0.29034554958343506, "learning_rate": 0.00019038972495204906, "loss": 0.20945435762405396, "mean_token_accuracy": 0.9179003089666367, "num_tokens": 28544476.0, "step": 2314 }, { "entropy": 0.9507464468479156, "epoch": 1.2190626645602949, "grad_norm": 0.3054998517036438, "learning_rate": 0.00019037986313581823, "loss": 0.21049703657627106, "mean_token_accuracy": 0.9139607399702072, "num_tokens": 28556812.0, "step": 2315 }, { "entropy": 0.9595097601413727, "epoch": 1.2195892575039495, "grad_norm": 0.28608593344688416, "learning_rate": 0.0001903699965479034, "loss": 0.22186635434627533, "mean_token_accuracy": 0.9084164053201675, "num_tokens": 28569148.0, "step": 2316 }, { "entropy": 0.9086242020130157, "epoch": 1.220115850447604, "grad_norm": 0.2904057502746582, "learning_rate": 0.00019036012518889036, "loss": 0.1948484480381012, "mean_token_accuracy": 0.9190005958080292, "num_tokens": 28581484.0, "step": 2317 }, { "entropy": 0.9179560393095016, "epoch": 1.2206424433912586, "grad_norm": 0.2642764151096344, "learning_rate": 0.00019035024905936503, "loss": 0.18806758522987366, "mean_token_accuracy": 0.9178005754947662, "num_tokens": 28593820.0, "step": 2318 }, { "entropy": 0.9741402119398117, "epoch": 1.221169036334913, "grad_norm": 0.28891104459762573, "learning_rate": 0.00019034036815991374, "loss": 0.21470314264297485, "mean_token_accuracy": 0.9158063977956772, "num_tokens": 28606156.0, "step": 2319 }, { "entropy": 0.9723116159439087, "epoch": 1.2216956292785677, "grad_norm": 0.2928186058998108, "learning_rate": 0.00019033048249112304, "loss": 0.21727263927459717, "mean_token_accuracy": 0.9125364273786545, "num_tokens": 28618492.0, "step": 2320 }, { "entropy": 1.0076178759336472, "epoch": 1.2222222222222223, "grad_norm": 0.2738136649131775, "learning_rate": 0.00019032059205357978, "loss": 0.20682492852210999, "mean_token_accuracy": 0.9168647974729538, "num_tokens": 28630828.0, "step": 2321 }, { "entropy": 0.9914740473031998, "epoch": 1.2227488151658767, "grad_norm": 0.32728976011276245, "learning_rate": 0.00019031069684787117, "loss": 0.23216472566127777, "mean_token_accuracy": 0.9085246026515961, "num_tokens": 28643164.0, "step": 2322 }, { "entropy": 1.019994467496872, "epoch": 1.2232754081095314, "grad_norm": 0.3143840432167053, "learning_rate": 0.00019030079687458454, "loss": 0.2100144624710083, "mean_token_accuracy": 0.9146460592746735, "num_tokens": 28655500.0, "step": 2323 }, { "entropy": 1.0059214681386948, "epoch": 1.2238020010531858, "grad_norm": 0.285477876663208, "learning_rate": 0.0001902908921343076, "loss": 0.19599957764148712, "mean_token_accuracy": 0.9203824996948242, "num_tokens": 28667836.0, "step": 2324 }, { "entropy": 1.0299699008464813, "epoch": 1.2243285939968405, "grad_norm": 0.30807819962501526, "learning_rate": 0.00019028098262762844, "loss": 0.2146599292755127, "mean_token_accuracy": 0.9128930121660233, "num_tokens": 28680172.0, "step": 2325 }, { "entropy": 0.9639817774295807, "epoch": 1.2248551869404949, "grad_norm": 0.2883492112159729, "learning_rate": 0.00019027106835513519, "loss": 0.2116781324148178, "mean_token_accuracy": 0.9104322791099548, "num_tokens": 28692508.0, "step": 2326 }, { "entropy": 0.9987800866365433, "epoch": 1.2253817798841495, "grad_norm": 0.2772632837295532, "learning_rate": 0.00019026114931741648, "loss": 0.18406018614768982, "mean_token_accuracy": 0.9260071665048599, "num_tokens": 28704844.0, "step": 2327 }, { "entropy": 0.9284749180078506, "epoch": 1.2259083728278042, "grad_norm": 0.26899397373199463, "learning_rate": 0.00019025122551506117, "loss": 0.19465957581996918, "mean_token_accuracy": 0.9211094230413437, "num_tokens": 28717180.0, "step": 2328 }, { "entropy": 0.9498527348041534, "epoch": 1.2264349657714586, "grad_norm": 0.2672523260116577, "learning_rate": 0.0001902412969486583, "loss": 0.1857932209968567, "mean_token_accuracy": 0.923532709479332, "num_tokens": 28729516.0, "step": 2329 }, { "entropy": 0.9485073536634445, "epoch": 1.2269615587151133, "grad_norm": 0.6426500678062439, "learning_rate": 0.00019023136361879733, "loss": 0.20064154267311096, "mean_token_accuracy": 0.9190724045038223, "num_tokens": 28741852.0, "step": 2330 }, { "entropy": 0.9678667783737183, "epoch": 1.2274881516587677, "grad_norm": 0.28017935156822205, "learning_rate": 0.00019022142552606788, "loss": 0.19379380345344543, "mean_token_accuracy": 0.9230899214744568, "num_tokens": 28754188.0, "step": 2331 }, { "entropy": 0.9232030957937241, "epoch": 1.2280147446024223, "grad_norm": 0.2922697365283966, "learning_rate": 0.00019021148267106002, "loss": 0.21339812874794006, "mean_token_accuracy": 0.9169651716947556, "num_tokens": 28766524.0, "step": 2332 }, { "entropy": 0.9682541638612747, "epoch": 1.228541337546077, "grad_norm": 0.2776217758655548, "learning_rate": 0.00019020153505436388, "loss": 0.1879439353942871, "mean_token_accuracy": 0.9254468381404877, "num_tokens": 28778860.0, "step": 2333 }, { "entropy": 0.9788610488176346, "epoch": 1.2290679304897314, "grad_norm": 0.2904343903064728, "learning_rate": 0.00019019158267657014, "loss": 0.20155103504657745, "mean_token_accuracy": 0.915040597319603, "num_tokens": 28791196.0, "step": 2334 }, { "entropy": 0.9573673754930496, "epoch": 1.229594523433386, "grad_norm": 0.2809135913848877, "learning_rate": 0.00019018162553826947, "loss": 0.2041783183813095, "mean_token_accuracy": 0.91671222448349, "num_tokens": 28803532.0, "step": 2335 }, { "entropy": 0.9262150526046753, "epoch": 1.2301211163770405, "grad_norm": 0.2890893220901489, "learning_rate": 0.00019017166364005303, "loss": 0.1984890252351761, "mean_token_accuracy": 0.9185997843742371, "num_tokens": 28815868.0, "step": 2336 }, { "entropy": 0.9690218567848206, "epoch": 1.2306477093206951, "grad_norm": 0.30195772647857666, "learning_rate": 0.0001901616969825122, "loss": 0.19511699676513672, "mean_token_accuracy": 0.9191469699144363, "num_tokens": 28828204.0, "step": 2337 }, { "entropy": 0.9442458599805832, "epoch": 1.2311743022643498, "grad_norm": 0.3288037180900574, "learning_rate": 0.00019015172556623863, "loss": 0.23278209567070007, "mean_token_accuracy": 0.9055567979812622, "num_tokens": 28840540.0, "step": 2338 }, { "entropy": 0.9516178071498871, "epoch": 1.2317008952080042, "grad_norm": 0.3043895363807678, "learning_rate": 0.00019014174939182432, "loss": 0.20317667722702026, "mean_token_accuracy": 0.9137967079877853, "num_tokens": 28852876.0, "step": 2339 }, { "entropy": 1.0066047459840775, "epoch": 1.2322274881516588, "grad_norm": 0.28470954298973083, "learning_rate": 0.0001901317684598614, "loss": 0.17943891882896423, "mean_token_accuracy": 0.9240919649600983, "num_tokens": 28865212.0, "step": 2340 }, { "entropy": 0.9875893741846085, "epoch": 1.2327540810953133, "grad_norm": 0.279293954372406, "learning_rate": 0.00019012178277094246, "loss": 0.18953418731689453, "mean_token_accuracy": 0.9218238890171051, "num_tokens": 28877548.0, "step": 2341 }, { "entropy": 1.0479088127613068, "epoch": 1.233280674038968, "grad_norm": 0.3232957720756531, "learning_rate": 0.00019011179232566026, "loss": 0.19601483643054962, "mean_token_accuracy": 0.9135144054889679, "num_tokens": 28889884.0, "step": 2342 }, { "entropy": 1.0485905408859253, "epoch": 1.2338072669826223, "grad_norm": 0.2966122031211853, "learning_rate": 0.00019010179712460786, "loss": 0.214534193277359, "mean_token_accuracy": 0.9167278558015823, "num_tokens": 28902220.0, "step": 2343 }, { "entropy": 1.0693544447422028, "epoch": 1.234333859926277, "grad_norm": 0.2795875668525696, "learning_rate": 0.00019009179716837865, "loss": 0.1979323923587799, "mean_token_accuracy": 0.9212673157453537, "num_tokens": 28914556.0, "step": 2344 }, { "entropy": 1.1432946920394897, "epoch": 1.2348604528699316, "grad_norm": 0.32812783122062683, "learning_rate": 0.00019008179245756624, "loss": 0.20545022189617157, "mean_token_accuracy": 0.9139831513166428, "num_tokens": 28926892.0, "step": 2345 }, { "entropy": 1.156277745962143, "epoch": 1.235387045813586, "grad_norm": 0.35038238763809204, "learning_rate": 0.00019007178299276453, "loss": 0.22025498747825623, "mean_token_accuracy": 0.9107816964387894, "num_tokens": 28939228.0, "step": 2346 }, { "entropy": 1.167900800704956, "epoch": 1.2359136387572407, "grad_norm": 0.2617517411708832, "learning_rate": 0.00019006176877456782, "loss": 0.1741318702697754, "mean_token_accuracy": 0.9294529408216476, "num_tokens": 28951564.0, "step": 2347 }, { "entropy": 1.2039166390895844, "epoch": 1.2364402317008951, "grad_norm": 0.3141527473926544, "learning_rate": 0.0001900517498035705, "loss": 0.21124760806560516, "mean_token_accuracy": 0.9103933870792389, "num_tokens": 28963900.0, "step": 2348 }, { "entropy": 1.1911627054214478, "epoch": 1.2369668246445498, "grad_norm": 0.3090423047542572, "learning_rate": 0.00019004172608036736, "loss": 0.20455247163772583, "mean_token_accuracy": 0.9178474098443985, "num_tokens": 28976236.0, "step": 2349 }, { "entropy": 1.2294414341449738, "epoch": 1.2374934175882044, "grad_norm": 0.42555737495422363, "learning_rate": 0.0001900316976055535, "loss": 0.1899854689836502, "mean_token_accuracy": 0.9238343685865402, "num_tokens": 28988572.0, "step": 2350 }, { "entropy": 1.2140373587608337, "epoch": 1.2380200105318588, "grad_norm": 0.3391142189502716, "learning_rate": 0.00019002166437972418, "loss": 0.212956041097641, "mean_token_accuracy": 0.9184004813432693, "num_tokens": 29000908.0, "step": 2351 }, { "entropy": 1.245664894580841, "epoch": 1.2385466034755135, "grad_norm": 0.2943424880504608, "learning_rate": 0.00019001162640347506, "loss": 0.19764168560504913, "mean_token_accuracy": 0.9214494824409485, "num_tokens": 29013244.0, "step": 2352 }, { "entropy": 1.2262179851531982, "epoch": 1.239073196419168, "grad_norm": 0.29305392503738403, "learning_rate": 0.000190001583677402, "loss": 0.21708795428276062, "mean_token_accuracy": 0.9119549542665482, "num_tokens": 29025580.0, "step": 2353 }, { "entropy": 1.2130177021026611, "epoch": 1.2395997893628226, "grad_norm": 0.2500525414943695, "learning_rate": 0.00018999153620210122, "loss": 0.1909836232662201, "mean_token_accuracy": 0.9247071444988251, "num_tokens": 29037916.0, "step": 2354 }, { "entropy": 1.2663672864437103, "epoch": 1.2401263823064772, "grad_norm": 0.2888049781322479, "learning_rate": 0.00018998148397816918, "loss": 0.19668535888195038, "mean_token_accuracy": 0.9236019253730774, "num_tokens": 29050252.0, "step": 2355 }, { "entropy": 1.2552369832992554, "epoch": 1.2406529752501316, "grad_norm": 0.30252373218536377, "learning_rate": 0.00018997142700620257, "loss": 0.21202778816223145, "mean_token_accuracy": 0.9104820787906647, "num_tokens": 29062588.0, "step": 2356 }, { "entropy": 1.2437193095684052, "epoch": 1.2411795681937863, "grad_norm": 0.2685464322566986, "learning_rate": 0.0001899613652867985, "loss": 0.19783562421798706, "mean_token_accuracy": 0.9259221404790878, "num_tokens": 29074924.0, "step": 2357 }, { "entropy": 1.2458664774894714, "epoch": 1.2417061611374407, "grad_norm": 0.27750658988952637, "learning_rate": 0.00018995129882055418, "loss": 0.19608265161514282, "mean_token_accuracy": 0.9223610162734985, "num_tokens": 29087260.0, "step": 2358 }, { "entropy": 1.28984996676445, "epoch": 1.2422327540810953, "grad_norm": 0.3127368688583374, "learning_rate": 0.00018994122760806724, "loss": 0.2381632924079895, "mean_token_accuracy": 0.906804770231247, "num_tokens": 29099596.0, "step": 2359 }, { "entropy": 1.2786964178085327, "epoch": 1.2427593470247498, "grad_norm": 0.29435664415359497, "learning_rate": 0.00018993115164993556, "loss": 0.2056436836719513, "mean_token_accuracy": 0.9188906252384186, "num_tokens": 29111932.0, "step": 2360 }, { "entropy": 1.296678066253662, "epoch": 1.2432859399684044, "grad_norm": 0.2973683476448059, "learning_rate": 0.00018992107094675727, "loss": 0.21866685152053833, "mean_token_accuracy": 0.9110830724239349, "num_tokens": 29124268.0, "step": 2361 }, { "entropy": 1.2541703283786774, "epoch": 1.243812532912059, "grad_norm": 0.2897864580154419, "learning_rate": 0.00018991098549913084, "loss": 0.18205136060714722, "mean_token_accuracy": 0.9259398877620697, "num_tokens": 29136604.0, "step": 2362 }, { "entropy": 1.2319467067718506, "epoch": 1.2443391258557135, "grad_norm": 0.2912856638431549, "learning_rate": 0.00018990089530765493, "loss": 0.21475206315517426, "mean_token_accuracy": 0.9117068946361542, "num_tokens": 29148940.0, "step": 2363 }, { "entropy": 1.1983669102191925, "epoch": 1.2448657187993681, "grad_norm": 0.30084285140037537, "learning_rate": 0.00018989080037292856, "loss": 0.20513667166233063, "mean_token_accuracy": 0.9175577163696289, "num_tokens": 29161276.0, "step": 2364 }, { "entropy": 1.208276093006134, "epoch": 1.2453923117430226, "grad_norm": 0.28459402918815613, "learning_rate": 0.00018988070069555105, "loss": 0.20270894467830658, "mean_token_accuracy": 0.9216506034135818, "num_tokens": 29173612.0, "step": 2365 }, { "entropy": 1.1837323307991028, "epoch": 1.2459189046866772, "grad_norm": 0.27861863374710083, "learning_rate": 0.0001898705962761219, "loss": 0.19915355741977692, "mean_token_accuracy": 0.9196107387542725, "num_tokens": 29185948.0, "step": 2366 }, { "entropy": 1.1845957934856415, "epoch": 1.2464454976303316, "grad_norm": 0.28316664695739746, "learning_rate": 0.00018986048711524097, "loss": 0.21355314552783966, "mean_token_accuracy": 0.9129188060760498, "num_tokens": 29198284.0, "step": 2367 }, { "entropy": 1.1677678227424622, "epoch": 1.2469720905739863, "grad_norm": 0.3210926651954651, "learning_rate": 0.00018985037321350836, "loss": 0.20634154975414276, "mean_token_accuracy": 0.9156036972999573, "num_tokens": 29210620.0, "step": 2368 }, { "entropy": 1.2081373929977417, "epoch": 1.247498683517641, "grad_norm": 0.32751724123954773, "learning_rate": 0.00018984025457152452, "loss": 0.22158020734786987, "mean_token_accuracy": 0.9142793416976929, "num_tokens": 29222956.0, "step": 2369 }, { "entropy": 1.198670506477356, "epoch": 1.2480252764612954, "grad_norm": 0.3396313488483429, "learning_rate": 0.0001898301311898901, "loss": 0.22338370978832245, "mean_token_accuracy": 0.9130024313926697, "num_tokens": 29235292.0, "step": 2370 }, { "entropy": 1.187466412782669, "epoch": 1.24855186940495, "grad_norm": 0.330683171749115, "learning_rate": 0.00018982000306920607, "loss": 0.2252286970615387, "mean_token_accuracy": 0.9099649637937546, "num_tokens": 29247628.0, "step": 2371 }, { "entropy": 1.1201028525829315, "epoch": 1.2490784623486046, "grad_norm": 0.2788279950618744, "learning_rate": 0.00018980987021007372, "loss": 0.197609081864357, "mean_token_accuracy": 0.919813871383667, "num_tokens": 29259964.0, "step": 2372 }, { "entropy": 1.1749643087387085, "epoch": 1.249605055292259, "grad_norm": 0.27696964144706726, "learning_rate": 0.00018979973261309453, "loss": 0.19340327382087708, "mean_token_accuracy": 0.9178819060325623, "num_tokens": 29272300.0, "step": 2373 }, { "entropy": 1.171377807855606, "epoch": 1.2501316482359137, "grad_norm": 0.26827797293663025, "learning_rate": 0.0001897895902788703, "loss": 0.20257636904716492, "mean_token_accuracy": 0.9170994907617569, "num_tokens": 29284636.0, "step": 2374 }, { "entropy": 1.1583305597305298, "epoch": 1.2506582411795681, "grad_norm": 0.26647472381591797, "learning_rate": 0.00018977944320800315, "loss": 0.19090743362903595, "mean_token_accuracy": 0.9245351999998093, "num_tokens": 29296972.0, "step": 2375 }, { "entropy": 1.2192396521568298, "epoch": 1.2511848341232228, "grad_norm": 0.29227685928344727, "learning_rate": 0.00018976929140109542, "loss": 0.21741797029972076, "mean_token_accuracy": 0.911442294716835, "num_tokens": 29309308.0, "step": 2376 }, { "entropy": 1.120053082704544, "epoch": 1.2517114270668772, "grad_norm": 0.27130043506622314, "learning_rate": 0.00018975913485874983, "loss": 0.2002987265586853, "mean_token_accuracy": 0.9195822030305862, "num_tokens": 29321644.0, "step": 2377 }, { "entropy": 1.1931759715080261, "epoch": 1.2522380200105319, "grad_norm": 0.28110983967781067, "learning_rate": 0.00018974897358156926, "loss": 0.18119770288467407, "mean_token_accuracy": 0.921199381351471, "num_tokens": 29333980.0, "step": 2378 }, { "entropy": 1.1507650911808014, "epoch": 1.2527646129541865, "grad_norm": 0.3061140775680542, "learning_rate": 0.00018973880757015696, "loss": 0.20350392162799835, "mean_token_accuracy": 0.918747752904892, "num_tokens": 29346316.0, "step": 2379 }, { "entropy": 1.1738670468330383, "epoch": 1.253291205897841, "grad_norm": 0.27520132064819336, "learning_rate": 0.00018972863682511639, "loss": 0.19713857769966125, "mean_token_accuracy": 0.9176778495311737, "num_tokens": 29358652.0, "step": 2380 }, { "entropy": 1.1170638799667358, "epoch": 1.2538177988414956, "grad_norm": 0.28535959124565125, "learning_rate": 0.00018971846134705137, "loss": 0.21452412009239197, "mean_token_accuracy": 0.9095005989074707, "num_tokens": 29370988.0, "step": 2381 }, { "entropy": 1.1119027435779572, "epoch": 1.25434439178515, "grad_norm": 0.2742728888988495, "learning_rate": 0.00018970828113656593, "loss": 0.1901988387107849, "mean_token_accuracy": 0.921889141201973, "num_tokens": 29383324.0, "step": 2382 }, { "entropy": 1.0820831060409546, "epoch": 1.2548709847288047, "grad_norm": 0.28090232610702515, "learning_rate": 0.00018969809619426439, "loss": 0.19445692002773285, "mean_token_accuracy": 0.9170260429382324, "num_tokens": 29395660.0, "step": 2383 }, { "entropy": 1.055662214756012, "epoch": 1.255397577672459, "grad_norm": 0.27719929814338684, "learning_rate": 0.00018968790652075136, "loss": 0.1977691501379013, "mean_token_accuracy": 0.919326663017273, "num_tokens": 29407996.0, "step": 2384 }, { "entropy": 1.1013965904712677, "epoch": 1.2559241706161137, "grad_norm": 0.31086885929107666, "learning_rate": 0.00018967771211663182, "loss": 0.2363457977771759, "mean_token_accuracy": 0.906139463186264, "num_tokens": 29420332.0, "step": 2385 }, { "entropy": 1.090101808309555, "epoch": 1.2564507635597684, "grad_norm": 0.2687731087207794, "learning_rate": 0.00018966751298251093, "loss": 0.18311643600463867, "mean_token_accuracy": 0.9264214485883713, "num_tokens": 29432668.0, "step": 2386 }, { "entropy": 1.1113143563270569, "epoch": 1.2569773565034228, "grad_norm": 0.3031775951385498, "learning_rate": 0.0001896573091189941, "loss": 0.20669670403003693, "mean_token_accuracy": 0.9185007810592651, "num_tokens": 29445004.0, "step": 2387 }, { "entropy": 1.0604256093502045, "epoch": 1.2575039494470774, "grad_norm": 0.28647610545158386, "learning_rate": 0.00018964710052668714, "loss": 0.20895907282829285, "mean_token_accuracy": 0.9176440387964249, "num_tokens": 29457340.0, "step": 2388 }, { "entropy": 1.094488948583603, "epoch": 1.258030542390732, "grad_norm": 0.28277674317359924, "learning_rate": 0.000189636887206196, "loss": 0.1958828866481781, "mean_token_accuracy": 0.9168824553489685, "num_tokens": 29469676.0, "step": 2389 }, { "entropy": 1.0930402874946594, "epoch": 1.2585571353343865, "grad_norm": 0.3038513660430908, "learning_rate": 0.00018962666915812702, "loss": 0.22608797252178192, "mean_token_accuracy": 0.9073146730661392, "num_tokens": 29482012.0, "step": 2390 }, { "entropy": 1.090045154094696, "epoch": 1.259083728278041, "grad_norm": 0.27166202664375305, "learning_rate": 0.00018961644638308683, "loss": 0.1975858360528946, "mean_token_accuracy": 0.9241401851177216, "num_tokens": 29494348.0, "step": 2391 }, { "entropy": 1.0796633809804916, "epoch": 1.2596103212216956, "grad_norm": 0.2842889130115509, "learning_rate": 0.00018960621888168224, "loss": 0.19585753977298737, "mean_token_accuracy": 0.9207384586334229, "num_tokens": 29506684.0, "step": 2392 }, { "entropy": 1.1113807559013367, "epoch": 1.2601369141653502, "grad_norm": 0.27799156308174133, "learning_rate": 0.00018959598665452043, "loss": 0.20170974731445312, "mean_token_accuracy": 0.9220674335956573, "num_tokens": 29519020.0, "step": 2393 }, { "entropy": 1.1154912114143372, "epoch": 1.2606635071090047, "grad_norm": 0.2918773889541626, "learning_rate": 0.0001895857497022088, "loss": 0.2008930742740631, "mean_token_accuracy": 0.9212677925825119, "num_tokens": 29531356.0, "step": 2394 }, { "entropy": 1.0571572482585907, "epoch": 1.2611901000526593, "grad_norm": 0.28213104605674744, "learning_rate": 0.00018957550802535503, "loss": 0.21011856198310852, "mean_token_accuracy": 0.9190024733543396, "num_tokens": 29543692.0, "step": 2395 }, { "entropy": 1.0876768827438354, "epoch": 1.261716692996314, "grad_norm": 0.3166556656360626, "learning_rate": 0.00018956526162456722, "loss": 0.21292051672935486, "mean_token_accuracy": 0.9117415696382523, "num_tokens": 29556028.0, "step": 2396 }, { "entropy": 1.1123850643634796, "epoch": 1.2622432859399684, "grad_norm": 0.3177889585494995, "learning_rate": 0.00018955501050045353, "loss": 0.21554914116859436, "mean_token_accuracy": 0.9117074012756348, "num_tokens": 29568364.0, "step": 2397 }, { "entropy": 1.121145874261856, "epoch": 1.262769878883623, "grad_norm": 0.28797921538352966, "learning_rate": 0.00018954475465362256, "loss": 0.2110595405101776, "mean_token_accuracy": 0.910643994808197, "num_tokens": 29580700.0, "step": 2398 }, { "entropy": 1.081002026796341, "epoch": 1.2632964718272774, "grad_norm": 0.2767108678817749, "learning_rate": 0.00018953449408468312, "loss": 0.20874468982219696, "mean_token_accuracy": 0.916566014289856, "num_tokens": 29593036.0, "step": 2399 }, { "entropy": 1.0670734643936157, "epoch": 1.263823064770932, "grad_norm": 0.2667304277420044, "learning_rate": 0.00018952422879424437, "loss": 0.21136702597141266, "mean_token_accuracy": 0.915779709815979, "num_tokens": 29605372.0, "step": 2400 }, { "entropy": 1.1176138818264008, "epoch": 1.2643496577145865, "grad_norm": 0.28897732496261597, "learning_rate": 0.0001895139587829156, "loss": 0.20740735530853271, "mean_token_accuracy": 0.9172630310058594, "num_tokens": 29617708.0, "step": 2401 }, { "entropy": 1.0523147583007812, "epoch": 1.2648762506582412, "grad_norm": 0.28087154030799866, "learning_rate": 0.00018950368405130653, "loss": 0.20881010591983795, "mean_token_accuracy": 0.9143330603837967, "num_tokens": 29630044.0, "step": 2402 }, { "entropy": 1.073082596063614, "epoch": 1.2654028436018958, "grad_norm": 0.2673327624797821, "learning_rate": 0.00018949340460002717, "loss": 0.20516178011894226, "mean_token_accuracy": 0.9163246154785156, "num_tokens": 29642380.0, "step": 2403 }, { "entropy": 0.9944493472576141, "epoch": 1.2659294365455502, "grad_norm": 0.23029980063438416, "learning_rate": 0.00018948312042968768, "loss": 0.18642765283584595, "mean_token_accuracy": 0.9236330091953278, "num_tokens": 29654716.0, "step": 2404 }, { "entropy": 1.0669757723808289, "epoch": 1.2664560294892049, "grad_norm": 0.26822593808174133, "learning_rate": 0.0001894728315408986, "loss": 0.20285025238990784, "mean_token_accuracy": 0.9172052592039108, "num_tokens": 29667052.0, "step": 2405 }, { "entropy": 1.0667217671871185, "epoch": 1.2669826224328595, "grad_norm": 0.28592145442962646, "learning_rate": 0.00018946253793427075, "loss": 0.21876372396945953, "mean_token_accuracy": 0.9099210351705551, "num_tokens": 29679388.0, "step": 2406 }, { "entropy": 1.0617501437664032, "epoch": 1.267509215376514, "grad_norm": 0.2814294099807739, "learning_rate": 0.0001894522396104151, "loss": 0.21466723084449768, "mean_token_accuracy": 0.9166467934846878, "num_tokens": 29691724.0, "step": 2407 }, { "entropy": 1.0295425057411194, "epoch": 1.2680358083201684, "grad_norm": 0.2818832993507385, "learning_rate": 0.0001894419365699431, "loss": 0.2018805742263794, "mean_token_accuracy": 0.9214745163917542, "num_tokens": 29704060.0, "step": 2408 }, { "entropy": 0.9962182641029358, "epoch": 1.268562401263823, "grad_norm": 0.2606944441795349, "learning_rate": 0.00018943162881346633, "loss": 0.20163223147392273, "mean_token_accuracy": 0.9152373224496841, "num_tokens": 29716396.0, "step": 2409 }, { "entropy": 1.0103175342082977, "epoch": 1.2690889942074777, "grad_norm": 0.2832614779472351, "learning_rate": 0.00018942131634159672, "loss": 0.20267333090305328, "mean_token_accuracy": 0.917528048157692, "num_tokens": 29728732.0, "step": 2410 }, { "entropy": 1.030224397778511, "epoch": 1.269615587151132, "grad_norm": 0.28863924741744995, "learning_rate": 0.00018941099915494646, "loss": 0.20709314942359924, "mean_token_accuracy": 0.9195363223552704, "num_tokens": 29741068.0, "step": 2411 }, { "entropy": 0.9850256592035294, "epoch": 1.2701421800947867, "grad_norm": 0.33532777428627014, "learning_rate": 0.00018940067725412807, "loss": 0.22378413379192352, "mean_token_accuracy": 0.9103842526674271, "num_tokens": 29753404.0, "step": 2412 }, { "entropy": 0.9951465576887131, "epoch": 1.2706687730384414, "grad_norm": 0.2885618209838867, "learning_rate": 0.0001893903506397542, "loss": 0.20284360647201538, "mean_token_accuracy": 0.9174323529005051, "num_tokens": 29765740.0, "step": 2413 }, { "entropy": 0.9759911596775055, "epoch": 1.2711953659820958, "grad_norm": 0.30822882056236267, "learning_rate": 0.00018938001931243797, "loss": 0.21964068710803986, "mean_token_accuracy": 0.9072186797857285, "num_tokens": 29778076.0, "step": 2414 }, { "entropy": 0.9762609899044037, "epoch": 1.2717219589257505, "grad_norm": 0.2687565088272095, "learning_rate": 0.00018936968327279264, "loss": 0.17709898948669434, "mean_token_accuracy": 0.9282322078943253, "num_tokens": 29790412.0, "step": 2415 }, { "entropy": 0.9670789986848831, "epoch": 1.2722485518694049, "grad_norm": 0.28542351722717285, "learning_rate": 0.00018935934252143182, "loss": 0.1963491588830948, "mean_token_accuracy": 0.9188527315855026, "num_tokens": 29802748.0, "step": 2416 }, { "entropy": 0.9343395233154297, "epoch": 1.2727751448130595, "grad_norm": 0.28767991065979004, "learning_rate": 0.00018934899705896937, "loss": 0.2048400342464447, "mean_token_accuracy": 0.9184893816709518, "num_tokens": 29815084.0, "step": 2417 }, { "entropy": 0.965802863240242, "epoch": 1.273301737756714, "grad_norm": 0.2734317481517792, "learning_rate": 0.00018933864688601946, "loss": 0.19449257850646973, "mean_token_accuracy": 0.9198505729436874, "num_tokens": 29827420.0, "step": 2418 }, { "entropy": 0.9207088947296143, "epoch": 1.2738283307003686, "grad_norm": 0.28382739424705505, "learning_rate": 0.00018932829200319647, "loss": 0.21684856712818146, "mean_token_accuracy": 0.9112024903297424, "num_tokens": 29839756.0, "step": 2419 }, { "entropy": 0.9559458643198013, "epoch": 1.2743549236440233, "grad_norm": 0.26874884963035583, "learning_rate": 0.00018931793241111519, "loss": 0.200919508934021, "mean_token_accuracy": 0.9189273715019226, "num_tokens": 29852092.0, "step": 2420 }, { "entropy": 0.956595167517662, "epoch": 1.2748815165876777, "grad_norm": 0.2639332115650177, "learning_rate": 0.0001893075681103905, "loss": 0.18435338139533997, "mean_token_accuracy": 0.9255244880914688, "num_tokens": 29864428.0, "step": 2421 }, { "entropy": 0.9653457999229431, "epoch": 1.2754081095313323, "grad_norm": 0.2683272659778595, "learning_rate": 0.0001892971991016378, "loss": 0.19316944479942322, "mean_token_accuracy": 0.9227836430072784, "num_tokens": 29876764.0, "step": 2422 }, { "entropy": 0.9717456251382828, "epoch": 1.275934702474987, "grad_norm": 0.2988039553165436, "learning_rate": 0.00018928682538547252, "loss": 0.2070363163948059, "mean_token_accuracy": 0.9153457581996918, "num_tokens": 29889100.0, "step": 2423 }, { "entropy": 0.968423455953598, "epoch": 1.2764612954186414, "grad_norm": 0.2866435647010803, "learning_rate": 0.0001892764469625106, "loss": 0.22353532910346985, "mean_token_accuracy": 0.9065069407224655, "num_tokens": 29901436.0, "step": 2424 }, { "entropy": 1.0139219462871552, "epoch": 1.2769878883622958, "grad_norm": 0.3166240155696869, "learning_rate": 0.000189266063833368, "loss": 0.21094951033592224, "mean_token_accuracy": 0.9138725250959396, "num_tokens": 29913772.0, "step": 2425 }, { "entropy": 0.9436186701059341, "epoch": 1.2775144813059505, "grad_norm": 0.266792893409729, "learning_rate": 0.00018925567599866123, "loss": 0.1921631246805191, "mean_token_accuracy": 0.923053190112114, "num_tokens": 29926108.0, "step": 2426 }, { "entropy": 0.9432852864265442, "epoch": 1.2780410742496051, "grad_norm": 0.27570202946662903, "learning_rate": 0.00018924528345900689, "loss": 0.20491164922714233, "mean_token_accuracy": 0.9194526821374893, "num_tokens": 29938444.0, "step": 2427 }, { "entropy": 1.0146455764770508, "epoch": 1.2785676671932595, "grad_norm": 0.3002910614013672, "learning_rate": 0.00018923488621502198, "loss": 0.21310178935527802, "mean_token_accuracy": 0.9097048193216324, "num_tokens": 29950780.0, "step": 2428 }, { "entropy": 0.9136994779109955, "epoch": 1.2790942601369142, "grad_norm": 0.2668123245239258, "learning_rate": 0.0001892244842673237, "loss": 0.19984757900238037, "mean_token_accuracy": 0.9176211655139923, "num_tokens": 29963116.0, "step": 2429 }, { "entropy": 0.9539975225925446, "epoch": 1.2796208530805688, "grad_norm": 0.27499574422836304, "learning_rate": 0.0001892140776165295, "loss": 0.19691187143325806, "mean_token_accuracy": 0.9206452816724777, "num_tokens": 29975452.0, "step": 2430 }, { "entropy": 0.9451378732919693, "epoch": 1.2801474460242233, "grad_norm": 0.26354870200157166, "learning_rate": 0.00018920366626325722, "loss": 0.19863781332969666, "mean_token_accuracy": 0.9141591340303421, "num_tokens": 29987788.0, "step": 2431 }, { "entropy": 0.9598711580038071, "epoch": 1.280674038967878, "grad_norm": 0.27625903487205505, "learning_rate": 0.00018919325020812493, "loss": 0.18384377658367157, "mean_token_accuracy": 0.9277281761169434, "num_tokens": 30000124.0, "step": 2432 }, { "entropy": 0.9703495502471924, "epoch": 1.2812006319115323, "grad_norm": 0.23485948145389557, "learning_rate": 0.00018918282945175091, "loss": 0.16364209353923798, "mean_token_accuracy": 0.9334625601768494, "num_tokens": 30012460.0, "step": 2433 }, { "entropy": 0.9682765752077103, "epoch": 1.281727224855187, "grad_norm": 0.28086769580841064, "learning_rate": 0.00018917240399475387, "loss": 0.20836037397384644, "mean_token_accuracy": 0.9150678068399429, "num_tokens": 30024796.0, "step": 2434 }, { "entropy": 0.9923833310604095, "epoch": 1.2822538177988414, "grad_norm": 0.2846622169017792, "learning_rate": 0.00018916197383775263, "loss": 0.19592522084712982, "mean_token_accuracy": 0.9235945791006088, "num_tokens": 30037132.0, "step": 2435 }, { "entropy": 0.9900262653827667, "epoch": 1.282780410742496, "grad_norm": 0.2638978958129883, "learning_rate": 0.00018915153898136638, "loss": 0.20760269463062286, "mean_token_accuracy": 0.9165667444467545, "num_tokens": 30049468.0, "step": 2436 }, { "entropy": 0.9972607046365738, "epoch": 1.2833070036861507, "grad_norm": 0.2679845988750458, "learning_rate": 0.0001891410994262146, "loss": 0.21356555819511414, "mean_token_accuracy": 0.9128797203302383, "num_tokens": 30061804.0, "step": 2437 }, { "entropy": 1.0473797023296356, "epoch": 1.2838335966298051, "grad_norm": 0.29876357316970825, "learning_rate": 0.000189130655172917, "loss": 0.1855165660381317, "mean_token_accuracy": 0.9234071522951126, "num_tokens": 30074140.0, "step": 2438 }, { "entropy": 1.0313687026500702, "epoch": 1.2843601895734598, "grad_norm": 0.3158549666404724, "learning_rate": 0.00018912020622209363, "loss": 0.19452282786369324, "mean_token_accuracy": 0.9206828027963638, "num_tokens": 30086476.0, "step": 2439 }, { "entropy": 1.0512953251600266, "epoch": 1.2848867825171142, "grad_norm": 0.289561927318573, "learning_rate": 0.00018910975257436477, "loss": 0.21705621480941772, "mean_token_accuracy": 0.9130683243274689, "num_tokens": 30098812.0, "step": 2440 }, { "entropy": 1.0579238533973694, "epoch": 1.2854133754607688, "grad_norm": 0.27795788645744324, "learning_rate": 0.00018909929423035097, "loss": 0.1992982029914856, "mean_token_accuracy": 0.9181873351335526, "num_tokens": 30111148.0, "step": 2441 }, { "entropy": 1.053389072418213, "epoch": 1.2859399684044233, "grad_norm": 0.2999892830848694, "learning_rate": 0.00018908883119067314, "loss": 0.1986619383096695, "mean_token_accuracy": 0.9188312739133835, "num_tokens": 30123484.0, "step": 2442 }, { "entropy": 1.055832028388977, "epoch": 1.286466561348078, "grad_norm": 0.31872841715812683, "learning_rate": 0.00018907836345595234, "loss": 0.22551697492599487, "mean_token_accuracy": 0.9126669466495514, "num_tokens": 30135820.0, "step": 2443 }, { "entropy": 1.0761081874370575, "epoch": 1.2869931542917326, "grad_norm": 0.28309813141822815, "learning_rate": 0.00018906789102680996, "loss": 0.20621955394744873, "mean_token_accuracy": 0.9136619865894318, "num_tokens": 30148156.0, "step": 2444 }, { "entropy": 1.0669479370117188, "epoch": 1.287519747235387, "grad_norm": 0.2921207845211029, "learning_rate": 0.0001890574139038678, "loss": 0.19345825910568237, "mean_token_accuracy": 0.9210665971040726, "num_tokens": 30160492.0, "step": 2445 }, { "entropy": 1.082845777273178, "epoch": 1.2880463401790416, "grad_norm": 0.3050430715084076, "learning_rate": 0.00018904693208774773, "loss": 0.20412419736385345, "mean_token_accuracy": 0.9169301390647888, "num_tokens": 30172828.0, "step": 2446 }, { "entropy": 1.037044733762741, "epoch": 1.2885729331226963, "grad_norm": 0.2966107130050659, "learning_rate": 0.00018903644557907202, "loss": 0.2055833488702774, "mean_token_accuracy": 0.9147552996873856, "num_tokens": 30185164.0, "step": 2447 }, { "entropy": 1.0677853226661682, "epoch": 1.2890995260663507, "grad_norm": 0.2843310534954071, "learning_rate": 0.0001890259543784632, "loss": 0.21242734789848328, "mean_token_accuracy": 0.9103299677371979, "num_tokens": 30197500.0, "step": 2448 }, { "entropy": 1.077808290719986, "epoch": 1.2896261190100053, "grad_norm": 0.3029589056968689, "learning_rate": 0.00018901545848654406, "loss": 0.21383321285247803, "mean_token_accuracy": 0.9146206676959991, "num_tokens": 30209836.0, "step": 2449 }, { "entropy": 1.067981243133545, "epoch": 1.2901527119536598, "grad_norm": 0.26611074805259705, "learning_rate": 0.0001890049579039377, "loss": 0.2002156376838684, "mean_token_accuracy": 0.9168877750635147, "num_tokens": 30222172.0, "step": 2450 }, { "entropy": 1.0742313861846924, "epoch": 1.2906793048973144, "grad_norm": 0.310247540473938, "learning_rate": 0.00018899445263126748, "loss": 0.20398539304733276, "mean_token_accuracy": 0.914374902844429, "num_tokens": 30234508.0, "step": 2451 }, { "entropy": 1.0848418474197388, "epoch": 1.2912058978409688, "grad_norm": 0.2897074818611145, "learning_rate": 0.000188983942669157, "loss": 0.19188785552978516, "mean_token_accuracy": 0.9222336858510971, "num_tokens": 30246844.0, "step": 2452 }, { "entropy": 1.1648883521556854, "epoch": 1.2917324907846235, "grad_norm": 0.3317052125930786, "learning_rate": 0.00018897342801823017, "loss": 0.21206307411193848, "mean_token_accuracy": 0.9162902683019638, "num_tokens": 30259180.0, "step": 2453 }, { "entropy": 1.089240550994873, "epoch": 1.2922590837282781, "grad_norm": 0.29545658826828003, "learning_rate": 0.00018896290867911124, "loss": 0.224837988615036, "mean_token_accuracy": 0.9070383608341217, "num_tokens": 30271516.0, "step": 2454 }, { "entropy": 1.0672079622745514, "epoch": 1.2927856766719326, "grad_norm": 0.28104934096336365, "learning_rate": 0.00018895238465242465, "loss": 0.18683423101902008, "mean_token_accuracy": 0.9193482846021652, "num_tokens": 30283852.0, "step": 2455 }, { "entropy": 1.109650194644928, "epoch": 1.2933122696155872, "grad_norm": 0.30402952432632446, "learning_rate": 0.00018894185593879513, "loss": 0.21138614416122437, "mean_token_accuracy": 0.9192399084568024, "num_tokens": 30296188.0, "step": 2456 }, { "entropy": 1.0995548069477081, "epoch": 1.2938388625592416, "grad_norm": 0.2972696125507355, "learning_rate": 0.00018893132253884777, "loss": 0.21770839393138885, "mean_token_accuracy": 0.9064899533987045, "num_tokens": 30308524.0, "step": 2457 }, { "entropy": 1.0900613367557526, "epoch": 1.2943654555028963, "grad_norm": 0.29551947116851807, "learning_rate": 0.00018892078445320785, "loss": 0.22550401091575623, "mean_token_accuracy": 0.9079246073961258, "num_tokens": 30320860.0, "step": 2458 }, { "entropy": 1.0972884893417358, "epoch": 1.2948920484465507, "grad_norm": 0.29107943177223206, "learning_rate": 0.0001889102416825009, "loss": 0.20210495591163635, "mean_token_accuracy": 0.918797492980957, "num_tokens": 30333196.0, "step": 2459 }, { "entropy": 1.1345873475074768, "epoch": 1.2954186413902053, "grad_norm": 0.2670139968395233, "learning_rate": 0.00018889969422735282, "loss": 0.2063610702753067, "mean_token_accuracy": 0.9150100499391556, "num_tokens": 30345532.0, "step": 2460 }, { "entropy": 1.1534136831760406, "epoch": 1.29594523433386, "grad_norm": 0.2725052535533905, "learning_rate": 0.00018888914208838977, "loss": 0.20247100293636322, "mean_token_accuracy": 0.9132510721683502, "num_tokens": 30357868.0, "step": 2461 }, { "entropy": 1.1401869356632233, "epoch": 1.2964718272775144, "grad_norm": 0.27257704734802246, "learning_rate": 0.00018887858526623816, "loss": 0.20108935236930847, "mean_token_accuracy": 0.9205031096935272, "num_tokens": 30370204.0, "step": 2462 }, { "entropy": 1.1363012492656708, "epoch": 1.296998420221169, "grad_norm": 0.25703343749046326, "learning_rate": 0.00018886802376152467, "loss": 0.1905408352613449, "mean_token_accuracy": 0.9216178208589554, "num_tokens": 30382540.0, "step": 2463 }, { "entropy": 1.1291438043117523, "epoch": 1.2975250131648237, "grad_norm": 0.26567402482032776, "learning_rate": 0.00018885745757487633, "loss": 0.2002328634262085, "mean_token_accuracy": 0.9188759624958038, "num_tokens": 30394876.0, "step": 2464 }, { "entropy": 1.1460005939006805, "epoch": 1.2980516061084781, "grad_norm": 0.2740042805671692, "learning_rate": 0.0001888468867069203, "loss": 0.2134706676006317, "mean_token_accuracy": 0.9186908006668091, "num_tokens": 30407212.0, "step": 2465 }, { "entropy": 1.1675595045089722, "epoch": 1.2985781990521326, "grad_norm": 0.27058151364326477, "learning_rate": 0.0001888363111582842, "loss": 0.20257370173931122, "mean_token_accuracy": 0.9163499921560287, "num_tokens": 30419548.0, "step": 2466 }, { "entropy": 1.129315197467804, "epoch": 1.2991047919957872, "grad_norm": 0.2428874373435974, "learning_rate": 0.00018882573092959576, "loss": 0.19501042366027832, "mean_token_accuracy": 0.9155511409044266, "num_tokens": 30431884.0, "step": 2467 }, { "entropy": 1.1659575700759888, "epoch": 1.2996313849394419, "grad_norm": 0.2721167504787445, "learning_rate": 0.00018881514602148313, "loss": 0.19770276546478271, "mean_token_accuracy": 0.9158978760242462, "num_tokens": 30444220.0, "step": 2468 }, { "entropy": 1.112877070903778, "epoch": 1.3001579778830963, "grad_norm": 0.2472962588071823, "learning_rate": 0.00018880455643457465, "loss": 0.19223164021968842, "mean_token_accuracy": 0.924824669957161, "num_tokens": 30456556.0, "step": 2469 }, { "entropy": 1.1800079345703125, "epoch": 1.300684570826751, "grad_norm": 0.2697281837463379, "learning_rate": 0.00018879396216949895, "loss": 0.1964273303747177, "mean_token_accuracy": 0.9209067970514297, "num_tokens": 30468892.0, "step": 2470 }, { "entropy": 1.163857877254486, "epoch": 1.3012111637704056, "grad_norm": 0.3045770227909088, "learning_rate": 0.00018878336322688494, "loss": 0.22345393896102905, "mean_token_accuracy": 0.9061350077390671, "num_tokens": 30481228.0, "step": 2471 }, { "entropy": 1.14396533370018, "epoch": 1.30173775671406, "grad_norm": 0.28983190655708313, "learning_rate": 0.0001887727596073619, "loss": 0.22206184267997742, "mean_token_accuracy": 0.9082365930080414, "num_tokens": 30493564.0, "step": 2472 }, { "entropy": 1.1775724589824677, "epoch": 1.3022643496577146, "grad_norm": 0.2802092432975769, "learning_rate": 0.0001887621513115592, "loss": 0.18831028044223785, "mean_token_accuracy": 0.9222876578569412, "num_tokens": 30505900.0, "step": 2473 }, { "entropy": 1.1594789624214172, "epoch": 1.302790942601369, "grad_norm": 0.28708985447883606, "learning_rate": 0.00018875153834010665, "loss": 0.19792331755161285, "mean_token_accuracy": 0.9184091091156006, "num_tokens": 30518236.0, "step": 2474 }, { "entropy": 1.1835083365440369, "epoch": 1.3033175355450237, "grad_norm": 0.2943269610404968, "learning_rate": 0.00018874092069363427, "loss": 0.2158336043357849, "mean_token_accuracy": 0.9099272340536118, "num_tokens": 30530572.0, "step": 2475 }, { "entropy": 1.1280877888202667, "epoch": 1.3038441284886781, "grad_norm": 0.29678258299827576, "learning_rate": 0.00018873029837277236, "loss": 0.2089228481054306, "mean_token_accuracy": 0.9140326231718063, "num_tokens": 30542908.0, "step": 2476 }, { "entropy": 1.1274373829364777, "epoch": 1.3043707214323328, "grad_norm": 0.2565828561782837, "learning_rate": 0.0001887196713781515, "loss": 0.1824226826429367, "mean_token_accuracy": 0.9261182844638824, "num_tokens": 30555244.0, "step": 2477 }, { "entropy": 1.1345534920692444, "epoch": 1.3048973143759874, "grad_norm": 0.29827621579170227, "learning_rate": 0.0001887090397104026, "loss": 0.20668740570545197, "mean_token_accuracy": 0.9158112704753876, "num_tokens": 30567580.0, "step": 2478 }, { "entropy": 1.1208145916461945, "epoch": 1.3054239073196419, "grad_norm": 0.31276044249534607, "learning_rate": 0.00018869840337015675, "loss": 0.2087455838918686, "mean_token_accuracy": 0.9144948124885559, "num_tokens": 30579916.0, "step": 2479 }, { "entropy": 1.153564065694809, "epoch": 1.3059505002632965, "grad_norm": 0.29550793766975403, "learning_rate": 0.00018868776235804536, "loss": 0.213548481464386, "mean_token_accuracy": 0.9138739556074142, "num_tokens": 30592252.0, "step": 2480 }, { "entropy": 1.1374950110912323, "epoch": 1.3064770932069512, "grad_norm": 0.27735957503318787, "learning_rate": 0.00018867711667470017, "loss": 0.19929325580596924, "mean_token_accuracy": 0.9164140969514847, "num_tokens": 30604588.0, "step": 2481 }, { "entropy": 1.1209405362606049, "epoch": 1.3070036861506056, "grad_norm": 0.2788814902305603, "learning_rate": 0.0001886664663207531, "loss": 0.21787486970424652, "mean_token_accuracy": 0.9160508364439011, "num_tokens": 30616924.0, "step": 2482 }, { "entropy": 1.1751077771186829, "epoch": 1.30753027909426, "grad_norm": 0.27281054854393005, "learning_rate": 0.00018865581129683644, "loss": 0.20231208205223083, "mean_token_accuracy": 0.9140424728393555, "num_tokens": 30629260.0, "step": 2483 }, { "entropy": 1.1451273262500763, "epoch": 1.3080568720379147, "grad_norm": 0.2548876404762268, "learning_rate": 0.00018864515160358272, "loss": 0.20404735207557678, "mean_token_accuracy": 0.9158653914928436, "num_tokens": 30641596.0, "step": 2484 }, { "entropy": 1.223433405160904, "epoch": 1.3085834649815693, "grad_norm": 0.28999221324920654, "learning_rate": 0.0001886344872416247, "loss": 0.21280592679977417, "mean_token_accuracy": 0.908152237534523, "num_tokens": 30653932.0, "step": 2485 }, { "entropy": 1.2113437056541443, "epoch": 1.3091100579252237, "grad_norm": 0.2526291012763977, "learning_rate": 0.00018862381821159552, "loss": 0.18035513162612915, "mean_token_accuracy": 0.9277927577495575, "num_tokens": 30666268.0, "step": 2486 }, { "entropy": 1.2897081971168518, "epoch": 1.3096366508688784, "grad_norm": 0.2631675899028778, "learning_rate": 0.0001886131445141285, "loss": 0.2015797197818756, "mean_token_accuracy": 0.918338343501091, "num_tokens": 30678604.0, "step": 2487 }, { "entropy": 1.2078757286071777, "epoch": 1.310163243812533, "grad_norm": 0.24873696267604828, "learning_rate": 0.00018860246614985725, "loss": 0.18720902502536774, "mean_token_accuracy": 0.9217247664928436, "num_tokens": 30690940.0, "step": 2488 }, { "entropy": 1.2295198142528534, "epoch": 1.3106898367561874, "grad_norm": 0.27777987718582153, "learning_rate": 0.00018859178311941575, "loss": 0.21630996465682983, "mean_token_accuracy": 0.9144271612167358, "num_tokens": 30703276.0, "step": 2489 }, { "entropy": 1.2049448788166046, "epoch": 1.311216429699842, "grad_norm": 0.26715347170829773, "learning_rate": 0.00018858109542343814, "loss": 0.19998157024383545, "mean_token_accuracy": 0.9232079237699509, "num_tokens": 30715612.0, "step": 2490 }, { "entropy": 1.1993949711322784, "epoch": 1.3117430226434965, "grad_norm": 0.2785743474960327, "learning_rate": 0.00018857040306255888, "loss": 0.20864132046699524, "mean_token_accuracy": 0.9150129109621048, "num_tokens": 30727948.0, "step": 2491 }, { "entropy": 1.197268307209015, "epoch": 1.3122696155871512, "grad_norm": 0.29957106709480286, "learning_rate": 0.0001885597060374128, "loss": 0.2152678519487381, "mean_token_accuracy": 0.9146653860807419, "num_tokens": 30740284.0, "step": 2492 }, { "entropy": 1.1922446489334106, "epoch": 1.3127962085308056, "grad_norm": 0.31052011251449585, "learning_rate": 0.00018854900434863477, "loss": 0.20205189287662506, "mean_token_accuracy": 0.9173094034194946, "num_tokens": 30752620.0, "step": 2493 }, { "entropy": 1.1869801878929138, "epoch": 1.3133228014744602, "grad_norm": 0.2926376760005951, "learning_rate": 0.0001885382979968602, "loss": 0.21089938282966614, "mean_token_accuracy": 0.9158413708209991, "num_tokens": 30764956.0, "step": 2494 }, { "entropy": 1.132896363735199, "epoch": 1.3138493944181149, "grad_norm": 0.27938100695610046, "learning_rate": 0.00018852758698272465, "loss": 0.1964457780122757, "mean_token_accuracy": 0.9246141463518143, "num_tokens": 30777292.0, "step": 2495 }, { "entropy": 1.2086142599582672, "epoch": 1.3143759873617693, "grad_norm": 0.28923818469047546, "learning_rate": 0.00018851687130686396, "loss": 0.2008797824382782, "mean_token_accuracy": 0.916870579123497, "num_tokens": 30789628.0, "step": 2496 }, { "entropy": 1.1438094079494476, "epoch": 1.314902580305424, "grad_norm": 0.2761872708797455, "learning_rate": 0.00018850615096991424, "loss": 0.19743943214416504, "mean_token_accuracy": 0.9220564365386963, "num_tokens": 30801964.0, "step": 2497 }, { "entropy": 1.1207115054130554, "epoch": 1.3154291732490786, "grad_norm": 0.2810716927051544, "learning_rate": 0.0001884954259725119, "loss": 0.20330996811389923, "mean_token_accuracy": 0.9163385629653931, "num_tokens": 30814300.0, "step": 2498 }, { "entropy": 1.1683085262775421, "epoch": 1.315955766192733, "grad_norm": 0.2724354565143585, "learning_rate": 0.00018848469631529364, "loss": 0.18855315446853638, "mean_token_accuracy": 0.9251711666584015, "num_tokens": 30826636.0, "step": 2499 }, { "entropy": 1.1003861129283905, "epoch": 1.3164823591363874, "grad_norm": 0.2779734432697296, "learning_rate": 0.00018847396199889638, "loss": 0.20665448904037476, "mean_token_accuracy": 0.9169312715530396, "num_tokens": 30838972.0, "step": 2500 }, { "entropy": 1.1359674334526062, "epoch": 1.317008952080042, "grad_norm": 0.28787779808044434, "learning_rate": 0.0001884632230239574, "loss": 0.19744256138801575, "mean_token_accuracy": 0.9244921803474426, "num_tokens": 30851308.0, "step": 2501 }, { "entropy": 1.1084416806697845, "epoch": 1.3175355450236967, "grad_norm": 0.2643449306488037, "learning_rate": 0.00018845247939111418, "loss": 0.19814109802246094, "mean_token_accuracy": 0.9191816598176956, "num_tokens": 30863644.0, "step": 2502 }, { "entropy": 1.1480841636657715, "epoch": 1.3180621379673512, "grad_norm": 0.2745157778263092, "learning_rate": 0.00018844173110100452, "loss": 0.20436102151870728, "mean_token_accuracy": 0.9175873845815659, "num_tokens": 30875980.0, "step": 2503 }, { "entropy": 1.168861299753189, "epoch": 1.3185887309110058, "grad_norm": 0.28558439016342163, "learning_rate": 0.00018843097815426644, "loss": 0.19720155000686646, "mean_token_accuracy": 0.921770378947258, "num_tokens": 30888316.0, "step": 2504 }, { "entropy": 1.1487717032432556, "epoch": 1.3191153238546605, "grad_norm": 0.252396821975708, "learning_rate": 0.00018842022055153837, "loss": 0.18812143802642822, "mean_token_accuracy": 0.9198298454284668, "num_tokens": 30900652.0, "step": 2505 }, { "entropy": 1.0874556303024292, "epoch": 1.3196419167983149, "grad_norm": 0.27975741028785706, "learning_rate": 0.00018840945829345885, "loss": 0.19726543128490448, "mean_token_accuracy": 0.9175487458705902, "num_tokens": 30912988.0, "step": 2506 }, { "entropy": 1.0931753516197205, "epoch": 1.3201685097419695, "grad_norm": 0.2753717005252838, "learning_rate": 0.0001883986913806668, "loss": 0.19207552075386047, "mean_token_accuracy": 0.9233367294073105, "num_tokens": 30925324.0, "step": 2507 }, { "entropy": 1.0678606629371643, "epoch": 1.320695102685624, "grad_norm": 0.2772499620914459, "learning_rate": 0.00018838791981380136, "loss": 0.20343419909477234, "mean_token_accuracy": 0.9183335304260254, "num_tokens": 30937660.0, "step": 2508 }, { "entropy": 1.0918059051036835, "epoch": 1.3212216956292786, "grad_norm": 0.29579028487205505, "learning_rate": 0.00018837714359350201, "loss": 0.2152230143547058, "mean_token_accuracy": 0.9208053946495056, "num_tokens": 30949996.0, "step": 2509 }, { "entropy": 1.0503469556570053, "epoch": 1.321748288572933, "grad_norm": 0.2653261423110962, "learning_rate": 0.0001883663627204085, "loss": 0.1930423229932785, "mean_token_accuracy": 0.9191714227199554, "num_tokens": 30962332.0, "step": 2510 }, { "entropy": 1.1172581315040588, "epoch": 1.3222748815165877, "grad_norm": 0.3529946208000183, "learning_rate": 0.00018835557719516078, "loss": 0.22693800926208496, "mean_token_accuracy": 0.9077934175729752, "num_tokens": 30974668.0, "step": 2511 }, { "entropy": 1.0955396890640259, "epoch": 1.3228014744602423, "grad_norm": 0.2981196343898773, "learning_rate": 0.0001883447870183991, "loss": 0.19838613271713257, "mean_token_accuracy": 0.9167172312736511, "num_tokens": 30987004.0, "step": 2512 }, { "entropy": 1.0746179521083832, "epoch": 1.3233280674038967, "grad_norm": 0.30476272106170654, "learning_rate": 0.00018833399219076407, "loss": 0.21524569392204285, "mean_token_accuracy": 0.9110986590385437, "num_tokens": 30999340.0, "step": 2513 }, { "entropy": 1.1119599342346191, "epoch": 1.3238546603475514, "grad_norm": 0.3129141628742218, "learning_rate": 0.00018832319271289646, "loss": 0.20734190940856934, "mean_token_accuracy": 0.9160514175891876, "num_tokens": 31011676.0, "step": 2514 }, { "entropy": 1.0783126950263977, "epoch": 1.3243812532912058, "grad_norm": 0.2936292588710785, "learning_rate": 0.00018831238858543742, "loss": 0.20680686831474304, "mean_token_accuracy": 0.9129305332899094, "num_tokens": 31024012.0, "step": 2515 }, { "entropy": 1.0885819494724274, "epoch": 1.3249078462348605, "grad_norm": 0.29339733719825745, "learning_rate": 0.00018830157980902833, "loss": 0.20416975021362305, "mean_token_accuracy": 0.9174858927726746, "num_tokens": 31036348.0, "step": 2516 }, { "entropy": 1.1106742322444916, "epoch": 1.325434439178515, "grad_norm": 0.3055555522441864, "learning_rate": 0.00018829076638431078, "loss": 0.2278045117855072, "mean_token_accuracy": 0.9134476184844971, "num_tokens": 31048684.0, "step": 2517 }, { "entropy": 1.1332001090049744, "epoch": 1.3259610321221695, "grad_norm": 0.27308133244514465, "learning_rate": 0.00018827994831192675, "loss": 0.19392089545726776, "mean_token_accuracy": 0.9187697917222977, "num_tokens": 31061020.0, "step": 2518 }, { "entropy": 1.196645975112915, "epoch": 1.3264876250658242, "grad_norm": 0.3041642904281616, "learning_rate": 0.00018826912559251848, "loss": 0.23238268494606018, "mean_token_accuracy": 0.9100022912025452, "num_tokens": 31073356.0, "step": 2519 }, { "entropy": 1.1595803797245026, "epoch": 1.3270142180094786, "grad_norm": 0.2854364812374115, "learning_rate": 0.00018825829822672837, "loss": 0.21763843297958374, "mean_token_accuracy": 0.911407396197319, "num_tokens": 31085692.0, "step": 2520 }, { "entropy": 1.1426350474357605, "epoch": 1.3275408109531333, "grad_norm": 0.26290595531463623, "learning_rate": 0.00018824746621519923, "loss": 0.18908298015594482, "mean_token_accuracy": 0.9210202246904373, "num_tokens": 31098028.0, "step": 2521 }, { "entropy": 1.1872995793819427, "epoch": 1.328067403896788, "grad_norm": 0.2785587012767792, "learning_rate": 0.00018823662955857407, "loss": 0.20560133457183838, "mean_token_accuracy": 0.9162561148405075, "num_tokens": 31110364.0, "step": 2522 }, { "entropy": 1.1389261186122894, "epoch": 1.3285939968404423, "grad_norm": 0.2547476291656494, "learning_rate": 0.00018822578825749623, "loss": 0.20492050051689148, "mean_token_accuracy": 0.9174861460924149, "num_tokens": 31122700.0, "step": 2523 }, { "entropy": 1.1379226744174957, "epoch": 1.329120589784097, "grad_norm": 0.2671321630477905, "learning_rate": 0.0001882149423126093, "loss": 0.21442070603370667, "mean_token_accuracy": 0.916014552116394, "num_tokens": 31135036.0, "step": 2524 }, { "entropy": 1.1240211725234985, "epoch": 1.3296471827277514, "grad_norm": 0.28270992636680603, "learning_rate": 0.00018820409172455707, "loss": 0.20910367369651794, "mean_token_accuracy": 0.9152929037809372, "num_tokens": 31147372.0, "step": 2525 }, { "entropy": 1.126050055027008, "epoch": 1.330173775671406, "grad_norm": 0.2661881148815155, "learning_rate": 0.00018819323649398373, "loss": 0.19098810851573944, "mean_token_accuracy": 0.9209559559822083, "num_tokens": 31159708.0, "step": 2526 }, { "entropy": 1.1266259253025055, "epoch": 1.3307003686150605, "grad_norm": 0.2929874658584595, "learning_rate": 0.0001881823766215337, "loss": 0.20036344230175018, "mean_token_accuracy": 0.9238387793302536, "num_tokens": 31172044.0, "step": 2527 }, { "entropy": 1.0866254270076752, "epoch": 1.3312269615587151, "grad_norm": 0.28896623849868774, "learning_rate": 0.00018817151210785162, "loss": 0.18842336535453796, "mean_token_accuracy": 0.9209622591733932, "num_tokens": 31184380.0, "step": 2528 }, { "entropy": 1.1249730587005615, "epoch": 1.3317535545023698, "grad_norm": 0.2872648537158966, "learning_rate": 0.0001881606429535825, "loss": 0.22201552987098694, "mean_token_accuracy": 0.9108192026615143, "num_tokens": 31196716.0, "step": 2529 }, { "entropy": 1.0949527323246002, "epoch": 1.3322801474460242, "grad_norm": 0.2851123511791229, "learning_rate": 0.0001881497691593716, "loss": 0.1967121958732605, "mean_token_accuracy": 0.9210963398218155, "num_tokens": 31209052.0, "step": 2530 }, { "entropy": 1.1146687865257263, "epoch": 1.3328067403896788, "grad_norm": 0.3102349638938904, "learning_rate": 0.00018813889072586434, "loss": 0.23011735081672668, "mean_token_accuracy": 0.9073590189218521, "num_tokens": 31221388.0, "step": 2531 }, { "entropy": 1.0698721408843994, "epoch": 1.3333333333333333, "grad_norm": 0.2832903563976288, "learning_rate": 0.0001881280076537066, "loss": 0.1880122423171997, "mean_token_accuracy": 0.9258202612400055, "num_tokens": 31233724.0, "step": 2532 }, { "entropy": 1.1224130392074585, "epoch": 1.333859926276988, "grad_norm": 0.2848287522792816, "learning_rate": 0.0001881171199435444, "loss": 0.19834977388381958, "mean_token_accuracy": 0.9168813228607178, "num_tokens": 31246060.0, "step": 2533 }, { "entropy": 1.1105233430862427, "epoch": 1.3343865192206423, "grad_norm": 0.3011896014213562, "learning_rate": 0.0001881062275960241, "loss": 0.22225533425807953, "mean_token_accuracy": 0.9092197567224503, "num_tokens": 31258396.0, "step": 2534 }, { "entropy": 1.0629687905311584, "epoch": 1.334913112164297, "grad_norm": 0.2885998785495758, "learning_rate": 0.0001880953306117923, "loss": 0.2081342339515686, "mean_token_accuracy": 0.9201711565256119, "num_tokens": 31270732.0, "step": 2535 }, { "entropy": 1.0981874465942383, "epoch": 1.3354397051079516, "grad_norm": 0.2881809175014496, "learning_rate": 0.0001880844289914959, "loss": 0.20444408059120178, "mean_token_accuracy": 0.9140055626630783, "num_tokens": 31283068.0, "step": 2536 }, { "entropy": 1.0878173410892487, "epoch": 1.335966298051606, "grad_norm": 0.2887677252292633, "learning_rate": 0.00018807352273578204, "loss": 0.20989957451820374, "mean_token_accuracy": 0.9208216220140457, "num_tokens": 31295404.0, "step": 2537 }, { "entropy": 1.1007463037967682, "epoch": 1.3364928909952607, "grad_norm": 0.2962489426136017, "learning_rate": 0.0001880626118452982, "loss": 0.20988334715366364, "mean_token_accuracy": 0.9117045700550079, "num_tokens": 31307740.0, "step": 2538 }, { "entropy": 1.1124551892280579, "epoch": 1.3370194839389153, "grad_norm": 0.2889869809150696, "learning_rate": 0.00018805169632069206, "loss": 0.22036269307136536, "mean_token_accuracy": 0.9166446030139923, "num_tokens": 31320076.0, "step": 2539 }, { "entropy": 1.0473781377077103, "epoch": 1.3375460768825698, "grad_norm": 0.28756895661354065, "learning_rate": 0.00018804077616261166, "loss": 0.20982427895069122, "mean_token_accuracy": 0.9156763106584549, "num_tokens": 31332412.0, "step": 2540 }, { "entropy": 1.0588495880365372, "epoch": 1.3380726698262242, "grad_norm": 0.2706986665725708, "learning_rate": 0.00018802985137170522, "loss": 0.2128053605556488, "mean_token_accuracy": 0.9166304022073746, "num_tokens": 31344748.0, "step": 2541 }, { "entropy": 1.075078159570694, "epoch": 1.3385992627698788, "grad_norm": 0.2772495746612549, "learning_rate": 0.0001880189219486213, "loss": 0.1886967122554779, "mean_token_accuracy": 0.9169599562883377, "num_tokens": 31357084.0, "step": 2542 }, { "entropy": 1.0650361776351929, "epoch": 1.3391258557135335, "grad_norm": 0.3137603998184204, "learning_rate": 0.0001880079878940087, "loss": 0.20629137754440308, "mean_token_accuracy": 0.919654980301857, "num_tokens": 31369420.0, "step": 2543 }, { "entropy": 1.0738177597522736, "epoch": 1.339652448657188, "grad_norm": 0.2894216775894165, "learning_rate": 0.00018799704920851652, "loss": 0.22449420392513275, "mean_token_accuracy": 0.9042561650276184, "num_tokens": 31381756.0, "step": 2544 }, { "entropy": 1.0527926087379456, "epoch": 1.3401790416008426, "grad_norm": 0.2740827202796936, "learning_rate": 0.00018798610589279417, "loss": 0.203867569565773, "mean_token_accuracy": 0.9112063497304916, "num_tokens": 31394092.0, "step": 2545 }, { "entropy": 1.0129956007003784, "epoch": 1.3407056345444972, "grad_norm": 0.2815206050872803, "learning_rate": 0.00018797515794749122, "loss": 0.18543724715709686, "mean_token_accuracy": 0.9268083721399307, "num_tokens": 31406428.0, "step": 2546 }, { "entropy": 1.032931998372078, "epoch": 1.3412322274881516, "grad_norm": 0.2881038784980774, "learning_rate": 0.00018796420537325762, "loss": 0.21719786524772644, "mean_token_accuracy": 0.918227955698967, "num_tokens": 31418764.0, "step": 2547 }, { "entropy": 1.0120973587036133, "epoch": 1.3417588204318063, "grad_norm": 0.27740973234176636, "learning_rate": 0.00018795324817074354, "loss": 0.18840999901294708, "mean_token_accuracy": 0.922258198261261, "num_tokens": 31431100.0, "step": 2548 }, { "entropy": 1.0631686747074127, "epoch": 1.3422854133754607, "grad_norm": 0.3168363869190216, "learning_rate": 0.0001879422863405995, "loss": 0.21135640144348145, "mean_token_accuracy": 0.9179410338401794, "num_tokens": 31443436.0, "step": 2549 }, { "entropy": 1.0500916242599487, "epoch": 1.3428120063191153, "grad_norm": 0.29962658882141113, "learning_rate": 0.00018793131988347617, "loss": 0.2103479504585266, "mean_token_accuracy": 0.9147076457738876, "num_tokens": 31455772.0, "step": 2550 }, { "entropy": 1.0350684523582458, "epoch": 1.3433385992627698, "grad_norm": 0.2993636727333069, "learning_rate": 0.0001879203488000246, "loss": 0.2143697738647461, "mean_token_accuracy": 0.9145818799734116, "num_tokens": 31468108.0, "step": 2551 }, { "entropy": 1.0683605670928955, "epoch": 1.3438651922064244, "grad_norm": 0.31891852617263794, "learning_rate": 0.0001879093730908961, "loss": 0.2051960527896881, "mean_token_accuracy": 0.9145154505968094, "num_tokens": 31480444.0, "step": 2552 }, { "entropy": 1.0360463559627533, "epoch": 1.344391785150079, "grad_norm": 0.29179492592811584, "learning_rate": 0.0001878983927567422, "loss": 0.2059982270002365, "mean_token_accuracy": 0.9194035530090332, "num_tokens": 31492780.0, "step": 2553 }, { "entropy": 1.093918263912201, "epoch": 1.3449183780937335, "grad_norm": 0.3079806864261627, "learning_rate": 0.0001878874077982147, "loss": 0.21530432999134064, "mean_token_accuracy": 0.9130852967500687, "num_tokens": 31505116.0, "step": 2554 }, { "entropy": 1.1094603836536407, "epoch": 1.3454449710373881, "grad_norm": 0.2917912006378174, "learning_rate": 0.00018787641821596583, "loss": 0.2050892859697342, "mean_token_accuracy": 0.9154047220945358, "num_tokens": 31517452.0, "step": 2555 }, { "entropy": 1.1357096135616302, "epoch": 1.3459715639810428, "grad_norm": 0.27194029092788696, "learning_rate": 0.00018786542401064789, "loss": 0.18924210965633392, "mean_token_accuracy": 0.9251724630594254, "num_tokens": 31529788.0, "step": 2556 }, { "entropy": 1.1269418597221375, "epoch": 1.3464981569246972, "grad_norm": 0.26160678267478943, "learning_rate": 0.00018785442518291353, "loss": 0.20647940039634705, "mean_token_accuracy": 0.9157357662916183, "num_tokens": 31542124.0, "step": 2557 }, { "entropy": 1.1875733733177185, "epoch": 1.3470247498683516, "grad_norm": 0.2644807696342468, "learning_rate": 0.00018784342173341575, "loss": 0.1932739019393921, "mean_token_accuracy": 0.9194819778203964, "num_tokens": 31554460.0, "step": 2558 }, { "entropy": 1.1785165071487427, "epoch": 1.3475513428120063, "grad_norm": 0.27935707569122314, "learning_rate": 0.00018783241366280773, "loss": 0.2223643660545349, "mean_token_accuracy": 0.9112606793642044, "num_tokens": 31566796.0, "step": 2559 }, { "entropy": 1.1744961738586426, "epoch": 1.348077935755661, "grad_norm": 0.272098183631897, "learning_rate": 0.0001878214009717429, "loss": 0.2064208835363388, "mean_token_accuracy": 0.9138854891061783, "num_tokens": 31579132.0, "step": 2560 }, { "entropy": 1.1525810956954956, "epoch": 1.3486045286993154, "grad_norm": 0.2795564532279968, "learning_rate": 0.00018781038366087513, "loss": 0.20882105827331543, "mean_token_accuracy": 0.9144481867551804, "num_tokens": 31591468.0, "step": 2561 }, { "entropy": 1.104248732328415, "epoch": 1.34913112164297, "grad_norm": 0.23773279786109924, "learning_rate": 0.00018779936173085837, "loss": 0.18065296113491058, "mean_token_accuracy": 0.9290421605110168, "num_tokens": 31603804.0, "step": 2562 }, { "entropy": 1.1595117151737213, "epoch": 1.3496577145866246, "grad_norm": 0.2747121751308441, "learning_rate": 0.00018778833518234698, "loss": 0.20582349598407745, "mean_token_accuracy": 0.912534311413765, "num_tokens": 31616140.0, "step": 2563 }, { "entropy": 1.155326247215271, "epoch": 1.350184307530279, "grad_norm": 0.2732286751270294, "learning_rate": 0.00018777730401599549, "loss": 0.19955134391784668, "mean_token_accuracy": 0.9210360944271088, "num_tokens": 31628476.0, "step": 2564 }, { "entropy": 1.1245983242988586, "epoch": 1.3507109004739337, "grad_norm": 0.24134601652622223, "learning_rate": 0.00018776626823245878, "loss": 0.18833664059638977, "mean_token_accuracy": 0.9211855530738831, "num_tokens": 31640812.0, "step": 2565 }, { "entropy": 1.1322357952594757, "epoch": 1.3512374934175881, "grad_norm": 0.27595973014831543, "learning_rate": 0.00018775522783239198, "loss": 0.20659556984901428, "mean_token_accuracy": 0.921311542391777, "num_tokens": 31653148.0, "step": 2566 }, { "entropy": 1.1415637731552124, "epoch": 1.3517640863612428, "grad_norm": 0.2799292802810669, "learning_rate": 0.00018774418281645053, "loss": 0.18609049916267395, "mean_token_accuracy": 0.9205182492733002, "num_tokens": 31665484.0, "step": 2567 }, { "entropy": 1.099078118801117, "epoch": 1.3522906793048972, "grad_norm": 0.356923907995224, "learning_rate": 0.00018773313318529, "loss": 0.20763400197029114, "mean_token_accuracy": 0.9158278256654739, "num_tokens": 31677820.0, "step": 2568 }, { "entropy": 1.1672882437705994, "epoch": 1.3528172722485519, "grad_norm": 0.323013573884964, "learning_rate": 0.00018772207893956647, "loss": 0.229105606675148, "mean_token_accuracy": 0.9055341184139252, "num_tokens": 31690156.0, "step": 2569 }, { "entropy": 1.129069447517395, "epoch": 1.3533438651922065, "grad_norm": 0.28814175724983215, "learning_rate": 0.00018771102007993613, "loss": 0.21873462200164795, "mean_token_accuracy": 0.9137783348560333, "num_tokens": 31702492.0, "step": 2570 }, { "entropy": 1.1057601869106293, "epoch": 1.353870458135861, "grad_norm": 0.27318117022514343, "learning_rate": 0.00018769995660705542, "loss": 0.21677207946777344, "mean_token_accuracy": 0.9136002212762833, "num_tokens": 31714828.0, "step": 2571 }, { "entropy": 1.1042208969593048, "epoch": 1.3543970510795156, "grad_norm": 0.28476253151893616, "learning_rate": 0.0001876888885215812, "loss": 0.20920810103416443, "mean_token_accuracy": 0.9151055365800858, "num_tokens": 31727164.0, "step": 2572 }, { "entropy": 1.133261263370514, "epoch": 1.3549236440231702, "grad_norm": 0.2653651237487793, "learning_rate": 0.00018767781582417043, "loss": 0.1804226189851761, "mean_token_accuracy": 0.9289367198944092, "num_tokens": 31739500.0, "step": 2573 }, { "entropy": 1.1577132642269135, "epoch": 1.3554502369668247, "grad_norm": 0.27154141664505005, "learning_rate": 0.00018766673851548047, "loss": 0.18820011615753174, "mean_token_accuracy": 0.9214843064546585, "num_tokens": 31751836.0, "step": 2574 }, { "entropy": 1.1380637884140015, "epoch": 1.355976829910479, "grad_norm": 0.2832103371620178, "learning_rate": 0.00018765565659616896, "loss": 0.2163006067276001, "mean_token_accuracy": 0.9146066755056381, "num_tokens": 31764172.0, "step": 2575 }, { "entropy": 1.171122670173645, "epoch": 1.3565034228541337, "grad_norm": 0.29119494557380676, "learning_rate": 0.00018764457006689372, "loss": 0.1951453536748886, "mean_token_accuracy": 0.916601300239563, "num_tokens": 31776508.0, "step": 2576 }, { "entropy": 1.1506705582141876, "epoch": 1.3570300157977884, "grad_norm": 0.28178977966308594, "learning_rate": 0.0001876334789283129, "loss": 0.21672406792640686, "mean_token_accuracy": 0.9112057536840439, "num_tokens": 31788844.0, "step": 2577 }, { "entropy": 1.1319689452648163, "epoch": 1.3575566087414428, "grad_norm": 0.31361258029937744, "learning_rate": 0.0001876223831810849, "loss": 0.23558440804481506, "mean_token_accuracy": 0.9097436219453812, "num_tokens": 31801180.0, "step": 2578 }, { "entropy": 1.1845204532146454, "epoch": 1.3580832016850974, "grad_norm": 0.2968812882900238, "learning_rate": 0.00018761128282586843, "loss": 0.20870262384414673, "mean_token_accuracy": 0.9157723784446716, "num_tokens": 31813516.0, "step": 2579 }, { "entropy": 1.1385733485221863, "epoch": 1.358609794628752, "grad_norm": 0.283302366733551, "learning_rate": 0.00018760017786332247, "loss": 0.20222227275371552, "mean_token_accuracy": 0.9147961437702179, "num_tokens": 31825852.0, "step": 2580 }, { "entropy": 1.1306065320968628, "epoch": 1.3591363875724065, "grad_norm": 0.3002590537071228, "learning_rate": 0.0001875890682941062, "loss": 0.23286172747612, "mean_token_accuracy": 0.9055652320384979, "num_tokens": 31838188.0, "step": 2581 }, { "entropy": 1.1369206607341766, "epoch": 1.3596629805160612, "grad_norm": 0.2827116847038269, "learning_rate": 0.00018757795411887922, "loss": 0.20414981245994568, "mean_token_accuracy": 0.9247657358646393, "num_tokens": 31850524.0, "step": 2582 }, { "entropy": 1.182368516921997, "epoch": 1.3601895734597156, "grad_norm": 0.2734077572822571, "learning_rate": 0.00018756683533830123, "loss": 0.18725436925888062, "mean_token_accuracy": 0.9269359111785889, "num_tokens": 31862860.0, "step": 2583 }, { "entropy": 1.1202270686626434, "epoch": 1.3607161664033702, "grad_norm": 0.27396515011787415, "learning_rate": 0.00018755571195303234, "loss": 0.19522534310817719, "mean_token_accuracy": 0.9229871332645416, "num_tokens": 31875196.0, "step": 2584 }, { "entropy": 1.1103180348873138, "epoch": 1.3612427593470247, "grad_norm": 0.27679014205932617, "learning_rate": 0.00018754458396373286, "loss": 0.1996929943561554, "mean_token_accuracy": 0.9204212427139282, "num_tokens": 31887532.0, "step": 2585 }, { "entropy": 1.1616276800632477, "epoch": 1.3617693522906793, "grad_norm": 0.29670003056526184, "learning_rate": 0.00018753345137106336, "loss": 0.23619894683361053, "mean_token_accuracy": 0.9007562100887299, "num_tokens": 31899868.0, "step": 2586 }, { "entropy": 1.1399752795696259, "epoch": 1.362295945234334, "grad_norm": 0.2779025435447693, "learning_rate": 0.0001875223141756848, "loss": 0.20615586638450623, "mean_token_accuracy": 0.9151979237794876, "num_tokens": 31912204.0, "step": 2587 }, { "entropy": 1.167212337255478, "epoch": 1.3628225381779884, "grad_norm": 0.2890734076499939, "learning_rate": 0.00018751117237825825, "loss": 0.20611752569675446, "mean_token_accuracy": 0.9171196669340134, "num_tokens": 31924540.0, "step": 2588 }, { "entropy": 1.126388281583786, "epoch": 1.363349131121643, "grad_norm": 0.27933791279792786, "learning_rate": 0.00018750002597944516, "loss": 0.20168091356754303, "mean_token_accuracy": 0.9160471111536026, "num_tokens": 31936876.0, "step": 2589 }, { "entropy": 1.1319892406463623, "epoch": 1.3638757240652974, "grad_norm": 0.28239932656288147, "learning_rate": 0.00018748887497990727, "loss": 0.20251701772212982, "mean_token_accuracy": 0.917927622795105, "num_tokens": 31949212.0, "step": 2590 }, { "entropy": 1.1169626712799072, "epoch": 1.364402317008952, "grad_norm": 0.280332088470459, "learning_rate": 0.00018747771938030648, "loss": 0.18491880595684052, "mean_token_accuracy": 0.9226613193750381, "num_tokens": 31961548.0, "step": 2591 }, { "entropy": 1.1182208061218262, "epoch": 1.3649289099526065, "grad_norm": 0.2557113766670227, "learning_rate": 0.00018746655918130506, "loss": 0.17858107388019562, "mean_token_accuracy": 0.9297724813222885, "num_tokens": 31973884.0, "step": 2592 }, { "entropy": 1.1194300055503845, "epoch": 1.3654555028962612, "grad_norm": 0.29216471314430237, "learning_rate": 0.00018745539438356557, "loss": 0.20672905445098877, "mean_token_accuracy": 0.9149999022483826, "num_tokens": 31986220.0, "step": 2593 }, { "entropy": 1.1690471470355988, "epoch": 1.3659820958399158, "grad_norm": 0.29650187492370605, "learning_rate": 0.00018744422498775072, "loss": 0.22313809394836426, "mean_token_accuracy": 0.9091308563947678, "num_tokens": 31998556.0, "step": 2594 }, { "entropy": 1.1421934366226196, "epoch": 1.3665086887835702, "grad_norm": 0.2731371521949768, "learning_rate": 0.0001874330509945236, "loss": 0.19944173097610474, "mean_token_accuracy": 0.9169053733348846, "num_tokens": 32010892.0, "step": 2595 }, { "entropy": 1.143957257270813, "epoch": 1.3670352817272249, "grad_norm": 0.3047042787075043, "learning_rate": 0.00018742187240454762, "loss": 0.20404207706451416, "mean_token_accuracy": 0.9194851368665695, "num_tokens": 32023228.0, "step": 2596 }, { "entropy": 1.1393778026103973, "epoch": 1.3675618746708795, "grad_norm": 0.30072396993637085, "learning_rate": 0.00018741068921848626, "loss": 0.2037821114063263, "mean_token_accuracy": 0.9212421625852585, "num_tokens": 32035564.0, "step": 2597 }, { "entropy": 1.139537751674652, "epoch": 1.368088467614534, "grad_norm": 0.3391966223716736, "learning_rate": 0.00018739950143700348, "loss": 0.19885693490505219, "mean_token_accuracy": 0.9235148131847382, "num_tokens": 32047900.0, "step": 2598 }, { "entropy": 1.1805144548416138, "epoch": 1.3686150605581886, "grad_norm": 0.2925131022930145, "learning_rate": 0.00018738830906076342, "loss": 0.20037105679512024, "mean_token_accuracy": 0.9239792376756668, "num_tokens": 32060236.0, "step": 2599 }, { "entropy": 1.185164213180542, "epoch": 1.369141653501843, "grad_norm": 0.2835521996021271, "learning_rate": 0.00018737711209043054, "loss": 0.20223882794380188, "mean_token_accuracy": 0.917163297533989, "num_tokens": 32072572.0, "step": 2600 }, { "entropy": 1.157685101032257, "epoch": 1.3696682464454977, "grad_norm": 0.27268749475479126, "learning_rate": 0.00018736591052666946, "loss": 0.1903955042362213, "mean_token_accuracy": 0.9194441586732864, "num_tokens": 32084908.0, "step": 2601 }, { "entropy": 1.2693307399749756, "epoch": 1.370194839389152, "grad_norm": 0.28890320658683777, "learning_rate": 0.00018735470437014523, "loss": 0.20518316328525543, "mean_token_accuracy": 0.9177209436893463, "num_tokens": 32097244.0, "step": 2602 }, { "entropy": 1.2482496500015259, "epoch": 1.3707214323328067, "grad_norm": 0.30512097477912903, "learning_rate": 0.00018734349362152305, "loss": 0.21335013210773468, "mean_token_accuracy": 0.9146852493286133, "num_tokens": 32109580.0, "step": 2603 }, { "entropy": 1.2782647907733917, "epoch": 1.3712480252764614, "grad_norm": 0.29834169149398804, "learning_rate": 0.0001873322782814684, "loss": 0.2050481140613556, "mean_token_accuracy": 0.9144423753023148, "num_tokens": 32121916.0, "step": 2604 }, { "entropy": 1.2587519884109497, "epoch": 1.3717746182201158, "grad_norm": 0.28562498092651367, "learning_rate": 0.00018732105835064715, "loss": 0.19426429271697998, "mean_token_accuracy": 0.920745924115181, "num_tokens": 32134252.0, "step": 2605 }, { "entropy": 1.2290140092372894, "epoch": 1.3723012111637705, "grad_norm": 0.30887603759765625, "learning_rate": 0.00018730983382972535, "loss": 0.23400862514972687, "mean_token_accuracy": 0.9006239920854568, "num_tokens": 32146588.0, "step": 2606 }, { "entropy": 1.2600108683109283, "epoch": 1.3728278041074249, "grad_norm": 0.3018042743206024, "learning_rate": 0.00018729860471936927, "loss": 0.2075652927160263, "mean_token_accuracy": 0.9155648052692413, "num_tokens": 32158924.0, "step": 2607 }, { "entropy": 1.2218706607818604, "epoch": 1.3733543970510795, "grad_norm": 0.29793429374694824, "learning_rate": 0.00018728737102024557, "loss": 0.219403937458992, "mean_token_accuracy": 0.9094530642032623, "num_tokens": 32171260.0, "step": 2608 }, { "entropy": 1.3601875305175781, "epoch": 1.373880989994734, "grad_norm": 0.32878509163856506, "learning_rate": 0.00018727613273302114, "loss": 0.21100544929504395, "mean_token_accuracy": 0.9185794442892075, "num_tokens": 32183596.0, "step": 2609 }, { "entropy": 1.2661290764808655, "epoch": 1.3744075829383886, "grad_norm": 0.27767306566238403, "learning_rate": 0.0001872648898583631, "loss": 0.22158057987689972, "mean_token_accuracy": 0.9131675958633423, "num_tokens": 32195932.0, "step": 2610 }, { "entropy": 1.2464967370033264, "epoch": 1.3749341758820433, "grad_norm": 0.2783961892127991, "learning_rate": 0.00018725364239693888, "loss": 0.193161278963089, "mean_token_accuracy": 0.9226386845111847, "num_tokens": 32208268.0, "step": 2611 }, { "entropy": 1.2675247490406036, "epoch": 1.3754607688256977, "grad_norm": 0.2909803092479706, "learning_rate": 0.00018724239034941618, "loss": 0.2184634506702423, "mean_token_accuracy": 0.9100800156593323, "num_tokens": 32220604.0, "step": 2612 }, { "entropy": 1.223971039056778, "epoch": 1.3759873617693523, "grad_norm": 0.2707139551639557, "learning_rate": 0.00018723113371646295, "loss": 0.1935388147830963, "mean_token_accuracy": 0.9257960468530655, "num_tokens": 32232940.0, "step": 2613 }, { "entropy": 1.2640557885169983, "epoch": 1.376513954713007, "grad_norm": 0.257673978805542, "learning_rate": 0.00018721987249874746, "loss": 0.17373917996883392, "mean_token_accuracy": 0.9268936216831207, "num_tokens": 32245276.0, "step": 2614 }, { "entropy": 1.260954111814499, "epoch": 1.3770405476566614, "grad_norm": 0.2596103847026825, "learning_rate": 0.00018720860669693823, "loss": 0.19530557096004486, "mean_token_accuracy": 0.9233595281839371, "num_tokens": 32257612.0, "step": 2615 }, { "entropy": 1.2570489048957825, "epoch": 1.3775671406003158, "grad_norm": 0.2871362268924713, "learning_rate": 0.000187197336311704, "loss": 0.21668970584869385, "mean_token_accuracy": 0.9106542319059372, "num_tokens": 32269948.0, "step": 2616 }, { "entropy": 1.2458524703979492, "epoch": 1.3780937335439705, "grad_norm": 0.29486218094825745, "learning_rate": 0.00018718606134371385, "loss": 0.21607458591461182, "mean_token_accuracy": 0.9180518984794617, "num_tokens": 32282284.0, "step": 2617 }, { "entropy": 1.1982189416885376, "epoch": 1.3786203264876251, "grad_norm": 0.266152560710907, "learning_rate": 0.00018717478179363715, "loss": 0.1885453462600708, "mean_token_accuracy": 0.920305460691452, "num_tokens": 32294620.0, "step": 2618 }, { "entropy": 1.1810212433338165, "epoch": 1.3791469194312795, "grad_norm": 0.34556058049201965, "learning_rate": 0.00018716349766214344, "loss": 0.2133154273033142, "mean_token_accuracy": 0.9144544005393982, "num_tokens": 32306956.0, "step": 2619 }, { "entropy": 1.1619344651699066, "epoch": 1.3796735123749342, "grad_norm": 0.27238133549690247, "learning_rate": 0.0001871522089499026, "loss": 0.18257702887058258, "mean_token_accuracy": 0.926590159535408, "num_tokens": 32319292.0, "step": 2620 }, { "entropy": 1.1952409446239471, "epoch": 1.3802001053185888, "grad_norm": 0.29954856634140015, "learning_rate": 0.0001871409156575848, "loss": 0.19620761275291443, "mean_token_accuracy": 0.9240281283855438, "num_tokens": 32331628.0, "step": 2621 }, { "entropy": 1.1484823524951935, "epoch": 1.3807266982622433, "grad_norm": 0.2953477203845978, "learning_rate": 0.00018712961778586046, "loss": 0.1918509304523468, "mean_token_accuracy": 0.9219135642051697, "num_tokens": 32343964.0, "step": 2622 }, { "entropy": 1.1857792735099792, "epoch": 1.381253291205898, "grad_norm": 0.29551708698272705, "learning_rate": 0.00018711831533540024, "loss": 0.1936018168926239, "mean_token_accuracy": 0.9209873676300049, "num_tokens": 32356300.0, "step": 2623 }, { "entropy": 1.1783287823200226, "epoch": 1.3817798841495523, "grad_norm": 0.3080747127532959, "learning_rate": 0.00018710700830687515, "loss": 0.20185130834579468, "mean_token_accuracy": 0.9161763191223145, "num_tokens": 32368636.0, "step": 2624 }, { "entropy": 1.1695483326911926, "epoch": 1.382306477093207, "grad_norm": 0.3095219135284424, "learning_rate": 0.00018709569670095636, "loss": 0.21143102645874023, "mean_token_accuracy": 0.9149758964776993, "num_tokens": 32380972.0, "step": 2625 }, { "entropy": 1.1955194175243378, "epoch": 1.3828330700368614, "grad_norm": 0.2797792851924896, "learning_rate": 0.00018708438051831544, "loss": 0.19557036459445953, "mean_token_accuracy": 0.921556681394577, "num_tokens": 32393308.0, "step": 2626 }, { "entropy": 1.204679548740387, "epoch": 1.383359662980516, "grad_norm": 0.2982284128665924, "learning_rate": 0.0001870730597596241, "loss": 0.19409126043319702, "mean_token_accuracy": 0.9241613745689392, "num_tokens": 32405644.0, "step": 2627 }, { "entropy": 1.2394556403160095, "epoch": 1.3838862559241707, "grad_norm": 0.27367693185806274, "learning_rate": 0.00018706173442555445, "loss": 0.19036509096622467, "mean_token_accuracy": 0.9197610020637512, "num_tokens": 32417980.0, "step": 2628 }, { "entropy": 1.1927104592323303, "epoch": 1.3844128488678251, "grad_norm": 0.2765471935272217, "learning_rate": 0.00018705040451677874, "loss": 0.19922952353954315, "mean_token_accuracy": 0.9253708273172379, "num_tokens": 32430316.0, "step": 2629 }, { "entropy": 1.192032277584076, "epoch": 1.3849394418114798, "grad_norm": 0.2959486246109009, "learning_rate": 0.0001870390700339696, "loss": 0.21350061893463135, "mean_token_accuracy": 0.915240153670311, "num_tokens": 32442652.0, "step": 2630 }, { "entropy": 1.21938955783844, "epoch": 1.3854660347551344, "grad_norm": 0.2759414613246918, "learning_rate": 0.00018702773097779992, "loss": 0.20076552033424377, "mean_token_accuracy": 0.9171973913908005, "num_tokens": 32454988.0, "step": 2631 }, { "entropy": 1.1680685877799988, "epoch": 1.3859926276987888, "grad_norm": 0.23211334645748138, "learning_rate": 0.00018701638734894277, "loss": 0.16931575536727905, "mean_token_accuracy": 0.9348405301570892, "num_tokens": 32467324.0, "step": 2632 }, { "entropy": 1.2244385778903961, "epoch": 1.3865192206424433, "grad_norm": 0.3211120367050171, "learning_rate": 0.0001870050391480716, "loss": 0.22183112800121307, "mean_token_accuracy": 0.9124436974525452, "num_tokens": 32479660.0, "step": 2633 }, { "entropy": 1.1737190783023834, "epoch": 1.387045813586098, "grad_norm": 0.29617705941200256, "learning_rate": 0.00018699368637586008, "loss": 0.22190259397029877, "mean_token_accuracy": 0.9131051301956177, "num_tokens": 32491996.0, "step": 2634 }, { "entropy": 1.217042326927185, "epoch": 1.3875724065297526, "grad_norm": 0.32766997814178467, "learning_rate": 0.00018698232903298215, "loss": 0.19216807186603546, "mean_token_accuracy": 0.9217599779367447, "num_tokens": 32504332.0, "step": 2635 }, { "entropy": 1.2256495356559753, "epoch": 1.388098999473407, "grad_norm": 0.286161333322525, "learning_rate": 0.00018697096712011203, "loss": 0.1934540718793869, "mean_token_accuracy": 0.9223566651344299, "num_tokens": 32516668.0, "step": 2636 }, { "entropy": 1.1700023114681244, "epoch": 1.3886255924170616, "grad_norm": 0.2702758014202118, "learning_rate": 0.00018695960063792421, "loss": 0.2006986141204834, "mean_token_accuracy": 0.9158665686845779, "num_tokens": 32529004.0, "step": 2637 }, { "entropy": 1.1851938664913177, "epoch": 1.3891521853607163, "grad_norm": 0.2678104639053345, "learning_rate": 0.00018694822958709346, "loss": 0.1974492073059082, "mean_token_accuracy": 0.9265509694814682, "num_tokens": 32541340.0, "step": 2638 }, { "entropy": 1.1814790070056915, "epoch": 1.3896787783043707, "grad_norm": 0.2913559079170227, "learning_rate": 0.00018693685396829483, "loss": 0.20490042865276337, "mean_token_accuracy": 0.911860391497612, "num_tokens": 32553676.0, "step": 2639 }, { "entropy": 1.1520279347896576, "epoch": 1.3902053712480253, "grad_norm": 0.3147750496864319, "learning_rate": 0.00018692547378220358, "loss": 0.20494982600212097, "mean_token_accuracy": 0.9163292199373245, "num_tokens": 32566012.0, "step": 2640 }, { "entropy": 1.1539938151836395, "epoch": 1.3907319641916798, "grad_norm": 0.27995991706848145, "learning_rate": 0.0001869140890294953, "loss": 0.19520774483680725, "mean_token_accuracy": 0.9176739156246185, "num_tokens": 32578348.0, "step": 2641 }, { "entropy": 1.1977797150611877, "epoch": 1.3912585571353344, "grad_norm": 0.2937062978744507, "learning_rate": 0.00018690269971084587, "loss": 0.20538851618766785, "mean_token_accuracy": 0.9172974228858948, "num_tokens": 32590684.0, "step": 2642 }, { "entropy": 1.187753289937973, "epoch": 1.3917851500789888, "grad_norm": 0.2842217683792114, "learning_rate": 0.00018689130582693136, "loss": 0.2011350840330124, "mean_token_accuracy": 0.9161236584186554, "num_tokens": 32603020.0, "step": 2643 }, { "entropy": 1.1970960795879364, "epoch": 1.3923117430226435, "grad_norm": 0.2834356129169464, "learning_rate": 0.00018687990737842818, "loss": 0.20202001929283142, "mean_token_accuracy": 0.920697346329689, "num_tokens": 32615356.0, "step": 2644 }, { "entropy": 1.1325391829013824, "epoch": 1.3928383359662981, "grad_norm": 0.2595110833644867, "learning_rate": 0.00018686850436601298, "loss": 0.17119885981082916, "mean_token_accuracy": 0.9274217188358307, "num_tokens": 32627692.0, "step": 2645 }, { "entropy": 1.203096479177475, "epoch": 1.3933649289099526, "grad_norm": 0.28552207350730896, "learning_rate": 0.00018685709679036272, "loss": 0.1984875351190567, "mean_token_accuracy": 0.9184497147798538, "num_tokens": 32640028.0, "step": 2646 }, { "entropy": 1.2174711227416992, "epoch": 1.3938915218536072, "grad_norm": 0.3431668281555176, "learning_rate": 0.00018684568465215457, "loss": 0.23073092103004456, "mean_token_accuracy": 0.9064096510410309, "num_tokens": 32652364.0, "step": 2647 }, { "entropy": 1.1742651760578156, "epoch": 1.3944181147972619, "grad_norm": 0.2867361605167389, "learning_rate": 0.00018683426795206603, "loss": 0.20909307897090912, "mean_token_accuracy": 0.9160559475421906, "num_tokens": 32664700.0, "step": 2648 }, { "entropy": 1.1931123435497284, "epoch": 1.3949447077409163, "grad_norm": 0.27413511276245117, "learning_rate": 0.0001868228466907748, "loss": 0.1944372057914734, "mean_token_accuracy": 0.9192412346601486, "num_tokens": 32677036.0, "step": 2649 }, { "entropy": 1.200911283493042, "epoch": 1.3954713006845707, "grad_norm": 0.32713064551353455, "learning_rate": 0.0001868114208689589, "loss": 0.22633163630962372, "mean_token_accuracy": 0.9066626876592636, "num_tokens": 32689372.0, "step": 2650 }, { "entropy": 1.173728585243225, "epoch": 1.3959978936282254, "grad_norm": 0.2703946828842163, "learning_rate": 0.00018679999048729667, "loss": 0.2105778455734253, "mean_token_accuracy": 0.9153214693069458, "num_tokens": 32701708.0, "step": 2651 }, { "entropy": 1.2183512151241302, "epoch": 1.39652448657188, "grad_norm": 0.2865394651889801, "learning_rate": 0.00018678855554646665, "loss": 0.19708535075187683, "mean_token_accuracy": 0.9225267171859741, "num_tokens": 32714044.0, "step": 2652 }, { "entropy": 1.2178658246994019, "epoch": 1.3970510795155344, "grad_norm": 0.2824452519416809, "learning_rate": 0.00018677711604714762, "loss": 0.22327733039855957, "mean_token_accuracy": 0.9088855236768723, "num_tokens": 32726380.0, "step": 2653 }, { "entropy": 1.2230781316757202, "epoch": 1.397577672459189, "grad_norm": 0.2827853560447693, "learning_rate": 0.00018676567199001868, "loss": 0.19934280216693878, "mean_token_accuracy": 0.9177891463041306, "num_tokens": 32738716.0, "step": 2654 }, { "entropy": 1.1976493299007416, "epoch": 1.3981042654028437, "grad_norm": 0.26556023955345154, "learning_rate": 0.00018675422337575926, "loss": 0.2057933360338211, "mean_token_accuracy": 0.918548509478569, "num_tokens": 32751052.0, "step": 2655 }, { "entropy": 1.2001135349273682, "epoch": 1.3986308583464981, "grad_norm": 0.2884269058704376, "learning_rate": 0.0001867427702050489, "loss": 0.20356959104537964, "mean_token_accuracy": 0.9222962260246277, "num_tokens": 32763388.0, "step": 2656 }, { "entropy": 1.206467181444168, "epoch": 1.3991574512901528, "grad_norm": 0.2789088189601898, "learning_rate": 0.0001867313124785676, "loss": 0.200584277510643, "mean_token_accuracy": 0.9238597601652145, "num_tokens": 32775724.0, "step": 2657 }, { "entropy": 1.1685158610343933, "epoch": 1.3996840442338072, "grad_norm": 0.262813001871109, "learning_rate": 0.00018671985019699553, "loss": 0.19860176742076874, "mean_token_accuracy": 0.9217494130134583, "num_tokens": 32788060.0, "step": 2658 }, { "entropy": 1.1696327328681946, "epoch": 1.4002106371774619, "grad_norm": 0.2782774865627289, "learning_rate": 0.00018670838336101308, "loss": 0.20912325382232666, "mean_token_accuracy": 0.9155998378992081, "num_tokens": 32800396.0, "step": 2659 }, { "entropy": 1.1536991596221924, "epoch": 1.4007372301211163, "grad_norm": 0.2786557972431183, "learning_rate": 0.00018669691197130097, "loss": 0.1923229843378067, "mean_token_accuracy": 0.9198986142873764, "num_tokens": 32812732.0, "step": 2660 }, { "entropy": 1.1637346744537354, "epoch": 1.401263823064771, "grad_norm": 0.2913641035556793, "learning_rate": 0.00018668543602854028, "loss": 0.19935357570648193, "mean_token_accuracy": 0.91521255671978, "num_tokens": 32825068.0, "step": 2661 }, { "entropy": 1.1952362954616547, "epoch": 1.4017904160084256, "grad_norm": 0.27064937353134155, "learning_rate": 0.00018667395553341213, "loss": 0.19324931502342224, "mean_token_accuracy": 0.9230464100837708, "num_tokens": 32837404.0, "step": 2662 }, { "entropy": 1.172296166419983, "epoch": 1.40231700895208, "grad_norm": 0.2844633162021637, "learning_rate": 0.0001866624704865982, "loss": 0.21573956310749054, "mean_token_accuracy": 0.9178134202957153, "num_tokens": 32849740.0, "step": 2663 }, { "entropy": 1.1426364183425903, "epoch": 1.4028436018957346, "grad_norm": 0.2857990860939026, "learning_rate": 0.0001866509808887802, "loss": 0.19915884733200073, "mean_token_accuracy": 0.919086143374443, "num_tokens": 32862076.0, "step": 2664 }, { "entropy": 1.1875398755073547, "epoch": 1.403370194839389, "grad_norm": 0.29901546239852905, "learning_rate": 0.00018663948674064025, "loss": 0.2148965746164322, "mean_token_accuracy": 0.9187829047441483, "num_tokens": 32874412.0, "step": 2665 }, { "entropy": 1.1802086234092712, "epoch": 1.4038967877830437, "grad_norm": 0.30026695132255554, "learning_rate": 0.0001866279880428606, "loss": 0.21468932926654816, "mean_token_accuracy": 0.9141033738851547, "num_tokens": 32886748.0, "step": 2666 }, { "entropy": 1.231868177652359, "epoch": 1.4044233807266981, "grad_norm": 0.3457041382789612, "learning_rate": 0.00018661648479612397, "loss": 0.21766367554664612, "mean_token_accuracy": 0.9147387742996216, "num_tokens": 32899084.0, "step": 2667 }, { "entropy": 1.1672147512435913, "epoch": 1.4049499736703528, "grad_norm": 0.29802289605140686, "learning_rate": 0.00018660497700111317, "loss": 0.1930084526538849, "mean_token_accuracy": 0.9234433770179749, "num_tokens": 32911420.0, "step": 2668 }, { "entropy": 1.2288798391819, "epoch": 1.4054765666140074, "grad_norm": 0.2817768454551697, "learning_rate": 0.00018659346465851138, "loss": 0.2119956761598587, "mean_token_accuracy": 0.9163240343332291, "num_tokens": 32923756.0, "step": 2669 }, { "entropy": 1.2406794726848602, "epoch": 1.4060031595576619, "grad_norm": 0.3248741030693054, "learning_rate": 0.000186581947769002, "loss": 0.21822670102119446, "mean_token_accuracy": 0.9133480787277222, "num_tokens": 32936092.0, "step": 2670 }, { "entropy": 1.1928761005401611, "epoch": 1.4065297525013165, "grad_norm": 0.29017162322998047, "learning_rate": 0.00018657042633326876, "loss": 0.19945287704467773, "mean_token_accuracy": 0.921704575419426, "num_tokens": 32948428.0, "step": 2671 }, { "entropy": 1.2523100972175598, "epoch": 1.4070563454449712, "grad_norm": 0.2896433174610138, "learning_rate": 0.00018655890035199557, "loss": 0.20614881813526154, "mean_token_accuracy": 0.9159245640039444, "num_tokens": 32960764.0, "step": 2672 }, { "entropy": 1.2614913880825043, "epoch": 1.4075829383886256, "grad_norm": 0.2920669615268707, "learning_rate": 0.0001865473698258667, "loss": 0.2224857062101364, "mean_token_accuracy": 0.9055542200803757, "num_tokens": 32973100.0, "step": 2673 }, { "entropy": 1.2949616014957428, "epoch": 1.4081095313322802, "grad_norm": 0.3054332435131073, "learning_rate": 0.00018653583475556663, "loss": 0.20840829610824585, "mean_token_accuracy": 0.9158879816532135, "num_tokens": 32985436.0, "step": 2674 }, { "entropy": 1.3014479279518127, "epoch": 1.4086361242759347, "grad_norm": 0.293302059173584, "learning_rate": 0.00018652429514178016, "loss": 0.2146826684474945, "mean_token_accuracy": 0.9126481860876083, "num_tokens": 32997772.0, "step": 2675 }, { "entropy": 1.3077419102191925, "epoch": 1.4091627172195893, "grad_norm": 0.2812763750553131, "learning_rate": 0.00018651275098519228, "loss": 0.2168470174074173, "mean_token_accuracy": 0.9146820157766342, "num_tokens": 33010108.0, "step": 2676 }, { "entropy": 1.3591797947883606, "epoch": 1.4096893101632437, "grad_norm": 0.27339309453964233, "learning_rate": 0.0001865012022864883, "loss": 0.2067457139492035, "mean_token_accuracy": 0.910685271024704, "num_tokens": 33022444.0, "step": 2677 }, { "entropy": 1.3165797293186188, "epoch": 1.4102159031068984, "grad_norm": 0.26994794607162476, "learning_rate": 0.00018648964904635388, "loss": 0.20063388347625732, "mean_token_accuracy": 0.915714293718338, "num_tokens": 33034780.0, "step": 2678 }, { "entropy": 1.350212275981903, "epoch": 1.410742496050553, "grad_norm": 0.26788488030433655, "learning_rate": 0.00018647809126547476, "loss": 0.2082659900188446, "mean_token_accuracy": 0.9163226187229156, "num_tokens": 33047116.0, "step": 2679 }, { "entropy": 1.3494655191898346, "epoch": 1.4112690889942074, "grad_norm": 0.3014771342277527, "learning_rate": 0.00018646652894453714, "loss": 0.2213258445262909, "mean_token_accuracy": 0.9125747829675674, "num_tokens": 33059452.0, "step": 2680 }, { "entropy": 1.3585596978664398, "epoch": 1.411795681937862, "grad_norm": 0.2993260324001312, "learning_rate": 0.00018645496208422738, "loss": 0.23662728071212769, "mean_token_accuracy": 0.9095396250486374, "num_tokens": 33071788.0, "step": 2681 }, { "entropy": 1.2951436042785645, "epoch": 1.4123222748815165, "grad_norm": 0.28097495436668396, "learning_rate": 0.00018644339068523208, "loss": 0.19883355498313904, "mean_token_accuracy": 0.9165204763412476, "num_tokens": 33084124.0, "step": 2682 }, { "entropy": 1.2786961197853088, "epoch": 1.4128488678251712, "grad_norm": 0.31551140546798706, "learning_rate": 0.00018643181474823828, "loss": 0.22398042678833008, "mean_token_accuracy": 0.9099626541137695, "num_tokens": 33096460.0, "step": 2683 }, { "entropy": 1.353494018316269, "epoch": 1.4133754607688256, "grad_norm": 0.27544382214546204, "learning_rate": 0.00018642023427393312, "loss": 0.19528742134571075, "mean_token_accuracy": 0.9221656024456024, "num_tokens": 33108796.0, "step": 2684 }, { "entropy": 1.3157804608345032, "epoch": 1.4139020537124802, "grad_norm": 0.26549386978149414, "learning_rate": 0.00018640864926300403, "loss": 0.1861998438835144, "mean_token_accuracy": 0.924147367477417, "num_tokens": 33121132.0, "step": 2685 }, { "entropy": 1.2875000834465027, "epoch": 1.4144286466561349, "grad_norm": 0.3759959042072296, "learning_rate": 0.00018639705971613878, "loss": 0.1876804083585739, "mean_token_accuracy": 0.9247392117977142, "num_tokens": 33133468.0, "step": 2686 }, { "entropy": 1.278031587600708, "epoch": 1.4149552395997893, "grad_norm": 0.2772931456565857, "learning_rate": 0.00018638546563402538, "loss": 0.1913738250732422, "mean_token_accuracy": 0.9191721677780151, "num_tokens": 33145804.0, "step": 2687 }, { "entropy": 1.3772215843200684, "epoch": 1.415481832543444, "grad_norm": 0.32579630613327026, "learning_rate": 0.00018637386701735208, "loss": 0.20003564655780792, "mean_token_accuracy": 0.9227780699729919, "num_tokens": 33158140.0, "step": 2688 }, { "entropy": 1.330332100391388, "epoch": 1.4160084254870986, "grad_norm": 0.3118603229522705, "learning_rate": 0.00018636226386680748, "loss": 0.1903379112482071, "mean_token_accuracy": 0.9189924746751785, "num_tokens": 33170476.0, "step": 2689 }, { "entropy": 1.3054493367671967, "epoch": 1.416535018430753, "grad_norm": 0.4101371467113495, "learning_rate": 0.0001863506561830803, "loss": 0.2160140872001648, "mean_token_accuracy": 0.9076957255601883, "num_tokens": 33182812.0, "step": 2690 }, { "entropy": 1.3156910836696625, "epoch": 1.4170616113744074, "grad_norm": 0.2924982011318207, "learning_rate": 0.0001863390439668597, "loss": 0.19913962483406067, "mean_token_accuracy": 0.9208202958106995, "num_tokens": 33195148.0, "step": 2691 }, { "entropy": 1.3482598662376404, "epoch": 1.417588204318062, "grad_norm": 0.27372100949287415, "learning_rate": 0.00018632742721883495, "loss": 0.19036367535591125, "mean_token_accuracy": 0.9198184758424759, "num_tokens": 33207484.0, "step": 2692 }, { "entropy": 1.3402643203735352, "epoch": 1.4181147972617167, "grad_norm": 0.2865314781665802, "learning_rate": 0.00018631580593969578, "loss": 0.20403306186199188, "mean_token_accuracy": 0.9174676239490509, "num_tokens": 33219820.0, "step": 2693 }, { "entropy": 1.3814849257469177, "epoch": 1.4186413902053712, "grad_norm": 0.298798531293869, "learning_rate": 0.00018630418013013199, "loss": 0.19326891005039215, "mean_token_accuracy": 0.9204562902450562, "num_tokens": 33232156.0, "step": 2694 }, { "entropy": 1.3497715592384338, "epoch": 1.4191679831490258, "grad_norm": 0.2983977794647217, "learning_rate": 0.00018629254979083372, "loss": 0.2127034068107605, "mean_token_accuracy": 0.9153210371732712, "num_tokens": 33244492.0, "step": 2695 }, { "entropy": 1.3387363851070404, "epoch": 1.4196945760926805, "grad_norm": 0.2673841714859009, "learning_rate": 0.00018628091492249149, "loss": 0.1976945847272873, "mean_token_accuracy": 0.9180579632520676, "num_tokens": 33256828.0, "step": 2696 }, { "entropy": 1.2811682224273682, "epoch": 1.4202211690363349, "grad_norm": 0.2700756788253784, "learning_rate": 0.00018626927552579592, "loss": 0.19237622618675232, "mean_token_accuracy": 0.9196698665618896, "num_tokens": 33269164.0, "step": 2697 }, { "entropy": 1.2764002978801727, "epoch": 1.4207477619799895, "grad_norm": 0.2527097463607788, "learning_rate": 0.00018625763160143796, "loss": 0.1781824678182602, "mean_token_accuracy": 0.9250129163265228, "num_tokens": 33281500.0, "step": 2698 }, { "entropy": 1.3061909675598145, "epoch": 1.421274354923644, "grad_norm": 0.27409103512763977, "learning_rate": 0.0001862459831501089, "loss": 0.1834535151720047, "mean_token_accuracy": 0.9291260540485382, "num_tokens": 33293836.0, "step": 2699 }, { "entropy": 1.4255090951919556, "epoch": 1.4218009478672986, "grad_norm": 0.35492557287216187, "learning_rate": 0.00018623433017250025, "loss": 0.2331741452217102, "mean_token_accuracy": 0.9052500277757645, "num_tokens": 33306172.0, "step": 2700 }, { "entropy": 1.3506521880626678, "epoch": 1.422327540810953, "grad_norm": 0.26301318407058716, "learning_rate": 0.0001862226726693037, "loss": 0.19686710834503174, "mean_token_accuracy": 0.9148916304111481, "num_tokens": 33318508.0, "step": 2701 }, { "entropy": 1.3578969836235046, "epoch": 1.4228541337546077, "grad_norm": 0.30393311381340027, "learning_rate": 0.00018621101064121136, "loss": 0.21072648465633392, "mean_token_accuracy": 0.9144587218761444, "num_tokens": 33330844.0, "step": 2702 }, { "entropy": 1.360473245382309, "epoch": 1.4233807266982623, "grad_norm": 0.27426621317863464, "learning_rate": 0.0001861993440889155, "loss": 0.1906125247478485, "mean_token_accuracy": 0.919151559472084, "num_tokens": 33343180.0, "step": 2703 }, { "entropy": 1.3859812319278717, "epoch": 1.4239073196419167, "grad_norm": 0.3062906861305237, "learning_rate": 0.0001861876730131087, "loss": 0.2006826102733612, "mean_token_accuracy": 0.915339469909668, "num_tokens": 33355516.0, "step": 2704 }, { "entropy": 1.3931569159030914, "epoch": 1.4244339125855714, "grad_norm": 0.27953484654426575, "learning_rate": 0.0001861759974144838, "loss": 0.20995528995990753, "mean_token_accuracy": 0.9106060713529587, "num_tokens": 33367852.0, "step": 2705 }, { "entropy": 1.4093142449855804, "epoch": 1.424960505529226, "grad_norm": 0.28498291969299316, "learning_rate": 0.00018616431729373393, "loss": 0.1967875361442566, "mean_token_accuracy": 0.9221569150686264, "num_tokens": 33380188.0, "step": 2706 }, { "entropy": 1.3485685586929321, "epoch": 1.4254870984728805, "grad_norm": 0.299116849899292, "learning_rate": 0.00018615263265155246, "loss": 0.20301219820976257, "mean_token_accuracy": 0.9173270463943481, "num_tokens": 33392524.0, "step": 2707 }, { "entropy": 1.3589564263820648, "epoch": 1.426013691416535, "grad_norm": 0.2964306175708771, "learning_rate": 0.00018614094348863306, "loss": 0.19253556430339813, "mean_token_accuracy": 0.9231040179729462, "num_tokens": 33404860.0, "step": 2708 }, { "entropy": 1.3823421597480774, "epoch": 1.4265402843601895, "grad_norm": 0.34210389852523804, "learning_rate": 0.0001861292498056696, "loss": 0.2110666185617447, "mean_token_accuracy": 0.9131441861391068, "num_tokens": 33417196.0, "step": 2709 }, { "entropy": 1.3455529510974884, "epoch": 1.4270668773038442, "grad_norm": 0.2749879062175751, "learning_rate": 0.00018611755160335633, "loss": 0.17992670834064484, "mean_token_accuracy": 0.9268961399793625, "num_tokens": 33429532.0, "step": 2710 }, { "entropy": 1.3250888884067535, "epoch": 1.4275934702474986, "grad_norm": 0.30342763662338257, "learning_rate": 0.00018610584888238764, "loss": 0.21458712220191956, "mean_token_accuracy": 0.9091243892908096, "num_tokens": 33441868.0, "step": 2711 }, { "entropy": 1.2988539934158325, "epoch": 1.4281200631911533, "grad_norm": 0.279607355594635, "learning_rate": 0.00018609414164345829, "loss": 0.1852928102016449, "mean_token_accuracy": 0.9220867305994034, "num_tokens": 33454204.0, "step": 2712 }, { "entropy": 1.314719408750534, "epoch": 1.428646656134808, "grad_norm": 0.28591296076774597, "learning_rate": 0.00018608242988726325, "loss": 0.17573139071464539, "mean_token_accuracy": 0.9259963184595108, "num_tokens": 33466540.0, "step": 2713 }, { "entropy": 1.2993620932102203, "epoch": 1.4291732490784623, "grad_norm": 0.2799248695373535, "learning_rate": 0.00018607071361449783, "loss": 0.21279355883598328, "mean_token_accuracy": 0.9184603095054626, "num_tokens": 33478876.0, "step": 2714 }, { "entropy": 1.2804417610168457, "epoch": 1.429699842022117, "grad_norm": 0.27112871408462524, "learning_rate": 0.00018605899282585743, "loss": 0.2066880762577057, "mean_token_accuracy": 0.9143773913383484, "num_tokens": 33491212.0, "step": 2715 }, { "entropy": 1.3299663960933685, "epoch": 1.4302264349657714, "grad_norm": 0.2755028009414673, "learning_rate": 0.000186047267522038, "loss": 0.20685116946697235, "mean_token_accuracy": 0.9201144576072693, "num_tokens": 33503548.0, "step": 2716 }, { "entropy": 1.2998407185077667, "epoch": 1.430753027909426, "grad_norm": 0.2707025408744812, "learning_rate": 0.00018603553770373552, "loss": 0.19559168815612793, "mean_token_accuracy": 0.9165090620517731, "num_tokens": 33515884.0, "step": 2717 }, { "entropy": 1.3012645542621613, "epoch": 1.4312796208530805, "grad_norm": 0.2650182247161865, "learning_rate": 0.00018602380337164634, "loss": 0.17805761098861694, "mean_token_accuracy": 0.9261130839586258, "num_tokens": 33528220.0, "step": 2718 }, { "entropy": 1.2708977460861206, "epoch": 1.4318062137967351, "grad_norm": 0.27006566524505615, "learning_rate": 0.00018601206452646706, "loss": 0.18752358853816986, "mean_token_accuracy": 0.9268027991056442, "num_tokens": 33540556.0, "step": 2719 }, { "entropy": 1.2761503458023071, "epoch": 1.4323328067403898, "grad_norm": 0.2888233959674835, "learning_rate": 0.00018600032116889453, "loss": 0.2155730128288269, "mean_token_accuracy": 0.9141710996627808, "num_tokens": 33552892.0, "step": 2720 }, { "entropy": 1.2359469830989838, "epoch": 1.4328593996840442, "grad_norm": 0.29737192392349243, "learning_rate": 0.00018598857329962587, "loss": 0.21056918799877167, "mean_token_accuracy": 0.9146129190921783, "num_tokens": 33565228.0, "step": 2721 }, { "entropy": 1.188820868730545, "epoch": 1.4333859926276988, "grad_norm": 0.303146630525589, "learning_rate": 0.00018597682091935856, "loss": 0.202779620885849, "mean_token_accuracy": 0.9155432283878326, "num_tokens": 33577564.0, "step": 2722 }, { "entropy": 1.2396386861801147, "epoch": 1.4339125855713535, "grad_norm": 0.2838284969329834, "learning_rate": 0.00018596506402879018, "loss": 0.2013065367937088, "mean_token_accuracy": 0.9150380194187164, "num_tokens": 33589900.0, "step": 2723 }, { "entropy": 1.2167082726955414, "epoch": 1.434439178515008, "grad_norm": 0.28906625509262085, "learning_rate": 0.0001859533026286187, "loss": 0.21567818522453308, "mean_token_accuracy": 0.9125472903251648, "num_tokens": 33602236.0, "step": 2724 }, { "entropy": 1.2206608951091766, "epoch": 1.4349657714586623, "grad_norm": 0.27452901005744934, "learning_rate": 0.00018594153671954236, "loss": 0.22003887593746185, "mean_token_accuracy": 0.9081568866968155, "num_tokens": 33614572.0, "step": 2725 }, { "entropy": 1.2153219878673553, "epoch": 1.435492364402317, "grad_norm": 0.28818845748901367, "learning_rate": 0.0001859297663022596, "loss": 0.21699745953083038, "mean_token_accuracy": 0.9116252958774567, "num_tokens": 33626908.0, "step": 2726 }, { "entropy": 1.2302789092063904, "epoch": 1.4360189573459716, "grad_norm": 0.2688583433628082, "learning_rate": 0.00018591799137746915, "loss": 0.19513952732086182, "mean_token_accuracy": 0.922428548336029, "num_tokens": 33639244.0, "step": 2727 }, { "entropy": 1.2083250284194946, "epoch": 1.436545550289626, "grad_norm": 0.2625478506088257, "learning_rate": 0.00018590621194587007, "loss": 0.20137974619865417, "mean_token_accuracy": 0.9156837463378906, "num_tokens": 33651580.0, "step": 2728 }, { "entropy": 1.251519650220871, "epoch": 1.4370721432332807, "grad_norm": 0.29624244570732117, "learning_rate": 0.00018589442800816158, "loss": 0.2012304663658142, "mean_token_accuracy": 0.9153359830379486, "num_tokens": 33663916.0, "step": 2729 }, { "entropy": 1.2322251498699188, "epoch": 1.4375987361769353, "grad_norm": 0.2729564309120178, "learning_rate": 0.00018588263956504327, "loss": 0.1936715543270111, "mean_token_accuracy": 0.9187065362930298, "num_tokens": 33676252.0, "step": 2730 }, { "entropy": 1.263836681842804, "epoch": 1.4381253291205898, "grad_norm": 0.2771749198436737, "learning_rate": 0.00018587084661721487, "loss": 0.19794949889183044, "mean_token_accuracy": 0.9143384546041489, "num_tokens": 33688588.0, "step": 2731 }, { "entropy": 1.2738985121250153, "epoch": 1.4386519220642444, "grad_norm": 0.30315807461738586, "learning_rate": 0.00018585904916537655, "loss": 0.20564697682857513, "mean_token_accuracy": 0.9139324128627777, "num_tokens": 33700924.0, "step": 2732 }, { "entropy": 1.2370990812778473, "epoch": 1.4391785150078988, "grad_norm": 0.3091336488723755, "learning_rate": 0.0001858472472102286, "loss": 0.2253596931695938, "mean_token_accuracy": 0.9058148860931396, "num_tokens": 33713260.0, "step": 2733 }, { "entropy": 1.2049230933189392, "epoch": 1.4397051079515535, "grad_norm": 0.2731562554836273, "learning_rate": 0.0001858354407524717, "loss": 0.18417584896087646, "mean_token_accuracy": 0.9258820116519928, "num_tokens": 33725596.0, "step": 2734 }, { "entropy": 1.187551736831665, "epoch": 1.440231700895208, "grad_norm": 0.27385076880455017, "learning_rate": 0.00018582362979280666, "loss": 0.1865832656621933, "mean_token_accuracy": 0.9226599186658859, "num_tokens": 33737932.0, "step": 2735 }, { "entropy": 1.286464512348175, "epoch": 1.4407582938388626, "grad_norm": 0.31394457817077637, "learning_rate": 0.00018581181433193465, "loss": 0.2028738260269165, "mean_token_accuracy": 0.923179104924202, "num_tokens": 33750268.0, "step": 2736 }, { "entropy": 1.2562143802642822, "epoch": 1.4412848867825172, "grad_norm": 0.2848510146141052, "learning_rate": 0.0001857999943705571, "loss": 0.19614958763122559, "mean_token_accuracy": 0.9193147718906403, "num_tokens": 33762604.0, "step": 2737 }, { "entropy": 1.1915212869644165, "epoch": 1.4418114797261716, "grad_norm": 0.28245916962623596, "learning_rate": 0.00018578816990937568, "loss": 0.2020082175731659, "mean_token_accuracy": 0.9246124476194382, "num_tokens": 33774940.0, "step": 2738 }, { "entropy": 1.1338683068752289, "epoch": 1.4423380726698263, "grad_norm": 0.2531015872955322, "learning_rate": 0.0001857763409490923, "loss": 0.19030161201953888, "mean_token_accuracy": 0.9210085272789001, "num_tokens": 33787276.0, "step": 2739 }, { "entropy": 1.1661230623722076, "epoch": 1.4428646656134807, "grad_norm": 0.2816557288169861, "learning_rate": 0.00018576450749040925, "loss": 0.19968748092651367, "mean_token_accuracy": 0.9191047251224518, "num_tokens": 33799612.0, "step": 2740 }, { "entropy": 1.226789653301239, "epoch": 1.4433912585571353, "grad_norm": 0.2743048369884491, "learning_rate": 0.00018575266953402896, "loss": 0.2070472538471222, "mean_token_accuracy": 0.9168623089790344, "num_tokens": 33811948.0, "step": 2741 }, { "entropy": 1.226866990327835, "epoch": 1.4439178515007898, "grad_norm": 0.27064448595046997, "learning_rate": 0.00018574082708065423, "loss": 0.19173914194107056, "mean_token_accuracy": 0.9202168434858322, "num_tokens": 33824284.0, "step": 2742 }, { "entropy": 1.1833116710186005, "epoch": 1.4444444444444444, "grad_norm": 0.2748906910419464, "learning_rate": 0.00018572898013098803, "loss": 0.20692995190620422, "mean_token_accuracy": 0.9154257923364639, "num_tokens": 33836620.0, "step": 2743 }, { "entropy": 1.2158693671226501, "epoch": 1.444971037388099, "grad_norm": 0.28100040555000305, "learning_rate": 0.00018571712868573368, "loss": 0.19965311884880066, "mean_token_accuracy": 0.9194239974021912, "num_tokens": 33848956.0, "step": 2744 }, { "entropy": 1.1900866031646729, "epoch": 1.4454976303317535, "grad_norm": 0.24971705675125122, "learning_rate": 0.00018570527274559468, "loss": 0.19126318395137787, "mean_token_accuracy": 0.9166027456521988, "num_tokens": 33861292.0, "step": 2745 }, { "entropy": 1.2365811467170715, "epoch": 1.4460242232754081, "grad_norm": 0.2837916612625122, "learning_rate": 0.0001856934123112749, "loss": 0.21584585309028625, "mean_token_accuracy": 0.9098552912473679, "num_tokens": 33873628.0, "step": 2746 }, { "entropy": 1.177088737487793, "epoch": 1.4465508162190628, "grad_norm": 0.25515440106391907, "learning_rate": 0.00018568154738347837, "loss": 0.18173626065254211, "mean_token_accuracy": 0.9271458983421326, "num_tokens": 33885964.0, "step": 2747 }, { "entropy": 1.1429234147071838, "epoch": 1.4470774091627172, "grad_norm": 0.25770071148872375, "learning_rate": 0.00018566967796290954, "loss": 0.19852091372013092, "mean_token_accuracy": 0.9165006726980209, "num_tokens": 33898300.0, "step": 2748 }, { "entropy": 1.1901302635669708, "epoch": 1.4476040021063719, "grad_norm": 0.2882276177406311, "learning_rate": 0.00018565780405027294, "loss": 0.2006741464138031, "mean_token_accuracy": 0.9199828803539276, "num_tokens": 33910636.0, "step": 2749 }, { "entropy": 1.1173346042633057, "epoch": 1.4481305950500263, "grad_norm": 0.2821039855480194, "learning_rate": 0.00018564592564627346, "loss": 0.2002512663602829, "mean_token_accuracy": 0.9197804033756256, "num_tokens": 33922972.0, "step": 2750 }, { "entropy": 1.1957898437976837, "epoch": 1.448657187993681, "grad_norm": 0.2622511684894562, "learning_rate": 0.0001856340427516163, "loss": 0.18590982258319855, "mean_token_accuracy": 0.9213429242372513, "num_tokens": 33935308.0, "step": 2751 }, { "entropy": 1.1354258060455322, "epoch": 1.4491837809373354, "grad_norm": 0.29836171865463257, "learning_rate": 0.00018562215536700684, "loss": 0.21873271465301514, "mean_token_accuracy": 0.9166739583015442, "num_tokens": 33947644.0, "step": 2752 }, { "entropy": 1.1251291930675507, "epoch": 1.44971037388099, "grad_norm": 0.28312045335769653, "learning_rate": 0.00018561026349315075, "loss": 0.1926782727241516, "mean_token_accuracy": 0.9215989857912064, "num_tokens": 33959980.0, "step": 2753 }, { "entropy": 1.1114425361156464, "epoch": 1.4502369668246446, "grad_norm": 0.2983197569847107, "learning_rate": 0.00018559836713075408, "loss": 0.20771543681621552, "mean_token_accuracy": 0.9185106605291367, "num_tokens": 33972316.0, "step": 2754 }, { "entropy": 1.137503057718277, "epoch": 1.450763559768299, "grad_norm": 0.2714558243751526, "learning_rate": 0.0001855864662805229, "loss": 0.20167207717895508, "mean_token_accuracy": 0.915928527712822, "num_tokens": 33984652.0, "step": 2755 }, { "entropy": 1.1457951962947845, "epoch": 1.4512901527119537, "grad_norm": 0.2937759459018707, "learning_rate": 0.00018557456094316378, "loss": 0.2275719940662384, "mean_token_accuracy": 0.9085268825292587, "num_tokens": 33996988.0, "step": 2756 }, { "entropy": 1.1622550189495087, "epoch": 1.4518167456556081, "grad_norm": 0.28541475534439087, "learning_rate": 0.00018556265111938346, "loss": 0.2119087278842926, "mean_token_accuracy": 0.9126318097114563, "num_tokens": 34009324.0, "step": 2757 }, { "entropy": 1.1782312989234924, "epoch": 1.4523433385992628, "grad_norm": 0.2765743136405945, "learning_rate": 0.000185550736809889, "loss": 0.2087940275669098, "mean_token_accuracy": 0.917047530412674, "num_tokens": 34021660.0, "step": 2758 }, { "entropy": 1.1760065853595734, "epoch": 1.4528699315429172, "grad_norm": 0.3112678527832031, "learning_rate": 0.0001855388180153876, "loss": 0.22077929973602295, "mean_token_accuracy": 0.9056372046470642, "num_tokens": 34033996.0, "step": 2759 }, { "entropy": 1.15424644947052, "epoch": 1.4533965244865719, "grad_norm": 0.2751659154891968, "learning_rate": 0.00018552689473658683, "loss": 0.1892865151166916, "mean_token_accuracy": 0.9226154536008835, "num_tokens": 34046332.0, "step": 2760 }, { "entropy": 1.1498244404792786, "epoch": 1.4539231174302265, "grad_norm": 0.286650687456131, "learning_rate": 0.00018551496697419458, "loss": 0.20391809940338135, "mean_token_accuracy": 0.9146721214056015, "num_tokens": 34058668.0, "step": 2761 }, { "entropy": 1.1243232488632202, "epoch": 1.454449710373881, "grad_norm": 0.27432703971862793, "learning_rate": 0.0001855030347289188, "loss": 0.20199985802173615, "mean_token_accuracy": 0.9169850200414658, "num_tokens": 34071004.0, "step": 2762 }, { "entropy": 1.0830981135368347, "epoch": 1.4549763033175356, "grad_norm": 0.2619624137878418, "learning_rate": 0.00018549109800146797, "loss": 0.20818959176540375, "mean_token_accuracy": 0.9124700576066971, "num_tokens": 34083340.0, "step": 2763 }, { "entropy": 1.1054499447345734, "epoch": 1.4555028962611902, "grad_norm": 0.2768312692642212, "learning_rate": 0.00018547915679255063, "loss": 0.21730467677116394, "mean_token_accuracy": 0.9118637144565582, "num_tokens": 34095676.0, "step": 2764 }, { "entropy": 1.0992402136325836, "epoch": 1.4560294892048447, "grad_norm": 0.27909815311431885, "learning_rate": 0.0001854672111028757, "loss": 0.21124142408370972, "mean_token_accuracy": 0.9161806106567383, "num_tokens": 34108012.0, "step": 2765 }, { "entropy": 1.097431093454361, "epoch": 1.456556082148499, "grad_norm": 0.2552739083766937, "learning_rate": 0.0001854552609331523, "loss": 0.19730296730995178, "mean_token_accuracy": 0.9189020395278931, "num_tokens": 34120348.0, "step": 2766 }, { "entropy": 1.0860483348369598, "epoch": 1.4570826750921537, "grad_norm": 0.25408875942230225, "learning_rate": 0.0001854433062840898, "loss": 0.1871172934770584, "mean_token_accuracy": 0.9257505685091019, "num_tokens": 34132684.0, "step": 2767 }, { "entropy": 1.1571218967437744, "epoch": 1.4576092680358084, "grad_norm": 0.27546441555023193, "learning_rate": 0.00018543134715639796, "loss": 0.21564674377441406, "mean_token_accuracy": 0.9180003553628922, "num_tokens": 34145020.0, "step": 2768 }, { "entropy": 1.1057285368442535, "epoch": 1.4581358609794628, "grad_norm": 0.28240835666656494, "learning_rate": 0.00018541938355078668, "loss": 0.206221804022789, "mean_token_accuracy": 0.9218368530273438, "num_tokens": 34157356.0, "step": 2769 }, { "entropy": 1.103806346654892, "epoch": 1.4586624539231174, "grad_norm": 0.2811862826347351, "learning_rate": 0.00018540741546796616, "loss": 0.21019676327705383, "mean_token_accuracy": 0.9138357639312744, "num_tokens": 34169692.0, "step": 2770 }, { "entropy": 1.0941491723060608, "epoch": 1.459189046866772, "grad_norm": 0.2942333221435547, "learning_rate": 0.00018539544290864692, "loss": 0.21564032137393951, "mean_token_accuracy": 0.9101224541664124, "num_tokens": 34182028.0, "step": 2771 }, { "entropy": 1.1355141997337341, "epoch": 1.4597156398104265, "grad_norm": 0.275642991065979, "learning_rate": 0.00018538346587353965, "loss": 0.1873530000448227, "mean_token_accuracy": 0.9246546924114227, "num_tokens": 34194364.0, "step": 2772 }, { "entropy": 1.1305597126483917, "epoch": 1.4602422327540812, "grad_norm": 0.2881714105606079, "learning_rate": 0.0001853714843633554, "loss": 0.2074936330318451, "mean_token_accuracy": 0.9153118878602982, "num_tokens": 34206700.0, "step": 2773 }, { "entropy": 1.1241107285022736, "epoch": 1.4607688256977356, "grad_norm": 0.2789553999900818, "learning_rate": 0.00018535949837880539, "loss": 0.2105862945318222, "mean_token_accuracy": 0.9097577780485153, "num_tokens": 34219036.0, "step": 2774 }, { "entropy": 1.160140573978424, "epoch": 1.4612954186413902, "grad_norm": 0.28768390417099, "learning_rate": 0.00018534750792060123, "loss": 0.22017565369606018, "mean_token_accuracy": 0.9114931225776672, "num_tokens": 34231372.0, "step": 2775 }, { "entropy": 1.1482027173042297, "epoch": 1.4618220115850447, "grad_norm": 0.2865487039089203, "learning_rate": 0.00018533551298945467, "loss": 0.2026289850473404, "mean_token_accuracy": 0.9202168434858322, "num_tokens": 34243708.0, "step": 2776 }, { "entropy": 1.1577872037887573, "epoch": 1.4623486045286993, "grad_norm": 0.2701823115348816, "learning_rate": 0.00018532351358607776, "loss": 0.19837477803230286, "mean_token_accuracy": 0.9212843328714371, "num_tokens": 34256044.0, "step": 2777 }, { "entropy": 1.1805611550807953, "epoch": 1.462875197472354, "grad_norm": 0.26425090432167053, "learning_rate": 0.0001853115097111829, "loss": 0.19171418249607086, "mean_token_accuracy": 0.9227536916732788, "num_tokens": 34268380.0, "step": 2778 }, { "entropy": 1.148007869720459, "epoch": 1.4634017904160084, "grad_norm": 0.2617400586605072, "learning_rate": 0.00018529950136548265, "loss": 0.20737731456756592, "mean_token_accuracy": 0.9154264628887177, "num_tokens": 34280716.0, "step": 2779 }, { "entropy": 1.1435377299785614, "epoch": 1.463928383359663, "grad_norm": 0.30841219425201416, "learning_rate": 0.0001852874885496899, "loss": 0.19211293756961823, "mean_token_accuracy": 0.9231193363666534, "num_tokens": 34293052.0, "step": 2780 }, { "entropy": 1.139043003320694, "epoch": 1.4644549763033177, "grad_norm": 0.27137625217437744, "learning_rate": 0.00018527547126451774, "loss": 0.1936057209968567, "mean_token_accuracy": 0.9202312529087067, "num_tokens": 34305388.0, "step": 2781 }, { "entropy": 1.1803344190120697, "epoch": 1.464981569246972, "grad_norm": 0.27719569206237793, "learning_rate": 0.00018526344951067957, "loss": 0.19913798570632935, "mean_token_accuracy": 0.9173661470413208, "num_tokens": 34317724.0, "step": 2782 }, { "entropy": 1.1878839433193207, "epoch": 1.4655081621906265, "grad_norm": 0.2626071870326996, "learning_rate": 0.00018525142328888915, "loss": 0.1828022301197052, "mean_token_accuracy": 0.9273342788219452, "num_tokens": 34330060.0, "step": 2783 }, { "entropy": 1.1797403395175934, "epoch": 1.4660347551342812, "grad_norm": 0.2877488434314728, "learning_rate": 0.00018523939259986025, "loss": 0.20025065541267395, "mean_token_accuracy": 0.9134245812892914, "num_tokens": 34342396.0, "step": 2784 }, { "entropy": 1.1705401837825775, "epoch": 1.4665613480779358, "grad_norm": 0.3143531382083893, "learning_rate": 0.00018522735744430714, "loss": 0.21406927704811096, "mean_token_accuracy": 0.9137789458036423, "num_tokens": 34354732.0, "step": 2785 }, { "entropy": 1.2104687094688416, "epoch": 1.4670879410215902, "grad_norm": 0.2813572585582733, "learning_rate": 0.00018521531782294433, "loss": 0.20670530200004578, "mean_token_accuracy": 0.9143806546926498, "num_tokens": 34367068.0, "step": 2786 }, { "entropy": 1.097440928220749, "epoch": 1.4676145339652449, "grad_norm": 0.26660245656967163, "learning_rate": 0.00018520327373648644, "loss": 0.20290805399417877, "mean_token_accuracy": 0.9134158790111542, "num_tokens": 34379404.0, "step": 2787 }, { "entropy": 1.1643409132957458, "epoch": 1.4681411269088995, "grad_norm": 0.30806708335876465, "learning_rate": 0.00018519122518564853, "loss": 0.23489350080490112, "mean_token_accuracy": 0.9051381498575211, "num_tokens": 34391740.0, "step": 2788 }, { "entropy": 1.1760393381118774, "epoch": 1.468667719852554, "grad_norm": 0.30387377738952637, "learning_rate": 0.00018517917217114583, "loss": 0.20897458493709564, "mean_token_accuracy": 0.9153114259243011, "num_tokens": 34404076.0, "step": 2789 }, { "entropy": 1.170498788356781, "epoch": 1.4691943127962086, "grad_norm": 0.3018253445625305, "learning_rate": 0.00018516711469369386, "loss": 0.22422116994857788, "mean_token_accuracy": 0.9047844111919403, "num_tokens": 34416412.0, "step": 2790 }, { "entropy": 1.2046408951282501, "epoch": 1.469720905739863, "grad_norm": 0.2658669650554657, "learning_rate": 0.00018515505275400838, "loss": 0.18931232392787933, "mean_token_accuracy": 0.9234489351511002, "num_tokens": 34428748.0, "step": 2791 }, { "entropy": 1.1974002122879028, "epoch": 1.4702474986835177, "grad_norm": 0.27987316250801086, "learning_rate": 0.00018514298635280546, "loss": 0.20819401741027832, "mean_token_accuracy": 0.9120146036148071, "num_tokens": 34441084.0, "step": 2792 }, { "entropy": 1.20514714717865, "epoch": 1.470774091627172, "grad_norm": 0.26001980900764465, "learning_rate": 0.0001851309154908014, "loss": 0.19804999232292175, "mean_token_accuracy": 0.9171354323625565, "num_tokens": 34453420.0, "step": 2793 }, { "entropy": 1.2106068134307861, "epoch": 1.4713006845708267, "grad_norm": 0.2716507017612457, "learning_rate": 0.0001851188401687128, "loss": 0.19358912110328674, "mean_token_accuracy": 0.9196220189332962, "num_tokens": 34465756.0, "step": 2794 }, { "entropy": 1.231193095445633, "epoch": 1.4718272775144814, "grad_norm": 0.26500481367111206, "learning_rate": 0.00018510676038725648, "loss": 0.19936080276966095, "mean_token_accuracy": 0.9158136695623398, "num_tokens": 34478092.0, "step": 2795 }, { "entropy": 1.2479934096336365, "epoch": 1.4723538704581358, "grad_norm": 0.2973508834838867, "learning_rate": 0.00018509467614714954, "loss": 0.22026515007019043, "mean_token_accuracy": 0.911934033036232, "num_tokens": 34490428.0, "step": 2796 }, { "entropy": 1.2747034132480621, "epoch": 1.4728804634017905, "grad_norm": 0.3173184394836426, "learning_rate": 0.0001850825874491094, "loss": 0.2203284353017807, "mean_token_accuracy": 0.9120416641235352, "num_tokens": 34502764.0, "step": 2797 }, { "entropy": 1.1952545940876007, "epoch": 1.473407056345445, "grad_norm": 0.2990429401397705, "learning_rate": 0.0001850704942938536, "loss": 0.21640948951244354, "mean_token_accuracy": 0.9109156578779221, "num_tokens": 34515100.0, "step": 2798 }, { "entropy": 1.2120374739170074, "epoch": 1.4739336492890995, "grad_norm": 0.2810207009315491, "learning_rate": 0.00018505839668210013, "loss": 0.2099630981683731, "mean_token_accuracy": 0.9159301519393921, "num_tokens": 34527436.0, "step": 2799 }, { "entropy": 1.196582019329071, "epoch": 1.474460242232754, "grad_norm": 0.3099983334541321, "learning_rate": 0.00018504629461456716, "loss": 0.19392438232898712, "mean_token_accuracy": 0.9205189049243927, "num_tokens": 34539772.0, "step": 2800 }, { "entropy": 1.161557525396347, "epoch": 1.4749868351764086, "grad_norm": 0.2738645672798157, "learning_rate": 0.000185034188091973, "loss": 0.20201784372329712, "mean_token_accuracy": 0.9174954891204834, "num_tokens": 34552108.0, "step": 2801 }, { "entropy": 1.2087386548519135, "epoch": 1.4755134281200633, "grad_norm": 0.3033156991004944, "learning_rate": 0.00018502207711503646, "loss": 0.21341297030448914, "mean_token_accuracy": 0.9146996885538101, "num_tokens": 34564444.0, "step": 2802 }, { "entropy": 1.2204181849956512, "epoch": 1.4760400210637177, "grad_norm": 0.29885637760162354, "learning_rate": 0.0001850099616844765, "loss": 0.23106718063354492, "mean_token_accuracy": 0.9073407649993896, "num_tokens": 34576780.0, "step": 2803 }, { "entropy": 1.193909078836441, "epoch": 1.4765666140073723, "grad_norm": 0.29883119463920593, "learning_rate": 0.00018499784180101226, "loss": 0.20271748304367065, "mean_token_accuracy": 0.9174822568893433, "num_tokens": 34589116.0, "step": 2804 }, { "entropy": 1.195640653371811, "epoch": 1.477093206951027, "grad_norm": 0.3074481189250946, "learning_rate": 0.0001849857174653633, "loss": 0.2207125425338745, "mean_token_accuracy": 0.9117613136768341, "num_tokens": 34601452.0, "step": 2805 }, { "entropy": 1.1937943994998932, "epoch": 1.4776197998946814, "grad_norm": 0.30861732363700867, "learning_rate": 0.00018497358867824933, "loss": 0.23427164554595947, "mean_token_accuracy": 0.9043611437082291, "num_tokens": 34613788.0, "step": 2806 }, { "entropy": 1.209238052368164, "epoch": 1.478146392838336, "grad_norm": 0.29167798161506653, "learning_rate": 0.00018496145544039038, "loss": 0.20825859904289246, "mean_token_accuracy": 0.9163528382778168, "num_tokens": 34626124.0, "step": 2807 }, { "entropy": 1.2348674535751343, "epoch": 1.4786729857819905, "grad_norm": 0.30392780900001526, "learning_rate": 0.00018494931775250671, "loss": 0.213743194937706, "mean_token_accuracy": 0.9198024868965149, "num_tokens": 34638460.0, "step": 2808 }, { "entropy": 1.2187554240226746, "epoch": 1.4791995787256451, "grad_norm": 0.26182109117507935, "learning_rate": 0.00018493717561531893, "loss": 0.20783649384975433, "mean_token_accuracy": 0.9161714315414429, "num_tokens": 34650796.0, "step": 2809 }, { "entropy": 1.2145146429538727, "epoch": 1.4797261716692995, "grad_norm": 0.2773604094982147, "learning_rate": 0.0001849250290295478, "loss": 0.20019277930259705, "mean_token_accuracy": 0.9166374951601028, "num_tokens": 34663132.0, "step": 2810 }, { "entropy": 1.1926589012145996, "epoch": 1.4802527646129542, "grad_norm": 0.26068729162216187, "learning_rate": 0.00018491287799591436, "loss": 0.20261983573436737, "mean_token_accuracy": 0.9161369353532791, "num_tokens": 34675468.0, "step": 2811 }, { "entropy": 1.2438783645629883, "epoch": 1.4807793575566088, "grad_norm": 0.28087806701660156, "learning_rate": 0.00018490072251513997, "loss": 0.20033368468284607, "mean_token_accuracy": 0.9154119491577148, "num_tokens": 34687804.0, "step": 2812 }, { "entropy": 1.1822409331798553, "epoch": 1.4813059505002633, "grad_norm": 0.29859158396720886, "learning_rate": 0.00018488856258794625, "loss": 0.21145831048488617, "mean_token_accuracy": 0.9173175245523453, "num_tokens": 34700140.0, "step": 2813 }, { "entropy": 1.134483963251114, "epoch": 1.481832543443918, "grad_norm": 0.27768927812576294, "learning_rate": 0.00018487639821505506, "loss": 0.19765517115592957, "mean_token_accuracy": 0.9187143296003342, "num_tokens": 34712476.0, "step": 2814 }, { "entropy": 1.1635059118270874, "epoch": 1.4823591363875723, "grad_norm": 0.2897265553474426, "learning_rate": 0.00018486422939718853, "loss": 0.20456260442733765, "mean_token_accuracy": 0.9187261015176773, "num_tokens": 34724812.0, "step": 2815 }, { "entropy": 1.0995591282844543, "epoch": 1.482885729331227, "grad_norm": 0.3071244955062866, "learning_rate": 0.00018485205613506903, "loss": 0.22590550780296326, "mean_token_accuracy": 0.9051891267299652, "num_tokens": 34737148.0, "step": 2816 }, { "entropy": 1.1542208194732666, "epoch": 1.4834123222748814, "grad_norm": 0.27810409665107727, "learning_rate": 0.00018483987842941922, "loss": 0.19803431630134583, "mean_token_accuracy": 0.922128900885582, "num_tokens": 34749484.0, "step": 2817 }, { "entropy": 1.1647526919841766, "epoch": 1.483938915218536, "grad_norm": 0.2628480792045593, "learning_rate": 0.00018482769628096207, "loss": 0.1754264533519745, "mean_token_accuracy": 0.9252566993236542, "num_tokens": 34761820.0, "step": 2818 }, { "entropy": 1.1333464682102203, "epoch": 1.4844655081621907, "grad_norm": 0.32637807726860046, "learning_rate": 0.00018481550969042069, "loss": 0.22181954979896545, "mean_token_accuracy": 0.9101926386356354, "num_tokens": 34774156.0, "step": 2819 }, { "entropy": 1.125653713941574, "epoch": 1.4849921011058451, "grad_norm": 0.3150729835033417, "learning_rate": 0.00018480331865851853, "loss": 0.22693070769309998, "mean_token_accuracy": 0.9116131216287613, "num_tokens": 34786492.0, "step": 2820 }, { "entropy": 1.1617139875888824, "epoch": 1.4855186940494998, "grad_norm": 0.3212885856628418, "learning_rate": 0.00018479112318597936, "loss": 0.22024253010749817, "mean_token_accuracy": 0.9142894148826599, "num_tokens": 34798828.0, "step": 2821 }, { "entropy": 1.130389004945755, "epoch": 1.4860452869931544, "grad_norm": 0.26759734749794006, "learning_rate": 0.00018477892327352713, "loss": 0.18030500411987305, "mean_token_accuracy": 0.9289237558841705, "num_tokens": 34811164.0, "step": 2822 }, { "entropy": 1.1489178240299225, "epoch": 1.4865718799368088, "grad_norm": 0.28973206877708435, "learning_rate": 0.00018476671892188605, "loss": 0.20612166821956635, "mean_token_accuracy": 0.9198791682720184, "num_tokens": 34823500.0, "step": 2823 }, { "entropy": 1.196854144334793, "epoch": 1.4870984728804635, "grad_norm": 0.29863879084587097, "learning_rate": 0.00018475451013178062, "loss": 0.20180033147335052, "mean_token_accuracy": 0.9196022301912308, "num_tokens": 34835836.0, "step": 2824 }, { "entropy": 1.1838077902793884, "epoch": 1.487625065824118, "grad_norm": 0.30217835307121277, "learning_rate": 0.00018474229690393568, "loss": 0.19603033363819122, "mean_token_accuracy": 0.9209345132112503, "num_tokens": 34848172.0, "step": 2825 }, { "entropy": 1.256701648235321, "epoch": 1.4881516587677726, "grad_norm": 0.2757579982280731, "learning_rate": 0.00018473007923907616, "loss": 0.19625365734100342, "mean_token_accuracy": 0.9234248697757721, "num_tokens": 34860508.0, "step": 2826 }, { "entropy": 1.2282088100910187, "epoch": 1.488678251711427, "grad_norm": 0.2982552945613861, "learning_rate": 0.0001847178571379274, "loss": 0.20196665823459625, "mean_token_accuracy": 0.9129941761493683, "num_tokens": 34872844.0, "step": 2827 }, { "entropy": 1.1983471512794495, "epoch": 1.4892048446550816, "grad_norm": 0.25875699520111084, "learning_rate": 0.00018470563060121498, "loss": 0.19371843338012695, "mean_token_accuracy": 0.9161286354064941, "num_tokens": 34885180.0, "step": 2828 }, { "entropy": 1.2658935189247131, "epoch": 1.4897314375987363, "grad_norm": 0.28629231452941895, "learning_rate": 0.0001846933996296647, "loss": 0.20451796054840088, "mean_token_accuracy": 0.9187720865011215, "num_tokens": 34897516.0, "step": 2829 }, { "entropy": 1.2226274013519287, "epoch": 1.4902580305423907, "grad_norm": 0.26883167028427124, "learning_rate": 0.00018468116422400258, "loss": 0.19514040648937225, "mean_token_accuracy": 0.9247150421142578, "num_tokens": 34909852.0, "step": 2830 }, { "entropy": 1.2325372695922852, "epoch": 1.4907846234860453, "grad_norm": 0.27920812368392944, "learning_rate": 0.00018466892438495503, "loss": 0.20849348604679108, "mean_token_accuracy": 0.9168450087308884, "num_tokens": 34922188.0, "step": 2831 }, { "entropy": 1.2324140071868896, "epoch": 1.4913112164296998, "grad_norm": 0.29039597511291504, "learning_rate": 0.00018465668011324863, "loss": 0.21684204041957855, "mean_token_accuracy": 0.9118513017892838, "num_tokens": 34934524.0, "step": 2832 }, { "entropy": 1.158925324678421, "epoch": 1.4918378093733544, "grad_norm": 0.2734275162220001, "learning_rate": 0.0001846444314096103, "loss": 0.1901196390390396, "mean_token_accuracy": 0.9206565618515015, "num_tokens": 34946860.0, "step": 2833 }, { "entropy": 1.179129183292389, "epoch": 1.4923644023170088, "grad_norm": 0.24893783032894135, "learning_rate": 0.0001846321782747671, "loss": 0.1810513734817505, "mean_token_accuracy": 0.925764262676239, "num_tokens": 34959196.0, "step": 2834 }, { "entropy": 1.1447475254535675, "epoch": 1.4928909952606635, "grad_norm": 0.2840208411216736, "learning_rate": 0.00018461992070944652, "loss": 0.20713338255882263, "mean_token_accuracy": 0.9199363738298416, "num_tokens": 34971532.0, "step": 2835 }, { "entropy": 1.2216734886169434, "epoch": 1.4934175882043181, "grad_norm": 0.28631988167762756, "learning_rate": 0.00018460765871437614, "loss": 0.20792193710803986, "mean_token_accuracy": 0.9214426577091217, "num_tokens": 34983868.0, "step": 2836 }, { "entropy": 1.1670808494091034, "epoch": 1.4939441811479726, "grad_norm": 0.2994043529033661, "learning_rate": 0.00018459539229028388, "loss": 0.2228715866804123, "mean_token_accuracy": 0.9080910384654999, "num_tokens": 34996204.0, "step": 2837 }, { "entropy": 1.1826681196689606, "epoch": 1.4944707740916272, "grad_norm": 0.2632300853729248, "learning_rate": 0.00018458312143789798, "loss": 0.19896544516086578, "mean_token_accuracy": 0.9158213883638382, "num_tokens": 35008540.0, "step": 2838 }, { "entropy": 1.1997667253017426, "epoch": 1.4949973670352819, "grad_norm": 0.28206589818000793, "learning_rate": 0.00018457084615794685, "loss": 0.18993441760540009, "mean_token_accuracy": 0.9219527989625931, "num_tokens": 35020876.0, "step": 2839 }, { "entropy": 1.2673965096473694, "epoch": 1.4955239599789363, "grad_norm": 0.29593348503112793, "learning_rate": 0.00018455856645115923, "loss": 0.2120542973279953, "mean_token_accuracy": 0.9183967113494873, "num_tokens": 35033212.0, "step": 2840 }, { "entropy": 1.2509069740772247, "epoch": 1.4960505529225907, "grad_norm": 0.4201185405254364, "learning_rate": 0.0001845462823182641, "loss": 0.21505090594291687, "mean_token_accuracy": 0.9150316119194031, "num_tokens": 35045548.0, "step": 2841 }, { "entropy": 1.3054153323173523, "epoch": 1.4965771458662454, "grad_norm": 0.2993493378162384, "learning_rate": 0.0001845339937599906, "loss": 0.1938711553812027, "mean_token_accuracy": 0.91843082010746, "num_tokens": 35057884.0, "step": 2842 }, { "entropy": 1.2852679789066315, "epoch": 1.4971037388099, "grad_norm": 0.28747817873954773, "learning_rate": 0.0001845217007770684, "loss": 0.18465346097946167, "mean_token_accuracy": 0.9223109483718872, "num_tokens": 35070220.0, "step": 2843 }, { "entropy": 1.3424168229103088, "epoch": 1.4976303317535544, "grad_norm": 0.2738924026489258, "learning_rate": 0.0001845094033702271, "loss": 0.19440293312072754, "mean_token_accuracy": 0.9208139926195145, "num_tokens": 35082556.0, "step": 2844 }, { "entropy": 1.2790354490280151, "epoch": 1.498156924697209, "grad_norm": 0.26316049695014954, "learning_rate": 0.00018449710154019687, "loss": 0.18655042350292206, "mean_token_accuracy": 0.9237352013587952, "num_tokens": 35094892.0, "step": 2845 }, { "entropy": 1.3539345264434814, "epoch": 1.4986835176408637, "grad_norm": 0.29045310616493225, "learning_rate": 0.00018448479528770784, "loss": 0.19067838788032532, "mean_token_accuracy": 0.9230899512767792, "num_tokens": 35107228.0, "step": 2846 }, { "entropy": 1.4051901996135712, "epoch": 1.4992101105845181, "grad_norm": 0.256143718957901, "learning_rate": 0.0001844724846134907, "loss": 0.2035890519618988, "mean_token_accuracy": 0.9209445118904114, "num_tokens": 35119564.0, "step": 2847 }, { "entropy": 1.4236982464790344, "epoch": 1.4997367035281728, "grad_norm": 0.28411853313446045, "learning_rate": 0.00018446016951827619, "loss": 0.20746804773807526, "mean_token_accuracy": 0.9163666069507599, "num_tokens": 35131900.0, "step": 2848 }, { "entropy": 1.4779279828071594, "epoch": 1.5002632964718274, "grad_norm": 0.31305235624313354, "learning_rate": 0.0001844478500027954, "loss": 0.20554354786872864, "mean_token_accuracy": 0.9199778288602829, "num_tokens": 35144236.0, "step": 2849 }, { "entropy": 1.436387151479721, "epoch": 1.5007898894154819, "grad_norm": 0.2702447772026062, "learning_rate": 0.00018443552606777966, "loss": 0.18683519959449768, "mean_token_accuracy": 0.9251002669334412, "num_tokens": 35156572.0, "step": 2850 }, { "entropy": 1.4672654867172241, "epoch": 1.5013164823591363, "grad_norm": 0.2640582323074341, "learning_rate": 0.0001844231977139606, "loss": 0.17821809649467468, "mean_token_accuracy": 0.9315766096115112, "num_tokens": 35168908.0, "step": 2851 }, { "entropy": 1.4444270133972168, "epoch": 1.501843075302791, "grad_norm": 0.29034173488616943, "learning_rate": 0.00018441086494207004, "loss": 0.20143531262874603, "mean_token_accuracy": 0.9211236834526062, "num_tokens": 35181244.0, "step": 2852 }, { "entropy": 1.447830855846405, "epoch": 1.5023696682464456, "grad_norm": 0.26047781109809875, "learning_rate": 0.00018439852775284016, "loss": 0.1932010054588318, "mean_token_accuracy": 0.9227436780929565, "num_tokens": 35193580.0, "step": 2853 }, { "entropy": 1.5056044459342957, "epoch": 1.5028962611901, "grad_norm": 0.2798239588737488, "learning_rate": 0.0001843861861470033, "loss": 0.197336345911026, "mean_token_accuracy": 0.9250242561101913, "num_tokens": 35205916.0, "step": 2854 }, { "entropy": 1.3938361406326294, "epoch": 1.5034228541337546, "grad_norm": 0.2706337571144104, "learning_rate": 0.00018437384012529213, "loss": 0.19167521595954895, "mean_token_accuracy": 0.9251234829425812, "num_tokens": 35218252.0, "step": 2855 }, { "entropy": 1.41653311252594, "epoch": 1.5039494470774093, "grad_norm": 0.25845250487327576, "learning_rate": 0.00018436148968843956, "loss": 0.18029874563217163, "mean_token_accuracy": 0.9265570193529129, "num_tokens": 35230588.0, "step": 2856 }, { "entropy": 1.449202448129654, "epoch": 1.5044760400210637, "grad_norm": 0.26958736777305603, "learning_rate": 0.00018434913483717871, "loss": 0.19115948677062988, "mean_token_accuracy": 0.9232787936925888, "num_tokens": 35242924.0, "step": 2857 }, { "entropy": 1.4373081922531128, "epoch": 1.5050026329647181, "grad_norm": 0.2909432649612427, "learning_rate": 0.00018433677557224312, "loss": 0.2226668894290924, "mean_token_accuracy": 0.9091159552335739, "num_tokens": 35255260.0, "step": 2858 }, { "entropy": 1.4466613829135895, "epoch": 1.5055292259083728, "grad_norm": 0.28296786546707153, "learning_rate": 0.0001843244118943664, "loss": 0.19658687710762024, "mean_token_accuracy": 0.9204612225294113, "num_tokens": 35267596.0, "step": 2859 }, { "entropy": 1.4727692604064941, "epoch": 1.5060558188520274, "grad_norm": 0.27067407965660095, "learning_rate": 0.00018431204380428258, "loss": 0.17784729599952698, "mean_token_accuracy": 0.9264029860496521, "num_tokens": 35279932.0, "step": 2860 }, { "entropy": 1.4386701583862305, "epoch": 1.5065824117956819, "grad_norm": 0.28752195835113525, "learning_rate": 0.0001842996713027258, "loss": 0.20581099390983582, "mean_token_accuracy": 0.9142017662525177, "num_tokens": 35292268.0, "step": 2861 }, { "entropy": 1.4239437580108643, "epoch": 1.5071090047393365, "grad_norm": 0.274856835603714, "learning_rate": 0.00018428729439043062, "loss": 0.18968544900417328, "mean_token_accuracy": 0.921679362654686, "num_tokens": 35304604.0, "step": 2862 }, { "entropy": 1.4606831967830658, "epoch": 1.5076355976829912, "grad_norm": 0.2826034426689148, "learning_rate": 0.00018427491306813171, "loss": 0.19272050261497498, "mean_token_accuracy": 0.9195594191551208, "num_tokens": 35316940.0, "step": 2863 }, { "entropy": 1.4668301343917847, "epoch": 1.5081621906266456, "grad_norm": 0.32095038890838623, "learning_rate": 0.00018426252733656415, "loss": 0.20584404468536377, "mean_token_accuracy": 0.915522113442421, "num_tokens": 35329276.0, "step": 2864 }, { "entropy": 1.3869444131851196, "epoch": 1.5086887835703, "grad_norm": 0.28584420680999756, "learning_rate": 0.00018425013719646318, "loss": 0.21644830703735352, "mean_token_accuracy": 0.9124075770378113, "num_tokens": 35341612.0, "step": 2865 }, { "entropy": 1.3982872068881989, "epoch": 1.5092153765139549, "grad_norm": 0.2921147048473358, "learning_rate": 0.00018423774264856433, "loss": 0.22454163432121277, "mean_token_accuracy": 0.9074548035860062, "num_tokens": 35353948.0, "step": 2866 }, { "entropy": 1.4254017174243927, "epoch": 1.5097419694576093, "grad_norm": 0.29195889830589294, "learning_rate": 0.00018422534369360335, "loss": 0.20947468280792236, "mean_token_accuracy": 0.9152242243289948, "num_tokens": 35366284.0, "step": 2867 }, { "entropy": 1.420524001121521, "epoch": 1.5102685624012637, "grad_norm": 0.28271856904029846, "learning_rate": 0.00018421294033231638, "loss": 0.19233407080173492, "mean_token_accuracy": 0.922194093465805, "num_tokens": 35378620.0, "step": 2868 }, { "entropy": 1.4296413362026215, "epoch": 1.5107951553449184, "grad_norm": 0.29727426171302795, "learning_rate": 0.00018420053256543967, "loss": 0.21647101640701294, "mean_token_accuracy": 0.9113524258136749, "num_tokens": 35390956.0, "step": 2869 }, { "entropy": 1.383836716413498, "epoch": 1.511321748288573, "grad_norm": 0.2626645565032959, "learning_rate": 0.00018418812039370982, "loss": 0.17489789426326752, "mean_token_accuracy": 0.9316018223762512, "num_tokens": 35403292.0, "step": 2870 }, { "entropy": 1.3209747970104218, "epoch": 1.5118483412322274, "grad_norm": 0.2824258804321289, "learning_rate": 0.00018417570381786365, "loss": 0.2016294300556183, "mean_token_accuracy": 0.9183167815208435, "num_tokens": 35415628.0, "step": 2871 }, { "entropy": 1.3184476792812347, "epoch": 1.512374934175882, "grad_norm": 0.290884405374527, "learning_rate": 0.00018416328283863827, "loss": 0.20478402078151703, "mean_token_accuracy": 0.9130069315433502, "num_tokens": 35427964.0, "step": 2872 }, { "entropy": 1.268851488828659, "epoch": 1.5129015271195367, "grad_norm": 0.2771494686603546, "learning_rate": 0.00018415085745677106, "loss": 0.1991674304008484, "mean_token_accuracy": 0.9160973429679871, "num_tokens": 35440300.0, "step": 2873 }, { "entropy": 1.3079243302345276, "epoch": 1.5134281200631912, "grad_norm": 0.30500468611717224, "learning_rate": 0.0001841384276729996, "loss": 0.22135591506958008, "mean_token_accuracy": 0.9075585156679153, "num_tokens": 35452636.0, "step": 2874 }, { "entropy": 1.2402482628822327, "epoch": 1.5139547130068456, "grad_norm": 0.2842849791049957, "learning_rate": 0.00018412599348806185, "loss": 0.2187984585762024, "mean_token_accuracy": 0.9123281091451645, "num_tokens": 35464972.0, "step": 2875 }, { "entropy": 1.1900142133235931, "epoch": 1.5144813059505002, "grad_norm": 0.27149152755737305, "learning_rate": 0.00018411355490269589, "loss": 0.20663440227508545, "mean_token_accuracy": 0.9168604612350464, "num_tokens": 35477308.0, "step": 2876 }, { "entropy": 1.2160408794879913, "epoch": 1.5150078988941549, "grad_norm": 0.3139822483062744, "learning_rate": 0.00018410111191764013, "loss": 0.19389238953590393, "mean_token_accuracy": 0.9242724925279617, "num_tokens": 35489644.0, "step": 2877 }, { "entropy": 1.2444290518760681, "epoch": 1.5155344918378093, "grad_norm": 0.2705695331096649, "learning_rate": 0.00018408866453363326, "loss": 0.19504526257514954, "mean_token_accuracy": 0.921023428440094, "num_tokens": 35501980.0, "step": 2878 }, { "entropy": 1.2649579048156738, "epoch": 1.516061084781464, "grad_norm": 0.2965560853481293, "learning_rate": 0.00018407621275141417, "loss": 0.20819805562496185, "mean_token_accuracy": 0.9142050892114639, "num_tokens": 35514316.0, "step": 2879 }, { "entropy": 1.270400732755661, "epoch": 1.5165876777251186, "grad_norm": 0.2897675931453705, "learning_rate": 0.0001840637565717221, "loss": 0.213098406791687, "mean_token_accuracy": 0.910462811589241, "num_tokens": 35526652.0, "step": 2880 }, { "entropy": 1.2283774614334106, "epoch": 1.517114270668773, "grad_norm": 0.29091915488243103, "learning_rate": 0.00018405129599529646, "loss": 0.19621555507183075, "mean_token_accuracy": 0.9233623296022415, "num_tokens": 35538988.0, "step": 2881 }, { "entropy": 1.2129921317100525, "epoch": 1.5176408636124274, "grad_norm": 0.36581671237945557, "learning_rate": 0.00018403883102287698, "loss": 0.19229567050933838, "mean_token_accuracy": 0.9180682301521301, "num_tokens": 35551324.0, "step": 2882 }, { "entropy": 1.2191410660743713, "epoch": 1.518167456556082, "grad_norm": 0.2867785394191742, "learning_rate": 0.00018402636165520367, "loss": 0.211622953414917, "mean_token_accuracy": 0.9161818474531174, "num_tokens": 35563660.0, "step": 2883 }, { "entropy": 1.2190195620059967, "epoch": 1.5186940494997367, "grad_norm": 0.25288647413253784, "learning_rate": 0.0001840138878930167, "loss": 0.19131462275981903, "mean_token_accuracy": 0.9191330075263977, "num_tokens": 35575996.0, "step": 2884 }, { "entropy": 1.2443910837173462, "epoch": 1.5192206424433912, "grad_norm": 0.27648887038230896, "learning_rate": 0.00018400140973705658, "loss": 0.20976126194000244, "mean_token_accuracy": 0.9147668480873108, "num_tokens": 35588332.0, "step": 2885 }, { "entropy": 1.2364069521427155, "epoch": 1.5197472353870458, "grad_norm": 0.2660056948661804, "learning_rate": 0.00018398892718806412, "loss": 0.18810099363327026, "mean_token_accuracy": 0.9223190397024155, "num_tokens": 35600668.0, "step": 2886 }, { "entropy": 1.2349788844585419, "epoch": 1.5202738283307005, "grad_norm": 0.25507408380508423, "learning_rate": 0.00018397644024678028, "loss": 0.20845112204551697, "mean_token_accuracy": 0.9182122647762299, "num_tokens": 35613004.0, "step": 2887 }, { "entropy": 1.2452967166900635, "epoch": 1.5208004212743549, "grad_norm": 0.2838190495967865, "learning_rate": 0.0001839639489139463, "loss": 0.19937308132648468, "mean_token_accuracy": 0.9176253229379654, "num_tokens": 35625340.0, "step": 2888 }, { "entropy": 1.214994490146637, "epoch": 1.5213270142180095, "grad_norm": 0.268673837184906, "learning_rate": 0.0001839514531903038, "loss": 0.1951359212398529, "mean_token_accuracy": 0.9214799553155899, "num_tokens": 35637676.0, "step": 2889 }, { "entropy": 1.270435869693756, "epoch": 1.5218536071616642, "grad_norm": 0.3197346031665802, "learning_rate": 0.00018393895307659456, "loss": 0.20956359803676605, "mean_token_accuracy": 0.9150731861591339, "num_tokens": 35650012.0, "step": 2890 }, { "entropy": 1.3132632076740265, "epoch": 1.5223802001053186, "grad_norm": 0.299365758895874, "learning_rate": 0.0001839264485735606, "loss": 0.204919695854187, "mean_token_accuracy": 0.912919282913208, "num_tokens": 35662348.0, "step": 2891 }, { "entropy": 1.306254893541336, "epoch": 1.522906793048973, "grad_norm": 0.2999991178512573, "learning_rate": 0.00018391393968194428, "loss": 0.221295565366745, "mean_token_accuracy": 0.9113573879003525, "num_tokens": 35674684.0, "step": 2892 }, { "entropy": 1.3227771818637848, "epoch": 1.5234333859926277, "grad_norm": 0.29826298356056213, "learning_rate": 0.00018390142640248817, "loss": 0.2028276026248932, "mean_token_accuracy": 0.9149623513221741, "num_tokens": 35687020.0, "step": 2893 }, { "entropy": 1.2494766116142273, "epoch": 1.5239599789362823, "grad_norm": 0.29955431818962097, "learning_rate": 0.0001838889087359351, "loss": 0.2077026069164276, "mean_token_accuracy": 0.918857529759407, "num_tokens": 35699356.0, "step": 2894 }, { "entropy": 1.2577630579471588, "epoch": 1.5244865718799367, "grad_norm": 0.2640293836593628, "learning_rate": 0.00018387638668302818, "loss": 0.20387566089630127, "mean_token_accuracy": 0.9126008599996567, "num_tokens": 35711692.0, "step": 2895 }, { "entropy": 1.3035214841365814, "epoch": 1.5250131648235914, "grad_norm": 0.27383658289909363, "learning_rate": 0.00018386386024451076, "loss": 0.19004280865192413, "mean_token_accuracy": 0.9235143810510635, "num_tokens": 35724028.0, "step": 2896 }, { "entropy": 1.3059624433517456, "epoch": 1.525539757767246, "grad_norm": 0.3266020715236664, "learning_rate": 0.00018385132942112646, "loss": 0.21989792585372925, "mean_token_accuracy": 0.9094354212284088, "num_tokens": 35736364.0, "step": 2897 }, { "entropy": 1.255292147397995, "epoch": 1.5260663507109005, "grad_norm": 0.29097259044647217, "learning_rate": 0.0001838387942136192, "loss": 0.20556314289569855, "mean_token_accuracy": 0.9147609919309616, "num_tokens": 35748700.0, "step": 2898 }, { "entropy": 1.293520450592041, "epoch": 1.526592943654555, "grad_norm": 0.2748951017856598, "learning_rate": 0.00018382625462273305, "loss": 0.1994977742433548, "mean_token_accuracy": 0.9188051521778107, "num_tokens": 35761036.0, "step": 2899 }, { "entropy": 1.2601102590560913, "epoch": 1.5271195365982095, "grad_norm": 0.25538790225982666, "learning_rate": 0.00018381371064921247, "loss": 0.19155453145503998, "mean_token_accuracy": 0.9221813231706619, "num_tokens": 35773372.0, "step": 2900 }, { "entropy": 1.302675575017929, "epoch": 1.5276461295418642, "grad_norm": 0.27591919898986816, "learning_rate": 0.0001838011622938021, "loss": 0.19985324144363403, "mean_token_accuracy": 0.9170637875795364, "num_tokens": 35785708.0, "step": 2901 }, { "entropy": 1.3327484726905823, "epoch": 1.5281727224855186, "grad_norm": 0.2705720365047455, "learning_rate": 0.0001837886095572469, "loss": 0.1857602745294571, "mean_token_accuracy": 0.9223667979240417, "num_tokens": 35798044.0, "step": 2902 }, { "entropy": 1.308729499578476, "epoch": 1.5286993154291733, "grad_norm": 0.2666257321834564, "learning_rate": 0.00018377605244029204, "loss": 0.18631060421466827, "mean_token_accuracy": 0.9259549677371979, "num_tokens": 35810380.0, "step": 2903 }, { "entropy": 1.3280511498451233, "epoch": 1.529225908372828, "grad_norm": 0.2811123728752136, "learning_rate": 0.00018376349094368288, "loss": 0.19803892076015472, "mean_token_accuracy": 0.9206533879041672, "num_tokens": 35822716.0, "step": 2904 }, { "entropy": 1.2749126553535461, "epoch": 1.5297525013164823, "grad_norm": 0.27242687344551086, "learning_rate": 0.00018375092506816524, "loss": 0.18691426515579224, "mean_token_accuracy": 0.921400859951973, "num_tokens": 35835052.0, "step": 2905 }, { "entropy": 1.3258703649044037, "epoch": 1.5302790942601368, "grad_norm": 0.2818097770214081, "learning_rate": 0.000183738354814485, "loss": 0.19853971898555756, "mean_token_accuracy": 0.9171813875436783, "num_tokens": 35847388.0, "step": 2906 }, { "entropy": 1.331975519657135, "epoch": 1.5308056872037916, "grad_norm": 0.29557204246520996, "learning_rate": 0.00018372578018338844, "loss": 0.19931554794311523, "mean_token_accuracy": 0.9204997718334198, "num_tokens": 35859724.0, "step": 2907 }, { "entropy": 1.3371560275554657, "epoch": 1.531332280147446, "grad_norm": 0.30124926567077637, "learning_rate": 0.00018371320117562199, "loss": 0.20128431916236877, "mean_token_accuracy": 0.9167551845312119, "num_tokens": 35872060.0, "step": 2908 }, { "entropy": 1.2963175475597382, "epoch": 1.5318588730911005, "grad_norm": 0.26844584941864014, "learning_rate": 0.00018370061779193243, "loss": 0.18807059526443481, "mean_token_accuracy": 0.9203794151544571, "num_tokens": 35884396.0, "step": 2909 }, { "entropy": 1.2872518599033356, "epoch": 1.5323854660347551, "grad_norm": 0.2787841260433197, "learning_rate": 0.0001836880300330668, "loss": 0.18961066007614136, "mean_token_accuracy": 0.9234008938074112, "num_tokens": 35896732.0, "step": 2910 }, { "entropy": 1.3187111616134644, "epoch": 1.5329120589784098, "grad_norm": 0.26749753952026367, "learning_rate": 0.00018367543789977225, "loss": 0.1896454393863678, "mean_token_accuracy": 0.919704869389534, "num_tokens": 35909068.0, "step": 2911 }, { "entropy": 1.2901692986488342, "epoch": 1.5334386519220642, "grad_norm": 0.28337034583091736, "learning_rate": 0.00018366284139279638, "loss": 0.19293320178985596, "mean_token_accuracy": 0.9212239682674408, "num_tokens": 35921404.0, "step": 2912 }, { "entropy": 1.2707647681236267, "epoch": 1.5339652448657188, "grad_norm": 0.2982810437679291, "learning_rate": 0.00018365024051288694, "loss": 0.19825252890586853, "mean_token_accuracy": 0.9236468225717545, "num_tokens": 35933740.0, "step": 2913 }, { "entropy": 1.3728724122047424, "epoch": 1.5344918378093735, "grad_norm": 0.2963562309741974, "learning_rate": 0.000183637635260792, "loss": 0.2167905569076538, "mean_token_accuracy": 0.9136679619550705, "num_tokens": 35946076.0, "step": 2914 }, { "entropy": 1.3078700304031372, "epoch": 1.535018430753028, "grad_norm": 0.2905045747756958, "learning_rate": 0.00018362502563725987, "loss": 0.22399064898490906, "mean_token_accuracy": 0.9054947942495346, "num_tokens": 35958412.0, "step": 2915 }, { "entropy": 1.292427510023117, "epoch": 1.5355450236966823, "grad_norm": 0.25560230016708374, "learning_rate": 0.0001836124116430391, "loss": 0.17694160342216492, "mean_token_accuracy": 0.9285813271999359, "num_tokens": 35970748.0, "step": 2916 }, { "entropy": 1.3606195151805878, "epoch": 1.536071616640337, "grad_norm": 0.2602185904979706, "learning_rate": 0.00018359979327887846, "loss": 0.20653316378593445, "mean_token_accuracy": 0.9120610505342484, "num_tokens": 35983084.0, "step": 2917 }, { "entropy": 1.340090036392212, "epoch": 1.5365982095839916, "grad_norm": 0.2481660097837448, "learning_rate": 0.00018358717054552706, "loss": 0.17147809267044067, "mean_token_accuracy": 0.9288907945156097, "num_tokens": 35995420.0, "step": 2918 }, { "entropy": 1.317726194858551, "epoch": 1.537124802527646, "grad_norm": 0.2963104546070099, "learning_rate": 0.00018357454344373426, "loss": 0.22185461223125458, "mean_token_accuracy": 0.9066198915243149, "num_tokens": 36007756.0, "step": 2919 }, { "entropy": 1.2521053552627563, "epoch": 1.5376513954713007, "grad_norm": 0.2623257040977478, "learning_rate": 0.00018356191197424964, "loss": 0.19398631155490875, "mean_token_accuracy": 0.9210677295923233, "num_tokens": 36020092.0, "step": 2920 }, { "entropy": 1.3271432518959045, "epoch": 1.5381779884149553, "grad_norm": 0.29276102781295776, "learning_rate": 0.00018354927613782306, "loss": 0.21266180276870728, "mean_token_accuracy": 0.9133126139640808, "num_tokens": 36032428.0, "step": 2921 }, { "entropy": 1.299724519252777, "epoch": 1.5387045813586098, "grad_norm": 0.27011600136756897, "learning_rate": 0.00018353663593520466, "loss": 0.20557110011577606, "mean_token_accuracy": 0.9162522554397583, "num_tokens": 36044764.0, "step": 2922 }, { "entropy": 1.3156613111495972, "epoch": 1.5392311743022642, "grad_norm": 0.2779374420642853, "learning_rate": 0.0001835239913671447, "loss": 0.2038457691669464, "mean_token_accuracy": 0.913342073559761, "num_tokens": 36057100.0, "step": 2923 }, { "entropy": 1.354040265083313, "epoch": 1.539757767245919, "grad_norm": 0.2893989384174347, "learning_rate": 0.000183511342434394, "loss": 0.22883382439613342, "mean_token_accuracy": 0.9079950302839279, "num_tokens": 36069436.0, "step": 2924 }, { "entropy": 1.3318619132041931, "epoch": 1.5402843601895735, "grad_norm": 0.2893321216106415, "learning_rate": 0.0001834986891377033, "loss": 0.2252848893404007, "mean_token_accuracy": 0.9112117439508438, "num_tokens": 36081772.0, "step": 2925 }, { "entropy": 1.4141647219657898, "epoch": 1.540810953133228, "grad_norm": 0.28723177313804626, "learning_rate": 0.0001834860314778238, "loss": 0.2135084867477417, "mean_token_accuracy": 0.9165365993976593, "num_tokens": 36094108.0, "step": 2926 }, { "entropy": 1.3629777133464813, "epoch": 1.5413375460768826, "grad_norm": 0.2711016833782196, "learning_rate": 0.00018347336945550696, "loss": 0.20635992288589478, "mean_token_accuracy": 0.9175506234169006, "num_tokens": 36106444.0, "step": 2927 }, { "entropy": 1.3666974306106567, "epoch": 1.5418641390205372, "grad_norm": 0.26723483204841614, "learning_rate": 0.00018346070307150443, "loss": 0.1943853497505188, "mean_token_accuracy": 0.9215286374092102, "num_tokens": 36118780.0, "step": 2928 }, { "entropy": 1.379920780658722, "epoch": 1.5423907319641916, "grad_norm": 0.36375778913497925, "learning_rate": 0.00018344803232656805, "loss": 0.2259494662284851, "mean_token_accuracy": 0.9057151675224304, "num_tokens": 36131116.0, "step": 2929 }, { "entropy": 1.3832117319107056, "epoch": 1.5429173249078463, "grad_norm": 0.30295872688293457, "learning_rate": 0.00018343535722145011, "loss": 0.22572673857212067, "mean_token_accuracy": 0.9093717187643051, "num_tokens": 36143452.0, "step": 2930 }, { "entropy": 1.3965988755226135, "epoch": 1.543443917851501, "grad_norm": 0.28036290407180786, "learning_rate": 0.00018342267775690302, "loss": 0.1899104118347168, "mean_token_accuracy": 0.9211853593587875, "num_tokens": 36155788.0, "step": 2931 }, { "entropy": 1.3536584973335266, "epoch": 1.5439705107951553, "grad_norm": 0.28164905309677124, "learning_rate": 0.00018340999393367952, "loss": 0.20792821049690247, "mean_token_accuracy": 0.9128543734550476, "num_tokens": 36168124.0, "step": 2932 }, { "entropy": 1.3484612703323364, "epoch": 1.5444971037388098, "grad_norm": 0.2770152688026428, "learning_rate": 0.00018339730575253252, "loss": 0.1988334357738495, "mean_token_accuracy": 0.9181084334850311, "num_tokens": 36180460.0, "step": 2933 }, { "entropy": 1.3058361113071442, "epoch": 1.5450236966824644, "grad_norm": 0.2750353515148163, "learning_rate": 0.0001833846132142153, "loss": 0.1986725926399231, "mean_token_accuracy": 0.9165878146886826, "num_tokens": 36192796.0, "step": 2934 }, { "entropy": 1.3110437989234924, "epoch": 1.545550289626119, "grad_norm": 0.28275609016418457, "learning_rate": 0.00018337191631948127, "loss": 0.2109573483467102, "mean_token_accuracy": 0.9166303426027298, "num_tokens": 36205132.0, "step": 2935 }, { "entropy": 1.3241609632968903, "epoch": 1.5460768825697735, "grad_norm": 0.3148845136165619, "learning_rate": 0.00018335921506908425, "loss": 0.23299464583396912, "mean_token_accuracy": 0.9048751890659332, "num_tokens": 36217468.0, "step": 2936 }, { "entropy": 1.2985778152942657, "epoch": 1.5466034755134281, "grad_norm": 0.2876144051551819, "learning_rate": 0.0001833465094637782, "loss": 0.19456106424331665, "mean_token_accuracy": 0.9193484932184219, "num_tokens": 36229804.0, "step": 2937 }, { "entropy": 1.2285209596157074, "epoch": 1.5471300684570828, "grad_norm": 0.2816034257411957, "learning_rate": 0.00018333379950431734, "loss": 0.2107038050889969, "mean_token_accuracy": 0.9162741601467133, "num_tokens": 36242140.0, "step": 2938 }, { "entropy": 1.270815670490265, "epoch": 1.5476566614007372, "grad_norm": 0.30017396807670593, "learning_rate": 0.00018332108519145623, "loss": 0.22914569079875946, "mean_token_accuracy": 0.9055030792951584, "num_tokens": 36254476.0, "step": 2939 }, { "entropy": 1.251087248325348, "epoch": 1.5481832543443916, "grad_norm": 0.2832695543766022, "learning_rate": 0.00018330836652594967, "loss": 0.19750654697418213, "mean_token_accuracy": 0.9202122986316681, "num_tokens": 36266812.0, "step": 2940 }, { "entropy": 1.2241024374961853, "epoch": 1.5487098472880465, "grad_norm": 0.2506945729255676, "learning_rate": 0.00018329564350855264, "loss": 0.19707068800926208, "mean_token_accuracy": 0.9187771528959274, "num_tokens": 36279148.0, "step": 2941 }, { "entropy": 1.2423125505447388, "epoch": 1.549236440231701, "grad_norm": 0.2908343970775604, "learning_rate": 0.00018328291614002048, "loss": 0.2287912517786026, "mean_token_accuracy": 0.9047258198261261, "num_tokens": 36291484.0, "step": 2942 }, { "entropy": 1.2304923236370087, "epoch": 1.5497630331753554, "grad_norm": 0.2795937955379486, "learning_rate": 0.0001832701844211087, "loss": 0.18848249316215515, "mean_token_accuracy": 0.9215769469738007, "num_tokens": 36303820.0, "step": 2943 }, { "entropy": 1.236438661813736, "epoch": 1.55028962611901, "grad_norm": 0.26903602480888367, "learning_rate": 0.0001832574483525731, "loss": 0.20066887140274048, "mean_token_accuracy": 0.9172261506319046, "num_tokens": 36316156.0, "step": 2944 }, { "entropy": 1.2736486494541168, "epoch": 1.5508162190626646, "grad_norm": 0.29723483324050903, "learning_rate": 0.0001832447079351698, "loss": 0.19067001342773438, "mean_token_accuracy": 0.9212439507246017, "num_tokens": 36328492.0, "step": 2945 }, { "entropy": 1.2396992444992065, "epoch": 1.551342812006319, "grad_norm": 0.29464191198349, "learning_rate": 0.0001832319631696551, "loss": 0.23630069196224213, "mean_token_accuracy": 0.9037884026765823, "num_tokens": 36340828.0, "step": 2946 }, { "entropy": 1.1540693938732147, "epoch": 1.5518694049499737, "grad_norm": 0.2827843129634857, "learning_rate": 0.00018321921405678554, "loss": 0.19755500555038452, "mean_token_accuracy": 0.9163824766874313, "num_tokens": 36353164.0, "step": 2947 }, { "entropy": 1.2334130108356476, "epoch": 1.5523959978936284, "grad_norm": 0.2816913425922394, "learning_rate": 0.000183206460597318, "loss": 0.20551520586013794, "mean_token_accuracy": 0.9176173806190491, "num_tokens": 36365500.0, "step": 2948 }, { "entropy": 1.1994071006774902, "epoch": 1.5529225908372828, "grad_norm": 0.278768390417099, "learning_rate": 0.0001831937027920096, "loss": 0.19148175418376923, "mean_token_accuracy": 0.9233074188232422, "num_tokens": 36377836.0, "step": 2949 }, { "entropy": 1.1344974339008331, "epoch": 1.5534491837809372, "grad_norm": 0.28436407446861267, "learning_rate": 0.00018318094064161765, "loss": 0.20278222858905792, "mean_token_accuracy": 0.9229292422533035, "num_tokens": 36390172.0, "step": 2950 }, { "entropy": 1.1987184286117554, "epoch": 1.5539757767245919, "grad_norm": 0.29216986894607544, "learning_rate": 0.0001831681741468998, "loss": 0.21907229721546173, "mean_token_accuracy": 0.9171420633792877, "num_tokens": 36402508.0, "step": 2951 }, { "entropy": 1.1500971913337708, "epoch": 1.5545023696682465, "grad_norm": 0.2810475826263428, "learning_rate": 0.00018315540330861386, "loss": 0.18719711899757385, "mean_token_accuracy": 0.9203604012727737, "num_tokens": 36414844.0, "step": 2952 }, { "entropy": 1.1963881850242615, "epoch": 1.555028962611901, "grad_norm": 0.26603206992149353, "learning_rate": 0.0001831426281275181, "loss": 0.1819818615913391, "mean_token_accuracy": 0.9269210547208786, "num_tokens": 36427180.0, "step": 2953 }, { "entropy": 1.1963586807250977, "epoch": 1.5555555555555556, "grad_norm": 0.26459643244743347, "learning_rate": 0.00018312984860437072, "loss": 0.1856173276901245, "mean_token_accuracy": 0.9259962737560272, "num_tokens": 36439516.0, "step": 2954 }, { "entropy": 1.2363464832305908, "epoch": 1.5560821484992102, "grad_norm": 0.2887548804283142, "learning_rate": 0.00018311706473993051, "loss": 0.21210099756717682, "mean_token_accuracy": 0.9151240438222885, "num_tokens": 36451852.0, "step": 2955 }, { "entropy": 1.2128595113754272, "epoch": 1.5566087414428647, "grad_norm": 0.25528791546821594, "learning_rate": 0.00018310427653495632, "loss": 0.18278326094150543, "mean_token_accuracy": 0.9265086054801941, "num_tokens": 36464188.0, "step": 2956 }, { "entropy": 1.2223176658153534, "epoch": 1.557135334386519, "grad_norm": 0.28269702196121216, "learning_rate": 0.0001830914839902073, "loss": 0.18532417714595795, "mean_token_accuracy": 0.9275024235248566, "num_tokens": 36476524.0, "step": 2957 }, { "entropy": 1.21820667386055, "epoch": 1.5576619273301737, "grad_norm": 0.28611740469932556, "learning_rate": 0.0001830786871064429, "loss": 0.1948256492614746, "mean_token_accuracy": 0.918529212474823, "num_tokens": 36488860.0, "step": 2958 }, { "entropy": 1.2262729704380035, "epoch": 1.5581885202738284, "grad_norm": 0.31858813762664795, "learning_rate": 0.00018306588588442278, "loss": 0.21474799513816833, "mean_token_accuracy": 0.9137346744537354, "num_tokens": 36501196.0, "step": 2959 }, { "entropy": 1.2295315265655518, "epoch": 1.5587151132174828, "grad_norm": 0.2632119357585907, "learning_rate": 0.00018305308032490688, "loss": 0.17983609437942505, "mean_token_accuracy": 0.9228373020887375, "num_tokens": 36513532.0, "step": 2960 }, { "entropy": 1.1716614663600922, "epoch": 1.5592417061611374, "grad_norm": 0.29031118750572205, "learning_rate": 0.0001830402704286554, "loss": 0.2138049602508545, "mean_token_accuracy": 0.9134559780359268, "num_tokens": 36525868.0, "step": 2961 }, { "entropy": 1.223358392715454, "epoch": 1.559768299104792, "grad_norm": 0.2957732677459717, "learning_rate": 0.00018302745619642874, "loss": 0.20625029504299164, "mean_token_accuracy": 0.9132367968559265, "num_tokens": 36538204.0, "step": 2962 }, { "entropy": 1.2663150429725647, "epoch": 1.5602948920484465, "grad_norm": 0.28148961067199707, "learning_rate": 0.00018301463762898765, "loss": 0.21098777651786804, "mean_token_accuracy": 0.9172250628471375, "num_tokens": 36550540.0, "step": 2963 }, { "entropy": 1.20645871758461, "epoch": 1.5608214849921012, "grad_norm": 0.25845208764076233, "learning_rate": 0.0001830018147270931, "loss": 0.18882045149803162, "mean_token_accuracy": 0.9250784367322922, "num_tokens": 36562876.0, "step": 2964 }, { "entropy": 1.2523989081382751, "epoch": 1.5613480779357558, "grad_norm": 0.2542496919631958, "learning_rate": 0.0001829889874915063, "loss": 0.19145433604717255, "mean_token_accuracy": 0.9239866137504578, "num_tokens": 36575212.0, "step": 2965 }, { "entropy": 1.262599766254425, "epoch": 1.5618746708794102, "grad_norm": 0.25594037771224976, "learning_rate": 0.00018297615592298872, "loss": 0.18396718800067902, "mean_token_accuracy": 0.9223331660032272, "num_tokens": 36587548.0, "step": 2966 }, { "entropy": 1.2905260622501373, "epoch": 1.5624012638230647, "grad_norm": 0.2649231255054474, "learning_rate": 0.00018296332002230208, "loss": 0.2021484375, "mean_token_accuracy": 0.9192336350679398, "num_tokens": 36599884.0, "step": 2967 }, { "entropy": 1.3087227940559387, "epoch": 1.5629278567667193, "grad_norm": 0.2674988806247711, "learning_rate": 0.00018295047979020843, "loss": 0.20633465051651, "mean_token_accuracy": 0.9197041392326355, "num_tokens": 36612220.0, "step": 2968 }, { "entropy": 1.2428779602050781, "epoch": 1.563454449710374, "grad_norm": 0.3095720112323761, "learning_rate": 0.00018293763522746995, "loss": 0.21707621216773987, "mean_token_accuracy": 0.909159705042839, "num_tokens": 36624556.0, "step": 2969 }, { "entropy": 1.2382693886756897, "epoch": 1.5639810426540284, "grad_norm": 0.2674081325531006, "learning_rate": 0.0001829247863348492, "loss": 0.19426822662353516, "mean_token_accuracy": 0.9186785072088242, "num_tokens": 36636892.0, "step": 2970 }, { "entropy": 1.3028753995895386, "epoch": 1.564507635597683, "grad_norm": 0.32122448086738586, "learning_rate": 0.0001829119331131089, "loss": 0.20461226999759674, "mean_token_accuracy": 0.9157003164291382, "num_tokens": 36649228.0, "step": 2971 }, { "entropy": 1.2865008413791656, "epoch": 1.5650342285413377, "grad_norm": 0.2696692645549774, "learning_rate": 0.0001828990755630121, "loss": 0.21100306510925293, "mean_token_accuracy": 0.9124954044818878, "num_tokens": 36661564.0, "step": 2972 }, { "entropy": 1.2516160607337952, "epoch": 1.565560821484992, "grad_norm": 0.2710763216018677, "learning_rate": 0.0001828862136853221, "loss": 0.1940108835697174, "mean_token_accuracy": 0.9198983609676361, "num_tokens": 36673900.0, "step": 2973 }, { "entropy": 1.286393016576767, "epoch": 1.5660874144286465, "grad_norm": 0.2848055958747864, "learning_rate": 0.00018287334748080236, "loss": 0.20404544472694397, "mean_token_accuracy": 0.9162185341119766, "num_tokens": 36686236.0, "step": 2974 }, { "entropy": 1.3426242470741272, "epoch": 1.5666140073723012, "grad_norm": 0.2882706820964813, "learning_rate": 0.00018286047695021678, "loss": 0.22008925676345825, "mean_token_accuracy": 0.9098223000764847, "num_tokens": 36698572.0, "step": 2975 }, { "entropy": 1.3892289400100708, "epoch": 1.5671406003159558, "grad_norm": 0.3032713532447815, "learning_rate": 0.0001828476020943293, "loss": 0.20148518681526184, "mean_token_accuracy": 0.9154692888259888, "num_tokens": 36710908.0, "step": 2976 }, { "entropy": 1.3957372307777405, "epoch": 1.5676671932596102, "grad_norm": 0.29055866599082947, "learning_rate": 0.0001828347229139043, "loss": 0.21428599953651428, "mean_token_accuracy": 0.9150131195783615, "num_tokens": 36723244.0, "step": 2977 }, { "entropy": 1.3814803957939148, "epoch": 1.5681937862032649, "grad_norm": 0.32633841037750244, "learning_rate": 0.00018282183940970627, "loss": 0.21884474158287048, "mean_token_accuracy": 0.9115358591079712, "num_tokens": 36735580.0, "step": 2978 }, { "entropy": 1.4007826447486877, "epoch": 1.5687203791469195, "grad_norm": 0.25024279952049255, "learning_rate": 0.00018280895158250012, "loss": 0.1829865425825119, "mean_token_accuracy": 0.9268663376569748, "num_tokens": 36747916.0, "step": 2979 }, { "entropy": 1.4274977445602417, "epoch": 1.569246972090574, "grad_norm": 0.3046821057796478, "learning_rate": 0.00018279605943305084, "loss": 0.2076328843832016, "mean_token_accuracy": 0.9161526709794998, "num_tokens": 36760252.0, "step": 2980 }, { "entropy": 1.3855017125606537, "epoch": 1.5697735650342284, "grad_norm": 0.3147059381008148, "learning_rate": 0.0001827831629621238, "loss": 0.21519812941551208, "mean_token_accuracy": 0.911521315574646, "num_tokens": 36772588.0, "step": 2981 }, { "entropy": 1.400354415178299, "epoch": 1.5703001579778832, "grad_norm": 0.264636367559433, "learning_rate": 0.00018277026217048464, "loss": 0.18982136249542236, "mean_token_accuracy": 0.9241060167551041, "num_tokens": 36784924.0, "step": 2982 }, { "entropy": 1.3857916295528412, "epoch": 1.5708267509215377, "grad_norm": 0.2669126093387604, "learning_rate": 0.0001827573570588991, "loss": 0.18247658014297485, "mean_token_accuracy": 0.927479475736618, "num_tokens": 36797260.0, "step": 2983 }, { "entropy": 1.3634335398674011, "epoch": 1.571353343865192, "grad_norm": 0.2893115282058716, "learning_rate": 0.00018274444762813333, "loss": 0.21217575669288635, "mean_token_accuracy": 0.9115361571311951, "num_tokens": 36809596.0, "step": 2984 }, { "entropy": 1.4070159196853638, "epoch": 1.5718799368088467, "grad_norm": 0.28923332691192627, "learning_rate": 0.0001827315338789537, "loss": 0.20832975208759308, "mean_token_accuracy": 0.9146668463945389, "num_tokens": 36821932.0, "step": 2985 }, { "entropy": 1.3532110452651978, "epoch": 1.5724065297525014, "grad_norm": 0.31392931938171387, "learning_rate": 0.00018271861581212686, "loss": 0.22782333195209503, "mean_token_accuracy": 0.9090021848678589, "num_tokens": 36834268.0, "step": 2986 }, { "entropy": 1.3118796646595001, "epoch": 1.5729331226961558, "grad_norm": 0.266999751329422, "learning_rate": 0.00018270569342841958, "loss": 0.18851986527442932, "mean_token_accuracy": 0.9194877445697784, "num_tokens": 36846604.0, "step": 2987 }, { "entropy": 1.312853455543518, "epoch": 1.5734597156398105, "grad_norm": 0.31233277916908264, "learning_rate": 0.00018269276672859905, "loss": 0.2123054414987564, "mean_token_accuracy": 0.913995623588562, "num_tokens": 36858940.0, "step": 2988 }, { "entropy": 1.3079098761081696, "epoch": 1.573986308583465, "grad_norm": 0.32085880637168884, "learning_rate": 0.0001826798357134327, "loss": 0.20270395278930664, "mean_token_accuracy": 0.9202222973108292, "num_tokens": 36871276.0, "step": 2989 }, { "entropy": 1.2647546529769897, "epoch": 1.5745129015271195, "grad_norm": 0.28355729579925537, "learning_rate": 0.00018266690038368805, "loss": 0.21255768835544586, "mean_token_accuracy": 0.9135896861553192, "num_tokens": 36883612.0, "step": 2990 }, { "entropy": 1.3451344072818756, "epoch": 1.575039494470774, "grad_norm": 0.2934354543685913, "learning_rate": 0.00018265396074013308, "loss": 0.1980549544095993, "mean_token_accuracy": 0.9198568016290665, "num_tokens": 36895948.0, "step": 2991 }, { "entropy": 1.3011061251163483, "epoch": 1.5755660874144286, "grad_norm": 0.2980000674724579, "learning_rate": 0.00018264101678353592, "loss": 0.217035174369812, "mean_token_accuracy": 0.9113334864377975, "num_tokens": 36908284.0, "step": 2992 }, { "entropy": 1.3149963021278381, "epoch": 1.5760926803580833, "grad_norm": 0.2599365711212158, "learning_rate": 0.000182628068514665, "loss": 0.18322350084781647, "mean_token_accuracy": 0.9244182854890823, "num_tokens": 36920620.0, "step": 2993 }, { "entropy": 1.2898566722869873, "epoch": 1.5766192733017377, "grad_norm": 0.2668352425098419, "learning_rate": 0.0001826151159342889, "loss": 0.21018338203430176, "mean_token_accuracy": 0.915318638086319, "num_tokens": 36932956.0, "step": 2994 }, { "entropy": 1.3840532004833221, "epoch": 1.5771458662453923, "grad_norm": 0.3147556781768799, "learning_rate": 0.00018260215904317666, "loss": 0.19453351199626923, "mean_token_accuracy": 0.9237265735864639, "num_tokens": 36945292.0, "step": 2995 }, { "entropy": 1.3175931572914124, "epoch": 1.577672459189047, "grad_norm": 0.2718995213508606, "learning_rate": 0.00018258919784209737, "loss": 0.20508694648742676, "mean_token_accuracy": 0.9145184606313705, "num_tokens": 36957628.0, "step": 2996 }, { "entropy": 1.270597904920578, "epoch": 1.5781990521327014, "grad_norm": 0.28836652636528015, "learning_rate": 0.0001825762323318205, "loss": 0.21483203768730164, "mean_token_accuracy": 0.9124789834022522, "num_tokens": 36969964.0, "step": 2997 }, { "entropy": 1.295089215040207, "epoch": 1.5787256450763558, "grad_norm": 0.2733713686466217, "learning_rate": 0.00018256326251311572, "loss": 0.20500729978084564, "mean_token_accuracy": 0.9173796772956848, "num_tokens": 36982300.0, "step": 2998 }, { "entropy": 1.337970644235611, "epoch": 1.5792522380200107, "grad_norm": 0.2778991162776947, "learning_rate": 0.00018255028838675297, "loss": 0.20565159618854523, "mean_token_accuracy": 0.9136320203542709, "num_tokens": 36994636.0, "step": 2999 }, { "entropy": 1.2989743649959564, "epoch": 1.5797788309636651, "grad_norm": 0.25889068841934204, "learning_rate": 0.00018253730995350246, "loss": 0.20373526215553284, "mean_token_accuracy": 0.9146820902824402, "num_tokens": 37006972.0, "step": 3000 }, { "entropy": 1.2905791997909546, "epoch": 1.5803054239073195, "grad_norm": 0.2675490081310272, "learning_rate": 0.00018252432721413463, "loss": 0.1987248659133911, "mean_token_accuracy": 0.9181516915559769, "num_tokens": 37019308.0, "step": 3001 }, { "entropy": 1.361492395401001, "epoch": 1.5808320168509742, "grad_norm": 0.2765367329120636, "learning_rate": 0.00018251134016942017, "loss": 0.2040756493806839, "mean_token_accuracy": 0.9120943993330002, "num_tokens": 37031644.0, "step": 3002 }, { "entropy": 1.315775990486145, "epoch": 1.5813586097946288, "grad_norm": 0.29613080620765686, "learning_rate": 0.00018249834882013013, "loss": 0.22368191182613373, "mean_token_accuracy": 0.9061230272054672, "num_tokens": 37043980.0, "step": 3003 }, { "entropy": 1.3352965414524078, "epoch": 1.5818852027382833, "grad_norm": 0.27554982900619507, "learning_rate": 0.0001824853531670356, "loss": 0.19793741405010223, "mean_token_accuracy": 0.9158347100019455, "num_tokens": 37056316.0, "step": 3004 }, { "entropy": 1.316037505865097, "epoch": 1.582411795681938, "grad_norm": 0.27454736828804016, "learning_rate": 0.00018247235321090818, "loss": 0.18979346752166748, "mean_token_accuracy": 0.9240574240684509, "num_tokens": 37068652.0, "step": 3005 }, { "entropy": 1.3708411157131195, "epoch": 1.5829383886255926, "grad_norm": 0.3125503361225128, "learning_rate": 0.00018245934895251954, "loss": 0.2330584079027176, "mean_token_accuracy": 0.9037808179855347, "num_tokens": 37080988.0, "step": 3006 }, { "entropy": 1.3388588428497314, "epoch": 1.583464981569247, "grad_norm": 0.26093074679374695, "learning_rate": 0.00018244634039264168, "loss": 0.18843436241149902, "mean_token_accuracy": 0.9198068231344223, "num_tokens": 37093324.0, "step": 3007 }, { "entropy": 1.329328566789627, "epoch": 1.5839915745129014, "grad_norm": 0.263508141040802, "learning_rate": 0.00018243332753204683, "loss": 0.1939357966184616, "mean_token_accuracy": 0.9173231720924377, "num_tokens": 37105660.0, "step": 3008 }, { "entropy": 1.3546556532382965, "epoch": 1.584518167456556, "grad_norm": 0.30631089210510254, "learning_rate": 0.00018242031037150753, "loss": 0.21186725795269012, "mean_token_accuracy": 0.9202042520046234, "num_tokens": 37117996.0, "step": 3009 }, { "entropy": 1.3740338385105133, "epoch": 1.5850447604002107, "grad_norm": 0.2766059935092926, "learning_rate": 0.00018240728891179647, "loss": 0.21025089919567108, "mean_token_accuracy": 0.9121541678905487, "num_tokens": 37130332.0, "step": 3010 }, { "entropy": 1.3977608382701874, "epoch": 1.5855713533438651, "grad_norm": 0.2912761867046356, "learning_rate": 0.0001823942631536867, "loss": 0.19623880088329315, "mean_token_accuracy": 0.9209590405225754, "num_tokens": 37142668.0, "step": 3011 }, { "entropy": 1.3947394490242004, "epoch": 1.5860979462875198, "grad_norm": 0.2996085584163666, "learning_rate": 0.00018238123309795146, "loss": 0.21346694231033325, "mean_token_accuracy": 0.913955420255661, "num_tokens": 37155004.0, "step": 3012 }, { "entropy": 1.4347988963127136, "epoch": 1.5866245392311744, "grad_norm": 0.2614869475364685, "learning_rate": 0.0001823681987453643, "loss": 0.19650410115718842, "mean_token_accuracy": 0.9160020351409912, "num_tokens": 37167340.0, "step": 3013 }, { "entropy": 1.4444604516029358, "epoch": 1.5871511321748288, "grad_norm": 0.2813529074192047, "learning_rate": 0.00018235516009669898, "loss": 0.21237128973007202, "mean_token_accuracy": 0.9177996516227722, "num_tokens": 37179676.0, "step": 3014 }, { "entropy": 1.4176826477050781, "epoch": 1.5876777251184833, "grad_norm": 0.26034414768218994, "learning_rate": 0.00018234211715272952, "loss": 0.19177646934986115, "mean_token_accuracy": 0.9230294227600098, "num_tokens": 37192012.0, "step": 3015 }, { "entropy": 1.4028598964214325, "epoch": 1.5882043180621381, "grad_norm": 0.24113664031028748, "learning_rate": 0.00018232906991423015, "loss": 0.18486344814300537, "mean_token_accuracy": 0.9242925494909286, "num_tokens": 37204348.0, "step": 3016 }, { "entropy": 1.4833852052688599, "epoch": 1.5887309110057926, "grad_norm": 0.2903052866458893, "learning_rate": 0.00018231601838197551, "loss": 0.21897634863853455, "mean_token_accuracy": 0.913661926984787, "num_tokens": 37216684.0, "step": 3017 }, { "entropy": 1.4880701303482056, "epoch": 1.589257503949447, "grad_norm": 0.27285730838775635, "learning_rate": 0.00018230296255674039, "loss": 0.20681525766849518, "mean_token_accuracy": 0.9199357628822327, "num_tokens": 37229020.0, "step": 3018 }, { "entropy": 1.499198168516159, "epoch": 1.5897840968931016, "grad_norm": 0.26768195629119873, "learning_rate": 0.00018228990243929972, "loss": 0.1827520728111267, "mean_token_accuracy": 0.9268405586481094, "num_tokens": 37241356.0, "step": 3019 }, { "entropy": 1.4143783450126648, "epoch": 1.5903106898367563, "grad_norm": 0.24908189475536346, "learning_rate": 0.00018227683803042895, "loss": 0.1842612624168396, "mean_token_accuracy": 0.9244772493839264, "num_tokens": 37253692.0, "step": 3020 }, { "entropy": 1.4475407600402832, "epoch": 1.5908372827804107, "grad_norm": 0.2763029634952545, "learning_rate": 0.0001822637693309035, "loss": 0.20840662717819214, "mean_token_accuracy": 0.9138160645961761, "num_tokens": 37266028.0, "step": 3021 }, { "entropy": 1.4383432567119598, "epoch": 1.5913638757240653, "grad_norm": 0.26852625608444214, "learning_rate": 0.00018225069634149929, "loss": 0.18256303668022156, "mean_token_accuracy": 0.9246383905410767, "num_tokens": 37278364.0, "step": 3022 }, { "entropy": 1.4704687893390656, "epoch": 1.59189046866772, "grad_norm": 0.2806725800037384, "learning_rate": 0.00018223761906299233, "loss": 0.20903661847114563, "mean_token_accuracy": 0.9137071222066879, "num_tokens": 37290700.0, "step": 3023 }, { "entropy": 1.459957629442215, "epoch": 1.5924170616113744, "grad_norm": 0.2818518280982971, "learning_rate": 0.00018222453749615897, "loss": 0.19897016882896423, "mean_token_accuracy": 0.9180968701839447, "num_tokens": 37303036.0, "step": 3024 }, { "entropy": 1.4267137944698334, "epoch": 1.5929436545550288, "grad_norm": 0.27753016352653503, "learning_rate": 0.0001822114516417758, "loss": 0.19683846831321716, "mean_token_accuracy": 0.9210103005170822, "num_tokens": 37315372.0, "step": 3025 }, { "entropy": 1.4476919174194336, "epoch": 1.5934702474986835, "grad_norm": 0.31564968824386597, "learning_rate": 0.00018219836150061957, "loss": 0.2070121020078659, "mean_token_accuracy": 0.9174090623855591, "num_tokens": 37327708.0, "step": 3026 }, { "entropy": 1.4439688622951508, "epoch": 1.5939968404423381, "grad_norm": 0.30953073501586914, "learning_rate": 0.00018218526707346745, "loss": 0.20584158599376678, "mean_token_accuracy": 0.9158007055521011, "num_tokens": 37340044.0, "step": 3027 }, { "entropy": 1.3989494144916534, "epoch": 1.5945234333859926, "grad_norm": 0.2637103497982025, "learning_rate": 0.0001821721683610968, "loss": 0.1927478164434433, "mean_token_accuracy": 0.9223356992006302, "num_tokens": 37352380.0, "step": 3028 }, { "entropy": 1.4854789972305298, "epoch": 1.5950500263296472, "grad_norm": 0.36630088090896606, "learning_rate": 0.0001821590653642851, "loss": 0.20990176498889923, "mean_token_accuracy": 0.9147738516330719, "num_tokens": 37364716.0, "step": 3029 }, { "entropy": 1.4564665853977203, "epoch": 1.5955766192733019, "grad_norm": 0.26051509380340576, "learning_rate": 0.00018214595808381027, "loss": 0.18453973531723022, "mean_token_accuracy": 0.9241913110017776, "num_tokens": 37377052.0, "step": 3030 }, { "entropy": 1.4754319489002228, "epoch": 1.5961032122169563, "grad_norm": 0.29275190830230713, "learning_rate": 0.00018213284652045044, "loss": 0.21073368191719055, "mean_token_accuracy": 0.9117372781038284, "num_tokens": 37389388.0, "step": 3031 }, { "entropy": 1.4840569198131561, "epoch": 1.5966298051606107, "grad_norm": 0.3072666525840759, "learning_rate": 0.00018211973067498388, "loss": 0.21400286257266998, "mean_token_accuracy": 0.9100693017244339, "num_tokens": 37401724.0, "step": 3032 }, { "entropy": 1.4717089235782623, "epoch": 1.5971563981042654, "grad_norm": 0.2699028551578522, "learning_rate": 0.00018210661054818928, "loss": 0.19959458708763123, "mean_token_accuracy": 0.9229124337434769, "num_tokens": 37414060.0, "step": 3033 }, { "entropy": 1.4640864431858063, "epoch": 1.59768299104792, "grad_norm": 0.2825060486793518, "learning_rate": 0.00018209348614084552, "loss": 0.20268788933753967, "mean_token_accuracy": 0.9144919216632843, "num_tokens": 37426396.0, "step": 3034 }, { "entropy": 1.4468800127506256, "epoch": 1.5982095839915744, "grad_norm": 0.2595546841621399, "learning_rate": 0.00018208035745373164, "loss": 0.19899562001228333, "mean_token_accuracy": 0.9162727296352386, "num_tokens": 37438732.0, "step": 3035 }, { "entropy": 1.350676715373993, "epoch": 1.598736176935229, "grad_norm": 0.24199891090393066, "learning_rate": 0.00018206722448762709, "loss": 0.1900622546672821, "mean_token_accuracy": 0.9200112372636795, "num_tokens": 37451068.0, "step": 3036 }, { "entropy": 1.400856375694275, "epoch": 1.5992627698788837, "grad_norm": 0.27306118607521057, "learning_rate": 0.00018205408724331141, "loss": 0.20936831831932068, "mean_token_accuracy": 0.914875254034996, "num_tokens": 37463404.0, "step": 3037 }, { "entropy": 1.4073627889156342, "epoch": 1.5997893628225381, "grad_norm": 0.2765679359436035, "learning_rate": 0.00018204094572156458, "loss": 0.20035390555858612, "mean_token_accuracy": 0.9182957410812378, "num_tokens": 37475740.0, "step": 3038 }, { "entropy": 1.3531818389892578, "epoch": 1.6003159557661928, "grad_norm": 0.2836569845676422, "learning_rate": 0.00018202779992316668, "loss": 0.19704091548919678, "mean_token_accuracy": 0.9173637330532074, "num_tokens": 37488076.0, "step": 3039 }, { "entropy": 1.3923197388648987, "epoch": 1.6008425487098474, "grad_norm": 0.27982088923454285, "learning_rate": 0.0001820146498488981, "loss": 0.1999388188123703, "mean_token_accuracy": 0.9147376418113708, "num_tokens": 37500412.0, "step": 3040 }, { "entropy": 1.3494668304920197, "epoch": 1.6013691416535019, "grad_norm": 0.26349878311157227, "learning_rate": 0.00018200149549953948, "loss": 0.18103967607021332, "mean_token_accuracy": 0.9260935634374619, "num_tokens": 37512748.0, "step": 3041 }, { "entropy": 1.3204819858074188, "epoch": 1.6018957345971563, "grad_norm": 0.25867944955825806, "learning_rate": 0.00018198833687587174, "loss": 0.1823253035545349, "mean_token_accuracy": 0.9261195659637451, "num_tokens": 37525084.0, "step": 3042 }, { "entropy": 1.3195437788963318, "epoch": 1.602422327540811, "grad_norm": 0.2801850736141205, "learning_rate": 0.000181975173978676, "loss": 0.20542439818382263, "mean_token_accuracy": 0.923522487282753, "num_tokens": 37537420.0, "step": 3043 }, { "entropy": 1.2695345878601074, "epoch": 1.6029489204844656, "grad_norm": 0.2899746298789978, "learning_rate": 0.00018196200680873373, "loss": 0.20561306178569794, "mean_token_accuracy": 0.9245081543922424, "num_tokens": 37549756.0, "step": 3044 }, { "entropy": 1.3507100939750671, "epoch": 1.60347551342812, "grad_norm": 0.2811649739742279, "learning_rate": 0.00018194883536682647, "loss": 0.1866132616996765, "mean_token_accuracy": 0.9258896708488464, "num_tokens": 37562092.0, "step": 3045 }, { "entropy": 1.3393961191177368, "epoch": 1.6040021063717746, "grad_norm": 0.28140196204185486, "learning_rate": 0.0001819356596537363, "loss": 0.20368412137031555, "mean_token_accuracy": 0.9165063202381134, "num_tokens": 37574428.0, "step": 3046 }, { "entropy": 1.359088659286499, "epoch": 1.6045286993154293, "grad_norm": 0.27477335929870605, "learning_rate": 0.0001819224796702452, "loss": 0.19396814703941345, "mean_token_accuracy": 0.9202080518007278, "num_tokens": 37586764.0, "step": 3047 }, { "entropy": 1.3814587593078613, "epoch": 1.6050552922590837, "grad_norm": 0.29211121797561646, "learning_rate": 0.00018190929541713572, "loss": 0.20291253924369812, "mean_token_accuracy": 0.9152930378913879, "num_tokens": 37599100.0, "step": 3048 }, { "entropy": 1.3579456806182861, "epoch": 1.6055818852027381, "grad_norm": 0.28613388538360596, "learning_rate": 0.0001818961068951905, "loss": 0.20026324689388275, "mean_token_accuracy": 0.9189726412296295, "num_tokens": 37611436.0, "step": 3049 }, { "entropy": 1.3749539852142334, "epoch": 1.6061084781463928, "grad_norm": 0.2683996558189392, "learning_rate": 0.00018188291410519244, "loss": 0.1952074021100998, "mean_token_accuracy": 0.920792356133461, "num_tokens": 37623772.0, "step": 3050 }, { "entropy": 1.3418311476707458, "epoch": 1.6066350710900474, "grad_norm": 0.2496364861726761, "learning_rate": 0.00018186971704792473, "loss": 0.1910889744758606, "mean_token_accuracy": 0.922058030962944, "num_tokens": 37636108.0, "step": 3051 }, { "entropy": 1.4323306381702423, "epoch": 1.6071616640337019, "grad_norm": 0.29833361506462097, "learning_rate": 0.00018185651572417082, "loss": 0.2218259572982788, "mean_token_accuracy": 0.9126611351966858, "num_tokens": 37648444.0, "step": 3052 }, { "entropy": 1.4041076600551605, "epoch": 1.6076882569773565, "grad_norm": 0.268341600894928, "learning_rate": 0.00018184331013471435, "loss": 0.1920214593410492, "mean_token_accuracy": 0.921149805188179, "num_tokens": 37660780.0, "step": 3053 }, { "entropy": 1.425819456577301, "epoch": 1.6082148499210112, "grad_norm": 0.2559536099433899, "learning_rate": 0.00018183010028033936, "loss": 0.190832257270813, "mean_token_accuracy": 0.9199120700359344, "num_tokens": 37673116.0, "step": 3054 }, { "entropy": 1.434893399477005, "epoch": 1.6087414428646656, "grad_norm": 0.2749493420124054, "learning_rate": 0.0001818168861618299, "loss": 0.2014118880033493, "mean_token_accuracy": 0.919294461607933, "num_tokens": 37685452.0, "step": 3055 }, { "entropy": 1.438273936510086, "epoch": 1.60926803580832, "grad_norm": 0.275410532951355, "learning_rate": 0.00018180366777997053, "loss": 0.19788864254951477, "mean_token_accuracy": 0.9188237637281418, "num_tokens": 37697788.0, "step": 3056 }, { "entropy": 1.432799518108368, "epoch": 1.6097946287519749, "grad_norm": 0.2629889249801636, "learning_rate": 0.00018179044513554592, "loss": 0.19507870078086853, "mean_token_accuracy": 0.9229663461446762, "num_tokens": 37710124.0, "step": 3057 }, { "entropy": 1.4455545842647552, "epoch": 1.6103212216956293, "grad_norm": 0.26387691497802734, "learning_rate": 0.00018177721822934097, "loss": 0.19666314125061035, "mean_token_accuracy": 0.9165372550487518, "num_tokens": 37722460.0, "step": 3058 }, { "entropy": 1.4410416781902313, "epoch": 1.6108478146392837, "grad_norm": 0.2629290819168091, "learning_rate": 0.00018176398706214094, "loss": 0.19509999454021454, "mean_token_accuracy": 0.9173319488763809, "num_tokens": 37734796.0, "step": 3059 }, { "entropy": 1.4279845058918, "epoch": 1.6113744075829384, "grad_norm": 0.2658042311668396, "learning_rate": 0.0001817507516347313, "loss": 0.19231608510017395, "mean_token_accuracy": 0.9192933142185211, "num_tokens": 37747132.0, "step": 3060 }, { "entropy": 1.4642042517662048, "epoch": 1.611901000526593, "grad_norm": 0.28102269768714905, "learning_rate": 0.0001817375119478977, "loss": 0.20499512553215027, "mean_token_accuracy": 0.9162133932113647, "num_tokens": 37759468.0, "step": 3061 }, { "entropy": 1.4484304189682007, "epoch": 1.6124275934702474, "grad_norm": 0.27475789189338684, "learning_rate": 0.00018172426800242613, "loss": 0.20957040786743164, "mean_token_accuracy": 0.9155688285827637, "num_tokens": 37771804.0, "step": 3062 }, { "entropy": 1.482906699180603, "epoch": 1.612954186413902, "grad_norm": 0.29586583375930786, "learning_rate": 0.00018171101979910282, "loss": 0.22400207817554474, "mean_token_accuracy": 0.909784346818924, "num_tokens": 37784140.0, "step": 3063 }, { "entropy": 1.4169412851333618, "epoch": 1.6134807793575567, "grad_norm": 0.27837517857551575, "learning_rate": 0.00018169776733871422, "loss": 0.20341360569000244, "mean_token_accuracy": 0.9175834655761719, "num_tokens": 37796476.0, "step": 3064 }, { "entropy": 1.4276740849018097, "epoch": 1.6140073723012112, "grad_norm": 0.2935931086540222, "learning_rate": 0.00018168451062204705, "loss": 0.2186911404132843, "mean_token_accuracy": 0.9123528748750687, "num_tokens": 37808812.0, "step": 3065 }, { "entropy": 1.365132212638855, "epoch": 1.6145339652448656, "grad_norm": 0.28768110275268555, "learning_rate": 0.0001816712496498883, "loss": 0.200998455286026, "mean_token_accuracy": 0.9152180403470993, "num_tokens": 37821148.0, "step": 3066 }, { "entropy": 1.3745067417621613, "epoch": 1.6150605581885202, "grad_norm": 0.27627506852149963, "learning_rate": 0.0001816579844230252, "loss": 0.18625864386558533, "mean_token_accuracy": 0.924001932144165, "num_tokens": 37833484.0, "step": 3067 }, { "entropy": 1.4378848373889923, "epoch": 1.6155871511321749, "grad_norm": 0.2882876992225647, "learning_rate": 0.00018164471494224523, "loss": 0.2090378701686859, "mean_token_accuracy": 0.9168783128261566, "num_tokens": 37845820.0, "step": 3068 }, { "entropy": 1.3996251821517944, "epoch": 1.6161137440758293, "grad_norm": 0.2672761380672455, "learning_rate": 0.00018163144120833608, "loss": 0.1835557073354721, "mean_token_accuracy": 0.9194261729717255, "num_tokens": 37858156.0, "step": 3069 }, { "entropy": 1.4170182049274445, "epoch": 1.616640337019484, "grad_norm": 0.27003446221351624, "learning_rate": 0.0001816181632220858, "loss": 0.19711357355117798, "mean_token_accuracy": 0.9203603714704514, "num_tokens": 37870492.0, "step": 3070 }, { "entropy": 1.3691149055957794, "epoch": 1.6171669299631386, "grad_norm": 0.3474653661251068, "learning_rate": 0.00018160488098428257, "loss": 0.20167282223701477, "mean_token_accuracy": 0.9143191576004028, "num_tokens": 37882828.0, "step": 3071 }, { "entropy": 1.4236225485801697, "epoch": 1.617693522906793, "grad_norm": 0.2758263349533081, "learning_rate": 0.00018159159449571488, "loss": 0.17881087958812714, "mean_token_accuracy": 0.9302650541067123, "num_tokens": 37895164.0, "step": 3072 }, { "entropy": 1.3676467835903168, "epoch": 1.6182201158504474, "grad_norm": 0.2386929839849472, "learning_rate": 0.00018157830375717152, "loss": 0.17412015795707703, "mean_token_accuracy": 0.9283822029829025, "num_tokens": 37907500.0, "step": 3073 }, { "entropy": 1.3564641177654266, "epoch": 1.6187467087941023, "grad_norm": 0.27638673782348633, "learning_rate": 0.00018156500876944146, "loss": 0.19623751938343048, "mean_token_accuracy": 0.9200726747512817, "num_tokens": 37919836.0, "step": 3074 }, { "entropy": 1.3610458672046661, "epoch": 1.6192733017377567, "grad_norm": 0.26332005858421326, "learning_rate": 0.00018155170953331395, "loss": 0.20123399794101715, "mean_token_accuracy": 0.9213415533304214, "num_tokens": 37932172.0, "step": 3075 }, { "entropy": 1.3856143057346344, "epoch": 1.6197998946814112, "grad_norm": 0.271820604801178, "learning_rate": 0.00018153840604957845, "loss": 0.20177248120307922, "mean_token_accuracy": 0.9182474464178085, "num_tokens": 37944508.0, "step": 3076 }, { "entropy": 1.4035983979701996, "epoch": 1.6203264876250658, "grad_norm": 0.2817936837673187, "learning_rate": 0.00018152509831902475, "loss": 0.20706719160079956, "mean_token_accuracy": 0.9193074107170105, "num_tokens": 37956844.0, "step": 3077 }, { "entropy": 1.3983607590198517, "epoch": 1.6208530805687205, "grad_norm": 0.28577920794487, "learning_rate": 0.00018151178634244285, "loss": 0.20233751833438873, "mean_token_accuracy": 0.9215396642684937, "num_tokens": 37969180.0, "step": 3078 }, { "entropy": 1.3775334060192108, "epoch": 1.6213796735123749, "grad_norm": 0.27165067195892334, "learning_rate": 0.00018149847012062303, "loss": 0.20568159222602844, "mean_token_accuracy": 0.9150748550891876, "num_tokens": 37981516.0, "step": 3079 }, { "entropy": 1.3893254697322845, "epoch": 1.6219062664560295, "grad_norm": 0.2963791489601135, "learning_rate": 0.0001814851496543557, "loss": 0.2330780327320099, "mean_token_accuracy": 0.9025420695543289, "num_tokens": 37993852.0, "step": 3080 }, { "entropy": 1.413798749446869, "epoch": 1.6224328593996842, "grad_norm": 0.28095170855522156, "learning_rate": 0.00018147182494443175, "loss": 0.21211260557174683, "mean_token_accuracy": 0.9117957949638367, "num_tokens": 38006188.0, "step": 3081 }, { "entropy": 1.3956659436225891, "epoch": 1.6229594523433386, "grad_norm": 0.24814847111701965, "learning_rate": 0.00018145849599164205, "loss": 0.19040384888648987, "mean_token_accuracy": 0.9219196736812592, "num_tokens": 38018524.0, "step": 3082 }, { "entropy": 1.4209897816181183, "epoch": 1.623486045286993, "grad_norm": 0.2665543854236603, "learning_rate": 0.00018144516279677798, "loss": 0.17405079305171967, "mean_token_accuracy": 0.9293960332870483, "num_tokens": 38030860.0, "step": 3083 }, { "entropy": 1.4261830151081085, "epoch": 1.6240126382306477, "grad_norm": 0.25339123606681824, "learning_rate": 0.000181431825360631, "loss": 0.19218730926513672, "mean_token_accuracy": 0.923881396651268, "num_tokens": 38043196.0, "step": 3084 }, { "entropy": 1.4016647636890411, "epoch": 1.6245392311743023, "grad_norm": 0.2759294807910919, "learning_rate": 0.00018141848368399287, "loss": 0.2100793719291687, "mean_token_accuracy": 0.917973980307579, "num_tokens": 38055532.0, "step": 3085 }, { "entropy": 1.4507297277450562, "epoch": 1.6250658241179567, "grad_norm": 0.2608982026576996, "learning_rate": 0.00018140513776765564, "loss": 0.19737984240055084, "mean_token_accuracy": 0.9216252714395523, "num_tokens": 38067868.0, "step": 3086 }, { "entropy": 1.3792197108268738, "epoch": 1.6255924170616114, "grad_norm": 0.24353928864002228, "learning_rate": 0.00018139178761241155, "loss": 0.18090927600860596, "mean_token_accuracy": 0.9230251908302307, "num_tokens": 38080204.0, "step": 3087 }, { "entropy": 1.4379716217517853, "epoch": 1.626119010005266, "grad_norm": 0.2893258035182953, "learning_rate": 0.00018137843321905316, "loss": 0.1988956481218338, "mean_token_accuracy": 0.9219255745410919, "num_tokens": 38092540.0, "step": 3088 }, { "entropy": 1.451730102300644, "epoch": 1.6266456029489205, "grad_norm": 0.2763747572898865, "learning_rate": 0.00018136507458837317, "loss": 0.20928485691547394, "mean_token_accuracy": 0.9120761156082153, "num_tokens": 38104876.0, "step": 3089 }, { "entropy": 1.3144610822200775, "epoch": 1.627172195892575, "grad_norm": 0.2689838111400604, "learning_rate": 0.00018135171172116465, "loss": 0.18982107937335968, "mean_token_accuracy": 0.9245468080043793, "num_tokens": 38117212.0, "step": 3090 }, { "entropy": 1.4066085815429688, "epoch": 1.6276987888362298, "grad_norm": 0.30367499589920044, "learning_rate": 0.0001813383446182209, "loss": 0.22956493496894836, "mean_token_accuracy": 0.9036817699670792, "num_tokens": 38129548.0, "step": 3091 }, { "entropy": 1.4063359797000885, "epoch": 1.6282253817798842, "grad_norm": 0.28438472747802734, "learning_rate": 0.0001813249732803354, "loss": 0.20594382286071777, "mean_token_accuracy": 0.9164040237665176, "num_tokens": 38141884.0, "step": 3092 }, { "entropy": 1.3957843482494354, "epoch": 1.6287519747235386, "grad_norm": 0.2880820333957672, "learning_rate": 0.00018131159770830201, "loss": 0.21393732726573944, "mean_token_accuracy": 0.9140539467334747, "num_tokens": 38154220.0, "step": 3093 }, { "entropy": 1.378790944814682, "epoch": 1.6292785676671933, "grad_norm": 0.2896707057952881, "learning_rate": 0.00018129821790291464, "loss": 0.19451484084129333, "mean_token_accuracy": 0.9213518798351288, "num_tokens": 38166556.0, "step": 3094 }, { "entropy": 1.3447534143924713, "epoch": 1.629805160610848, "grad_norm": 0.2766105532646179, "learning_rate": 0.00018128483386496767, "loss": 0.18321573734283447, "mean_token_accuracy": 0.9283481389284134, "num_tokens": 38178892.0, "step": 3095 }, { "entropy": 1.3944838345050812, "epoch": 1.6303317535545023, "grad_norm": 0.2913741171360016, "learning_rate": 0.00018127144559525554, "loss": 0.21014010906219482, "mean_token_accuracy": 0.9120883643627167, "num_tokens": 38191228.0, "step": 3096 }, { "entropy": 1.368843674659729, "epoch": 1.630858346498157, "grad_norm": 0.29250389337539673, "learning_rate": 0.00018125805309457312, "loss": 0.18993695080280304, "mean_token_accuracy": 0.9213495254516602, "num_tokens": 38203564.0, "step": 3097 }, { "entropy": 1.3401963114738464, "epoch": 1.6313849394418116, "grad_norm": 0.2760806083679199, "learning_rate": 0.00018124465636371541, "loss": 0.19008806347846985, "mean_token_accuracy": 0.9225458651781082, "num_tokens": 38215900.0, "step": 3098 }, { "entropy": 1.2728153765201569, "epoch": 1.631911532385466, "grad_norm": 0.26979056000709534, "learning_rate": 0.0001812312554034777, "loss": 0.20473819971084595, "mean_token_accuracy": 0.9232187569141388, "num_tokens": 38228236.0, "step": 3099 }, { "entropy": 1.3584931790828705, "epoch": 1.6324381253291205, "grad_norm": 0.2959223687648773, "learning_rate": 0.00018121785021465552, "loss": 0.2270255982875824, "mean_token_accuracy": 0.905184268951416, "num_tokens": 38240572.0, "step": 3100 }, { "entropy": 1.3553913831710815, "epoch": 1.6329647182727751, "grad_norm": 0.26358816027641296, "learning_rate": 0.00018120444079804465, "loss": 0.20057646930217743, "mean_token_accuracy": 0.9184893518686295, "num_tokens": 38252908.0, "step": 3101 }, { "entropy": 1.3980708122253418, "epoch": 1.6334913112164298, "grad_norm": 0.2931104302406311, "learning_rate": 0.00018119102715444116, "loss": 0.21116019785404205, "mean_token_accuracy": 0.9135480672121048, "num_tokens": 38265244.0, "step": 3102 }, { "entropy": 1.4063577055931091, "epoch": 1.6340179041600842, "grad_norm": 0.2717793583869934, "learning_rate": 0.00018117760928464133, "loss": 0.20886561274528503, "mean_token_accuracy": 0.9101425409317017, "num_tokens": 38277580.0, "step": 3103 }, { "entropy": 1.4049569368362427, "epoch": 1.6345444971037388, "grad_norm": 0.2535911500453949, "learning_rate": 0.00018116418718944167, "loss": 0.1921328455209732, "mean_token_accuracy": 0.9207909554243088, "num_tokens": 38289916.0, "step": 3104 }, { "entropy": 1.4364557266235352, "epoch": 1.6350710900473935, "grad_norm": 0.2491796612739563, "learning_rate": 0.000181150760869639, "loss": 0.19639377295970917, "mean_token_accuracy": 0.9185868501663208, "num_tokens": 38302252.0, "step": 3105 }, { "entropy": 1.422313004732132, "epoch": 1.635597682991048, "grad_norm": 0.2487051635980606, "learning_rate": 0.00018113733032603036, "loss": 0.18390119075775146, "mean_token_accuracy": 0.9225007146596909, "num_tokens": 38314588.0, "step": 3106 }, { "entropy": 1.4768524467945099, "epoch": 1.6361242759347023, "grad_norm": 0.26604220271110535, "learning_rate": 0.000181123895559413, "loss": 0.18640431761741638, "mean_token_accuracy": 0.925470381975174, "num_tokens": 38326924.0, "step": 3107 }, { "entropy": 1.407800167798996, "epoch": 1.636650868878357, "grad_norm": 0.2594732642173767, "learning_rate": 0.00018111045657058454, "loss": 0.20143477618694305, "mean_token_accuracy": 0.9186883568763733, "num_tokens": 38339260.0, "step": 3108 }, { "entropy": 1.4646252691745758, "epoch": 1.6371774618220116, "grad_norm": 0.2773849666118622, "learning_rate": 0.00018109701336034272, "loss": 0.21977382898330688, "mean_token_accuracy": 0.9103269428014755, "num_tokens": 38351596.0, "step": 3109 }, { "entropy": 1.4419430792331696, "epoch": 1.637704054765666, "grad_norm": 0.2626135051250458, "learning_rate": 0.0001810835659294856, "loss": 0.19379013776779175, "mean_token_accuracy": 0.9196373075246811, "num_tokens": 38363932.0, "step": 3110 }, { "entropy": 1.5183590054512024, "epoch": 1.6382306477093207, "grad_norm": 0.2934761047363281, "learning_rate": 0.0001810701142788115, "loss": 0.1913427710533142, "mean_token_accuracy": 0.9219005703926086, "num_tokens": 38376268.0, "step": 3111 }, { "entropy": 1.4548234045505524, "epoch": 1.6387572406529753, "grad_norm": 0.2878572344779968, "learning_rate": 0.00018105665840911894, "loss": 0.19860300421714783, "mean_token_accuracy": 0.9160057157278061, "num_tokens": 38388604.0, "step": 3112 }, { "entropy": 1.4858933091163635, "epoch": 1.6392838335966298, "grad_norm": 0.3022295832633972, "learning_rate": 0.0001810431983212067, "loss": 0.20890842378139496, "mean_token_accuracy": 0.9164535999298096, "num_tokens": 38400940.0, "step": 3113 }, { "entropy": 1.4954878389835358, "epoch": 1.6398104265402842, "grad_norm": 0.2701857388019562, "learning_rate": 0.00018102973401587386, "loss": 0.19486674666404724, "mean_token_accuracy": 0.9214330017566681, "num_tokens": 38413276.0, "step": 3114 }, { "entropy": 1.4851151406764984, "epoch": 1.640337019483939, "grad_norm": 0.2806397080421448, "learning_rate": 0.0001810162654939197, "loss": 0.19537058472633362, "mean_token_accuracy": 0.9198283851146698, "num_tokens": 38425612.0, "step": 3115 }, { "entropy": 1.5154271125793457, "epoch": 1.6408636124275935, "grad_norm": 0.30362340807914734, "learning_rate": 0.00018100279275614378, "loss": 0.20024994015693665, "mean_token_accuracy": 0.9208974838256836, "num_tokens": 38437948.0, "step": 3116 }, { "entropy": 1.4964538216590881, "epoch": 1.641390205371248, "grad_norm": 0.27380117774009705, "learning_rate": 0.00018098931580334587, "loss": 0.19451157748699188, "mean_token_accuracy": 0.922481581568718, "num_tokens": 38450284.0, "step": 3117 }, { "entropy": 1.4973836839199066, "epoch": 1.6419167983149026, "grad_norm": 0.2761797606945038, "learning_rate": 0.00018097583463632606, "loss": 0.20249421894550323, "mean_token_accuracy": 0.9215444773435593, "num_tokens": 38462620.0, "step": 3118 }, { "entropy": 1.5529511272907257, "epoch": 1.6424433912585572, "grad_norm": 0.289413183927536, "learning_rate": 0.0001809623492558846, "loss": 0.2158457338809967, "mean_token_accuracy": 0.9128688126802444, "num_tokens": 38474956.0, "step": 3119 }, { "entropy": 1.5039259195327759, "epoch": 1.6429699842022116, "grad_norm": 0.2677723467350006, "learning_rate": 0.0001809488596628221, "loss": 0.2032872885465622, "mean_token_accuracy": 0.9197664707899094, "num_tokens": 38487292.0, "step": 3120 }, { "entropy": 1.5852990448474884, "epoch": 1.6434965771458663, "grad_norm": 0.2714881896972656, "learning_rate": 0.0001809353658579393, "loss": 0.2129548341035843, "mean_token_accuracy": 0.9137803167104721, "num_tokens": 38499628.0, "step": 3121 }, { "entropy": 1.5083645284175873, "epoch": 1.644023170089521, "grad_norm": 0.32005801796913147, "learning_rate": 0.00018092186784203729, "loss": 0.20612075924873352, "mean_token_accuracy": 0.9157820492982864, "num_tokens": 38511964.0, "step": 3122 }, { "entropy": 1.563103348016739, "epoch": 1.6445497630331753, "grad_norm": 0.2607233226299286, "learning_rate": 0.00018090836561591734, "loss": 0.19675372540950775, "mean_token_accuracy": 0.9205005466938019, "num_tokens": 38524300.0, "step": 3123 }, { "entropy": 1.559066355228424, "epoch": 1.6450763559768298, "grad_norm": 0.2431030124425888, "learning_rate": 0.000180894859180381, "loss": 0.19404737651348114, "mean_token_accuracy": 0.9214319586753845, "num_tokens": 38536636.0, "step": 3124 }, { "entropy": 1.5827949941158295, "epoch": 1.6456029489204844, "grad_norm": 0.2936856150627136, "learning_rate": 0.0001808813485362301, "loss": 0.21814733743667603, "mean_token_accuracy": 0.9099378287792206, "num_tokens": 38548972.0, "step": 3125 }, { "entropy": 1.578831136226654, "epoch": 1.646129541864139, "grad_norm": 0.2785643935203552, "learning_rate": 0.00018086783368426664, "loss": 0.19619745016098022, "mean_token_accuracy": 0.9219939261674881, "num_tokens": 38561308.0, "step": 3126 }, { "entropy": 1.5287668108940125, "epoch": 1.6466561348077935, "grad_norm": 0.2629009485244751, "learning_rate": 0.00018085431462529295, "loss": 0.19254928827285767, "mean_token_accuracy": 0.9238256067037582, "num_tokens": 38573644.0, "step": 3127 }, { "entropy": 1.5286193788051605, "epoch": 1.6471827277514481, "grad_norm": 0.2730830907821655, "learning_rate": 0.00018084079136011157, "loss": 0.21922871470451355, "mean_token_accuracy": 0.9088734835386276, "num_tokens": 38585980.0, "step": 3128 }, { "entropy": 1.5122800767421722, "epoch": 1.6477093206951028, "grad_norm": 0.2737482786178589, "learning_rate": 0.0001808272638895253, "loss": 0.20768514275550842, "mean_token_accuracy": 0.913787379860878, "num_tokens": 38598316.0, "step": 3129 }, { "entropy": 1.5126305520534515, "epoch": 1.6482359136387572, "grad_norm": 0.2560437321662903, "learning_rate": 0.00018081373221433717, "loss": 0.18702422082424164, "mean_token_accuracy": 0.9235630929470062, "num_tokens": 38610652.0, "step": 3130 }, { "entropy": 1.425947904586792, "epoch": 1.6487625065824116, "grad_norm": 0.26945164799690247, "learning_rate": 0.00018080019633535051, "loss": 0.2076614946126938, "mean_token_accuracy": 0.914527490735054, "num_tokens": 38622988.0, "step": 3131 }, { "entropy": 1.4670809209346771, "epoch": 1.6492890995260665, "grad_norm": 0.27858737111091614, "learning_rate": 0.00018078665625336887, "loss": 0.20628421008586884, "mean_token_accuracy": 0.9157915860414505, "num_tokens": 38635324.0, "step": 3132 }, { "entropy": 1.358038753271103, "epoch": 1.649815692469721, "grad_norm": 0.24805906414985657, "learning_rate": 0.00018077311196919597, "loss": 0.18904471397399902, "mean_token_accuracy": 0.9245041012763977, "num_tokens": 38647660.0, "step": 3133 }, { "entropy": 1.324582278728485, "epoch": 1.6503422854133754, "grad_norm": 0.2563723027706146, "learning_rate": 0.00018075956348363595, "loss": 0.1867881715297699, "mean_token_accuracy": 0.9226547628641129, "num_tokens": 38659996.0, "step": 3134 }, { "entropy": 1.320959597826004, "epoch": 1.65086887835703, "grad_norm": 0.2722032070159912, "learning_rate": 0.00018074601079749307, "loss": 0.182020366191864, "mean_token_accuracy": 0.9248357862234116, "num_tokens": 38672332.0, "step": 3135 }, { "entropy": 1.2622464001178741, "epoch": 1.6513954713006846, "grad_norm": 0.27287331223487854, "learning_rate": 0.00018073245391157184, "loss": 0.20617710053920746, "mean_token_accuracy": 0.9157890826463699, "num_tokens": 38684668.0, "step": 3136 }, { "entropy": 1.2935321927070618, "epoch": 1.651922064244339, "grad_norm": 0.29414066672325134, "learning_rate": 0.00018071889282667708, "loss": 0.20646268129348755, "mean_token_accuracy": 0.9180812388658524, "num_tokens": 38697004.0, "step": 3137 }, { "entropy": 1.2393367290496826, "epoch": 1.6524486571879937, "grad_norm": 0.27941057085990906, "learning_rate": 0.00018070532754361387, "loss": 0.19918499886989594, "mean_token_accuracy": 0.9213303327560425, "num_tokens": 38709340.0, "step": 3138 }, { "entropy": 1.2073590159416199, "epoch": 1.6529752501316484, "grad_norm": 0.2652994394302368, "learning_rate": 0.00018069175806318747, "loss": 0.2018781453371048, "mean_token_accuracy": 0.9207476526498795, "num_tokens": 38721676.0, "step": 3139 }, { "entropy": 1.2771650850772858, "epoch": 1.6535018430753028, "grad_norm": 0.3261018991470337, "learning_rate": 0.00018067818438620336, "loss": 0.23345033824443817, "mean_token_accuracy": 0.9006090611219406, "num_tokens": 38734012.0, "step": 3140 }, { "entropy": 1.2039735317230225, "epoch": 1.6540284360189572, "grad_norm": 0.265409916639328, "learning_rate": 0.0001806646065134674, "loss": 0.19166678190231323, "mean_token_accuracy": 0.9186943769454956, "num_tokens": 38746348.0, "step": 3141 }, { "entropy": 1.1508864760398865, "epoch": 1.6545550289626119, "grad_norm": 0.2634056806564331, "learning_rate": 0.00018065102444578566, "loss": 0.20034006237983704, "mean_token_accuracy": 0.9211664348840714, "num_tokens": 38758684.0, "step": 3142 }, { "entropy": 1.1475915908813477, "epoch": 1.6550816219062665, "grad_norm": 0.2569848895072937, "learning_rate": 0.00018063743818396436, "loss": 0.18887409567832947, "mean_token_accuracy": 0.9205733388662338, "num_tokens": 38771020.0, "step": 3143 }, { "entropy": 1.1361444592475891, "epoch": 1.655608214849921, "grad_norm": 0.23779945075511932, "learning_rate": 0.00018062384772881004, "loss": 0.17688196897506714, "mean_token_accuracy": 0.9271897524595261, "num_tokens": 38783356.0, "step": 3144 }, { "entropy": 1.2171200811862946, "epoch": 1.6561348077935756, "grad_norm": 0.2639971375465393, "learning_rate": 0.00018061025308112953, "loss": 0.19022762775421143, "mean_token_accuracy": 0.9262509793043137, "num_tokens": 38795692.0, "step": 3145 }, { "entropy": 1.1198914051055908, "epoch": 1.6566614007372302, "grad_norm": 0.27189239859580994, "learning_rate": 0.00018059665424172987, "loss": 0.19100147485733032, "mean_token_accuracy": 0.9232686161994934, "num_tokens": 38808028.0, "step": 3146 }, { "entropy": 1.1745660603046417, "epoch": 1.6571879936808847, "grad_norm": 0.26474079489707947, "learning_rate": 0.00018058305121141827, "loss": 0.187790185213089, "mean_token_accuracy": 0.9250635355710983, "num_tokens": 38820364.0, "step": 3147 }, { "entropy": 1.1938625872135162, "epoch": 1.657714586624539, "grad_norm": 0.26579174399375916, "learning_rate": 0.0001805694439910023, "loss": 0.19708439707756042, "mean_token_accuracy": 0.9244084358215332, "num_tokens": 38832700.0, "step": 3148 }, { "entropy": 1.1665718257427216, "epoch": 1.658241179568194, "grad_norm": 0.28311535716056824, "learning_rate": 0.0001805558325812898, "loss": 0.2201116979122162, "mean_token_accuracy": 0.9134600609540939, "num_tokens": 38845036.0, "step": 3149 }, { "entropy": 1.1456275880336761, "epoch": 1.6587677725118484, "grad_norm": 0.2647797763347626, "learning_rate": 0.0001805422169830887, "loss": 0.20335599780082703, "mean_token_accuracy": 0.9210527390241623, "num_tokens": 38857372.0, "step": 3150 }, { "entropy": 1.2212076783180237, "epoch": 1.6592943654555028, "grad_norm": 0.2934233844280243, "learning_rate": 0.00018052859719720735, "loss": 0.21342241764068604, "mean_token_accuracy": 0.9127740412950516, "num_tokens": 38869708.0, "step": 3151 }, { "entropy": 1.1577803790569305, "epoch": 1.6598209583991574, "grad_norm": 0.28830140829086304, "learning_rate": 0.0001805149732244543, "loss": 0.22134548425674438, "mean_token_accuracy": 0.9122626036405563, "num_tokens": 38882044.0, "step": 3152 }, { "entropy": 1.1979770064353943, "epoch": 1.660347551342812, "grad_norm": 0.29721346497535706, "learning_rate": 0.0001805013450656382, "loss": 0.2053031623363495, "mean_token_accuracy": 0.9165612608194351, "num_tokens": 38894380.0, "step": 3153 }, { "entropy": 1.234178513288498, "epoch": 1.6608741442864665, "grad_norm": 0.25609639286994934, "learning_rate": 0.00018048771272156821, "loss": 0.18612919747829437, "mean_token_accuracy": 0.9224274605512619, "num_tokens": 38906716.0, "step": 3154 }, { "entropy": 1.1776945292949677, "epoch": 1.6614007372301212, "grad_norm": 0.30163243412971497, "learning_rate": 0.00018047407619305354, "loss": 0.20453007519245148, "mean_token_accuracy": 0.9143376648426056, "num_tokens": 38919052.0, "step": 3155 }, { "entropy": 1.1364782750606537, "epoch": 1.6619273301737758, "grad_norm": 0.26865363121032715, "learning_rate": 0.00018046043548090371, "loss": 0.19255727529525757, "mean_token_accuracy": 0.9212214797735214, "num_tokens": 38931388.0, "step": 3156 }, { "entropy": 1.1973776817321777, "epoch": 1.6624539231174302, "grad_norm": 0.290986031293869, "learning_rate": 0.0001804467905859285, "loss": 0.21269451081752777, "mean_token_accuracy": 0.9207015186548233, "num_tokens": 38943724.0, "step": 3157 }, { "entropy": 1.2418961226940155, "epoch": 1.6629805160610847, "grad_norm": 0.2690465748310089, "learning_rate": 0.00018043314150893795, "loss": 0.18485507369041443, "mean_token_accuracy": 0.923929750919342, "num_tokens": 38956060.0, "step": 3158 }, { "entropy": 1.2224768996238708, "epoch": 1.6635071090047393, "grad_norm": 0.2874819040298462, "learning_rate": 0.0001804194882507423, "loss": 0.20011025667190552, "mean_token_accuracy": 0.9204146862030029, "num_tokens": 38968396.0, "step": 3159 }, { "entropy": 1.2215831875801086, "epoch": 1.664033701948394, "grad_norm": 0.303321897983551, "learning_rate": 0.00018040583081215206, "loss": 0.21922917664051056, "mean_token_accuracy": 0.9072663635015488, "num_tokens": 38980732.0, "step": 3160 }, { "entropy": 1.3148879706859589, "epoch": 1.6645602948920484, "grad_norm": 0.3454381227493286, "learning_rate": 0.00018039216919397798, "loss": 0.23111680150032043, "mean_token_accuracy": 0.9131344109773636, "num_tokens": 38993068.0, "step": 3161 }, { "entropy": 1.2151626348495483, "epoch": 1.665086887835703, "grad_norm": 0.2705059349536896, "learning_rate": 0.00018037850339703112, "loss": 0.2070206105709076, "mean_token_accuracy": 0.915043517947197, "num_tokens": 39005404.0, "step": 3162 }, { "entropy": 1.2460331618785858, "epoch": 1.6656134807793577, "grad_norm": 0.28544241189956665, "learning_rate": 0.00018036483342212268, "loss": 0.2099902629852295, "mean_token_accuracy": 0.9136664867401123, "num_tokens": 39017740.0, "step": 3163 }, { "entropy": 1.2310877740383148, "epoch": 1.666140073723012, "grad_norm": 0.2626836895942688, "learning_rate": 0.00018035115927006424, "loss": 0.2030152976512909, "mean_token_accuracy": 0.9205620735883713, "num_tokens": 39030076.0, "step": 3164 }, { "entropy": 1.3169174790382385, "epoch": 1.6666666666666665, "grad_norm": 0.2741585373878479, "learning_rate": 0.00018033748094166746, "loss": 0.19826257228851318, "mean_token_accuracy": 0.9195802211761475, "num_tokens": 39042412.0, "step": 3165 }, { "entropy": 1.2823103368282318, "epoch": 1.6671932596103214, "grad_norm": 0.25388139486312866, "learning_rate": 0.00018032379843774442, "loss": 0.20759499073028564, "mean_token_accuracy": 0.9136326611042023, "num_tokens": 39054748.0, "step": 3166 }, { "entropy": 1.2326855063438416, "epoch": 1.6677198525539758, "grad_norm": 0.2549154758453369, "learning_rate": 0.00018031011175910738, "loss": 0.20668521523475647, "mean_token_accuracy": 0.9171313345432281, "num_tokens": 39067084.0, "step": 3167 }, { "entropy": 1.2375471889972687, "epoch": 1.6682464454976302, "grad_norm": 0.2682606279850006, "learning_rate": 0.00018029642090656878, "loss": 0.19891971349716187, "mean_token_accuracy": 0.9194265604019165, "num_tokens": 39079420.0, "step": 3168 }, { "entropy": 1.2905383706092834, "epoch": 1.6687730384412849, "grad_norm": 0.2665676176548004, "learning_rate": 0.00018028272588094138, "loss": 0.19952955842018127, "mean_token_accuracy": 0.9163491129875183, "num_tokens": 39091756.0, "step": 3169 }, { "entropy": 1.2198565304279327, "epoch": 1.6692996313849395, "grad_norm": 0.28037944436073303, "learning_rate": 0.00018026902668303818, "loss": 0.19893498718738556, "mean_token_accuracy": 0.9220035374164581, "num_tokens": 39104092.0, "step": 3170 }, { "entropy": 1.1831121444702148, "epoch": 1.669826224328594, "grad_norm": 0.2583988904953003, "learning_rate": 0.00018025532331367243, "loss": 0.17476224899291992, "mean_token_accuracy": 0.9299489706754684, "num_tokens": 39116428.0, "step": 3171 }, { "entropy": 1.2536409497261047, "epoch": 1.6703528172722486, "grad_norm": 0.28530681133270264, "learning_rate": 0.0001802416157736576, "loss": 0.1837761104106903, "mean_token_accuracy": 0.9242200702428818, "num_tokens": 39128764.0, "step": 3172 }, { "entropy": 1.2332830131053925, "epoch": 1.6708794102159032, "grad_norm": 0.29961588978767395, "learning_rate": 0.00018022790406380747, "loss": 0.2195456326007843, "mean_token_accuracy": 0.9104225635528564, "num_tokens": 39141100.0, "step": 3173 }, { "entropy": 1.1516872346401215, "epoch": 1.6714060031595577, "grad_norm": 0.2845155596733093, "learning_rate": 0.00018021418818493597, "loss": 0.20701955258846283, "mean_token_accuracy": 0.9150958508253098, "num_tokens": 39153436.0, "step": 3174 }, { "entropy": 1.2093952596187592, "epoch": 1.671932596103212, "grad_norm": 0.29277166724205017, "learning_rate": 0.00018020046813785735, "loss": 0.1868697553873062, "mean_token_accuracy": 0.9202113300561905, "num_tokens": 39165772.0, "step": 3175 }, { "entropy": 1.1511423885822296, "epoch": 1.6724591890468667, "grad_norm": 0.282686710357666, "learning_rate": 0.00018018674392338612, "loss": 0.18359015882015228, "mean_token_accuracy": 0.9301719814538956, "num_tokens": 39178108.0, "step": 3176 }, { "entropy": 1.158335953950882, "epoch": 1.6729857819905214, "grad_norm": 0.2753232419490814, "learning_rate": 0.00018017301554233697, "loss": 0.2069041132926941, "mean_token_accuracy": 0.9147633165121078, "num_tokens": 39190444.0, "step": 3177 }, { "entropy": 1.194052815437317, "epoch": 1.6735123749341758, "grad_norm": 0.2822655141353607, "learning_rate": 0.0001801592829955249, "loss": 0.1951710730791092, "mean_token_accuracy": 0.9215719550848007, "num_tokens": 39202780.0, "step": 3178 }, { "entropy": 1.151505172252655, "epoch": 1.6740389678778305, "grad_norm": 0.28857794404029846, "learning_rate": 0.00018014554628376512, "loss": 0.20368535816669464, "mean_token_accuracy": 0.9183078706264496, "num_tokens": 39215116.0, "step": 3179 }, { "entropy": 1.2312898933887482, "epoch": 1.674565560821485, "grad_norm": 0.306927353143692, "learning_rate": 0.00018013180540787309, "loss": 0.2206253558397293, "mean_token_accuracy": 0.9108968675136566, "num_tokens": 39227452.0, "step": 3180 }, { "entropy": 1.2053121328353882, "epoch": 1.6750921537651395, "grad_norm": 0.27955883741378784, "learning_rate": 0.00018011806036866452, "loss": 0.19037887454032898, "mean_token_accuracy": 0.917056143283844, "num_tokens": 39239788.0, "step": 3181 }, { "entropy": 1.1672830879688263, "epoch": 1.675618746708794, "grad_norm": 0.28999653458595276, "learning_rate": 0.0001801043111669554, "loss": 0.19952133297920227, "mean_token_accuracy": 0.917973592877388, "num_tokens": 39252124.0, "step": 3182 }, { "entropy": 1.2045989036560059, "epoch": 1.6761453396524486, "grad_norm": 0.28392067551612854, "learning_rate": 0.0001800905578035619, "loss": 0.2129674255847931, "mean_token_accuracy": 0.9127481281757355, "num_tokens": 39264460.0, "step": 3183 }, { "entropy": 1.19984170794487, "epoch": 1.6766719325961033, "grad_norm": 0.25406205654144287, "learning_rate": 0.00018007680027930053, "loss": 0.19678980112075806, "mean_token_accuracy": 0.9213206321001053, "num_tokens": 39276796.0, "step": 3184 }, { "entropy": 1.1855994760990143, "epoch": 1.6771985255397577, "grad_norm": 0.2667410373687744, "learning_rate": 0.00018006303859498794, "loss": 0.19079680740833282, "mean_token_accuracy": 0.9214341640472412, "num_tokens": 39289132.0, "step": 3185 }, { "entropy": 1.2297048270702362, "epoch": 1.6777251184834123, "grad_norm": 0.2681465446949005, "learning_rate": 0.0001800492727514411, "loss": 0.209198996424675, "mean_token_accuracy": 0.9140588194131851, "num_tokens": 39301468.0, "step": 3186 }, { "entropy": 1.2474170923233032, "epoch": 1.678251711427067, "grad_norm": 0.29584237933158875, "learning_rate": 0.00018003550274947727, "loss": 0.2179972529411316, "mean_token_accuracy": 0.910770982503891, "num_tokens": 39313804.0, "step": 3187 }, { "entropy": 1.2513139247894287, "epoch": 1.6787783043707214, "grad_norm": 0.26859045028686523, "learning_rate": 0.00018002172858991381, "loss": 0.19416972994804382, "mean_token_accuracy": 0.9244131296873093, "num_tokens": 39326140.0, "step": 3188 }, { "entropy": 1.2674452066421509, "epoch": 1.6793048973143758, "grad_norm": 0.2633540630340576, "learning_rate": 0.00018000795027356845, "loss": 0.206901416182518, "mean_token_accuracy": 0.9144023954868317, "num_tokens": 39338476.0, "step": 3189 }, { "entropy": 1.2862504124641418, "epoch": 1.6798314902580307, "grad_norm": 0.2601005434989929, "learning_rate": 0.00017999416780125908, "loss": 0.1940033733844757, "mean_token_accuracy": 0.9206139743328094, "num_tokens": 39350812.0, "step": 3190 }, { "entropy": 1.296876072883606, "epoch": 1.6803580832016851, "grad_norm": 0.2819749116897583, "learning_rate": 0.00017998038117380397, "loss": 0.20579656958580017, "mean_token_accuracy": 0.914523109793663, "num_tokens": 39363148.0, "step": 3191 }, { "entropy": 1.3008518517017365, "epoch": 1.6808846761453395, "grad_norm": 0.2690666913986206, "learning_rate": 0.00017996659039202148, "loss": 0.18763180077075958, "mean_token_accuracy": 0.9187602549791336, "num_tokens": 39375484.0, "step": 3192 }, { "entropy": 1.2868019342422485, "epoch": 1.6814112690889942, "grad_norm": 0.2677951753139496, "learning_rate": 0.00017995279545673034, "loss": 0.19632895290851593, "mean_token_accuracy": 0.9192786663770676, "num_tokens": 39387820.0, "step": 3193 }, { "entropy": 1.268946647644043, "epoch": 1.6819378620326488, "grad_norm": 0.2508223354816437, "learning_rate": 0.00017993899636874943, "loss": 0.18477728962898254, "mean_token_accuracy": 0.9243815243244171, "num_tokens": 39400156.0, "step": 3194 }, { "entropy": 1.322548896074295, "epoch": 1.6824644549763033, "grad_norm": 0.28498703241348267, "learning_rate": 0.00017992519312889796, "loss": 0.21436122059822083, "mean_token_accuracy": 0.9100509434938431, "num_tokens": 39412492.0, "step": 3195 }, { "entropy": 1.3395605385303497, "epoch": 1.682991047919958, "grad_norm": 0.26486754417419434, "learning_rate": 0.0001799113857379953, "loss": 0.1872069537639618, "mean_token_accuracy": 0.9222505837678909, "num_tokens": 39424828.0, "step": 3196 }, { "entropy": 1.308861881494522, "epoch": 1.6835176408636126, "grad_norm": 0.27471840381622314, "learning_rate": 0.00017989757419686116, "loss": 0.18717561662197113, "mean_token_accuracy": 0.9235621690750122, "num_tokens": 39437164.0, "step": 3197 }, { "entropy": 1.2929215729236603, "epoch": 1.684044233807267, "grad_norm": 0.2788255214691162, "learning_rate": 0.00017988375850631541, "loss": 0.20904980599880219, "mean_token_accuracy": 0.9153354316949844, "num_tokens": 39449500.0, "step": 3198 }, { "entropy": 1.2841696441173553, "epoch": 1.6845708267509214, "grad_norm": 0.30049991607666016, "learning_rate": 0.00017986993866717828, "loss": 0.2012903392314911, "mean_token_accuracy": 0.9142125397920609, "num_tokens": 39461836.0, "step": 3199 }, { "entropy": 1.261197030544281, "epoch": 1.685097419694576, "grad_norm": 0.2596745491027832, "learning_rate": 0.0001798561146802701, "loss": 0.1863638311624527, "mean_token_accuracy": 0.925238847732544, "num_tokens": 39474172.0, "step": 3200 }, { "entropy": 1.3221564590930939, "epoch": 1.6856240126382307, "grad_norm": 0.28279244899749756, "learning_rate": 0.00017984228654641153, "loss": 0.21060873568058014, "mean_token_accuracy": 0.9115581065416336, "num_tokens": 39486508.0, "step": 3201 }, { "entropy": 1.2866823077201843, "epoch": 1.6861506055818851, "grad_norm": 0.24817955493927002, "learning_rate": 0.00017982845426642348, "loss": 0.18661949038505554, "mean_token_accuracy": 0.9202256947755814, "num_tokens": 39498844.0, "step": 3202 }, { "entropy": 1.320129543542862, "epoch": 1.6866771985255398, "grad_norm": 0.2350441813468933, "learning_rate": 0.0001798146178411271, "loss": 0.17725782096385956, "mean_token_accuracy": 0.9308050870895386, "num_tokens": 39511180.0, "step": 3203 }, { "entropy": 1.410641998052597, "epoch": 1.6872037914691944, "grad_norm": 0.2893678545951843, "learning_rate": 0.00017980077727134376, "loss": 0.19813215732574463, "mean_token_accuracy": 0.9261365532875061, "num_tokens": 39523516.0, "step": 3204 }, { "entropy": 1.2950620353221893, "epoch": 1.6877303844128488, "grad_norm": 0.2544447183609009, "learning_rate": 0.0001797869325578951, "loss": 0.1995326578617096, "mean_token_accuracy": 0.9175571799278259, "num_tokens": 39535852.0, "step": 3205 }, { "entropy": 1.3695853650569916, "epoch": 1.6882569773565033, "grad_norm": 0.26028668880462646, "learning_rate": 0.00017977308370160304, "loss": 0.1951325535774231, "mean_token_accuracy": 0.9233993589878082, "num_tokens": 39548188.0, "step": 3206 }, { "entropy": 1.3739449977874756, "epoch": 1.6887835703001581, "grad_norm": 0.24822396039962769, "learning_rate": 0.00017975923070328965, "loss": 0.1763211488723755, "mean_token_accuracy": 0.9289481788873672, "num_tokens": 39560524.0, "step": 3207 }, { "entropy": 1.303276151418686, "epoch": 1.6893101632438126, "grad_norm": 0.234592005610466, "learning_rate": 0.00017974537356377733, "loss": 0.1826443076133728, "mean_token_accuracy": 0.925462156534195, "num_tokens": 39572860.0, "step": 3208 }, { "entropy": 1.353267639875412, "epoch": 1.689836756187467, "grad_norm": 0.25751370191574097, "learning_rate": 0.00017973151228388865, "loss": 0.18108654022216797, "mean_token_accuracy": 0.9255900233983994, "num_tokens": 39585196.0, "step": 3209 }, { "entropy": 1.3624829649925232, "epoch": 1.6903633491311216, "grad_norm": 0.27678364515304565, "learning_rate": 0.00017971764686444653, "loss": 0.20060954988002777, "mean_token_accuracy": 0.9197713881731033, "num_tokens": 39597532.0, "step": 3210 }, { "entropy": 1.3278814852237701, "epoch": 1.6908899420747763, "grad_norm": 0.26017773151397705, "learning_rate": 0.00017970377730627409, "loss": 0.1876058727502823, "mean_token_accuracy": 0.9261418581008911, "num_tokens": 39609868.0, "step": 3211 }, { "entropy": 1.335858404636383, "epoch": 1.6914165350184307, "grad_norm": 0.267092227935791, "learning_rate": 0.0001796899036101946, "loss": 0.20062491297721863, "mean_token_accuracy": 0.916288897395134, "num_tokens": 39622204.0, "step": 3212 }, { "entropy": 1.3814048171043396, "epoch": 1.6919431279620853, "grad_norm": 0.264210969209671, "learning_rate": 0.00017967602577703175, "loss": 0.19217954576015472, "mean_token_accuracy": 0.9183042198419571, "num_tokens": 39634540.0, "step": 3213 }, { "entropy": 1.3550595045089722, "epoch": 1.69246972090574, "grad_norm": 0.28114888072013855, "learning_rate": 0.00017966214380760938, "loss": 0.20994627475738525, "mean_token_accuracy": 0.9140847474336624, "num_tokens": 39646876.0, "step": 3214 }, { "entropy": 1.2746717631816864, "epoch": 1.6929963138493944, "grad_norm": 0.26488783955574036, "learning_rate": 0.0001796482577027515, "loss": 0.20270992815494537, "mean_token_accuracy": 0.9152298867702484, "num_tokens": 39659212.0, "step": 3215 }, { "entropy": 1.3254249095916748, "epoch": 1.6935229067930488, "grad_norm": 0.2747063636779785, "learning_rate": 0.00017963436746328253, "loss": 0.20579099655151367, "mean_token_accuracy": 0.9173053056001663, "num_tokens": 39671548.0, "step": 3216 }, { "entropy": 1.3438137471675873, "epoch": 1.6940494997367035, "grad_norm": 0.2942642569541931, "learning_rate": 0.00017962047309002702, "loss": 0.19839614629745483, "mean_token_accuracy": 0.9128136783838272, "num_tokens": 39683884.0, "step": 3217 }, { "entropy": 1.2776517271995544, "epoch": 1.6945760926803581, "grad_norm": 0.2709120213985443, "learning_rate": 0.0001796065745838098, "loss": 0.191197469830513, "mean_token_accuracy": 0.9194577038288116, "num_tokens": 39696220.0, "step": 3218 }, { "entropy": 1.338829666376114, "epoch": 1.6951026856240126, "grad_norm": 0.29193103313446045, "learning_rate": 0.00017959267194545597, "loss": 0.21261580288410187, "mean_token_accuracy": 0.9161190837621689, "num_tokens": 39708556.0, "step": 3219 }, { "entropy": 1.3053942620754242, "epoch": 1.6956292785676672, "grad_norm": 0.2555198669433594, "learning_rate": 0.00017957876517579076, "loss": 0.1975700557231903, "mean_token_accuracy": 0.9193883389234543, "num_tokens": 39720892.0, "step": 3220 }, { "entropy": 1.3086311519145966, "epoch": 1.6961558715113219, "grad_norm": 0.2704666554927826, "learning_rate": 0.00017956485427563984, "loss": 0.19425427913665771, "mean_token_accuracy": 0.9231333583593369, "num_tokens": 39733228.0, "step": 3221 }, { "entropy": 1.3097478151321411, "epoch": 1.6966824644549763, "grad_norm": 0.2648825943470001, "learning_rate": 0.000179550939245829, "loss": 0.1881440281867981, "mean_token_accuracy": 0.9222024977207184, "num_tokens": 39745564.0, "step": 3222 }, { "entropy": 1.341114103794098, "epoch": 1.6972090573986307, "grad_norm": 0.29292595386505127, "learning_rate": 0.00017953702008718426, "loss": 0.20591764152050018, "mean_token_accuracy": 0.9151119291782379, "num_tokens": 39757900.0, "step": 3223 }, { "entropy": 1.3235185742378235, "epoch": 1.6977356503422856, "grad_norm": 0.2651384472846985, "learning_rate": 0.0001795230968005319, "loss": 0.183737114071846, "mean_token_accuracy": 0.9256300330162048, "num_tokens": 39770236.0, "step": 3224 }, { "entropy": 1.3323991000652313, "epoch": 1.69826224328594, "grad_norm": 0.2805165946483612, "learning_rate": 0.0001795091693866985, "loss": 0.21993422508239746, "mean_token_accuracy": 0.9102575182914734, "num_tokens": 39782572.0, "step": 3225 }, { "entropy": 1.33993661403656, "epoch": 1.6987888362295944, "grad_norm": 0.2455688714981079, "learning_rate": 0.00017949523784651085, "loss": 0.1799536943435669, "mean_token_accuracy": 0.9266008138656616, "num_tokens": 39794908.0, "step": 3226 }, { "entropy": 1.3271623253822327, "epoch": 1.699315429173249, "grad_norm": 0.24277228116989136, "learning_rate": 0.00017948130218079598, "loss": 0.1912137269973755, "mean_token_accuracy": 0.9215309470891953, "num_tokens": 39807244.0, "step": 3227 }, { "entropy": 1.3194293975830078, "epoch": 1.6998420221169037, "grad_norm": 0.2657921612262726, "learning_rate": 0.00017946736239038118, "loss": 0.20347270369529724, "mean_token_accuracy": 0.9160242527723312, "num_tokens": 39819580.0, "step": 3228 }, { "entropy": 1.283385008573532, "epoch": 1.7003686150605581, "grad_norm": 0.2746362090110779, "learning_rate": 0.00017945341847609396, "loss": 0.19498057663440704, "mean_token_accuracy": 0.9214595407247543, "num_tokens": 39831916.0, "step": 3229 }, { "entropy": 1.3247983157634735, "epoch": 1.7008952080042128, "grad_norm": 0.2631048262119293, "learning_rate": 0.00017943947043876207, "loss": 0.19207647442817688, "mean_token_accuracy": 0.9226651191711426, "num_tokens": 39844252.0, "step": 3230 }, { "entropy": 1.3293734192848206, "epoch": 1.7014218009478674, "grad_norm": 0.28094783425331116, "learning_rate": 0.00017942551827921356, "loss": 0.2019774615764618, "mean_token_accuracy": 0.9162713438272476, "num_tokens": 39856588.0, "step": 3231 }, { "entropy": 1.338496744632721, "epoch": 1.7019483938915219, "grad_norm": 0.2915278375148773, "learning_rate": 0.00017941156199827664, "loss": 0.21198813617229462, "mean_token_accuracy": 0.9130686819553375, "num_tokens": 39868924.0, "step": 3232 }, { "entropy": 1.3526046872138977, "epoch": 1.7024749868351763, "grad_norm": 0.2703212797641754, "learning_rate": 0.00017939760159677988, "loss": 0.18862299621105194, "mean_token_accuracy": 0.9240467101335526, "num_tokens": 39881260.0, "step": 3233 }, { "entropy": 1.336966633796692, "epoch": 1.703001579778831, "grad_norm": 0.2505403161048889, "learning_rate": 0.00017938363707555198, "loss": 0.1721397340297699, "mean_token_accuracy": 0.928515300154686, "num_tokens": 39893596.0, "step": 3234 }, { "entropy": 1.2895264327526093, "epoch": 1.7035281727224856, "grad_norm": 0.27174112200737, "learning_rate": 0.00017936966843542195, "loss": 0.18495216965675354, "mean_token_accuracy": 0.9250223636627197, "num_tokens": 39905932.0, "step": 3235 }, { "entropy": 1.294345647096634, "epoch": 1.70405476566614, "grad_norm": 0.31108003854751587, "learning_rate": 0.000179355695677219, "loss": 0.22918599843978882, "mean_token_accuracy": 0.9110808223485947, "num_tokens": 39918268.0, "step": 3236 }, { "entropy": 1.2462213635444641, "epoch": 1.7045813586097947, "grad_norm": 0.2745544910430908, "learning_rate": 0.00017934171880177265, "loss": 0.20311737060546875, "mean_token_accuracy": 0.9179251939058304, "num_tokens": 39930604.0, "step": 3237 }, { "entropy": 1.2923784255981445, "epoch": 1.7051079515534493, "grad_norm": 0.2750037610530853, "learning_rate": 0.00017932773780991262, "loss": 0.20452114939689636, "mean_token_accuracy": 0.9181451350450516, "num_tokens": 39942940.0, "step": 3238 }, { "entropy": 1.2803550958633423, "epoch": 1.7056345444971037, "grad_norm": 0.29063141345977783, "learning_rate": 0.00017931375270246889, "loss": 0.2145015299320221, "mean_token_accuracy": 0.9154239445924759, "num_tokens": 39955276.0, "step": 3239 }, { "entropy": 1.3234757483005524, "epoch": 1.7061611374407581, "grad_norm": 0.2841363549232483, "learning_rate": 0.0001792997634802716, "loss": 0.2186480611562729, "mean_token_accuracy": 0.9111131429672241, "num_tokens": 39967612.0, "step": 3240 }, { "entropy": 1.2682130932807922, "epoch": 1.706687730384413, "grad_norm": 0.25876402854919434, "learning_rate": 0.0001792857701441513, "loss": 0.20549407601356506, "mean_token_accuracy": 0.9134150445461273, "num_tokens": 39979948.0, "step": 3241 }, { "entropy": 1.285068303346634, "epoch": 1.7072143233280674, "grad_norm": 0.2754906415939331, "learning_rate": 0.00017927177269493866, "loss": 0.2059261053800583, "mean_token_accuracy": 0.9146608859300613, "num_tokens": 39992284.0, "step": 3242 }, { "entropy": 1.3181243240833282, "epoch": 1.7077409162717219, "grad_norm": 0.28565770387649536, "learning_rate": 0.0001792577711334646, "loss": 0.20405897498130798, "mean_token_accuracy": 0.9132011830806732, "num_tokens": 40004620.0, "step": 3243 }, { "entropy": 1.2542202472686768, "epoch": 1.7082675092153765, "grad_norm": 0.23145394027233124, "learning_rate": 0.00017924376546056035, "loss": 0.1774619072675705, "mean_token_accuracy": 0.9282086789608002, "num_tokens": 40016956.0, "step": 3244 }, { "entropy": 1.3313210010528564, "epoch": 1.7087941021590312, "grad_norm": 0.2665564715862274, "learning_rate": 0.0001792297556770573, "loss": 0.19780829548835754, "mean_token_accuracy": 0.9161526560783386, "num_tokens": 40029292.0, "step": 3245 }, { "entropy": 1.395924985408783, "epoch": 1.7093206951026856, "grad_norm": 0.28649643063545227, "learning_rate": 0.00017921574178378718, "loss": 0.19208171963691711, "mean_token_accuracy": 0.9216294139623642, "num_tokens": 40041628.0, "step": 3246 }, { "entropy": 1.323070913553238, "epoch": 1.7098472880463402, "grad_norm": 0.28210774064064026, "learning_rate": 0.00017920172378158188, "loss": 0.1932576298713684, "mean_token_accuracy": 0.9173065274953842, "num_tokens": 40053964.0, "step": 3247 }, { "entropy": 1.2962166965007782, "epoch": 1.7103738809899949, "grad_norm": 0.2612176537513733, "learning_rate": 0.00017918770167127355, "loss": 0.1979486644268036, "mean_token_accuracy": 0.9187701344490051, "num_tokens": 40066300.0, "step": 3248 }, { "entropy": 1.3086665868759155, "epoch": 1.7109004739336493, "grad_norm": 0.27552592754364014, "learning_rate": 0.00017917367545369469, "loss": 0.22310736775398254, "mean_token_accuracy": 0.9084995836019516, "num_tokens": 40078636.0, "step": 3249 }, { "entropy": 1.281711757183075, "epoch": 1.7114270668773037, "grad_norm": 0.3259299397468567, "learning_rate": 0.00017915964512967784, "loss": 0.1875232756137848, "mean_token_accuracy": 0.9251815974712372, "num_tokens": 40090972.0, "step": 3250 }, { "entropy": 1.3861521780490875, "epoch": 1.7119536598209584, "grad_norm": 0.313814640045166, "learning_rate": 0.00017914561070005598, "loss": 0.21126891672611237, "mean_token_accuracy": 0.9117094427347183, "num_tokens": 40103308.0, "step": 3251 }, { "entropy": 1.3072172403335571, "epoch": 1.712480252764613, "grad_norm": 0.3379667103290558, "learning_rate": 0.0001791315721656622, "loss": 0.19064629077911377, "mean_token_accuracy": 0.9234190434217453, "num_tokens": 40115644.0, "step": 3252 }, { "entropy": 1.2437802255153656, "epoch": 1.7130068457082674, "grad_norm": 0.26171544194221497, "learning_rate": 0.00017911752952732993, "loss": 0.19964775443077087, "mean_token_accuracy": 0.9152403026819229, "num_tokens": 40127980.0, "step": 3253 }, { "entropy": 1.2901654541492462, "epoch": 1.713533438651922, "grad_norm": 0.26816311478614807, "learning_rate": 0.00017910348278589276, "loss": 0.20712605118751526, "mean_token_accuracy": 0.9133376479148865, "num_tokens": 40140316.0, "step": 3254 }, { "entropy": 1.2976833879947662, "epoch": 1.7140600315955767, "grad_norm": 0.2973898947238922, "learning_rate": 0.0001790894319421846, "loss": 0.21765637397766113, "mean_token_accuracy": 0.9121676534414291, "num_tokens": 40152652.0, "step": 3255 }, { "entropy": 1.277085781097412, "epoch": 1.7145866245392312, "grad_norm": 0.2639175355434418, "learning_rate": 0.00017907537699703955, "loss": 0.19076862931251526, "mean_token_accuracy": 0.9191281646490097, "num_tokens": 40164988.0, "step": 3256 }, { "entropy": 1.3531688749790192, "epoch": 1.7151132174828856, "grad_norm": 0.27909165620803833, "learning_rate": 0.00017906131795129198, "loss": 0.18622638285160065, "mean_token_accuracy": 0.9284979552030563, "num_tokens": 40177324.0, "step": 3257 }, { "entropy": 1.242502599954605, "epoch": 1.7156398104265402, "grad_norm": 0.2541889250278473, "learning_rate": 0.00017904725480577646, "loss": 0.18720562756061554, "mean_token_accuracy": 0.9233348220586777, "num_tokens": 40189660.0, "step": 3258 }, { "entropy": 1.2683814764022827, "epoch": 1.7161664033701949, "grad_norm": 0.29242897033691406, "learning_rate": 0.0001790331875613279, "loss": 0.214931458234787, "mean_token_accuracy": 0.910991907119751, "num_tokens": 40201996.0, "step": 3259 }, { "entropy": 1.337379515171051, "epoch": 1.7166929963138493, "grad_norm": 0.2787255048751831, "learning_rate": 0.0001790191162187813, "loss": 0.2036406546831131, "mean_token_accuracy": 0.9184634983539581, "num_tokens": 40214332.0, "step": 3260 }, { "entropy": 1.257769137620926, "epoch": 1.717219589257504, "grad_norm": 0.25968125462532043, "learning_rate": 0.00017900504077897206, "loss": 0.19390641152858734, "mean_token_accuracy": 0.9182478189468384, "num_tokens": 40226668.0, "step": 3261 }, { "entropy": 1.3203734755516052, "epoch": 1.7177461822011586, "grad_norm": 0.30727487802505493, "learning_rate": 0.00017899096124273576, "loss": 0.22841309010982513, "mean_token_accuracy": 0.9035236537456512, "num_tokens": 40239004.0, "step": 3262 }, { "entropy": 1.2281590104103088, "epoch": 1.718272775144813, "grad_norm": 0.2654935121536255, "learning_rate": 0.0001789768776109082, "loss": 0.19407188892364502, "mean_token_accuracy": 0.9239892512559891, "num_tokens": 40251340.0, "step": 3263 }, { "entropy": 1.2642222046852112, "epoch": 1.7187993680884674, "grad_norm": 0.28257355093955994, "learning_rate": 0.0001789627898843254, "loss": 0.2133817970752716, "mean_token_accuracy": 0.9196331948041916, "num_tokens": 40263676.0, "step": 3264 }, { "entropy": 1.3009636104106903, "epoch": 1.7193259610321223, "grad_norm": 0.2984471917152405, "learning_rate": 0.00017894869806382377, "loss": 0.21264006197452545, "mean_token_accuracy": 0.9153096079826355, "num_tokens": 40276012.0, "step": 3265 }, { "entropy": 1.3348345458507538, "epoch": 1.7198525539757767, "grad_norm": 0.28683388233184814, "learning_rate": 0.00017893460215023975, "loss": 0.20870405435562134, "mean_token_accuracy": 0.9114125370979309, "num_tokens": 40288348.0, "step": 3266 }, { "entropy": 1.2550526559352875, "epoch": 1.7203791469194312, "grad_norm": 0.25430989265441895, "learning_rate": 0.0001789205021444102, "loss": 0.19396786391735077, "mean_token_accuracy": 0.9199714511632919, "num_tokens": 40300684.0, "step": 3267 }, { "entropy": 1.303754299879074, "epoch": 1.7209057398630858, "grad_norm": 0.26650470495224, "learning_rate": 0.00017890639804717215, "loss": 0.19954167306423187, "mean_token_accuracy": 0.9163612723350525, "num_tokens": 40313020.0, "step": 3268 }, { "entropy": 1.2093145549297333, "epoch": 1.7214323328067405, "grad_norm": 0.29942092299461365, "learning_rate": 0.00017889228985936285, "loss": 0.2275795340538025, "mean_token_accuracy": 0.9083501994609833, "num_tokens": 40325356.0, "step": 3269 }, { "entropy": 1.2750758230686188, "epoch": 1.7219589257503949, "grad_norm": 0.2606362998485565, "learning_rate": 0.00017887817758181987, "loss": 0.19598644971847534, "mean_token_accuracy": 0.9228833317756653, "num_tokens": 40337692.0, "step": 3270 }, { "entropy": 1.2626889944076538, "epoch": 1.7224855186940495, "grad_norm": 0.2737748622894287, "learning_rate": 0.0001788640612153809, "loss": 0.20550641417503357, "mean_token_accuracy": 0.9146024286746979, "num_tokens": 40350028.0, "step": 3271 }, { "entropy": 1.2671963572502136, "epoch": 1.7230121116377042, "grad_norm": 0.295658677816391, "learning_rate": 0.00017884994076088398, "loss": 0.2249743938446045, "mean_token_accuracy": 0.9077863395214081, "num_tokens": 40362364.0, "step": 3272 }, { "entropy": 1.256992220878601, "epoch": 1.7235387045813586, "grad_norm": 0.2737193703651428, "learning_rate": 0.0001788358162191674, "loss": 0.21205906569957733, "mean_token_accuracy": 0.915488988161087, "num_tokens": 40374700.0, "step": 3273 }, { "entropy": 1.213915228843689, "epoch": 1.724065297525013, "grad_norm": 0.25337645411491394, "learning_rate": 0.00017882168759106957, "loss": 0.18594782054424286, "mean_token_accuracy": 0.9206974655389786, "num_tokens": 40387036.0, "step": 3274 }, { "entropy": 1.2303422391414642, "epoch": 1.7245918904686677, "grad_norm": 0.28474873304367065, "learning_rate": 0.0001788075548774293, "loss": 0.2072606086730957, "mean_token_accuracy": 0.9152207672595978, "num_tokens": 40399372.0, "step": 3275 }, { "entropy": 1.2771183252334595, "epoch": 1.7251184834123223, "grad_norm": 0.27036532759666443, "learning_rate": 0.00017879341807908555, "loss": 0.1881149560213089, "mean_token_accuracy": 0.92488132417202, "num_tokens": 40411708.0, "step": 3276 }, { "entropy": 1.2247534692287445, "epoch": 1.7256450763559767, "grad_norm": 0.2693551778793335, "learning_rate": 0.0001787792771968775, "loss": 0.2171371728181839, "mean_token_accuracy": 0.91679947078228, "num_tokens": 40424044.0, "step": 3277 }, { "entropy": 1.2200176119804382, "epoch": 1.7261716692996314, "grad_norm": 0.2627072334289551, "learning_rate": 0.00017876513223164466, "loss": 0.19582206010818481, "mean_token_accuracy": 0.9185523092746735, "num_tokens": 40436380.0, "step": 3278 }, { "entropy": 1.2262316644191742, "epoch": 1.726698262243286, "grad_norm": 0.26391029357910156, "learning_rate": 0.00017875098318422667, "loss": 0.18920688331127167, "mean_token_accuracy": 0.9226961433887482, "num_tokens": 40448716.0, "step": 3279 }, { "entropy": 1.2009854018688202, "epoch": 1.7272248551869405, "grad_norm": 0.2786342203617096, "learning_rate": 0.00017873683005546358, "loss": 0.2078881859779358, "mean_token_accuracy": 0.9170061498880386, "num_tokens": 40461052.0, "step": 3280 }, { "entropy": 1.219001442193985, "epoch": 1.727751448130595, "grad_norm": 0.34324315190315247, "learning_rate": 0.0001787226728461955, "loss": 0.2038731575012207, "mean_token_accuracy": 0.9136009812355042, "num_tokens": 40473388.0, "step": 3281 }, { "entropy": 1.1982538998126984, "epoch": 1.7282780410742498, "grad_norm": 0.3113863170146942, "learning_rate": 0.00017870851155726286, "loss": 0.2176617681980133, "mean_token_accuracy": 0.9123759865760803, "num_tokens": 40485724.0, "step": 3282 }, { "entropy": 1.2175420820713043, "epoch": 1.7288046340179042, "grad_norm": 0.27579864859580994, "learning_rate": 0.0001786943461895064, "loss": 0.2074568271636963, "mean_token_accuracy": 0.9171206802129745, "num_tokens": 40498060.0, "step": 3283 }, { "entropy": 1.1838345229625702, "epoch": 1.7293312269615586, "grad_norm": 0.2992401421070099, "learning_rate": 0.00017868017674376694, "loss": 0.20533637702465057, "mean_token_accuracy": 0.9176798313856125, "num_tokens": 40510396.0, "step": 3284 }, { "entropy": 1.2316609919071198, "epoch": 1.7298578199052133, "grad_norm": 0.3072640001773834, "learning_rate": 0.00017866600322088568, "loss": 0.21974754333496094, "mean_token_accuracy": 0.9138150960206985, "num_tokens": 40522732.0, "step": 3285 }, { "entropy": 1.2149794399738312, "epoch": 1.730384412848868, "grad_norm": 0.2651062309741974, "learning_rate": 0.00017865182562170403, "loss": 0.1996372640132904, "mean_token_accuracy": 0.9211166948080063, "num_tokens": 40535068.0, "step": 3286 }, { "entropy": 1.2700909972190857, "epoch": 1.7309110057925223, "grad_norm": 0.2680571377277374, "learning_rate": 0.00017863764394706363, "loss": 0.1831960678100586, "mean_token_accuracy": 0.926160454750061, "num_tokens": 40547404.0, "step": 3287 }, { "entropy": 1.2134180068969727, "epoch": 1.731437598736177, "grad_norm": 0.2633264362812042, "learning_rate": 0.0001786234581978064, "loss": 0.19375747442245483, "mean_token_accuracy": 0.9277003556489944, "num_tokens": 40559740.0, "step": 3288 }, { "entropy": 1.2066058814525604, "epoch": 1.7319641916798316, "grad_norm": 0.2779509723186493, "learning_rate": 0.00017860926837477437, "loss": 0.2058328092098236, "mean_token_accuracy": 0.9140601456165314, "num_tokens": 40572076.0, "step": 3289 }, { "entropy": 1.2765550911426544, "epoch": 1.732490784623486, "grad_norm": 0.26993927359580994, "learning_rate": 0.00017859507447880998, "loss": 0.19165240228176117, "mean_token_accuracy": 0.9281281679868698, "num_tokens": 40584412.0, "step": 3290 }, { "entropy": 1.260106086730957, "epoch": 1.7330173775671405, "grad_norm": 0.2724703848361969, "learning_rate": 0.00017858087651075584, "loss": 0.18630154430866241, "mean_token_accuracy": 0.9287521094083786, "num_tokens": 40596748.0, "step": 3291 }, { "entropy": 1.2476516962051392, "epoch": 1.7335439705107951, "grad_norm": 0.2591682970523834, "learning_rate": 0.00017856667447145475, "loss": 0.18758217990398407, "mean_token_accuracy": 0.9250517785549164, "num_tokens": 40609084.0, "step": 3292 }, { "entropy": 1.2707555294036865, "epoch": 1.7340705634544498, "grad_norm": 0.3217529058456421, "learning_rate": 0.00017855246836174986, "loss": 0.21787390112876892, "mean_token_accuracy": 0.9111398458480835, "num_tokens": 40621420.0, "step": 3293 }, { "entropy": 1.2611454129219055, "epoch": 1.7345971563981042, "grad_norm": 0.26216942071914673, "learning_rate": 0.00017853825818248443, "loss": 0.19248586893081665, "mean_token_accuracy": 0.9217905402183533, "num_tokens": 40633756.0, "step": 3294 }, { "entropy": 1.2096803486347198, "epoch": 1.7351237493417588, "grad_norm": 0.2533584535121918, "learning_rate": 0.00017852404393450214, "loss": 0.19668050110340118, "mean_token_accuracy": 0.9232807159423828, "num_tokens": 40646092.0, "step": 3295 }, { "entropy": 1.197802484035492, "epoch": 1.7356503422854135, "grad_norm": 0.25326570868492126, "learning_rate": 0.00017850982561864673, "loss": 0.17445367574691772, "mean_token_accuracy": 0.9264692068099976, "num_tokens": 40658428.0, "step": 3296 }, { "entropy": 1.2270566523075104, "epoch": 1.736176935229068, "grad_norm": 0.26528990268707275, "learning_rate": 0.00017849560323576226, "loss": 0.1855545938014984, "mean_token_accuracy": 0.9231870025396347, "num_tokens": 40670764.0, "step": 3297 }, { "entropy": 1.2130609154701233, "epoch": 1.7367035281727223, "grad_norm": 0.28013598918914795, "learning_rate": 0.00017848137678669307, "loss": 0.19601064920425415, "mean_token_accuracy": 0.9243181943893433, "num_tokens": 40683100.0, "step": 3298 }, { "entropy": 1.226871132850647, "epoch": 1.7372301211163772, "grad_norm": 0.2821487486362457, "learning_rate": 0.0001784671462722837, "loss": 0.21541166305541992, "mean_token_accuracy": 0.9133672714233398, "num_tokens": 40695436.0, "step": 3299 }, { "entropy": 1.2181604504585266, "epoch": 1.7377567140600316, "grad_norm": 0.2949363589286804, "learning_rate": 0.00017845291169337886, "loss": 0.2169766128063202, "mean_token_accuracy": 0.9101507663726807, "num_tokens": 40707772.0, "step": 3300 }, { "entropy": 1.237768977880478, "epoch": 1.738283307003686, "grad_norm": 0.3046022951602936, "learning_rate": 0.00017843867305082368, "loss": 0.20753508806228638, "mean_token_accuracy": 0.9195269197225571, "num_tokens": 40720108.0, "step": 3301 }, { "entropy": 1.206713229417801, "epoch": 1.7388098999473407, "grad_norm": 0.2679121196269989, "learning_rate": 0.0001784244303454633, "loss": 0.2043764740228653, "mean_token_accuracy": 0.9116311520338058, "num_tokens": 40732444.0, "step": 3302 }, { "entropy": 1.2439360618591309, "epoch": 1.7393364928909953, "grad_norm": 0.25374096632003784, "learning_rate": 0.00017841018357814338, "loss": 0.18161284923553467, "mean_token_accuracy": 0.9243684113025665, "num_tokens": 40744780.0, "step": 3303 }, { "entropy": 1.2688191533088684, "epoch": 1.7398630858346498, "grad_norm": 0.28752121329307556, "learning_rate": 0.00017839593274970953, "loss": 0.20974797010421753, "mean_token_accuracy": 0.9088063091039658, "num_tokens": 40757116.0, "step": 3304 }, { "entropy": 1.2342472076416016, "epoch": 1.7403896787783044, "grad_norm": 0.2605990469455719, "learning_rate": 0.00017838167786100786, "loss": 0.2021808922290802, "mean_token_accuracy": 0.9125561267137527, "num_tokens": 40769452.0, "step": 3305 }, { "entropy": 1.2520089447498322, "epoch": 1.740916271721959, "grad_norm": 0.2876226007938385, "learning_rate": 0.00017836741891288447, "loss": 0.21958418190479279, "mean_token_accuracy": 0.9127276241779327, "num_tokens": 40781788.0, "step": 3306 }, { "entropy": 1.2590630948543549, "epoch": 1.7414428646656135, "grad_norm": 0.267333984375, "learning_rate": 0.00017835315590618593, "loss": 0.19477830827236176, "mean_token_accuracy": 0.9198647290468216, "num_tokens": 40794124.0, "step": 3307 }, { "entropy": 1.222892850637436, "epoch": 1.741969457609268, "grad_norm": 0.2734076976776123, "learning_rate": 0.0001783388888417589, "loss": 0.1936633288860321, "mean_token_accuracy": 0.9192850589752197, "num_tokens": 40806460.0, "step": 3308 }, { "entropy": 1.2516216337680817, "epoch": 1.7424960505529226, "grad_norm": 0.293828547000885, "learning_rate": 0.00017832461772045033, "loss": 0.20226381719112396, "mean_token_accuracy": 0.9191479235887527, "num_tokens": 40818796.0, "step": 3309 }, { "entropy": 1.2808569073677063, "epoch": 1.7430226434965772, "grad_norm": 0.29275745153427124, "learning_rate": 0.00017831034254310748, "loss": 0.2209526002407074, "mean_token_accuracy": 0.9084486216306686, "num_tokens": 40831132.0, "step": 3310 }, { "entropy": 1.2265948355197906, "epoch": 1.7435492364402316, "grad_norm": 0.2859675884246826, "learning_rate": 0.0001782960633105777, "loss": 0.20897722244262695, "mean_token_accuracy": 0.9134756773710251, "num_tokens": 40843468.0, "step": 3311 }, { "entropy": 1.2819762527942657, "epoch": 1.7440758293838863, "grad_norm": 0.2739836275577545, "learning_rate": 0.0001782817800237087, "loss": 0.20494410395622253, "mean_token_accuracy": 0.9149334281682968, "num_tokens": 40855804.0, "step": 3312 }, { "entropy": 1.2840421795845032, "epoch": 1.744602422327541, "grad_norm": 0.27893322706222534, "learning_rate": 0.0001782674926833484, "loss": 0.20927336812019348, "mean_token_accuracy": 0.9126023948192596, "num_tokens": 40868140.0, "step": 3313 }, { "entropy": 1.2541827261447906, "epoch": 1.7451290152711953, "grad_norm": 0.2732979953289032, "learning_rate": 0.00017825320129034495, "loss": 0.20452941954135895, "mean_token_accuracy": 0.9158912748098373, "num_tokens": 40880476.0, "step": 3314 }, { "entropy": 1.2899048030376434, "epoch": 1.7456556082148498, "grad_norm": 0.3004266321659088, "learning_rate": 0.0001782389058455468, "loss": 0.20099236071109772, "mean_token_accuracy": 0.9254409223794937, "num_tokens": 40892812.0, "step": 3315 }, { "entropy": 1.287499874830246, "epoch": 1.7461822011585044, "grad_norm": 0.2748308479785919, "learning_rate": 0.00017822460634980245, "loss": 0.19413264095783234, "mean_token_accuracy": 0.9179486334323883, "num_tokens": 40905148.0, "step": 3316 }, { "entropy": 1.2944321632385254, "epoch": 1.746708794102159, "grad_norm": 0.2908708453178406, "learning_rate": 0.00017821030280396093, "loss": 0.21369019150733948, "mean_token_accuracy": 0.9173711091279984, "num_tokens": 40917484.0, "step": 3317 }, { "entropy": 1.262908548116684, "epoch": 1.7472353870458135, "grad_norm": 0.25998809933662415, "learning_rate": 0.00017819599520887126, "loss": 0.19156329333782196, "mean_token_accuracy": 0.9206810593605042, "num_tokens": 40929820.0, "step": 3318 }, { "entropy": 1.3015094697475433, "epoch": 1.7477619799894681, "grad_norm": 0.30315208435058594, "learning_rate": 0.00017818168356538284, "loss": 0.2028445154428482, "mean_token_accuracy": 0.9121357649564743, "num_tokens": 40942156.0, "step": 3319 }, { "entropy": 1.2577976882457733, "epoch": 1.7482885729331228, "grad_norm": 0.251533180475235, "learning_rate": 0.00017816736787434526, "loss": 0.17267408967018127, "mean_token_accuracy": 0.9274961352348328, "num_tokens": 40954492.0, "step": 3320 }, { "entropy": 1.298771619796753, "epoch": 1.7488151658767772, "grad_norm": 0.26891663670539856, "learning_rate": 0.00017815304813660835, "loss": 0.20470818877220154, "mean_token_accuracy": 0.9156215190887451, "num_tokens": 40966828.0, "step": 3321 }, { "entropy": 1.297717809677124, "epoch": 1.7493417588204319, "grad_norm": 0.277751624584198, "learning_rate": 0.00017813872435302222, "loss": 0.1922859251499176, "mean_token_accuracy": 0.9206653833389282, "num_tokens": 40979164.0, "step": 3322 }, { "entropy": 1.3184978663921356, "epoch": 1.7498683517640865, "grad_norm": 0.28764608502388, "learning_rate": 0.00017812439652443716, "loss": 0.19598035514354706, "mean_token_accuracy": 0.922876164317131, "num_tokens": 40991500.0, "step": 3323 }, { "entropy": 1.2648021578788757, "epoch": 1.750394944707741, "grad_norm": 0.2744153141975403, "learning_rate": 0.0001781100646517037, "loss": 0.19071339070796967, "mean_token_accuracy": 0.9216628968715668, "num_tokens": 41003836.0, "step": 3324 }, { "entropy": 1.2510377168655396, "epoch": 1.7509215376513954, "grad_norm": 0.2512511610984802, "learning_rate": 0.00017809572873567274, "loss": 0.16837379336357117, "mean_token_accuracy": 0.9307546615600586, "num_tokens": 41016172.0, "step": 3325 }, { "entropy": 1.282473772764206, "epoch": 1.75144813059505, "grad_norm": 0.29696282744407654, "learning_rate": 0.00017808138877719522, "loss": 0.19326961040496826, "mean_token_accuracy": 0.9177820086479187, "num_tokens": 41028508.0, "step": 3326 }, { "entropy": 1.2485735416412354, "epoch": 1.7519747235387046, "grad_norm": 0.25719940662384033, "learning_rate": 0.00017806704477712245, "loss": 0.19185180962085724, "mean_token_accuracy": 0.9225496500730515, "num_tokens": 41040844.0, "step": 3327 }, { "entropy": 1.254735678434372, "epoch": 1.752501316482359, "grad_norm": 0.2844921946525574, "learning_rate": 0.000178052696736306, "loss": 0.20377546548843384, "mean_token_accuracy": 0.9177062809467316, "num_tokens": 41053180.0, "step": 3328 }, { "entropy": 1.2341787219047546, "epoch": 1.7530279094260137, "grad_norm": 0.2937590479850769, "learning_rate": 0.00017803834465559754, "loss": 0.2154744565486908, "mean_token_accuracy": 0.9114655256271362, "num_tokens": 41065516.0, "step": 3329 }, { "entropy": 1.2713043689727783, "epoch": 1.7535545023696684, "grad_norm": 0.29252561926841736, "learning_rate": 0.00017802398853584915, "loss": 0.20079272985458374, "mean_token_accuracy": 0.9159099161624908, "num_tokens": 41077852.0, "step": 3330 }, { "entropy": 1.2464990019798279, "epoch": 1.7540810953133228, "grad_norm": 0.2867441177368164, "learning_rate": 0.000178009628377913, "loss": 0.2051943838596344, "mean_token_accuracy": 0.9145941138267517, "num_tokens": 41090188.0, "step": 3331 }, { "entropy": 1.2052176296710968, "epoch": 1.7546076882569772, "grad_norm": 0.257271945476532, "learning_rate": 0.0001779952641826416, "loss": 0.18216028809547424, "mean_token_accuracy": 0.9247520416975021, "num_tokens": 41102524.0, "step": 3332 }, { "entropy": 1.2561128735542297, "epoch": 1.7551342812006319, "grad_norm": 0.2668805718421936, "learning_rate": 0.00017798089595088773, "loss": 0.17578330636024475, "mean_token_accuracy": 0.9274698793888092, "num_tokens": 41114860.0, "step": 3333 }, { "entropy": 1.2273137271404266, "epoch": 1.7556608741442865, "grad_norm": 0.28731396794319153, "learning_rate": 0.00017796652368350422, "loss": 0.20657789707183838, "mean_token_accuracy": 0.9174284040927887, "num_tokens": 41127196.0, "step": 3334 }, { "entropy": 1.217975229024887, "epoch": 1.756187467087941, "grad_norm": 0.24883601069450378, "learning_rate": 0.00017795214738134437, "loss": 0.1853816658258438, "mean_token_accuracy": 0.9215361028909683, "num_tokens": 41139532.0, "step": 3335 }, { "entropy": 1.270724892616272, "epoch": 1.7567140600315956, "grad_norm": 0.3023955523967743, "learning_rate": 0.00017793776704526156, "loss": 0.21046261489391327, "mean_token_accuracy": 0.9148201197385788, "num_tokens": 41151868.0, "step": 3336 }, { "entropy": 1.3148931860923767, "epoch": 1.7572406529752502, "grad_norm": 0.31092697381973267, "learning_rate": 0.00017792338267610955, "loss": 0.22172124683856964, "mean_token_accuracy": 0.9151052385568619, "num_tokens": 41164204.0, "step": 3337 }, { "entropy": 1.2632471919059753, "epoch": 1.7577672459189047, "grad_norm": 0.26783210039138794, "learning_rate": 0.00017790899427474216, "loss": 0.197731152176857, "mean_token_accuracy": 0.9220364391803741, "num_tokens": 41176540.0, "step": 3338 }, { "entropy": 1.3053453266620636, "epoch": 1.758293838862559, "grad_norm": 0.28016164898872375, "learning_rate": 0.0001778946018420136, "loss": 0.19119513034820557, "mean_token_accuracy": 0.9238210469484329, "num_tokens": 41188876.0, "step": 3339 }, { "entropy": 1.2755919098854065, "epoch": 1.758820431806214, "grad_norm": 0.2692145109176636, "learning_rate": 0.00017788020537877822, "loss": 0.20970848202705383, "mean_token_accuracy": 0.9092446118593216, "num_tokens": 41201212.0, "step": 3340 }, { "entropy": 1.3126140236854553, "epoch": 1.7593470247498684, "grad_norm": 0.2891995906829834, "learning_rate": 0.00017786580488589072, "loss": 0.20718203485012054, "mean_token_accuracy": 0.9121265858411789, "num_tokens": 41213548.0, "step": 3341 }, { "entropy": 1.2515637278556824, "epoch": 1.7598736176935228, "grad_norm": 0.2759207487106323, "learning_rate": 0.0001778514003642059, "loss": 0.2197999209165573, "mean_token_accuracy": 0.9112512469291687, "num_tokens": 41225884.0, "step": 3342 }, { "entropy": 1.3375881612300873, "epoch": 1.7604002106371774, "grad_norm": 0.3448629677295685, "learning_rate": 0.0001778369918145789, "loss": 0.22216130793094635, "mean_token_accuracy": 0.9111101776361465, "num_tokens": 41238220.0, "step": 3343 }, { "entropy": 1.3089163899421692, "epoch": 1.760926803580832, "grad_norm": 0.3070039749145508, "learning_rate": 0.00017782257923786512, "loss": 0.227981299161911, "mean_token_accuracy": 0.9092568904161453, "num_tokens": 41250556.0, "step": 3344 }, { "entropy": 1.2772272825241089, "epoch": 1.7614533965244865, "grad_norm": 0.3033801317214966, "learning_rate": 0.0001778081626349201, "loss": 0.23961672186851501, "mean_token_accuracy": 0.9030078947544098, "num_tokens": 41262892.0, "step": 3345 }, { "entropy": 1.2329810559749603, "epoch": 1.7619799894681412, "grad_norm": 0.2866532504558563, "learning_rate": 0.00017779374200659967, "loss": 0.19439920783042908, "mean_token_accuracy": 0.9247799217700958, "num_tokens": 41275228.0, "step": 3346 }, { "entropy": 1.3167122602462769, "epoch": 1.7625065824117958, "grad_norm": 0.2825206518173218, "learning_rate": 0.0001777793173537599, "loss": 0.22407029569149017, "mean_token_accuracy": 0.9099050462245941, "num_tokens": 41287564.0, "step": 3347 }, { "entropy": 1.2629252672195435, "epoch": 1.7630331753554502, "grad_norm": 0.2708073854446411, "learning_rate": 0.00017776488867725712, "loss": 0.20463934540748596, "mean_token_accuracy": 0.9120416194200516, "num_tokens": 41299900.0, "step": 3348 }, { "entropy": 1.27415269613266, "epoch": 1.7635597682991047, "grad_norm": 0.2722845673561096, "learning_rate": 0.00017775045597794787, "loss": 0.21537022292613983, "mean_token_accuracy": 0.9141311943531036, "num_tokens": 41312236.0, "step": 3349 }, { "entropy": 1.3064779043197632, "epoch": 1.7640863612427593, "grad_norm": 0.2894989848136902, "learning_rate": 0.00017773601925668892, "loss": 0.22586101293563843, "mean_token_accuracy": 0.9097247868776321, "num_tokens": 41324572.0, "step": 3350 }, { "entropy": 1.2612329721450806, "epoch": 1.764612954186414, "grad_norm": 0.29836785793304443, "learning_rate": 0.00017772157851433728, "loss": 0.21758875250816345, "mean_token_accuracy": 0.9101037234067917, "num_tokens": 41336908.0, "step": 3351 }, { "entropy": 1.2290297746658325, "epoch": 1.7651395471300684, "grad_norm": 0.25658851861953735, "learning_rate": 0.00017770713375175027, "loss": 0.2039872407913208, "mean_token_accuracy": 0.9155770987272263, "num_tokens": 41349244.0, "step": 3352 }, { "entropy": 1.2159041166305542, "epoch": 1.765666140073723, "grad_norm": 0.25883957743644714, "learning_rate": 0.00017769268496978534, "loss": 0.2031729817390442, "mean_token_accuracy": 0.9135902374982834, "num_tokens": 41361580.0, "step": 3353 }, { "entropy": 1.2781166732311249, "epoch": 1.7661927330173777, "grad_norm": 0.2804759740829468, "learning_rate": 0.0001776782321693003, "loss": 0.20843571424484253, "mean_token_accuracy": 0.9182161241769791, "num_tokens": 41373916.0, "step": 3354 }, { "entropy": 1.2583058774471283, "epoch": 1.766719325961032, "grad_norm": 0.2756879925727844, "learning_rate": 0.000177663775351153, "loss": 0.20797543227672577, "mean_token_accuracy": 0.9124239981174469, "num_tokens": 41386252.0, "step": 3355 }, { "entropy": 1.216934710741043, "epoch": 1.7672459189046865, "grad_norm": 0.24864549934864044, "learning_rate": 0.00017764931451620176, "loss": 0.19844800233840942, "mean_token_accuracy": 0.9174752831459045, "num_tokens": 41398588.0, "step": 3356 }, { "entropy": 1.1914585530757904, "epoch": 1.7677725118483414, "grad_norm": 0.3007160723209381, "learning_rate": 0.000177634849665305, "loss": 0.19987277686595917, "mean_token_accuracy": 0.9170159250497818, "num_tokens": 41410924.0, "step": 3357 }, { "entropy": 1.2236018180847168, "epoch": 1.7682991047919958, "grad_norm": 0.26258760690689087, "learning_rate": 0.00017762038079932143, "loss": 0.19202816486358643, "mean_token_accuracy": 0.9185950011014938, "num_tokens": 41423260.0, "step": 3358 }, { "entropy": 1.203150063753128, "epoch": 1.7688256977356502, "grad_norm": 0.30711668729782104, "learning_rate": 0.00017760590791910996, "loss": 0.199526846408844, "mean_token_accuracy": 0.9178106486797333, "num_tokens": 41435596.0, "step": 3359 }, { "entropy": 1.1577493846416473, "epoch": 1.7693522906793049, "grad_norm": 0.2871035933494568, "learning_rate": 0.0001775914310255298, "loss": 0.20930145680904388, "mean_token_accuracy": 0.9113402664661407, "num_tokens": 41447932.0, "step": 3360 }, { "entropy": 1.1829438507556915, "epoch": 1.7698788836229595, "grad_norm": 0.2672130763530731, "learning_rate": 0.0001775769501194403, "loss": 0.19939038157463074, "mean_token_accuracy": 0.9205279648303986, "num_tokens": 41460268.0, "step": 3361 }, { "entropy": 1.1942402124404907, "epoch": 1.770405476566614, "grad_norm": 0.25566044449806213, "learning_rate": 0.00017756246520170114, "loss": 0.1758129745721817, "mean_token_accuracy": 0.9335868656635284, "num_tokens": 41472604.0, "step": 3362 }, { "entropy": 1.1532124280929565, "epoch": 1.7709320695102686, "grad_norm": 0.27559491991996765, "learning_rate": 0.00017754797627317223, "loss": 0.21339191496372223, "mean_token_accuracy": 0.9085791558027267, "num_tokens": 41484940.0, "step": 3363 }, { "entropy": 1.1915392577648163, "epoch": 1.7714586624539232, "grad_norm": 0.27328014373779297, "learning_rate": 0.00017753348333471368, "loss": 0.19107362627983093, "mean_token_accuracy": 0.919417142868042, "num_tokens": 41497276.0, "step": 3364 }, { "entropy": 1.2415129840373993, "epoch": 1.7719852553975777, "grad_norm": 0.3027941584587097, "learning_rate": 0.00017751898638718582, "loss": 0.21972572803497314, "mean_token_accuracy": 0.9154131710529327, "num_tokens": 41509612.0, "step": 3365 }, { "entropy": 1.2410273849964142, "epoch": 1.772511848341232, "grad_norm": 0.2616625726222992, "learning_rate": 0.00017750448543144923, "loss": 0.19885270297527313, "mean_token_accuracy": 0.9170425534248352, "num_tokens": 41521948.0, "step": 3366 }, { "entropy": 1.17729052901268, "epoch": 1.7730384412848867, "grad_norm": 0.2854722738265991, "learning_rate": 0.00017748998046836483, "loss": 0.21116960048675537, "mean_token_accuracy": 0.9104287326335907, "num_tokens": 41534284.0, "step": 3367 }, { "entropy": 1.2824692726135254, "epoch": 1.7735650342285414, "grad_norm": 0.3191331923007965, "learning_rate": 0.00017747547149879364, "loss": 0.22000783681869507, "mean_token_accuracy": 0.906844973564148, "num_tokens": 41546620.0, "step": 3368 }, { "entropy": 1.2594166994094849, "epoch": 1.7740916271721958, "grad_norm": 0.28365424275398254, "learning_rate": 0.000177460958523597, "loss": 0.2075151801109314, "mean_token_accuracy": 0.913050040602684, "num_tokens": 41558956.0, "step": 3369 }, { "entropy": 1.235844612121582, "epoch": 1.7746182201158505, "grad_norm": 0.2545213997364044, "learning_rate": 0.00017744644154363642, "loss": 0.19338078796863556, "mean_token_accuracy": 0.923160582780838, "num_tokens": 41571292.0, "step": 3370 }, { "entropy": 1.3051631450653076, "epoch": 1.7751448130595051, "grad_norm": 0.2971054017543793, "learning_rate": 0.00017743192055977373, "loss": 0.20190899074077606, "mean_token_accuracy": 0.9218249917030334, "num_tokens": 41583628.0, "step": 3371 }, { "entropy": 1.2504850327968597, "epoch": 1.7756714060031595, "grad_norm": 0.2931920886039734, "learning_rate": 0.00017741739557287093, "loss": 0.22522364556789398, "mean_token_accuracy": 0.9096525609493256, "num_tokens": 41595964.0, "step": 3372 }, { "entropy": 1.239783525466919, "epoch": 1.776197998946814, "grad_norm": 0.2665524482727051, "learning_rate": 0.0001774028665837903, "loss": 0.20252424478530884, "mean_token_accuracy": 0.9206974357366562, "num_tokens": 41608300.0, "step": 3373 }, { "entropy": 1.2758963406085968, "epoch": 1.7767245918904688, "grad_norm": 0.28818976879119873, "learning_rate": 0.00017738833359339434, "loss": 0.20459452271461487, "mean_token_accuracy": 0.9180116057395935, "num_tokens": 41620636.0, "step": 3374 }, { "entropy": 1.20317143201828, "epoch": 1.7772511848341233, "grad_norm": 0.24318887293338776, "learning_rate": 0.0001773737966025458, "loss": 0.18710657954216003, "mean_token_accuracy": 0.9200632572174072, "num_tokens": 41632972.0, "step": 3375 }, { "entropy": 1.2684413492679596, "epoch": 1.7777777777777777, "grad_norm": 0.2672540843486786, "learning_rate": 0.0001773592556121076, "loss": 0.21147683262825012, "mean_token_accuracy": 0.9108813256025314, "num_tokens": 41645308.0, "step": 3376 }, { "entropy": 1.2610873579978943, "epoch": 1.7783043707214323, "grad_norm": 0.2789379060268402, "learning_rate": 0.00017734471062294302, "loss": 0.19667166471481323, "mean_token_accuracy": 0.9191772490739822, "num_tokens": 41657644.0, "step": 3377 }, { "entropy": 1.209890991449356, "epoch": 1.778830963665087, "grad_norm": 0.259087473154068, "learning_rate": 0.00017733016163591547, "loss": 0.19788247346878052, "mean_token_accuracy": 0.9188321679830551, "num_tokens": 41669980.0, "step": 3378 }, { "entropy": 1.2839680910110474, "epoch": 1.7793575566087414, "grad_norm": 0.27051210403442383, "learning_rate": 0.00017731560865188865, "loss": 0.19803057610988617, "mean_token_accuracy": 0.921959638595581, "num_tokens": 41682316.0, "step": 3379 }, { "entropy": 1.2436229586601257, "epoch": 1.779884149552396, "grad_norm": 0.28252285718917847, "learning_rate": 0.0001773010516717265, "loss": 0.19300350546836853, "mean_token_accuracy": 0.9220046401023865, "num_tokens": 41694652.0, "step": 3380 }, { "entropy": 1.2022179961204529, "epoch": 1.7804107424960507, "grad_norm": 0.27916550636291504, "learning_rate": 0.00017728649069629316, "loss": 0.21073868870735168, "mean_token_accuracy": 0.913501039147377, "num_tokens": 41706988.0, "step": 3381 }, { "entropy": 1.1777479350566864, "epoch": 1.7809373354397051, "grad_norm": 0.2819908857345581, "learning_rate": 0.00017727192572645307, "loss": 0.2172769159078598, "mean_token_accuracy": 0.9113239943981171, "num_tokens": 41719324.0, "step": 3382 }, { "entropy": 1.2020470798015594, "epoch": 1.7814639283833595, "grad_norm": 0.2866542637348175, "learning_rate": 0.00017725735676307083, "loss": 0.20779943466186523, "mean_token_accuracy": 0.9181617349386215, "num_tokens": 41731660.0, "step": 3383 }, { "entropy": 1.2138996124267578, "epoch": 1.7819905213270142, "grad_norm": 0.26489347219467163, "learning_rate": 0.0001772427838070113, "loss": 0.2014807164669037, "mean_token_accuracy": 0.917888268828392, "num_tokens": 41743996.0, "step": 3384 }, { "entropy": 1.1408116817474365, "epoch": 1.7825171142706688, "grad_norm": 0.2681819498538971, "learning_rate": 0.00017722820685913963, "loss": 0.21120908856391907, "mean_token_accuracy": 0.9159476608037949, "num_tokens": 41756332.0, "step": 3385 }, { "entropy": 1.1952861547470093, "epoch": 1.7830437072143233, "grad_norm": 0.27355825901031494, "learning_rate": 0.00017721362592032117, "loss": 0.20519855618476868, "mean_token_accuracy": 0.9159957766532898, "num_tokens": 41768668.0, "step": 3386 }, { "entropy": 1.2068920731544495, "epoch": 1.783570300157978, "grad_norm": 0.28034836053848267, "learning_rate": 0.00017719904099142147, "loss": 0.20763035118579865, "mean_token_accuracy": 0.9192133694887161, "num_tokens": 41781004.0, "step": 3387 }, { "entropy": 1.1186204552650452, "epoch": 1.7840968931016326, "grad_norm": 0.26254552602767944, "learning_rate": 0.0001771844520733064, "loss": 0.20995590090751648, "mean_token_accuracy": 0.9153067320585251, "num_tokens": 41793340.0, "step": 3388 }, { "entropy": 1.1552630364894867, "epoch": 1.784623486045287, "grad_norm": 0.2836894392967224, "learning_rate": 0.00017716985916684197, "loss": 0.21084123849868774, "mean_token_accuracy": 0.9113008379936218, "num_tokens": 41805676.0, "step": 3389 }, { "entropy": 1.1729071736335754, "epoch": 1.7851500789889414, "grad_norm": 0.2675871253013611, "learning_rate": 0.0001771552622728945, "loss": 0.19911614060401917, "mean_token_accuracy": 0.9161395877599716, "num_tokens": 41818012.0, "step": 3390 }, { "entropy": 1.183312863111496, "epoch": 1.785676671932596, "grad_norm": 0.29449769854545593, "learning_rate": 0.00017714066139233053, "loss": 0.19318415224552155, "mean_token_accuracy": 0.920307382941246, "num_tokens": 41830348.0, "step": 3391 }, { "entropy": 1.1941271126270294, "epoch": 1.7862032648762507, "grad_norm": 0.29486992955207825, "learning_rate": 0.0001771260565260168, "loss": 0.20498642325401306, "mean_token_accuracy": 0.9168984740972519, "num_tokens": 41842684.0, "step": 3392 }, { "entropy": 1.1674256920814514, "epoch": 1.7867298578199051, "grad_norm": 0.3044561743736267, "learning_rate": 0.00017711144767482034, "loss": 0.2078413963317871, "mean_token_accuracy": 0.9115557223558426, "num_tokens": 41855020.0, "step": 3393 }, { "entropy": 1.115517109632492, "epoch": 1.7872564507635598, "grad_norm": 0.2597251832485199, "learning_rate": 0.00017709683483960837, "loss": 0.18797630071640015, "mean_token_accuracy": 0.9255786091089249, "num_tokens": 41867356.0, "step": 3394 }, { "entropy": 1.1435833275318146, "epoch": 1.7877830437072144, "grad_norm": 0.26411309838294983, "learning_rate": 0.0001770822180212484, "loss": 0.1814870834350586, "mean_token_accuracy": 0.9257442653179169, "num_tokens": 41879692.0, "step": 3395 }, { "entropy": 1.1526050865650177, "epoch": 1.7883096366508688, "grad_norm": 0.27172785997390747, "learning_rate": 0.00017706759722060816, "loss": 0.19988085329532623, "mean_token_accuracy": 0.9178711026906967, "num_tokens": 41892028.0, "step": 3396 }, { "entropy": 1.1092619001865387, "epoch": 1.7888362295945235, "grad_norm": 0.26404666900634766, "learning_rate": 0.00017705297243855551, "loss": 0.18823406100273132, "mean_token_accuracy": 0.9220343977212906, "num_tokens": 41904364.0, "step": 3397 }, { "entropy": 1.1228880286216736, "epoch": 1.7893628225381781, "grad_norm": 0.2574518620967865, "learning_rate": 0.00017703834367595878, "loss": 0.18857592344284058, "mean_token_accuracy": 0.9215908646583557, "num_tokens": 41916700.0, "step": 3398 }, { "entropy": 1.1254870891571045, "epoch": 1.7898894154818326, "grad_norm": 0.27541834115982056, "learning_rate": 0.00017702371093368627, "loss": 0.18809503316879272, "mean_token_accuracy": 0.9209438264369965, "num_tokens": 41929036.0, "step": 3399 }, { "entropy": 1.075088083744049, "epoch": 1.790416008425487, "grad_norm": 0.25025203824043274, "learning_rate": 0.00017700907421260668, "loss": 0.1794566810131073, "mean_token_accuracy": 0.925526887178421, "num_tokens": 41941372.0, "step": 3400 }, { "entropy": 1.1571705043315887, "epoch": 1.7909426013691416, "grad_norm": 0.2782227396965027, "learning_rate": 0.0001769944335135889, "loss": 0.19144821166992188, "mean_token_accuracy": 0.9179984331130981, "num_tokens": 41953708.0, "step": 3401 }, { "entropy": 1.0587176382541656, "epoch": 1.7914691943127963, "grad_norm": 0.2607192397117615, "learning_rate": 0.00017697978883750212, "loss": 0.19511093199253082, "mean_token_accuracy": 0.9198868274688721, "num_tokens": 41966044.0, "step": 3402 }, { "entropy": 1.1079656779766083, "epoch": 1.7919957872564507, "grad_norm": 0.26396170258522034, "learning_rate": 0.00017696514018521563, "loss": 0.21819618344306946, "mean_token_accuracy": 0.910576269030571, "num_tokens": 41978380.0, "step": 3403 }, { "entropy": 1.0812654197216034, "epoch": 1.7925223802001053, "grad_norm": 0.2712666690349579, "learning_rate": 0.00017695048755759908, "loss": 0.20643654465675354, "mean_token_accuracy": 0.9118922054767609, "num_tokens": 41990716.0, "step": 3404 }, { "entropy": 1.0948403775691986, "epoch": 1.79304897314376, "grad_norm": 0.2753002345561981, "learning_rate": 0.0001769358309555223, "loss": 0.21245992183685303, "mean_token_accuracy": 0.9119813740253448, "num_tokens": 42003052.0, "step": 3405 }, { "entropy": 1.1134866774082184, "epoch": 1.7935755660874144, "grad_norm": 0.24785494804382324, "learning_rate": 0.00017692117037985538, "loss": 0.1743498146533966, "mean_token_accuracy": 0.9319243878126144, "num_tokens": 42015388.0, "step": 3406 }, { "entropy": 1.03944431245327, "epoch": 1.7941021590310688, "grad_norm": 0.25819504261016846, "learning_rate": 0.0001769065058314686, "loss": 0.2109576016664505, "mean_token_accuracy": 0.9150231778621674, "num_tokens": 42027724.0, "step": 3407 }, { "entropy": 1.079315334558487, "epoch": 1.7946287519747235, "grad_norm": 0.26192978024482727, "learning_rate": 0.00017689183731123257, "loss": 0.20323598384857178, "mean_token_accuracy": 0.9163467139005661, "num_tokens": 42040060.0, "step": 3408 }, { "entropy": 1.1146911978721619, "epoch": 1.7951553449183781, "grad_norm": 0.2505536377429962, "learning_rate": 0.00017687716482001797, "loss": 0.18577729165554047, "mean_token_accuracy": 0.9239400625228882, "num_tokens": 42052396.0, "step": 3409 }, { "entropy": 1.0605261623859406, "epoch": 1.7956819378620326, "grad_norm": 0.25102049112319946, "learning_rate": 0.00017686248835869595, "loss": 0.20101284980773926, "mean_token_accuracy": 0.9199343025684357, "num_tokens": 42064732.0, "step": 3410 }, { "entropy": 1.0440888553857803, "epoch": 1.7962085308056872, "grad_norm": 0.26397231221199036, "learning_rate": 0.00017684780792813764, "loss": 0.2093440592288971, "mean_token_accuracy": 0.9137531369924545, "num_tokens": 42077068.0, "step": 3411 }, { "entropy": 1.0457901358604431, "epoch": 1.7967351237493419, "grad_norm": 0.28600117564201355, "learning_rate": 0.00017683312352921463, "loss": 0.21590805053710938, "mean_token_accuracy": 0.9133930206298828, "num_tokens": 42089404.0, "step": 3412 }, { "entropy": 1.0765321105718613, "epoch": 1.7972617166929963, "grad_norm": 0.27367517352104187, "learning_rate": 0.00017681843516279862, "loss": 0.17508497834205627, "mean_token_accuracy": 0.9287613779306412, "num_tokens": 42101740.0, "step": 3413 }, { "entropy": 1.0435933470726013, "epoch": 1.7977883096366507, "grad_norm": 0.3039937913417816, "learning_rate": 0.00017680374282976152, "loss": 0.22740893065929413, "mean_token_accuracy": 0.9117265343666077, "num_tokens": 42114076.0, "step": 3414 }, { "entropy": 1.0765089988708496, "epoch": 1.7983149025803056, "grad_norm": 0.29611867666244507, "learning_rate": 0.00017678904653097558, "loss": 0.2006775140762329, "mean_token_accuracy": 0.917385458946228, "num_tokens": 42126412.0, "step": 3415 }, { "entropy": 1.0454992651939392, "epoch": 1.79884149552396, "grad_norm": 0.27161067724227905, "learning_rate": 0.00017677434626731323, "loss": 0.2067311704158783, "mean_token_accuracy": 0.918012872338295, "num_tokens": 42138748.0, "step": 3416 }, { "entropy": 1.063028246164322, "epoch": 1.7993680884676144, "grad_norm": 0.30537426471710205, "learning_rate": 0.00017675964203964716, "loss": 0.22716304659843445, "mean_token_accuracy": 0.911460742354393, "num_tokens": 42151084.0, "step": 3417 }, { "entropy": 1.020344227552414, "epoch": 1.799894681411269, "grad_norm": 0.2623611092567444, "learning_rate": 0.00017674493384885022, "loss": 0.17709854245185852, "mean_token_accuracy": 0.9269069582223892, "num_tokens": 42163420.0, "step": 3418 }, { "entropy": 1.056466594338417, "epoch": 1.8004212743549237, "grad_norm": 0.28182798624038696, "learning_rate": 0.0001767302216957956, "loss": 0.2123803049325943, "mean_token_accuracy": 0.919185072183609, "num_tokens": 42175756.0, "step": 3419 }, { "entropy": 1.020190790295601, "epoch": 1.8009478672985781, "grad_norm": 0.2913738489151001, "learning_rate": 0.00017671550558135662, "loss": 0.2207547426223755, "mean_token_accuracy": 0.9098331481218338, "num_tokens": 42188092.0, "step": 3420 }, { "entropy": 1.0069181025028229, "epoch": 1.8014744602422328, "grad_norm": 0.3414415717124939, "learning_rate": 0.00017670078550640692, "loss": 0.20877774059772491, "mean_token_accuracy": 0.9150732308626175, "num_tokens": 42200428.0, "step": 3421 }, { "entropy": 0.9878948777914047, "epoch": 1.8020010531858874, "grad_norm": 0.2625672221183777, "learning_rate": 0.00017668606147182037, "loss": 0.18287813663482666, "mean_token_accuracy": 0.9247158914804459, "num_tokens": 42212764.0, "step": 3422 }, { "entropy": 0.9836813509464264, "epoch": 1.8025276461295419, "grad_norm": 0.2774287462234497, "learning_rate": 0.000176671333478471, "loss": 0.20418068766593933, "mean_token_accuracy": 0.9173961877822876, "num_tokens": 42225100.0, "step": 3423 }, { "entropy": 0.9749710410833359, "epoch": 1.8030542390731963, "grad_norm": 0.2605920433998108, "learning_rate": 0.00017665660152723319, "loss": 0.19839239120483398, "mean_token_accuracy": 0.9227689206600189, "num_tokens": 42237436.0, "step": 3424 }, { "entropy": 0.9625023603439331, "epoch": 1.803580832016851, "grad_norm": 0.2580849230289459, "learning_rate": 0.00017664186561898145, "loss": 0.19285142421722412, "mean_token_accuracy": 0.9149420410394669, "num_tokens": 42249772.0, "step": 3425 }, { "entropy": 0.9385105073451996, "epoch": 1.8041074249605056, "grad_norm": 0.2744423747062683, "learning_rate": 0.0001766271257545905, "loss": 0.22436729073524475, "mean_token_accuracy": 0.9081188142299652, "num_tokens": 42262108.0, "step": 3426 }, { "entropy": 0.9655201435089111, "epoch": 1.80463401790416, "grad_norm": 0.25290924310684204, "learning_rate": 0.00017661238193493548, "loss": 0.19769905507564545, "mean_token_accuracy": 0.9191560298204422, "num_tokens": 42274444.0, "step": 3427 }, { "entropy": 0.9744076132774353, "epoch": 1.8051606108478147, "grad_norm": 0.36244046688079834, "learning_rate": 0.00017659763416089157, "loss": 0.20538192987442017, "mean_token_accuracy": 0.91567362844944, "num_tokens": 42286780.0, "step": 3428 }, { "entropy": 0.9812397658824921, "epoch": 1.8056872037914693, "grad_norm": 0.2958359718322754, "learning_rate": 0.00017658288243333433, "loss": 0.22860632836818695, "mean_token_accuracy": 0.9086659848690033, "num_tokens": 42299116.0, "step": 3429 }, { "entropy": 0.9486215561628342, "epoch": 1.8062137967351237, "grad_norm": 0.2708651125431061, "learning_rate": 0.00017656812675313936, "loss": 0.20294052362442017, "mean_token_accuracy": 0.9186287671327591, "num_tokens": 42311452.0, "step": 3430 }, { "entropy": 1.018494963645935, "epoch": 1.8067403896787781, "grad_norm": 0.2610625922679901, "learning_rate": 0.00017655336712118274, "loss": 0.18903633952140808, "mean_token_accuracy": 0.9225384891033173, "num_tokens": 42323788.0, "step": 3431 }, { "entropy": 0.9701050668954849, "epoch": 1.807266982622433, "grad_norm": 0.2695980966091156, "learning_rate": 0.0001765386035383406, "loss": 0.20392455160617828, "mean_token_accuracy": 0.913482204079628, "num_tokens": 42336124.0, "step": 3432 }, { "entropy": 0.9882481843233109, "epoch": 1.8077935755660874, "grad_norm": 0.27849382162094116, "learning_rate": 0.0001765238360054894, "loss": 0.2001408338546753, "mean_token_accuracy": 0.9178249388933182, "num_tokens": 42348460.0, "step": 3433 }, { "entropy": 0.9755127131938934, "epoch": 1.8083201685097419, "grad_norm": 0.2871023714542389, "learning_rate": 0.00017650906452350577, "loss": 0.21643081307411194, "mean_token_accuracy": 0.9128262996673584, "num_tokens": 42360796.0, "step": 3434 }, { "entropy": 1.0046819299459457, "epoch": 1.8088467614533965, "grad_norm": 0.26911982893943787, "learning_rate": 0.00017649428909326665, "loss": 0.20376306772232056, "mean_token_accuracy": 0.9150490611791611, "num_tokens": 42373132.0, "step": 3435 }, { "entropy": 1.020606204867363, "epoch": 1.8093733543970512, "grad_norm": 0.2887180745601654, "learning_rate": 0.00017647950971564914, "loss": 0.2110900580883026, "mean_token_accuracy": 0.9153491258621216, "num_tokens": 42385468.0, "step": 3436 }, { "entropy": 0.9779709279537201, "epoch": 1.8098999473407056, "grad_norm": 0.2773571014404297, "learning_rate": 0.00017646472639153057, "loss": 0.21756364405155182, "mean_token_accuracy": 0.915818601846695, "num_tokens": 42397804.0, "step": 3437 }, { "entropy": 1.0198432505130768, "epoch": 1.8104265402843602, "grad_norm": 0.25971168279647827, "learning_rate": 0.00017644993912178863, "loss": 0.19616732001304626, "mean_token_accuracy": 0.9186940789222717, "num_tokens": 42410140.0, "step": 3438 }, { "entropy": 1.0019106715917587, "epoch": 1.8109531332280149, "grad_norm": 0.27781882882118225, "learning_rate": 0.00017643514790730106, "loss": 0.22385036945343018, "mean_token_accuracy": 0.9076634049415588, "num_tokens": 42422476.0, "step": 3439 }, { "entropy": 1.0161989629268646, "epoch": 1.8114797261716693, "grad_norm": 0.2737201452255249, "learning_rate": 0.00017642035274894596, "loss": 0.20915377140045166, "mean_token_accuracy": 0.9130603224039078, "num_tokens": 42434812.0, "step": 3440 }, { "entropy": 1.0263062715530396, "epoch": 1.8120063191153237, "grad_norm": 0.2517765760421753, "learning_rate": 0.00017640555364760173, "loss": 0.18634292483329773, "mean_token_accuracy": 0.9243203103542328, "num_tokens": 42447148.0, "step": 3441 }, { "entropy": 1.0274717211723328, "epoch": 1.8125329120589784, "grad_norm": 0.27562084794044495, "learning_rate": 0.00017639075060414675, "loss": 0.2285502851009369, "mean_token_accuracy": 0.905607059597969, "num_tokens": 42459484.0, "step": 3442 }, { "entropy": 1.0182528346776962, "epoch": 1.813059505002633, "grad_norm": 0.2482491433620453, "learning_rate": 0.00017637594361945988, "loss": 0.20179533958435059, "mean_token_accuracy": 0.9154495447874069, "num_tokens": 42471820.0, "step": 3443 }, { "entropy": 1.0020128339529037, "epoch": 1.8135860979462874, "grad_norm": 0.237760528922081, "learning_rate": 0.00017636113269442008, "loss": 0.16691860556602478, "mean_token_accuracy": 0.9328106641769409, "num_tokens": 42484156.0, "step": 3444 }, { "entropy": 0.9634300619363785, "epoch": 1.814112690889942, "grad_norm": 0.25161245465278625, "learning_rate": 0.00017634631782990665, "loss": 0.19200566411018372, "mean_token_accuracy": 0.9238070696592331, "num_tokens": 42496492.0, "step": 3445 }, { "entropy": 0.9657048434019089, "epoch": 1.8146392838335967, "grad_norm": 0.2663264572620392, "learning_rate": 0.00017633149902679903, "loss": 0.19708439707756042, "mean_token_accuracy": 0.9215977638959885, "num_tokens": 42508828.0, "step": 3446 }, { "entropy": 1.0027496963739395, "epoch": 1.8151658767772512, "grad_norm": 0.257934033870697, "learning_rate": 0.0001763166762859769, "loss": 0.19249504804611206, "mean_token_accuracy": 0.918593168258667, "num_tokens": 42521164.0, "step": 3447 }, { "entropy": 0.9626820534467697, "epoch": 1.8156924697209056, "grad_norm": 0.246200829744339, "learning_rate": 0.0001763018496083202, "loss": 0.17840000987052917, "mean_token_accuracy": 0.9268343597650528, "num_tokens": 42533500.0, "step": 3448 }, { "entropy": 0.9367417544126511, "epoch": 1.8162190626645605, "grad_norm": 0.2481808215379715, "learning_rate": 0.0001762870189947092, "loss": 0.18670141696929932, "mean_token_accuracy": 0.9216200262308121, "num_tokens": 42545836.0, "step": 3449 }, { "entropy": 0.9394432306289673, "epoch": 1.8167456556082149, "grad_norm": 0.26846200227737427, "learning_rate": 0.00017627218444602418, "loss": 0.19002090394496918, "mean_token_accuracy": 0.9229268431663513, "num_tokens": 42558172.0, "step": 3450 }, { "entropy": 0.9051215350627899, "epoch": 1.8172722485518693, "grad_norm": 0.2518659830093384, "learning_rate": 0.0001762573459631458, "loss": 0.19580325484275818, "mean_token_accuracy": 0.9171916991472244, "num_tokens": 42570508.0, "step": 3451 }, { "entropy": 0.9344974011182785, "epoch": 1.817798841495524, "grad_norm": 0.28661391139030457, "learning_rate": 0.000176242503546955, "loss": 0.2089633345603943, "mean_token_accuracy": 0.9145671278238297, "num_tokens": 42582844.0, "step": 3452 }, { "entropy": 0.9151428788900375, "epoch": 1.8183254344391786, "grad_norm": 0.27580344676971436, "learning_rate": 0.0001762276571983329, "loss": 0.20280398428440094, "mean_token_accuracy": 0.9187836647033691, "num_tokens": 42595180.0, "step": 3453 }, { "entropy": 0.9216799587011337, "epoch": 1.818852027382833, "grad_norm": 0.3177351653575897, "learning_rate": 0.00017621280691816076, "loss": 0.22672337293624878, "mean_token_accuracy": 0.9106907099485397, "num_tokens": 42607516.0, "step": 3454 }, { "entropy": 0.9563778191804886, "epoch": 1.8193786203264877, "grad_norm": 0.2692190110683441, "learning_rate": 0.0001761979527073202, "loss": 0.18519625067710876, "mean_token_accuracy": 0.9241679459810257, "num_tokens": 42619852.0, "step": 3455 }, { "entropy": 0.9491466730833054, "epoch": 1.8199052132701423, "grad_norm": 0.30144041776657104, "learning_rate": 0.00017618309456669297, "loss": 0.20708760619163513, "mean_token_accuracy": 0.9165724217891693, "num_tokens": 42632188.0, "step": 3456 }, { "entropy": 0.9680854380130768, "epoch": 1.8204318062137967, "grad_norm": 0.29503685235977173, "learning_rate": 0.00017616823249716118, "loss": 0.20235475897789001, "mean_token_accuracy": 0.9136970639228821, "num_tokens": 42644524.0, "step": 3457 }, { "entropy": 0.9400119334459305, "epoch": 1.8209583991574512, "grad_norm": 0.29825398325920105, "learning_rate": 0.00017615336649960713, "loss": 0.20762497186660767, "mean_token_accuracy": 0.9167003929615021, "num_tokens": 42656860.0, "step": 3458 }, { "entropy": 0.9631544351577759, "epoch": 1.8214849921011058, "grad_norm": 0.28420135378837585, "learning_rate": 0.00017613849657491327, "loss": 0.21617071330547333, "mean_token_accuracy": 0.9141428619623184, "num_tokens": 42669196.0, "step": 3459 }, { "entropy": 0.9421249181032181, "epoch": 1.8220115850447605, "grad_norm": 0.2639506459236145, "learning_rate": 0.00017612362272396233, "loss": 0.19029353559017181, "mean_token_accuracy": 0.9208075702190399, "num_tokens": 42681532.0, "step": 3460 }, { "entropy": 0.9671123921871185, "epoch": 1.8225381779884149, "grad_norm": 0.26940131187438965, "learning_rate": 0.00017610874494763728, "loss": 0.19277174770832062, "mean_token_accuracy": 0.921785444021225, "num_tokens": 42693868.0, "step": 3461 }, { "entropy": 0.9888048470020294, "epoch": 1.8230647709320695, "grad_norm": 0.27126485109329224, "learning_rate": 0.0001760938632468214, "loss": 0.20671769976615906, "mean_token_accuracy": 0.918752908706665, "num_tokens": 42706204.0, "step": 3462 }, { "entropy": 1.0084779560565948, "epoch": 1.8235913638757242, "grad_norm": 0.2975345849990845, "learning_rate": 0.00017607897762239808, "loss": 0.2272503823041916, "mean_token_accuracy": 0.9058665335178375, "num_tokens": 42718540.0, "step": 3463 }, { "entropy": 1.0197101086378098, "epoch": 1.8241179568193786, "grad_norm": 0.28193390369415283, "learning_rate": 0.00017606408807525098, "loss": 0.20244908332824707, "mean_token_accuracy": 0.9168011546134949, "num_tokens": 42730876.0, "step": 3464 }, { "entropy": 1.0353141129016876, "epoch": 1.824644549763033, "grad_norm": 0.2784873843193054, "learning_rate": 0.00017604919460626403, "loss": 0.21005836129188538, "mean_token_accuracy": 0.9177538007497787, "num_tokens": 42743212.0, "step": 3465 }, { "entropy": 1.076245129108429, "epoch": 1.8251711427066877, "grad_norm": 0.27502164244651794, "learning_rate": 0.00017603429721632134, "loss": 0.1887526512145996, "mean_token_accuracy": 0.921863242983818, "num_tokens": 42755548.0, "step": 3466 }, { "entropy": 1.062199056148529, "epoch": 1.8256977356503423, "grad_norm": 0.276706337928772, "learning_rate": 0.00017601939590630733, "loss": 0.18946623802185059, "mean_token_accuracy": 0.921543076634407, "num_tokens": 42767884.0, "step": 3467 }, { "entropy": 1.0050623714923859, "epoch": 1.8262243285939967, "grad_norm": 0.39241406321525574, "learning_rate": 0.00017600449067710656, "loss": 0.20796050131320953, "mean_token_accuracy": 0.918712854385376, "num_tokens": 42780220.0, "step": 3468 }, { "entropy": 0.9754211008548737, "epoch": 1.8267509215376514, "grad_norm": 0.25771889090538025, "learning_rate": 0.0001759895815296039, "loss": 0.19497676193714142, "mean_token_accuracy": 0.9191407561302185, "num_tokens": 42792556.0, "step": 3469 }, { "entropy": 1.0407283902168274, "epoch": 1.827277514481306, "grad_norm": 0.29367595911026, "learning_rate": 0.00017597466846468437, "loss": 0.19909502565860748, "mean_token_accuracy": 0.9213258177042007, "num_tokens": 42804892.0, "step": 3470 }, { "entropy": 1.0311505794525146, "epoch": 1.8278041074249605, "grad_norm": 0.28731125593185425, "learning_rate": 0.00017595975148323333, "loss": 0.22046415507793427, "mean_token_accuracy": 0.9133670032024384, "num_tokens": 42817228.0, "step": 3471 }, { "entropy": 1.0354828983545303, "epoch": 1.8283307003686151, "grad_norm": 0.257552832365036, "learning_rate": 0.00017594483058613625, "loss": 0.19373366236686707, "mean_token_accuracy": 0.915319561958313, "num_tokens": 42829564.0, "step": 3472 }, { "entropy": 1.0075701475143433, "epoch": 1.8288572933122698, "grad_norm": 0.30350086092948914, "learning_rate": 0.000175929905774279, "loss": 0.21878236532211304, "mean_token_accuracy": 0.9075680375099182, "num_tokens": 42841900.0, "step": 3473 }, { "entropy": 1.0445679128170013, "epoch": 1.8293838862559242, "grad_norm": 0.26493775844573975, "learning_rate": 0.00017591497704854745, "loss": 0.19537273049354553, "mean_token_accuracy": 0.9180216193199158, "num_tokens": 42854236.0, "step": 3474 }, { "entropy": 1.0321323722600937, "epoch": 1.8299104791995786, "grad_norm": 0.25514036417007446, "learning_rate": 0.0001759000444098279, "loss": 0.19023671746253967, "mean_token_accuracy": 0.9226201772689819, "num_tokens": 42866572.0, "step": 3475 }, { "entropy": 1.0683675110340118, "epoch": 1.8304370721432333, "grad_norm": 0.24957162141799927, "learning_rate": 0.00017588510785900688, "loss": 0.19595561921596527, "mean_token_accuracy": 0.9198444336652756, "num_tokens": 42878908.0, "step": 3476 }, { "entropy": 1.0605555176734924, "epoch": 1.830963665086888, "grad_norm": 0.26935040950775146, "learning_rate": 0.00017587016739697094, "loss": 0.207814022898674, "mean_token_accuracy": 0.9161375761032104, "num_tokens": 42891244.0, "step": 3477 }, { "entropy": 0.979072317481041, "epoch": 1.8314902580305423, "grad_norm": 0.2588823437690735, "learning_rate": 0.00017585522302460707, "loss": 0.1919378638267517, "mean_token_accuracy": 0.9216379672288895, "num_tokens": 42903580.0, "step": 3478 }, { "entropy": 1.034737452864647, "epoch": 1.832016850974197, "grad_norm": 0.27618345618247986, "learning_rate": 0.00017584027474280248, "loss": 0.20401082932949066, "mean_token_accuracy": 0.9176820069551468, "num_tokens": 42915916.0, "step": 3479 }, { "entropy": 1.0233630985021591, "epoch": 1.8325434439178516, "grad_norm": 0.29381322860717773, "learning_rate": 0.00017582532255244456, "loss": 0.20440031588077545, "mean_token_accuracy": 0.9106693267822266, "num_tokens": 42928252.0, "step": 3480 }, { "entropy": 1.0043966621160507, "epoch": 1.833070036861506, "grad_norm": 0.28479161858558655, "learning_rate": 0.00017581036645442083, "loss": 0.22450262308120728, "mean_token_accuracy": 0.9132276177406311, "num_tokens": 42940588.0, "step": 3481 }, { "entropy": 1.0819280743598938, "epoch": 1.8335966298051605, "grad_norm": 0.2651804983615875, "learning_rate": 0.00017579540644961926, "loss": 0.2066086381673813, "mean_token_accuracy": 0.9166118055582047, "num_tokens": 42952924.0, "step": 3482 }, { "entropy": 1.0218794494867325, "epoch": 1.8341232227488151, "grad_norm": 0.26943325996398926, "learning_rate": 0.00017578044253892787, "loss": 0.2052810937166214, "mean_token_accuracy": 0.918945848941803, "num_tokens": 42965260.0, "step": 3483 }, { "entropy": 1.075775384902954, "epoch": 1.8346498156924698, "grad_norm": 0.28176063299179077, "learning_rate": 0.00017576547472323501, "loss": 0.20732028782367706, "mean_token_accuracy": 0.91796013712883, "num_tokens": 42977596.0, "step": 3484 }, { "entropy": 0.9888935834169388, "epoch": 1.8351764086361242, "grad_norm": 0.24343425035476685, "learning_rate": 0.0001757505030034292, "loss": 0.1734849065542221, "mean_token_accuracy": 0.9293620884418488, "num_tokens": 42989932.0, "step": 3485 }, { "entropy": 0.9950584769248962, "epoch": 1.8357030015797788, "grad_norm": 0.23256437480449677, "learning_rate": 0.0001757355273803993, "loss": 0.18044212460517883, "mean_token_accuracy": 0.927759513258934, "num_tokens": 43002268.0, "step": 3486 }, { "entropy": 1.018806740641594, "epoch": 1.8362295945234335, "grad_norm": 0.28248098492622375, "learning_rate": 0.00017572054785503424, "loss": 0.22589240968227386, "mean_token_accuracy": 0.9108239859342575, "num_tokens": 43014604.0, "step": 3487 }, { "entropy": 0.9609373807907104, "epoch": 1.836756187467088, "grad_norm": 0.24391081929206848, "learning_rate": 0.00017570556442822333, "loss": 0.18671506643295288, "mean_token_accuracy": 0.9225711077451706, "num_tokens": 43026940.0, "step": 3488 }, { "entropy": 0.988832950592041, "epoch": 1.8372827804107423, "grad_norm": 0.2958183288574219, "learning_rate": 0.000175690577100856, "loss": 0.21036623418331146, "mean_token_accuracy": 0.9159839749336243, "num_tokens": 43039276.0, "step": 3489 }, { "entropy": 0.9858183264732361, "epoch": 1.8378093733543972, "grad_norm": 0.26455992460250854, "learning_rate": 0.00017567558587382198, "loss": 0.19656260311603546, "mean_token_accuracy": 0.9173092693090439, "num_tokens": 43051612.0, "step": 3490 }, { "entropy": 0.9774465411901474, "epoch": 1.8383359662980516, "grad_norm": 0.24327997863292694, "learning_rate": 0.00017566059074801123, "loss": 0.169850692152977, "mean_token_accuracy": 0.9312596470117569, "num_tokens": 43063948.0, "step": 3491 }, { "entropy": 0.96585513651371, "epoch": 1.838862559241706, "grad_norm": 0.26748207211494446, "learning_rate": 0.0001756455917243139, "loss": 0.19751040637493134, "mean_token_accuracy": 0.9155432730913162, "num_tokens": 43076284.0, "step": 3492 }, { "entropy": 0.985474169254303, "epoch": 1.8393891521853607, "grad_norm": 0.2670723497867584, "learning_rate": 0.0001756305888036204, "loss": 0.1883074939250946, "mean_token_accuracy": 0.9221811294555664, "num_tokens": 43088620.0, "step": 3493 }, { "entropy": 0.97892165184021, "epoch": 1.8399157451290153, "grad_norm": 0.27449530363082886, "learning_rate": 0.00017561558198682134, "loss": 0.2017425000667572, "mean_token_accuracy": 0.9193790405988693, "num_tokens": 43100956.0, "step": 3494 }, { "entropy": 0.92783522605896, "epoch": 1.8404423380726698, "grad_norm": 0.2700694501399994, "learning_rate": 0.00017560057127480764, "loss": 0.19871242344379425, "mean_token_accuracy": 0.9196399599313736, "num_tokens": 43113292.0, "step": 3495 }, { "entropy": 0.9279954582452774, "epoch": 1.8409689310163244, "grad_norm": 0.26998549699783325, "learning_rate": 0.00017558555666847037, "loss": 0.17693020403385162, "mean_token_accuracy": 0.9300927370786667, "num_tokens": 43125628.0, "step": 3496 }, { "entropy": 0.9917383641004562, "epoch": 1.841495523959979, "grad_norm": 0.31583210825920105, "learning_rate": 0.00017557053816870088, "loss": 0.227731853723526, "mean_token_accuracy": 0.9075176864862442, "num_tokens": 43137964.0, "step": 3497 }, { "entropy": 0.9914578646421432, "epoch": 1.8420221169036335, "grad_norm": 0.29741397500038147, "learning_rate": 0.00017555551577639068, "loss": 0.21265819668769836, "mean_token_accuracy": 0.9156584292650223, "num_tokens": 43150300.0, "step": 3498 }, { "entropy": 0.9868685007095337, "epoch": 1.842548709847288, "grad_norm": 0.3175033628940582, "learning_rate": 0.00017554048949243163, "loss": 0.20174245536327362, "mean_token_accuracy": 0.9204602241516113, "num_tokens": 43162636.0, "step": 3499 }, { "entropy": 0.9585036486387253, "epoch": 1.8430753027909426, "grad_norm": 0.2692413032054901, "learning_rate": 0.0001755254593177157, "loss": 0.1967068463563919, "mean_token_accuracy": 0.9194019138813019, "num_tokens": 43174972.0, "step": 3500 }, { "entropy": 1.0175974816083908, "epoch": 1.8436018957345972, "grad_norm": 0.2601134777069092, "learning_rate": 0.00017551042525313515, "loss": 0.20446570217609406, "mean_token_accuracy": 0.9177961945533752, "num_tokens": 43187308.0, "step": 3501 }, { "entropy": 0.9750374257564545, "epoch": 1.8441284886782516, "grad_norm": 0.2664104998111725, "learning_rate": 0.00017549538729958247, "loss": 0.20090380311012268, "mean_token_accuracy": 0.9167754501104355, "num_tokens": 43199644.0, "step": 3502 }, { "entropy": 1.0277975350618362, "epoch": 1.8446550816219063, "grad_norm": 0.26602786779403687, "learning_rate": 0.0001754803454579504, "loss": 0.21057289838790894, "mean_token_accuracy": 0.9140521287918091, "num_tokens": 43211980.0, "step": 3503 }, { "entropy": 0.9721402525901794, "epoch": 1.845181674565561, "grad_norm": 0.2602728605270386, "learning_rate": 0.00017546529972913187, "loss": 0.20174983143806458, "mean_token_accuracy": 0.9159922003746033, "num_tokens": 43224316.0, "step": 3504 }, { "entropy": 1.054141342639923, "epoch": 1.8457082675092154, "grad_norm": 0.2536306381225586, "learning_rate": 0.00017545025011402005, "loss": 0.19397109746932983, "mean_token_accuracy": 0.9237479120492935, "num_tokens": 43236652.0, "step": 3505 }, { "entropy": 1.041559875011444, "epoch": 1.8462348604528698, "grad_norm": 0.2991665303707123, "learning_rate": 0.00017543519661350837, "loss": 0.20816954970359802, "mean_token_accuracy": 0.9192373007535934, "num_tokens": 43248988.0, "step": 3506 }, { "entropy": 1.058956652879715, "epoch": 1.8467614533965246, "grad_norm": 0.29321545362472534, "learning_rate": 0.00017542013922849044, "loss": 0.2185562252998352, "mean_token_accuracy": 0.9086525142192841, "num_tokens": 43261324.0, "step": 3507 }, { "entropy": 1.0227807611227036, "epoch": 1.847288046340179, "grad_norm": 0.2425878793001175, "learning_rate": 0.00017540507795986014, "loss": 0.18261486291885376, "mean_token_accuracy": 0.9194140434265137, "num_tokens": 43273660.0, "step": 3508 }, { "entropy": 1.0270606130361557, "epoch": 1.8478146392838335, "grad_norm": 0.25291311740875244, "learning_rate": 0.00017539001280851156, "loss": 0.19907575845718384, "mean_token_accuracy": 0.9177414625883102, "num_tokens": 43285996.0, "step": 3509 }, { "entropy": 1.0220745652914047, "epoch": 1.8483412322274881, "grad_norm": 0.23823751509189606, "learning_rate": 0.00017537494377533908, "loss": 0.18174749612808228, "mean_token_accuracy": 0.9222448915243149, "num_tokens": 43298332.0, "step": 3510 }, { "entropy": 1.0170291811227798, "epoch": 1.8488678251711428, "grad_norm": 0.28503599762916565, "learning_rate": 0.00017535987086123717, "loss": 0.20761212706565857, "mean_token_accuracy": 0.9194875508546829, "num_tokens": 43310668.0, "step": 3511 }, { "entropy": 0.9842036962509155, "epoch": 1.8493944181147972, "grad_norm": 0.2714064121246338, "learning_rate": 0.00017534479406710072, "loss": 0.19920268654823303, "mean_token_accuracy": 0.9208008050918579, "num_tokens": 43323004.0, "step": 3512 }, { "entropy": 0.9929454177618027, "epoch": 1.8499210110584519, "grad_norm": 0.30067718029022217, "learning_rate": 0.00017532971339382467, "loss": 0.2108234167098999, "mean_token_accuracy": 0.9151533842086792, "num_tokens": 43335340.0, "step": 3513 }, { "entropy": 0.9094464778900146, "epoch": 1.8504476040021065, "grad_norm": 0.269818514585495, "learning_rate": 0.0001753146288423043, "loss": 0.19665856659412384, "mean_token_accuracy": 0.9184691607952118, "num_tokens": 43347676.0, "step": 3514 }, { "entropy": 0.9886156469583511, "epoch": 1.850974196945761, "grad_norm": 0.28764402866363525, "learning_rate": 0.00017529954041343516, "loss": 0.20603036880493164, "mean_token_accuracy": 0.920213133096695, "num_tokens": 43360012.0, "step": 3515 }, { "entropy": 0.9759783744812012, "epoch": 1.8515007898894154, "grad_norm": 0.2881333529949188, "learning_rate": 0.00017528444810811284, "loss": 0.19697514176368713, "mean_token_accuracy": 0.9233171492815018, "num_tokens": 43372348.0, "step": 3516 }, { "entropy": 0.956908330321312, "epoch": 1.85202738283307, "grad_norm": 0.2677208185195923, "learning_rate": 0.00017526935192723335, "loss": 0.19714459776878357, "mean_token_accuracy": 0.9196808934211731, "num_tokens": 43384684.0, "step": 3517 }, { "entropy": 0.9836724400520325, "epoch": 1.8525539757767246, "grad_norm": 0.30804702639579773, "learning_rate": 0.00017525425187169287, "loss": 0.21788114309310913, "mean_token_accuracy": 0.9175039529800415, "num_tokens": 43397020.0, "step": 3518 }, { "entropy": 1.002650871872902, "epoch": 1.853080568720379, "grad_norm": 0.2799338102340698, "learning_rate": 0.00017523914794238777, "loss": 0.1947844922542572, "mean_token_accuracy": 0.9189659506082535, "num_tokens": 43409356.0, "step": 3519 }, { "entropy": 0.9216767400503159, "epoch": 1.8536071616640337, "grad_norm": 0.24135830998420715, "learning_rate": 0.00017522404014021472, "loss": 0.18965280055999756, "mean_token_accuracy": 0.9230446666479111, "num_tokens": 43421692.0, "step": 3520 }, { "entropy": 0.9524090141057968, "epoch": 1.8541337546076884, "grad_norm": 0.26251375675201416, "learning_rate": 0.00017520892846607057, "loss": 0.20700010657310486, "mean_token_accuracy": 0.9134894460439682, "num_tokens": 43434028.0, "step": 3521 }, { "entropy": 1.011262759566307, "epoch": 1.8546603475513428, "grad_norm": 0.30192479491233826, "learning_rate": 0.00017519381292085238, "loss": 0.22291095554828644, "mean_token_accuracy": 0.9098920524120331, "num_tokens": 43446364.0, "step": 3522 }, { "entropy": 0.9867189973592758, "epoch": 1.8551869404949972, "grad_norm": 0.2610762119293213, "learning_rate": 0.00017517869350545747, "loss": 0.20300611853599548, "mean_token_accuracy": 0.918722614645958, "num_tokens": 43458700.0, "step": 3523 }, { "entropy": 0.9844164401292801, "epoch": 1.855713533438652, "grad_norm": 0.2718338072299957, "learning_rate": 0.00017516357022078348, "loss": 0.21439701318740845, "mean_token_accuracy": 0.9139817208051682, "num_tokens": 43471036.0, "step": 3524 }, { "entropy": 1.026760846376419, "epoch": 1.8562401263823065, "grad_norm": 0.28833097219467163, "learning_rate": 0.0001751484430677281, "loss": 0.1966688632965088, "mean_token_accuracy": 0.9210084974765778, "num_tokens": 43483372.0, "step": 3525 }, { "entropy": 0.9831033647060394, "epoch": 1.856766719325961, "grad_norm": 0.24818982183933258, "learning_rate": 0.00017513331204718934, "loss": 0.18625837564468384, "mean_token_accuracy": 0.9207738190889359, "num_tokens": 43495708.0, "step": 3526 }, { "entropy": 1.0132111757993698, "epoch": 1.8572933122696156, "grad_norm": 0.24483777582645416, "learning_rate": 0.00017511817716006552, "loss": 0.18312522768974304, "mean_token_accuracy": 0.9218669086694717, "num_tokens": 43508044.0, "step": 3527 }, { "entropy": 1.0282989740371704, "epoch": 1.8578199052132702, "grad_norm": 0.2627302408218384, "learning_rate": 0.00017510303840725504, "loss": 0.19312997162342072, "mean_token_accuracy": 0.9195411801338196, "num_tokens": 43520380.0, "step": 3528 }, { "entropy": 1.0256311148405075, "epoch": 1.8583464981569247, "grad_norm": 0.2712998390197754, "learning_rate": 0.0001750878957896566, "loss": 0.20464766025543213, "mean_token_accuracy": 0.9199627637863159, "num_tokens": 43532716.0, "step": 3529 }, { "entropy": 1.0233651250600815, "epoch": 1.8588730911005793, "grad_norm": 0.25352466106414795, "learning_rate": 0.00017507274930816916, "loss": 0.19999416172504425, "mean_token_accuracy": 0.9188231825828552, "num_tokens": 43545052.0, "step": 3530 }, { "entropy": 1.0036712139844894, "epoch": 1.859399684044234, "grad_norm": 0.25642892718315125, "learning_rate": 0.00017505759896369188, "loss": 0.17751988768577576, "mean_token_accuracy": 0.9266696274280548, "num_tokens": 43557388.0, "step": 3531 }, { "entropy": 1.0442322492599487, "epoch": 1.8599262769878884, "grad_norm": 0.27309077978134155, "learning_rate": 0.0001750424447571241, "loss": 0.20416924357414246, "mean_token_accuracy": 0.9193257242441177, "num_tokens": 43569724.0, "step": 3532 }, { "entropy": 1.0406121015548706, "epoch": 1.8604528699315428, "grad_norm": 0.2676863372325897, "learning_rate": 0.0001750272866893655, "loss": 0.2130739539861679, "mean_token_accuracy": 0.9103453308343887, "num_tokens": 43582060.0, "step": 3533 }, { "entropy": 1.0540429800748825, "epoch": 1.8609794628751974, "grad_norm": 0.26795145869255066, "learning_rate": 0.00017501212476131589, "loss": 0.19300617277622223, "mean_token_accuracy": 0.9267665147781372, "num_tokens": 43594396.0, "step": 3534 }, { "entropy": 1.0778743624687195, "epoch": 1.861506055818852, "grad_norm": 0.2814680337905884, "learning_rate": 0.00017499695897387534, "loss": 0.21657180786132812, "mean_token_accuracy": 0.913690060377121, "num_tokens": 43606732.0, "step": 3535 }, { "entropy": 1.0144944339990616, "epoch": 1.8620326487625065, "grad_norm": 0.25453317165374756, "learning_rate": 0.00017498178932794418, "loss": 0.19731523096561432, "mean_token_accuracy": 0.9211816489696503, "num_tokens": 43619068.0, "step": 3536 }, { "entropy": 1.0487922728061676, "epoch": 1.8625592417061612, "grad_norm": 0.29628288745880127, "learning_rate": 0.00017496661582442293, "loss": 0.20683038234710693, "mean_token_accuracy": 0.9144911020994186, "num_tokens": 43631404.0, "step": 3537 }, { "entropy": 1.0728088915348053, "epoch": 1.8630858346498158, "grad_norm": 0.2915079593658447, "learning_rate": 0.00017495143846421235, "loss": 0.20339436829090118, "mean_token_accuracy": 0.920454278588295, "num_tokens": 43643740.0, "step": 3538 }, { "entropy": 1.04716295003891, "epoch": 1.8636124275934702, "grad_norm": 0.23968999087810516, "learning_rate": 0.00017493625724821345, "loss": 0.17932488024234772, "mean_token_accuracy": 0.9295078665018082, "num_tokens": 43656076.0, "step": 3539 }, { "entropy": 1.1039165556430817, "epoch": 1.8641390205371247, "grad_norm": 0.2852647006511688, "learning_rate": 0.0001749210721773274, "loss": 0.20938575267791748, "mean_token_accuracy": 0.9154763072729111, "num_tokens": 43668412.0, "step": 3540 }, { "entropy": 1.062223643064499, "epoch": 1.8646656134807793, "grad_norm": 0.2730938494205475, "learning_rate": 0.00017490588325245573, "loss": 0.20177365839481354, "mean_token_accuracy": 0.920450896024704, "num_tokens": 43680748.0, "step": 3541 }, { "entropy": 1.0817009508609772, "epoch": 1.865192206424434, "grad_norm": 0.25735530257225037, "learning_rate": 0.00017489069047450003, "loss": 0.1912008374929428, "mean_token_accuracy": 0.9246111661195755, "num_tokens": 43693084.0, "step": 3542 }, { "entropy": 1.0735929310321808, "epoch": 1.8657187993680884, "grad_norm": 0.26666948199272156, "learning_rate": 0.00017487549384436228, "loss": 0.19975747168064117, "mean_token_accuracy": 0.9182255566120148, "num_tokens": 43705420.0, "step": 3543 }, { "entropy": 1.0770608186721802, "epoch": 1.866245392311743, "grad_norm": 0.2631293833255768, "learning_rate": 0.00017486029336294455, "loss": 0.21597373485565186, "mean_token_accuracy": 0.9157756865024567, "num_tokens": 43717756.0, "step": 3544 }, { "entropy": 1.0684048980474472, "epoch": 1.8667719852553977, "grad_norm": 0.2667410969734192, "learning_rate": 0.00017484508903114926, "loss": 0.19906820356845856, "mean_token_accuracy": 0.9196314960718155, "num_tokens": 43730092.0, "step": 3545 }, { "entropy": 1.1074407696723938, "epoch": 1.867298578199052, "grad_norm": 0.2910633981227875, "learning_rate": 0.00017482988084987897, "loss": 0.20462411642074585, "mean_token_accuracy": 0.9201758056879044, "num_tokens": 43742428.0, "step": 3546 }, { "entropy": 1.1205481886863708, "epoch": 1.8678251711427067, "grad_norm": 0.2661513388156891, "learning_rate": 0.00017481466882003651, "loss": 0.19449472427368164, "mean_token_accuracy": 0.9201523959636688, "num_tokens": 43754764.0, "step": 3547 }, { "entropy": 1.058198630809784, "epoch": 1.8683517640863614, "grad_norm": 0.26210594177246094, "learning_rate": 0.00017479945294252496, "loss": 0.21112874150276184, "mean_token_accuracy": 0.913567453622818, "num_tokens": 43767100.0, "step": 3548 }, { "entropy": 1.0497896373271942, "epoch": 1.8688783570300158, "grad_norm": 0.24254575371742249, "learning_rate": 0.00017478423321824752, "loss": 0.17959487438201904, "mean_token_accuracy": 0.9248331785202026, "num_tokens": 43779436.0, "step": 3549 }, { "entropy": 1.0271850526332855, "epoch": 1.8694049499736702, "grad_norm": 0.25798940658569336, "learning_rate": 0.00017476900964810777, "loss": 0.20330272614955902, "mean_token_accuracy": 0.9145640432834625, "num_tokens": 43791772.0, "step": 3550 }, { "entropy": 1.0344137400388718, "epoch": 1.8699315429173249, "grad_norm": 0.2523990869522095, "learning_rate": 0.00017475378223300944, "loss": 0.18353012204170227, "mean_token_accuracy": 0.9226906001567841, "num_tokens": 43804108.0, "step": 3551 }, { "entropy": 1.0250817984342575, "epoch": 1.8704581358609795, "grad_norm": 0.2655175030231476, "learning_rate": 0.00017473855097385646, "loss": 0.1963675618171692, "mean_token_accuracy": 0.9198670238256454, "num_tokens": 43816444.0, "step": 3552 }, { "entropy": 1.0592041909694672, "epoch": 1.870984728804634, "grad_norm": 0.2882557511329651, "learning_rate": 0.000174723315871553, "loss": 0.222836434841156, "mean_token_accuracy": 0.913982018828392, "num_tokens": 43828780.0, "step": 3553 }, { "entropy": 1.0100958496332169, "epoch": 1.8715113217482886, "grad_norm": 0.2879355847835541, "learning_rate": 0.00017470807692700354, "loss": 0.1921842247247696, "mean_token_accuracy": 0.9170998483896255, "num_tokens": 43841116.0, "step": 3554 }, { "entropy": 1.0180272459983826, "epoch": 1.8720379146919433, "grad_norm": 0.26359114050865173, "learning_rate": 0.0001746928341411127, "loss": 0.20603729784488678, "mean_token_accuracy": 0.9175525456666946, "num_tokens": 43853452.0, "step": 3555 }, { "entropy": 1.07178395986557, "epoch": 1.8725645076355977, "grad_norm": 0.27470099925994873, "learning_rate": 0.00017467758751478537, "loss": 0.20463289320468903, "mean_token_accuracy": 0.914940133690834, "num_tokens": 43865788.0, "step": 3556 }, { "entropy": 0.9943696707487106, "epoch": 1.873091100579252, "grad_norm": 0.24466237425804138, "learning_rate": 0.0001746623370489266, "loss": 0.17426809668540955, "mean_token_accuracy": 0.9257047772407532, "num_tokens": 43878124.0, "step": 3557 }, { "entropy": 1.0398575961589813, "epoch": 1.8736176935229067, "grad_norm": 0.2756820619106293, "learning_rate": 0.0001746470827444418, "loss": 0.21039924025535583, "mean_token_accuracy": 0.9163792431354523, "num_tokens": 43890460.0, "step": 3558 }, { "entropy": 1.113322228193283, "epoch": 1.8741442864665614, "grad_norm": 0.29872143268585205, "learning_rate": 0.00017463182460223647, "loss": 0.19940727949142456, "mean_token_accuracy": 0.9192183166742325, "num_tokens": 43902796.0, "step": 3559 }, { "entropy": 1.1167441308498383, "epoch": 1.8746708794102158, "grad_norm": 0.2722742557525635, "learning_rate": 0.00017461656262321643, "loss": 0.187882661819458, "mean_token_accuracy": 0.9232105165719986, "num_tokens": 43915132.0, "step": 3560 }, { "entropy": 1.0867882072925568, "epoch": 1.8751974723538705, "grad_norm": 0.2816410958766937, "learning_rate": 0.00017460129680828767, "loss": 0.20031344890594482, "mean_token_accuracy": 0.9189879596233368, "num_tokens": 43927468.0, "step": 3561 }, { "entropy": 1.1575427651405334, "epoch": 1.8757240652975251, "grad_norm": 0.29825645685195923, "learning_rate": 0.00017458602715835644, "loss": 0.2101304531097412, "mean_token_accuracy": 0.9124222993850708, "num_tokens": 43939804.0, "step": 3562 }, { "entropy": 1.0926944315433502, "epoch": 1.8762506582411795, "grad_norm": 0.2628743350505829, "learning_rate": 0.00017457075367432922, "loss": 0.19311033189296722, "mean_token_accuracy": 0.922664999961853, "num_tokens": 43952140.0, "step": 3563 }, { "entropy": 1.0990844368934631, "epoch": 1.876777251184834, "grad_norm": 0.27810606360435486, "learning_rate": 0.0001745554763571127, "loss": 0.19149093329906464, "mean_token_accuracy": 0.9224977344274521, "num_tokens": 43964476.0, "step": 3564 }, { "entropy": 1.0753406584262848, "epoch": 1.8773038441284888, "grad_norm": 0.2753046452999115, "learning_rate": 0.0001745401952076138, "loss": 0.20910421013832092, "mean_token_accuracy": 0.9132356494665146, "num_tokens": 43976812.0, "step": 3565 }, { "entropy": 1.114586502313614, "epoch": 1.8778304370721433, "grad_norm": 0.2780378758907318, "learning_rate": 0.00017452491022673967, "loss": 0.20378395915031433, "mean_token_accuracy": 0.9182945340871811, "num_tokens": 43989148.0, "step": 3566 }, { "entropy": 1.1071798503398895, "epoch": 1.8783570300157977, "grad_norm": 0.2734641432762146, "learning_rate": 0.00017450962141539773, "loss": 0.2131178081035614, "mean_token_accuracy": 0.9139434695243835, "num_tokens": 44001484.0, "step": 3567 }, { "entropy": 1.0694519877433777, "epoch": 1.8788836229594523, "grad_norm": 0.26163414120674133, "learning_rate": 0.00017449432877449553, "loss": 0.19922369718551636, "mean_token_accuracy": 0.9218622297048569, "num_tokens": 44013820.0, "step": 3568 }, { "entropy": 1.0787781774997711, "epoch": 1.879410215903107, "grad_norm": 0.2676631212234497, "learning_rate": 0.00017447903230494096, "loss": 0.18829788267612457, "mean_token_accuracy": 0.9208130836486816, "num_tokens": 44026156.0, "step": 3569 }, { "entropy": 1.106066107749939, "epoch": 1.8799368088467614, "grad_norm": 0.26856163144111633, "learning_rate": 0.00017446373200764203, "loss": 0.1804138720035553, "mean_token_accuracy": 0.919698104262352, "num_tokens": 44038492.0, "step": 3570 }, { "entropy": 1.141218662261963, "epoch": 1.880463401790416, "grad_norm": 0.2687745988368988, "learning_rate": 0.00017444842788350706, "loss": 0.1945033073425293, "mean_token_accuracy": 0.9200787246227264, "num_tokens": 44050828.0, "step": 3571 }, { "entropy": 1.1304888129234314, "epoch": 1.8809899947340707, "grad_norm": 0.25851964950561523, "learning_rate": 0.00017443311993344457, "loss": 0.19336003065109253, "mean_token_accuracy": 0.9188802093267441, "num_tokens": 44063164.0, "step": 3572 }, { "entropy": 1.1865220665931702, "epoch": 1.8815165876777251, "grad_norm": 0.29074305295944214, "learning_rate": 0.00017441780815836326, "loss": 0.1957467496395111, "mean_token_accuracy": 0.9202824831008911, "num_tokens": 44075500.0, "step": 3573 }, { "entropy": 1.1729064583778381, "epoch": 1.8820431806213795, "grad_norm": 0.2514488399028778, "learning_rate": 0.00017440249255917218, "loss": 0.17970673739910126, "mean_token_accuracy": 0.9232833385467529, "num_tokens": 44087836.0, "step": 3574 }, { "entropy": 1.1274474561214447, "epoch": 1.8825697735650342, "grad_norm": 0.27165448665618896, "learning_rate": 0.0001743871731367805, "loss": 0.18584352731704712, "mean_token_accuracy": 0.925078958272934, "num_tokens": 44100172.0, "step": 3575 }, { "entropy": 1.1284977793693542, "epoch": 1.8830963665086888, "grad_norm": 0.31029313802719116, "learning_rate": 0.00017437184989209755, "loss": 0.22961436212062836, "mean_token_accuracy": 0.9089037775993347, "num_tokens": 44112508.0, "step": 3576 }, { "entropy": 1.1539038717746735, "epoch": 1.8836229594523433, "grad_norm": 0.2871949076652527, "learning_rate": 0.00017435652282603309, "loss": 0.2109770029783249, "mean_token_accuracy": 0.9152273237705231, "num_tokens": 44124844.0, "step": 3577 }, { "entropy": 1.2086017429828644, "epoch": 1.884149552395998, "grad_norm": 0.2972370684146881, "learning_rate": 0.000174341191939497, "loss": 0.22491230070590973, "mean_token_accuracy": 0.9096596390008926, "num_tokens": 44137180.0, "step": 3578 }, { "entropy": 1.1673455834388733, "epoch": 1.8846761453396526, "grad_norm": 0.29084253311157227, "learning_rate": 0.00017432585723339933, "loss": 0.21230041980743408, "mean_token_accuracy": 0.9149164706468582, "num_tokens": 44149516.0, "step": 3579 }, { "entropy": 1.1442771553993225, "epoch": 1.885202738283307, "grad_norm": 0.2587001621723175, "learning_rate": 0.00017431051870865044, "loss": 0.19252054393291473, "mean_token_accuracy": 0.9200115948915482, "num_tokens": 44161852.0, "step": 3580 }, { "entropy": 1.185366839170456, "epoch": 1.8857293312269614, "grad_norm": 0.26025739312171936, "learning_rate": 0.00017429517636616086, "loss": 0.1987098902463913, "mean_token_accuracy": 0.9187203794717789, "num_tokens": 44174188.0, "step": 3581 }, { "entropy": 1.1812830567359924, "epoch": 1.8862559241706163, "grad_norm": 0.26062434911727905, "learning_rate": 0.00017427983020684145, "loss": 0.19222667813301086, "mean_token_accuracy": 0.9221339523792267, "num_tokens": 44186524.0, "step": 3582 }, { "entropy": 1.188157171010971, "epoch": 1.8867825171142707, "grad_norm": 0.27801626920700073, "learning_rate": 0.0001742644802316031, "loss": 0.19216661155223846, "mean_token_accuracy": 0.9170040041208267, "num_tokens": 44198860.0, "step": 3583 }, { "entropy": 1.1949248611927032, "epoch": 1.8873091100579251, "grad_norm": 0.24728041887283325, "learning_rate": 0.0001742491264413572, "loss": 0.187982976436615, "mean_token_accuracy": 0.9224367737770081, "num_tokens": 44211196.0, "step": 3584 }, { "entropy": 1.208105355501175, "epoch": 1.8878357030015798, "grad_norm": 0.32599449157714844, "learning_rate": 0.00017423376883701509, "loss": 0.1942829042673111, "mean_token_accuracy": 0.9238618314266205, "num_tokens": 44223532.0, "step": 3585 }, { "entropy": 1.2586550116539001, "epoch": 1.8883622959452344, "grad_norm": 0.2833736836910248, "learning_rate": 0.00017421840741948852, "loss": 0.1979784369468689, "mean_token_accuracy": 0.9184264540672302, "num_tokens": 44235868.0, "step": 3586 }, { "entropy": 1.2161791920661926, "epoch": 1.8888888888888888, "grad_norm": 0.27175453305244446, "learning_rate": 0.0001742030421896894, "loss": 0.18781299889087677, "mean_token_accuracy": 0.923054501414299, "num_tokens": 44248204.0, "step": 3587 }, { "entropy": 1.274359554052353, "epoch": 1.8894154818325435, "grad_norm": 0.300649493932724, "learning_rate": 0.00017418767314852986, "loss": 0.21826910972595215, "mean_token_accuracy": 0.906836673617363, "num_tokens": 44260540.0, "step": 3588 }, { "entropy": 1.2163540720939636, "epoch": 1.8899420747761981, "grad_norm": 0.25215044617652893, "learning_rate": 0.00017417230029692228, "loss": 0.20363149046897888, "mean_token_accuracy": 0.918889969587326, "num_tokens": 44272876.0, "step": 3589 }, { "entropy": 1.2891521751880646, "epoch": 1.8904686677198526, "grad_norm": 0.2741580903530121, "learning_rate": 0.00017415692363577926, "loss": 0.19672846794128418, "mean_token_accuracy": 0.9205434173345566, "num_tokens": 44285212.0, "step": 3590 }, { "entropy": 1.2554100453853607, "epoch": 1.890995260663507, "grad_norm": 0.2708304226398468, "learning_rate": 0.00017414154316601363, "loss": 0.19891998171806335, "mean_token_accuracy": 0.9197966605424881, "num_tokens": 44297548.0, "step": 3591 }, { "entropy": 1.2006763517856598, "epoch": 1.8915218536071616, "grad_norm": 0.2572955787181854, "learning_rate": 0.00017412615888853837, "loss": 0.196050226688385, "mean_token_accuracy": 0.923739418387413, "num_tokens": 44309884.0, "step": 3592 }, { "entropy": 1.2014833986759186, "epoch": 1.8920484465508163, "grad_norm": 0.2789122760295868, "learning_rate": 0.00017411077080426688, "loss": 0.19379383325576782, "mean_token_accuracy": 0.9179646968841553, "num_tokens": 44322220.0, "step": 3593 }, { "entropy": 1.2050150334835052, "epoch": 1.8925750394944707, "grad_norm": 0.2656964659690857, "learning_rate": 0.00017409537891411255, "loss": 0.2036164104938507, "mean_token_accuracy": 0.9147919863462448, "num_tokens": 44334556.0, "step": 3594 }, { "entropy": 1.1853137016296387, "epoch": 1.8931016324381253, "grad_norm": 0.2627456784248352, "learning_rate": 0.00017407998321898916, "loss": 0.2011202722787857, "mean_token_accuracy": 0.9194943606853485, "num_tokens": 44346892.0, "step": 3595 }, { "entropy": 1.1744475960731506, "epoch": 1.89362822538178, "grad_norm": 0.2604866027832031, "learning_rate": 0.0001740645837198107, "loss": 0.2077919840812683, "mean_token_accuracy": 0.9139293134212494, "num_tokens": 44359228.0, "step": 3596 }, { "entropy": 1.173338770866394, "epoch": 1.8941548183254344, "grad_norm": 0.2635132968425751, "learning_rate": 0.00017404918041749126, "loss": 0.20279425382614136, "mean_token_accuracy": 0.9182106554508209, "num_tokens": 44371564.0, "step": 3597 }, { "entropy": 1.1710366010665894, "epoch": 1.8946814112690888, "grad_norm": 0.2733679711818695, "learning_rate": 0.0001740337733129453, "loss": 0.19158853590488434, "mean_token_accuracy": 0.9208205044269562, "num_tokens": 44383900.0, "step": 3598 }, { "entropy": 1.113152414560318, "epoch": 1.8952080042127437, "grad_norm": 0.24724428355693817, "learning_rate": 0.0001740183624070874, "loss": 0.18724195659160614, "mean_token_accuracy": 0.922689363360405, "num_tokens": 44396236.0, "step": 3599 }, { "entropy": 1.1231700778007507, "epoch": 1.8957345971563981, "grad_norm": 0.2390860617160797, "learning_rate": 0.00017400294770083247, "loss": 0.16968569159507751, "mean_token_accuracy": 0.9303603619337082, "num_tokens": 44408572.0, "step": 3600 }, { "entropy": 1.2249704897403717, "epoch": 1.8962611901000526, "grad_norm": 0.2889772951602936, "learning_rate": 0.0001739875291950956, "loss": 0.20824474096298218, "mean_token_accuracy": 0.9169190227985382, "num_tokens": 44420908.0, "step": 3601 }, { "entropy": 1.1704488396644592, "epoch": 1.8967877830437072, "grad_norm": 0.2680244445800781, "learning_rate": 0.00017397210689079203, "loss": 0.20673055946826935, "mean_token_accuracy": 0.9180959910154343, "num_tokens": 44433244.0, "step": 3602 }, { "entropy": 1.1878012716770172, "epoch": 1.8973143759873619, "grad_norm": 0.2975465953350067, "learning_rate": 0.00017395668078883734, "loss": 0.20991596579551697, "mean_token_accuracy": 0.9183283597230911, "num_tokens": 44445580.0, "step": 3603 }, { "entropy": 1.1773861050605774, "epoch": 1.8978409689310163, "grad_norm": 0.2718547284603119, "learning_rate": 0.0001739412508901473, "loss": 0.20017877221107483, "mean_token_accuracy": 0.9203770905733109, "num_tokens": 44457916.0, "step": 3604 }, { "entropy": 1.1368711590766907, "epoch": 1.898367561874671, "grad_norm": 0.2801942527294159, "learning_rate": 0.00017392581719563786, "loss": 0.20202471315860748, "mean_token_accuracy": 0.9181565046310425, "num_tokens": 44470252.0, "step": 3605 }, { "entropy": 1.1801301538944244, "epoch": 1.8988941548183256, "grad_norm": 0.30454739928245544, "learning_rate": 0.00017391037970622525, "loss": 0.2132726013660431, "mean_token_accuracy": 0.9120954275131226, "num_tokens": 44482588.0, "step": 3606 }, { "entropy": 1.1741478145122528, "epoch": 1.89942074776198, "grad_norm": 0.26906171441078186, "learning_rate": 0.00017389493842282587, "loss": 0.19884657859802246, "mean_token_accuracy": 0.917621061205864, "num_tokens": 44494924.0, "step": 3607 }, { "entropy": 1.1842193901538849, "epoch": 1.8999473407056344, "grad_norm": 0.25997108221054077, "learning_rate": 0.00017387949334635644, "loss": 0.19672074913978577, "mean_token_accuracy": 0.9219666868448257, "num_tokens": 44507260.0, "step": 3608 }, { "entropy": 1.1503727734088898, "epoch": 1.900473933649289, "grad_norm": 0.27212950587272644, "learning_rate": 0.00017386404447773378, "loss": 0.19361799955368042, "mean_token_accuracy": 0.9216768741607666, "num_tokens": 44519596.0, "step": 3609 }, { "entropy": 1.2314816415309906, "epoch": 1.9010005265929437, "grad_norm": 0.27919554710388184, "learning_rate": 0.00017384859181787503, "loss": 0.21054218709468842, "mean_token_accuracy": 0.9163404256105423, "num_tokens": 44531932.0, "step": 3610 }, { "entropy": 1.1658604443073273, "epoch": 1.9015271195365981, "grad_norm": 0.2740512192249298, "learning_rate": 0.00017383313536769755, "loss": 0.18958908319473267, "mean_token_accuracy": 0.9197452515363693, "num_tokens": 44544268.0, "step": 3611 }, { "entropy": 1.2027749419212341, "epoch": 1.9020537124802528, "grad_norm": 0.264543741941452, "learning_rate": 0.00017381767512811885, "loss": 0.20404848456382751, "mean_token_accuracy": 0.916832685470581, "num_tokens": 44556604.0, "step": 3612 }, { "entropy": 1.1814589202404022, "epoch": 1.9025803054239074, "grad_norm": 0.2642267048358917, "learning_rate": 0.00017380221110005673, "loss": 0.19606810808181763, "mean_token_accuracy": 0.918126568198204, "num_tokens": 44568940.0, "step": 3613 }, { "entropy": 1.1763567328453064, "epoch": 1.9031068983675619, "grad_norm": 0.2508313059806824, "learning_rate": 0.0001737867432844292, "loss": 0.1951427459716797, "mean_token_accuracy": 0.9166415929794312, "num_tokens": 44581276.0, "step": 3614 }, { "entropy": 1.2736837267875671, "epoch": 1.9036334913112163, "grad_norm": 0.2942288815975189, "learning_rate": 0.0001737712716821545, "loss": 0.21287119388580322, "mean_token_accuracy": 0.9135104715824127, "num_tokens": 44593612.0, "step": 3615 }, { "entropy": 1.2576221525669098, "epoch": 1.904160084254871, "grad_norm": 0.255913108587265, "learning_rate": 0.00017375579629415105, "loss": 0.1842191517353058, "mean_token_accuracy": 0.9250049591064453, "num_tokens": 44605948.0, "step": 3616 }, { "entropy": 1.251773089170456, "epoch": 1.9046866771985256, "grad_norm": 0.2758917212486267, "learning_rate": 0.00017374031712133765, "loss": 0.21524254977703094, "mean_token_accuracy": 0.9172472357749939, "num_tokens": 44618284.0, "step": 3617 }, { "entropy": 1.2298138439655304, "epoch": 1.90521327014218, "grad_norm": 0.2682817876338959, "learning_rate": 0.0001737248341646331, "loss": 0.19541317224502563, "mean_token_accuracy": 0.9179702699184418, "num_tokens": 44630620.0, "step": 3618 }, { "entropy": 1.2236283421516418, "epoch": 1.9057398630858347, "grad_norm": 0.26307037472724915, "learning_rate": 0.00017370934742495656, "loss": 0.20737697184085846, "mean_token_accuracy": 0.9137110263109207, "num_tokens": 44642956.0, "step": 3619 }, { "entropy": 1.243878036737442, "epoch": 1.9062664560294893, "grad_norm": 0.2502284049987793, "learning_rate": 0.0001736938569032274, "loss": 0.20081773400306702, "mean_token_accuracy": 0.9174046218395233, "num_tokens": 44655292.0, "step": 3620 }, { "entropy": 1.2514996528625488, "epoch": 1.9067930489731437, "grad_norm": 0.250877320766449, "learning_rate": 0.00017367836260036515, "loss": 0.18941593170166016, "mean_token_accuracy": 0.9203214943408966, "num_tokens": 44667628.0, "step": 3621 }, { "entropy": 1.2207768857479095, "epoch": 1.9073196419167984, "grad_norm": 0.29659348726272583, "learning_rate": 0.00017366286451728967, "loss": 0.18773111701011658, "mean_token_accuracy": 0.9253512769937515, "num_tokens": 44679964.0, "step": 3622 }, { "entropy": 1.1811819076538086, "epoch": 1.907846234860453, "grad_norm": 0.25071752071380615, "learning_rate": 0.000173647362654921, "loss": 0.1999988704919815, "mean_token_accuracy": 0.9158650636672974, "num_tokens": 44692300.0, "step": 3623 }, { "entropy": 1.2793206870555878, "epoch": 1.9083728278041074, "grad_norm": 0.28312739729881287, "learning_rate": 0.0001736318570141794, "loss": 0.20251990854740143, "mean_token_accuracy": 0.9155915677547455, "num_tokens": 44704636.0, "step": 3624 }, { "entropy": 1.2060322165489197, "epoch": 1.9088994207477619, "grad_norm": 0.24651455879211426, "learning_rate": 0.00017361634759598525, "loss": 0.19613385200500488, "mean_token_accuracy": 0.9165442436933517, "num_tokens": 44716972.0, "step": 3625 }, { "entropy": 1.1942104697227478, "epoch": 1.9094260136914165, "grad_norm": 0.2771541178226471, "learning_rate": 0.0001736008344012594, "loss": 0.21619367599487305, "mean_token_accuracy": 0.9139316976070404, "num_tokens": 44729308.0, "step": 3626 }, { "entropy": 1.1322157979011536, "epoch": 1.9099526066350712, "grad_norm": 0.25058284401893616, "learning_rate": 0.00017358531743092266, "loss": 0.18762576580047607, "mean_token_accuracy": 0.9215554296970367, "num_tokens": 44741644.0, "step": 3627 }, { "entropy": 1.2009500563144684, "epoch": 1.9104791995787256, "grad_norm": 0.27951785922050476, "learning_rate": 0.00017356979668589625, "loss": 0.2000935822725296, "mean_token_accuracy": 0.9177307933568954, "num_tokens": 44753980.0, "step": 3628 }, { "entropy": 1.185960978269577, "epoch": 1.9110057925223802, "grad_norm": 0.2635090947151184, "learning_rate": 0.00017355427216710152, "loss": 0.19260722398757935, "mean_token_accuracy": 0.9208453297615051, "num_tokens": 44766316.0, "step": 3629 }, { "entropy": 1.179717481136322, "epoch": 1.9115323854660349, "grad_norm": 0.291584312915802, "learning_rate": 0.00017353874387546005, "loss": 0.20042484998703003, "mean_token_accuracy": 0.91756771504879, "num_tokens": 44778652.0, "step": 3630 }, { "entropy": 1.1897325813770294, "epoch": 1.9120589784096893, "grad_norm": 0.2626997232437134, "learning_rate": 0.00017352321181189373, "loss": 0.19658340513706207, "mean_token_accuracy": 0.9180559068918228, "num_tokens": 44790988.0, "step": 3631 }, { "entropy": 1.1979995667934418, "epoch": 1.9125855713533437, "grad_norm": 0.28412285447120667, "learning_rate": 0.00017350767597732453, "loss": 0.21948397159576416, "mean_token_accuracy": 0.9098146557807922, "num_tokens": 44803324.0, "step": 3632 }, { "entropy": 1.1823217272758484, "epoch": 1.9131121642969984, "grad_norm": 0.27307748794555664, "learning_rate": 0.00017349213637267476, "loss": 0.21455425024032593, "mean_token_accuracy": 0.9142604321241379, "num_tokens": 44815660.0, "step": 3633 }, { "entropy": 1.2042896449565887, "epoch": 1.913638757240653, "grad_norm": 0.31086379289627075, "learning_rate": 0.00017347659299886693, "loss": 0.21350350975990295, "mean_token_accuracy": 0.9092680513858795, "num_tokens": 44827996.0, "step": 3634 }, { "entropy": 1.2283751964569092, "epoch": 1.9141653501843074, "grad_norm": 0.2663927376270294, "learning_rate": 0.00017346104585682373, "loss": 0.19472280144691467, "mean_token_accuracy": 0.9193729162216187, "num_tokens": 44840332.0, "step": 3635 }, { "entropy": 1.183545082807541, "epoch": 1.914691943127962, "grad_norm": 0.2771006226539612, "learning_rate": 0.00017344549494746815, "loss": 0.19897666573524475, "mean_token_accuracy": 0.9188507944345474, "num_tokens": 44852668.0, "step": 3636 }, { "entropy": 1.2296278774738312, "epoch": 1.9152185360716167, "grad_norm": 0.27564653754234314, "learning_rate": 0.0001734299402717233, "loss": 0.20981676876544952, "mean_token_accuracy": 0.9140519946813583, "num_tokens": 44865004.0, "step": 3637 }, { "entropy": 1.2284190952777863, "epoch": 1.9157451290152712, "grad_norm": 0.26339784264564514, "learning_rate": 0.0001734143818305126, "loss": 0.19718164205551147, "mean_token_accuracy": 0.9198196828365326, "num_tokens": 44877340.0, "step": 3638 }, { "entropy": 1.1841385960578918, "epoch": 1.9162717219589256, "grad_norm": 0.28311020135879517, "learning_rate": 0.00017339881962475965, "loss": 0.21129263937473297, "mean_token_accuracy": 0.912701204419136, "num_tokens": 44889676.0, "step": 3639 }, { "entropy": 1.1703853607177734, "epoch": 1.9167983149025805, "grad_norm": 0.24933747947216034, "learning_rate": 0.00017338325365538827, "loss": 0.2056872695684433, "mean_token_accuracy": 0.9159862697124481, "num_tokens": 44902012.0, "step": 3640 }, { "entropy": 1.2645052373409271, "epoch": 1.9173249078462349, "grad_norm": 0.26389506459236145, "learning_rate": 0.00017336768392332258, "loss": 0.19748938083648682, "mean_token_accuracy": 0.9188157171010971, "num_tokens": 44914348.0, "step": 3641 }, { "entropy": 1.2652300000190735, "epoch": 1.9178515007898893, "grad_norm": 0.255624383687973, "learning_rate": 0.00017335211042948683, "loss": 0.18445834517478943, "mean_token_accuracy": 0.9235481023788452, "num_tokens": 44926684.0, "step": 3642 }, { "entropy": 1.2511534094810486, "epoch": 1.918378093733544, "grad_norm": 0.26123735308647156, "learning_rate": 0.0001733365331748055, "loss": 0.19365046918392181, "mean_token_accuracy": 0.921040266752243, "num_tokens": 44939020.0, "step": 3643 }, { "entropy": 1.2718633115291595, "epoch": 1.9189046866771986, "grad_norm": 0.28643572330474854, "learning_rate": 0.00017332095216020338, "loss": 0.2148754596710205, "mean_token_accuracy": 0.9159789234399796, "num_tokens": 44951356.0, "step": 3644 }, { "entropy": 1.3365231156349182, "epoch": 1.919431279620853, "grad_norm": 0.2991255223751068, "learning_rate": 0.0001733053673866054, "loss": 0.2158765196800232, "mean_token_accuracy": 0.9090882688760757, "num_tokens": 44963692.0, "step": 3645 }, { "entropy": 1.2829530537128448, "epoch": 1.9199578725645077, "grad_norm": 0.31265580654144287, "learning_rate": 0.0001732897788549367, "loss": 0.22893324494361877, "mean_token_accuracy": 0.9042454361915588, "num_tokens": 44976028.0, "step": 3646 }, { "entropy": 1.2604970932006836, "epoch": 1.9204844655081623, "grad_norm": 0.28193265199661255, "learning_rate": 0.00017327418656612272, "loss": 0.20636524260044098, "mean_token_accuracy": 0.9135946780443192, "num_tokens": 44988364.0, "step": 3647 }, { "entropy": 1.3023660778999329, "epoch": 1.9210110584518167, "grad_norm": 0.28154146671295166, "learning_rate": 0.00017325859052108906, "loss": 0.2026195228099823, "mean_token_accuracy": 0.9120919853448868, "num_tokens": 45000700.0, "step": 3648 }, { "entropy": 1.265262395143509, "epoch": 1.9215376513954712, "grad_norm": 0.24685363471508026, "learning_rate": 0.0001732429907207616, "loss": 0.19602523744106293, "mean_token_accuracy": 0.9172793030738831, "num_tokens": 45013036.0, "step": 3649 }, { "entropy": 1.3104206323623657, "epoch": 1.9220642443391258, "grad_norm": 0.31668615341186523, "learning_rate": 0.00017322738716606638, "loss": 0.22926807403564453, "mean_token_accuracy": 0.9078969061374664, "num_tokens": 45025372.0, "step": 3650 }, { "entropy": 1.2556992173194885, "epoch": 1.9225908372827805, "grad_norm": 0.2678292691707611, "learning_rate": 0.00017321177985792972, "loss": 0.19617974758148193, "mean_token_accuracy": 0.9211210906505585, "num_tokens": 45037708.0, "step": 3651 }, { "entropy": 1.3135022222995758, "epoch": 1.9231174302264349, "grad_norm": 0.26799413561820984, "learning_rate": 0.0001731961687972781, "loss": 0.20180177688598633, "mean_token_accuracy": 0.916679710149765, "num_tokens": 45050044.0, "step": 3652 }, { "entropy": 1.2593377232551575, "epoch": 1.9236440231700895, "grad_norm": 0.26281964778900146, "learning_rate": 0.0001731805539850383, "loss": 0.1954004168510437, "mean_token_accuracy": 0.9243785589933395, "num_tokens": 45062380.0, "step": 3653 }, { "entropy": 1.2636898756027222, "epoch": 1.9241706161137442, "grad_norm": 0.26839685440063477, "learning_rate": 0.00017316493542213722, "loss": 0.19961456954479218, "mean_token_accuracy": 0.9217253774404526, "num_tokens": 45074716.0, "step": 3654 }, { "entropy": 1.2462226152420044, "epoch": 1.9246972090573986, "grad_norm": 0.2672293186187744, "learning_rate": 0.00017314931310950208, "loss": 0.191788911819458, "mean_token_accuracy": 0.9207832664251328, "num_tokens": 45087052.0, "step": 3655 }, { "entropy": 1.24080029129982, "epoch": 1.925223802001053, "grad_norm": 0.27368423342704773, "learning_rate": 0.0001731336870480603, "loss": 0.19978970289230347, "mean_token_accuracy": 0.9169470369815826, "num_tokens": 45099388.0, "step": 3656 }, { "entropy": 1.1998139321804047, "epoch": 1.925750394944708, "grad_norm": 0.2728565037250519, "learning_rate": 0.00017311805723873946, "loss": 0.20359551906585693, "mean_token_accuracy": 0.9137473702430725, "num_tokens": 45111724.0, "step": 3657 }, { "entropy": 1.2402350306510925, "epoch": 1.9262769878883623, "grad_norm": 0.28210633993148804, "learning_rate": 0.00017310242368246746, "loss": 0.19972732663154602, "mean_token_accuracy": 0.9203901588916779, "num_tokens": 45124060.0, "step": 3658 }, { "entropy": 1.2057775259017944, "epoch": 1.9268035808320167, "grad_norm": 0.26620033383369446, "learning_rate": 0.00017308678638017238, "loss": 0.19069263339042664, "mean_token_accuracy": 0.9222879111766815, "num_tokens": 45136396.0, "step": 3659 }, { "entropy": 1.2476109266281128, "epoch": 1.9273301737756714, "grad_norm": 0.24337823688983917, "learning_rate": 0.00017307114533278247, "loss": 0.1780460923910141, "mean_token_accuracy": 0.9250701814889908, "num_tokens": 45148732.0, "step": 3660 }, { "entropy": 1.1989704370498657, "epoch": 1.927856766719326, "grad_norm": 0.25690510869026184, "learning_rate": 0.00017305550054122625, "loss": 0.19341933727264404, "mean_token_accuracy": 0.9228748381137848, "num_tokens": 45161068.0, "step": 3661 }, { "entropy": 1.2263188660144806, "epoch": 1.9283833596629805, "grad_norm": 0.26640671491622925, "learning_rate": 0.0001730398520064325, "loss": 0.18614225089550018, "mean_token_accuracy": 0.9255273640155792, "num_tokens": 45173404.0, "step": 3662 }, { "entropy": 1.272974044084549, "epoch": 1.9289099526066351, "grad_norm": 0.3008297383785248, "learning_rate": 0.00017302419972933014, "loss": 0.2073616087436676, "mean_token_accuracy": 0.9149825423955917, "num_tokens": 45185740.0, "step": 3663 }, { "entropy": 1.2914739549160004, "epoch": 1.9294365455502898, "grad_norm": 0.27512502670288086, "learning_rate": 0.0001730085437108484, "loss": 0.20276200771331787, "mean_token_accuracy": 0.9159463495016098, "num_tokens": 45198076.0, "step": 3664 }, { "entropy": 1.3106342256069183, "epoch": 1.9299631384939442, "grad_norm": 0.29478466510772705, "learning_rate": 0.00017299288395191664, "loss": 0.20114478468894958, "mean_token_accuracy": 0.9164300113916397, "num_tokens": 45210412.0, "step": 3665 }, { "entropy": 1.3369048535823822, "epoch": 1.9304897314375986, "grad_norm": 0.27624809741973877, "learning_rate": 0.0001729772204534645, "loss": 0.20260167121887207, "mean_token_accuracy": 0.9126608073711395, "num_tokens": 45222748.0, "step": 3666 }, { "entropy": 1.3504050076007843, "epoch": 1.9310163243812533, "grad_norm": 0.31120526790618896, "learning_rate": 0.00017296155321642188, "loss": 0.2171817421913147, "mean_token_accuracy": 0.9078565239906311, "num_tokens": 45235084.0, "step": 3667 }, { "entropy": 1.3360699117183685, "epoch": 1.931542917324908, "grad_norm": 0.29817092418670654, "learning_rate": 0.00017294588224171879, "loss": 0.1921902298927307, "mean_token_accuracy": 0.9241172969341278, "num_tokens": 45247420.0, "step": 3668 }, { "entropy": 1.3836988508701324, "epoch": 1.9320695102685623, "grad_norm": 0.2684880793094635, "learning_rate": 0.00017293020753028556, "loss": 0.20802155137062073, "mean_token_accuracy": 0.9166839867830276, "num_tokens": 45259756.0, "step": 3669 }, { "entropy": 1.4190702736377716, "epoch": 1.932596103212217, "grad_norm": 0.25781887769699097, "learning_rate": 0.00017291452908305268, "loss": 0.18944363296031952, "mean_token_accuracy": 0.9194059371948242, "num_tokens": 45272092.0, "step": 3670 }, { "entropy": 1.4297086596488953, "epoch": 1.9331226961558716, "grad_norm": 0.25668513774871826, "learning_rate": 0.00017289884690095092, "loss": 0.18865437805652618, "mean_token_accuracy": 0.9221978783607483, "num_tokens": 45284428.0, "step": 3671 }, { "entropy": 1.4811699092388153, "epoch": 1.933649289099526, "grad_norm": 0.25223368406295776, "learning_rate": 0.00017288316098491122, "loss": 0.1869308352470398, "mean_token_accuracy": 0.926489993929863, "num_tokens": 45296764.0, "step": 3672 }, { "entropy": 1.4673098027706146, "epoch": 1.9341758820431805, "grad_norm": 0.2823149263858795, "learning_rate": 0.00017286747133586473, "loss": 0.21887610852718353, "mean_token_accuracy": 0.9101450145244598, "num_tokens": 45309100.0, "step": 3673 }, { "entropy": 1.4374184310436249, "epoch": 1.9347024749868353, "grad_norm": 0.2951841652393341, "learning_rate": 0.00017285177795474293, "loss": 0.21811825037002563, "mean_token_accuracy": 0.9097328335046768, "num_tokens": 45321436.0, "step": 3674 }, { "entropy": 1.474625825881958, "epoch": 1.9352290679304898, "grad_norm": 0.2604941725730896, "learning_rate": 0.00017283608084247738, "loss": 0.18887674808502197, "mean_token_accuracy": 0.9238714724779129, "num_tokens": 45333772.0, "step": 3675 }, { "entropy": 1.4799661338329315, "epoch": 1.9357556608741442, "grad_norm": 0.2468399554491043, "learning_rate": 0.00017282037999999996, "loss": 0.20713761448860168, "mean_token_accuracy": 0.9197785556316376, "num_tokens": 45346108.0, "step": 3676 }, { "entropy": 1.4618735611438751, "epoch": 1.9362822538177988, "grad_norm": 0.24083919823169708, "learning_rate": 0.0001728046754282427, "loss": 0.18771159648895264, "mean_token_accuracy": 0.9197709262371063, "num_tokens": 45358444.0, "step": 3677 }, { "entropy": 1.5067411363124847, "epoch": 1.9368088467614535, "grad_norm": 0.2688843607902527, "learning_rate": 0.00017278896712813794, "loss": 0.19874204695224762, "mean_token_accuracy": 0.9193889200687408, "num_tokens": 45370780.0, "step": 3678 }, { "entropy": 1.4961673319339752, "epoch": 1.937335439705108, "grad_norm": 0.28911784291267395, "learning_rate": 0.00017277325510061813, "loss": 0.20285126566886902, "mean_token_accuracy": 0.9150000810623169, "num_tokens": 45383116.0, "step": 3679 }, { "entropy": 1.5026283860206604, "epoch": 1.9378620326487626, "grad_norm": 0.26418668031692505, "learning_rate": 0.00017275753934661606, "loss": 0.2061035931110382, "mean_token_accuracy": 0.9167807698249817, "num_tokens": 45395452.0, "step": 3680 }, { "entropy": 1.4821618497371674, "epoch": 1.9383886255924172, "grad_norm": 0.2582075893878937, "learning_rate": 0.00017274181986706464, "loss": 0.19469109177589417, "mean_token_accuracy": 0.9196734130382538, "num_tokens": 45407788.0, "step": 3681 }, { "entropy": 1.4628108739852905, "epoch": 1.9389152185360716, "grad_norm": 0.27692705392837524, "learning_rate": 0.0001727260966628971, "loss": 0.20121949911117554, "mean_token_accuracy": 0.9166281670331955, "num_tokens": 45420124.0, "step": 3682 }, { "entropy": 1.4591149389743805, "epoch": 1.939441811479726, "grad_norm": 0.28909337520599365, "learning_rate": 0.00017271036973504674, "loss": 0.19279229640960693, "mean_token_accuracy": 0.9220520555973053, "num_tokens": 45432460.0, "step": 3683 }, { "entropy": 1.5424366295337677, "epoch": 1.9399684044233807, "grad_norm": 0.3063618242740631, "learning_rate": 0.00017269463908444724, "loss": 0.2191891372203827, "mean_token_accuracy": 0.9127875715494156, "num_tokens": 45444796.0, "step": 3684 }, { "entropy": 1.4530845880508423, "epoch": 1.9404949973670353, "grad_norm": 0.2661772072315216, "learning_rate": 0.00017267890471203248, "loss": 0.19795681536197662, "mean_token_accuracy": 0.9154502600431442, "num_tokens": 45457132.0, "step": 3685 }, { "entropy": 1.4750907719135284, "epoch": 1.9410215903106898, "grad_norm": 0.2790045440196991, "learning_rate": 0.00017266316661873642, "loss": 0.22019743919372559, "mean_token_accuracy": 0.9140889048576355, "num_tokens": 45469468.0, "step": 3686 }, { "entropy": 1.4428746104240417, "epoch": 1.9415481832543444, "grad_norm": 0.26486507058143616, "learning_rate": 0.0001726474248054934, "loss": 0.1950511783361435, "mean_token_accuracy": 0.9183469414710999, "num_tokens": 45481804.0, "step": 3687 }, { "entropy": 1.5106236040592194, "epoch": 1.942074776197999, "grad_norm": 0.2506488263607025, "learning_rate": 0.00017263167927323794, "loss": 0.1819375455379486, "mean_token_accuracy": 0.9284966439008713, "num_tokens": 45494140.0, "step": 3688 }, { "entropy": 1.5388555824756622, "epoch": 1.9426013691416535, "grad_norm": 0.300800085067749, "learning_rate": 0.00017261593002290468, "loss": 0.19233667850494385, "mean_token_accuracy": 0.9199601858854294, "num_tokens": 45506476.0, "step": 3689 }, { "entropy": 1.48341503739357, "epoch": 1.943127962085308, "grad_norm": 0.32261741161346436, "learning_rate": 0.00017260017705542864, "loss": 0.21268944442272186, "mean_token_accuracy": 0.9111090153455734, "num_tokens": 45518812.0, "step": 3690 }, { "entropy": 1.5718600451946259, "epoch": 1.9436545550289626, "grad_norm": 0.29194772243499756, "learning_rate": 0.00017258442037174497, "loss": 0.19810812175273895, "mean_token_accuracy": 0.9194205850362778, "num_tokens": 45531148.0, "step": 3691 }, { "entropy": 1.4727455377578735, "epoch": 1.9441811479726172, "grad_norm": 0.263203501701355, "learning_rate": 0.00017256865997278896, "loss": 0.21588562428951263, "mean_token_accuracy": 0.9114230424165726, "num_tokens": 45543484.0, "step": 3692 }, { "entropy": 1.5082348585128784, "epoch": 1.9447077409162716, "grad_norm": 0.2874946594238281, "learning_rate": 0.0001725528958594963, "loss": 0.1873784065246582, "mean_token_accuracy": 0.9259777516126633, "num_tokens": 45555820.0, "step": 3693 }, { "entropy": 1.5053280889987946, "epoch": 1.9452343338599263, "grad_norm": 0.2794869542121887, "learning_rate": 0.00017253712803280284, "loss": 0.20504489541053772, "mean_token_accuracy": 0.9110683053731918, "num_tokens": 45568156.0, "step": 3694 }, { "entropy": 1.5468563735485077, "epoch": 1.945760926803581, "grad_norm": 0.27621355652809143, "learning_rate": 0.00017252135649364455, "loss": 0.21246497333049774, "mean_token_accuracy": 0.9150105863809586, "num_tokens": 45580492.0, "step": 3695 }, { "entropy": 1.5053722560405731, "epoch": 1.9462875197472354, "grad_norm": 0.2672613561153412, "learning_rate": 0.00017250558124295778, "loss": 0.20558930933475494, "mean_token_accuracy": 0.9144411534070969, "num_tokens": 45592828.0, "step": 3696 }, { "entropy": 1.4701599478721619, "epoch": 1.94681411269089, "grad_norm": 0.25279685854911804, "learning_rate": 0.0001724898022816789, "loss": 0.19829775393009186, "mean_token_accuracy": 0.921133354306221, "num_tokens": 45605164.0, "step": 3697 }, { "entropy": 1.5011445581912994, "epoch": 1.9473407056345446, "grad_norm": 0.2716440260410309, "learning_rate": 0.0001724740196107447, "loss": 0.20478171110153198, "mean_token_accuracy": 0.9158901125192642, "num_tokens": 45617500.0, "step": 3698 }, { "entropy": 1.480711042881012, "epoch": 1.947867298578199, "grad_norm": 0.2888793349266052, "learning_rate": 0.00017245823323109208, "loss": 0.19861237704753876, "mean_token_accuracy": 0.9149367064237595, "num_tokens": 45629836.0, "step": 3699 }, { "entropy": 1.426710307598114, "epoch": 1.9483938915218535, "grad_norm": 0.28729501366615295, "learning_rate": 0.00017244244314365822, "loss": 0.20462435483932495, "mean_token_accuracy": 0.9161471426486969, "num_tokens": 45642172.0, "step": 3700 }, { "entropy": 1.4438749551773071, "epoch": 1.9489204844655081, "grad_norm": 0.28520667552948, "learning_rate": 0.0001724266493493804, "loss": 0.20798423886299133, "mean_token_accuracy": 0.9113110899925232, "num_tokens": 45654508.0, "step": 3701 }, { "entropy": 1.4134547710418701, "epoch": 1.9494470774091628, "grad_norm": 0.26647916436195374, "learning_rate": 0.0001724108518491963, "loss": 0.19534523785114288, "mean_token_accuracy": 0.9230214208364487, "num_tokens": 45666844.0, "step": 3702 }, { "entropy": 1.4336603581905365, "epoch": 1.9499736703528172, "grad_norm": 0.27049604058265686, "learning_rate": 0.00017239505064404367, "loss": 0.18309858441352844, "mean_token_accuracy": 0.922065794467926, "num_tokens": 45679180.0, "step": 3703 }, { "entropy": 1.4100782871246338, "epoch": 1.9505002632964719, "grad_norm": 0.2777698338031769, "learning_rate": 0.00017237924573486053, "loss": 0.21323612332344055, "mean_token_accuracy": 0.9146802127361298, "num_tokens": 45691516.0, "step": 3704 }, { "entropy": 1.3497129678726196, "epoch": 1.9510268562401265, "grad_norm": 0.26056769490242004, "learning_rate": 0.00017236343712258515, "loss": 0.18909797072410583, "mean_token_accuracy": 0.9163524806499481, "num_tokens": 45703852.0, "step": 3705 }, { "entropy": 1.442967563867569, "epoch": 1.951553449183781, "grad_norm": 0.3076518774032593, "learning_rate": 0.000172347624808156, "loss": 0.20429672300815582, "mean_token_accuracy": 0.9184731394052505, "num_tokens": 45716188.0, "step": 3706 }, { "entropy": 1.3970259726047516, "epoch": 1.9520800421274354, "grad_norm": 0.2776000201702118, "learning_rate": 0.00017233180879251176, "loss": 0.18460848927497864, "mean_token_accuracy": 0.9276632517576218, "num_tokens": 45728524.0, "step": 3707 }, { "entropy": 1.3923786878585815, "epoch": 1.95260663507109, "grad_norm": 0.2807813286781311, "learning_rate": 0.00017231598907659133, "loss": 0.19556443393230438, "mean_token_accuracy": 0.9221478253602982, "num_tokens": 45740860.0, "step": 3708 }, { "entropy": 1.352414458990097, "epoch": 1.9531332280147446, "grad_norm": 0.27617254853248596, "learning_rate": 0.0001723001656613338, "loss": 0.20182929933071136, "mean_token_accuracy": 0.9149250984191895, "num_tokens": 45753196.0, "step": 3709 }, { "entropy": 1.3327330350875854, "epoch": 1.953659820958399, "grad_norm": 0.34774214029312134, "learning_rate": 0.00017228433854767859, "loss": 0.20589327812194824, "mean_token_accuracy": 0.9095378816127777, "num_tokens": 45765532.0, "step": 3710 }, { "entropy": 1.3821765780448914, "epoch": 1.9541864139020537, "grad_norm": 0.27642711997032166, "learning_rate": 0.00017226850773656522, "loss": 0.18724891543388367, "mean_token_accuracy": 0.9221665114164352, "num_tokens": 45777868.0, "step": 3711 }, { "entropy": 1.3774185180664062, "epoch": 1.9547130068457084, "grad_norm": 0.2937214970588684, "learning_rate": 0.00017225267322893345, "loss": 0.2190551459789276, "mean_token_accuracy": 0.9116322845220566, "num_tokens": 45790204.0, "step": 3712 }, { "entropy": 1.4014697074890137, "epoch": 1.9552395997893628, "grad_norm": 0.28920748829841614, "learning_rate": 0.0001722368350257233, "loss": 0.21408043801784515, "mean_token_accuracy": 0.9153937697410583, "num_tokens": 45802540.0, "step": 3713 }, { "entropy": 1.3347688913345337, "epoch": 1.9557661927330172, "grad_norm": 0.2642535865306854, "learning_rate": 0.000172220993127875, "loss": 0.18664056062698364, "mean_token_accuracy": 0.9244186133146286, "num_tokens": 45814876.0, "step": 3714 }, { "entropy": 1.4463875889778137, "epoch": 1.956292785676672, "grad_norm": 0.29163017868995667, "learning_rate": 0.000172205147536329, "loss": 0.1997067928314209, "mean_token_accuracy": 0.9191901385784149, "num_tokens": 45827212.0, "step": 3715 }, { "entropy": 1.356296420097351, "epoch": 1.9568193786203265, "grad_norm": 0.2423374354839325, "learning_rate": 0.000172189298252026, "loss": 0.17346829175949097, "mean_token_accuracy": 0.9300062209367752, "num_tokens": 45839548.0, "step": 3716 }, { "entropy": 1.4623576700687408, "epoch": 1.957345971563981, "grad_norm": 0.29987430572509766, "learning_rate": 0.00017217344527590674, "loss": 0.21269282698631287, "mean_token_accuracy": 0.910034641623497, "num_tokens": 45851884.0, "step": 3717 }, { "entropy": 1.3989585936069489, "epoch": 1.9578725645076356, "grad_norm": 0.2627890408039093, "learning_rate": 0.00017215758860891246, "loss": 0.19222907721996307, "mean_token_accuracy": 0.9272477477788925, "num_tokens": 45864220.0, "step": 3718 }, { "entropy": 1.3934078514575958, "epoch": 1.9583991574512902, "grad_norm": 0.29076218605041504, "learning_rate": 0.00017214172825198444, "loss": 0.19307014346122742, "mean_token_accuracy": 0.9236427992582321, "num_tokens": 45876556.0, "step": 3719 }, { "entropy": 1.3593478798866272, "epoch": 1.9589257503949447, "grad_norm": 0.2587772309780121, "learning_rate": 0.00017212586420606416, "loss": 0.19868242740631104, "mean_token_accuracy": 0.916473776102066, "num_tokens": 45888892.0, "step": 3720 }, { "entropy": 1.3617135286331177, "epoch": 1.9594523433385993, "grad_norm": 0.26174452900886536, "learning_rate": 0.00017210999647209344, "loss": 0.19469386339187622, "mean_token_accuracy": 0.9216127842664719, "num_tokens": 45901228.0, "step": 3721 }, { "entropy": 1.3824553787708282, "epoch": 1.959978936282254, "grad_norm": 0.2771162688732147, "learning_rate": 0.00017209412505101424, "loss": 0.19940043985843658, "mean_token_accuracy": 0.9135098457336426, "num_tokens": 45913564.0, "step": 3722 }, { "entropy": 1.396307110786438, "epoch": 1.9605055292259084, "grad_norm": 0.2760707139968872, "learning_rate": 0.00017207824994376874, "loss": 0.20229698717594147, "mean_token_accuracy": 0.9171424061059952, "num_tokens": 45925900.0, "step": 3723 }, { "entropy": 1.386707216501236, "epoch": 1.9610321221695628, "grad_norm": 0.290345698595047, "learning_rate": 0.00017206237115129937, "loss": 0.17667615413665771, "mean_token_accuracy": 0.9289303123950958, "num_tokens": 45938236.0, "step": 3724 }, { "entropy": 1.4016615748405457, "epoch": 1.9615587151132174, "grad_norm": 0.2932867407798767, "learning_rate": 0.00017204648867454874, "loss": 0.2111460119485855, "mean_token_accuracy": 0.915149986743927, "num_tokens": 45950572.0, "step": 3725 }, { "entropy": 1.3835887610912323, "epoch": 1.962085308056872, "grad_norm": 0.27471598982810974, "learning_rate": 0.0001720306025144597, "loss": 0.19538769125938416, "mean_token_accuracy": 0.9221490770578384, "num_tokens": 45962908.0, "step": 3726 }, { "entropy": 1.361358791589737, "epoch": 1.9626119010005265, "grad_norm": 0.3096008002758026, "learning_rate": 0.00017201471267197534, "loss": 0.22924600541591644, "mean_token_accuracy": 0.912015825510025, "num_tokens": 45975244.0, "step": 3727 }, { "entropy": 1.351409524679184, "epoch": 1.9631384939441812, "grad_norm": 0.27216240763664246, "learning_rate": 0.00017199881914803895, "loss": 0.19787034392356873, "mean_token_accuracy": 0.9182685315608978, "num_tokens": 45987580.0, "step": 3728 }, { "entropy": 1.4106302857398987, "epoch": 1.9636650868878358, "grad_norm": 0.28636589646339417, "learning_rate": 0.00017198292194359403, "loss": 0.22176605463027954, "mean_token_accuracy": 0.9129254519939423, "num_tokens": 45999916.0, "step": 3729 }, { "entropy": 1.351713240146637, "epoch": 1.9641916798314902, "grad_norm": 0.2533683180809021, "learning_rate": 0.00017196702105958428, "loss": 0.19331756234169006, "mean_token_accuracy": 0.9180753231048584, "num_tokens": 46012252.0, "step": 3730 }, { "entropy": 1.4381624460220337, "epoch": 1.9647182727751447, "grad_norm": 0.2788030207157135, "learning_rate": 0.00017195111649695368, "loss": 0.21007753908634186, "mean_token_accuracy": 0.9156930446624756, "num_tokens": 46024588.0, "step": 3731 }, { "entropy": 1.412168174982071, "epoch": 1.9652448657187995, "grad_norm": 0.31602713465690613, "learning_rate": 0.00017193520825664632, "loss": 0.17869442701339722, "mean_token_accuracy": 0.9241944849491119, "num_tokens": 46036924.0, "step": 3732 }, { "entropy": 1.3544166386127472, "epoch": 1.965771458662454, "grad_norm": 0.27904483675956726, "learning_rate": 0.0001719192963396067, "loss": 0.17792828381061554, "mean_token_accuracy": 0.9248538911342621, "num_tokens": 46049260.0, "step": 3733 }, { "entropy": 1.380949467420578, "epoch": 1.9662980516061084, "grad_norm": 0.266156405210495, "learning_rate": 0.0001719033807467793, "loss": 0.19987784326076508, "mean_token_accuracy": 0.9200113117694855, "num_tokens": 46061596.0, "step": 3734 }, { "entropy": 1.4363450706005096, "epoch": 1.966824644549763, "grad_norm": 0.25485169887542725, "learning_rate": 0.000171887461479109, "loss": 0.18918852508068085, "mean_token_accuracy": 0.926123857498169, "num_tokens": 46073932.0, "step": 3735 }, { "entropy": 1.5534420013427734, "epoch": 1.9673512374934177, "grad_norm": 0.3038926422595978, "learning_rate": 0.00017187153853754082, "loss": 0.1933830827474594, "mean_token_accuracy": 0.9212097078561783, "num_tokens": 46086268.0, "step": 3736 }, { "entropy": 1.4520435631275177, "epoch": 1.967877830437072, "grad_norm": 0.2602609395980835, "learning_rate": 0.00017185561192302004, "loss": 0.20847854018211365, "mean_token_accuracy": 0.914483830332756, "num_tokens": 46098604.0, "step": 3737 }, { "entropy": 1.4301496744155884, "epoch": 1.9684044233807267, "grad_norm": 0.28433549404144287, "learning_rate": 0.00017183968163649206, "loss": 0.20116156339645386, "mean_token_accuracy": 0.9151373505592346, "num_tokens": 46110940.0, "step": 3738 }, { "entropy": 1.4304525554180145, "epoch": 1.9689310163243814, "grad_norm": 0.24822618067264557, "learning_rate": 0.00017182374767890263, "loss": 0.20083917677402496, "mean_token_accuracy": 0.9184573292732239, "num_tokens": 46123276.0, "step": 3739 }, { "entropy": 1.4638838469982147, "epoch": 1.9694576092680358, "grad_norm": 0.2700670659542084, "learning_rate": 0.00017180781005119765, "loss": 0.20267093181610107, "mean_token_accuracy": 0.9162935614585876, "num_tokens": 46135612.0, "step": 3740 }, { "entropy": 1.3683336675167084, "epoch": 1.9699842022116902, "grad_norm": 0.26389580965042114, "learning_rate": 0.00017179186875432322, "loss": 0.1996886432170868, "mean_token_accuracy": 0.9172192066907883, "num_tokens": 46147948.0, "step": 3741 }, { "entropy": 1.411024570465088, "epoch": 1.9705107951553449, "grad_norm": 0.26272377371788025, "learning_rate": 0.00017177592378922566, "loss": 0.20570415258407593, "mean_token_accuracy": 0.9192255139350891, "num_tokens": 46160284.0, "step": 3742 }, { "entropy": 1.3969583213329315, "epoch": 1.9710373880989995, "grad_norm": 0.2648279666900635, "learning_rate": 0.0001717599751568516, "loss": 0.19804665446281433, "mean_token_accuracy": 0.9161637872457504, "num_tokens": 46172620.0, "step": 3743 }, { "entropy": 1.430682510137558, "epoch": 1.971563981042654, "grad_norm": 0.2636677920818329, "learning_rate": 0.00017174402285814776, "loss": 0.20058637857437134, "mean_token_accuracy": 0.9166569113731384, "num_tokens": 46184956.0, "step": 3744 }, { "entropy": 1.4314651489257812, "epoch": 1.9720905739863086, "grad_norm": 0.27471134066581726, "learning_rate": 0.00017172806689406118, "loss": 0.19406890869140625, "mean_token_accuracy": 0.9242938160896301, "num_tokens": 46197292.0, "step": 3745 }, { "entropy": 1.4192952811717987, "epoch": 1.9726171669299633, "grad_norm": 0.30075007677078247, "learning_rate": 0.00017171210726553903, "loss": 0.21153703331947327, "mean_token_accuracy": 0.91255022585392, "num_tokens": 46209628.0, "step": 3746 }, { "entropy": 1.4196560978889465, "epoch": 1.9731437598736177, "grad_norm": 0.2734670341014862, "learning_rate": 0.00017169614397352875, "loss": 0.19642943143844604, "mean_token_accuracy": 0.9212541729211807, "num_tokens": 46221964.0, "step": 3747 }, { "entropy": 1.3763989508152008, "epoch": 1.973670352817272, "grad_norm": 0.24970701336860657, "learning_rate": 0.00017168017701897802, "loss": 0.19371524453163147, "mean_token_accuracy": 0.9200150370597839, "num_tokens": 46234300.0, "step": 3748 }, { "entropy": 1.417275309562683, "epoch": 1.974196945760927, "grad_norm": 0.2494390606880188, "learning_rate": 0.00017166420640283466, "loss": 0.19952630996704102, "mean_token_accuracy": 0.9210073202848434, "num_tokens": 46246636.0, "step": 3749 }, { "entropy": 1.380375474691391, "epoch": 1.9747235387045814, "grad_norm": 0.2673463225364685, "learning_rate": 0.00017164823212604676, "loss": 0.19341374933719635, "mean_token_accuracy": 0.9220623522996902, "num_tokens": 46258972.0, "step": 3750 }, { "entropy": 1.3973598778247833, "epoch": 1.9752501316482358, "grad_norm": 0.28491443395614624, "learning_rate": 0.00017163225418956267, "loss": 0.21687844395637512, "mean_token_accuracy": 0.913015678524971, "num_tokens": 46271308.0, "step": 3751 }, { "entropy": 1.4152703285217285, "epoch": 1.9757767245918905, "grad_norm": 0.2640281021595001, "learning_rate": 0.00017161627259433082, "loss": 0.19280694425106049, "mean_token_accuracy": 0.9230195134878159, "num_tokens": 46283644.0, "step": 3752 }, { "entropy": 1.381377637386322, "epoch": 1.9763033175355451, "grad_norm": 0.2697671949863434, "learning_rate": 0.00017160028734130003, "loss": 0.18636345863342285, "mean_token_accuracy": 0.9252691715955734, "num_tokens": 46295980.0, "step": 3753 }, { "entropy": 1.3591782450675964, "epoch": 1.9768299104791995, "grad_norm": 0.2595213055610657, "learning_rate": 0.0001715842984314192, "loss": 0.19123241305351257, "mean_token_accuracy": 0.9189948439598083, "num_tokens": 46308316.0, "step": 3754 }, { "entropy": 1.3821331858634949, "epoch": 1.9773565034228542, "grad_norm": 0.27835193276405334, "learning_rate": 0.0001715683058656375, "loss": 0.2042919397354126, "mean_token_accuracy": 0.9147767573595047, "num_tokens": 46320652.0, "step": 3755 }, { "entropy": 1.3725225925445557, "epoch": 1.9778830963665088, "grad_norm": 0.2779839336872101, "learning_rate": 0.0001715523096449043, "loss": 0.20555046200752258, "mean_token_accuracy": 0.9161995947360992, "num_tokens": 46332988.0, "step": 3756 }, { "entropy": 1.3390932083129883, "epoch": 1.9784096893101633, "grad_norm": 0.2884056270122528, "learning_rate": 0.00017153630977016933, "loss": 0.21466374397277832, "mean_token_accuracy": 0.9098951071500778, "num_tokens": 46345324.0, "step": 3757 }, { "entropy": 1.304327368736267, "epoch": 1.9789362822538177, "grad_norm": 0.28233397006988525, "learning_rate": 0.00017152030624238224, "loss": 0.2030801624059677, "mean_token_accuracy": 0.9174643605947495, "num_tokens": 46357660.0, "step": 3758 }, { "entropy": 1.3582344055175781, "epoch": 1.9794628751974723, "grad_norm": 0.2734123170375824, "learning_rate": 0.00017150429906249314, "loss": 0.20131902396678925, "mean_token_accuracy": 0.9201581329107285, "num_tokens": 46369996.0, "step": 3759 }, { "entropy": 1.3707594871520996, "epoch": 1.979989468141127, "grad_norm": 0.28123629093170166, "learning_rate": 0.0001714882882314523, "loss": 0.22594565153121948, "mean_token_accuracy": 0.9095589369535446, "num_tokens": 46382332.0, "step": 3760 }, { "entropy": 1.325995683670044, "epoch": 1.9805160610847814, "grad_norm": 0.2784866690635681, "learning_rate": 0.00017147227375021015, "loss": 0.21171274781227112, "mean_token_accuracy": 0.9164798855781555, "num_tokens": 46394668.0, "step": 3761 }, { "entropy": 1.3826212286949158, "epoch": 1.981042654028436, "grad_norm": 0.27320340275764465, "learning_rate": 0.0001714562556197174, "loss": 0.18267717957496643, "mean_token_accuracy": 0.9259230494499207, "num_tokens": 46407004.0, "step": 3762 }, { "entropy": 1.2950341999530792, "epoch": 1.9815692469720907, "grad_norm": 0.28982457518577576, "learning_rate": 0.00017144023384092495, "loss": 0.20509836077690125, "mean_token_accuracy": 0.9163513332605362, "num_tokens": 46419340.0, "step": 3763 }, { "entropy": 1.3356437385082245, "epoch": 1.9820958399157451, "grad_norm": 0.2567256689071655, "learning_rate": 0.00017142420841478393, "loss": 0.18219546973705292, "mean_token_accuracy": 0.9224260747432709, "num_tokens": 46431676.0, "step": 3764 }, { "entropy": 1.3211258351802826, "epoch": 1.9826224328593995, "grad_norm": 0.25619199872016907, "learning_rate": 0.00017140817934224565, "loss": 0.20122160017490387, "mean_token_accuracy": 0.9165990948677063, "num_tokens": 46444012.0, "step": 3765 }, { "entropy": 1.2932257950305939, "epoch": 1.9831490258030542, "grad_norm": 0.2684885561466217, "learning_rate": 0.00017139214662426167, "loss": 0.1878378689289093, "mean_token_accuracy": 0.9228431284427643, "num_tokens": 46456348.0, "step": 3766 }, { "entropy": 1.2775112092494965, "epoch": 1.9836756187467088, "grad_norm": 0.2664264738559723, "learning_rate": 0.00017137611026178375, "loss": 0.19962744414806366, "mean_token_accuracy": 0.9182207137346268, "num_tokens": 46468684.0, "step": 3767 }, { "entropy": 1.2961704730987549, "epoch": 1.9842022116903633, "grad_norm": 0.27163180708885193, "learning_rate": 0.00017136007025576392, "loss": 0.2212834358215332, "mean_token_accuracy": 0.9135020226240158, "num_tokens": 46481020.0, "step": 3768 }, { "entropy": 1.3635116219520569, "epoch": 1.984728804634018, "grad_norm": 0.2555164396762848, "learning_rate": 0.00017134402660715436, "loss": 0.19105497002601624, "mean_token_accuracy": 0.92401522397995, "num_tokens": 46493356.0, "step": 3769 }, { "entropy": 1.2995677888393402, "epoch": 1.9852553975776726, "grad_norm": 0.2641841173171997, "learning_rate": 0.00017132797931690747, "loss": 0.19776709377765656, "mean_token_accuracy": 0.9210506677627563, "num_tokens": 46505692.0, "step": 3770 }, { "entropy": 1.2360694408416748, "epoch": 1.985781990521327, "grad_norm": 0.2550431489944458, "learning_rate": 0.0001713119283859759, "loss": 0.18957817554473877, "mean_token_accuracy": 0.9171388000249863, "num_tokens": 46518028.0, "step": 3771 }, { "entropy": 1.273363709449768, "epoch": 1.9863085834649814, "grad_norm": 0.25279700756073, "learning_rate": 0.00017129587381531247, "loss": 0.19003725051879883, "mean_token_accuracy": 0.9217302948236465, "num_tokens": 46530364.0, "step": 3772 }, { "entropy": 1.2529352307319641, "epoch": 1.9868351764086363, "grad_norm": 0.2749396860599518, "learning_rate": 0.0001712798156058703, "loss": 0.1858321577310562, "mean_token_accuracy": 0.9264263361692429, "num_tokens": 46542700.0, "step": 3773 }, { "entropy": 1.2869006991386414, "epoch": 1.9873617693522907, "grad_norm": 0.28312820196151733, "learning_rate": 0.00017126375375860263, "loss": 0.21077433228492737, "mean_token_accuracy": 0.9111466556787491, "num_tokens": 46555036.0, "step": 3774 }, { "entropy": 1.2937982976436615, "epoch": 1.9878883622959451, "grad_norm": 0.29525041580200195, "learning_rate": 0.00017124768827446297, "loss": 0.21481990814208984, "mean_token_accuracy": 0.9122337698936462, "num_tokens": 46567372.0, "step": 3775 }, { "entropy": 1.287131816148758, "epoch": 1.9884149552395998, "grad_norm": 0.2926379442214966, "learning_rate": 0.00017123161915440503, "loss": 0.20220476388931274, "mean_token_accuracy": 0.9196414649486542, "num_tokens": 46579708.0, "step": 3776 }, { "entropy": 1.2510655224323273, "epoch": 1.9889415481832544, "grad_norm": 0.307608962059021, "learning_rate": 0.00017121554639938272, "loss": 0.1835639774799347, "mean_token_accuracy": 0.9256336688995361, "num_tokens": 46592044.0, "step": 3777 }, { "entropy": 1.198952555656433, "epoch": 1.9894681411269088, "grad_norm": 0.2576758563518524, "learning_rate": 0.00017119947001035027, "loss": 0.20444577932357788, "mean_token_accuracy": 0.9202164262533188, "num_tokens": 46604380.0, "step": 3778 }, { "entropy": 1.30607271194458, "epoch": 1.9899947340705635, "grad_norm": 0.2850700914859772, "learning_rate": 0.00017118338998826197, "loss": 0.1958879828453064, "mean_token_accuracy": 0.9212403148412704, "num_tokens": 46616716.0, "step": 3779 }, { "entropy": 1.1765548586845398, "epoch": 1.9905213270142181, "grad_norm": 0.28321370482444763, "learning_rate": 0.00017116730633407238, "loss": 0.21571975946426392, "mean_token_accuracy": 0.9140463322401047, "num_tokens": 46629052.0, "step": 3780 }, { "entropy": 1.2251535058021545, "epoch": 1.9910479199578726, "grad_norm": 0.2587471604347229, "learning_rate": 0.00017115121904873637, "loss": 0.19872674345970154, "mean_token_accuracy": 0.9179710447788239, "num_tokens": 46641388.0, "step": 3781 }, { "entropy": 1.2262464761734009, "epoch": 1.991574512901527, "grad_norm": 0.26432153582572937, "learning_rate": 0.00017113512813320887, "loss": 0.18742287158966064, "mean_token_accuracy": 0.9234320670366287, "num_tokens": 46653724.0, "step": 3782 }, { "entropy": 1.2304887175559998, "epoch": 1.9921011058451816, "grad_norm": 0.3122429847717285, "learning_rate": 0.00017111903358844513, "loss": 0.20218738913536072, "mean_token_accuracy": 0.9151853322982788, "num_tokens": 46666060.0, "step": 3783 }, { "entropy": 1.254802256822586, "epoch": 1.9926276987888363, "grad_norm": 0.27966201305389404, "learning_rate": 0.0001711029354154006, "loss": 0.2041388899087906, "mean_token_accuracy": 0.9164295345544815, "num_tokens": 46678396.0, "step": 3784 }, { "entropy": 1.2461448013782501, "epoch": 1.9931542917324907, "grad_norm": 0.2727980315685272, "learning_rate": 0.00017108683361503093, "loss": 0.2023455798625946, "mean_token_accuracy": 0.9165138304233551, "num_tokens": 46690732.0, "step": 3785 }, { "entropy": 1.2635038495063782, "epoch": 1.9936808846761453, "grad_norm": 0.27869847416877747, "learning_rate": 0.000171070728188292, "loss": 0.21800480782985687, "mean_token_accuracy": 0.9098168015480042, "num_tokens": 46703068.0, "step": 3786 }, { "entropy": 1.3022080957889557, "epoch": 1.9942074776198, "grad_norm": 0.2651629149913788, "learning_rate": 0.00017105461913613986, "loss": 0.2050429880619049, "mean_token_accuracy": 0.9191136509180069, "num_tokens": 46715404.0, "step": 3787 }, { "entropy": 1.316438913345337, "epoch": 1.9947340705634544, "grad_norm": 0.2717432379722595, "learning_rate": 0.00017103850645953085, "loss": 0.20991484820842743, "mean_token_accuracy": 0.9131201207637787, "num_tokens": 46727740.0, "step": 3788 }, { "entropy": 1.3070935606956482, "epoch": 1.9952606635071088, "grad_norm": 0.28713029623031616, "learning_rate": 0.00017102239015942148, "loss": 0.22580859065055847, "mean_token_accuracy": 0.9063994288444519, "num_tokens": 46740076.0, "step": 3789 }, { "entropy": 1.2703860700130463, "epoch": 1.9957872564507637, "grad_norm": 0.2608626186847687, "learning_rate": 0.00017100627023676848, "loss": 0.20214328169822693, "mean_token_accuracy": 0.9189681559801102, "num_tokens": 46752412.0, "step": 3790 }, { "entropy": 1.248716801404953, "epoch": 1.9963138493944181, "grad_norm": 0.2430690973997116, "learning_rate": 0.00017099014669252877, "loss": 0.18712979555130005, "mean_token_accuracy": 0.9251755028963089, "num_tokens": 46764748.0, "step": 3791 }, { "entropy": 1.222788542509079, "epoch": 1.9968404423380726, "grad_norm": 0.277614027261734, "learning_rate": 0.0001709740195276595, "loss": 0.21778146922588348, "mean_token_accuracy": 0.9087530225515366, "num_tokens": 46777084.0, "step": 3792 }, { "entropy": 1.204005628824234, "epoch": 1.9973670352817272, "grad_norm": 0.2973788380622864, "learning_rate": 0.00017095788874311814, "loss": 0.19019125401973724, "mean_token_accuracy": 0.9220655113458633, "num_tokens": 46789420.0, "step": 3793 }, { "entropy": 1.2420277893543243, "epoch": 1.9978936282253819, "grad_norm": 0.25097668170928955, "learning_rate": 0.00017094175433986214, "loss": 0.197739377617836, "mean_token_accuracy": 0.9215272665023804, "num_tokens": 46801756.0, "step": 3794 }, { "entropy": 1.2404221594333649, "epoch": 1.9984202211690363, "grad_norm": 0.2478831261396408, "learning_rate": 0.0001709256163188494, "loss": 0.19220499694347382, "mean_token_accuracy": 0.9218998998403549, "num_tokens": 46814092.0, "step": 3795 }, { "entropy": 1.2480852603912354, "epoch": 1.998946814112691, "grad_norm": 0.25873619318008423, "learning_rate": 0.000170909474681038, "loss": 0.18990661203861237, "mean_token_accuracy": 0.9263609051704407, "num_tokens": 46826428.0, "step": 3796 }, { "entropy": 1.1696776449680328, "epoch": 1.9994734070563456, "grad_norm": 0.2425045371055603, "learning_rate": 0.00017089332942738604, "loss": 0.18430982530117035, "mean_token_accuracy": 0.9185814708471298, "num_tokens": 46838764.0, "step": 3797 }, { "entropy": 1.269264966249466, "epoch": 2.0, "grad_norm": 0.29400986433029175, "learning_rate": 0.000170877180558852, "loss": 0.1966848373413086, "mean_token_accuracy": 0.9257184416055679, "num_tokens": 46850072.0, "step": 3798 }, { "epoch": 2.0, "eval_entropy": 1.244152147623035, "eval_loss": 0.20280839502811432, "eval_mean_token_accuracy": 0.9176469020557253, "eval_num_tokens": 46850072.0, "eval_runtime": 665.3153, "eval_samples_per_second": 8.563, "eval_steps_per_second": 2.854, "step": 3798 }, { "entropy": 1.2631646990776062, "epoch": 2.0005265929436544, "grad_norm": 0.25198251008987427, "learning_rate": 0.00017086102807639458, "loss": 0.1870889663696289, "mean_token_accuracy": 0.9224293082952499, "num_tokens": 46862408.0, "step": 3799 }, { "entropy": 1.1980132162570953, "epoch": 2.0010531858873093, "grad_norm": 0.2404579371213913, "learning_rate": 0.00017084487198097266, "loss": 0.18207380175590515, "mean_token_accuracy": 0.9251429438591003, "num_tokens": 46874744.0, "step": 3800 }, { "entropy": 1.237736165523529, "epoch": 2.0015797788309637, "grad_norm": 0.27258867025375366, "learning_rate": 0.00017082871227354533, "loss": 0.18785671889781952, "mean_token_accuracy": 0.9198215752840042, "num_tokens": 46887080.0, "step": 3801 }, { "entropy": 1.245652198791504, "epoch": 2.002106371774618, "grad_norm": 0.2836478352546692, "learning_rate": 0.0001708125489550719, "loss": 0.19735261797904968, "mean_token_accuracy": 0.9185144305229187, "num_tokens": 46899416.0, "step": 3802 }, { "entropy": 1.2350683510303497, "epoch": 2.0026329647182726, "grad_norm": 0.28520843386650085, "learning_rate": 0.00017079638202651185, "loss": 0.181529700756073, "mean_token_accuracy": 0.9275423139333725, "num_tokens": 46911752.0, "step": 3803 }, { "entropy": 1.254747599363327, "epoch": 2.0031595576619274, "grad_norm": 0.2920467257499695, "learning_rate": 0.00017078021148882498, "loss": 0.2086395025253296, "mean_token_accuracy": 0.9195475280284882, "num_tokens": 46924088.0, "step": 3804 }, { "entropy": 1.1598127484321594, "epoch": 2.003686150605582, "grad_norm": 0.2568848431110382, "learning_rate": 0.00017076403734297112, "loss": 0.1833052933216095, "mean_token_accuracy": 0.9211831390857697, "num_tokens": 46936424.0, "step": 3805 }, { "entropy": 1.2467805445194244, "epoch": 2.0042127435492363, "grad_norm": 0.29362115263938904, "learning_rate": 0.00017074785958991063, "loss": 0.20824174582958221, "mean_token_accuracy": 0.9118938595056534, "num_tokens": 46948760.0, "step": 3806 }, { "entropy": 1.231805145740509, "epoch": 2.004739336492891, "grad_norm": 0.29164865612983704, "learning_rate": 0.0001707316782306037, "loss": 0.2124311774969101, "mean_token_accuracy": 0.9105638265609741, "num_tokens": 46961096.0, "step": 3807 }, { "entropy": 1.1256294250488281, "epoch": 2.0052659294365456, "grad_norm": 0.2622910141944885, "learning_rate": 0.00017071549326601107, "loss": 0.1925264447927475, "mean_token_accuracy": 0.9230650365352631, "num_tokens": 46973432.0, "step": 3808 }, { "entropy": 1.2006166875362396, "epoch": 2.0057925223802, "grad_norm": 0.28640827536582947, "learning_rate": 0.00017069930469709344, "loss": 0.20924372971057892, "mean_token_accuracy": 0.9144559353590012, "num_tokens": 46985768.0, "step": 3809 }, { "entropy": 1.2369438111782074, "epoch": 2.006319115323855, "grad_norm": 0.25838255882263184, "learning_rate": 0.0001706831125248119, "loss": 0.18743355572223663, "mean_token_accuracy": 0.9234079271554947, "num_tokens": 46998104.0, "step": 3810 }, { "entropy": 1.17817023396492, "epoch": 2.0068457082675093, "grad_norm": 0.2704300880432129, "learning_rate": 0.00017066691675012764, "loss": 0.18841452896595, "mean_token_accuracy": 0.9241382032632828, "num_tokens": 47010440.0, "step": 3811 }, { "entropy": 1.2373998761177063, "epoch": 2.0073723012111637, "grad_norm": 0.2672933042049408, "learning_rate": 0.00017065071737400213, "loss": 0.1963019222021103, "mean_token_accuracy": 0.9170713722705841, "num_tokens": 47022776.0, "step": 3812 }, { "entropy": 1.140851616859436, "epoch": 2.007898894154818, "grad_norm": 0.25465431809425354, "learning_rate": 0.00017063451439739704, "loss": 0.18710798025131226, "mean_token_accuracy": 0.9227855503559113, "num_tokens": 47035112.0, "step": 3813 }, { "entropy": 1.1974302530288696, "epoch": 2.008425487098473, "grad_norm": 0.2557191550731659, "learning_rate": 0.0001706183078212742, "loss": 0.17992272973060608, "mean_token_accuracy": 0.9254202246665955, "num_tokens": 47047448.0, "step": 3814 }, { "entropy": 1.2048839926719666, "epoch": 2.0089520800421274, "grad_norm": 0.27587470412254333, "learning_rate": 0.00017060209764659576, "loss": 0.18894129991531372, "mean_token_accuracy": 0.9178142994642258, "num_tokens": 47059784.0, "step": 3815 }, { "entropy": 1.2109751403331757, "epoch": 2.009478672985782, "grad_norm": 0.2797783613204956, "learning_rate": 0.000170585883874324, "loss": 0.19585882127285004, "mean_token_accuracy": 0.9170439839363098, "num_tokens": 47072120.0, "step": 3816 }, { "entropy": 1.1850585043430328, "epoch": 2.0100052659294367, "grad_norm": 0.24356874823570251, "learning_rate": 0.00017056966650542146, "loss": 0.1750049591064453, "mean_token_accuracy": 0.9231248944997787, "num_tokens": 47084456.0, "step": 3817 }, { "entropy": 1.2129537165164948, "epoch": 2.010531858873091, "grad_norm": 0.2753424644470215, "learning_rate": 0.00017055344554085081, "loss": 0.1915561556816101, "mean_token_accuracy": 0.9132361859083176, "num_tokens": 47096792.0, "step": 3818 }, { "entropy": 1.1568632423877716, "epoch": 2.0110584518167456, "grad_norm": 0.25440388917922974, "learning_rate": 0.00017053722098157504, "loss": 0.18248328566551208, "mean_token_accuracy": 0.9241259098052979, "num_tokens": 47109128.0, "step": 3819 }, { "entropy": 1.2225323617458344, "epoch": 2.0115850447604, "grad_norm": 0.2667352259159088, "learning_rate": 0.00017052099282855728, "loss": 0.1801188588142395, "mean_token_accuracy": 0.9245119541883469, "num_tokens": 47121464.0, "step": 3820 }, { "entropy": 1.2486798465251923, "epoch": 2.012111637704055, "grad_norm": 0.2779337465763092, "learning_rate": 0.00017050476108276095, "loss": 0.1984904706478119, "mean_token_accuracy": 0.9179847091436386, "num_tokens": 47133800.0, "step": 3821 }, { "entropy": 1.2059212625026703, "epoch": 2.0126382306477093, "grad_norm": 0.2828848659992218, "learning_rate": 0.0001704885257451496, "loss": 0.19344468414783478, "mean_token_accuracy": 0.9199190735816956, "num_tokens": 47146136.0, "step": 3822 }, { "entropy": 1.2063279151916504, "epoch": 2.0131648235913637, "grad_norm": 0.24573519825935364, "learning_rate": 0.000170472286816687, "loss": 0.17926183342933655, "mean_token_accuracy": 0.9242213070392609, "num_tokens": 47158472.0, "step": 3823 }, { "entropy": 1.2062674760818481, "epoch": 2.0136914165350186, "grad_norm": 0.2900843620300293, "learning_rate": 0.00017045604429833722, "loss": 0.18898425996303558, "mean_token_accuracy": 0.9269550293684006, "num_tokens": 47170808.0, "step": 3824 }, { "entropy": 1.2762680351734161, "epoch": 2.014218009478673, "grad_norm": 0.2975054979324341, "learning_rate": 0.00017043979819106447, "loss": 0.20459939539432526, "mean_token_accuracy": 0.918785035610199, "num_tokens": 47183144.0, "step": 3825 }, { "entropy": 1.257956087589264, "epoch": 2.0147446024223274, "grad_norm": 0.27851611375808716, "learning_rate": 0.00017042354849583312, "loss": 0.17341488599777222, "mean_token_accuracy": 0.9255774170160294, "num_tokens": 47195480.0, "step": 3826 }, { "entropy": 1.2822742462158203, "epoch": 2.0152711953659823, "grad_norm": 0.2700733244419098, "learning_rate": 0.0001704072952136079, "loss": 0.18918979167938232, "mean_token_accuracy": 0.921903595328331, "num_tokens": 47207816.0, "step": 3827 }, { "entropy": 1.26444673538208, "epoch": 2.0157977883096367, "grad_norm": 0.28335216641426086, "learning_rate": 0.00017039103834535366, "loss": 0.1854114681482315, "mean_token_accuracy": 0.9210407435894012, "num_tokens": 47220152.0, "step": 3828 }, { "entropy": 1.2844519019126892, "epoch": 2.016324381253291, "grad_norm": 0.291987806558609, "learning_rate": 0.00017037477789203545, "loss": 0.172478586435318, "mean_token_accuracy": 0.9290066659450531, "num_tokens": 47232488.0, "step": 3829 }, { "entropy": 1.1888793110847473, "epoch": 2.0168509741969456, "grad_norm": 0.2763528823852539, "learning_rate": 0.00017035851385461856, "loss": 0.1754818558692932, "mean_token_accuracy": 0.9284273386001587, "num_tokens": 47244824.0, "step": 3830 }, { "entropy": 1.2850163877010345, "epoch": 2.0173775671406005, "grad_norm": 0.2939310371875763, "learning_rate": 0.00017034224623406848, "loss": 0.1882777065038681, "mean_token_accuracy": 0.9187758266925812, "num_tokens": 47257160.0, "step": 3831 }, { "entropy": 1.278912514448166, "epoch": 2.017904160084255, "grad_norm": 0.26976412534713745, "learning_rate": 0.00017032597503135097, "loss": 0.18176186084747314, "mean_token_accuracy": 0.9222287982702255, "num_tokens": 47269496.0, "step": 3832 }, { "entropy": 1.2571650743484497, "epoch": 2.0184307530279093, "grad_norm": 0.2843485474586487, "learning_rate": 0.0001703097002474319, "loss": 0.1895454078912735, "mean_token_accuracy": 0.9216977059841156, "num_tokens": 47281832.0, "step": 3833 }, { "entropy": 1.239231675863266, "epoch": 2.018957345971564, "grad_norm": 0.2837580442428589, "learning_rate": 0.00017029342188327746, "loss": 0.18688803911209106, "mean_token_accuracy": 0.9240525960922241, "num_tokens": 47294168.0, "step": 3834 }, { "entropy": 1.199841469526291, "epoch": 2.0194839389152186, "grad_norm": 0.2625201344490051, "learning_rate": 0.00017027713993985399, "loss": 0.1796603798866272, "mean_token_accuracy": 0.9272690117359161, "num_tokens": 47306504.0, "step": 3835 }, { "entropy": 1.266678363084793, "epoch": 2.020010531858873, "grad_norm": 0.2874893844127655, "learning_rate": 0.00017026085441812803, "loss": 0.20230376720428467, "mean_token_accuracy": 0.9180373549461365, "num_tokens": 47318840.0, "step": 3836 }, { "entropy": 1.3089313209056854, "epoch": 2.0205371248025275, "grad_norm": 0.27973634004592896, "learning_rate": 0.00017024456531906636, "loss": 0.19552314281463623, "mean_token_accuracy": 0.9171228557825089, "num_tokens": 47331176.0, "step": 3837 }, { "entropy": 1.313205361366272, "epoch": 2.0210637177461823, "grad_norm": 0.2686075270175934, "learning_rate": 0.000170228272643636, "loss": 0.18762610852718353, "mean_token_accuracy": 0.9212076663970947, "num_tokens": 47343512.0, "step": 3838 }, { "entropy": 1.3670341670513153, "epoch": 2.0215903106898367, "grad_norm": 0.30073225498199463, "learning_rate": 0.00017021197639280412, "loss": 0.19591176509857178, "mean_token_accuracy": 0.9202536344528198, "num_tokens": 47355848.0, "step": 3839 }, { "entropy": 1.3341005444526672, "epoch": 2.022116903633491, "grad_norm": 0.26529407501220703, "learning_rate": 0.00017019567656753812, "loss": 0.1831834614276886, "mean_token_accuracy": 0.9253407269716263, "num_tokens": 47368184.0, "step": 3840 }, { "entropy": 1.3194755613803864, "epoch": 2.022643496577146, "grad_norm": 0.282293438911438, "learning_rate": 0.00017017937316880568, "loss": 0.20243722200393677, "mean_token_accuracy": 0.9165725558996201, "num_tokens": 47380520.0, "step": 3841 }, { "entropy": 1.4211511313915253, "epoch": 2.0231700895208005, "grad_norm": 0.29805392026901245, "learning_rate": 0.0001701630661975746, "loss": 0.18482814729213715, "mean_token_accuracy": 0.9222871661186218, "num_tokens": 47392856.0, "step": 3842 }, { "entropy": 1.3491427600383759, "epoch": 2.023696682464455, "grad_norm": 0.2905563414096832, "learning_rate": 0.00017014675565481293, "loss": 0.20305126905441284, "mean_token_accuracy": 0.9208891540765762, "num_tokens": 47405192.0, "step": 3843 }, { "entropy": 1.3559309840202332, "epoch": 2.0242232754081093, "grad_norm": 0.2943587005138397, "learning_rate": 0.00017013044154148894, "loss": 0.1753818392753601, "mean_token_accuracy": 0.9277485013008118, "num_tokens": 47417528.0, "step": 3844 }, { "entropy": 1.3276709914207458, "epoch": 2.024749868351764, "grad_norm": 0.29700222611427307, "learning_rate": 0.00017011412385857112, "loss": 0.2055238038301468, "mean_token_accuracy": 0.9166817218065262, "num_tokens": 47429864.0, "step": 3845 }, { "entropy": 1.298693597316742, "epoch": 2.0252764612954186, "grad_norm": 0.2802084982395172, "learning_rate": 0.00017009780260702812, "loss": 0.19370201230049133, "mean_token_accuracy": 0.9228375554084778, "num_tokens": 47442200.0, "step": 3846 }, { "entropy": 1.3408599495887756, "epoch": 2.025803054239073, "grad_norm": 0.28054699301719666, "learning_rate": 0.00017008147778782885, "loss": 0.18260030448436737, "mean_token_accuracy": 0.9232022166252136, "num_tokens": 47454536.0, "step": 3847 }, { "entropy": 1.2663397789001465, "epoch": 2.026329647182728, "grad_norm": 0.25765085220336914, "learning_rate": 0.00017006514940194246, "loss": 0.18359926342964172, "mean_token_accuracy": 0.9257479310035706, "num_tokens": 47466872.0, "step": 3848 }, { "entropy": 1.316208690404892, "epoch": 2.0268562401263823, "grad_norm": 0.2987428605556488, "learning_rate": 0.0001700488174503382, "loss": 0.19594340026378632, "mean_token_accuracy": 0.9216845035552979, "num_tokens": 47479208.0, "step": 3849 }, { "entropy": 1.3389540016651154, "epoch": 2.0273828330700367, "grad_norm": 0.27578049898147583, "learning_rate": 0.00017003248193398564, "loss": 0.19140341877937317, "mean_token_accuracy": 0.9192010909318924, "num_tokens": 47491544.0, "step": 3850 }, { "entropy": 1.3227673172950745, "epoch": 2.0279094260136916, "grad_norm": 0.2912873327732086, "learning_rate": 0.00017001614285385455, "loss": 0.20706209540367126, "mean_token_accuracy": 0.9152367115020752, "num_tokens": 47503880.0, "step": 3851 }, { "entropy": 1.2799009382724762, "epoch": 2.028436018957346, "grad_norm": 0.2770322561264038, "learning_rate": 0.00016999980021091483, "loss": 0.19841603934764862, "mean_token_accuracy": 0.9199351519346237, "num_tokens": 47516216.0, "step": 3852 }, { "entropy": 1.3126654028892517, "epoch": 2.0289626119010005, "grad_norm": 0.3020882308483124, "learning_rate": 0.0001699834540061367, "loss": 0.20801658928394318, "mean_token_accuracy": 0.9128816872835159, "num_tokens": 47528552.0, "step": 3853 }, { "entropy": 1.2508117258548737, "epoch": 2.029489204844655, "grad_norm": 0.24238452315330505, "learning_rate": 0.00016996710424049051, "loss": 0.1554844081401825, "mean_token_accuracy": 0.9381654858589172, "num_tokens": 47540888.0, "step": 3854 }, { "entropy": 1.278584361076355, "epoch": 2.0300157977883098, "grad_norm": 0.26651400327682495, "learning_rate": 0.00016995075091494685, "loss": 0.18668919801712036, "mean_token_accuracy": 0.9253730177879333, "num_tokens": 47553224.0, "step": 3855 }, { "entropy": 1.2722339630126953, "epoch": 2.030542390731964, "grad_norm": 0.285241037607193, "learning_rate": 0.00016993439403047652, "loss": 0.21573114395141602, "mean_token_accuracy": 0.9168124496936798, "num_tokens": 47565560.0, "step": 3856 }, { "entropy": 1.2240016758441925, "epoch": 2.0310689836756186, "grad_norm": 0.2548234760761261, "learning_rate": 0.00016991803358805058, "loss": 0.1847495436668396, "mean_token_accuracy": 0.9236398935317993, "num_tokens": 47577896.0, "step": 3857 }, { "entropy": 1.2316696643829346, "epoch": 2.0315955766192735, "grad_norm": 0.28398963809013367, "learning_rate": 0.00016990166958864015, "loss": 0.19505375623703003, "mean_token_accuracy": 0.9168769717216492, "num_tokens": 47590232.0, "step": 3858 }, { "entropy": 1.1961296796798706, "epoch": 2.032122169562928, "grad_norm": 0.27527958154678345, "learning_rate": 0.0001698853020332168, "loss": 0.17813697457313538, "mean_token_accuracy": 0.9261271953582764, "num_tokens": 47602568.0, "step": 3859 }, { "entropy": 1.273693025112152, "epoch": 2.0326487625065823, "grad_norm": 0.3149412274360657, "learning_rate": 0.00016986893092275205, "loss": 0.1986011564731598, "mean_token_accuracy": 0.922387108206749, "num_tokens": 47614904.0, "step": 3860 }, { "entropy": 1.2812358438968658, "epoch": 2.0331753554502368, "grad_norm": 0.2717421352863312, "learning_rate": 0.00016985255625821783, "loss": 0.1849009394645691, "mean_token_accuracy": 0.9245787113904953, "num_tokens": 47627240.0, "step": 3861 }, { "entropy": 1.2583646178245544, "epoch": 2.0337019483938916, "grad_norm": 0.26972222328186035, "learning_rate": 0.0001698361780405862, "loss": 0.18644441664218903, "mean_token_accuracy": 0.920393168926239, "num_tokens": 47639576.0, "step": 3862 }, { "entropy": 1.2793927788734436, "epoch": 2.034228541337546, "grad_norm": 0.2913520932197571, "learning_rate": 0.00016981979627082945, "loss": 0.17899954319000244, "mean_token_accuracy": 0.9248150438070297, "num_tokens": 47651912.0, "step": 3863 }, { "entropy": 1.2246437966823578, "epoch": 2.0347551342812005, "grad_norm": 0.2871529757976532, "learning_rate": 0.00016980341094992004, "loss": 0.19482392072677612, "mean_token_accuracy": 0.9184932112693787, "num_tokens": 47664248.0, "step": 3864 }, { "entropy": 1.1911917328834534, "epoch": 2.0352817272248553, "grad_norm": 0.2914022207260132, "learning_rate": 0.00016978702207883065, "loss": 0.19326715171337128, "mean_token_accuracy": 0.9233204275369644, "num_tokens": 47676584.0, "step": 3865 }, { "entropy": 1.2744377553462982, "epoch": 2.0358083201685098, "grad_norm": 0.26885589957237244, "learning_rate": 0.00016977062965853427, "loss": 0.19482609629631042, "mean_token_accuracy": 0.9205097407102585, "num_tokens": 47688920.0, "step": 3866 }, { "entropy": 1.2833932042121887, "epoch": 2.036334913112164, "grad_norm": 0.2556898295879364, "learning_rate": 0.00016975423369000394, "loss": 0.17208848893642426, "mean_token_accuracy": 0.929677814245224, "num_tokens": 47701256.0, "step": 3867 }, { "entropy": 1.297087401151657, "epoch": 2.036861506055819, "grad_norm": 0.2650216519832611, "learning_rate": 0.00016973783417421304, "loss": 0.18926797807216644, "mean_token_accuracy": 0.9191234409809113, "num_tokens": 47713592.0, "step": 3868 }, { "entropy": 1.2456922829151154, "epoch": 2.0373880989994735, "grad_norm": 0.2747442424297333, "learning_rate": 0.00016972143111213512, "loss": 0.19703906774520874, "mean_token_accuracy": 0.9198992401361465, "num_tokens": 47725928.0, "step": 3869 }, { "entropy": 1.330556869506836, "epoch": 2.037914691943128, "grad_norm": 0.2835814356803894, "learning_rate": 0.0001697050245047439, "loss": 0.18732693791389465, "mean_token_accuracy": 0.9204771220684052, "num_tokens": 47738264.0, "step": 3870 }, { "entropy": 1.304270088672638, "epoch": 2.0384412848867823, "grad_norm": 0.27201247215270996, "learning_rate": 0.00016968861435301337, "loss": 0.18724404275417328, "mean_token_accuracy": 0.921107143163681, "num_tokens": 47750600.0, "step": 3871 }, { "entropy": 1.230264812707901, "epoch": 2.038967877830437, "grad_norm": 0.2530989646911621, "learning_rate": 0.0001696722006579177, "loss": 0.17592748999595642, "mean_token_accuracy": 0.9254534393548965, "num_tokens": 47762936.0, "step": 3872 }, { "entropy": 1.2308352589607239, "epoch": 2.0394944707740916, "grad_norm": 0.2694772779941559, "learning_rate": 0.00016965578342043126, "loss": 0.19067507982254028, "mean_token_accuracy": 0.9236868768930435, "num_tokens": 47775272.0, "step": 3873 }, { "entropy": 1.291840374469757, "epoch": 2.040021063717746, "grad_norm": 0.2618374228477478, "learning_rate": 0.00016963936264152867, "loss": 0.18578636646270752, "mean_token_accuracy": 0.9224181473255157, "num_tokens": 47787608.0, "step": 3874 }, { "entropy": 1.2792740166187286, "epoch": 2.040547656661401, "grad_norm": 0.2911253571510315, "learning_rate": 0.0001696229383221847, "loss": 0.20944932103157043, "mean_token_accuracy": 0.9135683476924896, "num_tokens": 47799944.0, "step": 3875 }, { "entropy": 1.3030252158641815, "epoch": 2.0410742496050553, "grad_norm": 0.2904371917247772, "learning_rate": 0.0001696065104633744, "loss": 0.20830057561397552, "mean_token_accuracy": 0.9120756387710571, "num_tokens": 47812280.0, "step": 3876 }, { "entropy": 1.2803774774074554, "epoch": 2.0416008425487098, "grad_norm": 0.2760698199272156, "learning_rate": 0.00016959007906607303, "loss": 0.19493544101715088, "mean_token_accuracy": 0.9187896698713303, "num_tokens": 47824616.0, "step": 3877 }, { "entropy": 1.2554866671562195, "epoch": 2.042127435492364, "grad_norm": 0.4330475926399231, "learning_rate": 0.00016957364413125594, "loss": 0.18488185107707977, "mean_token_accuracy": 0.9197061508893967, "num_tokens": 47836952.0, "step": 3878 }, { "entropy": 1.3076776266098022, "epoch": 2.042654028436019, "grad_norm": 0.2841300964355469, "learning_rate": 0.00016955720565989884, "loss": 0.19156453013420105, "mean_token_accuracy": 0.9239335805177689, "num_tokens": 47849288.0, "step": 3879 }, { "entropy": 1.3151583969593048, "epoch": 2.0431806213796735, "grad_norm": 0.2921697199344635, "learning_rate": 0.00016954076365297758, "loss": 0.2065403163433075, "mean_token_accuracy": 0.9110155552625656, "num_tokens": 47861624.0, "step": 3880 }, { "entropy": 1.2858489751815796, "epoch": 2.043707214323328, "grad_norm": 0.27680060267448425, "learning_rate": 0.00016952431811146818, "loss": 0.19812069833278656, "mean_token_accuracy": 0.9194805026054382, "num_tokens": 47873960.0, "step": 3881 }, { "entropy": 1.3400939404964447, "epoch": 2.044233807266983, "grad_norm": 0.29581987857818604, "learning_rate": 0.00016950786903634696, "loss": 0.19464778900146484, "mean_token_accuracy": 0.920210674405098, "num_tokens": 47886296.0, "step": 3882 }, { "entropy": 1.3481502830982208, "epoch": 2.044760400210637, "grad_norm": 0.3192988634109497, "learning_rate": 0.0001694914164285904, "loss": 0.20431135594844818, "mean_token_accuracy": 0.918129950761795, "num_tokens": 47898632.0, "step": 3883 }, { "entropy": 1.212340623140335, "epoch": 2.0452869931542916, "grad_norm": 0.23157627880573273, "learning_rate": 0.00016947496028917516, "loss": 0.17617271840572357, "mean_token_accuracy": 0.9243680238723755, "num_tokens": 47910968.0, "step": 3884 }, { "entropy": 1.2161346971988678, "epoch": 2.0458135860979465, "grad_norm": 0.2513905167579651, "learning_rate": 0.0001694585006190782, "loss": 0.1802637130022049, "mean_token_accuracy": 0.924398884177208, "num_tokens": 47923304.0, "step": 3885 }, { "entropy": 1.3086143136024475, "epoch": 2.046340179041601, "grad_norm": 0.2897863984107971, "learning_rate": 0.00016944203741927662, "loss": 0.20457464456558228, "mean_token_accuracy": 0.9144063889980316, "num_tokens": 47935640.0, "step": 3886 }, { "entropy": 1.2356386482715607, "epoch": 2.0468667719852554, "grad_norm": 0.26771265268325806, "learning_rate": 0.00016942557069074768, "loss": 0.17813019454479218, "mean_token_accuracy": 0.9241292774677277, "num_tokens": 47947976.0, "step": 3887 }, { "entropy": 1.3301630318164825, "epoch": 2.0473933649289098, "grad_norm": 0.27502498030662537, "learning_rate": 0.000169409100434469, "loss": 0.20527851581573486, "mean_token_accuracy": 0.9159713387489319, "num_tokens": 47960312.0, "step": 3888 }, { "entropy": 1.2828874289989471, "epoch": 2.0479199578725646, "grad_norm": 0.261263370513916, "learning_rate": 0.00016939262665141832, "loss": 0.19007109105587006, "mean_token_accuracy": 0.9201304614543915, "num_tokens": 47972648.0, "step": 3889 }, { "entropy": 1.3016537725925446, "epoch": 2.048446550816219, "grad_norm": 0.2682885527610779, "learning_rate": 0.00016937614934257354, "loss": 0.1853100210428238, "mean_token_accuracy": 0.9268095791339874, "num_tokens": 47984984.0, "step": 3890 }, { "entropy": 1.2769020199775696, "epoch": 2.0489731437598735, "grad_norm": 0.2722259759902954, "learning_rate": 0.00016935966850891283, "loss": 0.20796817541122437, "mean_token_accuracy": 0.9139941036701202, "num_tokens": 47997320.0, "step": 3891 }, { "entropy": 1.258107304573059, "epoch": 2.0494997367035284, "grad_norm": 0.25843435525894165, "learning_rate": 0.00016934318415141457, "loss": 0.16999708116054535, "mean_token_accuracy": 0.9257606714963913, "num_tokens": 48009656.0, "step": 3892 }, { "entropy": 1.1906676590442657, "epoch": 2.050026329647183, "grad_norm": 0.2513735890388489, "learning_rate": 0.00016932669627105738, "loss": 0.1697864979505539, "mean_token_accuracy": 0.925465926527977, "num_tokens": 48021992.0, "step": 3893 }, { "entropy": 1.2723312675952911, "epoch": 2.050552922590837, "grad_norm": 0.2743954062461853, "learning_rate": 0.00016931020486881998, "loss": 0.18033276498317719, "mean_token_accuracy": 0.9286290258169174, "num_tokens": 48034328.0, "step": 3894 }, { "entropy": 1.2819771468639374, "epoch": 2.0510795155344916, "grad_norm": 0.29130327701568604, "learning_rate": 0.00016929370994568142, "loss": 0.1982630491256714, "mean_token_accuracy": 0.9166873097419739, "num_tokens": 48046664.0, "step": 3895 }, { "entropy": 1.2571477890014648, "epoch": 2.0516061084781465, "grad_norm": 0.27202513813972473, "learning_rate": 0.00016927721150262088, "loss": 0.18936115503311157, "mean_token_accuracy": 0.9197106510400772, "num_tokens": 48059000.0, "step": 3896 }, { "entropy": 1.3048891425132751, "epoch": 2.052132701421801, "grad_norm": 0.27362993359565735, "learning_rate": 0.00016926070954061782, "loss": 0.19029444456100464, "mean_token_accuracy": 0.9229496270418167, "num_tokens": 48071336.0, "step": 3897 }, { "entropy": 1.2617215812206268, "epoch": 2.0526592943654554, "grad_norm": 0.28144410252571106, "learning_rate": 0.00016924420406065177, "loss": 0.18220680952072144, "mean_token_accuracy": 0.9252916872501373, "num_tokens": 48083672.0, "step": 3898 }, { "entropy": 1.2789317965507507, "epoch": 2.0531858873091102, "grad_norm": 0.2608755826950073, "learning_rate": 0.00016922769506370268, "loss": 0.18006981909275055, "mean_token_accuracy": 0.9222934991121292, "num_tokens": 48096008.0, "step": 3899 }, { "entropy": 1.22543865442276, "epoch": 2.0537124802527646, "grad_norm": 0.27741050720214844, "learning_rate": 0.00016921118255075053, "loss": 0.1895115077495575, "mean_token_accuracy": 0.9215471893548965, "num_tokens": 48108344.0, "step": 3900 }, { "entropy": 1.2530005872249603, "epoch": 2.054239073196419, "grad_norm": 0.2714971899986267, "learning_rate": 0.00016919466652277556, "loss": 0.1776505410671234, "mean_token_accuracy": 0.9273561537265778, "num_tokens": 48120680.0, "step": 3901 }, { "entropy": 1.2720350325107574, "epoch": 2.0547656661400735, "grad_norm": 0.26950451731681824, "learning_rate": 0.00016917814698075827, "loss": 0.19353142380714417, "mean_token_accuracy": 0.9203890562057495, "num_tokens": 48133016.0, "step": 3902 }, { "entropy": 1.2247913479804993, "epoch": 2.0552922590837284, "grad_norm": 0.2836177945137024, "learning_rate": 0.0001691616239256793, "loss": 0.19141322374343872, "mean_token_accuracy": 0.9200913459062576, "num_tokens": 48145352.0, "step": 3903 }, { "entropy": 1.2887300550937653, "epoch": 2.055818852027383, "grad_norm": 0.2868979275226593, "learning_rate": 0.00016914509735851954, "loss": 0.20681561529636383, "mean_token_accuracy": 0.9199369102716446, "num_tokens": 48157688.0, "step": 3904 }, { "entropy": 1.2575041055679321, "epoch": 2.056345444971037, "grad_norm": 0.26332929730415344, "learning_rate": 0.00016912856728026006, "loss": 0.18368637561798096, "mean_token_accuracy": 0.9240716248750687, "num_tokens": 48170024.0, "step": 3905 }, { "entropy": 1.2432773113250732, "epoch": 2.056872037914692, "grad_norm": 0.29000067710876465, "learning_rate": 0.0001691120336918822, "loss": 0.20695710182189941, "mean_token_accuracy": 0.9119783192873001, "num_tokens": 48182360.0, "step": 3906 }, { "entropy": 1.2723545730113983, "epoch": 2.0573986308583465, "grad_norm": 0.2832140624523163, "learning_rate": 0.0001690954965943674, "loss": 0.19655488431453705, "mean_token_accuracy": 0.9173429161310196, "num_tokens": 48194696.0, "step": 3907 }, { "entropy": 1.3194984793663025, "epoch": 2.057925223802001, "grad_norm": 0.280369371175766, "learning_rate": 0.00016907895598869743, "loss": 0.18848003447055817, "mean_token_accuracy": 0.9231791347265244, "num_tokens": 48207032.0, "step": 3908 }, { "entropy": 1.2152039706707, "epoch": 2.058451816745656, "grad_norm": 0.2655313014984131, "learning_rate": 0.00016906241187585416, "loss": 0.19103647768497467, "mean_token_accuracy": 0.9197648912668228, "num_tokens": 48219368.0, "step": 3909 }, { "entropy": 1.2087748050689697, "epoch": 2.0589784096893102, "grad_norm": 0.26991021633148193, "learning_rate": 0.00016904586425681975, "loss": 0.18405042588710785, "mean_token_accuracy": 0.9230748862028122, "num_tokens": 48231704.0, "step": 3910 }, { "entropy": 1.2276612520217896, "epoch": 2.0595050026329647, "grad_norm": 0.2636072337627411, "learning_rate": 0.00016902931313257652, "loss": 0.1714887022972107, "mean_token_accuracy": 0.928344801068306, "num_tokens": 48244040.0, "step": 3911 }, { "entropy": 1.2997864484786987, "epoch": 2.060031595576619, "grad_norm": 0.29149720072746277, "learning_rate": 0.00016901275850410703, "loss": 0.19735336303710938, "mean_token_accuracy": 0.9174995422363281, "num_tokens": 48256376.0, "step": 3912 }, { "entropy": 1.2492857873439789, "epoch": 2.060558188520274, "grad_norm": 0.2696395218372345, "learning_rate": 0.00016899620037239398, "loss": 0.18676462769508362, "mean_token_accuracy": 0.9226437360048294, "num_tokens": 48268712.0, "step": 3913 }, { "entropy": 1.2569607198238373, "epoch": 2.0610847814639284, "grad_norm": 0.28245505690574646, "learning_rate": 0.00016897963873842043, "loss": 0.20712406933307648, "mean_token_accuracy": 0.9177358150482178, "num_tokens": 48281048.0, "step": 3914 }, { "entropy": 1.2320314943790436, "epoch": 2.061611374407583, "grad_norm": 0.28270742297172546, "learning_rate": 0.00016896307360316943, "loss": 0.19076888263225555, "mean_token_accuracy": 0.9220731556415558, "num_tokens": 48293384.0, "step": 3915 }, { "entropy": 1.3260917365550995, "epoch": 2.0621379673512377, "grad_norm": 0.2971607744693756, "learning_rate": 0.00016894650496762444, "loss": 0.19012241065502167, "mean_token_accuracy": 0.9222848564386368, "num_tokens": 48305720.0, "step": 3916 }, { "entropy": 1.2801413834095001, "epoch": 2.062664560294892, "grad_norm": 0.30607089400291443, "learning_rate": 0.00016892993283276902, "loss": 0.20878365635871887, "mean_token_accuracy": 0.9175769686698914, "num_tokens": 48318056.0, "step": 3917 }, { "entropy": 1.3265896141529083, "epoch": 2.0631911532385465, "grad_norm": 0.30750954151153564, "learning_rate": 0.00016891335719958697, "loss": 0.18873047828674316, "mean_token_accuracy": 0.920640304684639, "num_tokens": 48330392.0, "step": 3918 }, { "entropy": 1.350228101015091, "epoch": 2.063717746182201, "grad_norm": 0.2853001654148102, "learning_rate": 0.00016889677806906225, "loss": 0.18502716720104218, "mean_token_accuracy": 0.9253284931182861, "num_tokens": 48342728.0, "step": 3919 }, { "entropy": 1.2163171470165253, "epoch": 2.064244339125856, "grad_norm": 0.24412177503108978, "learning_rate": 0.0001688801954421791, "loss": 0.16768863797187805, "mean_token_accuracy": 0.9300560504198074, "num_tokens": 48355064.0, "step": 3920 }, { "entropy": 1.3360876441001892, "epoch": 2.0647709320695102, "grad_norm": 0.27784374356269836, "learning_rate": 0.00016886360931992194, "loss": 0.1872931867837906, "mean_token_accuracy": 0.9237985759973526, "num_tokens": 48367400.0, "step": 3921 }, { "entropy": 1.243847370147705, "epoch": 2.0652975250131647, "grad_norm": 0.28875452280044556, "learning_rate": 0.00016884701970327538, "loss": 0.19071172177791595, "mean_token_accuracy": 0.9176552146673203, "num_tokens": 48379736.0, "step": 3922 }, { "entropy": 1.3042690753936768, "epoch": 2.0658241179568195, "grad_norm": 0.289671927690506, "learning_rate": 0.0001688304265932242, "loss": 0.20444759726524353, "mean_token_accuracy": 0.9158494174480438, "num_tokens": 48392072.0, "step": 3923 }, { "entropy": 1.271407037973404, "epoch": 2.066350710900474, "grad_norm": 0.296796977519989, "learning_rate": 0.00016881382999075353, "loss": 0.1858009397983551, "mean_token_accuracy": 0.920338898897171, "num_tokens": 48404408.0, "step": 3924 }, { "entropy": 1.282002031803131, "epoch": 2.0668773038441284, "grad_norm": 0.27760758996009827, "learning_rate": 0.00016879722989684854, "loss": 0.198472797870636, "mean_token_accuracy": 0.9221088290214539, "num_tokens": 48416744.0, "step": 3925 }, { "entropy": 1.2682355344295502, "epoch": 2.0674038967877832, "grad_norm": 0.25768402218818665, "learning_rate": 0.00016878062631249473, "loss": 0.1786102056503296, "mean_token_accuracy": 0.9221510291099548, "num_tokens": 48429080.0, "step": 3926 }, { "entropy": 1.2786115109920502, "epoch": 2.0679304897314377, "grad_norm": 0.27482444047927856, "learning_rate": 0.0001687640192386777, "loss": 0.1859729140996933, "mean_token_accuracy": 0.9208211004734039, "num_tokens": 48441416.0, "step": 3927 }, { "entropy": 1.258926510810852, "epoch": 2.068457082675092, "grad_norm": 0.28567978739738464, "learning_rate": 0.00016874740867638339, "loss": 0.18969936668872833, "mean_token_accuracy": 0.9214884340763092, "num_tokens": 48453752.0, "step": 3928 }, { "entropy": 1.2364517748355865, "epoch": 2.0689836756187465, "grad_norm": 0.26859763264656067, "learning_rate": 0.00016873079462659783, "loss": 0.19034039974212646, "mean_token_accuracy": 0.9214574694633484, "num_tokens": 48466088.0, "step": 3929 }, { "entropy": 1.2525107264518738, "epoch": 2.0695102685624014, "grad_norm": 0.28058695793151855, "learning_rate": 0.00016871417709030727, "loss": 0.18607176840305328, "mean_token_accuracy": 0.9215060919523239, "num_tokens": 48478424.0, "step": 3930 }, { "entropy": 1.2619339525699615, "epoch": 2.070036861506056, "grad_norm": 0.2828121781349182, "learning_rate": 0.00016869755606849826, "loss": 0.18340539932250977, "mean_token_accuracy": 0.9251066595315933, "num_tokens": 48490760.0, "step": 3931 }, { "entropy": 1.2884092330932617, "epoch": 2.0705634544497102, "grad_norm": 0.26471489667892456, "learning_rate": 0.00016868093156215743, "loss": 0.17937590181827545, "mean_token_accuracy": 0.9243820607662201, "num_tokens": 48503096.0, "step": 3932 }, { "entropy": 1.2739530205726624, "epoch": 2.071090047393365, "grad_norm": 0.26046693325042725, "learning_rate": 0.00016866430357227177, "loss": 0.1955185979604721, "mean_token_accuracy": 0.9210577309131622, "num_tokens": 48515432.0, "step": 3933 }, { "entropy": 1.2842492163181305, "epoch": 2.0716166403370195, "grad_norm": 0.29395169019699097, "learning_rate": 0.00016864767209982825, "loss": 0.21026445925235748, "mean_token_accuracy": 0.9173175990581512, "num_tokens": 48527768.0, "step": 3934 }, { "entropy": 1.2743287682533264, "epoch": 2.072143233280674, "grad_norm": 0.272370845079422, "learning_rate": 0.00016863103714581432, "loss": 0.1986452043056488, "mean_token_accuracy": 0.9205825477838516, "num_tokens": 48540104.0, "step": 3935 }, { "entropy": 1.2706570327281952, "epoch": 2.0726698262243284, "grad_norm": 0.2720491588115692, "learning_rate": 0.00016861439871121743, "loss": 0.17972148954868317, "mean_token_accuracy": 0.9210758358240128, "num_tokens": 48552440.0, "step": 3936 }, { "entropy": 1.2344097197055817, "epoch": 2.0731964191679833, "grad_norm": 0.261137992143631, "learning_rate": 0.0001685977567970253, "loss": 0.18583646416664124, "mean_token_accuracy": 0.9242785274982452, "num_tokens": 48564776.0, "step": 3937 }, { "entropy": 1.2211202681064606, "epoch": 2.0737230121116377, "grad_norm": 0.2840760350227356, "learning_rate": 0.0001685811114042259, "loss": 0.18876339495182037, "mean_token_accuracy": 0.9212382435798645, "num_tokens": 48577112.0, "step": 3938 }, { "entropy": 1.2502583861351013, "epoch": 2.074249605055292, "grad_norm": 0.27275213599205017, "learning_rate": 0.00016856446253380735, "loss": 0.1872887909412384, "mean_token_accuracy": 0.923475593328476, "num_tokens": 48589448.0, "step": 3939 }, { "entropy": 1.2701627314090729, "epoch": 2.074776197998947, "grad_norm": 0.2745870053768158, "learning_rate": 0.00016854781018675797, "loss": 0.18436497449874878, "mean_token_accuracy": 0.9266326576471329, "num_tokens": 48601784.0, "step": 3940 }, { "entropy": 1.2546738684177399, "epoch": 2.0753027909426014, "grad_norm": 0.2822677195072174, "learning_rate": 0.0001685311543640664, "loss": 0.1884290874004364, "mean_token_accuracy": 0.9195769876241684, "num_tokens": 48614120.0, "step": 3941 }, { "entropy": 1.2545583546161652, "epoch": 2.075829383886256, "grad_norm": 0.2970985174179077, "learning_rate": 0.0001685144950667213, "loss": 0.19396939873695374, "mean_token_accuracy": 0.9214707016944885, "num_tokens": 48626456.0, "step": 3942 }, { "entropy": 1.243100881576538, "epoch": 2.0763559768299107, "grad_norm": 0.25157052278518677, "learning_rate": 0.0001684978322957117, "loss": 0.17563554644584656, "mean_token_accuracy": 0.9291206002235413, "num_tokens": 48638792.0, "step": 3943 }, { "entropy": 1.2628869712352753, "epoch": 2.076882569773565, "grad_norm": 0.2984946072101593, "learning_rate": 0.00016848116605202673, "loss": 0.20061740279197693, "mean_token_accuracy": 0.9180862903594971, "num_tokens": 48651128.0, "step": 3944 }, { "entropy": 1.3347080945968628, "epoch": 2.0774091627172195, "grad_norm": 0.3006715476512909, "learning_rate": 0.00016846449633665578, "loss": 0.18334859609603882, "mean_token_accuracy": 0.9282584637403488, "num_tokens": 48663464.0, "step": 3945 }, { "entropy": 1.2688239216804504, "epoch": 2.077935755660874, "grad_norm": 0.26901793479919434, "learning_rate": 0.00016844782315058847, "loss": 0.1989820897579193, "mean_token_accuracy": 0.9150257855653763, "num_tokens": 48675800.0, "step": 3946 }, { "entropy": 1.265367865562439, "epoch": 2.078462348604529, "grad_norm": 0.29596784710884094, "learning_rate": 0.00016843114649481452, "loss": 0.20104429125785828, "mean_token_accuracy": 0.9207267761230469, "num_tokens": 48688136.0, "step": 3947 }, { "entropy": 1.267877608537674, "epoch": 2.0789889415481833, "grad_norm": 0.29306116700172424, "learning_rate": 0.00016841446637032396, "loss": 0.20623625814914703, "mean_token_accuracy": 0.9133555591106415, "num_tokens": 48700472.0, "step": 3948 }, { "entropy": 1.2642518281936646, "epoch": 2.0795155344918377, "grad_norm": 0.2690291404724121, "learning_rate": 0.00016839778277810702, "loss": 0.181110218167305, "mean_token_accuracy": 0.9257129430770874, "num_tokens": 48712808.0, "step": 3949 }, { "entropy": 1.3663403391838074, "epoch": 2.0800421274354925, "grad_norm": 0.29609712958335876, "learning_rate": 0.0001683810957191541, "loss": 0.19982632994651794, "mean_token_accuracy": 0.9155548959970474, "num_tokens": 48725144.0, "step": 3950 }, { "entropy": 1.3063276708126068, "epoch": 2.080568720379147, "grad_norm": 0.2549259066581726, "learning_rate": 0.0001683644051944558, "loss": 0.16801197826862335, "mean_token_accuracy": 0.928315594792366, "num_tokens": 48737480.0, "step": 3951 }, { "entropy": 1.3074188232421875, "epoch": 2.0810953133228014, "grad_norm": 0.2865307331085205, "learning_rate": 0.0001683477112050029, "loss": 0.1887558102607727, "mean_token_accuracy": 0.9195426404476166, "num_tokens": 48749816.0, "step": 3952 }, { "entropy": 1.3835014998912811, "epoch": 2.081621906266456, "grad_norm": 0.27939164638519287, "learning_rate": 0.0001683310137517865, "loss": 0.1879327893257141, "mean_token_accuracy": 0.9196098446846008, "num_tokens": 48762152.0, "step": 3953 }, { "entropy": 1.4062438309192657, "epoch": 2.0821484992101107, "grad_norm": 0.3003182113170624, "learning_rate": 0.00016831431283579777, "loss": 0.20012448728084564, "mean_token_accuracy": 0.9185905754566193, "num_tokens": 48774488.0, "step": 3954 }, { "entropy": 1.3671795129776, "epoch": 2.082675092153765, "grad_norm": 0.2660031318664551, "learning_rate": 0.0001682976084580282, "loss": 0.19102323055267334, "mean_token_accuracy": 0.919410839676857, "num_tokens": 48786824.0, "step": 3955 }, { "entropy": 1.325892060995102, "epoch": 2.0832016850974195, "grad_norm": 0.2605104148387909, "learning_rate": 0.00016828090061946934, "loss": 0.18359193205833435, "mean_token_accuracy": 0.9214528203010559, "num_tokens": 48799160.0, "step": 3956 }, { "entropy": 1.3484356999397278, "epoch": 2.0837282780410744, "grad_norm": 0.2751688063144684, "learning_rate": 0.00016826418932111315, "loss": 0.18124142289161682, "mean_token_accuracy": 0.9217920154333115, "num_tokens": 48811496.0, "step": 3957 }, { "entropy": 1.3338854312896729, "epoch": 2.084254870984729, "grad_norm": 0.26002514362335205, "learning_rate": 0.0001682474745639516, "loss": 0.166397824883461, "mean_token_accuracy": 0.9286703169345856, "num_tokens": 48823832.0, "step": 3958 }, { "entropy": 1.3630346655845642, "epoch": 2.0847814639283833, "grad_norm": 0.28807926177978516, "learning_rate": 0.00016823075634897697, "loss": 0.1959732472896576, "mean_token_accuracy": 0.9200254678726196, "num_tokens": 48836168.0, "step": 3959 }, { "entropy": 1.3884229063987732, "epoch": 2.085308056872038, "grad_norm": 0.2943662405014038, "learning_rate": 0.00016821403467718178, "loss": 0.18066152930259705, "mean_token_accuracy": 0.9316907674074173, "num_tokens": 48848504.0, "step": 3960 }, { "entropy": 1.3363731503486633, "epoch": 2.0858346498156926, "grad_norm": 0.3065935969352722, "learning_rate": 0.0001681973095495586, "loss": 0.2028815746307373, "mean_token_accuracy": 0.9201863408088684, "num_tokens": 48860840.0, "step": 3961 }, { "entropy": 1.3781720399856567, "epoch": 2.086361242759347, "grad_norm": 0.3044969141483307, "learning_rate": 0.00016818058096710036, "loss": 0.2023879587650299, "mean_token_accuracy": 0.9209664463996887, "num_tokens": 48873176.0, "step": 3962 }, { "entropy": 1.3339049518108368, "epoch": 2.0868878357030014, "grad_norm": 0.3165450692176819, "learning_rate": 0.00016816384893080012, "loss": 0.2043043076992035, "mean_token_accuracy": 0.9149027913808823, "num_tokens": 48885512.0, "step": 3963 }, { "entropy": 1.3235175609588623, "epoch": 2.0874144286466563, "grad_norm": 0.2820136845111847, "learning_rate": 0.0001681471134416512, "loss": 0.18209639191627502, "mean_token_accuracy": 0.9246355444192886, "num_tokens": 48897848.0, "step": 3964 }, { "entropy": 1.3395156562328339, "epoch": 2.0879410215903107, "grad_norm": 0.45867112278938293, "learning_rate": 0.00016813037450064705, "loss": 0.19053226709365845, "mean_token_accuracy": 0.9275738596916199, "num_tokens": 48910184.0, "step": 3965 }, { "entropy": 1.3038859367370605, "epoch": 2.088467614533965, "grad_norm": 0.28860345482826233, "learning_rate": 0.00016811363210878137, "loss": 0.21587130427360535, "mean_token_accuracy": 0.9093978554010391, "num_tokens": 48922520.0, "step": 3966 }, { "entropy": 1.2706226110458374, "epoch": 2.08899420747762, "grad_norm": 0.281698077917099, "learning_rate": 0.0001680968862670481, "loss": 0.1824536919593811, "mean_token_accuracy": 0.9227961152791977, "num_tokens": 48934856.0, "step": 3967 }, { "entropy": 1.30519899725914, "epoch": 2.0895208004212744, "grad_norm": 0.28888365626335144, "learning_rate": 0.00016808013697644126, "loss": 0.19047529995441437, "mean_token_accuracy": 0.9213353842496872, "num_tokens": 48947192.0, "step": 3968 }, { "entropy": 1.3129478991031647, "epoch": 2.090047393364929, "grad_norm": 0.30279576778411865, "learning_rate": 0.00016806338423795524, "loss": 0.197226881980896, "mean_token_accuracy": 0.9145682752132416, "num_tokens": 48959528.0, "step": 3969 }, { "entropy": 1.3123193085193634, "epoch": 2.0905739863085833, "grad_norm": 0.2858417332172394, "learning_rate": 0.00016804662805258448, "loss": 0.1826488971710205, "mean_token_accuracy": 0.9254605323076248, "num_tokens": 48971864.0, "step": 3970 }, { "entropy": 1.347455382347107, "epoch": 2.091100579252238, "grad_norm": 0.2954428791999817, "learning_rate": 0.00016802986842132374, "loss": 0.20556935667991638, "mean_token_accuracy": 0.9166451990604401, "num_tokens": 48984200.0, "step": 3971 }, { "entropy": 1.319230854511261, "epoch": 2.0916271721958926, "grad_norm": 0.32010331749916077, "learning_rate": 0.00016801310534516798, "loss": 0.19692543148994446, "mean_token_accuracy": 0.9220879971981049, "num_tokens": 48996536.0, "step": 3972 }, { "entropy": 1.3301867544651031, "epoch": 2.092153765139547, "grad_norm": 0.24198579788208008, "learning_rate": 0.00016799633882511224, "loss": 0.18499736487865448, "mean_token_accuracy": 0.9226900786161423, "num_tokens": 49008872.0, "step": 3973 }, { "entropy": 1.3645350635051727, "epoch": 2.092680358083202, "grad_norm": 0.26797109842300415, "learning_rate": 0.00016797956886215195, "loss": 0.19249004125595093, "mean_token_accuracy": 0.9230862706899643, "num_tokens": 49021208.0, "step": 3974 }, { "entropy": 1.340773344039917, "epoch": 2.0932069510268563, "grad_norm": 0.26169508695602417, "learning_rate": 0.0001679627954572825, "loss": 0.18936491012573242, "mean_token_accuracy": 0.9241386204957962, "num_tokens": 49033544.0, "step": 3975 }, { "entropy": 1.3765994012355804, "epoch": 2.0937335439705107, "grad_norm": 0.2780802249908447, "learning_rate": 0.00016794601861149977, "loss": 0.1884055733680725, "mean_token_accuracy": 0.9221274852752686, "num_tokens": 49045880.0, "step": 3976 }, { "entropy": 1.4070016741752625, "epoch": 2.0942601369141656, "grad_norm": 0.26833170652389526, "learning_rate": 0.00016792923832579964, "loss": 0.18630680441856384, "mean_token_accuracy": 0.9243040978908539, "num_tokens": 49058216.0, "step": 3977 }, { "entropy": 1.3762468099594116, "epoch": 2.09478672985782, "grad_norm": 0.26797711849212646, "learning_rate": 0.00016791245460117825, "loss": 0.18355493247509003, "mean_token_accuracy": 0.9276077747344971, "num_tokens": 49070552.0, "step": 3978 }, { "entropy": 1.3690291047096252, "epoch": 2.0953133228014744, "grad_norm": 0.2826116383075714, "learning_rate": 0.000167895667438632, "loss": 0.19171208143234253, "mean_token_accuracy": 0.9223132878541946, "num_tokens": 49082888.0, "step": 3979 }, { "entropy": 1.395127385854721, "epoch": 2.095839915745129, "grad_norm": 0.29053691029548645, "learning_rate": 0.00016787887683915737, "loss": 0.1943792700767517, "mean_token_accuracy": 0.9202833324670792, "num_tokens": 49095224.0, "step": 3980 }, { "entropy": 1.4068172872066498, "epoch": 2.0963665086887837, "grad_norm": 0.296621710062027, "learning_rate": 0.00016786208280375123, "loss": 0.18952558934688568, "mean_token_accuracy": 0.9180808961391449, "num_tokens": 49107560.0, "step": 3981 }, { "entropy": 1.3650657832622528, "epoch": 2.096893101632438, "grad_norm": 0.3004305064678192, "learning_rate": 0.00016784528533341045, "loss": 0.19340358674526215, "mean_token_accuracy": 0.9233474135398865, "num_tokens": 49119896.0, "step": 3982 }, { "entropy": 1.3545269072055817, "epoch": 2.0974196945760926, "grad_norm": 0.2610722482204437, "learning_rate": 0.0001678284844291322, "loss": 0.17823578417301178, "mean_token_accuracy": 0.927034541964531, "num_tokens": 49132232.0, "step": 3983 }, { "entropy": 1.36451455950737, "epoch": 2.0979462875197474, "grad_norm": 0.29160958528518677, "learning_rate": 0.0001678116800919139, "loss": 0.19818106293678284, "mean_token_accuracy": 0.9195860922336578, "num_tokens": 49144568.0, "step": 3984 }, { "entropy": 1.339730054140091, "epoch": 2.098472880463402, "grad_norm": 0.27172547578811646, "learning_rate": 0.00016779487232275312, "loss": 0.19754473865032196, "mean_token_accuracy": 0.9192177653312683, "num_tokens": 49156904.0, "step": 3985 }, { "entropy": 1.3566035628318787, "epoch": 2.0989994734070563, "grad_norm": 0.2742775082588196, "learning_rate": 0.0001677780611226476, "loss": 0.18728569149971008, "mean_token_accuracy": 0.9219802916049957, "num_tokens": 49169240.0, "step": 3986 }, { "entropy": 1.3031164109706879, "epoch": 2.0995260663507107, "grad_norm": 0.2691558301448822, "learning_rate": 0.00016776124649259537, "loss": 0.1954994797706604, "mean_token_accuracy": 0.9175993353128433, "num_tokens": 49181576.0, "step": 3987 }, { "entropy": 1.3594340980052948, "epoch": 2.1000526592943656, "grad_norm": 0.3043460547924042, "learning_rate": 0.0001677444284335946, "loss": 0.18774178624153137, "mean_token_accuracy": 0.9245233535766602, "num_tokens": 49193912.0, "step": 3988 }, { "entropy": 1.3227914571762085, "epoch": 2.10057925223802, "grad_norm": 0.28486767411231995, "learning_rate": 0.00016772760694664364, "loss": 0.18533597886562347, "mean_token_accuracy": 0.9241953045129776, "num_tokens": 49206248.0, "step": 3989 }, { "entropy": 1.34839728474617, "epoch": 2.1011058451816744, "grad_norm": 0.31815943121910095, "learning_rate": 0.00016771078203274114, "loss": 0.20659512281417847, "mean_token_accuracy": 0.9135080128908157, "num_tokens": 49218584.0, "step": 3990 }, { "entropy": 1.3131659030914307, "epoch": 2.1016324381253293, "grad_norm": 0.2616286873817444, "learning_rate": 0.00016769395369288588, "loss": 0.16908803582191467, "mean_token_accuracy": 0.9313696920871735, "num_tokens": 49230920.0, "step": 3991 }, { "entropy": 1.313031405210495, "epoch": 2.1021590310689837, "grad_norm": 0.27754518389701843, "learning_rate": 0.00016767712192807682, "loss": 0.19504284858703613, "mean_token_accuracy": 0.916403278708458, "num_tokens": 49243256.0, "step": 3992 }, { "entropy": 1.304496705532074, "epoch": 2.102685624012638, "grad_norm": 0.28971877694129944, "learning_rate": 0.00016766028673931323, "loss": 0.1822929084300995, "mean_token_accuracy": 0.9260184317827225, "num_tokens": 49255592.0, "step": 3993 }, { "entropy": 1.293164074420929, "epoch": 2.103212216956293, "grad_norm": 0.2651752233505249, "learning_rate": 0.0001676434481275945, "loss": 0.18674691021442413, "mean_token_accuracy": 0.9198154211044312, "num_tokens": 49267928.0, "step": 3994 }, { "entropy": 1.3709676265716553, "epoch": 2.1037388098999474, "grad_norm": 0.2977954149246216, "learning_rate": 0.0001676266060939202, "loss": 0.21413739025592804, "mean_token_accuracy": 0.9135608524084091, "num_tokens": 49280264.0, "step": 3995 }, { "entropy": 1.4219199419021606, "epoch": 2.104265402843602, "grad_norm": 0.30583176016807556, "learning_rate": 0.00016760976063929017, "loss": 0.18949593603610992, "mean_token_accuracy": 0.9219523072242737, "num_tokens": 49292600.0, "step": 3996 }, { "entropy": 1.4119015336036682, "epoch": 2.1047919957872563, "grad_norm": 0.29364195466041565, "learning_rate": 0.00016759291176470444, "loss": 0.19350691139698029, "mean_token_accuracy": 0.9228742122650146, "num_tokens": 49304936.0, "step": 3997 }, { "entropy": 1.362772524356842, "epoch": 2.105318588730911, "grad_norm": 0.2556858956813812, "learning_rate": 0.0001675760594711632, "loss": 0.183720663189888, "mean_token_accuracy": 0.9237812012434006, "num_tokens": 49317272.0, "step": 3998 }, { "entropy": 1.3637798428535461, "epoch": 2.1058451816745656, "grad_norm": 0.2728027403354645, "learning_rate": 0.0001675592037596669, "loss": 0.19628110527992249, "mean_token_accuracy": 0.9191394597291946, "num_tokens": 49329608.0, "step": 3999 }, { "entropy": 1.3810409605503082, "epoch": 2.10637177461822, "grad_norm": 0.26390331983566284, "learning_rate": 0.00016754234463121613, "loss": 0.1863417774438858, "mean_token_accuracy": 0.9180260598659515, "num_tokens": 49341944.0, "step": 4000 }, { "entropy": 1.3575378060340881, "epoch": 2.106898367561875, "grad_norm": 0.26593732833862305, "learning_rate": 0.00016752548208681176, "loss": 0.1913304477930069, "mean_token_accuracy": 0.9183992445468903, "num_tokens": 49354280.0, "step": 4001 }, { "entropy": 1.3803537786006927, "epoch": 2.1074249605055293, "grad_norm": 0.2804014980792999, "learning_rate": 0.0001675086161274548, "loss": 0.17945896089076996, "mean_token_accuracy": 0.9222467094659805, "num_tokens": 49366616.0, "step": 4002 }, { "entropy": 1.3277397155761719, "epoch": 2.1079515534491837, "grad_norm": 0.27084991335868835, "learning_rate": 0.0001674917467541465, "loss": 0.2013774961233139, "mean_token_accuracy": 0.9130637645721436, "num_tokens": 49378952.0, "step": 4003 }, { "entropy": 1.3295770585536957, "epoch": 2.108478146392838, "grad_norm": 0.2723524868488312, "learning_rate": 0.0001674748739678883, "loss": 0.18388348817825317, "mean_token_accuracy": 0.9248556792736053, "num_tokens": 49391288.0, "step": 4004 }, { "entropy": 1.3474342226982117, "epoch": 2.109004739336493, "grad_norm": 0.3119790554046631, "learning_rate": 0.00016745799776968177, "loss": 0.21229058504104614, "mean_token_accuracy": 0.9167481958866119, "num_tokens": 49403624.0, "step": 4005 }, { "entropy": 1.3330671191215515, "epoch": 2.1095313322801474, "grad_norm": 0.28843197226524353, "learning_rate": 0.0001674411181605288, "loss": 0.2047140747308731, "mean_token_accuracy": 0.9146516472101212, "num_tokens": 49415960.0, "step": 4006 }, { "entropy": 1.4152400493621826, "epoch": 2.110057925223802, "grad_norm": 0.30813169479370117, "learning_rate": 0.00016742423514143147, "loss": 0.1919257640838623, "mean_token_accuracy": 0.9214138835668564, "num_tokens": 49428296.0, "step": 4007 }, { "entropy": 1.3549103736877441, "epoch": 2.1105845181674567, "grad_norm": 0.2713034451007843, "learning_rate": 0.000167407348713392, "loss": 0.199094757437706, "mean_token_accuracy": 0.9188733994960785, "num_tokens": 49440632.0, "step": 4008 }, { "entropy": 1.35169118642807, "epoch": 2.111111111111111, "grad_norm": 0.26357969641685486, "learning_rate": 0.00016739045887741283, "loss": 0.18052592873573303, "mean_token_accuracy": 0.9184356480836868, "num_tokens": 49452968.0, "step": 4009 }, { "entropy": 1.3346559405326843, "epoch": 2.1116377040547656, "grad_norm": 0.27484050393104553, "learning_rate": 0.0001673735656344966, "loss": 0.18684698641300201, "mean_token_accuracy": 0.9233911037445068, "num_tokens": 49465304.0, "step": 4010 }, { "entropy": 1.288124918937683, "epoch": 2.11216429699842, "grad_norm": 0.2778557240962982, "learning_rate": 0.00016735666898564616, "loss": 0.20437434315681458, "mean_token_accuracy": 0.9145655333995819, "num_tokens": 49477640.0, "step": 4011 }, { "entropy": 1.4040893018245697, "epoch": 2.112690889942075, "grad_norm": 0.2719804644584656, "learning_rate": 0.0001673397689318646, "loss": 0.17971079051494598, "mean_token_accuracy": 0.9259855449199677, "num_tokens": 49489976.0, "step": 4012 }, { "entropy": 1.3603813648223877, "epoch": 2.1132174828857293, "grad_norm": 0.28585880994796753, "learning_rate": 0.0001673228654741552, "loss": 0.18481558561325073, "mean_token_accuracy": 0.9266578257083893, "num_tokens": 49502312.0, "step": 4013 }, { "entropy": 1.2925344407558441, "epoch": 2.1137440758293837, "grad_norm": 0.26038700342178345, "learning_rate": 0.00016730595861352132, "loss": 0.18866756558418274, "mean_token_accuracy": 0.9256009310483932, "num_tokens": 49514648.0, "step": 4014 }, { "entropy": 1.2987899482250214, "epoch": 2.1142706687730386, "grad_norm": 0.28457188606262207, "learning_rate": 0.0001672890483509667, "loss": 0.20553961396217346, "mean_token_accuracy": 0.9197067618370056, "num_tokens": 49526984.0, "step": 4015 }, { "entropy": 1.3735082149505615, "epoch": 2.114797261716693, "grad_norm": 0.2766115367412567, "learning_rate": 0.00016727213468749517, "loss": 0.1972998082637787, "mean_token_accuracy": 0.9184480607509613, "num_tokens": 49539320.0, "step": 4016 }, { "entropy": 1.395142674446106, "epoch": 2.1153238546603474, "grad_norm": 0.2885947823524475, "learning_rate": 0.00016725521762411084, "loss": 0.18944555521011353, "mean_token_accuracy": 0.9218645691871643, "num_tokens": 49551656.0, "step": 4017 }, { "entropy": 1.397442787885666, "epoch": 2.1158504476040023, "grad_norm": 0.31787705421447754, "learning_rate": 0.00016723829716181797, "loss": 0.2024865299463272, "mean_token_accuracy": 0.9169978648424149, "num_tokens": 49563992.0, "step": 4018 }, { "entropy": 1.3703459203243256, "epoch": 2.1163770405476567, "grad_norm": 0.27631449699401855, "learning_rate": 0.00016722137330162096, "loss": 0.1807280331850052, "mean_token_accuracy": 0.9232948869466782, "num_tokens": 49576328.0, "step": 4019 }, { "entropy": 1.34648397564888, "epoch": 2.116903633491311, "grad_norm": 0.2967493534088135, "learning_rate": 0.00016720444604452454, "loss": 0.20159119367599487, "mean_token_accuracy": 0.9131289422512054, "num_tokens": 49588664.0, "step": 4020 }, { "entropy": 1.3790269792079926, "epoch": 2.1174302264349656, "grad_norm": 0.28901422023773193, "learning_rate": 0.00016718751539153358, "loss": 0.19655507802963257, "mean_token_accuracy": 0.9193400889635086, "num_tokens": 49601000.0, "step": 4021 }, { "entropy": 1.3603746592998505, "epoch": 2.1179568193786205, "grad_norm": 0.28060466051101685, "learning_rate": 0.0001671705813436531, "loss": 0.1773560345172882, "mean_token_accuracy": 0.9246945679187775, "num_tokens": 49613336.0, "step": 4022 }, { "entropy": 1.3825352787971497, "epoch": 2.118483412322275, "grad_norm": 0.30686402320861816, "learning_rate": 0.0001671536439018885, "loss": 0.20738644897937775, "mean_token_accuracy": 0.9165382385253906, "num_tokens": 49625672.0, "step": 4023 }, { "entropy": 1.353473424911499, "epoch": 2.1190100052659293, "grad_norm": 0.2645687460899353, "learning_rate": 0.00016713670306724512, "loss": 0.18006260693073273, "mean_token_accuracy": 0.9287989288568497, "num_tokens": 49638008.0, "step": 4024 }, { "entropy": 1.329434186220169, "epoch": 2.119536598209584, "grad_norm": 0.23572540283203125, "learning_rate": 0.00016711975884072872, "loss": 0.1625441312789917, "mean_token_accuracy": 0.9347212463617325, "num_tokens": 49650344.0, "step": 4025 }, { "entropy": 1.37681046128273, "epoch": 2.1200631911532386, "grad_norm": 0.25571563839912415, "learning_rate": 0.00016710281122334514, "loss": 0.17739693820476532, "mean_token_accuracy": 0.9257268309593201, "num_tokens": 49662680.0, "step": 4026 }, { "entropy": 1.366820365190506, "epoch": 2.120589784096893, "grad_norm": 0.2715073227882385, "learning_rate": 0.0001670858602161005, "loss": 0.200881227850914, "mean_token_accuracy": 0.9174215346574783, "num_tokens": 49675016.0, "step": 4027 }, { "entropy": 1.3869880437850952, "epoch": 2.1211163770405475, "grad_norm": 0.27762705087661743, "learning_rate": 0.00016706890582000105, "loss": 0.1989072561264038, "mean_token_accuracy": 0.9190517961978912, "num_tokens": 49687352.0, "step": 4028 }, { "entropy": 1.3485141694545746, "epoch": 2.1216429699842023, "grad_norm": 0.28710541129112244, "learning_rate": 0.0001670519480360533, "loss": 0.20247332751750946, "mean_token_accuracy": 0.9163581281900406, "num_tokens": 49699688.0, "step": 4029 }, { "entropy": 1.3902212977409363, "epoch": 2.1221695629278567, "grad_norm": 0.2807939350605011, "learning_rate": 0.0001670349868652639, "loss": 0.18549507856369019, "mean_token_accuracy": 0.9232971370220184, "num_tokens": 49712024.0, "step": 4030 }, { "entropy": 1.2936671376228333, "epoch": 2.122696155871511, "grad_norm": 0.277076780796051, "learning_rate": 0.00016701802230863978, "loss": 0.18881529569625854, "mean_token_accuracy": 0.9208351224660873, "num_tokens": 49724360.0, "step": 4031 }, { "entropy": 1.2952979803085327, "epoch": 2.123222748815166, "grad_norm": 0.28867289423942566, "learning_rate": 0.00016700105436718795, "loss": 0.18886399269104004, "mean_token_accuracy": 0.9231124371290207, "num_tokens": 49736696.0, "step": 4032 }, { "entropy": 1.35812708735466, "epoch": 2.1237493417588205, "grad_norm": 0.30915045738220215, "learning_rate": 0.00016698408304191578, "loss": 0.21172593533992767, "mean_token_accuracy": 0.918636828660965, "num_tokens": 49749032.0, "step": 4033 }, { "entropy": 1.29549902677536, "epoch": 2.124275934702475, "grad_norm": 0.2771642804145813, "learning_rate": 0.00016696710833383075, "loss": 0.17263811826705933, "mean_token_accuracy": 0.9258449673652649, "num_tokens": 49761368.0, "step": 4034 }, { "entropy": 1.2696373462677002, "epoch": 2.1248025276461293, "grad_norm": 0.2755196690559387, "learning_rate": 0.00016695013024394052, "loss": 0.18899832665920258, "mean_token_accuracy": 0.9189085364341736, "num_tokens": 49773704.0, "step": 4035 }, { "entropy": 1.253807783126831, "epoch": 2.125329120589784, "grad_norm": 0.28885576128959656, "learning_rate": 0.00016693314877325294, "loss": 0.19073623418807983, "mean_token_accuracy": 0.9253068566322327, "num_tokens": 49786040.0, "step": 4036 }, { "entropy": 1.2731792032718658, "epoch": 2.1258557135334386, "grad_norm": 0.3004090189933777, "learning_rate": 0.00016691616392277618, "loss": 0.19338059425354004, "mean_token_accuracy": 0.9188876748085022, "num_tokens": 49798376.0, "step": 4037 }, { "entropy": 1.210568755865097, "epoch": 2.126382306477093, "grad_norm": 0.2848544418811798, "learning_rate": 0.00016689917569351852, "loss": 0.20599129796028137, "mean_token_accuracy": 0.9142592400312424, "num_tokens": 49810712.0, "step": 4038 }, { "entropy": 1.2268668115139008, "epoch": 2.126908899420748, "grad_norm": 0.2891899645328522, "learning_rate": 0.0001668821840864884, "loss": 0.2129664123058319, "mean_token_accuracy": 0.9123159050941467, "num_tokens": 49823048.0, "step": 4039 }, { "entropy": 1.1677944362163544, "epoch": 2.1274354923644023, "grad_norm": 0.280416876077652, "learning_rate": 0.00016686518910269459, "loss": 0.19316363334655762, "mean_token_accuracy": 0.9191536903381348, "num_tokens": 49835384.0, "step": 4040 }, { "entropy": 1.1698110401630402, "epoch": 2.1279620853080567, "grad_norm": 0.2729722857475281, "learning_rate": 0.00016684819074314587, "loss": 0.17371591925621033, "mean_token_accuracy": 0.9292128086090088, "num_tokens": 49847720.0, "step": 4041 }, { "entropy": 1.1880428791046143, "epoch": 2.1284886782517116, "grad_norm": 0.2968471050262451, "learning_rate": 0.00016683118900885147, "loss": 0.19274401664733887, "mean_token_accuracy": 0.9200466126203537, "num_tokens": 49860056.0, "step": 4042 }, { "entropy": 1.1668127179145813, "epoch": 2.129015271195366, "grad_norm": 0.24909040331840515, "learning_rate": 0.0001668141839008206, "loss": 0.1683623492717743, "mean_token_accuracy": 0.9272440522909164, "num_tokens": 49872392.0, "step": 4043 }, { "entropy": 1.2406319081783295, "epoch": 2.1295418641390205, "grad_norm": 0.32238873839378357, "learning_rate": 0.00016679717542006275, "loss": 0.19797292351722717, "mean_token_accuracy": 0.9142682403326035, "num_tokens": 49884728.0, "step": 4044 }, { "entropy": 1.1888574957847595, "epoch": 2.130068457082675, "grad_norm": 0.2867093086242676, "learning_rate": 0.00016678016356758764, "loss": 0.19565987586975098, "mean_token_accuracy": 0.921043261885643, "num_tokens": 49897064.0, "step": 4045 }, { "entropy": 1.185506522655487, "epoch": 2.1305950500263298, "grad_norm": 0.29846811294555664, "learning_rate": 0.00016676314834440518, "loss": 0.20893250405788422, "mean_token_accuracy": 0.9120955020189285, "num_tokens": 49909400.0, "step": 4046 }, { "entropy": 1.1691254079341888, "epoch": 2.131121642969984, "grad_norm": 0.2745888829231262, "learning_rate": 0.00016674612975152542, "loss": 0.18490786850452423, "mean_token_accuracy": 0.9252546727657318, "num_tokens": 49921736.0, "step": 4047 }, { "entropy": 1.1454492807388306, "epoch": 2.1316482359136386, "grad_norm": 0.2868290841579437, "learning_rate": 0.00016672910778995866, "loss": 0.20495843887329102, "mean_token_accuracy": 0.9156783670186996, "num_tokens": 49934072.0, "step": 4048 }, { "entropy": 1.1920296549797058, "epoch": 2.1321748288572935, "grad_norm": 0.2875182628631592, "learning_rate": 0.00016671208246071546, "loss": 0.20269200205802917, "mean_token_accuracy": 0.9209336042404175, "num_tokens": 49946408.0, "step": 4049 }, { "entropy": 1.194561243057251, "epoch": 2.132701421800948, "grad_norm": 0.28611719608306885, "learning_rate": 0.00016669505376480642, "loss": 0.18004143238067627, "mean_token_accuracy": 0.9242940843105316, "num_tokens": 49958744.0, "step": 4050 }, { "entropy": 1.1752946376800537, "epoch": 2.1332280147446023, "grad_norm": 0.2773791253566742, "learning_rate": 0.00016667802170324252, "loss": 0.17548750340938568, "mean_token_accuracy": 0.9260925948619843, "num_tokens": 49971080.0, "step": 4051 }, { "entropy": 1.1404151320457458, "epoch": 2.1337546076882568, "grad_norm": 0.24352863430976868, "learning_rate": 0.0001666609862770348, "loss": 0.17417335510253906, "mean_token_accuracy": 0.9301496148109436, "num_tokens": 49983416.0, "step": 4052 }, { "entropy": 1.1148101389408112, "epoch": 2.1342812006319116, "grad_norm": 0.27176782488822937, "learning_rate": 0.0001666439474871946, "loss": 0.1892414093017578, "mean_token_accuracy": 0.9190666973590851, "num_tokens": 49995752.0, "step": 4053 }, { "entropy": 1.121658980846405, "epoch": 2.134807793575566, "grad_norm": 0.2826327979564667, "learning_rate": 0.00016662690533473333, "loss": 0.2030116468667984, "mean_token_accuracy": 0.921414390206337, "num_tokens": 50008088.0, "step": 4054 }, { "entropy": 1.1173063218593597, "epoch": 2.1353343865192205, "grad_norm": 0.2585664689540863, "learning_rate": 0.00016660985982066277, "loss": 0.177621528506279, "mean_token_accuracy": 0.9258757680654526, "num_tokens": 50020424.0, "step": 4055 }, { "entropy": 1.1216989159584045, "epoch": 2.1358609794628753, "grad_norm": 0.27996382117271423, "learning_rate": 0.00016659281094599478, "loss": 0.18978063762187958, "mean_token_accuracy": 0.9182009845972061, "num_tokens": 50032760.0, "step": 4056 }, { "entropy": 1.1314687132835388, "epoch": 2.1363875724065298, "grad_norm": 0.30307766795158386, "learning_rate": 0.00016657575871174143, "loss": 0.20396795868873596, "mean_token_accuracy": 0.9122677892446518, "num_tokens": 50045096.0, "step": 4057 }, { "entropy": 1.0608826130628586, "epoch": 2.136914165350184, "grad_norm": 0.27314090728759766, "learning_rate": 0.00016655870311891503, "loss": 0.19006496667861938, "mean_token_accuracy": 0.9235405623912811, "num_tokens": 50057432.0, "step": 4058 }, { "entropy": 1.0740149021148682, "epoch": 2.137440758293839, "grad_norm": 0.273417204618454, "learning_rate": 0.00016654164416852812, "loss": 0.1910788118839264, "mean_token_accuracy": 0.9203030318021774, "num_tokens": 50069768.0, "step": 4059 }, { "entropy": 1.0903103351593018, "epoch": 2.1379673512374935, "grad_norm": 0.2700668275356293, "learning_rate": 0.0001665245818615933, "loss": 0.1629205048084259, "mean_token_accuracy": 0.9328511208295822, "num_tokens": 50082104.0, "step": 4060 }, { "entropy": 1.1036777794361115, "epoch": 2.138493944181148, "grad_norm": 0.285442054271698, "learning_rate": 0.00016650751619912355, "loss": 0.1832047700881958, "mean_token_accuracy": 0.920674666762352, "num_tokens": 50094440.0, "step": 4061 }, { "entropy": 1.0578563511371613, "epoch": 2.1390205371248023, "grad_norm": 0.2827666103839874, "learning_rate": 0.00016649044718213186, "loss": 0.17583194375038147, "mean_token_accuracy": 0.9268711805343628, "num_tokens": 50106776.0, "step": 4062 }, { "entropy": 1.040594071149826, "epoch": 2.139547130068457, "grad_norm": 0.289329469203949, "learning_rate": 0.00016647337481163162, "loss": 0.18696846067905426, "mean_token_accuracy": 0.9217635691165924, "num_tokens": 50119112.0, "step": 4063 }, { "entropy": 1.076176255941391, "epoch": 2.1400737230121116, "grad_norm": 0.2821875810623169, "learning_rate": 0.00016645629908863623, "loss": 0.18235281109809875, "mean_token_accuracy": 0.927731066942215, "num_tokens": 50131448.0, "step": 4064 }, { "entropy": 1.0617471039295197, "epoch": 2.140600315955766, "grad_norm": 0.29055875539779663, "learning_rate": 0.00016643922001415945, "loss": 0.19152817130088806, "mean_token_accuracy": 0.921459436416626, "num_tokens": 50143784.0, "step": 4065 }, { "entropy": 1.0784454494714737, "epoch": 2.141126908899421, "grad_norm": 0.28317174315452576, "learning_rate": 0.0001664221375892151, "loss": 0.1880769580602646, "mean_token_accuracy": 0.9215621948242188, "num_tokens": 50156120.0, "step": 4066 }, { "entropy": 1.1484303772449493, "epoch": 2.1416535018430753, "grad_norm": 0.29933735728263855, "learning_rate": 0.0001664050518148173, "loss": 0.19272185862064362, "mean_token_accuracy": 0.9227567911148071, "num_tokens": 50168456.0, "step": 4067 }, { "entropy": 1.1309453547000885, "epoch": 2.1421800947867298, "grad_norm": 0.3005389869213104, "learning_rate": 0.00016638796269198035, "loss": 0.20710280537605286, "mean_token_accuracy": 0.9150481820106506, "num_tokens": 50180792.0, "step": 4068 }, { "entropy": 1.1589435040950775, "epoch": 2.142706687730384, "grad_norm": 0.3221890926361084, "learning_rate": 0.00016637087022171868, "loss": 0.20620915293693542, "mean_token_accuracy": 0.9166271984577179, "num_tokens": 50193128.0, "step": 4069 }, { "entropy": 1.106980949640274, "epoch": 2.143233280674039, "grad_norm": 0.2595953047275543, "learning_rate": 0.00016635377440504706, "loss": 0.1830139011144638, "mean_token_accuracy": 0.9249969273805618, "num_tokens": 50205464.0, "step": 4070 }, { "entropy": 1.1292275488376617, "epoch": 2.1437598736176935, "grad_norm": 0.28772836923599243, "learning_rate": 0.0001663366752429802, "loss": 0.2001112997531891, "mean_token_accuracy": 0.9196556061506271, "num_tokens": 50217800.0, "step": 4071 }, { "entropy": 1.149866372346878, "epoch": 2.144286466561348, "grad_norm": 0.25645655393600464, "learning_rate": 0.0001663195727365334, "loss": 0.17879578471183777, "mean_token_accuracy": 0.9276049882173538, "num_tokens": 50230136.0, "step": 4072 }, { "entropy": 1.1402757167816162, "epoch": 2.144813059505003, "grad_norm": 0.24784688651561737, "learning_rate": 0.00016630246688672176, "loss": 0.16923773288726807, "mean_token_accuracy": 0.9288965910673141, "num_tokens": 50242472.0, "step": 4073 }, { "entropy": 1.1733649671077728, "epoch": 2.145339652448657, "grad_norm": 0.2653653025627136, "learning_rate": 0.00016628535769456083, "loss": 0.19141364097595215, "mean_token_accuracy": 0.9215678870677948, "num_tokens": 50254808.0, "step": 4074 }, { "entropy": 1.1664075255393982, "epoch": 2.1458662453923116, "grad_norm": 0.2801195979118347, "learning_rate": 0.00016626824516106624, "loss": 0.2021307796239853, "mean_token_accuracy": 0.918086051940918, "num_tokens": 50267144.0, "step": 4075 }, { "entropy": 1.1810933351516724, "epoch": 2.1463928383359665, "grad_norm": 0.2909698486328125, "learning_rate": 0.00016625112928725394, "loss": 0.2095974087715149, "mean_token_accuracy": 0.9153055250644684, "num_tokens": 50279480.0, "step": 4076 }, { "entropy": 1.1292328536510468, "epoch": 2.146919431279621, "grad_norm": 0.24777865409851074, "learning_rate": 0.00016623401007413995, "loss": 0.18146950006484985, "mean_token_accuracy": 0.9228164702653885, "num_tokens": 50291816.0, "step": 4077 }, { "entropy": 1.2031064331531525, "epoch": 2.1474460242232754, "grad_norm": 0.29414162039756775, "learning_rate": 0.0001662168875227405, "loss": 0.19175127148628235, "mean_token_accuracy": 0.9232201874256134, "num_tokens": 50304152.0, "step": 4078 }, { "entropy": 1.2237733602523804, "epoch": 2.1479726171669298, "grad_norm": 0.2574436366558075, "learning_rate": 0.00016619976163407212, "loss": 0.18326136469841003, "mean_token_accuracy": 0.927291065454483, "num_tokens": 50316488.0, "step": 4079 }, { "entropy": 1.1478267908096313, "epoch": 2.1484992101105846, "grad_norm": 0.25556036829948425, "learning_rate": 0.00016618263240915143, "loss": 0.17815645039081573, "mean_token_accuracy": 0.9254791438579559, "num_tokens": 50328824.0, "step": 4080 }, { "entropy": 1.1542611420154572, "epoch": 2.149025803054239, "grad_norm": 0.2943160831928253, "learning_rate": 0.00016616549984899533, "loss": 0.2042732536792755, "mean_token_accuracy": 0.9145019352436066, "num_tokens": 50341160.0, "step": 4081 }, { "entropy": 1.1703786253929138, "epoch": 2.1495523959978935, "grad_norm": 0.29997357726097107, "learning_rate": 0.00016614836395462086, "loss": 0.18360967934131622, "mean_token_accuracy": 0.922757014632225, "num_tokens": 50353496.0, "step": 4082 }, { "entropy": 1.14296355843544, "epoch": 2.1500789889415484, "grad_norm": 0.4659420847892761, "learning_rate": 0.00016613122472704527, "loss": 0.19003994762897491, "mean_token_accuracy": 0.9201502650976181, "num_tokens": 50365832.0, "step": 4083 }, { "entropy": 1.2191529273986816, "epoch": 2.150605581885203, "grad_norm": 0.2996703088283539, "learning_rate": 0.00016611408216728603, "loss": 0.2007676362991333, "mean_token_accuracy": 0.9181395620107651, "num_tokens": 50378168.0, "step": 4084 }, { "entropy": 1.2132177352905273, "epoch": 2.151132174828857, "grad_norm": 0.25647181272506714, "learning_rate": 0.0001660969362763608, "loss": 0.1759507954120636, "mean_token_accuracy": 0.9269961714744568, "num_tokens": 50390504.0, "step": 4085 }, { "entropy": 1.220710039138794, "epoch": 2.1516587677725116, "grad_norm": 0.26862823963165283, "learning_rate": 0.0001660797870552874, "loss": 0.20389479398727417, "mean_token_accuracy": 0.9192573726177216, "num_tokens": 50402840.0, "step": 4086 }, { "entropy": 1.3179146647453308, "epoch": 2.1521853607161665, "grad_norm": 0.32815021276474, "learning_rate": 0.00016606263450508391, "loss": 0.20844385027885437, "mean_token_accuracy": 0.9123887866735458, "num_tokens": 50415176.0, "step": 4087 }, { "entropy": 1.270151823759079, "epoch": 2.152711953659821, "grad_norm": 0.28897103667259216, "learning_rate": 0.00016604547862676856, "loss": 0.19628524780273438, "mean_token_accuracy": 0.9163263142108917, "num_tokens": 50427512.0, "step": 4088 }, { "entropy": 1.297392338514328, "epoch": 2.1532385466034754, "grad_norm": 0.29361578822135925, "learning_rate": 0.0001660283194213598, "loss": 0.1971634477376938, "mean_token_accuracy": 0.9190499484539032, "num_tokens": 50439848.0, "step": 4089 }, { "entropy": 1.2932831943035126, "epoch": 2.1537651395471302, "grad_norm": 0.25311169028282166, "learning_rate": 0.0001660111568898763, "loss": 0.18418122828006744, "mean_token_accuracy": 0.9244278967380524, "num_tokens": 50452184.0, "step": 4090 }, { "entropy": 1.3569526970386505, "epoch": 2.1542917324907846, "grad_norm": 0.2899273633956909, "learning_rate": 0.00016599399103333685, "loss": 0.21381260454654694, "mean_token_accuracy": 0.9070511162281036, "num_tokens": 50464520.0, "step": 4091 }, { "entropy": 1.378174602985382, "epoch": 2.154818325434439, "grad_norm": 0.2990644574165344, "learning_rate": 0.00016597682185276049, "loss": 0.2194102704524994, "mean_token_accuracy": 0.9084511697292328, "num_tokens": 50476856.0, "step": 4092 }, { "entropy": 1.399436503648758, "epoch": 2.155344918378094, "grad_norm": 0.2860548198223114, "learning_rate": 0.00016595964934916653, "loss": 0.19893941283226013, "mean_token_accuracy": 0.9167734533548355, "num_tokens": 50489192.0, "step": 4093 }, { "entropy": 1.370680034160614, "epoch": 2.1558715113217484, "grad_norm": 0.28559643030166626, "learning_rate": 0.00016594247352357433, "loss": 0.19687819480895996, "mean_token_accuracy": 0.9142584204673767, "num_tokens": 50501528.0, "step": 4094 }, { "entropy": 1.359871655702591, "epoch": 2.156398104265403, "grad_norm": 0.2813403010368347, "learning_rate": 0.0001659252943770035, "loss": 0.21558703482151031, "mean_token_accuracy": 0.9130292385816574, "num_tokens": 50513864.0, "step": 4095 }, { "entropy": 1.4364489018917084, "epoch": 2.156924697209057, "grad_norm": 0.2761105000972748, "learning_rate": 0.00016590811191047393, "loss": 0.19772423803806305, "mean_token_accuracy": 0.916876494884491, "num_tokens": 50526200.0, "step": 4096 }, { "entropy": 1.4437676966190338, "epoch": 2.157451290152712, "grad_norm": 0.26975753903388977, "learning_rate": 0.0001658909261250056, "loss": 0.18524104356765747, "mean_token_accuracy": 0.921722486615181, "num_tokens": 50538536.0, "step": 4097 }, { "entropy": 1.4069486558437347, "epoch": 2.1579778830963665, "grad_norm": 0.2700808346271515, "learning_rate": 0.00016587373702161876, "loss": 0.1872127503156662, "mean_token_accuracy": 0.9228634834289551, "num_tokens": 50550872.0, "step": 4098 }, { "entropy": 1.4102502763271332, "epoch": 2.158504476040021, "grad_norm": 0.28084951639175415, "learning_rate": 0.00016585654460133376, "loss": 0.1960507333278656, "mean_token_accuracy": 0.9219342321157455, "num_tokens": 50563208.0, "step": 4099 }, { "entropy": 1.4461718797683716, "epoch": 2.159031068983676, "grad_norm": 0.2957639992237091, "learning_rate": 0.0001658393488651713, "loss": 0.18612340092658997, "mean_token_accuracy": 0.9263795763254166, "num_tokens": 50575544.0, "step": 4100 }, { "entropy": 1.4473920464515686, "epoch": 2.1595576619273302, "grad_norm": 0.261575311422348, "learning_rate": 0.00016582214981415217, "loss": 0.1952032893896103, "mean_token_accuracy": 0.9171668738126755, "num_tokens": 50587880.0, "step": 4101 }, { "entropy": 1.4263883233070374, "epoch": 2.1600842548709847, "grad_norm": 0.33648961782455444, "learning_rate": 0.00016580494744929735, "loss": 0.1953122764825821, "mean_token_accuracy": 0.9167916476726532, "num_tokens": 50600216.0, "step": 4102 }, { "entropy": 1.4109848737716675, "epoch": 2.160610847814639, "grad_norm": 0.2898204028606415, "learning_rate": 0.00016578774177162807, "loss": 0.19459910690784454, "mean_token_accuracy": 0.918088361620903, "num_tokens": 50612552.0, "step": 4103 }, { "entropy": 1.4371325075626373, "epoch": 2.161137440758294, "grad_norm": 0.2821919918060303, "learning_rate": 0.00016577053278216567, "loss": 0.20267830789089203, "mean_token_accuracy": 0.9202786535024643, "num_tokens": 50624888.0, "step": 4104 }, { "entropy": 1.4190351366996765, "epoch": 2.1616640337019484, "grad_norm": 0.28132855892181396, "learning_rate": 0.00016575332048193183, "loss": 0.1873740255832672, "mean_token_accuracy": 0.9211129248142242, "num_tokens": 50637224.0, "step": 4105 }, { "entropy": 1.3971222043037415, "epoch": 2.162190626645603, "grad_norm": 0.2738102674484253, "learning_rate": 0.0001657361048719483, "loss": 0.20248481631278992, "mean_token_accuracy": 0.9121163636445999, "num_tokens": 50649560.0, "step": 4106 }, { "entropy": 1.482112854719162, "epoch": 2.1627172195892577, "grad_norm": 0.2849135994911194, "learning_rate": 0.0001657188859532371, "loss": 0.2112928032875061, "mean_token_accuracy": 0.9163548201322556, "num_tokens": 50661896.0, "step": 4107 }, { "entropy": 1.4393364191055298, "epoch": 2.163243812532912, "grad_norm": 0.27296361327171326, "learning_rate": 0.00016570166372682034, "loss": 0.1941811442375183, "mean_token_accuracy": 0.9172745048999786, "num_tokens": 50674232.0, "step": 4108 }, { "entropy": 1.3936603665351868, "epoch": 2.1637704054765665, "grad_norm": 0.2626595199108124, "learning_rate": 0.00016568443819372052, "loss": 0.18277618288993835, "mean_token_accuracy": 0.9309801757335663, "num_tokens": 50686568.0, "step": 4109 }, { "entropy": 1.369593769311905, "epoch": 2.1642969984202214, "grad_norm": 0.2655249834060669, "learning_rate": 0.0001656672093549601, "loss": 0.19196127355098724, "mean_token_accuracy": 0.9230923056602478, "num_tokens": 50698904.0, "step": 4110 }, { "entropy": 1.4366631209850311, "epoch": 2.164823591363876, "grad_norm": 0.29604408144950867, "learning_rate": 0.00016564997721156197, "loss": 0.1939295530319214, "mean_token_accuracy": 0.9189808517694473, "num_tokens": 50711240.0, "step": 4111 }, { "entropy": 1.4341607093811035, "epoch": 2.1653501843075302, "grad_norm": 0.28088974952697754, "learning_rate": 0.000165632741764549, "loss": 0.2065155804157257, "mean_token_accuracy": 0.9164612293243408, "num_tokens": 50723576.0, "step": 4112 }, { "entropy": 1.4529509842395782, "epoch": 2.1658767772511847, "grad_norm": 0.2820344567298889, "learning_rate": 0.00016561550301494443, "loss": 0.18620197474956512, "mean_token_accuracy": 0.9235643148422241, "num_tokens": 50735912.0, "step": 4113 }, { "entropy": 1.4021332263946533, "epoch": 2.1664033701948395, "grad_norm": 0.2705285847187042, "learning_rate": 0.0001655982609637716, "loss": 0.19482757151126862, "mean_token_accuracy": 0.917400673031807, "num_tokens": 50748248.0, "step": 4114 }, { "entropy": 1.3551163375377655, "epoch": 2.166929963138494, "grad_norm": 0.2499101608991623, "learning_rate": 0.0001655810156120541, "loss": 0.17850345373153687, "mean_token_accuracy": 0.9285051375627518, "num_tokens": 50760584.0, "step": 4115 }, { "entropy": 1.3864115178585052, "epoch": 2.1674565560821484, "grad_norm": 0.283306360244751, "learning_rate": 0.00016556376696081558, "loss": 0.1874375194311142, "mean_token_accuracy": 0.9245508462190628, "num_tokens": 50772920.0, "step": 4116 }, { "entropy": 1.3825859427452087, "epoch": 2.1679831490258032, "grad_norm": 0.25388672947883606, "learning_rate": 0.0001655465150110801, "loss": 0.17021594941616058, "mean_token_accuracy": 0.9311476945877075, "num_tokens": 50785256.0, "step": 4117 }, { "entropy": 1.3711049556732178, "epoch": 2.1685097419694577, "grad_norm": 0.2609105408191681, "learning_rate": 0.00016552925976387177, "loss": 0.17833492159843445, "mean_token_accuracy": 0.9264799654483795, "num_tokens": 50797592.0, "step": 4118 }, { "entropy": 1.3915640711784363, "epoch": 2.169036334913112, "grad_norm": 0.30802109837532043, "learning_rate": 0.00016551200122021494, "loss": 0.20191773772239685, "mean_token_accuracy": 0.9182671159505844, "num_tokens": 50809928.0, "step": 4119 }, { "entropy": 1.2875527441501617, "epoch": 2.1695629278567665, "grad_norm": 0.2597365975379944, "learning_rate": 0.00016549473938113414, "loss": 0.18255290389060974, "mean_token_accuracy": 0.9238605499267578, "num_tokens": 50822264.0, "step": 4120 }, { "entropy": 1.2972512543201447, "epoch": 2.1700895208004214, "grad_norm": 0.2637297511100769, "learning_rate": 0.00016547747424765412, "loss": 0.17539075016975403, "mean_token_accuracy": 0.9288503229618073, "num_tokens": 50834600.0, "step": 4121 }, { "entropy": 1.3471184074878693, "epoch": 2.170616113744076, "grad_norm": 0.29643920063972473, "learning_rate": 0.0001654602058207998, "loss": 0.19519950449466705, "mean_token_accuracy": 0.9189782440662384, "num_tokens": 50846936.0, "step": 4122 }, { "entropy": 1.3144559860229492, "epoch": 2.1711427066877302, "grad_norm": 0.30460768938064575, "learning_rate": 0.0001654429341015963, "loss": 0.1963726282119751, "mean_token_accuracy": 0.9202246516942978, "num_tokens": 50859272.0, "step": 4123 }, { "entropy": 1.2872081398963928, "epoch": 2.171669299631385, "grad_norm": 0.27515682578086853, "learning_rate": 0.00016542565909106896, "loss": 0.18613222241401672, "mean_token_accuracy": 0.922202005982399, "num_tokens": 50871608.0, "step": 4124 }, { "entropy": 1.3294596076011658, "epoch": 2.1721958925750395, "grad_norm": 0.2827659547328949, "learning_rate": 0.00016540838079024325, "loss": 0.1930113434791565, "mean_token_accuracy": 0.926962748169899, "num_tokens": 50883944.0, "step": 4125 }, { "entropy": 1.3070390224456787, "epoch": 2.172722485518694, "grad_norm": 0.29022613167762756, "learning_rate": 0.00016539109920014498, "loss": 0.18820495903491974, "mean_token_accuracy": 0.9214640110731125, "num_tokens": 50896280.0, "step": 4126 }, { "entropy": 1.2923785746097565, "epoch": 2.173249078462349, "grad_norm": 0.30840960144996643, "learning_rate": 0.00016537381432179992, "loss": 0.19509851932525635, "mean_token_accuracy": 0.9167175590991974, "num_tokens": 50908616.0, "step": 4127 }, { "entropy": 1.2731912434101105, "epoch": 2.1737756714060033, "grad_norm": 0.262724906206131, "learning_rate": 0.00016535652615623433, "loss": 0.17678092420101166, "mean_token_accuracy": 0.924164742231369, "num_tokens": 50920952.0, "step": 4128 }, { "entropy": 1.2588714957237244, "epoch": 2.1743022643496577, "grad_norm": 0.2767009139060974, "learning_rate": 0.00016533923470447436, "loss": 0.1992766261100769, "mean_token_accuracy": 0.9205213189125061, "num_tokens": 50933288.0, "step": 4129 }, { "entropy": 1.2620333433151245, "epoch": 2.174828857293312, "grad_norm": 0.27543267607688904, "learning_rate": 0.0001653219399675466, "loss": 0.1907360702753067, "mean_token_accuracy": 0.9243224263191223, "num_tokens": 50945624.0, "step": 4130 }, { "entropy": 1.251461535692215, "epoch": 2.175355450236967, "grad_norm": 0.2669181823730469, "learning_rate": 0.00016530464194647768, "loss": 0.19080904126167297, "mean_token_accuracy": 0.9203681647777557, "num_tokens": 50957960.0, "step": 4131 }, { "entropy": 1.2553662955760956, "epoch": 2.1758820431806214, "grad_norm": 0.2973247468471527, "learning_rate": 0.0001652873406422945, "loss": 0.2005629688501358, "mean_token_accuracy": 0.9205776154994965, "num_tokens": 50970296.0, "step": 4132 }, { "entropy": 1.2845535278320312, "epoch": 2.176408636124276, "grad_norm": 0.2855272591114044, "learning_rate": 0.00016527003605602418, "loss": 0.19210195541381836, "mean_token_accuracy": 0.9204275608062744, "num_tokens": 50982632.0, "step": 4133 }, { "entropy": 1.2553153038024902, "epoch": 2.1769352290679307, "grad_norm": 0.2743854224681854, "learning_rate": 0.00016525272818869392, "loss": 0.19348418712615967, "mean_token_accuracy": 0.9160150438547134, "num_tokens": 50994968.0, "step": 4134 }, { "entropy": 1.2861834466457367, "epoch": 2.177461822011585, "grad_norm": 0.3126857578754425, "learning_rate": 0.00016523541704133128, "loss": 0.2036605328321457, "mean_token_accuracy": 0.91865274310112, "num_tokens": 51007304.0, "step": 4135 }, { "entropy": 1.2617907226085663, "epoch": 2.1779884149552395, "grad_norm": 0.2782585620880127, "learning_rate": 0.00016521810261496385, "loss": 0.1961769163608551, "mean_token_accuracy": 0.9191503077745438, "num_tokens": 51019640.0, "step": 4136 }, { "entropy": 1.2762066721916199, "epoch": 2.178515007898894, "grad_norm": 0.2730770707130432, "learning_rate": 0.00016520078491061944, "loss": 0.20689794421195984, "mean_token_accuracy": 0.9149703979492188, "num_tokens": 51031976.0, "step": 4137 }, { "entropy": 1.272611141204834, "epoch": 2.179041600842549, "grad_norm": 0.2779129445552826, "learning_rate": 0.00016518346392932625, "loss": 0.18954318761825562, "mean_token_accuracy": 0.9203405678272247, "num_tokens": 51044312.0, "step": 4138 }, { "entropy": 1.2742144763469696, "epoch": 2.1795681937862033, "grad_norm": 0.26842811703681946, "learning_rate": 0.00016516613967211237, "loss": 0.19438216090202332, "mean_token_accuracy": 0.9190889149904251, "num_tokens": 51056648.0, "step": 4139 }, { "entropy": 1.2541859447956085, "epoch": 2.1800947867298577, "grad_norm": 0.25953954458236694, "learning_rate": 0.00016514881214000637, "loss": 0.16562017798423767, "mean_token_accuracy": 0.9315860420465469, "num_tokens": 51068984.0, "step": 4140 }, { "entropy": 1.2067217528820038, "epoch": 2.1806213796735125, "grad_norm": 0.26448673009872437, "learning_rate": 0.00016513148133403678, "loss": 0.19268856942653656, "mean_token_accuracy": 0.9189769923686981, "num_tokens": 51081320.0, "step": 4141 }, { "entropy": 1.2760578393936157, "epoch": 2.181147972617167, "grad_norm": 0.28249260783195496, "learning_rate": 0.00016511414725523248, "loss": 0.19554588198661804, "mean_token_accuracy": 0.9178217202425003, "num_tokens": 51093656.0, "step": 4142 }, { "entropy": 1.225668877363205, "epoch": 2.1816745655608214, "grad_norm": 0.29703161120414734, "learning_rate": 0.00016509680990462253, "loss": 0.19665035605430603, "mean_token_accuracy": 0.9156013280153275, "num_tokens": 51105992.0, "step": 4143 }, { "entropy": 1.2031238079071045, "epoch": 2.1822011585044763, "grad_norm": 0.2988886535167694, "learning_rate": 0.00016507946928323607, "loss": 0.21606066823005676, "mean_token_accuracy": 0.912405326962471, "num_tokens": 51118328.0, "step": 4144 }, { "entropy": 1.2246394753456116, "epoch": 2.1827277514481307, "grad_norm": 0.3065650165081024, "learning_rate": 0.00016506212539210252, "loss": 0.19041046500205994, "mean_token_accuracy": 0.9208615720272064, "num_tokens": 51130664.0, "step": 4145 }, { "entropy": 1.2080211341381073, "epoch": 2.183254344391785, "grad_norm": 0.2621246576309204, "learning_rate": 0.00016504477823225155, "loss": 0.18758952617645264, "mean_token_accuracy": 0.9203426092863083, "num_tokens": 51143000.0, "step": 4146 }, { "entropy": 1.2131967544555664, "epoch": 2.1837809373354395, "grad_norm": 0.279575377702713, "learning_rate": 0.00016502742780471292, "loss": 0.19576191902160645, "mean_token_accuracy": 0.9203895181417465, "num_tokens": 51155336.0, "step": 4147 }, { "entropy": 1.2280302047729492, "epoch": 2.1843075302790944, "grad_norm": 0.30413857102394104, "learning_rate": 0.0001650100741105166, "loss": 0.23050157725811005, "mean_token_accuracy": 0.9074624329805374, "num_tokens": 51167672.0, "step": 4148 }, { "entropy": 1.134459227323532, "epoch": 2.184834123222749, "grad_norm": 0.2748672366142273, "learning_rate": 0.00016499271715069282, "loss": 0.20069140195846558, "mean_token_accuracy": 0.9178691804409027, "num_tokens": 51180008.0, "step": 4149 }, { "entropy": 1.1993885934352875, "epoch": 2.1853607161664033, "grad_norm": 0.2918178141117096, "learning_rate": 0.000164975356926272, "loss": 0.1967269331216812, "mean_token_accuracy": 0.9205320626497269, "num_tokens": 51192344.0, "step": 4150 }, { "entropy": 1.169199138879776, "epoch": 2.185887309110058, "grad_norm": 0.2743321657180786, "learning_rate": 0.00016495799343828457, "loss": 0.1919926255941391, "mean_token_accuracy": 0.923371896147728, "num_tokens": 51204680.0, "step": 4151 }, { "entropy": 1.18020898103714, "epoch": 2.1864139020537126, "grad_norm": 0.2571604549884796, "learning_rate": 0.00016494062668776142, "loss": 0.18856392800807953, "mean_token_accuracy": 0.9222598224878311, "num_tokens": 51217016.0, "step": 4152 }, { "entropy": 1.238032579421997, "epoch": 2.186940494997367, "grad_norm": 0.31084808707237244, "learning_rate": 0.0001649232566757335, "loss": 0.2140955924987793, "mean_token_accuracy": 0.9109927117824554, "num_tokens": 51229352.0, "step": 4153 }, { "entropy": 1.165948748588562, "epoch": 2.1874670879410214, "grad_norm": 0.25719159841537476, "learning_rate": 0.00016490588340323193, "loss": 0.17952802777290344, "mean_token_accuracy": 0.925691083073616, "num_tokens": 51241688.0, "step": 4154 }, { "entropy": 1.1968891322612762, "epoch": 2.1879936808846763, "grad_norm": 0.31568825244903564, "learning_rate": 0.00016488850687128808, "loss": 0.200781911611557, "mean_token_accuracy": 0.9183004051446915, "num_tokens": 51254024.0, "step": 4155 }, { "entropy": 1.1447340846061707, "epoch": 2.1885202738283307, "grad_norm": 0.27546897530555725, "learning_rate": 0.0001648711270809335, "loss": 0.18839329481124878, "mean_token_accuracy": 0.9184723347425461, "num_tokens": 51266360.0, "step": 4156 }, { "entropy": 1.171207994222641, "epoch": 2.189046866771985, "grad_norm": 0.274943083524704, "learning_rate": 0.00016485374403319992, "loss": 0.18055374920368195, "mean_token_accuracy": 0.9275996685028076, "num_tokens": 51278696.0, "step": 4157 }, { "entropy": 1.1181433200836182, "epoch": 2.18957345971564, "grad_norm": 0.26391127705574036, "learning_rate": 0.00016483635772911927, "loss": 0.18997561931610107, "mean_token_accuracy": 0.9185864478349686, "num_tokens": 51291032.0, "step": 4158 }, { "entropy": 1.179248869419098, "epoch": 2.1901000526592944, "grad_norm": 0.3057918846607208, "learning_rate": 0.00016481896816972365, "loss": 0.20668058097362518, "mean_token_accuracy": 0.9130419045686722, "num_tokens": 51303368.0, "step": 4159 }, { "entropy": 1.14694344997406, "epoch": 2.190626645602949, "grad_norm": 0.29680994153022766, "learning_rate": 0.00016480157535604542, "loss": 0.20385394990444183, "mean_token_accuracy": 0.9219126552343369, "num_tokens": 51315704.0, "step": 4160 }, { "entropy": 1.1223139762878418, "epoch": 2.1911532385466037, "grad_norm": 0.28084614872932434, "learning_rate": 0.00016478417928911707, "loss": 0.1831260770559311, "mean_token_accuracy": 0.921630397439003, "num_tokens": 51328040.0, "step": 4161 }, { "entropy": 1.1934473514556885, "epoch": 2.191679831490258, "grad_norm": 0.2605876922607422, "learning_rate": 0.0001647667799699713, "loss": 0.17136146128177643, "mean_token_accuracy": 0.9267126470804214, "num_tokens": 51340376.0, "step": 4162 }, { "entropy": 1.2115715444087982, "epoch": 2.1922064244339126, "grad_norm": 0.2804056704044342, "learning_rate": 0.00016474937739964098, "loss": 0.19194582104682922, "mean_token_accuracy": 0.9201535731554031, "num_tokens": 51352712.0, "step": 4163 }, { "entropy": 1.2309587597846985, "epoch": 2.192733017377567, "grad_norm": 0.29135453701019287, "learning_rate": 0.00016473197157915924, "loss": 0.193227156996727, "mean_token_accuracy": 0.9226816892623901, "num_tokens": 51365048.0, "step": 4164 }, { "entropy": 1.199971079826355, "epoch": 2.193259610321222, "grad_norm": 0.2691158950328827, "learning_rate": 0.00016471456250955935, "loss": 0.18729914724826813, "mean_token_accuracy": 0.9220250248908997, "num_tokens": 51377384.0, "step": 4165 }, { "entropy": 1.2236689925193787, "epoch": 2.1937862032648763, "grad_norm": 0.28157827258110046, "learning_rate": 0.0001646971501918748, "loss": 0.1987837255001068, "mean_token_accuracy": 0.9200732856988907, "num_tokens": 51389720.0, "step": 4166 }, { "entropy": 1.2567576467990875, "epoch": 2.1943127962085307, "grad_norm": 0.2924027442932129, "learning_rate": 0.00016467973462713924, "loss": 0.19592998921871185, "mean_token_accuracy": 0.9199083000421524, "num_tokens": 51402056.0, "step": 4167 }, { "entropy": 1.237093836069107, "epoch": 2.194839389152185, "grad_norm": 0.24912655353546143, "learning_rate": 0.00016466231581638654, "loss": 0.18574857711791992, "mean_token_accuracy": 0.9237374365329742, "num_tokens": 51414392.0, "step": 4168 }, { "entropy": 1.303921639919281, "epoch": 2.19536598209584, "grad_norm": 0.2773839235305786, "learning_rate": 0.00016464489376065073, "loss": 0.178799569606781, "mean_token_accuracy": 0.9240204840898514, "num_tokens": 51426728.0, "step": 4169 }, { "entropy": 1.3061772286891937, "epoch": 2.1958925750394944, "grad_norm": 0.2626015841960907, "learning_rate": 0.00016462746846096607, "loss": 0.18042266368865967, "mean_token_accuracy": 0.9253515899181366, "num_tokens": 51439064.0, "step": 4170 }, { "entropy": 1.2534684240818024, "epoch": 2.196419167983149, "grad_norm": 0.26793691515922546, "learning_rate": 0.00016461003991836702, "loss": 0.1747230887413025, "mean_token_accuracy": 0.9280012398958206, "num_tokens": 51451400.0, "step": 4171 }, { "entropy": 1.2703869342803955, "epoch": 2.1969457609268037, "grad_norm": 0.2812594473361969, "learning_rate": 0.0001645926081338882, "loss": 0.1805751770734787, "mean_token_accuracy": 0.9254391044378281, "num_tokens": 51463736.0, "step": 4172 }, { "entropy": 1.2749820053577423, "epoch": 2.197472353870458, "grad_norm": 0.28039759397506714, "learning_rate": 0.00016457517310856435, "loss": 0.1838250607252121, "mean_token_accuracy": 0.9279988557100296, "num_tokens": 51476072.0, "step": 4173 }, { "entropy": 1.2618244588375092, "epoch": 2.1979989468141126, "grad_norm": 0.27489322423934937, "learning_rate": 0.00016455773484343062, "loss": 0.19052180647850037, "mean_token_accuracy": 0.9222322404384613, "num_tokens": 51488408.0, "step": 4174 }, { "entropy": 1.2714160978794098, "epoch": 2.1985255397577674, "grad_norm": 0.2729232907295227, "learning_rate": 0.00016454029333952218, "loss": 0.18227756023406982, "mean_token_accuracy": 0.926309272646904, "num_tokens": 51500744.0, "step": 4175 }, { "entropy": 1.3097633719444275, "epoch": 2.199052132701422, "grad_norm": 0.2813631594181061, "learning_rate": 0.00016452284859787438, "loss": 0.19379457831382751, "mean_token_accuracy": 0.9247638136148453, "num_tokens": 51513080.0, "step": 4176 }, { "entropy": 1.2534567713737488, "epoch": 2.1995787256450763, "grad_norm": 0.29952695965766907, "learning_rate": 0.00016450540061952284, "loss": 0.2159310132265091, "mean_token_accuracy": 0.9128957092761993, "num_tokens": 51525416.0, "step": 4177 }, { "entropy": 1.2288260757923126, "epoch": 2.2001053185887307, "grad_norm": 0.28645092248916626, "learning_rate": 0.00016448794940550335, "loss": 0.18216633796691895, "mean_token_accuracy": 0.9225532412528992, "num_tokens": 51537752.0, "step": 4178 }, { "entropy": 1.2748102247714996, "epoch": 2.2006319115323856, "grad_norm": 0.27064216136932373, "learning_rate": 0.00016447049495685187, "loss": 0.17641235888004303, "mean_token_accuracy": 0.9300948679447174, "num_tokens": 51550088.0, "step": 4179 }, { "entropy": 1.2677447497844696, "epoch": 2.20115850447604, "grad_norm": 0.2583957314491272, "learning_rate": 0.0001644530372746046, "loss": 0.17626498639583588, "mean_token_accuracy": 0.9239745885133743, "num_tokens": 51562424.0, "step": 4180 }, { "entropy": 1.2885291874408722, "epoch": 2.2016850974196944, "grad_norm": 0.2887992262840271, "learning_rate": 0.00016443557635979788, "loss": 0.19101789593696594, "mean_token_accuracy": 0.9209521859884262, "num_tokens": 51574760.0, "step": 4181 }, { "entropy": 1.2113700211048126, "epoch": 2.2022116903633493, "grad_norm": 0.2987286150455475, "learning_rate": 0.00016441811221346828, "loss": 0.18627510964870453, "mean_token_accuracy": 0.9210187345743179, "num_tokens": 51587096.0, "step": 4182 }, { "entropy": 1.2981871664524078, "epoch": 2.2027382833070037, "grad_norm": 0.27984488010406494, "learning_rate": 0.0001644006448366525, "loss": 0.18086984753608704, "mean_token_accuracy": 0.9228075742721558, "num_tokens": 51599432.0, "step": 4183 }, { "entropy": 1.3021030724048615, "epoch": 2.203264876250658, "grad_norm": 0.29861992597579956, "learning_rate": 0.00016438317423038754, "loss": 0.19581389427185059, "mean_token_accuracy": 0.9156288206577301, "num_tokens": 51611768.0, "step": 4184 }, { "entropy": 1.2574114203453064, "epoch": 2.2037914691943126, "grad_norm": 0.28540849685668945, "learning_rate": 0.00016436570039571048, "loss": 0.1952468752861023, "mean_token_accuracy": 0.9155928790569305, "num_tokens": 51624104.0, "step": 4185 }, { "entropy": 1.3478785157203674, "epoch": 2.2043180621379674, "grad_norm": 0.46443215012550354, "learning_rate": 0.00016434822333365867, "loss": 0.17215551435947418, "mean_token_accuracy": 0.9300452023744583, "num_tokens": 51636440.0, "step": 4186 }, { "entropy": 1.2662345170974731, "epoch": 2.204844655081622, "grad_norm": 0.29072144627571106, "learning_rate": 0.00016433074304526957, "loss": 0.19199174642562866, "mean_token_accuracy": 0.9260234832763672, "num_tokens": 51648776.0, "step": 4187 }, { "entropy": 1.232847660779953, "epoch": 2.2053712480252763, "grad_norm": 0.25679078698158264, "learning_rate": 0.00016431325953158096, "loss": 0.17870289087295532, "mean_token_accuracy": 0.9293755143880844, "num_tokens": 51661112.0, "step": 4188 }, { "entropy": 1.2633108794689178, "epoch": 2.205897840968931, "grad_norm": 0.266966849565506, "learning_rate": 0.00016429577279363067, "loss": 0.1845407336950302, "mean_token_accuracy": 0.9210513830184937, "num_tokens": 51673448.0, "step": 4189 }, { "entropy": 1.2357351183891296, "epoch": 2.2064244339125856, "grad_norm": 0.27318739891052246, "learning_rate": 0.0001642782828324568, "loss": 0.18381115794181824, "mean_token_accuracy": 0.926314502954483, "num_tokens": 51685784.0, "step": 4190 }, { "entropy": 1.2260805070400238, "epoch": 2.20695102685624, "grad_norm": 0.3009386360645294, "learning_rate": 0.00016426078964909766, "loss": 0.19563618302345276, "mean_token_accuracy": 0.9195328205823898, "num_tokens": 51698120.0, "step": 4191 }, { "entropy": 1.2364404797554016, "epoch": 2.207477619799895, "grad_norm": 0.29123032093048096, "learning_rate": 0.00016424329324459167, "loss": 0.1951371729373932, "mean_token_accuracy": 0.9174755364656448, "num_tokens": 51710456.0, "step": 4192 }, { "entropy": 1.2290646433830261, "epoch": 2.2080042127435493, "grad_norm": 0.27491459250450134, "learning_rate": 0.00016422579361997754, "loss": 0.18299022316932678, "mean_token_accuracy": 0.9223412722349167, "num_tokens": 51722792.0, "step": 4193 }, { "entropy": 1.1536138653755188, "epoch": 2.2085308056872037, "grad_norm": 0.2737578749656677, "learning_rate": 0.00016420829077629407, "loss": 0.18880535662174225, "mean_token_accuracy": 0.9208870977163315, "num_tokens": 51735128.0, "step": 4194 }, { "entropy": 1.1930584907531738, "epoch": 2.209057398630858, "grad_norm": 0.2856224775314331, "learning_rate": 0.00016419078471458033, "loss": 0.1827823668718338, "mean_token_accuracy": 0.9252646416425705, "num_tokens": 51747464.0, "step": 4195 }, { "entropy": 1.1551392376422882, "epoch": 2.209583991574513, "grad_norm": 0.29800665378570557, "learning_rate": 0.00016417327543587557, "loss": 0.19618409872055054, "mean_token_accuracy": 0.9184785932302475, "num_tokens": 51759800.0, "step": 4196 }, { "entropy": 1.1179493069648743, "epoch": 2.2101105845181674, "grad_norm": 0.36465853452682495, "learning_rate": 0.00016415576294121918, "loss": 0.1905837059020996, "mean_token_accuracy": 0.9215804487466812, "num_tokens": 51772136.0, "step": 4197 }, { "entropy": 1.1246863901615143, "epoch": 2.210637177461822, "grad_norm": 0.2792600691318512, "learning_rate": 0.0001641382472316508, "loss": 0.2024848610162735, "mean_token_accuracy": 0.9161612391471863, "num_tokens": 51784472.0, "step": 4198 }, { "entropy": 1.1439398527145386, "epoch": 2.2111637704054767, "grad_norm": 0.2936895787715912, "learning_rate": 0.0001641207283082102, "loss": 0.18412424623966217, "mean_token_accuracy": 0.9253138452768326, "num_tokens": 51796808.0, "step": 4199 }, { "entropy": 1.1501588225364685, "epoch": 2.211690363349131, "grad_norm": 0.2793161869049072, "learning_rate": 0.00016410320617193743, "loss": 0.192224383354187, "mean_token_accuracy": 0.924894392490387, "num_tokens": 51809144.0, "step": 4200 }, { "entropy": 1.1433355212211609, "epoch": 2.2122169562927856, "grad_norm": 0.28388532996177673, "learning_rate": 0.0001640856808238726, "loss": 0.181789368391037, "mean_token_accuracy": 0.9237640649080276, "num_tokens": 51821480.0, "step": 4201 }, { "entropy": 1.141024112701416, "epoch": 2.21274354923644, "grad_norm": 0.275046706199646, "learning_rate": 0.00016406815226505618, "loss": 0.1791418045759201, "mean_token_accuracy": 0.9245376735925674, "num_tokens": 51833816.0, "step": 4202 }, { "entropy": 1.1009389460086823, "epoch": 2.213270142180095, "grad_norm": 0.2538962960243225, "learning_rate": 0.00016405062049652867, "loss": 0.1699582189321518, "mean_token_accuracy": 0.9293850362300873, "num_tokens": 51846152.0, "step": 4203 }, { "entropy": 1.1123566925525665, "epoch": 2.2137967351237493, "grad_norm": 0.2865713834762573, "learning_rate": 0.00016403308551933085, "loss": 0.19568300247192383, "mean_token_accuracy": 0.9213463515043259, "num_tokens": 51858488.0, "step": 4204 }, { "entropy": 1.1162798702716827, "epoch": 2.2143233280674037, "grad_norm": 0.2596893906593323, "learning_rate": 0.0001640155473345037, "loss": 0.18270273506641388, "mean_token_accuracy": 0.9247992038726807, "num_tokens": 51870824.0, "step": 4205 }, { "entropy": 1.1294128894805908, "epoch": 2.2148499210110586, "grad_norm": 0.2684587240219116, "learning_rate": 0.0001639980059430883, "loss": 0.17550542950630188, "mean_token_accuracy": 0.9285458475351334, "num_tokens": 51883160.0, "step": 4206 }, { "entropy": 1.1598798334598541, "epoch": 2.215376513954713, "grad_norm": 0.2630522847175598, "learning_rate": 0.00016398046134612603, "loss": 0.1818559169769287, "mean_token_accuracy": 0.9171760529279709, "num_tokens": 51895496.0, "step": 4207 }, { "entropy": 1.1745121777057648, "epoch": 2.2159031068983674, "grad_norm": 0.2528412640094757, "learning_rate": 0.00016396291354465835, "loss": 0.1682814657688141, "mean_token_accuracy": 0.9309436827898026, "num_tokens": 51907832.0, "step": 4208 }, { "entropy": 1.127808690071106, "epoch": 2.2164296998420223, "grad_norm": 0.27972131967544556, "learning_rate": 0.0001639453625397271, "loss": 0.1828276664018631, "mean_token_accuracy": 0.9239791631698608, "num_tokens": 51920168.0, "step": 4209 }, { "entropy": 1.2046663463115692, "epoch": 2.2169562927856767, "grad_norm": 0.28617292642593384, "learning_rate": 0.000163927808332374, "loss": 0.1929018497467041, "mean_token_accuracy": 0.9188937544822693, "num_tokens": 51932504.0, "step": 4210 }, { "entropy": 1.2402802407741547, "epoch": 2.217482885729331, "grad_norm": 0.30822160840034485, "learning_rate": 0.0001639102509236413, "loss": 0.22689157724380493, "mean_token_accuracy": 0.9049774557352066, "num_tokens": 51944840.0, "step": 4211 }, { "entropy": 1.2726169526576996, "epoch": 2.2180094786729856, "grad_norm": 0.31506627798080444, "learning_rate": 0.00016389269031457117, "loss": 0.18111148476600647, "mean_token_accuracy": 0.922523245215416, "num_tokens": 51957176.0, "step": 4212 }, { "entropy": 1.2062140107154846, "epoch": 2.2185360716166405, "grad_norm": 0.2667774558067322, "learning_rate": 0.00016387512650620616, "loss": 0.18210844695568085, "mean_token_accuracy": 0.9245853424072266, "num_tokens": 51969512.0, "step": 4213 }, { "entropy": 1.289791852235794, "epoch": 2.219062664560295, "grad_norm": 0.3121054470539093, "learning_rate": 0.00016385755949958888, "loss": 0.22761571407318115, "mean_token_accuracy": 0.9057991802692413, "num_tokens": 51981848.0, "step": 4214 }, { "entropy": 1.2653508186340332, "epoch": 2.2195892575039493, "grad_norm": 0.27332237362861633, "learning_rate": 0.0001638399892957622, "loss": 0.19882501661777496, "mean_token_accuracy": 0.9142513871192932, "num_tokens": 51994184.0, "step": 4215 }, { "entropy": 1.275252342224121, "epoch": 2.220115850447604, "grad_norm": 0.2822205126285553, "learning_rate": 0.00016382241589576918, "loss": 0.19739031791687012, "mean_token_accuracy": 0.9224513620138168, "num_tokens": 52006520.0, "step": 4216 }, { "entropy": 1.3314436376094818, "epoch": 2.2206424433912586, "grad_norm": 0.2844606041908264, "learning_rate": 0.000163804839300653, "loss": 0.18049627542495728, "mean_token_accuracy": 0.9332050979137421, "num_tokens": 52018856.0, "step": 4217 }, { "entropy": 1.311014175415039, "epoch": 2.221169036334913, "grad_norm": 0.28489887714385986, "learning_rate": 0.00016378725951145712, "loss": 0.17989040911197662, "mean_token_accuracy": 0.9219749569892883, "num_tokens": 52031192.0, "step": 4218 }, { "entropy": 1.2845270931720734, "epoch": 2.2216956292785675, "grad_norm": 0.27442827820777893, "learning_rate": 0.00016376967652922513, "loss": 0.19630296528339386, "mean_token_accuracy": 0.9183860868215561, "num_tokens": 52043528.0, "step": 4219 }, { "entropy": 1.3556245565414429, "epoch": 2.2222222222222223, "grad_norm": 0.3226070702075958, "learning_rate": 0.00016375209035500088, "loss": 0.21448081731796265, "mean_token_accuracy": 0.912571057677269, "num_tokens": 52055864.0, "step": 4220 }, { "entropy": 1.3001513183116913, "epoch": 2.2227488151658767, "grad_norm": 0.27793556451797485, "learning_rate": 0.00016373450098982825, "loss": 0.1880507916212082, "mean_token_accuracy": 0.9209636598825455, "num_tokens": 52068200.0, "step": 4221 }, { "entropy": 1.3293032348155975, "epoch": 2.223275408109531, "grad_norm": 0.2972993552684784, "learning_rate": 0.00016371690843475153, "loss": 0.21140480041503906, "mean_token_accuracy": 0.9138139635324478, "num_tokens": 52080536.0, "step": 4222 }, { "entropy": 1.3074055314064026, "epoch": 2.223802001053186, "grad_norm": 0.3054673671722412, "learning_rate": 0.00016369931269081503, "loss": 0.2108297497034073, "mean_token_accuracy": 0.9098422229290009, "num_tokens": 52092872.0, "step": 4223 }, { "entropy": 1.3391023874282837, "epoch": 2.2243285939968405, "grad_norm": 0.3014651834964752, "learning_rate": 0.00016368171375906332, "loss": 0.17931891977787018, "mean_token_accuracy": 0.92972631752491, "num_tokens": 52105208.0, "step": 4224 }, { "entropy": 1.33422189950943, "epoch": 2.224855186940495, "grad_norm": 0.2674652636051178, "learning_rate": 0.00016366411164054113, "loss": 0.19167745113372803, "mean_token_accuracy": 0.9219842851161957, "num_tokens": 52117544.0, "step": 4225 }, { "entropy": 1.3092358112335205, "epoch": 2.2253817798841498, "grad_norm": 0.27045342326164246, "learning_rate": 0.00016364650633629343, "loss": 0.1807311475276947, "mean_token_accuracy": 0.9232537895441055, "num_tokens": 52129880.0, "step": 4226 }, { "entropy": 1.2968615889549255, "epoch": 2.225908372827804, "grad_norm": 0.2784993052482605, "learning_rate": 0.0001636288978473653, "loss": 0.1864447295665741, "mean_token_accuracy": 0.9230673313140869, "num_tokens": 52142216.0, "step": 4227 }, { "entropy": 1.329050749540329, "epoch": 2.2264349657714586, "grad_norm": 0.27790436148643494, "learning_rate": 0.00016361128617480212, "loss": 0.18269293010234833, "mean_token_accuracy": 0.9271285682916641, "num_tokens": 52154552.0, "step": 4228 }, { "entropy": 1.239962786436081, "epoch": 2.226961558715113, "grad_norm": 0.29057615995407104, "learning_rate": 0.0001635936713196493, "loss": 0.2014170140028, "mean_token_accuracy": 0.9164643883705139, "num_tokens": 52166888.0, "step": 4229 }, { "entropy": 1.3514109253883362, "epoch": 2.227488151658768, "grad_norm": 0.27092015743255615, "learning_rate": 0.00016357605328295262, "loss": 0.1870952844619751, "mean_token_accuracy": 0.9230411946773529, "num_tokens": 52179224.0, "step": 4230 }, { "entropy": 1.3073534667491913, "epoch": 2.2280147446024223, "grad_norm": 0.2956768870353699, "learning_rate": 0.00016355843206575794, "loss": 0.19634544849395752, "mean_token_accuracy": 0.9185549914836884, "num_tokens": 52191560.0, "step": 4231 }, { "entropy": 1.251263678073883, "epoch": 2.2285413375460768, "grad_norm": 0.309213787317276, "learning_rate": 0.00016354080766911127, "loss": 0.20773160457611084, "mean_token_accuracy": 0.9145363122224808, "num_tokens": 52203896.0, "step": 4232 }, { "entropy": 1.2692146599292755, "epoch": 2.2290679304897316, "grad_norm": 0.2713463008403778, "learning_rate": 0.00016352318009405891, "loss": 0.16297750174999237, "mean_token_accuracy": 0.9313487559556961, "num_tokens": 52216232.0, "step": 4233 }, { "entropy": 1.2983099818229675, "epoch": 2.229594523433386, "grad_norm": 0.4321221709251404, "learning_rate": 0.0001635055493416473, "loss": 0.18140633404254913, "mean_token_accuracy": 0.9271613657474518, "num_tokens": 52228568.0, "step": 4234 }, { "entropy": 1.2863817512989044, "epoch": 2.2301211163770405, "grad_norm": 0.2778743505477905, "learning_rate": 0.00016348791541292312, "loss": 0.1831590235233307, "mean_token_accuracy": 0.9236334264278412, "num_tokens": 52240904.0, "step": 4235 }, { "entropy": 1.188327044248581, "epoch": 2.230647709320695, "grad_norm": 0.27315250039100647, "learning_rate": 0.0001634702783089331, "loss": 0.17779839038848877, "mean_token_accuracy": 0.9250446408987045, "num_tokens": 52253240.0, "step": 4236 }, { "entropy": 1.262020230293274, "epoch": 2.2311743022643498, "grad_norm": 0.3055287003517151, "learning_rate": 0.00016345263803072433, "loss": 0.20651106536388397, "mean_token_accuracy": 0.9169783294200897, "num_tokens": 52265576.0, "step": 4237 }, { "entropy": 1.3503897488117218, "epoch": 2.231700895208004, "grad_norm": 0.29245615005493164, "learning_rate": 0.000163434994579344, "loss": 0.19317273795604706, "mean_token_accuracy": 0.9234201461076736, "num_tokens": 52277912.0, "step": 4238 }, { "entropy": 1.2586136758327484, "epoch": 2.2322274881516586, "grad_norm": 0.2817426025867462, "learning_rate": 0.00016341734795583947, "loss": 0.2006417214870453, "mean_token_accuracy": 0.9167672246694565, "num_tokens": 52290248.0, "step": 4239 }, { "entropy": 1.2308941781520844, "epoch": 2.2327540810953135, "grad_norm": 0.3034634590148926, "learning_rate": 0.00016339969816125832, "loss": 0.19974562525749207, "mean_token_accuracy": 0.9195841699838638, "num_tokens": 52302584.0, "step": 4240 }, { "entropy": 1.305918425321579, "epoch": 2.233280674038968, "grad_norm": 0.2764703035354614, "learning_rate": 0.00016338204519664835, "loss": 0.19095191359519958, "mean_token_accuracy": 0.922985702753067, "num_tokens": 52314920.0, "step": 4241 }, { "entropy": 1.2824455499649048, "epoch": 2.2338072669826223, "grad_norm": 0.25803378224372864, "learning_rate": 0.00016336438906305748, "loss": 0.18053492903709412, "mean_token_accuracy": 0.9281091690063477, "num_tokens": 52327256.0, "step": 4242 }, { "entropy": 1.3713833093643188, "epoch": 2.234333859926277, "grad_norm": 0.26806026697158813, "learning_rate": 0.00016334672976153384, "loss": 0.1849786639213562, "mean_token_accuracy": 0.929167240858078, "num_tokens": 52339592.0, "step": 4243 }, { "entropy": 1.3161489963531494, "epoch": 2.2348604528699316, "grad_norm": 0.25630515813827515, "learning_rate": 0.0001633290672931258, "loss": 0.17108337581157684, "mean_token_accuracy": 0.9340009987354279, "num_tokens": 52351928.0, "step": 4244 }, { "entropy": 1.3286859691143036, "epoch": 2.235387045813586, "grad_norm": 0.29029756784439087, "learning_rate": 0.0001633114016588819, "loss": 0.20633910596370697, "mean_token_accuracy": 0.909833550453186, "num_tokens": 52364264.0, "step": 4245 }, { "entropy": 1.329633116722107, "epoch": 2.2359136387572405, "grad_norm": 0.2533878684043884, "learning_rate": 0.00016329373285985078, "loss": 0.19495350122451782, "mean_token_accuracy": 0.9151149392127991, "num_tokens": 52376600.0, "step": 4246 }, { "entropy": 1.3563131988048553, "epoch": 2.2364402317008953, "grad_norm": 0.26852771639823914, "learning_rate": 0.0001632760608970813, "loss": 0.18576224148273468, "mean_token_accuracy": 0.9227636158466339, "num_tokens": 52388936.0, "step": 4247 }, { "entropy": 1.358976662158966, "epoch": 2.2369668246445498, "grad_norm": 0.2841165065765381, "learning_rate": 0.00016325838577162266, "loss": 0.2020607888698578, "mean_token_accuracy": 0.917872816324234, "num_tokens": 52401272.0, "step": 4248 }, { "entropy": 1.4256496131420135, "epoch": 2.237493417588204, "grad_norm": 0.2953294515609741, "learning_rate": 0.00016324070748452408, "loss": 0.20347987115383148, "mean_token_accuracy": 0.9172584414482117, "num_tokens": 52413608.0, "step": 4249 }, { "entropy": 1.382269710302353, "epoch": 2.238020010531859, "grad_norm": 0.2767752707004547, "learning_rate": 0.000163223026036835, "loss": 0.19072210788726807, "mean_token_accuracy": 0.9170867800712585, "num_tokens": 52425944.0, "step": 4250 }, { "entropy": 1.3237777650356293, "epoch": 2.2385466034755135, "grad_norm": 0.26159167289733887, "learning_rate": 0.00016320534142960503, "loss": 0.1843932569026947, "mean_token_accuracy": 0.921222910284996, "num_tokens": 52438280.0, "step": 4251 }, { "entropy": 1.3900092542171478, "epoch": 2.239073196419168, "grad_norm": 0.29133832454681396, "learning_rate": 0.0001631876536638841, "loss": 0.18629711866378784, "mean_token_accuracy": 0.927318811416626, "num_tokens": 52450616.0, "step": 4252 }, { "entropy": 1.3216579258441925, "epoch": 2.2395997893628223, "grad_norm": 0.28946828842163086, "learning_rate": 0.00016316996274072217, "loss": 0.19785767793655396, "mean_token_accuracy": 0.9227815121412277, "num_tokens": 52462952.0, "step": 4253 }, { "entropy": 1.3586134910583496, "epoch": 2.240126382306477, "grad_norm": 0.27580100297927856, "learning_rate": 0.00016315226866116941, "loss": 0.195715993642807, "mean_token_accuracy": 0.9197490960359573, "num_tokens": 52475288.0, "step": 4254 }, { "entropy": 1.3740904033184052, "epoch": 2.2406529752501316, "grad_norm": 0.28149449825286865, "learning_rate": 0.00016313457142627628, "loss": 0.1904170960187912, "mean_token_accuracy": 0.9227342903614044, "num_tokens": 52487624.0, "step": 4255 }, { "entropy": 1.3365713357925415, "epoch": 2.241179568193786, "grad_norm": 0.2665024697780609, "learning_rate": 0.00016311687103709333, "loss": 0.1871342957019806, "mean_token_accuracy": 0.9221449494361877, "num_tokens": 52499960.0, "step": 4256 }, { "entropy": 1.3210458755493164, "epoch": 2.241706161137441, "grad_norm": 0.29255783557891846, "learning_rate": 0.0001630991674946713, "loss": 0.20028424263000488, "mean_token_accuracy": 0.9167197197675705, "num_tokens": 52512296.0, "step": 4257 }, { "entropy": 1.3026900589466095, "epoch": 2.2422327540810953, "grad_norm": 0.2644364833831787, "learning_rate": 0.00016308146080006123, "loss": 0.18610155582427979, "mean_token_accuracy": 0.9260168969631195, "num_tokens": 52524632.0, "step": 4258 }, { "entropy": 1.334023267030716, "epoch": 2.2427593470247498, "grad_norm": 0.29489240050315857, "learning_rate": 0.00016306375095431422, "loss": 0.19872379302978516, "mean_token_accuracy": 0.9185984432697296, "num_tokens": 52536968.0, "step": 4259 }, { "entropy": 1.3495826721191406, "epoch": 2.2432859399684046, "grad_norm": 0.2851937413215637, "learning_rate": 0.00016304603795848157, "loss": 0.19495224952697754, "mean_token_accuracy": 0.9217026382684708, "num_tokens": 52549304.0, "step": 4260 }, { "entropy": 1.305820494890213, "epoch": 2.243812532912059, "grad_norm": 0.28069403767585754, "learning_rate": 0.0001630283218136148, "loss": 0.19976091384887695, "mean_token_accuracy": 0.9190419614315033, "num_tokens": 52561640.0, "step": 4261 }, { "entropy": 1.33967986702919, "epoch": 2.2443391258557135, "grad_norm": 0.3040577471256256, "learning_rate": 0.00016301060252076567, "loss": 0.207487553358078, "mean_token_accuracy": 0.916191965341568, "num_tokens": 52573976.0, "step": 4262 }, { "entropy": 1.29051473736763, "epoch": 2.244865718799368, "grad_norm": 0.27407845854759216, "learning_rate": 0.00016299288008098605, "loss": 0.19776585698127747, "mean_token_accuracy": 0.9183499664068222, "num_tokens": 52586312.0, "step": 4263 }, { "entropy": 1.3070797622203827, "epoch": 2.245392311743023, "grad_norm": 0.27223050594329834, "learning_rate": 0.00016297515449532795, "loss": 0.18903937935829163, "mean_token_accuracy": 0.9230516403913498, "num_tokens": 52598648.0, "step": 4264 }, { "entropy": 1.2732833623886108, "epoch": 2.245918904686677, "grad_norm": 0.25695350766181946, "learning_rate": 0.00016295742576484377, "loss": 0.16693276166915894, "mean_token_accuracy": 0.9326575249433517, "num_tokens": 52610984.0, "step": 4265 }, { "entropy": 1.3194738030433655, "epoch": 2.2464454976303316, "grad_norm": 0.25403544306755066, "learning_rate": 0.0001629396938905858, "loss": 0.16951501369476318, "mean_token_accuracy": 0.9296520501375198, "num_tokens": 52623320.0, "step": 4266 }, { "entropy": 1.315958708524704, "epoch": 2.2469720905739865, "grad_norm": 0.3142984211444855, "learning_rate": 0.00016292195887360683, "loss": 0.21278263628482819, "mean_token_accuracy": 0.9144498258829117, "num_tokens": 52635656.0, "step": 4267 }, { "entropy": 1.3089948296546936, "epoch": 2.247498683517641, "grad_norm": 0.31691795587539673, "learning_rate": 0.00016290422071495958, "loss": 0.2112875133752823, "mean_token_accuracy": 0.9154753535985947, "num_tokens": 52647992.0, "step": 4268 }, { "entropy": 1.3680811524391174, "epoch": 2.2480252764612954, "grad_norm": 0.31187358498573303, "learning_rate": 0.0001628864794156971, "loss": 0.21332678198814392, "mean_token_accuracy": 0.9160029590129852, "num_tokens": 52660328.0, "step": 4269 }, { "entropy": 1.262885570526123, "epoch": 2.2485518694049498, "grad_norm": 0.2790033519268036, "learning_rate": 0.0001628687349768726, "loss": 0.18170538544654846, "mean_token_accuracy": 0.931568443775177, "num_tokens": 52672664.0, "step": 4270 }, { "entropy": 1.265404999256134, "epoch": 2.2490784623486046, "grad_norm": 0.25181683897972107, "learning_rate": 0.00016285098739953938, "loss": 0.17339858412742615, "mean_token_accuracy": 0.9286882877349854, "num_tokens": 52685000.0, "step": 4271 }, { "entropy": 1.3293351829051971, "epoch": 2.249605055292259, "grad_norm": 0.2925328314304352, "learning_rate": 0.00016283323668475115, "loss": 0.19423630833625793, "mean_token_accuracy": 0.9217019081115723, "num_tokens": 52697336.0, "step": 4272 }, { "entropy": 1.3089188933372498, "epoch": 2.2501316482359135, "grad_norm": 0.31548264622688293, "learning_rate": 0.00016281548283356156, "loss": 0.18943582475185394, "mean_token_accuracy": 0.9233786463737488, "num_tokens": 52709672.0, "step": 4273 }, { "entropy": 1.2492122054100037, "epoch": 2.2506582411795684, "grad_norm": 0.27606451511383057, "learning_rate": 0.0001627977258470246, "loss": 0.18954810500144958, "mean_token_accuracy": 0.9246101230382919, "num_tokens": 52722008.0, "step": 4274 }, { "entropy": 1.2629761397838593, "epoch": 2.251184834123223, "grad_norm": 0.28441867232322693, "learning_rate": 0.00016277996572619437, "loss": 0.19405168294906616, "mean_token_accuracy": 0.923010841012001, "num_tokens": 52734344.0, "step": 4275 }, { "entropy": 1.2314798533916473, "epoch": 2.251711427066877, "grad_norm": 0.2783687710762024, "learning_rate": 0.00016276220247212522, "loss": 0.18629150092601776, "mean_token_accuracy": 0.923210546374321, "num_tokens": 52746680.0, "step": 4276 }, { "entropy": 1.2616170942783356, "epoch": 2.252238020010532, "grad_norm": 0.27606093883514404, "learning_rate": 0.0001627444360858716, "loss": 0.170989528298378, "mean_token_accuracy": 0.9309239387512207, "num_tokens": 52759016.0, "step": 4277 }, { "entropy": 1.197077065706253, "epoch": 2.2527646129541865, "grad_norm": 0.2800334692001343, "learning_rate": 0.00016272666656848826, "loss": 0.2011934369802475, "mean_token_accuracy": 0.9129274040460587, "num_tokens": 52771352.0, "step": 4278 }, { "entropy": 1.2784244120121002, "epoch": 2.253291205897841, "grad_norm": 0.308682382106781, "learning_rate": 0.00016270889392103001, "loss": 0.20107175409793854, "mean_token_accuracy": 0.919810488820076, "num_tokens": 52783688.0, "step": 4279 }, { "entropy": 1.2287653982639313, "epoch": 2.2538177988414954, "grad_norm": 0.28182491660118103, "learning_rate": 0.00016269111814455197, "loss": 0.18231971561908722, "mean_token_accuracy": 0.923517182469368, "num_tokens": 52796024.0, "step": 4280 }, { "entropy": 1.2548049986362457, "epoch": 2.2543443917851502, "grad_norm": 0.3218842148780823, "learning_rate": 0.00016267333924010934, "loss": 0.207222118973732, "mean_token_accuracy": 0.9176555424928665, "num_tokens": 52808360.0, "step": 4281 }, { "entropy": 1.2320858240127563, "epoch": 2.2548709847288047, "grad_norm": 0.3021528124809265, "learning_rate": 0.00016265555720875756, "loss": 0.19539406895637512, "mean_token_accuracy": 0.9212926179170609, "num_tokens": 52820696.0, "step": 4282 }, { "entropy": 1.2006807029247284, "epoch": 2.255397577672459, "grad_norm": 0.25874409079551697, "learning_rate": 0.00016263777205155223, "loss": 0.17395153641700745, "mean_token_accuracy": 0.9307205528020859, "num_tokens": 52833032.0, "step": 4283 }, { "entropy": 1.2096614241600037, "epoch": 2.2559241706161135, "grad_norm": 0.28012752532958984, "learning_rate": 0.00016261998376954922, "loss": 0.19147738814353943, "mean_token_accuracy": 0.9207902103662491, "num_tokens": 52845368.0, "step": 4284 }, { "entropy": 1.1712572574615479, "epoch": 2.2564507635597684, "grad_norm": 0.2657926082611084, "learning_rate": 0.0001626021923638044, "loss": 0.1850869357585907, "mean_token_accuracy": 0.9235047101974487, "num_tokens": 52857704.0, "step": 4285 }, { "entropy": 1.2101311385631561, "epoch": 2.256977356503423, "grad_norm": 0.2975207269191742, "learning_rate": 0.00016258439783537406, "loss": 0.20111596584320068, "mean_token_accuracy": 0.919817328453064, "num_tokens": 52870040.0, "step": 4286 }, { "entropy": 1.1905730962753296, "epoch": 2.257503949447077, "grad_norm": 0.2743525505065918, "learning_rate": 0.0001625666001853145, "loss": 0.1912555694580078, "mean_token_accuracy": 0.9214645624160767, "num_tokens": 52882376.0, "step": 4287 }, { "entropy": 1.1946870684623718, "epoch": 2.258030542390732, "grad_norm": 0.29676419496536255, "learning_rate": 0.00016254879941468223, "loss": 0.2016541063785553, "mean_token_accuracy": 0.9167199581861496, "num_tokens": 52894712.0, "step": 4288 }, { "entropy": 1.2338870167732239, "epoch": 2.2585571353343865, "grad_norm": 0.28669846057891846, "learning_rate": 0.00016253099552453407, "loss": 0.18671299517154694, "mean_token_accuracy": 0.9237444400787354, "num_tokens": 52907048.0, "step": 4289 }, { "entropy": 1.2231320142745972, "epoch": 2.259083728278041, "grad_norm": 0.29122886061668396, "learning_rate": 0.00016251318851592686, "loss": 0.19480589032173157, "mean_token_accuracy": 0.9223777800798416, "num_tokens": 52919384.0, "step": 4290 }, { "entropy": 1.2313807010650635, "epoch": 2.259610321221696, "grad_norm": 0.2886621057987213, "learning_rate": 0.0001624953783899177, "loss": 0.20268778502941132, "mean_token_accuracy": 0.9181878566741943, "num_tokens": 52931720.0, "step": 4291 }, { "entropy": 1.2376523911952972, "epoch": 2.2601369141653502, "grad_norm": 0.26574602723121643, "learning_rate": 0.0001624775651475639, "loss": 0.1816636472940445, "mean_token_accuracy": 0.9279394000768661, "num_tokens": 52944056.0, "step": 4292 }, { "entropy": 1.2119337618350983, "epoch": 2.2606635071090047, "grad_norm": 0.27368560433387756, "learning_rate": 0.0001624597487899229, "loss": 0.18821629881858826, "mean_token_accuracy": 0.9214064329862595, "num_tokens": 52956392.0, "step": 4293 }, { "entropy": 1.2653162479400635, "epoch": 2.2611901000526595, "grad_norm": 0.2919362187385559, "learning_rate": 0.0001624419293180524, "loss": 0.20762929320335388, "mean_token_accuracy": 0.912530779838562, "num_tokens": 52968728.0, "step": 4294 }, { "entropy": 1.273656576871872, "epoch": 2.261716692996314, "grad_norm": 0.2898019552230835, "learning_rate": 0.00016242410673301022, "loss": 0.1861550211906433, "mean_token_accuracy": 0.9242700487375259, "num_tokens": 52981064.0, "step": 4295 }, { "entropy": 1.2827538847923279, "epoch": 2.2622432859399684, "grad_norm": 0.2659165859222412, "learning_rate": 0.00016240628103585437, "loss": 0.19199910759925842, "mean_token_accuracy": 0.920208215713501, "num_tokens": 52993400.0, "step": 4296 }, { "entropy": 1.3939678966999054, "epoch": 2.262769878883623, "grad_norm": 0.2849959135055542, "learning_rate": 0.00016238845222764302, "loss": 0.17641255259513855, "mean_token_accuracy": 0.9284879267215729, "num_tokens": 53005736.0, "step": 4297 }, { "entropy": 1.3991989195346832, "epoch": 2.2632964718272777, "grad_norm": 0.2852117419242859, "learning_rate": 0.00016237062030943466, "loss": 0.19910377264022827, "mean_token_accuracy": 0.9214527308940887, "num_tokens": 53018072.0, "step": 4298 }, { "entropy": 1.3499420583248138, "epoch": 2.263823064770932, "grad_norm": 0.29614681005477905, "learning_rate": 0.00016235278528228778, "loss": 0.22492265701293945, "mean_token_accuracy": 0.9076694399118423, "num_tokens": 53030408.0, "step": 4299 }, { "entropy": 1.3215619325637817, "epoch": 2.2643496577145865, "grad_norm": 0.30598577857017517, "learning_rate": 0.00016233494714726118, "loss": 0.19633576273918152, "mean_token_accuracy": 0.9187863171100616, "num_tokens": 53042744.0, "step": 4300 }, { "entropy": 1.3638521432876587, "epoch": 2.264876250658241, "grad_norm": 0.2770838737487793, "learning_rate": 0.00016231710590541382, "loss": 0.18263986706733704, "mean_token_accuracy": 0.9262545853853226, "num_tokens": 53055080.0, "step": 4301 }, { "entropy": 1.319113403558731, "epoch": 2.265402843601896, "grad_norm": 0.28063175082206726, "learning_rate": 0.0001622992615578048, "loss": 0.200247123837471, "mean_token_accuracy": 0.917742520570755, "num_tokens": 53067416.0, "step": 4302 }, { "entropy": 1.2884471416473389, "epoch": 2.2659294365455502, "grad_norm": 0.2803884446620941, "learning_rate": 0.0001622814141054934, "loss": 0.19679561257362366, "mean_token_accuracy": 0.9207372665405273, "num_tokens": 53079752.0, "step": 4303 }, { "entropy": 1.3329062163829803, "epoch": 2.2664560294892047, "grad_norm": 0.2911641299724579, "learning_rate": 0.00016226356354953923, "loss": 0.19328062236309052, "mean_token_accuracy": 0.9168116897344589, "num_tokens": 53092088.0, "step": 4304 }, { "entropy": 1.3833136558532715, "epoch": 2.2669826224328595, "grad_norm": 0.33080819249153137, "learning_rate": 0.00016224570989100185, "loss": 0.19918012619018555, "mean_token_accuracy": 0.9184055626392365, "num_tokens": 53104424.0, "step": 4305 }, { "entropy": 1.3158639967441559, "epoch": 2.267509215376514, "grad_norm": 0.26879438757896423, "learning_rate": 0.0001622278531309412, "loss": 0.18872933089733124, "mean_token_accuracy": 0.9242192357778549, "num_tokens": 53116760.0, "step": 4306 }, { "entropy": 1.388542801141739, "epoch": 2.2680358083201684, "grad_norm": 0.3074987530708313, "learning_rate": 0.00016220999327041735, "loss": 0.2129671573638916, "mean_token_accuracy": 0.9109326601028442, "num_tokens": 53129096.0, "step": 4307 }, { "entropy": 1.3813231885433197, "epoch": 2.2685624012638232, "grad_norm": 0.2779155373573303, "learning_rate": 0.00016219213031049047, "loss": 0.18388351798057556, "mean_token_accuracy": 0.924717515707016, "num_tokens": 53141432.0, "step": 4308 }, { "entropy": 1.3881699442863464, "epoch": 2.2690889942074777, "grad_norm": 0.27398285269737244, "learning_rate": 0.00016217426425222103, "loss": 0.19520778954029083, "mean_token_accuracy": 0.925410807132721, "num_tokens": 53153768.0, "step": 4309 }, { "entropy": 1.3659266531467438, "epoch": 2.269615587151132, "grad_norm": 0.27490484714508057, "learning_rate": 0.00016215639509666957, "loss": 0.17789322137832642, "mean_token_accuracy": 0.9270453304052353, "num_tokens": 53166104.0, "step": 4310 }, { "entropy": 1.3776750266551971, "epoch": 2.270142180094787, "grad_norm": 0.3111220598220825, "learning_rate": 0.000162138522844897, "loss": 0.1980695277452469, "mean_token_accuracy": 0.9179234504699707, "num_tokens": 53178440.0, "step": 4311 }, { "entropy": 1.3968066573143005, "epoch": 2.2706687730384414, "grad_norm": 0.30460214614868164, "learning_rate": 0.00016212064749796418, "loss": 0.20272967219352722, "mean_token_accuracy": 0.9162765592336655, "num_tokens": 53190776.0, "step": 4312 }, { "entropy": 1.3836086690425873, "epoch": 2.271195365982096, "grad_norm": 0.2826038897037506, "learning_rate": 0.00016210276905693227, "loss": 0.19780540466308594, "mean_token_accuracy": 0.9176635593175888, "num_tokens": 53203112.0, "step": 4313 }, { "entropy": 1.39346045255661, "epoch": 2.2717219589257502, "grad_norm": 0.3027603030204773, "learning_rate": 0.00016208488752286269, "loss": 0.21689122915267944, "mean_token_accuracy": 0.90862837433815, "num_tokens": 53215448.0, "step": 4314 }, { "entropy": 1.3023641109466553, "epoch": 2.272248551869405, "grad_norm": 0.2757156491279602, "learning_rate": 0.00016206700289681688, "loss": 0.18307238817214966, "mean_token_accuracy": 0.9282919764518738, "num_tokens": 53227784.0, "step": 4315 }, { "entropy": 1.35664564371109, "epoch": 2.2727751448130595, "grad_norm": 0.28664660453796387, "learning_rate": 0.00016204911517985659, "loss": 0.19184020161628723, "mean_token_accuracy": 0.920403391122818, "num_tokens": 53240120.0, "step": 4316 }, { "entropy": 1.3529805839061737, "epoch": 2.273301737756714, "grad_norm": 0.28960809111595154, "learning_rate": 0.0001620312243730437, "loss": 0.18796728551387787, "mean_token_accuracy": 0.9186430126428604, "num_tokens": 53252456.0, "step": 4317 }, { "entropy": 1.2922759354114532, "epoch": 2.2738283307003684, "grad_norm": 0.2737516760826111, "learning_rate": 0.00016201333047744025, "loss": 0.17952796816825867, "mean_token_accuracy": 0.9263361543416977, "num_tokens": 53264792.0, "step": 4318 }, { "entropy": 1.2446196675300598, "epoch": 2.2743549236440233, "grad_norm": 0.2577621042728424, "learning_rate": 0.00016199543349410854, "loss": 0.18877744674682617, "mean_token_accuracy": 0.92601378262043, "num_tokens": 53277128.0, "step": 4319 }, { "entropy": 1.2977658212184906, "epoch": 2.2748815165876777, "grad_norm": 0.27885574102401733, "learning_rate": 0.000161977533424111, "loss": 0.1956649273633957, "mean_token_accuracy": 0.9176055639982224, "num_tokens": 53289464.0, "step": 4320 }, { "entropy": 1.312001883983612, "epoch": 2.275408109531332, "grad_norm": 0.2542676031589508, "learning_rate": 0.00016195963026851027, "loss": 0.16451983153820038, "mean_token_accuracy": 0.9343025386333466, "num_tokens": 53301800.0, "step": 4321 }, { "entropy": 1.3300804793834686, "epoch": 2.275934702474987, "grad_norm": 0.2855078876018524, "learning_rate": 0.0001619417240283691, "loss": 0.18589822947978973, "mean_token_accuracy": 0.9211694002151489, "num_tokens": 53314136.0, "step": 4322 }, { "entropy": 1.3246194124221802, "epoch": 2.2764612954186414, "grad_norm": 0.2893201410770416, "learning_rate": 0.00016192381470475054, "loss": 0.18851175904273987, "mean_token_accuracy": 0.9267619699239731, "num_tokens": 53326472.0, "step": 4323 }, { "entropy": 1.2888253331184387, "epoch": 2.276987888362296, "grad_norm": 0.2698841989040375, "learning_rate": 0.00016190590229871773, "loss": 0.19300393760204315, "mean_token_accuracy": 0.9214081466197968, "num_tokens": 53338808.0, "step": 4324 }, { "entropy": 1.285881131887436, "epoch": 2.2775144813059507, "grad_norm": 0.27817195653915405, "learning_rate": 0.00016188798681133403, "loss": 0.1776391863822937, "mean_token_accuracy": 0.9255973249673843, "num_tokens": 53351144.0, "step": 4325 }, { "entropy": 1.330023616552353, "epoch": 2.278041074249605, "grad_norm": 0.2973087728023529, "learning_rate": 0.00016187006824366297, "loss": 0.21736116707324982, "mean_token_accuracy": 0.9165065437555313, "num_tokens": 53363480.0, "step": 4326 }, { "entropy": 1.3090458810329437, "epoch": 2.2785676671932595, "grad_norm": 0.2864411473274231, "learning_rate": 0.00016185214659676832, "loss": 0.18242886662483215, "mean_token_accuracy": 0.9262679815292358, "num_tokens": 53375816.0, "step": 4327 }, { "entropy": 1.3205254673957825, "epoch": 2.2790942601369144, "grad_norm": 0.2983349859714508, "learning_rate": 0.0001618342218717139, "loss": 0.18693310022354126, "mean_token_accuracy": 0.9253579378128052, "num_tokens": 53388152.0, "step": 4328 }, { "entropy": 1.3446447551250458, "epoch": 2.279620853080569, "grad_norm": 0.28103673458099365, "learning_rate": 0.00016181629406956385, "loss": 0.19234877824783325, "mean_token_accuracy": 0.9203990995883942, "num_tokens": 53400488.0, "step": 4329 }, { "entropy": 1.3458137810230255, "epoch": 2.2801474460242233, "grad_norm": 0.30117067694664, "learning_rate": 0.00016179836319138243, "loss": 0.19072972238063812, "mean_token_accuracy": 0.9225273281335831, "num_tokens": 53412824.0, "step": 4330 }, { "entropy": 1.3791090846061707, "epoch": 2.2806740389678777, "grad_norm": 0.3069910705089569, "learning_rate": 0.00016178042923823405, "loss": 0.20394977927207947, "mean_token_accuracy": 0.9209769368171692, "num_tokens": 53425160.0, "step": 4331 }, { "entropy": 1.3324054777622223, "epoch": 2.2812006319115326, "grad_norm": 0.25391244888305664, "learning_rate": 0.00016176249221118346, "loss": 0.1717671900987625, "mean_token_accuracy": 0.9276586025953293, "num_tokens": 53437496.0, "step": 4332 }, { "entropy": 1.3155920505523682, "epoch": 2.281727224855187, "grad_norm": 0.2734282314777374, "learning_rate": 0.00016174455211129536, "loss": 0.18031081557273865, "mean_token_accuracy": 0.9291572421789169, "num_tokens": 53449832.0, "step": 4333 }, { "entropy": 1.349910020828247, "epoch": 2.2822538177988414, "grad_norm": 0.2482135146856308, "learning_rate": 0.0001617266089396348, "loss": 0.1759587526321411, "mean_token_accuracy": 0.9239980727434158, "num_tokens": 53462168.0, "step": 4334 }, { "entropy": 1.378309428691864, "epoch": 2.282780410742496, "grad_norm": 0.27560997009277344, "learning_rate": 0.00016170866269726695, "loss": 0.19269959628582, "mean_token_accuracy": 0.9190654456615448, "num_tokens": 53474504.0, "step": 4335 }, { "entropy": 1.3972489535808563, "epoch": 2.2833070036861507, "grad_norm": 0.27502357959747314, "learning_rate": 0.00016169071338525718, "loss": 0.19034190475940704, "mean_token_accuracy": 0.9181709289550781, "num_tokens": 53486840.0, "step": 4336 }, { "entropy": 1.3337211310863495, "epoch": 2.283833596629805, "grad_norm": 0.2534601092338562, "learning_rate": 0.00016167276100467103, "loss": 0.17808862030506134, "mean_token_accuracy": 0.9231080412864685, "num_tokens": 53499176.0, "step": 4337 }, { "entropy": 1.4127607941627502, "epoch": 2.2843601895734595, "grad_norm": 0.3043602406978607, "learning_rate": 0.00016165480555657425, "loss": 0.21522895991802216, "mean_token_accuracy": 0.9097288846969604, "num_tokens": 53511512.0, "step": 4338 }, { "entropy": 1.316486895084381, "epoch": 2.2848867825171144, "grad_norm": 0.2641633152961731, "learning_rate": 0.0001616368470420327, "loss": 0.18304666876792908, "mean_token_accuracy": 0.9187512695789337, "num_tokens": 53523848.0, "step": 4339 }, { "entropy": 1.3706423938274384, "epoch": 2.285413375460769, "grad_norm": 0.2619921565055847, "learning_rate": 0.00016161888546211252, "loss": 0.20312339067459106, "mean_token_accuracy": 0.913113921880722, "num_tokens": 53536184.0, "step": 4340 }, { "entropy": 1.2946105301380157, "epoch": 2.2859399684044233, "grad_norm": 0.2881142497062683, "learning_rate": 0.00016160092081787995, "loss": 0.1995781809091568, "mean_token_accuracy": 0.9192468374967575, "num_tokens": 53548520.0, "step": 4341 }, { "entropy": 1.41688871383667, "epoch": 2.286466561348078, "grad_norm": 0.2905746102333069, "learning_rate": 0.0001615829531104015, "loss": 0.21028542518615723, "mean_token_accuracy": 0.9094423651695251, "num_tokens": 53560856.0, "step": 4342 }, { "entropy": 1.2906908690929413, "epoch": 2.2869931542917326, "grad_norm": 0.24352654814720154, "learning_rate": 0.00016156498234074374, "loss": 0.1764492690563202, "mean_token_accuracy": 0.9228947311639786, "num_tokens": 53573192.0, "step": 4343 }, { "entropy": 1.33392733335495, "epoch": 2.287519747235387, "grad_norm": 0.26100727915763855, "learning_rate": 0.00016154700850997355, "loss": 0.19272339344024658, "mean_token_accuracy": 0.9170558750629425, "num_tokens": 53585528.0, "step": 4344 }, { "entropy": 1.2810238003730774, "epoch": 2.288046340179042, "grad_norm": 0.2741535007953644, "learning_rate": 0.00016152903161915789, "loss": 0.1874852180480957, "mean_token_accuracy": 0.9228169918060303, "num_tokens": 53597864.0, "step": 4345 }, { "entropy": 1.2848420143127441, "epoch": 2.2885729331226963, "grad_norm": 0.2634083926677704, "learning_rate": 0.00016151105166936394, "loss": 0.19013947248458862, "mean_token_accuracy": 0.9219299107789993, "num_tokens": 53610200.0, "step": 4346 }, { "entropy": 1.2308179140090942, "epoch": 2.2890995260663507, "grad_norm": 0.28782540559768677, "learning_rate": 0.0001614930686616591, "loss": 0.19066664576530457, "mean_token_accuracy": 0.9219117313623428, "num_tokens": 53622536.0, "step": 4347 }, { "entropy": 1.2573314607143402, "epoch": 2.289626119010005, "grad_norm": 0.2767718434333801, "learning_rate": 0.00016147508259711088, "loss": 0.18270361423492432, "mean_token_accuracy": 0.9219647794961929, "num_tokens": 53634872.0, "step": 4348 }, { "entropy": 1.299607902765274, "epoch": 2.29015271195366, "grad_norm": 0.2846214175224304, "learning_rate": 0.00016145709347678707, "loss": 0.19855788350105286, "mean_token_accuracy": 0.9172389805316925, "num_tokens": 53647208.0, "step": 4349 }, { "entropy": 1.2599292993545532, "epoch": 2.2906793048973144, "grad_norm": 0.2899573743343353, "learning_rate": 0.0001614391013017555, "loss": 0.19316795468330383, "mean_token_accuracy": 0.9196108430624008, "num_tokens": 53659544.0, "step": 4350 }, { "entropy": 1.2123220264911652, "epoch": 2.291205897840969, "grad_norm": 0.272175669670105, "learning_rate": 0.0001614211060730843, "loss": 0.19963154196739197, "mean_token_accuracy": 0.9213588237762451, "num_tokens": 53671880.0, "step": 4351 }, { "entropy": 1.2599426805973053, "epoch": 2.2917324907846233, "grad_norm": 0.2871687114238739, "learning_rate": 0.0001614031077918417, "loss": 0.1960330456495285, "mean_token_accuracy": 0.9175105392932892, "num_tokens": 53684216.0, "step": 4352 }, { "entropy": 1.2873346507549286, "epoch": 2.292259083728278, "grad_norm": 0.2764008343219757, "learning_rate": 0.00016138510645909626, "loss": 0.1853741705417633, "mean_token_accuracy": 0.9236430674791336, "num_tokens": 53696552.0, "step": 4353 }, { "entropy": 1.2654350399971008, "epoch": 2.2927856766719326, "grad_norm": 0.3239395320415497, "learning_rate": 0.00016136710207591653, "loss": 0.18854394555091858, "mean_token_accuracy": 0.926001563668251, "num_tokens": 53708888.0, "step": 4354 }, { "entropy": 1.2028826177120209, "epoch": 2.293312269615587, "grad_norm": 0.2788753807544708, "learning_rate": 0.0001613490946433713, "loss": 0.19624781608581543, "mean_token_accuracy": 0.9118239730596542, "num_tokens": 53721224.0, "step": 4355 }, { "entropy": 1.2995253801345825, "epoch": 2.293838862559242, "grad_norm": 0.2672927975654602, "learning_rate": 0.0001613310841625296, "loss": 0.1733776032924652, "mean_token_accuracy": 0.9293322563171387, "num_tokens": 53733560.0, "step": 4356 }, { "entropy": 1.2344202101230621, "epoch": 2.2943654555028963, "grad_norm": 0.2676299512386322, "learning_rate": 0.0001613130706344607, "loss": 0.18073591589927673, "mean_token_accuracy": 0.9267222881317139, "num_tokens": 53745896.0, "step": 4357 }, { "entropy": 1.213013082742691, "epoch": 2.2948920484465507, "grad_norm": 0.29037851095199585, "learning_rate": 0.00016129505406023382, "loss": 0.20425663888454437, "mean_token_accuracy": 0.911371037364006, "num_tokens": 53758232.0, "step": 4358 }, { "entropy": 1.283359169960022, "epoch": 2.2954186413902056, "grad_norm": 0.2981805205345154, "learning_rate": 0.00016127703444091852, "loss": 0.18576066195964813, "mean_token_accuracy": 0.9234738498926163, "num_tokens": 53770568.0, "step": 4359 }, { "entropy": 1.3199339807033539, "epoch": 2.29594523433386, "grad_norm": 0.33105799555778503, "learning_rate": 0.00016125901177758457, "loss": 0.21435634791851044, "mean_token_accuracy": 0.9107922315597534, "num_tokens": 53782904.0, "step": 4360 }, { "entropy": 1.299638718366623, "epoch": 2.2964718272775144, "grad_norm": 0.2832479774951935, "learning_rate": 0.00016124098607130184, "loss": 0.19559845328330994, "mean_token_accuracy": 0.9197534024715424, "num_tokens": 53795240.0, "step": 4361 }, { "entropy": 1.2708514034748077, "epoch": 2.296998420221169, "grad_norm": 0.2999652624130249, "learning_rate": 0.00016122295732314042, "loss": 0.20792636275291443, "mean_token_accuracy": 0.9146489202976227, "num_tokens": 53807576.0, "step": 4362 }, { "entropy": 1.2924802005290985, "epoch": 2.2975250131648237, "grad_norm": 0.27054089307785034, "learning_rate": 0.00016120492553417065, "loss": 0.1762731522321701, "mean_token_accuracy": 0.9278860241174698, "num_tokens": 53819912.0, "step": 4363 }, { "entropy": 1.3254149854183197, "epoch": 2.298051606108478, "grad_norm": 0.2686094045639038, "learning_rate": 0.0001611868907054628, "loss": 0.17815278470516205, "mean_token_accuracy": 0.9264986962080002, "num_tokens": 53832248.0, "step": 4364 }, { "entropy": 1.3951729238033295, "epoch": 2.2985781990521326, "grad_norm": 0.28512006998062134, "learning_rate": 0.00016116885283808764, "loss": 0.201333150267601, "mean_token_accuracy": 0.9201938062906265, "num_tokens": 53844584.0, "step": 4365 }, { "entropy": 1.312125563621521, "epoch": 2.2991047919957874, "grad_norm": 0.27145853638648987, "learning_rate": 0.00016115081193311592, "loss": 0.17296220362186432, "mean_token_accuracy": 0.9303802251815796, "num_tokens": 53856920.0, "step": 4366 }, { "entropy": 1.3520390391349792, "epoch": 2.299631384939442, "grad_norm": 0.2710401713848114, "learning_rate": 0.00016113276799161857, "loss": 0.1911015808582306, "mean_token_accuracy": 0.918425902724266, "num_tokens": 53869256.0, "step": 4367 }, { "entropy": 1.4310398697853088, "epoch": 2.3001579778830963, "grad_norm": 0.30252817273139954, "learning_rate": 0.00016111472101466688, "loss": 0.20369470119476318, "mean_token_accuracy": 0.9167941361665726, "num_tokens": 53881592.0, "step": 4368 }, { "entropy": 1.357957899570465, "epoch": 2.3006845708267507, "grad_norm": 0.26683077216148376, "learning_rate": 0.00016109667100333208, "loss": 0.1931741088628769, "mean_token_accuracy": 0.9199745804071426, "num_tokens": 53893928.0, "step": 4369 }, { "entropy": 1.4150426983833313, "epoch": 2.3012111637704056, "grad_norm": 0.2798272669315338, "learning_rate": 0.00016107861795868576, "loss": 0.1891252100467682, "mean_token_accuracy": 0.9210709631443024, "num_tokens": 53906264.0, "step": 4370 }, { "entropy": 1.3921004831790924, "epoch": 2.30173775671406, "grad_norm": 0.27035799622535706, "learning_rate": 0.00016106056188179958, "loss": 0.18214790523052216, "mean_token_accuracy": 0.9235829561948776, "num_tokens": 53918600.0, "step": 4371 }, { "entropy": 1.3772303760051727, "epoch": 2.3022643496577144, "grad_norm": 0.2842561900615692, "learning_rate": 0.00016104250277374548, "loss": 0.20173102617263794, "mean_token_accuracy": 0.9209082275629044, "num_tokens": 53930936.0, "step": 4372 }, { "entropy": 1.3774393200874329, "epoch": 2.3027909426013693, "grad_norm": 0.27162718772888184, "learning_rate": 0.00016102444063559546, "loss": 0.19384866952896118, "mean_token_accuracy": 0.9170814156532288, "num_tokens": 53943272.0, "step": 4373 }, { "entropy": 1.336693435907364, "epoch": 2.3033175355450237, "grad_norm": 0.25225090980529785, "learning_rate": 0.00016100637546842179, "loss": 0.1860221028327942, "mean_token_accuracy": 0.9214341193437576, "num_tokens": 53955608.0, "step": 4374 }, { "entropy": 1.330688863992691, "epoch": 2.303844128488678, "grad_norm": 0.2605641484260559, "learning_rate": 0.00016098830727329693, "loss": 0.17431269586086273, "mean_token_accuracy": 0.9278644174337387, "num_tokens": 53967944.0, "step": 4375 }, { "entropy": 1.344216674566269, "epoch": 2.304370721432333, "grad_norm": 0.2637542486190796, "learning_rate": 0.0001609702360512934, "loss": 0.17134076356887817, "mean_token_accuracy": 0.929853156208992, "num_tokens": 53980280.0, "step": 4376 }, { "entropy": 1.3215482532978058, "epoch": 2.3048973143759874, "grad_norm": 0.28528934717178345, "learning_rate": 0.00016095216180348406, "loss": 0.19538789987564087, "mean_token_accuracy": 0.9190406650304794, "num_tokens": 53992616.0, "step": 4377 }, { "entropy": 1.3346219658851624, "epoch": 2.305423907319642, "grad_norm": 0.2910776734352112, "learning_rate": 0.00016093408453094182, "loss": 0.19502344727516174, "mean_token_accuracy": 0.9186424911022186, "num_tokens": 54004952.0, "step": 4378 }, { "entropy": 1.303836166858673, "epoch": 2.3059505002632963, "grad_norm": 0.27647870779037476, "learning_rate": 0.00016091600423473988, "loss": 0.18278121948242188, "mean_token_accuracy": 0.9247827529907227, "num_tokens": 54017288.0, "step": 4379 }, { "entropy": 1.3144015967845917, "epoch": 2.306477093206951, "grad_norm": 0.27541449666023254, "learning_rate": 0.00016089792091595153, "loss": 0.17720472812652588, "mean_token_accuracy": 0.9278306365013123, "num_tokens": 54029624.0, "step": 4380 }, { "entropy": 1.3188709318637848, "epoch": 2.3070036861506056, "grad_norm": 0.27120038866996765, "learning_rate": 0.00016087983457565026, "loss": 0.18134379386901855, "mean_token_accuracy": 0.9238206744194031, "num_tokens": 54041960.0, "step": 4381 }, { "entropy": 1.2987216711044312, "epoch": 2.30753027909426, "grad_norm": 0.2692391276359558, "learning_rate": 0.00016086174521490976, "loss": 0.18199361860752106, "mean_token_accuracy": 0.9220229238271713, "num_tokens": 54054296.0, "step": 4382 }, { "entropy": 1.3269225060939789, "epoch": 2.308056872037915, "grad_norm": 0.30096539855003357, "learning_rate": 0.00016084365283480388, "loss": 0.1970018595457077, "mean_token_accuracy": 0.9222443252801895, "num_tokens": 54066632.0, "step": 4383 }, { "entropy": 1.2876869142055511, "epoch": 2.3085834649815693, "grad_norm": 0.278378963470459, "learning_rate": 0.00016082555743640668, "loss": 0.19296762347221375, "mean_token_accuracy": 0.9184974581003189, "num_tokens": 54078968.0, "step": 4384 }, { "entropy": 1.3124735057353973, "epoch": 2.3091100579252237, "grad_norm": 0.2990483045578003, "learning_rate": 0.00016080745902079238, "loss": 0.1947772204875946, "mean_token_accuracy": 0.9188289642333984, "num_tokens": 54091304.0, "step": 4385 }, { "entropy": 1.2949390411376953, "epoch": 2.309636650868878, "grad_norm": 0.276991069316864, "learning_rate": 0.0001607893575890354, "loss": 0.17927928268909454, "mean_token_accuracy": 0.9291679114103317, "num_tokens": 54103640.0, "step": 4386 }, { "entropy": 1.2690950632095337, "epoch": 2.310163243812533, "grad_norm": 0.29863035678863525, "learning_rate": 0.0001607712531422102, "loss": 0.18910539150238037, "mean_token_accuracy": 0.9157494306564331, "num_tokens": 54115976.0, "step": 4387 }, { "entropy": 1.3071636855602264, "epoch": 2.3106898367561874, "grad_norm": 0.2578350603580475, "learning_rate": 0.00016075314568139167, "loss": 0.1770387887954712, "mean_token_accuracy": 0.9272283613681793, "num_tokens": 54128312.0, "step": 4388 }, { "entropy": 1.2916749119758606, "epoch": 2.311216429699842, "grad_norm": 0.2677556872367859, "learning_rate": 0.00016073503520765467, "loss": 0.19181080162525177, "mean_token_accuracy": 0.9190926253795624, "num_tokens": 54140648.0, "step": 4389 }, { "entropy": 1.309247374534607, "epoch": 2.3117430226434967, "grad_norm": 0.2915293872356415, "learning_rate": 0.00016071692172207435, "loss": 0.1867821216583252, "mean_token_accuracy": 0.9195849001407623, "num_tokens": 54152984.0, "step": 4390 }, { "entropy": 1.29865163564682, "epoch": 2.312269615587151, "grad_norm": 0.2806514501571655, "learning_rate": 0.00016069880522572597, "loss": 0.1817903220653534, "mean_token_accuracy": 0.9249827116727829, "num_tokens": 54165320.0, "step": 4391 }, { "entropy": 1.2931040525436401, "epoch": 2.3127962085308056, "grad_norm": 0.29710087180137634, "learning_rate": 0.00016068068571968507, "loss": 0.20901834964752197, "mean_token_accuracy": 0.9162816405296326, "num_tokens": 54177656.0, "step": 4392 }, { "entropy": 1.2990557551383972, "epoch": 2.3133228014744605, "grad_norm": 0.2834272086620331, "learning_rate": 0.00016066256320502719, "loss": 0.1743437647819519, "mean_token_accuracy": 0.9270213842391968, "num_tokens": 54189992.0, "step": 4393 }, { "entropy": 1.2775674760341644, "epoch": 2.313849394418115, "grad_norm": 0.2701371908187866, "learning_rate": 0.00016064443768282823, "loss": 0.17299538850784302, "mean_token_accuracy": 0.9240054935216904, "num_tokens": 54202328.0, "step": 4394 }, { "entropy": 1.312081515789032, "epoch": 2.3143759873617693, "grad_norm": 0.3133409321308136, "learning_rate": 0.0001606263091541642, "loss": 0.193025603890419, "mean_token_accuracy": 0.9182188510894775, "num_tokens": 54214664.0, "step": 4395 }, { "entropy": 1.3071553409099579, "epoch": 2.3149025803054237, "grad_norm": 0.2669501304626465, "learning_rate": 0.00016060817762011126, "loss": 0.17285308241844177, "mean_token_accuracy": 0.9284144788980484, "num_tokens": 54227000.0, "step": 4396 }, { "entropy": 1.3454262018203735, "epoch": 2.3154291732490786, "grad_norm": 0.29012081027030945, "learning_rate": 0.00016059004308174578, "loss": 0.20970484614372253, "mean_token_accuracy": 0.9146772921085358, "num_tokens": 54239336.0, "step": 4397 }, { "entropy": 1.3304231464862823, "epoch": 2.315955766192733, "grad_norm": 0.34615376591682434, "learning_rate": 0.0001605719055401443, "loss": 0.20989423990249634, "mean_token_accuracy": 0.912458136677742, "num_tokens": 54251672.0, "step": 4398 }, { "entropy": 1.3078122437000275, "epoch": 2.3164823591363874, "grad_norm": 0.3172536790370941, "learning_rate": 0.00016055376499638356, "loss": 0.21419790387153625, "mean_token_accuracy": 0.9104336500167847, "num_tokens": 54264008.0, "step": 4399 }, { "entropy": 1.3196004033088684, "epoch": 2.3170089520800423, "grad_norm": 0.26406171917915344, "learning_rate": 0.00016053562145154044, "loss": 0.1729414165019989, "mean_token_accuracy": 0.9300494939088821, "num_tokens": 54276344.0, "step": 4400 }, { "entropy": 1.3104143142700195, "epoch": 2.3175355450236967, "grad_norm": 0.27086126804351807, "learning_rate": 0.000160517474906692, "loss": 0.19196972250938416, "mean_token_accuracy": 0.9190964996814728, "num_tokens": 54288680.0, "step": 4401 }, { "entropy": 1.334696739912033, "epoch": 2.318062137967351, "grad_norm": 0.27888646721839905, "learning_rate": 0.00016049932536291552, "loss": 0.1965310424566269, "mean_token_accuracy": 0.9213904738426208, "num_tokens": 54301016.0, "step": 4402 }, { "entropy": 1.3062738478183746, "epoch": 2.3185887309110056, "grad_norm": 0.274829238653183, "learning_rate": 0.00016048117282128842, "loss": 0.1787204146385193, "mean_token_accuracy": 0.9259192049503326, "num_tokens": 54313352.0, "step": 4403 }, { "entropy": 1.3323825299739838, "epoch": 2.3191153238546605, "grad_norm": 0.3422197699546814, "learning_rate": 0.00016046301728288835, "loss": 0.2093147188425064, "mean_token_accuracy": 0.91293103992939, "num_tokens": 54325688.0, "step": 4404 }, { "entropy": 1.3408651053905487, "epoch": 2.319641916798315, "grad_norm": 0.27782759070396423, "learning_rate": 0.00016044485874879303, "loss": 0.18714700639247894, "mean_token_accuracy": 0.9252272844314575, "num_tokens": 54338024.0, "step": 4405 }, { "entropy": 1.2752661406993866, "epoch": 2.3201685097419693, "grad_norm": 0.2649306356906891, "learning_rate": 0.00016042669722008047, "loss": 0.18565596640110016, "mean_token_accuracy": 0.92513607442379, "num_tokens": 54350360.0, "step": 4406 }, { "entropy": 1.3408364355564117, "epoch": 2.320695102685624, "grad_norm": 0.2725090980529785, "learning_rate": 0.00016040853269782881, "loss": 0.1821533590555191, "mean_token_accuracy": 0.9206462651491165, "num_tokens": 54362696.0, "step": 4407 }, { "entropy": 1.3324918746948242, "epoch": 2.3212216956292786, "grad_norm": 0.2690848708152771, "learning_rate": 0.00016039036518311633, "loss": 0.19127275049686432, "mean_token_accuracy": 0.9218493103981018, "num_tokens": 54375032.0, "step": 4408 }, { "entropy": 1.387494683265686, "epoch": 2.321748288572933, "grad_norm": 0.29377731680870056, "learning_rate": 0.00016037219467702162, "loss": 0.19303129613399506, "mean_token_accuracy": 0.9185487180948257, "num_tokens": 54387368.0, "step": 4409 }, { "entropy": 1.3866168558597565, "epoch": 2.322274881516588, "grad_norm": 0.30252406001091003, "learning_rate": 0.00016035402118062329, "loss": 0.18900904059410095, "mean_token_accuracy": 0.9236882477998734, "num_tokens": 54399704.0, "step": 4410 }, { "entropy": 1.3696815967559814, "epoch": 2.3228014744602423, "grad_norm": 0.3095356225967407, "learning_rate": 0.00016033584469500017, "loss": 0.21661263704299927, "mean_token_accuracy": 0.9109258502721786, "num_tokens": 54412040.0, "step": 4411 }, { "entropy": 1.3689590990543365, "epoch": 2.3233280674038967, "grad_norm": 0.30804696679115295, "learning_rate": 0.00016031766522123136, "loss": 0.1792442947626114, "mean_token_accuracy": 0.9260575175285339, "num_tokens": 54424376.0, "step": 4412 }, { "entropy": 1.3878648579120636, "epoch": 2.323854660347551, "grad_norm": 0.26045045256614685, "learning_rate": 0.00016029948276039606, "loss": 0.1889743059873581, "mean_token_accuracy": 0.9185473471879959, "num_tokens": 54436712.0, "step": 4413 }, { "entropy": 1.3724315762519836, "epoch": 2.324381253291206, "grad_norm": 0.2750447392463684, "learning_rate": 0.00016028129731357366, "loss": 0.1990983784198761, "mean_token_accuracy": 0.9145029634237289, "num_tokens": 54449048.0, "step": 4414 }, { "entropy": 1.3819120228290558, "epoch": 2.3249078462348605, "grad_norm": 0.2784717082977295, "learning_rate": 0.00016026310888184363, "loss": 0.1772555112838745, "mean_token_accuracy": 0.9232773780822754, "num_tokens": 54461384.0, "step": 4415 }, { "entropy": 1.4001644849777222, "epoch": 2.325434439178515, "grad_norm": 0.2536607086658478, "learning_rate": 0.00016024491746628578, "loss": 0.17961403727531433, "mean_token_accuracy": 0.9264721125364304, "num_tokens": 54473720.0, "step": 4416 }, { "entropy": 1.4117590487003326, "epoch": 2.3259610321221693, "grad_norm": 0.2814858853816986, "learning_rate": 0.00016022672306798005, "loss": 0.2062462568283081, "mean_token_accuracy": 0.9142315089702606, "num_tokens": 54486056.0, "step": 4417 }, { "entropy": 1.4305457472801208, "epoch": 2.326487625065824, "grad_norm": 0.2592325508594513, "learning_rate": 0.00016020852568800653, "loss": 0.1808975487947464, "mean_token_accuracy": 0.9286819398403168, "num_tokens": 54498392.0, "step": 4418 }, { "entropy": 1.3532997369766235, "epoch": 2.3270142180094786, "grad_norm": 0.28283217549324036, "learning_rate": 0.00016019032532744548, "loss": 0.18879854679107666, "mean_token_accuracy": 0.9208284020423889, "num_tokens": 54510728.0, "step": 4419 }, { "entropy": 1.3316220939159393, "epoch": 2.327540810953133, "grad_norm": 0.2630079686641693, "learning_rate": 0.00016017212198737732, "loss": 0.17229636013507843, "mean_token_accuracy": 0.9275263994932175, "num_tokens": 54523064.0, "step": 4420 }, { "entropy": 1.388702541589737, "epoch": 2.328067403896788, "grad_norm": 0.2867870032787323, "learning_rate": 0.00016015391566888271, "loss": 0.20351353287696838, "mean_token_accuracy": 0.9170709401369095, "num_tokens": 54535400.0, "step": 4421 }, { "entropy": 1.3147936463356018, "epoch": 2.3285939968404423, "grad_norm": 0.2731653153896332, "learning_rate": 0.00016013570637304244, "loss": 0.19753791391849518, "mean_token_accuracy": 0.9179530590772629, "num_tokens": 54547736.0, "step": 4422 }, { "entropy": 1.3937702775001526, "epoch": 2.3291205897840968, "grad_norm": 0.28775882720947266, "learning_rate": 0.00016011749410093753, "loss": 0.18566149473190308, "mean_token_accuracy": 0.9243120849132538, "num_tokens": 54560072.0, "step": 4423 }, { "entropy": 1.3537203073501587, "epoch": 2.3296471827277516, "grad_norm": 0.2538524866104126, "learning_rate": 0.00016009927885364907, "loss": 0.18132588267326355, "mean_token_accuracy": 0.9244391024112701, "num_tokens": 54572408.0, "step": 4424 }, { "entropy": 1.328016459941864, "epoch": 2.330173775671406, "grad_norm": 0.30183935165405273, "learning_rate": 0.00016008106063225845, "loss": 0.21323493123054504, "mean_token_accuracy": 0.9161577224731445, "num_tokens": 54584744.0, "step": 4425 }, { "entropy": 1.3058584034442902, "epoch": 2.3307003686150605, "grad_norm": 0.28315648436546326, "learning_rate": 0.00016006283943784715, "loss": 0.20466047525405884, "mean_token_accuracy": 0.9173526763916016, "num_tokens": 54597080.0, "step": 4426 }, { "entropy": 1.371433824300766, "epoch": 2.3312269615587153, "grad_norm": 0.2796994149684906, "learning_rate": 0.00016004461527149687, "loss": 0.19173529744148254, "mean_token_accuracy": 0.9192550033330917, "num_tokens": 54609416.0, "step": 4427 }, { "entropy": 1.2901140749454498, "epoch": 2.3317535545023698, "grad_norm": 0.2696458399295807, "learning_rate": 0.00016002638813428943, "loss": 0.18851207196712494, "mean_token_accuracy": 0.9239564538002014, "num_tokens": 54621752.0, "step": 4428 }, { "entropy": 1.317545861005783, "epoch": 2.332280147446024, "grad_norm": 0.3081064522266388, "learning_rate": 0.00016000815802730693, "loss": 0.20056316256523132, "mean_token_accuracy": 0.9122645407915115, "num_tokens": 54634088.0, "step": 4429 }, { "entropy": 1.2482907176017761, "epoch": 2.3328067403896786, "grad_norm": 0.2816668152809143, "learning_rate": 0.0001599899249516315, "loss": 0.18329255282878876, "mean_token_accuracy": 0.9248232841491699, "num_tokens": 54646424.0, "step": 4430 }, { "entropy": 1.2596892416477203, "epoch": 2.3333333333333335, "grad_norm": 0.27750101685523987, "learning_rate": 0.00015997168890834567, "loss": 0.2004767507314682, "mean_token_accuracy": 0.9160079509019852, "num_tokens": 54658760.0, "step": 4431 }, { "entropy": 1.2721357941627502, "epoch": 2.333859926276988, "grad_norm": 0.28640201687812805, "learning_rate": 0.00015995344989853193, "loss": 0.18829813599586487, "mean_token_accuracy": 0.9209965318441391, "num_tokens": 54671096.0, "step": 4432 }, { "entropy": 1.281269371509552, "epoch": 2.3343865192206423, "grad_norm": 0.2667178809642792, "learning_rate": 0.00015993520792327294, "loss": 0.18476279079914093, "mean_token_accuracy": 0.9250704199075699, "num_tokens": 54683432.0, "step": 4433 }, { "entropy": 1.2215364575386047, "epoch": 2.3349131121642968, "grad_norm": 0.29263362288475037, "learning_rate": 0.00015991696298365174, "loss": 0.21507254242897034, "mean_token_accuracy": 0.9111363440752029, "num_tokens": 54695768.0, "step": 4434 }, { "entropy": 1.1838223040103912, "epoch": 2.3354397051079516, "grad_norm": 0.25401586294174194, "learning_rate": 0.00015989871508075137, "loss": 0.18073657155036926, "mean_token_accuracy": 0.9278956204652786, "num_tokens": 54708104.0, "step": 4435 }, { "entropy": 1.2792393565177917, "epoch": 2.335966298051606, "grad_norm": 0.2642403542995453, "learning_rate": 0.00015988046421565517, "loss": 0.1823883056640625, "mean_token_accuracy": 0.9233395755290985, "num_tokens": 54720440.0, "step": 4436 }, { "entropy": 1.281785398721695, "epoch": 2.3364928909952605, "grad_norm": 0.30070072412490845, "learning_rate": 0.0001598622103894465, "loss": 0.19212502241134644, "mean_token_accuracy": 0.9186575263738632, "num_tokens": 54732776.0, "step": 4437 }, { "entropy": 1.2644932866096497, "epoch": 2.3370194839389153, "grad_norm": 0.3136497437953949, "learning_rate": 0.00015984395360320902, "loss": 0.19951491057872772, "mean_token_accuracy": 0.9213179051876068, "num_tokens": 54745112.0, "step": 4438 }, { "entropy": 1.2794144749641418, "epoch": 2.3375460768825698, "grad_norm": 0.27775052189826965, "learning_rate": 0.00015982569385802653, "loss": 0.18891870975494385, "mean_token_accuracy": 0.9204751700162888, "num_tokens": 54757448.0, "step": 4439 }, { "entropy": 1.2809376120567322, "epoch": 2.338072669826224, "grad_norm": 0.28730466961860657, "learning_rate": 0.00015980743115498296, "loss": 0.20424111187458038, "mean_token_accuracy": 0.9203447997570038, "num_tokens": 54769784.0, "step": 4440 }, { "entropy": 1.2839619815349579, "epoch": 2.338599262769879, "grad_norm": 0.3166145384311676, "learning_rate": 0.00015978916549516257, "loss": 0.2077278047800064, "mean_token_accuracy": 0.9169203490018845, "num_tokens": 54782120.0, "step": 4441 }, { "entropy": 1.2435754537582397, "epoch": 2.3391258557135335, "grad_norm": 0.26010408997535706, "learning_rate": 0.0001597708968796496, "loss": 0.1755719631910324, "mean_token_accuracy": 0.9279258698225021, "num_tokens": 54794456.0, "step": 4442 }, { "entropy": 1.210321307182312, "epoch": 2.339652448657188, "grad_norm": 0.26333627104759216, "learning_rate": 0.00015975262530952853, "loss": 0.17494051158428192, "mean_token_accuracy": 0.9276866167783737, "num_tokens": 54806792.0, "step": 4443 }, { "entropy": 1.282522976398468, "epoch": 2.340179041600843, "grad_norm": 0.2993547022342682, "learning_rate": 0.0001597343507858841, "loss": 0.1840740144252777, "mean_token_accuracy": 0.9280155897140503, "num_tokens": 54819128.0, "step": 4444 }, { "entropy": 1.2530391216278076, "epoch": 2.340705634544497, "grad_norm": 0.28764256834983826, "learning_rate": 0.00015971607330980117, "loss": 0.19909349083900452, "mean_token_accuracy": 0.9169367849826813, "num_tokens": 54831464.0, "step": 4445 }, { "entropy": 1.3018465340137482, "epoch": 2.3412322274881516, "grad_norm": 0.2826826870441437, "learning_rate": 0.00015969779288236468, "loss": 0.19262577593326569, "mean_token_accuracy": 0.920672133564949, "num_tokens": 54843800.0, "step": 4446 }, { "entropy": 1.2566682994365692, "epoch": 2.341758820431806, "grad_norm": 0.29000788927078247, "learning_rate": 0.0001596795095046599, "loss": 0.21003186702728271, "mean_token_accuracy": 0.9126958400011063, "num_tokens": 54856136.0, "step": 4447 }, { "entropy": 1.2816908955574036, "epoch": 2.342285413375461, "grad_norm": 0.284256249666214, "learning_rate": 0.00015966122317777223, "loss": 0.20872412621974945, "mean_token_accuracy": 0.9170348197221756, "num_tokens": 54868472.0, "step": 4448 }, { "entropy": 1.2890898287296295, "epoch": 2.3428120063191153, "grad_norm": 0.2809978723526001, "learning_rate": 0.00015964293390278718, "loss": 0.20213517546653748, "mean_token_accuracy": 0.9191296994686127, "num_tokens": 54880808.0, "step": 4449 }, { "entropy": 1.3205406069755554, "epoch": 2.3433385992627698, "grad_norm": 0.27979543805122375, "learning_rate": 0.00015962464168079045, "loss": 0.195961132645607, "mean_token_accuracy": 0.9169862270355225, "num_tokens": 54893144.0, "step": 4450 }, { "entropy": 1.334695279598236, "epoch": 2.343865192206424, "grad_norm": 0.26562100648880005, "learning_rate": 0.000159606346512868, "loss": 0.1865580528974533, "mean_token_accuracy": 0.923822671175003, "num_tokens": 54905480.0, "step": 4451 }, { "entropy": 1.3165518641471863, "epoch": 2.344391785150079, "grad_norm": 0.2917470335960388, "learning_rate": 0.0001595880484001059, "loss": 0.20150445401668549, "mean_token_accuracy": 0.9178837388753891, "num_tokens": 54917816.0, "step": 4452 }, { "entropy": 1.3582655489444733, "epoch": 2.3449183780937335, "grad_norm": 0.26764020323753357, "learning_rate": 0.00015956974734359034, "loss": 0.18483439087867737, "mean_token_accuracy": 0.920818954706192, "num_tokens": 54930152.0, "step": 4453 }, { "entropy": 1.3119309544563293, "epoch": 2.345444971037388, "grad_norm": 0.2685227692127228, "learning_rate": 0.00015955144334440783, "loss": 0.20485417544841766, "mean_token_accuracy": 0.9134972244501114, "num_tokens": 54942488.0, "step": 4454 }, { "entropy": 1.3058526515960693, "epoch": 2.345971563981043, "grad_norm": 0.26575425267219543, "learning_rate": 0.00015953313640364492, "loss": 0.20995725691318512, "mean_token_accuracy": 0.912079855799675, "num_tokens": 54954824.0, "step": 4455 }, { "entropy": 1.3167513608932495, "epoch": 2.346498156924697, "grad_norm": 0.2694823145866394, "learning_rate": 0.00015951482652238843, "loss": 0.19169099628925323, "mean_token_accuracy": 0.9215113818645477, "num_tokens": 54967160.0, "step": 4456 }, { "entropy": 1.3394544422626495, "epoch": 2.3470247498683516, "grad_norm": 0.2890017032623291, "learning_rate": 0.00015949651370172525, "loss": 0.20341987907886505, "mean_token_accuracy": 0.9149002283811569, "num_tokens": 54979496.0, "step": 4457 }, { "entropy": 1.344273865222931, "epoch": 2.3475513428120065, "grad_norm": 0.27608951926231384, "learning_rate": 0.00015947819794274258, "loss": 0.1875733733177185, "mean_token_accuracy": 0.9171324670314789, "num_tokens": 54991832.0, "step": 4458 }, { "entropy": 1.3028335869312286, "epoch": 2.348077935755661, "grad_norm": 0.2981983423233032, "learning_rate": 0.00015945987924652764, "loss": 0.20515939593315125, "mean_token_accuracy": 0.91654272377491, "num_tokens": 55004168.0, "step": 4459 }, { "entropy": 1.3539035320281982, "epoch": 2.3486045286993154, "grad_norm": 0.27947360277175903, "learning_rate": 0.00015944155761416797, "loss": 0.1902858167886734, "mean_token_accuracy": 0.9198180288076401, "num_tokens": 55016504.0, "step": 4460 }, { "entropy": 1.317354530096054, "epoch": 2.34913112164297, "grad_norm": 0.2992118299007416, "learning_rate": 0.00015942323304675118, "loss": 0.1987239122390747, "mean_token_accuracy": 0.9191636443138123, "num_tokens": 55028840.0, "step": 4461 }, { "entropy": 1.310655266046524, "epoch": 2.3496577145866246, "grad_norm": 0.26667365431785583, "learning_rate": 0.0001594049055453651, "loss": 0.1835993528366089, "mean_token_accuracy": 0.922356128692627, "num_tokens": 55041176.0, "step": 4462 }, { "entropy": 1.254290759563446, "epoch": 2.350184307530279, "grad_norm": 0.2572006285190582, "learning_rate": 0.00015938657511109776, "loss": 0.18122154474258423, "mean_token_accuracy": 0.9250338971614838, "num_tokens": 55053512.0, "step": 4463 }, { "entropy": 1.330580860376358, "epoch": 2.3507109004739335, "grad_norm": 0.2904733717441559, "learning_rate": 0.00015936824174503727, "loss": 0.18564851582050323, "mean_token_accuracy": 0.9225763231515884, "num_tokens": 55065848.0, "step": 4464 }, { "entropy": 1.285946011543274, "epoch": 2.3512374934175884, "grad_norm": 0.28024446964263916, "learning_rate": 0.000159349905448272, "loss": 0.1889662742614746, "mean_token_accuracy": 0.9220243245363235, "num_tokens": 55078184.0, "step": 4465 }, { "entropy": 1.3022855818271637, "epoch": 2.351764086361243, "grad_norm": 0.2870224118232727, "learning_rate": 0.0001593315662218905, "loss": 0.18644535541534424, "mean_token_accuracy": 0.9205256253480911, "num_tokens": 55090520.0, "step": 4466 }, { "entropy": 1.2169810831546783, "epoch": 2.352290679304897, "grad_norm": 0.24071332812309265, "learning_rate": 0.00015931322406698142, "loss": 0.16642692685127258, "mean_token_accuracy": 0.930572435259819, "num_tokens": 55102856.0, "step": 4467 }, { "entropy": 1.2590057253837585, "epoch": 2.3528172722485516, "grad_norm": 0.2916509807109833, "learning_rate": 0.00015929487898463368, "loss": 0.1792268007993698, "mean_token_accuracy": 0.9278564751148224, "num_tokens": 55115192.0, "step": 4468 }, { "entropy": 1.3424552083015442, "epoch": 2.3533438651922065, "grad_norm": 0.3079618513584137, "learning_rate": 0.00015927653097593626, "loss": 0.20497339963912964, "mean_token_accuracy": 0.9212962538003922, "num_tokens": 55127528.0, "step": 4469 }, { "entropy": 1.3330655097961426, "epoch": 2.353870458135861, "grad_norm": 0.2870141863822937, "learning_rate": 0.0001592581800419784, "loss": 0.19076713919639587, "mean_token_accuracy": 0.9209161102771759, "num_tokens": 55139864.0, "step": 4470 }, { "entropy": 1.3257507979869843, "epoch": 2.3543970510795154, "grad_norm": 0.28117015957832336, "learning_rate": 0.00015923982618384948, "loss": 0.20129868388175964, "mean_token_accuracy": 0.9233514815568924, "num_tokens": 55152200.0, "step": 4471 }, { "entropy": 1.3009706437587738, "epoch": 2.3549236440231702, "grad_norm": 0.3033812940120697, "learning_rate": 0.0001592214694026391, "loss": 0.18937650322914124, "mean_token_accuracy": 0.9224123954772949, "num_tokens": 55164536.0, "step": 4472 }, { "entropy": 1.2963763773441315, "epoch": 2.3554502369668247, "grad_norm": 0.2638135552406311, "learning_rate": 0.00015920310969943697, "loss": 0.1769077479839325, "mean_token_accuracy": 0.9286084026098251, "num_tokens": 55176872.0, "step": 4473 }, { "entropy": 1.3231896758079529, "epoch": 2.355976829910479, "grad_norm": 0.26197150349617004, "learning_rate": 0.00015918474707533298, "loss": 0.17836906015872955, "mean_token_accuracy": 0.9256467223167419, "num_tokens": 55189208.0, "step": 4474 }, { "entropy": 1.3913252353668213, "epoch": 2.356503422854134, "grad_norm": 0.2851298451423645, "learning_rate": 0.00015916638153141722, "loss": 0.18936462700366974, "mean_token_accuracy": 0.9204428941011429, "num_tokens": 55201544.0, "step": 4475 }, { "entropy": 1.3488848209381104, "epoch": 2.3570300157977884, "grad_norm": 0.30388936400413513, "learning_rate": 0.00015914801306877993, "loss": 0.21345588564872742, "mean_token_accuracy": 0.9136727303266525, "num_tokens": 55213880.0, "step": 4476 }, { "entropy": 1.3502046167850494, "epoch": 2.357556608741443, "grad_norm": 0.28946250677108765, "learning_rate": 0.0001591296416885116, "loss": 0.20996083319187164, "mean_token_accuracy": 0.9157253056764603, "num_tokens": 55226216.0, "step": 4477 }, { "entropy": 1.3586644530296326, "epoch": 2.3580832016850977, "grad_norm": 0.27651745080947876, "learning_rate": 0.0001591112673917028, "loss": 0.18405741453170776, "mean_token_accuracy": 0.924022987484932, "num_tokens": 55238552.0, "step": 4478 }, { "entropy": 1.430792659521103, "epoch": 2.358609794628752, "grad_norm": 0.2895481288433075, "learning_rate": 0.00015909289017944426, "loss": 0.18251873552799225, "mean_token_accuracy": 0.923512801527977, "num_tokens": 55250888.0, "step": 4479 }, { "entropy": 1.3671636581420898, "epoch": 2.3591363875724065, "grad_norm": 0.25113236904144287, "learning_rate": 0.00015907451005282698, "loss": 0.16419190168380737, "mean_token_accuracy": 0.9323639422655106, "num_tokens": 55263224.0, "step": 4480 }, { "entropy": 1.354794681072235, "epoch": 2.359662980516061, "grad_norm": 0.296430766582489, "learning_rate": 0.00015905612701294208, "loss": 0.20118844509124756, "mean_token_accuracy": 0.9132822453975677, "num_tokens": 55275560.0, "step": 4481 }, { "entropy": 1.3990836441516876, "epoch": 2.360189573459716, "grad_norm": 0.28303229808807373, "learning_rate": 0.0001590377410608808, "loss": 0.20889045298099518, "mean_token_accuracy": 0.9137723445892334, "num_tokens": 55287896.0, "step": 4482 }, { "entropy": 1.3733917474746704, "epoch": 2.3607161664033702, "grad_norm": 0.27674078941345215, "learning_rate": 0.0001590193521977347, "loss": 0.1934237778186798, "mean_token_accuracy": 0.921452522277832, "num_tokens": 55300232.0, "step": 4483 }, { "entropy": 1.355101853609085, "epoch": 2.3612427593470247, "grad_norm": 0.24528248608112335, "learning_rate": 0.00015900096042459534, "loss": 0.17529264092445374, "mean_token_accuracy": 0.925555557012558, "num_tokens": 55312568.0, "step": 4484 }, { "entropy": 1.4111731946468353, "epoch": 2.361769352290679, "grad_norm": 0.28693532943725586, "learning_rate": 0.00015898256574255456, "loss": 0.1895090639591217, "mean_token_accuracy": 0.9167554080486298, "num_tokens": 55324904.0, "step": 4485 }, { "entropy": 1.3618127703666687, "epoch": 2.362295945234334, "grad_norm": 0.2586255669593811, "learning_rate": 0.00015896416815270437, "loss": 0.17887786030769348, "mean_token_accuracy": 0.9279444813728333, "num_tokens": 55337240.0, "step": 4486 }, { "entropy": 1.4009781777858734, "epoch": 2.3628225381779884, "grad_norm": 0.2798784673213959, "learning_rate": 0.00015894576765613684, "loss": 0.2002013474702835, "mean_token_accuracy": 0.9198189824819565, "num_tokens": 55349576.0, "step": 4487 }, { "entropy": 1.4672830998897552, "epoch": 2.363349131121643, "grad_norm": 0.30033984780311584, "learning_rate": 0.00015892736425394442, "loss": 0.19836139678955078, "mean_token_accuracy": 0.9234947264194489, "num_tokens": 55361912.0, "step": 4488 }, { "entropy": 1.4400977194309235, "epoch": 2.3638757240652977, "grad_norm": 0.2626227140426636, "learning_rate": 0.00015890895794721955, "loss": 0.1710968166589737, "mean_token_accuracy": 0.9296213835477829, "num_tokens": 55374248.0, "step": 4489 }, { "entropy": 1.4096495509147644, "epoch": 2.364402317008952, "grad_norm": 0.282968670129776, "learning_rate": 0.00015889054873705486, "loss": 0.1910400092601776, "mean_token_accuracy": 0.9231160432100296, "num_tokens": 55386584.0, "step": 4490 }, { "entropy": 1.407538741827011, "epoch": 2.3649289099526065, "grad_norm": 0.2817977964878082, "learning_rate": 0.0001588721366245433, "loss": 0.17246387898921967, "mean_token_accuracy": 0.9259490519762039, "num_tokens": 55398920.0, "step": 4491 }, { "entropy": 1.3910426497459412, "epoch": 2.3654555028962614, "grad_norm": 0.28504490852355957, "learning_rate": 0.0001588537216107778, "loss": 0.1968700885772705, "mean_token_accuracy": 0.9202799946069717, "num_tokens": 55411256.0, "step": 4492 }, { "entropy": 1.4219735264778137, "epoch": 2.365982095839916, "grad_norm": 0.2912696301937103, "learning_rate": 0.00015883530369685162, "loss": 0.2083374410867691, "mean_token_accuracy": 0.9184867888689041, "num_tokens": 55423592.0, "step": 4493 }, { "entropy": 1.343996375799179, "epoch": 2.3665086887835702, "grad_norm": 0.25932249426841736, "learning_rate": 0.00015881688288385808, "loss": 0.169301837682724, "mean_token_accuracy": 0.9262981861829758, "num_tokens": 55435928.0, "step": 4494 }, { "entropy": 1.4267469346523285, "epoch": 2.367035281727225, "grad_norm": 0.2699030339717865, "learning_rate": 0.00015879845917289074, "loss": 0.18538378179073334, "mean_token_accuracy": 0.9267265200614929, "num_tokens": 55448264.0, "step": 4495 }, { "entropy": 1.4803634285926819, "epoch": 2.3675618746708795, "grad_norm": 0.3319495618343353, "learning_rate": 0.00015878003256504327, "loss": 0.20425397157669067, "mean_token_accuracy": 0.9164634346961975, "num_tokens": 55460600.0, "step": 4496 }, { "entropy": 1.385725349187851, "epoch": 2.368088467614534, "grad_norm": 0.25805506110191345, "learning_rate": 0.0001587616030614096, "loss": 0.18095749616622925, "mean_token_accuracy": 0.922220304608345, "num_tokens": 55472936.0, "step": 4497 }, { "entropy": 1.4062891602516174, "epoch": 2.3686150605581884, "grad_norm": 0.25933024287223816, "learning_rate": 0.00015874317066308372, "loss": 0.18179509043693542, "mean_token_accuracy": 0.9226569682359695, "num_tokens": 55485272.0, "step": 4498 }, { "entropy": 1.4053870141506195, "epoch": 2.3691416535018432, "grad_norm": 0.2785022556781769, "learning_rate": 0.00015872473537115994, "loss": 0.19450442492961884, "mean_token_accuracy": 0.9210056364536285, "num_tokens": 55497608.0, "step": 4499 }, { "entropy": 1.346811443567276, "epoch": 2.3696682464454977, "grad_norm": 0.2664346992969513, "learning_rate": 0.0001587062971867326, "loss": 0.17768292129039764, "mean_token_accuracy": 0.926102340221405, "num_tokens": 55509944.0, "step": 4500 }, { "entropy": 1.528866469860077, "epoch": 2.370194839389152, "grad_norm": 0.3126022517681122, "learning_rate": 0.00015868785611089628, "loss": 0.2166975736618042, "mean_token_accuracy": 0.9128769040107727, "num_tokens": 55522280.0, "step": 4501 }, { "entropy": 1.4011040925979614, "epoch": 2.3707214323328065, "grad_norm": 0.261837363243103, "learning_rate": 0.00015866941214474572, "loss": 0.18179045617580414, "mean_token_accuracy": 0.923045888543129, "num_tokens": 55534616.0, "step": 4502 }, { "entropy": 1.3975766003131866, "epoch": 2.3712480252764614, "grad_norm": 0.2936818301677704, "learning_rate": 0.0001586509652893758, "loss": 0.22525236010551453, "mean_token_accuracy": 0.9070886373519897, "num_tokens": 55546952.0, "step": 4503 }, { "entropy": 1.379688709974289, "epoch": 2.371774618220116, "grad_norm": 0.27700334787368774, "learning_rate": 0.00015863251554588167, "loss": 0.21290606260299683, "mean_token_accuracy": 0.910546600818634, "num_tokens": 55559288.0, "step": 4504 }, { "entropy": 1.3719074726104736, "epoch": 2.3723012111637702, "grad_norm": 0.28597623109817505, "learning_rate": 0.00015861406291535853, "loss": 0.20922252535820007, "mean_token_accuracy": 0.9105053544044495, "num_tokens": 55571624.0, "step": 4505 }, { "entropy": 1.3768506050109863, "epoch": 2.372827804107425, "grad_norm": 0.2684311866760254, "learning_rate": 0.0001585956073989018, "loss": 0.20058728754520416, "mean_token_accuracy": 0.9121564775705338, "num_tokens": 55583960.0, "step": 4506 }, { "entropy": 1.3842982351779938, "epoch": 2.3733543970510795, "grad_norm": 0.2636588215827942, "learning_rate": 0.00015857714899760714, "loss": 0.19942373037338257, "mean_token_accuracy": 0.9159530699253082, "num_tokens": 55596296.0, "step": 4507 }, { "entropy": 1.406856209039688, "epoch": 2.373880989994734, "grad_norm": 0.27418437600135803, "learning_rate": 0.00015855868771257024, "loss": 0.20501425862312317, "mean_token_accuracy": 0.9155614525079727, "num_tokens": 55608632.0, "step": 4508 }, { "entropy": 1.4277390837669373, "epoch": 2.374407582938389, "grad_norm": 0.2765462398529053, "learning_rate": 0.00015854022354488707, "loss": 0.19365204870700836, "mean_token_accuracy": 0.9140615314245224, "num_tokens": 55620968.0, "step": 4509 }, { "entropy": 1.4029557406902313, "epoch": 2.3749341758820433, "grad_norm": 0.27889713644981384, "learning_rate": 0.00015852175649565375, "loss": 0.18732376396656036, "mean_token_accuracy": 0.9244106113910675, "num_tokens": 55633304.0, "step": 4510 }, { "entropy": 1.3472702205181122, "epoch": 2.3754607688256977, "grad_norm": 0.24661894142627716, "learning_rate": 0.00015850328656596656, "loss": 0.17409662902355194, "mean_token_accuracy": 0.9250094890594482, "num_tokens": 55645640.0, "step": 4511 }, { "entropy": 1.395214170217514, "epoch": 2.375987361769352, "grad_norm": 0.27474910020828247, "learning_rate": 0.00015848481375692195, "loss": 0.19719195365905762, "mean_token_accuracy": 0.9223782122135162, "num_tokens": 55657976.0, "step": 4512 }, { "entropy": 1.3260896503925323, "epoch": 2.376513954713007, "grad_norm": 0.26417186856269836, "learning_rate": 0.00015846633806961647, "loss": 0.19815877079963684, "mean_token_accuracy": 0.9204468429088593, "num_tokens": 55670312.0, "step": 4513 }, { "entropy": 1.3533766269683838, "epoch": 2.3770405476566614, "grad_norm": 0.2891894578933716, "learning_rate": 0.00015844785950514708, "loss": 0.1904796063899994, "mean_token_accuracy": 0.9149835109710693, "num_tokens": 55682648.0, "step": 4514 }, { "entropy": 1.3211008608341217, "epoch": 2.377567140600316, "grad_norm": 0.26906976103782654, "learning_rate": 0.00015842937806461057, "loss": 0.1900303214788437, "mean_token_accuracy": 0.9222564399242401, "num_tokens": 55694984.0, "step": 4515 }, { "entropy": 1.3689544200897217, "epoch": 2.3780937335439707, "grad_norm": 0.2991812229156494, "learning_rate": 0.0001584108937491042, "loss": 0.20970046520233154, "mean_token_accuracy": 0.9113328009843826, "num_tokens": 55707320.0, "step": 4516 }, { "entropy": 1.3300418257713318, "epoch": 2.378620326487625, "grad_norm": 0.26500844955444336, "learning_rate": 0.00015839240655972521, "loss": 0.19760391116142273, "mean_token_accuracy": 0.9200556874275208, "num_tokens": 55719656.0, "step": 4517 }, { "entropy": 1.3151434361934662, "epoch": 2.3791469194312795, "grad_norm": 0.2675932049751282, "learning_rate": 0.00015837391649757112, "loss": 0.1939803957939148, "mean_token_accuracy": 0.9216755032539368, "num_tokens": 55731992.0, "step": 4518 }, { "entropy": 1.3362997472286224, "epoch": 2.379673512374934, "grad_norm": 0.28336596488952637, "learning_rate": 0.00015835542356373953, "loss": 0.1987985372543335, "mean_token_accuracy": 0.9186425060033798, "num_tokens": 55744328.0, "step": 4519 }, { "entropy": 1.3139479160308838, "epoch": 2.380200105318589, "grad_norm": 0.2725384831428528, "learning_rate": 0.0001583369277593283, "loss": 0.19263529777526855, "mean_token_accuracy": 0.9191529750823975, "num_tokens": 55756664.0, "step": 4520 }, { "entropy": 1.3443782925605774, "epoch": 2.3807266982622433, "grad_norm": 0.2858370840549469, "learning_rate": 0.00015831842908543535, "loss": 0.18691514432430267, "mean_token_accuracy": 0.9257304817438126, "num_tokens": 55769000.0, "step": 4521 }, { "entropy": 1.3328638076782227, "epoch": 2.3812532912058977, "grad_norm": 0.29020607471466064, "learning_rate": 0.00015829992754315893, "loss": 0.1900632083415985, "mean_token_accuracy": 0.9172062873840332, "num_tokens": 55781336.0, "step": 4522 }, { "entropy": 1.2869420647621155, "epoch": 2.3817798841495526, "grad_norm": 0.25875672698020935, "learning_rate": 0.0001582814231335973, "loss": 0.17436552047729492, "mean_token_accuracy": 0.9253624975681305, "num_tokens": 55793672.0, "step": 4523 }, { "entropy": 1.2536731362342834, "epoch": 2.382306477093207, "grad_norm": 0.28048229217529297, "learning_rate": 0.00015826291585784898, "loss": 0.1865769326686859, "mean_token_accuracy": 0.9238808900117874, "num_tokens": 55806008.0, "step": 4524 }, { "entropy": 1.23280930519104, "epoch": 2.3828330700368614, "grad_norm": 0.2543039321899414, "learning_rate": 0.00015824440571701268, "loss": 0.17272458970546722, "mean_token_accuracy": 0.9268594980239868, "num_tokens": 55818344.0, "step": 4525 }, { "entropy": 1.2371512353420258, "epoch": 2.3833596629805163, "grad_norm": 0.26792868971824646, "learning_rate": 0.00015822589271218717, "loss": 0.19100236892700195, "mean_token_accuracy": 0.9224984645843506, "num_tokens": 55830680.0, "step": 4526 }, { "entropy": 1.2913587987422943, "epoch": 2.3838862559241707, "grad_norm": 0.29319706559181213, "learning_rate": 0.00015820737684447148, "loss": 0.18937891721725464, "mean_token_accuracy": 0.9151134341955185, "num_tokens": 55843016.0, "step": 4527 }, { "entropy": 1.2287176549434662, "epoch": 2.384412848867825, "grad_norm": 0.28001704812049866, "learning_rate": 0.00015818885811496485, "loss": 0.18166252970695496, "mean_token_accuracy": 0.9257358908653259, "num_tokens": 55855352.0, "step": 4528 }, { "entropy": 1.2606195509433746, "epoch": 2.3849394418114795, "grad_norm": 0.3030807375907898, "learning_rate": 0.0001581703365247665, "loss": 0.2063525915145874, "mean_token_accuracy": 0.9173136651515961, "num_tokens": 55867688.0, "step": 4529 }, { "entropy": 1.2028226852416992, "epoch": 2.3854660347551344, "grad_norm": 0.26009899377822876, "learning_rate": 0.00015815181207497612, "loss": 0.17096900939941406, "mean_token_accuracy": 0.929774135351181, "num_tokens": 55880024.0, "step": 4530 }, { "entropy": 1.2134665250778198, "epoch": 2.385992627698789, "grad_norm": 0.2998177111148834, "learning_rate": 0.00015813328476669324, "loss": 0.20142899453639984, "mean_token_accuracy": 0.9195566177368164, "num_tokens": 55892360.0, "step": 4531 }, { "entropy": 1.1590828597545624, "epoch": 2.3865192206424433, "grad_norm": 0.28007999062538147, "learning_rate": 0.00015811475460101785, "loss": 0.18869996070861816, "mean_token_accuracy": 0.9209212511777878, "num_tokens": 55904696.0, "step": 4532 }, { "entropy": 1.1737896800041199, "epoch": 2.387045813586098, "grad_norm": 0.2900781035423279, "learning_rate": 0.00015809622157904985, "loss": 0.18893763422966003, "mean_token_accuracy": 0.9233887642621994, "num_tokens": 55917032.0, "step": 4533 }, { "entropy": 1.2201267778873444, "epoch": 2.3875724065297526, "grad_norm": 0.3050040900707245, "learning_rate": 0.0001580776857018895, "loss": 0.20816883444786072, "mean_token_accuracy": 0.9114056080579758, "num_tokens": 55929368.0, "step": 4534 }, { "entropy": 1.1619028151035309, "epoch": 2.388098999473407, "grad_norm": 0.24892818927764893, "learning_rate": 0.00015805914697063724, "loss": 0.17240609228610992, "mean_token_accuracy": 0.9284298419952393, "num_tokens": 55941704.0, "step": 4535 }, { "entropy": 1.1720469892024994, "epoch": 2.3886255924170614, "grad_norm": 0.2732456624507904, "learning_rate": 0.00015804060538639347, "loss": 0.18014155328273773, "mean_token_accuracy": 0.9247136563062668, "num_tokens": 55954040.0, "step": 4536 }, { "entropy": 1.213779777288437, "epoch": 2.3891521853607163, "grad_norm": 0.289726585149765, "learning_rate": 0.00015802206095025899, "loss": 0.19931016862392426, "mean_token_accuracy": 0.9159621000289917, "num_tokens": 55966376.0, "step": 4537 }, { "entropy": 1.2300103604793549, "epoch": 2.3896787783043707, "grad_norm": 0.2903289794921875, "learning_rate": 0.00015800351366333462, "loss": 0.2093479335308075, "mean_token_accuracy": 0.9123352319002151, "num_tokens": 55978712.0, "step": 4538 }, { "entropy": 1.2362595200538635, "epoch": 2.390205371248025, "grad_norm": 0.276406854391098, "learning_rate": 0.00015798496352672145, "loss": 0.1859022080898285, "mean_token_accuracy": 0.9236205220222473, "num_tokens": 55991048.0, "step": 4539 }, { "entropy": 1.159458488225937, "epoch": 2.39073196419168, "grad_norm": 0.2462838739156723, "learning_rate": 0.00015796641054152067, "loss": 0.1730072796344757, "mean_token_accuracy": 0.9274507462978363, "num_tokens": 56003384.0, "step": 4540 }, { "entropy": 1.2364217042922974, "epoch": 2.3912585571353344, "grad_norm": 0.2972487509250641, "learning_rate": 0.00015794785470883368, "loss": 0.19434306025505066, "mean_token_accuracy": 0.9204827547073364, "num_tokens": 56015720.0, "step": 4541 }, { "entropy": 1.2326800525188446, "epoch": 2.391785150078989, "grad_norm": 0.26879581809043884, "learning_rate": 0.000157929296029762, "loss": 0.1797732710838318, "mean_token_accuracy": 0.9242551773786545, "num_tokens": 56028056.0, "step": 4542 }, { "entropy": 1.170352816581726, "epoch": 2.3923117430226437, "grad_norm": 0.26433271169662476, "learning_rate": 0.00015791073450540735, "loss": 0.18631601333618164, "mean_token_accuracy": 0.9216004759073257, "num_tokens": 56040392.0, "step": 4543 }, { "entropy": 1.1886663138866425, "epoch": 2.392838335966298, "grad_norm": 0.26627394556999207, "learning_rate": 0.00015789217013687166, "loss": 0.18448396027088165, "mean_token_accuracy": 0.9213402569293976, "num_tokens": 56052728.0, "step": 4544 }, { "entropy": 1.1851184666156769, "epoch": 2.3933649289099526, "grad_norm": 0.2651765048503876, "learning_rate": 0.00015787360292525697, "loss": 0.18697291612625122, "mean_token_accuracy": 0.9274520725011826, "num_tokens": 56065064.0, "step": 4545 }, { "entropy": 1.2112329304218292, "epoch": 2.393891521853607, "grad_norm": 0.28112831711769104, "learning_rate": 0.00015785503287166547, "loss": 0.19521315395832062, "mean_token_accuracy": 0.9178619235754013, "num_tokens": 56077400.0, "step": 4546 }, { "entropy": 1.263805478811264, "epoch": 2.394418114797262, "grad_norm": 0.29383382201194763, "learning_rate": 0.00015783645997719962, "loss": 0.2024495154619217, "mean_token_accuracy": 0.9234823882579803, "num_tokens": 56089736.0, "step": 4547 }, { "entropy": 1.2429666221141815, "epoch": 2.3949447077409163, "grad_norm": 0.27420487999916077, "learning_rate": 0.00015781788424296193, "loss": 0.19035124778747559, "mean_token_accuracy": 0.9219522327184677, "num_tokens": 56102072.0, "step": 4548 }, { "entropy": 1.2490891516208649, "epoch": 2.3954713006845707, "grad_norm": 0.27929991483688354, "learning_rate": 0.00015779930567005518, "loss": 0.2075713574886322, "mean_token_accuracy": 0.9149742126464844, "num_tokens": 56114408.0, "step": 4549 }, { "entropy": 1.2860136330127716, "epoch": 2.3959978936282256, "grad_norm": 0.27160221338272095, "learning_rate": 0.00015778072425958226, "loss": 0.17518314719200134, "mean_token_accuracy": 0.9276988953351974, "num_tokens": 56126744.0, "step": 4550 }, { "entropy": 1.2763722836971283, "epoch": 2.39652448657188, "grad_norm": 0.29390084743499756, "learning_rate": 0.0001577621400126462, "loss": 0.19787636399269104, "mean_token_accuracy": 0.9196744412183762, "num_tokens": 56139080.0, "step": 4551 }, { "entropy": 1.3100577592849731, "epoch": 2.3970510795155344, "grad_norm": 0.2876659333705902, "learning_rate": 0.00015774355293035025, "loss": 0.1936154067516327, "mean_token_accuracy": 0.9236638695001602, "num_tokens": 56151416.0, "step": 4552 }, { "entropy": 1.3262332379817963, "epoch": 2.397577672459189, "grad_norm": 0.26849564909935, "learning_rate": 0.00015772496301379787, "loss": 0.1760268211364746, "mean_token_accuracy": 0.923967570066452, "num_tokens": 56163752.0, "step": 4553 }, { "entropy": 1.3029709458351135, "epoch": 2.3981042654028437, "grad_norm": 0.29166650772094727, "learning_rate": 0.00015770637026409258, "loss": 0.18877920508384705, "mean_token_accuracy": 0.9225371479988098, "num_tokens": 56176088.0, "step": 4554 }, { "entropy": 1.3118659257888794, "epoch": 2.398630858346498, "grad_norm": 0.28362366557121277, "learning_rate": 0.00015768777468233816, "loss": 0.19103732705116272, "mean_token_accuracy": 0.9223171025514603, "num_tokens": 56188424.0, "step": 4555 }, { "entropy": 1.3041376173496246, "epoch": 2.3991574512901526, "grad_norm": 0.3170718550682068, "learning_rate": 0.0001576691762696385, "loss": 0.208947092294693, "mean_token_accuracy": 0.914543017745018, "num_tokens": 56200760.0, "step": 4556 }, { "entropy": 1.291472166776657, "epoch": 2.3996840442338074, "grad_norm": 0.2711356282234192, "learning_rate": 0.00015765057502709767, "loss": 0.18828198313713074, "mean_token_accuracy": 0.9219943135976791, "num_tokens": 56213096.0, "step": 4557 }, { "entropy": 1.2951588928699493, "epoch": 2.400210637177462, "grad_norm": 0.29720601439476013, "learning_rate": 0.0001576319709558199, "loss": 0.21101555228233337, "mean_token_accuracy": 0.9118272066116333, "num_tokens": 56225432.0, "step": 4558 }, { "entropy": 1.3469326496124268, "epoch": 2.4007372301211163, "grad_norm": 0.2986636757850647, "learning_rate": 0.00015761336405690967, "loss": 0.18926507234573364, "mean_token_accuracy": 0.9249073565006256, "num_tokens": 56237768.0, "step": 4559 }, { "entropy": 1.308281421661377, "epoch": 2.401263823064771, "grad_norm": 0.27620309591293335, "learning_rate": 0.00015759475433147155, "loss": 0.1896907240152359, "mean_token_accuracy": 0.9253196120262146, "num_tokens": 56250104.0, "step": 4560 }, { "entropy": 1.3006483912467957, "epoch": 2.4017904160084256, "grad_norm": 0.28648555278778076, "learning_rate": 0.0001575761417806102, "loss": 0.1915302276611328, "mean_token_accuracy": 0.921184629201889, "num_tokens": 56262440.0, "step": 4561 }, { "entropy": 1.3277715742588043, "epoch": 2.40231700895208, "grad_norm": 0.26527178287506104, "learning_rate": 0.00015755752640543068, "loss": 0.17917628586292267, "mean_token_accuracy": 0.9229338020086288, "num_tokens": 56274776.0, "step": 4562 }, { "entropy": 1.3829319775104523, "epoch": 2.4028436018957344, "grad_norm": 0.2874324321746826, "learning_rate": 0.00015753890820703796, "loss": 0.1934787929058075, "mean_token_accuracy": 0.9214570224285126, "num_tokens": 56287112.0, "step": 4563 }, { "entropy": 1.3280232846736908, "epoch": 2.4033701948393893, "grad_norm": 0.24855974316596985, "learning_rate": 0.00015752028718653735, "loss": 0.19005198776721954, "mean_token_accuracy": 0.9208149313926697, "num_tokens": 56299448.0, "step": 4564 }, { "entropy": 1.3538621664047241, "epoch": 2.4038967877830437, "grad_norm": 0.2776485085487366, "learning_rate": 0.00015750166334503428, "loss": 0.19672241806983948, "mean_token_accuracy": 0.9181719124317169, "num_tokens": 56311784.0, "step": 4565 }, { "entropy": 1.368317574262619, "epoch": 2.404423380726698, "grad_norm": 0.30098727345466614, "learning_rate": 0.00015748303668363428, "loss": 0.20025476813316345, "mean_token_accuracy": 0.916120171546936, "num_tokens": 56324120.0, "step": 4566 }, { "entropy": 1.3438273072242737, "epoch": 2.4049499736703526, "grad_norm": 0.25104859471321106, "learning_rate": 0.00015746440720344317, "loss": 0.18177089095115662, "mean_token_accuracy": 0.9239592254161835, "num_tokens": 56336456.0, "step": 4567 }, { "entropy": 1.3766308426856995, "epoch": 2.4054765666140074, "grad_norm": 0.27121055126190186, "learning_rate": 0.00015744577490556683, "loss": 0.2015809267759323, "mean_token_accuracy": 0.9173483699560165, "num_tokens": 56348792.0, "step": 4568 }, { "entropy": 1.4611666798591614, "epoch": 2.406003159557662, "grad_norm": 0.3079581558704376, "learning_rate": 0.00015742713979111135, "loss": 0.19990572333335876, "mean_token_accuracy": 0.9156835675239563, "num_tokens": 56361128.0, "step": 4569 }, { "entropy": 1.457626760005951, "epoch": 2.4065297525013163, "grad_norm": 0.2969047725200653, "learning_rate": 0.00015740850186118306, "loss": 0.2033241093158722, "mean_token_accuracy": 0.92415751516819, "num_tokens": 56373464.0, "step": 4570 }, { "entropy": 1.4298239052295685, "epoch": 2.407056345444971, "grad_norm": 0.31620898842811584, "learning_rate": 0.00015738986111688832, "loss": 0.22344595193862915, "mean_token_accuracy": 0.9087575227022171, "num_tokens": 56385800.0, "step": 4571 }, { "entropy": 1.4056819081306458, "epoch": 2.4075829383886256, "grad_norm": 0.27822446823120117, "learning_rate": 0.0001573712175593337, "loss": 0.19859078526496887, "mean_token_accuracy": 0.923060268163681, "num_tokens": 56398136.0, "step": 4572 }, { "entropy": 1.3622363805770874, "epoch": 2.40810953133228, "grad_norm": 0.2607809603214264, "learning_rate": 0.00015735257118962604, "loss": 0.1764621138572693, "mean_token_accuracy": 0.9253451228141785, "num_tokens": 56410472.0, "step": 4573 }, { "entropy": 1.4228957891464233, "epoch": 2.408636124275935, "grad_norm": 0.2639370560646057, "learning_rate": 0.0001573339220088722, "loss": 0.19621466100215912, "mean_token_accuracy": 0.920293316245079, "num_tokens": 56422808.0, "step": 4574 }, { "entropy": 1.353748857975006, "epoch": 2.4091627172195893, "grad_norm": 0.2694760859012604, "learning_rate": 0.00015731527001817928, "loss": 0.18804813921451569, "mean_token_accuracy": 0.9210447818040848, "num_tokens": 56435144.0, "step": 4575 }, { "entropy": 1.3881179988384247, "epoch": 2.4096893101632437, "grad_norm": 0.2707253694534302, "learning_rate": 0.00015729661521865452, "loss": 0.18320326507091522, "mean_token_accuracy": 0.9270624965429306, "num_tokens": 56447480.0, "step": 4576 }, { "entropy": 1.3343448638916016, "epoch": 2.4102159031068986, "grad_norm": 0.27668213844299316, "learning_rate": 0.00015727795761140545, "loss": 0.1835266351699829, "mean_token_accuracy": 0.9257790744304657, "num_tokens": 56459816.0, "step": 4577 }, { "entropy": 1.321186900138855, "epoch": 2.410742496050553, "grad_norm": 0.27669277787208557, "learning_rate": 0.00015725929719753956, "loss": 0.18208348751068115, "mean_token_accuracy": 0.9222432971000671, "num_tokens": 56472152.0, "step": 4578 }, { "entropy": 1.3364296555519104, "epoch": 2.4112690889942074, "grad_norm": 0.28166496753692627, "learning_rate": 0.00015724063397816468, "loss": 0.1879100501537323, "mean_token_accuracy": 0.919008269906044, "num_tokens": 56484488.0, "step": 4579 }, { "entropy": 1.3278461694717407, "epoch": 2.411795681937862, "grad_norm": 0.27643710374832153, "learning_rate": 0.00015722196795438866, "loss": 0.18816009163856506, "mean_token_accuracy": 0.9239133149385452, "num_tokens": 56496824.0, "step": 4580 }, { "entropy": 1.2958170771598816, "epoch": 2.4123222748815167, "grad_norm": 0.27953317761421204, "learning_rate": 0.0001572032991273196, "loss": 0.17952555418014526, "mean_token_accuracy": 0.9238559603691101, "num_tokens": 56509160.0, "step": 4581 }, { "entropy": 1.3013927638530731, "epoch": 2.412848867825171, "grad_norm": 0.2748692035675049, "learning_rate": 0.00015718462749806587, "loss": 0.19492384791374207, "mean_token_accuracy": 0.9214185774326324, "num_tokens": 56521496.0, "step": 4582 }, { "entropy": 1.3403103947639465, "epoch": 2.4133754607688256, "grad_norm": 0.30991989374160767, "learning_rate": 0.00015716595306773578, "loss": 0.19997966289520264, "mean_token_accuracy": 0.9153329730033875, "num_tokens": 56533832.0, "step": 4583 }, { "entropy": 1.3335986733436584, "epoch": 2.41390205371248, "grad_norm": 0.29624128341674805, "learning_rate": 0.00015714727583743797, "loss": 0.2043485939502716, "mean_token_accuracy": 0.9172103554010391, "num_tokens": 56546168.0, "step": 4584 }, { "entropy": 1.310105711221695, "epoch": 2.414428646656135, "grad_norm": 0.2946057915687561, "learning_rate": 0.00015712859580828116, "loss": 0.20172706246376038, "mean_token_accuracy": 0.9106387346982956, "num_tokens": 56558504.0, "step": 4585 }, { "entropy": 1.3054699003696442, "epoch": 2.4149552395997893, "grad_norm": 0.26526352763175964, "learning_rate": 0.00015710991298137434, "loss": 0.1864761859178543, "mean_token_accuracy": 0.9250095337629318, "num_tokens": 56570840.0, "step": 4586 }, { "entropy": 1.3284521996974945, "epoch": 2.4154818325434437, "grad_norm": 0.26133716106414795, "learning_rate": 0.00015709122735782654, "loss": 0.17758479714393616, "mean_token_accuracy": 0.9264996349811554, "num_tokens": 56583176.0, "step": 4587 }, { "entropy": 1.2835633158683777, "epoch": 2.4160084254870986, "grad_norm": 0.2573343515396118, "learning_rate": 0.00015707253893874705, "loss": 0.17470473051071167, "mean_token_accuracy": 0.9288149029016495, "num_tokens": 56595512.0, "step": 4588 }, { "entropy": 1.341663807630539, "epoch": 2.416535018430753, "grad_norm": 0.28183892369270325, "learning_rate": 0.0001570538477252453, "loss": 0.18871092796325684, "mean_token_accuracy": 0.923402264714241, "num_tokens": 56607848.0, "step": 4589 }, { "entropy": 1.3551491498947144, "epoch": 2.4170616113744074, "grad_norm": 0.2750586271286011, "learning_rate": 0.0001570351537184308, "loss": 0.19159851968288422, "mean_token_accuracy": 0.9253100901842117, "num_tokens": 56620184.0, "step": 4590 }, { "entropy": 1.361526906490326, "epoch": 2.4175882043180623, "grad_norm": 0.28902900218963623, "learning_rate": 0.0001570164569194134, "loss": 0.20224696397781372, "mean_token_accuracy": 0.9204160273075104, "num_tokens": 56632520.0, "step": 4591 }, { "entropy": 1.3157592415809631, "epoch": 2.4181147972617167, "grad_norm": 0.2721328139305115, "learning_rate": 0.00015699775732930303, "loss": 0.20679977536201477, "mean_token_accuracy": 0.9149771928787231, "num_tokens": 56644856.0, "step": 4592 }, { "entropy": 1.3480108678340912, "epoch": 2.418641390205371, "grad_norm": 0.24639494717121124, "learning_rate": 0.00015697905494920967, "loss": 0.18107910454273224, "mean_token_accuracy": 0.9280508905649185, "num_tokens": 56657192.0, "step": 4593 }, { "entropy": 1.340236097574234, "epoch": 2.419167983149026, "grad_norm": 0.2795374393463135, "learning_rate": 0.00015696034978024368, "loss": 0.20761287212371826, "mean_token_accuracy": 0.9111906141042709, "num_tokens": 56669528.0, "step": 4594 }, { "entropy": 1.3402322232723236, "epoch": 2.4196945760926805, "grad_norm": 0.2711165249347687, "learning_rate": 0.00015694164182351538, "loss": 0.1791497766971588, "mean_token_accuracy": 0.9271443635225296, "num_tokens": 56681864.0, "step": 4595 }, { "entropy": 1.3855849206447601, "epoch": 2.420221169036335, "grad_norm": 0.2867280840873718, "learning_rate": 0.00015692293108013545, "loss": 0.19872815907001495, "mean_token_accuracy": 0.9179540723562241, "num_tokens": 56694200.0, "step": 4596 }, { "entropy": 1.3175525963306427, "epoch": 2.4207477619799893, "grad_norm": 0.27587011456489563, "learning_rate": 0.00015690421755121457, "loss": 0.18959006667137146, "mean_token_accuracy": 0.9211609661579132, "num_tokens": 56706536.0, "step": 4597 }, { "entropy": 1.3644810616970062, "epoch": 2.421274354923644, "grad_norm": 0.2764270305633545, "learning_rate": 0.00015688550123786366, "loss": 0.1940041482448578, "mean_token_accuracy": 0.9237237423658371, "num_tokens": 56718872.0, "step": 4598 }, { "entropy": 1.3711154758930206, "epoch": 2.4218009478672986, "grad_norm": 0.2801766097545624, "learning_rate": 0.00015686678214119382, "loss": 0.1970905065536499, "mean_token_accuracy": 0.9176339656114578, "num_tokens": 56731208.0, "step": 4599 }, { "entropy": 1.3100129067897797, "epoch": 2.422327540810953, "grad_norm": 0.2844012975692749, "learning_rate": 0.0001568480602623163, "loss": 0.1999197155237198, "mean_token_accuracy": 0.9149242490530014, "num_tokens": 56743544.0, "step": 4600 }, { "entropy": 1.3215259611606598, "epoch": 2.4228541337546075, "grad_norm": 0.2659996747970581, "learning_rate": 0.00015682933560234248, "loss": 0.1908705085515976, "mean_token_accuracy": 0.9223310500383377, "num_tokens": 56755880.0, "step": 4601 }, { "entropy": 1.3315446376800537, "epoch": 2.4233807266982623, "grad_norm": 0.28083324432373047, "learning_rate": 0.00015681060816238394, "loss": 0.1834309995174408, "mean_token_accuracy": 0.9284676909446716, "num_tokens": 56768216.0, "step": 4602 }, { "entropy": 1.2885978817939758, "epoch": 2.4239073196419167, "grad_norm": 0.2809126675128937, "learning_rate": 0.00015679187794355242, "loss": 0.1866403967142105, "mean_token_accuracy": 0.9212284684181213, "num_tokens": 56780552.0, "step": 4603 }, { "entropy": 1.2973859310150146, "epoch": 2.424433912585571, "grad_norm": 0.2610211670398712, "learning_rate": 0.00015677314494695984, "loss": 0.17383259534835815, "mean_token_accuracy": 0.927782341837883, "num_tokens": 56792888.0, "step": 4604 }, { "entropy": 1.3476527631282806, "epoch": 2.424960505529226, "grad_norm": 0.3418804705142975, "learning_rate": 0.00015675440917371826, "loss": 0.19662517309188843, "mean_token_accuracy": 0.9165080189704895, "num_tokens": 56805224.0, "step": 4605 }, { "entropy": 1.3011980652809143, "epoch": 2.4254870984728805, "grad_norm": 0.2649618983268738, "learning_rate": 0.00015673567062493993, "loss": 0.1870417296886444, "mean_token_accuracy": 0.9290430843830109, "num_tokens": 56817560.0, "step": 4606 }, { "entropy": 1.3310189843177795, "epoch": 2.426013691416535, "grad_norm": 0.2768966257572174, "learning_rate": 0.00015671692930173723, "loss": 0.2032088190317154, "mean_token_accuracy": 0.9112291485071182, "num_tokens": 56829896.0, "step": 4607 }, { "entropy": 1.3227407336235046, "epoch": 2.4265402843601898, "grad_norm": 0.2667352259159088, "learning_rate": 0.0001566981852052227, "loss": 0.17368647456169128, "mean_token_accuracy": 0.9290298819541931, "num_tokens": 56842232.0, "step": 4608 }, { "entropy": 1.3284336924552917, "epoch": 2.427066877303844, "grad_norm": 0.2627871632575989, "learning_rate": 0.0001566794383365091, "loss": 0.1836368292570114, "mean_token_accuracy": 0.9237141758203506, "num_tokens": 56854568.0, "step": 4609 }, { "entropy": 1.3730064928531647, "epoch": 2.4275934702474986, "grad_norm": 0.27761170268058777, "learning_rate": 0.00015666068869670932, "loss": 0.20169535279273987, "mean_token_accuracy": 0.9138482213020325, "num_tokens": 56866904.0, "step": 4610 }, { "entropy": 1.3395865857601166, "epoch": 2.4281200631911535, "grad_norm": 0.3002219796180725, "learning_rate": 0.0001566419362869364, "loss": 0.2141709327697754, "mean_token_accuracy": 0.9107076972723007, "num_tokens": 56879240.0, "step": 4611 }, { "entropy": 1.387347549200058, "epoch": 2.428646656134808, "grad_norm": 0.28495123982429504, "learning_rate": 0.00015662318110830356, "loss": 0.19449102878570557, "mean_token_accuracy": 0.9209498912096024, "num_tokens": 56891576.0, "step": 4612 }, { "entropy": 1.3817225992679596, "epoch": 2.4291732490784623, "grad_norm": 0.2706870138645172, "learning_rate": 0.00015660442316192425, "loss": 0.18900935351848602, "mean_token_accuracy": 0.9174584001302719, "num_tokens": 56903912.0, "step": 4613 }, { "entropy": 1.352656215429306, "epoch": 2.4296998420221168, "grad_norm": 0.2922493815422058, "learning_rate": 0.00015658566244891193, "loss": 0.19300967454910278, "mean_token_accuracy": 0.9183215498924255, "num_tokens": 56916248.0, "step": 4614 }, { "entropy": 1.3354830145835876, "epoch": 2.4302264349657716, "grad_norm": 0.24328167736530304, "learning_rate": 0.00015656689897038036, "loss": 0.17530909180641174, "mean_token_accuracy": 0.9271158427000046, "num_tokens": 56928584.0, "step": 4615 }, { "entropy": 1.387416660785675, "epoch": 2.430753027909426, "grad_norm": 0.2972657382488251, "learning_rate": 0.0001565481327274434, "loss": 0.1807890385389328, "mean_token_accuracy": 0.9254136830568314, "num_tokens": 56940920.0, "step": 4616 }, { "entropy": 1.4199165403842926, "epoch": 2.4312796208530805, "grad_norm": 0.2991303503513336, "learning_rate": 0.0001565293637212151, "loss": 0.20695003867149353, "mean_token_accuracy": 0.9172242283821106, "num_tokens": 56953256.0, "step": 4617 }, { "entropy": 1.3269080817699432, "epoch": 2.431806213796735, "grad_norm": 0.26729339361190796, "learning_rate": 0.00015651059195280972, "loss": 0.19468078017234802, "mean_token_accuracy": 0.9203730225563049, "num_tokens": 56965592.0, "step": 4618 }, { "entropy": 1.3127374053001404, "epoch": 2.4323328067403898, "grad_norm": 0.26924213767051697, "learning_rate": 0.0001564918174233415, "loss": 0.19689175486564636, "mean_token_accuracy": 0.9202268719673157, "num_tokens": 56977928.0, "step": 4619 }, { "entropy": 1.3146660923957825, "epoch": 2.432859399684044, "grad_norm": 0.2669108510017395, "learning_rate": 0.00015647304013392512, "loss": 0.17507515847682953, "mean_token_accuracy": 0.9252168834209442, "num_tokens": 56990264.0, "step": 4620 }, { "entropy": 1.348682701587677, "epoch": 2.4333859926276986, "grad_norm": 0.29818832874298096, "learning_rate": 0.00015645426008567518, "loss": 0.19781912863254547, "mean_token_accuracy": 0.9172385036945343, "num_tokens": 57002600.0, "step": 4621 }, { "entropy": 1.3332387804985046, "epoch": 2.4339125855713535, "grad_norm": 0.26270851492881775, "learning_rate": 0.0001564354772797066, "loss": 0.18425442278385162, "mean_token_accuracy": 0.9268904775381088, "num_tokens": 57014936.0, "step": 4622 }, { "entropy": 1.342206448316574, "epoch": 2.434439178515008, "grad_norm": 0.2695198059082031, "learning_rate": 0.00015641669171713432, "loss": 0.18070070445537567, "mean_token_accuracy": 0.9249268621206284, "num_tokens": 57027272.0, "step": 4623 }, { "entropy": 1.3906873166561127, "epoch": 2.4349657714586623, "grad_norm": 0.3107193410396576, "learning_rate": 0.0001563979033990737, "loss": 0.1972734034061432, "mean_token_accuracy": 0.9214301854372025, "num_tokens": 57039608.0, "step": 4624 }, { "entropy": 1.4046538770198822, "epoch": 2.435492364402317, "grad_norm": 0.285004585981369, "learning_rate": 0.00015637911232663988, "loss": 0.18564899265766144, "mean_token_accuracy": 0.9255692511796951, "num_tokens": 57051944.0, "step": 4625 }, { "entropy": 1.3951005041599274, "epoch": 2.4360189573459716, "grad_norm": 0.27796947956085205, "learning_rate": 0.0001563603185009485, "loss": 0.19178025424480438, "mean_token_accuracy": 0.9215326011180878, "num_tokens": 57064280.0, "step": 4626 }, { "entropy": 1.3433052897453308, "epoch": 2.436545550289626, "grad_norm": 0.2718515992164612, "learning_rate": 0.00015634152192311524, "loss": 0.17776957154273987, "mean_token_accuracy": 0.9261139184236526, "num_tokens": 57076616.0, "step": 4627 }, { "entropy": 1.4135821163654327, "epoch": 2.437072143233281, "grad_norm": 0.288688987493515, "learning_rate": 0.00015632272259425597, "loss": 0.18565590679645538, "mean_token_accuracy": 0.9266521334648132, "num_tokens": 57088952.0, "step": 4628 }, { "entropy": 1.384842336177826, "epoch": 2.4375987361769353, "grad_norm": 0.2708379030227661, "learning_rate": 0.00015630392051548653, "loss": 0.19071045517921448, "mean_token_accuracy": 0.9206132292747498, "num_tokens": 57101288.0, "step": 4629 }, { "entropy": 1.3972707092761993, "epoch": 2.4381253291205898, "grad_norm": 0.29080888628959656, "learning_rate": 0.0001562851156879233, "loss": 0.1984952986240387, "mean_token_accuracy": 0.913146585226059, "num_tokens": 57113624.0, "step": 4630 }, { "entropy": 1.3927036225795746, "epoch": 2.438651922064244, "grad_norm": 0.2511928379535675, "learning_rate": 0.00015626630811268251, "loss": 0.16358304023742676, "mean_token_accuracy": 0.9305144250392914, "num_tokens": 57125960.0, "step": 4631 }, { "entropy": 1.3519012033939362, "epoch": 2.439178515007899, "grad_norm": 0.27660346031188965, "learning_rate": 0.00015624749779088063, "loss": 0.19364917278289795, "mean_token_accuracy": 0.9169550985097885, "num_tokens": 57138296.0, "step": 4632 }, { "entropy": 1.364226907491684, "epoch": 2.4397051079515535, "grad_norm": 0.28648045659065247, "learning_rate": 0.00015622868472363438, "loss": 0.19593121111392975, "mean_token_accuracy": 0.9160383343696594, "num_tokens": 57150632.0, "step": 4633 }, { "entropy": 1.35571950674057, "epoch": 2.440231700895208, "grad_norm": 0.2771262526512146, "learning_rate": 0.00015620986891206058, "loss": 0.19743886590003967, "mean_token_accuracy": 0.9158811867237091, "num_tokens": 57162968.0, "step": 4634 }, { "entropy": 1.3340860903263092, "epoch": 2.4407582938388623, "grad_norm": 0.26926276087760925, "learning_rate": 0.00015619105035727618, "loss": 0.1867595613002777, "mean_token_accuracy": 0.9221925735473633, "num_tokens": 57175304.0, "step": 4635 }, { "entropy": 1.3448993861675262, "epoch": 2.441284886782517, "grad_norm": 0.24788318574428558, "learning_rate": 0.0001561722290603983, "loss": 0.1681167185306549, "mean_token_accuracy": 0.9328633397817612, "num_tokens": 57187640.0, "step": 4636 }, { "entropy": 1.3575890362262726, "epoch": 2.4418114797261716, "grad_norm": 0.251751571893692, "learning_rate": 0.00015615340502254433, "loss": 0.17021462321281433, "mean_token_accuracy": 0.9230402410030365, "num_tokens": 57199976.0, "step": 4637 }, { "entropy": 1.3393411338329315, "epoch": 2.442338072669826, "grad_norm": 0.27187666296958923, "learning_rate": 0.00015613457824483173, "loss": 0.1871224194765091, "mean_token_accuracy": 0.9203449487686157, "num_tokens": 57212312.0, "step": 4638 }, { "entropy": 1.3779464364051819, "epoch": 2.442864665613481, "grad_norm": 0.29460328817367554, "learning_rate": 0.0001561157487283781, "loss": 0.19687990844249725, "mean_token_accuracy": 0.9119131118059158, "num_tokens": 57224648.0, "step": 4639 }, { "entropy": 1.3972814083099365, "epoch": 2.4433912585571353, "grad_norm": 0.27819696068763733, "learning_rate": 0.00015609691647430123, "loss": 0.19143208861351013, "mean_token_accuracy": 0.9203731119632721, "num_tokens": 57236984.0, "step": 4640 }, { "entropy": 1.325174868106842, "epoch": 2.4439178515007898, "grad_norm": 0.2797207236289978, "learning_rate": 0.00015607808148371908, "loss": 0.17681381106376648, "mean_token_accuracy": 0.9269442856311798, "num_tokens": 57249320.0, "step": 4641 }, { "entropy": 1.3612459897994995, "epoch": 2.4444444444444446, "grad_norm": 0.3185685873031616, "learning_rate": 0.00015605924375774986, "loss": 0.22030019760131836, "mean_token_accuracy": 0.9069929718971252, "num_tokens": 57261656.0, "step": 4642 }, { "entropy": 1.3378702402114868, "epoch": 2.444971037388099, "grad_norm": 0.2868621349334717, "learning_rate": 0.00015604040329751176, "loss": 0.1965884119272232, "mean_token_accuracy": 0.9148354679346085, "num_tokens": 57273992.0, "step": 4643 }, { "entropy": 1.3073699176311493, "epoch": 2.4454976303317535, "grad_norm": 0.29875674843788147, "learning_rate": 0.00015602156010412327, "loss": 0.20474374294281006, "mean_token_accuracy": 0.9165049344301224, "num_tokens": 57286328.0, "step": 4644 }, { "entropy": 1.2536769807338715, "epoch": 2.446024223275408, "grad_norm": 0.29766038060188293, "learning_rate": 0.00015600271417870297, "loss": 0.20265424251556396, "mean_token_accuracy": 0.9158102571964264, "num_tokens": 57298664.0, "step": 4645 }, { "entropy": 1.3608869314193726, "epoch": 2.446550816219063, "grad_norm": 0.29727551341056824, "learning_rate": 0.00015598386552236965, "loss": 0.20152640342712402, "mean_token_accuracy": 0.9140726178884506, "num_tokens": 57311000.0, "step": 4646 }, { "entropy": 1.3182392120361328, "epoch": 2.447077409162717, "grad_norm": 0.26966792345046997, "learning_rate": 0.00015596501413624227, "loss": 0.18247759342193604, "mean_token_accuracy": 0.9275117516517639, "num_tokens": 57323336.0, "step": 4647 }, { "entropy": 1.3680989146232605, "epoch": 2.4476040021063716, "grad_norm": 0.2620154321193695, "learning_rate": 0.0001559461600214399, "loss": 0.17146539688110352, "mean_token_accuracy": 0.928724393248558, "num_tokens": 57335672.0, "step": 4648 }, { "entropy": 1.362658977508545, "epoch": 2.4481305950500265, "grad_norm": 0.25905415415763855, "learning_rate": 0.0001559273031790818, "loss": 0.19432124495506287, "mean_token_accuracy": 0.9210942685604095, "num_tokens": 57348008.0, "step": 4649 }, { "entropy": 1.3837052881717682, "epoch": 2.448657187993681, "grad_norm": 0.26196369528770447, "learning_rate": 0.00015590844361028738, "loss": 0.18118348717689514, "mean_token_accuracy": 0.9250486940145493, "num_tokens": 57360344.0, "step": 4650 }, { "entropy": 1.3374846279621124, "epoch": 2.4491837809373354, "grad_norm": 0.25008776783943176, "learning_rate": 0.00015588958131617628, "loss": 0.17867028713226318, "mean_token_accuracy": 0.9267919510602951, "num_tokens": 57372680.0, "step": 4651 }, { "entropy": 1.4585446417331696, "epoch": 2.4497103738809898, "grad_norm": 0.30302000045776367, "learning_rate": 0.00015587071629786817, "loss": 0.19897569715976715, "mean_token_accuracy": 0.9165971130132675, "num_tokens": 57385016.0, "step": 4652 }, { "entropy": 1.3716599345207214, "epoch": 2.4502369668246446, "grad_norm": 0.2903025150299072, "learning_rate": 0.00015585184855648298, "loss": 0.19135521352291107, "mean_token_accuracy": 0.9185032695531845, "num_tokens": 57397352.0, "step": 4653 }, { "entropy": 1.3391970098018646, "epoch": 2.450763559768299, "grad_norm": 0.2981782853603363, "learning_rate": 0.0001558329780931408, "loss": 0.19125044345855713, "mean_token_accuracy": 0.9198358207941055, "num_tokens": 57409688.0, "step": 4654 }, { "entropy": 1.330566942691803, "epoch": 2.4512901527119535, "grad_norm": 0.28080058097839355, "learning_rate": 0.00015581410490896186, "loss": 0.19602055847644806, "mean_token_accuracy": 0.9168371856212616, "num_tokens": 57422024.0, "step": 4655 }, { "entropy": 1.3519669771194458, "epoch": 2.4518167456556084, "grad_norm": 0.29043126106262207, "learning_rate": 0.0001557952290050665, "loss": 0.20128756761550903, "mean_token_accuracy": 0.9184352457523346, "num_tokens": 57434360.0, "step": 4656 }, { "entropy": 1.3798860013484955, "epoch": 2.452343338599263, "grad_norm": 0.31429749727249146, "learning_rate": 0.00015577635038257532, "loss": 0.20553100109100342, "mean_token_accuracy": 0.9182298481464386, "num_tokens": 57446696.0, "step": 4657 }, { "entropy": 1.3261335492134094, "epoch": 2.452869931542917, "grad_norm": 0.28215980529785156, "learning_rate": 0.00015575746904260903, "loss": 0.1838231086730957, "mean_token_accuracy": 0.9184658974409103, "num_tokens": 57459032.0, "step": 4658 }, { "entropy": 1.3846520483493805, "epoch": 2.453396524486572, "grad_norm": 0.27965161204338074, "learning_rate": 0.00015573858498628851, "loss": 0.18266066908836365, "mean_token_accuracy": 0.9234927743673325, "num_tokens": 57471368.0, "step": 4659 }, { "entropy": 1.356047660112381, "epoch": 2.4539231174302265, "grad_norm": 0.2756958305835724, "learning_rate": 0.0001557196982147348, "loss": 0.1809377521276474, "mean_token_accuracy": 0.9223103225231171, "num_tokens": 57483704.0, "step": 4660 }, { "entropy": 1.3236099183559418, "epoch": 2.454449710373881, "grad_norm": 0.24765440821647644, "learning_rate": 0.00015570080872906903, "loss": 0.17653913795948029, "mean_token_accuracy": 0.926618218421936, "num_tokens": 57496040.0, "step": 4661 }, { "entropy": 1.3622512817382812, "epoch": 2.4549763033175354, "grad_norm": 0.2710879147052765, "learning_rate": 0.00015568191653041267, "loss": 0.1775762438774109, "mean_token_accuracy": 0.9290056526660919, "num_tokens": 57508376.0, "step": 4662 }, { "entropy": 1.4271577596664429, "epoch": 2.4555028962611902, "grad_norm": 0.3400026261806488, "learning_rate": 0.00015566302161988712, "loss": 0.21410952508449554, "mean_token_accuracy": 0.9081162363290787, "num_tokens": 57520712.0, "step": 4663 }, { "entropy": 1.3488382995128632, "epoch": 2.4560294892048447, "grad_norm": 0.2925370931625366, "learning_rate": 0.00015564412399861414, "loss": 0.19027042388916016, "mean_token_accuracy": 0.9205520153045654, "num_tokens": 57533048.0, "step": 4664 }, { "entropy": 1.37377467751503, "epoch": 2.456556082148499, "grad_norm": 0.29143059253692627, "learning_rate": 0.00015562522366771556, "loss": 0.2077019214630127, "mean_token_accuracy": 0.914614737033844, "num_tokens": 57545384.0, "step": 4665 }, { "entropy": 1.3595414757728577, "epoch": 2.457082675092154, "grad_norm": 0.2915399372577667, "learning_rate": 0.00015560632062831337, "loss": 0.19326642155647278, "mean_token_accuracy": 0.9180510342121124, "num_tokens": 57557720.0, "step": 4666 }, { "entropy": 1.3504066467285156, "epoch": 2.4576092680358084, "grad_norm": 0.2623111605644226, "learning_rate": 0.00015558741488152977, "loss": 0.19019611179828644, "mean_token_accuracy": 0.9178232103586197, "num_tokens": 57570056.0, "step": 4667 }, { "entropy": 1.4193410575389862, "epoch": 2.458135860979463, "grad_norm": 0.28917214274406433, "learning_rate": 0.00015556850642848698, "loss": 0.1902349442243576, "mean_token_accuracy": 0.9237756580114365, "num_tokens": 57582392.0, "step": 4668 }, { "entropy": 1.458041101694107, "epoch": 2.458662453923117, "grad_norm": 0.29611340165138245, "learning_rate": 0.00015554959527030763, "loss": 0.208420529961586, "mean_token_accuracy": 0.917582169175148, "num_tokens": 57594728.0, "step": 4669 }, { "entropy": 1.4654216468334198, "epoch": 2.459189046866772, "grad_norm": 0.3103972375392914, "learning_rate": 0.00015553068140811426, "loss": 0.19962163269519806, "mean_token_accuracy": 0.9165554493665695, "num_tokens": 57607064.0, "step": 4670 }, { "entropy": 1.4365287721157074, "epoch": 2.4597156398104265, "grad_norm": 0.2904442548751831, "learning_rate": 0.00015551176484302973, "loss": 0.2000875622034073, "mean_token_accuracy": 0.9224870204925537, "num_tokens": 57619400.0, "step": 4671 }, { "entropy": 1.4503169655799866, "epoch": 2.460242232754081, "grad_norm": 0.3007279634475708, "learning_rate": 0.00015549284557617697, "loss": 0.20989835262298584, "mean_token_accuracy": 0.9129480719566345, "num_tokens": 57631736.0, "step": 4672 }, { "entropy": 1.4487575888633728, "epoch": 2.460768825697736, "grad_norm": 0.2559841573238373, "learning_rate": 0.0001554739236086791, "loss": 0.17120632529258728, "mean_token_accuracy": 0.9269149452447891, "num_tokens": 57644072.0, "step": 4673 }, { "entropy": 1.5271873474121094, "epoch": 2.4612954186413902, "grad_norm": 0.29322513937950134, "learning_rate": 0.00015545499894165945, "loss": 0.20046186447143555, "mean_token_accuracy": 0.9165253788232803, "num_tokens": 57656408.0, "step": 4674 }, { "entropy": 1.4375866651535034, "epoch": 2.4618220115850447, "grad_norm": 0.24410809576511383, "learning_rate": 0.00015543607157624141, "loss": 0.18259111046791077, "mean_token_accuracy": 0.9227998405694962, "num_tokens": 57668744.0, "step": 4675 }, { "entropy": 1.431043803691864, "epoch": 2.4623486045286995, "grad_norm": 0.2558969259262085, "learning_rate": 0.00015541714151354866, "loss": 0.1708768606185913, "mean_token_accuracy": 0.9271507263183594, "num_tokens": 57681080.0, "step": 4676 }, { "entropy": 1.4392517507076263, "epoch": 2.462875197472354, "grad_norm": 0.27898111939430237, "learning_rate": 0.00015539820875470493, "loss": 0.18238875269889832, "mean_token_accuracy": 0.9190804958343506, "num_tokens": 57693416.0, "step": 4677 }, { "entropy": 1.4586999714374542, "epoch": 2.4634017904160084, "grad_norm": 0.2722666561603546, "learning_rate": 0.00015537927330083412, "loss": 0.1785045862197876, "mean_token_accuracy": 0.9265280216932297, "num_tokens": 57705752.0, "step": 4678 }, { "entropy": 1.4363029897212982, "epoch": 2.463928383359663, "grad_norm": 0.2756902277469635, "learning_rate": 0.00015536033515306036, "loss": 0.19934740662574768, "mean_token_accuracy": 0.9203079342842102, "num_tokens": 57718088.0, "step": 4679 }, { "entropy": 1.3940038681030273, "epoch": 2.4644549763033177, "grad_norm": 0.2740958034992218, "learning_rate": 0.00015534139431250789, "loss": 0.2017807960510254, "mean_token_accuracy": 0.9153221100568771, "num_tokens": 57730424.0, "step": 4680 }, { "entropy": 1.4366330802440643, "epoch": 2.464981569246972, "grad_norm": 0.2849027216434479, "learning_rate": 0.0001553224507803011, "loss": 0.20108060538768768, "mean_token_accuracy": 0.9228730350732803, "num_tokens": 57742760.0, "step": 4681 }, { "entropy": 1.4022051692008972, "epoch": 2.4655081621906265, "grad_norm": 0.25662413239479065, "learning_rate": 0.00015530350455756457, "loss": 0.1900719702243805, "mean_token_accuracy": 0.9239797294139862, "num_tokens": 57755096.0, "step": 4682 }, { "entropy": 1.3925521671772003, "epoch": 2.4660347551342814, "grad_norm": 0.27127277851104736, "learning_rate": 0.000155284555645423, "loss": 0.19370390474796295, "mean_token_accuracy": 0.9192579835653305, "num_tokens": 57767432.0, "step": 4683 }, { "entropy": 1.4185691177845001, "epoch": 2.466561348077936, "grad_norm": 0.25780409574508667, "learning_rate": 0.00015526560404500138, "loss": 0.1686680167913437, "mean_token_accuracy": 0.92674720287323, "num_tokens": 57779768.0, "step": 4684 }, { "entropy": 1.4209790229797363, "epoch": 2.4670879410215902, "grad_norm": 0.2740281820297241, "learning_rate": 0.00015524664975742457, "loss": 0.17835459113121033, "mean_token_accuracy": 0.9256129860877991, "num_tokens": 57792104.0, "step": 4685 }, { "entropy": 1.400107204914093, "epoch": 2.4676145339652447, "grad_norm": 0.2728610634803772, "learning_rate": 0.00015522769278381797, "loss": 0.19086140394210815, "mean_token_accuracy": 0.9191389083862305, "num_tokens": 57804440.0, "step": 4686 }, { "entropy": 1.3877354562282562, "epoch": 2.4681411269088995, "grad_norm": 0.2909792959690094, "learning_rate": 0.0001552087331253068, "loss": 0.19899430871009827, "mean_token_accuracy": 0.9197440594434738, "num_tokens": 57816776.0, "step": 4687 }, { "entropy": 1.379683405160904, "epoch": 2.468667719852554, "grad_norm": 0.2930801808834076, "learning_rate": 0.00015518977078301667, "loss": 0.19332917034626007, "mean_token_accuracy": 0.9176100790500641, "num_tokens": 57829112.0, "step": 4688 }, { "entropy": 1.384777694940567, "epoch": 2.4691943127962084, "grad_norm": 0.24330542981624603, "learning_rate": 0.00015517080575807319, "loss": 0.1706233024597168, "mean_token_accuracy": 0.9322277456521988, "num_tokens": 57841448.0, "step": 4689 }, { "entropy": 1.354981243610382, "epoch": 2.4697209057398632, "grad_norm": 0.2700625956058502, "learning_rate": 0.00015515183805160228, "loss": 0.17830899357795715, "mean_token_accuracy": 0.9246155321598053, "num_tokens": 57853784.0, "step": 4690 }, { "entropy": 1.348482221364975, "epoch": 2.4702474986835177, "grad_norm": 0.29389628767967224, "learning_rate": 0.00015513286766472993, "loss": 0.20552103221416473, "mean_token_accuracy": 0.9085098803043365, "num_tokens": 57866120.0, "step": 4691 }, { "entropy": 1.3473348915576935, "epoch": 2.470774091627172, "grad_norm": 0.291768878698349, "learning_rate": 0.00015511389459858224, "loss": 0.1977330446243286, "mean_token_accuracy": 0.91968734562397, "num_tokens": 57878456.0, "step": 4692 }, { "entropy": 1.3101034462451935, "epoch": 2.471300684570827, "grad_norm": 0.26433873176574707, "learning_rate": 0.0001550949188542856, "loss": 0.18745142221450806, "mean_token_accuracy": 0.9202346354722977, "num_tokens": 57890792.0, "step": 4693 }, { "entropy": 1.3141293823719025, "epoch": 2.4718272775144814, "grad_norm": 0.2735169231891632, "learning_rate": 0.00015507594043296646, "loss": 0.18631723523139954, "mean_token_accuracy": 0.9204375594854355, "num_tokens": 57903128.0, "step": 4694 }, { "entropy": 1.3004171252250671, "epoch": 2.472353870458136, "grad_norm": 0.2703790068626404, "learning_rate": 0.00015505695933575145, "loss": 0.2004447877407074, "mean_token_accuracy": 0.9170452207326889, "num_tokens": 57915464.0, "step": 4695 }, { "entropy": 1.3433512449264526, "epoch": 2.4728804634017902, "grad_norm": 0.31277215480804443, "learning_rate": 0.00015503797556376737, "loss": 0.21629300713539124, "mean_token_accuracy": 0.9137300401926041, "num_tokens": 57927800.0, "step": 4696 }, { "entropy": 1.3618537187576294, "epoch": 2.473407056345445, "grad_norm": 0.27481234073638916, "learning_rate": 0.0001550189891181412, "loss": 0.19332623481750488, "mean_token_accuracy": 0.9189375638961792, "num_tokens": 57940136.0, "step": 4697 }, { "entropy": 1.3607601523399353, "epoch": 2.4739336492890995, "grad_norm": 0.27814021706581116, "learning_rate": 0.000155, "loss": 0.20003022253513336, "mean_token_accuracy": 0.919358566403389, "num_tokens": 57952472.0, "step": 4698 }, { "entropy": 1.341829001903534, "epoch": 2.474460242232754, "grad_norm": 0.29070931673049927, "learning_rate": 0.0001549810082104711, "loss": 0.20077884197235107, "mean_token_accuracy": 0.9115552604198456, "num_tokens": 57964808.0, "step": 4699 }, { "entropy": 1.3571709096431732, "epoch": 2.474986835176409, "grad_norm": 0.2642231285572052, "learning_rate": 0.00015496201375068193, "loss": 0.18121525645256042, "mean_token_accuracy": 0.9253357946872711, "num_tokens": 57977144.0, "step": 4700 }, { "entropy": 1.3776450157165527, "epoch": 2.4755134281200633, "grad_norm": 0.2865309715270996, "learning_rate": 0.00015494301662176006, "loss": 0.18393152952194214, "mean_token_accuracy": 0.9276510328054428, "num_tokens": 57989480.0, "step": 4701 }, { "entropy": 1.3750910758972168, "epoch": 2.4760400210637177, "grad_norm": 0.2893163561820984, "learning_rate": 0.00015492401682483324, "loss": 0.19169265031814575, "mean_token_accuracy": 0.9269598424434662, "num_tokens": 58001816.0, "step": 4702 }, { "entropy": 1.343192994594574, "epoch": 2.476566614007372, "grad_norm": 0.2709070146083832, "learning_rate": 0.00015490501436102934, "loss": 0.1982916295528412, "mean_token_accuracy": 0.9179317057132721, "num_tokens": 58014152.0, "step": 4703 }, { "entropy": 1.283618688583374, "epoch": 2.477093206951027, "grad_norm": 0.26297813653945923, "learning_rate": 0.0001548860092314765, "loss": 0.18507333099842072, "mean_token_accuracy": 0.9239300638437271, "num_tokens": 58026488.0, "step": 4704 }, { "entropy": 1.3479060232639313, "epoch": 2.4776197998946814, "grad_norm": 0.2526850998401642, "learning_rate": 0.00015486700143730288, "loss": 0.16395074129104614, "mean_token_accuracy": 0.9379178881645203, "num_tokens": 58038824.0, "step": 4705 }, { "entropy": 1.3700522780418396, "epoch": 2.478146392838336, "grad_norm": 0.2784835696220398, "learning_rate": 0.00015484799097963695, "loss": 0.19287003576755524, "mean_token_accuracy": 0.918778121471405, "num_tokens": 58051160.0, "step": 4706 }, { "entropy": 1.3807547688484192, "epoch": 2.4786729857819907, "grad_norm": 0.2824748158454895, "learning_rate": 0.00015482897785960712, "loss": 0.18871180713176727, "mean_token_accuracy": 0.9191993176937103, "num_tokens": 58063496.0, "step": 4707 }, { "entropy": 1.4022415578365326, "epoch": 2.479199578725645, "grad_norm": 0.28391286730766296, "learning_rate": 0.0001548099620783422, "loss": 0.200555682182312, "mean_token_accuracy": 0.9131074696779251, "num_tokens": 58075832.0, "step": 4708 }, { "entropy": 1.428839921951294, "epoch": 2.4797261716692995, "grad_norm": 0.2970784604549408, "learning_rate": 0.000154790943636971, "loss": 0.1906449794769287, "mean_token_accuracy": 0.9224237501621246, "num_tokens": 58088168.0, "step": 4709 }, { "entropy": 1.3637046813964844, "epoch": 2.4802527646129544, "grad_norm": 0.25533929467201233, "learning_rate": 0.0001547719225366225, "loss": 0.1766054928302765, "mean_token_accuracy": 0.9246645867824554, "num_tokens": 58100504.0, "step": 4710 }, { "entropy": 1.4180608987808228, "epoch": 2.480779357556609, "grad_norm": 0.2714919447898865, "learning_rate": 0.00015475289877842595, "loss": 0.183756485581398, "mean_token_accuracy": 0.924714669585228, "num_tokens": 58112840.0, "step": 4711 }, { "entropy": 1.4052789807319641, "epoch": 2.4813059505002633, "grad_norm": 0.2869175374507904, "learning_rate": 0.00015473387236351064, "loss": 0.19138438999652863, "mean_token_accuracy": 0.9229259192943573, "num_tokens": 58125176.0, "step": 4712 }, { "entropy": 1.495551347732544, "epoch": 2.4818325434439177, "grad_norm": 0.29526039958000183, "learning_rate": 0.000154714843293006, "loss": 0.20986592769622803, "mean_token_accuracy": 0.9124022424221039, "num_tokens": 58137512.0, "step": 4713 }, { "entropy": 1.4451051354408264, "epoch": 2.4823591363875726, "grad_norm": 0.2789779007434845, "learning_rate": 0.0001546958115680418, "loss": 0.18474294245243073, "mean_token_accuracy": 0.9247586131095886, "num_tokens": 58149848.0, "step": 4714 }, { "entropy": 1.3909856081008911, "epoch": 2.482885729331227, "grad_norm": 0.24263574182987213, "learning_rate": 0.00015467677718974775, "loss": 0.1780616194009781, "mean_token_accuracy": 0.9270612746477127, "num_tokens": 58162184.0, "step": 4715 }, { "entropy": 1.4340462684631348, "epoch": 2.4834123222748814, "grad_norm": 0.2651912569999695, "learning_rate": 0.00015465774015925384, "loss": 0.17408399283885956, "mean_token_accuracy": 0.926845371723175, "num_tokens": 58174520.0, "step": 4716 }, { "entropy": 1.4597930312156677, "epoch": 2.483938915218536, "grad_norm": 0.28243258595466614, "learning_rate": 0.00015463870047769017, "loss": 0.18010583519935608, "mean_token_accuracy": 0.9231376051902771, "num_tokens": 58186856.0, "step": 4717 }, { "entropy": 1.4875306189060211, "epoch": 2.4844655081621907, "grad_norm": 0.29506340622901917, "learning_rate": 0.000154619658146187, "loss": 0.18998458981513977, "mean_token_accuracy": 0.9228047430515289, "num_tokens": 58199192.0, "step": 4718 }, { "entropy": 1.4901301264762878, "epoch": 2.484992101105845, "grad_norm": 0.2923277020454407, "learning_rate": 0.00015460061316587484, "loss": 0.2033998817205429, "mean_token_accuracy": 0.9161169081926346, "num_tokens": 58211528.0, "step": 4719 }, { "entropy": 1.498829424381256, "epoch": 2.4855186940494995, "grad_norm": 0.3002236783504486, "learning_rate": 0.00015458156553788423, "loss": 0.21175146102905273, "mean_token_accuracy": 0.9184870421886444, "num_tokens": 58223864.0, "step": 4720 }, { "entropy": 1.413221299648285, "epoch": 2.4860452869931544, "grad_norm": 0.28396493196487427, "learning_rate": 0.0001545625152633459, "loss": 0.18868695199489594, "mean_token_accuracy": 0.9188051074743271, "num_tokens": 58236200.0, "step": 4721 }, { "entropy": 1.4876404404640198, "epoch": 2.486571879936809, "grad_norm": 0.27693501114845276, "learning_rate": 0.00015454346234339075, "loss": 0.18164798617362976, "mean_token_accuracy": 0.9216231107711792, "num_tokens": 58248536.0, "step": 4722 }, { "entropy": 1.4857076406478882, "epoch": 2.4870984728804633, "grad_norm": 0.28282952308654785, "learning_rate": 0.00015452440677914987, "loss": 0.19472423195838928, "mean_token_accuracy": 0.9207596182823181, "num_tokens": 58260872.0, "step": 4723 }, { "entropy": 1.5304179787635803, "epoch": 2.487625065824118, "grad_norm": 0.2851126790046692, "learning_rate": 0.00015450534857175448, "loss": 0.1930224597454071, "mean_token_accuracy": 0.9197488129138947, "num_tokens": 58273208.0, "step": 4724 }, { "entropy": 1.5518591701984406, "epoch": 2.4881516587677726, "grad_norm": 0.33592379093170166, "learning_rate": 0.0001544862877223359, "loss": 0.19371357560157776, "mean_token_accuracy": 0.9196053594350815, "num_tokens": 58285544.0, "step": 4725 }, { "entropy": 1.4344633221626282, "epoch": 2.488678251711427, "grad_norm": 0.2809014618396759, "learning_rate": 0.00015446722423202575, "loss": 0.1901252120733261, "mean_token_accuracy": 0.9172061532735825, "num_tokens": 58297880.0, "step": 4726 }, { "entropy": 1.4716311693191528, "epoch": 2.489204844655082, "grad_norm": 0.2870580554008484, "learning_rate": 0.00015444815810195566, "loss": 0.19343703985214233, "mean_token_accuracy": 0.9194012731313705, "num_tokens": 58310216.0, "step": 4727 }, { "entropy": 1.4924903213977814, "epoch": 2.4897314375987363, "grad_norm": 0.2923792004585266, "learning_rate": 0.0001544290893332575, "loss": 0.1825990229845047, "mean_token_accuracy": 0.9255896955728531, "num_tokens": 58322552.0, "step": 4728 }, { "entropy": 1.4978864192962646, "epoch": 2.4902580305423907, "grad_norm": 0.2822360098361969, "learning_rate": 0.00015441001792706322, "loss": 0.1829996407032013, "mean_token_accuracy": 0.923396423459053, "num_tokens": 58334888.0, "step": 4729 }, { "entropy": 1.4193677008152008, "epoch": 2.490784623486045, "grad_norm": 0.2578467130661011, "learning_rate": 0.00015439094388450502, "loss": 0.170360267162323, "mean_token_accuracy": 0.9318064004182816, "num_tokens": 58347224.0, "step": 4730 }, { "entropy": 1.4174853563308716, "epoch": 2.4913112164297, "grad_norm": 0.26211613416671753, "learning_rate": 0.00015437186720671523, "loss": 0.18280640244483948, "mean_token_accuracy": 0.9214925467967987, "num_tokens": 58359560.0, "step": 4731 }, { "entropy": 1.4184439182281494, "epoch": 2.4918378093733544, "grad_norm": 0.27308353781700134, "learning_rate": 0.00015435278789482636, "loss": 0.18611527979373932, "mean_token_accuracy": 0.9204042702913284, "num_tokens": 58371896.0, "step": 4732 }, { "entropy": 1.442617654800415, "epoch": 2.492364402317009, "grad_norm": 0.2780870199203491, "learning_rate": 0.00015433370594997089, "loss": 0.1830921471118927, "mean_token_accuracy": 0.9229092448949814, "num_tokens": 58384232.0, "step": 4733 }, { "entropy": 1.484441488981247, "epoch": 2.4928909952606633, "grad_norm": 0.27742764353752136, "learning_rate": 0.00015431462137328173, "loss": 0.1889549344778061, "mean_token_accuracy": 0.9233603626489639, "num_tokens": 58396568.0, "step": 4734 }, { "entropy": 1.4144461452960968, "epoch": 2.493417588204318, "grad_norm": 0.29658958315849304, "learning_rate": 0.00015429553416589176, "loss": 0.19394293427467346, "mean_token_accuracy": 0.9221424907445908, "num_tokens": 58408904.0, "step": 4735 }, { "entropy": 1.3806745409965515, "epoch": 2.4939441811479726, "grad_norm": 0.27006301283836365, "learning_rate": 0.00015427644432893414, "loss": 0.19147875905036926, "mean_token_accuracy": 0.9202659428119659, "num_tokens": 58421240.0, "step": 4736 }, { "entropy": 1.4355372488498688, "epoch": 2.494470774091627, "grad_norm": 0.2959778308868408, "learning_rate": 0.00015425735186354208, "loss": 0.18910780549049377, "mean_token_accuracy": 0.920879676938057, "num_tokens": 58433576.0, "step": 4737 }, { "entropy": 1.4152382910251617, "epoch": 2.494997367035282, "grad_norm": 0.2920873165130615, "learning_rate": 0.00015423825677084895, "loss": 0.196088045835495, "mean_token_accuracy": 0.9160876125097275, "num_tokens": 58445912.0, "step": 4738 }, { "entropy": 1.4021598100662231, "epoch": 2.4955239599789363, "grad_norm": 0.2944489121437073, "learning_rate": 0.0001542191590519884, "loss": 0.19860148429870605, "mean_token_accuracy": 0.9189711213111877, "num_tokens": 58458248.0, "step": 4739 }, { "entropy": 1.3974989652633667, "epoch": 2.4960505529225907, "grad_norm": 0.2927993834018707, "learning_rate": 0.0001542000587080941, "loss": 0.20249119400978088, "mean_token_accuracy": 0.9131207466125488, "num_tokens": 58470584.0, "step": 4740 }, { "entropy": 1.528170496225357, "epoch": 2.4965771458662456, "grad_norm": 0.3085220456123352, "learning_rate": 0.0001541809557402999, "loss": 0.1807674765586853, "mean_token_accuracy": 0.9273618459701538, "num_tokens": 58482920.0, "step": 4741 }, { "entropy": 1.367598444223404, "epoch": 2.4971037388099, "grad_norm": 0.2692739963531494, "learning_rate": 0.00015416185014973993, "loss": 0.19078630208969116, "mean_token_accuracy": 0.919693797826767, "num_tokens": 58495256.0, "step": 4742 }, { "entropy": 1.339257150888443, "epoch": 2.4976303317535544, "grad_norm": 0.24560058116912842, "learning_rate": 0.00015414274193754823, "loss": 0.1724538803100586, "mean_token_accuracy": 0.9302109032869339, "num_tokens": 58507592.0, "step": 4743 }, { "entropy": 1.411946326494217, "epoch": 2.4981569246972093, "grad_norm": 0.27875998616218567, "learning_rate": 0.00015412363110485928, "loss": 0.19445690512657166, "mean_token_accuracy": 0.9199328869581223, "num_tokens": 58519928.0, "step": 4744 }, { "entropy": 1.4017539620399475, "epoch": 2.4986835176408637, "grad_norm": 0.2869739234447479, "learning_rate": 0.0001541045176528075, "loss": 0.18097423017024994, "mean_token_accuracy": 0.9258893132209778, "num_tokens": 58532264.0, "step": 4745 }, { "entropy": 1.3831762373447418, "epoch": 2.499210110584518, "grad_norm": 0.30489039421081543, "learning_rate": 0.00015408540158252755, "loss": 0.1928139328956604, "mean_token_accuracy": 0.9191577881574631, "num_tokens": 58544600.0, "step": 4746 }, { "entropy": 1.4570479691028595, "epoch": 2.4997367035281726, "grad_norm": 0.2680588960647583, "learning_rate": 0.0001540662828951543, "loss": 0.17343565821647644, "mean_token_accuracy": 0.9286295920610428, "num_tokens": 58556936.0, "step": 4747 }, { "entropy": 1.482690542936325, "epoch": 2.5002632964718274, "grad_norm": 0.27270379662513733, "learning_rate": 0.00015404716159182264, "loss": 0.1857714056968689, "mean_token_accuracy": 0.9244716465473175, "num_tokens": 58569272.0, "step": 4748 }, { "entropy": 1.4173051118850708, "epoch": 2.500789889415482, "grad_norm": 0.26899290084838867, "learning_rate": 0.00015402803767366774, "loss": 0.19327764213085175, "mean_token_accuracy": 0.9222336858510971, "num_tokens": 58581608.0, "step": 4749 }, { "entropy": 1.3975452482700348, "epoch": 2.5013164823591363, "grad_norm": 0.2648375332355499, "learning_rate": 0.00015400891114182488, "loss": 0.1719164401292801, "mean_token_accuracy": 0.9263694137334824, "num_tokens": 58593944.0, "step": 4750 }, { "entropy": 1.4633611142635345, "epoch": 2.5018430753027907, "grad_norm": 0.27619731426239014, "learning_rate": 0.00015398978199742945, "loss": 0.19618642330169678, "mean_token_accuracy": 0.9181656688451767, "num_tokens": 58606280.0, "step": 4751 }, { "entropy": 1.4815970957279205, "epoch": 2.5023696682464456, "grad_norm": 0.2575641870498657, "learning_rate": 0.000153970650241617, "loss": 0.1765824407339096, "mean_token_accuracy": 0.9256032109260559, "num_tokens": 58618616.0, "step": 4752 }, { "entropy": 1.4368881583213806, "epoch": 2.5028962611901, "grad_norm": 0.260724276304245, "learning_rate": 0.0001539515158755234, "loss": 0.1661488264799118, "mean_token_accuracy": 0.9317044764757156, "num_tokens": 58630952.0, "step": 4753 }, { "entropy": 1.537843406200409, "epoch": 2.5034228541337544, "grad_norm": 0.27667954564094543, "learning_rate": 0.00015393237890028443, "loss": 0.16878753900527954, "mean_token_accuracy": 0.929436519742012, "num_tokens": 58643288.0, "step": 4754 }, { "entropy": 1.4854961335659027, "epoch": 2.5039494470774093, "grad_norm": 0.2952048182487488, "learning_rate": 0.00015391323931703617, "loss": 0.17188966274261475, "mean_token_accuracy": 0.9301230907440186, "num_tokens": 58655624.0, "step": 4755 }, { "entropy": 1.5180222392082214, "epoch": 2.5044760400210637, "grad_norm": 0.3058265745639801, "learning_rate": 0.0001538940971269149, "loss": 0.19406625628471375, "mean_token_accuracy": 0.91983662545681, "num_tokens": 58667960.0, "step": 4756 }, { "entropy": 1.5174492299556732, "epoch": 2.505002632964718, "grad_norm": 0.2982122004032135, "learning_rate": 0.0001538749523310569, "loss": 0.19521798193454742, "mean_token_accuracy": 0.9169194102287292, "num_tokens": 58680296.0, "step": 4757 }, { "entropy": 1.5078306794166565, "epoch": 2.505529225908373, "grad_norm": 0.33034297823905945, "learning_rate": 0.00015385580493059865, "loss": 0.17905089259147644, "mean_token_accuracy": 0.9300853908061981, "num_tokens": 58692632.0, "step": 4758 }, { "entropy": 1.5533065497875214, "epoch": 2.5060558188520274, "grad_norm": 0.3211785554885864, "learning_rate": 0.0001538366549266769, "loss": 0.2184678316116333, "mean_token_accuracy": 0.912133514881134, "num_tokens": 58704968.0, "step": 4759 }, { "entropy": 1.5568303167819977, "epoch": 2.506582411795682, "grad_norm": 0.2776426374912262, "learning_rate": 0.00015381750232042847, "loss": 0.18281778693199158, "mean_token_accuracy": 0.925473615527153, "num_tokens": 58717304.0, "step": 4760 }, { "entropy": 1.5951158702373505, "epoch": 2.5071090047393367, "grad_norm": 0.28495267033576965, "learning_rate": 0.0001537983471129903, "loss": 0.19968701899051666, "mean_token_accuracy": 0.9174495190382004, "num_tokens": 58729640.0, "step": 4761 }, { "entropy": 1.6484262645244598, "epoch": 2.507635597682991, "grad_norm": 0.278410404920578, "learning_rate": 0.00015377918930549952, "loss": 0.1968478113412857, "mean_token_accuracy": 0.9191997349262238, "num_tokens": 58741976.0, "step": 4762 }, { "entropy": 1.5548788011074066, "epoch": 2.5081621906266456, "grad_norm": 0.3318310081958771, "learning_rate": 0.00015376002889909345, "loss": 0.19419671595096588, "mean_token_accuracy": 0.9201514571905136, "num_tokens": 58754312.0, "step": 4763 }, { "entropy": 1.5360266864299774, "epoch": 2.5086887835703, "grad_norm": 0.27847015857696533, "learning_rate": 0.00015374086589490951, "loss": 0.19744856655597687, "mean_token_accuracy": 0.9216972440481186, "num_tokens": 58766648.0, "step": 4764 }, { "entropy": 1.5686508417129517, "epoch": 2.509215376513955, "grad_norm": 0.28824716806411743, "learning_rate": 0.00015372170029408534, "loss": 0.1984092742204666, "mean_token_accuracy": 0.9193175435066223, "num_tokens": 58778984.0, "step": 4765 }, { "entropy": 1.5758169889450073, "epoch": 2.5097419694576093, "grad_norm": 0.2656327486038208, "learning_rate": 0.0001537025320977586, "loss": 0.1845746636390686, "mean_token_accuracy": 0.9232941418886185, "num_tokens": 58791320.0, "step": 4766 }, { "entropy": 1.543961524963379, "epoch": 2.5102685624012637, "grad_norm": 0.27334338426589966, "learning_rate": 0.0001536833613070673, "loss": 0.18064028024673462, "mean_token_accuracy": 0.9252053499221802, "num_tokens": 58803656.0, "step": 4767 }, { "entropy": 1.595755398273468, "epoch": 2.510795155344918, "grad_norm": 0.28184929490089417, "learning_rate": 0.00015366418792314937, "loss": 0.18395768105983734, "mean_token_accuracy": 0.9240316599607468, "num_tokens": 58815992.0, "step": 4768 }, { "entropy": 1.529136598110199, "epoch": 2.511321748288573, "grad_norm": 0.2473924607038498, "learning_rate": 0.00015364501194714317, "loss": 0.17464369535446167, "mean_token_accuracy": 0.9280594140291214, "num_tokens": 58828328.0, "step": 4769 }, { "entropy": 1.5212011635303497, "epoch": 2.5118483412322274, "grad_norm": 0.25740960240364075, "learning_rate": 0.00015362583338018694, "loss": 0.19115827977657318, "mean_token_accuracy": 0.9235165566205978, "num_tokens": 58840664.0, "step": 4770 }, { "entropy": 1.5040476322174072, "epoch": 2.512374934175882, "grad_norm": 0.2637852728366852, "learning_rate": 0.0001536066522234193, "loss": 0.18358321487903595, "mean_token_accuracy": 0.9271368533372879, "num_tokens": 58853000.0, "step": 4771 }, { "entropy": 1.4970723390579224, "epoch": 2.5129015271195367, "grad_norm": 0.26975688338279724, "learning_rate": 0.00015358746847797885, "loss": 0.19123801589012146, "mean_token_accuracy": 0.9218833893537521, "num_tokens": 58865336.0, "step": 4772 }, { "entropy": 1.4308944344520569, "epoch": 2.513428120063191, "grad_norm": 0.26151081919670105, "learning_rate": 0.00015356828214500444, "loss": 0.18660297989845276, "mean_token_accuracy": 0.9219815135002136, "num_tokens": 58877672.0, "step": 4773 }, { "entropy": 1.541033297777176, "epoch": 2.5139547130068456, "grad_norm": 0.30042555928230286, "learning_rate": 0.0001535490932256351, "loss": 0.20421351492404938, "mean_token_accuracy": 0.9185314625501633, "num_tokens": 58890008.0, "step": 4774 }, { "entropy": 1.4968733489513397, "epoch": 2.5144813059505005, "grad_norm": 0.30032971501350403, "learning_rate": 0.00015352990172100989, "loss": 0.19920584559440613, "mean_token_accuracy": 0.9175475388765335, "num_tokens": 58902344.0, "step": 4775 }, { "entropy": 1.4867732226848602, "epoch": 2.515007898894155, "grad_norm": 0.26996806263923645, "learning_rate": 0.00015351070763226806, "loss": 0.19374677538871765, "mean_token_accuracy": 0.9205781370401382, "num_tokens": 58914680.0, "step": 4776 }, { "entropy": 1.4824062585830688, "epoch": 2.5155344918378093, "grad_norm": 0.2542126178741455, "learning_rate": 0.0001534915109605492, "loss": 0.17349721491336823, "mean_token_accuracy": 0.9280759692192078, "num_tokens": 58927016.0, "step": 4777 }, { "entropy": 1.4385600686073303, "epoch": 2.516061084781464, "grad_norm": 0.2770039141178131, "learning_rate": 0.0001534723117069928, "loss": 0.18407964706420898, "mean_token_accuracy": 0.9262531846761703, "num_tokens": 58939352.0, "step": 4778 }, { "entropy": 1.3186810910701752, "epoch": 2.5165876777251186, "grad_norm": 0.2739590108394623, "learning_rate": 0.00015345310987273863, "loss": 0.18699848651885986, "mean_token_accuracy": 0.9226303249597549, "num_tokens": 58951688.0, "step": 4779 }, { "entropy": 1.3342479169368744, "epoch": 2.517114270668773, "grad_norm": 0.2480226755142212, "learning_rate": 0.00015343390545892658, "loss": 0.17880557477474213, "mean_token_accuracy": 0.9291187077760696, "num_tokens": 58964024.0, "step": 4780 }, { "entropy": 1.4129751324653625, "epoch": 2.5176408636124274, "grad_norm": 0.28868386149406433, "learning_rate": 0.00015341469846669674, "loss": 0.18943078815937042, "mean_token_accuracy": 0.9252970963716507, "num_tokens": 58976360.0, "step": 4781 }, { "entropy": 1.4371739029884338, "epoch": 2.518167456556082, "grad_norm": 0.2903843820095062, "learning_rate": 0.00015339548889718927, "loss": 0.19646281003952026, "mean_token_accuracy": 0.9155204445123672, "num_tokens": 58988696.0, "step": 4782 }, { "entropy": 1.3534334003925323, "epoch": 2.5186940494997367, "grad_norm": 0.2689908742904663, "learning_rate": 0.00015337627675154452, "loss": 0.19126330316066742, "mean_token_accuracy": 0.9226963371038437, "num_tokens": 59001032.0, "step": 4783 }, { "entropy": 1.403167486190796, "epoch": 2.519220642443391, "grad_norm": 0.2755464017391205, "learning_rate": 0.0001533570620309031, "loss": 0.1715218722820282, "mean_token_accuracy": 0.9286895543336868, "num_tokens": 59013368.0, "step": 4784 }, { "entropy": 1.342715084552765, "epoch": 2.5197472353870456, "grad_norm": 0.28502821922302246, "learning_rate": 0.00015333784473640558, "loss": 0.18913885951042175, "mean_token_accuracy": 0.9184420257806778, "num_tokens": 59025704.0, "step": 4785 }, { "entropy": 1.381771981716156, "epoch": 2.5202738283307005, "grad_norm": 0.300022691488266, "learning_rate": 0.00015331862486919282, "loss": 0.20708000659942627, "mean_token_accuracy": 0.9179199188947678, "num_tokens": 59038040.0, "step": 4786 }, { "entropy": 1.3914389312267303, "epoch": 2.520800421274355, "grad_norm": 0.32590633630752563, "learning_rate": 0.00015329940243040578, "loss": 0.20750224590301514, "mean_token_accuracy": 0.9141969978809357, "num_tokens": 59050376.0, "step": 4787 }, { "entropy": 1.425366759300232, "epoch": 2.5213270142180093, "grad_norm": 0.2782382071018219, "learning_rate": 0.00015328017742118557, "loss": 0.19896437227725983, "mean_token_accuracy": 0.9168428629636765, "num_tokens": 59062712.0, "step": 4788 }, { "entropy": 1.400715321302414, "epoch": 2.521853607161664, "grad_norm": 0.28630152344703674, "learning_rate": 0.00015326094984267352, "loss": 0.22256657481193542, "mean_token_accuracy": 0.9108149707317352, "num_tokens": 59075048.0, "step": 4789 }, { "entropy": 1.4121185541152954, "epoch": 2.5223802001053186, "grad_norm": 0.29156050086021423, "learning_rate": 0.000153241719696011, "loss": 0.21156355738639832, "mean_token_accuracy": 0.9142804145812988, "num_tokens": 59087384.0, "step": 4790 }, { "entropy": 1.4587819874286652, "epoch": 2.522906793048973, "grad_norm": 0.2809777557849884, "learning_rate": 0.00015322248698233958, "loss": 0.18381905555725098, "mean_token_accuracy": 0.9187909066677094, "num_tokens": 59099720.0, "step": 4791 }, { "entropy": 1.4324629604816437, "epoch": 2.523433385992628, "grad_norm": 0.24410581588745117, "learning_rate": 0.00015320325170280107, "loss": 0.17199113965034485, "mean_token_accuracy": 0.9289192855358124, "num_tokens": 59112056.0, "step": 4792 }, { "entropy": 1.457740843296051, "epoch": 2.5239599789362823, "grad_norm": 0.27388423681259155, "learning_rate": 0.00015318401385853729, "loss": 0.1924448013305664, "mean_token_accuracy": 0.9235370606184006, "num_tokens": 59124392.0, "step": 4793 }, { "entropy": 1.4426178336143494, "epoch": 2.5244865718799367, "grad_norm": 0.2799040973186493, "learning_rate": 0.0001531647734506903, "loss": 0.20240657031536102, "mean_token_accuracy": 0.917314887046814, "num_tokens": 59136728.0, "step": 4794 }, { "entropy": 1.4201898574829102, "epoch": 2.5250131648235916, "grad_norm": 0.29636329412460327, "learning_rate": 0.00015314553048040232, "loss": 0.20854808390140533, "mean_token_accuracy": 0.9121217727661133, "num_tokens": 59149064.0, "step": 4795 }, { "entropy": 1.4267604053020477, "epoch": 2.525539757767246, "grad_norm": 0.26949402689933777, "learning_rate": 0.00015312628494881567, "loss": 0.18854168057441711, "mean_token_accuracy": 0.9252474457025528, "num_tokens": 59161400.0, "step": 4796 }, { "entropy": 1.4317746460437775, "epoch": 2.5260663507109005, "grad_norm": 0.2725363075733185, "learning_rate": 0.0001531070368570728, "loss": 0.1946963369846344, "mean_token_accuracy": 0.9178613424301147, "num_tokens": 59173736.0, "step": 4797 }, { "entropy": 1.4510256946086884, "epoch": 2.526592943654555, "grad_norm": 0.25904926657676697, "learning_rate": 0.00015308778620631643, "loss": 0.17193448543548584, "mean_token_accuracy": 0.9315731972455978, "num_tokens": 59186072.0, "step": 4798 }, { "entropy": 1.4164240956306458, "epoch": 2.5271195365982093, "grad_norm": 0.25664958357810974, "learning_rate": 0.00015306853299768935, "loss": 0.1800077110528946, "mean_token_accuracy": 0.9235340803861618, "num_tokens": 59198408.0, "step": 4799 }, { "entropy": 1.4181910455226898, "epoch": 2.527646129541864, "grad_norm": 0.267265260219574, "learning_rate": 0.00015304927723233444, "loss": 0.1814480721950531, "mean_token_accuracy": 0.926010325551033, "num_tokens": 59210744.0, "step": 4800 }, { "entropy": 1.403830498456955, "epoch": 2.5281727224855186, "grad_norm": 0.2695743143558502, "learning_rate": 0.00015303001891139485, "loss": 0.18746566772460938, "mean_token_accuracy": 0.922560304403305, "num_tokens": 59223080.0, "step": 4801 }, { "entropy": 1.4577591121196747, "epoch": 2.528699315429173, "grad_norm": 0.33329254388809204, "learning_rate": 0.00015301075803601387, "loss": 0.21829648315906525, "mean_token_accuracy": 0.9158814549446106, "num_tokens": 59235416.0, "step": 4802 }, { "entropy": 1.4333778023719788, "epoch": 2.529225908372828, "grad_norm": 0.2889585793018341, "learning_rate": 0.00015299149460733485, "loss": 0.19638335704803467, "mean_token_accuracy": 0.9257490932941437, "num_tokens": 59247752.0, "step": 4803 }, { "entropy": 1.375129371881485, "epoch": 2.5297525013164823, "grad_norm": 0.27963852882385254, "learning_rate": 0.0001529722286265014, "loss": 0.19143079221248627, "mean_token_accuracy": 0.9210483729839325, "num_tokens": 59260088.0, "step": 4804 }, { "entropy": 1.4024271965026855, "epoch": 2.5302790942601368, "grad_norm": 0.28402864933013916, "learning_rate": 0.00015295296009465716, "loss": 0.19460776448249817, "mean_token_accuracy": 0.9193561524152756, "num_tokens": 59272424.0, "step": 4805 }, { "entropy": 1.3990450501441956, "epoch": 2.5308056872037916, "grad_norm": 0.26199251413345337, "learning_rate": 0.00015293368901294604, "loss": 0.18480481207370758, "mean_token_accuracy": 0.9206849783658981, "num_tokens": 59284760.0, "step": 4806 }, { "entropy": 1.4049314558506012, "epoch": 2.531332280147446, "grad_norm": 0.2740122377872467, "learning_rate": 0.00015291441538251206, "loss": 0.1854100227355957, "mean_token_accuracy": 0.9238648563623428, "num_tokens": 59297096.0, "step": 4807 }, { "entropy": 1.4527244567871094, "epoch": 2.5318588730911005, "grad_norm": 0.28150686621665955, "learning_rate": 0.00015289513920449933, "loss": 0.19049590826034546, "mean_token_accuracy": 0.9227531105279922, "num_tokens": 59309432.0, "step": 4808 }, { "entropy": 1.429905265569687, "epoch": 2.5323854660347553, "grad_norm": 0.2997985780239105, "learning_rate": 0.00015287586048005222, "loss": 0.2127116471529007, "mean_token_accuracy": 0.910615935921669, "num_tokens": 59321768.0, "step": 4809 }, { "entropy": 1.361231505870819, "epoch": 2.5329120589784098, "grad_norm": 0.24818584322929382, "learning_rate": 0.00015285657921031514, "loss": 0.1716461330652237, "mean_token_accuracy": 0.9304056763648987, "num_tokens": 59334104.0, "step": 4810 }, { "entropy": 1.4534060060977936, "epoch": 2.533438651922064, "grad_norm": 0.25663110613822937, "learning_rate": 0.00015283729539643278, "loss": 0.1782129853963852, "mean_token_accuracy": 0.9268085807561874, "num_tokens": 59346440.0, "step": 4811 }, { "entropy": 1.453408420085907, "epoch": 2.533965244865719, "grad_norm": 0.2804957330226898, "learning_rate": 0.00015281800903954986, "loss": 0.19750183820724487, "mean_token_accuracy": 0.9193479269742966, "num_tokens": 59358776.0, "step": 4812 }, { "entropy": 1.5167824625968933, "epoch": 2.5344918378093735, "grad_norm": 0.3135470747947693, "learning_rate": 0.00015279872014081132, "loss": 0.21170248091220856, "mean_token_accuracy": 0.9191084504127502, "num_tokens": 59371112.0, "step": 4813 }, { "entropy": 1.4512979388237, "epoch": 2.535018430753028, "grad_norm": 0.27713891863822937, "learning_rate": 0.00015277942870136217, "loss": 0.18782149255275726, "mean_token_accuracy": 0.9250089675188065, "num_tokens": 59383448.0, "step": 4814 }, { "entropy": 1.387693852186203, "epoch": 2.5355450236966823, "grad_norm": 0.29428794980049133, "learning_rate": 0.00015276013472234767, "loss": 0.19037064909934998, "mean_token_accuracy": 0.9212422370910645, "num_tokens": 59395784.0, "step": 4815 }, { "entropy": 1.4471594989299774, "epoch": 2.5360716166403368, "grad_norm": 0.29530593752861023, "learning_rate": 0.00015274083820491325, "loss": 0.20669062435626984, "mean_token_accuracy": 0.9147179573774338, "num_tokens": 59408120.0, "step": 4816 }, { "entropy": 1.4373044073581696, "epoch": 2.5365982095839916, "grad_norm": 0.28317534923553467, "learning_rate": 0.00015272153915020436, "loss": 0.20463967323303223, "mean_token_accuracy": 0.9127626866102219, "num_tokens": 59420456.0, "step": 4817 }, { "entropy": 1.4383168518543243, "epoch": 2.537124802527646, "grad_norm": 0.26127228140830994, "learning_rate": 0.00015270223755936668, "loss": 0.20316585898399353, "mean_token_accuracy": 0.918964073061943, "num_tokens": 59432792.0, "step": 4818 }, { "entropy": 1.441445916891098, "epoch": 2.5376513954713005, "grad_norm": 0.26680976152420044, "learning_rate": 0.00015268293343354602, "loss": 0.1995728462934494, "mean_token_accuracy": 0.916199654340744, "num_tokens": 59445128.0, "step": 4819 }, { "entropy": 1.4771413207054138, "epoch": 2.5381779884149553, "grad_norm": 0.27789434790611267, "learning_rate": 0.00015266362677388844, "loss": 0.20266149938106537, "mean_token_accuracy": 0.9153758585453033, "num_tokens": 59457464.0, "step": 4820 }, { "entropy": 1.4663703739643097, "epoch": 2.5387045813586098, "grad_norm": 0.2747149169445038, "learning_rate": 0.00015264431758153993, "loss": 0.19435656070709229, "mean_token_accuracy": 0.9212976843118668, "num_tokens": 59469800.0, "step": 4821 }, { "entropy": 1.4226221442222595, "epoch": 2.539231174302264, "grad_norm": 0.2740062177181244, "learning_rate": 0.00015262500585764687, "loss": 0.18962638080120087, "mean_token_accuracy": 0.9208030998706818, "num_tokens": 59482136.0, "step": 4822 }, { "entropy": 1.4463150799274445, "epoch": 2.539757767245919, "grad_norm": 0.26949939131736755, "learning_rate": 0.00015260569160335566, "loss": 0.18399539589881897, "mean_token_accuracy": 0.9234223514795303, "num_tokens": 59494472.0, "step": 4823 }, { "entropy": 1.4091249704360962, "epoch": 2.5402843601895735, "grad_norm": 0.30532780289649963, "learning_rate": 0.00015258637481981285, "loss": 0.19731716811656952, "mean_token_accuracy": 0.9179344773292542, "num_tokens": 59506808.0, "step": 4824 }, { "entropy": 1.4171604216098785, "epoch": 2.540810953133228, "grad_norm": 0.29440897703170776, "learning_rate": 0.00015256705550816517, "loss": 0.195593923330307, "mean_token_accuracy": 0.9183009415864944, "num_tokens": 59519144.0, "step": 4825 }, { "entropy": 1.4110483527183533, "epoch": 2.541337546076883, "grad_norm": 0.2890157103538513, "learning_rate": 0.00015254773366955951, "loss": 0.1955215185880661, "mean_token_accuracy": 0.9175896495580673, "num_tokens": 59531480.0, "step": 4826 }, { "entropy": 1.430400162935257, "epoch": 2.541864139020537, "grad_norm": 0.2826859951019287, "learning_rate": 0.00015252840930514292, "loss": 0.176889106631279, "mean_token_accuracy": 0.9274906814098358, "num_tokens": 59543816.0, "step": 4827 }, { "entropy": 1.374840259552002, "epoch": 2.5423907319641916, "grad_norm": 0.2729499638080597, "learning_rate": 0.00015250908241606253, "loss": 0.18692106008529663, "mean_token_accuracy": 0.9284721314907074, "num_tokens": 59556152.0, "step": 4828 }, { "entropy": 1.382160872220993, "epoch": 2.5429173249078465, "grad_norm": 0.2653583288192749, "learning_rate": 0.00015248975300346566, "loss": 0.18451890349388123, "mean_token_accuracy": 0.9224373549222946, "num_tokens": 59568488.0, "step": 4829 }, { "entropy": 1.3657977879047394, "epoch": 2.543443917851501, "grad_norm": 0.24867606163024902, "learning_rate": 0.0001524704210684998, "loss": 0.1776690036058426, "mean_token_accuracy": 0.9281052350997925, "num_tokens": 59580824.0, "step": 4830 }, { "entropy": 1.3682537972927094, "epoch": 2.5439705107951553, "grad_norm": 0.27566197514533997, "learning_rate": 0.0001524510866123126, "loss": 0.19942131638526917, "mean_token_accuracy": 0.9162020832300186, "num_tokens": 59593160.0, "step": 4831 }, { "entropy": 1.3574018776416779, "epoch": 2.5444971037388098, "grad_norm": 0.2771880328655243, "learning_rate": 0.0001524317496360518, "loss": 0.19043181836605072, "mean_token_accuracy": 0.9205653816461563, "num_tokens": 59605496.0, "step": 4832 }, { "entropy": 1.36737522482872, "epoch": 2.545023696682464, "grad_norm": 0.2834945023059845, "learning_rate": 0.00015241241014086535, "loss": 0.19852997362613678, "mean_token_accuracy": 0.9176250100135803, "num_tokens": 59617832.0, "step": 4833 }, { "entropy": 1.358602523803711, "epoch": 2.545550289626119, "grad_norm": 0.26471948623657227, "learning_rate": 0.00015239306812790129, "loss": 0.18846866488456726, "mean_token_accuracy": 0.9247909784317017, "num_tokens": 59630168.0, "step": 4834 }, { "entropy": 1.3623977303504944, "epoch": 2.5460768825697735, "grad_norm": 0.27146539092063904, "learning_rate": 0.00015237372359830787, "loss": 0.19878418743610382, "mean_token_accuracy": 0.9201604127883911, "num_tokens": 59642504.0, "step": 4835 }, { "entropy": 1.4069927632808685, "epoch": 2.546603475513428, "grad_norm": 0.2823067903518677, "learning_rate": 0.00015235437655323344, "loss": 0.20891442894935608, "mean_token_accuracy": 0.9150956869125366, "num_tokens": 59654840.0, "step": 4836 }, { "entropy": 1.3921907544136047, "epoch": 2.547130068457083, "grad_norm": 0.2729669511318207, "learning_rate": 0.00015233502699382652, "loss": 0.20379957556724548, "mean_token_accuracy": 0.9180693328380585, "num_tokens": 59667176.0, "step": 4837 }, { "entropy": 1.3551888167858124, "epoch": 2.547656661400737, "grad_norm": 0.263839989900589, "learning_rate": 0.00015231567492123585, "loss": 0.1928175985813141, "mean_token_accuracy": 0.9204489141702652, "num_tokens": 59679512.0, "step": 4838 }, { "entropy": 1.4220162332057953, "epoch": 2.5481832543443916, "grad_norm": 0.28904277086257935, "learning_rate": 0.00015229632033661014, "loss": 0.1956554502248764, "mean_token_accuracy": 0.9192171394824982, "num_tokens": 59691848.0, "step": 4839 }, { "entropy": 1.384028673171997, "epoch": 2.5487098472880465, "grad_norm": 0.2730739414691925, "learning_rate": 0.00015227696324109845, "loss": 0.1821494847536087, "mean_token_accuracy": 0.9268871694803238, "num_tokens": 59704184.0, "step": 4840 }, { "entropy": 1.3748473227024078, "epoch": 2.549236440231701, "grad_norm": 0.2834646999835968, "learning_rate": 0.00015225760363584982, "loss": 0.2006215900182724, "mean_token_accuracy": 0.9206278324127197, "num_tokens": 59716520.0, "step": 4841 }, { "entropy": 1.3900345861911774, "epoch": 2.5497630331753554, "grad_norm": 0.26609018445014954, "learning_rate": 0.0001522382415220136, "loss": 0.1950165331363678, "mean_token_accuracy": 0.9225917160511017, "num_tokens": 59728856.0, "step": 4842 }, { "entropy": 1.3536244630813599, "epoch": 2.5502896261190102, "grad_norm": 0.273309588432312, "learning_rate": 0.00015221887690073914, "loss": 0.19759991765022278, "mean_token_accuracy": 0.922698363661766, "num_tokens": 59741192.0, "step": 4843 }, { "entropy": 1.33824023604393, "epoch": 2.5508162190626646, "grad_norm": 0.2553465664386749, "learning_rate": 0.00015219950977317603, "loss": 0.175911545753479, "mean_token_accuracy": 0.9264104813337326, "num_tokens": 59753528.0, "step": 4844 }, { "entropy": 1.402260184288025, "epoch": 2.551342812006319, "grad_norm": 0.3060164749622345, "learning_rate": 0.00015218014014047398, "loss": 0.20706036686897278, "mean_token_accuracy": 0.912144809961319, "num_tokens": 59765864.0, "step": 4845 }, { "entropy": 1.3535306751728058, "epoch": 2.551869404949974, "grad_norm": 0.28057345747947693, "learning_rate": 0.00015216076800378286, "loss": 0.18130075931549072, "mean_token_accuracy": 0.9202318787574768, "num_tokens": 59778200.0, "step": 4846 }, { "entropy": 1.3663321137428284, "epoch": 2.5523959978936284, "grad_norm": 0.2771863639354706, "learning_rate": 0.00015214139336425272, "loss": 0.19252638518810272, "mean_token_accuracy": 0.9169972240924835, "num_tokens": 59790536.0, "step": 4847 }, { "entropy": 1.380006194114685, "epoch": 2.552922590837283, "grad_norm": 0.2713053822517395, "learning_rate": 0.0001521220162230336, "loss": 0.17066720128059387, "mean_token_accuracy": 0.9294691681861877, "num_tokens": 59802872.0, "step": 4848 }, { "entropy": 1.3988358080387115, "epoch": 2.553449183780937, "grad_norm": 0.3080752491950989, "learning_rate": 0.00015210263658127593, "loss": 0.19805192947387695, "mean_token_accuracy": 0.9194646626710892, "num_tokens": 59815208.0, "step": 4849 }, { "entropy": 1.3025390207767487, "epoch": 2.5539757767245916, "grad_norm": 0.26315048336982727, "learning_rate": 0.00015208325444013009, "loss": 0.18763092160224915, "mean_token_accuracy": 0.921664372086525, "num_tokens": 59827544.0, "step": 4850 }, { "entropy": 1.363812655210495, "epoch": 2.5545023696682465, "grad_norm": 0.28132131695747375, "learning_rate": 0.00015206386980074675, "loss": 0.20107382535934448, "mean_token_accuracy": 0.9173763394355774, "num_tokens": 59839880.0, "step": 4851 }, { "entropy": 1.3637959957122803, "epoch": 2.555028962611901, "grad_norm": 0.2793247699737549, "learning_rate": 0.0001520444826642766, "loss": 0.18369603157043457, "mean_token_accuracy": 0.9214000850915909, "num_tokens": 59852216.0, "step": 4852 }, { "entropy": 1.407531052827835, "epoch": 2.5555555555555554, "grad_norm": 0.27685731649398804, "learning_rate": 0.00015202509303187056, "loss": 0.19428351521492004, "mean_token_accuracy": 0.9237850308418274, "num_tokens": 59864552.0, "step": 4853 }, { "entropy": 1.4391858875751495, "epoch": 2.5560821484992102, "grad_norm": 0.30099570751190186, "learning_rate": 0.0001520057009046797, "loss": 0.20823752880096436, "mean_token_accuracy": 0.9157876074314117, "num_tokens": 59876888.0, "step": 4854 }, { "entropy": 1.4529668688774109, "epoch": 2.5566087414428647, "grad_norm": 0.3118361234664917, "learning_rate": 0.0001519863062838552, "loss": 0.2140086144208908, "mean_token_accuracy": 0.9144342094659805, "num_tokens": 59889224.0, "step": 4855 }, { "entropy": 1.4054121375083923, "epoch": 2.557135334386519, "grad_norm": 0.2828349471092224, "learning_rate": 0.00015196690917054843, "loss": 0.18467508256435394, "mean_token_accuracy": 0.9245531558990479, "num_tokens": 59901560.0, "step": 4856 }, { "entropy": 1.370518833398819, "epoch": 2.557661927330174, "grad_norm": 0.3127945363521576, "learning_rate": 0.00015194750956591086, "loss": 0.1978442370891571, "mean_token_accuracy": 0.9195757210254669, "num_tokens": 59913896.0, "step": 4857 }, { "entropy": 1.3630948066711426, "epoch": 2.5581885202738284, "grad_norm": 0.238580584526062, "learning_rate": 0.00015192810747109413, "loss": 0.15261900424957275, "mean_token_accuracy": 0.9331966936588287, "num_tokens": 59926232.0, "step": 4858 }, { "entropy": 1.411979854106903, "epoch": 2.558715113217483, "grad_norm": 0.2636284828186035, "learning_rate": 0.00015190870288725, "loss": 0.17438194155693054, "mean_token_accuracy": 0.9271792620420456, "num_tokens": 59938568.0, "step": 4859 }, { "entropy": 1.4212656915187836, "epoch": 2.5592417061611377, "grad_norm": 0.3053138554096222, "learning_rate": 0.0001518892958155305, "loss": 0.19817118346691132, "mean_token_accuracy": 0.9181718081235886, "num_tokens": 59950904.0, "step": 4860 }, { "entropy": 1.349739819765091, "epoch": 2.559768299104792, "grad_norm": 0.24464385211467743, "learning_rate": 0.00015186988625708763, "loss": 0.1783566176891327, "mean_token_accuracy": 0.9276772141456604, "num_tokens": 59963240.0, "step": 4861 }, { "entropy": 1.3938109576702118, "epoch": 2.5602948920484465, "grad_norm": 0.2769966423511505, "learning_rate": 0.00015185047421307363, "loss": 0.2047450840473175, "mean_token_accuracy": 0.9157468527555466, "num_tokens": 59975576.0, "step": 4862 }, { "entropy": 1.3291508555412292, "epoch": 2.5608214849921014, "grad_norm": 0.26295456290245056, "learning_rate": 0.00015183105968464094, "loss": 0.18852469325065613, "mean_token_accuracy": 0.9189134687185287, "num_tokens": 59987912.0, "step": 4863 }, { "entropy": 1.3406771123409271, "epoch": 2.561348077935756, "grad_norm": 0.30215656757354736, "learning_rate": 0.000151811642672942, "loss": 0.2007867395877838, "mean_token_accuracy": 0.9217905700206757, "num_tokens": 60000248.0, "step": 4864 }, { "entropy": 1.332020252943039, "epoch": 2.5618746708794102, "grad_norm": 0.3041894733905792, "learning_rate": 0.00015179222317912957, "loss": 0.1980377435684204, "mean_token_accuracy": 0.9134826958179474, "num_tokens": 60012584.0, "step": 4865 }, { "entropy": 1.363236427307129, "epoch": 2.5624012638230647, "grad_norm": 0.2855970859527588, "learning_rate": 0.0001517728012043564, "loss": 0.18393242359161377, "mean_token_accuracy": 0.920888140797615, "num_tokens": 60024920.0, "step": 4866 }, { "entropy": 1.3401431441307068, "epoch": 2.562927856766719, "grad_norm": 0.294961154460907, "learning_rate": 0.00015175337674977555, "loss": 0.18346351385116577, "mean_token_accuracy": 0.9255680441856384, "num_tokens": 60037256.0, "step": 4867 }, { "entropy": 1.3249768912792206, "epoch": 2.563454449710374, "grad_norm": 0.2849559187889099, "learning_rate": 0.00015173394981654004, "loss": 0.1919642984867096, "mean_token_accuracy": 0.9208333492279053, "num_tokens": 60049592.0, "step": 4868 }, { "entropy": 1.2834919691085815, "epoch": 2.5639810426540284, "grad_norm": 0.2871542274951935, "learning_rate": 0.00015171452040580317, "loss": 0.1890535205602646, "mean_token_accuracy": 0.9206035882234573, "num_tokens": 60061928.0, "step": 4869 }, { "entropy": 1.3021434247493744, "epoch": 2.564507635597683, "grad_norm": 0.30245718359947205, "learning_rate": 0.00015169508851871835, "loss": 0.20414495468139648, "mean_token_accuracy": 0.9124367386102676, "num_tokens": 60074264.0, "step": 4870 }, { "entropy": 1.2731509506702423, "epoch": 2.5650342285413377, "grad_norm": 0.2902166247367859, "learning_rate": 0.00015167565415643913, "loss": 0.20379520952701569, "mean_token_accuracy": 0.9124204516410828, "num_tokens": 60086600.0, "step": 4871 }, { "entropy": 1.3015616834163666, "epoch": 2.565560821484992, "grad_norm": 0.28301534056663513, "learning_rate": 0.00015165621732011924, "loss": 0.19441409409046173, "mean_token_accuracy": 0.9212340712547302, "num_tokens": 60098936.0, "step": 4872 }, { "entropy": 1.2701435387134552, "epoch": 2.5660874144286465, "grad_norm": 0.2904719114303589, "learning_rate": 0.00015163677801091255, "loss": 0.19993525743484497, "mean_token_accuracy": 0.9170213043689728, "num_tokens": 60111272.0, "step": 4873 }, { "entropy": 1.2749419212341309, "epoch": 2.5666140073723014, "grad_norm": 0.2766469419002533, "learning_rate": 0.00015161733622997298, "loss": 0.18929515779018402, "mean_token_accuracy": 0.9223896861076355, "num_tokens": 60123608.0, "step": 4874 }, { "entropy": 1.2422993183135986, "epoch": 2.567140600315956, "grad_norm": 0.27800917625427246, "learning_rate": 0.00015159789197845475, "loss": 0.1969931721687317, "mean_token_accuracy": 0.9148046523332596, "num_tokens": 60135944.0, "step": 4875 }, { "entropy": 1.3092963099479675, "epoch": 2.5676671932596102, "grad_norm": 0.29029369354248047, "learning_rate": 0.00015157844525751213, "loss": 0.1947655975818634, "mean_token_accuracy": 0.9203184247016907, "num_tokens": 60148280.0, "step": 4876 }, { "entropy": 1.2354808747768402, "epoch": 2.568193786203265, "grad_norm": 0.2631555497646332, "learning_rate": 0.00015155899606829955, "loss": 0.19616174697875977, "mean_token_accuracy": 0.9179852455854416, "num_tokens": 60160616.0, "step": 4877 }, { "entropy": 1.193561613559723, "epoch": 2.5687203791469195, "grad_norm": 0.2713335156440735, "learning_rate": 0.00015153954441197157, "loss": 0.18860536813735962, "mean_token_accuracy": 0.9259924739599228, "num_tokens": 60172952.0, "step": 4878 }, { "entropy": 1.221862941980362, "epoch": 2.569246972090574, "grad_norm": 0.2639184594154358, "learning_rate": 0.000151520090289683, "loss": 0.18559566140174866, "mean_token_accuracy": 0.9201700389385223, "num_tokens": 60185288.0, "step": 4879 }, { "entropy": 1.2744978070259094, "epoch": 2.5697735650342284, "grad_norm": 0.2902701497077942, "learning_rate": 0.00015150063370258864, "loss": 0.19379426538944244, "mean_token_accuracy": 0.9194291532039642, "num_tokens": 60197624.0, "step": 4880 }, { "entropy": 1.2000911235809326, "epoch": 2.5703001579778832, "grad_norm": 0.25564298033714294, "learning_rate": 0.00015148117465184352, "loss": 0.17944049835205078, "mean_token_accuracy": 0.9247357249259949, "num_tokens": 60209960.0, "step": 4881 }, { "entropy": 1.210292786359787, "epoch": 2.5708267509215377, "grad_norm": 0.26203998923301697, "learning_rate": 0.00015146171313860284, "loss": 0.18620462715625763, "mean_token_accuracy": 0.9194813221693039, "num_tokens": 60222296.0, "step": 4882 }, { "entropy": 1.2274521887302399, "epoch": 2.571353343865192, "grad_norm": 0.27803394198417664, "learning_rate": 0.00015144224916402194, "loss": 0.19611826539039612, "mean_token_accuracy": 0.9189580529928207, "num_tokens": 60234632.0, "step": 4883 }, { "entropy": 1.285475254058838, "epoch": 2.5718799368088465, "grad_norm": 0.3042823374271393, "learning_rate": 0.0001514227827292562, "loss": 0.20818758010864258, "mean_token_accuracy": 0.9117998331785202, "num_tokens": 60246968.0, "step": 4884 }, { "entropy": 1.2546075582504272, "epoch": 2.5724065297525014, "grad_norm": 0.27190738916397095, "learning_rate": 0.00015140331383546132, "loss": 0.1968504935503006, "mean_token_accuracy": 0.917721763253212, "num_tokens": 60259304.0, "step": 4885 }, { "entropy": 1.3057755529880524, "epoch": 2.572933122696156, "grad_norm": 0.27564769983291626, "learning_rate": 0.000151383842483793, "loss": 0.19694563746452332, "mean_token_accuracy": 0.9217658787965775, "num_tokens": 60271640.0, "step": 4886 }, { "entropy": 1.2702763080596924, "epoch": 2.5734597156398102, "grad_norm": 0.24457713961601257, "learning_rate": 0.00015136436867540718, "loss": 0.1783868968486786, "mean_token_accuracy": 0.9248514473438263, "num_tokens": 60283976.0, "step": 4887 }, { "entropy": 1.2917823791503906, "epoch": 2.573986308583465, "grad_norm": 0.30155834555625916, "learning_rate": 0.00015134489241145984, "loss": 0.211724653840065, "mean_token_accuracy": 0.9160776287317276, "num_tokens": 60296312.0, "step": 4888 }, { "entropy": 1.2568625509738922, "epoch": 2.5745129015271195, "grad_norm": 0.26823991537094116, "learning_rate": 0.00015132541369310726, "loss": 0.18977221846580505, "mean_token_accuracy": 0.9210988581180573, "num_tokens": 60308648.0, "step": 4889 }, { "entropy": 1.2876782417297363, "epoch": 2.575039494470774, "grad_norm": 0.26660630106925964, "learning_rate": 0.00015130593252150567, "loss": 0.1923052966594696, "mean_token_accuracy": 0.9208141714334488, "num_tokens": 60320984.0, "step": 4890 }, { "entropy": 1.2527808248996735, "epoch": 2.575566087414429, "grad_norm": 0.2633249759674072, "learning_rate": 0.00015128644889781165, "loss": 0.17889824509620667, "mean_token_accuracy": 0.9229971915483475, "num_tokens": 60333320.0, "step": 4891 }, { "entropy": 1.2528367638587952, "epoch": 2.5760926803580833, "grad_norm": 0.26531174778938293, "learning_rate": 0.0001512669628231818, "loss": 0.17675469815731049, "mean_token_accuracy": 0.9215357750654221, "num_tokens": 60345656.0, "step": 4892 }, { "entropy": 1.2803305685520172, "epoch": 2.5766192733017377, "grad_norm": 0.2765933573246002, "learning_rate": 0.00015124747429877292, "loss": 0.1918942928314209, "mean_token_accuracy": 0.9219794422388077, "num_tokens": 60357992.0, "step": 4893 }, { "entropy": 1.335657685995102, "epoch": 2.5771458662453925, "grad_norm": 0.31621235609054565, "learning_rate": 0.00015122798332574183, "loss": 0.1919841319322586, "mean_token_accuracy": 0.9153444766998291, "num_tokens": 60370328.0, "step": 4894 }, { "entropy": 1.2984404861927032, "epoch": 2.577672459189047, "grad_norm": 0.29850491881370544, "learning_rate": 0.00015120848990524572, "loss": 0.1919029951095581, "mean_token_accuracy": 0.9215899854898453, "num_tokens": 60382664.0, "step": 4895 }, { "entropy": 1.2599246203899384, "epoch": 2.5781990521327014, "grad_norm": 0.2824483811855316, "learning_rate": 0.00015118899403844172, "loss": 0.20817939937114716, "mean_token_accuracy": 0.9098999500274658, "num_tokens": 60395000.0, "step": 4896 }, { "entropy": 1.2227539122104645, "epoch": 2.578725645076356, "grad_norm": 0.2849332094192505, "learning_rate": 0.0001511694957264872, "loss": 0.1831064522266388, "mean_token_accuracy": 0.9280066043138504, "num_tokens": 60407336.0, "step": 4897 }, { "entropy": 1.27097687125206, "epoch": 2.5792522380200107, "grad_norm": 0.28264176845550537, "learning_rate": 0.0001511499949705397, "loss": 0.17965328693389893, "mean_token_accuracy": 0.9261346906423569, "num_tokens": 60419672.0, "step": 4898 }, { "entropy": 1.1849463284015656, "epoch": 2.579778830963665, "grad_norm": 0.27329471707344055, "learning_rate": 0.0001511304917717568, "loss": 0.19811423122882843, "mean_token_accuracy": 0.9193136245012283, "num_tokens": 60432008.0, "step": 4899 }, { "entropy": 1.2668118476867676, "epoch": 2.5803054239073195, "grad_norm": 0.2986825406551361, "learning_rate": 0.00015111098613129637, "loss": 0.1940465271472931, "mean_token_accuracy": 0.9172029942274094, "num_tokens": 60444344.0, "step": 4900 }, { "entropy": 1.2361448407173157, "epoch": 2.580832016850974, "grad_norm": 0.2798372805118561, "learning_rate": 0.00015109147805031633, "loss": 0.1894315630197525, "mean_token_accuracy": 0.9171324968338013, "num_tokens": 60456680.0, "step": 4901 }, { "entropy": 1.2954889237880707, "epoch": 2.581358609794629, "grad_norm": 0.3161953091621399, "learning_rate": 0.00015107196752997467, "loss": 0.18676374852657318, "mean_token_accuracy": 0.9234345406293869, "num_tokens": 60469016.0, "step": 4902 }, { "entropy": 1.2941784262657166, "epoch": 2.5818852027382833, "grad_norm": 0.31460681557655334, "learning_rate": 0.0001510524545714297, "loss": 0.19941675662994385, "mean_token_accuracy": 0.9116266816854477, "num_tokens": 60481352.0, "step": 4903 }, { "entropy": 1.2890789806842804, "epoch": 2.5824117956819377, "grad_norm": 0.2842191159725189, "learning_rate": 0.0001510329391758398, "loss": 0.17705805599689484, "mean_token_accuracy": 0.9248210489749908, "num_tokens": 60493688.0, "step": 4904 }, { "entropy": 1.3004145622253418, "epoch": 2.5829383886255926, "grad_norm": 0.30338117480278015, "learning_rate": 0.00015101342134436345, "loss": 0.19950935244560242, "mean_token_accuracy": 0.9210843443870544, "num_tokens": 60506024.0, "step": 4905 }, { "entropy": 1.3092130422592163, "epoch": 2.583464981569247, "grad_norm": 0.27796757221221924, "learning_rate": 0.0001509939010781593, "loss": 0.19549565017223358, "mean_token_accuracy": 0.9185791313648224, "num_tokens": 60518360.0, "step": 4906 }, { "entropy": 1.3043208718299866, "epoch": 2.5839915745129014, "grad_norm": 0.2806245684623718, "learning_rate": 0.00015097437837838622, "loss": 0.18059489130973816, "mean_token_accuracy": 0.9228035360574722, "num_tokens": 60530696.0, "step": 4907 }, { "entropy": 1.255238801240921, "epoch": 2.5845181674565563, "grad_norm": 0.25664472579956055, "learning_rate": 0.00015095485324620307, "loss": 0.17865927517414093, "mean_token_accuracy": 0.9228197932243347, "num_tokens": 60543032.0, "step": 4908 }, { "entropy": 1.3067887425422668, "epoch": 2.5850447604002107, "grad_norm": 0.27396947145462036, "learning_rate": 0.000150935325682769, "loss": 0.17701086401939392, "mean_token_accuracy": 0.9229120314121246, "num_tokens": 60555368.0, "step": 4909 }, { "entropy": 1.281879723072052, "epoch": 2.585571353343865, "grad_norm": 0.29621782898902893, "learning_rate": 0.0001509157956892432, "loss": 0.2053222805261612, "mean_token_accuracy": 0.9124819934368134, "num_tokens": 60567704.0, "step": 4910 }, { "entropy": 1.2755568325519562, "epoch": 2.58609794628752, "grad_norm": 0.27881988883018494, "learning_rate": 0.00015089626326678514, "loss": 0.1889788657426834, "mean_token_accuracy": 0.9183150380849838, "num_tokens": 60580040.0, "step": 4911 }, { "entropy": 1.2072003185749054, "epoch": 2.5866245392311744, "grad_norm": 0.2607763111591339, "learning_rate": 0.0001508767284165543, "loss": 0.16778123378753662, "mean_token_accuracy": 0.9284379333257675, "num_tokens": 60592376.0, "step": 4912 }, { "entropy": 1.249082773923874, "epoch": 2.587151132174829, "grad_norm": 0.2747190594673157, "learning_rate": 0.0001508571911397103, "loss": 0.19317784905433655, "mean_token_accuracy": 0.9194312244653702, "num_tokens": 60604712.0, "step": 4913 }, { "entropy": 1.2764122486114502, "epoch": 2.5876777251184833, "grad_norm": 0.28617385029792786, "learning_rate": 0.00015083765143741298, "loss": 0.1782130002975464, "mean_token_accuracy": 0.9292741566896439, "num_tokens": 60617048.0, "step": 4914 }, { "entropy": 1.2097508311271667, "epoch": 2.588204318062138, "grad_norm": 0.2889769971370697, "learning_rate": 0.00015081810931082235, "loss": 0.18960776925086975, "mean_token_accuracy": 0.9243573546409607, "num_tokens": 60629384.0, "step": 4915 }, { "entropy": 1.2399142682552338, "epoch": 2.5887309110057926, "grad_norm": 0.2919212281703949, "learning_rate": 0.00015079856476109848, "loss": 0.19247275590896606, "mean_token_accuracy": 0.9195180237293243, "num_tokens": 60641720.0, "step": 4916 }, { "entropy": 1.2030165493488312, "epoch": 2.589257503949447, "grad_norm": 0.29695242643356323, "learning_rate": 0.00015077901778940157, "loss": 0.21190334856510162, "mean_token_accuracy": 0.9165085405111313, "num_tokens": 60654056.0, "step": 4917 }, { "entropy": 1.1943929195404053, "epoch": 2.5897840968931014, "grad_norm": 0.2831406593322754, "learning_rate": 0.0001507594683968921, "loss": 0.18078364431858063, "mean_token_accuracy": 0.926941767334938, "num_tokens": 60666392.0, "step": 4918 }, { "entropy": 1.2222073674201965, "epoch": 2.5903106898367563, "grad_norm": 0.2951219379901886, "learning_rate": 0.00015073991658473055, "loss": 0.18491344153881073, "mean_token_accuracy": 0.9229899197816849, "num_tokens": 60678728.0, "step": 4919 }, { "entropy": 1.2402024269104004, "epoch": 2.5908372827804107, "grad_norm": 0.2913973927497864, "learning_rate": 0.00015072036235407756, "loss": 0.20621611177921295, "mean_token_accuracy": 0.9144409149885178, "num_tokens": 60691064.0, "step": 4920 }, { "entropy": 1.2773911952972412, "epoch": 2.591363875724065, "grad_norm": 0.27006563544273376, "learning_rate": 0.00015070080570609405, "loss": 0.18121947348117828, "mean_token_accuracy": 0.9238732904195786, "num_tokens": 60703400.0, "step": 4921 }, { "entropy": 1.2690989077091217, "epoch": 2.59189046866772, "grad_norm": 0.268216609954834, "learning_rate": 0.00015068124664194087, "loss": 0.18139807879924774, "mean_token_accuracy": 0.9222427159547806, "num_tokens": 60715736.0, "step": 4922 }, { "entropy": 1.200697124004364, "epoch": 2.5924170616113744, "grad_norm": 0.26179397106170654, "learning_rate": 0.00015066168516277923, "loss": 0.17864662408828735, "mean_token_accuracy": 0.9289314448833466, "num_tokens": 60728072.0, "step": 4923 }, { "entropy": 1.2993067800998688, "epoch": 2.592943654555029, "grad_norm": 0.2966409921646118, "learning_rate": 0.0001506421212697703, "loss": 0.19692149758338928, "mean_token_accuracy": 0.9166679531335831, "num_tokens": 60740408.0, "step": 4924 }, { "entropy": 1.2320555746555328, "epoch": 2.5934702474986837, "grad_norm": 0.2706405520439148, "learning_rate": 0.00015062255496407553, "loss": 0.17119428515434265, "mean_token_accuracy": 0.934698686003685, "num_tokens": 60752744.0, "step": 4925 }, { "entropy": 1.3128075301647186, "epoch": 2.593996840442338, "grad_norm": 0.29050150513648987, "learning_rate": 0.00015060298624685646, "loss": 0.20369823276996613, "mean_token_accuracy": 0.9178123623132706, "num_tokens": 60765080.0, "step": 4926 }, { "entropy": 1.3408489227294922, "epoch": 2.5945234333859926, "grad_norm": 0.28869307041168213, "learning_rate": 0.0001505834151192747, "loss": 0.19420656561851501, "mean_token_accuracy": 0.9170711934566498, "num_tokens": 60777416.0, "step": 4927 }, { "entropy": 1.3311878740787506, "epoch": 2.5950500263296474, "grad_norm": 0.3024950623512268, "learning_rate": 0.00015056384158249216, "loss": 0.2221667766571045, "mean_token_accuracy": 0.912192165851593, "num_tokens": 60789752.0, "step": 4928 }, { "entropy": 1.3265336155891418, "epoch": 2.595576619273302, "grad_norm": 0.2662777602672577, "learning_rate": 0.00015054426563767076, "loss": 0.1869158297777176, "mean_token_accuracy": 0.9230349361896515, "num_tokens": 60802088.0, "step": 4929 }, { "entropy": 1.3300181329250336, "epoch": 2.5961032122169563, "grad_norm": 0.2740636467933655, "learning_rate": 0.00015052468728597265, "loss": 0.18870602548122406, "mean_token_accuracy": 0.9215754866600037, "num_tokens": 60814424.0, "step": 4930 }, { "entropy": 1.2919826209545135, "epoch": 2.5966298051606107, "grad_norm": 0.2929941415786743, "learning_rate": 0.00015050510652856, "loss": 0.20022767782211304, "mean_token_accuracy": 0.9151937812566757, "num_tokens": 60826760.0, "step": 4931 }, { "entropy": 1.3107154071331024, "epoch": 2.597156398104265, "grad_norm": 0.2871747612953186, "learning_rate": 0.0001504855233665953, "loss": 0.20724672079086304, "mean_token_accuracy": 0.9125708937644958, "num_tokens": 60839096.0, "step": 4932 }, { "entropy": 1.3196457624435425, "epoch": 2.59768299104792, "grad_norm": 0.29808494448661804, "learning_rate": 0.000150465937801241, "loss": 0.20627810060977936, "mean_token_accuracy": 0.912663921713829, "num_tokens": 60851432.0, "step": 4933 }, { "entropy": 1.3223419189453125, "epoch": 2.5982095839915744, "grad_norm": 0.29379090666770935, "learning_rate": 0.00015044634983365983, "loss": 0.20280207693576813, "mean_token_accuracy": 0.9133302718400955, "num_tokens": 60863768.0, "step": 4934 }, { "entropy": 1.3727116882801056, "epoch": 2.598736176935229, "grad_norm": 0.2798406779766083, "learning_rate": 0.00015042675946501467, "loss": 0.1975862979888916, "mean_token_accuracy": 0.9198077917098999, "num_tokens": 60876104.0, "step": 4935 }, { "entropy": 1.3120767176151276, "epoch": 2.5992627698788837, "grad_norm": 0.27912437915802, "learning_rate": 0.00015040716669646837, "loss": 0.22149375081062317, "mean_token_accuracy": 0.9102857857942581, "num_tokens": 60888440.0, "step": 4936 }, { "entropy": 1.2911328673362732, "epoch": 2.599789362822538, "grad_norm": 0.2802145183086395, "learning_rate": 0.00015038757152918412, "loss": 0.19417962431907654, "mean_token_accuracy": 0.9157440662384033, "num_tokens": 60900776.0, "step": 4937 }, { "entropy": 1.3934805989265442, "epoch": 2.6003159557661926, "grad_norm": 0.28115054965019226, "learning_rate": 0.0001503679739643251, "loss": 0.19231252372264862, "mean_token_accuracy": 0.9217715561389923, "num_tokens": 60913112.0, "step": 4938 }, { "entropy": 1.2947366535663605, "epoch": 2.6008425487098474, "grad_norm": 0.24634382128715515, "learning_rate": 0.00015034837400305478, "loss": 0.18823671340942383, "mean_token_accuracy": 0.9209298342466354, "num_tokens": 60925448.0, "step": 4939 }, { "entropy": 1.2998045682907104, "epoch": 2.601369141653502, "grad_norm": 0.2468367964029312, "learning_rate": 0.00015032877164653668, "loss": 0.1801864206790924, "mean_token_accuracy": 0.924280971288681, "num_tokens": 60937784.0, "step": 4940 }, { "entropy": 1.294558823108673, "epoch": 2.6018957345971563, "grad_norm": 0.2462131679058075, "learning_rate": 0.00015030916689593444, "loss": 0.18104076385498047, "mean_token_accuracy": 0.923799991607666, "num_tokens": 60950120.0, "step": 4941 }, { "entropy": 1.3445029258728027, "epoch": 2.602422327540811, "grad_norm": 0.25693264603614807, "learning_rate": 0.0001502895597524119, "loss": 0.17664121091365814, "mean_token_accuracy": 0.926972508430481, "num_tokens": 60962456.0, "step": 4942 }, { "entropy": 1.3062118887901306, "epoch": 2.6029489204844656, "grad_norm": 0.2562658488750458, "learning_rate": 0.00015026995021713303, "loss": 0.17592185735702515, "mean_token_accuracy": 0.9261811375617981, "num_tokens": 60974792.0, "step": 4943 }, { "entropy": 1.3300414681434631, "epoch": 2.60347551342812, "grad_norm": 0.2567176818847656, "learning_rate": 0.00015025033829126194, "loss": 0.17641589045524597, "mean_token_accuracy": 0.9250547587871552, "num_tokens": 60987128.0, "step": 4944 }, { "entropy": 1.3550803363323212, "epoch": 2.604002106371775, "grad_norm": 0.30004099011421204, "learning_rate": 0.00015023072397596284, "loss": 0.19975590705871582, "mean_token_accuracy": 0.9152816534042358, "num_tokens": 60999464.0, "step": 4945 }, { "entropy": 1.3452115654945374, "epoch": 2.6045286993154293, "grad_norm": 0.2929515242576599, "learning_rate": 0.00015021110727240017, "loss": 0.20405176281929016, "mean_token_accuracy": 0.9165933579206467, "num_tokens": 61011800.0, "step": 4946 }, { "entropy": 1.3382624983787537, "epoch": 2.6050552922590837, "grad_norm": 0.293535977602005, "learning_rate": 0.0001501914881817384, "loss": 0.1919645369052887, "mean_token_accuracy": 0.9165096879005432, "num_tokens": 61024136.0, "step": 4947 }, { "entropy": 1.3008095026016235, "epoch": 2.605581885202738, "grad_norm": 0.271883100271225, "learning_rate": 0.00015017186670514225, "loss": 0.1803811490535736, "mean_token_accuracy": 0.9252985715866089, "num_tokens": 61036472.0, "step": 4948 }, { "entropy": 1.3121626377105713, "epoch": 2.6061084781463926, "grad_norm": 0.2665010392665863, "learning_rate": 0.0001501522428437765, "loss": 0.19021756947040558, "mean_token_accuracy": 0.917598158121109, "num_tokens": 61048808.0, "step": 4949 }, { "entropy": 1.3839079439640045, "epoch": 2.6066350710900474, "grad_norm": 0.33104774355888367, "learning_rate": 0.00015013261659880612, "loss": 0.1986754983663559, "mean_token_accuracy": 0.9182071089744568, "num_tokens": 61061144.0, "step": 4950 }, { "entropy": 1.394430249929428, "epoch": 2.607161664033702, "grad_norm": 0.30506664514541626, "learning_rate": 0.00015011298797139622, "loss": 0.20398959517478943, "mean_token_accuracy": 0.9175256192684174, "num_tokens": 61073480.0, "step": 4951 }, { "entropy": 1.3545320332050323, "epoch": 2.6076882569773563, "grad_norm": 0.26357078552246094, "learning_rate": 0.00015009335696271198, "loss": 0.18614837527275085, "mean_token_accuracy": 0.9249047487974167, "num_tokens": 61085816.0, "step": 4952 }, { "entropy": 1.3907168209552765, "epoch": 2.608214849921011, "grad_norm": 0.2741307020187378, "learning_rate": 0.00015007372357391885, "loss": 0.2001461386680603, "mean_token_accuracy": 0.9191935360431671, "num_tokens": 61098152.0, "step": 4953 }, { "entropy": 1.3543334007263184, "epoch": 2.6087414428646656, "grad_norm": 0.2835255265235901, "learning_rate": 0.0001500540878061823, "loss": 0.19529372453689575, "mean_token_accuracy": 0.9176384061574936, "num_tokens": 61110488.0, "step": 4954 }, { "entropy": 1.4248532056808472, "epoch": 2.60926803580832, "grad_norm": 0.30024221539497375, "learning_rate": 0.00015003444966066803, "loss": 0.19290918111801147, "mean_token_accuracy": 0.9208212941884995, "num_tokens": 61122824.0, "step": 4955 }, { "entropy": 1.4034450054168701, "epoch": 2.609794628751975, "grad_norm": 0.26515907049179077, "learning_rate": 0.0001500148091385418, "loss": 0.1898597776889801, "mean_token_accuracy": 0.9218143671751022, "num_tokens": 61135160.0, "step": 4956 }, { "entropy": 1.3745439052581787, "epoch": 2.6103212216956293, "grad_norm": 0.2902405858039856, "learning_rate": 0.0001499951662409696, "loss": 0.1814654916524887, "mean_token_accuracy": 0.9276015907526016, "num_tokens": 61147496.0, "step": 4957 }, { "entropy": 1.3754574656486511, "epoch": 2.6108478146392837, "grad_norm": 0.25714364647865295, "learning_rate": 0.00014997552096911745, "loss": 0.16097311675548553, "mean_token_accuracy": 0.9338142424821854, "num_tokens": 61159832.0, "step": 4958 }, { "entropy": 1.3770808279514313, "epoch": 2.6113744075829386, "grad_norm": 0.2730887234210968, "learning_rate": 0.00014995587332415164, "loss": 0.19565999507904053, "mean_token_accuracy": 0.9208303242921829, "num_tokens": 61172168.0, "step": 4959 }, { "entropy": 1.419737309217453, "epoch": 2.611901000526593, "grad_norm": 0.29134243726730347, "learning_rate": 0.00014993622330723857, "loss": 0.21380697190761566, "mean_token_accuracy": 0.9145271182060242, "num_tokens": 61184504.0, "step": 4960 }, { "entropy": 1.4257086515426636, "epoch": 2.6124275934702474, "grad_norm": 0.3023415207862854, "learning_rate": 0.0001499165709195446, "loss": 0.22057440876960754, "mean_token_accuracy": 0.911708801984787, "num_tokens": 61196840.0, "step": 4961 }, { "entropy": 1.3803713023662567, "epoch": 2.6129541864139023, "grad_norm": 0.26708221435546875, "learning_rate": 0.0001498969161622365, "loss": 0.18439361453056335, "mean_token_accuracy": 0.9259890019893646, "num_tokens": 61209176.0, "step": 4962 }, { "entropy": 1.3897138237953186, "epoch": 2.6134807793575567, "grad_norm": 0.2693830132484436, "learning_rate": 0.000149877259036481, "loss": 0.18453623354434967, "mean_token_accuracy": 0.9199992418289185, "num_tokens": 61221512.0, "step": 4963 }, { "entropy": 1.3420685827732086, "epoch": 2.614007372301211, "grad_norm": 0.26749715209007263, "learning_rate": 0.0001498575995434451, "loss": 0.18146294355392456, "mean_token_accuracy": 0.9221750348806381, "num_tokens": 61233848.0, "step": 4964 }, { "entropy": 1.424078345298767, "epoch": 2.6145339652448656, "grad_norm": 0.2738480269908905, "learning_rate": 0.00014983793768429582, "loss": 0.190167635679245, "mean_token_accuracy": 0.9162452816963196, "num_tokens": 61246184.0, "step": 4965 }, { "entropy": 1.424032837152481, "epoch": 2.61506055818852, "grad_norm": 0.3406761586666107, "learning_rate": 0.00014981827346020033, "loss": 0.21565118432044983, "mean_token_accuracy": 0.9105579107999802, "num_tokens": 61258520.0, "step": 4966 }, { "entropy": 1.3945941925048828, "epoch": 2.615587151132175, "grad_norm": 0.28860965371131897, "learning_rate": 0.00014979860687232605, "loss": 0.19807329773902893, "mean_token_accuracy": 0.918640673160553, "num_tokens": 61270856.0, "step": 4967 }, { "entropy": 1.4615474939346313, "epoch": 2.6161137440758293, "grad_norm": 0.2449038326740265, "learning_rate": 0.00014977893792184044, "loss": 0.17040449380874634, "mean_token_accuracy": 0.9294768422842026, "num_tokens": 61283192.0, "step": 4968 }, { "entropy": 1.387730598449707, "epoch": 2.6166403370194837, "grad_norm": 0.24215394258499146, "learning_rate": 0.00014975926660991114, "loss": 0.1671278029680252, "mean_token_accuracy": 0.9315755814313889, "num_tokens": 61295528.0, "step": 4969 }, { "entropy": 1.4137276411056519, "epoch": 2.6171669299631386, "grad_norm": 0.2633579969406128, "learning_rate": 0.0001497395929377059, "loss": 0.17472606897354126, "mean_token_accuracy": 0.9256842881441116, "num_tokens": 61307864.0, "step": 4970 }, { "entropy": 1.5112013518810272, "epoch": 2.617693522906793, "grad_norm": 0.30275458097457886, "learning_rate": 0.00014971991690639264, "loss": 0.18638665974140167, "mean_token_accuracy": 0.9230543673038483, "num_tokens": 61320200.0, "step": 4971 }, { "entropy": 1.4545276463031769, "epoch": 2.6182201158504474, "grad_norm": 0.2607262134552002, "learning_rate": 0.00014970023851713945, "loss": 0.18338130414485931, "mean_token_accuracy": 0.9261559545993805, "num_tokens": 61332536.0, "step": 4972 }, { "entropy": 1.5353376269340515, "epoch": 2.6187467087941023, "grad_norm": 0.2775002717971802, "learning_rate": 0.00014968055777111447, "loss": 0.19712965190410614, "mean_token_accuracy": 0.9215246587991714, "num_tokens": 61344872.0, "step": 4973 }, { "entropy": 1.492030531167984, "epoch": 2.6192733017377567, "grad_norm": 0.29135212302207947, "learning_rate": 0.0001496608746694861, "loss": 0.19520610570907593, "mean_token_accuracy": 0.9200300872325897, "num_tokens": 61357208.0, "step": 4974 }, { "entropy": 1.4847548604011536, "epoch": 2.619799894681411, "grad_norm": 0.2899549603462219, "learning_rate": 0.00014964118921342268, "loss": 0.20027291774749756, "mean_token_accuracy": 0.9164431840181351, "num_tokens": 61369544.0, "step": 4975 }, { "entropy": 1.545228362083435, "epoch": 2.620326487625066, "grad_norm": 0.32349705696105957, "learning_rate": 0.00014962150140409292, "loss": 0.202370285987854, "mean_token_accuracy": 0.9114632904529572, "num_tokens": 61381880.0, "step": 4976 }, { "entropy": 1.5073691308498383, "epoch": 2.6208530805687205, "grad_norm": 0.2822265923023224, "learning_rate": 0.0001496018112426656, "loss": 0.18207140266895294, "mean_token_accuracy": 0.9235720336437225, "num_tokens": 61394216.0, "step": 4977 }, { "entropy": 1.4734999239444733, "epoch": 2.621379673512375, "grad_norm": 0.26013490557670593, "learning_rate": 0.0001495821187303095, "loss": 0.18135610222816467, "mean_token_accuracy": 0.9248005449771881, "num_tokens": 61406552.0, "step": 4978 }, { "entropy": 1.4858646392822266, "epoch": 2.6219062664560298, "grad_norm": 0.26286378502845764, "learning_rate": 0.00014956242386819377, "loss": 0.17394036054611206, "mean_token_accuracy": 0.9256371855735779, "num_tokens": 61418888.0, "step": 4979 }, { "entropy": 1.5628124177455902, "epoch": 2.622432859399684, "grad_norm": 0.29492512345314026, "learning_rate": 0.00014954272665748753, "loss": 0.20093891024589539, "mean_token_accuracy": 0.9158370047807693, "num_tokens": 61431224.0, "step": 4980 }, { "entropy": 1.4645267724990845, "epoch": 2.6229594523433386, "grad_norm": 0.2536724805831909, "learning_rate": 0.00014952302709936004, "loss": 0.19026266038417816, "mean_token_accuracy": 0.9191191345453262, "num_tokens": 61443560.0, "step": 4981 }, { "entropy": 1.523823469877243, "epoch": 2.623486045286993, "grad_norm": 0.2790801227092743, "learning_rate": 0.00014950332519498077, "loss": 0.18979769945144653, "mean_token_accuracy": 0.9234752207994461, "num_tokens": 61455896.0, "step": 4982 }, { "entropy": 1.4641594588756561, "epoch": 2.6240126382306475, "grad_norm": 0.2721916735172272, "learning_rate": 0.00014948362094551937, "loss": 0.1872018724679947, "mean_token_accuracy": 0.9233260899782181, "num_tokens": 61468232.0, "step": 4983 }, { "entropy": 1.4742111563682556, "epoch": 2.6245392311743023, "grad_norm": 0.27885833382606506, "learning_rate": 0.00014946391435214555, "loss": 0.18875938653945923, "mean_token_accuracy": 0.9190693944692612, "num_tokens": 61480568.0, "step": 4984 }, { "entropy": 1.4826852679252625, "epoch": 2.6250658241179567, "grad_norm": 0.2697864770889282, "learning_rate": 0.0001494442054160291, "loss": 0.18166761100292206, "mean_token_accuracy": 0.9245208501815796, "num_tokens": 61492904.0, "step": 4985 }, { "entropy": 1.484268456697464, "epoch": 2.625592417061611, "grad_norm": 0.28331586718559265, "learning_rate": 0.00014942449413834008, "loss": 0.20358870923519135, "mean_token_accuracy": 0.9150479584932327, "num_tokens": 61505240.0, "step": 4986 }, { "entropy": 1.5757165551185608, "epoch": 2.626119010005266, "grad_norm": 0.29690924286842346, "learning_rate": 0.0001494047805202486, "loss": 0.2068706899881363, "mean_token_accuracy": 0.9173736572265625, "num_tokens": 61517576.0, "step": 4987 }, { "entropy": 1.533332884311676, "epoch": 2.6266456029489205, "grad_norm": 0.2705383002758026, "learning_rate": 0.000149385064562925, "loss": 0.17962002754211426, "mean_token_accuracy": 0.9280455708503723, "num_tokens": 61529912.0, "step": 4988 }, { "entropy": 1.4875019192695618, "epoch": 2.627172195892575, "grad_norm": 0.25805172324180603, "learning_rate": 0.0001493653462675397, "loss": 0.1781042516231537, "mean_token_accuracy": 0.9260552823543549, "num_tokens": 61542248.0, "step": 4989 }, { "entropy": 1.5069396495819092, "epoch": 2.6276987888362298, "grad_norm": 0.2651374340057373, "learning_rate": 0.0001493456256352632, "loss": 0.16291144490242004, "mean_token_accuracy": 0.9381222277879715, "num_tokens": 61554584.0, "step": 4990 }, { "entropy": 1.512205809354782, "epoch": 2.628225381779884, "grad_norm": 0.2627486288547516, "learning_rate": 0.0001493259026672662, "loss": 0.17600515484809875, "mean_token_accuracy": 0.9252037554979324, "num_tokens": 61566920.0, "step": 4991 }, { "entropy": 1.5533555746078491, "epoch": 2.6287519747235386, "grad_norm": 0.2759650945663452, "learning_rate": 0.0001493061773647196, "loss": 0.19801002740859985, "mean_token_accuracy": 0.916521742939949, "num_tokens": 61579256.0, "step": 4992 }, { "entropy": 1.5064502358436584, "epoch": 2.6292785676671935, "grad_norm": 0.2789139747619629, "learning_rate": 0.00014928644972879435, "loss": 0.1943892240524292, "mean_token_accuracy": 0.9217264503240585, "num_tokens": 61591592.0, "step": 4993 }, { "entropy": 1.4866106510162354, "epoch": 2.629805160610848, "grad_norm": 0.2809959352016449, "learning_rate": 0.00014926671976066153, "loss": 0.1923881471157074, "mean_token_accuracy": 0.920316144824028, "num_tokens": 61603928.0, "step": 4994 }, { "entropy": 1.452727496623993, "epoch": 2.6303317535545023, "grad_norm": 0.26779183745384216, "learning_rate": 0.00014924698746149247, "loss": 0.19007578492164612, "mean_token_accuracy": 0.9183843284845352, "num_tokens": 61616264.0, "step": 4995 }, { "entropy": 1.5179031789302826, "epoch": 2.630858346498157, "grad_norm": 0.31994399428367615, "learning_rate": 0.00014922725283245846, "loss": 0.20158439874649048, "mean_token_accuracy": 0.9133966416120529, "num_tokens": 61628600.0, "step": 4996 }, { "entropy": 1.4967687129974365, "epoch": 2.6313849394418116, "grad_norm": 0.27653440833091736, "learning_rate": 0.00014920751587473109, "loss": 0.18471458554267883, "mean_token_accuracy": 0.9204710125923157, "num_tokens": 61640936.0, "step": 4997 }, { "entropy": 1.4336793720722198, "epoch": 2.631911532385466, "grad_norm": 0.2625034749507904, "learning_rate": 0.00014918777658948207, "loss": 0.19384607672691345, "mean_token_accuracy": 0.9205842167139053, "num_tokens": 61653272.0, "step": 4998 }, { "entropy": 1.457231193780899, "epoch": 2.6324381253291205, "grad_norm": 0.27422916889190674, "learning_rate": 0.00014916803497788312, "loss": 0.19413116574287415, "mean_token_accuracy": 0.918518990278244, "num_tokens": 61665608.0, "step": 4999 }, { "entropy": 1.5142923891544342, "epoch": 2.632964718272775, "grad_norm": 0.297994464635849, "learning_rate": 0.00014914829104110624, "loss": 0.18459801375865936, "mean_token_accuracy": 0.9225414544343948, "num_tokens": 61677944.0, "step": 5000 }, { "entropy": 1.465256243944168, "epoch": 2.6334913112164298, "grad_norm": 0.26568931341171265, "learning_rate": 0.00014912854478032342, "loss": 0.16957612335681915, "mean_token_accuracy": 0.9300836622714996, "num_tokens": 61690280.0, "step": 5001 }, { "entropy": 1.4762811958789825, "epoch": 2.634017904160084, "grad_norm": 0.2986241579055786, "learning_rate": 0.00014910879619670704, "loss": 0.2125251293182373, "mean_token_accuracy": 0.9084591418504715, "num_tokens": 61702616.0, "step": 5002 }, { "entropy": 1.5015441477298737, "epoch": 2.6345444971037386, "grad_norm": 0.28843849897384644, "learning_rate": 0.00014908904529142936, "loss": 0.20061375200748444, "mean_token_accuracy": 0.9132287502288818, "num_tokens": 61714952.0, "step": 5003 }, { "entropy": 1.4222372174263, "epoch": 2.6350710900473935, "grad_norm": 0.26220911741256714, "learning_rate": 0.00014906929206566288, "loss": 0.1835784912109375, "mean_token_accuracy": 0.9224424511194229, "num_tokens": 61727288.0, "step": 5004 }, { "entropy": 1.503590077161789, "epoch": 2.635597682991048, "grad_norm": 0.2724861204624176, "learning_rate": 0.00014904953652058022, "loss": 0.18589074909687042, "mean_token_accuracy": 0.9205165356397629, "num_tokens": 61739624.0, "step": 5005 }, { "entropy": 1.4780482947826385, "epoch": 2.6361242759347023, "grad_norm": 0.2663821280002594, "learning_rate": 0.0001490297786573542, "loss": 0.16736972332000732, "mean_token_accuracy": 0.9276704490184784, "num_tokens": 61751960.0, "step": 5006 }, { "entropy": 1.5240800082683563, "epoch": 2.636650868878357, "grad_norm": 0.29903721809387207, "learning_rate": 0.00014901001847715772, "loss": 0.21255864202976227, "mean_token_accuracy": 0.914804145693779, "num_tokens": 61764296.0, "step": 5007 }, { "entropy": 1.4933780431747437, "epoch": 2.6371774618220116, "grad_norm": 0.29435548186302185, "learning_rate": 0.00014899025598116378, "loss": 0.21587303280830383, "mean_token_accuracy": 0.9131506383419037, "num_tokens": 61776632.0, "step": 5008 }, { "entropy": 1.4735883176326752, "epoch": 2.637704054765666, "grad_norm": 0.26635274291038513, "learning_rate": 0.00014897049117054562, "loss": 0.18540072441101074, "mean_token_accuracy": 0.9208427369594574, "num_tokens": 61788968.0, "step": 5009 }, { "entropy": 1.482529640197754, "epoch": 2.638230647709321, "grad_norm": 0.2780616283416748, "learning_rate": 0.00014895072404647652, "loss": 0.1992691457271576, "mean_token_accuracy": 0.9197406619787216, "num_tokens": 61801304.0, "step": 5010 }, { "entropy": 1.4966471791267395, "epoch": 2.6387572406529753, "grad_norm": 0.2593666911125183, "learning_rate": 0.00014893095461012996, "loss": 0.1759515404701233, "mean_token_accuracy": 0.9271847456693649, "num_tokens": 61813640.0, "step": 5011 }, { "entropy": 1.5135290026664734, "epoch": 2.6392838335966298, "grad_norm": 0.29530930519104004, "learning_rate": 0.00014891118286267953, "loss": 0.1886937916278839, "mean_token_accuracy": 0.9284406006336212, "num_tokens": 61825976.0, "step": 5012 }, { "entropy": 1.5016413629055023, "epoch": 2.639810426540284, "grad_norm": 0.2679826021194458, "learning_rate": 0.00014889140880529895, "loss": 0.18548890948295593, "mean_token_accuracy": 0.9230465292930603, "num_tokens": 61838312.0, "step": 5013 }, { "entropy": 1.4605536758899689, "epoch": 2.640337019483939, "grad_norm": 0.26483213901519775, "learning_rate": 0.00014887163243916212, "loss": 0.1955711394548416, "mean_token_accuracy": 0.9219475090503693, "num_tokens": 61850648.0, "step": 5014 }, { "entropy": 1.4169133007526398, "epoch": 2.6408636124275935, "grad_norm": 0.25406575202941895, "learning_rate": 0.00014885185376544303, "loss": 0.18453362584114075, "mean_token_accuracy": 0.9296320825815201, "num_tokens": 61862984.0, "step": 5015 }, { "entropy": 1.4207545518875122, "epoch": 2.641390205371248, "grad_norm": 0.26548707485198975, "learning_rate": 0.00014883207278531583, "loss": 0.1941414475440979, "mean_token_accuracy": 0.9198261648416519, "num_tokens": 61875320.0, "step": 5016 }, { "entropy": 1.4815255403518677, "epoch": 2.6419167983149023, "grad_norm": 0.30611151456832886, "learning_rate": 0.0001488122894999548, "loss": 0.19840019941329956, "mean_token_accuracy": 0.9162526428699493, "num_tokens": 61887656.0, "step": 5017 }, { "entropy": 1.459589034318924, "epoch": 2.642443391258557, "grad_norm": 0.26431792974472046, "learning_rate": 0.00014879250391053436, "loss": 0.19742351770401, "mean_token_accuracy": 0.9196898192167282, "num_tokens": 61899992.0, "step": 5018 }, { "entropy": 1.4588222205638885, "epoch": 2.6429699842022116, "grad_norm": 0.2513519823551178, "learning_rate": 0.00014877271601822906, "loss": 0.17419758439064026, "mean_token_accuracy": 0.9283565282821655, "num_tokens": 61912328.0, "step": 5019 }, { "entropy": 1.4621175527572632, "epoch": 2.643496577145866, "grad_norm": 0.2847839295864105, "learning_rate": 0.00014875292582421361, "loss": 0.20356279611587524, "mean_token_accuracy": 0.9177330881357193, "num_tokens": 61924664.0, "step": 5020 }, { "entropy": 1.4893657863140106, "epoch": 2.644023170089521, "grad_norm": 0.2779315710067749, "learning_rate": 0.0001487331333296628, "loss": 0.18966048955917358, "mean_token_accuracy": 0.9230923056602478, "num_tokens": 61937000.0, "step": 5021 }, { "entropy": 1.4491442739963531, "epoch": 2.6445497630331753, "grad_norm": 0.26622483134269714, "learning_rate": 0.00014871333853575162, "loss": 0.17434798181056976, "mean_token_accuracy": 0.9300359487533569, "num_tokens": 61949336.0, "step": 5022 }, { "entropy": 1.4646160006523132, "epoch": 2.6450763559768298, "grad_norm": 0.2670898139476776, "learning_rate": 0.0001486935414436552, "loss": 0.18202300369739532, "mean_token_accuracy": 0.9229418784379959, "num_tokens": 61961672.0, "step": 5023 }, { "entropy": 1.4607856273651123, "epoch": 2.6456029489204846, "grad_norm": 0.2811572551727295, "learning_rate": 0.0001486737420545487, "loss": 0.191569522023201, "mean_token_accuracy": 0.9196878373622894, "num_tokens": 61974008.0, "step": 5024 }, { "entropy": 1.4494915902614594, "epoch": 2.646129541864139, "grad_norm": 0.280921071767807, "learning_rate": 0.00014865394036960757, "loss": 0.20201906561851501, "mean_token_accuracy": 0.9147041141986847, "num_tokens": 61986344.0, "step": 5025 }, { "entropy": 1.4409070909023285, "epoch": 2.6466561348077935, "grad_norm": 0.30701422691345215, "learning_rate": 0.00014863413639000728, "loss": 0.21084938943386078, "mean_token_accuracy": 0.9105718582868576, "num_tokens": 61998680.0, "step": 5026 }, { "entropy": 1.488195687532425, "epoch": 2.6471827277514484, "grad_norm": 0.2876113951206207, "learning_rate": 0.0001486143301169235, "loss": 0.19386553764343262, "mean_token_accuracy": 0.9238238483667374, "num_tokens": 62011016.0, "step": 5027 }, { "entropy": 1.4491178691387177, "epoch": 2.647709320695103, "grad_norm": 0.27359431982040405, "learning_rate": 0.000148594521551532, "loss": 0.1898740977048874, "mean_token_accuracy": 0.9226633757352829, "num_tokens": 62023352.0, "step": 5028 }, { "entropy": 1.458969622850418, "epoch": 2.648235913638757, "grad_norm": 0.2540356516838074, "learning_rate": 0.0001485747106950087, "loss": 0.16982772946357727, "mean_token_accuracy": 0.9287703484296799, "num_tokens": 62035688.0, "step": 5029 }, { "entropy": 1.513466477394104, "epoch": 2.6487625065824116, "grad_norm": 0.3041362166404724, "learning_rate": 0.00014855489754852968, "loss": 0.19860799610614777, "mean_token_accuracy": 0.9202546030282974, "num_tokens": 62048024.0, "step": 5030 }, { "entropy": 1.4717740714550018, "epoch": 2.6492890995260665, "grad_norm": 0.26170480251312256, "learning_rate": 0.00014853508211327106, "loss": 0.18246625363826752, "mean_token_accuracy": 0.9252501279115677, "num_tokens": 62060360.0, "step": 5031 }, { "entropy": 1.485759437084198, "epoch": 2.649815692469721, "grad_norm": 0.2745889127254486, "learning_rate": 0.00014851526439040922, "loss": 0.18612299859523773, "mean_token_accuracy": 0.9231321662664413, "num_tokens": 62072696.0, "step": 5032 }, { "entropy": 1.4918552339076996, "epoch": 2.6503422854133754, "grad_norm": 0.282909095287323, "learning_rate": 0.00014849544438112067, "loss": 0.1870800256729126, "mean_token_accuracy": 0.9241845160722733, "num_tokens": 62085032.0, "step": 5033 }, { "entropy": 1.468372255563736, "epoch": 2.65086887835703, "grad_norm": 0.25634321570396423, "learning_rate": 0.00014847562208658192, "loss": 0.19367656111717224, "mean_token_accuracy": 0.9194540530443192, "num_tokens": 62097368.0, "step": 5034 }, { "entropy": 1.4729166626930237, "epoch": 2.6513954713006846, "grad_norm": 0.2615182101726532, "learning_rate": 0.00014845579750796974, "loss": 0.18999339640140533, "mean_token_accuracy": 0.918884739279747, "num_tokens": 62109704.0, "step": 5035 }, { "entropy": 1.4983617663383484, "epoch": 2.651922064244339, "grad_norm": 0.2739679515361786, "learning_rate": 0.00014843597064646098, "loss": 0.19533707201480865, "mean_token_accuracy": 0.9183563441038132, "num_tokens": 62122040.0, "step": 5036 }, { "entropy": 1.5050725042819977, "epoch": 2.6524486571879935, "grad_norm": 0.2634129822254181, "learning_rate": 0.0001484161415032327, "loss": 0.17496910691261292, "mean_token_accuracy": 0.9283895641565323, "num_tokens": 62134376.0, "step": 5037 }, { "entropy": 1.4989458620548248, "epoch": 2.6529752501316484, "grad_norm": 0.2645623981952667, "learning_rate": 0.000148396310079462, "loss": 0.1856268048286438, "mean_token_accuracy": 0.9227189868688583, "num_tokens": 62146712.0, "step": 5038 }, { "entropy": 1.437988817691803, "epoch": 2.653501843075303, "grad_norm": 0.24866002798080444, "learning_rate": 0.0001483764763763261, "loss": 0.19240614771842957, "mean_token_accuracy": 0.9217969477176666, "num_tokens": 62159048.0, "step": 5039 }, { "entropy": 1.495307207107544, "epoch": 2.654028436018957, "grad_norm": 0.2985769510269165, "learning_rate": 0.00014835664039500256, "loss": 0.18848103284835815, "mean_token_accuracy": 0.9216516762971878, "num_tokens": 62171384.0, "step": 5040 }, { "entropy": 1.5302987098693848, "epoch": 2.654555028962612, "grad_norm": 0.29026493430137634, "learning_rate": 0.0001483368021366688, "loss": 0.19517871737480164, "mean_token_accuracy": 0.919246032834053, "num_tokens": 62183720.0, "step": 5041 }, { "entropy": 1.5133644342422485, "epoch": 2.6550816219062665, "grad_norm": 0.29291194677352905, "learning_rate": 0.00014831696160250255, "loss": 0.1887335330247879, "mean_token_accuracy": 0.9231208711862564, "num_tokens": 62196056.0, "step": 5042 }, { "entropy": 1.5374446511268616, "epoch": 2.655608214849921, "grad_norm": 0.30532917380332947, "learning_rate": 0.0001482971187936816, "loss": 0.1930762231349945, "mean_token_accuracy": 0.9206221103668213, "num_tokens": 62208392.0, "step": 5043 }, { "entropy": 1.5095820128917694, "epoch": 2.656134807793576, "grad_norm": 0.2619345188140869, "learning_rate": 0.00014827727371138392, "loss": 0.16936379671096802, "mean_token_accuracy": 0.9295063018798828, "num_tokens": 62220728.0, "step": 5044 }, { "entropy": 1.4872773885726929, "epoch": 2.6566614007372302, "grad_norm": 0.259647399187088, "learning_rate": 0.00014825742635678763, "loss": 0.18199995160102844, "mean_token_accuracy": 0.9230765402317047, "num_tokens": 62233064.0, "step": 5045 }, { "entropy": 1.481743037700653, "epoch": 2.6571879936808847, "grad_norm": 0.2543366551399231, "learning_rate": 0.00014823757673107087, "loss": 0.1779671460390091, "mean_token_accuracy": 0.9248911142349243, "num_tokens": 62245400.0, "step": 5046 }, { "entropy": 1.4478746354579926, "epoch": 2.657714586624539, "grad_norm": 0.41329747438430786, "learning_rate": 0.00014821772483541206, "loss": 0.2164127230644226, "mean_token_accuracy": 0.9103289246559143, "num_tokens": 62257736.0, "step": 5047 }, { "entropy": 1.3805460035800934, "epoch": 2.658241179568194, "grad_norm": 0.2816043198108673, "learning_rate": 0.00014819787067098974, "loss": 0.16988952457904816, "mean_token_accuracy": 0.9290281236171722, "num_tokens": 62270072.0, "step": 5048 }, { "entropy": 1.4640763998031616, "epoch": 2.6587677725118484, "grad_norm": 0.3088597357273102, "learning_rate": 0.00014817801423898242, "loss": 0.2151375412940979, "mean_token_accuracy": 0.9137706756591797, "num_tokens": 62282408.0, "step": 5049 }, { "entropy": 1.4645437598228455, "epoch": 2.659294365455503, "grad_norm": 0.2925296425819397, "learning_rate": 0.00014815815554056888, "loss": 0.20622608065605164, "mean_token_accuracy": 0.916460320353508, "num_tokens": 62294744.0, "step": 5050 }, { "entropy": 1.4329487681388855, "epoch": 2.659820958399157, "grad_norm": 0.2808581292629242, "learning_rate": 0.00014813829457692811, "loss": 0.19199764728546143, "mean_token_accuracy": 0.9220515191555023, "num_tokens": 62307080.0, "step": 5051 }, { "entropy": 1.4280554354190826, "epoch": 2.660347551342812, "grad_norm": 0.3025852143764496, "learning_rate": 0.00014811843134923905, "loss": 0.20314553380012512, "mean_token_accuracy": 0.9143315702676773, "num_tokens": 62319416.0, "step": 5052 }, { "entropy": 1.4104456305503845, "epoch": 2.6608741442864665, "grad_norm": 0.25764983892440796, "learning_rate": 0.0001480985658586809, "loss": 0.19061550498008728, "mean_token_accuracy": 0.9198824912309647, "num_tokens": 62331752.0, "step": 5053 }, { "entropy": 1.3653182983398438, "epoch": 2.661400737230121, "grad_norm": 0.25570061802864075, "learning_rate": 0.00014807869810643293, "loss": 0.185185968875885, "mean_token_accuracy": 0.9199551194906235, "num_tokens": 62344088.0, "step": 5054 }, { "entropy": 1.406097024679184, "epoch": 2.661927330173776, "grad_norm": 0.2705627679824829, "learning_rate": 0.0001480588280936746, "loss": 0.18984414637088776, "mean_token_accuracy": 0.922783151268959, "num_tokens": 62356424.0, "step": 5055 }, { "entropy": 1.3973156809806824, "epoch": 2.6624539231174302, "grad_norm": 0.2610485255718231, "learning_rate": 0.0001480389558215855, "loss": 0.18623566627502441, "mean_token_accuracy": 0.9179131835699081, "num_tokens": 62368760.0, "step": 5056 }, { "entropy": 1.4304659962654114, "epoch": 2.6629805160610847, "grad_norm": 0.2898637056350708, "learning_rate": 0.00014801908129134526, "loss": 0.19678384065628052, "mean_token_accuracy": 0.9213199466466904, "num_tokens": 62381096.0, "step": 5057 }, { "entropy": 1.4300953447818756, "epoch": 2.6635071090047395, "grad_norm": 0.2751653492450714, "learning_rate": 0.0001479992045041338, "loss": 0.20221449434757233, "mean_token_accuracy": 0.9203903675079346, "num_tokens": 62393432.0, "step": 5058 }, { "entropy": 1.427178055047989, "epoch": 2.664033701948394, "grad_norm": 0.290485680103302, "learning_rate": 0.000147979325461131, "loss": 0.21843308210372925, "mean_token_accuracy": 0.913594514131546, "num_tokens": 62405768.0, "step": 5059 }, { "entropy": 1.385628342628479, "epoch": 2.6645602948920484, "grad_norm": 0.25159385800361633, "learning_rate": 0.000147959444163517, "loss": 0.1820984035730362, "mean_token_accuracy": 0.9247033447027206, "num_tokens": 62418104.0, "step": 5060 }, { "entropy": 1.4184448421001434, "epoch": 2.6650868878357032, "grad_norm": 0.27652180194854736, "learning_rate": 0.00014793956061247206, "loss": 0.19931438565254211, "mean_token_accuracy": 0.9216466546058655, "num_tokens": 62430440.0, "step": 5061 }, { "entropy": 1.4194599390029907, "epoch": 2.6656134807793577, "grad_norm": 0.25531280040740967, "learning_rate": 0.00014791967480917657, "loss": 0.20077663660049438, "mean_token_accuracy": 0.9188417941331863, "num_tokens": 62442776.0, "step": 5062 }, { "entropy": 1.4733093976974487, "epoch": 2.666140073723012, "grad_norm": 0.2748359739780426, "learning_rate": 0.00014789978675481099, "loss": 0.20483776926994324, "mean_token_accuracy": 0.9151559323072433, "num_tokens": 62455112.0, "step": 5063 }, { "entropy": 1.45448699593544, "epoch": 2.6666666666666665, "grad_norm": 0.27252256870269775, "learning_rate": 0.00014787989645055592, "loss": 0.1859803944826126, "mean_token_accuracy": 0.9244741946458817, "num_tokens": 62467448.0, "step": 5064 }, { "entropy": 1.4732069373130798, "epoch": 2.6671932596103214, "grad_norm": 0.2930166721343994, "learning_rate": 0.0001478600038975922, "loss": 0.19164472818374634, "mean_token_accuracy": 0.9163028299808502, "num_tokens": 62479784.0, "step": 5065 }, { "entropy": 1.5055941045284271, "epoch": 2.667719852553976, "grad_norm": 0.2679279148578644, "learning_rate": 0.0001478401090971007, "loss": 0.19617860019207, "mean_token_accuracy": 0.9202954471111298, "num_tokens": 62492120.0, "step": 5066 }, { "entropy": 1.460567593574524, "epoch": 2.6682464454976302, "grad_norm": 0.27816247940063477, "learning_rate": 0.00014782021205026253, "loss": 0.19984135031700134, "mean_token_accuracy": 0.9161521047353745, "num_tokens": 62504456.0, "step": 5067 }, { "entropy": 1.5180878043174744, "epoch": 2.6687730384412847, "grad_norm": 0.2608720064163208, "learning_rate": 0.00014780031275825873, "loss": 0.17761757969856262, "mean_token_accuracy": 0.9275451302528381, "num_tokens": 62516792.0, "step": 5068 }, { "entropy": 1.472340166568756, "epoch": 2.6692996313849395, "grad_norm": 0.2798198461532593, "learning_rate": 0.00014778041122227075, "loss": 0.19814461469650269, "mean_token_accuracy": 0.9174378514289856, "num_tokens": 62529128.0, "step": 5069 }, { "entropy": 1.4553137123584747, "epoch": 2.669826224328594, "grad_norm": 0.26443323493003845, "learning_rate": 0.0001477605074434799, "loss": 0.1944284290075302, "mean_token_accuracy": 0.9212834388017654, "num_tokens": 62541464.0, "step": 5070 }, { "entropy": 1.4736585021018982, "epoch": 2.6703528172722484, "grad_norm": 0.26062700152397156, "learning_rate": 0.00014774060142306783, "loss": 0.18508225679397583, "mean_token_accuracy": 0.9232953488826752, "num_tokens": 62553800.0, "step": 5071 }, { "entropy": 1.4530866146087646, "epoch": 2.6708794102159032, "grad_norm": 0.2670004665851593, "learning_rate": 0.00014772069316221624, "loss": 0.18442218005657196, "mean_token_accuracy": 0.9211182296276093, "num_tokens": 62566136.0, "step": 5072 }, { "entropy": 1.5300174951553345, "epoch": 2.6714060031595577, "grad_norm": 0.29020318388938904, "learning_rate": 0.00014770078266210693, "loss": 0.19545911252498627, "mean_token_accuracy": 0.9184393137693405, "num_tokens": 62578472.0, "step": 5073 }, { "entropy": 1.481099247932434, "epoch": 2.671932596103212, "grad_norm": 0.2822254002094269, "learning_rate": 0.00014768086992392187, "loss": 0.21277567744255066, "mean_token_accuracy": 0.9113451242446899, "num_tokens": 62590808.0, "step": 5074 }, { "entropy": 1.4741357564926147, "epoch": 2.672459189046867, "grad_norm": 0.2677938640117645, "learning_rate": 0.0001476609549488432, "loss": 0.18364793062210083, "mean_token_accuracy": 0.9212507903575897, "num_tokens": 62603144.0, "step": 5075 }, { "entropy": 1.4302943646907806, "epoch": 2.6729857819905214, "grad_norm": 0.28869354724884033, "learning_rate": 0.00014764103773805317, "loss": 0.19501850008964539, "mean_token_accuracy": 0.9206612259149551, "num_tokens": 62615480.0, "step": 5076 }, { "entropy": 1.4747921526432037, "epoch": 2.673512374934176, "grad_norm": 0.28305885195732117, "learning_rate": 0.00014762111829273408, "loss": 0.19867157936096191, "mean_token_accuracy": 0.9136838912963867, "num_tokens": 62627816.0, "step": 5077 }, { "entropy": 1.477564960718155, "epoch": 2.6740389678778307, "grad_norm": 0.29496532678604126, "learning_rate": 0.00014760119661406848, "loss": 0.2132798433303833, "mean_token_accuracy": 0.9153429567813873, "num_tokens": 62640152.0, "step": 5078 }, { "entropy": 1.4560523927211761, "epoch": 2.674565560821485, "grad_norm": 0.2781224548816681, "learning_rate": 0.00014758127270323901, "loss": 0.19361227750778198, "mean_token_accuracy": 0.9156886488199234, "num_tokens": 62652488.0, "step": 5079 }, { "entropy": 1.4673229455947876, "epoch": 2.6750921537651395, "grad_norm": 0.2802741527557373, "learning_rate": 0.00014756134656142842, "loss": 0.19040311872959137, "mean_token_accuracy": 0.9192695170640945, "num_tokens": 62664824.0, "step": 5080 }, { "entropy": 1.4941490292549133, "epoch": 2.675618746708794, "grad_norm": 0.289615273475647, "learning_rate": 0.00014754141818981958, "loss": 0.2048090100288391, "mean_token_accuracy": 0.9167844653129578, "num_tokens": 62677160.0, "step": 5081 }, { "entropy": 1.5785216391086578, "epoch": 2.6761453396524484, "grad_norm": 0.29720696806907654, "learning_rate": 0.00014752148758959556, "loss": 0.2018081247806549, "mean_token_accuracy": 0.9176874905824661, "num_tokens": 62689496.0, "step": 5082 }, { "entropy": 1.4724806249141693, "epoch": 2.6766719325961033, "grad_norm": 0.26232361793518066, "learning_rate": 0.0001475015547619395, "loss": 0.18163368105888367, "mean_token_accuracy": 0.9263022541999817, "num_tokens": 62701832.0, "step": 5083 }, { "entropy": 1.458247810602188, "epoch": 2.6771985255397577, "grad_norm": 0.25973543524742126, "learning_rate": 0.00014748161970803476, "loss": 0.18482840061187744, "mean_token_accuracy": 0.9212622344493866, "num_tokens": 62714168.0, "step": 5084 }, { "entropy": 1.4636139869689941, "epoch": 2.677725118483412, "grad_norm": 0.2422919124364853, "learning_rate": 0.00014746168242906466, "loss": 0.18235735595226288, "mean_token_accuracy": 0.925435408949852, "num_tokens": 62726504.0, "step": 5085 }, { "entropy": 1.5218181014060974, "epoch": 2.678251711427067, "grad_norm": 0.2919144928455353, "learning_rate": 0.00014744174292621284, "loss": 0.20702354609966278, "mean_token_accuracy": 0.9145085662603378, "num_tokens": 62738840.0, "step": 5086 }, { "entropy": 1.525699645280838, "epoch": 2.6787783043707214, "grad_norm": 0.2882302701473236, "learning_rate": 0.000147421801200663, "loss": 0.1976340264081955, "mean_token_accuracy": 0.9134345352649689, "num_tokens": 62751176.0, "step": 5087 }, { "entropy": 1.4348933696746826, "epoch": 2.679304897314376, "grad_norm": 0.2594358026981354, "learning_rate": 0.00014740185725359888, "loss": 0.18077734112739563, "mean_token_accuracy": 0.9274876117706299, "num_tokens": 62763512.0, "step": 5088 }, { "entropy": 1.5126748085021973, "epoch": 2.6798314902580307, "grad_norm": 0.27899715304374695, "learning_rate": 0.00014738191108620453, "loss": 0.16763128340244293, "mean_token_accuracy": 0.9275881052017212, "num_tokens": 62775848.0, "step": 5089 }, { "entropy": 1.4852455258369446, "epoch": 2.680358083201685, "grad_norm": 0.2729766368865967, "learning_rate": 0.00014736196269966398, "loss": 0.19001656770706177, "mean_token_accuracy": 0.920672133564949, "num_tokens": 62788184.0, "step": 5090 }, { "entropy": 1.5065564215183258, "epoch": 2.6808846761453395, "grad_norm": 0.2911035120487213, "learning_rate": 0.00014734201209516147, "loss": 0.1995036005973816, "mean_token_accuracy": 0.9154681265354156, "num_tokens": 62800520.0, "step": 5091 }, { "entropy": 1.533303052186966, "epoch": 2.6814112690889944, "grad_norm": 0.2991733253002167, "learning_rate": 0.00014732205927388135, "loss": 0.2060600221157074, "mean_token_accuracy": 0.9143246114253998, "num_tokens": 62812856.0, "step": 5092 }, { "entropy": 1.460000604391098, "epoch": 2.681937862032649, "grad_norm": 0.29276540875434875, "learning_rate": 0.00014730210423700808, "loss": 0.21440377831459045, "mean_token_accuracy": 0.9087410867214203, "num_tokens": 62825192.0, "step": 5093 }, { "entropy": 1.5091078579425812, "epoch": 2.6824644549763033, "grad_norm": 0.2839752435684204, "learning_rate": 0.00014728214698572631, "loss": 0.18155799806118011, "mean_token_accuracy": 0.9258093386888504, "num_tokens": 62837528.0, "step": 5094 }, { "entropy": 1.4895299971103668, "epoch": 2.682991047919958, "grad_norm": 0.29584982991218567, "learning_rate": 0.00014726218752122077, "loss": 0.1990211009979248, "mean_token_accuracy": 0.9221978783607483, "num_tokens": 62849864.0, "step": 5095 }, { "entropy": 1.5201840102672577, "epoch": 2.6835176408636126, "grad_norm": 0.2847629487514496, "learning_rate": 0.00014724222584467636, "loss": 0.18885351717472076, "mean_token_accuracy": 0.9195914417505264, "num_tokens": 62862200.0, "step": 5096 }, { "entropy": 1.5187770426273346, "epoch": 2.684044233807267, "grad_norm": 0.2975653111934662, "learning_rate": 0.00014722226195727805, "loss": 0.18812790513038635, "mean_token_accuracy": 0.9264185279607773, "num_tokens": 62874536.0, "step": 5097 }, { "entropy": 1.5271228551864624, "epoch": 2.6845708267509214, "grad_norm": 0.30130523443222046, "learning_rate": 0.00014720229586021098, "loss": 0.20495375990867615, "mean_token_accuracy": 0.9173427224159241, "num_tokens": 62886872.0, "step": 5098 }, { "entropy": 1.4671573638916016, "epoch": 2.685097419694576, "grad_norm": 0.2789948880672455, "learning_rate": 0.00014718232755466044, "loss": 0.19155564904212952, "mean_token_accuracy": 0.9244812875986099, "num_tokens": 62899208.0, "step": 5099 }, { "entropy": 1.4602892696857452, "epoch": 2.6856240126382307, "grad_norm": 0.282321959733963, "learning_rate": 0.00014716235704181183, "loss": 0.19326922297477722, "mean_token_accuracy": 0.9190951883792877, "num_tokens": 62911544.0, "step": 5100 }, { "entropy": 1.4617981910705566, "epoch": 2.686150605581885, "grad_norm": 0.2758800685405731, "learning_rate": 0.00014714238432285068, "loss": 0.18824873864650726, "mean_token_accuracy": 0.9187182486057281, "num_tokens": 62923880.0, "step": 5101 }, { "entropy": 1.569584608078003, "epoch": 2.6866771985255395, "grad_norm": 0.3216269314289093, "learning_rate": 0.00014712240939896267, "loss": 0.20186135172843933, "mean_token_accuracy": 0.9188182950019836, "num_tokens": 62936216.0, "step": 5102 }, { "entropy": 1.557395488023758, "epoch": 2.6872037914691944, "grad_norm": 0.299017071723938, "learning_rate": 0.00014710243227133358, "loss": 0.2022053301334381, "mean_token_accuracy": 0.9197170734405518, "num_tokens": 62948552.0, "step": 5103 }, { "entropy": 1.4289929568767548, "epoch": 2.687730384412849, "grad_norm": 0.2511787712574005, "learning_rate": 0.00014708245294114933, "loss": 0.17053452134132385, "mean_token_accuracy": 0.9278395920991898, "num_tokens": 62960888.0, "step": 5104 }, { "entropy": 1.5246893167495728, "epoch": 2.6882569773565033, "grad_norm": 0.3040166199207306, "learning_rate": 0.00014706247140959598, "loss": 0.211963951587677, "mean_token_accuracy": 0.9108811169862747, "num_tokens": 62973224.0, "step": 5105 }, { "entropy": 1.5441584885120392, "epoch": 2.688783570300158, "grad_norm": 0.28725534677505493, "learning_rate": 0.00014704248767785972, "loss": 0.20567721128463745, "mean_token_accuracy": 0.9181210845708847, "num_tokens": 62985560.0, "step": 5106 }, { "entropy": 1.5119162201881409, "epoch": 2.6893101632438126, "grad_norm": 0.29949843883514404, "learning_rate": 0.00014702250174712683, "loss": 0.2123764157295227, "mean_token_accuracy": 0.9134354293346405, "num_tokens": 62997896.0, "step": 5107 }, { "entropy": 1.4511745274066925, "epoch": 2.689836756187467, "grad_norm": 0.2614595592021942, "learning_rate": 0.00014700251361858386, "loss": 0.18792091310024261, "mean_token_accuracy": 0.9241390973329544, "num_tokens": 63010232.0, "step": 5108 }, { "entropy": 1.4284895956516266, "epoch": 2.690363349131122, "grad_norm": 0.26647090911865234, "learning_rate": 0.0001469825232934173, "loss": 0.18051902949810028, "mean_token_accuracy": 0.9248806685209274, "num_tokens": 63022568.0, "step": 5109 }, { "entropy": 1.4971970617771149, "epoch": 2.6908899420747763, "grad_norm": 0.2562994062900543, "learning_rate": 0.00014696253077281385, "loss": 0.18611495196819305, "mean_token_accuracy": 0.9216926395893097, "num_tokens": 63034904.0, "step": 5110 }, { "entropy": 1.4280113577842712, "epoch": 2.6914165350184307, "grad_norm": 0.27627092599868774, "learning_rate": 0.00014694253605796042, "loss": 0.19952592253684998, "mean_token_accuracy": 0.9170150011777878, "num_tokens": 63047240.0, "step": 5111 }, { "entropy": 1.38975790143013, "epoch": 2.6919431279620856, "grad_norm": 0.25191327929496765, "learning_rate": 0.00014692253915004393, "loss": 0.16972798109054565, "mean_token_accuracy": 0.9325916618108749, "num_tokens": 63059576.0, "step": 5112 }, { "entropy": 1.4815746545791626, "epoch": 2.69246972090574, "grad_norm": 0.27529120445251465, "learning_rate": 0.00014690254005025148, "loss": 0.1895769238471985, "mean_token_accuracy": 0.9245963543653488, "num_tokens": 63071912.0, "step": 5113 }, { "entropy": 1.3822405934333801, "epoch": 2.6929963138493944, "grad_norm": 0.28958284854888916, "learning_rate": 0.0001468825387597703, "loss": 0.1995624601840973, "mean_token_accuracy": 0.9220484644174576, "num_tokens": 63084248.0, "step": 5114 }, { "entropy": 1.3855730891227722, "epoch": 2.693522906793049, "grad_norm": 0.250946044921875, "learning_rate": 0.0001468625352797878, "loss": 0.1722625494003296, "mean_token_accuracy": 0.9266123324632645, "num_tokens": 63096584.0, "step": 5115 }, { "entropy": 1.4091150760650635, "epoch": 2.6940494997367033, "grad_norm": 0.2849009037017822, "learning_rate": 0.00014684252961149144, "loss": 0.2039925754070282, "mean_token_accuracy": 0.9155628532171249, "num_tokens": 63108920.0, "step": 5116 }, { "entropy": 1.3787662386894226, "epoch": 2.694576092680358, "grad_norm": 0.28099095821380615, "learning_rate": 0.00014682252175606878, "loss": 0.19700410962104797, "mean_token_accuracy": 0.9183400124311447, "num_tokens": 63121256.0, "step": 5117 }, { "entropy": 1.3753366470336914, "epoch": 2.6951026856240126, "grad_norm": 0.2916547656059265, "learning_rate": 0.00014680251171470766, "loss": 0.2051456719636917, "mean_token_accuracy": 0.9148056507110596, "num_tokens": 63133592.0, "step": 5118 }, { "entropy": 1.3619878888130188, "epoch": 2.695629278567667, "grad_norm": 0.27181702852249146, "learning_rate": 0.0001467824994885959, "loss": 0.16953186690807343, "mean_token_accuracy": 0.9321550875902176, "num_tokens": 63145928.0, "step": 5119 }, { "entropy": 1.3182980716228485, "epoch": 2.696155871511322, "grad_norm": 0.2878861427307129, "learning_rate": 0.0001467624850789215, "loss": 0.189472496509552, "mean_token_accuracy": 0.9215676188468933, "num_tokens": 63158264.0, "step": 5120 }, { "entropy": 1.3578261733055115, "epoch": 2.6966824644549763, "grad_norm": 0.29031458497047424, "learning_rate": 0.0001467424684868727, "loss": 0.19785207509994507, "mean_token_accuracy": 0.9179916083812714, "num_tokens": 63170600.0, "step": 5121 }, { "entropy": 1.3003853261470795, "epoch": 2.6972090573986307, "grad_norm": 0.2773895859718323, "learning_rate": 0.00014672244971363768, "loss": 0.18851050734519958, "mean_token_accuracy": 0.9205857366323471, "num_tokens": 63182936.0, "step": 5122 }, { "entropy": 1.348473995923996, "epoch": 2.6977356503422856, "grad_norm": 0.28892043232917786, "learning_rate": 0.00014670242876040483, "loss": 0.19180741906166077, "mean_token_accuracy": 0.9160315543413162, "num_tokens": 63195272.0, "step": 5123 }, { "entropy": 1.2486159205436707, "epoch": 2.69826224328594, "grad_norm": 0.28478798270225525, "learning_rate": 0.0001466824056283627, "loss": 0.199224591255188, "mean_token_accuracy": 0.9219311624765396, "num_tokens": 63207608.0, "step": 5124 }, { "entropy": 1.2535159289836884, "epoch": 2.6987888362295944, "grad_norm": 0.24823498725891113, "learning_rate": 0.00014666238031869994, "loss": 0.1766614466905594, "mean_token_accuracy": 0.9269942939281464, "num_tokens": 63219944.0, "step": 5125 }, { "entropy": 1.2995186150074005, "epoch": 2.6993154291732493, "grad_norm": 0.2622680962085724, "learning_rate": 0.0001466423528326054, "loss": 0.181438148021698, "mean_token_accuracy": 0.9263859242200851, "num_tokens": 63232280.0, "step": 5126 }, { "entropy": 1.3106255531311035, "epoch": 2.6998420221169037, "grad_norm": 0.300825834274292, "learning_rate": 0.00014662232317126788, "loss": 0.1900949627161026, "mean_token_accuracy": 0.919785350561142, "num_tokens": 63244616.0, "step": 5127 }, { "entropy": 1.2831209599971771, "epoch": 2.700368615060558, "grad_norm": 0.2816452085971832, "learning_rate": 0.00014660229133587653, "loss": 0.197813481092453, "mean_token_accuracy": 0.9157050102949142, "num_tokens": 63256952.0, "step": 5128 }, { "entropy": 1.2818153500556946, "epoch": 2.700895208004213, "grad_norm": 0.25588682293891907, "learning_rate": 0.00014658225732762045, "loss": 0.17363756895065308, "mean_token_accuracy": 0.9299523234367371, "num_tokens": 63269288.0, "step": 5129 }, { "entropy": 1.2921530902385712, "epoch": 2.7014218009478674, "grad_norm": 0.2761573791503906, "learning_rate": 0.00014656222114768898, "loss": 0.18385839462280273, "mean_token_accuracy": 0.9249665588140488, "num_tokens": 63281624.0, "step": 5130 }, { "entropy": 1.2621832191944122, "epoch": 2.701948393891522, "grad_norm": 0.2666982412338257, "learning_rate": 0.00014654218279727154, "loss": 0.18635493516921997, "mean_token_accuracy": 0.9211985170841217, "num_tokens": 63293960.0, "step": 5131 }, { "entropy": 1.263505905866623, "epoch": 2.7024749868351763, "grad_norm": 0.27494779229164124, "learning_rate": 0.0001465221422775577, "loss": 0.18919119238853455, "mean_token_accuracy": 0.9211875349283218, "num_tokens": 63306296.0, "step": 5132 }, { "entropy": 1.2421028017997742, "epoch": 2.7030015797788307, "grad_norm": 0.2690388560295105, "learning_rate": 0.00014650209958973713, "loss": 0.19874891638755798, "mean_token_accuracy": 0.9149452149868011, "num_tokens": 63318632.0, "step": 5133 }, { "entropy": 1.3355876505374908, "epoch": 2.7035281727224856, "grad_norm": 0.27606603503227234, "learning_rate": 0.00014648205473499963, "loss": 0.18637162446975708, "mean_token_accuracy": 0.9224206060171127, "num_tokens": 63330968.0, "step": 5134 }, { "entropy": 1.307241529226303, "epoch": 2.70405476566614, "grad_norm": 0.25661829113960266, "learning_rate": 0.0001464620077145352, "loss": 0.18009352684020996, "mean_token_accuracy": 0.9281450062990189, "num_tokens": 63343304.0, "step": 5135 }, { "entropy": 1.2898215353488922, "epoch": 2.7045813586097944, "grad_norm": 0.2869699001312256, "learning_rate": 0.0001464419585295339, "loss": 0.20290739834308624, "mean_token_accuracy": 0.9138100743293762, "num_tokens": 63355640.0, "step": 5136 }, { "entropy": 1.292168915271759, "epoch": 2.7051079515534493, "grad_norm": 0.273143470287323, "learning_rate": 0.00014642190718118593, "loss": 0.19269871711730957, "mean_token_accuracy": 0.9203228056430817, "num_tokens": 63367976.0, "step": 5137 }, { "entropy": 1.3003365695476532, "epoch": 2.7056345444971037, "grad_norm": 0.29047563672065735, "learning_rate": 0.0001464018536706816, "loss": 0.19433802366256714, "mean_token_accuracy": 0.9222328662872314, "num_tokens": 63380312.0, "step": 5138 }, { "entropy": 1.3424124121665955, "epoch": 2.706161137440758, "grad_norm": 0.28726476430892944, "learning_rate": 0.00014638179799921137, "loss": 0.1908145397901535, "mean_token_accuracy": 0.9210158437490463, "num_tokens": 63392648.0, "step": 5139 }, { "entropy": 1.2957504391670227, "epoch": 2.706687730384413, "grad_norm": 0.27413058280944824, "learning_rate": 0.00014636174016796583, "loss": 0.19619929790496826, "mean_token_accuracy": 0.9191281795501709, "num_tokens": 63404984.0, "step": 5140 }, { "entropy": 1.2907661497592926, "epoch": 2.7072143233280674, "grad_norm": 0.2575305700302124, "learning_rate": 0.00014634168017813574, "loss": 0.18570370972156525, "mean_token_accuracy": 0.9248242080211639, "num_tokens": 63417320.0, "step": 5141 }, { "entropy": 1.2979350090026855, "epoch": 2.707740916271722, "grad_norm": 0.25969117879867554, "learning_rate": 0.0001463216180309119, "loss": 0.1702679693698883, "mean_token_accuracy": 0.9241595566272736, "num_tokens": 63429656.0, "step": 5142 }, { "entropy": 1.303638905286789, "epoch": 2.7082675092153767, "grad_norm": 0.304808646440506, "learning_rate": 0.0001463015537274853, "loss": 0.21302911639213562, "mean_token_accuracy": 0.9168027937412262, "num_tokens": 63441992.0, "step": 5143 }, { "entropy": 1.3027910888195038, "epoch": 2.708794102159031, "grad_norm": 0.27357497811317444, "learning_rate": 0.00014628148726904706, "loss": 0.1874362826347351, "mean_token_accuracy": 0.9246872961521149, "num_tokens": 63454328.0, "step": 5144 }, { "entropy": 1.3277390003204346, "epoch": 2.7093206951026856, "grad_norm": 0.3108993470668793, "learning_rate": 0.00014626141865678837, "loss": 0.22254815697669983, "mean_token_accuracy": 0.9114834666252136, "num_tokens": 63466664.0, "step": 5145 }, { "entropy": 1.2865792214870453, "epoch": 2.7098472880463405, "grad_norm": 0.26160353422164917, "learning_rate": 0.0001462413478919006, "loss": 0.18020738661289215, "mean_token_accuracy": 0.9248409420251846, "num_tokens": 63479000.0, "step": 5146 }, { "entropy": 1.2977813482284546, "epoch": 2.710373880989995, "grad_norm": 0.27224621176719666, "learning_rate": 0.0001462212749755752, "loss": 0.17955082654953003, "mean_token_accuracy": 0.921922042965889, "num_tokens": 63491336.0, "step": 5147 }, { "entropy": 1.2977706491947174, "epoch": 2.7109004739336493, "grad_norm": 0.2755237817764282, "learning_rate": 0.00014620119990900384, "loss": 0.1703076809644699, "mean_token_accuracy": 0.9293846786022186, "num_tokens": 63503672.0, "step": 5148 }, { "entropy": 1.288289338350296, "epoch": 2.7114270668773037, "grad_norm": 0.2902235984802246, "learning_rate": 0.00014618112269337827, "loss": 0.20000024139881134, "mean_token_accuracy": 0.9120529741048813, "num_tokens": 63516008.0, "step": 5149 }, { "entropy": 1.3351134061813354, "epoch": 2.711953659820958, "grad_norm": 0.28813472390174866, "learning_rate": 0.0001461610433298903, "loss": 0.19814369082450867, "mean_token_accuracy": 0.9182053804397583, "num_tokens": 63528344.0, "step": 5150 }, { "entropy": 1.3223653137683868, "epoch": 2.712480252764613, "grad_norm": 0.2728074789047241, "learning_rate": 0.000146140961819732, "loss": 0.18013453483581543, "mean_token_accuracy": 0.9253092706203461, "num_tokens": 63540680.0, "step": 5151 }, { "entropy": 1.2829354405403137, "epoch": 2.7130068457082674, "grad_norm": 0.26212215423583984, "learning_rate": 0.00014612087816409533, "loss": 0.17448779940605164, "mean_token_accuracy": 0.9293143302202225, "num_tokens": 63553016.0, "step": 5152 }, { "entropy": 1.282748967409134, "epoch": 2.713533438651922, "grad_norm": 0.27840161323547363, "learning_rate": 0.00014610079236417273, "loss": 0.17790716886520386, "mean_token_accuracy": 0.9291750490665436, "num_tokens": 63565352.0, "step": 5153 }, { "entropy": 1.2521959245204926, "epoch": 2.7140600315955767, "grad_norm": 0.26914894580841064, "learning_rate": 0.00014608070442115648, "loss": 0.19306844472885132, "mean_token_accuracy": 0.9231783151626587, "num_tokens": 63577688.0, "step": 5154 }, { "entropy": 1.3317798674106598, "epoch": 2.714586624539231, "grad_norm": 0.30790823698043823, "learning_rate": 0.00014606061433623913, "loss": 0.19364537298679352, "mean_token_accuracy": 0.9153637439012527, "num_tokens": 63590024.0, "step": 5155 }, { "entropy": 1.3261720836162567, "epoch": 2.7151132174828856, "grad_norm": 0.27726447582244873, "learning_rate": 0.00014604052211061327, "loss": 0.1857507824897766, "mean_token_accuracy": 0.9212318807840347, "num_tokens": 63602360.0, "step": 5156 }, { "entropy": 1.3425556123256683, "epoch": 2.7156398104265405, "grad_norm": 0.28193601965904236, "learning_rate": 0.00014602042774547165, "loss": 0.17949122190475464, "mean_token_accuracy": 0.9272536188364029, "num_tokens": 63614696.0, "step": 5157 }, { "entropy": 1.2356054782867432, "epoch": 2.716166403370195, "grad_norm": 0.29531651735305786, "learning_rate": 0.00014600033124200718, "loss": 0.1958901435136795, "mean_token_accuracy": 0.9217116087675095, "num_tokens": 63627032.0, "step": 5158 }, { "entropy": 1.255002111196518, "epoch": 2.7166929963138493, "grad_norm": 0.28950661420822144, "learning_rate": 0.00014598023260141286, "loss": 0.204793781042099, "mean_token_accuracy": 0.9128590226173401, "num_tokens": 63639368.0, "step": 5159 }, { "entropy": 1.2777542769908905, "epoch": 2.717219589257504, "grad_norm": 0.30766382813453674, "learning_rate": 0.0001459601318248819, "loss": 0.20999419689178467, "mean_token_accuracy": 0.9123559296131134, "num_tokens": 63651704.0, "step": 5160 }, { "entropy": 1.3307510614395142, "epoch": 2.7177461822011586, "grad_norm": 0.2608412206172943, "learning_rate": 0.00014594002891360749, "loss": 0.18216381967067719, "mean_token_accuracy": 0.923665001988411, "num_tokens": 63664040.0, "step": 5161 }, { "entropy": 1.3185522556304932, "epoch": 2.718272775144813, "grad_norm": 0.2726461589336395, "learning_rate": 0.00014591992386878299, "loss": 0.17323972284793854, "mean_token_accuracy": 0.9279865473508835, "num_tokens": 63676376.0, "step": 5162 }, { "entropy": 1.2769018113613129, "epoch": 2.7187993680884674, "grad_norm": 0.26045459508895874, "learning_rate": 0.00014589981669160197, "loss": 0.1939665824174881, "mean_token_accuracy": 0.9193387180566788, "num_tokens": 63688712.0, "step": 5163 }, { "entropy": 1.3116481602191925, "epoch": 2.7193259610321223, "grad_norm": 0.2655951976776123, "learning_rate": 0.00014587970738325808, "loss": 0.19033044576644897, "mean_token_accuracy": 0.920961931347847, "num_tokens": 63701048.0, "step": 5164 }, { "entropy": 1.3548246026039124, "epoch": 2.7198525539757767, "grad_norm": 0.26746660470962524, "learning_rate": 0.00014585959594494514, "loss": 0.19389790296554565, "mean_token_accuracy": 0.9159002602100372, "num_tokens": 63713384.0, "step": 5165 }, { "entropy": 1.270853042602539, "epoch": 2.720379146919431, "grad_norm": 0.2794607877731323, "learning_rate": 0.00014583948237785693, "loss": 0.20356296002864838, "mean_token_accuracy": 0.9151900112628937, "num_tokens": 63725720.0, "step": 5166 }, { "entropy": 1.3171870708465576, "epoch": 2.7209057398630856, "grad_norm": 0.2875237762928009, "learning_rate": 0.00014581936668318755, "loss": 0.20418274402618408, "mean_token_accuracy": 0.916813850402832, "num_tokens": 63738056.0, "step": 5167 }, { "entropy": 1.2941392660140991, "epoch": 2.7214323328067405, "grad_norm": 0.2574351131916046, "learning_rate": 0.00014579924886213118, "loss": 0.1572742909193039, "mean_token_accuracy": 0.9385139495134354, "num_tokens": 63750392.0, "step": 5168 }, { "entropy": 1.3139513731002808, "epoch": 2.721958925750395, "grad_norm": 0.271741658449173, "learning_rate": 0.00014577912891588203, "loss": 0.1982661485671997, "mean_token_accuracy": 0.9115052968263626, "num_tokens": 63762728.0, "step": 5169 }, { "entropy": 1.2726760506629944, "epoch": 2.7224855186940493, "grad_norm": 0.25223416090011597, "learning_rate": 0.00014575900684563452, "loss": 0.1943812072277069, "mean_token_accuracy": 0.9204421192407608, "num_tokens": 63775064.0, "step": 5170 }, { "entropy": 1.372187465429306, "epoch": 2.723012111637704, "grad_norm": 0.2644391655921936, "learning_rate": 0.00014573888265258323, "loss": 0.19780956208705902, "mean_token_accuracy": 0.9187611937522888, "num_tokens": 63787400.0, "step": 5171 }, { "entropy": 1.3559328317642212, "epoch": 2.7235387045813586, "grad_norm": 0.2788529098033905, "learning_rate": 0.00014571875633792277, "loss": 0.20060011744499207, "mean_token_accuracy": 0.9212859869003296, "num_tokens": 63799736.0, "step": 5172 }, { "entropy": 1.309464156627655, "epoch": 2.724065297525013, "grad_norm": 0.280444860458374, "learning_rate": 0.0001456986279028479, "loss": 0.1905817836523056, "mean_token_accuracy": 0.9269229620695114, "num_tokens": 63812072.0, "step": 5173 }, { "entropy": 1.2712817192077637, "epoch": 2.724591890468668, "grad_norm": 0.24894411861896515, "learning_rate": 0.00014567849734855356, "loss": 0.171059712767601, "mean_token_accuracy": 0.9284334927797318, "num_tokens": 63824408.0, "step": 5174 }, { "entropy": 1.2753881216049194, "epoch": 2.7251184834123223, "grad_norm": 0.2422960251569748, "learning_rate": 0.00014565836467623483, "loss": 0.17582392692565918, "mean_token_accuracy": 0.9304329454898834, "num_tokens": 63836744.0, "step": 5175 }, { "entropy": 1.2553509175777435, "epoch": 2.7256450763559767, "grad_norm": 0.29317882657051086, "learning_rate": 0.0001456382298870868, "loss": 0.19796429574489594, "mean_token_accuracy": 0.9160526990890503, "num_tokens": 63849080.0, "step": 5176 }, { "entropy": 1.2531674802303314, "epoch": 2.7261716692996316, "grad_norm": 0.2940789759159088, "learning_rate": 0.00014561809298230474, "loss": 0.1948608160018921, "mean_token_accuracy": 0.9217565655708313, "num_tokens": 63861416.0, "step": 5177 }, { "entropy": 1.2800334095954895, "epoch": 2.726698262243286, "grad_norm": 0.27374762296676636, "learning_rate": 0.00014559795396308414, "loss": 0.1936039924621582, "mean_token_accuracy": 0.9136587381362915, "num_tokens": 63873752.0, "step": 5178 }, { "entropy": 1.2157056629657745, "epoch": 2.7272248551869405, "grad_norm": 0.25958263874053955, "learning_rate": 0.0001455778128306205, "loss": 0.1764679104089737, "mean_token_accuracy": 0.9242573529481888, "num_tokens": 63886088.0, "step": 5179 }, { "entropy": 1.316890001296997, "epoch": 2.727751448130595, "grad_norm": 0.26737043261528015, "learning_rate": 0.00014555766958610945, "loss": 0.1727948784828186, "mean_token_accuracy": 0.9259275048971176, "num_tokens": 63898424.0, "step": 5180 }, { "entropy": 1.2939126789569855, "epoch": 2.7282780410742498, "grad_norm": 0.2589419484138489, "learning_rate": 0.0001455375242307468, "loss": 0.19002790749073029, "mean_token_accuracy": 0.9219155609607697, "num_tokens": 63910760.0, "step": 5181 }, { "entropy": 1.2866698801517487, "epoch": 2.728804634017904, "grad_norm": 0.2805895507335663, "learning_rate": 0.00014551737676572846, "loss": 0.1931273192167282, "mean_token_accuracy": 0.9201782494783401, "num_tokens": 63923096.0, "step": 5182 }, { "entropy": 1.3028650879859924, "epoch": 2.7293312269615586, "grad_norm": 0.31638723611831665, "learning_rate": 0.00014549722719225047, "loss": 0.18288934230804443, "mean_token_accuracy": 0.9220278561115265, "num_tokens": 63935432.0, "step": 5183 }, { "entropy": 1.324157953262329, "epoch": 2.729857819905213, "grad_norm": 0.2694256007671356, "learning_rate": 0.00014547707551150908, "loss": 0.1794993281364441, "mean_token_accuracy": 0.9276534020900726, "num_tokens": 63947768.0, "step": 5184 }, { "entropy": 1.204854130744934, "epoch": 2.730384412848868, "grad_norm": 0.2793176770210266, "learning_rate": 0.00014545692172470041, "loss": 0.18844300508499146, "mean_token_accuracy": 0.9218170195817947, "num_tokens": 63960104.0, "step": 5185 }, { "entropy": 1.2477740049362183, "epoch": 2.7309110057925223, "grad_norm": 0.2856691777706146, "learning_rate": 0.00014543676583302095, "loss": 0.2099856734275818, "mean_token_accuracy": 0.9131463170051575, "num_tokens": 63972440.0, "step": 5186 }, { "entropy": 1.255644053220749, "epoch": 2.7314375987361768, "grad_norm": 0.2527347803115845, "learning_rate": 0.00014541660783766723, "loss": 0.1695612072944641, "mean_token_accuracy": 0.9271181374788284, "num_tokens": 63984776.0, "step": 5187 }, { "entropy": 1.3577595055103302, "epoch": 2.7319641916798316, "grad_norm": 0.2855788469314575, "learning_rate": 0.00014539644773983599, "loss": 0.19383448362350464, "mean_token_accuracy": 0.9202312529087067, "num_tokens": 63997112.0, "step": 5188 }, { "entropy": 1.3106902539730072, "epoch": 2.732490784623486, "grad_norm": 0.2907700836658478, "learning_rate": 0.00014537628554072392, "loss": 0.1855756938457489, "mean_token_accuracy": 0.9252744168043137, "num_tokens": 64009448.0, "step": 5189 }, { "entropy": 1.2726895809173584, "epoch": 2.7330173775671405, "grad_norm": 0.26627859473228455, "learning_rate": 0.000145356121241528, "loss": 0.17433853447437286, "mean_token_accuracy": 0.9330893158912659, "num_tokens": 64021784.0, "step": 5190 }, { "entropy": 1.2664414644241333, "epoch": 2.7335439705107953, "grad_norm": 0.31092652678489685, "learning_rate": 0.0001453359548434452, "loss": 0.20331533253192902, "mean_token_accuracy": 0.9178122878074646, "num_tokens": 64034120.0, "step": 5191 }, { "entropy": 1.3027536571025848, "epoch": 2.7340705634544498, "grad_norm": 0.2834033966064453, "learning_rate": 0.0001453157863476727, "loss": 0.2043476402759552, "mean_token_accuracy": 0.9179918766021729, "num_tokens": 64046456.0, "step": 5192 }, { "entropy": 1.2744874060153961, "epoch": 2.734597156398104, "grad_norm": 0.25400489568710327, "learning_rate": 0.0001452956157554078, "loss": 0.18056827783584595, "mean_token_accuracy": 0.9235711693763733, "num_tokens": 64058792.0, "step": 5193 }, { "entropy": 1.3080530762672424, "epoch": 2.735123749341759, "grad_norm": 0.26861700415611267, "learning_rate": 0.00014527544306784792, "loss": 0.18566924333572388, "mean_token_accuracy": 0.9226769655942917, "num_tokens": 64071128.0, "step": 5194 }, { "entropy": 1.2273122072219849, "epoch": 2.7356503422854135, "grad_norm": 0.29266297817230225, "learning_rate": 0.00014525526828619063, "loss": 0.20136258006095886, "mean_token_accuracy": 0.9192598909139633, "num_tokens": 64083464.0, "step": 5195 }, { "entropy": 1.2667721211910248, "epoch": 2.736176935229068, "grad_norm": 0.2782294750213623, "learning_rate": 0.00014523509141163349, "loss": 0.19713616371154785, "mean_token_accuracy": 0.9188579767942429, "num_tokens": 64095800.0, "step": 5196 }, { "entropy": 1.2403879165649414, "epoch": 2.7367035281727223, "grad_norm": 0.25267916917800903, "learning_rate": 0.00014521491244537434, "loss": 0.1698072850704193, "mean_token_accuracy": 0.9281718283891678, "num_tokens": 64108136.0, "step": 5197 }, { "entropy": 1.288205772638321, "epoch": 2.737230121116377, "grad_norm": 0.2854776680469513, "learning_rate": 0.0001451947313886111, "loss": 0.19052140414714813, "mean_token_accuracy": 0.9202392548322678, "num_tokens": 64120472.0, "step": 5198 }, { "entropy": 1.2585653364658356, "epoch": 2.7377567140600316, "grad_norm": 0.2774556279182434, "learning_rate": 0.0001451745482425418, "loss": 0.18510374426841736, "mean_token_accuracy": 0.9226521104574203, "num_tokens": 64132808.0, "step": 5199 }, { "entropy": 1.2777175903320312, "epoch": 2.738283307003686, "grad_norm": 0.2825121283531189, "learning_rate": 0.0001451543630083646, "loss": 0.18815097212791443, "mean_token_accuracy": 0.92147396504879, "num_tokens": 64145144.0, "step": 5200 }, { "entropy": 1.2806333005428314, "epoch": 2.7388098999473405, "grad_norm": 0.265458881855011, "learning_rate": 0.0001451341756872777, "loss": 0.1735052764415741, "mean_token_accuracy": 0.9319272637367249, "num_tokens": 64157480.0, "step": 5201 }, { "entropy": 1.232534110546112, "epoch": 2.7393364928909953, "grad_norm": 0.26001816987991333, "learning_rate": 0.00014511398628047964, "loss": 0.18147748708724976, "mean_token_accuracy": 0.9249249398708344, "num_tokens": 64169816.0, "step": 5202 }, { "entropy": 1.2178304493427277, "epoch": 2.7398630858346498, "grad_norm": 0.25026735663414, "learning_rate": 0.00014509379478916883, "loss": 0.18916335701942444, "mean_token_accuracy": 0.9198585599660873, "num_tokens": 64182152.0, "step": 5203 }, { "entropy": 1.2706682085990906, "epoch": 2.740389678778304, "grad_norm": 0.3009374737739563, "learning_rate": 0.00014507360121454398, "loss": 0.21226197481155396, "mean_token_accuracy": 0.914648026227951, "num_tokens": 64194488.0, "step": 5204 }, { "entropy": 1.2476151287555695, "epoch": 2.740916271721959, "grad_norm": 0.2885046899318695, "learning_rate": 0.00014505340555780383, "loss": 0.20312687754631042, "mean_token_accuracy": 0.9144037365913391, "num_tokens": 64206824.0, "step": 5205 }, { "entropy": 1.2514026165008545, "epoch": 2.7414428646656135, "grad_norm": 0.2752453088760376, "learning_rate": 0.00014503320782014735, "loss": 0.20632526278495789, "mean_token_accuracy": 0.9120770543813705, "num_tokens": 64219160.0, "step": 5206 }, { "entropy": 1.1842446029186249, "epoch": 2.741969457609268, "grad_norm": 0.24866744875907898, "learning_rate": 0.00014501300800277345, "loss": 0.163893461227417, "mean_token_accuracy": 0.9325317144393921, "num_tokens": 64231496.0, "step": 5207 }, { "entropy": 1.2263388633728027, "epoch": 2.742496050552923, "grad_norm": 0.285268634557724, "learning_rate": 0.00014499280610688137, "loss": 0.2103516310453415, "mean_token_accuracy": 0.9175826460123062, "num_tokens": 64243832.0, "step": 5208 }, { "entropy": 1.2222225368022919, "epoch": 2.743022643496577, "grad_norm": 0.26084497570991516, "learning_rate": 0.00014497260213367036, "loss": 0.1803930550813675, "mean_token_accuracy": 0.9286944568157196, "num_tokens": 64256168.0, "step": 5209 }, { "entropy": 1.2412607073783875, "epoch": 2.7435492364402316, "grad_norm": 0.25516054034233093, "learning_rate": 0.00014495239608433978, "loss": 0.17983819544315338, "mean_token_accuracy": 0.9248096346855164, "num_tokens": 64268504.0, "step": 5210 }, { "entropy": 1.2084096372127533, "epoch": 2.7440758293838865, "grad_norm": 0.24899202585220337, "learning_rate": 0.00014493218796008913, "loss": 0.18748557567596436, "mean_token_accuracy": 0.9227083474397659, "num_tokens": 64280840.0, "step": 5211 }, { "entropy": 1.2613386809825897, "epoch": 2.744602422327541, "grad_norm": 0.26508280634880066, "learning_rate": 0.0001449119777621181, "loss": 0.18772578239440918, "mean_token_accuracy": 0.9219543635845184, "num_tokens": 64293176.0, "step": 5212 }, { "entropy": 1.255203664302826, "epoch": 2.7451290152711953, "grad_norm": 0.2667011320590973, "learning_rate": 0.00014489176549162646, "loss": 0.1858472377061844, "mean_token_accuracy": 0.924461156129837, "num_tokens": 64305512.0, "step": 5213 }, { "entropy": 1.2351004779338837, "epoch": 2.7456556082148498, "grad_norm": 0.280694842338562, "learning_rate": 0.00014487155114981405, "loss": 0.1888059377670288, "mean_token_accuracy": 0.9221524894237518, "num_tokens": 64317848.0, "step": 5214 }, { "entropy": 1.2104078531265259, "epoch": 2.746182201158504, "grad_norm": 0.26034653186798096, "learning_rate": 0.00014485133473788087, "loss": 0.19770097732543945, "mean_token_accuracy": 0.9191710352897644, "num_tokens": 64330184.0, "step": 5215 }, { "entropy": 1.1654371917247772, "epoch": 2.746708794102159, "grad_norm": 0.25307705998420715, "learning_rate": 0.0001448311162570271, "loss": 0.18185806274414062, "mean_token_accuracy": 0.9264684021472931, "num_tokens": 64342520.0, "step": 5216 }, { "entropy": 1.1659926176071167, "epoch": 2.7472353870458135, "grad_norm": 0.25822415947914124, "learning_rate": 0.00014481089570845298, "loss": 0.1906038373708725, "mean_token_accuracy": 0.9225552678108215, "num_tokens": 64354856.0, "step": 5217 }, { "entropy": 1.1801254749298096, "epoch": 2.747761979989468, "grad_norm": 0.27742892503738403, "learning_rate": 0.00014479067309335888, "loss": 0.18619799613952637, "mean_token_accuracy": 0.9215237945318222, "num_tokens": 64367192.0, "step": 5218 }, { "entropy": 1.1851786077022552, "epoch": 2.748288572933123, "grad_norm": 0.2780286371707916, "learning_rate": 0.00014477044841294527, "loss": 0.19493329524993896, "mean_token_accuracy": 0.9193734228610992, "num_tokens": 64379528.0, "step": 5219 }, { "entropy": 1.233342856168747, "epoch": 2.748815165876777, "grad_norm": 0.28098252415657043, "learning_rate": 0.00014475022166841281, "loss": 0.19491320848464966, "mean_token_accuracy": 0.9158923923969269, "num_tokens": 64391864.0, "step": 5220 }, { "entropy": 1.2095706462860107, "epoch": 2.7493417588204316, "grad_norm": 0.2857399582862854, "learning_rate": 0.00014472999286096222, "loss": 0.2000798135995865, "mean_token_accuracy": 0.9185933470726013, "num_tokens": 64404200.0, "step": 5221 }, { "entropy": 1.1988272964954376, "epoch": 2.7498683517640865, "grad_norm": 0.24530266225337982, "learning_rate": 0.00014470976199179437, "loss": 0.17582175135612488, "mean_token_accuracy": 0.9265767633914948, "num_tokens": 64416536.0, "step": 5222 }, { "entropy": 1.1718643307685852, "epoch": 2.750394944707741, "grad_norm": 0.2735878527164459, "learning_rate": 0.00014468952906211024, "loss": 0.19718340039253235, "mean_token_accuracy": 0.9156841188669205, "num_tokens": 64428872.0, "step": 5223 }, { "entropy": 1.1433568000793457, "epoch": 2.7509215376513954, "grad_norm": 0.2572272717952728, "learning_rate": 0.00014466929407311102, "loss": 0.17076869308948517, "mean_token_accuracy": 0.9290028512477875, "num_tokens": 64441208.0, "step": 5224 }, { "entropy": 1.1182581186294556, "epoch": 2.7514481305950502, "grad_norm": 0.2657313048839569, "learning_rate": 0.0001446490570259978, "loss": 0.18352721631526947, "mean_token_accuracy": 0.9193586707115173, "num_tokens": 64453544.0, "step": 5225 }, { "entropy": 1.2004330456256866, "epoch": 2.7519747235387046, "grad_norm": 0.29233238101005554, "learning_rate": 0.00014462881792197207, "loss": 0.19094334542751312, "mean_token_accuracy": 0.9189015328884125, "num_tokens": 64465880.0, "step": 5226 }, { "entropy": 1.1328704953193665, "epoch": 2.752501316482359, "grad_norm": 0.302139550447464, "learning_rate": 0.00014460857676223523, "loss": 0.19258467853069305, "mean_token_accuracy": 0.9215465188026428, "num_tokens": 64478216.0, "step": 5227 }, { "entropy": 1.1518427729606628, "epoch": 2.753027909426014, "grad_norm": 0.30873894691467285, "learning_rate": 0.00014458833354798892, "loss": 0.21177682280540466, "mean_token_accuracy": 0.9149043411016464, "num_tokens": 64490552.0, "step": 5228 }, { "entropy": 1.1240712106227875, "epoch": 2.7535545023696684, "grad_norm": 0.2717989385128021, "learning_rate": 0.00014456808828043483, "loss": 0.19752712547779083, "mean_token_accuracy": 0.9208426624536514, "num_tokens": 64502888.0, "step": 5229 }, { "entropy": 1.1326690316200256, "epoch": 2.754081095313323, "grad_norm": 0.3072580099105835, "learning_rate": 0.0001445478409607748, "loss": 0.21544644236564636, "mean_token_accuracy": 0.9124970734119415, "num_tokens": 64515224.0, "step": 5230 }, { "entropy": 1.1086510717868805, "epoch": 2.754607688256977, "grad_norm": 0.27127352356910706, "learning_rate": 0.0001445275915902108, "loss": 0.17774805426597595, "mean_token_accuracy": 0.9219206869602203, "num_tokens": 64527560.0, "step": 5231 }, { "entropy": 1.1655531525611877, "epoch": 2.7551342812006316, "grad_norm": 0.2691557705402374, "learning_rate": 0.00014450734016994496, "loss": 0.17809565365314484, "mean_token_accuracy": 0.9255595207214355, "num_tokens": 64539896.0, "step": 5232 }, { "entropy": 1.1543531119823456, "epoch": 2.7556608741442865, "grad_norm": 0.27001041173934937, "learning_rate": 0.00014448708670117947, "loss": 0.1864895522594452, "mean_token_accuracy": 0.9234678447246552, "num_tokens": 64552232.0, "step": 5233 }, { "entropy": 1.1790067255496979, "epoch": 2.756187467087941, "grad_norm": 0.26234033703804016, "learning_rate": 0.00014446683118511663, "loss": 0.18123625218868256, "mean_token_accuracy": 0.9251542240381241, "num_tokens": 64564568.0, "step": 5234 }, { "entropy": 1.2072664499282837, "epoch": 2.7567140600315954, "grad_norm": 0.2714584767818451, "learning_rate": 0.00014444657362295893, "loss": 0.1822567880153656, "mean_token_accuracy": 0.9235909283161163, "num_tokens": 64576904.0, "step": 5235 }, { "entropy": 1.2083474397659302, "epoch": 2.7572406529752502, "grad_norm": 0.28527194261550903, "learning_rate": 0.00014442631401590889, "loss": 0.18012532591819763, "mean_token_accuracy": 0.92564357817173, "num_tokens": 64589240.0, "step": 5236 }, { "entropy": 1.2130491435527802, "epoch": 2.7577672459189047, "grad_norm": 0.28817492723464966, "learning_rate": 0.00014440605236516927, "loss": 0.2071560025215149, "mean_token_accuracy": 0.9179072976112366, "num_tokens": 64601576.0, "step": 5237 }, { "entropy": 1.1850566864013672, "epoch": 2.758293838862559, "grad_norm": 0.27280986309051514, "learning_rate": 0.00014438578867194282, "loss": 0.19194592535495758, "mean_token_accuracy": 0.9210992604494095, "num_tokens": 64613912.0, "step": 5238 }, { "entropy": 1.1494078934192657, "epoch": 2.758820431806214, "grad_norm": 0.25719964504241943, "learning_rate": 0.00014436552293743254, "loss": 0.18231096863746643, "mean_token_accuracy": 0.9223944246768951, "num_tokens": 64626248.0, "step": 5239 }, { "entropy": 1.2233496606349945, "epoch": 2.7593470247498684, "grad_norm": 0.2691393494606018, "learning_rate": 0.00014434525516284145, "loss": 0.19390058517456055, "mean_token_accuracy": 0.9192745685577393, "num_tokens": 64638584.0, "step": 5240 }, { "entropy": 1.2024221122264862, "epoch": 2.759873617693523, "grad_norm": 0.27692461013793945, "learning_rate": 0.00014432498534937274, "loss": 0.20155805349349976, "mean_token_accuracy": 0.9162195473909378, "num_tokens": 64650920.0, "step": 5241 }, { "entropy": 1.2103087902069092, "epoch": 2.7604002106371777, "grad_norm": 0.26054757833480835, "learning_rate": 0.00014430471349822973, "loss": 0.1835065633058548, "mean_token_accuracy": 0.9229078888893127, "num_tokens": 64663256.0, "step": 5242 }, { "entropy": 1.2184035181999207, "epoch": 2.760926803580832, "grad_norm": 0.2641240358352661, "learning_rate": 0.00014428443961061582, "loss": 0.1787245273590088, "mean_token_accuracy": 0.927379846572876, "num_tokens": 64675592.0, "step": 5243 }, { "entropy": 1.2011678516864777, "epoch": 2.7614533965244865, "grad_norm": 0.27148598432540894, "learning_rate": 0.00014426416368773455, "loss": 0.18567071855068207, "mean_token_accuracy": 0.9205454736948013, "num_tokens": 64687928.0, "step": 5244 }, { "entropy": 1.216088354587555, "epoch": 2.7619799894681414, "grad_norm": 0.26671719551086426, "learning_rate": 0.00014424388573078958, "loss": 0.20205147564411163, "mean_token_accuracy": 0.9125513881444931, "num_tokens": 64700264.0, "step": 5245 }, { "entropy": 1.1836239397525787, "epoch": 2.762506582411796, "grad_norm": 0.27321091294288635, "learning_rate": 0.00014422360574098468, "loss": 0.1828138530254364, "mean_token_accuracy": 0.9238127917051315, "num_tokens": 64712600.0, "step": 5246 }, { "entropy": 1.245295375585556, "epoch": 2.7630331753554502, "grad_norm": 0.28472384810447693, "learning_rate": 0.00014420332371952382, "loss": 0.18590515851974487, "mean_token_accuracy": 0.920741856098175, "num_tokens": 64724936.0, "step": 5247 }, { "entropy": 1.2197468280792236, "epoch": 2.7635597682991047, "grad_norm": 0.28858470916748047, "learning_rate": 0.00014418303966761095, "loss": 0.18920327723026276, "mean_token_accuracy": 0.9211139678955078, "num_tokens": 64737272.0, "step": 5248 }, { "entropy": 1.238138347864151, "epoch": 2.764086361242759, "grad_norm": 0.28883299231529236, "learning_rate": 0.00014416275358645027, "loss": 0.19570133090019226, "mean_token_accuracy": 0.9165759533643723, "num_tokens": 64749608.0, "step": 5249 }, { "entropy": 1.1910213232040405, "epoch": 2.764612954186414, "grad_norm": 0.2884749472141266, "learning_rate": 0.000144142465477246, "loss": 0.19064441323280334, "mean_token_accuracy": 0.9157634079456329, "num_tokens": 64761944.0, "step": 5250 }, { "entropy": 1.2231583893299103, "epoch": 2.7651395471300684, "grad_norm": 0.2951197922229767, "learning_rate": 0.00014412217534120255, "loss": 0.20204216241836548, "mean_token_accuracy": 0.9111807197332382, "num_tokens": 64774280.0, "step": 5251 }, { "entropy": 1.2133639454841614, "epoch": 2.765666140073723, "grad_norm": 0.2701243460178375, "learning_rate": 0.0001441018831795245, "loss": 0.17370574176311493, "mean_token_accuracy": 0.9307438880205154, "num_tokens": 64786616.0, "step": 5252 }, { "entropy": 1.2652662694454193, "epoch": 2.7661927330173777, "grad_norm": 0.29625698924064636, "learning_rate": 0.00014408158899341633, "loss": 0.1891971081495285, "mean_token_accuracy": 0.9214306026697159, "num_tokens": 64798952.0, "step": 5253 }, { "entropy": 1.2378207743167877, "epoch": 2.766719325961032, "grad_norm": 0.28450554609298706, "learning_rate": 0.0001440612927840829, "loss": 0.19953784346580505, "mean_token_accuracy": 0.9168573915958405, "num_tokens": 64811288.0, "step": 5254 }, { "entropy": 1.22379869222641, "epoch": 2.7672459189046865, "grad_norm": 0.2879558205604553, "learning_rate": 0.000144040994552729, "loss": 0.18986776471138, "mean_token_accuracy": 0.9215910136699677, "num_tokens": 64823624.0, "step": 5255 }, { "entropy": 1.2522724568843842, "epoch": 2.7677725118483414, "grad_norm": 0.2794259190559387, "learning_rate": 0.00014402069430055972, "loss": 0.1900891661643982, "mean_token_accuracy": 0.9175702631473541, "num_tokens": 64835960.0, "step": 5256 }, { "entropy": 1.2027116417884827, "epoch": 2.768299104791996, "grad_norm": 0.25514569878578186, "learning_rate": 0.00014400039202878007, "loss": 0.1653316169977188, "mean_token_accuracy": 0.9280052781105042, "num_tokens": 64848296.0, "step": 5257 }, { "entropy": 1.2198582589626312, "epoch": 2.7688256977356502, "grad_norm": 0.2743576765060425, "learning_rate": 0.00014398008773859535, "loss": 0.18544761836528778, "mean_token_accuracy": 0.9242594391107559, "num_tokens": 64860632.0, "step": 5258 }, { "entropy": 1.2221347987651825, "epoch": 2.769352290679305, "grad_norm": 0.2561204135417938, "learning_rate": 0.00014395978143121082, "loss": 0.18239974975585938, "mean_token_accuracy": 0.9222259372472763, "num_tokens": 64872968.0, "step": 5259 }, { "entropy": 1.1785187125205994, "epoch": 2.7698788836229595, "grad_norm": 0.25451043248176575, "learning_rate": 0.00014393947310783204, "loss": 0.1851981282234192, "mean_token_accuracy": 0.9230374693870544, "num_tokens": 64885304.0, "step": 5260 }, { "entropy": 1.238612949848175, "epoch": 2.770405476566614, "grad_norm": 0.27332982420921326, "learning_rate": 0.00014391916276966453, "loss": 0.18217436969280243, "mean_token_accuracy": 0.9256610721349716, "num_tokens": 64897640.0, "step": 5261 }, { "entropy": 1.2903965413570404, "epoch": 2.770932069510269, "grad_norm": 0.28146326541900635, "learning_rate": 0.000143898850417914, "loss": 0.19812659919261932, "mean_token_accuracy": 0.9138201922178268, "num_tokens": 64909976.0, "step": 5262 }, { "entropy": 1.2601101100444794, "epoch": 2.7714586624539232, "grad_norm": 0.2966877818107605, "learning_rate": 0.00014387853605378635, "loss": 0.19086399674415588, "mean_token_accuracy": 0.9252540320158005, "num_tokens": 64922312.0, "step": 5263 }, { "entropy": 1.269772619009018, "epoch": 2.7719852553975777, "grad_norm": 0.2694266438484192, "learning_rate": 0.00014385821967848744, "loss": 0.1787468045949936, "mean_token_accuracy": 0.9245084077119827, "num_tokens": 64934648.0, "step": 5264 }, { "entropy": 1.2981602251529694, "epoch": 2.772511848341232, "grad_norm": 0.308047354221344, "learning_rate": 0.0001438379012932234, "loss": 0.2297125905752182, "mean_token_accuracy": 0.9067529439926147, "num_tokens": 64946984.0, "step": 5265 }, { "entropy": 1.2986539602279663, "epoch": 2.7730384412848865, "grad_norm": 0.27238884568214417, "learning_rate": 0.00014381758089920037, "loss": 0.18589141964912415, "mean_token_accuracy": 0.9196806848049164, "num_tokens": 64959320.0, "step": 5266 }, { "entropy": 1.2592036128044128, "epoch": 2.7735650342285414, "grad_norm": 0.2565900683403015, "learning_rate": 0.00014379725849762468, "loss": 0.17390495538711548, "mean_token_accuracy": 0.9275496900081635, "num_tokens": 64971656.0, "step": 5267 }, { "entropy": 1.3076839447021484, "epoch": 2.774091627172196, "grad_norm": 0.27231037616729736, "learning_rate": 0.00014377693408970267, "loss": 0.1904066503047943, "mean_token_accuracy": 0.9181473851203918, "num_tokens": 64983992.0, "step": 5268 }, { "entropy": 1.347479671239853, "epoch": 2.7746182201158502, "grad_norm": 0.2822572588920593, "learning_rate": 0.00014375660767664103, "loss": 0.19602887332439423, "mean_token_accuracy": 0.9184332489967346, "num_tokens": 64996328.0, "step": 5269 }, { "entropy": 1.2493623495101929, "epoch": 2.775144813059505, "grad_norm": 0.2655910551548004, "learning_rate": 0.0001437362792596463, "loss": 0.19221758842468262, "mean_token_accuracy": 0.9155505746603012, "num_tokens": 65008664.0, "step": 5270 }, { "entropy": 1.3480267524719238, "epoch": 2.7756714060031595, "grad_norm": 0.28599438071250916, "learning_rate": 0.0001437159488399253, "loss": 0.19499412178993225, "mean_token_accuracy": 0.9208921939134598, "num_tokens": 65021000.0, "step": 5271 }, { "entropy": 1.2931790351867676, "epoch": 2.776197998946814, "grad_norm": 0.25337666273117065, "learning_rate": 0.00014369561641868497, "loss": 0.19652974605560303, "mean_token_accuracy": 0.9209015667438507, "num_tokens": 65033336.0, "step": 5272 }, { "entropy": 1.280663251876831, "epoch": 2.776724591890469, "grad_norm": 0.26555371284484863, "learning_rate": 0.00014367528199713225, "loss": 0.1882692575454712, "mean_token_accuracy": 0.9232436418533325, "num_tokens": 65045672.0, "step": 5273 }, { "entropy": 1.3029052913188934, "epoch": 2.7772511848341233, "grad_norm": 0.28663209080696106, "learning_rate": 0.0001436549455764743, "loss": 0.2037314623594284, "mean_token_accuracy": 0.9130341559648514, "num_tokens": 65058008.0, "step": 5274 }, { "entropy": 1.3463798463344574, "epoch": 2.7777777777777777, "grad_norm": 0.29982322454452515, "learning_rate": 0.00014363460715791838, "loss": 0.20301522314548492, "mean_token_accuracy": 0.9173043817281723, "num_tokens": 65070344.0, "step": 5275 }, { "entropy": 1.3196207582950592, "epoch": 2.7783043707214325, "grad_norm": 0.2660505175590515, "learning_rate": 0.00014361426674267192, "loss": 0.19917218387126923, "mean_token_accuracy": 0.917966678738594, "num_tokens": 65082680.0, "step": 5276 }, { "entropy": 1.2840626537799835, "epoch": 2.778830963665087, "grad_norm": 0.26385557651519775, "learning_rate": 0.00014359392433194233, "loss": 0.17794926464557648, "mean_token_accuracy": 0.9250075668096542, "num_tokens": 65095016.0, "step": 5277 }, { "entropy": 1.314213752746582, "epoch": 2.7793575566087414, "grad_norm": 0.28997546434402466, "learning_rate": 0.00014357357992693726, "loss": 0.1899823695421219, "mean_token_accuracy": 0.9185740947723389, "num_tokens": 65107352.0, "step": 5278 }, { "entropy": 1.3273931741714478, "epoch": 2.7798841495523963, "grad_norm": 0.31028249859809875, "learning_rate": 0.00014355323352886444, "loss": 0.18756736814975739, "mean_token_accuracy": 0.9197654277086258, "num_tokens": 65119688.0, "step": 5279 }, { "entropy": 1.2950712740421295, "epoch": 2.7804107424960507, "grad_norm": 0.27508464455604553, "learning_rate": 0.0001435328851389317, "loss": 0.19255675375461578, "mean_token_accuracy": 0.9202096164226532, "num_tokens": 65132024.0, "step": 5280 }, { "entropy": 1.2744563817977905, "epoch": 2.780937335439705, "grad_norm": 0.26312628388404846, "learning_rate": 0.000143512534758347, "loss": 0.18344777822494507, "mean_token_accuracy": 0.9259104430675507, "num_tokens": 65144360.0, "step": 5281 }, { "entropy": 1.2877683341503143, "epoch": 2.7814639283833595, "grad_norm": 0.2613600790500641, "learning_rate": 0.00014349218238831845, "loss": 0.17790953814983368, "mean_token_accuracy": 0.9296992272138596, "num_tokens": 65156696.0, "step": 5282 }, { "entropy": 1.2867728471755981, "epoch": 2.781990521327014, "grad_norm": 0.2650804817676544, "learning_rate": 0.00014347182803005427, "loss": 0.1828990876674652, "mean_token_accuracy": 0.9258298873901367, "num_tokens": 65169032.0, "step": 5283 }, { "entropy": 1.2489764094352722, "epoch": 2.782517114270669, "grad_norm": 0.2658465504646301, "learning_rate": 0.0001434514716847627, "loss": 0.18873544037342072, "mean_token_accuracy": 0.9171571433544159, "num_tokens": 65181368.0, "step": 5284 }, { "entropy": 1.2812611758708954, "epoch": 2.7830437072143233, "grad_norm": 0.2830650508403778, "learning_rate": 0.00014343111335365222, "loss": 0.18863148987293243, "mean_token_accuracy": 0.9229893535375595, "num_tokens": 65193704.0, "step": 5285 }, { "entropy": 1.2569757997989655, "epoch": 2.7835703001579777, "grad_norm": 0.2600972652435303, "learning_rate": 0.00014341075303793142, "loss": 0.1723325252532959, "mean_token_accuracy": 0.9290564060211182, "num_tokens": 65206040.0, "step": 5286 }, { "entropy": 1.27193483710289, "epoch": 2.7840968931016326, "grad_norm": 0.2815724015235901, "learning_rate": 0.00014339039073880895, "loss": 0.18959340453147888, "mean_token_accuracy": 0.9206994324922562, "num_tokens": 65218376.0, "step": 5287 }, { "entropy": 1.2226817309856415, "epoch": 2.784623486045287, "grad_norm": 0.2693398892879486, "learning_rate": 0.0001433700264574936, "loss": 0.19547715783119202, "mean_token_accuracy": 0.9208534508943558, "num_tokens": 65230712.0, "step": 5288 }, { "entropy": 1.2494825720787048, "epoch": 2.7851500789889414, "grad_norm": 0.2742237150669098, "learning_rate": 0.00014334966019519425, "loss": 0.18227458000183105, "mean_token_accuracy": 0.9274836480617523, "num_tokens": 65243048.0, "step": 5289 }, { "entropy": 1.260303258895874, "epoch": 2.7856766719325963, "grad_norm": 0.28628888726234436, "learning_rate": 0.00014332929195311997, "loss": 0.20284047722816467, "mean_token_accuracy": 0.9181239157915115, "num_tokens": 65255384.0, "step": 5290 }, { "entropy": 1.2684848606586456, "epoch": 2.7862032648762507, "grad_norm": 0.27382534742355347, "learning_rate": 0.00014330892173247984, "loss": 0.18891406059265137, "mean_token_accuracy": 0.9240432977676392, "num_tokens": 65267720.0, "step": 5291 }, { "entropy": 1.222090721130371, "epoch": 2.786729857819905, "grad_norm": 0.2744442820549011, "learning_rate": 0.0001432885495344832, "loss": 0.18809741735458374, "mean_token_accuracy": 0.9243640154600143, "num_tokens": 65280056.0, "step": 5292 }, { "entropy": 1.2474882304668427, "epoch": 2.78725645076356, "grad_norm": 0.27189698815345764, "learning_rate": 0.00014326817536033942, "loss": 0.18525537848472595, "mean_token_accuracy": 0.9237808287143707, "num_tokens": 65292392.0, "step": 5293 }, { "entropy": 1.2759239077568054, "epoch": 2.7877830437072144, "grad_norm": 0.2819172143936157, "learning_rate": 0.00014324779921125796, "loss": 0.20205055177211761, "mean_token_accuracy": 0.9156257063150406, "num_tokens": 65304728.0, "step": 5294 }, { "entropy": 1.273671805858612, "epoch": 2.788309636650869, "grad_norm": 0.27508002519607544, "learning_rate": 0.0001432274210884484, "loss": 0.19093528389930725, "mean_token_accuracy": 0.9219478368759155, "num_tokens": 65317064.0, "step": 5295 }, { "entropy": 1.3292940258979797, "epoch": 2.7888362295945237, "grad_norm": 0.28093087673187256, "learning_rate": 0.00014320704099312053, "loss": 0.2062903195619583, "mean_token_accuracy": 0.9147017002105713, "num_tokens": 65329400.0, "step": 5296 }, { "entropy": 1.2952646017074585, "epoch": 2.789362822538178, "grad_norm": 0.28177374601364136, "learning_rate": 0.00014318665892648424, "loss": 0.20459504425525665, "mean_token_accuracy": 0.9161693304777145, "num_tokens": 65341736.0, "step": 5297 }, { "entropy": 1.304824024438858, "epoch": 2.7898894154818326, "grad_norm": 0.2694205045700073, "learning_rate": 0.00014316627488974938, "loss": 0.1909191906452179, "mean_token_accuracy": 0.9177864342927933, "num_tokens": 65354072.0, "step": 5298 }, { "entropy": 1.3001328110694885, "epoch": 2.790416008425487, "grad_norm": 0.2765825390815735, "learning_rate": 0.00014314588888412607, "loss": 0.1955200880765915, "mean_token_accuracy": 0.921666830778122, "num_tokens": 65366408.0, "step": 5299 }, { "entropy": 1.2705854177474976, "epoch": 2.7909426013691414, "grad_norm": 0.27244964241981506, "learning_rate": 0.00014312550091082456, "loss": 0.18523868918418884, "mean_token_accuracy": 0.924994632601738, "num_tokens": 65378744.0, "step": 5300 }, { "entropy": 1.2694044709205627, "epoch": 2.7914691943127963, "grad_norm": 0.2661687731742859, "learning_rate": 0.00014310511097105513, "loss": 0.1898202747106552, "mean_token_accuracy": 0.9222358614206314, "num_tokens": 65391080.0, "step": 5301 }, { "entropy": 1.29021418094635, "epoch": 2.7919957872564507, "grad_norm": 0.2877323627471924, "learning_rate": 0.00014308471906602824, "loss": 0.19828127324581146, "mean_token_accuracy": 0.9166731089353561, "num_tokens": 65403416.0, "step": 5302 }, { "entropy": 1.2674870193004608, "epoch": 2.792522380200105, "grad_norm": 0.275603324174881, "learning_rate": 0.00014306432519695436, "loss": 0.19587281346321106, "mean_token_accuracy": 0.9162575602531433, "num_tokens": 65415752.0, "step": 5303 }, { "entropy": 1.2863653898239136, "epoch": 2.79304897314376, "grad_norm": 0.27803856134414673, "learning_rate": 0.00014304392936504424, "loss": 0.19489046931266785, "mean_token_accuracy": 0.9222230017185211, "num_tokens": 65428088.0, "step": 5304 }, { "entropy": 1.3094123899936676, "epoch": 2.7935755660874144, "grad_norm": 0.31087836623191833, "learning_rate": 0.00014302353157150862, "loss": 0.19567900896072388, "mean_token_accuracy": 0.9196409285068512, "num_tokens": 65440424.0, "step": 5305 }, { "entropy": 1.2640268802642822, "epoch": 2.794102159031069, "grad_norm": 0.27602046728134155, "learning_rate": 0.0001430031318175584, "loss": 0.19994071125984192, "mean_token_accuracy": 0.9169894754886627, "num_tokens": 65452760.0, "step": 5306 }, { "entropy": 1.3626899421215057, "epoch": 2.7946287519747237, "grad_norm": 0.2630988359451294, "learning_rate": 0.00014298273010440458, "loss": 0.17848266661167145, "mean_token_accuracy": 0.9260770082473755, "num_tokens": 65465096.0, "step": 5307 }, { "entropy": 1.3198005855083466, "epoch": 2.795155344918378, "grad_norm": 0.254104346036911, "learning_rate": 0.00014296232643325836, "loss": 0.17157261073589325, "mean_token_accuracy": 0.929302304983139, "num_tokens": 65477432.0, "step": 5308 }, { "entropy": 1.3163739144802094, "epoch": 2.7956819378620326, "grad_norm": 0.2930879294872284, "learning_rate": 0.00014294192080533088, "loss": 0.18230167031288147, "mean_token_accuracy": 0.9215236604213715, "num_tokens": 65489768.0, "step": 5309 }, { "entropy": 1.331737995147705, "epoch": 2.7962085308056874, "grad_norm": 0.2841273546218872, "learning_rate": 0.0001429215132218336, "loss": 0.21370966732501984, "mean_token_accuracy": 0.9168280363082886, "num_tokens": 65502104.0, "step": 5310 }, { "entropy": 1.3565723598003387, "epoch": 2.796735123749342, "grad_norm": 0.2748474180698395, "learning_rate": 0.00014290110368397795, "loss": 0.1781301200389862, "mean_token_accuracy": 0.93081134557724, "num_tokens": 65514440.0, "step": 5311 }, { "entropy": 1.332760989665985, "epoch": 2.7972617166929963, "grad_norm": 0.2885291576385498, "learning_rate": 0.0001428806921929756, "loss": 0.19329184293746948, "mean_token_accuracy": 0.9193468242883682, "num_tokens": 65526776.0, "step": 5312 }, { "entropy": 1.3488106727600098, "epoch": 2.7977883096366507, "grad_norm": 0.3057740330696106, "learning_rate": 0.0001428602787500381, "loss": 0.2155866026878357, "mean_token_accuracy": 0.9115214347839355, "num_tokens": 65539112.0, "step": 5313 }, { "entropy": 1.3490218222141266, "epoch": 2.7983149025803056, "grad_norm": 0.2725186049938202, "learning_rate": 0.00014283986335637743, "loss": 0.1859339028596878, "mean_token_accuracy": 0.9261448532342911, "num_tokens": 65551448.0, "step": 5314 }, { "entropy": 1.310249239206314, "epoch": 2.79884149552396, "grad_norm": 0.2817498445510864, "learning_rate": 0.00014281944601320546, "loss": 0.1796184778213501, "mean_token_accuracy": 0.9227155297994614, "num_tokens": 65563784.0, "step": 5315 }, { "entropy": 1.3516960740089417, "epoch": 2.7993680884676144, "grad_norm": 0.31386610865592957, "learning_rate": 0.00014279902672173427, "loss": 0.2113589197397232, "mean_token_accuracy": 0.9109881967306137, "num_tokens": 65576120.0, "step": 5316 }, { "entropy": 1.3502106964588165, "epoch": 2.799894681411269, "grad_norm": 0.3107154369354248, "learning_rate": 0.00014277860548317603, "loss": 0.1957147717475891, "mean_token_accuracy": 0.9212307333946228, "num_tokens": 65588456.0, "step": 5317 }, { "entropy": 1.286857783794403, "epoch": 2.8004212743549237, "grad_norm": 0.2969721853733063, "learning_rate": 0.00014275818229874301, "loss": 0.18805904686450958, "mean_token_accuracy": 0.9243521392345428, "num_tokens": 65600792.0, "step": 5318 }, { "entropy": 1.3212200999259949, "epoch": 2.800947867298578, "grad_norm": 0.28291863203048706, "learning_rate": 0.00014273775716964766, "loss": 0.18257564306259155, "mean_token_accuracy": 0.9234202355146408, "num_tokens": 65613128.0, "step": 5319 }, { "entropy": 1.2968879044055939, "epoch": 2.8014744602422326, "grad_norm": 0.27695876359939575, "learning_rate": 0.00014271733009710245, "loss": 0.1660367250442505, "mean_token_accuracy": 0.9291543513536453, "num_tokens": 65625464.0, "step": 5320 }, { "entropy": 1.2907300889492035, "epoch": 2.8020010531858874, "grad_norm": 0.29541856050491333, "learning_rate": 0.0001426969010823201, "loss": 0.21649664640426636, "mean_token_accuracy": 0.9106380492448807, "num_tokens": 65637800.0, "step": 5321 }, { "entropy": 1.315805196762085, "epoch": 2.802527646129542, "grad_norm": 0.28097328543663025, "learning_rate": 0.0001426764701265133, "loss": 0.188256174325943, "mean_token_accuracy": 0.9229840487241745, "num_tokens": 65650136.0, "step": 5322 }, { "entropy": 1.3322736322879791, "epoch": 2.8030542390731963, "grad_norm": 0.45639967918395996, "learning_rate": 0.00014265603723089484, "loss": 0.18657879531383514, "mean_token_accuracy": 0.9199790060520172, "num_tokens": 65662472.0, "step": 5323 }, { "entropy": 1.2863487601280212, "epoch": 2.803580832016851, "grad_norm": 0.2746271789073944, "learning_rate": 0.00014263560239667785, "loss": 0.18844881653785706, "mean_token_accuracy": 0.925334244966507, "num_tokens": 65674808.0, "step": 5324 }, { "entropy": 1.2828960418701172, "epoch": 2.8041074249605056, "grad_norm": 0.2776462733745575, "learning_rate": 0.00014261516562507533, "loss": 0.1838618367910385, "mean_token_accuracy": 0.9251666814088821, "num_tokens": 65687144.0, "step": 5325 }, { "entropy": 1.2915571928024292, "epoch": 2.80463401790416, "grad_norm": 0.28010231256484985, "learning_rate": 0.0001425947269173006, "loss": 0.1980217695236206, "mean_token_accuracy": 0.9215652793645859, "num_tokens": 65699480.0, "step": 5326 }, { "entropy": 1.2577224969863892, "epoch": 2.805160610847815, "grad_norm": 0.2838359475135803, "learning_rate": 0.00014257428627456682, "loss": 0.20210154354572296, "mean_token_accuracy": 0.9163983017206192, "num_tokens": 65711816.0, "step": 5327 }, { "entropy": 1.2922307252883911, "epoch": 2.8056872037914693, "grad_norm": 0.2706328332424164, "learning_rate": 0.00014255384369808756, "loss": 0.19801615178585052, "mean_token_accuracy": 0.915440022945404, "num_tokens": 65724152.0, "step": 5328 }, { "entropy": 1.2760253250598907, "epoch": 2.8062137967351237, "grad_norm": 0.2580713629722595, "learning_rate": 0.0001425333991890763, "loss": 0.16899164021015167, "mean_token_accuracy": 0.9279545992612839, "num_tokens": 65736488.0, "step": 5329 }, { "entropy": 1.2592010498046875, "epoch": 2.806740389678778, "grad_norm": 0.2732999622821808, "learning_rate": 0.00014251295274874678, "loss": 0.1941339373588562, "mean_token_accuracy": 0.9203190058469772, "num_tokens": 65748824.0, "step": 5330 }, { "entropy": 1.3266755938529968, "epoch": 2.807266982622433, "grad_norm": 0.2721918821334839, "learning_rate": 0.00014249250437831277, "loss": 0.18719229102134705, "mean_token_accuracy": 0.9207041710615158, "num_tokens": 65761160.0, "step": 5331 }, { "entropy": 1.3405596911907196, "epoch": 2.8077935755660874, "grad_norm": 0.29513224959373474, "learning_rate": 0.00014247205407898813, "loss": 0.20140871405601501, "mean_token_accuracy": 0.919532835483551, "num_tokens": 65773496.0, "step": 5332 }, { "entropy": 1.3203657865524292, "epoch": 2.808320168509742, "grad_norm": 0.26965105533599854, "learning_rate": 0.0001424516018519869, "loss": 0.1990198791027069, "mean_token_accuracy": 0.917657345533371, "num_tokens": 65785832.0, "step": 5333 }, { "entropy": 1.2802288830280304, "epoch": 2.8088467614533963, "grad_norm": 0.29502639174461365, "learning_rate": 0.00014243114769852322, "loss": 0.21779046952724457, "mean_token_accuracy": 0.9080840200185776, "num_tokens": 65798168.0, "step": 5334 }, { "entropy": 1.2174814939498901, "epoch": 2.809373354397051, "grad_norm": 0.23770982027053833, "learning_rate": 0.00014241069161981132, "loss": 0.18031489849090576, "mean_token_accuracy": 0.9241122305393219, "num_tokens": 65810504.0, "step": 5335 }, { "entropy": 1.303638517856598, "epoch": 2.8098999473407056, "grad_norm": 0.250471830368042, "learning_rate": 0.00014239023361706558, "loss": 0.18099047243595123, "mean_token_accuracy": 0.9224986284971237, "num_tokens": 65822840.0, "step": 5336 }, { "entropy": 1.3555626571178436, "epoch": 2.81042654028436, "grad_norm": 0.2877865433692932, "learning_rate": 0.00014236977369150043, "loss": 0.19794785976409912, "mean_token_accuracy": 0.916514053940773, "num_tokens": 65835176.0, "step": 5337 }, { "entropy": 1.3452889621257782, "epoch": 2.810953133228015, "grad_norm": 0.29638126492500305, "learning_rate": 0.0001423493118443305, "loss": 0.20515380799770355, "mean_token_accuracy": 0.9165419936180115, "num_tokens": 65847512.0, "step": 5338 }, { "entropy": 1.3289613127708435, "epoch": 2.8114797261716693, "grad_norm": 0.31008410453796387, "learning_rate": 0.00014232884807677045, "loss": 0.20547129213809967, "mean_token_accuracy": 0.9179491698741913, "num_tokens": 65859848.0, "step": 5339 }, { "entropy": 1.3396630585193634, "epoch": 2.8120063191153237, "grad_norm": 0.24820318818092346, "learning_rate": 0.00014230838239003514, "loss": 0.18229185044765472, "mean_token_accuracy": 0.9222933501005173, "num_tokens": 65872184.0, "step": 5340 }, { "entropy": 1.3142532706260681, "epoch": 2.8125329120589786, "grad_norm": 0.27396664023399353, "learning_rate": 0.00014228791478533944, "loss": 0.2007269263267517, "mean_token_accuracy": 0.9183091521263123, "num_tokens": 65884520.0, "step": 5341 }, { "entropy": 1.3794560730457306, "epoch": 2.813059505002633, "grad_norm": 0.276889443397522, "learning_rate": 0.0001422674452638985, "loss": 0.19162897765636444, "mean_token_accuracy": 0.9210671484470367, "num_tokens": 65896856.0, "step": 5342 }, { "entropy": 1.3106403052806854, "epoch": 2.8135860979462874, "grad_norm": 0.24311819672584534, "learning_rate": 0.00014224697382692733, "loss": 0.17249861359596252, "mean_token_accuracy": 0.926313728094101, "num_tokens": 65909192.0, "step": 5343 }, { "entropy": 1.357205718755722, "epoch": 2.8141126908899423, "grad_norm": 0.2881726622581482, "learning_rate": 0.00014222650047564128, "loss": 0.19397282600402832, "mean_token_accuracy": 0.9207228273153305, "num_tokens": 65921528.0, "step": 5344 }, { "entropy": 1.2870065569877625, "epoch": 2.8146392838335967, "grad_norm": 0.2502511739730835, "learning_rate": 0.00014220602521125577, "loss": 0.19269129633903503, "mean_token_accuracy": 0.9196359366178513, "num_tokens": 65933864.0, "step": 5345 }, { "entropy": 1.2929141223430634, "epoch": 2.815165876777251, "grad_norm": 0.2680942714214325, "learning_rate": 0.00014218554803498623, "loss": 0.19123870134353638, "mean_token_accuracy": 0.9213044196367264, "num_tokens": 65946200.0, "step": 5346 }, { "entropy": 1.2766457498073578, "epoch": 2.8156924697209056, "grad_norm": 0.266617089509964, "learning_rate": 0.0001421650689480483, "loss": 0.19216907024383545, "mean_token_accuracy": 0.923948273062706, "num_tokens": 65958536.0, "step": 5347 }, { "entropy": 1.279809296131134, "epoch": 2.8162190626645605, "grad_norm": 0.25692835450172424, "learning_rate": 0.00014214458795165768, "loss": 0.16894961893558502, "mean_token_accuracy": 0.9307194501161575, "num_tokens": 65970872.0, "step": 5348 }, { "entropy": 1.2850238978862762, "epoch": 2.816745655608215, "grad_norm": 0.2544446587562561, "learning_rate": 0.00014212410504703025, "loss": 0.18745863437652588, "mean_token_accuracy": 0.9202258735895157, "num_tokens": 65983208.0, "step": 5349 }, { "entropy": 1.3343496918678284, "epoch": 2.8172722485518693, "grad_norm": 0.2888110280036926, "learning_rate": 0.00014210362023538194, "loss": 0.19372104108333588, "mean_token_accuracy": 0.917907640337944, "num_tokens": 65995544.0, "step": 5350 }, { "entropy": 1.248584896326065, "epoch": 2.8177988414955237, "grad_norm": 0.258998841047287, "learning_rate": 0.0001420831335179288, "loss": 0.18754670023918152, "mean_token_accuracy": 0.9216349273920059, "num_tokens": 66007880.0, "step": 5351 }, { "entropy": 1.2730433344841003, "epoch": 2.8183254344391786, "grad_norm": 0.2844271957874298, "learning_rate": 0.000142062644895887, "loss": 0.19392099976539612, "mean_token_accuracy": 0.9160989373922348, "num_tokens": 66020216.0, "step": 5352 }, { "entropy": 1.239387720823288, "epoch": 2.818852027382833, "grad_norm": 0.2637011408805847, "learning_rate": 0.00014204215437047289, "loss": 0.16577531397342682, "mean_token_accuracy": 0.930683970451355, "num_tokens": 66032552.0, "step": 5353 }, { "entropy": 1.2617818415164948, "epoch": 2.8193786203264875, "grad_norm": 0.27310746908187866, "learning_rate": 0.0001420216619429028, "loss": 0.18738313019275665, "mean_token_accuracy": 0.922308012843132, "num_tokens": 66044888.0, "step": 5354 }, { "entropy": 1.2251103222370148, "epoch": 2.8199052132701423, "grad_norm": 0.2810131013393402, "learning_rate": 0.00014200116761439326, "loss": 0.18970806896686554, "mean_token_accuracy": 0.9238426834344864, "num_tokens": 66057224.0, "step": 5355 }, { "entropy": 1.300120770931244, "epoch": 2.8204318062137967, "grad_norm": 0.3125358819961548, "learning_rate": 0.00014198067138616096, "loss": 0.19446682929992676, "mean_token_accuracy": 0.9172956049442291, "num_tokens": 66069560.0, "step": 5356 }, { "entropy": 1.232959359884262, "epoch": 2.820958399157451, "grad_norm": 0.26678264141082764, "learning_rate": 0.00014196017325942257, "loss": 0.19019223749637604, "mean_token_accuracy": 0.919284850358963, "num_tokens": 66081896.0, "step": 5357 }, { "entropy": 1.2427859604358673, "epoch": 2.821484992101106, "grad_norm": 0.2783074975013733, "learning_rate": 0.00014193967323539497, "loss": 0.18141202628612518, "mean_token_accuracy": 0.9261755645275116, "num_tokens": 66094232.0, "step": 5358 }, { "entropy": 1.2050098180770874, "epoch": 2.8220115850447605, "grad_norm": 0.23615165054798126, "learning_rate": 0.0001419191713152951, "loss": 0.1723269373178482, "mean_token_accuracy": 0.9296863228082657, "num_tokens": 66106568.0, "step": 5359 }, { "entropy": 1.259114533662796, "epoch": 2.822538177988415, "grad_norm": 0.2952539324760437, "learning_rate": 0.00014189866750034016, "loss": 0.1994144320487976, "mean_token_accuracy": 0.9215876311063766, "num_tokens": 66118904.0, "step": 5360 }, { "entropy": 1.3054438531398773, "epoch": 2.8230647709320698, "grad_norm": 0.2893647849559784, "learning_rate": 0.00014187816179174717, "loss": 0.18889150023460388, "mean_token_accuracy": 0.9236411154270172, "num_tokens": 66131240.0, "step": 5361 }, { "entropy": 1.213493674993515, "epoch": 2.823591363875724, "grad_norm": 0.28194475173950195, "learning_rate": 0.00014185765419073352, "loss": 0.19393613934516907, "mean_token_accuracy": 0.9203670918941498, "num_tokens": 66143576.0, "step": 5362 }, { "entropy": 1.31081622838974, "epoch": 2.8241179568193786, "grad_norm": 0.26179248094558716, "learning_rate": 0.00014183714469851664, "loss": 0.17356306314468384, "mean_token_accuracy": 0.9289624840021133, "num_tokens": 66155912.0, "step": 5363 }, { "entropy": 1.2900842726230621, "epoch": 2.824644549763033, "grad_norm": 0.2782558798789978, "learning_rate": 0.00014181663331631404, "loss": 0.19263340532779694, "mean_token_accuracy": 0.9261777848005295, "num_tokens": 66168248.0, "step": 5364 }, { "entropy": 1.2860835790634155, "epoch": 2.8251711427066875, "grad_norm": 0.3041127920150757, "learning_rate": 0.00014179612004534334, "loss": 0.19561003148555756, "mean_token_accuracy": 0.9226749986410141, "num_tokens": 66180584.0, "step": 5365 }, { "entropy": 1.306857168674469, "epoch": 2.8256977356503423, "grad_norm": 0.2649271786212921, "learning_rate": 0.00014177560488682237, "loss": 0.18361037969589233, "mean_token_accuracy": 0.923071101307869, "num_tokens": 66192920.0, "step": 5366 }, { "entropy": 1.3504366278648376, "epoch": 2.8262243285939967, "grad_norm": 0.30323871970176697, "learning_rate": 0.00014175508784196892, "loss": 0.20840725302696228, "mean_token_accuracy": 0.9156047105789185, "num_tokens": 66205256.0, "step": 5367 }, { "entropy": 1.3343227803707123, "epoch": 2.826750921537651, "grad_norm": 0.30277058482170105, "learning_rate": 0.00014173456891200097, "loss": 0.2028798907995224, "mean_token_accuracy": 0.9148493260145187, "num_tokens": 66217592.0, "step": 5368 }, { "entropy": 1.2690812051296234, "epoch": 2.827277514481306, "grad_norm": 0.2847183346748352, "learning_rate": 0.0001417140480981366, "loss": 0.18881455063819885, "mean_token_accuracy": 0.9242660850286484, "num_tokens": 66229928.0, "step": 5369 }, { "entropy": 1.3083016276359558, "epoch": 2.8278041074249605, "grad_norm": 0.30137863755226135, "learning_rate": 0.00014169352540159406, "loss": 0.19169145822525024, "mean_token_accuracy": 0.9188456684350967, "num_tokens": 66242264.0, "step": 5370 }, { "entropy": 1.3139874637126923, "epoch": 2.828330700368615, "grad_norm": 0.2890307307243347, "learning_rate": 0.00014167300082359167, "loss": 0.19907841086387634, "mean_token_accuracy": 0.9193234592676163, "num_tokens": 66254600.0, "step": 5371 }, { "entropy": 1.2936797440052032, "epoch": 2.8288572933122698, "grad_norm": 0.27607885003089905, "learning_rate": 0.00014165247436534782, "loss": 0.1906982958316803, "mean_token_accuracy": 0.9183892905712128, "num_tokens": 66266936.0, "step": 5372 }, { "entropy": 1.3275218605995178, "epoch": 2.829383886255924, "grad_norm": 0.29767462611198425, "learning_rate": 0.000141631946028081, "loss": 0.21200454235076904, "mean_token_accuracy": 0.9133586883544922, "num_tokens": 66279272.0, "step": 5373 }, { "entropy": 1.3114037215709686, "epoch": 2.8299104791995786, "grad_norm": 0.2859516441822052, "learning_rate": 0.00014161141581300993, "loss": 0.2003038227558136, "mean_token_accuracy": 0.9200000613927841, "num_tokens": 66291608.0, "step": 5374 }, { "entropy": 1.2808501720428467, "epoch": 2.8304370721432335, "grad_norm": 0.2558257579803467, "learning_rate": 0.0001415908837213534, "loss": 0.17073266208171844, "mean_token_accuracy": 0.9285646677017212, "num_tokens": 66303944.0, "step": 5375 }, { "entropy": 1.2928644716739655, "epoch": 2.830963665086888, "grad_norm": 0.2917443811893463, "learning_rate": 0.00014157034975433017, "loss": 0.20764575898647308, "mean_token_accuracy": 0.915138840675354, "num_tokens": 66316280.0, "step": 5376 }, { "entropy": 1.2757077515125275, "epoch": 2.8314902580305423, "grad_norm": 0.2791418731212616, "learning_rate": 0.00014154981391315932, "loss": 0.18959811329841614, "mean_token_accuracy": 0.9251828342676163, "num_tokens": 66328616.0, "step": 5377 }, { "entropy": 1.319762110710144, "epoch": 2.832016850974197, "grad_norm": 0.26925116777420044, "learning_rate": 0.00014152927619905987, "loss": 0.17835290729999542, "mean_token_accuracy": 0.9292363375425339, "num_tokens": 66340952.0, "step": 5378 }, { "entropy": 1.2947478890419006, "epoch": 2.8325434439178516, "grad_norm": 0.2954257130622864, "learning_rate": 0.00014150873661325107, "loss": 0.19611039757728577, "mean_token_accuracy": 0.9170423597097397, "num_tokens": 66353288.0, "step": 5379 }, { "entropy": 1.3365015387535095, "epoch": 2.833070036861506, "grad_norm": 0.28138986229896545, "learning_rate": 0.00014148819515695226, "loss": 0.19645000994205475, "mean_token_accuracy": 0.9223781526088715, "num_tokens": 66365624.0, "step": 5380 }, { "entropy": 1.2312410771846771, "epoch": 2.8335966298051605, "grad_norm": 0.25112465023994446, "learning_rate": 0.0001414676518313828, "loss": 0.17653129994869232, "mean_token_accuracy": 0.9302770644426346, "num_tokens": 66377960.0, "step": 5381 }, { "entropy": 1.29915651679039, "epoch": 2.834123222748815, "grad_norm": 0.28604868054389954, "learning_rate": 0.00014144710663776224, "loss": 0.18507474660873413, "mean_token_accuracy": 0.9225872606039047, "num_tokens": 66390296.0, "step": 5382 }, { "entropy": 1.2989193797111511, "epoch": 2.8346498156924698, "grad_norm": 0.29358354210853577, "learning_rate": 0.00014142655957731027, "loss": 0.20054125785827637, "mean_token_accuracy": 0.9196604937314987, "num_tokens": 66402632.0, "step": 5383 }, { "entropy": 1.3038256466388702, "epoch": 2.835176408636124, "grad_norm": 0.2762550115585327, "learning_rate": 0.0001414060106512466, "loss": 0.18558046221733093, "mean_token_accuracy": 0.9259804487228394, "num_tokens": 66414968.0, "step": 5384 }, { "entropy": 1.2950901687145233, "epoch": 2.8357030015797786, "grad_norm": 0.2872573435306549, "learning_rate": 0.00014138545986079119, "loss": 0.1845257580280304, "mean_token_accuracy": 0.9250736236572266, "num_tokens": 66427304.0, "step": 5385 }, { "entropy": 1.243366152048111, "epoch": 2.8362295945234335, "grad_norm": 0.272707998752594, "learning_rate": 0.0001413649072071639, "loss": 0.19566035270690918, "mean_token_accuracy": 0.9192866683006287, "num_tokens": 66439640.0, "step": 5386 }, { "entropy": 1.283011943101883, "epoch": 2.836756187467088, "grad_norm": 0.24862247705459595, "learning_rate": 0.00014134435269158487, "loss": 0.18011629581451416, "mean_token_accuracy": 0.9231017231941223, "num_tokens": 66451976.0, "step": 5387 }, { "entropy": 1.2681494057178497, "epoch": 2.8372827804107423, "grad_norm": 0.2905445396900177, "learning_rate": 0.00014132379631527433, "loss": 0.19375208020210266, "mean_token_accuracy": 0.919303685426712, "num_tokens": 66464312.0, "step": 5388 }, { "entropy": 1.2690399587154388, "epoch": 2.837809373354397, "grad_norm": 0.32442450523376465, "learning_rate": 0.0001413032380794526, "loss": 0.22549712657928467, "mean_token_accuracy": 0.9056236445903778, "num_tokens": 66476648.0, "step": 5389 }, { "entropy": 1.2229408919811249, "epoch": 2.8383359662980516, "grad_norm": 0.2401140034198761, "learning_rate": 0.00014128267798534002, "loss": 0.16507481038570404, "mean_token_accuracy": 0.9342491179704666, "num_tokens": 66488984.0, "step": 5390 }, { "entropy": 1.2351162135601044, "epoch": 2.838862559241706, "grad_norm": 0.2740425765514374, "learning_rate": 0.00014126211603415723, "loss": 0.1834060549736023, "mean_token_accuracy": 0.9211757332086563, "num_tokens": 66501320.0, "step": 5391 }, { "entropy": 1.2271034121513367, "epoch": 2.839389152185361, "grad_norm": 0.2942942976951599, "learning_rate": 0.00014124155222712477, "loss": 0.20962479710578918, "mean_token_accuracy": 0.9142883569002151, "num_tokens": 66513656.0, "step": 5392 }, { "entropy": 1.2456031441688538, "epoch": 2.8399157451290153, "grad_norm": 0.2792077958583832, "learning_rate": 0.00014122098656546347, "loss": 0.19956699013710022, "mean_token_accuracy": 0.9134206175804138, "num_tokens": 66525992.0, "step": 5393 }, { "entropy": 1.2200534343719482, "epoch": 2.8404423380726698, "grad_norm": 0.2667393386363983, "learning_rate": 0.00014120041905039417, "loss": 0.18422703444957733, "mean_token_accuracy": 0.9217170625925064, "num_tokens": 66538328.0, "step": 5394 }, { "entropy": 1.2396110892295837, "epoch": 2.8409689310163246, "grad_norm": 0.29442811012268066, "learning_rate": 0.00014117984968313785, "loss": 0.19714084267616272, "mean_token_accuracy": 0.920742392539978, "num_tokens": 66550664.0, "step": 5395 }, { "entropy": 1.1788528263568878, "epoch": 2.841495523959979, "grad_norm": 0.2758336067199707, "learning_rate": 0.00014115927846491556, "loss": 0.19068320095539093, "mean_token_accuracy": 0.9210142344236374, "num_tokens": 66563000.0, "step": 5396 }, { "entropy": 1.1362981796264648, "epoch": 2.8420221169036335, "grad_norm": 0.25416529178619385, "learning_rate": 0.00014113870539694852, "loss": 0.16557230055332184, "mean_token_accuracy": 0.9342633932828903, "num_tokens": 66575336.0, "step": 5397 }, { "entropy": 1.1327734589576721, "epoch": 2.842548709847288, "grad_norm": 0.2415960431098938, "learning_rate": 0.00014111813048045804, "loss": 0.16808874905109406, "mean_token_accuracy": 0.9288180619478226, "num_tokens": 66587672.0, "step": 5398 }, { "entropy": 1.1094682216644287, "epoch": 2.8430753027909423, "grad_norm": 0.2572054862976074, "learning_rate": 0.00014109755371666553, "loss": 0.18255862593650818, "mean_token_accuracy": 0.9252709001302719, "num_tokens": 66600008.0, "step": 5399 }, { "entropy": 1.167961448431015, "epoch": 2.843601895734597, "grad_norm": 0.26458224654197693, "learning_rate": 0.0001410769751067925, "loss": 0.18526852130889893, "mean_token_accuracy": 0.9216188937425613, "num_tokens": 66612344.0, "step": 5400 }, { "entropy": 1.1674366891384125, "epoch": 2.8441284886782516, "grad_norm": 0.2747248411178589, "learning_rate": 0.00014105639465206057, "loss": 0.17862823605537415, "mean_token_accuracy": 0.9248768389225006, "num_tokens": 66624680.0, "step": 5401 }, { "entropy": 1.1781964004039764, "epoch": 2.844655081621906, "grad_norm": 0.2930940091609955, "learning_rate": 0.00014103581235369152, "loss": 0.19545236229896545, "mean_token_accuracy": 0.921414703130722, "num_tokens": 66637016.0, "step": 5402 }, { "entropy": 1.137371987104416, "epoch": 2.845181674565561, "grad_norm": 0.3015097975730896, "learning_rate": 0.00014101522821290718, "loss": 0.1982129067182541, "mean_token_accuracy": 0.9206677973270416, "num_tokens": 66649352.0, "step": 5403 }, { "entropy": 1.1155942976474762, "epoch": 2.8457082675092154, "grad_norm": 0.2667999863624573, "learning_rate": 0.00014099464223092951, "loss": 0.18535880744457245, "mean_token_accuracy": 0.9235810935497284, "num_tokens": 66661688.0, "step": 5404 }, { "entropy": 1.1362461149692535, "epoch": 2.8462348604528698, "grad_norm": 0.28863558173179626, "learning_rate": 0.00014097405440898059, "loss": 0.20071467757225037, "mean_token_accuracy": 0.9162945002317429, "num_tokens": 66674024.0, "step": 5405 }, { "entropy": 1.1156060993671417, "epoch": 2.8467614533965246, "grad_norm": 0.28235065937042236, "learning_rate": 0.0001409534647482826, "loss": 0.18811024725437164, "mean_token_accuracy": 0.9257550984621048, "num_tokens": 66686360.0, "step": 5406 }, { "entropy": 1.1049256920814514, "epoch": 2.847288046340179, "grad_norm": 0.27387118339538574, "learning_rate": 0.0001409328732500578, "loss": 0.18561598658561707, "mean_token_accuracy": 0.9243172854185104, "num_tokens": 66698696.0, "step": 5407 }, { "entropy": 1.0878219902515411, "epoch": 2.8478146392838335, "grad_norm": 0.24213702976703644, "learning_rate": 0.0001409122799155286, "loss": 0.17320024967193604, "mean_token_accuracy": 0.9250019490718842, "num_tokens": 66711032.0, "step": 5408 }, { "entropy": 1.1544892191886902, "epoch": 2.8483412322274884, "grad_norm": 0.297046959400177, "learning_rate": 0.00014089168474591752, "loss": 0.2007860541343689, "mean_token_accuracy": 0.9169928729534149, "num_tokens": 66723368.0, "step": 5409 }, { "entropy": 1.09200057387352, "epoch": 2.848867825171143, "grad_norm": 0.26236802339553833, "learning_rate": 0.00014087108774244714, "loss": 0.171499103307724, "mean_token_accuracy": 0.9301941990852356, "num_tokens": 66735704.0, "step": 5410 }, { "entropy": 1.127855896949768, "epoch": 2.849394418114797, "grad_norm": 0.2707575261592865, "learning_rate": 0.00014085048890634023, "loss": 0.18420180678367615, "mean_token_accuracy": 0.9241728633642197, "num_tokens": 66748040.0, "step": 5411 }, { "entropy": 1.1189501583576202, "epoch": 2.849921011058452, "grad_norm": 0.2789716124534607, "learning_rate": 0.00014082988823881963, "loss": 0.18347470462322235, "mean_token_accuracy": 0.9260276108980179, "num_tokens": 66760376.0, "step": 5412 }, { "entropy": 1.1610067784786224, "epoch": 2.8504476040021065, "grad_norm": 0.28152376413345337, "learning_rate": 0.0001408092857411082, "loss": 0.18292734026908875, "mean_token_accuracy": 0.9208507537841797, "num_tokens": 66772712.0, "step": 5413 }, { "entropy": 1.180832177400589, "epoch": 2.850974196945761, "grad_norm": 0.27147287130355835, "learning_rate": 0.00014078868141442912, "loss": 0.17122916877269745, "mean_token_accuracy": 0.9286279231309891, "num_tokens": 66785048.0, "step": 5414 }, { "entropy": 1.1299280226230621, "epoch": 2.8515007898894154, "grad_norm": 0.3026059865951538, "learning_rate": 0.00014076807526000539, "loss": 0.19383591413497925, "mean_token_accuracy": 0.9125325083732605, "num_tokens": 66797384.0, "step": 5415 }, { "entropy": 1.1946425437927246, "epoch": 2.85202738283307, "grad_norm": 0.309876412153244, "learning_rate": 0.00014074746727906046, "loss": 0.21104586124420166, "mean_token_accuracy": 0.9126588106155396, "num_tokens": 66809720.0, "step": 5416 }, { "entropy": 1.123658001422882, "epoch": 2.8525539757767246, "grad_norm": 0.25807276368141174, "learning_rate": 0.00014072685747281753, "loss": 0.17802190780639648, "mean_token_accuracy": 0.9260611236095428, "num_tokens": 66822056.0, "step": 5417 }, { "entropy": 1.1184225380420685, "epoch": 2.853080568720379, "grad_norm": 0.2761235237121582, "learning_rate": 0.00014070624584250018, "loss": 0.20021545886993408, "mean_token_accuracy": 0.9165898710489273, "num_tokens": 66834392.0, "step": 5418 }, { "entropy": 1.1407923996448517, "epoch": 2.8536071616640335, "grad_norm": 0.2857515811920166, "learning_rate": 0.000140685632389332, "loss": 0.19885635375976562, "mean_token_accuracy": 0.9142837524414062, "num_tokens": 66846728.0, "step": 5419 }, { "entropy": 1.138054519891739, "epoch": 2.8541337546076884, "grad_norm": 0.27679088711738586, "learning_rate": 0.00014066501711453664, "loss": 0.19095392525196075, "mean_token_accuracy": 0.9210739135742188, "num_tokens": 66859064.0, "step": 5420 }, { "entropy": 1.1621717810630798, "epoch": 2.854660347551343, "grad_norm": 0.2896009385585785, "learning_rate": 0.00014064440001933798, "loss": 0.1932981014251709, "mean_token_accuracy": 0.9193224459886551, "num_tokens": 66871400.0, "step": 5421 }, { "entropy": 1.1080684959888458, "epoch": 2.855186940494997, "grad_norm": 0.2747195065021515, "learning_rate": 0.00014062378110495989, "loss": 0.19618317484855652, "mean_token_accuracy": 0.919920340180397, "num_tokens": 66883736.0, "step": 5422 }, { "entropy": 1.1182142198085785, "epoch": 2.855713533438652, "grad_norm": 0.2994195222854614, "learning_rate": 0.0001406031603726264, "loss": 0.19491897523403168, "mean_token_accuracy": 0.9171514958143234, "num_tokens": 66896072.0, "step": 5423 }, { "entropy": 1.0934617221355438, "epoch": 2.8562401263823065, "grad_norm": 0.2570323646068573, "learning_rate": 0.00014058253782356166, "loss": 0.17098519206047058, "mean_token_accuracy": 0.9273951053619385, "num_tokens": 66908408.0, "step": 5424 }, { "entropy": 1.0887425243854523, "epoch": 2.856766719325961, "grad_norm": 0.24847312271595, "learning_rate": 0.00014056191345898986, "loss": 0.1830718219280243, "mean_token_accuracy": 0.9246447682380676, "num_tokens": 66920744.0, "step": 5425 }, { "entropy": 1.0863420367240906, "epoch": 2.857293312269616, "grad_norm": 0.27926573157310486, "learning_rate": 0.0001405412872801354, "loss": 0.1928982138633728, "mean_token_accuracy": 0.9180453270673752, "num_tokens": 66933080.0, "step": 5426 }, { "entropy": 1.0742215812206268, "epoch": 2.8578199052132702, "grad_norm": 0.26996538043022156, "learning_rate": 0.00014052065928822275, "loss": 0.19069387018680573, "mean_token_accuracy": 0.9181806743144989, "num_tokens": 66945416.0, "step": 5427 }, { "entropy": 1.0830220580101013, "epoch": 2.8583464981569247, "grad_norm": 0.28085827827453613, "learning_rate": 0.00014050002948447644, "loss": 0.2127879559993744, "mean_token_accuracy": 0.9116558134555817, "num_tokens": 66957752.0, "step": 5428 }, { "entropy": 1.1039027869701385, "epoch": 2.8588730911005795, "grad_norm": 0.27143600583076477, "learning_rate": 0.00014047939787012115, "loss": 0.1901354193687439, "mean_token_accuracy": 0.9206545948982239, "num_tokens": 66970088.0, "step": 5429 }, { "entropy": 1.170148491859436, "epoch": 2.859399684044234, "grad_norm": 0.30527952313423157, "learning_rate": 0.00014045876444638165, "loss": 0.19135817885398865, "mean_token_accuracy": 0.9210909754037857, "num_tokens": 66982424.0, "step": 5430 }, { "entropy": 1.122731328010559, "epoch": 2.8599262769878884, "grad_norm": 0.2801341116428375, "learning_rate": 0.0001404381292144828, "loss": 0.1940993219614029, "mean_token_accuracy": 0.9169181287288666, "num_tokens": 66994760.0, "step": 5431 }, { "entropy": 1.1264297366142273, "epoch": 2.860452869931543, "grad_norm": 0.27544909715652466, "learning_rate": 0.00014041749217564965, "loss": 0.17596957087516785, "mean_token_accuracy": 0.9287864416837692, "num_tokens": 67007096.0, "step": 5432 }, { "entropy": 1.072750210762024, "epoch": 2.860979462875197, "grad_norm": 0.2531747817993164, "learning_rate": 0.0001403968533311073, "loss": 0.1748124659061432, "mean_token_accuracy": 0.9279569089412689, "num_tokens": 67019432.0, "step": 5433 }, { "entropy": 1.06135892868042, "epoch": 2.861506055818852, "grad_norm": 0.2722875773906708, "learning_rate": 0.00014037621268208093, "loss": 0.1929028183221817, "mean_token_accuracy": 0.9204573929309845, "num_tokens": 67031768.0, "step": 5434 }, { "entropy": 1.1115979850292206, "epoch": 2.8620326487625065, "grad_norm": 0.30371981859207153, "learning_rate": 0.00014035557022979583, "loss": 0.21404585242271423, "mean_token_accuracy": 0.9116851538419724, "num_tokens": 67044104.0, "step": 5435 }, { "entropy": 1.1167850196361542, "epoch": 2.862559241706161, "grad_norm": 0.3018032908439636, "learning_rate": 0.00014033492597547744, "loss": 0.21622182428836823, "mean_token_accuracy": 0.9091343581676483, "num_tokens": 67056440.0, "step": 5436 }, { "entropy": 1.1104548573493958, "epoch": 2.863085834649816, "grad_norm": 0.25832709670066833, "learning_rate": 0.0001403142799203513, "loss": 0.18880854547023773, "mean_token_accuracy": 0.9243634939193726, "num_tokens": 67068776.0, "step": 5437 }, { "entropy": 1.1190284192562103, "epoch": 2.8636124275934702, "grad_norm": 0.2891407310962677, "learning_rate": 0.00014029363206564306, "loss": 0.19353890419006348, "mean_token_accuracy": 0.9211379885673523, "num_tokens": 67081112.0, "step": 5438 }, { "entropy": 1.1418761312961578, "epoch": 2.8641390205371247, "grad_norm": 0.26448798179626465, "learning_rate": 0.0001402729824125785, "loss": 0.1813502162694931, "mean_token_accuracy": 0.9249635934829712, "num_tokens": 67093448.0, "step": 5439 }, { "entropy": 1.1411679685115814, "epoch": 2.8646656134807795, "grad_norm": 0.2673298716545105, "learning_rate": 0.00014025233096238337, "loss": 0.2000432014465332, "mean_token_accuracy": 0.92094986140728, "num_tokens": 67105784.0, "step": 5440 }, { "entropy": 1.126186192035675, "epoch": 2.865192206424434, "grad_norm": 0.26789215207099915, "learning_rate": 0.0001402316777162837, "loss": 0.1887417435646057, "mean_token_accuracy": 0.9270607680082321, "num_tokens": 67118120.0, "step": 5441 }, { "entropy": 1.1385208070278168, "epoch": 2.8657187993680884, "grad_norm": 0.25131142139434814, "learning_rate": 0.0001402110226755055, "loss": 0.1738722175359726, "mean_token_accuracy": 0.930255264043808, "num_tokens": 67130456.0, "step": 5442 }, { "entropy": 1.122873455286026, "epoch": 2.8662453923117432, "grad_norm": 0.26481401920318604, "learning_rate": 0.000140190365841275, "loss": 0.18120309710502625, "mean_token_accuracy": 0.9251967370510101, "num_tokens": 67142792.0, "step": 5443 }, { "entropy": 1.1093613505363464, "epoch": 2.8667719852553977, "grad_norm": 0.2555820941925049, "learning_rate": 0.00014016970721481838, "loss": 0.1706184446811676, "mean_token_accuracy": 0.9285883456468582, "num_tokens": 67155128.0, "step": 5444 }, { "entropy": 1.1308659613132477, "epoch": 2.867298578199052, "grad_norm": 0.2681415379047394, "learning_rate": 0.00014014904679736213, "loss": 0.19834303855895996, "mean_token_accuracy": 0.9212728142738342, "num_tokens": 67167464.0, "step": 5445 }, { "entropy": 1.117288589477539, "epoch": 2.867825171142707, "grad_norm": 0.28140929341316223, "learning_rate": 0.0001401283845901327, "loss": 0.2111014872789383, "mean_token_accuracy": 0.9120144248008728, "num_tokens": 67179800.0, "step": 5446 }, { "entropy": 1.141126126050949, "epoch": 2.8683517640863614, "grad_norm": 0.2594495117664337, "learning_rate": 0.00014010772059435664, "loss": 0.18402037024497986, "mean_token_accuracy": 0.921778216958046, "num_tokens": 67192136.0, "step": 5447 }, { "entropy": 1.1240050196647644, "epoch": 2.868878357030016, "grad_norm": 0.2530897855758667, "learning_rate": 0.00014008705481126073, "loss": 0.1877949982881546, "mean_token_accuracy": 0.9208306074142456, "num_tokens": 67204472.0, "step": 5448 }, { "entropy": 1.2034168243408203, "epoch": 2.8694049499736702, "grad_norm": 0.28608205914497375, "learning_rate": 0.00014006638724207174, "loss": 0.19868814945220947, "mean_token_accuracy": 0.9173824042081833, "num_tokens": 67216808.0, "step": 5449 }, { "entropy": 1.2032455205917358, "epoch": 2.8699315429173247, "grad_norm": 0.29074713587760925, "learning_rate": 0.00014004571788801652, "loss": 0.20050571858882904, "mean_token_accuracy": 0.9168554842472076, "num_tokens": 67229144.0, "step": 5450 }, { "entropy": 1.185323804616928, "epoch": 2.8704581358609795, "grad_norm": 0.2699410319328308, "learning_rate": 0.0001400250467503222, "loss": 0.19191224873065948, "mean_token_accuracy": 0.9225668460130692, "num_tokens": 67241480.0, "step": 5451 }, { "entropy": 1.2091895043849945, "epoch": 2.870984728804634, "grad_norm": 0.268320232629776, "learning_rate": 0.00014000437383021586, "loss": 0.18603497743606567, "mean_token_accuracy": 0.9205420464277267, "num_tokens": 67253816.0, "step": 5452 }, { "entropy": 1.2147535979747772, "epoch": 2.8715113217482884, "grad_norm": 0.2614723742008209, "learning_rate": 0.0001399836991289247, "loss": 0.18065370619297028, "mean_token_accuracy": 0.9245912879705429, "num_tokens": 67266152.0, "step": 5453 }, { "entropy": 1.1979366540908813, "epoch": 2.8720379146919433, "grad_norm": 0.2876172661781311, "learning_rate": 0.00013996302264767608, "loss": 0.19929926097393036, "mean_token_accuracy": 0.9158833473920822, "num_tokens": 67278488.0, "step": 5454 }, { "entropy": 1.2220218181610107, "epoch": 2.8725645076355977, "grad_norm": 0.2671680748462677, "learning_rate": 0.00013994234438769747, "loss": 0.18833203613758087, "mean_token_accuracy": 0.9217775911092758, "num_tokens": 67290824.0, "step": 5455 }, { "entropy": 1.1728639602661133, "epoch": 2.873091100579252, "grad_norm": 0.3314996361732483, "learning_rate": 0.00013992166435021635, "loss": 0.20119228959083557, "mean_token_accuracy": 0.9148829132318497, "num_tokens": 67303160.0, "step": 5456 }, { "entropy": 1.227847933769226, "epoch": 2.873617693522907, "grad_norm": 0.27688175439834595, "learning_rate": 0.00013990098253646043, "loss": 0.18525132536888123, "mean_token_accuracy": 0.9234299957752228, "num_tokens": 67315496.0, "step": 5457 }, { "entropy": 1.229965090751648, "epoch": 2.8741442864665614, "grad_norm": 0.28945228457450867, "learning_rate": 0.00013988029894765748, "loss": 0.19980910420417786, "mean_token_accuracy": 0.9183862209320068, "num_tokens": 67327832.0, "step": 5458 }, { "entropy": 1.1130054593086243, "epoch": 2.874670879410216, "grad_norm": 0.26660850644111633, "learning_rate": 0.0001398596135850353, "loss": 0.18399474024772644, "mean_token_accuracy": 0.9241610169410706, "num_tokens": 67340168.0, "step": 5459 }, { "entropy": 1.1546690165996552, "epoch": 2.8751974723538707, "grad_norm": 0.28937751054763794, "learning_rate": 0.0001398389264498219, "loss": 0.2176598459482193, "mean_token_accuracy": 0.9133116751909256, "num_tokens": 67352504.0, "step": 5460 }, { "entropy": 1.1990187168121338, "epoch": 2.875724065297525, "grad_norm": 0.28130099177360535, "learning_rate": 0.00013981823754324538, "loss": 0.19636386632919312, "mean_token_accuracy": 0.9205514341592789, "num_tokens": 67364840.0, "step": 5461 }, { "entropy": 1.1869704127311707, "epoch": 2.8762506582411795, "grad_norm": 0.28470396995544434, "learning_rate": 0.00013979754686653387, "loss": 0.18688493967056274, "mean_token_accuracy": 0.9220611900091171, "num_tokens": 67377176.0, "step": 5462 }, { "entropy": 1.1728688478469849, "epoch": 2.876777251184834, "grad_norm": 0.2566015422344208, "learning_rate": 0.0001397768544209157, "loss": 0.179299995303154, "mean_token_accuracy": 0.9220699667930603, "num_tokens": 67389512.0, "step": 5463 }, { "entropy": 1.1600215435028076, "epoch": 2.877303844128489, "grad_norm": 0.27697089314460754, "learning_rate": 0.00013975616020761922, "loss": 0.18880513310432434, "mean_token_accuracy": 0.9230993837118149, "num_tokens": 67401848.0, "step": 5464 }, { "entropy": 1.1880110800266266, "epoch": 2.8778304370721433, "grad_norm": 0.30111849308013916, "learning_rate": 0.0001397354642278729, "loss": 0.19892379641532898, "mean_token_accuracy": 0.9172447323799133, "num_tokens": 67414184.0, "step": 5465 }, { "entropy": 1.1921871602535248, "epoch": 2.8783570300157977, "grad_norm": 0.2692202925682068, "learning_rate": 0.00013971476648290545, "loss": 0.18941126763820648, "mean_token_accuracy": 0.9192425012588501, "num_tokens": 67426520.0, "step": 5466 }, { "entropy": 1.2540110051631927, "epoch": 2.878883622959452, "grad_norm": 0.29185977578163147, "learning_rate": 0.00013969406697394548, "loss": 0.19037245213985443, "mean_token_accuracy": 0.9188786596059799, "num_tokens": 67438856.0, "step": 5467 }, { "entropy": 1.2021810710430145, "epoch": 2.879410215903107, "grad_norm": 0.2722068727016449, "learning_rate": 0.00013967336570222183, "loss": 0.19480682909488678, "mean_token_accuracy": 0.9211893379688263, "num_tokens": 67451192.0, "step": 5468 }, { "entropy": 1.2452360689640045, "epoch": 2.8799368088467614, "grad_norm": 0.30236995220184326, "learning_rate": 0.0001396526626689634, "loss": 0.19539473950862885, "mean_token_accuracy": 0.9220133870840073, "num_tokens": 67463528.0, "step": 5469 }, { "entropy": 1.1860556304454803, "epoch": 2.880463401790416, "grad_norm": 0.2610684335231781, "learning_rate": 0.0001396319578753992, "loss": 0.2000972032546997, "mean_token_accuracy": 0.9178863316774368, "num_tokens": 67475864.0, "step": 5470 }, { "entropy": 1.1721631586551666, "epoch": 2.8809899947340707, "grad_norm": 0.2493157833814621, "learning_rate": 0.00013961125132275836, "loss": 0.17627960443496704, "mean_token_accuracy": 0.9253731369972229, "num_tokens": 67488200.0, "step": 5471 }, { "entropy": 1.1537190973758698, "epoch": 2.881516587677725, "grad_norm": 0.2524517774581909, "learning_rate": 0.00013959054301227011, "loss": 0.19084662199020386, "mean_token_accuracy": 0.922870934009552, "num_tokens": 67500536.0, "step": 5472 }, { "entropy": 1.2264028787612915, "epoch": 2.8820431806213795, "grad_norm": 0.25612008571624756, "learning_rate": 0.00013956983294516386, "loss": 0.1767480969429016, "mean_token_accuracy": 0.9253916144371033, "num_tokens": 67512872.0, "step": 5473 }, { "entropy": 1.2065593600273132, "epoch": 2.8825697735650344, "grad_norm": 0.2584444582462311, "learning_rate": 0.0001395491211226689, "loss": 0.18127556145191193, "mean_token_accuracy": 0.9242168962955475, "num_tokens": 67525208.0, "step": 5474 }, { "entropy": 1.1801214814186096, "epoch": 2.883096366508689, "grad_norm": 0.24572916328907013, "learning_rate": 0.00013952840754601488, "loss": 0.18749801814556122, "mean_token_accuracy": 0.9196372032165527, "num_tokens": 67537544.0, "step": 5475 }, { "entropy": 1.2200948596000671, "epoch": 2.8836229594523433, "grad_norm": 0.281856507062912, "learning_rate": 0.0001395076922164314, "loss": 0.194240540266037, "mean_token_accuracy": 0.9169766008853912, "num_tokens": 67549880.0, "step": 5476 }, { "entropy": 1.2109468281269073, "epoch": 2.884149552395998, "grad_norm": 0.28432926535606384, "learning_rate": 0.00013948697513514822, "loss": 0.18888379633426666, "mean_token_accuracy": 0.9218895584344864, "num_tokens": 67562216.0, "step": 5477 }, { "entropy": 1.1744347214698792, "epoch": 2.8846761453396526, "grad_norm": 0.24902574717998505, "learning_rate": 0.00013946625630339518, "loss": 0.1767992079257965, "mean_token_accuracy": 0.926706999540329, "num_tokens": 67574552.0, "step": 5478 }, { "entropy": 1.1746321320533752, "epoch": 2.885202738283307, "grad_norm": 0.2674560546875, "learning_rate": 0.00013944553572240226, "loss": 0.1794002652168274, "mean_token_accuracy": 0.9238214045763016, "num_tokens": 67586888.0, "step": 5479 }, { "entropy": 1.1886841356754303, "epoch": 2.8857293312269614, "grad_norm": 0.28249746561050415, "learning_rate": 0.0001394248133933995, "loss": 0.19088155031204224, "mean_token_accuracy": 0.919599786400795, "num_tokens": 67599224.0, "step": 5480 }, { "entropy": 1.1575458347797394, "epoch": 2.8862559241706163, "grad_norm": 0.2625466585159302, "learning_rate": 0.00013940408931761706, "loss": 0.18857283890247345, "mean_token_accuracy": 0.9230266064405441, "num_tokens": 67611560.0, "step": 5481 }, { "entropy": 1.164193332195282, "epoch": 2.8867825171142707, "grad_norm": 0.2611542046070099, "learning_rate": 0.00013938336349628524, "loss": 0.1958429515361786, "mean_token_accuracy": 0.9188902080059052, "num_tokens": 67623896.0, "step": 5482 }, { "entropy": 1.1729185581207275, "epoch": 2.887309110057925, "grad_norm": 0.2818647623062134, "learning_rate": 0.00013936263593063438, "loss": 0.20438428223133087, "mean_token_accuracy": 0.9178862571716309, "num_tokens": 67636232.0, "step": 5483 }, { "entropy": 1.2090890109539032, "epoch": 2.8878357030015795, "grad_norm": 0.27847352623939514, "learning_rate": 0.00013934190662189496, "loss": 0.19311118125915527, "mean_token_accuracy": 0.920319065451622, "num_tokens": 67648568.0, "step": 5484 }, { "entropy": 1.1742522418498993, "epoch": 2.8883622959452344, "grad_norm": 0.2799610197544098, "learning_rate": 0.00013932117557129755, "loss": 0.20451730489730835, "mean_token_accuracy": 0.9123682975769043, "num_tokens": 67660904.0, "step": 5485 }, { "entropy": 1.1871919333934784, "epoch": 2.888888888888889, "grad_norm": 0.27488139271736145, "learning_rate": 0.00013930044278007283, "loss": 0.1982969343662262, "mean_token_accuracy": 0.9207281917333603, "num_tokens": 67673240.0, "step": 5486 }, { "entropy": 1.2073151469230652, "epoch": 2.8894154818325433, "grad_norm": 0.28361013531684875, "learning_rate": 0.00013927970824945165, "loss": 0.19221793115139008, "mean_token_accuracy": 0.9205655306577682, "num_tokens": 67685576.0, "step": 5487 }, { "entropy": 1.1463909447193146, "epoch": 2.889942074776198, "grad_norm": 0.2542709708213806, "learning_rate": 0.0001392589719806648, "loss": 0.18216948211193085, "mean_token_accuracy": 0.9249231219291687, "num_tokens": 67697912.0, "step": 5488 }, { "entropy": 1.1823024451732635, "epoch": 2.8904686677198526, "grad_norm": 0.28278055787086487, "learning_rate": 0.00013923823397494334, "loss": 0.18571798503398895, "mean_token_accuracy": 0.9252088069915771, "num_tokens": 67710248.0, "step": 5489 }, { "entropy": 1.1500611007213593, "epoch": 2.890995260663507, "grad_norm": 0.2649606764316559, "learning_rate": 0.00013921749423351833, "loss": 0.18341246247291565, "mean_token_accuracy": 0.925861045718193, "num_tokens": 67722584.0, "step": 5490 }, { "entropy": 1.1709353029727936, "epoch": 2.891521853607162, "grad_norm": 0.2752512991428375, "learning_rate": 0.00013919675275762098, "loss": 0.18391147255897522, "mean_token_accuracy": 0.9232052862644196, "num_tokens": 67734920.0, "step": 5491 }, { "entropy": 1.1525313258171082, "epoch": 2.8920484465508163, "grad_norm": 0.3017459213733673, "learning_rate": 0.0001391760095484826, "loss": 0.20819026231765747, "mean_token_accuracy": 0.9137952923774719, "num_tokens": 67747256.0, "step": 5492 }, { "entropy": 1.1915410459041595, "epoch": 2.8925750394944707, "grad_norm": 0.26276955008506775, "learning_rate": 0.00013915526460733462, "loss": 0.17978140711784363, "mean_token_accuracy": 0.9292542785406113, "num_tokens": 67759592.0, "step": 5493 }, { "entropy": 1.2160204350948334, "epoch": 2.8931016324381256, "grad_norm": 0.28528469800949097, "learning_rate": 0.00013913451793540844, "loss": 0.19692108035087585, "mean_token_accuracy": 0.9169259369373322, "num_tokens": 67771928.0, "step": 5494 }, { "entropy": 1.1477001011371613, "epoch": 2.89362822538178, "grad_norm": 0.2837713956832886, "learning_rate": 0.00013911376953393577, "loss": 0.18914955854415894, "mean_token_accuracy": 0.9206328988075256, "num_tokens": 67784264.0, "step": 5495 }, { "entropy": 1.157814860343933, "epoch": 2.8941548183254344, "grad_norm": 0.2714032530784607, "learning_rate": 0.00013909301940414828, "loss": 0.1825396716594696, "mean_token_accuracy": 0.9275189191102982, "num_tokens": 67796600.0, "step": 5496 }, { "entropy": 1.1470504999160767, "epoch": 2.894681411269089, "grad_norm": 0.2933061420917511, "learning_rate": 0.00013907226754727783, "loss": 0.19350317120552063, "mean_token_accuracy": 0.9198871105909348, "num_tokens": 67808936.0, "step": 5497 }, { "entropy": 1.1557423174381256, "epoch": 2.8952080042127437, "grad_norm": 0.26497289538383484, "learning_rate": 0.00013905151396455628, "loss": 0.18695615231990814, "mean_token_accuracy": 0.9201800376176834, "num_tokens": 67821272.0, "step": 5498 }, { "entropy": 1.2245990633964539, "epoch": 2.895734597156398, "grad_norm": 0.31506285071372986, "learning_rate": 0.0001390307586572156, "loss": 0.19346579909324646, "mean_token_accuracy": 0.9197398275136948, "num_tokens": 67833608.0, "step": 5499 }, { "entropy": 1.194277048110962, "epoch": 2.8962611901000526, "grad_norm": 0.3318503499031067, "learning_rate": 0.0001390100016264881, "loss": 0.19116128981113434, "mean_token_accuracy": 0.923472136259079, "num_tokens": 67845944.0, "step": 5500 }, { "entropy": 1.147051066160202, "epoch": 2.896787783043707, "grad_norm": 0.2742278575897217, "learning_rate": 0.00013898924287360584, "loss": 0.2055630087852478, "mean_token_accuracy": 0.9172082245349884, "num_tokens": 67858280.0, "step": 5501 }, { "entropy": 1.1588106751441956, "epoch": 2.897314375987362, "grad_norm": 0.27538150548934937, "learning_rate": 0.00013896848239980118, "loss": 0.1679210364818573, "mean_token_accuracy": 0.9297711849212646, "num_tokens": 67870616.0, "step": 5502 }, { "entropy": 1.1855699121952057, "epoch": 2.8978409689310163, "grad_norm": 0.2715197801589966, "learning_rate": 0.00013894772020630656, "loss": 0.20283342897891998, "mean_token_accuracy": 0.9191963374614716, "num_tokens": 67882952.0, "step": 5503 }, { "entropy": 1.1894906759262085, "epoch": 2.8983675618746707, "grad_norm": 0.28704389929771423, "learning_rate": 0.00013892695629435454, "loss": 0.19675171375274658, "mean_token_accuracy": 0.9200365841388702, "num_tokens": 67895288.0, "step": 5504 }, { "entropy": 1.160377025604248, "epoch": 2.8988941548183256, "grad_norm": 0.2784435451030731, "learning_rate": 0.0001389061906651777, "loss": 0.18051111698150635, "mean_token_accuracy": 0.9258342087268829, "num_tokens": 67907624.0, "step": 5505 }, { "entropy": 1.1449159979820251, "epoch": 2.89942074776198, "grad_norm": 0.2636511027812958, "learning_rate": 0.00013888542332000882, "loss": 0.17140930891036987, "mean_token_accuracy": 0.9295295923948288, "num_tokens": 67919960.0, "step": 5506 }, { "entropy": 1.1670503914356232, "epoch": 2.8999473407056344, "grad_norm": 0.2751680612564087, "learning_rate": 0.00013886465426008067, "loss": 0.19141370058059692, "mean_token_accuracy": 0.9227615296840668, "num_tokens": 67932296.0, "step": 5507 }, { "entropy": 1.176351010799408, "epoch": 2.9004739336492893, "grad_norm": 0.2705549895763397, "learning_rate": 0.0001388438834866263, "loss": 0.19590432941913605, "mean_token_accuracy": 0.9217877984046936, "num_tokens": 67944632.0, "step": 5508 }, { "entropy": 1.1857755184173584, "epoch": 2.9010005265929437, "grad_norm": 0.2822164297103882, "learning_rate": 0.00013882311100087862, "loss": 0.20122680068016052, "mean_token_accuracy": 0.9154031872749329, "num_tokens": 67956968.0, "step": 5509 }, { "entropy": 1.1495457887649536, "epoch": 2.901527119536598, "grad_norm": 0.29185017943382263, "learning_rate": 0.00013880233680407087, "loss": 0.190867617726326, "mean_token_accuracy": 0.9220561236143112, "num_tokens": 67969304.0, "step": 5510 }, { "entropy": 1.106411337852478, "epoch": 2.902053712480253, "grad_norm": 0.24719662964344025, "learning_rate": 0.0001387815608974362, "loss": 0.1714990735054016, "mean_token_accuracy": 0.9271316230297089, "num_tokens": 67981640.0, "step": 5511 }, { "entropy": 1.1132754385471344, "epoch": 2.9025803054239074, "grad_norm": 0.2547193765640259, "learning_rate": 0.0001387607832822081, "loss": 0.1815553456544876, "mean_token_accuracy": 0.9266224503517151, "num_tokens": 67993976.0, "step": 5512 }, { "entropy": 1.1470238864421844, "epoch": 2.903106898367562, "grad_norm": 0.27963170409202576, "learning_rate": 0.00013874000395961987, "loss": 0.19604888558387756, "mean_token_accuracy": 0.9155842065811157, "num_tokens": 68006312.0, "step": 5513 }, { "entropy": 1.1404377818107605, "epoch": 2.9036334913112163, "grad_norm": 0.2531251013278961, "learning_rate": 0.0001387192229309051, "loss": 0.17346608638763428, "mean_token_accuracy": 0.9276323318481445, "num_tokens": 68018648.0, "step": 5514 }, { "entropy": 1.1547462940216064, "epoch": 2.9041600842548707, "grad_norm": 0.2719525396823883, "learning_rate": 0.0001386984401972975, "loss": 0.19307196140289307, "mean_token_accuracy": 0.9185868501663208, "num_tokens": 68030984.0, "step": 5515 }, { "entropy": 1.154180645942688, "epoch": 2.9046866771985256, "grad_norm": 0.28286588191986084, "learning_rate": 0.00013867765576003075, "loss": 0.19983167946338654, "mean_token_accuracy": 0.919625997543335, "num_tokens": 68043320.0, "step": 5516 }, { "entropy": 1.1318946182727814, "epoch": 2.90521327014218, "grad_norm": 0.2880934476852417, "learning_rate": 0.00013865686962033876, "loss": 0.2102263867855072, "mean_token_accuracy": 0.9138824343681335, "num_tokens": 68055656.0, "step": 5517 }, { "entropy": 1.17483389377594, "epoch": 2.9057398630858344, "grad_norm": 0.2941156029701233, "learning_rate": 0.0001386360817794554, "loss": 0.19800475239753723, "mean_token_accuracy": 0.9159929603338242, "num_tokens": 68067992.0, "step": 5518 }, { "entropy": 1.1367288827896118, "epoch": 2.9062664560294893, "grad_norm": 0.2663951516151428, "learning_rate": 0.00013861529223861476, "loss": 0.18763451278209686, "mean_token_accuracy": 0.9239258766174316, "num_tokens": 68080328.0, "step": 5519 }, { "entropy": 1.1588850617408752, "epoch": 2.9067930489731437, "grad_norm": 0.2822934091091156, "learning_rate": 0.00013859450099905102, "loss": 0.1937345266342163, "mean_token_accuracy": 0.9200102388858795, "num_tokens": 68092664.0, "step": 5520 }, { "entropy": 1.1312378942966461, "epoch": 2.907319641916798, "grad_norm": 0.29542550444602966, "learning_rate": 0.00013857370806199843, "loss": 0.22057875990867615, "mean_token_accuracy": 0.9083669930696487, "num_tokens": 68105000.0, "step": 5521 }, { "entropy": 1.1559078097343445, "epoch": 2.907846234860453, "grad_norm": 0.281016081571579, "learning_rate": 0.0001385529134286913, "loss": 0.20015105605125427, "mean_token_accuracy": 0.9185057580471039, "num_tokens": 68117336.0, "step": 5522 }, { "entropy": 1.1671436727046967, "epoch": 2.9083728278041074, "grad_norm": 0.27406924962997437, "learning_rate": 0.00013853211710036415, "loss": 0.19811135530471802, "mean_token_accuracy": 0.9185190796852112, "num_tokens": 68129672.0, "step": 5523 }, { "entropy": 1.1776782274246216, "epoch": 2.908899420747762, "grad_norm": 0.26774463057518005, "learning_rate": 0.00013851131907825152, "loss": 0.1784535050392151, "mean_token_accuracy": 0.9311188608407974, "num_tokens": 68142008.0, "step": 5524 }, { "entropy": 1.1597624719142914, "epoch": 2.9094260136914167, "grad_norm": 0.29032954573631287, "learning_rate": 0.000138490519363588, "loss": 0.1870250701904297, "mean_token_accuracy": 0.921985000371933, "num_tokens": 68154344.0, "step": 5525 }, { "entropy": 1.198120653629303, "epoch": 2.909952606635071, "grad_norm": 0.295183390378952, "learning_rate": 0.00013846971795760844, "loss": 0.1946275234222412, "mean_token_accuracy": 0.9213293045759201, "num_tokens": 68166680.0, "step": 5526 }, { "entropy": 1.1845296919345856, "epoch": 2.9104791995787256, "grad_norm": 0.2734968662261963, "learning_rate": 0.00013844891486154766, "loss": 0.19152450561523438, "mean_token_accuracy": 0.9245569109916687, "num_tokens": 68179016.0, "step": 5527 }, { "entropy": 1.1325328648090363, "epoch": 2.9110057925223805, "grad_norm": 0.2562635540962219, "learning_rate": 0.0001384281100766406, "loss": 0.15855859220027924, "mean_token_accuracy": 0.9361820667982101, "num_tokens": 68191352.0, "step": 5528 }, { "entropy": 1.1461539268493652, "epoch": 2.911532385466035, "grad_norm": 0.29077833890914917, "learning_rate": 0.00013840730360412234, "loss": 0.19791193306446075, "mean_token_accuracy": 0.9110380262136459, "num_tokens": 68203688.0, "step": 5529 }, { "entropy": 1.1295833885669708, "epoch": 2.9120589784096893, "grad_norm": 0.30538904666900635, "learning_rate": 0.00013838649544522803, "loss": 0.20151552557945251, "mean_token_accuracy": 0.9133839756250381, "num_tokens": 68216024.0, "step": 5530 }, { "entropy": 1.0852110385894775, "epoch": 2.9125855713533437, "grad_norm": 0.2697118818759918, "learning_rate": 0.00013836568560119297, "loss": 0.19141703844070435, "mean_token_accuracy": 0.920340895652771, "num_tokens": 68228360.0, "step": 5531 }, { "entropy": 1.0908479988574982, "epoch": 2.913112164296998, "grad_norm": 0.2654431462287903, "learning_rate": 0.00013834487407325246, "loss": 0.17703814804553986, "mean_token_accuracy": 0.928848385810852, "num_tokens": 68240696.0, "step": 5532 }, { "entropy": 1.102216750383377, "epoch": 2.913638757240653, "grad_norm": 0.2828739285469055, "learning_rate": 0.000138324060862642, "loss": 0.19559074938297272, "mean_token_accuracy": 0.9155698269605637, "num_tokens": 68253032.0, "step": 5533 }, { "entropy": 1.0754432678222656, "epoch": 2.9141653501843074, "grad_norm": 0.25650569796562195, "learning_rate": 0.00013830324597059707, "loss": 0.1764622926712036, "mean_token_accuracy": 0.9295746833086014, "num_tokens": 68265368.0, "step": 5534 }, { "entropy": 1.1392635107040405, "epoch": 2.914691943127962, "grad_norm": 0.28012871742248535, "learning_rate": 0.00013828242939835342, "loss": 0.18477457761764526, "mean_token_accuracy": 0.9233775585889816, "num_tokens": 68277704.0, "step": 5535 }, { "entropy": 1.0746980011463165, "epoch": 2.9152185360716167, "grad_norm": 0.2698800265789032, "learning_rate": 0.00013826161114714682, "loss": 0.17916232347488403, "mean_token_accuracy": 0.9196085929870605, "num_tokens": 68290040.0, "step": 5536 }, { "entropy": 1.0633073151111603, "epoch": 2.915745129015271, "grad_norm": 0.291299432516098, "learning_rate": 0.00013824079121821305, "loss": 0.20749138295650482, "mean_token_accuracy": 0.9145458191633224, "num_tokens": 68302376.0, "step": 5537 }, { "entropy": 1.0806976854801178, "epoch": 2.9162717219589256, "grad_norm": 0.2732320725917816, "learning_rate": 0.0001382199696127881, "loss": 0.16982217133045197, "mean_token_accuracy": 0.9300663471221924, "num_tokens": 68314712.0, "step": 5538 }, { "entropy": 1.1155247688293457, "epoch": 2.9167983149025805, "grad_norm": 0.2718318700790405, "learning_rate": 0.00013819914633210806, "loss": 0.1862022876739502, "mean_token_accuracy": 0.9197591245174408, "num_tokens": 68327048.0, "step": 5539 }, { "entropy": 1.0436288714408875, "epoch": 2.917324907846235, "grad_norm": 0.27272531390190125, "learning_rate": 0.00013817832137740904, "loss": 0.18183693289756775, "mean_token_accuracy": 0.9253615438938141, "num_tokens": 68339384.0, "step": 5540 }, { "entropy": 1.080330640077591, "epoch": 2.9178515007898893, "grad_norm": 0.26378878951072693, "learning_rate": 0.00013815749474992733, "loss": 0.18048113584518433, "mean_token_accuracy": 0.9251774549484253, "num_tokens": 68351720.0, "step": 5541 }, { "entropy": 1.0835255086421967, "epoch": 2.918378093733544, "grad_norm": 0.2663480043411255, "learning_rate": 0.00013813666645089926, "loss": 0.1744183599948883, "mean_token_accuracy": 0.9293684512376785, "num_tokens": 68364056.0, "step": 5542 }, { "entropy": 1.0906038284301758, "epoch": 2.9189046866771986, "grad_norm": 0.27525952458381653, "learning_rate": 0.0001381158364815613, "loss": 0.1827646642923355, "mean_token_accuracy": 0.9212264567613602, "num_tokens": 68376392.0, "step": 5543 }, { "entropy": 1.0514227747917175, "epoch": 2.919431279620853, "grad_norm": 0.26160329580307007, "learning_rate": 0.00013809500484314997, "loss": 0.17371343076229095, "mean_token_accuracy": 0.9279900044202805, "num_tokens": 68388728.0, "step": 5544 }, { "entropy": 1.0968440175056458, "epoch": 2.919957872564508, "grad_norm": 0.2624936103820801, "learning_rate": 0.000138074171536902, "loss": 0.17753034830093384, "mean_token_accuracy": 0.9319224506616592, "num_tokens": 68401064.0, "step": 5545 }, { "entropy": 1.1374029517173767, "epoch": 2.9204844655081623, "grad_norm": 0.32361873984336853, "learning_rate": 0.0001380533365640541, "loss": 0.22792309522628784, "mean_token_accuracy": 0.9060098677873611, "num_tokens": 68413400.0, "step": 5546 }, { "entropy": 1.12219899892807, "epoch": 2.9210110584518167, "grad_norm": 0.30003783106803894, "learning_rate": 0.00013803249992584308, "loss": 0.19746218621730804, "mean_token_accuracy": 0.9168110936880112, "num_tokens": 68425736.0, "step": 5547 }, { "entropy": 1.1274137794971466, "epoch": 2.921537651395471, "grad_norm": 0.29291093349456787, "learning_rate": 0.0001380116616235059, "loss": 0.19064177572727203, "mean_token_accuracy": 0.9205840528011322, "num_tokens": 68438072.0, "step": 5548 }, { "entropy": 1.0552725493907928, "epoch": 2.9220642443391256, "grad_norm": 0.275552898645401, "learning_rate": 0.0001379908216582797, "loss": 0.19442486763000488, "mean_token_accuracy": 0.9182971268892288, "num_tokens": 68450408.0, "step": 5549 }, { "entropy": 1.129012256860733, "epoch": 2.9225908372827805, "grad_norm": 0.28331005573272705, "learning_rate": 0.0001379699800314015, "loss": 0.1991719901561737, "mean_token_accuracy": 0.9190961122512817, "num_tokens": 68462744.0, "step": 5550 }, { "entropy": 1.1428042948246002, "epoch": 2.923117430226435, "grad_norm": 0.2907262146472931, "learning_rate": 0.00013794913674410866, "loss": 0.1955050528049469, "mean_token_accuracy": 0.9185226857662201, "num_tokens": 68475080.0, "step": 5551 }, { "entropy": 1.1355925500392914, "epoch": 2.9236440231700893, "grad_norm": 0.2629597783088684, "learning_rate": 0.00013792829179763843, "loss": 0.16810822486877441, "mean_token_accuracy": 0.9289321601390839, "num_tokens": 68487416.0, "step": 5552 }, { "entropy": 1.1617874205112457, "epoch": 2.924170616113744, "grad_norm": 0.27793678641319275, "learning_rate": 0.0001379074451932283, "loss": 0.19166631996631622, "mean_token_accuracy": 0.9207886010408401, "num_tokens": 68499752.0, "step": 5553 }, { "entropy": 1.1701002717018127, "epoch": 2.9246972090573986, "grad_norm": 0.2866170108318329, "learning_rate": 0.00013788659693211584, "loss": 0.19832077622413635, "mean_token_accuracy": 0.919544905424118, "num_tokens": 68512088.0, "step": 5554 }, { "entropy": 1.1990052163600922, "epoch": 2.925223802001053, "grad_norm": 0.30915117263793945, "learning_rate": 0.00013786574701553866, "loss": 0.2161540687084198, "mean_token_accuracy": 0.9073906093835831, "num_tokens": 68524424.0, "step": 5555 }, { "entropy": 1.2210666835308075, "epoch": 2.925750394944708, "grad_norm": 0.28099068999290466, "learning_rate": 0.00013784489544473445, "loss": 0.2011336386203766, "mean_token_accuracy": 0.9171841740608215, "num_tokens": 68536760.0, "step": 5556 }, { "entropy": 1.181823045015335, "epoch": 2.9262769878883623, "grad_norm": 0.2659522593021393, "learning_rate": 0.00013782404222094109, "loss": 0.17810407280921936, "mean_token_accuracy": 0.924164891242981, "num_tokens": 68549096.0, "step": 5557 }, { "entropy": 1.157679796218872, "epoch": 2.9268035808320167, "grad_norm": 0.27199587225914, "learning_rate": 0.00013780318734539653, "loss": 0.1843995898962021, "mean_token_accuracy": 0.9218865782022476, "num_tokens": 68561432.0, "step": 5558 }, { "entropy": 1.192594975233078, "epoch": 2.9273301737756716, "grad_norm": 0.2700129747390747, "learning_rate": 0.0001377823308193388, "loss": 0.18727098405361176, "mean_token_accuracy": 0.9208443760871887, "num_tokens": 68573768.0, "step": 5559 }, { "entropy": 1.1255095601081848, "epoch": 2.927856766719326, "grad_norm": 0.26654013991355896, "learning_rate": 0.000137761472644006, "loss": 0.1948063224554062, "mean_token_accuracy": 0.9209031462669373, "num_tokens": 68586104.0, "step": 5560 }, { "entropy": 1.2041710019111633, "epoch": 2.9283833596629805, "grad_norm": 0.27617987990379333, "learning_rate": 0.0001377406128206364, "loss": 0.2021069973707199, "mean_token_accuracy": 0.9189692735671997, "num_tokens": 68598440.0, "step": 5561 }, { "entropy": 1.1256828010082245, "epoch": 2.9289099526066353, "grad_norm": 0.2534157633781433, "learning_rate": 0.00013771975135046827, "loss": 0.17834888398647308, "mean_token_accuracy": 0.9273785054683685, "num_tokens": 68610776.0, "step": 5562 }, { "entropy": 1.1691264808177948, "epoch": 2.9294365455502898, "grad_norm": 0.30477964878082275, "learning_rate": 0.00013769888823474005, "loss": 0.20396670699119568, "mean_token_accuracy": 0.9175550490617752, "num_tokens": 68623112.0, "step": 5563 }, { "entropy": 1.1377472281455994, "epoch": 2.929963138493944, "grad_norm": 0.2771162986755371, "learning_rate": 0.0001376780234746903, "loss": 0.18264469504356384, "mean_token_accuracy": 0.922416552901268, "num_tokens": 68635448.0, "step": 5564 }, { "entropy": 1.1698735654354095, "epoch": 2.9304897314375986, "grad_norm": 0.30147019028663635, "learning_rate": 0.00013765715707155765, "loss": 0.1867901235818863, "mean_token_accuracy": 0.9241589903831482, "num_tokens": 68647784.0, "step": 5565 }, { "entropy": 1.166481763124466, "epoch": 2.931016324381253, "grad_norm": 0.2786411643028259, "learning_rate": 0.00013763628902658075, "loss": 0.17687778174877167, "mean_token_accuracy": 0.9243270307779312, "num_tokens": 68660120.0, "step": 5566 }, { "entropy": 1.1443816721439362, "epoch": 2.931542917324908, "grad_norm": 0.28672003746032715, "learning_rate": 0.00013761541934099845, "loss": 0.20579706132411957, "mean_token_accuracy": 0.9173473715782166, "num_tokens": 68672456.0, "step": 5567 }, { "entropy": 1.1425879895687103, "epoch": 2.9320695102685623, "grad_norm": 0.28145724534988403, "learning_rate": 0.00013759454801604966, "loss": 0.2017051726579666, "mean_token_accuracy": 0.915640190243721, "num_tokens": 68684792.0, "step": 5568 }, { "entropy": 1.2048570811748505, "epoch": 2.9325961032122168, "grad_norm": 0.3142516613006592, "learning_rate": 0.00013757367505297336, "loss": 0.20900258421897888, "mean_token_accuracy": 0.9165971428155899, "num_tokens": 68697128.0, "step": 5569 }, { "entropy": 1.1582045555114746, "epoch": 2.9331226961558716, "grad_norm": 0.2675777077674866, "learning_rate": 0.00013755280045300874, "loss": 0.18169574439525604, "mean_token_accuracy": 0.9225203096866608, "num_tokens": 68709464.0, "step": 5570 }, { "entropy": 1.1519646644592285, "epoch": 2.933649289099526, "grad_norm": 0.2735153138637543, "learning_rate": 0.00013753192421739493, "loss": 0.1958380937576294, "mean_token_accuracy": 0.9182684272527695, "num_tokens": 68721800.0, "step": 5571 }, { "entropy": 1.1638001501560211, "epoch": 2.9341758820431805, "grad_norm": 0.2899276316165924, "learning_rate": 0.0001375110463473712, "loss": 0.17327781021595, "mean_token_accuracy": 0.9242293983697891, "num_tokens": 68734136.0, "step": 5572 }, { "entropy": 1.2003310024738312, "epoch": 2.9347024749868353, "grad_norm": 0.2884262502193451, "learning_rate": 0.00013749016684417702, "loss": 0.18135476112365723, "mean_token_accuracy": 0.9279640018939972, "num_tokens": 68746472.0, "step": 5573 }, { "entropy": 1.1927189528942108, "epoch": 2.9352290679304898, "grad_norm": 0.28940659761428833, "learning_rate": 0.00013746928570905188, "loss": 0.18795032799243927, "mean_token_accuracy": 0.9253685474395752, "num_tokens": 68758808.0, "step": 5574 }, { "entropy": 1.1657047271728516, "epoch": 2.935755660874144, "grad_norm": 0.2832283079624176, "learning_rate": 0.00013744840294323537, "loss": 0.18321970105171204, "mean_token_accuracy": 0.9225218445062637, "num_tokens": 68771144.0, "step": 5575 }, { "entropy": 1.152781069278717, "epoch": 2.936282253817799, "grad_norm": 0.28583258390426636, "learning_rate": 0.00013742751854796712, "loss": 0.1874796450138092, "mean_token_accuracy": 0.922102153301239, "num_tokens": 68783480.0, "step": 5576 }, { "entropy": 1.2105313837528229, "epoch": 2.9368088467614535, "grad_norm": 0.27317848801612854, "learning_rate": 0.00013740663252448694, "loss": 0.18234558403491974, "mean_token_accuracy": 0.9219536781311035, "num_tokens": 68795816.0, "step": 5577 }, { "entropy": 1.2403792440891266, "epoch": 2.937335439705108, "grad_norm": 0.2711533010005951, "learning_rate": 0.00013738574487403475, "loss": 0.19365224242210388, "mean_token_accuracy": 0.9241596162319183, "num_tokens": 68808152.0, "step": 5578 }, { "entropy": 1.1860476732254028, "epoch": 2.9378620326487628, "grad_norm": 0.2992393970489502, "learning_rate": 0.00013736485559785047, "loss": 0.1919434666633606, "mean_token_accuracy": 0.9213222712278366, "num_tokens": 68820488.0, "step": 5579 }, { "entropy": 1.2470246851444244, "epoch": 2.938388625592417, "grad_norm": 0.287310391664505, "learning_rate": 0.00013734396469717425, "loss": 0.19495737552642822, "mean_token_accuracy": 0.9231348186731339, "num_tokens": 68832824.0, "step": 5580 }, { "entropy": 1.2436520159244537, "epoch": 2.9389152185360716, "grad_norm": 0.3332797586917877, "learning_rate": 0.00013732307217324623, "loss": 0.19875866174697876, "mean_token_accuracy": 0.9161509722471237, "num_tokens": 68845160.0, "step": 5581 }, { "entropy": 1.2003789842128754, "epoch": 2.939441811479726, "grad_norm": 0.2667289972305298, "learning_rate": 0.00013730217802730664, "loss": 0.16958105564117432, "mean_token_accuracy": 0.9293218553066254, "num_tokens": 68857496.0, "step": 5582 }, { "entropy": 1.1950378119945526, "epoch": 2.9399684044233805, "grad_norm": 0.2579761743545532, "learning_rate": 0.00013728128226059584, "loss": 0.18693850934505463, "mean_token_accuracy": 0.9228319078683853, "num_tokens": 68869832.0, "step": 5583 }, { "entropy": 1.2720504403114319, "epoch": 2.9404949973670353, "grad_norm": 0.2997112572193146, "learning_rate": 0.00013726038487435436, "loss": 0.2124652862548828, "mean_token_accuracy": 0.9126077145338058, "num_tokens": 68882168.0, "step": 5584 }, { "entropy": 1.228448748588562, "epoch": 2.9410215903106898, "grad_norm": 0.2893296182155609, "learning_rate": 0.00013723948586982275, "loss": 0.2037881761789322, "mean_token_accuracy": 0.9126189202070236, "num_tokens": 68894504.0, "step": 5585 }, { "entropy": 1.1871382594108582, "epoch": 2.941548183254344, "grad_norm": 0.26550090312957764, "learning_rate": 0.00013721858524824157, "loss": 0.19779062271118164, "mean_token_accuracy": 0.9172335267066956, "num_tokens": 68906840.0, "step": 5586 }, { "entropy": 1.2471431493759155, "epoch": 2.942074776197999, "grad_norm": 0.29272446036338806, "learning_rate": 0.0001371976830108516, "loss": 0.19359451532363892, "mean_token_accuracy": 0.9180149137973785, "num_tokens": 68919176.0, "step": 5587 }, { "entropy": 1.2173875868320465, "epoch": 2.9426013691416535, "grad_norm": 0.29134252667427063, "learning_rate": 0.00013717677915889377, "loss": 0.2119414508342743, "mean_token_accuracy": 0.9115025997161865, "num_tokens": 68931512.0, "step": 5588 }, { "entropy": 1.2124152481555939, "epoch": 2.943127962085308, "grad_norm": 0.2665821313858032, "learning_rate": 0.00013715587369360894, "loss": 0.17928844690322876, "mean_token_accuracy": 0.9267236292362213, "num_tokens": 68943848.0, "step": 5589 }, { "entropy": 1.2175507247447968, "epoch": 2.943654555028963, "grad_norm": 0.28769803047180176, "learning_rate": 0.00013713496661623816, "loss": 0.19170348346233368, "mean_token_accuracy": 0.9222258031368256, "num_tokens": 68956184.0, "step": 5590 }, { "entropy": 1.2272031605243683, "epoch": 2.944181147972617, "grad_norm": 0.27572914958000183, "learning_rate": 0.00013711405792802257, "loss": 0.18151387572288513, "mean_token_accuracy": 0.9221614301204681, "num_tokens": 68968520.0, "step": 5591 }, { "entropy": 1.2204799950122833, "epoch": 2.9447077409162716, "grad_norm": 0.27613502740859985, "learning_rate": 0.0001370931476302034, "loss": 0.2014046609401703, "mean_token_accuracy": 0.9178587943315506, "num_tokens": 68980856.0, "step": 5592 }, { "entropy": 1.231167882680893, "epoch": 2.9452343338599265, "grad_norm": 0.2966768443584442, "learning_rate": 0.00013707223572402197, "loss": 0.21449437737464905, "mean_token_accuracy": 0.908181220293045, "num_tokens": 68993192.0, "step": 5593 }, { "entropy": 1.2601788640022278, "epoch": 2.945760926803581, "grad_norm": 0.28138867020606995, "learning_rate": 0.00013705132221071968, "loss": 0.17587848007678986, "mean_token_accuracy": 0.9247183203697205, "num_tokens": 69005528.0, "step": 5594 }, { "entropy": 1.1992701292037964, "epoch": 2.9462875197472354, "grad_norm": 0.2590610384941101, "learning_rate": 0.00013703040709153806, "loss": 0.1704290211200714, "mean_token_accuracy": 0.9288462251424789, "num_tokens": 69017864.0, "step": 5595 }, { "entropy": 1.2185679376125336, "epoch": 2.94681411269089, "grad_norm": 0.2668219208717346, "learning_rate": 0.00013700949036771874, "loss": 0.16232874989509583, "mean_token_accuracy": 0.9315534979104996, "num_tokens": 69030200.0, "step": 5596 }, { "entropy": 1.1763940453529358, "epoch": 2.9473407056345446, "grad_norm": 0.2598697245121002, "learning_rate": 0.00013698857204050334, "loss": 0.1769179254770279, "mean_token_accuracy": 0.9267005920410156, "num_tokens": 69042536.0, "step": 5597 }, { "entropy": 1.202961027622223, "epoch": 2.947867298578199, "grad_norm": 0.27415749430656433, "learning_rate": 0.00013696765211113375, "loss": 0.19501955807209015, "mean_token_accuracy": 0.9173151254653931, "num_tokens": 69054872.0, "step": 5598 }, { "entropy": 1.209532380104065, "epoch": 2.9483938915218535, "grad_norm": 0.2773316502571106, "learning_rate": 0.00013694673058085185, "loss": 0.17899590730667114, "mean_token_accuracy": 0.9237614125013351, "num_tokens": 69067208.0, "step": 5599 }, { "entropy": 1.1219777464866638, "epoch": 2.948920484465508, "grad_norm": 0.2790414094924927, "learning_rate": 0.00013692580745089963, "loss": 0.19162613153457642, "mean_token_accuracy": 0.9177257567644119, "num_tokens": 69079544.0, "step": 5600 }, { "entropy": 1.118897259235382, "epoch": 2.949447077409163, "grad_norm": 0.2677527666091919, "learning_rate": 0.0001369048827225191, "loss": 0.18540120124816895, "mean_token_accuracy": 0.9220905154943466, "num_tokens": 69091880.0, "step": 5601 }, { "entropy": 1.1859447062015533, "epoch": 2.949973670352817, "grad_norm": 0.3110491931438446, "learning_rate": 0.00013688395639695252, "loss": 0.1812945008277893, "mean_token_accuracy": 0.92556431889534, "num_tokens": 69104216.0, "step": 5602 }, { "entropy": 1.178531676530838, "epoch": 2.9505002632964716, "grad_norm": 0.3070037066936493, "learning_rate": 0.00013686302847544217, "loss": 0.19497287273406982, "mean_token_accuracy": 0.9196391552686691, "num_tokens": 69116552.0, "step": 5603 }, { "entropy": 1.191015750169754, "epoch": 2.9510268562401265, "grad_norm": 0.2829379141330719, "learning_rate": 0.00013684209895923038, "loss": 0.1905146837234497, "mean_token_accuracy": 0.9247777760028839, "num_tokens": 69128888.0, "step": 5604 }, { "entropy": 1.1308483183383942, "epoch": 2.951553449183781, "grad_norm": 0.27800098061561584, "learning_rate": 0.0001368211678495596, "loss": 0.17672711610794067, "mean_token_accuracy": 0.9262357801198959, "num_tokens": 69141224.0, "step": 5605 }, { "entropy": 1.0918956398963928, "epoch": 2.9520800421274354, "grad_norm": 0.25561094284057617, "learning_rate": 0.00013680023514767243, "loss": 0.17155037820339203, "mean_token_accuracy": 0.9289103746414185, "num_tokens": 69153560.0, "step": 5606 }, { "entropy": 1.1246024668216705, "epoch": 2.9526066350710902, "grad_norm": 0.27591127157211304, "learning_rate": 0.00013677930085481148, "loss": 0.18423430621623993, "mean_token_accuracy": 0.9247561097145081, "num_tokens": 69165896.0, "step": 5607 }, { "entropy": 1.1606371998786926, "epoch": 2.9531332280147446, "grad_norm": 0.291604220867157, "learning_rate": 0.00013675836497221953, "loss": 0.19698481261730194, "mean_token_accuracy": 0.9247680753469467, "num_tokens": 69178232.0, "step": 5608 }, { "entropy": 1.1188312768936157, "epoch": 2.953659820958399, "grad_norm": 0.27514177560806274, "learning_rate": 0.00013673742750113942, "loss": 0.18783308565616608, "mean_token_accuracy": 0.9232326596975327, "num_tokens": 69190568.0, "step": 5609 }, { "entropy": 1.1653947532176971, "epoch": 2.954186413902054, "grad_norm": 0.31085118651390076, "learning_rate": 0.00013671648844281408, "loss": 0.2055719643831253, "mean_token_accuracy": 0.917727917432785, "num_tokens": 69202904.0, "step": 5610 }, { "entropy": 1.1252780854701996, "epoch": 2.9547130068457084, "grad_norm": 0.3070995807647705, "learning_rate": 0.00013669554779848652, "loss": 0.19462232291698456, "mean_token_accuracy": 0.9197984337806702, "num_tokens": 69215240.0, "step": 5611 }, { "entropy": 1.1574952900409698, "epoch": 2.955239599789363, "grad_norm": 0.3188292384147644, "learning_rate": 0.0001366746055693999, "loss": 0.19384144246578217, "mean_token_accuracy": 0.9179680198431015, "num_tokens": 69227576.0, "step": 5612 }, { "entropy": 1.1276047825813293, "epoch": 2.955766192733017, "grad_norm": 0.28531914949417114, "learning_rate": 0.0001366536617567974, "loss": 0.19046741724014282, "mean_token_accuracy": 0.9173817783594131, "num_tokens": 69239912.0, "step": 5613 }, { "entropy": 1.0744889974594116, "epoch": 2.956292785676672, "grad_norm": 0.3078976571559906, "learning_rate": 0.00013663271636192234, "loss": 0.1820499300956726, "mean_token_accuracy": 0.9228551387786865, "num_tokens": 69252248.0, "step": 5614 }, { "entropy": 1.070107638835907, "epoch": 2.9568193786203265, "grad_norm": 0.2992478311061859, "learning_rate": 0.00013661176938601816, "loss": 0.19892115890979767, "mean_token_accuracy": 0.9189724177122116, "num_tokens": 69264584.0, "step": 5615 }, { "entropy": 1.1251972019672394, "epoch": 2.957345971563981, "grad_norm": 0.2962946891784668, "learning_rate": 0.00013659082083032831, "loss": 0.19916094839572906, "mean_token_accuracy": 0.9157926440238953, "num_tokens": 69276920.0, "step": 5616 }, { "entropy": 1.098711758852005, "epoch": 2.9578725645076354, "grad_norm": 0.30655038356781006, "learning_rate": 0.00013656987069609645, "loss": 0.18999090790748596, "mean_token_accuracy": 0.9222403913736343, "num_tokens": 69289256.0, "step": 5617 }, { "entropy": 1.1321788430213928, "epoch": 2.9583991574512902, "grad_norm": 0.25325635075569153, "learning_rate": 0.0001365489189845662, "loss": 0.15657661855220795, "mean_token_accuracy": 0.937756285071373, "num_tokens": 69301592.0, "step": 5618 }, { "entropy": 1.1218098402023315, "epoch": 2.9589257503949447, "grad_norm": 0.2875848412513733, "learning_rate": 0.0001365279656969814, "loss": 0.19016146659851074, "mean_token_accuracy": 0.9236724972724915, "num_tokens": 69313928.0, "step": 5619 }, { "entropy": 1.1002118289470673, "epoch": 2.959452343338599, "grad_norm": 0.23385827243328094, "learning_rate": 0.00013650701083458585, "loss": 0.16082242131233215, "mean_token_accuracy": 0.9308483749628067, "num_tokens": 69326264.0, "step": 5620 }, { "entropy": 1.1413602828979492, "epoch": 2.959978936282254, "grad_norm": 0.2711458206176758, "learning_rate": 0.0001364860543986236, "loss": 0.1713000237941742, "mean_token_accuracy": 0.9290253072977066, "num_tokens": 69338600.0, "step": 5621 }, { "entropy": 1.1146959960460663, "epoch": 2.9605055292259084, "grad_norm": 0.269614577293396, "learning_rate": 0.00013646509639033864, "loss": 0.19589899480342865, "mean_token_accuracy": 0.9199978858232498, "num_tokens": 69350936.0, "step": 5622 }, { "entropy": 1.1638236343860626, "epoch": 2.961032122169563, "grad_norm": 0.2893790304660797, "learning_rate": 0.00013644413681097517, "loss": 0.18870526552200317, "mean_token_accuracy": 0.9185014367103577, "num_tokens": 69363272.0, "step": 5623 }, { "entropy": 1.1203119456768036, "epoch": 2.9615587151132177, "grad_norm": 0.27260667085647583, "learning_rate": 0.00013642317566177746, "loss": 0.18144097924232483, "mean_token_accuracy": 0.9256602972745895, "num_tokens": 69375608.0, "step": 5624 }, { "entropy": 1.1110114455223083, "epoch": 2.962085308056872, "grad_norm": 0.27438077330589294, "learning_rate": 0.00013640221294398977, "loss": 0.1718054860830307, "mean_token_accuracy": 0.9250148683786392, "num_tokens": 69387944.0, "step": 5625 }, { "entropy": 1.1150699257850647, "epoch": 2.9626119010005265, "grad_norm": 0.2791772186756134, "learning_rate": 0.0001363812486588566, "loss": 0.193474680185318, "mean_token_accuracy": 0.9222072809934616, "num_tokens": 69400280.0, "step": 5626 }, { "entropy": 1.1526327729225159, "epoch": 2.9631384939441814, "grad_norm": 0.29484543204307556, "learning_rate": 0.00013636028280762243, "loss": 0.18960119783878326, "mean_token_accuracy": 0.922269880771637, "num_tokens": 69412616.0, "step": 5627 }, { "entropy": 1.1298829913139343, "epoch": 2.963665086887836, "grad_norm": 0.3016878664493561, "learning_rate": 0.00013633931539153195, "loss": 0.20321956276893616, "mean_token_accuracy": 0.9152559489011765, "num_tokens": 69424952.0, "step": 5628 }, { "entropy": 1.1410238444805145, "epoch": 2.9641916798314902, "grad_norm": 0.28455066680908203, "learning_rate": 0.00013631834641182982, "loss": 0.18510159850120544, "mean_token_accuracy": 0.9224362522363663, "num_tokens": 69437288.0, "step": 5629 }, { "entropy": 1.1718485355377197, "epoch": 2.9647182727751447, "grad_norm": 0.2834126055240631, "learning_rate": 0.00013629737586976087, "loss": 0.1816817671060562, "mean_token_accuracy": 0.9258575141429901, "num_tokens": 69449624.0, "step": 5630 }, { "entropy": 1.172424703836441, "epoch": 2.9652448657187995, "grad_norm": 0.3318967819213867, "learning_rate": 0.00013627640376656996, "loss": 0.20343869924545288, "mean_token_accuracy": 0.918372318148613, "num_tokens": 69461960.0, "step": 5631 }, { "entropy": 1.1813274025917053, "epoch": 2.965771458662454, "grad_norm": 0.3032076060771942, "learning_rate": 0.0001362554301035021, "loss": 0.18673169612884521, "mean_token_accuracy": 0.9254914075136185, "num_tokens": 69474296.0, "step": 5632 }, { "entropy": 1.17621248960495, "epoch": 2.9662980516061084, "grad_norm": 0.2967461347579956, "learning_rate": 0.00013623445488180242, "loss": 0.20186461508274078, "mean_token_accuracy": 0.9179050922393799, "num_tokens": 69486632.0, "step": 5633 }, { "entropy": 1.1494372189044952, "epoch": 2.966824644549763, "grad_norm": 0.2860412299633026, "learning_rate": 0.00013621347810271605, "loss": 0.18691250681877136, "mean_token_accuracy": 0.9263933897018433, "num_tokens": 69498968.0, "step": 5634 }, { "entropy": 1.218750774860382, "epoch": 2.9673512374934177, "grad_norm": 0.2923490107059479, "learning_rate": 0.00013619249976748826, "loss": 0.18676425516605377, "mean_token_accuracy": 0.9209718555212021, "num_tokens": 69511304.0, "step": 5635 }, { "entropy": 1.1901514530181885, "epoch": 2.967877830437072, "grad_norm": 0.28049829602241516, "learning_rate": 0.00013617151987736442, "loss": 0.18535064160823822, "mean_token_accuracy": 0.9233685433864594, "num_tokens": 69523640.0, "step": 5636 }, { "entropy": 1.2013523578643799, "epoch": 2.9684044233807265, "grad_norm": 0.28062236309051514, "learning_rate": 0.00013615053843358998, "loss": 0.17983686923980713, "mean_token_accuracy": 0.9255612045526505, "num_tokens": 69535976.0, "step": 5637 }, { "entropy": 1.1624835133552551, "epoch": 2.9689310163243814, "grad_norm": 0.2737025320529938, "learning_rate": 0.0001361295554374105, "loss": 0.18844152987003326, "mean_token_accuracy": 0.9273969531059265, "num_tokens": 69548312.0, "step": 5638 }, { "entropy": 1.1991266310214996, "epoch": 2.969457609268036, "grad_norm": 0.2777165174484253, "learning_rate": 0.00013610857089007162, "loss": 0.19535896182060242, "mean_token_accuracy": 0.9200830161571503, "num_tokens": 69560648.0, "step": 5639 }, { "entropy": 1.144371896982193, "epoch": 2.9699842022116902, "grad_norm": 0.2615988850593567, "learning_rate": 0.00013608758479281903, "loss": 0.1780557632446289, "mean_token_accuracy": 0.9246671944856644, "num_tokens": 69572984.0, "step": 5640 }, { "entropy": 1.1618445813655853, "epoch": 2.970510795155345, "grad_norm": 0.2715195417404175, "learning_rate": 0.0001360665971468986, "loss": 0.19814664125442505, "mean_token_accuracy": 0.9190391451120377, "num_tokens": 69585320.0, "step": 5641 }, { "entropy": 1.1613898575305939, "epoch": 2.9710373880989995, "grad_norm": 0.2754245400428772, "learning_rate": 0.00013604560795355623, "loss": 0.1853109747171402, "mean_token_accuracy": 0.921645313501358, "num_tokens": 69597656.0, "step": 5642 }, { "entropy": 1.1355976164340973, "epoch": 2.971563981042654, "grad_norm": 0.257498562335968, "learning_rate": 0.0001360246172140379, "loss": 0.17994259297847748, "mean_token_accuracy": 0.9238065183162689, "num_tokens": 69609992.0, "step": 5643 }, { "entropy": 1.112012267112732, "epoch": 2.972090573986309, "grad_norm": 0.252828985452652, "learning_rate": 0.00013600362492958976, "loss": 0.18598134815692902, "mean_token_accuracy": 0.9217955470085144, "num_tokens": 69622328.0, "step": 5644 }, { "entropy": 1.126198172569275, "epoch": 2.9726171669299633, "grad_norm": 0.26551613211631775, "learning_rate": 0.00013598263110145792, "loss": 0.19965651631355286, "mean_token_accuracy": 0.9193202555179596, "num_tokens": 69634664.0, "step": 5645 }, { "entropy": 1.1668301224708557, "epoch": 2.9731437598736177, "grad_norm": 0.28958189487457275, "learning_rate": 0.00013596163573088876, "loss": 0.18356260657310486, "mean_token_accuracy": 0.9249053448438644, "num_tokens": 69647000.0, "step": 5646 }, { "entropy": 1.1143859326839447, "epoch": 2.973670352817272, "grad_norm": 0.3172629177570343, "learning_rate": 0.00013594063881912854, "loss": 0.1905253529548645, "mean_token_accuracy": 0.921536773443222, "num_tokens": 69659336.0, "step": 5647 }, { "entropy": 1.094642162322998, "epoch": 2.974196945760927, "grad_norm": 0.2848716974258423, "learning_rate": 0.00013591964036742385, "loss": 0.19140908122062683, "mean_token_accuracy": 0.9186394363641739, "num_tokens": 69671672.0, "step": 5648 }, { "entropy": 1.1297516524791718, "epoch": 2.9747235387045814, "grad_norm": 0.2905782461166382, "learning_rate": 0.00013589864037702118, "loss": 0.19544151425361633, "mean_token_accuracy": 0.9194969236850739, "num_tokens": 69684008.0, "step": 5649 }, { "entropy": 1.0739370584487915, "epoch": 2.975250131648236, "grad_norm": 0.2813047766685486, "learning_rate": 0.00013587763884916716, "loss": 0.18597646057605743, "mean_token_accuracy": 0.9232052862644196, "num_tokens": 69696344.0, "step": 5650 }, { "entropy": 1.1179830431938171, "epoch": 2.9757767245918902, "grad_norm": 0.2737787365913391, "learning_rate": 0.00013585663578510852, "loss": 0.17890819907188416, "mean_token_accuracy": 0.928794801235199, "num_tokens": 69708680.0, "step": 5651 }, { "entropy": 1.0576025247573853, "epoch": 2.976303317535545, "grad_norm": 0.29176604747772217, "learning_rate": 0.00013583563118609217, "loss": 0.20427364110946655, "mean_token_accuracy": 0.9133568853139877, "num_tokens": 69721016.0, "step": 5652 }, { "entropy": 1.0724064707756042, "epoch": 2.9768299104791995, "grad_norm": 0.29897189140319824, "learning_rate": 0.00013581462505336494, "loss": 0.19813014566898346, "mean_token_accuracy": 0.9181051701307297, "num_tokens": 69733352.0, "step": 5653 }, { "entropy": 1.0667171627283096, "epoch": 2.977356503422854, "grad_norm": 0.2759121060371399, "learning_rate": 0.00013579361738817392, "loss": 0.18483181297779083, "mean_token_accuracy": 0.9265222549438477, "num_tokens": 69745688.0, "step": 5654 }, { "entropy": 1.0673297494649887, "epoch": 2.977883096366509, "grad_norm": 0.2818041443824768, "learning_rate": 0.00013577260819176614, "loss": 0.1941726803779602, "mean_token_accuracy": 0.9198822677135468, "num_tokens": 69758024.0, "step": 5655 }, { "entropy": 1.1064940094947815, "epoch": 2.9784096893101633, "grad_norm": 0.274727463722229, "learning_rate": 0.0001357515974653888, "loss": 0.1813822090625763, "mean_token_accuracy": 0.9252461194992065, "num_tokens": 69770360.0, "step": 5656 }, { "entropy": 1.063794195652008, "epoch": 2.9789362822538177, "grad_norm": 0.26077696681022644, "learning_rate": 0.00013573058521028925, "loss": 0.18046130239963531, "mean_token_accuracy": 0.9256167858839035, "num_tokens": 69782696.0, "step": 5657 }, { "entropy": 1.0971498489379883, "epoch": 2.9794628751974725, "grad_norm": 0.2734004259109497, "learning_rate": 0.00013570957142771482, "loss": 0.17433691024780273, "mean_token_accuracy": 0.9247601628303528, "num_tokens": 69795032.0, "step": 5658 }, { "entropy": 1.0478947162628174, "epoch": 2.979989468141127, "grad_norm": 0.25824877619743347, "learning_rate": 0.00013568855611891298, "loss": 0.17879095673561096, "mean_token_accuracy": 0.9230777621269226, "num_tokens": 69807368.0, "step": 5659 }, { "entropy": 1.059202879667282, "epoch": 2.9805160610847814, "grad_norm": 0.2494882196187973, "learning_rate": 0.00013566753928513127, "loss": 0.17027448117733002, "mean_token_accuracy": 0.9276464134454727, "num_tokens": 69819704.0, "step": 5660 }, { "entropy": 1.0435924679040909, "epoch": 2.9810426540284363, "grad_norm": 0.2691742777824402, "learning_rate": 0.00013564652092761738, "loss": 0.18695388734340668, "mean_token_accuracy": 0.9181651771068573, "num_tokens": 69832040.0, "step": 5661 }, { "entropy": 1.0967499911785126, "epoch": 2.9815692469720907, "grad_norm": 0.28094589710235596, "learning_rate": 0.000135625501047619, "loss": 0.1988556832075119, "mean_token_accuracy": 0.9151445478200912, "num_tokens": 69844376.0, "step": 5662 }, { "entropy": 1.0836659967899323, "epoch": 2.982095839915745, "grad_norm": 0.27233564853668213, "learning_rate": 0.000135604479646384, "loss": 0.19193214178085327, "mean_token_accuracy": 0.9200305938720703, "num_tokens": 69856712.0, "step": 5663 }, { "entropy": 1.1166917979717255, "epoch": 2.9826224328593995, "grad_norm": 0.27832654118537903, "learning_rate": 0.00013558345672516026, "loss": 0.1840783655643463, "mean_token_accuracy": 0.9224764257669449, "num_tokens": 69869048.0, "step": 5664 }, { "entropy": 1.071811318397522, "epoch": 2.983149025803054, "grad_norm": 0.27846652269363403, "learning_rate": 0.00013556243228519583, "loss": 0.18135033547878265, "mean_token_accuracy": 0.9215449392795563, "num_tokens": 69881384.0, "step": 5665 }, { "entropy": 1.0782484710216522, "epoch": 2.983675618746709, "grad_norm": 0.28974413871765137, "learning_rate": 0.00013554140632773874, "loss": 0.2007175236940384, "mean_token_accuracy": 0.9168247580528259, "num_tokens": 69893720.0, "step": 5666 }, { "entropy": 1.1107634007930756, "epoch": 2.9842022116903633, "grad_norm": 0.283978670835495, "learning_rate": 0.00013552037885403728, "loss": 0.17787045240402222, "mean_token_accuracy": 0.9235873967409134, "num_tokens": 69906056.0, "step": 5667 }, { "entropy": 1.107334554195404, "epoch": 2.9847288046340177, "grad_norm": 0.2613908648490906, "learning_rate": 0.00013549934986533966, "loss": 0.17772354185581207, "mean_token_accuracy": 0.9233258366584778, "num_tokens": 69918392.0, "step": 5668 }, { "entropy": 1.0990718305110931, "epoch": 2.9852553975776726, "grad_norm": 0.2806550860404968, "learning_rate": 0.00013547831936289422, "loss": 0.20128649473190308, "mean_token_accuracy": 0.9159611463546753, "num_tokens": 69930728.0, "step": 5669 }, { "entropy": 1.0974575281143188, "epoch": 2.985781990521327, "grad_norm": 0.2574922740459442, "learning_rate": 0.00013545728734794949, "loss": 0.1948179453611374, "mean_token_accuracy": 0.9183401465415955, "num_tokens": 69943064.0, "step": 5670 }, { "entropy": 1.1051023602485657, "epoch": 2.9863085834649814, "grad_norm": 0.27157384157180786, "learning_rate": 0.00013543625382175396, "loss": 0.18090611696243286, "mean_token_accuracy": 0.9248793721199036, "num_tokens": 69955400.0, "step": 5671 }, { "entropy": 1.0544289648532867, "epoch": 2.9868351764086363, "grad_norm": 0.271531879901886, "learning_rate": 0.00013541521878555633, "loss": 0.18519523739814758, "mean_token_accuracy": 0.9253270477056503, "num_tokens": 69967736.0, "step": 5672 }, { "entropy": 1.038584515452385, "epoch": 2.9873617693522907, "grad_norm": 0.26272615790367126, "learning_rate": 0.00013539418224060528, "loss": 0.18200033903121948, "mean_token_accuracy": 0.9267624914646149, "num_tokens": 69980072.0, "step": 5673 }, { "entropy": 1.1364141404628754, "epoch": 2.987888362295945, "grad_norm": 0.29418516159057617, "learning_rate": 0.0001353731441881496, "loss": 0.1954139918088913, "mean_token_accuracy": 0.9196117371320724, "num_tokens": 69992408.0, "step": 5674 }, { "entropy": 1.0358662456274033, "epoch": 2.9884149552396, "grad_norm": 0.24295592308044434, "learning_rate": 0.0001353521046294383, "loss": 0.17815330624580383, "mean_token_accuracy": 0.9219689667224884, "num_tokens": 70004744.0, "step": 5675 }, { "entropy": 1.0438331812620163, "epoch": 2.9889415481832544, "grad_norm": 0.27891722321510315, "learning_rate": 0.00013533106356572024, "loss": 0.20683948695659637, "mean_token_accuracy": 0.9159213751554489, "num_tokens": 70017080.0, "step": 5676 }, { "entropy": 1.0625006258487701, "epoch": 2.989468141126909, "grad_norm": 0.2645440995693207, "learning_rate": 0.00013531002099824465, "loss": 0.19023014605045319, "mean_token_accuracy": 0.9216374158859253, "num_tokens": 70029416.0, "step": 5677 }, { "entropy": 1.0237343311309814, "epoch": 2.9899947340705637, "grad_norm": 0.29645782709121704, "learning_rate": 0.0001352889769282606, "loss": 0.19946202635765076, "mean_token_accuracy": 0.9190236330032349, "num_tokens": 70041752.0, "step": 5678 }, { "entropy": 0.9966332167387009, "epoch": 2.990521327014218, "grad_norm": 0.27027246356010437, "learning_rate": 0.0001352679313570174, "loss": 0.1885770857334137, "mean_token_accuracy": 0.9219847321510315, "num_tokens": 70054088.0, "step": 5679 }, { "entropy": 1.020631194114685, "epoch": 2.9910479199578726, "grad_norm": 0.2740084230899811, "learning_rate": 0.00013524688428576435, "loss": 0.17383310198783875, "mean_token_accuracy": 0.9266319870948792, "num_tokens": 70066424.0, "step": 5680 }, { "entropy": 0.9709053188562393, "epoch": 2.991574512901527, "grad_norm": 0.25379857420921326, "learning_rate": 0.00013522583571575094, "loss": 0.17841334640979767, "mean_token_accuracy": 0.9239553660154343, "num_tokens": 70078760.0, "step": 5681 }, { "entropy": 1.0074795484542847, "epoch": 2.9921011058451814, "grad_norm": 0.30197978019714355, "learning_rate": 0.0001352047856482267, "loss": 0.2074137181043625, "mean_token_accuracy": 0.9108300656080246, "num_tokens": 70091096.0, "step": 5682 }, { "entropy": 1.0503327548503876, "epoch": 2.9926276987888363, "grad_norm": 0.3334502875804901, "learning_rate": 0.00013518373408444127, "loss": 0.1890716552734375, "mean_token_accuracy": 0.9206590056419373, "num_tokens": 70103432.0, "step": 5683 }, { "entropy": 0.9906752109527588, "epoch": 2.9931542917324907, "grad_norm": 0.27631211280822754, "learning_rate": 0.00013516268102564428, "loss": 0.19861096143722534, "mean_token_accuracy": 0.9207852929830551, "num_tokens": 70115768.0, "step": 5684 }, { "entropy": 1.0107875168323517, "epoch": 2.993680884676145, "grad_norm": 0.2852430045604706, "learning_rate": 0.0001351416264730856, "loss": 0.19408808648586273, "mean_token_accuracy": 0.9197646528482437, "num_tokens": 70128104.0, "step": 5685 }, { "entropy": 1.0509508550167084, "epoch": 2.9942074776198, "grad_norm": 0.2755467891693115, "learning_rate": 0.0001351205704280151, "loss": 0.19173826277256012, "mean_token_accuracy": 0.9201934188604355, "num_tokens": 70140440.0, "step": 5686 }, { "entropy": 0.9853422343730927, "epoch": 2.9947340705634544, "grad_norm": 0.2897648811340332, "learning_rate": 0.00013509951289168273, "loss": 0.1806781142950058, "mean_token_accuracy": 0.9233992248773575, "num_tokens": 70152776.0, "step": 5687 }, { "entropy": 0.9925468116998672, "epoch": 2.995260663507109, "grad_norm": 0.2701224684715271, "learning_rate": 0.00013507845386533858, "loss": 0.19695024192333221, "mean_token_accuracy": 0.9201646447181702, "num_tokens": 70165112.0, "step": 5688 }, { "entropy": 1.03090438246727, "epoch": 2.9957872564507637, "grad_norm": 0.2682291865348816, "learning_rate": 0.0001350573933502328, "loss": 0.17822284996509552, "mean_token_accuracy": 0.9288727343082428, "num_tokens": 70177448.0, "step": 5689 }, { "entropy": 1.086290031671524, "epoch": 2.996313849394418, "grad_norm": 0.28797224164009094, "learning_rate": 0.00013503633134761563, "loss": 0.20880261063575745, "mean_token_accuracy": 0.9159017503261566, "num_tokens": 70189784.0, "step": 5690 }, { "entropy": 1.0291350483894348, "epoch": 2.9968404423380726, "grad_norm": 0.27310577034950256, "learning_rate": 0.00013501526785873738, "loss": 0.1941332072019577, "mean_token_accuracy": 0.9144625663757324, "num_tokens": 70202120.0, "step": 5691 }, { "entropy": 1.062148556113243, "epoch": 2.9973670352817274, "grad_norm": 0.2835206687450409, "learning_rate": 0.00013499420288484842, "loss": 0.187083899974823, "mean_token_accuracy": 0.9213053584098816, "num_tokens": 70214456.0, "step": 5692 }, { "entropy": 1.0626972317695618, "epoch": 2.997893628225382, "grad_norm": 0.29710713028907776, "learning_rate": 0.0001349731364271994, "loss": 0.19888778030872345, "mean_token_accuracy": 0.9213065057992935, "num_tokens": 70226792.0, "step": 5693 }, { "entropy": 1.0669539272785187, "epoch": 2.9984202211690363, "grad_norm": 0.29479360580444336, "learning_rate": 0.00013495206848704078, "loss": 0.1920504868030548, "mean_token_accuracy": 0.9204203486442566, "num_tokens": 70239128.0, "step": 5694 }, { "entropy": 1.116328477859497, "epoch": 2.998946814112691, "grad_norm": 0.2870364487171173, "learning_rate": 0.0001349309990656233, "loss": 0.18787749111652374, "mean_token_accuracy": 0.9229247868061066, "num_tokens": 70251464.0, "step": 5695 }, { "entropy": 1.0815511643886566, "epoch": 2.9994734070563456, "grad_norm": 0.28028604388237, "learning_rate": 0.00013490992816419769, "loss": 0.1949234902858734, "mean_token_accuracy": 0.9191743582487106, "num_tokens": 70263800.0, "step": 5696 }, { "entropy": 1.1147053837776184, "epoch": 3.0, "grad_norm": 0.28414386510849, "learning_rate": 0.00013488885578401486, "loss": 0.18812201917171478, "mean_token_accuracy": 0.9226029217243195, "num_tokens": 70275108.0, "step": 5697 }, { "epoch": 3.0, "eval_entropy": 1.1281561226578622, "eval_loss": 0.19836974143981934, "eval_mean_token_accuracy": 0.9189834011862816, "eval_num_tokens": 70275108.0, "eval_runtime": 665.1541, "eval_samples_per_second": 8.565, "eval_steps_per_second": 2.855, "step": 5697 } ], "logging_steps": 1, "max_steps": 13293, "num_input_tokens_seen": 0, "num_train_epochs": 7, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.903806818534307e+19, "train_batch_size": 3, "trial_name": null, "trial_params": null }