{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 1899, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.5241050124168396, "epoch": 0.000526592943654555, "grad_norm": 111.6484146118164, "learning_rate": 0.0, "loss": 7.630620002746582, "mean_token_accuracy": 0.16127368062734604, "num_tokens": 12336.0, "step": 1 }, { "entropy": 1.5055236518383026, "epoch": 0.00105318588730911, "grad_norm": 111.12712097167969, "learning_rate": 5.012531328320802e-07, "loss": 7.332417964935303, "mean_token_accuracy": 0.17185717076063156, "num_tokens": 24672.0, "step": 2 }, { "entropy": 1.5026952624320984, "epoch": 0.001579778830963665, "grad_norm": 112.11380767822266, "learning_rate": 1.0025062656641603e-06, "loss": 7.473679542541504, "mean_token_accuracy": 0.1643187664449215, "num_tokens": 37008.0, "step": 3 }, { "entropy": 1.5194158256053925, "epoch": 0.00210637177461822, "grad_norm": 114.23673248291016, "learning_rate": 1.5037593984962406e-06, "loss": 7.426502704620361, "mean_token_accuracy": 0.1571561936289072, "num_tokens": 49344.0, "step": 4 }, { "entropy": 1.496931940317154, "epoch": 0.0026329647182727752, "grad_norm": 118.40357208251953, "learning_rate": 2.0050125313283207e-06, "loss": 7.894323348999023, "mean_token_accuracy": 0.1548401154577732, "num_tokens": 61680.0, "step": 5 }, { "entropy": 1.5049863159656525, "epoch": 0.00315955766192733, "grad_norm": 104.21913146972656, "learning_rate": 2.506265664160401e-06, "loss": 6.593452453613281, "mean_token_accuracy": 0.20564104989171028, "num_tokens": 74016.0, "step": 6 }, { "entropy": 1.4925725162029266, "epoch": 0.003686150605581885, "grad_norm": 114.10234069824219, "learning_rate": 3.007518796992481e-06, "loss": 7.3693318367004395, "mean_token_accuracy": 0.16597539372742176, "num_tokens": 86352.0, "step": 7 }, { "entropy": 1.5191607773303986, "epoch": 0.00421274354923644, "grad_norm": 115.99723815917969, "learning_rate": 3.5087719298245615e-06, "loss": 7.358461856842041, "mean_token_accuracy": 0.16679511591792107, "num_tokens": 98688.0, "step": 8 }, { "entropy": 1.5183644592761993, "epoch": 0.004739336492890996, "grad_norm": 106.1409912109375, "learning_rate": 4.010025062656641e-06, "loss": 6.668917655944824, "mean_token_accuracy": 0.18950679898262024, "num_tokens": 111024.0, "step": 9 }, { "entropy": 1.5116282999515533, "epoch": 0.0052659294365455505, "grad_norm": 110.57721710205078, "learning_rate": 4.511278195488722e-06, "loss": 6.99241304397583, "mean_token_accuracy": 0.18210845813155174, "num_tokens": 123360.0, "step": 10 }, { "entropy": 1.5269342362880707, "epoch": 0.005792522380200105, "grad_norm": 120.43307495117188, "learning_rate": 5.012531328320802e-06, "loss": 7.586757659912109, "mean_token_accuracy": 0.1462114453315735, "num_tokens": 135696.0, "step": 11 }, { "entropy": 1.5252384543418884, "epoch": 0.00631911532385466, "grad_norm": 111.8587875366211, "learning_rate": 5.5137844611528826e-06, "loss": 7.363627910614014, "mean_token_accuracy": 0.17107644863426685, "num_tokens": 148032.0, "step": 12 }, { "entropy": 1.5224651992321014, "epoch": 0.006845708267509215, "grad_norm": 107.8873291015625, "learning_rate": 6.015037593984962e-06, "loss": 6.356827735900879, "mean_token_accuracy": 0.19671257957816124, "num_tokens": 160368.0, "step": 13 }, { "entropy": 1.5416274964809418, "epoch": 0.00737230121116377, "grad_norm": 115.19085693359375, "learning_rate": 6.516290726817042e-06, "loss": 6.221941947937012, "mean_token_accuracy": 0.2142542451620102, "num_tokens": 172704.0, "step": 14 }, { "entropy": 1.5107212960720062, "epoch": 0.007898894154818325, "grad_norm": 110.73648834228516, "learning_rate": 7.017543859649123e-06, "loss": 6.397078514099121, "mean_token_accuracy": 0.20885847136378288, "num_tokens": 185040.0, "step": 15 }, { "entropy": 1.5597798526287079, "epoch": 0.00842548709847288, "grad_norm": 99.72173309326172, "learning_rate": 7.518796992481203e-06, "loss": 5.646764278411865, "mean_token_accuracy": 0.24349310994148254, "num_tokens": 197376.0, "step": 16 }, { "entropy": 1.5534575581550598, "epoch": 0.008952080042127435, "grad_norm": 104.43334197998047, "learning_rate": 8.020050125313283e-06, "loss": 5.892775535583496, "mean_token_accuracy": 0.22073492035269737, "num_tokens": 209712.0, "step": 17 }, { "entropy": 1.5676631033420563, "epoch": 0.009478672985781991, "grad_norm": 99.27777099609375, "learning_rate": 8.521303258145363e-06, "loss": 5.239416599273682, "mean_token_accuracy": 0.26043422892689705, "num_tokens": 222048.0, "step": 18 }, { "entropy": 1.5712612569332123, "epoch": 0.010005265929436546, "grad_norm": 94.56501770019531, "learning_rate": 9.022556390977444e-06, "loss": 5.018033981323242, "mean_token_accuracy": 0.2874941825866699, "num_tokens": 234384.0, "step": 19 }, { "entropy": 1.5856993794441223, "epoch": 0.010531858873091101, "grad_norm": 103.30012512207031, "learning_rate": 9.523809523809523e-06, "loss": 5.112401485443115, "mean_token_accuracy": 0.26686083525419235, "num_tokens": 246720.0, "step": 20 }, { "entropy": 1.542406052350998, "epoch": 0.011058451816745656, "grad_norm": 73.81751251220703, "learning_rate": 1.0025062656641604e-05, "loss": 3.298715353012085, "mean_token_accuracy": 0.42641731351614, "num_tokens": 259056.0, "step": 21 }, { "entropy": 1.5376673340797424, "epoch": 0.01158504476040021, "grad_norm": 74.847900390625, "learning_rate": 1.0526315789473684e-05, "loss": 3.5809030532836914, "mean_token_accuracy": 0.40752222388982773, "num_tokens": 271392.0, "step": 22 }, { "entropy": 1.548084020614624, "epoch": 0.012111637704054766, "grad_norm": 63.552825927734375, "learning_rate": 1.1027568922305765e-05, "loss": 3.100147247314453, "mean_token_accuracy": 0.45311493426561356, "num_tokens": 283728.0, "step": 23 }, { "entropy": 1.5953525304794312, "epoch": 0.01263823064770932, "grad_norm": 60.015655517578125, "learning_rate": 1.1528822055137844e-05, "loss": 2.783557176589966, "mean_token_accuracy": 0.47465962916612625, "num_tokens": 296064.0, "step": 24 }, { "entropy": 1.5308564603328705, "epoch": 0.013164823591363875, "grad_norm": 40.24797821044922, "learning_rate": 1.2030075187969925e-05, "loss": 2.171975612640381, "mean_token_accuracy": 0.5734862834215164, "num_tokens": 308400.0, "step": 25 }, { "entropy": 1.5149377882480621, "epoch": 0.01369141653501843, "grad_norm": 31.702476501464844, "learning_rate": 1.2531328320802006e-05, "loss": 1.907788634300232, "mean_token_accuracy": 0.6134172528982162, "num_tokens": 320736.0, "step": 26 }, { "entropy": 1.4917882978916168, "epoch": 0.014218009478672985, "grad_norm": 20.41485023498535, "learning_rate": 1.3032581453634085e-05, "loss": 1.6917057037353516, "mean_token_accuracy": 0.6387842893600464, "num_tokens": 333072.0, "step": 27 }, { "entropy": 1.4882407486438751, "epoch": 0.01474460242232754, "grad_norm": 15.065500259399414, "learning_rate": 1.3533834586466165e-05, "loss": 1.4968407154083252, "mean_token_accuracy": 0.6677049100399017, "num_tokens": 345408.0, "step": 28 }, { "entropy": 1.4370096921920776, "epoch": 0.015271195365982097, "grad_norm": 10.740882873535156, "learning_rate": 1.4035087719298246e-05, "loss": 1.3545355796813965, "mean_token_accuracy": 0.698340117931366, "num_tokens": 357744.0, "step": 29 }, { "entropy": 1.341864824295044, "epoch": 0.01579778830963665, "grad_norm": 3.3069381713867188, "learning_rate": 1.4536340852130325e-05, "loss": 1.0850293636322021, "mean_token_accuracy": 0.7386660128831863, "num_tokens": 370080.0, "step": 30 }, { "entropy": 1.4095737040042877, "epoch": 0.016324381253291206, "grad_norm": 2.9421474933624268, "learning_rate": 1.5037593984962406e-05, "loss": 1.1328743696212769, "mean_token_accuracy": 0.7404871881008148, "num_tokens": 382416.0, "step": 31 }, { "entropy": 1.4024023413658142, "epoch": 0.01685097419694576, "grad_norm": 2.5040762424468994, "learning_rate": 1.5538847117794486e-05, "loss": 1.1228951215744019, "mean_token_accuracy": 0.7428316622972488, "num_tokens": 394752.0, "step": 32 }, { "entropy": 1.3549567759037018, "epoch": 0.017377567140600316, "grad_norm": 1.7973337173461914, "learning_rate": 1.6040100250626565e-05, "loss": 1.0077903270721436, "mean_token_accuracy": 0.766022652387619, "num_tokens": 407088.0, "step": 33 }, { "entropy": 1.3836270570755005, "epoch": 0.01790416008425487, "grad_norm": 1.7406286001205444, "learning_rate": 1.6541353383458648e-05, "loss": 1.0222362279891968, "mean_token_accuracy": 0.7626231610774994, "num_tokens": 419424.0, "step": 34 }, { "entropy": 1.3947510421276093, "epoch": 0.018430753027909426, "grad_norm": 1.8865187168121338, "learning_rate": 1.7042606516290727e-05, "loss": 1.0371894836425781, "mean_token_accuracy": 0.7562028616666794, "num_tokens": 431760.0, "step": 35 }, { "entropy": 1.3465319573879242, "epoch": 0.018957345971563982, "grad_norm": 1.7011761665344238, "learning_rate": 1.7543859649122806e-05, "loss": 0.9494946599006653, "mean_token_accuracy": 0.7783531844615936, "num_tokens": 444096.0, "step": 36 }, { "entropy": 1.4580606818199158, "epoch": 0.019483938915218536, "grad_norm": 1.9021601676940918, "learning_rate": 1.8045112781954888e-05, "loss": 1.0398352146148682, "mean_token_accuracy": 0.7636931091547012, "num_tokens": 456432.0, "step": 37 }, { "entropy": 1.4095810949802399, "epoch": 0.020010531858873092, "grad_norm": 1.6176142692565918, "learning_rate": 1.8546365914786967e-05, "loss": 0.9648343324661255, "mean_token_accuracy": 0.763045608997345, "num_tokens": 468768.0, "step": 38 }, { "entropy": 1.4290408492088318, "epoch": 0.020537124802527645, "grad_norm": 1.802105188369751, "learning_rate": 1.9047619047619046e-05, "loss": 0.9583951234817505, "mean_token_accuracy": 0.7706119865179062, "num_tokens": 481104.0, "step": 39 }, { "entropy": 1.4769366383552551, "epoch": 0.021063717746182202, "grad_norm": 1.8512225151062012, "learning_rate": 1.954887218045113e-05, "loss": 1.0114065408706665, "mean_token_accuracy": 0.7521056234836578, "num_tokens": 493440.0, "step": 40 }, { "entropy": 1.508185237646103, "epoch": 0.021590310689836755, "grad_norm": 2.076702356338501, "learning_rate": 2.0050125313283208e-05, "loss": 0.9636508226394653, "mean_token_accuracy": 0.7661653459072113, "num_tokens": 505776.0, "step": 41 }, { "entropy": 1.459254652261734, "epoch": 0.022116903633491312, "grad_norm": 2.349229335784912, "learning_rate": 2.0551378446115287e-05, "loss": 0.9206173419952393, "mean_token_accuracy": 0.7662864923477173, "num_tokens": 518112.0, "step": 42 }, { "entropy": 1.5238048434257507, "epoch": 0.022643496577145865, "grad_norm": 2.185512065887451, "learning_rate": 2.105263157894737e-05, "loss": 0.9314085245132446, "mean_token_accuracy": 0.7649829983711243, "num_tokens": 530448.0, "step": 43 }, { "entropy": 1.5003608763217926, "epoch": 0.02317008952080042, "grad_norm": 2.0811667442321777, "learning_rate": 2.1553884711779448e-05, "loss": 0.8671697974205017, "mean_token_accuracy": 0.7754391133785248, "num_tokens": 542784.0, "step": 44 }, { "entropy": 1.591546893119812, "epoch": 0.023696682464454975, "grad_norm": 2.0840373039245605, "learning_rate": 2.205513784461153e-05, "loss": 0.872833251953125, "mean_token_accuracy": 0.7740741670131683, "num_tokens": 555120.0, "step": 45 }, { "entropy": 1.6416102647781372, "epoch": 0.02422327540810953, "grad_norm": 2.033761501312256, "learning_rate": 2.255639097744361e-05, "loss": 0.8919705152511597, "mean_token_accuracy": 0.7629313617944717, "num_tokens": 567456.0, "step": 46 }, { "entropy": 1.6393465399742126, "epoch": 0.024749868351764088, "grad_norm": 1.7740504741668701, "learning_rate": 2.3057644110275688e-05, "loss": 0.8117689490318298, "mean_token_accuracy": 0.7816901206970215, "num_tokens": 579792.0, "step": 47 }, { "entropy": 1.6808819770812988, "epoch": 0.02527646129541864, "grad_norm": 1.4741381406784058, "learning_rate": 2.355889724310777e-05, "loss": 0.8110437393188477, "mean_token_accuracy": 0.7762878388166428, "num_tokens": 592128.0, "step": 48 }, { "entropy": 1.7813679873943329, "epoch": 0.025803054239073198, "grad_norm": 1.135923147201538, "learning_rate": 2.406015037593985e-05, "loss": 0.8597409129142761, "mean_token_accuracy": 0.7689527124166489, "num_tokens": 604464.0, "step": 49 }, { "entropy": 1.7125210165977478, "epoch": 0.02632964718272775, "grad_norm": 1.0037126541137695, "learning_rate": 2.456140350877193e-05, "loss": 0.7560303807258606, "mean_token_accuracy": 0.7888963371515274, "num_tokens": 616800.0, "step": 50 }, { "entropy": 1.7505145072937012, "epoch": 0.026856240126382307, "grad_norm": 0.9906253218650818, "learning_rate": 2.506265664160401e-05, "loss": 0.7666164636611938, "mean_token_accuracy": 0.7822892367839813, "num_tokens": 629136.0, "step": 51 }, { "entropy": 1.8206515610218048, "epoch": 0.02738283307003686, "grad_norm": 1.0637407302856445, "learning_rate": 2.556390977443609e-05, "loss": 0.7570075988769531, "mean_token_accuracy": 0.7857469767332077, "num_tokens": 641472.0, "step": 52 }, { "entropy": 1.9179592430591583, "epoch": 0.027909426013691417, "grad_norm": 0.994309663772583, "learning_rate": 2.606516290726817e-05, "loss": 0.8264732956886292, "mean_token_accuracy": 0.7659910470247269, "num_tokens": 653808.0, "step": 53 }, { "entropy": 1.8192859292030334, "epoch": 0.02843601895734597, "grad_norm": 1.283566951751709, "learning_rate": 2.656641604010025e-05, "loss": 0.7167642712593079, "mean_token_accuracy": 0.7935251444578171, "num_tokens": 666144.0, "step": 54 }, { "entropy": 1.8640032410621643, "epoch": 0.028962611901000527, "grad_norm": 0.993376612663269, "learning_rate": 2.706766917293233e-05, "loss": 0.732735276222229, "mean_token_accuracy": 0.7889553904533386, "num_tokens": 678480.0, "step": 55 }, { "entropy": 1.9309577941894531, "epoch": 0.02948920484465508, "grad_norm": 0.952996551990509, "learning_rate": 2.756892230576441e-05, "loss": 0.7183045148849487, "mean_token_accuracy": 0.7865996956825256, "num_tokens": 690816.0, "step": 56 }, { "entropy": 1.9969252347946167, "epoch": 0.030015797788309637, "grad_norm": 0.9141530990600586, "learning_rate": 2.8070175438596492e-05, "loss": 0.7127647399902344, "mean_token_accuracy": 0.7965414077043533, "num_tokens": 703152.0, "step": 57 }, { "entropy": 1.9162320494651794, "epoch": 0.030542390731964193, "grad_norm": 1.0311601161956787, "learning_rate": 2.857142857142857e-05, "loss": 0.6988133788108826, "mean_token_accuracy": 0.7964022308588028, "num_tokens": 715488.0, "step": 58 }, { "entropy": 1.9365825355052948, "epoch": 0.031068983675618746, "grad_norm": 0.8333176374435425, "learning_rate": 2.907268170426065e-05, "loss": 0.6844547986984253, "mean_token_accuracy": 0.8021096438169479, "num_tokens": 727824.0, "step": 59 }, { "entropy": 1.9246950447559357, "epoch": 0.0315955766192733, "grad_norm": 0.8664101362228394, "learning_rate": 2.9573934837092732e-05, "loss": 0.6528723239898682, "mean_token_accuracy": 0.8053467720746994, "num_tokens": 740160.0, "step": 60 }, { "entropy": 1.929794728755951, "epoch": 0.032122169562927856, "grad_norm": 0.9577063918113708, "learning_rate": 3.007518796992481e-05, "loss": 0.678918719291687, "mean_token_accuracy": 0.7989283800125122, "num_tokens": 752496.0, "step": 61 }, { "entropy": 1.826391577720642, "epoch": 0.03264876250658241, "grad_norm": 0.8492108583450317, "learning_rate": 3.0576441102756894e-05, "loss": 0.6723799109458923, "mean_token_accuracy": 0.7983379364013672, "num_tokens": 764832.0, "step": 62 }, { "entropy": 1.9241991639137268, "epoch": 0.03317535545023697, "grad_norm": 0.928464412689209, "learning_rate": 3.107769423558897e-05, "loss": 0.6530962586402893, "mean_token_accuracy": 0.8008216470479965, "num_tokens": 777168.0, "step": 63 }, { "entropy": 1.8967448770999908, "epoch": 0.03370194839389152, "grad_norm": 1.0670896768569946, "learning_rate": 3.157894736842105e-05, "loss": 0.6292267441749573, "mean_token_accuracy": 0.8003135621547699, "num_tokens": 789504.0, "step": 64 }, { "entropy": 1.8847980499267578, "epoch": 0.034228541337546076, "grad_norm": 1.0110414028167725, "learning_rate": 3.208020050125313e-05, "loss": 0.6133747100830078, "mean_token_accuracy": 0.8148374855518341, "num_tokens": 801840.0, "step": 65 }, { "entropy": 1.930319905281067, "epoch": 0.03475513428120063, "grad_norm": 1.023224949836731, "learning_rate": 3.258145363408521e-05, "loss": 0.6123053431510925, "mean_token_accuracy": 0.8167780637741089, "num_tokens": 814176.0, "step": 66 }, { "entropy": 1.9471323192119598, "epoch": 0.03528172722485519, "grad_norm": 1.1810884475708008, "learning_rate": 3.3082706766917295e-05, "loss": 0.6039740443229675, "mean_token_accuracy": 0.8179137706756592, "num_tokens": 826512.0, "step": 67 }, { "entropy": 1.8890258967876434, "epoch": 0.03580832016850974, "grad_norm": 0.9907887578010559, "learning_rate": 3.3583959899749374e-05, "loss": 0.599247932434082, "mean_token_accuracy": 0.8207112550735474, "num_tokens": 838848.0, "step": 68 }, { "entropy": 1.9326116144657135, "epoch": 0.036334913112164295, "grad_norm": 1.0037294626235962, "learning_rate": 3.4085213032581453e-05, "loss": 0.5630755424499512, "mean_token_accuracy": 0.8216072916984558, "num_tokens": 851184.0, "step": 69 }, { "entropy": 1.925311028957367, "epoch": 0.03686150605581885, "grad_norm": 1.1875734329223633, "learning_rate": 3.458646616541353e-05, "loss": 0.5733011364936829, "mean_token_accuracy": 0.8164849728345871, "num_tokens": 863520.0, "step": 70 }, { "entropy": 2.051402121782303, "epoch": 0.03738809899947341, "grad_norm": 1.162881851196289, "learning_rate": 3.508771929824561e-05, "loss": 0.550703763961792, "mean_token_accuracy": 0.8178133964538574, "num_tokens": 875856.0, "step": 71 }, { "entropy": 1.9634678363800049, "epoch": 0.037914691943127965, "grad_norm": 0.9865695834159851, "learning_rate": 3.55889724310777e-05, "loss": 0.5769374966621399, "mean_token_accuracy": 0.8114093840122223, "num_tokens": 888192.0, "step": 72 }, { "entropy": 1.9920983016490936, "epoch": 0.038441284886782515, "grad_norm": 1.0162739753723145, "learning_rate": 3.6090225563909776e-05, "loss": 0.5818509459495544, "mean_token_accuracy": 0.8134536445140839, "num_tokens": 900528.0, "step": 73 }, { "entropy": 1.9029254913330078, "epoch": 0.03896787783043707, "grad_norm": 0.9538004398345947, "learning_rate": 3.6591478696741855e-05, "loss": 0.5178959369659424, "mean_token_accuracy": 0.8257192969322205, "num_tokens": 912864.0, "step": 74 }, { "entropy": 1.967795580625534, "epoch": 0.03949447077409163, "grad_norm": 0.9578227996826172, "learning_rate": 3.7092731829573934e-05, "loss": 0.5342862010002136, "mean_token_accuracy": 0.8278465121984482, "num_tokens": 925200.0, "step": 75 }, { "entropy": 1.9465965926647186, "epoch": 0.040021063717746184, "grad_norm": 1.0253666639328003, "learning_rate": 3.759398496240601e-05, "loss": 0.5030800104141235, "mean_token_accuracy": 0.83804552257061, "num_tokens": 937536.0, "step": 76 }, { "entropy": 1.8636894226074219, "epoch": 0.040547656661400734, "grad_norm": 0.8184434771537781, "learning_rate": 3.809523809523809e-05, "loss": 0.45680901408195496, "mean_token_accuracy": 0.8485544174909592, "num_tokens": 949872.0, "step": 77 }, { "entropy": 1.928781270980835, "epoch": 0.04107424960505529, "grad_norm": 0.8536883592605591, "learning_rate": 3.859649122807018e-05, "loss": 0.4830615818500519, "mean_token_accuracy": 0.8397646248340607, "num_tokens": 962208.0, "step": 78 }, { "entropy": 1.8684503734111786, "epoch": 0.04160084254870985, "grad_norm": 0.868567168712616, "learning_rate": 3.909774436090226e-05, "loss": 0.49555566906929016, "mean_token_accuracy": 0.8393678069114685, "num_tokens": 974544.0, "step": 79 }, { "entropy": 1.832389086484909, "epoch": 0.042127435492364404, "grad_norm": 0.7834892868995667, "learning_rate": 3.9598997493734336e-05, "loss": 0.4530882239341736, "mean_token_accuracy": 0.8548341691493988, "num_tokens": 986880.0, "step": 80 }, { "entropy": 1.8249096870422363, "epoch": 0.04265402843601896, "grad_norm": 0.7752470374107361, "learning_rate": 4.0100250626566415e-05, "loss": 0.4578617215156555, "mean_token_accuracy": 0.8508521616458893, "num_tokens": 999216.0, "step": 81 }, { "entropy": 1.9078024625778198, "epoch": 0.04318062137967351, "grad_norm": 0.7781356573104858, "learning_rate": 4.0601503759398494e-05, "loss": 0.43578821420669556, "mean_token_accuracy": 0.8600046187639236, "num_tokens": 1011552.0, "step": 82 }, { "entropy": 1.8074560463428497, "epoch": 0.04370721432332807, "grad_norm": 0.7703754305839539, "learning_rate": 4.110275689223057e-05, "loss": 0.4543125629425049, "mean_token_accuracy": 0.8561971783638, "num_tokens": 1023888.0, "step": 83 }, { "entropy": 1.7470267415046692, "epoch": 0.044233807266982623, "grad_norm": 0.6839037537574768, "learning_rate": 4.160401002506266e-05, "loss": 0.4043883681297302, "mean_token_accuracy": 0.8632047474384308, "num_tokens": 1036224.0, "step": 84 }, { "entropy": 1.8056954443454742, "epoch": 0.04476040021063718, "grad_norm": 0.8745210766792297, "learning_rate": 4.210526315789474e-05, "loss": 0.4576418101787567, "mean_token_accuracy": 0.8515569567680359, "num_tokens": 1048560.0, "step": 85 }, { "entropy": 1.7271961271762848, "epoch": 0.04528699315429173, "grad_norm": 0.7987569570541382, "learning_rate": 4.260651629072682e-05, "loss": 0.4062059819698334, "mean_token_accuracy": 0.8644601851701736, "num_tokens": 1060896.0, "step": 86 }, { "entropy": 1.7829216122627258, "epoch": 0.045813586097946286, "grad_norm": 0.8260216116905212, "learning_rate": 4.3107769423558896e-05, "loss": 0.4285086989402771, "mean_token_accuracy": 0.8619498312473297, "num_tokens": 1073232.0, "step": 87 }, { "entropy": 1.720045566558838, "epoch": 0.04634017904160084, "grad_norm": 0.8638037443161011, "learning_rate": 4.3609022556390975e-05, "loss": 0.42514118552207947, "mean_token_accuracy": 0.8556364923715591, "num_tokens": 1085568.0, "step": 88 }, { "entropy": 1.749743402004242, "epoch": 0.0468667719852554, "grad_norm": 0.6750407218933105, "learning_rate": 4.411027568922306e-05, "loss": 0.3981553912162781, "mean_token_accuracy": 0.8708555996417999, "num_tokens": 1097904.0, "step": 89 }, { "entropy": 1.785173624753952, "epoch": 0.04739336492890995, "grad_norm": 0.7802124619483948, "learning_rate": 4.461152882205514e-05, "loss": 0.3845086097717285, "mean_token_accuracy": 0.8747637271881104, "num_tokens": 1110240.0, "step": 90 }, { "entropy": 1.7087633907794952, "epoch": 0.047919957872564506, "grad_norm": 0.8488918542861938, "learning_rate": 4.511278195488722e-05, "loss": 0.3644571006298065, "mean_token_accuracy": 0.8757548332214355, "num_tokens": 1122576.0, "step": 91 }, { "entropy": 1.6821248829364777, "epoch": 0.04844655081621906, "grad_norm": 0.7744936943054199, "learning_rate": 4.56140350877193e-05, "loss": 0.40767285227775574, "mean_token_accuracy": 0.8596755862236023, "num_tokens": 1134912.0, "step": 92 }, { "entropy": 1.7099383771419525, "epoch": 0.04897314375987362, "grad_norm": 0.9390520453453064, "learning_rate": 4.6115288220551377e-05, "loss": 0.4450380802154541, "mean_token_accuracy": 0.8517685830593109, "num_tokens": 1147248.0, "step": 93 }, { "entropy": 1.6644540429115295, "epoch": 0.049499736703528176, "grad_norm": 0.9382246136665344, "learning_rate": 4.6616541353383456e-05, "loss": 0.37574899196624756, "mean_token_accuracy": 0.8736520707607269, "num_tokens": 1159584.0, "step": 94 }, { "entropy": 1.7045432031154633, "epoch": 0.050026329647182725, "grad_norm": 0.784248948097229, "learning_rate": 4.711779448621554e-05, "loss": 0.39656203985214233, "mean_token_accuracy": 0.8673653900623322, "num_tokens": 1171920.0, "step": 95 }, { "entropy": 1.6858630180358887, "epoch": 0.05055292259083728, "grad_norm": 0.7153828144073486, "learning_rate": 4.761904761904762e-05, "loss": 0.3821033835411072, "mean_token_accuracy": 0.870804488658905, "num_tokens": 1184256.0, "step": 96 }, { "entropy": 1.5798078775405884, "epoch": 0.05107951553449184, "grad_norm": 0.6857785582542419, "learning_rate": 4.81203007518797e-05, "loss": 0.3593214452266693, "mean_token_accuracy": 0.8746844828128815, "num_tokens": 1196592.0, "step": 97 }, { "entropy": 1.670957088470459, "epoch": 0.051606108478146395, "grad_norm": 0.7506043910980225, "learning_rate": 4.862155388471178e-05, "loss": 0.3727911412715912, "mean_token_accuracy": 0.8756437748670578, "num_tokens": 1208928.0, "step": 98 }, { "entropy": 1.5233455896377563, "epoch": 0.052132701421800945, "grad_norm": 0.7735759019851685, "learning_rate": 4.912280701754386e-05, "loss": 0.37093132734298706, "mean_token_accuracy": 0.8704032748937607, "num_tokens": 1221264.0, "step": 99 }, { "entropy": 1.6192973852157593, "epoch": 0.0526592943654555, "grad_norm": 0.7478036880493164, "learning_rate": 4.9624060150375936e-05, "loss": 0.3426092863082886, "mean_token_accuracy": 0.8861435055732727, "num_tokens": 1233600.0, "step": 100 }, { "entropy": 1.493833750486374, "epoch": 0.05318588730911006, "grad_norm": 0.7044211030006409, "learning_rate": 5.012531328320802e-05, "loss": 0.35205507278442383, "mean_token_accuracy": 0.8778510093688965, "num_tokens": 1245936.0, "step": 101 }, { "entropy": 1.4939774870872498, "epoch": 0.053712480252764615, "grad_norm": 0.7720161080360413, "learning_rate": 5.06265664160401e-05, "loss": 0.3975054621696472, "mean_token_accuracy": 0.8641460090875626, "num_tokens": 1258272.0, "step": 102 }, { "entropy": 1.6101951897144318, "epoch": 0.05423907319641917, "grad_norm": 0.669315755367279, "learning_rate": 5.112781954887218e-05, "loss": 0.34713947772979736, "mean_token_accuracy": 0.8790434300899506, "num_tokens": 1270608.0, "step": 103 }, { "entropy": 1.5196483135223389, "epoch": 0.05476566614007372, "grad_norm": 0.8516085743904114, "learning_rate": 5.162907268170426e-05, "loss": 0.3601211607456207, "mean_token_accuracy": 0.8756401091814041, "num_tokens": 1282944.0, "step": 104 }, { "entropy": 1.4721749424934387, "epoch": 0.05529225908372828, "grad_norm": 0.8156314492225647, "learning_rate": 5.213032581453634e-05, "loss": 0.3697987198829651, "mean_token_accuracy": 0.8728637546300888, "num_tokens": 1295280.0, "step": 105 }, { "entropy": 1.4663786590099335, "epoch": 0.055818852027382834, "grad_norm": 0.6453195810317993, "learning_rate": 5.2631578947368424e-05, "loss": 0.3338157534599304, "mean_token_accuracy": 0.8864734172821045, "num_tokens": 1307616.0, "step": 106 }, { "entropy": 1.497151494026184, "epoch": 0.05634544497103739, "grad_norm": 0.7146667242050171, "learning_rate": 5.31328320802005e-05, "loss": 0.34923166036605835, "mean_token_accuracy": 0.8819292187690735, "num_tokens": 1319952.0, "step": 107 }, { "entropy": 1.5161625444889069, "epoch": 0.05687203791469194, "grad_norm": 0.8290141820907593, "learning_rate": 5.363408521303258e-05, "loss": 0.3371197581291199, "mean_token_accuracy": 0.8877773582935333, "num_tokens": 1332288.0, "step": 108 }, { "entropy": 1.4333459436893463, "epoch": 0.0573986308583465, "grad_norm": 0.8022440671920776, "learning_rate": 5.413533834586466e-05, "loss": 0.31702953577041626, "mean_token_accuracy": 0.8909593671560287, "num_tokens": 1344624.0, "step": 109 }, { "entropy": 1.4444147646427155, "epoch": 0.057925223802001054, "grad_norm": 0.7960955500602722, "learning_rate": 5.463659147869674e-05, "loss": 0.3525749742984772, "mean_token_accuracy": 0.8755318969488144, "num_tokens": 1356960.0, "step": 110 }, { "entropy": 1.469768613576889, "epoch": 0.05845181674565561, "grad_norm": 0.8183742165565491, "learning_rate": 5.513784461152882e-05, "loss": 0.3398601710796356, "mean_token_accuracy": 0.8840423971414566, "num_tokens": 1369296.0, "step": 111 }, { "entropy": 1.4481310844421387, "epoch": 0.05897840968931016, "grad_norm": 0.6801962852478027, "learning_rate": 5.5639097744360905e-05, "loss": 0.34869900345802307, "mean_token_accuracy": 0.877396434545517, "num_tokens": 1381632.0, "step": 112 }, { "entropy": 1.4586880207061768, "epoch": 0.05950500263296472, "grad_norm": 0.7105273008346558, "learning_rate": 5.6140350877192984e-05, "loss": 0.32431477308273315, "mean_token_accuracy": 0.8829907327890396, "num_tokens": 1393968.0, "step": 113 }, { "entropy": 1.4191592037677765, "epoch": 0.06003159557661927, "grad_norm": 0.8621596097946167, "learning_rate": 5.664160401002506e-05, "loss": 0.29889625310897827, "mean_token_accuracy": 0.8882533758878708, "num_tokens": 1406304.0, "step": 114 }, { "entropy": 1.431228756904602, "epoch": 0.06055818852027383, "grad_norm": 0.662341833114624, "learning_rate": 5.714285714285714e-05, "loss": 0.34662240743637085, "mean_token_accuracy": 0.8789393156766891, "num_tokens": 1418640.0, "step": 115 }, { "entropy": 1.317075937986374, "epoch": 0.061084781463928386, "grad_norm": 0.6940162777900696, "learning_rate": 5.764411027568922e-05, "loss": 0.3154875636100769, "mean_token_accuracy": 0.886825367808342, "num_tokens": 1430976.0, "step": 116 }, { "entropy": 1.3747568726539612, "epoch": 0.061611374407582936, "grad_norm": 0.6974264979362488, "learning_rate": 5.81453634085213e-05, "loss": 0.36218538880348206, "mean_token_accuracy": 0.8753509372472763, "num_tokens": 1443312.0, "step": 117 }, { "entropy": 1.3549829423427582, "epoch": 0.06213796735123749, "grad_norm": 0.7157356142997742, "learning_rate": 5.8646616541353386e-05, "loss": 0.32229024171829224, "mean_token_accuracy": 0.8855572938919067, "num_tokens": 1455648.0, "step": 118 }, { "entropy": 1.4570170640945435, "epoch": 0.06266456029489205, "grad_norm": 0.7710041999816895, "learning_rate": 5.9147869674185465e-05, "loss": 0.3285849094390869, "mean_token_accuracy": 0.8840549886226654, "num_tokens": 1467984.0, "step": 119 }, { "entropy": 1.4027460813522339, "epoch": 0.0631911532385466, "grad_norm": 0.6999377012252808, "learning_rate": 5.9649122807017544e-05, "loss": 0.3464536666870117, "mean_token_accuracy": 0.8799307644367218, "num_tokens": 1480320.0, "step": 120 }, { "entropy": 1.3301794826984406, "epoch": 0.06371774618220116, "grad_norm": 0.7836945056915283, "learning_rate": 6.015037593984962e-05, "loss": 0.3436964750289917, "mean_token_accuracy": 0.8764877319335938, "num_tokens": 1492656.0, "step": 121 }, { "entropy": 1.3585115671157837, "epoch": 0.06424433912585571, "grad_norm": 0.7850233316421509, "learning_rate": 6.06516290726817e-05, "loss": 0.35563230514526367, "mean_token_accuracy": 0.8757744282484055, "num_tokens": 1504992.0, "step": 122 }, { "entropy": 1.2973756194114685, "epoch": 0.06477093206951026, "grad_norm": 0.7351557612419128, "learning_rate": 6.115288220551379e-05, "loss": 0.3156384527683258, "mean_token_accuracy": 0.886470839381218, "num_tokens": 1517328.0, "step": 123 }, { "entropy": 1.3591448068618774, "epoch": 0.06529752501316483, "grad_norm": 0.7262402176856995, "learning_rate": 6.165413533834587e-05, "loss": 0.27420130372047424, "mean_token_accuracy": 0.904089480638504, "num_tokens": 1529664.0, "step": 124 }, { "entropy": 1.253787875175476, "epoch": 0.06582411795681938, "grad_norm": 0.6739073991775513, "learning_rate": 6.215538847117795e-05, "loss": 0.34957295656204224, "mean_token_accuracy": 0.879968523979187, "num_tokens": 1542000.0, "step": 125 }, { "entropy": 1.261105090379715, "epoch": 0.06635071090047394, "grad_norm": 0.7828674912452698, "learning_rate": 6.265664160401002e-05, "loss": 0.3064384460449219, "mean_token_accuracy": 0.8853085935115814, "num_tokens": 1554336.0, "step": 126 }, { "entropy": 1.2267013192176819, "epoch": 0.06687730384412849, "grad_norm": 0.9648973345756531, "learning_rate": 6.31578947368421e-05, "loss": 0.3406292498111725, "mean_token_accuracy": 0.8785828351974487, "num_tokens": 1566672.0, "step": 127 }, { "entropy": 1.2064116597175598, "epoch": 0.06740389678778304, "grad_norm": 0.8842466473579407, "learning_rate": 6.365914786967418e-05, "loss": 0.3578197658061981, "mean_token_accuracy": 0.8797773271799088, "num_tokens": 1579008.0, "step": 128 }, { "entropy": 1.1993357837200165, "epoch": 0.0679304897314376, "grad_norm": 0.8396037817001343, "learning_rate": 6.416040100250626e-05, "loss": 0.32377177476882935, "mean_token_accuracy": 0.8842920362949371, "num_tokens": 1591344.0, "step": 129 }, { "entropy": 1.2047476172447205, "epoch": 0.06845708267509215, "grad_norm": 0.6860671043395996, "learning_rate": 6.466165413533834e-05, "loss": 0.29577356576919556, "mean_token_accuracy": 0.896445706486702, "num_tokens": 1603680.0, "step": 130 }, { "entropy": 1.2046065032482147, "epoch": 0.06898367561874671, "grad_norm": 0.6543269157409668, "learning_rate": 6.516290726817042e-05, "loss": 0.2779792845249176, "mean_token_accuracy": 0.9030982404947281, "num_tokens": 1616016.0, "step": 131 }, { "entropy": 1.1669755578041077, "epoch": 0.06951026856240126, "grad_norm": 0.7457153797149658, "learning_rate": 6.566416040100251e-05, "loss": 0.3149452209472656, "mean_token_accuracy": 0.8876487761735916, "num_tokens": 1628352.0, "step": 132 }, { "entropy": 1.2609427571296692, "epoch": 0.07003686150605581, "grad_norm": 0.7485870122909546, "learning_rate": 6.616541353383459e-05, "loss": 0.31902027130126953, "mean_token_accuracy": 0.8813460171222687, "num_tokens": 1640688.0, "step": 133 }, { "entropy": 1.2575346231460571, "epoch": 0.07056345444971038, "grad_norm": 0.7213554382324219, "learning_rate": 6.666666666666667e-05, "loss": 0.2797701358795166, "mean_token_accuracy": 0.8987373113632202, "num_tokens": 1653024.0, "step": 134 }, { "entropy": 1.186894565820694, "epoch": 0.07109004739336493, "grad_norm": 0.7020873427391052, "learning_rate": 6.716791979949875e-05, "loss": 0.2995363771915436, "mean_token_accuracy": 0.8897402882575989, "num_tokens": 1665360.0, "step": 135 }, { "entropy": 1.161018431186676, "epoch": 0.07161664033701948, "grad_norm": 0.7155889868736267, "learning_rate": 6.766917293233083e-05, "loss": 0.2925366759300232, "mean_token_accuracy": 0.8951611965894699, "num_tokens": 1677696.0, "step": 136 }, { "entropy": 1.2650261223316193, "epoch": 0.07214323328067404, "grad_norm": 0.7642542123794556, "learning_rate": 6.817042606516291e-05, "loss": 0.2801384925842285, "mean_token_accuracy": 0.8974052667617798, "num_tokens": 1690032.0, "step": 137 }, { "entropy": 1.2530198991298676, "epoch": 0.07266982622432859, "grad_norm": 0.8588266372680664, "learning_rate": 6.867167919799499e-05, "loss": 0.3360725939273834, "mean_token_accuracy": 0.8794126808643341, "num_tokens": 1702368.0, "step": 138 }, { "entropy": 1.2518652081489563, "epoch": 0.07319641916798315, "grad_norm": 0.6655072569847107, "learning_rate": 6.917293233082706e-05, "loss": 0.2788892388343811, "mean_token_accuracy": 0.8994075357913971, "num_tokens": 1714704.0, "step": 139 }, { "entropy": 1.1829611957073212, "epoch": 0.0737230121116377, "grad_norm": 0.7172735333442688, "learning_rate": 6.967418546365914e-05, "loss": 0.2918061316013336, "mean_token_accuracy": 0.8959014713764191, "num_tokens": 1727040.0, "step": 140 }, { "entropy": 1.2773233950138092, "epoch": 0.07424960505529225, "grad_norm": 0.697880208492279, "learning_rate": 7.017543859649122e-05, "loss": 0.3217264711856842, "mean_token_accuracy": 0.8819008469581604, "num_tokens": 1739376.0, "step": 141 }, { "entropy": 1.2314070761203766, "epoch": 0.07477619799894682, "grad_norm": 0.701502799987793, "learning_rate": 7.06766917293233e-05, "loss": 0.29351311922073364, "mean_token_accuracy": 0.8908087462186813, "num_tokens": 1751712.0, "step": 142 }, { "entropy": 1.2544872462749481, "epoch": 0.07530279094260137, "grad_norm": 0.7028551697731018, "learning_rate": 7.11779448621554e-05, "loss": 0.3528595566749573, "mean_token_accuracy": 0.8716742098331451, "num_tokens": 1764048.0, "step": 143 }, { "entropy": 1.1984558403491974, "epoch": 0.07582938388625593, "grad_norm": 0.6910477876663208, "learning_rate": 7.167919799498747e-05, "loss": 0.3136734366416931, "mean_token_accuracy": 0.8870812356472015, "num_tokens": 1776384.0, "step": 144 }, { "entropy": 1.2033996284008026, "epoch": 0.07635597682991048, "grad_norm": 0.7239225506782532, "learning_rate": 7.218045112781955e-05, "loss": 0.2979337275028229, "mean_token_accuracy": 0.8915670961141586, "num_tokens": 1788720.0, "step": 145 }, { "entropy": 1.1562331318855286, "epoch": 0.07688256977356503, "grad_norm": 0.7481216192245483, "learning_rate": 7.268170426065163e-05, "loss": 0.2653358280658722, "mean_token_accuracy": 0.8980085849761963, "num_tokens": 1801056.0, "step": 146 }, { "entropy": 1.2064136862754822, "epoch": 0.07740916271721959, "grad_norm": 0.7776615023612976, "learning_rate": 7.318295739348371e-05, "loss": 0.2848292589187622, "mean_token_accuracy": 0.8949488550424576, "num_tokens": 1813392.0, "step": 147 }, { "entropy": 1.1387107968330383, "epoch": 0.07793575566087414, "grad_norm": 0.8243488669395447, "learning_rate": 7.368421052631579e-05, "loss": 0.31445616483688354, "mean_token_accuracy": 0.887312263250351, "num_tokens": 1825728.0, "step": 148 }, { "entropy": 1.0903229415416718, "epoch": 0.0784623486045287, "grad_norm": 0.775776207447052, "learning_rate": 7.418546365914787e-05, "loss": 0.2984585762023926, "mean_token_accuracy": 0.8886806517839432, "num_tokens": 1838064.0, "step": 149 }, { "entropy": 1.1340011656284332, "epoch": 0.07898894154818326, "grad_norm": 0.7941513657569885, "learning_rate": 7.468671679197995e-05, "loss": 0.27699777483940125, "mean_token_accuracy": 0.9033427834510803, "num_tokens": 1850400.0, "step": 150 }, { "entropy": 1.084587723016739, "epoch": 0.0795155344918378, "grad_norm": 0.7044249773025513, "learning_rate": 7.518796992481203e-05, "loss": 0.2815166711807251, "mean_token_accuracy": 0.8928717374801636, "num_tokens": 1862736.0, "step": 151 }, { "entropy": 1.0816469937562943, "epoch": 0.08004212743549237, "grad_norm": 0.8506439328193665, "learning_rate": 7.56892230576441e-05, "loss": 0.3135736584663391, "mean_token_accuracy": 0.8835454434156418, "num_tokens": 1875072.0, "step": 152 }, { "entropy": 1.037431538105011, "epoch": 0.08056872037914692, "grad_norm": 0.6357259750366211, "learning_rate": 7.619047619047618e-05, "loss": 0.2715918719768524, "mean_token_accuracy": 0.9003684967756271, "num_tokens": 1887408.0, "step": 153 }, { "entropy": 1.101006418466568, "epoch": 0.08109531332280147, "grad_norm": 0.7176199555397034, "learning_rate": 7.669172932330826e-05, "loss": 0.3140455186367035, "mean_token_accuracy": 0.8868316859006882, "num_tokens": 1899744.0, "step": 154 }, { "entropy": 1.048825979232788, "epoch": 0.08162190626645603, "grad_norm": 0.8264813423156738, "learning_rate": 7.719298245614036e-05, "loss": 0.27318042516708374, "mean_token_accuracy": 0.8995131105184555, "num_tokens": 1912080.0, "step": 155 }, { "entropy": 1.0369156897068024, "epoch": 0.08214849921011058, "grad_norm": 0.7105727791786194, "learning_rate": 7.769423558897244e-05, "loss": 0.287497341632843, "mean_token_accuracy": 0.8940722495317459, "num_tokens": 1924416.0, "step": 156 }, { "entropy": 1.0527066588401794, "epoch": 0.08267509215376515, "grad_norm": 0.7094339728355408, "learning_rate": 7.819548872180451e-05, "loss": 0.31165987253189087, "mean_token_accuracy": 0.8851522654294968, "num_tokens": 1936752.0, "step": 157 }, { "entropy": 1.018677532672882, "epoch": 0.0832016850974197, "grad_norm": 0.6412932276725769, "learning_rate": 7.869674185463659e-05, "loss": 0.28470396995544434, "mean_token_accuracy": 0.8961537182331085, "num_tokens": 1949088.0, "step": 158 }, { "entropy": 1.011895701289177, "epoch": 0.08372827804107424, "grad_norm": 0.6732510924339294, "learning_rate": 7.919799498746867e-05, "loss": 0.28573673963546753, "mean_token_accuracy": 0.8944952934980392, "num_tokens": 1961424.0, "step": 159 }, { "entropy": 1.011293813586235, "epoch": 0.08425487098472881, "grad_norm": 0.6785159707069397, "learning_rate": 7.969924812030075e-05, "loss": 0.30068039894104004, "mean_token_accuracy": 0.8911136984825134, "num_tokens": 1973760.0, "step": 160 }, { "entropy": 1.020560160279274, "epoch": 0.08478146392838336, "grad_norm": 0.7218092679977417, "learning_rate": 8.020050125313283e-05, "loss": 0.30739086866378784, "mean_token_accuracy": 0.885330468416214, "num_tokens": 1986096.0, "step": 161 }, { "entropy": 1.0597094595432281, "epoch": 0.08530805687203792, "grad_norm": 0.7374167442321777, "learning_rate": 8.070175438596491e-05, "loss": 0.31700241565704346, "mean_token_accuracy": 0.8844025731086731, "num_tokens": 1998432.0, "step": 162 }, { "entropy": 1.0140591859817505, "epoch": 0.08583464981569247, "grad_norm": 0.6328212022781372, "learning_rate": 8.120300751879699e-05, "loss": 0.282073050737381, "mean_token_accuracy": 0.9006371796131134, "num_tokens": 2010768.0, "step": 163 }, { "entropy": 1.0362461507320404, "epoch": 0.08636124275934702, "grad_norm": 0.6613935828208923, "learning_rate": 8.170426065162907e-05, "loss": 0.2826480567455292, "mean_token_accuracy": 0.8936625272035599, "num_tokens": 2023104.0, "step": 164 }, { "entropy": 1.0381528735160828, "epoch": 0.08688783570300158, "grad_norm": 0.6834626197814941, "learning_rate": 8.220551378446115e-05, "loss": 0.2852419912815094, "mean_token_accuracy": 0.8987163454294205, "num_tokens": 2035440.0, "step": 165 }, { "entropy": 1.0698944479227066, "epoch": 0.08741442864665613, "grad_norm": 0.7904614806175232, "learning_rate": 8.270676691729324e-05, "loss": 0.2937854826450348, "mean_token_accuracy": 0.8909425586462021, "num_tokens": 2047776.0, "step": 166 }, { "entropy": 1.040902853012085, "epoch": 0.08794102159031068, "grad_norm": 0.7362328767776489, "learning_rate": 8.320802005012532e-05, "loss": 0.2914920449256897, "mean_token_accuracy": 0.898249089717865, "num_tokens": 2060112.0, "step": 167 }, { "entropy": 1.028788536787033, "epoch": 0.08846761453396525, "grad_norm": 0.8054221868515015, "learning_rate": 8.37092731829574e-05, "loss": 0.3018620014190674, "mean_token_accuracy": 0.8883562982082367, "num_tokens": 2072448.0, "step": 168 }, { "entropy": 1.0401608049869537, "epoch": 0.0889942074776198, "grad_norm": 0.6363168954849243, "learning_rate": 8.421052631578948e-05, "loss": 0.2924948036670685, "mean_token_accuracy": 0.8931814581155777, "num_tokens": 2084784.0, "step": 169 }, { "entropy": 1.0388599783182144, "epoch": 0.08952080042127436, "grad_norm": 1.0536071062088013, "learning_rate": 8.471177944862155e-05, "loss": 0.3022274971008301, "mean_token_accuracy": 0.8892710357904434, "num_tokens": 2097120.0, "step": 170 }, { "entropy": 1.0794771611690521, "epoch": 0.09004739336492891, "grad_norm": 0.7485163807868958, "learning_rate": 8.521303258145363e-05, "loss": 0.28198155760765076, "mean_token_accuracy": 0.8907860517501831, "num_tokens": 2109456.0, "step": 171 }, { "entropy": 1.0737251937389374, "epoch": 0.09057398630858346, "grad_norm": 0.7381237745285034, "learning_rate": 8.571428571428571e-05, "loss": 0.2523871660232544, "mean_token_accuracy": 0.9074936509132385, "num_tokens": 2121792.0, "step": 172 }, { "entropy": 1.003856584429741, "epoch": 0.09110057925223802, "grad_norm": 0.7226340770721436, "learning_rate": 8.621553884711779e-05, "loss": 0.27109643816947937, "mean_token_accuracy": 0.9041073471307755, "num_tokens": 2134128.0, "step": 173 }, { "entropy": 1.1186200976371765, "epoch": 0.09162717219589257, "grad_norm": 0.7579658627510071, "learning_rate": 8.671679197994987e-05, "loss": 0.3053061366081238, "mean_token_accuracy": 0.8858212381601334, "num_tokens": 2146464.0, "step": 174 }, { "entropy": 1.1462504863739014, "epoch": 0.09215376513954714, "grad_norm": 0.6947624087333679, "learning_rate": 8.721804511278195e-05, "loss": 0.3097134232521057, "mean_token_accuracy": 0.8846383690834045, "num_tokens": 2158800.0, "step": 175 }, { "entropy": 1.1312821209430695, "epoch": 0.09268035808320169, "grad_norm": 0.6850878596305847, "learning_rate": 8.771929824561403e-05, "loss": 0.26429426670074463, "mean_token_accuracy": 0.8986905962228775, "num_tokens": 2171136.0, "step": 176 }, { "entropy": 1.146384358406067, "epoch": 0.09320695102685624, "grad_norm": 0.7358205914497375, "learning_rate": 8.822055137844612e-05, "loss": 0.2753527760505676, "mean_token_accuracy": 0.8983759731054306, "num_tokens": 2183472.0, "step": 177 }, { "entropy": 1.2575857639312744, "epoch": 0.0937335439705108, "grad_norm": 0.6449548006057739, "learning_rate": 8.87218045112782e-05, "loss": 0.2840855121612549, "mean_token_accuracy": 0.8939386010169983, "num_tokens": 2195808.0, "step": 178 }, { "entropy": 1.190169095993042, "epoch": 0.09426013691416535, "grad_norm": 0.7093657851219177, "learning_rate": 8.922305764411028e-05, "loss": 0.2701612114906311, "mean_token_accuracy": 0.9016707092523575, "num_tokens": 2208144.0, "step": 179 }, { "entropy": 1.229299396276474, "epoch": 0.0947867298578199, "grad_norm": 0.7190297245979309, "learning_rate": 8.972431077694236e-05, "loss": 0.25798100233078003, "mean_token_accuracy": 0.9037416577339172, "num_tokens": 2220480.0, "step": 180 }, { "entropy": 1.2668792605400085, "epoch": 0.09531332280147446, "grad_norm": 0.7405722737312317, "learning_rate": 9.022556390977444e-05, "loss": 0.2883971929550171, "mean_token_accuracy": 0.8925597667694092, "num_tokens": 2232816.0, "step": 181 }, { "entropy": 1.1805595457553864, "epoch": 0.09583991574512901, "grad_norm": 0.6785654425621033, "learning_rate": 9.072681704260652e-05, "loss": 0.2622534930706024, "mean_token_accuracy": 0.9043945819139481, "num_tokens": 2245152.0, "step": 182 }, { "entropy": 1.24412140250206, "epoch": 0.09636650868878358, "grad_norm": 0.6113075017929077, "learning_rate": 9.12280701754386e-05, "loss": 0.30303800106048584, "mean_token_accuracy": 0.8807209581136703, "num_tokens": 2257488.0, "step": 183 }, { "entropy": 1.1531569063663483, "epoch": 0.09689310163243813, "grad_norm": 0.6058000922203064, "learning_rate": 9.172932330827067e-05, "loss": 0.2888239622116089, "mean_token_accuracy": 0.8989417850971222, "num_tokens": 2269824.0, "step": 184 }, { "entropy": 1.1511635780334473, "epoch": 0.09741969457609267, "grad_norm": 0.6023234128952026, "learning_rate": 9.223057644110275e-05, "loss": 0.2515050172805786, "mean_token_accuracy": 0.9097182005643845, "num_tokens": 2282160.0, "step": 185 }, { "entropy": 1.1716180443763733, "epoch": 0.09794628751974724, "grad_norm": 0.6153926253318787, "learning_rate": 9.273182957393483e-05, "loss": 0.2679345905780792, "mean_token_accuracy": 0.8987378627061844, "num_tokens": 2294496.0, "step": 186 }, { "entropy": 1.1668370068073273, "epoch": 0.09847288046340179, "grad_norm": 0.6524267196655273, "learning_rate": 9.323308270676691e-05, "loss": 0.28671011328697205, "mean_token_accuracy": 0.8961494415998459, "num_tokens": 2306832.0, "step": 187 }, { "entropy": 1.1817428171634674, "epoch": 0.09899947340705635, "grad_norm": 0.6342366337776184, "learning_rate": 9.373433583959899e-05, "loss": 0.2956732511520386, "mean_token_accuracy": 0.8947313278913498, "num_tokens": 2319168.0, "step": 188 }, { "entropy": 1.118630200624466, "epoch": 0.0995260663507109, "grad_norm": 0.6613883972167969, "learning_rate": 9.423558897243108e-05, "loss": 0.24410809576511383, "mean_token_accuracy": 0.9081003367900848, "num_tokens": 2331504.0, "step": 189 }, { "entropy": 1.1118974089622498, "epoch": 0.10005265929436545, "grad_norm": 0.6532029509544373, "learning_rate": 9.473684210526316e-05, "loss": 0.2677920162677765, "mean_token_accuracy": 0.8997665196657181, "num_tokens": 2343840.0, "step": 190 }, { "entropy": 1.1150999963283539, "epoch": 0.10057925223802001, "grad_norm": 0.6919822692871094, "learning_rate": 9.523809523809524e-05, "loss": 0.2759622633457184, "mean_token_accuracy": 0.896903395652771, "num_tokens": 2356176.0, "step": 191 }, { "entropy": 1.0659538507461548, "epoch": 0.10110584518167456, "grad_norm": 0.6363855600357056, "learning_rate": 9.573934837092732e-05, "loss": 0.2608574628829956, "mean_token_accuracy": 0.8995112329721451, "num_tokens": 2368512.0, "step": 192 }, { "entropy": 1.0789634585380554, "epoch": 0.10163243812532911, "grad_norm": 0.7043361067771912, "learning_rate": 9.62406015037594e-05, "loss": 0.27143171429634094, "mean_token_accuracy": 0.897380143404007, "num_tokens": 2380848.0, "step": 193 }, { "entropy": 1.1381100416183472, "epoch": 0.10215903106898368, "grad_norm": 0.6552066206932068, "learning_rate": 9.674185463659148e-05, "loss": 0.26525720953941345, "mean_token_accuracy": 0.9070263504981995, "num_tokens": 2393184.0, "step": 194 }, { "entropy": 1.1865114271640778, "epoch": 0.10268562401263823, "grad_norm": 0.634785532951355, "learning_rate": 9.724310776942356e-05, "loss": 0.26738592982292175, "mean_token_accuracy": 0.9013326019048691, "num_tokens": 2405520.0, "step": 195 }, { "entropy": 1.1835360527038574, "epoch": 0.10321221695629279, "grad_norm": 0.7315617799758911, "learning_rate": 9.774436090225564e-05, "loss": 0.29927945137023926, "mean_token_accuracy": 0.8894186317920685, "num_tokens": 2417856.0, "step": 196 }, { "entropy": 1.1675716638565063, "epoch": 0.10373880989994734, "grad_norm": 0.5887401700019836, "learning_rate": 9.824561403508771e-05, "loss": 0.2657887935638428, "mean_token_accuracy": 0.9044163674116135, "num_tokens": 2430192.0, "step": 197 }, { "entropy": 1.2119200527668, "epoch": 0.10426540284360189, "grad_norm": 0.7186099290847778, "learning_rate": 9.87468671679198e-05, "loss": 0.24999147653579712, "mean_token_accuracy": 0.9089571237564087, "num_tokens": 2442528.0, "step": 198 }, { "entropy": 1.1587353944778442, "epoch": 0.10479199578725645, "grad_norm": 0.6930050253868103, "learning_rate": 9.924812030075187e-05, "loss": 0.28423306345939636, "mean_token_accuracy": 0.8938881307840347, "num_tokens": 2454864.0, "step": 199 }, { "entropy": 1.1999735534191132, "epoch": 0.105318588730911, "grad_norm": 0.6575484871864319, "learning_rate": 9.974937343358397e-05, "loss": 0.25892868638038635, "mean_token_accuracy": 0.9065304547548294, "num_tokens": 2467200.0, "step": 200 }, { "entropy": 1.1664292514324188, "epoch": 0.10584518167456557, "grad_norm": 0.6501355767250061, "learning_rate": 0.00010025062656641604, "loss": 0.2730686068534851, "mean_token_accuracy": 0.8991207629442215, "num_tokens": 2479536.0, "step": 201 }, { "entropy": 1.2156886756420135, "epoch": 0.10637177461822012, "grad_norm": 1.1883974075317383, "learning_rate": 0.00010075187969924814, "loss": 0.2882535755634308, "mean_token_accuracy": 0.8935256004333496, "num_tokens": 2491872.0, "step": 202 }, { "entropy": 1.1884984374046326, "epoch": 0.10689836756187467, "grad_norm": 0.6555978655815125, "learning_rate": 0.0001012531328320802, "loss": 0.2524234354496002, "mean_token_accuracy": 0.9072889387607574, "num_tokens": 2504208.0, "step": 203 }, { "entropy": 1.204279750585556, "epoch": 0.10742496050552923, "grad_norm": 0.6422716379165649, "learning_rate": 0.0001017543859649123, "loss": 0.2662729322910309, "mean_token_accuracy": 0.9040449559688568, "num_tokens": 2516544.0, "step": 204 }, { "entropy": 1.2619583904743195, "epoch": 0.10795155344918378, "grad_norm": 0.7150806188583374, "learning_rate": 0.00010225563909774436, "loss": 0.2756538689136505, "mean_token_accuracy": 0.8975429385900497, "num_tokens": 2528880.0, "step": 205 }, { "entropy": 1.265720009803772, "epoch": 0.10847814639283834, "grad_norm": 0.6873537302017212, "learning_rate": 0.00010275689223057645, "loss": 0.25472116470336914, "mean_token_accuracy": 0.9096198529005051, "num_tokens": 2541216.0, "step": 206 }, { "entropy": 1.269091546535492, "epoch": 0.10900473933649289, "grad_norm": 0.6951980590820312, "learning_rate": 0.00010325814536340852, "loss": 0.26120638847351074, "mean_token_accuracy": 0.9050850421190262, "num_tokens": 2553552.0, "step": 207 }, { "entropy": 1.269478291273117, "epoch": 0.10953133228014744, "grad_norm": 0.556747555732727, "learning_rate": 0.00010375939849624061, "loss": 0.25462740659713745, "mean_token_accuracy": 0.9035714715719223, "num_tokens": 2565888.0, "step": 208 }, { "entropy": 1.261308342218399, "epoch": 0.110057925223802, "grad_norm": 0.6084737777709961, "learning_rate": 0.00010426065162907268, "loss": 0.28605493903160095, "mean_token_accuracy": 0.8935003876686096, "num_tokens": 2578224.0, "step": 209 }, { "entropy": 1.3189480602741241, "epoch": 0.11058451816745656, "grad_norm": 0.5886352062225342, "learning_rate": 0.00010476190476190477, "loss": 0.24048885703086853, "mean_token_accuracy": 0.9100839495658875, "num_tokens": 2590560.0, "step": 210 }, { "entropy": 1.3389763832092285, "epoch": 0.1111111111111111, "grad_norm": 0.6794092059135437, "learning_rate": 0.00010526315789473685, "loss": 0.2771369516849518, "mean_token_accuracy": 0.890377551317215, "num_tokens": 2602896.0, "step": 211 }, { "entropy": 1.3012954592704773, "epoch": 0.11163770405476567, "grad_norm": 0.6500777006149292, "learning_rate": 0.00010576441102756893, "loss": 0.26194366812705994, "mean_token_accuracy": 0.9035488367080688, "num_tokens": 2615232.0, "step": 212 }, { "entropy": 1.3287411630153656, "epoch": 0.11216429699842022, "grad_norm": 0.7444258332252502, "learning_rate": 0.000106265664160401, "loss": 0.25705063343048096, "mean_token_accuracy": 0.8985376209020615, "num_tokens": 2627568.0, "step": 213 }, { "entropy": 1.3762761354446411, "epoch": 0.11269088994207478, "grad_norm": 0.6778383255004883, "learning_rate": 0.0001067669172932331, "loss": 0.26562660932540894, "mean_token_accuracy": 0.8980493247509003, "num_tokens": 2639904.0, "step": 214 }, { "entropy": 1.3341316282749176, "epoch": 0.11321748288572933, "grad_norm": 0.5709004998207092, "learning_rate": 0.00010726817042606516, "loss": 0.22839783132076263, "mean_token_accuracy": 0.9137850105762482, "num_tokens": 2652240.0, "step": 215 }, { "entropy": 1.397248774766922, "epoch": 0.11374407582938388, "grad_norm": 0.6649454236030579, "learning_rate": 0.00010776942355889726, "loss": 0.2758176624774933, "mean_token_accuracy": 0.8951268941164017, "num_tokens": 2664576.0, "step": 216 }, { "entropy": 1.3985490798950195, "epoch": 0.11427066877303844, "grad_norm": 0.6822545528411865, "learning_rate": 0.00010827067669172932, "loss": 0.2714245021343231, "mean_token_accuracy": 0.9002304524183273, "num_tokens": 2676912.0, "step": 217 }, { "entropy": 1.4322108924388885, "epoch": 0.114797261716693, "grad_norm": 0.6045425534248352, "learning_rate": 0.00010877192982456141, "loss": 0.27720269560813904, "mean_token_accuracy": 0.8973477184772491, "num_tokens": 2689248.0, "step": 218 }, { "entropy": 1.412218064069748, "epoch": 0.11532385466034756, "grad_norm": 0.5996334552764893, "learning_rate": 0.00010927318295739348, "loss": 0.2552666962146759, "mean_token_accuracy": 0.9052979648113251, "num_tokens": 2701584.0, "step": 219 }, { "entropy": 1.4080830514431, "epoch": 0.11585044760400211, "grad_norm": 0.5775550007820129, "learning_rate": 0.00010977443609022557, "loss": 0.26107677817344666, "mean_token_accuracy": 0.902474120259285, "num_tokens": 2713920.0, "step": 220 }, { "entropy": 1.4139901399612427, "epoch": 0.11637704054765666, "grad_norm": 0.5853016972541809, "learning_rate": 0.00011027568922305764, "loss": 0.2802305519580841, "mean_token_accuracy": 0.8949225097894669, "num_tokens": 2726256.0, "step": 221 }, { "entropy": 1.354727566242218, "epoch": 0.11690363349131122, "grad_norm": 0.6593271493911743, "learning_rate": 0.00011077694235588973, "loss": 0.25806909799575806, "mean_token_accuracy": 0.9009847342967987, "num_tokens": 2738592.0, "step": 222 }, { "entropy": 1.363867849111557, "epoch": 0.11743022643496577, "grad_norm": 0.5569132566452026, "learning_rate": 0.00011127819548872181, "loss": 0.2619836926460266, "mean_token_accuracy": 0.9014725536108017, "num_tokens": 2750928.0, "step": 223 }, { "entropy": 1.4332265555858612, "epoch": 0.11795681937862032, "grad_norm": 0.6189314723014832, "learning_rate": 0.00011177944862155389, "loss": 0.26161426305770874, "mean_token_accuracy": 0.8975115269422531, "num_tokens": 2763264.0, "step": 224 }, { "entropy": 1.3454554677009583, "epoch": 0.11848341232227488, "grad_norm": 0.6003779768943787, "learning_rate": 0.00011228070175438597, "loss": 0.2651001214981079, "mean_token_accuracy": 0.9023340046405792, "num_tokens": 2775600.0, "step": 225 }, { "entropy": 1.3587769269943237, "epoch": 0.11901000526592943, "grad_norm": 0.7411830425262451, "learning_rate": 0.00011278195488721806, "loss": 0.2888566851615906, "mean_token_accuracy": 0.895685225725174, "num_tokens": 2787936.0, "step": 226 }, { "entropy": 1.4554640650749207, "epoch": 0.119536598209584, "grad_norm": 0.6714136004447937, "learning_rate": 0.00011328320802005013, "loss": 0.2898600101470947, "mean_token_accuracy": 0.8905848562717438, "num_tokens": 2800272.0, "step": 227 }, { "entropy": 1.4274349808692932, "epoch": 0.12006319115323855, "grad_norm": 0.5972358584403992, "learning_rate": 0.00011378446115288222, "loss": 0.2719231843948364, "mean_token_accuracy": 0.8995204567909241, "num_tokens": 2812608.0, "step": 228 }, { "entropy": 1.3975107669830322, "epoch": 0.1205897840968931, "grad_norm": 0.7388063073158264, "learning_rate": 0.00011428571428571428, "loss": 0.2811048924922943, "mean_token_accuracy": 0.8961653858423233, "num_tokens": 2824944.0, "step": 229 }, { "entropy": 1.41668900847435, "epoch": 0.12111637704054766, "grad_norm": 0.6408892273902893, "learning_rate": 0.00011478696741854638, "loss": 0.23900066316127777, "mean_token_accuracy": 0.9131550490856171, "num_tokens": 2837280.0, "step": 230 }, { "entropy": 1.4389840960502625, "epoch": 0.12164296998420221, "grad_norm": 0.6279134154319763, "learning_rate": 0.00011528822055137844, "loss": 0.27471503615379333, "mean_token_accuracy": 0.8994272202253342, "num_tokens": 2849616.0, "step": 231 }, { "entropy": 1.3705064952373505, "epoch": 0.12216956292785677, "grad_norm": 0.7351282835006714, "learning_rate": 0.00011578947368421053, "loss": 0.2829359471797943, "mean_token_accuracy": 0.8966951966285706, "num_tokens": 2861952.0, "step": 232 }, { "entropy": 1.4880229830741882, "epoch": 0.12269615587151132, "grad_norm": 0.6098307371139526, "learning_rate": 0.0001162907268170426, "loss": 0.25372314453125, "mean_token_accuracy": 0.901044175028801, "num_tokens": 2874288.0, "step": 233 }, { "entropy": 1.4908549189567566, "epoch": 0.12322274881516587, "grad_norm": 0.6075619459152222, "learning_rate": 0.00011679197994987469, "loss": 0.2654881477355957, "mean_token_accuracy": 0.8972955793142319, "num_tokens": 2886624.0, "step": 234 }, { "entropy": 1.3783467411994934, "epoch": 0.12374934175882044, "grad_norm": 0.6030115485191345, "learning_rate": 0.00011729323308270677, "loss": 0.25111234188079834, "mean_token_accuracy": 0.902543842792511, "num_tokens": 2898960.0, "step": 235 }, { "entropy": 1.3683518171310425, "epoch": 0.12427593470247499, "grad_norm": 0.6671847105026245, "learning_rate": 0.00011779448621553886, "loss": 0.25656643509864807, "mean_token_accuracy": 0.9067094326019287, "num_tokens": 2911296.0, "step": 236 }, { "entropy": 1.4006175696849823, "epoch": 0.12480252764612954, "grad_norm": 0.5684525370597839, "learning_rate": 0.00011829573934837093, "loss": 0.2626839876174927, "mean_token_accuracy": 0.9033264219760895, "num_tokens": 2923632.0, "step": 237 }, { "entropy": 1.335418850183487, "epoch": 0.1253291205897841, "grad_norm": 0.5542851090431213, "learning_rate": 0.00011879699248120302, "loss": 0.24251079559326172, "mean_token_accuracy": 0.9084768146276474, "num_tokens": 2935968.0, "step": 238 }, { "entropy": 1.3918206691741943, "epoch": 0.12585571353343866, "grad_norm": 0.7893558740615845, "learning_rate": 0.00011929824561403509, "loss": 0.2818213999271393, "mean_token_accuracy": 0.8929243236780167, "num_tokens": 2948304.0, "step": 239 }, { "entropy": 1.3344398736953735, "epoch": 0.1263823064770932, "grad_norm": 0.62665194272995, "learning_rate": 0.00011979949874686718, "loss": 0.24543407559394836, "mean_token_accuracy": 0.9088149815797806, "num_tokens": 2960640.0, "step": 240 }, { "entropy": 1.362634390592575, "epoch": 0.12690889942074776, "grad_norm": 0.6178820133209229, "learning_rate": 0.00012030075187969925, "loss": 0.24784636497497559, "mean_token_accuracy": 0.9079759418964386, "num_tokens": 2972976.0, "step": 241 }, { "entropy": 1.3410207033157349, "epoch": 0.12743549236440233, "grad_norm": 0.6127734780311584, "learning_rate": 0.00012080200501253134, "loss": 0.276973694562912, "mean_token_accuracy": 0.900666818022728, "num_tokens": 2985312.0, "step": 242 }, { "entropy": 1.3882217109203339, "epoch": 0.12796208530805686, "grad_norm": 0.6211519837379456, "learning_rate": 0.0001213032581453634, "loss": 0.29095229506492615, "mean_token_accuracy": 0.8922038376331329, "num_tokens": 2997648.0, "step": 243 }, { "entropy": 1.3064784407615662, "epoch": 0.12848867825171142, "grad_norm": 0.6020708084106445, "learning_rate": 0.0001218045112781955, "loss": 0.25750190019607544, "mean_token_accuracy": 0.8979595750570297, "num_tokens": 3009984.0, "step": 244 }, { "entropy": 1.3404588103294373, "epoch": 0.129015271195366, "grad_norm": 0.5311986804008484, "learning_rate": 0.00012230576441102757, "loss": 0.2417442798614502, "mean_token_accuracy": 0.9036334156990051, "num_tokens": 3022320.0, "step": 245 }, { "entropy": 1.3250301778316498, "epoch": 0.12954186413902052, "grad_norm": 0.6158598065376282, "learning_rate": 0.00012280701754385965, "loss": 0.28592783212661743, "mean_token_accuracy": 0.8968044072389603, "num_tokens": 3034656.0, "step": 246 }, { "entropy": 1.2895326018333435, "epoch": 0.1300684570826751, "grad_norm": 0.5133572816848755, "learning_rate": 0.00012330827067669173, "loss": 0.26722657680511475, "mean_token_accuracy": 0.899601012468338, "num_tokens": 3046992.0, "step": 247 }, { "entropy": 1.2834957540035248, "epoch": 0.13059505002632965, "grad_norm": 0.5774098038673401, "learning_rate": 0.0001238095238095238, "loss": 0.2552984654903412, "mean_token_accuracy": 0.9021749496459961, "num_tokens": 3059328.0, "step": 248 }, { "entropy": 1.28067284822464, "epoch": 0.13112164296998421, "grad_norm": 0.5813867449760437, "learning_rate": 0.0001243107769423559, "loss": 0.26484355330467224, "mean_token_accuracy": 0.8958484381437302, "num_tokens": 3071664.0, "step": 249 }, { "entropy": 1.3292741775512695, "epoch": 0.13164823591363875, "grad_norm": 0.5437096357345581, "learning_rate": 0.00012481203007518797, "loss": 0.25312983989715576, "mean_token_accuracy": 0.9083140790462494, "num_tokens": 3084000.0, "step": 250 }, { "entropy": 1.217045933008194, "epoch": 0.1321748288572933, "grad_norm": 0.5642932057380676, "learning_rate": 0.00012531328320802005, "loss": 0.24098949134349823, "mean_token_accuracy": 0.9082589000463486, "num_tokens": 3096336.0, "step": 251 }, { "entropy": 1.3332138061523438, "epoch": 0.13270142180094788, "grad_norm": 0.5955415368080139, "learning_rate": 0.00012581453634085213, "loss": 0.2849401831626892, "mean_token_accuracy": 0.8916681408882141, "num_tokens": 3108672.0, "step": 252 }, { "entropy": 1.295847773551941, "epoch": 0.1332280147446024, "grad_norm": 0.6146616339683533, "learning_rate": 0.0001263157894736842, "loss": 0.2735283076763153, "mean_token_accuracy": 0.8989967852830887, "num_tokens": 3121008.0, "step": 253 }, { "entropy": 1.2074873447418213, "epoch": 0.13375460768825698, "grad_norm": 0.5243288278579712, "learning_rate": 0.0001268170426065163, "loss": 0.24956879019737244, "mean_token_accuracy": 0.9056222587823868, "num_tokens": 3133344.0, "step": 254 }, { "entropy": 1.2322421371936798, "epoch": 0.13428120063191154, "grad_norm": 0.5780612230300903, "learning_rate": 0.00012731829573934836, "loss": 0.22142812609672546, "mean_token_accuracy": 0.9111984372138977, "num_tokens": 3145680.0, "step": 255 }, { "entropy": 1.2550228536128998, "epoch": 0.13480779357556608, "grad_norm": 0.5654560923576355, "learning_rate": 0.00012781954887218047, "loss": 0.2577667236328125, "mean_token_accuracy": 0.9028536081314087, "num_tokens": 3158016.0, "step": 256 }, { "entropy": 1.2815439105033875, "epoch": 0.13533438651922064, "grad_norm": 0.5860424041748047, "learning_rate": 0.00012832080200501252, "loss": 0.24961405992507935, "mean_token_accuracy": 0.9073447585105896, "num_tokens": 3170352.0, "step": 257 }, { "entropy": 1.3496994376182556, "epoch": 0.1358609794628752, "grad_norm": 0.5496608018875122, "learning_rate": 0.00012882205513784463, "loss": 0.23788216710090637, "mean_token_accuracy": 0.913466677069664, "num_tokens": 3182688.0, "step": 258 }, { "entropy": 1.2379789352416992, "epoch": 0.13638757240652974, "grad_norm": 0.5407847166061401, "learning_rate": 0.00012932330827067668, "loss": 0.242479607462883, "mean_token_accuracy": 0.9110987186431885, "num_tokens": 3195024.0, "step": 259 }, { "entropy": 1.2678188979625702, "epoch": 0.1369141653501843, "grad_norm": 0.6954227089881897, "learning_rate": 0.0001298245614035088, "loss": 0.3035907447338104, "mean_token_accuracy": 0.8935103565454483, "num_tokens": 3207360.0, "step": 260 }, { "entropy": 1.2501021325588226, "epoch": 0.13744075829383887, "grad_norm": 0.6763582825660706, "learning_rate": 0.00013032581453634084, "loss": 0.2833873927593231, "mean_token_accuracy": 0.8930742889642715, "num_tokens": 3219696.0, "step": 261 }, { "entropy": 1.2093367278575897, "epoch": 0.13796735123749343, "grad_norm": 0.5583021640777588, "learning_rate": 0.00013082706766917294, "loss": 0.23031063377857208, "mean_token_accuracy": 0.9110294431447983, "num_tokens": 3232032.0, "step": 262 }, { "entropy": 1.2286772429943085, "epoch": 0.13849394418114797, "grad_norm": 0.5849270224571228, "learning_rate": 0.00013132832080200502, "loss": 0.27444857358932495, "mean_token_accuracy": 0.8965310454368591, "num_tokens": 3244368.0, "step": 263 }, { "entropy": 1.2541997134685516, "epoch": 0.13902053712480253, "grad_norm": 0.5210989713668823, "learning_rate": 0.0001318295739348371, "loss": 0.24464797973632812, "mean_token_accuracy": 0.9072559326887131, "num_tokens": 3256704.0, "step": 264 }, { "entropy": 1.2401838898658752, "epoch": 0.1395471300684571, "grad_norm": 0.5357401371002197, "learning_rate": 0.00013233082706766918, "loss": 0.24787980318069458, "mean_token_accuracy": 0.9098693877458572, "num_tokens": 3269040.0, "step": 265 }, { "entropy": 1.2660530507564545, "epoch": 0.14007372301211163, "grad_norm": 0.5940161943435669, "learning_rate": 0.00013283208020050126, "loss": 0.27411437034606934, "mean_token_accuracy": 0.8980700373649597, "num_tokens": 3281376.0, "step": 266 }, { "entropy": 1.241824746131897, "epoch": 0.1406003159557662, "grad_norm": 0.604097306728363, "learning_rate": 0.00013333333333333334, "loss": 0.2866377830505371, "mean_token_accuracy": 0.8919961899518967, "num_tokens": 3293712.0, "step": 267 }, { "entropy": 1.1769486963748932, "epoch": 0.14112690889942076, "grad_norm": 0.7264558672904968, "learning_rate": 0.00013383458646616542, "loss": 0.26414263248443604, "mean_token_accuracy": 0.8967715352773666, "num_tokens": 3306048.0, "step": 268 }, { "entropy": 1.2283678948879242, "epoch": 0.1416535018430753, "grad_norm": 0.5465900301933289, "learning_rate": 0.0001343358395989975, "loss": 0.2366294264793396, "mean_token_accuracy": 0.9092733561992645, "num_tokens": 3318384.0, "step": 269 }, { "entropy": 1.262256383895874, "epoch": 0.14218009478672985, "grad_norm": 0.5315939784049988, "learning_rate": 0.00013483709273182958, "loss": 0.22708219289779663, "mean_token_accuracy": 0.914520725607872, "num_tokens": 3330720.0, "step": 270 }, { "entropy": 1.175988882780075, "epoch": 0.14270668773038442, "grad_norm": 0.5613946318626404, "learning_rate": 0.00013533834586466166, "loss": 0.22835803031921387, "mean_token_accuracy": 0.9081931263208389, "num_tokens": 3343056.0, "step": 271 }, { "entropy": 1.2391490042209625, "epoch": 0.14323328067403895, "grad_norm": 0.5381202101707458, "learning_rate": 0.00013583959899749373, "loss": 0.25535333156585693, "mean_token_accuracy": 0.9033481776714325, "num_tokens": 3355392.0, "step": 272 }, { "entropy": 1.2381133437156677, "epoch": 0.14375987361769352, "grad_norm": 0.6545175909996033, "learning_rate": 0.00013634085213032581, "loss": 0.268245667219162, "mean_token_accuracy": 0.9008642733097076, "num_tokens": 3367728.0, "step": 273 }, { "entropy": 1.2534950375556946, "epoch": 0.14428646656134808, "grad_norm": 0.6084462404251099, "learning_rate": 0.0001368421052631579, "loss": 0.241957426071167, "mean_token_accuracy": 0.9131230562925339, "num_tokens": 3380064.0, "step": 274 }, { "entropy": 1.2566357254981995, "epoch": 0.14481305950500264, "grad_norm": 0.5803132057189941, "learning_rate": 0.00013734335839598997, "loss": 0.24542784690856934, "mean_token_accuracy": 0.9083303511142731, "num_tokens": 3392400.0, "step": 275 }, { "entropy": 1.3298097252845764, "epoch": 0.14533965244865718, "grad_norm": 0.5581626296043396, "learning_rate": 0.00013784461152882208, "loss": 0.2682327330112457, "mean_token_accuracy": 0.8970459997653961, "num_tokens": 3404736.0, "step": 276 }, { "entropy": 1.2984472513198853, "epoch": 0.14586624539231174, "grad_norm": 0.5797234177589417, "learning_rate": 0.00013834586466165413, "loss": 0.2551107406616211, "mean_token_accuracy": 0.9025808274745941, "num_tokens": 3417072.0, "step": 277 }, { "entropy": 1.232091337442398, "epoch": 0.1463928383359663, "grad_norm": 0.56398606300354, "learning_rate": 0.00013884711779448624, "loss": 0.2523190379142761, "mean_token_accuracy": 0.9042512625455856, "num_tokens": 3429408.0, "step": 278 }, { "entropy": 1.364453375339508, "epoch": 0.14691943127962084, "grad_norm": 0.5884234309196472, "learning_rate": 0.0001393483709273183, "loss": 0.2788117229938507, "mean_token_accuracy": 0.90156190097332, "num_tokens": 3441744.0, "step": 279 }, { "entropy": 1.2391767501831055, "epoch": 0.1474460242232754, "grad_norm": 0.5528289079666138, "learning_rate": 0.0001398496240601504, "loss": 0.2562858760356903, "mean_token_accuracy": 0.905647337436676, "num_tokens": 3454080.0, "step": 280 }, { "entropy": 1.3013744056224823, "epoch": 0.14797261716692997, "grad_norm": 0.5353385806083679, "learning_rate": 0.00014035087719298245, "loss": 0.24675647914409637, "mean_token_accuracy": 0.9100503474473953, "num_tokens": 3466416.0, "step": 281 }, { "entropy": 1.2755855023860931, "epoch": 0.1484992101105845, "grad_norm": 0.5495297908782959, "learning_rate": 0.00014085213032581455, "loss": 0.2519223690032959, "mean_token_accuracy": 0.8966221362352371, "num_tokens": 3478752.0, "step": 282 }, { "entropy": 1.303219497203827, "epoch": 0.14902580305423907, "grad_norm": 0.5309876203536987, "learning_rate": 0.0001413533834586466, "loss": 0.24427109956741333, "mean_token_accuracy": 0.9075532704591751, "num_tokens": 3491088.0, "step": 283 }, { "entropy": 1.2614858448505402, "epoch": 0.14955239599789363, "grad_norm": 0.5807812809944153, "learning_rate": 0.0001418546365914787, "loss": 0.26809874176979065, "mean_token_accuracy": 0.899653896689415, "num_tokens": 3503424.0, "step": 284 }, { "entropy": 1.2611050605773926, "epoch": 0.1500789889415482, "grad_norm": 0.5592539310455322, "learning_rate": 0.0001423558897243108, "loss": 0.26588040590286255, "mean_token_accuracy": 0.8970725983381271, "num_tokens": 3515760.0, "step": 285 }, { "entropy": 1.2830645143985748, "epoch": 0.15060558188520273, "grad_norm": 0.5146520733833313, "learning_rate": 0.00014285714285714287, "loss": 0.24322782456874847, "mean_token_accuracy": 0.9055588096380234, "num_tokens": 3528096.0, "step": 286 }, { "entropy": 1.2292780876159668, "epoch": 0.1511321748288573, "grad_norm": 0.588441789150238, "learning_rate": 0.00014335839598997495, "loss": 0.2558269202709198, "mean_token_accuracy": 0.8964600563049316, "num_tokens": 3540432.0, "step": 287 }, { "entropy": 1.2410956919193268, "epoch": 0.15165876777251186, "grad_norm": 0.5761001706123352, "learning_rate": 0.00014385964912280703, "loss": 0.2511615455150604, "mean_token_accuracy": 0.9040048718452454, "num_tokens": 3552768.0, "step": 288 }, { "entropy": 1.3154540359973907, "epoch": 0.1521853607161664, "grad_norm": 0.6528503894805908, "learning_rate": 0.0001443609022556391, "loss": 0.2512635290622711, "mean_token_accuracy": 0.9024206399917603, "num_tokens": 3565104.0, "step": 289 }, { "entropy": 1.2947738468647003, "epoch": 0.15271195365982096, "grad_norm": 0.6061785221099854, "learning_rate": 0.00014486215538847118, "loss": 0.25342220067977905, "mean_token_accuracy": 0.9054669588804245, "num_tokens": 3577440.0, "step": 290 }, { "entropy": 1.2879831790924072, "epoch": 0.15323854660347552, "grad_norm": 0.5570182800292969, "learning_rate": 0.00014536340852130326, "loss": 0.27056393027305603, "mean_token_accuracy": 0.8992442786693573, "num_tokens": 3589776.0, "step": 291 }, { "entropy": 1.3449256420135498, "epoch": 0.15376513954713006, "grad_norm": 0.4950920045375824, "learning_rate": 0.00014586466165413534, "loss": 0.24097028374671936, "mean_token_accuracy": 0.9014376401901245, "num_tokens": 3602112.0, "step": 292 }, { "entropy": 1.4016221165657043, "epoch": 0.15429173249078462, "grad_norm": 0.554709792137146, "learning_rate": 0.00014636591478696742, "loss": 0.2270800769329071, "mean_token_accuracy": 0.9162011295557022, "num_tokens": 3614448.0, "step": 293 }, { "entropy": 1.514324426651001, "epoch": 0.15481832543443919, "grad_norm": 0.5531271696090698, "learning_rate": 0.0001468671679197995, "loss": 0.24683888256549835, "mean_token_accuracy": 0.9074130207300186, "num_tokens": 3626784.0, "step": 294 }, { "entropy": 1.471198707818985, "epoch": 0.15534491837809372, "grad_norm": 0.6712215542793274, "learning_rate": 0.00014736842105263158, "loss": 0.281759113073349, "mean_token_accuracy": 0.8955343812704086, "num_tokens": 3639120.0, "step": 295 }, { "entropy": 1.4630400836467743, "epoch": 0.15587151132174829, "grad_norm": 0.561416506767273, "learning_rate": 0.00014786967418546366, "loss": 0.275588721036911, "mean_token_accuracy": 0.8987540155649185, "num_tokens": 3651456.0, "step": 296 }, { "entropy": 1.491294264793396, "epoch": 0.15639810426540285, "grad_norm": 0.5332501530647278, "learning_rate": 0.00014837092731829574, "loss": 0.2502642273902893, "mean_token_accuracy": 0.9047496467828751, "num_tokens": 3663792.0, "step": 297 }, { "entropy": 1.3809879124164581, "epoch": 0.1569246972090574, "grad_norm": 0.499104768037796, "learning_rate": 0.00014887218045112784, "loss": 0.23079532384872437, "mean_token_accuracy": 0.909051313996315, "num_tokens": 3676128.0, "step": 298 }, { "entropy": 1.3202951848506927, "epoch": 0.15745129015271195, "grad_norm": 0.5114240646362305, "learning_rate": 0.0001493734335839599, "loss": 0.26147356629371643, "mean_token_accuracy": 0.9033501297235489, "num_tokens": 3688464.0, "step": 299 }, { "entropy": 1.3542028069496155, "epoch": 0.1579778830963665, "grad_norm": 0.492830753326416, "learning_rate": 0.000149874686716792, "loss": 0.2421473264694214, "mean_token_accuracy": 0.9081345945596695, "num_tokens": 3700800.0, "step": 300 }, { "entropy": 1.2910203635692596, "epoch": 0.15850447604002108, "grad_norm": 0.4862864911556244, "learning_rate": 0.00015037593984962405, "loss": 0.24877643585205078, "mean_token_accuracy": 0.9057342112064362, "num_tokens": 3713136.0, "step": 301 }, { "entropy": 1.3562625646591187, "epoch": 0.1590310689836756, "grad_norm": 0.6064998507499695, "learning_rate": 0.00015087719298245616, "loss": 0.2678510546684265, "mean_token_accuracy": 0.895992174744606, "num_tokens": 3725472.0, "step": 302 }, { "entropy": 1.3357418477535248, "epoch": 0.15955766192733017, "grad_norm": 0.5504618883132935, "learning_rate": 0.0001513784461152882, "loss": 0.24523413181304932, "mean_token_accuracy": 0.9103363454341888, "num_tokens": 3737808.0, "step": 303 }, { "entropy": 1.3335883915424347, "epoch": 0.16008425487098474, "grad_norm": 0.73444664478302, "learning_rate": 0.00015187969924812032, "loss": 0.2613740563392639, "mean_token_accuracy": 0.8996832072734833, "num_tokens": 3750144.0, "step": 304 }, { "entropy": 1.3423579335212708, "epoch": 0.16061084781463927, "grad_norm": 0.5342377424240112, "learning_rate": 0.00015238095238095237, "loss": 0.27072861790657043, "mean_token_accuracy": 0.8979348689317703, "num_tokens": 3762480.0, "step": 305 }, { "entropy": 1.2893436253070831, "epoch": 0.16113744075829384, "grad_norm": 0.49320632219314575, "learning_rate": 0.00015288220551378448, "loss": 0.24137352406978607, "mean_token_accuracy": 0.9123422801494598, "num_tokens": 3774816.0, "step": 306 }, { "entropy": 1.3107283115386963, "epoch": 0.1616640337019484, "grad_norm": 0.5037325620651245, "learning_rate": 0.00015338345864661653, "loss": 0.28284943103790283, "mean_token_accuracy": 0.8933527320623398, "num_tokens": 3787152.0, "step": 307 }, { "entropy": 1.2858748137950897, "epoch": 0.16219062664560294, "grad_norm": 0.7596031427383423, "learning_rate": 0.00015388471177944863, "loss": 0.2364031970500946, "mean_token_accuracy": 0.9070021212100983, "num_tokens": 3799488.0, "step": 308 }, { "entropy": 1.2649638950824738, "epoch": 0.1627172195892575, "grad_norm": 0.4712359607219696, "learning_rate": 0.0001543859649122807, "loss": 0.25866541266441345, "mean_token_accuracy": 0.8989972174167633, "num_tokens": 3811824.0, "step": 309 }, { "entropy": 1.1775002479553223, "epoch": 0.16324381253291206, "grad_norm": 0.47527384757995605, "learning_rate": 0.0001548872180451128, "loss": 0.22686654329299927, "mean_token_accuracy": 0.9112849235534668, "num_tokens": 3824160.0, "step": 310 }, { "entropy": 1.1848091185092926, "epoch": 0.16377040547656663, "grad_norm": 0.5009036064147949, "learning_rate": 0.00015538847117794487, "loss": 0.23199157416820526, "mean_token_accuracy": 0.9103835225105286, "num_tokens": 3836496.0, "step": 311 }, { "entropy": 1.1879796385765076, "epoch": 0.16429699842022116, "grad_norm": 0.530559778213501, "learning_rate": 0.00015588972431077695, "loss": 0.2687099277973175, "mean_token_accuracy": 0.9024157524108887, "num_tokens": 3848832.0, "step": 312 }, { "entropy": 1.1956203877925873, "epoch": 0.16482359136387573, "grad_norm": 0.5160781145095825, "learning_rate": 0.00015639097744360903, "loss": 0.24907854199409485, "mean_token_accuracy": 0.9046753495931625, "num_tokens": 3861168.0, "step": 313 }, { "entropy": 1.1685654819011688, "epoch": 0.1653501843075303, "grad_norm": 0.5312115550041199, "learning_rate": 0.0001568922305764411, "loss": 0.2576726973056793, "mean_token_accuracy": 0.9074427336454391, "num_tokens": 3873504.0, "step": 314 }, { "entropy": 1.1273577511310577, "epoch": 0.16587677725118483, "grad_norm": 0.6181286573410034, "learning_rate": 0.00015739348370927319, "loss": 0.23891520500183105, "mean_token_accuracy": 0.9119571298360825, "num_tokens": 3885840.0, "step": 315 }, { "entropy": 1.2541460990905762, "epoch": 0.1664033701948394, "grad_norm": 0.4766935408115387, "learning_rate": 0.00015789473684210527, "loss": 0.25483545660972595, "mean_token_accuracy": 0.8961910307407379, "num_tokens": 3898176.0, "step": 316 }, { "entropy": 1.1125807464122772, "epoch": 0.16692996313849395, "grad_norm": 0.5105007886886597, "learning_rate": 0.00015839598997493734, "loss": 0.2685958445072174, "mean_token_accuracy": 0.8989451825618744, "num_tokens": 3910512.0, "step": 317 }, { "entropy": 1.2121298015117645, "epoch": 0.1674565560821485, "grad_norm": 0.44646549224853516, "learning_rate": 0.00015889724310776942, "loss": 0.253686785697937, "mean_token_accuracy": 0.9083440899848938, "num_tokens": 3922848.0, "step": 318 }, { "entropy": 1.1011106967926025, "epoch": 0.16798314902580305, "grad_norm": 0.46656280755996704, "learning_rate": 0.0001593984962406015, "loss": 0.2927643060684204, "mean_token_accuracy": 0.8931492418050766, "num_tokens": 3935184.0, "step": 319 }, { "entropy": 1.1864506900310516, "epoch": 0.16850974196945762, "grad_norm": 0.4583514332771301, "learning_rate": 0.00015989974937343358, "loss": 0.22579318284988403, "mean_token_accuracy": 0.9128856211900711, "num_tokens": 3947520.0, "step": 320 }, { "entropy": 1.113357663154602, "epoch": 0.16903633491311215, "grad_norm": 0.5008531212806702, "learning_rate": 0.00016040100250626566, "loss": 0.2566073536872864, "mean_token_accuracy": 0.9067006707191467, "num_tokens": 3959856.0, "step": 321 }, { "entropy": 1.1666322350502014, "epoch": 0.16956292785676672, "grad_norm": 0.5016852021217346, "learning_rate": 0.00016090225563909777, "loss": 0.24807997047901154, "mean_token_accuracy": 0.9074774533510208, "num_tokens": 3972192.0, "step": 322 }, { "entropy": 1.0860579013824463, "epoch": 0.17008952080042128, "grad_norm": 0.5153301358222961, "learning_rate": 0.00016140350877192982, "loss": 0.2500810921192169, "mean_token_accuracy": 0.9049581736326218, "num_tokens": 3984528.0, "step": 323 }, { "entropy": 1.0754130184650421, "epoch": 0.17061611374407584, "grad_norm": 0.5485661625862122, "learning_rate": 0.00016190476190476192, "loss": 0.3087775707244873, "mean_token_accuracy": 0.8840746134519577, "num_tokens": 3996864.0, "step": 324 }, { "entropy": 1.097093939781189, "epoch": 0.17114270668773038, "grad_norm": 0.4524535834789276, "learning_rate": 0.00016240601503759398, "loss": 0.2556874454021454, "mean_token_accuracy": 0.9040686786174774, "num_tokens": 4009200.0, "step": 325 }, { "entropy": 1.0161993354558945, "epoch": 0.17166929963138494, "grad_norm": 0.5920532941818237, "learning_rate": 0.00016290726817042608, "loss": 0.2545970678329468, "mean_token_accuracy": 0.9038624912500381, "num_tokens": 4021536.0, "step": 326 }, { "entropy": 1.045365571975708, "epoch": 0.1721958925750395, "grad_norm": 0.5128290057182312, "learning_rate": 0.00016340852130325813, "loss": 0.23849724233150482, "mean_token_accuracy": 0.9063487350940704, "num_tokens": 4033872.0, "step": 327 }, { "entropy": 1.0524345636367798, "epoch": 0.17272248551869404, "grad_norm": 0.5058865547180176, "learning_rate": 0.00016390977443609024, "loss": 0.25231170654296875, "mean_token_accuracy": 0.9029942154884338, "num_tokens": 4046208.0, "step": 328 }, { "entropy": 1.1274868845939636, "epoch": 0.1732490784623486, "grad_norm": 0.5103746652603149, "learning_rate": 0.0001644110275689223, "loss": 0.26119422912597656, "mean_token_accuracy": 0.8970126211643219, "num_tokens": 4058544.0, "step": 329 }, { "entropy": 1.13772451877594, "epoch": 0.17377567140600317, "grad_norm": 0.463789701461792, "learning_rate": 0.0001649122807017544, "loss": 0.23172324895858765, "mean_token_accuracy": 0.9090371131896973, "num_tokens": 4070880.0, "step": 330 }, { "entropy": 1.1093823909759521, "epoch": 0.1743022643496577, "grad_norm": 0.4940638542175293, "learning_rate": 0.00016541353383458648, "loss": 0.25032839179039, "mean_token_accuracy": 0.9061925411224365, "num_tokens": 4083216.0, "step": 331 }, { "entropy": 1.0906598567962646, "epoch": 0.17482885729331227, "grad_norm": 0.5244042873382568, "learning_rate": 0.00016591478696741856, "loss": 0.2559994161128998, "mean_token_accuracy": 0.9056536555290222, "num_tokens": 4095552.0, "step": 332 }, { "entropy": 1.0064781606197357, "epoch": 0.17535545023696683, "grad_norm": 0.5328090786933899, "learning_rate": 0.00016641604010025064, "loss": 0.2423868030309677, "mean_token_accuracy": 0.9023227244615555, "num_tokens": 4107888.0, "step": 333 }, { "entropy": 0.9421130269765854, "epoch": 0.17588204318062137, "grad_norm": 0.4938746392726898, "learning_rate": 0.00016691729323308271, "loss": 0.2487686276435852, "mean_token_accuracy": 0.9072201699018478, "num_tokens": 4120224.0, "step": 334 }, { "entropy": 0.8471245914697647, "epoch": 0.17640863612427593, "grad_norm": 0.4719039499759674, "learning_rate": 0.0001674185463659148, "loss": 0.2677307426929474, "mean_token_accuracy": 0.89954973757267, "num_tokens": 4132560.0, "step": 335 }, { "entropy": 0.7532882988452911, "epoch": 0.1769352290679305, "grad_norm": 0.4836346209049225, "learning_rate": 0.00016791979949874687, "loss": 0.2508479356765747, "mean_token_accuracy": 0.9021095633506775, "num_tokens": 4144896.0, "step": 336 }, { "entropy": 0.6489329487085342, "epoch": 0.17746182201158506, "grad_norm": 0.5742446184158325, "learning_rate": 0.00016842105263157895, "loss": 0.2582406997680664, "mean_token_accuracy": 0.9013715237379074, "num_tokens": 4157232.0, "step": 337 }, { "entropy": 0.6537502855062485, "epoch": 0.1779884149552396, "grad_norm": 0.5390785336494446, "learning_rate": 0.00016892230576441103, "loss": 0.2649543881416321, "mean_token_accuracy": 0.8998610377311707, "num_tokens": 4169568.0, "step": 338 }, { "entropy": 0.6827399134635925, "epoch": 0.17851500789889416, "grad_norm": 0.507554829120636, "learning_rate": 0.0001694235588972431, "loss": 0.27018067240715027, "mean_token_accuracy": 0.8985839486122131, "num_tokens": 4181904.0, "step": 339 }, { "entropy": 0.7333462089300156, "epoch": 0.17904160084254872, "grad_norm": 0.4551506042480469, "learning_rate": 0.0001699248120300752, "loss": 0.25013625621795654, "mean_token_accuracy": 0.9111319333314896, "num_tokens": 4194240.0, "step": 340 }, { "entropy": 0.7495439946651459, "epoch": 0.17956819378620326, "grad_norm": 0.48456624150276184, "learning_rate": 0.00017042606516290727, "loss": 0.2707773745059967, "mean_token_accuracy": 0.8947316855192184, "num_tokens": 4206576.0, "step": 341 }, { "entropy": 0.7812775671482086, "epoch": 0.18009478672985782, "grad_norm": 0.4550190269947052, "learning_rate": 0.00017092731829573935, "loss": 0.2396947741508484, "mean_token_accuracy": 0.910267636179924, "num_tokens": 4218912.0, "step": 342 }, { "entropy": 0.9400374740362167, "epoch": 0.18062137967351238, "grad_norm": 0.5784738659858704, "learning_rate": 0.00017142857142857143, "loss": 0.26176217198371887, "mean_token_accuracy": 0.9009139388799667, "num_tokens": 4231248.0, "step": 343 }, { "entropy": 0.937469407916069, "epoch": 0.18114797261716692, "grad_norm": 0.5101773738861084, "learning_rate": 0.00017192982456140353, "loss": 0.222784623503685, "mean_token_accuracy": 0.9079811573028564, "num_tokens": 4243584.0, "step": 344 }, { "entropy": 0.9701919555664062, "epoch": 0.18167456556082148, "grad_norm": 0.4810556471347809, "learning_rate": 0.00017243107769423558, "loss": 0.25527724623680115, "mean_token_accuracy": 0.8977989107370377, "num_tokens": 4255920.0, "step": 345 }, { "entropy": 1.0421793162822723, "epoch": 0.18220115850447605, "grad_norm": 0.49446040391921997, "learning_rate": 0.0001729323308270677, "loss": 0.24790042638778687, "mean_token_accuracy": 0.9076082557439804, "num_tokens": 4268256.0, "step": 346 }, { "entropy": 1.0526159405708313, "epoch": 0.18272775144813058, "grad_norm": 0.5106586217880249, "learning_rate": 0.00017343358395989974, "loss": 0.258137047290802, "mean_token_accuracy": 0.9013570845127106, "num_tokens": 4280592.0, "step": 347 }, { "entropy": 1.0377429127693176, "epoch": 0.18325434439178515, "grad_norm": 0.5372883677482605, "learning_rate": 0.00017393483709273185, "loss": 0.2536155879497528, "mean_token_accuracy": 0.9079491943120956, "num_tokens": 4292928.0, "step": 348 }, { "entropy": 1.1226612329483032, "epoch": 0.1837809373354397, "grad_norm": 0.506536066532135, "learning_rate": 0.0001744360902255639, "loss": 0.2503521740436554, "mean_token_accuracy": 0.9043506681919098, "num_tokens": 4305264.0, "step": 349 }, { "entropy": 1.0955768823623657, "epoch": 0.18430753027909427, "grad_norm": 0.450717031955719, "learning_rate": 0.000174937343358396, "loss": 0.2611716687679291, "mean_token_accuracy": 0.9029702991247177, "num_tokens": 4317600.0, "step": 350 }, { "entropy": 1.1000354140996933, "epoch": 0.1848341232227488, "grad_norm": 0.5249627828598022, "learning_rate": 0.00017543859649122806, "loss": 0.23257189989089966, "mean_token_accuracy": 0.9120175540447235, "num_tokens": 4329936.0, "step": 351 }, { "entropy": 1.086414873600006, "epoch": 0.18536071616640337, "grad_norm": 0.488702654838562, "learning_rate": 0.00017593984962406016, "loss": 0.246709406375885, "mean_token_accuracy": 0.9029638320207596, "num_tokens": 4342272.0, "step": 352 }, { "entropy": 1.0042328536510468, "epoch": 0.18588730911005794, "grad_norm": 0.41849616169929504, "learning_rate": 0.00017644110275689224, "loss": 0.21574650704860687, "mean_token_accuracy": 0.9175253808498383, "num_tokens": 4354608.0, "step": 353 }, { "entropy": 1.0020455569028854, "epoch": 0.18641390205371247, "grad_norm": 0.46401116251945496, "learning_rate": 0.00017694235588972432, "loss": 0.2567673325538635, "mean_token_accuracy": 0.9054214805364609, "num_tokens": 4366944.0, "step": 354 }, { "entropy": 1.0092186033725739, "epoch": 0.18694049499736703, "grad_norm": 0.47048723697662354, "learning_rate": 0.0001774436090225564, "loss": 0.24711501598358154, "mean_token_accuracy": 0.9056050777435303, "num_tokens": 4379280.0, "step": 355 }, { "entropy": 0.9878545552492142, "epoch": 0.1874670879410216, "grad_norm": 0.47208353877067566, "learning_rate": 0.00017794486215538848, "loss": 0.2748403549194336, "mean_token_accuracy": 0.8964878469705582, "num_tokens": 4391616.0, "step": 356 }, { "entropy": 0.9895420670509338, "epoch": 0.18799368088467613, "grad_norm": 0.503665566444397, "learning_rate": 0.00017844611528822056, "loss": 0.24393996596336365, "mean_token_accuracy": 0.9081792533397675, "num_tokens": 4403952.0, "step": 357 }, { "entropy": 0.983001708984375, "epoch": 0.1885202738283307, "grad_norm": 0.5069933533668518, "learning_rate": 0.00017894736842105264, "loss": 0.2519129514694214, "mean_token_accuracy": 0.9055497497320175, "num_tokens": 4416288.0, "step": 358 }, { "entropy": 0.9950737804174423, "epoch": 0.18904686677198526, "grad_norm": 0.4974028766155243, "learning_rate": 0.00017944862155388472, "loss": 0.26243290305137634, "mean_token_accuracy": 0.8986903131008148, "num_tokens": 4428624.0, "step": 359 }, { "entropy": 1.0079210847616196, "epoch": 0.1895734597156398, "grad_norm": 0.5110583901405334, "learning_rate": 0.0001799498746867168, "loss": 0.2294146716594696, "mean_token_accuracy": 0.9131651520729065, "num_tokens": 4440960.0, "step": 360 }, { "entropy": 1.0026690363883972, "epoch": 0.19010005265929436, "grad_norm": 0.4598653316497803, "learning_rate": 0.00018045112781954887, "loss": 0.2722235321998596, "mean_token_accuracy": 0.8976626545190811, "num_tokens": 4453296.0, "step": 361 }, { "entropy": 1.0199629068374634, "epoch": 0.19062664560294892, "grad_norm": 0.4637596905231476, "learning_rate": 0.00018095238095238095, "loss": 0.2665867507457733, "mean_token_accuracy": 0.9000826925039291, "num_tokens": 4465632.0, "step": 362 }, { "entropy": 1.0425358265638351, "epoch": 0.1911532385466035, "grad_norm": 0.47371116280555725, "learning_rate": 0.00018145363408521303, "loss": 0.261046439409256, "mean_token_accuracy": 0.8978727906942368, "num_tokens": 4477968.0, "step": 363 }, { "entropy": 1.0688822865486145, "epoch": 0.19167983149025802, "grad_norm": 0.588598370552063, "learning_rate": 0.0001819548872180451, "loss": 0.2722393274307251, "mean_token_accuracy": 0.8954607844352722, "num_tokens": 4490304.0, "step": 364 }, { "entropy": 1.0311770141124725, "epoch": 0.1922064244339126, "grad_norm": 0.6127772331237793, "learning_rate": 0.0001824561403508772, "loss": 0.26557645201683044, "mean_token_accuracy": 0.898269534111023, "num_tokens": 4502640.0, "step": 365 }, { "entropy": 1.023191675543785, "epoch": 0.19273301737756715, "grad_norm": 0.4277988076210022, "learning_rate": 0.0001829573934837093, "loss": 0.25198060274124146, "mean_token_accuracy": 0.9041500091552734, "num_tokens": 4514976.0, "step": 366 }, { "entropy": 0.992491751909256, "epoch": 0.1932596103212217, "grad_norm": 0.4713631272315979, "learning_rate": 0.00018345864661654135, "loss": 0.25175848603248596, "mean_token_accuracy": 0.9065804481506348, "num_tokens": 4527312.0, "step": 367 }, { "entropy": 0.9969351142644882, "epoch": 0.19378620326487625, "grad_norm": 0.4729400873184204, "learning_rate": 0.00018395989974937345, "loss": 0.2526015341281891, "mean_token_accuracy": 0.9010139107704163, "num_tokens": 4539648.0, "step": 368 }, { "entropy": 1.0536664575338364, "epoch": 0.1943127962085308, "grad_norm": 0.5235168933868408, "learning_rate": 0.0001844611528822055, "loss": 0.292032927274704, "mean_token_accuracy": 0.8931012600660324, "num_tokens": 4551984.0, "step": 369 }, { "entropy": 1.042996197938919, "epoch": 0.19483938915218535, "grad_norm": 0.48083820939064026, "learning_rate": 0.0001849624060150376, "loss": 0.26578348875045776, "mean_token_accuracy": 0.9036569446325302, "num_tokens": 4564320.0, "step": 370 }, { "entropy": 1.0278095752000809, "epoch": 0.1953659820958399, "grad_norm": 0.39684435725212097, "learning_rate": 0.00018546365914786966, "loss": 0.23184379935264587, "mean_token_accuracy": 0.9090972989797592, "num_tokens": 4576656.0, "step": 371 }, { "entropy": 1.0532077848911285, "epoch": 0.19589257503949448, "grad_norm": 0.40189671516418457, "learning_rate": 0.00018596491228070177, "loss": 0.22099974751472473, "mean_token_accuracy": 0.9153455793857574, "num_tokens": 4588992.0, "step": 372 }, { "entropy": 1.090534657239914, "epoch": 0.196419167983149, "grad_norm": 0.4149918258190155, "learning_rate": 0.00018646616541353382, "loss": 0.26646703481674194, "mean_token_accuracy": 0.8960744440555573, "num_tokens": 4601328.0, "step": 373 }, { "entropy": 1.1020061373710632, "epoch": 0.19694576092680358, "grad_norm": 0.4702380299568176, "learning_rate": 0.00018696741854636593, "loss": 0.221252903342247, "mean_token_accuracy": 0.9114280194044113, "num_tokens": 4613664.0, "step": 374 }, { "entropy": 1.0703049004077911, "epoch": 0.19747235387045814, "grad_norm": 0.3877512216567993, "learning_rate": 0.00018746867167919798, "loss": 0.2393355667591095, "mean_token_accuracy": 0.9077306538820267, "num_tokens": 4626000.0, "step": 375 }, { "entropy": 1.1242592930793762, "epoch": 0.1979989468141127, "grad_norm": 0.4995574355125427, "learning_rate": 0.00018796992481203009, "loss": 0.26316261291503906, "mean_token_accuracy": 0.9027625322341919, "num_tokens": 4638336.0, "step": 376 }, { "entropy": 1.1577873229980469, "epoch": 0.19852553975776724, "grad_norm": 0.5234032273292542, "learning_rate": 0.00018847117794486217, "loss": 0.27375704050064087, "mean_token_accuracy": 0.8979371786117554, "num_tokens": 4650672.0, "step": 377 }, { "entropy": 1.1344494223594666, "epoch": 0.1990521327014218, "grad_norm": 0.5000519752502441, "learning_rate": 0.00018897243107769424, "loss": 0.26018521189689636, "mean_token_accuracy": 0.9034091979265213, "num_tokens": 4663008.0, "step": 378 }, { "entropy": 1.2858175039291382, "epoch": 0.19957872564507637, "grad_norm": 0.4786364436149597, "learning_rate": 0.00018947368421052632, "loss": 0.2609444260597229, "mean_token_accuracy": 0.8963579833507538, "num_tokens": 4675344.0, "step": 379 }, { "entropy": 1.205563873052597, "epoch": 0.2001053185887309, "grad_norm": 0.49225375056266785, "learning_rate": 0.0001899749373433584, "loss": 0.2702328562736511, "mean_token_accuracy": 0.89518603682518, "num_tokens": 4687680.0, "step": 380 }, { "entropy": 1.2623814940452576, "epoch": 0.20063191153238547, "grad_norm": 0.4847429692745209, "learning_rate": 0.00019047619047619048, "loss": 0.23678088188171387, "mean_token_accuracy": 0.9141177982091904, "num_tokens": 4700016.0, "step": 381 }, { "entropy": 1.2621397376060486, "epoch": 0.20115850447604003, "grad_norm": 0.42388200759887695, "learning_rate": 0.00019097744360902256, "loss": 0.22780729830265045, "mean_token_accuracy": 0.9121877998113632, "num_tokens": 4712352.0, "step": 382 }, { "entropy": 1.292501300573349, "epoch": 0.20168509741969456, "grad_norm": 0.4779922366142273, "learning_rate": 0.00019147869674185464, "loss": 0.2594977915287018, "mean_token_accuracy": 0.9015758037567139, "num_tokens": 4724688.0, "step": 383 }, { "entropy": 1.2592476904392242, "epoch": 0.20221169036334913, "grad_norm": 0.5031237006187439, "learning_rate": 0.00019197994987468672, "loss": 0.2655055820941925, "mean_token_accuracy": 0.8991453051567078, "num_tokens": 4737024.0, "step": 384 }, { "entropy": 1.2670154571533203, "epoch": 0.2027382833070037, "grad_norm": 0.43786391615867615, "learning_rate": 0.0001924812030075188, "loss": 0.2638092637062073, "mean_token_accuracy": 0.9021878391504288, "num_tokens": 4749360.0, "step": 385 }, { "entropy": 1.2625199258327484, "epoch": 0.20326487625065823, "grad_norm": 0.6012351512908936, "learning_rate": 0.00019298245614035088, "loss": 0.25398504734039307, "mean_token_accuracy": 0.9037431925535202, "num_tokens": 4761696.0, "step": 386 }, { "entropy": 1.2534445226192474, "epoch": 0.2037914691943128, "grad_norm": 0.48004376888275146, "learning_rate": 0.00019348370927318296, "loss": 0.24518710374832153, "mean_token_accuracy": 0.9088338762521744, "num_tokens": 4774032.0, "step": 387 }, { "entropy": 1.2239902317523956, "epoch": 0.20431806213796735, "grad_norm": 0.40316712856292725, "learning_rate": 0.00019398496240601503, "loss": 0.22658605873584747, "mean_token_accuracy": 0.9146187752485275, "num_tokens": 4786368.0, "step": 388 }, { "entropy": 1.236211746931076, "epoch": 0.20484465508162192, "grad_norm": 0.4805733859539032, "learning_rate": 0.0001944862155388471, "loss": 0.2645362615585327, "mean_token_accuracy": 0.899237260222435, "num_tokens": 4798704.0, "step": 389 }, { "entropy": 1.2168347239494324, "epoch": 0.20537124802527645, "grad_norm": 0.4017006754875183, "learning_rate": 0.00019498746867167922, "loss": 0.23945499956607819, "mean_token_accuracy": 0.9106440991163254, "num_tokens": 4811040.0, "step": 390 }, { "entropy": 1.2192648351192474, "epoch": 0.20589784096893102, "grad_norm": 0.4144308269023895, "learning_rate": 0.00019548872180451127, "loss": 0.24552568793296814, "mean_token_accuracy": 0.9093390554189682, "num_tokens": 4823376.0, "step": 391 }, { "entropy": 1.2436101734638214, "epoch": 0.20642443391258558, "grad_norm": 0.4212309420108795, "learning_rate": 0.00019598997493734338, "loss": 0.23153892159461975, "mean_token_accuracy": 0.9111403673887253, "num_tokens": 4835712.0, "step": 392 }, { "entropy": 1.255335807800293, "epoch": 0.20695102685624012, "grad_norm": 0.40789833664894104, "learning_rate": 0.00019649122807017543, "loss": 0.22183379530906677, "mean_token_accuracy": 0.9136195629835129, "num_tokens": 4848048.0, "step": 393 }, { "entropy": 1.2751134932041168, "epoch": 0.20747761979989468, "grad_norm": 0.4400269091129303, "learning_rate": 0.00019699248120300754, "loss": 0.24014121294021606, "mean_token_accuracy": 0.9085260182619095, "num_tokens": 4860384.0, "step": 394 }, { "entropy": 1.360796719789505, "epoch": 0.20800421274354924, "grad_norm": 0.4804284870624542, "learning_rate": 0.0001974937343358396, "loss": 0.25582095980644226, "mean_token_accuracy": 0.9006912261247635, "num_tokens": 4872720.0, "step": 395 }, { "entropy": 1.3161850571632385, "epoch": 0.20853080568720378, "grad_norm": 0.43244144320487976, "learning_rate": 0.0001979949874686717, "loss": 0.2349988967180252, "mean_token_accuracy": 0.9116800725460052, "num_tokens": 4885056.0, "step": 396 }, { "entropy": 1.3374731242656708, "epoch": 0.20905739863085834, "grad_norm": 0.4748205840587616, "learning_rate": 0.00019849624060150375, "loss": 0.22185081243515015, "mean_token_accuracy": 0.9125295132398605, "num_tokens": 4897392.0, "step": 397 }, { "entropy": 1.3775228261947632, "epoch": 0.2095839915745129, "grad_norm": 0.4581362307071686, "learning_rate": 0.00019899749373433585, "loss": 0.2567383646965027, "mean_token_accuracy": 0.9047663658857346, "num_tokens": 4909728.0, "step": 398 }, { "entropy": 1.4304566085338593, "epoch": 0.21011058451816747, "grad_norm": 0.5330026149749756, "learning_rate": 0.00019949874686716793, "loss": 0.24410131573677063, "mean_token_accuracy": 0.9004727154970169, "num_tokens": 4922064.0, "step": 399 }, { "entropy": 1.4176018834114075, "epoch": 0.210637177461822, "grad_norm": 0.5187347531318665, "learning_rate": 0.0002, "loss": 0.2622545063495636, "mean_token_accuracy": 0.8981441259384155, "num_tokens": 4934400.0, "step": 400 }, { "entropy": 1.3980787992477417, "epoch": 0.21116377040547657, "grad_norm": 0.4053288400173187, "learning_rate": 0.0001999999973286123, "loss": 0.23980936408042908, "mean_token_accuracy": 0.912782147526741, "num_tokens": 4946736.0, "step": 401 }, { "entropy": 1.4483689367771149, "epoch": 0.21169036334913113, "grad_norm": 0.45620113611221313, "learning_rate": 0.00019999998931444929, "loss": 0.25808754563331604, "mean_token_accuracy": 0.9030732810497284, "num_tokens": 4959072.0, "step": 402 }, { "entropy": 1.4470272064208984, "epoch": 0.21221695629278567, "grad_norm": 0.45807719230651855, "learning_rate": 0.0001999999759575115, "loss": 0.258093923330307, "mean_token_accuracy": 0.9026659429073334, "num_tokens": 4971408.0, "step": 403 }, { "entropy": 1.425654649734497, "epoch": 0.21274354923644023, "grad_norm": 0.4397832751274109, "learning_rate": 0.0001999999572577997, "loss": 0.24665014445781708, "mean_token_accuracy": 0.9062764793634415, "num_tokens": 4983744.0, "step": 404 }, { "entropy": 1.5687190890312195, "epoch": 0.2132701421800948, "grad_norm": 0.5367022156715393, "learning_rate": 0.00019999993321531494, "loss": 0.24174389243125916, "mean_token_accuracy": 0.9081769734621048, "num_tokens": 4996080.0, "step": 405 }, { "entropy": 1.405859649181366, "epoch": 0.21379673512374933, "grad_norm": 0.4007917046546936, "learning_rate": 0.00019999990383005872, "loss": 0.25402745604515076, "mean_token_accuracy": 0.9025277644395828, "num_tokens": 5008416.0, "step": 406 }, { "entropy": 1.4313717782497406, "epoch": 0.2143233280674039, "grad_norm": 0.4160802662372589, "learning_rate": 0.00019999986910203282, "loss": 0.24924606084823608, "mean_token_accuracy": 0.9043161869049072, "num_tokens": 5020752.0, "step": 407 }, { "entropy": 1.4701331555843353, "epoch": 0.21484992101105846, "grad_norm": 0.4316672086715698, "learning_rate": 0.00019999982903123921, "loss": 0.2638508379459381, "mean_token_accuracy": 0.8981801271438599, "num_tokens": 5033088.0, "step": 408 }, { "entropy": 1.4392390549182892, "epoch": 0.215376513954713, "grad_norm": 0.4544552266597748, "learning_rate": 0.00019999978361768031, "loss": 0.23990359902381897, "mean_token_accuracy": 0.9076667875051498, "num_tokens": 5045424.0, "step": 409 }, { "entropy": 1.4876410961151123, "epoch": 0.21590310689836756, "grad_norm": 0.4295142889022827, "learning_rate": 0.00019999973286135886, "loss": 0.21840089559555054, "mean_token_accuracy": 0.9214875847101212, "num_tokens": 5057760.0, "step": 410 }, { "entropy": 1.50434610247612, "epoch": 0.21642969984202212, "grad_norm": 0.4359295070171356, "learning_rate": 0.00019999967676227775, "loss": 0.2510741353034973, "mean_token_accuracy": 0.9052848815917969, "num_tokens": 5070096.0, "step": 411 }, { "entropy": 1.4829690754413605, "epoch": 0.21695629278567669, "grad_norm": 0.42792809009552, "learning_rate": 0.00019999961532044045, "loss": 0.2551060616970062, "mean_token_accuracy": 0.9011600762605667, "num_tokens": 5082432.0, "step": 412 }, { "entropy": 1.4852145910263062, "epoch": 0.21748288572933122, "grad_norm": 0.4182438850402832, "learning_rate": 0.00019999954853585052, "loss": 0.24789488315582275, "mean_token_accuracy": 0.9069723039865494, "num_tokens": 5094768.0, "step": 413 }, { "entropy": 1.4210355281829834, "epoch": 0.21800947867298578, "grad_norm": 0.42366713285446167, "learning_rate": 0.00019999947640851195, "loss": 0.24643118679523468, "mean_token_accuracy": 0.9047895669937134, "num_tokens": 5107104.0, "step": 414 }, { "entropy": 1.525164395570755, "epoch": 0.21853607161664035, "grad_norm": 0.4372459352016449, "learning_rate": 0.00019999939893842905, "loss": 0.2424328625202179, "mean_token_accuracy": 0.9087924510240555, "num_tokens": 5119440.0, "step": 415 }, { "entropy": 1.4822115898132324, "epoch": 0.21906266456029488, "grad_norm": 0.4659183919429779, "learning_rate": 0.00019999931612560637, "loss": 0.22431665658950806, "mean_token_accuracy": 0.9165952354669571, "num_tokens": 5131776.0, "step": 416 }, { "entropy": 1.5467821657657623, "epoch": 0.21958925750394945, "grad_norm": 0.44125568866729736, "learning_rate": 0.00019999922797004884, "loss": 0.23688746988773346, "mean_token_accuracy": 0.9075507670640945, "num_tokens": 5144112.0, "step": 417 }, { "entropy": 1.4780353605747223, "epoch": 0.220115850447604, "grad_norm": 0.43714895844459534, "learning_rate": 0.00019999913447176174, "loss": 0.24803104996681213, "mean_token_accuracy": 0.9086460769176483, "num_tokens": 5156448.0, "step": 418 }, { "entropy": 1.442844033241272, "epoch": 0.22064244339125855, "grad_norm": 0.5062248110771179, "learning_rate": 0.00019999903563075051, "loss": 0.2509956657886505, "mean_token_accuracy": 0.9084739983081818, "num_tokens": 5168784.0, "step": 419 }, { "entropy": 1.472544252872467, "epoch": 0.2211690363349131, "grad_norm": 0.44560346007347107, "learning_rate": 0.00019999893144702116, "loss": 0.2571001648902893, "mean_token_accuracy": 0.9050741344690323, "num_tokens": 5181120.0, "step": 420 }, { "entropy": 1.4741449654102325, "epoch": 0.22169562927856767, "grad_norm": 0.468660444021225, "learning_rate": 0.00019999882192057975, "loss": 0.2654499113559723, "mean_token_accuracy": 0.9030983746051788, "num_tokens": 5193456.0, "step": 421 }, { "entropy": 1.4696997106075287, "epoch": 0.2222222222222222, "grad_norm": 0.42363062500953674, "learning_rate": 0.0001999987070514329, "loss": 0.2351139783859253, "mean_token_accuracy": 0.9069055020809174, "num_tokens": 5205792.0, "step": 422 }, { "entropy": 1.452900618314743, "epoch": 0.22274881516587677, "grad_norm": 0.45147648453712463, "learning_rate": 0.00019999858683958726, "loss": 0.236272394657135, "mean_token_accuracy": 0.9084236770868301, "num_tokens": 5218128.0, "step": 423 }, { "entropy": 1.5096050798892975, "epoch": 0.22327540810953134, "grad_norm": 0.4349573850631714, "learning_rate": 0.00019999846128505015, "loss": 0.21908816695213318, "mean_token_accuracy": 0.9153110533952713, "num_tokens": 5230464.0, "step": 424 }, { "entropy": 1.5504009425640106, "epoch": 0.2238020010531859, "grad_norm": 0.40080899000167847, "learning_rate": 0.00019999833038782897, "loss": 0.21589110791683197, "mean_token_accuracy": 0.9171598702669144, "num_tokens": 5242800.0, "step": 425 }, { "entropy": 1.4936735033988953, "epoch": 0.22432859399684044, "grad_norm": 0.4071311056613922, "learning_rate": 0.0001999981941479314, "loss": 0.2125779092311859, "mean_token_accuracy": 0.9237974286079407, "num_tokens": 5255136.0, "step": 426 }, { "entropy": 1.5081810355186462, "epoch": 0.224855186940495, "grad_norm": 0.4242808222770691, "learning_rate": 0.0001999980525653656, "loss": 0.2447715699672699, "mean_token_accuracy": 0.9042525738477707, "num_tokens": 5267472.0, "step": 427 }, { "entropy": 1.5077386796474457, "epoch": 0.22538177988414956, "grad_norm": 0.5070521235466003, "learning_rate": 0.00019999790564014, "loss": 0.26209956407546997, "mean_token_accuracy": 0.9026446640491486, "num_tokens": 5279808.0, "step": 428 }, { "entropy": 1.4962070286273956, "epoch": 0.2259083728278041, "grad_norm": 0.6017259955406189, "learning_rate": 0.00019999775337226327, "loss": 0.3165000081062317, "mean_token_accuracy": 0.8868077397346497, "num_tokens": 5292144.0, "step": 429 }, { "entropy": 1.4911207258701324, "epoch": 0.22643496577145866, "grad_norm": 0.47006961703300476, "learning_rate": 0.00019999759576174448, "loss": 0.22799812257289886, "mean_token_accuracy": 0.9069435149431229, "num_tokens": 5304480.0, "step": 430 }, { "entropy": 1.5028018951416016, "epoch": 0.22696155871511323, "grad_norm": 0.4170990288257599, "learning_rate": 0.00019999743280859296, "loss": 0.21681472659111023, "mean_token_accuracy": 0.9184076339006424, "num_tokens": 5316816.0, "step": 431 }, { "entropy": 1.6698609590530396, "epoch": 0.22748815165876776, "grad_norm": 0.6547060012817383, "learning_rate": 0.0001999972645128184, "loss": 0.24768398702144623, "mean_token_accuracy": 0.9032211750745773, "num_tokens": 5329152.0, "step": 432 }, { "entropy": 1.549822211265564, "epoch": 0.22801474460242233, "grad_norm": 0.433370441198349, "learning_rate": 0.00019999709087443083, "loss": 0.24651046097278595, "mean_token_accuracy": 0.9072823375463486, "num_tokens": 5341488.0, "step": 433 }, { "entropy": 1.5724502205848694, "epoch": 0.2285413375460769, "grad_norm": 0.5081071853637695, "learning_rate": 0.00019999691189344045, "loss": 0.2539141774177551, "mean_token_accuracy": 0.901251494884491, "num_tokens": 5353824.0, "step": 434 }, { "entropy": 1.580730140209198, "epoch": 0.22906793048973143, "grad_norm": 0.4615112841129303, "learning_rate": 0.000199996727569858, "loss": 0.23179525136947632, "mean_token_accuracy": 0.9096536040306091, "num_tokens": 5366160.0, "step": 435 }, { "entropy": 1.6549272239208221, "epoch": 0.229594523433386, "grad_norm": 0.6388656497001648, "learning_rate": 0.00019999653790369438, "loss": 0.29721513390541077, "mean_token_accuracy": 0.8857980072498322, "num_tokens": 5378496.0, "step": 436 }, { "entropy": 1.6025878190994263, "epoch": 0.23012111637704055, "grad_norm": 0.49696317315101624, "learning_rate": 0.0001999963428949608, "loss": 0.2271474003791809, "mean_token_accuracy": 0.9138942360877991, "num_tokens": 5390832.0, "step": 437 }, { "entropy": 1.5836864113807678, "epoch": 0.23064770932069512, "grad_norm": 0.4876512289047241, "learning_rate": 0.00019999614254366895, "loss": 0.24330684542655945, "mean_token_accuracy": 0.9093976020812988, "num_tokens": 5403168.0, "step": 438 }, { "entropy": 1.5200332999229431, "epoch": 0.23117430226434965, "grad_norm": 0.6539078950881958, "learning_rate": 0.00019999593684983058, "loss": 0.2600172460079193, "mean_token_accuracy": 0.8999185413122177, "num_tokens": 5415504.0, "step": 439 }, { "entropy": 1.4733262360095978, "epoch": 0.23170089520800422, "grad_norm": 0.42358288168907166, "learning_rate": 0.000199995725813458, "loss": 0.22544077038764954, "mean_token_accuracy": 0.9120991379022598, "num_tokens": 5427840.0, "step": 440 }, { "entropy": 1.414179265499115, "epoch": 0.23222748815165878, "grad_norm": 0.49307864904403687, "learning_rate": 0.00019999550943456375, "loss": 0.24960950016975403, "mean_token_accuracy": 0.9004078656435013, "num_tokens": 5440176.0, "step": 441 }, { "entropy": 1.429827481508255, "epoch": 0.23275408109531331, "grad_norm": 0.505660891532898, "learning_rate": 0.00019999528771316057, "loss": 0.25559940934181213, "mean_token_accuracy": 0.9029601365327835, "num_tokens": 5452512.0, "step": 442 }, { "entropy": 1.4452406466007233, "epoch": 0.23328067403896788, "grad_norm": 0.5408805012702942, "learning_rate": 0.00019999506064926175, "loss": 0.2864495515823364, "mean_token_accuracy": 0.8919995576143265, "num_tokens": 5464848.0, "step": 443 }, { "entropy": 1.441390186548233, "epoch": 0.23380726698262244, "grad_norm": 0.49373185634613037, "learning_rate": 0.0001999948282428807, "loss": 0.2585368752479553, "mean_token_accuracy": 0.8959326446056366, "num_tokens": 5477184.0, "step": 444 }, { "entropy": 1.386150062084198, "epoch": 0.23433385992627698, "grad_norm": 0.4148918390274048, "learning_rate": 0.0001999945904940312, "loss": 0.2401098757982254, "mean_token_accuracy": 0.9103811830282211, "num_tokens": 5489520.0, "step": 445 }, { "entropy": 1.4309166073799133, "epoch": 0.23486045286993154, "grad_norm": 0.46061956882476807, "learning_rate": 0.00019999434740272743, "loss": 0.2515195310115814, "mean_token_accuracy": 0.9047931730747223, "num_tokens": 5501856.0, "step": 446 }, { "entropy": 1.4778549373149872, "epoch": 0.2353870458135861, "grad_norm": 0.543989896774292, "learning_rate": 0.00019999409896898372, "loss": 0.23118984699249268, "mean_token_accuracy": 0.9122479408979416, "num_tokens": 5514192.0, "step": 447 }, { "entropy": 1.3631019592285156, "epoch": 0.23591363875724064, "grad_norm": 0.39872297644615173, "learning_rate": 0.00019999384519281494, "loss": 0.23500953614711761, "mean_token_accuracy": 0.9080264270305634, "num_tokens": 5526528.0, "step": 448 }, { "entropy": 1.4472846686840057, "epoch": 0.2364402317008952, "grad_norm": 0.4705425500869751, "learning_rate": 0.00019999358607423608, "loss": 0.2556760609149933, "mean_token_accuracy": 0.903324156999588, "num_tokens": 5538864.0, "step": 449 }, { "entropy": 1.4216105043888092, "epoch": 0.23696682464454977, "grad_norm": 0.42123982310295105, "learning_rate": 0.00019999332161326253, "loss": 0.24162599444389343, "mean_token_accuracy": 0.906711995601654, "num_tokens": 5551200.0, "step": 450 }, { "entropy": 1.3214130699634552, "epoch": 0.23749341758820433, "grad_norm": 0.4052497148513794, "learning_rate": 0.00019999305180991002, "loss": 0.23021447658538818, "mean_token_accuracy": 0.9166329354047775, "num_tokens": 5563536.0, "step": 451 }, { "entropy": 1.2956161499023438, "epoch": 0.23802001053185887, "grad_norm": 0.4208316206932068, "learning_rate": 0.0001999927766641945, "loss": 0.25906720757484436, "mean_token_accuracy": 0.8939131498336792, "num_tokens": 5575872.0, "step": 452 }, { "entropy": 1.2186987400054932, "epoch": 0.23854660347551343, "grad_norm": 0.423001766204834, "learning_rate": 0.00019999249617613237, "loss": 0.2634647488594055, "mean_token_accuracy": 0.8950765579938889, "num_tokens": 5588208.0, "step": 453 }, { "entropy": 1.1696477234363556, "epoch": 0.239073196419168, "grad_norm": 0.7100384831428528, "learning_rate": 0.00019999221034574028, "loss": 0.2620895504951477, "mean_token_accuracy": 0.901919424533844, "num_tokens": 5600544.0, "step": 454 }, { "entropy": 1.1881844103336334, "epoch": 0.23959978936282253, "grad_norm": 0.40986204147338867, "learning_rate": 0.00019999191917303513, "loss": 0.23100420832633972, "mean_token_accuracy": 0.9076221436262131, "num_tokens": 5612880.0, "step": 455 }, { "entropy": 1.0672442317008972, "epoch": 0.2401263823064771, "grad_norm": 0.9633269309997559, "learning_rate": 0.0001999916226580343, "loss": 0.2286304533481598, "mean_token_accuracy": 0.9094352871179581, "num_tokens": 5625216.0, "step": 456 }, { "entropy": 1.0725638568401337, "epoch": 0.24065297525013166, "grad_norm": 0.5792625546455383, "learning_rate": 0.0001999913208007553, "loss": 0.21992720663547516, "mean_token_accuracy": 0.9132383912801743, "num_tokens": 5637552.0, "step": 457 }, { "entropy": 1.0756218880414963, "epoch": 0.2411795681937862, "grad_norm": 0.4889819622039795, "learning_rate": 0.0001999910136012161, "loss": 0.22047317028045654, "mean_token_accuracy": 0.9096969217061996, "num_tokens": 5649888.0, "step": 458 }, { "entropy": 1.025196298956871, "epoch": 0.24170616113744076, "grad_norm": 0.43335074186325073, "learning_rate": 0.00019999070105943494, "loss": 0.23299942910671234, "mean_token_accuracy": 0.9110541045665741, "num_tokens": 5662224.0, "step": 459 }, { "entropy": 1.0740464180707932, "epoch": 0.24223275408109532, "grad_norm": 0.4134856164455414, "learning_rate": 0.00019999038317543036, "loss": 0.2113601118326187, "mean_token_accuracy": 0.9125392287969589, "num_tokens": 5674560.0, "step": 460 }, { "entropy": 1.0400484502315521, "epoch": 0.24275934702474986, "grad_norm": 0.3933151364326477, "learning_rate": 0.00019999005994922125, "loss": 0.23023052513599396, "mean_token_accuracy": 0.9128931611776352, "num_tokens": 5686896.0, "step": 461 }, { "entropy": 1.033817708492279, "epoch": 0.24328593996840442, "grad_norm": 0.4203343093395233, "learning_rate": 0.00019998973138082675, "loss": 0.23599188029766083, "mean_token_accuracy": 0.9099869877099991, "num_tokens": 5699232.0, "step": 462 }, { "entropy": 1.0623035430908203, "epoch": 0.24381253291205898, "grad_norm": 0.41818881034851074, "learning_rate": 0.00019998939747026644, "loss": 0.23520024120807648, "mean_token_accuracy": 0.9101691842079163, "num_tokens": 5711568.0, "step": 463 }, { "entropy": 1.0741385221481323, "epoch": 0.24433912585571355, "grad_norm": 0.4350592792034149, "learning_rate": 0.00019998905821756006, "loss": 0.26694831252098083, "mean_token_accuracy": 0.8980891853570938, "num_tokens": 5723904.0, "step": 464 }, { "entropy": 1.1385951340198517, "epoch": 0.24486571879936808, "grad_norm": 0.4376484155654907, "learning_rate": 0.00019998871362272784, "loss": 0.25515180826187134, "mean_token_accuracy": 0.9086296558380127, "num_tokens": 5736240.0, "step": 465 }, { "entropy": 1.0884679853916168, "epoch": 0.24539231174302265, "grad_norm": 0.42011401057243347, "learning_rate": 0.00019998836368579013, "loss": 0.2314184159040451, "mean_token_accuracy": 0.9099607318639755, "num_tokens": 5748576.0, "step": 466 }, { "entropy": 1.09638212621212, "epoch": 0.2459189046866772, "grad_norm": 0.39627403020858765, "learning_rate": 0.0001999880084067678, "loss": 0.21417196094989777, "mean_token_accuracy": 0.9153980165719986, "num_tokens": 5760912.0, "step": 467 }, { "entropy": 1.091229110956192, "epoch": 0.24644549763033174, "grad_norm": 0.4235895872116089, "learning_rate": 0.00019998764778568192, "loss": 0.2682695686817169, "mean_token_accuracy": 0.9011466205120087, "num_tokens": 5773248.0, "step": 468 }, { "entropy": 1.1204252541065216, "epoch": 0.2469720905739863, "grad_norm": 0.43689507246017456, "learning_rate": 0.00019998728182255381, "loss": 0.24578194320201874, "mean_token_accuracy": 0.9062277525663376, "num_tokens": 5785584.0, "step": 469 }, { "entropy": 1.1320042610168457, "epoch": 0.24749868351764087, "grad_norm": 0.4219723641872406, "learning_rate": 0.0001999869105174053, "loss": 0.22462952136993408, "mean_token_accuracy": 0.9171530902385712, "num_tokens": 5797920.0, "step": 470 }, { "entropy": 1.1340222358703613, "epoch": 0.2480252764612954, "grad_norm": 0.3906649351119995, "learning_rate": 0.00019998653387025842, "loss": 0.2314276546239853, "mean_token_accuracy": 0.9133926779031754, "num_tokens": 5810256.0, "step": 471 }, { "entropy": 1.148337960243225, "epoch": 0.24855186940494997, "grad_norm": 0.435470312833786, "learning_rate": 0.00019998615188113547, "loss": 0.27237382531166077, "mean_token_accuracy": 0.8951744884252548, "num_tokens": 5822592.0, "step": 472 }, { "entropy": 1.084697663784027, "epoch": 0.24907846234860453, "grad_norm": 0.3843922019004822, "learning_rate": 0.00019998576455005918, "loss": 0.21877625584602356, "mean_token_accuracy": 0.9148665964603424, "num_tokens": 5834928.0, "step": 473 }, { "entropy": 1.1236861050128937, "epoch": 0.24960505529225907, "grad_norm": 0.3693842887878418, "learning_rate": 0.0001999853718770525, "loss": 0.24262937903404236, "mean_token_accuracy": 0.9089461863040924, "num_tokens": 5847264.0, "step": 474 }, { "entropy": 1.0875613689422607, "epoch": 0.25013164823591366, "grad_norm": 0.36348292231559753, "learning_rate": 0.0001999849738621388, "loss": 0.22801700234413147, "mean_token_accuracy": 0.9149875193834305, "num_tokens": 5859600.0, "step": 475 }, { "entropy": 1.1611447632312775, "epoch": 0.2506582411795682, "grad_norm": 0.3937731683254242, "learning_rate": 0.00019998457050534165, "loss": 0.2227628082036972, "mean_token_accuracy": 0.9130124449729919, "num_tokens": 5871936.0, "step": 476 }, { "entropy": 1.18001389503479, "epoch": 0.25118483412322273, "grad_norm": 0.38412168622016907, "learning_rate": 0.00019998416180668505, "loss": 0.25140437483787537, "mean_token_accuracy": 0.9021612256765366, "num_tokens": 5884272.0, "step": 477 }, { "entropy": 1.1783344447612762, "epoch": 0.2517114270668773, "grad_norm": 0.4068759083747864, "learning_rate": 0.00019998374776619316, "loss": 0.2507692575454712, "mean_token_accuracy": 0.9036175757646561, "num_tokens": 5896608.0, "step": 478 }, { "entropy": 1.2171072959899902, "epoch": 0.25223802001053186, "grad_norm": 0.38274940848350525, "learning_rate": 0.00019998332838389068, "loss": 0.23562754690647125, "mean_token_accuracy": 0.9149611443281174, "num_tokens": 5908944.0, "step": 479 }, { "entropy": 1.2112184464931488, "epoch": 0.2527646129541864, "grad_norm": 0.4171972870826721, "learning_rate": 0.00019998290365980247, "loss": 0.26383018493652344, "mean_token_accuracy": 0.8946961760520935, "num_tokens": 5921280.0, "step": 480 }, { "entropy": 1.1482765674591064, "epoch": 0.253291205897841, "grad_norm": 0.3705795407295227, "learning_rate": 0.0001999824735939537, "loss": 0.23539453744888306, "mean_token_accuracy": 0.9124044477939606, "num_tokens": 5933616.0, "step": 481 }, { "entropy": 1.1225126087665558, "epoch": 0.2538177988414955, "grad_norm": 0.38258257508277893, "learning_rate": 0.00019998203818636997, "loss": 0.24310466647148132, "mean_token_accuracy": 0.9069766700267792, "num_tokens": 5945952.0, "step": 482 }, { "entropy": 1.1831683218479156, "epoch": 0.25434439178515006, "grad_norm": 0.4023701548576355, "learning_rate": 0.00019998159743707706, "loss": 0.22924776375293732, "mean_token_accuracy": 0.910895898938179, "num_tokens": 5958288.0, "step": 483 }, { "entropy": 1.2125089168548584, "epoch": 0.25487098472880465, "grad_norm": 0.391679972410202, "learning_rate": 0.0001999811513461012, "loss": 0.23159608244895935, "mean_token_accuracy": 0.91130131483078, "num_tokens": 5970624.0, "step": 484 }, { "entropy": 1.1657118201255798, "epoch": 0.2553975776724592, "grad_norm": 0.36009886860847473, "learning_rate": 0.00019998069991346878, "loss": 0.22824552655220032, "mean_token_accuracy": 0.9051208347082138, "num_tokens": 5982960.0, "step": 485 }, { "entropy": 1.1666974127292633, "epoch": 0.2559241706161137, "grad_norm": 0.4200109839439392, "learning_rate": 0.00019998024313920668, "loss": 0.22612211108207703, "mean_token_accuracy": 0.9098036587238312, "num_tokens": 5995296.0, "step": 486 }, { "entropy": 1.1931614875793457, "epoch": 0.2564507635597683, "grad_norm": 0.3996848165988922, "learning_rate": 0.00019997978102334195, "loss": 0.23149043321609497, "mean_token_accuracy": 0.915941908955574, "num_tokens": 6007632.0, "step": 487 }, { "entropy": 1.2029556334018707, "epoch": 0.25697735650342285, "grad_norm": 0.381720632314682, "learning_rate": 0.00019997931356590212, "loss": 0.20601031184196472, "mean_token_accuracy": 0.9207601994276047, "num_tokens": 6019968.0, "step": 488 }, { "entropy": 1.286322921514511, "epoch": 0.2575039494470774, "grad_norm": 0.3947739601135254, "learning_rate": 0.00019997884076691484, "loss": 0.23165327310562134, "mean_token_accuracy": 0.9127722233533859, "num_tokens": 6032304.0, "step": 489 }, { "entropy": 1.1862512528896332, "epoch": 0.258030542390732, "grad_norm": 0.4733010232448578, "learning_rate": 0.00019997836262640825, "loss": 0.23455524444580078, "mean_token_accuracy": 0.9086931645870209, "num_tokens": 6044640.0, "step": 490 }, { "entropy": 1.2432229220867157, "epoch": 0.2585571353343865, "grad_norm": 0.5269920229911804, "learning_rate": 0.00019997787914441067, "loss": 0.25063106417655945, "mean_token_accuracy": 0.903441533446312, "num_tokens": 6056976.0, "step": 491 }, { "entropy": 1.1587136387825012, "epoch": 0.25908372827804105, "grad_norm": 0.3660036325454712, "learning_rate": 0.0001999773903209509, "loss": 0.23804998397827148, "mean_token_accuracy": 0.9118834733963013, "num_tokens": 6069312.0, "step": 492 }, { "entropy": 1.2006062865257263, "epoch": 0.25961032122169564, "grad_norm": 0.4517950117588043, "learning_rate": 0.00019997689615605785, "loss": 0.24688124656677246, "mean_token_accuracy": 0.9041164964437485, "num_tokens": 6081648.0, "step": 493 }, { "entropy": 1.2588125467300415, "epoch": 0.2601369141653502, "grad_norm": 0.3569098114967346, "learning_rate": 0.0001999763966497609, "loss": 0.22678923606872559, "mean_token_accuracy": 0.9117091447114944, "num_tokens": 6093984.0, "step": 494 }, { "entropy": 1.3271512985229492, "epoch": 0.26066350710900477, "grad_norm": 0.3427906036376953, "learning_rate": 0.00019997589180208972, "loss": 0.2427246868610382, "mean_token_accuracy": 0.91063092648983, "num_tokens": 6106320.0, "step": 495 }, { "entropy": 1.320880800485611, "epoch": 0.2611901000526593, "grad_norm": 0.41021794080734253, "learning_rate": 0.00019997538161307425, "loss": 0.24322479963302612, "mean_token_accuracy": 0.9047645032405853, "num_tokens": 6118656.0, "step": 496 }, { "entropy": 1.2419660687446594, "epoch": 0.26171669299631384, "grad_norm": 0.4706597328186035, "learning_rate": 0.00019997486608274478, "loss": 0.24686744809150696, "mean_token_accuracy": 0.9022967517375946, "num_tokens": 6130992.0, "step": 497 }, { "entropy": 1.2451711893081665, "epoch": 0.26224328593996843, "grad_norm": 0.37942013144493103, "learning_rate": 0.00019997434521113193, "loss": 0.2456897497177124, "mean_token_accuracy": 0.9084974527359009, "num_tokens": 6143328.0, "step": 498 }, { "entropy": 1.363191157579422, "epoch": 0.26276987888362296, "grad_norm": 0.4037798047065735, "learning_rate": 0.00019997381899826663, "loss": 0.24723505973815918, "mean_token_accuracy": 0.9025511145591736, "num_tokens": 6155664.0, "step": 499 }, { "entropy": 1.3585219979286194, "epoch": 0.2632964718272775, "grad_norm": 0.4076964855194092, "learning_rate": 0.0001999732874441801, "loss": 0.231999009847641, "mean_token_accuracy": 0.9121885448694229, "num_tokens": 6168000.0, "step": 500 }, { "entropy": 1.3322370648384094, "epoch": 0.2638230647709321, "grad_norm": 0.38084790110588074, "learning_rate": 0.0001999727505489039, "loss": 0.26456475257873535, "mean_token_accuracy": 0.9003604352474213, "num_tokens": 6180336.0, "step": 501 }, { "entropy": 1.3225562274456024, "epoch": 0.2643496577145866, "grad_norm": 0.3669094145298004, "learning_rate": 0.00019997220831246987, "loss": 0.22636903822422028, "mean_token_accuracy": 0.9135940670967102, "num_tokens": 6192672.0, "step": 502 }, { "entropy": 1.24677973985672, "epoch": 0.26487625065824116, "grad_norm": 0.36622145771980286, "learning_rate": 0.00019997166073491027, "loss": 0.2442116141319275, "mean_token_accuracy": 0.903778612613678, "num_tokens": 6205008.0, "step": 503 }, { "entropy": 1.2564740180969238, "epoch": 0.26540284360189575, "grad_norm": 0.37914055585861206, "learning_rate": 0.00019997110781625754, "loss": 0.250071257352829, "mean_token_accuracy": 0.905722975730896, "num_tokens": 6217344.0, "step": 504 }, { "entropy": 1.266231119632721, "epoch": 0.2659294365455503, "grad_norm": 0.4232172966003418, "learning_rate": 0.00019997054955654456, "loss": 0.22360444068908691, "mean_token_accuracy": 0.9164858758449554, "num_tokens": 6229680.0, "step": 505 }, { "entropy": 1.2842857539653778, "epoch": 0.2664560294892048, "grad_norm": 0.40517833828926086, "learning_rate": 0.0001999699859558044, "loss": 0.24367284774780273, "mean_token_accuracy": 0.906918466091156, "num_tokens": 6242016.0, "step": 506 }, { "entropy": 1.3325933814048767, "epoch": 0.2669826224328594, "grad_norm": 0.3894166648387909, "learning_rate": 0.00019996941701407058, "loss": 0.21899431943893433, "mean_token_accuracy": 0.9159570783376694, "num_tokens": 6254352.0, "step": 507 }, { "entropy": 1.2919807434082031, "epoch": 0.26750921537651395, "grad_norm": 0.3554909825325012, "learning_rate": 0.00019996884273137686, "loss": 0.22241441905498505, "mean_token_accuracy": 0.9181459695100784, "num_tokens": 6266688.0, "step": 508 }, { "entropy": 1.311550348997116, "epoch": 0.2680358083201685, "grad_norm": 0.36536744236946106, "learning_rate": 0.0001999682631077573, "loss": 0.2456498146057129, "mean_token_accuracy": 0.9058470577001572, "num_tokens": 6279024.0, "step": 509 }, { "entropy": 1.3708328008651733, "epoch": 0.2685624012638231, "grad_norm": 0.4042948782444, "learning_rate": 0.00019996767814324637, "loss": 0.266501247882843, "mean_token_accuracy": 0.900126188993454, "num_tokens": 6291360.0, "step": 510 }, { "entropy": 1.3850271105766296, "epoch": 0.2690889942074776, "grad_norm": 0.39048540592193604, "learning_rate": 0.00019996708783787874, "loss": 0.24780599772930145, "mean_token_accuracy": 0.9016763418912888, "num_tokens": 6303696.0, "step": 511 }, { "entropy": 1.3151749074459076, "epoch": 0.26961558715113215, "grad_norm": 0.37497779726982117, "learning_rate": 0.0001999664921916895, "loss": 0.23127570748329163, "mean_token_accuracy": 0.9075058400630951, "num_tokens": 6316032.0, "step": 512 }, { "entropy": 1.3835597038269043, "epoch": 0.27014218009478674, "grad_norm": 0.3880425691604614, "learning_rate": 0.00019996589120471392, "loss": 0.23898069560527802, "mean_token_accuracy": 0.9100230634212494, "num_tokens": 6328368.0, "step": 513 }, { "entropy": 1.4238722920417786, "epoch": 0.2706687730384413, "grad_norm": 0.36198124289512634, "learning_rate": 0.0001999652848769878, "loss": 0.22968879342079163, "mean_token_accuracy": 0.906474158167839, "num_tokens": 6340704.0, "step": 514 }, { "entropy": 1.517054557800293, "epoch": 0.2711953659820958, "grad_norm": 0.3657878637313843, "learning_rate": 0.00019996467320854703, "loss": 0.22068339586257935, "mean_token_accuracy": 0.9112901985645294, "num_tokens": 6353040.0, "step": 515 }, { "entropy": 1.5027157366275787, "epoch": 0.2717219589257504, "grad_norm": 0.34945791959762573, "learning_rate": 0.000199964056199428, "loss": 0.25596681237220764, "mean_token_accuracy": 0.9006428420543671, "num_tokens": 6365376.0, "step": 516 }, { "entropy": 1.5874098539352417, "epoch": 0.27224855186940494, "grad_norm": 0.3800085783004761, "learning_rate": 0.00019996343384966732, "loss": 0.25539156794548035, "mean_token_accuracy": 0.901904970407486, "num_tokens": 6377712.0, "step": 517 }, { "entropy": 1.5508817732334137, "epoch": 0.2727751448130595, "grad_norm": 0.3190958797931671, "learning_rate": 0.00019996280615930186, "loss": 0.235137477517128, "mean_token_accuracy": 0.9069496989250183, "num_tokens": 6390048.0, "step": 518 }, { "entropy": 1.5596497654914856, "epoch": 0.27330173775671407, "grad_norm": 0.35837146639823914, "learning_rate": 0.000199962173128369, "loss": 0.24638012051582336, "mean_token_accuracy": 0.9043673276901245, "num_tokens": 6402384.0, "step": 519 }, { "entropy": 1.544301688671112, "epoch": 0.2738283307003686, "grad_norm": 0.3943609595298767, "learning_rate": 0.00019996153475690623, "loss": 0.24823732674121857, "mean_token_accuracy": 0.9039914757013321, "num_tokens": 6414720.0, "step": 520 }, { "entropy": 1.4979600608348846, "epoch": 0.2743549236440232, "grad_norm": 0.3533165156841278, "learning_rate": 0.00019996089104495148, "loss": 0.21794329583644867, "mean_token_accuracy": 0.9170633852481842, "num_tokens": 6427056.0, "step": 521 }, { "entropy": 1.5348587334156036, "epoch": 0.27488151658767773, "grad_norm": 0.3516184091567993, "learning_rate": 0.00019996024199254295, "loss": 0.21856778860092163, "mean_token_accuracy": 0.9159553945064545, "num_tokens": 6439392.0, "step": 522 }, { "entropy": 1.5593447387218475, "epoch": 0.27540810953133227, "grad_norm": 0.3706720173358917, "learning_rate": 0.0001999595875997192, "loss": 0.24685126543045044, "mean_token_accuracy": 0.9023942798376083, "num_tokens": 6451728.0, "step": 523 }, { "entropy": 1.5938279330730438, "epoch": 0.27593470247498686, "grad_norm": 0.4374881088733673, "learning_rate": 0.00019995892786651905, "loss": 0.24188384413719177, "mean_token_accuracy": 0.904677078127861, "num_tokens": 6464064.0, "step": 524 }, { "entropy": 1.469886839389801, "epoch": 0.2764612954186414, "grad_norm": 0.46137046813964844, "learning_rate": 0.00019995826279298166, "loss": 0.23798640072345734, "mean_token_accuracy": 0.9109133780002594, "num_tokens": 6476400.0, "step": 525 }, { "entropy": 1.5873245596885681, "epoch": 0.27698788836229593, "grad_norm": 0.416920006275177, "learning_rate": 0.00019995759237914656, "loss": 0.25300133228302, "mean_token_accuracy": 0.9008941799402237, "num_tokens": 6488736.0, "step": 526 }, { "entropy": 1.5558778047561646, "epoch": 0.2775144813059505, "grad_norm": 0.36363670229911804, "learning_rate": 0.0001999569166250535, "loss": 0.22929418087005615, "mean_token_accuracy": 0.9127305895090103, "num_tokens": 6501072.0, "step": 527 }, { "entropy": 1.5871147811412811, "epoch": 0.27804107424960506, "grad_norm": 0.3830122947692871, "learning_rate": 0.00019995623553074258, "loss": 0.2472982108592987, "mean_token_accuracy": 0.9040207862854004, "num_tokens": 6513408.0, "step": 528 }, { "entropy": 1.6365769505500793, "epoch": 0.2785676671932596, "grad_norm": 0.3964959383010864, "learning_rate": 0.00019995554909625428, "loss": 0.25368693470954895, "mean_token_accuracy": 0.9007250666618347, "num_tokens": 6525744.0, "step": 529 }, { "entropy": 1.7017327845096588, "epoch": 0.2790942601369142, "grad_norm": 0.391290545463562, "learning_rate": 0.00019995485732162934, "loss": 0.2360502928495407, "mean_token_accuracy": 0.9084432125091553, "num_tokens": 6538080.0, "step": 530 }, { "entropy": 1.6393355131149292, "epoch": 0.2796208530805687, "grad_norm": 0.38507914543151855, "learning_rate": 0.0001999541602069088, "loss": 0.23786881566047668, "mean_token_accuracy": 0.9061485677957535, "num_tokens": 6550416.0, "step": 531 }, { "entropy": 1.6275135576725006, "epoch": 0.28014744602422326, "grad_norm": 0.37895116209983826, "learning_rate": 0.0001999534577521341, "loss": 0.23145025968551636, "mean_token_accuracy": 0.9090943783521652, "num_tokens": 6562752.0, "step": 532 }, { "entropy": 1.598475605249405, "epoch": 0.28067403896787785, "grad_norm": 0.4161452054977417, "learning_rate": 0.00019995274995734686, "loss": 0.2727176547050476, "mean_token_accuracy": 0.8956159949302673, "num_tokens": 6575088.0, "step": 533 }, { "entropy": 1.5213307440280914, "epoch": 0.2812006319115324, "grad_norm": 0.43801331520080566, "learning_rate": 0.00019995203682258915, "loss": 0.22940769791603088, "mean_token_accuracy": 0.9128211736679077, "num_tokens": 6587424.0, "step": 534 }, { "entropy": 1.634105533361435, "epoch": 0.2817272248551869, "grad_norm": 0.4054886996746063, "learning_rate": 0.0001999513183479033, "loss": 0.23942533135414124, "mean_token_accuracy": 0.9082587212324142, "num_tokens": 6599760.0, "step": 535 }, { "entropy": 1.4907733798027039, "epoch": 0.2822538177988415, "grad_norm": 0.40736711025238037, "learning_rate": 0.00019995059453333194, "loss": 0.22832639515399933, "mean_token_accuracy": 0.9135842621326447, "num_tokens": 6612096.0, "step": 536 }, { "entropy": 1.5832161009311676, "epoch": 0.28278041074249605, "grad_norm": 0.3980075418949127, "learning_rate": 0.0001999498653789181, "loss": 0.24887777864933014, "mean_token_accuracy": 0.9017034024000168, "num_tokens": 6624432.0, "step": 537 }, { "entropy": 1.4983101785182953, "epoch": 0.2833070036861506, "grad_norm": 0.3781083822250366, "learning_rate": 0.00019994913088470498, "loss": 0.23180519044399261, "mean_token_accuracy": 0.9052098244428635, "num_tokens": 6636768.0, "step": 538 }, { "entropy": 1.5062950551509857, "epoch": 0.2838335966298052, "grad_norm": 0.4003005623817444, "learning_rate": 0.00019994839105073623, "loss": 0.22549505531787872, "mean_token_accuracy": 0.9140617251396179, "num_tokens": 6649104.0, "step": 539 }, { "entropy": 1.5416783392429352, "epoch": 0.2843601895734597, "grad_norm": 0.39962485432624817, "learning_rate": 0.00019994764587705574, "loss": 0.2179470807313919, "mean_token_accuracy": 0.9161404520273209, "num_tokens": 6661440.0, "step": 540 }, { "entropy": 1.660192757844925, "epoch": 0.28488678251711425, "grad_norm": 0.42626917362213135, "learning_rate": 0.0001999468953637078, "loss": 0.26295173168182373, "mean_token_accuracy": 0.8983173221349716, "num_tokens": 6673776.0, "step": 541 }, { "entropy": 1.5149348974227905, "epoch": 0.28541337546076884, "grad_norm": 0.36926260590553284, "learning_rate": 0.00019994613951073692, "loss": 0.2277842015028, "mean_token_accuracy": 0.9144963473081589, "num_tokens": 6686112.0, "step": 542 }, { "entropy": 1.5601712763309479, "epoch": 0.2859399684044234, "grad_norm": 0.35751771926879883, "learning_rate": 0.00019994537831818799, "loss": 0.2134617567062378, "mean_token_accuracy": 0.9172465950250626, "num_tokens": 6698448.0, "step": 543 }, { "entropy": 1.629770964384079, "epoch": 0.2864665613480779, "grad_norm": 0.3708803951740265, "learning_rate": 0.00019994461178610617, "loss": 0.22911599278450012, "mean_token_accuracy": 0.9093553721904755, "num_tokens": 6710784.0, "step": 544 }, { "entropy": 1.5735207796096802, "epoch": 0.2869931542917325, "grad_norm": 0.3979873061180115, "learning_rate": 0.00019994383991453702, "loss": 0.2454529106616974, "mean_token_accuracy": 0.9057244658470154, "num_tokens": 6723120.0, "step": 545 }, { "entropy": 1.556952327489853, "epoch": 0.28751974723538704, "grad_norm": 0.36042284965515137, "learning_rate": 0.0001999430627035263, "loss": 0.22943763434886932, "mean_token_accuracy": 0.9095467925071716, "num_tokens": 6735456.0, "step": 546 }, { "entropy": 1.5784813165664673, "epoch": 0.2880463401790416, "grad_norm": 0.4354793131351471, "learning_rate": 0.0001999422801531202, "loss": 0.23101268708705902, "mean_token_accuracy": 0.9098020642995834, "num_tokens": 6747792.0, "step": 547 }, { "entropy": 1.6356432437896729, "epoch": 0.28857293312269616, "grad_norm": 0.38589903712272644, "learning_rate": 0.00019994149226336514, "loss": 0.2551157772541046, "mean_token_accuracy": 0.9008017480373383, "num_tokens": 6760128.0, "step": 548 }, { "entropy": 1.484334021806717, "epoch": 0.2890995260663507, "grad_norm": 0.3685605823993683, "learning_rate": 0.0001999406990343079, "loss": 0.21177145838737488, "mean_token_accuracy": 0.9134591519832611, "num_tokens": 6772464.0, "step": 549 }, { "entropy": 1.5352662205696106, "epoch": 0.2896261190100053, "grad_norm": 0.43439221382141113, "learning_rate": 0.00019993990046599555, "loss": 0.21738113462924957, "mean_token_accuracy": 0.9168129861354828, "num_tokens": 6784800.0, "step": 550 }, { "entropy": 1.4901257157325745, "epoch": 0.2901527119536598, "grad_norm": 0.40765848755836487, "learning_rate": 0.00019993909655847554, "loss": 0.2299802005290985, "mean_token_accuracy": 0.9086113125085831, "num_tokens": 6797136.0, "step": 551 }, { "entropy": 1.5647250413894653, "epoch": 0.29067930489731436, "grad_norm": 0.3714927136898041, "learning_rate": 0.0001999382873117956, "loss": 0.23209913074970245, "mean_token_accuracy": 0.912913978099823, "num_tokens": 6809472.0, "step": 552 }, { "entropy": 1.5570427775382996, "epoch": 0.29120589784096895, "grad_norm": 0.3235602080821991, "learning_rate": 0.0001999374727260037, "loss": 0.20470383763313293, "mean_token_accuracy": 0.9178998619318008, "num_tokens": 6821808.0, "step": 553 }, { "entropy": 1.6096443831920624, "epoch": 0.2917324907846235, "grad_norm": 0.3791026473045349, "learning_rate": 0.00019993665280114824, "loss": 0.23357072472572327, "mean_token_accuracy": 0.9100991189479828, "num_tokens": 6834144.0, "step": 554 }, { "entropy": 1.7047458291053772, "epoch": 0.292259083728278, "grad_norm": 0.4588649272918701, "learning_rate": 0.00019993582753727792, "loss": 0.23484769463539124, "mean_token_accuracy": 0.9089436531066895, "num_tokens": 6846480.0, "step": 555 }, { "entropy": 1.6045478284358978, "epoch": 0.2927856766719326, "grad_norm": 0.38022348284721375, "learning_rate": 0.00019993499693444168, "loss": 0.24132560193538666, "mean_token_accuracy": 0.9133987128734589, "num_tokens": 6858816.0, "step": 556 }, { "entropy": 1.5578656792640686, "epoch": 0.29331226961558715, "grad_norm": 0.3959854543209076, "learning_rate": 0.00019993416099268888, "loss": 0.2288515269756317, "mean_token_accuracy": 0.9094084948301315, "num_tokens": 6871152.0, "step": 557 }, { "entropy": 1.5771779716014862, "epoch": 0.2938388625592417, "grad_norm": 0.41283491253852844, "learning_rate": 0.00019993331971206911, "loss": 0.25233519077301025, "mean_token_accuracy": 0.8999712020158768, "num_tokens": 6883488.0, "step": 558 }, { "entropy": 1.5294803977012634, "epoch": 0.2943654555028963, "grad_norm": 0.41696879267692566, "learning_rate": 0.0001999324730926323, "loss": 0.2409447431564331, "mean_token_accuracy": 0.9075838178396225, "num_tokens": 6895824.0, "step": 559 }, { "entropy": 1.557918757200241, "epoch": 0.2948920484465508, "grad_norm": 0.8365952372550964, "learning_rate": 0.00019993162113442873, "loss": 0.26256802678108215, "mean_token_accuracy": 0.8970607817173004, "num_tokens": 6908160.0, "step": 560 }, { "entropy": 1.5486240088939667, "epoch": 0.29541864139020535, "grad_norm": 0.36394545435905457, "learning_rate": 0.000199930763837509, "loss": 0.23241116106510162, "mean_token_accuracy": 0.9164627194404602, "num_tokens": 6920496.0, "step": 561 }, { "entropy": 1.5366742312908173, "epoch": 0.29594523433385994, "grad_norm": 0.3717273771762848, "learning_rate": 0.00019992990120192393, "loss": 0.2316376268863678, "mean_token_accuracy": 0.9116377085447311, "num_tokens": 6932832.0, "step": 562 }, { "entropy": 1.6174998581409454, "epoch": 0.2964718272775145, "grad_norm": 0.3976577818393707, "learning_rate": 0.00019992903322772483, "loss": 0.2560444474220276, "mean_token_accuracy": 0.8992763608694077, "num_tokens": 6945168.0, "step": 563 }, { "entropy": 1.5432467758655548, "epoch": 0.296998420221169, "grad_norm": 0.32837730646133423, "learning_rate": 0.00019992815991496318, "loss": 0.2185848504304886, "mean_token_accuracy": 0.9149428755044937, "num_tokens": 6957504.0, "step": 564 }, { "entropy": 1.5321990847587585, "epoch": 0.2975250131648236, "grad_norm": 0.36741021275520325, "learning_rate": 0.00019992728126369078, "loss": 0.24631758034229279, "mean_token_accuracy": 0.9008835554122925, "num_tokens": 6969840.0, "step": 565 }, { "entropy": 1.6573955416679382, "epoch": 0.29805160610847814, "grad_norm": 0.40060925483703613, "learning_rate": 0.00019992639727395983, "loss": 0.24705615639686584, "mean_token_accuracy": 0.9055600762367249, "num_tokens": 6982176.0, "step": 566 }, { "entropy": 1.6146283447742462, "epoch": 0.2985781990521327, "grad_norm": 0.36694321036338806, "learning_rate": 0.00019992550794582282, "loss": 0.2382228970527649, "mean_token_accuracy": 0.9077549129724503, "num_tokens": 6994512.0, "step": 567 }, { "entropy": 1.608702838420868, "epoch": 0.29910479199578727, "grad_norm": 0.36138370633125305, "learning_rate": 0.00019992461327933252, "loss": 0.2497398406267166, "mean_token_accuracy": 0.9065199494361877, "num_tokens": 7006848.0, "step": 568 }, { "entropy": 1.5681868195533752, "epoch": 0.2996313849394418, "grad_norm": 0.3718649744987488, "learning_rate": 0.00019992371327454204, "loss": 0.22592690587043762, "mean_token_accuracy": 0.9139988124370575, "num_tokens": 7019184.0, "step": 569 }, { "entropy": 1.5541615784168243, "epoch": 0.3001579778830964, "grad_norm": 0.3475581407546997, "learning_rate": 0.00019992280793150485, "loss": 0.218974769115448, "mean_token_accuracy": 0.9153032898902893, "num_tokens": 7031520.0, "step": 570 }, { "entropy": 1.5086607038974762, "epoch": 0.30068457082675093, "grad_norm": 0.336376428604126, "learning_rate": 0.00019992189725027466, "loss": 0.2033504694700241, "mean_token_accuracy": 0.9149883091449738, "num_tokens": 7043856.0, "step": 571 }, { "entropy": 1.5713791847229004, "epoch": 0.30121116377040547, "grad_norm": 0.4335557520389557, "learning_rate": 0.0001999209812309055, "loss": 0.2449672371149063, "mean_token_accuracy": 0.9020196795463562, "num_tokens": 7056192.0, "step": 572 }, { "entropy": 1.5503774285316467, "epoch": 0.30173775671406006, "grad_norm": 0.3847261071205139, "learning_rate": 0.0001999200598734518, "loss": 0.23619771003723145, "mean_token_accuracy": 0.9090457707643509, "num_tokens": 7068528.0, "step": 573 }, { "entropy": 1.5812987089157104, "epoch": 0.3022643496577146, "grad_norm": 0.4005545675754547, "learning_rate": 0.00019991913317796825, "loss": 0.22766467928886414, "mean_token_accuracy": 0.9142022579908371, "num_tokens": 7080864.0, "step": 574 }, { "entropy": 1.5593630969524384, "epoch": 0.30279094260136913, "grad_norm": 0.3692858815193176, "learning_rate": 0.00019991820114450984, "loss": 0.24361425638198853, "mean_token_accuracy": 0.909025177359581, "num_tokens": 7093200.0, "step": 575 }, { "entropy": 1.639871895313263, "epoch": 0.3033175355450237, "grad_norm": 0.3423769176006317, "learning_rate": 0.0001999172637731319, "loss": 0.1989578753709793, "mean_token_accuracy": 0.9223005324602127, "num_tokens": 7105536.0, "step": 576 }, { "entropy": 1.5683670938014984, "epoch": 0.30384412848867826, "grad_norm": 0.3434232771396637, "learning_rate": 0.0001999163210638901, "loss": 0.23291000723838806, "mean_token_accuracy": 0.9105765074491501, "num_tokens": 7117872.0, "step": 577 }, { "entropy": 1.6403064131736755, "epoch": 0.3043707214323328, "grad_norm": 0.3877623975276947, "learning_rate": 0.00019991537301684037, "loss": 0.2589385509490967, "mean_token_accuracy": 0.9013812988996506, "num_tokens": 7130208.0, "step": 578 }, { "entropy": 1.577894926071167, "epoch": 0.3048973143759874, "grad_norm": 0.3848702013492584, "learning_rate": 0.00019991441963203906, "loss": 0.2235189825296402, "mean_token_accuracy": 0.9132665693759918, "num_tokens": 7142544.0, "step": 579 }, { "entropy": 1.594813734292984, "epoch": 0.3054239073196419, "grad_norm": 0.37452247738838196, "learning_rate": 0.00019991346090954268, "loss": 0.2309045046567917, "mean_token_accuracy": 0.9061081409454346, "num_tokens": 7154880.0, "step": 580 }, { "entropy": 1.6004383862018585, "epoch": 0.30595050026329645, "grad_norm": 0.36386990547180176, "learning_rate": 0.0001999124968494082, "loss": 0.22697995603084564, "mean_token_accuracy": 0.9153416603803635, "num_tokens": 7167216.0, "step": 581 }, { "entropy": 1.5263923108577728, "epoch": 0.30647709320695105, "grad_norm": 0.3861697316169739, "learning_rate": 0.00019991152745169283, "loss": 0.23612037301063538, "mean_token_accuracy": 0.9100482612848282, "num_tokens": 7179552.0, "step": 582 }, { "entropy": 1.4913224875926971, "epoch": 0.3070036861506056, "grad_norm": 0.37040355801582336, "learning_rate": 0.00019991055271645412, "loss": 0.2453731894493103, "mean_token_accuracy": 0.9096489399671555, "num_tokens": 7191888.0, "step": 583 }, { "entropy": 1.5870050489902496, "epoch": 0.3075302790942601, "grad_norm": 0.3563641309738159, "learning_rate": 0.00019990957264374992, "loss": 0.2088014781475067, "mean_token_accuracy": 0.9178295880556107, "num_tokens": 7204224.0, "step": 584 }, { "entropy": 1.5673131942749023, "epoch": 0.3080568720379147, "grad_norm": 0.42992061376571655, "learning_rate": 0.00019990858723363842, "loss": 0.22837956249713898, "mean_token_accuracy": 0.9150240123271942, "num_tokens": 7216560.0, "step": 585 }, { "entropy": 1.5697237253189087, "epoch": 0.30858346498156924, "grad_norm": 0.34907442331314087, "learning_rate": 0.00019990759648617814, "loss": 0.2061898112297058, "mean_token_accuracy": 0.9186743050813675, "num_tokens": 7228896.0, "step": 586 }, { "entropy": 1.5203896760940552, "epoch": 0.3091100579252238, "grad_norm": 0.3814384639263153, "learning_rate": 0.00019990660040142787, "loss": 0.23518475890159607, "mean_token_accuracy": 0.9073454886674881, "num_tokens": 7241232.0, "step": 587 }, { "entropy": 1.5959535539150238, "epoch": 0.30963665086887837, "grad_norm": 0.410187304019928, "learning_rate": 0.00019990559897944675, "loss": 0.2526550590991974, "mean_token_accuracy": 0.9053095877170563, "num_tokens": 7253568.0, "step": 588 }, { "entropy": 1.4929281175136566, "epoch": 0.3101632438125329, "grad_norm": 0.3563387989997864, "learning_rate": 0.00019990459222029422, "loss": 0.2284306138753891, "mean_token_accuracy": 0.9153739362955093, "num_tokens": 7265904.0, "step": 589 }, { "entropy": 1.5385482907295227, "epoch": 0.31068983675618744, "grad_norm": 0.3958924412727356, "learning_rate": 0.00019990358012403009, "loss": 0.25064951181411743, "mean_token_accuracy": 0.9019092172384262, "num_tokens": 7278240.0, "step": 590 }, { "entropy": 1.5795462429523468, "epoch": 0.31121642969984203, "grad_norm": 0.4616306722164154, "learning_rate": 0.00019990256269071435, "loss": 0.25259649753570557, "mean_token_accuracy": 0.9031090140342712, "num_tokens": 7290576.0, "step": 591 }, { "entropy": 1.5900325179100037, "epoch": 0.31174302264349657, "grad_norm": 0.36789095401763916, "learning_rate": 0.0001999015399204075, "loss": 0.239149808883667, "mean_token_accuracy": 0.9080104380846024, "num_tokens": 7302912.0, "step": 592 }, { "entropy": 1.595876008272171, "epoch": 0.3122696155871511, "grad_norm": 0.3929153084754944, "learning_rate": 0.0001999005118131702, "loss": 0.2852938175201416, "mean_token_accuracy": 0.8941920101642609, "num_tokens": 7315248.0, "step": 593 }, { "entropy": 1.616676688194275, "epoch": 0.3127962085308057, "grad_norm": 0.3501856327056885, "learning_rate": 0.00019989947836906346, "loss": 0.24000589549541473, "mean_token_accuracy": 0.9087683409452438, "num_tokens": 7327584.0, "step": 594 }, { "entropy": 1.6581095457077026, "epoch": 0.31332280147446023, "grad_norm": 0.42188331484794617, "learning_rate": 0.0001998984395881487, "loss": 0.24285097420215607, "mean_token_accuracy": 0.9076326787471771, "num_tokens": 7339920.0, "step": 595 }, { "entropy": 1.6323899328708649, "epoch": 0.3138493944181148, "grad_norm": 0.38462045788764954, "learning_rate": 0.00019989739547048753, "loss": 0.25823602080345154, "mean_token_accuracy": 0.9016465842723846, "num_tokens": 7352256.0, "step": 596 }, { "entropy": 1.648387372493744, "epoch": 0.31437598736176936, "grad_norm": 0.3550112545490265, "learning_rate": 0.00019989634601614198, "loss": 0.23165376484394073, "mean_token_accuracy": 0.9123150110244751, "num_tokens": 7364592.0, "step": 597 }, { "entropy": 1.541102021932602, "epoch": 0.3149025803054239, "grad_norm": 0.32691195607185364, "learning_rate": 0.0001998952912251743, "loss": 0.2173168659210205, "mean_token_accuracy": 0.9170237630605698, "num_tokens": 7376928.0, "step": 598 }, { "entropy": 1.5581879019737244, "epoch": 0.3154291732490785, "grad_norm": 0.37725362181663513, "learning_rate": 0.00019989423109764714, "loss": 0.22197510302066803, "mean_token_accuracy": 0.9138648211956024, "num_tokens": 7389264.0, "step": 599 }, { "entropy": 1.5590221285820007, "epoch": 0.315955766192733, "grad_norm": 0.36627396941185, "learning_rate": 0.0001998931656336234, "loss": 0.23069526255130768, "mean_token_accuracy": 0.9046057909727097, "num_tokens": 7401600.0, "step": 600 }, { "entropy": 1.617866188287735, "epoch": 0.31648235913638756, "grad_norm": 0.40031948685646057, "learning_rate": 0.00019989209483316637, "loss": 0.2336081862449646, "mean_token_accuracy": 0.9123480021953583, "num_tokens": 7413936.0, "step": 601 }, { "entropy": 1.53180992603302, "epoch": 0.31700895208004215, "grad_norm": 0.49535101652145386, "learning_rate": 0.00019989101869633962, "loss": 0.22568359971046448, "mean_token_accuracy": 0.9089675545692444, "num_tokens": 7426272.0, "step": 602 }, { "entropy": 1.5532157719135284, "epoch": 0.3175355450236967, "grad_norm": 0.4378284811973572, "learning_rate": 0.00019988993722320703, "loss": 0.2375514954328537, "mean_token_accuracy": 0.9061621576547623, "num_tokens": 7438608.0, "step": 603 }, { "entropy": 1.5265016555786133, "epoch": 0.3180621379673512, "grad_norm": 0.3522114157676697, "learning_rate": 0.0001998888504138327, "loss": 0.23949339985847473, "mean_token_accuracy": 0.9073717594146729, "num_tokens": 7450944.0, "step": 604 }, { "entropy": 1.61136794090271, "epoch": 0.3185887309110058, "grad_norm": 0.37977924942970276, "learning_rate": 0.00019988775826828133, "loss": 0.2230483740568161, "mean_token_accuracy": 0.9096570760011673, "num_tokens": 7463280.0, "step": 605 }, { "entropy": 1.593753159046173, "epoch": 0.31911532385466035, "grad_norm": 0.6494004130363464, "learning_rate": 0.0001998866607866176, "loss": 0.22851543128490448, "mean_token_accuracy": 0.9144780784845352, "num_tokens": 7475616.0, "step": 606 }, { "entropy": 1.5087667405605316, "epoch": 0.3196419167983149, "grad_norm": 0.3527071177959442, "learning_rate": 0.00019988555796890674, "loss": 0.20573341846466064, "mean_token_accuracy": 0.9186414480209351, "num_tokens": 7487952.0, "step": 607 }, { "entropy": 1.5721814334392548, "epoch": 0.3201685097419695, "grad_norm": 0.3536371886730194, "learning_rate": 0.00019988444981521418, "loss": 0.20877021551132202, "mean_token_accuracy": 0.9166864901781082, "num_tokens": 7500288.0, "step": 608 }, { "entropy": 1.5660102665424347, "epoch": 0.320695102685624, "grad_norm": 0.4063898026943207, "learning_rate": 0.00019988333632560572, "loss": 0.25388604402542114, "mean_token_accuracy": 0.9036387950181961, "num_tokens": 7512624.0, "step": 609 }, { "entropy": 1.5472122132778168, "epoch": 0.32122169562927855, "grad_norm": 0.3346962630748749, "learning_rate": 0.00019988221750014747, "loss": 0.2217264026403427, "mean_token_accuracy": 0.9168782234191895, "num_tokens": 7524960.0, "step": 610 }, { "entropy": 1.557081937789917, "epoch": 0.32174828857293314, "grad_norm": 0.37367674708366394, "learning_rate": 0.00019988109333890584, "loss": 0.21202939748764038, "mean_token_accuracy": 0.9218468219041824, "num_tokens": 7537296.0, "step": 611 }, { "entropy": 1.4869562089443207, "epoch": 0.3222748815165877, "grad_norm": 0.4604549705982208, "learning_rate": 0.00019987996384194755, "loss": 0.2245841920375824, "mean_token_accuracy": 0.9145530760288239, "num_tokens": 7549632.0, "step": 612 }, { "entropy": 1.515323966741562, "epoch": 0.3228014744602422, "grad_norm": 0.39376160502433777, "learning_rate": 0.0001998788290093397, "loss": 0.26140767335891724, "mean_token_accuracy": 0.8977334201335907, "num_tokens": 7561968.0, "step": 613 }, { "entropy": 1.487097293138504, "epoch": 0.3233280674038968, "grad_norm": 0.40344923734664917, "learning_rate": 0.00019987768884114962, "loss": 0.21170933544635773, "mean_token_accuracy": 0.9142201244831085, "num_tokens": 7574304.0, "step": 614 }, { "entropy": 1.4696341156959534, "epoch": 0.32385466034755134, "grad_norm": 0.3404286801815033, "learning_rate": 0.00019987654333744498, "loss": 0.2107430100440979, "mean_token_accuracy": 0.9169973582029343, "num_tokens": 7586640.0, "step": 615 }, { "entropy": 1.4763599038124084, "epoch": 0.3243812532912059, "grad_norm": 0.4449232518672943, "learning_rate": 0.00019987539249829381, "loss": 0.22219976782798767, "mean_token_accuracy": 0.9147885292768478, "num_tokens": 7598976.0, "step": 616 }, { "entropy": 1.4189346730709076, "epoch": 0.32490784623486046, "grad_norm": 0.33330264687538147, "learning_rate": 0.00019987423632376444, "loss": 0.20641736686229706, "mean_token_accuracy": 0.9154144078493118, "num_tokens": 7611312.0, "step": 617 }, { "entropy": 1.5400767922401428, "epoch": 0.325434439178515, "grad_norm": 0.3576372563838959, "learning_rate": 0.00019987307481392544, "loss": 0.21838723123073578, "mean_token_accuracy": 0.9165307581424713, "num_tokens": 7623648.0, "step": 618 }, { "entropy": 1.4934936463832855, "epoch": 0.32596103212216954, "grad_norm": 0.3858436942100525, "learning_rate": 0.00019987190796884582, "loss": 0.2230948656797409, "mean_token_accuracy": 0.9111486077308655, "num_tokens": 7635984.0, "step": 619 }, { "entropy": 1.5231453776359558, "epoch": 0.3264876250658241, "grad_norm": 0.3916998505592346, "learning_rate": 0.0001998707357885949, "loss": 0.2513001561164856, "mean_token_accuracy": 0.9021778851747513, "num_tokens": 7648320.0, "step": 620 }, { "entropy": 1.529598742723465, "epoch": 0.32701421800947866, "grad_norm": 0.768818736076355, "learning_rate": 0.00019986955827324215, "loss": 0.23995141685009003, "mean_token_accuracy": 0.9082267880439758, "num_tokens": 7660656.0, "step": 621 }, { "entropy": 1.56441992521286, "epoch": 0.32754081095313325, "grad_norm": 0.3836771249771118, "learning_rate": 0.0001998683754228575, "loss": 0.2571730613708496, "mean_token_accuracy": 0.905523344874382, "num_tokens": 7672992.0, "step": 622 }, { "entropy": 1.5032837986946106, "epoch": 0.3280674038967878, "grad_norm": 0.3536396920681, "learning_rate": 0.00019986718723751122, "loss": 0.2316400706768036, "mean_token_accuracy": 0.9121131896972656, "num_tokens": 7685328.0, "step": 623 }, { "entropy": 1.5374043881893158, "epoch": 0.3285939968404423, "grad_norm": 0.43927958607673645, "learning_rate": 0.00019986599371727383, "loss": 0.2222973108291626, "mean_token_accuracy": 0.9122229516506195, "num_tokens": 7697664.0, "step": 624 }, { "entropy": 1.5948379039764404, "epoch": 0.3291205897840969, "grad_norm": 0.3739503026008606, "learning_rate": 0.00019986479486221618, "loss": 0.23531857132911682, "mean_token_accuracy": 0.9108096957206726, "num_tokens": 7710000.0, "step": 625 }, { "entropy": 1.5133698880672455, "epoch": 0.32964718272775145, "grad_norm": 0.37042292952537537, "learning_rate": 0.00019986359067240942, "loss": 0.2119014859199524, "mean_token_accuracy": 0.9210023730993271, "num_tokens": 7722336.0, "step": 626 }, { "entropy": 1.565012902021408, "epoch": 0.330173775671406, "grad_norm": 0.36645272374153137, "learning_rate": 0.00019986238114792505, "loss": 0.22745972871780396, "mean_token_accuracy": 0.9089792966842651, "num_tokens": 7734672.0, "step": 627 }, { "entropy": 1.5374813377857208, "epoch": 0.3307003686150606, "grad_norm": 0.3918452858924866, "learning_rate": 0.00019986116628883485, "loss": 0.22233808040618896, "mean_token_accuracy": 0.91575026512146, "num_tokens": 7747008.0, "step": 628 }, { "entropy": 1.5814277529716492, "epoch": 0.3312269615587151, "grad_norm": 0.3956620395183563, "learning_rate": 0.00019985994609521098, "loss": 0.23237353563308716, "mean_token_accuracy": 0.9120265543460846, "num_tokens": 7759344.0, "step": 629 }, { "entropy": 1.607151210308075, "epoch": 0.33175355450236965, "grad_norm": 0.4154573380947113, "learning_rate": 0.00019985872056712585, "loss": 0.23763325810432434, "mean_token_accuracy": 0.9039438813924789, "num_tokens": 7771680.0, "step": 630 }, { "entropy": 1.5939337015151978, "epoch": 0.33228014744602424, "grad_norm": 0.5367919206619263, "learning_rate": 0.0001998574897046522, "loss": 0.22427549958229065, "mean_token_accuracy": 0.9124085754156113, "num_tokens": 7784016.0, "step": 631 }, { "entropy": 1.6544562876224518, "epoch": 0.3328067403896788, "grad_norm": 0.49991947412490845, "learning_rate": 0.00019985625350786313, "loss": 0.26143935322761536, "mean_token_accuracy": 0.8970800191164017, "num_tokens": 7796352.0, "step": 632 }, { "entropy": 1.567628562450409, "epoch": 0.3333333333333333, "grad_norm": 0.43659552931785583, "learning_rate": 0.00019985501197683202, "loss": 0.22153861820697784, "mean_token_accuracy": 0.9091014564037323, "num_tokens": 7808688.0, "step": 633 }, { "entropy": 1.6360341310501099, "epoch": 0.3338599262769879, "grad_norm": 0.406440794467926, "learning_rate": 0.00019985376511163255, "loss": 0.23250769078731537, "mean_token_accuracy": 0.9082053154706955, "num_tokens": 7821024.0, "step": 634 }, { "entropy": 1.617436408996582, "epoch": 0.33438651922064244, "grad_norm": 0.4746139347553253, "learning_rate": 0.00019985251291233872, "loss": 0.2448023557662964, "mean_token_accuracy": 0.9019272774457932, "num_tokens": 7833360.0, "step": 635 }, { "entropy": 1.5576602518558502, "epoch": 0.334913112164297, "grad_norm": 0.37426477670669556, "learning_rate": 0.00019985125537902497, "loss": 0.24818755686283112, "mean_token_accuracy": 0.9056387394666672, "num_tokens": 7845696.0, "step": 636 }, { "entropy": 1.5108153223991394, "epoch": 0.33543970510795157, "grad_norm": 0.36447635293006897, "learning_rate": 0.00019984999251176582, "loss": 0.23007383942604065, "mean_token_accuracy": 0.9102648496627808, "num_tokens": 7858032.0, "step": 637 }, { "entropy": 1.6435940563678741, "epoch": 0.3359662980516061, "grad_norm": 0.4201553165912628, "learning_rate": 0.00019984872431063632, "loss": 0.2524194121360779, "mean_token_accuracy": 0.9026057571172714, "num_tokens": 7870368.0, "step": 638 }, { "entropy": 1.5785358846187592, "epoch": 0.33649289099526064, "grad_norm": 0.34197092056274414, "learning_rate": 0.00019984745077571175, "loss": 0.22064879536628723, "mean_token_accuracy": 0.9168655872344971, "num_tokens": 7882704.0, "step": 639 }, { "entropy": 1.5749069154262543, "epoch": 0.33701948393891523, "grad_norm": 0.35670214891433716, "learning_rate": 0.00019984617190706768, "loss": 0.210345059633255, "mean_token_accuracy": 0.9159483909606934, "num_tokens": 7895040.0, "step": 640 }, { "entropy": 1.648300975561142, "epoch": 0.33754607688256977, "grad_norm": 0.5585328936576843, "learning_rate": 0.00019984488770478004, "loss": 0.26494815945625305, "mean_token_accuracy": 0.9005215167999268, "num_tokens": 7907376.0, "step": 641 }, { "entropy": 1.5516612827777863, "epoch": 0.3380726698262243, "grad_norm": 0.3812706172466278, "learning_rate": 0.0001998435981689251, "loss": 0.23725152015686035, "mean_token_accuracy": 0.9066549986600876, "num_tokens": 7919712.0, "step": 642 }, { "entropy": 1.538433849811554, "epoch": 0.3385992627698789, "grad_norm": 0.345907598733902, "learning_rate": 0.00019984230329957937, "loss": 0.21600767970085144, "mean_token_accuracy": 0.913017600774765, "num_tokens": 7932048.0, "step": 643 }, { "entropy": 1.5793551802635193, "epoch": 0.33912585571353343, "grad_norm": 0.375407874584198, "learning_rate": 0.00019984100309681973, "loss": 0.2297327220439911, "mean_token_accuracy": 0.9100670218467712, "num_tokens": 7944384.0, "step": 644 }, { "entropy": 1.6768275797367096, "epoch": 0.33965244865718797, "grad_norm": 0.3743014931678772, "learning_rate": 0.00019983969756072337, "loss": 0.23133614659309387, "mean_token_accuracy": 0.9111513495445251, "num_tokens": 7956720.0, "step": 645 }, { "entropy": 1.5642622113227844, "epoch": 0.34017904160084256, "grad_norm": 0.3964219093322754, "learning_rate": 0.00019983838669136782, "loss": 0.25138217210769653, "mean_token_accuracy": 0.9010957926511765, "num_tokens": 7969056.0, "step": 646 }, { "entropy": 1.562336266040802, "epoch": 0.3407056345444971, "grad_norm": 0.33525609970092773, "learning_rate": 0.00019983707048883083, "loss": 0.21662499010562897, "mean_token_accuracy": 0.9179873615503311, "num_tokens": 7981392.0, "step": 647 }, { "entropy": 1.5184325873851776, "epoch": 0.3412322274881517, "grad_norm": 0.36040404438972473, "learning_rate": 0.0001998357489531906, "loss": 0.21142053604125977, "mean_token_accuracy": 0.9129342883825302, "num_tokens": 7993728.0, "step": 648 }, { "entropy": 1.525155395269394, "epoch": 0.3417588204318062, "grad_norm": 0.37644830346107483, "learning_rate": 0.00019983442208452553, "loss": 0.24553003907203674, "mean_token_accuracy": 0.9037658125162125, "num_tokens": 8006064.0, "step": 649 }, { "entropy": 1.5811420381069183, "epoch": 0.34228541337546076, "grad_norm": 0.4055664837360382, "learning_rate": 0.00019983308988291446, "loss": 0.24890564382076263, "mean_token_accuracy": 0.9027184396982193, "num_tokens": 8018400.0, "step": 650 }, { "entropy": 1.5781408250331879, "epoch": 0.34281200631911535, "grad_norm": 0.37236547470092773, "learning_rate": 0.0001998317523484364, "loss": 0.2316565066576004, "mean_token_accuracy": 0.9119908362627029, "num_tokens": 8030736.0, "step": 651 }, { "entropy": 1.470947027206421, "epoch": 0.3433385992627699, "grad_norm": 0.3868812918663025, "learning_rate": 0.00019983040948117078, "loss": 0.2534410059452057, "mean_token_accuracy": 0.9021570980548859, "num_tokens": 8043072.0, "step": 652 }, { "entropy": 1.5348678827285767, "epoch": 0.3438651922064244, "grad_norm": 0.4387357234954834, "learning_rate": 0.00019982906128119732, "loss": 0.22310803830623627, "mean_token_accuracy": 0.9145376235246658, "num_tokens": 8055408.0, "step": 653 }, { "entropy": 1.6187977194786072, "epoch": 0.344391785150079, "grad_norm": 0.3973976671695709, "learning_rate": 0.00019982770774859608, "loss": 0.24628473818302155, "mean_token_accuracy": 0.9026829153299332, "num_tokens": 8067744.0, "step": 654 }, { "entropy": 1.552239865064621, "epoch": 0.34491837809373355, "grad_norm": 0.35203489661216736, "learning_rate": 0.00019982634888344737, "loss": 0.2246260643005371, "mean_token_accuracy": 0.9107431769371033, "num_tokens": 8080080.0, "step": 655 }, { "entropy": 1.5582615733146667, "epoch": 0.3454449710373881, "grad_norm": 0.35882458090782166, "learning_rate": 0.00019982498468583187, "loss": 0.24929207563400269, "mean_token_accuracy": 0.9079926460981369, "num_tokens": 8092416.0, "step": 656 }, { "entropy": 1.5417989492416382, "epoch": 0.3459715639810427, "grad_norm": 0.3812078833580017, "learning_rate": 0.00019982361515583056, "loss": 0.23627105355262756, "mean_token_accuracy": 0.9105822741985321, "num_tokens": 8104752.0, "step": 657 }, { "entropy": 1.5216515362262726, "epoch": 0.3464981569246972, "grad_norm": 0.425227552652359, "learning_rate": 0.00019982224029352477, "loss": 0.24528373777866364, "mean_token_accuracy": 0.9078731536865234, "num_tokens": 8117088.0, "step": 658 }, { "entropy": 1.5206952691078186, "epoch": 0.34702474986835175, "grad_norm": 0.33637750148773193, "learning_rate": 0.0001998208600989961, "loss": 0.2107471525669098, "mean_token_accuracy": 0.9135650843381882, "num_tokens": 8129424.0, "step": 659 }, { "entropy": 1.4702115952968597, "epoch": 0.34755134281200634, "grad_norm": 0.39711427688598633, "learning_rate": 0.00019981947457232646, "loss": 0.2600536048412323, "mean_token_accuracy": 0.900258481502533, "num_tokens": 8141760.0, "step": 660 }, { "entropy": 1.4251591563224792, "epoch": 0.34807793575566087, "grad_norm": 0.3307092487812042, "learning_rate": 0.00019981808371359816, "loss": 0.20669502019882202, "mean_token_accuracy": 0.9150898307561874, "num_tokens": 8154096.0, "step": 661 }, { "entropy": 1.4800917506217957, "epoch": 0.3486045286993154, "grad_norm": 0.3357905447483063, "learning_rate": 0.00019981668752289372, "loss": 0.21784240007400513, "mean_token_accuracy": 0.9145694226026535, "num_tokens": 8166432.0, "step": 662 }, { "entropy": 1.4939378798007965, "epoch": 0.34913112164297, "grad_norm": 0.3817315101623535, "learning_rate": 0.00019981528600029598, "loss": 0.23391678929328918, "mean_token_accuracy": 0.9120414704084396, "num_tokens": 8178768.0, "step": 663 }, { "entropy": 1.46476212143898, "epoch": 0.34965771458662454, "grad_norm": 0.38629287481307983, "learning_rate": 0.00019981387914588822, "loss": 0.2348746955394745, "mean_token_accuracy": 0.9141973257064819, "num_tokens": 8191104.0, "step": 664 }, { "entropy": 1.488828182220459, "epoch": 0.35018430753027907, "grad_norm": 0.43263551592826843, "learning_rate": 0.00019981246695975396, "loss": 0.24639199674129486, "mean_token_accuracy": 0.9060526490211487, "num_tokens": 8203440.0, "step": 665 }, { "entropy": 1.4127525091171265, "epoch": 0.35071090047393366, "grad_norm": 0.3648802936077118, "learning_rate": 0.00019981104944197698, "loss": 0.21946357190608978, "mean_token_accuracy": 0.9159405082464218, "num_tokens": 8215776.0, "step": 666 }, { "entropy": 1.4903503954410553, "epoch": 0.3512374934175882, "grad_norm": 0.34730279445648193, "learning_rate": 0.00019980962659264144, "loss": 0.2281692773103714, "mean_token_accuracy": 0.9098831713199615, "num_tokens": 8228112.0, "step": 667 }, { "entropy": 1.5247552990913391, "epoch": 0.35176408636124273, "grad_norm": 0.6796702742576599, "learning_rate": 0.00019980819841183185, "loss": 0.2541208267211914, "mean_token_accuracy": 0.899626687169075, "num_tokens": 8240448.0, "step": 668 }, { "entropy": 1.489711880683899, "epoch": 0.3522906793048973, "grad_norm": 0.33805036544799805, "learning_rate": 0.00019980676489963294, "loss": 0.2260848581790924, "mean_token_accuracy": 0.9087798148393631, "num_tokens": 8252784.0, "step": 669 }, { "entropy": 1.5027905106544495, "epoch": 0.35281727224855186, "grad_norm": 0.350353479385376, "learning_rate": 0.00019980532605612985, "loss": 0.21086406707763672, "mean_token_accuracy": 0.9210447818040848, "num_tokens": 8265120.0, "step": 670 }, { "entropy": 1.5674294233322144, "epoch": 0.35334386519220645, "grad_norm": 0.3340439200401306, "learning_rate": 0.00019980388188140798, "loss": 0.20525240898132324, "mean_token_accuracy": 0.922586515545845, "num_tokens": 8277456.0, "step": 671 }, { "entropy": 1.5054379403591156, "epoch": 0.353870458135861, "grad_norm": 0.3567858934402466, "learning_rate": 0.00019980243237555304, "loss": 0.2413492202758789, "mean_token_accuracy": 0.9065290242433548, "num_tokens": 8289792.0, "step": 672 }, { "entropy": 1.458409994840622, "epoch": 0.3543970510795155, "grad_norm": 0.3392413854598999, "learning_rate": 0.00019980097753865108, "loss": 0.21458403766155243, "mean_token_accuracy": 0.915942057967186, "num_tokens": 8302128.0, "step": 673 }, { "entropy": 1.5474618673324585, "epoch": 0.3549236440231701, "grad_norm": 0.3782627582550049, "learning_rate": 0.00019979951737078853, "loss": 0.24051563441753387, "mean_token_accuracy": 0.905216172337532, "num_tokens": 8314464.0, "step": 674 }, { "entropy": 1.453640639781952, "epoch": 0.35545023696682465, "grad_norm": 0.3473234474658966, "learning_rate": 0.000199798051872052, "loss": 0.22346456348896027, "mean_token_accuracy": 0.9117260426282883, "num_tokens": 8326800.0, "step": 675 }, { "entropy": 1.4625252783298492, "epoch": 0.3559768299104792, "grad_norm": 0.3387875258922577, "learning_rate": 0.0001997965810425285, "loss": 0.23459070920944214, "mean_token_accuracy": 0.9097730964422226, "num_tokens": 8339136.0, "step": 676 }, { "entropy": 1.4122467339038849, "epoch": 0.3565034228541338, "grad_norm": 0.3719231188297272, "learning_rate": 0.0001997951048823054, "loss": 0.21170935034751892, "mean_token_accuracy": 0.9177156686782837, "num_tokens": 8351472.0, "step": 677 }, { "entropy": 1.3950088024139404, "epoch": 0.3570300157977883, "grad_norm": 0.346206933259964, "learning_rate": 0.00019979362339147026, "loss": 0.24381937086582184, "mean_token_accuracy": 0.9096541851758957, "num_tokens": 8363808.0, "step": 678 }, { "entropy": 1.392151266336441, "epoch": 0.35755660874144285, "grad_norm": 0.4163087010383606, "learning_rate": 0.00019979213657011106, "loss": 0.23680301010608673, "mean_token_accuracy": 0.9078295677900314, "num_tokens": 8376144.0, "step": 679 }, { "entropy": 1.272907316684723, "epoch": 0.35808320168509744, "grad_norm": 0.4227026104927063, "learning_rate": 0.00019979064441831606, "loss": 0.2319648414850235, "mean_token_accuracy": 0.9085201323032379, "num_tokens": 8388480.0, "step": 680 }, { "entropy": 1.3540238738059998, "epoch": 0.358609794628752, "grad_norm": 0.41346514225006104, "learning_rate": 0.00019978914693617383, "loss": 0.228549063205719, "mean_token_accuracy": 0.9105959385633469, "num_tokens": 8400816.0, "step": 681 }, { "entropy": 1.360448271036148, "epoch": 0.3591363875724065, "grad_norm": 0.3442930281162262, "learning_rate": 0.0001997876441237733, "loss": 0.23922371864318848, "mean_token_accuracy": 0.9045034646987915, "num_tokens": 8413152.0, "step": 682 }, { "entropy": 1.2645371556282043, "epoch": 0.3596629805160611, "grad_norm": 0.3163891136646271, "learning_rate": 0.00019978613598120362, "loss": 0.23533323407173157, "mean_token_accuracy": 0.9094915986061096, "num_tokens": 8425488.0, "step": 683 }, { "entropy": 1.23646479845047, "epoch": 0.36018957345971564, "grad_norm": 0.3051406741142273, "learning_rate": 0.00019978462250855439, "loss": 0.23106315732002258, "mean_token_accuracy": 0.908999964594841, "num_tokens": 8437824.0, "step": 684 }, { "entropy": 1.2108670771121979, "epoch": 0.3607161664033702, "grad_norm": 0.3296745717525482, "learning_rate": 0.00019978310370591545, "loss": 0.21918885409832, "mean_token_accuracy": 0.9144444465637207, "num_tokens": 8450160.0, "step": 685 }, { "entropy": 1.2031162977218628, "epoch": 0.36124275934702477, "grad_norm": 0.34492868185043335, "learning_rate": 0.0001997815795733769, "loss": 0.23954619467258453, "mean_token_accuracy": 0.9077229052782059, "num_tokens": 8462496.0, "step": 686 }, { "entropy": 1.186975747346878, "epoch": 0.3617693522906793, "grad_norm": 0.3709777593612671, "learning_rate": 0.00019978005011102925, "loss": 0.2437351793050766, "mean_token_accuracy": 0.908468559384346, "num_tokens": 8474832.0, "step": 687 }, { "entropy": 1.2189928591251373, "epoch": 0.36229594523433384, "grad_norm": 0.39078283309936523, "learning_rate": 0.00019977851531896335, "loss": 0.23512142896652222, "mean_token_accuracy": 0.9079535007476807, "num_tokens": 8487168.0, "step": 688 }, { "entropy": 1.1402603685855865, "epoch": 0.36282253817798843, "grad_norm": 0.44031041860580444, "learning_rate": 0.00019977697519727025, "loss": 0.22278329730033875, "mean_token_accuracy": 0.9095389991998672, "num_tokens": 8499504.0, "step": 689 }, { "entropy": 1.2126906514167786, "epoch": 0.36334913112164297, "grad_norm": 0.4217199385166168, "learning_rate": 0.00019977542974604137, "loss": 0.2309587299823761, "mean_token_accuracy": 0.9086143374443054, "num_tokens": 8511840.0, "step": 690 }, { "entropy": 1.2279771864414215, "epoch": 0.3638757240652975, "grad_norm": 0.38159534335136414, "learning_rate": 0.00019977387896536847, "loss": 0.22851325571537018, "mean_token_accuracy": 0.9110317975282669, "num_tokens": 8524176.0, "step": 691 }, { "entropy": 1.1451427340507507, "epoch": 0.3644023170089521, "grad_norm": 0.38951390981674194, "learning_rate": 0.00019977232285534364, "loss": 0.22088123857975006, "mean_token_accuracy": 0.9204992055892944, "num_tokens": 8536512.0, "step": 692 }, { "entropy": 1.2615329325199127, "epoch": 0.36492890995260663, "grad_norm": 0.4139882028102875, "learning_rate": 0.0001997707614160592, "loss": 0.24705028533935547, "mean_token_accuracy": 0.9034076929092407, "num_tokens": 8548848.0, "step": 693 }, { "entropy": 1.283850759267807, "epoch": 0.36545550289626116, "grad_norm": 0.369973361492157, "learning_rate": 0.00019976919464760793, "loss": 0.22415512800216675, "mean_token_accuracy": 0.9107316434383392, "num_tokens": 8561184.0, "step": 694 }, { "entropy": 1.2292048037052155, "epoch": 0.36598209583991576, "grad_norm": 0.38250577449798584, "learning_rate": 0.00019976762255008277, "loss": 0.23568174242973328, "mean_token_accuracy": 0.9063956588506699, "num_tokens": 8573520.0, "step": 695 }, { "entropy": 1.2365350425243378, "epoch": 0.3665086887835703, "grad_norm": 0.3148071765899658, "learning_rate": 0.00019976604512357706, "loss": 0.1988360434770584, "mean_token_accuracy": 0.9224959909915924, "num_tokens": 8585856.0, "step": 696 }, { "entropy": 1.3029758036136627, "epoch": 0.3670352817272249, "grad_norm": 0.3744061589241028, "learning_rate": 0.00019976446236818444, "loss": 0.20495107769966125, "mean_token_accuracy": 0.9228791147470474, "num_tokens": 8598192.0, "step": 697 }, { "entropy": 1.2882287502288818, "epoch": 0.3675618746708794, "grad_norm": 0.36938560009002686, "learning_rate": 0.00019976287428399888, "loss": 0.21769095957279205, "mean_token_accuracy": 0.9142359048128128, "num_tokens": 8610528.0, "step": 698 }, { "entropy": 1.3306386470794678, "epoch": 0.36808846761453395, "grad_norm": 0.34892189502716064, "learning_rate": 0.00019976128087111468, "loss": 0.22379228472709656, "mean_token_accuracy": 0.910999983549118, "num_tokens": 8622864.0, "step": 699 }, { "entropy": 1.422240823507309, "epoch": 0.36861506055818855, "grad_norm": 0.4013206660747528, "learning_rate": 0.00019975968212962637, "loss": 0.24196377396583557, "mean_token_accuracy": 0.9052925109863281, "num_tokens": 8635200.0, "step": 700 }, { "entropy": 1.4155401587486267, "epoch": 0.3691416535018431, "grad_norm": 0.353211373090744, "learning_rate": 0.0001997580780596289, "loss": 0.23057395219802856, "mean_token_accuracy": 0.9112053066492081, "num_tokens": 8647536.0, "step": 701 }, { "entropy": 1.3654289841651917, "epoch": 0.3696682464454976, "grad_norm": 0.3298124372959137, "learning_rate": 0.0001997564686612175, "loss": 0.23379994928836823, "mean_token_accuracy": 0.9082982391119003, "num_tokens": 8659872.0, "step": 702 }, { "entropy": 1.4584643244743347, "epoch": 0.3701948393891522, "grad_norm": 0.3759617805480957, "learning_rate": 0.00019975485393448764, "loss": 0.23104792833328247, "mean_token_accuracy": 0.9065845310688019, "num_tokens": 8672208.0, "step": 703 }, { "entropy": 1.444229632616043, "epoch": 0.37072143233280674, "grad_norm": 0.3501303791999817, "learning_rate": 0.00019975323387953528, "loss": 0.2252783626317978, "mean_token_accuracy": 0.9078841656446457, "num_tokens": 8684544.0, "step": 704 }, { "entropy": 1.4961676001548767, "epoch": 0.3712480252764613, "grad_norm": 0.37864333391189575, "learning_rate": 0.00019975160849645656, "loss": 0.248760387301445, "mean_token_accuracy": 0.9001511335372925, "num_tokens": 8696880.0, "step": 705 }, { "entropy": 1.42547208070755, "epoch": 0.37177461822011587, "grad_norm": 0.34873253107070923, "learning_rate": 0.00019974997778534793, "loss": 0.21211083233356476, "mean_token_accuracy": 0.9166723936796188, "num_tokens": 8709216.0, "step": 706 }, { "entropy": 1.5042538046836853, "epoch": 0.3723012111637704, "grad_norm": 0.3550424873828888, "learning_rate": 0.00019974834174630622, "loss": 0.23886847496032715, "mean_token_accuracy": 0.907848909497261, "num_tokens": 8721552.0, "step": 707 }, { "entropy": 1.5081537961959839, "epoch": 0.37282780410742494, "grad_norm": 0.41367873549461365, "learning_rate": 0.00019974670037942855, "loss": 0.22889745235443115, "mean_token_accuracy": 0.9153233766555786, "num_tokens": 8733888.0, "step": 708 }, { "entropy": 1.3966407477855682, "epoch": 0.37335439705107953, "grad_norm": 0.3816620707511902, "learning_rate": 0.00019974505368481238, "loss": 0.22411897778511047, "mean_token_accuracy": 0.9170472025871277, "num_tokens": 8746224.0, "step": 709 }, { "entropy": 1.3528437912464142, "epoch": 0.37388098999473407, "grad_norm": 0.3909305930137634, "learning_rate": 0.00019974340166255543, "loss": 0.24883610010147095, "mean_token_accuracy": 0.9069965332746506, "num_tokens": 8758560.0, "step": 710 }, { "entropy": 1.3574591279029846, "epoch": 0.3744075829383886, "grad_norm": 0.3753831088542938, "learning_rate": 0.00019974174431275582, "loss": 0.21758557856082916, "mean_token_accuracy": 0.9138903617858887, "num_tokens": 8770896.0, "step": 711 }, { "entropy": 1.3783180713653564, "epoch": 0.3749341758820432, "grad_norm": 0.3737315833568573, "learning_rate": 0.0001997400816355119, "loss": 0.21359983086585999, "mean_token_accuracy": 0.9189057648181915, "num_tokens": 8783232.0, "step": 712 }, { "entropy": 1.3974202573299408, "epoch": 0.37546076882569773, "grad_norm": 0.349575012922287, "learning_rate": 0.00019973841363092232, "loss": 0.2197628617286682, "mean_token_accuracy": 0.910584107041359, "num_tokens": 8795568.0, "step": 713 }, { "entropy": 1.4738838374614716, "epoch": 0.37598736176935227, "grad_norm": 0.39151832461357117, "learning_rate": 0.0001997367402990862, "loss": 0.22688592970371246, "mean_token_accuracy": 0.9129604697227478, "num_tokens": 8807904.0, "step": 714 }, { "entropy": 1.4208093285560608, "epoch": 0.37651395471300686, "grad_norm": 0.41211023926734924, "learning_rate": 0.00019973506164010284, "loss": 0.20385678112506866, "mean_token_accuracy": 0.9227319210767746, "num_tokens": 8820240.0, "step": 715 }, { "entropy": 1.4047819375991821, "epoch": 0.3770405476566614, "grad_norm": 0.4299006164073944, "learning_rate": 0.00019973337765407187, "loss": 0.23750200867652893, "mean_token_accuracy": 0.9077501893043518, "num_tokens": 8832576.0, "step": 716 }, { "entropy": 1.374906837940216, "epoch": 0.37756714060031593, "grad_norm": 0.36846232414245605, "learning_rate": 0.00019973168834109327, "loss": 0.23285596072673798, "mean_token_accuracy": 0.9094402939081192, "num_tokens": 8844912.0, "step": 717 }, { "entropy": 1.4372902512550354, "epoch": 0.3780937335439705, "grad_norm": 0.3780461549758911, "learning_rate": 0.00019972999370126737, "loss": 0.23158109188079834, "mean_token_accuracy": 0.9099433869123459, "num_tokens": 8857248.0, "step": 718 }, { "entropy": 1.3874932825565338, "epoch": 0.37862032648762506, "grad_norm": 0.34537607431411743, "learning_rate": 0.00019972829373469467, "loss": 0.21864044666290283, "mean_token_accuracy": 0.9146191030740738, "num_tokens": 8869584.0, "step": 719 }, { "entropy": 1.374584138393402, "epoch": 0.3791469194312796, "grad_norm": 0.33857598900794983, "learning_rate": 0.00019972658844147621, "loss": 0.20933406054973602, "mean_token_accuracy": 0.917707160115242, "num_tokens": 8881920.0, "step": 720 }, { "entropy": 1.3695291578769684, "epoch": 0.3796735123749342, "grad_norm": 0.5717244148254395, "learning_rate": 0.0001997248778217131, "loss": 0.22078999876976013, "mean_token_accuracy": 0.9167369604110718, "num_tokens": 8894256.0, "step": 721 }, { "entropy": 1.26867213845253, "epoch": 0.3802001053185887, "grad_norm": 0.36367470026016235, "learning_rate": 0.000199723161875507, "loss": 0.23508650064468384, "mean_token_accuracy": 0.90509033203125, "num_tokens": 8906592.0, "step": 722 }, { "entropy": 1.3050034940242767, "epoch": 0.3807266982622433, "grad_norm": 0.3631988763809204, "learning_rate": 0.0001997214406029597, "loss": 0.22164851427078247, "mean_token_accuracy": 0.9132580459117889, "num_tokens": 8918928.0, "step": 723 }, { "entropy": 1.3181822001934052, "epoch": 0.38125329120589785, "grad_norm": 0.4014921486377716, "learning_rate": 0.00019971971400417342, "loss": 0.220194011926651, "mean_token_accuracy": 0.9143774807453156, "num_tokens": 8931264.0, "step": 724 }, { "entropy": 1.2655711770057678, "epoch": 0.3817798841495524, "grad_norm": 0.34297892451286316, "learning_rate": 0.00019971798207925063, "loss": 0.21592603623867035, "mean_token_accuracy": 0.9114037603139877, "num_tokens": 8943600.0, "step": 725 }, { "entropy": 1.3559162318706512, "epoch": 0.382306477093207, "grad_norm": 0.39595136046409607, "learning_rate": 0.00019971624482829415, "loss": 0.2135222852230072, "mean_token_accuracy": 0.9156046807765961, "num_tokens": 8955936.0, "step": 726 }, { "entropy": 1.4213075637817383, "epoch": 0.3828330700368615, "grad_norm": 0.35875996947288513, "learning_rate": 0.00019971450225140716, "loss": 0.22025166451931, "mean_token_accuracy": 0.9119539260864258, "num_tokens": 8968272.0, "step": 727 }, { "entropy": 1.2975660860538483, "epoch": 0.38335966298051605, "grad_norm": 0.33709245920181274, "learning_rate": 0.00019971275434869302, "loss": 0.2429068237543106, "mean_token_accuracy": 0.9056646823883057, "num_tokens": 8980608.0, "step": 728 }, { "entropy": 1.3944336771965027, "epoch": 0.38388625592417064, "grad_norm": 0.3580012321472168, "learning_rate": 0.0001997110011202556, "loss": 0.228425070643425, "mean_token_accuracy": 0.9088682681322098, "num_tokens": 8992944.0, "step": 729 }, { "entropy": 1.386294186115265, "epoch": 0.3844128488678252, "grad_norm": 0.5559288859367371, "learning_rate": 0.00019970924256619888, "loss": 0.22206491231918335, "mean_token_accuracy": 0.9095857888460159, "num_tokens": 9005280.0, "step": 730 }, { "entropy": 1.3968450129032135, "epoch": 0.3849394418114797, "grad_norm": 0.38346561789512634, "learning_rate": 0.0001997074786866273, "loss": 0.2516261637210846, "mean_token_accuracy": 0.9072631448507309, "num_tokens": 9017616.0, "step": 731 }, { "entropy": 1.3758391439914703, "epoch": 0.3854660347551343, "grad_norm": 0.4184466302394867, "learning_rate": 0.00019970570948164555, "loss": 0.2083946019411087, "mean_token_accuracy": 0.915515810251236, "num_tokens": 9029952.0, "step": 732 }, { "entropy": 1.3424640595912933, "epoch": 0.38599262769878884, "grad_norm": 0.3482263684272766, "learning_rate": 0.00019970393495135868, "loss": 0.23488564789295197, "mean_token_accuracy": 0.9109048992395401, "num_tokens": 9042288.0, "step": 733 }, { "entropy": 1.3400058150291443, "epoch": 0.3865192206424434, "grad_norm": 0.4521651268005371, "learning_rate": 0.00019970215509587205, "loss": 0.24672454595565796, "mean_token_accuracy": 0.9039757996797562, "num_tokens": 9054624.0, "step": 734 }, { "entropy": 1.3971166908740997, "epoch": 0.38704581358609796, "grad_norm": 0.3671362102031708, "learning_rate": 0.0001997003699152913, "loss": 0.22332459688186646, "mean_token_accuracy": 0.9150716066360474, "num_tokens": 9066960.0, "step": 735 }, { "entropy": 1.3570407629013062, "epoch": 0.3875724065297525, "grad_norm": 0.4007357358932495, "learning_rate": 0.00019969857940972235, "loss": 0.22975003719329834, "mean_token_accuracy": 0.9176786690950394, "num_tokens": 9079296.0, "step": 736 }, { "entropy": 1.3730257153511047, "epoch": 0.38809899947340704, "grad_norm": 0.3905254602432251, "learning_rate": 0.00019969678357927158, "loss": 0.22929853200912476, "mean_token_accuracy": 0.909871906042099, "num_tokens": 9091632.0, "step": 737 }, { "entropy": 1.3547758758068085, "epoch": 0.3886255924170616, "grad_norm": 0.36366337537765503, "learning_rate": 0.00019969498242404556, "loss": 0.22672298550605774, "mean_token_accuracy": 0.9105400443077087, "num_tokens": 9103968.0, "step": 738 }, { "entropy": 1.322388231754303, "epoch": 0.38915218536071616, "grad_norm": 0.3948267698287964, "learning_rate": 0.0001996931759441512, "loss": 0.21981076896190643, "mean_token_accuracy": 0.9127620607614517, "num_tokens": 9116304.0, "step": 739 }, { "entropy": 1.3535179495811462, "epoch": 0.3896787783043707, "grad_norm": 0.39007002115249634, "learning_rate": 0.00019969136413969577, "loss": 0.23180383443832397, "mean_token_accuracy": 0.9031165540218353, "num_tokens": 9128640.0, "step": 740 }, { "entropy": 1.395143300294876, "epoch": 0.3902053712480253, "grad_norm": 0.39624056220054626, "learning_rate": 0.00019968954701078678, "loss": 0.21380290389060974, "mean_token_accuracy": 0.9165746420621872, "num_tokens": 9140976.0, "step": 741 }, { "entropy": 1.3894523680210114, "epoch": 0.3907319641916798, "grad_norm": 0.37505805492401123, "learning_rate": 0.00019968772455753218, "loss": 0.21238526701927185, "mean_token_accuracy": 0.9176094681024551, "num_tokens": 9153312.0, "step": 742 }, { "entropy": 1.3369868099689484, "epoch": 0.39125855713533436, "grad_norm": 0.364109605550766, "learning_rate": 0.00019968589678004008, "loss": 0.2217993289232254, "mean_token_accuracy": 0.9145223498344421, "num_tokens": 9165648.0, "step": 743 }, { "entropy": 1.4128968715667725, "epoch": 0.39178515007898895, "grad_norm": 0.37613528966903687, "learning_rate": 0.00019968406367841903, "loss": 0.2087160050868988, "mean_token_accuracy": 0.9174602627754211, "num_tokens": 9177984.0, "step": 744 }, { "entropy": 1.3632179498672485, "epoch": 0.3923117430226435, "grad_norm": 0.3908347189426422, "learning_rate": 0.00019968222525277785, "loss": 0.24387134611606598, "mean_token_accuracy": 0.9096127450466156, "num_tokens": 9190320.0, "step": 745 }, { "entropy": 1.3598384857177734, "epoch": 0.392838335966298, "grad_norm": 0.4070599377155304, "learning_rate": 0.00019968038150322564, "loss": 0.22589103877544403, "mean_token_accuracy": 0.9176203459501266, "num_tokens": 9202656.0, "step": 746 }, { "entropy": 1.2700338661670685, "epoch": 0.3933649289099526, "grad_norm": 0.3903157711029053, "learning_rate": 0.0001996785324298719, "loss": 0.27620363235473633, "mean_token_accuracy": 0.89641934633255, "num_tokens": 9214992.0, "step": 747 }, { "entropy": 1.3561755120754242, "epoch": 0.39389152185360715, "grad_norm": 0.3912152647972107, "learning_rate": 0.00019967667803282637, "loss": 0.20860803127288818, "mean_token_accuracy": 0.918526291847229, "num_tokens": 9227328.0, "step": 748 }, { "entropy": 1.2694224119186401, "epoch": 0.39441811479726174, "grad_norm": 0.36671656370162964, "learning_rate": 0.00019967481831219917, "loss": 0.23243974149227142, "mean_token_accuracy": 0.9083072245121002, "num_tokens": 9239664.0, "step": 749 }, { "entropy": 1.2892687618732452, "epoch": 0.3949447077409163, "grad_norm": 0.33213678002357483, "learning_rate": 0.0001996729532681006, "loss": 0.22482578456401825, "mean_token_accuracy": 0.9108980298042297, "num_tokens": 9252000.0, "step": 750 }, { "entropy": 1.2784943878650665, "epoch": 0.3954713006845708, "grad_norm": 0.311139851808548, "learning_rate": 0.0001996710829006415, "loss": 0.22491638362407684, "mean_token_accuracy": 0.9146853238344193, "num_tokens": 9264336.0, "step": 751 }, { "entropy": 1.3392630815505981, "epoch": 0.3959978936282254, "grad_norm": 0.31522372364997864, "learning_rate": 0.00019966920720993286, "loss": 0.19653388857841492, "mean_token_accuracy": 0.9204227477312088, "num_tokens": 9276672.0, "step": 752 }, { "entropy": 1.3383756875991821, "epoch": 0.39652448657187994, "grad_norm": 0.353919118642807, "learning_rate": 0.00019966732619608598, "loss": 0.23490512371063232, "mean_token_accuracy": 0.9106432646512985, "num_tokens": 9289008.0, "step": 753 }, { "entropy": 1.3619754612445831, "epoch": 0.3970510795155345, "grad_norm": 0.40393969416618347, "learning_rate": 0.00019966543985921258, "loss": 0.25288036465644836, "mean_token_accuracy": 0.8984902203083038, "num_tokens": 9301344.0, "step": 754 }, { "entropy": 1.2913717925548553, "epoch": 0.39757767245918907, "grad_norm": 0.3196253478527069, "learning_rate": 0.00019966354819942462, "loss": 0.20618736743927002, "mean_token_accuracy": 0.9167482256889343, "num_tokens": 9313680.0, "step": 755 }, { "entropy": 1.3224665522575378, "epoch": 0.3981042654028436, "grad_norm": 0.32193470001220703, "learning_rate": 0.0001996616512168344, "loss": 0.21416081488132477, "mean_token_accuracy": 0.9158345758914948, "num_tokens": 9326016.0, "step": 756 }, { "entropy": 1.3358683288097382, "epoch": 0.39863085834649814, "grad_norm": 0.3324636220932007, "learning_rate": 0.00019965974891155458, "loss": 0.23043948411941528, "mean_token_accuracy": 0.9085040837526321, "num_tokens": 9338352.0, "step": 757 }, { "entropy": 1.3305124342441559, "epoch": 0.39915745129015273, "grad_norm": 0.34178489446640015, "learning_rate": 0.00019965784128369798, "loss": 0.22156858444213867, "mean_token_accuracy": 0.9111177027225494, "num_tokens": 9350688.0, "step": 758 }, { "entropy": 1.3993423879146576, "epoch": 0.39968404423380727, "grad_norm": 0.35117653012275696, "learning_rate": 0.00019965592833337797, "loss": 0.24540282785892487, "mean_token_accuracy": 0.9031884074211121, "num_tokens": 9363024.0, "step": 759 }, { "entropy": 1.363684356212616, "epoch": 0.4002106371774618, "grad_norm": 0.3588322699069977, "learning_rate": 0.000199654010060708, "loss": 0.23427176475524902, "mean_token_accuracy": 0.9089349061250687, "num_tokens": 9375360.0, "step": 760 }, { "entropy": 1.3599910140037537, "epoch": 0.4007372301211164, "grad_norm": 0.3444473147392273, "learning_rate": 0.000199652086465802, "loss": 0.2288491129875183, "mean_token_accuracy": 0.909742534160614, "num_tokens": 9387696.0, "step": 761 }, { "entropy": 1.3465708196163177, "epoch": 0.40126382306477093, "grad_norm": 0.3881551921367645, "learning_rate": 0.00019965015754877419, "loss": 0.21851959824562073, "mean_token_accuracy": 0.911541685461998, "num_tokens": 9400032.0, "step": 762 }, { "entropy": 1.3606258928775787, "epoch": 0.40179041600842547, "grad_norm": 0.3825187683105469, "learning_rate": 0.00019964822330973902, "loss": 0.24844150245189667, "mean_token_accuracy": 0.905233234167099, "num_tokens": 9412368.0, "step": 763 }, { "entropy": 1.4477742910385132, "epoch": 0.40231700895208006, "grad_norm": 0.4269307553768158, "learning_rate": 0.00019964628374881133, "loss": 0.21143238246440887, "mean_token_accuracy": 0.914307177066803, "num_tokens": 9424704.0, "step": 764 }, { "entropy": 1.4273262321949005, "epoch": 0.4028436018957346, "grad_norm": 0.477578341960907, "learning_rate": 0.0001996443388661063, "loss": 0.21041172742843628, "mean_token_accuracy": 0.9194318652153015, "num_tokens": 9437040.0, "step": 765 }, { "entropy": 1.42348974943161, "epoch": 0.40337019483938913, "grad_norm": 0.42482423782348633, "learning_rate": 0.00019964238866173933, "loss": 0.22475981712341309, "mean_token_accuracy": 0.9095583707094193, "num_tokens": 9449376.0, "step": 766 }, { "entropy": 1.3782070577144623, "epoch": 0.4038967877830437, "grad_norm": 0.3717379570007324, "learning_rate": 0.00019964043313582626, "loss": 0.2339317947626114, "mean_token_accuracy": 0.9064943641424179, "num_tokens": 9461712.0, "step": 767 }, { "entropy": 1.3753153681755066, "epoch": 0.40442338072669826, "grad_norm": 0.32700079679489136, "learning_rate": 0.00019963847228848312, "loss": 0.2289605587720871, "mean_token_accuracy": 0.9136441200971603, "num_tokens": 9474048.0, "step": 768 }, { "entropy": 1.3423367142677307, "epoch": 0.4049499736703528, "grad_norm": 0.4840228855609894, "learning_rate": 0.00019963650611982636, "loss": 0.24808013439178467, "mean_token_accuracy": 0.9013350456953049, "num_tokens": 9486384.0, "step": 769 }, { "entropy": 1.388725221157074, "epoch": 0.4054765666140074, "grad_norm": 0.3298131823539734, "learning_rate": 0.0001996345346299726, "loss": 0.21849092841148376, "mean_token_accuracy": 0.9153172671794891, "num_tokens": 9498720.0, "step": 770 }, { "entropy": 1.362036794424057, "epoch": 0.4060031595576619, "grad_norm": 0.423976331949234, "learning_rate": 0.00019963255781903902, "loss": 0.2337607443332672, "mean_token_accuracy": 0.9124665558338165, "num_tokens": 9511056.0, "step": 771 }, { "entropy": 1.321341723203659, "epoch": 0.40652975250131645, "grad_norm": 0.39548537135124207, "learning_rate": 0.00019963057568714288, "loss": 0.2241300493478775, "mean_token_accuracy": 0.9098886847496033, "num_tokens": 9523392.0, "step": 772 }, { "entropy": 1.2956216037273407, "epoch": 0.40705634544497105, "grad_norm": 0.36130490899086, "learning_rate": 0.00019962858823440184, "loss": 0.22631655633449554, "mean_token_accuracy": 0.9111677557229996, "num_tokens": 9535728.0, "step": 773 }, { "entropy": 1.3697873950004578, "epoch": 0.4075829383886256, "grad_norm": 0.3786010444164276, "learning_rate": 0.00019962659546093395, "loss": 0.22168497741222382, "mean_token_accuracy": 0.9110663533210754, "num_tokens": 9548064.0, "step": 774 }, { "entropy": 1.3025212287902832, "epoch": 0.4081095313322802, "grad_norm": 0.3891861140727997, "learning_rate": 0.00019962459736685745, "loss": 0.2645792067050934, "mean_token_accuracy": 0.8977373838424683, "num_tokens": 9560400.0, "step": 775 }, { "entropy": 1.3207987844944, "epoch": 0.4086361242759347, "grad_norm": 0.40660449862480164, "learning_rate": 0.000199622593952291, "loss": 0.23059073090553284, "mean_token_accuracy": 0.9096915870904922, "num_tokens": 9572736.0, "step": 776 }, { "entropy": 1.2878498435020447, "epoch": 0.40916271721958924, "grad_norm": 0.35745811462402344, "learning_rate": 0.00019962058521735346, "loss": 0.21263521909713745, "mean_token_accuracy": 0.9142482280731201, "num_tokens": 9585072.0, "step": 777 }, { "entropy": 1.2785497307777405, "epoch": 0.40968931016324384, "grad_norm": 0.3724184036254883, "learning_rate": 0.00019961857116216415, "loss": 0.2524154484272003, "mean_token_accuracy": 0.8991471230983734, "num_tokens": 9597408.0, "step": 778 }, { "entropy": 1.2408149540424347, "epoch": 0.41021590310689837, "grad_norm": 0.3448520600795746, "learning_rate": 0.00019961655178684263, "loss": 0.20971742272377014, "mean_token_accuracy": 0.9130227416753769, "num_tokens": 9609744.0, "step": 779 }, { "entropy": 1.2202830016613007, "epoch": 0.4107424960505529, "grad_norm": 0.37864333391189575, "learning_rate": 0.0001996145270915087, "loss": 0.23903977870941162, "mean_token_accuracy": 0.9029916822910309, "num_tokens": 9622080.0, "step": 780 }, { "entropy": 1.1748075485229492, "epoch": 0.4112690889942075, "grad_norm": 0.36790093779563904, "learning_rate": 0.0001996124970762827, "loss": 0.24326302111148834, "mean_token_accuracy": 0.9089493155479431, "num_tokens": 9634416.0, "step": 781 }, { "entropy": 1.1609198153018951, "epoch": 0.41179568193786203, "grad_norm": 0.3445703685283661, "learning_rate": 0.00019961046174128496, "loss": 0.22028180956840515, "mean_token_accuracy": 0.9107068032026291, "num_tokens": 9646752.0, "step": 782 }, { "entropy": 1.1026230156421661, "epoch": 0.41232227488151657, "grad_norm": 0.3440577983856201, "learning_rate": 0.00019960842108663644, "loss": 0.19753555953502655, "mean_token_accuracy": 0.9187215715646744, "num_tokens": 9659088.0, "step": 783 }, { "entropy": 1.1320343911647797, "epoch": 0.41284886782517116, "grad_norm": 0.38988834619522095, "learning_rate": 0.00019960637511245823, "loss": 0.24359619617462158, "mean_token_accuracy": 0.9055552929639816, "num_tokens": 9671424.0, "step": 784 }, { "entropy": 1.1358483731746674, "epoch": 0.4133754607688257, "grad_norm": 0.34981632232666016, "learning_rate": 0.0001996043238188718, "loss": 0.24487480521202087, "mean_token_accuracy": 0.9070784449577332, "num_tokens": 9683760.0, "step": 785 }, { "entropy": 1.1212266087532043, "epoch": 0.41390205371248023, "grad_norm": 0.3241615891456604, "learning_rate": 0.0001996022672059989, "loss": 0.2086082100868225, "mean_token_accuracy": 0.9190200418233871, "num_tokens": 9696096.0, "step": 786 }, { "entropy": 1.1631585955619812, "epoch": 0.4144286466561348, "grad_norm": 0.36856940388679504, "learning_rate": 0.00019960020527396165, "loss": 0.20457178354263306, "mean_token_accuracy": 0.9173056781291962, "num_tokens": 9708432.0, "step": 787 }, { "entropy": 1.1695051193237305, "epoch": 0.41495523959978936, "grad_norm": 0.3899996876716614, "learning_rate": 0.00019959813802288245, "loss": 0.24216774106025696, "mean_token_accuracy": 0.9103662818670273, "num_tokens": 9720768.0, "step": 788 }, { "entropy": 1.1804447770118713, "epoch": 0.4154818325434439, "grad_norm": 0.3940189778804779, "learning_rate": 0.000199596065452884, "loss": 0.2604479491710663, "mean_token_accuracy": 0.8987935930490494, "num_tokens": 9733104.0, "step": 789 }, { "entropy": 1.2298611104488373, "epoch": 0.4160084254870985, "grad_norm": 0.3992246687412262, "learning_rate": 0.00019959398756408937, "loss": 0.24308446049690247, "mean_token_accuracy": 0.9046371877193451, "num_tokens": 9745440.0, "step": 790 }, { "entropy": 1.130595326423645, "epoch": 0.416535018430753, "grad_norm": 0.32028424739837646, "learning_rate": 0.00019959190435662186, "loss": 0.21361656486988068, "mean_token_accuracy": 0.9175485223531723, "num_tokens": 9757776.0, "step": 791 }, { "entropy": 1.2031766474246979, "epoch": 0.41706161137440756, "grad_norm": 0.3323441445827484, "learning_rate": 0.00019958981583060518, "loss": 0.22529007494449615, "mean_token_accuracy": 0.9116253554821014, "num_tokens": 9770112.0, "step": 792 }, { "entropy": 1.1709198653697968, "epoch": 0.41758820431806215, "grad_norm": 0.3305797874927521, "learning_rate": 0.0001995877219861633, "loss": 0.21258684992790222, "mean_token_accuracy": 0.9117163866758347, "num_tokens": 9782448.0, "step": 793 }, { "entropy": 1.2462036609649658, "epoch": 0.4181147972617167, "grad_norm": 0.32563477754592896, "learning_rate": 0.00019958562282342056, "loss": 0.22679030895233154, "mean_token_accuracy": 0.9114914387464523, "num_tokens": 9794784.0, "step": 794 }, { "entropy": 1.1364922225475311, "epoch": 0.4186413902053712, "grad_norm": 0.3199447989463806, "learning_rate": 0.0001995835183425015, "loss": 0.22316469252109528, "mean_token_accuracy": 0.9091953933238983, "num_tokens": 9807120.0, "step": 795 }, { "entropy": 1.2300072014331818, "epoch": 0.4191679831490258, "grad_norm": 0.3554495871067047, "learning_rate": 0.0001995814085435311, "loss": 0.2148018628358841, "mean_token_accuracy": 0.9172432273626328, "num_tokens": 9819456.0, "step": 796 }, { "entropy": 1.2751358449459076, "epoch": 0.41969457609268035, "grad_norm": 0.3625534772872925, "learning_rate": 0.00019957929342663457, "loss": 0.217167928814888, "mean_token_accuracy": 0.9148837774991989, "num_tokens": 9831792.0, "step": 797 }, { "entropy": 1.2123389542102814, "epoch": 0.42022116903633494, "grad_norm": 0.3511140048503876, "learning_rate": 0.00019957717299193752, "loss": 0.21881210803985596, "mean_token_accuracy": 0.9147087782621384, "num_tokens": 9844128.0, "step": 798 }, { "entropy": 1.2617943584918976, "epoch": 0.4207477619799895, "grad_norm": 0.3321590721607208, "learning_rate": 0.0001995750472395658, "loss": 0.22508296370506287, "mean_token_accuracy": 0.9119736105203629, "num_tokens": 9856464.0, "step": 799 }, { "entropy": 1.2528738677501678, "epoch": 0.421274354923644, "grad_norm": 0.3493482768535614, "learning_rate": 0.00019957291616964565, "loss": 0.234869584441185, "mean_token_accuracy": 0.9126180708408356, "num_tokens": 9868800.0, "step": 800 }, { "entropy": 1.263050615787506, "epoch": 0.4218009478672986, "grad_norm": 0.33217278122901917, "learning_rate": 0.00019957077978230347, "loss": 0.22601178288459778, "mean_token_accuracy": 0.9101445376873016, "num_tokens": 9881136.0, "step": 801 }, { "entropy": 1.279297262430191, "epoch": 0.42232754081095314, "grad_norm": 0.3346133232116699, "learning_rate": 0.00019956863807766618, "loss": 0.22423239052295685, "mean_token_accuracy": 0.9134156703948975, "num_tokens": 9893472.0, "step": 802 }, { "entropy": 1.342239260673523, "epoch": 0.4228541337546077, "grad_norm": 0.32531458139419556, "learning_rate": 0.00019956649105586088, "loss": 0.23583942651748657, "mean_token_accuracy": 0.9080929756164551, "num_tokens": 9905808.0, "step": 803 }, { "entropy": 1.301451414823532, "epoch": 0.42338072669826227, "grad_norm": 0.3336106240749359, "learning_rate": 0.00019956433871701508, "loss": 0.23021520674228668, "mean_token_accuracy": 0.9132036864757538, "num_tokens": 9918144.0, "step": 804 }, { "entropy": 1.294978141784668, "epoch": 0.4239073196419168, "grad_norm": 0.36648303270339966, "learning_rate": 0.00019956218106125648, "loss": 0.216038778424263, "mean_token_accuracy": 0.9193701446056366, "num_tokens": 9930480.0, "step": 805 }, { "entropy": 1.3323890268802643, "epoch": 0.42443391258557134, "grad_norm": 0.5710987448692322, "learning_rate": 0.00019956001808871322, "loss": 0.21820521354675293, "mean_token_accuracy": 0.9192979484796524, "num_tokens": 9942816.0, "step": 806 }, { "entropy": 1.3704762756824493, "epoch": 0.42496050552922593, "grad_norm": 0.3389364778995514, "learning_rate": 0.00019955784979951366, "loss": 0.20125524699687958, "mean_token_accuracy": 0.9225403815507889, "num_tokens": 9955152.0, "step": 807 }, { "entropy": 1.361533671617508, "epoch": 0.42548709847288047, "grad_norm": 0.36687371134757996, "learning_rate": 0.00019955567619378653, "loss": 0.22097808122634888, "mean_token_accuracy": 0.9130203276872635, "num_tokens": 9967488.0, "step": 808 }, { "entropy": 1.3404709100723267, "epoch": 0.426013691416535, "grad_norm": 0.3457012474536896, "learning_rate": 0.00019955349727166088, "loss": 0.21268591284751892, "mean_token_accuracy": 0.9194072186946869, "num_tokens": 9979824.0, "step": 809 }, { "entropy": 1.3375678360462189, "epoch": 0.4265402843601896, "grad_norm": 0.3357281982898712, "learning_rate": 0.0001995513130332661, "loss": 0.21844780445098877, "mean_token_accuracy": 0.9134986102581024, "num_tokens": 9992160.0, "step": 810 }, { "entropy": 1.373364269733429, "epoch": 0.42706687730384413, "grad_norm": 0.3841971457004547, "learning_rate": 0.00019954912347873175, "loss": 0.2078622281551361, "mean_token_accuracy": 0.9202176630496979, "num_tokens": 10004496.0, "step": 811 }, { "entropy": 1.3305988311767578, "epoch": 0.42759347024749866, "grad_norm": 0.3852640986442566, "learning_rate": 0.0001995469286081879, "loss": 0.2230588048696518, "mean_token_accuracy": 0.9157514870166779, "num_tokens": 10016832.0, "step": 812 }, { "entropy": 1.3437947630882263, "epoch": 0.42812006319115326, "grad_norm": 0.390927791595459, "learning_rate": 0.0001995447284217648, "loss": 0.22504432499408722, "mean_token_accuracy": 0.911404550075531, "num_tokens": 10029168.0, "step": 813 }, { "entropy": 1.4292974174022675, "epoch": 0.4286466561348078, "grad_norm": 0.3649219274520874, "learning_rate": 0.00019954252291959313, "loss": 0.22576412558555603, "mean_token_accuracy": 0.9123170077800751, "num_tokens": 10041504.0, "step": 814 }, { "entropy": 1.3408824503421783, "epoch": 0.4291732490784623, "grad_norm": 0.4012393355369568, "learning_rate": 0.00019954031210180371, "loss": 0.2239188551902771, "mean_token_accuracy": 0.9098076522350311, "num_tokens": 10053840.0, "step": 815 }, { "entropy": 1.3955635130405426, "epoch": 0.4296998420221169, "grad_norm": 0.31125685572624207, "learning_rate": 0.00019953809596852786, "loss": 0.21482022106647491, "mean_token_accuracy": 0.9152773320674896, "num_tokens": 10066176.0, "step": 816 }, { "entropy": 1.372936338186264, "epoch": 0.43022643496577145, "grad_norm": 0.3509393632411957, "learning_rate": 0.00019953587451989712, "loss": 0.2275184839963913, "mean_token_accuracy": 0.9097452610731125, "num_tokens": 10078512.0, "step": 817 }, { "entropy": 1.2875484228134155, "epoch": 0.430753027909426, "grad_norm": 0.32160601019859314, "learning_rate": 0.00019953364775604336, "loss": 0.22542208433151245, "mean_token_accuracy": 0.9094801992177963, "num_tokens": 10090848.0, "step": 818 }, { "entropy": 1.387698233127594, "epoch": 0.4312796208530806, "grad_norm": 0.3713604807853699, "learning_rate": 0.00019953141567709878, "loss": 0.2560008466243744, "mean_token_accuracy": 0.9061192125082016, "num_tokens": 10103184.0, "step": 819 }, { "entropy": 1.3468024134635925, "epoch": 0.4318062137967351, "grad_norm": 0.30053895711898804, "learning_rate": 0.00019952917828319587, "loss": 0.21902483701705933, "mean_token_accuracy": 0.9183452129364014, "num_tokens": 10115520.0, "step": 820 }, { "entropy": 1.2196392714977264, "epoch": 0.43233280674038965, "grad_norm": 0.3135424256324768, "learning_rate": 0.00019952693557446748, "loss": 0.2191144973039627, "mean_token_accuracy": 0.9174018204212189, "num_tokens": 10127856.0, "step": 821 }, { "entropy": 1.341955155134201, "epoch": 0.43285939968404424, "grad_norm": 0.31046387553215027, "learning_rate": 0.00019952468755104672, "loss": 0.19744142889976501, "mean_token_accuracy": 0.9225213825702667, "num_tokens": 10140192.0, "step": 822 }, { "entropy": 1.2434613406658173, "epoch": 0.4333859926276988, "grad_norm": 0.3251499831676483, "learning_rate": 0.00019952243421306708, "loss": 0.22867801785469055, "mean_token_accuracy": 0.9065830409526825, "num_tokens": 10152528.0, "step": 823 }, { "entropy": 1.2479578852653503, "epoch": 0.43391258557135337, "grad_norm": 0.33372238278388977, "learning_rate": 0.0001995201755606622, "loss": 0.24028503894805908, "mean_token_accuracy": 0.9034052640199661, "num_tokens": 10164864.0, "step": 824 }, { "entropy": 1.2929136455059052, "epoch": 0.4344391785150079, "grad_norm": 0.3748015761375427, "learning_rate": 0.00019951791159396635, "loss": 0.22330275177955627, "mean_token_accuracy": 0.9107150882482529, "num_tokens": 10177200.0, "step": 825 }, { "entropy": 1.1717173159122467, "epoch": 0.43496577145866244, "grad_norm": 0.32337212562561035, "learning_rate": 0.00019951564231311382, "loss": 0.20805582404136658, "mean_token_accuracy": 0.9200474917888641, "num_tokens": 10189536.0, "step": 826 }, { "entropy": 1.2089639604091644, "epoch": 0.43549236440231703, "grad_norm": 0.3620331883430481, "learning_rate": 0.00019951336771823936, "loss": 0.24102292954921722, "mean_token_accuracy": 0.9084760844707489, "num_tokens": 10201872.0, "step": 827 }, { "entropy": 1.2690958082675934, "epoch": 0.43601895734597157, "grad_norm": 0.3436319828033447, "learning_rate": 0.00019951108780947793, "loss": 0.2396576702594757, "mean_token_accuracy": 0.9085531234741211, "num_tokens": 10214208.0, "step": 828 }, { "entropy": 1.1895755529403687, "epoch": 0.4365455502896261, "grad_norm": 0.3198072612285614, "learning_rate": 0.00019950880258696495, "loss": 0.21371476352214813, "mean_token_accuracy": 0.9214041531085968, "num_tokens": 10226544.0, "step": 829 }, { "entropy": 1.2306865453720093, "epoch": 0.4370721432332807, "grad_norm": 0.33646130561828613, "learning_rate": 0.00019950651205083607, "loss": 0.22665852308273315, "mean_token_accuracy": 0.9108365774154663, "num_tokens": 10238880.0, "step": 830 }, { "entropy": 1.2199313044548035, "epoch": 0.43759873617693523, "grad_norm": 0.2950493395328522, "learning_rate": 0.00019950421620122726, "loss": 0.19776280224323273, "mean_token_accuracy": 0.922358974814415, "num_tokens": 10251216.0, "step": 831 }, { "entropy": 1.2803155779838562, "epoch": 0.43812532912058977, "grad_norm": 0.3180263638496399, "learning_rate": 0.00019950191503827477, "loss": 0.2287098914384842, "mean_token_accuracy": 0.9091289192438126, "num_tokens": 10263552.0, "step": 832 }, { "entropy": 1.278805285692215, "epoch": 0.43865192206424436, "grad_norm": 0.30920109152793884, "learning_rate": 0.00019949960856211526, "loss": 0.22083017230033875, "mean_token_accuracy": 0.915079653263092, "num_tokens": 10275888.0, "step": 833 }, { "entropy": 1.255694329738617, "epoch": 0.4391785150078989, "grad_norm": 0.3112378716468811, "learning_rate": 0.00019949729677288568, "loss": 0.22883734107017517, "mean_token_accuracy": 0.9063798487186432, "num_tokens": 10288224.0, "step": 834 }, { "entropy": 1.2695356905460358, "epoch": 0.43970510795155343, "grad_norm": 0.36405643820762634, "learning_rate": 0.00019949497967072314, "loss": 0.25639811158180237, "mean_token_accuracy": 0.8983906358480453, "num_tokens": 10300560.0, "step": 835 }, { "entropy": 1.1852473616600037, "epoch": 0.440231700895208, "grad_norm": 0.3179355561733246, "learning_rate": 0.00019949265725576534, "loss": 0.2258102297782898, "mean_token_accuracy": 0.911256417632103, "num_tokens": 10312896.0, "step": 836 }, { "entropy": 1.2247830629348755, "epoch": 0.44075829383886256, "grad_norm": 0.30152472853660583, "learning_rate": 0.00019949032952815002, "loss": 0.22182312607765198, "mean_token_accuracy": 0.9133886694908142, "num_tokens": 10325232.0, "step": 837 }, { "entropy": 1.2358119487762451, "epoch": 0.4412848867825171, "grad_norm": 0.3537450134754181, "learning_rate": 0.00019948799648801546, "loss": 0.23890867829322815, "mean_token_accuracy": 0.9061432033777237, "num_tokens": 10337568.0, "step": 838 }, { "entropy": 1.255542904138565, "epoch": 0.4418114797261717, "grad_norm": 0.3185861110687256, "learning_rate": 0.00019948565813550012, "loss": 0.2323358654975891, "mean_token_accuracy": 0.910455733537674, "num_tokens": 10349904.0, "step": 839 }, { "entropy": 1.2060716450214386, "epoch": 0.4423380726698262, "grad_norm": 0.2943599820137024, "learning_rate": 0.00019948331447074282, "loss": 0.1973709762096405, "mean_token_accuracy": 0.9198663532733917, "num_tokens": 10362240.0, "step": 840 }, { "entropy": 1.23261758685112, "epoch": 0.44286466561348076, "grad_norm": 0.3526243269443512, "learning_rate": 0.00019948096549388269, "loss": 0.2500985562801361, "mean_token_accuracy": 0.9066997915506363, "num_tokens": 10374576.0, "step": 841 }, { "entropy": 1.237447440624237, "epoch": 0.44339125855713535, "grad_norm": 0.3191603422164917, "learning_rate": 0.00019947861120505914, "loss": 0.21682989597320557, "mean_token_accuracy": 0.914885938167572, "num_tokens": 10386912.0, "step": 842 }, { "entropy": 1.2385708093643188, "epoch": 0.4439178515007899, "grad_norm": 0.31065261363983154, "learning_rate": 0.000199476251604412, "loss": 0.22177095711231232, "mean_token_accuracy": 0.9108449369668961, "num_tokens": 10399248.0, "step": 843 }, { "entropy": 1.209405928850174, "epoch": 0.4444444444444444, "grad_norm": 0.3202918767929077, "learning_rate": 0.0001994738866920813, "loss": 0.23262163996696472, "mean_token_accuracy": 0.906676635146141, "num_tokens": 10411584.0, "step": 844 }, { "entropy": 1.2493412792682648, "epoch": 0.444971037388099, "grad_norm": 0.3377321660518646, "learning_rate": 0.00019947151646820745, "loss": 0.25681400299072266, "mean_token_accuracy": 0.9044294059276581, "num_tokens": 10423920.0, "step": 845 }, { "entropy": 1.2441616654396057, "epoch": 0.44549763033175355, "grad_norm": 0.3140577971935272, "learning_rate": 0.00019946914093293115, "loss": 0.23581147193908691, "mean_token_accuracy": 0.9107285887002945, "num_tokens": 10436256.0, "step": 846 }, { "entropy": 1.2595540583133698, "epoch": 0.4460242232754081, "grad_norm": 0.32932135462760925, "learning_rate": 0.00019946676008639343, "loss": 0.2249414175748825, "mean_token_accuracy": 0.9159797579050064, "num_tokens": 10448592.0, "step": 847 }, { "entropy": 1.2226338982582092, "epoch": 0.4465508162190627, "grad_norm": 0.3085028827190399, "learning_rate": 0.00019946437392873555, "loss": 0.22729279100894928, "mean_token_accuracy": 0.914769247174263, "num_tokens": 10460928.0, "step": 848 }, { "entropy": 1.2365905344486237, "epoch": 0.4470774091627172, "grad_norm": 0.33299946784973145, "learning_rate": 0.00019946198246009928, "loss": 0.23490425944328308, "mean_token_accuracy": 0.9082431495189667, "num_tokens": 10473264.0, "step": 849 }, { "entropy": 1.4061111807823181, "epoch": 0.4476040021063718, "grad_norm": 0.3621409833431244, "learning_rate": 0.00019945958568062656, "loss": 0.22818249464035034, "mean_token_accuracy": 0.9102335572242737, "num_tokens": 10485600.0, "step": 850 }, { "entropy": 1.2550583481788635, "epoch": 0.44813059505002634, "grad_norm": 0.33583348989486694, "learning_rate": 0.0001994571835904596, "loss": 0.2311660647392273, "mean_token_accuracy": 0.9055789560079575, "num_tokens": 10497936.0, "step": 851 }, { "entropy": 1.306765854358673, "epoch": 0.4486571879936809, "grad_norm": 0.34734323620796204, "learning_rate": 0.00019945477618974104, "loss": 0.24055415391921997, "mean_token_accuracy": 0.9080438315868378, "num_tokens": 10510272.0, "step": 852 }, { "entropy": 1.3021958768367767, "epoch": 0.44918378093733546, "grad_norm": 0.35933780670166016, "learning_rate": 0.00019945236347861383, "loss": 0.22972102463245392, "mean_token_accuracy": 0.9099899232387543, "num_tokens": 10522608.0, "step": 853 }, { "entropy": 1.2393949925899506, "epoch": 0.44971037388099, "grad_norm": 0.33583781123161316, "learning_rate": 0.00019944994545722115, "loss": 0.19537097215652466, "mean_token_accuracy": 0.9247924536466599, "num_tokens": 10534944.0, "step": 854 }, { "entropy": 1.2775700390338898, "epoch": 0.45023696682464454, "grad_norm": 0.33388838171958923, "learning_rate": 0.00019944752212570658, "loss": 0.20106476545333862, "mean_token_accuracy": 0.9226871877908707, "num_tokens": 10547280.0, "step": 855 }, { "entropy": 1.2714512348175049, "epoch": 0.4507635597682991, "grad_norm": 0.3518841862678528, "learning_rate": 0.00019944509348421394, "loss": 0.24091394245624542, "mean_token_accuracy": 0.9107283055782318, "num_tokens": 10559616.0, "step": 856 }, { "entropy": 1.3004609048366547, "epoch": 0.45129015271195366, "grad_norm": 0.31591442227363586, "learning_rate": 0.00019944265953288746, "loss": 0.22405283153057098, "mean_token_accuracy": 0.9140247255563736, "num_tokens": 10571952.0, "step": 857 }, { "entropy": 1.2649115324020386, "epoch": 0.4518167456556082, "grad_norm": 0.34270599484443665, "learning_rate": 0.00019944022027187157, "loss": 0.2242221236228943, "mean_token_accuracy": 0.9118231236934662, "num_tokens": 10584288.0, "step": 858 }, { "entropy": 1.20332869887352, "epoch": 0.4523433385992628, "grad_norm": 0.33847615122795105, "learning_rate": 0.0001994377757013111, "loss": 0.22582295536994934, "mean_token_accuracy": 0.9115125685930252, "num_tokens": 10596624.0, "step": 859 }, { "entropy": 1.2661672830581665, "epoch": 0.4528699315429173, "grad_norm": 0.34885501861572266, "learning_rate": 0.00019943532582135116, "loss": 0.2379041314125061, "mean_token_accuracy": 0.9074203372001648, "num_tokens": 10608960.0, "step": 860 }, { "entropy": 1.2014594674110413, "epoch": 0.45339652448657186, "grad_norm": 0.29767417907714844, "learning_rate": 0.0001994328706321372, "loss": 0.20825329422950745, "mean_token_accuracy": 0.9220836907625198, "num_tokens": 10621296.0, "step": 861 }, { "entropy": 1.1979358792304993, "epoch": 0.45392311743022645, "grad_norm": 0.33858057856559753, "learning_rate": 0.000199430410133815, "loss": 0.21688413619995117, "mean_token_accuracy": 0.9154618680477142, "num_tokens": 10633632.0, "step": 862 }, { "entropy": 1.1113716661930084, "epoch": 0.454449710373881, "grad_norm": 0.32101956009864807, "learning_rate": 0.00019942794432653053, "loss": 0.20722433924674988, "mean_token_accuracy": 0.9159047454595566, "num_tokens": 10645968.0, "step": 863 }, { "entropy": 1.1962774693965912, "epoch": 0.4549763033175355, "grad_norm": 0.34402385354042053, "learning_rate": 0.00019942547321043027, "loss": 0.2361735999584198, "mean_token_accuracy": 0.9091803878545761, "num_tokens": 10658304.0, "step": 864 }, { "entropy": 1.2290304005146027, "epoch": 0.4555028962611901, "grad_norm": 0.35236313939094543, "learning_rate": 0.00019942299678566086, "loss": 0.21090444922447205, "mean_token_accuracy": 0.9149055033922195, "num_tokens": 10670640.0, "step": 865 }, { "entropy": 1.1575745642185211, "epoch": 0.45602948920484465, "grad_norm": 0.34065473079681396, "learning_rate": 0.00019942051505236936, "loss": 0.2252214103937149, "mean_token_accuracy": 0.9156748950481415, "num_tokens": 10682976.0, "step": 866 }, { "entropy": 1.216041624546051, "epoch": 0.4565560821484992, "grad_norm": 0.34139883518218994, "learning_rate": 0.00019941802801070303, "loss": 0.2223672717809677, "mean_token_accuracy": 0.9103764742612839, "num_tokens": 10695312.0, "step": 867 }, { "entropy": 1.210105150938034, "epoch": 0.4570826750921538, "grad_norm": 0.33792680501937866, "learning_rate": 0.00019941553566080956, "loss": 0.21836510300636292, "mean_token_accuracy": 0.9169131815433502, "num_tokens": 10707648.0, "step": 868 }, { "entropy": 1.2123220264911652, "epoch": 0.4576092680358083, "grad_norm": 0.33836740255355835, "learning_rate": 0.0001994130380028369, "loss": 0.22877393662929535, "mean_token_accuracy": 0.9094105064868927, "num_tokens": 10719984.0, "step": 869 }, { "entropy": 1.2113963067531586, "epoch": 0.45813586097946285, "grad_norm": 0.3214447796344757, "learning_rate": 0.00019941053503693329, "loss": 0.22401154041290283, "mean_token_accuracy": 0.9101571440696716, "num_tokens": 10732320.0, "step": 870 }, { "entropy": 1.2003886699676514, "epoch": 0.45866245392311744, "grad_norm": 0.32083162665367126, "learning_rate": 0.00019940802676324734, "loss": 0.22345268726348877, "mean_token_accuracy": 0.909741148352623, "num_tokens": 10744656.0, "step": 871 }, { "entropy": 1.2443215548992157, "epoch": 0.459189046866772, "grad_norm": 0.32810378074645996, "learning_rate": 0.00019940551318192796, "loss": 0.22558192908763885, "mean_token_accuracy": 0.911412313580513, "num_tokens": 10756992.0, "step": 872 }, { "entropy": 1.2517528235912323, "epoch": 0.4597156398104265, "grad_norm": 0.2983804941177368, "learning_rate": 0.00019940299429312437, "loss": 0.22902357578277588, "mean_token_accuracy": 0.9084698557853699, "num_tokens": 10769328.0, "step": 873 }, { "entropy": 1.331667423248291, "epoch": 0.4602422327540811, "grad_norm": 0.33570387959480286, "learning_rate": 0.00019940047009698605, "loss": 0.21841317415237427, "mean_token_accuracy": 0.9151860028505325, "num_tokens": 10781664.0, "step": 874 }, { "entropy": 1.2408846318721771, "epoch": 0.46076882569773564, "grad_norm": 0.3269551992416382, "learning_rate": 0.00019939794059366294, "loss": 0.21816705167293549, "mean_token_accuracy": 0.9179367125034332, "num_tokens": 10794000.0, "step": 875 }, { "entropy": 1.2641226053237915, "epoch": 0.46129541864139023, "grad_norm": 0.31645506620407104, "learning_rate": 0.0001993954057833051, "loss": 0.22259601950645447, "mean_token_accuracy": 0.9116221219301224, "num_tokens": 10806336.0, "step": 876 }, { "entropy": 1.2864770293235779, "epoch": 0.46182201158504477, "grad_norm": 0.36219751834869385, "learning_rate": 0.0001993928656660631, "loss": 0.23597069084644318, "mean_token_accuracy": 0.9075523316860199, "num_tokens": 10818672.0, "step": 877 }, { "entropy": 1.284227877855301, "epoch": 0.4623486045286993, "grad_norm": 0.33684641122817993, "learning_rate": 0.00019939032024208762, "loss": 0.23688027262687683, "mean_token_accuracy": 0.90504090487957, "num_tokens": 10831008.0, "step": 878 }, { "entropy": 1.2863526940345764, "epoch": 0.4628751974723539, "grad_norm": 0.3741551637649536, "learning_rate": 0.0001993877695115299, "loss": 0.26197415590286255, "mean_token_accuracy": 0.8967071026563644, "num_tokens": 10843344.0, "step": 879 }, { "entropy": 1.3029287159442902, "epoch": 0.46340179041600843, "grad_norm": 0.33679425716400146, "learning_rate": 0.00019938521347454127, "loss": 0.2334819734096527, "mean_token_accuracy": 0.9123462438583374, "num_tokens": 10855680.0, "step": 880 }, { "entropy": 1.2353507280349731, "epoch": 0.46392838335966297, "grad_norm": 0.3251015543937683, "learning_rate": 0.00019938265213127344, "loss": 0.24127048254013062, "mean_token_accuracy": 0.9032625257968903, "num_tokens": 10868016.0, "step": 881 }, { "entropy": 1.2318426966667175, "epoch": 0.46445497630331756, "grad_norm": 0.3128981292247772, "learning_rate": 0.0001993800854818786, "loss": 0.23091557621955872, "mean_token_accuracy": 0.910790741443634, "num_tokens": 10880352.0, "step": 882 }, { "entropy": 1.1969189643859863, "epoch": 0.4649815692469721, "grad_norm": 0.2763598561286926, "learning_rate": 0.000199377513526509, "loss": 0.19723600149154663, "mean_token_accuracy": 0.9164901375770569, "num_tokens": 10892688.0, "step": 883 }, { "entropy": 1.3742352426052094, "epoch": 0.46550816219062663, "grad_norm": 0.36182069778442383, "learning_rate": 0.00019937493626531733, "loss": 0.23250778019428253, "mean_token_accuracy": 0.910800889134407, "num_tokens": 10905024.0, "step": 884 }, { "entropy": 1.287173181772232, "epoch": 0.4660347551342812, "grad_norm": 0.37185028195381165, "learning_rate": 0.00019937235369845666, "loss": 0.2612641453742981, "mean_token_accuracy": 0.8980638682842255, "num_tokens": 10917360.0, "step": 885 }, { "entropy": 1.256176471710205, "epoch": 0.46656134807793576, "grad_norm": 0.3193638026714325, "learning_rate": 0.00019936976582608023, "loss": 0.2168237864971161, "mean_token_accuracy": 0.9117200374603271, "num_tokens": 10929696.0, "step": 886 }, { "entropy": 1.3229191601276398, "epoch": 0.4670879410215903, "grad_norm": 0.3389144241809845, "learning_rate": 0.00019936717264834166, "loss": 0.22236081957817078, "mean_token_accuracy": 0.9158815294504166, "num_tokens": 10942032.0, "step": 887 }, { "entropy": 1.3444121778011322, "epoch": 0.4676145339652449, "grad_norm": 0.30865800380706787, "learning_rate": 0.00019936457416539497, "loss": 0.22498130798339844, "mean_token_accuracy": 0.9109358042478561, "num_tokens": 10954368.0, "step": 888 }, { "entropy": 1.3391337096691132, "epoch": 0.4681411269088994, "grad_norm": 0.34072619676589966, "learning_rate": 0.00019936197037739433, "loss": 0.25583821535110474, "mean_token_accuracy": 0.9030615091323853, "num_tokens": 10966704.0, "step": 889 }, { "entropy": 1.3236074447631836, "epoch": 0.46866771985255395, "grad_norm": 0.30708205699920654, "learning_rate": 0.00019935936128449437, "loss": 0.2282828986644745, "mean_token_accuracy": 0.9107722789049149, "num_tokens": 10979040.0, "step": 890 }, { "entropy": 1.3548866510391235, "epoch": 0.46919431279620855, "grad_norm": 0.3132648766040802, "learning_rate": 0.00019935674688684993, "loss": 0.21266606450080872, "mean_token_accuracy": 0.9191526621580124, "num_tokens": 10991376.0, "step": 891 }, { "entropy": 1.3176174461841583, "epoch": 0.4697209057398631, "grad_norm": 0.2955908477306366, "learning_rate": 0.00019935412718461625, "loss": 0.21996596455574036, "mean_token_accuracy": 0.9133886098861694, "num_tokens": 11003712.0, "step": 892 }, { "entropy": 1.3978124856948853, "epoch": 0.4702474986835176, "grad_norm": 0.29386526346206665, "learning_rate": 0.00019935150217794887, "loss": 0.21586540341377258, "mean_token_accuracy": 0.913035660982132, "num_tokens": 11016048.0, "step": 893 }, { "entropy": 1.3344171047210693, "epoch": 0.4707740916271722, "grad_norm": 0.307434618473053, "learning_rate": 0.00019934887186700352, "loss": 0.19684919714927673, "mean_token_accuracy": 0.9249100238084793, "num_tokens": 11028384.0, "step": 894 }, { "entropy": 1.2738686203956604, "epoch": 0.47130068457082674, "grad_norm": 0.30784371495246887, "learning_rate": 0.00019934623625193646, "loss": 0.23357078433036804, "mean_token_accuracy": 0.906443789601326, "num_tokens": 11040720.0, "step": 895 }, { "entropy": 1.3004032373428345, "epoch": 0.4718272775144813, "grad_norm": 0.3604377806186676, "learning_rate": 0.0001993435953329041, "loss": 0.23538318276405334, "mean_token_accuracy": 0.910987451672554, "num_tokens": 11053056.0, "step": 896 }, { "entropy": 1.349770426750183, "epoch": 0.47235387045813587, "grad_norm": 0.371415913105011, "learning_rate": 0.00019934094911006322, "loss": 0.23594705760478973, "mean_token_accuracy": 0.9082933962345123, "num_tokens": 11065392.0, "step": 897 }, { "entropy": 1.3280587792396545, "epoch": 0.4728804634017904, "grad_norm": 0.3518844544887543, "learning_rate": 0.0001993382975835709, "loss": 0.22077634930610657, "mean_token_accuracy": 0.9151550680398941, "num_tokens": 11077728.0, "step": 898 }, { "entropy": 1.2467398941516876, "epoch": 0.473407056345445, "grad_norm": 0.3485780358314514, "learning_rate": 0.00019933564075358455, "loss": 0.21681727468967438, "mean_token_accuracy": 0.917348250746727, "num_tokens": 11090064.0, "step": 899 }, { "entropy": 1.2497498095035553, "epoch": 0.47393364928909953, "grad_norm": 0.2795222997665405, "learning_rate": 0.0001993329786202619, "loss": 0.19592691957950592, "mean_token_accuracy": 0.92547307908535, "num_tokens": 11102400.0, "step": 900 }, { "entropy": 1.3175421953201294, "epoch": 0.47446024223275407, "grad_norm": 0.34323444962501526, "learning_rate": 0.00019933031118376097, "loss": 0.23341751098632812, "mean_token_accuracy": 0.9069218635559082, "num_tokens": 11114736.0, "step": 901 }, { "entropy": 1.2457618713378906, "epoch": 0.47498683517640866, "grad_norm": 0.3164939284324646, "learning_rate": 0.00019932763844424017, "loss": 0.2065175175666809, "mean_token_accuracy": 0.9177182614803314, "num_tokens": 11127072.0, "step": 902 }, { "entropy": 1.2637942731380463, "epoch": 0.4755134281200632, "grad_norm": 0.3504999279975891, "learning_rate": 0.00019932496040185808, "loss": 0.21458998322486877, "mean_token_accuracy": 0.9221720099449158, "num_tokens": 11139408.0, "step": 903 }, { "entropy": 1.2935825884342194, "epoch": 0.47604002106371773, "grad_norm": 0.37840691208839417, "learning_rate": 0.00019932227705677372, "loss": 0.227766752243042, "mean_token_accuracy": 0.9137209206819534, "num_tokens": 11151744.0, "step": 904 }, { "entropy": 1.3187288045883179, "epoch": 0.4765666140073723, "grad_norm": 0.35070836544036865, "learning_rate": 0.00019931958840914635, "loss": 0.23313553631305695, "mean_token_accuracy": 0.9072595983743668, "num_tokens": 11164080.0, "step": 905 }, { "entropy": 1.2109759449958801, "epoch": 0.47709320695102686, "grad_norm": 0.3268450200557709, "learning_rate": 0.00019931689445913564, "loss": 0.21801263093948364, "mean_token_accuracy": 0.9163070619106293, "num_tokens": 11176416.0, "step": 906 }, { "entropy": 1.2274765968322754, "epoch": 0.4776197998946814, "grad_norm": 0.3167557120323181, "learning_rate": 0.00019931419520690147, "loss": 0.21107861399650574, "mean_token_accuracy": 0.9160606116056442, "num_tokens": 11188752.0, "step": 907 }, { "entropy": 1.1903901398181915, "epoch": 0.478146392838336, "grad_norm": 0.3267144560813904, "learning_rate": 0.00019931149065260413, "loss": 0.20752331614494324, "mean_token_accuracy": 0.9146323353052139, "num_tokens": 11201088.0, "step": 908 }, { "entropy": 1.2301645576953888, "epoch": 0.4786729857819905, "grad_norm": 0.3323666751384735, "learning_rate": 0.0001993087807964041, "loss": 0.20132845640182495, "mean_token_accuracy": 0.9229601621627808, "num_tokens": 11213424.0, "step": 909 }, { "entropy": 1.2413881123065948, "epoch": 0.47919957872564506, "grad_norm": 0.3245013356208801, "learning_rate": 0.00019930606563846234, "loss": 0.19781675934791565, "mean_token_accuracy": 0.9200431853532791, "num_tokens": 11225760.0, "step": 910 }, { "entropy": 1.180581659078598, "epoch": 0.47972617166929965, "grad_norm": 0.31535807251930237, "learning_rate": 0.00019930334517893991, "loss": 0.2060268521308899, "mean_token_accuracy": 0.9165100157260895, "num_tokens": 11238096.0, "step": 911 }, { "entropy": 1.233038753271103, "epoch": 0.4802527646129542, "grad_norm": 0.32888907194137573, "learning_rate": 0.0001993006194179984, "loss": 0.22726945579051971, "mean_token_accuracy": 0.9112953692674637, "num_tokens": 11250432.0, "step": 912 }, { "entropy": 1.262090653181076, "epoch": 0.4807793575566087, "grad_norm": 0.3833845555782318, "learning_rate": 0.00019929788835579962, "loss": 0.23385398089885712, "mean_token_accuracy": 0.9076380431652069, "num_tokens": 11262768.0, "step": 913 }, { "entropy": 1.2252440452575684, "epoch": 0.4813059505002633, "grad_norm": 0.3054254949092865, "learning_rate": 0.00019929515199250565, "loss": 0.21175538003444672, "mean_token_accuracy": 0.91593237221241, "num_tokens": 11275104.0, "step": 914 }, { "entropy": 1.2347098588943481, "epoch": 0.48183254344391785, "grad_norm": 0.32731181383132935, "learning_rate": 0.00019929241032827898, "loss": 0.21469083428382874, "mean_token_accuracy": 0.9144894182682037, "num_tokens": 11287440.0, "step": 915 }, { "entropy": 1.2054485082626343, "epoch": 0.4823591363875724, "grad_norm": 0.3010466694831848, "learning_rate": 0.0001992896633632823, "loss": 0.2065753936767578, "mean_token_accuracy": 0.9242510497570038, "num_tokens": 11299776.0, "step": 916 }, { "entropy": 1.2271296083927155, "epoch": 0.482885729331227, "grad_norm": 0.42679160833358765, "learning_rate": 0.00019928691109767876, "loss": 0.23648393154144287, "mean_token_accuracy": 0.9071210771799088, "num_tokens": 11312112.0, "step": 917 }, { "entropy": 1.233128011226654, "epoch": 0.4834123222748815, "grad_norm": 0.3018331229686737, "learning_rate": 0.00019928415353163173, "loss": 0.20864740014076233, "mean_token_accuracy": 0.9222661405801773, "num_tokens": 11324448.0, "step": 918 }, { "entropy": 1.2823042571544647, "epoch": 0.48393891521853605, "grad_norm": 0.44017431139945984, "learning_rate": 0.00019928139066530487, "loss": 0.23257723450660706, "mean_token_accuracy": 0.9054065048694611, "num_tokens": 11336784.0, "step": 919 }, { "entropy": 1.2760326564311981, "epoch": 0.48446550816219064, "grad_norm": 0.3077127933502197, "learning_rate": 0.00019927862249886222, "loss": 0.22436192631721497, "mean_token_accuracy": 0.9136722385883331, "num_tokens": 11349120.0, "step": 920 }, { "entropy": 1.3157328069210052, "epoch": 0.4849921011058452, "grad_norm": 0.29968273639678955, "learning_rate": 0.0001992758490324681, "loss": 0.20738902688026428, "mean_token_accuracy": 0.9168381989002228, "num_tokens": 11361456.0, "step": 921 }, { "entropy": 1.3066685795783997, "epoch": 0.4855186940494997, "grad_norm": 0.31207534670829773, "learning_rate": 0.00019927307026628715, "loss": 0.2138848602771759, "mean_token_accuracy": 0.9126945734024048, "num_tokens": 11373792.0, "step": 922 }, { "entropy": 1.3030335009098053, "epoch": 0.4860452869931543, "grad_norm": 0.3280918598175049, "learning_rate": 0.00019927028620048438, "loss": 0.23367798328399658, "mean_token_accuracy": 0.9077742546796799, "num_tokens": 11386128.0, "step": 923 }, { "entropy": 1.2811558842658997, "epoch": 0.48657187993680884, "grad_norm": 0.376886248588562, "learning_rate": 0.00019926749683522502, "loss": 0.20860403776168823, "mean_token_accuracy": 0.9099331349134445, "num_tokens": 11398464.0, "step": 924 }, { "entropy": 1.2956900000572205, "epoch": 0.48709847288046343, "grad_norm": 0.2849150598049164, "learning_rate": 0.00019926470217067463, "loss": 0.20377135276794434, "mean_token_accuracy": 0.9249068945646286, "num_tokens": 11410800.0, "step": 925 }, { "entropy": 1.3335639834403992, "epoch": 0.48762506582411796, "grad_norm": 0.30451253056526184, "learning_rate": 0.00019926190220699916, "loss": 0.2137700468301773, "mean_token_accuracy": 0.9165246337652206, "num_tokens": 11423136.0, "step": 926 }, { "entropy": 1.3315201103687286, "epoch": 0.4881516587677725, "grad_norm": 0.31507113575935364, "learning_rate": 0.0001992590969443648, "loss": 0.22226491570472717, "mean_token_accuracy": 0.9110458046197891, "num_tokens": 11435472.0, "step": 927 }, { "entropy": 1.3439573049545288, "epoch": 0.4886782517114271, "grad_norm": 0.3123377561569214, "learning_rate": 0.00019925628638293815, "loss": 0.2124030739068985, "mean_token_accuracy": 0.9143670797348022, "num_tokens": 11447808.0, "step": 928 }, { "entropy": 1.373394101858139, "epoch": 0.4892048446550816, "grad_norm": 0.38396134972572327, "learning_rate": 0.00019925347052288594, "loss": 0.21086710691452026, "mean_token_accuracy": 0.9174065738916397, "num_tokens": 11460144.0, "step": 929 }, { "entropy": 1.3038064241409302, "epoch": 0.48973143759873616, "grad_norm": 0.3282279074192047, "learning_rate": 0.00019925064936437544, "loss": 0.19842374324798584, "mean_token_accuracy": 0.9203700721263885, "num_tokens": 11472480.0, "step": 930 }, { "entropy": 1.39743971824646, "epoch": 0.49025803054239075, "grad_norm": 0.3458907902240753, "learning_rate": 0.00019924782290757403, "loss": 0.21870574355125427, "mean_token_accuracy": 0.9133100211620331, "num_tokens": 11484816.0, "step": 931 }, { "entropy": 1.3737529814243317, "epoch": 0.4907846234860453, "grad_norm": 0.35361558198928833, "learning_rate": 0.0001992449911526496, "loss": 0.2228592187166214, "mean_token_accuracy": 0.908146470785141, "num_tokens": 11497152.0, "step": 932 }, { "entropy": 1.373944640159607, "epoch": 0.4913112164296998, "grad_norm": 0.3263792097568512, "learning_rate": 0.0001992421540997702, "loss": 0.19889512658119202, "mean_token_accuracy": 0.9241671562194824, "num_tokens": 11509488.0, "step": 933 }, { "entropy": 1.3812199532985687, "epoch": 0.4918378093733544, "grad_norm": 0.30469757318496704, "learning_rate": 0.00019923931174910421, "loss": 0.20764592289924622, "mean_token_accuracy": 0.9166074395179749, "num_tokens": 11521824.0, "step": 934 }, { "entropy": 1.3702083230018616, "epoch": 0.49236440231700895, "grad_norm": 0.3094841539859772, "learning_rate": 0.00019923646410082045, "loss": 0.22583043575286865, "mean_token_accuracy": 0.9111629873514175, "num_tokens": 11534160.0, "step": 935 }, { "entropy": 1.4550175070762634, "epoch": 0.4928909952606635, "grad_norm": 0.3479791581630707, "learning_rate": 0.0001992336111550879, "loss": 0.22404024004936218, "mean_token_accuracy": 0.9125335812568665, "num_tokens": 11546496.0, "step": 936 }, { "entropy": 1.369890809059143, "epoch": 0.4934175882043181, "grad_norm": 0.33549702167510986, "learning_rate": 0.00019923075291207595, "loss": 0.22361691296100616, "mean_token_accuracy": 0.9108781665563583, "num_tokens": 11558832.0, "step": 937 }, { "entropy": 1.4506123065948486, "epoch": 0.4939441811479726, "grad_norm": 0.31795117259025574, "learning_rate": 0.00019922788937195432, "loss": 0.20908354222774506, "mean_token_accuracy": 0.916689082980156, "num_tokens": 11571168.0, "step": 938 }, { "entropy": 1.4594894349575043, "epoch": 0.49447077409162715, "grad_norm": 0.3958785831928253, "learning_rate": 0.0001992250205348929, "loss": 0.22291752696037292, "mean_token_accuracy": 0.9057322442531586, "num_tokens": 11583504.0, "step": 939 }, { "entropy": 1.4367193281650543, "epoch": 0.49499736703528174, "grad_norm": 0.38530445098876953, "learning_rate": 0.00019922214640106207, "loss": 0.21757692098617554, "mean_token_accuracy": 0.9140817075967789, "num_tokens": 11595840.0, "step": 940 }, { "entropy": 1.4827219545841217, "epoch": 0.4955239599789363, "grad_norm": 0.36136746406555176, "learning_rate": 0.00019921926697063244, "loss": 0.245650514960289, "mean_token_accuracy": 0.9077811390161514, "num_tokens": 11608176.0, "step": 941 }, { "entropy": 1.4725195467472076, "epoch": 0.4960505529225908, "grad_norm": 0.3393801748752594, "learning_rate": 0.00019921638224377493, "loss": 0.22296787798404694, "mean_token_accuracy": 0.912161722779274, "num_tokens": 11620512.0, "step": 942 }, { "entropy": 1.5998758971691132, "epoch": 0.4965771458662454, "grad_norm": 0.31578320264816284, "learning_rate": 0.00019921349222066083, "loss": 0.21946173906326294, "mean_token_accuracy": 0.9090907126665115, "num_tokens": 11632848.0, "step": 943 }, { "entropy": 1.5493124723434448, "epoch": 0.49710373880989994, "grad_norm": 0.3594050705432892, "learning_rate": 0.00019921059690146165, "loss": 0.25090494751930237, "mean_token_accuracy": 0.899459958076477, "num_tokens": 11645184.0, "step": 944 }, { "entropy": 1.4591304063796997, "epoch": 0.4976303317535545, "grad_norm": 0.3398474454879761, "learning_rate": 0.0001992076962863493, "loss": 0.22868260741233826, "mean_token_accuracy": 0.9120910316705704, "num_tokens": 11657520.0, "step": 945 }, { "entropy": 1.5574268996715546, "epoch": 0.49815692469720907, "grad_norm": 0.37178367376327515, "learning_rate": 0.00019920479037549595, "loss": 0.24399921298027039, "mean_token_accuracy": 0.9063628762960434, "num_tokens": 11669856.0, "step": 946 }, { "entropy": 1.4919456243515015, "epoch": 0.4986835176408636, "grad_norm": 0.344330757856369, "learning_rate": 0.0001992018791690741, "loss": 0.2234281301498413, "mean_token_accuracy": 0.9139427691698074, "num_tokens": 11682192.0, "step": 947 }, { "entropy": 1.486481934785843, "epoch": 0.49921011058451814, "grad_norm": 0.3283190429210663, "learning_rate": 0.00019919896266725663, "loss": 0.21686026453971863, "mean_token_accuracy": 0.9156758487224579, "num_tokens": 11694528.0, "step": 948 }, { "entropy": 1.4495719075202942, "epoch": 0.49973670352817273, "grad_norm": 0.3260519802570343, "learning_rate": 0.00019919604087021664, "loss": 0.21722926199436188, "mean_token_accuracy": 0.9189446866512299, "num_tokens": 11706864.0, "step": 949 }, { "entropy": 1.5058691203594208, "epoch": 0.5002632964718273, "grad_norm": 0.34286144375801086, "learning_rate": 0.00019919311377812756, "loss": 0.2165110558271408, "mean_token_accuracy": 0.9119018763303757, "num_tokens": 11719200.0, "step": 950 }, { "entropy": 1.4864198863506317, "epoch": 0.5007898894154819, "grad_norm": 0.3339075446128845, "learning_rate": 0.00019919018139116318, "loss": 0.22437581419944763, "mean_token_accuracy": 0.9123266935348511, "num_tokens": 11731536.0, "step": 951 }, { "entropy": 1.5294865667819977, "epoch": 0.5013164823591364, "grad_norm": 0.3746489882469177, "learning_rate": 0.00019918724370949754, "loss": 0.2426229566335678, "mean_token_accuracy": 0.9112533032894135, "num_tokens": 11743872.0, "step": 952 }, { "entropy": 1.4867128133773804, "epoch": 0.5018430753027909, "grad_norm": 0.3308849036693573, "learning_rate": 0.00019918430073330513, "loss": 0.2087199091911316, "mean_token_accuracy": 0.919797733426094, "num_tokens": 11756208.0, "step": 953 }, { "entropy": 1.5136871337890625, "epoch": 0.5023696682464455, "grad_norm": 0.34608909487724304, "learning_rate": 0.00019918135246276052, "loss": 0.22718098759651184, "mean_token_accuracy": 0.9114474952220917, "num_tokens": 11768544.0, "step": 954 }, { "entropy": 1.5160588324069977, "epoch": 0.5028962611901, "grad_norm": 0.3665941655635834, "learning_rate": 0.00019917839889803884, "loss": 0.21780604124069214, "mean_token_accuracy": 0.9177397042512894, "num_tokens": 11780880.0, "step": 955 }, { "entropy": 1.4711733162403107, "epoch": 0.5034228541337546, "grad_norm": 0.3232526183128357, "learning_rate": 0.00019917544003931537, "loss": 0.20783714950084686, "mean_token_accuracy": 0.9170488715171814, "num_tokens": 11793216.0, "step": 956 }, { "entropy": 1.5061227977275848, "epoch": 0.5039494470774092, "grad_norm": 0.3460804522037506, "learning_rate": 0.00019917247588676582, "loss": 0.22913217544555664, "mean_token_accuracy": 0.9122664779424667, "num_tokens": 11805552.0, "step": 957 }, { "entropy": 1.4881491363048553, "epoch": 0.5044760400210637, "grad_norm": 0.38591158390045166, "learning_rate": 0.00019916950644056607, "loss": 0.2197885662317276, "mean_token_accuracy": 0.9077084809541702, "num_tokens": 11817888.0, "step": 958 }, { "entropy": 1.4673264026641846, "epoch": 0.5050026329647183, "grad_norm": 0.33065465092658997, "learning_rate": 0.00019916653170089246, "loss": 0.2319866120815277, "mean_token_accuracy": 0.9126220494508743, "num_tokens": 11830224.0, "step": 959 }, { "entropy": 1.4641340970993042, "epoch": 0.5055292259083728, "grad_norm": 0.36219480633735657, "learning_rate": 0.00019916355166792155, "loss": 0.23807652294635773, "mean_token_accuracy": 0.9052844792604446, "num_tokens": 11842560.0, "step": 960 }, { "entropy": 1.4770829379558563, "epoch": 0.5060558188520273, "grad_norm": 0.3402878940105438, "learning_rate": 0.00019916056634183027, "loss": 0.23622629046440125, "mean_token_accuracy": 0.9105163961648941, "num_tokens": 11854896.0, "step": 961 }, { "entropy": 1.510101705789566, "epoch": 0.506582411795682, "grad_norm": 0.38479122519493103, "learning_rate": 0.00019915757572279584, "loss": 0.26114726066589355, "mean_token_accuracy": 0.901023805141449, "num_tokens": 11867232.0, "step": 962 }, { "entropy": 1.462478369474411, "epoch": 0.5071090047393365, "grad_norm": 0.30232900381088257, "learning_rate": 0.0001991545798109958, "loss": 0.21362073719501495, "mean_token_accuracy": 0.9150588363409042, "num_tokens": 11879568.0, "step": 963 }, { "entropy": 1.4567637145519257, "epoch": 0.507635597682991, "grad_norm": 0.3392339050769806, "learning_rate": 0.00019915157860660797, "loss": 0.229543536901474, "mean_token_accuracy": 0.9123556017875671, "num_tokens": 11891904.0, "step": 964 }, { "entropy": 1.4373153448104858, "epoch": 0.5081621906266456, "grad_norm": 0.3237869441509247, "learning_rate": 0.00019914857210981052, "loss": 0.222116619348526, "mean_token_accuracy": 0.9098070710897446, "num_tokens": 11904240.0, "step": 965 }, { "entropy": 1.4922161400318146, "epoch": 0.5086887835703001, "grad_norm": 0.3090606927871704, "learning_rate": 0.00019914556032078198, "loss": 0.22452594339847565, "mean_token_accuracy": 0.9133640974760056, "num_tokens": 11916576.0, "step": 966 }, { "entropy": 1.4847496449947357, "epoch": 0.5092153765139548, "grad_norm": 0.31530138850212097, "learning_rate": 0.00019914254323970108, "loss": 0.21454353630542755, "mean_token_accuracy": 0.9175532162189484, "num_tokens": 11928912.0, "step": 967 }, { "entropy": 1.481870412826538, "epoch": 0.5097419694576093, "grad_norm": 0.3098122775554657, "learning_rate": 0.00019913952086674696, "loss": 0.21168866753578186, "mean_token_accuracy": 0.9122080057859421, "num_tokens": 11941248.0, "step": 968 }, { "entropy": 1.5705283880233765, "epoch": 0.5102685624012638, "grad_norm": 0.32009753584861755, "learning_rate": 0.000199136493202099, "loss": 0.20256565511226654, "mean_token_accuracy": 0.9237568825483322, "num_tokens": 11953584.0, "step": 969 }, { "entropy": 1.5321417450904846, "epoch": 0.5107951553449184, "grad_norm": 0.33614546060562134, "learning_rate": 0.000199133460245937, "loss": 0.2249448001384735, "mean_token_accuracy": 0.9105825424194336, "num_tokens": 11965920.0, "step": 970 }, { "entropy": 1.5060743689537048, "epoch": 0.5113217482885729, "grad_norm": 0.3201083540916443, "learning_rate": 0.00019913042199844097, "loss": 0.22582277655601501, "mean_token_accuracy": 0.9086000770330429, "num_tokens": 11978256.0, "step": 971 }, { "entropy": 1.5098620057106018, "epoch": 0.5118483412322274, "grad_norm": 0.739696204662323, "learning_rate": 0.00019912737845979126, "loss": 0.20600268244743347, "mean_token_accuracy": 0.9227887839078903, "num_tokens": 11990592.0, "step": 972 }, { "entropy": 1.5500882267951965, "epoch": 0.5123749341758821, "grad_norm": 0.3458639681339264, "learning_rate": 0.00019912432963016855, "loss": 0.23240959644317627, "mean_token_accuracy": 0.9070769846439362, "num_tokens": 12002928.0, "step": 973 }, { "entropy": 1.5514563918113708, "epoch": 0.5129015271195366, "grad_norm": 0.33823850750923157, "learning_rate": 0.0001991212755097539, "loss": 0.21927812695503235, "mean_token_accuracy": 0.9085335284471512, "num_tokens": 12015264.0, "step": 974 }, { "entropy": 1.4905177056789398, "epoch": 0.5134281200631912, "grad_norm": 0.3308093547821045, "learning_rate": 0.0001991182160987285, "loss": 0.22249096632003784, "mean_token_accuracy": 0.9114507138729095, "num_tokens": 12027600.0, "step": 975 }, { "entropy": 1.5092821419239044, "epoch": 0.5139547130068457, "grad_norm": 0.35571059584617615, "learning_rate": 0.0001991151513972741, "loss": 0.23242917656898499, "mean_token_accuracy": 0.9118809998035431, "num_tokens": 12039936.0, "step": 976 }, { "entropy": 1.426015704870224, "epoch": 0.5144813059505002, "grad_norm": 0.2942444086074829, "learning_rate": 0.0001991120814055725, "loss": 0.2060171216726303, "mean_token_accuracy": 0.9149444848299026, "num_tokens": 12052272.0, "step": 977 }, { "entropy": 1.4646040201187134, "epoch": 0.5150078988941548, "grad_norm": 0.36998897790908813, "learning_rate": 0.00019910900612380605, "loss": 0.23340070247650146, "mean_token_accuracy": 0.9063846617937088, "num_tokens": 12064608.0, "step": 978 }, { "entropy": 1.4659819900989532, "epoch": 0.5155344918378094, "grad_norm": 0.3255058526992798, "learning_rate": 0.00019910592555215725, "loss": 0.20911140739917755, "mean_token_accuracy": 0.9192948192358017, "num_tokens": 12076944.0, "step": 979 }, { "entropy": 1.5005815625190735, "epoch": 0.516061084781464, "grad_norm": 0.35735374689102173, "learning_rate": 0.000199102839690809, "loss": 0.2287176251411438, "mean_token_accuracy": 0.9081791937351227, "num_tokens": 12089280.0, "step": 980 }, { "entropy": 1.4197439849376678, "epoch": 0.5165876777251185, "grad_norm": 0.30643951892852783, "learning_rate": 0.00019909974853994452, "loss": 0.19968025386333466, "mean_token_accuracy": 0.9234030842781067, "num_tokens": 12101616.0, "step": 981 }, { "entropy": 1.4192424714565277, "epoch": 0.517114270668773, "grad_norm": 0.337433785200119, "learning_rate": 0.00019909665209974723, "loss": 0.23955072462558746, "mean_token_accuracy": 0.9109057635068893, "num_tokens": 12113952.0, "step": 982 }, { "entropy": 1.4805451035499573, "epoch": 0.5176408636124276, "grad_norm": 0.34595102071762085, "learning_rate": 0.00019909355037040104, "loss": 0.23975268006324768, "mean_token_accuracy": 0.9099203199148178, "num_tokens": 12126288.0, "step": 983 }, { "entropy": 1.4859175980091095, "epoch": 0.5181674565560821, "grad_norm": 0.33112627267837524, "learning_rate": 0.00019909044335209003, "loss": 0.23115341365337372, "mean_token_accuracy": 0.9144714772701263, "num_tokens": 12138624.0, "step": 984 }, { "entropy": 1.4870480000972748, "epoch": 0.5186940494997367, "grad_norm": 0.2882140576839447, "learning_rate": 0.00019908733104499868, "loss": 0.2003549188375473, "mean_token_accuracy": 0.9193922579288483, "num_tokens": 12150960.0, "step": 985 }, { "entropy": 1.5195731818675995, "epoch": 0.5192206424433913, "grad_norm": 0.33627068996429443, "learning_rate": 0.00019908421344931173, "loss": 0.2529386878013611, "mean_token_accuracy": 0.8942808210849762, "num_tokens": 12163296.0, "step": 986 }, { "entropy": 1.480097621679306, "epoch": 0.5197472353870458, "grad_norm": 1.469023585319519, "learning_rate": 0.0001990810905652142, "loss": 0.24130460619926453, "mean_token_accuracy": 0.9022433310747147, "num_tokens": 12175632.0, "step": 987 }, { "entropy": 1.498535007238388, "epoch": 0.5202738283307003, "grad_norm": 0.29503491520881653, "learning_rate": 0.00019907796239289154, "loss": 0.21136939525604248, "mean_token_accuracy": 0.9171615391969681, "num_tokens": 12187968.0, "step": 988 }, { "entropy": 1.5154505968093872, "epoch": 0.5208004212743549, "grad_norm": 0.29515334963798523, "learning_rate": 0.00019907482893252945, "loss": 0.22373729944229126, "mean_token_accuracy": 0.9104124307632446, "num_tokens": 12200304.0, "step": 989 }, { "entropy": 1.5455197095870972, "epoch": 0.5213270142180095, "grad_norm": 0.36879390478134155, "learning_rate": 0.00019907169018431394, "loss": 0.23778440058231354, "mean_token_accuracy": 0.9108938276767731, "num_tokens": 12212640.0, "step": 990 }, { "entropy": 1.5229522287845612, "epoch": 0.5218536071616641, "grad_norm": 0.33947938680648804, "learning_rate": 0.0001990685461484313, "loss": 0.22162161767482758, "mean_token_accuracy": 0.9117240607738495, "num_tokens": 12224976.0, "step": 991 }, { "entropy": 1.5108350217342377, "epoch": 0.5223802001053186, "grad_norm": 0.3344981074333191, "learning_rate": 0.00019906539682506823, "loss": 0.20931261777877808, "mean_token_accuracy": 0.9169653207063675, "num_tokens": 12237312.0, "step": 992 }, { "entropy": 1.508901059627533, "epoch": 0.5229067930489731, "grad_norm": 0.3136521279811859, "learning_rate": 0.00019906224221441168, "loss": 0.22339576482772827, "mean_token_accuracy": 0.9082980453968048, "num_tokens": 12249648.0, "step": 993 }, { "entropy": 1.5110598504543304, "epoch": 0.5234333859926277, "grad_norm": 0.3550313413143158, "learning_rate": 0.0001990590823166489, "loss": 0.2181922197341919, "mean_token_accuracy": 0.913140058517456, "num_tokens": 12261984.0, "step": 994 }, { "entropy": 1.4990539252758026, "epoch": 0.5239599789362822, "grad_norm": 0.3551686108112335, "learning_rate": 0.00019905591713196747, "loss": 0.21492283046245575, "mean_token_accuracy": 0.917353168129921, "num_tokens": 12274320.0, "step": 995 }, { "entropy": 1.6208187341690063, "epoch": 0.5244865718799369, "grad_norm": 0.3526499271392822, "learning_rate": 0.0001990527466605553, "loss": 0.2129640281200409, "mean_token_accuracy": 0.913350835442543, "num_tokens": 12286656.0, "step": 996 }, { "entropy": 1.5281141996383667, "epoch": 0.5250131648235914, "grad_norm": 0.33227595686912537, "learning_rate": 0.00019904957090260056, "loss": 0.21114130318164825, "mean_token_accuracy": 0.9172855019569397, "num_tokens": 12298992.0, "step": 997 }, { "entropy": 1.4690798819065094, "epoch": 0.5255397577672459, "grad_norm": 0.30048811435699463, "learning_rate": 0.00019904638985829187, "loss": 0.20892660319805145, "mean_token_accuracy": 0.9182561188936234, "num_tokens": 12311328.0, "step": 998 }, { "entropy": 1.6034342348575592, "epoch": 0.5260663507109005, "grad_norm": 0.3628803491592407, "learning_rate": 0.000199043203527818, "loss": 0.21608318388462067, "mean_token_accuracy": 0.913134828209877, "num_tokens": 12323664.0, "step": 999 }, { "entropy": 1.4999005496501923, "epoch": 0.526592943654555, "grad_norm": 0.3294629454612732, "learning_rate": 0.0001990400119113681, "loss": 0.21117916703224182, "mean_token_accuracy": 0.917900949716568, "num_tokens": 12336000.0, "step": 1000 }, { "entropy": 1.596118301153183, "epoch": 0.5271195365982095, "grad_norm": 0.3512589931488037, "learning_rate": 0.00019903681500913167, "loss": 0.20125192403793335, "mean_token_accuracy": 0.921380877494812, "num_tokens": 12348336.0, "step": 1001 }, { "entropy": 1.4794040620326996, "epoch": 0.5276461295418642, "grad_norm": 0.3046097457408905, "learning_rate": 0.0001990336128212985, "loss": 0.2075495421886444, "mean_token_accuracy": 0.9140082001686096, "num_tokens": 12360672.0, "step": 1002 }, { "entropy": 1.5259474217891693, "epoch": 0.5281727224855187, "grad_norm": 0.3376280963420868, "learning_rate": 0.00019903040534805866, "loss": 0.22057998180389404, "mean_token_accuracy": 0.9114288538694382, "num_tokens": 12373008.0, "step": 1003 }, { "entropy": 1.5479835271835327, "epoch": 0.5286993154291733, "grad_norm": 0.3668357729911804, "learning_rate": 0.00019902719258960253, "loss": 0.24602656066417694, "mean_token_accuracy": 0.9003023505210876, "num_tokens": 12385344.0, "step": 1004 }, { "entropy": 1.5563693940639496, "epoch": 0.5292259083728278, "grad_norm": 0.33542895317077637, "learning_rate": 0.0001990239745461209, "loss": 0.22432827949523926, "mean_token_accuracy": 0.9152787178754807, "num_tokens": 12397680.0, "step": 1005 }, { "entropy": 1.5360921025276184, "epoch": 0.5297525013164823, "grad_norm": 0.34227633476257324, "learning_rate": 0.00019902075121780473, "loss": 0.24711929261684418, "mean_token_accuracy": 0.9043864160776138, "num_tokens": 12410016.0, "step": 1006 }, { "entropy": 1.5392629504203796, "epoch": 0.5302790942601369, "grad_norm": 0.31668519973754883, "learning_rate": 0.00019901752260484545, "loss": 0.24319474399089813, "mean_token_accuracy": 0.9046953171491623, "num_tokens": 12422352.0, "step": 1007 }, { "entropy": 1.608776479959488, "epoch": 0.5308056872037915, "grad_norm": 0.3281152844429016, "learning_rate": 0.00019901428870743466, "loss": 0.2047930210828781, "mean_token_accuracy": 0.9202082604169846, "num_tokens": 12434688.0, "step": 1008 }, { "entropy": 1.6915300488471985, "epoch": 0.531332280147446, "grad_norm": 0.38227638602256775, "learning_rate": 0.0001990110495257644, "loss": 0.23451298475265503, "mean_token_accuracy": 0.9067147076129913, "num_tokens": 12447024.0, "step": 1009 }, { "entropy": 1.5676094889640808, "epoch": 0.5318588730911006, "grad_norm": 0.3091145157814026, "learning_rate": 0.0001990078050600269, "loss": 0.21618413925170898, "mean_token_accuracy": 0.9121405184268951, "num_tokens": 12459360.0, "step": 1010 }, { "entropy": 1.6247548460960388, "epoch": 0.5323854660347551, "grad_norm": 0.3261072337627411, "learning_rate": 0.0001990045553104148, "loss": 0.2148750126361847, "mean_token_accuracy": 0.9210677593946457, "num_tokens": 12471696.0, "step": 1011 }, { "entropy": 1.5738478302955627, "epoch": 0.5329120589784097, "grad_norm": 0.32214832305908203, "learning_rate": 0.00019900130027712099, "loss": 0.23918862640857697, "mean_token_accuracy": 0.9062842279672623, "num_tokens": 12484032.0, "step": 1012 }, { "entropy": 1.474539339542389, "epoch": 0.5334386519220643, "grad_norm": 0.346766859292984, "learning_rate": 0.00019899803996033876, "loss": 0.21119186282157898, "mean_token_accuracy": 0.918285146355629, "num_tokens": 12496368.0, "step": 1013 }, { "entropy": 1.5115889310836792, "epoch": 0.5339652448657188, "grad_norm": 0.3021303117275238, "learning_rate": 0.00019899477436026157, "loss": 0.19445011019706726, "mean_token_accuracy": 0.9237413257360458, "num_tokens": 12508704.0, "step": 1014 }, { "entropy": 1.492755115032196, "epoch": 0.5344918378093734, "grad_norm": 0.3711804449558258, "learning_rate": 0.00019899150347708335, "loss": 0.21977633237838745, "mean_token_accuracy": 0.9105686545372009, "num_tokens": 12521040.0, "step": 1015 }, { "entropy": 1.4154399931430817, "epoch": 0.5350184307530279, "grad_norm": 0.34001612663269043, "learning_rate": 0.00019898822731099827, "loss": 0.1881294697523117, "mean_token_accuracy": 0.924776166677475, "num_tokens": 12533376.0, "step": 1016 }, { "entropy": 1.41116601228714, "epoch": 0.5355450236966824, "grad_norm": 0.33592158555984497, "learning_rate": 0.00019898494586220077, "loss": 0.22032563388347626, "mean_token_accuracy": 0.9117150008678436, "num_tokens": 12545712.0, "step": 1017 }, { "entropy": 1.416001707315445, "epoch": 0.536071616640337, "grad_norm": 0.3635656535625458, "learning_rate": 0.00019898165913088568, "loss": 0.2379489541053772, "mean_token_accuracy": 0.9045498371124268, "num_tokens": 12558048.0, "step": 1018 }, { "entropy": 1.346794456243515, "epoch": 0.5365982095839916, "grad_norm": 0.41112419962882996, "learning_rate": 0.0001989783671172481, "loss": 0.24667346477508545, "mean_token_accuracy": 0.9044399708509445, "num_tokens": 12570384.0, "step": 1019 }, { "entropy": 1.417405605316162, "epoch": 0.5371248025276462, "grad_norm": 0.3971119821071625, "learning_rate": 0.00019897506982148353, "loss": 0.19713318347930908, "mean_token_accuracy": 0.9267271012067795, "num_tokens": 12582720.0, "step": 1020 }, { "entropy": 1.4534864723682404, "epoch": 0.5376513954713007, "grad_norm": 0.3351125717163086, "learning_rate": 0.00019897176724378762, "loss": 0.22281871736049652, "mean_token_accuracy": 0.9098447114229202, "num_tokens": 12595056.0, "step": 1021 }, { "entropy": 1.3609624803066254, "epoch": 0.5381779884149552, "grad_norm": 0.3119547665119171, "learning_rate": 0.00019896845938435642, "loss": 0.2145942896604538, "mean_token_accuracy": 0.9176490157842636, "num_tokens": 12607392.0, "step": 1022 }, { "entropy": 1.373078614473343, "epoch": 0.5387045813586098, "grad_norm": 0.3335905075073242, "learning_rate": 0.00019896514624338633, "loss": 0.20780502259731293, "mean_token_accuracy": 0.9145664125680923, "num_tokens": 12619728.0, "step": 1023 }, { "entropy": 1.45356023311615, "epoch": 0.5392311743022643, "grad_norm": 0.321328729391098, "learning_rate": 0.00019896182782107408, "loss": 0.21474064886569977, "mean_token_accuracy": 0.914635494351387, "num_tokens": 12632064.0, "step": 1024 }, { "entropy": 1.3756296038627625, "epoch": 0.539757767245919, "grad_norm": 0.3236009180545807, "learning_rate": 0.0001989585041176166, "loss": 0.19574275612831116, "mean_token_accuracy": 0.9214889109134674, "num_tokens": 12644400.0, "step": 1025 }, { "entropy": 1.374951332807541, "epoch": 0.5402843601895735, "grad_norm": 0.33436882495880127, "learning_rate": 0.00019895517513321125, "loss": 0.2343987077474594, "mean_token_accuracy": 0.9015287011861801, "num_tokens": 12656736.0, "step": 1026 }, { "entropy": 1.3473423719406128, "epoch": 0.540810953133228, "grad_norm": 0.30872446298599243, "learning_rate": 0.0001989518408680556, "loss": 0.23760074377059937, "mean_token_accuracy": 0.9077365547418594, "num_tokens": 12669072.0, "step": 1027 }, { "entropy": 1.4245812594890594, "epoch": 0.5413375460768826, "grad_norm": 0.32098084688186646, "learning_rate": 0.0001989485013223476, "loss": 0.22173723578453064, "mean_token_accuracy": 0.9116310328245163, "num_tokens": 12681408.0, "step": 1028 }, { "entropy": 1.357390284538269, "epoch": 0.5418641390205371, "grad_norm": 0.3540545701980591, "learning_rate": 0.0001989451564962855, "loss": 0.22398629784584045, "mean_token_accuracy": 0.914269283413887, "num_tokens": 12693744.0, "step": 1029 }, { "entropy": 1.4113155901432037, "epoch": 0.5423907319641916, "grad_norm": 0.3349270224571228, "learning_rate": 0.00019894180639006787, "loss": 0.23276042938232422, "mean_token_accuracy": 0.905420333147049, "num_tokens": 12706080.0, "step": 1030 }, { "entropy": 1.3748076260089874, "epoch": 0.5429173249078463, "grad_norm": 0.31247857213020325, "learning_rate": 0.0001989384510038936, "loss": 0.2479267716407776, "mean_token_accuracy": 0.8999170660972595, "num_tokens": 12718416.0, "step": 1031 }, { "entropy": 1.4230112135410309, "epoch": 0.5434439178515008, "grad_norm": 0.31677430868148804, "learning_rate": 0.0001989350903379619, "loss": 0.2388826310634613, "mean_token_accuracy": 0.9079335629940033, "num_tokens": 12730752.0, "step": 1032 }, { "entropy": 1.341791033744812, "epoch": 0.5439705107951553, "grad_norm": 0.30199915170669556, "learning_rate": 0.0001989317243924722, "loss": 0.21240849792957306, "mean_token_accuracy": 0.9131926447153091, "num_tokens": 12743088.0, "step": 1033 }, { "entropy": 1.3770472407341003, "epoch": 0.5444971037388099, "grad_norm": 0.28729885816574097, "learning_rate": 0.00019892835316762437, "loss": 0.20151323080062866, "mean_token_accuracy": 0.9193004071712494, "num_tokens": 12755424.0, "step": 1034 }, { "entropy": 1.3323063850402832, "epoch": 0.5450236966824644, "grad_norm": 0.3478204607963562, "learning_rate": 0.00019892497666361848, "loss": 0.22956590354442596, "mean_token_accuracy": 0.910034716129303, "num_tokens": 12767760.0, "step": 1035 }, { "entropy": 1.2777645885944366, "epoch": 0.545550289626119, "grad_norm": 0.32218146324157715, "learning_rate": 0.00019892159488065506, "loss": 0.2523505985736847, "mean_token_accuracy": 0.8999349474906921, "num_tokens": 12780096.0, "step": 1036 }, { "entropy": 1.3476167619228363, "epoch": 0.5460768825697736, "grad_norm": 0.3297399580478668, "learning_rate": 0.00019891820781893485, "loss": 0.24944739043712616, "mean_token_accuracy": 0.8990609049797058, "num_tokens": 12792432.0, "step": 1037 }, { "entropy": 1.3680584728717804, "epoch": 0.5466034755134281, "grad_norm": 0.31413063406944275, "learning_rate": 0.00019891481547865887, "loss": 0.23303711414337158, "mean_token_accuracy": 0.9072806537151337, "num_tokens": 12804768.0, "step": 1038 }, { "entropy": 1.2887639105319977, "epoch": 0.5471300684570827, "grad_norm": 0.30452004075050354, "learning_rate": 0.00019891141786002853, "loss": 0.20885013043880463, "mean_token_accuracy": 0.91634900867939, "num_tokens": 12817104.0, "step": 1039 }, { "entropy": 1.427742451429367, "epoch": 0.5476566614007372, "grad_norm": 0.3391040563583374, "learning_rate": 0.00019890801496324554, "loss": 0.21363744139671326, "mean_token_accuracy": 0.9168877154588699, "num_tokens": 12829440.0, "step": 1040 }, { "entropy": 1.4079940021038055, "epoch": 0.5481832543443917, "grad_norm": 0.34792712330818176, "learning_rate": 0.00019890460678851187, "loss": 0.23039647936820984, "mean_token_accuracy": 0.9067210853099823, "num_tokens": 12841776.0, "step": 1041 }, { "entropy": 1.362496793270111, "epoch": 0.5487098472880464, "grad_norm": 0.3340260684490204, "learning_rate": 0.00019890119333602988, "loss": 0.21935522556304932, "mean_token_accuracy": 0.9152266681194305, "num_tokens": 12854112.0, "step": 1042 }, { "entropy": 1.3945021033287048, "epoch": 0.5492364402317009, "grad_norm": 0.31123343110084534, "learning_rate": 0.00019889777460600221, "loss": 0.2165759801864624, "mean_token_accuracy": 0.9149927645921707, "num_tokens": 12866448.0, "step": 1043 }, { "entropy": 1.3361455798149109, "epoch": 0.5497630331753555, "grad_norm": 0.30849552154541016, "learning_rate": 0.0001988943505986318, "loss": 0.23334844410419464, "mean_token_accuracy": 0.9073198139667511, "num_tokens": 12878784.0, "step": 1044 }, { "entropy": 1.353363960981369, "epoch": 0.55028962611901, "grad_norm": 0.30394431948661804, "learning_rate": 0.00019889092131412188, "loss": 0.21873678267002106, "mean_token_accuracy": 0.9092230349779129, "num_tokens": 12891120.0, "step": 1045 }, { "entropy": 1.3730317652225494, "epoch": 0.5508162190626645, "grad_norm": 0.3051231801509857, "learning_rate": 0.0001988874867526761, "loss": 0.2074829638004303, "mean_token_accuracy": 0.9159383773803711, "num_tokens": 12903456.0, "step": 1046 }, { "entropy": 1.348529189825058, "epoch": 0.5513428120063191, "grad_norm": 0.34162041544914246, "learning_rate": 0.00019888404691449828, "loss": 0.20376741886138916, "mean_token_accuracy": 0.9213349372148514, "num_tokens": 12915792.0, "step": 1047 }, { "entropy": 1.3659497201442719, "epoch": 0.5518694049499737, "grad_norm": 0.3287021219730377, "learning_rate": 0.00019888060179979266, "loss": 0.22284625470638275, "mean_token_accuracy": 0.9160720854997635, "num_tokens": 12928128.0, "step": 1048 }, { "entropy": 1.39521923661232, "epoch": 0.5523959978936283, "grad_norm": 0.33031636476516724, "learning_rate": 0.00019887715140876373, "loss": 0.2400185465812683, "mean_token_accuracy": 0.9030187875032425, "num_tokens": 12940464.0, "step": 1049 }, { "entropy": 1.4470847249031067, "epoch": 0.5529225908372828, "grad_norm": 0.37168604135513306, "learning_rate": 0.00019887369574161633, "loss": 0.22982707619667053, "mean_token_accuracy": 0.9084116071462631, "num_tokens": 12952800.0, "step": 1050 }, { "entropy": 1.3384085595607758, "epoch": 0.5534491837809373, "grad_norm": 0.32396450638771057, "learning_rate": 0.00019887023479855565, "loss": 0.24000367522239685, "mean_token_accuracy": 0.9041632562875748, "num_tokens": 12965136.0, "step": 1051 }, { "entropy": 1.3531986474990845, "epoch": 0.5539757767245919, "grad_norm": 0.319603830575943, "learning_rate": 0.00019886676857978707, "loss": 0.23166413605213165, "mean_token_accuracy": 0.9047738164663315, "num_tokens": 12977472.0, "step": 1052 }, { "entropy": 1.3648565709590912, "epoch": 0.5545023696682464, "grad_norm": 0.3087165057659149, "learning_rate": 0.00019886329708551642, "loss": 0.21422043442726135, "mean_token_accuracy": 0.9170399606227875, "num_tokens": 12989808.0, "step": 1053 }, { "entropy": 1.4327314496040344, "epoch": 0.555028962611901, "grad_norm": 0.31154927611351013, "learning_rate": 0.00019885982031594973, "loss": 0.23706527054309845, "mean_token_accuracy": 0.9066223204135895, "num_tokens": 13002144.0, "step": 1054 }, { "entropy": 1.401264727115631, "epoch": 0.5555555555555556, "grad_norm": 0.30120137333869934, "learning_rate": 0.00019885633827129343, "loss": 0.21149972081184387, "mean_token_accuracy": 0.9169722944498062, "num_tokens": 13014480.0, "step": 1055 }, { "entropy": 1.4713716506958008, "epoch": 0.5560821484992101, "grad_norm": 0.39476147294044495, "learning_rate": 0.00019885285095175422, "loss": 0.26564526557922363, "mean_token_accuracy": 0.8999374806880951, "num_tokens": 13026816.0, "step": 1056 }, { "entropy": 1.4001291990280151, "epoch": 0.5566087414428647, "grad_norm": 0.3243412971496582, "learning_rate": 0.00019884935835753914, "loss": 0.2307104468345642, "mean_token_accuracy": 0.9069186598062515, "num_tokens": 13039152.0, "step": 1057 }, { "entropy": 1.4063750207424164, "epoch": 0.5571353343865192, "grad_norm": 0.3205982446670532, "learning_rate": 0.0001988458604888555, "loss": 0.2200152724981308, "mean_token_accuracy": 0.9117906540632248, "num_tokens": 13051488.0, "step": 1058 }, { "entropy": 1.4639129042625427, "epoch": 0.5576619273301737, "grad_norm": 0.35051432251930237, "learning_rate": 0.00019884235734591096, "loss": 0.21262915432453156, "mean_token_accuracy": 0.9155555963516235, "num_tokens": 13063824.0, "step": 1059 }, { "entropy": 1.3807141780853271, "epoch": 0.5581885202738284, "grad_norm": 0.31436532735824585, "learning_rate": 0.00019883884892891348, "loss": 0.23192916810512543, "mean_token_accuracy": 0.9132644683122635, "num_tokens": 13076160.0, "step": 1060 }, { "entropy": 1.4159002602100372, "epoch": 0.5587151132174829, "grad_norm": 0.35557860136032104, "learning_rate": 0.00019883533523807131, "loss": 0.2557951807975769, "mean_token_accuracy": 0.9019583463668823, "num_tokens": 13088496.0, "step": 1061 }, { "entropy": 1.4077826738357544, "epoch": 0.5592417061611374, "grad_norm": 0.35081014037132263, "learning_rate": 0.00019883181627359305, "loss": 0.21151600778102875, "mean_token_accuracy": 0.914755642414093, "num_tokens": 13100832.0, "step": 1062 }, { "entropy": 1.3742648661136627, "epoch": 0.559768299104792, "grad_norm": 0.28598442673683167, "learning_rate": 0.00019882829203568764, "loss": 0.21076026558876038, "mean_token_accuracy": 0.9148049652576447, "num_tokens": 13113168.0, "step": 1063 }, { "entropy": 1.4464651346206665, "epoch": 0.5602948920484465, "grad_norm": 0.29035648703575134, "learning_rate": 0.00019882476252456428, "loss": 0.20042768120765686, "mean_token_accuracy": 0.9182227253913879, "num_tokens": 13125504.0, "step": 1064 }, { "entropy": 1.3639024496078491, "epoch": 0.5608214849921012, "grad_norm": 0.3004502058029175, "learning_rate": 0.00019882122774043243, "loss": 0.2036202847957611, "mean_token_accuracy": 0.9217555373907089, "num_tokens": 13137840.0, "step": 1065 }, { "entropy": 1.3562072217464447, "epoch": 0.5613480779357557, "grad_norm": 0.29948773980140686, "learning_rate": 0.000198817687683502, "loss": 0.20943708717823029, "mean_token_accuracy": 0.9172091037034988, "num_tokens": 13150176.0, "step": 1066 }, { "entropy": 1.4171293675899506, "epoch": 0.5618746708794102, "grad_norm": 0.32766589522361755, "learning_rate": 0.00019881414235398313, "loss": 0.22548557817935944, "mean_token_accuracy": 0.9138119965791702, "num_tokens": 13162512.0, "step": 1067 }, { "entropy": 1.494034618139267, "epoch": 0.5624012638230648, "grad_norm": 0.3495429754257202, "learning_rate": 0.00019881059175208624, "loss": 0.24128882586956024, "mean_token_accuracy": 0.9064372777938843, "num_tokens": 13174848.0, "step": 1068 }, { "entropy": 1.4479554295539856, "epoch": 0.5629278567667193, "grad_norm": 0.3285626769065857, "learning_rate": 0.0001988070358780222, "loss": 0.1992790549993515, "mean_token_accuracy": 0.922189861536026, "num_tokens": 13187184.0, "step": 1069 }, { "entropy": 1.36091148853302, "epoch": 0.5634544497103738, "grad_norm": 0.29997125267982483, "learning_rate": 0.00019880347473200197, "loss": 0.19809836149215698, "mean_token_accuracy": 0.9212192296981812, "num_tokens": 13199520.0, "step": 1070 }, { "entropy": 1.4168705940246582, "epoch": 0.5639810426540285, "grad_norm": 0.320639044046402, "learning_rate": 0.0001987999083142371, "loss": 0.21112670004367828, "mean_token_accuracy": 0.9181769639253616, "num_tokens": 13211856.0, "step": 1071 }, { "entropy": 1.3809196650981903, "epoch": 0.564507635597683, "grad_norm": 0.36394959688186646, "learning_rate": 0.0001987963366249392, "loss": 0.23442226648330688, "mean_token_accuracy": 0.9071120172739029, "num_tokens": 13224192.0, "step": 1072 }, { "entropy": 1.3890978693962097, "epoch": 0.5650342285413376, "grad_norm": 0.34244871139526367, "learning_rate": 0.00019879275966432037, "loss": 0.22117844223976135, "mean_token_accuracy": 0.9115606546401978, "num_tokens": 13236528.0, "step": 1073 }, { "entropy": 1.3886411488056183, "epoch": 0.5655608214849921, "grad_norm": 0.35859042406082153, "learning_rate": 0.00019878917743259292, "loss": 0.21675634384155273, "mean_token_accuracy": 0.9194170236587524, "num_tokens": 13248864.0, "step": 1074 }, { "entropy": 1.4300493896007538, "epoch": 0.5660874144286466, "grad_norm": 0.34859365224838257, "learning_rate": 0.00019878558992996947, "loss": 0.24318671226501465, "mean_token_accuracy": 0.9037031382322311, "num_tokens": 13261200.0, "step": 1075 }, { "entropy": 1.3681704699993134, "epoch": 0.5666140073723012, "grad_norm": 0.3271603286266327, "learning_rate": 0.00019878199715666305, "loss": 0.2319377213716507, "mean_token_accuracy": 0.9129595458507538, "num_tokens": 13273536.0, "step": 1076 }, { "entropy": 1.395903766155243, "epoch": 0.5671406003159558, "grad_norm": 0.29173579812049866, "learning_rate": 0.00019877839911288693, "loss": 0.20177659392356873, "mean_token_accuracy": 0.9242661744356155, "num_tokens": 13285872.0, "step": 1077 }, { "entropy": 1.4401375949382782, "epoch": 0.5676671932596103, "grad_norm": 0.3181249499320984, "learning_rate": 0.0001987747957988547, "loss": 0.22763216495513916, "mean_token_accuracy": 0.907039076089859, "num_tokens": 13298208.0, "step": 1078 }, { "entropy": 1.3585200309753418, "epoch": 0.5681937862032649, "grad_norm": 0.2902856171131134, "learning_rate": 0.00019877118721478026, "loss": 0.19510802626609802, "mean_token_accuracy": 0.9210563600063324, "num_tokens": 13310544.0, "step": 1079 }, { "entropy": 1.3690218329429626, "epoch": 0.5687203791469194, "grad_norm": 0.31650200486183167, "learning_rate": 0.00019876757336087782, "loss": 0.23386812210083008, "mean_token_accuracy": 0.9065526723861694, "num_tokens": 13322880.0, "step": 1080 }, { "entropy": 1.4170444905757904, "epoch": 0.569246972090574, "grad_norm": 0.39458808302879333, "learning_rate": 0.00019876395423736192, "loss": 0.21256215870380402, "mean_token_accuracy": 0.9154652059078217, "num_tokens": 13335216.0, "step": 1081 }, { "entropy": 1.3711142838001251, "epoch": 0.5697735650342285, "grad_norm": 0.3102315366268158, "learning_rate": 0.00019876032984444744, "loss": 0.2107260674238205, "mean_token_accuracy": 0.9209572970867157, "num_tokens": 13347552.0, "step": 1082 }, { "entropy": 1.3468361794948578, "epoch": 0.5703001579778831, "grad_norm": 0.3204945921897888, "learning_rate": 0.00019875670018234946, "loss": 0.21677452325820923, "mean_token_accuracy": 0.9137840569019318, "num_tokens": 13359888.0, "step": 1083 }, { "entropy": 1.3397773206233978, "epoch": 0.5708267509215377, "grad_norm": 0.30542871356010437, "learning_rate": 0.00019875306525128354, "loss": 0.20801898837089539, "mean_token_accuracy": 0.9187730103731155, "num_tokens": 13372224.0, "step": 1084 }, { "entropy": 1.3542706668376923, "epoch": 0.5713533438651922, "grad_norm": 0.39070987701416016, "learning_rate": 0.00019874942505146542, "loss": 0.23829345405101776, "mean_token_accuracy": 0.9077901542186737, "num_tokens": 13384560.0, "step": 1085 }, { "entropy": 1.3789608180522919, "epoch": 0.5718799368088467, "grad_norm": 0.31589949131011963, "learning_rate": 0.00019874577958311124, "loss": 0.23594669997692108, "mean_token_accuracy": 0.9101516306400299, "num_tokens": 13396896.0, "step": 1086 }, { "entropy": 1.2831343114376068, "epoch": 0.5724065297525013, "grad_norm": 0.31056761741638184, "learning_rate": 0.00019874212884643733, "loss": 0.22809851169586182, "mean_token_accuracy": 0.9048083126544952, "num_tokens": 13409232.0, "step": 1087 }, { "entropy": 1.343775451183319, "epoch": 0.5729331226961558, "grad_norm": 0.35355332493782043, "learning_rate": 0.00019873847284166047, "loss": 0.24591763317584991, "mean_token_accuracy": 0.9045094102621078, "num_tokens": 13421568.0, "step": 1088 }, { "entropy": 1.3326263129711151, "epoch": 0.5734597156398105, "grad_norm": 0.30252182483673096, "learning_rate": 0.00019873481156899769, "loss": 0.2264258861541748, "mean_token_accuracy": 0.9123017936944962, "num_tokens": 13433904.0, "step": 1089 }, { "entropy": 1.4111762046813965, "epoch": 0.573986308583465, "grad_norm": 0.30441656708717346, "learning_rate": 0.00019873114502866633, "loss": 0.20945101976394653, "mean_token_accuracy": 0.9133919775485992, "num_tokens": 13446240.0, "step": 1090 }, { "entropy": 1.3507026731967926, "epoch": 0.5745129015271195, "grad_norm": 0.29725486040115356, "learning_rate": 0.00019872747322088405, "loss": 0.22033721208572388, "mean_token_accuracy": 0.9093347936868668, "num_tokens": 13458576.0, "step": 1091 }, { "entropy": 1.3604736626148224, "epoch": 0.5750394944707741, "grad_norm": 0.2988698482513428, "learning_rate": 0.00019872379614586884, "loss": 0.20934537053108215, "mean_token_accuracy": 0.919558510184288, "num_tokens": 13470912.0, "step": 1092 }, { "entropy": 1.2718960344791412, "epoch": 0.5755660874144286, "grad_norm": 0.296278178691864, "learning_rate": 0.00019872011380383896, "loss": 0.2263902723789215, "mean_token_accuracy": 0.9120451807975769, "num_tokens": 13483248.0, "step": 1093 }, { "entropy": 1.3046118319034576, "epoch": 0.5760926803580833, "grad_norm": 0.2931486666202545, "learning_rate": 0.00019871642619501302, "loss": 0.22945842146873474, "mean_token_accuracy": 0.9100485295057297, "num_tokens": 13495584.0, "step": 1094 }, { "entropy": 1.3241084516048431, "epoch": 0.5766192733017378, "grad_norm": 0.3063081204891205, "learning_rate": 0.00019871273331960996, "loss": 0.2523494362831116, "mean_token_accuracy": 0.9037816673517227, "num_tokens": 13507920.0, "step": 1095 }, { "entropy": 1.3798290491104126, "epoch": 0.5771458662453923, "grad_norm": 0.3451617956161499, "learning_rate": 0.00019870903517784898, "loss": 0.2181454300880432, "mean_token_accuracy": 0.9167459905147552, "num_tokens": 13520256.0, "step": 1096 }, { "entropy": 1.292254477739334, "epoch": 0.5776724591890469, "grad_norm": 0.29267409443855286, "learning_rate": 0.0001987053317699496, "loss": 0.2220621407032013, "mean_token_accuracy": 0.9128179252147675, "num_tokens": 13532592.0, "step": 1097 }, { "entropy": 1.2694779932498932, "epoch": 0.5781990521327014, "grad_norm": 0.2939811646938324, "learning_rate": 0.0001987016230961317, "loss": 0.21204796433448792, "mean_token_accuracy": 0.9153830707073212, "num_tokens": 13544928.0, "step": 1098 }, { "entropy": 1.301151692867279, "epoch": 0.5787256450763559, "grad_norm": 0.3276446461677551, "learning_rate": 0.0001986979091566154, "loss": 0.20669840276241302, "mean_token_accuracy": 0.9193602800369263, "num_tokens": 13557264.0, "step": 1099 }, { "entropy": 1.2780292332172394, "epoch": 0.5792522380200106, "grad_norm": 0.31635478138923645, "learning_rate": 0.00019869418995162124, "loss": 0.22475430369377136, "mean_token_accuracy": 0.9149479269981384, "num_tokens": 13569600.0, "step": 1100 }, { "entropy": 1.3376207053661346, "epoch": 0.5797788309636651, "grad_norm": 0.3281361162662506, "learning_rate": 0.00019869046548136996, "loss": 0.2165728509426117, "mean_token_accuracy": 0.9121999144554138, "num_tokens": 13581936.0, "step": 1101 }, { "entropy": 1.2792271375656128, "epoch": 0.5803054239073197, "grad_norm": 0.34059932827949524, "learning_rate": 0.00019868673574608266, "loss": 0.2282489687204361, "mean_token_accuracy": 0.9086829572916031, "num_tokens": 13594272.0, "step": 1102 }, { "entropy": 1.312345266342163, "epoch": 0.5808320168509742, "grad_norm": 0.3228605389595032, "learning_rate": 0.00019868300074598076, "loss": 0.22286418080329895, "mean_token_accuracy": 0.912465900182724, "num_tokens": 13606608.0, "step": 1103 }, { "entropy": 1.3179580569267273, "epoch": 0.5813586097946287, "grad_norm": 0.3180788457393646, "learning_rate": 0.000198679260481286, "loss": 0.2119407206773758, "mean_token_accuracy": 0.9113909304141998, "num_tokens": 13618944.0, "step": 1104 }, { "entropy": 1.3403850197792053, "epoch": 0.5818852027382833, "grad_norm": 0.3467418849468231, "learning_rate": 0.00019867551495222042, "loss": 0.23494362831115723, "mean_token_accuracy": 0.9045893847942352, "num_tokens": 13631280.0, "step": 1105 }, { "entropy": 1.3972817361354828, "epoch": 0.5824117956819379, "grad_norm": 0.289737343788147, "learning_rate": 0.00019867176415900635, "loss": 0.22767332196235657, "mean_token_accuracy": 0.9065064936876297, "num_tokens": 13643616.0, "step": 1106 }, { "entropy": 1.3646803498268127, "epoch": 0.5829383886255924, "grad_norm": 0.30822867155075073, "learning_rate": 0.00019866800810186644, "loss": 0.22304248809814453, "mean_token_accuracy": 0.9127557724714279, "num_tokens": 13655952.0, "step": 1107 }, { "entropy": 1.3917404413223267, "epoch": 0.583464981569247, "grad_norm": 0.3238813579082489, "learning_rate": 0.0001986642467810237, "loss": 0.23602177202701569, "mean_token_accuracy": 0.9076020121574402, "num_tokens": 13668288.0, "step": 1108 }, { "entropy": 1.4159584939479828, "epoch": 0.5839915745129015, "grad_norm": 0.3269672989845276, "learning_rate": 0.00019866048019670144, "loss": 0.22922644019126892, "mean_token_accuracy": 0.9118731915950775, "num_tokens": 13680624.0, "step": 1109 }, { "entropy": 1.426487773656845, "epoch": 0.584518167456556, "grad_norm": 0.33397728204727173, "learning_rate": 0.00019865670834912316, "loss": 0.21286353468894958, "mean_token_accuracy": 0.921152800321579, "num_tokens": 13692960.0, "step": 1110 }, { "entropy": 1.4119893908500671, "epoch": 0.5850447604002106, "grad_norm": 0.29753443598747253, "learning_rate": 0.00019865293123851288, "loss": 0.2373121976852417, "mean_token_accuracy": 0.9035847336053848, "num_tokens": 13705296.0, "step": 1111 }, { "entropy": 1.380676507949829, "epoch": 0.5855713533438652, "grad_norm": 0.2954482436180115, "learning_rate": 0.00019864914886509475, "loss": 0.21925240755081177, "mean_token_accuracy": 0.9149321764707565, "num_tokens": 13717632.0, "step": 1112 }, { "entropy": 1.382420837879181, "epoch": 0.5860979462875198, "grad_norm": 0.3165317177772522, "learning_rate": 0.00019864536122909336, "loss": 0.20962990820407867, "mean_token_accuracy": 0.9176686257123947, "num_tokens": 13729968.0, "step": 1113 }, { "entropy": 1.4016212224960327, "epoch": 0.5866245392311743, "grad_norm": 0.3741922974586487, "learning_rate": 0.00019864156833073352, "loss": 0.21471966803073883, "mean_token_accuracy": 0.9138137102127075, "num_tokens": 13742304.0, "step": 1114 }, { "entropy": 1.330253154039383, "epoch": 0.5871511321748288, "grad_norm": 0.30213749408721924, "learning_rate": 0.00019863777017024042, "loss": 0.21769596636295319, "mean_token_accuracy": 0.9100621193647385, "num_tokens": 13754640.0, "step": 1115 }, { "entropy": 1.353569656610489, "epoch": 0.5876777251184834, "grad_norm": 0.37241899967193604, "learning_rate": 0.00019863396674783953, "loss": 0.2180408537387848, "mean_token_accuracy": 0.9123483598232269, "num_tokens": 13766976.0, "step": 1116 }, { "entropy": 1.3220522999763489, "epoch": 0.588204318062138, "grad_norm": 0.33360689878463745, "learning_rate": 0.00019863015806375662, "loss": 0.21166455745697021, "mean_token_accuracy": 0.9151635468006134, "num_tokens": 13779312.0, "step": 1117 }, { "entropy": 1.4124476611614227, "epoch": 0.5887309110057926, "grad_norm": 0.35278213024139404, "learning_rate": 0.0001986263441182178, "loss": 0.24385729432106018, "mean_token_accuracy": 0.9091434925794601, "num_tokens": 13791648.0, "step": 1118 }, { "entropy": 1.3624746203422546, "epoch": 0.5892575039494471, "grad_norm": 0.303867906332016, "learning_rate": 0.00019862252491144954, "loss": 0.20682811737060547, "mean_token_accuracy": 0.9137058258056641, "num_tokens": 13803984.0, "step": 1119 }, { "entropy": 1.4214110970497131, "epoch": 0.5897840968931016, "grad_norm": 0.29519587755203247, "learning_rate": 0.00019861870044367844, "loss": 0.1955740600824356, "mean_token_accuracy": 0.9222785979509354, "num_tokens": 13816320.0, "step": 1120 }, { "entropy": 1.332068532705307, "epoch": 0.5903106898367562, "grad_norm": 0.31455355882644653, "learning_rate": 0.0001986148707151316, "loss": 0.22069820761680603, "mean_token_accuracy": 0.9075255244970322, "num_tokens": 13828656.0, "step": 1121 }, { "entropy": 1.288136750459671, "epoch": 0.5908372827804107, "grad_norm": 0.3047003448009491, "learning_rate": 0.0001986110357260364, "loss": 0.23481610417366028, "mean_token_accuracy": 0.9039241820573807, "num_tokens": 13840992.0, "step": 1122 }, { "entropy": 1.3215467631816864, "epoch": 0.5913638757240653, "grad_norm": 0.2980950176715851, "learning_rate": 0.0001986071954766205, "loss": 0.20938631892204285, "mean_token_accuracy": 0.9155066460371017, "num_tokens": 13853328.0, "step": 1123 }, { "entropy": 1.3901076912879944, "epoch": 0.5918904686677199, "grad_norm": 0.3429953455924988, "learning_rate": 0.0001986033499671118, "loss": 0.24023953080177307, "mean_token_accuracy": 0.9067379236221313, "num_tokens": 13865664.0, "step": 1124 }, { "entropy": 1.3358671963214874, "epoch": 0.5924170616113744, "grad_norm": 0.2808769643306732, "learning_rate": 0.00019859949919773866, "loss": 0.20975762605667114, "mean_token_accuracy": 0.9166984409093857, "num_tokens": 13878000.0, "step": 1125 }, { "entropy": 1.3196144104003906, "epoch": 0.592943654555029, "grad_norm": 0.3139532506465912, "learning_rate": 0.0001985956431687296, "loss": 0.23033276200294495, "mean_token_accuracy": 0.9116202145814896, "num_tokens": 13890336.0, "step": 1126 }, { "entropy": 1.3117577731609344, "epoch": 0.5934702474986835, "grad_norm": 0.27732840180397034, "learning_rate": 0.0001985917818803136, "loss": 0.20888479053974152, "mean_token_accuracy": 0.9136437624692917, "num_tokens": 13902672.0, "step": 1127 }, { "entropy": 1.3565605282783508, "epoch": 0.593996840442338, "grad_norm": 0.3072391152381897, "learning_rate": 0.00019858791533271993, "loss": 0.2347339540719986, "mean_token_accuracy": 0.9031410962343216, "num_tokens": 13915008.0, "step": 1128 }, { "entropy": 1.3418332636356354, "epoch": 0.5945234333859927, "grad_norm": 0.306152880191803, "learning_rate": 0.000198584043526178, "loss": 0.21512483060359955, "mean_token_accuracy": 0.913850799202919, "num_tokens": 13927344.0, "step": 1129 }, { "entropy": 1.2864646911621094, "epoch": 0.5950500263296472, "grad_norm": 0.272443026304245, "learning_rate": 0.0001985801664609177, "loss": 0.19553211331367493, "mean_token_accuracy": 0.9215691983699799, "num_tokens": 13939680.0, "step": 1130 }, { "entropy": 1.3621837496757507, "epoch": 0.5955766192733017, "grad_norm": 0.30602437257766724, "learning_rate": 0.00019857628413716923, "loss": 0.2275530993938446, "mean_token_accuracy": 0.9101060777902603, "num_tokens": 13952016.0, "step": 1131 }, { "entropy": 1.3566639721393585, "epoch": 0.5961032122169563, "grad_norm": 0.3048968017101288, "learning_rate": 0.00019857239655516302, "loss": 0.20348000526428223, "mean_token_accuracy": 0.9176989495754242, "num_tokens": 13964352.0, "step": 1132 }, { "entropy": 1.3097732663154602, "epoch": 0.5966298051606108, "grad_norm": 0.2780429720878601, "learning_rate": 0.00019856850371512987, "loss": 0.21352221071720123, "mean_token_accuracy": 0.9180653989315033, "num_tokens": 13976688.0, "step": 1133 }, { "entropy": 1.3601540923118591, "epoch": 0.5971563981042654, "grad_norm": 0.28900468349456787, "learning_rate": 0.00019856460561730086, "loss": 0.21711350977420807, "mean_token_accuracy": 0.9169211685657501, "num_tokens": 13989024.0, "step": 1134 }, { "entropy": 1.3538919687271118, "epoch": 0.59768299104792, "grad_norm": 0.34999901056289673, "learning_rate": 0.00019856070226190745, "loss": 0.24132667481899261, "mean_token_accuracy": 0.9076129645109177, "num_tokens": 14001360.0, "step": 1135 }, { "entropy": 1.3285188376903534, "epoch": 0.5982095839915745, "grad_norm": 0.3087072968482971, "learning_rate": 0.00019855679364918125, "loss": 0.21430730819702148, "mean_token_accuracy": 0.911715641617775, "num_tokens": 14013696.0, "step": 1136 }, { "entropy": 1.3584640622138977, "epoch": 0.5987361769352291, "grad_norm": 0.34012794494628906, "learning_rate": 0.00019855287977935438, "loss": 0.22795352339744568, "mean_token_accuracy": 0.9065137207508087, "num_tokens": 14026032.0, "step": 1137 }, { "entropy": 1.337429255247116, "epoch": 0.5992627698788836, "grad_norm": 0.30005964636802673, "learning_rate": 0.0001985489606526592, "loss": 0.22258292138576508, "mean_token_accuracy": 0.9104499816894531, "num_tokens": 14038368.0, "step": 1138 }, { "entropy": 1.3470830917358398, "epoch": 0.5997893628225381, "grad_norm": 0.33669254183769226, "learning_rate": 0.0001985450362693283, "loss": 0.24716174602508545, "mean_token_accuracy": 0.9071019142866135, "num_tokens": 14050704.0, "step": 1139 }, { "entropy": 1.3219377994537354, "epoch": 0.6003159557661928, "grad_norm": 0.28407081961631775, "learning_rate": 0.0001985411066295947, "loss": 0.2014906108379364, "mean_token_accuracy": 0.9218366146087646, "num_tokens": 14063040.0, "step": 1140 }, { "entropy": 1.3444631695747375, "epoch": 0.6008425487098473, "grad_norm": 0.3870190978050232, "learning_rate": 0.00019853717173369163, "loss": 0.231156125664711, "mean_token_accuracy": 0.9088256508111954, "num_tokens": 14075376.0, "step": 1141 }, { "entropy": 1.308059424161911, "epoch": 0.6013691416535019, "grad_norm": 0.2819710373878479, "learning_rate": 0.0001985332315818527, "loss": 0.20217713713645935, "mean_token_accuracy": 0.9211951047182083, "num_tokens": 14087712.0, "step": 1142 }, { "entropy": 1.3603175282478333, "epoch": 0.6018957345971564, "grad_norm": 0.2916105389595032, "learning_rate": 0.00019852928617431186, "loss": 0.21151602268218994, "mean_token_accuracy": 0.9143334627151489, "num_tokens": 14100048.0, "step": 1143 }, { "entropy": 1.4045506119728088, "epoch": 0.6024223275408109, "grad_norm": 0.33014437556266785, "learning_rate": 0.00019852533551130324, "loss": 0.2289315164089203, "mean_token_accuracy": 0.9064499735832214, "num_tokens": 14112384.0, "step": 1144 }, { "entropy": 1.3394192457199097, "epoch": 0.6029489204844655, "grad_norm": 0.28447818756103516, "learning_rate": 0.00019852137959306144, "loss": 0.21860811114311218, "mean_token_accuracy": 0.9082520753145218, "num_tokens": 14124720.0, "step": 1145 }, { "entropy": 1.391217827796936, "epoch": 0.6034755134281201, "grad_norm": 0.28422555327415466, "learning_rate": 0.00019851741841982128, "loss": 0.19729138910770416, "mean_token_accuracy": 0.9245949536561966, "num_tokens": 14137056.0, "step": 1146 }, { "entropy": 1.3858129382133484, "epoch": 0.6040021063717746, "grad_norm": 0.29647180438041687, "learning_rate": 0.00019851345199181793, "loss": 0.22420856356620789, "mean_token_accuracy": 0.9095530211925507, "num_tokens": 14149392.0, "step": 1147 }, { "entropy": 1.3382080793380737, "epoch": 0.6045286993154292, "grad_norm": 0.3809289336204529, "learning_rate": 0.0001985094803092868, "loss": 0.23012962937355042, "mean_token_accuracy": 0.9103907644748688, "num_tokens": 14161728.0, "step": 1148 }, { "entropy": 1.252241313457489, "epoch": 0.6050552922590837, "grad_norm": 0.28908881545066833, "learning_rate": 0.00019850550337246366, "loss": 0.21694348752498627, "mean_token_accuracy": 0.9180784374475479, "num_tokens": 14174064.0, "step": 1149 }, { "entropy": 1.3115107417106628, "epoch": 0.6055818852027383, "grad_norm": 0.30919113755226135, "learning_rate": 0.00019850152118158472, "loss": 0.22491689026355743, "mean_token_accuracy": 0.9089210480451584, "num_tokens": 14186400.0, "step": 1150 }, { "entropy": 1.2686559855937958, "epoch": 0.6061084781463928, "grad_norm": 0.27780571579933167, "learning_rate": 0.0001984975337368862, "loss": 0.18563629686832428, "mean_token_accuracy": 0.9245605766773224, "num_tokens": 14198736.0, "step": 1151 }, { "entropy": 1.272880494594574, "epoch": 0.6066350710900474, "grad_norm": 0.31458860635757446, "learning_rate": 0.00019849354103860495, "loss": 0.21442924439907074, "mean_token_accuracy": 0.9128790646791458, "num_tokens": 14211072.0, "step": 1152 }, { "entropy": 1.2540790140628815, "epoch": 0.607161664033702, "grad_norm": 0.32044321298599243, "learning_rate": 0.000198489543086978, "loss": 0.20413605868816376, "mean_token_accuracy": 0.9179537445306778, "num_tokens": 14223408.0, "step": 1153 }, { "entropy": 1.3018059134483337, "epoch": 0.6076882569773565, "grad_norm": 0.3418496251106262, "learning_rate": 0.00019848553988224254, "loss": 0.2165253758430481, "mean_token_accuracy": 0.9125253260135651, "num_tokens": 14235744.0, "step": 1154 }, { "entropy": 1.2327319979667664, "epoch": 0.608214849921011, "grad_norm": 0.3597237467765808, "learning_rate": 0.0001984815314246364, "loss": 0.235613614320755, "mean_token_accuracy": 0.9087760597467422, "num_tokens": 14248080.0, "step": 1155 }, { "entropy": 1.3383413255214691, "epoch": 0.6087414428646656, "grad_norm": 0.36206018924713135, "learning_rate": 0.00019847751771439738, "loss": 0.2203393429517746, "mean_token_accuracy": 0.9124666899442673, "num_tokens": 14260416.0, "step": 1156 }, { "entropy": 1.2537713646888733, "epoch": 0.6092680358083201, "grad_norm": 0.314043253660202, "learning_rate": 0.00019847349875176383, "loss": 0.18635031580924988, "mean_token_accuracy": 0.924136608839035, "num_tokens": 14272752.0, "step": 1157 }, { "entropy": 1.2804813086986542, "epoch": 0.6097946287519748, "grad_norm": 0.3333822786808014, "learning_rate": 0.00019846947453697436, "loss": 0.24032224714756012, "mean_token_accuracy": 0.9084908664226532, "num_tokens": 14285088.0, "step": 1158 }, { "entropy": 1.2433983385562897, "epoch": 0.6103212216956293, "grad_norm": 0.3367704451084137, "learning_rate": 0.0001984654450702678, "loss": 0.21996420621871948, "mean_token_accuracy": 0.9129030555486679, "num_tokens": 14297424.0, "step": 1159 }, { "entropy": 1.2872591018676758, "epoch": 0.6108478146392838, "grad_norm": 0.3126697838306427, "learning_rate": 0.00019846141035188334, "loss": 0.22938281297683716, "mean_token_accuracy": 0.9084669649600983, "num_tokens": 14309760.0, "step": 1160 }, { "entropy": 1.2282376289367676, "epoch": 0.6113744075829384, "grad_norm": 0.3045027554035187, "learning_rate": 0.0001984573703820606, "loss": 0.21839705109596252, "mean_token_accuracy": 0.9129580110311508, "num_tokens": 14322096.0, "step": 1161 }, { "entropy": 1.296276867389679, "epoch": 0.6119010005265929, "grad_norm": 0.3050879240036011, "learning_rate": 0.00019845332516103933, "loss": 0.21910154819488525, "mean_token_accuracy": 0.9160716086626053, "num_tokens": 14334432.0, "step": 1162 }, { "entropy": 1.2552114129066467, "epoch": 0.6124275934702474, "grad_norm": 0.3606356978416443, "learning_rate": 0.0001984492746890597, "loss": 0.23291565477848053, "mean_token_accuracy": 0.9024920612573624, "num_tokens": 14346768.0, "step": 1163 }, { "entropy": 1.2350418269634247, "epoch": 0.6129541864139021, "grad_norm": 0.30588603019714355, "learning_rate": 0.00019844521896636213, "loss": 0.22299546003341675, "mean_token_accuracy": 0.9098654091358185, "num_tokens": 14359104.0, "step": 1164 }, { "entropy": 1.2168787717819214, "epoch": 0.6134807793575566, "grad_norm": 0.30036792159080505, "learning_rate": 0.00019844115799318743, "loss": 0.2024330198764801, "mean_token_accuracy": 0.9177137911319733, "num_tokens": 14371440.0, "step": 1165 }, { "entropy": 1.2549520134925842, "epoch": 0.6140073723012112, "grad_norm": 0.38305899500846863, "learning_rate": 0.00019843709176977666, "loss": 0.2291533648967743, "mean_token_accuracy": 0.912639394402504, "num_tokens": 14383776.0, "step": 1166 }, { "entropy": 1.235708236694336, "epoch": 0.6145339652448657, "grad_norm": 0.34467607736587524, "learning_rate": 0.0001984330202963712, "loss": 0.22410570085048676, "mean_token_accuracy": 0.9121714979410172, "num_tokens": 14396112.0, "step": 1167 }, { "entropy": 1.1345283687114716, "epoch": 0.6150605581885202, "grad_norm": 0.3024910092353821, "learning_rate": 0.0001984289435732127, "loss": 0.22202812135219574, "mean_token_accuracy": 0.913068488240242, "num_tokens": 14408448.0, "step": 1168 }, { "entropy": 1.154352843761444, "epoch": 0.6155871511321749, "grad_norm": 0.3543850779533386, "learning_rate": 0.00019842486160054327, "loss": 0.24754247069358826, "mean_token_accuracy": 0.9041948169469833, "num_tokens": 14420784.0, "step": 1169 }, { "entropy": 1.1256769597530365, "epoch": 0.6161137440758294, "grad_norm": 0.31246209144592285, "learning_rate": 0.00019842077437860517, "loss": 0.23024949431419373, "mean_token_accuracy": 0.9097237884998322, "num_tokens": 14433120.0, "step": 1170 }, { "entropy": 1.2304538488388062, "epoch": 0.616640337019484, "grad_norm": 0.35418546199798584, "learning_rate": 0.00019841668190764106, "loss": 0.23257943987846375, "mean_token_accuracy": 0.9058277457952499, "num_tokens": 14445456.0, "step": 1171 }, { "entropy": 1.1736994087696075, "epoch": 0.6171669299631385, "grad_norm": 0.29421883821487427, "learning_rate": 0.0001984125841878939, "loss": 0.2265184223651886, "mean_token_accuracy": 0.9127582311630249, "num_tokens": 14457792.0, "step": 1172 }, { "entropy": 1.210179328918457, "epoch": 0.617693522906793, "grad_norm": 0.3278239667415619, "learning_rate": 0.0001984084812196069, "loss": 0.2220735400915146, "mean_token_accuracy": 0.9109156280755997, "num_tokens": 14470128.0, "step": 1173 }, { "entropy": 1.1588793694972992, "epoch": 0.6182201158504476, "grad_norm": 0.27815452218055725, "learning_rate": 0.00019840437300302366, "loss": 0.22251342236995697, "mean_token_accuracy": 0.9095259606838226, "num_tokens": 14482464.0, "step": 1174 }, { "entropy": 1.1791687309741974, "epoch": 0.6187467087941022, "grad_norm": 0.2694774270057678, "learning_rate": 0.00019840025953838804, "loss": 0.2061459869146347, "mean_token_accuracy": 0.9203435033559799, "num_tokens": 14494800.0, "step": 1175 }, { "entropy": 1.1984158754348755, "epoch": 0.6192733017377567, "grad_norm": 0.29139313101768494, "learning_rate": 0.00019839614082594424, "loss": 0.22982501983642578, "mean_token_accuracy": 0.911991760134697, "num_tokens": 14507136.0, "step": 1176 }, { "entropy": 1.1957634687423706, "epoch": 0.6197998946814113, "grad_norm": 0.2952525019645691, "learning_rate": 0.0001983920168659368, "loss": 0.20150825381278992, "mean_token_accuracy": 0.9190460294485092, "num_tokens": 14519472.0, "step": 1177 }, { "entropy": 1.2356001436710358, "epoch": 0.6203264876250658, "grad_norm": 0.3485545516014099, "learning_rate": 0.0001983878876586105, "loss": 0.22730165719985962, "mean_token_accuracy": 0.9079895615577698, "num_tokens": 14531808.0, "step": 1178 }, { "entropy": 1.2191669344902039, "epoch": 0.6208530805687204, "grad_norm": 0.31337442994117737, "learning_rate": 0.00019838375320421046, "loss": 0.2090841382741928, "mean_token_accuracy": 0.9179579317569733, "num_tokens": 14544144.0, "step": 1179 }, { "entropy": 1.1627593338489532, "epoch": 0.6213796735123749, "grad_norm": 0.3373863995075226, "learning_rate": 0.00019837961350298213, "loss": 0.22159543633460999, "mean_token_accuracy": 0.9035765677690506, "num_tokens": 14556480.0, "step": 1180 }, { "entropy": 1.244479089975357, "epoch": 0.6219062664560295, "grad_norm": 0.2939426898956299, "learning_rate": 0.0001983754685551713, "loss": 0.20940116047859192, "mean_token_accuracy": 0.9177102446556091, "num_tokens": 14568816.0, "step": 1181 }, { "entropy": 1.2316089570522308, "epoch": 0.6224328593996841, "grad_norm": 0.3053775727748871, "learning_rate": 0.00019837131836102396, "loss": 0.21764273941516876, "mean_token_accuracy": 0.9150272458791733, "num_tokens": 14581152.0, "step": 1182 }, { "entropy": 1.2752362787723541, "epoch": 0.6229594523433386, "grad_norm": 0.3304329812526703, "learning_rate": 0.00019836716292078647, "loss": 0.23420026898384094, "mean_token_accuracy": 0.9085260033607483, "num_tokens": 14593488.0, "step": 1183 }, { "entropy": 1.2659085094928741, "epoch": 0.6234860452869931, "grad_norm": 0.3893950879573822, "learning_rate": 0.00019836300223470562, "loss": 0.2608282268047333, "mean_token_accuracy": 0.9021032303571701, "num_tokens": 14605824.0, "step": 1184 }, { "entropy": 1.3032302856445312, "epoch": 0.6240126382306477, "grad_norm": 0.3007699251174927, "learning_rate": 0.00019835883630302836, "loss": 0.20315539836883545, "mean_token_accuracy": 0.9167050868272781, "num_tokens": 14618160.0, "step": 1185 }, { "entropy": 1.2084311544895172, "epoch": 0.6245392311743022, "grad_norm": 0.32948681712150574, "learning_rate": 0.00019835466512600197, "loss": 0.23484407365322113, "mean_token_accuracy": 0.9104520976543427, "num_tokens": 14630496.0, "step": 1186 }, { "entropy": 1.2006751894950867, "epoch": 0.6250658241179569, "grad_norm": 0.2981775104999542, "learning_rate": 0.00019835048870387405, "loss": 0.22286085784435272, "mean_token_accuracy": 0.9095976203680038, "num_tokens": 14642832.0, "step": 1187 }, { "entropy": 1.3096867799758911, "epoch": 0.6255924170616114, "grad_norm": 0.3300210237503052, "learning_rate": 0.0001983463070368926, "loss": 0.22102200984954834, "mean_token_accuracy": 0.9119229018688202, "num_tokens": 14655168.0, "step": 1188 }, { "entropy": 1.2840961813926697, "epoch": 0.6261190100052659, "grad_norm": 0.31997406482696533, "learning_rate": 0.00019834212012530579, "loss": 0.23797491192817688, "mean_token_accuracy": 0.9043692797422409, "num_tokens": 14667504.0, "step": 1189 }, { "entropy": 1.2393836975097656, "epoch": 0.6266456029489205, "grad_norm": 0.30698251724243164, "learning_rate": 0.00019833792796936222, "loss": 0.20287004113197327, "mean_token_accuracy": 0.9166252613067627, "num_tokens": 14679840.0, "step": 1190 }, { "entropy": 1.3439719676971436, "epoch": 0.627172195892575, "grad_norm": 0.32229262590408325, "learning_rate": 0.00019833373056931072, "loss": 0.23332646489143372, "mean_token_accuracy": 0.9090562462806702, "num_tokens": 14692176.0, "step": 1191 }, { "entropy": 1.2390953600406647, "epoch": 0.6276987888362296, "grad_norm": 0.3261661231517792, "learning_rate": 0.00019832952792540054, "loss": 0.22384727001190186, "mean_token_accuracy": 0.9121635258197784, "num_tokens": 14704512.0, "step": 1192 }, { "entropy": 1.3028371036052704, "epoch": 0.6282253817798842, "grad_norm": 0.31324324011802673, "learning_rate": 0.00019832532003788108, "loss": 0.2185819447040558, "mean_token_accuracy": 0.9167534857988358, "num_tokens": 14716848.0, "step": 1193 }, { "entropy": 1.1885470747947693, "epoch": 0.6287519747235387, "grad_norm": 0.46663784980773926, "learning_rate": 0.00019832110690700213, "loss": 0.21501871943473816, "mean_token_accuracy": 0.9109776020050049, "num_tokens": 14729184.0, "step": 1194 }, { "entropy": 1.2453204691410065, "epoch": 0.6292785676671933, "grad_norm": 0.3183780014514923, "learning_rate": 0.00019831688853301388, "loss": 0.22543299198150635, "mean_token_accuracy": 0.910496860742569, "num_tokens": 14741520.0, "step": 1195 }, { "entropy": 1.2583057284355164, "epoch": 0.6298051606108478, "grad_norm": 0.3381344676017761, "learning_rate": 0.0001983126649161667, "loss": 0.214624285697937, "mean_token_accuracy": 0.9137195497751236, "num_tokens": 14753856.0, "step": 1196 }, { "entropy": 1.2429248094558716, "epoch": 0.6303317535545023, "grad_norm": 0.30227339267730713, "learning_rate": 0.00019830843605671131, "loss": 0.2062695324420929, "mean_token_accuracy": 0.9234135448932648, "num_tokens": 14766192.0, "step": 1197 }, { "entropy": 1.220680981874466, "epoch": 0.630858346498157, "grad_norm": 0.3083505630493164, "learning_rate": 0.00019830420195489877, "loss": 0.2090727537870407, "mean_token_accuracy": 0.9170975387096405, "num_tokens": 14778528.0, "step": 1198 }, { "entropy": 1.248794138431549, "epoch": 0.6313849394418115, "grad_norm": 0.3802277743816376, "learning_rate": 0.00019829996261098046, "loss": 0.2367159128189087, "mean_token_accuracy": 0.9018937945365906, "num_tokens": 14790864.0, "step": 1199 }, { "entropy": 1.3259137272834778, "epoch": 0.631911532385466, "grad_norm": 0.414235919713974, "learning_rate": 0.00019829571802520803, "loss": 0.2376767247915268, "mean_token_accuracy": 0.9016633927822113, "num_tokens": 14803200.0, "step": 1200 }, { "entropy": 1.3644030392169952, "epoch": 0.6324381253291206, "grad_norm": 0.3521367013454437, "learning_rate": 0.0001982914681978334, "loss": 0.23597122728824615, "mean_token_accuracy": 0.9043200761079788, "num_tokens": 14815536.0, "step": 1201 }, { "entropy": 1.3481078147888184, "epoch": 0.6329647182727751, "grad_norm": 0.2994113266468048, "learning_rate": 0.000198287213129109, "loss": 0.21383647620677948, "mean_token_accuracy": 0.9209251701831818, "num_tokens": 14827872.0, "step": 1202 }, { "entropy": 1.3808801472187042, "epoch": 0.6334913112164297, "grad_norm": 0.2982345223426819, "learning_rate": 0.00019828295281928727, "loss": 0.2155206948518753, "mean_token_accuracy": 0.9116237312555313, "num_tokens": 14840208.0, "step": 1203 }, { "entropy": 1.418733924627304, "epoch": 0.6340179041600843, "grad_norm": 0.3023967742919922, "learning_rate": 0.00019827868726862117, "loss": 0.23393575847148895, "mean_token_accuracy": 0.9095605909824371, "num_tokens": 14852544.0, "step": 1204 }, { "entropy": 1.5514957010746002, "epoch": 0.6345444971037388, "grad_norm": 0.40304750204086304, "learning_rate": 0.00019827441647736393, "loss": 0.26255497336387634, "mean_token_accuracy": 0.9011336117982864, "num_tokens": 14864880.0, "step": 1205 }, { "entropy": 1.4219785034656525, "epoch": 0.6350710900473934, "grad_norm": 0.291746586561203, "learning_rate": 0.00019827014044576912, "loss": 0.21620029211044312, "mean_token_accuracy": 0.9115499705076218, "num_tokens": 14877216.0, "step": 1206 }, { "entropy": 1.3420428931713104, "epoch": 0.6355976829910479, "grad_norm": 0.3108786940574646, "learning_rate": 0.0001982658591740905, "loss": 0.23703286051750183, "mean_token_accuracy": 0.9016107618808746, "num_tokens": 14889552.0, "step": 1207 }, { "entropy": 1.4392370581626892, "epoch": 0.6361242759347024, "grad_norm": 0.27034372091293335, "learning_rate": 0.00019826157266258232, "loss": 0.21097946166992188, "mean_token_accuracy": 0.9190766364336014, "num_tokens": 14901888.0, "step": 1208 }, { "entropy": 1.4509558379650116, "epoch": 0.636650868878357, "grad_norm": 0.29659944772720337, "learning_rate": 0.000198257280911499, "loss": 0.22469229996204376, "mean_token_accuracy": 0.913391038775444, "num_tokens": 14914224.0, "step": 1209 }, { "entropy": 1.3904311954975128, "epoch": 0.6371774618220116, "grad_norm": 0.2719598412513733, "learning_rate": 0.00019825298392109529, "loss": 0.18848726153373718, "mean_token_accuracy": 0.9262688905000687, "num_tokens": 14926560.0, "step": 1210 }, { "entropy": 1.4359396994113922, "epoch": 0.6377040547656662, "grad_norm": 0.3138201832771301, "learning_rate": 0.00019824868169162631, "loss": 0.24162685871124268, "mean_token_accuracy": 0.9020742177963257, "num_tokens": 14938896.0, "step": 1211 }, { "entropy": 1.3890084326267242, "epoch": 0.6382306477093207, "grad_norm": 0.2986134886741638, "learning_rate": 0.00019824437422334744, "loss": 0.22484566271305084, "mean_token_accuracy": 0.9077206701040268, "num_tokens": 14951232.0, "step": 1212 }, { "entropy": 1.378806233406067, "epoch": 0.6387572406529752, "grad_norm": 0.29134130477905273, "learning_rate": 0.00019824006151651443, "loss": 0.2171209454536438, "mean_token_accuracy": 0.9133529961109161, "num_tokens": 14963568.0, "step": 1213 }, { "entropy": 1.363432914018631, "epoch": 0.6392838335966298, "grad_norm": 0.3041214346885681, "learning_rate": 0.00019823574357138323, "loss": 0.24093735218048096, "mean_token_accuracy": 0.903191551566124, "num_tokens": 14975904.0, "step": 1214 }, { "entropy": 1.432945430278778, "epoch": 0.6398104265402843, "grad_norm": 0.30195045471191406, "learning_rate": 0.00019823142038821027, "loss": 0.20907755196094513, "mean_token_accuracy": 0.9161103218793869, "num_tokens": 14988240.0, "step": 1215 }, { "entropy": 1.3210029900074005, "epoch": 0.640337019483939, "grad_norm": 0.29575979709625244, "learning_rate": 0.00019822709196725208, "loss": 0.21090644598007202, "mean_token_accuracy": 0.9149498790502548, "num_tokens": 15000576.0, "step": 1216 }, { "entropy": 1.3699910044670105, "epoch": 0.6408636124275935, "grad_norm": 0.2982396185398102, "learning_rate": 0.00019822275830876568, "loss": 0.2054290473461151, "mean_token_accuracy": 0.9217698276042938, "num_tokens": 15012912.0, "step": 1217 }, { "entropy": 1.41866934299469, "epoch": 0.641390205371248, "grad_norm": 0.3208104968070984, "learning_rate": 0.00019821841941300834, "loss": 0.24424780905246735, "mean_token_accuracy": 0.9118457287549973, "num_tokens": 15025248.0, "step": 1218 }, { "entropy": 1.399036020040512, "epoch": 0.6419167983149026, "grad_norm": 0.3094969689846039, "learning_rate": 0.00019821407528023758, "loss": 0.23681235313415527, "mean_token_accuracy": 0.9031997323036194, "num_tokens": 15037584.0, "step": 1219 }, { "entropy": 1.3915925920009613, "epoch": 0.6424433912585571, "grad_norm": 0.2973760962486267, "learning_rate": 0.00019820972591071131, "loss": 0.19640693068504333, "mean_token_accuracy": 0.9181762486696243, "num_tokens": 15049920.0, "step": 1220 }, { "entropy": 1.4664425551891327, "epoch": 0.6429699842022117, "grad_norm": 0.7199912667274475, "learning_rate": 0.0001982053713046878, "loss": 0.2480940818786621, "mean_token_accuracy": 0.9039055407047272, "num_tokens": 15062256.0, "step": 1221 }, { "entropy": 1.4178178012371063, "epoch": 0.6434965771458663, "grad_norm": 0.3677431643009186, "learning_rate": 0.00019820101146242547, "loss": 0.22347916662693024, "mean_token_accuracy": 0.9104437232017517, "num_tokens": 15074592.0, "step": 1222 }, { "entropy": 1.3942118883132935, "epoch": 0.6440231700895208, "grad_norm": 0.3363230228424072, "learning_rate": 0.00019819664638418314, "loss": 0.23758456110954285, "mean_token_accuracy": 0.9113318026065826, "num_tokens": 15086928.0, "step": 1223 }, { "entropy": 1.3070717453956604, "epoch": 0.6445497630331753, "grad_norm": 0.3119392693042755, "learning_rate": 0.00019819227607021996, "loss": 0.1808784306049347, "mean_token_accuracy": 0.9277928322553635, "num_tokens": 15099264.0, "step": 1224 }, { "entropy": 1.3485881388187408, "epoch": 0.6450763559768299, "grad_norm": 0.2953029274940491, "learning_rate": 0.00019818790052079542, "loss": 0.21690060198307037, "mean_token_accuracy": 0.9107033312320709, "num_tokens": 15111600.0, "step": 1225 }, { "entropy": 1.3310377597808838, "epoch": 0.6456029489204844, "grad_norm": 0.30317792296409607, "learning_rate": 0.0001981835197361692, "loss": 0.21382620930671692, "mean_token_accuracy": 0.9134241938591003, "num_tokens": 15123936.0, "step": 1226 }, { "entropy": 1.3547466397285461, "epoch": 0.6461295418641391, "grad_norm": 0.31380537152290344, "learning_rate": 0.00019817913371660136, "loss": 0.23309272527694702, "mean_token_accuracy": 0.9060655981302261, "num_tokens": 15136272.0, "step": 1227 }, { "entropy": 1.359354555606842, "epoch": 0.6466561348077936, "grad_norm": 0.3240332007408142, "learning_rate": 0.00019817474246235233, "loss": 0.2206256240606308, "mean_token_accuracy": 0.9170451760292053, "num_tokens": 15148608.0, "step": 1228 }, { "entropy": 1.3810060322284698, "epoch": 0.6471827277514481, "grad_norm": 0.28998929262161255, "learning_rate": 0.00019817034597368276, "loss": 0.20593759417533875, "mean_token_accuracy": 0.9143964052200317, "num_tokens": 15160944.0, "step": 1229 }, { "entropy": 1.3853793740272522, "epoch": 0.6477093206951027, "grad_norm": 0.3167085349559784, "learning_rate": 0.00019816594425085365, "loss": 0.214578315615654, "mean_token_accuracy": 0.9154220819473267, "num_tokens": 15173280.0, "step": 1230 }, { "entropy": 1.3485651314258575, "epoch": 0.6482359136387572, "grad_norm": 0.32996588945388794, "learning_rate": 0.00019816153729412627, "loss": 0.227751225233078, "mean_token_accuracy": 0.9076825082302094, "num_tokens": 15185616.0, "step": 1231 }, { "entropy": 1.2957139611244202, "epoch": 0.6487625065824117, "grad_norm": 0.2826898396015167, "learning_rate": 0.0001981571251037623, "loss": 0.2006268948316574, "mean_token_accuracy": 0.9202533811330795, "num_tokens": 15197952.0, "step": 1232 }, { "entropy": 1.42320716381073, "epoch": 0.6492890995260664, "grad_norm": 0.3413523733615875, "learning_rate": 0.00019815270768002357, "loss": 0.2385195791721344, "mean_token_accuracy": 0.9027537554502487, "num_tokens": 15210288.0, "step": 1233 }, { "entropy": 1.3331094086170197, "epoch": 0.6498156924697209, "grad_norm": 0.3069290220737457, "learning_rate": 0.00019814828502317245, "loss": 0.2170781046152115, "mean_token_accuracy": 0.9153832644224167, "num_tokens": 15222624.0, "step": 1234 }, { "entropy": 1.365331083536148, "epoch": 0.6503422854133755, "grad_norm": 0.2763271629810333, "learning_rate": 0.0001981438571334714, "loss": 0.21132177114486694, "mean_token_accuracy": 0.9158383458852768, "num_tokens": 15234960.0, "step": 1235 }, { "entropy": 1.3776979446411133, "epoch": 0.65086887835703, "grad_norm": 0.3232009708881378, "learning_rate": 0.0001981394240111833, "loss": 0.23016487061977386, "mean_token_accuracy": 0.9127575606107712, "num_tokens": 15247296.0, "step": 1236 }, { "entropy": 1.42231023311615, "epoch": 0.6513954713006845, "grad_norm": 0.2981938421726227, "learning_rate": 0.00019813498565657127, "loss": 0.22353443503379822, "mean_token_accuracy": 0.9140705019235611, "num_tokens": 15259632.0, "step": 1237 }, { "entropy": 1.4192762076854706, "epoch": 0.6519220642443391, "grad_norm": 0.30204325914382935, "learning_rate": 0.00019813054206989884, "loss": 0.22629618644714355, "mean_token_accuracy": 0.9069414585828781, "num_tokens": 15271968.0, "step": 1238 }, { "entropy": 1.4479241073131561, "epoch": 0.6524486571879937, "grad_norm": 0.2993687689304352, "learning_rate": 0.00019812609325142982, "loss": 0.22675678133964539, "mean_token_accuracy": 0.9094991534948349, "num_tokens": 15284304.0, "step": 1239 }, { "entropy": 1.4620944261550903, "epoch": 0.6529752501316483, "grad_norm": 0.3134925961494446, "learning_rate": 0.00019812163920142827, "loss": 0.22805798053741455, "mean_token_accuracy": 0.9107698351144791, "num_tokens": 15296640.0, "step": 1240 }, { "entropy": 1.495926171541214, "epoch": 0.6535018430753028, "grad_norm": 0.3140438199043274, "learning_rate": 0.00019811717992015862, "loss": 0.2086748480796814, "mean_token_accuracy": 0.9102585017681122, "num_tokens": 15308976.0, "step": 1241 }, { "entropy": 1.4446808993816376, "epoch": 0.6540284360189573, "grad_norm": 0.30744868516921997, "learning_rate": 0.00019811271540788556, "loss": 0.22943398356437683, "mean_token_accuracy": 0.9074350297451019, "num_tokens": 15321312.0, "step": 1242 }, { "entropy": 1.5100261270999908, "epoch": 0.6545550289626119, "grad_norm": 0.3204497694969177, "learning_rate": 0.00019810824566487417, "loss": 0.22844550013542175, "mean_token_accuracy": 0.9073818922042847, "num_tokens": 15333648.0, "step": 1243 }, { "entropy": 1.4075362086296082, "epoch": 0.6550816219062665, "grad_norm": 0.32697567343711853, "learning_rate": 0.00019810377069138976, "loss": 0.23277214169502258, "mean_token_accuracy": 0.9124523550271988, "num_tokens": 15345984.0, "step": 1244 }, { "entropy": 1.474784404039383, "epoch": 0.655608214849921, "grad_norm": 0.31703367829322815, "learning_rate": 0.000198099290487698, "loss": 0.2128317952156067, "mean_token_accuracy": 0.9103437811136246, "num_tokens": 15358320.0, "step": 1245 }, { "entropy": 1.3723844587802887, "epoch": 0.6561348077935756, "grad_norm": 0.3136475384235382, "learning_rate": 0.0001980948050540648, "loss": 0.2106158286333084, "mean_token_accuracy": 0.9139569699764252, "num_tokens": 15370656.0, "step": 1246 }, { "entropy": 1.4297202229499817, "epoch": 0.6566614007372301, "grad_norm": 0.31566086411476135, "learning_rate": 0.00019809031439075653, "loss": 0.22323954105377197, "mean_token_accuracy": 0.912299782037735, "num_tokens": 15382992.0, "step": 1247 }, { "entropy": 1.404792070388794, "epoch": 0.6571879936808847, "grad_norm": 0.30582812428474426, "learning_rate": 0.00019808581849803972, "loss": 0.19535206258296967, "mean_token_accuracy": 0.926054835319519, "num_tokens": 15395328.0, "step": 1248 }, { "entropy": 1.365869253873825, "epoch": 0.6577145866245392, "grad_norm": 0.32905054092407227, "learning_rate": 0.00019808131737618126, "loss": 0.206635981798172, "mean_token_accuracy": 0.9179205745458603, "num_tokens": 15407664.0, "step": 1249 }, { "entropy": 1.4380927085876465, "epoch": 0.6582411795681938, "grad_norm": 0.3363628685474396, "learning_rate": 0.00019807681102544834, "loss": 0.23559972643852234, "mean_token_accuracy": 0.9073036760091782, "num_tokens": 15420000.0, "step": 1250 }, { "entropy": 1.4528064727783203, "epoch": 0.6587677725118484, "grad_norm": 0.3616321384906769, "learning_rate": 0.00019807229944610854, "loss": 0.23041245341300964, "mean_token_accuracy": 0.9012827575206757, "num_tokens": 15432336.0, "step": 1251 }, { "entropy": 1.4460172951221466, "epoch": 0.6592943654555029, "grad_norm": 0.305955171585083, "learning_rate": 0.00019806778263842964, "loss": 0.21666109561920166, "mean_token_accuracy": 0.9198573529720306, "num_tokens": 15444672.0, "step": 1252 }, { "entropy": 1.500756323337555, "epoch": 0.6598209583991574, "grad_norm": 0.29015445709228516, "learning_rate": 0.00019806326060267977, "loss": 0.21642570197582245, "mean_token_accuracy": 0.9154843240976334, "num_tokens": 15457008.0, "step": 1253 }, { "entropy": 1.4731870293617249, "epoch": 0.660347551342812, "grad_norm": 0.3006648123264313, "learning_rate": 0.00019805873333912739, "loss": 0.20880235731601715, "mean_token_accuracy": 0.924048438668251, "num_tokens": 15469344.0, "step": 1254 }, { "entropy": 1.5191810727119446, "epoch": 0.6608741442864665, "grad_norm": 0.290721595287323, "learning_rate": 0.00019805420084804124, "loss": 0.21848249435424805, "mean_token_accuracy": 0.9141736477613449, "num_tokens": 15481680.0, "step": 1255 }, { "entropy": 1.521433562040329, "epoch": 0.6614007372301212, "grad_norm": 0.3009195327758789, "learning_rate": 0.00019804966312969046, "loss": 0.20721524953842163, "mean_token_accuracy": 0.9165780544281006, "num_tokens": 15494016.0, "step": 1256 }, { "entropy": 1.5230248272418976, "epoch": 0.6619273301737757, "grad_norm": 0.2907300293445587, "learning_rate": 0.00019804512018434432, "loss": 0.2220079004764557, "mean_token_accuracy": 0.9127085506916046, "num_tokens": 15506352.0, "step": 1257 }, { "entropy": 1.4415357112884521, "epoch": 0.6624539231174302, "grad_norm": 0.27609995007514954, "learning_rate": 0.00019804057201227259, "loss": 0.19916732609272003, "mean_token_accuracy": 0.9211323857307434, "num_tokens": 15518688.0, "step": 1258 }, { "entropy": 1.5071959793567657, "epoch": 0.6629805160610848, "grad_norm": 0.3255380690097809, "learning_rate": 0.0001980360186137452, "loss": 0.23832152783870697, "mean_token_accuracy": 0.9030174165964127, "num_tokens": 15531024.0, "step": 1259 }, { "entropy": 1.544082134962082, "epoch": 0.6635071090047393, "grad_norm": 0.31669536232948303, "learning_rate": 0.00019803145998903253, "loss": 0.2193489968776703, "mean_token_accuracy": 0.9140938073396683, "num_tokens": 15543360.0, "step": 1260 }, { "entropy": 1.5186286568641663, "epoch": 0.6640337019483938, "grad_norm": 0.3087945282459259, "learning_rate": 0.00019802689613840514, "loss": 0.2145516723394394, "mean_token_accuracy": 0.9134328663349152, "num_tokens": 15555696.0, "step": 1261 }, { "entropy": 1.4552082121372223, "epoch": 0.6645602948920485, "grad_norm": 0.3144809901714325, "learning_rate": 0.000198022327062134, "loss": 0.22542014718055725, "mean_token_accuracy": 0.9080185741186142, "num_tokens": 15568032.0, "step": 1262 }, { "entropy": 1.4759101569652557, "epoch": 0.665086887835703, "grad_norm": 0.28055956959724426, "learning_rate": 0.00019801775276049035, "loss": 0.19411805272102356, "mean_token_accuracy": 0.9219205677509308, "num_tokens": 15580368.0, "step": 1263 }, { "entropy": 1.5172317326068878, "epoch": 0.6656134807793576, "grad_norm": 0.28847187757492065, "learning_rate": 0.00019801317323374574, "loss": 0.1965804398059845, "mean_token_accuracy": 0.9217233210802078, "num_tokens": 15592704.0, "step": 1264 }, { "entropy": 1.4631735682487488, "epoch": 0.6661400737230121, "grad_norm": 0.3277401924133301, "learning_rate": 0.000198008588482172, "loss": 0.23770709335803986, "mean_token_accuracy": 0.9039840698242188, "num_tokens": 15605040.0, "step": 1265 }, { "entropy": 1.5213152170181274, "epoch": 0.6666666666666666, "grad_norm": 0.31430521607398987, "learning_rate": 0.00019800399850604129, "loss": 0.23058706521987915, "mean_token_accuracy": 0.9074577987194061, "num_tokens": 15617376.0, "step": 1266 }, { "entropy": 1.4705300331115723, "epoch": 0.6671932596103213, "grad_norm": 0.3256817162036896, "learning_rate": 0.0001979994033056261, "loss": 0.25320321321487427, "mean_token_accuracy": 0.9007576107978821, "num_tokens": 15629712.0, "step": 1267 }, { "entropy": 1.530697613954544, "epoch": 0.6677198525539758, "grad_norm": 0.30975228548049927, "learning_rate": 0.00019799480288119927, "loss": 0.23081722855567932, "mean_token_accuracy": 0.9080140292644501, "num_tokens": 15642048.0, "step": 1268 }, { "entropy": 1.495768964290619, "epoch": 0.6682464454976303, "grad_norm": 0.29344475269317627, "learning_rate": 0.00019799019723303388, "loss": 0.2015610784292221, "mean_token_accuracy": 0.9178611040115356, "num_tokens": 15654384.0, "step": 1269 }, { "entropy": 1.5803856551647186, "epoch": 0.6687730384412849, "grad_norm": 0.3023964464664459, "learning_rate": 0.00019798558636140333, "loss": 0.2174011915922165, "mean_token_accuracy": 0.9140703827142715, "num_tokens": 15666720.0, "step": 1270 }, { "entropy": 1.4897505939006805, "epoch": 0.6692996313849394, "grad_norm": 0.2858726978302002, "learning_rate": 0.0001979809702665813, "loss": 0.20024171471595764, "mean_token_accuracy": 0.9191962629556656, "num_tokens": 15679056.0, "step": 1271 }, { "entropy": 1.5215353667736053, "epoch": 0.669826224328594, "grad_norm": 0.27068790793418884, "learning_rate": 0.00019797634894884184, "loss": 0.21988946199417114, "mean_token_accuracy": 0.9098561853170395, "num_tokens": 15691392.0, "step": 1272 }, { "entropy": 1.5361709892749786, "epoch": 0.6703528172722486, "grad_norm": 0.3324735164642334, "learning_rate": 0.00019797172240845935, "loss": 0.2674825191497803, "mean_token_accuracy": 0.8955648243427277, "num_tokens": 15703728.0, "step": 1273 }, { "entropy": 1.5240019261837006, "epoch": 0.6708794102159031, "grad_norm": 0.3050387501716614, "learning_rate": 0.00019796709064570842, "loss": 0.22774918377399445, "mean_token_accuracy": 0.9072832018136978, "num_tokens": 15716064.0, "step": 1274 }, { "entropy": 1.4996045529842377, "epoch": 0.6714060031595577, "grad_norm": 0.2832599878311157, "learning_rate": 0.00019796245366086404, "loss": 0.21256539225578308, "mean_token_accuracy": 0.9113875329494476, "num_tokens": 15728400.0, "step": 1275 }, { "entropy": 1.537344366312027, "epoch": 0.6719325961032122, "grad_norm": 0.28976351022720337, "learning_rate": 0.00019795781145420148, "loss": 0.2061801552772522, "mean_token_accuracy": 0.9169371575117111, "num_tokens": 15740736.0, "step": 1276 }, { "entropy": 1.5299006402492523, "epoch": 0.6724591890468667, "grad_norm": 0.2772320806980133, "learning_rate": 0.0001979531640259963, "loss": 0.20862804353237152, "mean_token_accuracy": 0.9104678928852081, "num_tokens": 15753072.0, "step": 1277 }, { "entropy": 1.5044286847114563, "epoch": 0.6729857819905213, "grad_norm": 0.3096766769886017, "learning_rate": 0.0001979485113765244, "loss": 0.23148494958877563, "mean_token_accuracy": 0.9055089354515076, "num_tokens": 15765408.0, "step": 1278 }, { "entropy": 1.492220789194107, "epoch": 0.6735123749341759, "grad_norm": 0.2892164885997772, "learning_rate": 0.00019794385350606198, "loss": 0.2099100798368454, "mean_token_accuracy": 0.9140574485063553, "num_tokens": 15777744.0, "step": 1279 }, { "entropy": 1.5607218742370605, "epoch": 0.6740389678778305, "grad_norm": 0.3277181088924408, "learning_rate": 0.00019793919041488555, "loss": 0.22673308849334717, "mean_token_accuracy": 0.9092708230018616, "num_tokens": 15790080.0, "step": 1280 }, { "entropy": 1.5162492990493774, "epoch": 0.674565560821485, "grad_norm": 0.3172418475151062, "learning_rate": 0.00019793452210327194, "loss": 0.23533746600151062, "mean_token_accuracy": 0.9022314250469208, "num_tokens": 15802416.0, "step": 1281 }, { "entropy": 1.4783676862716675, "epoch": 0.6750921537651395, "grad_norm": 0.2982933521270752, "learning_rate": 0.00019792984857149826, "loss": 0.21463748812675476, "mean_token_accuracy": 0.9117985665798187, "num_tokens": 15814752.0, "step": 1282 }, { "entropy": 1.5162720084190369, "epoch": 0.6756187467087941, "grad_norm": 0.2976648211479187, "learning_rate": 0.000197925169819842, "loss": 0.21266265213489532, "mean_token_accuracy": 0.9171696603298187, "num_tokens": 15827088.0, "step": 1283 }, { "entropy": 1.5761696994304657, "epoch": 0.6761453396524486, "grad_norm": 0.32240986824035645, "learning_rate": 0.00019792048584858082, "loss": 0.22523874044418335, "mean_token_accuracy": 0.9125792235136032, "num_tokens": 15839424.0, "step": 1284 }, { "entropy": 1.4458520412445068, "epoch": 0.6766719325961033, "grad_norm": 0.2936963140964508, "learning_rate": 0.00019791579665799286, "loss": 0.20535065233707428, "mean_token_accuracy": 0.9165598750114441, "num_tokens": 15851760.0, "step": 1285 }, { "entropy": 1.4983311593532562, "epoch": 0.6771985255397578, "grad_norm": 0.34449514746665955, "learning_rate": 0.0001979111022483565, "loss": 0.21712952852249146, "mean_token_accuracy": 0.9153823703527451, "num_tokens": 15864096.0, "step": 1286 }, { "entropy": 1.562139093875885, "epoch": 0.6777251184834123, "grad_norm": 0.31743091344833374, "learning_rate": 0.00019790640261995034, "loss": 0.219345360994339, "mean_token_accuracy": 0.9084994047880173, "num_tokens": 15876432.0, "step": 1287 }, { "entropy": 1.5375787019729614, "epoch": 0.6782517114270669, "grad_norm": 0.27115342020988464, "learning_rate": 0.00019790169777305345, "loss": 0.19260238111019135, "mean_token_accuracy": 0.9227229058742523, "num_tokens": 15888768.0, "step": 1288 }, { "entropy": 1.4687424898147583, "epoch": 0.6787783043707214, "grad_norm": 0.302287220954895, "learning_rate": 0.00019789698770794506, "loss": 0.24450846016407013, "mean_token_accuracy": 0.9040905237197876, "num_tokens": 15901104.0, "step": 1289 }, { "entropy": 1.5125727355480194, "epoch": 0.6793048973143759, "grad_norm": 0.3316330313682556, "learning_rate": 0.00019789227242490481, "loss": 0.23443403840065002, "mean_token_accuracy": 0.9077270179986954, "num_tokens": 15913440.0, "step": 1290 }, { "entropy": 1.457822471857071, "epoch": 0.6798314902580306, "grad_norm": 0.3082807958126068, "learning_rate": 0.00019788755192421266, "loss": 0.2276977300643921, "mean_token_accuracy": 0.907697319984436, "num_tokens": 15925776.0, "step": 1291 }, { "entropy": 1.5687705874443054, "epoch": 0.6803580832016851, "grad_norm": 0.3347495198249817, "learning_rate": 0.00019788282620614877, "loss": 0.23658336699008942, "mean_token_accuracy": 0.9071597903966904, "num_tokens": 15938112.0, "step": 1292 }, { "entropy": 1.4747570753097534, "epoch": 0.6808846761453397, "grad_norm": 0.31832975149154663, "learning_rate": 0.0001978780952709937, "loss": 0.19530466198921204, "mean_token_accuracy": 0.9262362122535706, "num_tokens": 15950448.0, "step": 1293 }, { "entropy": 1.5592786967754364, "epoch": 0.6814112690889942, "grad_norm": 0.29860836267471313, "learning_rate": 0.00019787335911902835, "loss": 0.21259617805480957, "mean_token_accuracy": 0.9156482219696045, "num_tokens": 15962784.0, "step": 1294 }, { "entropy": 1.590408980846405, "epoch": 0.6819378620326487, "grad_norm": 0.33426377177238464, "learning_rate": 0.0001978686177505338, "loss": 0.250851035118103, "mean_token_accuracy": 0.9034130126237869, "num_tokens": 15975120.0, "step": 1295 }, { "entropy": 1.520596295595169, "epoch": 0.6824644549763034, "grad_norm": 0.31754234433174133, "learning_rate": 0.00019786387116579155, "loss": 0.23741202056407928, "mean_token_accuracy": 0.9074528068304062, "num_tokens": 15987456.0, "step": 1296 }, { "entropy": 1.589228630065918, "epoch": 0.6829910479199579, "grad_norm": 0.334957480430603, "learning_rate": 0.0001978591193650834, "loss": 0.2431160807609558, "mean_token_accuracy": 0.9039677083492279, "num_tokens": 15999792.0, "step": 1297 }, { "entropy": 1.5251929759979248, "epoch": 0.6835176408636124, "grad_norm": 0.26925790309906006, "learning_rate": 0.00019785436234869138, "loss": 0.18518362939357758, "mean_token_accuracy": 0.9277700483798981, "num_tokens": 16012128.0, "step": 1298 }, { "entropy": 1.49588942527771, "epoch": 0.684044233807267, "grad_norm": 0.2995278835296631, "learning_rate": 0.00019784960011689793, "loss": 0.21347451210021973, "mean_token_accuracy": 0.9186176806688309, "num_tokens": 16024464.0, "step": 1299 }, { "entropy": 1.5090012848377228, "epoch": 0.6845708267509215, "grad_norm": 0.2900152802467346, "learning_rate": 0.00019784483266998575, "loss": 0.20770123600959778, "mean_token_accuracy": 0.9164092987775803, "num_tokens": 16036800.0, "step": 1300 }, { "entropy": 1.524385005235672, "epoch": 0.685097419694576, "grad_norm": 0.2801123857498169, "learning_rate": 0.00019784006000823787, "loss": 0.1997857242822647, "mean_token_accuracy": 0.9173883497714996, "num_tokens": 16049136.0, "step": 1301 }, { "entropy": 1.5324156284332275, "epoch": 0.6856240126382307, "grad_norm": 0.30303382873535156, "learning_rate": 0.0001978352821319376, "loss": 0.21537630259990692, "mean_token_accuracy": 0.9123150855302811, "num_tokens": 16061472.0, "step": 1302 }, { "entropy": 1.538516879081726, "epoch": 0.6861506055818852, "grad_norm": 0.2965938448905945, "learning_rate": 0.00019783049904136855, "loss": 0.20010440051555634, "mean_token_accuracy": 0.9172840118408203, "num_tokens": 16073808.0, "step": 1303 }, { "entropy": 1.4958137571811676, "epoch": 0.6866771985255398, "grad_norm": 0.29906049370765686, "learning_rate": 0.0001978257107368147, "loss": 0.20351183414459229, "mean_token_accuracy": 0.921799048781395, "num_tokens": 16086144.0, "step": 1304 }, { "entropy": 1.4531968832015991, "epoch": 0.6872037914691943, "grad_norm": 0.31886446475982666, "learning_rate": 0.0001978209172185603, "loss": 0.21320727467536926, "mean_token_accuracy": 0.9105631560087204, "num_tokens": 16098480.0, "step": 1305 }, { "entropy": 1.3787581324577332, "epoch": 0.6877303844128488, "grad_norm": 0.2898115813732147, "learning_rate": 0.0001978161184868899, "loss": 0.2124798595905304, "mean_token_accuracy": 0.9114013463258743, "num_tokens": 16110816.0, "step": 1306 }, { "entropy": 1.4378518164157867, "epoch": 0.6882569773565034, "grad_norm": 0.31470921635627747, "learning_rate": 0.00019781131454208833, "loss": 0.19701991975307465, "mean_token_accuracy": 0.9186731576919556, "num_tokens": 16123152.0, "step": 1307 }, { "entropy": 1.4289041459560394, "epoch": 0.688783570300158, "grad_norm": 0.3303619921207428, "learning_rate": 0.0001978065053844409, "loss": 0.23253998160362244, "mean_token_accuracy": 0.9104226678609848, "num_tokens": 16135488.0, "step": 1308 }, { "entropy": 1.458989679813385, "epoch": 0.6893101632438126, "grad_norm": 0.30710119009017944, "learning_rate": 0.00019780169101423295, "loss": 0.2202616184949875, "mean_token_accuracy": 0.9115623980760574, "num_tokens": 16147824.0, "step": 1309 }, { "entropy": 1.5141521096229553, "epoch": 0.6898367561874671, "grad_norm": 0.3152952194213867, "learning_rate": 0.0001977968714317504, "loss": 0.19381463527679443, "mean_token_accuracy": 0.9204765856266022, "num_tokens": 16160160.0, "step": 1310 }, { "entropy": 1.4804642498493195, "epoch": 0.6903633491311216, "grad_norm": 0.3526984751224518, "learning_rate": 0.0001977920466372793, "loss": 0.22401507198810577, "mean_token_accuracy": 0.9142041653394699, "num_tokens": 16172496.0, "step": 1311 }, { "entropy": 1.4126333594322205, "epoch": 0.6908899420747762, "grad_norm": 0.2999390661716461, "learning_rate": 0.00019778721663110603, "loss": 0.212639719247818, "mean_token_accuracy": 0.9140689373016357, "num_tokens": 16184832.0, "step": 1312 }, { "entropy": 1.4407996237277985, "epoch": 0.6914165350184307, "grad_norm": 0.3175979554653168, "learning_rate": 0.00019778238141351744, "loss": 0.23567378520965576, "mean_token_accuracy": 0.9058562517166138, "num_tokens": 16197168.0, "step": 1313 }, { "entropy": 1.4304053783416748, "epoch": 0.6919431279620853, "grad_norm": 0.32357415556907654, "learning_rate": 0.00019777754098480047, "loss": 0.23323741555213928, "mean_token_accuracy": 0.9068403393030167, "num_tokens": 16209504.0, "step": 1314 }, { "entropy": 1.4463219940662384, "epoch": 0.6924697209057399, "grad_norm": 0.32085898518562317, "learning_rate": 0.0001977726953452425, "loss": 0.25303539633750916, "mean_token_accuracy": 0.9010388404130936, "num_tokens": 16221840.0, "step": 1315 }, { "entropy": 1.5001619458198547, "epoch": 0.6929963138493944, "grad_norm": 0.30218154191970825, "learning_rate": 0.0001977678444951312, "loss": 0.20458348095417023, "mean_token_accuracy": 0.9198221117258072, "num_tokens": 16234176.0, "step": 1316 }, { "entropy": 1.4169287383556366, "epoch": 0.693522906793049, "grad_norm": 0.2987150549888611, "learning_rate": 0.0001977629884347545, "loss": 0.20915895700454712, "mean_token_accuracy": 0.914911612868309, "num_tokens": 16246512.0, "step": 1317 }, { "entropy": 1.4708910584449768, "epoch": 0.6940494997367035, "grad_norm": 0.2975226938724518, "learning_rate": 0.00019775812716440073, "loss": 0.21582108736038208, "mean_token_accuracy": 0.916588231921196, "num_tokens": 16258848.0, "step": 1318 }, { "entropy": 1.395564466714859, "epoch": 0.6945760926803581, "grad_norm": 0.26800790429115295, "learning_rate": 0.00019775326068435843, "loss": 0.19701655209064484, "mean_token_accuracy": 0.9204675257205963, "num_tokens": 16271184.0, "step": 1319 }, { "entropy": 1.4954661428928375, "epoch": 0.6951026856240127, "grad_norm": 0.3218332529067993, "learning_rate": 0.00019774838899491647, "loss": 0.20654654502868652, "mean_token_accuracy": 0.9205126464366913, "num_tokens": 16283520.0, "step": 1320 }, { "entropy": 1.475353330373764, "epoch": 0.6956292785676672, "grad_norm": 0.29199621081352234, "learning_rate": 0.00019774351209636413, "loss": 0.22376279532909393, "mean_token_accuracy": 0.9100230783224106, "num_tokens": 16295856.0, "step": 1321 }, { "entropy": 1.5148694515228271, "epoch": 0.6961558715113217, "grad_norm": 0.30520734190940857, "learning_rate": 0.00019773862998899086, "loss": 0.2176750898361206, "mean_token_accuracy": 0.9201380461454391, "num_tokens": 16308192.0, "step": 1322 }, { "entropy": 1.5539270341396332, "epoch": 0.6966824644549763, "grad_norm": 0.32190483808517456, "learning_rate": 0.00019773374267308653, "loss": 0.2056635320186615, "mean_token_accuracy": 0.914083868265152, "num_tokens": 16320528.0, "step": 1323 }, { "entropy": 1.4479952156543732, "epoch": 0.6972090573986308, "grad_norm": 0.3086356222629547, "learning_rate": 0.00019772885014894125, "loss": 0.19541175663471222, "mean_token_accuracy": 0.9208300113677979, "num_tokens": 16332864.0, "step": 1324 }, { "entropy": 1.4255986511707306, "epoch": 0.6977356503422855, "grad_norm": 0.29759716987609863, "learning_rate": 0.00019772395241684547, "loss": 0.22268646955490112, "mean_token_accuracy": 0.9130487442016602, "num_tokens": 16345200.0, "step": 1325 }, { "entropy": 1.417414665222168, "epoch": 0.69826224328594, "grad_norm": 0.30235084891319275, "learning_rate": 0.00019771904947708991, "loss": 0.19872839748859406, "mean_token_accuracy": 0.9202670305967331, "num_tokens": 16357536.0, "step": 1326 }, { "entropy": 1.462871015071869, "epoch": 0.6987888362295945, "grad_norm": 0.330930233001709, "learning_rate": 0.00019771414132996565, "loss": 0.21214503049850464, "mean_token_accuracy": 0.9157495498657227, "num_tokens": 16369872.0, "step": 1327 }, { "entropy": 1.4870843291282654, "epoch": 0.6993154291732491, "grad_norm": 0.33824852108955383, "learning_rate": 0.00019770922797576407, "loss": 0.23521599173545837, "mean_token_accuracy": 0.9104333966970444, "num_tokens": 16382208.0, "step": 1328 }, { "entropy": 1.4692321121692657, "epoch": 0.6998420221169036, "grad_norm": 0.2853015959262848, "learning_rate": 0.0001977043094147768, "loss": 0.21163907647132874, "mean_token_accuracy": 0.9183786511421204, "num_tokens": 16394544.0, "step": 1329 }, { "entropy": 1.4160318076610565, "epoch": 0.7003686150605581, "grad_norm": 0.3194182217121124, "learning_rate": 0.00019769938564729585, "loss": 0.22332850098609924, "mean_token_accuracy": 0.9086870551109314, "num_tokens": 16406880.0, "step": 1330 }, { "entropy": 1.5249937772750854, "epoch": 0.7008952080042128, "grad_norm": 0.2979271709918976, "learning_rate": 0.00019769445667361358, "loss": 0.20148411393165588, "mean_token_accuracy": 0.919349730014801, "num_tokens": 16419216.0, "step": 1331 }, { "entropy": 1.475309818983078, "epoch": 0.7014218009478673, "grad_norm": 0.31436359882354736, "learning_rate": 0.00019768952249402252, "loss": 0.2226470410823822, "mean_token_accuracy": 0.9143447577953339, "num_tokens": 16431552.0, "step": 1332 }, { "entropy": 1.45591801404953, "epoch": 0.7019483938915219, "grad_norm": 0.3134812116622925, "learning_rate": 0.00019768458310881557, "loss": 0.239861398935318, "mean_token_accuracy": 0.9030255079269409, "num_tokens": 16443888.0, "step": 1333 }, { "entropy": 1.4746840596199036, "epoch": 0.7024749868351764, "grad_norm": 0.2945224642753601, "learning_rate": 0.00019767963851828604, "loss": 0.2150000035762787, "mean_token_accuracy": 0.9179409146308899, "num_tokens": 16456224.0, "step": 1334 }, { "entropy": 1.4820148646831512, "epoch": 0.7030015797788309, "grad_norm": 0.30797162652015686, "learning_rate": 0.00019767468872272737, "loss": 0.22350315749645233, "mean_token_accuracy": 0.9135662913322449, "num_tokens": 16468560.0, "step": 1335 }, { "entropy": 1.5698617100715637, "epoch": 0.7035281727224855, "grad_norm": 0.3179170489311218, "learning_rate": 0.00019766973372243343, "loss": 0.20203739404678345, "mean_token_accuracy": 0.9202521592378616, "num_tokens": 16480896.0, "step": 1336 }, { "entropy": 1.5165068209171295, "epoch": 0.7040547656661401, "grad_norm": 0.282023549079895, "learning_rate": 0.0001976647735176984, "loss": 0.2072068601846695, "mean_token_accuracy": 0.9170822501182556, "num_tokens": 16493232.0, "step": 1337 }, { "entropy": 1.5599988996982574, "epoch": 0.7045813586097947, "grad_norm": 0.32171323895454407, "learning_rate": 0.0001976598081088167, "loss": 0.2177916020154953, "mean_token_accuracy": 0.9149684607982635, "num_tokens": 16505568.0, "step": 1338 }, { "entropy": 1.566039115190506, "epoch": 0.7051079515534492, "grad_norm": 0.2976767420768738, "learning_rate": 0.00019765483749608313, "loss": 0.20423297584056854, "mean_token_accuracy": 0.9218804687261581, "num_tokens": 16517904.0, "step": 1339 }, { "entropy": 1.5926516354084015, "epoch": 0.7056345444971037, "grad_norm": 0.3847099244594574, "learning_rate": 0.00019764986167979275, "loss": 0.22431136667728424, "mean_token_accuracy": 0.9091393053531647, "num_tokens": 16530240.0, "step": 1340 }, { "entropy": 1.5083985030651093, "epoch": 0.7061611374407583, "grad_norm": 0.3162590563297272, "learning_rate": 0.0001976448806602409, "loss": 0.2287883162498474, "mean_token_accuracy": 0.9064637273550034, "num_tokens": 16542576.0, "step": 1341 }, { "entropy": 1.4989595413208008, "epoch": 0.7066877303844129, "grad_norm": 0.3000263571739197, "learning_rate": 0.00019763989443772337, "loss": 0.21327601373195648, "mean_token_accuracy": 0.9155562520027161, "num_tokens": 16554912.0, "step": 1342 }, { "entropy": 1.5128290951251984, "epoch": 0.7072143233280674, "grad_norm": 0.2836988568305969, "learning_rate": 0.00019763490301253608, "loss": 0.19906045496463776, "mean_token_accuracy": 0.9238555133342743, "num_tokens": 16567248.0, "step": 1343 }, { "entropy": 1.5032199919223785, "epoch": 0.707740916271722, "grad_norm": 0.2904132306575775, "learning_rate": 0.0001976299063849754, "loss": 0.21531090140342712, "mean_token_accuracy": 0.9095672369003296, "num_tokens": 16579584.0, "step": 1344 }, { "entropy": 1.587888479232788, "epoch": 0.7082675092153765, "grad_norm": 0.3187963664531708, "learning_rate": 0.00019762490455533792, "loss": 0.21344661712646484, "mean_token_accuracy": 0.9137663394212723, "num_tokens": 16591920.0, "step": 1345 }, { "entropy": 1.5427050590515137, "epoch": 0.708794102159031, "grad_norm": 0.2940306067466736, "learning_rate": 0.00019761989752392053, "loss": 0.1942479908466339, "mean_token_accuracy": 0.9190978854894638, "num_tokens": 16604256.0, "step": 1346 }, { "entropy": 1.5427431166172028, "epoch": 0.7093206951026856, "grad_norm": 0.3436744809150696, "learning_rate": 0.00019761488529102057, "loss": 0.2245483100414276, "mean_token_accuracy": 0.909973606467247, "num_tokens": 16616592.0, "step": 1347 }, { "entropy": 1.4897418022155762, "epoch": 0.7098472880463402, "grad_norm": 0.34564313292503357, "learning_rate": 0.0001976098678569355, "loss": 0.23059901595115662, "mean_token_accuracy": 0.9069952964782715, "num_tokens": 16628928.0, "step": 1348 }, { "entropy": 1.5078385174274445, "epoch": 0.7103738809899948, "grad_norm": 0.32199203968048096, "learning_rate": 0.0001976048452219632, "loss": 0.22921977937221527, "mean_token_accuracy": 0.9082883149385452, "num_tokens": 16641264.0, "step": 1349 }, { "entropy": 1.5083224773406982, "epoch": 0.7109004739336493, "grad_norm": 0.3183170258998871, "learning_rate": 0.00019759981738640185, "loss": 0.22415608167648315, "mean_token_accuracy": 0.9100949168205261, "num_tokens": 16653600.0, "step": 1350 }, { "entropy": 1.5398178398609161, "epoch": 0.7114270668773038, "grad_norm": 0.30399900674819946, "learning_rate": 0.0001975947843505499, "loss": 0.22306974232196808, "mean_token_accuracy": 0.9138671904802322, "num_tokens": 16665936.0, "step": 1351 }, { "entropy": 1.535412222146988, "epoch": 0.7119536598209584, "grad_norm": 0.2907712757587433, "learning_rate": 0.00019758974611470615, "loss": 0.2197205275297165, "mean_token_accuracy": 0.9130839556455612, "num_tokens": 16678272.0, "step": 1352 }, { "entropy": 1.4855974614620209, "epoch": 0.7124802527646129, "grad_norm": 0.28864648938179016, "learning_rate": 0.0001975847026791697, "loss": 0.21561571955680847, "mean_token_accuracy": 0.9168848842382431, "num_tokens": 16690608.0, "step": 1353 }, { "entropy": 1.453218251466751, "epoch": 0.7130068457082676, "grad_norm": 0.3135017454624176, "learning_rate": 0.00019757965404423994, "loss": 0.2011297047138214, "mean_token_accuracy": 0.9190320074558258, "num_tokens": 16702944.0, "step": 1354 }, { "entropy": 1.4790661036968231, "epoch": 0.7135334386519221, "grad_norm": 0.3001917004585266, "learning_rate": 0.00019757460021021655, "loss": 0.23639211058616638, "mean_token_accuracy": 0.9105001240968704, "num_tokens": 16715280.0, "step": 1355 }, { "entropy": 1.496882289648056, "epoch": 0.7140600315955766, "grad_norm": 0.31785574555397034, "learning_rate": 0.00019756954117739956, "loss": 0.2306048721075058, "mean_token_accuracy": 0.9150114953517914, "num_tokens": 16727616.0, "step": 1356 }, { "entropy": 1.4668599963188171, "epoch": 0.7145866245392312, "grad_norm": 0.29470139741897583, "learning_rate": 0.00019756447694608932, "loss": 0.21168065071105957, "mean_token_accuracy": 0.9137952625751495, "num_tokens": 16739952.0, "step": 1357 }, { "entropy": 1.422877013683319, "epoch": 0.7151132174828857, "grad_norm": 0.27277153730392456, "learning_rate": 0.00019755940751658643, "loss": 0.20774061977863312, "mean_token_accuracy": 0.9166775196790695, "num_tokens": 16752288.0, "step": 1358 }, { "entropy": 1.4244271516799927, "epoch": 0.7156398104265402, "grad_norm": 0.31778132915496826, "learning_rate": 0.00019755433288919187, "loss": 0.231976717710495, "mean_token_accuracy": 0.9075390994548798, "num_tokens": 16764624.0, "step": 1359 }, { "entropy": 1.4513772428035736, "epoch": 0.7161664033701949, "grad_norm": 0.30516210198402405, "learning_rate": 0.0001975492530642069, "loss": 0.20754879713058472, "mean_token_accuracy": 0.9216670095920563, "num_tokens": 16776960.0, "step": 1360 }, { "entropy": 1.4767080545425415, "epoch": 0.7166929963138494, "grad_norm": 0.3156355917453766, "learning_rate": 0.00019754416804193298, "loss": 0.20898932218551636, "mean_token_accuracy": 0.9173450469970703, "num_tokens": 16789296.0, "step": 1361 }, { "entropy": 1.4257088005542755, "epoch": 0.717219589257504, "grad_norm": 0.33443206548690796, "learning_rate": 0.0001975390778226721, "loss": 0.237446129322052, "mean_token_accuracy": 0.9077172726392746, "num_tokens": 16801632.0, "step": 1362 }, { "entropy": 1.393272042274475, "epoch": 0.7177461822011585, "grad_norm": 0.30247074365615845, "learning_rate": 0.00019753398240672637, "loss": 0.21317076683044434, "mean_token_accuracy": 0.9131140112876892, "num_tokens": 16813968.0, "step": 1363 }, { "entropy": 1.431013286113739, "epoch": 0.718272775144813, "grad_norm": 0.29114142060279846, "learning_rate": 0.0001975288817943983, "loss": 0.19287830591201782, "mean_token_accuracy": 0.9247073382139206, "num_tokens": 16826304.0, "step": 1364 }, { "entropy": 1.3813497424125671, "epoch": 0.7187993680884676, "grad_norm": 0.2997731566429138, "learning_rate": 0.00019752377598599067, "loss": 0.2021138221025467, "mean_token_accuracy": 0.9203190356492996, "num_tokens": 16838640.0, "step": 1365 }, { "entropy": 1.4252038598060608, "epoch": 0.7193259610321222, "grad_norm": 0.3252887725830078, "learning_rate": 0.0001975186649818066, "loss": 0.20873992145061493, "mean_token_accuracy": 0.912327915430069, "num_tokens": 16850976.0, "step": 1366 }, { "entropy": 1.4511545896530151, "epoch": 0.7198525539757767, "grad_norm": 0.34324178099632263, "learning_rate": 0.00019751354878214946, "loss": 0.21222266554832458, "mean_token_accuracy": 0.9157299846410751, "num_tokens": 16863312.0, "step": 1367 }, { "entropy": 1.3630057871341705, "epoch": 0.7203791469194313, "grad_norm": 0.37623706459999084, "learning_rate": 0.00019750842738732304, "loss": 0.2201295793056488, "mean_token_accuracy": 0.9165831059217453, "num_tokens": 16875648.0, "step": 1368 }, { "entropy": 1.3505005836486816, "epoch": 0.7209057398630858, "grad_norm": 0.30142372846603394, "learning_rate": 0.0001975033007976313, "loss": 0.22212043404579163, "mean_token_accuracy": 0.9122855514287949, "num_tokens": 16887984.0, "step": 1369 }, { "entropy": 1.4169504642486572, "epoch": 0.7214323328067404, "grad_norm": 0.3326164782047272, "learning_rate": 0.0001974981690133786, "loss": 0.22192654013633728, "mean_token_accuracy": 0.9108520150184631, "num_tokens": 16900320.0, "step": 1370 }, { "entropy": 1.367185264825821, "epoch": 0.721958925750395, "grad_norm": 0.33256617188453674, "learning_rate": 0.00019749303203486958, "loss": 0.24168333411216736, "mean_token_accuracy": 0.9047919362783432, "num_tokens": 16912656.0, "step": 1371 }, { "entropy": 1.3614123463630676, "epoch": 0.7224855186940495, "grad_norm": 0.3197641670703888, "learning_rate": 0.00019748788986240917, "loss": 0.23665747046470642, "mean_token_accuracy": 0.9026706665754318, "num_tokens": 16924992.0, "step": 1372 }, { "entropy": 1.3906526267528534, "epoch": 0.7230121116377041, "grad_norm": 0.29753339290618896, "learning_rate": 0.00019748274249630269, "loss": 0.19765980541706085, "mean_token_accuracy": 0.9235783219337463, "num_tokens": 16937328.0, "step": 1373 }, { "entropy": 1.3462652564048767, "epoch": 0.7235387045813586, "grad_norm": 0.2804873585700989, "learning_rate": 0.00019747758993685568, "loss": 0.22064946591854095, "mean_token_accuracy": 0.9110289812088013, "num_tokens": 16949664.0, "step": 1374 }, { "entropy": 1.4082630276679993, "epoch": 0.7240652975250131, "grad_norm": 0.3095674216747284, "learning_rate": 0.000197472432184374, "loss": 0.20987483859062195, "mean_token_accuracy": 0.9188564568758011, "num_tokens": 16962000.0, "step": 1375 }, { "entropy": 1.304635614156723, "epoch": 0.7245918904686677, "grad_norm": 0.2778051197528839, "learning_rate": 0.00019746726923916387, "loss": 0.21651524305343628, "mean_token_accuracy": 0.9125857651233673, "num_tokens": 16974336.0, "step": 1376 }, { "entropy": 1.3015822768211365, "epoch": 0.7251184834123223, "grad_norm": 0.2806200683116913, "learning_rate": 0.00019746210110153172, "loss": 0.22142334282398224, "mean_token_accuracy": 0.911768451333046, "num_tokens": 16986672.0, "step": 1377 }, { "entropy": 1.3526243567466736, "epoch": 0.7256450763559769, "grad_norm": 0.3183799684047699, "learning_rate": 0.0001974569277717844, "loss": 0.2256852686405182, "mean_token_accuracy": 0.9073309451341629, "num_tokens": 16999008.0, "step": 1378 }, { "entropy": 1.3906278908252716, "epoch": 0.7261716692996314, "grad_norm": 0.2876151204109192, "learning_rate": 0.00019745174925022904, "loss": 0.2028118073940277, "mean_token_accuracy": 0.923457607626915, "num_tokens": 17011344.0, "step": 1379 }, { "entropy": 1.350665271282196, "epoch": 0.7266982622432859, "grad_norm": 0.33748704195022583, "learning_rate": 0.00019744656553717305, "loss": 0.2175031304359436, "mean_token_accuracy": 0.9140133857727051, "num_tokens": 17023680.0, "step": 1380 }, { "entropy": 1.3705949485301971, "epoch": 0.7272248551869405, "grad_norm": 0.3174329400062561, "learning_rate": 0.00019744137663292412, "loss": 0.20505183935165405, "mean_token_accuracy": 0.916661724448204, "num_tokens": 17036016.0, "step": 1381 }, { "entropy": 1.3908927738666534, "epoch": 0.727751448130595, "grad_norm": 0.31065794825553894, "learning_rate": 0.00019743618253779033, "loss": 0.23529362678527832, "mean_token_accuracy": 0.910541832447052, "num_tokens": 17048352.0, "step": 1382 }, { "entropy": 1.3258641958236694, "epoch": 0.7282780410742496, "grad_norm": 0.26997655630111694, "learning_rate": 0.00019743098325207995, "loss": 0.18447992205619812, "mean_token_accuracy": 0.9224408715963364, "num_tokens": 17060688.0, "step": 1383 }, { "entropy": 1.3685748875141144, "epoch": 0.7288046340179042, "grad_norm": 0.3111379146575928, "learning_rate": 0.00019742577877610173, "loss": 0.22453925013542175, "mean_token_accuracy": 0.9133676290512085, "num_tokens": 17073024.0, "step": 1384 }, { "entropy": 1.42083340883255, "epoch": 0.7293312269615587, "grad_norm": 0.331272691488266, "learning_rate": 0.00019742056911016456, "loss": 0.23528197407722473, "mean_token_accuracy": 0.9075358361005783, "num_tokens": 17085360.0, "step": 1385 }, { "entropy": 1.4835380911827087, "epoch": 0.7298578199052133, "grad_norm": 0.30057939887046814, "learning_rate": 0.0001974153542545777, "loss": 0.19702467322349548, "mean_token_accuracy": 0.9221197068691254, "num_tokens": 17097696.0, "step": 1386 }, { "entropy": 1.412318229675293, "epoch": 0.7303844128488678, "grad_norm": 0.314919650554657, "learning_rate": 0.00019741013420965077, "loss": 0.22496280074119568, "mean_token_accuracy": 0.9107683897018433, "num_tokens": 17110032.0, "step": 1387 }, { "entropy": 1.5203742980957031, "epoch": 0.7309110057925223, "grad_norm": 0.4578418433666229, "learning_rate": 0.00019740490897569366, "loss": 0.22902803122997284, "mean_token_accuracy": 0.9130762368440628, "num_tokens": 17122368.0, "step": 1388 }, { "entropy": 1.496030032634735, "epoch": 0.731437598736177, "grad_norm": 0.29055219888687134, "learning_rate": 0.00019739967855301652, "loss": 0.21085382997989655, "mean_token_accuracy": 0.9122315496206284, "num_tokens": 17134704.0, "step": 1389 }, { "entropy": 1.4665674567222595, "epoch": 0.7319641916798315, "grad_norm": 0.2788514494895935, "learning_rate": 0.0001973944429419299, "loss": 0.20301197469234467, "mean_token_accuracy": 0.9215195178985596, "num_tokens": 17147040.0, "step": 1390 }, { "entropy": 1.5158916115760803, "epoch": 0.732490784623486, "grad_norm": 0.3139953315258026, "learning_rate": 0.00019738920214274454, "loss": 0.20764051377773285, "mean_token_accuracy": 0.915527880191803, "num_tokens": 17159376.0, "step": 1391 }, { "entropy": 1.5249950289726257, "epoch": 0.7330173775671406, "grad_norm": 0.30590322613716125, "learning_rate": 0.00019738395615577161, "loss": 0.22601057589054108, "mean_token_accuracy": 0.9111659973859787, "num_tokens": 17171712.0, "step": 1392 }, { "entropy": 1.468850463628769, "epoch": 0.7335439705107951, "grad_norm": 0.311515212059021, "learning_rate": 0.00019737870498132248, "loss": 0.2210465669631958, "mean_token_accuracy": 0.9097635447978973, "num_tokens": 17184048.0, "step": 1393 }, { "entropy": 1.5013999938964844, "epoch": 0.7340705634544498, "grad_norm": 0.3101951479911804, "learning_rate": 0.00019737344861970896, "loss": 0.21400384604930878, "mean_token_accuracy": 0.9109934121370316, "num_tokens": 17196384.0, "step": 1394 }, { "entropy": 1.4603233933448792, "epoch": 0.7345971563981043, "grad_norm": 0.26839688420295715, "learning_rate": 0.00019736818707124303, "loss": 0.1959075927734375, "mean_token_accuracy": 0.9210042357444763, "num_tokens": 17208720.0, "step": 1395 }, { "entropy": 1.513748586177826, "epoch": 0.7351237493417588, "grad_norm": 0.3097459673881531, "learning_rate": 0.00019736292033623704, "loss": 0.2226242572069168, "mean_token_accuracy": 0.9143490940332413, "num_tokens": 17221056.0, "step": 1396 }, { "entropy": 1.4970153272151947, "epoch": 0.7356503422854134, "grad_norm": 0.3178339898586273, "learning_rate": 0.00019735764841500368, "loss": 0.22419294714927673, "mean_token_accuracy": 0.9115694165229797, "num_tokens": 17233392.0, "step": 1397 }, { "entropy": 1.4637455344200134, "epoch": 0.7361769352290679, "grad_norm": 0.3103068768978119, "learning_rate": 0.0001973523713078559, "loss": 0.2213975489139557, "mean_token_accuracy": 0.908700242638588, "num_tokens": 17245728.0, "step": 1398 }, { "entropy": 1.4048950970172882, "epoch": 0.7367035281727224, "grad_norm": 0.3316826820373535, "learning_rate": 0.00019734708901510695, "loss": 0.22181765735149384, "mean_token_accuracy": 0.9124202877283096, "num_tokens": 17258064.0, "step": 1399 }, { "entropy": 1.400584727525711, "epoch": 0.7372301211163771, "grad_norm": 0.30288171768188477, "learning_rate": 0.0001973418015370704, "loss": 0.23632709681987762, "mean_token_accuracy": 0.903136819601059, "num_tokens": 17270400.0, "step": 1400 }, { "entropy": 1.4175618290901184, "epoch": 0.7377567140600316, "grad_norm": 0.2811354696750641, "learning_rate": 0.00019733650887406018, "loss": 0.21318787336349487, "mean_token_accuracy": 0.9126076847314835, "num_tokens": 17282736.0, "step": 1401 }, { "entropy": 1.4151119589805603, "epoch": 0.7382833070036862, "grad_norm": 0.2701869010925293, "learning_rate": 0.00019733121102639048, "loss": 0.21690967679023743, "mean_token_accuracy": 0.9093466997146606, "num_tokens": 17295072.0, "step": 1402 }, { "entropy": 1.3918836414813995, "epoch": 0.7388098999473407, "grad_norm": 0.27023303508758545, "learning_rate": 0.00019732590799437577, "loss": 0.18338678777217865, "mean_token_accuracy": 0.9283169507980347, "num_tokens": 17307408.0, "step": 1403 }, { "entropy": 1.4320692718029022, "epoch": 0.7393364928909952, "grad_norm": 0.26482948660850525, "learning_rate": 0.00019732059977833088, "loss": 0.2143803983926773, "mean_token_accuracy": 0.9123003780841827, "num_tokens": 17319744.0, "step": 1404 }, { "entropy": 1.4552482962608337, "epoch": 0.7398630858346498, "grad_norm": 0.3084104359149933, "learning_rate": 0.00019731528637857094, "loss": 0.21455544233322144, "mean_token_accuracy": 0.9187665581703186, "num_tokens": 17332080.0, "step": 1405 }, { "entropy": 1.362955391407013, "epoch": 0.7403896787783044, "grad_norm": 0.2885385751724243, "learning_rate": 0.00019730996779541133, "loss": 0.2053847312927246, "mean_token_accuracy": 0.9195720255374908, "num_tokens": 17344416.0, "step": 1406 }, { "entropy": 1.3902620077133179, "epoch": 0.740916271721959, "grad_norm": 0.31122514605522156, "learning_rate": 0.0001973046440291678, "loss": 0.24145708978176117, "mean_token_accuracy": 0.9063299000263214, "num_tokens": 17356752.0, "step": 1407 }, { "entropy": 1.3320231139659882, "epoch": 0.7414428646656135, "grad_norm": 0.285426527261734, "learning_rate": 0.00019729931508015647, "loss": 0.202953040599823, "mean_token_accuracy": 0.9166394174098969, "num_tokens": 17369088.0, "step": 1408 }, { "entropy": 1.3167757391929626, "epoch": 0.741969457609268, "grad_norm": 0.3052743375301361, "learning_rate": 0.00019729398094869358, "loss": 0.23250755667686462, "mean_token_accuracy": 0.909424439072609, "num_tokens": 17381424.0, "step": 1409 }, { "entropy": 1.3000437319278717, "epoch": 0.7424960505529226, "grad_norm": 0.33441463112831116, "learning_rate": 0.00019728864163509583, "loss": 0.2160688042640686, "mean_token_accuracy": 0.9094254523515701, "num_tokens": 17393760.0, "step": 1410 }, { "entropy": 1.3271216750144958, "epoch": 0.7430226434965771, "grad_norm": 0.2913570702075958, "learning_rate": 0.00019728329713968016, "loss": 0.1972869336605072, "mean_token_accuracy": 0.9217556267976761, "num_tokens": 17406096.0, "step": 1411 }, { "entropy": 1.3546923398971558, "epoch": 0.7435492364402317, "grad_norm": 0.31364765763282776, "learning_rate": 0.00019727794746276391, "loss": 0.21945282816886902, "mean_token_accuracy": 0.9129824340343475, "num_tokens": 17418432.0, "step": 1412 }, { "entropy": 1.3115905821323395, "epoch": 0.7440758293838863, "grad_norm": 0.29262346029281616, "learning_rate": 0.00019727259260466458, "loss": 0.22911304235458374, "mean_token_accuracy": 0.9053215533494949, "num_tokens": 17430768.0, "step": 1413 }, { "entropy": 1.2379891574382782, "epoch": 0.7446024223275408, "grad_norm": 0.3259003162384033, "learning_rate": 0.0001972672325657001, "loss": 0.19887758791446686, "mean_token_accuracy": 0.9181624054908752, "num_tokens": 17443104.0, "step": 1414 }, { "entropy": 1.3647005259990692, "epoch": 0.7451290152711953, "grad_norm": 0.4454919695854187, "learning_rate": 0.00019726186734618867, "loss": 0.22842802107334137, "mean_token_accuracy": 0.9110278934240341, "num_tokens": 17455440.0, "step": 1415 }, { "entropy": 1.3383563160896301, "epoch": 0.7456556082148499, "grad_norm": 0.30020466446876526, "learning_rate": 0.00019725649694644876, "loss": 0.22231580317020416, "mean_token_accuracy": 0.9075456112623215, "num_tokens": 17467776.0, "step": 1416 }, { "entropy": 1.3714047372341156, "epoch": 0.7461822011585044, "grad_norm": 0.29304370284080505, "learning_rate": 0.0001972511213667992, "loss": 0.21095791459083557, "mean_token_accuracy": 0.9166263341903687, "num_tokens": 17480112.0, "step": 1417 }, { "entropy": 1.3512816727161407, "epoch": 0.7467087941021591, "grad_norm": 0.3256070613861084, "learning_rate": 0.0001972457406075591, "loss": 0.20153497159481049, "mean_token_accuracy": 0.9194765239953995, "num_tokens": 17492448.0, "step": 1418 }, { "entropy": 1.3885486125946045, "epoch": 0.7472353870458136, "grad_norm": 0.3231737017631531, "learning_rate": 0.00019724035466904788, "loss": 0.2227013111114502, "mean_token_accuracy": 0.9109441936016083, "num_tokens": 17504784.0, "step": 1419 }, { "entropy": 1.3755838871002197, "epoch": 0.7477619799894681, "grad_norm": 0.29787546396255493, "learning_rate": 0.0001972349635515853, "loss": 0.216201514005661, "mean_token_accuracy": 0.9155356884002686, "num_tokens": 17517120.0, "step": 1420 }, { "entropy": 1.437903732061386, "epoch": 0.7482885729331227, "grad_norm": 0.33993855118751526, "learning_rate": 0.00019722956725549138, "loss": 0.21523010730743408, "mean_token_accuracy": 0.9125061631202698, "num_tokens": 17529456.0, "step": 1421 }, { "entropy": 1.333466112613678, "epoch": 0.7488151658767772, "grad_norm": 0.33743515610694885, "learning_rate": 0.00019722416578108642, "loss": 0.22355730831623077, "mean_token_accuracy": 0.9136557281017303, "num_tokens": 17541792.0, "step": 1422 }, { "entropy": 1.360717535018921, "epoch": 0.7493417588204319, "grad_norm": 0.2994014024734497, "learning_rate": 0.00019721875912869118, "loss": 0.19619853794574738, "mean_token_accuracy": 0.9230263978242874, "num_tokens": 17554128.0, "step": 1423 }, { "entropy": 1.2954363822937012, "epoch": 0.7498683517640864, "grad_norm": 0.29989591240882874, "learning_rate": 0.0001972133472986265, "loss": 0.2181311547756195, "mean_token_accuracy": 0.9170015305280685, "num_tokens": 17566464.0, "step": 1424 }, { "entropy": 1.380856215953827, "epoch": 0.7503949447077409, "grad_norm": 0.28764021396636963, "learning_rate": 0.00019720793029121377, "loss": 0.21031011641025543, "mean_token_accuracy": 0.9177572429180145, "num_tokens": 17578800.0, "step": 1425 }, { "entropy": 1.3035545349121094, "epoch": 0.7509215376513955, "grad_norm": 0.2988784611225128, "learning_rate": 0.00019720250810677446, "loss": 0.20998632907867432, "mean_token_accuracy": 0.9130989611148834, "num_tokens": 17591136.0, "step": 1426 }, { "entropy": 1.289101094007492, "epoch": 0.75144813059505, "grad_norm": 0.49617183208465576, "learning_rate": 0.0001971970807456305, "loss": 0.21026289463043213, "mean_token_accuracy": 0.9138355553150177, "num_tokens": 17603472.0, "step": 1427 }, { "entropy": 1.3593553006649017, "epoch": 0.7519747235387045, "grad_norm": 0.3344785273075104, "learning_rate": 0.0001971916482081041, "loss": 0.20339743793010712, "mean_token_accuracy": 0.9177296459674835, "num_tokens": 17615808.0, "step": 1428 }, { "entropy": 1.3161483705043793, "epoch": 0.7525013164823592, "grad_norm": 0.3118573725223541, "learning_rate": 0.00019718621049451772, "loss": 0.2201179563999176, "mean_token_accuracy": 0.9167029410600662, "num_tokens": 17628144.0, "step": 1429 }, { "entropy": 1.3809407949447632, "epoch": 0.7530279094260137, "grad_norm": 0.3208526074886322, "learning_rate": 0.00019718076760519423, "loss": 0.23530805110931396, "mean_token_accuracy": 0.9093427956104279, "num_tokens": 17640480.0, "step": 1430 }, { "entropy": 1.3892112076282501, "epoch": 0.7535545023696683, "grad_norm": 0.2703491747379303, "learning_rate": 0.00019717531954045663, "loss": 0.2121361941099167, "mean_token_accuracy": 0.916591003537178, "num_tokens": 17652816.0, "step": 1431 }, { "entropy": 1.464809536933899, "epoch": 0.7540810953133228, "grad_norm": 0.2980828285217285, "learning_rate": 0.00019716986630062842, "loss": 0.21547271311283112, "mean_token_accuracy": 0.9138219356536865, "num_tokens": 17665152.0, "step": 1432 }, { "entropy": 1.4611221253871918, "epoch": 0.7546076882569773, "grad_norm": 0.3190062642097473, "learning_rate": 0.00019716440788603332, "loss": 0.22262822091579437, "mean_token_accuracy": 0.9171289652585983, "num_tokens": 17677488.0, "step": 1433 }, { "entropy": 1.4677778780460358, "epoch": 0.7551342812006319, "grad_norm": 0.2803551256656647, "learning_rate": 0.00019715894429699537, "loss": 0.2030690461397171, "mean_token_accuracy": 0.9211814850568771, "num_tokens": 17689824.0, "step": 1434 }, { "entropy": 1.546930730342865, "epoch": 0.7556608741442865, "grad_norm": 0.3004758954048157, "learning_rate": 0.00019715347553383888, "loss": 0.21929655969142914, "mean_token_accuracy": 0.9147268533706665, "num_tokens": 17702160.0, "step": 1435 }, { "entropy": 1.458657145500183, "epoch": 0.756187467087941, "grad_norm": 0.2918381094932556, "learning_rate": 0.00019714800159688852, "loss": 0.20412471890449524, "mean_token_accuracy": 0.9208769351243973, "num_tokens": 17714496.0, "step": 1436 }, { "entropy": 1.4661605954170227, "epoch": 0.7567140600315956, "grad_norm": 0.28824299573898315, "learning_rate": 0.00019714252248646924, "loss": 0.19737893342971802, "mean_token_accuracy": 0.9271862953901291, "num_tokens": 17726832.0, "step": 1437 }, { "entropy": 1.4540847837924957, "epoch": 0.7572406529752501, "grad_norm": 0.2962500751018524, "learning_rate": 0.00019713703820290634, "loss": 0.21638396382331848, "mean_token_accuracy": 0.9159590601921082, "num_tokens": 17739168.0, "step": 1438 }, { "entropy": 1.4231859147548676, "epoch": 0.7577672459189047, "grad_norm": 0.29495999217033386, "learning_rate": 0.00019713154874652532, "loss": 0.2159111201763153, "mean_token_accuracy": 0.9145191609859467, "num_tokens": 17751504.0, "step": 1439 }, { "entropy": 1.3984394371509552, "epoch": 0.7582938388625592, "grad_norm": 0.3085009753704071, "learning_rate": 0.0001971260541176521, "loss": 0.2231639325618744, "mean_token_accuracy": 0.9079516977071762, "num_tokens": 17763840.0, "step": 1440 }, { "entropy": 1.4092283248901367, "epoch": 0.7588204318062138, "grad_norm": 0.31046876311302185, "learning_rate": 0.00019712055431661286, "loss": 0.21453410387039185, "mean_token_accuracy": 0.916040763258934, "num_tokens": 17776176.0, "step": 1441 }, { "entropy": 1.3918389678001404, "epoch": 0.7593470247498684, "grad_norm": 0.3046187460422516, "learning_rate": 0.00019711504934373408, "loss": 0.20514801144599915, "mean_token_accuracy": 0.9181930124759674, "num_tokens": 17788512.0, "step": 1442 }, { "entropy": 1.3869245946407318, "epoch": 0.7598736176935229, "grad_norm": 0.31358590722084045, "learning_rate": 0.00019710953919934256, "loss": 0.22413912415504456, "mean_token_accuracy": 0.9102539569139481, "num_tokens": 17800848.0, "step": 1443 }, { "entropy": 1.3643006086349487, "epoch": 0.7604002106371774, "grad_norm": 0.27224990725517273, "learning_rate": 0.00019710402388376544, "loss": 0.20147213339805603, "mean_token_accuracy": 0.9196710139513016, "num_tokens": 17813184.0, "step": 1444 }, { "entropy": 1.39336559176445, "epoch": 0.760926803580832, "grad_norm": 0.3104258179664612, "learning_rate": 0.00019709850339733008, "loss": 0.21504773199558258, "mean_token_accuracy": 0.9135936945676804, "num_tokens": 17825520.0, "step": 1445 }, { "entropy": 1.3767728209495544, "epoch": 0.7614533965244866, "grad_norm": 0.3152048587799072, "learning_rate": 0.0001970929777403642, "loss": 0.221971333026886, "mean_token_accuracy": 0.911506250500679, "num_tokens": 17837856.0, "step": 1446 }, { "entropy": 1.4271937906742096, "epoch": 0.7619799894681412, "grad_norm": 0.3253970444202423, "learning_rate": 0.00019708744691319588, "loss": 0.2253606915473938, "mean_token_accuracy": 0.9094466418027878, "num_tokens": 17850192.0, "step": 1447 }, { "entropy": 1.3933376669883728, "epoch": 0.7625065824117957, "grad_norm": 0.3199850022792816, "learning_rate": 0.00019708191091615343, "loss": 0.21662366390228271, "mean_token_accuracy": 0.9175620973110199, "num_tokens": 17862528.0, "step": 1448 }, { "entropy": 1.433942288160324, "epoch": 0.7630331753554502, "grad_norm": 0.2839816212654114, "learning_rate": 0.00019707636974956546, "loss": 0.20464417338371277, "mean_token_accuracy": 0.9186283946037292, "num_tokens": 17874864.0, "step": 1449 }, { "entropy": 1.3883062601089478, "epoch": 0.7635597682991048, "grad_norm": 0.3059125542640686, "learning_rate": 0.00019707082341376093, "loss": 0.21790815889835358, "mean_token_accuracy": 0.9127152860164642, "num_tokens": 17887200.0, "step": 1450 }, { "entropy": 1.4840424954891205, "epoch": 0.7640863612427593, "grad_norm": 0.317634642124176, "learning_rate": 0.0001970652719090691, "loss": 0.22078271210193634, "mean_token_accuracy": 0.9099593609571457, "num_tokens": 17899536.0, "step": 1451 }, { "entropy": 1.373614490032196, "epoch": 0.764612954186414, "grad_norm": 0.2764304280281067, "learning_rate": 0.00019705971523581957, "loss": 0.20861467719078064, "mean_token_accuracy": 0.9210799187421799, "num_tokens": 17911872.0, "step": 1452 }, { "entropy": 1.4546839594841003, "epoch": 0.7651395471300685, "grad_norm": 0.30617302656173706, "learning_rate": 0.00019705415339434212, "loss": 0.21506822109222412, "mean_token_accuracy": 0.9104336351156235, "num_tokens": 17924208.0, "step": 1453 }, { "entropy": 1.46762016415596, "epoch": 0.765666140073723, "grad_norm": 0.33141979575157166, "learning_rate": 0.000197048586384967, "loss": 0.23449833691120148, "mean_token_accuracy": 0.909214973449707, "num_tokens": 17936544.0, "step": 1454 }, { "entropy": 1.3759736120700836, "epoch": 0.7661927330173776, "grad_norm": 0.28817251324653625, "learning_rate": 0.00019704301420802467, "loss": 0.2031758576631546, "mean_token_accuracy": 0.9166503101587296, "num_tokens": 17948880.0, "step": 1455 }, { "entropy": 1.4604673385620117, "epoch": 0.7667193259610321, "grad_norm": 0.28507548570632935, "learning_rate": 0.0001970374368638459, "loss": 0.21905720233917236, "mean_token_accuracy": 0.9121448248624802, "num_tokens": 17961216.0, "step": 1456 }, { "entropy": 1.4368546605110168, "epoch": 0.7672459189046866, "grad_norm": 0.3244202435016632, "learning_rate": 0.00019703185435276179, "loss": 0.21986661851406097, "mean_token_accuracy": 0.9103575944900513, "num_tokens": 17973552.0, "step": 1457 }, { "entropy": 1.4183049201965332, "epoch": 0.7677725118483413, "grad_norm": 0.3483145833015442, "learning_rate": 0.00019702626667510376, "loss": 0.2258511334657669, "mean_token_accuracy": 0.9121571332216263, "num_tokens": 17985888.0, "step": 1458 }, { "entropy": 1.4387763142585754, "epoch": 0.7682991047919958, "grad_norm": 0.30231183767318726, "learning_rate": 0.00019702067383120352, "loss": 0.20727157592773438, "mean_token_accuracy": 0.9170671254396439, "num_tokens": 17998224.0, "step": 1459 }, { "entropy": 1.3991906344890594, "epoch": 0.7688256977356503, "grad_norm": 0.3081129789352417, "learning_rate": 0.00019701507582139304, "loss": 0.2180902510881424, "mean_token_accuracy": 0.916274681687355, "num_tokens": 18010560.0, "step": 1460 }, { "entropy": 1.4099707305431366, "epoch": 0.7693522906793049, "grad_norm": 0.27477627992630005, "learning_rate": 0.00019700947264600466, "loss": 0.19322465360164642, "mean_token_accuracy": 0.9191512167453766, "num_tokens": 18022896.0, "step": 1461 }, { "entropy": 1.4558897018432617, "epoch": 0.7698788836229594, "grad_norm": 0.2677430212497711, "learning_rate": 0.00019700386430537105, "loss": 0.21823228895664215, "mean_token_accuracy": 0.9123710244894028, "num_tokens": 18035232.0, "step": 1462 }, { "entropy": 1.4174329936504364, "epoch": 0.770405476566614, "grad_norm": 0.2713851034641266, "learning_rate": 0.00019699825079982512, "loss": 0.19724853336811066, "mean_token_accuracy": 0.9200254529714584, "num_tokens": 18047568.0, "step": 1463 }, { "entropy": 1.4575957953929901, "epoch": 0.7709320695102686, "grad_norm": 0.30220046639442444, "learning_rate": 0.00019699263212970007, "loss": 0.20754371583461761, "mean_token_accuracy": 0.9198533892631531, "num_tokens": 18059904.0, "step": 1464 }, { "entropy": 1.450849562883377, "epoch": 0.7714586624539231, "grad_norm": 0.28346338868141174, "learning_rate": 0.0001969870082953295, "loss": 0.19828161597251892, "mean_token_accuracy": 0.9172644019126892, "num_tokens": 18072240.0, "step": 1465 }, { "entropy": 1.4658414423465729, "epoch": 0.7719852553975777, "grad_norm": 0.3004949986934662, "learning_rate": 0.00019698137929704724, "loss": 0.20767343044281006, "mean_token_accuracy": 0.9210254102945328, "num_tokens": 18084576.0, "step": 1466 }, { "entropy": 1.4050607681274414, "epoch": 0.7725118483412322, "grad_norm": 0.2896452248096466, "learning_rate": 0.00019697574513518747, "loss": 0.20795601606369019, "mean_token_accuracy": 0.914929062128067, "num_tokens": 18096912.0, "step": 1467 }, { "entropy": 1.4351738393306732, "epoch": 0.7730384412848867, "grad_norm": 0.34425756335258484, "learning_rate": 0.00019697010581008463, "loss": 0.21601206064224243, "mean_token_accuracy": 0.9149073958396912, "num_tokens": 18109248.0, "step": 1468 }, { "entropy": 1.3905524611473083, "epoch": 0.7735650342285414, "grad_norm": 0.3009505271911621, "learning_rate": 0.00019696446132207353, "loss": 0.19988638162612915, "mean_token_accuracy": 0.9213133901357651, "num_tokens": 18121584.0, "step": 1469 }, { "entropy": 1.4411927461624146, "epoch": 0.7740916271721959, "grad_norm": 0.3239229619503021, "learning_rate": 0.0001969588116714892, "loss": 0.2117571234703064, "mean_token_accuracy": 0.9106622785329819, "num_tokens": 18133920.0, "step": 1470 }, { "entropy": 1.4064708650112152, "epoch": 0.7746182201158505, "grad_norm": 0.3362599015235901, "learning_rate": 0.00019695315685866707, "loss": 0.23721855878829956, "mean_token_accuracy": 0.9070688337087631, "num_tokens": 18146256.0, "step": 1471 }, { "entropy": 1.4237781167030334, "epoch": 0.775144813059505, "grad_norm": 0.3095615804195404, "learning_rate": 0.00019694749688394281, "loss": 0.2411169707775116, "mean_token_accuracy": 0.9083186686038971, "num_tokens": 18158592.0, "step": 1472 }, { "entropy": 1.3879849016666412, "epoch": 0.7756714060031595, "grad_norm": 0.28509050607681274, "learning_rate": 0.00019694183174765245, "loss": 0.22019074857234955, "mean_token_accuracy": 0.911543145775795, "num_tokens": 18170928.0, "step": 1473 }, { "entropy": 1.3992516100406647, "epoch": 0.7761979989468141, "grad_norm": 0.3135905861854553, "learning_rate": 0.00019693616145013227, "loss": 0.2088148593902588, "mean_token_accuracy": 0.9130579680204391, "num_tokens": 18183264.0, "step": 1474 }, { "entropy": 1.3637616336345673, "epoch": 0.7767245918904687, "grad_norm": 0.26418524980545044, "learning_rate": 0.00019693048599171887, "loss": 0.20479831099510193, "mean_token_accuracy": 0.916004553437233, "num_tokens": 18195600.0, "step": 1475 }, { "entropy": 1.4390030205249786, "epoch": 0.7772511848341233, "grad_norm": 0.290937215089798, "learning_rate": 0.0001969248053727492, "loss": 0.21481530368328094, "mean_token_accuracy": 0.9162030220031738, "num_tokens": 18207936.0, "step": 1476 }, { "entropy": 1.4204131364822388, "epoch": 0.7777777777777778, "grad_norm": 0.3285602331161499, "learning_rate": 0.00019691911959356044, "loss": 0.19588018953800201, "mean_token_accuracy": 0.9232761710882187, "num_tokens": 18220272.0, "step": 1477 }, { "entropy": 1.4693542420864105, "epoch": 0.7783043707214323, "grad_norm": 0.3064950704574585, "learning_rate": 0.0001969134286544902, "loss": 0.20760740339756012, "mean_token_accuracy": 0.9132848978042603, "num_tokens": 18232608.0, "step": 1478 }, { "entropy": 1.3828904628753662, "epoch": 0.7788309636650869, "grad_norm": 0.3061995506286621, "learning_rate": 0.00019690773255587625, "loss": 0.2265746295452118, "mean_token_accuracy": 0.9108180850744247, "num_tokens": 18244944.0, "step": 1479 }, { "entropy": 1.3849403858184814, "epoch": 0.7793575566087414, "grad_norm": 0.3251616656780243, "learning_rate": 0.00019690203129805672, "loss": 0.2233261615037918, "mean_token_accuracy": 0.9125779420137405, "num_tokens": 18257280.0, "step": 1480 }, { "entropy": 1.3147023022174835, "epoch": 0.779884149552396, "grad_norm": 0.31116747856140137, "learning_rate": 0.00019689632488137016, "loss": 0.24036768078804016, "mean_token_accuracy": 0.906961664557457, "num_tokens": 18269616.0, "step": 1481 }, { "entropy": 1.3186087906360626, "epoch": 0.7804107424960506, "grad_norm": 0.30934205651283264, "learning_rate": 0.0001968906133061552, "loss": 0.21348203718662262, "mean_token_accuracy": 0.9163684844970703, "num_tokens": 18281952.0, "step": 1482 }, { "entropy": 1.3171938359737396, "epoch": 0.7809373354397051, "grad_norm": 0.3076079487800598, "learning_rate": 0.00019688489657275103, "loss": 0.22806760668754578, "mean_token_accuracy": 0.9050341248512268, "num_tokens": 18294288.0, "step": 1483 }, { "entropy": 1.331948697566986, "epoch": 0.7814639283833597, "grad_norm": 0.3263510465621948, "learning_rate": 0.0001968791746814969, "loss": 0.2278282344341278, "mean_token_accuracy": 0.9075683802366257, "num_tokens": 18306624.0, "step": 1484 }, { "entropy": 1.3975997269153595, "epoch": 0.7819905213270142, "grad_norm": 0.37345680594444275, "learning_rate": 0.00019687344763273255, "loss": 0.22596792876720428, "mean_token_accuracy": 0.913162499666214, "num_tokens": 18318960.0, "step": 1485 }, { "entropy": 1.3315426707267761, "epoch": 0.7825171142706687, "grad_norm": 0.28193777799606323, "learning_rate": 0.00019686771542679797, "loss": 0.1983056217432022, "mean_token_accuracy": 0.9222036451101303, "num_tokens": 18331296.0, "step": 1486 }, { "entropy": 1.4003748893737793, "epoch": 0.7830437072143234, "grad_norm": 0.30775102972984314, "learning_rate": 0.00019686197806403343, "loss": 0.22822785377502441, "mean_token_accuracy": 0.9109926074743271, "num_tokens": 18343632.0, "step": 1487 }, { "entropy": 1.3931090831756592, "epoch": 0.7835703001579779, "grad_norm": 0.2824244201183319, "learning_rate": 0.0001968562355447795, "loss": 0.20619836449623108, "mean_token_accuracy": 0.9165951460599899, "num_tokens": 18355968.0, "step": 1488 }, { "entropy": 1.3029468953609467, "epoch": 0.7840968931016324, "grad_norm": 0.26663464307785034, "learning_rate": 0.00019685048786937713, "loss": 0.2070493847131729, "mean_token_accuracy": 0.91603122651577, "num_tokens": 18368304.0, "step": 1489 }, { "entropy": 1.4118830561637878, "epoch": 0.784623486045287, "grad_norm": 0.2948478162288666, "learning_rate": 0.00019684473503816746, "loss": 0.2121935933828354, "mean_token_accuracy": 0.9169209152460098, "num_tokens": 18380640.0, "step": 1490 }, { "entropy": 1.5040743947029114, "epoch": 0.7851500789889415, "grad_norm": 0.33927392959594727, "learning_rate": 0.00019683897705149208, "loss": 0.23608259856700897, "mean_token_accuracy": 0.9112606197595596, "num_tokens": 18392976.0, "step": 1491 }, { "entropy": 1.388082355260849, "epoch": 0.785676671932596, "grad_norm": 0.2748982012271881, "learning_rate": 0.0001968332139096927, "loss": 0.21956929564476013, "mean_token_accuracy": 0.9111993908882141, "num_tokens": 18405312.0, "step": 1492 }, { "entropy": 1.419054538011551, "epoch": 0.7862032648762507, "grad_norm": 0.2975718379020691, "learning_rate": 0.00019682744561311163, "loss": 0.20622003078460693, "mean_token_accuracy": 0.91482774913311, "num_tokens": 18417648.0, "step": 1493 }, { "entropy": 1.3681580722332, "epoch": 0.7867298578199052, "grad_norm": 0.30167657136917114, "learning_rate": 0.00019682167216209106, "loss": 0.22527143359184265, "mean_token_accuracy": 0.9118600189685822, "num_tokens": 18429984.0, "step": 1494 }, { "entropy": 1.3992347717285156, "epoch": 0.7872564507635598, "grad_norm": 0.3023481070995331, "learning_rate": 0.00019681589355697394, "loss": 0.20631316304206848, "mean_token_accuracy": 0.9144344329833984, "num_tokens": 18442320.0, "step": 1495 }, { "entropy": 1.2978556156158447, "epoch": 0.7877830437072143, "grad_norm": 0.275492399930954, "learning_rate": 0.00019681010979810318, "loss": 0.2021515965461731, "mean_token_accuracy": 0.9172556847333908, "num_tokens": 18454656.0, "step": 1496 }, { "entropy": 1.2966987490653992, "epoch": 0.7883096366508688, "grad_norm": 0.3461536169052124, "learning_rate": 0.00019680432088582217, "loss": 0.22693704068660736, "mean_token_accuracy": 0.9091721177101135, "num_tokens": 18466992.0, "step": 1497 }, { "entropy": 1.304772973060608, "epoch": 0.7888362295945235, "grad_norm": 0.32779547572135925, "learning_rate": 0.00019679852682047457, "loss": 0.21427524089813232, "mean_token_accuracy": 0.9151846766471863, "num_tokens": 18479328.0, "step": 1498 }, { "entropy": 1.2882267534732819, "epoch": 0.789362822538178, "grad_norm": 0.3116947114467621, "learning_rate": 0.00019679272760240435, "loss": 0.20784853398799896, "mean_token_accuracy": 0.9149093627929688, "num_tokens": 18491664.0, "step": 1499 }, { "entropy": 1.263739138841629, "epoch": 0.7898894154818326, "grad_norm": 0.443194717168808, "learning_rate": 0.0001967869232319557, "loss": 0.23977030813694, "mean_token_accuracy": 0.9084160029888153, "num_tokens": 18504000.0, "step": 1500 }, { "entropy": 1.2093487679958344, "epoch": 0.7904160084254871, "grad_norm": 0.29420503973960876, "learning_rate": 0.0001967811137094733, "loss": 0.22335118055343628, "mean_token_accuracy": 0.909618929028511, "num_tokens": 18516336.0, "step": 1501 }, { "entropy": 1.271395206451416, "epoch": 0.7909426013691416, "grad_norm": 0.5013836026191711, "learning_rate": 0.00019677529903530197, "loss": 0.2110762596130371, "mean_token_accuracy": 0.9183898121118546, "num_tokens": 18528672.0, "step": 1502 }, { "entropy": 1.2578312754631042, "epoch": 0.7914691943127962, "grad_norm": 0.37272414565086365, "learning_rate": 0.0001967694792097869, "loss": 0.22164121270179749, "mean_token_accuracy": 0.9116562008857727, "num_tokens": 18541008.0, "step": 1503 }, { "entropy": 1.2144514918327332, "epoch": 0.7919957872564508, "grad_norm": 0.3145962059497833, "learning_rate": 0.0001967636542332736, "loss": 0.22305795550346375, "mean_token_accuracy": 0.9156023114919662, "num_tokens": 18553344.0, "step": 1504 }, { "entropy": 1.2401383221149445, "epoch": 0.7925223802001053, "grad_norm": 0.2835533022880554, "learning_rate": 0.00019675782410610778, "loss": 0.19279327988624573, "mean_token_accuracy": 0.926255002617836, "num_tokens": 18565680.0, "step": 1505 }, { "entropy": 1.2049389481544495, "epoch": 0.7930489731437599, "grad_norm": 0.2632310092449188, "learning_rate": 0.00019675198882863567, "loss": 0.2010316103696823, "mean_token_accuracy": 0.91452956199646, "num_tokens": 18578016.0, "step": 1506 }, { "entropy": 1.249726414680481, "epoch": 0.7935755660874144, "grad_norm": 0.30521342158317566, "learning_rate": 0.0001967461484012036, "loss": 0.23277787864208221, "mean_token_accuracy": 0.9076357632875443, "num_tokens": 18590352.0, "step": 1507 }, { "entropy": 1.1978009939193726, "epoch": 0.794102159031069, "grad_norm": 0.2853034734725952, "learning_rate": 0.00019674030282415826, "loss": 0.2127259522676468, "mean_token_accuracy": 0.9155232310295105, "num_tokens": 18602688.0, "step": 1508 }, { "entropy": 1.25815749168396, "epoch": 0.7946287519747235, "grad_norm": 0.28645238280296326, "learning_rate": 0.00019673445209784677, "loss": 0.22002597153186798, "mean_token_accuracy": 0.9130334705114365, "num_tokens": 18615024.0, "step": 1509 }, { "entropy": 1.3180667161941528, "epoch": 0.7951553449183781, "grad_norm": 0.2906380891799927, "learning_rate": 0.00019672859622261633, "loss": 0.22877947986125946, "mean_token_accuracy": 0.912013441324234, "num_tokens": 18627360.0, "step": 1510 }, { "entropy": 1.2853264808654785, "epoch": 0.7956819378620327, "grad_norm": 0.28856080770492554, "learning_rate": 0.00019672273519881465, "loss": 0.2222394347190857, "mean_token_accuracy": 0.9078328162431717, "num_tokens": 18639696.0, "step": 1511 }, { "entropy": 1.2696054577827454, "epoch": 0.7962085308056872, "grad_norm": 0.30683693289756775, "learning_rate": 0.0001967168690267896, "loss": 0.22363853454589844, "mean_token_accuracy": 0.9149999022483826, "num_tokens": 18652032.0, "step": 1512 }, { "entropy": 1.272040843963623, "epoch": 0.7967351237493417, "grad_norm": 0.3236723840236664, "learning_rate": 0.0001967109977068895, "loss": 0.21476420760154724, "mean_token_accuracy": 0.9179616123437881, "num_tokens": 18664368.0, "step": 1513 }, { "entropy": 1.260970801115036, "epoch": 0.7972617166929963, "grad_norm": 0.30413469672203064, "learning_rate": 0.00019670512123946284, "loss": 0.22492626309394836, "mean_token_accuracy": 0.9107203483581543, "num_tokens": 18676704.0, "step": 1514 }, { "entropy": 1.2300290167331696, "epoch": 0.7977883096366508, "grad_norm": 0.2895817458629608, "learning_rate": 0.00019669923962485847, "loss": 0.2138168066740036, "mean_token_accuracy": 0.9164409637451172, "num_tokens": 18689040.0, "step": 1515 }, { "entropy": 1.2246987521648407, "epoch": 0.7983149025803055, "grad_norm": 0.30868765711784363, "learning_rate": 0.0001966933528634256, "loss": 0.2062627673149109, "mean_token_accuracy": 0.9158836156129837, "num_tokens": 18701376.0, "step": 1516 }, { "entropy": 1.24353489279747, "epoch": 0.79884149552396, "grad_norm": 0.2896019518375397, "learning_rate": 0.00019668746095551364, "loss": 0.2127014845609665, "mean_token_accuracy": 0.9154282063245773, "num_tokens": 18713712.0, "step": 1517 }, { "entropy": 1.219551146030426, "epoch": 0.7993680884676145, "grad_norm": 0.5301105380058289, "learning_rate": 0.0001966815639014724, "loss": 0.20765289664268494, "mean_token_accuracy": 0.9193731993436813, "num_tokens": 18726048.0, "step": 1518 }, { "entropy": 1.2230626046657562, "epoch": 0.7998946814112691, "grad_norm": 0.2891480624675751, "learning_rate": 0.00019667566170165194, "loss": 0.20567816495895386, "mean_token_accuracy": 0.9149514883756638, "num_tokens": 18738384.0, "step": 1519 }, { "entropy": 1.1955215632915497, "epoch": 0.8004212743549236, "grad_norm": 0.3952074646949768, "learning_rate": 0.00019666975435640258, "loss": 0.23236501216888428, "mean_token_accuracy": 0.910706028342247, "num_tokens": 18750720.0, "step": 1520 }, { "entropy": 1.1208319664001465, "epoch": 0.8009478672985783, "grad_norm": 0.3569393455982208, "learning_rate": 0.00019666384186607506, "loss": 0.2112501859664917, "mean_token_accuracy": 0.9126569777727127, "num_tokens": 18763056.0, "step": 1521 }, { "entropy": 1.1377290189266205, "epoch": 0.8014744602422328, "grad_norm": 0.2929931879043579, "learning_rate": 0.00019665792423102037, "loss": 0.22051754593849182, "mean_token_accuracy": 0.9091715216636658, "num_tokens": 18775392.0, "step": 1522 }, { "entropy": 1.1271924078464508, "epoch": 0.8020010531858873, "grad_norm": 0.3465351164340973, "learning_rate": 0.0001966520014515898, "loss": 0.22917094826698303, "mean_token_accuracy": 0.9075794517993927, "num_tokens": 18787728.0, "step": 1523 }, { "entropy": 1.1986294984817505, "epoch": 0.8025276461295419, "grad_norm": 0.32447630167007446, "learning_rate": 0.00019664607352813494, "loss": 0.23350387811660767, "mean_token_accuracy": 0.9076796770095825, "num_tokens": 18800064.0, "step": 1524 }, { "entropy": 1.1514316499233246, "epoch": 0.8030542390731964, "grad_norm": 0.3304944932460785, "learning_rate": 0.00019664014046100775, "loss": 0.21476618945598602, "mean_token_accuracy": 0.913004919886589, "num_tokens": 18812400.0, "step": 1525 }, { "entropy": 1.1340425908565521, "epoch": 0.8035808320168509, "grad_norm": 0.5441511869430542, "learning_rate": 0.00019663420225056035, "loss": 0.22214046120643616, "mean_token_accuracy": 0.9116765111684799, "num_tokens": 18824736.0, "step": 1526 }, { "entropy": 1.0562350451946259, "epoch": 0.8041074249605056, "grad_norm": 0.3077342212200165, "learning_rate": 0.00019662825889714533, "loss": 0.21319684386253357, "mean_token_accuracy": 0.918745294213295, "num_tokens": 18837072.0, "step": 1527 }, { "entropy": 1.0274389684200287, "epoch": 0.8046340179041601, "grad_norm": 0.3354491889476776, "learning_rate": 0.0001966223104011155, "loss": 0.2296486645936966, "mean_token_accuracy": 0.9057023078203201, "num_tokens": 18849408.0, "step": 1528 }, { "entropy": 1.0815512537956238, "epoch": 0.8051606108478147, "grad_norm": 0.3144749402999878, "learning_rate": 0.00019661635676282394, "loss": 0.229911670088768, "mean_token_accuracy": 0.9100077450275421, "num_tokens": 18861744.0, "step": 1529 }, { "entropy": 1.0930194556713104, "epoch": 0.8056872037914692, "grad_norm": 0.300818532705307, "learning_rate": 0.00019661039798262415, "loss": 0.20994170010089874, "mean_token_accuracy": 0.9187563508749008, "num_tokens": 18874080.0, "step": 1530 }, { "entropy": 1.0869486331939697, "epoch": 0.8062137967351237, "grad_norm": 0.28593873977661133, "learning_rate": 0.00019660443406086984, "loss": 0.20231741666793823, "mean_token_accuracy": 0.918257012963295, "num_tokens": 18886416.0, "step": 1531 }, { "entropy": 1.0835871398448944, "epoch": 0.8067403896787783, "grad_norm": 0.7419033050537109, "learning_rate": 0.000196598464997915, "loss": 0.2157197892665863, "mean_token_accuracy": 0.9135694205760956, "num_tokens": 18898752.0, "step": 1532 }, { "entropy": 1.1274356842041016, "epoch": 0.8072669826224329, "grad_norm": 0.31080278754234314, "learning_rate": 0.00019659249079411405, "loss": 0.22466787695884705, "mean_token_accuracy": 0.9107064604759216, "num_tokens": 18911088.0, "step": 1533 }, { "entropy": 1.0774615406990051, "epoch": 0.8077935755660874, "grad_norm": 0.28806376457214355, "learning_rate": 0.00019658651144982163, "loss": 0.2336619794368744, "mean_token_accuracy": 0.9125310033559799, "num_tokens": 18923424.0, "step": 1534 }, { "entropy": 1.0493130534887314, "epoch": 0.808320168509742, "grad_norm": 0.2861652672290802, "learning_rate": 0.0001965805269653927, "loss": 0.20115122199058533, "mean_token_accuracy": 0.919718474149704, "num_tokens": 18935760.0, "step": 1535 }, { "entropy": 1.0706775784492493, "epoch": 0.8088467614533965, "grad_norm": 0.29678940773010254, "learning_rate": 0.0001965745373411825, "loss": 0.21643559634685516, "mean_token_accuracy": 0.9111261665821075, "num_tokens": 18948096.0, "step": 1536 }, { "entropy": 1.0705525279045105, "epoch": 0.809373354397051, "grad_norm": 0.3051356077194214, "learning_rate": 0.0001965685425775466, "loss": 0.2151341289281845, "mean_token_accuracy": 0.9130971729755402, "num_tokens": 18960432.0, "step": 1537 }, { "entropy": 1.0797742903232574, "epoch": 0.8098999473407056, "grad_norm": 0.29696813225746155, "learning_rate": 0.0001965625426748409, "loss": 0.22983068227767944, "mean_token_accuracy": 0.9089944660663605, "num_tokens": 18972768.0, "step": 1538 }, { "entropy": 1.0420788824558258, "epoch": 0.8104265402843602, "grad_norm": 0.29141098260879517, "learning_rate": 0.00019655653763342155, "loss": 0.20703990757465363, "mean_token_accuracy": 0.9171910136938095, "num_tokens": 18985104.0, "step": 1539 }, { "entropy": 1.0945038497447968, "epoch": 0.8109531332280148, "grad_norm": 0.30959945917129517, "learning_rate": 0.00019655052745364509, "loss": 0.24617335200309753, "mean_token_accuracy": 0.9053667187690735, "num_tokens": 18997440.0, "step": 1540 }, { "entropy": 1.0674882233142853, "epoch": 0.8114797261716693, "grad_norm": 0.29151442646980286, "learning_rate": 0.00019654451213586824, "loss": 0.202132448554039, "mean_token_accuracy": 0.9202746897935867, "num_tokens": 19009776.0, "step": 1541 }, { "entropy": 1.1482883095741272, "epoch": 0.8120063191153238, "grad_norm": 0.3008717894554138, "learning_rate": 0.00019653849168044815, "loss": 0.2195252776145935, "mean_token_accuracy": 0.9127016216516495, "num_tokens": 19022112.0, "step": 1542 }, { "entropy": 1.0573867559432983, "epoch": 0.8125329120589784, "grad_norm": 0.2779742479324341, "learning_rate": 0.00019653246608774215, "loss": 0.20425541698932648, "mean_token_accuracy": 0.9176970571279526, "num_tokens": 19034448.0, "step": 1543 }, { "entropy": 1.1284627318382263, "epoch": 0.8130595050026329, "grad_norm": 0.3272855281829834, "learning_rate": 0.00019652643535810803, "loss": 0.2418060004711151, "mean_token_accuracy": 0.9060062915086746, "num_tokens": 19046784.0, "step": 1544 }, { "entropy": 1.160320371389389, "epoch": 0.8135860979462876, "grad_norm": 0.28571900725364685, "learning_rate": 0.00019652039949190372, "loss": 0.19945061206817627, "mean_token_accuracy": 0.9213592410087585, "num_tokens": 19059120.0, "step": 1545 }, { "entropy": 1.0708126425743103, "epoch": 0.8141126908899421, "grad_norm": 0.28214171528816223, "learning_rate": 0.00019651435848948762, "loss": 0.21407712996006012, "mean_token_accuracy": 0.9169910848140717, "num_tokens": 19071456.0, "step": 1546 }, { "entropy": 1.071442037820816, "epoch": 0.8146392838335966, "grad_norm": 0.27851834893226624, "learning_rate": 0.00019650831235121824, "loss": 0.20925593376159668, "mean_token_accuracy": 0.9159252196550369, "num_tokens": 19083792.0, "step": 1547 }, { "entropy": 1.1155974566936493, "epoch": 0.8151658767772512, "grad_norm": 0.3253529369831085, "learning_rate": 0.00019650226107745461, "loss": 0.21849502623081207, "mean_token_accuracy": 0.9110303372144699, "num_tokens": 19096128.0, "step": 1548 }, { "entropy": 1.0896004736423492, "epoch": 0.8156924697209057, "grad_norm": 0.28845205903053284, "learning_rate": 0.0001964962046685559, "loss": 0.22848929464817047, "mean_token_accuracy": 0.9086662530899048, "num_tokens": 19108464.0, "step": 1549 }, { "entropy": 1.0635098963975906, "epoch": 0.8162190626645603, "grad_norm": 0.3507218658924103, "learning_rate": 0.00019649014312488164, "loss": 0.22886288166046143, "mean_token_accuracy": 0.9107942432165146, "num_tokens": 19120800.0, "step": 1550 }, { "entropy": 1.0771049559116364, "epoch": 0.8167456556082149, "grad_norm": 0.3061995506286621, "learning_rate": 0.0001964840764467917, "loss": 0.22587770223617554, "mean_token_accuracy": 0.907668799161911, "num_tokens": 19133136.0, "step": 1551 }, { "entropy": 1.0604461431503296, "epoch": 0.8172722485518694, "grad_norm": 0.29044315218925476, "learning_rate": 0.00019647800463464622, "loss": 0.2082800567150116, "mean_token_accuracy": 0.9161125719547272, "num_tokens": 19145472.0, "step": 1552 }, { "entropy": 1.0522086769342422, "epoch": 0.817798841495524, "grad_norm": 0.301567405462265, "learning_rate": 0.0001964719276888056, "loss": 0.20523683726787567, "mean_token_accuracy": 0.9130432307720184, "num_tokens": 19157808.0, "step": 1553 }, { "entropy": 1.02540722489357, "epoch": 0.8183254344391785, "grad_norm": 0.29618892073631287, "learning_rate": 0.00019646584560963065, "loss": 0.22347863018512726, "mean_token_accuracy": 0.9131524860858917, "num_tokens": 19170144.0, "step": 1554 }, { "entropy": 1.0311861038208008, "epoch": 0.818852027382833, "grad_norm": 0.27861911058425903, "learning_rate": 0.00019645975839748244, "loss": 0.182900071144104, "mean_token_accuracy": 0.9252242147922516, "num_tokens": 19182480.0, "step": 1555 }, { "entropy": 1.0627757012844086, "epoch": 0.8193786203264877, "grad_norm": 0.3110608458518982, "learning_rate": 0.00019645366605272228, "loss": 0.23385684192180634, "mean_token_accuracy": 0.9053423404693604, "num_tokens": 19194816.0, "step": 1556 }, { "entropy": 1.0807601511478424, "epoch": 0.8199052132701422, "grad_norm": 0.31477105617523193, "learning_rate": 0.00019644756857571186, "loss": 0.22126808762550354, "mean_token_accuracy": 0.9116723388433456, "num_tokens": 19207152.0, "step": 1557 }, { "entropy": 1.079503744840622, "epoch": 0.8204318062137967, "grad_norm": 0.314552366733551, "learning_rate": 0.00019644146596681312, "loss": 0.22594426572322845, "mean_token_accuracy": 0.9112756550312042, "num_tokens": 19219488.0, "step": 1558 }, { "entropy": 1.0542688369750977, "epoch": 0.8209583991574513, "grad_norm": 0.30733972787857056, "learning_rate": 0.0001964353582263884, "loss": 0.22227591276168823, "mean_token_accuracy": 0.9121880233287811, "num_tokens": 19231824.0, "step": 1559 }, { "entropy": 1.0992242991924286, "epoch": 0.8214849921011058, "grad_norm": 0.29605984687805176, "learning_rate": 0.0001964292453548002, "loss": 0.22202306985855103, "mean_token_accuracy": 0.9160446226596832, "num_tokens": 19244160.0, "step": 1560 }, { "entropy": 1.1573190689086914, "epoch": 0.8220115850447604, "grad_norm": 0.3093453347682953, "learning_rate": 0.00019642312735241148, "loss": 0.22188301384449005, "mean_token_accuracy": 0.9117791652679443, "num_tokens": 19256496.0, "step": 1561 }, { "entropy": 1.0756475329399109, "epoch": 0.822538177988415, "grad_norm": 0.29175224900245667, "learning_rate": 0.00019641700421958543, "loss": 0.20454362034797668, "mean_token_accuracy": 0.9208622127771378, "num_tokens": 19268832.0, "step": 1562 }, { "entropy": 1.1309452950954437, "epoch": 0.8230647709320695, "grad_norm": 0.3055620789527893, "learning_rate": 0.00019641087595668547, "loss": 0.24093538522720337, "mean_token_accuracy": 0.9080805480480194, "num_tokens": 19281168.0, "step": 1563 }, { "entropy": 1.0666328370571136, "epoch": 0.8235913638757241, "grad_norm": 0.26273226737976074, "learning_rate": 0.00019640474256407545, "loss": 0.18816737830638885, "mean_token_accuracy": 0.9207744300365448, "num_tokens": 19293504.0, "step": 1564 }, { "entropy": 1.1276142299175262, "epoch": 0.8241179568193786, "grad_norm": 0.3050276041030884, "learning_rate": 0.0001963986040421195, "loss": 0.21849283576011658, "mean_token_accuracy": 0.9142372459173203, "num_tokens": 19305840.0, "step": 1565 }, { "entropy": 1.0887978076934814, "epoch": 0.8246445497630331, "grad_norm": 0.2735901176929474, "learning_rate": 0.00019639246039118198, "loss": 0.20344410836696625, "mean_token_accuracy": 0.9216662347316742, "num_tokens": 19318176.0, "step": 1566 }, { "entropy": 1.0880299508571625, "epoch": 0.8251711427066877, "grad_norm": 0.2992630898952484, "learning_rate": 0.00019638631161162761, "loss": 0.20155635476112366, "mean_token_accuracy": 0.9177606403827667, "num_tokens": 19330512.0, "step": 1567 }, { "entropy": 1.0990647375583649, "epoch": 0.8256977356503423, "grad_norm": 0.29473257064819336, "learning_rate": 0.00019638015770382142, "loss": 0.20519070327281952, "mean_token_accuracy": 0.9206506013870239, "num_tokens": 19342848.0, "step": 1568 }, { "entropy": 1.0590737760066986, "epoch": 0.8262243285939969, "grad_norm": 0.28194659948349, "learning_rate": 0.00019637399866812873, "loss": 0.20845578610897064, "mean_token_accuracy": 0.9180682003498077, "num_tokens": 19355184.0, "step": 1569 }, { "entropy": 1.1114600002765656, "epoch": 0.8267509215376514, "grad_norm": 0.3110455870628357, "learning_rate": 0.00019636783450491517, "loss": 0.2090432196855545, "mean_token_accuracy": 0.9182581901550293, "num_tokens": 19367520.0, "step": 1570 }, { "entropy": 1.159915953874588, "epoch": 0.8272775144813059, "grad_norm": 0.3254052400588989, "learning_rate": 0.00019636166521454668, "loss": 0.21491852402687073, "mean_token_accuracy": 0.9105751514434814, "num_tokens": 19379856.0, "step": 1571 }, { "entropy": 1.1465847194194794, "epoch": 0.8278041074249605, "grad_norm": 0.28690120577812195, "learning_rate": 0.00019635549079738946, "loss": 0.21204861998558044, "mean_token_accuracy": 0.9141225218772888, "num_tokens": 19392192.0, "step": 1572 }, { "entropy": 1.1238433420658112, "epoch": 0.8283307003686151, "grad_norm": 0.3004522919654846, "learning_rate": 0.0001963493112538101, "loss": 0.22797521948814392, "mean_token_accuracy": 0.9102497845888138, "num_tokens": 19404528.0, "step": 1573 }, { "entropy": 1.1517022848129272, "epoch": 0.8288572933122696, "grad_norm": 0.3072613477706909, "learning_rate": 0.00019634312658417538, "loss": 0.2027738243341446, "mean_token_accuracy": 0.9213471561670303, "num_tokens": 19416864.0, "step": 1574 }, { "entropy": 1.1321575045585632, "epoch": 0.8293838862559242, "grad_norm": 0.33203771710395813, "learning_rate": 0.0001963369367888525, "loss": 0.23440833389759064, "mean_token_accuracy": 0.9052640497684479, "num_tokens": 19429200.0, "step": 1575 }, { "entropy": 1.1507805287837982, "epoch": 0.8299104791995787, "grad_norm": 0.28893306851387024, "learning_rate": 0.00019633074186820886, "loss": 0.21041327714920044, "mean_token_accuracy": 0.9186779856681824, "num_tokens": 19441536.0, "step": 1576 }, { "entropy": 1.1217812597751617, "epoch": 0.8304370721432333, "grad_norm": 0.286567747592926, "learning_rate": 0.00019632454182261228, "loss": 0.20225471258163452, "mean_token_accuracy": 0.9235644489526749, "num_tokens": 19453872.0, "step": 1577 }, { "entropy": 1.1518227756023407, "epoch": 0.8309636650868878, "grad_norm": 0.30317631363868713, "learning_rate": 0.00019631833665243075, "loss": 0.22191138565540314, "mean_token_accuracy": 0.9106118381023407, "num_tokens": 19466208.0, "step": 1578 }, { "entropy": 1.164818674325943, "epoch": 0.8314902580305424, "grad_norm": 0.3264894187450409, "learning_rate": 0.0001963121263580327, "loss": 0.22096458077430725, "mean_token_accuracy": 0.9108817130327225, "num_tokens": 19478544.0, "step": 1579 }, { "entropy": 1.0784786641597748, "epoch": 0.832016850974197, "grad_norm": 0.2952364683151245, "learning_rate": 0.0001963059109397868, "loss": 0.2409459352493286, "mean_token_accuracy": 0.9058417230844498, "num_tokens": 19490880.0, "step": 1580 }, { "entropy": 1.0973447263240814, "epoch": 0.8325434439178515, "grad_norm": 0.2781769931316376, "learning_rate": 0.00019629969039806195, "loss": 0.2172403782606125, "mean_token_accuracy": 0.9110274314880371, "num_tokens": 19503216.0, "step": 1581 }, { "entropy": 1.1422053277492523, "epoch": 0.833070036861506, "grad_norm": 0.2971686124801636, "learning_rate": 0.0001962934647332275, "loss": 0.21011781692504883, "mean_token_accuracy": 0.9153971076011658, "num_tokens": 19515552.0, "step": 1582 }, { "entropy": 1.1796616911888123, "epoch": 0.8335966298051606, "grad_norm": 0.29507434368133545, "learning_rate": 0.000196287233945653, "loss": 0.19983485341072083, "mean_token_accuracy": 0.9158152490854263, "num_tokens": 19527888.0, "step": 1583 }, { "entropy": 1.1146294176578522, "epoch": 0.8341232227488151, "grad_norm": 0.275584876537323, "learning_rate": 0.00019628099803570837, "loss": 0.2035273015499115, "mean_token_accuracy": 0.9163656979799271, "num_tokens": 19540224.0, "step": 1584 }, { "entropy": 1.1470642983913422, "epoch": 0.8346498156924698, "grad_norm": 0.2765231430530548, "learning_rate": 0.00019627475700376374, "loss": 0.22747623920440674, "mean_token_accuracy": 0.9137639552354813, "num_tokens": 19552560.0, "step": 1585 }, { "entropy": 1.1012212336063385, "epoch": 0.8351764086361243, "grad_norm": 0.28456148505210876, "learning_rate": 0.00019626851085018964, "loss": 0.2105616182088852, "mean_token_accuracy": 0.9195501506328583, "num_tokens": 19564896.0, "step": 1586 }, { "entropy": 1.106357455253601, "epoch": 0.8357030015797788, "grad_norm": 0.32695838809013367, "learning_rate": 0.00019626225957535684, "loss": 0.22337135672569275, "mean_token_accuracy": 0.9134061336517334, "num_tokens": 19577232.0, "step": 1587 }, { "entropy": 1.169274091720581, "epoch": 0.8362295945234334, "grad_norm": 0.336927205324173, "learning_rate": 0.0001962560031796365, "loss": 0.2262648195028305, "mean_token_accuracy": 0.9084394127130508, "num_tokens": 19589568.0, "step": 1588 }, { "entropy": 1.1865193247795105, "epoch": 0.8367561874670879, "grad_norm": 0.3452165722846985, "learning_rate": 0.00019624974166339998, "loss": 0.24824325740337372, "mean_token_accuracy": 0.9022375047206879, "num_tokens": 19601904.0, "step": 1589 }, { "entropy": 1.1062462031841278, "epoch": 0.8372827804107424, "grad_norm": 0.3023000955581665, "learning_rate": 0.000196243475027019, "loss": 0.23354491591453552, "mean_token_accuracy": 0.9097914397716522, "num_tokens": 19614240.0, "step": 1590 }, { "entropy": 1.1293524503707886, "epoch": 0.8378093733543971, "grad_norm": 0.2942156195640564, "learning_rate": 0.00019623720327086557, "loss": 0.22122958302497864, "mean_token_accuracy": 0.9109482020139694, "num_tokens": 19626576.0, "step": 1591 }, { "entropy": 1.124775916337967, "epoch": 0.8383359662980516, "grad_norm": 0.315075546503067, "learning_rate": 0.00019623092639531198, "loss": 0.22557595372200012, "mean_token_accuracy": 0.9101526886224747, "num_tokens": 19638912.0, "step": 1592 }, { "entropy": 1.148577243089676, "epoch": 0.8388625592417062, "grad_norm": 0.43819931149482727, "learning_rate": 0.0001962246444007309, "loss": 0.22852541506290436, "mean_token_accuracy": 0.9057890176773071, "num_tokens": 19651248.0, "step": 1593 }, { "entropy": 1.14993816614151, "epoch": 0.8393891521853607, "grad_norm": 0.31310200691223145, "learning_rate": 0.00019621835728749525, "loss": 0.2385086715221405, "mean_token_accuracy": 0.9071990847587585, "num_tokens": 19663584.0, "step": 1594 }, { "entropy": 1.1644853949546814, "epoch": 0.8399157451290152, "grad_norm": 0.2970283031463623, "learning_rate": 0.00019621206505597823, "loss": 0.2200639396905899, "mean_token_accuracy": 0.9170584827661514, "num_tokens": 19675920.0, "step": 1595 }, { "entropy": 1.1328399777412415, "epoch": 0.8404423380726699, "grad_norm": 0.3323354125022888, "learning_rate": 0.0001962057677065534, "loss": 0.22121144831180573, "mean_token_accuracy": 0.9114271998405457, "num_tokens": 19688256.0, "step": 1596 }, { "entropy": 1.0829459726810455, "epoch": 0.8409689310163244, "grad_norm": 0.28420135378837585, "learning_rate": 0.0001961994652395946, "loss": 0.2405356764793396, "mean_token_accuracy": 0.9100402593612671, "num_tokens": 19700592.0, "step": 1597 }, { "entropy": 1.0924118757247925, "epoch": 0.841495523959979, "grad_norm": 0.25400787591934204, "learning_rate": 0.00019619315765547594, "loss": 0.18612799048423767, "mean_token_accuracy": 0.9215864688158035, "num_tokens": 19712928.0, "step": 1598 }, { "entropy": 1.1357889473438263, "epoch": 0.8420221169036335, "grad_norm": 0.2727976143360138, "learning_rate": 0.00019618684495457188, "loss": 0.22136437892913818, "mean_token_accuracy": 0.9126606434583664, "num_tokens": 19725264.0, "step": 1599 }, { "entropy": 1.0817617177963257, "epoch": 0.842548709847288, "grad_norm": 0.2677607238292694, "learning_rate": 0.0001961805271372572, "loss": 0.20533126592636108, "mean_token_accuracy": 0.9148357510566711, "num_tokens": 19737600.0, "step": 1600 }, { "entropy": 1.1030884683132172, "epoch": 0.8430753027909426, "grad_norm": 0.2927640378475189, "learning_rate": 0.0001961742042039069, "loss": 0.22252412140369415, "mean_token_accuracy": 0.9111676663160324, "num_tokens": 19749936.0, "step": 1601 }, { "entropy": 1.1529828608036041, "epoch": 0.8436018957345972, "grad_norm": 0.30727458000183105, "learning_rate": 0.00019616787615489635, "loss": 0.2029101848602295, "mean_token_accuracy": 0.9227928221225739, "num_tokens": 19762272.0, "step": 1602 }, { "entropy": 1.0316384136676788, "epoch": 0.8441284886782517, "grad_norm": 0.27791184186935425, "learning_rate": 0.00019616154299060122, "loss": 0.21758908033370972, "mean_token_accuracy": 0.9157789200544357, "num_tokens": 19774608.0, "step": 1603 }, { "entropy": 1.0185693204402924, "epoch": 0.8446550816219063, "grad_norm": 0.2891453504562378, "learning_rate": 0.00019615520471139749, "loss": 0.19542157649993896, "mean_token_accuracy": 0.9184477776288986, "num_tokens": 19786944.0, "step": 1604 }, { "entropy": 1.010437250137329, "epoch": 0.8451816745655608, "grad_norm": 0.29489409923553467, "learning_rate": 0.00019614886131766137, "loss": 0.2418351173400879, "mean_token_accuracy": 0.9019056260585785, "num_tokens": 19799280.0, "step": 1605 }, { "entropy": 1.0607281923294067, "epoch": 0.8457082675092154, "grad_norm": 0.2774660587310791, "learning_rate": 0.00019614251280976948, "loss": 0.1955130398273468, "mean_token_accuracy": 0.9208610653877258, "num_tokens": 19811616.0, "step": 1606 }, { "entropy": 1.0406393706798553, "epoch": 0.8462348604528699, "grad_norm": 0.3048405647277832, "learning_rate": 0.00019613615918809868, "loss": 0.24297615885734558, "mean_token_accuracy": 0.9006519466638565, "num_tokens": 19823952.0, "step": 1607 }, { "entropy": 0.9977871924638748, "epoch": 0.8467614533965245, "grad_norm": 0.29823529720306396, "learning_rate": 0.00019612980045302617, "loss": 0.22520115971565247, "mean_token_accuracy": 0.9101865142583847, "num_tokens": 19836288.0, "step": 1608 }, { "entropy": 0.9967030137777328, "epoch": 0.8472880463401791, "grad_norm": 0.30385443568229675, "learning_rate": 0.0001961234366049294, "loss": 0.2113213837146759, "mean_token_accuracy": 0.9132890105247498, "num_tokens": 19848624.0, "step": 1609 }, { "entropy": 0.9831344783306122, "epoch": 0.8478146392838336, "grad_norm": 0.2813466787338257, "learning_rate": 0.00019611706764418617, "loss": 0.20107880234718323, "mean_token_accuracy": 0.9161145985126495, "num_tokens": 19860960.0, "step": 1610 }, { "entropy": 1.0240805000066757, "epoch": 0.8483412322274881, "grad_norm": 0.3142811954021454, "learning_rate": 0.00019611069357117455, "loss": 0.20909224450588226, "mean_token_accuracy": 0.9144964218139648, "num_tokens": 19873296.0, "step": 1611 }, { "entropy": 0.9786220341920853, "epoch": 0.8488678251711427, "grad_norm": 0.2860144376754761, "learning_rate": 0.00019610431438627296, "loss": 0.20540790259838104, "mean_token_accuracy": 0.9215816557407379, "num_tokens": 19885632.0, "step": 1612 }, { "entropy": 1.0295808017253876, "epoch": 0.8493944181147972, "grad_norm": 0.2819706201553345, "learning_rate": 0.00019609793008986003, "loss": 0.2058688849210739, "mean_token_accuracy": 0.9158887714147568, "num_tokens": 19897968.0, "step": 1613 }, { "entropy": 1.0835894644260406, "epoch": 0.8499210110584519, "grad_norm": 0.2932409346103668, "learning_rate": 0.00019609154068231486, "loss": 0.2193165421485901, "mean_token_accuracy": 0.9130483567714691, "num_tokens": 19910304.0, "step": 1614 }, { "entropy": 1.0591089725494385, "epoch": 0.8504476040021064, "grad_norm": 0.3336801528930664, "learning_rate": 0.00019608514616401668, "loss": 0.2534202039241791, "mean_token_accuracy": 0.9020056575536728, "num_tokens": 19922640.0, "step": 1615 }, { "entropy": 1.0837358832359314, "epoch": 0.8509741969457609, "grad_norm": 0.2906700372695923, "learning_rate": 0.00019607874653534513, "loss": 0.21131698787212372, "mean_token_accuracy": 0.9210411906242371, "num_tokens": 19934976.0, "step": 1616 }, { "entropy": 1.0396023094654083, "epoch": 0.8515007898894155, "grad_norm": 0.29053011536598206, "learning_rate": 0.0001960723417966801, "loss": 0.21710500121116638, "mean_token_accuracy": 0.914475828409195, "num_tokens": 19947312.0, "step": 1617 }, { "entropy": 1.0233092904090881, "epoch": 0.85202738283307, "grad_norm": 0.26935815811157227, "learning_rate": 0.00019606593194840177, "loss": 0.22018460929393768, "mean_token_accuracy": 0.9134867042303085, "num_tokens": 19959648.0, "step": 1618 }, { "entropy": 1.0701540112495422, "epoch": 0.8525539757767245, "grad_norm": 0.28057801723480225, "learning_rate": 0.00019605951699089075, "loss": 0.21612004935741425, "mean_token_accuracy": 0.9129879325628281, "num_tokens": 19971984.0, "step": 1619 }, { "entropy": 1.012107402086258, "epoch": 0.8530805687203792, "grad_norm": 0.2693917155265808, "learning_rate": 0.00019605309692452774, "loss": 0.2114534080028534, "mean_token_accuracy": 0.9149720519781113, "num_tokens": 19984320.0, "step": 1620 }, { "entropy": 1.0413274019956589, "epoch": 0.8536071616640337, "grad_norm": 0.27927207946777344, "learning_rate": 0.00019604667174969394, "loss": 0.21135683357715607, "mean_token_accuracy": 0.9143811762332916, "num_tokens": 19996656.0, "step": 1621 }, { "entropy": 0.9798619896173477, "epoch": 0.8541337546076883, "grad_norm": 0.2772925794124603, "learning_rate": 0.00019604024146677079, "loss": 0.19996821880340576, "mean_token_accuracy": 0.9175093472003937, "num_tokens": 20008992.0, "step": 1622 }, { "entropy": 0.9713831841945648, "epoch": 0.8546603475513428, "grad_norm": 0.2909282445907593, "learning_rate": 0.00019603380607613994, "loss": 0.21484866738319397, "mean_token_accuracy": 0.9112430512905121, "num_tokens": 20021328.0, "step": 1623 }, { "entropy": 0.9760904163122177, "epoch": 0.8551869404949973, "grad_norm": 0.2880821228027344, "learning_rate": 0.0001960273655781835, "loss": 0.21467523276805878, "mean_token_accuracy": 0.9168452471494675, "num_tokens": 20033664.0, "step": 1624 }, { "entropy": 1.0048719644546509, "epoch": 0.855713533438652, "grad_norm": 0.3039538860321045, "learning_rate": 0.00019602091997328376, "loss": 0.21055804193019867, "mean_token_accuracy": 0.9170923382043839, "num_tokens": 20046000.0, "step": 1625 }, { "entropy": 0.95078045129776, "epoch": 0.8562401263823065, "grad_norm": 0.28427428007125854, "learning_rate": 0.00019601446926182335, "loss": 0.2352895438671112, "mean_token_accuracy": 0.9064240008592606, "num_tokens": 20058336.0, "step": 1626 }, { "entropy": 0.9472018629312515, "epoch": 0.856766719325961, "grad_norm": 0.2894728183746338, "learning_rate": 0.00019600801344418526, "loss": 0.2225104421377182, "mean_token_accuracy": 0.913215383887291, "num_tokens": 20070672.0, "step": 1627 }, { "entropy": 1.0047412514686584, "epoch": 0.8572933122696156, "grad_norm": 0.30747485160827637, "learning_rate": 0.00019600155252075268, "loss": 0.2196165919303894, "mean_token_accuracy": 0.9105159193277359, "num_tokens": 20083008.0, "step": 1628 }, { "entropy": 1.0216589123010635, "epoch": 0.8578199052132701, "grad_norm": 0.2717617452144623, "learning_rate": 0.0001959950864919092, "loss": 0.20522895455360413, "mean_token_accuracy": 0.9180753976106644, "num_tokens": 20095344.0, "step": 1629 }, { "entropy": 1.0321899056434631, "epoch": 0.8583464981569247, "grad_norm": 0.30837494134902954, "learning_rate": 0.00019598861535803863, "loss": 0.21629376709461212, "mean_token_accuracy": 0.9151955991983414, "num_tokens": 20107680.0, "step": 1630 }, { "entropy": 1.0596579015254974, "epoch": 0.8588730911005793, "grad_norm": 0.3152981996536255, "learning_rate": 0.00019598213911952515, "loss": 0.24829894304275513, "mean_token_accuracy": 0.9071104824542999, "num_tokens": 20120016.0, "step": 1631 }, { "entropy": 1.027356281876564, "epoch": 0.8593996840442338, "grad_norm": 0.2758905589580536, "learning_rate": 0.00019597565777675324, "loss": 0.20423409342765808, "mean_token_accuracy": 0.919173076748848, "num_tokens": 20132352.0, "step": 1632 }, { "entropy": 1.0339451730251312, "epoch": 0.8599262769878884, "grad_norm": 0.2790839672088623, "learning_rate": 0.0001959691713301076, "loss": 0.20338216423988342, "mean_token_accuracy": 0.916516900062561, "num_tokens": 20144688.0, "step": 1633 }, { "entropy": 1.0149255990982056, "epoch": 0.8604528699315429, "grad_norm": 0.2958633005619049, "learning_rate": 0.00019596267977997332, "loss": 0.22986331582069397, "mean_token_accuracy": 0.9077225029468536, "num_tokens": 20157024.0, "step": 1634 }, { "entropy": 0.9824042469263077, "epoch": 0.8609794628751974, "grad_norm": 0.2640792429447174, "learning_rate": 0.0001959561831267358, "loss": 0.20994797348976135, "mean_token_accuracy": 0.9186595976352692, "num_tokens": 20169360.0, "step": 1635 }, { "entropy": 0.9684455096721649, "epoch": 0.861506055818852, "grad_norm": 0.2797081768512726, "learning_rate": 0.00019594968137078068, "loss": 0.21638056635856628, "mean_token_accuracy": 0.9145815968513489, "num_tokens": 20181696.0, "step": 1636 }, { "entropy": 0.9729262888431549, "epoch": 0.8620326487625066, "grad_norm": 0.2565400004386902, "learning_rate": 0.0001959431745124939, "loss": 0.20372052490711212, "mean_token_accuracy": 0.9224633723497391, "num_tokens": 20194032.0, "step": 1637 }, { "entropy": 0.9809018820524216, "epoch": 0.8625592417061612, "grad_norm": 0.3174954354763031, "learning_rate": 0.0001959366625522618, "loss": 0.2331572026014328, "mean_token_accuracy": 0.9117663353681564, "num_tokens": 20206368.0, "step": 1638 }, { "entropy": 0.9628456979990005, "epoch": 0.8630858346498157, "grad_norm": 0.2894734740257263, "learning_rate": 0.0001959301454904709, "loss": 0.2223999798297882, "mean_token_accuracy": 0.9094413071870804, "num_tokens": 20218704.0, "step": 1639 }, { "entropy": 1.0126699656248093, "epoch": 0.8636124275934702, "grad_norm": 0.2930248975753784, "learning_rate": 0.0001959236233275081, "loss": 0.21124093234539032, "mean_token_accuracy": 0.9162924438714981, "num_tokens": 20231040.0, "step": 1640 }, { "entropy": 0.9787211865186691, "epoch": 0.8641390205371248, "grad_norm": 0.30070269107818604, "learning_rate": 0.00019591709606376059, "loss": 0.21121284365653992, "mean_token_accuracy": 0.9159329831600189, "num_tokens": 20243376.0, "step": 1641 }, { "entropy": 1.010118991136551, "epoch": 0.8646656134807793, "grad_norm": 0.28400495648384094, "learning_rate": 0.00019591056369961586, "loss": 0.21099403500556946, "mean_token_accuracy": 0.9190017580986023, "num_tokens": 20255712.0, "step": 1642 }, { "entropy": 0.9496536999940872, "epoch": 0.865192206424434, "grad_norm": 0.2675454914569855, "learning_rate": 0.00019590402623546167, "loss": 0.2049626260995865, "mean_token_accuracy": 0.9156690835952759, "num_tokens": 20268048.0, "step": 1643 }, { "entropy": 0.9466981887817383, "epoch": 0.8657187993680885, "grad_norm": 0.30046844482421875, "learning_rate": 0.00019589748367168612, "loss": 0.21190345287322998, "mean_token_accuracy": 0.9161060154438019, "num_tokens": 20280384.0, "step": 1644 }, { "entropy": 1.0232085585594177, "epoch": 0.866245392311743, "grad_norm": 0.3621319532394409, "learning_rate": 0.00019589093600867763, "loss": 0.2193715125322342, "mean_token_accuracy": 0.9074915945529938, "num_tokens": 20292720.0, "step": 1645 }, { "entropy": 0.993518516421318, "epoch": 0.8667719852553976, "grad_norm": 0.28956446051597595, "learning_rate": 0.00019588438324682488, "loss": 0.21250395476818085, "mean_token_accuracy": 0.9168424904346466, "num_tokens": 20305056.0, "step": 1646 }, { "entropy": 0.9817381650209427, "epoch": 0.8672985781990521, "grad_norm": 0.34931275248527527, "learning_rate": 0.00019587782538651687, "loss": 0.2343052327632904, "mean_token_accuracy": 0.9059536755084991, "num_tokens": 20317392.0, "step": 1647 }, { "entropy": 0.9840113967657089, "epoch": 0.8678251711427067, "grad_norm": 0.304169237613678, "learning_rate": 0.00019587126242814288, "loss": 0.20760950446128845, "mean_token_accuracy": 0.9196920245885849, "num_tokens": 20329728.0, "step": 1648 }, { "entropy": 0.99486044049263, "epoch": 0.8683517640863613, "grad_norm": 0.3464246094226837, "learning_rate": 0.00019586469437209256, "loss": 0.25210103392601013, "mean_token_accuracy": 0.9036094397306442, "num_tokens": 20342064.0, "step": 1649 }, { "entropy": 0.9775729477405548, "epoch": 0.8688783570300158, "grad_norm": 0.27859246730804443, "learning_rate": 0.00019585812121875577, "loss": 0.21410948038101196, "mean_token_accuracy": 0.9136857688426971, "num_tokens": 20354400.0, "step": 1650 }, { "entropy": 1.0246230065822601, "epoch": 0.8694049499736703, "grad_norm": 0.28361114859580994, "learning_rate": 0.00019585154296852277, "loss": 0.19681544601917267, "mean_token_accuracy": 0.9178670197725296, "num_tokens": 20366736.0, "step": 1651 }, { "entropy": 0.9918327033519745, "epoch": 0.8699315429173249, "grad_norm": 0.2778252065181732, "learning_rate": 0.00019584495962178403, "loss": 0.20562246441841125, "mean_token_accuracy": 0.9203788787126541, "num_tokens": 20379072.0, "step": 1652 }, { "entropy": 1.0197946578264236, "epoch": 0.8704581358609794, "grad_norm": 0.2764199674129486, "learning_rate": 0.0001958383711789304, "loss": 0.2005048245191574, "mean_token_accuracy": 0.9199100285768509, "num_tokens": 20391408.0, "step": 1653 }, { "entropy": 0.946838304400444, "epoch": 0.8709847288046341, "grad_norm": 0.318099707365036, "learning_rate": 0.00019583177764035295, "loss": 0.18645739555358887, "mean_token_accuracy": 0.9281531125307083, "num_tokens": 20403744.0, "step": 1654 }, { "entropy": 0.9969734102487564, "epoch": 0.8715113217482886, "grad_norm": 0.330425888299942, "learning_rate": 0.00019582517900644313, "loss": 0.2349887192249298, "mean_token_accuracy": 0.9082667678594589, "num_tokens": 20416080.0, "step": 1655 }, { "entropy": 0.9850341528654099, "epoch": 0.8720379146919431, "grad_norm": 0.30549484491348267, "learning_rate": 0.00019581857527759265, "loss": 0.22454282641410828, "mean_token_accuracy": 0.9096111208200455, "num_tokens": 20428416.0, "step": 1656 }, { "entropy": 0.9726726412773132, "epoch": 0.8725645076355977, "grad_norm": 0.26101022958755493, "learning_rate": 0.00019581196645419358, "loss": 0.18027372658252716, "mean_token_accuracy": 0.9280071556568146, "num_tokens": 20440752.0, "step": 1657 }, { "entropy": 1.045421838760376, "epoch": 0.8730911005792522, "grad_norm": 0.31144458055496216, "learning_rate": 0.0001958053525366382, "loss": 0.22132211923599243, "mean_token_accuracy": 0.9151443690061569, "num_tokens": 20453088.0, "step": 1658 }, { "entropy": 1.0683381259441376, "epoch": 0.8736176935229067, "grad_norm": 0.34451693296432495, "learning_rate": 0.0001957987335253191, "loss": 0.2497258186340332, "mean_token_accuracy": 0.9017534852027893, "num_tokens": 20465424.0, "step": 1659 }, { "entropy": 1.0424925982952118, "epoch": 0.8741442864665614, "grad_norm": 0.305476576089859, "learning_rate": 0.00019579210942062932, "loss": 0.21568341553211212, "mean_token_accuracy": 0.913795217871666, "num_tokens": 20477760.0, "step": 1660 }, { "entropy": 1.077263206243515, "epoch": 0.8746708794102159, "grad_norm": 0.28648725152015686, "learning_rate": 0.00019578548022296203, "loss": 0.18887600302696228, "mean_token_accuracy": 0.9262412637472153, "num_tokens": 20490096.0, "step": 1661 }, { "entropy": 1.0266597121953964, "epoch": 0.8751974723538705, "grad_norm": 0.31522682309150696, "learning_rate": 0.00019577884593271076, "loss": 0.21652202308177948, "mean_token_accuracy": 0.907884418964386, "num_tokens": 20502432.0, "step": 1662 }, { "entropy": 1.0532887279987335, "epoch": 0.875724065297525, "grad_norm": 0.25786280632019043, "learning_rate": 0.00019577220655026938, "loss": 0.18014520406723022, "mean_token_accuracy": 0.9304206520318985, "num_tokens": 20514768.0, "step": 1663 }, { "entropy": 1.0302300453186035, "epoch": 0.8762506582411795, "grad_norm": 0.27384263277053833, "learning_rate": 0.000195765562076032, "loss": 0.19573301076889038, "mean_token_accuracy": 0.9229860901832581, "num_tokens": 20527104.0, "step": 1664 }, { "entropy": 1.0142173171043396, "epoch": 0.8767772511848341, "grad_norm": 0.2829652428627014, "learning_rate": 0.0001957589125103931, "loss": 0.19770190119743347, "mean_token_accuracy": 0.9212857335805893, "num_tokens": 20539440.0, "step": 1665 }, { "entropy": 1.030619502067566, "epoch": 0.8773038441284887, "grad_norm": 0.31889650225639343, "learning_rate": 0.0001957522578537474, "loss": 0.21395039558410645, "mean_token_accuracy": 0.9180440455675125, "num_tokens": 20551776.0, "step": 1666 }, { "entropy": 1.0783992409706116, "epoch": 0.8778304370721433, "grad_norm": 0.31347182393074036, "learning_rate": 0.00019574559810648994, "loss": 0.23077845573425293, "mean_token_accuracy": 0.9107988774776459, "num_tokens": 20564112.0, "step": 1667 }, { "entropy": 1.0769988298416138, "epoch": 0.8783570300157978, "grad_norm": 0.30257898569107056, "learning_rate": 0.00019573893326901607, "loss": 0.18793995678424835, "mean_token_accuracy": 0.9216104596853256, "num_tokens": 20576448.0, "step": 1668 }, { "entropy": 1.041060984134674, "epoch": 0.8788836229594523, "grad_norm": 0.29523128271102905, "learning_rate": 0.0001957322633417215, "loss": 0.20431648194789886, "mean_token_accuracy": 0.9192978888750076, "num_tokens": 20588784.0, "step": 1669 }, { "entropy": 1.0586915016174316, "epoch": 0.8794102159031069, "grad_norm": 0.29364022612571716, "learning_rate": 0.0001957255883250021, "loss": 0.22029076516628265, "mean_token_accuracy": 0.9125624299049377, "num_tokens": 20601120.0, "step": 1670 }, { "entropy": 1.0633411705493927, "epoch": 0.8799368088467614, "grad_norm": 0.2905363440513611, "learning_rate": 0.00019571890821925417, "loss": 0.19489197432994843, "mean_token_accuracy": 0.9242742508649826, "num_tokens": 20613456.0, "step": 1671 }, { "entropy": 1.135309487581253, "epoch": 0.880463401790416, "grad_norm": 0.3044449985027313, "learning_rate": 0.0001957122230248743, "loss": 0.19300708174705505, "mean_token_accuracy": 0.9245816022157669, "num_tokens": 20625792.0, "step": 1672 }, { "entropy": 1.0445529222488403, "epoch": 0.8809899947340706, "grad_norm": 0.28844696283340454, "learning_rate": 0.00019570553274225928, "loss": 0.20883029699325562, "mean_token_accuracy": 0.9140314012765884, "num_tokens": 20638128.0, "step": 1673 }, { "entropy": 1.1107747852802277, "epoch": 0.8815165876777251, "grad_norm": 0.32846325635910034, "learning_rate": 0.00019569883737180634, "loss": 0.24370679259300232, "mean_token_accuracy": 0.901743620634079, "num_tokens": 20650464.0, "step": 1674 }, { "entropy": 1.1209677755832672, "epoch": 0.8820431806213797, "grad_norm": 0.2889225482940674, "learning_rate": 0.0001956921369139129, "loss": 0.21621105074882507, "mean_token_accuracy": 0.9143183678388596, "num_tokens": 20662800.0, "step": 1675 }, { "entropy": 1.0856188535690308, "epoch": 0.8825697735650342, "grad_norm": 0.27882513403892517, "learning_rate": 0.00019568543136897675, "loss": 0.21793431043624878, "mean_token_accuracy": 0.9142801910638809, "num_tokens": 20675136.0, "step": 1676 }, { "entropy": 1.0983311533927917, "epoch": 0.8830963665086888, "grad_norm": 0.272402822971344, "learning_rate": 0.00019567872073739595, "loss": 0.20574277639389038, "mean_token_accuracy": 0.9181714653968811, "num_tokens": 20687472.0, "step": 1677 }, { "entropy": 1.0844581425189972, "epoch": 0.8836229594523434, "grad_norm": 0.27611178159713745, "learning_rate": 0.0001956720050195689, "loss": 0.2087741196155548, "mean_token_accuracy": 0.9139288067817688, "num_tokens": 20699808.0, "step": 1678 }, { "entropy": 1.12508624792099, "epoch": 0.8841495523959979, "grad_norm": 0.29753515124320984, "learning_rate": 0.0001956652842158942, "loss": 0.20983164012432098, "mean_token_accuracy": 0.9156063199043274, "num_tokens": 20712144.0, "step": 1679 }, { "entropy": 1.1237779259681702, "epoch": 0.8846761453396524, "grad_norm": 0.2853649854660034, "learning_rate": 0.00019565855832677086, "loss": 0.20436659455299377, "mean_token_accuracy": 0.9203456342220306, "num_tokens": 20724480.0, "step": 1680 }, { "entropy": 1.1044580936431885, "epoch": 0.885202738283307, "grad_norm": 0.2854003608226776, "learning_rate": 0.00019565182735259822, "loss": 0.2195129096508026, "mean_token_accuracy": 0.9125242233276367, "num_tokens": 20736816.0, "step": 1681 }, { "entropy": 1.084385484457016, "epoch": 0.8857293312269615, "grad_norm": 0.29433006048202515, "learning_rate": 0.0001956450912937758, "loss": 0.2089007943868637, "mean_token_accuracy": 0.9135125875473022, "num_tokens": 20749152.0, "step": 1682 }, { "entropy": 1.0872920453548431, "epoch": 0.8862559241706162, "grad_norm": 0.2716350555419922, "learning_rate": 0.00019563835015070348, "loss": 0.20034612715244293, "mean_token_accuracy": 0.9140070527791977, "num_tokens": 20761488.0, "step": 1683 }, { "entropy": 1.0698755085468292, "epoch": 0.8867825171142707, "grad_norm": 0.263379842042923, "learning_rate": 0.00019563160392378144, "loss": 0.2013968825340271, "mean_token_accuracy": 0.920297846198082, "num_tokens": 20773824.0, "step": 1684 }, { "entropy": 1.0688921809196472, "epoch": 0.8873091100579252, "grad_norm": 0.2941676676273346, "learning_rate": 0.00019562485261341017, "loss": 0.222881019115448, "mean_token_accuracy": 0.9110155403614044, "num_tokens": 20786160.0, "step": 1685 }, { "entropy": 1.0462908446788788, "epoch": 0.8878357030015798, "grad_norm": 0.2833232581615448, "learning_rate": 0.00019561809621999047, "loss": 0.2037080079317093, "mean_token_accuracy": 0.9212964028120041, "num_tokens": 20798496.0, "step": 1686 }, { "entropy": 1.0370090901851654, "epoch": 0.8883622959452343, "grad_norm": 0.299941748380661, "learning_rate": 0.0001956113347439234, "loss": 0.21904562413692474, "mean_token_accuracy": 0.9075719863176346, "num_tokens": 20810832.0, "step": 1687 }, { "entropy": 1.0448128283023834, "epoch": 0.8888888888888888, "grad_norm": 0.2878952920436859, "learning_rate": 0.0001956045681856104, "loss": 0.2038077563047409, "mean_token_accuracy": 0.9187713265419006, "num_tokens": 20823168.0, "step": 1688 }, { "entropy": 1.0190322399139404, "epoch": 0.8894154818325435, "grad_norm": 0.34769734740257263, "learning_rate": 0.0001955977965454531, "loss": 0.213621124625206, "mean_token_accuracy": 0.9181492775678635, "num_tokens": 20835504.0, "step": 1689 }, { "entropy": 1.0234404504299164, "epoch": 0.889942074776198, "grad_norm": 0.2829277813434601, "learning_rate": 0.00019559101982385356, "loss": 0.20716841518878937, "mean_token_accuracy": 0.9201241731643677, "num_tokens": 20847840.0, "step": 1690 }, { "entropy": 1.0015476644039154, "epoch": 0.8904686677198526, "grad_norm": 0.26036950945854187, "learning_rate": 0.000195584238021214, "loss": 0.18766967952251434, "mean_token_accuracy": 0.9250665605068207, "num_tokens": 20860176.0, "step": 1691 }, { "entropy": 1.032362923026085, "epoch": 0.8909952606635071, "grad_norm": 0.4818808138370514, "learning_rate": 0.00019557745113793704, "loss": 0.19411087036132812, "mean_token_accuracy": 0.921613797545433, "num_tokens": 20872512.0, "step": 1692 }, { "entropy": 0.9709571003913879, "epoch": 0.8915218536071616, "grad_norm": 0.2804003655910492, "learning_rate": 0.0001955706591744256, "loss": 0.21858839690685272, "mean_token_accuracy": 0.9120522737503052, "num_tokens": 20884848.0, "step": 1693 }, { "entropy": 1.0739005506038666, "epoch": 0.8920484465508162, "grad_norm": 0.2946876585483551, "learning_rate": 0.00019556386213108288, "loss": 0.19359217584133148, "mean_token_accuracy": 0.925596609711647, "num_tokens": 20897184.0, "step": 1694 }, { "entropy": 1.0181286334991455, "epoch": 0.8925750394944708, "grad_norm": 0.3197228014469147, "learning_rate": 0.00019555706000831235, "loss": 0.2175355702638626, "mean_token_accuracy": 0.9139997512102127, "num_tokens": 20909520.0, "step": 1695 }, { "entropy": 1.0345196276903152, "epoch": 0.8931016324381253, "grad_norm": 0.29833653569221497, "learning_rate": 0.00019555025280651786, "loss": 0.2255219966173172, "mean_token_accuracy": 0.9102495014667511, "num_tokens": 20921856.0, "step": 1696 }, { "entropy": 0.9587903320789337, "epoch": 0.8936282253817799, "grad_norm": 0.2722357511520386, "learning_rate": 0.00019554344052610348, "loss": 0.19479139149188995, "mean_token_accuracy": 0.9188268184661865, "num_tokens": 20934192.0, "step": 1697 }, { "entropy": 0.9713253229856491, "epoch": 0.8941548183254344, "grad_norm": 0.2900646924972534, "learning_rate": 0.0001955366231674736, "loss": 0.20535482466220856, "mean_token_accuracy": 0.9150903820991516, "num_tokens": 20946528.0, "step": 1698 }, { "entropy": 1.020512416958809, "epoch": 0.894681411269089, "grad_norm": 0.2782817780971527, "learning_rate": 0.00019552980073103297, "loss": 0.20126226544380188, "mean_token_accuracy": 0.9161560386419296, "num_tokens": 20958864.0, "step": 1699 }, { "entropy": 0.9827070981264114, "epoch": 0.8952080042127436, "grad_norm": 0.2738768458366394, "learning_rate": 0.00019552297321718658, "loss": 0.19939669966697693, "mean_token_accuracy": 0.9180780202150345, "num_tokens": 20971200.0, "step": 1700 }, { "entropy": 0.9992471039295197, "epoch": 0.8957345971563981, "grad_norm": 0.31194329261779785, "learning_rate": 0.0001955161406263397, "loss": 0.23202218115329742, "mean_token_accuracy": 0.9068114459514618, "num_tokens": 20983536.0, "step": 1701 }, { "entropy": 0.9976187497377396, "epoch": 0.8962611901000527, "grad_norm": 0.29019710421562195, "learning_rate": 0.00019550930295889803, "loss": 0.21963413059711456, "mean_token_accuracy": 0.9133173823356628, "num_tokens": 20995872.0, "step": 1702 }, { "entropy": 1.0274995416402817, "epoch": 0.8967877830437072, "grad_norm": 0.2910099923610687, "learning_rate": 0.00019550246021526736, "loss": 0.20295658707618713, "mean_token_accuracy": 0.9164696484804153, "num_tokens": 21008208.0, "step": 1703 }, { "entropy": 1.0305428206920624, "epoch": 0.8973143759873617, "grad_norm": 0.3525075912475586, "learning_rate": 0.000195495612395854, "loss": 0.20155680179595947, "mean_token_accuracy": 0.9174475073814392, "num_tokens": 21020544.0, "step": 1704 }, { "entropy": 1.0068664401769638, "epoch": 0.8978409689310163, "grad_norm": 0.33528581261634827, "learning_rate": 0.00019548875950106448, "loss": 0.22776372730731964, "mean_token_accuracy": 0.906059592962265, "num_tokens": 21032880.0, "step": 1705 }, { "entropy": 1.0565652251243591, "epoch": 0.8983675618746709, "grad_norm": 0.29654526710510254, "learning_rate": 0.00019548190153130553, "loss": 0.23316293954849243, "mean_token_accuracy": 0.9070921689271927, "num_tokens": 21045216.0, "step": 1706 }, { "entropy": 0.9845771491527557, "epoch": 0.8988941548183255, "grad_norm": 0.3172268271446228, "learning_rate": 0.00019547503848698435, "loss": 0.22646287083625793, "mean_token_accuracy": 0.9135229587554932, "num_tokens": 21057552.0, "step": 1707 }, { "entropy": 1.014034628868103, "epoch": 0.89942074776198, "grad_norm": 0.27241358160972595, "learning_rate": 0.00019546817036850827, "loss": 0.21421730518341064, "mean_token_accuracy": 0.9127627313137054, "num_tokens": 21069888.0, "step": 1708 }, { "entropy": 1.044843077659607, "epoch": 0.8999473407056345, "grad_norm": 0.27422401309013367, "learning_rate": 0.00019546129717628512, "loss": 0.22259175777435303, "mean_token_accuracy": 0.90959133207798, "num_tokens": 21082224.0, "step": 1709 }, { "entropy": 1.0896000117063522, "epoch": 0.9004739336492891, "grad_norm": 0.31072503328323364, "learning_rate": 0.00019545441891072283, "loss": 0.21754461526870728, "mean_token_accuracy": 0.9161411225795746, "num_tokens": 21094560.0, "step": 1710 }, { "entropy": 1.0415829718112946, "epoch": 0.9010005265929436, "grad_norm": 0.261515736579895, "learning_rate": 0.00019544753557222975, "loss": 0.1926898956298828, "mean_token_accuracy": 0.9213140159845352, "num_tokens": 21106896.0, "step": 1711 }, { "entropy": 1.0076445639133453, "epoch": 0.9015271195365983, "grad_norm": 0.26134979724884033, "learning_rate": 0.00019544064716121452, "loss": 0.20023104548454285, "mean_token_accuracy": 0.9194119721651077, "num_tokens": 21119232.0, "step": 1712 }, { "entropy": 1.007362276315689, "epoch": 0.9020537124802528, "grad_norm": 0.2691597044467926, "learning_rate": 0.00019543375367808604, "loss": 0.19764183461666107, "mean_token_accuracy": 0.9207281470298767, "num_tokens": 21131568.0, "step": 1713 }, { "entropy": 1.0264256298542023, "epoch": 0.9025803054239073, "grad_norm": 0.2841010093688965, "learning_rate": 0.00019542685512325357, "loss": 0.19019414484500885, "mean_token_accuracy": 0.9279275834560394, "num_tokens": 21143904.0, "step": 1714 }, { "entropy": 1.0494853258132935, "epoch": 0.9031068983675619, "grad_norm": 0.2881733477115631, "learning_rate": 0.00019541995149712662, "loss": 0.19694221019744873, "mean_token_accuracy": 0.9203800857067108, "num_tokens": 21156240.0, "step": 1715 }, { "entropy": 1.029950574040413, "epoch": 0.9036334913112164, "grad_norm": 0.2856560945510864, "learning_rate": 0.00019541304280011498, "loss": 0.208457350730896, "mean_token_accuracy": 0.9130570143461227, "num_tokens": 21168576.0, "step": 1716 }, { "entropy": 1.036653459072113, "epoch": 0.9041600842548709, "grad_norm": 0.35959112644195557, "learning_rate": 0.00019540612903262887, "loss": 0.2388800084590912, "mean_token_accuracy": 0.909120500087738, "num_tokens": 21180912.0, "step": 1717 }, { "entropy": 1.00953871011734, "epoch": 0.9046866771985256, "grad_norm": 0.3067711293697357, "learning_rate": 0.00019539921019507862, "loss": 0.2145732194185257, "mean_token_accuracy": 0.9115498811006546, "num_tokens": 21193248.0, "step": 1718 }, { "entropy": 0.9901564866304398, "epoch": 0.9052132701421801, "grad_norm": 0.3036840856075287, "learning_rate": 0.00019539228628787501, "loss": 0.2193184792995453, "mean_token_accuracy": 0.9104121774435043, "num_tokens": 21205584.0, "step": 1719 }, { "entropy": 0.9771833568811417, "epoch": 0.9057398630858347, "grad_norm": 0.32093900442123413, "learning_rate": 0.00019538535731142907, "loss": 0.23529593646526337, "mean_token_accuracy": 0.9093421250581741, "num_tokens": 21217920.0, "step": 1720 }, { "entropy": 1.011559009552002, "epoch": 0.9062664560294892, "grad_norm": 0.2692308723926544, "learning_rate": 0.00019537842326615215, "loss": 0.20593476295471191, "mean_token_accuracy": 0.9199935644865036, "num_tokens": 21230256.0, "step": 1721 }, { "entropy": 1.073755070567131, "epoch": 0.9067930489731437, "grad_norm": 0.3065417408943176, "learning_rate": 0.00019537148415245582, "loss": 0.23454323410987854, "mean_token_accuracy": 0.9069335609674454, "num_tokens": 21242592.0, "step": 1722 }, { "entropy": 1.0648082047700882, "epoch": 0.9073196419167984, "grad_norm": 0.32037290930747986, "learning_rate": 0.0001953645399707521, "loss": 0.2138725221157074, "mean_token_accuracy": 0.9131258726119995, "num_tokens": 21254928.0, "step": 1723 }, { "entropy": 1.0663966238498688, "epoch": 0.9078462348604529, "grad_norm": 0.2899954915046692, "learning_rate": 0.00019535759072145318, "loss": 0.204481303691864, "mean_token_accuracy": 0.9170624017715454, "num_tokens": 21267264.0, "step": 1724 }, { "entropy": 1.020171880722046, "epoch": 0.9083728278041074, "grad_norm": 0.29145675897598267, "learning_rate": 0.0001953506364049716, "loss": 0.21512804925441742, "mean_token_accuracy": 0.9173563122749329, "num_tokens": 21279600.0, "step": 1725 }, { "entropy": 1.0235641449689865, "epoch": 0.908899420747762, "grad_norm": 0.27262571454048157, "learning_rate": 0.00019534367702172016, "loss": 0.22479593753814697, "mean_token_accuracy": 0.9110193848609924, "num_tokens": 21291936.0, "step": 1726 }, { "entropy": 0.9845803081989288, "epoch": 0.9094260136914165, "grad_norm": 0.2786709666252136, "learning_rate": 0.00019533671257211205, "loss": 0.2018449455499649, "mean_token_accuracy": 0.9166059494018555, "num_tokens": 21304272.0, "step": 1727 }, { "entropy": 0.9907389134168625, "epoch": 0.909952606635071, "grad_norm": 0.2637747526168823, "learning_rate": 0.00019532974305656075, "loss": 0.211765855550766, "mean_token_accuracy": 0.9151495099067688, "num_tokens": 21316608.0, "step": 1728 }, { "entropy": 1.0142314583063126, "epoch": 0.9104791995787257, "grad_norm": 0.2817028760910034, "learning_rate": 0.0001953227684754799, "loss": 0.19784370064735413, "mean_token_accuracy": 0.9207914024591446, "num_tokens": 21328944.0, "step": 1729 }, { "entropy": 1.0088147670030594, "epoch": 0.9110057925223802, "grad_norm": 0.2688204050064087, "learning_rate": 0.00019531578882928357, "loss": 0.20449689030647278, "mean_token_accuracy": 0.9207023978233337, "num_tokens": 21341280.0, "step": 1730 }, { "entropy": 0.9528838694095612, "epoch": 0.9115323854660348, "grad_norm": 0.27442365884780884, "learning_rate": 0.00019530880411838616, "loss": 0.21661211550235748, "mean_token_accuracy": 0.9121255576610565, "num_tokens": 21353616.0, "step": 1731 }, { "entropy": 0.9663679003715515, "epoch": 0.9120589784096893, "grad_norm": 0.2818276584148407, "learning_rate": 0.00019530181434320224, "loss": 0.21009200811386108, "mean_token_accuracy": 0.9155483096837997, "num_tokens": 21365952.0, "step": 1732 }, { "entropy": 0.9394736588001251, "epoch": 0.9125855713533438, "grad_norm": 0.3315548598766327, "learning_rate": 0.0001952948195041468, "loss": 0.21075570583343506, "mean_token_accuracy": 0.9181785732507706, "num_tokens": 21378288.0, "step": 1733 }, { "entropy": 0.9442544430494308, "epoch": 0.9131121642969984, "grad_norm": 0.3284794092178345, "learning_rate": 0.000195287819601635, "loss": 0.23087412118911743, "mean_token_accuracy": 0.9092219769954681, "num_tokens": 21390624.0, "step": 1734 }, { "entropy": 0.9372933954000473, "epoch": 0.913638757240653, "grad_norm": 0.29973915219306946, "learning_rate": 0.0001952808146360825, "loss": 0.2058921754360199, "mean_token_accuracy": 0.9160513281822205, "num_tokens": 21402960.0, "step": 1735 }, { "entropy": 0.9260263890028, "epoch": 0.9141653501843076, "grad_norm": 0.2917967438697815, "learning_rate": 0.00019527380460790508, "loss": 0.2268896996974945, "mean_token_accuracy": 0.9107523709535599, "num_tokens": 21415296.0, "step": 1736 }, { "entropy": 0.9555350244045258, "epoch": 0.9146919431279621, "grad_norm": 0.2836836874485016, "learning_rate": 0.0001952667895175189, "loss": 0.21083997189998627, "mean_token_accuracy": 0.9108854085206985, "num_tokens": 21427632.0, "step": 1737 }, { "entropy": 0.9710684269666672, "epoch": 0.9152185360716166, "grad_norm": 0.3263842761516571, "learning_rate": 0.00019525976936534035, "loss": 0.19704914093017578, "mean_token_accuracy": 0.9213050603866577, "num_tokens": 21439968.0, "step": 1738 }, { "entropy": 0.920185998082161, "epoch": 0.9157451290152712, "grad_norm": 0.3038593828678131, "learning_rate": 0.00019525274415178626, "loss": 0.2302832156419754, "mean_token_accuracy": 0.9091469496488571, "num_tokens": 21452304.0, "step": 1739 }, { "entropy": 0.9555569142103195, "epoch": 0.9162717219589257, "grad_norm": 0.3209346532821655, "learning_rate": 0.00019524571387727365, "loss": 0.2268507480621338, "mean_token_accuracy": 0.9097347557544708, "num_tokens": 21464640.0, "step": 1740 }, { "entropy": 0.9613929092884064, "epoch": 0.9167983149025803, "grad_norm": 0.28639957308769226, "learning_rate": 0.0001952386785422199, "loss": 0.22456036508083344, "mean_token_accuracy": 0.9144959151744843, "num_tokens": 21476976.0, "step": 1741 }, { "entropy": 0.9676374346017838, "epoch": 0.9173249078462349, "grad_norm": 0.29118600487709045, "learning_rate": 0.00019523163814704253, "loss": 0.21779820322990417, "mean_token_accuracy": 0.9170442819595337, "num_tokens": 21489312.0, "step": 1742 }, { "entropy": 0.9580910950899124, "epoch": 0.9178515007898894, "grad_norm": 0.28892767429351807, "learning_rate": 0.0001952245926921596, "loss": 0.1965646892786026, "mean_token_accuracy": 0.9236303865909576, "num_tokens": 21501648.0, "step": 1743 }, { "entropy": 1.0211364477872849, "epoch": 0.918378093733544, "grad_norm": 0.2978745996952057, "learning_rate": 0.00019521754217798935, "loss": 0.2231602966785431, "mean_token_accuracy": 0.9130188077688217, "num_tokens": 21513984.0, "step": 1744 }, { "entropy": 0.9940465688705444, "epoch": 0.9189046866771985, "grad_norm": 0.2930096685886383, "learning_rate": 0.00019521048660495026, "loss": 0.19159580767154694, "mean_token_accuracy": 0.9195211082696915, "num_tokens": 21526320.0, "step": 1745 }, { "entropy": 0.9247337281703949, "epoch": 0.919431279620853, "grad_norm": 0.2832118570804596, "learning_rate": 0.00019520342597346125, "loss": 0.21378204226493835, "mean_token_accuracy": 0.9141468554735184, "num_tokens": 21538656.0, "step": 1746 }, { "entropy": 0.9416433870792389, "epoch": 0.9199578725645077, "grad_norm": 0.3025250732898712, "learning_rate": 0.00019519636028394148, "loss": 0.21570643782615662, "mean_token_accuracy": 0.9150727838277817, "num_tokens": 21550992.0, "step": 1747 }, { "entropy": 0.9537800550460815, "epoch": 0.9204844655081622, "grad_norm": 0.29714229702949524, "learning_rate": 0.00019518928953681032, "loss": 0.22764158248901367, "mean_token_accuracy": 0.9034122675657272, "num_tokens": 21563328.0, "step": 1748 }, { "entropy": 0.9719788879156113, "epoch": 0.9210110584518167, "grad_norm": 0.2960829734802246, "learning_rate": 0.00019518221373248756, "loss": 0.2084151953458786, "mean_token_accuracy": 0.9151151925325394, "num_tokens": 21575664.0, "step": 1749 }, { "entropy": 0.9682374745607376, "epoch": 0.9215376513954713, "grad_norm": 0.2902142405509949, "learning_rate": 0.00019517513287139326, "loss": 0.19477756321430206, "mean_token_accuracy": 0.9197756201028824, "num_tokens": 21588000.0, "step": 1750 }, { "entropy": 0.9519971162080765, "epoch": 0.9220642443391258, "grad_norm": 0.28657373785972595, "learning_rate": 0.00019516804695394777, "loss": 0.23340506851673126, "mean_token_accuracy": 0.9101651012897491, "num_tokens": 21600336.0, "step": 1751 }, { "entropy": 0.9670501947402954, "epoch": 0.9225908372827805, "grad_norm": 0.2798555791378021, "learning_rate": 0.00019516095598057174, "loss": 0.2065662145614624, "mean_token_accuracy": 0.9186369478702545, "num_tokens": 21612672.0, "step": 1752 }, { "entropy": 0.9457984417676926, "epoch": 0.923117430226435, "grad_norm": 0.2589358985424042, "learning_rate": 0.00019515385995168608, "loss": 0.1857452392578125, "mean_token_accuracy": 0.9278716593980789, "num_tokens": 21625008.0, "step": 1753 }, { "entropy": 0.923014685511589, "epoch": 0.9236440231700895, "grad_norm": 0.29148226976394653, "learning_rate": 0.00019514675886771207, "loss": 0.21651901304721832, "mean_token_accuracy": 0.9152826964855194, "num_tokens": 21637344.0, "step": 1754 }, { "entropy": 0.95480976998806, "epoch": 0.9241706161137441, "grad_norm": 0.28343141078948975, "learning_rate": 0.00019513965272907128, "loss": 0.2175363004207611, "mean_token_accuracy": 0.9101854413747787, "num_tokens": 21649680.0, "step": 1755 }, { "entropy": 0.9613447189331055, "epoch": 0.9246972090573986, "grad_norm": 0.3009392023086548, "learning_rate": 0.0001951325415361855, "loss": 0.22403854131698608, "mean_token_accuracy": 0.9168571084737778, "num_tokens": 21662016.0, "step": 1756 }, { "entropy": 0.9929066747426987, "epoch": 0.9252238020010531, "grad_norm": 0.3036598563194275, "learning_rate": 0.00019512542528947696, "loss": 0.22976119816303253, "mean_token_accuracy": 0.9101551920175552, "num_tokens": 21674352.0, "step": 1757 }, { "entropy": 0.968064159154892, "epoch": 0.9257503949447078, "grad_norm": 0.28782951831817627, "learning_rate": 0.00019511830398936809, "loss": 0.21798846125602722, "mean_token_accuracy": 0.9074330925941467, "num_tokens": 21686688.0, "step": 1758 }, { "entropy": 0.9647489339113235, "epoch": 0.9262769878883623, "grad_norm": 0.2734207212924957, "learning_rate": 0.00019511117763628156, "loss": 0.209343820810318, "mean_token_accuracy": 0.9190388172864914, "num_tokens": 21699024.0, "step": 1759 }, { "entropy": 0.9990984350442886, "epoch": 0.9268035808320169, "grad_norm": 0.26921236515045166, "learning_rate": 0.00019510404623064053, "loss": 0.21170470118522644, "mean_token_accuracy": 0.9162604361772537, "num_tokens": 21711360.0, "step": 1760 }, { "entropy": 0.9623449593782425, "epoch": 0.9273301737756714, "grad_norm": 0.2714099884033203, "learning_rate": 0.00019509690977286825, "loss": 0.21800348162651062, "mean_token_accuracy": 0.9147970378398895, "num_tokens": 21723696.0, "step": 1761 }, { "entropy": 1.0402387380599976, "epoch": 0.9278567667193259, "grad_norm": 0.2736240327358246, "learning_rate": 0.00019508976826338844, "loss": 0.22173887491226196, "mean_token_accuracy": 0.9075192958116531, "num_tokens": 21736032.0, "step": 1762 }, { "entropy": 1.0271132439374924, "epoch": 0.9283833596629805, "grad_norm": 0.2877287268638611, "learning_rate": 0.00019508262170262502, "loss": 0.21932274103164673, "mean_token_accuracy": 0.915712833404541, "num_tokens": 21748368.0, "step": 1763 }, { "entropy": 1.034477338194847, "epoch": 0.9289099526066351, "grad_norm": 0.2779938280582428, "learning_rate": 0.0001950754700910023, "loss": 0.207020103931427, "mean_token_accuracy": 0.9147273898124695, "num_tokens": 21760704.0, "step": 1764 }, { "entropy": 0.9738915860652924, "epoch": 0.9294365455502897, "grad_norm": 0.25146281719207764, "learning_rate": 0.00019506831342894473, "loss": 0.1815354973077774, "mean_token_accuracy": 0.9243048876523972, "num_tokens": 21773040.0, "step": 1765 }, { "entropy": 0.9640511274337769, "epoch": 0.9299631384939442, "grad_norm": 0.2794640362262726, "learning_rate": 0.0001950611517168772, "loss": 0.222852423787117, "mean_token_accuracy": 0.9066295772790909, "num_tokens": 21785376.0, "step": 1766 }, { "entropy": 0.9703959077596664, "epoch": 0.9304897314375987, "grad_norm": 0.2606351971626282, "learning_rate": 0.00019505398495522487, "loss": 0.1913529932498932, "mean_token_accuracy": 0.9248643219470978, "num_tokens": 21797712.0, "step": 1767 }, { "entropy": 0.9996339529752731, "epoch": 0.9310163243812533, "grad_norm": 0.310641884803772, "learning_rate": 0.00019504681314441323, "loss": 0.22644834220409393, "mean_token_accuracy": 0.9118537902832031, "num_tokens": 21810048.0, "step": 1768 }, { "entropy": 0.9964617937803268, "epoch": 0.9315429173249078, "grad_norm": 0.2875900864601135, "learning_rate": 0.00019503963628486793, "loss": 0.2038813978433609, "mean_token_accuracy": 0.9186841398477554, "num_tokens": 21822384.0, "step": 1769 }, { "entropy": 0.9495928287506104, "epoch": 0.9320695102685624, "grad_norm": 0.2897108495235443, "learning_rate": 0.00019503245437701508, "loss": 0.20874524116516113, "mean_token_accuracy": 0.9164410084486008, "num_tokens": 21834720.0, "step": 1770 }, { "entropy": 1.0277469605207443, "epoch": 0.932596103212217, "grad_norm": 0.31645241379737854, "learning_rate": 0.00019502526742128104, "loss": 0.2254372090101242, "mean_token_accuracy": 0.9089788496494293, "num_tokens": 21847056.0, "step": 1771 }, { "entropy": 1.041675180196762, "epoch": 0.9331226961558715, "grad_norm": 0.3042741119861603, "learning_rate": 0.00019501807541809243, "loss": 0.21151864528656006, "mean_token_accuracy": 0.9152505397796631, "num_tokens": 21859392.0, "step": 1772 }, { "entropy": 1.0295332968235016, "epoch": 0.933649289099526, "grad_norm": 0.32914313673973083, "learning_rate": 0.00019501087836787623, "loss": 0.2500017285346985, "mean_token_accuracy": 0.8985483199357986, "num_tokens": 21871728.0, "step": 1773 }, { "entropy": 1.0453828126192093, "epoch": 0.9341758820431806, "grad_norm": 0.2983553111553192, "learning_rate": 0.00019500367627105965, "loss": 0.21561893820762634, "mean_token_accuracy": 0.9130748361349106, "num_tokens": 21884064.0, "step": 1774 }, { "entropy": 1.002024069428444, "epoch": 0.9347024749868352, "grad_norm": 0.28427883982658386, "learning_rate": 0.00019499646912807023, "loss": 0.22381159663200378, "mean_token_accuracy": 0.9057275652885437, "num_tokens": 21896400.0, "step": 1775 }, { "entropy": 1.0608263909816742, "epoch": 0.9352290679304898, "grad_norm": 0.27167659997940063, "learning_rate": 0.00019498925693933584, "loss": 0.1875414401292801, "mean_token_accuracy": 0.9234858453273773, "num_tokens": 21908736.0, "step": 1776 }, { "entropy": 1.0062582045793533, "epoch": 0.9357556608741443, "grad_norm": 0.2636836767196655, "learning_rate": 0.00019498203970528462, "loss": 0.21502971649169922, "mean_token_accuracy": 0.919221356511116, "num_tokens": 21921072.0, "step": 1777 }, { "entropy": 1.006988525390625, "epoch": 0.9362822538177988, "grad_norm": 0.26056134700775146, "learning_rate": 0.00019497481742634503, "loss": 0.201970174908638, "mean_token_accuracy": 0.9196654409170151, "num_tokens": 21933408.0, "step": 1778 }, { "entropy": 1.0629092454910278, "epoch": 0.9368088467614534, "grad_norm": 0.29083991050720215, "learning_rate": 0.00019496759010294577, "loss": 0.22228607535362244, "mean_token_accuracy": 0.9100936055183411, "num_tokens": 21945744.0, "step": 1779 }, { "entropy": 1.0019027441740036, "epoch": 0.9373354397051079, "grad_norm": 0.2699200212955475, "learning_rate": 0.00019496035773551592, "loss": 0.22549045085906982, "mean_token_accuracy": 0.9094872325658798, "num_tokens": 21958080.0, "step": 1780 }, { "entropy": 1.0057822614908218, "epoch": 0.9378620326487626, "grad_norm": 0.28440120816230774, "learning_rate": 0.00019495312032448485, "loss": 0.22345775365829468, "mean_token_accuracy": 0.9118607193231583, "num_tokens": 21970416.0, "step": 1781 }, { "entropy": 1.0094308406114578, "epoch": 0.9383886255924171, "grad_norm": 0.2834523320198059, "learning_rate": 0.00019494587787028216, "loss": 0.22185727953910828, "mean_token_accuracy": 0.9113683104515076, "num_tokens": 21982752.0, "step": 1782 }, { "entropy": 0.9964211732149124, "epoch": 0.9389152185360716, "grad_norm": 0.2954987585544586, "learning_rate": 0.00019493863037333778, "loss": 0.20775803923606873, "mean_token_accuracy": 0.9154636561870575, "num_tokens": 21995088.0, "step": 1783 }, { "entropy": 1.0346784442663193, "epoch": 0.9394418114797262, "grad_norm": 0.2964785695075989, "learning_rate": 0.000194931377834082, "loss": 0.2272047996520996, "mean_token_accuracy": 0.9083570241928101, "num_tokens": 22007424.0, "step": 1784 }, { "entropy": 1.0281512439250946, "epoch": 0.9399684044233807, "grad_norm": 0.26846325397491455, "learning_rate": 0.00019492412025294534, "loss": 0.20067930221557617, "mean_token_accuracy": 0.9195989966392517, "num_tokens": 22019760.0, "step": 1785 }, { "entropy": 0.9764789193868637, "epoch": 0.9404949973670352, "grad_norm": 0.26383689045906067, "learning_rate": 0.0001949168576303586, "loss": 0.2051767259836197, "mean_token_accuracy": 0.92010198533535, "num_tokens": 22032096.0, "step": 1786 }, { "entropy": 1.078786700963974, "epoch": 0.9410215903106899, "grad_norm": 0.3011668920516968, "learning_rate": 0.000194909589966753, "loss": 0.221777081489563, "mean_token_accuracy": 0.9121461063623428, "num_tokens": 22044432.0, "step": 1787 }, { "entropy": 0.9719114750623703, "epoch": 0.9415481832543444, "grad_norm": 0.27153825759887695, "learning_rate": 0.0001949023172625599, "loss": 0.21883930265903473, "mean_token_accuracy": 0.913441613316536, "num_tokens": 22056768.0, "step": 1788 }, { "entropy": 0.9923989027738571, "epoch": 0.942074776197999, "grad_norm": 0.3212338984012604, "learning_rate": 0.00019489503951821107, "loss": 0.22175338864326477, "mean_token_accuracy": 0.9168316125869751, "num_tokens": 22069104.0, "step": 1789 }, { "entropy": 0.9783156663179398, "epoch": 0.9426013691416535, "grad_norm": 0.273110568523407, "learning_rate": 0.00019488775673413857, "loss": 0.21147552132606506, "mean_token_accuracy": 0.9130014330148697, "num_tokens": 22081440.0, "step": 1790 }, { "entropy": 0.9893038272857666, "epoch": 0.943127962085308, "grad_norm": 0.2790793478488922, "learning_rate": 0.00019488046891077474, "loss": 0.22615540027618408, "mean_token_accuracy": 0.9109261482954025, "num_tokens": 22093776.0, "step": 1791 }, { "entropy": 1.0380553901195526, "epoch": 0.9436545550289626, "grad_norm": 0.27198460698127747, "learning_rate": 0.00019487317604855212, "loss": 0.205999955534935, "mean_token_accuracy": 0.9175222963094711, "num_tokens": 22106112.0, "step": 1792 }, { "entropy": 1.0116278380155563, "epoch": 0.9441811479726172, "grad_norm": 0.2635519504547119, "learning_rate": 0.00019486587814790377, "loss": 0.21772751212120056, "mean_token_accuracy": 0.9136025160551071, "num_tokens": 22118448.0, "step": 1793 }, { "entropy": 1.0237055569887161, "epoch": 0.9447077409162717, "grad_norm": 0.2741040289402008, "learning_rate": 0.00019485857520926288, "loss": 0.20760180056095123, "mean_token_accuracy": 0.9132292419672012, "num_tokens": 22130784.0, "step": 1794 }, { "entropy": 1.0196455419063568, "epoch": 0.9452343338599263, "grad_norm": 0.27313318848609924, "learning_rate": 0.00019485126723306292, "loss": 0.18969658017158508, "mean_token_accuracy": 0.9258754402399063, "num_tokens": 22143120.0, "step": 1795 }, { "entropy": 1.0403377711772919, "epoch": 0.9457609268035808, "grad_norm": 0.2604946494102478, "learning_rate": 0.00019484395421973783, "loss": 0.2132149338722229, "mean_token_accuracy": 0.9197222590446472, "num_tokens": 22155456.0, "step": 1796 }, { "entropy": 0.9670400768518448, "epoch": 0.9462875197472354, "grad_norm": 0.24395477771759033, "learning_rate": 0.00019483663616972165, "loss": 0.19094271957874298, "mean_token_accuracy": 0.9200141131877899, "num_tokens": 22167792.0, "step": 1797 }, { "entropy": 1.0197023451328278, "epoch": 0.94681411269089, "grad_norm": 0.2558318078517914, "learning_rate": 0.00019482931308344888, "loss": 0.19818465411663055, "mean_token_accuracy": 0.9231192022562027, "num_tokens": 22180128.0, "step": 1798 }, { "entropy": 1.0280962586402893, "epoch": 0.9473407056345445, "grad_norm": 0.28250062465667725, "learning_rate": 0.00019482198496135417, "loss": 0.22149549424648285, "mean_token_accuracy": 0.9105774611234665, "num_tokens": 22192464.0, "step": 1799 }, { "entropy": 1.004937931895256, "epoch": 0.9478672985781991, "grad_norm": 0.2890641391277313, "learning_rate": 0.00019481465180387264, "loss": 0.2117823362350464, "mean_token_accuracy": 0.9159420728683472, "num_tokens": 22204800.0, "step": 1800 }, { "entropy": 0.9912999272346497, "epoch": 0.9483938915218536, "grad_norm": 0.2721498906612396, "learning_rate": 0.00019480731361143955, "loss": 0.19752754271030426, "mean_token_accuracy": 0.9188252538442612, "num_tokens": 22217136.0, "step": 1801 }, { "entropy": 0.9911512136459351, "epoch": 0.9489204844655081, "grad_norm": 0.2967390716075897, "learning_rate": 0.00019479997038449054, "loss": 0.2183246612548828, "mean_token_accuracy": 0.908792570233345, "num_tokens": 22229472.0, "step": 1802 }, { "entropy": 1.0003108382225037, "epoch": 0.9494470774091627, "grad_norm": 0.281955748796463, "learning_rate": 0.00019479262212346153, "loss": 0.20015354454517365, "mean_token_accuracy": 0.9192506521940231, "num_tokens": 22241808.0, "step": 1803 }, { "entropy": 1.005830705165863, "epoch": 0.9499736703528173, "grad_norm": 0.29906165599823, "learning_rate": 0.00019478526882878876, "loss": 0.2205047309398651, "mean_token_accuracy": 0.9138208776712418, "num_tokens": 22254144.0, "step": 1804 }, { "entropy": 0.9975222796201706, "epoch": 0.9505002632964719, "grad_norm": 0.297961950302124, "learning_rate": 0.00019477791050090875, "loss": 0.21634206175804138, "mean_token_accuracy": 0.9120276570320129, "num_tokens": 22266480.0, "step": 1805 }, { "entropy": 0.9912213832139969, "epoch": 0.9510268562401264, "grad_norm": 0.3019638955593109, "learning_rate": 0.00019477054714025832, "loss": 0.21199895441532135, "mean_token_accuracy": 0.9165389537811279, "num_tokens": 22278816.0, "step": 1806 }, { "entropy": 0.9327168315649033, "epoch": 0.9515534491837809, "grad_norm": 0.288906991481781, "learning_rate": 0.00019476317874727456, "loss": 0.23043318092823029, "mean_token_accuracy": 0.9077083468437195, "num_tokens": 22291152.0, "step": 1807 }, { "entropy": 0.9759026318788528, "epoch": 0.9520800421274355, "grad_norm": 0.2820807993412018, "learning_rate": 0.00019475580532239497, "loss": 0.21610046923160553, "mean_token_accuracy": 0.914526030421257, "num_tokens": 22303488.0, "step": 1808 }, { "entropy": 1.01944038271904, "epoch": 0.95260663507109, "grad_norm": 0.29718121886253357, "learning_rate": 0.00019474842686605716, "loss": 0.2213006466627121, "mean_token_accuracy": 0.9078305512666702, "num_tokens": 22315824.0, "step": 1809 }, { "entropy": 0.9788577258586884, "epoch": 0.9531332280147446, "grad_norm": 0.2710515558719635, "learning_rate": 0.00019474104337869924, "loss": 0.19855360686779022, "mean_token_accuracy": 0.9186171144247055, "num_tokens": 22328160.0, "step": 1810 }, { "entropy": 0.9749794155359268, "epoch": 0.9536598209583992, "grad_norm": 0.2699875235557556, "learning_rate": 0.00019473365486075944, "loss": 0.20002411305904388, "mean_token_accuracy": 0.917415052652359, "num_tokens": 22340496.0, "step": 1811 }, { "entropy": 1.0002324134111404, "epoch": 0.9541864139020537, "grad_norm": 0.2768368422985077, "learning_rate": 0.00019472626131267646, "loss": 0.2179412692785263, "mean_token_accuracy": 0.9109683334827423, "num_tokens": 22352832.0, "step": 1812 }, { "entropy": 1.0184978395700455, "epoch": 0.9547130068457083, "grad_norm": 0.2990346848964691, "learning_rate": 0.00019471886273488915, "loss": 0.22559918463230133, "mean_token_accuracy": 0.911268338561058, "num_tokens": 22365168.0, "step": 1813 }, { "entropy": 0.9672580063343048, "epoch": 0.9552395997893628, "grad_norm": 0.258120059967041, "learning_rate": 0.00019471145912783671, "loss": 0.19848020374774933, "mean_token_accuracy": 0.9207747876644135, "num_tokens": 22377504.0, "step": 1814 }, { "entropy": 1.0332013070583344, "epoch": 0.9557661927330173, "grad_norm": 0.27658164501190186, "learning_rate": 0.00019470405049195876, "loss": 0.22540630400180817, "mean_token_accuracy": 0.909706637263298, "num_tokens": 22389840.0, "step": 1815 }, { "entropy": 1.0286743193864822, "epoch": 0.956292785676672, "grad_norm": 0.30504515767097473, "learning_rate": 0.00019469663682769491, "loss": 0.22958287596702576, "mean_token_accuracy": 0.90970279276371, "num_tokens": 22402176.0, "step": 1816 }, { "entropy": 1.0396344661712646, "epoch": 0.9568193786203265, "grad_norm": 0.3122229278087616, "learning_rate": 0.00019468921813548546, "loss": 0.21201902627944946, "mean_token_accuracy": 0.912709191441536, "num_tokens": 22414512.0, "step": 1817 }, { "entropy": 0.9904589354991913, "epoch": 0.957345971563981, "grad_norm": 0.2821761667728424, "learning_rate": 0.00019468179441577073, "loss": 0.21789240837097168, "mean_token_accuracy": 0.9137752056121826, "num_tokens": 22426848.0, "step": 1818 }, { "entropy": 0.9968847781419754, "epoch": 0.9578725645076356, "grad_norm": 0.2896675765514374, "learning_rate": 0.0001946743656689914, "loss": 0.19366274774074554, "mean_token_accuracy": 0.9199696481227875, "num_tokens": 22439184.0, "step": 1819 }, { "entropy": 0.9972859472036362, "epoch": 0.9583991574512901, "grad_norm": 0.2833546996116638, "learning_rate": 0.00019466693189558852, "loss": 0.20901280641555786, "mean_token_accuracy": 0.9163765460252762, "num_tokens": 22451520.0, "step": 1820 }, { "entropy": 1.0221098363399506, "epoch": 0.9589257503949447, "grad_norm": 0.30042803287506104, "learning_rate": 0.00019465949309600334, "loss": 0.20722414553165436, "mean_token_accuracy": 0.9166164398193359, "num_tokens": 22463856.0, "step": 1821 }, { "entropy": 0.9847268313169479, "epoch": 0.9594523433385993, "grad_norm": 0.29877185821533203, "learning_rate": 0.00019465204927067754, "loss": 0.22702287137508392, "mean_token_accuracy": 0.910624086856842, "num_tokens": 22476192.0, "step": 1822 }, { "entropy": 1.0212393552064896, "epoch": 0.9599789362822538, "grad_norm": 0.3099231421947479, "learning_rate": 0.00019464460042005293, "loss": 0.23366589844226837, "mean_token_accuracy": 0.9104152172803879, "num_tokens": 22488528.0, "step": 1823 }, { "entropy": 1.0240531265735626, "epoch": 0.9605055292259084, "grad_norm": 0.2815970182418823, "learning_rate": 0.00019463714654457172, "loss": 0.19396552443504333, "mean_token_accuracy": 0.9191655963659286, "num_tokens": 22500864.0, "step": 1824 }, { "entropy": 0.9908776879310608, "epoch": 0.9610321221695629, "grad_norm": 0.25329092144966125, "learning_rate": 0.00019462968764467648, "loss": 0.19574449956417084, "mean_token_accuracy": 0.9221374094486237, "num_tokens": 22513200.0, "step": 1825 }, { "entropy": 1.0275763273239136, "epoch": 0.9615587151132174, "grad_norm": 0.29698899388313293, "learning_rate": 0.00019462222372080992, "loss": 0.23368221521377563, "mean_token_accuracy": 0.9036354571580887, "num_tokens": 22525536.0, "step": 1826 }, { "entropy": 1.0337569862604141, "epoch": 0.9620853080568721, "grad_norm": 0.3343221843242645, "learning_rate": 0.00019461475477341512, "loss": 0.21144059300422668, "mean_token_accuracy": 0.9137226939201355, "num_tokens": 22537872.0, "step": 1827 }, { "entropy": 1.0447833985090256, "epoch": 0.9626119010005266, "grad_norm": 0.3130665421485901, "learning_rate": 0.0001946072808029355, "loss": 0.2065916359424591, "mean_token_accuracy": 0.9174522012472153, "num_tokens": 22550208.0, "step": 1828 }, { "entropy": 1.0395597666502, "epoch": 0.9631384939441812, "grad_norm": 0.26665323972702026, "learning_rate": 0.00019459980180981478, "loss": 0.21482327580451965, "mean_token_accuracy": 0.9130977690219879, "num_tokens": 22562544.0, "step": 1829 }, { "entropy": 1.0779733955860138, "epoch": 0.9636650868878357, "grad_norm": 0.28825950622558594, "learning_rate": 0.0001945923177944969, "loss": 0.21779173612594604, "mean_token_accuracy": 0.9156653732061386, "num_tokens": 22574880.0, "step": 1830 }, { "entropy": 1.0036635249853134, "epoch": 0.9641916798314902, "grad_norm": 0.2941460907459259, "learning_rate": 0.0001945848287574262, "loss": 0.2330627739429474, "mean_token_accuracy": 0.9059428721666336, "num_tokens": 22587216.0, "step": 1831 }, { "entropy": 0.9797258973121643, "epoch": 0.9647182727751448, "grad_norm": 0.25932562351226807, "learning_rate": 0.00019457733469904715, "loss": 0.2051321119070053, "mean_token_accuracy": 0.9192904084920883, "num_tokens": 22599552.0, "step": 1832 }, { "entropy": 1.039179965853691, "epoch": 0.9652448657187994, "grad_norm": 0.26872527599334717, "learning_rate": 0.0001945698356198047, "loss": 0.21343429386615753, "mean_token_accuracy": 0.9149598628282547, "num_tokens": 22611888.0, "step": 1833 }, { "entropy": 1.0027782917022705, "epoch": 0.965771458662454, "grad_norm": 0.27663007378578186, "learning_rate": 0.00019456233152014406, "loss": 0.19677159190177917, "mean_token_accuracy": 0.9209509938955307, "num_tokens": 22624224.0, "step": 1834 }, { "entropy": 1.0312834680080414, "epoch": 0.9662980516061085, "grad_norm": 0.28490519523620605, "learning_rate": 0.00019455482240051064, "loss": 0.21659842133522034, "mean_token_accuracy": 0.9108777791261673, "num_tokens": 22636560.0, "step": 1835 }, { "entropy": 1.012413963675499, "epoch": 0.966824644549763, "grad_norm": 0.27517637610435486, "learning_rate": 0.00019454730826135022, "loss": 0.22000275552272797, "mean_token_accuracy": 0.9186523258686066, "num_tokens": 22648896.0, "step": 1836 }, { "entropy": 0.9954932332038879, "epoch": 0.9673512374934176, "grad_norm": 0.27069538831710815, "learning_rate": 0.0001945397891031089, "loss": 0.19973544776439667, "mean_token_accuracy": 0.9211115539073944, "num_tokens": 22661232.0, "step": 1837 }, { "entropy": 1.0200046300888062, "epoch": 0.9678778304370721, "grad_norm": 0.2899874150753021, "learning_rate": 0.00019453226492623305, "loss": 0.22812676429748535, "mean_token_accuracy": 0.9122350364923477, "num_tokens": 22673568.0, "step": 1838 }, { "entropy": 0.9972085207700729, "epoch": 0.9684044233807267, "grad_norm": 0.29899537563323975, "learning_rate": 0.0001945247357311693, "loss": 0.2259579598903656, "mean_token_accuracy": 0.9079723209142685, "num_tokens": 22685904.0, "step": 1839 }, { "entropy": 1.0059181898832321, "epoch": 0.9689310163243813, "grad_norm": 0.29635098576545715, "learning_rate": 0.00019451720151836467, "loss": 0.23771284520626068, "mean_token_accuracy": 0.9140820056200027, "num_tokens": 22698240.0, "step": 1840 }, { "entropy": 1.0503579378128052, "epoch": 0.9694576092680358, "grad_norm": 0.29462575912475586, "learning_rate": 0.00019450966228826635, "loss": 0.19687220454216003, "mean_token_accuracy": 0.9218025654554367, "num_tokens": 22710576.0, "step": 1841 }, { "entropy": 0.9612717479467392, "epoch": 0.9699842022116903, "grad_norm": 0.27696606516838074, "learning_rate": 0.00019450211804132196, "loss": 0.19762445986270905, "mean_token_accuracy": 0.9190530776977539, "num_tokens": 22722912.0, "step": 1842 }, { "entropy": 0.9952682256698608, "epoch": 0.9705107951553449, "grad_norm": 0.2652910053730011, "learning_rate": 0.00019449456877797933, "loss": 0.21299602091312408, "mean_token_accuracy": 0.9156957715749741, "num_tokens": 22735248.0, "step": 1843 }, { "entropy": 0.9986753612756729, "epoch": 0.9710373880989994, "grad_norm": 0.2620997726917267, "learning_rate": 0.00019448701449868662, "loss": 0.1993142068386078, "mean_token_accuracy": 0.9197477102279663, "num_tokens": 22747584.0, "step": 1844 }, { "entropy": 0.9899931252002716, "epoch": 0.9715639810426541, "grad_norm": 0.29060348868370056, "learning_rate": 0.0001944794552038923, "loss": 0.2212766706943512, "mean_token_accuracy": 0.9078968465328217, "num_tokens": 22759920.0, "step": 1845 }, { "entropy": 1.0022216588258743, "epoch": 0.9720905739863086, "grad_norm": 0.30724501609802246, "learning_rate": 0.00019447189089404513, "loss": 0.2398059368133545, "mean_token_accuracy": 0.9064589291810989, "num_tokens": 22772256.0, "step": 1846 }, { "entropy": 0.997131809592247, "epoch": 0.9726171669299631, "grad_norm": 0.286475270986557, "learning_rate": 0.0001944643215695941, "loss": 0.21739161014556885, "mean_token_accuracy": 0.9086156636476517, "num_tokens": 22784592.0, "step": 1847 }, { "entropy": 0.9620841443538666, "epoch": 0.9731437598736177, "grad_norm": 0.2802620828151703, "learning_rate": 0.00019445674723098864, "loss": 0.18609827756881714, "mean_token_accuracy": 0.9273043125867844, "num_tokens": 22796928.0, "step": 1848 }, { "entropy": 0.9614392817020416, "epoch": 0.9736703528172722, "grad_norm": 0.2547474205493927, "learning_rate": 0.0001944491678786783, "loss": 0.20111055672168732, "mean_token_accuracy": 0.9191482216119766, "num_tokens": 22809264.0, "step": 1849 }, { "entropy": 0.9734077900648117, "epoch": 0.9741969457609269, "grad_norm": 0.2975533902645111, "learning_rate": 0.00019444158351311308, "loss": 0.20715618133544922, "mean_token_accuracy": 0.9150333106517792, "num_tokens": 22821600.0, "step": 1850 }, { "entropy": 0.9761214107275009, "epoch": 0.9747235387045814, "grad_norm": 0.28768840432167053, "learning_rate": 0.0001944339941347432, "loss": 0.18795141577720642, "mean_token_accuracy": 0.9215870052576065, "num_tokens": 22833936.0, "step": 1851 }, { "entropy": 0.9937604367733002, "epoch": 0.9752501316482359, "grad_norm": 0.29926928877830505, "learning_rate": 0.00019442639974401923, "loss": 0.21389541029930115, "mean_token_accuracy": 0.917677566409111, "num_tokens": 22846272.0, "step": 1852 }, { "entropy": 0.9756381958723068, "epoch": 0.9757767245918905, "grad_norm": 0.298100084066391, "learning_rate": 0.00019441880034139198, "loss": 0.21645361185073853, "mean_token_accuracy": 0.91536945104599, "num_tokens": 22858608.0, "step": 1853 }, { "entropy": 0.9328114837408066, "epoch": 0.976303317535545, "grad_norm": 0.27972036600112915, "learning_rate": 0.0001944111959273126, "loss": 0.20870962738990784, "mean_token_accuracy": 0.9177060127258301, "num_tokens": 22870944.0, "step": 1854 }, { "entropy": 0.9690214693546295, "epoch": 0.9768299104791995, "grad_norm": 0.28668034076690674, "learning_rate": 0.00019440358650223244, "loss": 0.20322152972221375, "mean_token_accuracy": 0.9198893010616302, "num_tokens": 22883280.0, "step": 1855 }, { "entropy": 0.9374023228883743, "epoch": 0.9773565034228542, "grad_norm": 0.2798213064670563, "learning_rate": 0.00019439597206660336, "loss": 0.20974165201187134, "mean_token_accuracy": 0.9153610616922379, "num_tokens": 22895616.0, "step": 1856 }, { "entropy": 0.988965705037117, "epoch": 0.9778830963665087, "grad_norm": 0.2775600254535675, "learning_rate": 0.00019438835262087728, "loss": 0.19997943937778473, "mean_token_accuracy": 0.9216296821832657, "num_tokens": 22907952.0, "step": 1857 }, { "entropy": 1.0289342552423477, "epoch": 0.9784096893101633, "grad_norm": 0.3432585299015045, "learning_rate": 0.00019438072816550654, "loss": 0.22643734514713287, "mean_token_accuracy": 0.9054546356201172, "num_tokens": 22920288.0, "step": 1858 }, { "entropy": 0.9867872446775436, "epoch": 0.9789362822538178, "grad_norm": 0.29411035776138306, "learning_rate": 0.0001943730987009438, "loss": 0.22154730558395386, "mean_token_accuracy": 0.9093334376811981, "num_tokens": 22932624.0, "step": 1859 }, { "entropy": 1.0116321295499802, "epoch": 0.9794628751974723, "grad_norm": 0.25875324010849, "learning_rate": 0.00019436546422764198, "loss": 0.19839854538440704, "mean_token_accuracy": 0.9156231582164764, "num_tokens": 22944960.0, "step": 1860 }, { "entropy": 1.0039302557706833, "epoch": 0.9799894681411269, "grad_norm": 0.29284337162971497, "learning_rate": 0.00019435782474605423, "loss": 0.2374696135520935, "mean_token_accuracy": 0.905433177947998, "num_tokens": 22957296.0, "step": 1861 }, { "entropy": 1.0000396072864532, "epoch": 0.9805160610847815, "grad_norm": 0.24808640778064728, "learning_rate": 0.00019435018025663412, "loss": 0.18588939309120178, "mean_token_accuracy": 0.9234057366847992, "num_tokens": 22969632.0, "step": 1862 }, { "entropy": 1.0562945902347565, "epoch": 0.981042654028436, "grad_norm": 0.2809024453163147, "learning_rate": 0.00019434253075983543, "loss": 0.19566890597343445, "mean_token_accuracy": 0.9169919043779373, "num_tokens": 22981968.0, "step": 1863 }, { "entropy": 1.066685050725937, "epoch": 0.9815692469720906, "grad_norm": 0.2744297385215759, "learning_rate": 0.0001943348762561123, "loss": 0.21286125481128693, "mean_token_accuracy": 0.911152720451355, "num_tokens": 22994304.0, "step": 1864 }, { "entropy": 1.0672977268695831, "epoch": 0.9820958399157451, "grad_norm": 0.30773451924324036, "learning_rate": 0.00019432721674591906, "loss": 0.22466342151165009, "mean_token_accuracy": 0.9027170091867447, "num_tokens": 23006640.0, "step": 1865 }, { "entropy": 0.9817476272583008, "epoch": 0.9826224328593997, "grad_norm": 0.25929689407348633, "learning_rate": 0.00019431955222971048, "loss": 0.20428617298603058, "mean_token_accuracy": 0.9160020500421524, "num_tokens": 23018976.0, "step": 1866 }, { "entropy": 1.0060690939426422, "epoch": 0.9831490258030542, "grad_norm": 0.3303799629211426, "learning_rate": 0.00019431188270794153, "loss": 0.22543492913246155, "mean_token_accuracy": 0.9112392216920853, "num_tokens": 23031312.0, "step": 1867 }, { "entropy": 0.9948325008153915, "epoch": 0.9836756187467088, "grad_norm": 0.2678799331188202, "learning_rate": 0.00019430420818106753, "loss": 0.19793486595153809, "mean_token_accuracy": 0.9236938953399658, "num_tokens": 23043648.0, "step": 1868 }, { "entropy": 1.0155895799398422, "epoch": 0.9842022116903634, "grad_norm": 0.32058584690093994, "learning_rate": 0.00019429652864954403, "loss": 0.22886891663074493, "mean_token_accuracy": 0.9127451777458191, "num_tokens": 23055984.0, "step": 1869 }, { "entropy": 1.0170871764421463, "epoch": 0.9847288046340179, "grad_norm": 0.2957039177417755, "learning_rate": 0.00019428884411382694, "loss": 0.21584120392799377, "mean_token_accuracy": 0.9092356264591217, "num_tokens": 23068320.0, "step": 1870 }, { "entropy": 1.0231945216655731, "epoch": 0.9852553975776724, "grad_norm": 0.2651207149028778, "learning_rate": 0.00019428115457437249, "loss": 0.18167884647846222, "mean_token_accuracy": 0.9309497475624084, "num_tokens": 23080656.0, "step": 1871 }, { "entropy": 0.9718558192253113, "epoch": 0.985781990521327, "grad_norm": 0.29894301295280457, "learning_rate": 0.0001942734600316371, "loss": 0.20839130878448486, "mean_token_accuracy": 0.9109772592782974, "num_tokens": 23092992.0, "step": 1872 }, { "entropy": 1.0036133825778961, "epoch": 0.9863085834649815, "grad_norm": 0.28074634075164795, "learning_rate": 0.00019426576048607754, "loss": 0.21850639581680298, "mean_token_accuracy": 0.9151745438575745, "num_tokens": 23105328.0, "step": 1873 }, { "entropy": 1.0208822190761566, "epoch": 0.9868351764086362, "grad_norm": 0.27776047587394714, "learning_rate": 0.00019425805593815094, "loss": 0.1931566298007965, "mean_token_accuracy": 0.9207221418619156, "num_tokens": 23117664.0, "step": 1874 }, { "entropy": 0.9643638432025909, "epoch": 0.9873617693522907, "grad_norm": 0.28227487206459045, "learning_rate": 0.00019425034638831466, "loss": 0.2174389511346817, "mean_token_accuracy": 0.9123106747865677, "num_tokens": 23130000.0, "step": 1875 }, { "entropy": 1.0151402354240417, "epoch": 0.9878883622959452, "grad_norm": 0.3007744252681732, "learning_rate": 0.00019424263183702634, "loss": 0.23054783046245575, "mean_token_accuracy": 0.9074221700429916, "num_tokens": 23142336.0, "step": 1876 }, { "entropy": 1.023296281695366, "epoch": 0.9884149552395998, "grad_norm": 0.2875635623931885, "learning_rate": 0.000194234912284744, "loss": 0.2183448076248169, "mean_token_accuracy": 0.9146157503128052, "num_tokens": 23154672.0, "step": 1877 }, { "entropy": 1.025291085243225, "epoch": 0.9889415481832543, "grad_norm": 0.2833808660507202, "learning_rate": 0.00019422718773192584, "loss": 0.2020779550075531, "mean_token_accuracy": 0.9207105487585068, "num_tokens": 23167008.0, "step": 1878 }, { "entropy": 1.0463321805000305, "epoch": 0.989468141126909, "grad_norm": 0.27166518568992615, "learning_rate": 0.0001942194581790305, "loss": 0.21112844347953796, "mean_token_accuracy": 0.9151988327503204, "num_tokens": 23179344.0, "step": 1879 }, { "entropy": 1.0174481570720673, "epoch": 0.9899947340705635, "grad_norm": 0.28479474782943726, "learning_rate": 0.00019421172362651677, "loss": 0.2219792902469635, "mean_token_accuracy": 0.9093788266181946, "num_tokens": 23191680.0, "step": 1880 }, { "entropy": 1.068659245967865, "epoch": 0.990521327014218, "grad_norm": 0.27825888991355896, "learning_rate": 0.00019420398407484383, "loss": 0.2115180492401123, "mean_token_accuracy": 0.913215160369873, "num_tokens": 23204016.0, "step": 1881 }, { "entropy": 1.0102509111166, "epoch": 0.9910479199578726, "grad_norm": 0.2567676901817322, "learning_rate": 0.00019419623952447113, "loss": 0.1962418258190155, "mean_token_accuracy": 0.9181914627552032, "num_tokens": 23216352.0, "step": 1882 }, { "entropy": 1.0041260570287704, "epoch": 0.9915745129015271, "grad_norm": 0.2607569992542267, "learning_rate": 0.00019418848997585842, "loss": 0.18007442355155945, "mean_token_accuracy": 0.9283247590065002, "num_tokens": 23228688.0, "step": 1883 }, { "entropy": 1.0119262784719467, "epoch": 0.9921011058451816, "grad_norm": 0.2691285312175751, "learning_rate": 0.00019418073542946577, "loss": 0.2185424566268921, "mean_token_accuracy": 0.9108522534370422, "num_tokens": 23241024.0, "step": 1884 }, { "entropy": 1.0200906693935394, "epoch": 0.9926276987888363, "grad_norm": 0.2762972414493561, "learning_rate": 0.0001941729758857535, "loss": 0.21047905087471008, "mean_token_accuracy": 0.921312689781189, "num_tokens": 23253360.0, "step": 1885 }, { "entropy": 1.0015190541744232, "epoch": 0.9931542917324908, "grad_norm": 0.2789957523345947, "learning_rate": 0.0001941652113451822, "loss": 0.22564658522605896, "mean_token_accuracy": 0.9052274376153946, "num_tokens": 23265696.0, "step": 1886 }, { "entropy": 1.0212842226028442, "epoch": 0.9936808846761453, "grad_norm": 0.2787906527519226, "learning_rate": 0.00019415744180821293, "loss": 0.19954261183738708, "mean_token_accuracy": 0.9225759655237198, "num_tokens": 23278032.0, "step": 1887 }, { "entropy": 1.0256837606430054, "epoch": 0.9942074776197999, "grad_norm": 0.3047766089439392, "learning_rate": 0.0001941496672753068, "loss": 0.22101764380931854, "mean_token_accuracy": 0.9100571721792221, "num_tokens": 23290368.0, "step": 1888 }, { "entropy": 1.0017095357179642, "epoch": 0.9947340705634544, "grad_norm": 0.3079693913459778, "learning_rate": 0.00019414188774692542, "loss": 0.23877866566181183, "mean_token_accuracy": 0.9044640958309174, "num_tokens": 23302704.0, "step": 1889 }, { "entropy": 0.9979955106973648, "epoch": 0.995260663507109, "grad_norm": 0.28942957520484924, "learning_rate": 0.00019413410322353055, "loss": 0.21703916788101196, "mean_token_accuracy": 0.911283403635025, "num_tokens": 23315040.0, "step": 1890 }, { "entropy": 1.000881314277649, "epoch": 0.9957872564507636, "grad_norm": 0.2723085582256317, "learning_rate": 0.00019412631370558433, "loss": 0.2083275318145752, "mean_token_accuracy": 0.9137948602437973, "num_tokens": 23327376.0, "step": 1891 }, { "entropy": 0.9760307371616364, "epoch": 0.9963138493944181, "grad_norm": 0.28710952401161194, "learning_rate": 0.00019411851919354925, "loss": 0.2206597775220871, "mean_token_accuracy": 0.913771316409111, "num_tokens": 23339712.0, "step": 1892 }, { "entropy": 1.0313685238361359, "epoch": 0.9968404423380727, "grad_norm": 0.2784387767314911, "learning_rate": 0.00019411071968788792, "loss": 0.20836740732192993, "mean_token_accuracy": 0.9158921986818314, "num_tokens": 23352048.0, "step": 1893 }, { "entropy": 0.9972709268331528, "epoch": 0.9973670352817272, "grad_norm": 0.2760670781135559, "learning_rate": 0.00019410291518906337, "loss": 0.215082049369812, "mean_token_accuracy": 0.9125083088874817, "num_tokens": 23364384.0, "step": 1894 }, { "entropy": 0.9749780297279358, "epoch": 0.9978936282253817, "grad_norm": 0.2756492793560028, "learning_rate": 0.00019409510569753897, "loss": 0.19914628565311432, "mean_token_accuracy": 0.9158760160207748, "num_tokens": 23376720.0, "step": 1895 }, { "entropy": 0.9882865399122238, "epoch": 0.9984202211690363, "grad_norm": 0.3229084610939026, "learning_rate": 0.00019408729121377828, "loss": 0.21740438044071198, "mean_token_accuracy": 0.9149737656116486, "num_tokens": 23389056.0, "step": 1896 }, { "entropy": 0.979081466794014, "epoch": 0.9989468141126909, "grad_norm": 0.2839930057525635, "learning_rate": 0.00019407947173824522, "loss": 0.20839889347553253, "mean_token_accuracy": 0.9204780906438828, "num_tokens": 23401392.0, "step": 1897 }, { "entropy": 0.9407005459070206, "epoch": 0.9994734070563455, "grad_norm": 0.28035539388656616, "learning_rate": 0.00019407164727140396, "loss": 0.2062290906906128, "mean_token_accuracy": 0.9152461290359497, "num_tokens": 23413728.0, "step": 1898 }, { "entropy": 0.9624819904565811, "epoch": 1.0, "grad_norm": 0.29015156626701355, "learning_rate": 0.00019406381781371902, "loss": 0.21500550210475922, "mean_token_accuracy": 0.915779635310173, "num_tokens": 23425036.0, "step": 1899 }, { "epoch": 1.0, "eval_entropy": 0.925739836008565, "eval_loss": 0.21148517727851868, "eval_mean_token_accuracy": 0.9153817107703826, "eval_num_tokens": 23425036.0, "eval_runtime": 664.4914, "eval_samples_per_second": 8.573, "eval_steps_per_second": 2.858, "step": 1899 } ], "logging_steps": 1, "max_steps": 13293, "num_input_tokens_seen": 0, "num_train_epochs": 7, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.6346022728450111e+19, "train_batch_size": 3, "trial_name": null, "trial_params": null }