{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 500, "global_step": 9495, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.5241050124168396, "epoch": 0.000526592943654555, "grad_norm": 111.6484146118164, "learning_rate": 0.0, "loss": 7.630620002746582, "mean_token_accuracy": 0.16127368062734604, "num_tokens": 12336.0, "step": 1 }, { "entropy": 1.5055236518383026, "epoch": 0.00105318588730911, "grad_norm": 111.12712097167969, "learning_rate": 5.012531328320802e-07, "loss": 7.332417964935303, "mean_token_accuracy": 0.17185717076063156, "num_tokens": 24672.0, "step": 2 }, { "entropy": 1.5026952624320984, "epoch": 0.001579778830963665, "grad_norm": 112.11380767822266, "learning_rate": 1.0025062656641603e-06, "loss": 7.473679542541504, "mean_token_accuracy": 0.1643187664449215, "num_tokens": 37008.0, "step": 3 }, { "entropy": 1.5194158256053925, "epoch": 0.00210637177461822, "grad_norm": 114.23673248291016, "learning_rate": 1.5037593984962406e-06, "loss": 7.426502704620361, "mean_token_accuracy": 0.1571561936289072, "num_tokens": 49344.0, "step": 4 }, { "entropy": 1.496931940317154, "epoch": 0.0026329647182727752, "grad_norm": 118.40357208251953, "learning_rate": 2.0050125313283207e-06, "loss": 7.894323348999023, "mean_token_accuracy": 0.1548401154577732, "num_tokens": 61680.0, "step": 5 }, { "entropy": 1.5049863159656525, "epoch": 0.00315955766192733, "grad_norm": 104.21913146972656, "learning_rate": 2.506265664160401e-06, "loss": 6.593452453613281, "mean_token_accuracy": 0.20564104989171028, "num_tokens": 74016.0, "step": 6 }, { "entropy": 1.4925725162029266, "epoch": 0.003686150605581885, "grad_norm": 114.10234069824219, "learning_rate": 3.007518796992481e-06, "loss": 7.3693318367004395, "mean_token_accuracy": 0.16597539372742176, "num_tokens": 86352.0, "step": 7 }, { "entropy": 1.5191607773303986, "epoch": 0.00421274354923644, "grad_norm": 115.99723815917969, "learning_rate": 3.5087719298245615e-06, "loss": 7.358461856842041, "mean_token_accuracy": 0.16679511591792107, "num_tokens": 98688.0, "step": 8 }, { "entropy": 1.5183644592761993, "epoch": 0.004739336492890996, "grad_norm": 106.1409912109375, "learning_rate": 4.010025062656641e-06, "loss": 6.668917655944824, "mean_token_accuracy": 0.18950679898262024, "num_tokens": 111024.0, "step": 9 }, { "entropy": 1.5116282999515533, "epoch": 0.0052659294365455505, "grad_norm": 110.57721710205078, "learning_rate": 4.511278195488722e-06, "loss": 6.99241304397583, "mean_token_accuracy": 0.18210845813155174, "num_tokens": 123360.0, "step": 10 }, { "entropy": 1.5269342362880707, "epoch": 0.005792522380200105, "grad_norm": 120.43307495117188, "learning_rate": 5.012531328320802e-06, "loss": 7.586757659912109, "mean_token_accuracy": 0.1462114453315735, "num_tokens": 135696.0, "step": 11 }, { "entropy": 1.5252384543418884, "epoch": 0.00631911532385466, "grad_norm": 111.8587875366211, "learning_rate": 5.5137844611528826e-06, "loss": 7.363627910614014, "mean_token_accuracy": 0.17107644863426685, "num_tokens": 148032.0, "step": 12 }, { "entropy": 1.5224651992321014, "epoch": 0.006845708267509215, "grad_norm": 107.8873291015625, "learning_rate": 6.015037593984962e-06, "loss": 6.356827735900879, "mean_token_accuracy": 0.19671257957816124, "num_tokens": 160368.0, "step": 13 }, { "entropy": 1.5416274964809418, "epoch": 0.00737230121116377, "grad_norm": 115.19085693359375, "learning_rate": 6.516290726817042e-06, "loss": 6.221941947937012, "mean_token_accuracy": 0.2142542451620102, "num_tokens": 172704.0, "step": 14 }, { "entropy": 1.5107212960720062, "epoch": 0.007898894154818325, "grad_norm": 110.73648834228516, "learning_rate": 7.017543859649123e-06, "loss": 6.397078514099121, "mean_token_accuracy": 0.20885847136378288, "num_tokens": 185040.0, "step": 15 }, { "entropy": 1.5597798526287079, "epoch": 0.00842548709847288, "grad_norm": 99.72173309326172, "learning_rate": 7.518796992481203e-06, "loss": 5.646764278411865, "mean_token_accuracy": 0.24349310994148254, "num_tokens": 197376.0, "step": 16 }, { "entropy": 1.5534575581550598, "epoch": 0.008952080042127435, "grad_norm": 104.43334197998047, "learning_rate": 8.020050125313283e-06, "loss": 5.892775535583496, "mean_token_accuracy": 0.22073492035269737, "num_tokens": 209712.0, "step": 17 }, { "entropy": 1.5676631033420563, "epoch": 0.009478672985781991, "grad_norm": 99.27777099609375, "learning_rate": 8.521303258145363e-06, "loss": 5.239416599273682, "mean_token_accuracy": 0.26043422892689705, "num_tokens": 222048.0, "step": 18 }, { "entropy": 1.5712612569332123, "epoch": 0.010005265929436546, "grad_norm": 94.56501770019531, "learning_rate": 9.022556390977444e-06, "loss": 5.018033981323242, "mean_token_accuracy": 0.2874941825866699, "num_tokens": 234384.0, "step": 19 }, { "entropy": 1.5856993794441223, "epoch": 0.010531858873091101, "grad_norm": 103.30012512207031, "learning_rate": 9.523809523809523e-06, "loss": 5.112401485443115, "mean_token_accuracy": 0.26686083525419235, "num_tokens": 246720.0, "step": 20 }, { "entropy": 1.542406052350998, "epoch": 0.011058451816745656, "grad_norm": 73.81751251220703, "learning_rate": 1.0025062656641604e-05, "loss": 3.298715353012085, "mean_token_accuracy": 0.42641731351614, "num_tokens": 259056.0, "step": 21 }, { "entropy": 1.5376673340797424, "epoch": 0.01158504476040021, "grad_norm": 74.847900390625, "learning_rate": 1.0526315789473684e-05, "loss": 3.5809030532836914, "mean_token_accuracy": 0.40752222388982773, "num_tokens": 271392.0, "step": 22 }, { "entropy": 1.548084020614624, "epoch": 0.012111637704054766, "grad_norm": 63.552825927734375, "learning_rate": 1.1027568922305765e-05, "loss": 3.100147247314453, "mean_token_accuracy": 0.45311493426561356, "num_tokens": 283728.0, "step": 23 }, { "entropy": 1.5953525304794312, "epoch": 0.01263823064770932, "grad_norm": 60.015655517578125, "learning_rate": 1.1528822055137844e-05, "loss": 2.783557176589966, "mean_token_accuracy": 0.47465962916612625, "num_tokens": 296064.0, "step": 24 }, { "entropy": 1.5308564603328705, "epoch": 0.013164823591363875, "grad_norm": 40.24797821044922, "learning_rate": 1.2030075187969925e-05, "loss": 2.171975612640381, "mean_token_accuracy": 0.5734862834215164, "num_tokens": 308400.0, "step": 25 }, { "entropy": 1.5149377882480621, "epoch": 0.01369141653501843, "grad_norm": 31.702476501464844, "learning_rate": 1.2531328320802006e-05, "loss": 1.907788634300232, "mean_token_accuracy": 0.6134172528982162, "num_tokens": 320736.0, "step": 26 }, { "entropy": 1.4917882978916168, "epoch": 0.014218009478672985, "grad_norm": 20.41485023498535, "learning_rate": 1.3032581453634085e-05, "loss": 1.6917057037353516, "mean_token_accuracy": 0.6387842893600464, "num_tokens": 333072.0, "step": 27 }, { "entropy": 1.4882407486438751, "epoch": 0.01474460242232754, "grad_norm": 15.065500259399414, "learning_rate": 1.3533834586466165e-05, "loss": 1.4968407154083252, "mean_token_accuracy": 0.6677049100399017, "num_tokens": 345408.0, "step": 28 }, { "entropy": 1.4370096921920776, "epoch": 0.015271195365982097, "grad_norm": 10.740882873535156, "learning_rate": 1.4035087719298246e-05, "loss": 1.3545355796813965, "mean_token_accuracy": 0.698340117931366, "num_tokens": 357744.0, "step": 29 }, { "entropy": 1.341864824295044, "epoch": 0.01579778830963665, "grad_norm": 3.3069381713867188, "learning_rate": 1.4536340852130325e-05, "loss": 1.0850293636322021, "mean_token_accuracy": 0.7386660128831863, "num_tokens": 370080.0, "step": 30 }, { "entropy": 1.4095737040042877, "epoch": 0.016324381253291206, "grad_norm": 2.9421474933624268, "learning_rate": 1.5037593984962406e-05, "loss": 1.1328743696212769, "mean_token_accuracy": 0.7404871881008148, "num_tokens": 382416.0, "step": 31 }, { "entropy": 1.4024023413658142, "epoch": 0.01685097419694576, "grad_norm": 2.5040762424468994, "learning_rate": 1.5538847117794486e-05, "loss": 1.1228951215744019, "mean_token_accuracy": 0.7428316622972488, "num_tokens": 394752.0, "step": 32 }, { "entropy": 1.3549567759037018, "epoch": 0.017377567140600316, "grad_norm": 1.7973337173461914, "learning_rate": 1.6040100250626565e-05, "loss": 1.0077903270721436, "mean_token_accuracy": 0.766022652387619, "num_tokens": 407088.0, "step": 33 }, { "entropy": 1.3836270570755005, "epoch": 0.01790416008425487, "grad_norm": 1.7406286001205444, "learning_rate": 1.6541353383458648e-05, "loss": 1.0222362279891968, "mean_token_accuracy": 0.7626231610774994, "num_tokens": 419424.0, "step": 34 }, { "entropy": 1.3947510421276093, "epoch": 0.018430753027909426, "grad_norm": 1.8865187168121338, "learning_rate": 1.7042606516290727e-05, "loss": 1.0371894836425781, "mean_token_accuracy": 0.7562028616666794, "num_tokens": 431760.0, "step": 35 }, { "entropy": 1.3465319573879242, "epoch": 0.018957345971563982, "grad_norm": 1.7011761665344238, "learning_rate": 1.7543859649122806e-05, "loss": 0.9494946599006653, "mean_token_accuracy": 0.7783531844615936, "num_tokens": 444096.0, "step": 36 }, { "entropy": 1.4580606818199158, "epoch": 0.019483938915218536, "grad_norm": 1.9021601676940918, "learning_rate": 1.8045112781954888e-05, "loss": 1.0398352146148682, "mean_token_accuracy": 0.7636931091547012, "num_tokens": 456432.0, "step": 37 }, { "entropy": 1.4095810949802399, "epoch": 0.020010531858873092, "grad_norm": 1.6176142692565918, "learning_rate": 1.8546365914786967e-05, "loss": 0.9648343324661255, "mean_token_accuracy": 0.763045608997345, "num_tokens": 468768.0, "step": 38 }, { "entropy": 1.4290408492088318, "epoch": 0.020537124802527645, "grad_norm": 1.802105188369751, "learning_rate": 1.9047619047619046e-05, "loss": 0.9583951234817505, "mean_token_accuracy": 0.7706119865179062, "num_tokens": 481104.0, "step": 39 }, { "entropy": 1.4769366383552551, "epoch": 0.021063717746182202, "grad_norm": 1.8512225151062012, "learning_rate": 1.954887218045113e-05, "loss": 1.0114065408706665, "mean_token_accuracy": 0.7521056234836578, "num_tokens": 493440.0, "step": 40 }, { "entropy": 1.508185237646103, "epoch": 0.021590310689836755, "grad_norm": 2.076702356338501, "learning_rate": 2.0050125313283208e-05, "loss": 0.9636508226394653, "mean_token_accuracy": 0.7661653459072113, "num_tokens": 505776.0, "step": 41 }, { "entropy": 1.459254652261734, "epoch": 0.022116903633491312, "grad_norm": 2.349229335784912, "learning_rate": 2.0551378446115287e-05, "loss": 0.9206173419952393, "mean_token_accuracy": 0.7662864923477173, "num_tokens": 518112.0, "step": 42 }, { "entropy": 1.5238048434257507, "epoch": 0.022643496577145865, "grad_norm": 2.185512065887451, "learning_rate": 2.105263157894737e-05, "loss": 0.9314085245132446, "mean_token_accuracy": 0.7649829983711243, "num_tokens": 530448.0, "step": 43 }, { "entropy": 1.5003608763217926, "epoch": 0.02317008952080042, "grad_norm": 2.0811667442321777, "learning_rate": 2.1553884711779448e-05, "loss": 0.8671697974205017, "mean_token_accuracy": 0.7754391133785248, "num_tokens": 542784.0, "step": 44 }, { "entropy": 1.591546893119812, "epoch": 0.023696682464454975, "grad_norm": 2.0840373039245605, "learning_rate": 2.205513784461153e-05, "loss": 0.872833251953125, "mean_token_accuracy": 0.7740741670131683, "num_tokens": 555120.0, "step": 45 }, { "entropy": 1.6416102647781372, "epoch": 0.02422327540810953, "grad_norm": 2.033761501312256, "learning_rate": 2.255639097744361e-05, "loss": 0.8919705152511597, "mean_token_accuracy": 0.7629313617944717, "num_tokens": 567456.0, "step": 46 }, { "entropy": 1.6393465399742126, "epoch": 0.024749868351764088, "grad_norm": 1.7740504741668701, "learning_rate": 2.3057644110275688e-05, "loss": 0.8117689490318298, "mean_token_accuracy": 0.7816901206970215, "num_tokens": 579792.0, "step": 47 }, { "entropy": 1.6808819770812988, "epoch": 0.02527646129541864, "grad_norm": 1.4741381406784058, "learning_rate": 2.355889724310777e-05, "loss": 0.8110437393188477, "mean_token_accuracy": 0.7762878388166428, "num_tokens": 592128.0, "step": 48 }, { "entropy": 1.7813679873943329, "epoch": 0.025803054239073198, "grad_norm": 1.135923147201538, "learning_rate": 2.406015037593985e-05, "loss": 0.8597409129142761, "mean_token_accuracy": 0.7689527124166489, "num_tokens": 604464.0, "step": 49 }, { "entropy": 1.7125210165977478, "epoch": 0.02632964718272775, "grad_norm": 1.0037126541137695, "learning_rate": 2.456140350877193e-05, "loss": 0.7560303807258606, "mean_token_accuracy": 0.7888963371515274, "num_tokens": 616800.0, "step": 50 }, { "entropy": 1.7505145072937012, "epoch": 0.026856240126382307, "grad_norm": 0.9906253218650818, "learning_rate": 2.506265664160401e-05, "loss": 0.7666164636611938, "mean_token_accuracy": 0.7822892367839813, "num_tokens": 629136.0, "step": 51 }, { "entropy": 1.8206515610218048, "epoch": 0.02738283307003686, "grad_norm": 1.0637407302856445, "learning_rate": 2.556390977443609e-05, "loss": 0.7570075988769531, "mean_token_accuracy": 0.7857469767332077, "num_tokens": 641472.0, "step": 52 }, { "entropy": 1.9179592430591583, "epoch": 0.027909426013691417, "grad_norm": 0.994309663772583, "learning_rate": 2.606516290726817e-05, "loss": 0.8264732956886292, "mean_token_accuracy": 0.7659910470247269, "num_tokens": 653808.0, "step": 53 }, { "entropy": 1.8192859292030334, "epoch": 0.02843601895734597, "grad_norm": 1.283566951751709, "learning_rate": 2.656641604010025e-05, "loss": 0.7167642712593079, "mean_token_accuracy": 0.7935251444578171, "num_tokens": 666144.0, "step": 54 }, { "entropy": 1.8640032410621643, "epoch": 0.028962611901000527, "grad_norm": 0.993376612663269, "learning_rate": 2.706766917293233e-05, "loss": 0.732735276222229, "mean_token_accuracy": 0.7889553904533386, "num_tokens": 678480.0, "step": 55 }, { "entropy": 1.9309577941894531, "epoch": 0.02948920484465508, "grad_norm": 0.952996551990509, "learning_rate": 2.756892230576441e-05, "loss": 0.7183045148849487, "mean_token_accuracy": 0.7865996956825256, "num_tokens": 690816.0, "step": 56 }, { "entropy": 1.9969252347946167, "epoch": 0.030015797788309637, "grad_norm": 0.9141530990600586, "learning_rate": 2.8070175438596492e-05, "loss": 0.7127647399902344, "mean_token_accuracy": 0.7965414077043533, "num_tokens": 703152.0, "step": 57 }, { "entropy": 1.9162320494651794, "epoch": 0.030542390731964193, "grad_norm": 1.0311601161956787, "learning_rate": 2.857142857142857e-05, "loss": 0.6988133788108826, "mean_token_accuracy": 0.7964022308588028, "num_tokens": 715488.0, "step": 58 }, { "entropy": 1.9365825355052948, "epoch": 0.031068983675618746, "grad_norm": 0.8333176374435425, "learning_rate": 2.907268170426065e-05, "loss": 0.6844547986984253, "mean_token_accuracy": 0.8021096438169479, "num_tokens": 727824.0, "step": 59 }, { "entropy": 1.9246950447559357, "epoch": 0.0315955766192733, "grad_norm": 0.8664101362228394, "learning_rate": 2.9573934837092732e-05, "loss": 0.6528723239898682, "mean_token_accuracy": 0.8053467720746994, "num_tokens": 740160.0, "step": 60 }, { "entropy": 1.929794728755951, "epoch": 0.032122169562927856, "grad_norm": 0.9577063918113708, "learning_rate": 3.007518796992481e-05, "loss": 0.678918719291687, "mean_token_accuracy": 0.7989283800125122, "num_tokens": 752496.0, "step": 61 }, { "entropy": 1.826391577720642, "epoch": 0.03264876250658241, "grad_norm": 0.8492108583450317, "learning_rate": 3.0576441102756894e-05, "loss": 0.6723799109458923, "mean_token_accuracy": 0.7983379364013672, "num_tokens": 764832.0, "step": 62 }, { "entropy": 1.9241991639137268, "epoch": 0.03317535545023697, "grad_norm": 0.928464412689209, "learning_rate": 3.107769423558897e-05, "loss": 0.6530962586402893, "mean_token_accuracy": 0.8008216470479965, "num_tokens": 777168.0, "step": 63 }, { "entropy": 1.8967448770999908, "epoch": 0.03370194839389152, "grad_norm": 1.0670896768569946, "learning_rate": 3.157894736842105e-05, "loss": 0.6292267441749573, "mean_token_accuracy": 0.8003135621547699, "num_tokens": 789504.0, "step": 64 }, { "entropy": 1.8847980499267578, "epoch": 0.034228541337546076, "grad_norm": 1.0110414028167725, "learning_rate": 3.208020050125313e-05, "loss": 0.6133747100830078, "mean_token_accuracy": 0.8148374855518341, "num_tokens": 801840.0, "step": 65 }, { "entropy": 1.930319905281067, "epoch": 0.03475513428120063, "grad_norm": 1.023224949836731, "learning_rate": 3.258145363408521e-05, "loss": 0.6123053431510925, "mean_token_accuracy": 0.8167780637741089, "num_tokens": 814176.0, "step": 66 }, { "entropy": 1.9471323192119598, "epoch": 0.03528172722485519, "grad_norm": 1.1810884475708008, "learning_rate": 3.3082706766917295e-05, "loss": 0.6039740443229675, "mean_token_accuracy": 0.8179137706756592, "num_tokens": 826512.0, "step": 67 }, { "entropy": 1.8890258967876434, "epoch": 0.03580832016850974, "grad_norm": 0.9907887578010559, "learning_rate": 3.3583959899749374e-05, "loss": 0.599247932434082, "mean_token_accuracy": 0.8207112550735474, "num_tokens": 838848.0, "step": 68 }, { "entropy": 1.9326116144657135, "epoch": 0.036334913112164295, "grad_norm": 1.0037294626235962, "learning_rate": 3.4085213032581453e-05, "loss": 0.5630755424499512, "mean_token_accuracy": 0.8216072916984558, "num_tokens": 851184.0, "step": 69 }, { "entropy": 1.925311028957367, "epoch": 0.03686150605581885, "grad_norm": 1.1875734329223633, "learning_rate": 3.458646616541353e-05, "loss": 0.5733011364936829, "mean_token_accuracy": 0.8164849728345871, "num_tokens": 863520.0, "step": 70 }, { "entropy": 2.051402121782303, "epoch": 0.03738809899947341, "grad_norm": 1.162881851196289, "learning_rate": 3.508771929824561e-05, "loss": 0.550703763961792, "mean_token_accuracy": 0.8178133964538574, "num_tokens": 875856.0, "step": 71 }, { "entropy": 1.9634678363800049, "epoch": 0.037914691943127965, "grad_norm": 0.9865695834159851, "learning_rate": 3.55889724310777e-05, "loss": 0.5769374966621399, "mean_token_accuracy": 0.8114093840122223, "num_tokens": 888192.0, "step": 72 }, { "entropy": 1.9920983016490936, "epoch": 0.038441284886782515, "grad_norm": 1.0162739753723145, "learning_rate": 3.6090225563909776e-05, "loss": 0.5818509459495544, "mean_token_accuracy": 0.8134536445140839, "num_tokens": 900528.0, "step": 73 }, { "entropy": 1.9029254913330078, "epoch": 0.03896787783043707, "grad_norm": 0.9538004398345947, "learning_rate": 3.6591478696741855e-05, "loss": 0.5178959369659424, "mean_token_accuracy": 0.8257192969322205, "num_tokens": 912864.0, "step": 74 }, { "entropy": 1.967795580625534, "epoch": 0.03949447077409163, "grad_norm": 0.9578227996826172, "learning_rate": 3.7092731829573934e-05, "loss": 0.5342862010002136, "mean_token_accuracy": 0.8278465121984482, "num_tokens": 925200.0, "step": 75 }, { "entropy": 1.9465965926647186, "epoch": 0.040021063717746184, "grad_norm": 1.0253666639328003, "learning_rate": 3.759398496240601e-05, "loss": 0.5030800104141235, "mean_token_accuracy": 0.83804552257061, "num_tokens": 937536.0, "step": 76 }, { "entropy": 1.8636894226074219, "epoch": 0.040547656661400734, "grad_norm": 0.8184434771537781, "learning_rate": 3.809523809523809e-05, "loss": 0.45680901408195496, "mean_token_accuracy": 0.8485544174909592, "num_tokens": 949872.0, "step": 77 }, { "entropy": 1.928781270980835, "epoch": 0.04107424960505529, "grad_norm": 0.8536883592605591, "learning_rate": 3.859649122807018e-05, "loss": 0.4830615818500519, "mean_token_accuracy": 0.8397646248340607, "num_tokens": 962208.0, "step": 78 }, { "entropy": 1.8684503734111786, "epoch": 0.04160084254870985, "grad_norm": 0.868567168712616, "learning_rate": 3.909774436090226e-05, "loss": 0.49555566906929016, "mean_token_accuracy": 0.8393678069114685, "num_tokens": 974544.0, "step": 79 }, { "entropy": 1.832389086484909, "epoch": 0.042127435492364404, "grad_norm": 0.7834892868995667, "learning_rate": 3.9598997493734336e-05, "loss": 0.4530882239341736, "mean_token_accuracy": 0.8548341691493988, "num_tokens": 986880.0, "step": 80 }, { "entropy": 1.8249096870422363, "epoch": 0.04265402843601896, "grad_norm": 0.7752470374107361, "learning_rate": 4.0100250626566415e-05, "loss": 0.4578617215156555, "mean_token_accuracy": 0.8508521616458893, "num_tokens": 999216.0, "step": 81 }, { "entropy": 1.9078024625778198, "epoch": 0.04318062137967351, "grad_norm": 0.7781356573104858, "learning_rate": 4.0601503759398494e-05, "loss": 0.43578821420669556, "mean_token_accuracy": 0.8600046187639236, "num_tokens": 1011552.0, "step": 82 }, { "entropy": 1.8074560463428497, "epoch": 0.04370721432332807, "grad_norm": 0.7703754305839539, "learning_rate": 4.110275689223057e-05, "loss": 0.4543125629425049, "mean_token_accuracy": 0.8561971783638, "num_tokens": 1023888.0, "step": 83 }, { "entropy": 1.7470267415046692, "epoch": 0.044233807266982623, "grad_norm": 0.6839037537574768, "learning_rate": 4.160401002506266e-05, "loss": 0.4043883681297302, "mean_token_accuracy": 0.8632047474384308, "num_tokens": 1036224.0, "step": 84 }, { "entropy": 1.8056954443454742, "epoch": 0.04476040021063718, "grad_norm": 0.8745210766792297, "learning_rate": 4.210526315789474e-05, "loss": 0.4576418101787567, "mean_token_accuracy": 0.8515569567680359, "num_tokens": 1048560.0, "step": 85 }, { "entropy": 1.7271961271762848, "epoch": 0.04528699315429173, "grad_norm": 0.7987569570541382, "learning_rate": 4.260651629072682e-05, "loss": 0.4062059819698334, "mean_token_accuracy": 0.8644601851701736, "num_tokens": 1060896.0, "step": 86 }, { "entropy": 1.7829216122627258, "epoch": 0.045813586097946286, "grad_norm": 0.8260216116905212, "learning_rate": 4.3107769423558896e-05, "loss": 0.4285086989402771, "mean_token_accuracy": 0.8619498312473297, "num_tokens": 1073232.0, "step": 87 }, { "entropy": 1.720045566558838, "epoch": 0.04634017904160084, "grad_norm": 0.8638037443161011, "learning_rate": 4.3609022556390975e-05, "loss": 0.42514118552207947, "mean_token_accuracy": 0.8556364923715591, "num_tokens": 1085568.0, "step": 88 }, { "entropy": 1.749743402004242, "epoch": 0.0468667719852554, "grad_norm": 0.6750407218933105, "learning_rate": 4.411027568922306e-05, "loss": 0.3981553912162781, "mean_token_accuracy": 0.8708555996417999, "num_tokens": 1097904.0, "step": 89 }, { "entropy": 1.785173624753952, "epoch": 0.04739336492890995, "grad_norm": 0.7802124619483948, "learning_rate": 4.461152882205514e-05, "loss": 0.3845086097717285, "mean_token_accuracy": 0.8747637271881104, "num_tokens": 1110240.0, "step": 90 }, { "entropy": 1.7087633907794952, "epoch": 0.047919957872564506, "grad_norm": 0.8488918542861938, "learning_rate": 4.511278195488722e-05, "loss": 0.3644571006298065, "mean_token_accuracy": 0.8757548332214355, "num_tokens": 1122576.0, "step": 91 }, { "entropy": 1.6821248829364777, "epoch": 0.04844655081621906, "grad_norm": 0.7744936943054199, "learning_rate": 4.56140350877193e-05, "loss": 0.40767285227775574, "mean_token_accuracy": 0.8596755862236023, "num_tokens": 1134912.0, "step": 92 }, { "entropy": 1.7099383771419525, "epoch": 0.04897314375987362, "grad_norm": 0.9390520453453064, "learning_rate": 4.6115288220551377e-05, "loss": 0.4450380802154541, "mean_token_accuracy": 0.8517685830593109, "num_tokens": 1147248.0, "step": 93 }, { "entropy": 1.6644540429115295, "epoch": 0.049499736703528176, "grad_norm": 0.9382246136665344, "learning_rate": 4.6616541353383456e-05, "loss": 0.37574899196624756, "mean_token_accuracy": 0.8736520707607269, "num_tokens": 1159584.0, "step": 94 }, { "entropy": 1.7045432031154633, "epoch": 0.050026329647182725, "grad_norm": 0.784248948097229, "learning_rate": 4.711779448621554e-05, "loss": 0.39656203985214233, "mean_token_accuracy": 0.8673653900623322, "num_tokens": 1171920.0, "step": 95 }, { "entropy": 1.6858630180358887, "epoch": 0.05055292259083728, "grad_norm": 0.7153828144073486, "learning_rate": 4.761904761904762e-05, "loss": 0.3821033835411072, "mean_token_accuracy": 0.870804488658905, "num_tokens": 1184256.0, "step": 96 }, { "entropy": 1.5798078775405884, "epoch": 0.05107951553449184, "grad_norm": 0.6857785582542419, "learning_rate": 4.81203007518797e-05, "loss": 0.3593214452266693, "mean_token_accuracy": 0.8746844828128815, "num_tokens": 1196592.0, "step": 97 }, { "entropy": 1.670957088470459, "epoch": 0.051606108478146395, "grad_norm": 0.7506043910980225, "learning_rate": 4.862155388471178e-05, "loss": 0.3727911412715912, "mean_token_accuracy": 0.8756437748670578, "num_tokens": 1208928.0, "step": 98 }, { "entropy": 1.5233455896377563, "epoch": 0.052132701421800945, "grad_norm": 0.7735759019851685, "learning_rate": 4.912280701754386e-05, "loss": 0.37093132734298706, "mean_token_accuracy": 0.8704032748937607, "num_tokens": 1221264.0, "step": 99 }, { "entropy": 1.6192973852157593, "epoch": 0.0526592943654555, "grad_norm": 0.7478036880493164, "learning_rate": 4.9624060150375936e-05, "loss": 0.3426092863082886, "mean_token_accuracy": 0.8861435055732727, "num_tokens": 1233600.0, "step": 100 }, { "entropy": 1.493833750486374, "epoch": 0.05318588730911006, "grad_norm": 0.7044211030006409, "learning_rate": 5.012531328320802e-05, "loss": 0.35205507278442383, "mean_token_accuracy": 0.8778510093688965, "num_tokens": 1245936.0, "step": 101 }, { "entropy": 1.4939774870872498, "epoch": 0.053712480252764615, "grad_norm": 0.7720161080360413, "learning_rate": 5.06265664160401e-05, "loss": 0.3975054621696472, "mean_token_accuracy": 0.8641460090875626, "num_tokens": 1258272.0, "step": 102 }, { "entropy": 1.6101951897144318, "epoch": 0.05423907319641917, "grad_norm": 0.669315755367279, "learning_rate": 5.112781954887218e-05, "loss": 0.34713947772979736, "mean_token_accuracy": 0.8790434300899506, "num_tokens": 1270608.0, "step": 103 }, { "entropy": 1.5196483135223389, "epoch": 0.05476566614007372, "grad_norm": 0.8516085743904114, "learning_rate": 5.162907268170426e-05, "loss": 0.3601211607456207, "mean_token_accuracy": 0.8756401091814041, "num_tokens": 1282944.0, "step": 104 }, { "entropy": 1.4721749424934387, "epoch": 0.05529225908372828, "grad_norm": 0.8156314492225647, "learning_rate": 5.213032581453634e-05, "loss": 0.3697987198829651, "mean_token_accuracy": 0.8728637546300888, "num_tokens": 1295280.0, "step": 105 }, { "entropy": 1.4663786590099335, "epoch": 0.055818852027382834, "grad_norm": 0.6453195810317993, "learning_rate": 5.2631578947368424e-05, "loss": 0.3338157534599304, "mean_token_accuracy": 0.8864734172821045, "num_tokens": 1307616.0, "step": 106 }, { "entropy": 1.497151494026184, "epoch": 0.05634544497103739, "grad_norm": 0.7146667242050171, "learning_rate": 5.31328320802005e-05, "loss": 0.34923166036605835, "mean_token_accuracy": 0.8819292187690735, "num_tokens": 1319952.0, "step": 107 }, { "entropy": 1.5161625444889069, "epoch": 0.05687203791469194, "grad_norm": 0.8290141820907593, "learning_rate": 5.363408521303258e-05, "loss": 0.3371197581291199, "mean_token_accuracy": 0.8877773582935333, "num_tokens": 1332288.0, "step": 108 }, { "entropy": 1.4333459436893463, "epoch": 0.0573986308583465, "grad_norm": 0.8022440671920776, "learning_rate": 5.413533834586466e-05, "loss": 0.31702953577041626, "mean_token_accuracy": 0.8909593671560287, "num_tokens": 1344624.0, "step": 109 }, { "entropy": 1.4444147646427155, "epoch": 0.057925223802001054, "grad_norm": 0.7960955500602722, "learning_rate": 5.463659147869674e-05, "loss": 0.3525749742984772, "mean_token_accuracy": 0.8755318969488144, "num_tokens": 1356960.0, "step": 110 }, { "entropy": 1.469768613576889, "epoch": 0.05845181674565561, "grad_norm": 0.8183742165565491, "learning_rate": 5.513784461152882e-05, "loss": 0.3398601710796356, "mean_token_accuracy": 0.8840423971414566, "num_tokens": 1369296.0, "step": 111 }, { "entropy": 1.4481310844421387, "epoch": 0.05897840968931016, "grad_norm": 0.6801962852478027, "learning_rate": 5.5639097744360905e-05, "loss": 0.34869900345802307, "mean_token_accuracy": 0.877396434545517, "num_tokens": 1381632.0, "step": 112 }, { "entropy": 1.4586880207061768, "epoch": 0.05950500263296472, "grad_norm": 0.7105273008346558, "learning_rate": 5.6140350877192984e-05, "loss": 0.32431477308273315, "mean_token_accuracy": 0.8829907327890396, "num_tokens": 1393968.0, "step": 113 }, { "entropy": 1.4191592037677765, "epoch": 0.06003159557661927, "grad_norm": 0.8621596097946167, "learning_rate": 5.664160401002506e-05, "loss": 0.29889625310897827, "mean_token_accuracy": 0.8882533758878708, "num_tokens": 1406304.0, "step": 114 }, { "entropy": 1.431228756904602, "epoch": 0.06055818852027383, "grad_norm": 0.662341833114624, "learning_rate": 5.714285714285714e-05, "loss": 0.34662240743637085, "mean_token_accuracy": 0.8789393156766891, "num_tokens": 1418640.0, "step": 115 }, { "entropy": 1.317075937986374, "epoch": 0.061084781463928386, "grad_norm": 0.6940162777900696, "learning_rate": 5.764411027568922e-05, "loss": 0.3154875636100769, "mean_token_accuracy": 0.886825367808342, "num_tokens": 1430976.0, "step": 116 }, { "entropy": 1.3747568726539612, "epoch": 0.061611374407582936, "grad_norm": 0.6974264979362488, "learning_rate": 5.81453634085213e-05, "loss": 0.36218538880348206, "mean_token_accuracy": 0.8753509372472763, "num_tokens": 1443312.0, "step": 117 }, { "entropy": 1.3549829423427582, "epoch": 0.06213796735123749, "grad_norm": 0.7157356142997742, "learning_rate": 5.8646616541353386e-05, "loss": 0.32229024171829224, "mean_token_accuracy": 0.8855572938919067, "num_tokens": 1455648.0, "step": 118 }, { "entropy": 1.4570170640945435, "epoch": 0.06266456029489205, "grad_norm": 0.7710041999816895, "learning_rate": 5.9147869674185465e-05, "loss": 0.3285849094390869, "mean_token_accuracy": 0.8840549886226654, "num_tokens": 1467984.0, "step": 119 }, { "entropy": 1.4027460813522339, "epoch": 0.0631911532385466, "grad_norm": 0.6999377012252808, "learning_rate": 5.9649122807017544e-05, "loss": 0.3464536666870117, "mean_token_accuracy": 0.8799307644367218, "num_tokens": 1480320.0, "step": 120 }, { "entropy": 1.3301794826984406, "epoch": 0.06371774618220116, "grad_norm": 0.7836945056915283, "learning_rate": 6.015037593984962e-05, "loss": 0.3436964750289917, "mean_token_accuracy": 0.8764877319335938, "num_tokens": 1492656.0, "step": 121 }, { "entropy": 1.3585115671157837, "epoch": 0.06424433912585571, "grad_norm": 0.7850233316421509, "learning_rate": 6.06516290726817e-05, "loss": 0.35563230514526367, "mean_token_accuracy": 0.8757744282484055, "num_tokens": 1504992.0, "step": 122 }, { "entropy": 1.2973756194114685, "epoch": 0.06477093206951026, "grad_norm": 0.7351557612419128, "learning_rate": 6.115288220551379e-05, "loss": 0.3156384527683258, "mean_token_accuracy": 0.886470839381218, "num_tokens": 1517328.0, "step": 123 }, { "entropy": 1.3591448068618774, "epoch": 0.06529752501316483, "grad_norm": 0.7262402176856995, "learning_rate": 6.165413533834587e-05, "loss": 0.27420130372047424, "mean_token_accuracy": 0.904089480638504, "num_tokens": 1529664.0, "step": 124 }, { "entropy": 1.253787875175476, "epoch": 0.06582411795681938, "grad_norm": 0.6739073991775513, "learning_rate": 6.215538847117795e-05, "loss": 0.34957295656204224, "mean_token_accuracy": 0.879968523979187, "num_tokens": 1542000.0, "step": 125 }, { "entropy": 1.261105090379715, "epoch": 0.06635071090047394, "grad_norm": 0.7828674912452698, "learning_rate": 6.265664160401002e-05, "loss": 0.3064384460449219, "mean_token_accuracy": 0.8853085935115814, "num_tokens": 1554336.0, "step": 126 }, { "entropy": 1.2267013192176819, "epoch": 0.06687730384412849, "grad_norm": 0.9648973345756531, "learning_rate": 6.31578947368421e-05, "loss": 0.3406292498111725, "mean_token_accuracy": 0.8785828351974487, "num_tokens": 1566672.0, "step": 127 }, { "entropy": 1.2064116597175598, "epoch": 0.06740389678778304, "grad_norm": 0.8842466473579407, "learning_rate": 6.365914786967418e-05, "loss": 0.3578197658061981, "mean_token_accuracy": 0.8797773271799088, "num_tokens": 1579008.0, "step": 128 }, { "entropy": 1.1993357837200165, "epoch": 0.0679304897314376, "grad_norm": 0.8396037817001343, "learning_rate": 6.416040100250626e-05, "loss": 0.32377177476882935, "mean_token_accuracy": 0.8842920362949371, "num_tokens": 1591344.0, "step": 129 }, { "entropy": 1.2047476172447205, "epoch": 0.06845708267509215, "grad_norm": 0.6860671043395996, "learning_rate": 6.466165413533834e-05, "loss": 0.29577356576919556, "mean_token_accuracy": 0.896445706486702, "num_tokens": 1603680.0, "step": 130 }, { "entropy": 1.2046065032482147, "epoch": 0.06898367561874671, "grad_norm": 0.6543269157409668, "learning_rate": 6.516290726817042e-05, "loss": 0.2779792845249176, "mean_token_accuracy": 0.9030982404947281, "num_tokens": 1616016.0, "step": 131 }, { "entropy": 1.1669755578041077, "epoch": 0.06951026856240126, "grad_norm": 0.7457153797149658, "learning_rate": 6.566416040100251e-05, "loss": 0.3149452209472656, "mean_token_accuracy": 0.8876487761735916, "num_tokens": 1628352.0, "step": 132 }, { "entropy": 1.2609427571296692, "epoch": 0.07003686150605581, "grad_norm": 0.7485870122909546, "learning_rate": 6.616541353383459e-05, "loss": 0.31902027130126953, "mean_token_accuracy": 0.8813460171222687, "num_tokens": 1640688.0, "step": 133 }, { "entropy": 1.2575346231460571, "epoch": 0.07056345444971038, "grad_norm": 0.7213554382324219, "learning_rate": 6.666666666666667e-05, "loss": 0.2797701358795166, "mean_token_accuracy": 0.8987373113632202, "num_tokens": 1653024.0, "step": 134 }, { "entropy": 1.186894565820694, "epoch": 0.07109004739336493, "grad_norm": 0.7020873427391052, "learning_rate": 6.716791979949875e-05, "loss": 0.2995363771915436, "mean_token_accuracy": 0.8897402882575989, "num_tokens": 1665360.0, "step": 135 }, { "entropy": 1.161018431186676, "epoch": 0.07161664033701948, "grad_norm": 0.7155889868736267, "learning_rate": 6.766917293233083e-05, "loss": 0.2925366759300232, "mean_token_accuracy": 0.8951611965894699, "num_tokens": 1677696.0, "step": 136 }, { "entropy": 1.2650261223316193, "epoch": 0.07214323328067404, "grad_norm": 0.7642542123794556, "learning_rate": 6.817042606516291e-05, "loss": 0.2801384925842285, "mean_token_accuracy": 0.8974052667617798, "num_tokens": 1690032.0, "step": 137 }, { "entropy": 1.2530198991298676, "epoch": 0.07266982622432859, "grad_norm": 0.8588266372680664, "learning_rate": 6.867167919799499e-05, "loss": 0.3360725939273834, "mean_token_accuracy": 0.8794126808643341, "num_tokens": 1702368.0, "step": 138 }, { "entropy": 1.2518652081489563, "epoch": 0.07319641916798315, "grad_norm": 0.6655072569847107, "learning_rate": 6.917293233082706e-05, "loss": 0.2788892388343811, "mean_token_accuracy": 0.8994075357913971, "num_tokens": 1714704.0, "step": 139 }, { "entropy": 1.1829611957073212, "epoch": 0.0737230121116377, "grad_norm": 0.7172735333442688, "learning_rate": 6.967418546365914e-05, "loss": 0.2918061316013336, "mean_token_accuracy": 0.8959014713764191, "num_tokens": 1727040.0, "step": 140 }, { "entropy": 1.2773233950138092, "epoch": 0.07424960505529225, "grad_norm": 0.697880208492279, "learning_rate": 7.017543859649122e-05, "loss": 0.3217264711856842, "mean_token_accuracy": 0.8819008469581604, "num_tokens": 1739376.0, "step": 141 }, { "entropy": 1.2314070761203766, "epoch": 0.07477619799894682, "grad_norm": 0.701502799987793, "learning_rate": 7.06766917293233e-05, "loss": 0.29351311922073364, "mean_token_accuracy": 0.8908087462186813, "num_tokens": 1751712.0, "step": 142 }, { "entropy": 1.2544872462749481, "epoch": 0.07530279094260137, "grad_norm": 0.7028551697731018, "learning_rate": 7.11779448621554e-05, "loss": 0.3528595566749573, "mean_token_accuracy": 0.8716742098331451, "num_tokens": 1764048.0, "step": 143 }, { "entropy": 1.1984558403491974, "epoch": 0.07582938388625593, "grad_norm": 0.6910477876663208, "learning_rate": 7.167919799498747e-05, "loss": 0.3136734366416931, "mean_token_accuracy": 0.8870812356472015, "num_tokens": 1776384.0, "step": 144 }, { "entropy": 1.2033996284008026, "epoch": 0.07635597682991048, "grad_norm": 0.7239225506782532, "learning_rate": 7.218045112781955e-05, "loss": 0.2979337275028229, "mean_token_accuracy": 0.8915670961141586, "num_tokens": 1788720.0, "step": 145 }, { "entropy": 1.1562331318855286, "epoch": 0.07688256977356503, "grad_norm": 0.7481216192245483, "learning_rate": 7.268170426065163e-05, "loss": 0.2653358280658722, "mean_token_accuracy": 0.8980085849761963, "num_tokens": 1801056.0, "step": 146 }, { "entropy": 1.2064136862754822, "epoch": 0.07740916271721959, "grad_norm": 0.7776615023612976, "learning_rate": 7.318295739348371e-05, "loss": 0.2848292589187622, "mean_token_accuracy": 0.8949488550424576, "num_tokens": 1813392.0, "step": 147 }, { "entropy": 1.1387107968330383, "epoch": 0.07793575566087414, "grad_norm": 0.8243488669395447, "learning_rate": 7.368421052631579e-05, "loss": 0.31445616483688354, "mean_token_accuracy": 0.887312263250351, "num_tokens": 1825728.0, "step": 148 }, { "entropy": 1.0903229415416718, "epoch": 0.0784623486045287, "grad_norm": 0.775776207447052, "learning_rate": 7.418546365914787e-05, "loss": 0.2984585762023926, "mean_token_accuracy": 0.8886806517839432, "num_tokens": 1838064.0, "step": 149 }, { "entropy": 1.1340011656284332, "epoch": 0.07898894154818326, "grad_norm": 0.7941513657569885, "learning_rate": 7.468671679197995e-05, "loss": 0.27699777483940125, "mean_token_accuracy": 0.9033427834510803, "num_tokens": 1850400.0, "step": 150 }, { "entropy": 1.084587723016739, "epoch": 0.0795155344918378, "grad_norm": 0.7044249773025513, "learning_rate": 7.518796992481203e-05, "loss": 0.2815166711807251, "mean_token_accuracy": 0.8928717374801636, "num_tokens": 1862736.0, "step": 151 }, { "entropy": 1.0816469937562943, "epoch": 0.08004212743549237, "grad_norm": 0.8506439328193665, "learning_rate": 7.56892230576441e-05, "loss": 0.3135736584663391, "mean_token_accuracy": 0.8835454434156418, "num_tokens": 1875072.0, "step": 152 }, { "entropy": 1.037431538105011, "epoch": 0.08056872037914692, "grad_norm": 0.6357259750366211, "learning_rate": 7.619047619047618e-05, "loss": 0.2715918719768524, "mean_token_accuracy": 0.9003684967756271, "num_tokens": 1887408.0, "step": 153 }, { "entropy": 1.101006418466568, "epoch": 0.08109531332280147, "grad_norm": 0.7176199555397034, "learning_rate": 7.669172932330826e-05, "loss": 0.3140455186367035, "mean_token_accuracy": 0.8868316859006882, "num_tokens": 1899744.0, "step": 154 }, { "entropy": 1.048825979232788, "epoch": 0.08162190626645603, "grad_norm": 0.8264813423156738, "learning_rate": 7.719298245614036e-05, "loss": 0.27318042516708374, "mean_token_accuracy": 0.8995131105184555, "num_tokens": 1912080.0, "step": 155 }, { "entropy": 1.0369156897068024, "epoch": 0.08214849921011058, "grad_norm": 0.7105727791786194, "learning_rate": 7.769423558897244e-05, "loss": 0.287497341632843, "mean_token_accuracy": 0.8940722495317459, "num_tokens": 1924416.0, "step": 156 }, { "entropy": 1.0527066588401794, "epoch": 0.08267509215376515, "grad_norm": 0.7094339728355408, "learning_rate": 7.819548872180451e-05, "loss": 0.31165987253189087, "mean_token_accuracy": 0.8851522654294968, "num_tokens": 1936752.0, "step": 157 }, { "entropy": 1.018677532672882, "epoch": 0.0832016850974197, "grad_norm": 0.6412932276725769, "learning_rate": 7.869674185463659e-05, "loss": 0.28470396995544434, "mean_token_accuracy": 0.8961537182331085, "num_tokens": 1949088.0, "step": 158 }, { "entropy": 1.011895701289177, "epoch": 0.08372827804107424, "grad_norm": 0.6732510924339294, "learning_rate": 7.919799498746867e-05, "loss": 0.28573673963546753, "mean_token_accuracy": 0.8944952934980392, "num_tokens": 1961424.0, "step": 159 }, { "entropy": 1.011293813586235, "epoch": 0.08425487098472881, "grad_norm": 0.6785159707069397, "learning_rate": 7.969924812030075e-05, "loss": 0.30068039894104004, "mean_token_accuracy": 0.8911136984825134, "num_tokens": 1973760.0, "step": 160 }, { "entropy": 1.020560160279274, "epoch": 0.08478146392838336, "grad_norm": 0.7218092679977417, "learning_rate": 8.020050125313283e-05, "loss": 0.30739086866378784, "mean_token_accuracy": 0.885330468416214, "num_tokens": 1986096.0, "step": 161 }, { "entropy": 1.0597094595432281, "epoch": 0.08530805687203792, "grad_norm": 0.7374167442321777, "learning_rate": 8.070175438596491e-05, "loss": 0.31700241565704346, "mean_token_accuracy": 0.8844025731086731, "num_tokens": 1998432.0, "step": 162 }, { "entropy": 1.0140591859817505, "epoch": 0.08583464981569247, "grad_norm": 0.6328212022781372, "learning_rate": 8.120300751879699e-05, "loss": 0.282073050737381, "mean_token_accuracy": 0.9006371796131134, "num_tokens": 2010768.0, "step": 163 }, { "entropy": 1.0362461507320404, "epoch": 0.08636124275934702, "grad_norm": 0.6613935828208923, "learning_rate": 8.170426065162907e-05, "loss": 0.2826480567455292, "mean_token_accuracy": 0.8936625272035599, "num_tokens": 2023104.0, "step": 164 }, { "entropy": 1.0381528735160828, "epoch": 0.08688783570300158, "grad_norm": 0.6834626197814941, "learning_rate": 8.220551378446115e-05, "loss": 0.2852419912815094, "mean_token_accuracy": 0.8987163454294205, "num_tokens": 2035440.0, "step": 165 }, { "entropy": 1.0698944479227066, "epoch": 0.08741442864665613, "grad_norm": 0.7904614806175232, "learning_rate": 8.270676691729324e-05, "loss": 0.2937854826450348, "mean_token_accuracy": 0.8909425586462021, "num_tokens": 2047776.0, "step": 166 }, { "entropy": 1.040902853012085, "epoch": 0.08794102159031068, "grad_norm": 0.7362328767776489, "learning_rate": 8.320802005012532e-05, "loss": 0.2914920449256897, "mean_token_accuracy": 0.898249089717865, "num_tokens": 2060112.0, "step": 167 }, { "entropy": 1.028788536787033, "epoch": 0.08846761453396525, "grad_norm": 0.8054221868515015, "learning_rate": 8.37092731829574e-05, "loss": 0.3018620014190674, "mean_token_accuracy": 0.8883562982082367, "num_tokens": 2072448.0, "step": 168 }, { "entropy": 1.0401608049869537, "epoch": 0.0889942074776198, "grad_norm": 0.6363168954849243, "learning_rate": 8.421052631578948e-05, "loss": 0.2924948036670685, "mean_token_accuracy": 0.8931814581155777, "num_tokens": 2084784.0, "step": 169 }, { "entropy": 1.0388599783182144, "epoch": 0.08952080042127436, "grad_norm": 1.0536071062088013, "learning_rate": 8.471177944862155e-05, "loss": 0.3022274971008301, "mean_token_accuracy": 0.8892710357904434, "num_tokens": 2097120.0, "step": 170 }, { "entropy": 1.0794771611690521, "epoch": 0.09004739336492891, "grad_norm": 0.7485163807868958, "learning_rate": 8.521303258145363e-05, "loss": 0.28198155760765076, "mean_token_accuracy": 0.8907860517501831, "num_tokens": 2109456.0, "step": 171 }, { "entropy": 1.0737251937389374, "epoch": 0.09057398630858346, "grad_norm": 0.7381237745285034, "learning_rate": 8.571428571428571e-05, "loss": 0.2523871660232544, "mean_token_accuracy": 0.9074936509132385, "num_tokens": 2121792.0, "step": 172 }, { "entropy": 1.003856584429741, "epoch": 0.09110057925223802, "grad_norm": 0.7226340770721436, "learning_rate": 8.621553884711779e-05, "loss": 0.27109643816947937, "mean_token_accuracy": 0.9041073471307755, "num_tokens": 2134128.0, "step": 173 }, { "entropy": 1.1186200976371765, "epoch": 0.09162717219589257, "grad_norm": 0.7579658627510071, "learning_rate": 8.671679197994987e-05, "loss": 0.3053061366081238, "mean_token_accuracy": 0.8858212381601334, "num_tokens": 2146464.0, "step": 174 }, { "entropy": 1.1462504863739014, "epoch": 0.09215376513954714, "grad_norm": 0.6947624087333679, "learning_rate": 8.721804511278195e-05, "loss": 0.3097134232521057, "mean_token_accuracy": 0.8846383690834045, "num_tokens": 2158800.0, "step": 175 }, { "entropy": 1.1312821209430695, "epoch": 0.09268035808320169, "grad_norm": 0.6850878596305847, "learning_rate": 8.771929824561403e-05, "loss": 0.26429426670074463, "mean_token_accuracy": 0.8986905962228775, "num_tokens": 2171136.0, "step": 176 }, { "entropy": 1.146384358406067, "epoch": 0.09320695102685624, "grad_norm": 0.7358205914497375, "learning_rate": 8.822055137844612e-05, "loss": 0.2753527760505676, "mean_token_accuracy": 0.8983759731054306, "num_tokens": 2183472.0, "step": 177 }, { "entropy": 1.2575857639312744, "epoch": 0.0937335439705108, "grad_norm": 0.6449548006057739, "learning_rate": 8.87218045112782e-05, "loss": 0.2840855121612549, "mean_token_accuracy": 0.8939386010169983, "num_tokens": 2195808.0, "step": 178 }, { "entropy": 1.190169095993042, "epoch": 0.09426013691416535, "grad_norm": 0.7093657851219177, "learning_rate": 8.922305764411028e-05, "loss": 0.2701612114906311, "mean_token_accuracy": 0.9016707092523575, "num_tokens": 2208144.0, "step": 179 }, { "entropy": 1.229299396276474, "epoch": 0.0947867298578199, "grad_norm": 0.7190297245979309, "learning_rate": 8.972431077694236e-05, "loss": 0.25798100233078003, "mean_token_accuracy": 0.9037416577339172, "num_tokens": 2220480.0, "step": 180 }, { "entropy": 1.2668792605400085, "epoch": 0.09531332280147446, "grad_norm": 0.7405722737312317, "learning_rate": 9.022556390977444e-05, "loss": 0.2883971929550171, "mean_token_accuracy": 0.8925597667694092, "num_tokens": 2232816.0, "step": 181 }, { "entropy": 1.1805595457553864, "epoch": 0.09583991574512901, "grad_norm": 0.6785654425621033, "learning_rate": 9.072681704260652e-05, "loss": 0.2622534930706024, "mean_token_accuracy": 0.9043945819139481, "num_tokens": 2245152.0, "step": 182 }, { "entropy": 1.24412140250206, "epoch": 0.09636650868878358, "grad_norm": 0.6113075017929077, "learning_rate": 9.12280701754386e-05, "loss": 0.30303800106048584, "mean_token_accuracy": 0.8807209581136703, "num_tokens": 2257488.0, "step": 183 }, { "entropy": 1.1531569063663483, "epoch": 0.09689310163243813, "grad_norm": 0.6058000922203064, "learning_rate": 9.172932330827067e-05, "loss": 0.2888239622116089, "mean_token_accuracy": 0.8989417850971222, "num_tokens": 2269824.0, "step": 184 }, { "entropy": 1.1511635780334473, "epoch": 0.09741969457609267, "grad_norm": 0.6023234128952026, "learning_rate": 9.223057644110275e-05, "loss": 0.2515050172805786, "mean_token_accuracy": 0.9097182005643845, "num_tokens": 2282160.0, "step": 185 }, { "entropy": 1.1716180443763733, "epoch": 0.09794628751974724, "grad_norm": 0.6153926253318787, "learning_rate": 9.273182957393483e-05, "loss": 0.2679345905780792, "mean_token_accuracy": 0.8987378627061844, "num_tokens": 2294496.0, "step": 186 }, { "entropy": 1.1668370068073273, "epoch": 0.09847288046340179, "grad_norm": 0.6524267196655273, "learning_rate": 9.323308270676691e-05, "loss": 0.28671011328697205, "mean_token_accuracy": 0.8961494415998459, "num_tokens": 2306832.0, "step": 187 }, { "entropy": 1.1817428171634674, "epoch": 0.09899947340705635, "grad_norm": 0.6342366337776184, "learning_rate": 9.373433583959899e-05, "loss": 0.2956732511520386, "mean_token_accuracy": 0.8947313278913498, "num_tokens": 2319168.0, "step": 188 }, { "entropy": 1.118630200624466, "epoch": 0.0995260663507109, "grad_norm": 0.6613883972167969, "learning_rate": 9.423558897243108e-05, "loss": 0.24410809576511383, "mean_token_accuracy": 0.9081003367900848, "num_tokens": 2331504.0, "step": 189 }, { "entropy": 1.1118974089622498, "epoch": 0.10005265929436545, "grad_norm": 0.6532029509544373, "learning_rate": 9.473684210526316e-05, "loss": 0.2677920162677765, "mean_token_accuracy": 0.8997665196657181, "num_tokens": 2343840.0, "step": 190 }, { "entropy": 1.1150999963283539, "epoch": 0.10057925223802001, "grad_norm": 0.6919822692871094, "learning_rate": 9.523809523809524e-05, "loss": 0.2759622633457184, "mean_token_accuracy": 0.896903395652771, "num_tokens": 2356176.0, "step": 191 }, { "entropy": 1.0659538507461548, "epoch": 0.10110584518167456, "grad_norm": 0.6363855600357056, "learning_rate": 9.573934837092732e-05, "loss": 0.2608574628829956, "mean_token_accuracy": 0.8995112329721451, "num_tokens": 2368512.0, "step": 192 }, { "entropy": 1.0789634585380554, "epoch": 0.10163243812532911, "grad_norm": 0.7043361067771912, "learning_rate": 9.62406015037594e-05, "loss": 0.27143171429634094, "mean_token_accuracy": 0.897380143404007, "num_tokens": 2380848.0, "step": 193 }, { "entropy": 1.1381100416183472, "epoch": 0.10215903106898368, "grad_norm": 0.6552066206932068, "learning_rate": 9.674185463659148e-05, "loss": 0.26525720953941345, "mean_token_accuracy": 0.9070263504981995, "num_tokens": 2393184.0, "step": 194 }, { "entropy": 1.1865114271640778, "epoch": 0.10268562401263823, "grad_norm": 0.634785532951355, "learning_rate": 9.724310776942356e-05, "loss": 0.26738592982292175, "mean_token_accuracy": 0.9013326019048691, "num_tokens": 2405520.0, "step": 195 }, { "entropy": 1.1835360527038574, "epoch": 0.10321221695629279, "grad_norm": 0.7315617799758911, "learning_rate": 9.774436090225564e-05, "loss": 0.29927945137023926, "mean_token_accuracy": 0.8894186317920685, "num_tokens": 2417856.0, "step": 196 }, { "entropy": 1.1675716638565063, "epoch": 0.10373880989994734, "grad_norm": 0.5887401700019836, "learning_rate": 9.824561403508771e-05, "loss": 0.2657887935638428, "mean_token_accuracy": 0.9044163674116135, "num_tokens": 2430192.0, "step": 197 }, { "entropy": 1.2119200527668, "epoch": 0.10426540284360189, "grad_norm": 0.7186099290847778, "learning_rate": 9.87468671679198e-05, "loss": 0.24999147653579712, "mean_token_accuracy": 0.9089571237564087, "num_tokens": 2442528.0, "step": 198 }, { "entropy": 1.1587353944778442, "epoch": 0.10479199578725645, "grad_norm": 0.6930050253868103, "learning_rate": 9.924812030075187e-05, "loss": 0.28423306345939636, "mean_token_accuracy": 0.8938881307840347, "num_tokens": 2454864.0, "step": 199 }, { "entropy": 1.1999735534191132, "epoch": 0.105318588730911, "grad_norm": 0.6575484871864319, "learning_rate": 9.974937343358397e-05, "loss": 0.25892868638038635, "mean_token_accuracy": 0.9065304547548294, "num_tokens": 2467200.0, "step": 200 }, { "entropy": 1.1664292514324188, "epoch": 0.10584518167456557, "grad_norm": 0.6501355767250061, "learning_rate": 0.00010025062656641604, "loss": 0.2730686068534851, "mean_token_accuracy": 0.8991207629442215, "num_tokens": 2479536.0, "step": 201 }, { "entropy": 1.2156886756420135, "epoch": 0.10637177461822012, "grad_norm": 1.1883974075317383, "learning_rate": 0.00010075187969924814, "loss": 0.2882535755634308, "mean_token_accuracy": 0.8935256004333496, "num_tokens": 2491872.0, "step": 202 }, { "entropy": 1.1884984374046326, "epoch": 0.10689836756187467, "grad_norm": 0.6555978655815125, "learning_rate": 0.0001012531328320802, "loss": 0.2524234354496002, "mean_token_accuracy": 0.9072889387607574, "num_tokens": 2504208.0, "step": 203 }, { "entropy": 1.204279750585556, "epoch": 0.10742496050552923, "grad_norm": 0.6422716379165649, "learning_rate": 0.0001017543859649123, "loss": 0.2662729322910309, "mean_token_accuracy": 0.9040449559688568, "num_tokens": 2516544.0, "step": 204 }, { "entropy": 1.2619583904743195, "epoch": 0.10795155344918378, "grad_norm": 0.7150806188583374, "learning_rate": 0.00010225563909774436, "loss": 0.2756538689136505, "mean_token_accuracy": 0.8975429385900497, "num_tokens": 2528880.0, "step": 205 }, { "entropy": 1.265720009803772, "epoch": 0.10847814639283834, "grad_norm": 0.6873537302017212, "learning_rate": 0.00010275689223057645, "loss": 0.25472116470336914, "mean_token_accuracy": 0.9096198529005051, "num_tokens": 2541216.0, "step": 206 }, { "entropy": 1.269091546535492, "epoch": 0.10900473933649289, "grad_norm": 0.6951980590820312, "learning_rate": 0.00010325814536340852, "loss": 0.26120638847351074, "mean_token_accuracy": 0.9050850421190262, "num_tokens": 2553552.0, "step": 207 }, { "entropy": 1.269478291273117, "epoch": 0.10953133228014744, "grad_norm": 0.556747555732727, "learning_rate": 0.00010375939849624061, "loss": 0.25462740659713745, "mean_token_accuracy": 0.9035714715719223, "num_tokens": 2565888.0, "step": 208 }, { "entropy": 1.261308342218399, "epoch": 0.110057925223802, "grad_norm": 0.6084737777709961, "learning_rate": 0.00010426065162907268, "loss": 0.28605493903160095, "mean_token_accuracy": 0.8935003876686096, "num_tokens": 2578224.0, "step": 209 }, { "entropy": 1.3189480602741241, "epoch": 0.11058451816745656, "grad_norm": 0.5886352062225342, "learning_rate": 0.00010476190476190477, "loss": 0.24048885703086853, "mean_token_accuracy": 0.9100839495658875, "num_tokens": 2590560.0, "step": 210 }, { "entropy": 1.3389763832092285, "epoch": 0.1111111111111111, "grad_norm": 0.6794092059135437, "learning_rate": 0.00010526315789473685, "loss": 0.2771369516849518, "mean_token_accuracy": 0.890377551317215, "num_tokens": 2602896.0, "step": 211 }, { "entropy": 1.3012954592704773, "epoch": 0.11163770405476567, "grad_norm": 0.6500777006149292, "learning_rate": 0.00010576441102756893, "loss": 0.26194366812705994, "mean_token_accuracy": 0.9035488367080688, "num_tokens": 2615232.0, "step": 212 }, { "entropy": 1.3287411630153656, "epoch": 0.11216429699842022, "grad_norm": 0.7444258332252502, "learning_rate": 0.000106265664160401, "loss": 0.25705063343048096, "mean_token_accuracy": 0.8985376209020615, "num_tokens": 2627568.0, "step": 213 }, { "entropy": 1.3762761354446411, "epoch": 0.11269088994207478, "grad_norm": 0.6778383255004883, "learning_rate": 0.0001067669172932331, "loss": 0.26562660932540894, "mean_token_accuracy": 0.8980493247509003, "num_tokens": 2639904.0, "step": 214 }, { "entropy": 1.3341316282749176, "epoch": 0.11321748288572933, "grad_norm": 0.5709004998207092, "learning_rate": 0.00010726817042606516, "loss": 0.22839783132076263, "mean_token_accuracy": 0.9137850105762482, "num_tokens": 2652240.0, "step": 215 }, { "entropy": 1.397248774766922, "epoch": 0.11374407582938388, "grad_norm": 0.6649454236030579, "learning_rate": 0.00010776942355889726, "loss": 0.2758176624774933, "mean_token_accuracy": 0.8951268941164017, "num_tokens": 2664576.0, "step": 216 }, { "entropy": 1.3985490798950195, "epoch": 0.11427066877303844, "grad_norm": 0.6822545528411865, "learning_rate": 0.00010827067669172932, "loss": 0.2714245021343231, "mean_token_accuracy": 0.9002304524183273, "num_tokens": 2676912.0, "step": 217 }, { "entropy": 1.4322108924388885, "epoch": 0.114797261716693, "grad_norm": 0.6045425534248352, "learning_rate": 0.00010877192982456141, "loss": 0.27720269560813904, "mean_token_accuracy": 0.8973477184772491, "num_tokens": 2689248.0, "step": 218 }, { "entropy": 1.412218064069748, "epoch": 0.11532385466034756, "grad_norm": 0.5996334552764893, "learning_rate": 0.00010927318295739348, "loss": 0.2552666962146759, "mean_token_accuracy": 0.9052979648113251, "num_tokens": 2701584.0, "step": 219 }, { "entropy": 1.4080830514431, "epoch": 0.11585044760400211, "grad_norm": 0.5775550007820129, "learning_rate": 0.00010977443609022557, "loss": 0.26107677817344666, "mean_token_accuracy": 0.902474120259285, "num_tokens": 2713920.0, "step": 220 }, { "entropy": 1.4139901399612427, "epoch": 0.11637704054765666, "grad_norm": 0.5853016972541809, "learning_rate": 0.00011027568922305764, "loss": 0.2802305519580841, "mean_token_accuracy": 0.8949225097894669, "num_tokens": 2726256.0, "step": 221 }, { "entropy": 1.354727566242218, "epoch": 0.11690363349131122, "grad_norm": 0.6593271493911743, "learning_rate": 0.00011077694235588973, "loss": 0.25806909799575806, "mean_token_accuracy": 0.9009847342967987, "num_tokens": 2738592.0, "step": 222 }, { "entropy": 1.363867849111557, "epoch": 0.11743022643496577, "grad_norm": 0.5569132566452026, "learning_rate": 0.00011127819548872181, "loss": 0.2619836926460266, "mean_token_accuracy": 0.9014725536108017, "num_tokens": 2750928.0, "step": 223 }, { "entropy": 1.4332265555858612, "epoch": 0.11795681937862032, "grad_norm": 0.6189314723014832, "learning_rate": 0.00011177944862155389, "loss": 0.26161426305770874, "mean_token_accuracy": 0.8975115269422531, "num_tokens": 2763264.0, "step": 224 }, { "entropy": 1.3454554677009583, "epoch": 0.11848341232227488, "grad_norm": 0.6003779768943787, "learning_rate": 0.00011228070175438597, "loss": 0.2651001214981079, "mean_token_accuracy": 0.9023340046405792, "num_tokens": 2775600.0, "step": 225 }, { "entropy": 1.3587769269943237, "epoch": 0.11901000526592943, "grad_norm": 0.7411830425262451, "learning_rate": 0.00011278195488721806, "loss": 0.2888566851615906, "mean_token_accuracy": 0.895685225725174, "num_tokens": 2787936.0, "step": 226 }, { "entropy": 1.4554640650749207, "epoch": 0.119536598209584, "grad_norm": 0.6714136004447937, "learning_rate": 0.00011328320802005013, "loss": 0.2898600101470947, "mean_token_accuracy": 0.8905848562717438, "num_tokens": 2800272.0, "step": 227 }, { "entropy": 1.4274349808692932, "epoch": 0.12006319115323855, "grad_norm": 0.5972358584403992, "learning_rate": 0.00011378446115288222, "loss": 0.2719231843948364, "mean_token_accuracy": 0.8995204567909241, "num_tokens": 2812608.0, "step": 228 }, { "entropy": 1.3975107669830322, "epoch": 0.1205897840968931, "grad_norm": 0.7388063073158264, "learning_rate": 0.00011428571428571428, "loss": 0.2811048924922943, "mean_token_accuracy": 0.8961653858423233, "num_tokens": 2824944.0, "step": 229 }, { "entropy": 1.41668900847435, "epoch": 0.12111637704054766, "grad_norm": 0.6408892273902893, "learning_rate": 0.00011478696741854638, "loss": 0.23900066316127777, "mean_token_accuracy": 0.9131550490856171, "num_tokens": 2837280.0, "step": 230 }, { "entropy": 1.4389840960502625, "epoch": 0.12164296998420221, "grad_norm": 0.6279134154319763, "learning_rate": 0.00011528822055137844, "loss": 0.27471503615379333, "mean_token_accuracy": 0.8994272202253342, "num_tokens": 2849616.0, "step": 231 }, { "entropy": 1.3705064952373505, "epoch": 0.12216956292785677, "grad_norm": 0.7351282835006714, "learning_rate": 0.00011578947368421053, "loss": 0.2829359471797943, "mean_token_accuracy": 0.8966951966285706, "num_tokens": 2861952.0, "step": 232 }, { "entropy": 1.4880229830741882, "epoch": 0.12269615587151132, "grad_norm": 0.6098307371139526, "learning_rate": 0.0001162907268170426, "loss": 0.25372314453125, "mean_token_accuracy": 0.901044175028801, "num_tokens": 2874288.0, "step": 233 }, { "entropy": 1.4908549189567566, "epoch": 0.12322274881516587, "grad_norm": 0.6075619459152222, "learning_rate": 0.00011679197994987469, "loss": 0.2654881477355957, "mean_token_accuracy": 0.8972955793142319, "num_tokens": 2886624.0, "step": 234 }, { "entropy": 1.3783467411994934, "epoch": 0.12374934175882044, "grad_norm": 0.6030115485191345, "learning_rate": 0.00011729323308270677, "loss": 0.25111234188079834, "mean_token_accuracy": 0.902543842792511, "num_tokens": 2898960.0, "step": 235 }, { "entropy": 1.3683518171310425, "epoch": 0.12427593470247499, "grad_norm": 0.6671847105026245, "learning_rate": 0.00011779448621553886, "loss": 0.25656643509864807, "mean_token_accuracy": 0.9067094326019287, "num_tokens": 2911296.0, "step": 236 }, { "entropy": 1.4006175696849823, "epoch": 0.12480252764612954, "grad_norm": 0.5684525370597839, "learning_rate": 0.00011829573934837093, "loss": 0.2626839876174927, "mean_token_accuracy": 0.9033264219760895, "num_tokens": 2923632.0, "step": 237 }, { "entropy": 1.335418850183487, "epoch": 0.1253291205897841, "grad_norm": 0.5542851090431213, "learning_rate": 0.00011879699248120302, "loss": 0.24251079559326172, "mean_token_accuracy": 0.9084768146276474, "num_tokens": 2935968.0, "step": 238 }, { "entropy": 1.3918206691741943, "epoch": 0.12585571353343866, "grad_norm": 0.7893558740615845, "learning_rate": 0.00011929824561403509, "loss": 0.2818213999271393, "mean_token_accuracy": 0.8929243236780167, "num_tokens": 2948304.0, "step": 239 }, { "entropy": 1.3344398736953735, "epoch": 0.1263823064770932, "grad_norm": 0.62665194272995, "learning_rate": 0.00011979949874686718, "loss": 0.24543407559394836, "mean_token_accuracy": 0.9088149815797806, "num_tokens": 2960640.0, "step": 240 }, { "entropy": 1.362634390592575, "epoch": 0.12690889942074776, "grad_norm": 0.6178820133209229, "learning_rate": 0.00012030075187969925, "loss": 0.24784636497497559, "mean_token_accuracy": 0.9079759418964386, "num_tokens": 2972976.0, "step": 241 }, { "entropy": 1.3410207033157349, "epoch": 0.12743549236440233, "grad_norm": 0.6127734780311584, "learning_rate": 0.00012080200501253134, "loss": 0.276973694562912, "mean_token_accuracy": 0.900666818022728, "num_tokens": 2985312.0, "step": 242 }, { "entropy": 1.3882217109203339, "epoch": 0.12796208530805686, "grad_norm": 0.6211519837379456, "learning_rate": 0.0001213032581453634, "loss": 0.29095229506492615, "mean_token_accuracy": 0.8922038376331329, "num_tokens": 2997648.0, "step": 243 }, { "entropy": 1.3064784407615662, "epoch": 0.12848867825171142, "grad_norm": 0.6020708084106445, "learning_rate": 0.0001218045112781955, "loss": 0.25750190019607544, "mean_token_accuracy": 0.8979595750570297, "num_tokens": 3009984.0, "step": 244 }, { "entropy": 1.3404588103294373, "epoch": 0.129015271195366, "grad_norm": 0.5311986804008484, "learning_rate": 0.00012230576441102757, "loss": 0.2417442798614502, "mean_token_accuracy": 0.9036334156990051, "num_tokens": 3022320.0, "step": 245 }, { "entropy": 1.3250301778316498, "epoch": 0.12954186413902052, "grad_norm": 0.6158598065376282, "learning_rate": 0.00012280701754385965, "loss": 0.28592783212661743, "mean_token_accuracy": 0.8968044072389603, "num_tokens": 3034656.0, "step": 246 }, { "entropy": 1.2895326018333435, "epoch": 0.1300684570826751, "grad_norm": 0.5133572816848755, "learning_rate": 0.00012330827067669173, "loss": 0.26722657680511475, "mean_token_accuracy": 0.899601012468338, "num_tokens": 3046992.0, "step": 247 }, { "entropy": 1.2834957540035248, "epoch": 0.13059505002632965, "grad_norm": 0.5774098038673401, "learning_rate": 0.0001238095238095238, "loss": 0.2552984654903412, "mean_token_accuracy": 0.9021749496459961, "num_tokens": 3059328.0, "step": 248 }, { "entropy": 1.28067284822464, "epoch": 0.13112164296998421, "grad_norm": 0.5813867449760437, "learning_rate": 0.0001243107769423559, "loss": 0.26484355330467224, "mean_token_accuracy": 0.8958484381437302, "num_tokens": 3071664.0, "step": 249 }, { "entropy": 1.3292741775512695, "epoch": 0.13164823591363875, "grad_norm": 0.5437096357345581, "learning_rate": 0.00012481203007518797, "loss": 0.25312983989715576, "mean_token_accuracy": 0.9083140790462494, "num_tokens": 3084000.0, "step": 250 }, { "entropy": 1.217045933008194, "epoch": 0.1321748288572933, "grad_norm": 0.5642932057380676, "learning_rate": 0.00012531328320802005, "loss": 0.24098949134349823, "mean_token_accuracy": 0.9082589000463486, "num_tokens": 3096336.0, "step": 251 }, { "entropy": 1.3332138061523438, "epoch": 0.13270142180094788, "grad_norm": 0.5955415368080139, "learning_rate": 0.00012581453634085213, "loss": 0.2849401831626892, "mean_token_accuracy": 0.8916681408882141, "num_tokens": 3108672.0, "step": 252 }, { "entropy": 1.295847773551941, "epoch": 0.1332280147446024, "grad_norm": 0.6146616339683533, "learning_rate": 0.0001263157894736842, "loss": 0.2735283076763153, "mean_token_accuracy": 0.8989967852830887, "num_tokens": 3121008.0, "step": 253 }, { "entropy": 1.2074873447418213, "epoch": 0.13375460768825698, "grad_norm": 0.5243288278579712, "learning_rate": 0.0001268170426065163, "loss": 0.24956879019737244, "mean_token_accuracy": 0.9056222587823868, "num_tokens": 3133344.0, "step": 254 }, { "entropy": 1.2322421371936798, "epoch": 0.13428120063191154, "grad_norm": 0.5780612230300903, "learning_rate": 0.00012731829573934836, "loss": 0.22142812609672546, "mean_token_accuracy": 0.9111984372138977, "num_tokens": 3145680.0, "step": 255 }, { "entropy": 1.2550228536128998, "epoch": 0.13480779357556608, "grad_norm": 0.5654560923576355, "learning_rate": 0.00012781954887218047, "loss": 0.2577667236328125, "mean_token_accuracy": 0.9028536081314087, "num_tokens": 3158016.0, "step": 256 }, { "entropy": 1.2815439105033875, "epoch": 0.13533438651922064, "grad_norm": 0.5860424041748047, "learning_rate": 0.00012832080200501252, "loss": 0.24961405992507935, "mean_token_accuracy": 0.9073447585105896, "num_tokens": 3170352.0, "step": 257 }, { "entropy": 1.3496994376182556, "epoch": 0.1358609794628752, "grad_norm": 0.5496608018875122, "learning_rate": 0.00012882205513784463, "loss": 0.23788216710090637, "mean_token_accuracy": 0.913466677069664, "num_tokens": 3182688.0, "step": 258 }, { "entropy": 1.2379789352416992, "epoch": 0.13638757240652974, "grad_norm": 0.5407847166061401, "learning_rate": 0.00012932330827067668, "loss": 0.242479607462883, "mean_token_accuracy": 0.9110987186431885, "num_tokens": 3195024.0, "step": 259 }, { "entropy": 1.2678188979625702, "epoch": 0.1369141653501843, "grad_norm": 0.6954227089881897, "learning_rate": 0.0001298245614035088, "loss": 0.3035907447338104, "mean_token_accuracy": 0.8935103565454483, "num_tokens": 3207360.0, "step": 260 }, { "entropy": 1.2501021325588226, "epoch": 0.13744075829383887, "grad_norm": 0.6763582825660706, "learning_rate": 0.00013032581453634084, "loss": 0.2833873927593231, "mean_token_accuracy": 0.8930742889642715, "num_tokens": 3219696.0, "step": 261 }, { "entropy": 1.2093367278575897, "epoch": 0.13796735123749343, "grad_norm": 0.5583021640777588, "learning_rate": 0.00013082706766917294, "loss": 0.23031063377857208, "mean_token_accuracy": 0.9110294431447983, "num_tokens": 3232032.0, "step": 262 }, { "entropy": 1.2286772429943085, "epoch": 0.13849394418114797, "grad_norm": 0.5849270224571228, "learning_rate": 0.00013132832080200502, "loss": 0.27444857358932495, "mean_token_accuracy": 0.8965310454368591, "num_tokens": 3244368.0, "step": 263 }, { "entropy": 1.2541997134685516, "epoch": 0.13902053712480253, "grad_norm": 0.5210989713668823, "learning_rate": 0.0001318295739348371, "loss": 0.24464797973632812, "mean_token_accuracy": 0.9072559326887131, "num_tokens": 3256704.0, "step": 264 }, { "entropy": 1.2401838898658752, "epoch": 0.1395471300684571, "grad_norm": 0.5357401371002197, "learning_rate": 0.00013233082706766918, "loss": 0.24787980318069458, "mean_token_accuracy": 0.9098693877458572, "num_tokens": 3269040.0, "step": 265 }, { "entropy": 1.2660530507564545, "epoch": 0.14007372301211163, "grad_norm": 0.5940161943435669, "learning_rate": 0.00013283208020050126, "loss": 0.27411437034606934, "mean_token_accuracy": 0.8980700373649597, "num_tokens": 3281376.0, "step": 266 }, { "entropy": 1.241824746131897, "epoch": 0.1406003159557662, "grad_norm": 0.604097306728363, "learning_rate": 0.00013333333333333334, "loss": 0.2866377830505371, "mean_token_accuracy": 0.8919961899518967, "num_tokens": 3293712.0, "step": 267 }, { "entropy": 1.1769486963748932, "epoch": 0.14112690889942076, "grad_norm": 0.7264558672904968, "learning_rate": 0.00013383458646616542, "loss": 0.26414263248443604, "mean_token_accuracy": 0.8967715352773666, "num_tokens": 3306048.0, "step": 268 }, { "entropy": 1.2283678948879242, "epoch": 0.1416535018430753, "grad_norm": 0.5465900301933289, "learning_rate": 0.0001343358395989975, "loss": 0.2366294264793396, "mean_token_accuracy": 0.9092733561992645, "num_tokens": 3318384.0, "step": 269 }, { "entropy": 1.262256383895874, "epoch": 0.14218009478672985, "grad_norm": 0.5315939784049988, "learning_rate": 0.00013483709273182958, "loss": 0.22708219289779663, "mean_token_accuracy": 0.914520725607872, "num_tokens": 3330720.0, "step": 270 }, { "entropy": 1.175988882780075, "epoch": 0.14270668773038442, "grad_norm": 0.5613946318626404, "learning_rate": 0.00013533834586466166, "loss": 0.22835803031921387, "mean_token_accuracy": 0.9081931263208389, "num_tokens": 3343056.0, "step": 271 }, { "entropy": 1.2391490042209625, "epoch": 0.14323328067403895, "grad_norm": 0.5381202101707458, "learning_rate": 0.00013583959899749373, "loss": 0.25535333156585693, "mean_token_accuracy": 0.9033481776714325, "num_tokens": 3355392.0, "step": 272 }, { "entropy": 1.2381133437156677, "epoch": 0.14375987361769352, "grad_norm": 0.6545175909996033, "learning_rate": 0.00013634085213032581, "loss": 0.268245667219162, "mean_token_accuracy": 0.9008642733097076, "num_tokens": 3367728.0, "step": 273 }, { "entropy": 1.2534950375556946, "epoch": 0.14428646656134808, "grad_norm": 0.6084462404251099, "learning_rate": 0.0001368421052631579, "loss": 0.241957426071167, "mean_token_accuracy": 0.9131230562925339, "num_tokens": 3380064.0, "step": 274 }, { "entropy": 1.2566357254981995, "epoch": 0.14481305950500264, "grad_norm": 0.5803132057189941, "learning_rate": 0.00013734335839598997, "loss": 0.24542784690856934, "mean_token_accuracy": 0.9083303511142731, "num_tokens": 3392400.0, "step": 275 }, { "entropy": 1.3298097252845764, "epoch": 0.14533965244865718, "grad_norm": 0.5581626296043396, "learning_rate": 0.00013784461152882208, "loss": 0.2682327330112457, "mean_token_accuracy": 0.8970459997653961, "num_tokens": 3404736.0, "step": 276 }, { "entropy": 1.2984472513198853, "epoch": 0.14586624539231174, "grad_norm": 0.5797234177589417, "learning_rate": 0.00013834586466165413, "loss": 0.2551107406616211, "mean_token_accuracy": 0.9025808274745941, "num_tokens": 3417072.0, "step": 277 }, { "entropy": 1.232091337442398, "epoch": 0.1463928383359663, "grad_norm": 0.56398606300354, "learning_rate": 0.00013884711779448624, "loss": 0.2523190379142761, "mean_token_accuracy": 0.9042512625455856, "num_tokens": 3429408.0, "step": 278 }, { "entropy": 1.364453375339508, "epoch": 0.14691943127962084, "grad_norm": 0.5884234309196472, "learning_rate": 0.0001393483709273183, "loss": 0.2788117229938507, "mean_token_accuracy": 0.90156190097332, "num_tokens": 3441744.0, "step": 279 }, { "entropy": 1.2391767501831055, "epoch": 0.1474460242232754, "grad_norm": 0.5528289079666138, "learning_rate": 0.0001398496240601504, "loss": 0.2562858760356903, "mean_token_accuracy": 0.905647337436676, "num_tokens": 3454080.0, "step": 280 }, { "entropy": 1.3013744056224823, "epoch": 0.14797261716692997, "grad_norm": 0.5353385806083679, "learning_rate": 0.00014035087719298245, "loss": 0.24675647914409637, "mean_token_accuracy": 0.9100503474473953, "num_tokens": 3466416.0, "step": 281 }, { "entropy": 1.2755855023860931, "epoch": 0.1484992101105845, "grad_norm": 0.5495297908782959, "learning_rate": 0.00014085213032581455, "loss": 0.2519223690032959, "mean_token_accuracy": 0.8966221362352371, "num_tokens": 3478752.0, "step": 282 }, { "entropy": 1.303219497203827, "epoch": 0.14902580305423907, "grad_norm": 0.5309876203536987, "learning_rate": 0.0001413533834586466, "loss": 0.24427109956741333, "mean_token_accuracy": 0.9075532704591751, "num_tokens": 3491088.0, "step": 283 }, { "entropy": 1.2614858448505402, "epoch": 0.14955239599789363, "grad_norm": 0.5807812809944153, "learning_rate": 0.0001418546365914787, "loss": 0.26809874176979065, "mean_token_accuracy": 0.899653896689415, "num_tokens": 3503424.0, "step": 284 }, { "entropy": 1.2611050605773926, "epoch": 0.1500789889415482, "grad_norm": 0.5592539310455322, "learning_rate": 0.0001423558897243108, "loss": 0.26588040590286255, "mean_token_accuracy": 0.8970725983381271, "num_tokens": 3515760.0, "step": 285 }, { "entropy": 1.2830645143985748, "epoch": 0.15060558188520273, "grad_norm": 0.5146520733833313, "learning_rate": 0.00014285714285714287, "loss": 0.24322782456874847, "mean_token_accuracy": 0.9055588096380234, "num_tokens": 3528096.0, "step": 286 }, { "entropy": 1.2292780876159668, "epoch": 0.1511321748288573, "grad_norm": 0.588441789150238, "learning_rate": 0.00014335839598997495, "loss": 0.2558269202709198, "mean_token_accuracy": 0.8964600563049316, "num_tokens": 3540432.0, "step": 287 }, { "entropy": 1.2410956919193268, "epoch": 0.15165876777251186, "grad_norm": 0.5761001706123352, "learning_rate": 0.00014385964912280703, "loss": 0.2511615455150604, "mean_token_accuracy": 0.9040048718452454, "num_tokens": 3552768.0, "step": 288 }, { "entropy": 1.3154540359973907, "epoch": 0.1521853607161664, "grad_norm": 0.6528503894805908, "learning_rate": 0.0001443609022556391, "loss": 0.2512635290622711, "mean_token_accuracy": 0.9024206399917603, "num_tokens": 3565104.0, "step": 289 }, { "entropy": 1.2947738468647003, "epoch": 0.15271195365982096, "grad_norm": 0.6061785221099854, "learning_rate": 0.00014486215538847118, "loss": 0.25342220067977905, "mean_token_accuracy": 0.9054669588804245, "num_tokens": 3577440.0, "step": 290 }, { "entropy": 1.2879831790924072, "epoch": 0.15323854660347552, "grad_norm": 0.5570182800292969, "learning_rate": 0.00014536340852130326, "loss": 0.27056393027305603, "mean_token_accuracy": 0.8992442786693573, "num_tokens": 3589776.0, "step": 291 }, { "entropy": 1.3449256420135498, "epoch": 0.15376513954713006, "grad_norm": 0.4950920045375824, "learning_rate": 0.00014586466165413534, "loss": 0.24097028374671936, "mean_token_accuracy": 0.9014376401901245, "num_tokens": 3602112.0, "step": 292 }, { "entropy": 1.4016221165657043, "epoch": 0.15429173249078462, "grad_norm": 0.554709792137146, "learning_rate": 0.00014636591478696742, "loss": 0.2270800769329071, "mean_token_accuracy": 0.9162011295557022, "num_tokens": 3614448.0, "step": 293 }, { "entropy": 1.514324426651001, "epoch": 0.15481832543443919, "grad_norm": 0.5531271696090698, "learning_rate": 0.0001468671679197995, "loss": 0.24683888256549835, "mean_token_accuracy": 0.9074130207300186, "num_tokens": 3626784.0, "step": 294 }, { "entropy": 1.471198707818985, "epoch": 0.15534491837809372, "grad_norm": 0.6712215542793274, "learning_rate": 0.00014736842105263158, "loss": 0.281759113073349, "mean_token_accuracy": 0.8955343812704086, "num_tokens": 3639120.0, "step": 295 }, { "entropy": 1.4630400836467743, "epoch": 0.15587151132174829, "grad_norm": 0.561416506767273, "learning_rate": 0.00014786967418546366, "loss": 0.275588721036911, "mean_token_accuracy": 0.8987540155649185, "num_tokens": 3651456.0, "step": 296 }, { "entropy": 1.491294264793396, "epoch": 0.15639810426540285, "grad_norm": 0.5332501530647278, "learning_rate": 0.00014837092731829574, "loss": 0.2502642273902893, "mean_token_accuracy": 0.9047496467828751, "num_tokens": 3663792.0, "step": 297 }, { "entropy": 1.3809879124164581, "epoch": 0.1569246972090574, "grad_norm": 0.499104768037796, "learning_rate": 0.00014887218045112784, "loss": 0.23079532384872437, "mean_token_accuracy": 0.909051313996315, "num_tokens": 3676128.0, "step": 298 }, { "entropy": 1.3202951848506927, "epoch": 0.15745129015271195, "grad_norm": 0.5114240646362305, "learning_rate": 0.0001493734335839599, "loss": 0.26147356629371643, "mean_token_accuracy": 0.9033501297235489, "num_tokens": 3688464.0, "step": 299 }, { "entropy": 1.3542028069496155, "epoch": 0.1579778830963665, "grad_norm": 0.492830753326416, "learning_rate": 0.000149874686716792, "loss": 0.2421473264694214, "mean_token_accuracy": 0.9081345945596695, "num_tokens": 3700800.0, "step": 300 }, { "entropy": 1.2910203635692596, "epoch": 0.15850447604002108, "grad_norm": 0.4862864911556244, "learning_rate": 0.00015037593984962405, "loss": 0.24877643585205078, "mean_token_accuracy": 0.9057342112064362, "num_tokens": 3713136.0, "step": 301 }, { "entropy": 1.3562625646591187, "epoch": 0.1590310689836756, "grad_norm": 0.6064998507499695, "learning_rate": 0.00015087719298245616, "loss": 0.2678510546684265, "mean_token_accuracy": 0.895992174744606, "num_tokens": 3725472.0, "step": 302 }, { "entropy": 1.3357418477535248, "epoch": 0.15955766192733017, "grad_norm": 0.5504618883132935, "learning_rate": 0.0001513784461152882, "loss": 0.24523413181304932, "mean_token_accuracy": 0.9103363454341888, "num_tokens": 3737808.0, "step": 303 }, { "entropy": 1.3335883915424347, "epoch": 0.16008425487098474, "grad_norm": 0.73444664478302, "learning_rate": 0.00015187969924812032, "loss": 0.2613740563392639, "mean_token_accuracy": 0.8996832072734833, "num_tokens": 3750144.0, "step": 304 }, { "entropy": 1.3423579335212708, "epoch": 0.16061084781463927, "grad_norm": 0.5342377424240112, "learning_rate": 0.00015238095238095237, "loss": 0.27072861790657043, "mean_token_accuracy": 0.8979348689317703, "num_tokens": 3762480.0, "step": 305 }, { "entropy": 1.2893436253070831, "epoch": 0.16113744075829384, "grad_norm": 0.49320632219314575, "learning_rate": 0.00015288220551378448, "loss": 0.24137352406978607, "mean_token_accuracy": 0.9123422801494598, "num_tokens": 3774816.0, "step": 306 }, { "entropy": 1.3107283115386963, "epoch": 0.1616640337019484, "grad_norm": 0.5037325620651245, "learning_rate": 0.00015338345864661653, "loss": 0.28284943103790283, "mean_token_accuracy": 0.8933527320623398, "num_tokens": 3787152.0, "step": 307 }, { "entropy": 1.2858748137950897, "epoch": 0.16219062664560294, "grad_norm": 0.7596031427383423, "learning_rate": 0.00015388471177944863, "loss": 0.2364031970500946, "mean_token_accuracy": 0.9070021212100983, "num_tokens": 3799488.0, "step": 308 }, { "entropy": 1.2649638950824738, "epoch": 0.1627172195892575, "grad_norm": 0.4712359607219696, "learning_rate": 0.0001543859649122807, "loss": 0.25866541266441345, "mean_token_accuracy": 0.8989972174167633, "num_tokens": 3811824.0, "step": 309 }, { "entropy": 1.1775002479553223, "epoch": 0.16324381253291206, "grad_norm": 0.47527384757995605, "learning_rate": 0.0001548872180451128, "loss": 0.22686654329299927, "mean_token_accuracy": 0.9112849235534668, "num_tokens": 3824160.0, "step": 310 }, { "entropy": 1.1848091185092926, "epoch": 0.16377040547656663, "grad_norm": 0.5009036064147949, "learning_rate": 0.00015538847117794487, "loss": 0.23199157416820526, "mean_token_accuracy": 0.9103835225105286, "num_tokens": 3836496.0, "step": 311 }, { "entropy": 1.1879796385765076, "epoch": 0.16429699842022116, "grad_norm": 0.530559778213501, "learning_rate": 0.00015588972431077695, "loss": 0.2687099277973175, "mean_token_accuracy": 0.9024157524108887, "num_tokens": 3848832.0, "step": 312 }, { "entropy": 1.1956203877925873, "epoch": 0.16482359136387573, "grad_norm": 0.5160781145095825, "learning_rate": 0.00015639097744360903, "loss": 0.24907854199409485, "mean_token_accuracy": 0.9046753495931625, "num_tokens": 3861168.0, "step": 313 }, { "entropy": 1.1685654819011688, "epoch": 0.1653501843075303, "grad_norm": 0.5312115550041199, "learning_rate": 0.0001568922305764411, "loss": 0.2576726973056793, "mean_token_accuracy": 0.9074427336454391, "num_tokens": 3873504.0, "step": 314 }, { "entropy": 1.1273577511310577, "epoch": 0.16587677725118483, "grad_norm": 0.6181286573410034, "learning_rate": 0.00015739348370927319, "loss": 0.23891520500183105, "mean_token_accuracy": 0.9119571298360825, "num_tokens": 3885840.0, "step": 315 }, { "entropy": 1.2541460990905762, "epoch": 0.1664033701948394, "grad_norm": 0.4766935408115387, "learning_rate": 0.00015789473684210527, "loss": 0.25483545660972595, "mean_token_accuracy": 0.8961910307407379, "num_tokens": 3898176.0, "step": 316 }, { "entropy": 1.1125807464122772, "epoch": 0.16692996313849395, "grad_norm": 0.5105007886886597, "learning_rate": 0.00015839598997493734, "loss": 0.2685958445072174, "mean_token_accuracy": 0.8989451825618744, "num_tokens": 3910512.0, "step": 317 }, { "entropy": 1.2121298015117645, "epoch": 0.1674565560821485, "grad_norm": 0.44646549224853516, "learning_rate": 0.00015889724310776942, "loss": 0.253686785697937, "mean_token_accuracy": 0.9083440899848938, "num_tokens": 3922848.0, "step": 318 }, { "entropy": 1.1011106967926025, "epoch": 0.16798314902580305, "grad_norm": 0.46656280755996704, "learning_rate": 0.0001593984962406015, "loss": 0.2927643060684204, "mean_token_accuracy": 0.8931492418050766, "num_tokens": 3935184.0, "step": 319 }, { "entropy": 1.1864506900310516, "epoch": 0.16850974196945762, "grad_norm": 0.4583514332771301, "learning_rate": 0.00015989974937343358, "loss": 0.22579318284988403, "mean_token_accuracy": 0.9128856211900711, "num_tokens": 3947520.0, "step": 320 }, { "entropy": 1.113357663154602, "epoch": 0.16903633491311215, "grad_norm": 0.5008531212806702, "learning_rate": 0.00016040100250626566, "loss": 0.2566073536872864, "mean_token_accuracy": 0.9067006707191467, "num_tokens": 3959856.0, "step": 321 }, { "entropy": 1.1666322350502014, "epoch": 0.16956292785676672, "grad_norm": 0.5016852021217346, "learning_rate": 0.00016090225563909777, "loss": 0.24807997047901154, "mean_token_accuracy": 0.9074774533510208, "num_tokens": 3972192.0, "step": 322 }, { "entropy": 1.0860579013824463, "epoch": 0.17008952080042128, "grad_norm": 0.5153301358222961, "learning_rate": 0.00016140350877192982, "loss": 0.2500810921192169, "mean_token_accuracy": 0.9049581736326218, "num_tokens": 3984528.0, "step": 323 }, { "entropy": 1.0754130184650421, "epoch": 0.17061611374407584, "grad_norm": 0.5485661625862122, "learning_rate": 0.00016190476190476192, "loss": 0.3087775707244873, "mean_token_accuracy": 0.8840746134519577, "num_tokens": 3996864.0, "step": 324 }, { "entropy": 1.097093939781189, "epoch": 0.17114270668773038, "grad_norm": 0.4524535834789276, "learning_rate": 0.00016240601503759398, "loss": 0.2556874454021454, "mean_token_accuracy": 0.9040686786174774, "num_tokens": 4009200.0, "step": 325 }, { "entropy": 1.0161993354558945, "epoch": 0.17166929963138494, "grad_norm": 0.5920532941818237, "learning_rate": 0.00016290726817042608, "loss": 0.2545970678329468, "mean_token_accuracy": 0.9038624912500381, "num_tokens": 4021536.0, "step": 326 }, { "entropy": 1.045365571975708, "epoch": 0.1721958925750395, "grad_norm": 0.5128290057182312, "learning_rate": 0.00016340852130325813, "loss": 0.23849724233150482, "mean_token_accuracy": 0.9063487350940704, "num_tokens": 4033872.0, "step": 327 }, { "entropy": 1.0524345636367798, "epoch": 0.17272248551869404, "grad_norm": 0.5058865547180176, "learning_rate": 0.00016390977443609024, "loss": 0.25231170654296875, "mean_token_accuracy": 0.9029942154884338, "num_tokens": 4046208.0, "step": 328 }, { "entropy": 1.1274868845939636, "epoch": 0.1732490784623486, "grad_norm": 0.5103746652603149, "learning_rate": 0.0001644110275689223, "loss": 0.26119422912597656, "mean_token_accuracy": 0.8970126211643219, "num_tokens": 4058544.0, "step": 329 }, { "entropy": 1.13772451877594, "epoch": 0.17377567140600317, "grad_norm": 0.463789701461792, "learning_rate": 0.0001649122807017544, "loss": 0.23172324895858765, "mean_token_accuracy": 0.9090371131896973, "num_tokens": 4070880.0, "step": 330 }, { "entropy": 1.1093823909759521, "epoch": 0.1743022643496577, "grad_norm": 0.4940638542175293, "learning_rate": 0.00016541353383458648, "loss": 0.25032839179039, "mean_token_accuracy": 0.9061925411224365, "num_tokens": 4083216.0, "step": 331 }, { "entropy": 1.0906598567962646, "epoch": 0.17482885729331227, "grad_norm": 0.5244042873382568, "learning_rate": 0.00016591478696741856, "loss": 0.2559994161128998, "mean_token_accuracy": 0.9056536555290222, "num_tokens": 4095552.0, "step": 332 }, { "entropy": 1.0064781606197357, "epoch": 0.17535545023696683, "grad_norm": 0.5328090786933899, "learning_rate": 0.00016641604010025064, "loss": 0.2423868030309677, "mean_token_accuracy": 0.9023227244615555, "num_tokens": 4107888.0, "step": 333 }, { "entropy": 0.9421130269765854, "epoch": 0.17588204318062137, "grad_norm": 0.4938746392726898, "learning_rate": 0.00016691729323308271, "loss": 0.2487686276435852, "mean_token_accuracy": 0.9072201699018478, "num_tokens": 4120224.0, "step": 334 }, { "entropy": 0.8471245914697647, "epoch": 0.17640863612427593, "grad_norm": 0.4719039499759674, "learning_rate": 0.0001674185463659148, "loss": 0.2677307426929474, "mean_token_accuracy": 0.89954973757267, "num_tokens": 4132560.0, "step": 335 }, { "entropy": 0.7532882988452911, "epoch": 0.1769352290679305, "grad_norm": 0.4836346209049225, "learning_rate": 0.00016791979949874687, "loss": 0.2508479356765747, "mean_token_accuracy": 0.9021095633506775, "num_tokens": 4144896.0, "step": 336 }, { "entropy": 0.6489329487085342, "epoch": 0.17746182201158506, "grad_norm": 0.5742446184158325, "learning_rate": 0.00016842105263157895, "loss": 0.2582406997680664, "mean_token_accuracy": 0.9013715237379074, "num_tokens": 4157232.0, "step": 337 }, { "entropy": 0.6537502855062485, "epoch": 0.1779884149552396, "grad_norm": 0.5390785336494446, "learning_rate": 0.00016892230576441103, "loss": 0.2649543881416321, "mean_token_accuracy": 0.8998610377311707, "num_tokens": 4169568.0, "step": 338 }, { "entropy": 0.6827399134635925, "epoch": 0.17851500789889416, "grad_norm": 0.507554829120636, "learning_rate": 0.0001694235588972431, "loss": 0.27018067240715027, "mean_token_accuracy": 0.8985839486122131, "num_tokens": 4181904.0, "step": 339 }, { "entropy": 0.7333462089300156, "epoch": 0.17904160084254872, "grad_norm": 0.4551506042480469, "learning_rate": 0.0001699248120300752, "loss": 0.25013625621795654, "mean_token_accuracy": 0.9111319333314896, "num_tokens": 4194240.0, "step": 340 }, { "entropy": 0.7495439946651459, "epoch": 0.17956819378620326, "grad_norm": 0.48456624150276184, "learning_rate": 0.00017042606516290727, "loss": 0.2707773745059967, "mean_token_accuracy": 0.8947316855192184, "num_tokens": 4206576.0, "step": 341 }, { "entropy": 0.7812775671482086, "epoch": 0.18009478672985782, "grad_norm": 0.4550190269947052, "learning_rate": 0.00017092731829573935, "loss": 0.2396947741508484, "mean_token_accuracy": 0.910267636179924, "num_tokens": 4218912.0, "step": 342 }, { "entropy": 0.9400374740362167, "epoch": 0.18062137967351238, "grad_norm": 0.5784738659858704, "learning_rate": 0.00017142857142857143, "loss": 0.26176217198371887, "mean_token_accuracy": 0.9009139388799667, "num_tokens": 4231248.0, "step": 343 }, { "entropy": 0.937469407916069, "epoch": 0.18114797261716692, "grad_norm": 0.5101773738861084, "learning_rate": 0.00017192982456140353, "loss": 0.222784623503685, "mean_token_accuracy": 0.9079811573028564, "num_tokens": 4243584.0, "step": 344 }, { "entropy": 0.9701919555664062, "epoch": 0.18167456556082148, "grad_norm": 0.4810556471347809, "learning_rate": 0.00017243107769423558, "loss": 0.25527724623680115, "mean_token_accuracy": 0.8977989107370377, "num_tokens": 4255920.0, "step": 345 }, { "entropy": 1.0421793162822723, "epoch": 0.18220115850447605, "grad_norm": 0.49446040391921997, "learning_rate": 0.0001729323308270677, "loss": 0.24790042638778687, "mean_token_accuracy": 0.9076082557439804, "num_tokens": 4268256.0, "step": 346 }, { "entropy": 1.0526159405708313, "epoch": 0.18272775144813058, "grad_norm": 0.5106586217880249, "learning_rate": 0.00017343358395989974, "loss": 0.258137047290802, "mean_token_accuracy": 0.9013570845127106, "num_tokens": 4280592.0, "step": 347 }, { "entropy": 1.0377429127693176, "epoch": 0.18325434439178515, "grad_norm": 0.5372883677482605, "learning_rate": 0.00017393483709273185, "loss": 0.2536155879497528, "mean_token_accuracy": 0.9079491943120956, "num_tokens": 4292928.0, "step": 348 }, { "entropy": 1.1226612329483032, "epoch": 0.1837809373354397, "grad_norm": 0.506536066532135, "learning_rate": 0.0001744360902255639, "loss": 0.2503521740436554, "mean_token_accuracy": 0.9043506681919098, "num_tokens": 4305264.0, "step": 349 }, { "entropy": 1.0955768823623657, "epoch": 0.18430753027909427, "grad_norm": 0.450717031955719, "learning_rate": 0.000174937343358396, "loss": 0.2611716687679291, "mean_token_accuracy": 0.9029702991247177, "num_tokens": 4317600.0, "step": 350 }, { "entropy": 1.1000354140996933, "epoch": 0.1848341232227488, "grad_norm": 0.5249627828598022, "learning_rate": 0.00017543859649122806, "loss": 0.23257189989089966, "mean_token_accuracy": 0.9120175540447235, "num_tokens": 4329936.0, "step": 351 }, { "entropy": 1.086414873600006, "epoch": 0.18536071616640337, "grad_norm": 0.488702654838562, "learning_rate": 0.00017593984962406016, "loss": 0.246709406375885, "mean_token_accuracy": 0.9029638320207596, "num_tokens": 4342272.0, "step": 352 }, { "entropy": 1.0042328536510468, "epoch": 0.18588730911005794, "grad_norm": 0.41849616169929504, "learning_rate": 0.00017644110275689224, "loss": 0.21574650704860687, "mean_token_accuracy": 0.9175253808498383, "num_tokens": 4354608.0, "step": 353 }, { "entropy": 1.0020455569028854, "epoch": 0.18641390205371247, "grad_norm": 0.46401116251945496, "learning_rate": 0.00017694235588972432, "loss": 0.2567673325538635, "mean_token_accuracy": 0.9054214805364609, "num_tokens": 4366944.0, "step": 354 }, { "entropy": 1.0092186033725739, "epoch": 0.18694049499736703, "grad_norm": 0.47048723697662354, "learning_rate": 0.0001774436090225564, "loss": 0.24711501598358154, "mean_token_accuracy": 0.9056050777435303, "num_tokens": 4379280.0, "step": 355 }, { "entropy": 0.9878545552492142, "epoch": 0.1874670879410216, "grad_norm": 0.47208353877067566, "learning_rate": 0.00017794486215538848, "loss": 0.2748403549194336, "mean_token_accuracy": 0.8964878469705582, "num_tokens": 4391616.0, "step": 356 }, { "entropy": 0.9895420670509338, "epoch": 0.18799368088467613, "grad_norm": 0.503665566444397, "learning_rate": 0.00017844611528822056, "loss": 0.24393996596336365, "mean_token_accuracy": 0.9081792533397675, "num_tokens": 4403952.0, "step": 357 }, { "entropy": 0.983001708984375, "epoch": 0.1885202738283307, "grad_norm": 0.5069933533668518, "learning_rate": 0.00017894736842105264, "loss": 0.2519129514694214, "mean_token_accuracy": 0.9055497497320175, "num_tokens": 4416288.0, "step": 358 }, { "entropy": 0.9950737804174423, "epoch": 0.18904686677198526, "grad_norm": 0.4974028766155243, "learning_rate": 0.00017944862155388472, "loss": 0.26243290305137634, "mean_token_accuracy": 0.8986903131008148, "num_tokens": 4428624.0, "step": 359 }, { "entropy": 1.0079210847616196, "epoch": 0.1895734597156398, "grad_norm": 0.5110583901405334, "learning_rate": 0.0001799498746867168, "loss": 0.2294146716594696, "mean_token_accuracy": 0.9131651520729065, "num_tokens": 4440960.0, "step": 360 }, { "entropy": 1.0026690363883972, "epoch": 0.19010005265929436, "grad_norm": 0.4598653316497803, "learning_rate": 0.00018045112781954887, "loss": 0.2722235321998596, "mean_token_accuracy": 0.8976626545190811, "num_tokens": 4453296.0, "step": 361 }, { "entropy": 1.0199629068374634, "epoch": 0.19062664560294892, "grad_norm": 0.4637596905231476, "learning_rate": 0.00018095238095238095, "loss": 0.2665867507457733, "mean_token_accuracy": 0.9000826925039291, "num_tokens": 4465632.0, "step": 362 }, { "entropy": 1.0425358265638351, "epoch": 0.1911532385466035, "grad_norm": 0.47371116280555725, "learning_rate": 0.00018145363408521303, "loss": 0.261046439409256, "mean_token_accuracy": 0.8978727906942368, "num_tokens": 4477968.0, "step": 363 }, { "entropy": 1.0688822865486145, "epoch": 0.19167983149025802, "grad_norm": 0.588598370552063, "learning_rate": 0.0001819548872180451, "loss": 0.2722393274307251, "mean_token_accuracy": 0.8954607844352722, "num_tokens": 4490304.0, "step": 364 }, { "entropy": 1.0311770141124725, "epoch": 0.1922064244339126, "grad_norm": 0.6127772331237793, "learning_rate": 0.0001824561403508772, "loss": 0.26557645201683044, "mean_token_accuracy": 0.898269534111023, "num_tokens": 4502640.0, "step": 365 }, { "entropy": 1.023191675543785, "epoch": 0.19273301737756715, "grad_norm": 0.4277988076210022, "learning_rate": 0.0001829573934837093, "loss": 0.25198060274124146, "mean_token_accuracy": 0.9041500091552734, "num_tokens": 4514976.0, "step": 366 }, { "entropy": 0.992491751909256, "epoch": 0.1932596103212217, "grad_norm": 0.4713631272315979, "learning_rate": 0.00018345864661654135, "loss": 0.25175848603248596, "mean_token_accuracy": 0.9065804481506348, "num_tokens": 4527312.0, "step": 367 }, { "entropy": 0.9969351142644882, "epoch": 0.19378620326487625, "grad_norm": 0.4729400873184204, "learning_rate": 0.00018395989974937345, "loss": 0.2526015341281891, "mean_token_accuracy": 0.9010139107704163, "num_tokens": 4539648.0, "step": 368 }, { "entropy": 1.0536664575338364, "epoch": 0.1943127962085308, "grad_norm": 0.5235168933868408, "learning_rate": 0.0001844611528822055, "loss": 0.292032927274704, "mean_token_accuracy": 0.8931012600660324, "num_tokens": 4551984.0, "step": 369 }, { "entropy": 1.042996197938919, "epoch": 0.19483938915218535, "grad_norm": 0.48083820939064026, "learning_rate": 0.0001849624060150376, "loss": 0.26578348875045776, "mean_token_accuracy": 0.9036569446325302, "num_tokens": 4564320.0, "step": 370 }, { "entropy": 1.0278095752000809, "epoch": 0.1953659820958399, "grad_norm": 0.39684435725212097, "learning_rate": 0.00018546365914786966, "loss": 0.23184379935264587, "mean_token_accuracy": 0.9090972989797592, "num_tokens": 4576656.0, "step": 371 }, { "entropy": 1.0532077848911285, "epoch": 0.19589257503949448, "grad_norm": 0.40189671516418457, "learning_rate": 0.00018596491228070177, "loss": 0.22099974751472473, "mean_token_accuracy": 0.9153455793857574, "num_tokens": 4588992.0, "step": 372 }, { "entropy": 1.090534657239914, "epoch": 0.196419167983149, "grad_norm": 0.4149918258190155, "learning_rate": 0.00018646616541353382, "loss": 0.26646703481674194, "mean_token_accuracy": 0.8960744440555573, "num_tokens": 4601328.0, "step": 373 }, { "entropy": 1.1020061373710632, "epoch": 0.19694576092680358, "grad_norm": 0.4702380299568176, "learning_rate": 0.00018696741854636593, "loss": 0.221252903342247, "mean_token_accuracy": 0.9114280194044113, "num_tokens": 4613664.0, "step": 374 }, { "entropy": 1.0703049004077911, "epoch": 0.19747235387045814, "grad_norm": 0.3877512216567993, "learning_rate": 0.00018746867167919798, "loss": 0.2393355667591095, "mean_token_accuracy": 0.9077306538820267, "num_tokens": 4626000.0, "step": 375 }, { "entropy": 1.1242592930793762, "epoch": 0.1979989468141127, "grad_norm": 0.4995574355125427, "learning_rate": 0.00018796992481203009, "loss": 0.26316261291503906, "mean_token_accuracy": 0.9027625322341919, "num_tokens": 4638336.0, "step": 376 }, { "entropy": 1.1577873229980469, "epoch": 0.19852553975776724, "grad_norm": 0.5234032273292542, "learning_rate": 0.00018847117794486217, "loss": 0.27375704050064087, "mean_token_accuracy": 0.8979371786117554, "num_tokens": 4650672.0, "step": 377 }, { "entropy": 1.1344494223594666, "epoch": 0.1990521327014218, "grad_norm": 0.5000519752502441, "learning_rate": 0.00018897243107769424, "loss": 0.26018521189689636, "mean_token_accuracy": 0.9034091979265213, "num_tokens": 4663008.0, "step": 378 }, { "entropy": 1.2858175039291382, "epoch": 0.19957872564507637, "grad_norm": 0.4786364436149597, "learning_rate": 0.00018947368421052632, "loss": 0.2609444260597229, "mean_token_accuracy": 0.8963579833507538, "num_tokens": 4675344.0, "step": 379 }, { "entropy": 1.205563873052597, "epoch": 0.2001053185887309, "grad_norm": 0.49225375056266785, "learning_rate": 0.0001899749373433584, "loss": 0.2702328562736511, "mean_token_accuracy": 0.89518603682518, "num_tokens": 4687680.0, "step": 380 }, { "entropy": 1.2623814940452576, "epoch": 0.20063191153238547, "grad_norm": 0.4847429692745209, "learning_rate": 0.00019047619047619048, "loss": 0.23678088188171387, "mean_token_accuracy": 0.9141177982091904, "num_tokens": 4700016.0, "step": 381 }, { "entropy": 1.2621397376060486, "epoch": 0.20115850447604003, "grad_norm": 0.42388200759887695, "learning_rate": 0.00019097744360902256, "loss": 0.22780729830265045, "mean_token_accuracy": 0.9121877998113632, "num_tokens": 4712352.0, "step": 382 }, { "entropy": 1.292501300573349, "epoch": 0.20168509741969456, "grad_norm": 0.4779922366142273, "learning_rate": 0.00019147869674185464, "loss": 0.2594977915287018, "mean_token_accuracy": 0.9015758037567139, "num_tokens": 4724688.0, "step": 383 }, { "entropy": 1.2592476904392242, "epoch": 0.20221169036334913, "grad_norm": 0.5031237006187439, "learning_rate": 0.00019197994987468672, "loss": 0.2655055820941925, "mean_token_accuracy": 0.8991453051567078, "num_tokens": 4737024.0, "step": 384 }, { "entropy": 1.2670154571533203, "epoch": 0.2027382833070037, "grad_norm": 0.43786391615867615, "learning_rate": 0.0001924812030075188, "loss": 0.2638092637062073, "mean_token_accuracy": 0.9021878391504288, "num_tokens": 4749360.0, "step": 385 }, { "entropy": 1.2625199258327484, "epoch": 0.20326487625065823, "grad_norm": 0.6012351512908936, "learning_rate": 0.00019298245614035088, "loss": 0.25398504734039307, "mean_token_accuracy": 0.9037431925535202, "num_tokens": 4761696.0, "step": 386 }, { "entropy": 1.2534445226192474, "epoch": 0.2037914691943128, "grad_norm": 0.48004376888275146, "learning_rate": 0.00019348370927318296, "loss": 0.24518710374832153, "mean_token_accuracy": 0.9088338762521744, "num_tokens": 4774032.0, "step": 387 }, { "entropy": 1.2239902317523956, "epoch": 0.20431806213796735, "grad_norm": 0.40316712856292725, "learning_rate": 0.00019398496240601503, "loss": 0.22658605873584747, "mean_token_accuracy": 0.9146187752485275, "num_tokens": 4786368.0, "step": 388 }, { "entropy": 1.236211746931076, "epoch": 0.20484465508162192, "grad_norm": 0.4805733859539032, "learning_rate": 0.0001944862155388471, "loss": 0.2645362615585327, "mean_token_accuracy": 0.899237260222435, "num_tokens": 4798704.0, "step": 389 }, { "entropy": 1.2168347239494324, "epoch": 0.20537124802527645, "grad_norm": 0.4017006754875183, "learning_rate": 0.00019498746867167922, "loss": 0.23945499956607819, "mean_token_accuracy": 0.9106440991163254, "num_tokens": 4811040.0, "step": 390 }, { "entropy": 1.2192648351192474, "epoch": 0.20589784096893102, "grad_norm": 0.4144308269023895, "learning_rate": 0.00019548872180451127, "loss": 0.24552568793296814, "mean_token_accuracy": 0.9093390554189682, "num_tokens": 4823376.0, "step": 391 }, { "entropy": 1.2436101734638214, "epoch": 0.20642443391258558, "grad_norm": 0.4212309420108795, "learning_rate": 0.00019598997493734338, "loss": 0.23153892159461975, "mean_token_accuracy": 0.9111403673887253, "num_tokens": 4835712.0, "step": 392 }, { "entropy": 1.255335807800293, "epoch": 0.20695102685624012, "grad_norm": 0.40789833664894104, "learning_rate": 0.00019649122807017543, "loss": 0.22183379530906677, "mean_token_accuracy": 0.9136195629835129, "num_tokens": 4848048.0, "step": 393 }, { "entropy": 1.2751134932041168, "epoch": 0.20747761979989468, "grad_norm": 0.4400269091129303, "learning_rate": 0.00019699248120300754, "loss": 0.24014121294021606, "mean_token_accuracy": 0.9085260182619095, "num_tokens": 4860384.0, "step": 394 }, { "entropy": 1.360796719789505, "epoch": 0.20800421274354924, "grad_norm": 0.4804284870624542, "learning_rate": 0.0001974937343358396, "loss": 0.25582095980644226, "mean_token_accuracy": 0.9006912261247635, "num_tokens": 4872720.0, "step": 395 }, { "entropy": 1.3161850571632385, "epoch": 0.20853080568720378, "grad_norm": 0.43244144320487976, "learning_rate": 0.0001979949874686717, "loss": 0.2349988967180252, "mean_token_accuracy": 0.9116800725460052, "num_tokens": 4885056.0, "step": 396 }, { "entropy": 1.3374731242656708, "epoch": 0.20905739863085834, "grad_norm": 0.4748205840587616, "learning_rate": 0.00019849624060150375, "loss": 0.22185081243515015, "mean_token_accuracy": 0.9125295132398605, "num_tokens": 4897392.0, "step": 397 }, { "entropy": 1.3775228261947632, "epoch": 0.2095839915745129, "grad_norm": 0.4581362307071686, "learning_rate": 0.00019899749373433585, "loss": 0.2567383646965027, "mean_token_accuracy": 0.9047663658857346, "num_tokens": 4909728.0, "step": 398 }, { "entropy": 1.4304566085338593, "epoch": 0.21011058451816747, "grad_norm": 0.5330026149749756, "learning_rate": 0.00019949874686716793, "loss": 0.24410131573677063, "mean_token_accuracy": 0.9004727154970169, "num_tokens": 4922064.0, "step": 399 }, { "entropy": 1.4176018834114075, "epoch": 0.210637177461822, "grad_norm": 0.5187347531318665, "learning_rate": 0.0002, "loss": 0.2622545063495636, "mean_token_accuracy": 0.8981441259384155, "num_tokens": 4934400.0, "step": 400 }, { "entropy": 1.3980787992477417, "epoch": 0.21116377040547657, "grad_norm": 0.4053288400173187, "learning_rate": 0.0001999999973286123, "loss": 0.23980936408042908, "mean_token_accuracy": 0.912782147526741, "num_tokens": 4946736.0, "step": 401 }, { "entropy": 1.4483689367771149, "epoch": 0.21169036334913113, "grad_norm": 0.45620113611221313, "learning_rate": 0.00019999998931444929, "loss": 0.25808754563331604, "mean_token_accuracy": 0.9030732810497284, "num_tokens": 4959072.0, "step": 402 }, { "entropy": 1.4470272064208984, "epoch": 0.21221695629278567, "grad_norm": 0.45807719230651855, "learning_rate": 0.0001999999759575115, "loss": 0.258093923330307, "mean_token_accuracy": 0.9026659429073334, "num_tokens": 4971408.0, "step": 403 }, { "entropy": 1.425654649734497, "epoch": 0.21274354923644023, "grad_norm": 0.4397832751274109, "learning_rate": 0.0001999999572577997, "loss": 0.24665014445781708, "mean_token_accuracy": 0.9062764793634415, "num_tokens": 4983744.0, "step": 404 }, { "entropy": 1.5687190890312195, "epoch": 0.2132701421800948, "grad_norm": 0.5367022156715393, "learning_rate": 0.00019999993321531494, "loss": 0.24174389243125916, "mean_token_accuracy": 0.9081769734621048, "num_tokens": 4996080.0, "step": 405 }, { "entropy": 1.405859649181366, "epoch": 0.21379673512374933, "grad_norm": 0.4007917046546936, "learning_rate": 0.00019999990383005872, "loss": 0.25402745604515076, "mean_token_accuracy": 0.9025277644395828, "num_tokens": 5008416.0, "step": 406 }, { "entropy": 1.4313717782497406, "epoch": 0.2143233280674039, "grad_norm": 0.4160802662372589, "learning_rate": 0.00019999986910203282, "loss": 0.24924606084823608, "mean_token_accuracy": 0.9043161869049072, "num_tokens": 5020752.0, "step": 407 }, { "entropy": 1.4701331555843353, "epoch": 0.21484992101105846, "grad_norm": 0.4316672086715698, "learning_rate": 0.00019999982903123921, "loss": 0.2638508379459381, "mean_token_accuracy": 0.8981801271438599, "num_tokens": 5033088.0, "step": 408 }, { "entropy": 1.4392390549182892, "epoch": 0.215376513954713, "grad_norm": 0.4544552266597748, "learning_rate": 0.00019999978361768031, "loss": 0.23990359902381897, "mean_token_accuracy": 0.9076667875051498, "num_tokens": 5045424.0, "step": 409 }, { "entropy": 1.4876410961151123, "epoch": 0.21590310689836756, "grad_norm": 0.4295142889022827, "learning_rate": 0.00019999973286135886, "loss": 0.21840089559555054, "mean_token_accuracy": 0.9214875847101212, "num_tokens": 5057760.0, "step": 410 }, { "entropy": 1.50434610247612, "epoch": 0.21642969984202212, "grad_norm": 0.4359295070171356, "learning_rate": 0.00019999967676227775, "loss": 0.2510741353034973, "mean_token_accuracy": 0.9052848815917969, "num_tokens": 5070096.0, "step": 411 }, { "entropy": 1.4829690754413605, "epoch": 0.21695629278567669, "grad_norm": 0.42792809009552, "learning_rate": 0.00019999961532044045, "loss": 0.2551060616970062, "mean_token_accuracy": 0.9011600762605667, "num_tokens": 5082432.0, "step": 412 }, { "entropy": 1.4852145910263062, "epoch": 0.21748288572933122, "grad_norm": 0.4182438850402832, "learning_rate": 0.00019999954853585052, "loss": 0.24789488315582275, "mean_token_accuracy": 0.9069723039865494, "num_tokens": 5094768.0, "step": 413 }, { "entropy": 1.4210355281829834, "epoch": 0.21800947867298578, "grad_norm": 0.42366713285446167, "learning_rate": 0.00019999947640851195, "loss": 0.24643118679523468, "mean_token_accuracy": 0.9047895669937134, "num_tokens": 5107104.0, "step": 414 }, { "entropy": 1.525164395570755, "epoch": 0.21853607161664035, "grad_norm": 0.4372459352016449, "learning_rate": 0.00019999939893842905, "loss": 0.2424328625202179, "mean_token_accuracy": 0.9087924510240555, "num_tokens": 5119440.0, "step": 415 }, { "entropy": 1.4822115898132324, "epoch": 0.21906266456029488, "grad_norm": 0.4659183919429779, "learning_rate": 0.00019999931612560637, "loss": 0.22431665658950806, "mean_token_accuracy": 0.9165952354669571, "num_tokens": 5131776.0, "step": 416 }, { "entropy": 1.5467821657657623, "epoch": 0.21958925750394945, "grad_norm": 0.44125568866729736, "learning_rate": 0.00019999922797004884, "loss": 0.23688746988773346, "mean_token_accuracy": 0.9075507670640945, "num_tokens": 5144112.0, "step": 417 }, { "entropy": 1.4780353605747223, "epoch": 0.220115850447604, "grad_norm": 0.43714895844459534, "learning_rate": 0.00019999913447176174, "loss": 0.24803104996681213, "mean_token_accuracy": 0.9086460769176483, "num_tokens": 5156448.0, "step": 418 }, { "entropy": 1.442844033241272, "epoch": 0.22064244339125855, "grad_norm": 0.5062248110771179, "learning_rate": 0.00019999903563075051, "loss": 0.2509956657886505, "mean_token_accuracy": 0.9084739983081818, "num_tokens": 5168784.0, "step": 419 }, { "entropy": 1.472544252872467, "epoch": 0.2211690363349131, "grad_norm": 0.44560346007347107, "learning_rate": 0.00019999893144702116, "loss": 0.2571001648902893, "mean_token_accuracy": 0.9050741344690323, "num_tokens": 5181120.0, "step": 420 }, { "entropy": 1.4741449654102325, "epoch": 0.22169562927856767, "grad_norm": 0.468660444021225, "learning_rate": 0.00019999882192057975, "loss": 0.2654499113559723, "mean_token_accuracy": 0.9030983746051788, "num_tokens": 5193456.0, "step": 421 }, { "entropy": 1.4696997106075287, "epoch": 0.2222222222222222, "grad_norm": 0.42363062500953674, "learning_rate": 0.0001999987070514329, "loss": 0.2351139783859253, "mean_token_accuracy": 0.9069055020809174, "num_tokens": 5205792.0, "step": 422 }, { "entropy": 1.452900618314743, "epoch": 0.22274881516587677, "grad_norm": 0.45147648453712463, "learning_rate": 0.00019999858683958726, "loss": 0.236272394657135, "mean_token_accuracy": 0.9084236770868301, "num_tokens": 5218128.0, "step": 423 }, { "entropy": 1.5096050798892975, "epoch": 0.22327540810953134, "grad_norm": 0.4349573850631714, "learning_rate": 0.00019999846128505015, "loss": 0.21908816695213318, "mean_token_accuracy": 0.9153110533952713, "num_tokens": 5230464.0, "step": 424 }, { "entropy": 1.5504009425640106, "epoch": 0.2238020010531859, "grad_norm": 0.40080899000167847, "learning_rate": 0.00019999833038782897, "loss": 0.21589110791683197, "mean_token_accuracy": 0.9171598702669144, "num_tokens": 5242800.0, "step": 425 }, { "entropy": 1.4936735033988953, "epoch": 0.22432859399684044, "grad_norm": 0.4071311056613922, "learning_rate": 0.0001999981941479314, "loss": 0.2125779092311859, "mean_token_accuracy": 0.9237974286079407, "num_tokens": 5255136.0, "step": 426 }, { "entropy": 1.5081810355186462, "epoch": 0.224855186940495, "grad_norm": 0.4242808222770691, "learning_rate": 0.0001999980525653656, "loss": 0.2447715699672699, "mean_token_accuracy": 0.9042525738477707, "num_tokens": 5267472.0, "step": 427 }, { "entropy": 1.5077386796474457, "epoch": 0.22538177988414956, "grad_norm": 0.5070521235466003, "learning_rate": 0.00019999790564014, "loss": 0.26209956407546997, "mean_token_accuracy": 0.9026446640491486, "num_tokens": 5279808.0, "step": 428 }, { "entropy": 1.4962070286273956, "epoch": 0.2259083728278041, "grad_norm": 0.6017259955406189, "learning_rate": 0.00019999775337226327, "loss": 0.3165000081062317, "mean_token_accuracy": 0.8868077397346497, "num_tokens": 5292144.0, "step": 429 }, { "entropy": 1.4911207258701324, "epoch": 0.22643496577145866, "grad_norm": 0.47006961703300476, "learning_rate": 0.00019999759576174448, "loss": 0.22799812257289886, "mean_token_accuracy": 0.9069435149431229, "num_tokens": 5304480.0, "step": 430 }, { "entropy": 1.5028018951416016, "epoch": 0.22696155871511323, "grad_norm": 0.4170990288257599, "learning_rate": 0.00019999743280859296, "loss": 0.21681472659111023, "mean_token_accuracy": 0.9184076339006424, "num_tokens": 5316816.0, "step": 431 }, { "entropy": 1.6698609590530396, "epoch": 0.22748815165876776, "grad_norm": 0.6547060012817383, "learning_rate": 0.0001999972645128184, "loss": 0.24768398702144623, "mean_token_accuracy": 0.9032211750745773, "num_tokens": 5329152.0, "step": 432 }, { "entropy": 1.549822211265564, "epoch": 0.22801474460242233, "grad_norm": 0.433370441198349, "learning_rate": 0.00019999709087443083, "loss": 0.24651046097278595, "mean_token_accuracy": 0.9072823375463486, "num_tokens": 5341488.0, "step": 433 }, { "entropy": 1.5724502205848694, "epoch": 0.2285413375460769, "grad_norm": 0.5081071853637695, "learning_rate": 0.00019999691189344045, "loss": 0.2539141774177551, "mean_token_accuracy": 0.901251494884491, "num_tokens": 5353824.0, "step": 434 }, { "entropy": 1.580730140209198, "epoch": 0.22906793048973143, "grad_norm": 0.4615112841129303, "learning_rate": 0.000199996727569858, "loss": 0.23179525136947632, "mean_token_accuracy": 0.9096536040306091, "num_tokens": 5366160.0, "step": 435 }, { "entropy": 1.6549272239208221, "epoch": 0.229594523433386, "grad_norm": 0.6388656497001648, "learning_rate": 0.00019999653790369438, "loss": 0.29721513390541077, "mean_token_accuracy": 0.8857980072498322, "num_tokens": 5378496.0, "step": 436 }, { "entropy": 1.6025878190994263, "epoch": 0.23012111637704055, "grad_norm": 0.49696317315101624, "learning_rate": 0.0001999963428949608, "loss": 0.2271474003791809, "mean_token_accuracy": 0.9138942360877991, "num_tokens": 5390832.0, "step": 437 }, { "entropy": 1.5836864113807678, "epoch": 0.23064770932069512, "grad_norm": 0.4876512289047241, "learning_rate": 0.00019999614254366895, "loss": 0.24330684542655945, "mean_token_accuracy": 0.9093976020812988, "num_tokens": 5403168.0, "step": 438 }, { "entropy": 1.5200332999229431, "epoch": 0.23117430226434965, "grad_norm": 0.6539078950881958, "learning_rate": 0.00019999593684983058, "loss": 0.2600172460079193, "mean_token_accuracy": 0.8999185413122177, "num_tokens": 5415504.0, "step": 439 }, { "entropy": 1.4733262360095978, "epoch": 0.23170089520800422, "grad_norm": 0.42358288168907166, "learning_rate": 0.000199995725813458, "loss": 0.22544077038764954, "mean_token_accuracy": 0.9120991379022598, "num_tokens": 5427840.0, "step": 440 }, { "entropy": 1.414179265499115, "epoch": 0.23222748815165878, "grad_norm": 0.49307864904403687, "learning_rate": 0.00019999550943456375, "loss": 0.24960950016975403, "mean_token_accuracy": 0.9004078656435013, "num_tokens": 5440176.0, "step": 441 }, { "entropy": 1.429827481508255, "epoch": 0.23275408109531331, "grad_norm": 0.505660891532898, "learning_rate": 0.00019999528771316057, "loss": 0.25559940934181213, "mean_token_accuracy": 0.9029601365327835, "num_tokens": 5452512.0, "step": 442 }, { "entropy": 1.4452406466007233, "epoch": 0.23328067403896788, "grad_norm": 0.5408805012702942, "learning_rate": 0.00019999506064926175, "loss": 0.2864495515823364, "mean_token_accuracy": 0.8919995576143265, "num_tokens": 5464848.0, "step": 443 }, { "entropy": 1.441390186548233, "epoch": 0.23380726698262244, "grad_norm": 0.49373185634613037, "learning_rate": 0.0001999948282428807, "loss": 0.2585368752479553, "mean_token_accuracy": 0.8959326446056366, "num_tokens": 5477184.0, "step": 444 }, { "entropy": 1.386150062084198, "epoch": 0.23433385992627698, "grad_norm": 0.4148918390274048, "learning_rate": 0.0001999945904940312, "loss": 0.2401098757982254, "mean_token_accuracy": 0.9103811830282211, "num_tokens": 5489520.0, "step": 445 }, { "entropy": 1.4309166073799133, "epoch": 0.23486045286993154, "grad_norm": 0.46061956882476807, "learning_rate": 0.00019999434740272743, "loss": 0.2515195310115814, "mean_token_accuracy": 0.9047931730747223, "num_tokens": 5501856.0, "step": 446 }, { "entropy": 1.4778549373149872, "epoch": 0.2353870458135861, "grad_norm": 0.543989896774292, "learning_rate": 0.00019999409896898372, "loss": 0.23118984699249268, "mean_token_accuracy": 0.9122479408979416, "num_tokens": 5514192.0, "step": 447 }, { "entropy": 1.3631019592285156, "epoch": 0.23591363875724064, "grad_norm": 0.39872297644615173, "learning_rate": 0.00019999384519281494, "loss": 0.23500953614711761, "mean_token_accuracy": 0.9080264270305634, "num_tokens": 5526528.0, "step": 448 }, { "entropy": 1.4472846686840057, "epoch": 0.2364402317008952, "grad_norm": 0.4705425500869751, "learning_rate": 0.00019999358607423608, "loss": 0.2556760609149933, "mean_token_accuracy": 0.903324156999588, "num_tokens": 5538864.0, "step": 449 }, { "entropy": 1.4216105043888092, "epoch": 0.23696682464454977, "grad_norm": 0.42123982310295105, "learning_rate": 0.00019999332161326253, "loss": 0.24162599444389343, "mean_token_accuracy": 0.906711995601654, "num_tokens": 5551200.0, "step": 450 }, { "entropy": 1.3214130699634552, "epoch": 0.23749341758820433, "grad_norm": 0.4052497148513794, "learning_rate": 0.00019999305180991002, "loss": 0.23021447658538818, "mean_token_accuracy": 0.9166329354047775, "num_tokens": 5563536.0, "step": 451 }, { "entropy": 1.2956161499023438, "epoch": 0.23802001053185887, "grad_norm": 0.4208316206932068, "learning_rate": 0.0001999927766641945, "loss": 0.25906720757484436, "mean_token_accuracy": 0.8939131498336792, "num_tokens": 5575872.0, "step": 452 }, { "entropy": 1.2186987400054932, "epoch": 0.23854660347551343, "grad_norm": 0.423001766204834, "learning_rate": 0.00019999249617613237, "loss": 0.2634647488594055, "mean_token_accuracy": 0.8950765579938889, "num_tokens": 5588208.0, "step": 453 }, { "entropy": 1.1696477234363556, "epoch": 0.239073196419168, "grad_norm": 0.7100384831428528, "learning_rate": 0.00019999221034574028, "loss": 0.2620895504951477, "mean_token_accuracy": 0.901919424533844, "num_tokens": 5600544.0, "step": 454 }, { "entropy": 1.1881844103336334, "epoch": 0.23959978936282253, "grad_norm": 0.40986204147338867, "learning_rate": 0.00019999191917303513, "loss": 0.23100420832633972, "mean_token_accuracy": 0.9076221436262131, "num_tokens": 5612880.0, "step": 455 }, { "entropy": 1.0672442317008972, "epoch": 0.2401263823064771, "grad_norm": 0.9633269309997559, "learning_rate": 0.0001999916226580343, "loss": 0.2286304533481598, "mean_token_accuracy": 0.9094352871179581, "num_tokens": 5625216.0, "step": 456 }, { "entropy": 1.0725638568401337, "epoch": 0.24065297525013166, "grad_norm": 0.5792625546455383, "learning_rate": 0.0001999913208007553, "loss": 0.21992720663547516, "mean_token_accuracy": 0.9132383912801743, "num_tokens": 5637552.0, "step": 457 }, { "entropy": 1.0756218880414963, "epoch": 0.2411795681937862, "grad_norm": 0.4889819622039795, "learning_rate": 0.0001999910136012161, "loss": 0.22047317028045654, "mean_token_accuracy": 0.9096969217061996, "num_tokens": 5649888.0, "step": 458 }, { "entropy": 1.025196298956871, "epoch": 0.24170616113744076, "grad_norm": 0.43335074186325073, "learning_rate": 0.00019999070105943494, "loss": 0.23299942910671234, "mean_token_accuracy": 0.9110541045665741, "num_tokens": 5662224.0, "step": 459 }, { "entropy": 1.0740464180707932, "epoch": 0.24223275408109532, "grad_norm": 0.4134856164455414, "learning_rate": 0.00019999038317543036, "loss": 0.2113601118326187, "mean_token_accuracy": 0.9125392287969589, "num_tokens": 5674560.0, "step": 460 }, { "entropy": 1.0400484502315521, "epoch": 0.24275934702474986, "grad_norm": 0.3933151364326477, "learning_rate": 0.00019999005994922125, "loss": 0.23023052513599396, "mean_token_accuracy": 0.9128931611776352, "num_tokens": 5686896.0, "step": 461 }, { "entropy": 1.033817708492279, "epoch": 0.24328593996840442, "grad_norm": 0.4203343093395233, "learning_rate": 0.00019998973138082675, "loss": 0.23599188029766083, "mean_token_accuracy": 0.9099869877099991, "num_tokens": 5699232.0, "step": 462 }, { "entropy": 1.0623035430908203, "epoch": 0.24381253291205898, "grad_norm": 0.41818881034851074, "learning_rate": 0.00019998939747026644, "loss": 0.23520024120807648, "mean_token_accuracy": 0.9101691842079163, "num_tokens": 5711568.0, "step": 463 }, { "entropy": 1.0741385221481323, "epoch": 0.24433912585571355, "grad_norm": 0.4350592792034149, "learning_rate": 0.00019998905821756006, "loss": 0.26694831252098083, "mean_token_accuracy": 0.8980891853570938, "num_tokens": 5723904.0, "step": 464 }, { "entropy": 1.1385951340198517, "epoch": 0.24486571879936808, "grad_norm": 0.4376484155654907, "learning_rate": 0.00019998871362272784, "loss": 0.25515180826187134, "mean_token_accuracy": 0.9086296558380127, "num_tokens": 5736240.0, "step": 465 }, { "entropy": 1.0884679853916168, "epoch": 0.24539231174302265, "grad_norm": 0.42011401057243347, "learning_rate": 0.00019998836368579013, "loss": 0.2314184159040451, "mean_token_accuracy": 0.9099607318639755, "num_tokens": 5748576.0, "step": 466 }, { "entropy": 1.09638212621212, "epoch": 0.2459189046866772, "grad_norm": 0.39627403020858765, "learning_rate": 0.0001999880084067678, "loss": 0.21417196094989777, "mean_token_accuracy": 0.9153980165719986, "num_tokens": 5760912.0, "step": 467 }, { "entropy": 1.091229110956192, "epoch": 0.24644549763033174, "grad_norm": 0.4235895872116089, "learning_rate": 0.00019998764778568192, "loss": 0.2682695686817169, "mean_token_accuracy": 0.9011466205120087, "num_tokens": 5773248.0, "step": 468 }, { "entropy": 1.1204252541065216, "epoch": 0.2469720905739863, "grad_norm": 0.43689507246017456, "learning_rate": 0.00019998728182255381, "loss": 0.24578194320201874, "mean_token_accuracy": 0.9062277525663376, "num_tokens": 5785584.0, "step": 469 }, { "entropy": 1.1320042610168457, "epoch": 0.24749868351764087, "grad_norm": 0.4219723641872406, "learning_rate": 0.0001999869105174053, "loss": 0.22462952136993408, "mean_token_accuracy": 0.9171530902385712, "num_tokens": 5797920.0, "step": 470 }, { "entropy": 1.1340222358703613, "epoch": 0.2480252764612954, "grad_norm": 0.3906649351119995, "learning_rate": 0.00019998653387025842, "loss": 0.2314276546239853, "mean_token_accuracy": 0.9133926779031754, "num_tokens": 5810256.0, "step": 471 }, { "entropy": 1.148337960243225, "epoch": 0.24855186940494997, "grad_norm": 0.435470312833786, "learning_rate": 0.00019998615188113547, "loss": 0.27237382531166077, "mean_token_accuracy": 0.8951744884252548, "num_tokens": 5822592.0, "step": 472 }, { "entropy": 1.084697663784027, "epoch": 0.24907846234860453, "grad_norm": 0.3843922019004822, "learning_rate": 0.00019998576455005918, "loss": 0.21877625584602356, "mean_token_accuracy": 0.9148665964603424, "num_tokens": 5834928.0, "step": 473 }, { "entropy": 1.1236861050128937, "epoch": 0.24960505529225907, "grad_norm": 0.3693842887878418, "learning_rate": 0.0001999853718770525, "loss": 0.24262937903404236, "mean_token_accuracy": 0.9089461863040924, "num_tokens": 5847264.0, "step": 474 }, { "entropy": 1.0875613689422607, "epoch": 0.25013164823591366, "grad_norm": 0.36348292231559753, "learning_rate": 0.0001999849738621388, "loss": 0.22801700234413147, "mean_token_accuracy": 0.9149875193834305, "num_tokens": 5859600.0, "step": 475 }, { "entropy": 1.1611447632312775, "epoch": 0.2506582411795682, "grad_norm": 0.3937731683254242, "learning_rate": 0.00019998457050534165, "loss": 0.2227628082036972, "mean_token_accuracy": 0.9130124449729919, "num_tokens": 5871936.0, "step": 476 }, { "entropy": 1.18001389503479, "epoch": 0.25118483412322273, "grad_norm": 0.38412168622016907, "learning_rate": 0.00019998416180668505, "loss": 0.25140437483787537, "mean_token_accuracy": 0.9021612256765366, "num_tokens": 5884272.0, "step": 477 }, { "entropy": 1.1783344447612762, "epoch": 0.2517114270668773, "grad_norm": 0.4068759083747864, "learning_rate": 0.00019998374776619316, "loss": 0.2507692575454712, "mean_token_accuracy": 0.9036175757646561, "num_tokens": 5896608.0, "step": 478 }, { "entropy": 1.2171072959899902, "epoch": 0.25223802001053186, "grad_norm": 0.38274940848350525, "learning_rate": 0.00019998332838389068, "loss": 0.23562754690647125, "mean_token_accuracy": 0.9149611443281174, "num_tokens": 5908944.0, "step": 479 }, { "entropy": 1.2112184464931488, "epoch": 0.2527646129541864, "grad_norm": 0.4171972870826721, "learning_rate": 0.00019998290365980247, "loss": 0.26383018493652344, "mean_token_accuracy": 0.8946961760520935, "num_tokens": 5921280.0, "step": 480 }, { "entropy": 1.1482765674591064, "epoch": 0.253291205897841, "grad_norm": 0.3705795407295227, "learning_rate": 0.0001999824735939537, "loss": 0.23539453744888306, "mean_token_accuracy": 0.9124044477939606, "num_tokens": 5933616.0, "step": 481 }, { "entropy": 1.1225126087665558, "epoch": 0.2538177988414955, "grad_norm": 0.38258257508277893, "learning_rate": 0.00019998203818636997, "loss": 0.24310466647148132, "mean_token_accuracy": 0.9069766700267792, "num_tokens": 5945952.0, "step": 482 }, { "entropy": 1.1831683218479156, "epoch": 0.25434439178515006, "grad_norm": 0.4023701548576355, "learning_rate": 0.00019998159743707706, "loss": 0.22924776375293732, "mean_token_accuracy": 0.910895898938179, "num_tokens": 5958288.0, "step": 483 }, { "entropy": 1.2125089168548584, "epoch": 0.25487098472880465, "grad_norm": 0.391679972410202, "learning_rate": 0.0001999811513461012, "loss": 0.23159608244895935, "mean_token_accuracy": 0.91130131483078, "num_tokens": 5970624.0, "step": 484 }, { "entropy": 1.1657118201255798, "epoch": 0.2553975776724592, "grad_norm": 0.36009886860847473, "learning_rate": 0.00019998069991346878, "loss": 0.22824552655220032, "mean_token_accuracy": 0.9051208347082138, "num_tokens": 5982960.0, "step": 485 }, { "entropy": 1.1666974127292633, "epoch": 0.2559241706161137, "grad_norm": 0.4200109839439392, "learning_rate": 0.00019998024313920668, "loss": 0.22612211108207703, "mean_token_accuracy": 0.9098036587238312, "num_tokens": 5995296.0, "step": 486 }, { "entropy": 1.1931614875793457, "epoch": 0.2564507635597683, "grad_norm": 0.3996848165988922, "learning_rate": 0.00019997978102334195, "loss": 0.23149043321609497, "mean_token_accuracy": 0.915941908955574, "num_tokens": 6007632.0, "step": 487 }, { "entropy": 1.2029556334018707, "epoch": 0.25697735650342285, "grad_norm": 0.381720632314682, "learning_rate": 0.00019997931356590212, "loss": 0.20601031184196472, "mean_token_accuracy": 0.9207601994276047, "num_tokens": 6019968.0, "step": 488 }, { "entropy": 1.286322921514511, "epoch": 0.2575039494470774, "grad_norm": 0.3947739601135254, "learning_rate": 0.00019997884076691484, "loss": 0.23165327310562134, "mean_token_accuracy": 0.9127722233533859, "num_tokens": 6032304.0, "step": 489 }, { "entropy": 1.1862512528896332, "epoch": 0.258030542390732, "grad_norm": 0.4733010232448578, "learning_rate": 0.00019997836262640825, "loss": 0.23455524444580078, "mean_token_accuracy": 0.9086931645870209, "num_tokens": 6044640.0, "step": 490 }, { "entropy": 1.2432229220867157, "epoch": 0.2585571353343865, "grad_norm": 0.5269920229911804, "learning_rate": 0.00019997787914441067, "loss": 0.25063106417655945, "mean_token_accuracy": 0.903441533446312, "num_tokens": 6056976.0, "step": 491 }, { "entropy": 1.1587136387825012, "epoch": 0.25908372827804105, "grad_norm": 0.3660036325454712, "learning_rate": 0.0001999773903209509, "loss": 0.23804998397827148, "mean_token_accuracy": 0.9118834733963013, "num_tokens": 6069312.0, "step": 492 }, { "entropy": 1.2006062865257263, "epoch": 0.25961032122169564, "grad_norm": 0.4517950117588043, "learning_rate": 0.00019997689615605785, "loss": 0.24688124656677246, "mean_token_accuracy": 0.9041164964437485, "num_tokens": 6081648.0, "step": 493 }, { "entropy": 1.2588125467300415, "epoch": 0.2601369141653502, "grad_norm": 0.3569098114967346, "learning_rate": 0.0001999763966497609, "loss": 0.22678923606872559, "mean_token_accuracy": 0.9117091447114944, "num_tokens": 6093984.0, "step": 494 }, { "entropy": 1.3271512985229492, "epoch": 0.26066350710900477, "grad_norm": 0.3427906036376953, "learning_rate": 0.00019997589180208972, "loss": 0.2427246868610382, "mean_token_accuracy": 0.91063092648983, "num_tokens": 6106320.0, "step": 495 }, { "entropy": 1.320880800485611, "epoch": 0.2611901000526593, "grad_norm": 0.41021794080734253, "learning_rate": 0.00019997538161307425, "loss": 0.24322479963302612, "mean_token_accuracy": 0.9047645032405853, "num_tokens": 6118656.0, "step": 496 }, { "entropy": 1.2419660687446594, "epoch": 0.26171669299631384, "grad_norm": 0.4706597328186035, "learning_rate": 0.00019997486608274478, "loss": 0.24686744809150696, "mean_token_accuracy": 0.9022967517375946, "num_tokens": 6130992.0, "step": 497 }, { "entropy": 1.2451711893081665, "epoch": 0.26224328593996843, "grad_norm": 0.37942013144493103, "learning_rate": 0.00019997434521113193, "loss": 0.2456897497177124, "mean_token_accuracy": 0.9084974527359009, "num_tokens": 6143328.0, "step": 498 }, { "entropy": 1.363191157579422, "epoch": 0.26276987888362296, "grad_norm": 0.4037798047065735, "learning_rate": 0.00019997381899826663, "loss": 0.24723505973815918, "mean_token_accuracy": 0.9025511145591736, "num_tokens": 6155664.0, "step": 499 }, { "entropy": 1.3585219979286194, "epoch": 0.2632964718272775, "grad_norm": 0.4076964855194092, "learning_rate": 0.0001999732874441801, "loss": 0.231999009847641, "mean_token_accuracy": 0.9121885448694229, "num_tokens": 6168000.0, "step": 500 }, { "entropy": 1.3322370648384094, "epoch": 0.2638230647709321, "grad_norm": 0.38084790110588074, "learning_rate": 0.0001999727505489039, "loss": 0.26456475257873535, "mean_token_accuracy": 0.9003604352474213, "num_tokens": 6180336.0, "step": 501 }, { "entropy": 1.3225562274456024, "epoch": 0.2643496577145866, "grad_norm": 0.3669094145298004, "learning_rate": 0.00019997220831246987, "loss": 0.22636903822422028, "mean_token_accuracy": 0.9135940670967102, "num_tokens": 6192672.0, "step": 502 }, { "entropy": 1.24677973985672, "epoch": 0.26487625065824116, "grad_norm": 0.36622145771980286, "learning_rate": 0.00019997166073491027, "loss": 0.2442116141319275, "mean_token_accuracy": 0.903778612613678, "num_tokens": 6205008.0, "step": 503 }, { "entropy": 1.2564740180969238, "epoch": 0.26540284360189575, "grad_norm": 0.37914055585861206, "learning_rate": 0.00019997110781625754, "loss": 0.250071257352829, "mean_token_accuracy": 0.905722975730896, "num_tokens": 6217344.0, "step": 504 }, { "entropy": 1.266231119632721, "epoch": 0.2659294365455503, "grad_norm": 0.4232172966003418, "learning_rate": 0.00019997054955654456, "loss": 0.22360444068908691, "mean_token_accuracy": 0.9164858758449554, "num_tokens": 6229680.0, "step": 505 }, { "entropy": 1.2842857539653778, "epoch": 0.2664560294892048, "grad_norm": 0.40517833828926086, "learning_rate": 0.0001999699859558044, "loss": 0.24367284774780273, "mean_token_accuracy": 0.906918466091156, "num_tokens": 6242016.0, "step": 506 }, { "entropy": 1.3325933814048767, "epoch": 0.2669826224328594, "grad_norm": 0.3894166648387909, "learning_rate": 0.00019996941701407058, "loss": 0.21899431943893433, "mean_token_accuracy": 0.9159570783376694, "num_tokens": 6254352.0, "step": 507 }, { "entropy": 1.2919807434082031, "epoch": 0.26750921537651395, "grad_norm": 0.3554909825325012, "learning_rate": 0.00019996884273137686, "loss": 0.22241441905498505, "mean_token_accuracy": 0.9181459695100784, "num_tokens": 6266688.0, "step": 508 }, { "entropy": 1.311550348997116, "epoch": 0.2680358083201685, "grad_norm": 0.36536744236946106, "learning_rate": 0.0001999682631077573, "loss": 0.2456498146057129, "mean_token_accuracy": 0.9058470577001572, "num_tokens": 6279024.0, "step": 509 }, { "entropy": 1.3708328008651733, "epoch": 0.2685624012638231, "grad_norm": 0.4042948782444, "learning_rate": 0.00019996767814324637, "loss": 0.266501247882843, "mean_token_accuracy": 0.900126188993454, "num_tokens": 6291360.0, "step": 510 }, { "entropy": 1.3850271105766296, "epoch": 0.2690889942074776, "grad_norm": 0.39048540592193604, "learning_rate": 0.00019996708783787874, "loss": 0.24780599772930145, "mean_token_accuracy": 0.9016763418912888, "num_tokens": 6303696.0, "step": 511 }, { "entropy": 1.3151749074459076, "epoch": 0.26961558715113215, "grad_norm": 0.37497779726982117, "learning_rate": 0.0001999664921916895, "loss": 0.23127570748329163, "mean_token_accuracy": 0.9075058400630951, "num_tokens": 6316032.0, "step": 512 }, { "entropy": 1.3835597038269043, "epoch": 0.27014218009478674, "grad_norm": 0.3880425691604614, "learning_rate": 0.00019996589120471392, "loss": 0.23898069560527802, "mean_token_accuracy": 0.9100230634212494, "num_tokens": 6328368.0, "step": 513 }, { "entropy": 1.4238722920417786, "epoch": 0.2706687730384413, "grad_norm": 0.36198124289512634, "learning_rate": 0.0001999652848769878, "loss": 0.22968879342079163, "mean_token_accuracy": 0.906474158167839, "num_tokens": 6340704.0, "step": 514 }, { "entropy": 1.517054557800293, "epoch": 0.2711953659820958, "grad_norm": 0.3657878637313843, "learning_rate": 0.00019996467320854703, "loss": 0.22068339586257935, "mean_token_accuracy": 0.9112901985645294, "num_tokens": 6353040.0, "step": 515 }, { "entropy": 1.5027157366275787, "epoch": 0.2717219589257504, "grad_norm": 0.34945791959762573, "learning_rate": 0.000199964056199428, "loss": 0.25596681237220764, "mean_token_accuracy": 0.9006428420543671, "num_tokens": 6365376.0, "step": 516 }, { "entropy": 1.5874098539352417, "epoch": 0.27224855186940494, "grad_norm": 0.3800085783004761, "learning_rate": 0.00019996343384966732, "loss": 0.25539156794548035, "mean_token_accuracy": 0.901904970407486, "num_tokens": 6377712.0, "step": 517 }, { "entropy": 1.5508817732334137, "epoch": 0.2727751448130595, "grad_norm": 0.3190958797931671, "learning_rate": 0.00019996280615930186, "loss": 0.235137477517128, "mean_token_accuracy": 0.9069496989250183, "num_tokens": 6390048.0, "step": 518 }, { "entropy": 1.5596497654914856, "epoch": 0.27330173775671407, "grad_norm": 0.35837146639823914, "learning_rate": 0.000199962173128369, "loss": 0.24638012051582336, "mean_token_accuracy": 0.9043673276901245, "num_tokens": 6402384.0, "step": 519 }, { "entropy": 1.544301688671112, "epoch": 0.2738283307003686, "grad_norm": 0.3943609595298767, "learning_rate": 0.00019996153475690623, "loss": 0.24823732674121857, "mean_token_accuracy": 0.9039914757013321, "num_tokens": 6414720.0, "step": 520 }, { "entropy": 1.4979600608348846, "epoch": 0.2743549236440232, "grad_norm": 0.3533165156841278, "learning_rate": 0.00019996089104495148, "loss": 0.21794329583644867, "mean_token_accuracy": 0.9170633852481842, "num_tokens": 6427056.0, "step": 521 }, { "entropy": 1.5348587334156036, "epoch": 0.27488151658767773, "grad_norm": 0.3516184091567993, "learning_rate": 0.00019996024199254295, "loss": 0.21856778860092163, "mean_token_accuracy": 0.9159553945064545, "num_tokens": 6439392.0, "step": 522 }, { "entropy": 1.5593447387218475, "epoch": 0.27540810953133227, "grad_norm": 0.3706720173358917, "learning_rate": 0.0001999595875997192, "loss": 0.24685126543045044, "mean_token_accuracy": 0.9023942798376083, "num_tokens": 6451728.0, "step": 523 }, { "entropy": 1.5938279330730438, "epoch": 0.27593470247498686, "grad_norm": 0.4374881088733673, "learning_rate": 0.00019995892786651905, "loss": 0.24188384413719177, "mean_token_accuracy": 0.904677078127861, "num_tokens": 6464064.0, "step": 524 }, { "entropy": 1.469886839389801, "epoch": 0.2764612954186414, "grad_norm": 0.46137046813964844, "learning_rate": 0.00019995826279298166, "loss": 0.23798640072345734, "mean_token_accuracy": 0.9109133780002594, "num_tokens": 6476400.0, "step": 525 }, { "entropy": 1.5873245596885681, "epoch": 0.27698788836229593, "grad_norm": 0.416920006275177, "learning_rate": 0.00019995759237914656, "loss": 0.25300133228302, "mean_token_accuracy": 0.9008941799402237, "num_tokens": 6488736.0, "step": 526 }, { "entropy": 1.5558778047561646, "epoch": 0.2775144813059505, "grad_norm": 0.36363670229911804, "learning_rate": 0.0001999569166250535, "loss": 0.22929418087005615, "mean_token_accuracy": 0.9127305895090103, "num_tokens": 6501072.0, "step": 527 }, { "entropy": 1.5871147811412811, "epoch": 0.27804107424960506, "grad_norm": 0.3830122947692871, "learning_rate": 0.00019995623553074258, "loss": 0.2472982108592987, "mean_token_accuracy": 0.9040207862854004, "num_tokens": 6513408.0, "step": 528 }, { "entropy": 1.6365769505500793, "epoch": 0.2785676671932596, "grad_norm": 0.3964959383010864, "learning_rate": 0.00019995554909625428, "loss": 0.25368693470954895, "mean_token_accuracy": 0.9007250666618347, "num_tokens": 6525744.0, "step": 529 }, { "entropy": 1.7017327845096588, "epoch": 0.2790942601369142, "grad_norm": 0.391290545463562, "learning_rate": 0.00019995485732162934, "loss": 0.2360502928495407, "mean_token_accuracy": 0.9084432125091553, "num_tokens": 6538080.0, "step": 530 }, { "entropy": 1.6393355131149292, "epoch": 0.2796208530805687, "grad_norm": 0.38507914543151855, "learning_rate": 0.0001999541602069088, "loss": 0.23786881566047668, "mean_token_accuracy": 0.9061485677957535, "num_tokens": 6550416.0, "step": 531 }, { "entropy": 1.6275135576725006, "epoch": 0.28014744602422326, "grad_norm": 0.37895116209983826, "learning_rate": 0.0001999534577521341, "loss": 0.23145025968551636, "mean_token_accuracy": 0.9090943783521652, "num_tokens": 6562752.0, "step": 532 }, { "entropy": 1.598475605249405, "epoch": 0.28067403896787785, "grad_norm": 0.4161452054977417, "learning_rate": 0.00019995274995734686, "loss": 0.2727176547050476, "mean_token_accuracy": 0.8956159949302673, "num_tokens": 6575088.0, "step": 533 }, { "entropy": 1.5213307440280914, "epoch": 0.2812006319115324, "grad_norm": 0.43801331520080566, "learning_rate": 0.00019995203682258915, "loss": 0.22940769791603088, "mean_token_accuracy": 0.9128211736679077, "num_tokens": 6587424.0, "step": 534 }, { "entropy": 1.634105533361435, "epoch": 0.2817272248551869, "grad_norm": 0.4054886996746063, "learning_rate": 0.0001999513183479033, "loss": 0.23942533135414124, "mean_token_accuracy": 0.9082587212324142, "num_tokens": 6599760.0, "step": 535 }, { "entropy": 1.4907733798027039, "epoch": 0.2822538177988415, "grad_norm": 0.40736711025238037, "learning_rate": 0.00019995059453333194, "loss": 0.22832639515399933, "mean_token_accuracy": 0.9135842621326447, "num_tokens": 6612096.0, "step": 536 }, { "entropy": 1.5832161009311676, "epoch": 0.28278041074249605, "grad_norm": 0.3980075418949127, "learning_rate": 0.0001999498653789181, "loss": 0.24887777864933014, "mean_token_accuracy": 0.9017034024000168, "num_tokens": 6624432.0, "step": 537 }, { "entropy": 1.4983101785182953, "epoch": 0.2833070036861506, "grad_norm": 0.3781083822250366, "learning_rate": 0.00019994913088470498, "loss": 0.23180519044399261, "mean_token_accuracy": 0.9052098244428635, "num_tokens": 6636768.0, "step": 538 }, { "entropy": 1.5062950551509857, "epoch": 0.2838335966298052, "grad_norm": 0.4003005623817444, "learning_rate": 0.00019994839105073623, "loss": 0.22549505531787872, "mean_token_accuracy": 0.9140617251396179, "num_tokens": 6649104.0, "step": 539 }, { "entropy": 1.5416783392429352, "epoch": 0.2843601895734597, "grad_norm": 0.39962485432624817, "learning_rate": 0.00019994764587705574, "loss": 0.2179470807313919, "mean_token_accuracy": 0.9161404520273209, "num_tokens": 6661440.0, "step": 540 }, { "entropy": 1.660192757844925, "epoch": 0.28488678251711425, "grad_norm": 0.42626917362213135, "learning_rate": 0.0001999468953637078, "loss": 0.26295173168182373, "mean_token_accuracy": 0.8983173221349716, "num_tokens": 6673776.0, "step": 541 }, { "entropy": 1.5149348974227905, "epoch": 0.28541337546076884, "grad_norm": 0.36926260590553284, "learning_rate": 0.00019994613951073692, "loss": 0.2277842015028, "mean_token_accuracy": 0.9144963473081589, "num_tokens": 6686112.0, "step": 542 }, { "entropy": 1.5601712763309479, "epoch": 0.2859399684044234, "grad_norm": 0.35751771926879883, "learning_rate": 0.00019994537831818799, "loss": 0.2134617567062378, "mean_token_accuracy": 0.9172465950250626, "num_tokens": 6698448.0, "step": 543 }, { "entropy": 1.629770964384079, "epoch": 0.2864665613480779, "grad_norm": 0.3708803951740265, "learning_rate": 0.00019994461178610617, "loss": 0.22911599278450012, "mean_token_accuracy": 0.9093553721904755, "num_tokens": 6710784.0, "step": 544 }, { "entropy": 1.5735207796096802, "epoch": 0.2869931542917325, "grad_norm": 0.3979873061180115, "learning_rate": 0.00019994383991453702, "loss": 0.2454529106616974, "mean_token_accuracy": 0.9057244658470154, "num_tokens": 6723120.0, "step": 545 }, { "entropy": 1.556952327489853, "epoch": 0.28751974723538704, "grad_norm": 0.36042284965515137, "learning_rate": 0.0001999430627035263, "loss": 0.22943763434886932, "mean_token_accuracy": 0.9095467925071716, "num_tokens": 6735456.0, "step": 546 }, { "entropy": 1.5784813165664673, "epoch": 0.2880463401790416, "grad_norm": 0.4354793131351471, "learning_rate": 0.0001999422801531202, "loss": 0.23101268708705902, "mean_token_accuracy": 0.9098020642995834, "num_tokens": 6747792.0, "step": 547 }, { "entropy": 1.6356432437896729, "epoch": 0.28857293312269616, "grad_norm": 0.38589903712272644, "learning_rate": 0.00019994149226336514, "loss": 0.2551157772541046, "mean_token_accuracy": 0.9008017480373383, "num_tokens": 6760128.0, "step": 548 }, { "entropy": 1.484334021806717, "epoch": 0.2890995260663507, "grad_norm": 0.3685605823993683, "learning_rate": 0.0001999406990343079, "loss": 0.21177145838737488, "mean_token_accuracy": 0.9134591519832611, "num_tokens": 6772464.0, "step": 549 }, { "entropy": 1.5352662205696106, "epoch": 0.2896261190100053, "grad_norm": 0.43439221382141113, "learning_rate": 0.00019993990046599555, "loss": 0.21738113462924957, "mean_token_accuracy": 0.9168129861354828, "num_tokens": 6784800.0, "step": 550 }, { "entropy": 1.4901257157325745, "epoch": 0.2901527119536598, "grad_norm": 0.40765848755836487, "learning_rate": 0.00019993909655847554, "loss": 0.2299802005290985, "mean_token_accuracy": 0.9086113125085831, "num_tokens": 6797136.0, "step": 551 }, { "entropy": 1.5647250413894653, "epoch": 0.29067930489731436, "grad_norm": 0.3714927136898041, "learning_rate": 0.0001999382873117956, "loss": 0.23209913074970245, "mean_token_accuracy": 0.912913978099823, "num_tokens": 6809472.0, "step": 552 }, { "entropy": 1.5570427775382996, "epoch": 0.29120589784096895, "grad_norm": 0.3235602080821991, "learning_rate": 0.0001999374727260037, "loss": 0.20470383763313293, "mean_token_accuracy": 0.9178998619318008, "num_tokens": 6821808.0, "step": 553 }, { "entropy": 1.6096443831920624, "epoch": 0.2917324907846235, "grad_norm": 0.3791026473045349, "learning_rate": 0.00019993665280114824, "loss": 0.23357072472572327, "mean_token_accuracy": 0.9100991189479828, "num_tokens": 6834144.0, "step": 554 }, { "entropy": 1.7047458291053772, "epoch": 0.292259083728278, "grad_norm": 0.4588649272918701, "learning_rate": 0.00019993582753727792, "loss": 0.23484769463539124, "mean_token_accuracy": 0.9089436531066895, "num_tokens": 6846480.0, "step": 555 }, { "entropy": 1.6045478284358978, "epoch": 0.2927856766719326, "grad_norm": 0.38022348284721375, "learning_rate": 0.00019993499693444168, "loss": 0.24132560193538666, "mean_token_accuracy": 0.9133987128734589, "num_tokens": 6858816.0, "step": 556 }, { "entropy": 1.5578656792640686, "epoch": 0.29331226961558715, "grad_norm": 0.3959854543209076, "learning_rate": 0.00019993416099268888, "loss": 0.2288515269756317, "mean_token_accuracy": 0.9094084948301315, "num_tokens": 6871152.0, "step": 557 }, { "entropy": 1.5771779716014862, "epoch": 0.2938388625592417, "grad_norm": 0.41283491253852844, "learning_rate": 0.00019993331971206911, "loss": 0.25233519077301025, "mean_token_accuracy": 0.8999712020158768, "num_tokens": 6883488.0, "step": 558 }, { "entropy": 1.5294803977012634, "epoch": 0.2943654555028963, "grad_norm": 0.41696879267692566, "learning_rate": 0.0001999324730926323, "loss": 0.2409447431564331, "mean_token_accuracy": 0.9075838178396225, "num_tokens": 6895824.0, "step": 559 }, { "entropy": 1.557918757200241, "epoch": 0.2948920484465508, "grad_norm": 0.8365952372550964, "learning_rate": 0.00019993162113442873, "loss": 0.26256802678108215, "mean_token_accuracy": 0.8970607817173004, "num_tokens": 6908160.0, "step": 560 }, { "entropy": 1.5486240088939667, "epoch": 0.29541864139020535, "grad_norm": 0.36394545435905457, "learning_rate": 0.000199930763837509, "loss": 0.23241116106510162, "mean_token_accuracy": 0.9164627194404602, "num_tokens": 6920496.0, "step": 561 }, { "entropy": 1.5366742312908173, "epoch": 0.29594523433385994, "grad_norm": 0.3717273771762848, "learning_rate": 0.00019992990120192393, "loss": 0.2316376268863678, "mean_token_accuracy": 0.9116377085447311, "num_tokens": 6932832.0, "step": 562 }, { "entropy": 1.6174998581409454, "epoch": 0.2964718272775145, "grad_norm": 0.3976577818393707, "learning_rate": 0.00019992903322772483, "loss": 0.2560444474220276, "mean_token_accuracy": 0.8992763608694077, "num_tokens": 6945168.0, "step": 563 }, { "entropy": 1.5432467758655548, "epoch": 0.296998420221169, "grad_norm": 0.32837730646133423, "learning_rate": 0.00019992815991496318, "loss": 0.2185848504304886, "mean_token_accuracy": 0.9149428755044937, "num_tokens": 6957504.0, "step": 564 }, { "entropy": 1.5321990847587585, "epoch": 0.2975250131648236, "grad_norm": 0.36741021275520325, "learning_rate": 0.00019992728126369078, "loss": 0.24631758034229279, "mean_token_accuracy": 0.9008835554122925, "num_tokens": 6969840.0, "step": 565 }, { "entropy": 1.6573955416679382, "epoch": 0.29805160610847814, "grad_norm": 0.40060925483703613, "learning_rate": 0.00019992639727395983, "loss": 0.24705615639686584, "mean_token_accuracy": 0.9055600762367249, "num_tokens": 6982176.0, "step": 566 }, { "entropy": 1.6146283447742462, "epoch": 0.2985781990521327, "grad_norm": 0.36694321036338806, "learning_rate": 0.00019992550794582282, "loss": 0.2382228970527649, "mean_token_accuracy": 0.9077549129724503, "num_tokens": 6994512.0, "step": 567 }, { "entropy": 1.608702838420868, "epoch": 0.29910479199578727, "grad_norm": 0.36138370633125305, "learning_rate": 0.00019992461327933252, "loss": 0.2497398406267166, "mean_token_accuracy": 0.9065199494361877, "num_tokens": 7006848.0, "step": 568 }, { "entropy": 1.5681868195533752, "epoch": 0.2996313849394418, "grad_norm": 0.3718649744987488, "learning_rate": 0.00019992371327454204, "loss": 0.22592690587043762, "mean_token_accuracy": 0.9139988124370575, "num_tokens": 7019184.0, "step": 569 }, { "entropy": 1.5541615784168243, "epoch": 0.3001579778830964, "grad_norm": 0.3475581407546997, "learning_rate": 0.00019992280793150485, "loss": 0.218974769115448, "mean_token_accuracy": 0.9153032898902893, "num_tokens": 7031520.0, "step": 570 }, { "entropy": 1.5086607038974762, "epoch": 0.30068457082675093, "grad_norm": 0.336376428604126, "learning_rate": 0.00019992189725027466, "loss": 0.2033504694700241, "mean_token_accuracy": 0.9149883091449738, "num_tokens": 7043856.0, "step": 571 }, { "entropy": 1.5713791847229004, "epoch": 0.30121116377040547, "grad_norm": 0.4335557520389557, "learning_rate": 0.0001999209812309055, "loss": 0.2449672371149063, "mean_token_accuracy": 0.9020196795463562, "num_tokens": 7056192.0, "step": 572 }, { "entropy": 1.5503774285316467, "epoch": 0.30173775671406006, "grad_norm": 0.3847261071205139, "learning_rate": 0.0001999200598734518, "loss": 0.23619771003723145, "mean_token_accuracy": 0.9090457707643509, "num_tokens": 7068528.0, "step": 573 }, { "entropy": 1.5812987089157104, "epoch": 0.3022643496577146, "grad_norm": 0.4005545675754547, "learning_rate": 0.00019991913317796825, "loss": 0.22766467928886414, "mean_token_accuracy": 0.9142022579908371, "num_tokens": 7080864.0, "step": 574 }, { "entropy": 1.5593630969524384, "epoch": 0.30279094260136913, "grad_norm": 0.3692858815193176, "learning_rate": 0.00019991820114450984, "loss": 0.24361425638198853, "mean_token_accuracy": 0.909025177359581, "num_tokens": 7093200.0, "step": 575 }, { "entropy": 1.639871895313263, "epoch": 0.3033175355450237, "grad_norm": 0.3423769176006317, "learning_rate": 0.0001999172637731319, "loss": 0.1989578753709793, "mean_token_accuracy": 0.9223005324602127, "num_tokens": 7105536.0, "step": 576 }, { "entropy": 1.5683670938014984, "epoch": 0.30384412848867826, "grad_norm": 0.3434232771396637, "learning_rate": 0.0001999163210638901, "loss": 0.23291000723838806, "mean_token_accuracy": 0.9105765074491501, "num_tokens": 7117872.0, "step": 577 }, { "entropy": 1.6403064131736755, "epoch": 0.3043707214323328, "grad_norm": 0.3877623975276947, "learning_rate": 0.00019991537301684037, "loss": 0.2589385509490967, "mean_token_accuracy": 0.9013812988996506, "num_tokens": 7130208.0, "step": 578 }, { "entropy": 1.577894926071167, "epoch": 0.3048973143759874, "grad_norm": 0.3848702013492584, "learning_rate": 0.00019991441963203906, "loss": 0.2235189825296402, "mean_token_accuracy": 0.9132665693759918, "num_tokens": 7142544.0, "step": 579 }, { "entropy": 1.594813734292984, "epoch": 0.3054239073196419, "grad_norm": 0.37452247738838196, "learning_rate": 0.00019991346090954268, "loss": 0.2309045046567917, "mean_token_accuracy": 0.9061081409454346, "num_tokens": 7154880.0, "step": 580 }, { "entropy": 1.6004383862018585, "epoch": 0.30595050026329645, "grad_norm": 0.36386990547180176, "learning_rate": 0.0001999124968494082, "loss": 0.22697995603084564, "mean_token_accuracy": 0.9153416603803635, "num_tokens": 7167216.0, "step": 581 }, { "entropy": 1.5263923108577728, "epoch": 0.30647709320695105, "grad_norm": 0.3861697316169739, "learning_rate": 0.00019991152745169283, "loss": 0.23612037301063538, "mean_token_accuracy": 0.9100482612848282, "num_tokens": 7179552.0, "step": 582 }, { "entropy": 1.4913224875926971, "epoch": 0.3070036861506056, "grad_norm": 0.37040355801582336, "learning_rate": 0.00019991055271645412, "loss": 0.2453731894493103, "mean_token_accuracy": 0.9096489399671555, "num_tokens": 7191888.0, "step": 583 }, { "entropy": 1.5870050489902496, "epoch": 0.3075302790942601, "grad_norm": 0.3563641309738159, "learning_rate": 0.00019990957264374992, "loss": 0.2088014781475067, "mean_token_accuracy": 0.9178295880556107, "num_tokens": 7204224.0, "step": 584 }, { "entropy": 1.5673131942749023, "epoch": 0.3080568720379147, "grad_norm": 0.42992061376571655, "learning_rate": 0.00019990858723363842, "loss": 0.22837956249713898, "mean_token_accuracy": 0.9150240123271942, "num_tokens": 7216560.0, "step": 585 }, { "entropy": 1.5697237253189087, "epoch": 0.30858346498156924, "grad_norm": 0.34907442331314087, "learning_rate": 0.00019990759648617814, "loss": 0.2061898112297058, "mean_token_accuracy": 0.9186743050813675, "num_tokens": 7228896.0, "step": 586 }, { "entropy": 1.5203896760940552, "epoch": 0.3091100579252238, "grad_norm": 0.3814384639263153, "learning_rate": 0.00019990660040142787, "loss": 0.23518475890159607, "mean_token_accuracy": 0.9073454886674881, "num_tokens": 7241232.0, "step": 587 }, { "entropy": 1.5959535539150238, "epoch": 0.30963665086887837, "grad_norm": 0.410187304019928, "learning_rate": 0.00019990559897944675, "loss": 0.2526550590991974, "mean_token_accuracy": 0.9053095877170563, "num_tokens": 7253568.0, "step": 588 }, { "entropy": 1.4929281175136566, "epoch": 0.3101632438125329, "grad_norm": 0.3563387989997864, "learning_rate": 0.00019990459222029422, "loss": 0.2284306138753891, "mean_token_accuracy": 0.9153739362955093, "num_tokens": 7265904.0, "step": 589 }, { "entropy": 1.5385482907295227, "epoch": 0.31068983675618744, "grad_norm": 0.3958924412727356, "learning_rate": 0.00019990358012403009, "loss": 0.25064951181411743, "mean_token_accuracy": 0.9019092172384262, "num_tokens": 7278240.0, "step": 590 }, { "entropy": 1.5795462429523468, "epoch": 0.31121642969984203, "grad_norm": 0.4616306722164154, "learning_rate": 0.00019990256269071435, "loss": 0.25259649753570557, "mean_token_accuracy": 0.9031090140342712, "num_tokens": 7290576.0, "step": 591 }, { "entropy": 1.5900325179100037, "epoch": 0.31174302264349657, "grad_norm": 0.36789095401763916, "learning_rate": 0.0001999015399204075, "loss": 0.239149808883667, "mean_token_accuracy": 0.9080104380846024, "num_tokens": 7302912.0, "step": 592 }, { "entropy": 1.595876008272171, "epoch": 0.3122696155871511, "grad_norm": 0.3929153084754944, "learning_rate": 0.0001999005118131702, "loss": 0.2852938175201416, "mean_token_accuracy": 0.8941920101642609, "num_tokens": 7315248.0, "step": 593 }, { "entropy": 1.616676688194275, "epoch": 0.3127962085308057, "grad_norm": 0.3501856327056885, "learning_rate": 0.00019989947836906346, "loss": 0.24000589549541473, "mean_token_accuracy": 0.9087683409452438, "num_tokens": 7327584.0, "step": 594 }, { "entropy": 1.6581095457077026, "epoch": 0.31332280147446023, "grad_norm": 0.42188331484794617, "learning_rate": 0.0001998984395881487, "loss": 0.24285097420215607, "mean_token_accuracy": 0.9076326787471771, "num_tokens": 7339920.0, "step": 595 }, { "entropy": 1.6323899328708649, "epoch": 0.3138493944181148, "grad_norm": 0.38462045788764954, "learning_rate": 0.00019989739547048753, "loss": 0.25823602080345154, "mean_token_accuracy": 0.9016465842723846, "num_tokens": 7352256.0, "step": 596 }, { "entropy": 1.648387372493744, "epoch": 0.31437598736176936, "grad_norm": 0.3550112545490265, "learning_rate": 0.00019989634601614198, "loss": 0.23165376484394073, "mean_token_accuracy": 0.9123150110244751, "num_tokens": 7364592.0, "step": 597 }, { "entropy": 1.541102021932602, "epoch": 0.3149025803054239, "grad_norm": 0.32691195607185364, "learning_rate": 0.0001998952912251743, "loss": 0.2173168659210205, "mean_token_accuracy": 0.9170237630605698, "num_tokens": 7376928.0, "step": 598 }, { "entropy": 1.5581879019737244, "epoch": 0.3154291732490785, "grad_norm": 0.37725362181663513, "learning_rate": 0.00019989423109764714, "loss": 0.22197510302066803, "mean_token_accuracy": 0.9138648211956024, "num_tokens": 7389264.0, "step": 599 }, { "entropy": 1.5590221285820007, "epoch": 0.315955766192733, "grad_norm": 0.36627396941185, "learning_rate": 0.0001998931656336234, "loss": 0.23069526255130768, "mean_token_accuracy": 0.9046057909727097, "num_tokens": 7401600.0, "step": 600 }, { "entropy": 1.617866188287735, "epoch": 0.31648235913638756, "grad_norm": 0.40031948685646057, "learning_rate": 0.00019989209483316637, "loss": 0.2336081862449646, "mean_token_accuracy": 0.9123480021953583, "num_tokens": 7413936.0, "step": 601 }, { "entropy": 1.53180992603302, "epoch": 0.31700895208004215, "grad_norm": 0.49535101652145386, "learning_rate": 0.00019989101869633962, "loss": 0.22568359971046448, "mean_token_accuracy": 0.9089675545692444, "num_tokens": 7426272.0, "step": 602 }, { "entropy": 1.5532157719135284, "epoch": 0.3175355450236967, "grad_norm": 0.4378284811973572, "learning_rate": 0.00019988993722320703, "loss": 0.2375514954328537, "mean_token_accuracy": 0.9061621576547623, "num_tokens": 7438608.0, "step": 603 }, { "entropy": 1.5265016555786133, "epoch": 0.3180621379673512, "grad_norm": 0.3522114157676697, "learning_rate": 0.0001998888504138327, "loss": 0.23949339985847473, "mean_token_accuracy": 0.9073717594146729, "num_tokens": 7450944.0, "step": 604 }, { "entropy": 1.61136794090271, "epoch": 0.3185887309110058, "grad_norm": 0.37977924942970276, "learning_rate": 0.00019988775826828133, "loss": 0.2230483740568161, "mean_token_accuracy": 0.9096570760011673, "num_tokens": 7463280.0, "step": 605 }, { "entropy": 1.593753159046173, "epoch": 0.31911532385466035, "grad_norm": 0.6494004130363464, "learning_rate": 0.0001998866607866176, "loss": 0.22851543128490448, "mean_token_accuracy": 0.9144780784845352, "num_tokens": 7475616.0, "step": 606 }, { "entropy": 1.5087667405605316, "epoch": 0.3196419167983149, "grad_norm": 0.3527071177959442, "learning_rate": 0.00019988555796890674, "loss": 0.20573341846466064, "mean_token_accuracy": 0.9186414480209351, "num_tokens": 7487952.0, "step": 607 }, { "entropy": 1.5721814334392548, "epoch": 0.3201685097419695, "grad_norm": 0.3536371886730194, "learning_rate": 0.00019988444981521418, "loss": 0.20877021551132202, "mean_token_accuracy": 0.9166864901781082, "num_tokens": 7500288.0, "step": 608 }, { "entropy": 1.5660102665424347, "epoch": 0.320695102685624, "grad_norm": 0.4063898026943207, "learning_rate": 0.00019988333632560572, "loss": 0.25388604402542114, "mean_token_accuracy": 0.9036387950181961, "num_tokens": 7512624.0, "step": 609 }, { "entropy": 1.5472122132778168, "epoch": 0.32122169562927855, "grad_norm": 0.3346962630748749, "learning_rate": 0.00019988221750014747, "loss": 0.2217264026403427, "mean_token_accuracy": 0.9168782234191895, "num_tokens": 7524960.0, "step": 610 }, { "entropy": 1.557081937789917, "epoch": 0.32174828857293314, "grad_norm": 0.37367674708366394, "learning_rate": 0.00019988109333890584, "loss": 0.21202939748764038, "mean_token_accuracy": 0.9218468219041824, "num_tokens": 7537296.0, "step": 611 }, { "entropy": 1.4869562089443207, "epoch": 0.3222748815165877, "grad_norm": 0.4604549705982208, "learning_rate": 0.00019987996384194755, "loss": 0.2245841920375824, "mean_token_accuracy": 0.9145530760288239, "num_tokens": 7549632.0, "step": 612 }, { "entropy": 1.515323966741562, "epoch": 0.3228014744602422, "grad_norm": 0.39376160502433777, "learning_rate": 0.0001998788290093397, "loss": 0.26140767335891724, "mean_token_accuracy": 0.8977334201335907, "num_tokens": 7561968.0, "step": 613 }, { "entropy": 1.487097293138504, "epoch": 0.3233280674038968, "grad_norm": 0.40344923734664917, "learning_rate": 0.00019987768884114962, "loss": 0.21170933544635773, "mean_token_accuracy": 0.9142201244831085, "num_tokens": 7574304.0, "step": 614 }, { "entropy": 1.4696341156959534, "epoch": 0.32385466034755134, "grad_norm": 0.3404286801815033, "learning_rate": 0.00019987654333744498, "loss": 0.2107430100440979, "mean_token_accuracy": 0.9169973582029343, "num_tokens": 7586640.0, "step": 615 }, { "entropy": 1.4763599038124084, "epoch": 0.3243812532912059, "grad_norm": 0.4449232518672943, "learning_rate": 0.00019987539249829381, "loss": 0.22219976782798767, "mean_token_accuracy": 0.9147885292768478, "num_tokens": 7598976.0, "step": 616 }, { "entropy": 1.4189346730709076, "epoch": 0.32490784623486046, "grad_norm": 0.33330264687538147, "learning_rate": 0.00019987423632376444, "loss": 0.20641736686229706, "mean_token_accuracy": 0.9154144078493118, "num_tokens": 7611312.0, "step": 617 }, { "entropy": 1.5400767922401428, "epoch": 0.325434439178515, "grad_norm": 0.3576372563838959, "learning_rate": 0.00019987307481392544, "loss": 0.21838723123073578, "mean_token_accuracy": 0.9165307581424713, "num_tokens": 7623648.0, "step": 618 }, { "entropy": 1.4934936463832855, "epoch": 0.32596103212216954, "grad_norm": 0.3858436942100525, "learning_rate": 0.00019987190796884582, "loss": 0.2230948656797409, "mean_token_accuracy": 0.9111486077308655, "num_tokens": 7635984.0, "step": 619 }, { "entropy": 1.5231453776359558, "epoch": 0.3264876250658241, "grad_norm": 0.3916998505592346, "learning_rate": 0.0001998707357885949, "loss": 0.2513001561164856, "mean_token_accuracy": 0.9021778851747513, "num_tokens": 7648320.0, "step": 620 }, { "entropy": 1.529598742723465, "epoch": 0.32701421800947866, "grad_norm": 0.768818736076355, "learning_rate": 0.00019986955827324215, "loss": 0.23995141685009003, "mean_token_accuracy": 0.9082267880439758, "num_tokens": 7660656.0, "step": 621 }, { "entropy": 1.56441992521286, "epoch": 0.32754081095313325, "grad_norm": 0.3836771249771118, "learning_rate": 0.0001998683754228575, "loss": 0.2571730613708496, "mean_token_accuracy": 0.905523344874382, "num_tokens": 7672992.0, "step": 622 }, { "entropy": 1.5032837986946106, "epoch": 0.3280674038967878, "grad_norm": 0.3536396920681, "learning_rate": 0.00019986718723751122, "loss": 0.2316400706768036, "mean_token_accuracy": 0.9121131896972656, "num_tokens": 7685328.0, "step": 623 }, { "entropy": 1.5374043881893158, "epoch": 0.3285939968404423, "grad_norm": 0.43927958607673645, "learning_rate": 0.00019986599371727383, "loss": 0.2222973108291626, "mean_token_accuracy": 0.9122229516506195, "num_tokens": 7697664.0, "step": 624 }, { "entropy": 1.5948379039764404, "epoch": 0.3291205897840969, "grad_norm": 0.3739503026008606, "learning_rate": 0.00019986479486221618, "loss": 0.23531857132911682, "mean_token_accuracy": 0.9108096957206726, "num_tokens": 7710000.0, "step": 625 }, { "entropy": 1.5133698880672455, "epoch": 0.32964718272775145, "grad_norm": 0.37042292952537537, "learning_rate": 0.00019986359067240942, "loss": 0.2119014859199524, "mean_token_accuracy": 0.9210023730993271, "num_tokens": 7722336.0, "step": 626 }, { "entropy": 1.565012902021408, "epoch": 0.330173775671406, "grad_norm": 0.36645272374153137, "learning_rate": 0.00019986238114792505, "loss": 0.22745972871780396, "mean_token_accuracy": 0.9089792966842651, "num_tokens": 7734672.0, "step": 627 }, { "entropy": 1.5374813377857208, "epoch": 0.3307003686150606, "grad_norm": 0.3918452858924866, "learning_rate": 0.00019986116628883485, "loss": 0.22233808040618896, "mean_token_accuracy": 0.91575026512146, "num_tokens": 7747008.0, "step": 628 }, { "entropy": 1.5814277529716492, "epoch": 0.3312269615587151, "grad_norm": 0.3956620395183563, "learning_rate": 0.00019985994609521098, "loss": 0.23237353563308716, "mean_token_accuracy": 0.9120265543460846, "num_tokens": 7759344.0, "step": 629 }, { "entropy": 1.607151210308075, "epoch": 0.33175355450236965, "grad_norm": 0.4154573380947113, "learning_rate": 0.00019985872056712585, "loss": 0.23763325810432434, "mean_token_accuracy": 0.9039438813924789, "num_tokens": 7771680.0, "step": 630 }, { "entropy": 1.5939337015151978, "epoch": 0.33228014744602424, "grad_norm": 0.5367919206619263, "learning_rate": 0.0001998574897046522, "loss": 0.22427549958229065, "mean_token_accuracy": 0.9124085754156113, "num_tokens": 7784016.0, "step": 631 }, { "entropy": 1.6544562876224518, "epoch": 0.3328067403896788, "grad_norm": 0.49991947412490845, "learning_rate": 0.00019985625350786313, "loss": 0.26143935322761536, "mean_token_accuracy": 0.8970800191164017, "num_tokens": 7796352.0, "step": 632 }, { "entropy": 1.567628562450409, "epoch": 0.3333333333333333, "grad_norm": 0.43659552931785583, "learning_rate": 0.00019985501197683202, "loss": 0.22153861820697784, "mean_token_accuracy": 0.9091014564037323, "num_tokens": 7808688.0, "step": 633 }, { "entropy": 1.6360341310501099, "epoch": 0.3338599262769879, "grad_norm": 0.406440794467926, "learning_rate": 0.00019985376511163255, "loss": 0.23250769078731537, "mean_token_accuracy": 0.9082053154706955, "num_tokens": 7821024.0, "step": 634 }, { "entropy": 1.617436408996582, "epoch": 0.33438651922064244, "grad_norm": 0.4746139347553253, "learning_rate": 0.00019985251291233872, "loss": 0.2448023557662964, "mean_token_accuracy": 0.9019272774457932, "num_tokens": 7833360.0, "step": 635 }, { "entropy": 1.5576602518558502, "epoch": 0.334913112164297, "grad_norm": 0.37426477670669556, "learning_rate": 0.00019985125537902497, "loss": 0.24818755686283112, "mean_token_accuracy": 0.9056387394666672, "num_tokens": 7845696.0, "step": 636 }, { "entropy": 1.5108153223991394, "epoch": 0.33543970510795157, "grad_norm": 0.36447635293006897, "learning_rate": 0.00019984999251176582, "loss": 0.23007383942604065, "mean_token_accuracy": 0.9102648496627808, "num_tokens": 7858032.0, "step": 637 }, { "entropy": 1.6435940563678741, "epoch": 0.3359662980516061, "grad_norm": 0.4201553165912628, "learning_rate": 0.00019984872431063632, "loss": 0.2524194121360779, "mean_token_accuracy": 0.9026057571172714, "num_tokens": 7870368.0, "step": 638 }, { "entropy": 1.5785358846187592, "epoch": 0.33649289099526064, "grad_norm": 0.34197092056274414, "learning_rate": 0.00019984745077571175, "loss": 0.22064879536628723, "mean_token_accuracy": 0.9168655872344971, "num_tokens": 7882704.0, "step": 639 }, { "entropy": 1.5749069154262543, "epoch": 0.33701948393891523, "grad_norm": 0.35670214891433716, "learning_rate": 0.00019984617190706768, "loss": 0.210345059633255, "mean_token_accuracy": 0.9159483909606934, "num_tokens": 7895040.0, "step": 640 }, { "entropy": 1.648300975561142, "epoch": 0.33754607688256977, "grad_norm": 0.5585328936576843, "learning_rate": 0.00019984488770478004, "loss": 0.26494815945625305, "mean_token_accuracy": 0.9005215167999268, "num_tokens": 7907376.0, "step": 641 }, { "entropy": 1.5516612827777863, "epoch": 0.3380726698262243, "grad_norm": 0.3812706172466278, "learning_rate": 0.0001998435981689251, "loss": 0.23725152015686035, "mean_token_accuracy": 0.9066549986600876, "num_tokens": 7919712.0, "step": 642 }, { "entropy": 1.538433849811554, "epoch": 0.3385992627698789, "grad_norm": 0.345907598733902, "learning_rate": 0.00019984230329957937, "loss": 0.21600767970085144, "mean_token_accuracy": 0.913017600774765, "num_tokens": 7932048.0, "step": 643 }, { "entropy": 1.5793551802635193, "epoch": 0.33912585571353343, "grad_norm": 0.375407874584198, "learning_rate": 0.00019984100309681973, "loss": 0.2297327220439911, "mean_token_accuracy": 0.9100670218467712, "num_tokens": 7944384.0, "step": 644 }, { "entropy": 1.6768275797367096, "epoch": 0.33965244865718797, "grad_norm": 0.3743014931678772, "learning_rate": 0.00019983969756072337, "loss": 0.23133614659309387, "mean_token_accuracy": 0.9111513495445251, "num_tokens": 7956720.0, "step": 645 }, { "entropy": 1.5642622113227844, "epoch": 0.34017904160084256, "grad_norm": 0.3964219093322754, "learning_rate": 0.00019983838669136782, "loss": 0.25138217210769653, "mean_token_accuracy": 0.9010957926511765, "num_tokens": 7969056.0, "step": 646 }, { "entropy": 1.562336266040802, "epoch": 0.3407056345444971, "grad_norm": 0.33525609970092773, "learning_rate": 0.00019983707048883083, "loss": 0.21662499010562897, "mean_token_accuracy": 0.9179873615503311, "num_tokens": 7981392.0, "step": 647 }, { "entropy": 1.5184325873851776, "epoch": 0.3412322274881517, "grad_norm": 0.36040404438972473, "learning_rate": 0.0001998357489531906, "loss": 0.21142053604125977, "mean_token_accuracy": 0.9129342883825302, "num_tokens": 7993728.0, "step": 648 }, { "entropy": 1.525155395269394, "epoch": 0.3417588204318062, "grad_norm": 0.37644830346107483, "learning_rate": 0.00019983442208452553, "loss": 0.24553003907203674, "mean_token_accuracy": 0.9037658125162125, "num_tokens": 8006064.0, "step": 649 }, { "entropy": 1.5811420381069183, "epoch": 0.34228541337546076, "grad_norm": 0.4055664837360382, "learning_rate": 0.00019983308988291446, "loss": 0.24890564382076263, "mean_token_accuracy": 0.9027184396982193, "num_tokens": 8018400.0, "step": 650 }, { "entropy": 1.5781408250331879, "epoch": 0.34281200631911535, "grad_norm": 0.37236547470092773, "learning_rate": 0.0001998317523484364, "loss": 0.2316565066576004, "mean_token_accuracy": 0.9119908362627029, "num_tokens": 8030736.0, "step": 651 }, { "entropy": 1.470947027206421, "epoch": 0.3433385992627699, "grad_norm": 0.3868812918663025, "learning_rate": 0.00019983040948117078, "loss": 0.2534410059452057, "mean_token_accuracy": 0.9021570980548859, "num_tokens": 8043072.0, "step": 652 }, { "entropy": 1.5348678827285767, "epoch": 0.3438651922064244, "grad_norm": 0.4387357234954834, "learning_rate": 0.00019982906128119732, "loss": 0.22310803830623627, "mean_token_accuracy": 0.9145376235246658, "num_tokens": 8055408.0, "step": 653 }, { "entropy": 1.6187977194786072, "epoch": 0.344391785150079, "grad_norm": 0.3973976671695709, "learning_rate": 0.00019982770774859608, "loss": 0.24628473818302155, "mean_token_accuracy": 0.9026829153299332, "num_tokens": 8067744.0, "step": 654 }, { "entropy": 1.552239865064621, "epoch": 0.34491837809373355, "grad_norm": 0.35203489661216736, "learning_rate": 0.00019982634888344737, "loss": 0.2246260643005371, "mean_token_accuracy": 0.9107431769371033, "num_tokens": 8080080.0, "step": 655 }, { "entropy": 1.5582615733146667, "epoch": 0.3454449710373881, "grad_norm": 0.35882458090782166, "learning_rate": 0.00019982498468583187, "loss": 0.24929207563400269, "mean_token_accuracy": 0.9079926460981369, "num_tokens": 8092416.0, "step": 656 }, { "entropy": 1.5417989492416382, "epoch": 0.3459715639810427, "grad_norm": 0.3812078833580017, "learning_rate": 0.00019982361515583056, "loss": 0.23627105355262756, "mean_token_accuracy": 0.9105822741985321, "num_tokens": 8104752.0, "step": 657 }, { "entropy": 1.5216515362262726, "epoch": 0.3464981569246972, "grad_norm": 0.425227552652359, "learning_rate": 0.00019982224029352477, "loss": 0.24528373777866364, "mean_token_accuracy": 0.9078731536865234, "num_tokens": 8117088.0, "step": 658 }, { "entropy": 1.5206952691078186, "epoch": 0.34702474986835175, "grad_norm": 0.33637750148773193, "learning_rate": 0.0001998208600989961, "loss": 0.2107471525669098, "mean_token_accuracy": 0.9135650843381882, "num_tokens": 8129424.0, "step": 659 }, { "entropy": 1.4702115952968597, "epoch": 0.34755134281200634, "grad_norm": 0.39711427688598633, "learning_rate": 0.00019981947457232646, "loss": 0.2600536048412323, "mean_token_accuracy": 0.900258481502533, "num_tokens": 8141760.0, "step": 660 }, { "entropy": 1.4251591563224792, "epoch": 0.34807793575566087, "grad_norm": 0.3307092487812042, "learning_rate": 0.00019981808371359816, "loss": 0.20669502019882202, "mean_token_accuracy": 0.9150898307561874, "num_tokens": 8154096.0, "step": 661 }, { "entropy": 1.4800917506217957, "epoch": 0.3486045286993154, "grad_norm": 0.3357905447483063, "learning_rate": 0.00019981668752289372, "loss": 0.21784240007400513, "mean_token_accuracy": 0.9145694226026535, "num_tokens": 8166432.0, "step": 662 }, { "entropy": 1.4939378798007965, "epoch": 0.34913112164297, "grad_norm": 0.3817315101623535, "learning_rate": 0.00019981528600029598, "loss": 0.23391678929328918, "mean_token_accuracy": 0.9120414704084396, "num_tokens": 8178768.0, "step": 663 }, { "entropy": 1.46476212143898, "epoch": 0.34965771458662454, "grad_norm": 0.38629287481307983, "learning_rate": 0.00019981387914588822, "loss": 0.2348746955394745, "mean_token_accuracy": 0.9141973257064819, "num_tokens": 8191104.0, "step": 664 }, { "entropy": 1.488828182220459, "epoch": 0.35018430753027907, "grad_norm": 0.43263551592826843, "learning_rate": 0.00019981246695975396, "loss": 0.24639199674129486, "mean_token_accuracy": 0.9060526490211487, "num_tokens": 8203440.0, "step": 665 }, { "entropy": 1.4127525091171265, "epoch": 0.35071090047393366, "grad_norm": 0.3648802936077118, "learning_rate": 0.00019981104944197698, "loss": 0.21946357190608978, "mean_token_accuracy": 0.9159405082464218, "num_tokens": 8215776.0, "step": 666 }, { "entropy": 1.4903503954410553, "epoch": 0.3512374934175882, "grad_norm": 0.34730279445648193, "learning_rate": 0.00019980962659264144, "loss": 0.2281692773103714, "mean_token_accuracy": 0.9098831713199615, "num_tokens": 8228112.0, "step": 667 }, { "entropy": 1.5247552990913391, "epoch": 0.35176408636124273, "grad_norm": 0.6796702742576599, "learning_rate": 0.00019980819841183185, "loss": 0.2541208267211914, "mean_token_accuracy": 0.899626687169075, "num_tokens": 8240448.0, "step": 668 }, { "entropy": 1.489711880683899, "epoch": 0.3522906793048973, "grad_norm": 0.33805036544799805, "learning_rate": 0.00019980676489963294, "loss": 0.2260848581790924, "mean_token_accuracy": 0.9087798148393631, "num_tokens": 8252784.0, "step": 669 }, { "entropy": 1.5027905106544495, "epoch": 0.35281727224855186, "grad_norm": 0.350353479385376, "learning_rate": 0.00019980532605612985, "loss": 0.21086406707763672, "mean_token_accuracy": 0.9210447818040848, "num_tokens": 8265120.0, "step": 670 }, { "entropy": 1.5674294233322144, "epoch": 0.35334386519220645, "grad_norm": 0.3340439200401306, "learning_rate": 0.00019980388188140798, "loss": 0.20525240898132324, "mean_token_accuracy": 0.922586515545845, "num_tokens": 8277456.0, "step": 671 }, { "entropy": 1.5054379403591156, "epoch": 0.353870458135861, "grad_norm": 0.3567858934402466, "learning_rate": 0.00019980243237555304, "loss": 0.2413492202758789, "mean_token_accuracy": 0.9065290242433548, "num_tokens": 8289792.0, "step": 672 }, { "entropy": 1.458409994840622, "epoch": 0.3543970510795155, "grad_norm": 0.3392413854598999, "learning_rate": 0.00019980097753865108, "loss": 0.21458403766155243, "mean_token_accuracy": 0.915942057967186, "num_tokens": 8302128.0, "step": 673 }, { "entropy": 1.5474618673324585, "epoch": 0.3549236440231701, "grad_norm": 0.3782627582550049, "learning_rate": 0.00019979951737078853, "loss": 0.24051563441753387, "mean_token_accuracy": 0.905216172337532, "num_tokens": 8314464.0, "step": 674 }, { "entropy": 1.453640639781952, "epoch": 0.35545023696682465, "grad_norm": 0.3473234474658966, "learning_rate": 0.000199798051872052, "loss": 0.22346456348896027, "mean_token_accuracy": 0.9117260426282883, "num_tokens": 8326800.0, "step": 675 }, { "entropy": 1.4625252783298492, "epoch": 0.3559768299104792, "grad_norm": 0.3387875258922577, "learning_rate": 0.0001997965810425285, "loss": 0.23459070920944214, "mean_token_accuracy": 0.9097730964422226, "num_tokens": 8339136.0, "step": 676 }, { "entropy": 1.4122467339038849, "epoch": 0.3565034228541338, "grad_norm": 0.3719231188297272, "learning_rate": 0.0001997951048823054, "loss": 0.21170935034751892, "mean_token_accuracy": 0.9177156686782837, "num_tokens": 8351472.0, "step": 677 }, { "entropy": 1.3950088024139404, "epoch": 0.3570300157977883, "grad_norm": 0.346206933259964, "learning_rate": 0.00019979362339147026, "loss": 0.24381937086582184, "mean_token_accuracy": 0.9096541851758957, "num_tokens": 8363808.0, "step": 678 }, { "entropy": 1.392151266336441, "epoch": 0.35755660874144285, "grad_norm": 0.4163087010383606, "learning_rate": 0.00019979213657011106, "loss": 0.23680301010608673, "mean_token_accuracy": 0.9078295677900314, "num_tokens": 8376144.0, "step": 679 }, { "entropy": 1.272907316684723, "epoch": 0.35808320168509744, "grad_norm": 0.4227026104927063, "learning_rate": 0.00019979064441831606, "loss": 0.2319648414850235, "mean_token_accuracy": 0.9085201323032379, "num_tokens": 8388480.0, "step": 680 }, { "entropy": 1.3540238738059998, "epoch": 0.358609794628752, "grad_norm": 0.41346514225006104, "learning_rate": 0.00019978914693617383, "loss": 0.228549063205719, "mean_token_accuracy": 0.9105959385633469, "num_tokens": 8400816.0, "step": 681 }, { "entropy": 1.360448271036148, "epoch": 0.3591363875724065, "grad_norm": 0.3442930281162262, "learning_rate": 0.0001997876441237733, "loss": 0.23922371864318848, "mean_token_accuracy": 0.9045034646987915, "num_tokens": 8413152.0, "step": 682 }, { "entropy": 1.2645371556282043, "epoch": 0.3596629805160611, "grad_norm": 0.3163891136646271, "learning_rate": 0.00019978613598120362, "loss": 0.23533323407173157, "mean_token_accuracy": 0.9094915986061096, "num_tokens": 8425488.0, "step": 683 }, { "entropy": 1.23646479845047, "epoch": 0.36018957345971564, "grad_norm": 0.3051406741142273, "learning_rate": 0.00019978462250855439, "loss": 0.23106315732002258, "mean_token_accuracy": 0.908999964594841, "num_tokens": 8437824.0, "step": 684 }, { "entropy": 1.2108670771121979, "epoch": 0.3607161664033702, "grad_norm": 0.3296745717525482, "learning_rate": 0.00019978310370591545, "loss": 0.21918885409832, "mean_token_accuracy": 0.9144444465637207, "num_tokens": 8450160.0, "step": 685 }, { "entropy": 1.2031162977218628, "epoch": 0.36124275934702477, "grad_norm": 0.34492868185043335, "learning_rate": 0.0001997815795733769, "loss": 0.23954619467258453, "mean_token_accuracy": 0.9077229052782059, "num_tokens": 8462496.0, "step": 686 }, { "entropy": 1.186975747346878, "epoch": 0.3617693522906793, "grad_norm": 0.3709777593612671, "learning_rate": 0.00019978005011102925, "loss": 0.2437351793050766, "mean_token_accuracy": 0.908468559384346, "num_tokens": 8474832.0, "step": 687 }, { "entropy": 1.2189928591251373, "epoch": 0.36229594523433384, "grad_norm": 0.39078283309936523, "learning_rate": 0.00019977851531896335, "loss": 0.23512142896652222, "mean_token_accuracy": 0.9079535007476807, "num_tokens": 8487168.0, "step": 688 }, { "entropy": 1.1402603685855865, "epoch": 0.36282253817798843, "grad_norm": 0.44031041860580444, "learning_rate": 0.00019977697519727025, "loss": 0.22278329730033875, "mean_token_accuracy": 0.9095389991998672, "num_tokens": 8499504.0, "step": 689 }, { "entropy": 1.2126906514167786, "epoch": 0.36334913112164297, "grad_norm": 0.4217199385166168, "learning_rate": 0.00019977542974604137, "loss": 0.2309587299823761, "mean_token_accuracy": 0.9086143374443054, "num_tokens": 8511840.0, "step": 690 }, { "entropy": 1.2279771864414215, "epoch": 0.3638757240652975, "grad_norm": 0.38159534335136414, "learning_rate": 0.00019977387896536847, "loss": 0.22851325571537018, "mean_token_accuracy": 0.9110317975282669, "num_tokens": 8524176.0, "step": 691 }, { "entropy": 1.1451427340507507, "epoch": 0.3644023170089521, "grad_norm": 0.38951390981674194, "learning_rate": 0.00019977232285534364, "loss": 0.22088123857975006, "mean_token_accuracy": 0.9204992055892944, "num_tokens": 8536512.0, "step": 692 }, { "entropy": 1.2615329325199127, "epoch": 0.36492890995260663, "grad_norm": 0.4139882028102875, "learning_rate": 0.0001997707614160592, "loss": 0.24705028533935547, "mean_token_accuracy": 0.9034076929092407, "num_tokens": 8548848.0, "step": 693 }, { "entropy": 1.283850759267807, "epoch": 0.36545550289626116, "grad_norm": 0.369973361492157, "learning_rate": 0.00019976919464760793, "loss": 0.22415512800216675, "mean_token_accuracy": 0.9107316434383392, "num_tokens": 8561184.0, "step": 694 }, { "entropy": 1.2292048037052155, "epoch": 0.36598209583991576, "grad_norm": 0.38250577449798584, "learning_rate": 0.00019976762255008277, "loss": 0.23568174242973328, "mean_token_accuracy": 0.9063956588506699, "num_tokens": 8573520.0, "step": 695 }, { "entropy": 1.2365350425243378, "epoch": 0.3665086887835703, "grad_norm": 0.3148071765899658, "learning_rate": 0.00019976604512357706, "loss": 0.1988360434770584, "mean_token_accuracy": 0.9224959909915924, "num_tokens": 8585856.0, "step": 696 }, { "entropy": 1.3029758036136627, "epoch": 0.3670352817272249, "grad_norm": 0.3744061589241028, "learning_rate": 0.00019976446236818444, "loss": 0.20495107769966125, "mean_token_accuracy": 0.9228791147470474, "num_tokens": 8598192.0, "step": 697 }, { "entropy": 1.2882287502288818, "epoch": 0.3675618746708794, "grad_norm": 0.36938560009002686, "learning_rate": 0.00019976287428399888, "loss": 0.21769095957279205, "mean_token_accuracy": 0.9142359048128128, "num_tokens": 8610528.0, "step": 698 }, { "entropy": 1.3306386470794678, "epoch": 0.36808846761453395, "grad_norm": 0.34892189502716064, "learning_rate": 0.00019976128087111468, "loss": 0.22379228472709656, "mean_token_accuracy": 0.910999983549118, "num_tokens": 8622864.0, "step": 699 }, { "entropy": 1.422240823507309, "epoch": 0.36861506055818855, "grad_norm": 0.4013206660747528, "learning_rate": 0.00019975968212962637, "loss": 0.24196377396583557, "mean_token_accuracy": 0.9052925109863281, "num_tokens": 8635200.0, "step": 700 }, { "entropy": 1.4155401587486267, "epoch": 0.3691416535018431, "grad_norm": 0.353211373090744, "learning_rate": 0.0001997580780596289, "loss": 0.23057395219802856, "mean_token_accuracy": 0.9112053066492081, "num_tokens": 8647536.0, "step": 701 }, { "entropy": 1.3654289841651917, "epoch": 0.3696682464454976, "grad_norm": 0.3298124372959137, "learning_rate": 0.0001997564686612175, "loss": 0.23379994928836823, "mean_token_accuracy": 0.9082982391119003, "num_tokens": 8659872.0, "step": 702 }, { "entropy": 1.4584643244743347, "epoch": 0.3701948393891522, "grad_norm": 0.3759617805480957, "learning_rate": 0.00019975485393448764, "loss": 0.23104792833328247, "mean_token_accuracy": 0.9065845310688019, "num_tokens": 8672208.0, "step": 703 }, { "entropy": 1.444229632616043, "epoch": 0.37072143233280674, "grad_norm": 0.3501303791999817, "learning_rate": 0.00019975323387953528, "loss": 0.2252783626317978, "mean_token_accuracy": 0.9078841656446457, "num_tokens": 8684544.0, "step": 704 }, { "entropy": 1.4961676001548767, "epoch": 0.3712480252764613, "grad_norm": 0.37864333391189575, "learning_rate": 0.00019975160849645656, "loss": 0.248760387301445, "mean_token_accuracy": 0.9001511335372925, "num_tokens": 8696880.0, "step": 705 }, { "entropy": 1.42547208070755, "epoch": 0.37177461822011587, "grad_norm": 0.34873253107070923, "learning_rate": 0.00019974997778534793, "loss": 0.21211083233356476, "mean_token_accuracy": 0.9166723936796188, "num_tokens": 8709216.0, "step": 706 }, { "entropy": 1.5042538046836853, "epoch": 0.3723012111637704, "grad_norm": 0.3550424873828888, "learning_rate": 0.00019974834174630622, "loss": 0.23886847496032715, "mean_token_accuracy": 0.907848909497261, "num_tokens": 8721552.0, "step": 707 }, { "entropy": 1.5081537961959839, "epoch": 0.37282780410742494, "grad_norm": 0.41367873549461365, "learning_rate": 0.00019974670037942855, "loss": 0.22889745235443115, "mean_token_accuracy": 0.9153233766555786, "num_tokens": 8733888.0, "step": 708 }, { "entropy": 1.3966407477855682, "epoch": 0.37335439705107953, "grad_norm": 0.3816620707511902, "learning_rate": 0.00019974505368481238, "loss": 0.22411897778511047, "mean_token_accuracy": 0.9170472025871277, "num_tokens": 8746224.0, "step": 709 }, { "entropy": 1.3528437912464142, "epoch": 0.37388098999473407, "grad_norm": 0.3909305930137634, "learning_rate": 0.00019974340166255543, "loss": 0.24883610010147095, "mean_token_accuracy": 0.9069965332746506, "num_tokens": 8758560.0, "step": 710 }, { "entropy": 1.3574591279029846, "epoch": 0.3744075829383886, "grad_norm": 0.3753831088542938, "learning_rate": 0.00019974174431275582, "loss": 0.21758557856082916, "mean_token_accuracy": 0.9138903617858887, "num_tokens": 8770896.0, "step": 711 }, { "entropy": 1.3783180713653564, "epoch": 0.3749341758820432, "grad_norm": 0.3737315833568573, "learning_rate": 0.0001997400816355119, "loss": 0.21359983086585999, "mean_token_accuracy": 0.9189057648181915, "num_tokens": 8783232.0, "step": 712 }, { "entropy": 1.3974202573299408, "epoch": 0.37546076882569773, "grad_norm": 0.349575012922287, "learning_rate": 0.00019973841363092232, "loss": 0.2197628617286682, "mean_token_accuracy": 0.910584107041359, "num_tokens": 8795568.0, "step": 713 }, { "entropy": 1.4738838374614716, "epoch": 0.37598736176935227, "grad_norm": 0.39151832461357117, "learning_rate": 0.0001997367402990862, "loss": 0.22688592970371246, "mean_token_accuracy": 0.9129604697227478, "num_tokens": 8807904.0, "step": 714 }, { "entropy": 1.4208093285560608, "epoch": 0.37651395471300686, "grad_norm": 0.41211023926734924, "learning_rate": 0.00019973506164010284, "loss": 0.20385678112506866, "mean_token_accuracy": 0.9227319210767746, "num_tokens": 8820240.0, "step": 715 }, { "entropy": 1.4047819375991821, "epoch": 0.3770405476566614, "grad_norm": 0.4299006164073944, "learning_rate": 0.00019973337765407187, "loss": 0.23750200867652893, "mean_token_accuracy": 0.9077501893043518, "num_tokens": 8832576.0, "step": 716 }, { "entropy": 1.374906837940216, "epoch": 0.37756714060031593, "grad_norm": 0.36846232414245605, "learning_rate": 0.00019973168834109327, "loss": 0.23285596072673798, "mean_token_accuracy": 0.9094402939081192, "num_tokens": 8844912.0, "step": 717 }, { "entropy": 1.4372902512550354, "epoch": 0.3780937335439705, "grad_norm": 0.3780461549758911, "learning_rate": 0.00019972999370126737, "loss": 0.23158109188079834, "mean_token_accuracy": 0.9099433869123459, "num_tokens": 8857248.0, "step": 718 }, { "entropy": 1.3874932825565338, "epoch": 0.37862032648762506, "grad_norm": 0.34537607431411743, "learning_rate": 0.00019972829373469467, "loss": 0.21864044666290283, "mean_token_accuracy": 0.9146191030740738, "num_tokens": 8869584.0, "step": 719 }, { "entropy": 1.374584138393402, "epoch": 0.3791469194312796, "grad_norm": 0.33857598900794983, "learning_rate": 0.00019972658844147621, "loss": 0.20933406054973602, "mean_token_accuracy": 0.917707160115242, "num_tokens": 8881920.0, "step": 720 }, { "entropy": 1.3695291578769684, "epoch": 0.3796735123749342, "grad_norm": 0.5717244148254395, "learning_rate": 0.0001997248778217131, "loss": 0.22078999876976013, "mean_token_accuracy": 0.9167369604110718, "num_tokens": 8894256.0, "step": 721 }, { "entropy": 1.26867213845253, "epoch": 0.3802001053185887, "grad_norm": 0.36367470026016235, "learning_rate": 0.000199723161875507, "loss": 0.23508650064468384, "mean_token_accuracy": 0.90509033203125, "num_tokens": 8906592.0, "step": 722 }, { "entropy": 1.3050034940242767, "epoch": 0.3807266982622433, "grad_norm": 0.3631988763809204, "learning_rate": 0.0001997214406029597, "loss": 0.22164851427078247, "mean_token_accuracy": 0.9132580459117889, "num_tokens": 8918928.0, "step": 723 }, { "entropy": 1.3181822001934052, "epoch": 0.38125329120589785, "grad_norm": 0.4014921486377716, "learning_rate": 0.00019971971400417342, "loss": 0.220194011926651, "mean_token_accuracy": 0.9143774807453156, "num_tokens": 8931264.0, "step": 724 }, { "entropy": 1.2655711770057678, "epoch": 0.3817798841495524, "grad_norm": 0.34297892451286316, "learning_rate": 0.00019971798207925063, "loss": 0.21592603623867035, "mean_token_accuracy": 0.9114037603139877, "num_tokens": 8943600.0, "step": 725 }, { "entropy": 1.3559162318706512, "epoch": 0.382306477093207, "grad_norm": 0.39595136046409607, "learning_rate": 0.00019971624482829415, "loss": 0.2135222852230072, "mean_token_accuracy": 0.9156046807765961, "num_tokens": 8955936.0, "step": 726 }, { "entropy": 1.4213075637817383, "epoch": 0.3828330700368615, "grad_norm": 0.35875996947288513, "learning_rate": 0.00019971450225140716, "loss": 0.22025166451931, "mean_token_accuracy": 0.9119539260864258, "num_tokens": 8968272.0, "step": 727 }, { "entropy": 1.2975660860538483, "epoch": 0.38335966298051605, "grad_norm": 0.33709245920181274, "learning_rate": 0.00019971275434869302, "loss": 0.2429068237543106, "mean_token_accuracy": 0.9056646823883057, "num_tokens": 8980608.0, "step": 728 }, { "entropy": 1.3944336771965027, "epoch": 0.38388625592417064, "grad_norm": 0.3580012321472168, "learning_rate": 0.0001997110011202556, "loss": 0.228425070643425, "mean_token_accuracy": 0.9088682681322098, "num_tokens": 8992944.0, "step": 729 }, { "entropy": 1.386294186115265, "epoch": 0.3844128488678252, "grad_norm": 0.5559288859367371, "learning_rate": 0.00019970924256619888, "loss": 0.22206491231918335, "mean_token_accuracy": 0.9095857888460159, "num_tokens": 9005280.0, "step": 730 }, { "entropy": 1.3968450129032135, "epoch": 0.3849394418114797, "grad_norm": 0.38346561789512634, "learning_rate": 0.0001997074786866273, "loss": 0.2516261637210846, "mean_token_accuracy": 0.9072631448507309, "num_tokens": 9017616.0, "step": 731 }, { "entropy": 1.3758391439914703, "epoch": 0.3854660347551343, "grad_norm": 0.4184466302394867, "learning_rate": 0.00019970570948164555, "loss": 0.2083946019411087, "mean_token_accuracy": 0.915515810251236, "num_tokens": 9029952.0, "step": 732 }, { "entropy": 1.3424640595912933, "epoch": 0.38599262769878884, "grad_norm": 0.3482263684272766, "learning_rate": 0.00019970393495135868, "loss": 0.23488564789295197, "mean_token_accuracy": 0.9109048992395401, "num_tokens": 9042288.0, "step": 733 }, { "entropy": 1.3400058150291443, "epoch": 0.3865192206424434, "grad_norm": 0.4521651268005371, "learning_rate": 0.00019970215509587205, "loss": 0.24672454595565796, "mean_token_accuracy": 0.9039757996797562, "num_tokens": 9054624.0, "step": 734 }, { "entropy": 1.3971166908740997, "epoch": 0.38704581358609796, "grad_norm": 0.3671362102031708, "learning_rate": 0.0001997003699152913, "loss": 0.22332459688186646, "mean_token_accuracy": 0.9150716066360474, "num_tokens": 9066960.0, "step": 735 }, { "entropy": 1.3570407629013062, "epoch": 0.3875724065297525, "grad_norm": 0.4007357358932495, "learning_rate": 0.00019969857940972235, "loss": 0.22975003719329834, "mean_token_accuracy": 0.9176786690950394, "num_tokens": 9079296.0, "step": 736 }, { "entropy": 1.3730257153511047, "epoch": 0.38809899947340704, "grad_norm": 0.3905254602432251, "learning_rate": 0.00019969678357927158, "loss": 0.22929853200912476, "mean_token_accuracy": 0.909871906042099, "num_tokens": 9091632.0, "step": 737 }, { "entropy": 1.3547758758068085, "epoch": 0.3886255924170616, "grad_norm": 0.36366337537765503, "learning_rate": 0.00019969498242404556, "loss": 0.22672298550605774, "mean_token_accuracy": 0.9105400443077087, "num_tokens": 9103968.0, "step": 738 }, { "entropy": 1.322388231754303, "epoch": 0.38915218536071616, "grad_norm": 0.3948267698287964, "learning_rate": 0.0001996931759441512, "loss": 0.21981076896190643, "mean_token_accuracy": 0.9127620607614517, "num_tokens": 9116304.0, "step": 739 }, { "entropy": 1.3535179495811462, "epoch": 0.3896787783043707, "grad_norm": 0.39007002115249634, "learning_rate": 0.00019969136413969577, "loss": 0.23180383443832397, "mean_token_accuracy": 0.9031165540218353, "num_tokens": 9128640.0, "step": 740 }, { "entropy": 1.395143300294876, "epoch": 0.3902053712480253, "grad_norm": 0.39624056220054626, "learning_rate": 0.00019968954701078678, "loss": 0.21380290389060974, "mean_token_accuracy": 0.9165746420621872, "num_tokens": 9140976.0, "step": 741 }, { "entropy": 1.3894523680210114, "epoch": 0.3907319641916798, "grad_norm": 0.37505805492401123, "learning_rate": 0.00019968772455753218, "loss": 0.21238526701927185, "mean_token_accuracy": 0.9176094681024551, "num_tokens": 9153312.0, "step": 742 }, { "entropy": 1.3369868099689484, "epoch": 0.39125855713533436, "grad_norm": 0.364109605550766, "learning_rate": 0.00019968589678004008, "loss": 0.2217993289232254, "mean_token_accuracy": 0.9145223498344421, "num_tokens": 9165648.0, "step": 743 }, { "entropy": 1.4128968715667725, "epoch": 0.39178515007898895, "grad_norm": 0.37613528966903687, "learning_rate": 0.00019968406367841903, "loss": 0.2087160050868988, "mean_token_accuracy": 0.9174602627754211, "num_tokens": 9177984.0, "step": 744 }, { "entropy": 1.3632179498672485, "epoch": 0.3923117430226435, "grad_norm": 0.3908347189426422, "learning_rate": 0.00019968222525277785, "loss": 0.24387134611606598, "mean_token_accuracy": 0.9096127450466156, "num_tokens": 9190320.0, "step": 745 }, { "entropy": 1.3598384857177734, "epoch": 0.392838335966298, "grad_norm": 0.4070599377155304, "learning_rate": 0.00019968038150322564, "loss": 0.22589103877544403, "mean_token_accuracy": 0.9176203459501266, "num_tokens": 9202656.0, "step": 746 }, { "entropy": 1.2700338661670685, "epoch": 0.3933649289099526, "grad_norm": 0.3903157711029053, "learning_rate": 0.0001996785324298719, "loss": 0.27620363235473633, "mean_token_accuracy": 0.89641934633255, "num_tokens": 9214992.0, "step": 747 }, { "entropy": 1.3561755120754242, "epoch": 0.39389152185360715, "grad_norm": 0.3912152647972107, "learning_rate": 0.00019967667803282637, "loss": 0.20860803127288818, "mean_token_accuracy": 0.918526291847229, "num_tokens": 9227328.0, "step": 748 }, { "entropy": 1.2694224119186401, "epoch": 0.39441811479726174, "grad_norm": 0.36671656370162964, "learning_rate": 0.00019967481831219917, "loss": 0.23243974149227142, "mean_token_accuracy": 0.9083072245121002, "num_tokens": 9239664.0, "step": 749 }, { "entropy": 1.2892687618732452, "epoch": 0.3949447077409163, "grad_norm": 0.33213678002357483, "learning_rate": 0.0001996729532681006, "loss": 0.22482578456401825, "mean_token_accuracy": 0.9108980298042297, "num_tokens": 9252000.0, "step": 750 }, { "entropy": 1.2784943878650665, "epoch": 0.3954713006845708, "grad_norm": 0.311139851808548, "learning_rate": 0.0001996710829006415, "loss": 0.22491638362407684, "mean_token_accuracy": 0.9146853238344193, "num_tokens": 9264336.0, "step": 751 }, { "entropy": 1.3392630815505981, "epoch": 0.3959978936282254, "grad_norm": 0.31522372364997864, "learning_rate": 0.00019966920720993286, "loss": 0.19653388857841492, "mean_token_accuracy": 0.9204227477312088, "num_tokens": 9276672.0, "step": 752 }, { "entropy": 1.3383756875991821, "epoch": 0.39652448657187994, "grad_norm": 0.353919118642807, "learning_rate": 0.00019966732619608598, "loss": 0.23490512371063232, "mean_token_accuracy": 0.9106432646512985, "num_tokens": 9289008.0, "step": 753 }, { "entropy": 1.3619754612445831, "epoch": 0.3970510795155345, "grad_norm": 0.40393969416618347, "learning_rate": 0.00019966543985921258, "loss": 0.25288036465644836, "mean_token_accuracy": 0.8984902203083038, "num_tokens": 9301344.0, "step": 754 }, { "entropy": 1.2913717925548553, "epoch": 0.39757767245918907, "grad_norm": 0.3196253478527069, "learning_rate": 0.00019966354819942462, "loss": 0.20618736743927002, "mean_token_accuracy": 0.9167482256889343, "num_tokens": 9313680.0, "step": 755 }, { "entropy": 1.3224665522575378, "epoch": 0.3981042654028436, "grad_norm": 0.32193470001220703, "learning_rate": 0.0001996616512168344, "loss": 0.21416081488132477, "mean_token_accuracy": 0.9158345758914948, "num_tokens": 9326016.0, "step": 756 }, { "entropy": 1.3358683288097382, "epoch": 0.39863085834649814, "grad_norm": 0.3324636220932007, "learning_rate": 0.00019965974891155458, "loss": 0.23043948411941528, "mean_token_accuracy": 0.9085040837526321, "num_tokens": 9338352.0, "step": 757 }, { "entropy": 1.3305124342441559, "epoch": 0.39915745129015273, "grad_norm": 0.34178489446640015, "learning_rate": 0.00019965784128369798, "loss": 0.22156858444213867, "mean_token_accuracy": 0.9111177027225494, "num_tokens": 9350688.0, "step": 758 }, { "entropy": 1.3993423879146576, "epoch": 0.39968404423380727, "grad_norm": 0.35117653012275696, "learning_rate": 0.00019965592833337797, "loss": 0.24540282785892487, "mean_token_accuracy": 0.9031884074211121, "num_tokens": 9363024.0, "step": 759 }, { "entropy": 1.363684356212616, "epoch": 0.4002106371774618, "grad_norm": 0.3588322699069977, "learning_rate": 0.000199654010060708, "loss": 0.23427176475524902, "mean_token_accuracy": 0.9089349061250687, "num_tokens": 9375360.0, "step": 760 }, { "entropy": 1.3599910140037537, "epoch": 0.4007372301211164, "grad_norm": 0.3444473147392273, "learning_rate": 0.000199652086465802, "loss": 0.2288491129875183, "mean_token_accuracy": 0.909742534160614, "num_tokens": 9387696.0, "step": 761 }, { "entropy": 1.3465708196163177, "epoch": 0.40126382306477093, "grad_norm": 0.3881551921367645, "learning_rate": 0.00019965015754877419, "loss": 0.21851959824562073, "mean_token_accuracy": 0.911541685461998, "num_tokens": 9400032.0, "step": 762 }, { "entropy": 1.3606258928775787, "epoch": 0.40179041600842547, "grad_norm": 0.3825187683105469, "learning_rate": 0.00019964822330973902, "loss": 0.24844150245189667, "mean_token_accuracy": 0.905233234167099, "num_tokens": 9412368.0, "step": 763 }, { "entropy": 1.4477742910385132, "epoch": 0.40231700895208006, "grad_norm": 0.4269307553768158, "learning_rate": 0.00019964628374881133, "loss": 0.21143238246440887, "mean_token_accuracy": 0.914307177066803, "num_tokens": 9424704.0, "step": 764 }, { "entropy": 1.4273262321949005, "epoch": 0.4028436018957346, "grad_norm": 0.477578341960907, "learning_rate": 0.0001996443388661063, "loss": 0.21041172742843628, "mean_token_accuracy": 0.9194318652153015, "num_tokens": 9437040.0, "step": 765 }, { "entropy": 1.42348974943161, "epoch": 0.40337019483938913, "grad_norm": 0.42482423782348633, "learning_rate": 0.00019964238866173933, "loss": 0.22475981712341309, "mean_token_accuracy": 0.9095583707094193, "num_tokens": 9449376.0, "step": 766 }, { "entropy": 1.3782070577144623, "epoch": 0.4038967877830437, "grad_norm": 0.3717379570007324, "learning_rate": 0.00019964043313582626, "loss": 0.2339317947626114, "mean_token_accuracy": 0.9064943641424179, "num_tokens": 9461712.0, "step": 767 }, { "entropy": 1.3753153681755066, "epoch": 0.40442338072669826, "grad_norm": 0.32700079679489136, "learning_rate": 0.00019963847228848312, "loss": 0.2289605587720871, "mean_token_accuracy": 0.9136441200971603, "num_tokens": 9474048.0, "step": 768 }, { "entropy": 1.3423367142677307, "epoch": 0.4049499736703528, "grad_norm": 0.4840228855609894, "learning_rate": 0.00019963650611982636, "loss": 0.24808013439178467, "mean_token_accuracy": 0.9013350456953049, "num_tokens": 9486384.0, "step": 769 }, { "entropy": 1.388725221157074, "epoch": 0.4054765666140074, "grad_norm": 0.3298131823539734, "learning_rate": 0.0001996345346299726, "loss": 0.21849092841148376, "mean_token_accuracy": 0.9153172671794891, "num_tokens": 9498720.0, "step": 770 }, { "entropy": 1.362036794424057, "epoch": 0.4060031595576619, "grad_norm": 0.423976331949234, "learning_rate": 0.00019963255781903902, "loss": 0.2337607443332672, "mean_token_accuracy": 0.9124665558338165, "num_tokens": 9511056.0, "step": 771 }, { "entropy": 1.321341723203659, "epoch": 0.40652975250131645, "grad_norm": 0.39548537135124207, "learning_rate": 0.00019963057568714288, "loss": 0.2241300493478775, "mean_token_accuracy": 0.9098886847496033, "num_tokens": 9523392.0, "step": 772 }, { "entropy": 1.2956216037273407, "epoch": 0.40705634544497105, "grad_norm": 0.36130490899086, "learning_rate": 0.00019962858823440184, "loss": 0.22631655633449554, "mean_token_accuracy": 0.9111677557229996, "num_tokens": 9535728.0, "step": 773 }, { "entropy": 1.3697873950004578, "epoch": 0.4075829383886256, "grad_norm": 0.3786010444164276, "learning_rate": 0.00019962659546093395, "loss": 0.22168497741222382, "mean_token_accuracy": 0.9110663533210754, "num_tokens": 9548064.0, "step": 774 }, { "entropy": 1.3025212287902832, "epoch": 0.4081095313322802, "grad_norm": 0.3891861140727997, "learning_rate": 0.00019962459736685745, "loss": 0.2645792067050934, "mean_token_accuracy": 0.8977373838424683, "num_tokens": 9560400.0, "step": 775 }, { "entropy": 1.3207987844944, "epoch": 0.4086361242759347, "grad_norm": 0.40660449862480164, "learning_rate": 0.000199622593952291, "loss": 0.23059073090553284, "mean_token_accuracy": 0.9096915870904922, "num_tokens": 9572736.0, "step": 776 }, { "entropy": 1.2878498435020447, "epoch": 0.40916271721958924, "grad_norm": 0.35745811462402344, "learning_rate": 0.00019962058521735346, "loss": 0.21263521909713745, "mean_token_accuracy": 0.9142482280731201, "num_tokens": 9585072.0, "step": 777 }, { "entropy": 1.2785497307777405, "epoch": 0.40968931016324384, "grad_norm": 0.3724184036254883, "learning_rate": 0.00019961857116216415, "loss": 0.2524154484272003, "mean_token_accuracy": 0.8991471230983734, "num_tokens": 9597408.0, "step": 778 }, { "entropy": 1.2408149540424347, "epoch": 0.41021590310689837, "grad_norm": 0.3448520600795746, "learning_rate": 0.00019961655178684263, "loss": 0.20971742272377014, "mean_token_accuracy": 0.9130227416753769, "num_tokens": 9609744.0, "step": 779 }, { "entropy": 1.2202830016613007, "epoch": 0.4107424960505529, "grad_norm": 0.37864333391189575, "learning_rate": 0.0001996145270915087, "loss": 0.23903977870941162, "mean_token_accuracy": 0.9029916822910309, "num_tokens": 9622080.0, "step": 780 }, { "entropy": 1.1748075485229492, "epoch": 0.4112690889942075, "grad_norm": 0.36790093779563904, "learning_rate": 0.0001996124970762827, "loss": 0.24326302111148834, "mean_token_accuracy": 0.9089493155479431, "num_tokens": 9634416.0, "step": 781 }, { "entropy": 1.1609198153018951, "epoch": 0.41179568193786203, "grad_norm": 0.3445703685283661, "learning_rate": 0.00019961046174128496, "loss": 0.22028180956840515, "mean_token_accuracy": 0.9107068032026291, "num_tokens": 9646752.0, "step": 782 }, { "entropy": 1.1026230156421661, "epoch": 0.41232227488151657, "grad_norm": 0.3440577983856201, "learning_rate": 0.00019960842108663644, "loss": 0.19753555953502655, "mean_token_accuracy": 0.9187215715646744, "num_tokens": 9659088.0, "step": 783 }, { "entropy": 1.1320343911647797, "epoch": 0.41284886782517116, "grad_norm": 0.38988834619522095, "learning_rate": 0.00019960637511245823, "loss": 0.24359619617462158, "mean_token_accuracy": 0.9055552929639816, "num_tokens": 9671424.0, "step": 784 }, { "entropy": 1.1358483731746674, "epoch": 0.4133754607688257, "grad_norm": 0.34981632232666016, "learning_rate": 0.0001996043238188718, "loss": 0.24487480521202087, "mean_token_accuracy": 0.9070784449577332, "num_tokens": 9683760.0, "step": 785 }, { "entropy": 1.1212266087532043, "epoch": 0.41390205371248023, "grad_norm": 0.3241615891456604, "learning_rate": 0.0001996022672059989, "loss": 0.2086082100868225, "mean_token_accuracy": 0.9190200418233871, "num_tokens": 9696096.0, "step": 786 }, { "entropy": 1.1631585955619812, "epoch": 0.4144286466561348, "grad_norm": 0.36856940388679504, "learning_rate": 0.00019960020527396165, "loss": 0.20457178354263306, "mean_token_accuracy": 0.9173056781291962, "num_tokens": 9708432.0, "step": 787 }, { "entropy": 1.1695051193237305, "epoch": 0.41495523959978936, "grad_norm": 0.3899996876716614, "learning_rate": 0.00019959813802288245, "loss": 0.24216774106025696, "mean_token_accuracy": 0.9103662818670273, "num_tokens": 9720768.0, "step": 788 }, { "entropy": 1.1804447770118713, "epoch": 0.4154818325434439, "grad_norm": 0.3940189778804779, "learning_rate": 0.000199596065452884, "loss": 0.2604479491710663, "mean_token_accuracy": 0.8987935930490494, "num_tokens": 9733104.0, "step": 789 }, { "entropy": 1.2298611104488373, "epoch": 0.4160084254870985, "grad_norm": 0.3992246687412262, "learning_rate": 0.00019959398756408937, "loss": 0.24308446049690247, "mean_token_accuracy": 0.9046371877193451, "num_tokens": 9745440.0, "step": 790 }, { "entropy": 1.130595326423645, "epoch": 0.416535018430753, "grad_norm": 0.32028424739837646, "learning_rate": 0.00019959190435662186, "loss": 0.21361656486988068, "mean_token_accuracy": 0.9175485223531723, "num_tokens": 9757776.0, "step": 791 }, { "entropy": 1.2031766474246979, "epoch": 0.41706161137440756, "grad_norm": 0.3323441445827484, "learning_rate": 0.00019958981583060518, "loss": 0.22529007494449615, "mean_token_accuracy": 0.9116253554821014, "num_tokens": 9770112.0, "step": 792 }, { "entropy": 1.1709198653697968, "epoch": 0.41758820431806215, "grad_norm": 0.3305797874927521, "learning_rate": 0.0001995877219861633, "loss": 0.21258684992790222, "mean_token_accuracy": 0.9117163866758347, "num_tokens": 9782448.0, "step": 793 }, { "entropy": 1.2462036609649658, "epoch": 0.4181147972617167, "grad_norm": 0.32563477754592896, "learning_rate": 0.00019958562282342056, "loss": 0.22679030895233154, "mean_token_accuracy": 0.9114914387464523, "num_tokens": 9794784.0, "step": 794 }, { "entropy": 1.1364922225475311, "epoch": 0.4186413902053712, "grad_norm": 0.3199447989463806, "learning_rate": 0.0001995835183425015, "loss": 0.22316469252109528, "mean_token_accuracy": 0.9091953933238983, "num_tokens": 9807120.0, "step": 795 }, { "entropy": 1.2300072014331818, "epoch": 0.4191679831490258, "grad_norm": 0.3554495871067047, "learning_rate": 0.0001995814085435311, "loss": 0.2148018628358841, "mean_token_accuracy": 0.9172432273626328, "num_tokens": 9819456.0, "step": 796 }, { "entropy": 1.2751358449459076, "epoch": 0.41969457609268035, "grad_norm": 0.3625534772872925, "learning_rate": 0.00019957929342663457, "loss": 0.217167928814888, "mean_token_accuracy": 0.9148837774991989, "num_tokens": 9831792.0, "step": 797 }, { "entropy": 1.2123389542102814, "epoch": 0.42022116903633494, "grad_norm": 0.3511140048503876, "learning_rate": 0.00019957717299193752, "loss": 0.21881210803985596, "mean_token_accuracy": 0.9147087782621384, "num_tokens": 9844128.0, "step": 798 }, { "entropy": 1.2617943584918976, "epoch": 0.4207477619799895, "grad_norm": 0.3321590721607208, "learning_rate": 0.0001995750472395658, "loss": 0.22508296370506287, "mean_token_accuracy": 0.9119736105203629, "num_tokens": 9856464.0, "step": 799 }, { "entropy": 1.2528738677501678, "epoch": 0.421274354923644, "grad_norm": 0.3493482768535614, "learning_rate": 0.00019957291616964565, "loss": 0.234869584441185, "mean_token_accuracy": 0.9126180708408356, "num_tokens": 9868800.0, "step": 800 }, { "entropy": 1.263050615787506, "epoch": 0.4218009478672986, "grad_norm": 0.33217278122901917, "learning_rate": 0.00019957077978230347, "loss": 0.22601178288459778, "mean_token_accuracy": 0.9101445376873016, "num_tokens": 9881136.0, "step": 801 }, { "entropy": 1.279297262430191, "epoch": 0.42232754081095314, "grad_norm": 0.3346133232116699, "learning_rate": 0.00019956863807766618, "loss": 0.22423239052295685, "mean_token_accuracy": 0.9134156703948975, "num_tokens": 9893472.0, "step": 802 }, { "entropy": 1.342239260673523, "epoch": 0.4228541337546077, "grad_norm": 0.32531458139419556, "learning_rate": 0.00019956649105586088, "loss": 0.23583942651748657, "mean_token_accuracy": 0.9080929756164551, "num_tokens": 9905808.0, "step": 803 }, { "entropy": 1.301451414823532, "epoch": 0.42338072669826227, "grad_norm": 0.3336106240749359, "learning_rate": 0.00019956433871701508, "loss": 0.23021520674228668, "mean_token_accuracy": 0.9132036864757538, "num_tokens": 9918144.0, "step": 804 }, { "entropy": 1.294978141784668, "epoch": 0.4239073196419168, "grad_norm": 0.36648303270339966, "learning_rate": 0.00019956218106125648, "loss": 0.216038778424263, "mean_token_accuracy": 0.9193701446056366, "num_tokens": 9930480.0, "step": 805 }, { "entropy": 1.3323890268802643, "epoch": 0.42443391258557134, "grad_norm": 0.5710987448692322, "learning_rate": 0.00019956001808871322, "loss": 0.21820521354675293, "mean_token_accuracy": 0.9192979484796524, "num_tokens": 9942816.0, "step": 806 }, { "entropy": 1.3704762756824493, "epoch": 0.42496050552922593, "grad_norm": 0.3389364778995514, "learning_rate": 0.00019955784979951366, "loss": 0.20125524699687958, "mean_token_accuracy": 0.9225403815507889, "num_tokens": 9955152.0, "step": 807 }, { "entropy": 1.361533671617508, "epoch": 0.42548709847288047, "grad_norm": 0.36687371134757996, "learning_rate": 0.00019955567619378653, "loss": 0.22097808122634888, "mean_token_accuracy": 0.9130203276872635, "num_tokens": 9967488.0, "step": 808 }, { "entropy": 1.3404709100723267, "epoch": 0.426013691416535, "grad_norm": 0.3457012474536896, "learning_rate": 0.00019955349727166088, "loss": 0.21268591284751892, "mean_token_accuracy": 0.9194072186946869, "num_tokens": 9979824.0, "step": 809 }, { "entropy": 1.3375678360462189, "epoch": 0.4265402843601896, "grad_norm": 0.3357281982898712, "learning_rate": 0.0001995513130332661, "loss": 0.21844780445098877, "mean_token_accuracy": 0.9134986102581024, "num_tokens": 9992160.0, "step": 810 }, { "entropy": 1.373364269733429, "epoch": 0.42706687730384413, "grad_norm": 0.3841971457004547, "learning_rate": 0.00019954912347873175, "loss": 0.2078622281551361, "mean_token_accuracy": 0.9202176630496979, "num_tokens": 10004496.0, "step": 811 }, { "entropy": 1.3305988311767578, "epoch": 0.42759347024749866, "grad_norm": 0.3852640986442566, "learning_rate": 0.0001995469286081879, "loss": 0.2230588048696518, "mean_token_accuracy": 0.9157514870166779, "num_tokens": 10016832.0, "step": 812 }, { "entropy": 1.3437947630882263, "epoch": 0.42812006319115326, "grad_norm": 0.390927791595459, "learning_rate": 0.0001995447284217648, "loss": 0.22504432499408722, "mean_token_accuracy": 0.911404550075531, "num_tokens": 10029168.0, "step": 813 }, { "entropy": 1.4292974174022675, "epoch": 0.4286466561348078, "grad_norm": 0.3649219274520874, "learning_rate": 0.00019954252291959313, "loss": 0.22576412558555603, "mean_token_accuracy": 0.9123170077800751, "num_tokens": 10041504.0, "step": 814 }, { "entropy": 1.3408824503421783, "epoch": 0.4291732490784623, "grad_norm": 0.4012393355369568, "learning_rate": 0.00019954031210180371, "loss": 0.2239188551902771, "mean_token_accuracy": 0.9098076522350311, "num_tokens": 10053840.0, "step": 815 }, { "entropy": 1.3955635130405426, "epoch": 0.4296998420221169, "grad_norm": 0.31125685572624207, "learning_rate": 0.00019953809596852786, "loss": 0.21482022106647491, "mean_token_accuracy": 0.9152773320674896, "num_tokens": 10066176.0, "step": 816 }, { "entropy": 1.372936338186264, "epoch": 0.43022643496577145, "grad_norm": 0.3509393632411957, "learning_rate": 0.00019953587451989712, "loss": 0.2275184839963913, "mean_token_accuracy": 0.9097452610731125, "num_tokens": 10078512.0, "step": 817 }, { "entropy": 1.2875484228134155, "epoch": 0.430753027909426, "grad_norm": 0.32160601019859314, "learning_rate": 0.00019953364775604336, "loss": 0.22542208433151245, "mean_token_accuracy": 0.9094801992177963, "num_tokens": 10090848.0, "step": 818 }, { "entropy": 1.387698233127594, "epoch": 0.4312796208530806, "grad_norm": 0.3713604807853699, "learning_rate": 0.00019953141567709878, "loss": 0.2560008466243744, "mean_token_accuracy": 0.9061192125082016, "num_tokens": 10103184.0, "step": 819 }, { "entropy": 1.3468024134635925, "epoch": 0.4318062137967351, "grad_norm": 0.30053895711898804, "learning_rate": 0.00019952917828319587, "loss": 0.21902483701705933, "mean_token_accuracy": 0.9183452129364014, "num_tokens": 10115520.0, "step": 820 }, { "entropy": 1.2196392714977264, "epoch": 0.43233280674038965, "grad_norm": 0.3135424256324768, "learning_rate": 0.00019952693557446748, "loss": 0.2191144973039627, "mean_token_accuracy": 0.9174018204212189, "num_tokens": 10127856.0, "step": 821 }, { "entropy": 1.341955155134201, "epoch": 0.43285939968404424, "grad_norm": 0.31046387553215027, "learning_rate": 0.00019952468755104672, "loss": 0.19744142889976501, "mean_token_accuracy": 0.9225213825702667, "num_tokens": 10140192.0, "step": 822 }, { "entropy": 1.2434613406658173, "epoch": 0.4333859926276988, "grad_norm": 0.3251499831676483, "learning_rate": 0.00019952243421306708, "loss": 0.22867801785469055, "mean_token_accuracy": 0.9065830409526825, "num_tokens": 10152528.0, "step": 823 }, { "entropy": 1.2479578852653503, "epoch": 0.43391258557135337, "grad_norm": 0.33372238278388977, "learning_rate": 0.0001995201755606622, "loss": 0.24028503894805908, "mean_token_accuracy": 0.9034052640199661, "num_tokens": 10164864.0, "step": 824 }, { "entropy": 1.2929136455059052, "epoch": 0.4344391785150079, "grad_norm": 0.3748015761375427, "learning_rate": 0.00019951791159396635, "loss": 0.22330275177955627, "mean_token_accuracy": 0.9107150882482529, "num_tokens": 10177200.0, "step": 825 }, { "entropy": 1.1717173159122467, "epoch": 0.43496577145866244, "grad_norm": 0.32337212562561035, "learning_rate": 0.00019951564231311382, "loss": 0.20805582404136658, "mean_token_accuracy": 0.9200474917888641, "num_tokens": 10189536.0, "step": 826 }, { "entropy": 1.2089639604091644, "epoch": 0.43549236440231703, "grad_norm": 0.3620331883430481, "learning_rate": 0.00019951336771823936, "loss": 0.24102292954921722, "mean_token_accuracy": 0.9084760844707489, "num_tokens": 10201872.0, "step": 827 }, { "entropy": 1.2690958082675934, "epoch": 0.43601895734597157, "grad_norm": 0.3436319828033447, "learning_rate": 0.00019951108780947793, "loss": 0.2396576702594757, "mean_token_accuracy": 0.9085531234741211, "num_tokens": 10214208.0, "step": 828 }, { "entropy": 1.1895755529403687, "epoch": 0.4365455502896261, "grad_norm": 0.3198072612285614, "learning_rate": 0.00019950880258696495, "loss": 0.21371476352214813, "mean_token_accuracy": 0.9214041531085968, "num_tokens": 10226544.0, "step": 829 }, { "entropy": 1.2306865453720093, "epoch": 0.4370721432332807, "grad_norm": 0.33646130561828613, "learning_rate": 0.00019950651205083607, "loss": 0.22665852308273315, "mean_token_accuracy": 0.9108365774154663, "num_tokens": 10238880.0, "step": 830 }, { "entropy": 1.2199313044548035, "epoch": 0.43759873617693523, "grad_norm": 0.2950493395328522, "learning_rate": 0.00019950421620122726, "loss": 0.19776280224323273, "mean_token_accuracy": 0.922358974814415, "num_tokens": 10251216.0, "step": 831 }, { "entropy": 1.2803155779838562, "epoch": 0.43812532912058977, "grad_norm": 0.3180263638496399, "learning_rate": 0.00019950191503827477, "loss": 0.2287098914384842, "mean_token_accuracy": 0.9091289192438126, "num_tokens": 10263552.0, "step": 832 }, { "entropy": 1.278805285692215, "epoch": 0.43865192206424436, "grad_norm": 0.30920109152793884, "learning_rate": 0.00019949960856211526, "loss": 0.22083017230033875, "mean_token_accuracy": 0.915079653263092, "num_tokens": 10275888.0, "step": 833 }, { "entropy": 1.255694329738617, "epoch": 0.4391785150078989, "grad_norm": 0.3112378716468811, "learning_rate": 0.00019949729677288568, "loss": 0.22883734107017517, "mean_token_accuracy": 0.9063798487186432, "num_tokens": 10288224.0, "step": 834 }, { "entropy": 1.2695356905460358, "epoch": 0.43970510795155343, "grad_norm": 0.36405643820762634, "learning_rate": 0.00019949497967072314, "loss": 0.25639811158180237, "mean_token_accuracy": 0.8983906358480453, "num_tokens": 10300560.0, "step": 835 }, { "entropy": 1.1852473616600037, "epoch": 0.440231700895208, "grad_norm": 0.3179355561733246, "learning_rate": 0.00019949265725576534, "loss": 0.2258102297782898, "mean_token_accuracy": 0.911256417632103, "num_tokens": 10312896.0, "step": 836 }, { "entropy": 1.2247830629348755, "epoch": 0.44075829383886256, "grad_norm": 0.30152472853660583, "learning_rate": 0.00019949032952815002, "loss": 0.22182312607765198, "mean_token_accuracy": 0.9133886694908142, "num_tokens": 10325232.0, "step": 837 }, { "entropy": 1.2358119487762451, "epoch": 0.4412848867825171, "grad_norm": 0.3537450134754181, "learning_rate": 0.00019948799648801546, "loss": 0.23890867829322815, "mean_token_accuracy": 0.9061432033777237, "num_tokens": 10337568.0, "step": 838 }, { "entropy": 1.255542904138565, "epoch": 0.4418114797261717, "grad_norm": 0.3185861110687256, "learning_rate": 0.00019948565813550012, "loss": 0.2323358654975891, "mean_token_accuracy": 0.910455733537674, "num_tokens": 10349904.0, "step": 839 }, { "entropy": 1.2060716450214386, "epoch": 0.4423380726698262, "grad_norm": 0.2943599820137024, "learning_rate": 0.00019948331447074282, "loss": 0.1973709762096405, "mean_token_accuracy": 0.9198663532733917, "num_tokens": 10362240.0, "step": 840 }, { "entropy": 1.23261758685112, "epoch": 0.44286466561348076, "grad_norm": 0.3526243269443512, "learning_rate": 0.00019948096549388269, "loss": 0.2500985562801361, "mean_token_accuracy": 0.9066997915506363, "num_tokens": 10374576.0, "step": 841 }, { "entropy": 1.237447440624237, "epoch": 0.44339125855713535, "grad_norm": 0.3191603422164917, "learning_rate": 0.00019947861120505914, "loss": 0.21682989597320557, "mean_token_accuracy": 0.914885938167572, "num_tokens": 10386912.0, "step": 842 }, { "entropy": 1.2385708093643188, "epoch": 0.4439178515007899, "grad_norm": 0.31065261363983154, "learning_rate": 0.000199476251604412, "loss": 0.22177095711231232, "mean_token_accuracy": 0.9108449369668961, "num_tokens": 10399248.0, "step": 843 }, { "entropy": 1.209405928850174, "epoch": 0.4444444444444444, "grad_norm": 0.3202918767929077, "learning_rate": 0.0001994738866920813, "loss": 0.23262163996696472, "mean_token_accuracy": 0.906676635146141, "num_tokens": 10411584.0, "step": 844 }, { "entropy": 1.2493412792682648, "epoch": 0.444971037388099, "grad_norm": 0.3377321660518646, "learning_rate": 0.00019947151646820745, "loss": 0.25681400299072266, "mean_token_accuracy": 0.9044294059276581, "num_tokens": 10423920.0, "step": 845 }, { "entropy": 1.2441616654396057, "epoch": 0.44549763033175355, "grad_norm": 0.3140577971935272, "learning_rate": 0.00019946914093293115, "loss": 0.23581147193908691, "mean_token_accuracy": 0.9107285887002945, "num_tokens": 10436256.0, "step": 846 }, { "entropy": 1.2595540583133698, "epoch": 0.4460242232754081, "grad_norm": 0.32932135462760925, "learning_rate": 0.00019946676008639343, "loss": 0.2249414175748825, "mean_token_accuracy": 0.9159797579050064, "num_tokens": 10448592.0, "step": 847 }, { "entropy": 1.2226338982582092, "epoch": 0.4465508162190627, "grad_norm": 0.3085028827190399, "learning_rate": 0.00019946437392873555, "loss": 0.22729279100894928, "mean_token_accuracy": 0.914769247174263, "num_tokens": 10460928.0, "step": 848 }, { "entropy": 1.2365905344486237, "epoch": 0.4470774091627172, "grad_norm": 0.33299946784973145, "learning_rate": 0.00019946198246009928, "loss": 0.23490425944328308, "mean_token_accuracy": 0.9082431495189667, "num_tokens": 10473264.0, "step": 849 }, { "entropy": 1.4061111807823181, "epoch": 0.4476040021063718, "grad_norm": 0.3621409833431244, "learning_rate": 0.00019945958568062656, "loss": 0.22818249464035034, "mean_token_accuracy": 0.9102335572242737, "num_tokens": 10485600.0, "step": 850 }, { "entropy": 1.2550583481788635, "epoch": 0.44813059505002634, "grad_norm": 0.33583348989486694, "learning_rate": 0.0001994571835904596, "loss": 0.2311660647392273, "mean_token_accuracy": 0.9055789560079575, "num_tokens": 10497936.0, "step": 851 }, { "entropy": 1.306765854358673, "epoch": 0.4486571879936809, "grad_norm": 0.34734323620796204, "learning_rate": 0.00019945477618974104, "loss": 0.24055415391921997, "mean_token_accuracy": 0.9080438315868378, "num_tokens": 10510272.0, "step": 852 }, { "entropy": 1.3021958768367767, "epoch": 0.44918378093733546, "grad_norm": 0.35933780670166016, "learning_rate": 0.00019945236347861383, "loss": 0.22972102463245392, "mean_token_accuracy": 0.9099899232387543, "num_tokens": 10522608.0, "step": 853 }, { "entropy": 1.2393949925899506, "epoch": 0.44971037388099, "grad_norm": 0.33583781123161316, "learning_rate": 0.00019944994545722115, "loss": 0.19537097215652466, "mean_token_accuracy": 0.9247924536466599, "num_tokens": 10534944.0, "step": 854 }, { "entropy": 1.2775700390338898, "epoch": 0.45023696682464454, "grad_norm": 0.33388838171958923, "learning_rate": 0.00019944752212570658, "loss": 0.20106476545333862, "mean_token_accuracy": 0.9226871877908707, "num_tokens": 10547280.0, "step": 855 }, { "entropy": 1.2714512348175049, "epoch": 0.4507635597682991, "grad_norm": 0.3518841862678528, "learning_rate": 0.00019944509348421394, "loss": 0.24091394245624542, "mean_token_accuracy": 0.9107283055782318, "num_tokens": 10559616.0, "step": 856 }, { "entropy": 1.3004609048366547, "epoch": 0.45129015271195366, "grad_norm": 0.31591442227363586, "learning_rate": 0.00019944265953288746, "loss": 0.22405283153057098, "mean_token_accuracy": 0.9140247255563736, "num_tokens": 10571952.0, "step": 857 }, { "entropy": 1.2649115324020386, "epoch": 0.4518167456556082, "grad_norm": 0.34270599484443665, "learning_rate": 0.00019944022027187157, "loss": 0.2242221236228943, "mean_token_accuracy": 0.9118231236934662, "num_tokens": 10584288.0, "step": 858 }, { "entropy": 1.20332869887352, "epoch": 0.4523433385992628, "grad_norm": 0.33847615122795105, "learning_rate": 0.0001994377757013111, "loss": 0.22582295536994934, "mean_token_accuracy": 0.9115125685930252, "num_tokens": 10596624.0, "step": 859 }, { "entropy": 1.2661672830581665, "epoch": 0.4528699315429173, "grad_norm": 0.34885501861572266, "learning_rate": 0.00019943532582135116, "loss": 0.2379041314125061, "mean_token_accuracy": 0.9074203372001648, "num_tokens": 10608960.0, "step": 860 }, { "entropy": 1.2014594674110413, "epoch": 0.45339652448657186, "grad_norm": 0.29767417907714844, "learning_rate": 0.0001994328706321372, "loss": 0.20825329422950745, "mean_token_accuracy": 0.9220836907625198, "num_tokens": 10621296.0, "step": 861 }, { "entropy": 1.1979358792304993, "epoch": 0.45392311743022645, "grad_norm": 0.33858057856559753, "learning_rate": 0.000199430410133815, "loss": 0.21688413619995117, "mean_token_accuracy": 0.9154618680477142, "num_tokens": 10633632.0, "step": 862 }, { "entropy": 1.1113716661930084, "epoch": 0.454449710373881, "grad_norm": 0.32101956009864807, "learning_rate": 0.00019942794432653053, "loss": 0.20722433924674988, "mean_token_accuracy": 0.9159047454595566, "num_tokens": 10645968.0, "step": 863 }, { "entropy": 1.1962774693965912, "epoch": 0.4549763033175355, "grad_norm": 0.34402385354042053, "learning_rate": 0.00019942547321043027, "loss": 0.2361735999584198, "mean_token_accuracy": 0.9091803878545761, "num_tokens": 10658304.0, "step": 864 }, { "entropy": 1.2290304005146027, "epoch": 0.4555028962611901, "grad_norm": 0.35236313939094543, "learning_rate": 0.00019942299678566086, "loss": 0.21090444922447205, "mean_token_accuracy": 0.9149055033922195, "num_tokens": 10670640.0, "step": 865 }, { "entropy": 1.1575745642185211, "epoch": 0.45602948920484465, "grad_norm": 0.34065473079681396, "learning_rate": 0.00019942051505236936, "loss": 0.2252214103937149, "mean_token_accuracy": 0.9156748950481415, "num_tokens": 10682976.0, "step": 866 }, { "entropy": 1.216041624546051, "epoch": 0.4565560821484992, "grad_norm": 0.34139883518218994, "learning_rate": 0.00019941802801070303, "loss": 0.2223672717809677, "mean_token_accuracy": 0.9103764742612839, "num_tokens": 10695312.0, "step": 867 }, { "entropy": 1.210105150938034, "epoch": 0.4570826750921538, "grad_norm": 0.33792680501937866, "learning_rate": 0.00019941553566080956, "loss": 0.21836510300636292, "mean_token_accuracy": 0.9169131815433502, "num_tokens": 10707648.0, "step": 868 }, { "entropy": 1.2123220264911652, "epoch": 0.4576092680358083, "grad_norm": 0.33836740255355835, "learning_rate": 0.0001994130380028369, "loss": 0.22877393662929535, "mean_token_accuracy": 0.9094105064868927, "num_tokens": 10719984.0, "step": 869 }, { "entropy": 1.2113963067531586, "epoch": 0.45813586097946285, "grad_norm": 0.3214447796344757, "learning_rate": 0.00019941053503693329, "loss": 0.22401154041290283, "mean_token_accuracy": 0.9101571440696716, "num_tokens": 10732320.0, "step": 870 }, { "entropy": 1.2003886699676514, "epoch": 0.45866245392311744, "grad_norm": 0.32083162665367126, "learning_rate": 0.00019940802676324734, "loss": 0.22345268726348877, "mean_token_accuracy": 0.909741148352623, "num_tokens": 10744656.0, "step": 871 }, { "entropy": 1.2443215548992157, "epoch": 0.459189046866772, "grad_norm": 0.32810378074645996, "learning_rate": 0.00019940551318192796, "loss": 0.22558192908763885, "mean_token_accuracy": 0.911412313580513, "num_tokens": 10756992.0, "step": 872 }, { "entropy": 1.2517528235912323, "epoch": 0.4597156398104265, "grad_norm": 0.2983804941177368, "learning_rate": 0.00019940299429312437, "loss": 0.22902357578277588, "mean_token_accuracy": 0.9084698557853699, "num_tokens": 10769328.0, "step": 873 }, { "entropy": 1.331667423248291, "epoch": 0.4602422327540811, "grad_norm": 0.33570387959480286, "learning_rate": 0.00019940047009698605, "loss": 0.21841317415237427, "mean_token_accuracy": 0.9151860028505325, "num_tokens": 10781664.0, "step": 874 }, { "entropy": 1.2408846318721771, "epoch": 0.46076882569773564, "grad_norm": 0.3269551992416382, "learning_rate": 0.00019939794059366294, "loss": 0.21816705167293549, "mean_token_accuracy": 0.9179367125034332, "num_tokens": 10794000.0, "step": 875 }, { "entropy": 1.2641226053237915, "epoch": 0.46129541864139023, "grad_norm": 0.31645506620407104, "learning_rate": 0.0001993954057833051, "loss": 0.22259601950645447, "mean_token_accuracy": 0.9116221219301224, "num_tokens": 10806336.0, "step": 876 }, { "entropy": 1.2864770293235779, "epoch": 0.46182201158504477, "grad_norm": 0.36219751834869385, "learning_rate": 0.0001993928656660631, "loss": 0.23597069084644318, "mean_token_accuracy": 0.9075523316860199, "num_tokens": 10818672.0, "step": 877 }, { "entropy": 1.284227877855301, "epoch": 0.4623486045286993, "grad_norm": 0.33684641122817993, "learning_rate": 0.00019939032024208762, "loss": 0.23688027262687683, "mean_token_accuracy": 0.90504090487957, "num_tokens": 10831008.0, "step": 878 }, { "entropy": 1.2863526940345764, "epoch": 0.4628751974723539, "grad_norm": 0.3741551637649536, "learning_rate": 0.0001993877695115299, "loss": 0.26197415590286255, "mean_token_accuracy": 0.8967071026563644, "num_tokens": 10843344.0, "step": 879 }, { "entropy": 1.3029287159442902, "epoch": 0.46340179041600843, "grad_norm": 0.33679425716400146, "learning_rate": 0.00019938521347454127, "loss": 0.2334819734096527, "mean_token_accuracy": 0.9123462438583374, "num_tokens": 10855680.0, "step": 880 }, { "entropy": 1.2353507280349731, "epoch": 0.46392838335966297, "grad_norm": 0.3251015543937683, "learning_rate": 0.00019938265213127344, "loss": 0.24127048254013062, "mean_token_accuracy": 0.9032625257968903, "num_tokens": 10868016.0, "step": 881 }, { "entropy": 1.2318426966667175, "epoch": 0.46445497630331756, "grad_norm": 0.3128981292247772, "learning_rate": 0.0001993800854818786, "loss": 0.23091557621955872, "mean_token_accuracy": 0.910790741443634, "num_tokens": 10880352.0, "step": 882 }, { "entropy": 1.1969189643859863, "epoch": 0.4649815692469721, "grad_norm": 0.2763598561286926, "learning_rate": 0.000199377513526509, "loss": 0.19723600149154663, "mean_token_accuracy": 0.9164901375770569, "num_tokens": 10892688.0, "step": 883 }, { "entropy": 1.3742352426052094, "epoch": 0.46550816219062663, "grad_norm": 0.36182069778442383, "learning_rate": 0.00019937493626531733, "loss": 0.23250778019428253, "mean_token_accuracy": 0.910800889134407, "num_tokens": 10905024.0, "step": 884 }, { "entropy": 1.287173181772232, "epoch": 0.4660347551342812, "grad_norm": 0.37185028195381165, "learning_rate": 0.00019937235369845666, "loss": 0.2612641453742981, "mean_token_accuracy": 0.8980638682842255, "num_tokens": 10917360.0, "step": 885 }, { "entropy": 1.256176471710205, "epoch": 0.46656134807793576, "grad_norm": 0.3193638026714325, "learning_rate": 0.00019936976582608023, "loss": 0.2168237864971161, "mean_token_accuracy": 0.9117200374603271, "num_tokens": 10929696.0, "step": 886 }, { "entropy": 1.3229191601276398, "epoch": 0.4670879410215903, "grad_norm": 0.3389144241809845, "learning_rate": 0.00019936717264834166, "loss": 0.22236081957817078, "mean_token_accuracy": 0.9158815294504166, "num_tokens": 10942032.0, "step": 887 }, { "entropy": 1.3444121778011322, "epoch": 0.4676145339652449, "grad_norm": 0.30865800380706787, "learning_rate": 0.00019936457416539497, "loss": 0.22498130798339844, "mean_token_accuracy": 0.9109358042478561, "num_tokens": 10954368.0, "step": 888 }, { "entropy": 1.3391337096691132, "epoch": 0.4681411269088994, "grad_norm": 0.34072619676589966, "learning_rate": 0.00019936197037739433, "loss": 0.25583821535110474, "mean_token_accuracy": 0.9030615091323853, "num_tokens": 10966704.0, "step": 889 }, { "entropy": 1.3236074447631836, "epoch": 0.46866771985255395, "grad_norm": 0.30708205699920654, "learning_rate": 0.00019935936128449437, "loss": 0.2282828986644745, "mean_token_accuracy": 0.9107722789049149, "num_tokens": 10979040.0, "step": 890 }, { "entropy": 1.3548866510391235, "epoch": 0.46919431279620855, "grad_norm": 0.3132648766040802, "learning_rate": 0.00019935674688684993, "loss": 0.21266606450080872, "mean_token_accuracy": 0.9191526621580124, "num_tokens": 10991376.0, "step": 891 }, { "entropy": 1.3176174461841583, "epoch": 0.4697209057398631, "grad_norm": 0.2955908477306366, "learning_rate": 0.00019935412718461625, "loss": 0.21996596455574036, "mean_token_accuracy": 0.9133886098861694, "num_tokens": 11003712.0, "step": 892 }, { "entropy": 1.3978124856948853, "epoch": 0.4702474986835176, "grad_norm": 0.29386526346206665, "learning_rate": 0.00019935150217794887, "loss": 0.21586540341377258, "mean_token_accuracy": 0.913035660982132, "num_tokens": 11016048.0, "step": 893 }, { "entropy": 1.3344171047210693, "epoch": 0.4707740916271722, "grad_norm": 0.307434618473053, "learning_rate": 0.00019934887186700352, "loss": 0.19684919714927673, "mean_token_accuracy": 0.9249100238084793, "num_tokens": 11028384.0, "step": 894 }, { "entropy": 1.2738686203956604, "epoch": 0.47130068457082674, "grad_norm": 0.30784371495246887, "learning_rate": 0.00019934623625193646, "loss": 0.23357078433036804, "mean_token_accuracy": 0.906443789601326, "num_tokens": 11040720.0, "step": 895 }, { "entropy": 1.3004032373428345, "epoch": 0.4718272775144813, "grad_norm": 0.3604377806186676, "learning_rate": 0.0001993435953329041, "loss": 0.23538318276405334, "mean_token_accuracy": 0.910987451672554, "num_tokens": 11053056.0, "step": 896 }, { "entropy": 1.349770426750183, "epoch": 0.47235387045813587, "grad_norm": 0.371415913105011, "learning_rate": 0.00019934094911006322, "loss": 0.23594705760478973, "mean_token_accuracy": 0.9082933962345123, "num_tokens": 11065392.0, "step": 897 }, { "entropy": 1.3280587792396545, "epoch": 0.4728804634017904, "grad_norm": 0.3518844544887543, "learning_rate": 0.0001993382975835709, "loss": 0.22077634930610657, "mean_token_accuracy": 0.9151550680398941, "num_tokens": 11077728.0, "step": 898 }, { "entropy": 1.2467398941516876, "epoch": 0.473407056345445, "grad_norm": 0.3485780358314514, "learning_rate": 0.00019933564075358455, "loss": 0.21681727468967438, "mean_token_accuracy": 0.917348250746727, "num_tokens": 11090064.0, "step": 899 }, { "entropy": 1.2497498095035553, "epoch": 0.47393364928909953, "grad_norm": 0.2795222997665405, "learning_rate": 0.0001993329786202619, "loss": 0.19592691957950592, "mean_token_accuracy": 0.92547307908535, "num_tokens": 11102400.0, "step": 900 }, { "entropy": 1.3175421953201294, "epoch": 0.47446024223275407, "grad_norm": 0.34323444962501526, "learning_rate": 0.00019933031118376097, "loss": 0.23341751098632812, "mean_token_accuracy": 0.9069218635559082, "num_tokens": 11114736.0, "step": 901 }, { "entropy": 1.2457618713378906, "epoch": 0.47498683517640866, "grad_norm": 0.3164939284324646, "learning_rate": 0.00019932763844424017, "loss": 0.2065175175666809, "mean_token_accuracy": 0.9177182614803314, "num_tokens": 11127072.0, "step": 902 }, { "entropy": 1.2637942731380463, "epoch": 0.4755134281200632, "grad_norm": 0.3504999279975891, "learning_rate": 0.00019932496040185808, "loss": 0.21458998322486877, "mean_token_accuracy": 0.9221720099449158, "num_tokens": 11139408.0, "step": 903 }, { "entropy": 1.2935825884342194, "epoch": 0.47604002106371773, "grad_norm": 0.37840691208839417, "learning_rate": 0.00019932227705677372, "loss": 0.227766752243042, "mean_token_accuracy": 0.9137209206819534, "num_tokens": 11151744.0, "step": 904 }, { "entropy": 1.3187288045883179, "epoch": 0.4765666140073723, "grad_norm": 0.35070836544036865, "learning_rate": 0.00019931958840914635, "loss": 0.23313553631305695, "mean_token_accuracy": 0.9072595983743668, "num_tokens": 11164080.0, "step": 905 }, { "entropy": 1.2109759449958801, "epoch": 0.47709320695102686, "grad_norm": 0.3268450200557709, "learning_rate": 0.00019931689445913564, "loss": 0.21801263093948364, "mean_token_accuracy": 0.9163070619106293, "num_tokens": 11176416.0, "step": 906 }, { "entropy": 1.2274765968322754, "epoch": 0.4776197998946814, "grad_norm": 0.3167557120323181, "learning_rate": 0.00019931419520690147, "loss": 0.21107861399650574, "mean_token_accuracy": 0.9160606116056442, "num_tokens": 11188752.0, "step": 907 }, { "entropy": 1.1903901398181915, "epoch": 0.478146392838336, "grad_norm": 0.3267144560813904, "learning_rate": 0.00019931149065260413, "loss": 0.20752331614494324, "mean_token_accuracy": 0.9146323353052139, "num_tokens": 11201088.0, "step": 908 }, { "entropy": 1.2301645576953888, "epoch": 0.4786729857819905, "grad_norm": 0.3323666751384735, "learning_rate": 0.0001993087807964041, "loss": 0.20132845640182495, "mean_token_accuracy": 0.9229601621627808, "num_tokens": 11213424.0, "step": 909 }, { "entropy": 1.2413881123065948, "epoch": 0.47919957872564506, "grad_norm": 0.3245013356208801, "learning_rate": 0.00019930606563846234, "loss": 0.19781675934791565, "mean_token_accuracy": 0.9200431853532791, "num_tokens": 11225760.0, "step": 910 }, { "entropy": 1.180581659078598, "epoch": 0.47972617166929965, "grad_norm": 0.31535807251930237, "learning_rate": 0.00019930334517893991, "loss": 0.2060268521308899, "mean_token_accuracy": 0.9165100157260895, "num_tokens": 11238096.0, "step": 911 }, { "entropy": 1.233038753271103, "epoch": 0.4802527646129542, "grad_norm": 0.32888907194137573, "learning_rate": 0.0001993006194179984, "loss": 0.22726945579051971, "mean_token_accuracy": 0.9112953692674637, "num_tokens": 11250432.0, "step": 912 }, { "entropy": 1.262090653181076, "epoch": 0.4807793575566087, "grad_norm": 0.3833845555782318, "learning_rate": 0.00019929788835579962, "loss": 0.23385398089885712, "mean_token_accuracy": 0.9076380431652069, "num_tokens": 11262768.0, "step": 913 }, { "entropy": 1.2252440452575684, "epoch": 0.4813059505002633, "grad_norm": 0.3054254949092865, "learning_rate": 0.00019929515199250565, "loss": 0.21175538003444672, "mean_token_accuracy": 0.91593237221241, "num_tokens": 11275104.0, "step": 914 }, { "entropy": 1.2347098588943481, "epoch": 0.48183254344391785, "grad_norm": 0.32731181383132935, "learning_rate": 0.00019929241032827898, "loss": 0.21469083428382874, "mean_token_accuracy": 0.9144894182682037, "num_tokens": 11287440.0, "step": 915 }, { "entropy": 1.2054485082626343, "epoch": 0.4823591363875724, "grad_norm": 0.3010466694831848, "learning_rate": 0.0001992896633632823, "loss": 0.2065753936767578, "mean_token_accuracy": 0.9242510497570038, "num_tokens": 11299776.0, "step": 916 }, { "entropy": 1.2271296083927155, "epoch": 0.482885729331227, "grad_norm": 0.42679160833358765, "learning_rate": 0.00019928691109767876, "loss": 0.23648393154144287, "mean_token_accuracy": 0.9071210771799088, "num_tokens": 11312112.0, "step": 917 }, { "entropy": 1.233128011226654, "epoch": 0.4834123222748815, "grad_norm": 0.3018331229686737, "learning_rate": 0.00019928415353163173, "loss": 0.20864740014076233, "mean_token_accuracy": 0.9222661405801773, "num_tokens": 11324448.0, "step": 918 }, { "entropy": 1.2823042571544647, "epoch": 0.48393891521853605, "grad_norm": 0.44017431139945984, "learning_rate": 0.00019928139066530487, "loss": 0.23257723450660706, "mean_token_accuracy": 0.9054065048694611, "num_tokens": 11336784.0, "step": 919 }, { "entropy": 1.2760326564311981, "epoch": 0.48446550816219064, "grad_norm": 0.3077127933502197, "learning_rate": 0.00019927862249886222, "loss": 0.22436192631721497, "mean_token_accuracy": 0.9136722385883331, "num_tokens": 11349120.0, "step": 920 }, { "entropy": 1.3157328069210052, "epoch": 0.4849921011058452, "grad_norm": 0.29968273639678955, "learning_rate": 0.0001992758490324681, "loss": 0.20738902688026428, "mean_token_accuracy": 0.9168381989002228, "num_tokens": 11361456.0, "step": 921 }, { "entropy": 1.3066685795783997, "epoch": 0.4855186940494997, "grad_norm": 0.31207534670829773, "learning_rate": 0.00019927307026628715, "loss": 0.2138848602771759, "mean_token_accuracy": 0.9126945734024048, "num_tokens": 11373792.0, "step": 922 }, { "entropy": 1.3030335009098053, "epoch": 0.4860452869931543, "grad_norm": 0.3280918598175049, "learning_rate": 0.00019927028620048438, "loss": 0.23367798328399658, "mean_token_accuracy": 0.9077742546796799, "num_tokens": 11386128.0, "step": 923 }, { "entropy": 1.2811558842658997, "epoch": 0.48657187993680884, "grad_norm": 0.376886248588562, "learning_rate": 0.00019926749683522502, "loss": 0.20860403776168823, "mean_token_accuracy": 0.9099331349134445, "num_tokens": 11398464.0, "step": 924 }, { "entropy": 1.2956900000572205, "epoch": 0.48709847288046343, "grad_norm": 0.2849150598049164, "learning_rate": 0.00019926470217067463, "loss": 0.20377135276794434, "mean_token_accuracy": 0.9249068945646286, "num_tokens": 11410800.0, "step": 925 }, { "entropy": 1.3335639834403992, "epoch": 0.48762506582411796, "grad_norm": 0.30451253056526184, "learning_rate": 0.00019926190220699916, "loss": 0.2137700468301773, "mean_token_accuracy": 0.9165246337652206, "num_tokens": 11423136.0, "step": 926 }, { "entropy": 1.3315201103687286, "epoch": 0.4881516587677725, "grad_norm": 0.31507113575935364, "learning_rate": 0.0001992590969443648, "loss": 0.22226491570472717, "mean_token_accuracy": 0.9110458046197891, "num_tokens": 11435472.0, "step": 927 }, { "entropy": 1.3439573049545288, "epoch": 0.4886782517114271, "grad_norm": 0.3123377561569214, "learning_rate": 0.00019925628638293815, "loss": 0.2124030739068985, "mean_token_accuracy": 0.9143670797348022, "num_tokens": 11447808.0, "step": 928 }, { "entropy": 1.373394101858139, "epoch": 0.4892048446550816, "grad_norm": 0.38396134972572327, "learning_rate": 0.00019925347052288594, "loss": 0.21086710691452026, "mean_token_accuracy": 0.9174065738916397, "num_tokens": 11460144.0, "step": 929 }, { "entropy": 1.3038064241409302, "epoch": 0.48973143759873616, "grad_norm": 0.3282279074192047, "learning_rate": 0.00019925064936437544, "loss": 0.19842374324798584, "mean_token_accuracy": 0.9203700721263885, "num_tokens": 11472480.0, "step": 930 }, { "entropy": 1.39743971824646, "epoch": 0.49025803054239075, "grad_norm": 0.3458907902240753, "learning_rate": 0.00019924782290757403, "loss": 0.21870574355125427, "mean_token_accuracy": 0.9133100211620331, "num_tokens": 11484816.0, "step": 931 }, { "entropy": 1.3737529814243317, "epoch": 0.4907846234860453, "grad_norm": 0.35361558198928833, "learning_rate": 0.0001992449911526496, "loss": 0.2228592187166214, "mean_token_accuracy": 0.908146470785141, "num_tokens": 11497152.0, "step": 932 }, { "entropy": 1.373944640159607, "epoch": 0.4913112164296998, "grad_norm": 0.3263792097568512, "learning_rate": 0.0001992421540997702, "loss": 0.19889512658119202, "mean_token_accuracy": 0.9241671562194824, "num_tokens": 11509488.0, "step": 933 }, { "entropy": 1.3812199532985687, "epoch": 0.4918378093733544, "grad_norm": 0.30469757318496704, "learning_rate": 0.00019923931174910421, "loss": 0.20764592289924622, "mean_token_accuracy": 0.9166074395179749, "num_tokens": 11521824.0, "step": 934 }, { "entropy": 1.3702083230018616, "epoch": 0.49236440231700895, "grad_norm": 0.3094841539859772, "learning_rate": 0.00019923646410082045, "loss": 0.22583043575286865, "mean_token_accuracy": 0.9111629873514175, "num_tokens": 11534160.0, "step": 935 }, { "entropy": 1.4550175070762634, "epoch": 0.4928909952606635, "grad_norm": 0.3479791581630707, "learning_rate": 0.0001992336111550879, "loss": 0.22404024004936218, "mean_token_accuracy": 0.9125335812568665, "num_tokens": 11546496.0, "step": 936 }, { "entropy": 1.369890809059143, "epoch": 0.4934175882043181, "grad_norm": 0.33549702167510986, "learning_rate": 0.00019923075291207595, "loss": 0.22361691296100616, "mean_token_accuracy": 0.9108781665563583, "num_tokens": 11558832.0, "step": 937 }, { "entropy": 1.4506123065948486, "epoch": 0.4939441811479726, "grad_norm": 0.31795117259025574, "learning_rate": 0.00019922788937195432, "loss": 0.20908354222774506, "mean_token_accuracy": 0.916689082980156, "num_tokens": 11571168.0, "step": 938 }, { "entropy": 1.4594894349575043, "epoch": 0.49447077409162715, "grad_norm": 0.3958785831928253, "learning_rate": 0.0001992250205348929, "loss": 0.22291752696037292, "mean_token_accuracy": 0.9057322442531586, "num_tokens": 11583504.0, "step": 939 }, { "entropy": 1.4367193281650543, "epoch": 0.49499736703528174, "grad_norm": 0.38530445098876953, "learning_rate": 0.00019922214640106207, "loss": 0.21757692098617554, "mean_token_accuracy": 0.9140817075967789, "num_tokens": 11595840.0, "step": 940 }, { "entropy": 1.4827219545841217, "epoch": 0.4955239599789363, "grad_norm": 0.36136746406555176, "learning_rate": 0.00019921926697063244, "loss": 0.245650514960289, "mean_token_accuracy": 0.9077811390161514, "num_tokens": 11608176.0, "step": 941 }, { "entropy": 1.4725195467472076, "epoch": 0.4960505529225908, "grad_norm": 0.3393801748752594, "learning_rate": 0.00019921638224377493, "loss": 0.22296787798404694, "mean_token_accuracy": 0.912161722779274, "num_tokens": 11620512.0, "step": 942 }, { "entropy": 1.5998758971691132, "epoch": 0.4965771458662454, "grad_norm": 0.31578320264816284, "learning_rate": 0.00019921349222066083, "loss": 0.21946173906326294, "mean_token_accuracy": 0.9090907126665115, "num_tokens": 11632848.0, "step": 943 }, { "entropy": 1.5493124723434448, "epoch": 0.49710373880989994, "grad_norm": 0.3594050705432892, "learning_rate": 0.00019921059690146165, "loss": 0.25090494751930237, "mean_token_accuracy": 0.899459958076477, "num_tokens": 11645184.0, "step": 944 }, { "entropy": 1.4591304063796997, "epoch": 0.4976303317535545, "grad_norm": 0.3398474454879761, "learning_rate": 0.0001992076962863493, "loss": 0.22868260741233826, "mean_token_accuracy": 0.9120910316705704, "num_tokens": 11657520.0, "step": 945 }, { "entropy": 1.5574268996715546, "epoch": 0.49815692469720907, "grad_norm": 0.37178367376327515, "learning_rate": 0.00019920479037549595, "loss": 0.24399921298027039, "mean_token_accuracy": 0.9063628762960434, "num_tokens": 11669856.0, "step": 946 }, { "entropy": 1.4919456243515015, "epoch": 0.4986835176408636, "grad_norm": 0.344330757856369, "learning_rate": 0.0001992018791690741, "loss": 0.2234281301498413, "mean_token_accuracy": 0.9139427691698074, "num_tokens": 11682192.0, "step": 947 }, { "entropy": 1.486481934785843, "epoch": 0.49921011058451814, "grad_norm": 0.3283190429210663, "learning_rate": 0.00019919896266725663, "loss": 0.21686026453971863, "mean_token_accuracy": 0.9156758487224579, "num_tokens": 11694528.0, "step": 948 }, { "entropy": 1.4495719075202942, "epoch": 0.49973670352817273, "grad_norm": 0.3260519802570343, "learning_rate": 0.00019919604087021664, "loss": 0.21722926199436188, "mean_token_accuracy": 0.9189446866512299, "num_tokens": 11706864.0, "step": 949 }, { "entropy": 1.5058691203594208, "epoch": 0.5002632964718273, "grad_norm": 0.34286144375801086, "learning_rate": 0.00019919311377812756, "loss": 0.2165110558271408, "mean_token_accuracy": 0.9119018763303757, "num_tokens": 11719200.0, "step": 950 }, { "entropy": 1.4864198863506317, "epoch": 0.5007898894154819, "grad_norm": 0.3339075446128845, "learning_rate": 0.00019919018139116318, "loss": 0.22437581419944763, "mean_token_accuracy": 0.9123266935348511, "num_tokens": 11731536.0, "step": 951 }, { "entropy": 1.5294865667819977, "epoch": 0.5013164823591364, "grad_norm": 0.3746489882469177, "learning_rate": 0.00019918724370949754, "loss": 0.2426229566335678, "mean_token_accuracy": 0.9112533032894135, "num_tokens": 11743872.0, "step": 952 }, { "entropy": 1.4867128133773804, "epoch": 0.5018430753027909, "grad_norm": 0.3308849036693573, "learning_rate": 0.00019918430073330513, "loss": 0.2087199091911316, "mean_token_accuracy": 0.919797733426094, "num_tokens": 11756208.0, "step": 953 }, { "entropy": 1.5136871337890625, "epoch": 0.5023696682464455, "grad_norm": 0.34608909487724304, "learning_rate": 0.00019918135246276052, "loss": 0.22718098759651184, "mean_token_accuracy": 0.9114474952220917, "num_tokens": 11768544.0, "step": 954 }, { "entropy": 1.5160588324069977, "epoch": 0.5028962611901, "grad_norm": 0.3665941655635834, "learning_rate": 0.00019917839889803884, "loss": 0.21780604124069214, "mean_token_accuracy": 0.9177397042512894, "num_tokens": 11780880.0, "step": 955 }, { "entropy": 1.4711733162403107, "epoch": 0.5034228541337546, "grad_norm": 0.3232526183128357, "learning_rate": 0.00019917544003931537, "loss": 0.20783714950084686, "mean_token_accuracy": 0.9170488715171814, "num_tokens": 11793216.0, "step": 956 }, { "entropy": 1.5061227977275848, "epoch": 0.5039494470774092, "grad_norm": 0.3460804522037506, "learning_rate": 0.00019917247588676582, "loss": 0.22913217544555664, "mean_token_accuracy": 0.9122664779424667, "num_tokens": 11805552.0, "step": 957 }, { "entropy": 1.4881491363048553, "epoch": 0.5044760400210637, "grad_norm": 0.38591158390045166, "learning_rate": 0.00019916950644056607, "loss": 0.2197885662317276, "mean_token_accuracy": 0.9077084809541702, "num_tokens": 11817888.0, "step": 958 }, { "entropy": 1.4673264026641846, "epoch": 0.5050026329647183, "grad_norm": 0.33065465092658997, "learning_rate": 0.00019916653170089246, "loss": 0.2319866120815277, "mean_token_accuracy": 0.9126220494508743, "num_tokens": 11830224.0, "step": 959 }, { "entropy": 1.4641340970993042, "epoch": 0.5055292259083728, "grad_norm": 0.36219480633735657, "learning_rate": 0.00019916355166792155, "loss": 0.23807652294635773, "mean_token_accuracy": 0.9052844792604446, "num_tokens": 11842560.0, "step": 960 }, { "entropy": 1.4770829379558563, "epoch": 0.5060558188520273, "grad_norm": 0.3402878940105438, "learning_rate": 0.00019916056634183027, "loss": 0.23622629046440125, "mean_token_accuracy": 0.9105163961648941, "num_tokens": 11854896.0, "step": 961 }, { "entropy": 1.510101705789566, "epoch": 0.506582411795682, "grad_norm": 0.38479122519493103, "learning_rate": 0.00019915757572279584, "loss": 0.26114726066589355, "mean_token_accuracy": 0.901023805141449, "num_tokens": 11867232.0, "step": 962 }, { "entropy": 1.462478369474411, "epoch": 0.5071090047393365, "grad_norm": 0.30232900381088257, "learning_rate": 0.0001991545798109958, "loss": 0.21362073719501495, "mean_token_accuracy": 0.9150588363409042, "num_tokens": 11879568.0, "step": 963 }, { "entropy": 1.4567637145519257, "epoch": 0.507635597682991, "grad_norm": 0.3392339050769806, "learning_rate": 0.00019915157860660797, "loss": 0.229543536901474, "mean_token_accuracy": 0.9123556017875671, "num_tokens": 11891904.0, "step": 964 }, { "entropy": 1.4373153448104858, "epoch": 0.5081621906266456, "grad_norm": 0.3237869441509247, "learning_rate": 0.00019914857210981052, "loss": 0.222116619348526, "mean_token_accuracy": 0.9098070710897446, "num_tokens": 11904240.0, "step": 965 }, { "entropy": 1.4922161400318146, "epoch": 0.5086887835703001, "grad_norm": 0.3090606927871704, "learning_rate": 0.00019914556032078198, "loss": 0.22452594339847565, "mean_token_accuracy": 0.9133640974760056, "num_tokens": 11916576.0, "step": 966 }, { "entropy": 1.4847496449947357, "epoch": 0.5092153765139548, "grad_norm": 0.31530138850212097, "learning_rate": 0.00019914254323970108, "loss": 0.21454353630542755, "mean_token_accuracy": 0.9175532162189484, "num_tokens": 11928912.0, "step": 967 }, { "entropy": 1.481870412826538, "epoch": 0.5097419694576093, "grad_norm": 0.3098122775554657, "learning_rate": 0.00019913952086674696, "loss": 0.21168866753578186, "mean_token_accuracy": 0.9122080057859421, "num_tokens": 11941248.0, "step": 968 }, { "entropy": 1.5705283880233765, "epoch": 0.5102685624012638, "grad_norm": 0.32009753584861755, "learning_rate": 0.000199136493202099, "loss": 0.20256565511226654, "mean_token_accuracy": 0.9237568825483322, "num_tokens": 11953584.0, "step": 969 }, { "entropy": 1.5321417450904846, "epoch": 0.5107951553449184, "grad_norm": 0.33614546060562134, "learning_rate": 0.000199133460245937, "loss": 0.2249448001384735, "mean_token_accuracy": 0.9105825424194336, "num_tokens": 11965920.0, "step": 970 }, { "entropy": 1.5060743689537048, "epoch": 0.5113217482885729, "grad_norm": 0.3201083540916443, "learning_rate": 0.00019913042199844097, "loss": 0.22582277655601501, "mean_token_accuracy": 0.9086000770330429, "num_tokens": 11978256.0, "step": 971 }, { "entropy": 1.5098620057106018, "epoch": 0.5118483412322274, "grad_norm": 0.739696204662323, "learning_rate": 0.00019912737845979126, "loss": 0.20600268244743347, "mean_token_accuracy": 0.9227887839078903, "num_tokens": 11990592.0, "step": 972 }, { "entropy": 1.5500882267951965, "epoch": 0.5123749341758821, "grad_norm": 0.3458639681339264, "learning_rate": 0.00019912432963016855, "loss": 0.23240959644317627, "mean_token_accuracy": 0.9070769846439362, "num_tokens": 12002928.0, "step": 973 }, { "entropy": 1.5514563918113708, "epoch": 0.5129015271195366, "grad_norm": 0.33823850750923157, "learning_rate": 0.0001991212755097539, "loss": 0.21927812695503235, "mean_token_accuracy": 0.9085335284471512, "num_tokens": 12015264.0, "step": 974 }, { "entropy": 1.4905177056789398, "epoch": 0.5134281200631912, "grad_norm": 0.3308093547821045, "learning_rate": 0.0001991182160987285, "loss": 0.22249096632003784, "mean_token_accuracy": 0.9114507138729095, "num_tokens": 12027600.0, "step": 975 }, { "entropy": 1.5092821419239044, "epoch": 0.5139547130068457, "grad_norm": 0.35571059584617615, "learning_rate": 0.0001991151513972741, "loss": 0.23242917656898499, "mean_token_accuracy": 0.9118809998035431, "num_tokens": 12039936.0, "step": 976 }, { "entropy": 1.426015704870224, "epoch": 0.5144813059505002, "grad_norm": 0.2942444086074829, "learning_rate": 0.0001991120814055725, "loss": 0.2060171216726303, "mean_token_accuracy": 0.9149444848299026, "num_tokens": 12052272.0, "step": 977 }, { "entropy": 1.4646040201187134, "epoch": 0.5150078988941548, "grad_norm": 0.36998897790908813, "learning_rate": 0.00019910900612380605, "loss": 0.23340070247650146, "mean_token_accuracy": 0.9063846617937088, "num_tokens": 12064608.0, "step": 978 }, { "entropy": 1.4659819900989532, "epoch": 0.5155344918378094, "grad_norm": 0.3255058526992798, "learning_rate": 0.00019910592555215725, "loss": 0.20911140739917755, "mean_token_accuracy": 0.9192948192358017, "num_tokens": 12076944.0, "step": 979 }, { "entropy": 1.5005815625190735, "epoch": 0.516061084781464, "grad_norm": 0.35735374689102173, "learning_rate": 0.000199102839690809, "loss": 0.2287176251411438, "mean_token_accuracy": 0.9081791937351227, "num_tokens": 12089280.0, "step": 980 }, { "entropy": 1.4197439849376678, "epoch": 0.5165876777251185, "grad_norm": 0.30643951892852783, "learning_rate": 0.00019909974853994452, "loss": 0.19968025386333466, "mean_token_accuracy": 0.9234030842781067, "num_tokens": 12101616.0, "step": 981 }, { "entropy": 1.4192424714565277, "epoch": 0.517114270668773, "grad_norm": 0.337433785200119, "learning_rate": 0.00019909665209974723, "loss": 0.23955072462558746, "mean_token_accuracy": 0.9109057635068893, "num_tokens": 12113952.0, "step": 982 }, { "entropy": 1.4805451035499573, "epoch": 0.5176408636124276, "grad_norm": 0.34595102071762085, "learning_rate": 0.00019909355037040104, "loss": 0.23975268006324768, "mean_token_accuracy": 0.9099203199148178, "num_tokens": 12126288.0, "step": 983 }, { "entropy": 1.4859175980091095, "epoch": 0.5181674565560821, "grad_norm": 0.33112627267837524, "learning_rate": 0.00019909044335209003, "loss": 0.23115341365337372, "mean_token_accuracy": 0.9144714772701263, "num_tokens": 12138624.0, "step": 984 }, { "entropy": 1.4870480000972748, "epoch": 0.5186940494997367, "grad_norm": 0.2882140576839447, "learning_rate": 0.00019908733104499868, "loss": 0.2003549188375473, "mean_token_accuracy": 0.9193922579288483, "num_tokens": 12150960.0, "step": 985 }, { "entropy": 1.5195731818675995, "epoch": 0.5192206424433913, "grad_norm": 0.33627068996429443, "learning_rate": 0.00019908421344931173, "loss": 0.2529386878013611, "mean_token_accuracy": 0.8942808210849762, "num_tokens": 12163296.0, "step": 986 }, { "entropy": 1.480097621679306, "epoch": 0.5197472353870458, "grad_norm": 1.469023585319519, "learning_rate": 0.0001990810905652142, "loss": 0.24130460619926453, "mean_token_accuracy": 0.9022433310747147, "num_tokens": 12175632.0, "step": 987 }, { "entropy": 1.498535007238388, "epoch": 0.5202738283307003, "grad_norm": 0.29503491520881653, "learning_rate": 0.00019907796239289154, "loss": 0.21136939525604248, "mean_token_accuracy": 0.9171615391969681, "num_tokens": 12187968.0, "step": 988 }, { "entropy": 1.5154505968093872, "epoch": 0.5208004212743549, "grad_norm": 0.29515334963798523, "learning_rate": 0.00019907482893252945, "loss": 0.22373729944229126, "mean_token_accuracy": 0.9104124307632446, "num_tokens": 12200304.0, "step": 989 }, { "entropy": 1.5455197095870972, "epoch": 0.5213270142180095, "grad_norm": 0.36879390478134155, "learning_rate": 0.00019907169018431394, "loss": 0.23778440058231354, "mean_token_accuracy": 0.9108938276767731, "num_tokens": 12212640.0, "step": 990 }, { "entropy": 1.5229522287845612, "epoch": 0.5218536071616641, "grad_norm": 0.33947938680648804, "learning_rate": 0.0001990685461484313, "loss": 0.22162161767482758, "mean_token_accuracy": 0.9117240607738495, "num_tokens": 12224976.0, "step": 991 }, { "entropy": 1.5108350217342377, "epoch": 0.5223802001053186, "grad_norm": 0.3344981074333191, "learning_rate": 0.00019906539682506823, "loss": 0.20931261777877808, "mean_token_accuracy": 0.9169653207063675, "num_tokens": 12237312.0, "step": 992 }, { "entropy": 1.508901059627533, "epoch": 0.5229067930489731, "grad_norm": 0.3136521279811859, "learning_rate": 0.00019906224221441168, "loss": 0.22339576482772827, "mean_token_accuracy": 0.9082980453968048, "num_tokens": 12249648.0, "step": 993 }, { "entropy": 1.5110598504543304, "epoch": 0.5234333859926277, "grad_norm": 0.3550313413143158, "learning_rate": 0.0001990590823166489, "loss": 0.2181922197341919, "mean_token_accuracy": 0.913140058517456, "num_tokens": 12261984.0, "step": 994 }, { "entropy": 1.4990539252758026, "epoch": 0.5239599789362822, "grad_norm": 0.3551686108112335, "learning_rate": 0.00019905591713196747, "loss": 0.21492283046245575, "mean_token_accuracy": 0.917353168129921, "num_tokens": 12274320.0, "step": 995 }, { "entropy": 1.6208187341690063, "epoch": 0.5244865718799369, "grad_norm": 0.3526499271392822, "learning_rate": 0.0001990527466605553, "loss": 0.2129640281200409, "mean_token_accuracy": 0.913350835442543, "num_tokens": 12286656.0, "step": 996 }, { "entropy": 1.5281141996383667, "epoch": 0.5250131648235914, "grad_norm": 0.33227595686912537, "learning_rate": 0.00019904957090260056, "loss": 0.21114130318164825, "mean_token_accuracy": 0.9172855019569397, "num_tokens": 12298992.0, "step": 997 }, { "entropy": 1.4690798819065094, "epoch": 0.5255397577672459, "grad_norm": 0.30048811435699463, "learning_rate": 0.00019904638985829187, "loss": 0.20892660319805145, "mean_token_accuracy": 0.9182561188936234, "num_tokens": 12311328.0, "step": 998 }, { "entropy": 1.6034342348575592, "epoch": 0.5260663507109005, "grad_norm": 0.3628803491592407, "learning_rate": 0.000199043203527818, "loss": 0.21608318388462067, "mean_token_accuracy": 0.913134828209877, "num_tokens": 12323664.0, "step": 999 }, { "entropy": 1.4999005496501923, "epoch": 0.526592943654555, "grad_norm": 0.3294629454612732, "learning_rate": 0.0001990400119113681, "loss": 0.21117916703224182, "mean_token_accuracy": 0.917900949716568, "num_tokens": 12336000.0, "step": 1000 }, { "entropy": 1.596118301153183, "epoch": 0.5271195365982095, "grad_norm": 0.3512589931488037, "learning_rate": 0.00019903681500913167, "loss": 0.20125192403793335, "mean_token_accuracy": 0.921380877494812, "num_tokens": 12348336.0, "step": 1001 }, { "entropy": 1.4794040620326996, "epoch": 0.5276461295418642, "grad_norm": 0.3046097457408905, "learning_rate": 0.0001990336128212985, "loss": 0.2075495421886444, "mean_token_accuracy": 0.9140082001686096, "num_tokens": 12360672.0, "step": 1002 }, { "entropy": 1.5259474217891693, "epoch": 0.5281727224855187, "grad_norm": 0.3376280963420868, "learning_rate": 0.00019903040534805866, "loss": 0.22057998180389404, "mean_token_accuracy": 0.9114288538694382, "num_tokens": 12373008.0, "step": 1003 }, { "entropy": 1.5479835271835327, "epoch": 0.5286993154291733, "grad_norm": 0.3668357729911804, "learning_rate": 0.00019902719258960253, "loss": 0.24602656066417694, "mean_token_accuracy": 0.9003023505210876, "num_tokens": 12385344.0, "step": 1004 }, { "entropy": 1.5563693940639496, "epoch": 0.5292259083728278, "grad_norm": 0.33542895317077637, "learning_rate": 0.0001990239745461209, "loss": 0.22432827949523926, "mean_token_accuracy": 0.9152787178754807, "num_tokens": 12397680.0, "step": 1005 }, { "entropy": 1.5360921025276184, "epoch": 0.5297525013164823, "grad_norm": 0.34227633476257324, "learning_rate": 0.00019902075121780473, "loss": 0.24711929261684418, "mean_token_accuracy": 0.9043864160776138, "num_tokens": 12410016.0, "step": 1006 }, { "entropy": 1.5392629504203796, "epoch": 0.5302790942601369, "grad_norm": 0.31668519973754883, "learning_rate": 0.00019901752260484545, "loss": 0.24319474399089813, "mean_token_accuracy": 0.9046953171491623, "num_tokens": 12422352.0, "step": 1007 }, { "entropy": 1.608776479959488, "epoch": 0.5308056872037915, "grad_norm": 0.3281152844429016, "learning_rate": 0.00019901428870743466, "loss": 0.2047930210828781, "mean_token_accuracy": 0.9202082604169846, "num_tokens": 12434688.0, "step": 1008 }, { "entropy": 1.6915300488471985, "epoch": 0.531332280147446, "grad_norm": 0.38227638602256775, "learning_rate": 0.0001990110495257644, "loss": 0.23451298475265503, "mean_token_accuracy": 0.9067147076129913, "num_tokens": 12447024.0, "step": 1009 }, { "entropy": 1.5676094889640808, "epoch": 0.5318588730911006, "grad_norm": 0.3091145157814026, "learning_rate": 0.0001990078050600269, "loss": 0.21618413925170898, "mean_token_accuracy": 0.9121405184268951, "num_tokens": 12459360.0, "step": 1010 }, { "entropy": 1.6247548460960388, "epoch": 0.5323854660347551, "grad_norm": 0.3261072337627411, "learning_rate": 0.0001990045553104148, "loss": 0.2148750126361847, "mean_token_accuracy": 0.9210677593946457, "num_tokens": 12471696.0, "step": 1011 }, { "entropy": 1.5738478302955627, "epoch": 0.5329120589784097, "grad_norm": 0.32214832305908203, "learning_rate": 0.00019900130027712099, "loss": 0.23918862640857697, "mean_token_accuracy": 0.9062842279672623, "num_tokens": 12484032.0, "step": 1012 }, { "entropy": 1.474539339542389, "epoch": 0.5334386519220643, "grad_norm": 0.346766859292984, "learning_rate": 0.00019899803996033876, "loss": 0.21119186282157898, "mean_token_accuracy": 0.918285146355629, "num_tokens": 12496368.0, "step": 1013 }, { "entropy": 1.5115889310836792, "epoch": 0.5339652448657188, "grad_norm": 0.3021303117275238, "learning_rate": 0.00019899477436026157, "loss": 0.19445011019706726, "mean_token_accuracy": 0.9237413257360458, "num_tokens": 12508704.0, "step": 1014 }, { "entropy": 1.492755115032196, "epoch": 0.5344918378093734, "grad_norm": 0.3711804449558258, "learning_rate": 0.00019899150347708335, "loss": 0.21977633237838745, "mean_token_accuracy": 0.9105686545372009, "num_tokens": 12521040.0, "step": 1015 }, { "entropy": 1.4154399931430817, "epoch": 0.5350184307530279, "grad_norm": 0.34001612663269043, "learning_rate": 0.00019898822731099827, "loss": 0.1881294697523117, "mean_token_accuracy": 0.924776166677475, "num_tokens": 12533376.0, "step": 1016 }, { "entropy": 1.41116601228714, "epoch": 0.5355450236966824, "grad_norm": 0.33592158555984497, "learning_rate": 0.00019898494586220077, "loss": 0.22032563388347626, "mean_token_accuracy": 0.9117150008678436, "num_tokens": 12545712.0, "step": 1017 }, { "entropy": 1.416001707315445, "epoch": 0.536071616640337, "grad_norm": 0.3635656535625458, "learning_rate": 0.00019898165913088568, "loss": 0.2379489541053772, "mean_token_accuracy": 0.9045498371124268, "num_tokens": 12558048.0, "step": 1018 }, { "entropy": 1.346794456243515, "epoch": 0.5365982095839916, "grad_norm": 0.41112419962882996, "learning_rate": 0.0001989783671172481, "loss": 0.24667346477508545, "mean_token_accuracy": 0.9044399708509445, "num_tokens": 12570384.0, "step": 1019 }, { "entropy": 1.417405605316162, "epoch": 0.5371248025276462, "grad_norm": 0.3971119821071625, "learning_rate": 0.00019897506982148353, "loss": 0.19713318347930908, "mean_token_accuracy": 0.9267271012067795, "num_tokens": 12582720.0, "step": 1020 }, { "entropy": 1.4534864723682404, "epoch": 0.5376513954713007, "grad_norm": 0.3351125717163086, "learning_rate": 0.00019897176724378762, "loss": 0.22281871736049652, "mean_token_accuracy": 0.9098447114229202, "num_tokens": 12595056.0, "step": 1021 }, { "entropy": 1.3609624803066254, "epoch": 0.5381779884149552, "grad_norm": 0.3119547665119171, "learning_rate": 0.00019896845938435642, "loss": 0.2145942896604538, "mean_token_accuracy": 0.9176490157842636, "num_tokens": 12607392.0, "step": 1022 }, { "entropy": 1.373078614473343, "epoch": 0.5387045813586098, "grad_norm": 0.3335905075073242, "learning_rate": 0.00019896514624338633, "loss": 0.20780502259731293, "mean_token_accuracy": 0.9145664125680923, "num_tokens": 12619728.0, "step": 1023 }, { "entropy": 1.45356023311615, "epoch": 0.5392311743022643, "grad_norm": 0.321328729391098, "learning_rate": 0.00019896182782107408, "loss": 0.21474064886569977, "mean_token_accuracy": 0.914635494351387, "num_tokens": 12632064.0, "step": 1024 }, { "entropy": 1.3756296038627625, "epoch": 0.539757767245919, "grad_norm": 0.3236009180545807, "learning_rate": 0.0001989585041176166, "loss": 0.19574275612831116, "mean_token_accuracy": 0.9214889109134674, "num_tokens": 12644400.0, "step": 1025 }, { "entropy": 1.374951332807541, "epoch": 0.5402843601895735, "grad_norm": 0.33436882495880127, "learning_rate": 0.00019895517513321125, "loss": 0.2343987077474594, "mean_token_accuracy": 0.9015287011861801, "num_tokens": 12656736.0, "step": 1026 }, { "entropy": 1.3473423719406128, "epoch": 0.540810953133228, "grad_norm": 0.30872446298599243, "learning_rate": 0.0001989518408680556, "loss": 0.23760074377059937, "mean_token_accuracy": 0.9077365547418594, "num_tokens": 12669072.0, "step": 1027 }, { "entropy": 1.4245812594890594, "epoch": 0.5413375460768826, "grad_norm": 0.32098084688186646, "learning_rate": 0.0001989485013223476, "loss": 0.22173723578453064, "mean_token_accuracy": 0.9116310328245163, "num_tokens": 12681408.0, "step": 1028 }, { "entropy": 1.357390284538269, "epoch": 0.5418641390205371, "grad_norm": 0.3540545701980591, "learning_rate": 0.0001989451564962855, "loss": 0.22398629784584045, "mean_token_accuracy": 0.914269283413887, "num_tokens": 12693744.0, "step": 1029 }, { "entropy": 1.4113155901432037, "epoch": 0.5423907319641916, "grad_norm": 0.3349270224571228, "learning_rate": 0.00019894180639006787, "loss": 0.23276042938232422, "mean_token_accuracy": 0.905420333147049, "num_tokens": 12706080.0, "step": 1030 }, { "entropy": 1.3748076260089874, "epoch": 0.5429173249078463, "grad_norm": 0.31247857213020325, "learning_rate": 0.0001989384510038936, "loss": 0.2479267716407776, "mean_token_accuracy": 0.8999170660972595, "num_tokens": 12718416.0, "step": 1031 }, { "entropy": 1.4230112135410309, "epoch": 0.5434439178515008, "grad_norm": 0.31677430868148804, "learning_rate": 0.0001989350903379619, "loss": 0.2388826310634613, "mean_token_accuracy": 0.9079335629940033, "num_tokens": 12730752.0, "step": 1032 }, { "entropy": 1.341791033744812, "epoch": 0.5439705107951553, "grad_norm": 0.30199915170669556, "learning_rate": 0.0001989317243924722, "loss": 0.21240849792957306, "mean_token_accuracy": 0.9131926447153091, "num_tokens": 12743088.0, "step": 1033 }, { "entropy": 1.3770472407341003, "epoch": 0.5444971037388099, "grad_norm": 0.28729885816574097, "learning_rate": 0.00019892835316762437, "loss": 0.20151323080062866, "mean_token_accuracy": 0.9193004071712494, "num_tokens": 12755424.0, "step": 1034 }, { "entropy": 1.3323063850402832, "epoch": 0.5450236966824644, "grad_norm": 0.3478204607963562, "learning_rate": 0.00019892497666361848, "loss": 0.22956590354442596, "mean_token_accuracy": 0.910034716129303, "num_tokens": 12767760.0, "step": 1035 }, { "entropy": 1.2777645885944366, "epoch": 0.545550289626119, "grad_norm": 0.32218146324157715, "learning_rate": 0.00019892159488065506, "loss": 0.2523505985736847, "mean_token_accuracy": 0.8999349474906921, "num_tokens": 12780096.0, "step": 1036 }, { "entropy": 1.3476167619228363, "epoch": 0.5460768825697736, "grad_norm": 0.3297399580478668, "learning_rate": 0.00019891820781893485, "loss": 0.24944739043712616, "mean_token_accuracy": 0.8990609049797058, "num_tokens": 12792432.0, "step": 1037 }, { "entropy": 1.3680584728717804, "epoch": 0.5466034755134281, "grad_norm": 0.31413063406944275, "learning_rate": 0.00019891481547865887, "loss": 0.23303711414337158, "mean_token_accuracy": 0.9072806537151337, "num_tokens": 12804768.0, "step": 1038 }, { "entropy": 1.2887639105319977, "epoch": 0.5471300684570827, "grad_norm": 0.30452004075050354, "learning_rate": 0.00019891141786002853, "loss": 0.20885013043880463, "mean_token_accuracy": 0.91634900867939, "num_tokens": 12817104.0, "step": 1039 }, { "entropy": 1.427742451429367, "epoch": 0.5476566614007372, "grad_norm": 0.3391040563583374, "learning_rate": 0.00019890801496324554, "loss": 0.21363744139671326, "mean_token_accuracy": 0.9168877154588699, "num_tokens": 12829440.0, "step": 1040 }, { "entropy": 1.4079940021038055, "epoch": 0.5481832543443917, "grad_norm": 0.34792712330818176, "learning_rate": 0.00019890460678851187, "loss": 0.23039647936820984, "mean_token_accuracy": 0.9067210853099823, "num_tokens": 12841776.0, "step": 1041 }, { "entropy": 1.362496793270111, "epoch": 0.5487098472880464, "grad_norm": 0.3340260684490204, "learning_rate": 0.00019890119333602988, "loss": 0.21935522556304932, "mean_token_accuracy": 0.9152266681194305, "num_tokens": 12854112.0, "step": 1042 }, { "entropy": 1.3945021033287048, "epoch": 0.5492364402317009, "grad_norm": 0.31123343110084534, "learning_rate": 0.00019889777460600221, "loss": 0.2165759801864624, "mean_token_accuracy": 0.9149927645921707, "num_tokens": 12866448.0, "step": 1043 }, { "entropy": 1.3361455798149109, "epoch": 0.5497630331753555, "grad_norm": 0.30849552154541016, "learning_rate": 0.0001988943505986318, "loss": 0.23334844410419464, "mean_token_accuracy": 0.9073198139667511, "num_tokens": 12878784.0, "step": 1044 }, { "entropy": 1.353363960981369, "epoch": 0.55028962611901, "grad_norm": 0.30394431948661804, "learning_rate": 0.00019889092131412188, "loss": 0.21873678267002106, "mean_token_accuracy": 0.9092230349779129, "num_tokens": 12891120.0, "step": 1045 }, { "entropy": 1.3730317652225494, "epoch": 0.5508162190626645, "grad_norm": 0.3051231801509857, "learning_rate": 0.0001988874867526761, "loss": 0.2074829638004303, "mean_token_accuracy": 0.9159383773803711, "num_tokens": 12903456.0, "step": 1046 }, { "entropy": 1.348529189825058, "epoch": 0.5513428120063191, "grad_norm": 0.34162041544914246, "learning_rate": 0.00019888404691449828, "loss": 0.20376741886138916, "mean_token_accuracy": 0.9213349372148514, "num_tokens": 12915792.0, "step": 1047 }, { "entropy": 1.3659497201442719, "epoch": 0.5518694049499737, "grad_norm": 0.3287021219730377, "learning_rate": 0.00019888060179979266, "loss": 0.22284625470638275, "mean_token_accuracy": 0.9160720854997635, "num_tokens": 12928128.0, "step": 1048 }, { "entropy": 1.39521923661232, "epoch": 0.5523959978936283, "grad_norm": 0.33031636476516724, "learning_rate": 0.00019887715140876373, "loss": 0.2400185465812683, "mean_token_accuracy": 0.9030187875032425, "num_tokens": 12940464.0, "step": 1049 }, { "entropy": 1.4470847249031067, "epoch": 0.5529225908372828, "grad_norm": 0.37168604135513306, "learning_rate": 0.00019887369574161633, "loss": 0.22982707619667053, "mean_token_accuracy": 0.9084116071462631, "num_tokens": 12952800.0, "step": 1050 }, { "entropy": 1.3384085595607758, "epoch": 0.5534491837809373, "grad_norm": 0.32396450638771057, "learning_rate": 0.00019887023479855565, "loss": 0.24000367522239685, "mean_token_accuracy": 0.9041632562875748, "num_tokens": 12965136.0, "step": 1051 }, { "entropy": 1.3531986474990845, "epoch": 0.5539757767245919, "grad_norm": 0.319603830575943, "learning_rate": 0.00019886676857978707, "loss": 0.23166413605213165, "mean_token_accuracy": 0.9047738164663315, "num_tokens": 12977472.0, "step": 1052 }, { "entropy": 1.3648565709590912, "epoch": 0.5545023696682464, "grad_norm": 0.3087165057659149, "learning_rate": 0.00019886329708551642, "loss": 0.21422043442726135, "mean_token_accuracy": 0.9170399606227875, "num_tokens": 12989808.0, "step": 1053 }, { "entropy": 1.4327314496040344, "epoch": 0.555028962611901, "grad_norm": 0.31154927611351013, "learning_rate": 0.00019885982031594973, "loss": 0.23706527054309845, "mean_token_accuracy": 0.9066223204135895, "num_tokens": 13002144.0, "step": 1054 }, { "entropy": 1.401264727115631, "epoch": 0.5555555555555556, "grad_norm": 0.30120137333869934, "learning_rate": 0.00019885633827129343, "loss": 0.21149972081184387, "mean_token_accuracy": 0.9169722944498062, "num_tokens": 13014480.0, "step": 1055 }, { "entropy": 1.4713716506958008, "epoch": 0.5560821484992101, "grad_norm": 0.39476147294044495, "learning_rate": 0.00019885285095175422, "loss": 0.26564526557922363, "mean_token_accuracy": 0.8999374806880951, "num_tokens": 13026816.0, "step": 1056 }, { "entropy": 1.4001291990280151, "epoch": 0.5566087414428647, "grad_norm": 0.3243412971496582, "learning_rate": 0.00019884935835753914, "loss": 0.2307104468345642, "mean_token_accuracy": 0.9069186598062515, "num_tokens": 13039152.0, "step": 1057 }, { "entropy": 1.4063750207424164, "epoch": 0.5571353343865192, "grad_norm": 0.3205982446670532, "learning_rate": 0.0001988458604888555, "loss": 0.2200152724981308, "mean_token_accuracy": 0.9117906540632248, "num_tokens": 13051488.0, "step": 1058 }, { "entropy": 1.4639129042625427, "epoch": 0.5576619273301737, "grad_norm": 0.35051432251930237, "learning_rate": 0.00019884235734591096, "loss": 0.21262915432453156, "mean_token_accuracy": 0.9155555963516235, "num_tokens": 13063824.0, "step": 1059 }, { "entropy": 1.3807141780853271, "epoch": 0.5581885202738284, "grad_norm": 0.31436532735824585, "learning_rate": 0.00019883884892891348, "loss": 0.23192916810512543, "mean_token_accuracy": 0.9132644683122635, "num_tokens": 13076160.0, "step": 1060 }, { "entropy": 1.4159002602100372, "epoch": 0.5587151132174829, "grad_norm": 0.35557860136032104, "learning_rate": 0.00019883533523807131, "loss": 0.2557951807975769, "mean_token_accuracy": 0.9019583463668823, "num_tokens": 13088496.0, "step": 1061 }, { "entropy": 1.4077826738357544, "epoch": 0.5592417061611374, "grad_norm": 0.35081014037132263, "learning_rate": 0.00019883181627359305, "loss": 0.21151600778102875, "mean_token_accuracy": 0.914755642414093, "num_tokens": 13100832.0, "step": 1062 }, { "entropy": 1.3742648661136627, "epoch": 0.559768299104792, "grad_norm": 0.28598442673683167, "learning_rate": 0.00019882829203568764, "loss": 0.21076026558876038, "mean_token_accuracy": 0.9148049652576447, "num_tokens": 13113168.0, "step": 1063 }, { "entropy": 1.4464651346206665, "epoch": 0.5602948920484465, "grad_norm": 0.29035648703575134, "learning_rate": 0.00019882476252456428, "loss": 0.20042768120765686, "mean_token_accuracy": 0.9182227253913879, "num_tokens": 13125504.0, "step": 1064 }, { "entropy": 1.3639024496078491, "epoch": 0.5608214849921012, "grad_norm": 0.3004502058029175, "learning_rate": 0.00019882122774043243, "loss": 0.2036202847957611, "mean_token_accuracy": 0.9217555373907089, "num_tokens": 13137840.0, "step": 1065 }, { "entropy": 1.3562072217464447, "epoch": 0.5613480779357557, "grad_norm": 0.29948773980140686, "learning_rate": 0.000198817687683502, "loss": 0.20943708717823029, "mean_token_accuracy": 0.9172091037034988, "num_tokens": 13150176.0, "step": 1066 }, { "entropy": 1.4171293675899506, "epoch": 0.5618746708794102, "grad_norm": 0.32766589522361755, "learning_rate": 0.00019881414235398313, "loss": 0.22548557817935944, "mean_token_accuracy": 0.9138119965791702, "num_tokens": 13162512.0, "step": 1067 }, { "entropy": 1.494034618139267, "epoch": 0.5624012638230648, "grad_norm": 0.3495429754257202, "learning_rate": 0.00019881059175208624, "loss": 0.24128882586956024, "mean_token_accuracy": 0.9064372777938843, "num_tokens": 13174848.0, "step": 1068 }, { "entropy": 1.4479554295539856, "epoch": 0.5629278567667193, "grad_norm": 0.3285626769065857, "learning_rate": 0.0001988070358780222, "loss": 0.1992790549993515, "mean_token_accuracy": 0.922189861536026, "num_tokens": 13187184.0, "step": 1069 }, { "entropy": 1.36091148853302, "epoch": 0.5634544497103738, "grad_norm": 0.29997125267982483, "learning_rate": 0.00019880347473200197, "loss": 0.19809836149215698, "mean_token_accuracy": 0.9212192296981812, "num_tokens": 13199520.0, "step": 1070 }, { "entropy": 1.4168705940246582, "epoch": 0.5639810426540285, "grad_norm": 0.320639044046402, "learning_rate": 0.0001987999083142371, "loss": 0.21112670004367828, "mean_token_accuracy": 0.9181769639253616, "num_tokens": 13211856.0, "step": 1071 }, { "entropy": 1.3809196650981903, "epoch": 0.564507635597683, "grad_norm": 0.36394959688186646, "learning_rate": 0.0001987963366249392, "loss": 0.23442226648330688, "mean_token_accuracy": 0.9071120172739029, "num_tokens": 13224192.0, "step": 1072 }, { "entropy": 1.3890978693962097, "epoch": 0.5650342285413376, "grad_norm": 0.34244871139526367, "learning_rate": 0.00019879275966432037, "loss": 0.22117844223976135, "mean_token_accuracy": 0.9115606546401978, "num_tokens": 13236528.0, "step": 1073 }, { "entropy": 1.3886411488056183, "epoch": 0.5655608214849921, "grad_norm": 0.35859042406082153, "learning_rate": 0.00019878917743259292, "loss": 0.21675634384155273, "mean_token_accuracy": 0.9194170236587524, "num_tokens": 13248864.0, "step": 1074 }, { "entropy": 1.4300493896007538, "epoch": 0.5660874144286466, "grad_norm": 0.34859365224838257, "learning_rate": 0.00019878558992996947, "loss": 0.24318671226501465, "mean_token_accuracy": 0.9037031382322311, "num_tokens": 13261200.0, "step": 1075 }, { "entropy": 1.3681704699993134, "epoch": 0.5666140073723012, "grad_norm": 0.3271603286266327, "learning_rate": 0.00019878199715666305, "loss": 0.2319377213716507, "mean_token_accuracy": 0.9129595458507538, "num_tokens": 13273536.0, "step": 1076 }, { "entropy": 1.395903766155243, "epoch": 0.5671406003159558, "grad_norm": 0.29173579812049866, "learning_rate": 0.00019877839911288693, "loss": 0.20177659392356873, "mean_token_accuracy": 0.9242661744356155, "num_tokens": 13285872.0, "step": 1077 }, { "entropy": 1.4401375949382782, "epoch": 0.5676671932596103, "grad_norm": 0.3181249499320984, "learning_rate": 0.0001987747957988547, "loss": 0.22763216495513916, "mean_token_accuracy": 0.907039076089859, "num_tokens": 13298208.0, "step": 1078 }, { "entropy": 1.3585200309753418, "epoch": 0.5681937862032649, "grad_norm": 0.2902856171131134, "learning_rate": 0.00019877118721478026, "loss": 0.19510802626609802, "mean_token_accuracy": 0.9210563600063324, "num_tokens": 13310544.0, "step": 1079 }, { "entropy": 1.3690218329429626, "epoch": 0.5687203791469194, "grad_norm": 0.31650200486183167, "learning_rate": 0.00019876757336087782, "loss": 0.23386812210083008, "mean_token_accuracy": 0.9065526723861694, "num_tokens": 13322880.0, "step": 1080 }, { "entropy": 1.4170444905757904, "epoch": 0.569246972090574, "grad_norm": 0.39458808302879333, "learning_rate": 0.00019876395423736192, "loss": 0.21256215870380402, "mean_token_accuracy": 0.9154652059078217, "num_tokens": 13335216.0, "step": 1081 }, { "entropy": 1.3711142838001251, "epoch": 0.5697735650342285, "grad_norm": 0.3102315366268158, "learning_rate": 0.00019876032984444744, "loss": 0.2107260674238205, "mean_token_accuracy": 0.9209572970867157, "num_tokens": 13347552.0, "step": 1082 }, { "entropy": 1.3468361794948578, "epoch": 0.5703001579778831, "grad_norm": 0.3204945921897888, "learning_rate": 0.00019875670018234946, "loss": 0.21677452325820923, "mean_token_accuracy": 0.9137840569019318, "num_tokens": 13359888.0, "step": 1083 }, { "entropy": 1.3397773206233978, "epoch": 0.5708267509215377, "grad_norm": 0.30542871356010437, "learning_rate": 0.00019875306525128354, "loss": 0.20801898837089539, "mean_token_accuracy": 0.9187730103731155, "num_tokens": 13372224.0, "step": 1084 }, { "entropy": 1.3542706668376923, "epoch": 0.5713533438651922, "grad_norm": 0.39070987701416016, "learning_rate": 0.00019874942505146542, "loss": 0.23829345405101776, "mean_token_accuracy": 0.9077901542186737, "num_tokens": 13384560.0, "step": 1085 }, { "entropy": 1.3789608180522919, "epoch": 0.5718799368088467, "grad_norm": 0.31589949131011963, "learning_rate": 0.00019874577958311124, "loss": 0.23594669997692108, "mean_token_accuracy": 0.9101516306400299, "num_tokens": 13396896.0, "step": 1086 }, { "entropy": 1.2831343114376068, "epoch": 0.5724065297525013, "grad_norm": 0.31056761741638184, "learning_rate": 0.00019874212884643733, "loss": 0.22809851169586182, "mean_token_accuracy": 0.9048083126544952, "num_tokens": 13409232.0, "step": 1087 }, { "entropy": 1.343775451183319, "epoch": 0.5729331226961558, "grad_norm": 0.35355332493782043, "learning_rate": 0.00019873847284166047, "loss": 0.24591763317584991, "mean_token_accuracy": 0.9045094102621078, "num_tokens": 13421568.0, "step": 1088 }, { "entropy": 1.3326263129711151, "epoch": 0.5734597156398105, "grad_norm": 0.30252182483673096, "learning_rate": 0.00019873481156899769, "loss": 0.2264258861541748, "mean_token_accuracy": 0.9123017936944962, "num_tokens": 13433904.0, "step": 1089 }, { "entropy": 1.4111762046813965, "epoch": 0.573986308583465, "grad_norm": 0.30441656708717346, "learning_rate": 0.00019873114502866633, "loss": 0.20945101976394653, "mean_token_accuracy": 0.9133919775485992, "num_tokens": 13446240.0, "step": 1090 }, { "entropy": 1.3507026731967926, "epoch": 0.5745129015271195, "grad_norm": 0.29725486040115356, "learning_rate": 0.00019872747322088405, "loss": 0.22033721208572388, "mean_token_accuracy": 0.9093347936868668, "num_tokens": 13458576.0, "step": 1091 }, { "entropy": 1.3604736626148224, "epoch": 0.5750394944707741, "grad_norm": 0.2988698482513428, "learning_rate": 0.00019872379614586884, "loss": 0.20934537053108215, "mean_token_accuracy": 0.919558510184288, "num_tokens": 13470912.0, "step": 1092 }, { "entropy": 1.2718960344791412, "epoch": 0.5755660874144286, "grad_norm": 0.296278178691864, "learning_rate": 0.00019872011380383896, "loss": 0.2263902723789215, "mean_token_accuracy": 0.9120451807975769, "num_tokens": 13483248.0, "step": 1093 }, { "entropy": 1.3046118319034576, "epoch": 0.5760926803580833, "grad_norm": 0.2931486666202545, "learning_rate": 0.00019871642619501302, "loss": 0.22945842146873474, "mean_token_accuracy": 0.9100485295057297, "num_tokens": 13495584.0, "step": 1094 }, { "entropy": 1.3241084516048431, "epoch": 0.5766192733017378, "grad_norm": 0.3063081204891205, "learning_rate": 0.00019871273331960996, "loss": 0.2523494362831116, "mean_token_accuracy": 0.9037816673517227, "num_tokens": 13507920.0, "step": 1095 }, { "entropy": 1.3798290491104126, "epoch": 0.5771458662453923, "grad_norm": 0.3451617956161499, "learning_rate": 0.00019870903517784898, "loss": 0.2181454300880432, "mean_token_accuracy": 0.9167459905147552, "num_tokens": 13520256.0, "step": 1096 }, { "entropy": 1.292254477739334, "epoch": 0.5776724591890469, "grad_norm": 0.29267409443855286, "learning_rate": 0.0001987053317699496, "loss": 0.2220621407032013, "mean_token_accuracy": 0.9128179252147675, "num_tokens": 13532592.0, "step": 1097 }, { "entropy": 1.2694779932498932, "epoch": 0.5781990521327014, "grad_norm": 0.2939811646938324, "learning_rate": 0.0001987016230961317, "loss": 0.21204796433448792, "mean_token_accuracy": 0.9153830707073212, "num_tokens": 13544928.0, "step": 1098 }, { "entropy": 1.301151692867279, "epoch": 0.5787256450763559, "grad_norm": 0.3276446461677551, "learning_rate": 0.0001986979091566154, "loss": 0.20669840276241302, "mean_token_accuracy": 0.9193602800369263, "num_tokens": 13557264.0, "step": 1099 }, { "entropy": 1.2780292332172394, "epoch": 0.5792522380200106, "grad_norm": 0.31635478138923645, "learning_rate": 0.00019869418995162124, "loss": 0.22475430369377136, "mean_token_accuracy": 0.9149479269981384, "num_tokens": 13569600.0, "step": 1100 }, { "entropy": 1.3376207053661346, "epoch": 0.5797788309636651, "grad_norm": 0.3281361162662506, "learning_rate": 0.00019869046548136996, "loss": 0.2165728509426117, "mean_token_accuracy": 0.9121999144554138, "num_tokens": 13581936.0, "step": 1101 }, { "entropy": 1.2792271375656128, "epoch": 0.5803054239073197, "grad_norm": 0.34059932827949524, "learning_rate": 0.00019868673574608266, "loss": 0.2282489687204361, "mean_token_accuracy": 0.9086829572916031, "num_tokens": 13594272.0, "step": 1102 }, { "entropy": 1.312345266342163, "epoch": 0.5808320168509742, "grad_norm": 0.3228605389595032, "learning_rate": 0.00019868300074598076, "loss": 0.22286418080329895, "mean_token_accuracy": 0.912465900182724, "num_tokens": 13606608.0, "step": 1103 }, { "entropy": 1.3179580569267273, "epoch": 0.5813586097946287, "grad_norm": 0.3180788457393646, "learning_rate": 0.000198679260481286, "loss": 0.2119407206773758, "mean_token_accuracy": 0.9113909304141998, "num_tokens": 13618944.0, "step": 1104 }, { "entropy": 1.3403850197792053, "epoch": 0.5818852027382833, "grad_norm": 0.3467418849468231, "learning_rate": 0.00019867551495222042, "loss": 0.23494362831115723, "mean_token_accuracy": 0.9045893847942352, "num_tokens": 13631280.0, "step": 1105 }, { "entropy": 1.3972817361354828, "epoch": 0.5824117956819379, "grad_norm": 0.289737343788147, "learning_rate": 0.00019867176415900635, "loss": 0.22767332196235657, "mean_token_accuracy": 0.9065064936876297, "num_tokens": 13643616.0, "step": 1106 }, { "entropy": 1.3646803498268127, "epoch": 0.5829383886255924, "grad_norm": 0.30822867155075073, "learning_rate": 0.00019866800810186644, "loss": 0.22304248809814453, "mean_token_accuracy": 0.9127557724714279, "num_tokens": 13655952.0, "step": 1107 }, { "entropy": 1.3917404413223267, "epoch": 0.583464981569247, "grad_norm": 0.3238813579082489, "learning_rate": 0.0001986642467810237, "loss": 0.23602177202701569, "mean_token_accuracy": 0.9076020121574402, "num_tokens": 13668288.0, "step": 1108 }, { "entropy": 1.4159584939479828, "epoch": 0.5839915745129015, "grad_norm": 0.3269672989845276, "learning_rate": 0.00019866048019670144, "loss": 0.22922644019126892, "mean_token_accuracy": 0.9118731915950775, "num_tokens": 13680624.0, "step": 1109 }, { "entropy": 1.426487773656845, "epoch": 0.584518167456556, "grad_norm": 0.33397728204727173, "learning_rate": 0.00019865670834912316, "loss": 0.21286353468894958, "mean_token_accuracy": 0.921152800321579, "num_tokens": 13692960.0, "step": 1110 }, { "entropy": 1.4119893908500671, "epoch": 0.5850447604002106, "grad_norm": 0.29753443598747253, "learning_rate": 0.00019865293123851288, "loss": 0.2373121976852417, "mean_token_accuracy": 0.9035847336053848, "num_tokens": 13705296.0, "step": 1111 }, { "entropy": 1.380676507949829, "epoch": 0.5855713533438652, "grad_norm": 0.2954482436180115, "learning_rate": 0.00019864914886509475, "loss": 0.21925240755081177, "mean_token_accuracy": 0.9149321764707565, "num_tokens": 13717632.0, "step": 1112 }, { "entropy": 1.382420837879181, "epoch": 0.5860979462875198, "grad_norm": 0.3165317177772522, "learning_rate": 0.00019864536122909336, "loss": 0.20962990820407867, "mean_token_accuracy": 0.9176686257123947, "num_tokens": 13729968.0, "step": 1113 }, { "entropy": 1.4016212224960327, "epoch": 0.5866245392311743, "grad_norm": 0.3741922974586487, "learning_rate": 0.00019864156833073352, "loss": 0.21471966803073883, "mean_token_accuracy": 0.9138137102127075, "num_tokens": 13742304.0, "step": 1114 }, { "entropy": 1.330253154039383, "epoch": 0.5871511321748288, "grad_norm": 0.30213749408721924, "learning_rate": 0.00019863777017024042, "loss": 0.21769596636295319, "mean_token_accuracy": 0.9100621193647385, "num_tokens": 13754640.0, "step": 1115 }, { "entropy": 1.353569656610489, "epoch": 0.5876777251184834, "grad_norm": 0.37241899967193604, "learning_rate": 0.00019863396674783953, "loss": 0.2180408537387848, "mean_token_accuracy": 0.9123483598232269, "num_tokens": 13766976.0, "step": 1116 }, { "entropy": 1.3220522999763489, "epoch": 0.588204318062138, "grad_norm": 0.33360689878463745, "learning_rate": 0.00019863015806375662, "loss": 0.21166455745697021, "mean_token_accuracy": 0.9151635468006134, "num_tokens": 13779312.0, "step": 1117 }, { "entropy": 1.4124476611614227, "epoch": 0.5887309110057926, "grad_norm": 0.35278213024139404, "learning_rate": 0.0001986263441182178, "loss": 0.24385729432106018, "mean_token_accuracy": 0.9091434925794601, "num_tokens": 13791648.0, "step": 1118 }, { "entropy": 1.3624746203422546, "epoch": 0.5892575039494471, "grad_norm": 0.303867906332016, "learning_rate": 0.00019862252491144954, "loss": 0.20682811737060547, "mean_token_accuracy": 0.9137058258056641, "num_tokens": 13803984.0, "step": 1119 }, { "entropy": 1.4214110970497131, "epoch": 0.5897840968931016, "grad_norm": 0.29519587755203247, "learning_rate": 0.00019861870044367844, "loss": 0.1955740600824356, "mean_token_accuracy": 0.9222785979509354, "num_tokens": 13816320.0, "step": 1120 }, { "entropy": 1.332068532705307, "epoch": 0.5903106898367562, "grad_norm": 0.31455355882644653, "learning_rate": 0.0001986148707151316, "loss": 0.22069820761680603, "mean_token_accuracy": 0.9075255244970322, "num_tokens": 13828656.0, "step": 1121 }, { "entropy": 1.288136750459671, "epoch": 0.5908372827804107, "grad_norm": 0.3047003448009491, "learning_rate": 0.0001986110357260364, "loss": 0.23481610417366028, "mean_token_accuracy": 0.9039241820573807, "num_tokens": 13840992.0, "step": 1122 }, { "entropy": 1.3215467631816864, "epoch": 0.5913638757240653, "grad_norm": 0.2980950176715851, "learning_rate": 0.0001986071954766205, "loss": 0.20938631892204285, "mean_token_accuracy": 0.9155066460371017, "num_tokens": 13853328.0, "step": 1123 }, { "entropy": 1.3901076912879944, "epoch": 0.5918904686677199, "grad_norm": 0.3429953455924988, "learning_rate": 0.0001986033499671118, "loss": 0.24023953080177307, "mean_token_accuracy": 0.9067379236221313, "num_tokens": 13865664.0, "step": 1124 }, { "entropy": 1.3358671963214874, "epoch": 0.5924170616113744, "grad_norm": 0.2808769643306732, "learning_rate": 0.00019859949919773866, "loss": 0.20975762605667114, "mean_token_accuracy": 0.9166984409093857, "num_tokens": 13878000.0, "step": 1125 }, { "entropy": 1.3196144104003906, "epoch": 0.592943654555029, "grad_norm": 0.3139532506465912, "learning_rate": 0.0001985956431687296, "loss": 0.23033276200294495, "mean_token_accuracy": 0.9116202145814896, "num_tokens": 13890336.0, "step": 1126 }, { "entropy": 1.3117577731609344, "epoch": 0.5934702474986835, "grad_norm": 0.27732840180397034, "learning_rate": 0.0001985917818803136, "loss": 0.20888479053974152, "mean_token_accuracy": 0.9136437624692917, "num_tokens": 13902672.0, "step": 1127 }, { "entropy": 1.3565605282783508, "epoch": 0.593996840442338, "grad_norm": 0.3072391152381897, "learning_rate": 0.00019858791533271993, "loss": 0.2347339540719986, "mean_token_accuracy": 0.9031410962343216, "num_tokens": 13915008.0, "step": 1128 }, { "entropy": 1.3418332636356354, "epoch": 0.5945234333859927, "grad_norm": 0.306152880191803, "learning_rate": 0.000198584043526178, "loss": 0.21512483060359955, "mean_token_accuracy": 0.913850799202919, "num_tokens": 13927344.0, "step": 1129 }, { "entropy": 1.2864646911621094, "epoch": 0.5950500263296472, "grad_norm": 0.272443026304245, "learning_rate": 0.0001985801664609177, "loss": 0.19553211331367493, "mean_token_accuracy": 0.9215691983699799, "num_tokens": 13939680.0, "step": 1130 }, { "entropy": 1.3621837496757507, "epoch": 0.5955766192733017, "grad_norm": 0.30602437257766724, "learning_rate": 0.00019857628413716923, "loss": 0.2275530993938446, "mean_token_accuracy": 0.9101060777902603, "num_tokens": 13952016.0, "step": 1131 }, { "entropy": 1.3566639721393585, "epoch": 0.5961032122169563, "grad_norm": 0.3048968017101288, "learning_rate": 0.00019857239655516302, "loss": 0.20348000526428223, "mean_token_accuracy": 0.9176989495754242, "num_tokens": 13964352.0, "step": 1132 }, { "entropy": 1.3097732663154602, "epoch": 0.5966298051606108, "grad_norm": 0.2780429720878601, "learning_rate": 0.00019856850371512987, "loss": 0.21352221071720123, "mean_token_accuracy": 0.9180653989315033, "num_tokens": 13976688.0, "step": 1133 }, { "entropy": 1.3601540923118591, "epoch": 0.5971563981042654, "grad_norm": 0.28900468349456787, "learning_rate": 0.00019856460561730086, "loss": 0.21711350977420807, "mean_token_accuracy": 0.9169211685657501, "num_tokens": 13989024.0, "step": 1134 }, { "entropy": 1.3538919687271118, "epoch": 0.59768299104792, "grad_norm": 0.34999901056289673, "learning_rate": 0.00019856070226190745, "loss": 0.24132667481899261, "mean_token_accuracy": 0.9076129645109177, "num_tokens": 14001360.0, "step": 1135 }, { "entropy": 1.3285188376903534, "epoch": 0.5982095839915745, "grad_norm": 0.3087072968482971, "learning_rate": 0.00019855679364918125, "loss": 0.21430730819702148, "mean_token_accuracy": 0.911715641617775, "num_tokens": 14013696.0, "step": 1136 }, { "entropy": 1.3584640622138977, "epoch": 0.5987361769352291, "grad_norm": 0.34012794494628906, "learning_rate": 0.00019855287977935438, "loss": 0.22795352339744568, "mean_token_accuracy": 0.9065137207508087, "num_tokens": 14026032.0, "step": 1137 }, { "entropy": 1.337429255247116, "epoch": 0.5992627698788836, "grad_norm": 0.30005964636802673, "learning_rate": 0.0001985489606526592, "loss": 0.22258292138576508, "mean_token_accuracy": 0.9104499816894531, "num_tokens": 14038368.0, "step": 1138 }, { "entropy": 1.3470830917358398, "epoch": 0.5997893628225381, "grad_norm": 0.33669254183769226, "learning_rate": 0.0001985450362693283, "loss": 0.24716174602508545, "mean_token_accuracy": 0.9071019142866135, "num_tokens": 14050704.0, "step": 1139 }, { "entropy": 1.3219377994537354, "epoch": 0.6003159557661928, "grad_norm": 0.28407081961631775, "learning_rate": 0.0001985411066295947, "loss": 0.2014906108379364, "mean_token_accuracy": 0.9218366146087646, "num_tokens": 14063040.0, "step": 1140 }, { "entropy": 1.3444631695747375, "epoch": 0.6008425487098473, "grad_norm": 0.3870190978050232, "learning_rate": 0.00019853717173369163, "loss": 0.231156125664711, "mean_token_accuracy": 0.9088256508111954, "num_tokens": 14075376.0, "step": 1141 }, { "entropy": 1.308059424161911, "epoch": 0.6013691416535019, "grad_norm": 0.2819710373878479, "learning_rate": 0.0001985332315818527, "loss": 0.20217713713645935, "mean_token_accuracy": 0.9211951047182083, "num_tokens": 14087712.0, "step": 1142 }, { "entropy": 1.3603175282478333, "epoch": 0.6018957345971564, "grad_norm": 0.2916105389595032, "learning_rate": 0.00019852928617431186, "loss": 0.21151602268218994, "mean_token_accuracy": 0.9143334627151489, "num_tokens": 14100048.0, "step": 1143 }, { "entropy": 1.4045506119728088, "epoch": 0.6024223275408109, "grad_norm": 0.33014437556266785, "learning_rate": 0.00019852533551130324, "loss": 0.2289315164089203, "mean_token_accuracy": 0.9064499735832214, "num_tokens": 14112384.0, "step": 1144 }, { "entropy": 1.3394192457199097, "epoch": 0.6029489204844655, "grad_norm": 0.28447818756103516, "learning_rate": 0.00019852137959306144, "loss": 0.21860811114311218, "mean_token_accuracy": 0.9082520753145218, "num_tokens": 14124720.0, "step": 1145 }, { "entropy": 1.391217827796936, "epoch": 0.6034755134281201, "grad_norm": 0.28422555327415466, "learning_rate": 0.00019851741841982128, "loss": 0.19729138910770416, "mean_token_accuracy": 0.9245949536561966, "num_tokens": 14137056.0, "step": 1146 }, { "entropy": 1.3858129382133484, "epoch": 0.6040021063717746, "grad_norm": 0.29647180438041687, "learning_rate": 0.00019851345199181793, "loss": 0.22420856356620789, "mean_token_accuracy": 0.9095530211925507, "num_tokens": 14149392.0, "step": 1147 }, { "entropy": 1.3382080793380737, "epoch": 0.6045286993154292, "grad_norm": 0.3809289336204529, "learning_rate": 0.0001985094803092868, "loss": 0.23012962937355042, "mean_token_accuracy": 0.9103907644748688, "num_tokens": 14161728.0, "step": 1148 }, { "entropy": 1.252241313457489, "epoch": 0.6050552922590837, "grad_norm": 0.28908881545066833, "learning_rate": 0.00019850550337246366, "loss": 0.21694348752498627, "mean_token_accuracy": 0.9180784374475479, "num_tokens": 14174064.0, "step": 1149 }, { "entropy": 1.3115107417106628, "epoch": 0.6055818852027383, "grad_norm": 0.30919113755226135, "learning_rate": 0.00019850152118158472, "loss": 0.22491689026355743, "mean_token_accuracy": 0.9089210480451584, "num_tokens": 14186400.0, "step": 1150 }, { "entropy": 1.2686559855937958, "epoch": 0.6061084781463928, "grad_norm": 0.27780571579933167, "learning_rate": 0.0001984975337368862, "loss": 0.18563629686832428, "mean_token_accuracy": 0.9245605766773224, "num_tokens": 14198736.0, "step": 1151 }, { "entropy": 1.272880494594574, "epoch": 0.6066350710900474, "grad_norm": 0.31458860635757446, "learning_rate": 0.00019849354103860495, "loss": 0.21442924439907074, "mean_token_accuracy": 0.9128790646791458, "num_tokens": 14211072.0, "step": 1152 }, { "entropy": 1.2540790140628815, "epoch": 0.607161664033702, "grad_norm": 0.32044321298599243, "learning_rate": 0.000198489543086978, "loss": 0.20413605868816376, "mean_token_accuracy": 0.9179537445306778, "num_tokens": 14223408.0, "step": 1153 }, { "entropy": 1.3018059134483337, "epoch": 0.6076882569773565, "grad_norm": 0.3418496251106262, "learning_rate": 0.00019848553988224254, "loss": 0.2165253758430481, "mean_token_accuracy": 0.9125253260135651, "num_tokens": 14235744.0, "step": 1154 }, { "entropy": 1.2327319979667664, "epoch": 0.608214849921011, "grad_norm": 0.3597237467765808, "learning_rate": 0.0001984815314246364, "loss": 0.235613614320755, "mean_token_accuracy": 0.9087760597467422, "num_tokens": 14248080.0, "step": 1155 }, { "entropy": 1.3383413255214691, "epoch": 0.6087414428646656, "grad_norm": 0.36206018924713135, "learning_rate": 0.00019847751771439738, "loss": 0.2203393429517746, "mean_token_accuracy": 0.9124666899442673, "num_tokens": 14260416.0, "step": 1156 }, { "entropy": 1.2537713646888733, "epoch": 0.6092680358083201, "grad_norm": 0.314043253660202, "learning_rate": 0.00019847349875176383, "loss": 0.18635031580924988, "mean_token_accuracy": 0.924136608839035, "num_tokens": 14272752.0, "step": 1157 }, { "entropy": 1.2804813086986542, "epoch": 0.6097946287519748, "grad_norm": 0.3333822786808014, "learning_rate": 0.00019846947453697436, "loss": 0.24032224714756012, "mean_token_accuracy": 0.9084908664226532, "num_tokens": 14285088.0, "step": 1158 }, { "entropy": 1.2433983385562897, "epoch": 0.6103212216956293, "grad_norm": 0.3367704451084137, "learning_rate": 0.0001984654450702678, "loss": 0.21996420621871948, "mean_token_accuracy": 0.9129030555486679, "num_tokens": 14297424.0, "step": 1159 }, { "entropy": 1.2872591018676758, "epoch": 0.6108478146392838, "grad_norm": 0.3126697838306427, "learning_rate": 0.00019846141035188334, "loss": 0.22938281297683716, "mean_token_accuracy": 0.9084669649600983, "num_tokens": 14309760.0, "step": 1160 }, { "entropy": 1.2282376289367676, "epoch": 0.6113744075829384, "grad_norm": 0.3045027554035187, "learning_rate": 0.0001984573703820606, "loss": 0.21839705109596252, "mean_token_accuracy": 0.9129580110311508, "num_tokens": 14322096.0, "step": 1161 }, { "entropy": 1.296276867389679, "epoch": 0.6119010005265929, "grad_norm": 0.3050879240036011, "learning_rate": 0.00019845332516103933, "loss": 0.21910154819488525, "mean_token_accuracy": 0.9160716086626053, "num_tokens": 14334432.0, "step": 1162 }, { "entropy": 1.2552114129066467, "epoch": 0.6124275934702474, "grad_norm": 0.3606356978416443, "learning_rate": 0.0001984492746890597, "loss": 0.23291565477848053, "mean_token_accuracy": 0.9024920612573624, "num_tokens": 14346768.0, "step": 1163 }, { "entropy": 1.2350418269634247, "epoch": 0.6129541864139021, "grad_norm": 0.30588603019714355, "learning_rate": 0.00019844521896636213, "loss": 0.22299546003341675, "mean_token_accuracy": 0.9098654091358185, "num_tokens": 14359104.0, "step": 1164 }, { "entropy": 1.2168787717819214, "epoch": 0.6134807793575566, "grad_norm": 0.30036792159080505, "learning_rate": 0.00019844115799318743, "loss": 0.2024330198764801, "mean_token_accuracy": 0.9177137911319733, "num_tokens": 14371440.0, "step": 1165 }, { "entropy": 1.2549520134925842, "epoch": 0.6140073723012112, "grad_norm": 0.38305899500846863, "learning_rate": 0.00019843709176977666, "loss": 0.2291533648967743, "mean_token_accuracy": 0.912639394402504, "num_tokens": 14383776.0, "step": 1166 }, { "entropy": 1.235708236694336, "epoch": 0.6145339652448657, "grad_norm": 0.34467607736587524, "learning_rate": 0.0001984330202963712, "loss": 0.22410570085048676, "mean_token_accuracy": 0.9121714979410172, "num_tokens": 14396112.0, "step": 1167 }, { "entropy": 1.1345283687114716, "epoch": 0.6150605581885202, "grad_norm": 0.3024910092353821, "learning_rate": 0.0001984289435732127, "loss": 0.22202812135219574, "mean_token_accuracy": 0.913068488240242, "num_tokens": 14408448.0, "step": 1168 }, { "entropy": 1.154352843761444, "epoch": 0.6155871511321749, "grad_norm": 0.3543850779533386, "learning_rate": 0.00019842486160054327, "loss": 0.24754247069358826, "mean_token_accuracy": 0.9041948169469833, "num_tokens": 14420784.0, "step": 1169 }, { "entropy": 1.1256769597530365, "epoch": 0.6161137440758294, "grad_norm": 0.31246209144592285, "learning_rate": 0.00019842077437860517, "loss": 0.23024949431419373, "mean_token_accuracy": 0.9097237884998322, "num_tokens": 14433120.0, "step": 1170 }, { "entropy": 1.2304538488388062, "epoch": 0.616640337019484, "grad_norm": 0.35418546199798584, "learning_rate": 0.00019841668190764106, "loss": 0.23257943987846375, "mean_token_accuracy": 0.9058277457952499, "num_tokens": 14445456.0, "step": 1171 }, { "entropy": 1.1736994087696075, "epoch": 0.6171669299631385, "grad_norm": 0.29421883821487427, "learning_rate": 0.0001984125841878939, "loss": 0.2265184223651886, "mean_token_accuracy": 0.9127582311630249, "num_tokens": 14457792.0, "step": 1172 }, { "entropy": 1.210179328918457, "epoch": 0.617693522906793, "grad_norm": 0.3278239667415619, "learning_rate": 0.0001984084812196069, "loss": 0.2220735400915146, "mean_token_accuracy": 0.9109156280755997, "num_tokens": 14470128.0, "step": 1173 }, { "entropy": 1.1588793694972992, "epoch": 0.6182201158504476, "grad_norm": 0.27815452218055725, "learning_rate": 0.00019840437300302366, "loss": 0.22251342236995697, "mean_token_accuracy": 0.9095259606838226, "num_tokens": 14482464.0, "step": 1174 }, { "entropy": 1.1791687309741974, "epoch": 0.6187467087941022, "grad_norm": 0.2694774270057678, "learning_rate": 0.00019840025953838804, "loss": 0.2061459869146347, "mean_token_accuracy": 0.9203435033559799, "num_tokens": 14494800.0, "step": 1175 }, { "entropy": 1.1984158754348755, "epoch": 0.6192733017377567, "grad_norm": 0.29139313101768494, "learning_rate": 0.00019839614082594424, "loss": 0.22982501983642578, "mean_token_accuracy": 0.911991760134697, "num_tokens": 14507136.0, "step": 1176 }, { "entropy": 1.1957634687423706, "epoch": 0.6197998946814113, "grad_norm": 0.2952525019645691, "learning_rate": 0.0001983920168659368, "loss": 0.20150825381278992, "mean_token_accuracy": 0.9190460294485092, "num_tokens": 14519472.0, "step": 1177 }, { "entropy": 1.2356001436710358, "epoch": 0.6203264876250658, "grad_norm": 0.3485545516014099, "learning_rate": 0.0001983878876586105, "loss": 0.22730165719985962, "mean_token_accuracy": 0.9079895615577698, "num_tokens": 14531808.0, "step": 1178 }, { "entropy": 1.2191669344902039, "epoch": 0.6208530805687204, "grad_norm": 0.31337442994117737, "learning_rate": 0.00019838375320421046, "loss": 0.2090841382741928, "mean_token_accuracy": 0.9179579317569733, "num_tokens": 14544144.0, "step": 1179 }, { "entropy": 1.1627593338489532, "epoch": 0.6213796735123749, "grad_norm": 0.3373863995075226, "learning_rate": 0.00019837961350298213, "loss": 0.22159543633460999, "mean_token_accuracy": 0.9035765677690506, "num_tokens": 14556480.0, "step": 1180 }, { "entropy": 1.244479089975357, "epoch": 0.6219062664560295, "grad_norm": 0.2939426898956299, "learning_rate": 0.0001983754685551713, "loss": 0.20940116047859192, "mean_token_accuracy": 0.9177102446556091, "num_tokens": 14568816.0, "step": 1181 }, { "entropy": 1.2316089570522308, "epoch": 0.6224328593996841, "grad_norm": 0.3053775727748871, "learning_rate": 0.00019837131836102396, "loss": 0.21764273941516876, "mean_token_accuracy": 0.9150272458791733, "num_tokens": 14581152.0, "step": 1182 }, { "entropy": 1.2752362787723541, "epoch": 0.6229594523433386, "grad_norm": 0.3304329812526703, "learning_rate": 0.00019836716292078647, "loss": 0.23420026898384094, "mean_token_accuracy": 0.9085260033607483, "num_tokens": 14593488.0, "step": 1183 }, { "entropy": 1.2659085094928741, "epoch": 0.6234860452869931, "grad_norm": 0.3893950879573822, "learning_rate": 0.00019836300223470562, "loss": 0.2608282268047333, "mean_token_accuracy": 0.9021032303571701, "num_tokens": 14605824.0, "step": 1184 }, { "entropy": 1.3032302856445312, "epoch": 0.6240126382306477, "grad_norm": 0.3007699251174927, "learning_rate": 0.00019835883630302836, "loss": 0.20315539836883545, "mean_token_accuracy": 0.9167050868272781, "num_tokens": 14618160.0, "step": 1185 }, { "entropy": 1.2084311544895172, "epoch": 0.6245392311743022, "grad_norm": 0.32948681712150574, "learning_rate": 0.00019835466512600197, "loss": 0.23484407365322113, "mean_token_accuracy": 0.9104520976543427, "num_tokens": 14630496.0, "step": 1186 }, { "entropy": 1.2006751894950867, "epoch": 0.6250658241179569, "grad_norm": 0.2981775104999542, "learning_rate": 0.00019835048870387405, "loss": 0.22286085784435272, "mean_token_accuracy": 0.9095976203680038, "num_tokens": 14642832.0, "step": 1187 }, { "entropy": 1.3096867799758911, "epoch": 0.6255924170616114, "grad_norm": 0.3300210237503052, "learning_rate": 0.0001983463070368926, "loss": 0.22102200984954834, "mean_token_accuracy": 0.9119229018688202, "num_tokens": 14655168.0, "step": 1188 }, { "entropy": 1.2840961813926697, "epoch": 0.6261190100052659, "grad_norm": 0.31997406482696533, "learning_rate": 0.00019834212012530579, "loss": 0.23797491192817688, "mean_token_accuracy": 0.9043692797422409, "num_tokens": 14667504.0, "step": 1189 }, { "entropy": 1.2393836975097656, "epoch": 0.6266456029489205, "grad_norm": 0.30698251724243164, "learning_rate": 0.00019833792796936222, "loss": 0.20287004113197327, "mean_token_accuracy": 0.9166252613067627, "num_tokens": 14679840.0, "step": 1190 }, { "entropy": 1.3439719676971436, "epoch": 0.627172195892575, "grad_norm": 0.32229262590408325, "learning_rate": 0.00019833373056931072, "loss": 0.23332646489143372, "mean_token_accuracy": 0.9090562462806702, "num_tokens": 14692176.0, "step": 1191 }, { "entropy": 1.2390953600406647, "epoch": 0.6276987888362296, "grad_norm": 0.3261661231517792, "learning_rate": 0.00019832952792540054, "loss": 0.22384727001190186, "mean_token_accuracy": 0.9121635258197784, "num_tokens": 14704512.0, "step": 1192 }, { "entropy": 1.3028371036052704, "epoch": 0.6282253817798842, "grad_norm": 0.31324324011802673, "learning_rate": 0.00019832532003788108, "loss": 0.2185819447040558, "mean_token_accuracy": 0.9167534857988358, "num_tokens": 14716848.0, "step": 1193 }, { "entropy": 1.1885470747947693, "epoch": 0.6287519747235387, "grad_norm": 0.46663784980773926, "learning_rate": 0.00019832110690700213, "loss": 0.21501871943473816, "mean_token_accuracy": 0.9109776020050049, "num_tokens": 14729184.0, "step": 1194 }, { "entropy": 1.2453204691410065, "epoch": 0.6292785676671933, "grad_norm": 0.3183780014514923, "learning_rate": 0.00019831688853301388, "loss": 0.22543299198150635, "mean_token_accuracy": 0.910496860742569, "num_tokens": 14741520.0, "step": 1195 }, { "entropy": 1.2583057284355164, "epoch": 0.6298051606108478, "grad_norm": 0.3381344676017761, "learning_rate": 0.0001983126649161667, "loss": 0.214624285697937, "mean_token_accuracy": 0.9137195497751236, "num_tokens": 14753856.0, "step": 1196 }, { "entropy": 1.2429248094558716, "epoch": 0.6303317535545023, "grad_norm": 0.30227339267730713, "learning_rate": 0.00019830843605671131, "loss": 0.2062695324420929, "mean_token_accuracy": 0.9234135448932648, "num_tokens": 14766192.0, "step": 1197 }, { "entropy": 1.220680981874466, "epoch": 0.630858346498157, "grad_norm": 0.3083505630493164, "learning_rate": 0.00019830420195489877, "loss": 0.2090727537870407, "mean_token_accuracy": 0.9170975387096405, "num_tokens": 14778528.0, "step": 1198 }, { "entropy": 1.248794138431549, "epoch": 0.6313849394418115, "grad_norm": 0.3802277743816376, "learning_rate": 0.00019829996261098046, "loss": 0.2367159128189087, "mean_token_accuracy": 0.9018937945365906, "num_tokens": 14790864.0, "step": 1199 }, { "entropy": 1.3259137272834778, "epoch": 0.631911532385466, "grad_norm": 0.414235919713974, "learning_rate": 0.00019829571802520803, "loss": 0.2376767247915268, "mean_token_accuracy": 0.9016633927822113, "num_tokens": 14803200.0, "step": 1200 }, { "entropy": 1.3644030392169952, "epoch": 0.6324381253291206, "grad_norm": 0.3521367013454437, "learning_rate": 0.0001982914681978334, "loss": 0.23597122728824615, "mean_token_accuracy": 0.9043200761079788, "num_tokens": 14815536.0, "step": 1201 }, { "entropy": 1.3481078147888184, "epoch": 0.6329647182727751, "grad_norm": 0.2994113266468048, "learning_rate": 0.000198287213129109, "loss": 0.21383647620677948, "mean_token_accuracy": 0.9209251701831818, "num_tokens": 14827872.0, "step": 1202 }, { "entropy": 1.3808801472187042, "epoch": 0.6334913112164297, "grad_norm": 0.2982345223426819, "learning_rate": 0.00019828295281928727, "loss": 0.2155206948518753, "mean_token_accuracy": 0.9116237312555313, "num_tokens": 14840208.0, "step": 1203 }, { "entropy": 1.418733924627304, "epoch": 0.6340179041600843, "grad_norm": 0.3023967742919922, "learning_rate": 0.00019827868726862117, "loss": 0.23393575847148895, "mean_token_accuracy": 0.9095605909824371, "num_tokens": 14852544.0, "step": 1204 }, { "entropy": 1.5514957010746002, "epoch": 0.6345444971037388, "grad_norm": 0.40304750204086304, "learning_rate": 0.00019827441647736393, "loss": 0.26255497336387634, "mean_token_accuracy": 0.9011336117982864, "num_tokens": 14864880.0, "step": 1205 }, { "entropy": 1.4219785034656525, "epoch": 0.6350710900473934, "grad_norm": 0.291746586561203, "learning_rate": 0.00019827014044576912, "loss": 0.21620029211044312, "mean_token_accuracy": 0.9115499705076218, "num_tokens": 14877216.0, "step": 1206 }, { "entropy": 1.3420428931713104, "epoch": 0.6355976829910479, "grad_norm": 0.3108786940574646, "learning_rate": 0.0001982658591740905, "loss": 0.23703286051750183, "mean_token_accuracy": 0.9016107618808746, "num_tokens": 14889552.0, "step": 1207 }, { "entropy": 1.4392370581626892, "epoch": 0.6361242759347024, "grad_norm": 0.27034372091293335, "learning_rate": 0.00019826157266258232, "loss": 0.21097946166992188, "mean_token_accuracy": 0.9190766364336014, "num_tokens": 14901888.0, "step": 1208 }, { "entropy": 1.4509558379650116, "epoch": 0.636650868878357, "grad_norm": 0.29659944772720337, "learning_rate": 0.000198257280911499, "loss": 0.22469229996204376, "mean_token_accuracy": 0.913391038775444, "num_tokens": 14914224.0, "step": 1209 }, { "entropy": 1.3904311954975128, "epoch": 0.6371774618220116, "grad_norm": 0.2719598412513733, "learning_rate": 0.00019825298392109529, "loss": 0.18848726153373718, "mean_token_accuracy": 0.9262688905000687, "num_tokens": 14926560.0, "step": 1210 }, { "entropy": 1.4359396994113922, "epoch": 0.6377040547656662, "grad_norm": 0.3138201832771301, "learning_rate": 0.00019824868169162631, "loss": 0.24162685871124268, "mean_token_accuracy": 0.9020742177963257, "num_tokens": 14938896.0, "step": 1211 }, { "entropy": 1.3890084326267242, "epoch": 0.6382306477093207, "grad_norm": 0.2986134886741638, "learning_rate": 0.00019824437422334744, "loss": 0.22484566271305084, "mean_token_accuracy": 0.9077206701040268, "num_tokens": 14951232.0, "step": 1212 }, { "entropy": 1.378806233406067, "epoch": 0.6387572406529752, "grad_norm": 0.29134130477905273, "learning_rate": 0.00019824006151651443, "loss": 0.2171209454536438, "mean_token_accuracy": 0.9133529961109161, "num_tokens": 14963568.0, "step": 1213 }, { "entropy": 1.363432914018631, "epoch": 0.6392838335966298, "grad_norm": 0.3041214346885681, "learning_rate": 0.00019823574357138323, "loss": 0.24093735218048096, "mean_token_accuracy": 0.903191551566124, "num_tokens": 14975904.0, "step": 1214 }, { "entropy": 1.432945430278778, "epoch": 0.6398104265402843, "grad_norm": 0.30195045471191406, "learning_rate": 0.00019823142038821027, "loss": 0.20907755196094513, "mean_token_accuracy": 0.9161103218793869, "num_tokens": 14988240.0, "step": 1215 }, { "entropy": 1.3210029900074005, "epoch": 0.640337019483939, "grad_norm": 0.29575979709625244, "learning_rate": 0.00019822709196725208, "loss": 0.21090644598007202, "mean_token_accuracy": 0.9149498790502548, "num_tokens": 15000576.0, "step": 1216 }, { "entropy": 1.3699910044670105, "epoch": 0.6408636124275935, "grad_norm": 0.2982396185398102, "learning_rate": 0.00019822275830876568, "loss": 0.2054290473461151, "mean_token_accuracy": 0.9217698276042938, "num_tokens": 15012912.0, "step": 1217 }, { "entropy": 1.41866934299469, "epoch": 0.641390205371248, "grad_norm": 0.3208104968070984, "learning_rate": 0.00019821841941300834, "loss": 0.24424780905246735, "mean_token_accuracy": 0.9118457287549973, "num_tokens": 15025248.0, "step": 1218 }, { "entropy": 1.399036020040512, "epoch": 0.6419167983149026, "grad_norm": 0.3094969689846039, "learning_rate": 0.00019821407528023758, "loss": 0.23681235313415527, "mean_token_accuracy": 0.9031997323036194, "num_tokens": 15037584.0, "step": 1219 }, { "entropy": 1.3915925920009613, "epoch": 0.6424433912585571, "grad_norm": 0.2973760962486267, "learning_rate": 0.00019820972591071131, "loss": 0.19640693068504333, "mean_token_accuracy": 0.9181762486696243, "num_tokens": 15049920.0, "step": 1220 }, { "entropy": 1.4664425551891327, "epoch": 0.6429699842022117, "grad_norm": 0.7199912667274475, "learning_rate": 0.0001982053713046878, "loss": 0.2480940818786621, "mean_token_accuracy": 0.9039055407047272, "num_tokens": 15062256.0, "step": 1221 }, { "entropy": 1.4178178012371063, "epoch": 0.6434965771458663, "grad_norm": 0.3677431643009186, "learning_rate": 0.00019820101146242547, "loss": 0.22347916662693024, "mean_token_accuracy": 0.9104437232017517, "num_tokens": 15074592.0, "step": 1222 }, { "entropy": 1.3942118883132935, "epoch": 0.6440231700895208, "grad_norm": 0.3363230228424072, "learning_rate": 0.00019819664638418314, "loss": 0.23758456110954285, "mean_token_accuracy": 0.9113318026065826, "num_tokens": 15086928.0, "step": 1223 }, { "entropy": 1.3070717453956604, "epoch": 0.6445497630331753, "grad_norm": 0.3119392693042755, "learning_rate": 0.00019819227607021996, "loss": 0.1808784306049347, "mean_token_accuracy": 0.9277928322553635, "num_tokens": 15099264.0, "step": 1224 }, { "entropy": 1.3485881388187408, "epoch": 0.6450763559768299, "grad_norm": 0.2953029274940491, "learning_rate": 0.00019818790052079542, "loss": 0.21690060198307037, "mean_token_accuracy": 0.9107033312320709, "num_tokens": 15111600.0, "step": 1225 }, { "entropy": 1.3310377597808838, "epoch": 0.6456029489204844, "grad_norm": 0.30317792296409607, "learning_rate": 0.0001981835197361692, "loss": 0.21382620930671692, "mean_token_accuracy": 0.9134241938591003, "num_tokens": 15123936.0, "step": 1226 }, { "entropy": 1.3547466397285461, "epoch": 0.6461295418641391, "grad_norm": 0.31380537152290344, "learning_rate": 0.00019817913371660136, "loss": 0.23309272527694702, "mean_token_accuracy": 0.9060655981302261, "num_tokens": 15136272.0, "step": 1227 }, { "entropy": 1.359354555606842, "epoch": 0.6466561348077936, "grad_norm": 0.3240332007408142, "learning_rate": 0.00019817474246235233, "loss": 0.2206256240606308, "mean_token_accuracy": 0.9170451760292053, "num_tokens": 15148608.0, "step": 1228 }, { "entropy": 1.3810060322284698, "epoch": 0.6471827277514481, "grad_norm": 0.28998929262161255, "learning_rate": 0.00019817034597368276, "loss": 0.20593759417533875, "mean_token_accuracy": 0.9143964052200317, "num_tokens": 15160944.0, "step": 1229 }, { "entropy": 1.3853793740272522, "epoch": 0.6477093206951027, "grad_norm": 0.3167085349559784, "learning_rate": 0.00019816594425085365, "loss": 0.214578315615654, "mean_token_accuracy": 0.9154220819473267, "num_tokens": 15173280.0, "step": 1230 }, { "entropy": 1.3485651314258575, "epoch": 0.6482359136387572, "grad_norm": 0.32996588945388794, "learning_rate": 0.00019816153729412627, "loss": 0.227751225233078, "mean_token_accuracy": 0.9076825082302094, "num_tokens": 15185616.0, "step": 1231 }, { "entropy": 1.2957139611244202, "epoch": 0.6487625065824117, "grad_norm": 0.2826898396015167, "learning_rate": 0.0001981571251037623, "loss": 0.2006268948316574, "mean_token_accuracy": 0.9202533811330795, "num_tokens": 15197952.0, "step": 1232 }, { "entropy": 1.42320716381073, "epoch": 0.6492890995260664, "grad_norm": 0.3413523733615875, "learning_rate": 0.00019815270768002357, "loss": 0.2385195791721344, "mean_token_accuracy": 0.9027537554502487, "num_tokens": 15210288.0, "step": 1233 }, { "entropy": 1.3331094086170197, "epoch": 0.6498156924697209, "grad_norm": 0.3069290220737457, "learning_rate": 0.00019814828502317245, "loss": 0.2170781046152115, "mean_token_accuracy": 0.9153832644224167, "num_tokens": 15222624.0, "step": 1234 }, { "entropy": 1.365331083536148, "epoch": 0.6503422854133755, "grad_norm": 0.2763271629810333, "learning_rate": 0.0001981438571334714, "loss": 0.21132177114486694, "mean_token_accuracy": 0.9158383458852768, "num_tokens": 15234960.0, "step": 1235 }, { "entropy": 1.3776979446411133, "epoch": 0.65086887835703, "grad_norm": 0.3232009708881378, "learning_rate": 0.0001981394240111833, "loss": 0.23016487061977386, "mean_token_accuracy": 0.9127575606107712, "num_tokens": 15247296.0, "step": 1236 }, { "entropy": 1.42231023311615, "epoch": 0.6513954713006845, "grad_norm": 0.2981938421726227, "learning_rate": 0.00019813498565657127, "loss": 0.22353443503379822, "mean_token_accuracy": 0.9140705019235611, "num_tokens": 15259632.0, "step": 1237 }, { "entropy": 1.4192762076854706, "epoch": 0.6519220642443391, "grad_norm": 0.30204325914382935, "learning_rate": 0.00019813054206989884, "loss": 0.22629618644714355, "mean_token_accuracy": 0.9069414585828781, "num_tokens": 15271968.0, "step": 1238 }, { "entropy": 1.4479241073131561, "epoch": 0.6524486571879937, "grad_norm": 0.2993687689304352, "learning_rate": 0.00019812609325142982, "loss": 0.22675678133964539, "mean_token_accuracy": 0.9094991534948349, "num_tokens": 15284304.0, "step": 1239 }, { "entropy": 1.4620944261550903, "epoch": 0.6529752501316483, "grad_norm": 0.3134925961494446, "learning_rate": 0.00019812163920142827, "loss": 0.22805798053741455, "mean_token_accuracy": 0.9107698351144791, "num_tokens": 15296640.0, "step": 1240 }, { "entropy": 1.495926171541214, "epoch": 0.6535018430753028, "grad_norm": 0.3140438199043274, "learning_rate": 0.00019811717992015862, "loss": 0.2086748480796814, "mean_token_accuracy": 0.9102585017681122, "num_tokens": 15308976.0, "step": 1241 }, { "entropy": 1.4446808993816376, "epoch": 0.6540284360189573, "grad_norm": 0.30744868516921997, "learning_rate": 0.00019811271540788556, "loss": 0.22943398356437683, "mean_token_accuracy": 0.9074350297451019, "num_tokens": 15321312.0, "step": 1242 }, { "entropy": 1.5100261270999908, "epoch": 0.6545550289626119, "grad_norm": 0.3204497694969177, "learning_rate": 0.00019810824566487417, "loss": 0.22844550013542175, "mean_token_accuracy": 0.9073818922042847, "num_tokens": 15333648.0, "step": 1243 }, { "entropy": 1.4075362086296082, "epoch": 0.6550816219062665, "grad_norm": 0.32697567343711853, "learning_rate": 0.00019810377069138976, "loss": 0.23277214169502258, "mean_token_accuracy": 0.9124523550271988, "num_tokens": 15345984.0, "step": 1244 }, { "entropy": 1.474784404039383, "epoch": 0.655608214849921, "grad_norm": 0.31703367829322815, "learning_rate": 0.000198099290487698, "loss": 0.2128317952156067, "mean_token_accuracy": 0.9103437811136246, "num_tokens": 15358320.0, "step": 1245 }, { "entropy": 1.3723844587802887, "epoch": 0.6561348077935756, "grad_norm": 0.3136475384235382, "learning_rate": 0.0001980948050540648, "loss": 0.2106158286333084, "mean_token_accuracy": 0.9139569699764252, "num_tokens": 15370656.0, "step": 1246 }, { "entropy": 1.4297202229499817, "epoch": 0.6566614007372301, "grad_norm": 0.31566086411476135, "learning_rate": 0.00019809031439075653, "loss": 0.22323954105377197, "mean_token_accuracy": 0.912299782037735, "num_tokens": 15382992.0, "step": 1247 }, { "entropy": 1.404792070388794, "epoch": 0.6571879936808847, "grad_norm": 0.30582812428474426, "learning_rate": 0.00019808581849803972, "loss": 0.19535206258296967, "mean_token_accuracy": 0.926054835319519, "num_tokens": 15395328.0, "step": 1248 }, { "entropy": 1.365869253873825, "epoch": 0.6577145866245392, "grad_norm": 0.32905054092407227, "learning_rate": 0.00019808131737618126, "loss": 0.206635981798172, "mean_token_accuracy": 0.9179205745458603, "num_tokens": 15407664.0, "step": 1249 }, { "entropy": 1.4380927085876465, "epoch": 0.6582411795681938, "grad_norm": 0.3363628685474396, "learning_rate": 0.00019807681102544834, "loss": 0.23559972643852234, "mean_token_accuracy": 0.9073036760091782, "num_tokens": 15420000.0, "step": 1250 }, { "entropy": 1.4528064727783203, "epoch": 0.6587677725118484, "grad_norm": 0.3616321384906769, "learning_rate": 0.00019807229944610854, "loss": 0.23041245341300964, "mean_token_accuracy": 0.9012827575206757, "num_tokens": 15432336.0, "step": 1251 }, { "entropy": 1.4460172951221466, "epoch": 0.6592943654555029, "grad_norm": 0.305955171585083, "learning_rate": 0.00019806778263842964, "loss": 0.21666109561920166, "mean_token_accuracy": 0.9198573529720306, "num_tokens": 15444672.0, "step": 1252 }, { "entropy": 1.500756323337555, "epoch": 0.6598209583991574, "grad_norm": 0.29015445709228516, "learning_rate": 0.00019806326060267977, "loss": 0.21642570197582245, "mean_token_accuracy": 0.9154843240976334, "num_tokens": 15457008.0, "step": 1253 }, { "entropy": 1.4731870293617249, "epoch": 0.660347551342812, "grad_norm": 0.3006648123264313, "learning_rate": 0.00019805873333912739, "loss": 0.20880235731601715, "mean_token_accuracy": 0.924048438668251, "num_tokens": 15469344.0, "step": 1254 }, { "entropy": 1.5191810727119446, "epoch": 0.6608741442864665, "grad_norm": 0.290721595287323, "learning_rate": 0.00019805420084804124, "loss": 0.21848249435424805, "mean_token_accuracy": 0.9141736477613449, "num_tokens": 15481680.0, "step": 1255 }, { "entropy": 1.521433562040329, "epoch": 0.6614007372301212, "grad_norm": 0.3009195327758789, "learning_rate": 0.00019804966312969046, "loss": 0.20721524953842163, "mean_token_accuracy": 0.9165780544281006, "num_tokens": 15494016.0, "step": 1256 }, { "entropy": 1.5230248272418976, "epoch": 0.6619273301737757, "grad_norm": 0.2907300293445587, "learning_rate": 0.00019804512018434432, "loss": 0.2220079004764557, "mean_token_accuracy": 0.9127085506916046, "num_tokens": 15506352.0, "step": 1257 }, { "entropy": 1.4415357112884521, "epoch": 0.6624539231174302, "grad_norm": 0.27609995007514954, "learning_rate": 0.00019804057201227259, "loss": 0.19916732609272003, "mean_token_accuracy": 0.9211323857307434, "num_tokens": 15518688.0, "step": 1258 }, { "entropy": 1.5071959793567657, "epoch": 0.6629805160610848, "grad_norm": 0.3255380690097809, "learning_rate": 0.0001980360186137452, "loss": 0.23832152783870697, "mean_token_accuracy": 0.9030174165964127, "num_tokens": 15531024.0, "step": 1259 }, { "entropy": 1.544082134962082, "epoch": 0.6635071090047393, "grad_norm": 0.31669536232948303, "learning_rate": 0.00019803145998903253, "loss": 0.2193489968776703, "mean_token_accuracy": 0.9140938073396683, "num_tokens": 15543360.0, "step": 1260 }, { "entropy": 1.5186286568641663, "epoch": 0.6640337019483938, "grad_norm": 0.3087945282459259, "learning_rate": 0.00019802689613840514, "loss": 0.2145516723394394, "mean_token_accuracy": 0.9134328663349152, "num_tokens": 15555696.0, "step": 1261 }, { "entropy": 1.4552082121372223, "epoch": 0.6645602948920485, "grad_norm": 0.3144809901714325, "learning_rate": 0.000198022327062134, "loss": 0.22542014718055725, "mean_token_accuracy": 0.9080185741186142, "num_tokens": 15568032.0, "step": 1262 }, { "entropy": 1.4759101569652557, "epoch": 0.665086887835703, "grad_norm": 0.28055956959724426, "learning_rate": 0.00019801775276049035, "loss": 0.19411805272102356, "mean_token_accuracy": 0.9219205677509308, "num_tokens": 15580368.0, "step": 1263 }, { "entropy": 1.5172317326068878, "epoch": 0.6656134807793576, "grad_norm": 0.28847187757492065, "learning_rate": 0.00019801317323374574, "loss": 0.1965804398059845, "mean_token_accuracy": 0.9217233210802078, "num_tokens": 15592704.0, "step": 1264 }, { "entropy": 1.4631735682487488, "epoch": 0.6661400737230121, "grad_norm": 0.3277401924133301, "learning_rate": 0.000198008588482172, "loss": 0.23770709335803986, "mean_token_accuracy": 0.9039840698242188, "num_tokens": 15605040.0, "step": 1265 }, { "entropy": 1.5213152170181274, "epoch": 0.6666666666666666, "grad_norm": 0.31430521607398987, "learning_rate": 0.00019800399850604129, "loss": 0.23058706521987915, "mean_token_accuracy": 0.9074577987194061, "num_tokens": 15617376.0, "step": 1266 }, { "entropy": 1.4705300331115723, "epoch": 0.6671932596103213, "grad_norm": 0.3256817162036896, "learning_rate": 0.0001979994033056261, "loss": 0.25320321321487427, "mean_token_accuracy": 0.9007576107978821, "num_tokens": 15629712.0, "step": 1267 }, { "entropy": 1.530697613954544, "epoch": 0.6677198525539758, "grad_norm": 0.30975228548049927, "learning_rate": 0.00019799480288119927, "loss": 0.23081722855567932, "mean_token_accuracy": 0.9080140292644501, "num_tokens": 15642048.0, "step": 1268 }, { "entropy": 1.495768964290619, "epoch": 0.6682464454976303, "grad_norm": 0.29344475269317627, "learning_rate": 0.00019799019723303388, "loss": 0.2015610784292221, "mean_token_accuracy": 0.9178611040115356, "num_tokens": 15654384.0, "step": 1269 }, { "entropy": 1.5803856551647186, "epoch": 0.6687730384412849, "grad_norm": 0.3023964464664459, "learning_rate": 0.00019798558636140333, "loss": 0.2174011915922165, "mean_token_accuracy": 0.9140703827142715, "num_tokens": 15666720.0, "step": 1270 }, { "entropy": 1.4897505939006805, "epoch": 0.6692996313849394, "grad_norm": 0.2858726978302002, "learning_rate": 0.0001979809702665813, "loss": 0.20024171471595764, "mean_token_accuracy": 0.9191962629556656, "num_tokens": 15679056.0, "step": 1271 }, { "entropy": 1.5215353667736053, "epoch": 0.669826224328594, "grad_norm": 0.27068790793418884, "learning_rate": 0.00019797634894884184, "loss": 0.21988946199417114, "mean_token_accuracy": 0.9098561853170395, "num_tokens": 15691392.0, "step": 1272 }, { "entropy": 1.5361709892749786, "epoch": 0.6703528172722486, "grad_norm": 0.3324735164642334, "learning_rate": 0.00019797172240845935, "loss": 0.2674825191497803, "mean_token_accuracy": 0.8955648243427277, "num_tokens": 15703728.0, "step": 1273 }, { "entropy": 1.5240019261837006, "epoch": 0.6708794102159031, "grad_norm": 0.3050387501716614, "learning_rate": 0.00019796709064570842, "loss": 0.22774918377399445, "mean_token_accuracy": 0.9072832018136978, "num_tokens": 15716064.0, "step": 1274 }, { "entropy": 1.4996045529842377, "epoch": 0.6714060031595577, "grad_norm": 0.2832599878311157, "learning_rate": 0.00019796245366086404, "loss": 0.21256539225578308, "mean_token_accuracy": 0.9113875329494476, "num_tokens": 15728400.0, "step": 1275 }, { "entropy": 1.537344366312027, "epoch": 0.6719325961032122, "grad_norm": 0.28976351022720337, "learning_rate": 0.00019795781145420148, "loss": 0.2061801552772522, "mean_token_accuracy": 0.9169371575117111, "num_tokens": 15740736.0, "step": 1276 }, { "entropy": 1.5299006402492523, "epoch": 0.6724591890468667, "grad_norm": 0.2772320806980133, "learning_rate": 0.0001979531640259963, "loss": 0.20862804353237152, "mean_token_accuracy": 0.9104678928852081, "num_tokens": 15753072.0, "step": 1277 }, { "entropy": 1.5044286847114563, "epoch": 0.6729857819905213, "grad_norm": 0.3096766769886017, "learning_rate": 0.0001979485113765244, "loss": 0.23148494958877563, "mean_token_accuracy": 0.9055089354515076, "num_tokens": 15765408.0, "step": 1278 }, { "entropy": 1.492220789194107, "epoch": 0.6735123749341759, "grad_norm": 0.2892164885997772, "learning_rate": 0.00019794385350606198, "loss": 0.2099100798368454, "mean_token_accuracy": 0.9140574485063553, "num_tokens": 15777744.0, "step": 1279 }, { "entropy": 1.5607218742370605, "epoch": 0.6740389678778305, "grad_norm": 0.3277181088924408, "learning_rate": 0.00019793919041488555, "loss": 0.22673308849334717, "mean_token_accuracy": 0.9092708230018616, "num_tokens": 15790080.0, "step": 1280 }, { "entropy": 1.5162492990493774, "epoch": 0.674565560821485, "grad_norm": 0.3172418475151062, "learning_rate": 0.00019793452210327194, "loss": 0.23533746600151062, "mean_token_accuracy": 0.9022314250469208, "num_tokens": 15802416.0, "step": 1281 }, { "entropy": 1.4783676862716675, "epoch": 0.6750921537651395, "grad_norm": 0.2982933521270752, "learning_rate": 0.00019792984857149826, "loss": 0.21463748812675476, "mean_token_accuracy": 0.9117985665798187, "num_tokens": 15814752.0, "step": 1282 }, { "entropy": 1.5162720084190369, "epoch": 0.6756187467087941, "grad_norm": 0.2976648211479187, "learning_rate": 0.000197925169819842, "loss": 0.21266265213489532, "mean_token_accuracy": 0.9171696603298187, "num_tokens": 15827088.0, "step": 1283 }, { "entropy": 1.5761696994304657, "epoch": 0.6761453396524486, "grad_norm": 0.32240986824035645, "learning_rate": 0.00019792048584858082, "loss": 0.22523874044418335, "mean_token_accuracy": 0.9125792235136032, "num_tokens": 15839424.0, "step": 1284 }, { "entropy": 1.4458520412445068, "epoch": 0.6766719325961033, "grad_norm": 0.2936963140964508, "learning_rate": 0.00019791579665799286, "loss": 0.20535065233707428, "mean_token_accuracy": 0.9165598750114441, "num_tokens": 15851760.0, "step": 1285 }, { "entropy": 1.4983311593532562, "epoch": 0.6771985255397578, "grad_norm": 0.34449514746665955, "learning_rate": 0.0001979111022483565, "loss": 0.21712952852249146, "mean_token_accuracy": 0.9153823703527451, "num_tokens": 15864096.0, "step": 1286 }, { "entropy": 1.562139093875885, "epoch": 0.6777251184834123, "grad_norm": 0.31743091344833374, "learning_rate": 0.00019790640261995034, "loss": 0.219345360994339, "mean_token_accuracy": 0.9084994047880173, "num_tokens": 15876432.0, "step": 1287 }, { "entropy": 1.5375787019729614, "epoch": 0.6782517114270669, "grad_norm": 0.27115342020988464, "learning_rate": 0.00019790169777305345, "loss": 0.19260238111019135, "mean_token_accuracy": 0.9227229058742523, "num_tokens": 15888768.0, "step": 1288 }, { "entropy": 1.4687424898147583, "epoch": 0.6787783043707214, "grad_norm": 0.302287220954895, "learning_rate": 0.00019789698770794506, "loss": 0.24450846016407013, "mean_token_accuracy": 0.9040905237197876, "num_tokens": 15901104.0, "step": 1289 }, { "entropy": 1.5125727355480194, "epoch": 0.6793048973143759, "grad_norm": 0.3316330313682556, "learning_rate": 0.00019789227242490481, "loss": 0.23443403840065002, "mean_token_accuracy": 0.9077270179986954, "num_tokens": 15913440.0, "step": 1290 }, { "entropy": 1.457822471857071, "epoch": 0.6798314902580306, "grad_norm": 0.3082807958126068, "learning_rate": 0.00019788755192421266, "loss": 0.2276977300643921, "mean_token_accuracy": 0.907697319984436, "num_tokens": 15925776.0, "step": 1291 }, { "entropy": 1.5687705874443054, "epoch": 0.6803580832016851, "grad_norm": 0.3347495198249817, "learning_rate": 0.00019788282620614877, "loss": 0.23658336699008942, "mean_token_accuracy": 0.9071597903966904, "num_tokens": 15938112.0, "step": 1292 }, { "entropy": 1.4747570753097534, "epoch": 0.6808846761453397, "grad_norm": 0.31832975149154663, "learning_rate": 0.0001978780952709937, "loss": 0.19530466198921204, "mean_token_accuracy": 0.9262362122535706, "num_tokens": 15950448.0, "step": 1293 }, { "entropy": 1.5592786967754364, "epoch": 0.6814112690889942, "grad_norm": 0.29860836267471313, "learning_rate": 0.00019787335911902835, "loss": 0.21259617805480957, "mean_token_accuracy": 0.9156482219696045, "num_tokens": 15962784.0, "step": 1294 }, { "entropy": 1.590408980846405, "epoch": 0.6819378620326487, "grad_norm": 0.33426377177238464, "learning_rate": 0.0001978686177505338, "loss": 0.250851035118103, "mean_token_accuracy": 0.9034130126237869, "num_tokens": 15975120.0, "step": 1295 }, { "entropy": 1.520596295595169, "epoch": 0.6824644549763034, "grad_norm": 0.31754234433174133, "learning_rate": 0.00019786387116579155, "loss": 0.23741202056407928, "mean_token_accuracy": 0.9074528068304062, "num_tokens": 15987456.0, "step": 1296 }, { "entropy": 1.589228630065918, "epoch": 0.6829910479199579, "grad_norm": 0.334957480430603, "learning_rate": 0.0001978591193650834, "loss": 0.2431160807609558, "mean_token_accuracy": 0.9039677083492279, "num_tokens": 15999792.0, "step": 1297 }, { "entropy": 1.5251929759979248, "epoch": 0.6835176408636124, "grad_norm": 0.26925790309906006, "learning_rate": 0.00019785436234869138, "loss": 0.18518362939357758, "mean_token_accuracy": 0.9277700483798981, "num_tokens": 16012128.0, "step": 1298 }, { "entropy": 1.49588942527771, "epoch": 0.684044233807267, "grad_norm": 0.2995278835296631, "learning_rate": 0.00019784960011689793, "loss": 0.21347451210021973, "mean_token_accuracy": 0.9186176806688309, "num_tokens": 16024464.0, "step": 1299 }, { "entropy": 1.5090012848377228, "epoch": 0.6845708267509215, "grad_norm": 0.2900152802467346, "learning_rate": 0.00019784483266998575, "loss": 0.20770123600959778, "mean_token_accuracy": 0.9164092987775803, "num_tokens": 16036800.0, "step": 1300 }, { "entropy": 1.524385005235672, "epoch": 0.685097419694576, "grad_norm": 0.2801123857498169, "learning_rate": 0.00019784006000823787, "loss": 0.1997857242822647, "mean_token_accuracy": 0.9173883497714996, "num_tokens": 16049136.0, "step": 1301 }, { "entropy": 1.5324156284332275, "epoch": 0.6856240126382307, "grad_norm": 0.30303382873535156, "learning_rate": 0.0001978352821319376, "loss": 0.21537630259990692, "mean_token_accuracy": 0.9123150855302811, "num_tokens": 16061472.0, "step": 1302 }, { "entropy": 1.538516879081726, "epoch": 0.6861506055818852, "grad_norm": 0.2965938448905945, "learning_rate": 0.00019783049904136855, "loss": 0.20010440051555634, "mean_token_accuracy": 0.9172840118408203, "num_tokens": 16073808.0, "step": 1303 }, { "entropy": 1.4958137571811676, "epoch": 0.6866771985255398, "grad_norm": 0.29906049370765686, "learning_rate": 0.0001978257107368147, "loss": 0.20351183414459229, "mean_token_accuracy": 0.921799048781395, "num_tokens": 16086144.0, "step": 1304 }, { "entropy": 1.4531968832015991, "epoch": 0.6872037914691943, "grad_norm": 0.31886446475982666, "learning_rate": 0.0001978209172185603, "loss": 0.21320727467536926, "mean_token_accuracy": 0.9105631560087204, "num_tokens": 16098480.0, "step": 1305 }, { "entropy": 1.3787581324577332, "epoch": 0.6877303844128488, "grad_norm": 0.2898115813732147, "learning_rate": 0.0001978161184868899, "loss": 0.2124798595905304, "mean_token_accuracy": 0.9114013463258743, "num_tokens": 16110816.0, "step": 1306 }, { "entropy": 1.4378518164157867, "epoch": 0.6882569773565034, "grad_norm": 0.31470921635627747, "learning_rate": 0.00019781131454208833, "loss": 0.19701991975307465, "mean_token_accuracy": 0.9186731576919556, "num_tokens": 16123152.0, "step": 1307 }, { "entropy": 1.4289041459560394, "epoch": 0.688783570300158, "grad_norm": 0.3303619921207428, "learning_rate": 0.0001978065053844409, "loss": 0.23253998160362244, "mean_token_accuracy": 0.9104226678609848, "num_tokens": 16135488.0, "step": 1308 }, { "entropy": 1.458989679813385, "epoch": 0.6893101632438126, "grad_norm": 0.30710119009017944, "learning_rate": 0.00019780169101423295, "loss": 0.2202616184949875, "mean_token_accuracy": 0.9115623980760574, "num_tokens": 16147824.0, "step": 1309 }, { "entropy": 1.5141521096229553, "epoch": 0.6898367561874671, "grad_norm": 0.3152952194213867, "learning_rate": 0.0001977968714317504, "loss": 0.19381463527679443, "mean_token_accuracy": 0.9204765856266022, "num_tokens": 16160160.0, "step": 1310 }, { "entropy": 1.4804642498493195, "epoch": 0.6903633491311216, "grad_norm": 0.3526984751224518, "learning_rate": 0.0001977920466372793, "loss": 0.22401507198810577, "mean_token_accuracy": 0.9142041653394699, "num_tokens": 16172496.0, "step": 1311 }, { "entropy": 1.4126333594322205, "epoch": 0.6908899420747762, "grad_norm": 0.2999390661716461, "learning_rate": 0.00019778721663110603, "loss": 0.212639719247818, "mean_token_accuracy": 0.9140689373016357, "num_tokens": 16184832.0, "step": 1312 }, { "entropy": 1.4407996237277985, "epoch": 0.6914165350184307, "grad_norm": 0.3175979554653168, "learning_rate": 0.00019778238141351744, "loss": 0.23567378520965576, "mean_token_accuracy": 0.9058562517166138, "num_tokens": 16197168.0, "step": 1313 }, { "entropy": 1.4304053783416748, "epoch": 0.6919431279620853, "grad_norm": 0.32357415556907654, "learning_rate": 0.00019777754098480047, "loss": 0.23323741555213928, "mean_token_accuracy": 0.9068403393030167, "num_tokens": 16209504.0, "step": 1314 }, { "entropy": 1.4463219940662384, "epoch": 0.6924697209057399, "grad_norm": 0.32085898518562317, "learning_rate": 0.0001977726953452425, "loss": 0.25303539633750916, "mean_token_accuracy": 0.9010388404130936, "num_tokens": 16221840.0, "step": 1315 }, { "entropy": 1.5001619458198547, "epoch": 0.6929963138493944, "grad_norm": 0.30218154191970825, "learning_rate": 0.0001977678444951312, "loss": 0.20458348095417023, "mean_token_accuracy": 0.9198221117258072, "num_tokens": 16234176.0, "step": 1316 }, { "entropy": 1.4169287383556366, "epoch": 0.693522906793049, "grad_norm": 0.2987150549888611, "learning_rate": 0.0001977629884347545, "loss": 0.20915895700454712, "mean_token_accuracy": 0.914911612868309, "num_tokens": 16246512.0, "step": 1317 }, { "entropy": 1.4708910584449768, "epoch": 0.6940494997367035, "grad_norm": 0.2975226938724518, "learning_rate": 0.00019775812716440073, "loss": 0.21582108736038208, "mean_token_accuracy": 0.916588231921196, "num_tokens": 16258848.0, "step": 1318 }, { "entropy": 1.395564466714859, "epoch": 0.6945760926803581, "grad_norm": 0.26800790429115295, "learning_rate": 0.00019775326068435843, "loss": 0.19701655209064484, "mean_token_accuracy": 0.9204675257205963, "num_tokens": 16271184.0, "step": 1319 }, { "entropy": 1.4954661428928375, "epoch": 0.6951026856240127, "grad_norm": 0.3218332529067993, "learning_rate": 0.00019774838899491647, "loss": 0.20654654502868652, "mean_token_accuracy": 0.9205126464366913, "num_tokens": 16283520.0, "step": 1320 }, { "entropy": 1.475353330373764, "epoch": 0.6956292785676672, "grad_norm": 0.29199621081352234, "learning_rate": 0.00019774351209636413, "loss": 0.22376279532909393, "mean_token_accuracy": 0.9100230783224106, "num_tokens": 16295856.0, "step": 1321 }, { "entropy": 1.5148694515228271, "epoch": 0.6961558715113217, "grad_norm": 0.30520734190940857, "learning_rate": 0.00019773862998899086, "loss": 0.2176750898361206, "mean_token_accuracy": 0.9201380461454391, "num_tokens": 16308192.0, "step": 1322 }, { "entropy": 1.5539270341396332, "epoch": 0.6966824644549763, "grad_norm": 0.32190483808517456, "learning_rate": 0.00019773374267308653, "loss": 0.2056635320186615, "mean_token_accuracy": 0.914083868265152, "num_tokens": 16320528.0, "step": 1323 }, { "entropy": 1.4479952156543732, "epoch": 0.6972090573986308, "grad_norm": 0.3086356222629547, "learning_rate": 0.00019772885014894125, "loss": 0.19541175663471222, "mean_token_accuracy": 0.9208300113677979, "num_tokens": 16332864.0, "step": 1324 }, { "entropy": 1.4255986511707306, "epoch": 0.6977356503422855, "grad_norm": 0.29759716987609863, "learning_rate": 0.00019772395241684547, "loss": 0.22268646955490112, "mean_token_accuracy": 0.9130487442016602, "num_tokens": 16345200.0, "step": 1325 }, { "entropy": 1.417414665222168, "epoch": 0.69826224328594, "grad_norm": 0.30235084891319275, "learning_rate": 0.00019771904947708991, "loss": 0.19872839748859406, "mean_token_accuracy": 0.9202670305967331, "num_tokens": 16357536.0, "step": 1326 }, { "entropy": 1.462871015071869, "epoch": 0.6987888362295945, "grad_norm": 0.330930233001709, "learning_rate": 0.00019771414132996565, "loss": 0.21214503049850464, "mean_token_accuracy": 0.9157495498657227, "num_tokens": 16369872.0, "step": 1327 }, { "entropy": 1.4870843291282654, "epoch": 0.6993154291732491, "grad_norm": 0.33824852108955383, "learning_rate": 0.00019770922797576407, "loss": 0.23521599173545837, "mean_token_accuracy": 0.9104333966970444, "num_tokens": 16382208.0, "step": 1328 }, { "entropy": 1.4692321121692657, "epoch": 0.6998420221169036, "grad_norm": 0.2853015959262848, "learning_rate": 0.0001977043094147768, "loss": 0.21163907647132874, "mean_token_accuracy": 0.9183786511421204, "num_tokens": 16394544.0, "step": 1329 }, { "entropy": 1.4160318076610565, "epoch": 0.7003686150605581, "grad_norm": 0.3194182217121124, "learning_rate": 0.00019769938564729585, "loss": 0.22332850098609924, "mean_token_accuracy": 0.9086870551109314, "num_tokens": 16406880.0, "step": 1330 }, { "entropy": 1.5249937772750854, "epoch": 0.7008952080042128, "grad_norm": 0.2979271709918976, "learning_rate": 0.00019769445667361358, "loss": 0.20148411393165588, "mean_token_accuracy": 0.919349730014801, "num_tokens": 16419216.0, "step": 1331 }, { "entropy": 1.475309818983078, "epoch": 0.7014218009478673, "grad_norm": 0.31436359882354736, "learning_rate": 0.00019768952249402252, "loss": 0.2226470410823822, "mean_token_accuracy": 0.9143447577953339, "num_tokens": 16431552.0, "step": 1332 }, { "entropy": 1.45591801404953, "epoch": 0.7019483938915219, "grad_norm": 0.3134812116622925, "learning_rate": 0.00019768458310881557, "loss": 0.239861398935318, "mean_token_accuracy": 0.9030255079269409, "num_tokens": 16443888.0, "step": 1333 }, { "entropy": 1.4746840596199036, "epoch": 0.7024749868351764, "grad_norm": 0.2945224642753601, "learning_rate": 0.00019767963851828604, "loss": 0.2150000035762787, "mean_token_accuracy": 0.9179409146308899, "num_tokens": 16456224.0, "step": 1334 }, { "entropy": 1.4820148646831512, "epoch": 0.7030015797788309, "grad_norm": 0.30797162652015686, "learning_rate": 0.00019767468872272737, "loss": 0.22350315749645233, "mean_token_accuracy": 0.9135662913322449, "num_tokens": 16468560.0, "step": 1335 }, { "entropy": 1.5698617100715637, "epoch": 0.7035281727224855, "grad_norm": 0.3179170489311218, "learning_rate": 0.00019766973372243343, "loss": 0.20203739404678345, "mean_token_accuracy": 0.9202521592378616, "num_tokens": 16480896.0, "step": 1336 }, { "entropy": 1.5165068209171295, "epoch": 0.7040547656661401, "grad_norm": 0.282023549079895, "learning_rate": 0.0001976647735176984, "loss": 0.2072068601846695, "mean_token_accuracy": 0.9170822501182556, "num_tokens": 16493232.0, "step": 1337 }, { "entropy": 1.5599988996982574, "epoch": 0.7045813586097947, "grad_norm": 0.32171323895454407, "learning_rate": 0.0001976598081088167, "loss": 0.2177916020154953, "mean_token_accuracy": 0.9149684607982635, "num_tokens": 16505568.0, "step": 1338 }, { "entropy": 1.566039115190506, "epoch": 0.7051079515534492, "grad_norm": 0.2976767420768738, "learning_rate": 0.00019765483749608313, "loss": 0.20423297584056854, "mean_token_accuracy": 0.9218804687261581, "num_tokens": 16517904.0, "step": 1339 }, { "entropy": 1.5926516354084015, "epoch": 0.7056345444971037, "grad_norm": 0.3847099244594574, "learning_rate": 0.00019764986167979275, "loss": 0.22431136667728424, "mean_token_accuracy": 0.9091393053531647, "num_tokens": 16530240.0, "step": 1340 }, { "entropy": 1.5083985030651093, "epoch": 0.7061611374407583, "grad_norm": 0.3162590563297272, "learning_rate": 0.0001976448806602409, "loss": 0.2287883162498474, "mean_token_accuracy": 0.9064637273550034, "num_tokens": 16542576.0, "step": 1341 }, { "entropy": 1.4989595413208008, "epoch": 0.7066877303844129, "grad_norm": 0.3000263571739197, "learning_rate": 0.00019763989443772337, "loss": 0.21327601373195648, "mean_token_accuracy": 0.9155562520027161, "num_tokens": 16554912.0, "step": 1342 }, { "entropy": 1.5128290951251984, "epoch": 0.7072143233280674, "grad_norm": 0.2836988568305969, "learning_rate": 0.00019763490301253608, "loss": 0.19906045496463776, "mean_token_accuracy": 0.9238555133342743, "num_tokens": 16567248.0, "step": 1343 }, { "entropy": 1.5032199919223785, "epoch": 0.707740916271722, "grad_norm": 0.2904132306575775, "learning_rate": 0.0001976299063849754, "loss": 0.21531090140342712, "mean_token_accuracy": 0.9095672369003296, "num_tokens": 16579584.0, "step": 1344 }, { "entropy": 1.587888479232788, "epoch": 0.7082675092153765, "grad_norm": 0.3187963664531708, "learning_rate": 0.00019762490455533792, "loss": 0.21344661712646484, "mean_token_accuracy": 0.9137663394212723, "num_tokens": 16591920.0, "step": 1345 }, { "entropy": 1.5427050590515137, "epoch": 0.708794102159031, "grad_norm": 0.2940306067466736, "learning_rate": 0.00019761989752392053, "loss": 0.1942479908466339, "mean_token_accuracy": 0.9190978854894638, "num_tokens": 16604256.0, "step": 1346 }, { "entropy": 1.5427431166172028, "epoch": 0.7093206951026856, "grad_norm": 0.3436744809150696, "learning_rate": 0.00019761488529102057, "loss": 0.2245483100414276, "mean_token_accuracy": 0.909973606467247, "num_tokens": 16616592.0, "step": 1347 }, { "entropy": 1.4897418022155762, "epoch": 0.7098472880463402, "grad_norm": 0.34564313292503357, "learning_rate": 0.0001976098678569355, "loss": 0.23059901595115662, "mean_token_accuracy": 0.9069952964782715, "num_tokens": 16628928.0, "step": 1348 }, { "entropy": 1.5078385174274445, "epoch": 0.7103738809899948, "grad_norm": 0.32199203968048096, "learning_rate": 0.0001976048452219632, "loss": 0.22921977937221527, "mean_token_accuracy": 0.9082883149385452, "num_tokens": 16641264.0, "step": 1349 }, { "entropy": 1.5083224773406982, "epoch": 0.7109004739336493, "grad_norm": 0.3183170258998871, "learning_rate": 0.00019759981738640185, "loss": 0.22415608167648315, "mean_token_accuracy": 0.9100949168205261, "num_tokens": 16653600.0, "step": 1350 }, { "entropy": 1.5398178398609161, "epoch": 0.7114270668773038, "grad_norm": 0.30399900674819946, "learning_rate": 0.0001975947843505499, "loss": 0.22306974232196808, "mean_token_accuracy": 0.9138671904802322, "num_tokens": 16665936.0, "step": 1351 }, { "entropy": 1.535412222146988, "epoch": 0.7119536598209584, "grad_norm": 0.2907712757587433, "learning_rate": 0.00019758974611470615, "loss": 0.2197205275297165, "mean_token_accuracy": 0.9130839556455612, "num_tokens": 16678272.0, "step": 1352 }, { "entropy": 1.4855974614620209, "epoch": 0.7124802527646129, "grad_norm": 0.28864648938179016, "learning_rate": 0.0001975847026791697, "loss": 0.21561571955680847, "mean_token_accuracy": 0.9168848842382431, "num_tokens": 16690608.0, "step": 1353 }, { "entropy": 1.453218251466751, "epoch": 0.7130068457082676, "grad_norm": 0.3135017454624176, "learning_rate": 0.00019757965404423994, "loss": 0.2011297047138214, "mean_token_accuracy": 0.9190320074558258, "num_tokens": 16702944.0, "step": 1354 }, { "entropy": 1.4790661036968231, "epoch": 0.7135334386519221, "grad_norm": 0.3001917004585266, "learning_rate": 0.00019757460021021655, "loss": 0.23639211058616638, "mean_token_accuracy": 0.9105001240968704, "num_tokens": 16715280.0, "step": 1355 }, { "entropy": 1.496882289648056, "epoch": 0.7140600315955766, "grad_norm": 0.31785574555397034, "learning_rate": 0.00019756954117739956, "loss": 0.2306048721075058, "mean_token_accuracy": 0.9150114953517914, "num_tokens": 16727616.0, "step": 1356 }, { "entropy": 1.4668599963188171, "epoch": 0.7145866245392312, "grad_norm": 0.29470139741897583, "learning_rate": 0.00019756447694608932, "loss": 0.21168065071105957, "mean_token_accuracy": 0.9137952625751495, "num_tokens": 16739952.0, "step": 1357 }, { "entropy": 1.422877013683319, "epoch": 0.7151132174828857, "grad_norm": 0.27277153730392456, "learning_rate": 0.00019755940751658643, "loss": 0.20774061977863312, "mean_token_accuracy": 0.9166775196790695, "num_tokens": 16752288.0, "step": 1358 }, { "entropy": 1.4244271516799927, "epoch": 0.7156398104265402, "grad_norm": 0.31778132915496826, "learning_rate": 0.00019755433288919187, "loss": 0.231976717710495, "mean_token_accuracy": 0.9075390994548798, "num_tokens": 16764624.0, "step": 1359 }, { "entropy": 1.4513772428035736, "epoch": 0.7161664033701949, "grad_norm": 0.30516210198402405, "learning_rate": 0.0001975492530642069, "loss": 0.20754879713058472, "mean_token_accuracy": 0.9216670095920563, "num_tokens": 16776960.0, "step": 1360 }, { "entropy": 1.4767080545425415, "epoch": 0.7166929963138494, "grad_norm": 0.3156355917453766, "learning_rate": 0.00019754416804193298, "loss": 0.20898932218551636, "mean_token_accuracy": 0.9173450469970703, "num_tokens": 16789296.0, "step": 1361 }, { "entropy": 1.4257088005542755, "epoch": 0.717219589257504, "grad_norm": 0.33443206548690796, "learning_rate": 0.0001975390778226721, "loss": 0.237446129322052, "mean_token_accuracy": 0.9077172726392746, "num_tokens": 16801632.0, "step": 1362 }, { "entropy": 1.393272042274475, "epoch": 0.7177461822011585, "grad_norm": 0.30247074365615845, "learning_rate": 0.00019753398240672637, "loss": 0.21317076683044434, "mean_token_accuracy": 0.9131140112876892, "num_tokens": 16813968.0, "step": 1363 }, { "entropy": 1.431013286113739, "epoch": 0.718272775144813, "grad_norm": 0.29114142060279846, "learning_rate": 0.0001975288817943983, "loss": 0.19287830591201782, "mean_token_accuracy": 0.9247073382139206, "num_tokens": 16826304.0, "step": 1364 }, { "entropy": 1.3813497424125671, "epoch": 0.7187993680884676, "grad_norm": 0.2997731566429138, "learning_rate": 0.00019752377598599067, "loss": 0.2021138221025467, "mean_token_accuracy": 0.9203190356492996, "num_tokens": 16838640.0, "step": 1365 }, { "entropy": 1.4252038598060608, "epoch": 0.7193259610321222, "grad_norm": 0.3252887725830078, "learning_rate": 0.0001975186649818066, "loss": 0.20873992145061493, "mean_token_accuracy": 0.912327915430069, "num_tokens": 16850976.0, "step": 1366 }, { "entropy": 1.4511545896530151, "epoch": 0.7198525539757767, "grad_norm": 0.34324178099632263, "learning_rate": 0.00019751354878214946, "loss": 0.21222266554832458, "mean_token_accuracy": 0.9157299846410751, "num_tokens": 16863312.0, "step": 1367 }, { "entropy": 1.3630057871341705, "epoch": 0.7203791469194313, "grad_norm": 0.37623706459999084, "learning_rate": 0.00019750842738732304, "loss": 0.2201295793056488, "mean_token_accuracy": 0.9165831059217453, "num_tokens": 16875648.0, "step": 1368 }, { "entropy": 1.3505005836486816, "epoch": 0.7209057398630858, "grad_norm": 0.30142372846603394, "learning_rate": 0.0001975033007976313, "loss": 0.22212043404579163, "mean_token_accuracy": 0.9122855514287949, "num_tokens": 16887984.0, "step": 1369 }, { "entropy": 1.4169504642486572, "epoch": 0.7214323328067404, "grad_norm": 0.3326164782047272, "learning_rate": 0.0001974981690133786, "loss": 0.22192654013633728, "mean_token_accuracy": 0.9108520150184631, "num_tokens": 16900320.0, "step": 1370 }, { "entropy": 1.367185264825821, "epoch": 0.721958925750395, "grad_norm": 0.33256617188453674, "learning_rate": 0.00019749303203486958, "loss": 0.24168333411216736, "mean_token_accuracy": 0.9047919362783432, "num_tokens": 16912656.0, "step": 1371 }, { "entropy": 1.3614123463630676, "epoch": 0.7224855186940495, "grad_norm": 0.3197641670703888, "learning_rate": 0.00019748788986240917, "loss": 0.23665747046470642, "mean_token_accuracy": 0.9026706665754318, "num_tokens": 16924992.0, "step": 1372 }, { "entropy": 1.3906526267528534, "epoch": 0.7230121116377041, "grad_norm": 0.29753339290618896, "learning_rate": 0.00019748274249630269, "loss": 0.19765980541706085, "mean_token_accuracy": 0.9235783219337463, "num_tokens": 16937328.0, "step": 1373 }, { "entropy": 1.3462652564048767, "epoch": 0.7235387045813586, "grad_norm": 0.2804873585700989, "learning_rate": 0.00019747758993685568, "loss": 0.22064946591854095, "mean_token_accuracy": 0.9110289812088013, "num_tokens": 16949664.0, "step": 1374 }, { "entropy": 1.4082630276679993, "epoch": 0.7240652975250131, "grad_norm": 0.3095674216747284, "learning_rate": 0.000197472432184374, "loss": 0.20987483859062195, "mean_token_accuracy": 0.9188564568758011, "num_tokens": 16962000.0, "step": 1375 }, { "entropy": 1.304635614156723, "epoch": 0.7245918904686677, "grad_norm": 0.2778051197528839, "learning_rate": 0.00019746726923916387, "loss": 0.21651524305343628, "mean_token_accuracy": 0.9125857651233673, "num_tokens": 16974336.0, "step": 1376 }, { "entropy": 1.3015822768211365, "epoch": 0.7251184834123223, "grad_norm": 0.2806200683116913, "learning_rate": 0.00019746210110153172, "loss": 0.22142334282398224, "mean_token_accuracy": 0.911768451333046, "num_tokens": 16986672.0, "step": 1377 }, { "entropy": 1.3526243567466736, "epoch": 0.7256450763559769, "grad_norm": 0.3183799684047699, "learning_rate": 0.0001974569277717844, "loss": 0.2256852686405182, "mean_token_accuracy": 0.9073309451341629, "num_tokens": 16999008.0, "step": 1378 }, { "entropy": 1.3906278908252716, "epoch": 0.7261716692996314, "grad_norm": 0.2876151204109192, "learning_rate": 0.00019745174925022904, "loss": 0.2028118073940277, "mean_token_accuracy": 0.923457607626915, "num_tokens": 17011344.0, "step": 1379 }, { "entropy": 1.350665271282196, "epoch": 0.7266982622432859, "grad_norm": 0.33748704195022583, "learning_rate": 0.00019744656553717305, "loss": 0.2175031304359436, "mean_token_accuracy": 0.9140133857727051, "num_tokens": 17023680.0, "step": 1380 }, { "entropy": 1.3705949485301971, "epoch": 0.7272248551869405, "grad_norm": 0.3174329400062561, "learning_rate": 0.00019744137663292412, "loss": 0.20505183935165405, "mean_token_accuracy": 0.916661724448204, "num_tokens": 17036016.0, "step": 1381 }, { "entropy": 1.3908927738666534, "epoch": 0.727751448130595, "grad_norm": 0.31065794825553894, "learning_rate": 0.00019743618253779033, "loss": 0.23529362678527832, "mean_token_accuracy": 0.910541832447052, "num_tokens": 17048352.0, "step": 1382 }, { "entropy": 1.3258641958236694, "epoch": 0.7282780410742496, "grad_norm": 0.26997655630111694, "learning_rate": 0.00019743098325207995, "loss": 0.18447992205619812, "mean_token_accuracy": 0.9224408715963364, "num_tokens": 17060688.0, "step": 1383 }, { "entropy": 1.3685748875141144, "epoch": 0.7288046340179042, "grad_norm": 0.3111379146575928, "learning_rate": 0.00019742577877610173, "loss": 0.22453925013542175, "mean_token_accuracy": 0.9133676290512085, "num_tokens": 17073024.0, "step": 1384 }, { "entropy": 1.42083340883255, "epoch": 0.7293312269615587, "grad_norm": 0.331272691488266, "learning_rate": 0.00019742056911016456, "loss": 0.23528197407722473, "mean_token_accuracy": 0.9075358361005783, "num_tokens": 17085360.0, "step": 1385 }, { "entropy": 1.4835380911827087, "epoch": 0.7298578199052133, "grad_norm": 0.30057939887046814, "learning_rate": 0.0001974153542545777, "loss": 0.19702467322349548, "mean_token_accuracy": 0.9221197068691254, "num_tokens": 17097696.0, "step": 1386 }, { "entropy": 1.412318229675293, "epoch": 0.7303844128488678, "grad_norm": 0.314919650554657, "learning_rate": 0.00019741013420965077, "loss": 0.22496280074119568, "mean_token_accuracy": 0.9107683897018433, "num_tokens": 17110032.0, "step": 1387 }, { "entropy": 1.5203742980957031, "epoch": 0.7309110057925223, "grad_norm": 0.4578418433666229, "learning_rate": 0.00019740490897569366, "loss": 0.22902803122997284, "mean_token_accuracy": 0.9130762368440628, "num_tokens": 17122368.0, "step": 1388 }, { "entropy": 1.496030032634735, "epoch": 0.731437598736177, "grad_norm": 0.29055219888687134, "learning_rate": 0.00019739967855301652, "loss": 0.21085382997989655, "mean_token_accuracy": 0.9122315496206284, "num_tokens": 17134704.0, "step": 1389 }, { "entropy": 1.4665674567222595, "epoch": 0.7319641916798315, "grad_norm": 0.2788514494895935, "learning_rate": 0.0001973944429419299, "loss": 0.20301197469234467, "mean_token_accuracy": 0.9215195178985596, "num_tokens": 17147040.0, "step": 1390 }, { "entropy": 1.5158916115760803, "epoch": 0.732490784623486, "grad_norm": 0.3139953315258026, "learning_rate": 0.00019738920214274454, "loss": 0.20764051377773285, "mean_token_accuracy": 0.915527880191803, "num_tokens": 17159376.0, "step": 1391 }, { "entropy": 1.5249950289726257, "epoch": 0.7330173775671406, "grad_norm": 0.30590322613716125, "learning_rate": 0.00019738395615577161, "loss": 0.22601057589054108, "mean_token_accuracy": 0.9111659973859787, "num_tokens": 17171712.0, "step": 1392 }, { "entropy": 1.468850463628769, "epoch": 0.7335439705107951, "grad_norm": 0.311515212059021, "learning_rate": 0.00019737870498132248, "loss": 0.2210465669631958, "mean_token_accuracy": 0.9097635447978973, "num_tokens": 17184048.0, "step": 1393 }, { "entropy": 1.5013999938964844, "epoch": 0.7340705634544498, "grad_norm": 0.3101951479911804, "learning_rate": 0.00019737344861970896, "loss": 0.21400384604930878, "mean_token_accuracy": 0.9109934121370316, "num_tokens": 17196384.0, "step": 1394 }, { "entropy": 1.4603233933448792, "epoch": 0.7345971563981043, "grad_norm": 0.26839688420295715, "learning_rate": 0.00019736818707124303, "loss": 0.1959075927734375, "mean_token_accuracy": 0.9210042357444763, "num_tokens": 17208720.0, "step": 1395 }, { "entropy": 1.513748586177826, "epoch": 0.7351237493417588, "grad_norm": 0.3097459673881531, "learning_rate": 0.00019736292033623704, "loss": 0.2226242572069168, "mean_token_accuracy": 0.9143490940332413, "num_tokens": 17221056.0, "step": 1396 }, { "entropy": 1.4970153272151947, "epoch": 0.7356503422854134, "grad_norm": 0.3178339898586273, "learning_rate": 0.00019735764841500368, "loss": 0.22419294714927673, "mean_token_accuracy": 0.9115694165229797, "num_tokens": 17233392.0, "step": 1397 }, { "entropy": 1.4637455344200134, "epoch": 0.7361769352290679, "grad_norm": 0.3103068768978119, "learning_rate": 0.0001973523713078559, "loss": 0.2213975489139557, "mean_token_accuracy": 0.908700242638588, "num_tokens": 17245728.0, "step": 1398 }, { "entropy": 1.4048950970172882, "epoch": 0.7367035281727224, "grad_norm": 0.3316826820373535, "learning_rate": 0.00019734708901510695, "loss": 0.22181765735149384, "mean_token_accuracy": 0.9124202877283096, "num_tokens": 17258064.0, "step": 1399 }, { "entropy": 1.400584727525711, "epoch": 0.7372301211163771, "grad_norm": 0.30288171768188477, "learning_rate": 0.0001973418015370704, "loss": 0.23632709681987762, "mean_token_accuracy": 0.903136819601059, "num_tokens": 17270400.0, "step": 1400 }, { "entropy": 1.4175618290901184, "epoch": 0.7377567140600316, "grad_norm": 0.2811354696750641, "learning_rate": 0.00019733650887406018, "loss": 0.21318787336349487, "mean_token_accuracy": 0.9126076847314835, "num_tokens": 17282736.0, "step": 1401 }, { "entropy": 1.4151119589805603, "epoch": 0.7382833070036862, "grad_norm": 0.2701869010925293, "learning_rate": 0.00019733121102639048, "loss": 0.21690967679023743, "mean_token_accuracy": 0.9093466997146606, "num_tokens": 17295072.0, "step": 1402 }, { "entropy": 1.3918836414813995, "epoch": 0.7388098999473407, "grad_norm": 0.27023303508758545, "learning_rate": 0.00019732590799437577, "loss": 0.18338678777217865, "mean_token_accuracy": 0.9283169507980347, "num_tokens": 17307408.0, "step": 1403 }, { "entropy": 1.4320692718029022, "epoch": 0.7393364928909952, "grad_norm": 0.26482948660850525, "learning_rate": 0.00019732059977833088, "loss": 0.2143803983926773, "mean_token_accuracy": 0.9123003780841827, "num_tokens": 17319744.0, "step": 1404 }, { "entropy": 1.4552482962608337, "epoch": 0.7398630858346498, "grad_norm": 0.3084104359149933, "learning_rate": 0.00019731528637857094, "loss": 0.21455544233322144, "mean_token_accuracy": 0.9187665581703186, "num_tokens": 17332080.0, "step": 1405 }, { "entropy": 1.362955391407013, "epoch": 0.7403896787783044, "grad_norm": 0.2885385751724243, "learning_rate": 0.00019730996779541133, "loss": 0.2053847312927246, "mean_token_accuracy": 0.9195720255374908, "num_tokens": 17344416.0, "step": 1406 }, { "entropy": 1.3902620077133179, "epoch": 0.740916271721959, "grad_norm": 0.31122514605522156, "learning_rate": 0.0001973046440291678, "loss": 0.24145708978176117, "mean_token_accuracy": 0.9063299000263214, "num_tokens": 17356752.0, "step": 1407 }, { "entropy": 1.3320231139659882, "epoch": 0.7414428646656135, "grad_norm": 0.285426527261734, "learning_rate": 0.00019729931508015647, "loss": 0.202953040599823, "mean_token_accuracy": 0.9166394174098969, "num_tokens": 17369088.0, "step": 1408 }, { "entropy": 1.3167757391929626, "epoch": 0.741969457609268, "grad_norm": 0.3052743375301361, "learning_rate": 0.00019729398094869358, "loss": 0.23250755667686462, "mean_token_accuracy": 0.909424439072609, "num_tokens": 17381424.0, "step": 1409 }, { "entropy": 1.3000437319278717, "epoch": 0.7424960505529226, "grad_norm": 0.33441463112831116, "learning_rate": 0.00019728864163509583, "loss": 0.2160688042640686, "mean_token_accuracy": 0.9094254523515701, "num_tokens": 17393760.0, "step": 1410 }, { "entropy": 1.3271216750144958, "epoch": 0.7430226434965771, "grad_norm": 0.2913570702075958, "learning_rate": 0.00019728329713968016, "loss": 0.1972869336605072, "mean_token_accuracy": 0.9217556267976761, "num_tokens": 17406096.0, "step": 1411 }, { "entropy": 1.3546923398971558, "epoch": 0.7435492364402317, "grad_norm": 0.31364765763282776, "learning_rate": 0.00019727794746276391, "loss": 0.21945282816886902, "mean_token_accuracy": 0.9129824340343475, "num_tokens": 17418432.0, "step": 1412 }, { "entropy": 1.3115905821323395, "epoch": 0.7440758293838863, "grad_norm": 0.29262346029281616, "learning_rate": 0.00019727259260466458, "loss": 0.22911304235458374, "mean_token_accuracy": 0.9053215533494949, "num_tokens": 17430768.0, "step": 1413 }, { "entropy": 1.2379891574382782, "epoch": 0.7446024223275408, "grad_norm": 0.3259003162384033, "learning_rate": 0.0001972672325657001, "loss": 0.19887758791446686, "mean_token_accuracy": 0.9181624054908752, "num_tokens": 17443104.0, "step": 1414 }, { "entropy": 1.3647005259990692, "epoch": 0.7451290152711953, "grad_norm": 0.4454919695854187, "learning_rate": 0.00019726186734618867, "loss": 0.22842802107334137, "mean_token_accuracy": 0.9110278934240341, "num_tokens": 17455440.0, "step": 1415 }, { "entropy": 1.3383563160896301, "epoch": 0.7456556082148499, "grad_norm": 0.30020466446876526, "learning_rate": 0.00019725649694644876, "loss": 0.22231580317020416, "mean_token_accuracy": 0.9075456112623215, "num_tokens": 17467776.0, "step": 1416 }, { "entropy": 1.3714047372341156, "epoch": 0.7461822011585044, "grad_norm": 0.29304370284080505, "learning_rate": 0.0001972511213667992, "loss": 0.21095791459083557, "mean_token_accuracy": 0.9166263341903687, "num_tokens": 17480112.0, "step": 1417 }, { "entropy": 1.3512816727161407, "epoch": 0.7467087941021591, "grad_norm": 0.3256070613861084, "learning_rate": 0.0001972457406075591, "loss": 0.20153497159481049, "mean_token_accuracy": 0.9194765239953995, "num_tokens": 17492448.0, "step": 1418 }, { "entropy": 1.3885486125946045, "epoch": 0.7472353870458136, "grad_norm": 0.3231737017631531, "learning_rate": 0.00019724035466904788, "loss": 0.2227013111114502, "mean_token_accuracy": 0.9109441936016083, "num_tokens": 17504784.0, "step": 1419 }, { "entropy": 1.3755838871002197, "epoch": 0.7477619799894681, "grad_norm": 0.29787546396255493, "learning_rate": 0.0001972349635515853, "loss": 0.216201514005661, "mean_token_accuracy": 0.9155356884002686, "num_tokens": 17517120.0, "step": 1420 }, { "entropy": 1.437903732061386, "epoch": 0.7482885729331227, "grad_norm": 0.33993855118751526, "learning_rate": 0.00019722956725549138, "loss": 0.21523010730743408, "mean_token_accuracy": 0.9125061631202698, "num_tokens": 17529456.0, "step": 1421 }, { "entropy": 1.333466112613678, "epoch": 0.7488151658767772, "grad_norm": 0.33743515610694885, "learning_rate": 0.00019722416578108642, "loss": 0.22355730831623077, "mean_token_accuracy": 0.9136557281017303, "num_tokens": 17541792.0, "step": 1422 }, { "entropy": 1.360717535018921, "epoch": 0.7493417588204319, "grad_norm": 0.2994014024734497, "learning_rate": 0.00019721875912869118, "loss": 0.19619853794574738, "mean_token_accuracy": 0.9230263978242874, "num_tokens": 17554128.0, "step": 1423 }, { "entropy": 1.2954363822937012, "epoch": 0.7498683517640864, "grad_norm": 0.29989591240882874, "learning_rate": 0.0001972133472986265, "loss": 0.2181311547756195, "mean_token_accuracy": 0.9170015305280685, "num_tokens": 17566464.0, "step": 1424 }, { "entropy": 1.380856215953827, "epoch": 0.7503949447077409, "grad_norm": 0.28764021396636963, "learning_rate": 0.00019720793029121377, "loss": 0.21031011641025543, "mean_token_accuracy": 0.9177572429180145, "num_tokens": 17578800.0, "step": 1425 }, { "entropy": 1.3035545349121094, "epoch": 0.7509215376513955, "grad_norm": 0.2988784611225128, "learning_rate": 0.00019720250810677446, "loss": 0.20998632907867432, "mean_token_accuracy": 0.9130989611148834, "num_tokens": 17591136.0, "step": 1426 }, { "entropy": 1.289101094007492, "epoch": 0.75144813059505, "grad_norm": 0.49617183208465576, "learning_rate": 0.0001971970807456305, "loss": 0.21026289463043213, "mean_token_accuracy": 0.9138355553150177, "num_tokens": 17603472.0, "step": 1427 }, { "entropy": 1.3593553006649017, "epoch": 0.7519747235387045, "grad_norm": 0.3344785273075104, "learning_rate": 0.0001971916482081041, "loss": 0.20339743793010712, "mean_token_accuracy": 0.9177296459674835, "num_tokens": 17615808.0, "step": 1428 }, { "entropy": 1.3161483705043793, "epoch": 0.7525013164823592, "grad_norm": 0.3118573725223541, "learning_rate": 0.00019718621049451772, "loss": 0.2201179563999176, "mean_token_accuracy": 0.9167029410600662, "num_tokens": 17628144.0, "step": 1429 }, { "entropy": 1.3809407949447632, "epoch": 0.7530279094260137, "grad_norm": 0.3208526074886322, "learning_rate": 0.00019718076760519423, "loss": 0.23530805110931396, "mean_token_accuracy": 0.9093427956104279, "num_tokens": 17640480.0, "step": 1430 }, { "entropy": 1.3892112076282501, "epoch": 0.7535545023696683, "grad_norm": 0.2703491747379303, "learning_rate": 0.00019717531954045663, "loss": 0.2121361941099167, "mean_token_accuracy": 0.916591003537178, "num_tokens": 17652816.0, "step": 1431 }, { "entropy": 1.464809536933899, "epoch": 0.7540810953133228, "grad_norm": 0.2980828285217285, "learning_rate": 0.00019716986630062842, "loss": 0.21547271311283112, "mean_token_accuracy": 0.9138219356536865, "num_tokens": 17665152.0, "step": 1432 }, { "entropy": 1.4611221253871918, "epoch": 0.7546076882569773, "grad_norm": 0.3190062642097473, "learning_rate": 0.00019716440788603332, "loss": 0.22262822091579437, "mean_token_accuracy": 0.9171289652585983, "num_tokens": 17677488.0, "step": 1433 }, { "entropy": 1.4677778780460358, "epoch": 0.7551342812006319, "grad_norm": 0.2803551256656647, "learning_rate": 0.00019715894429699537, "loss": 0.2030690461397171, "mean_token_accuracy": 0.9211814850568771, "num_tokens": 17689824.0, "step": 1434 }, { "entropy": 1.546930730342865, "epoch": 0.7556608741442865, "grad_norm": 0.3004758954048157, "learning_rate": 0.00019715347553383888, "loss": 0.21929655969142914, "mean_token_accuracy": 0.9147268533706665, "num_tokens": 17702160.0, "step": 1435 }, { "entropy": 1.458657145500183, "epoch": 0.756187467087941, "grad_norm": 0.2918381094932556, "learning_rate": 0.00019714800159688852, "loss": 0.20412471890449524, "mean_token_accuracy": 0.9208769351243973, "num_tokens": 17714496.0, "step": 1436 }, { "entropy": 1.4661605954170227, "epoch": 0.7567140600315956, "grad_norm": 0.28824299573898315, "learning_rate": 0.00019714252248646924, "loss": 0.19737893342971802, "mean_token_accuracy": 0.9271862953901291, "num_tokens": 17726832.0, "step": 1437 }, { "entropy": 1.4540847837924957, "epoch": 0.7572406529752501, "grad_norm": 0.2962500751018524, "learning_rate": 0.00019713703820290634, "loss": 0.21638396382331848, "mean_token_accuracy": 0.9159590601921082, "num_tokens": 17739168.0, "step": 1438 }, { "entropy": 1.4231859147548676, "epoch": 0.7577672459189047, "grad_norm": 0.29495999217033386, "learning_rate": 0.00019713154874652532, "loss": 0.2159111201763153, "mean_token_accuracy": 0.9145191609859467, "num_tokens": 17751504.0, "step": 1439 }, { "entropy": 1.3984394371509552, "epoch": 0.7582938388625592, "grad_norm": 0.3085009753704071, "learning_rate": 0.0001971260541176521, "loss": 0.2231639325618744, "mean_token_accuracy": 0.9079516977071762, "num_tokens": 17763840.0, "step": 1440 }, { "entropy": 1.4092283248901367, "epoch": 0.7588204318062138, "grad_norm": 0.31046876311302185, "learning_rate": 0.00019712055431661286, "loss": 0.21453410387039185, "mean_token_accuracy": 0.916040763258934, "num_tokens": 17776176.0, "step": 1441 }, { "entropy": 1.3918389678001404, "epoch": 0.7593470247498684, "grad_norm": 0.3046187460422516, "learning_rate": 0.00019711504934373408, "loss": 0.20514801144599915, "mean_token_accuracy": 0.9181930124759674, "num_tokens": 17788512.0, "step": 1442 }, { "entropy": 1.3869245946407318, "epoch": 0.7598736176935229, "grad_norm": 0.31358590722084045, "learning_rate": 0.00019710953919934256, "loss": 0.22413912415504456, "mean_token_accuracy": 0.9102539569139481, "num_tokens": 17800848.0, "step": 1443 }, { "entropy": 1.3643006086349487, "epoch": 0.7604002106371774, "grad_norm": 0.27224990725517273, "learning_rate": 0.00019710402388376544, "loss": 0.20147213339805603, "mean_token_accuracy": 0.9196710139513016, "num_tokens": 17813184.0, "step": 1444 }, { "entropy": 1.39336559176445, "epoch": 0.760926803580832, "grad_norm": 0.3104258179664612, "learning_rate": 0.00019709850339733008, "loss": 0.21504773199558258, "mean_token_accuracy": 0.9135936945676804, "num_tokens": 17825520.0, "step": 1445 }, { "entropy": 1.3767728209495544, "epoch": 0.7614533965244866, "grad_norm": 0.3152048587799072, "learning_rate": 0.0001970929777403642, "loss": 0.221971333026886, "mean_token_accuracy": 0.911506250500679, "num_tokens": 17837856.0, "step": 1446 }, { "entropy": 1.4271937906742096, "epoch": 0.7619799894681412, "grad_norm": 0.3253970444202423, "learning_rate": 0.00019708744691319588, "loss": 0.2253606915473938, "mean_token_accuracy": 0.9094466418027878, "num_tokens": 17850192.0, "step": 1447 }, { "entropy": 1.3933376669883728, "epoch": 0.7625065824117957, "grad_norm": 0.3199850022792816, "learning_rate": 0.00019708191091615343, "loss": 0.21662366390228271, "mean_token_accuracy": 0.9175620973110199, "num_tokens": 17862528.0, "step": 1448 }, { "entropy": 1.433942288160324, "epoch": 0.7630331753554502, "grad_norm": 0.2839816212654114, "learning_rate": 0.00019707636974956546, "loss": 0.20464417338371277, "mean_token_accuracy": 0.9186283946037292, "num_tokens": 17874864.0, "step": 1449 }, { "entropy": 1.3883062601089478, "epoch": 0.7635597682991048, "grad_norm": 0.3059125542640686, "learning_rate": 0.00019707082341376093, "loss": 0.21790815889835358, "mean_token_accuracy": 0.9127152860164642, "num_tokens": 17887200.0, "step": 1450 }, { "entropy": 1.4840424954891205, "epoch": 0.7640863612427593, "grad_norm": 0.317634642124176, "learning_rate": 0.0001970652719090691, "loss": 0.22078271210193634, "mean_token_accuracy": 0.9099593609571457, "num_tokens": 17899536.0, "step": 1451 }, { "entropy": 1.373614490032196, "epoch": 0.764612954186414, "grad_norm": 0.2764304280281067, "learning_rate": 0.00019705971523581957, "loss": 0.20861467719078064, "mean_token_accuracy": 0.9210799187421799, "num_tokens": 17911872.0, "step": 1452 }, { "entropy": 1.4546839594841003, "epoch": 0.7651395471300685, "grad_norm": 0.30617302656173706, "learning_rate": 0.00019705415339434212, "loss": 0.21506822109222412, "mean_token_accuracy": 0.9104336351156235, "num_tokens": 17924208.0, "step": 1453 }, { "entropy": 1.46762016415596, "epoch": 0.765666140073723, "grad_norm": 0.33141979575157166, "learning_rate": 0.000197048586384967, "loss": 0.23449833691120148, "mean_token_accuracy": 0.909214973449707, "num_tokens": 17936544.0, "step": 1454 }, { "entropy": 1.3759736120700836, "epoch": 0.7661927330173776, "grad_norm": 0.28817251324653625, "learning_rate": 0.00019704301420802467, "loss": 0.2031758576631546, "mean_token_accuracy": 0.9166503101587296, "num_tokens": 17948880.0, "step": 1455 }, { "entropy": 1.4604673385620117, "epoch": 0.7667193259610321, "grad_norm": 0.28507548570632935, "learning_rate": 0.0001970374368638459, "loss": 0.21905720233917236, "mean_token_accuracy": 0.9121448248624802, "num_tokens": 17961216.0, "step": 1456 }, { "entropy": 1.4368546605110168, "epoch": 0.7672459189046866, "grad_norm": 0.3244202435016632, "learning_rate": 0.00019703185435276179, "loss": 0.21986661851406097, "mean_token_accuracy": 0.9103575944900513, "num_tokens": 17973552.0, "step": 1457 }, { "entropy": 1.4183049201965332, "epoch": 0.7677725118483413, "grad_norm": 0.3483145833015442, "learning_rate": 0.00019702626667510376, "loss": 0.2258511334657669, "mean_token_accuracy": 0.9121571332216263, "num_tokens": 17985888.0, "step": 1458 }, { "entropy": 1.4387763142585754, "epoch": 0.7682991047919958, "grad_norm": 0.30231183767318726, "learning_rate": 0.00019702067383120352, "loss": 0.20727157592773438, "mean_token_accuracy": 0.9170671254396439, "num_tokens": 17998224.0, "step": 1459 }, { "entropy": 1.3991906344890594, "epoch": 0.7688256977356503, "grad_norm": 0.3081129789352417, "learning_rate": 0.00019701507582139304, "loss": 0.2180902510881424, "mean_token_accuracy": 0.916274681687355, "num_tokens": 18010560.0, "step": 1460 }, { "entropy": 1.4099707305431366, "epoch": 0.7693522906793049, "grad_norm": 0.27477627992630005, "learning_rate": 0.00019700947264600466, "loss": 0.19322465360164642, "mean_token_accuracy": 0.9191512167453766, "num_tokens": 18022896.0, "step": 1461 }, { "entropy": 1.4558897018432617, "epoch": 0.7698788836229594, "grad_norm": 0.2677430212497711, "learning_rate": 0.00019700386430537105, "loss": 0.21823228895664215, "mean_token_accuracy": 0.9123710244894028, "num_tokens": 18035232.0, "step": 1462 }, { "entropy": 1.4174329936504364, "epoch": 0.770405476566614, "grad_norm": 0.2713851034641266, "learning_rate": 0.00019699825079982512, "loss": 0.19724853336811066, "mean_token_accuracy": 0.9200254529714584, "num_tokens": 18047568.0, "step": 1463 }, { "entropy": 1.4575957953929901, "epoch": 0.7709320695102686, "grad_norm": 0.30220046639442444, "learning_rate": 0.00019699263212970007, "loss": 0.20754371583461761, "mean_token_accuracy": 0.9198533892631531, "num_tokens": 18059904.0, "step": 1464 }, { "entropy": 1.450849562883377, "epoch": 0.7714586624539231, "grad_norm": 0.28346338868141174, "learning_rate": 0.0001969870082953295, "loss": 0.19828161597251892, "mean_token_accuracy": 0.9172644019126892, "num_tokens": 18072240.0, "step": 1465 }, { "entropy": 1.4658414423465729, "epoch": 0.7719852553975777, "grad_norm": 0.3004949986934662, "learning_rate": 0.00019698137929704724, "loss": 0.20767343044281006, "mean_token_accuracy": 0.9210254102945328, "num_tokens": 18084576.0, "step": 1466 }, { "entropy": 1.4050607681274414, "epoch": 0.7725118483412322, "grad_norm": 0.2896452248096466, "learning_rate": 0.00019697574513518747, "loss": 0.20795601606369019, "mean_token_accuracy": 0.914929062128067, "num_tokens": 18096912.0, "step": 1467 }, { "entropy": 1.4351738393306732, "epoch": 0.7730384412848867, "grad_norm": 0.34425756335258484, "learning_rate": 0.00019697010581008463, "loss": 0.21601206064224243, "mean_token_accuracy": 0.9149073958396912, "num_tokens": 18109248.0, "step": 1468 }, { "entropy": 1.3905524611473083, "epoch": 0.7735650342285414, "grad_norm": 0.3009505271911621, "learning_rate": 0.00019696446132207353, "loss": 0.19988638162612915, "mean_token_accuracy": 0.9213133901357651, "num_tokens": 18121584.0, "step": 1469 }, { "entropy": 1.4411927461624146, "epoch": 0.7740916271721959, "grad_norm": 0.3239229619503021, "learning_rate": 0.0001969588116714892, "loss": 0.2117571234703064, "mean_token_accuracy": 0.9106622785329819, "num_tokens": 18133920.0, "step": 1470 }, { "entropy": 1.4064708650112152, "epoch": 0.7746182201158505, "grad_norm": 0.3362599015235901, "learning_rate": 0.00019695315685866707, "loss": 0.23721855878829956, "mean_token_accuracy": 0.9070688337087631, "num_tokens": 18146256.0, "step": 1471 }, { "entropy": 1.4237781167030334, "epoch": 0.775144813059505, "grad_norm": 0.3095615804195404, "learning_rate": 0.00019694749688394281, "loss": 0.2411169707775116, "mean_token_accuracy": 0.9083186686038971, "num_tokens": 18158592.0, "step": 1472 }, { "entropy": 1.3879849016666412, "epoch": 0.7756714060031595, "grad_norm": 0.28509050607681274, "learning_rate": 0.00019694183174765245, "loss": 0.22019074857234955, "mean_token_accuracy": 0.911543145775795, "num_tokens": 18170928.0, "step": 1473 }, { "entropy": 1.3992516100406647, "epoch": 0.7761979989468141, "grad_norm": 0.3135905861854553, "learning_rate": 0.00019693616145013227, "loss": 0.2088148593902588, "mean_token_accuracy": 0.9130579680204391, "num_tokens": 18183264.0, "step": 1474 }, { "entropy": 1.3637616336345673, "epoch": 0.7767245918904687, "grad_norm": 0.26418524980545044, "learning_rate": 0.00019693048599171887, "loss": 0.20479831099510193, "mean_token_accuracy": 0.916004553437233, "num_tokens": 18195600.0, "step": 1475 }, { "entropy": 1.4390030205249786, "epoch": 0.7772511848341233, "grad_norm": 0.290937215089798, "learning_rate": 0.0001969248053727492, "loss": 0.21481530368328094, "mean_token_accuracy": 0.9162030220031738, "num_tokens": 18207936.0, "step": 1476 }, { "entropy": 1.4204131364822388, "epoch": 0.7777777777777778, "grad_norm": 0.3285602331161499, "learning_rate": 0.00019691911959356044, "loss": 0.19588018953800201, "mean_token_accuracy": 0.9232761710882187, "num_tokens": 18220272.0, "step": 1477 }, { "entropy": 1.4693542420864105, "epoch": 0.7783043707214323, "grad_norm": 0.3064950704574585, "learning_rate": 0.0001969134286544902, "loss": 0.20760740339756012, "mean_token_accuracy": 0.9132848978042603, "num_tokens": 18232608.0, "step": 1478 }, { "entropy": 1.3828904628753662, "epoch": 0.7788309636650869, "grad_norm": 0.3061995506286621, "learning_rate": 0.00019690773255587625, "loss": 0.2265746295452118, "mean_token_accuracy": 0.9108180850744247, "num_tokens": 18244944.0, "step": 1479 }, { "entropy": 1.3849403858184814, "epoch": 0.7793575566087414, "grad_norm": 0.3251616656780243, "learning_rate": 0.00019690203129805672, "loss": 0.2233261615037918, "mean_token_accuracy": 0.9125779420137405, "num_tokens": 18257280.0, "step": 1480 }, { "entropy": 1.3147023022174835, "epoch": 0.779884149552396, "grad_norm": 0.31116747856140137, "learning_rate": 0.00019689632488137016, "loss": 0.24036768078804016, "mean_token_accuracy": 0.906961664557457, "num_tokens": 18269616.0, "step": 1481 }, { "entropy": 1.3186087906360626, "epoch": 0.7804107424960506, "grad_norm": 0.30934205651283264, "learning_rate": 0.0001968906133061552, "loss": 0.21348203718662262, "mean_token_accuracy": 0.9163684844970703, "num_tokens": 18281952.0, "step": 1482 }, { "entropy": 1.3171938359737396, "epoch": 0.7809373354397051, "grad_norm": 0.3076079487800598, "learning_rate": 0.00019688489657275103, "loss": 0.22806760668754578, "mean_token_accuracy": 0.9050341248512268, "num_tokens": 18294288.0, "step": 1483 }, { "entropy": 1.331948697566986, "epoch": 0.7814639283833597, "grad_norm": 0.3263510465621948, "learning_rate": 0.0001968791746814969, "loss": 0.2278282344341278, "mean_token_accuracy": 0.9075683802366257, "num_tokens": 18306624.0, "step": 1484 }, { "entropy": 1.3975997269153595, "epoch": 0.7819905213270142, "grad_norm": 0.37345680594444275, "learning_rate": 0.00019687344763273255, "loss": 0.22596792876720428, "mean_token_accuracy": 0.913162499666214, "num_tokens": 18318960.0, "step": 1485 }, { "entropy": 1.3315426707267761, "epoch": 0.7825171142706687, "grad_norm": 0.28193777799606323, "learning_rate": 0.00019686771542679797, "loss": 0.1983056217432022, "mean_token_accuracy": 0.9222036451101303, "num_tokens": 18331296.0, "step": 1486 }, { "entropy": 1.4003748893737793, "epoch": 0.7830437072143234, "grad_norm": 0.30775102972984314, "learning_rate": 0.00019686197806403343, "loss": 0.22822785377502441, "mean_token_accuracy": 0.9109926074743271, "num_tokens": 18343632.0, "step": 1487 }, { "entropy": 1.3931090831756592, "epoch": 0.7835703001579779, "grad_norm": 0.2824244201183319, "learning_rate": 0.0001968562355447795, "loss": 0.20619836449623108, "mean_token_accuracy": 0.9165951460599899, "num_tokens": 18355968.0, "step": 1488 }, { "entropy": 1.3029468953609467, "epoch": 0.7840968931016324, "grad_norm": 0.26663464307785034, "learning_rate": 0.00019685048786937713, "loss": 0.2070493847131729, "mean_token_accuracy": 0.91603122651577, "num_tokens": 18368304.0, "step": 1489 }, { "entropy": 1.4118830561637878, "epoch": 0.784623486045287, "grad_norm": 0.2948478162288666, "learning_rate": 0.00019684473503816746, "loss": 0.2121935933828354, "mean_token_accuracy": 0.9169209152460098, "num_tokens": 18380640.0, "step": 1490 }, { "entropy": 1.5040743947029114, "epoch": 0.7851500789889415, "grad_norm": 0.33927392959594727, "learning_rate": 0.00019683897705149208, "loss": 0.23608259856700897, "mean_token_accuracy": 0.9112606197595596, "num_tokens": 18392976.0, "step": 1491 }, { "entropy": 1.388082355260849, "epoch": 0.785676671932596, "grad_norm": 0.2748982012271881, "learning_rate": 0.0001968332139096927, "loss": 0.21956929564476013, "mean_token_accuracy": 0.9111993908882141, "num_tokens": 18405312.0, "step": 1492 }, { "entropy": 1.419054538011551, "epoch": 0.7862032648762507, "grad_norm": 0.2975718379020691, "learning_rate": 0.00019682744561311163, "loss": 0.20622003078460693, "mean_token_accuracy": 0.91482774913311, "num_tokens": 18417648.0, "step": 1493 }, { "entropy": 1.3681580722332, "epoch": 0.7867298578199052, "grad_norm": 0.30167657136917114, "learning_rate": 0.00019682167216209106, "loss": 0.22527143359184265, "mean_token_accuracy": 0.9118600189685822, "num_tokens": 18429984.0, "step": 1494 }, { "entropy": 1.3992347717285156, "epoch": 0.7872564507635598, "grad_norm": 0.3023481070995331, "learning_rate": 0.00019681589355697394, "loss": 0.20631316304206848, "mean_token_accuracy": 0.9144344329833984, "num_tokens": 18442320.0, "step": 1495 }, { "entropy": 1.2978556156158447, "epoch": 0.7877830437072143, "grad_norm": 0.275492399930954, "learning_rate": 0.00019681010979810318, "loss": 0.2021515965461731, "mean_token_accuracy": 0.9172556847333908, "num_tokens": 18454656.0, "step": 1496 }, { "entropy": 1.2966987490653992, "epoch": 0.7883096366508688, "grad_norm": 0.3461536169052124, "learning_rate": 0.00019680432088582217, "loss": 0.22693704068660736, "mean_token_accuracy": 0.9091721177101135, "num_tokens": 18466992.0, "step": 1497 }, { "entropy": 1.304772973060608, "epoch": 0.7888362295945235, "grad_norm": 0.32779547572135925, "learning_rate": 0.00019679852682047457, "loss": 0.21427524089813232, "mean_token_accuracy": 0.9151846766471863, "num_tokens": 18479328.0, "step": 1498 }, { "entropy": 1.2882267534732819, "epoch": 0.789362822538178, "grad_norm": 0.3116947114467621, "learning_rate": 0.00019679272760240435, "loss": 0.20784853398799896, "mean_token_accuracy": 0.9149093627929688, "num_tokens": 18491664.0, "step": 1499 }, { "entropy": 1.263739138841629, "epoch": 0.7898894154818326, "grad_norm": 0.443194717168808, "learning_rate": 0.0001967869232319557, "loss": 0.23977030813694, "mean_token_accuracy": 0.9084160029888153, "num_tokens": 18504000.0, "step": 1500 }, { "entropy": 1.2093487679958344, "epoch": 0.7904160084254871, "grad_norm": 0.29420503973960876, "learning_rate": 0.0001967811137094733, "loss": 0.22335118055343628, "mean_token_accuracy": 0.909618929028511, "num_tokens": 18516336.0, "step": 1501 }, { "entropy": 1.271395206451416, "epoch": 0.7909426013691416, "grad_norm": 0.5013836026191711, "learning_rate": 0.00019677529903530197, "loss": 0.2110762596130371, "mean_token_accuracy": 0.9183898121118546, "num_tokens": 18528672.0, "step": 1502 }, { "entropy": 1.2578312754631042, "epoch": 0.7914691943127962, "grad_norm": 0.37272414565086365, "learning_rate": 0.0001967694792097869, "loss": 0.22164121270179749, "mean_token_accuracy": 0.9116562008857727, "num_tokens": 18541008.0, "step": 1503 }, { "entropy": 1.2144514918327332, "epoch": 0.7919957872564508, "grad_norm": 0.3145962059497833, "learning_rate": 0.0001967636542332736, "loss": 0.22305795550346375, "mean_token_accuracy": 0.9156023114919662, "num_tokens": 18553344.0, "step": 1504 }, { "entropy": 1.2401383221149445, "epoch": 0.7925223802001053, "grad_norm": 0.2835533022880554, "learning_rate": 0.00019675782410610778, "loss": 0.19279327988624573, "mean_token_accuracy": 0.926255002617836, "num_tokens": 18565680.0, "step": 1505 }, { "entropy": 1.2049389481544495, "epoch": 0.7930489731437599, "grad_norm": 0.2632310092449188, "learning_rate": 0.00019675198882863567, "loss": 0.2010316103696823, "mean_token_accuracy": 0.91452956199646, "num_tokens": 18578016.0, "step": 1506 }, { "entropy": 1.249726414680481, "epoch": 0.7935755660874144, "grad_norm": 0.30521342158317566, "learning_rate": 0.0001967461484012036, "loss": 0.23277787864208221, "mean_token_accuracy": 0.9076357632875443, "num_tokens": 18590352.0, "step": 1507 }, { "entropy": 1.1978009939193726, "epoch": 0.794102159031069, "grad_norm": 0.2853034734725952, "learning_rate": 0.00019674030282415826, "loss": 0.2127259522676468, "mean_token_accuracy": 0.9155232310295105, "num_tokens": 18602688.0, "step": 1508 }, { "entropy": 1.25815749168396, "epoch": 0.7946287519747235, "grad_norm": 0.28645238280296326, "learning_rate": 0.00019673445209784677, "loss": 0.22002597153186798, "mean_token_accuracy": 0.9130334705114365, "num_tokens": 18615024.0, "step": 1509 }, { "entropy": 1.3180667161941528, "epoch": 0.7951553449183781, "grad_norm": 0.2906380891799927, "learning_rate": 0.00019672859622261633, "loss": 0.22877947986125946, "mean_token_accuracy": 0.912013441324234, "num_tokens": 18627360.0, "step": 1510 }, { "entropy": 1.2853264808654785, "epoch": 0.7956819378620327, "grad_norm": 0.28856080770492554, "learning_rate": 0.00019672273519881465, "loss": 0.2222394347190857, "mean_token_accuracy": 0.9078328162431717, "num_tokens": 18639696.0, "step": 1511 }, { "entropy": 1.2696054577827454, "epoch": 0.7962085308056872, "grad_norm": 0.30683693289756775, "learning_rate": 0.0001967168690267896, "loss": 0.22363853454589844, "mean_token_accuracy": 0.9149999022483826, "num_tokens": 18652032.0, "step": 1512 }, { "entropy": 1.272040843963623, "epoch": 0.7967351237493417, "grad_norm": 0.3236723840236664, "learning_rate": 0.0001967109977068895, "loss": 0.21476420760154724, "mean_token_accuracy": 0.9179616123437881, "num_tokens": 18664368.0, "step": 1513 }, { "entropy": 1.260970801115036, "epoch": 0.7972617166929963, "grad_norm": 0.30413469672203064, "learning_rate": 0.00019670512123946284, "loss": 0.22492626309394836, "mean_token_accuracy": 0.9107203483581543, "num_tokens": 18676704.0, "step": 1514 }, { "entropy": 1.2300290167331696, "epoch": 0.7977883096366508, "grad_norm": 0.2895817458629608, "learning_rate": 0.00019669923962485847, "loss": 0.2138168066740036, "mean_token_accuracy": 0.9164409637451172, "num_tokens": 18689040.0, "step": 1515 }, { "entropy": 1.2246987521648407, "epoch": 0.7983149025803055, "grad_norm": 0.30868765711784363, "learning_rate": 0.0001966933528634256, "loss": 0.2062627673149109, "mean_token_accuracy": 0.9158836156129837, "num_tokens": 18701376.0, "step": 1516 }, { "entropy": 1.24353489279747, "epoch": 0.79884149552396, "grad_norm": 0.2896019518375397, "learning_rate": 0.00019668746095551364, "loss": 0.2127014845609665, "mean_token_accuracy": 0.9154282063245773, "num_tokens": 18713712.0, "step": 1517 }, { "entropy": 1.219551146030426, "epoch": 0.7993680884676145, "grad_norm": 0.5301105380058289, "learning_rate": 0.0001966815639014724, "loss": 0.20765289664268494, "mean_token_accuracy": 0.9193731993436813, "num_tokens": 18726048.0, "step": 1518 }, { "entropy": 1.2230626046657562, "epoch": 0.7998946814112691, "grad_norm": 0.2891480624675751, "learning_rate": 0.00019667566170165194, "loss": 0.20567816495895386, "mean_token_accuracy": 0.9149514883756638, "num_tokens": 18738384.0, "step": 1519 }, { "entropy": 1.1955215632915497, "epoch": 0.8004212743549236, "grad_norm": 0.3952074646949768, "learning_rate": 0.00019666975435640258, "loss": 0.23236501216888428, "mean_token_accuracy": 0.910706028342247, "num_tokens": 18750720.0, "step": 1520 }, { "entropy": 1.1208319664001465, "epoch": 0.8009478672985783, "grad_norm": 0.3569393455982208, "learning_rate": 0.00019666384186607506, "loss": 0.2112501859664917, "mean_token_accuracy": 0.9126569777727127, "num_tokens": 18763056.0, "step": 1521 }, { "entropy": 1.1377290189266205, "epoch": 0.8014744602422328, "grad_norm": 0.2929931879043579, "learning_rate": 0.00019665792423102037, "loss": 0.22051754593849182, "mean_token_accuracy": 0.9091715216636658, "num_tokens": 18775392.0, "step": 1522 }, { "entropy": 1.1271924078464508, "epoch": 0.8020010531858873, "grad_norm": 0.3465351164340973, "learning_rate": 0.0001966520014515898, "loss": 0.22917094826698303, "mean_token_accuracy": 0.9075794517993927, "num_tokens": 18787728.0, "step": 1523 }, { "entropy": 1.1986294984817505, "epoch": 0.8025276461295419, "grad_norm": 0.32447630167007446, "learning_rate": 0.00019664607352813494, "loss": 0.23350387811660767, "mean_token_accuracy": 0.9076796770095825, "num_tokens": 18800064.0, "step": 1524 }, { "entropy": 1.1514316499233246, "epoch": 0.8030542390731964, "grad_norm": 0.3304944932460785, "learning_rate": 0.00019664014046100775, "loss": 0.21476618945598602, "mean_token_accuracy": 0.913004919886589, "num_tokens": 18812400.0, "step": 1525 }, { "entropy": 1.1340425908565521, "epoch": 0.8035808320168509, "grad_norm": 0.5441511869430542, "learning_rate": 0.00019663420225056035, "loss": 0.22214046120643616, "mean_token_accuracy": 0.9116765111684799, "num_tokens": 18824736.0, "step": 1526 }, { "entropy": 1.0562350451946259, "epoch": 0.8041074249605056, "grad_norm": 0.3077342212200165, "learning_rate": 0.00019662825889714533, "loss": 0.21319684386253357, "mean_token_accuracy": 0.918745294213295, "num_tokens": 18837072.0, "step": 1527 }, { "entropy": 1.0274389684200287, "epoch": 0.8046340179041601, "grad_norm": 0.3354491889476776, "learning_rate": 0.0001966223104011155, "loss": 0.2296486645936966, "mean_token_accuracy": 0.9057023078203201, "num_tokens": 18849408.0, "step": 1528 }, { "entropy": 1.0815512537956238, "epoch": 0.8051606108478147, "grad_norm": 0.3144749402999878, "learning_rate": 0.00019661635676282394, "loss": 0.229911670088768, "mean_token_accuracy": 0.9100077450275421, "num_tokens": 18861744.0, "step": 1529 }, { "entropy": 1.0930194556713104, "epoch": 0.8056872037914692, "grad_norm": 0.300818532705307, "learning_rate": 0.00019661039798262415, "loss": 0.20994170010089874, "mean_token_accuracy": 0.9187563508749008, "num_tokens": 18874080.0, "step": 1530 }, { "entropy": 1.0869486331939697, "epoch": 0.8062137967351237, "grad_norm": 0.28593873977661133, "learning_rate": 0.00019660443406086984, "loss": 0.20231741666793823, "mean_token_accuracy": 0.918257012963295, "num_tokens": 18886416.0, "step": 1531 }, { "entropy": 1.0835871398448944, "epoch": 0.8067403896787783, "grad_norm": 0.7419033050537109, "learning_rate": 0.000196598464997915, "loss": 0.2157197892665863, "mean_token_accuracy": 0.9135694205760956, "num_tokens": 18898752.0, "step": 1532 }, { "entropy": 1.1274356842041016, "epoch": 0.8072669826224329, "grad_norm": 0.31080278754234314, "learning_rate": 0.00019659249079411405, "loss": 0.22466787695884705, "mean_token_accuracy": 0.9107064604759216, "num_tokens": 18911088.0, "step": 1533 }, { "entropy": 1.0774615406990051, "epoch": 0.8077935755660874, "grad_norm": 0.28806376457214355, "learning_rate": 0.00019658651144982163, "loss": 0.2336619794368744, "mean_token_accuracy": 0.9125310033559799, "num_tokens": 18923424.0, "step": 1534 }, { "entropy": 1.0493130534887314, "epoch": 0.808320168509742, "grad_norm": 0.2861652672290802, "learning_rate": 0.0001965805269653927, "loss": 0.20115122199058533, "mean_token_accuracy": 0.919718474149704, "num_tokens": 18935760.0, "step": 1535 }, { "entropy": 1.0706775784492493, "epoch": 0.8088467614533965, "grad_norm": 0.29678940773010254, "learning_rate": 0.0001965745373411825, "loss": 0.21643559634685516, "mean_token_accuracy": 0.9111261665821075, "num_tokens": 18948096.0, "step": 1536 }, { "entropy": 1.0705525279045105, "epoch": 0.809373354397051, "grad_norm": 0.3051356077194214, "learning_rate": 0.0001965685425775466, "loss": 0.2151341289281845, "mean_token_accuracy": 0.9130971729755402, "num_tokens": 18960432.0, "step": 1537 }, { "entropy": 1.0797742903232574, "epoch": 0.8098999473407056, "grad_norm": 0.29696813225746155, "learning_rate": 0.0001965625426748409, "loss": 0.22983068227767944, "mean_token_accuracy": 0.9089944660663605, "num_tokens": 18972768.0, "step": 1538 }, { "entropy": 1.0420788824558258, "epoch": 0.8104265402843602, "grad_norm": 0.29141098260879517, "learning_rate": 0.00019655653763342155, "loss": 0.20703990757465363, "mean_token_accuracy": 0.9171910136938095, "num_tokens": 18985104.0, "step": 1539 }, { "entropy": 1.0945038497447968, "epoch": 0.8109531332280148, "grad_norm": 0.30959945917129517, "learning_rate": 0.00019655052745364509, "loss": 0.24617335200309753, "mean_token_accuracy": 0.9053667187690735, "num_tokens": 18997440.0, "step": 1540 }, { "entropy": 1.0674882233142853, "epoch": 0.8114797261716693, "grad_norm": 0.29151442646980286, "learning_rate": 0.00019654451213586824, "loss": 0.202132448554039, "mean_token_accuracy": 0.9202746897935867, "num_tokens": 19009776.0, "step": 1541 }, { "entropy": 1.1482883095741272, "epoch": 0.8120063191153238, "grad_norm": 0.3008717894554138, "learning_rate": 0.00019653849168044815, "loss": 0.2195252776145935, "mean_token_accuracy": 0.9127016216516495, "num_tokens": 19022112.0, "step": 1542 }, { "entropy": 1.0573867559432983, "epoch": 0.8125329120589784, "grad_norm": 0.2779742479324341, "learning_rate": 0.00019653246608774215, "loss": 0.20425541698932648, "mean_token_accuracy": 0.9176970571279526, "num_tokens": 19034448.0, "step": 1543 }, { "entropy": 1.1284627318382263, "epoch": 0.8130595050026329, "grad_norm": 0.3272855281829834, "learning_rate": 0.00019652643535810803, "loss": 0.2418060004711151, "mean_token_accuracy": 0.9060062915086746, "num_tokens": 19046784.0, "step": 1544 }, { "entropy": 1.160320371389389, "epoch": 0.8135860979462876, "grad_norm": 0.28571900725364685, "learning_rate": 0.00019652039949190372, "loss": 0.19945061206817627, "mean_token_accuracy": 0.9213592410087585, "num_tokens": 19059120.0, "step": 1545 }, { "entropy": 1.0708126425743103, "epoch": 0.8141126908899421, "grad_norm": 0.28214171528816223, "learning_rate": 0.00019651435848948762, "loss": 0.21407712996006012, "mean_token_accuracy": 0.9169910848140717, "num_tokens": 19071456.0, "step": 1546 }, { "entropy": 1.071442037820816, "epoch": 0.8146392838335966, "grad_norm": 0.27851834893226624, "learning_rate": 0.00019650831235121824, "loss": 0.20925593376159668, "mean_token_accuracy": 0.9159252196550369, "num_tokens": 19083792.0, "step": 1547 }, { "entropy": 1.1155974566936493, "epoch": 0.8151658767772512, "grad_norm": 0.3253529369831085, "learning_rate": 0.00019650226107745461, "loss": 0.21849502623081207, "mean_token_accuracy": 0.9110303372144699, "num_tokens": 19096128.0, "step": 1548 }, { "entropy": 1.0896004736423492, "epoch": 0.8156924697209057, "grad_norm": 0.28845205903053284, "learning_rate": 0.0001964962046685559, "loss": 0.22848929464817047, "mean_token_accuracy": 0.9086662530899048, "num_tokens": 19108464.0, "step": 1549 }, { "entropy": 1.0635098963975906, "epoch": 0.8162190626645603, "grad_norm": 0.3507218658924103, "learning_rate": 0.00019649014312488164, "loss": 0.22886288166046143, "mean_token_accuracy": 0.9107942432165146, "num_tokens": 19120800.0, "step": 1550 }, { "entropy": 1.0771049559116364, "epoch": 0.8167456556082149, "grad_norm": 0.3061995506286621, "learning_rate": 0.0001964840764467917, "loss": 0.22587770223617554, "mean_token_accuracy": 0.907668799161911, "num_tokens": 19133136.0, "step": 1551 }, { "entropy": 1.0604461431503296, "epoch": 0.8172722485518694, "grad_norm": 0.29044315218925476, "learning_rate": 0.00019647800463464622, "loss": 0.2082800567150116, "mean_token_accuracy": 0.9161125719547272, "num_tokens": 19145472.0, "step": 1552 }, { "entropy": 1.0522086769342422, "epoch": 0.817798841495524, "grad_norm": 0.301567405462265, "learning_rate": 0.0001964719276888056, "loss": 0.20523683726787567, "mean_token_accuracy": 0.9130432307720184, "num_tokens": 19157808.0, "step": 1553 }, { "entropy": 1.02540722489357, "epoch": 0.8183254344391785, "grad_norm": 0.29618892073631287, "learning_rate": 0.00019646584560963065, "loss": 0.22347863018512726, "mean_token_accuracy": 0.9131524860858917, "num_tokens": 19170144.0, "step": 1554 }, { "entropy": 1.0311861038208008, "epoch": 0.818852027382833, "grad_norm": 0.27861911058425903, "learning_rate": 0.00019645975839748244, "loss": 0.182900071144104, "mean_token_accuracy": 0.9252242147922516, "num_tokens": 19182480.0, "step": 1555 }, { "entropy": 1.0627757012844086, "epoch": 0.8193786203264877, "grad_norm": 0.3110608458518982, "learning_rate": 0.00019645366605272228, "loss": 0.23385684192180634, "mean_token_accuracy": 0.9053423404693604, "num_tokens": 19194816.0, "step": 1556 }, { "entropy": 1.0807601511478424, "epoch": 0.8199052132701422, "grad_norm": 0.31477105617523193, "learning_rate": 0.00019644756857571186, "loss": 0.22126808762550354, "mean_token_accuracy": 0.9116723388433456, "num_tokens": 19207152.0, "step": 1557 }, { "entropy": 1.079503744840622, "epoch": 0.8204318062137967, "grad_norm": 0.314552366733551, "learning_rate": 0.00019644146596681312, "loss": 0.22594426572322845, "mean_token_accuracy": 0.9112756550312042, "num_tokens": 19219488.0, "step": 1558 }, { "entropy": 1.0542688369750977, "epoch": 0.8209583991574513, "grad_norm": 0.30733972787857056, "learning_rate": 0.0001964353582263884, "loss": 0.22227591276168823, "mean_token_accuracy": 0.9121880233287811, "num_tokens": 19231824.0, "step": 1559 }, { "entropy": 1.0992242991924286, "epoch": 0.8214849921011058, "grad_norm": 0.29605984687805176, "learning_rate": 0.0001964292453548002, "loss": 0.22202306985855103, "mean_token_accuracy": 0.9160446226596832, "num_tokens": 19244160.0, "step": 1560 }, { "entropy": 1.1573190689086914, "epoch": 0.8220115850447604, "grad_norm": 0.3093453347682953, "learning_rate": 0.00019642312735241148, "loss": 0.22188301384449005, "mean_token_accuracy": 0.9117791652679443, "num_tokens": 19256496.0, "step": 1561 }, { "entropy": 1.0756475329399109, "epoch": 0.822538177988415, "grad_norm": 0.29175224900245667, "learning_rate": 0.00019641700421958543, "loss": 0.20454362034797668, "mean_token_accuracy": 0.9208622127771378, "num_tokens": 19268832.0, "step": 1562 }, { "entropy": 1.1309452950954437, "epoch": 0.8230647709320695, "grad_norm": 0.3055620789527893, "learning_rate": 0.00019641087595668547, "loss": 0.24093538522720337, "mean_token_accuracy": 0.9080805480480194, "num_tokens": 19281168.0, "step": 1563 }, { "entropy": 1.0666328370571136, "epoch": 0.8235913638757241, "grad_norm": 0.26273226737976074, "learning_rate": 0.00019640474256407545, "loss": 0.18816737830638885, "mean_token_accuracy": 0.9207744300365448, "num_tokens": 19293504.0, "step": 1564 }, { "entropy": 1.1276142299175262, "epoch": 0.8241179568193786, "grad_norm": 0.3050276041030884, "learning_rate": 0.0001963986040421195, "loss": 0.21849283576011658, "mean_token_accuracy": 0.9142372459173203, "num_tokens": 19305840.0, "step": 1565 }, { "entropy": 1.0887978076934814, "epoch": 0.8246445497630331, "grad_norm": 0.2735901176929474, "learning_rate": 0.00019639246039118198, "loss": 0.20344410836696625, "mean_token_accuracy": 0.9216662347316742, "num_tokens": 19318176.0, "step": 1566 }, { "entropy": 1.0880299508571625, "epoch": 0.8251711427066877, "grad_norm": 0.2992630898952484, "learning_rate": 0.00019638631161162761, "loss": 0.20155635476112366, "mean_token_accuracy": 0.9177606403827667, "num_tokens": 19330512.0, "step": 1567 }, { "entropy": 1.0990647375583649, "epoch": 0.8256977356503423, "grad_norm": 0.29473257064819336, "learning_rate": 0.00019638015770382142, "loss": 0.20519070327281952, "mean_token_accuracy": 0.9206506013870239, "num_tokens": 19342848.0, "step": 1568 }, { "entropy": 1.0590737760066986, "epoch": 0.8262243285939969, "grad_norm": 0.28194659948349, "learning_rate": 0.00019637399866812873, "loss": 0.20845578610897064, "mean_token_accuracy": 0.9180682003498077, "num_tokens": 19355184.0, "step": 1569 }, { "entropy": 1.1114600002765656, "epoch": 0.8267509215376514, "grad_norm": 0.3110455870628357, "learning_rate": 0.00019636783450491517, "loss": 0.2090432196855545, "mean_token_accuracy": 0.9182581901550293, "num_tokens": 19367520.0, "step": 1570 }, { "entropy": 1.159915953874588, "epoch": 0.8272775144813059, "grad_norm": 0.3254052400588989, "learning_rate": 0.00019636166521454668, "loss": 0.21491852402687073, "mean_token_accuracy": 0.9105751514434814, "num_tokens": 19379856.0, "step": 1571 }, { "entropy": 1.1465847194194794, "epoch": 0.8278041074249605, "grad_norm": 0.28690120577812195, "learning_rate": 0.00019635549079738946, "loss": 0.21204861998558044, "mean_token_accuracy": 0.9141225218772888, "num_tokens": 19392192.0, "step": 1572 }, { "entropy": 1.1238433420658112, "epoch": 0.8283307003686151, "grad_norm": 0.3004522919654846, "learning_rate": 0.0001963493112538101, "loss": 0.22797521948814392, "mean_token_accuracy": 0.9102497845888138, "num_tokens": 19404528.0, "step": 1573 }, { "entropy": 1.1517022848129272, "epoch": 0.8288572933122696, "grad_norm": 0.3072613477706909, "learning_rate": 0.00019634312658417538, "loss": 0.2027738243341446, "mean_token_accuracy": 0.9213471561670303, "num_tokens": 19416864.0, "step": 1574 }, { "entropy": 1.1321575045585632, "epoch": 0.8293838862559242, "grad_norm": 0.33203771710395813, "learning_rate": 0.0001963369367888525, "loss": 0.23440833389759064, "mean_token_accuracy": 0.9052640497684479, "num_tokens": 19429200.0, "step": 1575 }, { "entropy": 1.1507805287837982, "epoch": 0.8299104791995787, "grad_norm": 0.28893306851387024, "learning_rate": 0.00019633074186820886, "loss": 0.21041327714920044, "mean_token_accuracy": 0.9186779856681824, "num_tokens": 19441536.0, "step": 1576 }, { "entropy": 1.1217812597751617, "epoch": 0.8304370721432333, "grad_norm": 0.286567747592926, "learning_rate": 0.00019632454182261228, "loss": 0.20225471258163452, "mean_token_accuracy": 0.9235644489526749, "num_tokens": 19453872.0, "step": 1577 }, { "entropy": 1.1518227756023407, "epoch": 0.8309636650868878, "grad_norm": 0.30317631363868713, "learning_rate": 0.00019631833665243075, "loss": 0.22191138565540314, "mean_token_accuracy": 0.9106118381023407, "num_tokens": 19466208.0, "step": 1578 }, { "entropy": 1.164818674325943, "epoch": 0.8314902580305424, "grad_norm": 0.3264894187450409, "learning_rate": 0.0001963121263580327, "loss": 0.22096458077430725, "mean_token_accuracy": 0.9108817130327225, "num_tokens": 19478544.0, "step": 1579 }, { "entropy": 1.0784786641597748, "epoch": 0.832016850974197, "grad_norm": 0.2952364683151245, "learning_rate": 0.0001963059109397868, "loss": 0.2409459352493286, "mean_token_accuracy": 0.9058417230844498, "num_tokens": 19490880.0, "step": 1580 }, { "entropy": 1.0973447263240814, "epoch": 0.8325434439178515, "grad_norm": 0.2781769931316376, "learning_rate": 0.00019629969039806195, "loss": 0.2172403782606125, "mean_token_accuracy": 0.9110274314880371, "num_tokens": 19503216.0, "step": 1581 }, { "entropy": 1.1422053277492523, "epoch": 0.833070036861506, "grad_norm": 0.2971686124801636, "learning_rate": 0.0001962934647332275, "loss": 0.21011781692504883, "mean_token_accuracy": 0.9153971076011658, "num_tokens": 19515552.0, "step": 1582 }, { "entropy": 1.1796616911888123, "epoch": 0.8335966298051606, "grad_norm": 0.29507434368133545, "learning_rate": 0.000196287233945653, "loss": 0.19983485341072083, "mean_token_accuracy": 0.9158152490854263, "num_tokens": 19527888.0, "step": 1583 }, { "entropy": 1.1146294176578522, "epoch": 0.8341232227488151, "grad_norm": 0.275584876537323, "learning_rate": 0.00019628099803570837, "loss": 0.2035273015499115, "mean_token_accuracy": 0.9163656979799271, "num_tokens": 19540224.0, "step": 1584 }, { "entropy": 1.1470642983913422, "epoch": 0.8346498156924698, "grad_norm": 0.2765231430530548, "learning_rate": 0.00019627475700376374, "loss": 0.22747623920440674, "mean_token_accuracy": 0.9137639552354813, "num_tokens": 19552560.0, "step": 1585 }, { "entropy": 1.1012212336063385, "epoch": 0.8351764086361243, "grad_norm": 0.28456148505210876, "learning_rate": 0.00019626851085018964, "loss": 0.2105616182088852, "mean_token_accuracy": 0.9195501506328583, "num_tokens": 19564896.0, "step": 1586 }, { "entropy": 1.106357455253601, "epoch": 0.8357030015797788, "grad_norm": 0.32695838809013367, "learning_rate": 0.00019626225957535684, "loss": 0.22337135672569275, "mean_token_accuracy": 0.9134061336517334, "num_tokens": 19577232.0, "step": 1587 }, { "entropy": 1.169274091720581, "epoch": 0.8362295945234334, "grad_norm": 0.336927205324173, "learning_rate": 0.0001962560031796365, "loss": 0.2262648195028305, "mean_token_accuracy": 0.9084394127130508, "num_tokens": 19589568.0, "step": 1588 }, { "entropy": 1.1865193247795105, "epoch": 0.8367561874670879, "grad_norm": 0.3452165722846985, "learning_rate": 0.00019624974166339998, "loss": 0.24824325740337372, "mean_token_accuracy": 0.9022375047206879, "num_tokens": 19601904.0, "step": 1589 }, { "entropy": 1.1062462031841278, "epoch": 0.8372827804107424, "grad_norm": 0.3023000955581665, "learning_rate": 0.000196243475027019, "loss": 0.23354491591453552, "mean_token_accuracy": 0.9097914397716522, "num_tokens": 19614240.0, "step": 1590 }, { "entropy": 1.1293524503707886, "epoch": 0.8378093733543971, "grad_norm": 0.2942156195640564, "learning_rate": 0.00019623720327086557, "loss": 0.22122958302497864, "mean_token_accuracy": 0.9109482020139694, "num_tokens": 19626576.0, "step": 1591 }, { "entropy": 1.124775916337967, "epoch": 0.8383359662980516, "grad_norm": 0.315075546503067, "learning_rate": 0.00019623092639531198, "loss": 0.22557595372200012, "mean_token_accuracy": 0.9101526886224747, "num_tokens": 19638912.0, "step": 1592 }, { "entropy": 1.148577243089676, "epoch": 0.8388625592417062, "grad_norm": 0.43819931149482727, "learning_rate": 0.0001962246444007309, "loss": 0.22852541506290436, "mean_token_accuracy": 0.9057890176773071, "num_tokens": 19651248.0, "step": 1593 }, { "entropy": 1.14993816614151, "epoch": 0.8393891521853607, "grad_norm": 0.31310200691223145, "learning_rate": 0.00019621835728749525, "loss": 0.2385086715221405, "mean_token_accuracy": 0.9071990847587585, "num_tokens": 19663584.0, "step": 1594 }, { "entropy": 1.1644853949546814, "epoch": 0.8399157451290152, "grad_norm": 0.2970283031463623, "learning_rate": 0.00019621206505597823, "loss": 0.2200639396905899, "mean_token_accuracy": 0.9170584827661514, "num_tokens": 19675920.0, "step": 1595 }, { "entropy": 1.1328399777412415, "epoch": 0.8404423380726699, "grad_norm": 0.3323354125022888, "learning_rate": 0.0001962057677065534, "loss": 0.22121144831180573, "mean_token_accuracy": 0.9114271998405457, "num_tokens": 19688256.0, "step": 1596 }, { "entropy": 1.0829459726810455, "epoch": 0.8409689310163244, "grad_norm": 0.28420135378837585, "learning_rate": 0.0001961994652395946, "loss": 0.2405356764793396, "mean_token_accuracy": 0.9100402593612671, "num_tokens": 19700592.0, "step": 1597 }, { "entropy": 1.0924118757247925, "epoch": 0.841495523959979, "grad_norm": 0.25400787591934204, "learning_rate": 0.00019619315765547594, "loss": 0.18612799048423767, "mean_token_accuracy": 0.9215864688158035, "num_tokens": 19712928.0, "step": 1598 }, { "entropy": 1.1357889473438263, "epoch": 0.8420221169036335, "grad_norm": 0.2727976143360138, "learning_rate": 0.00019618684495457188, "loss": 0.22136437892913818, "mean_token_accuracy": 0.9126606434583664, "num_tokens": 19725264.0, "step": 1599 }, { "entropy": 1.0817617177963257, "epoch": 0.842548709847288, "grad_norm": 0.2677607238292694, "learning_rate": 0.0001961805271372572, "loss": 0.20533126592636108, "mean_token_accuracy": 0.9148357510566711, "num_tokens": 19737600.0, "step": 1600 }, { "entropy": 1.1030884683132172, "epoch": 0.8430753027909426, "grad_norm": 0.2927640378475189, "learning_rate": 0.0001961742042039069, "loss": 0.22252412140369415, "mean_token_accuracy": 0.9111676663160324, "num_tokens": 19749936.0, "step": 1601 }, { "entropy": 1.1529828608036041, "epoch": 0.8436018957345972, "grad_norm": 0.30727458000183105, "learning_rate": 0.00019616787615489635, "loss": 0.2029101848602295, "mean_token_accuracy": 0.9227928221225739, "num_tokens": 19762272.0, "step": 1602 }, { "entropy": 1.0316384136676788, "epoch": 0.8441284886782517, "grad_norm": 0.27791184186935425, "learning_rate": 0.00019616154299060122, "loss": 0.21758908033370972, "mean_token_accuracy": 0.9157789200544357, "num_tokens": 19774608.0, "step": 1603 }, { "entropy": 1.0185693204402924, "epoch": 0.8446550816219063, "grad_norm": 0.2891453504562378, "learning_rate": 0.00019615520471139749, "loss": 0.19542157649993896, "mean_token_accuracy": 0.9184477776288986, "num_tokens": 19786944.0, "step": 1604 }, { "entropy": 1.010437250137329, "epoch": 0.8451816745655608, "grad_norm": 0.29489409923553467, "learning_rate": 0.00019614886131766137, "loss": 0.2418351173400879, "mean_token_accuracy": 0.9019056260585785, "num_tokens": 19799280.0, "step": 1605 }, { "entropy": 1.0607281923294067, "epoch": 0.8457082675092154, "grad_norm": 0.2774660587310791, "learning_rate": 0.00019614251280976948, "loss": 0.1955130398273468, "mean_token_accuracy": 0.9208610653877258, "num_tokens": 19811616.0, "step": 1606 }, { "entropy": 1.0406393706798553, "epoch": 0.8462348604528699, "grad_norm": 0.3048405647277832, "learning_rate": 0.00019613615918809868, "loss": 0.24297615885734558, "mean_token_accuracy": 0.9006519466638565, "num_tokens": 19823952.0, "step": 1607 }, { "entropy": 0.9977871924638748, "epoch": 0.8467614533965245, "grad_norm": 0.29823529720306396, "learning_rate": 0.00019612980045302617, "loss": 0.22520115971565247, "mean_token_accuracy": 0.9101865142583847, "num_tokens": 19836288.0, "step": 1608 }, { "entropy": 0.9967030137777328, "epoch": 0.8472880463401791, "grad_norm": 0.30385443568229675, "learning_rate": 0.0001961234366049294, "loss": 0.2113213837146759, "mean_token_accuracy": 0.9132890105247498, "num_tokens": 19848624.0, "step": 1609 }, { "entropy": 0.9831344783306122, "epoch": 0.8478146392838336, "grad_norm": 0.2813466787338257, "learning_rate": 0.00019611706764418617, "loss": 0.20107880234718323, "mean_token_accuracy": 0.9161145985126495, "num_tokens": 19860960.0, "step": 1610 }, { "entropy": 1.0240805000066757, "epoch": 0.8483412322274881, "grad_norm": 0.3142811954021454, "learning_rate": 0.00019611069357117455, "loss": 0.20909224450588226, "mean_token_accuracy": 0.9144964218139648, "num_tokens": 19873296.0, "step": 1611 }, { "entropy": 0.9786220341920853, "epoch": 0.8488678251711427, "grad_norm": 0.2860144376754761, "learning_rate": 0.00019610431438627296, "loss": 0.20540790259838104, "mean_token_accuracy": 0.9215816557407379, "num_tokens": 19885632.0, "step": 1612 }, { "entropy": 1.0295808017253876, "epoch": 0.8493944181147972, "grad_norm": 0.2819706201553345, "learning_rate": 0.00019609793008986003, "loss": 0.2058688849210739, "mean_token_accuracy": 0.9158887714147568, "num_tokens": 19897968.0, "step": 1613 }, { "entropy": 1.0835894644260406, "epoch": 0.8499210110584519, "grad_norm": 0.2932409346103668, "learning_rate": 0.00019609154068231486, "loss": 0.2193165421485901, "mean_token_accuracy": 0.9130483567714691, "num_tokens": 19910304.0, "step": 1614 }, { "entropy": 1.0591089725494385, "epoch": 0.8504476040021064, "grad_norm": 0.3336801528930664, "learning_rate": 0.00019608514616401668, "loss": 0.2534202039241791, "mean_token_accuracy": 0.9020056575536728, "num_tokens": 19922640.0, "step": 1615 }, { "entropy": 1.0837358832359314, "epoch": 0.8509741969457609, "grad_norm": 0.2906700372695923, "learning_rate": 0.00019607874653534513, "loss": 0.21131698787212372, "mean_token_accuracy": 0.9210411906242371, "num_tokens": 19934976.0, "step": 1616 }, { "entropy": 1.0396023094654083, "epoch": 0.8515007898894155, "grad_norm": 0.29053011536598206, "learning_rate": 0.0001960723417966801, "loss": 0.21710500121116638, "mean_token_accuracy": 0.914475828409195, "num_tokens": 19947312.0, "step": 1617 }, { "entropy": 1.0233092904090881, "epoch": 0.85202738283307, "grad_norm": 0.26935815811157227, "learning_rate": 0.00019606593194840177, "loss": 0.22018460929393768, "mean_token_accuracy": 0.9134867042303085, "num_tokens": 19959648.0, "step": 1618 }, { "entropy": 1.0701540112495422, "epoch": 0.8525539757767245, "grad_norm": 0.28057801723480225, "learning_rate": 0.00019605951699089075, "loss": 0.21612004935741425, "mean_token_accuracy": 0.9129879325628281, "num_tokens": 19971984.0, "step": 1619 }, { "entropy": 1.012107402086258, "epoch": 0.8530805687203792, "grad_norm": 0.2693917155265808, "learning_rate": 0.00019605309692452774, "loss": 0.2114534080028534, "mean_token_accuracy": 0.9149720519781113, "num_tokens": 19984320.0, "step": 1620 }, { "entropy": 1.0413274019956589, "epoch": 0.8536071616640337, "grad_norm": 0.27927207946777344, "learning_rate": 0.00019604667174969394, "loss": 0.21135683357715607, "mean_token_accuracy": 0.9143811762332916, "num_tokens": 19996656.0, "step": 1621 }, { "entropy": 0.9798619896173477, "epoch": 0.8541337546076883, "grad_norm": 0.2772925794124603, "learning_rate": 0.00019604024146677079, "loss": 0.19996821880340576, "mean_token_accuracy": 0.9175093472003937, "num_tokens": 20008992.0, "step": 1622 }, { "entropy": 0.9713831841945648, "epoch": 0.8546603475513428, "grad_norm": 0.2909282445907593, "learning_rate": 0.00019603380607613994, "loss": 0.21484866738319397, "mean_token_accuracy": 0.9112430512905121, "num_tokens": 20021328.0, "step": 1623 }, { "entropy": 0.9760904163122177, "epoch": 0.8551869404949973, "grad_norm": 0.2880821228027344, "learning_rate": 0.0001960273655781835, "loss": 0.21467523276805878, "mean_token_accuracy": 0.9168452471494675, "num_tokens": 20033664.0, "step": 1624 }, { "entropy": 1.0048719644546509, "epoch": 0.855713533438652, "grad_norm": 0.3039538860321045, "learning_rate": 0.00019602091997328376, "loss": 0.21055804193019867, "mean_token_accuracy": 0.9170923382043839, "num_tokens": 20046000.0, "step": 1625 }, { "entropy": 0.95078045129776, "epoch": 0.8562401263823065, "grad_norm": 0.28427428007125854, "learning_rate": 0.00019601446926182335, "loss": 0.2352895438671112, "mean_token_accuracy": 0.9064240008592606, "num_tokens": 20058336.0, "step": 1626 }, { "entropy": 0.9472018629312515, "epoch": 0.856766719325961, "grad_norm": 0.2894728183746338, "learning_rate": 0.00019600801344418526, "loss": 0.2225104421377182, "mean_token_accuracy": 0.913215383887291, "num_tokens": 20070672.0, "step": 1627 }, { "entropy": 1.0047412514686584, "epoch": 0.8572933122696156, "grad_norm": 0.30747485160827637, "learning_rate": 0.00019600155252075268, "loss": 0.2196165919303894, "mean_token_accuracy": 0.9105159193277359, "num_tokens": 20083008.0, "step": 1628 }, { "entropy": 1.0216589123010635, "epoch": 0.8578199052132701, "grad_norm": 0.2717617452144623, "learning_rate": 0.0001959950864919092, "loss": 0.20522895455360413, "mean_token_accuracy": 0.9180753976106644, "num_tokens": 20095344.0, "step": 1629 }, { "entropy": 1.0321899056434631, "epoch": 0.8583464981569247, "grad_norm": 0.30837494134902954, "learning_rate": 0.00019598861535803863, "loss": 0.21629376709461212, "mean_token_accuracy": 0.9151955991983414, "num_tokens": 20107680.0, "step": 1630 }, { "entropy": 1.0596579015254974, "epoch": 0.8588730911005793, "grad_norm": 0.3152981996536255, "learning_rate": 0.00019598213911952515, "loss": 0.24829894304275513, "mean_token_accuracy": 0.9071104824542999, "num_tokens": 20120016.0, "step": 1631 }, { "entropy": 1.027356281876564, "epoch": 0.8593996840442338, "grad_norm": 0.2758905589580536, "learning_rate": 0.00019597565777675324, "loss": 0.20423409342765808, "mean_token_accuracy": 0.919173076748848, "num_tokens": 20132352.0, "step": 1632 }, { "entropy": 1.0339451730251312, "epoch": 0.8599262769878884, "grad_norm": 0.2790839672088623, "learning_rate": 0.0001959691713301076, "loss": 0.20338216423988342, "mean_token_accuracy": 0.916516900062561, "num_tokens": 20144688.0, "step": 1633 }, { "entropy": 1.0149255990982056, "epoch": 0.8604528699315429, "grad_norm": 0.2958633005619049, "learning_rate": 0.00019596267977997332, "loss": 0.22986331582069397, "mean_token_accuracy": 0.9077225029468536, "num_tokens": 20157024.0, "step": 1634 }, { "entropy": 0.9824042469263077, "epoch": 0.8609794628751974, "grad_norm": 0.2640792429447174, "learning_rate": 0.0001959561831267358, "loss": 0.20994797348976135, "mean_token_accuracy": 0.9186595976352692, "num_tokens": 20169360.0, "step": 1635 }, { "entropy": 0.9684455096721649, "epoch": 0.861506055818852, "grad_norm": 0.2797081768512726, "learning_rate": 0.00019594968137078068, "loss": 0.21638056635856628, "mean_token_accuracy": 0.9145815968513489, "num_tokens": 20181696.0, "step": 1636 }, { "entropy": 0.9729262888431549, "epoch": 0.8620326487625066, "grad_norm": 0.2565400004386902, "learning_rate": 0.0001959431745124939, "loss": 0.20372052490711212, "mean_token_accuracy": 0.9224633723497391, "num_tokens": 20194032.0, "step": 1637 }, { "entropy": 0.9809018820524216, "epoch": 0.8625592417061612, "grad_norm": 0.3174954354763031, "learning_rate": 0.0001959366625522618, "loss": 0.2331572026014328, "mean_token_accuracy": 0.9117663353681564, "num_tokens": 20206368.0, "step": 1638 }, { "entropy": 0.9628456979990005, "epoch": 0.8630858346498157, "grad_norm": 0.2894734740257263, "learning_rate": 0.0001959301454904709, "loss": 0.2223999798297882, "mean_token_accuracy": 0.9094413071870804, "num_tokens": 20218704.0, "step": 1639 }, { "entropy": 1.0126699656248093, "epoch": 0.8636124275934702, "grad_norm": 0.2930248975753784, "learning_rate": 0.0001959236233275081, "loss": 0.21124093234539032, "mean_token_accuracy": 0.9162924438714981, "num_tokens": 20231040.0, "step": 1640 }, { "entropy": 0.9787211865186691, "epoch": 0.8641390205371248, "grad_norm": 0.30070269107818604, "learning_rate": 0.00019591709606376059, "loss": 0.21121284365653992, "mean_token_accuracy": 0.9159329831600189, "num_tokens": 20243376.0, "step": 1641 }, { "entropy": 1.010118991136551, "epoch": 0.8646656134807793, "grad_norm": 0.28400495648384094, "learning_rate": 0.00019591056369961586, "loss": 0.21099403500556946, "mean_token_accuracy": 0.9190017580986023, "num_tokens": 20255712.0, "step": 1642 }, { "entropy": 0.9496536999940872, "epoch": 0.865192206424434, "grad_norm": 0.2675454914569855, "learning_rate": 0.00019590402623546167, "loss": 0.2049626260995865, "mean_token_accuracy": 0.9156690835952759, "num_tokens": 20268048.0, "step": 1643 }, { "entropy": 0.9466981887817383, "epoch": 0.8657187993680885, "grad_norm": 0.30046844482421875, "learning_rate": 0.00019589748367168612, "loss": 0.21190345287322998, "mean_token_accuracy": 0.9161060154438019, "num_tokens": 20280384.0, "step": 1644 }, { "entropy": 1.0232085585594177, "epoch": 0.866245392311743, "grad_norm": 0.3621319532394409, "learning_rate": 0.00019589093600867763, "loss": 0.2193715125322342, "mean_token_accuracy": 0.9074915945529938, "num_tokens": 20292720.0, "step": 1645 }, { "entropy": 0.993518516421318, "epoch": 0.8667719852553976, "grad_norm": 0.28956446051597595, "learning_rate": 0.00019588438324682488, "loss": 0.21250395476818085, "mean_token_accuracy": 0.9168424904346466, "num_tokens": 20305056.0, "step": 1646 }, { "entropy": 0.9817381650209427, "epoch": 0.8672985781990521, "grad_norm": 0.34931275248527527, "learning_rate": 0.00019587782538651687, "loss": 0.2343052327632904, "mean_token_accuracy": 0.9059536755084991, "num_tokens": 20317392.0, "step": 1647 }, { "entropy": 0.9840113967657089, "epoch": 0.8678251711427067, "grad_norm": 0.304169237613678, "learning_rate": 0.00019587126242814288, "loss": 0.20760950446128845, "mean_token_accuracy": 0.9196920245885849, "num_tokens": 20329728.0, "step": 1648 }, { "entropy": 0.99486044049263, "epoch": 0.8683517640863613, "grad_norm": 0.3464246094226837, "learning_rate": 0.00019586469437209256, "loss": 0.25210103392601013, "mean_token_accuracy": 0.9036094397306442, "num_tokens": 20342064.0, "step": 1649 }, { "entropy": 0.9775729477405548, "epoch": 0.8688783570300158, "grad_norm": 0.27859246730804443, "learning_rate": 0.00019585812121875577, "loss": 0.21410948038101196, "mean_token_accuracy": 0.9136857688426971, "num_tokens": 20354400.0, "step": 1650 }, { "entropy": 1.0246230065822601, "epoch": 0.8694049499736703, "grad_norm": 0.28361114859580994, "learning_rate": 0.00019585154296852277, "loss": 0.19681544601917267, "mean_token_accuracy": 0.9178670197725296, "num_tokens": 20366736.0, "step": 1651 }, { "entropy": 0.9918327033519745, "epoch": 0.8699315429173249, "grad_norm": 0.2778252065181732, "learning_rate": 0.00019584495962178403, "loss": 0.20562246441841125, "mean_token_accuracy": 0.9203788787126541, "num_tokens": 20379072.0, "step": 1652 }, { "entropy": 1.0197946578264236, "epoch": 0.8704581358609794, "grad_norm": 0.2764199674129486, "learning_rate": 0.0001958383711789304, "loss": 0.2005048245191574, "mean_token_accuracy": 0.9199100285768509, "num_tokens": 20391408.0, "step": 1653 }, { "entropy": 0.946838304400444, "epoch": 0.8709847288046341, "grad_norm": 0.318099707365036, "learning_rate": 0.00019583177764035295, "loss": 0.18645739555358887, "mean_token_accuracy": 0.9281531125307083, "num_tokens": 20403744.0, "step": 1654 }, { "entropy": 0.9969734102487564, "epoch": 0.8715113217482886, "grad_norm": 0.330425888299942, "learning_rate": 0.00019582517900644313, "loss": 0.2349887192249298, "mean_token_accuracy": 0.9082667678594589, "num_tokens": 20416080.0, "step": 1655 }, { "entropy": 0.9850341528654099, "epoch": 0.8720379146919431, "grad_norm": 0.30549484491348267, "learning_rate": 0.00019581857527759265, "loss": 0.22454282641410828, "mean_token_accuracy": 0.9096111208200455, "num_tokens": 20428416.0, "step": 1656 }, { "entropy": 0.9726726412773132, "epoch": 0.8725645076355977, "grad_norm": 0.26101022958755493, "learning_rate": 0.00019581196645419358, "loss": 0.18027372658252716, "mean_token_accuracy": 0.9280071556568146, "num_tokens": 20440752.0, "step": 1657 }, { "entropy": 1.045421838760376, "epoch": 0.8730911005792522, "grad_norm": 0.31144458055496216, "learning_rate": 0.0001958053525366382, "loss": 0.22132211923599243, "mean_token_accuracy": 0.9151443690061569, "num_tokens": 20453088.0, "step": 1658 }, { "entropy": 1.0683381259441376, "epoch": 0.8736176935229067, "grad_norm": 0.34451693296432495, "learning_rate": 0.0001957987335253191, "loss": 0.2497258186340332, "mean_token_accuracy": 0.9017534852027893, "num_tokens": 20465424.0, "step": 1659 }, { "entropy": 1.0424925982952118, "epoch": 0.8741442864665614, "grad_norm": 0.305476576089859, "learning_rate": 0.00019579210942062932, "loss": 0.21568341553211212, "mean_token_accuracy": 0.913795217871666, "num_tokens": 20477760.0, "step": 1660 }, { "entropy": 1.077263206243515, "epoch": 0.8746708794102159, "grad_norm": 0.28648725152015686, "learning_rate": 0.00019578548022296203, "loss": 0.18887600302696228, "mean_token_accuracy": 0.9262412637472153, "num_tokens": 20490096.0, "step": 1661 }, { "entropy": 1.0266597121953964, "epoch": 0.8751974723538705, "grad_norm": 0.31522682309150696, "learning_rate": 0.00019577884593271076, "loss": 0.21652202308177948, "mean_token_accuracy": 0.907884418964386, "num_tokens": 20502432.0, "step": 1662 }, { "entropy": 1.0532887279987335, "epoch": 0.875724065297525, "grad_norm": 0.25786280632019043, "learning_rate": 0.00019577220655026938, "loss": 0.18014520406723022, "mean_token_accuracy": 0.9304206520318985, "num_tokens": 20514768.0, "step": 1663 }, { "entropy": 1.0302300453186035, "epoch": 0.8762506582411795, "grad_norm": 0.27384263277053833, "learning_rate": 0.000195765562076032, "loss": 0.19573301076889038, "mean_token_accuracy": 0.9229860901832581, "num_tokens": 20527104.0, "step": 1664 }, { "entropy": 1.0142173171043396, "epoch": 0.8767772511848341, "grad_norm": 0.2829652428627014, "learning_rate": 0.0001957589125103931, "loss": 0.19770190119743347, "mean_token_accuracy": 0.9212857335805893, "num_tokens": 20539440.0, "step": 1665 }, { "entropy": 1.030619502067566, "epoch": 0.8773038441284887, "grad_norm": 0.31889650225639343, "learning_rate": 0.0001957522578537474, "loss": 0.21395039558410645, "mean_token_accuracy": 0.9180440455675125, "num_tokens": 20551776.0, "step": 1666 }, { "entropy": 1.0783992409706116, "epoch": 0.8778304370721433, "grad_norm": 0.31347182393074036, "learning_rate": 0.00019574559810648994, "loss": 0.23077845573425293, "mean_token_accuracy": 0.9107988774776459, "num_tokens": 20564112.0, "step": 1667 }, { "entropy": 1.0769988298416138, "epoch": 0.8783570300157978, "grad_norm": 0.30257898569107056, "learning_rate": 0.00019573893326901607, "loss": 0.18793995678424835, "mean_token_accuracy": 0.9216104596853256, "num_tokens": 20576448.0, "step": 1668 }, { "entropy": 1.041060984134674, "epoch": 0.8788836229594523, "grad_norm": 0.29523128271102905, "learning_rate": 0.0001957322633417215, "loss": 0.20431648194789886, "mean_token_accuracy": 0.9192978888750076, "num_tokens": 20588784.0, "step": 1669 }, { "entropy": 1.0586915016174316, "epoch": 0.8794102159031069, "grad_norm": 0.29364022612571716, "learning_rate": 0.0001957255883250021, "loss": 0.22029076516628265, "mean_token_accuracy": 0.9125624299049377, "num_tokens": 20601120.0, "step": 1670 }, { "entropy": 1.0633411705493927, "epoch": 0.8799368088467614, "grad_norm": 0.2905363440513611, "learning_rate": 0.00019571890821925417, "loss": 0.19489197432994843, "mean_token_accuracy": 0.9242742508649826, "num_tokens": 20613456.0, "step": 1671 }, { "entropy": 1.135309487581253, "epoch": 0.880463401790416, "grad_norm": 0.3044449985027313, "learning_rate": 0.0001957122230248743, "loss": 0.19300708174705505, "mean_token_accuracy": 0.9245816022157669, "num_tokens": 20625792.0, "step": 1672 }, { "entropy": 1.0445529222488403, "epoch": 0.8809899947340706, "grad_norm": 0.28844696283340454, "learning_rate": 0.00019570553274225928, "loss": 0.20883029699325562, "mean_token_accuracy": 0.9140314012765884, "num_tokens": 20638128.0, "step": 1673 }, { "entropy": 1.1107747852802277, "epoch": 0.8815165876777251, "grad_norm": 0.32846325635910034, "learning_rate": 0.00019569883737180634, "loss": 0.24370679259300232, "mean_token_accuracy": 0.901743620634079, "num_tokens": 20650464.0, "step": 1674 }, { "entropy": 1.1209677755832672, "epoch": 0.8820431806213797, "grad_norm": 0.2889225482940674, "learning_rate": 0.0001956921369139129, "loss": 0.21621105074882507, "mean_token_accuracy": 0.9143183678388596, "num_tokens": 20662800.0, "step": 1675 }, { "entropy": 1.0856188535690308, "epoch": 0.8825697735650342, "grad_norm": 0.27882513403892517, "learning_rate": 0.00019568543136897675, "loss": 0.21793431043624878, "mean_token_accuracy": 0.9142801910638809, "num_tokens": 20675136.0, "step": 1676 }, { "entropy": 1.0983311533927917, "epoch": 0.8830963665086888, "grad_norm": 0.272402822971344, "learning_rate": 0.00019567872073739595, "loss": 0.20574277639389038, "mean_token_accuracy": 0.9181714653968811, "num_tokens": 20687472.0, "step": 1677 }, { "entropy": 1.0844581425189972, "epoch": 0.8836229594523434, "grad_norm": 0.27611178159713745, "learning_rate": 0.0001956720050195689, "loss": 0.2087741196155548, "mean_token_accuracy": 0.9139288067817688, "num_tokens": 20699808.0, "step": 1678 }, { "entropy": 1.12508624792099, "epoch": 0.8841495523959979, "grad_norm": 0.29753515124320984, "learning_rate": 0.0001956652842158942, "loss": 0.20983164012432098, "mean_token_accuracy": 0.9156063199043274, "num_tokens": 20712144.0, "step": 1679 }, { "entropy": 1.1237779259681702, "epoch": 0.8846761453396524, "grad_norm": 0.2853649854660034, "learning_rate": 0.00019565855832677086, "loss": 0.20436659455299377, "mean_token_accuracy": 0.9203456342220306, "num_tokens": 20724480.0, "step": 1680 }, { "entropy": 1.1044580936431885, "epoch": 0.885202738283307, "grad_norm": 0.2854003608226776, "learning_rate": 0.00019565182735259822, "loss": 0.2195129096508026, "mean_token_accuracy": 0.9125242233276367, "num_tokens": 20736816.0, "step": 1681 }, { "entropy": 1.084385484457016, "epoch": 0.8857293312269615, "grad_norm": 0.29433006048202515, "learning_rate": 0.0001956450912937758, "loss": 0.2089007943868637, "mean_token_accuracy": 0.9135125875473022, "num_tokens": 20749152.0, "step": 1682 }, { "entropy": 1.0872920453548431, "epoch": 0.8862559241706162, "grad_norm": 0.2716350555419922, "learning_rate": 0.00019563835015070348, "loss": 0.20034612715244293, "mean_token_accuracy": 0.9140070527791977, "num_tokens": 20761488.0, "step": 1683 }, { "entropy": 1.0698755085468292, "epoch": 0.8867825171142707, "grad_norm": 0.263379842042923, "learning_rate": 0.00019563160392378144, "loss": 0.2013968825340271, "mean_token_accuracy": 0.920297846198082, "num_tokens": 20773824.0, "step": 1684 }, { "entropy": 1.0688921809196472, "epoch": 0.8873091100579252, "grad_norm": 0.2941676676273346, "learning_rate": 0.00019562485261341017, "loss": 0.222881019115448, "mean_token_accuracy": 0.9110155403614044, "num_tokens": 20786160.0, "step": 1685 }, { "entropy": 1.0462908446788788, "epoch": 0.8878357030015798, "grad_norm": 0.2833232581615448, "learning_rate": 0.00019561809621999047, "loss": 0.2037080079317093, "mean_token_accuracy": 0.9212964028120041, "num_tokens": 20798496.0, "step": 1686 }, { "entropy": 1.0370090901851654, "epoch": 0.8883622959452343, "grad_norm": 0.299941748380661, "learning_rate": 0.0001956113347439234, "loss": 0.21904562413692474, "mean_token_accuracy": 0.9075719863176346, "num_tokens": 20810832.0, "step": 1687 }, { "entropy": 1.0448128283023834, "epoch": 0.8888888888888888, "grad_norm": 0.2878952920436859, "learning_rate": 0.0001956045681856104, "loss": 0.2038077563047409, "mean_token_accuracy": 0.9187713265419006, "num_tokens": 20823168.0, "step": 1688 }, { "entropy": 1.0190322399139404, "epoch": 0.8894154818325435, "grad_norm": 0.34769734740257263, "learning_rate": 0.0001955977965454531, "loss": 0.213621124625206, "mean_token_accuracy": 0.9181492775678635, "num_tokens": 20835504.0, "step": 1689 }, { "entropy": 1.0234404504299164, "epoch": 0.889942074776198, "grad_norm": 0.2829277813434601, "learning_rate": 0.00019559101982385356, "loss": 0.20716841518878937, "mean_token_accuracy": 0.9201241731643677, "num_tokens": 20847840.0, "step": 1690 }, { "entropy": 1.0015476644039154, "epoch": 0.8904686677198526, "grad_norm": 0.26036950945854187, "learning_rate": 0.000195584238021214, "loss": 0.18766967952251434, "mean_token_accuracy": 0.9250665605068207, "num_tokens": 20860176.0, "step": 1691 }, { "entropy": 1.032362923026085, "epoch": 0.8909952606635071, "grad_norm": 0.4818808138370514, "learning_rate": 0.00019557745113793704, "loss": 0.19411087036132812, "mean_token_accuracy": 0.921613797545433, "num_tokens": 20872512.0, "step": 1692 }, { "entropy": 0.9709571003913879, "epoch": 0.8915218536071616, "grad_norm": 0.2804003655910492, "learning_rate": 0.0001955706591744256, "loss": 0.21858839690685272, "mean_token_accuracy": 0.9120522737503052, "num_tokens": 20884848.0, "step": 1693 }, { "entropy": 1.0739005506038666, "epoch": 0.8920484465508162, "grad_norm": 0.2946876585483551, "learning_rate": 0.00019556386213108288, "loss": 0.19359217584133148, "mean_token_accuracy": 0.925596609711647, "num_tokens": 20897184.0, "step": 1694 }, { "entropy": 1.0181286334991455, "epoch": 0.8925750394944708, "grad_norm": 0.3197228014469147, "learning_rate": 0.00019555706000831235, "loss": 0.2175355702638626, "mean_token_accuracy": 0.9139997512102127, "num_tokens": 20909520.0, "step": 1695 }, { "entropy": 1.0345196276903152, "epoch": 0.8931016324381253, "grad_norm": 0.29833653569221497, "learning_rate": 0.00019555025280651786, "loss": 0.2255219966173172, "mean_token_accuracy": 0.9102495014667511, "num_tokens": 20921856.0, "step": 1696 }, { "entropy": 0.9587903320789337, "epoch": 0.8936282253817799, "grad_norm": 0.2722357511520386, "learning_rate": 0.00019554344052610348, "loss": 0.19479139149188995, "mean_token_accuracy": 0.9188268184661865, "num_tokens": 20934192.0, "step": 1697 }, { "entropy": 0.9713253229856491, "epoch": 0.8941548183254344, "grad_norm": 0.2900646924972534, "learning_rate": 0.0001955366231674736, "loss": 0.20535482466220856, "mean_token_accuracy": 0.9150903820991516, "num_tokens": 20946528.0, "step": 1698 }, { "entropy": 1.020512416958809, "epoch": 0.894681411269089, "grad_norm": 0.2782817780971527, "learning_rate": 0.00019552980073103297, "loss": 0.20126226544380188, "mean_token_accuracy": 0.9161560386419296, "num_tokens": 20958864.0, "step": 1699 }, { "entropy": 0.9827070981264114, "epoch": 0.8952080042127436, "grad_norm": 0.2738768458366394, "learning_rate": 0.00019552297321718658, "loss": 0.19939669966697693, "mean_token_accuracy": 0.9180780202150345, "num_tokens": 20971200.0, "step": 1700 }, { "entropy": 0.9992471039295197, "epoch": 0.8957345971563981, "grad_norm": 0.31194329261779785, "learning_rate": 0.0001955161406263397, "loss": 0.23202218115329742, "mean_token_accuracy": 0.9068114459514618, "num_tokens": 20983536.0, "step": 1701 }, { "entropy": 0.9976187497377396, "epoch": 0.8962611901000527, "grad_norm": 0.29019710421562195, "learning_rate": 0.00019550930295889803, "loss": 0.21963413059711456, "mean_token_accuracy": 0.9133173823356628, "num_tokens": 20995872.0, "step": 1702 }, { "entropy": 1.0274995416402817, "epoch": 0.8967877830437072, "grad_norm": 0.2910099923610687, "learning_rate": 0.00019550246021526736, "loss": 0.20295658707618713, "mean_token_accuracy": 0.9164696484804153, "num_tokens": 21008208.0, "step": 1703 }, { "entropy": 1.0305428206920624, "epoch": 0.8973143759873617, "grad_norm": 0.3525075912475586, "learning_rate": 0.000195495612395854, "loss": 0.20155680179595947, "mean_token_accuracy": 0.9174475073814392, "num_tokens": 21020544.0, "step": 1704 }, { "entropy": 1.0068664401769638, "epoch": 0.8978409689310163, "grad_norm": 0.33528581261634827, "learning_rate": 0.00019548875950106448, "loss": 0.22776372730731964, "mean_token_accuracy": 0.906059592962265, "num_tokens": 21032880.0, "step": 1705 }, { "entropy": 1.0565652251243591, "epoch": 0.8983675618746709, "grad_norm": 0.29654526710510254, "learning_rate": 0.00019548190153130553, "loss": 0.23316293954849243, "mean_token_accuracy": 0.9070921689271927, "num_tokens": 21045216.0, "step": 1706 }, { "entropy": 0.9845771491527557, "epoch": 0.8988941548183255, "grad_norm": 0.3172268271446228, "learning_rate": 0.00019547503848698435, "loss": 0.22646287083625793, "mean_token_accuracy": 0.9135229587554932, "num_tokens": 21057552.0, "step": 1707 }, { "entropy": 1.014034628868103, "epoch": 0.89942074776198, "grad_norm": 0.27241358160972595, "learning_rate": 0.00019546817036850827, "loss": 0.21421730518341064, "mean_token_accuracy": 0.9127627313137054, "num_tokens": 21069888.0, "step": 1708 }, { "entropy": 1.044843077659607, "epoch": 0.8999473407056345, "grad_norm": 0.27422401309013367, "learning_rate": 0.00019546129717628512, "loss": 0.22259175777435303, "mean_token_accuracy": 0.90959133207798, "num_tokens": 21082224.0, "step": 1709 }, { "entropy": 1.0896000117063522, "epoch": 0.9004739336492891, "grad_norm": 0.31072503328323364, "learning_rate": 0.00019545441891072283, "loss": 0.21754461526870728, "mean_token_accuracy": 0.9161411225795746, "num_tokens": 21094560.0, "step": 1710 }, { "entropy": 1.0415829718112946, "epoch": 0.9010005265929436, "grad_norm": 0.261515736579895, "learning_rate": 0.00019544753557222975, "loss": 0.1926898956298828, "mean_token_accuracy": 0.9213140159845352, "num_tokens": 21106896.0, "step": 1711 }, { "entropy": 1.0076445639133453, "epoch": 0.9015271195365983, "grad_norm": 0.26134979724884033, "learning_rate": 0.00019544064716121452, "loss": 0.20023104548454285, "mean_token_accuracy": 0.9194119721651077, "num_tokens": 21119232.0, "step": 1712 }, { "entropy": 1.007362276315689, "epoch": 0.9020537124802528, "grad_norm": 0.2691597044467926, "learning_rate": 0.00019543375367808604, "loss": 0.19764183461666107, "mean_token_accuracy": 0.9207281470298767, "num_tokens": 21131568.0, "step": 1713 }, { "entropy": 1.0264256298542023, "epoch": 0.9025803054239073, "grad_norm": 0.2841010093688965, "learning_rate": 0.00019542685512325357, "loss": 0.19019414484500885, "mean_token_accuracy": 0.9279275834560394, "num_tokens": 21143904.0, "step": 1714 }, { "entropy": 1.0494853258132935, "epoch": 0.9031068983675619, "grad_norm": 0.2881733477115631, "learning_rate": 0.00019541995149712662, "loss": 0.19694221019744873, "mean_token_accuracy": 0.9203800857067108, "num_tokens": 21156240.0, "step": 1715 }, { "entropy": 1.029950574040413, "epoch": 0.9036334913112164, "grad_norm": 0.2856560945510864, "learning_rate": 0.00019541304280011498, "loss": 0.208457350730896, "mean_token_accuracy": 0.9130570143461227, "num_tokens": 21168576.0, "step": 1716 }, { "entropy": 1.036653459072113, "epoch": 0.9041600842548709, "grad_norm": 0.35959112644195557, "learning_rate": 0.00019540612903262887, "loss": 0.2388800084590912, "mean_token_accuracy": 0.909120500087738, "num_tokens": 21180912.0, "step": 1717 }, { "entropy": 1.00953871011734, "epoch": 0.9046866771985256, "grad_norm": 0.3067711293697357, "learning_rate": 0.00019539921019507862, "loss": 0.2145732194185257, "mean_token_accuracy": 0.9115498811006546, "num_tokens": 21193248.0, "step": 1718 }, { "entropy": 0.9901564866304398, "epoch": 0.9052132701421801, "grad_norm": 0.3036840856075287, "learning_rate": 0.00019539228628787501, "loss": 0.2193184792995453, "mean_token_accuracy": 0.9104121774435043, "num_tokens": 21205584.0, "step": 1719 }, { "entropy": 0.9771833568811417, "epoch": 0.9057398630858347, "grad_norm": 0.32093900442123413, "learning_rate": 0.00019538535731142907, "loss": 0.23529593646526337, "mean_token_accuracy": 0.9093421250581741, "num_tokens": 21217920.0, "step": 1720 }, { "entropy": 1.011559009552002, "epoch": 0.9062664560294892, "grad_norm": 0.2692308723926544, "learning_rate": 0.00019537842326615215, "loss": 0.20593476295471191, "mean_token_accuracy": 0.9199935644865036, "num_tokens": 21230256.0, "step": 1721 }, { "entropy": 1.073755070567131, "epoch": 0.9067930489731437, "grad_norm": 0.3065417408943176, "learning_rate": 0.00019537148415245582, "loss": 0.23454323410987854, "mean_token_accuracy": 0.9069335609674454, "num_tokens": 21242592.0, "step": 1722 }, { "entropy": 1.0648082047700882, "epoch": 0.9073196419167984, "grad_norm": 0.32037290930747986, "learning_rate": 0.0001953645399707521, "loss": 0.2138725221157074, "mean_token_accuracy": 0.9131258726119995, "num_tokens": 21254928.0, "step": 1723 }, { "entropy": 1.0663966238498688, "epoch": 0.9078462348604529, "grad_norm": 0.2899954915046692, "learning_rate": 0.00019535759072145318, "loss": 0.204481303691864, "mean_token_accuracy": 0.9170624017715454, "num_tokens": 21267264.0, "step": 1724 }, { "entropy": 1.020171880722046, "epoch": 0.9083728278041074, "grad_norm": 0.29145675897598267, "learning_rate": 0.0001953506364049716, "loss": 0.21512804925441742, "mean_token_accuracy": 0.9173563122749329, "num_tokens": 21279600.0, "step": 1725 }, { "entropy": 1.0235641449689865, "epoch": 0.908899420747762, "grad_norm": 0.27262571454048157, "learning_rate": 0.00019534367702172016, "loss": 0.22479593753814697, "mean_token_accuracy": 0.9110193848609924, "num_tokens": 21291936.0, "step": 1726 }, { "entropy": 0.9845803081989288, "epoch": 0.9094260136914165, "grad_norm": 0.2786709666252136, "learning_rate": 0.00019533671257211205, "loss": 0.2018449455499649, "mean_token_accuracy": 0.9166059494018555, "num_tokens": 21304272.0, "step": 1727 }, { "entropy": 0.9907389134168625, "epoch": 0.909952606635071, "grad_norm": 0.2637747526168823, "learning_rate": 0.00019532974305656075, "loss": 0.211765855550766, "mean_token_accuracy": 0.9151495099067688, "num_tokens": 21316608.0, "step": 1728 }, { "entropy": 1.0142314583063126, "epoch": 0.9104791995787257, "grad_norm": 0.2817028760910034, "learning_rate": 0.0001953227684754799, "loss": 0.19784370064735413, "mean_token_accuracy": 0.9207914024591446, "num_tokens": 21328944.0, "step": 1729 }, { "entropy": 1.0088147670030594, "epoch": 0.9110057925223802, "grad_norm": 0.2688204050064087, "learning_rate": 0.00019531578882928357, "loss": 0.20449689030647278, "mean_token_accuracy": 0.9207023978233337, "num_tokens": 21341280.0, "step": 1730 }, { "entropy": 0.9528838694095612, "epoch": 0.9115323854660348, "grad_norm": 0.27442365884780884, "learning_rate": 0.00019530880411838616, "loss": 0.21661211550235748, "mean_token_accuracy": 0.9121255576610565, "num_tokens": 21353616.0, "step": 1731 }, { "entropy": 0.9663679003715515, "epoch": 0.9120589784096893, "grad_norm": 0.2818276584148407, "learning_rate": 0.00019530181434320224, "loss": 0.21009200811386108, "mean_token_accuracy": 0.9155483096837997, "num_tokens": 21365952.0, "step": 1732 }, { "entropy": 0.9394736588001251, "epoch": 0.9125855713533438, "grad_norm": 0.3315548598766327, "learning_rate": 0.0001952948195041468, "loss": 0.21075570583343506, "mean_token_accuracy": 0.9181785732507706, "num_tokens": 21378288.0, "step": 1733 }, { "entropy": 0.9442544430494308, "epoch": 0.9131121642969984, "grad_norm": 0.3284794092178345, "learning_rate": 0.000195287819601635, "loss": 0.23087412118911743, "mean_token_accuracy": 0.9092219769954681, "num_tokens": 21390624.0, "step": 1734 }, { "entropy": 0.9372933954000473, "epoch": 0.913638757240653, "grad_norm": 0.29973915219306946, "learning_rate": 0.0001952808146360825, "loss": 0.2058921754360199, "mean_token_accuracy": 0.9160513281822205, "num_tokens": 21402960.0, "step": 1735 }, { "entropy": 0.9260263890028, "epoch": 0.9141653501843076, "grad_norm": 0.2917967438697815, "learning_rate": 0.00019527380460790508, "loss": 0.2268896996974945, "mean_token_accuracy": 0.9107523709535599, "num_tokens": 21415296.0, "step": 1736 }, { "entropy": 0.9555350244045258, "epoch": 0.9146919431279621, "grad_norm": 0.2836836874485016, "learning_rate": 0.0001952667895175189, "loss": 0.21083997189998627, "mean_token_accuracy": 0.9108854085206985, "num_tokens": 21427632.0, "step": 1737 }, { "entropy": 0.9710684269666672, "epoch": 0.9152185360716166, "grad_norm": 0.3263842761516571, "learning_rate": 0.00019525976936534035, "loss": 0.19704914093017578, "mean_token_accuracy": 0.9213050603866577, "num_tokens": 21439968.0, "step": 1738 }, { "entropy": 0.920185998082161, "epoch": 0.9157451290152712, "grad_norm": 0.3038593828678131, "learning_rate": 0.00019525274415178626, "loss": 0.2302832156419754, "mean_token_accuracy": 0.9091469496488571, "num_tokens": 21452304.0, "step": 1739 }, { "entropy": 0.9555569142103195, "epoch": 0.9162717219589257, "grad_norm": 0.3209346532821655, "learning_rate": 0.00019524571387727365, "loss": 0.2268507480621338, "mean_token_accuracy": 0.9097347557544708, "num_tokens": 21464640.0, "step": 1740 }, { "entropy": 0.9613929092884064, "epoch": 0.9167983149025803, "grad_norm": 0.28639957308769226, "learning_rate": 0.0001952386785422199, "loss": 0.22456036508083344, "mean_token_accuracy": 0.9144959151744843, "num_tokens": 21476976.0, "step": 1741 }, { "entropy": 0.9676374346017838, "epoch": 0.9173249078462349, "grad_norm": 0.29118600487709045, "learning_rate": 0.00019523163814704253, "loss": 0.21779820322990417, "mean_token_accuracy": 0.9170442819595337, "num_tokens": 21489312.0, "step": 1742 }, { "entropy": 0.9580910950899124, "epoch": 0.9178515007898894, "grad_norm": 0.28892767429351807, "learning_rate": 0.0001952245926921596, "loss": 0.1965646892786026, "mean_token_accuracy": 0.9236303865909576, "num_tokens": 21501648.0, "step": 1743 }, { "entropy": 1.0211364477872849, "epoch": 0.918378093733544, "grad_norm": 0.2978745996952057, "learning_rate": 0.00019521754217798935, "loss": 0.2231602966785431, "mean_token_accuracy": 0.9130188077688217, "num_tokens": 21513984.0, "step": 1744 }, { "entropy": 0.9940465688705444, "epoch": 0.9189046866771985, "grad_norm": 0.2930096685886383, "learning_rate": 0.00019521048660495026, "loss": 0.19159580767154694, "mean_token_accuracy": 0.9195211082696915, "num_tokens": 21526320.0, "step": 1745 }, { "entropy": 0.9247337281703949, "epoch": 0.919431279620853, "grad_norm": 0.2832118570804596, "learning_rate": 0.00019520342597346125, "loss": 0.21378204226493835, "mean_token_accuracy": 0.9141468554735184, "num_tokens": 21538656.0, "step": 1746 }, { "entropy": 0.9416433870792389, "epoch": 0.9199578725645077, "grad_norm": 0.3025250732898712, "learning_rate": 0.00019519636028394148, "loss": 0.21570643782615662, "mean_token_accuracy": 0.9150727838277817, "num_tokens": 21550992.0, "step": 1747 }, { "entropy": 0.9537800550460815, "epoch": 0.9204844655081622, "grad_norm": 0.29714229702949524, "learning_rate": 0.00019518928953681032, "loss": 0.22764158248901367, "mean_token_accuracy": 0.9034122675657272, "num_tokens": 21563328.0, "step": 1748 }, { "entropy": 0.9719788879156113, "epoch": 0.9210110584518167, "grad_norm": 0.2960829734802246, "learning_rate": 0.00019518221373248756, "loss": 0.2084151953458786, "mean_token_accuracy": 0.9151151925325394, "num_tokens": 21575664.0, "step": 1749 }, { "entropy": 0.9682374745607376, "epoch": 0.9215376513954713, "grad_norm": 0.2902142405509949, "learning_rate": 0.00019517513287139326, "loss": 0.19477756321430206, "mean_token_accuracy": 0.9197756201028824, "num_tokens": 21588000.0, "step": 1750 }, { "entropy": 0.9519971162080765, "epoch": 0.9220642443391258, "grad_norm": 0.28657373785972595, "learning_rate": 0.00019516804695394777, "loss": 0.23340506851673126, "mean_token_accuracy": 0.9101651012897491, "num_tokens": 21600336.0, "step": 1751 }, { "entropy": 0.9670501947402954, "epoch": 0.9225908372827805, "grad_norm": 0.2798555791378021, "learning_rate": 0.00019516095598057174, "loss": 0.2065662145614624, "mean_token_accuracy": 0.9186369478702545, "num_tokens": 21612672.0, "step": 1752 }, { "entropy": 0.9457984417676926, "epoch": 0.923117430226435, "grad_norm": 0.2589358985424042, "learning_rate": 0.00019515385995168608, "loss": 0.1857452392578125, "mean_token_accuracy": 0.9278716593980789, "num_tokens": 21625008.0, "step": 1753 }, { "entropy": 0.923014685511589, "epoch": 0.9236440231700895, "grad_norm": 0.29148226976394653, "learning_rate": 0.00019514675886771207, "loss": 0.21651901304721832, "mean_token_accuracy": 0.9152826964855194, "num_tokens": 21637344.0, "step": 1754 }, { "entropy": 0.95480976998806, "epoch": 0.9241706161137441, "grad_norm": 0.28343141078948975, "learning_rate": 0.00019513965272907128, "loss": 0.2175363004207611, "mean_token_accuracy": 0.9101854413747787, "num_tokens": 21649680.0, "step": 1755 }, { "entropy": 0.9613447189331055, "epoch": 0.9246972090573986, "grad_norm": 0.3009392023086548, "learning_rate": 0.0001951325415361855, "loss": 0.22403854131698608, "mean_token_accuracy": 0.9168571084737778, "num_tokens": 21662016.0, "step": 1756 }, { "entropy": 0.9929066747426987, "epoch": 0.9252238020010531, "grad_norm": 0.3036598563194275, "learning_rate": 0.00019512542528947696, "loss": 0.22976119816303253, "mean_token_accuracy": 0.9101551920175552, "num_tokens": 21674352.0, "step": 1757 }, { "entropy": 0.968064159154892, "epoch": 0.9257503949447078, "grad_norm": 0.28782951831817627, "learning_rate": 0.00019511830398936809, "loss": 0.21798846125602722, "mean_token_accuracy": 0.9074330925941467, "num_tokens": 21686688.0, "step": 1758 }, { "entropy": 0.9647489339113235, "epoch": 0.9262769878883623, "grad_norm": 0.2734207212924957, "learning_rate": 0.00019511117763628156, "loss": 0.209343820810318, "mean_token_accuracy": 0.9190388172864914, "num_tokens": 21699024.0, "step": 1759 }, { "entropy": 0.9990984350442886, "epoch": 0.9268035808320169, "grad_norm": 0.26921236515045166, "learning_rate": 0.00019510404623064053, "loss": 0.21170470118522644, "mean_token_accuracy": 0.9162604361772537, "num_tokens": 21711360.0, "step": 1760 }, { "entropy": 0.9623449593782425, "epoch": 0.9273301737756714, "grad_norm": 0.2714099884033203, "learning_rate": 0.00019509690977286825, "loss": 0.21800348162651062, "mean_token_accuracy": 0.9147970378398895, "num_tokens": 21723696.0, "step": 1761 }, { "entropy": 1.0402387380599976, "epoch": 0.9278567667193259, "grad_norm": 0.2736240327358246, "learning_rate": 0.00019508976826338844, "loss": 0.22173887491226196, "mean_token_accuracy": 0.9075192958116531, "num_tokens": 21736032.0, "step": 1762 }, { "entropy": 1.0271132439374924, "epoch": 0.9283833596629805, "grad_norm": 0.2877287268638611, "learning_rate": 0.00019508262170262502, "loss": 0.21932274103164673, "mean_token_accuracy": 0.915712833404541, "num_tokens": 21748368.0, "step": 1763 }, { "entropy": 1.034477338194847, "epoch": 0.9289099526066351, "grad_norm": 0.2779938280582428, "learning_rate": 0.0001950754700910023, "loss": 0.207020103931427, "mean_token_accuracy": 0.9147273898124695, "num_tokens": 21760704.0, "step": 1764 }, { "entropy": 0.9738915860652924, "epoch": 0.9294365455502897, "grad_norm": 0.25146281719207764, "learning_rate": 0.00019506831342894473, "loss": 0.1815354973077774, "mean_token_accuracy": 0.9243048876523972, "num_tokens": 21773040.0, "step": 1765 }, { "entropy": 0.9640511274337769, "epoch": 0.9299631384939442, "grad_norm": 0.2794640362262726, "learning_rate": 0.0001950611517168772, "loss": 0.222852423787117, "mean_token_accuracy": 0.9066295772790909, "num_tokens": 21785376.0, "step": 1766 }, { "entropy": 0.9703959077596664, "epoch": 0.9304897314375987, "grad_norm": 0.2606351971626282, "learning_rate": 0.00019505398495522487, "loss": 0.1913529932498932, "mean_token_accuracy": 0.9248643219470978, "num_tokens": 21797712.0, "step": 1767 }, { "entropy": 0.9996339529752731, "epoch": 0.9310163243812533, "grad_norm": 0.310641884803772, "learning_rate": 0.00019504681314441323, "loss": 0.22644834220409393, "mean_token_accuracy": 0.9118537902832031, "num_tokens": 21810048.0, "step": 1768 }, { "entropy": 0.9964617937803268, "epoch": 0.9315429173249078, "grad_norm": 0.2875900864601135, "learning_rate": 0.00019503963628486793, "loss": 0.2038813978433609, "mean_token_accuracy": 0.9186841398477554, "num_tokens": 21822384.0, "step": 1769 }, { "entropy": 0.9495928287506104, "epoch": 0.9320695102685624, "grad_norm": 0.2897108495235443, "learning_rate": 0.00019503245437701508, "loss": 0.20874524116516113, "mean_token_accuracy": 0.9164410084486008, "num_tokens": 21834720.0, "step": 1770 }, { "entropy": 1.0277469605207443, "epoch": 0.932596103212217, "grad_norm": 0.31645241379737854, "learning_rate": 0.00019502526742128104, "loss": 0.2254372090101242, "mean_token_accuracy": 0.9089788496494293, "num_tokens": 21847056.0, "step": 1771 }, { "entropy": 1.041675180196762, "epoch": 0.9331226961558715, "grad_norm": 0.3042741119861603, "learning_rate": 0.00019501807541809243, "loss": 0.21151864528656006, "mean_token_accuracy": 0.9152505397796631, "num_tokens": 21859392.0, "step": 1772 }, { "entropy": 1.0295332968235016, "epoch": 0.933649289099526, "grad_norm": 0.32914313673973083, "learning_rate": 0.00019501087836787623, "loss": 0.2500017285346985, "mean_token_accuracy": 0.8985483199357986, "num_tokens": 21871728.0, "step": 1773 }, { "entropy": 1.0453828126192093, "epoch": 0.9341758820431806, "grad_norm": 0.2983553111553192, "learning_rate": 0.00019500367627105965, "loss": 0.21561893820762634, "mean_token_accuracy": 0.9130748361349106, "num_tokens": 21884064.0, "step": 1774 }, { "entropy": 1.002024069428444, "epoch": 0.9347024749868352, "grad_norm": 0.28427883982658386, "learning_rate": 0.00019499646912807023, "loss": 0.22381159663200378, "mean_token_accuracy": 0.9057275652885437, "num_tokens": 21896400.0, "step": 1775 }, { "entropy": 1.0608263909816742, "epoch": 0.9352290679304898, "grad_norm": 0.27167659997940063, "learning_rate": 0.00019498925693933584, "loss": 0.1875414401292801, "mean_token_accuracy": 0.9234858453273773, "num_tokens": 21908736.0, "step": 1776 }, { "entropy": 1.0062582045793533, "epoch": 0.9357556608741443, "grad_norm": 0.2636836767196655, "learning_rate": 0.00019498203970528462, "loss": 0.21502971649169922, "mean_token_accuracy": 0.919221356511116, "num_tokens": 21921072.0, "step": 1777 }, { "entropy": 1.006988525390625, "epoch": 0.9362822538177988, "grad_norm": 0.26056134700775146, "learning_rate": 0.00019497481742634503, "loss": 0.201970174908638, "mean_token_accuracy": 0.9196654409170151, "num_tokens": 21933408.0, "step": 1778 }, { "entropy": 1.0629092454910278, "epoch": 0.9368088467614534, "grad_norm": 0.29083991050720215, "learning_rate": 0.00019496759010294577, "loss": 0.22228607535362244, "mean_token_accuracy": 0.9100936055183411, "num_tokens": 21945744.0, "step": 1779 }, { "entropy": 1.0019027441740036, "epoch": 0.9373354397051079, "grad_norm": 0.2699200212955475, "learning_rate": 0.00019496035773551592, "loss": 0.22549045085906982, "mean_token_accuracy": 0.9094872325658798, "num_tokens": 21958080.0, "step": 1780 }, { "entropy": 1.0057822614908218, "epoch": 0.9378620326487626, "grad_norm": 0.28440120816230774, "learning_rate": 0.00019495312032448485, "loss": 0.22345775365829468, "mean_token_accuracy": 0.9118607193231583, "num_tokens": 21970416.0, "step": 1781 }, { "entropy": 1.0094308406114578, "epoch": 0.9383886255924171, "grad_norm": 0.2834523320198059, "learning_rate": 0.00019494587787028216, "loss": 0.22185727953910828, "mean_token_accuracy": 0.9113683104515076, "num_tokens": 21982752.0, "step": 1782 }, { "entropy": 0.9964211732149124, "epoch": 0.9389152185360716, "grad_norm": 0.2954987585544586, "learning_rate": 0.00019493863037333778, "loss": 0.20775803923606873, "mean_token_accuracy": 0.9154636561870575, "num_tokens": 21995088.0, "step": 1783 }, { "entropy": 1.0346784442663193, "epoch": 0.9394418114797262, "grad_norm": 0.2964785695075989, "learning_rate": 0.000194931377834082, "loss": 0.2272047996520996, "mean_token_accuracy": 0.9083570241928101, "num_tokens": 22007424.0, "step": 1784 }, { "entropy": 1.0281512439250946, "epoch": 0.9399684044233807, "grad_norm": 0.26846325397491455, "learning_rate": 0.00019492412025294534, "loss": 0.20067930221557617, "mean_token_accuracy": 0.9195989966392517, "num_tokens": 22019760.0, "step": 1785 }, { "entropy": 0.9764789193868637, "epoch": 0.9404949973670352, "grad_norm": 0.26383689045906067, "learning_rate": 0.0001949168576303586, "loss": 0.2051767259836197, "mean_token_accuracy": 0.92010198533535, "num_tokens": 22032096.0, "step": 1786 }, { "entropy": 1.078786700963974, "epoch": 0.9410215903106899, "grad_norm": 0.3011668920516968, "learning_rate": 0.000194909589966753, "loss": 0.221777081489563, "mean_token_accuracy": 0.9121461063623428, "num_tokens": 22044432.0, "step": 1787 }, { "entropy": 0.9719114750623703, "epoch": 0.9415481832543444, "grad_norm": 0.27153825759887695, "learning_rate": 0.0001949023172625599, "loss": 0.21883930265903473, "mean_token_accuracy": 0.913441613316536, "num_tokens": 22056768.0, "step": 1788 }, { "entropy": 0.9923989027738571, "epoch": 0.942074776197999, "grad_norm": 0.3212338984012604, "learning_rate": 0.00019489503951821107, "loss": 0.22175338864326477, "mean_token_accuracy": 0.9168316125869751, "num_tokens": 22069104.0, "step": 1789 }, { "entropy": 0.9783156663179398, "epoch": 0.9426013691416535, "grad_norm": 0.273110568523407, "learning_rate": 0.00019488775673413857, "loss": 0.21147552132606506, "mean_token_accuracy": 0.9130014330148697, "num_tokens": 22081440.0, "step": 1790 }, { "entropy": 0.9893038272857666, "epoch": 0.943127962085308, "grad_norm": 0.2790793478488922, "learning_rate": 0.00019488046891077474, "loss": 0.22615540027618408, "mean_token_accuracy": 0.9109261482954025, "num_tokens": 22093776.0, "step": 1791 }, { "entropy": 1.0380553901195526, "epoch": 0.9436545550289626, "grad_norm": 0.27198460698127747, "learning_rate": 0.00019487317604855212, "loss": 0.205999955534935, "mean_token_accuracy": 0.9175222963094711, "num_tokens": 22106112.0, "step": 1792 }, { "entropy": 1.0116278380155563, "epoch": 0.9441811479726172, "grad_norm": 0.2635519504547119, "learning_rate": 0.00019486587814790377, "loss": 0.21772751212120056, "mean_token_accuracy": 0.9136025160551071, "num_tokens": 22118448.0, "step": 1793 }, { "entropy": 1.0237055569887161, "epoch": 0.9447077409162717, "grad_norm": 0.2741040289402008, "learning_rate": 0.00019485857520926288, "loss": 0.20760180056095123, "mean_token_accuracy": 0.9132292419672012, "num_tokens": 22130784.0, "step": 1794 }, { "entropy": 1.0196455419063568, "epoch": 0.9452343338599263, "grad_norm": 0.27313318848609924, "learning_rate": 0.00019485126723306292, "loss": 0.18969658017158508, "mean_token_accuracy": 0.9258754402399063, "num_tokens": 22143120.0, "step": 1795 }, { "entropy": 1.0403377711772919, "epoch": 0.9457609268035808, "grad_norm": 0.2604946494102478, "learning_rate": 0.00019484395421973783, "loss": 0.2132149338722229, "mean_token_accuracy": 0.9197222590446472, "num_tokens": 22155456.0, "step": 1796 }, { "entropy": 0.9670400768518448, "epoch": 0.9462875197472354, "grad_norm": 0.24395477771759033, "learning_rate": 0.00019483663616972165, "loss": 0.19094271957874298, "mean_token_accuracy": 0.9200141131877899, "num_tokens": 22167792.0, "step": 1797 }, { "entropy": 1.0197023451328278, "epoch": 0.94681411269089, "grad_norm": 0.2558318078517914, "learning_rate": 0.00019482931308344888, "loss": 0.19818465411663055, "mean_token_accuracy": 0.9231192022562027, "num_tokens": 22180128.0, "step": 1798 }, { "entropy": 1.0280962586402893, "epoch": 0.9473407056345445, "grad_norm": 0.28250062465667725, "learning_rate": 0.00019482198496135417, "loss": 0.22149549424648285, "mean_token_accuracy": 0.9105774611234665, "num_tokens": 22192464.0, "step": 1799 }, { "entropy": 1.004937931895256, "epoch": 0.9478672985781991, "grad_norm": 0.2890641391277313, "learning_rate": 0.00019481465180387264, "loss": 0.2117823362350464, "mean_token_accuracy": 0.9159420728683472, "num_tokens": 22204800.0, "step": 1800 }, { "entropy": 0.9912999272346497, "epoch": 0.9483938915218536, "grad_norm": 0.2721498906612396, "learning_rate": 0.00019480731361143955, "loss": 0.19752754271030426, "mean_token_accuracy": 0.9188252538442612, "num_tokens": 22217136.0, "step": 1801 }, { "entropy": 0.9911512136459351, "epoch": 0.9489204844655081, "grad_norm": 0.2967390716075897, "learning_rate": 0.00019479997038449054, "loss": 0.2183246612548828, "mean_token_accuracy": 0.908792570233345, "num_tokens": 22229472.0, "step": 1802 }, { "entropy": 1.0003108382225037, "epoch": 0.9494470774091627, "grad_norm": 0.281955748796463, "learning_rate": 0.00019479262212346153, "loss": 0.20015354454517365, "mean_token_accuracy": 0.9192506521940231, "num_tokens": 22241808.0, "step": 1803 }, { "entropy": 1.005830705165863, "epoch": 0.9499736703528173, "grad_norm": 0.29906165599823, "learning_rate": 0.00019478526882878876, "loss": 0.2205047309398651, "mean_token_accuracy": 0.9138208776712418, "num_tokens": 22254144.0, "step": 1804 }, { "entropy": 0.9975222796201706, "epoch": 0.9505002632964719, "grad_norm": 0.297961950302124, "learning_rate": 0.00019477791050090875, "loss": 0.21634206175804138, "mean_token_accuracy": 0.9120276570320129, "num_tokens": 22266480.0, "step": 1805 }, { "entropy": 0.9912213832139969, "epoch": 0.9510268562401264, "grad_norm": 0.3019638955593109, "learning_rate": 0.00019477054714025832, "loss": 0.21199895441532135, "mean_token_accuracy": 0.9165389537811279, "num_tokens": 22278816.0, "step": 1806 }, { "entropy": 0.9327168315649033, "epoch": 0.9515534491837809, "grad_norm": 0.288906991481781, "learning_rate": 0.00019476317874727456, "loss": 0.23043318092823029, "mean_token_accuracy": 0.9077083468437195, "num_tokens": 22291152.0, "step": 1807 }, { "entropy": 0.9759026318788528, "epoch": 0.9520800421274355, "grad_norm": 0.2820807993412018, "learning_rate": 0.00019475580532239497, "loss": 0.21610046923160553, "mean_token_accuracy": 0.914526030421257, "num_tokens": 22303488.0, "step": 1808 }, { "entropy": 1.01944038271904, "epoch": 0.95260663507109, "grad_norm": 0.29718121886253357, "learning_rate": 0.00019474842686605716, "loss": 0.2213006466627121, "mean_token_accuracy": 0.9078305512666702, "num_tokens": 22315824.0, "step": 1809 }, { "entropy": 0.9788577258586884, "epoch": 0.9531332280147446, "grad_norm": 0.2710515558719635, "learning_rate": 0.00019474104337869924, "loss": 0.19855360686779022, "mean_token_accuracy": 0.9186171144247055, "num_tokens": 22328160.0, "step": 1810 }, { "entropy": 0.9749794155359268, "epoch": 0.9536598209583992, "grad_norm": 0.2699875235557556, "learning_rate": 0.00019473365486075944, "loss": 0.20002411305904388, "mean_token_accuracy": 0.917415052652359, "num_tokens": 22340496.0, "step": 1811 }, { "entropy": 1.0002324134111404, "epoch": 0.9541864139020537, "grad_norm": 0.2768368422985077, "learning_rate": 0.00019472626131267646, "loss": 0.2179412692785263, "mean_token_accuracy": 0.9109683334827423, "num_tokens": 22352832.0, "step": 1812 }, { "entropy": 1.0184978395700455, "epoch": 0.9547130068457083, "grad_norm": 0.2990346848964691, "learning_rate": 0.00019471886273488915, "loss": 0.22559918463230133, "mean_token_accuracy": 0.911268338561058, "num_tokens": 22365168.0, "step": 1813 }, { "entropy": 0.9672580063343048, "epoch": 0.9552395997893628, "grad_norm": 0.258120059967041, "learning_rate": 0.00019471145912783671, "loss": 0.19848020374774933, "mean_token_accuracy": 0.9207747876644135, "num_tokens": 22377504.0, "step": 1814 }, { "entropy": 1.0332013070583344, "epoch": 0.9557661927330173, "grad_norm": 0.27658164501190186, "learning_rate": 0.00019470405049195876, "loss": 0.22540630400180817, "mean_token_accuracy": 0.909706637263298, "num_tokens": 22389840.0, "step": 1815 }, { "entropy": 1.0286743193864822, "epoch": 0.956292785676672, "grad_norm": 0.30504515767097473, "learning_rate": 0.00019469663682769491, "loss": 0.22958287596702576, "mean_token_accuracy": 0.90970279276371, "num_tokens": 22402176.0, "step": 1816 }, { "entropy": 1.0396344661712646, "epoch": 0.9568193786203265, "grad_norm": 0.3122229278087616, "learning_rate": 0.00019468921813548546, "loss": 0.21201902627944946, "mean_token_accuracy": 0.912709191441536, "num_tokens": 22414512.0, "step": 1817 }, { "entropy": 0.9904589354991913, "epoch": 0.957345971563981, "grad_norm": 0.2821761667728424, "learning_rate": 0.00019468179441577073, "loss": 0.21789240837097168, "mean_token_accuracy": 0.9137752056121826, "num_tokens": 22426848.0, "step": 1818 }, { "entropy": 0.9968847781419754, "epoch": 0.9578725645076356, "grad_norm": 0.2896675765514374, "learning_rate": 0.0001946743656689914, "loss": 0.19366274774074554, "mean_token_accuracy": 0.9199696481227875, "num_tokens": 22439184.0, "step": 1819 }, { "entropy": 0.9972859472036362, "epoch": 0.9583991574512901, "grad_norm": 0.2833546996116638, "learning_rate": 0.00019466693189558852, "loss": 0.20901280641555786, "mean_token_accuracy": 0.9163765460252762, "num_tokens": 22451520.0, "step": 1820 }, { "entropy": 1.0221098363399506, "epoch": 0.9589257503949447, "grad_norm": 0.30042803287506104, "learning_rate": 0.00019465949309600334, "loss": 0.20722414553165436, "mean_token_accuracy": 0.9166164398193359, "num_tokens": 22463856.0, "step": 1821 }, { "entropy": 0.9847268313169479, "epoch": 0.9594523433385993, "grad_norm": 0.29877185821533203, "learning_rate": 0.00019465204927067754, "loss": 0.22702287137508392, "mean_token_accuracy": 0.910624086856842, "num_tokens": 22476192.0, "step": 1822 }, { "entropy": 1.0212393552064896, "epoch": 0.9599789362822538, "grad_norm": 0.3099231421947479, "learning_rate": 0.00019464460042005293, "loss": 0.23366589844226837, "mean_token_accuracy": 0.9104152172803879, "num_tokens": 22488528.0, "step": 1823 }, { "entropy": 1.0240531265735626, "epoch": 0.9605055292259084, "grad_norm": 0.2815970182418823, "learning_rate": 0.00019463714654457172, "loss": 0.19396552443504333, "mean_token_accuracy": 0.9191655963659286, "num_tokens": 22500864.0, "step": 1824 }, { "entropy": 0.9908776879310608, "epoch": 0.9610321221695629, "grad_norm": 0.25329092144966125, "learning_rate": 0.00019462968764467648, "loss": 0.19574449956417084, "mean_token_accuracy": 0.9221374094486237, "num_tokens": 22513200.0, "step": 1825 }, { "entropy": 1.0275763273239136, "epoch": 0.9615587151132174, "grad_norm": 0.29698899388313293, "learning_rate": 0.00019462222372080992, "loss": 0.23368221521377563, "mean_token_accuracy": 0.9036354571580887, "num_tokens": 22525536.0, "step": 1826 }, { "entropy": 1.0337569862604141, "epoch": 0.9620853080568721, "grad_norm": 0.3343221843242645, "learning_rate": 0.00019461475477341512, "loss": 0.21144059300422668, "mean_token_accuracy": 0.9137226939201355, "num_tokens": 22537872.0, "step": 1827 }, { "entropy": 1.0447833985090256, "epoch": 0.9626119010005266, "grad_norm": 0.3130665421485901, "learning_rate": 0.0001946072808029355, "loss": 0.2065916359424591, "mean_token_accuracy": 0.9174522012472153, "num_tokens": 22550208.0, "step": 1828 }, { "entropy": 1.0395597666502, "epoch": 0.9631384939441812, "grad_norm": 0.26665323972702026, "learning_rate": 0.00019459980180981478, "loss": 0.21482327580451965, "mean_token_accuracy": 0.9130977690219879, "num_tokens": 22562544.0, "step": 1829 }, { "entropy": 1.0779733955860138, "epoch": 0.9636650868878357, "grad_norm": 0.28825950622558594, "learning_rate": 0.0001945923177944969, "loss": 0.21779173612594604, "mean_token_accuracy": 0.9156653732061386, "num_tokens": 22574880.0, "step": 1830 }, { "entropy": 1.0036635249853134, "epoch": 0.9641916798314902, "grad_norm": 0.2941460907459259, "learning_rate": 0.0001945848287574262, "loss": 0.2330627739429474, "mean_token_accuracy": 0.9059428721666336, "num_tokens": 22587216.0, "step": 1831 }, { "entropy": 0.9797258973121643, "epoch": 0.9647182727751448, "grad_norm": 0.25932562351226807, "learning_rate": 0.00019457733469904715, "loss": 0.2051321119070053, "mean_token_accuracy": 0.9192904084920883, "num_tokens": 22599552.0, "step": 1832 }, { "entropy": 1.039179965853691, "epoch": 0.9652448657187994, "grad_norm": 0.26872527599334717, "learning_rate": 0.0001945698356198047, "loss": 0.21343429386615753, "mean_token_accuracy": 0.9149598628282547, "num_tokens": 22611888.0, "step": 1833 }, { "entropy": 1.0027782917022705, "epoch": 0.965771458662454, "grad_norm": 0.27663007378578186, "learning_rate": 0.00019456233152014406, "loss": 0.19677159190177917, "mean_token_accuracy": 0.9209509938955307, "num_tokens": 22624224.0, "step": 1834 }, { "entropy": 1.0312834680080414, "epoch": 0.9662980516061085, "grad_norm": 0.28490519523620605, "learning_rate": 0.00019455482240051064, "loss": 0.21659842133522034, "mean_token_accuracy": 0.9108777791261673, "num_tokens": 22636560.0, "step": 1835 }, { "entropy": 1.012413963675499, "epoch": 0.966824644549763, "grad_norm": 0.27517637610435486, "learning_rate": 0.00019454730826135022, "loss": 0.22000275552272797, "mean_token_accuracy": 0.9186523258686066, "num_tokens": 22648896.0, "step": 1836 }, { "entropy": 0.9954932332038879, "epoch": 0.9673512374934176, "grad_norm": 0.27069538831710815, "learning_rate": 0.0001945397891031089, "loss": 0.19973544776439667, "mean_token_accuracy": 0.9211115539073944, "num_tokens": 22661232.0, "step": 1837 }, { "entropy": 1.0200046300888062, "epoch": 0.9678778304370721, "grad_norm": 0.2899874150753021, "learning_rate": 0.00019453226492623305, "loss": 0.22812676429748535, "mean_token_accuracy": 0.9122350364923477, "num_tokens": 22673568.0, "step": 1838 }, { "entropy": 0.9972085207700729, "epoch": 0.9684044233807267, "grad_norm": 0.29899537563323975, "learning_rate": 0.0001945247357311693, "loss": 0.2259579598903656, "mean_token_accuracy": 0.9079723209142685, "num_tokens": 22685904.0, "step": 1839 }, { "entropy": 1.0059181898832321, "epoch": 0.9689310163243813, "grad_norm": 0.29635098576545715, "learning_rate": 0.00019451720151836467, "loss": 0.23771284520626068, "mean_token_accuracy": 0.9140820056200027, "num_tokens": 22698240.0, "step": 1840 }, { "entropy": 1.0503579378128052, "epoch": 0.9694576092680358, "grad_norm": 0.29462575912475586, "learning_rate": 0.00019450966228826635, "loss": 0.19687220454216003, "mean_token_accuracy": 0.9218025654554367, "num_tokens": 22710576.0, "step": 1841 }, { "entropy": 0.9612717479467392, "epoch": 0.9699842022116903, "grad_norm": 0.27696606516838074, "learning_rate": 0.00019450211804132196, "loss": 0.19762445986270905, "mean_token_accuracy": 0.9190530776977539, "num_tokens": 22722912.0, "step": 1842 }, { "entropy": 0.9952682256698608, "epoch": 0.9705107951553449, "grad_norm": 0.2652910053730011, "learning_rate": 0.00019449456877797933, "loss": 0.21299602091312408, "mean_token_accuracy": 0.9156957715749741, "num_tokens": 22735248.0, "step": 1843 }, { "entropy": 0.9986753612756729, "epoch": 0.9710373880989994, "grad_norm": 0.2620997726917267, "learning_rate": 0.00019448701449868662, "loss": 0.1993142068386078, "mean_token_accuracy": 0.9197477102279663, "num_tokens": 22747584.0, "step": 1844 }, { "entropy": 0.9899931252002716, "epoch": 0.9715639810426541, "grad_norm": 0.29060348868370056, "learning_rate": 0.0001944794552038923, "loss": 0.2212766706943512, "mean_token_accuracy": 0.9078968465328217, "num_tokens": 22759920.0, "step": 1845 }, { "entropy": 1.0022216588258743, "epoch": 0.9720905739863086, "grad_norm": 0.30724501609802246, "learning_rate": 0.00019447189089404513, "loss": 0.2398059368133545, "mean_token_accuracy": 0.9064589291810989, "num_tokens": 22772256.0, "step": 1846 }, { "entropy": 0.997131809592247, "epoch": 0.9726171669299631, "grad_norm": 0.286475270986557, "learning_rate": 0.0001944643215695941, "loss": 0.21739161014556885, "mean_token_accuracy": 0.9086156636476517, "num_tokens": 22784592.0, "step": 1847 }, { "entropy": 0.9620841443538666, "epoch": 0.9731437598736177, "grad_norm": 0.2802620828151703, "learning_rate": 0.00019445674723098864, "loss": 0.18609827756881714, "mean_token_accuracy": 0.9273043125867844, "num_tokens": 22796928.0, "step": 1848 }, { "entropy": 0.9614392817020416, "epoch": 0.9736703528172722, "grad_norm": 0.2547474205493927, "learning_rate": 0.0001944491678786783, "loss": 0.20111055672168732, "mean_token_accuracy": 0.9191482216119766, "num_tokens": 22809264.0, "step": 1849 }, { "entropy": 0.9734077900648117, "epoch": 0.9741969457609269, "grad_norm": 0.2975533902645111, "learning_rate": 0.00019444158351311308, "loss": 0.20715618133544922, "mean_token_accuracy": 0.9150333106517792, "num_tokens": 22821600.0, "step": 1850 }, { "entropy": 0.9761214107275009, "epoch": 0.9747235387045814, "grad_norm": 0.28768840432167053, "learning_rate": 0.0001944339941347432, "loss": 0.18795141577720642, "mean_token_accuracy": 0.9215870052576065, "num_tokens": 22833936.0, "step": 1851 }, { "entropy": 0.9937604367733002, "epoch": 0.9752501316482359, "grad_norm": 0.29926928877830505, "learning_rate": 0.00019442639974401923, "loss": 0.21389541029930115, "mean_token_accuracy": 0.917677566409111, "num_tokens": 22846272.0, "step": 1852 }, { "entropy": 0.9756381958723068, "epoch": 0.9757767245918905, "grad_norm": 0.298100084066391, "learning_rate": 0.00019441880034139198, "loss": 0.21645361185073853, "mean_token_accuracy": 0.91536945104599, "num_tokens": 22858608.0, "step": 1853 }, { "entropy": 0.9328114837408066, "epoch": 0.976303317535545, "grad_norm": 0.27972036600112915, "learning_rate": 0.0001944111959273126, "loss": 0.20870962738990784, "mean_token_accuracy": 0.9177060127258301, "num_tokens": 22870944.0, "step": 1854 }, { "entropy": 0.9690214693546295, "epoch": 0.9768299104791995, "grad_norm": 0.28668034076690674, "learning_rate": 0.00019440358650223244, "loss": 0.20322152972221375, "mean_token_accuracy": 0.9198893010616302, "num_tokens": 22883280.0, "step": 1855 }, { "entropy": 0.9374023228883743, "epoch": 0.9773565034228542, "grad_norm": 0.2798213064670563, "learning_rate": 0.00019439597206660336, "loss": 0.20974165201187134, "mean_token_accuracy": 0.9153610616922379, "num_tokens": 22895616.0, "step": 1856 }, { "entropy": 0.988965705037117, "epoch": 0.9778830963665087, "grad_norm": 0.2775600254535675, "learning_rate": 0.00019438835262087728, "loss": 0.19997943937778473, "mean_token_accuracy": 0.9216296821832657, "num_tokens": 22907952.0, "step": 1857 }, { "entropy": 1.0289342552423477, "epoch": 0.9784096893101633, "grad_norm": 0.3432585299015045, "learning_rate": 0.00019438072816550654, "loss": 0.22643734514713287, "mean_token_accuracy": 0.9054546356201172, "num_tokens": 22920288.0, "step": 1858 }, { "entropy": 0.9867872446775436, "epoch": 0.9789362822538178, "grad_norm": 0.29411035776138306, "learning_rate": 0.0001943730987009438, "loss": 0.22154730558395386, "mean_token_accuracy": 0.9093334376811981, "num_tokens": 22932624.0, "step": 1859 }, { "entropy": 1.0116321295499802, "epoch": 0.9794628751974723, "grad_norm": 0.25875324010849, "learning_rate": 0.00019436546422764198, "loss": 0.19839854538440704, "mean_token_accuracy": 0.9156231582164764, "num_tokens": 22944960.0, "step": 1860 }, { "entropy": 1.0039302557706833, "epoch": 0.9799894681411269, "grad_norm": 0.29284337162971497, "learning_rate": 0.00019435782474605423, "loss": 0.2374696135520935, "mean_token_accuracy": 0.905433177947998, "num_tokens": 22957296.0, "step": 1861 }, { "entropy": 1.0000396072864532, "epoch": 0.9805160610847815, "grad_norm": 0.24808640778064728, "learning_rate": 0.00019435018025663412, "loss": 0.18588939309120178, "mean_token_accuracy": 0.9234057366847992, "num_tokens": 22969632.0, "step": 1862 }, { "entropy": 1.0562945902347565, "epoch": 0.981042654028436, "grad_norm": 0.2809024453163147, "learning_rate": 0.00019434253075983543, "loss": 0.19566890597343445, "mean_token_accuracy": 0.9169919043779373, "num_tokens": 22981968.0, "step": 1863 }, { "entropy": 1.066685050725937, "epoch": 0.9815692469720906, "grad_norm": 0.2744297385215759, "learning_rate": 0.0001943348762561123, "loss": 0.21286125481128693, "mean_token_accuracy": 0.911152720451355, "num_tokens": 22994304.0, "step": 1864 }, { "entropy": 1.0672977268695831, "epoch": 0.9820958399157451, "grad_norm": 0.30773451924324036, "learning_rate": 0.00019432721674591906, "loss": 0.22466342151165009, "mean_token_accuracy": 0.9027170091867447, "num_tokens": 23006640.0, "step": 1865 }, { "entropy": 0.9817476272583008, "epoch": 0.9826224328593997, "grad_norm": 0.25929689407348633, "learning_rate": 0.00019431955222971048, "loss": 0.20428617298603058, "mean_token_accuracy": 0.9160020500421524, "num_tokens": 23018976.0, "step": 1866 }, { "entropy": 1.0060690939426422, "epoch": 0.9831490258030542, "grad_norm": 0.3303799629211426, "learning_rate": 0.00019431188270794153, "loss": 0.22543492913246155, "mean_token_accuracy": 0.9112392216920853, "num_tokens": 23031312.0, "step": 1867 }, { "entropy": 0.9948325008153915, "epoch": 0.9836756187467088, "grad_norm": 0.2678799331188202, "learning_rate": 0.00019430420818106753, "loss": 0.19793486595153809, "mean_token_accuracy": 0.9236938953399658, "num_tokens": 23043648.0, "step": 1868 }, { "entropy": 1.0155895799398422, "epoch": 0.9842022116903634, "grad_norm": 0.32058584690093994, "learning_rate": 0.00019429652864954403, "loss": 0.22886891663074493, "mean_token_accuracy": 0.9127451777458191, "num_tokens": 23055984.0, "step": 1869 }, { "entropy": 1.0170871764421463, "epoch": 0.9847288046340179, "grad_norm": 0.2957039177417755, "learning_rate": 0.00019428884411382694, "loss": 0.21584120392799377, "mean_token_accuracy": 0.9092356264591217, "num_tokens": 23068320.0, "step": 1870 }, { "entropy": 1.0231945216655731, "epoch": 0.9852553975776724, "grad_norm": 0.2651207149028778, "learning_rate": 0.00019428115457437249, "loss": 0.18167884647846222, "mean_token_accuracy": 0.9309497475624084, "num_tokens": 23080656.0, "step": 1871 }, { "entropy": 0.9718558192253113, "epoch": 0.985781990521327, "grad_norm": 0.29894301295280457, "learning_rate": 0.0001942734600316371, "loss": 0.20839130878448486, "mean_token_accuracy": 0.9109772592782974, "num_tokens": 23092992.0, "step": 1872 }, { "entropy": 1.0036133825778961, "epoch": 0.9863085834649815, "grad_norm": 0.28074634075164795, "learning_rate": 0.00019426576048607754, "loss": 0.21850639581680298, "mean_token_accuracy": 0.9151745438575745, "num_tokens": 23105328.0, "step": 1873 }, { "entropy": 1.0208822190761566, "epoch": 0.9868351764086362, "grad_norm": 0.27776047587394714, "learning_rate": 0.00019425805593815094, "loss": 0.1931566298007965, "mean_token_accuracy": 0.9207221418619156, "num_tokens": 23117664.0, "step": 1874 }, { "entropy": 0.9643638432025909, "epoch": 0.9873617693522907, "grad_norm": 0.28227487206459045, "learning_rate": 0.00019425034638831466, "loss": 0.2174389511346817, "mean_token_accuracy": 0.9123106747865677, "num_tokens": 23130000.0, "step": 1875 }, { "entropy": 1.0151402354240417, "epoch": 0.9878883622959452, "grad_norm": 0.3007744252681732, "learning_rate": 0.00019424263183702634, "loss": 0.23054783046245575, "mean_token_accuracy": 0.9074221700429916, "num_tokens": 23142336.0, "step": 1876 }, { "entropy": 1.023296281695366, "epoch": 0.9884149552395998, "grad_norm": 0.2875635623931885, "learning_rate": 0.000194234912284744, "loss": 0.2183448076248169, "mean_token_accuracy": 0.9146157503128052, "num_tokens": 23154672.0, "step": 1877 }, { "entropy": 1.025291085243225, "epoch": 0.9889415481832543, "grad_norm": 0.2833808660507202, "learning_rate": 0.00019422718773192584, "loss": 0.2020779550075531, "mean_token_accuracy": 0.9207105487585068, "num_tokens": 23167008.0, "step": 1878 }, { "entropy": 1.0463321805000305, "epoch": 0.989468141126909, "grad_norm": 0.27166518568992615, "learning_rate": 0.0001942194581790305, "loss": 0.21112844347953796, "mean_token_accuracy": 0.9151988327503204, "num_tokens": 23179344.0, "step": 1879 }, { "entropy": 1.0174481570720673, "epoch": 0.9899947340705635, "grad_norm": 0.28479474782943726, "learning_rate": 0.00019421172362651677, "loss": 0.2219792902469635, "mean_token_accuracy": 0.9093788266181946, "num_tokens": 23191680.0, "step": 1880 }, { "entropy": 1.068659245967865, "epoch": 0.990521327014218, "grad_norm": 0.27825888991355896, "learning_rate": 0.00019420398407484383, "loss": 0.2115180492401123, "mean_token_accuracy": 0.913215160369873, "num_tokens": 23204016.0, "step": 1881 }, { "entropy": 1.0102509111166, "epoch": 0.9910479199578726, "grad_norm": 0.2567676901817322, "learning_rate": 0.00019419623952447113, "loss": 0.1962418258190155, "mean_token_accuracy": 0.9181914627552032, "num_tokens": 23216352.0, "step": 1882 }, { "entropy": 1.0041260570287704, "epoch": 0.9915745129015271, "grad_norm": 0.2607569992542267, "learning_rate": 0.00019418848997585842, "loss": 0.18007442355155945, "mean_token_accuracy": 0.9283247590065002, "num_tokens": 23228688.0, "step": 1883 }, { "entropy": 1.0119262784719467, "epoch": 0.9921011058451816, "grad_norm": 0.2691285312175751, "learning_rate": 0.00019418073542946577, "loss": 0.2185424566268921, "mean_token_accuracy": 0.9108522534370422, "num_tokens": 23241024.0, "step": 1884 }, { "entropy": 1.0200906693935394, "epoch": 0.9926276987888363, "grad_norm": 0.2762972414493561, "learning_rate": 0.0001941729758857535, "loss": 0.21047905087471008, "mean_token_accuracy": 0.921312689781189, "num_tokens": 23253360.0, "step": 1885 }, { "entropy": 1.0015190541744232, "epoch": 0.9931542917324908, "grad_norm": 0.2789957523345947, "learning_rate": 0.0001941652113451822, "loss": 0.22564658522605896, "mean_token_accuracy": 0.9052274376153946, "num_tokens": 23265696.0, "step": 1886 }, { "entropy": 1.0212842226028442, "epoch": 0.9936808846761453, "grad_norm": 0.2787906527519226, "learning_rate": 0.00019415744180821293, "loss": 0.19954261183738708, "mean_token_accuracy": 0.9225759655237198, "num_tokens": 23278032.0, "step": 1887 }, { "entropy": 1.0256837606430054, "epoch": 0.9942074776197999, "grad_norm": 0.3047766089439392, "learning_rate": 0.0001941496672753068, "loss": 0.22101764380931854, "mean_token_accuracy": 0.9100571721792221, "num_tokens": 23290368.0, "step": 1888 }, { "entropy": 1.0017095357179642, "epoch": 0.9947340705634544, "grad_norm": 0.3079693913459778, "learning_rate": 0.00019414188774692542, "loss": 0.23877866566181183, "mean_token_accuracy": 0.9044640958309174, "num_tokens": 23302704.0, "step": 1889 }, { "entropy": 0.9979955106973648, "epoch": 0.995260663507109, "grad_norm": 0.28942957520484924, "learning_rate": 0.00019413410322353055, "loss": 0.21703916788101196, "mean_token_accuracy": 0.911283403635025, "num_tokens": 23315040.0, "step": 1890 }, { "entropy": 1.000881314277649, "epoch": 0.9957872564507636, "grad_norm": 0.2723085582256317, "learning_rate": 0.00019412631370558433, "loss": 0.2083275318145752, "mean_token_accuracy": 0.9137948602437973, "num_tokens": 23327376.0, "step": 1891 }, { "entropy": 0.9760307371616364, "epoch": 0.9963138493944181, "grad_norm": 0.28710952401161194, "learning_rate": 0.00019411851919354925, "loss": 0.2206597775220871, "mean_token_accuracy": 0.913771316409111, "num_tokens": 23339712.0, "step": 1892 }, { "entropy": 1.0313685238361359, "epoch": 0.9968404423380727, "grad_norm": 0.2784387767314911, "learning_rate": 0.00019411071968788792, "loss": 0.20836740732192993, "mean_token_accuracy": 0.9158921986818314, "num_tokens": 23352048.0, "step": 1893 }, { "entropy": 0.9972709268331528, "epoch": 0.9973670352817272, "grad_norm": 0.2760670781135559, "learning_rate": 0.00019410291518906337, "loss": 0.215082049369812, "mean_token_accuracy": 0.9125083088874817, "num_tokens": 23364384.0, "step": 1894 }, { "entropy": 0.9749780297279358, "epoch": 0.9978936282253817, "grad_norm": 0.2756492793560028, "learning_rate": 0.00019409510569753897, "loss": 0.19914628565311432, "mean_token_accuracy": 0.9158760160207748, "num_tokens": 23376720.0, "step": 1895 }, { "entropy": 0.9882865399122238, "epoch": 0.9984202211690363, "grad_norm": 0.3229084610939026, "learning_rate": 0.00019408729121377828, "loss": 0.21740438044071198, "mean_token_accuracy": 0.9149737656116486, "num_tokens": 23389056.0, "step": 1896 }, { "entropy": 0.979081466794014, "epoch": 0.9989468141126909, "grad_norm": 0.2839930057525635, "learning_rate": 0.00019407947173824522, "loss": 0.20839889347553253, "mean_token_accuracy": 0.9204780906438828, "num_tokens": 23401392.0, "step": 1897 }, { "entropy": 0.9407005459070206, "epoch": 0.9994734070563455, "grad_norm": 0.28035539388656616, "learning_rate": 0.00019407164727140396, "loss": 0.2062290906906128, "mean_token_accuracy": 0.9152461290359497, "num_tokens": 23413728.0, "step": 1898 }, { "entropy": 0.9624819904565811, "epoch": 1.0, "grad_norm": 0.29015156626701355, "learning_rate": 0.00019406381781371902, "loss": 0.21500550210475922, "mean_token_accuracy": 0.915779635310173, "num_tokens": 23425036.0, "step": 1899 }, { "epoch": 1.0, "eval_entropy": 0.925739836008565, "eval_loss": 0.21148517727851868, "eval_mean_token_accuracy": 0.9153817107703826, "eval_num_tokens": 23425036.0, "eval_runtime": 664.4914, "eval_samples_per_second": 8.573, "eval_steps_per_second": 2.858, "step": 1899 }, { "entropy": 0.9483114928007126, "epoch": 1.0005265929436546, "grad_norm": 0.28408128023147583, "learning_rate": 0.00019405598336565518, "loss": 0.2106991708278656, "mean_token_accuracy": 0.9160860329866409, "num_tokens": 23437372.0, "step": 1900 }, { "entropy": 0.898838147521019, "epoch": 1.001053185887309, "grad_norm": 0.27440792322158813, "learning_rate": 0.00019404814392767753, "loss": 0.21290592849254608, "mean_token_accuracy": 0.9125117361545563, "num_tokens": 23449708.0, "step": 1901 }, { "entropy": 0.9791853725910187, "epoch": 1.0015797788309637, "grad_norm": 0.28151366114616394, "learning_rate": 0.00019404029950025143, "loss": 0.19366838037967682, "mean_token_accuracy": 0.9241389185190201, "num_tokens": 23462044.0, "step": 1902 }, { "entropy": 0.9103992432355881, "epoch": 1.0021063717746181, "grad_norm": 0.29249274730682373, "learning_rate": 0.00019403245008384255, "loss": 0.21274180710315704, "mean_token_accuracy": 0.9132009893655777, "num_tokens": 23474380.0, "step": 1903 }, { "entropy": 0.9207734614610672, "epoch": 1.0026329647182728, "grad_norm": 0.29525914788246155, "learning_rate": 0.00019402459567891694, "loss": 0.20322710275650024, "mean_token_accuracy": 0.9193697869777679, "num_tokens": 23486716.0, "step": 1904 }, { "entropy": 0.9738444536924362, "epoch": 1.0031595576619274, "grad_norm": 0.28035998344421387, "learning_rate": 0.00019401673628594078, "loss": 0.1997321993112564, "mean_token_accuracy": 0.915515661239624, "num_tokens": 23499052.0, "step": 1905 }, { "entropy": 0.9290015399456024, "epoch": 1.0036861506055819, "grad_norm": 0.2815547287464142, "learning_rate": 0.00019400887190538068, "loss": 0.20885860919952393, "mean_token_accuracy": 0.9181715399026871, "num_tokens": 23511388.0, "step": 1906 }, { "entropy": 0.9481154382228851, "epoch": 1.0042127435492365, "grad_norm": 0.2717452645301819, "learning_rate": 0.0001940010025377035, "loss": 0.20289872586727142, "mean_token_accuracy": 0.9163729101419449, "num_tokens": 23523724.0, "step": 1907 }, { "entropy": 0.9266571402549744, "epoch": 1.004739336492891, "grad_norm": 0.3059215843677521, "learning_rate": 0.00019399312818337637, "loss": 0.20683327317237854, "mean_token_accuracy": 0.9123108834028244, "num_tokens": 23536060.0, "step": 1908 }, { "entropy": 0.9232073873281479, "epoch": 1.0052659294365456, "grad_norm": 0.2654300034046173, "learning_rate": 0.00019398524884286678, "loss": 0.18700408935546875, "mean_token_accuracy": 0.9244769513607025, "num_tokens": 23548396.0, "step": 1909 }, { "entropy": 0.9462733566761017, "epoch": 1.0057925223802, "grad_norm": 0.28558823466300964, "learning_rate": 0.0001939773645166425, "loss": 0.20201043784618378, "mean_token_accuracy": 0.9207958728075027, "num_tokens": 23560732.0, "step": 1910 }, { "entropy": 0.9496246725320816, "epoch": 1.0063191153238547, "grad_norm": 0.27963462471961975, "learning_rate": 0.00019396947520517154, "loss": 0.20976471900939941, "mean_token_accuracy": 0.9165468662977219, "num_tokens": 23573068.0, "step": 1911 }, { "entropy": 0.9894253462553024, "epoch": 1.0068457082675093, "grad_norm": 0.2891998291015625, "learning_rate": 0.00019396158090892224, "loss": 0.2190844714641571, "mean_token_accuracy": 0.9077310711145401, "num_tokens": 23585404.0, "step": 1912 }, { "entropy": 1.0001903474330902, "epoch": 1.0073723012111637, "grad_norm": 0.2947920560836792, "learning_rate": 0.00019395368162836323, "loss": 0.21794044971466064, "mean_token_accuracy": 0.9169338941574097, "num_tokens": 23597740.0, "step": 1913 }, { "entropy": 0.9664654582738876, "epoch": 1.0078988941548184, "grad_norm": 0.270565390586853, "learning_rate": 0.00019394577736396346, "loss": 0.19095301628112793, "mean_token_accuracy": 0.9217241108417511, "num_tokens": 23610076.0, "step": 1914 }, { "entropy": 0.9208107441663742, "epoch": 1.0084254870984728, "grad_norm": 0.27241528034210205, "learning_rate": 0.0001939378681161922, "loss": 0.18645267188549042, "mean_token_accuracy": 0.9272374659776688, "num_tokens": 23622412.0, "step": 1915 }, { "entropy": 1.0111596435308456, "epoch": 1.0089520800421274, "grad_norm": 0.3164159655570984, "learning_rate": 0.00019392995388551888, "loss": 0.22077365219593048, "mean_token_accuracy": 0.9118006080389023, "num_tokens": 23634748.0, "step": 1916 }, { "entropy": 0.944818839430809, "epoch": 1.009478672985782, "grad_norm": 0.28582748770713806, "learning_rate": 0.00019392203467241342, "loss": 0.2104344218969345, "mean_token_accuracy": 0.9131231158971786, "num_tokens": 23647084.0, "step": 1917 }, { "entropy": 1.0247685611248016, "epoch": 1.0100052659294365, "grad_norm": 0.2851823568344116, "learning_rate": 0.00019391411047734589, "loss": 0.21748843789100647, "mean_token_accuracy": 0.9151061922311783, "num_tokens": 23659420.0, "step": 1918 }, { "entropy": 0.9971954673528671, "epoch": 1.0105318588730912, "grad_norm": 0.2717190682888031, "learning_rate": 0.00019390618130078673, "loss": 0.2043081521987915, "mean_token_accuracy": 0.9173936247825623, "num_tokens": 23671756.0, "step": 1919 }, { "entropy": 0.9666483253240585, "epoch": 1.0110584518167456, "grad_norm": 0.2750032842159271, "learning_rate": 0.00019389824714320658, "loss": 0.19933579862117767, "mean_token_accuracy": 0.9193840771913528, "num_tokens": 23684092.0, "step": 1920 }, { "entropy": 0.997409462928772, "epoch": 1.0115850447604002, "grad_norm": 0.2951802611351013, "learning_rate": 0.0001938903080050765, "loss": 0.2241615653038025, "mean_token_accuracy": 0.9114827215671539, "num_tokens": 23696428.0, "step": 1921 }, { "entropy": 1.0097313821315765, "epoch": 1.0121116377040547, "grad_norm": 0.29612311720848083, "learning_rate": 0.00019388236388686783, "loss": 0.2130715399980545, "mean_token_accuracy": 0.9157524257898331, "num_tokens": 23708764.0, "step": 1922 }, { "entropy": 1.029169887304306, "epoch": 1.0126382306477093, "grad_norm": 0.28184011578559875, "learning_rate": 0.00019387441478905206, "loss": 0.20634552836418152, "mean_token_accuracy": 0.9152942299842834, "num_tokens": 23721100.0, "step": 1923 }, { "entropy": 1.0215208977460861, "epoch": 1.013164823591364, "grad_norm": 0.2626985013484955, "learning_rate": 0.00019386646071210118, "loss": 0.18794600665569305, "mean_token_accuracy": 0.9244592189788818, "num_tokens": 23733436.0, "step": 1924 }, { "entropy": 1.03949436545372, "epoch": 1.0136914165350184, "grad_norm": 0.2628861665725708, "learning_rate": 0.00019385850165648733, "loss": 0.2007792592048645, "mean_token_accuracy": 0.9187650829553604, "num_tokens": 23745772.0, "step": 1925 }, { "entropy": 0.9779924899339676, "epoch": 1.014218009478673, "grad_norm": 0.28041279315948486, "learning_rate": 0.000193850537622683, "loss": 0.1995813548564911, "mean_token_accuracy": 0.9189839065074921, "num_tokens": 23758108.0, "step": 1926 }, { "entropy": 1.0496584177017212, "epoch": 1.0147446024223274, "grad_norm": 0.30866992473602295, "learning_rate": 0.00019384256861116096, "loss": 0.2425222247838974, "mean_token_accuracy": 0.9028880447149277, "num_tokens": 23770444.0, "step": 1927 }, { "entropy": 1.0065599381923676, "epoch": 1.015271195365982, "grad_norm": 0.26788726449012756, "learning_rate": 0.0001938345946223943, "loss": 0.1882321834564209, "mean_token_accuracy": 0.9198320806026459, "num_tokens": 23782780.0, "step": 1928 }, { "entropy": 1.0039747208356857, "epoch": 1.0157977883096367, "grad_norm": 0.2758983373641968, "learning_rate": 0.00019382661565685638, "loss": 0.20896543562412262, "mean_token_accuracy": 0.9133927524089813, "num_tokens": 23795116.0, "step": 1929 }, { "entropy": 0.9877621978521347, "epoch": 1.0163243812532912, "grad_norm": 0.27864596247673035, "learning_rate": 0.00019381863171502088, "loss": 0.18458585441112518, "mean_token_accuracy": 0.9242655336856842, "num_tokens": 23807452.0, "step": 1930 }, { "entropy": 1.00676129758358, "epoch": 1.0168509741969458, "grad_norm": 0.27991485595703125, "learning_rate": 0.00019381064279736174, "loss": 0.21812650561332703, "mean_token_accuracy": 0.915228009223938, "num_tokens": 23819788.0, "step": 1931 }, { "entropy": 0.9534656554460526, "epoch": 1.0173775671406002, "grad_norm": 0.2649945914745331, "learning_rate": 0.00019380264890435324, "loss": 0.21227021515369415, "mean_token_accuracy": 0.9195111691951752, "num_tokens": 23832124.0, "step": 1932 }, { "entropy": 1.000964567065239, "epoch": 1.0179041600842549, "grad_norm": 0.268867164850235, "learning_rate": 0.0001937946500364699, "loss": 0.20481450855731964, "mean_token_accuracy": 0.9178451746702194, "num_tokens": 23844460.0, "step": 1933 }, { "entropy": 1.000000774860382, "epoch": 1.0184307530279095, "grad_norm": 0.27489760518074036, "learning_rate": 0.00019378664619418653, "loss": 0.20561310648918152, "mean_token_accuracy": 0.915080651640892, "num_tokens": 23856796.0, "step": 1934 }, { "entropy": 0.9716245830059052, "epoch": 1.018957345971564, "grad_norm": 0.306060791015625, "learning_rate": 0.00019377863737797839, "loss": 0.21995992958545685, "mean_token_accuracy": 0.910162016749382, "num_tokens": 23869132.0, "step": 1935 }, { "entropy": 0.9378920793533325, "epoch": 1.0194839389152186, "grad_norm": 0.26929163932800293, "learning_rate": 0.00019377062358832083, "loss": 0.18971963226795197, "mean_token_accuracy": 0.921707347035408, "num_tokens": 23881468.0, "step": 1936 }, { "entropy": 0.9584116488695145, "epoch": 1.020010531858873, "grad_norm": 0.27198344469070435, "learning_rate": 0.0001937626048256896, "loss": 0.19669067859649658, "mean_token_accuracy": 0.9219775944948196, "num_tokens": 23893804.0, "step": 1937 }, { "entropy": 0.9765763580799103, "epoch": 1.0205371248025277, "grad_norm": 0.2800286114215851, "learning_rate": 0.0001937545810905607, "loss": 0.20201562345027924, "mean_token_accuracy": 0.9161263704299927, "num_tokens": 23906140.0, "step": 1938 }, { "entropy": 0.9443774819374084, "epoch": 1.021063717746182, "grad_norm": 0.28303396701812744, "learning_rate": 0.0001937465523834105, "loss": 0.19613805413246155, "mean_token_accuracy": 0.9168961495161057, "num_tokens": 23918476.0, "step": 1939 }, { "entropy": 0.9929839223623276, "epoch": 1.0215903106898367, "grad_norm": 0.317105770111084, "learning_rate": 0.00019373851870471562, "loss": 0.20963701605796814, "mean_token_accuracy": 0.9184058755636215, "num_tokens": 23930812.0, "step": 1940 }, { "entropy": 0.9796905666589737, "epoch": 1.0221169036334914, "grad_norm": 0.29658782482147217, "learning_rate": 0.0001937304800549529, "loss": 0.2231239676475525, "mean_token_accuracy": 0.9108584076166153, "num_tokens": 23943148.0, "step": 1941 }, { "entropy": 0.9595655649900436, "epoch": 1.0226434965771458, "grad_norm": 0.25836655497550964, "learning_rate": 0.00019372243643459963, "loss": 0.18731528520584106, "mean_token_accuracy": 0.9224317222833633, "num_tokens": 23955484.0, "step": 1942 }, { "entropy": 0.9837910383939743, "epoch": 1.0231700895208005, "grad_norm": 0.2838844060897827, "learning_rate": 0.0001937143878441333, "loss": 0.21538090705871582, "mean_token_accuracy": 0.9147688299417496, "num_tokens": 23967820.0, "step": 1943 }, { "entropy": 1.002283364534378, "epoch": 1.0236966824644549, "grad_norm": 0.2761163115501404, "learning_rate": 0.00019370633428403164, "loss": 0.17965167760849, "mean_token_accuracy": 0.9276806563138962, "num_tokens": 23980156.0, "step": 1944 }, { "entropy": 0.9750987738370895, "epoch": 1.0242232754081095, "grad_norm": 0.2677707374095917, "learning_rate": 0.00019369827575477282, "loss": 0.1916501522064209, "mean_token_accuracy": 0.9206420630216599, "num_tokens": 23992492.0, "step": 1945 }, { "entropy": 1.0182987600564957, "epoch": 1.0247498683517642, "grad_norm": 0.2850121259689331, "learning_rate": 0.00019369021225683518, "loss": 0.2081344723701477, "mean_token_accuracy": 0.9149588048458099, "num_tokens": 24004828.0, "step": 1946 }, { "entropy": 0.9728025048971176, "epoch": 1.0252764612954186, "grad_norm": 0.2776131331920624, "learning_rate": 0.00019368214379069745, "loss": 0.20609930157661438, "mean_token_accuracy": 0.9178636223077774, "num_tokens": 24017164.0, "step": 1947 }, { "entropy": 0.9742907732725143, "epoch": 1.0258030542390733, "grad_norm": 0.29074424505233765, "learning_rate": 0.0001936740703568386, "loss": 0.21784421801567078, "mean_token_accuracy": 0.9106293469667435, "num_tokens": 24029500.0, "step": 1948 }, { "entropy": 0.9815188944339752, "epoch": 1.0263296471827277, "grad_norm": 0.2835097908973694, "learning_rate": 0.0001936659919557378, "loss": 0.20473387837409973, "mean_token_accuracy": 0.9137338846921921, "num_tokens": 24041836.0, "step": 1949 }, { "entropy": 0.9593153893947601, "epoch": 1.0268562401263823, "grad_norm": 0.27597561478614807, "learning_rate": 0.00019365790858787477, "loss": 0.21293160319328308, "mean_token_accuracy": 0.9137197583913803, "num_tokens": 24054172.0, "step": 1950 }, { "entropy": 1.006902426481247, "epoch": 1.0273828330700367, "grad_norm": 0.29685065150260925, "learning_rate": 0.00019364982025372925, "loss": 0.21124479174613953, "mean_token_accuracy": 0.9155112355947495, "num_tokens": 24066508.0, "step": 1951 }, { "entropy": 0.9826443940401077, "epoch": 1.0279094260136914, "grad_norm": 0.28184542059898376, "learning_rate": 0.0001936417269537815, "loss": 0.18985268473625183, "mean_token_accuracy": 0.9251315295696259, "num_tokens": 24078844.0, "step": 1952 }, { "entropy": 0.9592526108026505, "epoch": 1.028436018957346, "grad_norm": 0.2665354013442993, "learning_rate": 0.00019363362868851186, "loss": 0.17802020907402039, "mean_token_accuracy": 0.923170417547226, "num_tokens": 24091180.0, "step": 1953 }, { "entropy": 0.9736118167638779, "epoch": 1.0289626119010005, "grad_norm": 0.2990165650844574, "learning_rate": 0.00019362552545840121, "loss": 0.21102318167686462, "mean_token_accuracy": 0.918361246585846, "num_tokens": 24103516.0, "step": 1954 }, { "entropy": 0.9543041735887527, "epoch": 1.0294892048446551, "grad_norm": 0.2993450462818146, "learning_rate": 0.00019361741726393048, "loss": 0.20676571130752563, "mean_token_accuracy": 0.9157939106225967, "num_tokens": 24115852.0, "step": 1955 }, { "entropy": 0.9188299477100372, "epoch": 1.0300157977883095, "grad_norm": 0.28595927357673645, "learning_rate": 0.00019360930410558107, "loss": 0.20469802618026733, "mean_token_accuracy": 0.9192691892385483, "num_tokens": 24128188.0, "step": 1956 }, { "entropy": 0.9500316083431244, "epoch": 1.0305423907319642, "grad_norm": 0.3056456744670868, "learning_rate": 0.00019360118598383454, "loss": 0.21120858192443848, "mean_token_accuracy": 0.9139054864645004, "num_tokens": 24140524.0, "step": 1957 }, { "entropy": 0.9614865332841873, "epoch": 1.0310689836756188, "grad_norm": 0.3015027642250061, "learning_rate": 0.00019359306289917292, "loss": 0.19627857208251953, "mean_token_accuracy": 0.9196411669254303, "num_tokens": 24152860.0, "step": 1958 }, { "entropy": 0.9348547607660294, "epoch": 1.0315955766192733, "grad_norm": 0.2926042377948761, "learning_rate": 0.00019358493485207833, "loss": 0.1929434835910797, "mean_token_accuracy": 0.9180857390165329, "num_tokens": 24165196.0, "step": 1959 }, { "entropy": 0.8882603049278259, "epoch": 1.032122169562928, "grad_norm": 0.2788626551628113, "learning_rate": 0.00019357680184303334, "loss": 0.2019919753074646, "mean_token_accuracy": 0.9170414507389069, "num_tokens": 24177532.0, "step": 1960 }, { "entropy": 0.9481528550386429, "epoch": 1.0326487625065823, "grad_norm": 0.30911776423454285, "learning_rate": 0.00019356866387252076, "loss": 0.20932908356189728, "mean_token_accuracy": 0.9150265455245972, "num_tokens": 24189868.0, "step": 1961 }, { "entropy": 0.9632448703050613, "epoch": 1.033175355450237, "grad_norm": 0.29422178864479065, "learning_rate": 0.00019356052094102367, "loss": 0.1939503401517868, "mean_token_accuracy": 0.9227122515439987, "num_tokens": 24202204.0, "step": 1962 }, { "entropy": 0.9328284412622452, "epoch": 1.0337019483938916, "grad_norm": 0.3035720884799957, "learning_rate": 0.0001935523730490255, "loss": 0.21952201426029205, "mean_token_accuracy": 0.9107953608036041, "num_tokens": 24214540.0, "step": 1963 }, { "entropy": 0.9676711559295654, "epoch": 1.034228541337546, "grad_norm": 0.2915896773338318, "learning_rate": 0.0001935442201970099, "loss": 0.19596201181411743, "mean_token_accuracy": 0.9193816781044006, "num_tokens": 24226876.0, "step": 1964 }, { "entropy": 0.9730495363473892, "epoch": 1.0347551342812007, "grad_norm": 0.28182631731033325, "learning_rate": 0.0001935360623854609, "loss": 0.20961566269397736, "mean_token_accuracy": 0.9185821712017059, "num_tokens": 24239212.0, "step": 1965 }, { "entropy": 1.023067906498909, "epoch": 1.0352817272248551, "grad_norm": 0.30114588141441345, "learning_rate": 0.00019352789961486273, "loss": 0.23333251476287842, "mean_token_accuracy": 0.9085756540298462, "num_tokens": 24251548.0, "step": 1966 }, { "entropy": 0.9701975286006927, "epoch": 1.0358083201685098, "grad_norm": 0.2716124355792999, "learning_rate": 0.00019351973188570004, "loss": 0.20822694897651672, "mean_token_accuracy": 0.9222011566162109, "num_tokens": 24263884.0, "step": 1967 }, { "entropy": 0.9808885604143143, "epoch": 1.0363349131121642, "grad_norm": 0.26052355766296387, "learning_rate": 0.0001935115591984576, "loss": 0.1830577850341797, "mean_token_accuracy": 0.9277938008308411, "num_tokens": 24276220.0, "step": 1968 }, { "entropy": 1.0236380398273468, "epoch": 1.0368615060558188, "grad_norm": 0.2982364296913147, "learning_rate": 0.00019350338155362066, "loss": 0.19804757833480835, "mean_token_accuracy": 0.9196522831916809, "num_tokens": 24288556.0, "step": 1969 }, { "entropy": 1.0457386374473572, "epoch": 1.0373880989994735, "grad_norm": 0.30198392271995544, "learning_rate": 0.00019349519895167468, "loss": 0.20456969738006592, "mean_token_accuracy": 0.9179401248693466, "num_tokens": 24300892.0, "step": 1970 }, { "entropy": 1.0371754169464111, "epoch": 1.037914691943128, "grad_norm": 0.2852479815483093, "learning_rate": 0.00019348701139310537, "loss": 0.22744318842887878, "mean_token_accuracy": 0.9061823189258575, "num_tokens": 24313228.0, "step": 1971 }, { "entropy": 1.0361986309289932, "epoch": 1.0384412848867826, "grad_norm": 0.29646071791648865, "learning_rate": 0.00019347881887839878, "loss": 0.22257165610790253, "mean_token_accuracy": 0.9108520895242691, "num_tokens": 24325564.0, "step": 1972 }, { "entropy": 1.043959766626358, "epoch": 1.038967877830437, "grad_norm": 0.3205704092979431, "learning_rate": 0.00019347062140804126, "loss": 0.21183185279369354, "mean_token_accuracy": 0.9146294444799423, "num_tokens": 24337900.0, "step": 1973 }, { "entropy": 1.0562986433506012, "epoch": 1.0394944707740916, "grad_norm": 0.31516483426094055, "learning_rate": 0.00019346241898251945, "loss": 0.222466379404068, "mean_token_accuracy": 0.912394255399704, "num_tokens": 24350236.0, "step": 1974 }, { "entropy": 0.9892242848873138, "epoch": 1.0400210637177463, "grad_norm": 0.27365726232528687, "learning_rate": 0.0001934542116023203, "loss": 0.18739140033721924, "mean_token_accuracy": 0.924969956278801, "num_tokens": 24362572.0, "step": 1975 }, { "entropy": 1.006972685456276, "epoch": 1.0405476566614007, "grad_norm": 0.2618653178215027, "learning_rate": 0.00019344599926793098, "loss": 0.2140425145626068, "mean_token_accuracy": 0.9133986085653305, "num_tokens": 24374908.0, "step": 1976 }, { "entropy": 1.0172683149576187, "epoch": 1.0410742496050553, "grad_norm": 0.29427164793014526, "learning_rate": 0.00019343778197983912, "loss": 0.22519932687282562, "mean_token_accuracy": 0.9123007953166962, "num_tokens": 24387244.0, "step": 1977 }, { "entropy": 1.01324824988842, "epoch": 1.0416008425487098, "grad_norm": 0.2959752678871155, "learning_rate": 0.00019342955973853236, "loss": 0.2103637009859085, "mean_token_accuracy": 0.9110966324806213, "num_tokens": 24399580.0, "step": 1978 }, { "entropy": 0.9949903935194016, "epoch": 1.0421274354923644, "grad_norm": 0.26972147822380066, "learning_rate": 0.00019342133254449898, "loss": 0.19294336438179016, "mean_token_accuracy": 0.9218278974294662, "num_tokens": 24411916.0, "step": 1979 }, { "entropy": 1.003416359424591, "epoch": 1.042654028436019, "grad_norm": 0.29061558842658997, "learning_rate": 0.00019341310039822725, "loss": 0.1943337321281433, "mean_token_accuracy": 0.9220097661018372, "num_tokens": 24424252.0, "step": 1980 }, { "entropy": 1.0185414999723434, "epoch": 1.0431806213796735, "grad_norm": 0.2810025215148926, "learning_rate": 0.00019340486330020595, "loss": 0.1928320974111557, "mean_token_accuracy": 0.9200875461101532, "num_tokens": 24436588.0, "step": 1981 }, { "entropy": 1.0032877922058105, "epoch": 1.0437072143233281, "grad_norm": 0.27209043502807617, "learning_rate": 0.00019339662125092403, "loss": 0.19464010000228882, "mean_token_accuracy": 0.9196325391530991, "num_tokens": 24448924.0, "step": 1982 }, { "entropy": 1.0001914203166962, "epoch": 1.0442338072669826, "grad_norm": 0.3038516342639923, "learning_rate": 0.00019338837425087078, "loss": 0.21659797430038452, "mean_token_accuracy": 0.9114441424608231, "num_tokens": 24461260.0, "step": 1983 }, { "entropy": 0.9755618721246719, "epoch": 1.0447604002106372, "grad_norm": 0.27092164754867554, "learning_rate": 0.00019338012230053574, "loss": 0.19371184706687927, "mean_token_accuracy": 0.9238433092832565, "num_tokens": 24473596.0, "step": 1984 }, { "entropy": 0.9904940128326416, "epoch": 1.0452869931542916, "grad_norm": 0.29529231786727905, "learning_rate": 0.00019337186540040885, "loss": 0.20442527532577515, "mean_token_accuracy": 0.9141305983066559, "num_tokens": 24485932.0, "step": 1985 }, { "entropy": 0.9658221155405045, "epoch": 1.0458135860979463, "grad_norm": 0.27508610486984253, "learning_rate": 0.00019336360355098024, "loss": 0.21024343371391296, "mean_token_accuracy": 0.9153925180435181, "num_tokens": 24498268.0, "step": 1986 }, { "entropy": 0.9924428313970566, "epoch": 1.046340179041601, "grad_norm": 0.28747668862342834, "learning_rate": 0.00019335533675274037, "loss": 0.18813030421733856, "mean_token_accuracy": 0.9244283735752106, "num_tokens": 24510604.0, "step": 1987 }, { "entropy": 1.0350338965654373, "epoch": 1.0468667719852554, "grad_norm": 0.28181594610214233, "learning_rate": 0.00019334706500617998, "loss": 0.18969137966632843, "mean_token_accuracy": 0.9228011220693588, "num_tokens": 24522940.0, "step": 1988 }, { "entropy": 1.017800748348236, "epoch": 1.04739336492891, "grad_norm": 0.2933719754219055, "learning_rate": 0.00019333878831179012, "loss": 0.2083795666694641, "mean_token_accuracy": 0.9186853021383286, "num_tokens": 24535276.0, "step": 1989 }, { "entropy": 1.0671946704387665, "epoch": 1.0479199578725644, "grad_norm": 0.28361761569976807, "learning_rate": 0.00019333050667006213, "loss": 0.20133714377880096, "mean_token_accuracy": 0.9176107496023178, "num_tokens": 24547612.0, "step": 1990 }, { "entropy": 1.0133258700370789, "epoch": 1.048446550816219, "grad_norm": 0.2936132550239563, "learning_rate": 0.00019332222008148765, "loss": 0.23258453607559204, "mean_token_accuracy": 0.9048744589090347, "num_tokens": 24559948.0, "step": 1991 }, { "entropy": 1.1020651161670685, "epoch": 1.0489731437598737, "grad_norm": 0.29475727677345276, "learning_rate": 0.0001933139285465586, "loss": 0.23158571124076843, "mean_token_accuracy": 0.90408755838871, "num_tokens": 24572284.0, "step": 1992 }, { "entropy": 1.0560840368270874, "epoch": 1.0494997367035281, "grad_norm": 0.2781185805797577, "learning_rate": 0.00019330563206576725, "loss": 0.21855907142162323, "mean_token_accuracy": 0.9118623584508896, "num_tokens": 24584620.0, "step": 1993 }, { "entropy": 1.1237812638282776, "epoch": 1.0500263296471828, "grad_norm": 0.3516911268234253, "learning_rate": 0.000193297330639606, "loss": 0.21132902801036835, "mean_token_accuracy": 0.9161721616983414, "num_tokens": 24596956.0, "step": 1994 }, { "entropy": 1.0761407017707825, "epoch": 1.0505529225908372, "grad_norm": 0.2794252038002014, "learning_rate": 0.00019328902426856776, "loss": 0.20890802145004272, "mean_token_accuracy": 0.920161560177803, "num_tokens": 24609292.0, "step": 1995 }, { "entropy": 1.049127846956253, "epoch": 1.0510795155344919, "grad_norm": 0.2529737651348114, "learning_rate": 0.00019328071295314557, "loss": 0.1920773684978485, "mean_token_accuracy": 0.9240875691175461, "num_tokens": 24621628.0, "step": 1996 }, { "entropy": 1.1565322875976562, "epoch": 1.0516061084781465, "grad_norm": 0.28871044516563416, "learning_rate": 0.00019327239669383287, "loss": 0.21732774376869202, "mean_token_accuracy": 0.9144384115934372, "num_tokens": 24633964.0, "step": 1997 }, { "entropy": 1.0519833862781525, "epoch": 1.052132701421801, "grad_norm": 0.25382453203201294, "learning_rate": 0.00019326407549112332, "loss": 0.2088373750448227, "mean_token_accuracy": 0.9129265993833542, "num_tokens": 24646300.0, "step": 1998 }, { "entropy": 1.0678929388523102, "epoch": 1.0526592943654556, "grad_norm": 0.2656494081020355, "learning_rate": 0.0001932557493455109, "loss": 0.19079969823360443, "mean_token_accuracy": 0.9278986901044846, "num_tokens": 24658636.0, "step": 1999 }, { "entropy": 1.074799358844757, "epoch": 1.05318588730911, "grad_norm": 0.27760738134384155, "learning_rate": 0.00019324741825748988, "loss": 0.18772991001605988, "mean_token_accuracy": 0.9245434403419495, "num_tokens": 24670972.0, "step": 2000 }, { "entropy": 1.0773050487041473, "epoch": 1.0537124802527646, "grad_norm": 0.27600982785224915, "learning_rate": 0.0001932390822275549, "loss": 0.20754915475845337, "mean_token_accuracy": 0.9160582423210144, "num_tokens": 24683308.0, "step": 2001 }, { "entropy": 1.0425165295600891, "epoch": 1.054239073196419, "grad_norm": 0.2946891188621521, "learning_rate": 0.0001932307412562007, "loss": 0.1997680515050888, "mean_token_accuracy": 0.9208045303821564, "num_tokens": 24695644.0, "step": 2002 }, { "entropy": 1.0058126598596573, "epoch": 1.0547656661400737, "grad_norm": 0.29050102829933167, "learning_rate": 0.00019322239534392253, "loss": 0.20790837705135345, "mean_token_accuracy": 0.9103892594575882, "num_tokens": 24707980.0, "step": 2003 }, { "entropy": 0.9951896965503693, "epoch": 1.0552922590837284, "grad_norm": 0.3011538088321686, "learning_rate": 0.0001932140444912158, "loss": 0.20860427618026733, "mean_token_accuracy": 0.9159162491559982, "num_tokens": 24720316.0, "step": 2004 }, { "entropy": 1.0219779312610626, "epoch": 1.0558188520273828, "grad_norm": 0.2890591323375702, "learning_rate": 0.00019320568869857623, "loss": 0.22163572907447815, "mean_token_accuracy": 0.911671981215477, "num_tokens": 24732652.0, "step": 2005 }, { "entropy": 1.0054317712783813, "epoch": 1.0563454449710374, "grad_norm": 0.31731894612312317, "learning_rate": 0.00019319732796649992, "loss": 0.21079890429973602, "mean_token_accuracy": 0.9145800471305847, "num_tokens": 24744988.0, "step": 2006 }, { "entropy": 0.9920244216918945, "epoch": 1.0568720379146919, "grad_norm": 0.26154065132141113, "learning_rate": 0.00019318896229548313, "loss": 0.1758606880903244, "mean_token_accuracy": 0.9275805801153183, "num_tokens": 24757324.0, "step": 2007 }, { "entropy": 1.013138324022293, "epoch": 1.0573986308583465, "grad_norm": 0.2615264058113098, "learning_rate": 0.00019318059168602251, "loss": 0.18549133837223053, "mean_token_accuracy": 0.9265227019786835, "num_tokens": 24769660.0, "step": 2008 }, { "entropy": 1.0628323256969452, "epoch": 1.0579252238020012, "grad_norm": 0.3117140233516693, "learning_rate": 0.000193172216138615, "loss": 0.22904282808303833, "mean_token_accuracy": 0.9080474376678467, "num_tokens": 24781996.0, "step": 2009 }, { "entropy": 1.061298355460167, "epoch": 1.0584518167456556, "grad_norm": 0.2991147041320801, "learning_rate": 0.00019316383565375777, "loss": 0.19954919815063477, "mean_token_accuracy": 0.9186259061098099, "num_tokens": 24794332.0, "step": 2010 }, { "entropy": 1.0400668680667877, "epoch": 1.0589784096893102, "grad_norm": 0.29817700386047363, "learning_rate": 0.00019315545023194835, "loss": 0.21616995334625244, "mean_token_accuracy": 0.912378340959549, "num_tokens": 24806668.0, "step": 2011 }, { "entropy": 1.0405495166778564, "epoch": 1.0595050026329647, "grad_norm": 0.2854476571083069, "learning_rate": 0.0001931470598736845, "loss": 0.2017708569765091, "mean_token_accuracy": 0.91714146733284, "num_tokens": 24819004.0, "step": 2012 }, { "entropy": 1.0748549401760101, "epoch": 1.0600315955766193, "grad_norm": 0.30470097064971924, "learning_rate": 0.00019313866457946433, "loss": 0.20843440294265747, "mean_token_accuracy": 0.917302206158638, "num_tokens": 24831340.0, "step": 2013 }, { "entropy": 1.0435102880001068, "epoch": 1.0605581885202737, "grad_norm": 0.29722654819488525, "learning_rate": 0.0001931302643497862, "loss": 0.2125845104455948, "mean_token_accuracy": 0.9157662689685822, "num_tokens": 24843676.0, "step": 2014 }, { "entropy": 1.0407266318798065, "epoch": 1.0610847814639284, "grad_norm": 0.27866822481155396, "learning_rate": 0.0001931218591851488, "loss": 0.1866873800754547, "mean_token_accuracy": 0.9244244992733002, "num_tokens": 24856012.0, "step": 2015 }, { "entropy": 1.0343786031007767, "epoch": 1.061611374407583, "grad_norm": 0.29595327377319336, "learning_rate": 0.00019311344908605108, "loss": 0.21080759167671204, "mean_token_accuracy": 0.9200511127710342, "num_tokens": 24868348.0, "step": 2016 }, { "entropy": 1.0134167224168777, "epoch": 1.0621379673512374, "grad_norm": 0.2973070740699768, "learning_rate": 0.0001931050340529923, "loss": 0.21294423937797546, "mean_token_accuracy": 0.9145906716585159, "num_tokens": 24880684.0, "step": 2017 }, { "entropy": 1.129615068435669, "epoch": 1.062664560294892, "grad_norm": 0.29881370067596436, "learning_rate": 0.00019309661408647207, "loss": 0.20720480382442474, "mean_token_accuracy": 0.9196062386035919, "num_tokens": 24893020.0, "step": 2018 }, { "entropy": 1.0598470270633698, "epoch": 1.0631911532385465, "grad_norm": 0.26026830077171326, "learning_rate": 0.00019308818918699016, "loss": 0.17674966156482697, "mean_token_accuracy": 0.9275426715612411, "num_tokens": 24905356.0, "step": 2019 }, { "entropy": 1.045887529850006, "epoch": 1.0637177461822012, "grad_norm": 0.25472280383110046, "learning_rate": 0.00019307975935504672, "loss": 0.17633673548698425, "mean_token_accuracy": 0.9277019053697586, "num_tokens": 24917692.0, "step": 2020 }, { "entropy": 1.0263851881027222, "epoch": 1.0642443391258558, "grad_norm": 0.2858225107192993, "learning_rate": 0.00019307132459114222, "loss": 0.20337790250778198, "mean_token_accuracy": 0.9162404388189316, "num_tokens": 24930028.0, "step": 2021 }, { "entropy": 1.0703861713409424, "epoch": 1.0647709320695102, "grad_norm": 0.3153981566429138, "learning_rate": 0.00019306288489577734, "loss": 0.217787504196167, "mean_token_accuracy": 0.9114295095205307, "num_tokens": 24942364.0, "step": 2022 }, { "entropy": 1.0497725158929825, "epoch": 1.0652975250131649, "grad_norm": 0.29816338419914246, "learning_rate": 0.0001930544402694531, "loss": 0.21639864146709442, "mean_token_accuracy": 0.9137828648090363, "num_tokens": 24954700.0, "step": 2023 }, { "entropy": 1.0218316316604614, "epoch": 1.0658241179568193, "grad_norm": 0.32789114117622375, "learning_rate": 0.00019304599071267082, "loss": 0.22291415929794312, "mean_token_accuracy": 0.9094216227531433, "num_tokens": 24967036.0, "step": 2024 }, { "entropy": 1.0307366997003555, "epoch": 1.066350710900474, "grad_norm": 0.2897968888282776, "learning_rate": 0.0001930375362259321, "loss": 0.20538388192653656, "mean_token_accuracy": 0.9126376360654831, "num_tokens": 24979372.0, "step": 2025 }, { "entropy": 1.0069323182106018, "epoch": 1.0668773038441284, "grad_norm": 0.258139044046402, "learning_rate": 0.00019302907680973888, "loss": 0.19350063800811768, "mean_token_accuracy": 0.9235964566469193, "num_tokens": 24991708.0, "step": 2026 }, { "entropy": 0.9675715416669846, "epoch": 1.067403896787783, "grad_norm": 0.28487148880958557, "learning_rate": 0.00019302061246459325, "loss": 0.2119164764881134, "mean_token_accuracy": 0.9105935990810394, "num_tokens": 25004044.0, "step": 2027 }, { "entropy": 1.0363286584615707, "epoch": 1.0679304897314377, "grad_norm": 0.30349263548851013, "learning_rate": 0.00019301214319099774, "loss": 0.20691387355327606, "mean_token_accuracy": 0.9157197773456573, "num_tokens": 25016380.0, "step": 2028 }, { "entropy": 1.0630298554897308, "epoch": 1.068457082675092, "grad_norm": 0.30097535252571106, "learning_rate": 0.0001930036689894551, "loss": 0.20818623900413513, "mean_token_accuracy": 0.9164175242185593, "num_tokens": 25028716.0, "step": 2029 }, { "entropy": 0.996089369058609, "epoch": 1.0689836756187467, "grad_norm": 0.28663763403892517, "learning_rate": 0.0001929951898604685, "loss": 0.2216407209634781, "mean_token_accuracy": 0.9137296378612518, "num_tokens": 25041052.0, "step": 2030 }, { "entropy": 1.0333895981311798, "epoch": 1.0695102685624012, "grad_norm": 0.2872811555862427, "learning_rate": 0.00019298670580454114, "loss": 0.19668258726596832, "mean_token_accuracy": 0.9209001511335373, "num_tokens": 25053388.0, "step": 2031 }, { "entropy": 1.050906777381897, "epoch": 1.0700368615060558, "grad_norm": 0.29872143268585205, "learning_rate": 0.00019297821682217676, "loss": 0.21886757016181946, "mean_token_accuracy": 0.9144444167613983, "num_tokens": 25065724.0, "step": 2032 }, { "entropy": 0.9869663417339325, "epoch": 1.0705634544497105, "grad_norm": 0.26373037695884705, "learning_rate": 0.00019296972291387926, "loss": 0.21317996084690094, "mean_token_accuracy": 0.913250133395195, "num_tokens": 25078060.0, "step": 2033 }, { "entropy": 0.996940404176712, "epoch": 1.0710900473933649, "grad_norm": 0.27339690923690796, "learning_rate": 0.00019296122408015294, "loss": 0.21194380521774292, "mean_token_accuracy": 0.9130052775144577, "num_tokens": 25090396.0, "step": 2034 }, { "entropy": 1.0184991508722305, "epoch": 1.0716166403370195, "grad_norm": 0.2744937539100647, "learning_rate": 0.00019295272032150224, "loss": 0.19760127365589142, "mean_token_accuracy": 0.9164283275604248, "num_tokens": 25102732.0, "step": 2035 }, { "entropy": 1.0074135214090347, "epoch": 1.072143233280674, "grad_norm": 0.28469040989875793, "learning_rate": 0.00019294421163843203, "loss": 0.2201453596353531, "mean_token_accuracy": 0.9090453386306763, "num_tokens": 25115068.0, "step": 2036 }, { "entropy": 0.9988047778606415, "epoch": 1.0726698262243286, "grad_norm": 0.26611679792404175, "learning_rate": 0.00019293569803144743, "loss": 0.21755945682525635, "mean_token_accuracy": 0.9131471365690231, "num_tokens": 25127404.0, "step": 2037 }, { "entropy": 0.9802228659391403, "epoch": 1.0731964191679833, "grad_norm": 0.27171045541763306, "learning_rate": 0.00019292717950105382, "loss": 0.21177193522453308, "mean_token_accuracy": 0.9141269624233246, "num_tokens": 25139740.0, "step": 2038 }, { "entropy": 1.0224299430847168, "epoch": 1.0737230121116377, "grad_norm": 0.304115355014801, "learning_rate": 0.00019291865604775688, "loss": 0.21834969520568848, "mean_token_accuracy": 0.9116663038730621, "num_tokens": 25152076.0, "step": 2039 }, { "entropy": 1.0109304785728455, "epoch": 1.0742496050552923, "grad_norm": 0.2777882218360901, "learning_rate": 0.00019291012767206261, "loss": 0.19935154914855957, "mean_token_accuracy": 0.9226459413766861, "num_tokens": 25164412.0, "step": 2040 }, { "entropy": 1.0325984209775925, "epoch": 1.0747761979989467, "grad_norm": 0.3269108235836029, "learning_rate": 0.00019290159437447733, "loss": 0.23336344957351685, "mean_token_accuracy": 0.9101394861936569, "num_tokens": 25176748.0, "step": 2041 }, { "entropy": 1.0169707685709, "epoch": 1.0753027909426014, "grad_norm": 0.2711583077907562, "learning_rate": 0.00019289305615550754, "loss": 0.19230744242668152, "mean_token_accuracy": 0.9222860485315323, "num_tokens": 25189084.0, "step": 2042 }, { "entropy": 0.9706145972013474, "epoch": 1.0758293838862558, "grad_norm": 0.26547273993492126, "learning_rate": 0.0001928845130156602, "loss": 0.20648162066936493, "mean_token_accuracy": 0.9119333028793335, "num_tokens": 25201420.0, "step": 2043 }, { "entropy": 1.017429158091545, "epoch": 1.0763559768299105, "grad_norm": 0.2850116491317749, "learning_rate": 0.00019287596495544233, "loss": 0.2100791037082672, "mean_token_accuracy": 0.9145694822072983, "num_tokens": 25213756.0, "step": 2044 }, { "entropy": 0.9998975098133087, "epoch": 1.0768825697735651, "grad_norm": 0.2765794098377228, "learning_rate": 0.0001928674119753615, "loss": 0.2017804980278015, "mean_token_accuracy": 0.9189972132444382, "num_tokens": 25226092.0, "step": 2045 }, { "entropy": 1.041368529200554, "epoch": 1.0774091627172195, "grad_norm": 0.2918790280818939, "learning_rate": 0.00019285885407592542, "loss": 0.20694515109062195, "mean_token_accuracy": 0.9102893173694611, "num_tokens": 25238428.0, "step": 2046 }, { "entropy": 0.9665294885635376, "epoch": 1.0779357556608742, "grad_norm": 0.2802746891975403, "learning_rate": 0.0001928502912576421, "loss": 0.2127482146024704, "mean_token_accuracy": 0.9124037772417068, "num_tokens": 25250764.0, "step": 2047 }, { "entropy": 1.009907528758049, "epoch": 1.0784623486045286, "grad_norm": 0.3065343201160431, "learning_rate": 0.0001928417235210199, "loss": 0.23531584441661835, "mean_token_accuracy": 0.9090160578489304, "num_tokens": 25263100.0, "step": 2048 }, { "entropy": 1.0422001481056213, "epoch": 1.0789889415481833, "grad_norm": 0.295613169670105, "learning_rate": 0.00019283315086656737, "loss": 0.20345695316791534, "mean_token_accuracy": 0.9175281077623367, "num_tokens": 25275436.0, "step": 2049 }, { "entropy": 1.0016635805368423, "epoch": 1.079515534491838, "grad_norm": 0.27219337224960327, "learning_rate": 0.0001928245732947935, "loss": 0.19025292992591858, "mean_token_accuracy": 0.9241680800914764, "num_tokens": 25287772.0, "step": 2050 }, { "entropy": 0.9872867614030838, "epoch": 1.0800421274354923, "grad_norm": 0.2815146744251251, "learning_rate": 0.00019281599080620741, "loss": 0.2239912748336792, "mean_token_accuracy": 0.9086337685585022, "num_tokens": 25300108.0, "step": 2051 }, { "entropy": 1.0149886310100555, "epoch": 1.080568720379147, "grad_norm": 0.2981141209602356, "learning_rate": 0.0001928074034013187, "loss": 0.21916988492012024, "mean_token_accuracy": 0.9091440141201019, "num_tokens": 25312444.0, "step": 2052 }, { "entropy": 0.9956868588924408, "epoch": 1.0810953133228014, "grad_norm": 0.28481054306030273, "learning_rate": 0.00019279881108063705, "loss": 0.21595682203769684, "mean_token_accuracy": 0.912951722741127, "num_tokens": 25324780.0, "step": 2053 }, { "entropy": 1.0007793605327606, "epoch": 1.081621906266456, "grad_norm": 0.281215637922287, "learning_rate": 0.00019279021384467255, "loss": 0.21096494793891907, "mean_token_accuracy": 0.9124733507633209, "num_tokens": 25337116.0, "step": 2054 }, { "entropy": 1.0316517055034637, "epoch": 1.0821484992101107, "grad_norm": 0.4712248742580414, "learning_rate": 0.00019278161169393563, "loss": 0.21723365783691406, "mean_token_accuracy": 0.9101579338312149, "num_tokens": 25349452.0, "step": 2055 }, { "entropy": 1.036922350525856, "epoch": 1.0826750921537651, "grad_norm": 0.27001330256462097, "learning_rate": 0.0001927730046289369, "loss": 0.2058403491973877, "mean_token_accuracy": 0.9116992652416229, "num_tokens": 25361788.0, "step": 2056 }, { "entropy": 1.043273389339447, "epoch": 1.0832016850974198, "grad_norm": 0.29966092109680176, "learning_rate": 0.0001927643926501873, "loss": 0.2038857638835907, "mean_token_accuracy": 0.9206432849168777, "num_tokens": 25374124.0, "step": 2057 }, { "entropy": 1.1009390354156494, "epoch": 1.0837282780410742, "grad_norm": 0.295094758272171, "learning_rate": 0.0001927557757581981, "loss": 0.21461978554725647, "mean_token_accuracy": 0.9137238711118698, "num_tokens": 25386460.0, "step": 2058 }, { "entropy": 1.0440688282251358, "epoch": 1.0842548709847288, "grad_norm": 0.2719572186470032, "learning_rate": 0.00019274715395348085, "loss": 0.19468249380588531, "mean_token_accuracy": 0.9245257526636124, "num_tokens": 25398796.0, "step": 2059 }, { "entropy": 1.095595896244049, "epoch": 1.0847814639283833, "grad_norm": 0.30201783776283264, "learning_rate": 0.00019273852723654736, "loss": 0.2008979767560959, "mean_token_accuracy": 0.9223850518465042, "num_tokens": 25411132.0, "step": 2060 }, { "entropy": 1.072413593530655, "epoch": 1.085308056872038, "grad_norm": 0.3010813891887665, "learning_rate": 0.00019272989560790974, "loss": 0.1963309794664383, "mean_token_accuracy": 0.9216117411851883, "num_tokens": 25423468.0, "step": 2061 }, { "entropy": 1.0537616908550262, "epoch": 1.0858346498156926, "grad_norm": 0.4835893213748932, "learning_rate": 0.00019272125906808038, "loss": 0.2151128351688385, "mean_token_accuracy": 0.9163444191217422, "num_tokens": 25435804.0, "step": 2062 }, { "entropy": 1.0696274489164352, "epoch": 1.086361242759347, "grad_norm": 0.2978211045265198, "learning_rate": 0.00019271261761757202, "loss": 0.19762234389781952, "mean_token_accuracy": 0.9217347949743271, "num_tokens": 25448140.0, "step": 2063 }, { "entropy": 1.0669613778591156, "epoch": 1.0868878357030016, "grad_norm": 0.27142512798309326, "learning_rate": 0.00019270397125689765, "loss": 0.20439964532852173, "mean_token_accuracy": 0.9173642098903656, "num_tokens": 25460476.0, "step": 2064 }, { "entropy": 1.0918617248535156, "epoch": 1.087414428646656, "grad_norm": 0.2899603545665741, "learning_rate": 0.00019269531998657055, "loss": 0.2081996202468872, "mean_token_accuracy": 0.916422575712204, "num_tokens": 25472812.0, "step": 2065 }, { "entropy": 1.0441029965877533, "epoch": 1.0879410215903107, "grad_norm": 0.2680945098400116, "learning_rate": 0.00019268666380710425, "loss": 0.19378285109996796, "mean_token_accuracy": 0.9220094531774521, "num_tokens": 25485148.0, "step": 2066 }, { "entropy": 1.0455826669931412, "epoch": 1.0884676145339653, "grad_norm": 0.2643810212612152, "learning_rate": 0.0001926780027190127, "loss": 0.19173350930213928, "mean_token_accuracy": 0.9210256785154343, "num_tokens": 25497484.0, "step": 2067 }, { "entropy": 1.169319897890091, "epoch": 1.0889942074776198, "grad_norm": 0.3351131081581116, "learning_rate": 0.00019266933672280998, "loss": 0.20055952668190002, "mean_token_accuracy": 0.9239787012338638, "num_tokens": 25509820.0, "step": 2068 }, { "entropy": 0.9933416992425919, "epoch": 1.0895208004212744, "grad_norm": 0.2722816467285156, "learning_rate": 0.00019266066581901056, "loss": 0.18528851866722107, "mean_token_accuracy": 0.925559476017952, "num_tokens": 25522156.0, "step": 2069 }, { "entropy": 1.0143402963876724, "epoch": 1.0900473933649288, "grad_norm": 0.2853977680206299, "learning_rate": 0.00019265199000812922, "loss": 0.20564962923526764, "mean_token_accuracy": 0.918012797832489, "num_tokens": 25534492.0, "step": 2070 }, { "entropy": 1.0507995039224625, "epoch": 1.0905739863085835, "grad_norm": 0.2650372385978699, "learning_rate": 0.00019264330929068098, "loss": 0.19438353180885315, "mean_token_accuracy": 0.9210219085216522, "num_tokens": 25546828.0, "step": 2071 }, { "entropy": 1.0700190365314484, "epoch": 1.0911005792522381, "grad_norm": 0.2895369529724121, "learning_rate": 0.00019263462366718112, "loss": 0.20609940588474274, "mean_token_accuracy": 0.9171310365200043, "num_tokens": 25559164.0, "step": 2072 }, { "entropy": 1.0044712573289871, "epoch": 1.0916271721958926, "grad_norm": 0.2867662310600281, "learning_rate": 0.0001926259331381453, "loss": 0.1890471875667572, "mean_token_accuracy": 0.9236837476491928, "num_tokens": 25571500.0, "step": 2073 }, { "entropy": 1.0000011622905731, "epoch": 1.0921537651395472, "grad_norm": 0.2822493612766266, "learning_rate": 0.00019261723770408942, "loss": 0.20667140185832977, "mean_token_accuracy": 0.9199023395776749, "num_tokens": 25583836.0, "step": 2074 }, { "entropy": 0.966169461607933, "epoch": 1.0926803580832016, "grad_norm": 0.28859975934028625, "learning_rate": 0.00019260853736552963, "loss": 0.21461637318134308, "mean_token_accuracy": 0.909663125872612, "num_tokens": 25596172.0, "step": 2075 }, { "entropy": 1.0433668792247772, "epoch": 1.0932069510268563, "grad_norm": 0.2675197422504425, "learning_rate": 0.0001925998321229825, "loss": 0.20010057091712952, "mean_token_accuracy": 0.9186754375696182, "num_tokens": 25608508.0, "step": 2076 }, { "entropy": 1.08010932803154, "epoch": 1.0937335439705107, "grad_norm": 0.2648799419403076, "learning_rate": 0.00019259112197696473, "loss": 0.1912347376346588, "mean_token_accuracy": 0.923126220703125, "num_tokens": 25620844.0, "step": 2077 }, { "entropy": 1.0481482297182083, "epoch": 1.0942601369141653, "grad_norm": 0.26581716537475586, "learning_rate": 0.00019258240692799342, "loss": 0.2124476432800293, "mean_token_accuracy": 0.9156401306390762, "num_tokens": 25633180.0, "step": 2078 }, { "entropy": 0.991655707359314, "epoch": 1.09478672985782, "grad_norm": 0.24418914318084717, "learning_rate": 0.00019257368697658597, "loss": 0.1879653036594391, "mean_token_accuracy": 0.9245227575302124, "num_tokens": 25645516.0, "step": 2079 }, { "entropy": 1.029534325003624, "epoch": 1.0953133228014744, "grad_norm": 0.27712008357048035, "learning_rate": 0.00019256496212326, "loss": 0.19567881524562836, "mean_token_accuracy": 0.9220569729804993, "num_tokens": 25657852.0, "step": 2080 }, { "entropy": 1.0455122739076614, "epoch": 1.095839915745129, "grad_norm": 0.25748133659362793, "learning_rate": 0.0001925562323685334, "loss": 0.19087985157966614, "mean_token_accuracy": 0.9210804253816605, "num_tokens": 25670188.0, "step": 2081 }, { "entropy": 1.053975835442543, "epoch": 1.0963665086887835, "grad_norm": 0.2648088037967682, "learning_rate": 0.0001925474977129245, "loss": 0.20259462296962738, "mean_token_accuracy": 0.9170144945383072, "num_tokens": 25682524.0, "step": 2082 }, { "entropy": 1.1167932152748108, "epoch": 1.0968931016324381, "grad_norm": 0.3016040325164795, "learning_rate": 0.0001925387581569518, "loss": 0.2160032093524933, "mean_token_accuracy": 0.9073923379182816, "num_tokens": 25694860.0, "step": 2083 }, { "entropy": 1.0568408221006393, "epoch": 1.0974196945760926, "grad_norm": 0.29051339626312256, "learning_rate": 0.0001925300137011341, "loss": 0.1947801113128662, "mean_token_accuracy": 0.9265160709619522, "num_tokens": 25707196.0, "step": 2084 }, { "entropy": 1.0293535590171814, "epoch": 1.0979462875197472, "grad_norm": 0.28292426466941833, "learning_rate": 0.00019252126434599046, "loss": 0.20448973774909973, "mean_token_accuracy": 0.9163498878479004, "num_tokens": 25719532.0, "step": 2085 }, { "entropy": 0.9932720512151718, "epoch": 1.0984728804634019, "grad_norm": 0.268726110458374, "learning_rate": 0.00019251251009204037, "loss": 0.20217624306678772, "mean_token_accuracy": 0.9180169999599457, "num_tokens": 25731868.0, "step": 2086 }, { "entropy": 1.03742016851902, "epoch": 1.0989994734070563, "grad_norm": 0.2555520534515381, "learning_rate": 0.00019250375093980346, "loss": 0.19689497351646423, "mean_token_accuracy": 0.922407329082489, "num_tokens": 25744204.0, "step": 2087 }, { "entropy": 1.0640356242656708, "epoch": 1.099526066350711, "grad_norm": 0.28077611327171326, "learning_rate": 0.00019249498688979973, "loss": 0.2088557481765747, "mean_token_accuracy": 0.9098563194274902, "num_tokens": 25756540.0, "step": 2088 }, { "entropy": 1.059511423110962, "epoch": 1.1000526592943654, "grad_norm": 0.27445870637893677, "learning_rate": 0.00019248621794254944, "loss": 0.20993183553218842, "mean_token_accuracy": 0.916303813457489, "num_tokens": 25768876.0, "step": 2089 }, { "entropy": 1.0723062455654144, "epoch": 1.10057925223802, "grad_norm": 0.2826826274394989, "learning_rate": 0.00019247744409857316, "loss": 0.20269325375556946, "mean_token_accuracy": 0.9222795218229294, "num_tokens": 25781212.0, "step": 2090 }, { "entropy": 1.0870884507894516, "epoch": 1.1011058451816746, "grad_norm": 0.27127087116241455, "learning_rate": 0.00019246866535839173, "loss": 0.20817485451698303, "mean_token_accuracy": 0.916502445936203, "num_tokens": 25793548.0, "step": 2091 }, { "entropy": 1.037529081106186, "epoch": 1.101632438125329, "grad_norm": 0.28745195269584656, "learning_rate": 0.0001924598817225263, "loss": 0.22985900938510895, "mean_token_accuracy": 0.9097397327423096, "num_tokens": 25805884.0, "step": 2092 }, { "entropy": 1.0101779103279114, "epoch": 1.1021590310689837, "grad_norm": 0.26528680324554443, "learning_rate": 0.00019245109319149833, "loss": 0.19186118245124817, "mean_token_accuracy": 0.923490360379219, "num_tokens": 25818220.0, "step": 2093 }, { "entropy": 1.0416104793548584, "epoch": 1.1026856240126381, "grad_norm": 0.2599078118801117, "learning_rate": 0.0001924422997658295, "loss": 0.2087230086326599, "mean_token_accuracy": 0.9174604564905167, "num_tokens": 25830556.0, "step": 2094 }, { "entropy": 1.071406990289688, "epoch": 1.1032122169562928, "grad_norm": 0.27701428532600403, "learning_rate": 0.00019243350144604185, "loss": 0.21016359329223633, "mean_token_accuracy": 0.9129587262868881, "num_tokens": 25842892.0, "step": 2095 }, { "entropy": 1.0269631147384644, "epoch": 1.1037388098999474, "grad_norm": 0.28013738989830017, "learning_rate": 0.00019242469823265769, "loss": 0.20927533507347107, "mean_token_accuracy": 0.9170541018247604, "num_tokens": 25855228.0, "step": 2096 }, { "entropy": 1.076466590166092, "epoch": 1.1042654028436019, "grad_norm": 0.2795049548149109, "learning_rate": 0.00019241589012619953, "loss": 0.20179404318332672, "mean_token_accuracy": 0.9215785712003708, "num_tokens": 25867564.0, "step": 2097 }, { "entropy": 1.097602665424347, "epoch": 1.1047919957872565, "grad_norm": 0.2958826720714569, "learning_rate": 0.00019240707712719042, "loss": 0.22175639867782593, "mean_token_accuracy": 0.9060819000005722, "num_tokens": 25879900.0, "step": 2098 }, { "entropy": 1.074698805809021, "epoch": 1.105318588730911, "grad_norm": 0.26773980259895325, "learning_rate": 0.0001923982592361534, "loss": 0.18457193672657013, "mean_token_accuracy": 0.923177182674408, "num_tokens": 25892236.0, "step": 2099 }, { "entropy": 1.1188512742519379, "epoch": 1.1058451816745656, "grad_norm": 0.2522232234477997, "learning_rate": 0.000192389436453612, "loss": 0.19157402217388153, "mean_token_accuracy": 0.921467125415802, "num_tokens": 25904572.0, "step": 2100 }, { "entropy": 1.101550132036209, "epoch": 1.10637177461822, "grad_norm": 0.268435537815094, "learning_rate": 0.00019238060878008995, "loss": 0.1853233426809311, "mean_token_accuracy": 0.9239556342363358, "num_tokens": 25916908.0, "step": 2101 }, { "entropy": 1.1288717091083527, "epoch": 1.1068983675618747, "grad_norm": 0.30907148122787476, "learning_rate": 0.00019237177621611134, "loss": 0.21557700634002686, "mean_token_accuracy": 0.912951648235321, "num_tokens": 25929244.0, "step": 2102 }, { "entropy": 1.0122136920690536, "epoch": 1.1074249605055293, "grad_norm": 0.2754114866256714, "learning_rate": 0.00019236293876220042, "loss": 0.22462958097457886, "mean_token_accuracy": 0.9148844480514526, "num_tokens": 25941580.0, "step": 2103 }, { "entropy": 1.0024352222681046, "epoch": 1.1079515534491837, "grad_norm": 0.28880998492240906, "learning_rate": 0.0001923540964188819, "loss": 0.19037997722625732, "mean_token_accuracy": 0.9214117079973221, "num_tokens": 25953916.0, "step": 2104 }, { "entropy": 1.090283751487732, "epoch": 1.1084781463928384, "grad_norm": 0.3156434893608093, "learning_rate": 0.0001923452491866807, "loss": 0.22172510623931885, "mean_token_accuracy": 0.9104326665401459, "num_tokens": 25966252.0, "step": 2105 }, { "entropy": 1.0386274009943008, "epoch": 1.1090047393364928, "grad_norm": 0.28844019770622253, "learning_rate": 0.00019233639706612196, "loss": 0.19381242990493774, "mean_token_accuracy": 0.920799121260643, "num_tokens": 25978588.0, "step": 2106 }, { "entropy": 1.0614490807056427, "epoch": 1.1095313322801474, "grad_norm": 0.2973669767379761, "learning_rate": 0.00019232754005773123, "loss": 0.206210196018219, "mean_token_accuracy": 0.9167844653129578, "num_tokens": 25990924.0, "step": 2107 }, { "entropy": 1.0339891910552979, "epoch": 1.110057925223802, "grad_norm": 0.29104986786842346, "learning_rate": 0.00019231867816203428, "loss": 0.20842497050762177, "mean_token_accuracy": 0.9144662916660309, "num_tokens": 26003260.0, "step": 2108 }, { "entropy": 1.0249072164297104, "epoch": 1.1105845181674565, "grad_norm": 0.28756386041641235, "learning_rate": 0.0001923098113795572, "loss": 0.2018943727016449, "mean_token_accuracy": 0.9205996543169022, "num_tokens": 26015596.0, "step": 2109 }, { "entropy": 1.017577350139618, "epoch": 1.1111111111111112, "grad_norm": 0.30264243483543396, "learning_rate": 0.0001923009397108264, "loss": 0.20579789578914642, "mean_token_accuracy": 0.9167483001947403, "num_tokens": 26027932.0, "step": 2110 }, { "entropy": 1.0238764435052872, "epoch": 1.1116377040547656, "grad_norm": 0.27734920382499695, "learning_rate": 0.00019229206315636845, "loss": 0.19919277727603912, "mean_token_accuracy": 0.9176904708147049, "num_tokens": 26040268.0, "step": 2111 }, { "entropy": 1.002189740538597, "epoch": 1.1121642969984202, "grad_norm": 0.2930961847305298, "learning_rate": 0.00019228318171671035, "loss": 0.19597947597503662, "mean_token_accuracy": 0.9197946488857269, "num_tokens": 26052604.0, "step": 2112 }, { "entropy": 0.9857950955629349, "epoch": 1.1126908899420749, "grad_norm": 0.28313517570495605, "learning_rate": 0.00019227429539237935, "loss": 0.2069045752286911, "mean_token_accuracy": 0.9212967753410339, "num_tokens": 26064940.0, "step": 2113 }, { "entropy": 1.0099002569913864, "epoch": 1.1132174828857293, "grad_norm": 0.2959808111190796, "learning_rate": 0.00019226540418390293, "loss": 0.21741098165512085, "mean_token_accuracy": 0.9100223034620285, "num_tokens": 26077276.0, "step": 2114 }, { "entropy": 0.9958448708057404, "epoch": 1.113744075829384, "grad_norm": 0.2769598364830017, "learning_rate": 0.00019225650809180897, "loss": 0.20837773382663727, "mean_token_accuracy": 0.918271854519844, "num_tokens": 26089612.0, "step": 2115 }, { "entropy": 1.014888659119606, "epoch": 1.1142706687730384, "grad_norm": 0.29256078600883484, "learning_rate": 0.00019224760711662555, "loss": 0.20603659749031067, "mean_token_accuracy": 0.9164493978023529, "num_tokens": 26101948.0, "step": 2116 }, { "entropy": 1.005908653140068, "epoch": 1.114797261716693, "grad_norm": 0.2789181172847748, "learning_rate": 0.00019223870125888108, "loss": 0.19784985482692719, "mean_token_accuracy": 0.9218984693288803, "num_tokens": 26114284.0, "step": 2117 }, { "entropy": 1.0451974421739578, "epoch": 1.1153238546603474, "grad_norm": 0.27004557847976685, "learning_rate": 0.0001922297905191042, "loss": 0.19614283740520477, "mean_token_accuracy": 0.9270102232694626, "num_tokens": 26126620.0, "step": 2118 }, { "entropy": 1.091399073600769, "epoch": 1.115850447604002, "grad_norm": 0.28412166237831116, "learning_rate": 0.000192220874897824, "loss": 0.18808285892009735, "mean_token_accuracy": 0.9227005243301392, "num_tokens": 26138956.0, "step": 2119 }, { "entropy": 1.0639157593250275, "epoch": 1.1163770405476567, "grad_norm": 0.29297924041748047, "learning_rate": 0.0001922119543955696, "loss": 0.20654083788394928, "mean_token_accuracy": 0.9152026325464249, "num_tokens": 26151292.0, "step": 2120 }, { "entropy": 1.0102118253707886, "epoch": 1.1169036334913112, "grad_norm": 0.27283284068107605, "learning_rate": 0.0001922030290128707, "loss": 0.19149716198444366, "mean_token_accuracy": 0.9258815199136734, "num_tokens": 26163628.0, "step": 2121 }, { "entropy": 1.0362121015787125, "epoch": 1.1174302264349658, "grad_norm": 0.28490447998046875, "learning_rate": 0.00019219409875025705, "loss": 0.1954336166381836, "mean_token_accuracy": 0.9174920916557312, "num_tokens": 26175964.0, "step": 2122 }, { "entropy": 1.0734621286392212, "epoch": 1.1179568193786202, "grad_norm": 0.289915531873703, "learning_rate": 0.0001921851636082588, "loss": 0.20870134234428406, "mean_token_accuracy": 0.9131461679935455, "num_tokens": 26188300.0, "step": 2123 }, { "entropy": 1.1021492779254913, "epoch": 1.1184834123222749, "grad_norm": 0.30639079213142395, "learning_rate": 0.0001921762235874064, "loss": 0.21529828011989594, "mean_token_accuracy": 0.9132403880357742, "num_tokens": 26200636.0, "step": 2124 }, { "entropy": 1.041254460811615, "epoch": 1.1190100052659295, "grad_norm": 0.24776063859462738, "learning_rate": 0.00019216727868823062, "loss": 0.19100171327590942, "mean_token_accuracy": 0.9220355451107025, "num_tokens": 26212972.0, "step": 2125 }, { "entropy": 1.0897882282733917, "epoch": 1.119536598209584, "grad_norm": 0.28905171155929565, "learning_rate": 0.00019215832891126237, "loss": 0.19190385937690735, "mean_token_accuracy": 0.9242671728134155, "num_tokens": 26225308.0, "step": 2126 }, { "entropy": 1.1073324233293533, "epoch": 1.1200631911532386, "grad_norm": 0.2728095054626465, "learning_rate": 0.000192149374257033, "loss": 0.2034318745136261, "mean_token_accuracy": 0.9145397841930389, "num_tokens": 26237644.0, "step": 2127 }, { "entropy": 1.1713103353977203, "epoch": 1.120589784096893, "grad_norm": 0.31770387291908264, "learning_rate": 0.00019214041472607408, "loss": 0.22776833176612854, "mean_token_accuracy": 0.9096698760986328, "num_tokens": 26249980.0, "step": 2128 }, { "entropy": 1.169573962688446, "epoch": 1.1211163770405477, "grad_norm": 0.3100426495075226, "learning_rate": 0.00019213145031891747, "loss": 0.19859901070594788, "mean_token_accuracy": 0.9183387011289597, "num_tokens": 26262316.0, "step": 2129 }, { "entropy": 1.0875117480754852, "epoch": 1.1216429699842023, "grad_norm": 0.27162665128707886, "learning_rate": 0.00019212248103609537, "loss": 0.20907218754291534, "mean_token_accuracy": 0.9196607321500778, "num_tokens": 26274652.0, "step": 2130 }, { "entropy": 1.084071934223175, "epoch": 1.1221695629278567, "grad_norm": 0.2759605944156647, "learning_rate": 0.00019211350687814023, "loss": 0.18926078081130981, "mean_token_accuracy": 0.9211393296718597, "num_tokens": 26286988.0, "step": 2131 }, { "entropy": 1.1398064196109772, "epoch": 1.1226961558715114, "grad_norm": 0.28818970918655396, "learning_rate": 0.00019210452784558478, "loss": 0.20041367411613464, "mean_token_accuracy": 0.9223820567131042, "num_tokens": 26299324.0, "step": 2132 }, { "entropy": 1.0466588735580444, "epoch": 1.1232227488151658, "grad_norm": 0.29245075583457947, "learning_rate": 0.000192095543938962, "loss": 0.20363174378871918, "mean_token_accuracy": 0.9165193289518356, "num_tokens": 26311660.0, "step": 2133 }, { "entropy": 1.0405475795269012, "epoch": 1.1237493417588205, "grad_norm": 0.2925106883049011, "learning_rate": 0.00019208655515880532, "loss": 0.1999765932559967, "mean_token_accuracy": 0.9169381856918335, "num_tokens": 26323996.0, "step": 2134 }, { "entropy": 1.04118974506855, "epoch": 1.1242759347024749, "grad_norm": 0.26943859457969666, "learning_rate": 0.0001920775615056483, "loss": 0.19177857041358948, "mean_token_accuracy": 0.9220841228961945, "num_tokens": 26336332.0, "step": 2135 }, { "entropy": 1.0740750879049301, "epoch": 1.1248025276461295, "grad_norm": 0.2784332036972046, "learning_rate": 0.0001920685629800248, "loss": 0.18828029930591583, "mean_token_accuracy": 0.9239522963762283, "num_tokens": 26348668.0, "step": 2136 }, { "entropy": 1.032617449760437, "epoch": 1.1253291205897842, "grad_norm": 0.28828391432762146, "learning_rate": 0.00019205955958246905, "loss": 0.20189997553825378, "mean_token_accuracy": 0.9197202920913696, "num_tokens": 26361004.0, "step": 2137 }, { "entropy": 1.1041496396064758, "epoch": 1.1258557135334386, "grad_norm": 0.3010398745536804, "learning_rate": 0.00019205055131351557, "loss": 0.20388422906398773, "mean_token_accuracy": 0.9182727336883545, "num_tokens": 26373340.0, "step": 2138 }, { "entropy": 1.0780200958251953, "epoch": 1.1263823064770933, "grad_norm": 0.30870407819747925, "learning_rate": 0.00019204153817369905, "loss": 0.21839921176433563, "mean_token_accuracy": 0.9158252775669098, "num_tokens": 26385676.0, "step": 2139 }, { "entropy": 1.090522974729538, "epoch": 1.1269088994207477, "grad_norm": 0.3072364330291748, "learning_rate": 0.00019203252016355458, "loss": 0.1994020640850067, "mean_token_accuracy": 0.9187403917312622, "num_tokens": 26398012.0, "step": 2140 }, { "entropy": 1.1098020374774933, "epoch": 1.1274354923644023, "grad_norm": 0.2888351082801819, "learning_rate": 0.00019202349728361754, "loss": 0.2039174735546112, "mean_token_accuracy": 0.9148209691047668, "num_tokens": 26410348.0, "step": 2141 }, { "entropy": 1.1232051849365234, "epoch": 1.1279620853080567, "grad_norm": 0.2976013123989105, "learning_rate": 0.0001920144695344235, "loss": 0.2292768359184265, "mean_token_accuracy": 0.9084900766611099, "num_tokens": 26422684.0, "step": 2142 }, { "entropy": 1.1429337561130524, "epoch": 1.1284886782517114, "grad_norm": 0.2777968645095825, "learning_rate": 0.00019200543691650845, "loss": 0.19244031608104706, "mean_token_accuracy": 0.9237828403711319, "num_tokens": 26435020.0, "step": 2143 }, { "entropy": 1.096487671136856, "epoch": 1.129015271195366, "grad_norm": 0.25569429993629456, "learning_rate": 0.00019199639943040856, "loss": 0.1880742460489273, "mean_token_accuracy": 0.924060508608818, "num_tokens": 26447356.0, "step": 2144 }, { "entropy": 1.1004936397075653, "epoch": 1.1295418641390205, "grad_norm": 0.25819581747055054, "learning_rate": 0.00019198735707666036, "loss": 0.18885719776153564, "mean_token_accuracy": 0.9271882772445679, "num_tokens": 26459692.0, "step": 2145 }, { "entropy": 1.1160069704055786, "epoch": 1.1300684570826751, "grad_norm": 0.28844067454338074, "learning_rate": 0.00019197830985580064, "loss": 0.2207649052143097, "mean_token_accuracy": 0.9111542254686356, "num_tokens": 26472028.0, "step": 2146 }, { "entropy": 1.1166575253009796, "epoch": 1.1305950500263298, "grad_norm": 0.26548051834106445, "learning_rate": 0.00019196925776836644, "loss": 0.20018815994262695, "mean_token_accuracy": 0.9172813147306442, "num_tokens": 26484364.0, "step": 2147 }, { "entropy": 1.1224709153175354, "epoch": 1.1311216429699842, "grad_norm": 0.26083195209503174, "learning_rate": 0.00019196020081489517, "loss": 0.19701796770095825, "mean_token_accuracy": 0.9212660789489746, "num_tokens": 26496700.0, "step": 2148 }, { "entropy": 1.1387836039066315, "epoch": 1.1316482359136388, "grad_norm": 0.2727262079715729, "learning_rate": 0.00019195113899592446, "loss": 0.18492068350315094, "mean_token_accuracy": 0.9268793612718582, "num_tokens": 26509036.0, "step": 2149 }, { "entropy": 1.1890142858028412, "epoch": 1.1321748288572933, "grad_norm": 0.28917086124420166, "learning_rate": 0.0001919420723119923, "loss": 0.21750162541866302, "mean_token_accuracy": 0.9132700264453888, "num_tokens": 26521372.0, "step": 2150 }, { "entropy": 1.1991948783397675, "epoch": 1.132701421800948, "grad_norm": 0.3479141294956207, "learning_rate": 0.00019193300076363688, "loss": 0.21669164299964905, "mean_token_accuracy": 0.9105279594659805, "num_tokens": 26533708.0, "step": 2151 }, { "entropy": 1.166500449180603, "epoch": 1.1332280147446023, "grad_norm": 0.27059152722358704, "learning_rate": 0.00019192392435139676, "loss": 0.1777915358543396, "mean_token_accuracy": 0.9269713759422302, "num_tokens": 26546044.0, "step": 2152 }, { "entropy": 1.1897345781326294, "epoch": 1.133754607688257, "grad_norm": 0.27053096890449524, "learning_rate": 0.00019191484307581075, "loss": 0.1803973764181137, "mean_token_accuracy": 0.9253678023815155, "num_tokens": 26558380.0, "step": 2153 }, { "entropy": 1.1454325318336487, "epoch": 1.1342812006319116, "grad_norm": 0.3126206696033478, "learning_rate": 0.00019190575693741794, "loss": 0.20110175013542175, "mean_token_accuracy": 0.9191780984401703, "num_tokens": 26570716.0, "step": 2154 }, { "entropy": 1.1290227174758911, "epoch": 1.134807793575566, "grad_norm": 0.2912094295024872, "learning_rate": 0.0001918966659367577, "loss": 0.19985133409500122, "mean_token_accuracy": 0.9185344576835632, "num_tokens": 26583052.0, "step": 2155 }, { "entropy": 1.1607117354869843, "epoch": 1.1353343865192207, "grad_norm": 0.3160911202430725, "learning_rate": 0.00019188757007436978, "loss": 0.21099629998207092, "mean_token_accuracy": 0.914495974779129, "num_tokens": 26595388.0, "step": 2156 }, { "entropy": 1.1428423523902893, "epoch": 1.1358609794628751, "grad_norm": 0.30592912435531616, "learning_rate": 0.00019187846935079405, "loss": 0.20286978781223297, "mean_token_accuracy": 0.919879361987114, "num_tokens": 26607724.0, "step": 2157 }, { "entropy": 1.1966476142406464, "epoch": 1.1363875724065298, "grad_norm": 0.305442750453949, "learning_rate": 0.00019186936376657085, "loss": 0.19738367199897766, "mean_token_accuracy": 0.9184410721063614, "num_tokens": 26620060.0, "step": 2158 }, { "entropy": 1.1541268825531006, "epoch": 1.1369141653501842, "grad_norm": 0.32751592993736267, "learning_rate": 0.00019186025332224068, "loss": 0.22538770735263824, "mean_token_accuracy": 0.9071175456047058, "num_tokens": 26632396.0, "step": 2159 }, { "entropy": 1.1819856464862823, "epoch": 1.1374407582938388, "grad_norm": 0.3354586958885193, "learning_rate": 0.00019185113801834438, "loss": 0.2322450429201126, "mean_token_accuracy": 0.9149561524391174, "num_tokens": 26644732.0, "step": 2160 }, { "entropy": 1.2278803288936615, "epoch": 1.1379673512374935, "grad_norm": 0.39081871509552, "learning_rate": 0.0001918420178554231, "loss": 0.2215672731399536, "mean_token_accuracy": 0.9058908820152283, "num_tokens": 26657068.0, "step": 2161 }, { "entropy": 1.1993200778961182, "epoch": 1.138493944181148, "grad_norm": 0.30215588212013245, "learning_rate": 0.00019183289283401821, "loss": 0.21090206503868103, "mean_token_accuracy": 0.9153352379798889, "num_tokens": 26669404.0, "step": 2162 }, { "entropy": 1.2832166850566864, "epoch": 1.1390205371248026, "grad_norm": 0.28006455302238464, "learning_rate": 0.00019182376295467143, "loss": 0.19265320897102356, "mean_token_accuracy": 0.9220689386129379, "num_tokens": 26681740.0, "step": 2163 }, { "entropy": 1.2227767407894135, "epoch": 1.1395471300684572, "grad_norm": 0.2612974941730499, "learning_rate": 0.0001918146282179248, "loss": 0.19369927048683167, "mean_token_accuracy": 0.9246975183486938, "num_tokens": 26694076.0, "step": 2164 }, { "entropy": 1.2275767028331757, "epoch": 1.1400737230121116, "grad_norm": 0.2888461649417877, "learning_rate": 0.00019180548862432047, "loss": 0.22057251632213593, "mean_token_accuracy": 0.9090530127286911, "num_tokens": 26706412.0, "step": 2165 }, { "entropy": 1.3238163888454437, "epoch": 1.1406003159557663, "grad_norm": 0.2778269350528717, "learning_rate": 0.0001917963441744011, "loss": 0.21366479992866516, "mean_token_accuracy": 0.9129827171564102, "num_tokens": 26718748.0, "step": 2166 }, { "entropy": 1.2234577536582947, "epoch": 1.1411269088994207, "grad_norm": 0.2672150135040283, "learning_rate": 0.0001917871948687096, "loss": 0.20926086604595184, "mean_token_accuracy": 0.9146319776773453, "num_tokens": 26731084.0, "step": 2167 }, { "entropy": 1.285551905632019, "epoch": 1.1416535018430753, "grad_norm": 0.2621254026889801, "learning_rate": 0.00019177804070778893, "loss": 0.19555458426475525, "mean_token_accuracy": 0.9218839704990387, "num_tokens": 26743420.0, "step": 2168 }, { "entropy": 1.2906259596347809, "epoch": 1.1421800947867298, "grad_norm": 0.2878972291946411, "learning_rate": 0.00019176888169218265, "loss": 0.20401382446289062, "mean_token_accuracy": 0.9181995242834091, "num_tokens": 26755756.0, "step": 2169 }, { "entropy": 1.2635590136051178, "epoch": 1.1427066877303844, "grad_norm": 0.27613574266433716, "learning_rate": 0.0001917597178224345, "loss": 0.1996793895959854, "mean_token_accuracy": 0.9244147539138794, "num_tokens": 26768092.0, "step": 2170 }, { "entropy": 1.2653245031833649, "epoch": 1.143233280674039, "grad_norm": 0.26447412371635437, "learning_rate": 0.00019175054909908838, "loss": 0.19309335947036743, "mean_token_accuracy": 0.9219875186681747, "num_tokens": 26780428.0, "step": 2171 }, { "entropy": 1.2837787866592407, "epoch": 1.1437598736176935, "grad_norm": 0.27839452028274536, "learning_rate": 0.00019174137552268865, "loss": 0.19706347584724426, "mean_token_accuracy": 0.9179331064224243, "num_tokens": 26792764.0, "step": 2172 }, { "entropy": 1.284653127193451, "epoch": 1.1442864665613481, "grad_norm": 0.31177014112472534, "learning_rate": 0.0001917321970937799, "loss": 0.20646242797374725, "mean_token_accuracy": 0.9135401993989944, "num_tokens": 26805100.0, "step": 2173 }, { "entropy": 1.2473564743995667, "epoch": 1.1448130595050026, "grad_norm": 0.29228970408439636, "learning_rate": 0.00019172301381290696, "loss": 0.19468794763088226, "mean_token_accuracy": 0.9253511428833008, "num_tokens": 26817436.0, "step": 2174 }, { "entropy": 1.2133914828300476, "epoch": 1.1453396524486572, "grad_norm": 0.27723586559295654, "learning_rate": 0.000191713825680615, "loss": 0.19811224937438965, "mean_token_accuracy": 0.9239038378000259, "num_tokens": 26829772.0, "step": 2175 }, { "entropy": 1.2187740504741669, "epoch": 1.1458662453923116, "grad_norm": 0.32399874925613403, "learning_rate": 0.0001917046326974495, "loss": 0.21336714923381805, "mean_token_accuracy": 0.9163462072610855, "num_tokens": 26842108.0, "step": 2176 }, { "entropy": 1.1896620392799377, "epoch": 1.1463928383359663, "grad_norm": 0.2760239541530609, "learning_rate": 0.00019169543486395612, "loss": 0.19351127743721008, "mean_token_accuracy": 0.920502170920372, "num_tokens": 26854444.0, "step": 2177 }, { "entropy": 1.3020657300949097, "epoch": 1.146919431279621, "grad_norm": 0.33600714802742004, "learning_rate": 0.00019168623218068098, "loss": 0.19245027005672455, "mean_token_accuracy": 0.9246270656585693, "num_tokens": 26866780.0, "step": 2178 }, { "entropy": 1.2935131192207336, "epoch": 1.1474460242232754, "grad_norm": 0.28109049797058105, "learning_rate": 0.00019167702464817032, "loss": 0.18623016774654388, "mean_token_accuracy": 0.9251067191362381, "num_tokens": 26879116.0, "step": 2179 }, { "entropy": 1.2790460288524628, "epoch": 1.14797261716693, "grad_norm": 0.3010100722312927, "learning_rate": 0.00019166781226697077, "loss": 0.20548678934574127, "mean_token_accuracy": 0.9172774851322174, "num_tokens": 26891452.0, "step": 2180 }, { "entropy": 1.3008805811405182, "epoch": 1.1484992101105844, "grad_norm": 0.32880863547325134, "learning_rate": 0.00019165859503762918, "loss": 0.19846193492412567, "mean_token_accuracy": 0.9145328849554062, "num_tokens": 26903788.0, "step": 2181 }, { "entropy": 1.2794018983840942, "epoch": 1.149025803054239, "grad_norm": 0.3064977526664734, "learning_rate": 0.00019164937296069275, "loss": 0.20974700152873993, "mean_token_accuracy": 0.9109003394842148, "num_tokens": 26916124.0, "step": 2182 }, { "entropy": 1.2440880835056305, "epoch": 1.1495523959978937, "grad_norm": 0.27806052565574646, "learning_rate": 0.00019164014603670896, "loss": 0.19501592218875885, "mean_token_accuracy": 0.9204808473587036, "num_tokens": 26928460.0, "step": 2183 }, { "entropy": 1.3518921732902527, "epoch": 1.1500789889415481, "grad_norm": 0.321502149105072, "learning_rate": 0.0001916309142662255, "loss": 0.22053658962249756, "mean_token_accuracy": 0.9092803299427032, "num_tokens": 26940796.0, "step": 2184 }, { "entropy": 1.2679640352725983, "epoch": 1.1506055818852028, "grad_norm": 0.2918587625026703, "learning_rate": 0.00019162167764979048, "loss": 0.21362480521202087, "mean_token_accuracy": 0.9154315143823624, "num_tokens": 26953132.0, "step": 2185 }, { "entropy": 1.3025008738040924, "epoch": 1.1511321748288572, "grad_norm": 0.38866928219795227, "learning_rate": 0.00019161243618795213, "loss": 0.27079999446868896, "mean_token_accuracy": 0.896030992269516, "num_tokens": 26965468.0, "step": 2186 }, { "entropy": 1.2515160739421844, "epoch": 1.1516587677725119, "grad_norm": 0.2795846462249756, "learning_rate": 0.00019160318988125917, "loss": 0.20014791190624237, "mean_token_accuracy": 0.9226631373167038, "num_tokens": 26977804.0, "step": 2187 }, { "entropy": 1.2235470414161682, "epoch": 1.1521853607161665, "grad_norm": 0.27590784430503845, "learning_rate": 0.0001915939387302604, "loss": 0.1861528754234314, "mean_token_accuracy": 0.9201293885707855, "num_tokens": 26990140.0, "step": 2188 }, { "entropy": 1.222849279642105, "epoch": 1.152711953659821, "grad_norm": 0.2712383568286896, "learning_rate": 0.00019158468273550508, "loss": 0.19584113359451294, "mean_token_accuracy": 0.9204514920711517, "num_tokens": 27002476.0, "step": 2189 }, { "entropy": 1.2125034630298615, "epoch": 1.1532385466034756, "grad_norm": 0.2759631872177124, "learning_rate": 0.00019157542189754268, "loss": 0.19963940978050232, "mean_token_accuracy": 0.9220093786716461, "num_tokens": 27014812.0, "step": 2190 }, { "entropy": 1.1839116215705872, "epoch": 1.15376513954713, "grad_norm": 0.25730669498443604, "learning_rate": 0.00019156615621692292, "loss": 0.18340635299682617, "mean_token_accuracy": 0.9252117276191711, "num_tokens": 27027148.0, "step": 2191 }, { "entropy": 1.202635020017624, "epoch": 1.1542917324907846, "grad_norm": 0.2737926244735718, "learning_rate": 0.00019155688569419586, "loss": 0.206609845161438, "mean_token_accuracy": 0.9209761023521423, "num_tokens": 27039484.0, "step": 2192 }, { "entropy": 1.168206125497818, "epoch": 1.154818325434439, "grad_norm": 0.26999542117118835, "learning_rate": 0.00019154761032991185, "loss": 0.20011095702648163, "mean_token_accuracy": 0.9189373552799225, "num_tokens": 27051820.0, "step": 2193 }, { "entropy": 1.2162071764469147, "epoch": 1.1553449183780937, "grad_norm": 0.25214529037475586, "learning_rate": 0.00019153833012462148, "loss": 0.19554975628852844, "mean_token_accuracy": 0.9181893914937973, "num_tokens": 27064156.0, "step": 2194 }, { "entropy": 1.1848547458648682, "epoch": 1.1558715113217484, "grad_norm": 0.2536722719669342, "learning_rate": 0.00019152904507887573, "loss": 0.19084079563617706, "mean_token_accuracy": 0.9256320744752884, "num_tokens": 27076492.0, "step": 2195 }, { "entropy": 1.1943599879741669, "epoch": 1.1563981042654028, "grad_norm": 0.2896130084991455, "learning_rate": 0.00019151975519322576, "loss": 0.19871902465820312, "mean_token_accuracy": 0.9247763454914093, "num_tokens": 27088828.0, "step": 2196 }, { "entropy": 1.2219892144203186, "epoch": 1.1569246972090574, "grad_norm": 0.287672221660614, "learning_rate": 0.00019151046046822305, "loss": 0.20714130997657776, "mean_token_accuracy": 0.918072521686554, "num_tokens": 27101164.0, "step": 2197 }, { "entropy": 1.2384284734725952, "epoch": 1.1574512901527119, "grad_norm": 0.2936769425868988, "learning_rate": 0.00019150116090441938, "loss": 0.21063557267189026, "mean_token_accuracy": 0.9142559766769409, "num_tokens": 27113500.0, "step": 2198 }, { "entropy": 1.2583527266979218, "epoch": 1.1579778830963665, "grad_norm": 0.30406489968299866, "learning_rate": 0.00019149185650236682, "loss": 0.2245735228061676, "mean_token_accuracy": 0.9095106869935989, "num_tokens": 27125836.0, "step": 2199 }, { "entropy": 1.2499944269657135, "epoch": 1.1585044760400212, "grad_norm": 0.30430343747138977, "learning_rate": 0.0001914825472626177, "loss": 0.21744973957538605, "mean_token_accuracy": 0.9074316918849945, "num_tokens": 27138172.0, "step": 2200 }, { "entropy": 1.1596157252788544, "epoch": 1.1590310689836756, "grad_norm": 0.29872894287109375, "learning_rate": 0.00019147323318572466, "loss": 0.20363301038742065, "mean_token_accuracy": 0.9211505800485611, "num_tokens": 27150508.0, "step": 2201 }, { "entropy": 1.2048721611499786, "epoch": 1.1595576619273302, "grad_norm": 0.28121620416641235, "learning_rate": 0.00019146391427224063, "loss": 0.20417368412017822, "mean_token_accuracy": 0.9163524359464645, "num_tokens": 27162844.0, "step": 2202 }, { "entropy": 1.2005835473537445, "epoch": 1.1600842548709847, "grad_norm": 0.2875327169895172, "learning_rate": 0.00019145459052271883, "loss": 0.1831551492214203, "mean_token_accuracy": 0.9263263195753098, "num_tokens": 27175180.0, "step": 2203 }, { "entropy": 1.1740988194942474, "epoch": 1.1606108478146393, "grad_norm": 0.30328717827796936, "learning_rate": 0.00019144526193771275, "loss": 0.2115185409784317, "mean_token_accuracy": 0.9105354696512222, "num_tokens": 27187516.0, "step": 2204 }, { "entropy": 1.1883420646190643, "epoch": 1.161137440758294, "grad_norm": 0.3002709448337555, "learning_rate": 0.00019143592851777617, "loss": 0.1997799128293991, "mean_token_accuracy": 0.9204158633947372, "num_tokens": 27199852.0, "step": 2205 }, { "entropy": 1.186734914779663, "epoch": 1.1616640337019484, "grad_norm": 0.2615937888622284, "learning_rate": 0.00019142659026346315, "loss": 0.20187148451805115, "mean_token_accuracy": 0.9159397482872009, "num_tokens": 27212188.0, "step": 2206 }, { "entropy": 1.1872017085552216, "epoch": 1.162190626645603, "grad_norm": 0.26249435544013977, "learning_rate": 0.00019141724717532802, "loss": 0.18397313356399536, "mean_token_accuracy": 0.9237561523914337, "num_tokens": 27224524.0, "step": 2207 }, { "entropy": 1.1571813225746155, "epoch": 1.1627172195892574, "grad_norm": 0.27942758798599243, "learning_rate": 0.0001914078992539255, "loss": 0.18515753746032715, "mean_token_accuracy": 0.9259720593690872, "num_tokens": 27236860.0, "step": 2208 }, { "entropy": 1.1432051360607147, "epoch": 1.163243812532912, "grad_norm": 0.2963655889034271, "learning_rate": 0.00019139854649981048, "loss": 0.21573269367218018, "mean_token_accuracy": 0.9100171327590942, "num_tokens": 27249196.0, "step": 2209 }, { "entropy": 1.188007116317749, "epoch": 1.1637704054765665, "grad_norm": 0.31860122084617615, "learning_rate": 0.00019138918891353817, "loss": 0.2418171912431717, "mean_token_accuracy": 0.9069865345954895, "num_tokens": 27261532.0, "step": 2210 }, { "entropy": 1.1004420518875122, "epoch": 1.1642969984202212, "grad_norm": 0.2776052951812744, "learning_rate": 0.00019137982649566407, "loss": 0.2053711712360382, "mean_token_accuracy": 0.9153793305158615, "num_tokens": 27273868.0, "step": 2211 }, { "entropy": 1.1410734951496124, "epoch": 1.1648235913638758, "grad_norm": 0.28460225462913513, "learning_rate": 0.00019137045924674402, "loss": 0.21728798747062683, "mean_token_accuracy": 0.9123410433530807, "num_tokens": 27286204.0, "step": 2212 }, { "entropy": 1.1587063372135162, "epoch": 1.1653501843075302, "grad_norm": 0.2642859220504761, "learning_rate": 0.0001913610871673341, "loss": 0.18721605837345123, "mean_token_accuracy": 0.9224630892276764, "num_tokens": 27298540.0, "step": 2213 }, { "entropy": 1.1271196007728577, "epoch": 1.1658767772511849, "grad_norm": 0.28819388151168823, "learning_rate": 0.00019135171025799056, "loss": 0.18717646598815918, "mean_token_accuracy": 0.9211658984422684, "num_tokens": 27310876.0, "step": 2214 }, { "entropy": 1.1337847411632538, "epoch": 1.1664033701948393, "grad_norm": 0.2941300570964813, "learning_rate": 0.0001913423285192702, "loss": 0.21211886405944824, "mean_token_accuracy": 0.9153169095516205, "num_tokens": 27323212.0, "step": 2215 }, { "entropy": 1.1438775956630707, "epoch": 1.166929963138494, "grad_norm": 0.2863110303878784, "learning_rate": 0.0001913329419517299, "loss": 0.2077072560787201, "mean_token_accuracy": 0.9118431657552719, "num_tokens": 27335548.0, "step": 2216 }, { "entropy": 1.1338017284870148, "epoch": 1.1674565560821484, "grad_norm": 0.2920835316181183, "learning_rate": 0.0001913235505559268, "loss": 0.19436489045619965, "mean_token_accuracy": 0.9221871793270111, "num_tokens": 27347884.0, "step": 2217 }, { "entropy": 1.142452985048294, "epoch": 1.167983149025803, "grad_norm": 0.26582619547843933, "learning_rate": 0.00019131415433241855, "loss": 0.19146628677845, "mean_token_accuracy": 0.9218153953552246, "num_tokens": 27360220.0, "step": 2218 }, { "entropy": 1.1075855195522308, "epoch": 1.1685097419694577, "grad_norm": 0.2855731248855591, "learning_rate": 0.0001913047532817629, "loss": 0.20022396743297577, "mean_token_accuracy": 0.919172614812851, "num_tokens": 27372556.0, "step": 2219 }, { "entropy": 1.161133885383606, "epoch": 1.169036334913112, "grad_norm": 0.2820180356502533, "learning_rate": 0.0001912953474045179, "loss": 0.2025647759437561, "mean_token_accuracy": 0.9174589961767197, "num_tokens": 27384892.0, "step": 2220 }, { "entropy": 1.145233541727066, "epoch": 1.1695629278567667, "grad_norm": 0.2780614495277405, "learning_rate": 0.00019128593670124198, "loss": 0.20629477500915527, "mean_token_accuracy": 0.9178284406661987, "num_tokens": 27397228.0, "step": 2221 }, { "entropy": 1.1302664279937744, "epoch": 1.1700895208004214, "grad_norm": 0.28989875316619873, "learning_rate": 0.00019127652117249374, "loss": 0.20143242180347443, "mean_token_accuracy": 0.9146946966648102, "num_tokens": 27409564.0, "step": 2222 }, { "entropy": 1.145494520664215, "epoch": 1.1706161137440758, "grad_norm": 0.280318945646286, "learning_rate": 0.0001912671008188322, "loss": 0.18556565046310425, "mean_token_accuracy": 0.9243800044059753, "num_tokens": 27421900.0, "step": 2223 }, { "entropy": 1.122549831867218, "epoch": 1.1711427066877305, "grad_norm": 0.28058454394340515, "learning_rate": 0.0001912576756408165, "loss": 0.19919465482234955, "mean_token_accuracy": 0.9234228730201721, "num_tokens": 27434236.0, "step": 2224 }, { "entropy": 1.1942664980888367, "epoch": 1.1716692996313849, "grad_norm": 0.3011435866355896, "learning_rate": 0.00019124824563900622, "loss": 0.2100905328989029, "mean_token_accuracy": 0.9161610305309296, "num_tokens": 27446572.0, "step": 2225 }, { "entropy": 1.1235324144363403, "epoch": 1.1721958925750395, "grad_norm": 0.2678482234477997, "learning_rate": 0.00019123881081396113, "loss": 0.18935970962047577, "mean_token_accuracy": 0.9210453182458878, "num_tokens": 27458908.0, "step": 2226 }, { "entropy": 1.1233053505420685, "epoch": 1.172722485518694, "grad_norm": 0.3001168966293335, "learning_rate": 0.00019122937116624133, "loss": 0.1962110847234726, "mean_token_accuracy": 0.9216617047786713, "num_tokens": 27471244.0, "step": 2227 }, { "entropy": 1.1534164547920227, "epoch": 1.1732490784623486, "grad_norm": 0.3095707893371582, "learning_rate": 0.00019121992669640726, "loss": 0.2072276473045349, "mean_token_accuracy": 0.9137547612190247, "num_tokens": 27483580.0, "step": 2228 }, { "entropy": 1.1193904280662537, "epoch": 1.1737756714060033, "grad_norm": 0.26677873730659485, "learning_rate": 0.00019121047740501947, "loss": 0.20390596985816956, "mean_token_accuracy": 0.9185405522584915, "num_tokens": 27495916.0, "step": 2229 }, { "entropy": 1.1349280178546906, "epoch": 1.1743022643496577, "grad_norm": 0.2756739854812622, "learning_rate": 0.000191201023292639, "loss": 0.2036488950252533, "mean_token_accuracy": 0.9196960180997849, "num_tokens": 27508252.0, "step": 2230 }, { "entropy": 1.1713554561138153, "epoch": 1.1748288572933123, "grad_norm": 0.30103445053100586, "learning_rate": 0.00019119156435982703, "loss": 0.20072484016418457, "mean_token_accuracy": 0.925217941403389, "num_tokens": 27520588.0, "step": 2231 }, { "entropy": 1.1370952129364014, "epoch": 1.1753554502369667, "grad_norm": 0.32296401262283325, "learning_rate": 0.00019118210060714512, "loss": 0.23248368501663208, "mean_token_accuracy": 0.9066440016031265, "num_tokens": 27532924.0, "step": 2232 }, { "entropy": 1.152237057685852, "epoch": 1.1758820431806214, "grad_norm": 0.2729482650756836, "learning_rate": 0.00019117263203515504, "loss": 0.19771021604537964, "mean_token_accuracy": 0.9137565195560455, "num_tokens": 27545260.0, "step": 2233 }, { "entropy": 1.175236165523529, "epoch": 1.1764086361242758, "grad_norm": 0.27823638916015625, "learning_rate": 0.00019116315864441897, "loss": 0.20588554441928864, "mean_token_accuracy": 0.9182644933462143, "num_tokens": 27557596.0, "step": 2234 }, { "entropy": 1.19709312915802, "epoch": 1.1769352290679305, "grad_norm": 0.2955763041973114, "learning_rate": 0.00019115368043549916, "loss": 0.1897638589143753, "mean_token_accuracy": 0.9216989874839783, "num_tokens": 27569932.0, "step": 2235 }, { "entropy": 1.2332687377929688, "epoch": 1.1774618220115851, "grad_norm": 0.3177914023399353, "learning_rate": 0.00019114419740895837, "loss": 0.23029568791389465, "mean_token_accuracy": 0.906041145324707, "num_tokens": 27582268.0, "step": 2236 }, { "entropy": 1.1908305287361145, "epoch": 1.1779884149552395, "grad_norm": 0.2913646996021271, "learning_rate": 0.00019113470956535952, "loss": 0.20150071382522583, "mean_token_accuracy": 0.9204053580760956, "num_tokens": 27594604.0, "step": 2237 }, { "entropy": 1.2038147449493408, "epoch": 1.1785150078988942, "grad_norm": 0.28544673323631287, "learning_rate": 0.00019112521690526583, "loss": 0.18555422127246857, "mean_token_accuracy": 0.924328088760376, "num_tokens": 27606940.0, "step": 2238 }, { "entropy": 1.2000732123851776, "epoch": 1.1790416008425488, "grad_norm": 0.2675821781158447, "learning_rate": 0.00019111571942924085, "loss": 0.19991934299468994, "mean_token_accuracy": 0.9188268631696701, "num_tokens": 27619276.0, "step": 2239 }, { "entropy": 1.206215888261795, "epoch": 1.1795681937862033, "grad_norm": 0.2979394495487213, "learning_rate": 0.00019110621713784842, "loss": 0.19255416095256805, "mean_token_accuracy": 0.9227475672960281, "num_tokens": 27631612.0, "step": 2240 }, { "entropy": 1.1973096132278442, "epoch": 1.180094786729858, "grad_norm": 0.27704933285713196, "learning_rate": 0.0001910967100316526, "loss": 0.18796265125274658, "mean_token_accuracy": 0.9225670397281647, "num_tokens": 27643948.0, "step": 2241 }, { "entropy": 1.2093007564544678, "epoch": 1.1806213796735123, "grad_norm": 0.29337137937545776, "learning_rate": 0.00019108719811121772, "loss": 0.193947434425354, "mean_token_accuracy": 0.9231081902980804, "num_tokens": 27656284.0, "step": 2242 }, { "entropy": 1.2430245876312256, "epoch": 1.181147972617167, "grad_norm": 0.3377665579319, "learning_rate": 0.00019107768137710852, "loss": 0.21937604248523712, "mean_token_accuracy": 0.9147068560123444, "num_tokens": 27668620.0, "step": 2243 }, { "entropy": 1.247610479593277, "epoch": 1.1816745655608214, "grad_norm": 0.32605549693107605, "learning_rate": 0.00019106815982988996, "loss": 0.22798651456832886, "mean_token_accuracy": 0.9099006354808807, "num_tokens": 27680956.0, "step": 2244 }, { "entropy": 1.1888035833835602, "epoch": 1.182201158504476, "grad_norm": 0.30127960443496704, "learning_rate": 0.00019105863347012724, "loss": 0.21623851358890533, "mean_token_accuracy": 0.9116876125335693, "num_tokens": 27693292.0, "step": 2245 }, { "entropy": 1.1904528439044952, "epoch": 1.1827277514481307, "grad_norm": 0.26522204279899597, "learning_rate": 0.0001910491022983859, "loss": 0.19360768795013428, "mean_token_accuracy": 0.9212395548820496, "num_tokens": 27705628.0, "step": 2246 }, { "entropy": 1.190793126821518, "epoch": 1.1832543443917851, "grad_norm": 0.28089118003845215, "learning_rate": 0.00019103956631523177, "loss": 0.20212800800800323, "mean_token_accuracy": 0.918514221906662, "num_tokens": 27717964.0, "step": 2247 }, { "entropy": 1.1978855729103088, "epoch": 1.1837809373354398, "grad_norm": 0.29225775599479675, "learning_rate": 0.00019103002552123087, "loss": 0.21059700846672058, "mean_token_accuracy": 0.913848802447319, "num_tokens": 27730300.0, "step": 2248 }, { "entropy": 1.1586676836013794, "epoch": 1.1843075302790942, "grad_norm": 0.2872113287448883, "learning_rate": 0.00019102047991694966, "loss": 0.21480488777160645, "mean_token_accuracy": 0.9116514921188354, "num_tokens": 27742636.0, "step": 2249 }, { "entropy": 1.1448751091957092, "epoch": 1.1848341232227488, "grad_norm": 0.29005923867225647, "learning_rate": 0.00019101092950295478, "loss": 0.2099185287952423, "mean_token_accuracy": 0.9138695448637009, "num_tokens": 27754972.0, "step": 2250 }, { "entropy": 1.137921154499054, "epoch": 1.1853607161664033, "grad_norm": 0.27500849962234497, "learning_rate": 0.0001910013742798132, "loss": 0.1960453987121582, "mean_token_accuracy": 0.9165975153446198, "num_tokens": 27767308.0, "step": 2251 }, { "entropy": 1.0970045328140259, "epoch": 1.185887309110058, "grad_norm": 0.26834315061569214, "learning_rate": 0.0001909918142480921, "loss": 0.2065771222114563, "mean_token_accuracy": 0.9169502705335617, "num_tokens": 27779644.0, "step": 2252 }, { "entropy": 1.1106819808483124, "epoch": 1.1864139020537126, "grad_norm": 0.29660072922706604, "learning_rate": 0.0001909822494083591, "loss": 0.19244039058685303, "mean_token_accuracy": 0.9193838387727737, "num_tokens": 27791980.0, "step": 2253 }, { "entropy": 1.0947784334421158, "epoch": 1.186940494997367, "grad_norm": 0.3122023642063141, "learning_rate": 0.0001909726797611819, "loss": 0.2027546465396881, "mean_token_accuracy": 0.916048526763916, "num_tokens": 27804316.0, "step": 2254 }, { "entropy": 1.077293038368225, "epoch": 1.1874670879410216, "grad_norm": 0.29647305607795715, "learning_rate": 0.00019096310530712865, "loss": 0.19166618585586548, "mean_token_accuracy": 0.9190387576818466, "num_tokens": 27816652.0, "step": 2255 }, { "entropy": 1.0975450575351715, "epoch": 1.187993680884676, "grad_norm": 0.30608993768692017, "learning_rate": 0.00019095352604676775, "loss": 0.20418736338615417, "mean_token_accuracy": 0.9154408276081085, "num_tokens": 27828988.0, "step": 2256 }, { "entropy": 1.0858297049999237, "epoch": 1.1885202738283307, "grad_norm": 0.2871757447719574, "learning_rate": 0.00019094394198066784, "loss": 0.20662033557891846, "mean_token_accuracy": 0.9137272536754608, "num_tokens": 27841324.0, "step": 2257 }, { "entropy": 1.098552942276001, "epoch": 1.1890468667719853, "grad_norm": 0.31691616773605347, "learning_rate": 0.0001909343531093979, "loss": 0.19544214010238647, "mean_token_accuracy": 0.9170811921358109, "num_tokens": 27853660.0, "step": 2258 }, { "entropy": 1.0465008020401, "epoch": 1.1895734597156398, "grad_norm": 0.274053156375885, "learning_rate": 0.00019092475943352708, "loss": 0.18214793503284454, "mean_token_accuracy": 0.9284517616033554, "num_tokens": 27865996.0, "step": 2259 }, { "entropy": 1.0639517903327942, "epoch": 1.1901000526592944, "grad_norm": 0.3095509111881256, "learning_rate": 0.000190915160953625, "loss": 0.21801498532295227, "mean_token_accuracy": 0.9145664125680923, "num_tokens": 27878332.0, "step": 2260 }, { "entropy": 1.0542739927768707, "epoch": 1.1906266456029488, "grad_norm": 0.29980573058128357, "learning_rate": 0.0001909055576702614, "loss": 0.21734799444675446, "mean_token_accuracy": 0.9118731617927551, "num_tokens": 27890668.0, "step": 2261 }, { "entropy": 1.0719305872917175, "epoch": 1.1911532385466035, "grad_norm": 0.29808852076530457, "learning_rate": 0.00019089594958400638, "loss": 0.19167831540107727, "mean_token_accuracy": 0.9198271036148071, "num_tokens": 27903004.0, "step": 2262 }, { "entropy": 1.083087533712387, "epoch": 1.1916798314902581, "grad_norm": 0.2985793948173523, "learning_rate": 0.00019088633669543035, "loss": 0.20173481106758118, "mean_token_accuracy": 0.9191490411758423, "num_tokens": 27915340.0, "step": 2263 }, { "entropy": 1.0608322620391846, "epoch": 1.1922064244339126, "grad_norm": 0.3635084927082062, "learning_rate": 0.00019087671900510394, "loss": 0.19898994266986847, "mean_token_accuracy": 0.9207655042409897, "num_tokens": 27927676.0, "step": 2264 }, { "entropy": 1.0396868586540222, "epoch": 1.1927330173775672, "grad_norm": 0.2880086898803711, "learning_rate": 0.00019086709651359817, "loss": 0.2001173496246338, "mean_token_accuracy": 0.9208283871412277, "num_tokens": 27940012.0, "step": 2265 }, { "entropy": 1.0880854725837708, "epoch": 1.1932596103212216, "grad_norm": 0.30705323815345764, "learning_rate": 0.00019085746922148413, "loss": 0.22503894567489624, "mean_token_accuracy": 0.9097017347812653, "num_tokens": 27952348.0, "step": 2266 }, { "entropy": 1.0872746706008911, "epoch": 1.1937862032648763, "grad_norm": 0.27415189146995544, "learning_rate": 0.00019084783712933345, "loss": 0.19403532147407532, "mean_token_accuracy": 0.9209066331386566, "num_tokens": 27964684.0, "step": 2267 }, { "entropy": 1.0447344183921814, "epoch": 1.1943127962085307, "grad_norm": 0.2834930121898651, "learning_rate": 0.0001908382002377179, "loss": 0.2041846364736557, "mean_token_accuracy": 0.919536292552948, "num_tokens": 27977020.0, "step": 2268 }, { "entropy": 1.0546895861625671, "epoch": 1.1948393891521853, "grad_norm": 0.2582406997680664, "learning_rate": 0.00019082855854720955, "loss": 0.19313426315784454, "mean_token_accuracy": 0.920450747013092, "num_tokens": 27989356.0, "step": 2269 }, { "entropy": 1.1272867023944855, "epoch": 1.19536598209584, "grad_norm": 0.28488391637802124, "learning_rate": 0.0001908189120583808, "loss": 0.22456082701683044, "mean_token_accuracy": 0.9063926041126251, "num_tokens": 28001692.0, "step": 2270 }, { "entropy": 1.071615993976593, "epoch": 1.1958925750394944, "grad_norm": 0.262404203414917, "learning_rate": 0.00019080926077180425, "loss": 0.18905514478683472, "mean_token_accuracy": 0.9255506098270416, "num_tokens": 28014028.0, "step": 2271 }, { "entropy": 1.0979838967323303, "epoch": 1.196419167983149, "grad_norm": 0.2802709639072418, "learning_rate": 0.00019079960468805293, "loss": 0.1837414801120758, "mean_token_accuracy": 0.9260729998350143, "num_tokens": 28026364.0, "step": 2272 }, { "entropy": 1.0705920308828354, "epoch": 1.1969457609268035, "grad_norm": 0.2867828607559204, "learning_rate": 0.00019078994380769998, "loss": 0.2067106068134308, "mean_token_accuracy": 0.9144153445959091, "num_tokens": 28038700.0, "step": 2273 }, { "entropy": 1.0631752610206604, "epoch": 1.1974723538704581, "grad_norm": 0.2956964075565338, "learning_rate": 0.000190780278131319, "loss": 0.22864574193954468, "mean_token_accuracy": 0.9114911556243896, "num_tokens": 28051036.0, "step": 2274 }, { "entropy": 1.0306233167648315, "epoch": 1.1979989468141128, "grad_norm": 0.27961382269859314, "learning_rate": 0.00019077060765948368, "loss": 0.2214936763048172, "mean_token_accuracy": 0.910724937915802, "num_tokens": 28063372.0, "step": 2275 }, { "entropy": 1.0444636046886444, "epoch": 1.1985255397577672, "grad_norm": 0.2704748511314392, "learning_rate": 0.00019076093239276813, "loss": 0.1987978219985962, "mean_token_accuracy": 0.9210948199033737, "num_tokens": 28075708.0, "step": 2276 }, { "entropy": 1.0565994679927826, "epoch": 1.1990521327014219, "grad_norm": 0.2979368269443512, "learning_rate": 0.00019075125233174674, "loss": 0.20775671303272247, "mean_token_accuracy": 0.915656104683876, "num_tokens": 28088044.0, "step": 2277 }, { "entropy": 1.0443108528852463, "epoch": 1.1995787256450763, "grad_norm": 0.28842073678970337, "learning_rate": 0.0001907415674769942, "loss": 0.2142159640789032, "mean_token_accuracy": 0.9145304262638092, "num_tokens": 28100380.0, "step": 2278 }, { "entropy": 1.0332957953214645, "epoch": 1.200105318588731, "grad_norm": 0.2912449538707733, "learning_rate": 0.00019073187782908538, "loss": 0.20978567004203796, "mean_token_accuracy": 0.9145148694515228, "num_tokens": 28112716.0, "step": 2279 }, { "entropy": 1.0637232959270477, "epoch": 1.2006319115323856, "grad_norm": 0.27986404299736023, "learning_rate": 0.0001907221833885955, "loss": 0.20642036199569702, "mean_token_accuracy": 0.9175934493541718, "num_tokens": 28125052.0, "step": 2280 }, { "entropy": 1.0875510275363922, "epoch": 1.20115850447604, "grad_norm": 0.2697252333164215, "learning_rate": 0.00019071248415610008, "loss": 0.17736025154590607, "mean_token_accuracy": 0.9242502599954605, "num_tokens": 28137388.0, "step": 2281 }, { "entropy": 1.0523739904165268, "epoch": 1.2016850974196946, "grad_norm": 0.28700074553489685, "learning_rate": 0.0001907027801321749, "loss": 0.19527116417884827, "mean_token_accuracy": 0.9207979440689087, "num_tokens": 28149724.0, "step": 2282 }, { "entropy": 1.0521668642759323, "epoch": 1.202211690363349, "grad_norm": 0.33191800117492676, "learning_rate": 0.00019069307131739608, "loss": 0.20707619190216064, "mean_token_accuracy": 0.9119413197040558, "num_tokens": 28162060.0, "step": 2283 }, { "entropy": 1.0997390151023865, "epoch": 1.2027382833070037, "grad_norm": 0.2936375141143799, "learning_rate": 0.00019068335771233987, "loss": 0.1859363317489624, "mean_token_accuracy": 0.925885409116745, "num_tokens": 28174396.0, "step": 2284 }, { "entropy": 1.0267358273267746, "epoch": 1.2032648762506581, "grad_norm": 0.31446945667266846, "learning_rate": 0.000190673639317583, "loss": 0.20978572964668274, "mean_token_accuracy": 0.9154664278030396, "num_tokens": 28186732.0, "step": 2285 }, { "entropy": 1.0447548627853394, "epoch": 1.2037914691943128, "grad_norm": 0.26753443479537964, "learning_rate": 0.0001906639161337024, "loss": 0.18991108238697052, "mean_token_accuracy": 0.9253087639808655, "num_tokens": 28199068.0, "step": 2286 }, { "entropy": 1.019596055150032, "epoch": 1.2043180621379674, "grad_norm": 0.2849011719226837, "learning_rate": 0.00019065418816127517, "loss": 0.19186937808990479, "mean_token_accuracy": 0.9237010776996613, "num_tokens": 28211404.0, "step": 2287 }, { "entropy": 1.0712246000766754, "epoch": 1.2048446550816219, "grad_norm": 0.3231803774833679, "learning_rate": 0.0001906444554008789, "loss": 0.21262578666210175, "mean_token_accuracy": 0.9131361246109009, "num_tokens": 28223740.0, "step": 2288 }, { "entropy": 1.0217514485120773, "epoch": 1.2053712480252765, "grad_norm": 0.27426403760910034, "learning_rate": 0.00019063471785309136, "loss": 0.19608943164348602, "mean_token_accuracy": 0.9183037132024765, "num_tokens": 28236076.0, "step": 2289 }, { "entropy": 1.0533497035503387, "epoch": 1.205897840968931, "grad_norm": 0.31602412462234497, "learning_rate": 0.0001906249755184906, "loss": 0.20852188766002655, "mean_token_accuracy": 0.9144260287284851, "num_tokens": 28248412.0, "step": 2290 }, { "entropy": 1.0375554859638214, "epoch": 1.2064244339125856, "grad_norm": 0.2901093065738678, "learning_rate": 0.00019061522839765495, "loss": 0.20651787519454956, "mean_token_accuracy": 0.9151993989944458, "num_tokens": 28260748.0, "step": 2291 }, { "entropy": 1.047476589679718, "epoch": 1.20695102685624, "grad_norm": 0.28905728459358215, "learning_rate": 0.00019060547649116304, "loss": 0.18046444654464722, "mean_token_accuracy": 0.924500435590744, "num_tokens": 28273084.0, "step": 2292 }, { "entropy": 1.0409999787807465, "epoch": 1.2074776197998947, "grad_norm": 0.26790550351142883, "learning_rate": 0.00019059571979959382, "loss": 0.182978093624115, "mean_token_accuracy": 0.9302794337272644, "num_tokens": 28285420.0, "step": 2293 }, { "entropy": 0.9823900163173676, "epoch": 1.2080042127435493, "grad_norm": 0.29670295119285583, "learning_rate": 0.00019058595832352647, "loss": 0.19820117950439453, "mean_token_accuracy": 0.9207546710968018, "num_tokens": 28297756.0, "step": 2294 }, { "entropy": 1.0482214242219925, "epoch": 1.2085308056872037, "grad_norm": 0.2754944860935211, "learning_rate": 0.00019057619206354042, "loss": 0.1841028481721878, "mean_token_accuracy": 0.9217727184295654, "num_tokens": 28310092.0, "step": 2295 }, { "entropy": 0.979021742939949, "epoch": 1.2090573986308584, "grad_norm": 0.2850244641304016, "learning_rate": 0.00019056642102021555, "loss": 0.19173939526081085, "mean_token_accuracy": 0.920306608080864, "num_tokens": 28322428.0, "step": 2296 }, { "entropy": 1.0073926001787186, "epoch": 1.209583991574513, "grad_norm": 0.2759486734867096, "learning_rate": 0.00019055664519413177, "loss": 0.19916388392448425, "mean_token_accuracy": 0.9175459295511246, "num_tokens": 28334764.0, "step": 2297 }, { "entropy": 0.9477061033248901, "epoch": 1.2101105845181674, "grad_norm": 0.3503093719482422, "learning_rate": 0.00019054686458586952, "loss": 0.20742762088775635, "mean_token_accuracy": 0.9118971973657608, "num_tokens": 28347100.0, "step": 2298 }, { "entropy": 1.0388128459453583, "epoch": 1.210637177461822, "grad_norm": 0.3258967697620392, "learning_rate": 0.00019053707919600938, "loss": 0.22573794424533844, "mean_token_accuracy": 0.9091981053352356, "num_tokens": 28359436.0, "step": 2299 }, { "entropy": 0.9342583864927292, "epoch": 1.2111637704054765, "grad_norm": 0.2741185426712036, "learning_rate": 0.00019052728902513224, "loss": 0.1891242414712906, "mean_token_accuracy": 0.920941025018692, "num_tokens": 28371772.0, "step": 2300 }, { "entropy": 0.9953952133655548, "epoch": 1.2116903633491312, "grad_norm": 0.29077091813087463, "learning_rate": 0.00019051749407381934, "loss": 0.2002788484096527, "mean_token_accuracy": 0.9163627922534943, "num_tokens": 28384108.0, "step": 2301 }, { "entropy": 0.9766784757375717, "epoch": 1.2122169562927856, "grad_norm": 0.301318496465683, "learning_rate": 0.00019050769434265206, "loss": 0.20140445232391357, "mean_token_accuracy": 0.9168388992547989, "num_tokens": 28396444.0, "step": 2302 }, { "entropy": 0.9402145892381668, "epoch": 1.2127435492364402, "grad_norm": 0.2892124056816101, "learning_rate": 0.00019049788983221223, "loss": 0.19553864002227783, "mean_token_accuracy": 0.9176475703716278, "num_tokens": 28408780.0, "step": 2303 }, { "entropy": 0.9864234030246735, "epoch": 1.2132701421800949, "grad_norm": 0.2760343551635742, "learning_rate": 0.00019048808054308183, "loss": 0.18409714102745056, "mean_token_accuracy": 0.9212307929992676, "num_tokens": 28421116.0, "step": 2304 }, { "entropy": 1.0085313767194748, "epoch": 1.2137967351237493, "grad_norm": 0.31804919242858887, "learning_rate": 0.00019047826647584324, "loss": 0.21396562457084656, "mean_token_accuracy": 0.9174764901399612, "num_tokens": 28433452.0, "step": 2305 }, { "entropy": 0.9060227423906326, "epoch": 1.214323328067404, "grad_norm": 0.26906898617744446, "learning_rate": 0.000190468447631079, "loss": 0.1767490655183792, "mean_token_accuracy": 0.9256879538297653, "num_tokens": 28445788.0, "step": 2306 }, { "entropy": 0.9600940495729446, "epoch": 1.2148499210110584, "grad_norm": 0.31325221061706543, "learning_rate": 0.00019045862400937207, "loss": 0.2050899714231491, "mean_token_accuracy": 0.915095791220665, "num_tokens": 28458124.0, "step": 2307 }, { "entropy": 0.9618964791297913, "epoch": 1.215376513954713, "grad_norm": 0.28453946113586426, "learning_rate": 0.00019044879561130553, "loss": 0.19918674230575562, "mean_token_accuracy": 0.9192324429750443, "num_tokens": 28470460.0, "step": 2308 }, { "entropy": 0.9584704488515854, "epoch": 1.2159031068983674, "grad_norm": 0.27916356921195984, "learning_rate": 0.00019043896243746292, "loss": 0.20780225098133087, "mean_token_accuracy": 0.9173972904682159, "num_tokens": 28482796.0, "step": 2309 }, { "entropy": 0.9718508273363113, "epoch": 1.216429699842022, "grad_norm": 0.3944566249847412, "learning_rate": 0.00019042912448842794, "loss": 0.20700976252555847, "mean_token_accuracy": 0.9170730262994766, "num_tokens": 28495132.0, "step": 2310 }, { "entropy": 0.9472010433673859, "epoch": 1.2169562927856767, "grad_norm": 0.27791833877563477, "learning_rate": 0.0001904192817647846, "loss": 0.19973602890968323, "mean_token_accuracy": 0.9199665784835815, "num_tokens": 28507468.0, "step": 2311 }, { "entropy": 0.9158832877874374, "epoch": 1.2174828857293312, "grad_norm": 0.2705928385257721, "learning_rate": 0.00019040943426711725, "loss": 0.1925109326839447, "mean_token_accuracy": 0.922896683216095, "num_tokens": 28519804.0, "step": 2312 }, { "entropy": 0.9301202595233917, "epoch": 1.2180094786729858, "grad_norm": 0.29519709944725037, "learning_rate": 0.00019039958199601044, "loss": 0.2137046456336975, "mean_token_accuracy": 0.9163611382246017, "num_tokens": 28532140.0, "step": 2313 }, { "entropy": 0.9268923699855804, "epoch": 1.2185360716166405, "grad_norm": 0.29034554958343506, "learning_rate": 0.00019038972495204906, "loss": 0.20945435762405396, "mean_token_accuracy": 0.9179003089666367, "num_tokens": 28544476.0, "step": 2314 }, { "entropy": 0.9507464468479156, "epoch": 1.2190626645602949, "grad_norm": 0.3054998517036438, "learning_rate": 0.00019037986313581823, "loss": 0.21049703657627106, "mean_token_accuracy": 0.9139607399702072, "num_tokens": 28556812.0, "step": 2315 }, { "entropy": 0.9595097601413727, "epoch": 1.2195892575039495, "grad_norm": 0.28608593344688416, "learning_rate": 0.0001903699965479034, "loss": 0.22186635434627533, "mean_token_accuracy": 0.9084164053201675, "num_tokens": 28569148.0, "step": 2316 }, { "entropy": 0.9086242020130157, "epoch": 1.220115850447604, "grad_norm": 0.2904057502746582, "learning_rate": 0.00019036012518889036, "loss": 0.1948484480381012, "mean_token_accuracy": 0.9190005958080292, "num_tokens": 28581484.0, "step": 2317 }, { "entropy": 0.9179560393095016, "epoch": 1.2206424433912586, "grad_norm": 0.2642764151096344, "learning_rate": 0.00019035024905936503, "loss": 0.18806758522987366, "mean_token_accuracy": 0.9178005754947662, "num_tokens": 28593820.0, "step": 2318 }, { "entropy": 0.9741402119398117, "epoch": 1.221169036334913, "grad_norm": 0.28891104459762573, "learning_rate": 0.00019034036815991374, "loss": 0.21470314264297485, "mean_token_accuracy": 0.9158063977956772, "num_tokens": 28606156.0, "step": 2319 }, { "entropy": 0.9723116159439087, "epoch": 1.2216956292785677, "grad_norm": 0.2928186058998108, "learning_rate": 0.00019033048249112304, "loss": 0.21727263927459717, "mean_token_accuracy": 0.9125364273786545, "num_tokens": 28618492.0, "step": 2320 }, { "entropy": 1.0076178759336472, "epoch": 1.2222222222222223, "grad_norm": 0.2738136649131775, "learning_rate": 0.00019032059205357978, "loss": 0.20682492852210999, "mean_token_accuracy": 0.9168647974729538, "num_tokens": 28630828.0, "step": 2321 }, { "entropy": 0.9914740473031998, "epoch": 1.2227488151658767, "grad_norm": 0.32728976011276245, "learning_rate": 0.00019031069684787117, "loss": 0.23216472566127777, "mean_token_accuracy": 0.9085246026515961, "num_tokens": 28643164.0, "step": 2322 }, { "entropy": 1.019994467496872, "epoch": 1.2232754081095314, "grad_norm": 0.3143840432167053, "learning_rate": 0.00019030079687458454, "loss": 0.2100144624710083, "mean_token_accuracy": 0.9146460592746735, "num_tokens": 28655500.0, "step": 2323 }, { "entropy": 1.0059214681386948, "epoch": 1.2238020010531858, "grad_norm": 0.285477876663208, "learning_rate": 0.0001902908921343076, "loss": 0.19599957764148712, "mean_token_accuracy": 0.9203824996948242, "num_tokens": 28667836.0, "step": 2324 }, { "entropy": 1.0299699008464813, "epoch": 1.2243285939968405, "grad_norm": 0.30807819962501526, "learning_rate": 0.00019028098262762844, "loss": 0.2146599292755127, "mean_token_accuracy": 0.9128930121660233, "num_tokens": 28680172.0, "step": 2325 }, { "entropy": 0.9639817774295807, "epoch": 1.2248551869404949, "grad_norm": 0.2883492112159729, "learning_rate": 0.00019027106835513519, "loss": 0.2116781324148178, "mean_token_accuracy": 0.9104322791099548, "num_tokens": 28692508.0, "step": 2326 }, { "entropy": 0.9987800866365433, "epoch": 1.2253817798841495, "grad_norm": 0.2772632837295532, "learning_rate": 0.00019026114931741648, "loss": 0.18406018614768982, "mean_token_accuracy": 0.9260071665048599, "num_tokens": 28704844.0, "step": 2327 }, { "entropy": 0.9284749180078506, "epoch": 1.2259083728278042, "grad_norm": 0.26899397373199463, "learning_rate": 0.00019025122551506117, "loss": 0.19465957581996918, "mean_token_accuracy": 0.9211094230413437, "num_tokens": 28717180.0, "step": 2328 }, { "entropy": 0.9498527348041534, "epoch": 1.2264349657714586, "grad_norm": 0.2672523260116577, "learning_rate": 0.0001902412969486583, "loss": 0.1857932209968567, "mean_token_accuracy": 0.923532709479332, "num_tokens": 28729516.0, "step": 2329 }, { "entropy": 0.9485073536634445, "epoch": 1.2269615587151133, "grad_norm": 0.6426500678062439, "learning_rate": 0.00019023136361879733, "loss": 0.20064154267311096, "mean_token_accuracy": 0.9190724045038223, "num_tokens": 28741852.0, "step": 2330 }, { "entropy": 0.9678667783737183, "epoch": 1.2274881516587677, "grad_norm": 0.28017935156822205, "learning_rate": 0.00019022142552606788, "loss": 0.19379380345344543, "mean_token_accuracy": 0.9230899214744568, "num_tokens": 28754188.0, "step": 2331 }, { "entropy": 0.9232030957937241, "epoch": 1.2280147446024223, "grad_norm": 0.2922697365283966, "learning_rate": 0.00019021148267106002, "loss": 0.21339812874794006, "mean_token_accuracy": 0.9169651716947556, "num_tokens": 28766524.0, "step": 2332 }, { "entropy": 0.9682541638612747, "epoch": 1.228541337546077, "grad_norm": 0.2776217758655548, "learning_rate": 0.00019020153505436388, "loss": 0.1879439353942871, "mean_token_accuracy": 0.9254468381404877, "num_tokens": 28778860.0, "step": 2333 }, { "entropy": 0.9788610488176346, "epoch": 1.2290679304897314, "grad_norm": 0.2904343903064728, "learning_rate": 0.00019019158267657014, "loss": 0.20155103504657745, "mean_token_accuracy": 0.915040597319603, "num_tokens": 28791196.0, "step": 2334 }, { "entropy": 0.9573673754930496, "epoch": 1.229594523433386, "grad_norm": 0.2809135913848877, "learning_rate": 0.00019018162553826947, "loss": 0.2041783183813095, "mean_token_accuracy": 0.91671222448349, "num_tokens": 28803532.0, "step": 2335 }, { "entropy": 0.9262150526046753, "epoch": 1.2301211163770405, "grad_norm": 0.2890893220901489, "learning_rate": 0.00019017166364005303, "loss": 0.1984890252351761, "mean_token_accuracy": 0.9185997843742371, "num_tokens": 28815868.0, "step": 2336 }, { "entropy": 0.9690218567848206, "epoch": 1.2306477093206951, "grad_norm": 0.30195772647857666, "learning_rate": 0.0001901616969825122, "loss": 0.19511699676513672, "mean_token_accuracy": 0.9191469699144363, "num_tokens": 28828204.0, "step": 2337 }, { "entropy": 0.9442458599805832, "epoch": 1.2311743022643498, "grad_norm": 0.3288037180900574, "learning_rate": 0.00019015172556623863, "loss": 0.23278209567070007, "mean_token_accuracy": 0.9055567979812622, "num_tokens": 28840540.0, "step": 2338 }, { "entropy": 0.9516178071498871, "epoch": 1.2317008952080042, "grad_norm": 0.3043895363807678, "learning_rate": 0.00019014174939182432, "loss": 0.20317667722702026, "mean_token_accuracy": 0.9137967079877853, "num_tokens": 28852876.0, "step": 2339 }, { "entropy": 1.0066047459840775, "epoch": 1.2322274881516588, "grad_norm": 0.28470954298973083, "learning_rate": 0.0001901317684598614, "loss": 0.17943891882896423, "mean_token_accuracy": 0.9240919649600983, "num_tokens": 28865212.0, "step": 2340 }, { "entropy": 0.9875893741846085, "epoch": 1.2327540810953133, "grad_norm": 0.279293954372406, "learning_rate": 0.00019012178277094246, "loss": 0.18953418731689453, "mean_token_accuracy": 0.9218238890171051, "num_tokens": 28877548.0, "step": 2341 }, { "entropy": 1.0479088127613068, "epoch": 1.233280674038968, "grad_norm": 0.3232957720756531, "learning_rate": 0.00019011179232566026, "loss": 0.19601483643054962, "mean_token_accuracy": 0.9135144054889679, "num_tokens": 28889884.0, "step": 2342 }, { "entropy": 1.0485905408859253, "epoch": 1.2338072669826223, "grad_norm": 0.2966122031211853, "learning_rate": 0.00019010179712460786, "loss": 0.214534193277359, "mean_token_accuracy": 0.9167278558015823, "num_tokens": 28902220.0, "step": 2343 }, { "entropy": 1.0693544447422028, "epoch": 1.234333859926277, "grad_norm": 0.2795875668525696, "learning_rate": 0.00019009179716837865, "loss": 0.1979323923587799, "mean_token_accuracy": 0.9212673157453537, "num_tokens": 28914556.0, "step": 2344 }, { "entropy": 1.1432946920394897, "epoch": 1.2348604528699316, "grad_norm": 0.32812783122062683, "learning_rate": 0.00019008179245756624, "loss": 0.20545022189617157, "mean_token_accuracy": 0.9139831513166428, "num_tokens": 28926892.0, "step": 2345 }, { "entropy": 1.156277745962143, "epoch": 1.235387045813586, "grad_norm": 0.35038238763809204, "learning_rate": 0.00019007178299276453, "loss": 0.22025498747825623, "mean_token_accuracy": 0.9107816964387894, "num_tokens": 28939228.0, "step": 2346 }, { "entropy": 1.167900800704956, "epoch": 1.2359136387572407, "grad_norm": 0.2617517411708832, "learning_rate": 0.00019006176877456782, "loss": 0.1741318702697754, "mean_token_accuracy": 0.9294529408216476, "num_tokens": 28951564.0, "step": 2347 }, { "entropy": 1.2039166390895844, "epoch": 1.2364402317008951, "grad_norm": 0.3141527473926544, "learning_rate": 0.0001900517498035705, "loss": 0.21124760806560516, "mean_token_accuracy": 0.9103933870792389, "num_tokens": 28963900.0, "step": 2348 }, { "entropy": 1.1911627054214478, "epoch": 1.2369668246445498, "grad_norm": 0.3090423047542572, "learning_rate": 0.00019004172608036736, "loss": 0.20455247163772583, "mean_token_accuracy": 0.9178474098443985, "num_tokens": 28976236.0, "step": 2349 }, { "entropy": 1.2294414341449738, "epoch": 1.2374934175882044, "grad_norm": 0.42555737495422363, "learning_rate": 0.0001900316976055535, "loss": 0.1899854689836502, "mean_token_accuracy": 0.9238343685865402, "num_tokens": 28988572.0, "step": 2350 }, { "entropy": 1.2140373587608337, "epoch": 1.2380200105318588, "grad_norm": 0.3391142189502716, "learning_rate": 0.00019002166437972418, "loss": 0.212956041097641, "mean_token_accuracy": 0.9184004813432693, "num_tokens": 29000908.0, "step": 2351 }, { "entropy": 1.245664894580841, "epoch": 1.2385466034755135, "grad_norm": 0.2943424880504608, "learning_rate": 0.00019001162640347506, "loss": 0.19764168560504913, "mean_token_accuracy": 0.9214494824409485, "num_tokens": 29013244.0, "step": 2352 }, { "entropy": 1.2262179851531982, "epoch": 1.239073196419168, "grad_norm": 0.29305392503738403, "learning_rate": 0.000190001583677402, "loss": 0.21708795428276062, "mean_token_accuracy": 0.9119549542665482, "num_tokens": 29025580.0, "step": 2353 }, { "entropy": 1.2130177021026611, "epoch": 1.2395997893628226, "grad_norm": 0.2500525414943695, "learning_rate": 0.00018999153620210122, "loss": 0.1909836232662201, "mean_token_accuracy": 0.9247071444988251, "num_tokens": 29037916.0, "step": 2354 }, { "entropy": 1.2663672864437103, "epoch": 1.2401263823064772, "grad_norm": 0.2888049781322479, "learning_rate": 0.00018998148397816918, "loss": 0.19668535888195038, "mean_token_accuracy": 0.9236019253730774, "num_tokens": 29050252.0, "step": 2355 }, { "entropy": 1.2552369832992554, "epoch": 1.2406529752501316, "grad_norm": 0.30252373218536377, "learning_rate": 0.00018997142700620257, "loss": 0.21202778816223145, "mean_token_accuracy": 0.9104820787906647, "num_tokens": 29062588.0, "step": 2356 }, { "entropy": 1.2437193095684052, "epoch": 1.2411795681937863, "grad_norm": 0.2685464322566986, "learning_rate": 0.0001899613652867985, "loss": 0.19783562421798706, "mean_token_accuracy": 0.9259221404790878, "num_tokens": 29074924.0, "step": 2357 }, { "entropy": 1.2458664774894714, "epoch": 1.2417061611374407, "grad_norm": 0.27750658988952637, "learning_rate": 0.00018995129882055418, "loss": 0.19608265161514282, "mean_token_accuracy": 0.9223610162734985, "num_tokens": 29087260.0, "step": 2358 }, { "entropy": 1.28984996676445, "epoch": 1.2422327540810953, "grad_norm": 0.3127368688583374, "learning_rate": 0.00018994122760806724, "loss": 0.2381632924079895, "mean_token_accuracy": 0.906804770231247, "num_tokens": 29099596.0, "step": 2359 }, { "entropy": 1.2786964178085327, "epoch": 1.2427593470247498, "grad_norm": 0.29435664415359497, "learning_rate": 0.00018993115164993556, "loss": 0.2056436836719513, "mean_token_accuracy": 0.9188906252384186, "num_tokens": 29111932.0, "step": 2360 }, { "entropy": 1.296678066253662, "epoch": 1.2432859399684044, "grad_norm": 0.2973683476448059, "learning_rate": 0.00018992107094675727, "loss": 0.21866685152053833, "mean_token_accuracy": 0.9110830724239349, "num_tokens": 29124268.0, "step": 2361 }, { "entropy": 1.2541703283786774, "epoch": 1.243812532912059, "grad_norm": 0.2897864580154419, "learning_rate": 0.00018991098549913084, "loss": 0.18205136060714722, "mean_token_accuracy": 0.9259398877620697, "num_tokens": 29136604.0, "step": 2362 }, { "entropy": 1.2319467067718506, "epoch": 1.2443391258557135, "grad_norm": 0.2912856638431549, "learning_rate": 0.00018990089530765493, "loss": 0.21475206315517426, "mean_token_accuracy": 0.9117068946361542, "num_tokens": 29148940.0, "step": 2363 }, { "entropy": 1.1983669102191925, "epoch": 1.2448657187993681, "grad_norm": 0.30084285140037537, "learning_rate": 0.00018989080037292856, "loss": 0.20513667166233063, "mean_token_accuracy": 0.9175577163696289, "num_tokens": 29161276.0, "step": 2364 }, { "entropy": 1.208276093006134, "epoch": 1.2453923117430226, "grad_norm": 0.28459402918815613, "learning_rate": 0.00018988070069555105, "loss": 0.20270894467830658, "mean_token_accuracy": 0.9216506034135818, "num_tokens": 29173612.0, "step": 2365 }, { "entropy": 1.1837323307991028, "epoch": 1.2459189046866772, "grad_norm": 0.27861863374710083, "learning_rate": 0.0001898705962761219, "loss": 0.19915355741977692, "mean_token_accuracy": 0.9196107387542725, "num_tokens": 29185948.0, "step": 2366 }, { "entropy": 1.1845957934856415, "epoch": 1.2464454976303316, "grad_norm": 0.28316664695739746, "learning_rate": 0.00018986048711524097, "loss": 0.21355314552783966, "mean_token_accuracy": 0.9129188060760498, "num_tokens": 29198284.0, "step": 2367 }, { "entropy": 1.1677678227424622, "epoch": 1.2469720905739863, "grad_norm": 0.3210926651954651, "learning_rate": 0.00018985037321350836, "loss": 0.20634154975414276, "mean_token_accuracy": 0.9156036972999573, "num_tokens": 29210620.0, "step": 2368 }, { "entropy": 1.2081373929977417, "epoch": 1.247498683517641, "grad_norm": 0.32751724123954773, "learning_rate": 0.00018984025457152452, "loss": 0.22158020734786987, "mean_token_accuracy": 0.9142793416976929, "num_tokens": 29222956.0, "step": 2369 }, { "entropy": 1.198670506477356, "epoch": 1.2480252764612954, "grad_norm": 0.3396313488483429, "learning_rate": 0.0001898301311898901, "loss": 0.22338370978832245, "mean_token_accuracy": 0.9130024313926697, "num_tokens": 29235292.0, "step": 2370 }, { "entropy": 1.187466412782669, "epoch": 1.24855186940495, "grad_norm": 0.330683171749115, "learning_rate": 0.00018982000306920607, "loss": 0.2252286970615387, "mean_token_accuracy": 0.9099649637937546, "num_tokens": 29247628.0, "step": 2371 }, { "entropy": 1.1201028525829315, "epoch": 1.2490784623486046, "grad_norm": 0.2788279950618744, "learning_rate": 0.00018980987021007372, "loss": 0.197609081864357, "mean_token_accuracy": 0.919813871383667, "num_tokens": 29259964.0, "step": 2372 }, { "entropy": 1.1749643087387085, "epoch": 1.249605055292259, "grad_norm": 0.27696964144706726, "learning_rate": 0.00018979973261309453, "loss": 0.19340327382087708, "mean_token_accuracy": 0.9178819060325623, "num_tokens": 29272300.0, "step": 2373 }, { "entropy": 1.171377807855606, "epoch": 1.2501316482359137, "grad_norm": 0.26827797293663025, "learning_rate": 0.0001897895902788703, "loss": 0.20257636904716492, "mean_token_accuracy": 0.9170994907617569, "num_tokens": 29284636.0, "step": 2374 }, { "entropy": 1.1583305597305298, "epoch": 1.2506582411795681, "grad_norm": 0.26647472381591797, "learning_rate": 0.00018977944320800315, "loss": 0.19090743362903595, "mean_token_accuracy": 0.9245351999998093, "num_tokens": 29296972.0, "step": 2375 }, { "entropy": 1.2192396521568298, "epoch": 1.2511848341232228, "grad_norm": 0.29227685928344727, "learning_rate": 0.00018976929140109542, "loss": 0.21741797029972076, "mean_token_accuracy": 0.911442294716835, "num_tokens": 29309308.0, "step": 2376 }, { "entropy": 1.120053082704544, "epoch": 1.2517114270668772, "grad_norm": 0.27130043506622314, "learning_rate": 0.00018975913485874983, "loss": 0.2002987265586853, "mean_token_accuracy": 0.9195822030305862, "num_tokens": 29321644.0, "step": 2377 }, { "entropy": 1.1931759715080261, "epoch": 1.2522380200105319, "grad_norm": 0.28110983967781067, "learning_rate": 0.00018974897358156926, "loss": 0.18119770288467407, "mean_token_accuracy": 0.921199381351471, "num_tokens": 29333980.0, "step": 2378 }, { "entropy": 1.1507650911808014, "epoch": 1.2527646129541865, "grad_norm": 0.3061140775680542, "learning_rate": 0.00018973880757015696, "loss": 0.20350392162799835, "mean_token_accuracy": 0.918747752904892, "num_tokens": 29346316.0, "step": 2379 }, { "entropy": 1.1738670468330383, "epoch": 1.253291205897841, "grad_norm": 0.27520132064819336, "learning_rate": 0.00018972863682511639, "loss": 0.19713857769966125, "mean_token_accuracy": 0.9176778495311737, "num_tokens": 29358652.0, "step": 2380 }, { "entropy": 1.1170638799667358, "epoch": 1.2538177988414956, "grad_norm": 0.28535959124565125, "learning_rate": 0.00018971846134705137, "loss": 0.21452412009239197, "mean_token_accuracy": 0.9095005989074707, "num_tokens": 29370988.0, "step": 2381 }, { "entropy": 1.1119027435779572, "epoch": 1.25434439178515, "grad_norm": 0.2742728888988495, "learning_rate": 0.00018970828113656593, "loss": 0.1901988387107849, "mean_token_accuracy": 0.921889141201973, "num_tokens": 29383324.0, "step": 2382 }, { "entropy": 1.0820831060409546, "epoch": 1.2548709847288047, "grad_norm": 0.28090232610702515, "learning_rate": 0.00018969809619426439, "loss": 0.19445692002773285, "mean_token_accuracy": 0.9170260429382324, "num_tokens": 29395660.0, "step": 2383 }, { "entropy": 1.055662214756012, "epoch": 1.255397577672459, "grad_norm": 0.27719929814338684, "learning_rate": 0.00018968790652075136, "loss": 0.1977691501379013, "mean_token_accuracy": 0.919326663017273, "num_tokens": 29407996.0, "step": 2384 }, { "entropy": 1.1013965904712677, "epoch": 1.2559241706161137, "grad_norm": 0.31086885929107666, "learning_rate": 0.00018967771211663182, "loss": 0.2363457977771759, "mean_token_accuracy": 0.906139463186264, "num_tokens": 29420332.0, "step": 2385 }, { "entropy": 1.090101808309555, "epoch": 1.2564507635597684, "grad_norm": 0.2687731087207794, "learning_rate": 0.00018966751298251093, "loss": 0.18311643600463867, "mean_token_accuracy": 0.9264214485883713, "num_tokens": 29432668.0, "step": 2386 }, { "entropy": 1.1113143563270569, "epoch": 1.2569773565034228, "grad_norm": 0.3031775951385498, "learning_rate": 0.0001896573091189941, "loss": 0.20669670403003693, "mean_token_accuracy": 0.9185007810592651, "num_tokens": 29445004.0, "step": 2387 }, { "entropy": 1.0604256093502045, "epoch": 1.2575039494470774, "grad_norm": 0.28647610545158386, "learning_rate": 0.00018964710052668714, "loss": 0.20895907282829285, "mean_token_accuracy": 0.9176440387964249, "num_tokens": 29457340.0, "step": 2388 }, { "entropy": 1.094488948583603, "epoch": 1.258030542390732, "grad_norm": 0.28277674317359924, "learning_rate": 0.000189636887206196, "loss": 0.1958828866481781, "mean_token_accuracy": 0.9168824553489685, "num_tokens": 29469676.0, "step": 2389 }, { "entropy": 1.0930402874946594, "epoch": 1.2585571353343865, "grad_norm": 0.3038513660430908, "learning_rate": 0.00018962666915812702, "loss": 0.22608797252178192, "mean_token_accuracy": 0.9073146730661392, "num_tokens": 29482012.0, "step": 2390 }, { "entropy": 1.090045154094696, "epoch": 1.259083728278041, "grad_norm": 0.27166202664375305, "learning_rate": 0.00018961644638308683, "loss": 0.1975858360528946, "mean_token_accuracy": 0.9241401851177216, "num_tokens": 29494348.0, "step": 2391 }, { "entropy": 1.0796633809804916, "epoch": 1.2596103212216956, "grad_norm": 0.2842889130115509, "learning_rate": 0.00018960621888168224, "loss": 0.19585753977298737, "mean_token_accuracy": 0.9207384586334229, "num_tokens": 29506684.0, "step": 2392 }, { "entropy": 1.1113807559013367, "epoch": 1.2601369141653502, "grad_norm": 0.27799156308174133, "learning_rate": 0.00018959598665452043, "loss": 0.20170974731445312, "mean_token_accuracy": 0.9220674335956573, "num_tokens": 29519020.0, "step": 2393 }, { "entropy": 1.1154912114143372, "epoch": 1.2606635071090047, "grad_norm": 0.2918773889541626, "learning_rate": 0.0001895857497022088, "loss": 0.2008930742740631, "mean_token_accuracy": 0.9212677925825119, "num_tokens": 29531356.0, "step": 2394 }, { "entropy": 1.0571572482585907, "epoch": 1.2611901000526593, "grad_norm": 0.28213104605674744, "learning_rate": 0.00018957550802535503, "loss": 0.21011856198310852, "mean_token_accuracy": 0.9190024733543396, "num_tokens": 29543692.0, "step": 2395 }, { "entropy": 1.0876768827438354, "epoch": 1.261716692996314, "grad_norm": 0.3166556656360626, "learning_rate": 0.00018956526162456722, "loss": 0.21292051672935486, "mean_token_accuracy": 0.9117415696382523, "num_tokens": 29556028.0, "step": 2396 }, { "entropy": 1.1123850643634796, "epoch": 1.2622432859399684, "grad_norm": 0.3177889585494995, "learning_rate": 0.00018955501050045353, "loss": 0.21554914116859436, "mean_token_accuracy": 0.9117074012756348, "num_tokens": 29568364.0, "step": 2397 }, { "entropy": 1.121145874261856, "epoch": 1.262769878883623, "grad_norm": 0.28797921538352966, "learning_rate": 0.00018954475465362256, "loss": 0.2110595405101776, "mean_token_accuracy": 0.910643994808197, "num_tokens": 29580700.0, "step": 2398 }, { "entropy": 1.081002026796341, "epoch": 1.2632964718272774, "grad_norm": 0.2767108678817749, "learning_rate": 0.00018953449408468312, "loss": 0.20874468982219696, "mean_token_accuracy": 0.916566014289856, "num_tokens": 29593036.0, "step": 2399 }, { "entropy": 1.0670734643936157, "epoch": 1.263823064770932, "grad_norm": 0.2667304277420044, "learning_rate": 0.00018952422879424437, "loss": 0.21136702597141266, "mean_token_accuracy": 0.915779709815979, "num_tokens": 29605372.0, "step": 2400 }, { "entropy": 1.1176138818264008, "epoch": 1.2643496577145865, "grad_norm": 0.28897732496261597, "learning_rate": 0.0001895139587829156, "loss": 0.20740735530853271, "mean_token_accuracy": 0.9172630310058594, "num_tokens": 29617708.0, "step": 2401 }, { "entropy": 1.0523147583007812, "epoch": 1.2648762506582412, "grad_norm": 0.28087154030799866, "learning_rate": 0.00018950368405130653, "loss": 0.20881010591983795, "mean_token_accuracy": 0.9143330603837967, "num_tokens": 29630044.0, "step": 2402 }, { "entropy": 1.073082596063614, "epoch": 1.2654028436018958, "grad_norm": 0.2673327624797821, "learning_rate": 0.00018949340460002717, "loss": 0.20516178011894226, "mean_token_accuracy": 0.9163246154785156, "num_tokens": 29642380.0, "step": 2403 }, { "entropy": 0.9944493472576141, "epoch": 1.2659294365455502, "grad_norm": 0.23029980063438416, "learning_rate": 0.00018948312042968768, "loss": 0.18642765283584595, "mean_token_accuracy": 0.9236330091953278, "num_tokens": 29654716.0, "step": 2404 }, { "entropy": 1.0669757723808289, "epoch": 1.2664560294892049, "grad_norm": 0.26822593808174133, "learning_rate": 0.0001894728315408986, "loss": 0.20285025238990784, "mean_token_accuracy": 0.9172052592039108, "num_tokens": 29667052.0, "step": 2405 }, { "entropy": 1.0667217671871185, "epoch": 1.2669826224328595, "grad_norm": 0.28592145442962646, "learning_rate": 0.00018946253793427075, "loss": 0.21876372396945953, "mean_token_accuracy": 0.9099210351705551, "num_tokens": 29679388.0, "step": 2406 }, { "entropy": 1.0617501437664032, "epoch": 1.267509215376514, "grad_norm": 0.2814294099807739, "learning_rate": 0.0001894522396104151, "loss": 0.21466723084449768, "mean_token_accuracy": 0.9166467934846878, "num_tokens": 29691724.0, "step": 2407 }, { "entropy": 1.0295425057411194, "epoch": 1.2680358083201684, "grad_norm": 0.2818832993507385, "learning_rate": 0.0001894419365699431, "loss": 0.2018805742263794, "mean_token_accuracy": 0.9214745163917542, "num_tokens": 29704060.0, "step": 2408 }, { "entropy": 0.9962182641029358, "epoch": 1.268562401263823, "grad_norm": 0.2606944441795349, "learning_rate": 0.00018943162881346633, "loss": 0.20163223147392273, "mean_token_accuracy": 0.9152373224496841, "num_tokens": 29716396.0, "step": 2409 }, { "entropy": 1.0103175342082977, "epoch": 1.2690889942074777, "grad_norm": 0.2832614779472351, "learning_rate": 0.00018942131634159672, "loss": 0.20267333090305328, "mean_token_accuracy": 0.917528048157692, "num_tokens": 29728732.0, "step": 2410 }, { "entropy": 1.030224397778511, "epoch": 1.269615587151132, "grad_norm": 0.28863924741744995, "learning_rate": 0.00018941099915494646, "loss": 0.20709314942359924, "mean_token_accuracy": 0.9195363223552704, "num_tokens": 29741068.0, "step": 2411 }, { "entropy": 0.9850256592035294, "epoch": 1.2701421800947867, "grad_norm": 0.33532777428627014, "learning_rate": 0.00018940067725412807, "loss": 0.22378413379192352, "mean_token_accuracy": 0.9103842526674271, "num_tokens": 29753404.0, "step": 2412 }, { "entropy": 0.9951465576887131, "epoch": 1.2706687730384414, "grad_norm": 0.2885618209838867, "learning_rate": 0.0001893903506397542, "loss": 0.20284360647201538, "mean_token_accuracy": 0.9174323529005051, "num_tokens": 29765740.0, "step": 2413 }, { "entropy": 0.9759911596775055, "epoch": 1.2711953659820958, "grad_norm": 0.30822882056236267, "learning_rate": 0.00018938001931243797, "loss": 0.21964068710803986, "mean_token_accuracy": 0.9072186797857285, "num_tokens": 29778076.0, "step": 2414 }, { "entropy": 0.9762609899044037, "epoch": 1.2717219589257505, "grad_norm": 0.2687565088272095, "learning_rate": 0.00018936968327279264, "loss": 0.17709898948669434, "mean_token_accuracy": 0.9282322078943253, "num_tokens": 29790412.0, "step": 2415 }, { "entropy": 0.9670789986848831, "epoch": 1.2722485518694049, "grad_norm": 0.28542351722717285, "learning_rate": 0.00018935934252143182, "loss": 0.1963491588830948, "mean_token_accuracy": 0.9188527315855026, "num_tokens": 29802748.0, "step": 2416 }, { "entropy": 0.9343395233154297, "epoch": 1.2727751448130595, "grad_norm": 0.28767991065979004, "learning_rate": 0.00018934899705896937, "loss": 0.2048400342464447, "mean_token_accuracy": 0.9184893816709518, "num_tokens": 29815084.0, "step": 2417 }, { "entropy": 0.965802863240242, "epoch": 1.273301737756714, "grad_norm": 0.2734317481517792, "learning_rate": 0.00018933864688601946, "loss": 0.19449257850646973, "mean_token_accuracy": 0.9198505729436874, "num_tokens": 29827420.0, "step": 2418 }, { "entropy": 0.9207088947296143, "epoch": 1.2738283307003686, "grad_norm": 0.28382739424705505, "learning_rate": 0.00018932829200319647, "loss": 0.21684856712818146, "mean_token_accuracy": 0.9112024903297424, "num_tokens": 29839756.0, "step": 2419 }, { "entropy": 0.9559458643198013, "epoch": 1.2743549236440233, "grad_norm": 0.26874884963035583, "learning_rate": 0.00018931793241111519, "loss": 0.200919508934021, "mean_token_accuracy": 0.9189273715019226, "num_tokens": 29852092.0, "step": 2420 }, { "entropy": 0.956595167517662, "epoch": 1.2748815165876777, "grad_norm": 0.2639332115650177, "learning_rate": 0.0001893075681103905, "loss": 0.18435338139533997, "mean_token_accuracy": 0.9255244880914688, "num_tokens": 29864428.0, "step": 2421 }, { "entropy": 0.9653457999229431, "epoch": 1.2754081095313323, "grad_norm": 0.2683272659778595, "learning_rate": 0.0001892971991016378, "loss": 0.19316944479942322, "mean_token_accuracy": 0.9227836430072784, "num_tokens": 29876764.0, "step": 2422 }, { "entropy": 0.9717456251382828, "epoch": 1.275934702474987, "grad_norm": 0.2988039553165436, "learning_rate": 0.00018928682538547252, "loss": 0.2070363163948059, "mean_token_accuracy": 0.9153457581996918, "num_tokens": 29889100.0, "step": 2423 }, { "entropy": 0.968423455953598, "epoch": 1.2764612954186414, "grad_norm": 0.2866435647010803, "learning_rate": 0.0001892764469625106, "loss": 0.22353532910346985, "mean_token_accuracy": 0.9065069407224655, "num_tokens": 29901436.0, "step": 2424 }, { "entropy": 1.0139219462871552, "epoch": 1.2769878883622958, "grad_norm": 0.3166240155696869, "learning_rate": 0.000189266063833368, "loss": 0.21094951033592224, "mean_token_accuracy": 0.9138725250959396, "num_tokens": 29913772.0, "step": 2425 }, { "entropy": 0.9436186701059341, "epoch": 1.2775144813059505, "grad_norm": 0.266792893409729, "learning_rate": 0.00018925567599866123, "loss": 0.1921631246805191, "mean_token_accuracy": 0.923053190112114, "num_tokens": 29926108.0, "step": 2426 }, { "entropy": 0.9432852864265442, "epoch": 1.2780410742496051, "grad_norm": 0.27570202946662903, "learning_rate": 0.00018924528345900689, "loss": 0.20491164922714233, "mean_token_accuracy": 0.9194526821374893, "num_tokens": 29938444.0, "step": 2427 }, { "entropy": 1.0146455764770508, "epoch": 1.2785676671932595, "grad_norm": 0.3002910614013672, "learning_rate": 0.00018923488621502198, "loss": 0.21310178935527802, "mean_token_accuracy": 0.9097048193216324, "num_tokens": 29950780.0, "step": 2428 }, { "entropy": 0.9136994779109955, "epoch": 1.2790942601369142, "grad_norm": 0.2668123245239258, "learning_rate": 0.0001892244842673237, "loss": 0.19984757900238037, "mean_token_accuracy": 0.9176211655139923, "num_tokens": 29963116.0, "step": 2429 }, { "entropy": 0.9539975225925446, "epoch": 1.2796208530805688, "grad_norm": 0.27499574422836304, "learning_rate": 0.0001892140776165295, "loss": 0.19691187143325806, "mean_token_accuracy": 0.9206452816724777, "num_tokens": 29975452.0, "step": 2430 }, { "entropy": 0.9451378732919693, "epoch": 1.2801474460242233, "grad_norm": 0.26354870200157166, "learning_rate": 0.00018920366626325722, "loss": 0.19863781332969666, "mean_token_accuracy": 0.9141591340303421, "num_tokens": 29987788.0, "step": 2431 }, { "entropy": 0.9598711580038071, "epoch": 1.280674038967878, "grad_norm": 0.27625903487205505, "learning_rate": 0.00018919325020812493, "loss": 0.18384377658367157, "mean_token_accuracy": 0.9277281761169434, "num_tokens": 30000124.0, "step": 2432 }, { "entropy": 0.9703495502471924, "epoch": 1.2812006319115323, "grad_norm": 0.23485948145389557, "learning_rate": 0.00018918282945175091, "loss": 0.16364209353923798, "mean_token_accuracy": 0.9334625601768494, "num_tokens": 30012460.0, "step": 2433 }, { "entropy": 0.9682765752077103, "epoch": 1.281727224855187, "grad_norm": 0.28086769580841064, "learning_rate": 0.00018917240399475387, "loss": 0.20836037397384644, "mean_token_accuracy": 0.9150678068399429, "num_tokens": 30024796.0, "step": 2434 }, { "entropy": 0.9923833310604095, "epoch": 1.2822538177988414, "grad_norm": 0.2846622169017792, "learning_rate": 0.00018916197383775263, "loss": 0.19592522084712982, "mean_token_accuracy": 0.9235945791006088, "num_tokens": 30037132.0, "step": 2435 }, { "entropy": 0.9900262653827667, "epoch": 1.282780410742496, "grad_norm": 0.2638978958129883, "learning_rate": 0.00018915153898136638, "loss": 0.20760269463062286, "mean_token_accuracy": 0.9165667444467545, "num_tokens": 30049468.0, "step": 2436 }, { "entropy": 0.9972607046365738, "epoch": 1.2833070036861507, "grad_norm": 0.2679845988750458, "learning_rate": 0.0001891410994262146, "loss": 0.21356555819511414, "mean_token_accuracy": 0.9128797203302383, "num_tokens": 30061804.0, "step": 2437 }, { "entropy": 1.0473797023296356, "epoch": 1.2838335966298051, "grad_norm": 0.29876357316970825, "learning_rate": 0.000189130655172917, "loss": 0.1855165660381317, "mean_token_accuracy": 0.9234071522951126, "num_tokens": 30074140.0, "step": 2438 }, { "entropy": 1.0313687026500702, "epoch": 1.2843601895734598, "grad_norm": 0.3158549666404724, "learning_rate": 0.00018912020622209363, "loss": 0.19452282786369324, "mean_token_accuracy": 0.9206828027963638, "num_tokens": 30086476.0, "step": 2439 }, { "entropy": 1.0512953251600266, "epoch": 1.2848867825171142, "grad_norm": 0.289561927318573, "learning_rate": 0.00018910975257436477, "loss": 0.21705621480941772, "mean_token_accuracy": 0.9130683243274689, "num_tokens": 30098812.0, "step": 2440 }, { "entropy": 1.0579238533973694, "epoch": 1.2854133754607688, "grad_norm": 0.27795788645744324, "learning_rate": 0.00018909929423035097, "loss": 0.1992982029914856, "mean_token_accuracy": 0.9181873351335526, "num_tokens": 30111148.0, "step": 2441 }, { "entropy": 1.053389072418213, "epoch": 1.2859399684044233, "grad_norm": 0.2999892830848694, "learning_rate": 0.00018908883119067314, "loss": 0.1986619383096695, "mean_token_accuracy": 0.9188312739133835, "num_tokens": 30123484.0, "step": 2442 }, { "entropy": 1.055832028388977, "epoch": 1.286466561348078, "grad_norm": 0.31872841715812683, "learning_rate": 0.00018907836345595234, "loss": 0.22551697492599487, "mean_token_accuracy": 0.9126669466495514, "num_tokens": 30135820.0, "step": 2443 }, { "entropy": 1.0761081874370575, "epoch": 1.2869931542917326, "grad_norm": 0.28309813141822815, "learning_rate": 0.00018906789102680996, "loss": 0.20621955394744873, "mean_token_accuracy": 0.9136619865894318, "num_tokens": 30148156.0, "step": 2444 }, { "entropy": 1.0669479370117188, "epoch": 1.287519747235387, "grad_norm": 0.2921207845211029, "learning_rate": 0.0001890574139038678, "loss": 0.19345825910568237, "mean_token_accuracy": 0.9210665971040726, "num_tokens": 30160492.0, "step": 2445 }, { "entropy": 1.082845777273178, "epoch": 1.2880463401790416, "grad_norm": 0.3050430715084076, "learning_rate": 0.00018904693208774773, "loss": 0.20412419736385345, "mean_token_accuracy": 0.9169301390647888, "num_tokens": 30172828.0, "step": 2446 }, { "entropy": 1.037044733762741, "epoch": 1.2885729331226963, "grad_norm": 0.2966107130050659, "learning_rate": 0.00018903644557907202, "loss": 0.2055833488702774, "mean_token_accuracy": 0.9147552996873856, "num_tokens": 30185164.0, "step": 2447 }, { "entropy": 1.0677853226661682, "epoch": 1.2890995260663507, "grad_norm": 0.2843310534954071, "learning_rate": 0.0001890259543784632, "loss": 0.21242734789848328, "mean_token_accuracy": 0.9103299677371979, "num_tokens": 30197500.0, "step": 2448 }, { "entropy": 1.077808290719986, "epoch": 1.2896261190100053, "grad_norm": 0.3029589056968689, "learning_rate": 0.00018901545848654406, "loss": 0.21383321285247803, "mean_token_accuracy": 0.9146206676959991, "num_tokens": 30209836.0, "step": 2449 }, { "entropy": 1.067981243133545, "epoch": 1.2901527119536598, "grad_norm": 0.26611074805259705, "learning_rate": 0.0001890049579039377, "loss": 0.2002156376838684, "mean_token_accuracy": 0.9168877750635147, "num_tokens": 30222172.0, "step": 2450 }, { "entropy": 1.0742313861846924, "epoch": 1.2906793048973144, "grad_norm": 0.310247540473938, "learning_rate": 0.00018899445263126748, "loss": 0.20398539304733276, "mean_token_accuracy": 0.914374902844429, "num_tokens": 30234508.0, "step": 2451 }, { "entropy": 1.0848418474197388, "epoch": 1.2912058978409688, "grad_norm": 0.2897074818611145, "learning_rate": 0.000188983942669157, "loss": 0.19188785552978516, "mean_token_accuracy": 0.9222336858510971, "num_tokens": 30246844.0, "step": 2452 }, { "entropy": 1.1648883521556854, "epoch": 1.2917324907846235, "grad_norm": 0.3317052125930786, "learning_rate": 0.00018897342801823017, "loss": 0.21206307411193848, "mean_token_accuracy": 0.9162902683019638, "num_tokens": 30259180.0, "step": 2453 }, { "entropy": 1.089240550994873, "epoch": 1.2922590837282781, "grad_norm": 0.29545658826828003, "learning_rate": 0.00018896290867911124, "loss": 0.224837988615036, "mean_token_accuracy": 0.9070383608341217, "num_tokens": 30271516.0, "step": 2454 }, { "entropy": 1.0672079622745514, "epoch": 1.2927856766719326, "grad_norm": 0.28104934096336365, "learning_rate": 0.00018895238465242465, "loss": 0.18683423101902008, "mean_token_accuracy": 0.9193482846021652, "num_tokens": 30283852.0, "step": 2455 }, { "entropy": 1.109650194644928, "epoch": 1.2933122696155872, "grad_norm": 0.30402952432632446, "learning_rate": 0.00018894185593879513, "loss": 0.21138614416122437, "mean_token_accuracy": 0.9192399084568024, "num_tokens": 30296188.0, "step": 2456 }, { "entropy": 1.0995548069477081, "epoch": 1.2938388625592416, "grad_norm": 0.2972696125507355, "learning_rate": 0.00018893132253884777, "loss": 0.21770839393138885, "mean_token_accuracy": 0.9064899533987045, "num_tokens": 30308524.0, "step": 2457 }, { "entropy": 1.0900613367557526, "epoch": 1.2943654555028963, "grad_norm": 0.29551947116851807, "learning_rate": 0.00018892078445320785, "loss": 0.22550401091575623, "mean_token_accuracy": 0.9079246073961258, "num_tokens": 30320860.0, "step": 2458 }, { "entropy": 1.0972884893417358, "epoch": 1.2948920484465507, "grad_norm": 0.29107943177223206, "learning_rate": 0.0001889102416825009, "loss": 0.20210495591163635, "mean_token_accuracy": 0.918797492980957, "num_tokens": 30333196.0, "step": 2459 }, { "entropy": 1.1345873475074768, "epoch": 1.2954186413902053, "grad_norm": 0.2670139968395233, "learning_rate": 0.00018889969422735282, "loss": 0.2063610702753067, "mean_token_accuracy": 0.9150100499391556, "num_tokens": 30345532.0, "step": 2460 }, { "entropy": 1.1534136831760406, "epoch": 1.29594523433386, "grad_norm": 0.2725052535533905, "learning_rate": 0.00018888914208838977, "loss": 0.20247100293636322, "mean_token_accuracy": 0.9132510721683502, "num_tokens": 30357868.0, "step": 2461 }, { "entropy": 1.1401869356632233, "epoch": 1.2964718272775144, "grad_norm": 0.27257704734802246, "learning_rate": 0.00018887858526623816, "loss": 0.20108935236930847, "mean_token_accuracy": 0.9205031096935272, "num_tokens": 30370204.0, "step": 2462 }, { "entropy": 1.1363012492656708, "epoch": 1.296998420221169, "grad_norm": 0.25703343749046326, "learning_rate": 0.00018886802376152467, "loss": 0.1905408352613449, "mean_token_accuracy": 0.9216178208589554, "num_tokens": 30382540.0, "step": 2463 }, { "entropy": 1.1291438043117523, "epoch": 1.2975250131648237, "grad_norm": 0.26567402482032776, "learning_rate": 0.00018885745757487633, "loss": 0.2002328634262085, "mean_token_accuracy": 0.9188759624958038, "num_tokens": 30394876.0, "step": 2464 }, { "entropy": 1.1460005939006805, "epoch": 1.2980516061084781, "grad_norm": 0.2740042805671692, "learning_rate": 0.0001888468867069203, "loss": 0.2134706676006317, "mean_token_accuracy": 0.9186908006668091, "num_tokens": 30407212.0, "step": 2465 }, { "entropy": 1.1675595045089722, "epoch": 1.2985781990521326, "grad_norm": 0.27058151364326477, "learning_rate": 0.0001888363111582842, "loss": 0.20257370173931122, "mean_token_accuracy": 0.9163499921560287, "num_tokens": 30419548.0, "step": 2466 }, { "entropy": 1.129315197467804, "epoch": 1.2991047919957872, "grad_norm": 0.2428874373435974, "learning_rate": 0.00018882573092959576, "loss": 0.19501042366027832, "mean_token_accuracy": 0.9155511409044266, "num_tokens": 30431884.0, "step": 2467 }, { "entropy": 1.1659575700759888, "epoch": 1.2996313849394419, "grad_norm": 0.2721167504787445, "learning_rate": 0.00018881514602148313, "loss": 0.19770276546478271, "mean_token_accuracy": 0.9158978760242462, "num_tokens": 30444220.0, "step": 2468 }, { "entropy": 1.112877070903778, "epoch": 1.3001579778830963, "grad_norm": 0.2472962588071823, "learning_rate": 0.00018880455643457465, "loss": 0.19223164021968842, "mean_token_accuracy": 0.924824669957161, "num_tokens": 30456556.0, "step": 2469 }, { "entropy": 1.1800079345703125, "epoch": 1.300684570826751, "grad_norm": 0.2697281837463379, "learning_rate": 0.00018879396216949895, "loss": 0.1964273303747177, "mean_token_accuracy": 0.9209067970514297, "num_tokens": 30468892.0, "step": 2470 }, { "entropy": 1.163857877254486, "epoch": 1.3012111637704056, "grad_norm": 0.3045770227909088, "learning_rate": 0.00018878336322688494, "loss": 0.22345393896102905, "mean_token_accuracy": 0.9061350077390671, "num_tokens": 30481228.0, "step": 2471 }, { "entropy": 1.14396533370018, "epoch": 1.30173775671406, "grad_norm": 0.28983190655708313, "learning_rate": 0.0001887727596073619, "loss": 0.22206184267997742, "mean_token_accuracy": 0.9082365930080414, "num_tokens": 30493564.0, "step": 2472 }, { "entropy": 1.1775724589824677, "epoch": 1.3022643496577146, "grad_norm": 0.2802092432975769, "learning_rate": 0.0001887621513115592, "loss": 0.18831028044223785, "mean_token_accuracy": 0.9222876578569412, "num_tokens": 30505900.0, "step": 2473 }, { "entropy": 1.1594789624214172, "epoch": 1.302790942601369, "grad_norm": 0.28708985447883606, "learning_rate": 0.00018875153834010665, "loss": 0.19792331755161285, "mean_token_accuracy": 0.9184091091156006, "num_tokens": 30518236.0, "step": 2474 }, { "entropy": 1.1835083365440369, "epoch": 1.3033175355450237, "grad_norm": 0.2943269610404968, "learning_rate": 0.00018874092069363427, "loss": 0.2158336043357849, "mean_token_accuracy": 0.9099272340536118, "num_tokens": 30530572.0, "step": 2475 }, { "entropy": 1.1280877888202667, "epoch": 1.3038441284886781, "grad_norm": 0.29678258299827576, "learning_rate": 0.00018873029837277236, "loss": 0.2089228481054306, "mean_token_accuracy": 0.9140326231718063, "num_tokens": 30542908.0, "step": 2476 }, { "entropy": 1.1274373829364777, "epoch": 1.3043707214323328, "grad_norm": 0.2565828561782837, "learning_rate": 0.0001887196713781515, "loss": 0.1824226826429367, "mean_token_accuracy": 0.9261182844638824, "num_tokens": 30555244.0, "step": 2477 }, { "entropy": 1.1345534920692444, "epoch": 1.3048973143759874, "grad_norm": 0.29827621579170227, "learning_rate": 0.0001887090397104026, "loss": 0.20668740570545197, "mean_token_accuracy": 0.9158112704753876, "num_tokens": 30567580.0, "step": 2478 }, { "entropy": 1.1208145916461945, "epoch": 1.3054239073196419, "grad_norm": 0.31276044249534607, "learning_rate": 0.00018869840337015675, "loss": 0.2087455838918686, "mean_token_accuracy": 0.9144948124885559, "num_tokens": 30579916.0, "step": 2479 }, { "entropy": 1.153564065694809, "epoch": 1.3059505002632965, "grad_norm": 0.29550793766975403, "learning_rate": 0.00018868776235804536, "loss": 0.213548481464386, "mean_token_accuracy": 0.9138739556074142, "num_tokens": 30592252.0, "step": 2480 }, { "entropy": 1.1374950110912323, "epoch": 1.3064770932069512, "grad_norm": 0.27735957503318787, "learning_rate": 0.00018867711667470017, "loss": 0.19929325580596924, "mean_token_accuracy": 0.9164140969514847, "num_tokens": 30604588.0, "step": 2481 }, { "entropy": 1.1209405362606049, "epoch": 1.3070036861506056, "grad_norm": 0.2788814902305603, "learning_rate": 0.0001886664663207531, "loss": 0.21787486970424652, "mean_token_accuracy": 0.9160508364439011, "num_tokens": 30616924.0, "step": 2482 }, { "entropy": 1.1751077771186829, "epoch": 1.30753027909426, "grad_norm": 0.27281054854393005, "learning_rate": 0.00018865581129683644, "loss": 0.20231208205223083, "mean_token_accuracy": 0.9140424728393555, "num_tokens": 30629260.0, "step": 2483 }, { "entropy": 1.1451273262500763, "epoch": 1.3080568720379147, "grad_norm": 0.2548876404762268, "learning_rate": 0.00018864515160358272, "loss": 0.20404735207557678, "mean_token_accuracy": 0.9158653914928436, "num_tokens": 30641596.0, "step": 2484 }, { "entropy": 1.223433405160904, "epoch": 1.3085834649815693, "grad_norm": 0.28999221324920654, "learning_rate": 0.0001886344872416247, "loss": 0.21280592679977417, "mean_token_accuracy": 0.908152237534523, "num_tokens": 30653932.0, "step": 2485 }, { "entropy": 1.2113437056541443, "epoch": 1.3091100579252237, "grad_norm": 0.2526291012763977, "learning_rate": 0.00018862381821159552, "loss": 0.18035513162612915, "mean_token_accuracy": 0.9277927577495575, "num_tokens": 30666268.0, "step": 2486 }, { "entropy": 1.2897081971168518, "epoch": 1.3096366508688784, "grad_norm": 0.2631675899028778, "learning_rate": 0.0001886131445141285, "loss": 0.2015797197818756, "mean_token_accuracy": 0.918338343501091, "num_tokens": 30678604.0, "step": 2487 }, { "entropy": 1.2078757286071777, "epoch": 1.310163243812533, "grad_norm": 0.24873696267604828, "learning_rate": 0.00018860246614985725, "loss": 0.18720902502536774, "mean_token_accuracy": 0.9217247664928436, "num_tokens": 30690940.0, "step": 2488 }, { "entropy": 1.2295198142528534, "epoch": 1.3106898367561874, "grad_norm": 0.27777987718582153, "learning_rate": 0.00018859178311941575, "loss": 0.21630996465682983, "mean_token_accuracy": 0.9144271612167358, "num_tokens": 30703276.0, "step": 2489 }, { "entropy": 1.2049448788166046, "epoch": 1.311216429699842, "grad_norm": 0.26715347170829773, "learning_rate": 0.00018858109542343814, "loss": 0.19998157024383545, "mean_token_accuracy": 0.9232079237699509, "num_tokens": 30715612.0, "step": 2490 }, { "entropy": 1.1993949711322784, "epoch": 1.3117430226434965, "grad_norm": 0.2785743474960327, "learning_rate": 0.00018857040306255888, "loss": 0.20864132046699524, "mean_token_accuracy": 0.9150129109621048, "num_tokens": 30727948.0, "step": 2491 }, { "entropy": 1.197268307209015, "epoch": 1.3122696155871512, "grad_norm": 0.29957106709480286, "learning_rate": 0.0001885597060374128, "loss": 0.2152678519487381, "mean_token_accuracy": 0.9146653860807419, "num_tokens": 30740284.0, "step": 2492 }, { "entropy": 1.1922446489334106, "epoch": 1.3127962085308056, "grad_norm": 0.31052011251449585, "learning_rate": 0.00018854900434863477, "loss": 0.20205189287662506, "mean_token_accuracy": 0.9173094034194946, "num_tokens": 30752620.0, "step": 2493 }, { "entropy": 1.1869801878929138, "epoch": 1.3133228014744602, "grad_norm": 0.2926376760005951, "learning_rate": 0.0001885382979968602, "loss": 0.21089938282966614, "mean_token_accuracy": 0.9158413708209991, "num_tokens": 30764956.0, "step": 2494 }, { "entropy": 1.132896363735199, "epoch": 1.3138493944181149, "grad_norm": 0.27938100695610046, "learning_rate": 0.00018852758698272465, "loss": 0.1964457780122757, "mean_token_accuracy": 0.9246141463518143, "num_tokens": 30777292.0, "step": 2495 }, { "entropy": 1.2086142599582672, "epoch": 1.3143759873617693, "grad_norm": 0.28923818469047546, "learning_rate": 0.00018851687130686396, "loss": 0.2008797824382782, "mean_token_accuracy": 0.916870579123497, "num_tokens": 30789628.0, "step": 2496 }, { "entropy": 1.1438094079494476, "epoch": 1.314902580305424, "grad_norm": 0.2761872708797455, "learning_rate": 0.00018850615096991424, "loss": 0.19743943214416504, "mean_token_accuracy": 0.9220564365386963, "num_tokens": 30801964.0, "step": 2497 }, { "entropy": 1.1207115054130554, "epoch": 1.3154291732490786, "grad_norm": 0.2810716927051544, "learning_rate": 0.0001884954259725119, "loss": 0.20330996811389923, "mean_token_accuracy": 0.9163385629653931, "num_tokens": 30814300.0, "step": 2498 }, { "entropy": 1.1683085262775421, "epoch": 1.315955766192733, "grad_norm": 0.2724354565143585, "learning_rate": 0.00018848469631529364, "loss": 0.18855315446853638, "mean_token_accuracy": 0.9251711666584015, "num_tokens": 30826636.0, "step": 2499 }, { "entropy": 1.1003861129283905, "epoch": 1.3164823591363874, "grad_norm": 0.2779734432697296, "learning_rate": 0.00018847396199889638, "loss": 0.20665448904037476, "mean_token_accuracy": 0.9169312715530396, "num_tokens": 30838972.0, "step": 2500 }, { "entropy": 1.1359674334526062, "epoch": 1.317008952080042, "grad_norm": 0.28787779808044434, "learning_rate": 0.0001884632230239574, "loss": 0.19744256138801575, "mean_token_accuracy": 0.9244921803474426, "num_tokens": 30851308.0, "step": 2501 }, { "entropy": 1.1084416806697845, "epoch": 1.3175355450236967, "grad_norm": 0.2643449306488037, "learning_rate": 0.00018845247939111418, "loss": 0.19814109802246094, "mean_token_accuracy": 0.9191816598176956, "num_tokens": 30863644.0, "step": 2502 }, { "entropy": 1.1480841636657715, "epoch": 1.3180621379673512, "grad_norm": 0.2745157778263092, "learning_rate": 0.00018844173110100452, "loss": 0.20436102151870728, "mean_token_accuracy": 0.9175873845815659, "num_tokens": 30875980.0, "step": 2503 }, { "entropy": 1.168861299753189, "epoch": 1.3185887309110058, "grad_norm": 0.28558439016342163, "learning_rate": 0.00018843097815426644, "loss": 0.19720155000686646, "mean_token_accuracy": 0.921770378947258, "num_tokens": 30888316.0, "step": 2504 }, { "entropy": 1.1487717032432556, "epoch": 1.3191153238546605, "grad_norm": 0.252396821975708, "learning_rate": 0.00018842022055153837, "loss": 0.18812143802642822, "mean_token_accuracy": 0.9198298454284668, "num_tokens": 30900652.0, "step": 2505 }, { "entropy": 1.0874556303024292, "epoch": 1.3196419167983149, "grad_norm": 0.27975741028785706, "learning_rate": 0.00018840945829345885, "loss": 0.19726543128490448, "mean_token_accuracy": 0.9175487458705902, "num_tokens": 30912988.0, "step": 2506 }, { "entropy": 1.0931753516197205, "epoch": 1.3201685097419695, "grad_norm": 0.2753717005252838, "learning_rate": 0.0001883986913806668, "loss": 0.19207552075386047, "mean_token_accuracy": 0.9233367294073105, "num_tokens": 30925324.0, "step": 2507 }, { "entropy": 1.0678606629371643, "epoch": 1.320695102685624, "grad_norm": 0.2772499620914459, "learning_rate": 0.00018838791981380136, "loss": 0.20343419909477234, "mean_token_accuracy": 0.9183335304260254, "num_tokens": 30937660.0, "step": 2508 }, { "entropy": 1.0918059051036835, "epoch": 1.3212216956292786, "grad_norm": 0.29579028487205505, "learning_rate": 0.00018837714359350201, "loss": 0.2152230143547058, "mean_token_accuracy": 0.9208053946495056, "num_tokens": 30949996.0, "step": 2509 }, { "entropy": 1.0503469556570053, "epoch": 1.321748288572933, "grad_norm": 0.2653261423110962, "learning_rate": 0.0001883663627204085, "loss": 0.1930423229932785, "mean_token_accuracy": 0.9191714227199554, "num_tokens": 30962332.0, "step": 2510 }, { "entropy": 1.1172581315040588, "epoch": 1.3222748815165877, "grad_norm": 0.3529946208000183, "learning_rate": 0.00018835557719516078, "loss": 0.22693800926208496, "mean_token_accuracy": 0.9077934175729752, "num_tokens": 30974668.0, "step": 2511 }, { "entropy": 1.0955396890640259, "epoch": 1.3228014744602423, "grad_norm": 0.2981196343898773, "learning_rate": 0.0001883447870183991, "loss": 0.19838613271713257, "mean_token_accuracy": 0.9167172312736511, "num_tokens": 30987004.0, "step": 2512 }, { "entropy": 1.0746179521083832, "epoch": 1.3233280674038967, "grad_norm": 0.30476272106170654, "learning_rate": 0.00018833399219076407, "loss": 0.21524569392204285, "mean_token_accuracy": 0.9110986590385437, "num_tokens": 30999340.0, "step": 2513 }, { "entropy": 1.1119599342346191, "epoch": 1.3238546603475514, "grad_norm": 0.3129141628742218, "learning_rate": 0.00018832319271289646, "loss": 0.20734190940856934, "mean_token_accuracy": 0.9160514175891876, "num_tokens": 31011676.0, "step": 2514 }, { "entropy": 1.0783126950263977, "epoch": 1.3243812532912058, "grad_norm": 0.2936292588710785, "learning_rate": 0.00018831238858543742, "loss": 0.20680686831474304, "mean_token_accuracy": 0.9129305332899094, "num_tokens": 31024012.0, "step": 2515 }, { "entropy": 1.0885819494724274, "epoch": 1.3249078462348605, "grad_norm": 0.29339733719825745, "learning_rate": 0.00018830157980902833, "loss": 0.20416975021362305, "mean_token_accuracy": 0.9174858927726746, "num_tokens": 31036348.0, "step": 2516 }, { "entropy": 1.1106742322444916, "epoch": 1.325434439178515, "grad_norm": 0.3055555522441864, "learning_rate": 0.00018829076638431078, "loss": 0.2278045117855072, "mean_token_accuracy": 0.9134476184844971, "num_tokens": 31048684.0, "step": 2517 }, { "entropy": 1.1332001090049744, "epoch": 1.3259610321221695, "grad_norm": 0.27308133244514465, "learning_rate": 0.00018827994831192675, "loss": 0.19392089545726776, "mean_token_accuracy": 0.9187697917222977, "num_tokens": 31061020.0, "step": 2518 }, { "entropy": 1.196645975112915, "epoch": 1.3264876250658242, "grad_norm": 0.3041642904281616, "learning_rate": 0.00018826912559251848, "loss": 0.23238268494606018, "mean_token_accuracy": 0.9100022912025452, "num_tokens": 31073356.0, "step": 2519 }, { "entropy": 1.1595803797245026, "epoch": 1.3270142180094786, "grad_norm": 0.2854364812374115, "learning_rate": 0.00018825829822672837, "loss": 0.21763843297958374, "mean_token_accuracy": 0.911407396197319, "num_tokens": 31085692.0, "step": 2520 }, { "entropy": 1.1426350474357605, "epoch": 1.3275408109531333, "grad_norm": 0.26290595531463623, "learning_rate": 0.00018824746621519923, "loss": 0.18908298015594482, "mean_token_accuracy": 0.9210202246904373, "num_tokens": 31098028.0, "step": 2521 }, { "entropy": 1.1872995793819427, "epoch": 1.328067403896788, "grad_norm": 0.2785587012767792, "learning_rate": 0.00018823662955857407, "loss": 0.20560133457183838, "mean_token_accuracy": 0.9162561148405075, "num_tokens": 31110364.0, "step": 2522 }, { "entropy": 1.1389261186122894, "epoch": 1.3285939968404423, "grad_norm": 0.2547476291656494, "learning_rate": 0.00018822578825749623, "loss": 0.20492050051689148, "mean_token_accuracy": 0.9174861460924149, "num_tokens": 31122700.0, "step": 2523 }, { "entropy": 1.1379226744174957, "epoch": 1.329120589784097, "grad_norm": 0.2671321630477905, "learning_rate": 0.0001882149423126093, "loss": 0.21442070603370667, "mean_token_accuracy": 0.916014552116394, "num_tokens": 31135036.0, "step": 2524 }, { "entropy": 1.1240211725234985, "epoch": 1.3296471827277514, "grad_norm": 0.28270992636680603, "learning_rate": 0.00018820409172455707, "loss": 0.20910367369651794, "mean_token_accuracy": 0.9152929037809372, "num_tokens": 31147372.0, "step": 2525 }, { "entropy": 1.126050055027008, "epoch": 1.330173775671406, "grad_norm": 0.2661881148815155, "learning_rate": 0.00018819323649398373, "loss": 0.19098810851573944, "mean_token_accuracy": 0.9209559559822083, "num_tokens": 31159708.0, "step": 2526 }, { "entropy": 1.1266259253025055, "epoch": 1.3307003686150605, "grad_norm": 0.2929874658584595, "learning_rate": 0.0001881823766215337, "loss": 0.20036344230175018, "mean_token_accuracy": 0.9238387793302536, "num_tokens": 31172044.0, "step": 2527 }, { "entropy": 1.0866254270076752, "epoch": 1.3312269615587151, "grad_norm": 0.28896623849868774, "learning_rate": 0.00018817151210785162, "loss": 0.18842336535453796, "mean_token_accuracy": 0.9209622591733932, "num_tokens": 31184380.0, "step": 2528 }, { "entropy": 1.1249730587005615, "epoch": 1.3317535545023698, "grad_norm": 0.2872648537158966, "learning_rate": 0.0001881606429535825, "loss": 0.22201552987098694, "mean_token_accuracy": 0.9108192026615143, "num_tokens": 31196716.0, "step": 2529 }, { "entropy": 1.0949527323246002, "epoch": 1.3322801474460242, "grad_norm": 0.2851123511791229, "learning_rate": 0.0001881497691593716, "loss": 0.1967121958732605, "mean_token_accuracy": 0.9210963398218155, "num_tokens": 31209052.0, "step": 2530 }, { "entropy": 1.1146687865257263, "epoch": 1.3328067403896788, "grad_norm": 0.3102349638938904, "learning_rate": 0.00018813889072586434, "loss": 0.23011735081672668, "mean_token_accuracy": 0.9073590189218521, "num_tokens": 31221388.0, "step": 2531 }, { "entropy": 1.0698721408843994, "epoch": 1.3333333333333333, "grad_norm": 0.2832903563976288, "learning_rate": 0.0001881280076537066, "loss": 0.1880122423171997, "mean_token_accuracy": 0.9258202612400055, "num_tokens": 31233724.0, "step": 2532 }, { "entropy": 1.1224130392074585, "epoch": 1.333859926276988, "grad_norm": 0.2848287522792816, "learning_rate": 0.0001881171199435444, "loss": 0.19834977388381958, "mean_token_accuracy": 0.9168813228607178, "num_tokens": 31246060.0, "step": 2533 }, { "entropy": 1.1105233430862427, "epoch": 1.3343865192206423, "grad_norm": 0.3011896014213562, "learning_rate": 0.0001881062275960241, "loss": 0.22225533425807953, "mean_token_accuracy": 0.9092197567224503, "num_tokens": 31258396.0, "step": 2534 }, { "entropy": 1.0629687905311584, "epoch": 1.334913112164297, "grad_norm": 0.2885998785495758, "learning_rate": 0.0001880953306117923, "loss": 0.2081342339515686, "mean_token_accuracy": 0.9201711565256119, "num_tokens": 31270732.0, "step": 2535 }, { "entropy": 1.0981874465942383, "epoch": 1.3354397051079516, "grad_norm": 0.2881809175014496, "learning_rate": 0.0001880844289914959, "loss": 0.20444408059120178, "mean_token_accuracy": 0.9140055626630783, "num_tokens": 31283068.0, "step": 2536 }, { "entropy": 1.0878173410892487, "epoch": 1.335966298051606, "grad_norm": 0.2887677252292633, "learning_rate": 0.00018807352273578204, "loss": 0.20989957451820374, "mean_token_accuracy": 0.9208216220140457, "num_tokens": 31295404.0, "step": 2537 }, { "entropy": 1.1007463037967682, "epoch": 1.3364928909952607, "grad_norm": 0.2962489426136017, "learning_rate": 0.0001880626118452982, "loss": 0.20988334715366364, "mean_token_accuracy": 0.9117045700550079, "num_tokens": 31307740.0, "step": 2538 }, { "entropy": 1.1124551892280579, "epoch": 1.3370194839389153, "grad_norm": 0.2889869809150696, "learning_rate": 0.00018805169632069206, "loss": 0.22036269307136536, "mean_token_accuracy": 0.9166446030139923, "num_tokens": 31320076.0, "step": 2539 }, { "entropy": 1.0473781377077103, "epoch": 1.3375460768825698, "grad_norm": 0.28756895661354065, "learning_rate": 0.00018804077616261166, "loss": 0.20982427895069122, "mean_token_accuracy": 0.9156763106584549, "num_tokens": 31332412.0, "step": 2540 }, { "entropy": 1.0588495880365372, "epoch": 1.3380726698262242, "grad_norm": 0.2706986665725708, "learning_rate": 0.00018802985137170522, "loss": 0.2128053605556488, "mean_token_accuracy": 0.9166304022073746, "num_tokens": 31344748.0, "step": 2541 }, { "entropy": 1.075078159570694, "epoch": 1.3385992627698788, "grad_norm": 0.2772495746612549, "learning_rate": 0.0001880189219486213, "loss": 0.1886967122554779, "mean_token_accuracy": 0.9169599562883377, "num_tokens": 31357084.0, "step": 2542 }, { "entropy": 1.0650361776351929, "epoch": 1.3391258557135335, "grad_norm": 0.3137603998184204, "learning_rate": 0.0001880079878940087, "loss": 0.20629137754440308, "mean_token_accuracy": 0.919654980301857, "num_tokens": 31369420.0, "step": 2543 }, { "entropy": 1.0738177597522736, "epoch": 1.339652448657188, "grad_norm": 0.2894216775894165, "learning_rate": 0.00018799704920851652, "loss": 0.22449420392513275, "mean_token_accuracy": 0.9042561650276184, "num_tokens": 31381756.0, "step": 2544 }, { "entropy": 1.0527926087379456, "epoch": 1.3401790416008426, "grad_norm": 0.2740827202796936, "learning_rate": 0.00018798610589279417, "loss": 0.203867569565773, "mean_token_accuracy": 0.9112063497304916, "num_tokens": 31394092.0, "step": 2545 }, { "entropy": 1.0129956007003784, "epoch": 1.3407056345444972, "grad_norm": 0.2815206050872803, "learning_rate": 0.00018797515794749122, "loss": 0.18543724715709686, "mean_token_accuracy": 0.9268083721399307, "num_tokens": 31406428.0, "step": 2546 }, { "entropy": 1.032931998372078, "epoch": 1.3412322274881516, "grad_norm": 0.2881038784980774, "learning_rate": 0.00018796420537325762, "loss": 0.21719786524772644, "mean_token_accuracy": 0.918227955698967, "num_tokens": 31418764.0, "step": 2547 }, { "entropy": 1.0120973587036133, "epoch": 1.3417588204318063, "grad_norm": 0.27740973234176636, "learning_rate": 0.00018795324817074354, "loss": 0.18840999901294708, "mean_token_accuracy": 0.922258198261261, "num_tokens": 31431100.0, "step": 2548 }, { "entropy": 1.0631686747074127, "epoch": 1.3422854133754607, "grad_norm": 0.3168363869190216, "learning_rate": 0.0001879422863405995, "loss": 0.21135640144348145, "mean_token_accuracy": 0.9179410338401794, "num_tokens": 31443436.0, "step": 2549 }, { "entropy": 1.0500916242599487, "epoch": 1.3428120063191153, "grad_norm": 0.29962658882141113, "learning_rate": 0.00018793131988347617, "loss": 0.2103479504585266, "mean_token_accuracy": 0.9147076457738876, "num_tokens": 31455772.0, "step": 2550 }, { "entropy": 1.0350684523582458, "epoch": 1.3433385992627698, "grad_norm": 0.2993636727333069, "learning_rate": 0.0001879203488000246, "loss": 0.2143697738647461, "mean_token_accuracy": 0.9145818799734116, "num_tokens": 31468108.0, "step": 2551 }, { "entropy": 1.0683605670928955, "epoch": 1.3438651922064244, "grad_norm": 0.31891852617263794, "learning_rate": 0.0001879093730908961, "loss": 0.2051960527896881, "mean_token_accuracy": 0.9145154505968094, "num_tokens": 31480444.0, "step": 2552 }, { "entropy": 1.0360463559627533, "epoch": 1.344391785150079, "grad_norm": 0.29179492592811584, "learning_rate": 0.0001878983927567422, "loss": 0.2059982270002365, "mean_token_accuracy": 0.9194035530090332, "num_tokens": 31492780.0, "step": 2553 }, { "entropy": 1.093918263912201, "epoch": 1.3449183780937335, "grad_norm": 0.3079806864261627, "learning_rate": 0.0001878874077982147, "loss": 0.21530432999134064, "mean_token_accuracy": 0.9130852967500687, "num_tokens": 31505116.0, "step": 2554 }, { "entropy": 1.1094603836536407, "epoch": 1.3454449710373881, "grad_norm": 0.2917912006378174, "learning_rate": 0.00018787641821596583, "loss": 0.2050892859697342, "mean_token_accuracy": 0.9154047220945358, "num_tokens": 31517452.0, "step": 2555 }, { "entropy": 1.1357096135616302, "epoch": 1.3459715639810428, "grad_norm": 0.27194029092788696, "learning_rate": 0.00018786542401064789, "loss": 0.18924210965633392, "mean_token_accuracy": 0.9251724630594254, "num_tokens": 31529788.0, "step": 2556 }, { "entropy": 1.1269418597221375, "epoch": 1.3464981569246972, "grad_norm": 0.26160678267478943, "learning_rate": 0.00018785442518291353, "loss": 0.20647940039634705, "mean_token_accuracy": 0.9157357662916183, "num_tokens": 31542124.0, "step": 2557 }, { "entropy": 1.1875733733177185, "epoch": 1.3470247498683516, "grad_norm": 0.2644807696342468, "learning_rate": 0.00018784342173341575, "loss": 0.1932739019393921, "mean_token_accuracy": 0.9194819778203964, "num_tokens": 31554460.0, "step": 2558 }, { "entropy": 1.1785165071487427, "epoch": 1.3475513428120063, "grad_norm": 0.27935707569122314, "learning_rate": 0.00018783241366280773, "loss": 0.2223643660545349, "mean_token_accuracy": 0.9112606793642044, "num_tokens": 31566796.0, "step": 2559 }, { "entropy": 1.1744961738586426, "epoch": 1.348077935755661, "grad_norm": 0.272098183631897, "learning_rate": 0.0001878214009717429, "loss": 0.2064208835363388, "mean_token_accuracy": 0.9138854891061783, "num_tokens": 31579132.0, "step": 2560 }, { "entropy": 1.1525810956954956, "epoch": 1.3486045286993154, "grad_norm": 0.2795564532279968, "learning_rate": 0.00018781038366087513, "loss": 0.20882105827331543, "mean_token_accuracy": 0.9144481867551804, "num_tokens": 31591468.0, "step": 2561 }, { "entropy": 1.104248732328415, "epoch": 1.34913112164297, "grad_norm": 0.23773279786109924, "learning_rate": 0.00018779936173085837, "loss": 0.18065296113491058, "mean_token_accuracy": 0.9290421605110168, "num_tokens": 31603804.0, "step": 2562 }, { "entropy": 1.1595117151737213, "epoch": 1.3496577145866246, "grad_norm": 0.2747121751308441, "learning_rate": 0.00018778833518234698, "loss": 0.20582349598407745, "mean_token_accuracy": 0.912534311413765, "num_tokens": 31616140.0, "step": 2563 }, { "entropy": 1.155326247215271, "epoch": 1.350184307530279, "grad_norm": 0.2732286751270294, "learning_rate": 0.00018777730401599549, "loss": 0.19955134391784668, "mean_token_accuracy": 0.9210360944271088, "num_tokens": 31628476.0, "step": 2564 }, { "entropy": 1.1245983242988586, "epoch": 1.3507109004739337, "grad_norm": 0.24134601652622223, "learning_rate": 0.00018776626823245878, "loss": 0.18833664059638977, "mean_token_accuracy": 0.9211855530738831, "num_tokens": 31640812.0, "step": 2565 }, { "entropy": 1.1322357952594757, "epoch": 1.3512374934175881, "grad_norm": 0.27595973014831543, "learning_rate": 0.00018775522783239198, "loss": 0.20659556984901428, "mean_token_accuracy": 0.921311542391777, "num_tokens": 31653148.0, "step": 2566 }, { "entropy": 1.1415637731552124, "epoch": 1.3517640863612428, "grad_norm": 0.2799292802810669, "learning_rate": 0.00018774418281645053, "loss": 0.18609049916267395, "mean_token_accuracy": 0.9205182492733002, "num_tokens": 31665484.0, "step": 2567 }, { "entropy": 1.099078118801117, "epoch": 1.3522906793048972, "grad_norm": 0.356923907995224, "learning_rate": 0.00018773313318529, "loss": 0.20763400197029114, "mean_token_accuracy": 0.9158278256654739, "num_tokens": 31677820.0, "step": 2568 }, { "entropy": 1.1672882437705994, "epoch": 1.3528172722485519, "grad_norm": 0.323013573884964, "learning_rate": 0.00018772207893956647, "loss": 0.229105606675148, "mean_token_accuracy": 0.9055341184139252, "num_tokens": 31690156.0, "step": 2569 }, { "entropy": 1.129069447517395, "epoch": 1.3533438651922065, "grad_norm": 0.28814175724983215, "learning_rate": 0.00018771102007993613, "loss": 0.21873462200164795, "mean_token_accuracy": 0.9137783348560333, "num_tokens": 31702492.0, "step": 2570 }, { "entropy": 1.1057601869106293, "epoch": 1.353870458135861, "grad_norm": 0.27318117022514343, "learning_rate": 0.00018769995660705542, "loss": 0.21677207946777344, "mean_token_accuracy": 0.9136002212762833, "num_tokens": 31714828.0, "step": 2571 }, { "entropy": 1.1042208969593048, "epoch": 1.3543970510795156, "grad_norm": 0.28476253151893616, "learning_rate": 0.0001876888885215812, "loss": 0.20920810103416443, "mean_token_accuracy": 0.9151055365800858, "num_tokens": 31727164.0, "step": 2572 }, { "entropy": 1.133261263370514, "epoch": 1.3549236440231702, "grad_norm": 0.2653651237487793, "learning_rate": 0.00018767781582417043, "loss": 0.1804226189851761, "mean_token_accuracy": 0.9289367198944092, "num_tokens": 31739500.0, "step": 2573 }, { "entropy": 1.1577132642269135, "epoch": 1.3554502369668247, "grad_norm": 0.27154141664505005, "learning_rate": 0.00018766673851548047, "loss": 0.18820011615753174, "mean_token_accuracy": 0.9214843064546585, "num_tokens": 31751836.0, "step": 2574 }, { "entropy": 1.1380637884140015, "epoch": 1.355976829910479, "grad_norm": 0.2832103371620178, "learning_rate": 0.00018765565659616896, "loss": 0.2163006067276001, "mean_token_accuracy": 0.9146066755056381, "num_tokens": 31764172.0, "step": 2575 }, { "entropy": 1.171122670173645, "epoch": 1.3565034228541337, "grad_norm": 0.29119494557380676, "learning_rate": 0.00018764457006689372, "loss": 0.1951453536748886, "mean_token_accuracy": 0.916601300239563, "num_tokens": 31776508.0, "step": 2576 }, { "entropy": 1.1506705582141876, "epoch": 1.3570300157977884, "grad_norm": 0.28178977966308594, "learning_rate": 0.0001876334789283129, "loss": 0.21672406792640686, "mean_token_accuracy": 0.9112057536840439, "num_tokens": 31788844.0, "step": 2577 }, { "entropy": 1.1319689452648163, "epoch": 1.3575566087414428, "grad_norm": 0.31361258029937744, "learning_rate": 0.0001876223831810849, "loss": 0.23558440804481506, "mean_token_accuracy": 0.9097436219453812, "num_tokens": 31801180.0, "step": 2578 }, { "entropy": 1.1845204532146454, "epoch": 1.3580832016850974, "grad_norm": 0.2968812882900238, "learning_rate": 0.00018761128282586843, "loss": 0.20870262384414673, "mean_token_accuracy": 0.9157723784446716, "num_tokens": 31813516.0, "step": 2579 }, { "entropy": 1.1385733485221863, "epoch": 1.358609794628752, "grad_norm": 0.283302366733551, "learning_rate": 0.00018760017786332247, "loss": 0.20222227275371552, "mean_token_accuracy": 0.9147961437702179, "num_tokens": 31825852.0, "step": 2580 }, { "entropy": 1.1306065320968628, "epoch": 1.3591363875724065, "grad_norm": 0.3002590537071228, "learning_rate": 0.0001875890682941062, "loss": 0.23286172747612, "mean_token_accuracy": 0.9055652320384979, "num_tokens": 31838188.0, "step": 2581 }, { "entropy": 1.1369206607341766, "epoch": 1.3596629805160612, "grad_norm": 0.2827116847038269, "learning_rate": 0.00018757795411887922, "loss": 0.20414981245994568, "mean_token_accuracy": 0.9247657358646393, "num_tokens": 31850524.0, "step": 2582 }, { "entropy": 1.182368516921997, "epoch": 1.3601895734597156, "grad_norm": 0.2734077572822571, "learning_rate": 0.00018756683533830123, "loss": 0.18725436925888062, "mean_token_accuracy": 0.9269359111785889, "num_tokens": 31862860.0, "step": 2583 }, { "entropy": 1.1202270686626434, "epoch": 1.3607161664033702, "grad_norm": 0.27396515011787415, "learning_rate": 0.00018755571195303234, "loss": 0.19522534310817719, "mean_token_accuracy": 0.9229871332645416, "num_tokens": 31875196.0, "step": 2584 }, { "entropy": 1.1103180348873138, "epoch": 1.3612427593470247, "grad_norm": 0.27679014205932617, "learning_rate": 0.00018754458396373286, "loss": 0.1996929943561554, "mean_token_accuracy": 0.9204212427139282, "num_tokens": 31887532.0, "step": 2585 }, { "entropy": 1.1616276800632477, "epoch": 1.3617693522906793, "grad_norm": 0.29670003056526184, "learning_rate": 0.00018753345137106336, "loss": 0.23619894683361053, "mean_token_accuracy": 0.9007562100887299, "num_tokens": 31899868.0, "step": 2586 }, { "entropy": 1.1399752795696259, "epoch": 1.362295945234334, "grad_norm": 0.2779025435447693, "learning_rate": 0.0001875223141756848, "loss": 0.20615586638450623, "mean_token_accuracy": 0.9151979237794876, "num_tokens": 31912204.0, "step": 2587 }, { "entropy": 1.167212337255478, "epoch": 1.3628225381779884, "grad_norm": 0.2890734076499939, "learning_rate": 0.00018751117237825825, "loss": 0.20611752569675446, "mean_token_accuracy": 0.9171196669340134, "num_tokens": 31924540.0, "step": 2588 }, { "entropy": 1.126388281583786, "epoch": 1.363349131121643, "grad_norm": 0.27933791279792786, "learning_rate": 0.00018750002597944516, "loss": 0.20168091356754303, "mean_token_accuracy": 0.9160471111536026, "num_tokens": 31936876.0, "step": 2589 }, { "entropy": 1.1319892406463623, "epoch": 1.3638757240652974, "grad_norm": 0.28239932656288147, "learning_rate": 0.00018748887497990727, "loss": 0.20251701772212982, "mean_token_accuracy": 0.917927622795105, "num_tokens": 31949212.0, "step": 2590 }, { "entropy": 1.1169626712799072, "epoch": 1.364402317008952, "grad_norm": 0.280332088470459, "learning_rate": 0.00018747771938030648, "loss": 0.18491880595684052, "mean_token_accuracy": 0.9226613193750381, "num_tokens": 31961548.0, "step": 2591 }, { "entropy": 1.1182208061218262, "epoch": 1.3649289099526065, "grad_norm": 0.2557113766670227, "learning_rate": 0.00018746655918130506, "loss": 0.17858107388019562, "mean_token_accuracy": 0.9297724813222885, "num_tokens": 31973884.0, "step": 2592 }, { "entropy": 1.1194300055503845, "epoch": 1.3654555028962612, "grad_norm": 0.29216471314430237, "learning_rate": 0.00018745539438356557, "loss": 0.20672905445098877, "mean_token_accuracy": 0.9149999022483826, "num_tokens": 31986220.0, "step": 2593 }, { "entropy": 1.1690471470355988, "epoch": 1.3659820958399158, "grad_norm": 0.29650187492370605, "learning_rate": 0.00018744422498775072, "loss": 0.22313809394836426, "mean_token_accuracy": 0.9091308563947678, "num_tokens": 31998556.0, "step": 2594 }, { "entropy": 1.1421934366226196, "epoch": 1.3665086887835702, "grad_norm": 0.2731371521949768, "learning_rate": 0.0001874330509945236, "loss": 0.19944173097610474, "mean_token_accuracy": 0.9169053733348846, "num_tokens": 32010892.0, "step": 2595 }, { "entropy": 1.143957257270813, "epoch": 1.3670352817272249, "grad_norm": 0.3047042787075043, "learning_rate": 0.00018742187240454762, "loss": 0.20404207706451416, "mean_token_accuracy": 0.9194851368665695, "num_tokens": 32023228.0, "step": 2596 }, { "entropy": 1.1393778026103973, "epoch": 1.3675618746708795, "grad_norm": 0.30072396993637085, "learning_rate": 0.00018741068921848626, "loss": 0.2037821114063263, "mean_token_accuracy": 0.9212421625852585, "num_tokens": 32035564.0, "step": 2597 }, { "entropy": 1.139537751674652, "epoch": 1.368088467614534, "grad_norm": 0.3391966223716736, "learning_rate": 0.00018739950143700348, "loss": 0.19885693490505219, "mean_token_accuracy": 0.9235148131847382, "num_tokens": 32047900.0, "step": 2598 }, { "entropy": 1.1805144548416138, "epoch": 1.3686150605581886, "grad_norm": 0.2925131022930145, "learning_rate": 0.00018738830906076342, "loss": 0.20037105679512024, "mean_token_accuracy": 0.9239792376756668, "num_tokens": 32060236.0, "step": 2599 }, { "entropy": 1.185164213180542, "epoch": 1.369141653501843, "grad_norm": 0.2835521996021271, "learning_rate": 0.00018737711209043054, "loss": 0.20223882794380188, "mean_token_accuracy": 0.917163297533989, "num_tokens": 32072572.0, "step": 2600 }, { "entropy": 1.157685101032257, "epoch": 1.3696682464454977, "grad_norm": 0.27268749475479126, "learning_rate": 0.00018736591052666946, "loss": 0.1903955042362213, "mean_token_accuracy": 0.9194441586732864, "num_tokens": 32084908.0, "step": 2601 }, { "entropy": 1.2693307399749756, "epoch": 1.370194839389152, "grad_norm": 0.28890320658683777, "learning_rate": 0.00018735470437014523, "loss": 0.20518316328525543, "mean_token_accuracy": 0.9177209436893463, "num_tokens": 32097244.0, "step": 2602 }, { "entropy": 1.2482496500015259, "epoch": 1.3707214323328067, "grad_norm": 0.30512097477912903, "learning_rate": 0.00018734349362152305, "loss": 0.21335013210773468, "mean_token_accuracy": 0.9146852493286133, "num_tokens": 32109580.0, "step": 2603 }, { "entropy": 1.2782647907733917, "epoch": 1.3712480252764614, "grad_norm": 0.29834169149398804, "learning_rate": 0.0001873322782814684, "loss": 0.2050481140613556, "mean_token_accuracy": 0.9144423753023148, "num_tokens": 32121916.0, "step": 2604 }, { "entropy": 1.2587519884109497, "epoch": 1.3717746182201158, "grad_norm": 0.28562498092651367, "learning_rate": 0.00018732105835064715, "loss": 0.19426429271697998, "mean_token_accuracy": 0.920745924115181, "num_tokens": 32134252.0, "step": 2605 }, { "entropy": 1.2290140092372894, "epoch": 1.3723012111637705, "grad_norm": 0.30887603759765625, "learning_rate": 0.00018730983382972535, "loss": 0.23400862514972687, "mean_token_accuracy": 0.9006239920854568, "num_tokens": 32146588.0, "step": 2606 }, { "entropy": 1.2600108683109283, "epoch": 1.3728278041074249, "grad_norm": 0.3018042743206024, "learning_rate": 0.00018729860471936927, "loss": 0.2075652927160263, "mean_token_accuracy": 0.9155648052692413, "num_tokens": 32158924.0, "step": 2607 }, { "entropy": 1.2218706607818604, "epoch": 1.3733543970510795, "grad_norm": 0.29793429374694824, "learning_rate": 0.00018728737102024557, "loss": 0.219403937458992, "mean_token_accuracy": 0.9094530642032623, "num_tokens": 32171260.0, "step": 2608 }, { "entropy": 1.3601875305175781, "epoch": 1.373880989994734, "grad_norm": 0.32878509163856506, "learning_rate": 0.00018727613273302114, "loss": 0.21100544929504395, "mean_token_accuracy": 0.9185794442892075, "num_tokens": 32183596.0, "step": 2609 }, { "entropy": 1.2661290764808655, "epoch": 1.3744075829383886, "grad_norm": 0.27767306566238403, "learning_rate": 0.0001872648898583631, "loss": 0.22158057987689972, "mean_token_accuracy": 0.9131675958633423, "num_tokens": 32195932.0, "step": 2610 }, { "entropy": 1.2464967370033264, "epoch": 1.3749341758820433, "grad_norm": 0.2783961892127991, "learning_rate": 0.00018725364239693888, "loss": 0.193161278963089, "mean_token_accuracy": 0.9226386845111847, "num_tokens": 32208268.0, "step": 2611 }, { "entropy": 1.2675247490406036, "epoch": 1.3754607688256977, "grad_norm": 0.2909803092479706, "learning_rate": 0.00018724239034941618, "loss": 0.2184634506702423, "mean_token_accuracy": 0.9100800156593323, "num_tokens": 32220604.0, "step": 2612 }, { "entropy": 1.223971039056778, "epoch": 1.3759873617693523, "grad_norm": 0.2707139551639557, "learning_rate": 0.00018723113371646295, "loss": 0.1935388147830963, "mean_token_accuracy": 0.9257960468530655, "num_tokens": 32232940.0, "step": 2613 }, { "entropy": 1.2640557885169983, "epoch": 1.376513954713007, "grad_norm": 0.257673978805542, "learning_rate": 0.00018721987249874746, "loss": 0.17373917996883392, "mean_token_accuracy": 0.9268936216831207, "num_tokens": 32245276.0, "step": 2614 }, { "entropy": 1.260954111814499, "epoch": 1.3770405476566614, "grad_norm": 0.2596103847026825, "learning_rate": 0.00018720860669693823, "loss": 0.19530557096004486, "mean_token_accuracy": 0.9233595281839371, "num_tokens": 32257612.0, "step": 2615 }, { "entropy": 1.2570489048957825, "epoch": 1.3775671406003158, "grad_norm": 0.2871362268924713, "learning_rate": 0.000187197336311704, "loss": 0.21668970584869385, "mean_token_accuracy": 0.9106542319059372, "num_tokens": 32269948.0, "step": 2616 }, { "entropy": 1.2458524703979492, "epoch": 1.3780937335439705, "grad_norm": 0.29486218094825745, "learning_rate": 0.00018718606134371385, "loss": 0.21607458591461182, "mean_token_accuracy": 0.9180518984794617, "num_tokens": 32282284.0, "step": 2617 }, { "entropy": 1.1982189416885376, "epoch": 1.3786203264876251, "grad_norm": 0.266152560710907, "learning_rate": 0.00018717478179363715, "loss": 0.1885453462600708, "mean_token_accuracy": 0.920305460691452, "num_tokens": 32294620.0, "step": 2618 }, { "entropy": 1.1810212433338165, "epoch": 1.3791469194312795, "grad_norm": 0.34556058049201965, "learning_rate": 0.00018716349766214344, "loss": 0.2133154273033142, "mean_token_accuracy": 0.9144544005393982, "num_tokens": 32306956.0, "step": 2619 }, { "entropy": 1.1619344651699066, "epoch": 1.3796735123749342, "grad_norm": 0.27238133549690247, "learning_rate": 0.0001871522089499026, "loss": 0.18257702887058258, "mean_token_accuracy": 0.926590159535408, "num_tokens": 32319292.0, "step": 2620 }, { "entropy": 1.1952409446239471, "epoch": 1.3802001053185888, "grad_norm": 0.29954856634140015, "learning_rate": 0.0001871409156575848, "loss": 0.19620761275291443, "mean_token_accuracy": 0.9240281283855438, "num_tokens": 32331628.0, "step": 2621 }, { "entropy": 1.1484823524951935, "epoch": 1.3807266982622433, "grad_norm": 0.2953477203845978, "learning_rate": 0.00018712961778586046, "loss": 0.1918509304523468, "mean_token_accuracy": 0.9219135642051697, "num_tokens": 32343964.0, "step": 2622 }, { "entropy": 1.1857792735099792, "epoch": 1.381253291205898, "grad_norm": 0.29551708698272705, "learning_rate": 0.00018711831533540024, "loss": 0.1936018168926239, "mean_token_accuracy": 0.9209873676300049, "num_tokens": 32356300.0, "step": 2623 }, { "entropy": 1.1783287823200226, "epoch": 1.3817798841495523, "grad_norm": 0.3080747127532959, "learning_rate": 0.00018710700830687515, "loss": 0.20185130834579468, "mean_token_accuracy": 0.9161763191223145, "num_tokens": 32368636.0, "step": 2624 }, { "entropy": 1.1695483326911926, "epoch": 1.382306477093207, "grad_norm": 0.3095219135284424, "learning_rate": 0.00018709569670095636, "loss": 0.21143102645874023, "mean_token_accuracy": 0.9149758964776993, "num_tokens": 32380972.0, "step": 2625 }, { "entropy": 1.1955194175243378, "epoch": 1.3828330700368614, "grad_norm": 0.2797792851924896, "learning_rate": 0.00018708438051831544, "loss": 0.19557036459445953, "mean_token_accuracy": 0.921556681394577, "num_tokens": 32393308.0, "step": 2626 }, { "entropy": 1.204679548740387, "epoch": 1.383359662980516, "grad_norm": 0.2982284128665924, "learning_rate": 0.0001870730597596241, "loss": 0.19409126043319702, "mean_token_accuracy": 0.9241613745689392, "num_tokens": 32405644.0, "step": 2627 }, { "entropy": 1.2394556403160095, "epoch": 1.3838862559241707, "grad_norm": 0.27367693185806274, "learning_rate": 0.00018706173442555445, "loss": 0.19036509096622467, "mean_token_accuracy": 0.9197610020637512, "num_tokens": 32417980.0, "step": 2628 }, { "entropy": 1.1927104592323303, "epoch": 1.3844128488678251, "grad_norm": 0.2765471935272217, "learning_rate": 0.00018705040451677874, "loss": 0.19922952353954315, "mean_token_accuracy": 0.9253708273172379, "num_tokens": 32430316.0, "step": 2629 }, { "entropy": 1.192032277584076, "epoch": 1.3849394418114798, "grad_norm": 0.2959486246109009, "learning_rate": 0.0001870390700339696, "loss": 0.21350061893463135, "mean_token_accuracy": 0.915240153670311, "num_tokens": 32442652.0, "step": 2630 }, { "entropy": 1.21938955783844, "epoch": 1.3854660347551344, "grad_norm": 0.2759414613246918, "learning_rate": 0.00018702773097779992, "loss": 0.20076552033424377, "mean_token_accuracy": 0.9171973913908005, "num_tokens": 32454988.0, "step": 2631 }, { "entropy": 1.1680685877799988, "epoch": 1.3859926276987888, "grad_norm": 0.23211334645748138, "learning_rate": 0.00018701638734894277, "loss": 0.16931575536727905, "mean_token_accuracy": 0.9348405301570892, "num_tokens": 32467324.0, "step": 2632 }, { "entropy": 1.2244385778903961, "epoch": 1.3865192206424433, "grad_norm": 0.3211120367050171, "learning_rate": 0.0001870050391480716, "loss": 0.22183112800121307, "mean_token_accuracy": 0.9124436974525452, "num_tokens": 32479660.0, "step": 2633 }, { "entropy": 1.1737190783023834, "epoch": 1.387045813586098, "grad_norm": 0.29617705941200256, "learning_rate": 0.00018699368637586008, "loss": 0.22190259397029877, "mean_token_accuracy": 0.9131051301956177, "num_tokens": 32491996.0, "step": 2634 }, { "entropy": 1.217042326927185, "epoch": 1.3875724065297526, "grad_norm": 0.32766997814178467, "learning_rate": 0.00018698232903298215, "loss": 0.19216807186603546, "mean_token_accuracy": 0.9217599779367447, "num_tokens": 32504332.0, "step": 2635 }, { "entropy": 1.2256495356559753, "epoch": 1.388098999473407, "grad_norm": 0.286161333322525, "learning_rate": 0.00018697096712011203, "loss": 0.1934540718793869, "mean_token_accuracy": 0.9223566651344299, "num_tokens": 32516668.0, "step": 2636 }, { "entropy": 1.1700023114681244, "epoch": 1.3886255924170616, "grad_norm": 0.2702758014202118, "learning_rate": 0.00018695960063792421, "loss": 0.2006986141204834, "mean_token_accuracy": 0.9158665686845779, "num_tokens": 32529004.0, "step": 2637 }, { "entropy": 1.1851938664913177, "epoch": 1.3891521853607163, "grad_norm": 0.2678104639053345, "learning_rate": 0.00018694822958709346, "loss": 0.1974492073059082, "mean_token_accuracy": 0.9265509694814682, "num_tokens": 32541340.0, "step": 2638 }, { "entropy": 1.1814790070056915, "epoch": 1.3896787783043707, "grad_norm": 0.2913559079170227, "learning_rate": 0.00018693685396829483, "loss": 0.20490042865276337, "mean_token_accuracy": 0.911860391497612, "num_tokens": 32553676.0, "step": 2639 }, { "entropy": 1.1520279347896576, "epoch": 1.3902053712480253, "grad_norm": 0.3147750496864319, "learning_rate": 0.00018692547378220358, "loss": 0.20494982600212097, "mean_token_accuracy": 0.9163292199373245, "num_tokens": 32566012.0, "step": 2640 }, { "entropy": 1.1539938151836395, "epoch": 1.3907319641916798, "grad_norm": 0.27995991706848145, "learning_rate": 0.0001869140890294953, "loss": 0.19520774483680725, "mean_token_accuracy": 0.9176739156246185, "num_tokens": 32578348.0, "step": 2641 }, { "entropy": 1.1977797150611877, "epoch": 1.3912585571353344, "grad_norm": 0.2937062978744507, "learning_rate": 0.00018690269971084587, "loss": 0.20538851618766785, "mean_token_accuracy": 0.9172974228858948, "num_tokens": 32590684.0, "step": 2642 }, { "entropy": 1.187753289937973, "epoch": 1.3917851500789888, "grad_norm": 0.2842217683792114, "learning_rate": 0.00018689130582693136, "loss": 0.2011350840330124, "mean_token_accuracy": 0.9161236584186554, "num_tokens": 32603020.0, "step": 2643 }, { "entropy": 1.1970960795879364, "epoch": 1.3923117430226435, "grad_norm": 0.2834356129169464, "learning_rate": 0.00018687990737842818, "loss": 0.20202001929283142, "mean_token_accuracy": 0.920697346329689, "num_tokens": 32615356.0, "step": 2644 }, { "entropy": 1.1325391829013824, "epoch": 1.3928383359662981, "grad_norm": 0.2595110833644867, "learning_rate": 0.00018686850436601298, "loss": 0.17119885981082916, "mean_token_accuracy": 0.9274217188358307, "num_tokens": 32627692.0, "step": 2645 }, { "entropy": 1.203096479177475, "epoch": 1.3933649289099526, "grad_norm": 0.28552207350730896, "learning_rate": 0.00018685709679036272, "loss": 0.1984875351190567, "mean_token_accuracy": 0.9184497147798538, "num_tokens": 32640028.0, "step": 2646 }, { "entropy": 1.2174711227416992, "epoch": 1.3938915218536072, "grad_norm": 0.3431668281555176, "learning_rate": 0.00018684568465215457, "loss": 0.23073092103004456, "mean_token_accuracy": 0.9064096510410309, "num_tokens": 32652364.0, "step": 2647 }, { "entropy": 1.1742651760578156, "epoch": 1.3944181147972619, "grad_norm": 0.2867361605167389, "learning_rate": 0.00018683426795206603, "loss": 0.20909307897090912, "mean_token_accuracy": 0.9160559475421906, "num_tokens": 32664700.0, "step": 2648 }, { "entropy": 1.1931123435497284, "epoch": 1.3949447077409163, "grad_norm": 0.27413511276245117, "learning_rate": 0.0001868228466907748, "loss": 0.1944372057914734, "mean_token_accuracy": 0.9192412346601486, "num_tokens": 32677036.0, "step": 2649 }, { "entropy": 1.200911283493042, "epoch": 1.3954713006845707, "grad_norm": 0.32713064551353455, "learning_rate": 0.0001868114208689589, "loss": 0.22633163630962372, "mean_token_accuracy": 0.9066626876592636, "num_tokens": 32689372.0, "step": 2650 }, { "entropy": 1.173728585243225, "epoch": 1.3959978936282254, "grad_norm": 0.2703946828842163, "learning_rate": 0.00018679999048729667, "loss": 0.2105778455734253, "mean_token_accuracy": 0.9153214693069458, "num_tokens": 32701708.0, "step": 2651 }, { "entropy": 1.2183512151241302, "epoch": 1.39652448657188, "grad_norm": 0.2865394651889801, "learning_rate": 0.00018678855554646665, "loss": 0.19708535075187683, "mean_token_accuracy": 0.9225267171859741, "num_tokens": 32714044.0, "step": 2652 }, { "entropy": 1.2178658246994019, "epoch": 1.3970510795155344, "grad_norm": 0.2824452519416809, "learning_rate": 0.00018677711604714762, "loss": 0.22327733039855957, "mean_token_accuracy": 0.9088855236768723, "num_tokens": 32726380.0, "step": 2653 }, { "entropy": 1.2230781316757202, "epoch": 1.397577672459189, "grad_norm": 0.2827853560447693, "learning_rate": 0.00018676567199001868, "loss": 0.19934280216693878, "mean_token_accuracy": 0.9177891463041306, "num_tokens": 32738716.0, "step": 2654 }, { "entropy": 1.1976493299007416, "epoch": 1.3981042654028437, "grad_norm": 0.26556023955345154, "learning_rate": 0.00018675422337575926, "loss": 0.2057933360338211, "mean_token_accuracy": 0.918548509478569, "num_tokens": 32751052.0, "step": 2655 }, { "entropy": 1.2001135349273682, "epoch": 1.3986308583464981, "grad_norm": 0.2884269058704376, "learning_rate": 0.0001867427702050489, "loss": 0.20356959104537964, "mean_token_accuracy": 0.9222962260246277, "num_tokens": 32763388.0, "step": 2656 }, { "entropy": 1.206467181444168, "epoch": 1.3991574512901528, "grad_norm": 0.2789088189601898, "learning_rate": 0.0001867313124785676, "loss": 0.200584277510643, "mean_token_accuracy": 0.9238597601652145, "num_tokens": 32775724.0, "step": 2657 }, { "entropy": 1.1685158610343933, "epoch": 1.3996840442338072, "grad_norm": 0.262813001871109, "learning_rate": 0.00018671985019699553, "loss": 0.19860176742076874, "mean_token_accuracy": 0.9217494130134583, "num_tokens": 32788060.0, "step": 2658 }, { "entropy": 1.1696327328681946, "epoch": 1.4002106371774619, "grad_norm": 0.2782774865627289, "learning_rate": 0.00018670838336101308, "loss": 0.20912325382232666, "mean_token_accuracy": 0.9155998378992081, "num_tokens": 32800396.0, "step": 2659 }, { "entropy": 1.1536991596221924, "epoch": 1.4007372301211163, "grad_norm": 0.2786557972431183, "learning_rate": 0.00018669691197130097, "loss": 0.1923229843378067, "mean_token_accuracy": 0.9198986142873764, "num_tokens": 32812732.0, "step": 2660 }, { "entropy": 1.1637346744537354, "epoch": 1.401263823064771, "grad_norm": 0.2913641035556793, "learning_rate": 0.00018668543602854028, "loss": 0.19935357570648193, "mean_token_accuracy": 0.91521255671978, "num_tokens": 32825068.0, "step": 2661 }, { "entropy": 1.1952362954616547, "epoch": 1.4017904160084256, "grad_norm": 0.27064937353134155, "learning_rate": 0.00018667395553341213, "loss": 0.19324931502342224, "mean_token_accuracy": 0.9230464100837708, "num_tokens": 32837404.0, "step": 2662 }, { "entropy": 1.172296166419983, "epoch": 1.40231700895208, "grad_norm": 0.2844633162021637, "learning_rate": 0.0001866624704865982, "loss": 0.21573956310749054, "mean_token_accuracy": 0.9178134202957153, "num_tokens": 32849740.0, "step": 2663 }, { "entropy": 1.1426364183425903, "epoch": 1.4028436018957346, "grad_norm": 0.2857990860939026, "learning_rate": 0.0001866509808887802, "loss": 0.19915884733200073, "mean_token_accuracy": 0.919086143374443, "num_tokens": 32862076.0, "step": 2664 }, { "entropy": 1.1875398755073547, "epoch": 1.403370194839389, "grad_norm": 0.29901546239852905, "learning_rate": 0.00018663948674064025, "loss": 0.2148965746164322, "mean_token_accuracy": 0.9187829047441483, "num_tokens": 32874412.0, "step": 2665 }, { "entropy": 1.1802086234092712, "epoch": 1.4038967877830437, "grad_norm": 0.30026695132255554, "learning_rate": 0.0001866279880428606, "loss": 0.21468932926654816, "mean_token_accuracy": 0.9141033738851547, "num_tokens": 32886748.0, "step": 2666 }, { "entropy": 1.231868177652359, "epoch": 1.4044233807266981, "grad_norm": 0.3457041382789612, "learning_rate": 0.00018661648479612397, "loss": 0.21766367554664612, "mean_token_accuracy": 0.9147387742996216, "num_tokens": 32899084.0, "step": 2667 }, { "entropy": 1.1672147512435913, "epoch": 1.4049499736703528, "grad_norm": 0.29802289605140686, "learning_rate": 0.00018660497700111317, "loss": 0.1930084526538849, "mean_token_accuracy": 0.9234433770179749, "num_tokens": 32911420.0, "step": 2668 }, { "entropy": 1.2288798391819, "epoch": 1.4054765666140074, "grad_norm": 0.2817768454551697, "learning_rate": 0.00018659346465851138, "loss": 0.2119956761598587, "mean_token_accuracy": 0.9163240343332291, "num_tokens": 32923756.0, "step": 2669 }, { "entropy": 1.2406794726848602, "epoch": 1.4060031595576619, "grad_norm": 0.3248741030693054, "learning_rate": 0.000186581947769002, "loss": 0.21822670102119446, "mean_token_accuracy": 0.9133480787277222, "num_tokens": 32936092.0, "step": 2670 }, { "entropy": 1.1928761005401611, "epoch": 1.4065297525013165, "grad_norm": 0.29017162322998047, "learning_rate": 0.00018657042633326876, "loss": 0.19945287704467773, "mean_token_accuracy": 0.921704575419426, "num_tokens": 32948428.0, "step": 2671 }, { "entropy": 1.2523100972175598, "epoch": 1.4070563454449712, "grad_norm": 0.2896433174610138, "learning_rate": 0.00018655890035199557, "loss": 0.20614881813526154, "mean_token_accuracy": 0.9159245640039444, "num_tokens": 32960764.0, "step": 2672 }, { "entropy": 1.2614913880825043, "epoch": 1.4075829383886256, "grad_norm": 0.2920669615268707, "learning_rate": 0.0001865473698258667, "loss": 0.2224857062101364, "mean_token_accuracy": 0.9055542200803757, "num_tokens": 32973100.0, "step": 2673 }, { "entropy": 1.2949616014957428, "epoch": 1.4081095313322802, "grad_norm": 0.3054332435131073, "learning_rate": 0.00018653583475556663, "loss": 0.20840829610824585, "mean_token_accuracy": 0.9158879816532135, "num_tokens": 32985436.0, "step": 2674 }, { "entropy": 1.3014479279518127, "epoch": 1.4086361242759347, "grad_norm": 0.293302059173584, "learning_rate": 0.00018652429514178016, "loss": 0.2146826684474945, "mean_token_accuracy": 0.9126481860876083, "num_tokens": 32997772.0, "step": 2675 }, { "entropy": 1.3077419102191925, "epoch": 1.4091627172195893, "grad_norm": 0.2812763750553131, "learning_rate": 0.00018651275098519228, "loss": 0.2168470174074173, "mean_token_accuracy": 0.9146820157766342, "num_tokens": 33010108.0, "step": 2676 }, { "entropy": 1.3591797947883606, "epoch": 1.4096893101632437, "grad_norm": 0.27339309453964233, "learning_rate": 0.0001865012022864883, "loss": 0.2067457139492035, "mean_token_accuracy": 0.910685271024704, "num_tokens": 33022444.0, "step": 2677 }, { "entropy": 1.3165797293186188, "epoch": 1.4102159031068984, "grad_norm": 0.26994794607162476, "learning_rate": 0.00018648964904635388, "loss": 0.20063388347625732, "mean_token_accuracy": 0.915714293718338, "num_tokens": 33034780.0, "step": 2678 }, { "entropy": 1.350212275981903, "epoch": 1.410742496050553, "grad_norm": 0.26788488030433655, "learning_rate": 0.00018647809126547476, "loss": 0.2082659900188446, "mean_token_accuracy": 0.9163226187229156, "num_tokens": 33047116.0, "step": 2679 }, { "entropy": 1.3494655191898346, "epoch": 1.4112690889942074, "grad_norm": 0.3014771342277527, "learning_rate": 0.00018646652894453714, "loss": 0.2213258445262909, "mean_token_accuracy": 0.9125747829675674, "num_tokens": 33059452.0, "step": 2680 }, { "entropy": 1.3585596978664398, "epoch": 1.411795681937862, "grad_norm": 0.2993260324001312, "learning_rate": 0.00018645496208422738, "loss": 0.23662728071212769, "mean_token_accuracy": 0.9095396250486374, "num_tokens": 33071788.0, "step": 2681 }, { "entropy": 1.2951436042785645, "epoch": 1.4123222748815165, "grad_norm": 0.28097495436668396, "learning_rate": 0.00018644339068523208, "loss": 0.19883355498313904, "mean_token_accuracy": 0.9165204763412476, "num_tokens": 33084124.0, "step": 2682 }, { "entropy": 1.2786961197853088, "epoch": 1.4128488678251712, "grad_norm": 0.31551140546798706, "learning_rate": 0.00018643181474823828, "loss": 0.22398042678833008, "mean_token_accuracy": 0.9099626541137695, "num_tokens": 33096460.0, "step": 2683 }, { "entropy": 1.353494018316269, "epoch": 1.4133754607688256, "grad_norm": 0.27544382214546204, "learning_rate": 0.00018642023427393312, "loss": 0.19528742134571075, "mean_token_accuracy": 0.9221656024456024, "num_tokens": 33108796.0, "step": 2684 }, { "entropy": 1.3157804608345032, "epoch": 1.4139020537124802, "grad_norm": 0.26549386978149414, "learning_rate": 0.00018640864926300403, "loss": 0.1861998438835144, "mean_token_accuracy": 0.924147367477417, "num_tokens": 33121132.0, "step": 2685 }, { "entropy": 1.2875000834465027, "epoch": 1.4144286466561349, "grad_norm": 0.3759959042072296, "learning_rate": 0.00018639705971613878, "loss": 0.1876804083585739, "mean_token_accuracy": 0.9247392117977142, "num_tokens": 33133468.0, "step": 2686 }, { "entropy": 1.278031587600708, "epoch": 1.4149552395997893, "grad_norm": 0.2772931456565857, "learning_rate": 0.00018638546563402538, "loss": 0.1913738250732422, "mean_token_accuracy": 0.9191721677780151, "num_tokens": 33145804.0, "step": 2687 }, { "entropy": 1.3772215843200684, "epoch": 1.415481832543444, "grad_norm": 0.32579630613327026, "learning_rate": 0.00018637386701735208, "loss": 0.20003564655780792, "mean_token_accuracy": 0.9227780699729919, "num_tokens": 33158140.0, "step": 2688 }, { "entropy": 1.330332100391388, "epoch": 1.4160084254870986, "grad_norm": 0.3118603229522705, "learning_rate": 0.00018636226386680748, "loss": 0.1903379112482071, "mean_token_accuracy": 0.9189924746751785, "num_tokens": 33170476.0, "step": 2689 }, { "entropy": 1.3054493367671967, "epoch": 1.416535018430753, "grad_norm": 0.4101371467113495, "learning_rate": 0.0001863506561830803, "loss": 0.2160140872001648, "mean_token_accuracy": 0.9076957255601883, "num_tokens": 33182812.0, "step": 2690 }, { "entropy": 1.3156910836696625, "epoch": 1.4170616113744074, "grad_norm": 0.2924982011318207, "learning_rate": 0.0001863390439668597, "loss": 0.19913962483406067, "mean_token_accuracy": 0.9208202958106995, "num_tokens": 33195148.0, "step": 2691 }, { "entropy": 1.3482598662376404, "epoch": 1.417588204318062, "grad_norm": 0.27372100949287415, "learning_rate": 0.00018632742721883495, "loss": 0.19036367535591125, "mean_token_accuracy": 0.9198184758424759, "num_tokens": 33207484.0, "step": 2692 }, { "entropy": 1.3402643203735352, "epoch": 1.4181147972617167, "grad_norm": 0.2865314781665802, "learning_rate": 0.00018631580593969578, "loss": 0.20403306186199188, "mean_token_accuracy": 0.9174676239490509, "num_tokens": 33219820.0, "step": 2693 }, { "entropy": 1.3814849257469177, "epoch": 1.4186413902053712, "grad_norm": 0.298798531293869, "learning_rate": 0.00018630418013013199, "loss": 0.19326891005039215, "mean_token_accuracy": 0.9204562902450562, "num_tokens": 33232156.0, "step": 2694 }, { "entropy": 1.3497715592384338, "epoch": 1.4191679831490258, "grad_norm": 0.2983977794647217, "learning_rate": 0.00018629254979083372, "loss": 0.2127034068107605, "mean_token_accuracy": 0.9153210371732712, "num_tokens": 33244492.0, "step": 2695 }, { "entropy": 1.3387363851070404, "epoch": 1.4196945760926805, "grad_norm": 0.2673841714859009, "learning_rate": 0.00018628091492249149, "loss": 0.1976945847272873, "mean_token_accuracy": 0.9180579632520676, "num_tokens": 33256828.0, "step": 2696 }, { "entropy": 1.2811682224273682, "epoch": 1.4202211690363349, "grad_norm": 0.2700756788253784, "learning_rate": 0.00018626927552579592, "loss": 0.19237622618675232, "mean_token_accuracy": 0.9196698665618896, "num_tokens": 33269164.0, "step": 2697 }, { "entropy": 1.2764002978801727, "epoch": 1.4207477619799895, "grad_norm": 0.2527097463607788, "learning_rate": 0.00018625763160143796, "loss": 0.1781824678182602, "mean_token_accuracy": 0.9250129163265228, "num_tokens": 33281500.0, "step": 2698 }, { "entropy": 1.3061909675598145, "epoch": 1.421274354923644, "grad_norm": 0.27409103512763977, "learning_rate": 0.0001862459831501089, "loss": 0.1834535151720047, "mean_token_accuracy": 0.9291260540485382, "num_tokens": 33293836.0, "step": 2699 }, { "entropy": 1.4255090951919556, "epoch": 1.4218009478672986, "grad_norm": 0.35492557287216187, "learning_rate": 0.00018623433017250025, "loss": 0.2331741452217102, "mean_token_accuracy": 0.9052500277757645, "num_tokens": 33306172.0, "step": 2700 }, { "entropy": 1.3506521880626678, "epoch": 1.422327540810953, "grad_norm": 0.26301318407058716, "learning_rate": 0.0001862226726693037, "loss": 0.19686710834503174, "mean_token_accuracy": 0.9148916304111481, "num_tokens": 33318508.0, "step": 2701 }, { "entropy": 1.3578969836235046, "epoch": 1.4228541337546077, "grad_norm": 0.30393311381340027, "learning_rate": 0.00018621101064121136, "loss": 0.21072648465633392, "mean_token_accuracy": 0.9144587218761444, "num_tokens": 33330844.0, "step": 2702 }, { "entropy": 1.360473245382309, "epoch": 1.4233807266982623, "grad_norm": 0.27426621317863464, "learning_rate": 0.0001861993440889155, "loss": 0.1906125247478485, "mean_token_accuracy": 0.919151559472084, "num_tokens": 33343180.0, "step": 2703 }, { "entropy": 1.3859812319278717, "epoch": 1.4239073196419167, "grad_norm": 0.3062906861305237, "learning_rate": 0.0001861876730131087, "loss": 0.2006826102733612, "mean_token_accuracy": 0.915339469909668, "num_tokens": 33355516.0, "step": 2704 }, { "entropy": 1.3931569159030914, "epoch": 1.4244339125855714, "grad_norm": 0.27953484654426575, "learning_rate": 0.0001861759974144838, "loss": 0.20995528995990753, "mean_token_accuracy": 0.9106060713529587, "num_tokens": 33367852.0, "step": 2705 }, { "entropy": 1.4093142449855804, "epoch": 1.424960505529226, "grad_norm": 0.28498291969299316, "learning_rate": 0.00018616431729373393, "loss": 0.1967875361442566, "mean_token_accuracy": 0.9221569150686264, "num_tokens": 33380188.0, "step": 2706 }, { "entropy": 1.3485685586929321, "epoch": 1.4254870984728805, "grad_norm": 0.299116849899292, "learning_rate": 0.00018615263265155246, "loss": 0.20301219820976257, "mean_token_accuracy": 0.9173270463943481, "num_tokens": 33392524.0, "step": 2707 }, { "entropy": 1.3589564263820648, "epoch": 1.426013691416535, "grad_norm": 0.2964306175708771, "learning_rate": 0.00018614094348863306, "loss": 0.19253556430339813, "mean_token_accuracy": 0.9231040179729462, "num_tokens": 33404860.0, "step": 2708 }, { "entropy": 1.3823421597480774, "epoch": 1.4265402843601895, "grad_norm": 0.34210389852523804, "learning_rate": 0.0001861292498056696, "loss": 0.2110666185617447, "mean_token_accuracy": 0.9131441861391068, "num_tokens": 33417196.0, "step": 2709 }, { "entropy": 1.3455529510974884, "epoch": 1.4270668773038442, "grad_norm": 0.2749879062175751, "learning_rate": 0.00018611755160335633, "loss": 0.17992670834064484, "mean_token_accuracy": 0.9268961399793625, "num_tokens": 33429532.0, "step": 2710 }, { "entropy": 1.3250888884067535, "epoch": 1.4275934702474986, "grad_norm": 0.30342763662338257, "learning_rate": 0.00018610584888238764, "loss": 0.21458712220191956, "mean_token_accuracy": 0.9091243892908096, "num_tokens": 33441868.0, "step": 2711 }, { "entropy": 1.2988539934158325, "epoch": 1.4281200631911533, "grad_norm": 0.279607355594635, "learning_rate": 0.00018609414164345829, "loss": 0.1852928102016449, "mean_token_accuracy": 0.9220867305994034, "num_tokens": 33454204.0, "step": 2712 }, { "entropy": 1.314719408750534, "epoch": 1.428646656134808, "grad_norm": 0.28591296076774597, "learning_rate": 0.00018608242988726325, "loss": 0.17573139071464539, "mean_token_accuracy": 0.9259963184595108, "num_tokens": 33466540.0, "step": 2713 }, { "entropy": 1.2993620932102203, "epoch": 1.4291732490784623, "grad_norm": 0.2799248695373535, "learning_rate": 0.00018607071361449783, "loss": 0.21279355883598328, "mean_token_accuracy": 0.9184603095054626, "num_tokens": 33478876.0, "step": 2714 }, { "entropy": 1.2804417610168457, "epoch": 1.429699842022117, "grad_norm": 0.27112871408462524, "learning_rate": 0.00018605899282585743, "loss": 0.2066880762577057, "mean_token_accuracy": 0.9143773913383484, "num_tokens": 33491212.0, "step": 2715 }, { "entropy": 1.3299663960933685, "epoch": 1.4302264349657714, "grad_norm": 0.2755028009414673, "learning_rate": 0.000186047267522038, "loss": 0.20685116946697235, "mean_token_accuracy": 0.9201144576072693, "num_tokens": 33503548.0, "step": 2716 }, { "entropy": 1.2998407185077667, "epoch": 1.430753027909426, "grad_norm": 0.2707025408744812, "learning_rate": 0.00018603553770373552, "loss": 0.19559168815612793, "mean_token_accuracy": 0.9165090620517731, "num_tokens": 33515884.0, "step": 2717 }, { "entropy": 1.3012645542621613, "epoch": 1.4312796208530805, "grad_norm": 0.2650182247161865, "learning_rate": 0.00018602380337164634, "loss": 0.17805761098861694, "mean_token_accuracy": 0.9261130839586258, "num_tokens": 33528220.0, "step": 2718 }, { "entropy": 1.2708977460861206, "epoch": 1.4318062137967351, "grad_norm": 0.27006566524505615, "learning_rate": 0.00018601206452646706, "loss": 0.18752358853816986, "mean_token_accuracy": 0.9268027991056442, "num_tokens": 33540556.0, "step": 2719 }, { "entropy": 1.2761503458023071, "epoch": 1.4323328067403898, "grad_norm": 0.2888233959674835, "learning_rate": 0.00018600032116889453, "loss": 0.2155730128288269, "mean_token_accuracy": 0.9141710996627808, "num_tokens": 33552892.0, "step": 2720 }, { "entropy": 1.2359469830989838, "epoch": 1.4328593996840442, "grad_norm": 0.29737192392349243, "learning_rate": 0.00018598857329962587, "loss": 0.21056918799877167, "mean_token_accuracy": 0.9146129190921783, "num_tokens": 33565228.0, "step": 2721 }, { "entropy": 1.188820868730545, "epoch": 1.4333859926276988, "grad_norm": 0.303146630525589, "learning_rate": 0.00018597682091935856, "loss": 0.202779620885849, "mean_token_accuracy": 0.9155432283878326, "num_tokens": 33577564.0, "step": 2722 }, { "entropy": 1.2396386861801147, "epoch": 1.4339125855713535, "grad_norm": 0.2838284969329834, "learning_rate": 0.00018596506402879018, "loss": 0.2013065367937088, "mean_token_accuracy": 0.9150380194187164, "num_tokens": 33589900.0, "step": 2723 }, { "entropy": 1.2167082726955414, "epoch": 1.434439178515008, "grad_norm": 0.28906625509262085, "learning_rate": 0.0001859533026286187, "loss": 0.21567818522453308, "mean_token_accuracy": 0.9125472903251648, "num_tokens": 33602236.0, "step": 2724 }, { "entropy": 1.2206608951091766, "epoch": 1.4349657714586623, "grad_norm": 0.27452901005744934, "learning_rate": 0.00018594153671954236, "loss": 0.22003887593746185, "mean_token_accuracy": 0.9081568866968155, "num_tokens": 33614572.0, "step": 2725 }, { "entropy": 1.2153219878673553, "epoch": 1.435492364402317, "grad_norm": 0.28818845748901367, "learning_rate": 0.0001859297663022596, "loss": 0.21699745953083038, "mean_token_accuracy": 0.9116252958774567, "num_tokens": 33626908.0, "step": 2726 }, { "entropy": 1.2302789092063904, "epoch": 1.4360189573459716, "grad_norm": 0.2688583433628082, "learning_rate": 0.00018591799137746915, "loss": 0.19513952732086182, "mean_token_accuracy": 0.922428548336029, "num_tokens": 33639244.0, "step": 2727 }, { "entropy": 1.2083250284194946, "epoch": 1.436545550289626, "grad_norm": 0.2625478506088257, "learning_rate": 0.00018590621194587007, "loss": 0.20137974619865417, "mean_token_accuracy": 0.9156837463378906, "num_tokens": 33651580.0, "step": 2728 }, { "entropy": 1.251519650220871, "epoch": 1.4370721432332807, "grad_norm": 0.29624244570732117, "learning_rate": 0.00018589442800816158, "loss": 0.2012304663658142, "mean_token_accuracy": 0.9153359830379486, "num_tokens": 33663916.0, "step": 2729 }, { "entropy": 1.2322251498699188, "epoch": 1.4375987361769353, "grad_norm": 0.2729564309120178, "learning_rate": 0.00018588263956504327, "loss": 0.1936715543270111, "mean_token_accuracy": 0.9187065362930298, "num_tokens": 33676252.0, "step": 2730 }, { "entropy": 1.263836681842804, "epoch": 1.4381253291205898, "grad_norm": 0.2771749198436737, "learning_rate": 0.00018587084661721487, "loss": 0.19794949889183044, "mean_token_accuracy": 0.9143384546041489, "num_tokens": 33688588.0, "step": 2731 }, { "entropy": 1.2738985121250153, "epoch": 1.4386519220642444, "grad_norm": 0.30315807461738586, "learning_rate": 0.00018585904916537655, "loss": 0.20564697682857513, "mean_token_accuracy": 0.9139324128627777, "num_tokens": 33700924.0, "step": 2732 }, { "entropy": 1.2370990812778473, "epoch": 1.4391785150078988, "grad_norm": 0.3091336488723755, "learning_rate": 0.0001858472472102286, "loss": 0.2253596931695938, "mean_token_accuracy": 0.9058148860931396, "num_tokens": 33713260.0, "step": 2733 }, { "entropy": 1.2049230933189392, "epoch": 1.4397051079515535, "grad_norm": 0.2731562554836273, "learning_rate": 0.0001858354407524717, "loss": 0.18417584896087646, "mean_token_accuracy": 0.9258820116519928, "num_tokens": 33725596.0, "step": 2734 }, { "entropy": 1.187551736831665, "epoch": 1.440231700895208, "grad_norm": 0.27385076880455017, "learning_rate": 0.00018582362979280666, "loss": 0.1865832656621933, "mean_token_accuracy": 0.9226599186658859, "num_tokens": 33737932.0, "step": 2735 }, { "entropy": 1.286464512348175, "epoch": 1.4407582938388626, "grad_norm": 0.31394457817077637, "learning_rate": 0.00018581181433193465, "loss": 0.2028738260269165, "mean_token_accuracy": 0.923179104924202, "num_tokens": 33750268.0, "step": 2736 }, { "entropy": 1.2562143802642822, "epoch": 1.4412848867825172, "grad_norm": 0.2848510146141052, "learning_rate": 0.0001857999943705571, "loss": 0.19614958763122559, "mean_token_accuracy": 0.9193147718906403, "num_tokens": 33762604.0, "step": 2737 }, { "entropy": 1.1915212869644165, "epoch": 1.4418114797261716, "grad_norm": 0.28245916962623596, "learning_rate": 0.00018578816990937568, "loss": 0.2020082175731659, "mean_token_accuracy": 0.9246124476194382, "num_tokens": 33774940.0, "step": 2738 }, { "entropy": 1.1338683068752289, "epoch": 1.4423380726698263, "grad_norm": 0.2531015872955322, "learning_rate": 0.0001857763409490923, "loss": 0.19030161201953888, "mean_token_accuracy": 0.9210085272789001, "num_tokens": 33787276.0, "step": 2739 }, { "entropy": 1.1661230623722076, "epoch": 1.4428646656134807, "grad_norm": 0.2816557288169861, "learning_rate": 0.00018576450749040925, "loss": 0.19968748092651367, "mean_token_accuracy": 0.9191047251224518, "num_tokens": 33799612.0, "step": 2740 }, { "entropy": 1.226789653301239, "epoch": 1.4433912585571353, "grad_norm": 0.2743048369884491, "learning_rate": 0.00018575266953402896, "loss": 0.2070472538471222, "mean_token_accuracy": 0.9168623089790344, "num_tokens": 33811948.0, "step": 2741 }, { "entropy": 1.226866990327835, "epoch": 1.4439178515007898, "grad_norm": 0.27064448595046997, "learning_rate": 0.00018574082708065423, "loss": 0.19173914194107056, "mean_token_accuracy": 0.9202168434858322, "num_tokens": 33824284.0, "step": 2742 }, { "entropy": 1.1833116710186005, "epoch": 1.4444444444444444, "grad_norm": 0.2748906910419464, "learning_rate": 0.00018572898013098803, "loss": 0.20692995190620422, "mean_token_accuracy": 0.9154257923364639, "num_tokens": 33836620.0, "step": 2743 }, { "entropy": 1.2158693671226501, "epoch": 1.444971037388099, "grad_norm": 0.28100040555000305, "learning_rate": 0.00018571712868573368, "loss": 0.19965311884880066, "mean_token_accuracy": 0.9194239974021912, "num_tokens": 33848956.0, "step": 2744 }, { "entropy": 1.1900866031646729, "epoch": 1.4454976303317535, "grad_norm": 0.24971705675125122, "learning_rate": 0.00018570527274559468, "loss": 0.19126318395137787, "mean_token_accuracy": 0.9166027456521988, "num_tokens": 33861292.0, "step": 2745 }, { "entropy": 1.2365811467170715, "epoch": 1.4460242232754081, "grad_norm": 0.2837916612625122, "learning_rate": 0.0001856934123112749, "loss": 0.21584585309028625, "mean_token_accuracy": 0.9098552912473679, "num_tokens": 33873628.0, "step": 2746 }, { "entropy": 1.177088737487793, "epoch": 1.4465508162190628, "grad_norm": 0.25515440106391907, "learning_rate": 0.00018568154738347837, "loss": 0.18173626065254211, "mean_token_accuracy": 0.9271458983421326, "num_tokens": 33885964.0, "step": 2747 }, { "entropy": 1.1429234147071838, "epoch": 1.4470774091627172, "grad_norm": 0.25770071148872375, "learning_rate": 0.00018566967796290954, "loss": 0.19852091372013092, "mean_token_accuracy": 0.9165006726980209, "num_tokens": 33898300.0, "step": 2748 }, { "entropy": 1.1901302635669708, "epoch": 1.4476040021063719, "grad_norm": 0.2882276177406311, "learning_rate": 0.00018565780405027294, "loss": 0.2006741464138031, "mean_token_accuracy": 0.9199828803539276, "num_tokens": 33910636.0, "step": 2749 }, { "entropy": 1.1173346042633057, "epoch": 1.4481305950500263, "grad_norm": 0.2821039855480194, "learning_rate": 0.00018564592564627346, "loss": 0.2002512663602829, "mean_token_accuracy": 0.9197804033756256, "num_tokens": 33922972.0, "step": 2750 }, { "entropy": 1.1957898437976837, "epoch": 1.448657187993681, "grad_norm": 0.2622511684894562, "learning_rate": 0.0001856340427516163, "loss": 0.18590982258319855, "mean_token_accuracy": 0.9213429242372513, "num_tokens": 33935308.0, "step": 2751 }, { "entropy": 1.1354258060455322, "epoch": 1.4491837809373354, "grad_norm": 0.29836171865463257, "learning_rate": 0.00018562215536700684, "loss": 0.21873271465301514, "mean_token_accuracy": 0.9166739583015442, "num_tokens": 33947644.0, "step": 2752 }, { "entropy": 1.1251291930675507, "epoch": 1.44971037388099, "grad_norm": 0.28312045335769653, "learning_rate": 0.00018561026349315075, "loss": 0.1926782727241516, "mean_token_accuracy": 0.9215989857912064, "num_tokens": 33959980.0, "step": 2753 }, { "entropy": 1.1114425361156464, "epoch": 1.4502369668246446, "grad_norm": 0.2983197569847107, "learning_rate": 0.00018559836713075408, "loss": 0.20771543681621552, "mean_token_accuracy": 0.9185106605291367, "num_tokens": 33972316.0, "step": 2754 }, { "entropy": 1.137503057718277, "epoch": 1.450763559768299, "grad_norm": 0.2714558243751526, "learning_rate": 0.0001855864662805229, "loss": 0.20167207717895508, "mean_token_accuracy": 0.915928527712822, "num_tokens": 33984652.0, "step": 2755 }, { "entropy": 1.1457951962947845, "epoch": 1.4512901527119537, "grad_norm": 0.2937759459018707, "learning_rate": 0.00018557456094316378, "loss": 0.2275719940662384, "mean_token_accuracy": 0.9085268825292587, "num_tokens": 33996988.0, "step": 2756 }, { "entropy": 1.1622550189495087, "epoch": 1.4518167456556081, "grad_norm": 0.28541475534439087, "learning_rate": 0.00018556265111938346, "loss": 0.2119087278842926, "mean_token_accuracy": 0.9126318097114563, "num_tokens": 34009324.0, "step": 2757 }, { "entropy": 1.1782312989234924, "epoch": 1.4523433385992628, "grad_norm": 0.2765743136405945, "learning_rate": 0.000185550736809889, "loss": 0.2087940275669098, "mean_token_accuracy": 0.917047530412674, "num_tokens": 34021660.0, "step": 2758 }, { "entropy": 1.1760065853595734, "epoch": 1.4528699315429172, "grad_norm": 0.3112678527832031, "learning_rate": 0.0001855388180153876, "loss": 0.22077929973602295, "mean_token_accuracy": 0.9056372046470642, "num_tokens": 34033996.0, "step": 2759 }, { "entropy": 1.15424644947052, "epoch": 1.4533965244865719, "grad_norm": 0.2751659154891968, "learning_rate": 0.00018552689473658683, "loss": 0.1892865151166916, "mean_token_accuracy": 0.9226154536008835, "num_tokens": 34046332.0, "step": 2760 }, { "entropy": 1.1498244404792786, "epoch": 1.4539231174302265, "grad_norm": 0.286650687456131, "learning_rate": 0.00018551496697419458, "loss": 0.20391809940338135, "mean_token_accuracy": 0.9146721214056015, "num_tokens": 34058668.0, "step": 2761 }, { "entropy": 1.1243232488632202, "epoch": 1.454449710373881, "grad_norm": 0.27432703971862793, "learning_rate": 0.0001855030347289188, "loss": 0.20199985802173615, "mean_token_accuracy": 0.9169850200414658, "num_tokens": 34071004.0, "step": 2762 }, { "entropy": 1.0830981135368347, "epoch": 1.4549763033175356, "grad_norm": 0.2619624137878418, "learning_rate": 0.00018549109800146797, "loss": 0.20818959176540375, "mean_token_accuracy": 0.9124700576066971, "num_tokens": 34083340.0, "step": 2763 }, { "entropy": 1.1054499447345734, "epoch": 1.4555028962611902, "grad_norm": 0.2768312692642212, "learning_rate": 0.00018547915679255063, "loss": 0.21730467677116394, "mean_token_accuracy": 0.9118637144565582, "num_tokens": 34095676.0, "step": 2764 }, { "entropy": 1.0992402136325836, "epoch": 1.4560294892048447, "grad_norm": 0.27909815311431885, "learning_rate": 0.0001854672111028757, "loss": 0.21124142408370972, "mean_token_accuracy": 0.9161806106567383, "num_tokens": 34108012.0, "step": 2765 }, { "entropy": 1.097431093454361, "epoch": 1.456556082148499, "grad_norm": 0.2552739083766937, "learning_rate": 0.0001854552609331523, "loss": 0.19730296730995178, "mean_token_accuracy": 0.9189020395278931, "num_tokens": 34120348.0, "step": 2766 }, { "entropy": 1.0860483348369598, "epoch": 1.4570826750921537, "grad_norm": 0.25408875942230225, "learning_rate": 0.0001854433062840898, "loss": 0.1871172934770584, "mean_token_accuracy": 0.9257505685091019, "num_tokens": 34132684.0, "step": 2767 }, { "entropy": 1.1571218967437744, "epoch": 1.4576092680358084, "grad_norm": 0.27546441555023193, "learning_rate": 0.00018543134715639796, "loss": 0.21564674377441406, "mean_token_accuracy": 0.9180003553628922, "num_tokens": 34145020.0, "step": 2768 }, { "entropy": 1.1057285368442535, "epoch": 1.4581358609794628, "grad_norm": 0.28240835666656494, "learning_rate": 0.00018541938355078668, "loss": 0.206221804022789, "mean_token_accuracy": 0.9218368530273438, "num_tokens": 34157356.0, "step": 2769 }, { "entropy": 1.103806346654892, "epoch": 1.4586624539231174, "grad_norm": 0.2811862826347351, "learning_rate": 0.00018540741546796616, "loss": 0.21019676327705383, "mean_token_accuracy": 0.9138357639312744, "num_tokens": 34169692.0, "step": 2770 }, { "entropy": 1.0941491723060608, "epoch": 1.459189046866772, "grad_norm": 0.2942333221435547, "learning_rate": 0.00018539544290864692, "loss": 0.21564032137393951, "mean_token_accuracy": 0.9101224541664124, "num_tokens": 34182028.0, "step": 2771 }, { "entropy": 1.1355141997337341, "epoch": 1.4597156398104265, "grad_norm": 0.275642991065979, "learning_rate": 0.00018538346587353965, "loss": 0.1873530000448227, "mean_token_accuracy": 0.9246546924114227, "num_tokens": 34194364.0, "step": 2772 }, { "entropy": 1.1305597126483917, "epoch": 1.4602422327540812, "grad_norm": 0.2881714105606079, "learning_rate": 0.0001853714843633554, "loss": 0.2074936330318451, "mean_token_accuracy": 0.9153118878602982, "num_tokens": 34206700.0, "step": 2773 }, { "entropy": 1.1241107285022736, "epoch": 1.4607688256977356, "grad_norm": 0.2789553999900818, "learning_rate": 0.00018535949837880539, "loss": 0.2105862945318222, "mean_token_accuracy": 0.9097577780485153, "num_tokens": 34219036.0, "step": 2774 }, { "entropy": 1.160140573978424, "epoch": 1.4612954186413902, "grad_norm": 0.28768390417099, "learning_rate": 0.00018534750792060123, "loss": 0.22017565369606018, "mean_token_accuracy": 0.9114931225776672, "num_tokens": 34231372.0, "step": 2775 }, { "entropy": 1.1482027173042297, "epoch": 1.4618220115850447, "grad_norm": 0.2865487039089203, "learning_rate": 0.00018533551298945467, "loss": 0.2026289850473404, "mean_token_accuracy": 0.9202168434858322, "num_tokens": 34243708.0, "step": 2776 }, { "entropy": 1.1577872037887573, "epoch": 1.4623486045286993, "grad_norm": 0.2701823115348816, "learning_rate": 0.00018532351358607776, "loss": 0.19837477803230286, "mean_token_accuracy": 0.9212843328714371, "num_tokens": 34256044.0, "step": 2777 }, { "entropy": 1.1805611550807953, "epoch": 1.462875197472354, "grad_norm": 0.26425090432167053, "learning_rate": 0.0001853115097111829, "loss": 0.19171418249607086, "mean_token_accuracy": 0.9227536916732788, "num_tokens": 34268380.0, "step": 2778 }, { "entropy": 1.148007869720459, "epoch": 1.4634017904160084, "grad_norm": 0.2617400586605072, "learning_rate": 0.00018529950136548265, "loss": 0.20737731456756592, "mean_token_accuracy": 0.9154264628887177, "num_tokens": 34280716.0, "step": 2779 }, { "entropy": 1.1435377299785614, "epoch": 1.463928383359663, "grad_norm": 0.30841219425201416, "learning_rate": 0.0001852874885496899, "loss": 0.19211293756961823, "mean_token_accuracy": 0.9231193363666534, "num_tokens": 34293052.0, "step": 2780 }, { "entropy": 1.139043003320694, "epoch": 1.4644549763033177, "grad_norm": 0.27137625217437744, "learning_rate": 0.00018527547126451774, "loss": 0.1936057209968567, "mean_token_accuracy": 0.9202312529087067, "num_tokens": 34305388.0, "step": 2781 }, { "entropy": 1.1803344190120697, "epoch": 1.464981569246972, "grad_norm": 0.27719569206237793, "learning_rate": 0.00018526344951067957, "loss": 0.19913798570632935, "mean_token_accuracy": 0.9173661470413208, "num_tokens": 34317724.0, "step": 2782 }, { "entropy": 1.1878839433193207, "epoch": 1.4655081621906265, "grad_norm": 0.2626071870326996, "learning_rate": 0.00018525142328888915, "loss": 0.1828022301197052, "mean_token_accuracy": 0.9273342788219452, "num_tokens": 34330060.0, "step": 2783 }, { "entropy": 1.1797403395175934, "epoch": 1.4660347551342812, "grad_norm": 0.2877488434314728, "learning_rate": 0.00018523939259986025, "loss": 0.20025065541267395, "mean_token_accuracy": 0.9134245812892914, "num_tokens": 34342396.0, "step": 2784 }, { "entropy": 1.1705401837825775, "epoch": 1.4665613480779358, "grad_norm": 0.3143531382083893, "learning_rate": 0.00018522735744430714, "loss": 0.21406927704811096, "mean_token_accuracy": 0.9137789458036423, "num_tokens": 34354732.0, "step": 2785 }, { "entropy": 1.2104687094688416, "epoch": 1.4670879410215902, "grad_norm": 0.2813572585582733, "learning_rate": 0.00018521531782294433, "loss": 0.20670530200004578, "mean_token_accuracy": 0.9143806546926498, "num_tokens": 34367068.0, "step": 2786 }, { "entropy": 1.097440928220749, "epoch": 1.4676145339652449, "grad_norm": 0.26660245656967163, "learning_rate": 0.00018520327373648644, "loss": 0.20290805399417877, "mean_token_accuracy": 0.9134158790111542, "num_tokens": 34379404.0, "step": 2787 }, { "entropy": 1.1643409132957458, "epoch": 1.4681411269088995, "grad_norm": 0.30806708335876465, "learning_rate": 0.00018519122518564853, "loss": 0.23489350080490112, "mean_token_accuracy": 0.9051381498575211, "num_tokens": 34391740.0, "step": 2788 }, { "entropy": 1.1760393381118774, "epoch": 1.468667719852554, "grad_norm": 0.30387377738952637, "learning_rate": 0.00018517917217114583, "loss": 0.20897458493709564, "mean_token_accuracy": 0.9153114259243011, "num_tokens": 34404076.0, "step": 2789 }, { "entropy": 1.170498788356781, "epoch": 1.4691943127962086, "grad_norm": 0.3018253445625305, "learning_rate": 0.00018516711469369386, "loss": 0.22422116994857788, "mean_token_accuracy": 0.9047844111919403, "num_tokens": 34416412.0, "step": 2790 }, { "entropy": 1.2046408951282501, "epoch": 1.469720905739863, "grad_norm": 0.2658669650554657, "learning_rate": 0.00018515505275400838, "loss": 0.18931232392787933, "mean_token_accuracy": 0.9234489351511002, "num_tokens": 34428748.0, "step": 2791 }, { "entropy": 1.1974002122879028, "epoch": 1.4702474986835177, "grad_norm": 0.27987316250801086, "learning_rate": 0.00018514298635280546, "loss": 0.20819401741027832, "mean_token_accuracy": 0.9120146036148071, "num_tokens": 34441084.0, "step": 2792 }, { "entropy": 1.20514714717865, "epoch": 1.470774091627172, "grad_norm": 0.26001980900764465, "learning_rate": 0.0001851309154908014, "loss": 0.19804999232292175, "mean_token_accuracy": 0.9171354323625565, "num_tokens": 34453420.0, "step": 2793 }, { "entropy": 1.2106068134307861, "epoch": 1.4713006845708267, "grad_norm": 0.2716507017612457, "learning_rate": 0.0001851188401687128, "loss": 0.19358912110328674, "mean_token_accuracy": 0.9196220189332962, "num_tokens": 34465756.0, "step": 2794 }, { "entropy": 1.231193095445633, "epoch": 1.4718272775144814, "grad_norm": 0.26500481367111206, "learning_rate": 0.00018510676038725648, "loss": 0.19936080276966095, "mean_token_accuracy": 0.9158136695623398, "num_tokens": 34478092.0, "step": 2795 }, { "entropy": 1.2479934096336365, "epoch": 1.4723538704581358, "grad_norm": 0.2973508834838867, "learning_rate": 0.00018509467614714954, "loss": 0.22026515007019043, "mean_token_accuracy": 0.911934033036232, "num_tokens": 34490428.0, "step": 2796 }, { "entropy": 1.2747034132480621, "epoch": 1.4728804634017905, "grad_norm": 0.3173184394836426, "learning_rate": 0.0001850825874491094, "loss": 0.2203284353017807, "mean_token_accuracy": 0.9120416641235352, "num_tokens": 34502764.0, "step": 2797 }, { "entropy": 1.1952545940876007, "epoch": 1.473407056345445, "grad_norm": 0.2990429401397705, "learning_rate": 0.0001850704942938536, "loss": 0.21640948951244354, "mean_token_accuracy": 0.9109156578779221, "num_tokens": 34515100.0, "step": 2798 }, { "entropy": 1.2120374739170074, "epoch": 1.4739336492890995, "grad_norm": 0.2810207009315491, "learning_rate": 0.00018505839668210013, "loss": 0.2099630981683731, "mean_token_accuracy": 0.9159301519393921, "num_tokens": 34527436.0, "step": 2799 }, { "entropy": 1.196582019329071, "epoch": 1.474460242232754, "grad_norm": 0.3099983334541321, "learning_rate": 0.00018504629461456716, "loss": 0.19392438232898712, "mean_token_accuracy": 0.9205189049243927, "num_tokens": 34539772.0, "step": 2800 }, { "entropy": 1.161557525396347, "epoch": 1.4749868351764086, "grad_norm": 0.2738645672798157, "learning_rate": 0.000185034188091973, "loss": 0.20201784372329712, "mean_token_accuracy": 0.9174954891204834, "num_tokens": 34552108.0, "step": 2801 }, { "entropy": 1.2087386548519135, "epoch": 1.4755134281200633, "grad_norm": 0.3033156991004944, "learning_rate": 0.00018502207711503646, "loss": 0.21341297030448914, "mean_token_accuracy": 0.9146996885538101, "num_tokens": 34564444.0, "step": 2802 }, { "entropy": 1.2204181849956512, "epoch": 1.4760400210637177, "grad_norm": 0.29885637760162354, "learning_rate": 0.0001850099616844765, "loss": 0.23106718063354492, "mean_token_accuracy": 0.9073407649993896, "num_tokens": 34576780.0, "step": 2803 }, { "entropy": 1.193909078836441, "epoch": 1.4765666140073723, "grad_norm": 0.29883119463920593, "learning_rate": 0.00018499784180101226, "loss": 0.20271748304367065, "mean_token_accuracy": 0.9174822568893433, "num_tokens": 34589116.0, "step": 2804 }, { "entropy": 1.195640653371811, "epoch": 1.477093206951027, "grad_norm": 0.3074481189250946, "learning_rate": 0.0001849857174653633, "loss": 0.2207125425338745, "mean_token_accuracy": 0.9117613136768341, "num_tokens": 34601452.0, "step": 2805 }, { "entropy": 1.1937943994998932, "epoch": 1.4776197998946814, "grad_norm": 0.30861732363700867, "learning_rate": 0.00018497358867824933, "loss": 0.23427164554595947, "mean_token_accuracy": 0.9043611437082291, "num_tokens": 34613788.0, "step": 2806 }, { "entropy": 1.209238052368164, "epoch": 1.478146392838336, "grad_norm": 0.29167798161506653, "learning_rate": 0.00018496145544039038, "loss": 0.20825859904289246, "mean_token_accuracy": 0.9163528382778168, "num_tokens": 34626124.0, "step": 2807 }, { "entropy": 1.2348674535751343, "epoch": 1.4786729857819905, "grad_norm": 0.30392780900001526, "learning_rate": 0.00018494931775250671, "loss": 0.213743194937706, "mean_token_accuracy": 0.9198024868965149, "num_tokens": 34638460.0, "step": 2808 }, { "entropy": 1.2187554240226746, "epoch": 1.4791995787256451, "grad_norm": 0.26182109117507935, "learning_rate": 0.00018493717561531893, "loss": 0.20783649384975433, "mean_token_accuracy": 0.9161714315414429, "num_tokens": 34650796.0, "step": 2809 }, { "entropy": 1.2145146429538727, "epoch": 1.4797261716692995, "grad_norm": 0.2773604094982147, "learning_rate": 0.0001849250290295478, "loss": 0.20019277930259705, "mean_token_accuracy": 0.9166374951601028, "num_tokens": 34663132.0, "step": 2810 }, { "entropy": 1.1926589012145996, "epoch": 1.4802527646129542, "grad_norm": 0.26068729162216187, "learning_rate": 0.00018491287799591436, "loss": 0.20261983573436737, "mean_token_accuracy": 0.9161369353532791, "num_tokens": 34675468.0, "step": 2811 }, { "entropy": 1.2438783645629883, "epoch": 1.4807793575566088, "grad_norm": 0.28087806701660156, "learning_rate": 0.00018490072251513997, "loss": 0.20033368468284607, "mean_token_accuracy": 0.9154119491577148, "num_tokens": 34687804.0, "step": 2812 }, { "entropy": 1.1822409331798553, "epoch": 1.4813059505002633, "grad_norm": 0.29859158396720886, "learning_rate": 0.00018488856258794625, "loss": 0.21145831048488617, "mean_token_accuracy": 0.9173175245523453, "num_tokens": 34700140.0, "step": 2813 }, { "entropy": 1.134483963251114, "epoch": 1.481832543443918, "grad_norm": 0.27768927812576294, "learning_rate": 0.00018487639821505506, "loss": 0.19765517115592957, "mean_token_accuracy": 0.9187143296003342, "num_tokens": 34712476.0, "step": 2814 }, { "entropy": 1.1635059118270874, "epoch": 1.4823591363875723, "grad_norm": 0.2897265553474426, "learning_rate": 0.00018486422939718853, "loss": 0.20456260442733765, "mean_token_accuracy": 0.9187261015176773, "num_tokens": 34724812.0, "step": 2815 }, { "entropy": 1.0995591282844543, "epoch": 1.482885729331227, "grad_norm": 0.3071244955062866, "learning_rate": 0.00018485205613506903, "loss": 0.22590550780296326, "mean_token_accuracy": 0.9051891267299652, "num_tokens": 34737148.0, "step": 2816 }, { "entropy": 1.1542208194732666, "epoch": 1.4834123222748814, "grad_norm": 0.27810409665107727, "learning_rate": 0.00018483987842941922, "loss": 0.19803431630134583, "mean_token_accuracy": 0.922128900885582, "num_tokens": 34749484.0, "step": 2817 }, { "entropy": 1.1647526919841766, "epoch": 1.483938915218536, "grad_norm": 0.2628480792045593, "learning_rate": 0.00018482769628096207, "loss": 0.1754264533519745, "mean_token_accuracy": 0.9252566993236542, "num_tokens": 34761820.0, "step": 2818 }, { "entropy": 1.1333464682102203, "epoch": 1.4844655081621907, "grad_norm": 0.32637807726860046, "learning_rate": 0.00018481550969042069, "loss": 0.22181954979896545, "mean_token_accuracy": 0.9101926386356354, "num_tokens": 34774156.0, "step": 2819 }, { "entropy": 1.125653713941574, "epoch": 1.4849921011058451, "grad_norm": 0.3150729835033417, "learning_rate": 0.00018480331865851853, "loss": 0.22693070769309998, "mean_token_accuracy": 0.9116131216287613, "num_tokens": 34786492.0, "step": 2820 }, { "entropy": 1.1617139875888824, "epoch": 1.4855186940494998, "grad_norm": 0.3212885856628418, "learning_rate": 0.00018479112318597936, "loss": 0.22024253010749817, "mean_token_accuracy": 0.9142894148826599, "num_tokens": 34798828.0, "step": 2821 }, { "entropy": 1.130389004945755, "epoch": 1.4860452869931544, "grad_norm": 0.26759734749794006, "learning_rate": 0.00018477892327352713, "loss": 0.18030500411987305, "mean_token_accuracy": 0.9289237558841705, "num_tokens": 34811164.0, "step": 2822 }, { "entropy": 1.1489178240299225, "epoch": 1.4865718799368088, "grad_norm": 0.28973206877708435, "learning_rate": 0.00018476671892188605, "loss": 0.20612166821956635, "mean_token_accuracy": 0.9198791682720184, "num_tokens": 34823500.0, "step": 2823 }, { "entropy": 1.196854144334793, "epoch": 1.4870984728804635, "grad_norm": 0.29863879084587097, "learning_rate": 0.00018475451013178062, "loss": 0.20180033147335052, "mean_token_accuracy": 0.9196022301912308, "num_tokens": 34835836.0, "step": 2824 }, { "entropy": 1.1838077902793884, "epoch": 1.487625065824118, "grad_norm": 0.30217835307121277, "learning_rate": 0.00018474229690393568, "loss": 0.19603033363819122, "mean_token_accuracy": 0.9209345132112503, "num_tokens": 34848172.0, "step": 2825 }, { "entropy": 1.256701648235321, "epoch": 1.4881516587677726, "grad_norm": 0.2757579982280731, "learning_rate": 0.00018473007923907616, "loss": 0.19625365734100342, "mean_token_accuracy": 0.9234248697757721, "num_tokens": 34860508.0, "step": 2826 }, { "entropy": 1.2282088100910187, "epoch": 1.488678251711427, "grad_norm": 0.2982552945613861, "learning_rate": 0.0001847178571379274, "loss": 0.20196665823459625, "mean_token_accuracy": 0.9129941761493683, "num_tokens": 34872844.0, "step": 2827 }, { "entropy": 1.1983471512794495, "epoch": 1.4892048446550816, "grad_norm": 0.25875699520111084, "learning_rate": 0.00018470563060121498, "loss": 0.19371843338012695, "mean_token_accuracy": 0.9161286354064941, "num_tokens": 34885180.0, "step": 2828 }, { "entropy": 1.2658935189247131, "epoch": 1.4897314375987363, "grad_norm": 0.28629231452941895, "learning_rate": 0.0001846933996296647, "loss": 0.20451796054840088, "mean_token_accuracy": 0.9187720865011215, "num_tokens": 34897516.0, "step": 2829 }, { "entropy": 1.2226274013519287, "epoch": 1.4902580305423907, "grad_norm": 0.26883167028427124, "learning_rate": 0.00018468116422400258, "loss": 0.19514040648937225, "mean_token_accuracy": 0.9247150421142578, "num_tokens": 34909852.0, "step": 2830 }, { "entropy": 1.2325372695922852, "epoch": 1.4907846234860453, "grad_norm": 0.27920812368392944, "learning_rate": 0.00018466892438495503, "loss": 0.20849348604679108, "mean_token_accuracy": 0.9168450087308884, "num_tokens": 34922188.0, "step": 2831 }, { "entropy": 1.2324140071868896, "epoch": 1.4913112164296998, "grad_norm": 0.29039597511291504, "learning_rate": 0.00018465668011324863, "loss": 0.21684204041957855, "mean_token_accuracy": 0.9118513017892838, "num_tokens": 34934524.0, "step": 2832 }, { "entropy": 1.158925324678421, "epoch": 1.4918378093733544, "grad_norm": 0.2734275162220001, "learning_rate": 0.0001846444314096103, "loss": 0.1901196390390396, "mean_token_accuracy": 0.9206565618515015, "num_tokens": 34946860.0, "step": 2833 }, { "entropy": 1.179129183292389, "epoch": 1.4923644023170088, "grad_norm": 0.24893783032894135, "learning_rate": 0.0001846321782747671, "loss": 0.1810513734817505, "mean_token_accuracy": 0.925764262676239, "num_tokens": 34959196.0, "step": 2834 }, { "entropy": 1.1447475254535675, "epoch": 1.4928909952606635, "grad_norm": 0.2840208411216736, "learning_rate": 0.00018461992070944652, "loss": 0.20713338255882263, "mean_token_accuracy": 0.9199363738298416, "num_tokens": 34971532.0, "step": 2835 }, { "entropy": 1.2216734886169434, "epoch": 1.4934175882043181, "grad_norm": 0.28631988167762756, "learning_rate": 0.00018460765871437614, "loss": 0.20792193710803986, "mean_token_accuracy": 0.9214426577091217, "num_tokens": 34983868.0, "step": 2836 }, { "entropy": 1.1670808494091034, "epoch": 1.4939441811479726, "grad_norm": 0.2994043529033661, "learning_rate": 0.00018459539229028388, "loss": 0.2228715866804123, "mean_token_accuracy": 0.9080910384654999, "num_tokens": 34996204.0, "step": 2837 }, { "entropy": 1.1826681196689606, "epoch": 1.4944707740916272, "grad_norm": 0.2632300853729248, "learning_rate": 0.00018458312143789798, "loss": 0.19896544516086578, "mean_token_accuracy": 0.9158213883638382, "num_tokens": 35008540.0, "step": 2838 }, { "entropy": 1.1997667253017426, "epoch": 1.4949973670352819, "grad_norm": 0.28206589818000793, "learning_rate": 0.00018457084615794685, "loss": 0.18993441760540009, "mean_token_accuracy": 0.9219527989625931, "num_tokens": 35020876.0, "step": 2839 }, { "entropy": 1.2673965096473694, "epoch": 1.4955239599789363, "grad_norm": 0.29593348503112793, "learning_rate": 0.00018455856645115923, "loss": 0.2120542973279953, "mean_token_accuracy": 0.9183967113494873, "num_tokens": 35033212.0, "step": 2840 }, { "entropy": 1.2509069740772247, "epoch": 1.4960505529225907, "grad_norm": 0.4201185405254364, "learning_rate": 0.0001845462823182641, "loss": 0.21505090594291687, "mean_token_accuracy": 0.9150316119194031, "num_tokens": 35045548.0, "step": 2841 }, { "entropy": 1.3054153323173523, "epoch": 1.4965771458662454, "grad_norm": 0.2993493378162384, "learning_rate": 0.0001845339937599906, "loss": 0.1938711553812027, "mean_token_accuracy": 0.91843082010746, "num_tokens": 35057884.0, "step": 2842 }, { "entropy": 1.2852679789066315, "epoch": 1.4971037388099, "grad_norm": 0.28747817873954773, "learning_rate": 0.0001845217007770684, "loss": 0.18465346097946167, "mean_token_accuracy": 0.9223109483718872, "num_tokens": 35070220.0, "step": 2843 }, { "entropy": 1.3424168229103088, "epoch": 1.4976303317535544, "grad_norm": 0.2738924026489258, "learning_rate": 0.0001845094033702271, "loss": 0.19440293312072754, "mean_token_accuracy": 0.9208139926195145, "num_tokens": 35082556.0, "step": 2844 }, { "entropy": 1.2790354490280151, "epoch": 1.498156924697209, "grad_norm": 0.26316049695014954, "learning_rate": 0.00018449710154019687, "loss": 0.18655042350292206, "mean_token_accuracy": 0.9237352013587952, "num_tokens": 35094892.0, "step": 2845 }, { "entropy": 1.3539345264434814, "epoch": 1.4986835176408637, "grad_norm": 0.29045310616493225, "learning_rate": 0.00018448479528770784, "loss": 0.19067838788032532, "mean_token_accuracy": 0.9230899512767792, "num_tokens": 35107228.0, "step": 2846 }, { "entropy": 1.4051901996135712, "epoch": 1.4992101105845181, "grad_norm": 0.256143718957901, "learning_rate": 0.0001844724846134907, "loss": 0.2035890519618988, "mean_token_accuracy": 0.9209445118904114, "num_tokens": 35119564.0, "step": 2847 }, { "entropy": 1.4236982464790344, "epoch": 1.4997367035281728, "grad_norm": 0.28411853313446045, "learning_rate": 0.00018446016951827619, "loss": 0.20746804773807526, "mean_token_accuracy": 0.9163666069507599, "num_tokens": 35131900.0, "step": 2848 }, { "entropy": 1.4779279828071594, "epoch": 1.5002632964718274, "grad_norm": 0.31305235624313354, "learning_rate": 0.0001844478500027954, "loss": 0.20554354786872864, "mean_token_accuracy": 0.9199778288602829, "num_tokens": 35144236.0, "step": 2849 }, { "entropy": 1.436387151479721, "epoch": 1.5007898894154819, "grad_norm": 0.2702447772026062, "learning_rate": 0.00018443552606777966, "loss": 0.18683519959449768, "mean_token_accuracy": 0.9251002669334412, "num_tokens": 35156572.0, "step": 2850 }, { "entropy": 1.4672654867172241, "epoch": 1.5013164823591363, "grad_norm": 0.2640582323074341, "learning_rate": 0.0001844231977139606, "loss": 0.17821809649467468, "mean_token_accuracy": 0.9315766096115112, "num_tokens": 35168908.0, "step": 2851 }, { "entropy": 1.4444270133972168, "epoch": 1.501843075302791, "grad_norm": 0.29034173488616943, "learning_rate": 0.00018441086494207004, "loss": 0.20143531262874603, "mean_token_accuracy": 0.9211236834526062, "num_tokens": 35181244.0, "step": 2852 }, { "entropy": 1.447830855846405, "epoch": 1.5023696682464456, "grad_norm": 0.26047781109809875, "learning_rate": 0.00018439852775284016, "loss": 0.1932010054588318, "mean_token_accuracy": 0.9227436780929565, "num_tokens": 35193580.0, "step": 2853 }, { "entropy": 1.5056044459342957, "epoch": 1.5028962611901, "grad_norm": 0.2798239588737488, "learning_rate": 0.0001843861861470033, "loss": 0.197336345911026, "mean_token_accuracy": 0.9250242561101913, "num_tokens": 35205916.0, "step": 2854 }, { "entropy": 1.3938361406326294, "epoch": 1.5034228541337546, "grad_norm": 0.2706337571144104, "learning_rate": 0.00018437384012529213, "loss": 0.19167521595954895, "mean_token_accuracy": 0.9251234829425812, "num_tokens": 35218252.0, "step": 2855 }, { "entropy": 1.41653311252594, "epoch": 1.5039494470774093, "grad_norm": 0.25845250487327576, "learning_rate": 0.00018436148968843956, "loss": 0.18029874563217163, "mean_token_accuracy": 0.9265570193529129, "num_tokens": 35230588.0, "step": 2856 }, { "entropy": 1.449202448129654, "epoch": 1.5044760400210637, "grad_norm": 0.26958736777305603, "learning_rate": 0.00018434913483717871, "loss": 0.19115948677062988, "mean_token_accuracy": 0.9232787936925888, "num_tokens": 35242924.0, "step": 2857 }, { "entropy": 1.4373081922531128, "epoch": 1.5050026329647181, "grad_norm": 0.2909432649612427, "learning_rate": 0.00018433677557224312, "loss": 0.2226668894290924, "mean_token_accuracy": 0.9091159552335739, "num_tokens": 35255260.0, "step": 2858 }, { "entropy": 1.4466613829135895, "epoch": 1.5055292259083728, "grad_norm": 0.28296786546707153, "learning_rate": 0.0001843244118943664, "loss": 0.19658687710762024, "mean_token_accuracy": 0.9204612225294113, "num_tokens": 35267596.0, "step": 2859 }, { "entropy": 1.4727692604064941, "epoch": 1.5060558188520274, "grad_norm": 0.27067407965660095, "learning_rate": 0.00018431204380428258, "loss": 0.17784729599952698, "mean_token_accuracy": 0.9264029860496521, "num_tokens": 35279932.0, "step": 2860 }, { "entropy": 1.4386701583862305, "epoch": 1.5065824117956819, "grad_norm": 0.28752195835113525, "learning_rate": 0.0001842996713027258, "loss": 0.20581099390983582, "mean_token_accuracy": 0.9142017662525177, "num_tokens": 35292268.0, "step": 2861 }, { "entropy": 1.4239437580108643, "epoch": 1.5071090047393365, "grad_norm": 0.274856835603714, "learning_rate": 0.00018428729439043062, "loss": 0.18968544900417328, "mean_token_accuracy": 0.921679362654686, "num_tokens": 35304604.0, "step": 2862 }, { "entropy": 1.4606831967830658, "epoch": 1.5076355976829912, "grad_norm": 0.2826034426689148, "learning_rate": 0.00018427491306813171, "loss": 0.19272050261497498, "mean_token_accuracy": 0.9195594191551208, "num_tokens": 35316940.0, "step": 2863 }, { "entropy": 1.4668301343917847, "epoch": 1.5081621906266456, "grad_norm": 0.32095038890838623, "learning_rate": 0.00018426252733656415, "loss": 0.20584404468536377, "mean_token_accuracy": 0.915522113442421, "num_tokens": 35329276.0, "step": 2864 }, { "entropy": 1.3869444131851196, "epoch": 1.5086887835703, "grad_norm": 0.28584420680999756, "learning_rate": 0.00018425013719646318, "loss": 0.21644830703735352, "mean_token_accuracy": 0.9124075770378113, "num_tokens": 35341612.0, "step": 2865 }, { "entropy": 1.3982872068881989, "epoch": 1.5092153765139549, "grad_norm": 0.2921147048473358, "learning_rate": 0.00018423774264856433, "loss": 0.22454163432121277, "mean_token_accuracy": 0.9074548035860062, "num_tokens": 35353948.0, "step": 2866 }, { "entropy": 1.4254017174243927, "epoch": 1.5097419694576093, "grad_norm": 0.29195889830589294, "learning_rate": 0.00018422534369360335, "loss": 0.20947468280792236, "mean_token_accuracy": 0.9152242243289948, "num_tokens": 35366284.0, "step": 2867 }, { "entropy": 1.420524001121521, "epoch": 1.5102685624012637, "grad_norm": 0.28271856904029846, "learning_rate": 0.00018421294033231638, "loss": 0.19233407080173492, "mean_token_accuracy": 0.922194093465805, "num_tokens": 35378620.0, "step": 2868 }, { "entropy": 1.4296413362026215, "epoch": 1.5107951553449184, "grad_norm": 0.29727426171302795, "learning_rate": 0.00018420053256543967, "loss": 0.21647101640701294, "mean_token_accuracy": 0.9113524258136749, "num_tokens": 35390956.0, "step": 2869 }, { "entropy": 1.383836716413498, "epoch": 1.511321748288573, "grad_norm": 0.2626645565032959, "learning_rate": 0.00018418812039370982, "loss": 0.17489789426326752, "mean_token_accuracy": 0.9316018223762512, "num_tokens": 35403292.0, "step": 2870 }, { "entropy": 1.3209747970104218, "epoch": 1.5118483412322274, "grad_norm": 0.2824258804321289, "learning_rate": 0.00018417570381786365, "loss": 0.2016294300556183, "mean_token_accuracy": 0.9183167815208435, "num_tokens": 35415628.0, "step": 2871 }, { "entropy": 1.3184476792812347, "epoch": 1.512374934175882, "grad_norm": 0.290884405374527, "learning_rate": 0.00018416328283863827, "loss": 0.20478402078151703, "mean_token_accuracy": 0.9130069315433502, "num_tokens": 35427964.0, "step": 2872 }, { "entropy": 1.268851488828659, "epoch": 1.5129015271195367, "grad_norm": 0.2771494686603546, "learning_rate": 0.00018415085745677106, "loss": 0.1991674304008484, "mean_token_accuracy": 0.9160973429679871, "num_tokens": 35440300.0, "step": 2873 }, { "entropy": 1.3079243302345276, "epoch": 1.5134281200631912, "grad_norm": 0.30500468611717224, "learning_rate": 0.0001841384276729996, "loss": 0.22135591506958008, "mean_token_accuracy": 0.9075585156679153, "num_tokens": 35452636.0, "step": 2874 }, { "entropy": 1.2402482628822327, "epoch": 1.5139547130068456, "grad_norm": 0.2842849791049957, "learning_rate": 0.00018412599348806185, "loss": 0.2187984585762024, "mean_token_accuracy": 0.9123281091451645, "num_tokens": 35464972.0, "step": 2875 }, { "entropy": 1.1900142133235931, "epoch": 1.5144813059505002, "grad_norm": 0.27149152755737305, "learning_rate": 0.00018411355490269589, "loss": 0.20663440227508545, "mean_token_accuracy": 0.9168604612350464, "num_tokens": 35477308.0, "step": 2876 }, { "entropy": 1.2160408794879913, "epoch": 1.5150078988941549, "grad_norm": 0.3139822483062744, "learning_rate": 0.00018410111191764013, "loss": 0.19389238953590393, "mean_token_accuracy": 0.9242724925279617, "num_tokens": 35489644.0, "step": 2877 }, { "entropy": 1.2444290518760681, "epoch": 1.5155344918378093, "grad_norm": 0.2705695331096649, "learning_rate": 0.00018408866453363326, "loss": 0.19504526257514954, "mean_token_accuracy": 0.921023428440094, "num_tokens": 35501980.0, "step": 2878 }, { "entropy": 1.2649579048156738, "epoch": 1.516061084781464, "grad_norm": 0.2965560853481293, "learning_rate": 0.00018407621275141417, "loss": 0.20819805562496185, "mean_token_accuracy": 0.9142050892114639, "num_tokens": 35514316.0, "step": 2879 }, { "entropy": 1.270400732755661, "epoch": 1.5165876777251186, "grad_norm": 0.2897675931453705, "learning_rate": 0.0001840637565717221, "loss": 0.213098406791687, "mean_token_accuracy": 0.910462811589241, "num_tokens": 35526652.0, "step": 2880 }, { "entropy": 1.2283774614334106, "epoch": 1.517114270668773, "grad_norm": 0.29091915488243103, "learning_rate": 0.00018405129599529646, "loss": 0.19621555507183075, "mean_token_accuracy": 0.9233623296022415, "num_tokens": 35538988.0, "step": 2881 }, { "entropy": 1.2129921317100525, "epoch": 1.5176408636124274, "grad_norm": 0.36581671237945557, "learning_rate": 0.00018403883102287698, "loss": 0.19229567050933838, "mean_token_accuracy": 0.9180682301521301, "num_tokens": 35551324.0, "step": 2882 }, { "entropy": 1.2191410660743713, "epoch": 1.518167456556082, "grad_norm": 0.2867785394191742, "learning_rate": 0.00018402636165520367, "loss": 0.211622953414917, "mean_token_accuracy": 0.9161818474531174, "num_tokens": 35563660.0, "step": 2883 }, { "entropy": 1.2190195620059967, "epoch": 1.5186940494997367, "grad_norm": 0.25288647413253784, "learning_rate": 0.0001840138878930167, "loss": 0.19131462275981903, "mean_token_accuracy": 0.9191330075263977, "num_tokens": 35575996.0, "step": 2884 }, { "entropy": 1.2443910837173462, "epoch": 1.5192206424433912, "grad_norm": 0.27648887038230896, "learning_rate": 0.00018400140973705658, "loss": 0.20976126194000244, "mean_token_accuracy": 0.9147668480873108, "num_tokens": 35588332.0, "step": 2885 }, { "entropy": 1.2364069521427155, "epoch": 1.5197472353870458, "grad_norm": 0.2660056948661804, "learning_rate": 0.00018398892718806412, "loss": 0.18810099363327026, "mean_token_accuracy": 0.9223190397024155, "num_tokens": 35600668.0, "step": 2886 }, { "entropy": 1.2349788844585419, "epoch": 1.5202738283307005, "grad_norm": 0.25507408380508423, "learning_rate": 0.00018397644024678028, "loss": 0.20845112204551697, "mean_token_accuracy": 0.9182122647762299, "num_tokens": 35613004.0, "step": 2887 }, { "entropy": 1.2452967166900635, "epoch": 1.5208004212743549, "grad_norm": 0.2838190495967865, "learning_rate": 0.0001839639489139463, "loss": 0.19937308132648468, "mean_token_accuracy": 0.9176253229379654, "num_tokens": 35625340.0, "step": 2888 }, { "entropy": 1.214994490146637, "epoch": 1.5213270142180095, "grad_norm": 0.268673837184906, "learning_rate": 0.0001839514531903038, "loss": 0.1951359212398529, "mean_token_accuracy": 0.9214799553155899, "num_tokens": 35637676.0, "step": 2889 }, { "entropy": 1.270435869693756, "epoch": 1.5218536071616642, "grad_norm": 0.3197346031665802, "learning_rate": 0.00018393895307659456, "loss": 0.20956359803676605, "mean_token_accuracy": 0.9150731861591339, "num_tokens": 35650012.0, "step": 2890 }, { "entropy": 1.3132632076740265, "epoch": 1.5223802001053186, "grad_norm": 0.299365758895874, "learning_rate": 0.0001839264485735606, "loss": 0.204919695854187, "mean_token_accuracy": 0.912919282913208, "num_tokens": 35662348.0, "step": 2891 }, { "entropy": 1.306254893541336, "epoch": 1.522906793048973, "grad_norm": 0.2999991178512573, "learning_rate": 0.00018391393968194428, "loss": 0.221295565366745, "mean_token_accuracy": 0.9113573879003525, "num_tokens": 35674684.0, "step": 2892 }, { "entropy": 1.3227771818637848, "epoch": 1.5234333859926277, "grad_norm": 0.29826298356056213, "learning_rate": 0.00018390142640248817, "loss": 0.2028276026248932, "mean_token_accuracy": 0.9149623513221741, "num_tokens": 35687020.0, "step": 2893 }, { "entropy": 1.2494766116142273, "epoch": 1.5239599789362823, "grad_norm": 0.29955431818962097, "learning_rate": 0.0001838889087359351, "loss": 0.2077026069164276, "mean_token_accuracy": 0.918857529759407, "num_tokens": 35699356.0, "step": 2894 }, { "entropy": 1.2577630579471588, "epoch": 1.5244865718799367, "grad_norm": 0.2640293836593628, "learning_rate": 0.00018387638668302818, "loss": 0.20387566089630127, "mean_token_accuracy": 0.9126008599996567, "num_tokens": 35711692.0, "step": 2895 }, { "entropy": 1.3035214841365814, "epoch": 1.5250131648235914, "grad_norm": 0.27383658289909363, "learning_rate": 0.00018386386024451076, "loss": 0.19004280865192413, "mean_token_accuracy": 0.9235143810510635, "num_tokens": 35724028.0, "step": 2896 }, { "entropy": 1.3059624433517456, "epoch": 1.525539757767246, "grad_norm": 0.3266020715236664, "learning_rate": 0.00018385132942112646, "loss": 0.21989792585372925, "mean_token_accuracy": 0.9094354212284088, "num_tokens": 35736364.0, "step": 2897 }, { "entropy": 1.255292147397995, "epoch": 1.5260663507109005, "grad_norm": 0.29097259044647217, "learning_rate": 0.0001838387942136192, "loss": 0.20556314289569855, "mean_token_accuracy": 0.9147609919309616, "num_tokens": 35748700.0, "step": 2898 }, { "entropy": 1.293520450592041, "epoch": 1.526592943654555, "grad_norm": 0.2748951017856598, "learning_rate": 0.00018382625462273305, "loss": 0.1994977742433548, "mean_token_accuracy": 0.9188051521778107, "num_tokens": 35761036.0, "step": 2899 }, { "entropy": 1.2601102590560913, "epoch": 1.5271195365982095, "grad_norm": 0.25538790225982666, "learning_rate": 0.00018381371064921247, "loss": 0.19155453145503998, "mean_token_accuracy": 0.9221813231706619, "num_tokens": 35773372.0, "step": 2900 }, { "entropy": 1.302675575017929, "epoch": 1.5276461295418642, "grad_norm": 0.27591919898986816, "learning_rate": 0.0001838011622938021, "loss": 0.19985324144363403, "mean_token_accuracy": 0.9170637875795364, "num_tokens": 35785708.0, "step": 2901 }, { "entropy": 1.3327484726905823, "epoch": 1.5281727224855186, "grad_norm": 0.2705720365047455, "learning_rate": 0.0001837886095572469, "loss": 0.1857602745294571, "mean_token_accuracy": 0.9223667979240417, "num_tokens": 35798044.0, "step": 2902 }, { "entropy": 1.308729499578476, "epoch": 1.5286993154291733, "grad_norm": 0.2666257321834564, "learning_rate": 0.00018377605244029204, "loss": 0.18631060421466827, "mean_token_accuracy": 0.9259549677371979, "num_tokens": 35810380.0, "step": 2903 }, { "entropy": 1.3280511498451233, "epoch": 1.529225908372828, "grad_norm": 0.2811123728752136, "learning_rate": 0.00018376349094368288, "loss": 0.19803892076015472, "mean_token_accuracy": 0.9206533879041672, "num_tokens": 35822716.0, "step": 2904 }, { "entropy": 1.2749126553535461, "epoch": 1.5297525013164823, "grad_norm": 0.27242687344551086, "learning_rate": 0.00018375092506816524, "loss": 0.18691426515579224, "mean_token_accuracy": 0.921400859951973, "num_tokens": 35835052.0, "step": 2905 }, { "entropy": 1.3258703649044037, "epoch": 1.5302790942601368, "grad_norm": 0.2818097770214081, "learning_rate": 0.000183738354814485, "loss": 0.19853971898555756, "mean_token_accuracy": 0.9171813875436783, "num_tokens": 35847388.0, "step": 2906 }, { "entropy": 1.331975519657135, "epoch": 1.5308056872037916, "grad_norm": 0.29557204246520996, "learning_rate": 0.00018372578018338844, "loss": 0.19931554794311523, "mean_token_accuracy": 0.9204997718334198, "num_tokens": 35859724.0, "step": 2907 }, { "entropy": 1.3371560275554657, "epoch": 1.531332280147446, "grad_norm": 0.30124926567077637, "learning_rate": 0.00018371320117562199, "loss": 0.20128431916236877, "mean_token_accuracy": 0.9167551845312119, "num_tokens": 35872060.0, "step": 2908 }, { "entropy": 1.2963175475597382, "epoch": 1.5318588730911005, "grad_norm": 0.26844584941864014, "learning_rate": 0.00018370061779193243, "loss": 0.18807059526443481, "mean_token_accuracy": 0.9203794151544571, "num_tokens": 35884396.0, "step": 2909 }, { "entropy": 1.2872518599033356, "epoch": 1.5323854660347551, "grad_norm": 0.2787841260433197, "learning_rate": 0.0001836880300330668, "loss": 0.18961066007614136, "mean_token_accuracy": 0.9234008938074112, "num_tokens": 35896732.0, "step": 2910 }, { "entropy": 1.3187111616134644, "epoch": 1.5329120589784098, "grad_norm": 0.26749753952026367, "learning_rate": 0.00018367543789977225, "loss": 0.1896454393863678, "mean_token_accuracy": 0.919704869389534, "num_tokens": 35909068.0, "step": 2911 }, { "entropy": 1.2901692986488342, "epoch": 1.5334386519220642, "grad_norm": 0.28337034583091736, "learning_rate": 0.00018366284139279638, "loss": 0.19293320178985596, "mean_token_accuracy": 0.9212239682674408, "num_tokens": 35921404.0, "step": 2912 }, { "entropy": 1.2707647681236267, "epoch": 1.5339652448657188, "grad_norm": 0.2982810437679291, "learning_rate": 0.00018365024051288694, "loss": 0.19825252890586853, "mean_token_accuracy": 0.9236468225717545, "num_tokens": 35933740.0, "step": 2913 }, { "entropy": 1.3728724122047424, "epoch": 1.5344918378093735, "grad_norm": 0.2963562309741974, "learning_rate": 0.000183637635260792, "loss": 0.2167905569076538, "mean_token_accuracy": 0.9136679619550705, "num_tokens": 35946076.0, "step": 2914 }, { "entropy": 1.3078700304031372, "epoch": 1.535018430753028, "grad_norm": 0.2905045747756958, "learning_rate": 0.00018362502563725987, "loss": 0.22399064898490906, "mean_token_accuracy": 0.9054947942495346, "num_tokens": 35958412.0, "step": 2915 }, { "entropy": 1.292427510023117, "epoch": 1.5355450236966823, "grad_norm": 0.25560230016708374, "learning_rate": 0.0001836124116430391, "loss": 0.17694160342216492, "mean_token_accuracy": 0.9285813271999359, "num_tokens": 35970748.0, "step": 2916 }, { "entropy": 1.3606195151805878, "epoch": 1.536071616640337, "grad_norm": 0.2602185904979706, "learning_rate": 0.00018359979327887846, "loss": 0.20653316378593445, "mean_token_accuracy": 0.9120610505342484, "num_tokens": 35983084.0, "step": 2917 }, { "entropy": 1.340090036392212, "epoch": 1.5365982095839916, "grad_norm": 0.2481660097837448, "learning_rate": 0.00018358717054552706, "loss": 0.17147809267044067, "mean_token_accuracy": 0.9288907945156097, "num_tokens": 35995420.0, "step": 2918 }, { "entropy": 1.317726194858551, "epoch": 1.537124802527646, "grad_norm": 0.2963104546070099, "learning_rate": 0.00018357454344373426, "loss": 0.22185461223125458, "mean_token_accuracy": 0.9066198915243149, "num_tokens": 36007756.0, "step": 2919 }, { "entropy": 1.2521053552627563, "epoch": 1.5376513954713007, "grad_norm": 0.2623257040977478, "learning_rate": 0.00018356191197424964, "loss": 0.19398631155490875, "mean_token_accuracy": 0.9210677295923233, "num_tokens": 36020092.0, "step": 2920 }, { "entropy": 1.3271432518959045, "epoch": 1.5381779884149553, "grad_norm": 0.29276102781295776, "learning_rate": 0.00018354927613782306, "loss": 0.21266180276870728, "mean_token_accuracy": 0.9133126139640808, "num_tokens": 36032428.0, "step": 2921 }, { "entropy": 1.299724519252777, "epoch": 1.5387045813586098, "grad_norm": 0.27011600136756897, "learning_rate": 0.00018353663593520466, "loss": 0.20557110011577606, "mean_token_accuracy": 0.9162522554397583, "num_tokens": 36044764.0, "step": 2922 }, { "entropy": 1.3156613111495972, "epoch": 1.5392311743022642, "grad_norm": 0.2779374420642853, "learning_rate": 0.0001835239913671447, "loss": 0.2038457691669464, "mean_token_accuracy": 0.913342073559761, "num_tokens": 36057100.0, "step": 2923 }, { "entropy": 1.354040265083313, "epoch": 1.539757767245919, "grad_norm": 0.2893989384174347, "learning_rate": 0.000183511342434394, "loss": 0.22883382439613342, "mean_token_accuracy": 0.9079950302839279, "num_tokens": 36069436.0, "step": 2924 }, { "entropy": 1.3318619132041931, "epoch": 1.5402843601895735, "grad_norm": 0.2893321216106415, "learning_rate": 0.0001834986891377033, "loss": 0.2252848893404007, "mean_token_accuracy": 0.9112117439508438, "num_tokens": 36081772.0, "step": 2925 }, { "entropy": 1.4141647219657898, "epoch": 1.540810953133228, "grad_norm": 0.28723177313804626, "learning_rate": 0.0001834860314778238, "loss": 0.2135084867477417, "mean_token_accuracy": 0.9165365993976593, "num_tokens": 36094108.0, "step": 2926 }, { "entropy": 1.3629777133464813, "epoch": 1.5413375460768826, "grad_norm": 0.2711016833782196, "learning_rate": 0.00018347336945550696, "loss": 0.20635992288589478, "mean_token_accuracy": 0.9175506234169006, "num_tokens": 36106444.0, "step": 2927 }, { "entropy": 1.3666974306106567, "epoch": 1.5418641390205372, "grad_norm": 0.26723483204841614, "learning_rate": 0.00018346070307150443, "loss": 0.1943853497505188, "mean_token_accuracy": 0.9215286374092102, "num_tokens": 36118780.0, "step": 2928 }, { "entropy": 1.379920780658722, "epoch": 1.5423907319641916, "grad_norm": 0.36375778913497925, "learning_rate": 0.00018344803232656805, "loss": 0.2259494662284851, "mean_token_accuracy": 0.9057151675224304, "num_tokens": 36131116.0, "step": 2929 }, { "entropy": 1.3832117319107056, "epoch": 1.5429173249078463, "grad_norm": 0.30295872688293457, "learning_rate": 0.00018343535722145011, "loss": 0.22572673857212067, "mean_token_accuracy": 0.9093717187643051, "num_tokens": 36143452.0, "step": 2930 }, { "entropy": 1.3965988755226135, "epoch": 1.543443917851501, "grad_norm": 0.28036290407180786, "learning_rate": 0.00018342267775690302, "loss": 0.1899104118347168, "mean_token_accuracy": 0.9211853593587875, "num_tokens": 36155788.0, "step": 2931 }, { "entropy": 1.3536584973335266, "epoch": 1.5439705107951553, "grad_norm": 0.28164905309677124, "learning_rate": 0.00018340999393367952, "loss": 0.20792821049690247, "mean_token_accuracy": 0.9128543734550476, "num_tokens": 36168124.0, "step": 2932 }, { "entropy": 1.3484612703323364, "epoch": 1.5444971037388098, "grad_norm": 0.2770152688026428, "learning_rate": 0.00018339730575253252, "loss": 0.1988334357738495, "mean_token_accuracy": 0.9181084334850311, "num_tokens": 36180460.0, "step": 2933 }, { "entropy": 1.3058361113071442, "epoch": 1.5450236966824644, "grad_norm": 0.2750353515148163, "learning_rate": 0.0001833846132142153, "loss": 0.1986725926399231, "mean_token_accuracy": 0.9165878146886826, "num_tokens": 36192796.0, "step": 2934 }, { "entropy": 1.3110437989234924, "epoch": 1.545550289626119, "grad_norm": 0.28275609016418457, "learning_rate": 0.00018337191631948127, "loss": 0.2109573483467102, "mean_token_accuracy": 0.9166303426027298, "num_tokens": 36205132.0, "step": 2935 }, { "entropy": 1.3241609632968903, "epoch": 1.5460768825697735, "grad_norm": 0.3148845136165619, "learning_rate": 0.00018335921506908425, "loss": 0.23299464583396912, "mean_token_accuracy": 0.9048751890659332, "num_tokens": 36217468.0, "step": 2936 }, { "entropy": 1.2985778152942657, "epoch": 1.5466034755134281, "grad_norm": 0.2876144051551819, "learning_rate": 0.0001833465094637782, "loss": 0.19456106424331665, "mean_token_accuracy": 0.9193484932184219, "num_tokens": 36229804.0, "step": 2937 }, { "entropy": 1.2285209596157074, "epoch": 1.5471300684570828, "grad_norm": 0.2816034257411957, "learning_rate": 0.00018333379950431734, "loss": 0.2107038050889969, "mean_token_accuracy": 0.9162741601467133, "num_tokens": 36242140.0, "step": 2938 }, { "entropy": 1.270815670490265, "epoch": 1.5476566614007372, "grad_norm": 0.30017396807670593, "learning_rate": 0.00018332108519145623, "loss": 0.22914569079875946, "mean_token_accuracy": 0.9055030792951584, "num_tokens": 36254476.0, "step": 2939 }, { "entropy": 1.251087248325348, "epoch": 1.5481832543443916, "grad_norm": 0.2832695543766022, "learning_rate": 0.00018330836652594967, "loss": 0.19750654697418213, "mean_token_accuracy": 0.9202122986316681, "num_tokens": 36266812.0, "step": 2940 }, { "entropy": 1.2241024374961853, "epoch": 1.5487098472880465, "grad_norm": 0.2506945729255676, "learning_rate": 0.00018329564350855264, "loss": 0.19707068800926208, "mean_token_accuracy": 0.9187771528959274, "num_tokens": 36279148.0, "step": 2941 }, { "entropy": 1.2423125505447388, "epoch": 1.549236440231701, "grad_norm": 0.2908343970775604, "learning_rate": 0.00018328291614002048, "loss": 0.2287912517786026, "mean_token_accuracy": 0.9047258198261261, "num_tokens": 36291484.0, "step": 2942 }, { "entropy": 1.2304923236370087, "epoch": 1.5497630331753554, "grad_norm": 0.2795937955379486, "learning_rate": 0.0001832701844211087, "loss": 0.18848249316215515, "mean_token_accuracy": 0.9215769469738007, "num_tokens": 36303820.0, "step": 2943 }, { "entropy": 1.236438661813736, "epoch": 1.55028962611901, "grad_norm": 0.26903602480888367, "learning_rate": 0.0001832574483525731, "loss": 0.20066887140274048, "mean_token_accuracy": 0.9172261506319046, "num_tokens": 36316156.0, "step": 2944 }, { "entropy": 1.2736486494541168, "epoch": 1.5508162190626646, "grad_norm": 0.29723483324050903, "learning_rate": 0.0001832447079351698, "loss": 0.19067001342773438, "mean_token_accuracy": 0.9212439507246017, "num_tokens": 36328492.0, "step": 2945 }, { "entropy": 1.2396992444992065, "epoch": 1.551342812006319, "grad_norm": 0.29464191198349, "learning_rate": 0.0001832319631696551, "loss": 0.23630069196224213, "mean_token_accuracy": 0.9037884026765823, "num_tokens": 36340828.0, "step": 2946 }, { "entropy": 1.1540693938732147, "epoch": 1.5518694049499737, "grad_norm": 0.2827843129634857, "learning_rate": 0.00018321921405678554, "loss": 0.19755500555038452, "mean_token_accuracy": 0.9163824766874313, "num_tokens": 36353164.0, "step": 2947 }, { "entropy": 1.2334130108356476, "epoch": 1.5523959978936284, "grad_norm": 0.2816913425922394, "learning_rate": 0.000183206460597318, "loss": 0.20551520586013794, "mean_token_accuracy": 0.9176173806190491, "num_tokens": 36365500.0, "step": 2948 }, { "entropy": 1.1994071006774902, "epoch": 1.5529225908372828, "grad_norm": 0.278768390417099, "learning_rate": 0.0001831937027920096, "loss": 0.19148175418376923, "mean_token_accuracy": 0.9233074188232422, "num_tokens": 36377836.0, "step": 2949 }, { "entropy": 1.1344974339008331, "epoch": 1.5534491837809372, "grad_norm": 0.28436407446861267, "learning_rate": 0.00018318094064161765, "loss": 0.20278222858905792, "mean_token_accuracy": 0.9229292422533035, "num_tokens": 36390172.0, "step": 2950 }, { "entropy": 1.1987184286117554, "epoch": 1.5539757767245919, "grad_norm": 0.29216986894607544, "learning_rate": 0.0001831681741468998, "loss": 0.21907229721546173, "mean_token_accuracy": 0.9171420633792877, "num_tokens": 36402508.0, "step": 2951 }, { "entropy": 1.1500971913337708, "epoch": 1.5545023696682465, "grad_norm": 0.2810475826263428, "learning_rate": 0.00018315540330861386, "loss": 0.18719711899757385, "mean_token_accuracy": 0.9203604012727737, "num_tokens": 36414844.0, "step": 2952 }, { "entropy": 1.1963881850242615, "epoch": 1.555028962611901, "grad_norm": 0.26603206992149353, "learning_rate": 0.0001831426281275181, "loss": 0.1819818615913391, "mean_token_accuracy": 0.9269210547208786, "num_tokens": 36427180.0, "step": 2953 }, { "entropy": 1.1963586807250977, "epoch": 1.5555555555555556, "grad_norm": 0.26459643244743347, "learning_rate": 0.00018312984860437072, "loss": 0.1856173276901245, "mean_token_accuracy": 0.9259962737560272, "num_tokens": 36439516.0, "step": 2954 }, { "entropy": 1.2363464832305908, "epoch": 1.5560821484992102, "grad_norm": 0.2887548804283142, "learning_rate": 0.00018311706473993051, "loss": 0.21210099756717682, "mean_token_accuracy": 0.9151240438222885, "num_tokens": 36451852.0, "step": 2955 }, { "entropy": 1.2128595113754272, "epoch": 1.5566087414428647, "grad_norm": 0.25528791546821594, "learning_rate": 0.00018310427653495632, "loss": 0.18278326094150543, "mean_token_accuracy": 0.9265086054801941, "num_tokens": 36464188.0, "step": 2956 }, { "entropy": 1.2223176658153534, "epoch": 1.557135334386519, "grad_norm": 0.28269702196121216, "learning_rate": 0.0001830914839902073, "loss": 0.18532417714595795, "mean_token_accuracy": 0.9275024235248566, "num_tokens": 36476524.0, "step": 2957 }, { "entropy": 1.21820667386055, "epoch": 1.5576619273301737, "grad_norm": 0.28611740469932556, "learning_rate": 0.0001830786871064429, "loss": 0.1948256492614746, "mean_token_accuracy": 0.918529212474823, "num_tokens": 36488860.0, "step": 2958 }, { "entropy": 1.2262729704380035, "epoch": 1.5581885202738284, "grad_norm": 0.31858813762664795, "learning_rate": 0.00018306588588442278, "loss": 0.21474799513816833, "mean_token_accuracy": 0.9137346744537354, "num_tokens": 36501196.0, "step": 2959 }, { "entropy": 1.2295315265655518, "epoch": 1.5587151132174828, "grad_norm": 0.2632119357585907, "learning_rate": 0.00018305308032490688, "loss": 0.17983609437942505, "mean_token_accuracy": 0.9228373020887375, "num_tokens": 36513532.0, "step": 2960 }, { "entropy": 1.1716614663600922, "epoch": 1.5592417061611374, "grad_norm": 0.29031118750572205, "learning_rate": 0.0001830402704286554, "loss": 0.2138049602508545, "mean_token_accuracy": 0.9134559780359268, "num_tokens": 36525868.0, "step": 2961 }, { "entropy": 1.223358392715454, "epoch": 1.559768299104792, "grad_norm": 0.2957732677459717, "learning_rate": 0.00018302745619642874, "loss": 0.20625029504299164, "mean_token_accuracy": 0.9132367968559265, "num_tokens": 36538204.0, "step": 2962 }, { "entropy": 1.2663150429725647, "epoch": 1.5602948920484465, "grad_norm": 0.28148961067199707, "learning_rate": 0.00018301463762898765, "loss": 0.21098777651786804, "mean_token_accuracy": 0.9172250628471375, "num_tokens": 36550540.0, "step": 2963 }, { "entropy": 1.20645871758461, "epoch": 1.5608214849921012, "grad_norm": 0.25845208764076233, "learning_rate": 0.0001830018147270931, "loss": 0.18882045149803162, "mean_token_accuracy": 0.9250784367322922, "num_tokens": 36562876.0, "step": 2964 }, { "entropy": 1.2523989081382751, "epoch": 1.5613480779357558, "grad_norm": 0.2542496919631958, "learning_rate": 0.0001829889874915063, "loss": 0.19145433604717255, "mean_token_accuracy": 0.9239866137504578, "num_tokens": 36575212.0, "step": 2965 }, { "entropy": 1.262599766254425, "epoch": 1.5618746708794102, "grad_norm": 0.25594037771224976, "learning_rate": 0.00018297615592298872, "loss": 0.18396718800067902, "mean_token_accuracy": 0.9223331660032272, "num_tokens": 36587548.0, "step": 2966 }, { "entropy": 1.2905260622501373, "epoch": 1.5624012638230647, "grad_norm": 0.2649231255054474, "learning_rate": 0.00018296332002230208, "loss": 0.2021484375, "mean_token_accuracy": 0.9192336350679398, "num_tokens": 36599884.0, "step": 2967 }, { "entropy": 1.3087227940559387, "epoch": 1.5629278567667193, "grad_norm": 0.2674988806247711, "learning_rate": 0.00018295047979020843, "loss": 0.20633465051651, "mean_token_accuracy": 0.9197041392326355, "num_tokens": 36612220.0, "step": 2968 }, { "entropy": 1.2428779602050781, "epoch": 1.563454449710374, "grad_norm": 0.3095720112323761, "learning_rate": 0.00018293763522746995, "loss": 0.21707621216773987, "mean_token_accuracy": 0.909159705042839, "num_tokens": 36624556.0, "step": 2969 }, { "entropy": 1.2382693886756897, "epoch": 1.5639810426540284, "grad_norm": 0.2674081325531006, "learning_rate": 0.0001829247863348492, "loss": 0.19426822662353516, "mean_token_accuracy": 0.9186785072088242, "num_tokens": 36636892.0, "step": 2970 }, { "entropy": 1.3028753995895386, "epoch": 1.564507635597683, "grad_norm": 0.32122448086738586, "learning_rate": 0.0001829119331131089, "loss": 0.20461226999759674, "mean_token_accuracy": 0.9157003164291382, "num_tokens": 36649228.0, "step": 2971 }, { "entropy": 1.2865008413791656, "epoch": 1.5650342285413377, "grad_norm": 0.2696692645549774, "learning_rate": 0.0001828990755630121, "loss": 0.21100306510925293, "mean_token_accuracy": 0.9124954044818878, "num_tokens": 36661564.0, "step": 2972 }, { "entropy": 1.2516160607337952, "epoch": 1.565560821484992, "grad_norm": 0.2710763216018677, "learning_rate": 0.0001828862136853221, "loss": 0.1940108835697174, "mean_token_accuracy": 0.9198983609676361, "num_tokens": 36673900.0, "step": 2973 }, { "entropy": 1.286393016576767, "epoch": 1.5660874144286465, "grad_norm": 0.2848055958747864, "learning_rate": 0.00018287334748080236, "loss": 0.20404544472694397, "mean_token_accuracy": 0.9162185341119766, "num_tokens": 36686236.0, "step": 2974 }, { "entropy": 1.3426242470741272, "epoch": 1.5666140073723012, "grad_norm": 0.2882706820964813, "learning_rate": 0.00018286047695021678, "loss": 0.22008925676345825, "mean_token_accuracy": 0.9098223000764847, "num_tokens": 36698572.0, "step": 2975 }, { "entropy": 1.3892289400100708, "epoch": 1.5671406003159558, "grad_norm": 0.3032713532447815, "learning_rate": 0.0001828476020943293, "loss": 0.20148518681526184, "mean_token_accuracy": 0.9154692888259888, "num_tokens": 36710908.0, "step": 2976 }, { "entropy": 1.3957372307777405, "epoch": 1.5676671932596102, "grad_norm": 0.29055866599082947, "learning_rate": 0.0001828347229139043, "loss": 0.21428599953651428, "mean_token_accuracy": 0.9150131195783615, "num_tokens": 36723244.0, "step": 2977 }, { "entropy": 1.3814803957939148, "epoch": 1.5681937862032649, "grad_norm": 0.32633841037750244, "learning_rate": 0.00018282183940970627, "loss": 0.21884474158287048, "mean_token_accuracy": 0.9115358591079712, "num_tokens": 36735580.0, "step": 2978 }, { "entropy": 1.4007826447486877, "epoch": 1.5687203791469195, "grad_norm": 0.25024279952049255, "learning_rate": 0.00018280895158250012, "loss": 0.1829865425825119, "mean_token_accuracy": 0.9268663376569748, "num_tokens": 36747916.0, "step": 2979 }, { "entropy": 1.4274977445602417, "epoch": 1.569246972090574, "grad_norm": 0.3046821057796478, "learning_rate": 0.00018279605943305084, "loss": 0.2076328843832016, "mean_token_accuracy": 0.9161526709794998, "num_tokens": 36760252.0, "step": 2980 }, { "entropy": 1.3855017125606537, "epoch": 1.5697735650342284, "grad_norm": 0.3147059381008148, "learning_rate": 0.0001827831629621238, "loss": 0.21519812941551208, "mean_token_accuracy": 0.911521315574646, "num_tokens": 36772588.0, "step": 2981 }, { "entropy": 1.400354415178299, "epoch": 1.5703001579778832, "grad_norm": 0.264636367559433, "learning_rate": 0.00018277026217048464, "loss": 0.18982136249542236, "mean_token_accuracy": 0.9241060167551041, "num_tokens": 36784924.0, "step": 2982 }, { "entropy": 1.3857916295528412, "epoch": 1.5708267509215377, "grad_norm": 0.2669126093387604, "learning_rate": 0.0001827573570588991, "loss": 0.18247658014297485, "mean_token_accuracy": 0.927479475736618, "num_tokens": 36797260.0, "step": 2983 }, { "entropy": 1.3634335398674011, "epoch": 1.571353343865192, "grad_norm": 0.2893115282058716, "learning_rate": 0.00018274444762813333, "loss": 0.21217575669288635, "mean_token_accuracy": 0.9115361571311951, "num_tokens": 36809596.0, "step": 2984 }, { "entropy": 1.4070159196853638, "epoch": 1.5718799368088467, "grad_norm": 0.28923332691192627, "learning_rate": 0.0001827315338789537, "loss": 0.20832975208759308, "mean_token_accuracy": 0.9146668463945389, "num_tokens": 36821932.0, "step": 2985 }, { "entropy": 1.3532110452651978, "epoch": 1.5724065297525014, "grad_norm": 0.31392931938171387, "learning_rate": 0.00018271861581212686, "loss": 0.22782333195209503, "mean_token_accuracy": 0.9090021848678589, "num_tokens": 36834268.0, "step": 2986 }, { "entropy": 1.3118796646595001, "epoch": 1.5729331226961558, "grad_norm": 0.266999751329422, "learning_rate": 0.00018270569342841958, "loss": 0.18851986527442932, "mean_token_accuracy": 0.9194877445697784, "num_tokens": 36846604.0, "step": 2987 }, { "entropy": 1.312853455543518, "epoch": 1.5734597156398105, "grad_norm": 0.31233277916908264, "learning_rate": 0.00018269276672859905, "loss": 0.2123054414987564, "mean_token_accuracy": 0.913995623588562, "num_tokens": 36858940.0, "step": 2988 }, { "entropy": 1.3079098761081696, "epoch": 1.573986308583465, "grad_norm": 0.32085880637168884, "learning_rate": 0.0001826798357134327, "loss": 0.20270395278930664, "mean_token_accuracy": 0.9202222973108292, "num_tokens": 36871276.0, "step": 2989 }, { "entropy": 1.2647546529769897, "epoch": 1.5745129015271195, "grad_norm": 0.28355729579925537, "learning_rate": 0.00018266690038368805, "loss": 0.21255768835544586, "mean_token_accuracy": 0.9135896861553192, "num_tokens": 36883612.0, "step": 2990 }, { "entropy": 1.3451344072818756, "epoch": 1.575039494470774, "grad_norm": 0.2934354543685913, "learning_rate": 0.00018265396074013308, "loss": 0.1980549544095993, "mean_token_accuracy": 0.9198568016290665, "num_tokens": 36895948.0, "step": 2991 }, { "entropy": 1.3011061251163483, "epoch": 1.5755660874144286, "grad_norm": 0.2980000674724579, "learning_rate": 0.00018264101678353592, "loss": 0.217035174369812, "mean_token_accuracy": 0.9113334864377975, "num_tokens": 36908284.0, "step": 2992 }, { "entropy": 1.3149963021278381, "epoch": 1.5760926803580833, "grad_norm": 0.2599365711212158, "learning_rate": 0.000182628068514665, "loss": 0.18322350084781647, "mean_token_accuracy": 0.9244182854890823, "num_tokens": 36920620.0, "step": 2993 }, { "entropy": 1.2898566722869873, "epoch": 1.5766192733017377, "grad_norm": 0.2668352425098419, "learning_rate": 0.0001826151159342889, "loss": 0.21018338203430176, "mean_token_accuracy": 0.915318638086319, "num_tokens": 36932956.0, "step": 2994 }, { "entropy": 1.3840532004833221, "epoch": 1.5771458662453923, "grad_norm": 0.3147556781768799, "learning_rate": 0.00018260215904317666, "loss": 0.19453351199626923, "mean_token_accuracy": 0.9237265735864639, "num_tokens": 36945292.0, "step": 2995 }, { "entropy": 1.3175931572914124, "epoch": 1.577672459189047, "grad_norm": 0.2718995213508606, "learning_rate": 0.00018258919784209737, "loss": 0.20508694648742676, "mean_token_accuracy": 0.9145184606313705, "num_tokens": 36957628.0, "step": 2996 }, { "entropy": 1.270597904920578, "epoch": 1.5781990521327014, "grad_norm": 0.28836652636528015, "learning_rate": 0.0001825762323318205, "loss": 0.21483203768730164, "mean_token_accuracy": 0.9124789834022522, "num_tokens": 36969964.0, "step": 2997 }, { "entropy": 1.295089215040207, "epoch": 1.5787256450763558, "grad_norm": 0.2733713686466217, "learning_rate": 0.00018256326251311572, "loss": 0.20500729978084564, "mean_token_accuracy": 0.9173796772956848, "num_tokens": 36982300.0, "step": 2998 }, { "entropy": 1.337970644235611, "epoch": 1.5792522380200107, "grad_norm": 0.2778991162776947, "learning_rate": 0.00018255028838675297, "loss": 0.20565159618854523, "mean_token_accuracy": 0.9136320203542709, "num_tokens": 36994636.0, "step": 2999 }, { "entropy": 1.2989743649959564, "epoch": 1.5797788309636651, "grad_norm": 0.25889068841934204, "learning_rate": 0.00018253730995350246, "loss": 0.20373526215553284, "mean_token_accuracy": 0.9146820902824402, "num_tokens": 37006972.0, "step": 3000 }, { "entropy": 1.2905791997909546, "epoch": 1.5803054239073195, "grad_norm": 0.2675490081310272, "learning_rate": 0.00018252432721413463, "loss": 0.1987248659133911, "mean_token_accuracy": 0.9181516915559769, "num_tokens": 37019308.0, "step": 3001 }, { "entropy": 1.361492395401001, "epoch": 1.5808320168509742, "grad_norm": 0.2765367329120636, "learning_rate": 0.00018251134016942017, "loss": 0.2040756493806839, "mean_token_accuracy": 0.9120943993330002, "num_tokens": 37031644.0, "step": 3002 }, { "entropy": 1.315775990486145, "epoch": 1.5813586097946288, "grad_norm": 0.29613080620765686, "learning_rate": 0.00018249834882013013, "loss": 0.22368191182613373, "mean_token_accuracy": 0.9061230272054672, "num_tokens": 37043980.0, "step": 3003 }, { "entropy": 1.3352965414524078, "epoch": 1.5818852027382833, "grad_norm": 0.27554982900619507, "learning_rate": 0.0001824853531670356, "loss": 0.19793741405010223, "mean_token_accuracy": 0.9158347100019455, "num_tokens": 37056316.0, "step": 3004 }, { "entropy": 1.316037505865097, "epoch": 1.582411795681938, "grad_norm": 0.27454736828804016, "learning_rate": 0.00018247235321090818, "loss": 0.18979346752166748, "mean_token_accuracy": 0.9240574240684509, "num_tokens": 37068652.0, "step": 3005 }, { "entropy": 1.3708411157131195, "epoch": 1.5829383886255926, "grad_norm": 0.3125503361225128, "learning_rate": 0.00018245934895251954, "loss": 0.2330584079027176, "mean_token_accuracy": 0.9037808179855347, "num_tokens": 37080988.0, "step": 3006 }, { "entropy": 1.3388588428497314, "epoch": 1.583464981569247, "grad_norm": 0.26093074679374695, "learning_rate": 0.00018244634039264168, "loss": 0.18843436241149902, "mean_token_accuracy": 0.9198068231344223, "num_tokens": 37093324.0, "step": 3007 }, { "entropy": 1.329328566789627, "epoch": 1.5839915745129014, "grad_norm": 0.263508141040802, "learning_rate": 0.00018243332753204683, "loss": 0.1939357966184616, "mean_token_accuracy": 0.9173231720924377, "num_tokens": 37105660.0, "step": 3008 }, { "entropy": 1.3546556532382965, "epoch": 1.584518167456556, "grad_norm": 0.30631089210510254, "learning_rate": 0.00018242031037150753, "loss": 0.21186725795269012, "mean_token_accuracy": 0.9202042520046234, "num_tokens": 37117996.0, "step": 3009 }, { "entropy": 1.3740338385105133, "epoch": 1.5850447604002107, "grad_norm": 0.2766059935092926, "learning_rate": 0.00018240728891179647, "loss": 0.21025089919567108, "mean_token_accuracy": 0.9121541678905487, "num_tokens": 37130332.0, "step": 3010 }, { "entropy": 1.3977608382701874, "epoch": 1.5855713533438651, "grad_norm": 0.2912761867046356, "learning_rate": 0.0001823942631536867, "loss": 0.19623880088329315, "mean_token_accuracy": 0.9209590405225754, "num_tokens": 37142668.0, "step": 3011 }, { "entropy": 1.3947394490242004, "epoch": 1.5860979462875198, "grad_norm": 0.2996085584163666, "learning_rate": 0.00018238123309795146, "loss": 0.21346694231033325, "mean_token_accuracy": 0.913955420255661, "num_tokens": 37155004.0, "step": 3012 }, { "entropy": 1.4347988963127136, "epoch": 1.5866245392311744, "grad_norm": 0.2614869475364685, "learning_rate": 0.0001823681987453643, "loss": 0.19650410115718842, "mean_token_accuracy": 0.9160020351409912, "num_tokens": 37167340.0, "step": 3013 }, { "entropy": 1.4444604516029358, "epoch": 1.5871511321748288, "grad_norm": 0.2813529074192047, "learning_rate": 0.00018235516009669898, "loss": 0.21237128973007202, "mean_token_accuracy": 0.9177996516227722, "num_tokens": 37179676.0, "step": 3014 }, { "entropy": 1.4176826477050781, "epoch": 1.5876777251184833, "grad_norm": 0.26034414768218994, "learning_rate": 0.00018234211715272952, "loss": 0.19177646934986115, "mean_token_accuracy": 0.9230294227600098, "num_tokens": 37192012.0, "step": 3015 }, { "entropy": 1.4028598964214325, "epoch": 1.5882043180621381, "grad_norm": 0.24113664031028748, "learning_rate": 0.00018232906991423015, "loss": 0.18486344814300537, "mean_token_accuracy": 0.9242925494909286, "num_tokens": 37204348.0, "step": 3016 }, { "entropy": 1.4833852052688599, "epoch": 1.5887309110057926, "grad_norm": 0.2903052866458893, "learning_rate": 0.00018231601838197551, "loss": 0.21897634863853455, "mean_token_accuracy": 0.913661926984787, "num_tokens": 37216684.0, "step": 3017 }, { "entropy": 1.4880701303482056, "epoch": 1.589257503949447, "grad_norm": 0.27285730838775635, "learning_rate": 0.00018230296255674039, "loss": 0.20681525766849518, "mean_token_accuracy": 0.9199357628822327, "num_tokens": 37229020.0, "step": 3018 }, { "entropy": 1.499198168516159, "epoch": 1.5897840968931016, "grad_norm": 0.26768195629119873, "learning_rate": 0.00018228990243929972, "loss": 0.1827520728111267, "mean_token_accuracy": 0.9268405586481094, "num_tokens": 37241356.0, "step": 3019 }, { "entropy": 1.4143783450126648, "epoch": 1.5903106898367563, "grad_norm": 0.24908189475536346, "learning_rate": 0.00018227683803042895, "loss": 0.1842612624168396, "mean_token_accuracy": 0.9244772493839264, "num_tokens": 37253692.0, "step": 3020 }, { "entropy": 1.4475407600402832, "epoch": 1.5908372827804107, "grad_norm": 0.2763029634952545, "learning_rate": 0.0001822637693309035, "loss": 0.20840662717819214, "mean_token_accuracy": 0.9138160645961761, "num_tokens": 37266028.0, "step": 3021 }, { "entropy": 1.4383432567119598, "epoch": 1.5913638757240653, "grad_norm": 0.26852625608444214, "learning_rate": 0.00018225069634149929, "loss": 0.18256303668022156, "mean_token_accuracy": 0.9246383905410767, "num_tokens": 37278364.0, "step": 3022 }, { "entropy": 1.4704687893390656, "epoch": 1.59189046866772, "grad_norm": 0.2806725800037384, "learning_rate": 0.00018223761906299233, "loss": 0.20903661847114563, "mean_token_accuracy": 0.9137071222066879, "num_tokens": 37290700.0, "step": 3023 }, { "entropy": 1.459957629442215, "epoch": 1.5924170616113744, "grad_norm": 0.2818518280982971, "learning_rate": 0.00018222453749615897, "loss": 0.19897016882896423, "mean_token_accuracy": 0.9180968701839447, "num_tokens": 37303036.0, "step": 3024 }, { "entropy": 1.4267137944698334, "epoch": 1.5929436545550288, "grad_norm": 0.27753016352653503, "learning_rate": 0.0001822114516417758, "loss": 0.19683846831321716, "mean_token_accuracy": 0.9210103005170822, "num_tokens": 37315372.0, "step": 3025 }, { "entropy": 1.4476919174194336, "epoch": 1.5934702474986835, "grad_norm": 0.31564968824386597, "learning_rate": 0.00018219836150061957, "loss": 0.2070121020078659, "mean_token_accuracy": 0.9174090623855591, "num_tokens": 37327708.0, "step": 3026 }, { "entropy": 1.4439688622951508, "epoch": 1.5939968404423381, "grad_norm": 0.30953073501586914, "learning_rate": 0.00018218526707346745, "loss": 0.20584158599376678, "mean_token_accuracy": 0.9158007055521011, "num_tokens": 37340044.0, "step": 3027 }, { "entropy": 1.3989494144916534, "epoch": 1.5945234333859926, "grad_norm": 0.2637103497982025, "learning_rate": 0.0001821721683610968, "loss": 0.1927478164434433, "mean_token_accuracy": 0.9223356992006302, "num_tokens": 37352380.0, "step": 3028 }, { "entropy": 1.4854789972305298, "epoch": 1.5950500263296472, "grad_norm": 0.36630088090896606, "learning_rate": 0.0001821590653642851, "loss": 0.20990176498889923, "mean_token_accuracy": 0.9147738516330719, "num_tokens": 37364716.0, "step": 3029 }, { "entropy": 1.4564665853977203, "epoch": 1.5955766192733019, "grad_norm": 0.26051509380340576, "learning_rate": 0.00018214595808381027, "loss": 0.18453973531723022, "mean_token_accuracy": 0.9241913110017776, "num_tokens": 37377052.0, "step": 3030 }, { "entropy": 1.4754319489002228, "epoch": 1.5961032122169563, "grad_norm": 0.29275190830230713, "learning_rate": 0.00018213284652045044, "loss": 0.21073368191719055, "mean_token_accuracy": 0.9117372781038284, "num_tokens": 37389388.0, "step": 3031 }, { "entropy": 1.4840569198131561, "epoch": 1.5966298051606107, "grad_norm": 0.3072666525840759, "learning_rate": 0.00018211973067498388, "loss": 0.21400286257266998, "mean_token_accuracy": 0.9100693017244339, "num_tokens": 37401724.0, "step": 3032 }, { "entropy": 1.4717089235782623, "epoch": 1.5971563981042654, "grad_norm": 0.2699028551578522, "learning_rate": 0.00018210661054818928, "loss": 0.19959458708763123, "mean_token_accuracy": 0.9229124337434769, "num_tokens": 37414060.0, "step": 3033 }, { "entropy": 1.4640864431858063, "epoch": 1.59768299104792, "grad_norm": 0.2825060486793518, "learning_rate": 0.00018209348614084552, "loss": 0.20268788933753967, "mean_token_accuracy": 0.9144919216632843, "num_tokens": 37426396.0, "step": 3034 }, { "entropy": 1.4468800127506256, "epoch": 1.5982095839915744, "grad_norm": 0.2595546841621399, "learning_rate": 0.00018208035745373164, "loss": 0.19899562001228333, "mean_token_accuracy": 0.9162727296352386, "num_tokens": 37438732.0, "step": 3035 }, { "entropy": 1.350676715373993, "epoch": 1.598736176935229, "grad_norm": 0.24199891090393066, "learning_rate": 0.00018206722448762709, "loss": 0.1900622546672821, "mean_token_accuracy": 0.9200112372636795, "num_tokens": 37451068.0, "step": 3036 }, { "entropy": 1.400856375694275, "epoch": 1.5992627698788837, "grad_norm": 0.27306118607521057, "learning_rate": 0.00018205408724331141, "loss": 0.20936831831932068, "mean_token_accuracy": 0.914875254034996, "num_tokens": 37463404.0, "step": 3037 }, { "entropy": 1.4073627889156342, "epoch": 1.5997893628225381, "grad_norm": 0.2765679359436035, "learning_rate": 0.00018204094572156458, "loss": 0.20035390555858612, "mean_token_accuracy": 0.9182957410812378, "num_tokens": 37475740.0, "step": 3038 }, { "entropy": 1.3531818389892578, "epoch": 1.6003159557661928, "grad_norm": 0.2836569845676422, "learning_rate": 0.00018202779992316668, "loss": 0.19704091548919678, "mean_token_accuracy": 0.9173637330532074, "num_tokens": 37488076.0, "step": 3039 }, { "entropy": 1.3923197388648987, "epoch": 1.6008425487098474, "grad_norm": 0.27982088923454285, "learning_rate": 0.0001820146498488981, "loss": 0.1999388188123703, "mean_token_accuracy": 0.9147376418113708, "num_tokens": 37500412.0, "step": 3040 }, { "entropy": 1.3494668304920197, "epoch": 1.6013691416535019, "grad_norm": 0.26349878311157227, "learning_rate": 0.00018200149549953948, "loss": 0.18103967607021332, "mean_token_accuracy": 0.9260935634374619, "num_tokens": 37512748.0, "step": 3041 }, { "entropy": 1.3204819858074188, "epoch": 1.6018957345971563, "grad_norm": 0.25867944955825806, "learning_rate": 0.00018198833687587174, "loss": 0.1823253035545349, "mean_token_accuracy": 0.9261195659637451, "num_tokens": 37525084.0, "step": 3042 }, { "entropy": 1.3195437788963318, "epoch": 1.602422327540811, "grad_norm": 0.2801850736141205, "learning_rate": 0.000181975173978676, "loss": 0.20542439818382263, "mean_token_accuracy": 0.923522487282753, "num_tokens": 37537420.0, "step": 3043 }, { "entropy": 1.2695345878601074, "epoch": 1.6029489204844656, "grad_norm": 0.2899746298789978, "learning_rate": 0.00018196200680873373, "loss": 0.20561306178569794, "mean_token_accuracy": 0.9245081543922424, "num_tokens": 37549756.0, "step": 3044 }, { "entropy": 1.3507100939750671, "epoch": 1.60347551342812, "grad_norm": 0.2811649739742279, "learning_rate": 0.00018194883536682647, "loss": 0.1866132616996765, "mean_token_accuracy": 0.9258896708488464, "num_tokens": 37562092.0, "step": 3045 }, { "entropy": 1.3393961191177368, "epoch": 1.6040021063717746, "grad_norm": 0.28140196204185486, "learning_rate": 0.0001819356596537363, "loss": 0.20368412137031555, "mean_token_accuracy": 0.9165063202381134, "num_tokens": 37574428.0, "step": 3046 }, { "entropy": 1.359088659286499, "epoch": 1.6045286993154293, "grad_norm": 0.27477335929870605, "learning_rate": 0.0001819224796702452, "loss": 0.19396814703941345, "mean_token_accuracy": 0.9202080518007278, "num_tokens": 37586764.0, "step": 3047 }, { "entropy": 1.3814587593078613, "epoch": 1.6050552922590837, "grad_norm": 0.29211121797561646, "learning_rate": 0.00018190929541713572, "loss": 0.20291253924369812, "mean_token_accuracy": 0.9152930378913879, "num_tokens": 37599100.0, "step": 3048 }, { "entropy": 1.3579456806182861, "epoch": 1.6055818852027381, "grad_norm": 0.28613388538360596, "learning_rate": 0.0001818961068951905, "loss": 0.20026324689388275, "mean_token_accuracy": 0.9189726412296295, "num_tokens": 37611436.0, "step": 3049 }, { "entropy": 1.3749539852142334, "epoch": 1.6061084781463928, "grad_norm": 0.2683996558189392, "learning_rate": 0.00018188291410519244, "loss": 0.1952074021100998, "mean_token_accuracy": 0.920792356133461, "num_tokens": 37623772.0, "step": 3050 }, { "entropy": 1.3418311476707458, "epoch": 1.6066350710900474, "grad_norm": 0.2496364861726761, "learning_rate": 0.00018186971704792473, "loss": 0.1910889744758606, "mean_token_accuracy": 0.922058030962944, "num_tokens": 37636108.0, "step": 3051 }, { "entropy": 1.4323306381702423, "epoch": 1.6071616640337019, "grad_norm": 0.29833361506462097, "learning_rate": 0.00018185651572417082, "loss": 0.2218259572982788, "mean_token_accuracy": 0.9126611351966858, "num_tokens": 37648444.0, "step": 3052 }, { "entropy": 1.4041076600551605, "epoch": 1.6076882569773565, "grad_norm": 0.268341600894928, "learning_rate": 0.00018184331013471435, "loss": 0.1920214593410492, "mean_token_accuracy": 0.921149805188179, "num_tokens": 37660780.0, "step": 3053 }, { "entropy": 1.425819456577301, "epoch": 1.6082148499210112, "grad_norm": 0.2559536099433899, "learning_rate": 0.00018183010028033936, "loss": 0.190832257270813, "mean_token_accuracy": 0.9199120700359344, "num_tokens": 37673116.0, "step": 3054 }, { "entropy": 1.434893399477005, "epoch": 1.6087414428646656, "grad_norm": 0.2749493420124054, "learning_rate": 0.0001818168861618299, "loss": 0.2014118880033493, "mean_token_accuracy": 0.919294461607933, "num_tokens": 37685452.0, "step": 3055 }, { "entropy": 1.438273936510086, "epoch": 1.60926803580832, "grad_norm": 0.275410532951355, "learning_rate": 0.00018180366777997053, "loss": 0.19788864254951477, "mean_token_accuracy": 0.9188237637281418, "num_tokens": 37697788.0, "step": 3056 }, { "entropy": 1.432799518108368, "epoch": 1.6097946287519749, "grad_norm": 0.2629889249801636, "learning_rate": 0.00018179044513554592, "loss": 0.19507870078086853, "mean_token_accuracy": 0.9229663461446762, "num_tokens": 37710124.0, "step": 3057 }, { "entropy": 1.4455545842647552, "epoch": 1.6103212216956293, "grad_norm": 0.26387691497802734, "learning_rate": 0.00018177721822934097, "loss": 0.19666314125061035, "mean_token_accuracy": 0.9165372550487518, "num_tokens": 37722460.0, "step": 3058 }, { "entropy": 1.4410416781902313, "epoch": 1.6108478146392837, "grad_norm": 0.2629290819168091, "learning_rate": 0.00018176398706214094, "loss": 0.19509999454021454, "mean_token_accuracy": 0.9173319488763809, "num_tokens": 37734796.0, "step": 3059 }, { "entropy": 1.4279845058918, "epoch": 1.6113744075829384, "grad_norm": 0.2658042311668396, "learning_rate": 0.0001817507516347313, "loss": 0.19231608510017395, "mean_token_accuracy": 0.9192933142185211, "num_tokens": 37747132.0, "step": 3060 }, { "entropy": 1.4642042517662048, "epoch": 1.611901000526593, "grad_norm": 0.28102269768714905, "learning_rate": 0.0001817375119478977, "loss": 0.20499512553215027, "mean_token_accuracy": 0.9162133932113647, "num_tokens": 37759468.0, "step": 3061 }, { "entropy": 1.4484304189682007, "epoch": 1.6124275934702474, "grad_norm": 0.27475789189338684, "learning_rate": 0.00018172426800242613, "loss": 0.20957040786743164, "mean_token_accuracy": 0.9155688285827637, "num_tokens": 37771804.0, "step": 3062 }, { "entropy": 1.482906699180603, "epoch": 1.612954186413902, "grad_norm": 0.29586583375930786, "learning_rate": 0.00018171101979910282, "loss": 0.22400207817554474, "mean_token_accuracy": 0.909784346818924, "num_tokens": 37784140.0, "step": 3063 }, { "entropy": 1.4169412851333618, "epoch": 1.6134807793575567, "grad_norm": 0.27837517857551575, "learning_rate": 0.00018169776733871422, "loss": 0.20341360569000244, "mean_token_accuracy": 0.9175834655761719, "num_tokens": 37796476.0, "step": 3064 }, { "entropy": 1.4276740849018097, "epoch": 1.6140073723012112, "grad_norm": 0.2935931086540222, "learning_rate": 0.00018168451062204705, "loss": 0.2186911404132843, "mean_token_accuracy": 0.9123528748750687, "num_tokens": 37808812.0, "step": 3065 }, { "entropy": 1.365132212638855, "epoch": 1.6145339652448656, "grad_norm": 0.28768110275268555, "learning_rate": 0.0001816712496498883, "loss": 0.200998455286026, "mean_token_accuracy": 0.9152180403470993, "num_tokens": 37821148.0, "step": 3066 }, { "entropy": 1.3745067417621613, "epoch": 1.6150605581885202, "grad_norm": 0.27627506852149963, "learning_rate": 0.0001816579844230252, "loss": 0.18625864386558533, "mean_token_accuracy": 0.924001932144165, "num_tokens": 37833484.0, "step": 3067 }, { "entropy": 1.4378848373889923, "epoch": 1.6155871511321749, "grad_norm": 0.2882876992225647, "learning_rate": 0.00018164471494224523, "loss": 0.2090378701686859, "mean_token_accuracy": 0.9168783128261566, "num_tokens": 37845820.0, "step": 3068 }, { "entropy": 1.3996251821517944, "epoch": 1.6161137440758293, "grad_norm": 0.2672761380672455, "learning_rate": 0.00018163144120833608, "loss": 0.1835557073354721, "mean_token_accuracy": 0.9194261729717255, "num_tokens": 37858156.0, "step": 3069 }, { "entropy": 1.4170182049274445, "epoch": 1.616640337019484, "grad_norm": 0.27003446221351624, "learning_rate": 0.0001816181632220858, "loss": 0.19711357355117798, "mean_token_accuracy": 0.9203603714704514, "num_tokens": 37870492.0, "step": 3070 }, { "entropy": 1.3691149055957794, "epoch": 1.6171669299631386, "grad_norm": 0.3474653661251068, "learning_rate": 0.00018160488098428257, "loss": 0.20167282223701477, "mean_token_accuracy": 0.9143191576004028, "num_tokens": 37882828.0, "step": 3071 }, { "entropy": 1.4236225485801697, "epoch": 1.617693522906793, "grad_norm": 0.2758263349533081, "learning_rate": 0.00018159159449571488, "loss": 0.17881087958812714, "mean_token_accuracy": 0.9302650541067123, "num_tokens": 37895164.0, "step": 3072 }, { "entropy": 1.3676467835903168, "epoch": 1.6182201158504474, "grad_norm": 0.2386929839849472, "learning_rate": 0.00018157830375717152, "loss": 0.17412015795707703, "mean_token_accuracy": 0.9283822029829025, "num_tokens": 37907500.0, "step": 3073 }, { "entropy": 1.3564641177654266, "epoch": 1.6187467087941023, "grad_norm": 0.27638673782348633, "learning_rate": 0.00018156500876944146, "loss": 0.19623751938343048, "mean_token_accuracy": 0.9200726747512817, "num_tokens": 37919836.0, "step": 3074 }, { "entropy": 1.3610458672046661, "epoch": 1.6192733017377567, "grad_norm": 0.26332005858421326, "learning_rate": 0.00018155170953331395, "loss": 0.20123399794101715, "mean_token_accuracy": 0.9213415533304214, "num_tokens": 37932172.0, "step": 3075 }, { "entropy": 1.3856143057346344, "epoch": 1.6197998946814112, "grad_norm": 0.271820604801178, "learning_rate": 0.00018153840604957845, "loss": 0.20177248120307922, "mean_token_accuracy": 0.9182474464178085, "num_tokens": 37944508.0, "step": 3076 }, { "entropy": 1.4035983979701996, "epoch": 1.6203264876250658, "grad_norm": 0.2817936837673187, "learning_rate": 0.00018152509831902475, "loss": 0.20706719160079956, "mean_token_accuracy": 0.9193074107170105, "num_tokens": 37956844.0, "step": 3077 }, { "entropy": 1.3983607590198517, "epoch": 1.6208530805687205, "grad_norm": 0.28577920794487, "learning_rate": 0.00018151178634244285, "loss": 0.20233751833438873, "mean_token_accuracy": 0.9215396642684937, "num_tokens": 37969180.0, "step": 3078 }, { "entropy": 1.3775334060192108, "epoch": 1.6213796735123749, "grad_norm": 0.27165067195892334, "learning_rate": 0.00018149847012062303, "loss": 0.20568159222602844, "mean_token_accuracy": 0.9150748550891876, "num_tokens": 37981516.0, "step": 3079 }, { "entropy": 1.3893254697322845, "epoch": 1.6219062664560295, "grad_norm": 0.2963791489601135, "learning_rate": 0.0001814851496543557, "loss": 0.2330780327320099, "mean_token_accuracy": 0.9025420695543289, "num_tokens": 37993852.0, "step": 3080 }, { "entropy": 1.413798749446869, "epoch": 1.6224328593996842, "grad_norm": 0.28095170855522156, "learning_rate": 0.00018147182494443175, "loss": 0.21211260557174683, "mean_token_accuracy": 0.9117957949638367, "num_tokens": 38006188.0, "step": 3081 }, { "entropy": 1.3956659436225891, "epoch": 1.6229594523433386, "grad_norm": 0.24814847111701965, "learning_rate": 0.00018145849599164205, "loss": 0.19040384888648987, "mean_token_accuracy": 0.9219196736812592, "num_tokens": 38018524.0, "step": 3082 }, { "entropy": 1.4209897816181183, "epoch": 1.623486045286993, "grad_norm": 0.2665543854236603, "learning_rate": 0.00018144516279677798, "loss": 0.17405079305171967, "mean_token_accuracy": 0.9293960332870483, "num_tokens": 38030860.0, "step": 3083 }, { "entropy": 1.4261830151081085, "epoch": 1.6240126382306477, "grad_norm": 0.25339123606681824, "learning_rate": 0.000181431825360631, "loss": 0.19218730926513672, "mean_token_accuracy": 0.923881396651268, "num_tokens": 38043196.0, "step": 3084 }, { "entropy": 1.4016647636890411, "epoch": 1.6245392311743023, "grad_norm": 0.2759294807910919, "learning_rate": 0.00018141848368399287, "loss": 0.2100793719291687, "mean_token_accuracy": 0.917973980307579, "num_tokens": 38055532.0, "step": 3085 }, { "entropy": 1.4507297277450562, "epoch": 1.6250658241179567, "grad_norm": 0.2608982026576996, "learning_rate": 0.00018140513776765564, "loss": 0.19737984240055084, "mean_token_accuracy": 0.9216252714395523, "num_tokens": 38067868.0, "step": 3086 }, { "entropy": 1.3792197108268738, "epoch": 1.6255924170616114, "grad_norm": 0.24353928864002228, "learning_rate": 0.00018139178761241155, "loss": 0.18090927600860596, "mean_token_accuracy": 0.9230251908302307, "num_tokens": 38080204.0, "step": 3087 }, { "entropy": 1.4379716217517853, "epoch": 1.626119010005266, "grad_norm": 0.2893258035182953, "learning_rate": 0.00018137843321905316, "loss": 0.1988956481218338, "mean_token_accuracy": 0.9219255745410919, "num_tokens": 38092540.0, "step": 3088 }, { "entropy": 1.451730102300644, "epoch": 1.6266456029489205, "grad_norm": 0.2763747572898865, "learning_rate": 0.00018136507458837317, "loss": 0.20928485691547394, "mean_token_accuracy": 0.9120761156082153, "num_tokens": 38104876.0, "step": 3089 }, { "entropy": 1.3144610822200775, "epoch": 1.627172195892575, "grad_norm": 0.2689838111400604, "learning_rate": 0.00018135171172116465, "loss": 0.18982107937335968, "mean_token_accuracy": 0.9245468080043793, "num_tokens": 38117212.0, "step": 3090 }, { "entropy": 1.4066085815429688, "epoch": 1.6276987888362298, "grad_norm": 0.30367499589920044, "learning_rate": 0.0001813383446182209, "loss": 0.22956493496894836, "mean_token_accuracy": 0.9036817699670792, "num_tokens": 38129548.0, "step": 3091 }, { "entropy": 1.4063359797000885, "epoch": 1.6282253817798842, "grad_norm": 0.28438472747802734, "learning_rate": 0.0001813249732803354, "loss": 0.20594382286071777, "mean_token_accuracy": 0.9164040237665176, "num_tokens": 38141884.0, "step": 3092 }, { "entropy": 1.3957843482494354, "epoch": 1.6287519747235386, "grad_norm": 0.2880820333957672, "learning_rate": 0.00018131159770830201, "loss": 0.21393732726573944, "mean_token_accuracy": 0.9140539467334747, "num_tokens": 38154220.0, "step": 3093 }, { "entropy": 1.378790944814682, "epoch": 1.6292785676671933, "grad_norm": 0.2896707057952881, "learning_rate": 0.00018129821790291464, "loss": 0.19451484084129333, "mean_token_accuracy": 0.9213518798351288, "num_tokens": 38166556.0, "step": 3094 }, { "entropy": 1.3447534143924713, "epoch": 1.629805160610848, "grad_norm": 0.2766105532646179, "learning_rate": 0.00018128483386496767, "loss": 0.18321573734283447, "mean_token_accuracy": 0.9283481389284134, "num_tokens": 38178892.0, "step": 3095 }, { "entropy": 1.3944838345050812, "epoch": 1.6303317535545023, "grad_norm": 0.2913741171360016, "learning_rate": 0.00018127144559525554, "loss": 0.21014010906219482, "mean_token_accuracy": 0.9120883643627167, "num_tokens": 38191228.0, "step": 3096 }, { "entropy": 1.368843674659729, "epoch": 1.630858346498157, "grad_norm": 0.29250389337539673, "learning_rate": 0.00018125805309457312, "loss": 0.18993695080280304, "mean_token_accuracy": 0.9213495254516602, "num_tokens": 38203564.0, "step": 3097 }, { "entropy": 1.3401963114738464, "epoch": 1.6313849394418116, "grad_norm": 0.2760806083679199, "learning_rate": 0.00018124465636371541, "loss": 0.19008806347846985, "mean_token_accuracy": 0.9225458651781082, "num_tokens": 38215900.0, "step": 3098 }, { "entropy": 1.2728153765201569, "epoch": 1.631911532385466, "grad_norm": 0.26979056000709534, "learning_rate": 0.0001812312554034777, "loss": 0.20473819971084595, "mean_token_accuracy": 0.9232187569141388, "num_tokens": 38228236.0, "step": 3099 }, { "entropy": 1.3584931790828705, "epoch": 1.6324381253291205, "grad_norm": 0.2959223687648773, "learning_rate": 0.00018121785021465552, "loss": 0.2270255982875824, "mean_token_accuracy": 0.905184268951416, "num_tokens": 38240572.0, "step": 3100 }, { "entropy": 1.3553913831710815, "epoch": 1.6329647182727751, "grad_norm": 0.26358816027641296, "learning_rate": 0.00018120444079804465, "loss": 0.20057646930217743, "mean_token_accuracy": 0.9184893518686295, "num_tokens": 38252908.0, "step": 3101 }, { "entropy": 1.3980708122253418, "epoch": 1.6334913112164298, "grad_norm": 0.2931104302406311, "learning_rate": 0.00018119102715444116, "loss": 0.21116019785404205, "mean_token_accuracy": 0.9135480672121048, "num_tokens": 38265244.0, "step": 3102 }, { "entropy": 1.4063577055931091, "epoch": 1.6340179041600842, "grad_norm": 0.2717793583869934, "learning_rate": 0.00018117760928464133, "loss": 0.20886561274528503, "mean_token_accuracy": 0.9101425409317017, "num_tokens": 38277580.0, "step": 3103 }, { "entropy": 1.4049569368362427, "epoch": 1.6345444971037388, "grad_norm": 0.2535911500453949, "learning_rate": 0.00018116418718944167, "loss": 0.1921328455209732, "mean_token_accuracy": 0.9207909554243088, "num_tokens": 38289916.0, "step": 3104 }, { "entropy": 1.4364557266235352, "epoch": 1.6350710900473935, "grad_norm": 0.2491796612739563, "learning_rate": 0.000181150760869639, "loss": 0.19639377295970917, "mean_token_accuracy": 0.9185868501663208, "num_tokens": 38302252.0, "step": 3105 }, { "entropy": 1.422313004732132, "epoch": 1.635597682991048, "grad_norm": 0.2487051635980606, "learning_rate": 0.00018113733032603036, "loss": 0.18390119075775146, "mean_token_accuracy": 0.9225007146596909, "num_tokens": 38314588.0, "step": 3106 }, { "entropy": 1.4768524467945099, "epoch": 1.6361242759347023, "grad_norm": 0.26604220271110535, "learning_rate": 0.000181123895559413, "loss": 0.18640431761741638, "mean_token_accuracy": 0.925470381975174, "num_tokens": 38326924.0, "step": 3107 }, { "entropy": 1.407800167798996, "epoch": 1.636650868878357, "grad_norm": 0.2594732642173767, "learning_rate": 0.00018111045657058454, "loss": 0.20143477618694305, "mean_token_accuracy": 0.9186883568763733, "num_tokens": 38339260.0, "step": 3108 }, { "entropy": 1.4646252691745758, "epoch": 1.6371774618220116, "grad_norm": 0.2773849666118622, "learning_rate": 0.00018109701336034272, "loss": 0.21977382898330688, "mean_token_accuracy": 0.9103269428014755, "num_tokens": 38351596.0, "step": 3109 }, { "entropy": 1.4419430792331696, "epoch": 1.637704054765666, "grad_norm": 0.2626135051250458, "learning_rate": 0.0001810835659294856, "loss": 0.19379013776779175, "mean_token_accuracy": 0.9196373075246811, "num_tokens": 38363932.0, "step": 3110 }, { "entropy": 1.5183590054512024, "epoch": 1.6382306477093207, "grad_norm": 0.2934761047363281, "learning_rate": 0.0001810701142788115, "loss": 0.1913427710533142, "mean_token_accuracy": 0.9219005703926086, "num_tokens": 38376268.0, "step": 3111 }, { "entropy": 1.4548234045505524, "epoch": 1.6387572406529753, "grad_norm": 0.2878572344779968, "learning_rate": 0.00018105665840911894, "loss": 0.19860300421714783, "mean_token_accuracy": 0.9160057157278061, "num_tokens": 38388604.0, "step": 3112 }, { "entropy": 1.4858933091163635, "epoch": 1.6392838335966298, "grad_norm": 0.3022295832633972, "learning_rate": 0.0001810431983212067, "loss": 0.20890842378139496, "mean_token_accuracy": 0.9164535999298096, "num_tokens": 38400940.0, "step": 3113 }, { "entropy": 1.4954878389835358, "epoch": 1.6398104265402842, "grad_norm": 0.2701857388019562, "learning_rate": 0.00018102973401587386, "loss": 0.19486674666404724, "mean_token_accuracy": 0.9214330017566681, "num_tokens": 38413276.0, "step": 3114 }, { "entropy": 1.4851151406764984, "epoch": 1.640337019483939, "grad_norm": 0.2806397080421448, "learning_rate": 0.0001810162654939197, "loss": 0.19537058472633362, "mean_token_accuracy": 0.9198283851146698, "num_tokens": 38425612.0, "step": 3115 }, { "entropy": 1.5154271125793457, "epoch": 1.6408636124275935, "grad_norm": 0.30362340807914734, "learning_rate": 0.00018100279275614378, "loss": 0.20024994015693665, "mean_token_accuracy": 0.9208974838256836, "num_tokens": 38437948.0, "step": 3116 }, { "entropy": 1.4964538216590881, "epoch": 1.641390205371248, "grad_norm": 0.27380117774009705, "learning_rate": 0.00018098931580334587, "loss": 0.19451157748699188, "mean_token_accuracy": 0.922481581568718, "num_tokens": 38450284.0, "step": 3117 }, { "entropy": 1.4973836839199066, "epoch": 1.6419167983149026, "grad_norm": 0.2761797606945038, "learning_rate": 0.00018097583463632606, "loss": 0.20249421894550323, "mean_token_accuracy": 0.9215444773435593, "num_tokens": 38462620.0, "step": 3118 }, { "entropy": 1.5529511272907257, "epoch": 1.6424433912585572, "grad_norm": 0.289413183927536, "learning_rate": 0.0001809623492558846, "loss": 0.2158457338809967, "mean_token_accuracy": 0.9128688126802444, "num_tokens": 38474956.0, "step": 3119 }, { "entropy": 1.5039259195327759, "epoch": 1.6429699842022116, "grad_norm": 0.2677723467350006, "learning_rate": 0.0001809488596628221, "loss": 0.2032872885465622, "mean_token_accuracy": 0.9197664707899094, "num_tokens": 38487292.0, "step": 3120 }, { "entropy": 1.5852990448474884, "epoch": 1.6434965771458663, "grad_norm": 0.2714881896972656, "learning_rate": 0.0001809353658579393, "loss": 0.2129548341035843, "mean_token_accuracy": 0.9137803167104721, "num_tokens": 38499628.0, "step": 3121 }, { "entropy": 1.5083645284175873, "epoch": 1.644023170089521, "grad_norm": 0.32005801796913147, "learning_rate": 0.00018092186784203729, "loss": 0.20612075924873352, "mean_token_accuracy": 0.9157820492982864, "num_tokens": 38511964.0, "step": 3122 }, { "entropy": 1.563103348016739, "epoch": 1.6445497630331753, "grad_norm": 0.2607233226299286, "learning_rate": 0.00018090836561591734, "loss": 0.19675372540950775, "mean_token_accuracy": 0.9205005466938019, "num_tokens": 38524300.0, "step": 3123 }, { "entropy": 1.559066355228424, "epoch": 1.6450763559768298, "grad_norm": 0.2431030124425888, "learning_rate": 0.000180894859180381, "loss": 0.19404737651348114, "mean_token_accuracy": 0.9214319586753845, "num_tokens": 38536636.0, "step": 3124 }, { "entropy": 1.5827949941158295, "epoch": 1.6456029489204844, "grad_norm": 0.2936856150627136, "learning_rate": 0.0001808813485362301, "loss": 0.21814733743667603, "mean_token_accuracy": 0.9099378287792206, "num_tokens": 38548972.0, "step": 3125 }, { "entropy": 1.578831136226654, "epoch": 1.646129541864139, "grad_norm": 0.2785643935203552, "learning_rate": 0.00018086783368426664, "loss": 0.19619745016098022, "mean_token_accuracy": 0.9219939261674881, "num_tokens": 38561308.0, "step": 3126 }, { "entropy": 1.5287668108940125, "epoch": 1.6466561348077935, "grad_norm": 0.2629009485244751, "learning_rate": 0.00018085431462529295, "loss": 0.19254928827285767, "mean_token_accuracy": 0.9238256067037582, "num_tokens": 38573644.0, "step": 3127 }, { "entropy": 1.5286193788051605, "epoch": 1.6471827277514481, "grad_norm": 0.2730830907821655, "learning_rate": 0.00018084079136011157, "loss": 0.21922871470451355, "mean_token_accuracy": 0.9088734835386276, "num_tokens": 38585980.0, "step": 3128 }, { "entropy": 1.5122800767421722, "epoch": 1.6477093206951028, "grad_norm": 0.2737482786178589, "learning_rate": 0.0001808272638895253, "loss": 0.20768514275550842, "mean_token_accuracy": 0.913787379860878, "num_tokens": 38598316.0, "step": 3129 }, { "entropy": 1.5126305520534515, "epoch": 1.6482359136387572, "grad_norm": 0.2560437321662903, "learning_rate": 0.00018081373221433717, "loss": 0.18702422082424164, "mean_token_accuracy": 0.9235630929470062, "num_tokens": 38610652.0, "step": 3130 }, { "entropy": 1.425947904586792, "epoch": 1.6487625065824116, "grad_norm": 0.26945164799690247, "learning_rate": 0.00018080019633535051, "loss": 0.2076614946126938, "mean_token_accuracy": 0.914527490735054, "num_tokens": 38622988.0, "step": 3131 }, { "entropy": 1.4670809209346771, "epoch": 1.6492890995260665, "grad_norm": 0.27858737111091614, "learning_rate": 0.00018078665625336887, "loss": 0.20628421008586884, "mean_token_accuracy": 0.9157915860414505, "num_tokens": 38635324.0, "step": 3132 }, { "entropy": 1.358038753271103, "epoch": 1.649815692469721, "grad_norm": 0.24805906414985657, "learning_rate": 0.00018077311196919597, "loss": 0.18904471397399902, "mean_token_accuracy": 0.9245041012763977, "num_tokens": 38647660.0, "step": 3133 }, { "entropy": 1.324582278728485, "epoch": 1.6503422854133754, "grad_norm": 0.2563723027706146, "learning_rate": 0.00018075956348363595, "loss": 0.1867881715297699, "mean_token_accuracy": 0.9226547628641129, "num_tokens": 38659996.0, "step": 3134 }, { "entropy": 1.320959597826004, "epoch": 1.65086887835703, "grad_norm": 0.2722032070159912, "learning_rate": 0.00018074601079749307, "loss": 0.182020366191864, "mean_token_accuracy": 0.9248357862234116, "num_tokens": 38672332.0, "step": 3135 }, { "entropy": 1.2622464001178741, "epoch": 1.6513954713006846, "grad_norm": 0.27287331223487854, "learning_rate": 0.00018073245391157184, "loss": 0.20617710053920746, "mean_token_accuracy": 0.9157890826463699, "num_tokens": 38684668.0, "step": 3136 }, { "entropy": 1.2935321927070618, "epoch": 1.651922064244339, "grad_norm": 0.29414066672325134, "learning_rate": 0.00018071889282667708, "loss": 0.20646268129348755, "mean_token_accuracy": 0.9180812388658524, "num_tokens": 38697004.0, "step": 3137 }, { "entropy": 1.2393367290496826, "epoch": 1.6524486571879937, "grad_norm": 0.27941057085990906, "learning_rate": 0.00018070532754361387, "loss": 0.19918499886989594, "mean_token_accuracy": 0.9213303327560425, "num_tokens": 38709340.0, "step": 3138 }, { "entropy": 1.2073590159416199, "epoch": 1.6529752501316484, "grad_norm": 0.2652994394302368, "learning_rate": 0.00018069175806318747, "loss": 0.2018781453371048, "mean_token_accuracy": 0.9207476526498795, "num_tokens": 38721676.0, "step": 3139 }, { "entropy": 1.2771650850772858, "epoch": 1.6535018430753028, "grad_norm": 0.3261018991470337, "learning_rate": 0.00018067818438620336, "loss": 0.23345033824443817, "mean_token_accuracy": 0.9006090611219406, "num_tokens": 38734012.0, "step": 3140 }, { "entropy": 1.2039735317230225, "epoch": 1.6540284360189572, "grad_norm": 0.265409916639328, "learning_rate": 0.0001806646065134674, "loss": 0.19166678190231323, "mean_token_accuracy": 0.9186943769454956, "num_tokens": 38746348.0, "step": 3141 }, { "entropy": 1.1508864760398865, "epoch": 1.6545550289626119, "grad_norm": 0.2634056806564331, "learning_rate": 0.00018065102444578566, "loss": 0.20034006237983704, "mean_token_accuracy": 0.9211664348840714, "num_tokens": 38758684.0, "step": 3142 }, { "entropy": 1.1475915908813477, "epoch": 1.6550816219062665, "grad_norm": 0.2569848895072937, "learning_rate": 0.00018063743818396436, "loss": 0.18887409567832947, "mean_token_accuracy": 0.9205733388662338, "num_tokens": 38771020.0, "step": 3143 }, { "entropy": 1.1361444592475891, "epoch": 1.655608214849921, "grad_norm": 0.23779945075511932, "learning_rate": 0.00018062384772881004, "loss": 0.17688196897506714, "mean_token_accuracy": 0.9271897524595261, "num_tokens": 38783356.0, "step": 3144 }, { "entropy": 1.2171200811862946, "epoch": 1.6561348077935756, "grad_norm": 0.2639971375465393, "learning_rate": 0.00018061025308112953, "loss": 0.19022762775421143, "mean_token_accuracy": 0.9262509793043137, "num_tokens": 38795692.0, "step": 3145 }, { "entropy": 1.1198914051055908, "epoch": 1.6566614007372302, "grad_norm": 0.27189239859580994, "learning_rate": 0.00018059665424172987, "loss": 0.19100147485733032, "mean_token_accuracy": 0.9232686161994934, "num_tokens": 38808028.0, "step": 3146 }, { "entropy": 1.1745660603046417, "epoch": 1.6571879936808847, "grad_norm": 0.26474079489707947, "learning_rate": 0.00018058305121141827, "loss": 0.187790185213089, "mean_token_accuracy": 0.9250635355710983, "num_tokens": 38820364.0, "step": 3147 }, { "entropy": 1.1938625872135162, "epoch": 1.657714586624539, "grad_norm": 0.26579174399375916, "learning_rate": 0.0001805694439910023, "loss": 0.19708439707756042, "mean_token_accuracy": 0.9244084358215332, "num_tokens": 38832700.0, "step": 3148 }, { "entropy": 1.1665718257427216, "epoch": 1.658241179568194, "grad_norm": 0.28311535716056824, "learning_rate": 0.0001805558325812898, "loss": 0.2201116979122162, "mean_token_accuracy": 0.9134600609540939, "num_tokens": 38845036.0, "step": 3149 }, { "entropy": 1.1456275880336761, "epoch": 1.6587677725118484, "grad_norm": 0.2647797763347626, "learning_rate": 0.0001805422169830887, "loss": 0.20335599780082703, "mean_token_accuracy": 0.9210527390241623, "num_tokens": 38857372.0, "step": 3150 }, { "entropy": 1.2212076783180237, "epoch": 1.6592943654555028, "grad_norm": 0.2934233844280243, "learning_rate": 0.00018052859719720735, "loss": 0.21342241764068604, "mean_token_accuracy": 0.9127740412950516, "num_tokens": 38869708.0, "step": 3151 }, { "entropy": 1.1577803790569305, "epoch": 1.6598209583991574, "grad_norm": 0.28830140829086304, "learning_rate": 0.0001805149732244543, "loss": 0.22134548425674438, "mean_token_accuracy": 0.9122626036405563, "num_tokens": 38882044.0, "step": 3152 }, { "entropy": 1.1979770064353943, "epoch": 1.660347551342812, "grad_norm": 0.29721346497535706, "learning_rate": 0.0001805013450656382, "loss": 0.2053031623363495, "mean_token_accuracy": 0.9165612608194351, "num_tokens": 38894380.0, "step": 3153 }, { "entropy": 1.234178513288498, "epoch": 1.6608741442864665, "grad_norm": 0.25609639286994934, "learning_rate": 0.00018048771272156821, "loss": 0.18612919747829437, "mean_token_accuracy": 0.9224274605512619, "num_tokens": 38906716.0, "step": 3154 }, { "entropy": 1.1776945292949677, "epoch": 1.6614007372301212, "grad_norm": 0.30163243412971497, "learning_rate": 0.00018047407619305354, "loss": 0.20453007519245148, "mean_token_accuracy": 0.9143376648426056, "num_tokens": 38919052.0, "step": 3155 }, { "entropy": 1.1364782750606537, "epoch": 1.6619273301737758, "grad_norm": 0.26865363121032715, "learning_rate": 0.00018046043548090371, "loss": 0.19255727529525757, "mean_token_accuracy": 0.9212214797735214, "num_tokens": 38931388.0, "step": 3156 }, { "entropy": 1.1973776817321777, "epoch": 1.6624539231174302, "grad_norm": 0.290986031293869, "learning_rate": 0.0001804467905859285, "loss": 0.21269451081752777, "mean_token_accuracy": 0.9207015186548233, "num_tokens": 38943724.0, "step": 3157 }, { "entropy": 1.2418961226940155, "epoch": 1.6629805160610847, "grad_norm": 0.2690465748310089, "learning_rate": 0.00018043314150893795, "loss": 0.18485507369041443, "mean_token_accuracy": 0.923929750919342, "num_tokens": 38956060.0, "step": 3158 }, { "entropy": 1.2224768996238708, "epoch": 1.6635071090047393, "grad_norm": 0.2874819040298462, "learning_rate": 0.0001804194882507423, "loss": 0.20011025667190552, "mean_token_accuracy": 0.9204146862030029, "num_tokens": 38968396.0, "step": 3159 }, { "entropy": 1.2215831875801086, "epoch": 1.664033701948394, "grad_norm": 0.303321897983551, "learning_rate": 0.00018040583081215206, "loss": 0.21922917664051056, "mean_token_accuracy": 0.9072663635015488, "num_tokens": 38980732.0, "step": 3160 }, { "entropy": 1.3148879706859589, "epoch": 1.6645602948920484, "grad_norm": 0.3454381227493286, "learning_rate": 0.00018039216919397798, "loss": 0.23111680150032043, "mean_token_accuracy": 0.9131344109773636, "num_tokens": 38993068.0, "step": 3161 }, { "entropy": 1.2151626348495483, "epoch": 1.665086887835703, "grad_norm": 0.2705059349536896, "learning_rate": 0.00018037850339703112, "loss": 0.2070206105709076, "mean_token_accuracy": 0.915043517947197, "num_tokens": 39005404.0, "step": 3162 }, { "entropy": 1.2460331618785858, "epoch": 1.6656134807793577, "grad_norm": 0.28544241189956665, "learning_rate": 0.00018036483342212268, "loss": 0.2099902629852295, "mean_token_accuracy": 0.9136664867401123, "num_tokens": 39017740.0, "step": 3163 }, { "entropy": 1.2310877740383148, "epoch": 1.666140073723012, "grad_norm": 0.2626836895942688, "learning_rate": 0.00018035115927006424, "loss": 0.2030152976512909, "mean_token_accuracy": 0.9205620735883713, "num_tokens": 39030076.0, "step": 3164 }, { "entropy": 1.3169174790382385, "epoch": 1.6666666666666665, "grad_norm": 0.2741585373878479, "learning_rate": 0.00018033748094166746, "loss": 0.19826257228851318, "mean_token_accuracy": 0.9195802211761475, "num_tokens": 39042412.0, "step": 3165 }, { "entropy": 1.2823103368282318, "epoch": 1.6671932596103214, "grad_norm": 0.25388139486312866, "learning_rate": 0.00018032379843774442, "loss": 0.20759499073028564, "mean_token_accuracy": 0.9136326611042023, "num_tokens": 39054748.0, "step": 3166 }, { "entropy": 1.2326855063438416, "epoch": 1.6677198525539758, "grad_norm": 0.2549154758453369, "learning_rate": 0.00018031011175910738, "loss": 0.20668521523475647, "mean_token_accuracy": 0.9171313345432281, "num_tokens": 39067084.0, "step": 3167 }, { "entropy": 1.2375471889972687, "epoch": 1.6682464454976302, "grad_norm": 0.2682606279850006, "learning_rate": 0.00018029642090656878, "loss": 0.19891971349716187, "mean_token_accuracy": 0.9194265604019165, "num_tokens": 39079420.0, "step": 3168 }, { "entropy": 1.2905383706092834, "epoch": 1.6687730384412849, "grad_norm": 0.2665676176548004, "learning_rate": 0.00018028272588094138, "loss": 0.19952955842018127, "mean_token_accuracy": 0.9163491129875183, "num_tokens": 39091756.0, "step": 3169 }, { "entropy": 1.2198565304279327, "epoch": 1.6692996313849395, "grad_norm": 0.28037944436073303, "learning_rate": 0.00018026902668303818, "loss": 0.19893498718738556, "mean_token_accuracy": 0.9220035374164581, "num_tokens": 39104092.0, "step": 3170 }, { "entropy": 1.1831121444702148, "epoch": 1.669826224328594, "grad_norm": 0.2583988904953003, "learning_rate": 0.00018025532331367243, "loss": 0.17476224899291992, "mean_token_accuracy": 0.9299489706754684, "num_tokens": 39116428.0, "step": 3171 }, { "entropy": 1.2536409497261047, "epoch": 1.6703528172722486, "grad_norm": 0.28530681133270264, "learning_rate": 0.0001802416157736576, "loss": 0.1837761104106903, "mean_token_accuracy": 0.9242200702428818, "num_tokens": 39128764.0, "step": 3172 }, { "entropy": 1.2332830131053925, "epoch": 1.6708794102159032, "grad_norm": 0.29961588978767395, "learning_rate": 0.00018022790406380747, "loss": 0.2195456326007843, "mean_token_accuracy": 0.9104225635528564, "num_tokens": 39141100.0, "step": 3173 }, { "entropy": 1.1516872346401215, "epoch": 1.6714060031595577, "grad_norm": 0.2845155596733093, "learning_rate": 0.00018021418818493597, "loss": 0.20701955258846283, "mean_token_accuracy": 0.9150958508253098, "num_tokens": 39153436.0, "step": 3174 }, { "entropy": 1.2093952596187592, "epoch": 1.671932596103212, "grad_norm": 0.29277166724205017, "learning_rate": 0.00018020046813785735, "loss": 0.1868697553873062, "mean_token_accuracy": 0.9202113300561905, "num_tokens": 39165772.0, "step": 3175 }, { "entropy": 1.1511423885822296, "epoch": 1.6724591890468667, "grad_norm": 0.282686710357666, "learning_rate": 0.00018018674392338612, "loss": 0.18359015882015228, "mean_token_accuracy": 0.9301719814538956, "num_tokens": 39178108.0, "step": 3176 }, { "entropy": 1.158335953950882, "epoch": 1.6729857819905214, "grad_norm": 0.2753232419490814, "learning_rate": 0.00018017301554233697, "loss": 0.2069041132926941, "mean_token_accuracy": 0.9147633165121078, "num_tokens": 39190444.0, "step": 3177 }, { "entropy": 1.194052815437317, "epoch": 1.6735123749341758, "grad_norm": 0.2822655141353607, "learning_rate": 0.0001801592829955249, "loss": 0.1951710730791092, "mean_token_accuracy": 0.9215719550848007, "num_tokens": 39202780.0, "step": 3178 }, { "entropy": 1.151505172252655, "epoch": 1.6740389678778305, "grad_norm": 0.28857794404029846, "learning_rate": 0.00018014554628376512, "loss": 0.20368535816669464, "mean_token_accuracy": 0.9183078706264496, "num_tokens": 39215116.0, "step": 3179 }, { "entropy": 1.2312898933887482, "epoch": 1.674565560821485, "grad_norm": 0.306927353143692, "learning_rate": 0.00018013180540787309, "loss": 0.2206253558397293, "mean_token_accuracy": 0.9108968675136566, "num_tokens": 39227452.0, "step": 3180 }, { "entropy": 1.2053121328353882, "epoch": 1.6750921537651395, "grad_norm": 0.27955883741378784, "learning_rate": 0.00018011806036866452, "loss": 0.19037887454032898, "mean_token_accuracy": 0.917056143283844, "num_tokens": 39239788.0, "step": 3181 }, { "entropy": 1.1672830879688263, "epoch": 1.675618746708794, "grad_norm": 0.28999653458595276, "learning_rate": 0.0001801043111669554, "loss": 0.19952133297920227, "mean_token_accuracy": 0.917973592877388, "num_tokens": 39252124.0, "step": 3182 }, { "entropy": 1.2045989036560059, "epoch": 1.6761453396524486, "grad_norm": 0.28392067551612854, "learning_rate": 0.0001800905578035619, "loss": 0.2129674255847931, "mean_token_accuracy": 0.9127481281757355, "num_tokens": 39264460.0, "step": 3183 }, { "entropy": 1.19984170794487, "epoch": 1.6766719325961033, "grad_norm": 0.25406205654144287, "learning_rate": 0.00018007680027930053, "loss": 0.19678980112075806, "mean_token_accuracy": 0.9213206321001053, "num_tokens": 39276796.0, "step": 3184 }, { "entropy": 1.1855994760990143, "epoch": 1.6771985255397577, "grad_norm": 0.2667410373687744, "learning_rate": 0.00018006303859498794, "loss": 0.19079680740833282, "mean_token_accuracy": 0.9214341640472412, "num_tokens": 39289132.0, "step": 3185 }, { "entropy": 1.2297048270702362, "epoch": 1.6777251184834123, "grad_norm": 0.2681465446949005, "learning_rate": 0.0001800492727514411, "loss": 0.209198996424675, "mean_token_accuracy": 0.9140588194131851, "num_tokens": 39301468.0, "step": 3186 }, { "entropy": 1.2474170923233032, "epoch": 1.678251711427067, "grad_norm": 0.29584237933158875, "learning_rate": 0.00018003550274947727, "loss": 0.2179972529411316, "mean_token_accuracy": 0.910770982503891, "num_tokens": 39313804.0, "step": 3187 }, { "entropy": 1.2513139247894287, "epoch": 1.6787783043707214, "grad_norm": 0.26859045028686523, "learning_rate": 0.00018002172858991381, "loss": 0.19416972994804382, "mean_token_accuracy": 0.9244131296873093, "num_tokens": 39326140.0, "step": 3188 }, { "entropy": 1.2674452066421509, "epoch": 1.6793048973143758, "grad_norm": 0.2633540630340576, "learning_rate": 0.00018000795027356845, "loss": 0.206901416182518, "mean_token_accuracy": 0.9144023954868317, "num_tokens": 39338476.0, "step": 3189 }, { "entropy": 1.2862504124641418, "epoch": 1.6798314902580307, "grad_norm": 0.2601005434989929, "learning_rate": 0.00017999416780125908, "loss": 0.1940033733844757, "mean_token_accuracy": 0.9206139743328094, "num_tokens": 39350812.0, "step": 3190 }, { "entropy": 1.296876072883606, "epoch": 1.6803580832016851, "grad_norm": 0.2819749116897583, "learning_rate": 0.00017998038117380397, "loss": 0.20579656958580017, "mean_token_accuracy": 0.914523109793663, "num_tokens": 39363148.0, "step": 3191 }, { "entropy": 1.3008518517017365, "epoch": 1.6808846761453395, "grad_norm": 0.2690666913986206, "learning_rate": 0.00017996659039202148, "loss": 0.18763180077075958, "mean_token_accuracy": 0.9187602549791336, "num_tokens": 39375484.0, "step": 3192 }, { "entropy": 1.2868019342422485, "epoch": 1.6814112690889942, "grad_norm": 0.2677951753139496, "learning_rate": 0.00017995279545673034, "loss": 0.19632895290851593, "mean_token_accuracy": 0.9192786663770676, "num_tokens": 39387820.0, "step": 3193 }, { "entropy": 1.268946647644043, "epoch": 1.6819378620326488, "grad_norm": 0.2508223354816437, "learning_rate": 0.00017993899636874943, "loss": 0.18477728962898254, "mean_token_accuracy": 0.9243815243244171, "num_tokens": 39400156.0, "step": 3194 }, { "entropy": 1.322548896074295, "epoch": 1.6824644549763033, "grad_norm": 0.28498703241348267, "learning_rate": 0.00017992519312889796, "loss": 0.21436122059822083, "mean_token_accuracy": 0.9100509434938431, "num_tokens": 39412492.0, "step": 3195 }, { "entropy": 1.3395605385303497, "epoch": 1.682991047919958, "grad_norm": 0.26486754417419434, "learning_rate": 0.0001799113857379953, "loss": 0.1872069537639618, "mean_token_accuracy": 0.9222505837678909, "num_tokens": 39424828.0, "step": 3196 }, { "entropy": 1.308861881494522, "epoch": 1.6835176408636126, "grad_norm": 0.27471840381622314, "learning_rate": 0.00017989757419686116, "loss": 0.18717561662197113, "mean_token_accuracy": 0.9235621690750122, "num_tokens": 39437164.0, "step": 3197 }, { "entropy": 1.2929215729236603, "epoch": 1.684044233807267, "grad_norm": 0.2788255214691162, "learning_rate": 0.00017988375850631541, "loss": 0.20904980599880219, "mean_token_accuracy": 0.9153354316949844, "num_tokens": 39449500.0, "step": 3198 }, { "entropy": 1.2841696441173553, "epoch": 1.6845708267509214, "grad_norm": 0.30049991607666016, "learning_rate": 0.00017986993866717828, "loss": 0.2012903392314911, "mean_token_accuracy": 0.9142125397920609, "num_tokens": 39461836.0, "step": 3199 }, { "entropy": 1.261197030544281, "epoch": 1.685097419694576, "grad_norm": 0.2596745491027832, "learning_rate": 0.0001798561146802701, "loss": 0.1863638311624527, "mean_token_accuracy": 0.925238847732544, "num_tokens": 39474172.0, "step": 3200 }, { "entropy": 1.3221564590930939, "epoch": 1.6856240126382307, "grad_norm": 0.28279244899749756, "learning_rate": 0.00017984228654641153, "loss": 0.21060873568058014, "mean_token_accuracy": 0.9115581065416336, "num_tokens": 39486508.0, "step": 3201 }, { "entropy": 1.2866823077201843, "epoch": 1.6861506055818851, "grad_norm": 0.24817955493927002, "learning_rate": 0.00017982845426642348, "loss": 0.18661949038505554, "mean_token_accuracy": 0.9202256947755814, "num_tokens": 39498844.0, "step": 3202 }, { "entropy": 1.320129543542862, "epoch": 1.6866771985255398, "grad_norm": 0.2350441813468933, "learning_rate": 0.0001798146178411271, "loss": 0.17725782096385956, "mean_token_accuracy": 0.9308050870895386, "num_tokens": 39511180.0, "step": 3203 }, { "entropy": 1.410641998052597, "epoch": 1.6872037914691944, "grad_norm": 0.2893678545951843, "learning_rate": 0.00017980077727134376, "loss": 0.19813215732574463, "mean_token_accuracy": 0.9261365532875061, "num_tokens": 39523516.0, "step": 3204 }, { "entropy": 1.2950620353221893, "epoch": 1.6877303844128488, "grad_norm": 0.2544447183609009, "learning_rate": 0.0001797869325578951, "loss": 0.1995326578617096, "mean_token_accuracy": 0.9175571799278259, "num_tokens": 39535852.0, "step": 3205 }, { "entropy": 1.3695853650569916, "epoch": 1.6882569773565033, "grad_norm": 0.26028668880462646, "learning_rate": 0.00017977308370160304, "loss": 0.1951325535774231, "mean_token_accuracy": 0.9233993589878082, "num_tokens": 39548188.0, "step": 3206 }, { "entropy": 1.3739449977874756, "epoch": 1.6887835703001581, "grad_norm": 0.24822396039962769, "learning_rate": 0.00017975923070328965, "loss": 0.1763211488723755, "mean_token_accuracy": 0.9289481788873672, "num_tokens": 39560524.0, "step": 3207 }, { "entropy": 1.303276151418686, "epoch": 1.6893101632438126, "grad_norm": 0.234592005610466, "learning_rate": 0.00017974537356377733, "loss": 0.1826443076133728, "mean_token_accuracy": 0.925462156534195, "num_tokens": 39572860.0, "step": 3208 }, { "entropy": 1.353267639875412, "epoch": 1.689836756187467, "grad_norm": 0.25751370191574097, "learning_rate": 0.00017973151228388865, "loss": 0.18108654022216797, "mean_token_accuracy": 0.9255900233983994, "num_tokens": 39585196.0, "step": 3209 }, { "entropy": 1.3624829649925232, "epoch": 1.6903633491311216, "grad_norm": 0.27678364515304565, "learning_rate": 0.00017971764686444653, "loss": 0.20060954988002777, "mean_token_accuracy": 0.9197713881731033, "num_tokens": 39597532.0, "step": 3210 }, { "entropy": 1.3278814852237701, "epoch": 1.6908899420747763, "grad_norm": 0.26017773151397705, "learning_rate": 0.00017970377730627409, "loss": 0.1876058727502823, "mean_token_accuracy": 0.9261418581008911, "num_tokens": 39609868.0, "step": 3211 }, { "entropy": 1.335858404636383, "epoch": 1.6914165350184307, "grad_norm": 0.267092227935791, "learning_rate": 0.0001796899036101946, "loss": 0.20062491297721863, "mean_token_accuracy": 0.916288897395134, "num_tokens": 39622204.0, "step": 3212 }, { "entropy": 1.3814048171043396, "epoch": 1.6919431279620853, "grad_norm": 0.264210969209671, "learning_rate": 0.00017967602577703175, "loss": 0.19217954576015472, "mean_token_accuracy": 0.9183042198419571, "num_tokens": 39634540.0, "step": 3213 }, { "entropy": 1.3550595045089722, "epoch": 1.69246972090574, "grad_norm": 0.28114888072013855, "learning_rate": 0.00017966214380760938, "loss": 0.20994627475738525, "mean_token_accuracy": 0.9140847474336624, "num_tokens": 39646876.0, "step": 3214 }, { "entropy": 1.2746717631816864, "epoch": 1.6929963138493944, "grad_norm": 0.26488783955574036, "learning_rate": 0.0001796482577027515, "loss": 0.20270992815494537, "mean_token_accuracy": 0.9152298867702484, "num_tokens": 39659212.0, "step": 3215 }, { "entropy": 1.3254249095916748, "epoch": 1.6935229067930488, "grad_norm": 0.2747063636779785, "learning_rate": 0.00017963436746328253, "loss": 0.20579099655151367, "mean_token_accuracy": 0.9173053056001663, "num_tokens": 39671548.0, "step": 3216 }, { "entropy": 1.3438137471675873, "epoch": 1.6940494997367035, "grad_norm": 0.2942642569541931, "learning_rate": 0.00017962047309002702, "loss": 0.19839614629745483, "mean_token_accuracy": 0.9128136783838272, "num_tokens": 39683884.0, "step": 3217 }, { "entropy": 1.2776517271995544, "epoch": 1.6945760926803581, "grad_norm": 0.2709120213985443, "learning_rate": 0.0001796065745838098, "loss": 0.191197469830513, "mean_token_accuracy": 0.9194577038288116, "num_tokens": 39696220.0, "step": 3218 }, { "entropy": 1.338829666376114, "epoch": 1.6951026856240126, "grad_norm": 0.29193103313446045, "learning_rate": 0.00017959267194545597, "loss": 0.21261580288410187, "mean_token_accuracy": 0.9161190837621689, "num_tokens": 39708556.0, "step": 3219 }, { "entropy": 1.3053942620754242, "epoch": 1.6956292785676672, "grad_norm": 0.2555198669433594, "learning_rate": 0.00017957876517579076, "loss": 0.1975700557231903, "mean_token_accuracy": 0.9193883389234543, "num_tokens": 39720892.0, "step": 3220 }, { "entropy": 1.3086311519145966, "epoch": 1.6961558715113219, "grad_norm": 0.2704666554927826, "learning_rate": 0.00017956485427563984, "loss": 0.19425427913665771, "mean_token_accuracy": 0.9231333583593369, "num_tokens": 39733228.0, "step": 3221 }, { "entropy": 1.3097478151321411, "epoch": 1.6966824644549763, "grad_norm": 0.2648825943470001, "learning_rate": 0.000179550939245829, "loss": 0.1881440281867981, "mean_token_accuracy": 0.9222024977207184, "num_tokens": 39745564.0, "step": 3222 }, { "entropy": 1.341114103794098, "epoch": 1.6972090573986307, "grad_norm": 0.29292595386505127, "learning_rate": 0.00017953702008718426, "loss": 0.20591764152050018, "mean_token_accuracy": 0.9151119291782379, "num_tokens": 39757900.0, "step": 3223 }, { "entropy": 1.3235185742378235, "epoch": 1.6977356503422856, "grad_norm": 0.2651384472846985, "learning_rate": 0.0001795230968005319, "loss": 0.183737114071846, "mean_token_accuracy": 0.9256300330162048, "num_tokens": 39770236.0, "step": 3224 }, { "entropy": 1.3323991000652313, "epoch": 1.69826224328594, "grad_norm": 0.2805165946483612, "learning_rate": 0.0001795091693866985, "loss": 0.21993422508239746, "mean_token_accuracy": 0.9102575182914734, "num_tokens": 39782572.0, "step": 3225 }, { "entropy": 1.33993661403656, "epoch": 1.6987888362295944, "grad_norm": 0.2455688714981079, "learning_rate": 0.00017949523784651085, "loss": 0.1799536943435669, "mean_token_accuracy": 0.9266008138656616, "num_tokens": 39794908.0, "step": 3226 }, { "entropy": 1.3271623253822327, "epoch": 1.699315429173249, "grad_norm": 0.24277228116989136, "learning_rate": 0.00017948130218079598, "loss": 0.1912137269973755, "mean_token_accuracy": 0.9215309470891953, "num_tokens": 39807244.0, "step": 3227 }, { "entropy": 1.3194293975830078, "epoch": 1.6998420221169037, "grad_norm": 0.2657921612262726, "learning_rate": 0.00017946736239038118, "loss": 0.20347270369529724, "mean_token_accuracy": 0.9160242527723312, "num_tokens": 39819580.0, "step": 3228 }, { "entropy": 1.283385008573532, "epoch": 1.7003686150605581, "grad_norm": 0.2746362090110779, "learning_rate": 0.00017945341847609396, "loss": 0.19498057663440704, "mean_token_accuracy": 0.9214595407247543, "num_tokens": 39831916.0, "step": 3229 }, { "entropy": 1.3247983157634735, "epoch": 1.7008952080042128, "grad_norm": 0.2631048262119293, "learning_rate": 0.00017943947043876207, "loss": 0.19207647442817688, "mean_token_accuracy": 0.9226651191711426, "num_tokens": 39844252.0, "step": 3230 }, { "entropy": 1.3293734192848206, "epoch": 1.7014218009478674, "grad_norm": 0.28094783425331116, "learning_rate": 0.00017942551827921356, "loss": 0.2019774615764618, "mean_token_accuracy": 0.9162713438272476, "num_tokens": 39856588.0, "step": 3231 }, { "entropy": 1.338496744632721, "epoch": 1.7019483938915219, "grad_norm": 0.2915278375148773, "learning_rate": 0.00017941156199827664, "loss": 0.21198813617229462, "mean_token_accuracy": 0.9130686819553375, "num_tokens": 39868924.0, "step": 3232 }, { "entropy": 1.3526046872138977, "epoch": 1.7024749868351763, "grad_norm": 0.2703212797641754, "learning_rate": 0.00017939760159677988, "loss": 0.18862299621105194, "mean_token_accuracy": 0.9240467101335526, "num_tokens": 39881260.0, "step": 3233 }, { "entropy": 1.336966633796692, "epoch": 1.703001579778831, "grad_norm": 0.2505403161048889, "learning_rate": 0.00017938363707555198, "loss": 0.1721397340297699, "mean_token_accuracy": 0.928515300154686, "num_tokens": 39893596.0, "step": 3234 }, { "entropy": 1.2895264327526093, "epoch": 1.7035281727224856, "grad_norm": 0.27174112200737, "learning_rate": 0.00017936966843542195, "loss": 0.18495216965675354, "mean_token_accuracy": 0.9250223636627197, "num_tokens": 39905932.0, "step": 3235 }, { "entropy": 1.294345647096634, "epoch": 1.70405476566614, "grad_norm": 0.31108003854751587, "learning_rate": 0.000179355695677219, "loss": 0.22918599843978882, "mean_token_accuracy": 0.9110808223485947, "num_tokens": 39918268.0, "step": 3236 }, { "entropy": 1.2462213635444641, "epoch": 1.7045813586097947, "grad_norm": 0.2745544910430908, "learning_rate": 0.00017934171880177265, "loss": 0.20311737060546875, "mean_token_accuracy": 0.9179251939058304, "num_tokens": 39930604.0, "step": 3237 }, { "entropy": 1.2923784255981445, "epoch": 1.7051079515534493, "grad_norm": 0.2750037610530853, "learning_rate": 0.00017932773780991262, "loss": 0.20452114939689636, "mean_token_accuracy": 0.9181451350450516, "num_tokens": 39942940.0, "step": 3238 }, { "entropy": 1.2803550958633423, "epoch": 1.7056345444971037, "grad_norm": 0.29063141345977783, "learning_rate": 0.00017931375270246889, "loss": 0.2145015299320221, "mean_token_accuracy": 0.9154239445924759, "num_tokens": 39955276.0, "step": 3239 }, { "entropy": 1.3234757483005524, "epoch": 1.7061611374407581, "grad_norm": 0.2841363549232483, "learning_rate": 0.0001792997634802716, "loss": 0.2186480611562729, "mean_token_accuracy": 0.9111131429672241, "num_tokens": 39967612.0, "step": 3240 }, { "entropy": 1.2682130932807922, "epoch": 1.706687730384413, "grad_norm": 0.25876402854919434, "learning_rate": 0.0001792857701441513, "loss": 0.20549407601356506, "mean_token_accuracy": 0.9134150445461273, "num_tokens": 39979948.0, "step": 3241 }, { "entropy": 1.285068303346634, "epoch": 1.7072143233280674, "grad_norm": 0.2754906415939331, "learning_rate": 0.00017927177269493866, "loss": 0.2059261053800583, "mean_token_accuracy": 0.9146608859300613, "num_tokens": 39992284.0, "step": 3242 }, { "entropy": 1.3181243240833282, "epoch": 1.7077409162717219, "grad_norm": 0.28565770387649536, "learning_rate": 0.0001792577711334646, "loss": 0.20405897498130798, "mean_token_accuracy": 0.9132011830806732, "num_tokens": 40004620.0, "step": 3243 }, { "entropy": 1.2542202472686768, "epoch": 1.7082675092153765, "grad_norm": 0.23145394027233124, "learning_rate": 0.00017924376546056035, "loss": 0.1774619072675705, "mean_token_accuracy": 0.9282086789608002, "num_tokens": 40016956.0, "step": 3244 }, { "entropy": 1.3313210010528564, "epoch": 1.7087941021590312, "grad_norm": 0.2665564715862274, "learning_rate": 0.0001792297556770573, "loss": 0.19780829548835754, "mean_token_accuracy": 0.9161526560783386, "num_tokens": 40029292.0, "step": 3245 }, { "entropy": 1.395924985408783, "epoch": 1.7093206951026856, "grad_norm": 0.28649643063545227, "learning_rate": 0.00017921574178378718, "loss": 0.19208171963691711, "mean_token_accuracy": 0.9216294139623642, "num_tokens": 40041628.0, "step": 3246 }, { "entropy": 1.323070913553238, "epoch": 1.7098472880463402, "grad_norm": 0.28210774064064026, "learning_rate": 0.00017920172378158188, "loss": 0.1932576298713684, "mean_token_accuracy": 0.9173065274953842, "num_tokens": 40053964.0, "step": 3247 }, { "entropy": 1.2962166965007782, "epoch": 1.7103738809899949, "grad_norm": 0.2612176537513733, "learning_rate": 0.00017918770167127355, "loss": 0.1979486644268036, "mean_token_accuracy": 0.9187701344490051, "num_tokens": 40066300.0, "step": 3248 }, { "entropy": 1.3086665868759155, "epoch": 1.7109004739336493, "grad_norm": 0.27552592754364014, "learning_rate": 0.00017917367545369469, "loss": 0.22310736775398254, "mean_token_accuracy": 0.9084995836019516, "num_tokens": 40078636.0, "step": 3249 }, { "entropy": 1.281711757183075, "epoch": 1.7114270668773037, "grad_norm": 0.3259299397468567, "learning_rate": 0.00017915964512967784, "loss": 0.1875232756137848, "mean_token_accuracy": 0.9251815974712372, "num_tokens": 40090972.0, "step": 3250 }, { "entropy": 1.3861521780490875, "epoch": 1.7119536598209584, "grad_norm": 0.313814640045166, "learning_rate": 0.00017914561070005598, "loss": 0.21126891672611237, "mean_token_accuracy": 0.9117094427347183, "num_tokens": 40103308.0, "step": 3251 }, { "entropy": 1.3072172403335571, "epoch": 1.712480252764613, "grad_norm": 0.3379667103290558, "learning_rate": 0.0001791315721656622, "loss": 0.19064629077911377, "mean_token_accuracy": 0.9234190434217453, "num_tokens": 40115644.0, "step": 3252 }, { "entropy": 1.2437802255153656, "epoch": 1.7130068457082674, "grad_norm": 0.26171544194221497, "learning_rate": 0.00017911752952732993, "loss": 0.19964775443077087, "mean_token_accuracy": 0.9152403026819229, "num_tokens": 40127980.0, "step": 3253 }, { "entropy": 1.2901654541492462, "epoch": 1.713533438651922, "grad_norm": 0.26816311478614807, "learning_rate": 0.00017910348278589276, "loss": 0.20712605118751526, "mean_token_accuracy": 0.9133376479148865, "num_tokens": 40140316.0, "step": 3254 }, { "entropy": 1.2976833879947662, "epoch": 1.7140600315955767, "grad_norm": 0.2973898947238922, "learning_rate": 0.0001790894319421846, "loss": 0.21765637397766113, "mean_token_accuracy": 0.9121676534414291, "num_tokens": 40152652.0, "step": 3255 }, { "entropy": 1.277085781097412, "epoch": 1.7145866245392312, "grad_norm": 0.2639175355434418, "learning_rate": 0.00017907537699703955, "loss": 0.19076862931251526, "mean_token_accuracy": 0.9191281646490097, "num_tokens": 40164988.0, "step": 3256 }, { "entropy": 1.3531688749790192, "epoch": 1.7151132174828856, "grad_norm": 0.27909165620803833, "learning_rate": 0.00017906131795129198, "loss": 0.18622638285160065, "mean_token_accuracy": 0.9284979552030563, "num_tokens": 40177324.0, "step": 3257 }, { "entropy": 1.242502599954605, "epoch": 1.7156398104265402, "grad_norm": 0.2541889250278473, "learning_rate": 0.00017904725480577646, "loss": 0.18720562756061554, "mean_token_accuracy": 0.9233348220586777, "num_tokens": 40189660.0, "step": 3258 }, { "entropy": 1.2683814764022827, "epoch": 1.7161664033701949, "grad_norm": 0.29242897033691406, "learning_rate": 0.0001790331875613279, "loss": 0.214931458234787, "mean_token_accuracy": 0.910991907119751, "num_tokens": 40201996.0, "step": 3259 }, { "entropy": 1.337379515171051, "epoch": 1.7166929963138493, "grad_norm": 0.2787255048751831, "learning_rate": 0.0001790191162187813, "loss": 0.2036406546831131, "mean_token_accuracy": 0.9184634983539581, "num_tokens": 40214332.0, "step": 3260 }, { "entropy": 1.257769137620926, "epoch": 1.717219589257504, "grad_norm": 0.25968125462532043, "learning_rate": 0.00017900504077897206, "loss": 0.19390641152858734, "mean_token_accuracy": 0.9182478189468384, "num_tokens": 40226668.0, "step": 3261 }, { "entropy": 1.3203734755516052, "epoch": 1.7177461822011586, "grad_norm": 0.30727487802505493, "learning_rate": 0.00017899096124273576, "loss": 0.22841309010982513, "mean_token_accuracy": 0.9035236537456512, "num_tokens": 40239004.0, "step": 3262 }, { "entropy": 1.2281590104103088, "epoch": 1.718272775144813, "grad_norm": 0.2654935121536255, "learning_rate": 0.0001789768776109082, "loss": 0.19407188892364502, "mean_token_accuracy": 0.9239892512559891, "num_tokens": 40251340.0, "step": 3263 }, { "entropy": 1.2642222046852112, "epoch": 1.7187993680884674, "grad_norm": 0.28257355093955994, "learning_rate": 0.0001789627898843254, "loss": 0.2133817970752716, "mean_token_accuracy": 0.9196331948041916, "num_tokens": 40263676.0, "step": 3264 }, { "entropy": 1.3009636104106903, "epoch": 1.7193259610321223, "grad_norm": 0.2984471917152405, "learning_rate": 0.00017894869806382377, "loss": 0.21264006197452545, "mean_token_accuracy": 0.9153096079826355, "num_tokens": 40276012.0, "step": 3265 }, { "entropy": 1.3348345458507538, "epoch": 1.7198525539757767, "grad_norm": 0.28683388233184814, "learning_rate": 0.00017893460215023975, "loss": 0.20870405435562134, "mean_token_accuracy": 0.9114125370979309, "num_tokens": 40288348.0, "step": 3266 }, { "entropy": 1.2550526559352875, "epoch": 1.7203791469194312, "grad_norm": 0.25430989265441895, "learning_rate": 0.0001789205021444102, "loss": 0.19396786391735077, "mean_token_accuracy": 0.9199714511632919, "num_tokens": 40300684.0, "step": 3267 }, { "entropy": 1.303754299879074, "epoch": 1.7209057398630858, "grad_norm": 0.26650470495224, "learning_rate": 0.00017890639804717215, "loss": 0.19954167306423187, "mean_token_accuracy": 0.9163612723350525, "num_tokens": 40313020.0, "step": 3268 }, { "entropy": 1.2093145549297333, "epoch": 1.7214323328067405, "grad_norm": 0.29942092299461365, "learning_rate": 0.00017889228985936285, "loss": 0.2275795340538025, "mean_token_accuracy": 0.9083501994609833, "num_tokens": 40325356.0, "step": 3269 }, { "entropy": 1.2750758230686188, "epoch": 1.7219589257503949, "grad_norm": 0.2606362998485565, "learning_rate": 0.00017887817758181987, "loss": 0.19598644971847534, "mean_token_accuracy": 0.9228833317756653, "num_tokens": 40337692.0, "step": 3270 }, { "entropy": 1.2626889944076538, "epoch": 1.7224855186940495, "grad_norm": 0.2737748622894287, "learning_rate": 0.0001788640612153809, "loss": 0.20550641417503357, "mean_token_accuracy": 0.9146024286746979, "num_tokens": 40350028.0, "step": 3271 }, { "entropy": 1.2671963572502136, "epoch": 1.7230121116377042, "grad_norm": 0.295658677816391, "learning_rate": 0.00017884994076088398, "loss": 0.2249743938446045, "mean_token_accuracy": 0.9077863395214081, "num_tokens": 40362364.0, "step": 3272 }, { "entropy": 1.256992220878601, "epoch": 1.7235387045813586, "grad_norm": 0.2737193703651428, "learning_rate": 0.0001788358162191674, "loss": 0.21205906569957733, "mean_token_accuracy": 0.915488988161087, "num_tokens": 40374700.0, "step": 3273 }, { "entropy": 1.213915228843689, "epoch": 1.724065297525013, "grad_norm": 0.25337645411491394, "learning_rate": 0.00017882168759106957, "loss": 0.18594782054424286, "mean_token_accuracy": 0.9206974655389786, "num_tokens": 40387036.0, "step": 3274 }, { "entropy": 1.2303422391414642, "epoch": 1.7245918904686677, "grad_norm": 0.28474873304367065, "learning_rate": 0.0001788075548774293, "loss": 0.2072606086730957, "mean_token_accuracy": 0.9152207672595978, "num_tokens": 40399372.0, "step": 3275 }, { "entropy": 1.2771183252334595, "epoch": 1.7251184834123223, "grad_norm": 0.27036532759666443, "learning_rate": 0.00017879341807908555, "loss": 0.1881149560213089, "mean_token_accuracy": 0.92488132417202, "num_tokens": 40411708.0, "step": 3276 }, { "entropy": 1.2247534692287445, "epoch": 1.7256450763559767, "grad_norm": 0.2693551778793335, "learning_rate": 0.0001787792771968775, "loss": 0.2171371728181839, "mean_token_accuracy": 0.91679947078228, "num_tokens": 40424044.0, "step": 3277 }, { "entropy": 1.2200176119804382, "epoch": 1.7261716692996314, "grad_norm": 0.2627072334289551, "learning_rate": 0.00017876513223164466, "loss": 0.19582206010818481, "mean_token_accuracy": 0.9185523092746735, "num_tokens": 40436380.0, "step": 3278 }, { "entropy": 1.2262316644191742, "epoch": 1.726698262243286, "grad_norm": 0.26391029357910156, "learning_rate": 0.00017875098318422667, "loss": 0.18920688331127167, "mean_token_accuracy": 0.9226961433887482, "num_tokens": 40448716.0, "step": 3279 }, { "entropy": 1.2009854018688202, "epoch": 1.7272248551869405, "grad_norm": 0.2786342203617096, "learning_rate": 0.00017873683005546358, "loss": 0.2078881859779358, "mean_token_accuracy": 0.9170061498880386, "num_tokens": 40461052.0, "step": 3280 }, { "entropy": 1.219001442193985, "epoch": 1.727751448130595, "grad_norm": 0.34324315190315247, "learning_rate": 0.0001787226728461955, "loss": 0.2038731575012207, "mean_token_accuracy": 0.9136009812355042, "num_tokens": 40473388.0, "step": 3281 }, { "entropy": 1.1982538998126984, "epoch": 1.7282780410742498, "grad_norm": 0.3113863170146942, "learning_rate": 0.00017870851155726286, "loss": 0.2176617681980133, "mean_token_accuracy": 0.9123759865760803, "num_tokens": 40485724.0, "step": 3282 }, { "entropy": 1.2175420820713043, "epoch": 1.7288046340179042, "grad_norm": 0.27579864859580994, "learning_rate": 0.0001786943461895064, "loss": 0.2074568271636963, "mean_token_accuracy": 0.9171206802129745, "num_tokens": 40498060.0, "step": 3283 }, { "entropy": 1.1838345229625702, "epoch": 1.7293312269615586, "grad_norm": 0.2992401421070099, "learning_rate": 0.00017868017674376694, "loss": 0.20533637702465057, "mean_token_accuracy": 0.9176798313856125, "num_tokens": 40510396.0, "step": 3284 }, { "entropy": 1.2316609919071198, "epoch": 1.7298578199052133, "grad_norm": 0.3072640001773834, "learning_rate": 0.00017866600322088568, "loss": 0.21974754333496094, "mean_token_accuracy": 0.9138150960206985, "num_tokens": 40522732.0, "step": 3285 }, { "entropy": 1.2149794399738312, "epoch": 1.730384412848868, "grad_norm": 0.2651062309741974, "learning_rate": 0.00017865182562170403, "loss": 0.1996372640132904, "mean_token_accuracy": 0.9211166948080063, "num_tokens": 40535068.0, "step": 3286 }, { "entropy": 1.2700909972190857, "epoch": 1.7309110057925223, "grad_norm": 0.2680571377277374, "learning_rate": 0.00017863764394706363, "loss": 0.1831960678100586, "mean_token_accuracy": 0.926160454750061, "num_tokens": 40547404.0, "step": 3287 }, { "entropy": 1.2134180068969727, "epoch": 1.731437598736177, "grad_norm": 0.2633264362812042, "learning_rate": 0.0001786234581978064, "loss": 0.19375747442245483, "mean_token_accuracy": 0.9277003556489944, "num_tokens": 40559740.0, "step": 3288 }, { "entropy": 1.2066058814525604, "epoch": 1.7319641916798316, "grad_norm": 0.2779509723186493, "learning_rate": 0.00017860926837477437, "loss": 0.2058328092098236, "mean_token_accuracy": 0.9140601456165314, "num_tokens": 40572076.0, "step": 3289 }, { "entropy": 1.2765550911426544, "epoch": 1.732490784623486, "grad_norm": 0.26993927359580994, "learning_rate": 0.00017859507447880998, "loss": 0.19165240228176117, "mean_token_accuracy": 0.9281281679868698, "num_tokens": 40584412.0, "step": 3290 }, { "entropy": 1.260106086730957, "epoch": 1.7330173775671405, "grad_norm": 0.2724703848361969, "learning_rate": 0.00017858087651075584, "loss": 0.18630154430866241, "mean_token_accuracy": 0.9287521094083786, "num_tokens": 40596748.0, "step": 3291 }, { "entropy": 1.2476516962051392, "epoch": 1.7335439705107951, "grad_norm": 0.2591682970523834, "learning_rate": 0.00017856667447145475, "loss": 0.18758217990398407, "mean_token_accuracy": 0.9250517785549164, "num_tokens": 40609084.0, "step": 3292 }, { "entropy": 1.2707555294036865, "epoch": 1.7340705634544498, "grad_norm": 0.3217529058456421, "learning_rate": 0.00017855246836174986, "loss": 0.21787390112876892, "mean_token_accuracy": 0.9111398458480835, "num_tokens": 40621420.0, "step": 3293 }, { "entropy": 1.2611454129219055, "epoch": 1.7345971563981042, "grad_norm": 0.26216942071914673, "learning_rate": 0.00017853825818248443, "loss": 0.19248586893081665, "mean_token_accuracy": 0.9217905402183533, "num_tokens": 40633756.0, "step": 3294 }, { "entropy": 1.2096803486347198, "epoch": 1.7351237493417588, "grad_norm": 0.2533584535121918, "learning_rate": 0.00017852404393450214, "loss": 0.19668050110340118, "mean_token_accuracy": 0.9232807159423828, "num_tokens": 40646092.0, "step": 3295 }, { "entropy": 1.197802484035492, "epoch": 1.7356503422854135, "grad_norm": 0.25326570868492126, "learning_rate": 0.00017850982561864673, "loss": 0.17445367574691772, "mean_token_accuracy": 0.9264692068099976, "num_tokens": 40658428.0, "step": 3296 }, { "entropy": 1.2270566523075104, "epoch": 1.736176935229068, "grad_norm": 0.26528990268707275, "learning_rate": 0.00017849560323576226, "loss": 0.1855545938014984, "mean_token_accuracy": 0.9231870025396347, "num_tokens": 40670764.0, "step": 3297 }, { "entropy": 1.2130609154701233, "epoch": 1.7367035281727223, "grad_norm": 0.28013598918914795, "learning_rate": 0.00017848137678669307, "loss": 0.19601064920425415, "mean_token_accuracy": 0.9243181943893433, "num_tokens": 40683100.0, "step": 3298 }, { "entropy": 1.226871132850647, "epoch": 1.7372301211163772, "grad_norm": 0.2821487486362457, "learning_rate": 0.0001784671462722837, "loss": 0.21541166305541992, "mean_token_accuracy": 0.9133672714233398, "num_tokens": 40695436.0, "step": 3299 }, { "entropy": 1.2181604504585266, "epoch": 1.7377567140600316, "grad_norm": 0.2949363589286804, "learning_rate": 0.00017845291169337886, "loss": 0.2169766128063202, "mean_token_accuracy": 0.9101507663726807, "num_tokens": 40707772.0, "step": 3300 }, { "entropy": 1.237768977880478, "epoch": 1.738283307003686, "grad_norm": 0.3046022951602936, "learning_rate": 0.00017843867305082368, "loss": 0.20753508806228638, "mean_token_accuracy": 0.9195269197225571, "num_tokens": 40720108.0, "step": 3301 }, { "entropy": 1.206713229417801, "epoch": 1.7388098999473407, "grad_norm": 0.2679121196269989, "learning_rate": 0.0001784244303454633, "loss": 0.2043764740228653, "mean_token_accuracy": 0.9116311520338058, "num_tokens": 40732444.0, "step": 3302 }, { "entropy": 1.2439360618591309, "epoch": 1.7393364928909953, "grad_norm": 0.25374096632003784, "learning_rate": 0.00017841018357814338, "loss": 0.18161284923553467, "mean_token_accuracy": 0.9243684113025665, "num_tokens": 40744780.0, "step": 3303 }, { "entropy": 1.2688191533088684, "epoch": 1.7398630858346498, "grad_norm": 0.28752121329307556, "learning_rate": 0.00017839593274970953, "loss": 0.20974797010421753, "mean_token_accuracy": 0.9088063091039658, "num_tokens": 40757116.0, "step": 3304 }, { "entropy": 1.2342472076416016, "epoch": 1.7403896787783044, "grad_norm": 0.2605990469455719, "learning_rate": 0.00017838167786100786, "loss": 0.2021808922290802, "mean_token_accuracy": 0.9125561267137527, "num_tokens": 40769452.0, "step": 3305 }, { "entropy": 1.2520089447498322, "epoch": 1.740916271721959, "grad_norm": 0.2876226007938385, "learning_rate": 0.00017836741891288447, "loss": 0.21958418190479279, "mean_token_accuracy": 0.9127276241779327, "num_tokens": 40781788.0, "step": 3306 }, { "entropy": 1.2590630948543549, "epoch": 1.7414428646656135, "grad_norm": 0.267333984375, "learning_rate": 0.00017835315590618593, "loss": 0.19477830827236176, "mean_token_accuracy": 0.9198647290468216, "num_tokens": 40794124.0, "step": 3307 }, { "entropy": 1.222892850637436, "epoch": 1.741969457609268, "grad_norm": 0.2734076976776123, "learning_rate": 0.0001783388888417589, "loss": 0.1936633288860321, "mean_token_accuracy": 0.9192850589752197, "num_tokens": 40806460.0, "step": 3308 }, { "entropy": 1.2516216337680817, "epoch": 1.7424960505529226, "grad_norm": 0.293828547000885, "learning_rate": 0.00017832461772045033, "loss": 0.20226381719112396, "mean_token_accuracy": 0.9191479235887527, "num_tokens": 40818796.0, "step": 3309 }, { "entropy": 1.2808569073677063, "epoch": 1.7430226434965772, "grad_norm": 0.29275745153427124, "learning_rate": 0.00017831034254310748, "loss": 0.2209526002407074, "mean_token_accuracy": 0.9084486216306686, "num_tokens": 40831132.0, "step": 3310 }, { "entropy": 1.2265948355197906, "epoch": 1.7435492364402316, "grad_norm": 0.2859675884246826, "learning_rate": 0.0001782960633105777, "loss": 0.20897722244262695, "mean_token_accuracy": 0.9134756773710251, "num_tokens": 40843468.0, "step": 3311 }, { "entropy": 1.2819762527942657, "epoch": 1.7440758293838863, "grad_norm": 0.2739836275577545, "learning_rate": 0.0001782817800237087, "loss": 0.20494410395622253, "mean_token_accuracy": 0.9149334281682968, "num_tokens": 40855804.0, "step": 3312 }, { "entropy": 1.2840421795845032, "epoch": 1.744602422327541, "grad_norm": 0.27893322706222534, "learning_rate": 0.0001782674926833484, "loss": 0.20927336812019348, "mean_token_accuracy": 0.9126023948192596, "num_tokens": 40868140.0, "step": 3313 }, { "entropy": 1.2541827261447906, "epoch": 1.7451290152711953, "grad_norm": 0.2732979953289032, "learning_rate": 0.00017825320129034495, "loss": 0.20452941954135895, "mean_token_accuracy": 0.9158912748098373, "num_tokens": 40880476.0, "step": 3314 }, { "entropy": 1.2899048030376434, "epoch": 1.7456556082148498, "grad_norm": 0.3004266321659088, "learning_rate": 0.0001782389058455468, "loss": 0.20099236071109772, "mean_token_accuracy": 0.9254409223794937, "num_tokens": 40892812.0, "step": 3315 }, { "entropy": 1.287499874830246, "epoch": 1.7461822011585044, "grad_norm": 0.2748308479785919, "learning_rate": 0.00017822460634980245, "loss": 0.19413264095783234, "mean_token_accuracy": 0.9179486334323883, "num_tokens": 40905148.0, "step": 3316 }, { "entropy": 1.2944321632385254, "epoch": 1.746708794102159, "grad_norm": 0.2908708453178406, "learning_rate": 0.00017821030280396093, "loss": 0.21369019150733948, "mean_token_accuracy": 0.9173711091279984, "num_tokens": 40917484.0, "step": 3317 }, { "entropy": 1.262908548116684, "epoch": 1.7472353870458135, "grad_norm": 0.25998809933662415, "learning_rate": 0.00017819599520887126, "loss": 0.19156329333782196, "mean_token_accuracy": 0.9206810593605042, "num_tokens": 40929820.0, "step": 3318 }, { "entropy": 1.3015094697475433, "epoch": 1.7477619799894681, "grad_norm": 0.30315208435058594, "learning_rate": 0.00017818168356538284, "loss": 0.2028445154428482, "mean_token_accuracy": 0.9121357649564743, "num_tokens": 40942156.0, "step": 3319 }, { "entropy": 1.2577976882457733, "epoch": 1.7482885729331228, "grad_norm": 0.251533180475235, "learning_rate": 0.00017816736787434526, "loss": 0.17267408967018127, "mean_token_accuracy": 0.9274961352348328, "num_tokens": 40954492.0, "step": 3320 }, { "entropy": 1.298771619796753, "epoch": 1.7488151658767772, "grad_norm": 0.26891663670539856, "learning_rate": 0.00017815304813660835, "loss": 0.20470818877220154, "mean_token_accuracy": 0.9156215190887451, "num_tokens": 40966828.0, "step": 3321 }, { "entropy": 1.297717809677124, "epoch": 1.7493417588204319, "grad_norm": 0.277751624584198, "learning_rate": 0.00017813872435302222, "loss": 0.1922859251499176, "mean_token_accuracy": 0.9206653833389282, "num_tokens": 40979164.0, "step": 3322 }, { "entropy": 1.3184978663921356, "epoch": 1.7498683517640865, "grad_norm": 0.28764608502388, "learning_rate": 0.00017812439652443716, "loss": 0.19598035514354706, "mean_token_accuracy": 0.922876164317131, "num_tokens": 40991500.0, "step": 3323 }, { "entropy": 1.2648021578788757, "epoch": 1.750394944707741, "grad_norm": 0.2744153141975403, "learning_rate": 0.0001781100646517037, "loss": 0.19071339070796967, "mean_token_accuracy": 0.9216628968715668, "num_tokens": 41003836.0, "step": 3324 }, { "entropy": 1.2510377168655396, "epoch": 1.7509215376513954, "grad_norm": 0.2512511610984802, "learning_rate": 0.00017809572873567274, "loss": 0.16837379336357117, "mean_token_accuracy": 0.9307546615600586, "num_tokens": 41016172.0, "step": 3325 }, { "entropy": 1.282473772764206, "epoch": 1.75144813059505, "grad_norm": 0.29696282744407654, "learning_rate": 0.00017808138877719522, "loss": 0.19326961040496826, "mean_token_accuracy": 0.9177820086479187, "num_tokens": 41028508.0, "step": 3326 }, { "entropy": 1.2485735416412354, "epoch": 1.7519747235387046, "grad_norm": 0.25719940662384033, "learning_rate": 0.00017806704477712245, "loss": 0.19185180962085724, "mean_token_accuracy": 0.9225496500730515, "num_tokens": 41040844.0, "step": 3327 }, { "entropy": 1.254735678434372, "epoch": 1.752501316482359, "grad_norm": 0.2844921946525574, "learning_rate": 0.000178052696736306, "loss": 0.20377546548843384, "mean_token_accuracy": 0.9177062809467316, "num_tokens": 41053180.0, "step": 3328 }, { "entropy": 1.2341787219047546, "epoch": 1.7530279094260137, "grad_norm": 0.2937590479850769, "learning_rate": 0.00017803834465559754, "loss": 0.2154744565486908, "mean_token_accuracy": 0.9114655256271362, "num_tokens": 41065516.0, "step": 3329 }, { "entropy": 1.2713043689727783, "epoch": 1.7535545023696684, "grad_norm": 0.29252561926841736, "learning_rate": 0.00017802398853584915, "loss": 0.20079272985458374, "mean_token_accuracy": 0.9159099161624908, "num_tokens": 41077852.0, "step": 3330 }, { "entropy": 1.2464990019798279, "epoch": 1.7540810953133228, "grad_norm": 0.2867441177368164, "learning_rate": 0.000178009628377913, "loss": 0.2051943838596344, "mean_token_accuracy": 0.9145941138267517, "num_tokens": 41090188.0, "step": 3331 }, { "entropy": 1.2052176296710968, "epoch": 1.7546076882569772, "grad_norm": 0.257271945476532, "learning_rate": 0.0001779952641826416, "loss": 0.18216028809547424, "mean_token_accuracy": 0.9247520416975021, "num_tokens": 41102524.0, "step": 3332 }, { "entropy": 1.2561128735542297, "epoch": 1.7551342812006319, "grad_norm": 0.2668805718421936, "learning_rate": 0.00017798089595088773, "loss": 0.17578330636024475, "mean_token_accuracy": 0.9274698793888092, "num_tokens": 41114860.0, "step": 3333 }, { "entropy": 1.2273137271404266, "epoch": 1.7556608741442865, "grad_norm": 0.28731396794319153, "learning_rate": 0.00017796652368350422, "loss": 0.20657789707183838, "mean_token_accuracy": 0.9174284040927887, "num_tokens": 41127196.0, "step": 3334 }, { "entropy": 1.217975229024887, "epoch": 1.756187467087941, "grad_norm": 0.24883601069450378, "learning_rate": 0.00017795214738134437, "loss": 0.1853816658258438, "mean_token_accuracy": 0.9215361028909683, "num_tokens": 41139532.0, "step": 3335 }, { "entropy": 1.270724892616272, "epoch": 1.7567140600315956, "grad_norm": 0.3023955523967743, "learning_rate": 0.00017793776704526156, "loss": 0.21046261489391327, "mean_token_accuracy": 0.9148201197385788, "num_tokens": 41151868.0, "step": 3336 }, { "entropy": 1.3148931860923767, "epoch": 1.7572406529752502, "grad_norm": 0.31092697381973267, "learning_rate": 0.00017792338267610955, "loss": 0.22172124683856964, "mean_token_accuracy": 0.9151052385568619, "num_tokens": 41164204.0, "step": 3337 }, { "entropy": 1.2632471919059753, "epoch": 1.7577672459189047, "grad_norm": 0.26783210039138794, "learning_rate": 0.00017790899427474216, "loss": 0.197731152176857, "mean_token_accuracy": 0.9220364391803741, "num_tokens": 41176540.0, "step": 3338 }, { "entropy": 1.3053453266620636, "epoch": 1.758293838862559, "grad_norm": 0.28016164898872375, "learning_rate": 0.0001778946018420136, "loss": 0.19119513034820557, "mean_token_accuracy": 0.9238210469484329, "num_tokens": 41188876.0, "step": 3339 }, { "entropy": 1.2755919098854065, "epoch": 1.758820431806214, "grad_norm": 0.2692145109176636, "learning_rate": 0.00017788020537877822, "loss": 0.20970848202705383, "mean_token_accuracy": 0.9092446118593216, "num_tokens": 41201212.0, "step": 3340 }, { "entropy": 1.3126140236854553, "epoch": 1.7593470247498684, "grad_norm": 0.2891995906829834, "learning_rate": 0.00017786580488589072, "loss": 0.20718203485012054, "mean_token_accuracy": 0.9121265858411789, "num_tokens": 41213548.0, "step": 3341 }, { "entropy": 1.2515637278556824, "epoch": 1.7598736176935228, "grad_norm": 0.2759207487106323, "learning_rate": 0.0001778514003642059, "loss": 0.2197999209165573, "mean_token_accuracy": 0.9112512469291687, "num_tokens": 41225884.0, "step": 3342 }, { "entropy": 1.3375881612300873, "epoch": 1.7604002106371774, "grad_norm": 0.3448629677295685, "learning_rate": 0.0001778369918145789, "loss": 0.22216130793094635, "mean_token_accuracy": 0.9111101776361465, "num_tokens": 41238220.0, "step": 3343 }, { "entropy": 1.3089163899421692, "epoch": 1.760926803580832, "grad_norm": 0.3070039749145508, "learning_rate": 0.00017782257923786512, "loss": 0.227981299161911, "mean_token_accuracy": 0.9092568904161453, "num_tokens": 41250556.0, "step": 3344 }, { "entropy": 1.2772272825241089, "epoch": 1.7614533965244865, "grad_norm": 0.3033801317214966, "learning_rate": 0.0001778081626349201, "loss": 0.23961672186851501, "mean_token_accuracy": 0.9030078947544098, "num_tokens": 41262892.0, "step": 3345 }, { "entropy": 1.2329810559749603, "epoch": 1.7619799894681412, "grad_norm": 0.2866532504558563, "learning_rate": 0.00017779374200659967, "loss": 0.19439920783042908, "mean_token_accuracy": 0.9247799217700958, "num_tokens": 41275228.0, "step": 3346 }, { "entropy": 1.3167122602462769, "epoch": 1.7625065824117958, "grad_norm": 0.2825206518173218, "learning_rate": 0.0001777793173537599, "loss": 0.22407029569149017, "mean_token_accuracy": 0.9099050462245941, "num_tokens": 41287564.0, "step": 3347 }, { "entropy": 1.2629252672195435, "epoch": 1.7630331753554502, "grad_norm": 0.2708073854446411, "learning_rate": 0.00017776488867725712, "loss": 0.20463934540748596, "mean_token_accuracy": 0.9120416194200516, "num_tokens": 41299900.0, "step": 3348 }, { "entropy": 1.27415269613266, "epoch": 1.7635597682991047, "grad_norm": 0.2722845673561096, "learning_rate": 0.00017775045597794787, "loss": 0.21537022292613983, "mean_token_accuracy": 0.9141311943531036, "num_tokens": 41312236.0, "step": 3349 }, { "entropy": 1.3064779043197632, "epoch": 1.7640863612427593, "grad_norm": 0.2894989848136902, "learning_rate": 0.00017773601925668892, "loss": 0.22586101293563843, "mean_token_accuracy": 0.9097247868776321, "num_tokens": 41324572.0, "step": 3350 }, { "entropy": 1.2612329721450806, "epoch": 1.764612954186414, "grad_norm": 0.29836785793304443, "learning_rate": 0.00017772157851433728, "loss": 0.21758875250816345, "mean_token_accuracy": 0.9101037234067917, "num_tokens": 41336908.0, "step": 3351 }, { "entropy": 1.2290297746658325, "epoch": 1.7651395471300684, "grad_norm": 0.25658851861953735, "learning_rate": 0.00017770713375175027, "loss": 0.2039872407913208, "mean_token_accuracy": 0.9155770987272263, "num_tokens": 41349244.0, "step": 3352 }, { "entropy": 1.2159041166305542, "epoch": 1.765666140073723, "grad_norm": 0.25883957743644714, "learning_rate": 0.00017769268496978534, "loss": 0.2031729817390442, "mean_token_accuracy": 0.9135902374982834, "num_tokens": 41361580.0, "step": 3353 }, { "entropy": 1.2781166732311249, "epoch": 1.7661927330173777, "grad_norm": 0.2804759740829468, "learning_rate": 0.0001776782321693003, "loss": 0.20843571424484253, "mean_token_accuracy": 0.9182161241769791, "num_tokens": 41373916.0, "step": 3354 }, { "entropy": 1.2583058774471283, "epoch": 1.766719325961032, "grad_norm": 0.2756879925727844, "learning_rate": 0.000177663775351153, "loss": 0.20797543227672577, "mean_token_accuracy": 0.9124239981174469, "num_tokens": 41386252.0, "step": 3355 }, { "entropy": 1.216934710741043, "epoch": 1.7672459189046865, "grad_norm": 0.24864549934864044, "learning_rate": 0.00017764931451620176, "loss": 0.19844800233840942, "mean_token_accuracy": 0.9174752831459045, "num_tokens": 41398588.0, "step": 3356 }, { "entropy": 1.1914585530757904, "epoch": 1.7677725118483414, "grad_norm": 0.3007160723209381, "learning_rate": 0.000177634849665305, "loss": 0.19987277686595917, "mean_token_accuracy": 0.9170159250497818, "num_tokens": 41410924.0, "step": 3357 }, { "entropy": 1.2236018180847168, "epoch": 1.7682991047919958, "grad_norm": 0.26258760690689087, "learning_rate": 0.00017762038079932143, "loss": 0.19202816486358643, "mean_token_accuracy": 0.9185950011014938, "num_tokens": 41423260.0, "step": 3358 }, { "entropy": 1.203150063753128, "epoch": 1.7688256977356502, "grad_norm": 0.30711668729782104, "learning_rate": 0.00017760590791910996, "loss": 0.199526846408844, "mean_token_accuracy": 0.9178106486797333, "num_tokens": 41435596.0, "step": 3359 }, { "entropy": 1.1577493846416473, "epoch": 1.7693522906793049, "grad_norm": 0.2871035933494568, "learning_rate": 0.0001775914310255298, "loss": 0.20930145680904388, "mean_token_accuracy": 0.9113402664661407, "num_tokens": 41447932.0, "step": 3360 }, { "entropy": 1.1829438507556915, "epoch": 1.7698788836229595, "grad_norm": 0.2672130763530731, "learning_rate": 0.0001775769501194403, "loss": 0.19939038157463074, "mean_token_accuracy": 0.9205279648303986, "num_tokens": 41460268.0, "step": 3361 }, { "entropy": 1.1942402124404907, "epoch": 1.770405476566614, "grad_norm": 0.25566044449806213, "learning_rate": 0.00017756246520170114, "loss": 0.1758129745721817, "mean_token_accuracy": 0.9335868656635284, "num_tokens": 41472604.0, "step": 3362 }, { "entropy": 1.1532124280929565, "epoch": 1.7709320695102686, "grad_norm": 0.27559491991996765, "learning_rate": 0.00017754797627317223, "loss": 0.21339191496372223, "mean_token_accuracy": 0.9085791558027267, "num_tokens": 41484940.0, "step": 3363 }, { "entropy": 1.1915392577648163, "epoch": 1.7714586624539232, "grad_norm": 0.27328014373779297, "learning_rate": 0.00017753348333471368, "loss": 0.19107362627983093, "mean_token_accuracy": 0.919417142868042, "num_tokens": 41497276.0, "step": 3364 }, { "entropy": 1.2415129840373993, "epoch": 1.7719852553975777, "grad_norm": 0.3027941584587097, "learning_rate": 0.00017751898638718582, "loss": 0.21972572803497314, "mean_token_accuracy": 0.9154131710529327, "num_tokens": 41509612.0, "step": 3365 }, { "entropy": 1.2410273849964142, "epoch": 1.772511848341232, "grad_norm": 0.2616625726222992, "learning_rate": 0.00017750448543144923, "loss": 0.19885270297527313, "mean_token_accuracy": 0.9170425534248352, "num_tokens": 41521948.0, "step": 3366 }, { "entropy": 1.17729052901268, "epoch": 1.7730384412848867, "grad_norm": 0.2854722738265991, "learning_rate": 0.00017748998046836483, "loss": 0.21116960048675537, "mean_token_accuracy": 0.9104287326335907, "num_tokens": 41534284.0, "step": 3367 }, { "entropy": 1.2824692726135254, "epoch": 1.7735650342285414, "grad_norm": 0.3191331923007965, "learning_rate": 0.00017747547149879364, "loss": 0.22000783681869507, "mean_token_accuracy": 0.906844973564148, "num_tokens": 41546620.0, "step": 3368 }, { "entropy": 1.2594166994094849, "epoch": 1.7740916271721958, "grad_norm": 0.28365424275398254, "learning_rate": 0.000177460958523597, "loss": 0.2075151801109314, "mean_token_accuracy": 0.913050040602684, "num_tokens": 41558956.0, "step": 3369 }, { "entropy": 1.235844612121582, "epoch": 1.7746182201158505, "grad_norm": 0.2545213997364044, "learning_rate": 0.00017744644154363642, "loss": 0.19338078796863556, "mean_token_accuracy": 0.923160582780838, "num_tokens": 41571292.0, "step": 3370 }, { "entropy": 1.3051631450653076, "epoch": 1.7751448130595051, "grad_norm": 0.2971054017543793, "learning_rate": 0.00017743192055977373, "loss": 0.20190899074077606, "mean_token_accuracy": 0.9218249917030334, "num_tokens": 41583628.0, "step": 3371 }, { "entropy": 1.2504850327968597, "epoch": 1.7756714060031595, "grad_norm": 0.2931920886039734, "learning_rate": 0.00017741739557287093, "loss": 0.22522364556789398, "mean_token_accuracy": 0.9096525609493256, "num_tokens": 41595964.0, "step": 3372 }, { "entropy": 1.239783525466919, "epoch": 1.776197998946814, "grad_norm": 0.2665524482727051, "learning_rate": 0.0001774028665837903, "loss": 0.20252424478530884, "mean_token_accuracy": 0.9206974357366562, "num_tokens": 41608300.0, "step": 3373 }, { "entropy": 1.2758963406085968, "epoch": 1.7767245918904688, "grad_norm": 0.28818976879119873, "learning_rate": 0.00017738833359339434, "loss": 0.20459452271461487, "mean_token_accuracy": 0.9180116057395935, "num_tokens": 41620636.0, "step": 3374 }, { "entropy": 1.20317143201828, "epoch": 1.7772511848341233, "grad_norm": 0.24318887293338776, "learning_rate": 0.0001773737966025458, "loss": 0.18710657954216003, "mean_token_accuracy": 0.9200632572174072, "num_tokens": 41632972.0, "step": 3375 }, { "entropy": 1.2684413492679596, "epoch": 1.7777777777777777, "grad_norm": 0.2672540843486786, "learning_rate": 0.0001773592556121076, "loss": 0.21147683262825012, "mean_token_accuracy": 0.9108813256025314, "num_tokens": 41645308.0, "step": 3376 }, { "entropy": 1.2610873579978943, "epoch": 1.7783043707214323, "grad_norm": 0.2789379060268402, "learning_rate": 0.00017734471062294302, "loss": 0.19667166471481323, "mean_token_accuracy": 0.9191772490739822, "num_tokens": 41657644.0, "step": 3377 }, { "entropy": 1.209890991449356, "epoch": 1.778830963665087, "grad_norm": 0.259087473154068, "learning_rate": 0.00017733016163591547, "loss": 0.19788247346878052, "mean_token_accuracy": 0.9188321679830551, "num_tokens": 41669980.0, "step": 3378 }, { "entropy": 1.2839680910110474, "epoch": 1.7793575566087414, "grad_norm": 0.27051210403442383, "learning_rate": 0.00017731560865188865, "loss": 0.19803057610988617, "mean_token_accuracy": 0.921959638595581, "num_tokens": 41682316.0, "step": 3379 }, { "entropy": 1.2436229586601257, "epoch": 1.779884149552396, "grad_norm": 0.28252285718917847, "learning_rate": 0.0001773010516717265, "loss": 0.19300350546836853, "mean_token_accuracy": 0.9220046401023865, "num_tokens": 41694652.0, "step": 3380 }, { "entropy": 1.2022179961204529, "epoch": 1.7804107424960507, "grad_norm": 0.27916550636291504, "learning_rate": 0.00017728649069629316, "loss": 0.21073868870735168, "mean_token_accuracy": 0.913501039147377, "num_tokens": 41706988.0, "step": 3381 }, { "entropy": 1.1777479350566864, "epoch": 1.7809373354397051, "grad_norm": 0.2819908857345581, "learning_rate": 0.00017727192572645307, "loss": 0.2172769159078598, "mean_token_accuracy": 0.9113239943981171, "num_tokens": 41719324.0, "step": 3382 }, { "entropy": 1.2020470798015594, "epoch": 1.7814639283833595, "grad_norm": 0.2866542637348175, "learning_rate": 0.00017725735676307083, "loss": 0.20779943466186523, "mean_token_accuracy": 0.9181617349386215, "num_tokens": 41731660.0, "step": 3383 }, { "entropy": 1.2138996124267578, "epoch": 1.7819905213270142, "grad_norm": 0.26489347219467163, "learning_rate": 0.0001772427838070113, "loss": 0.2014807164669037, "mean_token_accuracy": 0.917888268828392, "num_tokens": 41743996.0, "step": 3384 }, { "entropy": 1.1408116817474365, "epoch": 1.7825171142706688, "grad_norm": 0.2681819498538971, "learning_rate": 0.00017722820685913963, "loss": 0.21120908856391907, "mean_token_accuracy": 0.9159476608037949, "num_tokens": 41756332.0, "step": 3385 }, { "entropy": 1.1952861547470093, "epoch": 1.7830437072143233, "grad_norm": 0.27355825901031494, "learning_rate": 0.00017721362592032117, "loss": 0.20519855618476868, "mean_token_accuracy": 0.9159957766532898, "num_tokens": 41768668.0, "step": 3386 }, { "entropy": 1.2068920731544495, "epoch": 1.783570300157978, "grad_norm": 0.28034836053848267, "learning_rate": 0.00017719904099142147, "loss": 0.20763035118579865, "mean_token_accuracy": 0.9192133694887161, "num_tokens": 41781004.0, "step": 3387 }, { "entropy": 1.1186204552650452, "epoch": 1.7840968931016326, "grad_norm": 0.26254552602767944, "learning_rate": 0.0001771844520733064, "loss": 0.20995590090751648, "mean_token_accuracy": 0.9153067320585251, "num_tokens": 41793340.0, "step": 3388 }, { "entropy": 1.1552630364894867, "epoch": 1.784623486045287, "grad_norm": 0.2836894392967224, "learning_rate": 0.00017716985916684197, "loss": 0.21084123849868774, "mean_token_accuracy": 0.9113008379936218, "num_tokens": 41805676.0, "step": 3389 }, { "entropy": 1.1729071736335754, "epoch": 1.7851500789889414, "grad_norm": 0.2675871253013611, "learning_rate": 0.0001771552622728945, "loss": 0.19911614060401917, "mean_token_accuracy": 0.9161395877599716, "num_tokens": 41818012.0, "step": 3390 }, { "entropy": 1.183312863111496, "epoch": 1.785676671932596, "grad_norm": 0.29449769854545593, "learning_rate": 0.00017714066139233053, "loss": 0.19318415224552155, "mean_token_accuracy": 0.920307382941246, "num_tokens": 41830348.0, "step": 3391 }, { "entropy": 1.1941271126270294, "epoch": 1.7862032648762507, "grad_norm": 0.29486992955207825, "learning_rate": 0.0001771260565260168, "loss": 0.20498642325401306, "mean_token_accuracy": 0.9168984740972519, "num_tokens": 41842684.0, "step": 3392 }, { "entropy": 1.1674256920814514, "epoch": 1.7867298578199051, "grad_norm": 0.3044561743736267, "learning_rate": 0.00017711144767482034, "loss": 0.2078413963317871, "mean_token_accuracy": 0.9115557223558426, "num_tokens": 41855020.0, "step": 3393 }, { "entropy": 1.115517109632492, "epoch": 1.7872564507635598, "grad_norm": 0.2597251832485199, "learning_rate": 0.00017709683483960837, "loss": 0.18797630071640015, "mean_token_accuracy": 0.9255786091089249, "num_tokens": 41867356.0, "step": 3394 }, { "entropy": 1.1435833275318146, "epoch": 1.7877830437072144, "grad_norm": 0.26411309838294983, "learning_rate": 0.0001770822180212484, "loss": 0.1814870834350586, "mean_token_accuracy": 0.9257442653179169, "num_tokens": 41879692.0, "step": 3395 }, { "entropy": 1.1526050865650177, "epoch": 1.7883096366508688, "grad_norm": 0.27172785997390747, "learning_rate": 0.00017706759722060816, "loss": 0.19988085329532623, "mean_token_accuracy": 0.9178711026906967, "num_tokens": 41892028.0, "step": 3396 }, { "entropy": 1.1092619001865387, "epoch": 1.7888362295945235, "grad_norm": 0.26404666900634766, "learning_rate": 0.00017705297243855551, "loss": 0.18823406100273132, "mean_token_accuracy": 0.9220343977212906, "num_tokens": 41904364.0, "step": 3397 }, { "entropy": 1.1228880286216736, "epoch": 1.7893628225381781, "grad_norm": 0.2574518620967865, "learning_rate": 0.00017703834367595878, "loss": 0.18857592344284058, "mean_token_accuracy": 0.9215908646583557, "num_tokens": 41916700.0, "step": 3398 }, { "entropy": 1.1254870891571045, "epoch": 1.7898894154818326, "grad_norm": 0.27541834115982056, "learning_rate": 0.00017702371093368627, "loss": 0.18809503316879272, "mean_token_accuracy": 0.9209438264369965, "num_tokens": 41929036.0, "step": 3399 }, { "entropy": 1.075088083744049, "epoch": 1.790416008425487, "grad_norm": 0.25025203824043274, "learning_rate": 0.00017700907421260668, "loss": 0.1794566810131073, "mean_token_accuracy": 0.925526887178421, "num_tokens": 41941372.0, "step": 3400 }, { "entropy": 1.1571705043315887, "epoch": 1.7909426013691416, "grad_norm": 0.2782227396965027, "learning_rate": 0.0001769944335135889, "loss": 0.19144821166992188, "mean_token_accuracy": 0.9179984331130981, "num_tokens": 41953708.0, "step": 3401 }, { "entropy": 1.0587176382541656, "epoch": 1.7914691943127963, "grad_norm": 0.2607192397117615, "learning_rate": 0.00017697978883750212, "loss": 0.19511093199253082, "mean_token_accuracy": 0.9198868274688721, "num_tokens": 41966044.0, "step": 3402 }, { "entropy": 1.1079656779766083, "epoch": 1.7919957872564507, "grad_norm": 0.26396170258522034, "learning_rate": 0.00017696514018521563, "loss": 0.21819618344306946, "mean_token_accuracy": 0.910576269030571, "num_tokens": 41978380.0, "step": 3403 }, { "entropy": 1.0812654197216034, "epoch": 1.7925223802001053, "grad_norm": 0.2712666690349579, "learning_rate": 0.00017695048755759908, "loss": 0.20643654465675354, "mean_token_accuracy": 0.9118922054767609, "num_tokens": 41990716.0, "step": 3404 }, { "entropy": 1.0948403775691986, "epoch": 1.79304897314376, "grad_norm": 0.2753002345561981, "learning_rate": 0.0001769358309555223, "loss": 0.21245992183685303, "mean_token_accuracy": 0.9119813740253448, "num_tokens": 42003052.0, "step": 3405 }, { "entropy": 1.1134866774082184, "epoch": 1.7935755660874144, "grad_norm": 0.24785494804382324, "learning_rate": 0.00017692117037985538, "loss": 0.1743498146533966, "mean_token_accuracy": 0.9319243878126144, "num_tokens": 42015388.0, "step": 3406 }, { "entropy": 1.03944431245327, "epoch": 1.7941021590310688, "grad_norm": 0.25819504261016846, "learning_rate": 0.0001769065058314686, "loss": 0.2109576016664505, "mean_token_accuracy": 0.9150231778621674, "num_tokens": 42027724.0, "step": 3407 }, { "entropy": 1.079315334558487, "epoch": 1.7946287519747235, "grad_norm": 0.26192978024482727, "learning_rate": 0.00017689183731123257, "loss": 0.20323598384857178, "mean_token_accuracy": 0.9163467139005661, "num_tokens": 42040060.0, "step": 3408 }, { "entropy": 1.1146911978721619, "epoch": 1.7951553449183781, "grad_norm": 0.2505536377429962, "learning_rate": 0.00017687716482001797, "loss": 0.18577729165554047, "mean_token_accuracy": 0.9239400625228882, "num_tokens": 42052396.0, "step": 3409 }, { "entropy": 1.0605261623859406, "epoch": 1.7956819378620326, "grad_norm": 0.25102049112319946, "learning_rate": 0.00017686248835869595, "loss": 0.20101284980773926, "mean_token_accuracy": 0.9199343025684357, "num_tokens": 42064732.0, "step": 3410 }, { "entropy": 1.0440888553857803, "epoch": 1.7962085308056872, "grad_norm": 0.26397231221199036, "learning_rate": 0.00017684780792813764, "loss": 0.2093440592288971, "mean_token_accuracy": 0.9137531369924545, "num_tokens": 42077068.0, "step": 3411 }, { "entropy": 1.0457901358604431, "epoch": 1.7967351237493419, "grad_norm": 0.28600117564201355, "learning_rate": 0.00017683312352921463, "loss": 0.21590805053710938, "mean_token_accuracy": 0.9133930206298828, "num_tokens": 42089404.0, "step": 3412 }, { "entropy": 1.0765321105718613, "epoch": 1.7972617166929963, "grad_norm": 0.27367517352104187, "learning_rate": 0.00017681843516279862, "loss": 0.17508497834205627, "mean_token_accuracy": 0.9287613779306412, "num_tokens": 42101740.0, "step": 3413 }, { "entropy": 1.0435933470726013, "epoch": 1.7977883096366507, "grad_norm": 0.3039937913417816, "learning_rate": 0.00017680374282976152, "loss": 0.22740893065929413, "mean_token_accuracy": 0.9117265343666077, "num_tokens": 42114076.0, "step": 3414 }, { "entropy": 1.0765089988708496, "epoch": 1.7983149025803056, "grad_norm": 0.29611867666244507, "learning_rate": 0.00017678904653097558, "loss": 0.2006775140762329, "mean_token_accuracy": 0.917385458946228, "num_tokens": 42126412.0, "step": 3415 }, { "entropy": 1.0454992651939392, "epoch": 1.79884149552396, "grad_norm": 0.27161067724227905, "learning_rate": 0.00017677434626731323, "loss": 0.2067311704158783, "mean_token_accuracy": 0.918012872338295, "num_tokens": 42138748.0, "step": 3416 }, { "entropy": 1.063028246164322, "epoch": 1.7993680884676144, "grad_norm": 0.30537426471710205, "learning_rate": 0.00017675964203964716, "loss": 0.22716304659843445, "mean_token_accuracy": 0.911460742354393, "num_tokens": 42151084.0, "step": 3417 }, { "entropy": 1.020344227552414, "epoch": 1.799894681411269, "grad_norm": 0.2623611092567444, "learning_rate": 0.00017674493384885022, "loss": 0.17709854245185852, "mean_token_accuracy": 0.9269069582223892, "num_tokens": 42163420.0, "step": 3418 }, { "entropy": 1.056466594338417, "epoch": 1.8004212743549237, "grad_norm": 0.28182798624038696, "learning_rate": 0.0001767302216957956, "loss": 0.2123803049325943, "mean_token_accuracy": 0.919185072183609, "num_tokens": 42175756.0, "step": 3419 }, { "entropy": 1.020190790295601, "epoch": 1.8009478672985781, "grad_norm": 0.2913738489151001, "learning_rate": 0.00017671550558135662, "loss": 0.2207547426223755, "mean_token_accuracy": 0.9098331481218338, "num_tokens": 42188092.0, "step": 3420 }, { "entropy": 1.0069181025028229, "epoch": 1.8014744602422328, "grad_norm": 0.3414415717124939, "learning_rate": 0.00017670078550640692, "loss": 0.20877774059772491, "mean_token_accuracy": 0.9150732308626175, "num_tokens": 42200428.0, "step": 3421 }, { "entropy": 0.9878948777914047, "epoch": 1.8020010531858874, "grad_norm": 0.2625672221183777, "learning_rate": 0.00017668606147182037, "loss": 0.18287813663482666, "mean_token_accuracy": 0.9247158914804459, "num_tokens": 42212764.0, "step": 3422 }, { "entropy": 0.9836813509464264, "epoch": 1.8025276461295419, "grad_norm": 0.2774287462234497, "learning_rate": 0.000176671333478471, "loss": 0.20418068766593933, "mean_token_accuracy": 0.9173961877822876, "num_tokens": 42225100.0, "step": 3423 }, { "entropy": 0.9749710410833359, "epoch": 1.8030542390731963, "grad_norm": 0.2605920433998108, "learning_rate": 0.00017665660152723319, "loss": 0.19839239120483398, "mean_token_accuracy": 0.9227689206600189, "num_tokens": 42237436.0, "step": 3424 }, { "entropy": 0.9625023603439331, "epoch": 1.803580832016851, "grad_norm": 0.2580849230289459, "learning_rate": 0.00017664186561898145, "loss": 0.19285142421722412, "mean_token_accuracy": 0.9149420410394669, "num_tokens": 42249772.0, "step": 3425 }, { "entropy": 0.9385105073451996, "epoch": 1.8041074249605056, "grad_norm": 0.2744423747062683, "learning_rate": 0.0001766271257545905, "loss": 0.22436729073524475, "mean_token_accuracy": 0.9081188142299652, "num_tokens": 42262108.0, "step": 3426 }, { "entropy": 0.9655201435089111, "epoch": 1.80463401790416, "grad_norm": 0.25290924310684204, "learning_rate": 0.00017661238193493548, "loss": 0.19769905507564545, "mean_token_accuracy": 0.9191560298204422, "num_tokens": 42274444.0, "step": 3427 }, { "entropy": 0.9744076132774353, "epoch": 1.8051606108478147, "grad_norm": 0.36244046688079834, "learning_rate": 0.00017659763416089157, "loss": 0.20538192987442017, "mean_token_accuracy": 0.91567362844944, "num_tokens": 42286780.0, "step": 3428 }, { "entropy": 0.9812397658824921, "epoch": 1.8056872037914693, "grad_norm": 0.2958359718322754, "learning_rate": 0.00017658288243333433, "loss": 0.22860632836818695, "mean_token_accuracy": 0.9086659848690033, "num_tokens": 42299116.0, "step": 3429 }, { "entropy": 0.9486215561628342, "epoch": 1.8062137967351237, "grad_norm": 0.2708651125431061, "learning_rate": 0.00017656812675313936, "loss": 0.20294052362442017, "mean_token_accuracy": 0.9186287671327591, "num_tokens": 42311452.0, "step": 3430 }, { "entropy": 1.018494963645935, "epoch": 1.8067403896787781, "grad_norm": 0.2610625922679901, "learning_rate": 0.00017655336712118274, "loss": 0.18903633952140808, "mean_token_accuracy": 0.9225384891033173, "num_tokens": 42323788.0, "step": 3431 }, { "entropy": 0.9701050668954849, "epoch": 1.807266982622433, "grad_norm": 0.2695980966091156, "learning_rate": 0.0001765386035383406, "loss": 0.20392455160617828, "mean_token_accuracy": 0.913482204079628, "num_tokens": 42336124.0, "step": 3432 }, { "entropy": 0.9882481843233109, "epoch": 1.8077935755660874, "grad_norm": 0.27849382162094116, "learning_rate": 0.0001765238360054894, "loss": 0.2001408338546753, "mean_token_accuracy": 0.9178249388933182, "num_tokens": 42348460.0, "step": 3433 }, { "entropy": 0.9755127131938934, "epoch": 1.8083201685097419, "grad_norm": 0.2871023714542389, "learning_rate": 0.00017650906452350577, "loss": 0.21643081307411194, "mean_token_accuracy": 0.9128262996673584, "num_tokens": 42360796.0, "step": 3434 }, { "entropy": 1.0046819299459457, "epoch": 1.8088467614533965, "grad_norm": 0.26911982893943787, "learning_rate": 0.00017649428909326665, "loss": 0.20376306772232056, "mean_token_accuracy": 0.9150490611791611, "num_tokens": 42373132.0, "step": 3435 }, { "entropy": 1.020606204867363, "epoch": 1.8093733543970512, "grad_norm": 0.2887180745601654, "learning_rate": 0.00017647950971564914, "loss": 0.2110900580883026, "mean_token_accuracy": 0.9153491258621216, "num_tokens": 42385468.0, "step": 3436 }, { "entropy": 0.9779709279537201, "epoch": 1.8098999473407056, "grad_norm": 0.2773571014404297, "learning_rate": 0.00017646472639153057, "loss": 0.21756364405155182, "mean_token_accuracy": 0.915818601846695, "num_tokens": 42397804.0, "step": 3437 }, { "entropy": 1.0198432505130768, "epoch": 1.8104265402843602, "grad_norm": 0.25971168279647827, "learning_rate": 0.00017644993912178863, "loss": 0.19616732001304626, "mean_token_accuracy": 0.9186940789222717, "num_tokens": 42410140.0, "step": 3438 }, { "entropy": 1.0019106715917587, "epoch": 1.8109531332280149, "grad_norm": 0.27781882882118225, "learning_rate": 0.00017643514790730106, "loss": 0.22385036945343018, "mean_token_accuracy": 0.9076634049415588, "num_tokens": 42422476.0, "step": 3439 }, { "entropy": 1.0161989629268646, "epoch": 1.8114797261716693, "grad_norm": 0.2737201452255249, "learning_rate": 0.00017642035274894596, "loss": 0.20915377140045166, "mean_token_accuracy": 0.9130603224039078, "num_tokens": 42434812.0, "step": 3440 }, { "entropy": 1.0263062715530396, "epoch": 1.8120063191153237, "grad_norm": 0.2517765760421753, "learning_rate": 0.00017640555364760173, "loss": 0.18634292483329773, "mean_token_accuracy": 0.9243203103542328, "num_tokens": 42447148.0, "step": 3441 }, { "entropy": 1.0274717211723328, "epoch": 1.8125329120589784, "grad_norm": 0.27562084794044495, "learning_rate": 0.00017639075060414675, "loss": 0.2285502851009369, "mean_token_accuracy": 0.905607059597969, "num_tokens": 42459484.0, "step": 3442 }, { "entropy": 1.0182528346776962, "epoch": 1.813059505002633, "grad_norm": 0.2482491433620453, "learning_rate": 0.00017637594361945988, "loss": 0.20179533958435059, "mean_token_accuracy": 0.9154495447874069, "num_tokens": 42471820.0, "step": 3443 }, { "entropy": 1.0020128339529037, "epoch": 1.8135860979462874, "grad_norm": 0.237760528922081, "learning_rate": 0.00017636113269442008, "loss": 0.16691860556602478, "mean_token_accuracy": 0.9328106641769409, "num_tokens": 42484156.0, "step": 3444 }, { "entropy": 0.9634300619363785, "epoch": 1.814112690889942, "grad_norm": 0.25161245465278625, "learning_rate": 0.00017634631782990665, "loss": 0.19200566411018372, "mean_token_accuracy": 0.9238070696592331, "num_tokens": 42496492.0, "step": 3445 }, { "entropy": 0.9657048434019089, "epoch": 1.8146392838335967, "grad_norm": 0.2663264572620392, "learning_rate": 0.00017633149902679903, "loss": 0.19708439707756042, "mean_token_accuracy": 0.9215977638959885, "num_tokens": 42508828.0, "step": 3446 }, { "entropy": 1.0027496963739395, "epoch": 1.8151658767772512, "grad_norm": 0.257934033870697, "learning_rate": 0.0001763166762859769, "loss": 0.19249504804611206, "mean_token_accuracy": 0.918593168258667, "num_tokens": 42521164.0, "step": 3447 }, { "entropy": 0.9626820534467697, "epoch": 1.8156924697209056, "grad_norm": 0.246200829744339, "learning_rate": 0.0001763018496083202, "loss": 0.17840000987052917, "mean_token_accuracy": 0.9268343597650528, "num_tokens": 42533500.0, "step": 3448 }, { "entropy": 0.9367417544126511, "epoch": 1.8162190626645605, "grad_norm": 0.2481808215379715, "learning_rate": 0.0001762870189947092, "loss": 0.18670141696929932, "mean_token_accuracy": 0.9216200262308121, "num_tokens": 42545836.0, "step": 3449 }, { "entropy": 0.9394432306289673, "epoch": 1.8167456556082149, "grad_norm": 0.26846200227737427, "learning_rate": 0.00017627218444602418, "loss": 0.19002090394496918, "mean_token_accuracy": 0.9229268431663513, "num_tokens": 42558172.0, "step": 3450 }, { "entropy": 0.9051215350627899, "epoch": 1.8172722485518693, "grad_norm": 0.2518659830093384, "learning_rate": 0.0001762573459631458, "loss": 0.19580325484275818, "mean_token_accuracy": 0.9171916991472244, "num_tokens": 42570508.0, "step": 3451 }, { "entropy": 0.9344974011182785, "epoch": 1.817798841495524, "grad_norm": 0.28661391139030457, "learning_rate": 0.000176242503546955, "loss": 0.2089633345603943, "mean_token_accuracy": 0.9145671278238297, "num_tokens": 42582844.0, "step": 3452 }, { "entropy": 0.9151428788900375, "epoch": 1.8183254344391786, "grad_norm": 0.27580344676971436, "learning_rate": 0.0001762276571983329, "loss": 0.20280398428440094, "mean_token_accuracy": 0.9187836647033691, "num_tokens": 42595180.0, "step": 3453 }, { "entropy": 0.9216799587011337, "epoch": 1.818852027382833, "grad_norm": 0.3177351653575897, "learning_rate": 0.00017621280691816076, "loss": 0.22672337293624878, "mean_token_accuracy": 0.9106907099485397, "num_tokens": 42607516.0, "step": 3454 }, { "entropy": 0.9563778191804886, "epoch": 1.8193786203264877, "grad_norm": 0.2692190110683441, "learning_rate": 0.0001761979527073202, "loss": 0.18519625067710876, "mean_token_accuracy": 0.9241679459810257, "num_tokens": 42619852.0, "step": 3455 }, { "entropy": 0.9491466730833054, "epoch": 1.8199052132701423, "grad_norm": 0.30144041776657104, "learning_rate": 0.00017618309456669297, "loss": 0.20708760619163513, "mean_token_accuracy": 0.9165724217891693, "num_tokens": 42632188.0, "step": 3456 }, { "entropy": 0.9680854380130768, "epoch": 1.8204318062137967, "grad_norm": 0.29503685235977173, "learning_rate": 0.00017616823249716118, "loss": 0.20235475897789001, "mean_token_accuracy": 0.9136970639228821, "num_tokens": 42644524.0, "step": 3457 }, { "entropy": 0.9400119334459305, "epoch": 1.8209583991574512, "grad_norm": 0.29825398325920105, "learning_rate": 0.00017615336649960713, "loss": 0.20762497186660767, "mean_token_accuracy": 0.9167003929615021, "num_tokens": 42656860.0, "step": 3458 }, { "entropy": 0.9631544351577759, "epoch": 1.8214849921011058, "grad_norm": 0.28420135378837585, "learning_rate": 0.00017613849657491327, "loss": 0.21617071330547333, "mean_token_accuracy": 0.9141428619623184, "num_tokens": 42669196.0, "step": 3459 }, { "entropy": 0.9421249181032181, "epoch": 1.8220115850447605, "grad_norm": 0.2639506459236145, "learning_rate": 0.00017612362272396233, "loss": 0.19029353559017181, "mean_token_accuracy": 0.9208075702190399, "num_tokens": 42681532.0, "step": 3460 }, { "entropy": 0.9671123921871185, "epoch": 1.8225381779884149, "grad_norm": 0.26940131187438965, "learning_rate": 0.00017610874494763728, "loss": 0.19277174770832062, "mean_token_accuracy": 0.921785444021225, "num_tokens": 42693868.0, "step": 3461 }, { "entropy": 0.9888048470020294, "epoch": 1.8230647709320695, "grad_norm": 0.27126485109329224, "learning_rate": 0.0001760938632468214, "loss": 0.20671769976615906, "mean_token_accuracy": 0.918752908706665, "num_tokens": 42706204.0, "step": 3462 }, { "entropy": 1.0084779560565948, "epoch": 1.8235913638757242, "grad_norm": 0.2975345849990845, "learning_rate": 0.00017607897762239808, "loss": 0.2272503823041916, "mean_token_accuracy": 0.9058665335178375, "num_tokens": 42718540.0, "step": 3463 }, { "entropy": 1.0197101086378098, "epoch": 1.8241179568193786, "grad_norm": 0.28193390369415283, "learning_rate": 0.00017606408807525098, "loss": 0.20244908332824707, "mean_token_accuracy": 0.9168011546134949, "num_tokens": 42730876.0, "step": 3464 }, { "entropy": 1.0353141129016876, "epoch": 1.824644549763033, "grad_norm": 0.2784873843193054, "learning_rate": 0.00017604919460626403, "loss": 0.21005836129188538, "mean_token_accuracy": 0.9177538007497787, "num_tokens": 42743212.0, "step": 3465 }, { "entropy": 1.076245129108429, "epoch": 1.8251711427066877, "grad_norm": 0.27502164244651794, "learning_rate": 0.00017603429721632134, "loss": 0.1887526512145996, "mean_token_accuracy": 0.921863242983818, "num_tokens": 42755548.0, "step": 3466 }, { "entropy": 1.062199056148529, "epoch": 1.8256977356503423, "grad_norm": 0.276706337928772, "learning_rate": 0.00017601939590630733, "loss": 0.18946623802185059, "mean_token_accuracy": 0.921543076634407, "num_tokens": 42767884.0, "step": 3467 }, { "entropy": 1.0050623714923859, "epoch": 1.8262243285939967, "grad_norm": 0.39241406321525574, "learning_rate": 0.00017600449067710656, "loss": 0.20796050131320953, "mean_token_accuracy": 0.918712854385376, "num_tokens": 42780220.0, "step": 3468 }, { "entropy": 0.9754211008548737, "epoch": 1.8267509215376514, "grad_norm": 0.25771889090538025, "learning_rate": 0.0001759895815296039, "loss": 0.19497676193714142, "mean_token_accuracy": 0.9191407561302185, "num_tokens": 42792556.0, "step": 3469 }, { "entropy": 1.0407283902168274, "epoch": 1.827277514481306, "grad_norm": 0.29367595911026, "learning_rate": 0.00017597466846468437, "loss": 0.19909502565860748, "mean_token_accuracy": 0.9213258177042007, "num_tokens": 42804892.0, "step": 3470 }, { "entropy": 1.0311505794525146, "epoch": 1.8278041074249605, "grad_norm": 0.28731125593185425, "learning_rate": 0.00017595975148323333, "loss": 0.22046415507793427, "mean_token_accuracy": 0.9133670032024384, "num_tokens": 42817228.0, "step": 3471 }, { "entropy": 1.0354828983545303, "epoch": 1.8283307003686151, "grad_norm": 0.257552832365036, "learning_rate": 0.00017594483058613625, "loss": 0.19373366236686707, "mean_token_accuracy": 0.915319561958313, "num_tokens": 42829564.0, "step": 3472 }, { "entropy": 1.0075701475143433, "epoch": 1.8288572933122698, "grad_norm": 0.30350086092948914, "learning_rate": 0.000175929905774279, "loss": 0.21878236532211304, "mean_token_accuracy": 0.9075680375099182, "num_tokens": 42841900.0, "step": 3473 }, { "entropy": 1.0445679128170013, "epoch": 1.8293838862559242, "grad_norm": 0.26493775844573975, "learning_rate": 0.00017591497704854745, "loss": 0.19537273049354553, "mean_token_accuracy": 0.9180216193199158, "num_tokens": 42854236.0, "step": 3474 }, { "entropy": 1.0321323722600937, "epoch": 1.8299104791995786, "grad_norm": 0.25514036417007446, "learning_rate": 0.0001759000444098279, "loss": 0.19023671746253967, "mean_token_accuracy": 0.9226201772689819, "num_tokens": 42866572.0, "step": 3475 }, { "entropy": 1.0683675110340118, "epoch": 1.8304370721432333, "grad_norm": 0.24957162141799927, "learning_rate": 0.00017588510785900688, "loss": 0.19595561921596527, "mean_token_accuracy": 0.9198444336652756, "num_tokens": 42878908.0, "step": 3476 }, { "entropy": 1.0605555176734924, "epoch": 1.830963665086888, "grad_norm": 0.26935040950775146, "learning_rate": 0.00017587016739697094, "loss": 0.207814022898674, "mean_token_accuracy": 0.9161375761032104, "num_tokens": 42891244.0, "step": 3477 }, { "entropy": 0.979072317481041, "epoch": 1.8314902580305423, "grad_norm": 0.2588823437690735, "learning_rate": 0.00017585522302460707, "loss": 0.1919378638267517, "mean_token_accuracy": 0.9216379672288895, "num_tokens": 42903580.0, "step": 3478 }, { "entropy": 1.034737452864647, "epoch": 1.832016850974197, "grad_norm": 0.27618345618247986, "learning_rate": 0.00017584027474280248, "loss": 0.20401082932949066, "mean_token_accuracy": 0.9176820069551468, "num_tokens": 42915916.0, "step": 3479 }, { "entropy": 1.0233630985021591, "epoch": 1.8325434439178516, "grad_norm": 0.29381322860717773, "learning_rate": 0.00017582532255244456, "loss": 0.20440031588077545, "mean_token_accuracy": 0.9106693267822266, "num_tokens": 42928252.0, "step": 3480 }, { "entropy": 1.0043966621160507, "epoch": 1.833070036861506, "grad_norm": 0.28479161858558655, "learning_rate": 0.00017581036645442083, "loss": 0.22450262308120728, "mean_token_accuracy": 0.9132276177406311, "num_tokens": 42940588.0, "step": 3481 }, { "entropy": 1.0819280743598938, "epoch": 1.8335966298051605, "grad_norm": 0.2651804983615875, "learning_rate": 0.00017579540644961926, "loss": 0.2066086381673813, "mean_token_accuracy": 0.9166118055582047, "num_tokens": 42952924.0, "step": 3482 }, { "entropy": 1.0218794494867325, "epoch": 1.8341232227488151, "grad_norm": 0.26943325996398926, "learning_rate": 0.00017578044253892787, "loss": 0.2052810937166214, "mean_token_accuracy": 0.918945848941803, "num_tokens": 42965260.0, "step": 3483 }, { "entropy": 1.075775384902954, "epoch": 1.8346498156924698, "grad_norm": 0.28176063299179077, "learning_rate": 0.00017576547472323501, "loss": 0.20732028782367706, "mean_token_accuracy": 0.91796013712883, "num_tokens": 42977596.0, "step": 3484 }, { "entropy": 0.9888935834169388, "epoch": 1.8351764086361242, "grad_norm": 0.24343425035476685, "learning_rate": 0.0001757505030034292, "loss": 0.1734849065542221, "mean_token_accuracy": 0.9293620884418488, "num_tokens": 42989932.0, "step": 3485 }, { "entropy": 0.9950584769248962, "epoch": 1.8357030015797788, "grad_norm": 0.23256437480449677, "learning_rate": 0.0001757355273803993, "loss": 0.18044212460517883, "mean_token_accuracy": 0.927759513258934, "num_tokens": 43002268.0, "step": 3486 }, { "entropy": 1.018806740641594, "epoch": 1.8362295945234335, "grad_norm": 0.28248098492622375, "learning_rate": 0.00017572054785503424, "loss": 0.22589240968227386, "mean_token_accuracy": 0.9108239859342575, "num_tokens": 43014604.0, "step": 3487 }, { "entropy": 0.9609373807907104, "epoch": 1.836756187467088, "grad_norm": 0.24391081929206848, "learning_rate": 0.00017570556442822333, "loss": 0.18671506643295288, "mean_token_accuracy": 0.9225711077451706, "num_tokens": 43026940.0, "step": 3488 }, { "entropy": 0.988832950592041, "epoch": 1.8372827804107423, "grad_norm": 0.2958183288574219, "learning_rate": 0.000175690577100856, "loss": 0.21036623418331146, "mean_token_accuracy": 0.9159839749336243, "num_tokens": 43039276.0, "step": 3489 }, { "entropy": 0.9858183264732361, "epoch": 1.8378093733543972, "grad_norm": 0.26455992460250854, "learning_rate": 0.00017567558587382198, "loss": 0.19656260311603546, "mean_token_accuracy": 0.9173092693090439, "num_tokens": 43051612.0, "step": 3490 }, { "entropy": 0.9774465411901474, "epoch": 1.8383359662980516, "grad_norm": 0.24327997863292694, "learning_rate": 0.00017566059074801123, "loss": 0.169850692152977, "mean_token_accuracy": 0.9312596470117569, "num_tokens": 43063948.0, "step": 3491 }, { "entropy": 0.96585513651371, "epoch": 1.838862559241706, "grad_norm": 0.26748207211494446, "learning_rate": 0.0001756455917243139, "loss": 0.19751040637493134, "mean_token_accuracy": 0.9155432730913162, "num_tokens": 43076284.0, "step": 3492 }, { "entropy": 0.985474169254303, "epoch": 1.8393891521853607, "grad_norm": 0.2670723497867584, "learning_rate": 0.0001756305888036204, "loss": 0.1883074939250946, "mean_token_accuracy": 0.9221811294555664, "num_tokens": 43088620.0, "step": 3493 }, { "entropy": 0.97892165184021, "epoch": 1.8399157451290153, "grad_norm": 0.27449530363082886, "learning_rate": 0.00017561558198682134, "loss": 0.2017425000667572, "mean_token_accuracy": 0.9193790405988693, "num_tokens": 43100956.0, "step": 3494 }, { "entropy": 0.92783522605896, "epoch": 1.8404423380726698, "grad_norm": 0.2700694501399994, "learning_rate": 0.00017560057127480764, "loss": 0.19871242344379425, "mean_token_accuracy": 0.9196399599313736, "num_tokens": 43113292.0, "step": 3495 }, { "entropy": 0.9279954582452774, "epoch": 1.8409689310163244, "grad_norm": 0.26998549699783325, "learning_rate": 0.00017558555666847037, "loss": 0.17693020403385162, "mean_token_accuracy": 0.9300927370786667, "num_tokens": 43125628.0, "step": 3496 }, { "entropy": 0.9917383641004562, "epoch": 1.841495523959979, "grad_norm": 0.31583210825920105, "learning_rate": 0.00017557053816870088, "loss": 0.227731853723526, "mean_token_accuracy": 0.9075176864862442, "num_tokens": 43137964.0, "step": 3497 }, { "entropy": 0.9914578646421432, "epoch": 1.8420221169036335, "grad_norm": 0.29741397500038147, "learning_rate": 0.00017555551577639068, "loss": 0.21265819668769836, "mean_token_accuracy": 0.9156584292650223, "num_tokens": 43150300.0, "step": 3498 }, { "entropy": 0.9868685007095337, "epoch": 1.842548709847288, "grad_norm": 0.3175033628940582, "learning_rate": 0.00017554048949243163, "loss": 0.20174245536327362, "mean_token_accuracy": 0.9204602241516113, "num_tokens": 43162636.0, "step": 3499 }, { "entropy": 0.9585036486387253, "epoch": 1.8430753027909426, "grad_norm": 0.2692413032054901, "learning_rate": 0.0001755254593177157, "loss": 0.1967068463563919, "mean_token_accuracy": 0.9194019138813019, "num_tokens": 43174972.0, "step": 3500 }, { "entropy": 1.0175974816083908, "epoch": 1.8436018957345972, "grad_norm": 0.2601134777069092, "learning_rate": 0.00017551042525313515, "loss": 0.20446570217609406, "mean_token_accuracy": 0.9177961945533752, "num_tokens": 43187308.0, "step": 3501 }, { "entropy": 0.9750374257564545, "epoch": 1.8441284886782516, "grad_norm": 0.2664104998111725, "learning_rate": 0.00017549538729958247, "loss": 0.20090380311012268, "mean_token_accuracy": 0.9167754501104355, "num_tokens": 43199644.0, "step": 3502 }, { "entropy": 1.0277975350618362, "epoch": 1.8446550816219063, "grad_norm": 0.26602786779403687, "learning_rate": 0.0001754803454579504, "loss": 0.21057289838790894, "mean_token_accuracy": 0.9140521287918091, "num_tokens": 43211980.0, "step": 3503 }, { "entropy": 0.9721402525901794, "epoch": 1.845181674565561, "grad_norm": 0.2602728605270386, "learning_rate": 0.00017546529972913187, "loss": 0.20174983143806458, "mean_token_accuracy": 0.9159922003746033, "num_tokens": 43224316.0, "step": 3504 }, { "entropy": 1.054141342639923, "epoch": 1.8457082675092154, "grad_norm": 0.2536306381225586, "learning_rate": 0.00017545025011402005, "loss": 0.19397109746932983, "mean_token_accuracy": 0.9237479120492935, "num_tokens": 43236652.0, "step": 3505 }, { "entropy": 1.041559875011444, "epoch": 1.8462348604528698, "grad_norm": 0.2991665303707123, "learning_rate": 0.00017543519661350837, "loss": 0.20816954970359802, "mean_token_accuracy": 0.9192373007535934, "num_tokens": 43248988.0, "step": 3506 }, { "entropy": 1.058956652879715, "epoch": 1.8467614533965246, "grad_norm": 0.29321545362472534, "learning_rate": 0.00017542013922849044, "loss": 0.2185562252998352, "mean_token_accuracy": 0.9086525142192841, "num_tokens": 43261324.0, "step": 3507 }, { "entropy": 1.0227807611227036, "epoch": 1.847288046340179, "grad_norm": 0.2425878793001175, "learning_rate": 0.00017540507795986014, "loss": 0.18261486291885376, "mean_token_accuracy": 0.9194140434265137, "num_tokens": 43273660.0, "step": 3508 }, { "entropy": 1.0270606130361557, "epoch": 1.8478146392838335, "grad_norm": 0.25291311740875244, "learning_rate": 0.00017539001280851156, "loss": 0.19907575845718384, "mean_token_accuracy": 0.9177414625883102, "num_tokens": 43285996.0, "step": 3509 }, { "entropy": 1.0220745652914047, "epoch": 1.8483412322274881, "grad_norm": 0.23823751509189606, "learning_rate": 0.00017537494377533908, "loss": 0.18174749612808228, "mean_token_accuracy": 0.9222448915243149, "num_tokens": 43298332.0, "step": 3510 }, { "entropy": 1.0170291811227798, "epoch": 1.8488678251711428, "grad_norm": 0.28503599762916565, "learning_rate": 0.00017535987086123717, "loss": 0.20761212706565857, "mean_token_accuracy": 0.9194875508546829, "num_tokens": 43310668.0, "step": 3511 }, { "entropy": 0.9842036962509155, "epoch": 1.8493944181147972, "grad_norm": 0.2714064121246338, "learning_rate": 0.00017534479406710072, "loss": 0.19920268654823303, "mean_token_accuracy": 0.9208008050918579, "num_tokens": 43323004.0, "step": 3512 }, { "entropy": 0.9929454177618027, "epoch": 1.8499210110584519, "grad_norm": 0.30067718029022217, "learning_rate": 0.00017532971339382467, "loss": 0.2108234167098999, "mean_token_accuracy": 0.9151533842086792, "num_tokens": 43335340.0, "step": 3513 }, { "entropy": 0.9094464778900146, "epoch": 1.8504476040021065, "grad_norm": 0.269818514585495, "learning_rate": 0.0001753146288423043, "loss": 0.19665856659412384, "mean_token_accuracy": 0.9184691607952118, "num_tokens": 43347676.0, "step": 3514 }, { "entropy": 0.9886156469583511, "epoch": 1.850974196945761, "grad_norm": 0.28764402866363525, "learning_rate": 0.00017529954041343516, "loss": 0.20603036880493164, "mean_token_accuracy": 0.920213133096695, "num_tokens": 43360012.0, "step": 3515 }, { "entropy": 0.9759783744812012, "epoch": 1.8515007898894154, "grad_norm": 0.2881333529949188, "learning_rate": 0.00017528444810811284, "loss": 0.19697514176368713, "mean_token_accuracy": 0.9233171492815018, "num_tokens": 43372348.0, "step": 3516 }, { "entropy": 0.956908330321312, "epoch": 1.85202738283307, "grad_norm": 0.2677208185195923, "learning_rate": 0.00017526935192723335, "loss": 0.19714459776878357, "mean_token_accuracy": 0.9196808934211731, "num_tokens": 43384684.0, "step": 3517 }, { "entropy": 0.9836724400520325, "epoch": 1.8525539757767246, "grad_norm": 0.30804702639579773, "learning_rate": 0.00017525425187169287, "loss": 0.21788114309310913, "mean_token_accuracy": 0.9175039529800415, "num_tokens": 43397020.0, "step": 3518 }, { "entropy": 1.002650871872902, "epoch": 1.853080568720379, "grad_norm": 0.2799338102340698, "learning_rate": 0.00017523914794238777, "loss": 0.1947844922542572, "mean_token_accuracy": 0.9189659506082535, "num_tokens": 43409356.0, "step": 3519 }, { "entropy": 0.9216767400503159, "epoch": 1.8536071616640337, "grad_norm": 0.24135830998420715, "learning_rate": 0.00017522404014021472, "loss": 0.18965280055999756, "mean_token_accuracy": 0.9230446666479111, "num_tokens": 43421692.0, "step": 3520 }, { "entropy": 0.9524090141057968, "epoch": 1.8541337546076884, "grad_norm": 0.26251375675201416, "learning_rate": 0.00017520892846607057, "loss": 0.20700010657310486, "mean_token_accuracy": 0.9134894460439682, "num_tokens": 43434028.0, "step": 3521 }, { "entropy": 1.011262759566307, "epoch": 1.8546603475513428, "grad_norm": 0.30192479491233826, "learning_rate": 0.00017519381292085238, "loss": 0.22291095554828644, "mean_token_accuracy": 0.9098920524120331, "num_tokens": 43446364.0, "step": 3522 }, { "entropy": 0.9867189973592758, "epoch": 1.8551869404949972, "grad_norm": 0.2610762119293213, "learning_rate": 0.00017517869350545747, "loss": 0.20300611853599548, "mean_token_accuracy": 0.918722614645958, "num_tokens": 43458700.0, "step": 3523 }, { "entropy": 0.9844164401292801, "epoch": 1.855713533438652, "grad_norm": 0.2718338072299957, "learning_rate": 0.00017516357022078348, "loss": 0.21439701318740845, "mean_token_accuracy": 0.9139817208051682, "num_tokens": 43471036.0, "step": 3524 }, { "entropy": 1.026760846376419, "epoch": 1.8562401263823065, "grad_norm": 0.28833097219467163, "learning_rate": 0.0001751484430677281, "loss": 0.1966688632965088, "mean_token_accuracy": 0.9210084974765778, "num_tokens": 43483372.0, "step": 3525 }, { "entropy": 0.9831033647060394, "epoch": 1.856766719325961, "grad_norm": 0.24818982183933258, "learning_rate": 0.00017513331204718934, "loss": 0.18625837564468384, "mean_token_accuracy": 0.9207738190889359, "num_tokens": 43495708.0, "step": 3526 }, { "entropy": 1.0132111757993698, "epoch": 1.8572933122696156, "grad_norm": 0.24483777582645416, "learning_rate": 0.00017511817716006552, "loss": 0.18312522768974304, "mean_token_accuracy": 0.9218669086694717, "num_tokens": 43508044.0, "step": 3527 }, { "entropy": 1.0282989740371704, "epoch": 1.8578199052132702, "grad_norm": 0.2627302408218384, "learning_rate": 0.00017510303840725504, "loss": 0.19312997162342072, "mean_token_accuracy": 0.9195411801338196, "num_tokens": 43520380.0, "step": 3528 }, { "entropy": 1.0256311148405075, "epoch": 1.8583464981569247, "grad_norm": 0.2712998390197754, "learning_rate": 0.0001750878957896566, "loss": 0.20464766025543213, "mean_token_accuracy": 0.9199627637863159, "num_tokens": 43532716.0, "step": 3529 }, { "entropy": 1.0233651250600815, "epoch": 1.8588730911005793, "grad_norm": 0.25352466106414795, "learning_rate": 0.00017507274930816916, "loss": 0.19999416172504425, "mean_token_accuracy": 0.9188231825828552, "num_tokens": 43545052.0, "step": 3530 }, { "entropy": 1.0036712139844894, "epoch": 1.859399684044234, "grad_norm": 0.25642892718315125, "learning_rate": 0.00017505759896369188, "loss": 0.17751988768577576, "mean_token_accuracy": 0.9266696274280548, "num_tokens": 43557388.0, "step": 3531 }, { "entropy": 1.0442322492599487, "epoch": 1.8599262769878884, "grad_norm": 0.27309077978134155, "learning_rate": 0.0001750424447571241, "loss": 0.20416924357414246, "mean_token_accuracy": 0.9193257242441177, "num_tokens": 43569724.0, "step": 3532 }, { "entropy": 1.0406121015548706, "epoch": 1.8604528699315428, "grad_norm": 0.2676863372325897, "learning_rate": 0.0001750272866893655, "loss": 0.2130739539861679, "mean_token_accuracy": 0.9103453308343887, "num_tokens": 43582060.0, "step": 3533 }, { "entropy": 1.0540429800748825, "epoch": 1.8609794628751974, "grad_norm": 0.26795145869255066, "learning_rate": 0.00017501212476131589, "loss": 0.19300617277622223, "mean_token_accuracy": 0.9267665147781372, "num_tokens": 43594396.0, "step": 3534 }, { "entropy": 1.0778743624687195, "epoch": 1.861506055818852, "grad_norm": 0.2814680337905884, "learning_rate": 0.00017499695897387534, "loss": 0.21657180786132812, "mean_token_accuracy": 0.913690060377121, "num_tokens": 43606732.0, "step": 3535 }, { "entropy": 1.0144944339990616, "epoch": 1.8620326487625065, "grad_norm": 0.25453317165374756, "learning_rate": 0.00017498178932794418, "loss": 0.19731523096561432, "mean_token_accuracy": 0.9211816489696503, "num_tokens": 43619068.0, "step": 3536 }, { "entropy": 1.0487922728061676, "epoch": 1.8625592417061612, "grad_norm": 0.29628288745880127, "learning_rate": 0.00017496661582442293, "loss": 0.20683038234710693, "mean_token_accuracy": 0.9144911020994186, "num_tokens": 43631404.0, "step": 3537 }, { "entropy": 1.0728088915348053, "epoch": 1.8630858346498158, "grad_norm": 0.2915079593658447, "learning_rate": 0.00017495143846421235, "loss": 0.20339436829090118, "mean_token_accuracy": 0.920454278588295, "num_tokens": 43643740.0, "step": 3538 }, { "entropy": 1.04716295003891, "epoch": 1.8636124275934702, "grad_norm": 0.23968999087810516, "learning_rate": 0.00017493625724821345, "loss": 0.17932488024234772, "mean_token_accuracy": 0.9295078665018082, "num_tokens": 43656076.0, "step": 3539 }, { "entropy": 1.1039165556430817, "epoch": 1.8641390205371247, "grad_norm": 0.2852647006511688, "learning_rate": 0.0001749210721773274, "loss": 0.20938575267791748, "mean_token_accuracy": 0.9154763072729111, "num_tokens": 43668412.0, "step": 3540 }, { "entropy": 1.062223643064499, "epoch": 1.8646656134807793, "grad_norm": 0.2730938494205475, "learning_rate": 0.00017490588325245573, "loss": 0.20177365839481354, "mean_token_accuracy": 0.920450896024704, "num_tokens": 43680748.0, "step": 3541 }, { "entropy": 1.0817009508609772, "epoch": 1.865192206424434, "grad_norm": 0.25735530257225037, "learning_rate": 0.00017489069047450003, "loss": 0.1912008374929428, "mean_token_accuracy": 0.9246111661195755, "num_tokens": 43693084.0, "step": 3542 }, { "entropy": 1.0735929310321808, "epoch": 1.8657187993680884, "grad_norm": 0.26666948199272156, "learning_rate": 0.00017487549384436228, "loss": 0.19975747168064117, "mean_token_accuracy": 0.9182255566120148, "num_tokens": 43705420.0, "step": 3543 }, { "entropy": 1.0770608186721802, "epoch": 1.866245392311743, "grad_norm": 0.2631293833255768, "learning_rate": 0.00017486029336294455, "loss": 0.21597373485565186, "mean_token_accuracy": 0.9157756865024567, "num_tokens": 43717756.0, "step": 3544 }, { "entropy": 1.0684048980474472, "epoch": 1.8667719852553977, "grad_norm": 0.2667410969734192, "learning_rate": 0.00017484508903114926, "loss": 0.19906820356845856, "mean_token_accuracy": 0.9196314960718155, "num_tokens": 43730092.0, "step": 3545 }, { "entropy": 1.1074407696723938, "epoch": 1.867298578199052, "grad_norm": 0.2910633981227875, "learning_rate": 0.00017482988084987897, "loss": 0.20462411642074585, "mean_token_accuracy": 0.9201758056879044, "num_tokens": 43742428.0, "step": 3546 }, { "entropy": 1.1205481886863708, "epoch": 1.8678251711427067, "grad_norm": 0.2661513388156891, "learning_rate": 0.00017481466882003651, "loss": 0.19449472427368164, "mean_token_accuracy": 0.9201523959636688, "num_tokens": 43754764.0, "step": 3547 }, { "entropy": 1.058198630809784, "epoch": 1.8683517640863614, "grad_norm": 0.26210594177246094, "learning_rate": 0.00017479945294252496, "loss": 0.21112874150276184, "mean_token_accuracy": 0.913567453622818, "num_tokens": 43767100.0, "step": 3548 }, { "entropy": 1.0497896373271942, "epoch": 1.8688783570300158, "grad_norm": 0.24254575371742249, "learning_rate": 0.00017478423321824752, "loss": 0.17959487438201904, "mean_token_accuracy": 0.9248331785202026, "num_tokens": 43779436.0, "step": 3549 }, { "entropy": 1.0271850526332855, "epoch": 1.8694049499736702, "grad_norm": 0.25798940658569336, "learning_rate": 0.00017476900964810777, "loss": 0.20330272614955902, "mean_token_accuracy": 0.9145640432834625, "num_tokens": 43791772.0, "step": 3550 }, { "entropy": 1.0344137400388718, "epoch": 1.8699315429173249, "grad_norm": 0.2523990869522095, "learning_rate": 0.00017475378223300944, "loss": 0.18353012204170227, "mean_token_accuracy": 0.9226906001567841, "num_tokens": 43804108.0, "step": 3551 }, { "entropy": 1.0250817984342575, "epoch": 1.8704581358609795, "grad_norm": 0.2655175030231476, "learning_rate": 0.00017473855097385646, "loss": 0.1963675618171692, "mean_token_accuracy": 0.9198670238256454, "num_tokens": 43816444.0, "step": 3552 }, { "entropy": 1.0592041909694672, "epoch": 1.870984728804634, "grad_norm": 0.2882557511329651, "learning_rate": 0.000174723315871553, "loss": 0.222836434841156, "mean_token_accuracy": 0.913982018828392, "num_tokens": 43828780.0, "step": 3553 }, { "entropy": 1.0100958496332169, "epoch": 1.8715113217482886, "grad_norm": 0.2879355847835541, "learning_rate": 0.00017470807692700354, "loss": 0.1921842247247696, "mean_token_accuracy": 0.9170998483896255, "num_tokens": 43841116.0, "step": 3554 }, { "entropy": 1.0180272459983826, "epoch": 1.8720379146919433, "grad_norm": 0.26359114050865173, "learning_rate": 0.0001746928341411127, "loss": 0.20603729784488678, "mean_token_accuracy": 0.9175525456666946, "num_tokens": 43853452.0, "step": 3555 }, { "entropy": 1.07178395986557, "epoch": 1.8725645076355977, "grad_norm": 0.27470099925994873, "learning_rate": 0.00017467758751478537, "loss": 0.20463289320468903, "mean_token_accuracy": 0.914940133690834, "num_tokens": 43865788.0, "step": 3556 }, { "entropy": 0.9943696707487106, "epoch": 1.873091100579252, "grad_norm": 0.24466237425804138, "learning_rate": 0.0001746623370489266, "loss": 0.17426809668540955, "mean_token_accuracy": 0.9257047772407532, "num_tokens": 43878124.0, "step": 3557 }, { "entropy": 1.0398575961589813, "epoch": 1.8736176935229067, "grad_norm": 0.2756820619106293, "learning_rate": 0.0001746470827444418, "loss": 0.21039924025535583, "mean_token_accuracy": 0.9163792431354523, "num_tokens": 43890460.0, "step": 3558 }, { "entropy": 1.113322228193283, "epoch": 1.8741442864665614, "grad_norm": 0.29872143268585205, "learning_rate": 0.00017463182460223647, "loss": 0.19940727949142456, "mean_token_accuracy": 0.9192183166742325, "num_tokens": 43902796.0, "step": 3559 }, { "entropy": 1.1167441308498383, "epoch": 1.8746708794102158, "grad_norm": 0.2722742557525635, "learning_rate": 0.00017461656262321643, "loss": 0.187882661819458, "mean_token_accuracy": 0.9232105165719986, "num_tokens": 43915132.0, "step": 3560 }, { "entropy": 1.0867882072925568, "epoch": 1.8751974723538705, "grad_norm": 0.2816410958766937, "learning_rate": 0.00017460129680828767, "loss": 0.20031344890594482, "mean_token_accuracy": 0.9189879596233368, "num_tokens": 43927468.0, "step": 3561 }, { "entropy": 1.1575427651405334, "epoch": 1.8757240652975251, "grad_norm": 0.29825645685195923, "learning_rate": 0.00017458602715835644, "loss": 0.2101304531097412, "mean_token_accuracy": 0.9124222993850708, "num_tokens": 43939804.0, "step": 3562 }, { "entropy": 1.0926944315433502, "epoch": 1.8762506582411795, "grad_norm": 0.2628743350505829, "learning_rate": 0.00017457075367432922, "loss": 0.19311033189296722, "mean_token_accuracy": 0.922664999961853, "num_tokens": 43952140.0, "step": 3563 }, { "entropy": 1.0990844368934631, "epoch": 1.876777251184834, "grad_norm": 0.27810606360435486, "learning_rate": 0.0001745554763571127, "loss": 0.19149093329906464, "mean_token_accuracy": 0.9224977344274521, "num_tokens": 43964476.0, "step": 3564 }, { "entropy": 1.0753406584262848, "epoch": 1.8773038441284888, "grad_norm": 0.2753046452999115, "learning_rate": 0.0001745401952076138, "loss": 0.20910421013832092, "mean_token_accuracy": 0.9132356494665146, "num_tokens": 43976812.0, "step": 3565 }, { "entropy": 1.114586502313614, "epoch": 1.8778304370721433, "grad_norm": 0.2780378758907318, "learning_rate": 0.00017452491022673967, "loss": 0.20378395915031433, "mean_token_accuracy": 0.9182945340871811, "num_tokens": 43989148.0, "step": 3566 }, { "entropy": 1.1071798503398895, "epoch": 1.8783570300157977, "grad_norm": 0.2734641432762146, "learning_rate": 0.00017450962141539773, "loss": 0.2131178081035614, "mean_token_accuracy": 0.9139434695243835, "num_tokens": 44001484.0, "step": 3567 }, { "entropy": 1.0694519877433777, "epoch": 1.8788836229594523, "grad_norm": 0.26163414120674133, "learning_rate": 0.00017449432877449553, "loss": 0.19922369718551636, "mean_token_accuracy": 0.9218622297048569, "num_tokens": 44013820.0, "step": 3568 }, { "entropy": 1.0787781774997711, "epoch": 1.879410215903107, "grad_norm": 0.2676631212234497, "learning_rate": 0.00017447903230494096, "loss": 0.18829788267612457, "mean_token_accuracy": 0.9208130836486816, "num_tokens": 44026156.0, "step": 3569 }, { "entropy": 1.106066107749939, "epoch": 1.8799368088467614, "grad_norm": 0.26856163144111633, "learning_rate": 0.00017446373200764203, "loss": 0.1804138720035553, "mean_token_accuracy": 0.919698104262352, "num_tokens": 44038492.0, "step": 3570 }, { "entropy": 1.141218662261963, "epoch": 1.880463401790416, "grad_norm": 0.2687745988368988, "learning_rate": 0.00017444842788350706, "loss": 0.1945033073425293, "mean_token_accuracy": 0.9200787246227264, "num_tokens": 44050828.0, "step": 3571 }, { "entropy": 1.1304888129234314, "epoch": 1.8809899947340707, "grad_norm": 0.25851964950561523, "learning_rate": 0.00017443311993344457, "loss": 0.19336003065109253, "mean_token_accuracy": 0.9188802093267441, "num_tokens": 44063164.0, "step": 3572 }, { "entropy": 1.1865220665931702, "epoch": 1.8815165876777251, "grad_norm": 0.29074305295944214, "learning_rate": 0.00017441780815836326, "loss": 0.1957467496395111, "mean_token_accuracy": 0.9202824831008911, "num_tokens": 44075500.0, "step": 3573 }, { "entropy": 1.1729064583778381, "epoch": 1.8820431806213795, "grad_norm": 0.2514488399028778, "learning_rate": 0.00017440249255917218, "loss": 0.17970673739910126, "mean_token_accuracy": 0.9232833385467529, "num_tokens": 44087836.0, "step": 3574 }, { "entropy": 1.1274474561214447, "epoch": 1.8825697735650342, "grad_norm": 0.27165448665618896, "learning_rate": 0.0001743871731367805, "loss": 0.18584352731704712, "mean_token_accuracy": 0.925078958272934, "num_tokens": 44100172.0, "step": 3575 }, { "entropy": 1.1284977793693542, "epoch": 1.8830963665086888, "grad_norm": 0.31029313802719116, "learning_rate": 0.00017437184989209755, "loss": 0.22961436212062836, "mean_token_accuracy": 0.9089037775993347, "num_tokens": 44112508.0, "step": 3576 }, { "entropy": 1.1539038717746735, "epoch": 1.8836229594523433, "grad_norm": 0.2871949076652527, "learning_rate": 0.00017435652282603309, "loss": 0.2109770029783249, "mean_token_accuracy": 0.9152273237705231, "num_tokens": 44124844.0, "step": 3577 }, { "entropy": 1.2086017429828644, "epoch": 1.884149552395998, "grad_norm": 0.2972370684146881, "learning_rate": 0.000174341191939497, "loss": 0.22491230070590973, "mean_token_accuracy": 0.9096596390008926, "num_tokens": 44137180.0, "step": 3578 }, { "entropy": 1.1673455834388733, "epoch": 1.8846761453396526, "grad_norm": 0.29084253311157227, "learning_rate": 0.00017432585723339933, "loss": 0.21230041980743408, "mean_token_accuracy": 0.9149164706468582, "num_tokens": 44149516.0, "step": 3579 }, { "entropy": 1.1442771553993225, "epoch": 1.885202738283307, "grad_norm": 0.2587001621723175, "learning_rate": 0.00017431051870865044, "loss": 0.19252054393291473, "mean_token_accuracy": 0.9200115948915482, "num_tokens": 44161852.0, "step": 3580 }, { "entropy": 1.185366839170456, "epoch": 1.8857293312269614, "grad_norm": 0.26025739312171936, "learning_rate": 0.00017429517636616086, "loss": 0.1987098902463913, "mean_token_accuracy": 0.9187203794717789, "num_tokens": 44174188.0, "step": 3581 }, { "entropy": 1.1812830567359924, "epoch": 1.8862559241706163, "grad_norm": 0.26062434911727905, "learning_rate": 0.00017427983020684145, "loss": 0.19222667813301086, "mean_token_accuracy": 0.9221339523792267, "num_tokens": 44186524.0, "step": 3582 }, { "entropy": 1.188157171010971, "epoch": 1.8867825171142707, "grad_norm": 0.27801626920700073, "learning_rate": 0.0001742644802316031, "loss": 0.19216661155223846, "mean_token_accuracy": 0.9170040041208267, "num_tokens": 44198860.0, "step": 3583 }, { "entropy": 1.1949248611927032, "epoch": 1.8873091100579251, "grad_norm": 0.24728041887283325, "learning_rate": 0.0001742491264413572, "loss": 0.187982976436615, "mean_token_accuracy": 0.9224367737770081, "num_tokens": 44211196.0, "step": 3584 }, { "entropy": 1.208105355501175, "epoch": 1.8878357030015798, "grad_norm": 0.32599449157714844, "learning_rate": 0.00017423376883701509, "loss": 0.1942829042673111, "mean_token_accuracy": 0.9238618314266205, "num_tokens": 44223532.0, "step": 3585 }, { "entropy": 1.2586550116539001, "epoch": 1.8883622959452344, "grad_norm": 0.2833736836910248, "learning_rate": 0.00017421840741948852, "loss": 0.1979784369468689, "mean_token_accuracy": 0.9184264540672302, "num_tokens": 44235868.0, "step": 3586 }, { "entropy": 1.2161791920661926, "epoch": 1.8888888888888888, "grad_norm": 0.27175453305244446, "learning_rate": 0.0001742030421896894, "loss": 0.18781299889087677, "mean_token_accuracy": 0.923054501414299, "num_tokens": 44248204.0, "step": 3587 }, { "entropy": 1.274359554052353, "epoch": 1.8894154818325435, "grad_norm": 0.300649493932724, "learning_rate": 0.00017418767314852986, "loss": 0.21826910972595215, "mean_token_accuracy": 0.906836673617363, "num_tokens": 44260540.0, "step": 3588 }, { "entropy": 1.2163540720939636, "epoch": 1.8899420747761981, "grad_norm": 0.25215044617652893, "learning_rate": 0.00017417230029692228, "loss": 0.20363149046897888, "mean_token_accuracy": 0.918889969587326, "num_tokens": 44272876.0, "step": 3589 }, { "entropy": 1.2891521751880646, "epoch": 1.8904686677198526, "grad_norm": 0.2741580903530121, "learning_rate": 0.00017415692363577926, "loss": 0.19672846794128418, "mean_token_accuracy": 0.9205434173345566, "num_tokens": 44285212.0, "step": 3590 }, { "entropy": 1.2554100453853607, "epoch": 1.890995260663507, "grad_norm": 0.2708304226398468, "learning_rate": 0.00017414154316601363, "loss": 0.19891998171806335, "mean_token_accuracy": 0.9197966605424881, "num_tokens": 44297548.0, "step": 3591 }, { "entropy": 1.2006763517856598, "epoch": 1.8915218536071616, "grad_norm": 0.2572955787181854, "learning_rate": 0.00017412615888853837, "loss": 0.196050226688385, "mean_token_accuracy": 0.923739418387413, "num_tokens": 44309884.0, "step": 3592 }, { "entropy": 1.2014833986759186, "epoch": 1.8920484465508163, "grad_norm": 0.2789122760295868, "learning_rate": 0.00017411077080426688, "loss": 0.19379383325576782, "mean_token_accuracy": 0.9179646968841553, "num_tokens": 44322220.0, "step": 3593 }, { "entropy": 1.2050150334835052, "epoch": 1.8925750394944707, "grad_norm": 0.2656964659690857, "learning_rate": 0.00017409537891411255, "loss": 0.2036164104938507, "mean_token_accuracy": 0.9147919863462448, "num_tokens": 44334556.0, "step": 3594 }, { "entropy": 1.1853137016296387, "epoch": 1.8931016324381253, "grad_norm": 0.2627456784248352, "learning_rate": 0.00017407998321898916, "loss": 0.2011202722787857, "mean_token_accuracy": 0.9194943606853485, "num_tokens": 44346892.0, "step": 3595 }, { "entropy": 1.1744475960731506, "epoch": 1.89362822538178, "grad_norm": 0.2604866027832031, "learning_rate": 0.0001740645837198107, "loss": 0.2077919840812683, "mean_token_accuracy": 0.9139293134212494, "num_tokens": 44359228.0, "step": 3596 }, { "entropy": 1.173338770866394, "epoch": 1.8941548183254344, "grad_norm": 0.2635132968425751, "learning_rate": 0.00017404918041749126, "loss": 0.20279425382614136, "mean_token_accuracy": 0.9182106554508209, "num_tokens": 44371564.0, "step": 3597 }, { "entropy": 1.1710366010665894, "epoch": 1.8946814112690888, "grad_norm": 0.2733679711818695, "learning_rate": 0.0001740337733129453, "loss": 0.19158853590488434, "mean_token_accuracy": 0.9208205044269562, "num_tokens": 44383900.0, "step": 3598 }, { "entropy": 1.113152414560318, "epoch": 1.8952080042127437, "grad_norm": 0.24724428355693817, "learning_rate": 0.0001740183624070874, "loss": 0.18724195659160614, "mean_token_accuracy": 0.922689363360405, "num_tokens": 44396236.0, "step": 3599 }, { "entropy": 1.1231700778007507, "epoch": 1.8957345971563981, "grad_norm": 0.2390860617160797, "learning_rate": 0.00017400294770083247, "loss": 0.16968569159507751, "mean_token_accuracy": 0.9303603619337082, "num_tokens": 44408572.0, "step": 3600 }, { "entropy": 1.2249704897403717, "epoch": 1.8962611901000526, "grad_norm": 0.2889772951602936, "learning_rate": 0.0001739875291950956, "loss": 0.20824474096298218, "mean_token_accuracy": 0.9169190227985382, "num_tokens": 44420908.0, "step": 3601 }, { "entropy": 1.1704488396644592, "epoch": 1.8967877830437072, "grad_norm": 0.2680244445800781, "learning_rate": 0.00017397210689079203, "loss": 0.20673055946826935, "mean_token_accuracy": 0.9180959910154343, "num_tokens": 44433244.0, "step": 3602 }, { "entropy": 1.1878012716770172, "epoch": 1.8973143759873619, "grad_norm": 0.2975465953350067, "learning_rate": 0.00017395668078883734, "loss": 0.20991596579551697, "mean_token_accuracy": 0.9183283597230911, "num_tokens": 44445580.0, "step": 3603 }, { "entropy": 1.1773861050605774, "epoch": 1.8978409689310163, "grad_norm": 0.2718547284603119, "learning_rate": 0.0001739412508901473, "loss": 0.20017877221107483, "mean_token_accuracy": 0.9203770905733109, "num_tokens": 44457916.0, "step": 3604 }, { "entropy": 1.1368711590766907, "epoch": 1.898367561874671, "grad_norm": 0.2801942527294159, "learning_rate": 0.00017392581719563786, "loss": 0.20202471315860748, "mean_token_accuracy": 0.9181565046310425, "num_tokens": 44470252.0, "step": 3605 }, { "entropy": 1.1801301538944244, "epoch": 1.8988941548183256, "grad_norm": 0.30454739928245544, "learning_rate": 0.00017391037970622525, "loss": 0.2132726013660431, "mean_token_accuracy": 0.9120954275131226, "num_tokens": 44482588.0, "step": 3606 }, { "entropy": 1.1741478145122528, "epoch": 1.89942074776198, "grad_norm": 0.26906171441078186, "learning_rate": 0.00017389493842282587, "loss": 0.19884657859802246, "mean_token_accuracy": 0.917621061205864, "num_tokens": 44494924.0, "step": 3607 }, { "entropy": 1.1842193901538849, "epoch": 1.8999473407056344, "grad_norm": 0.25997108221054077, "learning_rate": 0.00017387949334635644, "loss": 0.19672074913978577, "mean_token_accuracy": 0.9219666868448257, "num_tokens": 44507260.0, "step": 3608 }, { "entropy": 1.1503727734088898, "epoch": 1.900473933649289, "grad_norm": 0.27212950587272644, "learning_rate": 0.00017386404447773378, "loss": 0.19361799955368042, "mean_token_accuracy": 0.9216768741607666, "num_tokens": 44519596.0, "step": 3609 }, { "entropy": 1.2314816415309906, "epoch": 1.9010005265929437, "grad_norm": 0.27919554710388184, "learning_rate": 0.00017384859181787503, "loss": 0.21054218709468842, "mean_token_accuracy": 0.9163404256105423, "num_tokens": 44531932.0, "step": 3610 }, { "entropy": 1.1658604443073273, "epoch": 1.9015271195365981, "grad_norm": 0.2740512192249298, "learning_rate": 0.00017383313536769755, "loss": 0.18958908319473267, "mean_token_accuracy": 0.9197452515363693, "num_tokens": 44544268.0, "step": 3611 }, { "entropy": 1.2027749419212341, "epoch": 1.9020537124802528, "grad_norm": 0.264543741941452, "learning_rate": 0.00017381767512811885, "loss": 0.20404848456382751, "mean_token_accuracy": 0.916832685470581, "num_tokens": 44556604.0, "step": 3612 }, { "entropy": 1.1814589202404022, "epoch": 1.9025803054239074, "grad_norm": 0.2642267048358917, "learning_rate": 0.00017380221110005673, "loss": 0.19606810808181763, "mean_token_accuracy": 0.918126568198204, "num_tokens": 44568940.0, "step": 3613 }, { "entropy": 1.1763567328453064, "epoch": 1.9031068983675619, "grad_norm": 0.2508313059806824, "learning_rate": 0.0001737867432844292, "loss": 0.1951427459716797, "mean_token_accuracy": 0.9166415929794312, "num_tokens": 44581276.0, "step": 3614 }, { "entropy": 1.2736837267875671, "epoch": 1.9036334913112163, "grad_norm": 0.2942288815975189, "learning_rate": 0.0001737712716821545, "loss": 0.21287119388580322, "mean_token_accuracy": 0.9135104715824127, "num_tokens": 44593612.0, "step": 3615 }, { "entropy": 1.2576221525669098, "epoch": 1.904160084254871, "grad_norm": 0.255913108587265, "learning_rate": 0.00017375579629415105, "loss": 0.1842191517353058, "mean_token_accuracy": 0.9250049591064453, "num_tokens": 44605948.0, "step": 3616 }, { "entropy": 1.251773089170456, "epoch": 1.9046866771985256, "grad_norm": 0.2758917212486267, "learning_rate": 0.00017374031712133765, "loss": 0.21524254977703094, "mean_token_accuracy": 0.9172472357749939, "num_tokens": 44618284.0, "step": 3617 }, { "entropy": 1.2298138439655304, "epoch": 1.90521327014218, "grad_norm": 0.2682817876338959, "learning_rate": 0.0001737248341646331, "loss": 0.19541317224502563, "mean_token_accuracy": 0.9179702699184418, "num_tokens": 44630620.0, "step": 3618 }, { "entropy": 1.2236283421516418, "epoch": 1.9057398630858347, "grad_norm": 0.26307037472724915, "learning_rate": 0.00017370934742495656, "loss": 0.20737697184085846, "mean_token_accuracy": 0.9137110263109207, "num_tokens": 44642956.0, "step": 3619 }, { "entropy": 1.243878036737442, "epoch": 1.9062664560294893, "grad_norm": 0.2502284049987793, "learning_rate": 0.0001736938569032274, "loss": 0.20081773400306702, "mean_token_accuracy": 0.9174046218395233, "num_tokens": 44655292.0, "step": 3620 }, { "entropy": 1.2514996528625488, "epoch": 1.9067930489731437, "grad_norm": 0.250877320766449, "learning_rate": 0.00017367836260036515, "loss": 0.18941593170166016, "mean_token_accuracy": 0.9203214943408966, "num_tokens": 44667628.0, "step": 3621 }, { "entropy": 1.2207768857479095, "epoch": 1.9073196419167984, "grad_norm": 0.29659348726272583, "learning_rate": 0.00017366286451728967, "loss": 0.18773111701011658, "mean_token_accuracy": 0.9253512769937515, "num_tokens": 44679964.0, "step": 3622 }, { "entropy": 1.1811819076538086, "epoch": 1.907846234860453, "grad_norm": 0.25071752071380615, "learning_rate": 0.000173647362654921, "loss": 0.1999988704919815, "mean_token_accuracy": 0.9158650636672974, "num_tokens": 44692300.0, "step": 3623 }, { "entropy": 1.2793206870555878, "epoch": 1.9083728278041074, "grad_norm": 0.28312739729881287, "learning_rate": 0.0001736318570141794, "loss": 0.20251990854740143, "mean_token_accuracy": 0.9155915677547455, "num_tokens": 44704636.0, "step": 3624 }, { "entropy": 1.2060322165489197, "epoch": 1.9088994207477619, "grad_norm": 0.24651455879211426, "learning_rate": 0.00017361634759598525, "loss": 0.19613385200500488, "mean_token_accuracy": 0.9165442436933517, "num_tokens": 44716972.0, "step": 3625 }, { "entropy": 1.1942104697227478, "epoch": 1.9094260136914165, "grad_norm": 0.2771541178226471, "learning_rate": 0.0001736008344012594, "loss": 0.21619367599487305, "mean_token_accuracy": 0.9139316976070404, "num_tokens": 44729308.0, "step": 3626 }, { "entropy": 1.1322157979011536, "epoch": 1.9099526066350712, "grad_norm": 0.25058284401893616, "learning_rate": 0.00017358531743092266, "loss": 0.18762576580047607, "mean_token_accuracy": 0.9215554296970367, "num_tokens": 44741644.0, "step": 3627 }, { "entropy": 1.2009500563144684, "epoch": 1.9104791995787256, "grad_norm": 0.27951785922050476, "learning_rate": 0.00017356979668589625, "loss": 0.2000935822725296, "mean_token_accuracy": 0.9177307933568954, "num_tokens": 44753980.0, "step": 3628 }, { "entropy": 1.185960978269577, "epoch": 1.9110057925223802, "grad_norm": 0.2635090947151184, "learning_rate": 0.00017355427216710152, "loss": 0.19260722398757935, "mean_token_accuracy": 0.9208453297615051, "num_tokens": 44766316.0, "step": 3629 }, { "entropy": 1.179717481136322, "epoch": 1.9115323854660349, "grad_norm": 0.291584312915802, "learning_rate": 0.00017353874387546005, "loss": 0.20042484998703003, "mean_token_accuracy": 0.91756771504879, "num_tokens": 44778652.0, "step": 3630 }, { "entropy": 1.1897325813770294, "epoch": 1.9120589784096893, "grad_norm": 0.2626997232437134, "learning_rate": 0.00017352321181189373, "loss": 0.19658340513706207, "mean_token_accuracy": 0.9180559068918228, "num_tokens": 44790988.0, "step": 3631 }, { "entropy": 1.1979995667934418, "epoch": 1.9125855713533437, "grad_norm": 0.28412285447120667, "learning_rate": 0.00017350767597732453, "loss": 0.21948397159576416, "mean_token_accuracy": 0.9098146557807922, "num_tokens": 44803324.0, "step": 3632 }, { "entropy": 1.1823217272758484, "epoch": 1.9131121642969984, "grad_norm": 0.27307748794555664, "learning_rate": 0.00017349213637267476, "loss": 0.21455425024032593, "mean_token_accuracy": 0.9142604321241379, "num_tokens": 44815660.0, "step": 3633 }, { "entropy": 1.2042896449565887, "epoch": 1.913638757240653, "grad_norm": 0.31086379289627075, "learning_rate": 0.00017347659299886693, "loss": 0.21350350975990295, "mean_token_accuracy": 0.9092680513858795, "num_tokens": 44827996.0, "step": 3634 }, { "entropy": 1.2283751964569092, "epoch": 1.9141653501843074, "grad_norm": 0.2663927376270294, "learning_rate": 0.00017346104585682373, "loss": 0.19472280144691467, "mean_token_accuracy": 0.9193729162216187, "num_tokens": 44840332.0, "step": 3635 }, { "entropy": 1.183545082807541, "epoch": 1.914691943127962, "grad_norm": 0.2771006226539612, "learning_rate": 0.00017344549494746815, "loss": 0.19897666573524475, "mean_token_accuracy": 0.9188507944345474, "num_tokens": 44852668.0, "step": 3636 }, { "entropy": 1.2296278774738312, "epoch": 1.9152185360716167, "grad_norm": 0.27564653754234314, "learning_rate": 0.0001734299402717233, "loss": 0.20981676876544952, "mean_token_accuracy": 0.9140519946813583, "num_tokens": 44865004.0, "step": 3637 }, { "entropy": 1.2284190952777863, "epoch": 1.9157451290152712, "grad_norm": 0.26339784264564514, "learning_rate": 0.0001734143818305126, "loss": 0.19718164205551147, "mean_token_accuracy": 0.9198196828365326, "num_tokens": 44877340.0, "step": 3638 }, { "entropy": 1.1841385960578918, "epoch": 1.9162717219589256, "grad_norm": 0.28311020135879517, "learning_rate": 0.00017339881962475965, "loss": 0.21129263937473297, "mean_token_accuracy": 0.912701204419136, "num_tokens": 44889676.0, "step": 3639 }, { "entropy": 1.1703853607177734, "epoch": 1.9167983149025805, "grad_norm": 0.24933747947216034, "learning_rate": 0.00017338325365538827, "loss": 0.2056872695684433, "mean_token_accuracy": 0.9159862697124481, "num_tokens": 44902012.0, "step": 3640 }, { "entropy": 1.2645052373409271, "epoch": 1.9173249078462349, "grad_norm": 0.26389506459236145, "learning_rate": 0.00017336768392332258, "loss": 0.19748938083648682, "mean_token_accuracy": 0.9188157171010971, "num_tokens": 44914348.0, "step": 3641 }, { "entropy": 1.2652300000190735, "epoch": 1.9178515007898893, "grad_norm": 0.255624383687973, "learning_rate": 0.00017335211042948683, "loss": 0.18445834517478943, "mean_token_accuracy": 0.9235481023788452, "num_tokens": 44926684.0, "step": 3642 }, { "entropy": 1.2511534094810486, "epoch": 1.918378093733544, "grad_norm": 0.26123735308647156, "learning_rate": 0.0001733365331748055, "loss": 0.19365046918392181, "mean_token_accuracy": 0.921040266752243, "num_tokens": 44939020.0, "step": 3643 }, { "entropy": 1.2718633115291595, "epoch": 1.9189046866771986, "grad_norm": 0.28643572330474854, "learning_rate": 0.00017332095216020338, "loss": 0.2148754596710205, "mean_token_accuracy": 0.9159789234399796, "num_tokens": 44951356.0, "step": 3644 }, { "entropy": 1.3365231156349182, "epoch": 1.919431279620853, "grad_norm": 0.2991255223751068, "learning_rate": 0.0001733053673866054, "loss": 0.2158765196800232, "mean_token_accuracy": 0.9090882688760757, "num_tokens": 44963692.0, "step": 3645 }, { "entropy": 1.2829530537128448, "epoch": 1.9199578725645077, "grad_norm": 0.31265580654144287, "learning_rate": 0.0001732897788549367, "loss": 0.22893324494361877, "mean_token_accuracy": 0.9042454361915588, "num_tokens": 44976028.0, "step": 3646 }, { "entropy": 1.2604970932006836, "epoch": 1.9204844655081623, "grad_norm": 0.28193265199661255, "learning_rate": 0.00017327418656612272, "loss": 0.20636524260044098, "mean_token_accuracy": 0.9135946780443192, "num_tokens": 44988364.0, "step": 3647 }, { "entropy": 1.3023660778999329, "epoch": 1.9210110584518167, "grad_norm": 0.28154146671295166, "learning_rate": 0.00017325859052108906, "loss": 0.2026195228099823, "mean_token_accuracy": 0.9120919853448868, "num_tokens": 45000700.0, "step": 3648 }, { "entropy": 1.265262395143509, "epoch": 1.9215376513954712, "grad_norm": 0.24685363471508026, "learning_rate": 0.0001732429907207616, "loss": 0.19602523744106293, "mean_token_accuracy": 0.9172793030738831, "num_tokens": 45013036.0, "step": 3649 }, { "entropy": 1.3104206323623657, "epoch": 1.9220642443391258, "grad_norm": 0.31668615341186523, "learning_rate": 0.00017322738716606638, "loss": 0.22926807403564453, "mean_token_accuracy": 0.9078969061374664, "num_tokens": 45025372.0, "step": 3650 }, { "entropy": 1.2556992173194885, "epoch": 1.9225908372827805, "grad_norm": 0.2678292691707611, "learning_rate": 0.00017321177985792972, "loss": 0.19617974758148193, "mean_token_accuracy": 0.9211210906505585, "num_tokens": 45037708.0, "step": 3651 }, { "entropy": 1.3135022222995758, "epoch": 1.9231174302264349, "grad_norm": 0.26799413561820984, "learning_rate": 0.0001731961687972781, "loss": 0.20180177688598633, "mean_token_accuracy": 0.916679710149765, "num_tokens": 45050044.0, "step": 3652 }, { "entropy": 1.2593377232551575, "epoch": 1.9236440231700895, "grad_norm": 0.26281964778900146, "learning_rate": 0.0001731805539850383, "loss": 0.1954004168510437, "mean_token_accuracy": 0.9243785589933395, "num_tokens": 45062380.0, "step": 3653 }, { "entropy": 1.2636898756027222, "epoch": 1.9241706161137442, "grad_norm": 0.26839685440063477, "learning_rate": 0.00017316493542213722, "loss": 0.19961456954479218, "mean_token_accuracy": 0.9217253774404526, "num_tokens": 45074716.0, "step": 3654 }, { "entropy": 1.2462226152420044, "epoch": 1.9246972090573986, "grad_norm": 0.2672293186187744, "learning_rate": 0.00017314931310950208, "loss": 0.191788911819458, "mean_token_accuracy": 0.9207832664251328, "num_tokens": 45087052.0, "step": 3655 }, { "entropy": 1.24080029129982, "epoch": 1.925223802001053, "grad_norm": 0.27368423342704773, "learning_rate": 0.0001731336870480603, "loss": 0.19978970289230347, "mean_token_accuracy": 0.9169470369815826, "num_tokens": 45099388.0, "step": 3656 }, { "entropy": 1.1998139321804047, "epoch": 1.925750394944708, "grad_norm": 0.2728565037250519, "learning_rate": 0.00017311805723873946, "loss": 0.20359551906585693, "mean_token_accuracy": 0.9137473702430725, "num_tokens": 45111724.0, "step": 3657 }, { "entropy": 1.2402350306510925, "epoch": 1.9262769878883623, "grad_norm": 0.28210633993148804, "learning_rate": 0.00017310242368246746, "loss": 0.19972732663154602, "mean_token_accuracy": 0.9203901588916779, "num_tokens": 45124060.0, "step": 3658 }, { "entropy": 1.2057775259017944, "epoch": 1.9268035808320167, "grad_norm": 0.26620033383369446, "learning_rate": 0.00017308678638017238, "loss": 0.19069263339042664, "mean_token_accuracy": 0.9222879111766815, "num_tokens": 45136396.0, "step": 3659 }, { "entropy": 1.2476109266281128, "epoch": 1.9273301737756714, "grad_norm": 0.24337823688983917, "learning_rate": 0.00017307114533278247, "loss": 0.1780460923910141, "mean_token_accuracy": 0.9250701814889908, "num_tokens": 45148732.0, "step": 3660 }, { "entropy": 1.1989704370498657, "epoch": 1.927856766719326, "grad_norm": 0.25690510869026184, "learning_rate": 0.00017305550054122625, "loss": 0.19341933727264404, "mean_token_accuracy": 0.9228748381137848, "num_tokens": 45161068.0, "step": 3661 }, { "entropy": 1.2263188660144806, "epoch": 1.9283833596629805, "grad_norm": 0.26640671491622925, "learning_rate": 0.0001730398520064325, "loss": 0.18614225089550018, "mean_token_accuracy": 0.9255273640155792, "num_tokens": 45173404.0, "step": 3662 }, { "entropy": 1.272974044084549, "epoch": 1.9289099526066351, "grad_norm": 0.3008297383785248, "learning_rate": 0.00017302419972933014, "loss": 0.2073616087436676, "mean_token_accuracy": 0.9149825423955917, "num_tokens": 45185740.0, "step": 3663 }, { "entropy": 1.2914739549160004, "epoch": 1.9294365455502898, "grad_norm": 0.27512502670288086, "learning_rate": 0.0001730085437108484, "loss": 0.20276200771331787, "mean_token_accuracy": 0.9159463495016098, "num_tokens": 45198076.0, "step": 3664 }, { "entropy": 1.3106342256069183, "epoch": 1.9299631384939442, "grad_norm": 0.29478466510772705, "learning_rate": 0.00017299288395191664, "loss": 0.20114478468894958, "mean_token_accuracy": 0.9164300113916397, "num_tokens": 45210412.0, "step": 3665 }, { "entropy": 1.3369048535823822, "epoch": 1.9304897314375986, "grad_norm": 0.27624809741973877, "learning_rate": 0.0001729772204534645, "loss": 0.20260167121887207, "mean_token_accuracy": 0.9126608073711395, "num_tokens": 45222748.0, "step": 3666 }, { "entropy": 1.3504050076007843, "epoch": 1.9310163243812533, "grad_norm": 0.31120526790618896, "learning_rate": 0.00017296155321642188, "loss": 0.2171817421913147, "mean_token_accuracy": 0.9078565239906311, "num_tokens": 45235084.0, "step": 3667 }, { "entropy": 1.3360699117183685, "epoch": 1.931542917324908, "grad_norm": 0.29817092418670654, "learning_rate": 0.00017294588224171879, "loss": 0.1921902298927307, "mean_token_accuracy": 0.9241172969341278, "num_tokens": 45247420.0, "step": 3668 }, { "entropy": 1.3836988508701324, "epoch": 1.9320695102685623, "grad_norm": 0.2684880793094635, "learning_rate": 0.00017293020753028556, "loss": 0.20802155137062073, "mean_token_accuracy": 0.9166839867830276, "num_tokens": 45259756.0, "step": 3669 }, { "entropy": 1.4190702736377716, "epoch": 1.932596103212217, "grad_norm": 0.25781887769699097, "learning_rate": 0.00017291452908305268, "loss": 0.18944363296031952, "mean_token_accuracy": 0.9194059371948242, "num_tokens": 45272092.0, "step": 3670 }, { "entropy": 1.4297086596488953, "epoch": 1.9331226961558716, "grad_norm": 0.25668513774871826, "learning_rate": 0.00017289884690095092, "loss": 0.18865437805652618, "mean_token_accuracy": 0.9221978783607483, "num_tokens": 45284428.0, "step": 3671 }, { "entropy": 1.4811699092388153, "epoch": 1.933649289099526, "grad_norm": 0.25223368406295776, "learning_rate": 0.00017288316098491122, "loss": 0.1869308352470398, "mean_token_accuracy": 0.926489993929863, "num_tokens": 45296764.0, "step": 3672 }, { "entropy": 1.4673098027706146, "epoch": 1.9341758820431805, "grad_norm": 0.2823149263858795, "learning_rate": 0.00017286747133586473, "loss": 0.21887610852718353, "mean_token_accuracy": 0.9101450145244598, "num_tokens": 45309100.0, "step": 3673 }, { "entropy": 1.4374184310436249, "epoch": 1.9347024749868353, "grad_norm": 0.2951841652393341, "learning_rate": 0.00017285177795474293, "loss": 0.21811825037002563, "mean_token_accuracy": 0.9097328335046768, "num_tokens": 45321436.0, "step": 3674 }, { "entropy": 1.474625825881958, "epoch": 1.9352290679304898, "grad_norm": 0.2604941725730896, "learning_rate": 0.00017283608084247738, "loss": 0.18887674808502197, "mean_token_accuracy": 0.9238714724779129, "num_tokens": 45333772.0, "step": 3675 }, { "entropy": 1.4799661338329315, "epoch": 1.9357556608741442, "grad_norm": 0.2468399554491043, "learning_rate": 0.00017282037999999996, "loss": 0.20713761448860168, "mean_token_accuracy": 0.9197785556316376, "num_tokens": 45346108.0, "step": 3676 }, { "entropy": 1.4618735611438751, "epoch": 1.9362822538177988, "grad_norm": 0.24083919823169708, "learning_rate": 0.0001728046754282427, "loss": 0.18771159648895264, "mean_token_accuracy": 0.9197709262371063, "num_tokens": 45358444.0, "step": 3677 }, { "entropy": 1.5067411363124847, "epoch": 1.9368088467614535, "grad_norm": 0.2688843607902527, "learning_rate": 0.00017278896712813794, "loss": 0.19874204695224762, "mean_token_accuracy": 0.9193889200687408, "num_tokens": 45370780.0, "step": 3678 }, { "entropy": 1.4961673319339752, "epoch": 1.937335439705108, "grad_norm": 0.28911784291267395, "learning_rate": 0.00017277325510061813, "loss": 0.20285126566886902, "mean_token_accuracy": 0.9150000810623169, "num_tokens": 45383116.0, "step": 3679 }, { "entropy": 1.5026283860206604, "epoch": 1.9378620326487626, "grad_norm": 0.26418668031692505, "learning_rate": 0.00017275753934661606, "loss": 0.2061035931110382, "mean_token_accuracy": 0.9167807698249817, "num_tokens": 45395452.0, "step": 3680 }, { "entropy": 1.4821618497371674, "epoch": 1.9383886255924172, "grad_norm": 0.2582075893878937, "learning_rate": 0.00017274181986706464, "loss": 0.19469109177589417, "mean_token_accuracy": 0.9196734130382538, "num_tokens": 45407788.0, "step": 3681 }, { "entropy": 1.4628108739852905, "epoch": 1.9389152185360716, "grad_norm": 0.27692705392837524, "learning_rate": 0.0001727260966628971, "loss": 0.20121949911117554, "mean_token_accuracy": 0.9166281670331955, "num_tokens": 45420124.0, "step": 3682 }, { "entropy": 1.4591149389743805, "epoch": 1.939441811479726, "grad_norm": 0.28909337520599365, "learning_rate": 0.00017271036973504674, "loss": 0.19279229640960693, "mean_token_accuracy": 0.9220520555973053, "num_tokens": 45432460.0, "step": 3683 }, { "entropy": 1.5424366295337677, "epoch": 1.9399684044233807, "grad_norm": 0.3063618242740631, "learning_rate": 0.00017269463908444724, "loss": 0.2191891372203827, "mean_token_accuracy": 0.9127875715494156, "num_tokens": 45444796.0, "step": 3684 }, { "entropy": 1.4530845880508423, "epoch": 1.9404949973670353, "grad_norm": 0.2661772072315216, "learning_rate": 0.00017267890471203248, "loss": 0.19795681536197662, "mean_token_accuracy": 0.9154502600431442, "num_tokens": 45457132.0, "step": 3685 }, { "entropy": 1.4750907719135284, "epoch": 1.9410215903106898, "grad_norm": 0.2790045440196991, "learning_rate": 0.00017266316661873642, "loss": 0.22019743919372559, "mean_token_accuracy": 0.9140889048576355, "num_tokens": 45469468.0, "step": 3686 }, { "entropy": 1.4428746104240417, "epoch": 1.9415481832543444, "grad_norm": 0.26486507058143616, "learning_rate": 0.0001726474248054934, "loss": 0.1950511783361435, "mean_token_accuracy": 0.9183469414710999, "num_tokens": 45481804.0, "step": 3687 }, { "entropy": 1.5106236040592194, "epoch": 1.942074776197999, "grad_norm": 0.2506488263607025, "learning_rate": 0.00017263167927323794, "loss": 0.1819375455379486, "mean_token_accuracy": 0.9284966439008713, "num_tokens": 45494140.0, "step": 3688 }, { "entropy": 1.5388555824756622, "epoch": 1.9426013691416535, "grad_norm": 0.300800085067749, "learning_rate": 0.00017261593002290468, "loss": 0.19233667850494385, "mean_token_accuracy": 0.9199601858854294, "num_tokens": 45506476.0, "step": 3689 }, { "entropy": 1.48341503739357, "epoch": 1.943127962085308, "grad_norm": 0.32261741161346436, "learning_rate": 0.00017260017705542864, "loss": 0.21268944442272186, "mean_token_accuracy": 0.9111090153455734, "num_tokens": 45518812.0, "step": 3690 }, { "entropy": 1.5718600451946259, "epoch": 1.9436545550289626, "grad_norm": 0.29194772243499756, "learning_rate": 0.00017258442037174497, "loss": 0.19810812175273895, "mean_token_accuracy": 0.9194205850362778, "num_tokens": 45531148.0, "step": 3691 }, { "entropy": 1.4727455377578735, "epoch": 1.9441811479726172, "grad_norm": 0.263203501701355, "learning_rate": 0.00017256865997278896, "loss": 0.21588562428951263, "mean_token_accuracy": 0.9114230424165726, "num_tokens": 45543484.0, "step": 3692 }, { "entropy": 1.5082348585128784, "epoch": 1.9447077409162716, "grad_norm": 0.2874946594238281, "learning_rate": 0.0001725528958594963, "loss": 0.1873784065246582, "mean_token_accuracy": 0.9259777516126633, "num_tokens": 45555820.0, "step": 3693 }, { "entropy": 1.5053280889987946, "epoch": 1.9452343338599263, "grad_norm": 0.2794869542121887, "learning_rate": 0.00017253712803280284, "loss": 0.20504489541053772, "mean_token_accuracy": 0.9110683053731918, "num_tokens": 45568156.0, "step": 3694 }, { "entropy": 1.5468563735485077, "epoch": 1.945760926803581, "grad_norm": 0.27621355652809143, "learning_rate": 0.00017252135649364455, "loss": 0.21246497333049774, "mean_token_accuracy": 0.9150105863809586, "num_tokens": 45580492.0, "step": 3695 }, { "entropy": 1.5053722560405731, "epoch": 1.9462875197472354, "grad_norm": 0.2672613561153412, "learning_rate": 0.00017250558124295778, "loss": 0.20558930933475494, "mean_token_accuracy": 0.9144411534070969, "num_tokens": 45592828.0, "step": 3696 }, { "entropy": 1.4701599478721619, "epoch": 1.94681411269089, "grad_norm": 0.25279685854911804, "learning_rate": 0.0001724898022816789, "loss": 0.19829775393009186, "mean_token_accuracy": 0.921133354306221, "num_tokens": 45605164.0, "step": 3697 }, { "entropy": 1.5011445581912994, "epoch": 1.9473407056345446, "grad_norm": 0.2716440260410309, "learning_rate": 0.0001724740196107447, "loss": 0.20478171110153198, "mean_token_accuracy": 0.9158901125192642, "num_tokens": 45617500.0, "step": 3698 }, { "entropy": 1.480711042881012, "epoch": 1.947867298578199, "grad_norm": 0.2888793349266052, "learning_rate": 0.00017245823323109208, "loss": 0.19861237704753876, "mean_token_accuracy": 0.9149367064237595, "num_tokens": 45629836.0, "step": 3699 }, { "entropy": 1.426710307598114, "epoch": 1.9483938915218535, "grad_norm": 0.28729501366615295, "learning_rate": 0.00017244244314365822, "loss": 0.20462435483932495, "mean_token_accuracy": 0.9161471426486969, "num_tokens": 45642172.0, "step": 3700 }, { "entropy": 1.4438749551773071, "epoch": 1.9489204844655081, "grad_norm": 0.28520667552948, "learning_rate": 0.0001724266493493804, "loss": 0.20798423886299133, "mean_token_accuracy": 0.9113110899925232, "num_tokens": 45654508.0, "step": 3701 }, { "entropy": 1.4134547710418701, "epoch": 1.9494470774091628, "grad_norm": 0.26647916436195374, "learning_rate": 0.0001724108518491963, "loss": 0.19534523785114288, "mean_token_accuracy": 0.9230214208364487, "num_tokens": 45666844.0, "step": 3702 }, { "entropy": 1.4336603581905365, "epoch": 1.9499736703528172, "grad_norm": 0.27049604058265686, "learning_rate": 0.00017239505064404367, "loss": 0.18309858441352844, "mean_token_accuracy": 0.922065794467926, "num_tokens": 45679180.0, "step": 3703 }, { "entropy": 1.4100782871246338, "epoch": 1.9505002632964719, "grad_norm": 0.2777698338031769, "learning_rate": 0.00017237924573486053, "loss": 0.21323612332344055, "mean_token_accuracy": 0.9146802127361298, "num_tokens": 45691516.0, "step": 3704 }, { "entropy": 1.3497129678726196, "epoch": 1.9510268562401265, "grad_norm": 0.26056769490242004, "learning_rate": 0.00017236343712258515, "loss": 0.18909797072410583, "mean_token_accuracy": 0.9163524806499481, "num_tokens": 45703852.0, "step": 3705 }, { "entropy": 1.442967563867569, "epoch": 1.951553449183781, "grad_norm": 0.3076518774032593, "learning_rate": 0.000172347624808156, "loss": 0.20429672300815582, "mean_token_accuracy": 0.9184731394052505, "num_tokens": 45716188.0, "step": 3706 }, { "entropy": 1.3970259726047516, "epoch": 1.9520800421274354, "grad_norm": 0.2776000201702118, "learning_rate": 0.00017233180879251176, "loss": 0.18460848927497864, "mean_token_accuracy": 0.9276632517576218, "num_tokens": 45728524.0, "step": 3707 }, { "entropy": 1.3923786878585815, "epoch": 1.95260663507109, "grad_norm": 0.2807813286781311, "learning_rate": 0.00017231598907659133, "loss": 0.19556443393230438, "mean_token_accuracy": 0.9221478253602982, "num_tokens": 45740860.0, "step": 3708 }, { "entropy": 1.352414458990097, "epoch": 1.9531332280147446, "grad_norm": 0.27617254853248596, "learning_rate": 0.0001723001656613338, "loss": 0.20182929933071136, "mean_token_accuracy": 0.9149250984191895, "num_tokens": 45753196.0, "step": 3709 }, { "entropy": 1.3327330350875854, "epoch": 1.953659820958399, "grad_norm": 0.34774214029312134, "learning_rate": 0.00017228433854767859, "loss": 0.20589327812194824, "mean_token_accuracy": 0.9095378816127777, "num_tokens": 45765532.0, "step": 3710 }, { "entropy": 1.3821765780448914, "epoch": 1.9541864139020537, "grad_norm": 0.27642711997032166, "learning_rate": 0.00017226850773656522, "loss": 0.18724891543388367, "mean_token_accuracy": 0.9221665114164352, "num_tokens": 45777868.0, "step": 3711 }, { "entropy": 1.3774185180664062, "epoch": 1.9547130068457084, "grad_norm": 0.2937214970588684, "learning_rate": 0.00017225267322893345, "loss": 0.2190551459789276, "mean_token_accuracy": 0.9116322845220566, "num_tokens": 45790204.0, "step": 3712 }, { "entropy": 1.4014697074890137, "epoch": 1.9552395997893628, "grad_norm": 0.28920748829841614, "learning_rate": 0.0001722368350257233, "loss": 0.21408043801784515, "mean_token_accuracy": 0.9153937697410583, "num_tokens": 45802540.0, "step": 3713 }, { "entropy": 1.3347688913345337, "epoch": 1.9557661927330172, "grad_norm": 0.2642535865306854, "learning_rate": 0.000172220993127875, "loss": 0.18664056062698364, "mean_token_accuracy": 0.9244186133146286, "num_tokens": 45814876.0, "step": 3714 }, { "entropy": 1.4463875889778137, "epoch": 1.956292785676672, "grad_norm": 0.29163017868995667, "learning_rate": 0.000172205147536329, "loss": 0.1997067928314209, "mean_token_accuracy": 0.9191901385784149, "num_tokens": 45827212.0, "step": 3715 }, { "entropy": 1.356296420097351, "epoch": 1.9568193786203265, "grad_norm": 0.2423374354839325, "learning_rate": 0.000172189298252026, "loss": 0.17346829175949097, "mean_token_accuracy": 0.9300062209367752, "num_tokens": 45839548.0, "step": 3716 }, { "entropy": 1.4623576700687408, "epoch": 1.957345971563981, "grad_norm": 0.29987430572509766, "learning_rate": 0.00017217344527590674, "loss": 0.21269282698631287, "mean_token_accuracy": 0.910034641623497, "num_tokens": 45851884.0, "step": 3717 }, { "entropy": 1.3989585936069489, "epoch": 1.9578725645076356, "grad_norm": 0.2627890408039093, "learning_rate": 0.00017215758860891246, "loss": 0.19222907721996307, "mean_token_accuracy": 0.9272477477788925, "num_tokens": 45864220.0, "step": 3718 }, { "entropy": 1.3934078514575958, "epoch": 1.9583991574512902, "grad_norm": 0.29076218605041504, "learning_rate": 0.00017214172825198444, "loss": 0.19307014346122742, "mean_token_accuracy": 0.9236427992582321, "num_tokens": 45876556.0, "step": 3719 }, { "entropy": 1.3593478798866272, "epoch": 1.9589257503949447, "grad_norm": 0.2587772309780121, "learning_rate": 0.00017212586420606416, "loss": 0.19868242740631104, "mean_token_accuracy": 0.916473776102066, "num_tokens": 45888892.0, "step": 3720 }, { "entropy": 1.3617135286331177, "epoch": 1.9594523433385993, "grad_norm": 0.26174452900886536, "learning_rate": 0.00017210999647209344, "loss": 0.19469386339187622, "mean_token_accuracy": 0.9216127842664719, "num_tokens": 45901228.0, "step": 3721 }, { "entropy": 1.3824553787708282, "epoch": 1.959978936282254, "grad_norm": 0.2771162688732147, "learning_rate": 0.00017209412505101424, "loss": 0.19940043985843658, "mean_token_accuracy": 0.9135098457336426, "num_tokens": 45913564.0, "step": 3722 }, { "entropy": 1.396307110786438, "epoch": 1.9605055292259084, "grad_norm": 0.2760707139968872, "learning_rate": 0.00017207824994376874, "loss": 0.20229698717594147, "mean_token_accuracy": 0.9171424061059952, "num_tokens": 45925900.0, "step": 3723 }, { "entropy": 1.386707216501236, "epoch": 1.9610321221695628, "grad_norm": 0.290345698595047, "learning_rate": 0.00017206237115129937, "loss": 0.17667615413665771, "mean_token_accuracy": 0.9289303123950958, "num_tokens": 45938236.0, "step": 3724 }, { "entropy": 1.4016615748405457, "epoch": 1.9615587151132174, "grad_norm": 0.2932867407798767, "learning_rate": 0.00017204648867454874, "loss": 0.2111460119485855, "mean_token_accuracy": 0.915149986743927, "num_tokens": 45950572.0, "step": 3725 }, { "entropy": 1.3835887610912323, "epoch": 1.962085308056872, "grad_norm": 0.27471598982810974, "learning_rate": 0.0001720306025144597, "loss": 0.19538769125938416, "mean_token_accuracy": 0.9221490770578384, "num_tokens": 45962908.0, "step": 3726 }, { "entropy": 1.361358791589737, "epoch": 1.9626119010005265, "grad_norm": 0.3096008002758026, "learning_rate": 0.00017201471267197534, "loss": 0.22924600541591644, "mean_token_accuracy": 0.912015825510025, "num_tokens": 45975244.0, "step": 3727 }, { "entropy": 1.351409524679184, "epoch": 1.9631384939441812, "grad_norm": 0.27216240763664246, "learning_rate": 0.00017199881914803895, "loss": 0.19787034392356873, "mean_token_accuracy": 0.9182685315608978, "num_tokens": 45987580.0, "step": 3728 }, { "entropy": 1.4106302857398987, "epoch": 1.9636650868878358, "grad_norm": 0.28636589646339417, "learning_rate": 0.00017198292194359403, "loss": 0.22176605463027954, "mean_token_accuracy": 0.9129254519939423, "num_tokens": 45999916.0, "step": 3729 }, { "entropy": 1.351713240146637, "epoch": 1.9641916798314902, "grad_norm": 0.2533683180809021, "learning_rate": 0.00017196702105958428, "loss": 0.19331756234169006, "mean_token_accuracy": 0.9180753231048584, "num_tokens": 46012252.0, "step": 3730 }, { "entropy": 1.4381624460220337, "epoch": 1.9647182727751447, "grad_norm": 0.2788030207157135, "learning_rate": 0.00017195111649695368, "loss": 0.21007753908634186, "mean_token_accuracy": 0.9156930446624756, "num_tokens": 46024588.0, "step": 3731 }, { "entropy": 1.412168174982071, "epoch": 1.9652448657187995, "grad_norm": 0.31602713465690613, "learning_rate": 0.00017193520825664632, "loss": 0.17869442701339722, "mean_token_accuracy": 0.9241944849491119, "num_tokens": 46036924.0, "step": 3732 }, { "entropy": 1.3544166386127472, "epoch": 1.965771458662454, "grad_norm": 0.27904483675956726, "learning_rate": 0.0001719192963396067, "loss": 0.17792828381061554, "mean_token_accuracy": 0.9248538911342621, "num_tokens": 46049260.0, "step": 3733 }, { "entropy": 1.380949467420578, "epoch": 1.9662980516061084, "grad_norm": 0.266156405210495, "learning_rate": 0.0001719033807467793, "loss": 0.19987784326076508, "mean_token_accuracy": 0.9200113117694855, "num_tokens": 46061596.0, "step": 3734 }, { "entropy": 1.4363450706005096, "epoch": 1.966824644549763, "grad_norm": 0.25485169887542725, "learning_rate": 0.000171887461479109, "loss": 0.18918852508068085, "mean_token_accuracy": 0.926123857498169, "num_tokens": 46073932.0, "step": 3735 }, { "entropy": 1.5534420013427734, "epoch": 1.9673512374934177, "grad_norm": 0.3038926422595978, "learning_rate": 0.00017187153853754082, "loss": 0.1933830827474594, "mean_token_accuracy": 0.9212097078561783, "num_tokens": 46086268.0, "step": 3736 }, { "entropy": 1.4520435631275177, "epoch": 1.967877830437072, "grad_norm": 0.2602609395980835, "learning_rate": 0.00017185561192302004, "loss": 0.20847854018211365, "mean_token_accuracy": 0.914483830332756, "num_tokens": 46098604.0, "step": 3737 }, { "entropy": 1.4301496744155884, "epoch": 1.9684044233807267, "grad_norm": 0.28433549404144287, "learning_rate": 0.00017183968163649206, "loss": 0.20116156339645386, "mean_token_accuracy": 0.9151373505592346, "num_tokens": 46110940.0, "step": 3738 }, { "entropy": 1.4304525554180145, "epoch": 1.9689310163243814, "grad_norm": 0.24822618067264557, "learning_rate": 0.00017182374767890263, "loss": 0.20083917677402496, "mean_token_accuracy": 0.9184573292732239, "num_tokens": 46123276.0, "step": 3739 }, { "entropy": 1.4638838469982147, "epoch": 1.9694576092680358, "grad_norm": 0.2700670659542084, "learning_rate": 0.00017180781005119765, "loss": 0.20267093181610107, "mean_token_accuracy": 0.9162935614585876, "num_tokens": 46135612.0, "step": 3740 }, { "entropy": 1.3683336675167084, "epoch": 1.9699842022116902, "grad_norm": 0.26389580965042114, "learning_rate": 0.00017179186875432322, "loss": 0.1996886432170868, "mean_token_accuracy": 0.9172192066907883, "num_tokens": 46147948.0, "step": 3741 }, { "entropy": 1.411024570465088, "epoch": 1.9705107951553449, "grad_norm": 0.26272377371788025, "learning_rate": 0.00017177592378922566, "loss": 0.20570415258407593, "mean_token_accuracy": 0.9192255139350891, "num_tokens": 46160284.0, "step": 3742 }, { "entropy": 1.3969583213329315, "epoch": 1.9710373880989995, "grad_norm": 0.2648279666900635, "learning_rate": 0.0001717599751568516, "loss": 0.19804665446281433, "mean_token_accuracy": 0.9161637872457504, "num_tokens": 46172620.0, "step": 3743 }, { "entropy": 1.430682510137558, "epoch": 1.971563981042654, "grad_norm": 0.2636677920818329, "learning_rate": 0.00017174402285814776, "loss": 0.20058637857437134, "mean_token_accuracy": 0.9166569113731384, "num_tokens": 46184956.0, "step": 3744 }, { "entropy": 1.4314651489257812, "epoch": 1.9720905739863086, "grad_norm": 0.27471134066581726, "learning_rate": 0.00017172806689406118, "loss": 0.19406890869140625, "mean_token_accuracy": 0.9242938160896301, "num_tokens": 46197292.0, "step": 3745 }, { "entropy": 1.4192952811717987, "epoch": 1.9726171669299633, "grad_norm": 0.30075007677078247, "learning_rate": 0.00017171210726553903, "loss": 0.21153703331947327, "mean_token_accuracy": 0.91255022585392, "num_tokens": 46209628.0, "step": 3746 }, { "entropy": 1.4196560978889465, "epoch": 1.9731437598736177, "grad_norm": 0.2734670341014862, "learning_rate": 0.00017169614397352875, "loss": 0.19642943143844604, "mean_token_accuracy": 0.9212541729211807, "num_tokens": 46221964.0, "step": 3747 }, { "entropy": 1.3763989508152008, "epoch": 1.973670352817272, "grad_norm": 0.24970701336860657, "learning_rate": 0.00017168017701897802, "loss": 0.19371524453163147, "mean_token_accuracy": 0.9200150370597839, "num_tokens": 46234300.0, "step": 3748 }, { "entropy": 1.417275309562683, "epoch": 1.974196945760927, "grad_norm": 0.2494390606880188, "learning_rate": 0.00017166420640283466, "loss": 0.19952630996704102, "mean_token_accuracy": 0.9210073202848434, "num_tokens": 46246636.0, "step": 3749 }, { "entropy": 1.380375474691391, "epoch": 1.9747235387045814, "grad_norm": 0.2673463225364685, "learning_rate": 0.00017164823212604676, "loss": 0.19341374933719635, "mean_token_accuracy": 0.9220623522996902, "num_tokens": 46258972.0, "step": 3750 }, { "entropy": 1.3973598778247833, "epoch": 1.9752501316482358, "grad_norm": 0.28491443395614624, "learning_rate": 0.00017163225418956267, "loss": 0.21687844395637512, "mean_token_accuracy": 0.913015678524971, "num_tokens": 46271308.0, "step": 3751 }, { "entropy": 1.4152703285217285, "epoch": 1.9757767245918905, "grad_norm": 0.2640281021595001, "learning_rate": 0.00017161627259433082, "loss": 0.19280694425106049, "mean_token_accuracy": 0.9230195134878159, "num_tokens": 46283644.0, "step": 3752 }, { "entropy": 1.381377637386322, "epoch": 1.9763033175355451, "grad_norm": 0.2697671949863434, "learning_rate": 0.00017160028734130003, "loss": 0.18636345863342285, "mean_token_accuracy": 0.9252691715955734, "num_tokens": 46295980.0, "step": 3753 }, { "entropy": 1.3591782450675964, "epoch": 1.9768299104791995, "grad_norm": 0.2595213055610657, "learning_rate": 0.0001715842984314192, "loss": 0.19123241305351257, "mean_token_accuracy": 0.9189948439598083, "num_tokens": 46308316.0, "step": 3754 }, { "entropy": 1.3821331858634949, "epoch": 1.9773565034228542, "grad_norm": 0.27835193276405334, "learning_rate": 0.0001715683058656375, "loss": 0.2042919397354126, "mean_token_accuracy": 0.9147767573595047, "num_tokens": 46320652.0, "step": 3755 }, { "entropy": 1.3725225925445557, "epoch": 1.9778830963665088, "grad_norm": 0.2779839336872101, "learning_rate": 0.0001715523096449043, "loss": 0.20555046200752258, "mean_token_accuracy": 0.9161995947360992, "num_tokens": 46332988.0, "step": 3756 }, { "entropy": 1.3390932083129883, "epoch": 1.9784096893101633, "grad_norm": 0.2884056270122528, "learning_rate": 0.00017153630977016933, "loss": 0.21466374397277832, "mean_token_accuracy": 0.9098951071500778, "num_tokens": 46345324.0, "step": 3757 }, { "entropy": 1.304327368736267, "epoch": 1.9789362822538177, "grad_norm": 0.28233397006988525, "learning_rate": 0.00017152030624238224, "loss": 0.2030801624059677, "mean_token_accuracy": 0.9174643605947495, "num_tokens": 46357660.0, "step": 3758 }, { "entropy": 1.3582344055175781, "epoch": 1.9794628751974723, "grad_norm": 0.2734123170375824, "learning_rate": 0.00017150429906249314, "loss": 0.20131902396678925, "mean_token_accuracy": 0.9201581329107285, "num_tokens": 46369996.0, "step": 3759 }, { "entropy": 1.3707594871520996, "epoch": 1.979989468141127, "grad_norm": 0.28123629093170166, "learning_rate": 0.0001714882882314523, "loss": 0.22594565153121948, "mean_token_accuracy": 0.9095589369535446, "num_tokens": 46382332.0, "step": 3760 }, { "entropy": 1.325995683670044, "epoch": 1.9805160610847814, "grad_norm": 0.2784866690635681, "learning_rate": 0.00017147227375021015, "loss": 0.21171274781227112, "mean_token_accuracy": 0.9164798855781555, "num_tokens": 46394668.0, "step": 3761 }, { "entropy": 1.3826212286949158, "epoch": 1.981042654028436, "grad_norm": 0.27320340275764465, "learning_rate": 0.0001714562556197174, "loss": 0.18267717957496643, "mean_token_accuracy": 0.9259230494499207, "num_tokens": 46407004.0, "step": 3762 }, { "entropy": 1.2950341999530792, "epoch": 1.9815692469720907, "grad_norm": 0.28982457518577576, "learning_rate": 0.00017144023384092495, "loss": 0.20509836077690125, "mean_token_accuracy": 0.9163513332605362, "num_tokens": 46419340.0, "step": 3763 }, { "entropy": 1.3356437385082245, "epoch": 1.9820958399157451, "grad_norm": 0.2567256689071655, "learning_rate": 0.00017142420841478393, "loss": 0.18219546973705292, "mean_token_accuracy": 0.9224260747432709, "num_tokens": 46431676.0, "step": 3764 }, { "entropy": 1.3211258351802826, "epoch": 1.9826224328593995, "grad_norm": 0.25619199872016907, "learning_rate": 0.00017140817934224565, "loss": 0.20122160017490387, "mean_token_accuracy": 0.9165990948677063, "num_tokens": 46444012.0, "step": 3765 }, { "entropy": 1.2932257950305939, "epoch": 1.9831490258030542, "grad_norm": 0.2684885561466217, "learning_rate": 0.00017139214662426167, "loss": 0.1878378689289093, "mean_token_accuracy": 0.9228431284427643, "num_tokens": 46456348.0, "step": 3766 }, { "entropy": 1.2775112092494965, "epoch": 1.9836756187467088, "grad_norm": 0.2664264738559723, "learning_rate": 0.00017137611026178375, "loss": 0.19962744414806366, "mean_token_accuracy": 0.9182207137346268, "num_tokens": 46468684.0, "step": 3767 }, { "entropy": 1.2961704730987549, "epoch": 1.9842022116903633, "grad_norm": 0.27163180708885193, "learning_rate": 0.00017136007025576392, "loss": 0.2212834358215332, "mean_token_accuracy": 0.9135020226240158, "num_tokens": 46481020.0, "step": 3768 }, { "entropy": 1.3635116219520569, "epoch": 1.984728804634018, "grad_norm": 0.2555164396762848, "learning_rate": 0.00017134402660715436, "loss": 0.19105497002601624, "mean_token_accuracy": 0.92401522397995, "num_tokens": 46493356.0, "step": 3769 }, { "entropy": 1.2995677888393402, "epoch": 1.9852553975776726, "grad_norm": 0.2641841173171997, "learning_rate": 0.00017132797931690747, "loss": 0.19776709377765656, "mean_token_accuracy": 0.9210506677627563, "num_tokens": 46505692.0, "step": 3770 }, { "entropy": 1.2360694408416748, "epoch": 1.985781990521327, "grad_norm": 0.2550431489944458, "learning_rate": 0.0001713119283859759, "loss": 0.18957817554473877, "mean_token_accuracy": 0.9171388000249863, "num_tokens": 46518028.0, "step": 3771 }, { "entropy": 1.273363709449768, "epoch": 1.9863085834649814, "grad_norm": 0.25279700756073, "learning_rate": 0.00017129587381531247, "loss": 0.19003725051879883, "mean_token_accuracy": 0.9217302948236465, "num_tokens": 46530364.0, "step": 3772 }, { "entropy": 1.2529352307319641, "epoch": 1.9868351764086363, "grad_norm": 0.2749396860599518, "learning_rate": 0.0001712798156058703, "loss": 0.1858321577310562, "mean_token_accuracy": 0.9264263361692429, "num_tokens": 46542700.0, "step": 3773 }, { "entropy": 1.2869006991386414, "epoch": 1.9873617693522907, "grad_norm": 0.28312820196151733, "learning_rate": 0.00017126375375860263, "loss": 0.21077433228492737, "mean_token_accuracy": 0.9111466556787491, "num_tokens": 46555036.0, "step": 3774 }, { "entropy": 1.2937982976436615, "epoch": 1.9878883622959451, "grad_norm": 0.29525041580200195, "learning_rate": 0.00017124768827446297, "loss": 0.21481990814208984, "mean_token_accuracy": 0.9122337698936462, "num_tokens": 46567372.0, "step": 3775 }, { "entropy": 1.287131816148758, "epoch": 1.9884149552395998, "grad_norm": 0.2926379442214966, "learning_rate": 0.00017123161915440503, "loss": 0.20220476388931274, "mean_token_accuracy": 0.9196414649486542, "num_tokens": 46579708.0, "step": 3776 }, { "entropy": 1.2510655224323273, "epoch": 1.9889415481832544, "grad_norm": 0.307608962059021, "learning_rate": 0.00017121554639938272, "loss": 0.1835639774799347, "mean_token_accuracy": 0.9256336688995361, "num_tokens": 46592044.0, "step": 3777 }, { "entropy": 1.198952555656433, "epoch": 1.9894681411269088, "grad_norm": 0.2576758563518524, "learning_rate": 0.00017119947001035027, "loss": 0.20444577932357788, "mean_token_accuracy": 0.9202164262533188, "num_tokens": 46604380.0, "step": 3778 }, { "entropy": 1.30607271194458, "epoch": 1.9899947340705635, "grad_norm": 0.2850700914859772, "learning_rate": 0.00017118338998826197, "loss": 0.1958879828453064, "mean_token_accuracy": 0.9212403148412704, "num_tokens": 46616716.0, "step": 3779 }, { "entropy": 1.1765548586845398, "epoch": 1.9905213270142181, "grad_norm": 0.28321370482444763, "learning_rate": 0.00017116730633407238, "loss": 0.21571975946426392, "mean_token_accuracy": 0.9140463322401047, "num_tokens": 46629052.0, "step": 3780 }, { "entropy": 1.2251535058021545, "epoch": 1.9910479199578726, "grad_norm": 0.2587471604347229, "learning_rate": 0.00017115121904873637, "loss": 0.19872674345970154, "mean_token_accuracy": 0.9179710447788239, "num_tokens": 46641388.0, "step": 3781 }, { "entropy": 1.2262464761734009, "epoch": 1.991574512901527, "grad_norm": 0.26432153582572937, "learning_rate": 0.00017113512813320887, "loss": 0.18742287158966064, "mean_token_accuracy": 0.9234320670366287, "num_tokens": 46653724.0, "step": 3782 }, { "entropy": 1.2304887175559998, "epoch": 1.9921011058451816, "grad_norm": 0.3122429847717285, "learning_rate": 0.00017111903358844513, "loss": 0.20218738913536072, "mean_token_accuracy": 0.9151853322982788, "num_tokens": 46666060.0, "step": 3783 }, { "entropy": 1.254802256822586, "epoch": 1.9926276987888363, "grad_norm": 0.27966201305389404, "learning_rate": 0.0001711029354154006, "loss": 0.2041388899087906, "mean_token_accuracy": 0.9164295345544815, "num_tokens": 46678396.0, "step": 3784 }, { "entropy": 1.2461448013782501, "epoch": 1.9931542917324907, "grad_norm": 0.2727980315685272, "learning_rate": 0.00017108683361503093, "loss": 0.2023455798625946, "mean_token_accuracy": 0.9165138304233551, "num_tokens": 46690732.0, "step": 3785 }, { "entropy": 1.2635038495063782, "epoch": 1.9936808846761453, "grad_norm": 0.27869847416877747, "learning_rate": 0.000171070728188292, "loss": 0.21800480782985687, "mean_token_accuracy": 0.9098168015480042, "num_tokens": 46703068.0, "step": 3786 }, { "entropy": 1.3022080957889557, "epoch": 1.9942074776198, "grad_norm": 0.2651629149913788, "learning_rate": 0.00017105461913613986, "loss": 0.2050429880619049, "mean_token_accuracy": 0.9191136509180069, "num_tokens": 46715404.0, "step": 3787 }, { "entropy": 1.316438913345337, "epoch": 1.9947340705634544, "grad_norm": 0.2717432379722595, "learning_rate": 0.00017103850645953085, "loss": 0.20991484820842743, "mean_token_accuracy": 0.9131201207637787, "num_tokens": 46727740.0, "step": 3788 }, { "entropy": 1.3070935606956482, "epoch": 1.9952606635071088, "grad_norm": 0.28713029623031616, "learning_rate": 0.00017102239015942148, "loss": 0.22580859065055847, "mean_token_accuracy": 0.9063994288444519, "num_tokens": 46740076.0, "step": 3789 }, { "entropy": 1.2703860700130463, "epoch": 1.9957872564507637, "grad_norm": 0.2608626186847687, "learning_rate": 0.00017100627023676848, "loss": 0.20214328169822693, "mean_token_accuracy": 0.9189681559801102, "num_tokens": 46752412.0, "step": 3790 }, { "entropy": 1.248716801404953, "epoch": 1.9963138493944181, "grad_norm": 0.2430690973997116, "learning_rate": 0.00017099014669252877, "loss": 0.18712979555130005, "mean_token_accuracy": 0.9251755028963089, "num_tokens": 46764748.0, "step": 3791 }, { "entropy": 1.222788542509079, "epoch": 1.9968404423380726, "grad_norm": 0.277614027261734, "learning_rate": 0.0001709740195276595, "loss": 0.21778146922588348, "mean_token_accuracy": 0.9087530225515366, "num_tokens": 46777084.0, "step": 3792 }, { "entropy": 1.204005628824234, "epoch": 1.9973670352817272, "grad_norm": 0.2973788380622864, "learning_rate": 0.00017095788874311814, "loss": 0.19019125401973724, "mean_token_accuracy": 0.9220655113458633, "num_tokens": 46789420.0, "step": 3793 }, { "entropy": 1.2420277893543243, "epoch": 1.9978936282253819, "grad_norm": 0.25097668170928955, "learning_rate": 0.00017094175433986214, "loss": 0.197739377617836, "mean_token_accuracy": 0.9215272665023804, "num_tokens": 46801756.0, "step": 3794 }, { "entropy": 1.2404221594333649, "epoch": 1.9984202211690363, "grad_norm": 0.2478831261396408, "learning_rate": 0.0001709256163188494, "loss": 0.19220499694347382, "mean_token_accuracy": 0.9218998998403549, "num_tokens": 46814092.0, "step": 3795 }, { "entropy": 1.2480852603912354, "epoch": 1.998946814112691, "grad_norm": 0.25873619318008423, "learning_rate": 0.000170909474681038, "loss": 0.18990661203861237, "mean_token_accuracy": 0.9263609051704407, "num_tokens": 46826428.0, "step": 3796 }, { "entropy": 1.1696776449680328, "epoch": 1.9994734070563456, "grad_norm": 0.2425045371055603, "learning_rate": 0.00017089332942738604, "loss": 0.18430982530117035, "mean_token_accuracy": 0.9185814708471298, "num_tokens": 46838764.0, "step": 3797 }, { "entropy": 1.269264966249466, "epoch": 2.0, "grad_norm": 0.29400986433029175, "learning_rate": 0.000170877180558852, "loss": 0.1966848373413086, "mean_token_accuracy": 0.9257184416055679, "num_tokens": 46850072.0, "step": 3798 }, { "epoch": 2.0, "eval_entropy": 1.244152147623035, "eval_loss": 0.20280839502811432, "eval_mean_token_accuracy": 0.9176469020557253, "eval_num_tokens": 46850072.0, "eval_runtime": 665.3153, "eval_samples_per_second": 8.563, "eval_steps_per_second": 2.854, "step": 3798 }, { "entropy": 1.2631646990776062, "epoch": 2.0005265929436544, "grad_norm": 0.25198251008987427, "learning_rate": 0.00017086102807639458, "loss": 0.1870889663696289, "mean_token_accuracy": 0.9224293082952499, "num_tokens": 46862408.0, "step": 3799 }, { "entropy": 1.1980132162570953, "epoch": 2.0010531858873093, "grad_norm": 0.2404579371213913, "learning_rate": 0.00017084487198097266, "loss": 0.18207380175590515, "mean_token_accuracy": 0.9251429438591003, "num_tokens": 46874744.0, "step": 3800 }, { "entropy": 1.237736165523529, "epoch": 2.0015797788309637, "grad_norm": 0.27258867025375366, "learning_rate": 0.00017082871227354533, "loss": 0.18785671889781952, "mean_token_accuracy": 0.9198215752840042, "num_tokens": 46887080.0, "step": 3801 }, { "entropy": 1.245652198791504, "epoch": 2.002106371774618, "grad_norm": 0.2836478352546692, "learning_rate": 0.0001708125489550719, "loss": 0.19735261797904968, "mean_token_accuracy": 0.9185144305229187, "num_tokens": 46899416.0, "step": 3802 }, { "entropy": 1.2350683510303497, "epoch": 2.0026329647182726, "grad_norm": 0.28520843386650085, "learning_rate": 0.00017079638202651185, "loss": 0.181529700756073, "mean_token_accuracy": 0.9275423139333725, "num_tokens": 46911752.0, "step": 3803 }, { "entropy": 1.254747599363327, "epoch": 2.0031595576619274, "grad_norm": 0.2920467257499695, "learning_rate": 0.00017078021148882498, "loss": 0.2086395025253296, "mean_token_accuracy": 0.9195475280284882, "num_tokens": 46924088.0, "step": 3804 }, { "entropy": 1.1598127484321594, "epoch": 2.003686150605582, "grad_norm": 0.2568848431110382, "learning_rate": 0.00017076403734297112, "loss": 0.1833052933216095, "mean_token_accuracy": 0.9211831390857697, "num_tokens": 46936424.0, "step": 3805 }, { "entropy": 1.2467805445194244, "epoch": 2.0042127435492363, "grad_norm": 0.29362115263938904, "learning_rate": 0.00017074785958991063, "loss": 0.20824174582958221, "mean_token_accuracy": 0.9118938595056534, "num_tokens": 46948760.0, "step": 3806 }, { "entropy": 1.231805145740509, "epoch": 2.004739336492891, "grad_norm": 0.29164865612983704, "learning_rate": 0.0001707316782306037, "loss": 0.2124311774969101, "mean_token_accuracy": 0.9105638265609741, "num_tokens": 46961096.0, "step": 3807 }, { "entropy": 1.1256294250488281, "epoch": 2.0052659294365456, "grad_norm": 0.2622910141944885, "learning_rate": 0.00017071549326601107, "loss": 0.1925264447927475, "mean_token_accuracy": 0.9230650365352631, "num_tokens": 46973432.0, "step": 3808 }, { "entropy": 1.2006166875362396, "epoch": 2.0057925223802, "grad_norm": 0.28640827536582947, "learning_rate": 0.00017069930469709344, "loss": 0.20924372971057892, "mean_token_accuracy": 0.9144559353590012, "num_tokens": 46985768.0, "step": 3809 }, { "entropy": 1.2369438111782074, "epoch": 2.006319115323855, "grad_norm": 0.25838255882263184, "learning_rate": 0.0001706831125248119, "loss": 0.18743355572223663, "mean_token_accuracy": 0.9234079271554947, "num_tokens": 46998104.0, "step": 3810 }, { "entropy": 1.17817023396492, "epoch": 2.0068457082675093, "grad_norm": 0.2704300880432129, "learning_rate": 0.00017066691675012764, "loss": 0.18841452896595, "mean_token_accuracy": 0.9241382032632828, "num_tokens": 47010440.0, "step": 3811 }, { "entropy": 1.2373998761177063, "epoch": 2.0073723012111637, "grad_norm": 0.2672933042049408, "learning_rate": 0.00017065071737400213, "loss": 0.1963019222021103, "mean_token_accuracy": 0.9170713722705841, "num_tokens": 47022776.0, "step": 3812 }, { "entropy": 1.140851616859436, "epoch": 2.007898894154818, "grad_norm": 0.25465431809425354, "learning_rate": 0.00017063451439739704, "loss": 0.18710798025131226, "mean_token_accuracy": 0.9227855503559113, "num_tokens": 47035112.0, "step": 3813 }, { "entropy": 1.1974302530288696, "epoch": 2.008425487098473, "grad_norm": 0.2557191550731659, "learning_rate": 0.0001706183078212742, "loss": 0.17992272973060608, "mean_token_accuracy": 0.9254202246665955, "num_tokens": 47047448.0, "step": 3814 }, { "entropy": 1.2048839926719666, "epoch": 2.0089520800421274, "grad_norm": 0.27587470412254333, "learning_rate": 0.00017060209764659576, "loss": 0.18894129991531372, "mean_token_accuracy": 0.9178142994642258, "num_tokens": 47059784.0, "step": 3815 }, { "entropy": 1.2109751403331757, "epoch": 2.009478672985782, "grad_norm": 0.2797783613204956, "learning_rate": 0.000170585883874324, "loss": 0.19585882127285004, "mean_token_accuracy": 0.9170439839363098, "num_tokens": 47072120.0, "step": 3816 }, { "entropy": 1.1850585043430328, "epoch": 2.0100052659294367, "grad_norm": 0.24356874823570251, "learning_rate": 0.00017056966650542146, "loss": 0.1750049591064453, "mean_token_accuracy": 0.9231248944997787, "num_tokens": 47084456.0, "step": 3817 }, { "entropy": 1.2129537165164948, "epoch": 2.010531858873091, "grad_norm": 0.2753424644470215, "learning_rate": 0.00017055344554085081, "loss": 0.1915561556816101, "mean_token_accuracy": 0.9132361859083176, "num_tokens": 47096792.0, "step": 3818 }, { "entropy": 1.1568632423877716, "epoch": 2.0110584518167456, "grad_norm": 0.25440388917922974, "learning_rate": 0.00017053722098157504, "loss": 0.18248328566551208, "mean_token_accuracy": 0.9241259098052979, "num_tokens": 47109128.0, "step": 3819 }, { "entropy": 1.2225323617458344, "epoch": 2.0115850447604, "grad_norm": 0.2667352259159088, "learning_rate": 0.00017052099282855728, "loss": 0.1801188588142395, "mean_token_accuracy": 0.9245119541883469, "num_tokens": 47121464.0, "step": 3820 }, { "entropy": 1.2486798465251923, "epoch": 2.012111637704055, "grad_norm": 0.2779337465763092, "learning_rate": 0.00017050476108276095, "loss": 0.1984904706478119, "mean_token_accuracy": 0.9179847091436386, "num_tokens": 47133800.0, "step": 3821 }, { "entropy": 1.2059212625026703, "epoch": 2.0126382306477093, "grad_norm": 0.2828848659992218, "learning_rate": 0.0001704885257451496, "loss": 0.19344468414783478, "mean_token_accuracy": 0.9199190735816956, "num_tokens": 47146136.0, "step": 3822 }, { "entropy": 1.2063279151916504, "epoch": 2.0131648235913637, "grad_norm": 0.24573519825935364, "learning_rate": 0.000170472286816687, "loss": 0.17926183342933655, "mean_token_accuracy": 0.9242213070392609, "num_tokens": 47158472.0, "step": 3823 }, { "entropy": 1.2062674760818481, "epoch": 2.0136914165350186, "grad_norm": 0.2900843620300293, "learning_rate": 0.00017045604429833722, "loss": 0.18898425996303558, "mean_token_accuracy": 0.9269550293684006, "num_tokens": 47170808.0, "step": 3824 }, { "entropy": 1.2762680351734161, "epoch": 2.014218009478673, "grad_norm": 0.2975054979324341, "learning_rate": 0.00017043979819106447, "loss": 0.20459939539432526, "mean_token_accuracy": 0.918785035610199, "num_tokens": 47183144.0, "step": 3825 }, { "entropy": 1.257956087589264, "epoch": 2.0147446024223274, "grad_norm": 0.27851611375808716, "learning_rate": 0.00017042354849583312, "loss": 0.17341488599777222, "mean_token_accuracy": 0.9255774170160294, "num_tokens": 47195480.0, "step": 3826 }, { "entropy": 1.2822742462158203, "epoch": 2.0152711953659823, "grad_norm": 0.2700733244419098, "learning_rate": 0.0001704072952136079, "loss": 0.18918979167938232, "mean_token_accuracy": 0.921903595328331, "num_tokens": 47207816.0, "step": 3827 }, { "entropy": 1.26444673538208, "epoch": 2.0157977883096367, "grad_norm": 0.28335216641426086, "learning_rate": 0.00017039103834535366, "loss": 0.1854114681482315, "mean_token_accuracy": 0.9210407435894012, "num_tokens": 47220152.0, "step": 3828 }, { "entropy": 1.2844519019126892, "epoch": 2.016324381253291, "grad_norm": 0.291987806558609, "learning_rate": 0.00017037477789203545, "loss": 0.172478586435318, "mean_token_accuracy": 0.9290066659450531, "num_tokens": 47232488.0, "step": 3829 }, { "entropy": 1.1888793110847473, "epoch": 2.0168509741969456, "grad_norm": 0.2763528823852539, "learning_rate": 0.00017035851385461856, "loss": 0.1754818558692932, "mean_token_accuracy": 0.9284273386001587, "num_tokens": 47244824.0, "step": 3830 }, { "entropy": 1.2850163877010345, "epoch": 2.0173775671406005, "grad_norm": 0.2939310371875763, "learning_rate": 0.00017034224623406848, "loss": 0.1882777065038681, "mean_token_accuracy": 0.9187758266925812, "num_tokens": 47257160.0, "step": 3831 }, { "entropy": 1.278912514448166, "epoch": 2.017904160084255, "grad_norm": 0.26976412534713745, "learning_rate": 0.00017032597503135097, "loss": 0.18176186084747314, "mean_token_accuracy": 0.9222287982702255, "num_tokens": 47269496.0, "step": 3832 }, { "entropy": 1.2571650743484497, "epoch": 2.0184307530279093, "grad_norm": 0.2843485474586487, "learning_rate": 0.0001703097002474319, "loss": 0.1895454078912735, "mean_token_accuracy": 0.9216977059841156, "num_tokens": 47281832.0, "step": 3833 }, { "entropy": 1.239231675863266, "epoch": 2.018957345971564, "grad_norm": 0.2837580442428589, "learning_rate": 0.00017029342188327746, "loss": 0.18688803911209106, "mean_token_accuracy": 0.9240525960922241, "num_tokens": 47294168.0, "step": 3834 }, { "entropy": 1.199841469526291, "epoch": 2.0194839389152186, "grad_norm": 0.2625201344490051, "learning_rate": 0.00017027713993985399, "loss": 0.1796603798866272, "mean_token_accuracy": 0.9272690117359161, "num_tokens": 47306504.0, "step": 3835 }, { "entropy": 1.266678363084793, "epoch": 2.020010531858873, "grad_norm": 0.2874893844127655, "learning_rate": 0.00017026085441812803, "loss": 0.20230376720428467, "mean_token_accuracy": 0.9180373549461365, "num_tokens": 47318840.0, "step": 3836 }, { "entropy": 1.3089313209056854, "epoch": 2.0205371248025275, "grad_norm": 0.27973634004592896, "learning_rate": 0.00017024456531906636, "loss": 0.19552314281463623, "mean_token_accuracy": 0.9171228557825089, "num_tokens": 47331176.0, "step": 3837 }, { "entropy": 1.313205361366272, "epoch": 2.0210637177461823, "grad_norm": 0.2686075270175934, "learning_rate": 0.000170228272643636, "loss": 0.18762610852718353, "mean_token_accuracy": 0.9212076663970947, "num_tokens": 47343512.0, "step": 3838 }, { "entropy": 1.3670341670513153, "epoch": 2.0215903106898367, "grad_norm": 0.30073225498199463, "learning_rate": 0.00017021197639280412, "loss": 0.19591176509857178, "mean_token_accuracy": 0.9202536344528198, "num_tokens": 47355848.0, "step": 3839 }, { "entropy": 1.3341005444526672, "epoch": 2.022116903633491, "grad_norm": 0.26529407501220703, "learning_rate": 0.00017019567656753812, "loss": 0.1831834614276886, "mean_token_accuracy": 0.9253407269716263, "num_tokens": 47368184.0, "step": 3840 }, { "entropy": 1.3194755613803864, "epoch": 2.022643496577146, "grad_norm": 0.282293438911438, "learning_rate": 0.00017017937316880568, "loss": 0.20243722200393677, "mean_token_accuracy": 0.9165725558996201, "num_tokens": 47380520.0, "step": 3841 }, { "entropy": 1.4211511313915253, "epoch": 2.0231700895208005, "grad_norm": 0.29805392026901245, "learning_rate": 0.0001701630661975746, "loss": 0.18482814729213715, "mean_token_accuracy": 0.9222871661186218, "num_tokens": 47392856.0, "step": 3842 }, { "entropy": 1.3491427600383759, "epoch": 2.023696682464455, "grad_norm": 0.2905563414096832, "learning_rate": 0.00017014675565481293, "loss": 0.20305126905441284, "mean_token_accuracy": 0.9208891540765762, "num_tokens": 47405192.0, "step": 3843 }, { "entropy": 1.3559309840202332, "epoch": 2.0242232754081093, "grad_norm": 0.2943587005138397, "learning_rate": 0.00017013044154148894, "loss": 0.1753818392753601, "mean_token_accuracy": 0.9277485013008118, "num_tokens": 47417528.0, "step": 3844 }, { "entropy": 1.3276709914207458, "epoch": 2.024749868351764, "grad_norm": 0.29700222611427307, "learning_rate": 0.00017011412385857112, "loss": 0.2055238038301468, "mean_token_accuracy": 0.9166817218065262, "num_tokens": 47429864.0, "step": 3845 }, { "entropy": 1.298693597316742, "epoch": 2.0252764612954186, "grad_norm": 0.2802084982395172, "learning_rate": 0.00017009780260702812, "loss": 0.19370201230049133, "mean_token_accuracy": 0.9228375554084778, "num_tokens": 47442200.0, "step": 3846 }, { "entropy": 1.3408599495887756, "epoch": 2.025803054239073, "grad_norm": 0.28054699301719666, "learning_rate": 0.00017008147778782885, "loss": 0.18260030448436737, "mean_token_accuracy": 0.9232022166252136, "num_tokens": 47454536.0, "step": 3847 }, { "entropy": 1.2663397789001465, "epoch": 2.026329647182728, "grad_norm": 0.25765085220336914, "learning_rate": 0.00017006514940194246, "loss": 0.18359926342964172, "mean_token_accuracy": 0.9257479310035706, "num_tokens": 47466872.0, "step": 3848 }, { "entropy": 1.316208690404892, "epoch": 2.0268562401263823, "grad_norm": 0.2987428605556488, "learning_rate": 0.0001700488174503382, "loss": 0.19594340026378632, "mean_token_accuracy": 0.9216845035552979, "num_tokens": 47479208.0, "step": 3849 }, { "entropy": 1.3389540016651154, "epoch": 2.0273828330700367, "grad_norm": 0.27578049898147583, "learning_rate": 0.00017003248193398564, "loss": 0.19140341877937317, "mean_token_accuracy": 0.9192010909318924, "num_tokens": 47491544.0, "step": 3850 }, { "entropy": 1.3227673172950745, "epoch": 2.0279094260136916, "grad_norm": 0.2912873327732086, "learning_rate": 0.00017001614285385455, "loss": 0.20706209540367126, "mean_token_accuracy": 0.9152367115020752, "num_tokens": 47503880.0, "step": 3851 }, { "entropy": 1.2799009382724762, "epoch": 2.028436018957346, "grad_norm": 0.2770322561264038, "learning_rate": 0.00016999980021091483, "loss": 0.19841603934764862, "mean_token_accuracy": 0.9199351519346237, "num_tokens": 47516216.0, "step": 3852 }, { "entropy": 1.3126654028892517, "epoch": 2.0289626119010005, "grad_norm": 0.3020882308483124, "learning_rate": 0.0001699834540061367, "loss": 0.20801658928394318, "mean_token_accuracy": 0.9128816872835159, "num_tokens": 47528552.0, "step": 3853 }, { "entropy": 1.2508117258548737, "epoch": 2.029489204844655, "grad_norm": 0.24238452315330505, "learning_rate": 0.00016996710424049051, "loss": 0.1554844081401825, "mean_token_accuracy": 0.9381654858589172, "num_tokens": 47540888.0, "step": 3854 }, { "entropy": 1.278584361076355, "epoch": 2.0300157977883098, "grad_norm": 0.26651400327682495, "learning_rate": 0.00016995075091494685, "loss": 0.18668919801712036, "mean_token_accuracy": 0.9253730177879333, "num_tokens": 47553224.0, "step": 3855 }, { "entropy": 1.2722339630126953, "epoch": 2.030542390731964, "grad_norm": 0.285241037607193, "learning_rate": 0.00016993439403047652, "loss": 0.21573114395141602, "mean_token_accuracy": 0.9168124496936798, "num_tokens": 47565560.0, "step": 3856 }, { "entropy": 1.2240016758441925, "epoch": 2.0310689836756186, "grad_norm": 0.2548234760761261, "learning_rate": 0.00016991803358805058, "loss": 0.1847495436668396, "mean_token_accuracy": 0.9236398935317993, "num_tokens": 47577896.0, "step": 3857 }, { "entropy": 1.2316696643829346, "epoch": 2.0315955766192735, "grad_norm": 0.28398963809013367, "learning_rate": 0.00016990166958864015, "loss": 0.19505375623703003, "mean_token_accuracy": 0.9168769717216492, "num_tokens": 47590232.0, "step": 3858 }, { "entropy": 1.1961296796798706, "epoch": 2.032122169562928, "grad_norm": 0.27527958154678345, "learning_rate": 0.0001698853020332168, "loss": 0.17813697457313538, "mean_token_accuracy": 0.9261271953582764, "num_tokens": 47602568.0, "step": 3859 }, { "entropy": 1.273693025112152, "epoch": 2.0326487625065823, "grad_norm": 0.3149412274360657, "learning_rate": 0.00016986893092275205, "loss": 0.1986011564731598, "mean_token_accuracy": 0.922387108206749, "num_tokens": 47614904.0, "step": 3860 }, { "entropy": 1.2812358438968658, "epoch": 2.0331753554502368, "grad_norm": 0.2717421352863312, "learning_rate": 0.00016985255625821783, "loss": 0.1849009394645691, "mean_token_accuracy": 0.9245787113904953, "num_tokens": 47627240.0, "step": 3861 }, { "entropy": 1.2583646178245544, "epoch": 2.0337019483938916, "grad_norm": 0.26972222328186035, "learning_rate": 0.0001698361780405862, "loss": 0.18644441664218903, "mean_token_accuracy": 0.920393168926239, "num_tokens": 47639576.0, "step": 3862 }, { "entropy": 1.2793927788734436, "epoch": 2.034228541337546, "grad_norm": 0.2913520932197571, "learning_rate": 0.00016981979627082945, "loss": 0.17899954319000244, "mean_token_accuracy": 0.9248150438070297, "num_tokens": 47651912.0, "step": 3863 }, { "entropy": 1.2246437966823578, "epoch": 2.0347551342812005, "grad_norm": 0.2871529757976532, "learning_rate": 0.00016980341094992004, "loss": 0.19482392072677612, "mean_token_accuracy": 0.9184932112693787, "num_tokens": 47664248.0, "step": 3864 }, { "entropy": 1.1911917328834534, "epoch": 2.0352817272248553, "grad_norm": 0.2914022207260132, "learning_rate": 0.00016978702207883065, "loss": 0.19326715171337128, "mean_token_accuracy": 0.9233204275369644, "num_tokens": 47676584.0, "step": 3865 }, { "entropy": 1.2744377553462982, "epoch": 2.0358083201685098, "grad_norm": 0.26885589957237244, "learning_rate": 0.00016977062965853427, "loss": 0.19482609629631042, "mean_token_accuracy": 0.9205097407102585, "num_tokens": 47688920.0, "step": 3866 }, { "entropy": 1.2833932042121887, "epoch": 2.036334913112164, "grad_norm": 0.2556898295879364, "learning_rate": 0.00016975423369000394, "loss": 0.17208848893642426, "mean_token_accuracy": 0.929677814245224, "num_tokens": 47701256.0, "step": 3867 }, { "entropy": 1.297087401151657, "epoch": 2.036861506055819, "grad_norm": 0.2650216519832611, "learning_rate": 0.00016973783417421304, "loss": 0.18926797807216644, "mean_token_accuracy": 0.9191234409809113, "num_tokens": 47713592.0, "step": 3868 }, { "entropy": 1.2456922829151154, "epoch": 2.0373880989994735, "grad_norm": 0.2747442424297333, "learning_rate": 0.00016972143111213512, "loss": 0.19703906774520874, "mean_token_accuracy": 0.9198992401361465, "num_tokens": 47725928.0, "step": 3869 }, { "entropy": 1.330556869506836, "epoch": 2.037914691943128, "grad_norm": 0.2835814356803894, "learning_rate": 0.0001697050245047439, "loss": 0.18732693791389465, "mean_token_accuracy": 0.9204771220684052, "num_tokens": 47738264.0, "step": 3870 }, { "entropy": 1.304270088672638, "epoch": 2.0384412848867823, "grad_norm": 0.27201247215270996, "learning_rate": 0.00016968861435301337, "loss": 0.18724404275417328, "mean_token_accuracy": 0.921107143163681, "num_tokens": 47750600.0, "step": 3871 }, { "entropy": 1.230264812707901, "epoch": 2.038967877830437, "grad_norm": 0.2530989646911621, "learning_rate": 0.0001696722006579177, "loss": 0.17592748999595642, "mean_token_accuracy": 0.9254534393548965, "num_tokens": 47762936.0, "step": 3872 }, { "entropy": 1.2308352589607239, "epoch": 2.0394944707740916, "grad_norm": 0.2694772779941559, "learning_rate": 0.00016965578342043126, "loss": 0.19067507982254028, "mean_token_accuracy": 0.9236868768930435, "num_tokens": 47775272.0, "step": 3873 }, { "entropy": 1.291840374469757, "epoch": 2.040021063717746, "grad_norm": 0.2618374228477478, "learning_rate": 0.00016963936264152867, "loss": 0.18578636646270752, "mean_token_accuracy": 0.9224181473255157, "num_tokens": 47787608.0, "step": 3874 }, { "entropy": 1.2792740166187286, "epoch": 2.040547656661401, "grad_norm": 0.2911253571510315, "learning_rate": 0.0001696229383221847, "loss": 0.20944932103157043, "mean_token_accuracy": 0.9135683476924896, "num_tokens": 47799944.0, "step": 3875 }, { "entropy": 1.3030252158641815, "epoch": 2.0410742496050553, "grad_norm": 0.2904371917247772, "learning_rate": 0.0001696065104633744, "loss": 0.20830057561397552, "mean_token_accuracy": 0.9120756387710571, "num_tokens": 47812280.0, "step": 3876 }, { "entropy": 1.2803774774074554, "epoch": 2.0416008425487098, "grad_norm": 0.2760698199272156, "learning_rate": 0.00016959007906607303, "loss": 0.19493544101715088, "mean_token_accuracy": 0.9187896698713303, "num_tokens": 47824616.0, "step": 3877 }, { "entropy": 1.2554866671562195, "epoch": 2.042127435492364, "grad_norm": 0.4330475926399231, "learning_rate": 0.00016957364413125594, "loss": 0.18488185107707977, "mean_token_accuracy": 0.9197061508893967, "num_tokens": 47836952.0, "step": 3878 }, { "entropy": 1.3076776266098022, "epoch": 2.042654028436019, "grad_norm": 0.2841300964355469, "learning_rate": 0.00016955720565989884, "loss": 0.19156453013420105, "mean_token_accuracy": 0.9239335805177689, "num_tokens": 47849288.0, "step": 3879 }, { "entropy": 1.3151583969593048, "epoch": 2.0431806213796735, "grad_norm": 0.2921697199344635, "learning_rate": 0.00016954076365297758, "loss": 0.2065403163433075, "mean_token_accuracy": 0.9110155552625656, "num_tokens": 47861624.0, "step": 3880 }, { "entropy": 1.2858489751815796, "epoch": 2.043707214323328, "grad_norm": 0.27680060267448425, "learning_rate": 0.00016952431811146818, "loss": 0.19812069833278656, "mean_token_accuracy": 0.9194805026054382, "num_tokens": 47873960.0, "step": 3881 }, { "entropy": 1.3400939404964447, "epoch": 2.044233807266983, "grad_norm": 0.29581987857818604, "learning_rate": 0.00016950786903634696, "loss": 0.19464778900146484, "mean_token_accuracy": 0.920210674405098, "num_tokens": 47886296.0, "step": 3882 }, { "entropy": 1.3481502830982208, "epoch": 2.044760400210637, "grad_norm": 0.3192988634109497, "learning_rate": 0.0001694914164285904, "loss": 0.20431135594844818, "mean_token_accuracy": 0.918129950761795, "num_tokens": 47898632.0, "step": 3883 }, { "entropy": 1.212340623140335, "epoch": 2.0452869931542916, "grad_norm": 0.23157627880573273, "learning_rate": 0.00016947496028917516, "loss": 0.17617271840572357, "mean_token_accuracy": 0.9243680238723755, "num_tokens": 47910968.0, "step": 3884 }, { "entropy": 1.2161346971988678, "epoch": 2.0458135860979465, "grad_norm": 0.2513905167579651, "learning_rate": 0.0001694585006190782, "loss": 0.1802637130022049, "mean_token_accuracy": 0.924398884177208, "num_tokens": 47923304.0, "step": 3885 }, { "entropy": 1.3086143136024475, "epoch": 2.046340179041601, "grad_norm": 0.2897863984107971, "learning_rate": 0.00016944203741927662, "loss": 0.20457464456558228, "mean_token_accuracy": 0.9144063889980316, "num_tokens": 47935640.0, "step": 3886 }, { "entropy": 1.2356386482715607, "epoch": 2.0468667719852554, "grad_norm": 0.26771265268325806, "learning_rate": 0.00016942557069074768, "loss": 0.17813019454479218, "mean_token_accuracy": 0.9241292774677277, "num_tokens": 47947976.0, "step": 3887 }, { "entropy": 1.3301630318164825, "epoch": 2.0473933649289098, "grad_norm": 0.27502498030662537, "learning_rate": 0.000169409100434469, "loss": 0.20527851581573486, "mean_token_accuracy": 0.9159713387489319, "num_tokens": 47960312.0, "step": 3888 }, { "entropy": 1.2828874289989471, "epoch": 2.0479199578725646, "grad_norm": 0.261263370513916, "learning_rate": 0.00016939262665141832, "loss": 0.19007109105587006, "mean_token_accuracy": 0.9201304614543915, "num_tokens": 47972648.0, "step": 3889 }, { "entropy": 1.3016537725925446, "epoch": 2.048446550816219, "grad_norm": 0.2682885527610779, "learning_rate": 0.00016937614934257354, "loss": 0.1853100210428238, "mean_token_accuracy": 0.9268095791339874, "num_tokens": 47984984.0, "step": 3890 }, { "entropy": 1.2769020199775696, "epoch": 2.0489731437598735, "grad_norm": 0.2722259759902954, "learning_rate": 0.00016935966850891283, "loss": 0.20796817541122437, "mean_token_accuracy": 0.9139941036701202, "num_tokens": 47997320.0, "step": 3891 }, { "entropy": 1.258107304573059, "epoch": 2.0494997367035284, "grad_norm": 0.25843435525894165, "learning_rate": 0.00016934318415141457, "loss": 0.16999708116054535, "mean_token_accuracy": 0.9257606714963913, "num_tokens": 48009656.0, "step": 3892 }, { "entropy": 1.1906676590442657, "epoch": 2.050026329647183, "grad_norm": 0.2513735890388489, "learning_rate": 0.00016932669627105738, "loss": 0.1697864979505539, "mean_token_accuracy": 0.925465926527977, "num_tokens": 48021992.0, "step": 3893 }, { "entropy": 1.2723312675952911, "epoch": 2.050552922590837, "grad_norm": 0.2743954062461853, "learning_rate": 0.00016931020486881998, "loss": 0.18033276498317719, "mean_token_accuracy": 0.9286290258169174, "num_tokens": 48034328.0, "step": 3894 }, { "entropy": 1.2819771468639374, "epoch": 2.0510795155344916, "grad_norm": 0.29130327701568604, "learning_rate": 0.00016929370994568142, "loss": 0.1982630491256714, "mean_token_accuracy": 0.9166873097419739, "num_tokens": 48046664.0, "step": 3895 }, { "entropy": 1.2571477890014648, "epoch": 2.0516061084781465, "grad_norm": 0.27202513813972473, "learning_rate": 0.00016927721150262088, "loss": 0.18936115503311157, "mean_token_accuracy": 0.9197106510400772, "num_tokens": 48059000.0, "step": 3896 }, { "entropy": 1.3048891425132751, "epoch": 2.052132701421801, "grad_norm": 0.27362993359565735, "learning_rate": 0.00016926070954061782, "loss": 0.19029444456100464, "mean_token_accuracy": 0.9229496270418167, "num_tokens": 48071336.0, "step": 3897 }, { "entropy": 1.2617215812206268, "epoch": 2.0526592943654554, "grad_norm": 0.28144410252571106, "learning_rate": 0.00016924420406065177, "loss": 0.18220680952072144, "mean_token_accuracy": 0.9252916872501373, "num_tokens": 48083672.0, "step": 3898 }, { "entropy": 1.2789317965507507, "epoch": 2.0531858873091102, "grad_norm": 0.2608755826950073, "learning_rate": 0.00016922769506370268, "loss": 0.18006981909275055, "mean_token_accuracy": 0.9222934991121292, "num_tokens": 48096008.0, "step": 3899 }, { "entropy": 1.22543865442276, "epoch": 2.0537124802527646, "grad_norm": 0.27741050720214844, "learning_rate": 0.00016921118255075053, "loss": 0.1895115077495575, "mean_token_accuracy": 0.9215471893548965, "num_tokens": 48108344.0, "step": 3900 }, { "entropy": 1.2530005872249603, "epoch": 2.054239073196419, "grad_norm": 0.2714971899986267, "learning_rate": 0.00016919466652277556, "loss": 0.1776505410671234, "mean_token_accuracy": 0.9273561537265778, "num_tokens": 48120680.0, "step": 3901 }, { "entropy": 1.2720350325107574, "epoch": 2.0547656661400735, "grad_norm": 0.26950451731681824, "learning_rate": 0.00016917814698075827, "loss": 0.19353142380714417, "mean_token_accuracy": 0.9203890562057495, "num_tokens": 48133016.0, "step": 3902 }, { "entropy": 1.2247913479804993, "epoch": 2.0552922590837284, "grad_norm": 0.2836177945137024, "learning_rate": 0.0001691616239256793, "loss": 0.19141322374343872, "mean_token_accuracy": 0.9200913459062576, "num_tokens": 48145352.0, "step": 3903 }, { "entropy": 1.2887300550937653, "epoch": 2.055818852027383, "grad_norm": 0.2868979275226593, "learning_rate": 0.00016914509735851954, "loss": 0.20681561529636383, "mean_token_accuracy": 0.9199369102716446, "num_tokens": 48157688.0, "step": 3904 }, { "entropy": 1.2575041055679321, "epoch": 2.056345444971037, "grad_norm": 0.26332929730415344, "learning_rate": 0.00016912856728026006, "loss": 0.18368637561798096, "mean_token_accuracy": 0.9240716248750687, "num_tokens": 48170024.0, "step": 3905 }, { "entropy": 1.2432773113250732, "epoch": 2.056872037914692, "grad_norm": 0.29000067710876465, "learning_rate": 0.0001691120336918822, "loss": 0.20695710182189941, "mean_token_accuracy": 0.9119783192873001, "num_tokens": 48182360.0, "step": 3906 }, { "entropy": 1.2723545730113983, "epoch": 2.0573986308583465, "grad_norm": 0.2832140624523163, "learning_rate": 0.0001690954965943674, "loss": 0.19655488431453705, "mean_token_accuracy": 0.9173429161310196, "num_tokens": 48194696.0, "step": 3907 }, { "entropy": 1.3194984793663025, "epoch": 2.057925223802001, "grad_norm": 0.280369371175766, "learning_rate": 0.00016907895598869743, "loss": 0.18848003447055817, "mean_token_accuracy": 0.9231791347265244, "num_tokens": 48207032.0, "step": 3908 }, { "entropy": 1.2152039706707, "epoch": 2.058451816745656, "grad_norm": 0.2655313014984131, "learning_rate": 0.00016906241187585416, "loss": 0.19103647768497467, "mean_token_accuracy": 0.9197648912668228, "num_tokens": 48219368.0, "step": 3909 }, { "entropy": 1.2087748050689697, "epoch": 2.0589784096893102, "grad_norm": 0.26991021633148193, "learning_rate": 0.00016904586425681975, "loss": 0.18405042588710785, "mean_token_accuracy": 0.9230748862028122, "num_tokens": 48231704.0, "step": 3910 }, { "entropy": 1.2276612520217896, "epoch": 2.0595050026329647, "grad_norm": 0.2636072337627411, "learning_rate": 0.00016902931313257652, "loss": 0.1714887022972107, "mean_token_accuracy": 0.928344801068306, "num_tokens": 48244040.0, "step": 3911 }, { "entropy": 1.2997864484786987, "epoch": 2.060031595576619, "grad_norm": 0.29149720072746277, "learning_rate": 0.00016901275850410703, "loss": 0.19735336303710938, "mean_token_accuracy": 0.9174995422363281, "num_tokens": 48256376.0, "step": 3912 }, { "entropy": 1.2492857873439789, "epoch": 2.060558188520274, "grad_norm": 0.2696395218372345, "learning_rate": 0.00016899620037239398, "loss": 0.18676462769508362, "mean_token_accuracy": 0.9226437360048294, "num_tokens": 48268712.0, "step": 3913 }, { "entropy": 1.2569607198238373, "epoch": 2.0610847814639284, "grad_norm": 0.28245505690574646, "learning_rate": 0.00016897963873842043, "loss": 0.20712406933307648, "mean_token_accuracy": 0.9177358150482178, "num_tokens": 48281048.0, "step": 3914 }, { "entropy": 1.2320314943790436, "epoch": 2.061611374407583, "grad_norm": 0.28270742297172546, "learning_rate": 0.00016896307360316943, "loss": 0.19076888263225555, "mean_token_accuracy": 0.9220731556415558, "num_tokens": 48293384.0, "step": 3915 }, { "entropy": 1.3260917365550995, "epoch": 2.0621379673512377, "grad_norm": 0.2971607744693756, "learning_rate": 0.00016894650496762444, "loss": 0.19012241065502167, "mean_token_accuracy": 0.9222848564386368, "num_tokens": 48305720.0, "step": 3916 }, { "entropy": 1.2801413834095001, "epoch": 2.062664560294892, "grad_norm": 0.30607089400291443, "learning_rate": 0.00016892993283276902, "loss": 0.20878365635871887, "mean_token_accuracy": 0.9175769686698914, "num_tokens": 48318056.0, "step": 3917 }, { "entropy": 1.3265896141529083, "epoch": 2.0631911532385465, "grad_norm": 0.30750954151153564, "learning_rate": 0.00016891335719958697, "loss": 0.18873047828674316, "mean_token_accuracy": 0.920640304684639, "num_tokens": 48330392.0, "step": 3918 }, { "entropy": 1.350228101015091, "epoch": 2.063717746182201, "grad_norm": 0.2853001654148102, "learning_rate": 0.00016889677806906225, "loss": 0.18502716720104218, "mean_token_accuracy": 0.9253284931182861, "num_tokens": 48342728.0, "step": 3919 }, { "entropy": 1.2163171470165253, "epoch": 2.064244339125856, "grad_norm": 0.24412177503108978, "learning_rate": 0.0001688801954421791, "loss": 0.16768863797187805, "mean_token_accuracy": 0.9300560504198074, "num_tokens": 48355064.0, "step": 3920 }, { "entropy": 1.3360876441001892, "epoch": 2.0647709320695102, "grad_norm": 0.27784374356269836, "learning_rate": 0.00016886360931992194, "loss": 0.1872931867837906, "mean_token_accuracy": 0.9237985759973526, "num_tokens": 48367400.0, "step": 3921 }, { "entropy": 1.243847370147705, "epoch": 2.0652975250131647, "grad_norm": 0.28875452280044556, "learning_rate": 0.00016884701970327538, "loss": 0.19071172177791595, "mean_token_accuracy": 0.9176552146673203, "num_tokens": 48379736.0, "step": 3922 }, { "entropy": 1.3042690753936768, "epoch": 2.0658241179568195, "grad_norm": 0.289671927690506, "learning_rate": 0.0001688304265932242, "loss": 0.20444759726524353, "mean_token_accuracy": 0.9158494174480438, "num_tokens": 48392072.0, "step": 3923 }, { "entropy": 1.271407037973404, "epoch": 2.066350710900474, "grad_norm": 0.296796977519989, "learning_rate": 0.00016881382999075353, "loss": 0.1858009397983551, "mean_token_accuracy": 0.920338898897171, "num_tokens": 48404408.0, "step": 3924 }, { "entropy": 1.282002031803131, "epoch": 2.0668773038441284, "grad_norm": 0.27760758996009827, "learning_rate": 0.00016879722989684854, "loss": 0.198472797870636, "mean_token_accuracy": 0.9221088290214539, "num_tokens": 48416744.0, "step": 3925 }, { "entropy": 1.2682355344295502, "epoch": 2.0674038967877832, "grad_norm": 0.25768402218818665, "learning_rate": 0.00016878062631249473, "loss": 0.1786102056503296, "mean_token_accuracy": 0.9221510291099548, "num_tokens": 48429080.0, "step": 3926 }, { "entropy": 1.2786115109920502, "epoch": 2.0679304897314377, "grad_norm": 0.27482444047927856, "learning_rate": 0.0001687640192386777, "loss": 0.1859729140996933, "mean_token_accuracy": 0.9208211004734039, "num_tokens": 48441416.0, "step": 3927 }, { "entropy": 1.258926510810852, "epoch": 2.068457082675092, "grad_norm": 0.28567978739738464, "learning_rate": 0.00016874740867638339, "loss": 0.18969936668872833, "mean_token_accuracy": 0.9214884340763092, "num_tokens": 48453752.0, "step": 3928 }, { "entropy": 1.2364517748355865, "epoch": 2.0689836756187465, "grad_norm": 0.26859763264656067, "learning_rate": 0.00016873079462659783, "loss": 0.19034039974212646, "mean_token_accuracy": 0.9214574694633484, "num_tokens": 48466088.0, "step": 3929 }, { "entropy": 1.2525107264518738, "epoch": 2.0695102685624014, "grad_norm": 0.28058695793151855, "learning_rate": 0.00016871417709030727, "loss": 0.18607176840305328, "mean_token_accuracy": 0.9215060919523239, "num_tokens": 48478424.0, "step": 3930 }, { "entropy": 1.2619339525699615, "epoch": 2.070036861506056, "grad_norm": 0.2828121781349182, "learning_rate": 0.00016869755606849826, "loss": 0.18340539932250977, "mean_token_accuracy": 0.9251066595315933, "num_tokens": 48490760.0, "step": 3931 }, { "entropy": 1.2884092330932617, "epoch": 2.0705634544497102, "grad_norm": 0.26471489667892456, "learning_rate": 0.00016868093156215743, "loss": 0.17937590181827545, "mean_token_accuracy": 0.9243820607662201, "num_tokens": 48503096.0, "step": 3932 }, { "entropy": 1.2739530205726624, "epoch": 2.071090047393365, "grad_norm": 0.26046693325042725, "learning_rate": 0.00016866430357227177, "loss": 0.1955185979604721, "mean_token_accuracy": 0.9210577309131622, "num_tokens": 48515432.0, "step": 3933 }, { "entropy": 1.2842492163181305, "epoch": 2.0716166403370195, "grad_norm": 0.29395169019699097, "learning_rate": 0.00016864767209982825, "loss": 0.21026445925235748, "mean_token_accuracy": 0.9173175990581512, "num_tokens": 48527768.0, "step": 3934 }, { "entropy": 1.2743287682533264, "epoch": 2.072143233280674, "grad_norm": 0.272370845079422, "learning_rate": 0.00016863103714581432, "loss": 0.1986452043056488, "mean_token_accuracy": 0.9205825477838516, "num_tokens": 48540104.0, "step": 3935 }, { "entropy": 1.2706570327281952, "epoch": 2.0726698262243284, "grad_norm": 0.2720491588115692, "learning_rate": 0.00016861439871121743, "loss": 0.17972148954868317, "mean_token_accuracy": 0.9210758358240128, "num_tokens": 48552440.0, "step": 3936 }, { "entropy": 1.2344097197055817, "epoch": 2.0731964191679833, "grad_norm": 0.261137992143631, "learning_rate": 0.0001685977567970253, "loss": 0.18583646416664124, "mean_token_accuracy": 0.9242785274982452, "num_tokens": 48564776.0, "step": 3937 }, { "entropy": 1.2211202681064606, "epoch": 2.0737230121116377, "grad_norm": 0.2840760350227356, "learning_rate": 0.0001685811114042259, "loss": 0.18876339495182037, "mean_token_accuracy": 0.9212382435798645, "num_tokens": 48577112.0, "step": 3938 }, { "entropy": 1.2502583861351013, "epoch": 2.074249605055292, "grad_norm": 0.27275213599205017, "learning_rate": 0.00016856446253380735, "loss": 0.1872887909412384, "mean_token_accuracy": 0.923475593328476, "num_tokens": 48589448.0, "step": 3939 }, { "entropy": 1.2701627314090729, "epoch": 2.074776197998947, "grad_norm": 0.2745870053768158, "learning_rate": 0.00016854781018675797, "loss": 0.18436497449874878, "mean_token_accuracy": 0.9266326576471329, "num_tokens": 48601784.0, "step": 3940 }, { "entropy": 1.2546738684177399, "epoch": 2.0753027909426014, "grad_norm": 0.2822677195072174, "learning_rate": 0.0001685311543640664, "loss": 0.1884290874004364, "mean_token_accuracy": 0.9195769876241684, "num_tokens": 48614120.0, "step": 3941 }, { "entropy": 1.2545583546161652, "epoch": 2.075829383886256, "grad_norm": 0.2970985174179077, "learning_rate": 0.0001685144950667213, "loss": 0.19396939873695374, "mean_token_accuracy": 0.9214707016944885, "num_tokens": 48626456.0, "step": 3942 }, { "entropy": 1.243100881576538, "epoch": 2.0763559768299107, "grad_norm": 0.25157052278518677, "learning_rate": 0.0001684978322957117, "loss": 0.17563554644584656, "mean_token_accuracy": 0.9291206002235413, "num_tokens": 48638792.0, "step": 3943 }, { "entropy": 1.2628869712352753, "epoch": 2.076882569773565, "grad_norm": 0.2984946072101593, "learning_rate": 0.00016848116605202673, "loss": 0.20061740279197693, "mean_token_accuracy": 0.9180862903594971, "num_tokens": 48651128.0, "step": 3944 }, { "entropy": 1.3347080945968628, "epoch": 2.0774091627172195, "grad_norm": 0.3006715476512909, "learning_rate": 0.00016846449633665578, "loss": 0.18334859609603882, "mean_token_accuracy": 0.9282584637403488, "num_tokens": 48663464.0, "step": 3945 }, { "entropy": 1.2688239216804504, "epoch": 2.077935755660874, "grad_norm": 0.26901793479919434, "learning_rate": 0.00016844782315058847, "loss": 0.1989820897579193, "mean_token_accuracy": 0.9150257855653763, "num_tokens": 48675800.0, "step": 3946 }, { "entropy": 1.265367865562439, "epoch": 2.078462348604529, "grad_norm": 0.29596784710884094, "learning_rate": 0.00016843114649481452, "loss": 0.20104429125785828, "mean_token_accuracy": 0.9207267761230469, "num_tokens": 48688136.0, "step": 3947 }, { "entropy": 1.267877608537674, "epoch": 2.0789889415481833, "grad_norm": 0.29306116700172424, "learning_rate": 0.00016841446637032396, "loss": 0.20623625814914703, "mean_token_accuracy": 0.9133555591106415, "num_tokens": 48700472.0, "step": 3948 }, { "entropy": 1.2642518281936646, "epoch": 2.0795155344918377, "grad_norm": 0.2690291404724121, "learning_rate": 0.00016839778277810702, "loss": 0.181110218167305, "mean_token_accuracy": 0.9257129430770874, "num_tokens": 48712808.0, "step": 3949 }, { "entropy": 1.3663403391838074, "epoch": 2.0800421274354925, "grad_norm": 0.29609712958335876, "learning_rate": 0.0001683810957191541, "loss": 0.19982632994651794, "mean_token_accuracy": 0.9155548959970474, "num_tokens": 48725144.0, "step": 3950 }, { "entropy": 1.3063276708126068, "epoch": 2.080568720379147, "grad_norm": 0.2549259066581726, "learning_rate": 0.0001683644051944558, "loss": 0.16801197826862335, "mean_token_accuracy": 0.928315594792366, "num_tokens": 48737480.0, "step": 3951 }, { "entropy": 1.3074188232421875, "epoch": 2.0810953133228014, "grad_norm": 0.2865307331085205, "learning_rate": 0.0001683477112050029, "loss": 0.1887558102607727, "mean_token_accuracy": 0.9195426404476166, "num_tokens": 48749816.0, "step": 3952 }, { "entropy": 1.3835014998912811, "epoch": 2.081621906266456, "grad_norm": 0.27939164638519287, "learning_rate": 0.0001683310137517865, "loss": 0.1879327893257141, "mean_token_accuracy": 0.9196098446846008, "num_tokens": 48762152.0, "step": 3953 }, { "entropy": 1.4062438309192657, "epoch": 2.0821484992101107, "grad_norm": 0.3003182113170624, "learning_rate": 0.00016831431283579777, "loss": 0.20012448728084564, "mean_token_accuracy": 0.9185905754566193, "num_tokens": 48774488.0, "step": 3954 }, { "entropy": 1.3671795129776, "epoch": 2.082675092153765, "grad_norm": 0.2660031318664551, "learning_rate": 0.0001682976084580282, "loss": 0.19102323055267334, "mean_token_accuracy": 0.919410839676857, "num_tokens": 48786824.0, "step": 3955 }, { "entropy": 1.325892060995102, "epoch": 2.0832016850974195, "grad_norm": 0.2605104148387909, "learning_rate": 0.00016828090061946934, "loss": 0.18359193205833435, "mean_token_accuracy": 0.9214528203010559, "num_tokens": 48799160.0, "step": 3956 }, { "entropy": 1.3484356999397278, "epoch": 2.0837282780410744, "grad_norm": 0.2751688063144684, "learning_rate": 0.00016826418932111315, "loss": 0.18124142289161682, "mean_token_accuracy": 0.9217920154333115, "num_tokens": 48811496.0, "step": 3957 }, { "entropy": 1.3338854312896729, "epoch": 2.084254870984729, "grad_norm": 0.26002514362335205, "learning_rate": 0.0001682474745639516, "loss": 0.166397824883461, "mean_token_accuracy": 0.9286703169345856, "num_tokens": 48823832.0, "step": 3958 }, { "entropy": 1.3630346655845642, "epoch": 2.0847814639283833, "grad_norm": 0.28807926177978516, "learning_rate": 0.00016823075634897697, "loss": 0.1959732472896576, "mean_token_accuracy": 0.9200254678726196, "num_tokens": 48836168.0, "step": 3959 }, { "entropy": 1.3884229063987732, "epoch": 2.085308056872038, "grad_norm": 0.2943662405014038, "learning_rate": 0.00016821403467718178, "loss": 0.18066152930259705, "mean_token_accuracy": 0.9316907674074173, "num_tokens": 48848504.0, "step": 3960 }, { "entropy": 1.3363731503486633, "epoch": 2.0858346498156926, "grad_norm": 0.3065935969352722, "learning_rate": 0.0001681973095495586, "loss": 0.2028815746307373, "mean_token_accuracy": 0.9201863408088684, "num_tokens": 48860840.0, "step": 3961 }, { "entropy": 1.3781720399856567, "epoch": 2.086361242759347, "grad_norm": 0.3044969141483307, "learning_rate": 0.00016818058096710036, "loss": 0.2023879587650299, "mean_token_accuracy": 0.9209664463996887, "num_tokens": 48873176.0, "step": 3962 }, { "entropy": 1.3339049518108368, "epoch": 2.0868878357030014, "grad_norm": 0.3165450692176819, "learning_rate": 0.00016816384893080012, "loss": 0.2043043076992035, "mean_token_accuracy": 0.9149027913808823, "num_tokens": 48885512.0, "step": 3963 }, { "entropy": 1.3235175609588623, "epoch": 2.0874144286466563, "grad_norm": 0.2820136845111847, "learning_rate": 0.0001681471134416512, "loss": 0.18209639191627502, "mean_token_accuracy": 0.9246355444192886, "num_tokens": 48897848.0, "step": 3964 }, { "entropy": 1.3395156562328339, "epoch": 2.0879410215903107, "grad_norm": 0.45867112278938293, "learning_rate": 0.00016813037450064705, "loss": 0.19053226709365845, "mean_token_accuracy": 0.9275738596916199, "num_tokens": 48910184.0, "step": 3965 }, { "entropy": 1.3038859367370605, "epoch": 2.088467614533965, "grad_norm": 0.28860345482826233, "learning_rate": 0.00016811363210878137, "loss": 0.21587130427360535, "mean_token_accuracy": 0.9093978554010391, "num_tokens": 48922520.0, "step": 3966 }, { "entropy": 1.2706226110458374, "epoch": 2.08899420747762, "grad_norm": 0.281698077917099, "learning_rate": 0.0001680968862670481, "loss": 0.1824536919593811, "mean_token_accuracy": 0.9227961152791977, "num_tokens": 48934856.0, "step": 3967 }, { "entropy": 1.30519899725914, "epoch": 2.0895208004212744, "grad_norm": 0.28888365626335144, "learning_rate": 0.00016808013697644126, "loss": 0.19047529995441437, "mean_token_accuracy": 0.9213353842496872, "num_tokens": 48947192.0, "step": 3968 }, { "entropy": 1.3129478991031647, "epoch": 2.090047393364929, "grad_norm": 0.30279576778411865, "learning_rate": 0.00016806338423795524, "loss": 0.197226881980896, "mean_token_accuracy": 0.9145682752132416, "num_tokens": 48959528.0, "step": 3969 }, { "entropy": 1.3123193085193634, "epoch": 2.0905739863085833, "grad_norm": 0.2858417332172394, "learning_rate": 0.00016804662805258448, "loss": 0.1826488971710205, "mean_token_accuracy": 0.9254605323076248, "num_tokens": 48971864.0, "step": 3970 }, { "entropy": 1.347455382347107, "epoch": 2.091100579252238, "grad_norm": 0.2954428791999817, "learning_rate": 0.00016802986842132374, "loss": 0.20556935667991638, "mean_token_accuracy": 0.9166451990604401, "num_tokens": 48984200.0, "step": 3971 }, { "entropy": 1.319230854511261, "epoch": 2.0916271721958926, "grad_norm": 0.32010331749916077, "learning_rate": 0.00016801310534516798, "loss": 0.19692543148994446, "mean_token_accuracy": 0.9220879971981049, "num_tokens": 48996536.0, "step": 3972 }, { "entropy": 1.3301867544651031, "epoch": 2.092153765139547, "grad_norm": 0.24198579788208008, "learning_rate": 0.00016799633882511224, "loss": 0.18499736487865448, "mean_token_accuracy": 0.9226900786161423, "num_tokens": 49008872.0, "step": 3973 }, { "entropy": 1.3645350635051727, "epoch": 2.092680358083202, "grad_norm": 0.26797109842300415, "learning_rate": 0.00016797956886215195, "loss": 0.19249004125595093, "mean_token_accuracy": 0.9230862706899643, "num_tokens": 49021208.0, "step": 3974 }, { "entropy": 1.340773344039917, "epoch": 2.0932069510268563, "grad_norm": 0.26169508695602417, "learning_rate": 0.0001679627954572825, "loss": 0.18936491012573242, "mean_token_accuracy": 0.9241386204957962, "num_tokens": 49033544.0, "step": 3975 }, { "entropy": 1.3765994012355804, "epoch": 2.0937335439705107, "grad_norm": 0.2780802249908447, "learning_rate": 0.00016794601861149977, "loss": 0.1884055733680725, "mean_token_accuracy": 0.9221274852752686, "num_tokens": 49045880.0, "step": 3976 }, { "entropy": 1.4070016741752625, "epoch": 2.0942601369141656, "grad_norm": 0.26833170652389526, "learning_rate": 0.00016792923832579964, "loss": 0.18630680441856384, "mean_token_accuracy": 0.9243040978908539, "num_tokens": 49058216.0, "step": 3977 }, { "entropy": 1.3762468099594116, "epoch": 2.09478672985782, "grad_norm": 0.26797711849212646, "learning_rate": 0.00016791245460117825, "loss": 0.18355493247509003, "mean_token_accuracy": 0.9276077747344971, "num_tokens": 49070552.0, "step": 3978 }, { "entropy": 1.3690291047096252, "epoch": 2.0953133228014744, "grad_norm": 0.2826116383075714, "learning_rate": 0.000167895667438632, "loss": 0.19171208143234253, "mean_token_accuracy": 0.9223132878541946, "num_tokens": 49082888.0, "step": 3979 }, { "entropy": 1.395127385854721, "epoch": 2.095839915745129, "grad_norm": 0.29053691029548645, "learning_rate": 0.00016787887683915737, "loss": 0.1943792700767517, "mean_token_accuracy": 0.9202833324670792, "num_tokens": 49095224.0, "step": 3980 }, { "entropy": 1.4068172872066498, "epoch": 2.0963665086887837, "grad_norm": 0.296621710062027, "learning_rate": 0.00016786208280375123, "loss": 0.18952558934688568, "mean_token_accuracy": 0.9180808961391449, "num_tokens": 49107560.0, "step": 3981 }, { "entropy": 1.3650657832622528, "epoch": 2.096893101632438, "grad_norm": 0.3004305064678192, "learning_rate": 0.00016784528533341045, "loss": 0.19340358674526215, "mean_token_accuracy": 0.9233474135398865, "num_tokens": 49119896.0, "step": 3982 }, { "entropy": 1.3545269072055817, "epoch": 2.0974196945760926, "grad_norm": 0.2610722482204437, "learning_rate": 0.0001678284844291322, "loss": 0.17823578417301178, "mean_token_accuracy": 0.927034541964531, "num_tokens": 49132232.0, "step": 3983 }, { "entropy": 1.36451455950737, "epoch": 2.0979462875197474, "grad_norm": 0.29160958528518677, "learning_rate": 0.0001678116800919139, "loss": 0.19818106293678284, "mean_token_accuracy": 0.9195860922336578, "num_tokens": 49144568.0, "step": 3984 }, { "entropy": 1.339730054140091, "epoch": 2.098472880463402, "grad_norm": 0.27172547578811646, "learning_rate": 0.00016779487232275312, "loss": 0.19754473865032196, "mean_token_accuracy": 0.9192177653312683, "num_tokens": 49156904.0, "step": 3985 }, { "entropy": 1.3566035628318787, "epoch": 2.0989994734070563, "grad_norm": 0.2742775082588196, "learning_rate": 0.0001677780611226476, "loss": 0.18728569149971008, "mean_token_accuracy": 0.9219802916049957, "num_tokens": 49169240.0, "step": 3986 }, { "entropy": 1.3031164109706879, "epoch": 2.0995260663507107, "grad_norm": 0.2691558301448822, "learning_rate": 0.00016776124649259537, "loss": 0.1954994797706604, "mean_token_accuracy": 0.9175993353128433, "num_tokens": 49181576.0, "step": 3987 }, { "entropy": 1.3594340980052948, "epoch": 2.1000526592943656, "grad_norm": 0.3043460547924042, "learning_rate": 0.0001677444284335946, "loss": 0.18774178624153137, "mean_token_accuracy": 0.9245233535766602, "num_tokens": 49193912.0, "step": 3988 }, { "entropy": 1.3227914571762085, "epoch": 2.10057925223802, "grad_norm": 0.28486767411231995, "learning_rate": 0.00016772760694664364, "loss": 0.18533597886562347, "mean_token_accuracy": 0.9241953045129776, "num_tokens": 49206248.0, "step": 3989 }, { "entropy": 1.34839728474617, "epoch": 2.1011058451816744, "grad_norm": 0.31815943121910095, "learning_rate": 0.00016771078203274114, "loss": 0.20659512281417847, "mean_token_accuracy": 0.9135080128908157, "num_tokens": 49218584.0, "step": 3990 }, { "entropy": 1.3131659030914307, "epoch": 2.1016324381253293, "grad_norm": 0.2616286873817444, "learning_rate": 0.00016769395369288588, "loss": 0.16908803582191467, "mean_token_accuracy": 0.9313696920871735, "num_tokens": 49230920.0, "step": 3991 }, { "entropy": 1.313031405210495, "epoch": 2.1021590310689837, "grad_norm": 0.27754518389701843, "learning_rate": 0.00016767712192807682, "loss": 0.19504284858703613, "mean_token_accuracy": 0.916403278708458, "num_tokens": 49243256.0, "step": 3992 }, { "entropy": 1.304496705532074, "epoch": 2.102685624012638, "grad_norm": 0.28971877694129944, "learning_rate": 0.00016766028673931323, "loss": 0.1822929084300995, "mean_token_accuracy": 0.9260184317827225, "num_tokens": 49255592.0, "step": 3993 }, { "entropy": 1.293164074420929, "epoch": 2.103212216956293, "grad_norm": 0.2651752233505249, "learning_rate": 0.0001676434481275945, "loss": 0.18674691021442413, "mean_token_accuracy": 0.9198154211044312, "num_tokens": 49267928.0, "step": 3994 }, { "entropy": 1.3709676265716553, "epoch": 2.1037388098999474, "grad_norm": 0.2977954149246216, "learning_rate": 0.0001676266060939202, "loss": 0.21413739025592804, "mean_token_accuracy": 0.9135608524084091, "num_tokens": 49280264.0, "step": 3995 }, { "entropy": 1.4219199419021606, "epoch": 2.104265402843602, "grad_norm": 0.30583176016807556, "learning_rate": 0.00016760976063929017, "loss": 0.18949593603610992, "mean_token_accuracy": 0.9219523072242737, "num_tokens": 49292600.0, "step": 3996 }, { "entropy": 1.4119015336036682, "epoch": 2.1047919957872563, "grad_norm": 0.29364195466041565, "learning_rate": 0.00016759291176470444, "loss": 0.19350691139698029, "mean_token_accuracy": 0.9228742122650146, "num_tokens": 49304936.0, "step": 3997 }, { "entropy": 1.362772524356842, "epoch": 2.105318588730911, "grad_norm": 0.2556858956813812, "learning_rate": 0.0001675760594711632, "loss": 0.183720663189888, "mean_token_accuracy": 0.9237812012434006, "num_tokens": 49317272.0, "step": 3998 }, { "entropy": 1.3637798428535461, "epoch": 2.1058451816745656, "grad_norm": 0.2728027403354645, "learning_rate": 0.0001675592037596669, "loss": 0.19628110527992249, "mean_token_accuracy": 0.9191394597291946, "num_tokens": 49329608.0, "step": 3999 }, { "entropy": 1.3810409605503082, "epoch": 2.10637177461822, "grad_norm": 0.26390331983566284, "learning_rate": 0.00016754234463121613, "loss": 0.1863417774438858, "mean_token_accuracy": 0.9180260598659515, "num_tokens": 49341944.0, "step": 4000 }, { "entropy": 1.3575378060340881, "epoch": 2.106898367561875, "grad_norm": 0.26593732833862305, "learning_rate": 0.00016752548208681176, "loss": 0.1913304477930069, "mean_token_accuracy": 0.9183992445468903, "num_tokens": 49354280.0, "step": 4001 }, { "entropy": 1.3803537786006927, "epoch": 2.1074249605055293, "grad_norm": 0.2804014980792999, "learning_rate": 0.0001675086161274548, "loss": 0.17945896089076996, "mean_token_accuracy": 0.9222467094659805, "num_tokens": 49366616.0, "step": 4002 }, { "entropy": 1.3277397155761719, "epoch": 2.1079515534491837, "grad_norm": 0.27084991335868835, "learning_rate": 0.0001674917467541465, "loss": 0.2013774961233139, "mean_token_accuracy": 0.9130637645721436, "num_tokens": 49378952.0, "step": 4003 }, { "entropy": 1.3295770585536957, "epoch": 2.108478146392838, "grad_norm": 0.2723524868488312, "learning_rate": 0.0001674748739678883, "loss": 0.18388348817825317, "mean_token_accuracy": 0.9248556792736053, "num_tokens": 49391288.0, "step": 4004 }, { "entropy": 1.3474342226982117, "epoch": 2.109004739336493, "grad_norm": 0.3119790554046631, "learning_rate": 0.00016745799776968177, "loss": 0.21229058504104614, "mean_token_accuracy": 0.9167481958866119, "num_tokens": 49403624.0, "step": 4005 }, { "entropy": 1.3330671191215515, "epoch": 2.1095313322801474, "grad_norm": 0.28843197226524353, "learning_rate": 0.0001674411181605288, "loss": 0.2047140747308731, "mean_token_accuracy": 0.9146516472101212, "num_tokens": 49415960.0, "step": 4006 }, { "entropy": 1.4152400493621826, "epoch": 2.110057925223802, "grad_norm": 0.30813169479370117, "learning_rate": 0.00016742423514143147, "loss": 0.1919257640838623, "mean_token_accuracy": 0.9214138835668564, "num_tokens": 49428296.0, "step": 4007 }, { "entropy": 1.3549103736877441, "epoch": 2.1105845181674567, "grad_norm": 0.2713034451007843, "learning_rate": 0.000167407348713392, "loss": 0.199094757437706, "mean_token_accuracy": 0.9188733994960785, "num_tokens": 49440632.0, "step": 4008 }, { "entropy": 1.35169118642807, "epoch": 2.111111111111111, "grad_norm": 0.26357969641685486, "learning_rate": 0.00016739045887741283, "loss": 0.18052592873573303, "mean_token_accuracy": 0.9184356480836868, "num_tokens": 49452968.0, "step": 4009 }, { "entropy": 1.3346559405326843, "epoch": 2.1116377040547656, "grad_norm": 0.27484050393104553, "learning_rate": 0.0001673735656344966, "loss": 0.18684698641300201, "mean_token_accuracy": 0.9233911037445068, "num_tokens": 49465304.0, "step": 4010 }, { "entropy": 1.288124918937683, "epoch": 2.11216429699842, "grad_norm": 0.2778557240962982, "learning_rate": 0.00016735666898564616, "loss": 0.20437434315681458, "mean_token_accuracy": 0.9145655333995819, "num_tokens": 49477640.0, "step": 4011 }, { "entropy": 1.4040893018245697, "epoch": 2.112690889942075, "grad_norm": 0.2719804644584656, "learning_rate": 0.0001673397689318646, "loss": 0.17971079051494598, "mean_token_accuracy": 0.9259855449199677, "num_tokens": 49489976.0, "step": 4012 }, { "entropy": 1.3603813648223877, "epoch": 2.1132174828857293, "grad_norm": 0.28585880994796753, "learning_rate": 0.0001673228654741552, "loss": 0.18481558561325073, "mean_token_accuracy": 0.9266578257083893, "num_tokens": 49502312.0, "step": 4013 }, { "entropy": 1.2925344407558441, "epoch": 2.1137440758293837, "grad_norm": 0.26038700342178345, "learning_rate": 0.00016730595861352132, "loss": 0.18866756558418274, "mean_token_accuracy": 0.9256009310483932, "num_tokens": 49514648.0, "step": 4014 }, { "entropy": 1.2987899482250214, "epoch": 2.1142706687730386, "grad_norm": 0.28457188606262207, "learning_rate": 0.0001672890483509667, "loss": 0.20553961396217346, "mean_token_accuracy": 0.9197067618370056, "num_tokens": 49526984.0, "step": 4015 }, { "entropy": 1.3735082149505615, "epoch": 2.114797261716693, "grad_norm": 0.2766115367412567, "learning_rate": 0.00016727213468749517, "loss": 0.1972998082637787, "mean_token_accuracy": 0.9184480607509613, "num_tokens": 49539320.0, "step": 4016 }, { "entropy": 1.395142674446106, "epoch": 2.1153238546603474, "grad_norm": 0.2885947823524475, "learning_rate": 0.00016725521762411084, "loss": 0.18944555521011353, "mean_token_accuracy": 0.9218645691871643, "num_tokens": 49551656.0, "step": 4017 }, { "entropy": 1.397442787885666, "epoch": 2.1158504476040023, "grad_norm": 0.31787705421447754, "learning_rate": 0.00016723829716181797, "loss": 0.2024865299463272, "mean_token_accuracy": 0.9169978648424149, "num_tokens": 49563992.0, "step": 4018 }, { "entropy": 1.3703459203243256, "epoch": 2.1163770405476567, "grad_norm": 0.27631449699401855, "learning_rate": 0.00016722137330162096, "loss": 0.1807280331850052, "mean_token_accuracy": 0.9232948869466782, "num_tokens": 49576328.0, "step": 4019 }, { "entropy": 1.34648397564888, "epoch": 2.116903633491311, "grad_norm": 0.2967493534088135, "learning_rate": 0.00016720444604452454, "loss": 0.20159119367599487, "mean_token_accuracy": 0.9131289422512054, "num_tokens": 49588664.0, "step": 4020 }, { "entropy": 1.3790269792079926, "epoch": 2.1174302264349656, "grad_norm": 0.28901422023773193, "learning_rate": 0.00016718751539153358, "loss": 0.19655507802963257, "mean_token_accuracy": 0.9193400889635086, "num_tokens": 49601000.0, "step": 4021 }, { "entropy": 1.3603746592998505, "epoch": 2.1179568193786205, "grad_norm": 0.28060466051101685, "learning_rate": 0.0001671705813436531, "loss": 0.1773560345172882, "mean_token_accuracy": 0.9246945679187775, "num_tokens": 49613336.0, "step": 4022 }, { "entropy": 1.3825352787971497, "epoch": 2.118483412322275, "grad_norm": 0.30686402320861816, "learning_rate": 0.0001671536439018885, "loss": 0.20738644897937775, "mean_token_accuracy": 0.9165382385253906, "num_tokens": 49625672.0, "step": 4023 }, { "entropy": 1.353473424911499, "epoch": 2.1190100052659293, "grad_norm": 0.2645687460899353, "learning_rate": 0.00016713670306724512, "loss": 0.18006260693073273, "mean_token_accuracy": 0.9287989288568497, "num_tokens": 49638008.0, "step": 4024 }, { "entropy": 1.329434186220169, "epoch": 2.119536598209584, "grad_norm": 0.23572540283203125, "learning_rate": 0.00016711975884072872, "loss": 0.1625441312789917, "mean_token_accuracy": 0.9347212463617325, "num_tokens": 49650344.0, "step": 4025 }, { "entropy": 1.37681046128273, "epoch": 2.1200631911532386, "grad_norm": 0.25571563839912415, "learning_rate": 0.00016710281122334514, "loss": 0.17739693820476532, "mean_token_accuracy": 0.9257268309593201, "num_tokens": 49662680.0, "step": 4026 }, { "entropy": 1.366820365190506, "epoch": 2.120589784096893, "grad_norm": 0.2715073227882385, "learning_rate": 0.0001670858602161005, "loss": 0.200881227850914, "mean_token_accuracy": 0.9174215346574783, "num_tokens": 49675016.0, "step": 4027 }, { "entropy": 1.3869880437850952, "epoch": 2.1211163770405475, "grad_norm": 0.27762705087661743, "learning_rate": 0.00016706890582000105, "loss": 0.1989072561264038, "mean_token_accuracy": 0.9190517961978912, "num_tokens": 49687352.0, "step": 4028 }, { "entropy": 1.3485141694545746, "epoch": 2.1216429699842023, "grad_norm": 0.28710541129112244, "learning_rate": 0.0001670519480360533, "loss": 0.20247332751750946, "mean_token_accuracy": 0.9163581281900406, "num_tokens": 49699688.0, "step": 4029 }, { "entropy": 1.3902212977409363, "epoch": 2.1221695629278567, "grad_norm": 0.2807939350605011, "learning_rate": 0.0001670349868652639, "loss": 0.18549507856369019, "mean_token_accuracy": 0.9232971370220184, "num_tokens": 49712024.0, "step": 4030 }, { "entropy": 1.2936671376228333, "epoch": 2.122696155871511, "grad_norm": 0.277076780796051, "learning_rate": 0.00016701802230863978, "loss": 0.18881529569625854, "mean_token_accuracy": 0.9208351224660873, "num_tokens": 49724360.0, "step": 4031 }, { "entropy": 1.2952979803085327, "epoch": 2.123222748815166, "grad_norm": 0.28867289423942566, "learning_rate": 0.00016700105436718795, "loss": 0.18886399269104004, "mean_token_accuracy": 0.9231124371290207, "num_tokens": 49736696.0, "step": 4032 }, { "entropy": 1.35812708735466, "epoch": 2.1237493417588205, "grad_norm": 0.30915045738220215, "learning_rate": 0.00016698408304191578, "loss": 0.21172593533992767, "mean_token_accuracy": 0.918636828660965, "num_tokens": 49749032.0, "step": 4033 }, { "entropy": 1.29549902677536, "epoch": 2.124275934702475, "grad_norm": 0.2771642804145813, "learning_rate": 0.00016696710833383075, "loss": 0.17263811826705933, "mean_token_accuracy": 0.9258449673652649, "num_tokens": 49761368.0, "step": 4034 }, { "entropy": 1.2696373462677002, "epoch": 2.1248025276461293, "grad_norm": 0.2755196690559387, "learning_rate": 0.00016695013024394052, "loss": 0.18899832665920258, "mean_token_accuracy": 0.9189085364341736, "num_tokens": 49773704.0, "step": 4035 }, { "entropy": 1.253807783126831, "epoch": 2.125329120589784, "grad_norm": 0.28885576128959656, "learning_rate": 0.00016693314877325294, "loss": 0.19073623418807983, "mean_token_accuracy": 0.9253068566322327, "num_tokens": 49786040.0, "step": 4036 }, { "entropy": 1.2731792032718658, "epoch": 2.1258557135334386, "grad_norm": 0.3004090189933777, "learning_rate": 0.00016691616392277618, "loss": 0.19338059425354004, "mean_token_accuracy": 0.9188876748085022, "num_tokens": 49798376.0, "step": 4037 }, { "entropy": 1.210568755865097, "epoch": 2.126382306477093, "grad_norm": 0.2848544418811798, "learning_rate": 0.00016689917569351852, "loss": 0.20599129796028137, "mean_token_accuracy": 0.9142592400312424, "num_tokens": 49810712.0, "step": 4038 }, { "entropy": 1.2268668115139008, "epoch": 2.126908899420748, "grad_norm": 0.2891899645328522, "learning_rate": 0.0001668821840864884, "loss": 0.2129664123058319, "mean_token_accuracy": 0.9123159050941467, "num_tokens": 49823048.0, "step": 4039 }, { "entropy": 1.1677944362163544, "epoch": 2.1274354923644023, "grad_norm": 0.280416876077652, "learning_rate": 0.00016686518910269459, "loss": 0.19316363334655762, "mean_token_accuracy": 0.9191536903381348, "num_tokens": 49835384.0, "step": 4040 }, { "entropy": 1.1698110401630402, "epoch": 2.1279620853080567, "grad_norm": 0.2729722857475281, "learning_rate": 0.00016684819074314587, "loss": 0.17371591925621033, "mean_token_accuracy": 0.9292128086090088, "num_tokens": 49847720.0, "step": 4041 }, { "entropy": 1.1880428791046143, "epoch": 2.1284886782517116, "grad_norm": 0.2968471050262451, "learning_rate": 0.00016683118900885147, "loss": 0.19274401664733887, "mean_token_accuracy": 0.9200466126203537, "num_tokens": 49860056.0, "step": 4042 }, { "entropy": 1.1668127179145813, "epoch": 2.129015271195366, "grad_norm": 0.24909040331840515, "learning_rate": 0.0001668141839008206, "loss": 0.1683623492717743, "mean_token_accuracy": 0.9272440522909164, "num_tokens": 49872392.0, "step": 4043 }, { "entropy": 1.2406319081783295, "epoch": 2.1295418641390205, "grad_norm": 0.32238873839378357, "learning_rate": 0.00016679717542006275, "loss": 0.19797292351722717, "mean_token_accuracy": 0.9142682403326035, "num_tokens": 49884728.0, "step": 4044 }, { "entropy": 1.1888574957847595, "epoch": 2.130068457082675, "grad_norm": 0.2867093086242676, "learning_rate": 0.00016678016356758764, "loss": 0.19565987586975098, "mean_token_accuracy": 0.921043261885643, "num_tokens": 49897064.0, "step": 4045 }, { "entropy": 1.185506522655487, "epoch": 2.1305950500263298, "grad_norm": 0.29846811294555664, "learning_rate": 0.00016676314834440518, "loss": 0.20893250405788422, "mean_token_accuracy": 0.9120955020189285, "num_tokens": 49909400.0, "step": 4046 }, { "entropy": 1.1691254079341888, "epoch": 2.131121642969984, "grad_norm": 0.2745888829231262, "learning_rate": 0.00016674612975152542, "loss": 0.18490786850452423, "mean_token_accuracy": 0.9252546727657318, "num_tokens": 49921736.0, "step": 4047 }, { "entropy": 1.1454492807388306, "epoch": 2.1316482359136386, "grad_norm": 0.2868290841579437, "learning_rate": 0.00016672910778995866, "loss": 0.20495843887329102, "mean_token_accuracy": 0.9156783670186996, "num_tokens": 49934072.0, "step": 4048 }, { "entropy": 1.1920296549797058, "epoch": 2.1321748288572935, "grad_norm": 0.2875182628631592, "learning_rate": 0.00016671208246071546, "loss": 0.20269200205802917, "mean_token_accuracy": 0.9209336042404175, "num_tokens": 49946408.0, "step": 4049 }, { "entropy": 1.194561243057251, "epoch": 2.132701421800948, "grad_norm": 0.28611719608306885, "learning_rate": 0.00016669505376480642, "loss": 0.18004143238067627, "mean_token_accuracy": 0.9242940843105316, "num_tokens": 49958744.0, "step": 4050 }, { "entropy": 1.1752946376800537, "epoch": 2.1332280147446023, "grad_norm": 0.2773791253566742, "learning_rate": 0.00016667802170324252, "loss": 0.17548750340938568, "mean_token_accuracy": 0.9260925948619843, "num_tokens": 49971080.0, "step": 4051 }, { "entropy": 1.1404151320457458, "epoch": 2.1337546076882568, "grad_norm": 0.24352863430976868, "learning_rate": 0.0001666609862770348, "loss": 0.17417335510253906, "mean_token_accuracy": 0.9301496148109436, "num_tokens": 49983416.0, "step": 4052 }, { "entropy": 1.1148101389408112, "epoch": 2.1342812006319116, "grad_norm": 0.27176782488822937, "learning_rate": 0.0001666439474871946, "loss": 0.1892414093017578, "mean_token_accuracy": 0.9190666973590851, "num_tokens": 49995752.0, "step": 4053 }, { "entropy": 1.121658980846405, "epoch": 2.134807793575566, "grad_norm": 0.2826327979564667, "learning_rate": 0.00016662690533473333, "loss": 0.2030116468667984, "mean_token_accuracy": 0.921414390206337, "num_tokens": 50008088.0, "step": 4054 }, { "entropy": 1.1173063218593597, "epoch": 2.1353343865192205, "grad_norm": 0.2585664689540863, "learning_rate": 0.00016660985982066277, "loss": 0.177621528506279, "mean_token_accuracy": 0.9258757680654526, "num_tokens": 50020424.0, "step": 4055 }, { "entropy": 1.1216989159584045, "epoch": 2.1358609794628753, "grad_norm": 0.27996382117271423, "learning_rate": 0.00016659281094599478, "loss": 0.18978063762187958, "mean_token_accuracy": 0.9182009845972061, "num_tokens": 50032760.0, "step": 4056 }, { "entropy": 1.1314687132835388, "epoch": 2.1363875724065298, "grad_norm": 0.30307766795158386, "learning_rate": 0.00016657575871174143, "loss": 0.20396795868873596, "mean_token_accuracy": 0.9122677892446518, "num_tokens": 50045096.0, "step": 4057 }, { "entropy": 1.0608826130628586, "epoch": 2.136914165350184, "grad_norm": 0.27314090728759766, "learning_rate": 0.00016655870311891503, "loss": 0.19006496667861938, "mean_token_accuracy": 0.9235405623912811, "num_tokens": 50057432.0, "step": 4058 }, { "entropy": 1.0740149021148682, "epoch": 2.137440758293839, "grad_norm": 0.273417204618454, "learning_rate": 0.00016654164416852812, "loss": 0.1910788118839264, "mean_token_accuracy": 0.9203030318021774, "num_tokens": 50069768.0, "step": 4059 }, { "entropy": 1.0903103351593018, "epoch": 2.1379673512374935, "grad_norm": 0.2700668275356293, "learning_rate": 0.0001665245818615933, "loss": 0.1629205048084259, "mean_token_accuracy": 0.9328511208295822, "num_tokens": 50082104.0, "step": 4060 }, { "entropy": 1.1036777794361115, "epoch": 2.138493944181148, "grad_norm": 0.285442054271698, "learning_rate": 0.00016650751619912355, "loss": 0.1832047700881958, "mean_token_accuracy": 0.920674666762352, "num_tokens": 50094440.0, "step": 4061 }, { "entropy": 1.0578563511371613, "epoch": 2.1390205371248023, "grad_norm": 0.2827666103839874, "learning_rate": 0.00016649044718213186, "loss": 0.17583194375038147, "mean_token_accuracy": 0.9268711805343628, "num_tokens": 50106776.0, "step": 4062 }, { "entropy": 1.040594071149826, "epoch": 2.139547130068457, "grad_norm": 0.289329469203949, "learning_rate": 0.00016647337481163162, "loss": 0.18696846067905426, "mean_token_accuracy": 0.9217635691165924, "num_tokens": 50119112.0, "step": 4063 }, { "entropy": 1.076176255941391, "epoch": 2.1400737230121116, "grad_norm": 0.2821875810623169, "learning_rate": 0.00016645629908863623, "loss": 0.18235281109809875, "mean_token_accuracy": 0.927731066942215, "num_tokens": 50131448.0, "step": 4064 }, { "entropy": 1.0617471039295197, "epoch": 2.140600315955766, "grad_norm": 0.29055875539779663, "learning_rate": 0.00016643922001415945, "loss": 0.19152817130088806, "mean_token_accuracy": 0.921459436416626, "num_tokens": 50143784.0, "step": 4065 }, { "entropy": 1.0784454494714737, "epoch": 2.141126908899421, "grad_norm": 0.28317174315452576, "learning_rate": 0.0001664221375892151, "loss": 0.1880769580602646, "mean_token_accuracy": 0.9215621948242188, "num_tokens": 50156120.0, "step": 4066 }, { "entropy": 1.1484303772449493, "epoch": 2.1416535018430753, "grad_norm": 0.29933735728263855, "learning_rate": 0.0001664050518148173, "loss": 0.19272185862064362, "mean_token_accuracy": 0.9227567911148071, "num_tokens": 50168456.0, "step": 4067 }, { "entropy": 1.1309453547000885, "epoch": 2.1421800947867298, "grad_norm": 0.3005389869213104, "learning_rate": 0.00016638796269198035, "loss": 0.20710280537605286, "mean_token_accuracy": 0.9150481820106506, "num_tokens": 50180792.0, "step": 4068 }, { "entropy": 1.1589435040950775, "epoch": 2.142706687730384, "grad_norm": 0.3221890926361084, "learning_rate": 0.00016637087022171868, "loss": 0.20620915293693542, "mean_token_accuracy": 0.9166271984577179, "num_tokens": 50193128.0, "step": 4069 }, { "entropy": 1.106980949640274, "epoch": 2.143233280674039, "grad_norm": 0.2595953047275543, "learning_rate": 0.00016635377440504706, "loss": 0.1830139011144638, "mean_token_accuracy": 0.9249969273805618, "num_tokens": 50205464.0, "step": 4070 }, { "entropy": 1.1292275488376617, "epoch": 2.1437598736176935, "grad_norm": 0.28772836923599243, "learning_rate": 0.0001663366752429802, "loss": 0.2001112997531891, "mean_token_accuracy": 0.9196556061506271, "num_tokens": 50217800.0, "step": 4071 }, { "entropy": 1.149866372346878, "epoch": 2.144286466561348, "grad_norm": 0.25645655393600464, "learning_rate": 0.0001663195727365334, "loss": 0.17879578471183777, "mean_token_accuracy": 0.9276049882173538, "num_tokens": 50230136.0, "step": 4072 }, { "entropy": 1.1402757167816162, "epoch": 2.144813059505003, "grad_norm": 0.24784688651561737, "learning_rate": 0.00016630246688672176, "loss": 0.16923773288726807, "mean_token_accuracy": 0.9288965910673141, "num_tokens": 50242472.0, "step": 4073 }, { "entropy": 1.1733649671077728, "epoch": 2.145339652448657, "grad_norm": 0.2653653025627136, "learning_rate": 0.00016628535769456083, "loss": 0.19141364097595215, "mean_token_accuracy": 0.9215678870677948, "num_tokens": 50254808.0, "step": 4074 }, { "entropy": 1.1664075255393982, "epoch": 2.1458662453923116, "grad_norm": 0.2801195979118347, "learning_rate": 0.00016626824516106624, "loss": 0.2021307796239853, "mean_token_accuracy": 0.918086051940918, "num_tokens": 50267144.0, "step": 4075 }, { "entropy": 1.1810933351516724, "epoch": 2.1463928383359665, "grad_norm": 0.2909698486328125, "learning_rate": 0.00016625112928725394, "loss": 0.2095974087715149, "mean_token_accuracy": 0.9153055250644684, "num_tokens": 50279480.0, "step": 4076 }, { "entropy": 1.1292328536510468, "epoch": 2.146919431279621, "grad_norm": 0.24777865409851074, "learning_rate": 0.00016623401007413995, "loss": 0.18146950006484985, "mean_token_accuracy": 0.9228164702653885, "num_tokens": 50291816.0, "step": 4077 }, { "entropy": 1.2031064331531525, "epoch": 2.1474460242232754, "grad_norm": 0.29414162039756775, "learning_rate": 0.0001662168875227405, "loss": 0.19175127148628235, "mean_token_accuracy": 0.9232201874256134, "num_tokens": 50304152.0, "step": 4078 }, { "entropy": 1.2237733602523804, "epoch": 2.1479726171669298, "grad_norm": 0.2574436366558075, "learning_rate": 0.00016619976163407212, "loss": 0.18326136469841003, "mean_token_accuracy": 0.927291065454483, "num_tokens": 50316488.0, "step": 4079 }, { "entropy": 1.1478267908096313, "epoch": 2.1484992101105846, "grad_norm": 0.25556036829948425, "learning_rate": 0.00016618263240915143, "loss": 0.17815645039081573, "mean_token_accuracy": 0.9254791438579559, "num_tokens": 50328824.0, "step": 4080 }, { "entropy": 1.1542611420154572, "epoch": 2.149025803054239, "grad_norm": 0.2943160831928253, "learning_rate": 0.00016616549984899533, "loss": 0.2042732536792755, "mean_token_accuracy": 0.9145019352436066, "num_tokens": 50341160.0, "step": 4081 }, { "entropy": 1.1703786253929138, "epoch": 2.1495523959978935, "grad_norm": 0.29997357726097107, "learning_rate": 0.00016614836395462086, "loss": 0.18360967934131622, "mean_token_accuracy": 0.922757014632225, "num_tokens": 50353496.0, "step": 4082 }, { "entropy": 1.14296355843544, "epoch": 2.1500789889415484, "grad_norm": 0.4659420847892761, "learning_rate": 0.00016613122472704527, "loss": 0.19003994762897491, "mean_token_accuracy": 0.9201502650976181, "num_tokens": 50365832.0, "step": 4083 }, { "entropy": 1.2191529273986816, "epoch": 2.150605581885203, "grad_norm": 0.2996703088283539, "learning_rate": 0.00016611408216728603, "loss": 0.2007676362991333, "mean_token_accuracy": 0.9181395620107651, "num_tokens": 50378168.0, "step": 4084 }, { "entropy": 1.2132177352905273, "epoch": 2.151132174828857, "grad_norm": 0.25647181272506714, "learning_rate": 0.0001660969362763608, "loss": 0.1759507954120636, "mean_token_accuracy": 0.9269961714744568, "num_tokens": 50390504.0, "step": 4085 }, { "entropy": 1.220710039138794, "epoch": 2.1516587677725116, "grad_norm": 0.26862823963165283, "learning_rate": 0.0001660797870552874, "loss": 0.20389479398727417, "mean_token_accuracy": 0.9192573726177216, "num_tokens": 50402840.0, "step": 4086 }, { "entropy": 1.3179146647453308, "epoch": 2.1521853607161665, "grad_norm": 0.32815021276474, "learning_rate": 0.00016606263450508391, "loss": 0.20844385027885437, "mean_token_accuracy": 0.9123887866735458, "num_tokens": 50415176.0, "step": 4087 }, { "entropy": 1.270151823759079, "epoch": 2.152711953659821, "grad_norm": 0.28897103667259216, "learning_rate": 0.00016604547862676856, "loss": 0.19628524780273438, "mean_token_accuracy": 0.9163263142108917, "num_tokens": 50427512.0, "step": 4088 }, { "entropy": 1.297392338514328, "epoch": 2.1532385466034754, "grad_norm": 0.29361578822135925, "learning_rate": 0.0001660283194213598, "loss": 0.1971634477376938, "mean_token_accuracy": 0.9190499484539032, "num_tokens": 50439848.0, "step": 4089 }, { "entropy": 1.2932831943035126, "epoch": 2.1537651395471302, "grad_norm": 0.25311169028282166, "learning_rate": 0.0001660111568898763, "loss": 0.18418122828006744, "mean_token_accuracy": 0.9244278967380524, "num_tokens": 50452184.0, "step": 4090 }, { "entropy": 1.3569526970386505, "epoch": 2.1542917324907846, "grad_norm": 0.2899273633956909, "learning_rate": 0.00016599399103333685, "loss": 0.21381260454654694, "mean_token_accuracy": 0.9070511162281036, "num_tokens": 50464520.0, "step": 4091 }, { "entropy": 1.378174602985382, "epoch": 2.154818325434439, "grad_norm": 0.2990644574165344, "learning_rate": 0.00016597682185276049, "loss": 0.2194102704524994, "mean_token_accuracy": 0.9084511697292328, "num_tokens": 50476856.0, "step": 4092 }, { "entropy": 1.399436503648758, "epoch": 2.155344918378094, "grad_norm": 0.2860548198223114, "learning_rate": 0.00016595964934916653, "loss": 0.19893941283226013, "mean_token_accuracy": 0.9167734533548355, "num_tokens": 50489192.0, "step": 4093 }, { "entropy": 1.370680034160614, "epoch": 2.1558715113217484, "grad_norm": 0.28559643030166626, "learning_rate": 0.00016594247352357433, "loss": 0.19687819480895996, "mean_token_accuracy": 0.9142584204673767, "num_tokens": 50501528.0, "step": 4094 }, { "entropy": 1.359871655702591, "epoch": 2.156398104265403, "grad_norm": 0.2813403010368347, "learning_rate": 0.0001659252943770035, "loss": 0.21558703482151031, "mean_token_accuracy": 0.9130292385816574, "num_tokens": 50513864.0, "step": 4095 }, { "entropy": 1.4364489018917084, "epoch": 2.156924697209057, "grad_norm": 0.2761105000972748, "learning_rate": 0.00016590811191047393, "loss": 0.19772423803806305, "mean_token_accuracy": 0.916876494884491, "num_tokens": 50526200.0, "step": 4096 }, { "entropy": 1.4437676966190338, "epoch": 2.157451290152712, "grad_norm": 0.26975753903388977, "learning_rate": 0.0001658909261250056, "loss": 0.18524104356765747, "mean_token_accuracy": 0.921722486615181, "num_tokens": 50538536.0, "step": 4097 }, { "entropy": 1.4069486558437347, "epoch": 2.1579778830963665, "grad_norm": 0.2700808346271515, "learning_rate": 0.00016587373702161876, "loss": 0.1872127503156662, "mean_token_accuracy": 0.9228634834289551, "num_tokens": 50550872.0, "step": 4098 }, { "entropy": 1.4102502763271332, "epoch": 2.158504476040021, "grad_norm": 0.28084951639175415, "learning_rate": 0.00016585654460133376, "loss": 0.1960507333278656, "mean_token_accuracy": 0.9219342321157455, "num_tokens": 50563208.0, "step": 4099 }, { "entropy": 1.4461718797683716, "epoch": 2.159031068983676, "grad_norm": 0.2957639992237091, "learning_rate": 0.0001658393488651713, "loss": 0.18612340092658997, "mean_token_accuracy": 0.9263795763254166, "num_tokens": 50575544.0, "step": 4100 }, { "entropy": 1.4473920464515686, "epoch": 2.1595576619273302, "grad_norm": 0.261575311422348, "learning_rate": 0.00016582214981415217, "loss": 0.1952032893896103, "mean_token_accuracy": 0.9171668738126755, "num_tokens": 50587880.0, "step": 4101 }, { "entropy": 1.4263883233070374, "epoch": 2.1600842548709847, "grad_norm": 0.33648961782455444, "learning_rate": 0.00016580494744929735, "loss": 0.1953122764825821, "mean_token_accuracy": 0.9167916476726532, "num_tokens": 50600216.0, "step": 4102 }, { "entropy": 1.4109848737716675, "epoch": 2.160610847814639, "grad_norm": 0.2898204028606415, "learning_rate": 0.00016578774177162807, "loss": 0.19459910690784454, "mean_token_accuracy": 0.918088361620903, "num_tokens": 50612552.0, "step": 4103 }, { "entropy": 1.4371325075626373, "epoch": 2.161137440758294, "grad_norm": 0.2821919918060303, "learning_rate": 0.00016577053278216567, "loss": 0.20267830789089203, "mean_token_accuracy": 0.9202786535024643, "num_tokens": 50624888.0, "step": 4104 }, { "entropy": 1.4190351366996765, "epoch": 2.1616640337019484, "grad_norm": 0.28132855892181396, "learning_rate": 0.00016575332048193183, "loss": 0.1873740255832672, "mean_token_accuracy": 0.9211129248142242, "num_tokens": 50637224.0, "step": 4105 }, { "entropy": 1.3971222043037415, "epoch": 2.162190626645603, "grad_norm": 0.2738102674484253, "learning_rate": 0.0001657361048719483, "loss": 0.20248481631278992, "mean_token_accuracy": 0.9121163636445999, "num_tokens": 50649560.0, "step": 4106 }, { "entropy": 1.482112854719162, "epoch": 2.1627172195892577, "grad_norm": 0.2849135994911194, "learning_rate": 0.0001657188859532371, "loss": 0.2112928032875061, "mean_token_accuracy": 0.9163548201322556, "num_tokens": 50661896.0, "step": 4107 }, { "entropy": 1.4393364191055298, "epoch": 2.163243812532912, "grad_norm": 0.27296361327171326, "learning_rate": 0.00016570166372682034, "loss": 0.1941811442375183, "mean_token_accuracy": 0.9172745048999786, "num_tokens": 50674232.0, "step": 4108 }, { "entropy": 1.3936603665351868, "epoch": 2.1637704054765665, "grad_norm": 0.2626595199108124, "learning_rate": 0.00016568443819372052, "loss": 0.18277618288993835, "mean_token_accuracy": 0.9309801757335663, "num_tokens": 50686568.0, "step": 4109 }, { "entropy": 1.369593769311905, "epoch": 2.1642969984202214, "grad_norm": 0.2655249834060669, "learning_rate": 0.0001656672093549601, "loss": 0.19196127355098724, "mean_token_accuracy": 0.9230923056602478, "num_tokens": 50698904.0, "step": 4110 }, { "entropy": 1.4366631209850311, "epoch": 2.164823591363876, "grad_norm": 0.29604408144950867, "learning_rate": 0.00016564997721156197, "loss": 0.1939295530319214, "mean_token_accuracy": 0.9189808517694473, "num_tokens": 50711240.0, "step": 4111 }, { "entropy": 1.4341607093811035, "epoch": 2.1653501843075302, "grad_norm": 0.28088974952697754, "learning_rate": 0.000165632741764549, "loss": 0.2065155804157257, "mean_token_accuracy": 0.9164612293243408, "num_tokens": 50723576.0, "step": 4112 }, { "entropy": 1.4529509842395782, "epoch": 2.1658767772511847, "grad_norm": 0.2820344567298889, "learning_rate": 0.00016561550301494443, "loss": 0.18620197474956512, "mean_token_accuracy": 0.9235643148422241, "num_tokens": 50735912.0, "step": 4113 }, { "entropy": 1.4021332263946533, "epoch": 2.1664033701948395, "grad_norm": 0.2705285847187042, "learning_rate": 0.0001655982609637716, "loss": 0.19482757151126862, "mean_token_accuracy": 0.917400673031807, "num_tokens": 50748248.0, "step": 4114 }, { "entropy": 1.3551163375377655, "epoch": 2.166929963138494, "grad_norm": 0.2499101608991623, "learning_rate": 0.0001655810156120541, "loss": 0.17850345373153687, "mean_token_accuracy": 0.9285051375627518, "num_tokens": 50760584.0, "step": 4115 }, { "entropy": 1.3864115178585052, "epoch": 2.1674565560821484, "grad_norm": 0.283306360244751, "learning_rate": 0.00016556376696081558, "loss": 0.1874375194311142, "mean_token_accuracy": 0.9245508462190628, "num_tokens": 50772920.0, "step": 4116 }, { "entropy": 1.3825859427452087, "epoch": 2.1679831490258032, "grad_norm": 0.25388672947883606, "learning_rate": 0.0001655465150110801, "loss": 0.17021594941616058, "mean_token_accuracy": 0.9311476945877075, "num_tokens": 50785256.0, "step": 4117 }, { "entropy": 1.3711049556732178, "epoch": 2.1685097419694577, "grad_norm": 0.2609105408191681, "learning_rate": 0.00016552925976387177, "loss": 0.17833492159843445, "mean_token_accuracy": 0.9264799654483795, "num_tokens": 50797592.0, "step": 4118 }, { "entropy": 1.3915640711784363, "epoch": 2.169036334913112, "grad_norm": 0.30802109837532043, "learning_rate": 0.00016551200122021494, "loss": 0.20191773772239685, "mean_token_accuracy": 0.9182671159505844, "num_tokens": 50809928.0, "step": 4119 }, { "entropy": 1.2875527441501617, "epoch": 2.1695629278567665, "grad_norm": 0.2597365975379944, "learning_rate": 0.00016549473938113414, "loss": 0.18255290389060974, "mean_token_accuracy": 0.9238605499267578, "num_tokens": 50822264.0, "step": 4120 }, { "entropy": 1.2972512543201447, "epoch": 2.1700895208004214, "grad_norm": 0.2637297511100769, "learning_rate": 0.00016547747424765412, "loss": 0.17539075016975403, "mean_token_accuracy": 0.9288503229618073, "num_tokens": 50834600.0, "step": 4121 }, { "entropy": 1.3471184074878693, "epoch": 2.170616113744076, "grad_norm": 0.29643920063972473, "learning_rate": 0.0001654602058207998, "loss": 0.19519950449466705, "mean_token_accuracy": 0.9189782440662384, "num_tokens": 50846936.0, "step": 4122 }, { "entropy": 1.3144559860229492, "epoch": 2.1711427066877302, "grad_norm": 0.30460768938064575, "learning_rate": 0.0001654429341015963, "loss": 0.1963726282119751, "mean_token_accuracy": 0.9202246516942978, "num_tokens": 50859272.0, "step": 4123 }, { "entropy": 1.2872081398963928, "epoch": 2.171669299631385, "grad_norm": 0.27515682578086853, "learning_rate": 0.00016542565909106896, "loss": 0.18613222241401672, "mean_token_accuracy": 0.922202005982399, "num_tokens": 50871608.0, "step": 4124 }, { "entropy": 1.3294596076011658, "epoch": 2.1721958925750395, "grad_norm": 0.2827659547328949, "learning_rate": 0.00016540838079024325, "loss": 0.1930113434791565, "mean_token_accuracy": 0.926962748169899, "num_tokens": 50883944.0, "step": 4125 }, { "entropy": 1.3070390224456787, "epoch": 2.172722485518694, "grad_norm": 0.29022613167762756, "learning_rate": 0.00016539109920014498, "loss": 0.18820495903491974, "mean_token_accuracy": 0.9214640110731125, "num_tokens": 50896280.0, "step": 4126 }, { "entropy": 1.2923785746097565, "epoch": 2.173249078462349, "grad_norm": 0.30840960144996643, "learning_rate": 0.00016537381432179992, "loss": 0.19509851932525635, "mean_token_accuracy": 0.9167175590991974, "num_tokens": 50908616.0, "step": 4127 }, { "entropy": 1.2731912434101105, "epoch": 2.1737756714060033, "grad_norm": 0.262724906206131, "learning_rate": 0.00016535652615623433, "loss": 0.17678092420101166, "mean_token_accuracy": 0.924164742231369, "num_tokens": 50920952.0, "step": 4128 }, { "entropy": 1.2588714957237244, "epoch": 2.1743022643496577, "grad_norm": 0.2767009139060974, "learning_rate": 0.00016533923470447436, "loss": 0.1992766261100769, "mean_token_accuracy": 0.9205213189125061, "num_tokens": 50933288.0, "step": 4129 }, { "entropy": 1.2620333433151245, "epoch": 2.174828857293312, "grad_norm": 0.27543267607688904, "learning_rate": 0.0001653219399675466, "loss": 0.1907360702753067, "mean_token_accuracy": 0.9243224263191223, "num_tokens": 50945624.0, "step": 4130 }, { "entropy": 1.251461535692215, "epoch": 2.175355450236967, "grad_norm": 0.2669181823730469, "learning_rate": 0.00016530464194647768, "loss": 0.19080904126167297, "mean_token_accuracy": 0.9203681647777557, "num_tokens": 50957960.0, "step": 4131 }, { "entropy": 1.2553662955760956, "epoch": 2.1758820431806214, "grad_norm": 0.2973247468471527, "learning_rate": 0.0001652873406422945, "loss": 0.2005629688501358, "mean_token_accuracy": 0.9205776154994965, "num_tokens": 50970296.0, "step": 4132 }, { "entropy": 1.2845535278320312, "epoch": 2.176408636124276, "grad_norm": 0.2855272591114044, "learning_rate": 0.00016527003605602418, "loss": 0.19210195541381836, "mean_token_accuracy": 0.9204275608062744, "num_tokens": 50982632.0, "step": 4133 }, { "entropy": 1.2553153038024902, "epoch": 2.1769352290679307, "grad_norm": 0.2743854224681854, "learning_rate": 0.00016525272818869392, "loss": 0.19348418712615967, "mean_token_accuracy": 0.9160150438547134, "num_tokens": 50994968.0, "step": 4134 }, { "entropy": 1.2861834466457367, "epoch": 2.177461822011585, "grad_norm": 0.3126857578754425, "learning_rate": 0.00016523541704133128, "loss": 0.2036605328321457, "mean_token_accuracy": 0.91865274310112, "num_tokens": 51007304.0, "step": 4135 }, { "entropy": 1.2617907226085663, "epoch": 2.1779884149552395, "grad_norm": 0.2782585620880127, "learning_rate": 0.00016521810261496385, "loss": 0.1961769163608551, "mean_token_accuracy": 0.9191503077745438, "num_tokens": 51019640.0, "step": 4136 }, { "entropy": 1.2762066721916199, "epoch": 2.178515007898894, "grad_norm": 0.2730770707130432, "learning_rate": 0.00016520078491061944, "loss": 0.20689794421195984, "mean_token_accuracy": 0.9149703979492188, "num_tokens": 51031976.0, "step": 4137 }, { "entropy": 1.272611141204834, "epoch": 2.179041600842549, "grad_norm": 0.2779129445552826, "learning_rate": 0.00016518346392932625, "loss": 0.18954318761825562, "mean_token_accuracy": 0.9203405678272247, "num_tokens": 51044312.0, "step": 4138 }, { "entropy": 1.2742144763469696, "epoch": 2.1795681937862033, "grad_norm": 0.26842811703681946, "learning_rate": 0.00016516613967211237, "loss": 0.19438216090202332, "mean_token_accuracy": 0.9190889149904251, "num_tokens": 51056648.0, "step": 4139 }, { "entropy": 1.2541859447956085, "epoch": 2.1800947867298577, "grad_norm": 0.25953954458236694, "learning_rate": 0.00016514881214000637, "loss": 0.16562017798423767, "mean_token_accuracy": 0.9315860420465469, "num_tokens": 51068984.0, "step": 4140 }, { "entropy": 1.2067217528820038, "epoch": 2.1806213796735125, "grad_norm": 0.26448673009872437, "learning_rate": 0.00016513148133403678, "loss": 0.19268856942653656, "mean_token_accuracy": 0.9189769923686981, "num_tokens": 51081320.0, "step": 4141 }, { "entropy": 1.2760578393936157, "epoch": 2.181147972617167, "grad_norm": 0.28249260783195496, "learning_rate": 0.00016511414725523248, "loss": 0.19554588198661804, "mean_token_accuracy": 0.9178217202425003, "num_tokens": 51093656.0, "step": 4142 }, { "entropy": 1.225668877363205, "epoch": 2.1816745655608214, "grad_norm": 0.29703161120414734, "learning_rate": 0.00016509680990462253, "loss": 0.19665035605430603, "mean_token_accuracy": 0.9156013280153275, "num_tokens": 51105992.0, "step": 4143 }, { "entropy": 1.2031238079071045, "epoch": 2.1822011585044763, "grad_norm": 0.2988886535167694, "learning_rate": 0.00016507946928323607, "loss": 0.21606066823005676, "mean_token_accuracy": 0.912405326962471, "num_tokens": 51118328.0, "step": 4144 }, { "entropy": 1.2246394753456116, "epoch": 2.1827277514481307, "grad_norm": 0.3065650165081024, "learning_rate": 0.00016506212539210252, "loss": 0.19041046500205994, "mean_token_accuracy": 0.9208615720272064, "num_tokens": 51130664.0, "step": 4145 }, { "entropy": 1.2080211341381073, "epoch": 2.183254344391785, "grad_norm": 0.2621246576309204, "learning_rate": 0.00016504477823225155, "loss": 0.18758952617645264, "mean_token_accuracy": 0.9203426092863083, "num_tokens": 51143000.0, "step": 4146 }, { "entropy": 1.2131967544555664, "epoch": 2.1837809373354395, "grad_norm": 0.279575377702713, "learning_rate": 0.00016502742780471292, "loss": 0.19576191902160645, "mean_token_accuracy": 0.9203895181417465, "num_tokens": 51155336.0, "step": 4147 }, { "entropy": 1.2280302047729492, "epoch": 2.1843075302790944, "grad_norm": 0.30413857102394104, "learning_rate": 0.0001650100741105166, "loss": 0.23050157725811005, "mean_token_accuracy": 0.9074624329805374, "num_tokens": 51167672.0, "step": 4148 }, { "entropy": 1.134459227323532, "epoch": 2.184834123222749, "grad_norm": 0.2748672366142273, "learning_rate": 0.00016499271715069282, "loss": 0.20069140195846558, "mean_token_accuracy": 0.9178691804409027, "num_tokens": 51180008.0, "step": 4149 }, { "entropy": 1.1993885934352875, "epoch": 2.1853607161664033, "grad_norm": 0.2918178141117096, "learning_rate": 0.000164975356926272, "loss": 0.1967269331216812, "mean_token_accuracy": 0.9205320626497269, "num_tokens": 51192344.0, "step": 4150 }, { "entropy": 1.169199138879776, "epoch": 2.185887309110058, "grad_norm": 0.2743321657180786, "learning_rate": 0.00016495799343828457, "loss": 0.1919926255941391, "mean_token_accuracy": 0.923371896147728, "num_tokens": 51204680.0, "step": 4151 }, { "entropy": 1.18020898103714, "epoch": 2.1864139020537126, "grad_norm": 0.2571604549884796, "learning_rate": 0.00016494062668776142, "loss": 0.18856392800807953, "mean_token_accuracy": 0.9222598224878311, "num_tokens": 51217016.0, "step": 4152 }, { "entropy": 1.238032579421997, "epoch": 2.186940494997367, "grad_norm": 0.31084808707237244, "learning_rate": 0.0001649232566757335, "loss": 0.2140955924987793, "mean_token_accuracy": 0.9109927117824554, "num_tokens": 51229352.0, "step": 4153 }, { "entropy": 1.165948748588562, "epoch": 2.1874670879410214, "grad_norm": 0.25719159841537476, "learning_rate": 0.00016490588340323193, "loss": 0.17952802777290344, "mean_token_accuracy": 0.925691083073616, "num_tokens": 51241688.0, "step": 4154 }, { "entropy": 1.1968891322612762, "epoch": 2.1879936808846763, "grad_norm": 0.31568825244903564, "learning_rate": 0.00016488850687128808, "loss": 0.200781911611557, "mean_token_accuracy": 0.9183004051446915, "num_tokens": 51254024.0, "step": 4155 }, { "entropy": 1.1447340846061707, "epoch": 2.1885202738283307, "grad_norm": 0.27546897530555725, "learning_rate": 0.0001648711270809335, "loss": 0.18839329481124878, "mean_token_accuracy": 0.9184723347425461, "num_tokens": 51266360.0, "step": 4156 }, { "entropy": 1.171207994222641, "epoch": 2.189046866771985, "grad_norm": 0.274943083524704, "learning_rate": 0.00016485374403319992, "loss": 0.18055374920368195, "mean_token_accuracy": 0.9275996685028076, "num_tokens": 51278696.0, "step": 4157 }, { "entropy": 1.1181433200836182, "epoch": 2.18957345971564, "grad_norm": 0.26391127705574036, "learning_rate": 0.00016483635772911927, "loss": 0.18997561931610107, "mean_token_accuracy": 0.9185864478349686, "num_tokens": 51291032.0, "step": 4158 }, { "entropy": 1.179248869419098, "epoch": 2.1901000526592944, "grad_norm": 0.3057918846607208, "learning_rate": 0.00016481896816972365, "loss": 0.20668058097362518, "mean_token_accuracy": 0.9130419045686722, "num_tokens": 51303368.0, "step": 4159 }, { "entropy": 1.14694344997406, "epoch": 2.190626645602949, "grad_norm": 0.29680994153022766, "learning_rate": 0.00016480157535604542, "loss": 0.20385394990444183, "mean_token_accuracy": 0.9219126552343369, "num_tokens": 51315704.0, "step": 4160 }, { "entropy": 1.1223139762878418, "epoch": 2.1911532385466037, "grad_norm": 0.28084614872932434, "learning_rate": 0.00016478417928911707, "loss": 0.1831260770559311, "mean_token_accuracy": 0.921630397439003, "num_tokens": 51328040.0, "step": 4161 }, { "entropy": 1.1934473514556885, "epoch": 2.191679831490258, "grad_norm": 0.2605876922607422, "learning_rate": 0.0001647667799699713, "loss": 0.17136146128177643, "mean_token_accuracy": 0.9267126470804214, "num_tokens": 51340376.0, "step": 4162 }, { "entropy": 1.2115715444087982, "epoch": 2.1922064244339126, "grad_norm": 0.2804056704044342, "learning_rate": 0.00016474937739964098, "loss": 0.19194582104682922, "mean_token_accuracy": 0.9201535731554031, "num_tokens": 51352712.0, "step": 4163 }, { "entropy": 1.2309587597846985, "epoch": 2.192733017377567, "grad_norm": 0.29135453701019287, "learning_rate": 0.00016473197157915924, "loss": 0.193227156996727, "mean_token_accuracy": 0.9226816892623901, "num_tokens": 51365048.0, "step": 4164 }, { "entropy": 1.199971079826355, "epoch": 2.193259610321222, "grad_norm": 0.2691158950328827, "learning_rate": 0.00016471456250955935, "loss": 0.18729914724826813, "mean_token_accuracy": 0.9220250248908997, "num_tokens": 51377384.0, "step": 4165 }, { "entropy": 1.2236689925193787, "epoch": 2.1937862032648763, "grad_norm": 0.28157827258110046, "learning_rate": 0.0001646971501918748, "loss": 0.1987837255001068, "mean_token_accuracy": 0.9200732856988907, "num_tokens": 51389720.0, "step": 4166 }, { "entropy": 1.2567576467990875, "epoch": 2.1943127962085307, "grad_norm": 0.2924027442932129, "learning_rate": 0.00016467973462713924, "loss": 0.19592998921871185, "mean_token_accuracy": 0.9199083000421524, "num_tokens": 51402056.0, "step": 4167 }, { "entropy": 1.237093836069107, "epoch": 2.194839389152185, "grad_norm": 0.24912655353546143, "learning_rate": 0.00016466231581638654, "loss": 0.18574857711791992, "mean_token_accuracy": 0.9237374365329742, "num_tokens": 51414392.0, "step": 4168 }, { "entropy": 1.303921639919281, "epoch": 2.19536598209584, "grad_norm": 0.2773839235305786, "learning_rate": 0.00016464489376065073, "loss": 0.178799569606781, "mean_token_accuracy": 0.9240204840898514, "num_tokens": 51426728.0, "step": 4169 }, { "entropy": 1.3061772286891937, "epoch": 2.1958925750394944, "grad_norm": 0.2626015841960907, "learning_rate": 0.00016462746846096607, "loss": 0.18042266368865967, "mean_token_accuracy": 0.9253515899181366, "num_tokens": 51439064.0, "step": 4170 }, { "entropy": 1.2534684240818024, "epoch": 2.196419167983149, "grad_norm": 0.26793691515922546, "learning_rate": 0.00016461003991836702, "loss": 0.1747230887413025, "mean_token_accuracy": 0.9280012398958206, "num_tokens": 51451400.0, "step": 4171 }, { "entropy": 1.2703869342803955, "epoch": 2.1969457609268037, "grad_norm": 0.2812594473361969, "learning_rate": 0.0001645926081338882, "loss": 0.1805751770734787, "mean_token_accuracy": 0.9254391044378281, "num_tokens": 51463736.0, "step": 4172 }, { "entropy": 1.2749820053577423, "epoch": 2.197472353870458, "grad_norm": 0.28039759397506714, "learning_rate": 0.00016457517310856435, "loss": 0.1838250607252121, "mean_token_accuracy": 0.9279988557100296, "num_tokens": 51476072.0, "step": 4173 }, { "entropy": 1.2618244588375092, "epoch": 2.1979989468141126, "grad_norm": 0.27489322423934937, "learning_rate": 0.00016455773484343062, "loss": 0.19052180647850037, "mean_token_accuracy": 0.9222322404384613, "num_tokens": 51488408.0, "step": 4174 }, { "entropy": 1.2714160978794098, "epoch": 2.1985255397577674, "grad_norm": 0.2729232907295227, "learning_rate": 0.00016454029333952218, "loss": 0.18227756023406982, "mean_token_accuracy": 0.926309272646904, "num_tokens": 51500744.0, "step": 4175 }, { "entropy": 1.3097633719444275, "epoch": 2.199052132701422, "grad_norm": 0.2813631594181061, "learning_rate": 0.00016452284859787438, "loss": 0.19379457831382751, "mean_token_accuracy": 0.9247638136148453, "num_tokens": 51513080.0, "step": 4176 }, { "entropy": 1.2534567713737488, "epoch": 2.1995787256450763, "grad_norm": 0.29952695965766907, "learning_rate": 0.00016450540061952284, "loss": 0.2159310132265091, "mean_token_accuracy": 0.9128957092761993, "num_tokens": 51525416.0, "step": 4177 }, { "entropy": 1.2288260757923126, "epoch": 2.2001053185887307, "grad_norm": 0.28645092248916626, "learning_rate": 0.00016448794940550335, "loss": 0.18216633796691895, "mean_token_accuracy": 0.9225532412528992, "num_tokens": 51537752.0, "step": 4178 }, { "entropy": 1.2748102247714996, "epoch": 2.2006319115323856, "grad_norm": 0.27064216136932373, "learning_rate": 0.00016447049495685187, "loss": 0.17641235888004303, "mean_token_accuracy": 0.9300948679447174, "num_tokens": 51550088.0, "step": 4179 }, { "entropy": 1.2677447497844696, "epoch": 2.20115850447604, "grad_norm": 0.2583957314491272, "learning_rate": 0.0001644530372746046, "loss": 0.17626498639583588, "mean_token_accuracy": 0.9239745885133743, "num_tokens": 51562424.0, "step": 4180 }, { "entropy": 1.2885291874408722, "epoch": 2.2016850974196944, "grad_norm": 0.2887992262840271, "learning_rate": 0.00016443557635979788, "loss": 0.19101789593696594, "mean_token_accuracy": 0.9209521859884262, "num_tokens": 51574760.0, "step": 4181 }, { "entropy": 1.2113700211048126, "epoch": 2.2022116903633493, "grad_norm": 0.2987286150455475, "learning_rate": 0.00016441811221346828, "loss": 0.18627510964870453, "mean_token_accuracy": 0.9210187345743179, "num_tokens": 51587096.0, "step": 4182 }, { "entropy": 1.2981871664524078, "epoch": 2.2027382833070037, "grad_norm": 0.27984488010406494, "learning_rate": 0.0001644006448366525, "loss": 0.18086984753608704, "mean_token_accuracy": 0.9228075742721558, "num_tokens": 51599432.0, "step": 4183 }, { "entropy": 1.3021030724048615, "epoch": 2.203264876250658, "grad_norm": 0.29861992597579956, "learning_rate": 0.00016438317423038754, "loss": 0.19581389427185059, "mean_token_accuracy": 0.9156288206577301, "num_tokens": 51611768.0, "step": 4184 }, { "entropy": 1.2574114203453064, "epoch": 2.2037914691943126, "grad_norm": 0.28540849685668945, "learning_rate": 0.00016436570039571048, "loss": 0.1952468752861023, "mean_token_accuracy": 0.9155928790569305, "num_tokens": 51624104.0, "step": 4185 }, { "entropy": 1.3478785157203674, "epoch": 2.2043180621379674, "grad_norm": 0.46443215012550354, "learning_rate": 0.00016434822333365867, "loss": 0.17215551435947418, "mean_token_accuracy": 0.9300452023744583, "num_tokens": 51636440.0, "step": 4186 }, { "entropy": 1.2662345170974731, "epoch": 2.204844655081622, "grad_norm": 0.29072144627571106, "learning_rate": 0.00016433074304526957, "loss": 0.19199174642562866, "mean_token_accuracy": 0.9260234832763672, "num_tokens": 51648776.0, "step": 4187 }, { "entropy": 1.232847660779953, "epoch": 2.2053712480252763, "grad_norm": 0.25679078698158264, "learning_rate": 0.00016431325953158096, "loss": 0.17870289087295532, "mean_token_accuracy": 0.9293755143880844, "num_tokens": 51661112.0, "step": 4188 }, { "entropy": 1.2633108794689178, "epoch": 2.205897840968931, "grad_norm": 0.266966849565506, "learning_rate": 0.00016429577279363067, "loss": 0.1845407336950302, "mean_token_accuracy": 0.9210513830184937, "num_tokens": 51673448.0, "step": 4189 }, { "entropy": 1.2357351183891296, "epoch": 2.2064244339125856, "grad_norm": 0.27318739891052246, "learning_rate": 0.0001642782828324568, "loss": 0.18381115794181824, "mean_token_accuracy": 0.926314502954483, "num_tokens": 51685784.0, "step": 4190 }, { "entropy": 1.2260805070400238, "epoch": 2.20695102685624, "grad_norm": 0.3009386360645294, "learning_rate": 0.00016426078964909766, "loss": 0.19563618302345276, "mean_token_accuracy": 0.9195328205823898, "num_tokens": 51698120.0, "step": 4191 }, { "entropy": 1.2364404797554016, "epoch": 2.207477619799895, "grad_norm": 0.29123032093048096, "learning_rate": 0.00016424329324459167, "loss": 0.1951371729373932, "mean_token_accuracy": 0.9174755364656448, "num_tokens": 51710456.0, "step": 4192 }, { "entropy": 1.2290646433830261, "epoch": 2.2080042127435493, "grad_norm": 0.27491459250450134, "learning_rate": 0.00016422579361997754, "loss": 0.18299022316932678, "mean_token_accuracy": 0.9223412722349167, "num_tokens": 51722792.0, "step": 4193 }, { "entropy": 1.1536138653755188, "epoch": 2.2085308056872037, "grad_norm": 0.2737578749656677, "learning_rate": 0.00016420829077629407, "loss": 0.18880535662174225, "mean_token_accuracy": 0.9208870977163315, "num_tokens": 51735128.0, "step": 4194 }, { "entropy": 1.1930584907531738, "epoch": 2.209057398630858, "grad_norm": 0.2856224775314331, "learning_rate": 0.00016419078471458033, "loss": 0.1827823668718338, "mean_token_accuracy": 0.9252646416425705, "num_tokens": 51747464.0, "step": 4195 }, { "entropy": 1.1551392376422882, "epoch": 2.209583991574513, "grad_norm": 0.29800665378570557, "learning_rate": 0.00016417327543587557, "loss": 0.19618409872055054, "mean_token_accuracy": 0.9184785932302475, "num_tokens": 51759800.0, "step": 4196 }, { "entropy": 1.1179493069648743, "epoch": 2.2101105845181674, "grad_norm": 0.36465853452682495, "learning_rate": 0.00016415576294121918, "loss": 0.1905837059020996, "mean_token_accuracy": 0.9215804487466812, "num_tokens": 51772136.0, "step": 4197 }, { "entropy": 1.1246863901615143, "epoch": 2.210637177461822, "grad_norm": 0.2792600691318512, "learning_rate": 0.0001641382472316508, "loss": 0.2024848610162735, "mean_token_accuracy": 0.9161612391471863, "num_tokens": 51784472.0, "step": 4198 }, { "entropy": 1.1439398527145386, "epoch": 2.2111637704054767, "grad_norm": 0.2936895787715912, "learning_rate": 0.0001641207283082102, "loss": 0.18412424623966217, "mean_token_accuracy": 0.9253138452768326, "num_tokens": 51796808.0, "step": 4199 }, { "entropy": 1.1501588225364685, "epoch": 2.211690363349131, "grad_norm": 0.2793161869049072, "learning_rate": 0.00016410320617193743, "loss": 0.192224383354187, "mean_token_accuracy": 0.924894392490387, "num_tokens": 51809144.0, "step": 4200 }, { "entropy": 1.1433355212211609, "epoch": 2.2122169562927856, "grad_norm": 0.28388532996177673, "learning_rate": 0.0001640856808238726, "loss": 0.181789368391037, "mean_token_accuracy": 0.9237640649080276, "num_tokens": 51821480.0, "step": 4201 }, { "entropy": 1.141024112701416, "epoch": 2.21274354923644, "grad_norm": 0.275046706199646, "learning_rate": 0.00016406815226505618, "loss": 0.1791418045759201, "mean_token_accuracy": 0.9245376735925674, "num_tokens": 51833816.0, "step": 4202 }, { "entropy": 1.1009389460086823, "epoch": 2.213270142180095, "grad_norm": 0.2538962960243225, "learning_rate": 0.00016405062049652867, "loss": 0.1699582189321518, "mean_token_accuracy": 0.9293850362300873, "num_tokens": 51846152.0, "step": 4203 }, { "entropy": 1.1123566925525665, "epoch": 2.2137967351237493, "grad_norm": 0.2865713834762573, "learning_rate": 0.00016403308551933085, "loss": 0.19568300247192383, "mean_token_accuracy": 0.9213463515043259, "num_tokens": 51858488.0, "step": 4204 }, { "entropy": 1.1162798702716827, "epoch": 2.2143233280674037, "grad_norm": 0.2596893906593323, "learning_rate": 0.0001640155473345037, "loss": 0.18270273506641388, "mean_token_accuracy": 0.9247992038726807, "num_tokens": 51870824.0, "step": 4205 }, { "entropy": 1.1294128894805908, "epoch": 2.2148499210110586, "grad_norm": 0.2684587240219116, "learning_rate": 0.0001639980059430883, "loss": 0.17550542950630188, "mean_token_accuracy": 0.9285458475351334, "num_tokens": 51883160.0, "step": 4206 }, { "entropy": 1.1598798334598541, "epoch": 2.215376513954713, "grad_norm": 0.2630522847175598, "learning_rate": 0.00016398046134612603, "loss": 0.1818559169769287, "mean_token_accuracy": 0.9171760529279709, "num_tokens": 51895496.0, "step": 4207 }, { "entropy": 1.1745121777057648, "epoch": 2.2159031068983674, "grad_norm": 0.2528412640094757, "learning_rate": 0.00016396291354465835, "loss": 0.1682814657688141, "mean_token_accuracy": 0.9309436827898026, "num_tokens": 51907832.0, "step": 4208 }, { "entropy": 1.127808690071106, "epoch": 2.2164296998420223, "grad_norm": 0.27972131967544556, "learning_rate": 0.0001639453625397271, "loss": 0.1828276664018631, "mean_token_accuracy": 0.9239791631698608, "num_tokens": 51920168.0, "step": 4209 }, { "entropy": 1.2046663463115692, "epoch": 2.2169562927856767, "grad_norm": 0.28617292642593384, "learning_rate": 0.000163927808332374, "loss": 0.1929018497467041, "mean_token_accuracy": 0.9188937544822693, "num_tokens": 51932504.0, "step": 4210 }, { "entropy": 1.2402802407741547, "epoch": 2.217482885729331, "grad_norm": 0.30822160840034485, "learning_rate": 0.0001639102509236413, "loss": 0.22689157724380493, "mean_token_accuracy": 0.9049774557352066, "num_tokens": 51944840.0, "step": 4211 }, { "entropy": 1.2726169526576996, "epoch": 2.2180094786729856, "grad_norm": 0.31506627798080444, "learning_rate": 0.00016389269031457117, "loss": 0.18111148476600647, "mean_token_accuracy": 0.922523245215416, "num_tokens": 51957176.0, "step": 4212 }, { "entropy": 1.2062140107154846, "epoch": 2.2185360716166405, "grad_norm": 0.2667774558067322, "learning_rate": 0.00016387512650620616, "loss": 0.18210844695568085, "mean_token_accuracy": 0.9245853424072266, "num_tokens": 51969512.0, "step": 4213 }, { "entropy": 1.289791852235794, "epoch": 2.219062664560295, "grad_norm": 0.3121054470539093, "learning_rate": 0.00016385755949958888, "loss": 0.22761571407318115, "mean_token_accuracy": 0.9057991802692413, "num_tokens": 51981848.0, "step": 4214 }, { "entropy": 1.2653508186340332, "epoch": 2.2195892575039493, "grad_norm": 0.27332237362861633, "learning_rate": 0.0001638399892957622, "loss": 0.19882501661777496, "mean_token_accuracy": 0.9142513871192932, "num_tokens": 51994184.0, "step": 4215 }, { "entropy": 1.275252342224121, "epoch": 2.220115850447604, "grad_norm": 0.2822205126285553, "learning_rate": 0.00016382241589576918, "loss": 0.19739031791687012, "mean_token_accuracy": 0.9224513620138168, "num_tokens": 52006520.0, "step": 4216 }, { "entropy": 1.3314436376094818, "epoch": 2.2206424433912586, "grad_norm": 0.2844606041908264, "learning_rate": 0.000163804839300653, "loss": 0.18049627542495728, "mean_token_accuracy": 0.9332050979137421, "num_tokens": 52018856.0, "step": 4217 }, { "entropy": 1.311014175415039, "epoch": 2.221169036334913, "grad_norm": 0.28489887714385986, "learning_rate": 0.00016378725951145712, "loss": 0.17989040911197662, "mean_token_accuracy": 0.9219749569892883, "num_tokens": 52031192.0, "step": 4218 }, { "entropy": 1.2845270931720734, "epoch": 2.2216956292785675, "grad_norm": 0.27442827820777893, "learning_rate": 0.00016376967652922513, "loss": 0.19630296528339386, "mean_token_accuracy": 0.9183860868215561, "num_tokens": 52043528.0, "step": 4219 }, { "entropy": 1.3556245565414429, "epoch": 2.2222222222222223, "grad_norm": 0.3226070702075958, "learning_rate": 0.00016375209035500088, "loss": 0.21448081731796265, "mean_token_accuracy": 0.912571057677269, "num_tokens": 52055864.0, "step": 4220 }, { "entropy": 1.3001513183116913, "epoch": 2.2227488151658767, "grad_norm": 0.27793556451797485, "learning_rate": 0.00016373450098982825, "loss": 0.1880507916212082, "mean_token_accuracy": 0.9209636598825455, "num_tokens": 52068200.0, "step": 4221 }, { "entropy": 1.3293032348155975, "epoch": 2.223275408109531, "grad_norm": 0.2972993552684784, "learning_rate": 0.00016371690843475153, "loss": 0.21140480041503906, "mean_token_accuracy": 0.9138139635324478, "num_tokens": 52080536.0, "step": 4222 }, { "entropy": 1.3074055314064026, "epoch": 2.223802001053186, "grad_norm": 0.3054673671722412, "learning_rate": 0.00016369931269081503, "loss": 0.2108297497034073, "mean_token_accuracy": 0.9098422229290009, "num_tokens": 52092872.0, "step": 4223 }, { "entropy": 1.3391023874282837, "epoch": 2.2243285939968405, "grad_norm": 0.3014651834964752, "learning_rate": 0.00016368171375906332, "loss": 0.17931891977787018, "mean_token_accuracy": 0.92972631752491, "num_tokens": 52105208.0, "step": 4224 }, { "entropy": 1.33422189950943, "epoch": 2.224855186940495, "grad_norm": 0.2674652636051178, "learning_rate": 0.00016366411164054113, "loss": 0.19167745113372803, "mean_token_accuracy": 0.9219842851161957, "num_tokens": 52117544.0, "step": 4225 }, { "entropy": 1.3092358112335205, "epoch": 2.2253817798841498, "grad_norm": 0.27045342326164246, "learning_rate": 0.00016364650633629343, "loss": 0.1807311475276947, "mean_token_accuracy": 0.9232537895441055, "num_tokens": 52129880.0, "step": 4226 }, { "entropy": 1.2968615889549255, "epoch": 2.225908372827804, "grad_norm": 0.2784993052482605, "learning_rate": 0.0001636288978473653, "loss": 0.1864447295665741, "mean_token_accuracy": 0.9230673313140869, "num_tokens": 52142216.0, "step": 4227 }, { "entropy": 1.329050749540329, "epoch": 2.2264349657714586, "grad_norm": 0.27790436148643494, "learning_rate": 0.00016361128617480212, "loss": 0.18269293010234833, "mean_token_accuracy": 0.9271285682916641, "num_tokens": 52154552.0, "step": 4228 }, { "entropy": 1.239962786436081, "epoch": 2.226961558715113, "grad_norm": 0.29057615995407104, "learning_rate": 0.0001635936713196493, "loss": 0.2014170140028, "mean_token_accuracy": 0.9164643883705139, "num_tokens": 52166888.0, "step": 4229 }, { "entropy": 1.3514109253883362, "epoch": 2.227488151658768, "grad_norm": 0.27092015743255615, "learning_rate": 0.00016357605328295262, "loss": 0.1870952844619751, "mean_token_accuracy": 0.9230411946773529, "num_tokens": 52179224.0, "step": 4230 }, { "entropy": 1.3073534667491913, "epoch": 2.2280147446024223, "grad_norm": 0.2956768870353699, "learning_rate": 0.00016355843206575794, "loss": 0.19634544849395752, "mean_token_accuracy": 0.9185549914836884, "num_tokens": 52191560.0, "step": 4231 }, { "entropy": 1.251263678073883, "epoch": 2.2285413375460768, "grad_norm": 0.309213787317276, "learning_rate": 0.00016354080766911127, "loss": 0.20773160457611084, "mean_token_accuracy": 0.9145363122224808, "num_tokens": 52203896.0, "step": 4232 }, { "entropy": 1.2692146599292755, "epoch": 2.2290679304897316, "grad_norm": 0.2713463008403778, "learning_rate": 0.00016352318009405891, "loss": 0.16297750174999237, "mean_token_accuracy": 0.9313487559556961, "num_tokens": 52216232.0, "step": 4233 }, { "entropy": 1.2983099818229675, "epoch": 2.229594523433386, "grad_norm": 0.4321221709251404, "learning_rate": 0.0001635055493416473, "loss": 0.18140633404254913, "mean_token_accuracy": 0.9271613657474518, "num_tokens": 52228568.0, "step": 4234 }, { "entropy": 1.2863817512989044, "epoch": 2.2301211163770405, "grad_norm": 0.2778743505477905, "learning_rate": 0.00016348791541292312, "loss": 0.1831590235233307, "mean_token_accuracy": 0.9236334264278412, "num_tokens": 52240904.0, "step": 4235 }, { "entropy": 1.188327044248581, "epoch": 2.230647709320695, "grad_norm": 0.27315250039100647, "learning_rate": 0.0001634702783089331, "loss": 0.17779839038848877, "mean_token_accuracy": 0.9250446408987045, "num_tokens": 52253240.0, "step": 4236 }, { "entropy": 1.262020230293274, "epoch": 2.2311743022643498, "grad_norm": 0.3055287003517151, "learning_rate": 0.00016345263803072433, "loss": 0.20651106536388397, "mean_token_accuracy": 0.9169783294200897, "num_tokens": 52265576.0, "step": 4237 }, { "entropy": 1.3503897488117218, "epoch": 2.231700895208004, "grad_norm": 0.29245615005493164, "learning_rate": 0.000163434994579344, "loss": 0.19317273795604706, "mean_token_accuracy": 0.9234201461076736, "num_tokens": 52277912.0, "step": 4238 }, { "entropy": 1.2586136758327484, "epoch": 2.2322274881516586, "grad_norm": 0.2817426025867462, "learning_rate": 0.00016341734795583947, "loss": 0.2006417214870453, "mean_token_accuracy": 0.9167672246694565, "num_tokens": 52290248.0, "step": 4239 }, { "entropy": 1.2308941781520844, "epoch": 2.2327540810953135, "grad_norm": 0.3034634590148926, "learning_rate": 0.00016339969816125832, "loss": 0.19974562525749207, "mean_token_accuracy": 0.9195841699838638, "num_tokens": 52302584.0, "step": 4240 }, { "entropy": 1.305918425321579, "epoch": 2.233280674038968, "grad_norm": 0.2764703035354614, "learning_rate": 0.00016338204519664835, "loss": 0.19095191359519958, "mean_token_accuracy": 0.922985702753067, "num_tokens": 52314920.0, "step": 4241 }, { "entropy": 1.2824455499649048, "epoch": 2.2338072669826223, "grad_norm": 0.25803378224372864, "learning_rate": 0.00016336438906305748, "loss": 0.18053492903709412, "mean_token_accuracy": 0.9281091690063477, "num_tokens": 52327256.0, "step": 4242 }, { "entropy": 1.3713833093643188, "epoch": 2.234333859926277, "grad_norm": 0.26806026697158813, "learning_rate": 0.00016334672976153384, "loss": 0.1849786639213562, "mean_token_accuracy": 0.929167240858078, "num_tokens": 52339592.0, "step": 4243 }, { "entropy": 1.3161489963531494, "epoch": 2.2348604528699316, "grad_norm": 0.25630515813827515, "learning_rate": 0.0001633290672931258, "loss": 0.17108337581157684, "mean_token_accuracy": 0.9340009987354279, "num_tokens": 52351928.0, "step": 4244 }, { "entropy": 1.3286859691143036, "epoch": 2.235387045813586, "grad_norm": 0.29029756784439087, "learning_rate": 0.0001633114016588819, "loss": 0.20633910596370697, "mean_token_accuracy": 0.909833550453186, "num_tokens": 52364264.0, "step": 4245 }, { "entropy": 1.329633116722107, "epoch": 2.2359136387572405, "grad_norm": 0.2533878684043884, "learning_rate": 0.00016329373285985078, "loss": 0.19495350122451782, "mean_token_accuracy": 0.9151149392127991, "num_tokens": 52376600.0, "step": 4246 }, { "entropy": 1.3563131988048553, "epoch": 2.2364402317008953, "grad_norm": 0.26852771639823914, "learning_rate": 0.0001632760608970813, "loss": 0.18576224148273468, "mean_token_accuracy": 0.9227636158466339, "num_tokens": 52388936.0, "step": 4247 }, { "entropy": 1.358976662158966, "epoch": 2.2369668246445498, "grad_norm": 0.2841165065765381, "learning_rate": 0.00016325838577162266, "loss": 0.2020607888698578, "mean_token_accuracy": 0.917872816324234, "num_tokens": 52401272.0, "step": 4248 }, { "entropy": 1.4256496131420135, "epoch": 2.237493417588204, "grad_norm": 0.2953294515609741, "learning_rate": 0.00016324070748452408, "loss": 0.20347987115383148, "mean_token_accuracy": 0.9172584414482117, "num_tokens": 52413608.0, "step": 4249 }, { "entropy": 1.382269710302353, "epoch": 2.238020010531859, "grad_norm": 0.2767752707004547, "learning_rate": 0.000163223026036835, "loss": 0.19072210788726807, "mean_token_accuracy": 0.9170867800712585, "num_tokens": 52425944.0, "step": 4250 }, { "entropy": 1.3237777650356293, "epoch": 2.2385466034755135, "grad_norm": 0.26159167289733887, "learning_rate": 0.00016320534142960503, "loss": 0.1843932569026947, "mean_token_accuracy": 0.921222910284996, "num_tokens": 52438280.0, "step": 4251 }, { "entropy": 1.3900092542171478, "epoch": 2.239073196419168, "grad_norm": 0.29133832454681396, "learning_rate": 0.0001631876536638841, "loss": 0.18629711866378784, "mean_token_accuracy": 0.927318811416626, "num_tokens": 52450616.0, "step": 4252 }, { "entropy": 1.3216579258441925, "epoch": 2.2395997893628223, "grad_norm": 0.28946828842163086, "learning_rate": 0.00016316996274072217, "loss": 0.19785767793655396, "mean_token_accuracy": 0.9227815121412277, "num_tokens": 52462952.0, "step": 4253 }, { "entropy": 1.3586134910583496, "epoch": 2.240126382306477, "grad_norm": 0.27580100297927856, "learning_rate": 0.00016315226866116941, "loss": 0.195715993642807, "mean_token_accuracy": 0.9197490960359573, "num_tokens": 52475288.0, "step": 4254 }, { "entropy": 1.3740904033184052, "epoch": 2.2406529752501316, "grad_norm": 0.28149449825286865, "learning_rate": 0.00016313457142627628, "loss": 0.1904170960187912, "mean_token_accuracy": 0.9227342903614044, "num_tokens": 52487624.0, "step": 4255 }, { "entropy": 1.3365713357925415, "epoch": 2.241179568193786, "grad_norm": 0.2665024697780609, "learning_rate": 0.00016311687103709333, "loss": 0.1871342957019806, "mean_token_accuracy": 0.9221449494361877, "num_tokens": 52499960.0, "step": 4256 }, { "entropy": 1.3210458755493164, "epoch": 2.241706161137441, "grad_norm": 0.29255783557891846, "learning_rate": 0.0001630991674946713, "loss": 0.20028424263000488, "mean_token_accuracy": 0.9167197197675705, "num_tokens": 52512296.0, "step": 4257 }, { "entropy": 1.3026900589466095, "epoch": 2.2422327540810953, "grad_norm": 0.2644364833831787, "learning_rate": 0.00016308146080006123, "loss": 0.18610155582427979, "mean_token_accuracy": 0.9260168969631195, "num_tokens": 52524632.0, "step": 4258 }, { "entropy": 1.334023267030716, "epoch": 2.2427593470247498, "grad_norm": 0.29489240050315857, "learning_rate": 0.00016306375095431422, "loss": 0.19872379302978516, "mean_token_accuracy": 0.9185984432697296, "num_tokens": 52536968.0, "step": 4259 }, { "entropy": 1.3495826721191406, "epoch": 2.2432859399684046, "grad_norm": 0.2851937413215637, "learning_rate": 0.00016304603795848157, "loss": 0.19495224952697754, "mean_token_accuracy": 0.9217026382684708, "num_tokens": 52549304.0, "step": 4260 }, { "entropy": 1.305820494890213, "epoch": 2.243812532912059, "grad_norm": 0.28069403767585754, "learning_rate": 0.0001630283218136148, "loss": 0.19976091384887695, "mean_token_accuracy": 0.9190419614315033, "num_tokens": 52561640.0, "step": 4261 }, { "entropy": 1.33967986702919, "epoch": 2.2443391258557135, "grad_norm": 0.3040577471256256, "learning_rate": 0.00016301060252076567, "loss": 0.207487553358078, "mean_token_accuracy": 0.916191965341568, "num_tokens": 52573976.0, "step": 4262 }, { "entropy": 1.29051473736763, "epoch": 2.244865718799368, "grad_norm": 0.27407845854759216, "learning_rate": 0.00016299288008098605, "loss": 0.19776585698127747, "mean_token_accuracy": 0.9183499664068222, "num_tokens": 52586312.0, "step": 4263 }, { "entropy": 1.3070797622203827, "epoch": 2.245392311743023, "grad_norm": 0.27223050594329834, "learning_rate": 0.00016297515449532795, "loss": 0.18903937935829163, "mean_token_accuracy": 0.9230516403913498, "num_tokens": 52598648.0, "step": 4264 }, { "entropy": 1.2732833623886108, "epoch": 2.245918904686677, "grad_norm": 0.25695350766181946, "learning_rate": 0.00016295742576484377, "loss": 0.16693276166915894, "mean_token_accuracy": 0.9326575249433517, "num_tokens": 52610984.0, "step": 4265 }, { "entropy": 1.3194738030433655, "epoch": 2.2464454976303316, "grad_norm": 0.25403544306755066, "learning_rate": 0.0001629396938905858, "loss": 0.16951501369476318, "mean_token_accuracy": 0.9296520501375198, "num_tokens": 52623320.0, "step": 4266 }, { "entropy": 1.315958708524704, "epoch": 2.2469720905739865, "grad_norm": 0.3142984211444855, "learning_rate": 0.00016292195887360683, "loss": 0.21278263628482819, "mean_token_accuracy": 0.9144498258829117, "num_tokens": 52635656.0, "step": 4267 }, { "entropy": 1.3089948296546936, "epoch": 2.247498683517641, "grad_norm": 0.31691795587539673, "learning_rate": 0.00016290422071495958, "loss": 0.2112875133752823, "mean_token_accuracy": 0.9154753535985947, "num_tokens": 52647992.0, "step": 4268 }, { "entropy": 1.3680811524391174, "epoch": 2.2480252764612954, "grad_norm": 0.31187358498573303, "learning_rate": 0.0001628864794156971, "loss": 0.21332678198814392, "mean_token_accuracy": 0.9160029590129852, "num_tokens": 52660328.0, "step": 4269 }, { "entropy": 1.262885570526123, "epoch": 2.2485518694049498, "grad_norm": 0.2790033519268036, "learning_rate": 0.0001628687349768726, "loss": 0.18170538544654846, "mean_token_accuracy": 0.931568443775177, "num_tokens": 52672664.0, "step": 4270 }, { "entropy": 1.265404999256134, "epoch": 2.2490784623486046, "grad_norm": 0.25181683897972107, "learning_rate": 0.00016285098739953938, "loss": 0.17339858412742615, "mean_token_accuracy": 0.9286882877349854, "num_tokens": 52685000.0, "step": 4271 }, { "entropy": 1.3293351829051971, "epoch": 2.249605055292259, "grad_norm": 0.2925328314304352, "learning_rate": 0.00016283323668475115, "loss": 0.19423630833625793, "mean_token_accuracy": 0.9217019081115723, "num_tokens": 52697336.0, "step": 4272 }, { "entropy": 1.3089188933372498, "epoch": 2.2501316482359135, "grad_norm": 0.31548264622688293, "learning_rate": 0.00016281548283356156, "loss": 0.18943582475185394, "mean_token_accuracy": 0.9233786463737488, "num_tokens": 52709672.0, "step": 4273 }, { "entropy": 1.2492122054100037, "epoch": 2.2506582411795684, "grad_norm": 0.27606451511383057, "learning_rate": 0.0001627977258470246, "loss": 0.18954810500144958, "mean_token_accuracy": 0.9246101230382919, "num_tokens": 52722008.0, "step": 4274 }, { "entropy": 1.2629761397838593, "epoch": 2.251184834123223, "grad_norm": 0.28441867232322693, "learning_rate": 0.00016277996572619437, "loss": 0.19405168294906616, "mean_token_accuracy": 0.923010841012001, "num_tokens": 52734344.0, "step": 4275 }, { "entropy": 1.2314798533916473, "epoch": 2.251711427066877, "grad_norm": 0.2783687710762024, "learning_rate": 0.00016276220247212522, "loss": 0.18629150092601776, "mean_token_accuracy": 0.923210546374321, "num_tokens": 52746680.0, "step": 4276 }, { "entropy": 1.2616170942783356, "epoch": 2.252238020010532, "grad_norm": 0.27606093883514404, "learning_rate": 0.0001627444360858716, "loss": 0.170989528298378, "mean_token_accuracy": 0.9309239387512207, "num_tokens": 52759016.0, "step": 4277 }, { "entropy": 1.197077065706253, "epoch": 2.2527646129541865, "grad_norm": 0.2800334692001343, "learning_rate": 0.00016272666656848826, "loss": 0.2011934369802475, "mean_token_accuracy": 0.9129274040460587, "num_tokens": 52771352.0, "step": 4278 }, { "entropy": 1.2784244120121002, "epoch": 2.253291205897841, "grad_norm": 0.308682382106781, "learning_rate": 0.00016270889392103001, "loss": 0.20107175409793854, "mean_token_accuracy": 0.919810488820076, "num_tokens": 52783688.0, "step": 4279 }, { "entropy": 1.2287653982639313, "epoch": 2.2538177988414954, "grad_norm": 0.28182491660118103, "learning_rate": 0.00016269111814455197, "loss": 0.18231971561908722, "mean_token_accuracy": 0.923517182469368, "num_tokens": 52796024.0, "step": 4280 }, { "entropy": 1.2548049986362457, "epoch": 2.2543443917851502, "grad_norm": 0.3218842148780823, "learning_rate": 0.00016267333924010934, "loss": 0.207222118973732, "mean_token_accuracy": 0.9176555424928665, "num_tokens": 52808360.0, "step": 4281 }, { "entropy": 1.2320858240127563, "epoch": 2.2548709847288047, "grad_norm": 0.3021528124809265, "learning_rate": 0.00016265555720875756, "loss": 0.19539406895637512, "mean_token_accuracy": 0.9212926179170609, "num_tokens": 52820696.0, "step": 4282 }, { "entropy": 1.2006807029247284, "epoch": 2.255397577672459, "grad_norm": 0.25874409079551697, "learning_rate": 0.00016263777205155223, "loss": 0.17395153641700745, "mean_token_accuracy": 0.9307205528020859, "num_tokens": 52833032.0, "step": 4283 }, { "entropy": 1.2096614241600037, "epoch": 2.2559241706161135, "grad_norm": 0.28012752532958984, "learning_rate": 0.00016261998376954922, "loss": 0.19147738814353943, "mean_token_accuracy": 0.9207902103662491, "num_tokens": 52845368.0, "step": 4284 }, { "entropy": 1.1712572574615479, "epoch": 2.2564507635597684, "grad_norm": 0.2657926082611084, "learning_rate": 0.0001626021923638044, "loss": 0.1850869357585907, "mean_token_accuracy": 0.9235047101974487, "num_tokens": 52857704.0, "step": 4285 }, { "entropy": 1.2101311385631561, "epoch": 2.256977356503423, "grad_norm": 0.2975207269191742, "learning_rate": 0.00016258439783537406, "loss": 0.20111596584320068, "mean_token_accuracy": 0.919817328453064, "num_tokens": 52870040.0, "step": 4286 }, { "entropy": 1.1905730962753296, "epoch": 2.257503949447077, "grad_norm": 0.2743525505065918, "learning_rate": 0.0001625666001853145, "loss": 0.1912555694580078, "mean_token_accuracy": 0.9214645624160767, "num_tokens": 52882376.0, "step": 4287 }, { "entropy": 1.1946870684623718, "epoch": 2.258030542390732, "grad_norm": 0.29676419496536255, "learning_rate": 0.00016254879941468223, "loss": 0.2016541063785553, "mean_token_accuracy": 0.9167199581861496, "num_tokens": 52894712.0, "step": 4288 }, { "entropy": 1.2338870167732239, "epoch": 2.2585571353343865, "grad_norm": 0.28669846057891846, "learning_rate": 0.00016253099552453407, "loss": 0.18671299517154694, "mean_token_accuracy": 0.9237444400787354, "num_tokens": 52907048.0, "step": 4289 }, { "entropy": 1.2231320142745972, "epoch": 2.259083728278041, "grad_norm": 0.29122886061668396, "learning_rate": 0.00016251318851592686, "loss": 0.19480589032173157, "mean_token_accuracy": 0.9223777800798416, "num_tokens": 52919384.0, "step": 4290 }, { "entropy": 1.2313807010650635, "epoch": 2.259610321221696, "grad_norm": 0.2886621057987213, "learning_rate": 0.0001624953783899177, "loss": 0.20268778502941132, "mean_token_accuracy": 0.9181878566741943, "num_tokens": 52931720.0, "step": 4291 }, { "entropy": 1.2376523911952972, "epoch": 2.2601369141653502, "grad_norm": 0.26574602723121643, "learning_rate": 0.0001624775651475639, "loss": 0.1816636472940445, "mean_token_accuracy": 0.9279394000768661, "num_tokens": 52944056.0, "step": 4292 }, { "entropy": 1.2119337618350983, "epoch": 2.2606635071090047, "grad_norm": 0.27368560433387756, "learning_rate": 0.0001624597487899229, "loss": 0.18821629881858826, "mean_token_accuracy": 0.9214064329862595, "num_tokens": 52956392.0, "step": 4293 }, { "entropy": 1.2653162479400635, "epoch": 2.2611901000526595, "grad_norm": 0.2919362187385559, "learning_rate": 0.0001624419293180524, "loss": 0.20762929320335388, "mean_token_accuracy": 0.912530779838562, "num_tokens": 52968728.0, "step": 4294 }, { "entropy": 1.273656576871872, "epoch": 2.261716692996314, "grad_norm": 0.2898019552230835, "learning_rate": 0.00016242410673301022, "loss": 0.1861550211906433, "mean_token_accuracy": 0.9242700487375259, "num_tokens": 52981064.0, "step": 4295 }, { "entropy": 1.2827538847923279, "epoch": 2.2622432859399684, "grad_norm": 0.2659165859222412, "learning_rate": 0.00016240628103585437, "loss": 0.19199910759925842, "mean_token_accuracy": 0.920208215713501, "num_tokens": 52993400.0, "step": 4296 }, { "entropy": 1.3939678966999054, "epoch": 2.262769878883623, "grad_norm": 0.2849959135055542, "learning_rate": 0.00016238845222764302, "loss": 0.17641255259513855, "mean_token_accuracy": 0.9284879267215729, "num_tokens": 53005736.0, "step": 4297 }, { "entropy": 1.3991989195346832, "epoch": 2.2632964718272777, "grad_norm": 0.2852117419242859, "learning_rate": 0.00016237062030943466, "loss": 0.19910377264022827, "mean_token_accuracy": 0.9214527308940887, "num_tokens": 53018072.0, "step": 4298 }, { "entropy": 1.3499420583248138, "epoch": 2.263823064770932, "grad_norm": 0.29614681005477905, "learning_rate": 0.00016235278528228778, "loss": 0.22492265701293945, "mean_token_accuracy": 0.9076694399118423, "num_tokens": 53030408.0, "step": 4299 }, { "entropy": 1.3215619325637817, "epoch": 2.2643496577145865, "grad_norm": 0.30598577857017517, "learning_rate": 0.00016233494714726118, "loss": 0.19633576273918152, "mean_token_accuracy": 0.9187863171100616, "num_tokens": 53042744.0, "step": 4300 }, { "entropy": 1.3638521432876587, "epoch": 2.264876250658241, "grad_norm": 0.2770838737487793, "learning_rate": 0.00016231710590541382, "loss": 0.18263986706733704, "mean_token_accuracy": 0.9262545853853226, "num_tokens": 53055080.0, "step": 4301 }, { "entropy": 1.319113403558731, "epoch": 2.265402843601896, "grad_norm": 0.28063175082206726, "learning_rate": 0.0001622992615578048, "loss": 0.200247123837471, "mean_token_accuracy": 0.917742520570755, "num_tokens": 53067416.0, "step": 4302 }, { "entropy": 1.2884471416473389, "epoch": 2.2659294365455502, "grad_norm": 0.2803884446620941, "learning_rate": 0.0001622814141054934, "loss": 0.19679561257362366, "mean_token_accuracy": 0.9207372665405273, "num_tokens": 53079752.0, "step": 4303 }, { "entropy": 1.3329062163829803, "epoch": 2.2664560294892047, "grad_norm": 0.2911641299724579, "learning_rate": 0.00016226356354953923, "loss": 0.19328062236309052, "mean_token_accuracy": 0.9168116897344589, "num_tokens": 53092088.0, "step": 4304 }, { "entropy": 1.3833136558532715, "epoch": 2.2669826224328595, "grad_norm": 0.33080819249153137, "learning_rate": 0.00016224570989100185, "loss": 0.19918012619018555, "mean_token_accuracy": 0.9184055626392365, "num_tokens": 53104424.0, "step": 4305 }, { "entropy": 1.3158639967441559, "epoch": 2.267509215376514, "grad_norm": 0.26879438757896423, "learning_rate": 0.0001622278531309412, "loss": 0.18872933089733124, "mean_token_accuracy": 0.9242192357778549, "num_tokens": 53116760.0, "step": 4306 }, { "entropy": 1.388542801141739, "epoch": 2.2680358083201684, "grad_norm": 0.3074987530708313, "learning_rate": 0.00016220999327041735, "loss": 0.2129671573638916, "mean_token_accuracy": 0.9109326601028442, "num_tokens": 53129096.0, "step": 4307 }, { "entropy": 1.3813231885433197, "epoch": 2.2685624012638232, "grad_norm": 0.2779155373573303, "learning_rate": 0.00016219213031049047, "loss": 0.18388351798057556, "mean_token_accuracy": 0.924717515707016, "num_tokens": 53141432.0, "step": 4308 }, { "entropy": 1.3881699442863464, "epoch": 2.2690889942074777, "grad_norm": 0.27398285269737244, "learning_rate": 0.00016217426425222103, "loss": 0.19520778954029083, "mean_token_accuracy": 0.925410807132721, "num_tokens": 53153768.0, "step": 4309 }, { "entropy": 1.3659266531467438, "epoch": 2.269615587151132, "grad_norm": 0.27490484714508057, "learning_rate": 0.00016215639509666957, "loss": 0.17789322137832642, "mean_token_accuracy": 0.9270453304052353, "num_tokens": 53166104.0, "step": 4310 }, { "entropy": 1.3776750266551971, "epoch": 2.270142180094787, "grad_norm": 0.3111220598220825, "learning_rate": 0.000162138522844897, "loss": 0.1980695277452469, "mean_token_accuracy": 0.9179234504699707, "num_tokens": 53178440.0, "step": 4311 }, { "entropy": 1.3968066573143005, "epoch": 2.2706687730384414, "grad_norm": 0.30460214614868164, "learning_rate": 0.00016212064749796418, "loss": 0.20272967219352722, "mean_token_accuracy": 0.9162765592336655, "num_tokens": 53190776.0, "step": 4312 }, { "entropy": 1.3836086690425873, "epoch": 2.271195365982096, "grad_norm": 0.2826038897037506, "learning_rate": 0.00016210276905693227, "loss": 0.19780540466308594, "mean_token_accuracy": 0.9176635593175888, "num_tokens": 53203112.0, "step": 4313 }, { "entropy": 1.39346045255661, "epoch": 2.2717219589257502, "grad_norm": 0.3027603030204773, "learning_rate": 0.00016208488752286269, "loss": 0.21689122915267944, "mean_token_accuracy": 0.90862837433815, "num_tokens": 53215448.0, "step": 4314 }, { "entropy": 1.3023641109466553, "epoch": 2.272248551869405, "grad_norm": 0.2757156491279602, "learning_rate": 0.00016206700289681688, "loss": 0.18307238817214966, "mean_token_accuracy": 0.9282919764518738, "num_tokens": 53227784.0, "step": 4315 }, { "entropy": 1.35664564371109, "epoch": 2.2727751448130595, "grad_norm": 0.28664660453796387, "learning_rate": 0.00016204911517985659, "loss": 0.19184020161628723, "mean_token_accuracy": 0.920403391122818, "num_tokens": 53240120.0, "step": 4316 }, { "entropy": 1.3529805839061737, "epoch": 2.273301737756714, "grad_norm": 0.28960809111595154, "learning_rate": 0.0001620312243730437, "loss": 0.18796728551387787, "mean_token_accuracy": 0.9186430126428604, "num_tokens": 53252456.0, "step": 4317 }, { "entropy": 1.2922759354114532, "epoch": 2.2738283307003684, "grad_norm": 0.2737516760826111, "learning_rate": 0.00016201333047744025, "loss": 0.17952796816825867, "mean_token_accuracy": 0.9263361543416977, "num_tokens": 53264792.0, "step": 4318 }, { "entropy": 1.2446196675300598, "epoch": 2.2743549236440233, "grad_norm": 0.2577621042728424, "learning_rate": 0.00016199543349410854, "loss": 0.18877744674682617, "mean_token_accuracy": 0.92601378262043, "num_tokens": 53277128.0, "step": 4319 }, { "entropy": 1.2977658212184906, "epoch": 2.2748815165876777, "grad_norm": 0.27885574102401733, "learning_rate": 0.000161977533424111, "loss": 0.1956649273633957, "mean_token_accuracy": 0.9176055639982224, "num_tokens": 53289464.0, "step": 4320 }, { "entropy": 1.312001883983612, "epoch": 2.275408109531332, "grad_norm": 0.2542676031589508, "learning_rate": 0.00016195963026851027, "loss": 0.16451983153820038, "mean_token_accuracy": 0.9343025386333466, "num_tokens": 53301800.0, "step": 4321 }, { "entropy": 1.3300804793834686, "epoch": 2.275934702474987, "grad_norm": 0.2855078876018524, "learning_rate": 0.0001619417240283691, "loss": 0.18589822947978973, "mean_token_accuracy": 0.9211694002151489, "num_tokens": 53314136.0, "step": 4322 }, { "entropy": 1.3246194124221802, "epoch": 2.2764612954186414, "grad_norm": 0.2893201410770416, "learning_rate": 0.00016192381470475054, "loss": 0.18851175904273987, "mean_token_accuracy": 0.9267619699239731, "num_tokens": 53326472.0, "step": 4323 }, { "entropy": 1.2888253331184387, "epoch": 2.276987888362296, "grad_norm": 0.2698841989040375, "learning_rate": 0.00016190590229871773, "loss": 0.19300393760204315, "mean_token_accuracy": 0.9214081466197968, "num_tokens": 53338808.0, "step": 4324 }, { "entropy": 1.285881131887436, "epoch": 2.2775144813059507, "grad_norm": 0.27817195653915405, "learning_rate": 0.00016188798681133403, "loss": 0.1776391863822937, "mean_token_accuracy": 0.9255973249673843, "num_tokens": 53351144.0, "step": 4325 }, { "entropy": 1.330023616552353, "epoch": 2.278041074249605, "grad_norm": 0.2973087728023529, "learning_rate": 0.00016187006824366297, "loss": 0.21736116707324982, "mean_token_accuracy": 0.9165065437555313, "num_tokens": 53363480.0, "step": 4326 }, { "entropy": 1.3090458810329437, "epoch": 2.2785676671932595, "grad_norm": 0.2864411473274231, "learning_rate": 0.00016185214659676832, "loss": 0.18242886662483215, "mean_token_accuracy": 0.9262679815292358, "num_tokens": 53375816.0, "step": 4327 }, { "entropy": 1.3205254673957825, "epoch": 2.2790942601369144, "grad_norm": 0.2983349859714508, "learning_rate": 0.0001618342218717139, "loss": 0.18693310022354126, "mean_token_accuracy": 0.9253579378128052, "num_tokens": 53388152.0, "step": 4328 }, { "entropy": 1.3446447551250458, "epoch": 2.279620853080569, "grad_norm": 0.28103673458099365, "learning_rate": 0.00016181629406956385, "loss": 0.19234877824783325, "mean_token_accuracy": 0.9203990995883942, "num_tokens": 53400488.0, "step": 4329 }, { "entropy": 1.3458137810230255, "epoch": 2.2801474460242233, "grad_norm": 0.30117067694664, "learning_rate": 0.00016179836319138243, "loss": 0.19072972238063812, "mean_token_accuracy": 0.9225273281335831, "num_tokens": 53412824.0, "step": 4330 }, { "entropy": 1.3791090846061707, "epoch": 2.2806740389678777, "grad_norm": 0.3069910705089569, "learning_rate": 0.00016178042923823405, "loss": 0.20394977927207947, "mean_token_accuracy": 0.9209769368171692, "num_tokens": 53425160.0, "step": 4331 }, { "entropy": 1.3324054777622223, "epoch": 2.2812006319115326, "grad_norm": 0.25391244888305664, "learning_rate": 0.00016176249221118346, "loss": 0.1717671900987625, "mean_token_accuracy": 0.9276586025953293, "num_tokens": 53437496.0, "step": 4332 }, { "entropy": 1.3155920505523682, "epoch": 2.281727224855187, "grad_norm": 0.2734282314777374, "learning_rate": 0.00016174455211129536, "loss": 0.18031081557273865, "mean_token_accuracy": 0.9291572421789169, "num_tokens": 53449832.0, "step": 4333 }, { "entropy": 1.349910020828247, "epoch": 2.2822538177988414, "grad_norm": 0.2482135146856308, "learning_rate": 0.0001617266089396348, "loss": 0.1759587526321411, "mean_token_accuracy": 0.9239980727434158, "num_tokens": 53462168.0, "step": 4334 }, { "entropy": 1.378309428691864, "epoch": 2.282780410742496, "grad_norm": 0.27560997009277344, "learning_rate": 0.00016170866269726695, "loss": 0.19269959628582, "mean_token_accuracy": 0.9190654456615448, "num_tokens": 53474504.0, "step": 4335 }, { "entropy": 1.3972489535808563, "epoch": 2.2833070036861507, "grad_norm": 0.27502357959747314, "learning_rate": 0.00016169071338525718, "loss": 0.19034190475940704, "mean_token_accuracy": 0.9181709289550781, "num_tokens": 53486840.0, "step": 4336 }, { "entropy": 1.3337211310863495, "epoch": 2.283833596629805, "grad_norm": 0.2534601092338562, "learning_rate": 0.00016167276100467103, "loss": 0.17808862030506134, "mean_token_accuracy": 0.9231080412864685, "num_tokens": 53499176.0, "step": 4337 }, { "entropy": 1.4127607941627502, "epoch": 2.2843601895734595, "grad_norm": 0.3043602406978607, "learning_rate": 0.00016165480555657425, "loss": 0.21522895991802216, "mean_token_accuracy": 0.9097288846969604, "num_tokens": 53511512.0, "step": 4338 }, { "entropy": 1.316486895084381, "epoch": 2.2848867825171144, "grad_norm": 0.2641633152961731, "learning_rate": 0.0001616368470420327, "loss": 0.18304666876792908, "mean_token_accuracy": 0.9187512695789337, "num_tokens": 53523848.0, "step": 4339 }, { "entropy": 1.3706423938274384, "epoch": 2.285413375460769, "grad_norm": 0.2619921565055847, "learning_rate": 0.00016161888546211252, "loss": 0.20312339067459106, "mean_token_accuracy": 0.913113921880722, "num_tokens": 53536184.0, "step": 4340 }, { "entropy": 1.2946105301380157, "epoch": 2.2859399684044233, "grad_norm": 0.2881142497062683, "learning_rate": 0.00016160092081787995, "loss": 0.1995781809091568, "mean_token_accuracy": 0.9192468374967575, "num_tokens": 53548520.0, "step": 4341 }, { "entropy": 1.41688871383667, "epoch": 2.286466561348078, "grad_norm": 0.2905746102333069, "learning_rate": 0.0001615829531104015, "loss": 0.21028542518615723, "mean_token_accuracy": 0.9094423651695251, "num_tokens": 53560856.0, "step": 4342 }, { "entropy": 1.2906908690929413, "epoch": 2.2869931542917326, "grad_norm": 0.24352654814720154, "learning_rate": 0.00016156498234074374, "loss": 0.1764492690563202, "mean_token_accuracy": 0.9228947311639786, "num_tokens": 53573192.0, "step": 4343 }, { "entropy": 1.33392733335495, "epoch": 2.287519747235387, "grad_norm": 0.26100727915763855, "learning_rate": 0.00016154700850997355, "loss": 0.19272339344024658, "mean_token_accuracy": 0.9170558750629425, "num_tokens": 53585528.0, "step": 4344 }, { "entropy": 1.2810238003730774, "epoch": 2.288046340179042, "grad_norm": 0.2741535007953644, "learning_rate": 0.00016152903161915789, "loss": 0.1874852180480957, "mean_token_accuracy": 0.9228169918060303, "num_tokens": 53597864.0, "step": 4345 }, { "entropy": 1.2848420143127441, "epoch": 2.2885729331226963, "grad_norm": 0.2634083926677704, "learning_rate": 0.00016151105166936394, "loss": 0.19013947248458862, "mean_token_accuracy": 0.9219299107789993, "num_tokens": 53610200.0, "step": 4346 }, { "entropy": 1.2308179140090942, "epoch": 2.2890995260663507, "grad_norm": 0.28782540559768677, "learning_rate": 0.0001614930686616591, "loss": 0.19066664576530457, "mean_token_accuracy": 0.9219117313623428, "num_tokens": 53622536.0, "step": 4347 }, { "entropy": 1.2573314607143402, "epoch": 2.289626119010005, "grad_norm": 0.2767718434333801, "learning_rate": 0.00016147508259711088, "loss": 0.18270361423492432, "mean_token_accuracy": 0.9219647794961929, "num_tokens": 53634872.0, "step": 4348 }, { "entropy": 1.299607902765274, "epoch": 2.29015271195366, "grad_norm": 0.2846214175224304, "learning_rate": 0.00016145709347678707, "loss": 0.19855788350105286, "mean_token_accuracy": 0.9172389805316925, "num_tokens": 53647208.0, "step": 4349 }, { "entropy": 1.2599292993545532, "epoch": 2.2906793048973144, "grad_norm": 0.2899573743343353, "learning_rate": 0.0001614391013017555, "loss": 0.19316795468330383, "mean_token_accuracy": 0.9196108430624008, "num_tokens": 53659544.0, "step": 4350 }, { "entropy": 1.2123220264911652, "epoch": 2.291205897840969, "grad_norm": 0.272175669670105, "learning_rate": 0.0001614211060730843, "loss": 0.19963154196739197, "mean_token_accuracy": 0.9213588237762451, "num_tokens": 53671880.0, "step": 4351 }, { "entropy": 1.2599426805973053, "epoch": 2.2917324907846233, "grad_norm": 0.2871687114238739, "learning_rate": 0.0001614031077918417, "loss": 0.1960330456495285, "mean_token_accuracy": 0.9175105392932892, "num_tokens": 53684216.0, "step": 4352 }, { "entropy": 1.2873346507549286, "epoch": 2.292259083728278, "grad_norm": 0.2764008343219757, "learning_rate": 0.00016138510645909626, "loss": 0.1853741705417633, "mean_token_accuracy": 0.9236430674791336, "num_tokens": 53696552.0, "step": 4353 }, { "entropy": 1.2654350399971008, "epoch": 2.2927856766719326, "grad_norm": 0.3239395320415497, "learning_rate": 0.00016136710207591653, "loss": 0.18854394555091858, "mean_token_accuracy": 0.926001563668251, "num_tokens": 53708888.0, "step": 4354 }, { "entropy": 1.2028826177120209, "epoch": 2.293312269615587, "grad_norm": 0.2788753807544708, "learning_rate": 0.0001613490946433713, "loss": 0.19624781608581543, "mean_token_accuracy": 0.9118239730596542, "num_tokens": 53721224.0, "step": 4355 }, { "entropy": 1.2995253801345825, "epoch": 2.293838862559242, "grad_norm": 0.2672927975654602, "learning_rate": 0.0001613310841625296, "loss": 0.1733776032924652, "mean_token_accuracy": 0.9293322563171387, "num_tokens": 53733560.0, "step": 4356 }, { "entropy": 1.2344202101230621, "epoch": 2.2943654555028963, "grad_norm": 0.2676299512386322, "learning_rate": 0.0001613130706344607, "loss": 0.18073591589927673, "mean_token_accuracy": 0.9267222881317139, "num_tokens": 53745896.0, "step": 4357 }, { "entropy": 1.213013082742691, "epoch": 2.2948920484465507, "grad_norm": 0.29037851095199585, "learning_rate": 0.00016129505406023382, "loss": 0.20425663888454437, "mean_token_accuracy": 0.911371037364006, "num_tokens": 53758232.0, "step": 4358 }, { "entropy": 1.283359169960022, "epoch": 2.2954186413902056, "grad_norm": 0.2981805205345154, "learning_rate": 0.00016127703444091852, "loss": 0.18576066195964813, "mean_token_accuracy": 0.9234738498926163, "num_tokens": 53770568.0, "step": 4359 }, { "entropy": 1.3199339807033539, "epoch": 2.29594523433386, "grad_norm": 0.33105799555778503, "learning_rate": 0.00016125901177758457, "loss": 0.21435634791851044, "mean_token_accuracy": 0.9107922315597534, "num_tokens": 53782904.0, "step": 4360 }, { "entropy": 1.299638718366623, "epoch": 2.2964718272775144, "grad_norm": 0.2832479774951935, "learning_rate": 0.00016124098607130184, "loss": 0.19559845328330994, "mean_token_accuracy": 0.9197534024715424, "num_tokens": 53795240.0, "step": 4361 }, { "entropy": 1.2708514034748077, "epoch": 2.296998420221169, "grad_norm": 0.2999652624130249, "learning_rate": 0.00016122295732314042, "loss": 0.20792636275291443, "mean_token_accuracy": 0.9146489202976227, "num_tokens": 53807576.0, "step": 4362 }, { "entropy": 1.2924802005290985, "epoch": 2.2975250131648237, "grad_norm": 0.27054089307785034, "learning_rate": 0.00016120492553417065, "loss": 0.1762731522321701, "mean_token_accuracy": 0.9278860241174698, "num_tokens": 53819912.0, "step": 4363 }, { "entropy": 1.3254149854183197, "epoch": 2.298051606108478, "grad_norm": 0.2686094045639038, "learning_rate": 0.0001611868907054628, "loss": 0.17815278470516205, "mean_token_accuracy": 0.9264986962080002, "num_tokens": 53832248.0, "step": 4364 }, { "entropy": 1.3951729238033295, "epoch": 2.2985781990521326, "grad_norm": 0.28512006998062134, "learning_rate": 0.00016116885283808764, "loss": 0.201333150267601, "mean_token_accuracy": 0.9201938062906265, "num_tokens": 53844584.0, "step": 4365 }, { "entropy": 1.312125563621521, "epoch": 2.2991047919957874, "grad_norm": 0.27145853638648987, "learning_rate": 0.00016115081193311592, "loss": 0.17296220362186432, "mean_token_accuracy": 0.9303802251815796, "num_tokens": 53856920.0, "step": 4366 }, { "entropy": 1.3520390391349792, "epoch": 2.299631384939442, "grad_norm": 0.2710401713848114, "learning_rate": 0.00016113276799161857, "loss": 0.1911015808582306, "mean_token_accuracy": 0.918425902724266, "num_tokens": 53869256.0, "step": 4367 }, { "entropy": 1.4310398697853088, "epoch": 2.3001579778830963, "grad_norm": 0.30252817273139954, "learning_rate": 0.00016111472101466688, "loss": 0.20369470119476318, "mean_token_accuracy": 0.9167941361665726, "num_tokens": 53881592.0, "step": 4368 }, { "entropy": 1.357957899570465, "epoch": 2.3006845708267507, "grad_norm": 0.26683077216148376, "learning_rate": 0.00016109667100333208, "loss": 0.1931741088628769, "mean_token_accuracy": 0.9199745804071426, "num_tokens": 53893928.0, "step": 4369 }, { "entropy": 1.4150426983833313, "epoch": 2.3012111637704056, "grad_norm": 0.2798272669315338, "learning_rate": 0.00016107861795868576, "loss": 0.1891252100467682, "mean_token_accuracy": 0.9210709631443024, "num_tokens": 53906264.0, "step": 4370 }, { "entropy": 1.3921004831790924, "epoch": 2.30173775671406, "grad_norm": 0.27035799622535706, "learning_rate": 0.00016106056188179958, "loss": 0.18214790523052216, "mean_token_accuracy": 0.9235829561948776, "num_tokens": 53918600.0, "step": 4371 }, { "entropy": 1.3772303760051727, "epoch": 2.3022643496577144, "grad_norm": 0.2842561900615692, "learning_rate": 0.00016104250277374548, "loss": 0.20173102617263794, "mean_token_accuracy": 0.9209082275629044, "num_tokens": 53930936.0, "step": 4372 }, { "entropy": 1.3774393200874329, "epoch": 2.3027909426013693, "grad_norm": 0.27162718772888184, "learning_rate": 0.00016102444063559546, "loss": 0.19384866952896118, "mean_token_accuracy": 0.9170814156532288, "num_tokens": 53943272.0, "step": 4373 }, { "entropy": 1.336693435907364, "epoch": 2.3033175355450237, "grad_norm": 0.25225090980529785, "learning_rate": 0.00016100637546842179, "loss": 0.1860221028327942, "mean_token_accuracy": 0.9214341193437576, "num_tokens": 53955608.0, "step": 4374 }, { "entropy": 1.330688863992691, "epoch": 2.303844128488678, "grad_norm": 0.2605641484260559, "learning_rate": 0.00016098830727329693, "loss": 0.17431269586086273, "mean_token_accuracy": 0.9278644174337387, "num_tokens": 53967944.0, "step": 4375 }, { "entropy": 1.344216674566269, "epoch": 2.304370721432333, "grad_norm": 0.2637542486190796, "learning_rate": 0.0001609702360512934, "loss": 0.17134076356887817, "mean_token_accuracy": 0.929853156208992, "num_tokens": 53980280.0, "step": 4376 }, { "entropy": 1.3215482532978058, "epoch": 2.3048973143759874, "grad_norm": 0.28528934717178345, "learning_rate": 0.00016095216180348406, "loss": 0.19538789987564087, "mean_token_accuracy": 0.9190406650304794, "num_tokens": 53992616.0, "step": 4377 }, { "entropy": 1.3346219658851624, "epoch": 2.305423907319642, "grad_norm": 0.2910776734352112, "learning_rate": 0.00016093408453094182, "loss": 0.19502344727516174, "mean_token_accuracy": 0.9186424911022186, "num_tokens": 54004952.0, "step": 4378 }, { "entropy": 1.303836166858673, "epoch": 2.3059505002632963, "grad_norm": 0.27647870779037476, "learning_rate": 0.00016091600423473988, "loss": 0.18278121948242188, "mean_token_accuracy": 0.9247827529907227, "num_tokens": 54017288.0, "step": 4379 }, { "entropy": 1.3144015967845917, "epoch": 2.306477093206951, "grad_norm": 0.27541449666023254, "learning_rate": 0.00016089792091595153, "loss": 0.17720472812652588, "mean_token_accuracy": 0.9278306365013123, "num_tokens": 54029624.0, "step": 4380 }, { "entropy": 1.3188709318637848, "epoch": 2.3070036861506056, "grad_norm": 0.27120038866996765, "learning_rate": 0.00016087983457565026, "loss": 0.18134379386901855, "mean_token_accuracy": 0.9238206744194031, "num_tokens": 54041960.0, "step": 4381 }, { "entropy": 1.2987216711044312, "epoch": 2.30753027909426, "grad_norm": 0.2692391276359558, "learning_rate": 0.00016086174521490976, "loss": 0.18199361860752106, "mean_token_accuracy": 0.9220229238271713, "num_tokens": 54054296.0, "step": 4382 }, { "entropy": 1.3269225060939789, "epoch": 2.308056872037915, "grad_norm": 0.30096539855003357, "learning_rate": 0.00016084365283480388, "loss": 0.1970018595457077, "mean_token_accuracy": 0.9222443252801895, "num_tokens": 54066632.0, "step": 4383 }, { "entropy": 1.2876869142055511, "epoch": 2.3085834649815693, "grad_norm": 0.278378963470459, "learning_rate": 0.00016082555743640668, "loss": 0.19296762347221375, "mean_token_accuracy": 0.9184974581003189, "num_tokens": 54078968.0, "step": 4384 }, { "entropy": 1.3124735057353973, "epoch": 2.3091100579252237, "grad_norm": 0.2990483045578003, "learning_rate": 0.00016080745902079238, "loss": 0.1947772204875946, "mean_token_accuracy": 0.9188289642333984, "num_tokens": 54091304.0, "step": 4385 }, { "entropy": 1.2949390411376953, "epoch": 2.309636650868878, "grad_norm": 0.276991069316864, "learning_rate": 0.0001607893575890354, "loss": 0.17927928268909454, "mean_token_accuracy": 0.9291679114103317, "num_tokens": 54103640.0, "step": 4386 }, { "entropy": 1.2690950632095337, "epoch": 2.310163243812533, "grad_norm": 0.29863035678863525, "learning_rate": 0.0001607712531422102, "loss": 0.18910539150238037, "mean_token_accuracy": 0.9157494306564331, "num_tokens": 54115976.0, "step": 4387 }, { "entropy": 1.3071636855602264, "epoch": 2.3106898367561874, "grad_norm": 0.2578350603580475, "learning_rate": 0.00016075314568139167, "loss": 0.1770387887954712, "mean_token_accuracy": 0.9272283613681793, "num_tokens": 54128312.0, "step": 4388 }, { "entropy": 1.2916749119758606, "epoch": 2.311216429699842, "grad_norm": 0.2677556872367859, "learning_rate": 0.00016073503520765467, "loss": 0.19181080162525177, "mean_token_accuracy": 0.9190926253795624, "num_tokens": 54140648.0, "step": 4389 }, { "entropy": 1.309247374534607, "epoch": 2.3117430226434967, "grad_norm": 0.2915293872356415, "learning_rate": 0.00016071692172207435, "loss": 0.1867821216583252, "mean_token_accuracy": 0.9195849001407623, "num_tokens": 54152984.0, "step": 4390 }, { "entropy": 1.29865163564682, "epoch": 2.312269615587151, "grad_norm": 0.2806514501571655, "learning_rate": 0.00016069880522572597, "loss": 0.1817903220653534, "mean_token_accuracy": 0.9249827116727829, "num_tokens": 54165320.0, "step": 4391 }, { "entropy": 1.2931040525436401, "epoch": 2.3127962085308056, "grad_norm": 0.29710087180137634, "learning_rate": 0.00016068068571968507, "loss": 0.20901834964752197, "mean_token_accuracy": 0.9162816405296326, "num_tokens": 54177656.0, "step": 4392 }, { "entropy": 1.2990557551383972, "epoch": 2.3133228014744605, "grad_norm": 0.2834272086620331, "learning_rate": 0.00016066256320502719, "loss": 0.1743437647819519, "mean_token_accuracy": 0.9270213842391968, "num_tokens": 54189992.0, "step": 4393 }, { "entropy": 1.2775674760341644, "epoch": 2.313849394418115, "grad_norm": 0.2701371908187866, "learning_rate": 0.00016064443768282823, "loss": 0.17299538850784302, "mean_token_accuracy": 0.9240054935216904, "num_tokens": 54202328.0, "step": 4394 }, { "entropy": 1.312081515789032, "epoch": 2.3143759873617693, "grad_norm": 0.3133409321308136, "learning_rate": 0.0001606263091541642, "loss": 0.193025603890419, "mean_token_accuracy": 0.9182188510894775, "num_tokens": 54214664.0, "step": 4395 }, { "entropy": 1.3071553409099579, "epoch": 2.3149025803054237, "grad_norm": 0.2669501304626465, "learning_rate": 0.00016060817762011126, "loss": 0.17285308241844177, "mean_token_accuracy": 0.9284144788980484, "num_tokens": 54227000.0, "step": 4396 }, { "entropy": 1.3454262018203735, "epoch": 2.3154291732490786, "grad_norm": 0.29012081027030945, "learning_rate": 0.00016059004308174578, "loss": 0.20970484614372253, "mean_token_accuracy": 0.9146772921085358, "num_tokens": 54239336.0, "step": 4397 }, { "entropy": 1.3304231464862823, "epoch": 2.315955766192733, "grad_norm": 0.34615376591682434, "learning_rate": 0.0001605719055401443, "loss": 0.20989423990249634, "mean_token_accuracy": 0.912458136677742, "num_tokens": 54251672.0, "step": 4398 }, { "entropy": 1.3078122437000275, "epoch": 2.3164823591363874, "grad_norm": 0.3172536790370941, "learning_rate": 0.00016055376499638356, "loss": 0.21419790387153625, "mean_token_accuracy": 0.9104336500167847, "num_tokens": 54264008.0, "step": 4399 }, { "entropy": 1.3196004033088684, "epoch": 2.3170089520800423, "grad_norm": 0.26406171917915344, "learning_rate": 0.00016053562145154044, "loss": 0.1729414165019989, "mean_token_accuracy": 0.9300494939088821, "num_tokens": 54276344.0, "step": 4400 }, { "entropy": 1.3104143142700195, "epoch": 2.3175355450236967, "grad_norm": 0.27086126804351807, "learning_rate": 0.000160517474906692, "loss": 0.19196972250938416, "mean_token_accuracy": 0.9190964996814728, "num_tokens": 54288680.0, "step": 4401 }, { "entropy": 1.334696739912033, "epoch": 2.318062137967351, "grad_norm": 0.27888646721839905, "learning_rate": 0.00016049932536291552, "loss": 0.1965310424566269, "mean_token_accuracy": 0.9213904738426208, "num_tokens": 54301016.0, "step": 4402 }, { "entropy": 1.3062738478183746, "epoch": 2.3185887309110056, "grad_norm": 0.274829238653183, "learning_rate": 0.00016048117282128842, "loss": 0.1787204146385193, "mean_token_accuracy": 0.9259192049503326, "num_tokens": 54313352.0, "step": 4403 }, { "entropy": 1.3323825299739838, "epoch": 2.3191153238546605, "grad_norm": 0.3422197699546814, "learning_rate": 0.00016046301728288835, "loss": 0.2093147188425064, "mean_token_accuracy": 0.91293103992939, "num_tokens": 54325688.0, "step": 4404 }, { "entropy": 1.3408651053905487, "epoch": 2.319641916798315, "grad_norm": 0.27782759070396423, "learning_rate": 0.00016044485874879303, "loss": 0.18714700639247894, "mean_token_accuracy": 0.9252272844314575, "num_tokens": 54338024.0, "step": 4405 }, { "entropy": 1.2752661406993866, "epoch": 2.3201685097419693, "grad_norm": 0.2649306356906891, "learning_rate": 0.00016042669722008047, "loss": 0.18565596640110016, "mean_token_accuracy": 0.92513607442379, "num_tokens": 54350360.0, "step": 4406 }, { "entropy": 1.3408364355564117, "epoch": 2.320695102685624, "grad_norm": 0.2725090980529785, "learning_rate": 0.00016040853269782881, "loss": 0.1821533590555191, "mean_token_accuracy": 0.9206462651491165, "num_tokens": 54362696.0, "step": 4407 }, { "entropy": 1.3324918746948242, "epoch": 2.3212216956292786, "grad_norm": 0.2690848708152771, "learning_rate": 0.00016039036518311633, "loss": 0.19127275049686432, "mean_token_accuracy": 0.9218493103981018, "num_tokens": 54375032.0, "step": 4408 }, { "entropy": 1.387494683265686, "epoch": 2.321748288572933, "grad_norm": 0.29377731680870056, "learning_rate": 0.00016037219467702162, "loss": 0.19303129613399506, "mean_token_accuracy": 0.9185487180948257, "num_tokens": 54387368.0, "step": 4409 }, { "entropy": 1.3866168558597565, "epoch": 2.322274881516588, "grad_norm": 0.30252406001091003, "learning_rate": 0.00016035402118062329, "loss": 0.18900904059410095, "mean_token_accuracy": 0.9236882477998734, "num_tokens": 54399704.0, "step": 4410 }, { "entropy": 1.3696815967559814, "epoch": 2.3228014744602423, "grad_norm": 0.3095356225967407, "learning_rate": 0.00016033584469500017, "loss": 0.21661263704299927, "mean_token_accuracy": 0.9109258502721786, "num_tokens": 54412040.0, "step": 4411 }, { "entropy": 1.3689590990543365, "epoch": 2.3233280674038967, "grad_norm": 0.30804696679115295, "learning_rate": 0.00016031766522123136, "loss": 0.1792442947626114, "mean_token_accuracy": 0.9260575175285339, "num_tokens": 54424376.0, "step": 4412 }, { "entropy": 1.3878648579120636, "epoch": 2.323854660347551, "grad_norm": 0.26045045256614685, "learning_rate": 0.00016029948276039606, "loss": 0.1889743059873581, "mean_token_accuracy": 0.9185473471879959, "num_tokens": 54436712.0, "step": 4413 }, { "entropy": 1.3724315762519836, "epoch": 2.324381253291206, "grad_norm": 0.2750447392463684, "learning_rate": 0.00016028129731357366, "loss": 0.1990983784198761, "mean_token_accuracy": 0.9145029634237289, "num_tokens": 54449048.0, "step": 4414 }, { "entropy": 1.3819120228290558, "epoch": 2.3249078462348605, "grad_norm": 0.2784717082977295, "learning_rate": 0.00016026310888184363, "loss": 0.1772555112838745, "mean_token_accuracy": 0.9232773780822754, "num_tokens": 54461384.0, "step": 4415 }, { "entropy": 1.4001644849777222, "epoch": 2.325434439178515, "grad_norm": 0.2536607086658478, "learning_rate": 0.00016024491746628578, "loss": 0.17961403727531433, "mean_token_accuracy": 0.9264721125364304, "num_tokens": 54473720.0, "step": 4416 }, { "entropy": 1.4117590487003326, "epoch": 2.3259610321221693, "grad_norm": 0.2814858853816986, "learning_rate": 0.00016022672306798005, "loss": 0.2062462568283081, "mean_token_accuracy": 0.9142315089702606, "num_tokens": 54486056.0, "step": 4417 }, { "entropy": 1.4305457472801208, "epoch": 2.326487625065824, "grad_norm": 0.2592325508594513, "learning_rate": 0.00016020852568800653, "loss": 0.1808975487947464, "mean_token_accuracy": 0.9286819398403168, "num_tokens": 54498392.0, "step": 4418 }, { "entropy": 1.3532997369766235, "epoch": 2.3270142180094786, "grad_norm": 0.28283217549324036, "learning_rate": 0.00016019032532744548, "loss": 0.18879854679107666, "mean_token_accuracy": 0.9208284020423889, "num_tokens": 54510728.0, "step": 4419 }, { "entropy": 1.3316220939159393, "epoch": 2.327540810953133, "grad_norm": 0.2630079686641693, "learning_rate": 0.00016017212198737732, "loss": 0.17229636013507843, "mean_token_accuracy": 0.9275263994932175, "num_tokens": 54523064.0, "step": 4420 }, { "entropy": 1.388702541589737, "epoch": 2.328067403896788, "grad_norm": 0.2867870032787323, "learning_rate": 0.00016015391566888271, "loss": 0.20351353287696838, "mean_token_accuracy": 0.9170709401369095, "num_tokens": 54535400.0, "step": 4421 }, { "entropy": 1.3147936463356018, "epoch": 2.3285939968404423, "grad_norm": 0.2731653153896332, "learning_rate": 0.00016013570637304244, "loss": 0.19753791391849518, "mean_token_accuracy": 0.9179530590772629, "num_tokens": 54547736.0, "step": 4422 }, { "entropy": 1.3937702775001526, "epoch": 2.3291205897840968, "grad_norm": 0.28775882720947266, "learning_rate": 0.00016011749410093753, "loss": 0.18566149473190308, "mean_token_accuracy": 0.9243120849132538, "num_tokens": 54560072.0, "step": 4423 }, { "entropy": 1.3537203073501587, "epoch": 2.3296471827277516, "grad_norm": 0.2538524866104126, "learning_rate": 0.00016009927885364907, "loss": 0.18132588267326355, "mean_token_accuracy": 0.9244391024112701, "num_tokens": 54572408.0, "step": 4424 }, { "entropy": 1.328016459941864, "epoch": 2.330173775671406, "grad_norm": 0.30183935165405273, "learning_rate": 0.00016008106063225845, "loss": 0.21323493123054504, "mean_token_accuracy": 0.9161577224731445, "num_tokens": 54584744.0, "step": 4425 }, { "entropy": 1.3058584034442902, "epoch": 2.3307003686150605, "grad_norm": 0.28315648436546326, "learning_rate": 0.00016006283943784715, "loss": 0.20466047525405884, "mean_token_accuracy": 0.9173526763916016, "num_tokens": 54597080.0, "step": 4426 }, { "entropy": 1.371433824300766, "epoch": 2.3312269615587153, "grad_norm": 0.2796994149684906, "learning_rate": 0.00016004461527149687, "loss": 0.19173529744148254, "mean_token_accuracy": 0.9192550033330917, "num_tokens": 54609416.0, "step": 4427 }, { "entropy": 1.2901140749454498, "epoch": 2.3317535545023698, "grad_norm": 0.2696458399295807, "learning_rate": 0.00016002638813428943, "loss": 0.18851207196712494, "mean_token_accuracy": 0.9239564538002014, "num_tokens": 54621752.0, "step": 4428 }, { "entropy": 1.317545861005783, "epoch": 2.332280147446024, "grad_norm": 0.3081064522266388, "learning_rate": 0.00016000815802730693, "loss": 0.20056316256523132, "mean_token_accuracy": 0.9122645407915115, "num_tokens": 54634088.0, "step": 4429 }, { "entropy": 1.2482907176017761, "epoch": 2.3328067403896786, "grad_norm": 0.2816668152809143, "learning_rate": 0.0001599899249516315, "loss": 0.18329255282878876, "mean_token_accuracy": 0.9248232841491699, "num_tokens": 54646424.0, "step": 4430 }, { "entropy": 1.2596892416477203, "epoch": 2.3333333333333335, "grad_norm": 0.27750101685523987, "learning_rate": 0.00015997168890834567, "loss": 0.2004767507314682, "mean_token_accuracy": 0.9160079509019852, "num_tokens": 54658760.0, "step": 4431 }, { "entropy": 1.2721357941627502, "epoch": 2.333859926276988, "grad_norm": 0.28640201687812805, "learning_rate": 0.00015995344989853193, "loss": 0.18829813599586487, "mean_token_accuracy": 0.9209965318441391, "num_tokens": 54671096.0, "step": 4432 }, { "entropy": 1.281269371509552, "epoch": 2.3343865192206423, "grad_norm": 0.2667178809642792, "learning_rate": 0.00015993520792327294, "loss": 0.18476279079914093, "mean_token_accuracy": 0.9250704199075699, "num_tokens": 54683432.0, "step": 4433 }, { "entropy": 1.2215364575386047, "epoch": 2.3349131121642968, "grad_norm": 0.29263362288475037, "learning_rate": 0.00015991696298365174, "loss": 0.21507254242897034, "mean_token_accuracy": 0.9111363440752029, "num_tokens": 54695768.0, "step": 4434 }, { "entropy": 1.1838223040103912, "epoch": 2.3354397051079516, "grad_norm": 0.25401586294174194, "learning_rate": 0.00015989871508075137, "loss": 0.18073657155036926, "mean_token_accuracy": 0.9278956204652786, "num_tokens": 54708104.0, "step": 4435 }, { "entropy": 1.2792393565177917, "epoch": 2.335966298051606, "grad_norm": 0.2642403542995453, "learning_rate": 0.00015988046421565517, "loss": 0.1823883056640625, "mean_token_accuracy": 0.9233395755290985, "num_tokens": 54720440.0, "step": 4436 }, { "entropy": 1.281785398721695, "epoch": 2.3364928909952605, "grad_norm": 0.30070072412490845, "learning_rate": 0.0001598622103894465, "loss": 0.19212502241134644, "mean_token_accuracy": 0.9186575263738632, "num_tokens": 54732776.0, "step": 4437 }, { "entropy": 1.2644932866096497, "epoch": 2.3370194839389153, "grad_norm": 0.3136497437953949, "learning_rate": 0.00015984395360320902, "loss": 0.19951491057872772, "mean_token_accuracy": 0.9213179051876068, "num_tokens": 54745112.0, "step": 4438 }, { "entropy": 1.2794144749641418, "epoch": 2.3375460768825698, "grad_norm": 0.27775052189826965, "learning_rate": 0.00015982569385802653, "loss": 0.18891870975494385, "mean_token_accuracy": 0.9204751700162888, "num_tokens": 54757448.0, "step": 4439 }, { "entropy": 1.2809376120567322, "epoch": 2.338072669826224, "grad_norm": 0.28730466961860657, "learning_rate": 0.00015980743115498296, "loss": 0.20424111187458038, "mean_token_accuracy": 0.9203447997570038, "num_tokens": 54769784.0, "step": 4440 }, { "entropy": 1.2839619815349579, "epoch": 2.338599262769879, "grad_norm": 0.3166145384311676, "learning_rate": 0.00015978916549516257, "loss": 0.2077278047800064, "mean_token_accuracy": 0.9169203490018845, "num_tokens": 54782120.0, "step": 4441 }, { "entropy": 1.2435754537582397, "epoch": 2.3391258557135335, "grad_norm": 0.26010408997535706, "learning_rate": 0.0001597708968796496, "loss": 0.1755719631910324, "mean_token_accuracy": 0.9279258698225021, "num_tokens": 54794456.0, "step": 4442 }, { "entropy": 1.210321307182312, "epoch": 2.339652448657188, "grad_norm": 0.26333627104759216, "learning_rate": 0.00015975262530952853, "loss": 0.17494051158428192, "mean_token_accuracy": 0.9276866167783737, "num_tokens": 54806792.0, "step": 4443 }, { "entropy": 1.282522976398468, "epoch": 2.340179041600843, "grad_norm": 0.2993547022342682, "learning_rate": 0.0001597343507858841, "loss": 0.1840740144252777, "mean_token_accuracy": 0.9280155897140503, "num_tokens": 54819128.0, "step": 4444 }, { "entropy": 1.2530391216278076, "epoch": 2.340705634544497, "grad_norm": 0.28764256834983826, "learning_rate": 0.00015971607330980117, "loss": 0.19909349083900452, "mean_token_accuracy": 0.9169367849826813, "num_tokens": 54831464.0, "step": 4445 }, { "entropy": 1.3018465340137482, "epoch": 2.3412322274881516, "grad_norm": 0.2826826870441437, "learning_rate": 0.00015969779288236468, "loss": 0.19262577593326569, "mean_token_accuracy": 0.920672133564949, "num_tokens": 54843800.0, "step": 4446 }, { "entropy": 1.2566682994365692, "epoch": 2.341758820431806, "grad_norm": 0.29000788927078247, "learning_rate": 0.0001596795095046599, "loss": 0.21003186702728271, "mean_token_accuracy": 0.9126958400011063, "num_tokens": 54856136.0, "step": 4447 }, { "entropy": 1.2816908955574036, "epoch": 2.342285413375461, "grad_norm": 0.284256249666214, "learning_rate": 0.00015966122317777223, "loss": 0.20872412621974945, "mean_token_accuracy": 0.9170348197221756, "num_tokens": 54868472.0, "step": 4448 }, { "entropy": 1.2890898287296295, "epoch": 2.3428120063191153, "grad_norm": 0.2809978723526001, "learning_rate": 0.00015964293390278718, "loss": 0.20213517546653748, "mean_token_accuracy": 0.9191296994686127, "num_tokens": 54880808.0, "step": 4449 }, { "entropy": 1.3205406069755554, "epoch": 2.3433385992627698, "grad_norm": 0.27979543805122375, "learning_rate": 0.00015962464168079045, "loss": 0.195961132645607, "mean_token_accuracy": 0.9169862270355225, "num_tokens": 54893144.0, "step": 4450 }, { "entropy": 1.334695279598236, "epoch": 2.343865192206424, "grad_norm": 0.26562100648880005, "learning_rate": 0.000159606346512868, "loss": 0.1865580528974533, "mean_token_accuracy": 0.923822671175003, "num_tokens": 54905480.0, "step": 4451 }, { "entropy": 1.3165518641471863, "epoch": 2.344391785150079, "grad_norm": 0.2917470335960388, "learning_rate": 0.0001595880484001059, "loss": 0.20150445401668549, "mean_token_accuracy": 0.9178837388753891, "num_tokens": 54917816.0, "step": 4452 }, { "entropy": 1.3582655489444733, "epoch": 2.3449183780937335, "grad_norm": 0.26764020323753357, "learning_rate": 0.00015956974734359034, "loss": 0.18483439087867737, "mean_token_accuracy": 0.920818954706192, "num_tokens": 54930152.0, "step": 4453 }, { "entropy": 1.3119309544563293, "epoch": 2.345444971037388, "grad_norm": 0.2685227692127228, "learning_rate": 0.00015955144334440783, "loss": 0.20485417544841766, "mean_token_accuracy": 0.9134972244501114, "num_tokens": 54942488.0, "step": 4454 }, { "entropy": 1.3058526515960693, "epoch": 2.345971563981043, "grad_norm": 0.26575425267219543, "learning_rate": 0.00015953313640364492, "loss": 0.20995725691318512, "mean_token_accuracy": 0.912079855799675, "num_tokens": 54954824.0, "step": 4455 }, { "entropy": 1.3167513608932495, "epoch": 2.346498156924697, "grad_norm": 0.2694823145866394, "learning_rate": 0.00015951482652238843, "loss": 0.19169099628925323, "mean_token_accuracy": 0.9215113818645477, "num_tokens": 54967160.0, "step": 4456 }, { "entropy": 1.3394544422626495, "epoch": 2.3470247498683516, "grad_norm": 0.2890017032623291, "learning_rate": 0.00015949651370172525, "loss": 0.20341987907886505, "mean_token_accuracy": 0.9149002283811569, "num_tokens": 54979496.0, "step": 4457 }, { "entropy": 1.344273865222931, "epoch": 2.3475513428120065, "grad_norm": 0.27608951926231384, "learning_rate": 0.00015947819794274258, "loss": 0.1875733733177185, "mean_token_accuracy": 0.9171324670314789, "num_tokens": 54991832.0, "step": 4458 }, { "entropy": 1.3028335869312286, "epoch": 2.348077935755661, "grad_norm": 0.2981983423233032, "learning_rate": 0.00015945987924652764, "loss": 0.20515939593315125, "mean_token_accuracy": 0.91654272377491, "num_tokens": 55004168.0, "step": 4459 }, { "entropy": 1.3539035320281982, "epoch": 2.3486045286993154, "grad_norm": 0.27947360277175903, "learning_rate": 0.00015944155761416797, "loss": 0.1902858167886734, "mean_token_accuracy": 0.9198180288076401, "num_tokens": 55016504.0, "step": 4460 }, { "entropy": 1.317354530096054, "epoch": 2.34913112164297, "grad_norm": 0.2992118299007416, "learning_rate": 0.00015942323304675118, "loss": 0.1987239122390747, "mean_token_accuracy": 0.9191636443138123, "num_tokens": 55028840.0, "step": 4461 }, { "entropy": 1.310655266046524, "epoch": 2.3496577145866246, "grad_norm": 0.26667365431785583, "learning_rate": 0.0001594049055453651, "loss": 0.1835993528366089, "mean_token_accuracy": 0.922356128692627, "num_tokens": 55041176.0, "step": 4462 }, { "entropy": 1.254290759563446, "epoch": 2.350184307530279, "grad_norm": 0.2572006285190582, "learning_rate": 0.00015938657511109776, "loss": 0.18122154474258423, "mean_token_accuracy": 0.9250338971614838, "num_tokens": 55053512.0, "step": 4463 }, { "entropy": 1.330580860376358, "epoch": 2.3507109004739335, "grad_norm": 0.2904733717441559, "learning_rate": 0.00015936824174503727, "loss": 0.18564851582050323, "mean_token_accuracy": 0.9225763231515884, "num_tokens": 55065848.0, "step": 4464 }, { "entropy": 1.285946011543274, "epoch": 2.3512374934175884, "grad_norm": 0.28024446964263916, "learning_rate": 0.000159349905448272, "loss": 0.1889662742614746, "mean_token_accuracy": 0.9220243245363235, "num_tokens": 55078184.0, "step": 4465 }, { "entropy": 1.3022855818271637, "epoch": 2.351764086361243, "grad_norm": 0.2870224118232727, "learning_rate": 0.0001593315662218905, "loss": 0.18644535541534424, "mean_token_accuracy": 0.9205256253480911, "num_tokens": 55090520.0, "step": 4466 }, { "entropy": 1.2169810831546783, "epoch": 2.352290679304897, "grad_norm": 0.24071332812309265, "learning_rate": 0.00015931322406698142, "loss": 0.16642692685127258, "mean_token_accuracy": 0.930572435259819, "num_tokens": 55102856.0, "step": 4467 }, { "entropy": 1.2590057253837585, "epoch": 2.3528172722485516, "grad_norm": 0.2916509807109833, "learning_rate": 0.00015929487898463368, "loss": 0.1792268007993698, "mean_token_accuracy": 0.9278564751148224, "num_tokens": 55115192.0, "step": 4468 }, { "entropy": 1.3424552083015442, "epoch": 2.3533438651922065, "grad_norm": 0.3079618513584137, "learning_rate": 0.00015927653097593626, "loss": 0.20497339963912964, "mean_token_accuracy": 0.9212962538003922, "num_tokens": 55127528.0, "step": 4469 }, { "entropy": 1.3330655097961426, "epoch": 2.353870458135861, "grad_norm": 0.2870141863822937, "learning_rate": 0.0001592581800419784, "loss": 0.19076713919639587, "mean_token_accuracy": 0.9209161102771759, "num_tokens": 55139864.0, "step": 4470 }, { "entropy": 1.3257507979869843, "epoch": 2.3543970510795154, "grad_norm": 0.28117015957832336, "learning_rate": 0.00015923982618384948, "loss": 0.20129868388175964, "mean_token_accuracy": 0.9233514815568924, "num_tokens": 55152200.0, "step": 4471 }, { "entropy": 1.3009706437587738, "epoch": 2.3549236440231702, "grad_norm": 0.3033812940120697, "learning_rate": 0.0001592214694026391, "loss": 0.18937650322914124, "mean_token_accuracy": 0.9224123954772949, "num_tokens": 55164536.0, "step": 4472 }, { "entropy": 1.2963763773441315, "epoch": 2.3554502369668247, "grad_norm": 0.2638135552406311, "learning_rate": 0.00015920310969943697, "loss": 0.1769077479839325, "mean_token_accuracy": 0.9286084026098251, "num_tokens": 55176872.0, "step": 4473 }, { "entropy": 1.3231896758079529, "epoch": 2.355976829910479, "grad_norm": 0.26197150349617004, "learning_rate": 0.00015918474707533298, "loss": 0.17836906015872955, "mean_token_accuracy": 0.9256467223167419, "num_tokens": 55189208.0, "step": 4474 }, { "entropy": 1.3913252353668213, "epoch": 2.356503422854134, "grad_norm": 0.2851298451423645, "learning_rate": 0.00015916638153141722, "loss": 0.18936462700366974, "mean_token_accuracy": 0.9204428941011429, "num_tokens": 55201544.0, "step": 4475 }, { "entropy": 1.3488848209381104, "epoch": 2.3570300157977884, "grad_norm": 0.30388936400413513, "learning_rate": 0.00015914801306877993, "loss": 0.21345588564872742, "mean_token_accuracy": 0.9136727303266525, "num_tokens": 55213880.0, "step": 4476 }, { "entropy": 1.3502046167850494, "epoch": 2.357556608741443, "grad_norm": 0.28946250677108765, "learning_rate": 0.0001591296416885116, "loss": 0.20996083319187164, "mean_token_accuracy": 0.9157253056764603, "num_tokens": 55226216.0, "step": 4477 }, { "entropy": 1.3586644530296326, "epoch": 2.3580832016850977, "grad_norm": 0.27651745080947876, "learning_rate": 0.0001591112673917028, "loss": 0.18405741453170776, "mean_token_accuracy": 0.924022987484932, "num_tokens": 55238552.0, "step": 4478 }, { "entropy": 1.430792659521103, "epoch": 2.358609794628752, "grad_norm": 0.2895481288433075, "learning_rate": 0.00015909289017944426, "loss": 0.18251873552799225, "mean_token_accuracy": 0.923512801527977, "num_tokens": 55250888.0, "step": 4479 }, { "entropy": 1.3671636581420898, "epoch": 2.3591363875724065, "grad_norm": 0.25113236904144287, "learning_rate": 0.00015907451005282698, "loss": 0.16419190168380737, "mean_token_accuracy": 0.9323639422655106, "num_tokens": 55263224.0, "step": 4480 }, { "entropy": 1.354794681072235, "epoch": 2.359662980516061, "grad_norm": 0.296430766582489, "learning_rate": 0.00015905612701294208, "loss": 0.20118844509124756, "mean_token_accuracy": 0.9132822453975677, "num_tokens": 55275560.0, "step": 4481 }, { "entropy": 1.3990836441516876, "epoch": 2.360189573459716, "grad_norm": 0.28303229808807373, "learning_rate": 0.0001590377410608808, "loss": 0.20889045298099518, "mean_token_accuracy": 0.9137723445892334, "num_tokens": 55287896.0, "step": 4482 }, { "entropy": 1.3733917474746704, "epoch": 2.3607161664033702, "grad_norm": 0.27674078941345215, "learning_rate": 0.0001590193521977347, "loss": 0.1934237778186798, "mean_token_accuracy": 0.921452522277832, "num_tokens": 55300232.0, "step": 4483 }, { "entropy": 1.355101853609085, "epoch": 2.3612427593470247, "grad_norm": 0.24528248608112335, "learning_rate": 0.00015900096042459534, "loss": 0.17529264092445374, "mean_token_accuracy": 0.925555557012558, "num_tokens": 55312568.0, "step": 4484 }, { "entropy": 1.4111731946468353, "epoch": 2.361769352290679, "grad_norm": 0.28693532943725586, "learning_rate": 0.00015898256574255456, "loss": 0.1895090639591217, "mean_token_accuracy": 0.9167554080486298, "num_tokens": 55324904.0, "step": 4485 }, { "entropy": 1.3618127703666687, "epoch": 2.362295945234334, "grad_norm": 0.2586255669593811, "learning_rate": 0.00015896416815270437, "loss": 0.17887786030769348, "mean_token_accuracy": 0.9279444813728333, "num_tokens": 55337240.0, "step": 4486 }, { "entropy": 1.4009781777858734, "epoch": 2.3628225381779884, "grad_norm": 0.2798784673213959, "learning_rate": 0.00015894576765613684, "loss": 0.2002013474702835, "mean_token_accuracy": 0.9198189824819565, "num_tokens": 55349576.0, "step": 4487 }, { "entropy": 1.4672830998897552, "epoch": 2.363349131121643, "grad_norm": 0.30033984780311584, "learning_rate": 0.00015892736425394442, "loss": 0.19836139678955078, "mean_token_accuracy": 0.9234947264194489, "num_tokens": 55361912.0, "step": 4488 }, { "entropy": 1.4400977194309235, "epoch": 2.3638757240652977, "grad_norm": 0.2626227140426636, "learning_rate": 0.00015890895794721955, "loss": 0.1710968166589737, "mean_token_accuracy": 0.9296213835477829, "num_tokens": 55374248.0, "step": 4489 }, { "entropy": 1.4096495509147644, "epoch": 2.364402317008952, "grad_norm": 0.282968670129776, "learning_rate": 0.00015889054873705486, "loss": 0.1910400092601776, "mean_token_accuracy": 0.9231160432100296, "num_tokens": 55386584.0, "step": 4490 }, { "entropy": 1.407538741827011, "epoch": 2.3649289099526065, "grad_norm": 0.2817977964878082, "learning_rate": 0.0001588721366245433, "loss": 0.17246387898921967, "mean_token_accuracy": 0.9259490519762039, "num_tokens": 55398920.0, "step": 4491 }, { "entropy": 1.3910426497459412, "epoch": 2.3654555028962614, "grad_norm": 0.28504490852355957, "learning_rate": 0.0001588537216107778, "loss": 0.1968700885772705, "mean_token_accuracy": 0.9202799946069717, "num_tokens": 55411256.0, "step": 4492 }, { "entropy": 1.4219735264778137, "epoch": 2.365982095839916, "grad_norm": 0.2912696301937103, "learning_rate": 0.00015883530369685162, "loss": 0.2083374410867691, "mean_token_accuracy": 0.9184867888689041, "num_tokens": 55423592.0, "step": 4493 }, { "entropy": 1.343996375799179, "epoch": 2.3665086887835702, "grad_norm": 0.25932249426841736, "learning_rate": 0.00015881688288385808, "loss": 0.169301837682724, "mean_token_accuracy": 0.9262981861829758, "num_tokens": 55435928.0, "step": 4494 }, { "entropy": 1.4267469346523285, "epoch": 2.367035281727225, "grad_norm": 0.2699030339717865, "learning_rate": 0.00015879845917289074, "loss": 0.18538378179073334, "mean_token_accuracy": 0.9267265200614929, "num_tokens": 55448264.0, "step": 4495 }, { "entropy": 1.4803634285926819, "epoch": 2.3675618746708795, "grad_norm": 0.3319495618343353, "learning_rate": 0.00015878003256504327, "loss": 0.20425397157669067, "mean_token_accuracy": 0.9164634346961975, "num_tokens": 55460600.0, "step": 4496 }, { "entropy": 1.385725349187851, "epoch": 2.368088467614534, "grad_norm": 0.25805506110191345, "learning_rate": 0.0001587616030614096, "loss": 0.18095749616622925, "mean_token_accuracy": 0.922220304608345, "num_tokens": 55472936.0, "step": 4497 }, { "entropy": 1.4062891602516174, "epoch": 2.3686150605581884, "grad_norm": 0.25933024287223816, "learning_rate": 0.00015874317066308372, "loss": 0.18179509043693542, "mean_token_accuracy": 0.9226569682359695, "num_tokens": 55485272.0, "step": 4498 }, { "entropy": 1.4053870141506195, "epoch": 2.3691416535018432, "grad_norm": 0.2785022556781769, "learning_rate": 0.00015872473537115994, "loss": 0.19450442492961884, "mean_token_accuracy": 0.9210056364536285, "num_tokens": 55497608.0, "step": 4499 }, { "entropy": 1.346811443567276, "epoch": 2.3696682464454977, "grad_norm": 0.2664346992969513, "learning_rate": 0.0001587062971867326, "loss": 0.17768292129039764, "mean_token_accuracy": 0.926102340221405, "num_tokens": 55509944.0, "step": 4500 }, { "entropy": 1.528866469860077, "epoch": 2.370194839389152, "grad_norm": 0.3126022517681122, "learning_rate": 0.00015868785611089628, "loss": 0.2166975736618042, "mean_token_accuracy": 0.9128769040107727, "num_tokens": 55522280.0, "step": 4501 }, { "entropy": 1.4011040925979614, "epoch": 2.3707214323328065, "grad_norm": 0.261837363243103, "learning_rate": 0.00015866941214474572, "loss": 0.18179045617580414, "mean_token_accuracy": 0.923045888543129, "num_tokens": 55534616.0, "step": 4502 }, { "entropy": 1.3975766003131866, "epoch": 2.3712480252764614, "grad_norm": 0.2936818301677704, "learning_rate": 0.0001586509652893758, "loss": 0.22525236010551453, "mean_token_accuracy": 0.9070886373519897, "num_tokens": 55546952.0, "step": 4503 }, { "entropy": 1.379688709974289, "epoch": 2.371774618220116, "grad_norm": 0.27700334787368774, "learning_rate": 0.00015863251554588167, "loss": 0.21290606260299683, "mean_token_accuracy": 0.910546600818634, "num_tokens": 55559288.0, "step": 4504 }, { "entropy": 1.3719074726104736, "epoch": 2.3723012111637702, "grad_norm": 0.28597623109817505, "learning_rate": 0.00015861406291535853, "loss": 0.20922252535820007, "mean_token_accuracy": 0.9105053544044495, "num_tokens": 55571624.0, "step": 4505 }, { "entropy": 1.3768506050109863, "epoch": 2.372827804107425, "grad_norm": 0.2684311866760254, "learning_rate": 0.0001585956073989018, "loss": 0.20058728754520416, "mean_token_accuracy": 0.9121564775705338, "num_tokens": 55583960.0, "step": 4506 }, { "entropy": 1.3842982351779938, "epoch": 2.3733543970510795, "grad_norm": 0.2636588215827942, "learning_rate": 0.00015857714899760714, "loss": 0.19942373037338257, "mean_token_accuracy": 0.9159530699253082, "num_tokens": 55596296.0, "step": 4507 }, { "entropy": 1.406856209039688, "epoch": 2.373880989994734, "grad_norm": 0.27418437600135803, "learning_rate": 0.00015855868771257024, "loss": 0.20501425862312317, "mean_token_accuracy": 0.9155614525079727, "num_tokens": 55608632.0, "step": 4508 }, { "entropy": 1.4277390837669373, "epoch": 2.374407582938389, "grad_norm": 0.2765462398529053, "learning_rate": 0.00015854022354488707, "loss": 0.19365204870700836, "mean_token_accuracy": 0.9140615314245224, "num_tokens": 55620968.0, "step": 4509 }, { "entropy": 1.4029557406902313, "epoch": 2.3749341758820433, "grad_norm": 0.27889713644981384, "learning_rate": 0.00015852175649565375, "loss": 0.18732376396656036, "mean_token_accuracy": 0.9244106113910675, "num_tokens": 55633304.0, "step": 4510 }, { "entropy": 1.3472702205181122, "epoch": 2.3754607688256977, "grad_norm": 0.24661894142627716, "learning_rate": 0.00015850328656596656, "loss": 0.17409662902355194, "mean_token_accuracy": 0.9250094890594482, "num_tokens": 55645640.0, "step": 4511 }, { "entropy": 1.395214170217514, "epoch": 2.375987361769352, "grad_norm": 0.27474910020828247, "learning_rate": 0.00015848481375692195, "loss": 0.19719195365905762, "mean_token_accuracy": 0.9223782122135162, "num_tokens": 55657976.0, "step": 4512 }, { "entropy": 1.3260896503925323, "epoch": 2.376513954713007, "grad_norm": 0.26417186856269836, "learning_rate": 0.00015846633806961647, "loss": 0.19815877079963684, "mean_token_accuracy": 0.9204468429088593, "num_tokens": 55670312.0, "step": 4513 }, { "entropy": 1.3533766269683838, "epoch": 2.3770405476566614, "grad_norm": 0.2891894578933716, "learning_rate": 0.00015844785950514708, "loss": 0.1904796063899994, "mean_token_accuracy": 0.9149835109710693, "num_tokens": 55682648.0, "step": 4514 }, { "entropy": 1.3211008608341217, "epoch": 2.377567140600316, "grad_norm": 0.26906976103782654, "learning_rate": 0.00015842937806461057, "loss": 0.1900303214788437, "mean_token_accuracy": 0.9222564399242401, "num_tokens": 55694984.0, "step": 4515 }, { "entropy": 1.3689544200897217, "epoch": 2.3780937335439707, "grad_norm": 0.2991812229156494, "learning_rate": 0.0001584108937491042, "loss": 0.20970046520233154, "mean_token_accuracy": 0.9113328009843826, "num_tokens": 55707320.0, "step": 4516 }, { "entropy": 1.3300418257713318, "epoch": 2.378620326487625, "grad_norm": 0.26500844955444336, "learning_rate": 0.00015839240655972521, "loss": 0.19760391116142273, "mean_token_accuracy": 0.9200556874275208, "num_tokens": 55719656.0, "step": 4517 }, { "entropy": 1.3151434361934662, "epoch": 2.3791469194312795, "grad_norm": 0.2675932049751282, "learning_rate": 0.00015837391649757112, "loss": 0.1939803957939148, "mean_token_accuracy": 0.9216755032539368, "num_tokens": 55731992.0, "step": 4518 }, { "entropy": 1.3362997472286224, "epoch": 2.379673512374934, "grad_norm": 0.28336596488952637, "learning_rate": 0.00015835542356373953, "loss": 0.1987985372543335, "mean_token_accuracy": 0.9186425060033798, "num_tokens": 55744328.0, "step": 4519 }, { "entropy": 1.3139479160308838, "epoch": 2.380200105318589, "grad_norm": 0.2725384831428528, "learning_rate": 0.0001583369277593283, "loss": 0.19263529777526855, "mean_token_accuracy": 0.9191529750823975, "num_tokens": 55756664.0, "step": 4520 }, { "entropy": 1.3443782925605774, "epoch": 2.3807266982622433, "grad_norm": 0.2858370840549469, "learning_rate": 0.00015831842908543535, "loss": 0.18691514432430267, "mean_token_accuracy": 0.9257304817438126, "num_tokens": 55769000.0, "step": 4521 }, { "entropy": 1.3328638076782227, "epoch": 2.3812532912058977, "grad_norm": 0.29020607471466064, "learning_rate": 0.00015829992754315893, "loss": 0.1900632083415985, "mean_token_accuracy": 0.9172062873840332, "num_tokens": 55781336.0, "step": 4522 }, { "entropy": 1.2869420647621155, "epoch": 2.3817798841495526, "grad_norm": 0.25875672698020935, "learning_rate": 0.0001582814231335973, "loss": 0.17436552047729492, "mean_token_accuracy": 0.9253624975681305, "num_tokens": 55793672.0, "step": 4523 }, { "entropy": 1.2536731362342834, "epoch": 2.382306477093207, "grad_norm": 0.28048229217529297, "learning_rate": 0.00015826291585784898, "loss": 0.1865769326686859, "mean_token_accuracy": 0.9238808900117874, "num_tokens": 55806008.0, "step": 4524 }, { "entropy": 1.23280930519104, "epoch": 2.3828330700368614, "grad_norm": 0.2543039321899414, "learning_rate": 0.00015824440571701268, "loss": 0.17272458970546722, "mean_token_accuracy": 0.9268594980239868, "num_tokens": 55818344.0, "step": 4525 }, { "entropy": 1.2371512353420258, "epoch": 2.3833596629805163, "grad_norm": 0.26792868971824646, "learning_rate": 0.00015822589271218717, "loss": 0.19100236892700195, "mean_token_accuracy": 0.9224984645843506, "num_tokens": 55830680.0, "step": 4526 }, { "entropy": 1.2913587987422943, "epoch": 2.3838862559241707, "grad_norm": 0.29319706559181213, "learning_rate": 0.00015820737684447148, "loss": 0.18937891721725464, "mean_token_accuracy": 0.9151134341955185, "num_tokens": 55843016.0, "step": 4527 }, { "entropy": 1.2287176549434662, "epoch": 2.384412848867825, "grad_norm": 0.28001704812049866, "learning_rate": 0.00015818885811496485, "loss": 0.18166252970695496, "mean_token_accuracy": 0.9257358908653259, "num_tokens": 55855352.0, "step": 4528 }, { "entropy": 1.2606195509433746, "epoch": 2.3849394418114795, "grad_norm": 0.3030807375907898, "learning_rate": 0.0001581703365247665, "loss": 0.2063525915145874, "mean_token_accuracy": 0.9173136651515961, "num_tokens": 55867688.0, "step": 4529 }, { "entropy": 1.2028226852416992, "epoch": 2.3854660347551344, "grad_norm": 0.26009899377822876, "learning_rate": 0.00015815181207497612, "loss": 0.17096900939941406, "mean_token_accuracy": 0.929774135351181, "num_tokens": 55880024.0, "step": 4530 }, { "entropy": 1.2134665250778198, "epoch": 2.385992627698789, "grad_norm": 0.2998177111148834, "learning_rate": 0.00015813328476669324, "loss": 0.20142899453639984, "mean_token_accuracy": 0.9195566177368164, "num_tokens": 55892360.0, "step": 4531 }, { "entropy": 1.1590828597545624, "epoch": 2.3865192206424433, "grad_norm": 0.28007999062538147, "learning_rate": 0.00015811475460101785, "loss": 0.18869996070861816, "mean_token_accuracy": 0.9209212511777878, "num_tokens": 55904696.0, "step": 4532 }, { "entropy": 1.1737896800041199, "epoch": 2.387045813586098, "grad_norm": 0.2900781035423279, "learning_rate": 0.00015809622157904985, "loss": 0.18893763422966003, "mean_token_accuracy": 0.9233887642621994, "num_tokens": 55917032.0, "step": 4533 }, { "entropy": 1.2201267778873444, "epoch": 2.3875724065297526, "grad_norm": 0.3050040900707245, "learning_rate": 0.0001580776857018895, "loss": 0.20816883444786072, "mean_token_accuracy": 0.9114056080579758, "num_tokens": 55929368.0, "step": 4534 }, { "entropy": 1.1619028151035309, "epoch": 2.388098999473407, "grad_norm": 0.24892818927764893, "learning_rate": 0.00015805914697063724, "loss": 0.17240609228610992, "mean_token_accuracy": 0.9284298419952393, "num_tokens": 55941704.0, "step": 4535 }, { "entropy": 1.1720469892024994, "epoch": 2.3886255924170614, "grad_norm": 0.2732456624507904, "learning_rate": 0.00015804060538639347, "loss": 0.18014155328273773, "mean_token_accuracy": 0.9247136563062668, "num_tokens": 55954040.0, "step": 4536 }, { "entropy": 1.213779777288437, "epoch": 2.3891521853607163, "grad_norm": 0.289726585149765, "learning_rate": 0.00015802206095025899, "loss": 0.19931016862392426, "mean_token_accuracy": 0.9159621000289917, "num_tokens": 55966376.0, "step": 4537 }, { "entropy": 1.2300103604793549, "epoch": 2.3896787783043707, "grad_norm": 0.2903289794921875, "learning_rate": 0.00015800351366333462, "loss": 0.2093479335308075, "mean_token_accuracy": 0.9123352319002151, "num_tokens": 55978712.0, "step": 4538 }, { "entropy": 1.2362595200538635, "epoch": 2.390205371248025, "grad_norm": 0.276406854391098, "learning_rate": 0.00015798496352672145, "loss": 0.1859022080898285, "mean_token_accuracy": 0.9236205220222473, "num_tokens": 55991048.0, "step": 4539 }, { "entropy": 1.159458488225937, "epoch": 2.39073196419168, "grad_norm": 0.2462838739156723, "learning_rate": 0.00015796641054152067, "loss": 0.1730072796344757, "mean_token_accuracy": 0.9274507462978363, "num_tokens": 56003384.0, "step": 4540 }, { "entropy": 1.2364217042922974, "epoch": 2.3912585571353344, "grad_norm": 0.2972487509250641, "learning_rate": 0.00015794785470883368, "loss": 0.19434306025505066, "mean_token_accuracy": 0.9204827547073364, "num_tokens": 56015720.0, "step": 4541 }, { "entropy": 1.2326800525188446, "epoch": 2.391785150078989, "grad_norm": 0.26879581809043884, "learning_rate": 0.000157929296029762, "loss": 0.1797732710838318, "mean_token_accuracy": 0.9242551773786545, "num_tokens": 56028056.0, "step": 4542 }, { "entropy": 1.170352816581726, "epoch": 2.3923117430226437, "grad_norm": 0.26433271169662476, "learning_rate": 0.00015791073450540735, "loss": 0.18631601333618164, "mean_token_accuracy": 0.9216004759073257, "num_tokens": 56040392.0, "step": 4543 }, { "entropy": 1.1886663138866425, "epoch": 2.392838335966298, "grad_norm": 0.26627394556999207, "learning_rate": 0.00015789217013687166, "loss": 0.18448396027088165, "mean_token_accuracy": 0.9213402569293976, "num_tokens": 56052728.0, "step": 4544 }, { "entropy": 1.1851184666156769, "epoch": 2.3933649289099526, "grad_norm": 0.2651765048503876, "learning_rate": 0.00015787360292525697, "loss": 0.18697291612625122, "mean_token_accuracy": 0.9274520725011826, "num_tokens": 56065064.0, "step": 4545 }, { "entropy": 1.2112329304218292, "epoch": 2.393891521853607, "grad_norm": 0.28112831711769104, "learning_rate": 0.00015785503287166547, "loss": 0.19521315395832062, "mean_token_accuracy": 0.9178619235754013, "num_tokens": 56077400.0, "step": 4546 }, { "entropy": 1.263805478811264, "epoch": 2.394418114797262, "grad_norm": 0.29383382201194763, "learning_rate": 0.00015783645997719962, "loss": 0.2024495154619217, "mean_token_accuracy": 0.9234823882579803, "num_tokens": 56089736.0, "step": 4547 }, { "entropy": 1.2429666221141815, "epoch": 2.3949447077409163, "grad_norm": 0.27420487999916077, "learning_rate": 0.00015781788424296193, "loss": 0.19035124778747559, "mean_token_accuracy": 0.9219522327184677, "num_tokens": 56102072.0, "step": 4548 }, { "entropy": 1.2490891516208649, "epoch": 2.3954713006845707, "grad_norm": 0.27929991483688354, "learning_rate": 0.00015779930567005518, "loss": 0.2075713574886322, "mean_token_accuracy": 0.9149742126464844, "num_tokens": 56114408.0, "step": 4549 }, { "entropy": 1.2860136330127716, "epoch": 2.3959978936282256, "grad_norm": 0.27160221338272095, "learning_rate": 0.00015778072425958226, "loss": 0.17518314719200134, "mean_token_accuracy": 0.9276988953351974, "num_tokens": 56126744.0, "step": 4550 }, { "entropy": 1.2763722836971283, "epoch": 2.39652448657188, "grad_norm": 0.29390084743499756, "learning_rate": 0.0001577621400126462, "loss": 0.19787636399269104, "mean_token_accuracy": 0.9196744412183762, "num_tokens": 56139080.0, "step": 4551 }, { "entropy": 1.3100577592849731, "epoch": 2.3970510795155344, "grad_norm": 0.2876659333705902, "learning_rate": 0.00015774355293035025, "loss": 0.1936154067516327, "mean_token_accuracy": 0.9236638695001602, "num_tokens": 56151416.0, "step": 4552 }, { "entropy": 1.3262332379817963, "epoch": 2.397577672459189, "grad_norm": 0.26849564909935, "learning_rate": 0.00015772496301379787, "loss": 0.1760268211364746, "mean_token_accuracy": 0.923967570066452, "num_tokens": 56163752.0, "step": 4553 }, { "entropy": 1.3029709458351135, "epoch": 2.3981042654028437, "grad_norm": 0.29166650772094727, "learning_rate": 0.00015770637026409258, "loss": 0.18877920508384705, "mean_token_accuracy": 0.9225371479988098, "num_tokens": 56176088.0, "step": 4554 }, { "entropy": 1.3118659257888794, "epoch": 2.398630858346498, "grad_norm": 0.28362366557121277, "learning_rate": 0.00015768777468233816, "loss": 0.19103732705116272, "mean_token_accuracy": 0.9223171025514603, "num_tokens": 56188424.0, "step": 4555 }, { "entropy": 1.3041376173496246, "epoch": 2.3991574512901526, "grad_norm": 0.3170718550682068, "learning_rate": 0.0001576691762696385, "loss": 0.208947092294693, "mean_token_accuracy": 0.914543017745018, "num_tokens": 56200760.0, "step": 4556 }, { "entropy": 1.291472166776657, "epoch": 2.3996840442338074, "grad_norm": 0.2711356282234192, "learning_rate": 0.00015765057502709767, "loss": 0.18828198313713074, "mean_token_accuracy": 0.9219943135976791, "num_tokens": 56213096.0, "step": 4557 }, { "entropy": 1.2951588928699493, "epoch": 2.400210637177462, "grad_norm": 0.29720601439476013, "learning_rate": 0.0001576319709558199, "loss": 0.21101555228233337, "mean_token_accuracy": 0.9118272066116333, "num_tokens": 56225432.0, "step": 4558 }, { "entropy": 1.3469326496124268, "epoch": 2.4007372301211163, "grad_norm": 0.2986636757850647, "learning_rate": 0.00015761336405690967, "loss": 0.18926507234573364, "mean_token_accuracy": 0.9249073565006256, "num_tokens": 56237768.0, "step": 4559 }, { "entropy": 1.308281421661377, "epoch": 2.401263823064771, "grad_norm": 0.27620309591293335, "learning_rate": 0.00015759475433147155, "loss": 0.1896907240152359, "mean_token_accuracy": 0.9253196120262146, "num_tokens": 56250104.0, "step": 4560 }, { "entropy": 1.3006483912467957, "epoch": 2.4017904160084256, "grad_norm": 0.28648555278778076, "learning_rate": 0.0001575761417806102, "loss": 0.1915302276611328, "mean_token_accuracy": 0.921184629201889, "num_tokens": 56262440.0, "step": 4561 }, { "entropy": 1.3277715742588043, "epoch": 2.40231700895208, "grad_norm": 0.26527178287506104, "learning_rate": 0.00015755752640543068, "loss": 0.17917628586292267, "mean_token_accuracy": 0.9229338020086288, "num_tokens": 56274776.0, "step": 4562 }, { "entropy": 1.3829319775104523, "epoch": 2.4028436018957344, "grad_norm": 0.2874324321746826, "learning_rate": 0.00015753890820703796, "loss": 0.1934787929058075, "mean_token_accuracy": 0.9214570224285126, "num_tokens": 56287112.0, "step": 4563 }, { "entropy": 1.3280232846736908, "epoch": 2.4033701948393893, "grad_norm": 0.24855974316596985, "learning_rate": 0.00015752028718653735, "loss": 0.19005198776721954, "mean_token_accuracy": 0.9208149313926697, "num_tokens": 56299448.0, "step": 4564 }, { "entropy": 1.3538621664047241, "epoch": 2.4038967877830437, "grad_norm": 0.2776485085487366, "learning_rate": 0.00015750166334503428, "loss": 0.19672241806983948, "mean_token_accuracy": 0.9181719124317169, "num_tokens": 56311784.0, "step": 4565 }, { "entropy": 1.368317574262619, "epoch": 2.404423380726698, "grad_norm": 0.30098727345466614, "learning_rate": 0.00015748303668363428, "loss": 0.20025476813316345, "mean_token_accuracy": 0.916120171546936, "num_tokens": 56324120.0, "step": 4566 }, { "entropy": 1.3438273072242737, "epoch": 2.4049499736703526, "grad_norm": 0.25104859471321106, "learning_rate": 0.00015746440720344317, "loss": 0.18177089095115662, "mean_token_accuracy": 0.9239592254161835, "num_tokens": 56336456.0, "step": 4567 }, { "entropy": 1.3766308426856995, "epoch": 2.4054765666140074, "grad_norm": 0.27121055126190186, "learning_rate": 0.00015744577490556683, "loss": 0.2015809267759323, "mean_token_accuracy": 0.9173483699560165, "num_tokens": 56348792.0, "step": 4568 }, { "entropy": 1.4611666798591614, "epoch": 2.406003159557662, "grad_norm": 0.3079581558704376, "learning_rate": 0.00015742713979111135, "loss": 0.19990572333335876, "mean_token_accuracy": 0.9156835675239563, "num_tokens": 56361128.0, "step": 4569 }, { "entropy": 1.457626760005951, "epoch": 2.4065297525013163, "grad_norm": 0.2969047725200653, "learning_rate": 0.00015740850186118306, "loss": 0.2033241093158722, "mean_token_accuracy": 0.92415751516819, "num_tokens": 56373464.0, "step": 4570 }, { "entropy": 1.4298239052295685, "epoch": 2.407056345444971, "grad_norm": 0.31620898842811584, "learning_rate": 0.00015738986111688832, "loss": 0.22344595193862915, "mean_token_accuracy": 0.9087575227022171, "num_tokens": 56385800.0, "step": 4571 }, { "entropy": 1.4056819081306458, "epoch": 2.4075829383886256, "grad_norm": 0.27822446823120117, "learning_rate": 0.0001573712175593337, "loss": 0.19859078526496887, "mean_token_accuracy": 0.923060268163681, "num_tokens": 56398136.0, "step": 4572 }, { "entropy": 1.3622363805770874, "epoch": 2.40810953133228, "grad_norm": 0.2607809603214264, "learning_rate": 0.00015735257118962604, "loss": 0.1764621138572693, "mean_token_accuracy": 0.9253451228141785, "num_tokens": 56410472.0, "step": 4573 }, { "entropy": 1.4228957891464233, "epoch": 2.408636124275935, "grad_norm": 0.2639370560646057, "learning_rate": 0.0001573339220088722, "loss": 0.19621466100215912, "mean_token_accuracy": 0.920293316245079, "num_tokens": 56422808.0, "step": 4574 }, { "entropy": 1.353748857975006, "epoch": 2.4091627172195893, "grad_norm": 0.2694760859012604, "learning_rate": 0.00015731527001817928, "loss": 0.18804813921451569, "mean_token_accuracy": 0.9210447818040848, "num_tokens": 56435144.0, "step": 4575 }, { "entropy": 1.3881179988384247, "epoch": 2.4096893101632437, "grad_norm": 0.2707253694534302, "learning_rate": 0.00015729661521865452, "loss": 0.18320326507091522, "mean_token_accuracy": 0.9270624965429306, "num_tokens": 56447480.0, "step": 4576 }, { "entropy": 1.3343448638916016, "epoch": 2.4102159031068986, "grad_norm": 0.27668213844299316, "learning_rate": 0.00015727795761140545, "loss": 0.1835266351699829, "mean_token_accuracy": 0.9257790744304657, "num_tokens": 56459816.0, "step": 4577 }, { "entropy": 1.321186900138855, "epoch": 2.410742496050553, "grad_norm": 0.27669277787208557, "learning_rate": 0.00015725929719753956, "loss": 0.18208348751068115, "mean_token_accuracy": 0.9222432971000671, "num_tokens": 56472152.0, "step": 4578 }, { "entropy": 1.3364296555519104, "epoch": 2.4112690889942074, "grad_norm": 0.28166496753692627, "learning_rate": 0.00015724063397816468, "loss": 0.1879100501537323, "mean_token_accuracy": 0.919008269906044, "num_tokens": 56484488.0, "step": 4579 }, { "entropy": 1.3278461694717407, "epoch": 2.411795681937862, "grad_norm": 0.27643710374832153, "learning_rate": 0.00015722196795438866, "loss": 0.18816009163856506, "mean_token_accuracy": 0.9239133149385452, "num_tokens": 56496824.0, "step": 4580 }, { "entropy": 1.2958170771598816, "epoch": 2.4123222748815167, "grad_norm": 0.27953317761421204, "learning_rate": 0.0001572032991273196, "loss": 0.17952555418014526, "mean_token_accuracy": 0.9238559603691101, "num_tokens": 56509160.0, "step": 4581 }, { "entropy": 1.3013927638530731, "epoch": 2.412848867825171, "grad_norm": 0.2748692035675049, "learning_rate": 0.00015718462749806587, "loss": 0.19492384791374207, "mean_token_accuracy": 0.9214185774326324, "num_tokens": 56521496.0, "step": 4582 }, { "entropy": 1.3403103947639465, "epoch": 2.4133754607688256, "grad_norm": 0.30991989374160767, "learning_rate": 0.00015716595306773578, "loss": 0.19997966289520264, "mean_token_accuracy": 0.9153329730033875, "num_tokens": 56533832.0, "step": 4583 }, { "entropy": 1.3335986733436584, "epoch": 2.41390205371248, "grad_norm": 0.29624128341674805, "learning_rate": 0.00015714727583743797, "loss": 0.2043485939502716, "mean_token_accuracy": 0.9172103554010391, "num_tokens": 56546168.0, "step": 4584 }, { "entropy": 1.310105711221695, "epoch": 2.414428646656135, "grad_norm": 0.2946057915687561, "learning_rate": 0.00015712859580828116, "loss": 0.20172706246376038, "mean_token_accuracy": 0.9106387346982956, "num_tokens": 56558504.0, "step": 4585 }, { "entropy": 1.3054699003696442, "epoch": 2.4149552395997893, "grad_norm": 0.26526352763175964, "learning_rate": 0.00015710991298137434, "loss": 0.1864761859178543, "mean_token_accuracy": 0.9250095337629318, "num_tokens": 56570840.0, "step": 4586 }, { "entropy": 1.3284521996974945, "epoch": 2.4154818325434437, "grad_norm": 0.26133716106414795, "learning_rate": 0.00015709122735782654, "loss": 0.17758479714393616, "mean_token_accuracy": 0.9264996349811554, "num_tokens": 56583176.0, "step": 4587 }, { "entropy": 1.2835633158683777, "epoch": 2.4160084254870986, "grad_norm": 0.2573343515396118, "learning_rate": 0.00015707253893874705, "loss": 0.17470473051071167, "mean_token_accuracy": 0.9288149029016495, "num_tokens": 56595512.0, "step": 4588 }, { "entropy": 1.341663807630539, "epoch": 2.416535018430753, "grad_norm": 0.28183892369270325, "learning_rate": 0.0001570538477252453, "loss": 0.18871092796325684, "mean_token_accuracy": 0.923402264714241, "num_tokens": 56607848.0, "step": 4589 }, { "entropy": 1.3551491498947144, "epoch": 2.4170616113744074, "grad_norm": 0.2750586271286011, "learning_rate": 0.0001570351537184308, "loss": 0.19159851968288422, "mean_token_accuracy": 0.9253100901842117, "num_tokens": 56620184.0, "step": 4590 }, { "entropy": 1.361526906490326, "epoch": 2.4175882043180623, "grad_norm": 0.28902900218963623, "learning_rate": 0.0001570164569194134, "loss": 0.20224696397781372, "mean_token_accuracy": 0.9204160273075104, "num_tokens": 56632520.0, "step": 4591 }, { "entropy": 1.3157592415809631, "epoch": 2.4181147972617167, "grad_norm": 0.2721328139305115, "learning_rate": 0.00015699775732930303, "loss": 0.20679977536201477, "mean_token_accuracy": 0.9149771928787231, "num_tokens": 56644856.0, "step": 4592 }, { "entropy": 1.3480108678340912, "epoch": 2.418641390205371, "grad_norm": 0.24639494717121124, "learning_rate": 0.00015697905494920967, "loss": 0.18107910454273224, "mean_token_accuracy": 0.9280508905649185, "num_tokens": 56657192.0, "step": 4593 }, { "entropy": 1.340236097574234, "epoch": 2.419167983149026, "grad_norm": 0.2795374393463135, "learning_rate": 0.00015696034978024368, "loss": 0.20761287212371826, "mean_token_accuracy": 0.9111906141042709, "num_tokens": 56669528.0, "step": 4594 }, { "entropy": 1.3402322232723236, "epoch": 2.4196945760926805, "grad_norm": 0.2711165249347687, "learning_rate": 0.00015694164182351538, "loss": 0.1791497766971588, "mean_token_accuracy": 0.9271443635225296, "num_tokens": 56681864.0, "step": 4595 }, { "entropy": 1.3855849206447601, "epoch": 2.420221169036335, "grad_norm": 0.2867280840873718, "learning_rate": 0.00015692293108013545, "loss": 0.19872815907001495, "mean_token_accuracy": 0.9179540723562241, "num_tokens": 56694200.0, "step": 4596 }, { "entropy": 1.3175525963306427, "epoch": 2.4207477619799893, "grad_norm": 0.27587011456489563, "learning_rate": 0.00015690421755121457, "loss": 0.18959006667137146, "mean_token_accuracy": 0.9211609661579132, "num_tokens": 56706536.0, "step": 4597 }, { "entropy": 1.3644810616970062, "epoch": 2.421274354923644, "grad_norm": 0.2764270305633545, "learning_rate": 0.00015688550123786366, "loss": 0.1940041482448578, "mean_token_accuracy": 0.9237237423658371, "num_tokens": 56718872.0, "step": 4598 }, { "entropy": 1.3711154758930206, "epoch": 2.4218009478672986, "grad_norm": 0.2801766097545624, "learning_rate": 0.00015686678214119382, "loss": 0.1970905065536499, "mean_token_accuracy": 0.9176339656114578, "num_tokens": 56731208.0, "step": 4599 }, { "entropy": 1.3100129067897797, "epoch": 2.422327540810953, "grad_norm": 0.2844012975692749, "learning_rate": 0.0001568480602623163, "loss": 0.1999197155237198, "mean_token_accuracy": 0.9149242490530014, "num_tokens": 56743544.0, "step": 4600 }, { "entropy": 1.3215259611606598, "epoch": 2.4228541337546075, "grad_norm": 0.2659996747970581, "learning_rate": 0.00015682933560234248, "loss": 0.1908705085515976, "mean_token_accuracy": 0.9223310500383377, "num_tokens": 56755880.0, "step": 4601 }, { "entropy": 1.3315446376800537, "epoch": 2.4233807266982623, "grad_norm": 0.28083324432373047, "learning_rate": 0.00015681060816238394, "loss": 0.1834309995174408, "mean_token_accuracy": 0.9284676909446716, "num_tokens": 56768216.0, "step": 4602 }, { "entropy": 1.2885978817939758, "epoch": 2.4239073196419167, "grad_norm": 0.2809126675128937, "learning_rate": 0.00015679187794355242, "loss": 0.1866403967142105, "mean_token_accuracy": 0.9212284684181213, "num_tokens": 56780552.0, "step": 4603 }, { "entropy": 1.2973859310150146, "epoch": 2.424433912585571, "grad_norm": 0.2610211670398712, "learning_rate": 0.00015677314494695984, "loss": 0.17383259534835815, "mean_token_accuracy": 0.927782341837883, "num_tokens": 56792888.0, "step": 4604 }, { "entropy": 1.3476527631282806, "epoch": 2.424960505529226, "grad_norm": 0.3418804705142975, "learning_rate": 0.00015675440917371826, "loss": 0.19662517309188843, "mean_token_accuracy": 0.9165080189704895, "num_tokens": 56805224.0, "step": 4605 }, { "entropy": 1.3011980652809143, "epoch": 2.4254870984728805, "grad_norm": 0.2649618983268738, "learning_rate": 0.00015673567062493993, "loss": 0.1870417296886444, "mean_token_accuracy": 0.9290430843830109, "num_tokens": 56817560.0, "step": 4606 }, { "entropy": 1.3310189843177795, "epoch": 2.426013691416535, "grad_norm": 0.2768966257572174, "learning_rate": 0.00015671692930173723, "loss": 0.2032088190317154, "mean_token_accuracy": 0.9112291485071182, "num_tokens": 56829896.0, "step": 4607 }, { "entropy": 1.3227407336235046, "epoch": 2.4265402843601898, "grad_norm": 0.2667352259159088, "learning_rate": 0.0001566981852052227, "loss": 0.17368647456169128, "mean_token_accuracy": 0.9290298819541931, "num_tokens": 56842232.0, "step": 4608 }, { "entropy": 1.3284336924552917, "epoch": 2.427066877303844, "grad_norm": 0.2627871632575989, "learning_rate": 0.0001566794383365091, "loss": 0.1836368292570114, "mean_token_accuracy": 0.9237141758203506, "num_tokens": 56854568.0, "step": 4609 }, { "entropy": 1.3730064928531647, "epoch": 2.4275934702474986, "grad_norm": 0.27761170268058777, "learning_rate": 0.00015666068869670932, "loss": 0.20169535279273987, "mean_token_accuracy": 0.9138482213020325, "num_tokens": 56866904.0, "step": 4610 }, { "entropy": 1.3395865857601166, "epoch": 2.4281200631911535, "grad_norm": 0.3002219796180725, "learning_rate": 0.0001566419362869364, "loss": 0.2141709327697754, "mean_token_accuracy": 0.9107076972723007, "num_tokens": 56879240.0, "step": 4611 }, { "entropy": 1.387347549200058, "epoch": 2.428646656134808, "grad_norm": 0.28495123982429504, "learning_rate": 0.00015662318110830356, "loss": 0.19449102878570557, "mean_token_accuracy": 0.9209498912096024, "num_tokens": 56891576.0, "step": 4612 }, { "entropy": 1.3817225992679596, "epoch": 2.4291732490784623, "grad_norm": 0.2706870138645172, "learning_rate": 0.00015660442316192425, "loss": 0.18900935351848602, "mean_token_accuracy": 0.9174584001302719, "num_tokens": 56903912.0, "step": 4613 }, { "entropy": 1.352656215429306, "epoch": 2.4296998420221168, "grad_norm": 0.2922493815422058, "learning_rate": 0.00015658566244891193, "loss": 0.19300967454910278, "mean_token_accuracy": 0.9183215498924255, "num_tokens": 56916248.0, "step": 4614 }, { "entropy": 1.3354830145835876, "epoch": 2.4302264349657716, "grad_norm": 0.24328167736530304, "learning_rate": 0.00015656689897038036, "loss": 0.17530909180641174, "mean_token_accuracy": 0.9271158427000046, "num_tokens": 56928584.0, "step": 4615 }, { "entropy": 1.387416660785675, "epoch": 2.430753027909426, "grad_norm": 0.2972657382488251, "learning_rate": 0.0001565481327274434, "loss": 0.1807890385389328, "mean_token_accuracy": 0.9254136830568314, "num_tokens": 56940920.0, "step": 4616 }, { "entropy": 1.4199165403842926, "epoch": 2.4312796208530805, "grad_norm": 0.2991303503513336, "learning_rate": 0.0001565293637212151, "loss": 0.20695003867149353, "mean_token_accuracy": 0.9172242283821106, "num_tokens": 56953256.0, "step": 4617 }, { "entropy": 1.3269080817699432, "epoch": 2.431806213796735, "grad_norm": 0.26729339361190796, "learning_rate": 0.00015651059195280972, "loss": 0.19468078017234802, "mean_token_accuracy": 0.9203730225563049, "num_tokens": 56965592.0, "step": 4618 }, { "entropy": 1.3127374053001404, "epoch": 2.4323328067403898, "grad_norm": 0.26924213767051697, "learning_rate": 0.0001564918174233415, "loss": 0.19689175486564636, "mean_token_accuracy": 0.9202268719673157, "num_tokens": 56977928.0, "step": 4619 }, { "entropy": 1.3146660923957825, "epoch": 2.432859399684044, "grad_norm": 0.2669108510017395, "learning_rate": 0.00015647304013392512, "loss": 0.17507515847682953, "mean_token_accuracy": 0.9252168834209442, "num_tokens": 56990264.0, "step": 4620 }, { "entropy": 1.348682701587677, "epoch": 2.4333859926276986, "grad_norm": 0.29818832874298096, "learning_rate": 0.00015645426008567518, "loss": 0.19781912863254547, "mean_token_accuracy": 0.9172385036945343, "num_tokens": 57002600.0, "step": 4621 }, { "entropy": 1.3332387804985046, "epoch": 2.4339125855713535, "grad_norm": 0.26270851492881775, "learning_rate": 0.0001564354772797066, "loss": 0.18425442278385162, "mean_token_accuracy": 0.9268904775381088, "num_tokens": 57014936.0, "step": 4622 }, { "entropy": 1.342206448316574, "epoch": 2.434439178515008, "grad_norm": 0.2695198059082031, "learning_rate": 0.00015641669171713432, "loss": 0.18070070445537567, "mean_token_accuracy": 0.9249268621206284, "num_tokens": 57027272.0, "step": 4623 }, { "entropy": 1.3906873166561127, "epoch": 2.4349657714586623, "grad_norm": 0.3107193410396576, "learning_rate": 0.0001563979033990737, "loss": 0.1972734034061432, "mean_token_accuracy": 0.9214301854372025, "num_tokens": 57039608.0, "step": 4624 }, { "entropy": 1.4046538770198822, "epoch": 2.435492364402317, "grad_norm": 0.285004585981369, "learning_rate": 0.00015637911232663988, "loss": 0.18564899265766144, "mean_token_accuracy": 0.9255692511796951, "num_tokens": 57051944.0, "step": 4625 }, { "entropy": 1.3951005041599274, "epoch": 2.4360189573459716, "grad_norm": 0.27796947956085205, "learning_rate": 0.0001563603185009485, "loss": 0.19178025424480438, "mean_token_accuracy": 0.9215326011180878, "num_tokens": 57064280.0, "step": 4626 }, { "entropy": 1.3433052897453308, "epoch": 2.436545550289626, "grad_norm": 0.2718515992164612, "learning_rate": 0.00015634152192311524, "loss": 0.17776957154273987, "mean_token_accuracy": 0.9261139184236526, "num_tokens": 57076616.0, "step": 4627 }, { "entropy": 1.4135821163654327, "epoch": 2.437072143233281, "grad_norm": 0.288688987493515, "learning_rate": 0.00015632272259425597, "loss": 0.18565590679645538, "mean_token_accuracy": 0.9266521334648132, "num_tokens": 57088952.0, "step": 4628 }, { "entropy": 1.384842336177826, "epoch": 2.4375987361769353, "grad_norm": 0.2708379030227661, "learning_rate": 0.00015630392051548653, "loss": 0.19071045517921448, "mean_token_accuracy": 0.9206132292747498, "num_tokens": 57101288.0, "step": 4629 }, { "entropy": 1.3972707092761993, "epoch": 2.4381253291205898, "grad_norm": 0.29080888628959656, "learning_rate": 0.0001562851156879233, "loss": 0.1984952986240387, "mean_token_accuracy": 0.913146585226059, "num_tokens": 57113624.0, "step": 4630 }, { "entropy": 1.3927036225795746, "epoch": 2.438651922064244, "grad_norm": 0.2511928379535675, "learning_rate": 0.00015626630811268251, "loss": 0.16358304023742676, "mean_token_accuracy": 0.9305144250392914, "num_tokens": 57125960.0, "step": 4631 }, { "entropy": 1.3519012033939362, "epoch": 2.439178515007899, "grad_norm": 0.27660346031188965, "learning_rate": 0.00015624749779088063, "loss": 0.19364917278289795, "mean_token_accuracy": 0.9169550985097885, "num_tokens": 57138296.0, "step": 4632 }, { "entropy": 1.364226907491684, "epoch": 2.4397051079515535, "grad_norm": 0.28648045659065247, "learning_rate": 0.00015622868472363438, "loss": 0.19593121111392975, "mean_token_accuracy": 0.9160383343696594, "num_tokens": 57150632.0, "step": 4633 }, { "entropy": 1.35571950674057, "epoch": 2.440231700895208, "grad_norm": 0.2771262526512146, "learning_rate": 0.00015620986891206058, "loss": 0.19743886590003967, "mean_token_accuracy": 0.9158811867237091, "num_tokens": 57162968.0, "step": 4634 }, { "entropy": 1.3340860903263092, "epoch": 2.4407582938388623, "grad_norm": 0.26926276087760925, "learning_rate": 0.00015619105035727618, "loss": 0.1867595613002777, "mean_token_accuracy": 0.9221925735473633, "num_tokens": 57175304.0, "step": 4635 }, { "entropy": 1.3448993861675262, "epoch": 2.441284886782517, "grad_norm": 0.24788318574428558, "learning_rate": 0.0001561722290603983, "loss": 0.1681167185306549, "mean_token_accuracy": 0.9328633397817612, "num_tokens": 57187640.0, "step": 4636 }, { "entropy": 1.3575890362262726, "epoch": 2.4418114797261716, "grad_norm": 0.251751571893692, "learning_rate": 0.00015615340502254433, "loss": 0.17021462321281433, "mean_token_accuracy": 0.9230402410030365, "num_tokens": 57199976.0, "step": 4637 }, { "entropy": 1.3393411338329315, "epoch": 2.442338072669826, "grad_norm": 0.27187666296958923, "learning_rate": 0.00015613457824483173, "loss": 0.1871224194765091, "mean_token_accuracy": 0.9203449487686157, "num_tokens": 57212312.0, "step": 4638 }, { "entropy": 1.3779464364051819, "epoch": 2.442864665613481, "grad_norm": 0.29460328817367554, "learning_rate": 0.0001561157487283781, "loss": 0.19687990844249725, "mean_token_accuracy": 0.9119131118059158, "num_tokens": 57224648.0, "step": 4639 }, { "entropy": 1.3972814083099365, "epoch": 2.4433912585571353, "grad_norm": 0.27819696068763733, "learning_rate": 0.00015609691647430123, "loss": 0.19143208861351013, "mean_token_accuracy": 0.9203731119632721, "num_tokens": 57236984.0, "step": 4640 }, { "entropy": 1.325174868106842, "epoch": 2.4439178515007898, "grad_norm": 0.2797207236289978, "learning_rate": 0.00015607808148371908, "loss": 0.17681381106376648, "mean_token_accuracy": 0.9269442856311798, "num_tokens": 57249320.0, "step": 4641 }, { "entropy": 1.3612459897994995, "epoch": 2.4444444444444446, "grad_norm": 0.3185685873031616, "learning_rate": 0.00015605924375774986, "loss": 0.22030019760131836, "mean_token_accuracy": 0.9069929718971252, "num_tokens": 57261656.0, "step": 4642 }, { "entropy": 1.3378702402114868, "epoch": 2.444971037388099, "grad_norm": 0.2868621349334717, "learning_rate": 0.00015604040329751176, "loss": 0.1965884119272232, "mean_token_accuracy": 0.9148354679346085, "num_tokens": 57273992.0, "step": 4643 }, { "entropy": 1.3073699176311493, "epoch": 2.4454976303317535, "grad_norm": 0.29875674843788147, "learning_rate": 0.00015602156010412327, "loss": 0.20474374294281006, "mean_token_accuracy": 0.9165049344301224, "num_tokens": 57286328.0, "step": 4644 }, { "entropy": 1.2536769807338715, "epoch": 2.446024223275408, "grad_norm": 0.29766038060188293, "learning_rate": 0.00015600271417870297, "loss": 0.20265424251556396, "mean_token_accuracy": 0.9158102571964264, "num_tokens": 57298664.0, "step": 4645 }, { "entropy": 1.3608869314193726, "epoch": 2.446550816219063, "grad_norm": 0.29727551341056824, "learning_rate": 0.00015598386552236965, "loss": 0.20152640342712402, "mean_token_accuracy": 0.9140726178884506, "num_tokens": 57311000.0, "step": 4646 }, { "entropy": 1.3182392120361328, "epoch": 2.447077409162717, "grad_norm": 0.26966792345046997, "learning_rate": 0.00015596501413624227, "loss": 0.18247759342193604, "mean_token_accuracy": 0.9275117516517639, "num_tokens": 57323336.0, "step": 4647 }, { "entropy": 1.3680989146232605, "epoch": 2.4476040021063716, "grad_norm": 0.2620154321193695, "learning_rate": 0.0001559461600214399, "loss": 0.17146539688110352, "mean_token_accuracy": 0.928724393248558, "num_tokens": 57335672.0, "step": 4648 }, { "entropy": 1.362658977508545, "epoch": 2.4481305950500265, "grad_norm": 0.25905415415763855, "learning_rate": 0.0001559273031790818, "loss": 0.19432124495506287, "mean_token_accuracy": 0.9210942685604095, "num_tokens": 57348008.0, "step": 4649 }, { "entropy": 1.3837052881717682, "epoch": 2.448657187993681, "grad_norm": 0.26196369528770447, "learning_rate": 0.00015590844361028738, "loss": 0.18118348717689514, "mean_token_accuracy": 0.9250486940145493, "num_tokens": 57360344.0, "step": 4650 }, { "entropy": 1.3374846279621124, "epoch": 2.4491837809373354, "grad_norm": 0.25008776783943176, "learning_rate": 0.00015588958131617628, "loss": 0.17867028713226318, "mean_token_accuracy": 0.9267919510602951, "num_tokens": 57372680.0, "step": 4651 }, { "entropy": 1.4585446417331696, "epoch": 2.4497103738809898, "grad_norm": 0.30302000045776367, "learning_rate": 0.00015587071629786817, "loss": 0.19897569715976715, "mean_token_accuracy": 0.9165971130132675, "num_tokens": 57385016.0, "step": 4652 }, { "entropy": 1.3716599345207214, "epoch": 2.4502369668246446, "grad_norm": 0.2903025150299072, "learning_rate": 0.00015585184855648298, "loss": 0.19135521352291107, "mean_token_accuracy": 0.9185032695531845, "num_tokens": 57397352.0, "step": 4653 }, { "entropy": 1.3391970098018646, "epoch": 2.450763559768299, "grad_norm": 0.2981782853603363, "learning_rate": 0.0001558329780931408, "loss": 0.19125044345855713, "mean_token_accuracy": 0.9198358207941055, "num_tokens": 57409688.0, "step": 4654 }, { "entropy": 1.330566942691803, "epoch": 2.4512901527119535, "grad_norm": 0.28080058097839355, "learning_rate": 0.00015581410490896186, "loss": 0.19602055847644806, "mean_token_accuracy": 0.9168371856212616, "num_tokens": 57422024.0, "step": 4655 }, { "entropy": 1.3519669771194458, "epoch": 2.4518167456556084, "grad_norm": 0.29043126106262207, "learning_rate": 0.0001557952290050665, "loss": 0.20128756761550903, "mean_token_accuracy": 0.9184352457523346, "num_tokens": 57434360.0, "step": 4656 }, { "entropy": 1.3798860013484955, "epoch": 2.452343338599263, "grad_norm": 0.31429749727249146, "learning_rate": 0.00015577635038257532, "loss": 0.20553100109100342, "mean_token_accuracy": 0.9182298481464386, "num_tokens": 57446696.0, "step": 4657 }, { "entropy": 1.3261335492134094, "epoch": 2.452869931542917, "grad_norm": 0.28215980529785156, "learning_rate": 0.00015575746904260903, "loss": 0.1838231086730957, "mean_token_accuracy": 0.9184658974409103, "num_tokens": 57459032.0, "step": 4658 }, { "entropy": 1.3846520483493805, "epoch": 2.453396524486572, "grad_norm": 0.27965161204338074, "learning_rate": 0.00015573858498628851, "loss": 0.18266066908836365, "mean_token_accuracy": 0.9234927743673325, "num_tokens": 57471368.0, "step": 4659 }, { "entropy": 1.356047660112381, "epoch": 2.4539231174302265, "grad_norm": 0.2756958305835724, "learning_rate": 0.0001557196982147348, "loss": 0.1809377521276474, "mean_token_accuracy": 0.9223103225231171, "num_tokens": 57483704.0, "step": 4660 }, { "entropy": 1.3236099183559418, "epoch": 2.454449710373881, "grad_norm": 0.24765440821647644, "learning_rate": 0.00015570080872906903, "loss": 0.17653913795948029, "mean_token_accuracy": 0.926618218421936, "num_tokens": 57496040.0, "step": 4661 }, { "entropy": 1.3622512817382812, "epoch": 2.4549763033175354, "grad_norm": 0.2710879147052765, "learning_rate": 0.00015568191653041267, "loss": 0.1775762438774109, "mean_token_accuracy": 0.9290056526660919, "num_tokens": 57508376.0, "step": 4662 }, { "entropy": 1.4271577596664429, "epoch": 2.4555028962611902, "grad_norm": 0.3400026261806488, "learning_rate": 0.00015566302161988712, "loss": 0.21410952508449554, "mean_token_accuracy": 0.9081162363290787, "num_tokens": 57520712.0, "step": 4663 }, { "entropy": 1.3488382995128632, "epoch": 2.4560294892048447, "grad_norm": 0.2925370931625366, "learning_rate": 0.00015564412399861414, "loss": 0.19027042388916016, "mean_token_accuracy": 0.9205520153045654, "num_tokens": 57533048.0, "step": 4664 }, { "entropy": 1.37377467751503, "epoch": 2.456556082148499, "grad_norm": 0.29143059253692627, "learning_rate": 0.00015562522366771556, "loss": 0.2077019214630127, "mean_token_accuracy": 0.914614737033844, "num_tokens": 57545384.0, "step": 4665 }, { "entropy": 1.3595414757728577, "epoch": 2.457082675092154, "grad_norm": 0.2915399372577667, "learning_rate": 0.00015560632062831337, "loss": 0.19326642155647278, "mean_token_accuracy": 0.9180510342121124, "num_tokens": 57557720.0, "step": 4666 }, { "entropy": 1.3504066467285156, "epoch": 2.4576092680358084, "grad_norm": 0.2623111605644226, "learning_rate": 0.00015558741488152977, "loss": 0.19019611179828644, "mean_token_accuracy": 0.9178232103586197, "num_tokens": 57570056.0, "step": 4667 }, { "entropy": 1.4193410575389862, "epoch": 2.458135860979463, "grad_norm": 0.28917214274406433, "learning_rate": 0.00015556850642848698, "loss": 0.1902349442243576, "mean_token_accuracy": 0.9237756580114365, "num_tokens": 57582392.0, "step": 4668 }, { "entropy": 1.458041101694107, "epoch": 2.458662453923117, "grad_norm": 0.29611340165138245, "learning_rate": 0.00015554959527030763, "loss": 0.208420529961586, "mean_token_accuracy": 0.917582169175148, "num_tokens": 57594728.0, "step": 4669 }, { "entropy": 1.4654216468334198, "epoch": 2.459189046866772, "grad_norm": 0.3103972375392914, "learning_rate": 0.00015553068140811426, "loss": 0.19962163269519806, "mean_token_accuracy": 0.9165554493665695, "num_tokens": 57607064.0, "step": 4670 }, { "entropy": 1.4365287721157074, "epoch": 2.4597156398104265, "grad_norm": 0.2904442548751831, "learning_rate": 0.00015551176484302973, "loss": 0.2000875622034073, "mean_token_accuracy": 0.9224870204925537, "num_tokens": 57619400.0, "step": 4671 }, { "entropy": 1.4503169655799866, "epoch": 2.460242232754081, "grad_norm": 0.3007279634475708, "learning_rate": 0.00015549284557617697, "loss": 0.20989835262298584, "mean_token_accuracy": 0.9129480719566345, "num_tokens": 57631736.0, "step": 4672 }, { "entropy": 1.4487575888633728, "epoch": 2.460768825697736, "grad_norm": 0.2559841573238373, "learning_rate": 0.0001554739236086791, "loss": 0.17120632529258728, "mean_token_accuracy": 0.9269149452447891, "num_tokens": 57644072.0, "step": 4673 }, { "entropy": 1.5271873474121094, "epoch": 2.4612954186413902, "grad_norm": 0.29322513937950134, "learning_rate": 0.00015545499894165945, "loss": 0.20046186447143555, "mean_token_accuracy": 0.9165253788232803, "num_tokens": 57656408.0, "step": 4674 }, { "entropy": 1.4375866651535034, "epoch": 2.4618220115850447, "grad_norm": 0.24410809576511383, "learning_rate": 0.00015543607157624141, "loss": 0.18259111046791077, "mean_token_accuracy": 0.9227998405694962, "num_tokens": 57668744.0, "step": 4675 }, { "entropy": 1.431043803691864, "epoch": 2.4623486045286995, "grad_norm": 0.2558969259262085, "learning_rate": 0.00015541714151354866, "loss": 0.1708768606185913, "mean_token_accuracy": 0.9271507263183594, "num_tokens": 57681080.0, "step": 4676 }, { "entropy": 1.4392517507076263, "epoch": 2.462875197472354, "grad_norm": 0.27898111939430237, "learning_rate": 0.00015539820875470493, "loss": 0.18238875269889832, "mean_token_accuracy": 0.9190804958343506, "num_tokens": 57693416.0, "step": 4677 }, { "entropy": 1.4586999714374542, "epoch": 2.4634017904160084, "grad_norm": 0.2722666561603546, "learning_rate": 0.00015537927330083412, "loss": 0.1785045862197876, "mean_token_accuracy": 0.9265280216932297, "num_tokens": 57705752.0, "step": 4678 }, { "entropy": 1.4363029897212982, "epoch": 2.463928383359663, "grad_norm": 0.2756902277469635, "learning_rate": 0.00015536033515306036, "loss": 0.19934740662574768, "mean_token_accuracy": 0.9203079342842102, "num_tokens": 57718088.0, "step": 4679 }, { "entropy": 1.3940038681030273, "epoch": 2.4644549763033177, "grad_norm": 0.2740958034992218, "learning_rate": 0.00015534139431250789, "loss": 0.2017807960510254, "mean_token_accuracy": 0.9153221100568771, "num_tokens": 57730424.0, "step": 4680 }, { "entropy": 1.4366330802440643, "epoch": 2.464981569246972, "grad_norm": 0.2849027216434479, "learning_rate": 0.0001553224507803011, "loss": 0.20108060538768768, "mean_token_accuracy": 0.9228730350732803, "num_tokens": 57742760.0, "step": 4681 }, { "entropy": 1.4022051692008972, "epoch": 2.4655081621906265, "grad_norm": 0.25662413239479065, "learning_rate": 0.00015530350455756457, "loss": 0.1900719702243805, "mean_token_accuracy": 0.9239797294139862, "num_tokens": 57755096.0, "step": 4682 }, { "entropy": 1.3925521671772003, "epoch": 2.4660347551342814, "grad_norm": 0.27127277851104736, "learning_rate": 0.000155284555645423, "loss": 0.19370390474796295, "mean_token_accuracy": 0.9192579835653305, "num_tokens": 57767432.0, "step": 4683 }, { "entropy": 1.4185691177845001, "epoch": 2.466561348077936, "grad_norm": 0.25780409574508667, "learning_rate": 0.00015526560404500138, "loss": 0.1686680167913437, "mean_token_accuracy": 0.92674720287323, "num_tokens": 57779768.0, "step": 4684 }, { "entropy": 1.4209790229797363, "epoch": 2.4670879410215902, "grad_norm": 0.2740281820297241, "learning_rate": 0.00015524664975742457, "loss": 0.17835459113121033, "mean_token_accuracy": 0.9256129860877991, "num_tokens": 57792104.0, "step": 4685 }, { "entropy": 1.400107204914093, "epoch": 2.4676145339652447, "grad_norm": 0.2728610634803772, "learning_rate": 0.00015522769278381797, "loss": 0.19086140394210815, "mean_token_accuracy": 0.9191389083862305, "num_tokens": 57804440.0, "step": 4686 }, { "entropy": 1.3877354562282562, "epoch": 2.4681411269088995, "grad_norm": 0.2909792959690094, "learning_rate": 0.0001552087331253068, "loss": 0.19899430871009827, "mean_token_accuracy": 0.9197440594434738, "num_tokens": 57816776.0, "step": 4687 }, { "entropy": 1.379683405160904, "epoch": 2.468667719852554, "grad_norm": 0.2930801808834076, "learning_rate": 0.00015518977078301667, "loss": 0.19332917034626007, "mean_token_accuracy": 0.9176100790500641, "num_tokens": 57829112.0, "step": 4688 }, { "entropy": 1.384777694940567, "epoch": 2.4691943127962084, "grad_norm": 0.24330542981624603, "learning_rate": 0.00015517080575807319, "loss": 0.1706233024597168, "mean_token_accuracy": 0.9322277456521988, "num_tokens": 57841448.0, "step": 4689 }, { "entropy": 1.354981243610382, "epoch": 2.4697209057398632, "grad_norm": 0.2700625956058502, "learning_rate": 0.00015515183805160228, "loss": 0.17830899357795715, "mean_token_accuracy": 0.9246155321598053, "num_tokens": 57853784.0, "step": 4690 }, { "entropy": 1.348482221364975, "epoch": 2.4702474986835177, "grad_norm": 0.29389628767967224, "learning_rate": 0.00015513286766472993, "loss": 0.20552103221416473, "mean_token_accuracy": 0.9085098803043365, "num_tokens": 57866120.0, "step": 4691 }, { "entropy": 1.3473348915576935, "epoch": 2.470774091627172, "grad_norm": 0.291768878698349, "learning_rate": 0.00015511389459858224, "loss": 0.1977330446243286, "mean_token_accuracy": 0.91968734562397, "num_tokens": 57878456.0, "step": 4692 }, { "entropy": 1.3101034462451935, "epoch": 2.471300684570827, "grad_norm": 0.26433873176574707, "learning_rate": 0.0001550949188542856, "loss": 0.18745142221450806, "mean_token_accuracy": 0.9202346354722977, "num_tokens": 57890792.0, "step": 4693 }, { "entropy": 1.3141293823719025, "epoch": 2.4718272775144814, "grad_norm": 0.2735169231891632, "learning_rate": 0.00015507594043296646, "loss": 0.18631723523139954, "mean_token_accuracy": 0.9204375594854355, "num_tokens": 57903128.0, "step": 4694 }, { "entropy": 1.3004171252250671, "epoch": 2.472353870458136, "grad_norm": 0.2703790068626404, "learning_rate": 0.00015505695933575145, "loss": 0.2004447877407074, "mean_token_accuracy": 0.9170452207326889, "num_tokens": 57915464.0, "step": 4695 }, { "entropy": 1.3433512449264526, "epoch": 2.4728804634017902, "grad_norm": 0.31277215480804443, "learning_rate": 0.00015503797556376737, "loss": 0.21629300713539124, "mean_token_accuracy": 0.9137300401926041, "num_tokens": 57927800.0, "step": 4696 }, { "entropy": 1.3618537187576294, "epoch": 2.473407056345445, "grad_norm": 0.27481234073638916, "learning_rate": 0.0001550189891181412, "loss": 0.19332623481750488, "mean_token_accuracy": 0.9189375638961792, "num_tokens": 57940136.0, "step": 4697 }, { "entropy": 1.3607601523399353, "epoch": 2.4739336492890995, "grad_norm": 0.27814021706581116, "learning_rate": 0.000155, "loss": 0.20003022253513336, "mean_token_accuracy": 0.919358566403389, "num_tokens": 57952472.0, "step": 4698 }, { "entropy": 1.341829001903534, "epoch": 2.474460242232754, "grad_norm": 0.29070931673049927, "learning_rate": 0.0001549810082104711, "loss": 0.20077884197235107, "mean_token_accuracy": 0.9115552604198456, "num_tokens": 57964808.0, "step": 4699 }, { "entropy": 1.3571709096431732, "epoch": 2.474986835176409, "grad_norm": 0.2642231285572052, "learning_rate": 0.00015496201375068193, "loss": 0.18121525645256042, "mean_token_accuracy": 0.9253357946872711, "num_tokens": 57977144.0, "step": 4700 }, { "entropy": 1.3776450157165527, "epoch": 2.4755134281200633, "grad_norm": 0.2865309715270996, "learning_rate": 0.00015494301662176006, "loss": 0.18393152952194214, "mean_token_accuracy": 0.9276510328054428, "num_tokens": 57989480.0, "step": 4701 }, { "entropy": 1.3750910758972168, "epoch": 2.4760400210637177, "grad_norm": 0.2893163561820984, "learning_rate": 0.00015492401682483324, "loss": 0.19169265031814575, "mean_token_accuracy": 0.9269598424434662, "num_tokens": 58001816.0, "step": 4702 }, { "entropy": 1.343192994594574, "epoch": 2.476566614007372, "grad_norm": 0.2709070146083832, "learning_rate": 0.00015490501436102934, "loss": 0.1982916295528412, "mean_token_accuracy": 0.9179317057132721, "num_tokens": 58014152.0, "step": 4703 }, { "entropy": 1.283618688583374, "epoch": 2.477093206951027, "grad_norm": 0.26297813653945923, "learning_rate": 0.0001548860092314765, "loss": 0.18507333099842072, "mean_token_accuracy": 0.9239300638437271, "num_tokens": 58026488.0, "step": 4704 }, { "entropy": 1.3479060232639313, "epoch": 2.4776197998946814, "grad_norm": 0.2526850998401642, "learning_rate": 0.00015486700143730288, "loss": 0.16395074129104614, "mean_token_accuracy": 0.9379178881645203, "num_tokens": 58038824.0, "step": 4705 }, { "entropy": 1.3700522780418396, "epoch": 2.478146392838336, "grad_norm": 0.2784835696220398, "learning_rate": 0.00015484799097963695, "loss": 0.19287003576755524, "mean_token_accuracy": 0.918778121471405, "num_tokens": 58051160.0, "step": 4706 }, { "entropy": 1.3807547688484192, "epoch": 2.4786729857819907, "grad_norm": 0.2824748158454895, "learning_rate": 0.00015482897785960712, "loss": 0.18871180713176727, "mean_token_accuracy": 0.9191993176937103, "num_tokens": 58063496.0, "step": 4707 }, { "entropy": 1.4022415578365326, "epoch": 2.479199578725645, "grad_norm": 0.28391286730766296, "learning_rate": 0.0001548099620783422, "loss": 0.200555682182312, "mean_token_accuracy": 0.9131074696779251, "num_tokens": 58075832.0, "step": 4708 }, { "entropy": 1.428839921951294, "epoch": 2.4797261716692995, "grad_norm": 0.2970784604549408, "learning_rate": 0.000154790943636971, "loss": 0.1906449794769287, "mean_token_accuracy": 0.9224237501621246, "num_tokens": 58088168.0, "step": 4709 }, { "entropy": 1.3637046813964844, "epoch": 2.4802527646129544, "grad_norm": 0.25533929467201233, "learning_rate": 0.0001547719225366225, "loss": 0.1766054928302765, "mean_token_accuracy": 0.9246645867824554, "num_tokens": 58100504.0, "step": 4710 }, { "entropy": 1.4180608987808228, "epoch": 2.480779357556609, "grad_norm": 0.2714919447898865, "learning_rate": 0.00015475289877842595, "loss": 0.183756485581398, "mean_token_accuracy": 0.924714669585228, "num_tokens": 58112840.0, "step": 4711 }, { "entropy": 1.4052789807319641, "epoch": 2.4813059505002633, "grad_norm": 0.2869175374507904, "learning_rate": 0.00015473387236351064, "loss": 0.19138438999652863, "mean_token_accuracy": 0.9229259192943573, "num_tokens": 58125176.0, "step": 4712 }, { "entropy": 1.495551347732544, "epoch": 2.4818325434439177, "grad_norm": 0.29526039958000183, "learning_rate": 0.000154714843293006, "loss": 0.20986592769622803, "mean_token_accuracy": 0.9124022424221039, "num_tokens": 58137512.0, "step": 4713 }, { "entropy": 1.4451051354408264, "epoch": 2.4823591363875726, "grad_norm": 0.2789779007434845, "learning_rate": 0.0001546958115680418, "loss": 0.18474294245243073, "mean_token_accuracy": 0.9247586131095886, "num_tokens": 58149848.0, "step": 4714 }, { "entropy": 1.3909856081008911, "epoch": 2.482885729331227, "grad_norm": 0.24263574182987213, "learning_rate": 0.00015467677718974775, "loss": 0.1780616194009781, "mean_token_accuracy": 0.9270612746477127, "num_tokens": 58162184.0, "step": 4715 }, { "entropy": 1.4340462684631348, "epoch": 2.4834123222748814, "grad_norm": 0.2651912569999695, "learning_rate": 0.00015465774015925384, "loss": 0.17408399283885956, "mean_token_accuracy": 0.926845371723175, "num_tokens": 58174520.0, "step": 4716 }, { "entropy": 1.4597930312156677, "epoch": 2.483938915218536, "grad_norm": 0.28243258595466614, "learning_rate": 0.00015463870047769017, "loss": 0.18010583519935608, "mean_token_accuracy": 0.9231376051902771, "num_tokens": 58186856.0, "step": 4717 }, { "entropy": 1.4875306189060211, "epoch": 2.4844655081621907, "grad_norm": 0.29506340622901917, "learning_rate": 0.000154619658146187, "loss": 0.18998458981513977, "mean_token_accuracy": 0.9228047430515289, "num_tokens": 58199192.0, "step": 4718 }, { "entropy": 1.4901301264762878, "epoch": 2.484992101105845, "grad_norm": 0.2923277020454407, "learning_rate": 0.00015460061316587484, "loss": 0.2033998817205429, "mean_token_accuracy": 0.9161169081926346, "num_tokens": 58211528.0, "step": 4719 }, { "entropy": 1.498829424381256, "epoch": 2.4855186940494995, "grad_norm": 0.3002236783504486, "learning_rate": 0.00015458156553788423, "loss": 0.21175146102905273, "mean_token_accuracy": 0.9184870421886444, "num_tokens": 58223864.0, "step": 4720 }, { "entropy": 1.413221299648285, "epoch": 2.4860452869931544, "grad_norm": 0.28396493196487427, "learning_rate": 0.0001545625152633459, "loss": 0.18868695199489594, "mean_token_accuracy": 0.9188051074743271, "num_tokens": 58236200.0, "step": 4721 }, { "entropy": 1.4876404404640198, "epoch": 2.486571879936809, "grad_norm": 0.27693501114845276, "learning_rate": 0.00015454346234339075, "loss": 0.18164798617362976, "mean_token_accuracy": 0.9216231107711792, "num_tokens": 58248536.0, "step": 4722 }, { "entropy": 1.4857076406478882, "epoch": 2.4870984728804633, "grad_norm": 0.28282952308654785, "learning_rate": 0.00015452440677914987, "loss": 0.19472423195838928, "mean_token_accuracy": 0.9207596182823181, "num_tokens": 58260872.0, "step": 4723 }, { "entropy": 1.5304179787635803, "epoch": 2.487625065824118, "grad_norm": 0.2851126790046692, "learning_rate": 0.00015450534857175448, "loss": 0.1930224597454071, "mean_token_accuracy": 0.9197488129138947, "num_tokens": 58273208.0, "step": 4724 }, { "entropy": 1.5518591701984406, "epoch": 2.4881516587677726, "grad_norm": 0.33592379093170166, "learning_rate": 0.0001544862877223359, "loss": 0.19371357560157776, "mean_token_accuracy": 0.9196053594350815, "num_tokens": 58285544.0, "step": 4725 }, { "entropy": 1.4344633221626282, "epoch": 2.488678251711427, "grad_norm": 0.2809014618396759, "learning_rate": 0.00015446722423202575, "loss": 0.1901252120733261, "mean_token_accuracy": 0.9172061532735825, "num_tokens": 58297880.0, "step": 4726 }, { "entropy": 1.4716311693191528, "epoch": 2.489204844655082, "grad_norm": 0.2870580554008484, "learning_rate": 0.00015444815810195566, "loss": 0.19343703985214233, "mean_token_accuracy": 0.9194012731313705, "num_tokens": 58310216.0, "step": 4727 }, { "entropy": 1.4924903213977814, "epoch": 2.4897314375987363, "grad_norm": 0.2923792004585266, "learning_rate": 0.0001544290893332575, "loss": 0.1825990229845047, "mean_token_accuracy": 0.9255896955728531, "num_tokens": 58322552.0, "step": 4728 }, { "entropy": 1.4978864192962646, "epoch": 2.4902580305423907, "grad_norm": 0.2822360098361969, "learning_rate": 0.00015441001792706322, "loss": 0.1829996407032013, "mean_token_accuracy": 0.923396423459053, "num_tokens": 58334888.0, "step": 4729 }, { "entropy": 1.4193677008152008, "epoch": 2.490784623486045, "grad_norm": 0.2578467130661011, "learning_rate": 0.00015439094388450502, "loss": 0.170360267162323, "mean_token_accuracy": 0.9318064004182816, "num_tokens": 58347224.0, "step": 4730 }, { "entropy": 1.4174853563308716, "epoch": 2.4913112164297, "grad_norm": 0.26211613416671753, "learning_rate": 0.00015437186720671523, "loss": 0.18280640244483948, "mean_token_accuracy": 0.9214925467967987, "num_tokens": 58359560.0, "step": 4731 }, { "entropy": 1.4184439182281494, "epoch": 2.4918378093733544, "grad_norm": 0.27308353781700134, "learning_rate": 0.00015435278789482636, "loss": 0.18611527979373932, "mean_token_accuracy": 0.9204042702913284, "num_tokens": 58371896.0, "step": 4732 }, { "entropy": 1.442617654800415, "epoch": 2.492364402317009, "grad_norm": 0.2780870199203491, "learning_rate": 0.00015433370594997089, "loss": 0.1830921471118927, "mean_token_accuracy": 0.9229092448949814, "num_tokens": 58384232.0, "step": 4733 }, { "entropy": 1.484441488981247, "epoch": 2.4928909952606633, "grad_norm": 0.27742764353752136, "learning_rate": 0.00015431462137328173, "loss": 0.1889549344778061, "mean_token_accuracy": 0.9233603626489639, "num_tokens": 58396568.0, "step": 4734 }, { "entropy": 1.4144461452960968, "epoch": 2.493417588204318, "grad_norm": 0.29658958315849304, "learning_rate": 0.00015429553416589176, "loss": 0.19394293427467346, "mean_token_accuracy": 0.9221424907445908, "num_tokens": 58408904.0, "step": 4735 }, { "entropy": 1.3806745409965515, "epoch": 2.4939441811479726, "grad_norm": 0.27006301283836365, "learning_rate": 0.00015427644432893414, "loss": 0.19147875905036926, "mean_token_accuracy": 0.9202659428119659, "num_tokens": 58421240.0, "step": 4736 }, { "entropy": 1.4355372488498688, "epoch": 2.494470774091627, "grad_norm": 0.2959778308868408, "learning_rate": 0.00015425735186354208, "loss": 0.18910780549049377, "mean_token_accuracy": 0.920879676938057, "num_tokens": 58433576.0, "step": 4737 }, { "entropy": 1.4152382910251617, "epoch": 2.494997367035282, "grad_norm": 0.2920873165130615, "learning_rate": 0.00015423825677084895, "loss": 0.196088045835495, "mean_token_accuracy": 0.9160876125097275, "num_tokens": 58445912.0, "step": 4738 }, { "entropy": 1.4021598100662231, "epoch": 2.4955239599789363, "grad_norm": 0.2944489121437073, "learning_rate": 0.0001542191590519884, "loss": 0.19860148429870605, "mean_token_accuracy": 0.9189711213111877, "num_tokens": 58458248.0, "step": 4739 }, { "entropy": 1.3974989652633667, "epoch": 2.4960505529225907, "grad_norm": 0.2927993834018707, "learning_rate": 0.0001542000587080941, "loss": 0.20249119400978088, "mean_token_accuracy": 0.9131207466125488, "num_tokens": 58470584.0, "step": 4740 }, { "entropy": 1.528170496225357, "epoch": 2.4965771458662456, "grad_norm": 0.3085220456123352, "learning_rate": 0.0001541809557402999, "loss": 0.1807674765586853, "mean_token_accuracy": 0.9273618459701538, "num_tokens": 58482920.0, "step": 4741 }, { "entropy": 1.367598444223404, "epoch": 2.4971037388099, "grad_norm": 0.2692739963531494, "learning_rate": 0.00015416185014973993, "loss": 0.19078630208969116, "mean_token_accuracy": 0.919693797826767, "num_tokens": 58495256.0, "step": 4742 }, { "entropy": 1.339257150888443, "epoch": 2.4976303317535544, "grad_norm": 0.24560058116912842, "learning_rate": 0.00015414274193754823, "loss": 0.1724538803100586, "mean_token_accuracy": 0.9302109032869339, "num_tokens": 58507592.0, "step": 4743 }, { "entropy": 1.411946326494217, "epoch": 2.4981569246972093, "grad_norm": 0.27875998616218567, "learning_rate": 0.00015412363110485928, "loss": 0.19445690512657166, "mean_token_accuracy": 0.9199328869581223, "num_tokens": 58519928.0, "step": 4744 }, { "entropy": 1.4017539620399475, "epoch": 2.4986835176408637, "grad_norm": 0.2869739234447479, "learning_rate": 0.0001541045176528075, "loss": 0.18097423017024994, "mean_token_accuracy": 0.9258893132209778, "num_tokens": 58532264.0, "step": 4745 }, { "entropy": 1.3831762373447418, "epoch": 2.499210110584518, "grad_norm": 0.30489039421081543, "learning_rate": 0.00015408540158252755, "loss": 0.1928139328956604, "mean_token_accuracy": 0.9191577881574631, "num_tokens": 58544600.0, "step": 4746 }, { "entropy": 1.4570479691028595, "epoch": 2.4997367035281726, "grad_norm": 0.2680588960647583, "learning_rate": 0.0001540662828951543, "loss": 0.17343565821647644, "mean_token_accuracy": 0.9286295920610428, "num_tokens": 58556936.0, "step": 4747 }, { "entropy": 1.482690542936325, "epoch": 2.5002632964718274, "grad_norm": 0.27270379662513733, "learning_rate": 0.00015404716159182264, "loss": 0.1857714056968689, "mean_token_accuracy": 0.9244716465473175, "num_tokens": 58569272.0, "step": 4748 }, { "entropy": 1.4173051118850708, "epoch": 2.500789889415482, "grad_norm": 0.26899290084838867, "learning_rate": 0.00015402803767366774, "loss": 0.19327764213085175, "mean_token_accuracy": 0.9222336858510971, "num_tokens": 58581608.0, "step": 4749 }, { "entropy": 1.3975452482700348, "epoch": 2.5013164823591363, "grad_norm": 0.2648375332355499, "learning_rate": 0.00015400891114182488, "loss": 0.1719164401292801, "mean_token_accuracy": 0.9263694137334824, "num_tokens": 58593944.0, "step": 4750 }, { "entropy": 1.4633611142635345, "epoch": 2.5018430753027907, "grad_norm": 0.27619731426239014, "learning_rate": 0.00015398978199742945, "loss": 0.19618642330169678, "mean_token_accuracy": 0.9181656688451767, "num_tokens": 58606280.0, "step": 4751 }, { "entropy": 1.4815970957279205, "epoch": 2.5023696682464456, "grad_norm": 0.2575641870498657, "learning_rate": 0.000153970650241617, "loss": 0.1765824407339096, "mean_token_accuracy": 0.9256032109260559, "num_tokens": 58618616.0, "step": 4752 }, { "entropy": 1.4368881583213806, "epoch": 2.5028962611901, "grad_norm": 0.260724276304245, "learning_rate": 0.0001539515158755234, "loss": 0.1661488264799118, "mean_token_accuracy": 0.9317044764757156, "num_tokens": 58630952.0, "step": 4753 }, { "entropy": 1.537843406200409, "epoch": 2.5034228541337544, "grad_norm": 0.27667954564094543, "learning_rate": 0.00015393237890028443, "loss": 0.16878753900527954, "mean_token_accuracy": 0.929436519742012, "num_tokens": 58643288.0, "step": 4754 }, { "entropy": 1.4854961335659027, "epoch": 2.5039494470774093, "grad_norm": 0.2952048182487488, "learning_rate": 0.00015391323931703617, "loss": 0.17188966274261475, "mean_token_accuracy": 0.9301230907440186, "num_tokens": 58655624.0, "step": 4755 }, { "entropy": 1.5180222392082214, "epoch": 2.5044760400210637, "grad_norm": 0.3058265745639801, "learning_rate": 0.0001538940971269149, "loss": 0.19406625628471375, "mean_token_accuracy": 0.91983662545681, "num_tokens": 58667960.0, "step": 4756 }, { "entropy": 1.5174492299556732, "epoch": 2.505002632964718, "grad_norm": 0.2982122004032135, "learning_rate": 0.0001538749523310569, "loss": 0.19521798193454742, "mean_token_accuracy": 0.9169194102287292, "num_tokens": 58680296.0, "step": 4757 }, { "entropy": 1.5078306794166565, "epoch": 2.505529225908373, "grad_norm": 0.33034297823905945, "learning_rate": 0.00015385580493059865, "loss": 0.17905089259147644, "mean_token_accuracy": 0.9300853908061981, "num_tokens": 58692632.0, "step": 4758 }, { "entropy": 1.5533065497875214, "epoch": 2.5060558188520274, "grad_norm": 0.3211785554885864, "learning_rate": 0.0001538366549266769, "loss": 0.2184678316116333, "mean_token_accuracy": 0.912133514881134, "num_tokens": 58704968.0, "step": 4759 }, { "entropy": 1.5568303167819977, "epoch": 2.506582411795682, "grad_norm": 0.2776426374912262, "learning_rate": 0.00015381750232042847, "loss": 0.18281778693199158, "mean_token_accuracy": 0.925473615527153, "num_tokens": 58717304.0, "step": 4760 }, { "entropy": 1.5951158702373505, "epoch": 2.5071090047393367, "grad_norm": 0.28495267033576965, "learning_rate": 0.0001537983471129903, "loss": 0.19968701899051666, "mean_token_accuracy": 0.9174495190382004, "num_tokens": 58729640.0, "step": 4761 }, { "entropy": 1.6484262645244598, "epoch": 2.507635597682991, "grad_norm": 0.278410404920578, "learning_rate": 0.00015377918930549952, "loss": 0.1968478113412857, "mean_token_accuracy": 0.9191997349262238, "num_tokens": 58741976.0, "step": 4762 }, { "entropy": 1.5548788011074066, "epoch": 2.5081621906266456, "grad_norm": 0.3318310081958771, "learning_rate": 0.00015376002889909345, "loss": 0.19419671595096588, "mean_token_accuracy": 0.9201514571905136, "num_tokens": 58754312.0, "step": 4763 }, { "entropy": 1.5360266864299774, "epoch": 2.5086887835703, "grad_norm": 0.27847015857696533, "learning_rate": 0.00015374086589490951, "loss": 0.19744856655597687, "mean_token_accuracy": 0.9216972440481186, "num_tokens": 58766648.0, "step": 4764 }, { "entropy": 1.5686508417129517, "epoch": 2.509215376513955, "grad_norm": 0.28824716806411743, "learning_rate": 0.00015372170029408534, "loss": 0.1984092742204666, "mean_token_accuracy": 0.9193175435066223, "num_tokens": 58778984.0, "step": 4765 }, { "entropy": 1.5758169889450073, "epoch": 2.5097419694576093, "grad_norm": 0.2656327486038208, "learning_rate": 0.0001537025320977586, "loss": 0.1845746636390686, "mean_token_accuracy": 0.9232941418886185, "num_tokens": 58791320.0, "step": 4766 }, { "entropy": 1.543961524963379, "epoch": 2.5102685624012637, "grad_norm": 0.27334338426589966, "learning_rate": 0.0001536833613070673, "loss": 0.18064028024673462, "mean_token_accuracy": 0.9252053499221802, "num_tokens": 58803656.0, "step": 4767 }, { "entropy": 1.595755398273468, "epoch": 2.510795155344918, "grad_norm": 0.28184929490089417, "learning_rate": 0.00015366418792314937, "loss": 0.18395768105983734, "mean_token_accuracy": 0.9240316599607468, "num_tokens": 58815992.0, "step": 4768 }, { "entropy": 1.529136598110199, "epoch": 2.511321748288573, "grad_norm": 0.2473924607038498, "learning_rate": 0.00015364501194714317, "loss": 0.17464369535446167, "mean_token_accuracy": 0.9280594140291214, "num_tokens": 58828328.0, "step": 4769 }, { "entropy": 1.5212011635303497, "epoch": 2.5118483412322274, "grad_norm": 0.25740960240364075, "learning_rate": 0.00015362583338018694, "loss": 0.19115827977657318, "mean_token_accuracy": 0.9235165566205978, "num_tokens": 58840664.0, "step": 4770 }, { "entropy": 1.5040476322174072, "epoch": 2.512374934175882, "grad_norm": 0.2637852728366852, "learning_rate": 0.0001536066522234193, "loss": 0.18358321487903595, "mean_token_accuracy": 0.9271368533372879, "num_tokens": 58853000.0, "step": 4771 }, { "entropy": 1.4970723390579224, "epoch": 2.5129015271195367, "grad_norm": 0.26975688338279724, "learning_rate": 0.00015358746847797885, "loss": 0.19123801589012146, "mean_token_accuracy": 0.9218833893537521, "num_tokens": 58865336.0, "step": 4772 }, { "entropy": 1.4308944344520569, "epoch": 2.513428120063191, "grad_norm": 0.26151081919670105, "learning_rate": 0.00015356828214500444, "loss": 0.18660297989845276, "mean_token_accuracy": 0.9219815135002136, "num_tokens": 58877672.0, "step": 4773 }, { "entropy": 1.541033297777176, "epoch": 2.5139547130068456, "grad_norm": 0.30042555928230286, "learning_rate": 0.0001535490932256351, "loss": 0.20421351492404938, "mean_token_accuracy": 0.9185314625501633, "num_tokens": 58890008.0, "step": 4774 }, { "entropy": 1.4968733489513397, "epoch": 2.5144813059505005, "grad_norm": 0.30032971501350403, "learning_rate": 0.00015352990172100989, "loss": 0.19920584559440613, "mean_token_accuracy": 0.9175475388765335, "num_tokens": 58902344.0, "step": 4775 }, { "entropy": 1.4867732226848602, "epoch": 2.515007898894155, "grad_norm": 0.26996806263923645, "learning_rate": 0.00015351070763226806, "loss": 0.19374677538871765, "mean_token_accuracy": 0.9205781370401382, "num_tokens": 58914680.0, "step": 4776 }, { "entropy": 1.4824062585830688, "epoch": 2.5155344918378093, "grad_norm": 0.2542126178741455, "learning_rate": 0.0001534915109605492, "loss": 0.17349721491336823, "mean_token_accuracy": 0.9280759692192078, "num_tokens": 58927016.0, "step": 4777 }, { "entropy": 1.4385600686073303, "epoch": 2.516061084781464, "grad_norm": 0.2770039141178131, "learning_rate": 0.0001534723117069928, "loss": 0.18407964706420898, "mean_token_accuracy": 0.9262531846761703, "num_tokens": 58939352.0, "step": 4778 }, { "entropy": 1.3186810910701752, "epoch": 2.5165876777251186, "grad_norm": 0.2739590108394623, "learning_rate": 0.00015345310987273863, "loss": 0.18699848651885986, "mean_token_accuracy": 0.9226303249597549, "num_tokens": 58951688.0, "step": 4779 }, { "entropy": 1.3342479169368744, "epoch": 2.517114270668773, "grad_norm": 0.2480226755142212, "learning_rate": 0.00015343390545892658, "loss": 0.17880557477474213, "mean_token_accuracy": 0.9291187077760696, "num_tokens": 58964024.0, "step": 4780 }, { "entropy": 1.4129751324653625, "epoch": 2.5176408636124274, "grad_norm": 0.28868386149406433, "learning_rate": 0.00015341469846669674, "loss": 0.18943078815937042, "mean_token_accuracy": 0.9252970963716507, "num_tokens": 58976360.0, "step": 4781 }, { "entropy": 1.4371739029884338, "epoch": 2.518167456556082, "grad_norm": 0.2903843820095062, "learning_rate": 0.00015339548889718927, "loss": 0.19646281003952026, "mean_token_accuracy": 0.9155204445123672, "num_tokens": 58988696.0, "step": 4782 }, { "entropy": 1.3534334003925323, "epoch": 2.5186940494997367, "grad_norm": 0.2689908742904663, "learning_rate": 0.00015337627675154452, "loss": 0.19126330316066742, "mean_token_accuracy": 0.9226963371038437, "num_tokens": 59001032.0, "step": 4783 }, { "entropy": 1.403167486190796, "epoch": 2.519220642443391, "grad_norm": 0.2755464017391205, "learning_rate": 0.0001533570620309031, "loss": 0.1715218722820282, "mean_token_accuracy": 0.9286895543336868, "num_tokens": 59013368.0, "step": 4784 }, { "entropy": 1.342715084552765, "epoch": 2.5197472353870456, "grad_norm": 0.28502821922302246, "learning_rate": 0.00015333784473640558, "loss": 0.18913885951042175, "mean_token_accuracy": 0.9184420257806778, "num_tokens": 59025704.0, "step": 4785 }, { "entropy": 1.381771981716156, "epoch": 2.5202738283307005, "grad_norm": 0.300022691488266, "learning_rate": 0.00015331862486919282, "loss": 0.20708000659942627, "mean_token_accuracy": 0.9179199188947678, "num_tokens": 59038040.0, "step": 4786 }, { "entropy": 1.3914389312267303, "epoch": 2.520800421274355, "grad_norm": 0.32590633630752563, "learning_rate": 0.00015329940243040578, "loss": 0.20750224590301514, "mean_token_accuracy": 0.9141969978809357, "num_tokens": 59050376.0, "step": 4787 }, { "entropy": 1.425366759300232, "epoch": 2.5213270142180093, "grad_norm": 0.2782382071018219, "learning_rate": 0.00015328017742118557, "loss": 0.19896437227725983, "mean_token_accuracy": 0.9168428629636765, "num_tokens": 59062712.0, "step": 4788 }, { "entropy": 1.400715321302414, "epoch": 2.521853607161664, "grad_norm": 0.28630152344703674, "learning_rate": 0.00015326094984267352, "loss": 0.22256657481193542, "mean_token_accuracy": 0.9108149707317352, "num_tokens": 59075048.0, "step": 4789 }, { "entropy": 1.4121185541152954, "epoch": 2.5223802001053186, "grad_norm": 0.29156050086021423, "learning_rate": 0.000153241719696011, "loss": 0.21156355738639832, "mean_token_accuracy": 0.9142804145812988, "num_tokens": 59087384.0, "step": 4790 }, { "entropy": 1.4587819874286652, "epoch": 2.522906793048973, "grad_norm": 0.2809777557849884, "learning_rate": 0.00015322248698233958, "loss": 0.18381905555725098, "mean_token_accuracy": 0.9187909066677094, "num_tokens": 59099720.0, "step": 4791 }, { "entropy": 1.4324629604816437, "epoch": 2.523433385992628, "grad_norm": 0.24410581588745117, "learning_rate": 0.00015320325170280107, "loss": 0.17199113965034485, "mean_token_accuracy": 0.9289192855358124, "num_tokens": 59112056.0, "step": 4792 }, { "entropy": 1.457740843296051, "epoch": 2.5239599789362823, "grad_norm": 0.27388423681259155, "learning_rate": 0.00015318401385853729, "loss": 0.1924448013305664, "mean_token_accuracy": 0.9235370606184006, "num_tokens": 59124392.0, "step": 4793 }, { "entropy": 1.4426178336143494, "epoch": 2.5244865718799367, "grad_norm": 0.2799040973186493, "learning_rate": 0.0001531647734506903, "loss": 0.20240657031536102, "mean_token_accuracy": 0.917314887046814, "num_tokens": 59136728.0, "step": 4794 }, { "entropy": 1.4201898574829102, "epoch": 2.5250131648235916, "grad_norm": 0.29636329412460327, "learning_rate": 0.00015314553048040232, "loss": 0.20854808390140533, "mean_token_accuracy": 0.9121217727661133, "num_tokens": 59149064.0, "step": 4795 }, { "entropy": 1.4267604053020477, "epoch": 2.525539757767246, "grad_norm": 0.26949402689933777, "learning_rate": 0.00015312628494881567, "loss": 0.18854168057441711, "mean_token_accuracy": 0.9252474457025528, "num_tokens": 59161400.0, "step": 4796 }, { "entropy": 1.4317746460437775, "epoch": 2.5260663507109005, "grad_norm": 0.2725363075733185, "learning_rate": 0.0001531070368570728, "loss": 0.1946963369846344, "mean_token_accuracy": 0.9178613424301147, "num_tokens": 59173736.0, "step": 4797 }, { "entropy": 1.4510256946086884, "epoch": 2.526592943654555, "grad_norm": 0.25904926657676697, "learning_rate": 0.00015308778620631643, "loss": 0.17193448543548584, "mean_token_accuracy": 0.9315731972455978, "num_tokens": 59186072.0, "step": 4798 }, { "entropy": 1.4164240956306458, "epoch": 2.5271195365982093, "grad_norm": 0.25664958357810974, "learning_rate": 0.00015306853299768935, "loss": 0.1800077110528946, "mean_token_accuracy": 0.9235340803861618, "num_tokens": 59198408.0, "step": 4799 }, { "entropy": 1.4181910455226898, "epoch": 2.527646129541864, "grad_norm": 0.267265260219574, "learning_rate": 0.00015304927723233444, "loss": 0.1814480721950531, "mean_token_accuracy": 0.926010325551033, "num_tokens": 59210744.0, "step": 4800 }, { "entropy": 1.403830498456955, "epoch": 2.5281727224855186, "grad_norm": 0.2695743143558502, "learning_rate": 0.00015303001891139485, "loss": 0.18746566772460938, "mean_token_accuracy": 0.922560304403305, "num_tokens": 59223080.0, "step": 4801 }, { "entropy": 1.4577591121196747, "epoch": 2.528699315429173, "grad_norm": 0.33329254388809204, "learning_rate": 0.00015301075803601387, "loss": 0.21829648315906525, "mean_token_accuracy": 0.9158814549446106, "num_tokens": 59235416.0, "step": 4802 }, { "entropy": 1.4333778023719788, "epoch": 2.529225908372828, "grad_norm": 0.2889585793018341, "learning_rate": 0.00015299149460733485, "loss": 0.19638335704803467, "mean_token_accuracy": 0.9257490932941437, "num_tokens": 59247752.0, "step": 4803 }, { "entropy": 1.375129371881485, "epoch": 2.5297525013164823, "grad_norm": 0.27963852882385254, "learning_rate": 0.0001529722286265014, "loss": 0.19143079221248627, "mean_token_accuracy": 0.9210483729839325, "num_tokens": 59260088.0, "step": 4804 }, { "entropy": 1.4024271965026855, "epoch": 2.5302790942601368, "grad_norm": 0.28402864933013916, "learning_rate": 0.00015295296009465716, "loss": 0.19460776448249817, "mean_token_accuracy": 0.9193561524152756, "num_tokens": 59272424.0, "step": 4805 }, { "entropy": 1.3990450501441956, "epoch": 2.5308056872037916, "grad_norm": 0.26199251413345337, "learning_rate": 0.00015293368901294604, "loss": 0.18480481207370758, "mean_token_accuracy": 0.9206849783658981, "num_tokens": 59284760.0, "step": 4806 }, { "entropy": 1.4049314558506012, "epoch": 2.531332280147446, "grad_norm": 0.2740122377872467, "learning_rate": 0.00015291441538251206, "loss": 0.1854100227355957, "mean_token_accuracy": 0.9238648563623428, "num_tokens": 59297096.0, "step": 4807 }, { "entropy": 1.4527244567871094, "epoch": 2.5318588730911005, "grad_norm": 0.28150686621665955, "learning_rate": 0.00015289513920449933, "loss": 0.19049590826034546, "mean_token_accuracy": 0.9227531105279922, "num_tokens": 59309432.0, "step": 4808 }, { "entropy": 1.429905265569687, "epoch": 2.5323854660347553, "grad_norm": 0.2997985780239105, "learning_rate": 0.00015287586048005222, "loss": 0.2127116471529007, "mean_token_accuracy": 0.910615935921669, "num_tokens": 59321768.0, "step": 4809 }, { "entropy": 1.361231505870819, "epoch": 2.5329120589784098, "grad_norm": 0.24818584322929382, "learning_rate": 0.00015285657921031514, "loss": 0.1716461330652237, "mean_token_accuracy": 0.9304056763648987, "num_tokens": 59334104.0, "step": 4810 }, { "entropy": 1.4534060060977936, "epoch": 2.533438651922064, "grad_norm": 0.25663110613822937, "learning_rate": 0.00015283729539643278, "loss": 0.1782129853963852, "mean_token_accuracy": 0.9268085807561874, "num_tokens": 59346440.0, "step": 4811 }, { "entropy": 1.453408420085907, "epoch": 2.533965244865719, "grad_norm": 0.2804957330226898, "learning_rate": 0.00015281800903954986, "loss": 0.19750183820724487, "mean_token_accuracy": 0.9193479269742966, "num_tokens": 59358776.0, "step": 4812 }, { "entropy": 1.5167824625968933, "epoch": 2.5344918378093735, "grad_norm": 0.3135470747947693, "learning_rate": 0.00015279872014081132, "loss": 0.21170248091220856, "mean_token_accuracy": 0.9191084504127502, "num_tokens": 59371112.0, "step": 4813 }, { "entropy": 1.4512979388237, "epoch": 2.535018430753028, "grad_norm": 0.27713891863822937, "learning_rate": 0.00015277942870136217, "loss": 0.18782149255275726, "mean_token_accuracy": 0.9250089675188065, "num_tokens": 59383448.0, "step": 4814 }, { "entropy": 1.387693852186203, "epoch": 2.5355450236966823, "grad_norm": 0.29428794980049133, "learning_rate": 0.00015276013472234767, "loss": 0.19037064909934998, "mean_token_accuracy": 0.9212422370910645, "num_tokens": 59395784.0, "step": 4815 }, { "entropy": 1.4471594989299774, "epoch": 2.5360716166403368, "grad_norm": 0.29530593752861023, "learning_rate": 0.00015274083820491325, "loss": 0.20669062435626984, "mean_token_accuracy": 0.9147179573774338, "num_tokens": 59408120.0, "step": 4816 }, { "entropy": 1.4373044073581696, "epoch": 2.5365982095839916, "grad_norm": 0.28317534923553467, "learning_rate": 0.00015272153915020436, "loss": 0.20463967323303223, "mean_token_accuracy": 0.9127626866102219, "num_tokens": 59420456.0, "step": 4817 }, { "entropy": 1.4383168518543243, "epoch": 2.537124802527646, "grad_norm": 0.26127228140830994, "learning_rate": 0.00015270223755936668, "loss": 0.20316585898399353, "mean_token_accuracy": 0.918964073061943, "num_tokens": 59432792.0, "step": 4818 }, { "entropy": 1.441445916891098, "epoch": 2.5376513954713005, "grad_norm": 0.26680976152420044, "learning_rate": 0.00015268293343354602, "loss": 0.1995728462934494, "mean_token_accuracy": 0.916199654340744, "num_tokens": 59445128.0, "step": 4819 }, { "entropy": 1.4771413207054138, "epoch": 2.5381779884149553, "grad_norm": 0.27789434790611267, "learning_rate": 0.00015266362677388844, "loss": 0.20266149938106537, "mean_token_accuracy": 0.9153758585453033, "num_tokens": 59457464.0, "step": 4820 }, { "entropy": 1.4663703739643097, "epoch": 2.5387045813586098, "grad_norm": 0.2747149169445038, "learning_rate": 0.00015264431758153993, "loss": 0.19435656070709229, "mean_token_accuracy": 0.9212976843118668, "num_tokens": 59469800.0, "step": 4821 }, { "entropy": 1.4226221442222595, "epoch": 2.539231174302264, "grad_norm": 0.2740062177181244, "learning_rate": 0.00015262500585764687, "loss": 0.18962638080120087, "mean_token_accuracy": 0.9208030998706818, "num_tokens": 59482136.0, "step": 4822 }, { "entropy": 1.4463150799274445, "epoch": 2.539757767245919, "grad_norm": 0.26949939131736755, "learning_rate": 0.00015260569160335566, "loss": 0.18399539589881897, "mean_token_accuracy": 0.9234223514795303, "num_tokens": 59494472.0, "step": 4823 }, { "entropy": 1.4091249704360962, "epoch": 2.5402843601895735, "grad_norm": 0.30532780289649963, "learning_rate": 0.00015258637481981285, "loss": 0.19731716811656952, "mean_token_accuracy": 0.9179344773292542, "num_tokens": 59506808.0, "step": 4824 }, { "entropy": 1.4171604216098785, "epoch": 2.540810953133228, "grad_norm": 0.29440897703170776, "learning_rate": 0.00015256705550816517, "loss": 0.195593923330307, "mean_token_accuracy": 0.9183009415864944, "num_tokens": 59519144.0, "step": 4825 }, { "entropy": 1.4110483527183533, "epoch": 2.541337546076883, "grad_norm": 0.2890157103538513, "learning_rate": 0.00015254773366955951, "loss": 0.1955215185880661, "mean_token_accuracy": 0.9175896495580673, "num_tokens": 59531480.0, "step": 4826 }, { "entropy": 1.430400162935257, "epoch": 2.541864139020537, "grad_norm": 0.2826859951019287, "learning_rate": 0.00015252840930514292, "loss": 0.176889106631279, "mean_token_accuracy": 0.9274906814098358, "num_tokens": 59543816.0, "step": 4827 }, { "entropy": 1.374840259552002, "epoch": 2.5423907319641916, "grad_norm": 0.2729499638080597, "learning_rate": 0.00015250908241606253, "loss": 0.18692106008529663, "mean_token_accuracy": 0.9284721314907074, "num_tokens": 59556152.0, "step": 4828 }, { "entropy": 1.382160872220993, "epoch": 2.5429173249078465, "grad_norm": 0.2653583288192749, "learning_rate": 0.00015248975300346566, "loss": 0.18451890349388123, "mean_token_accuracy": 0.9224373549222946, "num_tokens": 59568488.0, "step": 4829 }, { "entropy": 1.3657977879047394, "epoch": 2.543443917851501, "grad_norm": 0.24867606163024902, "learning_rate": 0.0001524704210684998, "loss": 0.1776690036058426, "mean_token_accuracy": 0.9281052350997925, "num_tokens": 59580824.0, "step": 4830 }, { "entropy": 1.3682537972927094, "epoch": 2.5439705107951553, "grad_norm": 0.27566197514533997, "learning_rate": 0.0001524510866123126, "loss": 0.19942131638526917, "mean_token_accuracy": 0.9162020832300186, "num_tokens": 59593160.0, "step": 4831 }, { "entropy": 1.3574018776416779, "epoch": 2.5444971037388098, "grad_norm": 0.2771880328655243, "learning_rate": 0.0001524317496360518, "loss": 0.19043181836605072, "mean_token_accuracy": 0.9205653816461563, "num_tokens": 59605496.0, "step": 4832 }, { "entropy": 1.36737522482872, "epoch": 2.545023696682464, "grad_norm": 0.2834945023059845, "learning_rate": 0.00015241241014086535, "loss": 0.19852997362613678, "mean_token_accuracy": 0.9176250100135803, "num_tokens": 59617832.0, "step": 4833 }, { "entropy": 1.358602523803711, "epoch": 2.545550289626119, "grad_norm": 0.26471948623657227, "learning_rate": 0.00015239306812790129, "loss": 0.18846866488456726, "mean_token_accuracy": 0.9247909784317017, "num_tokens": 59630168.0, "step": 4834 }, { "entropy": 1.3623977303504944, "epoch": 2.5460768825697735, "grad_norm": 0.27146539092063904, "learning_rate": 0.00015237372359830787, "loss": 0.19878418743610382, "mean_token_accuracy": 0.9201604127883911, "num_tokens": 59642504.0, "step": 4835 }, { "entropy": 1.4069927632808685, "epoch": 2.546603475513428, "grad_norm": 0.2823067903518677, "learning_rate": 0.00015235437655323344, "loss": 0.20891442894935608, "mean_token_accuracy": 0.9150956869125366, "num_tokens": 59654840.0, "step": 4836 }, { "entropy": 1.3921907544136047, "epoch": 2.547130068457083, "grad_norm": 0.2729669511318207, "learning_rate": 0.00015233502699382652, "loss": 0.20379957556724548, "mean_token_accuracy": 0.9180693328380585, "num_tokens": 59667176.0, "step": 4837 }, { "entropy": 1.3551888167858124, "epoch": 2.547656661400737, "grad_norm": 0.263839989900589, "learning_rate": 0.00015231567492123585, "loss": 0.1928175985813141, "mean_token_accuracy": 0.9204489141702652, "num_tokens": 59679512.0, "step": 4838 }, { "entropy": 1.4220162332057953, "epoch": 2.5481832543443916, "grad_norm": 0.28904277086257935, "learning_rate": 0.00015229632033661014, "loss": 0.1956554502248764, "mean_token_accuracy": 0.9192171394824982, "num_tokens": 59691848.0, "step": 4839 }, { "entropy": 1.384028673171997, "epoch": 2.5487098472880465, "grad_norm": 0.2730739414691925, "learning_rate": 0.00015227696324109845, "loss": 0.1821494847536087, "mean_token_accuracy": 0.9268871694803238, "num_tokens": 59704184.0, "step": 4840 }, { "entropy": 1.3748473227024078, "epoch": 2.549236440231701, "grad_norm": 0.2834646999835968, "learning_rate": 0.00015225760363584982, "loss": 0.2006215900182724, "mean_token_accuracy": 0.9206278324127197, "num_tokens": 59716520.0, "step": 4841 }, { "entropy": 1.3900345861911774, "epoch": 2.5497630331753554, "grad_norm": 0.26609018445014954, "learning_rate": 0.0001522382415220136, "loss": 0.1950165331363678, "mean_token_accuracy": 0.9225917160511017, "num_tokens": 59728856.0, "step": 4842 }, { "entropy": 1.3536244630813599, "epoch": 2.5502896261190102, "grad_norm": 0.273309588432312, "learning_rate": 0.00015221887690073914, "loss": 0.19759991765022278, "mean_token_accuracy": 0.922698363661766, "num_tokens": 59741192.0, "step": 4843 }, { "entropy": 1.33824023604393, "epoch": 2.5508162190626646, "grad_norm": 0.2553465664386749, "learning_rate": 0.00015219950977317603, "loss": 0.175911545753479, "mean_token_accuracy": 0.9264104813337326, "num_tokens": 59753528.0, "step": 4844 }, { "entropy": 1.402260184288025, "epoch": 2.551342812006319, "grad_norm": 0.3060164749622345, "learning_rate": 0.00015218014014047398, "loss": 0.20706036686897278, "mean_token_accuracy": 0.912144809961319, "num_tokens": 59765864.0, "step": 4845 }, { "entropy": 1.3535306751728058, "epoch": 2.551869404949974, "grad_norm": 0.28057345747947693, "learning_rate": 0.00015216076800378286, "loss": 0.18130075931549072, "mean_token_accuracy": 0.9202318787574768, "num_tokens": 59778200.0, "step": 4846 }, { "entropy": 1.3663321137428284, "epoch": 2.5523959978936284, "grad_norm": 0.2771863639354706, "learning_rate": 0.00015214139336425272, "loss": 0.19252638518810272, "mean_token_accuracy": 0.9169972240924835, "num_tokens": 59790536.0, "step": 4847 }, { "entropy": 1.380006194114685, "epoch": 2.552922590837283, "grad_norm": 0.2713053822517395, "learning_rate": 0.0001521220162230336, "loss": 0.17066720128059387, "mean_token_accuracy": 0.9294691681861877, "num_tokens": 59802872.0, "step": 4848 }, { "entropy": 1.3988358080387115, "epoch": 2.553449183780937, "grad_norm": 0.3080752491950989, "learning_rate": 0.00015210263658127593, "loss": 0.19805192947387695, "mean_token_accuracy": 0.9194646626710892, "num_tokens": 59815208.0, "step": 4849 }, { "entropy": 1.3025390207767487, "epoch": 2.5539757767245916, "grad_norm": 0.26315048336982727, "learning_rate": 0.00015208325444013009, "loss": 0.18763092160224915, "mean_token_accuracy": 0.921664372086525, "num_tokens": 59827544.0, "step": 4850 }, { "entropy": 1.363812655210495, "epoch": 2.5545023696682465, "grad_norm": 0.28132131695747375, "learning_rate": 0.00015206386980074675, "loss": 0.20107382535934448, "mean_token_accuracy": 0.9173763394355774, "num_tokens": 59839880.0, "step": 4851 }, { "entropy": 1.3637959957122803, "epoch": 2.555028962611901, "grad_norm": 0.2793247699737549, "learning_rate": 0.0001520444826642766, "loss": 0.18369603157043457, "mean_token_accuracy": 0.9214000850915909, "num_tokens": 59852216.0, "step": 4852 }, { "entropy": 1.407531052827835, "epoch": 2.5555555555555554, "grad_norm": 0.27685731649398804, "learning_rate": 0.00015202509303187056, "loss": 0.19428351521492004, "mean_token_accuracy": 0.9237850308418274, "num_tokens": 59864552.0, "step": 4853 }, { "entropy": 1.4391858875751495, "epoch": 2.5560821484992102, "grad_norm": 0.30099570751190186, "learning_rate": 0.0001520057009046797, "loss": 0.20823752880096436, "mean_token_accuracy": 0.9157876074314117, "num_tokens": 59876888.0, "step": 4854 }, { "entropy": 1.4529668688774109, "epoch": 2.5566087414428647, "grad_norm": 0.3118361234664917, "learning_rate": 0.0001519863062838552, "loss": 0.2140086144208908, "mean_token_accuracy": 0.9144342094659805, "num_tokens": 59889224.0, "step": 4855 }, { "entropy": 1.4054121375083923, "epoch": 2.557135334386519, "grad_norm": 0.2828349471092224, "learning_rate": 0.00015196690917054843, "loss": 0.18467508256435394, "mean_token_accuracy": 0.9245531558990479, "num_tokens": 59901560.0, "step": 4856 }, { "entropy": 1.370518833398819, "epoch": 2.557661927330174, "grad_norm": 0.3127945363521576, "learning_rate": 0.00015194750956591086, "loss": 0.1978442370891571, "mean_token_accuracy": 0.9195757210254669, "num_tokens": 59913896.0, "step": 4857 }, { "entropy": 1.3630948066711426, "epoch": 2.5581885202738284, "grad_norm": 0.238580584526062, "learning_rate": 0.00015192810747109413, "loss": 0.15261900424957275, "mean_token_accuracy": 0.9331966936588287, "num_tokens": 59926232.0, "step": 4858 }, { "entropy": 1.411979854106903, "epoch": 2.558715113217483, "grad_norm": 0.2636284828186035, "learning_rate": 0.00015190870288725, "loss": 0.17438194155693054, "mean_token_accuracy": 0.9271792620420456, "num_tokens": 59938568.0, "step": 4859 }, { "entropy": 1.4212656915187836, "epoch": 2.5592417061611377, "grad_norm": 0.3053138554096222, "learning_rate": 0.0001518892958155305, "loss": 0.19817118346691132, "mean_token_accuracy": 0.9181718081235886, "num_tokens": 59950904.0, "step": 4860 }, { "entropy": 1.349739819765091, "epoch": 2.559768299104792, "grad_norm": 0.24464385211467743, "learning_rate": 0.00015186988625708763, "loss": 0.1783566176891327, "mean_token_accuracy": 0.9276772141456604, "num_tokens": 59963240.0, "step": 4861 }, { "entropy": 1.3938109576702118, "epoch": 2.5602948920484465, "grad_norm": 0.2769966423511505, "learning_rate": 0.00015185047421307363, "loss": 0.2047450840473175, "mean_token_accuracy": 0.9157468527555466, "num_tokens": 59975576.0, "step": 4862 }, { "entropy": 1.3291508555412292, "epoch": 2.5608214849921014, "grad_norm": 0.26295456290245056, "learning_rate": 0.00015183105968464094, "loss": 0.18852469325065613, "mean_token_accuracy": 0.9189134687185287, "num_tokens": 59987912.0, "step": 4863 }, { "entropy": 1.3406771123409271, "epoch": 2.561348077935756, "grad_norm": 0.30215656757354736, "learning_rate": 0.000151811642672942, "loss": 0.2007867395877838, "mean_token_accuracy": 0.9217905700206757, "num_tokens": 60000248.0, "step": 4864 }, { "entropy": 1.332020252943039, "epoch": 2.5618746708794102, "grad_norm": 0.3041894733905792, "learning_rate": 0.00015179222317912957, "loss": 0.1980377435684204, "mean_token_accuracy": 0.9134826958179474, "num_tokens": 60012584.0, "step": 4865 }, { "entropy": 1.363236427307129, "epoch": 2.5624012638230647, "grad_norm": 0.2855970859527588, "learning_rate": 0.0001517728012043564, "loss": 0.18393242359161377, "mean_token_accuracy": 0.920888140797615, "num_tokens": 60024920.0, "step": 4866 }, { "entropy": 1.3401431441307068, "epoch": 2.562927856766719, "grad_norm": 0.294961154460907, "learning_rate": 0.00015175337674977555, "loss": 0.18346351385116577, "mean_token_accuracy": 0.9255680441856384, "num_tokens": 60037256.0, "step": 4867 }, { "entropy": 1.3249768912792206, "epoch": 2.563454449710374, "grad_norm": 0.2849559187889099, "learning_rate": 0.00015173394981654004, "loss": 0.1919642984867096, "mean_token_accuracy": 0.9208333492279053, "num_tokens": 60049592.0, "step": 4868 }, { "entropy": 1.2834919691085815, "epoch": 2.5639810426540284, "grad_norm": 0.2871542274951935, "learning_rate": 0.00015171452040580317, "loss": 0.1890535205602646, "mean_token_accuracy": 0.9206035882234573, "num_tokens": 60061928.0, "step": 4869 }, { "entropy": 1.3021434247493744, "epoch": 2.564507635597683, "grad_norm": 0.30245718359947205, "learning_rate": 0.00015169508851871835, "loss": 0.20414495468139648, "mean_token_accuracy": 0.9124367386102676, "num_tokens": 60074264.0, "step": 4870 }, { "entropy": 1.2731509506702423, "epoch": 2.5650342285413377, "grad_norm": 0.2902166247367859, "learning_rate": 0.00015167565415643913, "loss": 0.20379520952701569, "mean_token_accuracy": 0.9124204516410828, "num_tokens": 60086600.0, "step": 4871 }, { "entropy": 1.3015616834163666, "epoch": 2.565560821484992, "grad_norm": 0.28301534056663513, "learning_rate": 0.00015165621732011924, "loss": 0.19441409409046173, "mean_token_accuracy": 0.9212340712547302, "num_tokens": 60098936.0, "step": 4872 }, { "entropy": 1.2701435387134552, "epoch": 2.5660874144286465, "grad_norm": 0.2904719114303589, "learning_rate": 0.00015163677801091255, "loss": 0.19993525743484497, "mean_token_accuracy": 0.9170213043689728, "num_tokens": 60111272.0, "step": 4873 }, { "entropy": 1.2749419212341309, "epoch": 2.5666140073723014, "grad_norm": 0.2766469419002533, "learning_rate": 0.00015161733622997298, "loss": 0.18929515779018402, "mean_token_accuracy": 0.9223896861076355, "num_tokens": 60123608.0, "step": 4874 }, { "entropy": 1.2422993183135986, "epoch": 2.567140600315956, "grad_norm": 0.27800917625427246, "learning_rate": 0.00015159789197845475, "loss": 0.1969931721687317, "mean_token_accuracy": 0.9148046523332596, "num_tokens": 60135944.0, "step": 4875 }, { "entropy": 1.3092963099479675, "epoch": 2.5676671932596102, "grad_norm": 0.29029369354248047, "learning_rate": 0.00015157844525751213, "loss": 0.1947655975818634, "mean_token_accuracy": 0.9203184247016907, "num_tokens": 60148280.0, "step": 4876 }, { "entropy": 1.2354808747768402, "epoch": 2.568193786203265, "grad_norm": 0.2631555497646332, "learning_rate": 0.00015155899606829955, "loss": 0.19616174697875977, "mean_token_accuracy": 0.9179852455854416, "num_tokens": 60160616.0, "step": 4877 }, { "entropy": 1.193561613559723, "epoch": 2.5687203791469195, "grad_norm": 0.2713335156440735, "learning_rate": 0.00015153954441197157, "loss": 0.18860536813735962, "mean_token_accuracy": 0.9259924739599228, "num_tokens": 60172952.0, "step": 4878 }, { "entropy": 1.221862941980362, "epoch": 2.569246972090574, "grad_norm": 0.2639184594154358, "learning_rate": 0.000151520090289683, "loss": 0.18559566140174866, "mean_token_accuracy": 0.9201700389385223, "num_tokens": 60185288.0, "step": 4879 }, { "entropy": 1.2744978070259094, "epoch": 2.5697735650342284, "grad_norm": 0.2902701497077942, "learning_rate": 0.00015150063370258864, "loss": 0.19379426538944244, "mean_token_accuracy": 0.9194291532039642, "num_tokens": 60197624.0, "step": 4880 }, { "entropy": 1.2000911235809326, "epoch": 2.5703001579778832, "grad_norm": 0.25564298033714294, "learning_rate": 0.00015148117465184352, "loss": 0.17944049835205078, "mean_token_accuracy": 0.9247357249259949, "num_tokens": 60209960.0, "step": 4881 }, { "entropy": 1.210292786359787, "epoch": 2.5708267509215377, "grad_norm": 0.26203998923301697, "learning_rate": 0.00015146171313860284, "loss": 0.18620462715625763, "mean_token_accuracy": 0.9194813221693039, "num_tokens": 60222296.0, "step": 4882 }, { "entropy": 1.2274521887302399, "epoch": 2.571353343865192, "grad_norm": 0.27803394198417664, "learning_rate": 0.00015144224916402194, "loss": 0.19611826539039612, "mean_token_accuracy": 0.9189580529928207, "num_tokens": 60234632.0, "step": 4883 }, { "entropy": 1.285475254058838, "epoch": 2.5718799368088465, "grad_norm": 0.3042823374271393, "learning_rate": 0.0001514227827292562, "loss": 0.20818758010864258, "mean_token_accuracy": 0.9117998331785202, "num_tokens": 60246968.0, "step": 4884 }, { "entropy": 1.2546075582504272, "epoch": 2.5724065297525014, "grad_norm": 0.27190738916397095, "learning_rate": 0.00015140331383546132, "loss": 0.1968504935503006, "mean_token_accuracy": 0.917721763253212, "num_tokens": 60259304.0, "step": 4885 }, { "entropy": 1.3057755529880524, "epoch": 2.572933122696156, "grad_norm": 0.27564769983291626, "learning_rate": 0.000151383842483793, "loss": 0.19694563746452332, "mean_token_accuracy": 0.9217658787965775, "num_tokens": 60271640.0, "step": 4886 }, { "entropy": 1.2702763080596924, "epoch": 2.5734597156398102, "grad_norm": 0.24457713961601257, "learning_rate": 0.00015136436867540718, "loss": 0.1783868968486786, "mean_token_accuracy": 0.9248514473438263, "num_tokens": 60283976.0, "step": 4887 }, { "entropy": 1.2917823791503906, "epoch": 2.573986308583465, "grad_norm": 0.30155834555625916, "learning_rate": 0.00015134489241145984, "loss": 0.211724653840065, "mean_token_accuracy": 0.9160776287317276, "num_tokens": 60296312.0, "step": 4888 }, { "entropy": 1.2568625509738922, "epoch": 2.5745129015271195, "grad_norm": 0.26823991537094116, "learning_rate": 0.00015132541369310726, "loss": 0.18977221846580505, "mean_token_accuracy": 0.9210988581180573, "num_tokens": 60308648.0, "step": 4889 }, { "entropy": 1.2876782417297363, "epoch": 2.575039494470774, "grad_norm": 0.26660630106925964, "learning_rate": 0.00015130593252150567, "loss": 0.1923052966594696, "mean_token_accuracy": 0.9208141714334488, "num_tokens": 60320984.0, "step": 4890 }, { "entropy": 1.2527808248996735, "epoch": 2.575566087414429, "grad_norm": 0.2633249759674072, "learning_rate": 0.00015128644889781165, "loss": 0.17889824509620667, "mean_token_accuracy": 0.9229971915483475, "num_tokens": 60333320.0, "step": 4891 }, { "entropy": 1.2528367638587952, "epoch": 2.5760926803580833, "grad_norm": 0.26531174778938293, "learning_rate": 0.0001512669628231818, "loss": 0.17675469815731049, "mean_token_accuracy": 0.9215357750654221, "num_tokens": 60345656.0, "step": 4892 }, { "entropy": 1.2803305685520172, "epoch": 2.5766192733017377, "grad_norm": 0.2765933573246002, "learning_rate": 0.00015124747429877292, "loss": 0.1918942928314209, "mean_token_accuracy": 0.9219794422388077, "num_tokens": 60357992.0, "step": 4893 }, { "entropy": 1.335657685995102, "epoch": 2.5771458662453925, "grad_norm": 0.31621235609054565, "learning_rate": 0.00015122798332574183, "loss": 0.1919841319322586, "mean_token_accuracy": 0.9153444766998291, "num_tokens": 60370328.0, "step": 4894 }, { "entropy": 1.2984404861927032, "epoch": 2.577672459189047, "grad_norm": 0.29850491881370544, "learning_rate": 0.00015120848990524572, "loss": 0.1919029951095581, "mean_token_accuracy": 0.9215899854898453, "num_tokens": 60382664.0, "step": 4895 }, { "entropy": 1.2599246203899384, "epoch": 2.5781990521327014, "grad_norm": 0.2824483811855316, "learning_rate": 0.00015118899403844172, "loss": 0.20817939937114716, "mean_token_accuracy": 0.9098999500274658, "num_tokens": 60395000.0, "step": 4896 }, { "entropy": 1.2227539122104645, "epoch": 2.578725645076356, "grad_norm": 0.2849332094192505, "learning_rate": 0.0001511694957264872, "loss": 0.1831064522266388, "mean_token_accuracy": 0.9280066043138504, "num_tokens": 60407336.0, "step": 4897 }, { "entropy": 1.27097687125206, "epoch": 2.5792522380200107, "grad_norm": 0.28264176845550537, "learning_rate": 0.0001511499949705397, "loss": 0.17965328693389893, "mean_token_accuracy": 0.9261346906423569, "num_tokens": 60419672.0, "step": 4898 }, { "entropy": 1.1849463284015656, "epoch": 2.579778830963665, "grad_norm": 0.27329471707344055, "learning_rate": 0.0001511304917717568, "loss": 0.19811423122882843, "mean_token_accuracy": 0.9193136245012283, "num_tokens": 60432008.0, "step": 4899 }, { "entropy": 1.2668118476867676, "epoch": 2.5803054239073195, "grad_norm": 0.2986825406551361, "learning_rate": 0.00015111098613129637, "loss": 0.1940465271472931, "mean_token_accuracy": 0.9172029942274094, "num_tokens": 60444344.0, "step": 4900 }, { "entropy": 1.2361448407173157, "epoch": 2.580832016850974, "grad_norm": 0.2798372805118561, "learning_rate": 0.00015109147805031633, "loss": 0.1894315630197525, "mean_token_accuracy": 0.9171324968338013, "num_tokens": 60456680.0, "step": 4901 }, { "entropy": 1.2954889237880707, "epoch": 2.581358609794629, "grad_norm": 0.3161953091621399, "learning_rate": 0.00015107196752997467, "loss": 0.18676374852657318, "mean_token_accuracy": 0.9234345406293869, "num_tokens": 60469016.0, "step": 4902 }, { "entropy": 1.2941784262657166, "epoch": 2.5818852027382833, "grad_norm": 0.31460681557655334, "learning_rate": 0.0001510524545714297, "loss": 0.19941675662994385, "mean_token_accuracy": 0.9116266816854477, "num_tokens": 60481352.0, "step": 4903 }, { "entropy": 1.2890789806842804, "epoch": 2.5824117956819377, "grad_norm": 0.2842191159725189, "learning_rate": 0.0001510329391758398, "loss": 0.17705805599689484, "mean_token_accuracy": 0.9248210489749908, "num_tokens": 60493688.0, "step": 4904 }, { "entropy": 1.3004145622253418, "epoch": 2.5829383886255926, "grad_norm": 0.30338117480278015, "learning_rate": 0.00015101342134436345, "loss": 0.19950935244560242, "mean_token_accuracy": 0.9210843443870544, "num_tokens": 60506024.0, "step": 4905 }, { "entropy": 1.3092130422592163, "epoch": 2.583464981569247, "grad_norm": 0.27796757221221924, "learning_rate": 0.0001509939010781593, "loss": 0.19549565017223358, "mean_token_accuracy": 0.9185791313648224, "num_tokens": 60518360.0, "step": 4906 }, { "entropy": 1.3043208718299866, "epoch": 2.5839915745129014, "grad_norm": 0.2806245684623718, "learning_rate": 0.00015097437837838622, "loss": 0.18059489130973816, "mean_token_accuracy": 0.9228035360574722, "num_tokens": 60530696.0, "step": 4907 }, { "entropy": 1.255238801240921, "epoch": 2.5845181674565563, "grad_norm": 0.25664472579956055, "learning_rate": 0.00015095485324620307, "loss": 0.17865927517414093, "mean_token_accuracy": 0.9228197932243347, "num_tokens": 60543032.0, "step": 4908 }, { "entropy": 1.3067887425422668, "epoch": 2.5850447604002107, "grad_norm": 0.27396947145462036, "learning_rate": 0.000150935325682769, "loss": 0.17701086401939392, "mean_token_accuracy": 0.9229120314121246, "num_tokens": 60555368.0, "step": 4909 }, { "entropy": 1.281879723072052, "epoch": 2.585571353343865, "grad_norm": 0.29621782898902893, "learning_rate": 0.0001509157956892432, "loss": 0.2053222805261612, "mean_token_accuracy": 0.9124819934368134, "num_tokens": 60567704.0, "step": 4910 }, { "entropy": 1.2755568325519562, "epoch": 2.58609794628752, "grad_norm": 0.27881988883018494, "learning_rate": 0.00015089626326678514, "loss": 0.1889788657426834, "mean_token_accuracy": 0.9183150380849838, "num_tokens": 60580040.0, "step": 4911 }, { "entropy": 1.2072003185749054, "epoch": 2.5866245392311744, "grad_norm": 0.2607763111591339, "learning_rate": 0.0001508767284165543, "loss": 0.16778123378753662, "mean_token_accuracy": 0.9284379333257675, "num_tokens": 60592376.0, "step": 4912 }, { "entropy": 1.249082773923874, "epoch": 2.587151132174829, "grad_norm": 0.2747190594673157, "learning_rate": 0.0001508571911397103, "loss": 0.19317784905433655, "mean_token_accuracy": 0.9194312244653702, "num_tokens": 60604712.0, "step": 4913 }, { "entropy": 1.2764122486114502, "epoch": 2.5876777251184833, "grad_norm": 0.28617385029792786, "learning_rate": 0.00015083765143741298, "loss": 0.1782130002975464, "mean_token_accuracy": 0.9292741566896439, "num_tokens": 60617048.0, "step": 4914 }, { "entropy": 1.2097508311271667, "epoch": 2.588204318062138, "grad_norm": 0.2889769971370697, "learning_rate": 0.00015081810931082235, "loss": 0.18960776925086975, "mean_token_accuracy": 0.9243573546409607, "num_tokens": 60629384.0, "step": 4915 }, { "entropy": 1.2399142682552338, "epoch": 2.5887309110057926, "grad_norm": 0.2919212281703949, "learning_rate": 0.00015079856476109848, "loss": 0.19247275590896606, "mean_token_accuracy": 0.9195180237293243, "num_tokens": 60641720.0, "step": 4916 }, { "entropy": 1.2030165493488312, "epoch": 2.589257503949447, "grad_norm": 0.29695242643356323, "learning_rate": 0.00015077901778940157, "loss": 0.21190334856510162, "mean_token_accuracy": 0.9165085405111313, "num_tokens": 60654056.0, "step": 4917 }, { "entropy": 1.1943929195404053, "epoch": 2.5897840968931014, "grad_norm": 0.2831406593322754, "learning_rate": 0.0001507594683968921, "loss": 0.18078364431858063, "mean_token_accuracy": 0.926941767334938, "num_tokens": 60666392.0, "step": 4918 }, { "entropy": 1.2222073674201965, "epoch": 2.5903106898367563, "grad_norm": 0.2951219379901886, "learning_rate": 0.00015073991658473055, "loss": 0.18491344153881073, "mean_token_accuracy": 0.9229899197816849, "num_tokens": 60678728.0, "step": 4919 }, { "entropy": 1.2402024269104004, "epoch": 2.5908372827804107, "grad_norm": 0.2913973927497864, "learning_rate": 0.00015072036235407756, "loss": 0.20621611177921295, "mean_token_accuracy": 0.9144409149885178, "num_tokens": 60691064.0, "step": 4920 }, { "entropy": 1.2773911952972412, "epoch": 2.591363875724065, "grad_norm": 0.27006563544273376, "learning_rate": 0.00015070080570609405, "loss": 0.18121947348117828, "mean_token_accuracy": 0.9238732904195786, "num_tokens": 60703400.0, "step": 4921 }, { "entropy": 1.2690989077091217, "epoch": 2.59189046866772, "grad_norm": 0.268216609954834, "learning_rate": 0.00015068124664194087, "loss": 0.18139807879924774, "mean_token_accuracy": 0.9222427159547806, "num_tokens": 60715736.0, "step": 4922 }, { "entropy": 1.200697124004364, "epoch": 2.5924170616113744, "grad_norm": 0.26179397106170654, "learning_rate": 0.00015066168516277923, "loss": 0.17864662408828735, "mean_token_accuracy": 0.9289314448833466, "num_tokens": 60728072.0, "step": 4923 }, { "entropy": 1.2993067800998688, "epoch": 2.592943654555029, "grad_norm": 0.2966409921646118, "learning_rate": 0.0001506421212697703, "loss": 0.19692149758338928, "mean_token_accuracy": 0.9166679531335831, "num_tokens": 60740408.0, "step": 4924 }, { "entropy": 1.2320555746555328, "epoch": 2.5934702474986837, "grad_norm": 0.2706405520439148, "learning_rate": 0.00015062255496407553, "loss": 0.17119428515434265, "mean_token_accuracy": 0.934698686003685, "num_tokens": 60752744.0, "step": 4925 }, { "entropy": 1.3128075301647186, "epoch": 2.593996840442338, "grad_norm": 0.29050150513648987, "learning_rate": 0.00015060298624685646, "loss": 0.20369823276996613, "mean_token_accuracy": 0.9178123623132706, "num_tokens": 60765080.0, "step": 4926 }, { "entropy": 1.3408489227294922, "epoch": 2.5945234333859926, "grad_norm": 0.28869307041168213, "learning_rate": 0.0001505834151192747, "loss": 0.19420656561851501, "mean_token_accuracy": 0.9170711934566498, "num_tokens": 60777416.0, "step": 4927 }, { "entropy": 1.3311878740787506, "epoch": 2.5950500263296474, "grad_norm": 0.3024950623512268, "learning_rate": 0.00015056384158249216, "loss": 0.2221667766571045, "mean_token_accuracy": 0.912192165851593, "num_tokens": 60789752.0, "step": 4928 }, { "entropy": 1.3265336155891418, "epoch": 2.595576619273302, "grad_norm": 0.2662777602672577, "learning_rate": 0.00015054426563767076, "loss": 0.1869158297777176, "mean_token_accuracy": 0.9230349361896515, "num_tokens": 60802088.0, "step": 4929 }, { "entropy": 1.3300181329250336, "epoch": 2.5961032122169563, "grad_norm": 0.2740636467933655, "learning_rate": 0.00015052468728597265, "loss": 0.18870602548122406, "mean_token_accuracy": 0.9215754866600037, "num_tokens": 60814424.0, "step": 4930 }, { "entropy": 1.2919826209545135, "epoch": 2.5966298051606107, "grad_norm": 0.2929941415786743, "learning_rate": 0.00015050510652856, "loss": 0.20022767782211304, "mean_token_accuracy": 0.9151937812566757, "num_tokens": 60826760.0, "step": 4931 }, { "entropy": 1.3107154071331024, "epoch": 2.597156398104265, "grad_norm": 0.2871747612953186, "learning_rate": 0.0001504855233665953, "loss": 0.20724672079086304, "mean_token_accuracy": 0.9125708937644958, "num_tokens": 60839096.0, "step": 4932 }, { "entropy": 1.3196457624435425, "epoch": 2.59768299104792, "grad_norm": 0.29808494448661804, "learning_rate": 0.000150465937801241, "loss": 0.20627810060977936, "mean_token_accuracy": 0.912663921713829, "num_tokens": 60851432.0, "step": 4933 }, { "entropy": 1.3223419189453125, "epoch": 2.5982095839915744, "grad_norm": 0.29379090666770935, "learning_rate": 0.00015044634983365983, "loss": 0.20280207693576813, "mean_token_accuracy": 0.9133302718400955, "num_tokens": 60863768.0, "step": 4934 }, { "entropy": 1.3727116882801056, "epoch": 2.598736176935229, "grad_norm": 0.2798406779766083, "learning_rate": 0.00015042675946501467, "loss": 0.1975862979888916, "mean_token_accuracy": 0.9198077917098999, "num_tokens": 60876104.0, "step": 4935 }, { "entropy": 1.3120767176151276, "epoch": 2.5992627698788837, "grad_norm": 0.27912437915802, "learning_rate": 0.00015040716669646837, "loss": 0.22149375081062317, "mean_token_accuracy": 0.9102857857942581, "num_tokens": 60888440.0, "step": 4936 }, { "entropy": 1.2911328673362732, "epoch": 2.599789362822538, "grad_norm": 0.2802145183086395, "learning_rate": 0.00015038757152918412, "loss": 0.19417962431907654, "mean_token_accuracy": 0.9157440662384033, "num_tokens": 60900776.0, "step": 4937 }, { "entropy": 1.3934805989265442, "epoch": 2.6003159557661926, "grad_norm": 0.28115054965019226, "learning_rate": 0.0001503679739643251, "loss": 0.19231252372264862, "mean_token_accuracy": 0.9217715561389923, "num_tokens": 60913112.0, "step": 4938 }, { "entropy": 1.2947366535663605, "epoch": 2.6008425487098474, "grad_norm": 0.24634382128715515, "learning_rate": 0.00015034837400305478, "loss": 0.18823671340942383, "mean_token_accuracy": 0.9209298342466354, "num_tokens": 60925448.0, "step": 4939 }, { "entropy": 1.2998045682907104, "epoch": 2.601369141653502, "grad_norm": 0.2468367964029312, "learning_rate": 0.00015032877164653668, "loss": 0.1801864206790924, "mean_token_accuracy": 0.924280971288681, "num_tokens": 60937784.0, "step": 4940 }, { "entropy": 1.294558823108673, "epoch": 2.6018957345971563, "grad_norm": 0.2462131679058075, "learning_rate": 0.00015030916689593444, "loss": 0.18104076385498047, "mean_token_accuracy": 0.923799991607666, "num_tokens": 60950120.0, "step": 4941 }, { "entropy": 1.3445029258728027, "epoch": 2.602422327540811, "grad_norm": 0.25693264603614807, "learning_rate": 0.0001502895597524119, "loss": 0.17664121091365814, "mean_token_accuracy": 0.926972508430481, "num_tokens": 60962456.0, "step": 4942 }, { "entropy": 1.3062118887901306, "epoch": 2.6029489204844656, "grad_norm": 0.2562658488750458, "learning_rate": 0.00015026995021713303, "loss": 0.17592185735702515, "mean_token_accuracy": 0.9261811375617981, "num_tokens": 60974792.0, "step": 4943 }, { "entropy": 1.3300414681434631, "epoch": 2.60347551342812, "grad_norm": 0.2567176818847656, "learning_rate": 0.00015025033829126194, "loss": 0.17641589045524597, "mean_token_accuracy": 0.9250547587871552, "num_tokens": 60987128.0, "step": 4944 }, { "entropy": 1.3550803363323212, "epoch": 2.604002106371775, "grad_norm": 0.30004099011421204, "learning_rate": 0.00015023072397596284, "loss": 0.19975590705871582, "mean_token_accuracy": 0.9152816534042358, "num_tokens": 60999464.0, "step": 4945 }, { "entropy": 1.3452115654945374, "epoch": 2.6045286993154293, "grad_norm": 0.2929515242576599, "learning_rate": 0.00015021110727240017, "loss": 0.20405176281929016, "mean_token_accuracy": 0.9165933579206467, "num_tokens": 61011800.0, "step": 4946 }, { "entropy": 1.3382624983787537, "epoch": 2.6050552922590837, "grad_norm": 0.293535977602005, "learning_rate": 0.0001501914881817384, "loss": 0.1919645369052887, "mean_token_accuracy": 0.9165096879005432, "num_tokens": 61024136.0, "step": 4947 }, { "entropy": 1.3008095026016235, "epoch": 2.605581885202738, "grad_norm": 0.271883100271225, "learning_rate": 0.00015017186670514225, "loss": 0.1803811490535736, "mean_token_accuracy": 0.9252985715866089, "num_tokens": 61036472.0, "step": 4948 }, { "entropy": 1.3121626377105713, "epoch": 2.6061084781463926, "grad_norm": 0.2665010392665863, "learning_rate": 0.0001501522428437765, "loss": 0.19021756947040558, "mean_token_accuracy": 0.917598158121109, "num_tokens": 61048808.0, "step": 4949 }, { "entropy": 1.3839079439640045, "epoch": 2.6066350710900474, "grad_norm": 0.33104774355888367, "learning_rate": 0.00015013261659880612, "loss": 0.1986754983663559, "mean_token_accuracy": 0.9182071089744568, "num_tokens": 61061144.0, "step": 4950 }, { "entropy": 1.394430249929428, "epoch": 2.607161664033702, "grad_norm": 0.30506664514541626, "learning_rate": 0.00015011298797139622, "loss": 0.20398959517478943, "mean_token_accuracy": 0.9175256192684174, "num_tokens": 61073480.0, "step": 4951 }, { "entropy": 1.3545320332050323, "epoch": 2.6076882569773563, "grad_norm": 0.26357078552246094, "learning_rate": 0.00015009335696271198, "loss": 0.18614837527275085, "mean_token_accuracy": 0.9249047487974167, "num_tokens": 61085816.0, "step": 4952 }, { "entropy": 1.3907168209552765, "epoch": 2.608214849921011, "grad_norm": 0.2741307020187378, "learning_rate": 0.00015007372357391885, "loss": 0.2001461386680603, "mean_token_accuracy": 0.9191935360431671, "num_tokens": 61098152.0, "step": 4953 }, { "entropy": 1.3543334007263184, "epoch": 2.6087414428646656, "grad_norm": 0.2835255265235901, "learning_rate": 0.0001500540878061823, "loss": 0.19529372453689575, "mean_token_accuracy": 0.9176384061574936, "num_tokens": 61110488.0, "step": 4954 }, { "entropy": 1.4248532056808472, "epoch": 2.60926803580832, "grad_norm": 0.30024221539497375, "learning_rate": 0.00015003444966066803, "loss": 0.19290918111801147, "mean_token_accuracy": 0.9208212941884995, "num_tokens": 61122824.0, "step": 4955 }, { "entropy": 1.4034450054168701, "epoch": 2.609794628751975, "grad_norm": 0.26515907049179077, "learning_rate": 0.0001500148091385418, "loss": 0.1898597776889801, "mean_token_accuracy": 0.9218143671751022, "num_tokens": 61135160.0, "step": 4956 }, { "entropy": 1.3745439052581787, "epoch": 2.6103212216956293, "grad_norm": 0.2902405858039856, "learning_rate": 0.0001499951662409696, "loss": 0.1814654916524887, "mean_token_accuracy": 0.9276015907526016, "num_tokens": 61147496.0, "step": 4957 }, { "entropy": 1.3754574656486511, "epoch": 2.6108478146392837, "grad_norm": 0.25714364647865295, "learning_rate": 0.00014997552096911745, "loss": 0.16097311675548553, "mean_token_accuracy": 0.9338142424821854, "num_tokens": 61159832.0, "step": 4958 }, { "entropy": 1.3770808279514313, "epoch": 2.6113744075829386, "grad_norm": 0.2730887234210968, "learning_rate": 0.00014995587332415164, "loss": 0.19565999507904053, "mean_token_accuracy": 0.9208303242921829, "num_tokens": 61172168.0, "step": 4959 }, { "entropy": 1.419737309217453, "epoch": 2.611901000526593, "grad_norm": 0.29134243726730347, "learning_rate": 0.00014993622330723857, "loss": 0.21380697190761566, "mean_token_accuracy": 0.9145271182060242, "num_tokens": 61184504.0, "step": 4960 }, { "entropy": 1.4257086515426636, "epoch": 2.6124275934702474, "grad_norm": 0.3023415207862854, "learning_rate": 0.0001499165709195446, "loss": 0.22057440876960754, "mean_token_accuracy": 0.911708801984787, "num_tokens": 61196840.0, "step": 4961 }, { "entropy": 1.3803713023662567, "epoch": 2.6129541864139023, "grad_norm": 0.26708221435546875, "learning_rate": 0.0001498969161622365, "loss": 0.18439361453056335, "mean_token_accuracy": 0.9259890019893646, "num_tokens": 61209176.0, "step": 4962 }, { "entropy": 1.3897138237953186, "epoch": 2.6134807793575567, "grad_norm": 0.2693830132484436, "learning_rate": 0.000149877259036481, "loss": 0.18453623354434967, "mean_token_accuracy": 0.9199992418289185, "num_tokens": 61221512.0, "step": 4963 }, { "entropy": 1.3420685827732086, "epoch": 2.614007372301211, "grad_norm": 0.26749715209007263, "learning_rate": 0.0001498575995434451, "loss": 0.18146294355392456, "mean_token_accuracy": 0.9221750348806381, "num_tokens": 61233848.0, "step": 4964 }, { "entropy": 1.424078345298767, "epoch": 2.6145339652448656, "grad_norm": 0.2738480269908905, "learning_rate": 0.00014983793768429582, "loss": 0.190167635679245, "mean_token_accuracy": 0.9162452816963196, "num_tokens": 61246184.0, "step": 4965 }, { "entropy": 1.424032837152481, "epoch": 2.61506055818852, "grad_norm": 0.3406761586666107, "learning_rate": 0.00014981827346020033, "loss": 0.21565118432044983, "mean_token_accuracy": 0.9105579107999802, "num_tokens": 61258520.0, "step": 4966 }, { "entropy": 1.3945941925048828, "epoch": 2.615587151132175, "grad_norm": 0.28860965371131897, "learning_rate": 0.00014979860687232605, "loss": 0.19807329773902893, "mean_token_accuracy": 0.918640673160553, "num_tokens": 61270856.0, "step": 4967 }, { "entropy": 1.4615474939346313, "epoch": 2.6161137440758293, "grad_norm": 0.2449038326740265, "learning_rate": 0.00014977893792184044, "loss": 0.17040449380874634, "mean_token_accuracy": 0.9294768422842026, "num_tokens": 61283192.0, "step": 4968 }, { "entropy": 1.387730598449707, "epoch": 2.6166403370194837, "grad_norm": 0.24215394258499146, "learning_rate": 0.00014975926660991114, "loss": 0.1671278029680252, "mean_token_accuracy": 0.9315755814313889, "num_tokens": 61295528.0, "step": 4969 }, { "entropy": 1.4137276411056519, "epoch": 2.6171669299631386, "grad_norm": 0.2633579969406128, "learning_rate": 0.0001497395929377059, "loss": 0.17472606897354126, "mean_token_accuracy": 0.9256842881441116, "num_tokens": 61307864.0, "step": 4970 }, { "entropy": 1.5112013518810272, "epoch": 2.617693522906793, "grad_norm": 0.30275458097457886, "learning_rate": 0.00014971991690639264, "loss": 0.18638665974140167, "mean_token_accuracy": 0.9230543673038483, "num_tokens": 61320200.0, "step": 4971 }, { "entropy": 1.4545276463031769, "epoch": 2.6182201158504474, "grad_norm": 0.2607262134552002, "learning_rate": 0.00014970023851713945, "loss": 0.18338130414485931, "mean_token_accuracy": 0.9261559545993805, "num_tokens": 61332536.0, "step": 4972 }, { "entropy": 1.5353376269340515, "epoch": 2.6187467087941023, "grad_norm": 0.2775002717971802, "learning_rate": 0.00014968055777111447, "loss": 0.19712965190410614, "mean_token_accuracy": 0.9215246587991714, "num_tokens": 61344872.0, "step": 4973 }, { "entropy": 1.492030531167984, "epoch": 2.6192733017377567, "grad_norm": 0.29135212302207947, "learning_rate": 0.0001496608746694861, "loss": 0.19520610570907593, "mean_token_accuracy": 0.9200300872325897, "num_tokens": 61357208.0, "step": 4974 }, { "entropy": 1.4847548604011536, "epoch": 2.619799894681411, "grad_norm": 0.2899549603462219, "learning_rate": 0.00014964118921342268, "loss": 0.20027291774749756, "mean_token_accuracy": 0.9164431840181351, "num_tokens": 61369544.0, "step": 4975 }, { "entropy": 1.545228362083435, "epoch": 2.620326487625066, "grad_norm": 0.32349705696105957, "learning_rate": 0.00014962150140409292, "loss": 0.202370285987854, "mean_token_accuracy": 0.9114632904529572, "num_tokens": 61381880.0, "step": 4976 }, { "entropy": 1.5073691308498383, "epoch": 2.6208530805687205, "grad_norm": 0.2822265923023224, "learning_rate": 0.0001496018112426656, "loss": 0.18207140266895294, "mean_token_accuracy": 0.9235720336437225, "num_tokens": 61394216.0, "step": 4977 }, { "entropy": 1.4734999239444733, "epoch": 2.621379673512375, "grad_norm": 0.26013490557670593, "learning_rate": 0.0001495821187303095, "loss": 0.18135610222816467, "mean_token_accuracy": 0.9248005449771881, "num_tokens": 61406552.0, "step": 4978 }, { "entropy": 1.4858646392822266, "epoch": 2.6219062664560298, "grad_norm": 0.26286378502845764, "learning_rate": 0.00014956242386819377, "loss": 0.17394036054611206, "mean_token_accuracy": 0.9256371855735779, "num_tokens": 61418888.0, "step": 4979 }, { "entropy": 1.5628124177455902, "epoch": 2.622432859399684, "grad_norm": 0.29492512345314026, "learning_rate": 0.00014954272665748753, "loss": 0.20093891024589539, "mean_token_accuracy": 0.9158370047807693, "num_tokens": 61431224.0, "step": 4980 }, { "entropy": 1.4645267724990845, "epoch": 2.6229594523433386, "grad_norm": 0.2536724805831909, "learning_rate": 0.00014952302709936004, "loss": 0.19026266038417816, "mean_token_accuracy": 0.9191191345453262, "num_tokens": 61443560.0, "step": 4981 }, { "entropy": 1.523823469877243, "epoch": 2.623486045286993, "grad_norm": 0.2790801227092743, "learning_rate": 0.00014950332519498077, "loss": 0.18979769945144653, "mean_token_accuracy": 0.9234752207994461, "num_tokens": 61455896.0, "step": 4982 }, { "entropy": 1.4641594588756561, "epoch": 2.6240126382306475, "grad_norm": 0.2721916735172272, "learning_rate": 0.00014948362094551937, "loss": 0.1872018724679947, "mean_token_accuracy": 0.9233260899782181, "num_tokens": 61468232.0, "step": 4983 }, { "entropy": 1.4742111563682556, "epoch": 2.6245392311743023, "grad_norm": 0.27885833382606506, "learning_rate": 0.00014946391435214555, "loss": 0.18875938653945923, "mean_token_accuracy": 0.9190693944692612, "num_tokens": 61480568.0, "step": 4984 }, { "entropy": 1.4826852679252625, "epoch": 2.6250658241179567, "grad_norm": 0.2697864770889282, "learning_rate": 0.0001494442054160291, "loss": 0.18166761100292206, "mean_token_accuracy": 0.9245208501815796, "num_tokens": 61492904.0, "step": 4985 }, { "entropy": 1.484268456697464, "epoch": 2.625592417061611, "grad_norm": 0.28331586718559265, "learning_rate": 0.00014942449413834008, "loss": 0.20358870923519135, "mean_token_accuracy": 0.9150479584932327, "num_tokens": 61505240.0, "step": 4986 }, { "entropy": 1.5757165551185608, "epoch": 2.626119010005266, "grad_norm": 0.29690924286842346, "learning_rate": 0.0001494047805202486, "loss": 0.2068706899881363, "mean_token_accuracy": 0.9173736572265625, "num_tokens": 61517576.0, "step": 4987 }, { "entropy": 1.533332884311676, "epoch": 2.6266456029489205, "grad_norm": 0.2705383002758026, "learning_rate": 0.000149385064562925, "loss": 0.17962002754211426, "mean_token_accuracy": 0.9280455708503723, "num_tokens": 61529912.0, "step": 4988 }, { "entropy": 1.4875019192695618, "epoch": 2.627172195892575, "grad_norm": 0.25805172324180603, "learning_rate": 0.0001493653462675397, "loss": 0.1781042516231537, "mean_token_accuracy": 0.9260552823543549, "num_tokens": 61542248.0, "step": 4989 }, { "entropy": 1.5069396495819092, "epoch": 2.6276987888362298, "grad_norm": 0.2651374340057373, "learning_rate": 0.0001493456256352632, "loss": 0.16291144490242004, "mean_token_accuracy": 0.9381222277879715, "num_tokens": 61554584.0, "step": 4990 }, { "entropy": 1.512205809354782, "epoch": 2.628225381779884, "grad_norm": 0.2627486288547516, "learning_rate": 0.0001493259026672662, "loss": 0.17600515484809875, "mean_token_accuracy": 0.9252037554979324, "num_tokens": 61566920.0, "step": 4991 }, { "entropy": 1.5533555746078491, "epoch": 2.6287519747235386, "grad_norm": 0.2759650945663452, "learning_rate": 0.0001493061773647196, "loss": 0.19801002740859985, "mean_token_accuracy": 0.916521742939949, "num_tokens": 61579256.0, "step": 4992 }, { "entropy": 1.5064502358436584, "epoch": 2.6292785676671935, "grad_norm": 0.2789139747619629, "learning_rate": 0.00014928644972879435, "loss": 0.1943892240524292, "mean_token_accuracy": 0.9217264503240585, "num_tokens": 61591592.0, "step": 4993 }, { "entropy": 1.4866106510162354, "epoch": 2.629805160610848, "grad_norm": 0.2809959352016449, "learning_rate": 0.00014926671976066153, "loss": 0.1923881471157074, "mean_token_accuracy": 0.920316144824028, "num_tokens": 61603928.0, "step": 4994 }, { "entropy": 1.452727496623993, "epoch": 2.6303317535545023, "grad_norm": 0.26779183745384216, "learning_rate": 0.00014924698746149247, "loss": 0.19007578492164612, "mean_token_accuracy": 0.9183843284845352, "num_tokens": 61616264.0, "step": 4995 }, { "entropy": 1.5179031789302826, "epoch": 2.630858346498157, "grad_norm": 0.31994399428367615, "learning_rate": 0.00014922725283245846, "loss": 0.20158439874649048, "mean_token_accuracy": 0.9133966416120529, "num_tokens": 61628600.0, "step": 4996 }, { "entropy": 1.4967687129974365, "epoch": 2.6313849394418116, "grad_norm": 0.27653440833091736, "learning_rate": 0.00014920751587473109, "loss": 0.18471458554267883, "mean_token_accuracy": 0.9204710125923157, "num_tokens": 61640936.0, "step": 4997 }, { "entropy": 1.4336793720722198, "epoch": 2.631911532385466, "grad_norm": 0.2625034749507904, "learning_rate": 0.00014918777658948207, "loss": 0.19384607672691345, "mean_token_accuracy": 0.9205842167139053, "num_tokens": 61653272.0, "step": 4998 }, { "entropy": 1.457231193780899, "epoch": 2.6324381253291205, "grad_norm": 0.27422916889190674, "learning_rate": 0.00014916803497788312, "loss": 0.19413116574287415, "mean_token_accuracy": 0.918518990278244, "num_tokens": 61665608.0, "step": 4999 }, { "entropy": 1.5142923891544342, "epoch": 2.632964718272775, "grad_norm": 0.297994464635849, "learning_rate": 0.00014914829104110624, "loss": 0.18459801375865936, "mean_token_accuracy": 0.9225414544343948, "num_tokens": 61677944.0, "step": 5000 }, { "entropy": 1.465256243944168, "epoch": 2.6334913112164298, "grad_norm": 0.26568931341171265, "learning_rate": 0.00014912854478032342, "loss": 0.16957612335681915, "mean_token_accuracy": 0.9300836622714996, "num_tokens": 61690280.0, "step": 5001 }, { "entropy": 1.4762811958789825, "epoch": 2.634017904160084, "grad_norm": 0.2986241579055786, "learning_rate": 0.00014910879619670704, "loss": 0.2125251293182373, "mean_token_accuracy": 0.9084591418504715, "num_tokens": 61702616.0, "step": 5002 }, { "entropy": 1.5015441477298737, "epoch": 2.6345444971037386, "grad_norm": 0.28843849897384644, "learning_rate": 0.00014908904529142936, "loss": 0.20061375200748444, "mean_token_accuracy": 0.9132287502288818, "num_tokens": 61714952.0, "step": 5003 }, { "entropy": 1.4222372174263, "epoch": 2.6350710900473935, "grad_norm": 0.26220911741256714, "learning_rate": 0.00014906929206566288, "loss": 0.1835784912109375, "mean_token_accuracy": 0.9224424511194229, "num_tokens": 61727288.0, "step": 5004 }, { "entropy": 1.503590077161789, "epoch": 2.635597682991048, "grad_norm": 0.2724861204624176, "learning_rate": 0.00014904953652058022, "loss": 0.18589074909687042, "mean_token_accuracy": 0.9205165356397629, "num_tokens": 61739624.0, "step": 5005 }, { "entropy": 1.4780482947826385, "epoch": 2.6361242759347023, "grad_norm": 0.2663821280002594, "learning_rate": 0.0001490297786573542, "loss": 0.16736972332000732, "mean_token_accuracy": 0.9276704490184784, "num_tokens": 61751960.0, "step": 5006 }, { "entropy": 1.5240800082683563, "epoch": 2.636650868878357, "grad_norm": 0.29903721809387207, "learning_rate": 0.00014901001847715772, "loss": 0.21255864202976227, "mean_token_accuracy": 0.914804145693779, "num_tokens": 61764296.0, "step": 5007 }, { "entropy": 1.4933780431747437, "epoch": 2.6371774618220116, "grad_norm": 0.29435548186302185, "learning_rate": 0.00014899025598116378, "loss": 0.21587303280830383, "mean_token_accuracy": 0.9131506383419037, "num_tokens": 61776632.0, "step": 5008 }, { "entropy": 1.4735883176326752, "epoch": 2.637704054765666, "grad_norm": 0.26635274291038513, "learning_rate": 0.00014897049117054562, "loss": 0.18540072441101074, "mean_token_accuracy": 0.9208427369594574, "num_tokens": 61788968.0, "step": 5009 }, { "entropy": 1.482529640197754, "epoch": 2.638230647709321, "grad_norm": 0.2780616283416748, "learning_rate": 0.00014895072404647652, "loss": 0.1992691457271576, "mean_token_accuracy": 0.9197406619787216, "num_tokens": 61801304.0, "step": 5010 }, { "entropy": 1.4966471791267395, "epoch": 2.6387572406529753, "grad_norm": 0.2593666911125183, "learning_rate": 0.00014893095461012996, "loss": 0.1759515404701233, "mean_token_accuracy": 0.9271847456693649, "num_tokens": 61813640.0, "step": 5011 }, { "entropy": 1.5135290026664734, "epoch": 2.6392838335966298, "grad_norm": 0.29530930519104004, "learning_rate": 0.00014891118286267953, "loss": 0.1886937916278839, "mean_token_accuracy": 0.9284406006336212, "num_tokens": 61825976.0, "step": 5012 }, { "entropy": 1.5016413629055023, "epoch": 2.639810426540284, "grad_norm": 0.2679826021194458, "learning_rate": 0.00014889140880529895, "loss": 0.18548890948295593, "mean_token_accuracy": 0.9230465292930603, "num_tokens": 61838312.0, "step": 5013 }, { "entropy": 1.4605536758899689, "epoch": 2.640337019483939, "grad_norm": 0.26483213901519775, "learning_rate": 0.00014887163243916212, "loss": 0.1955711394548416, "mean_token_accuracy": 0.9219475090503693, "num_tokens": 61850648.0, "step": 5014 }, { "entropy": 1.4169133007526398, "epoch": 2.6408636124275935, "grad_norm": 0.25406575202941895, "learning_rate": 0.00014885185376544303, "loss": 0.18453362584114075, "mean_token_accuracy": 0.9296320825815201, "num_tokens": 61862984.0, "step": 5015 }, { "entropy": 1.4207545518875122, "epoch": 2.641390205371248, "grad_norm": 0.26548707485198975, "learning_rate": 0.00014883207278531583, "loss": 0.1941414475440979, "mean_token_accuracy": 0.9198261648416519, "num_tokens": 61875320.0, "step": 5016 }, { "entropy": 1.4815255403518677, "epoch": 2.6419167983149023, "grad_norm": 0.30611151456832886, "learning_rate": 0.0001488122894999548, "loss": 0.19840019941329956, "mean_token_accuracy": 0.9162526428699493, "num_tokens": 61887656.0, "step": 5017 }, { "entropy": 1.459589034318924, "epoch": 2.642443391258557, "grad_norm": 0.26431792974472046, "learning_rate": 0.00014879250391053436, "loss": 0.19742351770401, "mean_token_accuracy": 0.9196898192167282, "num_tokens": 61899992.0, "step": 5018 }, { "entropy": 1.4588222205638885, "epoch": 2.6429699842022116, "grad_norm": 0.2513519823551178, "learning_rate": 0.00014877271601822906, "loss": 0.17419758439064026, "mean_token_accuracy": 0.9283565282821655, "num_tokens": 61912328.0, "step": 5019 }, { "entropy": 1.4621175527572632, "epoch": 2.643496577145866, "grad_norm": 0.2847839295864105, "learning_rate": 0.00014875292582421361, "loss": 0.20356279611587524, "mean_token_accuracy": 0.9177330881357193, "num_tokens": 61924664.0, "step": 5020 }, { "entropy": 1.4893657863140106, "epoch": 2.644023170089521, "grad_norm": 0.2779315710067749, "learning_rate": 0.0001487331333296628, "loss": 0.18966048955917358, "mean_token_accuracy": 0.9230923056602478, "num_tokens": 61937000.0, "step": 5021 }, { "entropy": 1.4491442739963531, "epoch": 2.6445497630331753, "grad_norm": 0.26622483134269714, "learning_rate": 0.00014871333853575162, "loss": 0.17434798181056976, "mean_token_accuracy": 0.9300359487533569, "num_tokens": 61949336.0, "step": 5022 }, { "entropy": 1.4646160006523132, "epoch": 2.6450763559768298, "grad_norm": 0.2670898139476776, "learning_rate": 0.0001486935414436552, "loss": 0.18202300369739532, "mean_token_accuracy": 0.9229418784379959, "num_tokens": 61961672.0, "step": 5023 }, { "entropy": 1.4607856273651123, "epoch": 2.6456029489204846, "grad_norm": 0.2811572551727295, "learning_rate": 0.0001486737420545487, "loss": 0.191569522023201, "mean_token_accuracy": 0.9196878373622894, "num_tokens": 61974008.0, "step": 5024 }, { "entropy": 1.4494915902614594, "epoch": 2.646129541864139, "grad_norm": 0.280921071767807, "learning_rate": 0.00014865394036960757, "loss": 0.20201906561851501, "mean_token_accuracy": 0.9147041141986847, "num_tokens": 61986344.0, "step": 5025 }, { "entropy": 1.4409070909023285, "epoch": 2.6466561348077935, "grad_norm": 0.30701422691345215, "learning_rate": 0.00014863413639000728, "loss": 0.21084938943386078, "mean_token_accuracy": 0.9105718582868576, "num_tokens": 61998680.0, "step": 5026 }, { "entropy": 1.488195687532425, "epoch": 2.6471827277514484, "grad_norm": 0.2876113951206207, "learning_rate": 0.0001486143301169235, "loss": 0.19386553764343262, "mean_token_accuracy": 0.9238238483667374, "num_tokens": 62011016.0, "step": 5027 }, { "entropy": 1.4491178691387177, "epoch": 2.647709320695103, "grad_norm": 0.27359431982040405, "learning_rate": 0.000148594521551532, "loss": 0.1898740977048874, "mean_token_accuracy": 0.9226633757352829, "num_tokens": 62023352.0, "step": 5028 }, { "entropy": 1.458969622850418, "epoch": 2.648235913638757, "grad_norm": 0.2540356516838074, "learning_rate": 0.0001485747106950087, "loss": 0.16982772946357727, "mean_token_accuracy": 0.9287703484296799, "num_tokens": 62035688.0, "step": 5029 }, { "entropy": 1.513466477394104, "epoch": 2.6487625065824116, "grad_norm": 0.3041362166404724, "learning_rate": 0.00014855489754852968, "loss": 0.19860799610614777, "mean_token_accuracy": 0.9202546030282974, "num_tokens": 62048024.0, "step": 5030 }, { "entropy": 1.4717740714550018, "epoch": 2.6492890995260665, "grad_norm": 0.26170480251312256, "learning_rate": 0.00014853508211327106, "loss": 0.18246625363826752, "mean_token_accuracy": 0.9252501279115677, "num_tokens": 62060360.0, "step": 5031 }, { "entropy": 1.485759437084198, "epoch": 2.649815692469721, "grad_norm": 0.2745889127254486, "learning_rate": 0.00014851526439040922, "loss": 0.18612299859523773, "mean_token_accuracy": 0.9231321662664413, "num_tokens": 62072696.0, "step": 5032 }, { "entropy": 1.4918552339076996, "epoch": 2.6503422854133754, "grad_norm": 0.282909095287323, "learning_rate": 0.00014849544438112067, "loss": 0.1870800256729126, "mean_token_accuracy": 0.9241845160722733, "num_tokens": 62085032.0, "step": 5033 }, { "entropy": 1.468372255563736, "epoch": 2.65086887835703, "grad_norm": 0.25634321570396423, "learning_rate": 0.00014847562208658192, "loss": 0.19367656111717224, "mean_token_accuracy": 0.9194540530443192, "num_tokens": 62097368.0, "step": 5034 }, { "entropy": 1.4729166626930237, "epoch": 2.6513954713006846, "grad_norm": 0.2615182101726532, "learning_rate": 0.00014845579750796974, "loss": 0.18999339640140533, "mean_token_accuracy": 0.918884739279747, "num_tokens": 62109704.0, "step": 5035 }, { "entropy": 1.4983617663383484, "epoch": 2.651922064244339, "grad_norm": 0.2739679515361786, "learning_rate": 0.00014843597064646098, "loss": 0.19533707201480865, "mean_token_accuracy": 0.9183563441038132, "num_tokens": 62122040.0, "step": 5036 }, { "entropy": 1.5050725042819977, "epoch": 2.6524486571879935, "grad_norm": 0.2634129822254181, "learning_rate": 0.0001484161415032327, "loss": 0.17496910691261292, "mean_token_accuracy": 0.9283895641565323, "num_tokens": 62134376.0, "step": 5037 }, { "entropy": 1.4989458620548248, "epoch": 2.6529752501316484, "grad_norm": 0.2645623981952667, "learning_rate": 0.000148396310079462, "loss": 0.1856268048286438, "mean_token_accuracy": 0.9227189868688583, "num_tokens": 62146712.0, "step": 5038 }, { "entropy": 1.437988817691803, "epoch": 2.653501843075303, "grad_norm": 0.24866002798080444, "learning_rate": 0.0001483764763763261, "loss": 0.19240614771842957, "mean_token_accuracy": 0.9217969477176666, "num_tokens": 62159048.0, "step": 5039 }, { "entropy": 1.495307207107544, "epoch": 2.654028436018957, "grad_norm": 0.2985769510269165, "learning_rate": 0.00014835664039500256, "loss": 0.18848103284835815, "mean_token_accuracy": 0.9216516762971878, "num_tokens": 62171384.0, "step": 5040 }, { "entropy": 1.5302987098693848, "epoch": 2.654555028962612, "grad_norm": 0.29026493430137634, "learning_rate": 0.0001483368021366688, "loss": 0.19517871737480164, "mean_token_accuracy": 0.919246032834053, "num_tokens": 62183720.0, "step": 5041 }, { "entropy": 1.5133644342422485, "epoch": 2.6550816219062665, "grad_norm": 0.29291194677352905, "learning_rate": 0.00014831696160250255, "loss": 0.1887335330247879, "mean_token_accuracy": 0.9231208711862564, "num_tokens": 62196056.0, "step": 5042 }, { "entropy": 1.5374446511268616, "epoch": 2.655608214849921, "grad_norm": 0.30532917380332947, "learning_rate": 0.0001482971187936816, "loss": 0.1930762231349945, "mean_token_accuracy": 0.9206221103668213, "num_tokens": 62208392.0, "step": 5043 }, { "entropy": 1.5095820128917694, "epoch": 2.656134807793576, "grad_norm": 0.2619345188140869, "learning_rate": 0.00014827727371138392, "loss": 0.16936379671096802, "mean_token_accuracy": 0.9295063018798828, "num_tokens": 62220728.0, "step": 5044 }, { "entropy": 1.4872773885726929, "epoch": 2.6566614007372302, "grad_norm": 0.259647399187088, "learning_rate": 0.00014825742635678763, "loss": 0.18199995160102844, "mean_token_accuracy": 0.9230765402317047, "num_tokens": 62233064.0, "step": 5045 }, { "entropy": 1.481743037700653, "epoch": 2.6571879936808847, "grad_norm": 0.2543366551399231, "learning_rate": 0.00014823757673107087, "loss": 0.1779671460390091, "mean_token_accuracy": 0.9248911142349243, "num_tokens": 62245400.0, "step": 5046 }, { "entropy": 1.4478746354579926, "epoch": 2.657714586624539, "grad_norm": 0.41329747438430786, "learning_rate": 0.00014821772483541206, "loss": 0.2164127230644226, "mean_token_accuracy": 0.9103289246559143, "num_tokens": 62257736.0, "step": 5047 }, { "entropy": 1.3805460035800934, "epoch": 2.658241179568194, "grad_norm": 0.2816043198108673, "learning_rate": 0.00014819787067098974, "loss": 0.16988952457904816, "mean_token_accuracy": 0.9290281236171722, "num_tokens": 62270072.0, "step": 5048 }, { "entropy": 1.4640763998031616, "epoch": 2.6587677725118484, "grad_norm": 0.3088597357273102, "learning_rate": 0.00014817801423898242, "loss": 0.2151375412940979, "mean_token_accuracy": 0.9137706756591797, "num_tokens": 62282408.0, "step": 5049 }, { "entropy": 1.4645437598228455, "epoch": 2.659294365455503, "grad_norm": 0.2925296425819397, "learning_rate": 0.00014815815554056888, "loss": 0.20622608065605164, "mean_token_accuracy": 0.916460320353508, "num_tokens": 62294744.0, "step": 5050 }, { "entropy": 1.4329487681388855, "epoch": 2.659820958399157, "grad_norm": 0.2808581292629242, "learning_rate": 0.00014813829457692811, "loss": 0.19199764728546143, "mean_token_accuracy": 0.9220515191555023, "num_tokens": 62307080.0, "step": 5051 }, { "entropy": 1.4280554354190826, "epoch": 2.660347551342812, "grad_norm": 0.3025852143764496, "learning_rate": 0.00014811843134923905, "loss": 0.20314553380012512, "mean_token_accuracy": 0.9143315702676773, "num_tokens": 62319416.0, "step": 5052 }, { "entropy": 1.4104456305503845, "epoch": 2.6608741442864665, "grad_norm": 0.25764983892440796, "learning_rate": 0.0001480985658586809, "loss": 0.19061550498008728, "mean_token_accuracy": 0.9198824912309647, "num_tokens": 62331752.0, "step": 5053 }, { "entropy": 1.3653182983398438, "epoch": 2.661400737230121, "grad_norm": 0.25570061802864075, "learning_rate": 0.00014807869810643293, "loss": 0.185185968875885, "mean_token_accuracy": 0.9199551194906235, "num_tokens": 62344088.0, "step": 5054 }, { "entropy": 1.406097024679184, "epoch": 2.661927330173776, "grad_norm": 0.2705627679824829, "learning_rate": 0.0001480588280936746, "loss": 0.18984414637088776, "mean_token_accuracy": 0.922783151268959, "num_tokens": 62356424.0, "step": 5055 }, { "entropy": 1.3973156809806824, "epoch": 2.6624539231174302, "grad_norm": 0.2610485255718231, "learning_rate": 0.0001480389558215855, "loss": 0.18623566627502441, "mean_token_accuracy": 0.9179131835699081, "num_tokens": 62368760.0, "step": 5056 }, { "entropy": 1.4304659962654114, "epoch": 2.6629805160610847, "grad_norm": 0.2898637056350708, "learning_rate": 0.00014801908129134526, "loss": 0.19678384065628052, "mean_token_accuracy": 0.9213199466466904, "num_tokens": 62381096.0, "step": 5057 }, { "entropy": 1.4300953447818756, "epoch": 2.6635071090047395, "grad_norm": 0.2751653492450714, "learning_rate": 0.0001479992045041338, "loss": 0.20221449434757233, "mean_token_accuracy": 0.9203903675079346, "num_tokens": 62393432.0, "step": 5058 }, { "entropy": 1.427178055047989, "epoch": 2.664033701948394, "grad_norm": 0.290485680103302, "learning_rate": 0.000147979325461131, "loss": 0.21843308210372925, "mean_token_accuracy": 0.913594514131546, "num_tokens": 62405768.0, "step": 5059 }, { "entropy": 1.385628342628479, "epoch": 2.6645602948920484, "grad_norm": 0.25159385800361633, "learning_rate": 0.000147959444163517, "loss": 0.1820984035730362, "mean_token_accuracy": 0.9247033447027206, "num_tokens": 62418104.0, "step": 5060 }, { "entropy": 1.4184448421001434, "epoch": 2.6650868878357032, "grad_norm": 0.27652180194854736, "learning_rate": 0.00014793956061247206, "loss": 0.19931438565254211, "mean_token_accuracy": 0.9216466546058655, "num_tokens": 62430440.0, "step": 5061 }, { "entropy": 1.4194599390029907, "epoch": 2.6656134807793577, "grad_norm": 0.25531280040740967, "learning_rate": 0.00014791967480917657, "loss": 0.20077663660049438, "mean_token_accuracy": 0.9188417941331863, "num_tokens": 62442776.0, "step": 5062 }, { "entropy": 1.4733093976974487, "epoch": 2.666140073723012, "grad_norm": 0.2748359739780426, "learning_rate": 0.00014789978675481099, "loss": 0.20483776926994324, "mean_token_accuracy": 0.9151559323072433, "num_tokens": 62455112.0, "step": 5063 }, { "entropy": 1.45448699593544, "epoch": 2.6666666666666665, "grad_norm": 0.27252256870269775, "learning_rate": 0.00014787989645055592, "loss": 0.1859803944826126, "mean_token_accuracy": 0.9244741946458817, "num_tokens": 62467448.0, "step": 5064 }, { "entropy": 1.4732069373130798, "epoch": 2.6671932596103214, "grad_norm": 0.2930166721343994, "learning_rate": 0.0001478600038975922, "loss": 0.19164472818374634, "mean_token_accuracy": 0.9163028299808502, "num_tokens": 62479784.0, "step": 5065 }, { "entropy": 1.5055941045284271, "epoch": 2.667719852553976, "grad_norm": 0.2679279148578644, "learning_rate": 0.0001478401090971007, "loss": 0.19617860019207, "mean_token_accuracy": 0.9202954471111298, "num_tokens": 62492120.0, "step": 5066 }, { "entropy": 1.460567593574524, "epoch": 2.6682464454976302, "grad_norm": 0.27816247940063477, "learning_rate": 0.00014782021205026253, "loss": 0.19984135031700134, "mean_token_accuracy": 0.9161521047353745, "num_tokens": 62504456.0, "step": 5067 }, { "entropy": 1.5180878043174744, "epoch": 2.6687730384412847, "grad_norm": 0.2608720064163208, "learning_rate": 0.00014780031275825873, "loss": 0.17761757969856262, "mean_token_accuracy": 0.9275451302528381, "num_tokens": 62516792.0, "step": 5068 }, { "entropy": 1.472340166568756, "epoch": 2.6692996313849395, "grad_norm": 0.2798198461532593, "learning_rate": 0.00014778041122227075, "loss": 0.19814461469650269, "mean_token_accuracy": 0.9174378514289856, "num_tokens": 62529128.0, "step": 5069 }, { "entropy": 1.4553137123584747, "epoch": 2.669826224328594, "grad_norm": 0.26443323493003845, "learning_rate": 0.0001477605074434799, "loss": 0.1944284290075302, "mean_token_accuracy": 0.9212834388017654, "num_tokens": 62541464.0, "step": 5070 }, { "entropy": 1.4736585021018982, "epoch": 2.6703528172722484, "grad_norm": 0.26062700152397156, "learning_rate": 0.00014774060142306783, "loss": 0.18508225679397583, "mean_token_accuracy": 0.9232953488826752, "num_tokens": 62553800.0, "step": 5071 }, { "entropy": 1.4530866146087646, "epoch": 2.6708794102159032, "grad_norm": 0.2670004665851593, "learning_rate": 0.00014772069316221624, "loss": 0.18442218005657196, "mean_token_accuracy": 0.9211182296276093, "num_tokens": 62566136.0, "step": 5072 }, { "entropy": 1.5300174951553345, "epoch": 2.6714060031595577, "grad_norm": 0.29020318388938904, "learning_rate": 0.00014770078266210693, "loss": 0.19545911252498627, "mean_token_accuracy": 0.9184393137693405, "num_tokens": 62578472.0, "step": 5073 }, { "entropy": 1.481099247932434, "epoch": 2.671932596103212, "grad_norm": 0.2822254002094269, "learning_rate": 0.00014768086992392187, "loss": 0.21277567744255066, "mean_token_accuracy": 0.9113451242446899, "num_tokens": 62590808.0, "step": 5074 }, { "entropy": 1.4741357564926147, "epoch": 2.672459189046867, "grad_norm": 0.2677938640117645, "learning_rate": 0.0001476609549488432, "loss": 0.18364793062210083, "mean_token_accuracy": 0.9212507903575897, "num_tokens": 62603144.0, "step": 5075 }, { "entropy": 1.4302943646907806, "epoch": 2.6729857819905214, "grad_norm": 0.28869354724884033, "learning_rate": 0.00014764103773805317, "loss": 0.19501850008964539, "mean_token_accuracy": 0.9206612259149551, "num_tokens": 62615480.0, "step": 5076 }, { "entropy": 1.4747921526432037, "epoch": 2.673512374934176, "grad_norm": 0.28305885195732117, "learning_rate": 0.00014762111829273408, "loss": 0.19867157936096191, "mean_token_accuracy": 0.9136838912963867, "num_tokens": 62627816.0, "step": 5077 }, { "entropy": 1.477564960718155, "epoch": 2.6740389678778307, "grad_norm": 0.29496532678604126, "learning_rate": 0.00014760119661406848, "loss": 0.2132798433303833, "mean_token_accuracy": 0.9153429567813873, "num_tokens": 62640152.0, "step": 5078 }, { "entropy": 1.4560523927211761, "epoch": 2.674565560821485, "grad_norm": 0.2781224548816681, "learning_rate": 0.00014758127270323901, "loss": 0.19361227750778198, "mean_token_accuracy": 0.9156886488199234, "num_tokens": 62652488.0, "step": 5079 }, { "entropy": 1.4673229455947876, "epoch": 2.6750921537651395, "grad_norm": 0.2802741527557373, "learning_rate": 0.00014756134656142842, "loss": 0.19040311872959137, "mean_token_accuracy": 0.9192695170640945, "num_tokens": 62664824.0, "step": 5080 }, { "entropy": 1.4941490292549133, "epoch": 2.675618746708794, "grad_norm": 0.289615273475647, "learning_rate": 0.00014754141818981958, "loss": 0.2048090100288391, "mean_token_accuracy": 0.9167844653129578, "num_tokens": 62677160.0, "step": 5081 }, { "entropy": 1.5785216391086578, "epoch": 2.6761453396524484, "grad_norm": 0.29720696806907654, "learning_rate": 0.00014752148758959556, "loss": 0.2018081247806549, "mean_token_accuracy": 0.9176874905824661, "num_tokens": 62689496.0, "step": 5082 }, { "entropy": 1.4724806249141693, "epoch": 2.6766719325961033, "grad_norm": 0.26232361793518066, "learning_rate": 0.0001475015547619395, "loss": 0.18163368105888367, "mean_token_accuracy": 0.9263022541999817, "num_tokens": 62701832.0, "step": 5083 }, { "entropy": 1.458247810602188, "epoch": 2.6771985255397577, "grad_norm": 0.25973543524742126, "learning_rate": 0.00014748161970803476, "loss": 0.18482840061187744, "mean_token_accuracy": 0.9212622344493866, "num_tokens": 62714168.0, "step": 5084 }, { "entropy": 1.4636139869689941, "epoch": 2.677725118483412, "grad_norm": 0.2422919124364853, "learning_rate": 0.00014746168242906466, "loss": 0.18235735595226288, "mean_token_accuracy": 0.925435408949852, "num_tokens": 62726504.0, "step": 5085 }, { "entropy": 1.5218181014060974, "epoch": 2.678251711427067, "grad_norm": 0.2919144928455353, "learning_rate": 0.00014744174292621284, "loss": 0.20702354609966278, "mean_token_accuracy": 0.9145085662603378, "num_tokens": 62738840.0, "step": 5086 }, { "entropy": 1.525699645280838, "epoch": 2.6787783043707214, "grad_norm": 0.2882302701473236, "learning_rate": 0.000147421801200663, "loss": 0.1976340264081955, "mean_token_accuracy": 0.9134345352649689, "num_tokens": 62751176.0, "step": 5087 }, { "entropy": 1.4348933696746826, "epoch": 2.679304897314376, "grad_norm": 0.2594358026981354, "learning_rate": 0.00014740185725359888, "loss": 0.18077734112739563, "mean_token_accuracy": 0.9274876117706299, "num_tokens": 62763512.0, "step": 5088 }, { "entropy": 1.5126748085021973, "epoch": 2.6798314902580307, "grad_norm": 0.27899715304374695, "learning_rate": 0.00014738191108620453, "loss": 0.16763128340244293, "mean_token_accuracy": 0.9275881052017212, "num_tokens": 62775848.0, "step": 5089 }, { "entropy": 1.4852455258369446, "epoch": 2.680358083201685, "grad_norm": 0.2729766368865967, "learning_rate": 0.00014736196269966398, "loss": 0.19001656770706177, "mean_token_accuracy": 0.920672133564949, "num_tokens": 62788184.0, "step": 5090 }, { "entropy": 1.5065564215183258, "epoch": 2.6808846761453395, "grad_norm": 0.2911035120487213, "learning_rate": 0.00014734201209516147, "loss": 0.1995036005973816, "mean_token_accuracy": 0.9154681265354156, "num_tokens": 62800520.0, "step": 5091 }, { "entropy": 1.533303052186966, "epoch": 2.6814112690889944, "grad_norm": 0.2991733253002167, "learning_rate": 0.00014732205927388135, "loss": 0.2060600221157074, "mean_token_accuracy": 0.9143246114253998, "num_tokens": 62812856.0, "step": 5092 }, { "entropy": 1.460000604391098, "epoch": 2.681937862032649, "grad_norm": 0.29276540875434875, "learning_rate": 0.00014730210423700808, "loss": 0.21440377831459045, "mean_token_accuracy": 0.9087410867214203, "num_tokens": 62825192.0, "step": 5093 }, { "entropy": 1.5091078579425812, "epoch": 2.6824644549763033, "grad_norm": 0.2839752435684204, "learning_rate": 0.00014728214698572631, "loss": 0.18155799806118011, "mean_token_accuracy": 0.9258093386888504, "num_tokens": 62837528.0, "step": 5094 }, { "entropy": 1.4895299971103668, "epoch": 2.682991047919958, "grad_norm": 0.29584982991218567, "learning_rate": 0.00014726218752122077, "loss": 0.1990211009979248, "mean_token_accuracy": 0.9221978783607483, "num_tokens": 62849864.0, "step": 5095 }, { "entropy": 1.5201840102672577, "epoch": 2.6835176408636126, "grad_norm": 0.2847629487514496, "learning_rate": 0.00014724222584467636, "loss": 0.18885351717472076, "mean_token_accuracy": 0.9195914417505264, "num_tokens": 62862200.0, "step": 5096 }, { "entropy": 1.5187770426273346, "epoch": 2.684044233807267, "grad_norm": 0.2975653111934662, "learning_rate": 0.00014722226195727805, "loss": 0.18812790513038635, "mean_token_accuracy": 0.9264185279607773, "num_tokens": 62874536.0, "step": 5097 }, { "entropy": 1.5271228551864624, "epoch": 2.6845708267509214, "grad_norm": 0.30130523443222046, "learning_rate": 0.00014720229586021098, "loss": 0.20495375990867615, "mean_token_accuracy": 0.9173427224159241, "num_tokens": 62886872.0, "step": 5098 }, { "entropy": 1.4671573638916016, "epoch": 2.685097419694576, "grad_norm": 0.2789948880672455, "learning_rate": 0.00014718232755466044, "loss": 0.19155564904212952, "mean_token_accuracy": 0.9244812875986099, "num_tokens": 62899208.0, "step": 5099 }, { "entropy": 1.4602892696857452, "epoch": 2.6856240126382307, "grad_norm": 0.282321959733963, "learning_rate": 0.00014716235704181183, "loss": 0.19326922297477722, "mean_token_accuracy": 0.9190951883792877, "num_tokens": 62911544.0, "step": 5100 }, { "entropy": 1.4617981910705566, "epoch": 2.686150605581885, "grad_norm": 0.2758800685405731, "learning_rate": 0.00014714238432285068, "loss": 0.18824873864650726, "mean_token_accuracy": 0.9187182486057281, "num_tokens": 62923880.0, "step": 5101 }, { "entropy": 1.569584608078003, "epoch": 2.6866771985255395, "grad_norm": 0.3216269314289093, "learning_rate": 0.00014712240939896267, "loss": 0.20186135172843933, "mean_token_accuracy": 0.9188182950019836, "num_tokens": 62936216.0, "step": 5102 }, { "entropy": 1.557395488023758, "epoch": 2.6872037914691944, "grad_norm": 0.299017071723938, "learning_rate": 0.00014710243227133358, "loss": 0.2022053301334381, "mean_token_accuracy": 0.9197170734405518, "num_tokens": 62948552.0, "step": 5103 }, { "entropy": 1.4289929568767548, "epoch": 2.687730384412849, "grad_norm": 0.2511787712574005, "learning_rate": 0.00014708245294114933, "loss": 0.17053452134132385, "mean_token_accuracy": 0.9278395920991898, "num_tokens": 62960888.0, "step": 5104 }, { "entropy": 1.5246893167495728, "epoch": 2.6882569773565033, "grad_norm": 0.3040166199207306, "learning_rate": 0.00014706247140959598, "loss": 0.211963951587677, "mean_token_accuracy": 0.9108811169862747, "num_tokens": 62973224.0, "step": 5105 }, { "entropy": 1.5441584885120392, "epoch": 2.688783570300158, "grad_norm": 0.28725534677505493, "learning_rate": 0.00014704248767785972, "loss": 0.20567721128463745, "mean_token_accuracy": 0.9181210845708847, "num_tokens": 62985560.0, "step": 5106 }, { "entropy": 1.5119162201881409, "epoch": 2.6893101632438126, "grad_norm": 0.29949843883514404, "learning_rate": 0.00014702250174712683, "loss": 0.2123764157295227, "mean_token_accuracy": 0.9134354293346405, "num_tokens": 62997896.0, "step": 5107 }, { "entropy": 1.4511745274066925, "epoch": 2.689836756187467, "grad_norm": 0.2614595592021942, "learning_rate": 0.00014700251361858386, "loss": 0.18792091310024261, "mean_token_accuracy": 0.9241390973329544, "num_tokens": 63010232.0, "step": 5108 }, { "entropy": 1.4284895956516266, "epoch": 2.690363349131122, "grad_norm": 0.26647090911865234, "learning_rate": 0.0001469825232934173, "loss": 0.18051902949810028, "mean_token_accuracy": 0.9248806685209274, "num_tokens": 63022568.0, "step": 5109 }, { "entropy": 1.4971970617771149, "epoch": 2.6908899420747763, "grad_norm": 0.2562994062900543, "learning_rate": 0.00014696253077281385, "loss": 0.18611495196819305, "mean_token_accuracy": 0.9216926395893097, "num_tokens": 63034904.0, "step": 5110 }, { "entropy": 1.4280113577842712, "epoch": 2.6914165350184307, "grad_norm": 0.27627092599868774, "learning_rate": 0.00014694253605796042, "loss": 0.19952592253684998, "mean_token_accuracy": 0.9170150011777878, "num_tokens": 63047240.0, "step": 5111 }, { "entropy": 1.38975790143013, "epoch": 2.6919431279620856, "grad_norm": 0.25191327929496765, "learning_rate": 0.00014692253915004393, "loss": 0.16972798109054565, "mean_token_accuracy": 0.9325916618108749, "num_tokens": 63059576.0, "step": 5112 }, { "entropy": 1.4815746545791626, "epoch": 2.69246972090574, "grad_norm": 0.27529120445251465, "learning_rate": 0.00014690254005025148, "loss": 0.1895769238471985, "mean_token_accuracy": 0.9245963543653488, "num_tokens": 63071912.0, "step": 5113 }, { "entropy": 1.3822405934333801, "epoch": 2.6929963138493944, "grad_norm": 0.28958284854888916, "learning_rate": 0.0001468825387597703, "loss": 0.1995624601840973, "mean_token_accuracy": 0.9220484644174576, "num_tokens": 63084248.0, "step": 5114 }, { "entropy": 1.3855730891227722, "epoch": 2.693522906793049, "grad_norm": 0.250946044921875, "learning_rate": 0.0001468625352797878, "loss": 0.1722625494003296, "mean_token_accuracy": 0.9266123324632645, "num_tokens": 63096584.0, "step": 5115 }, { "entropy": 1.4091150760650635, "epoch": 2.6940494997367033, "grad_norm": 0.2849009037017822, "learning_rate": 0.00014684252961149144, "loss": 0.2039925754070282, "mean_token_accuracy": 0.9155628532171249, "num_tokens": 63108920.0, "step": 5116 }, { "entropy": 1.3787662386894226, "epoch": 2.694576092680358, "grad_norm": 0.28099095821380615, "learning_rate": 0.00014682252175606878, "loss": 0.19700410962104797, "mean_token_accuracy": 0.9183400124311447, "num_tokens": 63121256.0, "step": 5117 }, { "entropy": 1.3753366470336914, "epoch": 2.6951026856240126, "grad_norm": 0.2916547656059265, "learning_rate": 0.00014680251171470766, "loss": 0.2051456719636917, "mean_token_accuracy": 0.9148056507110596, "num_tokens": 63133592.0, "step": 5118 }, { "entropy": 1.3619878888130188, "epoch": 2.695629278567667, "grad_norm": 0.27181702852249146, "learning_rate": 0.0001467824994885959, "loss": 0.16953186690807343, "mean_token_accuracy": 0.9321550875902176, "num_tokens": 63145928.0, "step": 5119 }, { "entropy": 1.3182980716228485, "epoch": 2.696155871511322, "grad_norm": 0.2878861427307129, "learning_rate": 0.0001467624850789215, "loss": 0.189472496509552, "mean_token_accuracy": 0.9215676188468933, "num_tokens": 63158264.0, "step": 5120 }, { "entropy": 1.3578261733055115, "epoch": 2.6966824644549763, "grad_norm": 0.29031458497047424, "learning_rate": 0.0001467424684868727, "loss": 0.19785207509994507, "mean_token_accuracy": 0.9179916083812714, "num_tokens": 63170600.0, "step": 5121 }, { "entropy": 1.3003853261470795, "epoch": 2.6972090573986307, "grad_norm": 0.2773895859718323, "learning_rate": 0.00014672244971363768, "loss": 0.18851050734519958, "mean_token_accuracy": 0.9205857366323471, "num_tokens": 63182936.0, "step": 5122 }, { "entropy": 1.348473995923996, "epoch": 2.6977356503422856, "grad_norm": 0.28892043232917786, "learning_rate": 0.00014670242876040483, "loss": 0.19180741906166077, "mean_token_accuracy": 0.9160315543413162, "num_tokens": 63195272.0, "step": 5123 }, { "entropy": 1.2486159205436707, "epoch": 2.69826224328594, "grad_norm": 0.28478798270225525, "learning_rate": 0.0001466824056283627, "loss": 0.199224591255188, "mean_token_accuracy": 0.9219311624765396, "num_tokens": 63207608.0, "step": 5124 }, { "entropy": 1.2535159289836884, "epoch": 2.6987888362295944, "grad_norm": 0.24823498725891113, "learning_rate": 0.00014666238031869994, "loss": 0.1766614466905594, "mean_token_accuracy": 0.9269942939281464, "num_tokens": 63219944.0, "step": 5125 }, { "entropy": 1.2995186150074005, "epoch": 2.6993154291732493, "grad_norm": 0.2622680962085724, "learning_rate": 0.0001466423528326054, "loss": 0.181438148021698, "mean_token_accuracy": 0.9263859242200851, "num_tokens": 63232280.0, "step": 5126 }, { "entropy": 1.3106255531311035, "epoch": 2.6998420221169037, "grad_norm": 0.300825834274292, "learning_rate": 0.00014662232317126788, "loss": 0.1900949627161026, "mean_token_accuracy": 0.919785350561142, "num_tokens": 63244616.0, "step": 5127 }, { "entropy": 1.2831209599971771, "epoch": 2.700368615060558, "grad_norm": 0.2816452085971832, "learning_rate": 0.00014660229133587653, "loss": 0.197813481092453, "mean_token_accuracy": 0.9157050102949142, "num_tokens": 63256952.0, "step": 5128 }, { "entropy": 1.2818153500556946, "epoch": 2.700895208004213, "grad_norm": 0.25588682293891907, "learning_rate": 0.00014658225732762045, "loss": 0.17363756895065308, "mean_token_accuracy": 0.9299523234367371, "num_tokens": 63269288.0, "step": 5129 }, { "entropy": 1.2921530902385712, "epoch": 2.7014218009478674, "grad_norm": 0.2761573791503906, "learning_rate": 0.00014656222114768898, "loss": 0.18385839462280273, "mean_token_accuracy": 0.9249665588140488, "num_tokens": 63281624.0, "step": 5130 }, { "entropy": 1.2621832191944122, "epoch": 2.701948393891522, "grad_norm": 0.2666982412338257, "learning_rate": 0.00014654218279727154, "loss": 0.18635493516921997, "mean_token_accuracy": 0.9211985170841217, "num_tokens": 63293960.0, "step": 5131 }, { "entropy": 1.263505905866623, "epoch": 2.7024749868351763, "grad_norm": 0.27494779229164124, "learning_rate": 0.0001465221422775577, "loss": 0.18919119238853455, "mean_token_accuracy": 0.9211875349283218, "num_tokens": 63306296.0, "step": 5132 }, { "entropy": 1.2421028017997742, "epoch": 2.7030015797788307, "grad_norm": 0.2690388560295105, "learning_rate": 0.00014650209958973713, "loss": 0.19874891638755798, "mean_token_accuracy": 0.9149452149868011, "num_tokens": 63318632.0, "step": 5133 }, { "entropy": 1.3355876505374908, "epoch": 2.7035281727224856, "grad_norm": 0.27606603503227234, "learning_rate": 0.00014648205473499963, "loss": 0.18637162446975708, "mean_token_accuracy": 0.9224206060171127, "num_tokens": 63330968.0, "step": 5134 }, { "entropy": 1.307241529226303, "epoch": 2.70405476566614, "grad_norm": 0.25661829113960266, "learning_rate": 0.0001464620077145352, "loss": 0.18009352684020996, "mean_token_accuracy": 0.9281450062990189, "num_tokens": 63343304.0, "step": 5135 }, { "entropy": 1.2898215353488922, "epoch": 2.7045813586097944, "grad_norm": 0.2869699001312256, "learning_rate": 0.0001464419585295339, "loss": 0.20290739834308624, "mean_token_accuracy": 0.9138100743293762, "num_tokens": 63355640.0, "step": 5136 }, { "entropy": 1.292168915271759, "epoch": 2.7051079515534493, "grad_norm": 0.273143470287323, "learning_rate": 0.00014642190718118593, "loss": 0.19269871711730957, "mean_token_accuracy": 0.9203228056430817, "num_tokens": 63367976.0, "step": 5137 }, { "entropy": 1.3003365695476532, "epoch": 2.7056345444971037, "grad_norm": 0.29047563672065735, "learning_rate": 0.0001464018536706816, "loss": 0.19433802366256714, "mean_token_accuracy": 0.9222328662872314, "num_tokens": 63380312.0, "step": 5138 }, { "entropy": 1.3424124121665955, "epoch": 2.706161137440758, "grad_norm": 0.28726476430892944, "learning_rate": 0.00014638179799921137, "loss": 0.1908145397901535, "mean_token_accuracy": 0.9210158437490463, "num_tokens": 63392648.0, "step": 5139 }, { "entropy": 1.2957504391670227, "epoch": 2.706687730384413, "grad_norm": 0.27413058280944824, "learning_rate": 0.00014636174016796583, "loss": 0.19619929790496826, "mean_token_accuracy": 0.9191281795501709, "num_tokens": 63404984.0, "step": 5140 }, { "entropy": 1.2907661497592926, "epoch": 2.7072143233280674, "grad_norm": 0.2575305700302124, "learning_rate": 0.00014634168017813574, "loss": 0.18570370972156525, "mean_token_accuracy": 0.9248242080211639, "num_tokens": 63417320.0, "step": 5141 }, { "entropy": 1.2979350090026855, "epoch": 2.707740916271722, "grad_norm": 0.25969117879867554, "learning_rate": 0.0001463216180309119, "loss": 0.1702679693698883, "mean_token_accuracy": 0.9241595566272736, "num_tokens": 63429656.0, "step": 5142 }, { "entropy": 1.303638905286789, "epoch": 2.7082675092153767, "grad_norm": 0.304808646440506, "learning_rate": 0.0001463015537274853, "loss": 0.21302911639213562, "mean_token_accuracy": 0.9168027937412262, "num_tokens": 63441992.0, "step": 5143 }, { "entropy": 1.3027910888195038, "epoch": 2.708794102159031, "grad_norm": 0.27357497811317444, "learning_rate": 0.00014628148726904706, "loss": 0.1874362826347351, "mean_token_accuracy": 0.9246872961521149, "num_tokens": 63454328.0, "step": 5144 }, { "entropy": 1.3277390003204346, "epoch": 2.7093206951026856, "grad_norm": 0.3108993470668793, "learning_rate": 0.00014626141865678837, "loss": 0.22254815697669983, "mean_token_accuracy": 0.9114834666252136, "num_tokens": 63466664.0, "step": 5145 }, { "entropy": 1.2865792214870453, "epoch": 2.7098472880463405, "grad_norm": 0.26160353422164917, "learning_rate": 0.0001462413478919006, "loss": 0.18020738661289215, "mean_token_accuracy": 0.9248409420251846, "num_tokens": 63479000.0, "step": 5146 }, { "entropy": 1.2977813482284546, "epoch": 2.710373880989995, "grad_norm": 0.27224621176719666, "learning_rate": 0.0001462212749755752, "loss": 0.17955082654953003, "mean_token_accuracy": 0.921922042965889, "num_tokens": 63491336.0, "step": 5147 }, { "entropy": 1.2977706491947174, "epoch": 2.7109004739336493, "grad_norm": 0.2755237817764282, "learning_rate": 0.00014620119990900384, "loss": 0.1703076809644699, "mean_token_accuracy": 0.9293846786022186, "num_tokens": 63503672.0, "step": 5148 }, { "entropy": 1.288289338350296, "epoch": 2.7114270668773037, "grad_norm": 0.2902235984802246, "learning_rate": 0.00014618112269337827, "loss": 0.20000024139881134, "mean_token_accuracy": 0.9120529741048813, "num_tokens": 63516008.0, "step": 5149 }, { "entropy": 1.3351134061813354, "epoch": 2.711953659820958, "grad_norm": 0.28813472390174866, "learning_rate": 0.0001461610433298903, "loss": 0.19814369082450867, "mean_token_accuracy": 0.9182053804397583, "num_tokens": 63528344.0, "step": 5150 }, { "entropy": 1.3223653137683868, "epoch": 2.712480252764613, "grad_norm": 0.2728074789047241, "learning_rate": 0.000146140961819732, "loss": 0.18013453483581543, "mean_token_accuracy": 0.9253092706203461, "num_tokens": 63540680.0, "step": 5151 }, { "entropy": 1.2829354405403137, "epoch": 2.7130068457082674, "grad_norm": 0.26212215423583984, "learning_rate": 0.00014612087816409533, "loss": 0.17448779940605164, "mean_token_accuracy": 0.9293143302202225, "num_tokens": 63553016.0, "step": 5152 }, { "entropy": 1.282748967409134, "epoch": 2.713533438651922, "grad_norm": 0.27840161323547363, "learning_rate": 0.00014610079236417273, "loss": 0.17790716886520386, "mean_token_accuracy": 0.9291750490665436, "num_tokens": 63565352.0, "step": 5153 }, { "entropy": 1.2521959245204926, "epoch": 2.7140600315955767, "grad_norm": 0.26914894580841064, "learning_rate": 0.00014608070442115648, "loss": 0.19306844472885132, "mean_token_accuracy": 0.9231783151626587, "num_tokens": 63577688.0, "step": 5154 }, { "entropy": 1.3317798674106598, "epoch": 2.714586624539231, "grad_norm": 0.30790823698043823, "learning_rate": 0.00014606061433623913, "loss": 0.19364537298679352, "mean_token_accuracy": 0.9153637439012527, "num_tokens": 63590024.0, "step": 5155 }, { "entropy": 1.3261720836162567, "epoch": 2.7151132174828856, "grad_norm": 0.27726447582244873, "learning_rate": 0.00014604052211061327, "loss": 0.1857507824897766, "mean_token_accuracy": 0.9212318807840347, "num_tokens": 63602360.0, "step": 5156 }, { "entropy": 1.3425556123256683, "epoch": 2.7156398104265405, "grad_norm": 0.28193601965904236, "learning_rate": 0.00014602042774547165, "loss": 0.17949122190475464, "mean_token_accuracy": 0.9272536188364029, "num_tokens": 63614696.0, "step": 5157 }, { "entropy": 1.2356054782867432, "epoch": 2.716166403370195, "grad_norm": 0.29531651735305786, "learning_rate": 0.00014600033124200718, "loss": 0.1958901435136795, "mean_token_accuracy": 0.9217116087675095, "num_tokens": 63627032.0, "step": 5158 }, { "entropy": 1.255002111196518, "epoch": 2.7166929963138493, "grad_norm": 0.28950661420822144, "learning_rate": 0.00014598023260141286, "loss": 0.204793781042099, "mean_token_accuracy": 0.9128590226173401, "num_tokens": 63639368.0, "step": 5159 }, { "entropy": 1.2777542769908905, "epoch": 2.717219589257504, "grad_norm": 0.30766382813453674, "learning_rate": 0.0001459601318248819, "loss": 0.20999419689178467, "mean_token_accuracy": 0.9123559296131134, "num_tokens": 63651704.0, "step": 5160 }, { "entropy": 1.3307510614395142, "epoch": 2.7177461822011586, "grad_norm": 0.2608412206172943, "learning_rate": 0.00014594002891360749, "loss": 0.18216381967067719, "mean_token_accuracy": 0.923665001988411, "num_tokens": 63664040.0, "step": 5161 }, { "entropy": 1.3185522556304932, "epoch": 2.718272775144813, "grad_norm": 0.2726461589336395, "learning_rate": 0.00014591992386878299, "loss": 0.17323972284793854, "mean_token_accuracy": 0.9279865473508835, "num_tokens": 63676376.0, "step": 5162 }, { "entropy": 1.2769018113613129, "epoch": 2.7187993680884674, "grad_norm": 0.26045459508895874, "learning_rate": 0.00014589981669160197, "loss": 0.1939665824174881, "mean_token_accuracy": 0.9193387180566788, "num_tokens": 63688712.0, "step": 5163 }, { "entropy": 1.3116481602191925, "epoch": 2.7193259610321223, "grad_norm": 0.2655951976776123, "learning_rate": 0.00014587970738325808, "loss": 0.19033044576644897, "mean_token_accuracy": 0.920961931347847, "num_tokens": 63701048.0, "step": 5164 }, { "entropy": 1.3548246026039124, "epoch": 2.7198525539757767, "grad_norm": 0.26746660470962524, "learning_rate": 0.00014585959594494514, "loss": 0.19389790296554565, "mean_token_accuracy": 0.9159002602100372, "num_tokens": 63713384.0, "step": 5165 }, { "entropy": 1.270853042602539, "epoch": 2.720379146919431, "grad_norm": 0.2794607877731323, "learning_rate": 0.00014583948237785693, "loss": 0.20356296002864838, "mean_token_accuracy": 0.9151900112628937, "num_tokens": 63725720.0, "step": 5166 }, { "entropy": 1.3171870708465576, "epoch": 2.7209057398630856, "grad_norm": 0.2875237762928009, "learning_rate": 0.00014581936668318755, "loss": 0.20418274402618408, "mean_token_accuracy": 0.916813850402832, "num_tokens": 63738056.0, "step": 5167 }, { "entropy": 1.2941392660140991, "epoch": 2.7214323328067405, "grad_norm": 0.2574351131916046, "learning_rate": 0.00014579924886213118, "loss": 0.1572742909193039, "mean_token_accuracy": 0.9385139495134354, "num_tokens": 63750392.0, "step": 5168 }, { "entropy": 1.3139513731002808, "epoch": 2.721958925750395, "grad_norm": 0.271741658449173, "learning_rate": 0.00014577912891588203, "loss": 0.1982661485671997, "mean_token_accuracy": 0.9115052968263626, "num_tokens": 63762728.0, "step": 5169 }, { "entropy": 1.2726760506629944, "epoch": 2.7224855186940493, "grad_norm": 0.25223416090011597, "learning_rate": 0.00014575900684563452, "loss": 0.1943812072277069, "mean_token_accuracy": 0.9204421192407608, "num_tokens": 63775064.0, "step": 5170 }, { "entropy": 1.372187465429306, "epoch": 2.723012111637704, "grad_norm": 0.2644391655921936, "learning_rate": 0.00014573888265258323, "loss": 0.19780956208705902, "mean_token_accuracy": 0.9187611937522888, "num_tokens": 63787400.0, "step": 5171 }, { "entropy": 1.3559328317642212, "epoch": 2.7235387045813586, "grad_norm": 0.2788529098033905, "learning_rate": 0.00014571875633792277, "loss": 0.20060011744499207, "mean_token_accuracy": 0.9212859869003296, "num_tokens": 63799736.0, "step": 5172 }, { "entropy": 1.309464156627655, "epoch": 2.724065297525013, "grad_norm": 0.280444860458374, "learning_rate": 0.0001456986279028479, "loss": 0.1905817836523056, "mean_token_accuracy": 0.9269229620695114, "num_tokens": 63812072.0, "step": 5173 }, { "entropy": 1.2712817192077637, "epoch": 2.724591890468668, "grad_norm": 0.24894411861896515, "learning_rate": 0.00014567849734855356, "loss": 0.171059712767601, "mean_token_accuracy": 0.9284334927797318, "num_tokens": 63824408.0, "step": 5174 }, { "entropy": 1.2753881216049194, "epoch": 2.7251184834123223, "grad_norm": 0.2422960251569748, "learning_rate": 0.00014565836467623483, "loss": 0.17582392692565918, "mean_token_accuracy": 0.9304329454898834, "num_tokens": 63836744.0, "step": 5175 }, { "entropy": 1.2553509175777435, "epoch": 2.7256450763559767, "grad_norm": 0.29317882657051086, "learning_rate": 0.0001456382298870868, "loss": 0.19796429574489594, "mean_token_accuracy": 0.9160526990890503, "num_tokens": 63849080.0, "step": 5176 }, { "entropy": 1.2531674802303314, "epoch": 2.7261716692996316, "grad_norm": 0.2940789759159088, "learning_rate": 0.00014561809298230474, "loss": 0.1948608160018921, "mean_token_accuracy": 0.9217565655708313, "num_tokens": 63861416.0, "step": 5177 }, { "entropy": 1.2800334095954895, "epoch": 2.726698262243286, "grad_norm": 0.27374762296676636, "learning_rate": 0.00014559795396308414, "loss": 0.1936039924621582, "mean_token_accuracy": 0.9136587381362915, "num_tokens": 63873752.0, "step": 5178 }, { "entropy": 1.2157056629657745, "epoch": 2.7272248551869405, "grad_norm": 0.25958263874053955, "learning_rate": 0.0001455778128306205, "loss": 0.1764679104089737, "mean_token_accuracy": 0.9242573529481888, "num_tokens": 63886088.0, "step": 5179 }, { "entropy": 1.316890001296997, "epoch": 2.727751448130595, "grad_norm": 0.26737043261528015, "learning_rate": 0.00014555766958610945, "loss": 0.1727948784828186, "mean_token_accuracy": 0.9259275048971176, "num_tokens": 63898424.0, "step": 5180 }, { "entropy": 1.2939126789569855, "epoch": 2.7282780410742498, "grad_norm": 0.2589419484138489, "learning_rate": 0.0001455375242307468, "loss": 0.19002790749073029, "mean_token_accuracy": 0.9219155609607697, "num_tokens": 63910760.0, "step": 5181 }, { "entropy": 1.2866698801517487, "epoch": 2.728804634017904, "grad_norm": 0.2805895507335663, "learning_rate": 0.00014551737676572846, "loss": 0.1931273192167282, "mean_token_accuracy": 0.9201782494783401, "num_tokens": 63923096.0, "step": 5182 }, { "entropy": 1.3028650879859924, "epoch": 2.7293312269615586, "grad_norm": 0.31638723611831665, "learning_rate": 0.00014549722719225047, "loss": 0.18288934230804443, "mean_token_accuracy": 0.9220278561115265, "num_tokens": 63935432.0, "step": 5183 }, { "entropy": 1.324157953262329, "epoch": 2.729857819905213, "grad_norm": 0.2694256007671356, "learning_rate": 0.00014547707551150908, "loss": 0.1794993281364441, "mean_token_accuracy": 0.9276534020900726, "num_tokens": 63947768.0, "step": 5184 }, { "entropy": 1.204854130744934, "epoch": 2.730384412848868, "grad_norm": 0.2793176770210266, "learning_rate": 0.00014545692172470041, "loss": 0.18844300508499146, "mean_token_accuracy": 0.9218170195817947, "num_tokens": 63960104.0, "step": 5185 }, { "entropy": 1.2477740049362183, "epoch": 2.7309110057925223, "grad_norm": 0.2856691777706146, "learning_rate": 0.00014543676583302095, "loss": 0.2099856734275818, "mean_token_accuracy": 0.9131463170051575, "num_tokens": 63972440.0, "step": 5186 }, { "entropy": 1.255644053220749, "epoch": 2.7314375987361768, "grad_norm": 0.2527347803115845, "learning_rate": 0.00014541660783766723, "loss": 0.1695612072944641, "mean_token_accuracy": 0.9271181374788284, "num_tokens": 63984776.0, "step": 5187 }, { "entropy": 1.3577595055103302, "epoch": 2.7319641916798316, "grad_norm": 0.2855788469314575, "learning_rate": 0.00014539644773983599, "loss": 0.19383448362350464, "mean_token_accuracy": 0.9202312529087067, "num_tokens": 63997112.0, "step": 5188 }, { "entropy": 1.3106902539730072, "epoch": 2.732490784623486, "grad_norm": 0.2907700836658478, "learning_rate": 0.00014537628554072392, "loss": 0.1855756938457489, "mean_token_accuracy": 0.9252744168043137, "num_tokens": 64009448.0, "step": 5189 }, { "entropy": 1.2726895809173584, "epoch": 2.7330173775671405, "grad_norm": 0.26627859473228455, "learning_rate": 0.000145356121241528, "loss": 0.17433853447437286, "mean_token_accuracy": 0.9330893158912659, "num_tokens": 64021784.0, "step": 5190 }, { "entropy": 1.2664414644241333, "epoch": 2.7335439705107953, "grad_norm": 0.31092652678489685, "learning_rate": 0.0001453359548434452, "loss": 0.20331533253192902, "mean_token_accuracy": 0.9178122878074646, "num_tokens": 64034120.0, "step": 5191 }, { "entropy": 1.3027536571025848, "epoch": 2.7340705634544498, "grad_norm": 0.2834033966064453, "learning_rate": 0.0001453157863476727, "loss": 0.2043476402759552, "mean_token_accuracy": 0.9179918766021729, "num_tokens": 64046456.0, "step": 5192 }, { "entropy": 1.2744874060153961, "epoch": 2.734597156398104, "grad_norm": 0.25400489568710327, "learning_rate": 0.0001452956157554078, "loss": 0.18056827783584595, "mean_token_accuracy": 0.9235711693763733, "num_tokens": 64058792.0, "step": 5193 }, { "entropy": 1.3080530762672424, "epoch": 2.735123749341759, "grad_norm": 0.26861700415611267, "learning_rate": 0.00014527544306784792, "loss": 0.18566924333572388, "mean_token_accuracy": 0.9226769655942917, "num_tokens": 64071128.0, "step": 5194 }, { "entropy": 1.2273122072219849, "epoch": 2.7356503422854135, "grad_norm": 0.29266297817230225, "learning_rate": 0.00014525526828619063, "loss": 0.20136258006095886, "mean_token_accuracy": 0.9192598909139633, "num_tokens": 64083464.0, "step": 5195 }, { "entropy": 1.2667721211910248, "epoch": 2.736176935229068, "grad_norm": 0.2782294750213623, "learning_rate": 0.00014523509141163349, "loss": 0.19713616371154785, "mean_token_accuracy": 0.9188579767942429, "num_tokens": 64095800.0, "step": 5196 }, { "entropy": 1.2403879165649414, "epoch": 2.7367035281727223, "grad_norm": 0.25267916917800903, "learning_rate": 0.00014521491244537434, "loss": 0.1698072850704193, "mean_token_accuracy": 0.9281718283891678, "num_tokens": 64108136.0, "step": 5197 }, { "entropy": 1.288205772638321, "epoch": 2.737230121116377, "grad_norm": 0.2854776680469513, "learning_rate": 0.0001451947313886111, "loss": 0.19052140414714813, "mean_token_accuracy": 0.9202392548322678, "num_tokens": 64120472.0, "step": 5198 }, { "entropy": 1.2585653364658356, "epoch": 2.7377567140600316, "grad_norm": 0.2774556279182434, "learning_rate": 0.0001451745482425418, "loss": 0.18510374426841736, "mean_token_accuracy": 0.9226521104574203, "num_tokens": 64132808.0, "step": 5199 }, { "entropy": 1.2777175903320312, "epoch": 2.738283307003686, "grad_norm": 0.2825121283531189, "learning_rate": 0.0001451543630083646, "loss": 0.18815097212791443, "mean_token_accuracy": 0.92147396504879, "num_tokens": 64145144.0, "step": 5200 }, { "entropy": 1.2806333005428314, "epoch": 2.7388098999473405, "grad_norm": 0.265458881855011, "learning_rate": 0.0001451341756872777, "loss": 0.1735052764415741, "mean_token_accuracy": 0.9319272637367249, "num_tokens": 64157480.0, "step": 5201 }, { "entropy": 1.232534110546112, "epoch": 2.7393364928909953, "grad_norm": 0.26001816987991333, "learning_rate": 0.00014511398628047964, "loss": 0.18147748708724976, "mean_token_accuracy": 0.9249249398708344, "num_tokens": 64169816.0, "step": 5202 }, { "entropy": 1.2178304493427277, "epoch": 2.7398630858346498, "grad_norm": 0.25026735663414, "learning_rate": 0.00014509379478916883, "loss": 0.18916335701942444, "mean_token_accuracy": 0.9198585599660873, "num_tokens": 64182152.0, "step": 5203 }, { "entropy": 1.2706682085990906, "epoch": 2.740389678778304, "grad_norm": 0.3009374737739563, "learning_rate": 0.00014507360121454398, "loss": 0.21226197481155396, "mean_token_accuracy": 0.914648026227951, "num_tokens": 64194488.0, "step": 5204 }, { "entropy": 1.2476151287555695, "epoch": 2.740916271721959, "grad_norm": 0.2885046899318695, "learning_rate": 0.00014505340555780383, "loss": 0.20312687754631042, "mean_token_accuracy": 0.9144037365913391, "num_tokens": 64206824.0, "step": 5205 }, { "entropy": 1.2514026165008545, "epoch": 2.7414428646656135, "grad_norm": 0.2752453088760376, "learning_rate": 0.00014503320782014735, "loss": 0.20632526278495789, "mean_token_accuracy": 0.9120770543813705, "num_tokens": 64219160.0, "step": 5206 }, { "entropy": 1.1842446029186249, "epoch": 2.741969457609268, "grad_norm": 0.24866744875907898, "learning_rate": 0.00014501300800277345, "loss": 0.163893461227417, "mean_token_accuracy": 0.9325317144393921, "num_tokens": 64231496.0, "step": 5207 }, { "entropy": 1.2263388633728027, "epoch": 2.742496050552923, "grad_norm": 0.285268634557724, "learning_rate": 0.00014499280610688137, "loss": 0.2103516310453415, "mean_token_accuracy": 0.9175826460123062, "num_tokens": 64243832.0, "step": 5208 }, { "entropy": 1.2222225368022919, "epoch": 2.743022643496577, "grad_norm": 0.26084497570991516, "learning_rate": 0.00014497260213367036, "loss": 0.1803930550813675, "mean_token_accuracy": 0.9286944568157196, "num_tokens": 64256168.0, "step": 5209 }, { "entropy": 1.2412607073783875, "epoch": 2.7435492364402316, "grad_norm": 0.25516054034233093, "learning_rate": 0.00014495239608433978, "loss": 0.17983819544315338, "mean_token_accuracy": 0.9248096346855164, "num_tokens": 64268504.0, "step": 5210 }, { "entropy": 1.2084096372127533, "epoch": 2.7440758293838865, "grad_norm": 0.24899202585220337, "learning_rate": 0.00014493218796008913, "loss": 0.18748557567596436, "mean_token_accuracy": 0.9227083474397659, "num_tokens": 64280840.0, "step": 5211 }, { "entropy": 1.2613386809825897, "epoch": 2.744602422327541, "grad_norm": 0.26508280634880066, "learning_rate": 0.0001449119777621181, "loss": 0.18772578239440918, "mean_token_accuracy": 0.9219543635845184, "num_tokens": 64293176.0, "step": 5212 }, { "entropy": 1.255203664302826, "epoch": 2.7451290152711953, "grad_norm": 0.2667011320590973, "learning_rate": 0.00014489176549162646, "loss": 0.1858472377061844, "mean_token_accuracy": 0.924461156129837, "num_tokens": 64305512.0, "step": 5213 }, { "entropy": 1.2351004779338837, "epoch": 2.7456556082148498, "grad_norm": 0.280694842338562, "learning_rate": 0.00014487155114981405, "loss": 0.1888059377670288, "mean_token_accuracy": 0.9221524894237518, "num_tokens": 64317848.0, "step": 5214 }, { "entropy": 1.2104078531265259, "epoch": 2.746182201158504, "grad_norm": 0.26034653186798096, "learning_rate": 0.00014485133473788087, "loss": 0.19770097732543945, "mean_token_accuracy": 0.9191710352897644, "num_tokens": 64330184.0, "step": 5215 }, { "entropy": 1.1654371917247772, "epoch": 2.746708794102159, "grad_norm": 0.25307705998420715, "learning_rate": 0.0001448311162570271, "loss": 0.18185806274414062, "mean_token_accuracy": 0.9264684021472931, "num_tokens": 64342520.0, "step": 5216 }, { "entropy": 1.1659926176071167, "epoch": 2.7472353870458135, "grad_norm": 0.25822415947914124, "learning_rate": 0.00014481089570845298, "loss": 0.1906038373708725, "mean_token_accuracy": 0.9225552678108215, "num_tokens": 64354856.0, "step": 5217 }, { "entropy": 1.1801254749298096, "epoch": 2.747761979989468, "grad_norm": 0.27742892503738403, "learning_rate": 0.00014479067309335888, "loss": 0.18619799613952637, "mean_token_accuracy": 0.9215237945318222, "num_tokens": 64367192.0, "step": 5218 }, { "entropy": 1.1851786077022552, "epoch": 2.748288572933123, "grad_norm": 0.2780286371707916, "learning_rate": 0.00014477044841294527, "loss": 0.19493329524993896, "mean_token_accuracy": 0.9193734228610992, "num_tokens": 64379528.0, "step": 5219 }, { "entropy": 1.233342856168747, "epoch": 2.748815165876777, "grad_norm": 0.28098252415657043, "learning_rate": 0.00014475022166841281, "loss": 0.19491320848464966, "mean_token_accuracy": 0.9158923923969269, "num_tokens": 64391864.0, "step": 5220 }, { "entropy": 1.2095706462860107, "epoch": 2.7493417588204316, "grad_norm": 0.2857399582862854, "learning_rate": 0.00014472999286096222, "loss": 0.2000798135995865, "mean_token_accuracy": 0.9185933470726013, "num_tokens": 64404200.0, "step": 5221 }, { "entropy": 1.1988272964954376, "epoch": 2.7498683517640865, "grad_norm": 0.24530266225337982, "learning_rate": 0.00014470976199179437, "loss": 0.17582175135612488, "mean_token_accuracy": 0.9265767633914948, "num_tokens": 64416536.0, "step": 5222 }, { "entropy": 1.1718643307685852, "epoch": 2.750394944707741, "grad_norm": 0.2735878527164459, "learning_rate": 0.00014468952906211024, "loss": 0.19718340039253235, "mean_token_accuracy": 0.9156841188669205, "num_tokens": 64428872.0, "step": 5223 }, { "entropy": 1.1433568000793457, "epoch": 2.7509215376513954, "grad_norm": 0.2572272717952728, "learning_rate": 0.00014466929407311102, "loss": 0.17076869308948517, "mean_token_accuracy": 0.9290028512477875, "num_tokens": 64441208.0, "step": 5224 }, { "entropy": 1.1182581186294556, "epoch": 2.7514481305950502, "grad_norm": 0.2657313048839569, "learning_rate": 0.0001446490570259978, "loss": 0.18352721631526947, "mean_token_accuracy": 0.9193586707115173, "num_tokens": 64453544.0, "step": 5225 }, { "entropy": 1.2004330456256866, "epoch": 2.7519747235387046, "grad_norm": 0.29233238101005554, "learning_rate": 0.00014462881792197207, "loss": 0.19094334542751312, "mean_token_accuracy": 0.9189015328884125, "num_tokens": 64465880.0, "step": 5226 }, { "entropy": 1.1328704953193665, "epoch": 2.752501316482359, "grad_norm": 0.302139550447464, "learning_rate": 0.00014460857676223523, "loss": 0.19258467853069305, "mean_token_accuracy": 0.9215465188026428, "num_tokens": 64478216.0, "step": 5227 }, { "entropy": 1.1518427729606628, "epoch": 2.753027909426014, "grad_norm": 0.30873894691467285, "learning_rate": 0.00014458833354798892, "loss": 0.21177682280540466, "mean_token_accuracy": 0.9149043411016464, "num_tokens": 64490552.0, "step": 5228 }, { "entropy": 1.1240712106227875, "epoch": 2.7535545023696684, "grad_norm": 0.2717989385128021, "learning_rate": 0.00014456808828043483, "loss": 0.19752712547779083, "mean_token_accuracy": 0.9208426624536514, "num_tokens": 64502888.0, "step": 5229 }, { "entropy": 1.1326690316200256, "epoch": 2.754081095313323, "grad_norm": 0.3072580099105835, "learning_rate": 0.0001445478409607748, "loss": 0.21544644236564636, "mean_token_accuracy": 0.9124970734119415, "num_tokens": 64515224.0, "step": 5230 }, { "entropy": 1.1086510717868805, "epoch": 2.754607688256977, "grad_norm": 0.27127352356910706, "learning_rate": 0.0001445275915902108, "loss": 0.17774805426597595, "mean_token_accuracy": 0.9219206869602203, "num_tokens": 64527560.0, "step": 5231 }, { "entropy": 1.1655531525611877, "epoch": 2.7551342812006316, "grad_norm": 0.2691557705402374, "learning_rate": 0.00014450734016994496, "loss": 0.17809565365314484, "mean_token_accuracy": 0.9255595207214355, "num_tokens": 64539896.0, "step": 5232 }, { "entropy": 1.1543531119823456, "epoch": 2.7556608741442865, "grad_norm": 0.27001041173934937, "learning_rate": 0.00014448708670117947, "loss": 0.1864895522594452, "mean_token_accuracy": 0.9234678447246552, "num_tokens": 64552232.0, "step": 5233 }, { "entropy": 1.1790067255496979, "epoch": 2.756187467087941, "grad_norm": 0.26234033703804016, "learning_rate": 0.00014446683118511663, "loss": 0.18123625218868256, "mean_token_accuracy": 0.9251542240381241, "num_tokens": 64564568.0, "step": 5234 }, { "entropy": 1.2072664499282837, "epoch": 2.7567140600315954, "grad_norm": 0.2714584767818451, "learning_rate": 0.00014444657362295893, "loss": 0.1822567880153656, "mean_token_accuracy": 0.9235909283161163, "num_tokens": 64576904.0, "step": 5235 }, { "entropy": 1.2083474397659302, "epoch": 2.7572406529752502, "grad_norm": 0.28527194261550903, "learning_rate": 0.00014442631401590889, "loss": 0.18012532591819763, "mean_token_accuracy": 0.92564357817173, "num_tokens": 64589240.0, "step": 5236 }, { "entropy": 1.2130491435527802, "epoch": 2.7577672459189047, "grad_norm": 0.28817492723464966, "learning_rate": 0.00014440605236516927, "loss": 0.2071560025215149, "mean_token_accuracy": 0.9179072976112366, "num_tokens": 64601576.0, "step": 5237 }, { "entropy": 1.1850566864013672, "epoch": 2.758293838862559, "grad_norm": 0.27280986309051514, "learning_rate": 0.00014438578867194282, "loss": 0.19194592535495758, "mean_token_accuracy": 0.9210992604494095, "num_tokens": 64613912.0, "step": 5238 }, { "entropy": 1.1494078934192657, "epoch": 2.758820431806214, "grad_norm": 0.25719964504241943, "learning_rate": 0.00014436552293743254, "loss": 0.18231096863746643, "mean_token_accuracy": 0.9223944246768951, "num_tokens": 64626248.0, "step": 5239 }, { "entropy": 1.2233496606349945, "epoch": 2.7593470247498684, "grad_norm": 0.2691393494606018, "learning_rate": 0.00014434525516284145, "loss": 0.19390058517456055, "mean_token_accuracy": 0.9192745685577393, "num_tokens": 64638584.0, "step": 5240 }, { "entropy": 1.2024221122264862, "epoch": 2.759873617693523, "grad_norm": 0.27692461013793945, "learning_rate": 0.00014432498534937274, "loss": 0.20155805349349976, "mean_token_accuracy": 0.9162195473909378, "num_tokens": 64650920.0, "step": 5241 }, { "entropy": 1.2103087902069092, "epoch": 2.7604002106371777, "grad_norm": 0.26054757833480835, "learning_rate": 0.00014430471349822973, "loss": 0.1835065633058548, "mean_token_accuracy": 0.9229078888893127, "num_tokens": 64663256.0, "step": 5242 }, { "entropy": 1.2184035181999207, "epoch": 2.760926803580832, "grad_norm": 0.2641240358352661, "learning_rate": 0.00014428443961061582, "loss": 0.1787245273590088, "mean_token_accuracy": 0.927379846572876, "num_tokens": 64675592.0, "step": 5243 }, { "entropy": 1.2011678516864777, "epoch": 2.7614533965244865, "grad_norm": 0.27148598432540894, "learning_rate": 0.00014426416368773455, "loss": 0.18567071855068207, "mean_token_accuracy": 0.9205454736948013, "num_tokens": 64687928.0, "step": 5244 }, { "entropy": 1.216088354587555, "epoch": 2.7619799894681414, "grad_norm": 0.26671719551086426, "learning_rate": 0.00014424388573078958, "loss": 0.20205147564411163, "mean_token_accuracy": 0.9125513881444931, "num_tokens": 64700264.0, "step": 5245 }, { "entropy": 1.1836239397525787, "epoch": 2.762506582411796, "grad_norm": 0.27321091294288635, "learning_rate": 0.00014422360574098468, "loss": 0.1828138530254364, "mean_token_accuracy": 0.9238127917051315, "num_tokens": 64712600.0, "step": 5246 }, { "entropy": 1.245295375585556, "epoch": 2.7630331753554502, "grad_norm": 0.28472384810447693, "learning_rate": 0.00014420332371952382, "loss": 0.18590515851974487, "mean_token_accuracy": 0.920741856098175, "num_tokens": 64724936.0, "step": 5247 }, { "entropy": 1.2197468280792236, "epoch": 2.7635597682991047, "grad_norm": 0.28858470916748047, "learning_rate": 0.00014418303966761095, "loss": 0.18920327723026276, "mean_token_accuracy": 0.9211139678955078, "num_tokens": 64737272.0, "step": 5248 }, { "entropy": 1.238138347864151, "epoch": 2.764086361242759, "grad_norm": 0.28883299231529236, "learning_rate": 0.00014416275358645027, "loss": 0.19570133090019226, "mean_token_accuracy": 0.9165759533643723, "num_tokens": 64749608.0, "step": 5249 }, { "entropy": 1.1910213232040405, "epoch": 2.764612954186414, "grad_norm": 0.2884749472141266, "learning_rate": 0.000144142465477246, "loss": 0.19064441323280334, "mean_token_accuracy": 0.9157634079456329, "num_tokens": 64761944.0, "step": 5250 }, { "entropy": 1.2231583893299103, "epoch": 2.7651395471300684, "grad_norm": 0.2951197922229767, "learning_rate": 0.00014412217534120255, "loss": 0.20204216241836548, "mean_token_accuracy": 0.9111807197332382, "num_tokens": 64774280.0, "step": 5251 }, { "entropy": 1.2133639454841614, "epoch": 2.765666140073723, "grad_norm": 0.2701243460178375, "learning_rate": 0.0001441018831795245, "loss": 0.17370574176311493, "mean_token_accuracy": 0.9307438880205154, "num_tokens": 64786616.0, "step": 5252 }, { "entropy": 1.2652662694454193, "epoch": 2.7661927330173777, "grad_norm": 0.29625698924064636, "learning_rate": 0.00014408158899341633, "loss": 0.1891971081495285, "mean_token_accuracy": 0.9214306026697159, "num_tokens": 64798952.0, "step": 5253 }, { "entropy": 1.2378207743167877, "epoch": 2.766719325961032, "grad_norm": 0.28450554609298706, "learning_rate": 0.0001440612927840829, "loss": 0.19953784346580505, "mean_token_accuracy": 0.9168573915958405, "num_tokens": 64811288.0, "step": 5254 }, { "entropy": 1.22379869222641, "epoch": 2.7672459189046865, "grad_norm": 0.2879558205604553, "learning_rate": 0.000144040994552729, "loss": 0.18986776471138, "mean_token_accuracy": 0.9215910136699677, "num_tokens": 64823624.0, "step": 5255 }, { "entropy": 1.2522724568843842, "epoch": 2.7677725118483414, "grad_norm": 0.2794259190559387, "learning_rate": 0.00014402069430055972, "loss": 0.1900891661643982, "mean_token_accuracy": 0.9175702631473541, "num_tokens": 64835960.0, "step": 5256 }, { "entropy": 1.2027116417884827, "epoch": 2.768299104791996, "grad_norm": 0.25514569878578186, "learning_rate": 0.00014400039202878007, "loss": 0.1653316169977188, "mean_token_accuracy": 0.9280052781105042, "num_tokens": 64848296.0, "step": 5257 }, { "entropy": 1.2198582589626312, "epoch": 2.7688256977356502, "grad_norm": 0.2743576765060425, "learning_rate": 0.00014398008773859535, "loss": 0.18544761836528778, "mean_token_accuracy": 0.9242594391107559, "num_tokens": 64860632.0, "step": 5258 }, { "entropy": 1.2221347987651825, "epoch": 2.769352290679305, "grad_norm": 0.2561204135417938, "learning_rate": 0.00014395978143121082, "loss": 0.18239974975585938, "mean_token_accuracy": 0.9222259372472763, "num_tokens": 64872968.0, "step": 5259 }, { "entropy": 1.1785187125205994, "epoch": 2.7698788836229595, "grad_norm": 0.25451043248176575, "learning_rate": 0.00014393947310783204, "loss": 0.1851981282234192, "mean_token_accuracy": 0.9230374693870544, "num_tokens": 64885304.0, "step": 5260 }, { "entropy": 1.238612949848175, "epoch": 2.770405476566614, "grad_norm": 0.27332982420921326, "learning_rate": 0.00014391916276966453, "loss": 0.18217436969280243, "mean_token_accuracy": 0.9256610721349716, "num_tokens": 64897640.0, "step": 5261 }, { "entropy": 1.2903965413570404, "epoch": 2.770932069510269, "grad_norm": 0.28146326541900635, "learning_rate": 0.000143898850417914, "loss": 0.19812659919261932, "mean_token_accuracy": 0.9138201922178268, "num_tokens": 64909976.0, "step": 5262 }, { "entropy": 1.2601101100444794, "epoch": 2.7714586624539232, "grad_norm": 0.2966877818107605, "learning_rate": 0.00014387853605378635, "loss": 0.19086399674415588, "mean_token_accuracy": 0.9252540320158005, "num_tokens": 64922312.0, "step": 5263 }, { "entropy": 1.269772619009018, "epoch": 2.7719852553975777, "grad_norm": 0.2694266438484192, "learning_rate": 0.00014385821967848744, "loss": 0.1787468045949936, "mean_token_accuracy": 0.9245084077119827, "num_tokens": 64934648.0, "step": 5264 }, { "entropy": 1.2981602251529694, "epoch": 2.772511848341232, "grad_norm": 0.308047354221344, "learning_rate": 0.0001438379012932234, "loss": 0.2297125905752182, "mean_token_accuracy": 0.9067529439926147, "num_tokens": 64946984.0, "step": 5265 }, { "entropy": 1.2986539602279663, "epoch": 2.7730384412848865, "grad_norm": 0.27238884568214417, "learning_rate": 0.00014381758089920037, "loss": 0.18589141964912415, "mean_token_accuracy": 0.9196806848049164, "num_tokens": 64959320.0, "step": 5266 }, { "entropy": 1.2592036128044128, "epoch": 2.7735650342285414, "grad_norm": 0.2565900683403015, "learning_rate": 0.00014379725849762468, "loss": 0.17390495538711548, "mean_token_accuracy": 0.9275496900081635, "num_tokens": 64971656.0, "step": 5267 }, { "entropy": 1.3076839447021484, "epoch": 2.774091627172196, "grad_norm": 0.27231037616729736, "learning_rate": 0.00014377693408970267, "loss": 0.1904066503047943, "mean_token_accuracy": 0.9181473851203918, "num_tokens": 64983992.0, "step": 5268 }, { "entropy": 1.347479671239853, "epoch": 2.7746182201158502, "grad_norm": 0.2822572588920593, "learning_rate": 0.00014375660767664103, "loss": 0.19602887332439423, "mean_token_accuracy": 0.9184332489967346, "num_tokens": 64996328.0, "step": 5269 }, { "entropy": 1.2493623495101929, "epoch": 2.775144813059505, "grad_norm": 0.2655910551548004, "learning_rate": 0.0001437362792596463, "loss": 0.19221758842468262, "mean_token_accuracy": 0.9155505746603012, "num_tokens": 65008664.0, "step": 5270 }, { "entropy": 1.3480267524719238, "epoch": 2.7756714060031595, "grad_norm": 0.28599438071250916, "learning_rate": 0.0001437159488399253, "loss": 0.19499412178993225, "mean_token_accuracy": 0.9208921939134598, "num_tokens": 65021000.0, "step": 5271 }, { "entropy": 1.2931790351867676, "epoch": 2.776197998946814, "grad_norm": 0.25337666273117065, "learning_rate": 0.00014369561641868497, "loss": 0.19652974605560303, "mean_token_accuracy": 0.9209015667438507, "num_tokens": 65033336.0, "step": 5272 }, { "entropy": 1.280663251876831, "epoch": 2.776724591890469, "grad_norm": 0.26555371284484863, "learning_rate": 0.00014367528199713225, "loss": 0.1882692575454712, "mean_token_accuracy": 0.9232436418533325, "num_tokens": 65045672.0, "step": 5273 }, { "entropy": 1.3029052913188934, "epoch": 2.7772511848341233, "grad_norm": 0.28663209080696106, "learning_rate": 0.0001436549455764743, "loss": 0.2037314623594284, "mean_token_accuracy": 0.9130341559648514, "num_tokens": 65058008.0, "step": 5274 }, { "entropy": 1.3463798463344574, "epoch": 2.7777777777777777, "grad_norm": 0.29982322454452515, "learning_rate": 0.00014363460715791838, "loss": 0.20301522314548492, "mean_token_accuracy": 0.9173043817281723, "num_tokens": 65070344.0, "step": 5275 }, { "entropy": 1.3196207582950592, "epoch": 2.7783043707214325, "grad_norm": 0.2660505175590515, "learning_rate": 0.00014361426674267192, "loss": 0.19917218387126923, "mean_token_accuracy": 0.917966678738594, "num_tokens": 65082680.0, "step": 5276 }, { "entropy": 1.2840626537799835, "epoch": 2.778830963665087, "grad_norm": 0.26385557651519775, "learning_rate": 0.00014359392433194233, "loss": 0.17794926464557648, "mean_token_accuracy": 0.9250075668096542, "num_tokens": 65095016.0, "step": 5277 }, { "entropy": 1.314213752746582, "epoch": 2.7793575566087414, "grad_norm": 0.28997546434402466, "learning_rate": 0.00014357357992693726, "loss": 0.1899823695421219, "mean_token_accuracy": 0.9185740947723389, "num_tokens": 65107352.0, "step": 5278 }, { "entropy": 1.3273931741714478, "epoch": 2.7798841495523963, "grad_norm": 0.31028249859809875, "learning_rate": 0.00014355323352886444, "loss": 0.18756736814975739, "mean_token_accuracy": 0.9197654277086258, "num_tokens": 65119688.0, "step": 5279 }, { "entropy": 1.2950712740421295, "epoch": 2.7804107424960507, "grad_norm": 0.27508464455604553, "learning_rate": 0.0001435328851389317, "loss": 0.19255675375461578, "mean_token_accuracy": 0.9202096164226532, "num_tokens": 65132024.0, "step": 5280 }, { "entropy": 1.2744563817977905, "epoch": 2.780937335439705, "grad_norm": 0.26312628388404846, "learning_rate": 0.000143512534758347, "loss": 0.18344777822494507, "mean_token_accuracy": 0.9259104430675507, "num_tokens": 65144360.0, "step": 5281 }, { "entropy": 1.2877683341503143, "epoch": 2.7814639283833595, "grad_norm": 0.2613600790500641, "learning_rate": 0.00014349218238831845, "loss": 0.17790953814983368, "mean_token_accuracy": 0.9296992272138596, "num_tokens": 65156696.0, "step": 5282 }, { "entropy": 1.2867728471755981, "epoch": 2.781990521327014, "grad_norm": 0.2650804817676544, "learning_rate": 0.00014347182803005427, "loss": 0.1828990876674652, "mean_token_accuracy": 0.9258298873901367, "num_tokens": 65169032.0, "step": 5283 }, { "entropy": 1.2489764094352722, "epoch": 2.782517114270669, "grad_norm": 0.2658465504646301, "learning_rate": 0.0001434514716847627, "loss": 0.18873544037342072, "mean_token_accuracy": 0.9171571433544159, "num_tokens": 65181368.0, "step": 5284 }, { "entropy": 1.2812611758708954, "epoch": 2.7830437072143233, "grad_norm": 0.2830650508403778, "learning_rate": 0.00014343111335365222, "loss": 0.18863148987293243, "mean_token_accuracy": 0.9229893535375595, "num_tokens": 65193704.0, "step": 5285 }, { "entropy": 1.2569757997989655, "epoch": 2.7835703001579777, "grad_norm": 0.2600972652435303, "learning_rate": 0.00014341075303793142, "loss": 0.1723325252532959, "mean_token_accuracy": 0.9290564060211182, "num_tokens": 65206040.0, "step": 5286 }, { "entropy": 1.27193483710289, "epoch": 2.7840968931016326, "grad_norm": 0.2815724015235901, "learning_rate": 0.00014339039073880895, "loss": 0.18959340453147888, "mean_token_accuracy": 0.9206994324922562, "num_tokens": 65218376.0, "step": 5287 }, { "entropy": 1.2226817309856415, "epoch": 2.784623486045287, "grad_norm": 0.2693398892879486, "learning_rate": 0.0001433700264574936, "loss": 0.19547715783119202, "mean_token_accuracy": 0.9208534508943558, "num_tokens": 65230712.0, "step": 5288 }, { "entropy": 1.2494825720787048, "epoch": 2.7851500789889414, "grad_norm": 0.2742237150669098, "learning_rate": 0.00014334966019519425, "loss": 0.18227458000183105, "mean_token_accuracy": 0.9274836480617523, "num_tokens": 65243048.0, "step": 5289 }, { "entropy": 1.260303258895874, "epoch": 2.7856766719325963, "grad_norm": 0.28628888726234436, "learning_rate": 0.00014332929195311997, "loss": 0.20284047722816467, "mean_token_accuracy": 0.9181239157915115, "num_tokens": 65255384.0, "step": 5290 }, { "entropy": 1.2684848606586456, "epoch": 2.7862032648762507, "grad_norm": 0.27382534742355347, "learning_rate": 0.00014330892173247984, "loss": 0.18891406059265137, "mean_token_accuracy": 0.9240432977676392, "num_tokens": 65267720.0, "step": 5291 }, { "entropy": 1.222090721130371, "epoch": 2.786729857819905, "grad_norm": 0.2744442820549011, "learning_rate": 0.0001432885495344832, "loss": 0.18809741735458374, "mean_token_accuracy": 0.9243640154600143, "num_tokens": 65280056.0, "step": 5292 }, { "entropy": 1.2474882304668427, "epoch": 2.78725645076356, "grad_norm": 0.27189698815345764, "learning_rate": 0.00014326817536033942, "loss": 0.18525537848472595, "mean_token_accuracy": 0.9237808287143707, "num_tokens": 65292392.0, "step": 5293 }, { "entropy": 1.2759239077568054, "epoch": 2.7877830437072144, "grad_norm": 0.2819172143936157, "learning_rate": 0.00014324779921125796, "loss": 0.20205055177211761, "mean_token_accuracy": 0.9156257063150406, "num_tokens": 65304728.0, "step": 5294 }, { "entropy": 1.273671805858612, "epoch": 2.788309636650869, "grad_norm": 0.27508002519607544, "learning_rate": 0.0001432274210884484, "loss": 0.19093528389930725, "mean_token_accuracy": 0.9219478368759155, "num_tokens": 65317064.0, "step": 5295 }, { "entropy": 1.3292940258979797, "epoch": 2.7888362295945237, "grad_norm": 0.28093087673187256, "learning_rate": 0.00014320704099312053, "loss": 0.2062903195619583, "mean_token_accuracy": 0.9147017002105713, "num_tokens": 65329400.0, "step": 5296 }, { "entropy": 1.2952646017074585, "epoch": 2.789362822538178, "grad_norm": 0.28177374601364136, "learning_rate": 0.00014318665892648424, "loss": 0.20459504425525665, "mean_token_accuracy": 0.9161693304777145, "num_tokens": 65341736.0, "step": 5297 }, { "entropy": 1.304824024438858, "epoch": 2.7898894154818326, "grad_norm": 0.2694205045700073, "learning_rate": 0.00014316627488974938, "loss": 0.1909191906452179, "mean_token_accuracy": 0.9177864342927933, "num_tokens": 65354072.0, "step": 5298 }, { "entropy": 1.3001328110694885, "epoch": 2.790416008425487, "grad_norm": 0.2765825390815735, "learning_rate": 0.00014314588888412607, "loss": 0.1955200880765915, "mean_token_accuracy": 0.921666830778122, "num_tokens": 65366408.0, "step": 5299 }, { "entropy": 1.2705854177474976, "epoch": 2.7909426013691414, "grad_norm": 0.27244964241981506, "learning_rate": 0.00014312550091082456, "loss": 0.18523868918418884, "mean_token_accuracy": 0.924994632601738, "num_tokens": 65378744.0, "step": 5300 }, { "entropy": 1.2694044709205627, "epoch": 2.7914691943127963, "grad_norm": 0.2661687731742859, "learning_rate": 0.00014310511097105513, "loss": 0.1898202747106552, "mean_token_accuracy": 0.9222358614206314, "num_tokens": 65391080.0, "step": 5301 }, { "entropy": 1.29021418094635, "epoch": 2.7919957872564507, "grad_norm": 0.2877323627471924, "learning_rate": 0.00014308471906602824, "loss": 0.19828127324581146, "mean_token_accuracy": 0.9166731089353561, "num_tokens": 65403416.0, "step": 5302 }, { "entropy": 1.2674870193004608, "epoch": 2.792522380200105, "grad_norm": 0.275603324174881, "learning_rate": 0.00014306432519695436, "loss": 0.19587281346321106, "mean_token_accuracy": 0.9162575602531433, "num_tokens": 65415752.0, "step": 5303 }, { "entropy": 1.2863653898239136, "epoch": 2.79304897314376, "grad_norm": 0.27803856134414673, "learning_rate": 0.00014304392936504424, "loss": 0.19489046931266785, "mean_token_accuracy": 0.9222230017185211, "num_tokens": 65428088.0, "step": 5304 }, { "entropy": 1.3094123899936676, "epoch": 2.7935755660874144, "grad_norm": 0.31087836623191833, "learning_rate": 0.00014302353157150862, "loss": 0.19567900896072388, "mean_token_accuracy": 0.9196409285068512, "num_tokens": 65440424.0, "step": 5305 }, { "entropy": 1.2640268802642822, "epoch": 2.794102159031069, "grad_norm": 0.27602046728134155, "learning_rate": 0.0001430031318175584, "loss": 0.19994071125984192, "mean_token_accuracy": 0.9169894754886627, "num_tokens": 65452760.0, "step": 5306 }, { "entropy": 1.3626899421215057, "epoch": 2.7946287519747237, "grad_norm": 0.2630988359451294, "learning_rate": 0.00014298273010440458, "loss": 0.17848266661167145, "mean_token_accuracy": 0.9260770082473755, "num_tokens": 65465096.0, "step": 5307 }, { "entropy": 1.3198005855083466, "epoch": 2.795155344918378, "grad_norm": 0.254104346036911, "learning_rate": 0.00014296232643325836, "loss": 0.17157261073589325, "mean_token_accuracy": 0.929302304983139, "num_tokens": 65477432.0, "step": 5308 }, { "entropy": 1.3163739144802094, "epoch": 2.7956819378620326, "grad_norm": 0.2930879294872284, "learning_rate": 0.00014294192080533088, "loss": 0.18230167031288147, "mean_token_accuracy": 0.9215236604213715, "num_tokens": 65489768.0, "step": 5309 }, { "entropy": 1.331737995147705, "epoch": 2.7962085308056874, "grad_norm": 0.2841273546218872, "learning_rate": 0.0001429215132218336, "loss": 0.21370966732501984, "mean_token_accuracy": 0.9168280363082886, "num_tokens": 65502104.0, "step": 5310 }, { "entropy": 1.3565723598003387, "epoch": 2.796735123749342, "grad_norm": 0.2748474180698395, "learning_rate": 0.00014290110368397795, "loss": 0.1781301200389862, "mean_token_accuracy": 0.93081134557724, "num_tokens": 65514440.0, "step": 5311 }, { "entropy": 1.332760989665985, "epoch": 2.7972617166929963, "grad_norm": 0.2885291576385498, "learning_rate": 0.0001428806921929756, "loss": 0.19329184293746948, "mean_token_accuracy": 0.9193468242883682, "num_tokens": 65526776.0, "step": 5312 }, { "entropy": 1.3488106727600098, "epoch": 2.7977883096366507, "grad_norm": 0.3057740330696106, "learning_rate": 0.0001428602787500381, "loss": 0.2155866026878357, "mean_token_accuracy": 0.9115214347839355, "num_tokens": 65539112.0, "step": 5313 }, { "entropy": 1.3490218222141266, "epoch": 2.7983149025803056, "grad_norm": 0.2725186049938202, "learning_rate": 0.00014283986335637743, "loss": 0.1859339028596878, "mean_token_accuracy": 0.9261448532342911, "num_tokens": 65551448.0, "step": 5314 }, { "entropy": 1.310249239206314, "epoch": 2.79884149552396, "grad_norm": 0.2817498445510864, "learning_rate": 0.00014281944601320546, "loss": 0.1796184778213501, "mean_token_accuracy": 0.9227155297994614, "num_tokens": 65563784.0, "step": 5315 }, { "entropy": 1.3516960740089417, "epoch": 2.7993680884676144, "grad_norm": 0.31386610865592957, "learning_rate": 0.00014279902672173427, "loss": 0.2113589197397232, "mean_token_accuracy": 0.9109881967306137, "num_tokens": 65576120.0, "step": 5316 }, { "entropy": 1.3502106964588165, "epoch": 2.799894681411269, "grad_norm": 0.3107154369354248, "learning_rate": 0.00014277860548317603, "loss": 0.1957147717475891, "mean_token_accuracy": 0.9212307333946228, "num_tokens": 65588456.0, "step": 5317 }, { "entropy": 1.286857783794403, "epoch": 2.8004212743549237, "grad_norm": 0.2969721853733063, "learning_rate": 0.00014275818229874301, "loss": 0.18805904686450958, "mean_token_accuracy": 0.9243521392345428, "num_tokens": 65600792.0, "step": 5318 }, { "entropy": 1.3212200999259949, "epoch": 2.800947867298578, "grad_norm": 0.28291863203048706, "learning_rate": 0.00014273775716964766, "loss": 0.18257564306259155, "mean_token_accuracy": 0.9234202355146408, "num_tokens": 65613128.0, "step": 5319 }, { "entropy": 1.2968879044055939, "epoch": 2.8014744602422326, "grad_norm": 0.27695876359939575, "learning_rate": 0.00014271733009710245, "loss": 0.1660367250442505, "mean_token_accuracy": 0.9291543513536453, "num_tokens": 65625464.0, "step": 5320 }, { "entropy": 1.2907300889492035, "epoch": 2.8020010531858874, "grad_norm": 0.29541856050491333, "learning_rate": 0.0001426969010823201, "loss": 0.21649664640426636, "mean_token_accuracy": 0.9106380492448807, "num_tokens": 65637800.0, "step": 5321 }, { "entropy": 1.315805196762085, "epoch": 2.802527646129542, "grad_norm": 0.28097328543663025, "learning_rate": 0.0001426764701265133, "loss": 0.188256174325943, "mean_token_accuracy": 0.9229840487241745, "num_tokens": 65650136.0, "step": 5322 }, { "entropy": 1.3322736322879791, "epoch": 2.8030542390731963, "grad_norm": 0.45639967918395996, "learning_rate": 0.00014265603723089484, "loss": 0.18657879531383514, "mean_token_accuracy": 0.9199790060520172, "num_tokens": 65662472.0, "step": 5323 }, { "entropy": 1.2863487601280212, "epoch": 2.803580832016851, "grad_norm": 0.2746271789073944, "learning_rate": 0.00014263560239667785, "loss": 0.18844881653785706, "mean_token_accuracy": 0.925334244966507, "num_tokens": 65674808.0, "step": 5324 }, { "entropy": 1.2828960418701172, "epoch": 2.8041074249605056, "grad_norm": 0.2776462733745575, "learning_rate": 0.00014261516562507533, "loss": 0.1838618367910385, "mean_token_accuracy": 0.9251666814088821, "num_tokens": 65687144.0, "step": 5325 }, { "entropy": 1.2915571928024292, "epoch": 2.80463401790416, "grad_norm": 0.28010231256484985, "learning_rate": 0.0001425947269173006, "loss": 0.1980217695236206, "mean_token_accuracy": 0.9215652793645859, "num_tokens": 65699480.0, "step": 5326 }, { "entropy": 1.2577224969863892, "epoch": 2.805160610847815, "grad_norm": 0.2838359475135803, "learning_rate": 0.00014257428627456682, "loss": 0.20210154354572296, "mean_token_accuracy": 0.9163983017206192, "num_tokens": 65711816.0, "step": 5327 }, { "entropy": 1.2922307252883911, "epoch": 2.8056872037914693, "grad_norm": 0.2706328332424164, "learning_rate": 0.00014255384369808756, "loss": 0.19801615178585052, "mean_token_accuracy": 0.915440022945404, "num_tokens": 65724152.0, "step": 5328 }, { "entropy": 1.2760253250598907, "epoch": 2.8062137967351237, "grad_norm": 0.2580713629722595, "learning_rate": 0.0001425333991890763, "loss": 0.16899164021015167, "mean_token_accuracy": 0.9279545992612839, "num_tokens": 65736488.0, "step": 5329 }, { "entropy": 1.2592010498046875, "epoch": 2.806740389678778, "grad_norm": 0.2732999622821808, "learning_rate": 0.00014251295274874678, "loss": 0.1941339373588562, "mean_token_accuracy": 0.9203190058469772, "num_tokens": 65748824.0, "step": 5330 }, { "entropy": 1.3266755938529968, "epoch": 2.807266982622433, "grad_norm": 0.2721918821334839, "learning_rate": 0.00014249250437831277, "loss": 0.18719229102134705, "mean_token_accuracy": 0.9207041710615158, "num_tokens": 65761160.0, "step": 5331 }, { "entropy": 1.3405596911907196, "epoch": 2.8077935755660874, "grad_norm": 0.29513224959373474, "learning_rate": 0.00014247205407898813, "loss": 0.20140871405601501, "mean_token_accuracy": 0.919532835483551, "num_tokens": 65773496.0, "step": 5332 }, { "entropy": 1.3203657865524292, "epoch": 2.808320168509742, "grad_norm": 0.26965105533599854, "learning_rate": 0.0001424516018519869, "loss": 0.1990198791027069, "mean_token_accuracy": 0.917657345533371, "num_tokens": 65785832.0, "step": 5333 }, { "entropy": 1.2802288830280304, "epoch": 2.8088467614533963, "grad_norm": 0.29502639174461365, "learning_rate": 0.00014243114769852322, "loss": 0.21779046952724457, "mean_token_accuracy": 0.9080840200185776, "num_tokens": 65798168.0, "step": 5334 }, { "entropy": 1.2174814939498901, "epoch": 2.809373354397051, "grad_norm": 0.23770982027053833, "learning_rate": 0.00014241069161981132, "loss": 0.18031489849090576, "mean_token_accuracy": 0.9241122305393219, "num_tokens": 65810504.0, "step": 5335 }, { "entropy": 1.303638517856598, "epoch": 2.8098999473407056, "grad_norm": 0.250471830368042, "learning_rate": 0.00014239023361706558, "loss": 0.18099047243595123, "mean_token_accuracy": 0.9224986284971237, "num_tokens": 65822840.0, "step": 5336 }, { "entropy": 1.3555626571178436, "epoch": 2.81042654028436, "grad_norm": 0.2877865433692932, "learning_rate": 0.00014236977369150043, "loss": 0.19794785976409912, "mean_token_accuracy": 0.916514053940773, "num_tokens": 65835176.0, "step": 5337 }, { "entropy": 1.3452889621257782, "epoch": 2.810953133228015, "grad_norm": 0.29638126492500305, "learning_rate": 0.0001423493118443305, "loss": 0.20515380799770355, "mean_token_accuracy": 0.9165419936180115, "num_tokens": 65847512.0, "step": 5338 }, { "entropy": 1.3289613127708435, "epoch": 2.8114797261716693, "grad_norm": 0.31008410453796387, "learning_rate": 0.00014232884807677045, "loss": 0.20547129213809967, "mean_token_accuracy": 0.9179491698741913, "num_tokens": 65859848.0, "step": 5339 }, { "entropy": 1.3396630585193634, "epoch": 2.8120063191153237, "grad_norm": 0.24820318818092346, "learning_rate": 0.00014230838239003514, "loss": 0.18229185044765472, "mean_token_accuracy": 0.9222933501005173, "num_tokens": 65872184.0, "step": 5340 }, { "entropy": 1.3142532706260681, "epoch": 2.8125329120589786, "grad_norm": 0.27396664023399353, "learning_rate": 0.00014228791478533944, "loss": 0.2007269263267517, "mean_token_accuracy": 0.9183091521263123, "num_tokens": 65884520.0, "step": 5341 }, { "entropy": 1.3794560730457306, "epoch": 2.813059505002633, "grad_norm": 0.276889443397522, "learning_rate": 0.0001422674452638985, "loss": 0.19162897765636444, "mean_token_accuracy": 0.9210671484470367, "num_tokens": 65896856.0, "step": 5342 }, { "entropy": 1.3106403052806854, "epoch": 2.8135860979462874, "grad_norm": 0.24311819672584534, "learning_rate": 0.00014224697382692733, "loss": 0.17249861359596252, "mean_token_accuracy": 0.926313728094101, "num_tokens": 65909192.0, "step": 5343 }, { "entropy": 1.357205718755722, "epoch": 2.8141126908899423, "grad_norm": 0.2881726622581482, "learning_rate": 0.00014222650047564128, "loss": 0.19397282600402832, "mean_token_accuracy": 0.9207228273153305, "num_tokens": 65921528.0, "step": 5344 }, { "entropy": 1.2870065569877625, "epoch": 2.8146392838335967, "grad_norm": 0.2502511739730835, "learning_rate": 0.00014220602521125577, "loss": 0.19269129633903503, "mean_token_accuracy": 0.9196359366178513, "num_tokens": 65933864.0, "step": 5345 }, { "entropy": 1.2929141223430634, "epoch": 2.815165876777251, "grad_norm": 0.2680942714214325, "learning_rate": 0.00014218554803498623, "loss": 0.19123870134353638, "mean_token_accuracy": 0.9213044196367264, "num_tokens": 65946200.0, "step": 5346 }, { "entropy": 1.2766457498073578, "epoch": 2.8156924697209056, "grad_norm": 0.266617089509964, "learning_rate": 0.0001421650689480483, "loss": 0.19216907024383545, "mean_token_accuracy": 0.923948273062706, "num_tokens": 65958536.0, "step": 5347 }, { "entropy": 1.279809296131134, "epoch": 2.8162190626645605, "grad_norm": 0.25692835450172424, "learning_rate": 0.00014214458795165768, "loss": 0.16894961893558502, "mean_token_accuracy": 0.9307194501161575, "num_tokens": 65970872.0, "step": 5348 }, { "entropy": 1.2850238978862762, "epoch": 2.816745655608215, "grad_norm": 0.2544446587562561, "learning_rate": 0.00014212410504703025, "loss": 0.18745863437652588, "mean_token_accuracy": 0.9202258735895157, "num_tokens": 65983208.0, "step": 5349 }, { "entropy": 1.3343496918678284, "epoch": 2.8172722485518693, "grad_norm": 0.2888110280036926, "learning_rate": 0.00014210362023538194, "loss": 0.19372104108333588, "mean_token_accuracy": 0.917907640337944, "num_tokens": 65995544.0, "step": 5350 }, { "entropy": 1.248584896326065, "epoch": 2.8177988414955237, "grad_norm": 0.258998841047287, "learning_rate": 0.0001420831335179288, "loss": 0.18754670023918152, "mean_token_accuracy": 0.9216349273920059, "num_tokens": 66007880.0, "step": 5351 }, { "entropy": 1.2730433344841003, "epoch": 2.8183254344391786, "grad_norm": 0.2844271957874298, "learning_rate": 0.000142062644895887, "loss": 0.19392099976539612, "mean_token_accuracy": 0.9160989373922348, "num_tokens": 66020216.0, "step": 5352 }, { "entropy": 1.239387720823288, "epoch": 2.818852027382833, "grad_norm": 0.2637011408805847, "learning_rate": 0.00014204215437047289, "loss": 0.16577531397342682, "mean_token_accuracy": 0.930683970451355, "num_tokens": 66032552.0, "step": 5353 }, { "entropy": 1.2617818415164948, "epoch": 2.8193786203264875, "grad_norm": 0.27310746908187866, "learning_rate": 0.0001420216619429028, "loss": 0.18738313019275665, "mean_token_accuracy": 0.922308012843132, "num_tokens": 66044888.0, "step": 5354 }, { "entropy": 1.2251103222370148, "epoch": 2.8199052132701423, "grad_norm": 0.2810131013393402, "learning_rate": 0.00014200116761439326, "loss": 0.18970806896686554, "mean_token_accuracy": 0.9238426834344864, "num_tokens": 66057224.0, "step": 5355 }, { "entropy": 1.300120770931244, "epoch": 2.8204318062137967, "grad_norm": 0.3125358819961548, "learning_rate": 0.00014198067138616096, "loss": 0.19446682929992676, "mean_token_accuracy": 0.9172956049442291, "num_tokens": 66069560.0, "step": 5356 }, { "entropy": 1.232959359884262, "epoch": 2.820958399157451, "grad_norm": 0.26678264141082764, "learning_rate": 0.00014196017325942257, "loss": 0.19019223749637604, "mean_token_accuracy": 0.919284850358963, "num_tokens": 66081896.0, "step": 5357 }, { "entropy": 1.2427859604358673, "epoch": 2.821484992101106, "grad_norm": 0.2783074975013733, "learning_rate": 0.00014193967323539497, "loss": 0.18141202628612518, "mean_token_accuracy": 0.9261755645275116, "num_tokens": 66094232.0, "step": 5358 }, { "entropy": 1.2050098180770874, "epoch": 2.8220115850447605, "grad_norm": 0.23615165054798126, "learning_rate": 0.0001419191713152951, "loss": 0.1723269373178482, "mean_token_accuracy": 0.9296863228082657, "num_tokens": 66106568.0, "step": 5359 }, { "entropy": 1.259114533662796, "epoch": 2.822538177988415, "grad_norm": 0.2952539324760437, "learning_rate": 0.00014189866750034016, "loss": 0.1994144320487976, "mean_token_accuracy": 0.9215876311063766, "num_tokens": 66118904.0, "step": 5360 }, { "entropy": 1.3054438531398773, "epoch": 2.8230647709320698, "grad_norm": 0.2893647849559784, "learning_rate": 0.00014187816179174717, "loss": 0.18889150023460388, "mean_token_accuracy": 0.9236411154270172, "num_tokens": 66131240.0, "step": 5361 }, { "entropy": 1.213493674993515, "epoch": 2.823591363875724, "grad_norm": 0.28194475173950195, "learning_rate": 0.00014185765419073352, "loss": 0.19393613934516907, "mean_token_accuracy": 0.9203670918941498, "num_tokens": 66143576.0, "step": 5362 }, { "entropy": 1.31081622838974, "epoch": 2.8241179568193786, "grad_norm": 0.26179248094558716, "learning_rate": 0.00014183714469851664, "loss": 0.17356306314468384, "mean_token_accuracy": 0.9289624840021133, "num_tokens": 66155912.0, "step": 5363 }, { "entropy": 1.2900842726230621, "epoch": 2.824644549763033, "grad_norm": 0.2782558798789978, "learning_rate": 0.00014181663331631404, "loss": 0.19263340532779694, "mean_token_accuracy": 0.9261777848005295, "num_tokens": 66168248.0, "step": 5364 }, { "entropy": 1.2860835790634155, "epoch": 2.8251711427066875, "grad_norm": 0.3041127920150757, "learning_rate": 0.00014179612004534334, "loss": 0.19561003148555756, "mean_token_accuracy": 0.9226749986410141, "num_tokens": 66180584.0, "step": 5365 }, { "entropy": 1.306857168674469, "epoch": 2.8256977356503423, "grad_norm": 0.2649271786212921, "learning_rate": 0.00014177560488682237, "loss": 0.18361037969589233, "mean_token_accuracy": 0.923071101307869, "num_tokens": 66192920.0, "step": 5366 }, { "entropy": 1.3504366278648376, "epoch": 2.8262243285939967, "grad_norm": 0.30323871970176697, "learning_rate": 0.00014175508784196892, "loss": 0.20840725302696228, "mean_token_accuracy": 0.9156047105789185, "num_tokens": 66205256.0, "step": 5367 }, { "entropy": 1.3343227803707123, "epoch": 2.826750921537651, "grad_norm": 0.30277058482170105, "learning_rate": 0.00014173456891200097, "loss": 0.2028798907995224, "mean_token_accuracy": 0.9148493260145187, "num_tokens": 66217592.0, "step": 5368 }, { "entropy": 1.2690812051296234, "epoch": 2.827277514481306, "grad_norm": 0.2847183346748352, "learning_rate": 0.0001417140480981366, "loss": 0.18881455063819885, "mean_token_accuracy": 0.9242660850286484, "num_tokens": 66229928.0, "step": 5369 }, { "entropy": 1.3083016276359558, "epoch": 2.8278041074249605, "grad_norm": 0.30137863755226135, "learning_rate": 0.00014169352540159406, "loss": 0.19169145822525024, "mean_token_accuracy": 0.9188456684350967, "num_tokens": 66242264.0, "step": 5370 }, { "entropy": 1.3139874637126923, "epoch": 2.828330700368615, "grad_norm": 0.2890307307243347, "learning_rate": 0.00014167300082359167, "loss": 0.19907841086387634, "mean_token_accuracy": 0.9193234592676163, "num_tokens": 66254600.0, "step": 5371 }, { "entropy": 1.2936797440052032, "epoch": 2.8288572933122698, "grad_norm": 0.27607885003089905, "learning_rate": 0.00014165247436534782, "loss": 0.1906982958316803, "mean_token_accuracy": 0.9183892905712128, "num_tokens": 66266936.0, "step": 5372 }, { "entropy": 1.3275218605995178, "epoch": 2.829383886255924, "grad_norm": 0.29767462611198425, "learning_rate": 0.000141631946028081, "loss": 0.21200454235076904, "mean_token_accuracy": 0.9133586883544922, "num_tokens": 66279272.0, "step": 5373 }, { "entropy": 1.3114037215709686, "epoch": 2.8299104791995786, "grad_norm": 0.2859516441822052, "learning_rate": 0.00014161141581300993, "loss": 0.2003038227558136, "mean_token_accuracy": 0.9200000613927841, "num_tokens": 66291608.0, "step": 5374 }, { "entropy": 1.2808501720428467, "epoch": 2.8304370721432335, "grad_norm": 0.2558257579803467, "learning_rate": 0.0001415908837213534, "loss": 0.17073266208171844, "mean_token_accuracy": 0.9285646677017212, "num_tokens": 66303944.0, "step": 5375 }, { "entropy": 1.2928644716739655, "epoch": 2.830963665086888, "grad_norm": 0.2917443811893463, "learning_rate": 0.00014157034975433017, "loss": 0.20764575898647308, "mean_token_accuracy": 0.915138840675354, "num_tokens": 66316280.0, "step": 5376 }, { "entropy": 1.2757077515125275, "epoch": 2.8314902580305423, "grad_norm": 0.2791418731212616, "learning_rate": 0.00014154981391315932, "loss": 0.18959811329841614, "mean_token_accuracy": 0.9251828342676163, "num_tokens": 66328616.0, "step": 5377 }, { "entropy": 1.319762110710144, "epoch": 2.832016850974197, "grad_norm": 0.26925116777420044, "learning_rate": 0.00014152927619905987, "loss": 0.17835290729999542, "mean_token_accuracy": 0.9292363375425339, "num_tokens": 66340952.0, "step": 5378 }, { "entropy": 1.2947478890419006, "epoch": 2.8325434439178516, "grad_norm": 0.2954257130622864, "learning_rate": 0.00014150873661325107, "loss": 0.19611039757728577, "mean_token_accuracy": 0.9170423597097397, "num_tokens": 66353288.0, "step": 5379 }, { "entropy": 1.3365015387535095, "epoch": 2.833070036861506, "grad_norm": 0.28138986229896545, "learning_rate": 0.00014148819515695226, "loss": 0.19645000994205475, "mean_token_accuracy": 0.9223781526088715, "num_tokens": 66365624.0, "step": 5380 }, { "entropy": 1.2312410771846771, "epoch": 2.8335966298051605, "grad_norm": 0.25112465023994446, "learning_rate": 0.0001414676518313828, "loss": 0.17653129994869232, "mean_token_accuracy": 0.9302770644426346, "num_tokens": 66377960.0, "step": 5381 }, { "entropy": 1.29915651679039, "epoch": 2.834123222748815, "grad_norm": 0.28604868054389954, "learning_rate": 0.00014144710663776224, "loss": 0.18507474660873413, "mean_token_accuracy": 0.9225872606039047, "num_tokens": 66390296.0, "step": 5382 }, { "entropy": 1.2989193797111511, "epoch": 2.8346498156924698, "grad_norm": 0.29358354210853577, "learning_rate": 0.00014142655957731027, "loss": 0.20054125785827637, "mean_token_accuracy": 0.9196604937314987, "num_tokens": 66402632.0, "step": 5383 }, { "entropy": 1.3038256466388702, "epoch": 2.835176408636124, "grad_norm": 0.2762550115585327, "learning_rate": 0.0001414060106512466, "loss": 0.18558046221733093, "mean_token_accuracy": 0.9259804487228394, "num_tokens": 66414968.0, "step": 5384 }, { "entropy": 1.2950901687145233, "epoch": 2.8357030015797786, "grad_norm": 0.2872573435306549, "learning_rate": 0.00014138545986079119, "loss": 0.1845257580280304, "mean_token_accuracy": 0.9250736236572266, "num_tokens": 66427304.0, "step": 5385 }, { "entropy": 1.243366152048111, "epoch": 2.8362295945234335, "grad_norm": 0.272707998752594, "learning_rate": 0.0001413649072071639, "loss": 0.19566035270690918, "mean_token_accuracy": 0.9192866683006287, "num_tokens": 66439640.0, "step": 5386 }, { "entropy": 1.283011943101883, "epoch": 2.836756187467088, "grad_norm": 0.24862247705459595, "learning_rate": 0.00014134435269158487, "loss": 0.18011629581451416, "mean_token_accuracy": 0.9231017231941223, "num_tokens": 66451976.0, "step": 5387 }, { "entropy": 1.2681494057178497, "epoch": 2.8372827804107423, "grad_norm": 0.2905445396900177, "learning_rate": 0.00014132379631527433, "loss": 0.19375208020210266, "mean_token_accuracy": 0.919303685426712, "num_tokens": 66464312.0, "step": 5388 }, { "entropy": 1.2690399587154388, "epoch": 2.837809373354397, "grad_norm": 0.32442450523376465, "learning_rate": 0.0001413032380794526, "loss": 0.22549712657928467, "mean_token_accuracy": 0.9056236445903778, "num_tokens": 66476648.0, "step": 5389 }, { "entropy": 1.2229408919811249, "epoch": 2.8383359662980516, "grad_norm": 0.2401140034198761, "learning_rate": 0.00014128267798534002, "loss": 0.16507481038570404, "mean_token_accuracy": 0.9342491179704666, "num_tokens": 66488984.0, "step": 5390 }, { "entropy": 1.2351162135601044, "epoch": 2.838862559241706, "grad_norm": 0.2740425765514374, "learning_rate": 0.00014126211603415723, "loss": 0.1834060549736023, "mean_token_accuracy": 0.9211757332086563, "num_tokens": 66501320.0, "step": 5391 }, { "entropy": 1.2271034121513367, "epoch": 2.839389152185361, "grad_norm": 0.2942942976951599, "learning_rate": 0.00014124155222712477, "loss": 0.20962479710578918, "mean_token_accuracy": 0.9142883569002151, "num_tokens": 66513656.0, "step": 5392 }, { "entropy": 1.2456031441688538, "epoch": 2.8399157451290153, "grad_norm": 0.2792077958583832, "learning_rate": 0.00014122098656546347, "loss": 0.19956699013710022, "mean_token_accuracy": 0.9134206175804138, "num_tokens": 66525992.0, "step": 5393 }, { "entropy": 1.2200534343719482, "epoch": 2.8404423380726698, "grad_norm": 0.2667393386363983, "learning_rate": 0.00014120041905039417, "loss": 0.18422703444957733, "mean_token_accuracy": 0.9217170625925064, "num_tokens": 66538328.0, "step": 5394 }, { "entropy": 1.2396110892295837, "epoch": 2.8409689310163246, "grad_norm": 0.29442811012268066, "learning_rate": 0.00014117984968313785, "loss": 0.19714084267616272, "mean_token_accuracy": 0.920742392539978, "num_tokens": 66550664.0, "step": 5395 }, { "entropy": 1.1788528263568878, "epoch": 2.841495523959979, "grad_norm": 0.2758336067199707, "learning_rate": 0.00014115927846491556, "loss": 0.19068320095539093, "mean_token_accuracy": 0.9210142344236374, "num_tokens": 66563000.0, "step": 5396 }, { "entropy": 1.1362981796264648, "epoch": 2.8420221169036335, "grad_norm": 0.25416529178619385, "learning_rate": 0.00014113870539694852, "loss": 0.16557230055332184, "mean_token_accuracy": 0.9342633932828903, "num_tokens": 66575336.0, "step": 5397 }, { "entropy": 1.1327734589576721, "epoch": 2.842548709847288, "grad_norm": 0.2415960431098938, "learning_rate": 0.00014111813048045804, "loss": 0.16808874905109406, "mean_token_accuracy": 0.9288180619478226, "num_tokens": 66587672.0, "step": 5398 }, { "entropy": 1.1094682216644287, "epoch": 2.8430753027909423, "grad_norm": 0.2572054862976074, "learning_rate": 0.00014109755371666553, "loss": 0.18255862593650818, "mean_token_accuracy": 0.9252709001302719, "num_tokens": 66600008.0, "step": 5399 }, { "entropy": 1.167961448431015, "epoch": 2.843601895734597, "grad_norm": 0.26458224654197693, "learning_rate": 0.0001410769751067925, "loss": 0.18526852130889893, "mean_token_accuracy": 0.9216188937425613, "num_tokens": 66612344.0, "step": 5400 }, { "entropy": 1.1674366891384125, "epoch": 2.8441284886782516, "grad_norm": 0.2747248411178589, "learning_rate": 0.00014105639465206057, "loss": 0.17862823605537415, "mean_token_accuracy": 0.9248768389225006, "num_tokens": 66624680.0, "step": 5401 }, { "entropy": 1.1781964004039764, "epoch": 2.844655081621906, "grad_norm": 0.2930940091609955, "learning_rate": 0.00014103581235369152, "loss": 0.19545236229896545, "mean_token_accuracy": 0.921414703130722, "num_tokens": 66637016.0, "step": 5402 }, { "entropy": 1.137371987104416, "epoch": 2.845181674565561, "grad_norm": 0.3015097975730896, "learning_rate": 0.00014101522821290718, "loss": 0.1982129067182541, "mean_token_accuracy": 0.9206677973270416, "num_tokens": 66649352.0, "step": 5403 }, { "entropy": 1.1155942976474762, "epoch": 2.8457082675092154, "grad_norm": 0.2667999863624573, "learning_rate": 0.00014099464223092951, "loss": 0.18535880744457245, "mean_token_accuracy": 0.9235810935497284, "num_tokens": 66661688.0, "step": 5404 }, { "entropy": 1.1362461149692535, "epoch": 2.8462348604528698, "grad_norm": 0.28863558173179626, "learning_rate": 0.00014097405440898059, "loss": 0.20071467757225037, "mean_token_accuracy": 0.9162945002317429, "num_tokens": 66674024.0, "step": 5405 }, { "entropy": 1.1156060993671417, "epoch": 2.8467614533965246, "grad_norm": 0.28235065937042236, "learning_rate": 0.0001409534647482826, "loss": 0.18811024725437164, "mean_token_accuracy": 0.9257550984621048, "num_tokens": 66686360.0, "step": 5406 }, { "entropy": 1.1049256920814514, "epoch": 2.847288046340179, "grad_norm": 0.27387118339538574, "learning_rate": 0.0001409328732500578, "loss": 0.18561598658561707, "mean_token_accuracy": 0.9243172854185104, "num_tokens": 66698696.0, "step": 5407 }, { "entropy": 1.0878219902515411, "epoch": 2.8478146392838335, "grad_norm": 0.24213702976703644, "learning_rate": 0.0001409122799155286, "loss": 0.17320024967193604, "mean_token_accuracy": 0.9250019490718842, "num_tokens": 66711032.0, "step": 5408 }, { "entropy": 1.1544892191886902, "epoch": 2.8483412322274884, "grad_norm": 0.297046959400177, "learning_rate": 0.00014089168474591752, "loss": 0.2007860541343689, "mean_token_accuracy": 0.9169928729534149, "num_tokens": 66723368.0, "step": 5409 }, { "entropy": 1.09200057387352, "epoch": 2.848867825171143, "grad_norm": 0.26236802339553833, "learning_rate": 0.00014087108774244714, "loss": 0.171499103307724, "mean_token_accuracy": 0.9301941990852356, "num_tokens": 66735704.0, "step": 5410 }, { "entropy": 1.127855896949768, "epoch": 2.849394418114797, "grad_norm": 0.2707575261592865, "learning_rate": 0.00014085048890634023, "loss": 0.18420180678367615, "mean_token_accuracy": 0.9241728633642197, "num_tokens": 66748040.0, "step": 5411 }, { "entropy": 1.1189501583576202, "epoch": 2.849921011058452, "grad_norm": 0.2789716124534607, "learning_rate": 0.00014082988823881963, "loss": 0.18347470462322235, "mean_token_accuracy": 0.9260276108980179, "num_tokens": 66760376.0, "step": 5412 }, { "entropy": 1.1610067784786224, "epoch": 2.8504476040021065, "grad_norm": 0.28152376413345337, "learning_rate": 0.0001408092857411082, "loss": 0.18292734026908875, "mean_token_accuracy": 0.9208507537841797, "num_tokens": 66772712.0, "step": 5413 }, { "entropy": 1.180832177400589, "epoch": 2.850974196945761, "grad_norm": 0.27147287130355835, "learning_rate": 0.00014078868141442912, "loss": 0.17122916877269745, "mean_token_accuracy": 0.9286279231309891, "num_tokens": 66785048.0, "step": 5414 }, { "entropy": 1.1299280226230621, "epoch": 2.8515007898894154, "grad_norm": 0.3026059865951538, "learning_rate": 0.00014076807526000539, "loss": 0.19383591413497925, "mean_token_accuracy": 0.9125325083732605, "num_tokens": 66797384.0, "step": 5415 }, { "entropy": 1.1946425437927246, "epoch": 2.85202738283307, "grad_norm": 0.309876412153244, "learning_rate": 0.00014074746727906046, "loss": 0.21104586124420166, "mean_token_accuracy": 0.9126588106155396, "num_tokens": 66809720.0, "step": 5416 }, { "entropy": 1.123658001422882, "epoch": 2.8525539757767246, "grad_norm": 0.25807276368141174, "learning_rate": 0.00014072685747281753, "loss": 0.17802190780639648, "mean_token_accuracy": 0.9260611236095428, "num_tokens": 66822056.0, "step": 5417 }, { "entropy": 1.1184225380420685, "epoch": 2.853080568720379, "grad_norm": 0.2761235237121582, "learning_rate": 0.00014070624584250018, "loss": 0.20021545886993408, "mean_token_accuracy": 0.9165898710489273, "num_tokens": 66834392.0, "step": 5418 }, { "entropy": 1.1407923996448517, "epoch": 2.8536071616640335, "grad_norm": 0.2857515811920166, "learning_rate": 0.000140685632389332, "loss": 0.19885635375976562, "mean_token_accuracy": 0.9142837524414062, "num_tokens": 66846728.0, "step": 5419 }, { "entropy": 1.138054519891739, "epoch": 2.8541337546076884, "grad_norm": 0.27679088711738586, "learning_rate": 0.00014066501711453664, "loss": 0.19095392525196075, "mean_token_accuracy": 0.9210739135742188, "num_tokens": 66859064.0, "step": 5420 }, { "entropy": 1.1621717810630798, "epoch": 2.854660347551343, "grad_norm": 0.2896009385585785, "learning_rate": 0.00014064440001933798, "loss": 0.1932981014251709, "mean_token_accuracy": 0.9193224459886551, "num_tokens": 66871400.0, "step": 5421 }, { "entropy": 1.1080684959888458, "epoch": 2.855186940494997, "grad_norm": 0.2747195065021515, "learning_rate": 0.00014062378110495989, "loss": 0.19618317484855652, "mean_token_accuracy": 0.919920340180397, "num_tokens": 66883736.0, "step": 5422 }, { "entropy": 1.1182142198085785, "epoch": 2.855713533438652, "grad_norm": 0.2994195222854614, "learning_rate": 0.0001406031603726264, "loss": 0.19491897523403168, "mean_token_accuracy": 0.9171514958143234, "num_tokens": 66896072.0, "step": 5423 }, { "entropy": 1.0934617221355438, "epoch": 2.8562401263823065, "grad_norm": 0.2570323646068573, "learning_rate": 0.00014058253782356166, "loss": 0.17098519206047058, "mean_token_accuracy": 0.9273951053619385, "num_tokens": 66908408.0, "step": 5424 }, { "entropy": 1.0887425243854523, "epoch": 2.856766719325961, "grad_norm": 0.24847312271595, "learning_rate": 0.00014056191345898986, "loss": 0.1830718219280243, "mean_token_accuracy": 0.9246447682380676, "num_tokens": 66920744.0, "step": 5425 }, { "entropy": 1.0863420367240906, "epoch": 2.857293312269616, "grad_norm": 0.27926573157310486, "learning_rate": 0.0001405412872801354, "loss": 0.1928982138633728, "mean_token_accuracy": 0.9180453270673752, "num_tokens": 66933080.0, "step": 5426 }, { "entropy": 1.0742215812206268, "epoch": 2.8578199052132702, "grad_norm": 0.26996538043022156, "learning_rate": 0.00014052065928822275, "loss": 0.19069387018680573, "mean_token_accuracy": 0.9181806743144989, "num_tokens": 66945416.0, "step": 5427 }, { "entropy": 1.0830220580101013, "epoch": 2.8583464981569247, "grad_norm": 0.28085827827453613, "learning_rate": 0.00014050002948447644, "loss": 0.2127879559993744, "mean_token_accuracy": 0.9116558134555817, "num_tokens": 66957752.0, "step": 5428 }, { "entropy": 1.1039027869701385, "epoch": 2.8588730911005795, "grad_norm": 0.27143600583076477, "learning_rate": 0.00014047939787012115, "loss": 0.1901354193687439, "mean_token_accuracy": 0.9206545948982239, "num_tokens": 66970088.0, "step": 5429 }, { "entropy": 1.170148491859436, "epoch": 2.859399684044234, "grad_norm": 0.30527952313423157, "learning_rate": 0.00014045876444638165, "loss": 0.19135817885398865, "mean_token_accuracy": 0.9210909754037857, "num_tokens": 66982424.0, "step": 5430 }, { "entropy": 1.122731328010559, "epoch": 2.8599262769878884, "grad_norm": 0.2801341116428375, "learning_rate": 0.0001404381292144828, "loss": 0.1940993219614029, "mean_token_accuracy": 0.9169181287288666, "num_tokens": 66994760.0, "step": 5431 }, { "entropy": 1.1264297366142273, "epoch": 2.860452869931543, "grad_norm": 0.27544909715652466, "learning_rate": 0.00014041749217564965, "loss": 0.17596957087516785, "mean_token_accuracy": 0.9287864416837692, "num_tokens": 67007096.0, "step": 5432 }, { "entropy": 1.072750210762024, "epoch": 2.860979462875197, "grad_norm": 0.2531747817993164, "learning_rate": 0.0001403968533311073, "loss": 0.1748124659061432, "mean_token_accuracy": 0.9279569089412689, "num_tokens": 67019432.0, "step": 5433 }, { "entropy": 1.06135892868042, "epoch": 2.861506055818852, "grad_norm": 0.2722875773906708, "learning_rate": 0.00014037621268208093, "loss": 0.1929028183221817, "mean_token_accuracy": 0.9204573929309845, "num_tokens": 67031768.0, "step": 5434 }, { "entropy": 1.1115979850292206, "epoch": 2.8620326487625065, "grad_norm": 0.30371981859207153, "learning_rate": 0.00014035557022979583, "loss": 0.21404585242271423, "mean_token_accuracy": 0.9116851538419724, "num_tokens": 67044104.0, "step": 5435 }, { "entropy": 1.1167850196361542, "epoch": 2.862559241706161, "grad_norm": 0.3018032908439636, "learning_rate": 0.00014033492597547744, "loss": 0.21622182428836823, "mean_token_accuracy": 0.9091343581676483, "num_tokens": 67056440.0, "step": 5436 }, { "entropy": 1.1104548573493958, "epoch": 2.863085834649816, "grad_norm": 0.25832709670066833, "learning_rate": 0.0001403142799203513, "loss": 0.18880854547023773, "mean_token_accuracy": 0.9243634939193726, "num_tokens": 67068776.0, "step": 5437 }, { "entropy": 1.1190284192562103, "epoch": 2.8636124275934702, "grad_norm": 0.2891407310962677, "learning_rate": 0.00014029363206564306, "loss": 0.19353890419006348, "mean_token_accuracy": 0.9211379885673523, "num_tokens": 67081112.0, "step": 5438 }, { "entropy": 1.1418761312961578, "epoch": 2.8641390205371247, "grad_norm": 0.26448798179626465, "learning_rate": 0.0001402729824125785, "loss": 0.1813502162694931, "mean_token_accuracy": 0.9249635934829712, "num_tokens": 67093448.0, "step": 5439 }, { "entropy": 1.1411679685115814, "epoch": 2.8646656134807795, "grad_norm": 0.2673298716545105, "learning_rate": 0.00014025233096238337, "loss": 0.2000432014465332, "mean_token_accuracy": 0.92094986140728, "num_tokens": 67105784.0, "step": 5440 }, { "entropy": 1.126186192035675, "epoch": 2.865192206424434, "grad_norm": 0.26789215207099915, "learning_rate": 0.0001402316777162837, "loss": 0.1887417435646057, "mean_token_accuracy": 0.9270607680082321, "num_tokens": 67118120.0, "step": 5441 }, { "entropy": 1.1385208070278168, "epoch": 2.8657187993680884, "grad_norm": 0.25131142139434814, "learning_rate": 0.0001402110226755055, "loss": 0.1738722175359726, "mean_token_accuracy": 0.930255264043808, "num_tokens": 67130456.0, "step": 5442 }, { "entropy": 1.122873455286026, "epoch": 2.8662453923117432, "grad_norm": 0.26481401920318604, "learning_rate": 0.000140190365841275, "loss": 0.18120309710502625, "mean_token_accuracy": 0.9251967370510101, "num_tokens": 67142792.0, "step": 5443 }, { "entropy": 1.1093613505363464, "epoch": 2.8667719852553977, "grad_norm": 0.2555820941925049, "learning_rate": 0.00014016970721481838, "loss": 0.1706184446811676, "mean_token_accuracy": 0.9285883456468582, "num_tokens": 67155128.0, "step": 5444 }, { "entropy": 1.1308659613132477, "epoch": 2.867298578199052, "grad_norm": 0.2681415379047394, "learning_rate": 0.00014014904679736213, "loss": 0.19834303855895996, "mean_token_accuracy": 0.9212728142738342, "num_tokens": 67167464.0, "step": 5445 }, { "entropy": 1.117288589477539, "epoch": 2.867825171142707, "grad_norm": 0.28140929341316223, "learning_rate": 0.0001401283845901327, "loss": 0.2111014872789383, "mean_token_accuracy": 0.9120144248008728, "num_tokens": 67179800.0, "step": 5446 }, { "entropy": 1.141126126050949, "epoch": 2.8683517640863614, "grad_norm": 0.2594495117664337, "learning_rate": 0.00014010772059435664, "loss": 0.18402037024497986, "mean_token_accuracy": 0.921778216958046, "num_tokens": 67192136.0, "step": 5447 }, { "entropy": 1.1240050196647644, "epoch": 2.868878357030016, "grad_norm": 0.2530897855758667, "learning_rate": 0.00014008705481126073, "loss": 0.1877949982881546, "mean_token_accuracy": 0.9208306074142456, "num_tokens": 67204472.0, "step": 5448 }, { "entropy": 1.2034168243408203, "epoch": 2.8694049499736702, "grad_norm": 0.28608205914497375, "learning_rate": 0.00014006638724207174, "loss": 0.19868814945220947, "mean_token_accuracy": 0.9173824042081833, "num_tokens": 67216808.0, "step": 5449 }, { "entropy": 1.2032455205917358, "epoch": 2.8699315429173247, "grad_norm": 0.29074713587760925, "learning_rate": 0.00014004571788801652, "loss": 0.20050571858882904, "mean_token_accuracy": 0.9168554842472076, "num_tokens": 67229144.0, "step": 5450 }, { "entropy": 1.185323804616928, "epoch": 2.8704581358609795, "grad_norm": 0.2699410319328308, "learning_rate": 0.0001400250467503222, "loss": 0.19191224873065948, "mean_token_accuracy": 0.9225668460130692, "num_tokens": 67241480.0, "step": 5451 }, { "entropy": 1.2091895043849945, "epoch": 2.870984728804634, "grad_norm": 0.268320232629776, "learning_rate": 0.00014000437383021586, "loss": 0.18603497743606567, "mean_token_accuracy": 0.9205420464277267, "num_tokens": 67253816.0, "step": 5452 }, { "entropy": 1.2147535979747772, "epoch": 2.8715113217482884, "grad_norm": 0.2614723742008209, "learning_rate": 0.0001399836991289247, "loss": 0.18065370619297028, "mean_token_accuracy": 0.9245912879705429, "num_tokens": 67266152.0, "step": 5453 }, { "entropy": 1.1979366540908813, "epoch": 2.8720379146919433, "grad_norm": 0.2876172661781311, "learning_rate": 0.00013996302264767608, "loss": 0.19929926097393036, "mean_token_accuracy": 0.9158833473920822, "num_tokens": 67278488.0, "step": 5454 }, { "entropy": 1.2220218181610107, "epoch": 2.8725645076355977, "grad_norm": 0.2671680748462677, "learning_rate": 0.00013994234438769747, "loss": 0.18833203613758087, "mean_token_accuracy": 0.9217775911092758, "num_tokens": 67290824.0, "step": 5455 }, { "entropy": 1.1728639602661133, "epoch": 2.873091100579252, "grad_norm": 0.3314996361732483, "learning_rate": 0.00013992166435021635, "loss": 0.20119228959083557, "mean_token_accuracy": 0.9148829132318497, "num_tokens": 67303160.0, "step": 5456 }, { "entropy": 1.227847933769226, "epoch": 2.873617693522907, "grad_norm": 0.27688175439834595, "learning_rate": 0.00013990098253646043, "loss": 0.18525132536888123, "mean_token_accuracy": 0.9234299957752228, "num_tokens": 67315496.0, "step": 5457 }, { "entropy": 1.229965090751648, "epoch": 2.8741442864665614, "grad_norm": 0.28945228457450867, "learning_rate": 0.00013988029894765748, "loss": 0.19980910420417786, "mean_token_accuracy": 0.9183862209320068, "num_tokens": 67327832.0, "step": 5458 }, { "entropy": 1.1130054593086243, "epoch": 2.874670879410216, "grad_norm": 0.26660850644111633, "learning_rate": 0.0001398596135850353, "loss": 0.18399474024772644, "mean_token_accuracy": 0.9241610169410706, "num_tokens": 67340168.0, "step": 5459 }, { "entropy": 1.1546690165996552, "epoch": 2.8751974723538707, "grad_norm": 0.28937751054763794, "learning_rate": 0.0001398389264498219, "loss": 0.2176598459482193, "mean_token_accuracy": 0.9133116751909256, "num_tokens": 67352504.0, "step": 5460 }, { "entropy": 1.1990187168121338, "epoch": 2.875724065297525, "grad_norm": 0.28130099177360535, "learning_rate": 0.00013981823754324538, "loss": 0.19636386632919312, "mean_token_accuracy": 0.9205514341592789, "num_tokens": 67364840.0, "step": 5461 }, { "entropy": 1.1869704127311707, "epoch": 2.8762506582411795, "grad_norm": 0.28470396995544434, "learning_rate": 0.00013979754686653387, "loss": 0.18688493967056274, "mean_token_accuracy": 0.9220611900091171, "num_tokens": 67377176.0, "step": 5462 }, { "entropy": 1.1728688478469849, "epoch": 2.876777251184834, "grad_norm": 0.2566015422344208, "learning_rate": 0.0001397768544209157, "loss": 0.179299995303154, "mean_token_accuracy": 0.9220699667930603, "num_tokens": 67389512.0, "step": 5463 }, { "entropy": 1.1600215435028076, "epoch": 2.877303844128489, "grad_norm": 0.27697089314460754, "learning_rate": 0.00013975616020761922, "loss": 0.18880513310432434, "mean_token_accuracy": 0.9230993837118149, "num_tokens": 67401848.0, "step": 5464 }, { "entropy": 1.1880110800266266, "epoch": 2.8778304370721433, "grad_norm": 0.30111849308013916, "learning_rate": 0.0001397354642278729, "loss": 0.19892379641532898, "mean_token_accuracy": 0.9172447323799133, "num_tokens": 67414184.0, "step": 5465 }, { "entropy": 1.1921871602535248, "epoch": 2.8783570300157977, "grad_norm": 0.2692202925682068, "learning_rate": 0.00013971476648290545, "loss": 0.18941126763820648, "mean_token_accuracy": 0.9192425012588501, "num_tokens": 67426520.0, "step": 5466 }, { "entropy": 1.2540110051631927, "epoch": 2.878883622959452, "grad_norm": 0.29185977578163147, "learning_rate": 0.00013969406697394548, "loss": 0.19037245213985443, "mean_token_accuracy": 0.9188786596059799, "num_tokens": 67438856.0, "step": 5467 }, { "entropy": 1.2021810710430145, "epoch": 2.879410215903107, "grad_norm": 0.2722068727016449, "learning_rate": 0.00013967336570222183, "loss": 0.19480682909488678, "mean_token_accuracy": 0.9211893379688263, "num_tokens": 67451192.0, "step": 5468 }, { "entropy": 1.2452360689640045, "epoch": 2.8799368088467614, "grad_norm": 0.30236995220184326, "learning_rate": 0.0001396526626689634, "loss": 0.19539473950862885, "mean_token_accuracy": 0.9220133870840073, "num_tokens": 67463528.0, "step": 5469 }, { "entropy": 1.1860556304454803, "epoch": 2.880463401790416, "grad_norm": 0.2610684335231781, "learning_rate": 0.0001396319578753992, "loss": 0.2000972032546997, "mean_token_accuracy": 0.9178863316774368, "num_tokens": 67475864.0, "step": 5470 }, { "entropy": 1.1721631586551666, "epoch": 2.8809899947340707, "grad_norm": 0.2493157833814621, "learning_rate": 0.00013961125132275836, "loss": 0.17627960443496704, "mean_token_accuracy": 0.9253731369972229, "num_tokens": 67488200.0, "step": 5471 }, { "entropy": 1.1537190973758698, "epoch": 2.881516587677725, "grad_norm": 0.2524517774581909, "learning_rate": 0.00013959054301227011, "loss": 0.19084662199020386, "mean_token_accuracy": 0.922870934009552, "num_tokens": 67500536.0, "step": 5472 }, { "entropy": 1.2264028787612915, "epoch": 2.8820431806213795, "grad_norm": 0.25612008571624756, "learning_rate": 0.00013956983294516386, "loss": 0.1767480969429016, "mean_token_accuracy": 0.9253916144371033, "num_tokens": 67512872.0, "step": 5473 }, { "entropy": 1.2065593600273132, "epoch": 2.8825697735650344, "grad_norm": 0.2584444582462311, "learning_rate": 0.0001395491211226689, "loss": 0.18127556145191193, "mean_token_accuracy": 0.9242168962955475, "num_tokens": 67525208.0, "step": 5474 }, { "entropy": 1.1801214814186096, "epoch": 2.883096366508689, "grad_norm": 0.24572916328907013, "learning_rate": 0.00013952840754601488, "loss": 0.18749801814556122, "mean_token_accuracy": 0.9196372032165527, "num_tokens": 67537544.0, "step": 5475 }, { "entropy": 1.2200948596000671, "epoch": 2.8836229594523433, "grad_norm": 0.281856507062912, "learning_rate": 0.0001395076922164314, "loss": 0.194240540266037, "mean_token_accuracy": 0.9169766008853912, "num_tokens": 67549880.0, "step": 5476 }, { "entropy": 1.2109468281269073, "epoch": 2.884149552395998, "grad_norm": 0.28432926535606384, "learning_rate": 0.00013948697513514822, "loss": 0.18888379633426666, "mean_token_accuracy": 0.9218895584344864, "num_tokens": 67562216.0, "step": 5477 }, { "entropy": 1.1744347214698792, "epoch": 2.8846761453396526, "grad_norm": 0.24902574717998505, "learning_rate": 0.00013946625630339518, "loss": 0.1767992079257965, "mean_token_accuracy": 0.926706999540329, "num_tokens": 67574552.0, "step": 5478 }, { "entropy": 1.1746321320533752, "epoch": 2.885202738283307, "grad_norm": 0.2674560546875, "learning_rate": 0.00013944553572240226, "loss": 0.1794002652168274, "mean_token_accuracy": 0.9238214045763016, "num_tokens": 67586888.0, "step": 5479 }, { "entropy": 1.1886841356754303, "epoch": 2.8857293312269614, "grad_norm": 0.28249746561050415, "learning_rate": 0.0001394248133933995, "loss": 0.19088155031204224, "mean_token_accuracy": 0.919599786400795, "num_tokens": 67599224.0, "step": 5480 }, { "entropy": 1.1575458347797394, "epoch": 2.8862559241706163, "grad_norm": 0.2625466585159302, "learning_rate": 0.00013940408931761706, "loss": 0.18857283890247345, "mean_token_accuracy": 0.9230266064405441, "num_tokens": 67611560.0, "step": 5481 }, { "entropy": 1.164193332195282, "epoch": 2.8867825171142707, "grad_norm": 0.2611542046070099, "learning_rate": 0.00013938336349628524, "loss": 0.1958429515361786, "mean_token_accuracy": 0.9188902080059052, "num_tokens": 67623896.0, "step": 5482 }, { "entropy": 1.1729185581207275, "epoch": 2.887309110057925, "grad_norm": 0.2818647623062134, "learning_rate": 0.00013936263593063438, "loss": 0.20438428223133087, "mean_token_accuracy": 0.9178862571716309, "num_tokens": 67636232.0, "step": 5483 }, { "entropy": 1.2090890109539032, "epoch": 2.8878357030015795, "grad_norm": 0.27847352623939514, "learning_rate": 0.00013934190662189496, "loss": 0.19311118125915527, "mean_token_accuracy": 0.920319065451622, "num_tokens": 67648568.0, "step": 5484 }, { "entropy": 1.1742522418498993, "epoch": 2.8883622959452344, "grad_norm": 0.2799610197544098, "learning_rate": 0.00013932117557129755, "loss": 0.20451730489730835, "mean_token_accuracy": 0.9123682975769043, "num_tokens": 67660904.0, "step": 5485 }, { "entropy": 1.1871919333934784, "epoch": 2.888888888888889, "grad_norm": 0.27488139271736145, "learning_rate": 0.00013930044278007283, "loss": 0.1982969343662262, "mean_token_accuracy": 0.9207281917333603, "num_tokens": 67673240.0, "step": 5486 }, { "entropy": 1.2073151469230652, "epoch": 2.8894154818325433, "grad_norm": 0.28361013531684875, "learning_rate": 0.00013927970824945165, "loss": 0.19221793115139008, "mean_token_accuracy": 0.9205655306577682, "num_tokens": 67685576.0, "step": 5487 }, { "entropy": 1.1463909447193146, "epoch": 2.889942074776198, "grad_norm": 0.2542709708213806, "learning_rate": 0.0001392589719806648, "loss": 0.18216948211193085, "mean_token_accuracy": 0.9249231219291687, "num_tokens": 67697912.0, "step": 5488 }, { "entropy": 1.1823024451732635, "epoch": 2.8904686677198526, "grad_norm": 0.28278055787086487, "learning_rate": 0.00013923823397494334, "loss": 0.18571798503398895, "mean_token_accuracy": 0.9252088069915771, "num_tokens": 67710248.0, "step": 5489 }, { "entropy": 1.1500611007213593, "epoch": 2.890995260663507, "grad_norm": 0.2649606764316559, "learning_rate": 0.00013921749423351833, "loss": 0.18341246247291565, "mean_token_accuracy": 0.925861045718193, "num_tokens": 67722584.0, "step": 5490 }, { "entropy": 1.1709353029727936, "epoch": 2.891521853607162, "grad_norm": 0.2752512991428375, "learning_rate": 0.00013919675275762098, "loss": 0.18391147255897522, "mean_token_accuracy": 0.9232052862644196, "num_tokens": 67734920.0, "step": 5491 }, { "entropy": 1.1525313258171082, "epoch": 2.8920484465508163, "grad_norm": 0.3017459213733673, "learning_rate": 0.0001391760095484826, "loss": 0.20819026231765747, "mean_token_accuracy": 0.9137952923774719, "num_tokens": 67747256.0, "step": 5492 }, { "entropy": 1.1915410459041595, "epoch": 2.8925750394944707, "grad_norm": 0.26276955008506775, "learning_rate": 0.00013915526460733462, "loss": 0.17978140711784363, "mean_token_accuracy": 0.9292542785406113, "num_tokens": 67759592.0, "step": 5493 }, { "entropy": 1.2160204350948334, "epoch": 2.8931016324381256, "grad_norm": 0.28528469800949097, "learning_rate": 0.00013913451793540844, "loss": 0.19692108035087585, "mean_token_accuracy": 0.9169259369373322, "num_tokens": 67771928.0, "step": 5494 }, { "entropy": 1.1477001011371613, "epoch": 2.89362822538178, "grad_norm": 0.2837713956832886, "learning_rate": 0.00013911376953393577, "loss": 0.18914955854415894, "mean_token_accuracy": 0.9206328988075256, "num_tokens": 67784264.0, "step": 5495 }, { "entropy": 1.157814860343933, "epoch": 2.8941548183254344, "grad_norm": 0.2714032530784607, "learning_rate": 0.00013909301940414828, "loss": 0.1825396716594696, "mean_token_accuracy": 0.9275189191102982, "num_tokens": 67796600.0, "step": 5496 }, { "entropy": 1.1470504999160767, "epoch": 2.894681411269089, "grad_norm": 0.2933061420917511, "learning_rate": 0.00013907226754727783, "loss": 0.19350317120552063, "mean_token_accuracy": 0.9198871105909348, "num_tokens": 67808936.0, "step": 5497 }, { "entropy": 1.1557423174381256, "epoch": 2.8952080042127437, "grad_norm": 0.26497289538383484, "learning_rate": 0.00013905151396455628, "loss": 0.18695615231990814, "mean_token_accuracy": 0.9201800376176834, "num_tokens": 67821272.0, "step": 5498 }, { "entropy": 1.2245990633964539, "epoch": 2.895734597156398, "grad_norm": 0.31506285071372986, "learning_rate": 0.0001390307586572156, "loss": 0.19346579909324646, "mean_token_accuracy": 0.9197398275136948, "num_tokens": 67833608.0, "step": 5499 }, { "entropy": 1.194277048110962, "epoch": 2.8962611901000526, "grad_norm": 0.3318503499031067, "learning_rate": 0.0001390100016264881, "loss": 0.19116128981113434, "mean_token_accuracy": 0.923472136259079, "num_tokens": 67845944.0, "step": 5500 }, { "entropy": 1.147051066160202, "epoch": 2.896787783043707, "grad_norm": 0.2742278575897217, "learning_rate": 0.00013898924287360584, "loss": 0.2055630087852478, "mean_token_accuracy": 0.9172082245349884, "num_tokens": 67858280.0, "step": 5501 }, { "entropy": 1.1588106751441956, "epoch": 2.897314375987362, "grad_norm": 0.27538150548934937, "learning_rate": 0.00013896848239980118, "loss": 0.1679210364818573, "mean_token_accuracy": 0.9297711849212646, "num_tokens": 67870616.0, "step": 5502 }, { "entropy": 1.1855699121952057, "epoch": 2.8978409689310163, "grad_norm": 0.2715197801589966, "learning_rate": 0.00013894772020630656, "loss": 0.20283342897891998, "mean_token_accuracy": 0.9191963374614716, "num_tokens": 67882952.0, "step": 5503 }, { "entropy": 1.1894906759262085, "epoch": 2.8983675618746707, "grad_norm": 0.28704389929771423, "learning_rate": 0.00013892695629435454, "loss": 0.19675171375274658, "mean_token_accuracy": 0.9200365841388702, "num_tokens": 67895288.0, "step": 5504 }, { "entropy": 1.160377025604248, "epoch": 2.8988941548183256, "grad_norm": 0.2784435451030731, "learning_rate": 0.0001389061906651777, "loss": 0.18051111698150635, "mean_token_accuracy": 0.9258342087268829, "num_tokens": 67907624.0, "step": 5505 }, { "entropy": 1.1449159979820251, "epoch": 2.89942074776198, "grad_norm": 0.2636511027812958, "learning_rate": 0.00013888542332000882, "loss": 0.17140930891036987, "mean_token_accuracy": 0.9295295923948288, "num_tokens": 67919960.0, "step": 5506 }, { "entropy": 1.1670503914356232, "epoch": 2.8999473407056344, "grad_norm": 0.2751680612564087, "learning_rate": 0.00013886465426008067, "loss": 0.19141370058059692, "mean_token_accuracy": 0.9227615296840668, "num_tokens": 67932296.0, "step": 5507 }, { "entropy": 1.176351010799408, "epoch": 2.9004739336492893, "grad_norm": 0.2705549895763397, "learning_rate": 0.0001388438834866263, "loss": 0.19590432941913605, "mean_token_accuracy": 0.9217877984046936, "num_tokens": 67944632.0, "step": 5508 }, { "entropy": 1.1857755184173584, "epoch": 2.9010005265929437, "grad_norm": 0.2822164297103882, "learning_rate": 0.00013882311100087862, "loss": 0.20122680068016052, "mean_token_accuracy": 0.9154031872749329, "num_tokens": 67956968.0, "step": 5509 }, { "entropy": 1.1495457887649536, "epoch": 2.901527119536598, "grad_norm": 0.29185017943382263, "learning_rate": 0.00013880233680407087, "loss": 0.190867617726326, "mean_token_accuracy": 0.9220561236143112, "num_tokens": 67969304.0, "step": 5510 }, { "entropy": 1.106411337852478, "epoch": 2.902053712480253, "grad_norm": 0.24719662964344025, "learning_rate": 0.0001387815608974362, "loss": 0.1714990735054016, "mean_token_accuracy": 0.9271316230297089, "num_tokens": 67981640.0, "step": 5511 }, { "entropy": 1.1132754385471344, "epoch": 2.9025803054239074, "grad_norm": 0.2547193765640259, "learning_rate": 0.0001387607832822081, "loss": 0.1815553456544876, "mean_token_accuracy": 0.9266224503517151, "num_tokens": 67993976.0, "step": 5512 }, { "entropy": 1.1470238864421844, "epoch": 2.903106898367562, "grad_norm": 0.27963170409202576, "learning_rate": 0.00013874000395961987, "loss": 0.19604888558387756, "mean_token_accuracy": 0.9155842065811157, "num_tokens": 68006312.0, "step": 5513 }, { "entropy": 1.1404377818107605, "epoch": 2.9036334913112163, "grad_norm": 0.2531251013278961, "learning_rate": 0.0001387192229309051, "loss": 0.17346608638763428, "mean_token_accuracy": 0.9276323318481445, "num_tokens": 68018648.0, "step": 5514 }, { "entropy": 1.1547462940216064, "epoch": 2.9041600842548707, "grad_norm": 0.2719525396823883, "learning_rate": 0.0001386984401972975, "loss": 0.19307196140289307, "mean_token_accuracy": 0.9185868501663208, "num_tokens": 68030984.0, "step": 5515 }, { "entropy": 1.154180645942688, "epoch": 2.9046866771985256, "grad_norm": 0.28286588191986084, "learning_rate": 0.00013867765576003075, "loss": 0.19983167946338654, "mean_token_accuracy": 0.919625997543335, "num_tokens": 68043320.0, "step": 5516 }, { "entropy": 1.1318946182727814, "epoch": 2.90521327014218, "grad_norm": 0.2880934476852417, "learning_rate": 0.00013865686962033876, "loss": 0.2102263867855072, "mean_token_accuracy": 0.9138824343681335, "num_tokens": 68055656.0, "step": 5517 }, { "entropy": 1.17483389377594, "epoch": 2.9057398630858344, "grad_norm": 0.2941156029701233, "learning_rate": 0.0001386360817794554, "loss": 0.19800475239753723, "mean_token_accuracy": 0.9159929603338242, "num_tokens": 68067992.0, "step": 5518 }, { "entropy": 1.1367288827896118, "epoch": 2.9062664560294893, "grad_norm": 0.2663951516151428, "learning_rate": 0.00013861529223861476, "loss": 0.18763451278209686, "mean_token_accuracy": 0.9239258766174316, "num_tokens": 68080328.0, "step": 5519 }, { "entropy": 1.1588850617408752, "epoch": 2.9067930489731437, "grad_norm": 0.2822934091091156, "learning_rate": 0.00013859450099905102, "loss": 0.1937345266342163, "mean_token_accuracy": 0.9200102388858795, "num_tokens": 68092664.0, "step": 5520 }, { "entropy": 1.1312378942966461, "epoch": 2.907319641916798, "grad_norm": 0.29542550444602966, "learning_rate": 0.00013857370806199843, "loss": 0.22057875990867615, "mean_token_accuracy": 0.9083669930696487, "num_tokens": 68105000.0, "step": 5521 }, { "entropy": 1.1559078097343445, "epoch": 2.907846234860453, "grad_norm": 0.281016081571579, "learning_rate": 0.0001385529134286913, "loss": 0.20015105605125427, "mean_token_accuracy": 0.9185057580471039, "num_tokens": 68117336.0, "step": 5522 }, { "entropy": 1.1671436727046967, "epoch": 2.9083728278041074, "grad_norm": 0.27406924962997437, "learning_rate": 0.00013853211710036415, "loss": 0.19811135530471802, "mean_token_accuracy": 0.9185190796852112, "num_tokens": 68129672.0, "step": 5523 }, { "entropy": 1.1776782274246216, "epoch": 2.908899420747762, "grad_norm": 0.26774463057518005, "learning_rate": 0.00013851131907825152, "loss": 0.1784535050392151, "mean_token_accuracy": 0.9311188608407974, "num_tokens": 68142008.0, "step": 5524 }, { "entropy": 1.1597624719142914, "epoch": 2.9094260136914167, "grad_norm": 0.29032954573631287, "learning_rate": 0.000138490519363588, "loss": 0.1870250701904297, "mean_token_accuracy": 0.921985000371933, "num_tokens": 68154344.0, "step": 5525 }, { "entropy": 1.198120653629303, "epoch": 2.909952606635071, "grad_norm": 0.295183390378952, "learning_rate": 0.00013846971795760844, "loss": 0.1946275234222412, "mean_token_accuracy": 0.9213293045759201, "num_tokens": 68166680.0, "step": 5526 }, { "entropy": 1.1845296919345856, "epoch": 2.9104791995787256, "grad_norm": 0.2734968662261963, "learning_rate": 0.00013844891486154766, "loss": 0.19152450561523438, "mean_token_accuracy": 0.9245569109916687, "num_tokens": 68179016.0, "step": 5527 }, { "entropy": 1.1325328648090363, "epoch": 2.9110057925223805, "grad_norm": 0.2562635540962219, "learning_rate": 0.0001384281100766406, "loss": 0.15855859220027924, "mean_token_accuracy": 0.9361820667982101, "num_tokens": 68191352.0, "step": 5528 }, { "entropy": 1.1461539268493652, "epoch": 2.911532385466035, "grad_norm": 0.29077833890914917, "learning_rate": 0.00013840730360412234, "loss": 0.19791193306446075, "mean_token_accuracy": 0.9110380262136459, "num_tokens": 68203688.0, "step": 5529 }, { "entropy": 1.1295833885669708, "epoch": 2.9120589784096893, "grad_norm": 0.30538904666900635, "learning_rate": 0.00013838649544522803, "loss": 0.20151552557945251, "mean_token_accuracy": 0.9133839756250381, "num_tokens": 68216024.0, "step": 5530 }, { "entropy": 1.0852110385894775, "epoch": 2.9125855713533437, "grad_norm": 0.2697118818759918, "learning_rate": 0.00013836568560119297, "loss": 0.19141703844070435, "mean_token_accuracy": 0.920340895652771, "num_tokens": 68228360.0, "step": 5531 }, { "entropy": 1.0908479988574982, "epoch": 2.913112164296998, "grad_norm": 0.2654431462287903, "learning_rate": 0.00013834487407325246, "loss": 0.17703814804553986, "mean_token_accuracy": 0.928848385810852, "num_tokens": 68240696.0, "step": 5532 }, { "entropy": 1.102216750383377, "epoch": 2.913638757240653, "grad_norm": 0.2828739285469055, "learning_rate": 0.000138324060862642, "loss": 0.19559074938297272, "mean_token_accuracy": 0.9155698269605637, "num_tokens": 68253032.0, "step": 5533 }, { "entropy": 1.0754432678222656, "epoch": 2.9141653501843074, "grad_norm": 0.25650569796562195, "learning_rate": 0.00013830324597059707, "loss": 0.1764622926712036, "mean_token_accuracy": 0.9295746833086014, "num_tokens": 68265368.0, "step": 5534 }, { "entropy": 1.1392635107040405, "epoch": 2.914691943127962, "grad_norm": 0.28012871742248535, "learning_rate": 0.00013828242939835342, "loss": 0.18477457761764526, "mean_token_accuracy": 0.9233775585889816, "num_tokens": 68277704.0, "step": 5535 }, { "entropy": 1.0746980011463165, "epoch": 2.9152185360716167, "grad_norm": 0.2698800265789032, "learning_rate": 0.00013826161114714682, "loss": 0.17916232347488403, "mean_token_accuracy": 0.9196085929870605, "num_tokens": 68290040.0, "step": 5536 }, { "entropy": 1.0633073151111603, "epoch": 2.915745129015271, "grad_norm": 0.291299432516098, "learning_rate": 0.00013824079121821305, "loss": 0.20749138295650482, "mean_token_accuracy": 0.9145458191633224, "num_tokens": 68302376.0, "step": 5537 }, { "entropy": 1.0806976854801178, "epoch": 2.9162717219589256, "grad_norm": 0.2732320725917816, "learning_rate": 0.0001382199696127881, "loss": 0.16982217133045197, "mean_token_accuracy": 0.9300663471221924, "num_tokens": 68314712.0, "step": 5538 }, { "entropy": 1.1155247688293457, "epoch": 2.9167983149025805, "grad_norm": 0.2718318700790405, "learning_rate": 0.00013819914633210806, "loss": 0.1862022876739502, "mean_token_accuracy": 0.9197591245174408, "num_tokens": 68327048.0, "step": 5539 }, { "entropy": 1.0436288714408875, "epoch": 2.917324907846235, "grad_norm": 0.27272531390190125, "learning_rate": 0.00013817832137740904, "loss": 0.18183693289756775, "mean_token_accuracy": 0.9253615438938141, "num_tokens": 68339384.0, "step": 5540 }, { "entropy": 1.080330640077591, "epoch": 2.9178515007898893, "grad_norm": 0.26378878951072693, "learning_rate": 0.00013815749474992733, "loss": 0.18048113584518433, "mean_token_accuracy": 0.9251774549484253, "num_tokens": 68351720.0, "step": 5541 }, { "entropy": 1.0835255086421967, "epoch": 2.918378093733544, "grad_norm": 0.2663480043411255, "learning_rate": 0.00013813666645089926, "loss": 0.1744183599948883, "mean_token_accuracy": 0.9293684512376785, "num_tokens": 68364056.0, "step": 5542 }, { "entropy": 1.0906038284301758, "epoch": 2.9189046866771986, "grad_norm": 0.27525952458381653, "learning_rate": 0.0001381158364815613, "loss": 0.1827646642923355, "mean_token_accuracy": 0.9212264567613602, "num_tokens": 68376392.0, "step": 5543 }, { "entropy": 1.0514227747917175, "epoch": 2.919431279620853, "grad_norm": 0.26160329580307007, "learning_rate": 0.00013809500484314997, "loss": 0.17371343076229095, "mean_token_accuracy": 0.9279900044202805, "num_tokens": 68388728.0, "step": 5544 }, { "entropy": 1.0968440175056458, "epoch": 2.919957872564508, "grad_norm": 0.2624936103820801, "learning_rate": 0.000138074171536902, "loss": 0.17753034830093384, "mean_token_accuracy": 0.9319224506616592, "num_tokens": 68401064.0, "step": 5545 }, { "entropy": 1.1374029517173767, "epoch": 2.9204844655081623, "grad_norm": 0.32361873984336853, "learning_rate": 0.0001380533365640541, "loss": 0.22792309522628784, "mean_token_accuracy": 0.9060098677873611, "num_tokens": 68413400.0, "step": 5546 }, { "entropy": 1.12219899892807, "epoch": 2.9210110584518167, "grad_norm": 0.30003783106803894, "learning_rate": 0.00013803249992584308, "loss": 0.19746218621730804, "mean_token_accuracy": 0.9168110936880112, "num_tokens": 68425736.0, "step": 5547 }, { "entropy": 1.1274137794971466, "epoch": 2.921537651395471, "grad_norm": 0.29291093349456787, "learning_rate": 0.0001380116616235059, "loss": 0.19064177572727203, "mean_token_accuracy": 0.9205840528011322, "num_tokens": 68438072.0, "step": 5548 }, { "entropy": 1.0552725493907928, "epoch": 2.9220642443391256, "grad_norm": 0.275552898645401, "learning_rate": 0.0001379908216582797, "loss": 0.19442486763000488, "mean_token_accuracy": 0.9182971268892288, "num_tokens": 68450408.0, "step": 5549 }, { "entropy": 1.129012256860733, "epoch": 2.9225908372827805, "grad_norm": 0.28331005573272705, "learning_rate": 0.0001379699800314015, "loss": 0.1991719901561737, "mean_token_accuracy": 0.9190961122512817, "num_tokens": 68462744.0, "step": 5550 }, { "entropy": 1.1428042948246002, "epoch": 2.923117430226435, "grad_norm": 0.2907262146472931, "learning_rate": 0.00013794913674410866, "loss": 0.1955050528049469, "mean_token_accuracy": 0.9185226857662201, "num_tokens": 68475080.0, "step": 5551 }, { "entropy": 1.1355925500392914, "epoch": 2.9236440231700893, "grad_norm": 0.2629597783088684, "learning_rate": 0.00013792829179763843, "loss": 0.16810822486877441, "mean_token_accuracy": 0.9289321601390839, "num_tokens": 68487416.0, "step": 5552 }, { "entropy": 1.1617874205112457, "epoch": 2.924170616113744, "grad_norm": 0.27793678641319275, "learning_rate": 0.0001379074451932283, "loss": 0.19166631996631622, "mean_token_accuracy": 0.9207886010408401, "num_tokens": 68499752.0, "step": 5553 }, { "entropy": 1.1701002717018127, "epoch": 2.9246972090573986, "grad_norm": 0.2866170108318329, "learning_rate": 0.00013788659693211584, "loss": 0.19832077622413635, "mean_token_accuracy": 0.919544905424118, "num_tokens": 68512088.0, "step": 5554 }, { "entropy": 1.1990052163600922, "epoch": 2.925223802001053, "grad_norm": 0.30915117263793945, "learning_rate": 0.00013786574701553866, "loss": 0.2161540687084198, "mean_token_accuracy": 0.9073906093835831, "num_tokens": 68524424.0, "step": 5555 }, { "entropy": 1.2210666835308075, "epoch": 2.925750394944708, "grad_norm": 0.28099068999290466, "learning_rate": 0.00013784489544473445, "loss": 0.2011336386203766, "mean_token_accuracy": 0.9171841740608215, "num_tokens": 68536760.0, "step": 5556 }, { "entropy": 1.181823045015335, "epoch": 2.9262769878883623, "grad_norm": 0.2659522593021393, "learning_rate": 0.00013782404222094109, "loss": 0.17810407280921936, "mean_token_accuracy": 0.924164891242981, "num_tokens": 68549096.0, "step": 5557 }, { "entropy": 1.157679796218872, "epoch": 2.9268035808320167, "grad_norm": 0.27199587225914, "learning_rate": 0.00013780318734539653, "loss": 0.1843995898962021, "mean_token_accuracy": 0.9218865782022476, "num_tokens": 68561432.0, "step": 5558 }, { "entropy": 1.192594975233078, "epoch": 2.9273301737756716, "grad_norm": 0.2700129747390747, "learning_rate": 0.0001377823308193388, "loss": 0.18727098405361176, "mean_token_accuracy": 0.9208443760871887, "num_tokens": 68573768.0, "step": 5559 }, { "entropy": 1.1255095601081848, "epoch": 2.927856766719326, "grad_norm": 0.26654013991355896, "learning_rate": 0.000137761472644006, "loss": 0.1948063224554062, "mean_token_accuracy": 0.9209031462669373, "num_tokens": 68586104.0, "step": 5560 }, { "entropy": 1.2041710019111633, "epoch": 2.9283833596629805, "grad_norm": 0.27617987990379333, "learning_rate": 0.0001377406128206364, "loss": 0.2021069973707199, "mean_token_accuracy": 0.9189692735671997, "num_tokens": 68598440.0, "step": 5561 }, { "entropy": 1.1256828010082245, "epoch": 2.9289099526066353, "grad_norm": 0.2534157633781433, "learning_rate": 0.00013771975135046827, "loss": 0.17834888398647308, "mean_token_accuracy": 0.9273785054683685, "num_tokens": 68610776.0, "step": 5562 }, { "entropy": 1.1691264808177948, "epoch": 2.9294365455502898, "grad_norm": 0.30477964878082275, "learning_rate": 0.00013769888823474005, "loss": 0.20396670699119568, "mean_token_accuracy": 0.9175550490617752, "num_tokens": 68623112.0, "step": 5563 }, { "entropy": 1.1377472281455994, "epoch": 2.929963138493944, "grad_norm": 0.2771162986755371, "learning_rate": 0.0001376780234746903, "loss": 0.18264469504356384, "mean_token_accuracy": 0.922416552901268, "num_tokens": 68635448.0, "step": 5564 }, { "entropy": 1.1698735654354095, "epoch": 2.9304897314375986, "grad_norm": 0.30147019028663635, "learning_rate": 0.00013765715707155765, "loss": 0.1867901235818863, "mean_token_accuracy": 0.9241589903831482, "num_tokens": 68647784.0, "step": 5565 }, { "entropy": 1.166481763124466, "epoch": 2.931016324381253, "grad_norm": 0.2786411643028259, "learning_rate": 0.00013763628902658075, "loss": 0.17687778174877167, "mean_token_accuracy": 0.9243270307779312, "num_tokens": 68660120.0, "step": 5566 }, { "entropy": 1.1443816721439362, "epoch": 2.931542917324908, "grad_norm": 0.28672003746032715, "learning_rate": 0.00013761541934099845, "loss": 0.20579706132411957, "mean_token_accuracy": 0.9173473715782166, "num_tokens": 68672456.0, "step": 5567 }, { "entropy": 1.1425879895687103, "epoch": 2.9320695102685623, "grad_norm": 0.28145724534988403, "learning_rate": 0.00013759454801604966, "loss": 0.2017051726579666, "mean_token_accuracy": 0.915640190243721, "num_tokens": 68684792.0, "step": 5568 }, { "entropy": 1.2048570811748505, "epoch": 2.9325961032122168, "grad_norm": 0.3142516613006592, "learning_rate": 0.00013757367505297336, "loss": 0.20900258421897888, "mean_token_accuracy": 0.9165971428155899, "num_tokens": 68697128.0, "step": 5569 }, { "entropy": 1.1582045555114746, "epoch": 2.9331226961558716, "grad_norm": 0.2675777077674866, "learning_rate": 0.00013755280045300874, "loss": 0.18169574439525604, "mean_token_accuracy": 0.9225203096866608, "num_tokens": 68709464.0, "step": 5570 }, { "entropy": 1.1519646644592285, "epoch": 2.933649289099526, "grad_norm": 0.2735153138637543, "learning_rate": 0.00013753192421739493, "loss": 0.1958380937576294, "mean_token_accuracy": 0.9182684272527695, "num_tokens": 68721800.0, "step": 5571 }, { "entropy": 1.1638001501560211, "epoch": 2.9341758820431805, "grad_norm": 0.2899276316165924, "learning_rate": 0.0001375110463473712, "loss": 0.17327781021595, "mean_token_accuracy": 0.9242293983697891, "num_tokens": 68734136.0, "step": 5572 }, { "entropy": 1.2003310024738312, "epoch": 2.9347024749868353, "grad_norm": 0.2884262502193451, "learning_rate": 0.00013749016684417702, "loss": 0.18135476112365723, "mean_token_accuracy": 0.9279640018939972, "num_tokens": 68746472.0, "step": 5573 }, { "entropy": 1.1927189528942108, "epoch": 2.9352290679304898, "grad_norm": 0.28940659761428833, "learning_rate": 0.00013746928570905188, "loss": 0.18795032799243927, "mean_token_accuracy": 0.9253685474395752, "num_tokens": 68758808.0, "step": 5574 }, { "entropy": 1.1657047271728516, "epoch": 2.935755660874144, "grad_norm": 0.2832283079624176, "learning_rate": 0.00013744840294323537, "loss": 0.18321970105171204, "mean_token_accuracy": 0.9225218445062637, "num_tokens": 68771144.0, "step": 5575 }, { "entropy": 1.152781069278717, "epoch": 2.936282253817799, "grad_norm": 0.28583258390426636, "learning_rate": 0.00013742751854796712, "loss": 0.1874796450138092, "mean_token_accuracy": 0.922102153301239, "num_tokens": 68783480.0, "step": 5576 }, { "entropy": 1.2105313837528229, "epoch": 2.9368088467614535, "grad_norm": 0.27317848801612854, "learning_rate": 0.00013740663252448694, "loss": 0.18234558403491974, "mean_token_accuracy": 0.9219536781311035, "num_tokens": 68795816.0, "step": 5577 }, { "entropy": 1.2403792440891266, "epoch": 2.937335439705108, "grad_norm": 0.2711533010005951, "learning_rate": 0.00013738574487403475, "loss": 0.19365224242210388, "mean_token_accuracy": 0.9241596162319183, "num_tokens": 68808152.0, "step": 5578 }, { "entropy": 1.1860476732254028, "epoch": 2.9378620326487628, "grad_norm": 0.2992393970489502, "learning_rate": 0.00013736485559785047, "loss": 0.1919434666633606, "mean_token_accuracy": 0.9213222712278366, "num_tokens": 68820488.0, "step": 5579 }, { "entropy": 1.2470246851444244, "epoch": 2.938388625592417, "grad_norm": 0.287310391664505, "learning_rate": 0.00013734396469717425, "loss": 0.19495737552642822, "mean_token_accuracy": 0.9231348186731339, "num_tokens": 68832824.0, "step": 5580 }, { "entropy": 1.2436520159244537, "epoch": 2.9389152185360716, "grad_norm": 0.3332797586917877, "learning_rate": 0.00013732307217324623, "loss": 0.19875866174697876, "mean_token_accuracy": 0.9161509722471237, "num_tokens": 68845160.0, "step": 5581 }, { "entropy": 1.2003789842128754, "epoch": 2.939441811479726, "grad_norm": 0.2667289972305298, "learning_rate": 0.00013730217802730664, "loss": 0.16958105564117432, "mean_token_accuracy": 0.9293218553066254, "num_tokens": 68857496.0, "step": 5582 }, { "entropy": 1.1950378119945526, "epoch": 2.9399684044233805, "grad_norm": 0.2579761743545532, "learning_rate": 0.00013728128226059584, "loss": 0.18693850934505463, "mean_token_accuracy": 0.9228319078683853, "num_tokens": 68869832.0, "step": 5583 }, { "entropy": 1.2720504403114319, "epoch": 2.9404949973670353, "grad_norm": 0.2997112572193146, "learning_rate": 0.00013726038487435436, "loss": 0.2124652862548828, "mean_token_accuracy": 0.9126077145338058, "num_tokens": 68882168.0, "step": 5584 }, { "entropy": 1.228448748588562, "epoch": 2.9410215903106898, "grad_norm": 0.2893296182155609, "learning_rate": 0.00013723948586982275, "loss": 0.2037881761789322, "mean_token_accuracy": 0.9126189202070236, "num_tokens": 68894504.0, "step": 5585 }, { "entropy": 1.1871382594108582, "epoch": 2.941548183254344, "grad_norm": 0.26550090312957764, "learning_rate": 0.00013721858524824157, "loss": 0.19779062271118164, "mean_token_accuracy": 0.9172335267066956, "num_tokens": 68906840.0, "step": 5586 }, { "entropy": 1.2471431493759155, "epoch": 2.942074776197999, "grad_norm": 0.29272446036338806, "learning_rate": 0.0001371976830108516, "loss": 0.19359451532363892, "mean_token_accuracy": 0.9180149137973785, "num_tokens": 68919176.0, "step": 5587 }, { "entropy": 1.2173875868320465, "epoch": 2.9426013691416535, "grad_norm": 0.29134252667427063, "learning_rate": 0.00013717677915889377, "loss": 0.2119414508342743, "mean_token_accuracy": 0.9115025997161865, "num_tokens": 68931512.0, "step": 5588 }, { "entropy": 1.2124152481555939, "epoch": 2.943127962085308, "grad_norm": 0.2665821313858032, "learning_rate": 0.00013715587369360894, "loss": 0.17928844690322876, "mean_token_accuracy": 0.9267236292362213, "num_tokens": 68943848.0, "step": 5589 }, { "entropy": 1.2175507247447968, "epoch": 2.943654555028963, "grad_norm": 0.28769803047180176, "learning_rate": 0.00013713496661623816, "loss": 0.19170348346233368, "mean_token_accuracy": 0.9222258031368256, "num_tokens": 68956184.0, "step": 5590 }, { "entropy": 1.2272031605243683, "epoch": 2.944181147972617, "grad_norm": 0.27572914958000183, "learning_rate": 0.00013711405792802257, "loss": 0.18151387572288513, "mean_token_accuracy": 0.9221614301204681, "num_tokens": 68968520.0, "step": 5591 }, { "entropy": 1.2204799950122833, "epoch": 2.9447077409162716, "grad_norm": 0.27613502740859985, "learning_rate": 0.0001370931476302034, "loss": 0.2014046609401703, "mean_token_accuracy": 0.9178587943315506, "num_tokens": 68980856.0, "step": 5592 }, { "entropy": 1.231167882680893, "epoch": 2.9452343338599265, "grad_norm": 0.2966768443584442, "learning_rate": 0.00013707223572402197, "loss": 0.21449437737464905, "mean_token_accuracy": 0.908181220293045, "num_tokens": 68993192.0, "step": 5593 }, { "entropy": 1.2601788640022278, "epoch": 2.945760926803581, "grad_norm": 0.28138867020606995, "learning_rate": 0.00013705132221071968, "loss": 0.17587848007678986, "mean_token_accuracy": 0.9247183203697205, "num_tokens": 69005528.0, "step": 5594 }, { "entropy": 1.1992701292037964, "epoch": 2.9462875197472354, "grad_norm": 0.2590610384941101, "learning_rate": 0.00013703040709153806, "loss": 0.1704290211200714, "mean_token_accuracy": 0.9288462251424789, "num_tokens": 69017864.0, "step": 5595 }, { "entropy": 1.2185679376125336, "epoch": 2.94681411269089, "grad_norm": 0.2668219208717346, "learning_rate": 0.00013700949036771874, "loss": 0.16232874989509583, "mean_token_accuracy": 0.9315534979104996, "num_tokens": 69030200.0, "step": 5596 }, { "entropy": 1.1763940453529358, "epoch": 2.9473407056345446, "grad_norm": 0.2598697245121002, "learning_rate": 0.00013698857204050334, "loss": 0.1769179254770279, "mean_token_accuracy": 0.9267005920410156, "num_tokens": 69042536.0, "step": 5597 }, { "entropy": 1.202961027622223, "epoch": 2.947867298578199, "grad_norm": 0.27415749430656433, "learning_rate": 0.00013696765211113375, "loss": 0.19501955807209015, "mean_token_accuracy": 0.9173151254653931, "num_tokens": 69054872.0, "step": 5598 }, { "entropy": 1.209532380104065, "epoch": 2.9483938915218535, "grad_norm": 0.2773316502571106, "learning_rate": 0.00013694673058085185, "loss": 0.17899590730667114, "mean_token_accuracy": 0.9237614125013351, "num_tokens": 69067208.0, "step": 5599 }, { "entropy": 1.1219777464866638, "epoch": 2.948920484465508, "grad_norm": 0.2790414094924927, "learning_rate": 0.00013692580745089963, "loss": 0.19162613153457642, "mean_token_accuracy": 0.9177257567644119, "num_tokens": 69079544.0, "step": 5600 }, { "entropy": 1.118897259235382, "epoch": 2.949447077409163, "grad_norm": 0.2677527666091919, "learning_rate": 0.0001369048827225191, "loss": 0.18540120124816895, "mean_token_accuracy": 0.9220905154943466, "num_tokens": 69091880.0, "step": 5601 }, { "entropy": 1.1859447062015533, "epoch": 2.949973670352817, "grad_norm": 0.3110491931438446, "learning_rate": 0.00013688395639695252, "loss": 0.1812945008277893, "mean_token_accuracy": 0.92556431889534, "num_tokens": 69104216.0, "step": 5602 }, { "entropy": 1.178531676530838, "epoch": 2.9505002632964716, "grad_norm": 0.3070037066936493, "learning_rate": 0.00013686302847544217, "loss": 0.19497287273406982, "mean_token_accuracy": 0.9196391552686691, "num_tokens": 69116552.0, "step": 5603 }, { "entropy": 1.191015750169754, "epoch": 2.9510268562401265, "grad_norm": 0.2829379141330719, "learning_rate": 0.00013684209895923038, "loss": 0.1905146837234497, "mean_token_accuracy": 0.9247777760028839, "num_tokens": 69128888.0, "step": 5604 }, { "entropy": 1.1308483183383942, "epoch": 2.951553449183781, "grad_norm": 0.27800098061561584, "learning_rate": 0.0001368211678495596, "loss": 0.17672711610794067, "mean_token_accuracy": 0.9262357801198959, "num_tokens": 69141224.0, "step": 5605 }, { "entropy": 1.0918956398963928, "epoch": 2.9520800421274354, "grad_norm": 0.25561094284057617, "learning_rate": 0.00013680023514767243, "loss": 0.17155037820339203, "mean_token_accuracy": 0.9289103746414185, "num_tokens": 69153560.0, "step": 5606 }, { "entropy": 1.1246024668216705, "epoch": 2.9526066350710902, "grad_norm": 0.27591127157211304, "learning_rate": 0.00013677930085481148, "loss": 0.18423430621623993, "mean_token_accuracy": 0.9247561097145081, "num_tokens": 69165896.0, "step": 5607 }, { "entropy": 1.1606371998786926, "epoch": 2.9531332280147446, "grad_norm": 0.291604220867157, "learning_rate": 0.00013675836497221953, "loss": 0.19698481261730194, "mean_token_accuracy": 0.9247680753469467, "num_tokens": 69178232.0, "step": 5608 }, { "entropy": 1.1188312768936157, "epoch": 2.953659820958399, "grad_norm": 0.27514177560806274, "learning_rate": 0.00013673742750113942, "loss": 0.18783308565616608, "mean_token_accuracy": 0.9232326596975327, "num_tokens": 69190568.0, "step": 5609 }, { "entropy": 1.1653947532176971, "epoch": 2.954186413902054, "grad_norm": 0.31085118651390076, "learning_rate": 0.00013671648844281408, "loss": 0.2055719643831253, "mean_token_accuracy": 0.917727917432785, "num_tokens": 69202904.0, "step": 5610 }, { "entropy": 1.1252780854701996, "epoch": 2.9547130068457084, "grad_norm": 0.3070995807647705, "learning_rate": 0.00013669554779848652, "loss": 0.19462232291698456, "mean_token_accuracy": 0.9197984337806702, "num_tokens": 69215240.0, "step": 5611 }, { "entropy": 1.1574952900409698, "epoch": 2.955239599789363, "grad_norm": 0.3188292384147644, "learning_rate": 0.0001366746055693999, "loss": 0.19384144246578217, "mean_token_accuracy": 0.9179680198431015, "num_tokens": 69227576.0, "step": 5612 }, { "entropy": 1.1276047825813293, "epoch": 2.955766192733017, "grad_norm": 0.28531914949417114, "learning_rate": 0.0001366536617567974, "loss": 0.19046741724014282, "mean_token_accuracy": 0.9173817783594131, "num_tokens": 69239912.0, "step": 5613 }, { "entropy": 1.0744889974594116, "epoch": 2.956292785676672, "grad_norm": 0.3078976571559906, "learning_rate": 0.00013663271636192234, "loss": 0.1820499300956726, "mean_token_accuracy": 0.9228551387786865, "num_tokens": 69252248.0, "step": 5614 }, { "entropy": 1.070107638835907, "epoch": 2.9568193786203265, "grad_norm": 0.2992478311061859, "learning_rate": 0.00013661176938601816, "loss": 0.19892115890979767, "mean_token_accuracy": 0.9189724177122116, "num_tokens": 69264584.0, "step": 5615 }, { "entropy": 1.1251972019672394, "epoch": 2.957345971563981, "grad_norm": 0.2962946891784668, "learning_rate": 0.00013659082083032831, "loss": 0.19916094839572906, "mean_token_accuracy": 0.9157926440238953, "num_tokens": 69276920.0, "step": 5616 }, { "entropy": 1.098711758852005, "epoch": 2.9578725645076354, "grad_norm": 0.30655038356781006, "learning_rate": 0.00013656987069609645, "loss": 0.18999090790748596, "mean_token_accuracy": 0.9222403913736343, "num_tokens": 69289256.0, "step": 5617 }, { "entropy": 1.1321788430213928, "epoch": 2.9583991574512902, "grad_norm": 0.25325635075569153, "learning_rate": 0.0001365489189845662, "loss": 0.15657661855220795, "mean_token_accuracy": 0.937756285071373, "num_tokens": 69301592.0, "step": 5618 }, { "entropy": 1.1218098402023315, "epoch": 2.9589257503949447, "grad_norm": 0.2875848412513733, "learning_rate": 0.0001365279656969814, "loss": 0.19016146659851074, "mean_token_accuracy": 0.9236724972724915, "num_tokens": 69313928.0, "step": 5619 }, { "entropy": 1.1002118289470673, "epoch": 2.959452343338599, "grad_norm": 0.23385827243328094, "learning_rate": 0.00013650701083458585, "loss": 0.16082242131233215, "mean_token_accuracy": 0.9308483749628067, "num_tokens": 69326264.0, "step": 5620 }, { "entropy": 1.1413602828979492, "epoch": 2.959978936282254, "grad_norm": 0.2711458206176758, "learning_rate": 0.0001364860543986236, "loss": 0.1713000237941742, "mean_token_accuracy": 0.9290253072977066, "num_tokens": 69338600.0, "step": 5621 }, { "entropy": 1.1146959960460663, "epoch": 2.9605055292259084, "grad_norm": 0.269614577293396, "learning_rate": 0.00013646509639033864, "loss": 0.19589899480342865, "mean_token_accuracy": 0.9199978858232498, "num_tokens": 69350936.0, "step": 5622 }, { "entropy": 1.1638236343860626, "epoch": 2.961032122169563, "grad_norm": 0.2893790304660797, "learning_rate": 0.00013644413681097517, "loss": 0.18870526552200317, "mean_token_accuracy": 0.9185014367103577, "num_tokens": 69363272.0, "step": 5623 }, { "entropy": 1.1203119456768036, "epoch": 2.9615587151132177, "grad_norm": 0.27260667085647583, "learning_rate": 0.00013642317566177746, "loss": 0.18144097924232483, "mean_token_accuracy": 0.9256602972745895, "num_tokens": 69375608.0, "step": 5624 }, { "entropy": 1.1110114455223083, "epoch": 2.962085308056872, "grad_norm": 0.27438077330589294, "learning_rate": 0.00013640221294398977, "loss": 0.1718054860830307, "mean_token_accuracy": 0.9250148683786392, "num_tokens": 69387944.0, "step": 5625 }, { "entropy": 1.1150699257850647, "epoch": 2.9626119010005265, "grad_norm": 0.2791772186756134, "learning_rate": 0.0001363812486588566, "loss": 0.193474680185318, "mean_token_accuracy": 0.9222072809934616, "num_tokens": 69400280.0, "step": 5626 }, { "entropy": 1.1526327729225159, "epoch": 2.9631384939441814, "grad_norm": 0.29484543204307556, "learning_rate": 0.00013636028280762243, "loss": 0.18960119783878326, "mean_token_accuracy": 0.922269880771637, "num_tokens": 69412616.0, "step": 5627 }, { "entropy": 1.1298829913139343, "epoch": 2.963665086887836, "grad_norm": 0.3016878664493561, "learning_rate": 0.00013633931539153195, "loss": 0.20321956276893616, "mean_token_accuracy": 0.9152559489011765, "num_tokens": 69424952.0, "step": 5628 }, { "entropy": 1.1410238444805145, "epoch": 2.9641916798314902, "grad_norm": 0.28455066680908203, "learning_rate": 0.00013631834641182982, "loss": 0.18510159850120544, "mean_token_accuracy": 0.9224362522363663, "num_tokens": 69437288.0, "step": 5629 }, { "entropy": 1.1718485355377197, "epoch": 2.9647182727751447, "grad_norm": 0.2834126055240631, "learning_rate": 0.00013629737586976087, "loss": 0.1816817671060562, "mean_token_accuracy": 0.9258575141429901, "num_tokens": 69449624.0, "step": 5630 }, { "entropy": 1.172424703836441, "epoch": 2.9652448657187995, "grad_norm": 0.3318967819213867, "learning_rate": 0.00013627640376656996, "loss": 0.20343869924545288, "mean_token_accuracy": 0.918372318148613, "num_tokens": 69461960.0, "step": 5631 }, { "entropy": 1.1813274025917053, "epoch": 2.965771458662454, "grad_norm": 0.3032076060771942, "learning_rate": 0.0001362554301035021, "loss": 0.18673169612884521, "mean_token_accuracy": 0.9254914075136185, "num_tokens": 69474296.0, "step": 5632 }, { "entropy": 1.17621248960495, "epoch": 2.9662980516061084, "grad_norm": 0.2967461347579956, "learning_rate": 0.00013623445488180242, "loss": 0.20186461508274078, "mean_token_accuracy": 0.9179050922393799, "num_tokens": 69486632.0, "step": 5633 }, { "entropy": 1.1494372189044952, "epoch": 2.966824644549763, "grad_norm": 0.2860412299633026, "learning_rate": 0.00013621347810271605, "loss": 0.18691250681877136, "mean_token_accuracy": 0.9263933897018433, "num_tokens": 69498968.0, "step": 5634 }, { "entropy": 1.218750774860382, "epoch": 2.9673512374934177, "grad_norm": 0.2923490107059479, "learning_rate": 0.00013619249976748826, "loss": 0.18676425516605377, "mean_token_accuracy": 0.9209718555212021, "num_tokens": 69511304.0, "step": 5635 }, { "entropy": 1.1901514530181885, "epoch": 2.967877830437072, "grad_norm": 0.28049829602241516, "learning_rate": 0.00013617151987736442, "loss": 0.18535064160823822, "mean_token_accuracy": 0.9233685433864594, "num_tokens": 69523640.0, "step": 5636 }, { "entropy": 1.2013523578643799, "epoch": 2.9684044233807265, "grad_norm": 0.28062236309051514, "learning_rate": 0.00013615053843358998, "loss": 0.17983686923980713, "mean_token_accuracy": 0.9255612045526505, "num_tokens": 69535976.0, "step": 5637 }, { "entropy": 1.1624835133552551, "epoch": 2.9689310163243814, "grad_norm": 0.2737025320529938, "learning_rate": 0.0001361295554374105, "loss": 0.18844152987003326, "mean_token_accuracy": 0.9273969531059265, "num_tokens": 69548312.0, "step": 5638 }, { "entropy": 1.1991266310214996, "epoch": 2.969457609268036, "grad_norm": 0.2777165174484253, "learning_rate": 0.00013610857089007162, "loss": 0.19535896182060242, "mean_token_accuracy": 0.9200830161571503, "num_tokens": 69560648.0, "step": 5639 }, { "entropy": 1.144371896982193, "epoch": 2.9699842022116902, "grad_norm": 0.2615988850593567, "learning_rate": 0.00013608758479281903, "loss": 0.1780557632446289, "mean_token_accuracy": 0.9246671944856644, "num_tokens": 69572984.0, "step": 5640 }, { "entropy": 1.1618445813655853, "epoch": 2.970510795155345, "grad_norm": 0.2715195417404175, "learning_rate": 0.0001360665971468986, "loss": 0.19814664125442505, "mean_token_accuracy": 0.9190391451120377, "num_tokens": 69585320.0, "step": 5641 }, { "entropy": 1.1613898575305939, "epoch": 2.9710373880989995, "grad_norm": 0.2754245400428772, "learning_rate": 0.00013604560795355623, "loss": 0.1853109747171402, "mean_token_accuracy": 0.921645313501358, "num_tokens": 69597656.0, "step": 5642 }, { "entropy": 1.1355976164340973, "epoch": 2.971563981042654, "grad_norm": 0.257498562335968, "learning_rate": 0.0001360246172140379, "loss": 0.17994259297847748, "mean_token_accuracy": 0.9238065183162689, "num_tokens": 69609992.0, "step": 5643 }, { "entropy": 1.112012267112732, "epoch": 2.972090573986309, "grad_norm": 0.252828985452652, "learning_rate": 0.00013600362492958976, "loss": 0.18598134815692902, "mean_token_accuracy": 0.9217955470085144, "num_tokens": 69622328.0, "step": 5644 }, { "entropy": 1.126198172569275, "epoch": 2.9726171669299633, "grad_norm": 0.26551613211631775, "learning_rate": 0.00013598263110145792, "loss": 0.19965651631355286, "mean_token_accuracy": 0.9193202555179596, "num_tokens": 69634664.0, "step": 5645 }, { "entropy": 1.1668301224708557, "epoch": 2.9731437598736177, "grad_norm": 0.28958189487457275, "learning_rate": 0.00013596163573088876, "loss": 0.18356260657310486, "mean_token_accuracy": 0.9249053448438644, "num_tokens": 69647000.0, "step": 5646 }, { "entropy": 1.1143859326839447, "epoch": 2.973670352817272, "grad_norm": 0.3172629177570343, "learning_rate": 0.00013594063881912854, "loss": 0.1905253529548645, "mean_token_accuracy": 0.921536773443222, "num_tokens": 69659336.0, "step": 5647 }, { "entropy": 1.094642162322998, "epoch": 2.974196945760927, "grad_norm": 0.2848716974258423, "learning_rate": 0.00013591964036742385, "loss": 0.19140908122062683, "mean_token_accuracy": 0.9186394363641739, "num_tokens": 69671672.0, "step": 5648 }, { "entropy": 1.1297516524791718, "epoch": 2.9747235387045814, "grad_norm": 0.2905782461166382, "learning_rate": 0.00013589864037702118, "loss": 0.19544151425361633, "mean_token_accuracy": 0.9194969236850739, "num_tokens": 69684008.0, "step": 5649 }, { "entropy": 1.0739370584487915, "epoch": 2.975250131648236, "grad_norm": 0.2813047766685486, "learning_rate": 0.00013587763884916716, "loss": 0.18597646057605743, "mean_token_accuracy": 0.9232052862644196, "num_tokens": 69696344.0, "step": 5650 }, { "entropy": 1.1179830431938171, "epoch": 2.9757767245918902, "grad_norm": 0.2737787365913391, "learning_rate": 0.00013585663578510852, "loss": 0.17890819907188416, "mean_token_accuracy": 0.928794801235199, "num_tokens": 69708680.0, "step": 5651 }, { "entropy": 1.0576025247573853, "epoch": 2.976303317535545, "grad_norm": 0.29176604747772217, "learning_rate": 0.00013583563118609217, "loss": 0.20427364110946655, "mean_token_accuracy": 0.9133568853139877, "num_tokens": 69721016.0, "step": 5652 }, { "entropy": 1.0724064707756042, "epoch": 2.9768299104791995, "grad_norm": 0.29897189140319824, "learning_rate": 0.00013581462505336494, "loss": 0.19813014566898346, "mean_token_accuracy": 0.9181051701307297, "num_tokens": 69733352.0, "step": 5653 }, { "entropy": 1.0667171627283096, "epoch": 2.977356503422854, "grad_norm": 0.2759121060371399, "learning_rate": 0.00013579361738817392, "loss": 0.18483181297779083, "mean_token_accuracy": 0.9265222549438477, "num_tokens": 69745688.0, "step": 5654 }, { "entropy": 1.0673297494649887, "epoch": 2.977883096366509, "grad_norm": 0.2818041443824768, "learning_rate": 0.00013577260819176614, "loss": 0.1941726803779602, "mean_token_accuracy": 0.9198822677135468, "num_tokens": 69758024.0, "step": 5655 }, { "entropy": 1.1064940094947815, "epoch": 2.9784096893101633, "grad_norm": 0.274727463722229, "learning_rate": 0.0001357515974653888, "loss": 0.1813822090625763, "mean_token_accuracy": 0.9252461194992065, "num_tokens": 69770360.0, "step": 5656 }, { "entropy": 1.063794195652008, "epoch": 2.9789362822538177, "grad_norm": 0.26077696681022644, "learning_rate": 0.00013573058521028925, "loss": 0.18046130239963531, "mean_token_accuracy": 0.9256167858839035, "num_tokens": 69782696.0, "step": 5657 }, { "entropy": 1.0971498489379883, "epoch": 2.9794628751974725, "grad_norm": 0.2734004259109497, "learning_rate": 0.00013570957142771482, "loss": 0.17433691024780273, "mean_token_accuracy": 0.9247601628303528, "num_tokens": 69795032.0, "step": 5658 }, { "entropy": 1.0478947162628174, "epoch": 2.979989468141127, "grad_norm": 0.25824877619743347, "learning_rate": 0.00013568855611891298, "loss": 0.17879095673561096, "mean_token_accuracy": 0.9230777621269226, "num_tokens": 69807368.0, "step": 5659 }, { "entropy": 1.059202879667282, "epoch": 2.9805160610847814, "grad_norm": 0.2494882196187973, "learning_rate": 0.00013566753928513127, "loss": 0.17027448117733002, "mean_token_accuracy": 0.9276464134454727, "num_tokens": 69819704.0, "step": 5660 }, { "entropy": 1.0435924679040909, "epoch": 2.9810426540284363, "grad_norm": 0.2691742777824402, "learning_rate": 0.00013564652092761738, "loss": 0.18695388734340668, "mean_token_accuracy": 0.9181651771068573, "num_tokens": 69832040.0, "step": 5661 }, { "entropy": 1.0967499911785126, "epoch": 2.9815692469720907, "grad_norm": 0.28094589710235596, "learning_rate": 0.000135625501047619, "loss": 0.1988556832075119, "mean_token_accuracy": 0.9151445478200912, "num_tokens": 69844376.0, "step": 5662 }, { "entropy": 1.0836659967899323, "epoch": 2.982095839915745, "grad_norm": 0.27233564853668213, "learning_rate": 0.000135604479646384, "loss": 0.19193214178085327, "mean_token_accuracy": 0.9200305938720703, "num_tokens": 69856712.0, "step": 5663 }, { "entropy": 1.1166917979717255, "epoch": 2.9826224328593995, "grad_norm": 0.27832654118537903, "learning_rate": 0.00013558345672516026, "loss": 0.1840783655643463, "mean_token_accuracy": 0.9224764257669449, "num_tokens": 69869048.0, "step": 5664 }, { "entropy": 1.071811318397522, "epoch": 2.983149025803054, "grad_norm": 0.27846652269363403, "learning_rate": 0.00013556243228519583, "loss": 0.18135033547878265, "mean_token_accuracy": 0.9215449392795563, "num_tokens": 69881384.0, "step": 5665 }, { "entropy": 1.0782484710216522, "epoch": 2.983675618746709, "grad_norm": 0.28974413871765137, "learning_rate": 0.00013554140632773874, "loss": 0.2007175236940384, "mean_token_accuracy": 0.9168247580528259, "num_tokens": 69893720.0, "step": 5666 }, { "entropy": 1.1107634007930756, "epoch": 2.9842022116903633, "grad_norm": 0.283978670835495, "learning_rate": 0.00013552037885403728, "loss": 0.17787045240402222, "mean_token_accuracy": 0.9235873967409134, "num_tokens": 69906056.0, "step": 5667 }, { "entropy": 1.107334554195404, "epoch": 2.9847288046340177, "grad_norm": 0.2613908648490906, "learning_rate": 0.00013549934986533966, "loss": 0.17772354185581207, "mean_token_accuracy": 0.9233258366584778, "num_tokens": 69918392.0, "step": 5668 }, { "entropy": 1.0990718305110931, "epoch": 2.9852553975776726, "grad_norm": 0.2806550860404968, "learning_rate": 0.00013547831936289422, "loss": 0.20128649473190308, "mean_token_accuracy": 0.9159611463546753, "num_tokens": 69930728.0, "step": 5669 }, { "entropy": 1.0974575281143188, "epoch": 2.985781990521327, "grad_norm": 0.2574922740459442, "learning_rate": 0.00013545728734794949, "loss": 0.1948179453611374, "mean_token_accuracy": 0.9183401465415955, "num_tokens": 69943064.0, "step": 5670 }, { "entropy": 1.1051023602485657, "epoch": 2.9863085834649814, "grad_norm": 0.27157384157180786, "learning_rate": 0.00013543625382175396, "loss": 0.18090611696243286, "mean_token_accuracy": 0.9248793721199036, "num_tokens": 69955400.0, "step": 5671 }, { "entropy": 1.0544289648532867, "epoch": 2.9868351764086363, "grad_norm": 0.271531879901886, "learning_rate": 0.00013541521878555633, "loss": 0.18519523739814758, "mean_token_accuracy": 0.9253270477056503, "num_tokens": 69967736.0, "step": 5672 }, { "entropy": 1.038584515452385, "epoch": 2.9873617693522907, "grad_norm": 0.26272615790367126, "learning_rate": 0.00013539418224060528, "loss": 0.18200033903121948, "mean_token_accuracy": 0.9267624914646149, "num_tokens": 69980072.0, "step": 5673 }, { "entropy": 1.1364141404628754, "epoch": 2.987888362295945, "grad_norm": 0.29418516159057617, "learning_rate": 0.0001353731441881496, "loss": 0.1954139918088913, "mean_token_accuracy": 0.9196117371320724, "num_tokens": 69992408.0, "step": 5674 }, { "entropy": 1.0358662456274033, "epoch": 2.9884149552396, "grad_norm": 0.24295592308044434, "learning_rate": 0.0001353521046294383, "loss": 0.17815330624580383, "mean_token_accuracy": 0.9219689667224884, "num_tokens": 70004744.0, "step": 5675 }, { "entropy": 1.0438331812620163, "epoch": 2.9889415481832544, "grad_norm": 0.27891722321510315, "learning_rate": 0.00013533106356572024, "loss": 0.20683948695659637, "mean_token_accuracy": 0.9159213751554489, "num_tokens": 70017080.0, "step": 5676 }, { "entropy": 1.0625006258487701, "epoch": 2.989468141126909, "grad_norm": 0.2645440995693207, "learning_rate": 0.00013531002099824465, "loss": 0.19023014605045319, "mean_token_accuracy": 0.9216374158859253, "num_tokens": 70029416.0, "step": 5677 }, { "entropy": 1.0237343311309814, "epoch": 2.9899947340705637, "grad_norm": 0.29645782709121704, "learning_rate": 0.0001352889769282606, "loss": 0.19946202635765076, "mean_token_accuracy": 0.9190236330032349, "num_tokens": 70041752.0, "step": 5678 }, { "entropy": 0.9966332167387009, "epoch": 2.990521327014218, "grad_norm": 0.27027246356010437, "learning_rate": 0.0001352679313570174, "loss": 0.1885770857334137, "mean_token_accuracy": 0.9219847321510315, "num_tokens": 70054088.0, "step": 5679 }, { "entropy": 1.020631194114685, "epoch": 2.9910479199578726, "grad_norm": 0.2740084230899811, "learning_rate": 0.00013524688428576435, "loss": 0.17383310198783875, "mean_token_accuracy": 0.9266319870948792, "num_tokens": 70066424.0, "step": 5680 }, { "entropy": 0.9709053188562393, "epoch": 2.991574512901527, "grad_norm": 0.25379857420921326, "learning_rate": 0.00013522583571575094, "loss": 0.17841334640979767, "mean_token_accuracy": 0.9239553660154343, "num_tokens": 70078760.0, "step": 5681 }, { "entropy": 1.0074795484542847, "epoch": 2.9921011058451814, "grad_norm": 0.30197978019714355, "learning_rate": 0.0001352047856482267, "loss": 0.2074137181043625, "mean_token_accuracy": 0.9108300656080246, "num_tokens": 70091096.0, "step": 5682 }, { "entropy": 1.0503327548503876, "epoch": 2.9926276987888363, "grad_norm": 0.3334502875804901, "learning_rate": 0.00013518373408444127, "loss": 0.1890716552734375, "mean_token_accuracy": 0.9206590056419373, "num_tokens": 70103432.0, "step": 5683 }, { "entropy": 0.9906752109527588, "epoch": 2.9931542917324907, "grad_norm": 0.27631211280822754, "learning_rate": 0.00013516268102564428, "loss": 0.19861096143722534, "mean_token_accuracy": 0.9207852929830551, "num_tokens": 70115768.0, "step": 5684 }, { "entropy": 1.0107875168323517, "epoch": 2.993680884676145, "grad_norm": 0.2852430045604706, "learning_rate": 0.0001351416264730856, "loss": 0.19408808648586273, "mean_token_accuracy": 0.9197646528482437, "num_tokens": 70128104.0, "step": 5685 }, { "entropy": 1.0509508550167084, "epoch": 2.9942074776198, "grad_norm": 0.2755467891693115, "learning_rate": 0.0001351205704280151, "loss": 0.19173826277256012, "mean_token_accuracy": 0.9201934188604355, "num_tokens": 70140440.0, "step": 5686 }, { "entropy": 0.9853422343730927, "epoch": 2.9947340705634544, "grad_norm": 0.2897648811340332, "learning_rate": 0.00013509951289168273, "loss": 0.1806781142950058, "mean_token_accuracy": 0.9233992248773575, "num_tokens": 70152776.0, "step": 5687 }, { "entropy": 0.9925468116998672, "epoch": 2.995260663507109, "grad_norm": 0.2701224684715271, "learning_rate": 0.00013507845386533858, "loss": 0.19695024192333221, "mean_token_accuracy": 0.9201646447181702, "num_tokens": 70165112.0, "step": 5688 }, { "entropy": 1.03090438246727, "epoch": 2.9957872564507637, "grad_norm": 0.2682291865348816, "learning_rate": 0.0001350573933502328, "loss": 0.17822284996509552, "mean_token_accuracy": 0.9288727343082428, "num_tokens": 70177448.0, "step": 5689 }, { "entropy": 1.086290031671524, "epoch": 2.996313849394418, "grad_norm": 0.28797224164009094, "learning_rate": 0.00013503633134761563, "loss": 0.20880261063575745, "mean_token_accuracy": 0.9159017503261566, "num_tokens": 70189784.0, "step": 5690 }, { "entropy": 1.0291350483894348, "epoch": 2.9968404423380726, "grad_norm": 0.27310577034950256, "learning_rate": 0.00013501526785873738, "loss": 0.1941332072019577, "mean_token_accuracy": 0.9144625663757324, "num_tokens": 70202120.0, "step": 5691 }, { "entropy": 1.062148556113243, "epoch": 2.9973670352817274, "grad_norm": 0.2835206687450409, "learning_rate": 0.00013499420288484842, "loss": 0.187083899974823, "mean_token_accuracy": 0.9213053584098816, "num_tokens": 70214456.0, "step": 5692 }, { "entropy": 1.0626972317695618, "epoch": 2.997893628225382, "grad_norm": 0.29710713028907776, "learning_rate": 0.0001349731364271994, "loss": 0.19888778030872345, "mean_token_accuracy": 0.9213065057992935, "num_tokens": 70226792.0, "step": 5693 }, { "entropy": 1.0669539272785187, "epoch": 2.9984202211690363, "grad_norm": 0.29479360580444336, "learning_rate": 0.00013495206848704078, "loss": 0.1920504868030548, "mean_token_accuracy": 0.9204203486442566, "num_tokens": 70239128.0, "step": 5694 }, { "entropy": 1.116328477859497, "epoch": 2.998946814112691, "grad_norm": 0.2870364487171173, "learning_rate": 0.0001349309990656233, "loss": 0.18787749111652374, "mean_token_accuracy": 0.9229247868061066, "num_tokens": 70251464.0, "step": 5695 }, { "entropy": 1.0815511643886566, "epoch": 2.9994734070563456, "grad_norm": 0.28028604388237, "learning_rate": 0.00013490992816419769, "loss": 0.1949234902858734, "mean_token_accuracy": 0.9191743582487106, "num_tokens": 70263800.0, "step": 5696 }, { "entropy": 1.1147053837776184, "epoch": 3.0, "grad_norm": 0.28414386510849, "learning_rate": 0.00013488885578401486, "loss": 0.18812201917171478, "mean_token_accuracy": 0.9226029217243195, "num_tokens": 70275108.0, "step": 5697 }, { "epoch": 3.0, "eval_entropy": 1.1281561226578622, "eval_loss": 0.19836974143981934, "eval_mean_token_accuracy": 0.9189834011862816, "eval_num_tokens": 70275108.0, "eval_runtime": 665.1541, "eval_samples_per_second": 8.565, "eval_steps_per_second": 2.855, "step": 5697 }, { "entropy": 1.0955340713262558, "epoch": 3.0005265929436544, "grad_norm": 0.26776036620140076, "learning_rate": 0.00013486778192632574, "loss": 0.17236140370368958, "mean_token_accuracy": 0.9287768304347992, "num_tokens": 70287444.0, "step": 5698 }, { "entropy": 1.1214534044265747, "epoch": 3.0010531858873093, "grad_norm": 0.26134249567985535, "learning_rate": 0.0001348467065923813, "loss": 0.1755731999874115, "mean_token_accuracy": 0.9287609606981277, "num_tokens": 70299780.0, "step": 5699 }, { "entropy": 1.18242946267128, "epoch": 3.0015797788309637, "grad_norm": 0.2665163576602936, "learning_rate": 0.00013482562978343274, "loss": 0.17313434183597565, "mean_token_accuracy": 0.9301868975162506, "num_tokens": 70312116.0, "step": 5700 }, { "entropy": 1.1398328244686127, "epoch": 3.002106371774618, "grad_norm": 0.2637473940849304, "learning_rate": 0.0001348045515007312, "loss": 0.1913183033466339, "mean_token_accuracy": 0.9221321642398834, "num_tokens": 70324452.0, "step": 5701 }, { "entropy": 1.1458471715450287, "epoch": 3.0026329647182726, "grad_norm": 0.2840864062309265, "learning_rate": 0.00013478347174552806, "loss": 0.1964738816022873, "mean_token_accuracy": 0.9198814779520035, "num_tokens": 70336788.0, "step": 5702 }, { "entropy": 1.1397323310375214, "epoch": 3.0031595576619274, "grad_norm": 0.27136555314064026, "learning_rate": 0.00013476239051907462, "loss": 0.17828154563903809, "mean_token_accuracy": 0.9233542084693909, "num_tokens": 70349124.0, "step": 5703 }, { "entropy": 1.1608546674251556, "epoch": 3.003686150605582, "grad_norm": 0.26567453145980835, "learning_rate": 0.0001347413078226224, "loss": 0.17471587657928467, "mean_token_accuracy": 0.9279931634664536, "num_tokens": 70361460.0, "step": 5704 }, { "entropy": 1.1472634077072144, "epoch": 3.0042127435492363, "grad_norm": 0.30112066864967346, "learning_rate": 0.0001347202236574229, "loss": 0.1816388964653015, "mean_token_accuracy": 0.923245444893837, "num_tokens": 70373796.0, "step": 5705 }, { "entropy": 1.151903212070465, "epoch": 3.004739336492891, "grad_norm": 0.293971449136734, "learning_rate": 0.00013469913802472783, "loss": 0.18356375396251678, "mean_token_accuracy": 0.9272286742925644, "num_tokens": 70386132.0, "step": 5706 }, { "entropy": 1.1657882332801819, "epoch": 3.0052659294365456, "grad_norm": 0.28911593556404114, "learning_rate": 0.0001346780509257889, "loss": 0.18047240376472473, "mean_token_accuracy": 0.9277788549661636, "num_tokens": 70398468.0, "step": 5707 }, { "entropy": 1.1399290561676025, "epoch": 3.0057925223802, "grad_norm": 0.29552772641181946, "learning_rate": 0.0001346569623618579, "loss": 0.19448219239711761, "mean_token_accuracy": 0.9166269600391388, "num_tokens": 70410804.0, "step": 5708 }, { "entropy": 1.1525852382183075, "epoch": 3.006319115323855, "grad_norm": 0.3083997070789337, "learning_rate": 0.00013463587233418677, "loss": 0.19267818331718445, "mean_token_accuracy": 0.9213844537734985, "num_tokens": 70423140.0, "step": 5709 }, { "entropy": 1.1313498616218567, "epoch": 3.0068457082675093, "grad_norm": 0.2973012626171112, "learning_rate": 0.00013461478084402745, "loss": 0.1891457885503769, "mean_token_accuracy": 0.9198461174964905, "num_tokens": 70435476.0, "step": 5710 }, { "entropy": 1.115710586309433, "epoch": 3.0073723012111637, "grad_norm": 0.290634423494339, "learning_rate": 0.00013459368789263212, "loss": 0.18500478565692902, "mean_token_accuracy": 0.9200536608695984, "num_tokens": 70447812.0, "step": 5711 }, { "entropy": 1.100893348455429, "epoch": 3.007898894154818, "grad_norm": 0.2578546702861786, "learning_rate": 0.00013457259348125287, "loss": 0.16856224834918976, "mean_token_accuracy": 0.9306410551071167, "num_tokens": 70460148.0, "step": 5712 }, { "entropy": 1.139553964138031, "epoch": 3.008425487098473, "grad_norm": 0.2893870174884796, "learning_rate": 0.00013455149761114194, "loss": 0.18014776706695557, "mean_token_accuracy": 0.9216979593038559, "num_tokens": 70472484.0, "step": 5713 }, { "entropy": 1.1330049335956573, "epoch": 3.0089520800421274, "grad_norm": 0.27027586102485657, "learning_rate": 0.0001345304002835517, "loss": 0.18928660452365875, "mean_token_accuracy": 0.9179441779851913, "num_tokens": 70484820.0, "step": 5714 }, { "entropy": 1.0694325268268585, "epoch": 3.009478672985782, "grad_norm": 0.2793356776237488, "learning_rate": 0.00013450930149973457, "loss": 0.16622862219810486, "mean_token_accuracy": 0.9302334487438202, "num_tokens": 70497156.0, "step": 5715 }, { "entropy": 1.1282596588134766, "epoch": 3.0100052659294367, "grad_norm": 0.30310606956481934, "learning_rate": 0.00013448820126094307, "loss": 0.18254932761192322, "mean_token_accuracy": 0.926398292183876, "num_tokens": 70509492.0, "step": 5716 }, { "entropy": 1.0743071734905243, "epoch": 3.010531858873091, "grad_norm": 0.2671526372432709, "learning_rate": 0.00013446709956842977, "loss": 0.17425042390823364, "mean_token_accuracy": 0.9269017428159714, "num_tokens": 70521828.0, "step": 5717 }, { "entropy": 1.140877604484558, "epoch": 3.0110584518167456, "grad_norm": 0.28673312067985535, "learning_rate": 0.0001344459964234474, "loss": 0.17692753672599792, "mean_token_accuracy": 0.9303084462881088, "num_tokens": 70534164.0, "step": 5718 }, { "entropy": 1.0774936378002167, "epoch": 3.0115850447604, "grad_norm": 0.28812918066978455, "learning_rate": 0.0001344248918272487, "loss": 0.1853148192167282, "mean_token_accuracy": 0.9222434610128403, "num_tokens": 70546500.0, "step": 5719 }, { "entropy": 1.0731661915779114, "epoch": 3.012111637704055, "grad_norm": 0.2482844740152359, "learning_rate": 0.0001344037857810865, "loss": 0.16944734752178192, "mean_token_accuracy": 0.9281590282917023, "num_tokens": 70558836.0, "step": 5720 }, { "entropy": 1.0630016028881073, "epoch": 3.0126382306477093, "grad_norm": 0.27899959683418274, "learning_rate": 0.0001343826782862138, "loss": 0.17717432975769043, "mean_token_accuracy": 0.9256823360919952, "num_tokens": 70571172.0, "step": 5721 }, { "entropy": 1.0696978271007538, "epoch": 3.0131648235913637, "grad_norm": 0.28155818581581116, "learning_rate": 0.0001343615693438836, "loss": 0.17846429347991943, "mean_token_accuracy": 0.9255829900503159, "num_tokens": 70583508.0, "step": 5722 }, { "entropy": 1.0763144791126251, "epoch": 3.0136914165350186, "grad_norm": 0.28091639280319214, "learning_rate": 0.000134340458955349, "loss": 0.165150985121727, "mean_token_accuracy": 0.9292021095752716, "num_tokens": 70595844.0, "step": 5723 }, { "entropy": 1.0497006177902222, "epoch": 3.014218009478673, "grad_norm": 0.28318631649017334, "learning_rate": 0.00013431934712186328, "loss": 0.17467093467712402, "mean_token_accuracy": 0.9236724972724915, "num_tokens": 70608180.0, "step": 5724 }, { "entropy": 1.0530437529087067, "epoch": 3.0147446024223274, "grad_norm": 0.30431923270225525, "learning_rate": 0.00013429823384467958, "loss": 0.1854005753993988, "mean_token_accuracy": 0.9183477163314819, "num_tokens": 70620516.0, "step": 5725 }, { "entropy": 1.0483869463205338, "epoch": 3.0152711953659823, "grad_norm": 0.32633599638938904, "learning_rate": 0.0001342771191250514, "loss": 0.18871113657951355, "mean_token_accuracy": 0.9216799437999725, "num_tokens": 70632852.0, "step": 5726 }, { "entropy": 1.0900256037712097, "epoch": 3.0157977883096367, "grad_norm": 0.29401761293411255, "learning_rate": 0.00013425600296423218, "loss": 0.18117111921310425, "mean_token_accuracy": 0.9225471466779709, "num_tokens": 70645188.0, "step": 5727 }, { "entropy": 1.0106222331523895, "epoch": 3.016324381253291, "grad_norm": 0.31423333287239075, "learning_rate": 0.0001342348853634754, "loss": 0.19358471035957336, "mean_token_accuracy": 0.9177974313497543, "num_tokens": 70657524.0, "step": 5728 }, { "entropy": 1.0555269122123718, "epoch": 3.0168509741969456, "grad_norm": 0.3006555438041687, "learning_rate": 0.00013421376632403474, "loss": 0.18857192993164062, "mean_token_accuracy": 0.9178750962018967, "num_tokens": 70669860.0, "step": 5729 }, { "entropy": 1.0142070949077606, "epoch": 3.0173775671406005, "grad_norm": 0.28049519658088684, "learning_rate": 0.00013419264584716388, "loss": 0.17920871078968048, "mean_token_accuracy": 0.9233438372612, "num_tokens": 70682196.0, "step": 5730 }, { "entropy": 1.0379585921764374, "epoch": 3.017904160084255, "grad_norm": 0.3113473951816559, "learning_rate": 0.0001341715239341167, "loss": 0.19308455288410187, "mean_token_accuracy": 0.9195876121520996, "num_tokens": 70694532.0, "step": 5731 }, { "entropy": 1.0213616341352463, "epoch": 3.0184307530279093, "grad_norm": 0.27108868956565857, "learning_rate": 0.000134150400586147, "loss": 0.1776331663131714, "mean_token_accuracy": 0.9214796870946884, "num_tokens": 70706868.0, "step": 5732 }, { "entropy": 1.0628427565097809, "epoch": 3.018957345971564, "grad_norm": 0.29523083567619324, "learning_rate": 0.00013412927580450876, "loss": 0.16967853903770447, "mean_token_accuracy": 0.9279854595661163, "num_tokens": 70719204.0, "step": 5733 }, { "entropy": 1.0506865829229355, "epoch": 3.0194839389152186, "grad_norm": 0.2957015037536621, "learning_rate": 0.00013410814959045607, "loss": 0.19069498777389526, "mean_token_accuracy": 0.9195856302976608, "num_tokens": 70731540.0, "step": 5734 }, { "entropy": 1.0332060009241104, "epoch": 3.020010531858873, "grad_norm": 0.2643355429172516, "learning_rate": 0.000134087021945243, "loss": 0.16467365622520447, "mean_token_accuracy": 0.9302788972854614, "num_tokens": 70743876.0, "step": 5735 }, { "entropy": 1.0697474479675293, "epoch": 3.0205371248025275, "grad_norm": 0.2627510726451874, "learning_rate": 0.0001340658928701239, "loss": 0.17428165674209595, "mean_token_accuracy": 0.9276122748851776, "num_tokens": 70756212.0, "step": 5736 }, { "entropy": 1.0646617710590363, "epoch": 3.0210637177461823, "grad_norm": 0.2824498414993286, "learning_rate": 0.00013404476236635298, "loss": 0.1826760172843933, "mean_token_accuracy": 0.9254467487335205, "num_tokens": 70768548.0, "step": 5737 }, { "entropy": 1.0966342091560364, "epoch": 3.0215903106898367, "grad_norm": 0.3121627867221832, "learning_rate": 0.00013402363043518465, "loss": 0.2022552490234375, "mean_token_accuracy": 0.9123482406139374, "num_tokens": 70780884.0, "step": 5738 }, { "entropy": 1.0816529989242554, "epoch": 3.022116903633491, "grad_norm": 0.29687079787254333, "learning_rate": 0.0001340024970778734, "loss": 0.1894153505563736, "mean_token_accuracy": 0.9202007204294205, "num_tokens": 70793220.0, "step": 5739 }, { "entropy": 1.0896082818508148, "epoch": 3.022643496577146, "grad_norm": 0.2755042016506195, "learning_rate": 0.00013398136229567383, "loss": 0.16922765970230103, "mean_token_accuracy": 0.9306073486804962, "num_tokens": 70805556.0, "step": 5740 }, { "entropy": 1.0459871590137482, "epoch": 3.0231700895208005, "grad_norm": 0.2520120441913605, "learning_rate": 0.0001339602260898405, "loss": 0.17134934663772583, "mean_token_accuracy": 0.9289929568767548, "num_tokens": 70817892.0, "step": 5741 }, { "entropy": 1.0361694693565369, "epoch": 3.023696682464455, "grad_norm": 0.250061959028244, "learning_rate": 0.0001339390884616282, "loss": 0.16119395196437836, "mean_token_accuracy": 0.9309128522872925, "num_tokens": 70830228.0, "step": 5742 }, { "entropy": 1.071681022644043, "epoch": 3.0242232754081093, "grad_norm": 0.28559988737106323, "learning_rate": 0.0001339179494122918, "loss": 0.19253742694854736, "mean_token_accuracy": 0.9223012626171112, "num_tokens": 70842564.0, "step": 5743 }, { "entropy": 1.096194326877594, "epoch": 3.024749868351764, "grad_norm": 0.2857185900211334, "learning_rate": 0.00013389680894308612, "loss": 0.1934041976928711, "mean_token_accuracy": 0.918251097202301, "num_tokens": 70854900.0, "step": 5744 }, { "entropy": 1.0822049677371979, "epoch": 3.0252764612954186, "grad_norm": 0.2802906632423401, "learning_rate": 0.00013387566705526618, "loss": 0.16483765840530396, "mean_token_accuracy": 0.9284011572599411, "num_tokens": 70867236.0, "step": 5745 }, { "entropy": 1.108426570892334, "epoch": 3.025803054239073, "grad_norm": 0.2935839593410492, "learning_rate": 0.00013385452375008704, "loss": 0.18292377889156342, "mean_token_accuracy": 0.9248574525117874, "num_tokens": 70879572.0, "step": 5746 }, { "entropy": 1.056396335363388, "epoch": 3.026329647182728, "grad_norm": 0.2763398587703705, "learning_rate": 0.00013383337902880384, "loss": 0.16577623784542084, "mean_token_accuracy": 0.9300137013196945, "num_tokens": 70891908.0, "step": 5747 }, { "entropy": 1.1094647943973541, "epoch": 3.0268562401263823, "grad_norm": 0.29576507210731506, "learning_rate": 0.00013381223289267186, "loss": 0.18659496307373047, "mean_token_accuracy": 0.9255060255527496, "num_tokens": 70904244.0, "step": 5748 }, { "entropy": 1.0577907860279083, "epoch": 3.0273828330700367, "grad_norm": 0.2823028564453125, "learning_rate": 0.0001337910853429464, "loss": 0.1799258142709732, "mean_token_accuracy": 0.9247395992279053, "num_tokens": 70916580.0, "step": 5749 }, { "entropy": 1.0622846484184265, "epoch": 3.0279094260136916, "grad_norm": 0.2962205111980438, "learning_rate": 0.00013376993638088285, "loss": 0.19302281737327576, "mean_token_accuracy": 0.9213569909334183, "num_tokens": 70928916.0, "step": 5750 }, { "entropy": 1.1032023429870605, "epoch": 3.028436018957346, "grad_norm": 0.3092851936817169, "learning_rate": 0.00013374878600773676, "loss": 0.18477167189121246, "mean_token_accuracy": 0.9206407815217972, "num_tokens": 70941252.0, "step": 5751 }, { "entropy": 1.0572893917560577, "epoch": 3.0289626119010005, "grad_norm": 0.2842503786087036, "learning_rate": 0.00013372763422476365, "loss": 0.16644704341888428, "mean_token_accuracy": 0.9310343712568283, "num_tokens": 70953588.0, "step": 5752 }, { "entropy": 1.0782719254493713, "epoch": 3.029489204844655, "grad_norm": 0.2930472791194916, "learning_rate": 0.00013370648103321915, "loss": 0.17955656349658966, "mean_token_accuracy": 0.9243563711643219, "num_tokens": 70965924.0, "step": 5753 }, { "entropy": 1.0949573516845703, "epoch": 3.0300157977883098, "grad_norm": 0.2939299941062927, "learning_rate": 0.00013368532643435907, "loss": 0.18444274365901947, "mean_token_accuracy": 0.9251150488853455, "num_tokens": 70978260.0, "step": 5754 }, { "entropy": 1.1037635505199432, "epoch": 3.030542390731964, "grad_norm": 0.3208787739276886, "learning_rate": 0.0001336641704294392, "loss": 0.19437548518180847, "mean_token_accuracy": 0.9186409413814545, "num_tokens": 70990596.0, "step": 5755 }, { "entropy": 1.1095591187477112, "epoch": 3.0310689836756186, "grad_norm": 0.3024508059024811, "learning_rate": 0.00013364301301971548, "loss": 0.18942897021770477, "mean_token_accuracy": 0.9229587614536285, "num_tokens": 71002932.0, "step": 5756 }, { "entropy": 1.0845279693603516, "epoch": 3.0315955766192735, "grad_norm": 0.28569653630256653, "learning_rate": 0.00013362185420644386, "loss": 0.17577636241912842, "mean_token_accuracy": 0.9218069911003113, "num_tokens": 71015268.0, "step": 5757 }, { "entropy": 1.1118775308132172, "epoch": 3.032122169562928, "grad_norm": 0.258633553981781, "learning_rate": 0.00013360069399088044, "loss": 0.1673622876405716, "mean_token_accuracy": 0.9336172491312027, "num_tokens": 71027604.0, "step": 5758 }, { "entropy": 1.0533491671085358, "epoch": 3.0326487625065823, "grad_norm": 0.29966580867767334, "learning_rate": 0.00013357953237428137, "loss": 0.19163398444652557, "mean_token_accuracy": 0.9217822551727295, "num_tokens": 71039940.0, "step": 5759 }, { "entropy": 1.1153427362442017, "epoch": 3.0331753554502368, "grad_norm": 0.267869234085083, "learning_rate": 0.00013355836935790292, "loss": 0.16859161853790283, "mean_token_accuracy": 0.9335697442293167, "num_tokens": 71052276.0, "step": 5760 }, { "entropy": 1.1055462658405304, "epoch": 3.0337019483938916, "grad_norm": 0.28465765714645386, "learning_rate": 0.00013353720494300138, "loss": 0.17460112273693085, "mean_token_accuracy": 0.9235497415065765, "num_tokens": 71064612.0, "step": 5761 }, { "entropy": 1.1153737902641296, "epoch": 3.034228541337546, "grad_norm": 0.26903560757637024, "learning_rate": 0.00013351603913083315, "loss": 0.16478265821933746, "mean_token_accuracy": 0.9304361194372177, "num_tokens": 71076948.0, "step": 5762 }, { "entropy": 1.1499566733837128, "epoch": 3.0347551342812005, "grad_norm": 0.2969987392425537, "learning_rate": 0.00013349487192265472, "loss": 0.1865185797214508, "mean_token_accuracy": 0.9161245077848434, "num_tokens": 71089284.0, "step": 5763 }, { "entropy": 1.1352367103099823, "epoch": 3.0352817272248553, "grad_norm": 0.2893647253513336, "learning_rate": 0.00013347370331972272, "loss": 0.17901989817619324, "mean_token_accuracy": 0.9262292981147766, "num_tokens": 71101620.0, "step": 5764 }, { "entropy": 1.0742166340351105, "epoch": 3.0358083201685098, "grad_norm": 0.2570260763168335, "learning_rate": 0.00013345253332329375, "loss": 0.16443604230880737, "mean_token_accuracy": 0.9334456920623779, "num_tokens": 71113956.0, "step": 5765 }, { "entropy": 1.0759824514389038, "epoch": 3.036334913112164, "grad_norm": 0.2551080882549286, "learning_rate": 0.00013343136193462457, "loss": 0.1790422797203064, "mean_token_accuracy": 0.9245909750461578, "num_tokens": 71126292.0, "step": 5766 }, { "entropy": 1.1418220102787018, "epoch": 3.036861506055819, "grad_norm": 0.29069963097572327, "learning_rate": 0.000133410189154972, "loss": 0.17374365031719208, "mean_token_accuracy": 0.9302159249782562, "num_tokens": 71138628.0, "step": 5767 }, { "entropy": 1.0893676578998566, "epoch": 3.0373880989994735, "grad_norm": 0.25986167788505554, "learning_rate": 0.00013338901498559296, "loss": 0.15803691744804382, "mean_token_accuracy": 0.9312460720539093, "num_tokens": 71150964.0, "step": 5768 }, { "entropy": 1.1315541565418243, "epoch": 3.037914691943128, "grad_norm": 0.29130497574806213, "learning_rate": 0.0001333678394277444, "loss": 0.16455236077308655, "mean_token_accuracy": 0.9309317022562027, "num_tokens": 71163300.0, "step": 5769 }, { "entropy": 1.1340096592903137, "epoch": 3.0384412848867823, "grad_norm": 0.29143375158309937, "learning_rate": 0.0001333466624826834, "loss": 0.17422541975975037, "mean_token_accuracy": 0.9201169013977051, "num_tokens": 71175636.0, "step": 5770 }, { "entropy": 1.1219017505645752, "epoch": 3.038967877830437, "grad_norm": 0.29477885365486145, "learning_rate": 0.0001333254841516672, "loss": 0.1977756917476654, "mean_token_accuracy": 0.9190415889024734, "num_tokens": 71187972.0, "step": 5771 }, { "entropy": 1.15945702791214, "epoch": 3.0394944707740916, "grad_norm": 0.30047401785850525, "learning_rate": 0.00013330430443595287, "loss": 0.16675785183906555, "mean_token_accuracy": 0.9310600459575653, "num_tokens": 71200308.0, "step": 5772 }, { "entropy": 1.1178282797336578, "epoch": 3.040021063717746, "grad_norm": 0.2938012182712555, "learning_rate": 0.00013328312333679785, "loss": 0.20171600580215454, "mean_token_accuracy": 0.9149762839078903, "num_tokens": 71212644.0, "step": 5773 }, { "entropy": 1.1635751724243164, "epoch": 3.040547656661401, "grad_norm": 0.2849313020706177, "learning_rate": 0.00013326194085545948, "loss": 0.1755695790052414, "mean_token_accuracy": 0.9265087693929672, "num_tokens": 71224980.0, "step": 5774 }, { "entropy": 1.1646137833595276, "epoch": 3.0410742496050553, "grad_norm": 0.2710713744163513, "learning_rate": 0.0001332407569931953, "loss": 0.1735789030790329, "mean_token_accuracy": 0.9277262687683105, "num_tokens": 71237316.0, "step": 5775 }, { "entropy": 1.1816756129264832, "epoch": 3.0416008425487098, "grad_norm": 0.2794504463672638, "learning_rate": 0.0001332195717512628, "loss": 0.17608892917633057, "mean_token_accuracy": 0.9275052696466446, "num_tokens": 71249652.0, "step": 5776 }, { "entropy": 1.1921135187149048, "epoch": 3.042127435492364, "grad_norm": 0.2821495532989502, "learning_rate": 0.00013319838513091968, "loss": 0.18013815581798553, "mean_token_accuracy": 0.9232759028673172, "num_tokens": 71261988.0, "step": 5777 }, { "entropy": 1.1501494944095612, "epoch": 3.042654028436019, "grad_norm": 0.2837124168872833, "learning_rate": 0.00013317719713342368, "loss": 0.18457761406898499, "mean_token_accuracy": 0.9243838042020798, "num_tokens": 71274324.0, "step": 5778 }, { "entropy": 1.192774474620819, "epoch": 3.0431806213796735, "grad_norm": 0.30532482266426086, "learning_rate": 0.00013315600776003247, "loss": 0.18408426642417908, "mean_token_accuracy": 0.9200680702924728, "num_tokens": 71286660.0, "step": 5779 }, { "entropy": 1.136399120092392, "epoch": 3.043707214323328, "grad_norm": 0.26497748494148254, "learning_rate": 0.00013313481701200414, "loss": 0.16611620783805847, "mean_token_accuracy": 0.9339018017053604, "num_tokens": 71298996.0, "step": 5780 }, { "entropy": 1.1677029728889465, "epoch": 3.044233807266983, "grad_norm": 0.2965880334377289, "learning_rate": 0.00013311362489059654, "loss": 0.17575864493846893, "mean_token_accuracy": 0.927231565117836, "num_tokens": 71311332.0, "step": 5781 }, { "entropy": 1.1640919148921967, "epoch": 3.044760400210637, "grad_norm": 0.27395427227020264, "learning_rate": 0.00013309243139706772, "loss": 0.1687280684709549, "mean_token_accuracy": 0.9323958903551102, "num_tokens": 71323668.0, "step": 5782 }, { "entropy": 1.142760157585144, "epoch": 3.0452869931542916, "grad_norm": 0.3184906840324402, "learning_rate": 0.00013307123653267587, "loss": 0.18931150436401367, "mean_token_accuracy": 0.9203809797763824, "num_tokens": 71336004.0, "step": 5783 }, { "entropy": 1.1388859152793884, "epoch": 3.0458135860979465, "grad_norm": 0.2914552092552185, "learning_rate": 0.00013305004029867914, "loss": 0.1891023814678192, "mean_token_accuracy": 0.9190599769353867, "num_tokens": 71348340.0, "step": 5784 }, { "entropy": 1.1550920009613037, "epoch": 3.046340179041601, "grad_norm": 0.3001711964607239, "learning_rate": 0.0001330288426963359, "loss": 0.1784719079732895, "mean_token_accuracy": 0.9228701889514923, "num_tokens": 71360676.0, "step": 5785 }, { "entropy": 1.163255751132965, "epoch": 3.0468667719852554, "grad_norm": 0.3006163537502289, "learning_rate": 0.00013300764372690447, "loss": 0.20307712256908417, "mean_token_accuracy": 0.915765792131424, "num_tokens": 71373012.0, "step": 5786 }, { "entropy": 1.1174058318138123, "epoch": 3.0473933649289098, "grad_norm": 0.28055649995803833, "learning_rate": 0.00013298644339164334, "loss": 0.17206884920597076, "mean_token_accuracy": 0.9293131530284882, "num_tokens": 71385348.0, "step": 5787 }, { "entropy": 1.1481737196445465, "epoch": 3.0479199578725646, "grad_norm": 0.2757937014102936, "learning_rate": 0.00013296524169181107, "loss": 0.1666310727596283, "mean_token_accuracy": 0.9299214482307434, "num_tokens": 71397684.0, "step": 5788 }, { "entropy": 1.1161286234855652, "epoch": 3.048446550816219, "grad_norm": 0.28487345576286316, "learning_rate": 0.0001329440386286662, "loss": 0.17753304541110992, "mean_token_accuracy": 0.9214348793029785, "num_tokens": 71410020.0, "step": 5789 }, { "entropy": 1.1513926088809967, "epoch": 3.0489731437598735, "grad_norm": 0.2864345610141754, "learning_rate": 0.0001329228342034675, "loss": 0.17936980724334717, "mean_token_accuracy": 0.9247641712427139, "num_tokens": 71422356.0, "step": 5790 }, { "entropy": 1.1690279245376587, "epoch": 3.0494997367035284, "grad_norm": 0.29427191615104675, "learning_rate": 0.00013290162841747376, "loss": 0.18683072924613953, "mean_token_accuracy": 0.9196323603391647, "num_tokens": 71434692.0, "step": 5791 }, { "entropy": 1.1411975026130676, "epoch": 3.050026329647183, "grad_norm": 0.29006507992744446, "learning_rate": 0.0001328804212719438, "loss": 0.17810499668121338, "mean_token_accuracy": 0.9264704585075378, "num_tokens": 71447028.0, "step": 5792 }, { "entropy": 1.0939705073833466, "epoch": 3.050552922590837, "grad_norm": 0.28467386960983276, "learning_rate": 0.0001328592127681366, "loss": 0.16793327033519745, "mean_token_accuracy": 0.9279095828533173, "num_tokens": 71459364.0, "step": 5793 }, { "entropy": 1.0950967967510223, "epoch": 3.0510795155344916, "grad_norm": 0.2878323793411255, "learning_rate": 0.00013283800290731114, "loss": 0.17144641280174255, "mean_token_accuracy": 0.9291983097791672, "num_tokens": 71471700.0, "step": 5794 }, { "entropy": 1.1139646768569946, "epoch": 3.0516061084781465, "grad_norm": 0.2899021804332733, "learning_rate": 0.0001328167916907266, "loss": 0.1691819280385971, "mean_token_accuracy": 0.9288174957036972, "num_tokens": 71484036.0, "step": 5795 }, { "entropy": 1.0817930102348328, "epoch": 3.052132701421801, "grad_norm": 0.2783130705356598, "learning_rate": 0.0001327955791196421, "loss": 0.16818395256996155, "mean_token_accuracy": 0.9270586669445038, "num_tokens": 71496372.0, "step": 5796 }, { "entropy": 1.1195127665996552, "epoch": 3.0526592943654554, "grad_norm": 0.29349660873413086, "learning_rate": 0.0001327743651953169, "loss": 0.17434924840927124, "mean_token_accuracy": 0.9261120557785034, "num_tokens": 71508708.0, "step": 5797 }, { "entropy": 1.1135068237781525, "epoch": 3.0531858873091102, "grad_norm": 0.2993173897266388, "learning_rate": 0.00013275314991901044, "loss": 0.18269886076450348, "mean_token_accuracy": 0.9268842190504074, "num_tokens": 71521044.0, "step": 5798 }, { "entropy": 1.0761390030384064, "epoch": 3.0537124802527646, "grad_norm": 0.3032976984977722, "learning_rate": 0.00013273193329198205, "loss": 0.18568283319473267, "mean_token_accuracy": 0.9237289726734161, "num_tokens": 71533380.0, "step": 5799 }, { "entropy": 1.0722538530826569, "epoch": 3.054239073196419, "grad_norm": 0.3053904175758362, "learning_rate": 0.0001327107153154913, "loss": 0.18497273325920105, "mean_token_accuracy": 0.921196460723877, "num_tokens": 71545716.0, "step": 5800 }, { "entropy": 1.0652728378772736, "epoch": 3.0547656661400735, "grad_norm": 0.2781349718570709, "learning_rate": 0.0001326894959907977, "loss": 0.18898527324199677, "mean_token_accuracy": 0.9184873849153519, "num_tokens": 71558052.0, "step": 5801 }, { "entropy": 1.0627508759498596, "epoch": 3.0552922590837284, "grad_norm": 0.30204126238822937, "learning_rate": 0.000132668275319161, "loss": 0.19641637802124023, "mean_token_accuracy": 0.922800600528717, "num_tokens": 71570388.0, "step": 5802 }, { "entropy": 1.0257129222154617, "epoch": 3.055818852027383, "grad_norm": 0.2787397503852844, "learning_rate": 0.00013264705330184092, "loss": 0.17782054841518402, "mean_token_accuracy": 0.9246032387018204, "num_tokens": 71582724.0, "step": 5803 }, { "entropy": 1.0518714487552643, "epoch": 3.056345444971037, "grad_norm": 0.27710703015327454, "learning_rate": 0.0001326258299400973, "loss": 0.18275544047355652, "mean_token_accuracy": 0.9222777634859085, "num_tokens": 71595060.0, "step": 5804 }, { "entropy": 1.0704227536916733, "epoch": 3.056872037914692, "grad_norm": 0.3062211573123932, "learning_rate": 0.00013260460523519, "loss": 0.18094666302204132, "mean_token_accuracy": 0.9187027215957642, "num_tokens": 71607396.0, "step": 5805 }, { "entropy": 1.051187515258789, "epoch": 3.0573986308583465, "grad_norm": 0.28965574502944946, "learning_rate": 0.00013258337918837905, "loss": 0.18023884296417236, "mean_token_accuracy": 0.9190809279680252, "num_tokens": 71619732.0, "step": 5806 }, { "entropy": 1.1001330316066742, "epoch": 3.057925223802001, "grad_norm": 0.30051374435424805, "learning_rate": 0.00013256215180092447, "loss": 0.18936161696910858, "mean_token_accuracy": 0.9188069850206375, "num_tokens": 71632068.0, "step": 5807 }, { "entropy": 1.0515406131744385, "epoch": 3.058451816745656, "grad_norm": 0.2791909873485565, "learning_rate": 0.0001325409230740865, "loss": 0.17704379558563232, "mean_token_accuracy": 0.9265051782131195, "num_tokens": 71644404.0, "step": 5808 }, { "entropy": 1.0193083584308624, "epoch": 3.0589784096893102, "grad_norm": 0.285780668258667, "learning_rate": 0.00013251969300912523, "loss": 0.16971568763256073, "mean_token_accuracy": 0.9304918050765991, "num_tokens": 71656740.0, "step": 5809 }, { "entropy": 0.9988278597593307, "epoch": 3.0595050026329647, "grad_norm": 0.2850463390350342, "learning_rate": 0.0001324984616073011, "loss": 0.17589221894741058, "mean_token_accuracy": 0.9308154135942459, "num_tokens": 71669076.0, "step": 5810 }, { "entropy": 1.0253951698541641, "epoch": 3.060031595576619, "grad_norm": 0.28472432494163513, "learning_rate": 0.00013247722886987443, "loss": 0.1638464778661728, "mean_token_accuracy": 0.9300073832273483, "num_tokens": 71681412.0, "step": 5811 }, { "entropy": 1.023746833205223, "epoch": 3.060558188520274, "grad_norm": 0.28646063804626465, "learning_rate": 0.00013245599479810564, "loss": 0.1735069900751114, "mean_token_accuracy": 0.9263989329338074, "num_tokens": 71693748.0, "step": 5812 }, { "entropy": 0.9947127848863602, "epoch": 3.0610847814639284, "grad_norm": 0.27799171209335327, "learning_rate": 0.00013243475939325538, "loss": 0.17884136736392975, "mean_token_accuracy": 0.9239570498466492, "num_tokens": 71706084.0, "step": 5813 }, { "entropy": 1.0348500907421112, "epoch": 3.061611374407583, "grad_norm": 0.29147857427597046, "learning_rate": 0.00013241352265658417, "loss": 0.17199379205703735, "mean_token_accuracy": 0.9261778295040131, "num_tokens": 71718420.0, "step": 5814 }, { "entropy": 0.9770552963018417, "epoch": 3.0621379673512377, "grad_norm": 0.26427361369132996, "learning_rate": 0.0001323922845893528, "loss": 0.17064280807971954, "mean_token_accuracy": 0.9300706535577774, "num_tokens": 71730756.0, "step": 5815 }, { "entropy": 1.0042769014835358, "epoch": 3.062664560294892, "grad_norm": 0.274197518825531, "learning_rate": 0.00013237104519282198, "loss": 0.15780170261859894, "mean_token_accuracy": 0.9329145699739456, "num_tokens": 71743092.0, "step": 5816 }, { "entropy": 1.0151778310537338, "epoch": 3.0631911532385465, "grad_norm": 0.26683470606803894, "learning_rate": 0.00013234980446825257, "loss": 0.1659105122089386, "mean_token_accuracy": 0.9312007278203964, "num_tokens": 71755428.0, "step": 5817 }, { "entropy": 0.9765558987855911, "epoch": 3.063717746182201, "grad_norm": 0.2901502847671509, "learning_rate": 0.00013232856241690555, "loss": 0.18892541527748108, "mean_token_accuracy": 0.918955847620964, "num_tokens": 71767764.0, "step": 5818 }, { "entropy": 1.0077444463968277, "epoch": 3.064244339125856, "grad_norm": 0.3046390414237976, "learning_rate": 0.000132307319040042, "loss": 0.18454664945602417, "mean_token_accuracy": 0.9204002022743225, "num_tokens": 71780100.0, "step": 5819 }, { "entropy": 1.030941441655159, "epoch": 3.0647709320695102, "grad_norm": 0.31215187907218933, "learning_rate": 0.00013228607433892284, "loss": 0.20272856950759888, "mean_token_accuracy": 0.9166811406612396, "num_tokens": 71792436.0, "step": 5820 }, { "entropy": 0.9970352947711945, "epoch": 3.0652975250131647, "grad_norm": 0.26677122712135315, "learning_rate": 0.00013226482831480937, "loss": 0.17062878608703613, "mean_token_accuracy": 0.9292921721935272, "num_tokens": 71804772.0, "step": 5821 }, { "entropy": 0.9916958510875702, "epoch": 3.0658241179568195, "grad_norm": 0.3014390170574188, "learning_rate": 0.00013224358096896279, "loss": 0.1784030795097351, "mean_token_accuracy": 0.9230726957321167, "num_tokens": 71817108.0, "step": 5822 }, { "entropy": 1.003650039434433, "epoch": 3.066350710900474, "grad_norm": 0.30364856123924255, "learning_rate": 0.0001322223323026445, "loss": 0.18567705154418945, "mean_token_accuracy": 0.9203255027532578, "num_tokens": 71829444.0, "step": 5823 }, { "entropy": 0.9895204901695251, "epoch": 3.0668773038441284, "grad_norm": 0.28889593482017517, "learning_rate": 0.0001322010823171158, "loss": 0.1736719310283661, "mean_token_accuracy": 0.9261168986558914, "num_tokens": 71841780.0, "step": 5824 }, { "entropy": 0.9563289880752563, "epoch": 3.0674038967877832, "grad_norm": 0.2949967682361603, "learning_rate": 0.0001321798310136383, "loss": 0.18222150206565857, "mean_token_accuracy": 0.9264791905879974, "num_tokens": 71854116.0, "step": 5825 }, { "entropy": 0.9729903489351273, "epoch": 3.0679304897314377, "grad_norm": 0.2907126843929291, "learning_rate": 0.00013215857839347347, "loss": 0.18862363696098328, "mean_token_accuracy": 0.9187849313020706, "num_tokens": 71866452.0, "step": 5826 }, { "entropy": 0.9874851405620575, "epoch": 3.068457082675092, "grad_norm": 0.3004235029220581, "learning_rate": 0.00013213732445788303, "loss": 0.19510529935359955, "mean_token_accuracy": 0.9176079481840134, "num_tokens": 71878788.0, "step": 5827 }, { "entropy": 0.9737606048583984, "epoch": 3.0689836756187465, "grad_norm": 0.29955679178237915, "learning_rate": 0.00013211606920812864, "loss": 0.1905735284090042, "mean_token_accuracy": 0.9228790551424026, "num_tokens": 71891124.0, "step": 5828 }, { "entropy": 0.9671222120523453, "epoch": 3.0695102685624014, "grad_norm": 0.2844952642917633, "learning_rate": 0.0001320948126454721, "loss": 0.18964330852031708, "mean_token_accuracy": 0.918824627995491, "num_tokens": 71903460.0, "step": 5829 }, { "entropy": 0.9817742556333542, "epoch": 3.070036861506056, "grad_norm": 0.2865328788757324, "learning_rate": 0.00013207355477117534, "loss": 0.184239462018013, "mean_token_accuracy": 0.9218413978815079, "num_tokens": 71915796.0, "step": 5830 }, { "entropy": 1.0103529393672943, "epoch": 3.0705634544497102, "grad_norm": 0.2857781946659088, "learning_rate": 0.00013205229558650028, "loss": 0.1801823377609253, "mean_token_accuracy": 0.9265488833189011, "num_tokens": 71928132.0, "step": 5831 }, { "entropy": 1.0271504372358322, "epoch": 3.071090047393365, "grad_norm": 0.27296462655067444, "learning_rate": 0.00013203103509270894, "loss": 0.16963928937911987, "mean_token_accuracy": 0.9278423190116882, "num_tokens": 71940468.0, "step": 5832 }, { "entropy": 1.0373024642467499, "epoch": 3.0716166403370195, "grad_norm": 0.32619747519493103, "learning_rate": 0.0001320097732910635, "loss": 0.20516563951969147, "mean_token_accuracy": 0.9147870093584061, "num_tokens": 71952804.0, "step": 5833 }, { "entropy": 1.0268867909908295, "epoch": 3.072143233280674, "grad_norm": 0.27325931191444397, "learning_rate": 0.00013198851018282606, "loss": 0.18094776570796967, "mean_token_accuracy": 0.9250821322202682, "num_tokens": 71965140.0, "step": 5834 }, { "entropy": 0.9949807524681091, "epoch": 3.0726698262243284, "grad_norm": 0.2740168869495392, "learning_rate": 0.00013196724576925898, "loss": 0.18525102734565735, "mean_token_accuracy": 0.9229671359062195, "num_tokens": 71977476.0, "step": 5835 }, { "entropy": 1.00574392080307, "epoch": 3.0731964191679833, "grad_norm": 0.2765384614467621, "learning_rate": 0.00013194598005162447, "loss": 0.16539379954338074, "mean_token_accuracy": 0.9317118972539902, "num_tokens": 71989812.0, "step": 5836 }, { "entropy": 1.0072713494300842, "epoch": 3.0737230121116377, "grad_norm": 0.2896250784397125, "learning_rate": 0.0001319247130311851, "loss": 0.1674274504184723, "mean_token_accuracy": 0.9269036948680878, "num_tokens": 72002148.0, "step": 5837 }, { "entropy": 1.0159356147050858, "epoch": 3.074249605055292, "grad_norm": 0.2608317732810974, "learning_rate": 0.00013190344470920327, "loss": 0.17006650567054749, "mean_token_accuracy": 0.9248785823583603, "num_tokens": 72014484.0, "step": 5838 }, { "entropy": 1.0277487933635712, "epoch": 3.074776197998947, "grad_norm": 0.29685619473457336, "learning_rate": 0.00013188217508694163, "loss": 0.19034484028816223, "mean_token_accuracy": 0.9209220856428146, "num_tokens": 72026820.0, "step": 5839 }, { "entropy": 0.9729027599096298, "epoch": 3.0753027909426014, "grad_norm": 0.2588353157043457, "learning_rate": 0.00013186090416566278, "loss": 0.16739526391029358, "mean_token_accuracy": 0.9292702972888947, "num_tokens": 72039156.0, "step": 5840 }, { "entropy": 0.946832001209259, "epoch": 3.075829383886256, "grad_norm": 0.29065054655075073, "learning_rate": 0.00013183963194662946, "loss": 0.17941366136074066, "mean_token_accuracy": 0.9269576519727707, "num_tokens": 72051492.0, "step": 5841 }, { "entropy": 0.9500826895236969, "epoch": 3.0763559768299107, "grad_norm": 0.30167078971862793, "learning_rate": 0.00013181835843110448, "loss": 0.18562158942222595, "mean_token_accuracy": 0.9208818674087524, "num_tokens": 72063828.0, "step": 5842 }, { "entropy": 0.9446297138929367, "epoch": 3.076882569773565, "grad_norm": 0.2649385929107666, "learning_rate": 0.00013179708362035073, "loss": 0.18260982632637024, "mean_token_accuracy": 0.9223494529724121, "num_tokens": 72076164.0, "step": 5843 }, { "entropy": 0.9216752499341965, "epoch": 3.0774091627172195, "grad_norm": 0.29369136691093445, "learning_rate": 0.00013177580751563118, "loss": 0.17421871423721313, "mean_token_accuracy": 0.9291995912790298, "num_tokens": 72088500.0, "step": 5844 }, { "entropy": 1.0294009149074554, "epoch": 3.077935755660874, "grad_norm": 0.2864926755428314, "learning_rate": 0.0001317545301182088, "loss": 0.16719837486743927, "mean_token_accuracy": 0.9276296347379684, "num_tokens": 72100836.0, "step": 5845 }, { "entropy": 1.0061109811067581, "epoch": 3.078462348604529, "grad_norm": 0.31383106112480164, "learning_rate": 0.00013173325142934683, "loss": 0.1888384222984314, "mean_token_accuracy": 0.9204787760972977, "num_tokens": 72113172.0, "step": 5846 }, { "entropy": 0.946212887763977, "epoch": 3.0789889415481833, "grad_norm": 0.2886209189891815, "learning_rate": 0.00013171197145030837, "loss": 0.18259429931640625, "mean_token_accuracy": 0.9196333736181259, "num_tokens": 72125508.0, "step": 5847 }, { "entropy": 1.0319083482027054, "epoch": 3.0795155344918377, "grad_norm": 0.3208879232406616, "learning_rate": 0.0001316906901823567, "loss": 0.19582988321781158, "mean_token_accuracy": 0.9173017740249634, "num_tokens": 72137844.0, "step": 5848 }, { "entropy": 0.9948568791151047, "epoch": 3.0800421274354925, "grad_norm": 0.2987675666809082, "learning_rate": 0.00013166940762675522, "loss": 0.18619319796562195, "mean_token_accuracy": 0.9224425554275513, "num_tokens": 72150180.0, "step": 5849 }, { "entropy": 0.9998792558908463, "epoch": 3.080568720379147, "grad_norm": 0.29199832677841187, "learning_rate": 0.00013164812378476726, "loss": 0.1841306984424591, "mean_token_accuracy": 0.9235689789056778, "num_tokens": 72162516.0, "step": 5850 }, { "entropy": 0.9340603649616241, "epoch": 3.0810953133228014, "grad_norm": 0.29936087131500244, "learning_rate": 0.00013162683865765637, "loss": 0.18153662979602814, "mean_token_accuracy": 0.920834869146347, "num_tokens": 72174852.0, "step": 5851 }, { "entropy": 0.9640193283557892, "epoch": 3.081621906266456, "grad_norm": 0.32455864548683167, "learning_rate": 0.00013160555224668615, "loss": 0.18892093002796173, "mean_token_accuracy": 0.9217241108417511, "num_tokens": 72187188.0, "step": 5852 }, { "entropy": 0.9838850498199463, "epoch": 3.0821484992101107, "grad_norm": 0.29325219988822937, "learning_rate": 0.00013158426455312018, "loss": 0.1794615536928177, "mean_token_accuracy": 0.9225403517484665, "num_tokens": 72199524.0, "step": 5853 }, { "entropy": 0.9487807154655457, "epoch": 3.082675092153765, "grad_norm": 0.2752475440502167, "learning_rate": 0.00013156297557822224, "loss": 0.15716516971588135, "mean_token_accuracy": 0.9343967288732529, "num_tokens": 72211860.0, "step": 5854 }, { "entropy": 1.0301673710346222, "epoch": 3.0832016850974195, "grad_norm": 0.3180379569530487, "learning_rate": 0.00013154168532325615, "loss": 0.20467087626457214, "mean_token_accuracy": 0.9166474789381027, "num_tokens": 72224196.0, "step": 5855 }, { "entropy": 1.004869282245636, "epoch": 3.0837282780410744, "grad_norm": 0.28707006573677063, "learning_rate": 0.00013152039378948574, "loss": 0.18228140473365784, "mean_token_accuracy": 0.9262249171733856, "num_tokens": 72236532.0, "step": 5856 }, { "entropy": 1.0051259696483612, "epoch": 3.084254870984729, "grad_norm": 0.27821314334869385, "learning_rate": 0.00013149910097817494, "loss": 0.16908696293830872, "mean_token_accuracy": 0.9320413321256638, "num_tokens": 72248868.0, "step": 5857 }, { "entropy": 1.000169724225998, "epoch": 3.0847814639283833, "grad_norm": 0.2890099287033081, "learning_rate": 0.00013147780689058784, "loss": 0.16586747765541077, "mean_token_accuracy": 0.9278808683156967, "num_tokens": 72261204.0, "step": 5858 }, { "entropy": 1.0450342297554016, "epoch": 3.085308056872038, "grad_norm": 0.2950303256511688, "learning_rate": 0.00013145651152798857, "loss": 0.17741480469703674, "mean_token_accuracy": 0.9268434792757034, "num_tokens": 72273540.0, "step": 5859 }, { "entropy": 1.031152680516243, "epoch": 3.0858346498156926, "grad_norm": 0.31254854798316956, "learning_rate": 0.00013143521489164124, "loss": 0.1890886127948761, "mean_token_accuracy": 0.9225743561983109, "num_tokens": 72285876.0, "step": 5860 }, { "entropy": 1.0067125707864761, "epoch": 3.086361242759347, "grad_norm": 0.2938244938850403, "learning_rate": 0.00013141391698281012, "loss": 0.18479709327220917, "mean_token_accuracy": 0.9220405369997025, "num_tokens": 72298212.0, "step": 5861 }, { "entropy": 0.974154531955719, "epoch": 3.0868878357030014, "grad_norm": 0.26539933681488037, "learning_rate": 0.00013139261780275958, "loss": 0.1614721566438675, "mean_token_accuracy": 0.9337578117847443, "num_tokens": 72310548.0, "step": 5862 }, { "entropy": 0.9784013479948044, "epoch": 3.0874144286466563, "grad_norm": 0.2748902142047882, "learning_rate": 0.00013137131735275402, "loss": 0.16838830709457397, "mean_token_accuracy": 0.9306375980377197, "num_tokens": 72322884.0, "step": 5863 }, { "entropy": 1.03346548974514, "epoch": 3.0879410215903107, "grad_norm": 0.33242136240005493, "learning_rate": 0.00013135001563405787, "loss": 0.1944301426410675, "mean_token_accuracy": 0.913677766919136, "num_tokens": 72335220.0, "step": 5864 }, { "entropy": 0.9649850279092789, "epoch": 3.088467614533965, "grad_norm": 0.28117993474006653, "learning_rate": 0.00013132871264793573, "loss": 0.17021432518959045, "mean_token_accuracy": 0.928614541888237, "num_tokens": 72347556.0, "step": 5865 }, { "entropy": 0.9285301268100739, "epoch": 3.08899420747762, "grad_norm": 0.27827489376068115, "learning_rate": 0.00013130740839565228, "loss": 0.15523271262645721, "mean_token_accuracy": 0.9350172430276871, "num_tokens": 72359892.0, "step": 5866 }, { "entropy": 0.9720413982868195, "epoch": 3.0895208004212744, "grad_norm": 0.28834617137908936, "learning_rate": 0.00013128610287847214, "loss": 0.1742348074913025, "mean_token_accuracy": 0.9259906262159348, "num_tokens": 72372228.0, "step": 5867 }, { "entropy": 0.9477108120918274, "epoch": 3.090047393364929, "grad_norm": 0.2890585958957672, "learning_rate": 0.00013126479609766017, "loss": 0.17141348123550415, "mean_token_accuracy": 0.9350418746471405, "num_tokens": 72384564.0, "step": 5868 }, { "entropy": 0.9333702474832535, "epoch": 3.0905739863085833, "grad_norm": 0.3177509009838104, "learning_rate": 0.00013124348805448118, "loss": 0.17872607707977295, "mean_token_accuracy": 0.9237185716629028, "num_tokens": 72396900.0, "step": 5869 }, { "entropy": 0.9048350304365158, "epoch": 3.091100579252238, "grad_norm": 0.29665181040763855, "learning_rate": 0.00013122217875020012, "loss": 0.1873965859413147, "mean_token_accuracy": 0.9245747178792953, "num_tokens": 72409236.0, "step": 5870 }, { "entropy": 0.9140274971723557, "epoch": 3.0916271721958926, "grad_norm": 0.2923314869403839, "learning_rate": 0.000131200868186082, "loss": 0.1777024120092392, "mean_token_accuracy": 0.9223998188972473, "num_tokens": 72421572.0, "step": 5871 }, { "entropy": 0.93026502430439, "epoch": 3.092153765139547, "grad_norm": 0.2896692156791687, "learning_rate": 0.0001311795563633919, "loss": 0.17808280885219574, "mean_token_accuracy": 0.9236349910497665, "num_tokens": 72433908.0, "step": 5872 }, { "entropy": 0.9688552618026733, "epoch": 3.092680358083202, "grad_norm": 0.30245140194892883, "learning_rate": 0.00013115824328339498, "loss": 0.1754363775253296, "mean_token_accuracy": 0.9290272146463394, "num_tokens": 72446244.0, "step": 5873 }, { "entropy": 0.9436691403388977, "epoch": 3.0932069510268563, "grad_norm": 0.3126986622810364, "learning_rate": 0.00013113692894735647, "loss": 0.19607993960380554, "mean_token_accuracy": 0.919350653886795, "num_tokens": 72458580.0, "step": 5874 }, { "entropy": 0.9906564652919769, "epoch": 3.0937335439705107, "grad_norm": 0.288845956325531, "learning_rate": 0.00013111561335654173, "loss": 0.1837921440601349, "mean_token_accuracy": 0.923243373632431, "num_tokens": 72470916.0, "step": 5875 }, { "entropy": 0.9391609728336334, "epoch": 3.0942601369141656, "grad_norm": 0.28532668948173523, "learning_rate": 0.00013109429651221604, "loss": 0.15645398199558258, "mean_token_accuracy": 0.9355584979057312, "num_tokens": 72483252.0, "step": 5876 }, { "entropy": 0.9522290229797363, "epoch": 3.09478672985782, "grad_norm": 0.2875584065914154, "learning_rate": 0.00013107297841564495, "loss": 0.17390328645706177, "mean_token_accuracy": 0.926831528544426, "num_tokens": 72495588.0, "step": 5877 }, { "entropy": 1.0038781613111496, "epoch": 3.0953133228014744, "grad_norm": 0.31649264693260193, "learning_rate": 0.00013105165906809394, "loss": 0.17345508933067322, "mean_token_accuracy": 0.9273377507925034, "num_tokens": 72507924.0, "step": 5878 }, { "entropy": 0.953633263707161, "epoch": 3.095839915745129, "grad_norm": 0.27122682332992554, "learning_rate": 0.00013103033847082862, "loss": 0.17186909914016724, "mean_token_accuracy": 0.9262486696243286, "num_tokens": 72520260.0, "step": 5879 }, { "entropy": 0.9963507354259491, "epoch": 3.0963665086887837, "grad_norm": 0.29431045055389404, "learning_rate": 0.0001310090166251147, "loss": 0.1882622390985489, "mean_token_accuracy": 0.9177558422088623, "num_tokens": 72532596.0, "step": 5880 }, { "entropy": 1.0024547725915909, "epoch": 3.096893101632438, "grad_norm": 0.28813937306404114, "learning_rate": 0.00013098769353221787, "loss": 0.18425771594047546, "mean_token_accuracy": 0.9189359992742538, "num_tokens": 72544932.0, "step": 5881 }, { "entropy": 0.9621204137802124, "epoch": 3.0974196945760926, "grad_norm": 0.27608561515808105, "learning_rate": 0.00013096636919340403, "loss": 0.1865629106760025, "mean_token_accuracy": 0.9199081361293793, "num_tokens": 72557268.0, "step": 5882 }, { "entropy": 1.003304123878479, "epoch": 3.0979462875197474, "grad_norm": 0.29859909415245056, "learning_rate": 0.00013094504360993908, "loss": 0.1924053430557251, "mean_token_accuracy": 0.9214104861021042, "num_tokens": 72569604.0, "step": 5883 }, { "entropy": 1.025260254740715, "epoch": 3.098472880463402, "grad_norm": 0.3071950078010559, "learning_rate": 0.00013092371678308896, "loss": 0.20280207693576813, "mean_token_accuracy": 0.9109026789665222, "num_tokens": 72581940.0, "step": 5884 }, { "entropy": 1.00009123980999, "epoch": 3.0989994734070563, "grad_norm": 0.29816606640815735, "learning_rate": 0.0001309023887141197, "loss": 0.17498430609703064, "mean_token_accuracy": 0.9293450862169266, "num_tokens": 72594276.0, "step": 5885 }, { "entropy": 0.995394691824913, "epoch": 3.0995260663507107, "grad_norm": 0.28363287448883057, "learning_rate": 0.00013088105940429744, "loss": 0.1702607125043869, "mean_token_accuracy": 0.9287439733743668, "num_tokens": 72606612.0, "step": 5886 }, { "entropy": 1.014031559228897, "epoch": 3.1000526592943656, "grad_norm": 0.31453272700309753, "learning_rate": 0.00013085972885488843, "loss": 0.19794932007789612, "mean_token_accuracy": 0.9198706299066544, "num_tokens": 72618948.0, "step": 5887 }, { "entropy": 1.0270172506570816, "epoch": 3.10057925223802, "grad_norm": 0.31530511379241943, "learning_rate": 0.00013083839706715884, "loss": 0.19103944301605225, "mean_token_accuracy": 0.9153321981430054, "num_tokens": 72631284.0, "step": 5888 }, { "entropy": 1.0285425931215286, "epoch": 3.1011058451816744, "grad_norm": 0.2896331548690796, "learning_rate": 0.0001308170640423751, "loss": 0.1762722134590149, "mean_token_accuracy": 0.9229384660720825, "num_tokens": 72643620.0, "step": 5889 }, { "entropy": 1.0397944748401642, "epoch": 3.1016324381253293, "grad_norm": 0.2989019453525543, "learning_rate": 0.0001307957297818036, "loss": 0.18894504010677338, "mean_token_accuracy": 0.916764959692955, "num_tokens": 72655956.0, "step": 5890 }, { "entropy": 0.9798354804515839, "epoch": 3.1021590310689837, "grad_norm": 0.27662745118141174, "learning_rate": 0.00013077439428671084, "loss": 0.1908535659313202, "mean_token_accuracy": 0.9216964095830917, "num_tokens": 72668292.0, "step": 5891 }, { "entropy": 1.0175761878490448, "epoch": 3.102685624012638, "grad_norm": 0.3136708438396454, "learning_rate": 0.00013075305755836338, "loss": 0.195576474070549, "mean_token_accuracy": 0.9208648949861526, "num_tokens": 72680628.0, "step": 5892 }, { "entropy": 1.0088795125484467, "epoch": 3.103212216956293, "grad_norm": 0.2834429442882538, "learning_rate": 0.00013073171959802785, "loss": 0.17227596044540405, "mean_token_accuracy": 0.9266511499881744, "num_tokens": 72692964.0, "step": 5893 }, { "entropy": 1.0117809623479843, "epoch": 3.1037388098999474, "grad_norm": 0.3066660165786743, "learning_rate": 0.00013071038040697095, "loss": 0.18589381873607635, "mean_token_accuracy": 0.9194468706846237, "num_tokens": 72705300.0, "step": 5894 }, { "entropy": 1.0212982147932053, "epoch": 3.104265402843602, "grad_norm": 0.282331645488739, "learning_rate": 0.00013068903998645945, "loss": 0.18355408310890198, "mean_token_accuracy": 0.922243520617485, "num_tokens": 72717636.0, "step": 5895 }, { "entropy": 1.0034818798303604, "epoch": 3.1047919957872563, "grad_norm": 0.2822534739971161, "learning_rate": 0.00013066769833776026, "loss": 0.18468129634857178, "mean_token_accuracy": 0.9255609661340714, "num_tokens": 72729972.0, "step": 5896 }, { "entropy": 0.9707738161087036, "epoch": 3.105318588730911, "grad_norm": 0.28754761815071106, "learning_rate": 0.00013064635546214027, "loss": 0.18167972564697266, "mean_token_accuracy": 0.9241908490657806, "num_tokens": 72742308.0, "step": 5897 }, { "entropy": 0.9499937295913696, "epoch": 3.1058451816745656, "grad_norm": 0.28328055143356323, "learning_rate": 0.0001306250113608665, "loss": 0.18320026993751526, "mean_token_accuracy": 0.9243544191122055, "num_tokens": 72754644.0, "step": 5898 }, { "entropy": 1.0261553823947906, "epoch": 3.10637177461822, "grad_norm": 0.29419898986816406, "learning_rate": 0.00013060366603520601, "loss": 0.1817263513803482, "mean_token_accuracy": 0.9239636808633804, "num_tokens": 72766980.0, "step": 5899 }, { "entropy": 0.9795711040496826, "epoch": 3.106898367561875, "grad_norm": 0.2906143367290497, "learning_rate": 0.00013058231948642597, "loss": 0.17092804610729218, "mean_token_accuracy": 0.9313593059778214, "num_tokens": 72779316.0, "step": 5900 }, { "entropy": 0.9814235419034958, "epoch": 3.1074249605055293, "grad_norm": 0.28841039538383484, "learning_rate": 0.00013056097171579357, "loss": 0.17476145923137665, "mean_token_accuracy": 0.9297506809234619, "num_tokens": 72791652.0, "step": 5901 }, { "entropy": 0.9798099398612976, "epoch": 3.1079515534491837, "grad_norm": 0.2775534987449646, "learning_rate": 0.00013053962272457613, "loss": 0.1680983006954193, "mean_token_accuracy": 0.9283261299133301, "num_tokens": 72803988.0, "step": 5902 }, { "entropy": 1.0072557479143143, "epoch": 3.108478146392838, "grad_norm": 0.2890489399433136, "learning_rate": 0.000130518272514041, "loss": 0.17888548970222473, "mean_token_accuracy": 0.9257342368364334, "num_tokens": 72816324.0, "step": 5903 }, { "entropy": 0.9900611490011215, "epoch": 3.109004739336493, "grad_norm": 0.3024149239063263, "learning_rate": 0.00013049692108545562, "loss": 0.18220660090446472, "mean_token_accuracy": 0.9204623997211456, "num_tokens": 72828660.0, "step": 5904 }, { "entropy": 1.0078524500131607, "epoch": 3.1095313322801474, "grad_norm": 0.31779125332832336, "learning_rate": 0.00013047556844008747, "loss": 0.194386824965477, "mean_token_accuracy": 0.9209152162075043, "num_tokens": 72840996.0, "step": 5905 }, { "entropy": 0.9710298627614975, "epoch": 3.110057925223802, "grad_norm": 0.2938542664051056, "learning_rate": 0.00013045421457920416, "loss": 0.17387202382087708, "mean_token_accuracy": 0.9304901510477066, "num_tokens": 72853332.0, "step": 5906 }, { "entropy": 1.0137410461902618, "epoch": 3.1105845181674567, "grad_norm": 0.31136083602905273, "learning_rate": 0.00013043285950407342, "loss": 0.18210887908935547, "mean_token_accuracy": 0.9235569536685944, "num_tokens": 72865668.0, "step": 5907 }, { "entropy": 0.9845224022865295, "epoch": 3.111111111111111, "grad_norm": 0.2719968855381012, "learning_rate": 0.00013041150321596286, "loss": 0.16895705461502075, "mean_token_accuracy": 0.9294350296258926, "num_tokens": 72878004.0, "step": 5908 }, { "entropy": 0.9864397495985031, "epoch": 3.1116377040547656, "grad_norm": 0.301286518573761, "learning_rate": 0.00013039014571614028, "loss": 0.18717461824417114, "mean_token_accuracy": 0.9226465821266174, "num_tokens": 72890340.0, "step": 5909 }, { "entropy": 0.9790801554918289, "epoch": 3.11216429699842, "grad_norm": 0.2874787449836731, "learning_rate": 0.00013036878700587365, "loss": 0.18862608075141907, "mean_token_accuracy": 0.9194082766771317, "num_tokens": 72902676.0, "step": 5910 }, { "entropy": 1.0117427706718445, "epoch": 3.112690889942075, "grad_norm": 0.26695552468299866, "learning_rate": 0.00013034742708643084, "loss": 0.173864483833313, "mean_token_accuracy": 0.9279522448778152, "num_tokens": 72915012.0, "step": 5911 }, { "entropy": 0.942085400223732, "epoch": 3.1132174828857293, "grad_norm": 0.2916507124900818, "learning_rate": 0.00013032606595907989, "loss": 0.17523030936717987, "mean_token_accuracy": 0.9323842823505402, "num_tokens": 72927348.0, "step": 5912 }, { "entropy": 1.0327578485012054, "epoch": 3.1137440758293837, "grad_norm": 0.30272775888442993, "learning_rate": 0.00013030470362508884, "loss": 0.1859118491411209, "mean_token_accuracy": 0.9215680062770844, "num_tokens": 72939684.0, "step": 5913 }, { "entropy": 0.9773134887218475, "epoch": 3.1142706687730386, "grad_norm": 0.2893243730068207, "learning_rate": 0.00013028334008572588, "loss": 0.17654062807559967, "mean_token_accuracy": 0.9239582568407059, "num_tokens": 72952020.0, "step": 5914 }, { "entropy": 0.9801084250211716, "epoch": 3.114797261716693, "grad_norm": 0.2631586194038391, "learning_rate": 0.00013026197534225925, "loss": 0.15703842043876648, "mean_token_accuracy": 0.9351452887058258, "num_tokens": 72964356.0, "step": 5915 }, { "entropy": 1.0578633546829224, "epoch": 3.1153238546603474, "grad_norm": 0.2890935242176056, "learning_rate": 0.00013024060939595723, "loss": 0.1817035675048828, "mean_token_accuracy": 0.9252161383628845, "num_tokens": 72976692.0, "step": 5916 }, { "entropy": 1.0292495489120483, "epoch": 3.1158504476040023, "grad_norm": 0.288146436214447, "learning_rate": 0.00013021924224808823, "loss": 0.19315966963768005, "mean_token_accuracy": 0.9209520369768143, "num_tokens": 72989028.0, "step": 5917 }, { "entropy": 0.9683614373207092, "epoch": 3.1163770405476567, "grad_norm": 0.28280383348464966, "learning_rate": 0.00013019787389992066, "loss": 0.18978121876716614, "mean_token_accuracy": 0.9187489449977875, "num_tokens": 73001364.0, "step": 5918 }, { "entropy": 0.9939278662204742, "epoch": 3.116903633491311, "grad_norm": 0.2836332321166992, "learning_rate": 0.00013017650435272305, "loss": 0.17158405482769012, "mean_token_accuracy": 0.9307135939598083, "num_tokens": 73013700.0, "step": 5919 }, { "entropy": 1.040738195180893, "epoch": 3.1174302264349656, "grad_norm": 0.2956024408340454, "learning_rate": 0.00013015513360776392, "loss": 0.1901095062494278, "mean_token_accuracy": 0.9226278364658356, "num_tokens": 73026036.0, "step": 5920 }, { "entropy": 1.0458858758211136, "epoch": 3.1179568193786205, "grad_norm": 0.336071640253067, "learning_rate": 0.00013013376166631205, "loss": 0.20758454501628876, "mean_token_accuracy": 0.9135317951440811, "num_tokens": 73038372.0, "step": 5921 }, { "entropy": 1.0126291811466217, "epoch": 3.118483412322275, "grad_norm": 0.29755648970603943, "learning_rate": 0.00013011238852963605, "loss": 0.19317781925201416, "mean_token_accuracy": 0.9182720631361008, "num_tokens": 73050708.0, "step": 5922 }, { "entropy": 0.9963730573654175, "epoch": 3.1190100052659293, "grad_norm": 0.2682756781578064, "learning_rate": 0.00013009101419900475, "loss": 0.17621959745883942, "mean_token_accuracy": 0.925027385354042, "num_tokens": 73063044.0, "step": 5923 }, { "entropy": 1.0447964668273926, "epoch": 3.119536598209584, "grad_norm": 0.3019618093967438, "learning_rate": 0.0001300696386756871, "loss": 0.1902092695236206, "mean_token_accuracy": 0.9218323826789856, "num_tokens": 73075380.0, "step": 5924 }, { "entropy": 0.9710809290409088, "epoch": 3.1200631911532386, "grad_norm": 0.2597827613353729, "learning_rate": 0.0001300482619609519, "loss": 0.17227184772491455, "mean_token_accuracy": 0.92453433573246, "num_tokens": 73087716.0, "step": 5925 }, { "entropy": 1.0418781042099, "epoch": 3.120589784096893, "grad_norm": 0.29908981919288635, "learning_rate": 0.00013002688405606828, "loss": 0.17560279369354248, "mean_token_accuracy": 0.9268177151679993, "num_tokens": 73100052.0, "step": 5926 }, { "entropy": 0.9824186861515045, "epoch": 3.1211163770405475, "grad_norm": 0.303090363740921, "learning_rate": 0.0001300055049623053, "loss": 0.1912716180086136, "mean_token_accuracy": 0.9202925115823746, "num_tokens": 73112388.0, "step": 5927 }, { "entropy": 0.9852057695388794, "epoch": 3.1216429699842023, "grad_norm": 0.2938767671585083, "learning_rate": 0.0001299841246809321, "loss": 0.17864194512367249, "mean_token_accuracy": 0.9232177287340164, "num_tokens": 73124724.0, "step": 5928 }, { "entropy": 1.02889284491539, "epoch": 3.1221695629278567, "grad_norm": 0.305049866437912, "learning_rate": 0.00012996274321321787, "loss": 0.18025071918964386, "mean_token_accuracy": 0.9296489357948303, "num_tokens": 73137060.0, "step": 5929 }, { "entropy": 0.9720607846975327, "epoch": 3.122696155871511, "grad_norm": 0.28418251872062683, "learning_rate": 0.00012994136056043186, "loss": 0.18828493356704712, "mean_token_accuracy": 0.9190543591976166, "num_tokens": 73149396.0, "step": 5930 }, { "entropy": 0.9504470825195312, "epoch": 3.123222748815166, "grad_norm": 0.28166502714157104, "learning_rate": 0.00012991997672384358, "loss": 0.18314103782176971, "mean_token_accuracy": 0.9210266470909119, "num_tokens": 73161732.0, "step": 5931 }, { "entropy": 1.0184333622455597, "epoch": 3.1237493417588205, "grad_norm": 0.31155115365982056, "learning_rate": 0.0001298985917047224, "loss": 0.1838856041431427, "mean_token_accuracy": 0.9216693192720413, "num_tokens": 73174068.0, "step": 5932 }, { "entropy": 0.9916276931762695, "epoch": 3.124275934702475, "grad_norm": 0.3261113166809082, "learning_rate": 0.00012987720550433775, "loss": 0.17985975742340088, "mean_token_accuracy": 0.9207182675600052, "num_tokens": 73186404.0, "step": 5933 }, { "entropy": 0.9735004603862762, "epoch": 3.1248025276461293, "grad_norm": 0.2895289361476898, "learning_rate": 0.0001298558181239593, "loss": 0.17738863825798035, "mean_token_accuracy": 0.92310531437397, "num_tokens": 73198740.0, "step": 5934 }, { "entropy": 0.9904636740684509, "epoch": 3.125329120589784, "grad_norm": 0.26589369773864746, "learning_rate": 0.00012983442956485662, "loss": 0.1570383608341217, "mean_token_accuracy": 0.9323722422122955, "num_tokens": 73211076.0, "step": 5935 }, { "entropy": 1.0544918030500412, "epoch": 3.1258557135334386, "grad_norm": 0.3020542860031128, "learning_rate": 0.00012981303982829948, "loss": 0.18856723606586456, "mean_token_accuracy": 0.9201971888542175, "num_tokens": 73223412.0, "step": 5936 }, { "entropy": 0.9709584712982178, "epoch": 3.126382306477093, "grad_norm": 0.2670464515686035, "learning_rate": 0.00012979164891555766, "loss": 0.167905792593956, "mean_token_accuracy": 0.9310225397348404, "num_tokens": 73235748.0, "step": 5937 }, { "entropy": 1.026566207408905, "epoch": 3.126908899420748, "grad_norm": 0.29108577966690063, "learning_rate": 0.000129770256827901, "loss": 0.17460668087005615, "mean_token_accuracy": 0.9300505667924881, "num_tokens": 73248084.0, "step": 5938 }, { "entropy": 1.0133537948131561, "epoch": 3.1274354923644023, "grad_norm": 0.3254956305027008, "learning_rate": 0.0001297488635665994, "loss": 0.2051609456539154, "mean_token_accuracy": 0.916284367442131, "num_tokens": 73260420.0, "step": 5939 }, { "entropy": 1.0277920812368393, "epoch": 3.1279620853080567, "grad_norm": 0.2922893166542053, "learning_rate": 0.00012972746913292288, "loss": 0.17920175194740295, "mean_token_accuracy": 0.9276208430528641, "num_tokens": 73272756.0, "step": 5940 }, { "entropy": 0.9691586345434189, "epoch": 3.1284886782517116, "grad_norm": 0.2643762230873108, "learning_rate": 0.0001297060735281415, "loss": 0.17805035412311554, "mean_token_accuracy": 0.9242268353700638, "num_tokens": 73285092.0, "step": 5941 }, { "entropy": 1.0250355750322342, "epoch": 3.129015271195366, "grad_norm": 0.28367775678634644, "learning_rate": 0.0001296846767535254, "loss": 0.18581588566303253, "mean_token_accuracy": 0.9214816987514496, "num_tokens": 73297428.0, "step": 5942 }, { "entropy": 1.0472411066293716, "epoch": 3.1295418641390205, "grad_norm": 0.2918038070201874, "learning_rate": 0.00012966327881034476, "loss": 0.18668335676193237, "mean_token_accuracy": 0.9221546500921249, "num_tokens": 73309764.0, "step": 5943 }, { "entropy": 1.0437220931053162, "epoch": 3.130068457082675, "grad_norm": 0.286050021648407, "learning_rate": 0.00012964187969986986, "loss": 0.17461931705474854, "mean_token_accuracy": 0.9245903939008713, "num_tokens": 73322100.0, "step": 5944 }, { "entropy": 1.0097281336784363, "epoch": 3.1305950500263298, "grad_norm": 0.2658098340034485, "learning_rate": 0.00012962047942337106, "loss": 0.16860619187355042, "mean_token_accuracy": 0.9307616651058197, "num_tokens": 73334436.0, "step": 5945 }, { "entropy": 0.9922635406255722, "epoch": 3.131121642969984, "grad_norm": 0.27987632155418396, "learning_rate": 0.00012959907798211872, "loss": 0.1775607317686081, "mean_token_accuracy": 0.9260025918483734, "num_tokens": 73346772.0, "step": 5946 }, { "entropy": 0.9956186562776566, "epoch": 3.1316482359136386, "grad_norm": 0.27126094698905945, "learning_rate": 0.0001295776753773834, "loss": 0.16783833503723145, "mean_token_accuracy": 0.9281550049781799, "num_tokens": 73359108.0, "step": 5947 }, { "entropy": 1.0380958318710327, "epoch": 3.1321748288572935, "grad_norm": 0.2689456343650818, "learning_rate": 0.00012955627161043558, "loss": 0.1678178310394287, "mean_token_accuracy": 0.9268752187490463, "num_tokens": 73371444.0, "step": 5948 }, { "entropy": 1.0214119404554367, "epoch": 3.132701421800948, "grad_norm": 0.281562477350235, "learning_rate": 0.00012953486668254588, "loss": 0.17973113059997559, "mean_token_accuracy": 0.9210423231124878, "num_tokens": 73383780.0, "step": 5949 }, { "entropy": 1.011966422200203, "epoch": 3.1332280147446023, "grad_norm": 0.28674042224884033, "learning_rate": 0.00012951346059498505, "loss": 0.18101146817207336, "mean_token_accuracy": 0.9260558187961578, "num_tokens": 73396116.0, "step": 5950 }, { "entropy": 1.0085774511098862, "epoch": 3.1337546076882568, "grad_norm": 0.27952900528907776, "learning_rate": 0.00012949205334902375, "loss": 0.18016311526298523, "mean_token_accuracy": 0.9254178255796432, "num_tokens": 73408452.0, "step": 5951 }, { "entropy": 1.0077911466360092, "epoch": 3.1342812006319116, "grad_norm": 0.2722882926464081, "learning_rate": 0.00012947064494593286, "loss": 0.18341054022312164, "mean_token_accuracy": 0.9214029014110565, "num_tokens": 73420788.0, "step": 5952 }, { "entropy": 1.038177341222763, "epoch": 3.134807793575566, "grad_norm": 0.2963654100894928, "learning_rate": 0.00012944923538698325, "loss": 0.18527300655841827, "mean_token_accuracy": 0.9238464385271072, "num_tokens": 73433124.0, "step": 5953 }, { "entropy": 1.0265491753816605, "epoch": 3.1353343865192205, "grad_norm": 0.27687832713127136, "learning_rate": 0.00012942782467344593, "loss": 0.1755915731191635, "mean_token_accuracy": 0.9277375042438507, "num_tokens": 73445460.0, "step": 5954 }, { "entropy": 1.0480819642543793, "epoch": 3.1358609794628753, "grad_norm": 0.2859427332878113, "learning_rate": 0.00012940641280659188, "loss": 0.18823222815990448, "mean_token_accuracy": 0.9216801226139069, "num_tokens": 73457796.0, "step": 5955 }, { "entropy": 1.0693493485450745, "epoch": 3.1363875724065298, "grad_norm": 0.3324831426143646, "learning_rate": 0.00012938499978769222, "loss": 0.1855066418647766, "mean_token_accuracy": 0.9238448441028595, "num_tokens": 73470132.0, "step": 5956 }, { "entropy": 1.0338356047868729, "epoch": 3.136914165350184, "grad_norm": 0.26955410838127136, "learning_rate": 0.00012936358561801807, "loss": 0.1669587939977646, "mean_token_accuracy": 0.9290878027677536, "num_tokens": 73482468.0, "step": 5957 }, { "entropy": 1.0918577015399933, "epoch": 3.137440758293839, "grad_norm": 0.3077058792114258, "learning_rate": 0.0001293421702988407, "loss": 0.17801736295223236, "mean_token_accuracy": 0.9242205321788788, "num_tokens": 73494804.0, "step": 5958 }, { "entropy": 1.0301255732774734, "epoch": 3.1379673512374935, "grad_norm": 0.287098228931427, "learning_rate": 0.00012932075383143148, "loss": 0.17325901985168457, "mean_token_accuracy": 0.9261231869459152, "num_tokens": 73507140.0, "step": 5959 }, { "entropy": 1.0039707273244858, "epoch": 3.138493944181148, "grad_norm": 0.2861899733543396, "learning_rate": 0.00012929933621706166, "loss": 0.17903730273246765, "mean_token_accuracy": 0.9243130832910538, "num_tokens": 73519476.0, "step": 5960 }, { "entropy": 1.0366846919059753, "epoch": 3.1390205371248023, "grad_norm": 0.2873387336730957, "learning_rate": 0.00012927791745700277, "loss": 0.1751435399055481, "mean_token_accuracy": 0.9282572865486145, "num_tokens": 73531812.0, "step": 5961 }, { "entropy": 1.093095302581787, "epoch": 3.139547130068457, "grad_norm": 0.2945985198020935, "learning_rate": 0.00012925649755252624, "loss": 0.19299519062042236, "mean_token_accuracy": 0.9205166846513748, "num_tokens": 73544148.0, "step": 5962 }, { "entropy": 1.0331242233514786, "epoch": 3.1400737230121116, "grad_norm": 0.2650090456008911, "learning_rate": 0.0001292350765049037, "loss": 0.18281593918800354, "mean_token_accuracy": 0.9210380017757416, "num_tokens": 73556484.0, "step": 5963 }, { "entropy": 1.0869034230709076, "epoch": 3.140600315955766, "grad_norm": 0.31165093183517456, "learning_rate": 0.0001292136543154068, "loss": 0.18366098403930664, "mean_token_accuracy": 0.9227862507104874, "num_tokens": 73568820.0, "step": 5964 }, { "entropy": 1.008332222700119, "epoch": 3.141126908899421, "grad_norm": 0.27395057678222656, "learning_rate": 0.0001291922309853072, "loss": 0.16771671175956726, "mean_token_accuracy": 0.9288883656263351, "num_tokens": 73581156.0, "step": 5965 }, { "entropy": 1.049354761838913, "epoch": 3.1416535018430753, "grad_norm": 0.296152800321579, "learning_rate": 0.00012917080651587672, "loss": 0.17943327128887177, "mean_token_accuracy": 0.9249696284532547, "num_tokens": 73593492.0, "step": 5966 }, { "entropy": 1.0088461339473724, "epoch": 3.1421800947867298, "grad_norm": 0.2626063823699951, "learning_rate": 0.0001291493809083872, "loss": 0.1711309850215912, "mean_token_accuracy": 0.9292300641536713, "num_tokens": 73605828.0, "step": 5967 }, { "entropy": 1.051283359527588, "epoch": 3.142706687730384, "grad_norm": 0.28641244769096375, "learning_rate": 0.00012912795416411056, "loss": 0.18154369294643402, "mean_token_accuracy": 0.9274348318576813, "num_tokens": 73618164.0, "step": 5968 }, { "entropy": 1.0577448010444641, "epoch": 3.143233280674039, "grad_norm": 0.2720896005630493, "learning_rate": 0.0001291065262843187, "loss": 0.1672617644071579, "mean_token_accuracy": 0.9289580285549164, "num_tokens": 73630500.0, "step": 5969 }, { "entropy": 1.0459100604057312, "epoch": 3.1437598736176935, "grad_norm": 0.30032745003700256, "learning_rate": 0.00012908509727028376, "loss": 0.17962820827960968, "mean_token_accuracy": 0.9249450415372849, "num_tokens": 73642836.0, "step": 5970 }, { "entropy": 1.054712176322937, "epoch": 3.144286466561348, "grad_norm": 0.31555280089378357, "learning_rate": 0.00012906366712327788, "loss": 0.18882232904434204, "mean_token_accuracy": 0.9210335910320282, "num_tokens": 73655172.0, "step": 5971 }, { "entropy": 1.0289185047149658, "epoch": 3.144813059505003, "grad_norm": 0.3134496510028839, "learning_rate": 0.00012904223584457315, "loss": 0.20182853937149048, "mean_token_accuracy": 0.9166600257158279, "num_tokens": 73667508.0, "step": 5972 }, { "entropy": 1.0345142036676407, "epoch": 3.145339652448657, "grad_norm": 0.27865415811538696, "learning_rate": 0.00012902080343544188, "loss": 0.1802331507205963, "mean_token_accuracy": 0.9225296080112457, "num_tokens": 73679844.0, "step": 5973 }, { "entropy": 1.027937650680542, "epoch": 3.1458662453923116, "grad_norm": 0.2987896800041199, "learning_rate": 0.0001289993698971564, "loss": 0.17813797295093536, "mean_token_accuracy": 0.9263286739587784, "num_tokens": 73692180.0, "step": 5974 }, { "entropy": 1.0327493250370026, "epoch": 3.1463928383359665, "grad_norm": 0.2850527763366699, "learning_rate": 0.00012897793523098904, "loss": 0.176524817943573, "mean_token_accuracy": 0.923951119184494, "num_tokens": 73704516.0, "step": 5975 }, { "entropy": 0.9963532090187073, "epoch": 3.146919431279621, "grad_norm": 0.2879466414451599, "learning_rate": 0.00012895649943821228, "loss": 0.18072587251663208, "mean_token_accuracy": 0.9252651482820511, "num_tokens": 73716852.0, "step": 5976 }, { "entropy": 0.9650211036205292, "epoch": 3.1474460242232754, "grad_norm": 0.2874644696712494, "learning_rate": 0.00012893506252009863, "loss": 0.1855263113975525, "mean_token_accuracy": 0.9205344468355179, "num_tokens": 73729188.0, "step": 5977 }, { "entropy": 0.9902265071868896, "epoch": 3.1479726171669298, "grad_norm": 0.30048924684524536, "learning_rate": 0.00012891362447792069, "loss": 0.19820508360862732, "mean_token_accuracy": 0.9142971634864807, "num_tokens": 73741524.0, "step": 5978 }, { "entropy": 0.9674103707075119, "epoch": 3.1484992101105846, "grad_norm": 0.294927716255188, "learning_rate": 0.00012889218531295107, "loss": 0.1868659257888794, "mean_token_accuracy": 0.9226386100053787, "num_tokens": 73753860.0, "step": 5979 }, { "entropy": 0.9716824889183044, "epoch": 3.149025803054239, "grad_norm": 0.2963883578777313, "learning_rate": 0.00012887074502646257, "loss": 0.1829419881105423, "mean_token_accuracy": 0.9211580753326416, "num_tokens": 73766196.0, "step": 5980 }, { "entropy": 0.9973532259464264, "epoch": 3.1495523959978935, "grad_norm": 0.2655693292617798, "learning_rate": 0.0001288493036197279, "loss": 0.16832715272903442, "mean_token_accuracy": 0.9321129769086838, "num_tokens": 73778532.0, "step": 5981 }, { "entropy": 0.9477798938751221, "epoch": 3.1500789889415484, "grad_norm": 0.28809699416160583, "learning_rate": 0.00012882786109401993, "loss": 0.17731884121894836, "mean_token_accuracy": 0.9298195987939835, "num_tokens": 73790868.0, "step": 5982 }, { "entropy": 0.9419539272785187, "epoch": 3.150605581885203, "grad_norm": 0.25741738080978394, "learning_rate": 0.0001288064174506116, "loss": 0.17238347232341766, "mean_token_accuracy": 0.9305710196495056, "num_tokens": 73803204.0, "step": 5983 }, { "entropy": 0.9464537054300308, "epoch": 3.151132174828857, "grad_norm": 0.30378761887550354, "learning_rate": 0.00012878497269077586, "loss": 0.18827325105667114, "mean_token_accuracy": 0.9179285317659378, "num_tokens": 73815540.0, "step": 5984 }, { "entropy": 0.9460196644067764, "epoch": 3.1516587677725116, "grad_norm": 0.286990225315094, "learning_rate": 0.0001287635268157858, "loss": 0.1831638216972351, "mean_token_accuracy": 0.920984223484993, "num_tokens": 73827876.0, "step": 5985 }, { "entropy": 0.9726483821868896, "epoch": 3.1521853607161665, "grad_norm": 0.30301207304000854, "learning_rate": 0.00012874207982691447, "loss": 0.18871383368968964, "mean_token_accuracy": 0.922227144241333, "num_tokens": 73840212.0, "step": 5986 }, { "entropy": 0.9950109422206879, "epoch": 3.152711953659821, "grad_norm": 0.31202518939971924, "learning_rate": 0.00012872063172543512, "loss": 0.19398647546768188, "mean_token_accuracy": 0.9219925999641418, "num_tokens": 73852548.0, "step": 5987 }, { "entropy": 0.9679990857839584, "epoch": 3.1532385466034754, "grad_norm": 0.2762276828289032, "learning_rate": 0.000128699182512621, "loss": 0.16103002429008484, "mean_token_accuracy": 0.9330836683511734, "num_tokens": 73864884.0, "step": 5988 }, { "entropy": 0.9781599789857864, "epoch": 3.1537651395471302, "grad_norm": 0.3027253746986389, "learning_rate": 0.00012867773218974539, "loss": 0.20093132555484772, "mean_token_accuracy": 0.9174567013978958, "num_tokens": 73877220.0, "step": 5989 }, { "entropy": 0.926795020699501, "epoch": 3.1542917324907846, "grad_norm": 0.28476205468177795, "learning_rate": 0.00012865628075808168, "loss": 0.1770479679107666, "mean_token_accuracy": 0.9274154454469681, "num_tokens": 73889556.0, "step": 5990 }, { "entropy": 0.9234910011291504, "epoch": 3.154818325434439, "grad_norm": 0.27796196937561035, "learning_rate": 0.00012863482821890332, "loss": 0.17518147826194763, "mean_token_accuracy": 0.9281267076730728, "num_tokens": 73901892.0, "step": 5991 }, { "entropy": 0.9753734618425369, "epoch": 3.155344918378094, "grad_norm": 0.28891271352767944, "learning_rate": 0.00012861337457348383, "loss": 0.17538145184516907, "mean_token_accuracy": 0.9244814366102219, "num_tokens": 73914228.0, "step": 5992 }, { "entropy": 0.9478357136249542, "epoch": 3.1558715113217484, "grad_norm": 0.28454625606536865, "learning_rate": 0.00012859191982309673, "loss": 0.178102508187294, "mean_token_accuracy": 0.9241252690553665, "num_tokens": 73926564.0, "step": 5993 }, { "entropy": 0.9561555236577988, "epoch": 3.156398104265403, "grad_norm": 0.27385735511779785, "learning_rate": 0.00012857046396901577, "loss": 0.17082807421684265, "mean_token_accuracy": 0.9306003004312515, "num_tokens": 73938900.0, "step": 5994 }, { "entropy": 0.9790538102388382, "epoch": 3.156924697209057, "grad_norm": 0.3030516803264618, "learning_rate": 0.0001285490070125146, "loss": 0.19459722936153412, "mean_token_accuracy": 0.9199800938367844, "num_tokens": 73951236.0, "step": 5995 }, { "entropy": 0.9638478457927704, "epoch": 3.157451290152712, "grad_norm": 0.3094443082809448, "learning_rate": 0.00012852754895486697, "loss": 0.18378609418869019, "mean_token_accuracy": 0.9208549112081528, "num_tokens": 73963572.0, "step": 5996 }, { "entropy": 0.9615375697612762, "epoch": 3.1579778830963665, "grad_norm": 0.30250605940818787, "learning_rate": 0.00012850608979734672, "loss": 0.18148188292980194, "mean_token_accuracy": 0.9263082146644592, "num_tokens": 73975908.0, "step": 5997 }, { "entropy": 1.0005483031272888, "epoch": 3.158504476040021, "grad_norm": 0.3065294623374939, "learning_rate": 0.0001284846295412278, "loss": 0.1826051026582718, "mean_token_accuracy": 0.9210184514522552, "num_tokens": 73988244.0, "step": 5998 }, { "entropy": 0.9474383294582367, "epoch": 3.159031068983676, "grad_norm": 0.27827489376068115, "learning_rate": 0.00012846316818778417, "loss": 0.17282012104988098, "mean_token_accuracy": 0.923882320523262, "num_tokens": 74000580.0, "step": 5999 }, { "entropy": 0.9649649113416672, "epoch": 3.1595576619273302, "grad_norm": 0.2762611508369446, "learning_rate": 0.00012844170573828988, "loss": 0.17711496353149414, "mean_token_accuracy": 0.9302596747875214, "num_tokens": 74012916.0, "step": 6000 }, { "entropy": 0.9723414182662964, "epoch": 3.1600842548709847, "grad_norm": 0.2944243550300598, "learning_rate": 0.00012842024219401898, "loss": 0.16719335317611694, "mean_token_accuracy": 0.9334683865308762, "num_tokens": 74025252.0, "step": 6001 }, { "entropy": 0.9083682596683502, "epoch": 3.160610847814639, "grad_norm": 0.275662362575531, "learning_rate": 0.00012839877755624565, "loss": 0.1716337651014328, "mean_token_accuracy": 0.9241354614496231, "num_tokens": 74037588.0, "step": 6002 }, { "entropy": 0.9236375540494919, "epoch": 3.161137440758294, "grad_norm": 0.2888052463531494, "learning_rate": 0.00012837731182624415, "loss": 0.17050597071647644, "mean_token_accuracy": 0.9272229671478271, "num_tokens": 74049924.0, "step": 6003 }, { "entropy": 0.954410120844841, "epoch": 3.1616640337019484, "grad_norm": 0.2948882281780243, "learning_rate": 0.00012835584500528875, "loss": 0.18716907501220703, "mean_token_accuracy": 0.9205042868852615, "num_tokens": 74062260.0, "step": 6004 }, { "entropy": 0.9476812034845352, "epoch": 3.162190626645603, "grad_norm": 0.2547721862792969, "learning_rate": 0.00012833437709465386, "loss": 0.1682538241147995, "mean_token_accuracy": 0.9294954538345337, "num_tokens": 74074596.0, "step": 6005 }, { "entropy": 0.9671272784471512, "epoch": 3.1627172195892577, "grad_norm": 0.2941117286682129, "learning_rate": 0.00012831290809561382, "loss": 0.1855352371931076, "mean_token_accuracy": 0.9234724044799805, "num_tokens": 74086932.0, "step": 6006 }, { "entropy": 0.9462792277336121, "epoch": 3.163243812532912, "grad_norm": 0.2800365686416626, "learning_rate": 0.00012829143800944314, "loss": 0.1678551584482193, "mean_token_accuracy": 0.9280218780040741, "num_tokens": 74099268.0, "step": 6007 }, { "entropy": 0.9736743271350861, "epoch": 3.1637704054765665, "grad_norm": 0.29358065128326416, "learning_rate": 0.00012826996683741644, "loss": 0.17688816785812378, "mean_token_accuracy": 0.9257215261459351, "num_tokens": 74111604.0, "step": 6008 }, { "entropy": 0.9866583496332169, "epoch": 3.1642969984202214, "grad_norm": 0.3088134229183197, "learning_rate": 0.00012824849458080827, "loss": 0.19596421718597412, "mean_token_accuracy": 0.916352167725563, "num_tokens": 74123940.0, "step": 6009 }, { "entropy": 0.9428907185792923, "epoch": 3.164823591363876, "grad_norm": 0.304568350315094, "learning_rate": 0.00012822702124089337, "loss": 0.1897311508655548, "mean_token_accuracy": 0.9233558624982834, "num_tokens": 74136276.0, "step": 6010 }, { "entropy": 0.9672934710979462, "epoch": 3.1653501843075302, "grad_norm": 0.3099748194217682, "learning_rate": 0.0001282055468189464, "loss": 0.2050492912530899, "mean_token_accuracy": 0.9136051535606384, "num_tokens": 74148612.0, "step": 6011 }, { "entropy": 0.8931698203086853, "epoch": 3.1658767772511847, "grad_norm": 0.2969735264778137, "learning_rate": 0.0001281840713162423, "loss": 0.17930302023887634, "mean_token_accuracy": 0.9252002835273743, "num_tokens": 74160948.0, "step": 6012 }, { "entropy": 0.9153631329536438, "epoch": 3.1664033701948395, "grad_norm": 0.29347336292266846, "learning_rate": 0.0001281625947340558, "loss": 0.1735287308692932, "mean_token_accuracy": 0.9257992506027222, "num_tokens": 74173284.0, "step": 6013 }, { "entropy": 0.9040100425481796, "epoch": 3.166929963138494, "grad_norm": 0.2996053695678711, "learning_rate": 0.00012814111707366195, "loss": 0.1787641942501068, "mean_token_accuracy": 0.9250529259443283, "num_tokens": 74185620.0, "step": 6014 }, { "entropy": 0.9010534137487411, "epoch": 3.1674565560821484, "grad_norm": 0.25485759973526, "learning_rate": 0.0001281196383363357, "loss": 0.159829780459404, "mean_token_accuracy": 0.9268502444028854, "num_tokens": 74197956.0, "step": 6015 }, { "entropy": 0.9162964373826981, "epoch": 3.1679831490258032, "grad_norm": 0.3184720277786255, "learning_rate": 0.00012809815852335213, "loss": 0.18885093927383423, "mean_token_accuracy": 0.9227601438760757, "num_tokens": 74210292.0, "step": 6016 }, { "entropy": 0.886315330862999, "epoch": 3.1685097419694577, "grad_norm": 0.2911457121372223, "learning_rate": 0.00012807667763598638, "loss": 0.17227713763713837, "mean_token_accuracy": 0.9295205473899841, "num_tokens": 74222628.0, "step": 6017 }, { "entropy": 0.9286379963159561, "epoch": 3.169036334913112, "grad_norm": 0.27264803647994995, "learning_rate": 0.0001280551956755136, "loss": 0.1657165288925171, "mean_token_accuracy": 0.9366953074932098, "num_tokens": 74234964.0, "step": 6018 }, { "entropy": 0.930014505982399, "epoch": 3.1695629278567665, "grad_norm": 0.3046049475669861, "learning_rate": 0.00012803371264320912, "loss": 0.1632966250181198, "mean_token_accuracy": 0.9310959875583649, "num_tokens": 74247300.0, "step": 6019 }, { "entropy": 0.9086096882820129, "epoch": 3.1700895208004214, "grad_norm": 0.2823864221572876, "learning_rate": 0.00012801222854034826, "loss": 0.1753690093755722, "mean_token_accuracy": 0.9284543991088867, "num_tokens": 74259636.0, "step": 6020 }, { "entropy": 0.8453738987445831, "epoch": 3.170616113744076, "grad_norm": 0.2871163487434387, "learning_rate": 0.00012799074336820635, "loss": 0.18023160099983215, "mean_token_accuracy": 0.9228629618883133, "num_tokens": 74271972.0, "step": 6021 }, { "entropy": 0.904409795999527, "epoch": 3.1711427066877302, "grad_norm": 0.32247886061668396, "learning_rate": 0.00012796925712805883, "loss": 0.20106787979602814, "mean_token_accuracy": 0.9166100919246674, "num_tokens": 74284308.0, "step": 6022 }, { "entropy": 0.8857452869415283, "epoch": 3.171669299631385, "grad_norm": 0.31473007798194885, "learning_rate": 0.00012794776982118127, "loss": 0.206316739320755, "mean_token_accuracy": 0.9149357676506042, "num_tokens": 74296644.0, "step": 6023 }, { "entropy": 0.8967972993850708, "epoch": 3.1721958925750395, "grad_norm": 0.2719268798828125, "learning_rate": 0.00012792628144884925, "loss": 0.1664860099554062, "mean_token_accuracy": 0.9297046065330505, "num_tokens": 74308980.0, "step": 6024 }, { "entropy": 0.919925644993782, "epoch": 3.172722485518694, "grad_norm": 0.30338454246520996, "learning_rate": 0.00012790479201233834, "loss": 0.17423170804977417, "mean_token_accuracy": 0.9267141819000244, "num_tokens": 74321316.0, "step": 6025 }, { "entropy": 0.9101917892694473, "epoch": 3.173249078462349, "grad_norm": 0.2964281737804413, "learning_rate": 0.00012788330151292432, "loss": 0.17755359411239624, "mean_token_accuracy": 0.925290584564209, "num_tokens": 74333652.0, "step": 6026 }, { "entropy": 0.868523046374321, "epoch": 3.1737756714060033, "grad_norm": 0.32196730375289917, "learning_rate": 0.0001278618099518829, "loss": 0.2060573548078537, "mean_token_accuracy": 0.9190028607845306, "num_tokens": 74345988.0, "step": 6027 }, { "entropy": 0.8719951957464218, "epoch": 3.1743022643496577, "grad_norm": 0.2882232964038849, "learning_rate": 0.00012784031733048992, "loss": 0.1669994592666626, "mean_token_accuracy": 0.9271730333566666, "num_tokens": 74358324.0, "step": 6028 }, { "entropy": 0.8512067198753357, "epoch": 3.174828857293312, "grad_norm": 0.29102852940559387, "learning_rate": 0.00012781882365002132, "loss": 0.1903591752052307, "mean_token_accuracy": 0.9173757582902908, "num_tokens": 74370660.0, "step": 6029 }, { "entropy": 0.8923112750053406, "epoch": 3.175355450236967, "grad_norm": 0.28172409534454346, "learning_rate": 0.000127797328911753, "loss": 0.17183968424797058, "mean_token_accuracy": 0.9267172068357468, "num_tokens": 74382996.0, "step": 6030 }, { "entropy": 0.8994222730398178, "epoch": 3.1758820431806214, "grad_norm": 0.30900153517723083, "learning_rate": 0.00012777583311696097, "loss": 0.19755873084068298, "mean_token_accuracy": 0.9184713661670685, "num_tokens": 74395332.0, "step": 6031 }, { "entropy": 0.9129990190267563, "epoch": 3.176408636124276, "grad_norm": 0.2915842533111572, "learning_rate": 0.00012775433626692131, "loss": 0.17764748632907867, "mean_token_accuracy": 0.9233520030975342, "num_tokens": 74407668.0, "step": 6032 }, { "entropy": 0.8965678662061691, "epoch": 3.1769352290679307, "grad_norm": 0.3085368573665619, "learning_rate": 0.00012773283836291027, "loss": 0.19080962240695953, "mean_token_accuracy": 0.9208065420389175, "num_tokens": 74420004.0, "step": 6033 }, { "entropy": 0.9515413045883179, "epoch": 3.177461822011585, "grad_norm": 0.28024330735206604, "learning_rate": 0.0001277113394062039, "loss": 0.1752488613128662, "mean_token_accuracy": 0.923393651843071, "num_tokens": 74432340.0, "step": 6034 }, { "entropy": 0.8868319243192673, "epoch": 3.1779884149552395, "grad_norm": 0.2637077867984772, "learning_rate": 0.00012768983939807858, "loss": 0.1692328155040741, "mean_token_accuracy": 0.9270408600568771, "num_tokens": 74444676.0, "step": 6035 }, { "entropy": 0.9367111325263977, "epoch": 3.178515007898894, "grad_norm": 0.30866900086402893, "learning_rate": 0.0001276683383398106, "loss": 0.19459642469882965, "mean_token_accuracy": 0.9200681746006012, "num_tokens": 74457012.0, "step": 6036 }, { "entropy": 0.9755773544311523, "epoch": 3.179041600842549, "grad_norm": 0.29067596793174744, "learning_rate": 0.00012764683623267632, "loss": 0.17644400894641876, "mean_token_accuracy": 0.9248355776071548, "num_tokens": 74469348.0, "step": 6037 }, { "entropy": 0.9238932579755783, "epoch": 3.1795681937862033, "grad_norm": 0.2967524528503418, "learning_rate": 0.00012762533307795226, "loss": 0.18571233749389648, "mean_token_accuracy": 0.9185805767774582, "num_tokens": 74481684.0, "step": 6038 }, { "entropy": 0.9369767755270004, "epoch": 3.1800947867298577, "grad_norm": 0.27729305624961853, "learning_rate": 0.0001276038288769149, "loss": 0.17377406358718872, "mean_token_accuracy": 0.9294021874666214, "num_tokens": 74494020.0, "step": 6039 }, { "entropy": 0.9587116092443466, "epoch": 3.1806213796735125, "grad_norm": 0.2849549651145935, "learning_rate": 0.0001275823236308408, "loss": 0.17863985896110535, "mean_token_accuracy": 0.9239156097173691, "num_tokens": 74506356.0, "step": 6040 }, { "entropy": 0.906728059053421, "epoch": 3.181147972617167, "grad_norm": 0.2766047418117523, "learning_rate": 0.00012756081734100662, "loss": 0.17260222136974335, "mean_token_accuracy": 0.9303994923830032, "num_tokens": 74518692.0, "step": 6041 }, { "entropy": 0.9309165328741074, "epoch": 3.1816745655608214, "grad_norm": 0.25417715311050415, "learning_rate": 0.00012753931000868908, "loss": 0.17008274793624878, "mean_token_accuracy": 0.9315279871225357, "num_tokens": 74531028.0, "step": 6042 }, { "entropy": 0.9460414797067642, "epoch": 3.1822011585044763, "grad_norm": 0.2841247320175171, "learning_rate": 0.0001275178016351649, "loss": 0.20334357023239136, "mean_token_accuracy": 0.9160185158252716, "num_tokens": 74543364.0, "step": 6043 }, { "entropy": 0.9646149277687073, "epoch": 3.1827277514481307, "grad_norm": 0.27899524569511414, "learning_rate": 0.000127496292221711, "loss": 0.16916584968566895, "mean_token_accuracy": 0.9278223812580109, "num_tokens": 74555700.0, "step": 6044 }, { "entropy": 1.0223030000925064, "epoch": 3.183254344391785, "grad_norm": 0.3250932991504669, "learning_rate": 0.0001274747817696042, "loss": 0.20184363424777985, "mean_token_accuracy": 0.9218162596225739, "num_tokens": 74568036.0, "step": 6045 }, { "entropy": 0.9621344953775406, "epoch": 3.1837809373354395, "grad_norm": 0.26898354291915894, "learning_rate": 0.0001274532702801214, "loss": 0.16600225865840912, "mean_token_accuracy": 0.9326440840959549, "num_tokens": 74580372.0, "step": 6046 }, { "entropy": 0.9494886696338654, "epoch": 3.1843075302790944, "grad_norm": 0.27224642038345337, "learning_rate": 0.0001274317577545397, "loss": 0.17049263417720795, "mean_token_accuracy": 0.9249418377876282, "num_tokens": 74592708.0, "step": 6047 }, { "entropy": 0.9812628626823425, "epoch": 3.184834123222749, "grad_norm": 0.2864963710308075, "learning_rate": 0.00012741024419413613, "loss": 0.1766996532678604, "mean_token_accuracy": 0.9260700345039368, "num_tokens": 74605044.0, "step": 6048 }, { "entropy": 1.0052879303693771, "epoch": 3.1853607161664033, "grad_norm": 0.3256306052207947, "learning_rate": 0.0001273887296001879, "loss": 0.19246399402618408, "mean_token_accuracy": 0.9181402176618576, "num_tokens": 74617380.0, "step": 6049 }, { "entropy": 1.0402062833309174, "epoch": 3.185887309110058, "grad_norm": 0.31314828991889954, "learning_rate": 0.00012736721397397206, "loss": 0.18360930681228638, "mean_token_accuracy": 0.9209848344326019, "num_tokens": 74629716.0, "step": 6050 }, { "entropy": 1.0098388940095901, "epoch": 3.1864139020537126, "grad_norm": 0.2711458206176758, "learning_rate": 0.000127345697316766, "loss": 0.16650447249412537, "mean_token_accuracy": 0.927087277173996, "num_tokens": 74642052.0, "step": 6051 }, { "entropy": 1.044172078371048, "epoch": 3.186940494997367, "grad_norm": 0.3235626518726349, "learning_rate": 0.00012732417962984697, "loss": 0.19019578397274017, "mean_token_accuracy": 0.9197899550199509, "num_tokens": 74654388.0, "step": 6052 }, { "entropy": 1.0233334600925446, "epoch": 3.1874670879410214, "grad_norm": 0.28503936529159546, "learning_rate": 0.0001273026609144924, "loss": 0.18028733134269714, "mean_token_accuracy": 0.9271443486213684, "num_tokens": 74666724.0, "step": 6053 }, { "entropy": 1.0430432260036469, "epoch": 3.1879936808846763, "grad_norm": 0.28121379017829895, "learning_rate": 0.00012728114117197963, "loss": 0.17312172055244446, "mean_token_accuracy": 0.9267847239971161, "num_tokens": 74679060.0, "step": 6054 }, { "entropy": 0.9970735609531403, "epoch": 3.1885202738283307, "grad_norm": 0.31420785188674927, "learning_rate": 0.0001272596204035863, "loss": 0.1869233250617981, "mean_token_accuracy": 0.9196929782629013, "num_tokens": 74691396.0, "step": 6055 }, { "entropy": 1.0581863820552826, "epoch": 3.189046866771985, "grad_norm": 0.31081312894821167, "learning_rate": 0.00012723809861058986, "loss": 0.17754991352558136, "mean_token_accuracy": 0.9275716245174408, "num_tokens": 74703732.0, "step": 6056 }, { "entropy": 1.0594633221626282, "epoch": 3.18957345971564, "grad_norm": 0.2916032373905182, "learning_rate": 0.00012721657579426796, "loss": 0.16658541560173035, "mean_token_accuracy": 0.9299917966127396, "num_tokens": 74716068.0, "step": 6057 }, { "entropy": 1.0787553191184998, "epoch": 3.1901000526592944, "grad_norm": 0.2959164083003998, "learning_rate": 0.00012719505195589833, "loss": 0.18187478184700012, "mean_token_accuracy": 0.9289588928222656, "num_tokens": 74728404.0, "step": 6058 }, { "entropy": 1.0568149238824844, "epoch": 3.190626645602949, "grad_norm": 0.26274511218070984, "learning_rate": 0.00012717352709675872, "loss": 0.16812138259410858, "mean_token_accuracy": 0.9347347170114517, "num_tokens": 74740740.0, "step": 6059 }, { "entropy": 1.0166764706373215, "epoch": 3.1911532385466037, "grad_norm": 0.27479109168052673, "learning_rate": 0.00012715200121812687, "loss": 0.17319561541080475, "mean_token_accuracy": 0.9268957078456879, "num_tokens": 74753076.0, "step": 6060 }, { "entropy": 1.090210884809494, "epoch": 3.191679831490258, "grad_norm": 0.30568063259124756, "learning_rate": 0.00012713047432128067, "loss": 0.17797154188156128, "mean_token_accuracy": 0.9297853410243988, "num_tokens": 74765412.0, "step": 6061 }, { "entropy": 1.0944711565971375, "epoch": 3.1922064244339126, "grad_norm": 0.29322412610054016, "learning_rate": 0.00012710894640749807, "loss": 0.17470967769622803, "mean_token_accuracy": 0.9270069003105164, "num_tokens": 74777748.0, "step": 6062 }, { "entropy": 1.0665898323059082, "epoch": 3.192733017377567, "grad_norm": 0.2914141118526459, "learning_rate": 0.00012708741747805702, "loss": 0.19307973980903625, "mean_token_accuracy": 0.9191839843988419, "num_tokens": 74790084.0, "step": 6063 }, { "entropy": 1.0894026160240173, "epoch": 3.193259610321222, "grad_norm": 0.285011351108551, "learning_rate": 0.0001270658875342356, "loss": 0.17769688367843628, "mean_token_accuracy": 0.9278746247291565, "num_tokens": 74802420.0, "step": 6064 }, { "entropy": 1.113456517457962, "epoch": 3.1937862032648763, "grad_norm": 0.31497251987457275, "learning_rate": 0.00012704435657731188, "loss": 0.1936781406402588, "mean_token_accuracy": 0.9238170832395554, "num_tokens": 74814756.0, "step": 6065 }, { "entropy": 1.0806358754634857, "epoch": 3.1943127962085307, "grad_norm": 0.28313109278678894, "learning_rate": 0.00012702282460856407, "loss": 0.18170379102230072, "mean_token_accuracy": 0.9257088601589203, "num_tokens": 74827092.0, "step": 6066 }, { "entropy": 1.1051075458526611, "epoch": 3.194839389152185, "grad_norm": 0.2947232723236084, "learning_rate": 0.0001270012916292704, "loss": 0.1816052347421646, "mean_token_accuracy": 0.9246692359447479, "num_tokens": 74839428.0, "step": 6067 }, { "entropy": 1.17019122838974, "epoch": 3.19536598209584, "grad_norm": 0.31820914149284363, "learning_rate": 0.00012697975764070914, "loss": 0.18826723098754883, "mean_token_accuracy": 0.9142595082521439, "num_tokens": 74851764.0, "step": 6068 }, { "entropy": 1.102179765701294, "epoch": 3.1958925750394944, "grad_norm": 0.30241599678993225, "learning_rate": 0.0001269582226441586, "loss": 0.2013278603553772, "mean_token_accuracy": 0.9154189229011536, "num_tokens": 74864100.0, "step": 6069 }, { "entropy": 1.1176361441612244, "epoch": 3.196419167983149, "grad_norm": 0.2859967052936554, "learning_rate": 0.00012693668664089724, "loss": 0.18881945312023163, "mean_token_accuracy": 0.9228017330169678, "num_tokens": 74876436.0, "step": 6070 }, { "entropy": 1.147952139377594, "epoch": 3.1969457609268037, "grad_norm": 0.3129325807094574, "learning_rate": 0.0001269151496322035, "loss": 0.20676347613334656, "mean_token_accuracy": 0.9172220826148987, "num_tokens": 74888772.0, "step": 6071 }, { "entropy": 1.0977469086647034, "epoch": 3.197472353870458, "grad_norm": 0.2926788926124573, "learning_rate": 0.0001268936116193559, "loss": 0.17107011377811432, "mean_token_accuracy": 0.929108127951622, "num_tokens": 74901108.0, "step": 6072 }, { "entropy": 1.117818146944046, "epoch": 3.1979989468141126, "grad_norm": 0.28832677006721497, "learning_rate": 0.00012687207260363308, "loss": 0.18728822469711304, "mean_token_accuracy": 0.9181636422872543, "num_tokens": 74913444.0, "step": 6073 }, { "entropy": 1.1389150619506836, "epoch": 3.1985255397577674, "grad_norm": 0.28520458936691284, "learning_rate": 0.00012685053258631364, "loss": 0.18073593080043793, "mean_token_accuracy": 0.9208191931247711, "num_tokens": 74925780.0, "step": 6074 }, { "entropy": 1.139819324016571, "epoch": 3.199052132701422, "grad_norm": 0.3071376383304596, "learning_rate": 0.00012682899156867626, "loss": 0.19548124074935913, "mean_token_accuracy": 0.9135144054889679, "num_tokens": 74938116.0, "step": 6075 }, { "entropy": 1.1386458277702332, "epoch": 3.1995787256450763, "grad_norm": 0.2790388762950897, "learning_rate": 0.00012680744955199976, "loss": 0.17659339308738708, "mean_token_accuracy": 0.9237524420022964, "num_tokens": 74950452.0, "step": 6076 }, { "entropy": 1.1673567295074463, "epoch": 3.2001053185887307, "grad_norm": 0.2836650013923645, "learning_rate": 0.00012678590653756295, "loss": 0.18439726531505585, "mean_token_accuracy": 0.9258717596530914, "num_tokens": 74962788.0, "step": 6077 }, { "entropy": 1.1256002485752106, "epoch": 3.2006319115323856, "grad_norm": 0.2836996018886566, "learning_rate": 0.00012676436252664468, "loss": 0.1797911673784256, "mean_token_accuracy": 0.9222531169652939, "num_tokens": 74975124.0, "step": 6078 }, { "entropy": 1.139472633600235, "epoch": 3.20115850447604, "grad_norm": 0.29277554154396057, "learning_rate": 0.00012674281752052396, "loss": 0.1976083517074585, "mean_token_accuracy": 0.9170555472373962, "num_tokens": 74987460.0, "step": 6079 }, { "entropy": 1.1551057398319244, "epoch": 3.2016850974196944, "grad_norm": 0.2957473695278168, "learning_rate": 0.00012672127152047973, "loss": 0.1852739304304123, "mean_token_accuracy": 0.9232263416051865, "num_tokens": 74999796.0, "step": 6080 }, { "entropy": 1.1753365695476532, "epoch": 3.2022116903633493, "grad_norm": 0.29280924797058105, "learning_rate": 0.000126699724527791, "loss": 0.18121716380119324, "mean_token_accuracy": 0.9265182018280029, "num_tokens": 75012132.0, "step": 6081 }, { "entropy": 1.1696423590183258, "epoch": 3.2027382833070037, "grad_norm": 0.3267524838447571, "learning_rate": 0.00012667817654373704, "loss": 0.19591163098812103, "mean_token_accuracy": 0.9163945615291595, "num_tokens": 75024468.0, "step": 6082 }, { "entropy": 1.2067201733589172, "epoch": 3.203264876250658, "grad_norm": 0.2947297990322113, "learning_rate": 0.00012665662756959693, "loss": 0.1690807342529297, "mean_token_accuracy": 0.9303170293569565, "num_tokens": 75036804.0, "step": 6083 }, { "entropy": 1.1902517676353455, "epoch": 3.2037914691943126, "grad_norm": 0.29545536637306213, "learning_rate": 0.00012663507760664994, "loss": 0.18513049185276031, "mean_token_accuracy": 0.9230286926031113, "num_tokens": 75049140.0, "step": 6084 }, { "entropy": 1.1767702102661133, "epoch": 3.2043180621379674, "grad_norm": 0.29497984051704407, "learning_rate": 0.0001266135266561753, "loss": 0.17692333459854126, "mean_token_accuracy": 0.9241546839475632, "num_tokens": 75061476.0, "step": 6085 }, { "entropy": 1.1620597839355469, "epoch": 3.204844655081622, "grad_norm": 0.28324300050735474, "learning_rate": 0.00012659197471945246, "loss": 0.18718908727169037, "mean_token_accuracy": 0.9241278767585754, "num_tokens": 75073812.0, "step": 6086 }, { "entropy": 1.1229282915592194, "epoch": 3.2053712480252763, "grad_norm": 0.25627800822257996, "learning_rate": 0.00012657042179776078, "loss": 0.1552576869726181, "mean_token_accuracy": 0.9354147613048553, "num_tokens": 75086148.0, "step": 6087 }, { "entropy": 1.1936973929405212, "epoch": 3.205897840968931, "grad_norm": 0.28294000029563904, "learning_rate": 0.0001265488678923797, "loss": 0.1731725037097931, "mean_token_accuracy": 0.925356075167656, "num_tokens": 75098484.0, "step": 6088 }, { "entropy": 1.1629082262516022, "epoch": 3.2064244339125856, "grad_norm": 0.2877937853336334, "learning_rate": 0.00012652731300458883, "loss": 0.17543064057826996, "mean_token_accuracy": 0.9272084087133408, "num_tokens": 75110820.0, "step": 6089 }, { "entropy": 1.2082597315311432, "epoch": 3.20695102685624, "grad_norm": 0.2778930962085724, "learning_rate": 0.00012650575713566767, "loss": 0.16450908780097961, "mean_token_accuracy": 0.9307198077440262, "num_tokens": 75123156.0, "step": 6090 }, { "entropy": 1.226649910211563, "epoch": 3.207477619799895, "grad_norm": 0.2595750391483307, "learning_rate": 0.00012648420028689596, "loss": 0.16251420974731445, "mean_token_accuracy": 0.9295267313718796, "num_tokens": 75135492.0, "step": 6091 }, { "entropy": 1.158011019229889, "epoch": 3.2080042127435493, "grad_norm": 0.2987614870071411, "learning_rate": 0.0001264626424595533, "loss": 0.18314017355442047, "mean_token_accuracy": 0.9236122965812683, "num_tokens": 75147828.0, "step": 6092 }, { "entropy": 1.1719801127910614, "epoch": 3.2085308056872037, "grad_norm": 0.308034211397171, "learning_rate": 0.00012644108365491958, "loss": 0.19339613616466522, "mean_token_accuracy": 0.9197325706481934, "num_tokens": 75160164.0, "step": 6093 }, { "entropy": 1.1360925734043121, "epoch": 3.209057398630858, "grad_norm": 0.2838227152824402, "learning_rate": 0.00012641952387427448, "loss": 0.1735890656709671, "mean_token_accuracy": 0.9284939914941788, "num_tokens": 75172500.0, "step": 6094 }, { "entropy": 1.1555771827697754, "epoch": 3.209583991574513, "grad_norm": 0.3021514415740967, "learning_rate": 0.00012639796311889796, "loss": 0.18424902856349945, "mean_token_accuracy": 0.9217068552970886, "num_tokens": 75184836.0, "step": 6095 }, { "entropy": 1.1850262582302094, "epoch": 3.2101105845181674, "grad_norm": 0.29426127672195435, "learning_rate": 0.00012637640139006998, "loss": 0.1832590401172638, "mean_token_accuracy": 0.9267239272594452, "num_tokens": 75197172.0, "step": 6096 }, { "entropy": 1.174637347459793, "epoch": 3.210637177461822, "grad_norm": 0.2878929376602173, "learning_rate": 0.0001263548386890705, "loss": 0.18444159626960754, "mean_token_accuracy": 0.9251533895730972, "num_tokens": 75209508.0, "step": 6097 }, { "entropy": 1.2012336254119873, "epoch": 3.2111637704054767, "grad_norm": 0.29878565669059753, "learning_rate": 0.00012633327501717956, "loss": 0.18056027591228485, "mean_token_accuracy": 0.9282454997301102, "num_tokens": 75221844.0, "step": 6098 }, { "entropy": 1.1817958354949951, "epoch": 3.211690363349131, "grad_norm": 0.2876642346382141, "learning_rate": 0.00012631171037567727, "loss": 0.17095500230789185, "mean_token_accuracy": 0.924737811088562, "num_tokens": 75234180.0, "step": 6099 }, { "entropy": 1.1270457804203033, "epoch": 3.2122169562927856, "grad_norm": 0.24099025130271912, "learning_rate": 0.0001262901447658438, "loss": 0.15860724449157715, "mean_token_accuracy": 0.931660920381546, "num_tokens": 75246516.0, "step": 6100 }, { "entropy": 1.1745367348194122, "epoch": 3.21274354923644, "grad_norm": 0.2938980460166931, "learning_rate": 0.00012626857818895938, "loss": 0.18283730745315552, "mean_token_accuracy": 0.9220217019319534, "num_tokens": 75258852.0, "step": 6101 }, { "entropy": 1.1532530188560486, "epoch": 3.213270142180095, "grad_norm": 0.27625831961631775, "learning_rate": 0.00012624701064630433, "loss": 0.17850688099861145, "mean_token_accuracy": 0.9294148087501526, "num_tokens": 75271188.0, "step": 6102 }, { "entropy": 1.160976082086563, "epoch": 3.2137967351237493, "grad_norm": 0.29574382305145264, "learning_rate": 0.00012622544213915894, "loss": 0.17223690450191498, "mean_token_accuracy": 0.9264660626649857, "num_tokens": 75283524.0, "step": 6103 }, { "entropy": 1.1664827466011047, "epoch": 3.2143233280674037, "grad_norm": 0.29536303877830505, "learning_rate": 0.0001262038726688036, "loss": 0.18994994461536407, "mean_token_accuracy": 0.9243973344564438, "num_tokens": 75295860.0, "step": 6104 }, { "entropy": 1.1745307743549347, "epoch": 3.2148499210110586, "grad_norm": 0.30445703864097595, "learning_rate": 0.00012618230223651876, "loss": 0.1881660670042038, "mean_token_accuracy": 0.923809602856636, "num_tokens": 75308196.0, "step": 6105 }, { "entropy": 1.1292920410633087, "epoch": 3.215376513954713, "grad_norm": 0.2815026044845581, "learning_rate": 0.000126160730843585, "loss": 0.18442246317863464, "mean_token_accuracy": 0.9258362799882889, "num_tokens": 75320532.0, "step": 6106 }, { "entropy": 1.1680370271205902, "epoch": 3.2159031068983674, "grad_norm": 0.3535638451576233, "learning_rate": 0.0001261391584912828, "loss": 0.2101319283246994, "mean_token_accuracy": 0.9123208075761795, "num_tokens": 75332868.0, "step": 6107 }, { "entropy": 1.1719010472297668, "epoch": 3.2164296998420223, "grad_norm": 0.31875982880592346, "learning_rate": 0.00012611758518089286, "loss": 0.1957074999809265, "mean_token_accuracy": 0.9135269224643707, "num_tokens": 75345204.0, "step": 6108 }, { "entropy": 1.2349201440811157, "epoch": 3.2169562927856767, "grad_norm": 0.3066956102848053, "learning_rate": 0.00012609601091369583, "loss": 0.1689293086528778, "mean_token_accuracy": 0.9295897334814072, "num_tokens": 75357540.0, "step": 6109 }, { "entropy": 1.1840606331825256, "epoch": 3.217482885729331, "grad_norm": 0.29718321561813354, "learning_rate": 0.00012607443569097245, "loss": 0.20115578174591064, "mean_token_accuracy": 0.9171886295080185, "num_tokens": 75369876.0, "step": 6110 }, { "entropy": 1.1642614603042603, "epoch": 3.2180094786729856, "grad_norm": 0.2805807590484619, "learning_rate": 0.0001260528595140035, "loss": 0.17763221263885498, "mean_token_accuracy": 0.9212594777345657, "num_tokens": 75382212.0, "step": 6111 }, { "entropy": 1.2080804705619812, "epoch": 3.2185360716166405, "grad_norm": 0.284940242767334, "learning_rate": 0.00012603128238406985, "loss": 0.1861756145954132, "mean_token_accuracy": 0.9266208410263062, "num_tokens": 75394548.0, "step": 6112 }, { "entropy": 1.2124915719032288, "epoch": 3.219062664560295, "grad_norm": 0.3166573643684387, "learning_rate": 0.00012600970430245236, "loss": 0.20203432440757751, "mean_token_accuracy": 0.9154464155435562, "num_tokens": 75406884.0, "step": 6113 }, { "entropy": 1.1943967640399933, "epoch": 3.2195892575039493, "grad_norm": 0.2512170672416687, "learning_rate": 0.00012598812527043208, "loss": 0.16128602623939514, "mean_token_accuracy": 0.9311299026012421, "num_tokens": 75419220.0, "step": 6114 }, { "entropy": 1.2292022109031677, "epoch": 3.220115850447604, "grad_norm": 0.28310030698776245, "learning_rate": 0.00012596654528929, "loss": 0.1860269159078598, "mean_token_accuracy": 0.9250501245260239, "num_tokens": 75431556.0, "step": 6115 }, { "entropy": 1.2319591641426086, "epoch": 3.2206424433912586, "grad_norm": 0.3099038898944855, "learning_rate": 0.00012594496436030714, "loss": 0.19201034307479858, "mean_token_accuracy": 0.9213238954544067, "num_tokens": 75443892.0, "step": 6116 }, { "entropy": 1.2286298871040344, "epoch": 3.221169036334913, "grad_norm": 0.29794779419898987, "learning_rate": 0.0001259233824847647, "loss": 0.1706649363040924, "mean_token_accuracy": 0.9281015396118164, "num_tokens": 75456228.0, "step": 6117 }, { "entropy": 1.2060716450214386, "epoch": 3.2216956292785675, "grad_norm": 0.30427494645118713, "learning_rate": 0.00012590179966394388, "loss": 0.19397449493408203, "mean_token_accuracy": 0.9212569743394852, "num_tokens": 75468564.0, "step": 6118 }, { "entropy": 1.239819973707199, "epoch": 3.2222222222222223, "grad_norm": 0.2990228831768036, "learning_rate": 0.0001258802158991259, "loss": 0.18792952597141266, "mean_token_accuracy": 0.9206580072641373, "num_tokens": 75480900.0, "step": 6119 }, { "entropy": 1.23019939661026, "epoch": 3.2227488151658767, "grad_norm": 0.27720263600349426, "learning_rate": 0.00012585863119159198, "loss": 0.18679332733154297, "mean_token_accuracy": 0.9180274903774261, "num_tokens": 75493236.0, "step": 6120 }, { "entropy": 1.2414479851722717, "epoch": 3.223275408109531, "grad_norm": 0.28125715255737305, "learning_rate": 0.00012583704554262364, "loss": 0.16257213056087494, "mean_token_accuracy": 0.9326681643724442, "num_tokens": 75505572.0, "step": 6121 }, { "entropy": 1.2053897678852081, "epoch": 3.223802001053186, "grad_norm": 0.26854726672172546, "learning_rate": 0.00012581545895350217, "loss": 0.17040804028511047, "mean_token_accuracy": 0.9294180870056152, "num_tokens": 75517908.0, "step": 6122 }, { "entropy": 1.2712475657463074, "epoch": 3.2243285939968405, "grad_norm": 0.30547404289245605, "learning_rate": 0.0001257938714255091, "loss": 0.18066394329071045, "mean_token_accuracy": 0.9216051995754242, "num_tokens": 75530244.0, "step": 6123 }, { "entropy": 1.2184970080852509, "epoch": 3.224855186940495, "grad_norm": 0.2835502624511719, "learning_rate": 0.0001257722829599259, "loss": 0.1837792992591858, "mean_token_accuracy": 0.9190782308578491, "num_tokens": 75542580.0, "step": 6124 }, { "entropy": 1.191634327173233, "epoch": 3.2253817798841498, "grad_norm": 0.2832392156124115, "learning_rate": 0.00012575069355803427, "loss": 0.17726731300354004, "mean_token_accuracy": 0.9231899827718735, "num_tokens": 75554916.0, "step": 6125 }, { "entropy": 1.2391059696674347, "epoch": 3.225908372827804, "grad_norm": 0.30272725224494934, "learning_rate": 0.0001257291032211157, "loss": 0.18769414722919464, "mean_token_accuracy": 0.9255936145782471, "num_tokens": 75567252.0, "step": 6126 }, { "entropy": 1.177028775215149, "epoch": 3.2264349657714586, "grad_norm": 0.260392963886261, "learning_rate": 0.00012570751195045197, "loss": 0.1694093942642212, "mean_token_accuracy": 0.9297531694173813, "num_tokens": 75579588.0, "step": 6127 }, { "entropy": 1.2347355782985687, "epoch": 3.226961558715113, "grad_norm": 0.2754638195037842, "learning_rate": 0.00012568591974732477, "loss": 0.17848004400730133, "mean_token_accuracy": 0.925995871424675, "num_tokens": 75591924.0, "step": 6128 }, { "entropy": 1.202033132314682, "epoch": 3.227488151658768, "grad_norm": 0.2989853322505951, "learning_rate": 0.00012566432661301598, "loss": 0.17350336909294128, "mean_token_accuracy": 0.9255778640508652, "num_tokens": 75604260.0, "step": 6129 }, { "entropy": 1.1826526522636414, "epoch": 3.2280147446024223, "grad_norm": 0.29631954431533813, "learning_rate": 0.0001256427325488074, "loss": 0.18491564691066742, "mean_token_accuracy": 0.92462258040905, "num_tokens": 75616596.0, "step": 6130 }, { "entropy": 1.212283730506897, "epoch": 3.2285413375460768, "grad_norm": 0.2688755691051483, "learning_rate": 0.00012562113755598095, "loss": 0.1655760407447815, "mean_token_accuracy": 0.9282697588205338, "num_tokens": 75628932.0, "step": 6131 }, { "entropy": 1.2409653961658478, "epoch": 3.2290679304897316, "grad_norm": 0.2876735329627991, "learning_rate": 0.00012559954163581866, "loss": 0.17220713198184967, "mean_token_accuracy": 0.9249308109283447, "num_tokens": 75641268.0, "step": 6132 }, { "entropy": 1.2126244008541107, "epoch": 3.229594523433386, "grad_norm": 0.3038305640220642, "learning_rate": 0.00012557794478960246, "loss": 0.1925899088382721, "mean_token_accuracy": 0.9231642782688141, "num_tokens": 75653604.0, "step": 6133 }, { "entropy": 1.2351355254650116, "epoch": 3.2301211163770405, "grad_norm": 0.32141029834747314, "learning_rate": 0.00012555634701861448, "loss": 0.19204822182655334, "mean_token_accuracy": 0.920773446559906, "num_tokens": 75665940.0, "step": 6134 }, { "entropy": 1.183781385421753, "epoch": 3.230647709320695, "grad_norm": 0.28224945068359375, "learning_rate": 0.00012553474832413685, "loss": 0.188804030418396, "mean_token_accuracy": 0.9181794226169586, "num_tokens": 75678276.0, "step": 6135 }, { "entropy": 1.2339649200439453, "epoch": 3.2311743022643498, "grad_norm": 0.26924869418144226, "learning_rate": 0.00012551314870745174, "loss": 0.16667309403419495, "mean_token_accuracy": 0.9302802532911301, "num_tokens": 75690612.0, "step": 6136 }, { "entropy": 1.2304637134075165, "epoch": 3.231700895208004, "grad_norm": 0.3316200375556946, "learning_rate": 0.00012549154816984142, "loss": 0.1978515088558197, "mean_token_accuracy": 0.9189146757125854, "num_tokens": 75702948.0, "step": 6137 }, { "entropy": 1.2245360910892487, "epoch": 3.2322274881516586, "grad_norm": 0.29681289196014404, "learning_rate": 0.0001254699467125882, "loss": 0.16820311546325684, "mean_token_accuracy": 0.9299140870571136, "num_tokens": 75715284.0, "step": 6138 }, { "entropy": 1.1647963225841522, "epoch": 3.2327540810953135, "grad_norm": 0.2810593545436859, "learning_rate": 0.0001254483443369744, "loss": 0.17601312696933746, "mean_token_accuracy": 0.9255238920450211, "num_tokens": 75727620.0, "step": 6139 }, { "entropy": 1.2284044921398163, "epoch": 3.233280674038968, "grad_norm": 0.3164808750152588, "learning_rate": 0.00012542674104428243, "loss": 0.19982348382472992, "mean_token_accuracy": 0.9159713089466095, "num_tokens": 75739956.0, "step": 6140 }, { "entropy": 1.2567321062088013, "epoch": 3.2338072669826223, "grad_norm": 0.3081972897052765, "learning_rate": 0.00012540513683579474, "loss": 0.19968608021736145, "mean_token_accuracy": 0.9218475669622421, "num_tokens": 75752292.0, "step": 6141 }, { "entropy": 1.2771920561790466, "epoch": 3.234333859926277, "grad_norm": 0.30709677934646606, "learning_rate": 0.00012538353171279387, "loss": 0.19182801246643066, "mean_token_accuracy": 0.9227764755487442, "num_tokens": 75764628.0, "step": 6142 }, { "entropy": 1.17875474691391, "epoch": 3.2348604528699316, "grad_norm": 0.28673815727233887, "learning_rate": 0.0001253619256765624, "loss": 0.18364201486110687, "mean_token_accuracy": 0.9248145222663879, "num_tokens": 75776964.0, "step": 6143 }, { "entropy": 1.1919936537742615, "epoch": 3.235387045813586, "grad_norm": 0.2708572447299957, "learning_rate": 0.00012534031872838292, "loss": 0.164185032248497, "mean_token_accuracy": 0.9241882562637329, "num_tokens": 75789300.0, "step": 6144 }, { "entropy": 1.2565065324306488, "epoch": 3.2359136387572405, "grad_norm": 0.32703325152397156, "learning_rate": 0.00012531871086953814, "loss": 0.18734511733055115, "mean_token_accuracy": 0.9243505895137787, "num_tokens": 75801636.0, "step": 6145 }, { "entropy": 1.1935489773750305, "epoch": 3.2364402317008953, "grad_norm": 0.29197418689727783, "learning_rate": 0.0001252971021013108, "loss": 0.18213504552841187, "mean_token_accuracy": 0.9209382683038712, "num_tokens": 75813972.0, "step": 6146 }, { "entropy": 1.2141109108924866, "epoch": 3.2369668246445498, "grad_norm": 0.28175437450408936, "learning_rate": 0.00012527549242498365, "loss": 0.16677020490169525, "mean_token_accuracy": 0.9321560859680176, "num_tokens": 75826308.0, "step": 6147 }, { "entropy": 1.2104218900203705, "epoch": 3.237493417588204, "grad_norm": 0.30901896953582764, "learning_rate": 0.00012525388184183952, "loss": 0.18270671367645264, "mean_token_accuracy": 0.9228143841028214, "num_tokens": 75838644.0, "step": 6148 }, { "entropy": 1.2070663571357727, "epoch": 3.238020010531859, "grad_norm": 0.31356850266456604, "learning_rate": 0.00012523227035316135, "loss": 0.16722548007965088, "mean_token_accuracy": 0.9297654330730438, "num_tokens": 75850980.0, "step": 6149 }, { "entropy": 1.2063406705856323, "epoch": 3.2385466034755135, "grad_norm": 0.29572710394859314, "learning_rate": 0.0001252106579602321, "loss": 0.1823430061340332, "mean_token_accuracy": 0.9221715778112411, "num_tokens": 75863316.0, "step": 6150 }, { "entropy": 1.202089548110962, "epoch": 3.239073196419168, "grad_norm": 0.41573962569236755, "learning_rate": 0.0001251890446643347, "loss": 0.18167167901992798, "mean_token_accuracy": 0.9231297075748444, "num_tokens": 75875652.0, "step": 6151 }, { "entropy": 1.2254632711410522, "epoch": 3.2395997893628223, "grad_norm": 0.30677860975265503, "learning_rate": 0.00012516743046675228, "loss": 0.17912791669368744, "mean_token_accuracy": 0.9259785264730453, "num_tokens": 75887988.0, "step": 6152 }, { "entropy": 1.2403289377689362, "epoch": 3.240126382306477, "grad_norm": 0.28188419342041016, "learning_rate": 0.00012514581536876787, "loss": 0.1662982851266861, "mean_token_accuracy": 0.9265069961547852, "num_tokens": 75900324.0, "step": 6153 }, { "entropy": 1.214851200580597, "epoch": 3.2406529752501316, "grad_norm": 0.29193687438964844, "learning_rate": 0.00012512419937166474, "loss": 0.18590956926345825, "mean_token_accuracy": 0.9184418022632599, "num_tokens": 75912660.0, "step": 6154 }, { "entropy": 1.206022471189499, "epoch": 3.241179568193786, "grad_norm": 0.2955065369606018, "learning_rate": 0.00012510258247672596, "loss": 0.1851632297039032, "mean_token_accuracy": 0.9227798581123352, "num_tokens": 75924996.0, "step": 6155 }, { "entropy": 1.2169673144817352, "epoch": 3.241706161137441, "grad_norm": 0.3072492778301239, "learning_rate": 0.00012508096468523498, "loss": 0.19872868061065674, "mean_token_accuracy": 0.9143420159816742, "num_tokens": 75937332.0, "step": 6156 }, { "entropy": 1.2228606343269348, "epoch": 3.2422327540810953, "grad_norm": 0.2958139479160309, "learning_rate": 0.00012505934599847497, "loss": 0.1759375035762787, "mean_token_accuracy": 0.9271186739206314, "num_tokens": 75949668.0, "step": 6157 }, { "entropy": 1.2175047397613525, "epoch": 3.2427593470247498, "grad_norm": 0.2919408679008484, "learning_rate": 0.00012503772641772934, "loss": 0.1769973337650299, "mean_token_accuracy": 0.9262620210647583, "num_tokens": 75962004.0, "step": 6158 }, { "entropy": 1.2171292901039124, "epoch": 3.2432859399684046, "grad_norm": 0.275551438331604, "learning_rate": 0.00012501610594428157, "loss": 0.1847660392522812, "mean_token_accuracy": 0.9262053966522217, "num_tokens": 75974340.0, "step": 6159 }, { "entropy": 1.234005868434906, "epoch": 3.243812532912059, "grad_norm": 0.3129563331604004, "learning_rate": 0.0001249944845794151, "loss": 0.19297876954078674, "mean_token_accuracy": 0.9163733869791031, "num_tokens": 75986676.0, "step": 6160 }, { "entropy": 1.2253689765930176, "epoch": 3.2443391258557135, "grad_norm": 0.28347060084342957, "learning_rate": 0.00012497286232441348, "loss": 0.17327147722244263, "mean_token_accuracy": 0.928035169839859, "num_tokens": 75999012.0, "step": 6161 }, { "entropy": 1.2434102296829224, "epoch": 3.244865718799368, "grad_norm": 0.2920335829257965, "learning_rate": 0.0001249512391805603, "loss": 0.2005065679550171, "mean_token_accuracy": 0.9157353788614273, "num_tokens": 76011348.0, "step": 6162 }, { "entropy": 1.302938461303711, "epoch": 3.245392311743023, "grad_norm": 0.2882930040359497, "learning_rate": 0.0001249296151491392, "loss": 0.1890123039484024, "mean_token_accuracy": 0.9203406572341919, "num_tokens": 76023684.0, "step": 6163 }, { "entropy": 1.2709252536296844, "epoch": 3.245918904686677, "grad_norm": 0.3011837899684906, "learning_rate": 0.00012490799023143385, "loss": 0.19571897387504578, "mean_token_accuracy": 0.9177806377410889, "num_tokens": 76036020.0, "step": 6164 }, { "entropy": 1.2109342217445374, "epoch": 3.2464454976303316, "grad_norm": 0.2555895149707794, "learning_rate": 0.000124886364428728, "loss": 0.16856005787849426, "mean_token_accuracy": 0.9285546839237213, "num_tokens": 76048356.0, "step": 6165 }, { "entropy": 1.2866427302360535, "epoch": 3.2469720905739865, "grad_norm": 0.31408652663230896, "learning_rate": 0.00012486473774230548, "loss": 0.20854584872722626, "mean_token_accuracy": 0.9128608703613281, "num_tokens": 76060692.0, "step": 6166 }, { "entropy": 1.2667243480682373, "epoch": 3.247498683517641, "grad_norm": 0.27591609954833984, "learning_rate": 0.0001248431101734501, "loss": 0.18142713606357574, "mean_token_accuracy": 0.922798290848732, "num_tokens": 76073028.0, "step": 6167 }, { "entropy": 1.2338934242725372, "epoch": 3.2480252764612954, "grad_norm": 0.2758982181549072, "learning_rate": 0.0001248214817234458, "loss": 0.18854719400405884, "mean_token_accuracy": 0.9161380380392075, "num_tokens": 76085364.0, "step": 6168 }, { "entropy": 1.2804130017757416, "epoch": 3.2485518694049498, "grad_norm": 0.29587045311927795, "learning_rate": 0.0001247998523935765, "loss": 0.18399131298065186, "mean_token_accuracy": 0.9224258214235306, "num_tokens": 76097700.0, "step": 6169 }, { "entropy": 1.3210213482379913, "epoch": 3.2490784623486046, "grad_norm": 0.3032381236553192, "learning_rate": 0.00012477822218512623, "loss": 0.186031311750412, "mean_token_accuracy": 0.921225294470787, "num_tokens": 76110036.0, "step": 6170 }, { "entropy": 1.2946960628032684, "epoch": 3.249605055292259, "grad_norm": 0.2837267220020294, "learning_rate": 0.00012475659109937906, "loss": 0.17635822296142578, "mean_token_accuracy": 0.9275114834308624, "num_tokens": 76122372.0, "step": 6171 }, { "entropy": 1.3051108717918396, "epoch": 3.2501316482359135, "grad_norm": 0.27409878373146057, "learning_rate": 0.00012473495913761906, "loss": 0.18140482902526855, "mean_token_accuracy": 0.922147199511528, "num_tokens": 76134708.0, "step": 6172 }, { "entropy": 1.2981198728084564, "epoch": 3.2506582411795684, "grad_norm": 0.27573296427726746, "learning_rate": 0.0001247133263011304, "loss": 0.173725426197052, "mean_token_accuracy": 0.9266543388366699, "num_tokens": 76147044.0, "step": 6173 }, { "entropy": 1.3327777683734894, "epoch": 3.251184834123223, "grad_norm": 0.29280543327331543, "learning_rate": 0.00012469169259119735, "loss": 0.17917679250240326, "mean_token_accuracy": 0.9230498522520065, "num_tokens": 76159380.0, "step": 6174 }, { "entropy": 1.273023247718811, "epoch": 3.251711427066877, "grad_norm": 0.2697977125644684, "learning_rate": 0.00012467005800910412, "loss": 0.17984896898269653, "mean_token_accuracy": 0.9266160875558853, "num_tokens": 76171716.0, "step": 6175 }, { "entropy": 1.3279211521148682, "epoch": 3.252238020010532, "grad_norm": 0.30282941460609436, "learning_rate": 0.0001246484225561351, "loss": 0.18830984830856323, "mean_token_accuracy": 0.9210638850927353, "num_tokens": 76184052.0, "step": 6176 }, { "entropy": 1.3487639725208282, "epoch": 3.2527646129541865, "grad_norm": 0.31188657879829407, "learning_rate": 0.00012462678623357455, "loss": 0.20160964131355286, "mean_token_accuracy": 0.9153773486614227, "num_tokens": 76196388.0, "step": 6177 }, { "entropy": 1.3300007581710815, "epoch": 3.253291205897841, "grad_norm": 0.2827070951461792, "learning_rate": 0.00012460514904270696, "loss": 0.19206058979034424, "mean_token_accuracy": 0.920170783996582, "num_tokens": 76208724.0, "step": 6178 }, { "entropy": 1.3335220217704773, "epoch": 3.2538177988414954, "grad_norm": 0.3128904104232788, "learning_rate": 0.0001245835109848168, "loss": 0.19153635203838348, "mean_token_accuracy": 0.919683575630188, "num_tokens": 76221060.0, "step": 6179 }, { "entropy": 1.329508662223816, "epoch": 3.2543443917851502, "grad_norm": 0.294729620218277, "learning_rate": 0.0001245618720611886, "loss": 0.17604173719882965, "mean_token_accuracy": 0.9236066043376923, "num_tokens": 76233396.0, "step": 6180 }, { "entropy": 1.3312866687774658, "epoch": 3.2548709847288047, "grad_norm": 0.3070805072784424, "learning_rate": 0.00012454023227310694, "loss": 0.19934087991714478, "mean_token_accuracy": 0.9166095405817032, "num_tokens": 76245732.0, "step": 6181 }, { "entropy": 1.2477159202098846, "epoch": 3.255397577672459, "grad_norm": 0.2840286195278168, "learning_rate": 0.00012451859162185643, "loss": 0.18146276473999023, "mean_token_accuracy": 0.9268984943628311, "num_tokens": 76258068.0, "step": 6182 }, { "entropy": 1.2960457801818848, "epoch": 3.2559241706161135, "grad_norm": 0.29388269782066345, "learning_rate": 0.00012449695010872177, "loss": 0.18993444740772247, "mean_token_accuracy": 0.9193546026945114, "num_tokens": 76270404.0, "step": 6183 }, { "entropy": 1.259146362543106, "epoch": 3.2564507635597684, "grad_norm": 0.26432740688323975, "learning_rate": 0.00012447530773498764, "loss": 0.17386454343795776, "mean_token_accuracy": 0.9284330308437347, "num_tokens": 76282740.0, "step": 6184 }, { "entropy": 1.2615996301174164, "epoch": 3.256977356503423, "grad_norm": 0.29614487290382385, "learning_rate": 0.00012445366450193886, "loss": 0.16952276229858398, "mean_token_accuracy": 0.9308066666126251, "num_tokens": 76295076.0, "step": 6185 }, { "entropy": 1.3251206576824188, "epoch": 3.257503949447077, "grad_norm": 0.3130854666233063, "learning_rate": 0.0001244320204108603, "loss": 0.1777714341878891, "mean_token_accuracy": 0.9288688153028488, "num_tokens": 76307412.0, "step": 6186 }, { "entropy": 1.2637268602848053, "epoch": 3.258030542390732, "grad_norm": 0.298968106508255, "learning_rate": 0.00012441037546303676, "loss": 0.1983793079853058, "mean_token_accuracy": 0.9180431962013245, "num_tokens": 76319748.0, "step": 6187 }, { "entropy": 1.2078056633472443, "epoch": 3.2585571353343865, "grad_norm": 0.2688981294631958, "learning_rate": 0.00012438872965975326, "loss": 0.17481450736522675, "mean_token_accuracy": 0.9246529191732407, "num_tokens": 76332084.0, "step": 6188 }, { "entropy": 1.2519322335720062, "epoch": 3.259083728278041, "grad_norm": 0.29199621081352234, "learning_rate": 0.00012436708300229472, "loss": 0.1926528662443161, "mean_token_accuracy": 0.9195021241903305, "num_tokens": 76344420.0, "step": 6189 }, { "entropy": 1.2125513851642609, "epoch": 3.259610321221696, "grad_norm": 0.2778526544570923, "learning_rate": 0.0001243454354919462, "loss": 0.16762031614780426, "mean_token_accuracy": 0.9271342903375626, "num_tokens": 76356756.0, "step": 6190 }, { "entropy": 1.2814996242523193, "epoch": 3.2601369141653502, "grad_norm": 0.30158013105392456, "learning_rate": 0.0001243237871299928, "loss": 0.16893842816352844, "mean_token_accuracy": 0.9282845556735992, "num_tokens": 76369092.0, "step": 6191 }, { "entropy": 1.2342957556247711, "epoch": 3.2606635071090047, "grad_norm": 0.28979063034057617, "learning_rate": 0.00012430213791771963, "loss": 0.17779289186000824, "mean_token_accuracy": 0.9218163043260574, "num_tokens": 76381428.0, "step": 6192 }, { "entropy": 1.2822068333625793, "epoch": 3.2611901000526595, "grad_norm": 0.327267050743103, "learning_rate": 0.0001242804878564119, "loss": 0.19853328168392181, "mean_token_accuracy": 0.9153106510639191, "num_tokens": 76393764.0, "step": 6193 }, { "entropy": 1.2986519038677216, "epoch": 3.261716692996314, "grad_norm": 0.3420284688472748, "learning_rate": 0.00012425883694735482, "loss": 0.1888749599456787, "mean_token_accuracy": 0.9159906208515167, "num_tokens": 76406100.0, "step": 6194 }, { "entropy": 1.2821783423423767, "epoch": 3.2622432859399684, "grad_norm": 0.30797383189201355, "learning_rate": 0.0001242371851918337, "loss": 0.18895478546619415, "mean_token_accuracy": 0.9191595017910004, "num_tokens": 76418436.0, "step": 6195 }, { "entropy": 1.2532289028167725, "epoch": 3.262769878883623, "grad_norm": 0.3051166832447052, "learning_rate": 0.00012421553259113393, "loss": 0.17775626480579376, "mean_token_accuracy": 0.9237864166498184, "num_tokens": 76430772.0, "step": 6196 }, { "entropy": 1.3062248826026917, "epoch": 3.2632964718272777, "grad_norm": 0.32124513387680054, "learning_rate": 0.00012419387914654076, "loss": 0.18037666380405426, "mean_token_accuracy": 0.9269574880599976, "num_tokens": 76443108.0, "step": 6197 }, { "entropy": 1.2437196373939514, "epoch": 3.263823064770932, "grad_norm": 0.2947427034378052, "learning_rate": 0.00012417222485933978, "loss": 0.18406802415847778, "mean_token_accuracy": 0.9227783232927322, "num_tokens": 76455444.0, "step": 6198 }, { "entropy": 1.2761265933513641, "epoch": 3.2643496577145865, "grad_norm": 0.2777099609375, "learning_rate": 0.00012415056973081638, "loss": 0.1712026447057724, "mean_token_accuracy": 0.9295600354671478, "num_tokens": 76467780.0, "step": 6199 }, { "entropy": 1.3158571124076843, "epoch": 3.264876250658241, "grad_norm": 0.2971872389316559, "learning_rate": 0.00012412891376225612, "loss": 0.17403270304203033, "mean_token_accuracy": 0.9262079894542694, "num_tokens": 76480116.0, "step": 6200 }, { "entropy": 1.2905315160751343, "epoch": 3.265402843601896, "grad_norm": 0.28583183884620667, "learning_rate": 0.00012410725695494464, "loss": 0.16530053317546844, "mean_token_accuracy": 0.929039940237999, "num_tokens": 76492452.0, "step": 6201 }, { "entropy": 1.252262145280838, "epoch": 3.2659294365455502, "grad_norm": 0.3061239719390869, "learning_rate": 0.00012408559931016753, "loss": 0.18879777193069458, "mean_token_accuracy": 0.9231210649013519, "num_tokens": 76504788.0, "step": 6202 }, { "entropy": 1.2744266092777252, "epoch": 3.2664560294892047, "grad_norm": 0.2914201319217682, "learning_rate": 0.00012406394082921046, "loss": 0.17487694323062897, "mean_token_accuracy": 0.9287125766277313, "num_tokens": 76517124.0, "step": 6203 }, { "entropy": 1.2931773960590363, "epoch": 3.2669826224328595, "grad_norm": 0.2819075882434845, "learning_rate": 0.0001240422815133592, "loss": 0.16330452263355255, "mean_token_accuracy": 0.9317172169685364, "num_tokens": 76529460.0, "step": 6204 }, { "entropy": 1.2473205626010895, "epoch": 3.267509215376514, "grad_norm": 0.3001861274242401, "learning_rate": 0.00012402062136389954, "loss": 0.18457162380218506, "mean_token_accuracy": 0.9188896268606186, "num_tokens": 76541796.0, "step": 6205 }, { "entropy": 1.2851862609386444, "epoch": 3.2680358083201684, "grad_norm": 0.29719528555870056, "learning_rate": 0.0001239989603821173, "loss": 0.17140623927116394, "mean_token_accuracy": 0.9282460957765579, "num_tokens": 76554132.0, "step": 6206 }, { "entropy": 1.2846690118312836, "epoch": 3.2685624012638232, "grad_norm": 0.2931407392024994, "learning_rate": 0.00012397729856929835, "loss": 0.17985954880714417, "mean_token_accuracy": 0.9300493150949478, "num_tokens": 76566468.0, "step": 6207 }, { "entropy": 1.3359651863574982, "epoch": 3.2690889942074777, "grad_norm": 0.2905985713005066, "learning_rate": 0.0001239556359267287, "loss": 0.1789180040359497, "mean_token_accuracy": 0.9208443909883499, "num_tokens": 76578804.0, "step": 6208 }, { "entropy": 1.2525035738945007, "epoch": 3.269615587151132, "grad_norm": 0.281355082988739, "learning_rate": 0.00012393397245569427, "loss": 0.18138766288757324, "mean_token_accuracy": 0.9221275150775909, "num_tokens": 76591140.0, "step": 6209 }, { "entropy": 1.3100119233131409, "epoch": 3.270142180094787, "grad_norm": 0.270400732755661, "learning_rate": 0.00012391230815748112, "loss": 0.17373928427696228, "mean_token_accuracy": 0.9232037961483002, "num_tokens": 76603476.0, "step": 6210 }, { "entropy": 1.3040125966072083, "epoch": 3.2706687730384414, "grad_norm": 0.29999953508377075, "learning_rate": 0.00012389064303337528, "loss": 0.1941448450088501, "mean_token_accuracy": 0.9185135662555695, "num_tokens": 76615812.0, "step": 6211 }, { "entropy": 1.317997932434082, "epoch": 3.271195365982096, "grad_norm": 0.28788891434669495, "learning_rate": 0.00012386897708466295, "loss": 0.18096309900283813, "mean_token_accuracy": 0.9225906133651733, "num_tokens": 76628148.0, "step": 6212 }, { "entropy": 1.3324589431285858, "epoch": 3.2717219589257502, "grad_norm": 0.308905690908432, "learning_rate": 0.00012384731031263028, "loss": 0.18385492265224457, "mean_token_accuracy": 0.9245429188013077, "num_tokens": 76640484.0, "step": 6213 }, { "entropy": 1.3233293890953064, "epoch": 3.272248551869405, "grad_norm": 0.2808932662010193, "learning_rate": 0.0001238256427185635, "loss": 0.16888180375099182, "mean_token_accuracy": 0.9283661246299744, "num_tokens": 76652820.0, "step": 6214 }, { "entropy": 1.2769432961940765, "epoch": 3.2727751448130595, "grad_norm": 0.2868754267692566, "learning_rate": 0.00012380397430374892, "loss": 0.18716515600681305, "mean_token_accuracy": 0.9205536544322968, "num_tokens": 76665156.0, "step": 6215 }, { "entropy": 1.3713759183883667, "epoch": 3.273301737756714, "grad_norm": 0.29639267921447754, "learning_rate": 0.00012378230506947285, "loss": 0.1748577207326889, "mean_token_accuracy": 0.9252920746803284, "num_tokens": 76677492.0, "step": 6216 }, { "entropy": 1.2873197197914124, "epoch": 3.2738283307003684, "grad_norm": 0.3188132345676422, "learning_rate": 0.0001237606350170216, "loss": 0.19027827680110931, "mean_token_accuracy": 0.9210074543952942, "num_tokens": 76689828.0, "step": 6217 }, { "entropy": 1.242147296667099, "epoch": 3.2743549236440233, "grad_norm": 0.2808919847011566, "learning_rate": 0.00012373896414768167, "loss": 0.15831927955150604, "mean_token_accuracy": 0.9348323941230774, "num_tokens": 76702164.0, "step": 6218 }, { "entropy": 1.3022652864456177, "epoch": 3.2748815165876777, "grad_norm": 0.2820264399051666, "learning_rate": 0.00012371729246273954, "loss": 0.18252812325954437, "mean_token_accuracy": 0.9279136508703232, "num_tokens": 76714500.0, "step": 6219 }, { "entropy": 1.258202999830246, "epoch": 3.275408109531332, "grad_norm": 0.29160061478614807, "learning_rate": 0.0001236956199634817, "loss": 0.17641672492027283, "mean_token_accuracy": 0.9247133880853653, "num_tokens": 76726836.0, "step": 6220 }, { "entropy": 1.2638160586357117, "epoch": 3.275934702474987, "grad_norm": 0.30546367168426514, "learning_rate": 0.0001236739466511947, "loss": 0.17519892752170563, "mean_token_accuracy": 0.9232414662837982, "num_tokens": 76739172.0, "step": 6221 }, { "entropy": 1.2811826467514038, "epoch": 3.2764612954186414, "grad_norm": 0.28423309326171875, "learning_rate": 0.00012365227252716522, "loss": 0.168607696890831, "mean_token_accuracy": 0.9301139712333679, "num_tokens": 76751508.0, "step": 6222 }, { "entropy": 1.3453866243362427, "epoch": 3.276987888362296, "grad_norm": 0.3236750066280365, "learning_rate": 0.00012363059759267988, "loss": 0.18853197991847992, "mean_token_accuracy": 0.9232541024684906, "num_tokens": 76763844.0, "step": 6223 }, { "entropy": 1.268451988697052, "epoch": 3.2775144813059507, "grad_norm": 0.2743200361728668, "learning_rate": 0.0001236089218490254, "loss": 0.15886418521404266, "mean_token_accuracy": 0.9334812015295029, "num_tokens": 76776180.0, "step": 6224 }, { "entropy": 1.3066802024841309, "epoch": 3.278041074249605, "grad_norm": 0.3363740146160126, "learning_rate": 0.00012358724529748857, "loss": 0.18869782984256744, "mean_token_accuracy": 0.9239563941955566, "num_tokens": 76788516.0, "step": 6225 }, { "entropy": 1.3019660413265228, "epoch": 3.2785676671932595, "grad_norm": 0.30076122283935547, "learning_rate": 0.00012356556793935615, "loss": 0.1893063187599182, "mean_token_accuracy": 0.9223721027374268, "num_tokens": 76800852.0, "step": 6226 }, { "entropy": 1.3066136240959167, "epoch": 3.2790942601369144, "grad_norm": 0.3011791706085205, "learning_rate": 0.00012354388977591505, "loss": 0.15764912962913513, "mean_token_accuracy": 0.9360844492912292, "num_tokens": 76813188.0, "step": 6227 }, { "entropy": 1.3428710401058197, "epoch": 3.279620853080569, "grad_norm": 0.30883345007896423, "learning_rate": 0.00012352221080845212, "loss": 0.18702161312103271, "mean_token_accuracy": 0.9179170429706573, "num_tokens": 76825524.0, "step": 6228 }, { "entropy": 1.2546886503696442, "epoch": 3.2801474460242233, "grad_norm": 0.31887173652648926, "learning_rate": 0.00012350053103825438, "loss": 0.18897868692874908, "mean_token_accuracy": 0.9202984124422073, "num_tokens": 76837860.0, "step": 6229 }, { "entropy": 1.2445046305656433, "epoch": 3.2806740389678777, "grad_norm": 0.27127400040626526, "learning_rate": 0.0001234788504666088, "loss": 0.17110732197761536, "mean_token_accuracy": 0.9267043769359589, "num_tokens": 76850196.0, "step": 6230 }, { "entropy": 1.2792969346046448, "epoch": 3.2812006319115326, "grad_norm": 0.29130396246910095, "learning_rate": 0.00012345716909480242, "loss": 0.1774936467409134, "mean_token_accuracy": 0.9278624057769775, "num_tokens": 76862532.0, "step": 6231 }, { "entropy": 1.284456580877304, "epoch": 3.281727224855187, "grad_norm": 0.30248746275901794, "learning_rate": 0.00012343548692412233, "loss": 0.1800181269645691, "mean_token_accuracy": 0.9215735793113708, "num_tokens": 76874868.0, "step": 6232 }, { "entropy": 1.2692930698394775, "epoch": 3.2822538177988414, "grad_norm": 0.2928861379623413, "learning_rate": 0.0001234138039558557, "loss": 0.19163967669010162, "mean_token_accuracy": 0.9179900139570236, "num_tokens": 76887204.0, "step": 6233 }, { "entropy": 1.247650921344757, "epoch": 3.282780410742496, "grad_norm": 0.31334158778190613, "learning_rate": 0.00012339212019128973, "loss": 0.19242893159389496, "mean_token_accuracy": 0.9193117916584015, "num_tokens": 76899540.0, "step": 6234 }, { "entropy": 1.2478911876678467, "epoch": 3.2833070036861507, "grad_norm": 0.3001970052719116, "learning_rate": 0.0001233704356317116, "loss": 0.17564845085144043, "mean_token_accuracy": 0.9316419661045074, "num_tokens": 76911876.0, "step": 6235 }, { "entropy": 1.3031432330608368, "epoch": 3.283833596629805, "grad_norm": 0.28892484307289124, "learning_rate": 0.0001233487502784087, "loss": 0.18837390840053558, "mean_token_accuracy": 0.9224282503128052, "num_tokens": 76924212.0, "step": 6236 }, { "entropy": 1.3214940428733826, "epoch": 3.2843601895734595, "grad_norm": 0.2903456687927246, "learning_rate": 0.00012332706413266823, "loss": 0.17962339520454407, "mean_token_accuracy": 0.9192012697458267, "num_tokens": 76936548.0, "step": 6237 }, { "entropy": 1.3401213586330414, "epoch": 3.2848867825171144, "grad_norm": 0.29672813415527344, "learning_rate": 0.00012330537719577766, "loss": 0.18679866194725037, "mean_token_accuracy": 0.9169516563415527, "num_tokens": 76948884.0, "step": 6238 }, { "entropy": 1.3582242131233215, "epoch": 3.285413375460769, "grad_norm": 0.2805413007736206, "learning_rate": 0.0001232836894690244, "loss": 0.18263594806194305, "mean_token_accuracy": 0.9259663075208664, "num_tokens": 76961220.0, "step": 6239 }, { "entropy": 1.2710779011249542, "epoch": 3.2859399684044233, "grad_norm": 0.2695918083190918, "learning_rate": 0.00012326200095369593, "loss": 0.178550124168396, "mean_token_accuracy": 0.9272159487009048, "num_tokens": 76973556.0, "step": 6240 }, { "entropy": 1.348080426454544, "epoch": 3.286466561348078, "grad_norm": 0.308569073677063, "learning_rate": 0.00012324031165107977, "loss": 0.1801525056362152, "mean_token_accuracy": 0.924568384885788, "num_tokens": 76985892.0, "step": 6241 }, { "entropy": 1.2940427362918854, "epoch": 3.2869931542917326, "grad_norm": 0.28971853852272034, "learning_rate": 0.00012321862156246342, "loss": 0.1751011162996292, "mean_token_accuracy": 0.9240054190158844, "num_tokens": 76998228.0, "step": 6242 }, { "entropy": 1.3105450570583344, "epoch": 3.287519747235387, "grad_norm": 0.2823137640953064, "learning_rate": 0.0001231969306891346, "loss": 0.18045909702777863, "mean_token_accuracy": 0.926315575838089, "num_tokens": 77010564.0, "step": 6243 }, { "entropy": 1.3067985475063324, "epoch": 3.288046340179042, "grad_norm": 0.30029135942459106, "learning_rate": 0.00012317523903238094, "loss": 0.18511660397052765, "mean_token_accuracy": 0.9207724779844284, "num_tokens": 77022900.0, "step": 6244 }, { "entropy": 1.333036631345749, "epoch": 3.2885729331226963, "grad_norm": 0.30139487981796265, "learning_rate": 0.0001231535465934901, "loss": 0.1940365582704544, "mean_token_accuracy": 0.9214530885219574, "num_tokens": 77035236.0, "step": 6245 }, { "entropy": 1.3007804155349731, "epoch": 3.2890995260663507, "grad_norm": 0.26908811926841736, "learning_rate": 0.00012313185337374985, "loss": 0.17049038410186768, "mean_token_accuracy": 0.9276867210865021, "num_tokens": 77047572.0, "step": 6246 }, { "entropy": 1.3777782022953033, "epoch": 3.289626119010005, "grad_norm": 0.31890666484832764, "learning_rate": 0.000123110159374448, "loss": 0.19547241926193237, "mean_token_accuracy": 0.9192814230918884, "num_tokens": 77059908.0, "step": 6247 }, { "entropy": 1.3698776066303253, "epoch": 3.29015271195366, "grad_norm": 0.30019745230674744, "learning_rate": 0.00012308846459687243, "loss": 0.17105017602443695, "mean_token_accuracy": 0.9322203248739243, "num_tokens": 77072244.0, "step": 6248 }, { "entropy": 1.2837482690811157, "epoch": 3.2906793048973144, "grad_norm": 0.28274422883987427, "learning_rate": 0.000123066769042311, "loss": 0.17917296290397644, "mean_token_accuracy": 0.9279322028160095, "num_tokens": 77084580.0, "step": 6249 }, { "entropy": 1.348880112171173, "epoch": 3.291205897840969, "grad_norm": 0.3124294877052307, "learning_rate": 0.00012304507271205167, "loss": 0.18216298520565033, "mean_token_accuracy": 0.9279361516237259, "num_tokens": 77096916.0, "step": 6250 }, { "entropy": 1.328457921743393, "epoch": 3.2917324907846233, "grad_norm": 0.29864731431007385, "learning_rate": 0.00012302337560738235, "loss": 0.19336733222007751, "mean_token_accuracy": 0.9219559580087662, "num_tokens": 77109252.0, "step": 6251 }, { "entropy": 1.308976262807846, "epoch": 3.292259083728278, "grad_norm": 0.3369043469429016, "learning_rate": 0.00012300167772959114, "loss": 0.20705236494541168, "mean_token_accuracy": 0.9159487783908844, "num_tokens": 77121588.0, "step": 6252 }, { "entropy": 1.3961984515190125, "epoch": 3.2927856766719326, "grad_norm": 0.2894037067890167, "learning_rate": 0.0001229799790799661, "loss": 0.1619293987751007, "mean_token_accuracy": 0.9350053817033768, "num_tokens": 77133924.0, "step": 6253 }, { "entropy": 1.3159714043140411, "epoch": 3.293312269615587, "grad_norm": 0.26713791489601135, "learning_rate": 0.0001229582796597954, "loss": 0.1694222390651703, "mean_token_accuracy": 0.9325111657381058, "num_tokens": 77146260.0, "step": 6254 }, { "entropy": 1.3922246992588043, "epoch": 3.293838862559242, "grad_norm": 0.2928251326084137, "learning_rate": 0.00012293657947036715, "loss": 0.17767813801765442, "mean_token_accuracy": 0.9284683912992477, "num_tokens": 77158596.0, "step": 6255 }, { "entropy": 1.3610136806964874, "epoch": 3.2943654555028963, "grad_norm": 0.277475506067276, "learning_rate": 0.00012291487851296955, "loss": 0.17403161525726318, "mean_token_accuracy": 0.9285924583673477, "num_tokens": 77170932.0, "step": 6256 }, { "entropy": 1.3568114638328552, "epoch": 3.2948920484465507, "grad_norm": 0.31263595819473267, "learning_rate": 0.0001228931767888909, "loss": 0.1871493011713028, "mean_token_accuracy": 0.925555557012558, "num_tokens": 77183268.0, "step": 6257 }, { "entropy": 1.3260321021080017, "epoch": 3.2954186413902056, "grad_norm": 0.2852775752544403, "learning_rate": 0.0001228714742994195, "loss": 0.16670246422290802, "mean_token_accuracy": 0.9286938607692719, "num_tokens": 77195604.0, "step": 6258 }, { "entropy": 1.3797948062419891, "epoch": 3.29594523433386, "grad_norm": 0.30797091126441956, "learning_rate": 0.00012284977104584367, "loss": 0.1951187551021576, "mean_token_accuracy": 0.9217554777860641, "num_tokens": 77207940.0, "step": 6259 }, { "entropy": 1.3536570966243744, "epoch": 3.2964718272775144, "grad_norm": 0.2918627858161926, "learning_rate": 0.00012282806702945185, "loss": 0.18449142575263977, "mean_token_accuracy": 0.9261642545461655, "num_tokens": 77220276.0, "step": 6260 }, { "entropy": 1.3510786592960358, "epoch": 3.296998420221169, "grad_norm": 0.2922392785549164, "learning_rate": 0.00012280636225153244, "loss": 0.1884160339832306, "mean_token_accuracy": 0.9224065691232681, "num_tokens": 77232612.0, "step": 6261 }, { "entropy": 1.3692474663257599, "epoch": 3.2975250131648237, "grad_norm": 0.3316969871520996, "learning_rate": 0.00012278465671337394, "loss": 0.20385709404945374, "mean_token_accuracy": 0.9145285934209824, "num_tokens": 77244948.0, "step": 6262 }, { "entropy": 1.3025420308113098, "epoch": 3.298051606108478, "grad_norm": 0.2928790748119354, "learning_rate": 0.00012276295041626492, "loss": 0.17966334521770477, "mean_token_accuracy": 0.9247696399688721, "num_tokens": 77257284.0, "step": 6263 }, { "entropy": 1.331528127193451, "epoch": 3.2985781990521326, "grad_norm": 0.2715156674385071, "learning_rate": 0.00012274124336149388, "loss": 0.15209448337554932, "mean_token_accuracy": 0.9380554258823395, "num_tokens": 77269620.0, "step": 6264 }, { "entropy": 1.2930799722671509, "epoch": 3.2991047919957874, "grad_norm": 0.3041073679924011, "learning_rate": 0.00012271953555034948, "loss": 0.16017360985279083, "mean_token_accuracy": 0.9354993849992752, "num_tokens": 77281956.0, "step": 6265 }, { "entropy": 1.288301259279251, "epoch": 3.299631384939442, "grad_norm": 0.34979477524757385, "learning_rate": 0.00012269782698412043, "loss": 0.18351054191589355, "mean_token_accuracy": 0.9256859570741653, "num_tokens": 77294292.0, "step": 6266 }, { "entropy": 1.2581088542938232, "epoch": 3.3001579778830963, "grad_norm": 0.29193171858787537, "learning_rate": 0.0001226761176640954, "loss": 0.18515905737876892, "mean_token_accuracy": 0.920244887471199, "num_tokens": 77306628.0, "step": 6267 }, { "entropy": 1.334260106086731, "epoch": 3.3006845708267507, "grad_norm": 0.31209471821784973, "learning_rate": 0.0001226544075915631, "loss": 0.1918957531452179, "mean_token_accuracy": 0.9205730259418488, "num_tokens": 77318964.0, "step": 6268 }, { "entropy": 1.2262840270996094, "epoch": 3.3012111637704056, "grad_norm": 0.2917366921901703, "learning_rate": 0.00012263269676781243, "loss": 0.1814029961824417, "mean_token_accuracy": 0.9222237467765808, "num_tokens": 77331300.0, "step": 6269 }, { "entropy": 1.291917860507965, "epoch": 3.30173775671406, "grad_norm": 0.3144878149032593, "learning_rate": 0.00012261098519413213, "loss": 0.182567298412323, "mean_token_accuracy": 0.9216288179159164, "num_tokens": 77343636.0, "step": 6270 }, { "entropy": 1.2892558574676514, "epoch": 3.3022643496577144, "grad_norm": 0.3424370586872101, "learning_rate": 0.00012258927287181118, "loss": 0.17693836987018585, "mean_token_accuracy": 0.9250752925872803, "num_tokens": 77355972.0, "step": 6271 }, { "entropy": 1.2943249344825745, "epoch": 3.3027909426013693, "grad_norm": 0.30987316370010376, "learning_rate": 0.00012256755980213845, "loss": 0.17040230333805084, "mean_token_accuracy": 0.9257796704769135, "num_tokens": 77368308.0, "step": 6272 }, { "entropy": 1.248966097831726, "epoch": 3.3033175355450237, "grad_norm": 0.3050011396408081, "learning_rate": 0.00012254584598640297, "loss": 0.1835927516222, "mean_token_accuracy": 0.9233296066522598, "num_tokens": 77380644.0, "step": 6273 }, { "entropy": 1.2827671766281128, "epoch": 3.303844128488678, "grad_norm": 0.3306349217891693, "learning_rate": 0.0001225241314258937, "loss": 0.17201808094978333, "mean_token_accuracy": 0.9289962649345398, "num_tokens": 77392980.0, "step": 6274 }, { "entropy": 1.2073831260204315, "epoch": 3.304370721432333, "grad_norm": 0.2555938959121704, "learning_rate": 0.0001225024161218998, "loss": 0.1644388884305954, "mean_token_accuracy": 0.9306099265813828, "num_tokens": 77405316.0, "step": 6275 }, { "entropy": 1.1848298013210297, "epoch": 3.3048973143759874, "grad_norm": 0.2741433084011078, "learning_rate": 0.00012248070007571027, "loss": 0.1641799509525299, "mean_token_accuracy": 0.9321964681148529, "num_tokens": 77417652.0, "step": 6276 }, { "entropy": 1.2541768550872803, "epoch": 3.305423907319642, "grad_norm": 0.33179324865341187, "learning_rate": 0.00012245898328861436, "loss": 0.20032846927642822, "mean_token_accuracy": 0.9160593599081039, "num_tokens": 77429988.0, "step": 6277 }, { "entropy": 1.2670972049236298, "epoch": 3.3059505002632963, "grad_norm": 0.32215121388435364, "learning_rate": 0.0001224372657619012, "loss": 0.18955227732658386, "mean_token_accuracy": 0.9195306450128555, "num_tokens": 77442324.0, "step": 6278 }, { "entropy": 1.243691623210907, "epoch": 3.306477093206951, "grad_norm": 0.26894742250442505, "learning_rate": 0.00012241554749686006, "loss": 0.17201484739780426, "mean_token_accuracy": 0.9331451952457428, "num_tokens": 77454660.0, "step": 6279 }, { "entropy": 1.2710082828998566, "epoch": 3.3070036861506056, "grad_norm": 0.277451753616333, "learning_rate": 0.00012239382849478026, "loss": 0.16356228291988373, "mean_token_accuracy": 0.9296573549509048, "num_tokens": 77466996.0, "step": 6280 }, { "entropy": 1.2021631002426147, "epoch": 3.30753027909426, "grad_norm": 0.28685319423675537, "learning_rate": 0.00012237210875695108, "loss": 0.175466850399971, "mean_token_accuracy": 0.9210334420204163, "num_tokens": 77479332.0, "step": 6281 }, { "entropy": 1.2092857658863068, "epoch": 3.308056872037915, "grad_norm": 0.31844884157180786, "learning_rate": 0.0001223503882846619, "loss": 0.18344981968402863, "mean_token_accuracy": 0.9227282404899597, "num_tokens": 77491668.0, "step": 6282 }, { "entropy": 1.189133197069168, "epoch": 3.3085834649815693, "grad_norm": 0.2735708951950073, "learning_rate": 0.00012232866707920215, "loss": 0.16277778148651123, "mean_token_accuracy": 0.9327268749475479, "num_tokens": 77504004.0, "step": 6283 }, { "entropy": 1.2456674873828888, "epoch": 3.3091100579252237, "grad_norm": 0.31346774101257324, "learning_rate": 0.00012230694514186134, "loss": 0.18626126646995544, "mean_token_accuracy": 0.9211814552545547, "num_tokens": 77516340.0, "step": 6284 }, { "entropy": 1.2482060492038727, "epoch": 3.309636650868878, "grad_norm": 0.30682602524757385, "learning_rate": 0.00012228522247392887, "loss": 0.17980405688285828, "mean_token_accuracy": 0.9244150966405869, "num_tokens": 77528676.0, "step": 6285 }, { "entropy": 1.1912206411361694, "epoch": 3.310163243812533, "grad_norm": 0.25870731472969055, "learning_rate": 0.0001222634990766944, "loss": 0.16307370364665985, "mean_token_accuracy": 0.9303781092166901, "num_tokens": 77541012.0, "step": 6286 }, { "entropy": 1.1591845452785492, "epoch": 3.3106898367561874, "grad_norm": 0.27272090315818787, "learning_rate": 0.0001222417749514474, "loss": 0.17256568372249603, "mean_token_accuracy": 0.9279441237449646, "num_tokens": 77553348.0, "step": 6287 }, { "entropy": 1.2483986914157867, "epoch": 3.311216429699842, "grad_norm": 0.2890327572822571, "learning_rate": 0.0001222200500994776, "loss": 0.16983464360237122, "mean_token_accuracy": 0.9310442209243774, "num_tokens": 77565684.0, "step": 6288 }, { "entropy": 1.206378698348999, "epoch": 3.3117430226434967, "grad_norm": 0.2675359547138214, "learning_rate": 0.00012219832452207467, "loss": 0.1648457944393158, "mean_token_accuracy": 0.926652655005455, "num_tokens": 77578020.0, "step": 6289 }, { "entropy": 1.2289733290672302, "epoch": 3.312269615587151, "grad_norm": 0.30007657408714294, "learning_rate": 0.00012217659822052828, "loss": 0.16314581036567688, "mean_token_accuracy": 0.9349983930587769, "num_tokens": 77590356.0, "step": 6290 }, { "entropy": 1.2137439548969269, "epoch": 3.3127962085308056, "grad_norm": 0.2984062731266022, "learning_rate": 0.00012215487119612826, "loss": 0.18604514002799988, "mean_token_accuracy": 0.9209646135568619, "num_tokens": 77602692.0, "step": 6291 }, { "entropy": 1.1965177357196808, "epoch": 3.3133228014744605, "grad_norm": 0.2772281765937805, "learning_rate": 0.00012213314345016434, "loss": 0.16918744146823883, "mean_token_accuracy": 0.9283002465963364, "num_tokens": 77615028.0, "step": 6292 }, { "entropy": 1.2328120470046997, "epoch": 3.313849394418115, "grad_norm": 0.29671624302864075, "learning_rate": 0.00012211141498392645, "loss": 0.17436084151268005, "mean_token_accuracy": 0.926695927977562, "num_tokens": 77627364.0, "step": 6293 }, { "entropy": 1.2302624881267548, "epoch": 3.3143759873617693, "grad_norm": 0.2875054180622101, "learning_rate": 0.00012208968579870442, "loss": 0.18385103344917297, "mean_token_accuracy": 0.9278070479631424, "num_tokens": 77639700.0, "step": 6294 }, { "entropy": 1.2216106355190277, "epoch": 3.3149025803054237, "grad_norm": 0.27963787317276, "learning_rate": 0.0001220679558957882, "loss": 0.16584040224552155, "mean_token_accuracy": 0.9339368790388107, "num_tokens": 77652036.0, "step": 6295 }, { "entropy": 1.214008629322052, "epoch": 3.3154291732490786, "grad_norm": 0.3183528780937195, "learning_rate": 0.00012204622527646781, "loss": 0.20121121406555176, "mean_token_accuracy": 0.9120351374149323, "num_tokens": 77664372.0, "step": 6296 }, { "entropy": 1.1923558712005615, "epoch": 3.315955766192733, "grad_norm": 0.30246466398239136, "learning_rate": 0.00012202449394203319, "loss": 0.17298796772956848, "mean_token_accuracy": 0.9281925112009048, "num_tokens": 77676708.0, "step": 6297 }, { "entropy": 1.1890799403190613, "epoch": 3.3164823591363874, "grad_norm": 0.29945051670074463, "learning_rate": 0.00012200276189377449, "loss": 0.16734355688095093, "mean_token_accuracy": 0.9296771138906479, "num_tokens": 77689044.0, "step": 6298 }, { "entropy": 1.155686229467392, "epoch": 3.3170089520800423, "grad_norm": 0.28938549757003784, "learning_rate": 0.00012198102913298178, "loss": 0.17813976109027863, "mean_token_accuracy": 0.9260826110839844, "num_tokens": 77701380.0, "step": 6299 }, { "entropy": 1.2165965139865875, "epoch": 3.3175355450236967, "grad_norm": 0.31674203276634216, "learning_rate": 0.00012195929566094515, "loss": 0.18068945407867432, "mean_token_accuracy": 0.9256344437599182, "num_tokens": 77713716.0, "step": 6300 }, { "entropy": 1.2314816415309906, "epoch": 3.318062137967351, "grad_norm": 0.30882787704467773, "learning_rate": 0.00012193756147895488, "loss": 0.18806438148021698, "mean_token_accuracy": 0.9189537465572357, "num_tokens": 77726052.0, "step": 6301 }, { "entropy": 1.1795615553855896, "epoch": 3.3185887309110056, "grad_norm": 0.28717485070228577, "learning_rate": 0.00012191582658830114, "loss": 0.1791655421257019, "mean_token_accuracy": 0.9259586930274963, "num_tokens": 77738388.0, "step": 6302 }, { "entropy": 1.2114834785461426, "epoch": 3.3191153238546605, "grad_norm": 0.3069087266921997, "learning_rate": 0.00012189409099027427, "loss": 0.1844533383846283, "mean_token_accuracy": 0.9256695508956909, "num_tokens": 77750724.0, "step": 6303 }, { "entropy": 1.189144790172577, "epoch": 3.319641916798315, "grad_norm": 0.2855905294418335, "learning_rate": 0.00012187235468616449, "loss": 0.17765678465366364, "mean_token_accuracy": 0.9295614361763, "num_tokens": 77763060.0, "step": 6304 }, { "entropy": 1.2269161939620972, "epoch": 3.3201685097419693, "grad_norm": 0.31023627519607544, "learning_rate": 0.00012185061767726225, "loss": 0.19039218127727509, "mean_token_accuracy": 0.9216252714395523, "num_tokens": 77775396.0, "step": 6305 }, { "entropy": 1.2304878532886505, "epoch": 3.320695102685624, "grad_norm": 0.2721764147281647, "learning_rate": 0.00012182887996485786, "loss": 0.17890873551368713, "mean_token_accuracy": 0.926185354590416, "num_tokens": 77787732.0, "step": 6306 }, { "entropy": 1.198279082775116, "epoch": 3.3212216956292786, "grad_norm": 0.3037056028842926, "learning_rate": 0.00012180714155024185, "loss": 0.19335156679153442, "mean_token_accuracy": 0.9204846918582916, "num_tokens": 77800068.0, "step": 6307 }, { "entropy": 1.198100596666336, "epoch": 3.321748288572933, "grad_norm": 0.28984254598617554, "learning_rate": 0.00012178540243470466, "loss": 0.18056681752204895, "mean_token_accuracy": 0.9277454763650894, "num_tokens": 77812404.0, "step": 6308 }, { "entropy": 1.2626543045043945, "epoch": 3.322274881516588, "grad_norm": 0.28939563035964966, "learning_rate": 0.00012176366261953677, "loss": 0.18535594642162323, "mean_token_accuracy": 0.917705699801445, "num_tokens": 77824740.0, "step": 6309 }, { "entropy": 1.1280077993869781, "epoch": 3.3228014744602423, "grad_norm": 0.2761329710483551, "learning_rate": 0.00012174192210602886, "loss": 0.16896678507328033, "mean_token_accuracy": 0.9300144165754318, "num_tokens": 77837076.0, "step": 6310 }, { "entropy": 1.1924511790275574, "epoch": 3.3233280674038967, "grad_norm": 0.2868991196155548, "learning_rate": 0.00012172018089547146, "loss": 0.1733475625514984, "mean_token_accuracy": 0.9288337081670761, "num_tokens": 77849412.0, "step": 6311 }, { "entropy": 1.2250944375991821, "epoch": 3.323854660347551, "grad_norm": 0.28686419129371643, "learning_rate": 0.00012169843898915521, "loss": 0.17834466695785522, "mean_token_accuracy": 0.9234661906957626, "num_tokens": 77861748.0, "step": 6312 }, { "entropy": 1.18630051612854, "epoch": 3.324381253291206, "grad_norm": 0.27554911375045776, "learning_rate": 0.00012167669638837083, "loss": 0.17016924917697906, "mean_token_accuracy": 0.9278373867273331, "num_tokens": 77874084.0, "step": 6313 }, { "entropy": 1.194406509399414, "epoch": 3.3249078462348605, "grad_norm": 0.2967835068702698, "learning_rate": 0.00012165495309440904, "loss": 0.1776619851589203, "mean_token_accuracy": 0.9240773171186447, "num_tokens": 77886420.0, "step": 6314 }, { "entropy": 1.1789636015892029, "epoch": 3.325434439178515, "grad_norm": 0.29467225074768066, "learning_rate": 0.00012163320910856062, "loss": 0.18165810406208038, "mean_token_accuracy": 0.9236823320388794, "num_tokens": 77898756.0, "step": 6315 }, { "entropy": 1.235141545534134, "epoch": 3.3259610321221693, "grad_norm": 0.288943350315094, "learning_rate": 0.00012161146443211635, "loss": 0.18570385873317719, "mean_token_accuracy": 0.9260200262069702, "num_tokens": 77911092.0, "step": 6316 }, { "entropy": 1.207500845193863, "epoch": 3.326487625065824, "grad_norm": 0.3039279282093048, "learning_rate": 0.00012158971906636716, "loss": 0.18949507176876068, "mean_token_accuracy": 0.9216862767934799, "num_tokens": 77923428.0, "step": 6317 }, { "entropy": 1.157785713672638, "epoch": 3.3270142180094786, "grad_norm": 0.28206175565719604, "learning_rate": 0.0001215679730126039, "loss": 0.16813766956329346, "mean_token_accuracy": 0.9271836131811142, "num_tokens": 77935764.0, "step": 6318 }, { "entropy": 1.1457824409008026, "epoch": 3.327540810953133, "grad_norm": 0.2728706896305084, "learning_rate": 0.00012154622627211748, "loss": 0.18301129341125488, "mean_token_accuracy": 0.9233203828334808, "num_tokens": 77948100.0, "step": 6319 }, { "entropy": 1.1551872491836548, "epoch": 3.328067403896788, "grad_norm": 0.30633148550987244, "learning_rate": 0.00012152447884619887, "loss": 0.1762765645980835, "mean_token_accuracy": 0.9293456971645355, "num_tokens": 77960436.0, "step": 6320 }, { "entropy": 1.1439066231250763, "epoch": 3.3285939968404423, "grad_norm": 0.30425259470939636, "learning_rate": 0.00012150273073613916, "loss": 0.17624837160110474, "mean_token_accuracy": 0.9292152673006058, "num_tokens": 77972772.0, "step": 6321 }, { "entropy": 1.1565793454647064, "epoch": 3.3291205897840968, "grad_norm": 0.28278112411499023, "learning_rate": 0.00012148098194322936, "loss": 0.17056959867477417, "mean_token_accuracy": 0.9300214350223541, "num_tokens": 77985108.0, "step": 6322 }, { "entropy": 1.1920295357704163, "epoch": 3.3296471827277516, "grad_norm": 0.32281213998794556, "learning_rate": 0.00012145923246876058, "loss": 0.18377986550331116, "mean_token_accuracy": 0.9265360087156296, "num_tokens": 77997444.0, "step": 6323 }, { "entropy": 1.1695996820926666, "epoch": 3.330173775671406, "grad_norm": 0.32021892070770264, "learning_rate": 0.00012143748231402396, "loss": 0.19081415235996246, "mean_token_accuracy": 0.9188333600759506, "num_tokens": 78009780.0, "step": 6324 }, { "entropy": 1.2148053050041199, "epoch": 3.3307003686150605, "grad_norm": 0.3022609353065491, "learning_rate": 0.00012141573148031069, "loss": 0.1708085983991623, "mean_token_accuracy": 0.9268668293952942, "num_tokens": 78022116.0, "step": 6325 }, { "entropy": 1.2103819847106934, "epoch": 3.3312269615587153, "grad_norm": 0.3088929057121277, "learning_rate": 0.00012139397996891195, "loss": 0.17563574016094208, "mean_token_accuracy": 0.9249402433633804, "num_tokens": 78034452.0, "step": 6326 }, { "entropy": 1.2167181074619293, "epoch": 3.3317535545023698, "grad_norm": 0.3257026672363281, "learning_rate": 0.00012137222778111907, "loss": 0.18812602758407593, "mean_token_accuracy": 0.9249632805585861, "num_tokens": 78046788.0, "step": 6327 }, { "entropy": 1.19572913646698, "epoch": 3.332280147446024, "grad_norm": 0.3196490705013275, "learning_rate": 0.00012135047491822329, "loss": 0.1719440370798111, "mean_token_accuracy": 0.9299701750278473, "num_tokens": 78059124.0, "step": 6328 }, { "entropy": 1.186407446861267, "epoch": 3.3328067403896786, "grad_norm": 0.27008503675460815, "learning_rate": 0.00012132872138151597, "loss": 0.1582118272781372, "mean_token_accuracy": 0.9298784285783768, "num_tokens": 78071460.0, "step": 6329 }, { "entropy": 1.2195619642734528, "epoch": 3.3333333333333335, "grad_norm": 0.2909710109233856, "learning_rate": 0.00012130696717228845, "loss": 0.1674053966999054, "mean_token_accuracy": 0.9280695915222168, "num_tokens": 78083796.0, "step": 6330 }, { "entropy": 1.2100169360637665, "epoch": 3.333859926276988, "grad_norm": 0.2931506335735321, "learning_rate": 0.00012128521229183223, "loss": 0.18500615656375885, "mean_token_accuracy": 0.9271363615989685, "num_tokens": 78096132.0, "step": 6331 }, { "entropy": 1.2285574674606323, "epoch": 3.3343865192206423, "grad_norm": 0.2904454469680786, "learning_rate": 0.00012126345674143873, "loss": 0.17087505757808685, "mean_token_accuracy": 0.9284899085760117, "num_tokens": 78108468.0, "step": 6332 }, { "entropy": 1.2296108901500702, "epoch": 3.3349131121642968, "grad_norm": 0.27629929780960083, "learning_rate": 0.00012124170052239947, "loss": 0.16646593809127808, "mean_token_accuracy": 0.928304061293602, "num_tokens": 78120804.0, "step": 6333 }, { "entropy": 1.2326724231243134, "epoch": 3.3354397051079516, "grad_norm": 0.2919878363609314, "learning_rate": 0.00012121994363600593, "loss": 0.16050314903259277, "mean_token_accuracy": 0.9345861971378326, "num_tokens": 78133140.0, "step": 6334 }, { "entropy": 1.2286337912082672, "epoch": 3.335966298051606, "grad_norm": 0.3131559491157532, "learning_rate": 0.00012119818608354976, "loss": 0.1890125274658203, "mean_token_accuracy": 0.9257236868143082, "num_tokens": 78145476.0, "step": 6335 }, { "entropy": 1.224203109741211, "epoch": 3.3364928909952605, "grad_norm": 0.30545997619628906, "learning_rate": 0.00012117642786632252, "loss": 0.1883762627840042, "mean_token_accuracy": 0.9211859107017517, "num_tokens": 78157812.0, "step": 6336 }, { "entropy": 1.2018961906433105, "epoch": 3.3370194839389153, "grad_norm": 0.28659677505493164, "learning_rate": 0.00012115466898561594, "loss": 0.16844090819358826, "mean_token_accuracy": 0.9275706559419632, "num_tokens": 78170148.0, "step": 6337 }, { "entropy": 1.2401127219200134, "epoch": 3.3375460768825698, "grad_norm": 0.2736494243144989, "learning_rate": 0.00012113290944272164, "loss": 0.17726998031139374, "mean_token_accuracy": 0.9241432696580887, "num_tokens": 78182484.0, "step": 6338 }, { "entropy": 1.3018797636032104, "epoch": 3.338072669826224, "grad_norm": 0.3217552900314331, "learning_rate": 0.00012111114923893143, "loss": 0.17722119390964508, "mean_token_accuracy": 0.9320580661296844, "num_tokens": 78194820.0, "step": 6339 }, { "entropy": 1.2583179473876953, "epoch": 3.338599262769879, "grad_norm": 0.303801953792572, "learning_rate": 0.00012108938837553703, "loss": 0.19931627810001373, "mean_token_accuracy": 0.9146895110607147, "num_tokens": 78207156.0, "step": 6340 }, { "entropy": 1.2409113943576813, "epoch": 3.3391258557135335, "grad_norm": 0.28290995955467224, "learning_rate": 0.00012106762685383023, "loss": 0.1745530366897583, "mean_token_accuracy": 0.9276322573423386, "num_tokens": 78219492.0, "step": 6341 }, { "entropy": 1.285282850265503, "epoch": 3.339652448657188, "grad_norm": 0.3015868663787842, "learning_rate": 0.00012104586467510302, "loss": 0.18549884855747223, "mean_token_accuracy": 0.9204204976558685, "num_tokens": 78231828.0, "step": 6342 }, { "entropy": 1.2624708712100983, "epoch": 3.340179041600843, "grad_norm": 0.2822583317756653, "learning_rate": 0.00012102410184064716, "loss": 0.1973864734172821, "mean_token_accuracy": 0.9140585213899612, "num_tokens": 78244164.0, "step": 6343 }, { "entropy": 1.262296050786972, "epoch": 3.340705634544497, "grad_norm": 0.26198214292526245, "learning_rate": 0.0001210023383517546, "loss": 0.16668781638145447, "mean_token_accuracy": 0.9317191243171692, "num_tokens": 78256500.0, "step": 6344 }, { "entropy": 1.2780193090438843, "epoch": 3.3412322274881516, "grad_norm": 0.27448320388793945, "learning_rate": 0.00012098057420971738, "loss": 0.1586671769618988, "mean_token_accuracy": 0.9334205389022827, "num_tokens": 78268836.0, "step": 6345 }, { "entropy": 1.234157383441925, "epoch": 3.341758820431806, "grad_norm": 0.3024885654449463, "learning_rate": 0.00012095880941582744, "loss": 0.20172396302223206, "mean_token_accuracy": 0.916020467877388, "num_tokens": 78281172.0, "step": 6346 }, { "entropy": 1.1784034371376038, "epoch": 3.342285413375461, "grad_norm": 0.265259712934494, "learning_rate": 0.00012093704397137691, "loss": 0.17870020866394043, "mean_token_accuracy": 0.927327424287796, "num_tokens": 78293508.0, "step": 6347 }, { "entropy": 1.2499751150608063, "epoch": 3.3428120063191153, "grad_norm": 0.2962338328361511, "learning_rate": 0.00012091527787765778, "loss": 0.1875610649585724, "mean_token_accuracy": 0.925552487373352, "num_tokens": 78305844.0, "step": 6348 }, { "entropy": 1.24460768699646, "epoch": 3.3433385992627698, "grad_norm": 0.28698840737342834, "learning_rate": 0.0001208935111359622, "loss": 0.18320082128047943, "mean_token_accuracy": 0.9247717559337616, "num_tokens": 78318180.0, "step": 6349 }, { "entropy": 1.1530158817768097, "epoch": 3.343865192206424, "grad_norm": 0.2892373502254486, "learning_rate": 0.00012087174374758242, "loss": 0.18444812297821045, "mean_token_accuracy": 0.9245470464229584, "num_tokens": 78330516.0, "step": 6350 }, { "entropy": 1.1886387765407562, "epoch": 3.344391785150079, "grad_norm": 0.2701685130596161, "learning_rate": 0.00012084997571381054, "loss": 0.1672668755054474, "mean_token_accuracy": 0.9284243434667587, "num_tokens": 78342852.0, "step": 6351 }, { "entropy": 1.156844139099121, "epoch": 3.3449183780937335, "grad_norm": 0.2838175892829895, "learning_rate": 0.00012082820703593885, "loss": 0.18693877756595612, "mean_token_accuracy": 0.9201638102531433, "num_tokens": 78355188.0, "step": 6352 }, { "entropy": 1.188556969165802, "epoch": 3.345444971037388, "grad_norm": 0.2990287244319916, "learning_rate": 0.00012080643771525961, "loss": 0.18148550391197205, "mean_token_accuracy": 0.9223086684942245, "num_tokens": 78367524.0, "step": 6353 }, { "entropy": 1.1083954274654388, "epoch": 3.345971563981043, "grad_norm": 0.257366806268692, "learning_rate": 0.00012078466775306516, "loss": 0.16781064867973328, "mean_token_accuracy": 0.9296265095472336, "num_tokens": 78379860.0, "step": 6354 }, { "entropy": 1.1946285963058472, "epoch": 3.346498156924697, "grad_norm": 0.27597206830978394, "learning_rate": 0.00012076289715064782, "loss": 0.17030231654644012, "mean_token_accuracy": 0.9265072345733643, "num_tokens": 78392196.0, "step": 6355 }, { "entropy": 1.183891624212265, "epoch": 3.3470247498683516, "grad_norm": 0.30806371569633484, "learning_rate": 0.00012074112590930002, "loss": 0.20386773347854614, "mean_token_accuracy": 0.9101837873458862, "num_tokens": 78404532.0, "step": 6356 }, { "entropy": 1.1817936897277832, "epoch": 3.3475513428120065, "grad_norm": 0.31423214077949524, "learning_rate": 0.0001207193540303142, "loss": 0.19481787085533142, "mean_token_accuracy": 0.9217385649681091, "num_tokens": 78416868.0, "step": 6357 }, { "entropy": 1.1405643820762634, "epoch": 3.348077935755661, "grad_norm": 0.2859838306903839, "learning_rate": 0.00012069758151498279, "loss": 0.16153916716575623, "mean_token_accuracy": 0.9346592873334885, "num_tokens": 78429204.0, "step": 6358 }, { "entropy": 1.1543972492218018, "epoch": 3.3486045286993154, "grad_norm": 0.24678775668144226, "learning_rate": 0.00012067580836459831, "loss": 0.15756991505622864, "mean_token_accuracy": 0.9298305809497833, "num_tokens": 78441540.0, "step": 6359 }, { "entropy": 1.1946463882923126, "epoch": 3.34913112164297, "grad_norm": 0.3142666816711426, "learning_rate": 0.00012065403458045333, "loss": 0.20290496945381165, "mean_token_accuracy": 0.9145755767822266, "num_tokens": 78453876.0, "step": 6360 }, { "entropy": 1.1657448410987854, "epoch": 3.3496577145866246, "grad_norm": 0.2870401442050934, "learning_rate": 0.00012063226016384039, "loss": 0.172034353017807, "mean_token_accuracy": 0.922562375664711, "num_tokens": 78466212.0, "step": 6361 }, { "entropy": 1.2565245032310486, "epoch": 3.350184307530279, "grad_norm": 0.3314197361469269, "learning_rate": 0.00012061048511605215, "loss": 0.20180392265319824, "mean_token_accuracy": 0.9127491116523743, "num_tokens": 78478548.0, "step": 6362 }, { "entropy": 1.177832692861557, "epoch": 3.3507109004739335, "grad_norm": 0.2937653362751007, "learning_rate": 0.00012058870943838126, "loss": 0.18437829613685608, "mean_token_accuracy": 0.9219544529914856, "num_tokens": 78490884.0, "step": 6363 }, { "entropy": 1.2124599814414978, "epoch": 3.3512374934175884, "grad_norm": 0.5006588697433472, "learning_rate": 0.0001205669331321204, "loss": 0.1952374279499054, "mean_token_accuracy": 0.9153865575790405, "num_tokens": 78503220.0, "step": 6364 }, { "entropy": 1.2190957367420197, "epoch": 3.351764086361243, "grad_norm": 0.2922239899635315, "learning_rate": 0.00012054515619856226, "loss": 0.1920488327741623, "mean_token_accuracy": 0.9183184653520584, "num_tokens": 78515556.0, "step": 6365 }, { "entropy": 1.2415741980075836, "epoch": 3.352290679304897, "grad_norm": 0.30346837639808655, "learning_rate": 0.00012052337863899974, "loss": 0.1981666088104248, "mean_token_accuracy": 0.9160395860671997, "num_tokens": 78527892.0, "step": 6366 }, { "entropy": 1.195659875869751, "epoch": 3.3528172722485516, "grad_norm": 0.2848213315010071, "learning_rate": 0.00012050160045472552, "loss": 0.1909000128507614, "mean_token_accuracy": 0.9224957972764969, "num_tokens": 78540228.0, "step": 6367 }, { "entropy": 1.2450491189956665, "epoch": 3.3533438651922065, "grad_norm": 0.2762988805770874, "learning_rate": 0.00012047982164703249, "loss": 0.18776358664035797, "mean_token_accuracy": 0.9186998158693314, "num_tokens": 78552564.0, "step": 6368 }, { "entropy": 1.207970678806305, "epoch": 3.353870458135861, "grad_norm": 0.2834496796131134, "learning_rate": 0.00012045804221721351, "loss": 0.18195226788520813, "mean_token_accuracy": 0.9273946136236191, "num_tokens": 78564900.0, "step": 6369 }, { "entropy": 1.2410457730293274, "epoch": 3.3543970510795154, "grad_norm": 0.27324333786964417, "learning_rate": 0.00012043626216656154, "loss": 0.16907982528209686, "mean_token_accuracy": 0.9275219589471817, "num_tokens": 78577236.0, "step": 6370 }, { "entropy": 1.2029935419559479, "epoch": 3.3549236440231702, "grad_norm": 0.2765830457210541, "learning_rate": 0.00012041448149636951, "loss": 0.17685846984386444, "mean_token_accuracy": 0.9254040271043777, "num_tokens": 78589572.0, "step": 6371 }, { "entropy": 1.2648300230503082, "epoch": 3.3554502369668247, "grad_norm": 0.27480435371398926, "learning_rate": 0.00012039270020793044, "loss": 0.17362096905708313, "mean_token_accuracy": 0.9295898973941803, "num_tokens": 78601908.0, "step": 6372 }, { "entropy": 1.2284594178199768, "epoch": 3.355976829910479, "grad_norm": 0.25838661193847656, "learning_rate": 0.00012037091830253731, "loss": 0.16208310425281525, "mean_token_accuracy": 0.9317517578601837, "num_tokens": 78614244.0, "step": 6373 }, { "entropy": 1.2273503541946411, "epoch": 3.356503422854134, "grad_norm": 0.2887210547924042, "learning_rate": 0.0001203491357814832, "loss": 0.19540974497795105, "mean_token_accuracy": 0.9187801033258438, "num_tokens": 78626580.0, "step": 6374 }, { "entropy": 1.2493335902690887, "epoch": 3.3570300157977884, "grad_norm": 0.2819010019302368, "learning_rate": 0.00012032735264606123, "loss": 0.17759953439235687, "mean_token_accuracy": 0.9274661093950272, "num_tokens": 78638916.0, "step": 6375 }, { "entropy": 1.2599061727523804, "epoch": 3.357556608741443, "grad_norm": 0.29018980264663696, "learning_rate": 0.00012030556889756451, "loss": 0.1770056188106537, "mean_token_accuracy": 0.9274345934391022, "num_tokens": 78651252.0, "step": 6376 }, { "entropy": 1.264013558626175, "epoch": 3.3580832016850977, "grad_norm": 0.3153349757194519, "learning_rate": 0.00012028378453728624, "loss": 0.17471736669540405, "mean_token_accuracy": 0.9202364683151245, "num_tokens": 78663588.0, "step": 6377 }, { "entropy": 1.1637910306453705, "epoch": 3.358609794628752, "grad_norm": 0.2624271512031555, "learning_rate": 0.00012026199956651962, "loss": 0.17016033828258514, "mean_token_accuracy": 0.9273744225502014, "num_tokens": 78675924.0, "step": 6378 }, { "entropy": 1.1808833479881287, "epoch": 3.3591363875724065, "grad_norm": 0.2628500163555145, "learning_rate": 0.00012024021398655787, "loss": 0.16058243811130524, "mean_token_accuracy": 0.927247166633606, "num_tokens": 78688260.0, "step": 6379 }, { "entropy": 1.2481871843338013, "epoch": 3.359662980516061, "grad_norm": 0.28747764229774475, "learning_rate": 0.00012021842779869434, "loss": 0.16280566155910492, "mean_token_accuracy": 0.9292982518672943, "num_tokens": 78700596.0, "step": 6380 }, { "entropy": 1.2191427946090698, "epoch": 3.360189573459716, "grad_norm": 0.27619126439094543, "learning_rate": 0.00012019664100422232, "loss": 0.1760042905807495, "mean_token_accuracy": 0.9255061149597168, "num_tokens": 78712932.0, "step": 6381 }, { "entropy": 1.1552186608314514, "epoch": 3.3607161664033702, "grad_norm": 0.30576804280281067, "learning_rate": 0.00012017485360443512, "loss": 0.18111807107925415, "mean_token_accuracy": 0.9282488375902176, "num_tokens": 78725268.0, "step": 6382 }, { "entropy": 1.1739835739135742, "epoch": 3.3612427593470247, "grad_norm": 0.30674469470977783, "learning_rate": 0.00012015306560062615, "loss": 0.1644260287284851, "mean_token_accuracy": 0.9309899657964706, "num_tokens": 78737604.0, "step": 6383 }, { "entropy": 1.2402102649211884, "epoch": 3.361769352290679, "grad_norm": 0.3177843987941742, "learning_rate": 0.0001201312769940889, "loss": 0.1768120974302292, "mean_token_accuracy": 0.9286710470914841, "num_tokens": 78749940.0, "step": 6384 }, { "entropy": 1.2038277089595795, "epoch": 3.362295945234334, "grad_norm": 0.3215712010860443, "learning_rate": 0.00012010948778611677, "loss": 0.1781700700521469, "mean_token_accuracy": 0.9258454293012619, "num_tokens": 78762276.0, "step": 6385 }, { "entropy": 1.1869046688079834, "epoch": 3.3628225381779884, "grad_norm": 0.2943532466888428, "learning_rate": 0.00012008769797800325, "loss": 0.1682606190443039, "mean_token_accuracy": 0.9279265105724335, "num_tokens": 78774612.0, "step": 6386 }, { "entropy": 1.2341134548187256, "epoch": 3.363349131121643, "grad_norm": 0.2947143316268921, "learning_rate": 0.00012006590757104193, "loss": 0.17378848791122437, "mean_token_accuracy": 0.9286226630210876, "num_tokens": 78786948.0, "step": 6387 }, { "entropy": 1.2471059262752533, "epoch": 3.3638757240652977, "grad_norm": 0.3317924439907074, "learning_rate": 0.00012004411656652629, "loss": 0.19607557356357574, "mean_token_accuracy": 0.9176600426435471, "num_tokens": 78799284.0, "step": 6388 }, { "entropy": 1.2376134991645813, "epoch": 3.364402317008952, "grad_norm": 0.31895434856414795, "learning_rate": 0.00012002232496575005, "loss": 0.19523006677627563, "mean_token_accuracy": 0.9213353097438812, "num_tokens": 78811620.0, "step": 6389 }, { "entropy": 1.2288467288017273, "epoch": 3.3649289099526065, "grad_norm": 0.29991111159324646, "learning_rate": 0.00012000053277000676, "loss": 0.18137109279632568, "mean_token_accuracy": 0.9244268536567688, "num_tokens": 78823956.0, "step": 6390 }, { "entropy": 1.1793527603149414, "epoch": 3.3654555028962614, "grad_norm": 0.29665106534957886, "learning_rate": 0.00011997873998059014, "loss": 0.1704409420490265, "mean_token_accuracy": 0.9303467869758606, "num_tokens": 78836292.0, "step": 6391 }, { "entropy": 1.1957817375659943, "epoch": 3.365982095839916, "grad_norm": 0.29373741149902344, "learning_rate": 0.00011995694659879388, "loss": 0.18752476572990417, "mean_token_accuracy": 0.9178687334060669, "num_tokens": 78848628.0, "step": 6392 }, { "entropy": 1.2042733132839203, "epoch": 3.3665086887835702, "grad_norm": 0.28693804144859314, "learning_rate": 0.00011993515262591173, "loss": 0.17888300120830536, "mean_token_accuracy": 0.9232824593782425, "num_tokens": 78860964.0, "step": 6393 }, { "entropy": 1.2232481241226196, "epoch": 3.367035281727225, "grad_norm": 0.2558070123195648, "learning_rate": 0.00011991335806323751, "loss": 0.16054439544677734, "mean_token_accuracy": 0.9309938848018646, "num_tokens": 78873300.0, "step": 6394 }, { "entropy": 1.2379162907600403, "epoch": 3.3675618746708795, "grad_norm": 0.2749565839767456, "learning_rate": 0.00011989156291206496, "loss": 0.18252678215503693, "mean_token_accuracy": 0.9256701171398163, "num_tokens": 78885636.0, "step": 6395 }, { "entropy": 1.2794814705848694, "epoch": 3.368088467614534, "grad_norm": 0.30195149779319763, "learning_rate": 0.00011986976717368801, "loss": 0.18169333040714264, "mean_token_accuracy": 0.9204668700695038, "num_tokens": 78897972.0, "step": 6396 }, { "entropy": 1.231975257396698, "epoch": 3.3686150605581884, "grad_norm": 0.27333301305770874, "learning_rate": 0.00011984797084940047, "loss": 0.16971755027770996, "mean_token_accuracy": 0.9289774149656296, "num_tokens": 78910308.0, "step": 6397 }, { "entropy": 1.2228410243988037, "epoch": 3.3691416535018432, "grad_norm": 0.28853610157966614, "learning_rate": 0.00011982617394049631, "loss": 0.18892638385295868, "mean_token_accuracy": 0.9222717136144638, "num_tokens": 78922644.0, "step": 6398 }, { "entropy": 1.249678373336792, "epoch": 3.3696682464454977, "grad_norm": 0.2797059416770935, "learning_rate": 0.0001198043764482695, "loss": 0.18563976883888245, "mean_token_accuracy": 0.9269446730613708, "num_tokens": 78934980.0, "step": 6399 }, { "entropy": 1.284705102443695, "epoch": 3.370194839389152, "grad_norm": 0.30524787306785583, "learning_rate": 0.00011978257837401396, "loss": 0.1918303370475769, "mean_token_accuracy": 0.9167343527078629, "num_tokens": 78947316.0, "step": 6400 }, { "entropy": 1.207202434539795, "epoch": 3.3707214323328065, "grad_norm": 0.29419729113578796, "learning_rate": 0.0001197607797190238, "loss": 0.184175044298172, "mean_token_accuracy": 0.9205076545476913, "num_tokens": 78959652.0, "step": 6401 }, { "entropy": 1.227299064397812, "epoch": 3.3712480252764614, "grad_norm": 0.2963317930698395, "learning_rate": 0.00011973898048459302, "loss": 0.1846417635679245, "mean_token_accuracy": 0.9231779873371124, "num_tokens": 78971988.0, "step": 6402 }, { "entropy": 1.2725982964038849, "epoch": 3.371774618220116, "grad_norm": 0.2637333273887634, "learning_rate": 0.00011971718067201571, "loss": 0.16954471170902252, "mean_token_accuracy": 0.9284968376159668, "num_tokens": 78984324.0, "step": 6403 }, { "entropy": 1.2824425995349884, "epoch": 3.3723012111637702, "grad_norm": 0.2682304382324219, "learning_rate": 0.00011969538028258605, "loss": 0.1740560233592987, "mean_token_accuracy": 0.9296318143606186, "num_tokens": 78996660.0, "step": 6404 }, { "entropy": 1.329407274723053, "epoch": 3.372827804107425, "grad_norm": 0.29967549443244934, "learning_rate": 0.00011967357931759817, "loss": 0.19346961379051208, "mean_token_accuracy": 0.9207515865564346, "num_tokens": 79008996.0, "step": 6405 }, { "entropy": 1.3016041815280914, "epoch": 3.3733543970510795, "grad_norm": 0.29610949754714966, "learning_rate": 0.00011965177777834627, "loss": 0.18378973007202148, "mean_token_accuracy": 0.9205546379089355, "num_tokens": 79021332.0, "step": 6406 }, { "entropy": 1.2999705076217651, "epoch": 3.373880989994734, "grad_norm": 0.2858199179172516, "learning_rate": 0.00011962997566612455, "loss": 0.18614935874938965, "mean_token_accuracy": 0.926463171839714, "num_tokens": 79033668.0, "step": 6407 }, { "entropy": 1.2828991115093231, "epoch": 3.374407582938389, "grad_norm": 0.2873018980026245, "learning_rate": 0.00011960817298222734, "loss": 0.1899888515472412, "mean_token_accuracy": 0.9183394014835358, "num_tokens": 79046004.0, "step": 6408 }, { "entropy": 1.3172793090343475, "epoch": 3.3749341758820433, "grad_norm": 0.275519460439682, "learning_rate": 0.00011958636972794885, "loss": 0.1644439399242401, "mean_token_accuracy": 0.9322114735841751, "num_tokens": 79058340.0, "step": 6409 }, { "entropy": 1.298895001411438, "epoch": 3.3754607688256977, "grad_norm": 0.2899971604347229, "learning_rate": 0.00011956456590458351, "loss": 0.19333909451961517, "mean_token_accuracy": 0.9222669005393982, "num_tokens": 79070676.0, "step": 6410 }, { "entropy": 1.2996078133583069, "epoch": 3.375987361769352, "grad_norm": 0.27553460001945496, "learning_rate": 0.00011954276151342563, "loss": 0.1796150505542755, "mean_token_accuracy": 0.9242543876171112, "num_tokens": 79083012.0, "step": 6411 }, { "entropy": 1.308868795633316, "epoch": 3.376513954713007, "grad_norm": 0.29169005155563354, "learning_rate": 0.0001195209565557696, "loss": 0.19432169198989868, "mean_token_accuracy": 0.9213165938854218, "num_tokens": 79095348.0, "step": 6412 }, { "entropy": 1.2722634673118591, "epoch": 3.3770405476566614, "grad_norm": 0.2994008958339691, "learning_rate": 0.0001194991510329099, "loss": 0.18884015083312988, "mean_token_accuracy": 0.9226324707269669, "num_tokens": 79107684.0, "step": 6413 }, { "entropy": 1.2974510788917542, "epoch": 3.377567140600316, "grad_norm": 0.2953341603279114, "learning_rate": 0.00011947734494614094, "loss": 0.17390935122966766, "mean_token_accuracy": 0.9245711266994476, "num_tokens": 79120020.0, "step": 6414 }, { "entropy": 1.3775281608104706, "epoch": 3.3780937335439707, "grad_norm": 0.3047100007534027, "learning_rate": 0.00011945553829675727, "loss": 0.19041329622268677, "mean_token_accuracy": 0.9213204681873322, "num_tokens": 79132356.0, "step": 6415 }, { "entropy": 1.275354027748108, "epoch": 3.378620326487625, "grad_norm": 0.284958153963089, "learning_rate": 0.0001194337310860534, "loss": 0.19259652495384216, "mean_token_accuracy": 0.9220735430717468, "num_tokens": 79144692.0, "step": 6416 }, { "entropy": 1.2742116153240204, "epoch": 3.3791469194312795, "grad_norm": 0.2963763475418091, "learning_rate": 0.0001194119233153239, "loss": 0.19243276119232178, "mean_token_accuracy": 0.9173785448074341, "num_tokens": 79157028.0, "step": 6417 }, { "entropy": 1.2317672371864319, "epoch": 3.379673512374934, "grad_norm": 0.2609945237636566, "learning_rate": 0.00011939011498586333, "loss": 0.1713690608739853, "mean_token_accuracy": 0.9274909198284149, "num_tokens": 79169364.0, "step": 6418 }, { "entropy": 1.2643351554870605, "epoch": 3.380200105318589, "grad_norm": 0.29731491208076477, "learning_rate": 0.0001193683060989664, "loss": 0.1900637447834015, "mean_token_accuracy": 0.9176663905382156, "num_tokens": 79181700.0, "step": 6419 }, { "entropy": 1.22477388381958, "epoch": 3.3807266982622433, "grad_norm": 0.26480039954185486, "learning_rate": 0.00011934649665592775, "loss": 0.1722249835729599, "mean_token_accuracy": 0.928803339600563, "num_tokens": 79194036.0, "step": 6420 }, { "entropy": 1.3332690596580505, "epoch": 3.3812532912058977, "grad_norm": 0.301868200302124, "learning_rate": 0.00011932468665804204, "loss": 0.19132918119430542, "mean_token_accuracy": 0.9140020310878754, "num_tokens": 79206372.0, "step": 6421 }, { "entropy": 1.2536985278129578, "epoch": 3.3817798841495526, "grad_norm": 0.2905433475971222, "learning_rate": 0.00011930287610660404, "loss": 0.18709422647953033, "mean_token_accuracy": 0.9244557172060013, "num_tokens": 79218708.0, "step": 6422 }, { "entropy": 1.2495616376399994, "epoch": 3.382306477093207, "grad_norm": 0.28424185514450073, "learning_rate": 0.00011928106500290852, "loss": 0.1886255443096161, "mean_token_accuracy": 0.9215163737535477, "num_tokens": 79231044.0, "step": 6423 }, { "entropy": 1.2593499422073364, "epoch": 3.3828330700368614, "grad_norm": 0.31604936718940735, "learning_rate": 0.00011925925334825026, "loss": 0.18721966445446014, "mean_token_accuracy": 0.9196096658706665, "num_tokens": 79243380.0, "step": 6424 }, { "entropy": 1.2623234689235687, "epoch": 3.3833596629805163, "grad_norm": 0.2880619764328003, "learning_rate": 0.0001192374411439241, "loss": 0.1715773046016693, "mean_token_accuracy": 0.923977866768837, "num_tokens": 79255716.0, "step": 6425 }, { "entropy": 1.3184354901313782, "epoch": 3.3838862559241707, "grad_norm": 0.2996920049190521, "learning_rate": 0.00011921562839122488, "loss": 0.17126569151878357, "mean_token_accuracy": 0.9306629002094269, "num_tokens": 79268052.0, "step": 6426 }, { "entropy": 1.3011780977249146, "epoch": 3.384412848867825, "grad_norm": 0.3026772141456604, "learning_rate": 0.00011919381509144754, "loss": 0.19099418818950653, "mean_token_accuracy": 0.9181606322526932, "num_tokens": 79280388.0, "step": 6427 }, { "entropy": 1.2803550064563751, "epoch": 3.3849394418114795, "grad_norm": 0.29658186435699463, "learning_rate": 0.00011917200124588697, "loss": 0.18606960773468018, "mean_token_accuracy": 0.9221401065587997, "num_tokens": 79292724.0, "step": 6428 }, { "entropy": 1.2547394335269928, "epoch": 3.3854660347551344, "grad_norm": 0.2973290681838989, "learning_rate": 0.00011915018685583812, "loss": 0.1786566823720932, "mean_token_accuracy": 0.9251726716756821, "num_tokens": 79305060.0, "step": 6429 }, { "entropy": 1.2376038432121277, "epoch": 3.385992627698789, "grad_norm": 0.2691799998283386, "learning_rate": 0.00011912837192259605, "loss": 0.16852682828903198, "mean_token_accuracy": 0.9302997440099716, "num_tokens": 79317396.0, "step": 6430 }, { "entropy": 1.2441319227218628, "epoch": 3.3865192206424433, "grad_norm": 0.33154886960983276, "learning_rate": 0.00011910655644745575, "loss": 0.18511882424354553, "mean_token_accuracy": 0.9216586500406265, "num_tokens": 79329732.0, "step": 6431 }, { "entropy": 1.2591944336891174, "epoch": 3.387045813586098, "grad_norm": 0.28172236680984497, "learning_rate": 0.0001190847404317122, "loss": 0.1694486439228058, "mean_token_accuracy": 0.9262288212776184, "num_tokens": 79342068.0, "step": 6432 }, { "entropy": 1.2733435928821564, "epoch": 3.3875724065297526, "grad_norm": 0.2878052890300751, "learning_rate": 0.00011906292387666062, "loss": 0.17619693279266357, "mean_token_accuracy": 0.9262575060129166, "num_tokens": 79354404.0, "step": 6433 }, { "entropy": 1.2411152124404907, "epoch": 3.388098999473407, "grad_norm": 0.2835223078727722, "learning_rate": 0.00011904110678359609, "loss": 0.16783303022384644, "mean_token_accuracy": 0.9300921261310577, "num_tokens": 79366740.0, "step": 6434 }, { "entropy": 1.231415331363678, "epoch": 3.3886255924170614, "grad_norm": 0.29557785391807556, "learning_rate": 0.00011901928915381368, "loss": 0.17754420638084412, "mean_token_accuracy": 0.9224963933229446, "num_tokens": 79379076.0, "step": 6435 }, { "entropy": 1.2087534964084625, "epoch": 3.3891521853607163, "grad_norm": 0.2918643057346344, "learning_rate": 0.0001189974709886087, "loss": 0.16821406781673431, "mean_token_accuracy": 0.9269145727157593, "num_tokens": 79391412.0, "step": 6436 }, { "entropy": 1.227657288312912, "epoch": 3.3896787783043707, "grad_norm": 0.2932935357093811, "learning_rate": 0.0001189756522892763, "loss": 0.18248559534549713, "mean_token_accuracy": 0.9262166172266006, "num_tokens": 79403748.0, "step": 6437 }, { "entropy": 1.1676511764526367, "epoch": 3.390205371248025, "grad_norm": 0.27335324883461, "learning_rate": 0.0001189538330571117, "loss": 0.17541730403900146, "mean_token_accuracy": 0.9259244501590729, "num_tokens": 79416084.0, "step": 6438 }, { "entropy": 1.1459696888923645, "epoch": 3.39073196419168, "grad_norm": 0.28938010334968567, "learning_rate": 0.00011893201329341024, "loss": 0.19099408388137817, "mean_token_accuracy": 0.9196609854698181, "num_tokens": 79428420.0, "step": 6439 }, { "entropy": 1.1173287332057953, "epoch": 3.3912585571353344, "grad_norm": 0.2747189700603485, "learning_rate": 0.00011891019299946722, "loss": 0.17232942581176758, "mean_token_accuracy": 0.9275729954242706, "num_tokens": 79440756.0, "step": 6440 }, { "entropy": 1.1371882557868958, "epoch": 3.391785150078989, "grad_norm": 0.2940896153450012, "learning_rate": 0.00011888837217657796, "loss": 0.18742087483406067, "mean_token_accuracy": 0.9245633780956268, "num_tokens": 79453092.0, "step": 6441 }, { "entropy": 1.155574470758438, "epoch": 3.3923117430226437, "grad_norm": 0.29194408655166626, "learning_rate": 0.00011886655082603784, "loss": 0.18641987442970276, "mean_token_accuracy": 0.917420044541359, "num_tokens": 79465428.0, "step": 6442 }, { "entropy": 1.1233960390090942, "epoch": 3.392838335966298, "grad_norm": 0.26886695623397827, "learning_rate": 0.00011884472894914229, "loss": 0.16601043939590454, "mean_token_accuracy": 0.9291917532682419, "num_tokens": 79477764.0, "step": 6443 }, { "entropy": 1.1976157426834106, "epoch": 3.3933649289099526, "grad_norm": 0.29385286569595337, "learning_rate": 0.00011882290654718675, "loss": 0.18610018491744995, "mean_token_accuracy": 0.9244470000267029, "num_tokens": 79490100.0, "step": 6444 }, { "entropy": 1.203144907951355, "epoch": 3.393891521853607, "grad_norm": 0.29804056882858276, "learning_rate": 0.00011880108362146667, "loss": 0.1752803772687912, "mean_token_accuracy": 0.9256718158721924, "num_tokens": 79502436.0, "step": 6445 }, { "entropy": 1.1739285290241241, "epoch": 3.394418114797262, "grad_norm": 0.2718615233898163, "learning_rate": 0.00011877926017327754, "loss": 0.1714663803577423, "mean_token_accuracy": 0.9250137358903885, "num_tokens": 79514772.0, "step": 6446 }, { "entropy": 1.1488629579544067, "epoch": 3.3949447077409163, "grad_norm": 0.3127129077911377, "learning_rate": 0.00011875743620391488, "loss": 0.20285893976688385, "mean_token_accuracy": 0.917593389749527, "num_tokens": 79527108.0, "step": 6447 }, { "entropy": 1.1775774657726288, "epoch": 3.3954713006845707, "grad_norm": 0.29271870851516724, "learning_rate": 0.00011873561171467428, "loss": 0.17101457715034485, "mean_token_accuracy": 0.9278821647167206, "num_tokens": 79539444.0, "step": 6448 }, { "entropy": 1.1941743195056915, "epoch": 3.3959978936282256, "grad_norm": 0.27094972133636475, "learning_rate": 0.00011871378670685136, "loss": 0.17561134696006775, "mean_token_accuracy": 0.9257544875144958, "num_tokens": 79551780.0, "step": 6449 }, { "entropy": 1.178059995174408, "epoch": 3.39652448657188, "grad_norm": 0.3000102639198303, "learning_rate": 0.00011869196118174171, "loss": 0.18154367804527283, "mean_token_accuracy": 0.9236386120319366, "num_tokens": 79564116.0, "step": 6450 }, { "entropy": 1.1910910308361053, "epoch": 3.3970510795155344, "grad_norm": 0.2832523286342621, "learning_rate": 0.00011867013514064099, "loss": 0.17263087630271912, "mean_token_accuracy": 0.9248661249876022, "num_tokens": 79576452.0, "step": 6451 }, { "entropy": 1.2076069116592407, "epoch": 3.397577672459189, "grad_norm": 0.2817825973033905, "learning_rate": 0.00011864830858484483, "loss": 0.17139405012130737, "mean_token_accuracy": 0.9288913309574127, "num_tokens": 79588788.0, "step": 6452 }, { "entropy": 1.2060706615447998, "epoch": 3.3981042654028437, "grad_norm": 0.2979954481124878, "learning_rate": 0.00011862648151564901, "loss": 0.18236488103866577, "mean_token_accuracy": 0.9236573427915573, "num_tokens": 79601124.0, "step": 6453 }, { "entropy": 1.1929865777492523, "epoch": 3.398630858346498, "grad_norm": 0.2678283751010895, "learning_rate": 0.0001186046539343493, "loss": 0.16911433637142181, "mean_token_accuracy": 0.9306193888187408, "num_tokens": 79613460.0, "step": 6454 }, { "entropy": 1.233336627483368, "epoch": 3.3991574512901526, "grad_norm": 0.29617202281951904, "learning_rate": 0.0001185828258422414, "loss": 0.18631018698215485, "mean_token_accuracy": 0.9211310297250748, "num_tokens": 79625796.0, "step": 6455 }, { "entropy": 1.1534165441989899, "epoch": 3.3996840442338074, "grad_norm": 0.27414995431900024, "learning_rate": 0.00011856099724062118, "loss": 0.16907277703285217, "mean_token_accuracy": 0.9311786592006683, "num_tokens": 79638132.0, "step": 6456 }, { "entropy": 1.1924218833446503, "epoch": 3.400210637177462, "grad_norm": 0.2850103974342346, "learning_rate": 0.00011853916813078443, "loss": 0.17662088572978973, "mean_token_accuracy": 0.921423465013504, "num_tokens": 79650468.0, "step": 6457 }, { "entropy": 1.1488845944404602, "epoch": 3.4007372301211163, "grad_norm": 0.28349876403808594, "learning_rate": 0.00011851733851402705, "loss": 0.1736859381198883, "mean_token_accuracy": 0.9290521740913391, "num_tokens": 79662804.0, "step": 6458 }, { "entropy": 1.1178289353847504, "epoch": 3.401263823064771, "grad_norm": 0.2724773585796356, "learning_rate": 0.00011849550839164494, "loss": 0.16534751653671265, "mean_token_accuracy": 0.9299388378858566, "num_tokens": 79675140.0, "step": 6459 }, { "entropy": 1.1308171153068542, "epoch": 3.4017904160084256, "grad_norm": 0.32460305094718933, "learning_rate": 0.00011847367776493398, "loss": 0.1942930817604065, "mean_token_accuracy": 0.9228388965129852, "num_tokens": 79687476.0, "step": 6460 }, { "entropy": 1.1373795866966248, "epoch": 3.40231700895208, "grad_norm": 0.29590973258018494, "learning_rate": 0.00011845184663519017, "loss": 0.19952240586280823, "mean_token_accuracy": 0.9187348335981369, "num_tokens": 79699812.0, "step": 6461 }, { "entropy": 1.150606632232666, "epoch": 3.4028436018957344, "grad_norm": 0.30514517426490784, "learning_rate": 0.0001184300150037095, "loss": 0.19055360555648804, "mean_token_accuracy": 0.9176119863986969, "num_tokens": 79712148.0, "step": 6462 }, { "entropy": 1.1520099937915802, "epoch": 3.4033701948393893, "grad_norm": 0.3059881031513214, "learning_rate": 0.00011840818287178794, "loss": 0.18636028468608856, "mean_token_accuracy": 0.9222996830940247, "num_tokens": 79724484.0, "step": 6463 }, { "entropy": 1.1693687438964844, "epoch": 3.4038967877830437, "grad_norm": 0.2850539982318878, "learning_rate": 0.00011838635024072163, "loss": 0.18698805570602417, "mean_token_accuracy": 0.9174241870641708, "num_tokens": 79736820.0, "step": 6464 }, { "entropy": 1.114208161830902, "epoch": 3.404423380726698, "grad_norm": 0.3076694905757904, "learning_rate": 0.00011836451711180653, "loss": 0.19643941521644592, "mean_token_accuracy": 0.9194021672010422, "num_tokens": 79749156.0, "step": 6465 }, { "entropy": 1.1309235095977783, "epoch": 3.4049499736703526, "grad_norm": 0.28560197353363037, "learning_rate": 0.00011834268348633883, "loss": 0.1844782531261444, "mean_token_accuracy": 0.9242021590471268, "num_tokens": 79761492.0, "step": 6466 }, { "entropy": 1.148236870765686, "epoch": 3.4054765666140074, "grad_norm": 0.28917980194091797, "learning_rate": 0.00011832084936561463, "loss": 0.18366330862045288, "mean_token_accuracy": 0.9233373254537582, "num_tokens": 79773828.0, "step": 6467 }, { "entropy": 1.070885330438614, "epoch": 3.406003159557662, "grad_norm": 0.2740862965583801, "learning_rate": 0.00011829901475093008, "loss": 0.1761816143989563, "mean_token_accuracy": 0.9252870231866837, "num_tokens": 79786164.0, "step": 6468 }, { "entropy": 1.177080899477005, "epoch": 3.4065297525013163, "grad_norm": 0.3115704357624054, "learning_rate": 0.00011827717964358143, "loss": 0.18946781754493713, "mean_token_accuracy": 0.917195126414299, "num_tokens": 79798500.0, "step": 6469 }, { "entropy": 1.0926099717617035, "epoch": 3.407056345444971, "grad_norm": 0.25463196635246277, "learning_rate": 0.00011825534404486482, "loss": 0.17440186440944672, "mean_token_accuracy": 0.9275397509336472, "num_tokens": 79810836.0, "step": 6470 }, { "entropy": 1.0430421829223633, "epoch": 3.4075829383886256, "grad_norm": 0.26303786039352417, "learning_rate": 0.00011823350795607659, "loss": 0.1669006198644638, "mean_token_accuracy": 0.9294939339160919, "num_tokens": 79823172.0, "step": 6471 }, { "entropy": 1.1282849311828613, "epoch": 3.40810953133228, "grad_norm": 0.2979987561702728, "learning_rate": 0.00011821167137851299, "loss": 0.18477582931518555, "mean_token_accuracy": 0.922090008854866, "num_tokens": 79835508.0, "step": 6472 }, { "entropy": 1.1561923325061798, "epoch": 3.408636124275935, "grad_norm": 0.29177531599998474, "learning_rate": 0.00011818983431347028, "loss": 0.17757226526737213, "mean_token_accuracy": 0.9250189960002899, "num_tokens": 79847844.0, "step": 6473 }, { "entropy": 1.0861241519451141, "epoch": 3.4091627172195893, "grad_norm": 0.2876853942871094, "learning_rate": 0.00011816799676224488, "loss": 0.1904408186674118, "mean_token_accuracy": 0.9173862636089325, "num_tokens": 79860180.0, "step": 6474 }, { "entropy": 1.17974391579628, "epoch": 3.4096893101632437, "grad_norm": 0.3049277067184448, "learning_rate": 0.00011814615872613311, "loss": 0.18711437284946442, "mean_token_accuracy": 0.9238569587469101, "num_tokens": 79872516.0, "step": 6475 }, { "entropy": 1.0536549985408783, "epoch": 3.4102159031068986, "grad_norm": 0.28174707293510437, "learning_rate": 0.00011812432020643137, "loss": 0.1753990352153778, "mean_token_accuracy": 0.9222654402256012, "num_tokens": 79884852.0, "step": 6476 }, { "entropy": 1.1042083203792572, "epoch": 3.410742496050553, "grad_norm": 0.32421329617500305, "learning_rate": 0.00011810248120443608, "loss": 0.19320152699947357, "mean_token_accuracy": 0.920337051153183, "num_tokens": 79897188.0, "step": 6477 }, { "entropy": 1.140292465686798, "epoch": 3.4112690889942074, "grad_norm": 0.2862115502357483, "learning_rate": 0.0001180806417214437, "loss": 0.1740087866783142, "mean_token_accuracy": 0.9301891177892685, "num_tokens": 79909524.0, "step": 6478 }, { "entropy": 1.1167017817497253, "epoch": 3.411795681937862, "grad_norm": 0.2692073881626129, "learning_rate": 0.00011805880175875075, "loss": 0.1728738248348236, "mean_token_accuracy": 0.927298367023468, "num_tokens": 79921860.0, "step": 6479 }, { "entropy": 1.1420233249664307, "epoch": 3.4123222748815167, "grad_norm": 0.29182690382003784, "learning_rate": 0.00011803696131765369, "loss": 0.19215109944343567, "mean_token_accuracy": 0.9238179624080658, "num_tokens": 79934196.0, "step": 6480 }, { "entropy": 1.1108609437942505, "epoch": 3.412848867825171, "grad_norm": 0.2644272446632385, "learning_rate": 0.00011801512039944906, "loss": 0.1557019054889679, "mean_token_accuracy": 0.9326039105653763, "num_tokens": 79946532.0, "step": 6481 }, { "entropy": 1.1349286437034607, "epoch": 3.4133754607688256, "grad_norm": 0.26609179377555847, "learning_rate": 0.00011799327900543348, "loss": 0.17688050866127014, "mean_token_accuracy": 0.9275576919317245, "num_tokens": 79958868.0, "step": 6482 }, { "entropy": 1.1302656531333923, "epoch": 3.41390205371248, "grad_norm": 0.28293290734291077, "learning_rate": 0.00011797143713690351, "loss": 0.1745883971452713, "mean_token_accuracy": 0.9272965341806412, "num_tokens": 79971204.0, "step": 6483 }, { "entropy": 1.1133773624897003, "epoch": 3.414428646656135, "grad_norm": 0.30129706859588623, "learning_rate": 0.00011794959479515577, "loss": 0.17393873631954193, "mean_token_accuracy": 0.9289537519216537, "num_tokens": 79983540.0, "step": 6484 }, { "entropy": 1.079831063747406, "epoch": 3.4149552395997893, "grad_norm": 0.2830981910228729, "learning_rate": 0.00011792775198148694, "loss": 0.17949578166007996, "mean_token_accuracy": 0.9253024756908417, "num_tokens": 79995876.0, "step": 6485 }, { "entropy": 1.1521460115909576, "epoch": 3.4154818325434437, "grad_norm": 0.2825452387332916, "learning_rate": 0.00011790590869719364, "loss": 0.17278841137886047, "mean_token_accuracy": 0.9261876493692398, "num_tokens": 80008212.0, "step": 6486 }, { "entropy": 1.139787495136261, "epoch": 3.4160084254870986, "grad_norm": 0.2988513708114624, "learning_rate": 0.00011788406494357267, "loss": 0.16685795783996582, "mean_token_accuracy": 0.928671270608902, "num_tokens": 80020548.0, "step": 6487 }, { "entropy": 1.1628269851207733, "epoch": 3.416535018430753, "grad_norm": 0.31854918599128723, "learning_rate": 0.0001178622207219207, "loss": 0.181523859500885, "mean_token_accuracy": 0.9237556904554367, "num_tokens": 80032884.0, "step": 6488 }, { "entropy": 1.1285809874534607, "epoch": 3.4170616113744074, "grad_norm": 0.30883485078811646, "learning_rate": 0.00011784037603353448, "loss": 0.19393117725849152, "mean_token_accuracy": 0.9213438779115677, "num_tokens": 80045220.0, "step": 6489 }, { "entropy": 1.1644846498966217, "epoch": 3.4175882043180623, "grad_norm": 0.3214302361011505, "learning_rate": 0.00011781853087971087, "loss": 0.19055591523647308, "mean_token_accuracy": 0.917168065905571, "num_tokens": 80057556.0, "step": 6490 }, { "entropy": 1.121892660856247, "epoch": 3.4181147972617167, "grad_norm": 0.2962856590747833, "learning_rate": 0.0001177966852617466, "loss": 0.18106937408447266, "mean_token_accuracy": 0.9241335690021515, "num_tokens": 80069892.0, "step": 6491 }, { "entropy": 1.1662413477897644, "epoch": 3.418641390205371, "grad_norm": 0.2937811017036438, "learning_rate": 0.00011777483918093861, "loss": 0.18079042434692383, "mean_token_accuracy": 0.9276749789714813, "num_tokens": 80082228.0, "step": 6492 }, { "entropy": 1.1140519380569458, "epoch": 3.419167983149026, "grad_norm": 0.31999075412750244, "learning_rate": 0.00011775299263858375, "loss": 0.19316482543945312, "mean_token_accuracy": 0.913131058216095, "num_tokens": 80094564.0, "step": 6493 }, { "entropy": 1.1816271245479584, "epoch": 3.4196945760926805, "grad_norm": 0.3379019498825073, "learning_rate": 0.00011773114563597889, "loss": 0.1968633532524109, "mean_token_accuracy": 0.9174982309341431, "num_tokens": 80106900.0, "step": 6494 }, { "entropy": 1.1929983496665955, "epoch": 3.420221169036335, "grad_norm": 0.3005848526954651, "learning_rate": 0.00011770929817442095, "loss": 0.19482584297657013, "mean_token_accuracy": 0.9178702384233475, "num_tokens": 80119236.0, "step": 6495 }, { "entropy": 1.1554315090179443, "epoch": 3.4207477619799893, "grad_norm": 0.307674378156662, "learning_rate": 0.00011768745025520694, "loss": 0.19060266017913818, "mean_token_accuracy": 0.9200639873743057, "num_tokens": 80131572.0, "step": 6496 }, { "entropy": 1.1913148760795593, "epoch": 3.421274354923644, "grad_norm": 0.2751021683216095, "learning_rate": 0.00011766560187963378, "loss": 0.16455766558647156, "mean_token_accuracy": 0.9302422404289246, "num_tokens": 80143908.0, "step": 6497 }, { "entropy": 1.1741644442081451, "epoch": 3.4218009478672986, "grad_norm": 0.2983550429344177, "learning_rate": 0.00011764375304899852, "loss": 0.1866965889930725, "mean_token_accuracy": 0.9235400706529617, "num_tokens": 80156244.0, "step": 6498 }, { "entropy": 1.1782455444335938, "epoch": 3.422327540810953, "grad_norm": 0.27744725346565247, "learning_rate": 0.00011762190376459821, "loss": 0.17858903110027313, "mean_token_accuracy": 0.9297527521848679, "num_tokens": 80168580.0, "step": 6499 }, { "entropy": 1.1986348330974579, "epoch": 3.4228541337546075, "grad_norm": 0.3018032908439636, "learning_rate": 0.00011760005402772991, "loss": 0.1937883049249649, "mean_token_accuracy": 0.920555979013443, "num_tokens": 80180916.0, "step": 6500 }, { "entropy": 1.15380859375, "epoch": 3.4233807266982623, "grad_norm": 0.2850533723831177, "learning_rate": 0.00011757820383969067, "loss": 0.18893076479434967, "mean_token_accuracy": 0.9242502003908157, "num_tokens": 80193252.0, "step": 6501 }, { "entropy": 1.1450749039649963, "epoch": 3.4239073196419167, "grad_norm": 0.2731717526912689, "learning_rate": 0.00011755635320177765, "loss": 0.18395653367042542, "mean_token_accuracy": 0.9267681837081909, "num_tokens": 80205588.0, "step": 6502 }, { "entropy": 1.1836364269256592, "epoch": 3.424433912585571, "grad_norm": 0.27843019366264343, "learning_rate": 0.000117534502115288, "loss": 0.1765354722738266, "mean_token_accuracy": 0.9239010214805603, "num_tokens": 80217924.0, "step": 6503 }, { "entropy": 1.18682000041008, "epoch": 3.424960505529226, "grad_norm": 0.2813323140144348, "learning_rate": 0.00011751265058151886, "loss": 0.18243086338043213, "mean_token_accuracy": 0.92229263484478, "num_tokens": 80230260.0, "step": 6504 }, { "entropy": 1.1708821058273315, "epoch": 3.4254870984728805, "grad_norm": 0.2978111207485199, "learning_rate": 0.00011749079860176744, "loss": 0.1917700469493866, "mean_token_accuracy": 0.9173836261034012, "num_tokens": 80242596.0, "step": 6505 }, { "entropy": 1.1800695657730103, "epoch": 3.426013691416535, "grad_norm": 0.26697853207588196, "learning_rate": 0.00011746894617733095, "loss": 0.16811959445476532, "mean_token_accuracy": 0.9246619343757629, "num_tokens": 80254932.0, "step": 6506 }, { "entropy": 1.2367313504219055, "epoch": 3.4265402843601898, "grad_norm": 0.27477413415908813, "learning_rate": 0.00011744709330950668, "loss": 0.16949662566184998, "mean_token_accuracy": 0.9291162043809891, "num_tokens": 80267268.0, "step": 6507 }, { "entropy": 1.2026059925556183, "epoch": 3.427066877303844, "grad_norm": 0.3085479140281677, "learning_rate": 0.00011742523999959189, "loss": 0.1769024133682251, "mean_token_accuracy": 0.9260054975748062, "num_tokens": 80279604.0, "step": 6508 }, { "entropy": 1.1773946285247803, "epoch": 3.4275934702474986, "grad_norm": 0.2875780761241913, "learning_rate": 0.00011740338624888387, "loss": 0.19272294640541077, "mean_token_accuracy": 0.9172291159629822, "num_tokens": 80291940.0, "step": 6509 }, { "entropy": 1.1749962270259857, "epoch": 3.4281200631911535, "grad_norm": 0.30613988637924194, "learning_rate": 0.00011738153205867994, "loss": 0.20412415266036987, "mean_token_accuracy": 0.9147639125585556, "num_tokens": 80304276.0, "step": 6510 }, { "entropy": 1.160490334033966, "epoch": 3.428646656134808, "grad_norm": 0.2724848985671997, "learning_rate": 0.0001173596774302775, "loss": 0.1785711944103241, "mean_token_accuracy": 0.922538086771965, "num_tokens": 80316612.0, "step": 6511 }, { "entropy": 1.214755892753601, "epoch": 3.4291732490784623, "grad_norm": 0.28239157795906067, "learning_rate": 0.00011733782236497388, "loss": 0.18591734766960144, "mean_token_accuracy": 0.9207028150558472, "num_tokens": 80328948.0, "step": 6512 }, { "entropy": 1.2043667435646057, "epoch": 3.4296998420221168, "grad_norm": 0.3124966025352478, "learning_rate": 0.00011731596686406654, "loss": 0.19779212772846222, "mean_token_accuracy": 0.9196977764368057, "num_tokens": 80341284.0, "step": 6513 }, { "entropy": 1.2145142257213593, "epoch": 3.4302264349657716, "grad_norm": 0.2977919578552246, "learning_rate": 0.0001172941109288529, "loss": 0.18922749161720276, "mean_token_accuracy": 0.9222802817821503, "num_tokens": 80353620.0, "step": 6514 }, { "entropy": 1.15992671251297, "epoch": 3.430753027909426, "grad_norm": 0.2696559727191925, "learning_rate": 0.00011727225456063039, "loss": 0.18153204023838043, "mean_token_accuracy": 0.9248543679714203, "num_tokens": 80365956.0, "step": 6515 }, { "entropy": 1.2090700566768646, "epoch": 3.4312796208530805, "grad_norm": 0.3119373023509979, "learning_rate": 0.00011725039776069648, "loss": 0.20308628678321838, "mean_token_accuracy": 0.9092807322740555, "num_tokens": 80378292.0, "step": 6516 }, { "entropy": 1.2414629459381104, "epoch": 3.431806213796735, "grad_norm": 0.3116752505302429, "learning_rate": 0.00011722854053034873, "loss": 0.17774319648742676, "mean_token_accuracy": 0.9240649789571762, "num_tokens": 80390628.0, "step": 6517 }, { "entropy": 1.1835478842258453, "epoch": 3.4323328067403898, "grad_norm": 0.27387240529060364, "learning_rate": 0.0001172066828708847, "loss": 0.1747710108757019, "mean_token_accuracy": 0.923068955540657, "num_tokens": 80402964.0, "step": 6518 }, { "entropy": 1.1313741505146027, "epoch": 3.432859399684044, "grad_norm": 0.304924875497818, "learning_rate": 0.00011718482478360188, "loss": 0.17499877512454987, "mean_token_accuracy": 0.9271975159645081, "num_tokens": 80415300.0, "step": 6519 }, { "entropy": 1.1431568264961243, "epoch": 3.4333859926276986, "grad_norm": 0.28177160024642944, "learning_rate": 0.00011716296626979789, "loss": 0.19097380340099335, "mean_token_accuracy": 0.9180660396814346, "num_tokens": 80427636.0, "step": 6520 }, { "entropy": 1.1546144783496857, "epoch": 3.4339125855713535, "grad_norm": 0.3083032965660095, "learning_rate": 0.00011714110733077035, "loss": 0.1891811490058899, "mean_token_accuracy": 0.9216991811990738, "num_tokens": 80439972.0, "step": 6521 }, { "entropy": 1.1065263599157333, "epoch": 3.434439178515008, "grad_norm": 0.3084210455417633, "learning_rate": 0.00011711924796781688, "loss": 0.17542743682861328, "mean_token_accuracy": 0.9292380809783936, "num_tokens": 80452308.0, "step": 6522 }, { "entropy": 1.1676940321922302, "epoch": 3.4349657714586623, "grad_norm": 0.2608500123023987, "learning_rate": 0.00011709738818223514, "loss": 0.16403529047966003, "mean_token_accuracy": 0.9323164075613022, "num_tokens": 80464644.0, "step": 6523 }, { "entropy": 1.1683576107025146, "epoch": 3.435492364402317, "grad_norm": 0.28820911049842834, "learning_rate": 0.00011707552797532286, "loss": 0.18304772675037384, "mean_token_accuracy": 0.9200898706912994, "num_tokens": 80476980.0, "step": 6524 }, { "entropy": 1.185946136713028, "epoch": 3.4360189573459716, "grad_norm": 0.2908236086368561, "learning_rate": 0.00011705366734837771, "loss": 0.19122043251991272, "mean_token_accuracy": 0.9251454919576645, "num_tokens": 80489316.0, "step": 6525 }, { "entropy": 1.1847181618213654, "epoch": 3.436545550289626, "grad_norm": 0.27221596240997314, "learning_rate": 0.00011703180630269743, "loss": 0.18010379374027252, "mean_token_accuracy": 0.9298422038555145, "num_tokens": 80501652.0, "step": 6526 }, { "entropy": 1.2135211527347565, "epoch": 3.437072143233281, "grad_norm": 0.2955719530582428, "learning_rate": 0.00011700994483957982, "loss": 0.18285644054412842, "mean_token_accuracy": 0.9246233403682709, "num_tokens": 80513988.0, "step": 6527 }, { "entropy": 1.144883543252945, "epoch": 3.4375987361769353, "grad_norm": 0.26957473158836365, "learning_rate": 0.00011698808296032264, "loss": 0.14868520200252533, "mean_token_accuracy": 0.9365567862987518, "num_tokens": 80526324.0, "step": 6528 }, { "entropy": 1.1634040772914886, "epoch": 3.4381253291205898, "grad_norm": 0.2562483847141266, "learning_rate": 0.00011696622066622367, "loss": 0.16868998110294342, "mean_token_accuracy": 0.927982896566391, "num_tokens": 80538660.0, "step": 6529 }, { "entropy": 1.1752456724643707, "epoch": 3.438651922064244, "grad_norm": 0.2774886190891266, "learning_rate": 0.00011694435795858078, "loss": 0.16871336102485657, "mean_token_accuracy": 0.9282544255256653, "num_tokens": 80550996.0, "step": 6530 }, { "entropy": 1.1989236772060394, "epoch": 3.439178515007899, "grad_norm": 0.28946998715400696, "learning_rate": 0.00011692249483869186, "loss": 0.17763032019138336, "mean_token_accuracy": 0.9257817566394806, "num_tokens": 80563332.0, "step": 6531 }, { "entropy": 1.1545622050762177, "epoch": 3.4397051079515535, "grad_norm": 0.27830907702445984, "learning_rate": 0.00011690063130785478, "loss": 0.16989469528198242, "mean_token_accuracy": 0.926095500588417, "num_tokens": 80575668.0, "step": 6532 }, { "entropy": 1.1149566769599915, "epoch": 3.440231700895208, "grad_norm": 0.2736249566078186, "learning_rate": 0.00011687876736736745, "loss": 0.1887683868408203, "mean_token_accuracy": 0.9233509004116058, "num_tokens": 80588004.0, "step": 6533 }, { "entropy": 1.2303832173347473, "epoch": 3.4407582938388623, "grad_norm": 0.29226261377334595, "learning_rate": 0.00011685690301852776, "loss": 0.17193004488945007, "mean_token_accuracy": 0.9291989207267761, "num_tokens": 80600340.0, "step": 6534 }, { "entropy": 1.1652312874794006, "epoch": 3.441284886782517, "grad_norm": 0.2794043719768524, "learning_rate": 0.0001168350382626337, "loss": 0.177666574716568, "mean_token_accuracy": 0.9256787747144699, "num_tokens": 80612676.0, "step": 6535 }, { "entropy": 1.1783691346645355, "epoch": 3.4418114797261716, "grad_norm": 0.29861900210380554, "learning_rate": 0.00011681317310098328, "loss": 0.16599920392036438, "mean_token_accuracy": 0.9310362935066223, "num_tokens": 80625012.0, "step": 6536 }, { "entropy": 1.0840280950069427, "epoch": 3.442338072669826, "grad_norm": 0.26808103919029236, "learning_rate": 0.00011679130753487447, "loss": 0.16576027870178223, "mean_token_accuracy": 0.9295181483030319, "num_tokens": 80637348.0, "step": 6537 }, { "entropy": 1.1727299690246582, "epoch": 3.442864665613481, "grad_norm": 0.31399986147880554, "learning_rate": 0.00011676944156560532, "loss": 0.18242204189300537, "mean_token_accuracy": 0.9273713827133179, "num_tokens": 80649684.0, "step": 6538 }, { "entropy": 1.0957313776016235, "epoch": 3.4433912585571353, "grad_norm": 0.28226765990257263, "learning_rate": 0.00011674757519447386, "loss": 0.18178041279315948, "mean_token_accuracy": 0.9263020008802414, "num_tokens": 80662020.0, "step": 6539 }, { "entropy": 1.149830937385559, "epoch": 3.4439178515007898, "grad_norm": 0.31284838914871216, "learning_rate": 0.0001167257084227782, "loss": 0.2012108564376831, "mean_token_accuracy": 0.9146735966205597, "num_tokens": 80674356.0, "step": 6540 }, { "entropy": 1.1322484910488129, "epoch": 3.4444444444444446, "grad_norm": 0.31378963589668274, "learning_rate": 0.00011670384125181641, "loss": 0.18821854889392853, "mean_token_accuracy": 0.9224686771631241, "num_tokens": 80686692.0, "step": 6541 }, { "entropy": 1.1315763294696808, "epoch": 3.444971037388099, "grad_norm": 0.28233757615089417, "learning_rate": 0.0001166819736828867, "loss": 0.1841033399105072, "mean_token_accuracy": 0.9217792600393295, "num_tokens": 80699028.0, "step": 6542 }, { "entropy": 1.1389168202877045, "epoch": 3.4454976303317535, "grad_norm": 0.2919313609600067, "learning_rate": 0.00011666010571728712, "loss": 0.1807428002357483, "mean_token_accuracy": 0.9238739907741547, "num_tokens": 80711364.0, "step": 6543 }, { "entropy": 1.1506391763687134, "epoch": 3.446024223275408, "grad_norm": 0.30495715141296387, "learning_rate": 0.00011663823735631585, "loss": 0.17703501880168915, "mean_token_accuracy": 0.9246587008237839, "num_tokens": 80723700.0, "step": 6544 }, { "entropy": 1.149292677640915, "epoch": 3.446550816219063, "grad_norm": 0.32440587878227234, "learning_rate": 0.00011661636860127114, "loss": 0.18952536582946777, "mean_token_accuracy": 0.9217132180929184, "num_tokens": 80736036.0, "step": 6545 }, { "entropy": 1.143787831068039, "epoch": 3.447077409162717, "grad_norm": 0.3194747567176819, "learning_rate": 0.00011659449945345123, "loss": 0.19040217995643616, "mean_token_accuracy": 0.9150918424129486, "num_tokens": 80748372.0, "step": 6546 }, { "entropy": 1.133771300315857, "epoch": 3.4476040021063716, "grad_norm": 0.29951024055480957, "learning_rate": 0.00011657262991415428, "loss": 0.1916394680738449, "mean_token_accuracy": 0.9152339398860931, "num_tokens": 80760708.0, "step": 6547 }, { "entropy": 1.0690845847129822, "epoch": 3.4481305950500265, "grad_norm": 0.2761151194572449, "learning_rate": 0.00011655075998467861, "loss": 0.17733247578144073, "mean_token_accuracy": 0.924552246928215, "num_tokens": 80773044.0, "step": 6548 }, { "entropy": 1.125348061323166, "epoch": 3.448657187993681, "grad_norm": 0.3156280219554901, "learning_rate": 0.0001165288896663225, "loss": 0.19168615341186523, "mean_token_accuracy": 0.9187020510435104, "num_tokens": 80785380.0, "step": 6549 }, { "entropy": 1.1275436580181122, "epoch": 3.4491837809373354, "grad_norm": 0.316463828086853, "learning_rate": 0.00011650701896038428, "loss": 0.18441078066825867, "mean_token_accuracy": 0.9246549159288406, "num_tokens": 80797716.0, "step": 6550 }, { "entropy": 1.1101392209529877, "epoch": 3.4497103738809898, "grad_norm": 0.2858564853668213, "learning_rate": 0.00011648514786816225, "loss": 0.17851370573043823, "mean_token_accuracy": 0.9278943240642548, "num_tokens": 80810052.0, "step": 6551 }, { "entropy": 1.1429508030414581, "epoch": 3.4502369668246446, "grad_norm": 0.29304617643356323, "learning_rate": 0.0001164632763909548, "loss": 0.18404991924762726, "mean_token_accuracy": 0.9244458377361298, "num_tokens": 80822388.0, "step": 6552 }, { "entropy": 1.1314391195774078, "epoch": 3.450763559768299, "grad_norm": 0.3081319332122803, "learning_rate": 0.00011644140453006032, "loss": 0.17857228219509125, "mean_token_accuracy": 0.928916722536087, "num_tokens": 80834724.0, "step": 6553 }, { "entropy": 1.1212832033634186, "epoch": 3.4512901527119535, "grad_norm": 0.27429813146591187, "learning_rate": 0.00011641953228677715, "loss": 0.16691306233406067, "mean_token_accuracy": 0.9267957210540771, "num_tokens": 80847060.0, "step": 6554 }, { "entropy": 1.1509199142456055, "epoch": 3.4518167456556084, "grad_norm": 0.27302080392837524, "learning_rate": 0.00011639765966240377, "loss": 0.17131754755973816, "mean_token_accuracy": 0.93344546854496, "num_tokens": 80859396.0, "step": 6555 }, { "entropy": 1.1925573647022247, "epoch": 3.452343338599263, "grad_norm": 0.29770827293395996, "learning_rate": 0.00011637578665823865, "loss": 0.18186959624290466, "mean_token_accuracy": 0.9227061569690704, "num_tokens": 80871732.0, "step": 6556 }, { "entropy": 1.1526966989040375, "epoch": 3.452869931542917, "grad_norm": 0.30691203474998474, "learning_rate": 0.00011635391327558024, "loss": 0.18933729827404022, "mean_token_accuracy": 0.9198598265647888, "num_tokens": 80884068.0, "step": 6557 }, { "entropy": 1.1838021278381348, "epoch": 3.453396524486572, "grad_norm": 0.2861593961715698, "learning_rate": 0.00011633203951572702, "loss": 0.16275659203529358, "mean_token_accuracy": 0.928879976272583, "num_tokens": 80896404.0, "step": 6558 }, { "entropy": 1.1318974792957306, "epoch": 3.4539231174302265, "grad_norm": 0.2791045606136322, "learning_rate": 0.00011631016537997752, "loss": 0.17893241345882416, "mean_token_accuracy": 0.9246382415294647, "num_tokens": 80908740.0, "step": 6559 }, { "entropy": 1.1594657599925995, "epoch": 3.454449710373881, "grad_norm": 0.27512961626052856, "learning_rate": 0.00011628829086963027, "loss": 0.17512042820453644, "mean_token_accuracy": 0.9278998225927353, "num_tokens": 80921076.0, "step": 6560 }, { "entropy": 1.1768932342529297, "epoch": 3.4549763033175354, "grad_norm": 0.3068045973777771, "learning_rate": 0.00011626641598598387, "loss": 0.1870686411857605, "mean_token_accuracy": 0.9198578298091888, "num_tokens": 80933412.0, "step": 6561 }, { "entropy": 1.1646634340286255, "epoch": 3.4555028962611902, "grad_norm": 0.2588438093662262, "learning_rate": 0.00011624454073033686, "loss": 0.16256776452064514, "mean_token_accuracy": 0.933254674077034, "num_tokens": 80945748.0, "step": 6562 }, { "entropy": 1.151212453842163, "epoch": 3.4560294892048447, "grad_norm": 0.27041497826576233, "learning_rate": 0.00011622266510398788, "loss": 0.16854098439216614, "mean_token_accuracy": 0.9279792308807373, "num_tokens": 80958084.0, "step": 6563 }, { "entropy": 1.1997774839401245, "epoch": 3.456556082148499, "grad_norm": 0.29609692096710205, "learning_rate": 0.00011620078910823551, "loss": 0.17611055076122284, "mean_token_accuracy": 0.9268074929714203, "num_tokens": 80970420.0, "step": 6564 }, { "entropy": 1.170654296875, "epoch": 3.457082675092154, "grad_norm": 0.2995675802230835, "learning_rate": 0.00011617891274437842, "loss": 0.17296573519706726, "mean_token_accuracy": 0.9252562969923019, "num_tokens": 80982756.0, "step": 6565 }, { "entropy": 1.156025767326355, "epoch": 3.4576092680358084, "grad_norm": 0.2921859920024872, "learning_rate": 0.00011615703601371533, "loss": 0.17505501210689545, "mean_token_accuracy": 0.9234371185302734, "num_tokens": 80995092.0, "step": 6566 }, { "entropy": 1.161046952009201, "epoch": 3.458135860979463, "grad_norm": 0.31642282009124756, "learning_rate": 0.0001161351589175449, "loss": 0.18353474140167236, "mean_token_accuracy": 0.9227949529886246, "num_tokens": 81007428.0, "step": 6567 }, { "entropy": 1.1706399023532867, "epoch": 3.458662453923117, "grad_norm": 0.2912273108959198, "learning_rate": 0.00011611328145716582, "loss": 0.18829534947872162, "mean_token_accuracy": 0.9239943772554398, "num_tokens": 81019764.0, "step": 6568 }, { "entropy": 1.2326059937477112, "epoch": 3.459189046866772, "grad_norm": 0.3132517635822296, "learning_rate": 0.00011609140363387685, "loss": 0.1908145248889923, "mean_token_accuracy": 0.9225149899721146, "num_tokens": 81032100.0, "step": 6569 }, { "entropy": 1.2250230610370636, "epoch": 3.4597156398104265, "grad_norm": 0.30630579590797424, "learning_rate": 0.00011606952544897679, "loss": 0.17763450741767883, "mean_token_accuracy": 0.9313493818044662, "num_tokens": 81044436.0, "step": 6570 }, { "entropy": 1.1709964573383331, "epoch": 3.460242232754081, "grad_norm": 0.29354631900787354, "learning_rate": 0.00011604764690376433, "loss": 0.17751732468605042, "mean_token_accuracy": 0.9243370294570923, "num_tokens": 81056772.0, "step": 6571 }, { "entropy": 1.2080395221710205, "epoch": 3.460768825697736, "grad_norm": 0.36343979835510254, "learning_rate": 0.00011602576799953833, "loss": 0.23610971868038177, "mean_token_accuracy": 0.9005018621683121, "num_tokens": 81069108.0, "step": 6572 }, { "entropy": 1.1714594960212708, "epoch": 3.4612954186413902, "grad_norm": 0.29311808943748474, "learning_rate": 0.00011600388873759761, "loss": 0.1803843230009079, "mean_token_accuracy": 0.9217955619096756, "num_tokens": 81081444.0, "step": 6573 }, { "entropy": 1.220309853553772, "epoch": 3.4618220115850447, "grad_norm": 0.2932807207107544, "learning_rate": 0.00011598200911924104, "loss": 0.176841601729393, "mean_token_accuracy": 0.9230359196662903, "num_tokens": 81093780.0, "step": 6574 }, { "entropy": 1.2133452594280243, "epoch": 3.4623486045286995, "grad_norm": 0.29667747020721436, "learning_rate": 0.00011596012914576741, "loss": 0.18306420743465424, "mean_token_accuracy": 0.9236768782138824, "num_tokens": 81106116.0, "step": 6575 }, { "entropy": 1.1925814747810364, "epoch": 3.462875197472354, "grad_norm": 0.29117000102996826, "learning_rate": 0.00011593824881847568, "loss": 0.1902187466621399, "mean_token_accuracy": 0.9213954210281372, "num_tokens": 81118452.0, "step": 6576 }, { "entropy": 1.1880240738391876, "epoch": 3.4634017904160084, "grad_norm": 0.25567275285720825, "learning_rate": 0.00011591636813866473, "loss": 0.1658111959695816, "mean_token_accuracy": 0.9269106239080429, "num_tokens": 81130788.0, "step": 6577 }, { "entropy": 1.2391690611839294, "epoch": 3.463928383359663, "grad_norm": 0.29640063643455505, "learning_rate": 0.00011589448710763348, "loss": 0.19188007712364197, "mean_token_accuracy": 0.9219590872526169, "num_tokens": 81143124.0, "step": 6578 }, { "entropy": 1.2411593794822693, "epoch": 3.4644549763033177, "grad_norm": 0.3092680275440216, "learning_rate": 0.00011587260572668085, "loss": 0.1927184760570526, "mean_token_accuracy": 0.9193492829799652, "num_tokens": 81155460.0, "step": 6579 }, { "entropy": 1.1688562631607056, "epoch": 3.464981569246972, "grad_norm": 0.28550633788108826, "learning_rate": 0.00011585072399710588, "loss": 0.1812695562839508, "mean_token_accuracy": 0.9236355274915695, "num_tokens": 81167796.0, "step": 6580 }, { "entropy": 1.208341121673584, "epoch": 3.4655081621906265, "grad_norm": 0.33204883337020874, "learning_rate": 0.00011582884192020757, "loss": 0.21132433414459229, "mean_token_accuracy": 0.9120856076478958, "num_tokens": 81180132.0, "step": 6581 }, { "entropy": 1.1913246512413025, "epoch": 3.4660347551342814, "grad_norm": 0.2986827790737152, "learning_rate": 0.00011580695949728484, "loss": 0.1846022605895996, "mean_token_accuracy": 0.920821487903595, "num_tokens": 81192468.0, "step": 6582 }, { "entropy": 1.163210928440094, "epoch": 3.466561348077936, "grad_norm": 0.247142493724823, "learning_rate": 0.00011578507672963677, "loss": 0.17058244347572327, "mean_token_accuracy": 0.9306974112987518, "num_tokens": 81204804.0, "step": 6583 }, { "entropy": 1.184818983078003, "epoch": 3.4670879410215902, "grad_norm": 0.29265332221984863, "learning_rate": 0.00011576319361856241, "loss": 0.1763373613357544, "mean_token_accuracy": 0.9287092983722687, "num_tokens": 81217140.0, "step": 6584 }, { "entropy": 1.2022126913070679, "epoch": 3.4676145339652447, "grad_norm": 0.2635056674480438, "learning_rate": 0.00011574131016536084, "loss": 0.16333281993865967, "mean_token_accuracy": 0.9308081120252609, "num_tokens": 81229476.0, "step": 6585 }, { "entropy": 1.2003533244132996, "epoch": 3.4681411269088995, "grad_norm": 0.28320667147636414, "learning_rate": 0.00011571942637133115, "loss": 0.1698949933052063, "mean_token_accuracy": 0.9323157668113708, "num_tokens": 81241812.0, "step": 6586 }, { "entropy": 1.167895257472992, "epoch": 3.468667719852554, "grad_norm": 0.29053619503974915, "learning_rate": 0.00011569754223777245, "loss": 0.1694645881652832, "mean_token_accuracy": 0.9299274981021881, "num_tokens": 81254148.0, "step": 6587 }, { "entropy": 1.1586227118968964, "epoch": 3.4691943127962084, "grad_norm": 0.2703516185283661, "learning_rate": 0.00011567565776598388, "loss": 0.18138079345226288, "mean_token_accuracy": 0.9253202378749847, "num_tokens": 81266484.0, "step": 6588 }, { "entropy": 1.1255720853805542, "epoch": 3.4697209057398632, "grad_norm": 0.29182925820350647, "learning_rate": 0.00011565377295726459, "loss": 0.1912750005722046, "mean_token_accuracy": 0.9197563380002975, "num_tokens": 81278820.0, "step": 6589 }, { "entropy": 1.187912940979004, "epoch": 3.4702474986835177, "grad_norm": 0.31208208203315735, "learning_rate": 0.00011563188781291374, "loss": 0.19024209678173065, "mean_token_accuracy": 0.9244617819786072, "num_tokens": 81291156.0, "step": 6590 }, { "entropy": 1.1452976763248444, "epoch": 3.470774091627172, "grad_norm": 0.2791716158390045, "learning_rate": 0.00011561000233423056, "loss": 0.17118626832962036, "mean_token_accuracy": 0.9291893988847733, "num_tokens": 81303492.0, "step": 6591 }, { "entropy": 1.1394523978233337, "epoch": 3.471300684570827, "grad_norm": 0.2760827839374542, "learning_rate": 0.00011558811652251422, "loss": 0.1816837340593338, "mean_token_accuracy": 0.9236189126968384, "num_tokens": 81315828.0, "step": 6592 }, { "entropy": 1.1685126721858978, "epoch": 3.4718272775144814, "grad_norm": 0.296041876077652, "learning_rate": 0.00011556623037906395, "loss": 0.2019861936569214, "mean_token_accuracy": 0.9170893728733063, "num_tokens": 81328164.0, "step": 6593 }, { "entropy": 1.1197969913482666, "epoch": 3.472353870458136, "grad_norm": 0.2810327708721161, "learning_rate": 0.00011554434390517905, "loss": 0.17977027595043182, "mean_token_accuracy": 0.9234771877527237, "num_tokens": 81340500.0, "step": 6594 }, { "entropy": 1.098362535238266, "epoch": 3.4728804634017902, "grad_norm": 0.25688573718070984, "learning_rate": 0.00011552245710215879, "loss": 0.16313600540161133, "mean_token_accuracy": 0.9315668940544128, "num_tokens": 81352836.0, "step": 6595 }, { "entropy": 1.1131737232208252, "epoch": 3.473407056345445, "grad_norm": 0.27133485674858093, "learning_rate": 0.00011550056997130243, "loss": 0.16423733532428741, "mean_token_accuracy": 0.9326688498258591, "num_tokens": 81365172.0, "step": 6596 }, { "entropy": 1.1590063273906708, "epoch": 3.4739336492890995, "grad_norm": 0.297391414642334, "learning_rate": 0.00011547868251390925, "loss": 0.1711481511592865, "mean_token_accuracy": 0.9264299124479294, "num_tokens": 81377508.0, "step": 6597 }, { "entropy": 1.1494792103767395, "epoch": 3.474460242232754, "grad_norm": 0.3100283741950989, "learning_rate": 0.00011545679473127864, "loss": 0.19451028108596802, "mean_token_accuracy": 0.9161731451749802, "num_tokens": 81389844.0, "step": 6598 }, { "entropy": 1.133365660905838, "epoch": 3.474986835176409, "grad_norm": 0.2772313356399536, "learning_rate": 0.00011543490662470995, "loss": 0.1697755753993988, "mean_token_accuracy": 0.9305469989776611, "num_tokens": 81402180.0, "step": 6599 }, { "entropy": 1.1910265684127808, "epoch": 3.4755134281200633, "grad_norm": 0.3043367266654968, "learning_rate": 0.00011541301819550252, "loss": 0.20497861504554749, "mean_token_accuracy": 0.9168409556150436, "num_tokens": 81414516.0, "step": 6600 }, { "entropy": 1.1660354733467102, "epoch": 3.4760400210637177, "grad_norm": 0.2840496599674225, "learning_rate": 0.00011539112944495576, "loss": 0.18001000583171844, "mean_token_accuracy": 0.926645889878273, "num_tokens": 81426852.0, "step": 6601 }, { "entropy": 1.1751192808151245, "epoch": 3.476566614007372, "grad_norm": 0.28846150636672974, "learning_rate": 0.00011536924037436905, "loss": 0.1850300431251526, "mean_token_accuracy": 0.9225201606750488, "num_tokens": 81439188.0, "step": 6602 }, { "entropy": 1.1629333794116974, "epoch": 3.477093206951027, "grad_norm": 0.2861765921115875, "learning_rate": 0.00011534735098504183, "loss": 0.18943603336811066, "mean_token_accuracy": 0.9230009764432907, "num_tokens": 81451524.0, "step": 6603 }, { "entropy": 1.1608426570892334, "epoch": 3.4776197998946814, "grad_norm": 0.2963612675666809, "learning_rate": 0.00011532546127827355, "loss": 0.1895626187324524, "mean_token_accuracy": 0.9220454096794128, "num_tokens": 81463860.0, "step": 6604 }, { "entropy": 1.1968906819820404, "epoch": 3.478146392838336, "grad_norm": 0.30905681848526, "learning_rate": 0.00011530357125536368, "loss": 0.19823943078517914, "mean_token_accuracy": 0.920026570558548, "num_tokens": 81476196.0, "step": 6605 }, { "entropy": 1.1985065340995789, "epoch": 3.4786729857819907, "grad_norm": 0.34819188714027405, "learning_rate": 0.00011528168091761173, "loss": 0.19964611530303955, "mean_token_accuracy": 0.915794849395752, "num_tokens": 81488532.0, "step": 6606 }, { "entropy": 1.1689610183238983, "epoch": 3.479199578725645, "grad_norm": 0.27715957164764404, "learning_rate": 0.00011525979026631712, "loss": 0.16660673916339874, "mean_token_accuracy": 0.9315045028924942, "num_tokens": 81500868.0, "step": 6607 }, { "entropy": 1.2170887291431427, "epoch": 3.4797261716692995, "grad_norm": 0.2823488712310791, "learning_rate": 0.00011523789930277944, "loss": 0.1779467612504959, "mean_token_accuracy": 0.9199190735816956, "num_tokens": 81513204.0, "step": 6608 }, { "entropy": 1.162218153476715, "epoch": 3.4802527646129544, "grad_norm": 0.26582789421081543, "learning_rate": 0.00011521600802829819, "loss": 0.18130990862846375, "mean_token_accuracy": 0.9264215528964996, "num_tokens": 81525540.0, "step": 6609 }, { "entropy": 1.1923732459545135, "epoch": 3.480779357556609, "grad_norm": 0.2713901698589325, "learning_rate": 0.00011519411644417296, "loss": 0.16954302787780762, "mean_token_accuracy": 0.9345614463090897, "num_tokens": 81537876.0, "step": 6610 }, { "entropy": 1.1585627794265747, "epoch": 3.4813059505002633, "grad_norm": 0.27282825112342834, "learning_rate": 0.00011517222455170328, "loss": 0.1718309372663498, "mean_token_accuracy": 0.9259562790393829, "num_tokens": 81550212.0, "step": 6611 }, { "entropy": 1.1762122213840485, "epoch": 3.4818325434439177, "grad_norm": 0.3016502857208252, "learning_rate": 0.00011515033235218881, "loss": 0.20218555629253387, "mean_token_accuracy": 0.9207109361886978, "num_tokens": 81562548.0, "step": 6612 }, { "entropy": 1.215482771396637, "epoch": 3.4823591363875726, "grad_norm": 0.2939586937427521, "learning_rate": 0.00011512843984692914, "loss": 0.17666953802108765, "mean_token_accuracy": 0.9242789447307587, "num_tokens": 81574884.0, "step": 6613 }, { "entropy": 1.1481686234474182, "epoch": 3.482885729331227, "grad_norm": 0.2719016671180725, "learning_rate": 0.00011510654703722383, "loss": 0.15779361128807068, "mean_token_accuracy": 0.9320281744003296, "num_tokens": 81587220.0, "step": 6614 }, { "entropy": 1.1334491670131683, "epoch": 3.4834123222748814, "grad_norm": 0.3050325810909271, "learning_rate": 0.00011508465392437264, "loss": 0.18969212472438812, "mean_token_accuracy": 0.9199853092432022, "num_tokens": 81599556.0, "step": 6615 }, { "entropy": 1.1732980012893677, "epoch": 3.483938915218536, "grad_norm": 0.29076868295669556, "learning_rate": 0.00011506276050967518, "loss": 0.1871393620967865, "mean_token_accuracy": 0.921945109963417, "num_tokens": 81611892.0, "step": 6616 }, { "entropy": 1.0930970907211304, "epoch": 3.4844655081621907, "grad_norm": 0.2882307469844818, "learning_rate": 0.00011504086679443111, "loss": 0.17107221484184265, "mean_token_accuracy": 0.9295700341463089, "num_tokens": 81624228.0, "step": 6617 }, { "entropy": 1.1252177059650421, "epoch": 3.484992101105845, "grad_norm": 0.30228209495544434, "learning_rate": 0.00011501897277994015, "loss": 0.1892736852169037, "mean_token_accuracy": 0.9221300929784775, "num_tokens": 81636564.0, "step": 6618 }, { "entropy": 1.0760619044303894, "epoch": 3.4855186940494995, "grad_norm": 0.29396650195121765, "learning_rate": 0.00011499707846750205, "loss": 0.18223868310451508, "mean_token_accuracy": 0.923398420214653, "num_tokens": 81648900.0, "step": 6619 }, { "entropy": 1.1159788966178894, "epoch": 3.4860452869931544, "grad_norm": 0.2782004177570343, "learning_rate": 0.00011497518385841652, "loss": 0.17237144708633423, "mean_token_accuracy": 0.9255961179733276, "num_tokens": 81661236.0, "step": 6620 }, { "entropy": 1.1408976912498474, "epoch": 3.486571879936809, "grad_norm": 0.27848049998283386, "learning_rate": 0.00011495328895398332, "loss": 0.17134708166122437, "mean_token_accuracy": 0.9314141422510147, "num_tokens": 81673572.0, "step": 6621 }, { "entropy": 1.1072252094745636, "epoch": 3.4870984728804633, "grad_norm": 0.2836681306362152, "learning_rate": 0.00011493139375550222, "loss": 0.17910803854465485, "mean_token_accuracy": 0.9250835627317429, "num_tokens": 81685908.0, "step": 6622 }, { "entropy": 1.1477026045322418, "epoch": 3.487625065824118, "grad_norm": 0.2834495007991791, "learning_rate": 0.00011490949826427304, "loss": 0.1532410979270935, "mean_token_accuracy": 0.9367298632860184, "num_tokens": 81698244.0, "step": 6623 }, { "entropy": 1.1082239151000977, "epoch": 3.4881516587677726, "grad_norm": 0.28554338216781616, "learning_rate": 0.00011488760248159554, "loss": 0.18579819798469543, "mean_token_accuracy": 0.9214308559894562, "num_tokens": 81710580.0, "step": 6624 }, { "entropy": 1.1037914752960205, "epoch": 3.488678251711427, "grad_norm": 0.29008516669273376, "learning_rate": 0.00011486570640876959, "loss": 0.18042230606079102, "mean_token_accuracy": 0.925680547952652, "num_tokens": 81722916.0, "step": 6625 }, { "entropy": 1.0983848571777344, "epoch": 3.489204844655082, "grad_norm": 0.2795179486274719, "learning_rate": 0.00011484381004709499, "loss": 0.18224458396434784, "mean_token_accuracy": 0.9255627989768982, "num_tokens": 81735252.0, "step": 6626 }, { "entropy": 1.1155040860176086, "epoch": 3.4897314375987363, "grad_norm": 0.3062456250190735, "learning_rate": 0.00011482191339787161, "loss": 0.17353153228759766, "mean_token_accuracy": 0.9272499978542328, "num_tokens": 81747588.0, "step": 6627 }, { "entropy": 1.114521861076355, "epoch": 3.4902580305423907, "grad_norm": 0.2883119285106659, "learning_rate": 0.00011480001646239935, "loss": 0.18347394466400146, "mean_token_accuracy": 0.9220988899469376, "num_tokens": 81759924.0, "step": 6628 }, { "entropy": 1.1525468230247498, "epoch": 3.490784623486045, "grad_norm": 0.28988999128341675, "learning_rate": 0.00011477811924197807, "loss": 0.17436982691287994, "mean_token_accuracy": 0.9284380972385406, "num_tokens": 81772260.0, "step": 6629 }, { "entropy": 1.115129292011261, "epoch": 3.4913112164297, "grad_norm": 0.3117002844810486, "learning_rate": 0.00011475622173790775, "loss": 0.20904293656349182, "mean_token_accuracy": 0.9139687567949295, "num_tokens": 81784596.0, "step": 6630 }, { "entropy": 1.1141754984855652, "epoch": 3.4918378093733544, "grad_norm": 0.2861360013484955, "learning_rate": 0.00011473432395148824, "loss": 0.17029538750648499, "mean_token_accuracy": 0.926383838057518, "num_tokens": 81796932.0, "step": 6631 }, { "entropy": 1.13048455119133, "epoch": 3.492364402317009, "grad_norm": 0.28451624512672424, "learning_rate": 0.00011471242588401949, "loss": 0.17212338745594025, "mean_token_accuracy": 0.9275546222925186, "num_tokens": 81809268.0, "step": 6632 }, { "entropy": 1.1467244625091553, "epoch": 3.4928909952606633, "grad_norm": 0.3095795810222626, "learning_rate": 0.00011469052753680149, "loss": 0.17537778615951538, "mean_token_accuracy": 0.9277688413858414, "num_tokens": 81821604.0, "step": 6633 }, { "entropy": 1.1912976801395416, "epoch": 3.493417588204318, "grad_norm": 0.2997737228870392, "learning_rate": 0.00011466862891113424, "loss": 0.1905490607023239, "mean_token_accuracy": 0.9257136583328247, "num_tokens": 81833940.0, "step": 6634 }, { "entropy": 1.1551499962806702, "epoch": 3.4939441811479726, "grad_norm": 0.2778836786746979, "learning_rate": 0.00011464673000831767, "loss": 0.17382913827896118, "mean_token_accuracy": 0.931753933429718, "num_tokens": 81846276.0, "step": 6635 }, { "entropy": 1.135138601064682, "epoch": 3.494470774091627, "grad_norm": 0.2902297377586365, "learning_rate": 0.00011462483082965183, "loss": 0.17853501439094543, "mean_token_accuracy": 0.9257641136646271, "num_tokens": 81858612.0, "step": 6636 }, { "entropy": 1.1280643343925476, "epoch": 3.494997367035282, "grad_norm": 0.2728481888771057, "learning_rate": 0.00011460293137643673, "loss": 0.17710497975349426, "mean_token_accuracy": 0.9243131428956985, "num_tokens": 81870948.0, "step": 6637 }, { "entropy": 1.2509664297103882, "epoch": 3.4955239599789363, "grad_norm": 0.3230011761188507, "learning_rate": 0.00011458103164997244, "loss": 0.18864156305789948, "mean_token_accuracy": 0.9205769598484039, "num_tokens": 81883284.0, "step": 6638 }, { "entropy": 1.2034538090229034, "epoch": 3.4960505529225907, "grad_norm": 0.2898879647254944, "learning_rate": 0.00011455913165155898, "loss": 0.17311909794807434, "mean_token_accuracy": 0.925488069653511, "num_tokens": 81895620.0, "step": 6639 }, { "entropy": 1.198070228099823, "epoch": 3.4965771458662456, "grad_norm": 0.34274739027023315, "learning_rate": 0.00011453723138249647, "loss": 0.2226196974515915, "mean_token_accuracy": 0.9075485169887543, "num_tokens": 81907956.0, "step": 6640 }, { "entropy": 1.148144394159317, "epoch": 3.4971037388099, "grad_norm": 0.29571598768234253, "learning_rate": 0.000114515330844085, "loss": 0.1886741667985916, "mean_token_accuracy": 0.9233464449644089, "num_tokens": 81920292.0, "step": 6641 }, { "entropy": 1.221672236919403, "epoch": 3.4976303317535544, "grad_norm": 0.2766885757446289, "learning_rate": 0.00011449343003762459, "loss": 0.17083361744880676, "mean_token_accuracy": 0.9291570335626602, "num_tokens": 81932628.0, "step": 6642 }, { "entropy": 1.1299061477184296, "epoch": 3.4981569246972093, "grad_norm": 0.2906188368797302, "learning_rate": 0.00011447152896441544, "loss": 0.1777857095003128, "mean_token_accuracy": 0.9236705750226974, "num_tokens": 81944964.0, "step": 6643 }, { "entropy": 1.159753531217575, "epoch": 3.4986835176408637, "grad_norm": 0.2817007005214691, "learning_rate": 0.00011444962762575771, "loss": 0.16421736776828766, "mean_token_accuracy": 0.9325893074274063, "num_tokens": 81957300.0, "step": 6644 }, { "entropy": 1.1971134841442108, "epoch": 3.499210110584518, "grad_norm": 0.2881527841091156, "learning_rate": 0.00011442772602295154, "loss": 0.1794702112674713, "mean_token_accuracy": 0.9238597750663757, "num_tokens": 81969636.0, "step": 6645 }, { "entropy": 1.1957855224609375, "epoch": 3.4997367035281726, "grad_norm": 0.27637138962745667, "learning_rate": 0.00011440582415729704, "loss": 0.18101292848587036, "mean_token_accuracy": 0.9228304326534271, "num_tokens": 81981972.0, "step": 6646 }, { "entropy": 1.1890069842338562, "epoch": 3.5002632964718274, "grad_norm": 0.287105530500412, "learning_rate": 0.00011438392203009445, "loss": 0.16792245209217072, "mean_token_accuracy": 0.9272554069757462, "num_tokens": 81994308.0, "step": 6647 }, { "entropy": 1.1754546761512756, "epoch": 3.500789889415482, "grad_norm": 0.2850852310657501, "learning_rate": 0.00011436201964264397, "loss": 0.18495099246501923, "mean_token_accuracy": 0.9250370264053345, "num_tokens": 82006644.0, "step": 6648 }, { "entropy": 1.170114904642105, "epoch": 3.5013164823591363, "grad_norm": 0.3009004592895508, "learning_rate": 0.0001143401169962458, "loss": 0.17369845509529114, "mean_token_accuracy": 0.9245720952749252, "num_tokens": 82018980.0, "step": 6649 }, { "entropy": 1.1544669270515442, "epoch": 3.5018430753027907, "grad_norm": 0.2812612056732178, "learning_rate": 0.00011431821409220016, "loss": 0.15663373470306396, "mean_token_accuracy": 0.9367344081401825, "num_tokens": 82031316.0, "step": 6650 }, { "entropy": 1.166733056306839, "epoch": 3.5023696682464456, "grad_norm": 0.2908081114292145, "learning_rate": 0.00011429631093180735, "loss": 0.188845694065094, "mean_token_accuracy": 0.9181435257196426, "num_tokens": 82043652.0, "step": 6651 }, { "entropy": 1.1835882365703583, "epoch": 3.5028962611901, "grad_norm": 0.2998650074005127, "learning_rate": 0.0001142744075163676, "loss": 0.18816843628883362, "mean_token_accuracy": 0.9196074903011322, "num_tokens": 82055988.0, "step": 6652 }, { "entropy": 1.1490100622177124, "epoch": 3.5034228541337544, "grad_norm": 0.29029542207717896, "learning_rate": 0.00011425250384718113, "loss": 0.1794453114271164, "mean_token_accuracy": 0.9246736168861389, "num_tokens": 82068324.0, "step": 6653 }, { "entropy": 1.1529352962970734, "epoch": 3.5039494470774093, "grad_norm": 0.28752025961875916, "learning_rate": 0.00011423059992554836, "loss": 0.1690784990787506, "mean_token_accuracy": 0.9275295436382294, "num_tokens": 82080660.0, "step": 6654 }, { "entropy": 1.1477917730808258, "epoch": 3.5044760400210637, "grad_norm": 0.2715306282043457, "learning_rate": 0.00011420869575276954, "loss": 0.18134590983390808, "mean_token_accuracy": 0.923336461186409, "num_tokens": 82092996.0, "step": 6655 }, { "entropy": 1.1334083378314972, "epoch": 3.505002632964718, "grad_norm": 0.2830401360988617, "learning_rate": 0.00011418679133014492, "loss": 0.1798047125339508, "mean_token_accuracy": 0.9220581203699112, "num_tokens": 82105332.0, "step": 6656 }, { "entropy": 1.1629810333251953, "epoch": 3.505529225908373, "grad_norm": 0.29926276206970215, "learning_rate": 0.00011416488665897496, "loss": 0.17554765939712524, "mean_token_accuracy": 0.9291818886995316, "num_tokens": 82117668.0, "step": 6657 }, { "entropy": 1.189599096775055, "epoch": 3.5060558188520274, "grad_norm": 0.29402297735214233, "learning_rate": 0.0001141429817405599, "loss": 0.1820201873779297, "mean_token_accuracy": 0.9224792569875717, "num_tokens": 82130004.0, "step": 6658 }, { "entropy": 1.202353149652481, "epoch": 3.506582411795682, "grad_norm": 0.30211108922958374, "learning_rate": 0.00011412107657620022, "loss": 0.18185541033744812, "mean_token_accuracy": 0.9220666885375977, "num_tokens": 82142340.0, "step": 6659 }, { "entropy": 1.1482025682926178, "epoch": 3.5071090047393367, "grad_norm": 0.2861393094062805, "learning_rate": 0.0001140991711671962, "loss": 0.1571296602487564, "mean_token_accuracy": 0.9309457689523697, "num_tokens": 82154676.0, "step": 6660 }, { "entropy": 1.175143539905548, "epoch": 3.507635597682991, "grad_norm": 0.30909398198127747, "learning_rate": 0.00011407726551484829, "loss": 0.1912471503019333, "mean_token_accuracy": 0.9234516620635986, "num_tokens": 82167012.0, "step": 6661 }, { "entropy": 1.1644525229930878, "epoch": 3.5081621906266456, "grad_norm": 0.27131006121635437, "learning_rate": 0.0001140553596204569, "loss": 0.16325272619724274, "mean_token_accuracy": 0.9287524670362473, "num_tokens": 82179348.0, "step": 6662 }, { "entropy": 1.1756154894828796, "epoch": 3.5086887835703, "grad_norm": 0.2639835774898529, "learning_rate": 0.00011403345348532241, "loss": 0.16972073912620544, "mean_token_accuracy": 0.930676743388176, "num_tokens": 82191684.0, "step": 6663 }, { "entropy": 1.168285846710205, "epoch": 3.509215376513955, "grad_norm": 0.280975341796875, "learning_rate": 0.00011401154711074536, "loss": 0.17953525483608246, "mean_token_accuracy": 0.9248925000429153, "num_tokens": 82204020.0, "step": 6664 }, { "entropy": 1.1686240434646606, "epoch": 3.5097419694576093, "grad_norm": 0.3023900091648102, "learning_rate": 0.0001139896404980261, "loss": 0.19406768679618835, "mean_token_accuracy": 0.9197174608707428, "num_tokens": 82216356.0, "step": 6665 }, { "entropy": 1.1314858198165894, "epoch": 3.5102685624012637, "grad_norm": 0.2750619053840637, "learning_rate": 0.00011396773364846515, "loss": 0.18743553757667542, "mean_token_accuracy": 0.9228628724813461, "num_tokens": 82228692.0, "step": 6666 }, { "entropy": 1.1731296479701996, "epoch": 3.510795155344918, "grad_norm": 0.26219767332077026, "learning_rate": 0.00011394582656336294, "loss": 0.16224750876426697, "mean_token_accuracy": 0.9315479099750519, "num_tokens": 82241028.0, "step": 6667 }, { "entropy": 1.1279303133487701, "epoch": 3.511321748288573, "grad_norm": 0.2696554362773895, "learning_rate": 0.00011392391924402006, "loss": 0.1876666396856308, "mean_token_accuracy": 0.9174473583698273, "num_tokens": 82253364.0, "step": 6668 }, { "entropy": 1.1923480331897736, "epoch": 3.5118483412322274, "grad_norm": 0.3161199688911438, "learning_rate": 0.00011390201169173696, "loss": 0.18782727420330048, "mean_token_accuracy": 0.9201867580413818, "num_tokens": 82265700.0, "step": 6669 }, { "entropy": 1.13890740275383, "epoch": 3.512374934175882, "grad_norm": 0.28775709867477417, "learning_rate": 0.00011388010390781412, "loss": 0.18304120004177094, "mean_token_accuracy": 0.9230560064315796, "num_tokens": 82278036.0, "step": 6670 }, { "entropy": 1.1755778789520264, "epoch": 3.5129015271195367, "grad_norm": 0.29729554057121277, "learning_rate": 0.00011385819589355213, "loss": 0.19876186549663544, "mean_token_accuracy": 0.9160097390413284, "num_tokens": 82290372.0, "step": 6671 }, { "entropy": 1.1228938102722168, "epoch": 3.513428120063191, "grad_norm": 0.269479900598526, "learning_rate": 0.00011383628765025159, "loss": 0.16613386571407318, "mean_token_accuracy": 0.9278391003608704, "num_tokens": 82302708.0, "step": 6672 }, { "entropy": 1.1971102356910706, "epoch": 3.5139547130068456, "grad_norm": 0.29220128059387207, "learning_rate": 0.00011381437917921298, "loss": 0.19029895961284637, "mean_token_accuracy": 0.9208804666996002, "num_tokens": 82315044.0, "step": 6673 }, { "entropy": 1.1914150714874268, "epoch": 3.5144813059505005, "grad_norm": 0.26985040307044983, "learning_rate": 0.00011379247048173691, "loss": 0.1660212129354477, "mean_token_accuracy": 0.9299520552158356, "num_tokens": 82327380.0, "step": 6674 }, { "entropy": 1.1616050004959106, "epoch": 3.515007898894155, "grad_norm": 0.27132195234298706, "learning_rate": 0.00011377056155912398, "loss": 0.16966667771339417, "mean_token_accuracy": 0.9275068193674088, "num_tokens": 82339716.0, "step": 6675 }, { "entropy": 1.1854330003261566, "epoch": 3.5155344918378093, "grad_norm": 0.29107174277305603, "learning_rate": 0.00011374865241267478, "loss": 0.19449283182621002, "mean_token_accuracy": 0.9214458614587784, "num_tokens": 82352052.0, "step": 6676 }, { "entropy": 1.159307211637497, "epoch": 3.516061084781464, "grad_norm": 0.30077505111694336, "learning_rate": 0.0001137267430436899, "loss": 0.18535788357257843, "mean_token_accuracy": 0.9221621602773666, "num_tokens": 82364388.0, "step": 6677 }, { "entropy": 1.1502597630023956, "epoch": 3.5165876777251186, "grad_norm": 0.26556146144866943, "learning_rate": 0.00011370483345347005, "loss": 0.14751596748828888, "mean_token_accuracy": 0.9397944211959839, "num_tokens": 82376724.0, "step": 6678 }, { "entropy": 1.1277763843536377, "epoch": 3.517114270668773, "grad_norm": 0.26896631717681885, "learning_rate": 0.00011368292364331586, "loss": 0.16893108189105988, "mean_token_accuracy": 0.930274710059166, "num_tokens": 82389060.0, "step": 6679 }, { "entropy": 1.165677160024643, "epoch": 3.5176408636124274, "grad_norm": 0.2698739767074585, "learning_rate": 0.00011366101361452792, "loss": 0.16360832750797272, "mean_token_accuracy": 0.9305921196937561, "num_tokens": 82401396.0, "step": 6680 }, { "entropy": 1.1598637700080872, "epoch": 3.518167456556082, "grad_norm": 0.29341399669647217, "learning_rate": 0.00011363910336840693, "loss": 0.18213388323783875, "mean_token_accuracy": 0.9251310080289841, "num_tokens": 82413732.0, "step": 6681 }, { "entropy": 1.2141633033752441, "epoch": 3.5186940494997367, "grad_norm": 0.3217828869819641, "learning_rate": 0.00011361719290625359, "loss": 0.1961696296930313, "mean_token_accuracy": 0.9190056324005127, "num_tokens": 82426068.0, "step": 6682 }, { "entropy": 1.2312059104442596, "epoch": 3.519220642443391, "grad_norm": 0.29935598373413086, "learning_rate": 0.00011359528222936859, "loss": 0.17847727239131927, "mean_token_accuracy": 0.9217860400676727, "num_tokens": 82438404.0, "step": 6683 }, { "entropy": 1.1697284579277039, "epoch": 3.5197472353870456, "grad_norm": 0.2881301939487457, "learning_rate": 0.00011357337133905267, "loss": 0.1669689267873764, "mean_token_accuracy": 0.9282235205173492, "num_tokens": 82450740.0, "step": 6684 }, { "entropy": 1.1748462319374084, "epoch": 3.5202738283307005, "grad_norm": 0.2914867699146271, "learning_rate": 0.00011355146023660647, "loss": 0.16577622294425964, "mean_token_accuracy": 0.928860068321228, "num_tokens": 82463076.0, "step": 6685 }, { "entropy": 1.193132072687149, "epoch": 3.520800421274355, "grad_norm": 0.288672536611557, "learning_rate": 0.00011352954892333081, "loss": 0.16755886375904083, "mean_token_accuracy": 0.9266272485256195, "num_tokens": 82475412.0, "step": 6686 }, { "entropy": 1.1540884375572205, "epoch": 3.5213270142180093, "grad_norm": 0.28521907329559326, "learning_rate": 0.00011350763740052641, "loss": 0.16336628794670105, "mean_token_accuracy": 0.9258767068386078, "num_tokens": 82487748.0, "step": 6687 }, { "entropy": 1.1704376339912415, "epoch": 3.521853607161664, "grad_norm": 0.285859078168869, "learning_rate": 0.000113485725669494, "loss": 0.174256831407547, "mean_token_accuracy": 0.9224302023649216, "num_tokens": 82500084.0, "step": 6688 }, { "entropy": 1.1904620826244354, "epoch": 3.5223802001053186, "grad_norm": 0.3063889145851135, "learning_rate": 0.00011346381373153437, "loss": 0.17402036488056183, "mean_token_accuracy": 0.9279422610998154, "num_tokens": 82512420.0, "step": 6689 }, { "entropy": 1.1764242053031921, "epoch": 3.522906793048973, "grad_norm": 0.3261604905128479, "learning_rate": 0.00011344190158794831, "loss": 0.19507795572280884, "mean_token_accuracy": 0.9163391441106796, "num_tokens": 82524756.0, "step": 6690 }, { "entropy": 1.1777270138263702, "epoch": 3.523433385992628, "grad_norm": 0.30891919136047363, "learning_rate": 0.0001134199892400366, "loss": 0.17530623078346252, "mean_token_accuracy": 0.9266311526298523, "num_tokens": 82537092.0, "step": 6691 }, { "entropy": 1.1871914863586426, "epoch": 3.5239599789362823, "grad_norm": 0.2826218008995056, "learning_rate": 0.0001133980766891001, "loss": 0.16185614466667175, "mean_token_accuracy": 0.9352222830057144, "num_tokens": 82549428.0, "step": 6692 }, { "entropy": 1.198514848947525, "epoch": 3.5244865718799367, "grad_norm": 0.31576254963874817, "learning_rate": 0.00011337616393643957, "loss": 0.19219081103801727, "mean_token_accuracy": 0.9173667877912521, "num_tokens": 82561764.0, "step": 6693 }, { "entropy": 1.110146313905716, "epoch": 3.5250131648235916, "grad_norm": 0.30720821022987366, "learning_rate": 0.0001133542509833559, "loss": 0.17404642701148987, "mean_token_accuracy": 0.9256002455949783, "num_tokens": 82574100.0, "step": 6694 }, { "entropy": 1.1758156716823578, "epoch": 3.525539757767246, "grad_norm": 0.28131312131881714, "learning_rate": 0.00011333233783114983, "loss": 0.16816528141498566, "mean_token_accuracy": 0.9299330562353134, "num_tokens": 82586436.0, "step": 6695 }, { "entropy": 1.2057862281799316, "epoch": 3.5260663507109005, "grad_norm": 0.27498504519462585, "learning_rate": 0.00011331042448112233, "loss": 0.16259035468101501, "mean_token_accuracy": 0.9331092834472656, "num_tokens": 82598772.0, "step": 6696 }, { "entropy": 1.254322737455368, "epoch": 3.526592943654555, "grad_norm": 0.3335970938205719, "learning_rate": 0.00011328851093457422, "loss": 0.19345268607139587, "mean_token_accuracy": 0.9160381555557251, "num_tokens": 82611108.0, "step": 6697 }, { "entropy": 1.189445048570633, "epoch": 3.5271195365982093, "grad_norm": 0.3048352599143982, "learning_rate": 0.00011326659719280639, "loss": 0.18552914261817932, "mean_token_accuracy": 0.9201581329107285, "num_tokens": 82623444.0, "step": 6698 }, { "entropy": 1.184005230665207, "epoch": 3.527646129541864, "grad_norm": 0.2636079788208008, "learning_rate": 0.0001132446832571197, "loss": 0.1744004786014557, "mean_token_accuracy": 0.9310558140277863, "num_tokens": 82635780.0, "step": 6699 }, { "entropy": 1.2675062119960785, "epoch": 3.5281727224855186, "grad_norm": 0.3155592978000641, "learning_rate": 0.00011322276912881509, "loss": 0.18889999389648438, "mean_token_accuracy": 0.9213542491197586, "num_tokens": 82648116.0, "step": 6700 }, { "entropy": 1.2281614542007446, "epoch": 3.528699315429173, "grad_norm": 0.3071075975894928, "learning_rate": 0.00011320085480919347, "loss": 0.18316353857517242, "mean_token_accuracy": 0.9199003130197525, "num_tokens": 82660452.0, "step": 6701 }, { "entropy": 1.2589176893234253, "epoch": 3.529225908372828, "grad_norm": 0.2643257975578308, "learning_rate": 0.00011317894029955571, "loss": 0.17070399224758148, "mean_token_accuracy": 0.9279015958309174, "num_tokens": 82672788.0, "step": 6702 }, { "entropy": 1.2546433806419373, "epoch": 3.5297525013164823, "grad_norm": 0.28589674830436707, "learning_rate": 0.00011315702560120287, "loss": 0.17748479545116425, "mean_token_accuracy": 0.9249358177185059, "num_tokens": 82685124.0, "step": 6703 }, { "entropy": 1.2395256757736206, "epoch": 3.5302790942601368, "grad_norm": 0.27757275104522705, "learning_rate": 0.00011313511071543577, "loss": 0.18514981865882874, "mean_token_accuracy": 0.9227488189935684, "num_tokens": 82697460.0, "step": 6704 }, { "entropy": 1.3025157749652863, "epoch": 3.5308056872037916, "grad_norm": 0.31811168789863586, "learning_rate": 0.00011311319564355542, "loss": 0.2027345597743988, "mean_token_accuracy": 0.919356182217598, "num_tokens": 82709796.0, "step": 6705 }, { "entropy": 1.2027359008789062, "epoch": 3.531332280147446, "grad_norm": 0.25090813636779785, "learning_rate": 0.00011309128038686278, "loss": 0.17038676142692566, "mean_token_accuracy": 0.9237317740917206, "num_tokens": 82722132.0, "step": 6706 }, { "entropy": 1.2685667276382446, "epoch": 3.5318588730911005, "grad_norm": 0.2764739394187927, "learning_rate": 0.00011306936494665887, "loss": 0.18713237345218658, "mean_token_accuracy": 0.9216730147600174, "num_tokens": 82734468.0, "step": 6707 }, { "entropy": 1.2293285727500916, "epoch": 3.5323854660347553, "grad_norm": 0.2929922342300415, "learning_rate": 0.00011304744932424464, "loss": 0.1961107850074768, "mean_token_accuracy": 0.9158258140087128, "num_tokens": 82746804.0, "step": 6708 }, { "entropy": 1.2187176942825317, "epoch": 3.5329120589784098, "grad_norm": 0.23983658850193024, "learning_rate": 0.00011302553352092111, "loss": 0.16560348868370056, "mean_token_accuracy": 0.932516485452652, "num_tokens": 82759140.0, "step": 6709 }, { "entropy": 1.202950358390808, "epoch": 3.533438651922064, "grad_norm": 0.2635363042354584, "learning_rate": 0.0001130036175379893, "loss": 0.15890291333198547, "mean_token_accuracy": 0.9299011379480362, "num_tokens": 82771476.0, "step": 6710 }, { "entropy": 1.2060719430446625, "epoch": 3.533965244865719, "grad_norm": 0.27711576223373413, "learning_rate": 0.0001129817013767502, "loss": 0.17853610217571259, "mean_token_accuracy": 0.9225573241710663, "num_tokens": 82783812.0, "step": 6711 }, { "entropy": 1.2049013674259186, "epoch": 3.5344918378093735, "grad_norm": 0.2870274484157562, "learning_rate": 0.00011295978503850487, "loss": 0.18564696609973907, "mean_token_accuracy": 0.9162482470273972, "num_tokens": 82796148.0, "step": 6712 }, { "entropy": 1.2103980481624603, "epoch": 3.535018430753028, "grad_norm": 0.26491767168045044, "learning_rate": 0.00011293786852455439, "loss": 0.16474959254264832, "mean_token_accuracy": 0.932452842593193, "num_tokens": 82808484.0, "step": 6713 }, { "entropy": 1.196048378944397, "epoch": 3.5355450236966823, "grad_norm": 0.2709740400314331, "learning_rate": 0.00011291595183619974, "loss": 0.17166750133037567, "mean_token_accuracy": 0.9255477041006088, "num_tokens": 82820820.0, "step": 6714 }, { "entropy": 1.1764866709709167, "epoch": 3.5360716166403368, "grad_norm": 0.29145118594169617, "learning_rate": 0.00011289403497474202, "loss": 0.17616400122642517, "mean_token_accuracy": 0.9311197251081467, "num_tokens": 82833156.0, "step": 6715 }, { "entropy": 1.1895210444927216, "epoch": 3.5365982095839916, "grad_norm": 0.3000554144382477, "learning_rate": 0.00011287211794148232, "loss": 0.18552231788635254, "mean_token_accuracy": 0.9238729327917099, "num_tokens": 82845492.0, "step": 6716 }, { "entropy": 1.1906383037567139, "epoch": 3.537124802527646, "grad_norm": 0.30997785925865173, "learning_rate": 0.00011285020073772172, "loss": 0.1873130053281784, "mean_token_accuracy": 0.9219983518123627, "num_tokens": 82857828.0, "step": 6717 }, { "entropy": 1.2437363266944885, "epoch": 3.5376513954713005, "grad_norm": 0.2874256670475006, "learning_rate": 0.00011282828336476134, "loss": 0.15653786063194275, "mean_token_accuracy": 0.9357765763998032, "num_tokens": 82870164.0, "step": 6718 }, { "entropy": 1.162617802619934, "epoch": 3.5381779884149553, "grad_norm": 0.274565190076828, "learning_rate": 0.00011280636582390222, "loss": 0.16253608465194702, "mean_token_accuracy": 0.9314239025115967, "num_tokens": 82882500.0, "step": 6719 }, { "entropy": 1.1853586435317993, "epoch": 3.5387045813586098, "grad_norm": 0.30693045258522034, "learning_rate": 0.00011278444811644553, "loss": 0.1883617341518402, "mean_token_accuracy": 0.9210736006498337, "num_tokens": 82894836.0, "step": 6720 }, { "entropy": 1.1961411833763123, "epoch": 3.539231174302264, "grad_norm": 0.7807809710502625, "learning_rate": 0.0001127625302436924, "loss": 0.18562889099121094, "mean_token_accuracy": 0.9230353385210037, "num_tokens": 82907172.0, "step": 6721 }, { "entropy": 1.1774947941303253, "epoch": 3.539757767245919, "grad_norm": 0.30910661816596985, "learning_rate": 0.00011274061220694396, "loss": 0.17419037222862244, "mean_token_accuracy": 0.924850583076477, "num_tokens": 82919508.0, "step": 6722 }, { "entropy": 1.1937752664089203, "epoch": 3.5402843601895735, "grad_norm": 0.32564640045166016, "learning_rate": 0.00011271869400750133, "loss": 0.19138182699680328, "mean_token_accuracy": 0.9183522164821625, "num_tokens": 82931844.0, "step": 6723 }, { "entropy": 1.1646762192249298, "epoch": 3.540810953133228, "grad_norm": 0.29397276043891907, "learning_rate": 0.00011269677564666565, "loss": 0.1737130582332611, "mean_token_accuracy": 0.9258291274309158, "num_tokens": 82944180.0, "step": 6724 }, { "entropy": 1.2043721377849579, "epoch": 3.541337546076883, "grad_norm": 0.30750924348831177, "learning_rate": 0.00011267485712573818, "loss": 0.18758301436901093, "mean_token_accuracy": 0.9227220118045807, "num_tokens": 82956516.0, "step": 6725 }, { "entropy": 1.205798625946045, "epoch": 3.541864139020537, "grad_norm": 0.30392226576805115, "learning_rate": 0.00011265293844601997, "loss": 0.17270836234092712, "mean_token_accuracy": 0.9301195740699768, "num_tokens": 82968852.0, "step": 6726 }, { "entropy": 1.1954290270805359, "epoch": 3.5423907319641916, "grad_norm": 0.28532564640045166, "learning_rate": 0.00011263101960881228, "loss": 0.17308568954467773, "mean_token_accuracy": 0.9245552122592926, "num_tokens": 82981188.0, "step": 6727 }, { "entropy": 1.232110172510147, "epoch": 3.5429173249078465, "grad_norm": 0.33423352241516113, "learning_rate": 0.00011260910061541637, "loss": 0.18927906453609467, "mean_token_accuracy": 0.9178860485553741, "num_tokens": 82993524.0, "step": 6728 }, { "entropy": 1.2852757275104523, "epoch": 3.543443917851501, "grad_norm": 0.2983771562576294, "learning_rate": 0.0001125871814671333, "loss": 0.17770478129386902, "mean_token_accuracy": 0.9284773916006088, "num_tokens": 83005860.0, "step": 6729 }, { "entropy": 1.2685899138450623, "epoch": 3.5439705107951553, "grad_norm": 0.29142412543296814, "learning_rate": 0.00011256526216526433, "loss": 0.1880548745393753, "mean_token_accuracy": 0.923332005739212, "num_tokens": 83018196.0, "step": 6730 }, { "entropy": 1.2598896324634552, "epoch": 3.5444971037388098, "grad_norm": 0.2949274480342865, "learning_rate": 0.0001125433427111107, "loss": 0.17068499326705933, "mean_token_accuracy": 0.9293069690465927, "num_tokens": 83030532.0, "step": 6731 }, { "entropy": 1.2281588017940521, "epoch": 3.545023696682464, "grad_norm": 0.2889408469200134, "learning_rate": 0.00011252142310597364, "loss": 0.17698845267295837, "mean_token_accuracy": 0.9286070317029953, "num_tokens": 83042868.0, "step": 6732 }, { "entropy": 1.269063025712967, "epoch": 3.545550289626119, "grad_norm": 0.29950693249702454, "learning_rate": 0.00011249950335115443, "loss": 0.16892579197883606, "mean_token_accuracy": 0.9297320991754532, "num_tokens": 83055204.0, "step": 6733 }, { "entropy": 1.2776862978935242, "epoch": 3.5460768825697735, "grad_norm": 0.31639254093170166, "learning_rate": 0.00011247758344795423, "loss": 0.19716720283031464, "mean_token_accuracy": 0.9158044904470444, "num_tokens": 83067540.0, "step": 6734 }, { "entropy": 1.317240983247757, "epoch": 3.546603475513428, "grad_norm": 0.28840455412864685, "learning_rate": 0.00011245566339767435, "loss": 0.18107880651950836, "mean_token_accuracy": 0.9243495315313339, "num_tokens": 83079876.0, "step": 6735 }, { "entropy": 1.2626528143882751, "epoch": 3.547130068457083, "grad_norm": 0.2795928716659546, "learning_rate": 0.00011243374320161607, "loss": 0.16566278040409088, "mean_token_accuracy": 0.9298494160175323, "num_tokens": 83092212.0, "step": 6736 }, { "entropy": 1.2726233303546906, "epoch": 3.547656661400737, "grad_norm": 0.315793514251709, "learning_rate": 0.0001124118228610806, "loss": 0.1717158704996109, "mean_token_accuracy": 0.9273900836706161, "num_tokens": 83104548.0, "step": 6737 }, { "entropy": 1.3019500076770782, "epoch": 3.5481832543443916, "grad_norm": 0.3635459244251251, "learning_rate": 0.0001123899023773693, "loss": 0.18998388946056366, "mean_token_accuracy": 0.919920027256012, "num_tokens": 83116884.0, "step": 6738 }, { "entropy": 1.2970272600650787, "epoch": 3.5487098472880465, "grad_norm": 0.2943572998046875, "learning_rate": 0.0001123679817517834, "loss": 0.18436715006828308, "mean_token_accuracy": 0.9233886748552322, "num_tokens": 83129220.0, "step": 6739 }, { "entropy": 1.2755154073238373, "epoch": 3.549236440231701, "grad_norm": 0.3052658140659332, "learning_rate": 0.00011234606098562424, "loss": 0.18061406910419464, "mean_token_accuracy": 0.9223170429468155, "num_tokens": 83141556.0, "step": 6740 }, { "entropy": 1.2355510890483856, "epoch": 3.5497630331753554, "grad_norm": 0.30959102511405945, "learning_rate": 0.0001123241400801931, "loss": 0.18960706889629364, "mean_token_accuracy": 0.9217345267534256, "num_tokens": 83153892.0, "step": 6741 }, { "entropy": 1.2396555840969086, "epoch": 3.5502896261190102, "grad_norm": 0.29119154810905457, "learning_rate": 0.0001123022190367913, "loss": 0.17762398719787598, "mean_token_accuracy": 0.9257684648036957, "num_tokens": 83166228.0, "step": 6742 }, { "entropy": 1.1585346460342407, "epoch": 3.5508162190626646, "grad_norm": 0.2666080892086029, "learning_rate": 0.00011228029785672023, "loss": 0.1687043160200119, "mean_token_accuracy": 0.9259619563817978, "num_tokens": 83178564.0, "step": 6743 }, { "entropy": 1.1754328608512878, "epoch": 3.551342812006319, "grad_norm": 0.35181063413619995, "learning_rate": 0.0001122583765412811, "loss": 0.18153096735477448, "mean_token_accuracy": 0.9212551862001419, "num_tokens": 83190900.0, "step": 6744 }, { "entropy": 1.1387519538402557, "epoch": 3.551869404949974, "grad_norm": 0.24666999280452728, "learning_rate": 0.00011223645509177535, "loss": 0.14854127168655396, "mean_token_accuracy": 0.9388223141431808, "num_tokens": 83203236.0, "step": 6745 }, { "entropy": 1.122187227010727, "epoch": 3.5523959978936284, "grad_norm": 0.2791399657726288, "learning_rate": 0.00011221453350950431, "loss": 0.1779361367225647, "mean_token_accuracy": 0.9246224761009216, "num_tokens": 83215572.0, "step": 6746 }, { "entropy": 1.1300030052661896, "epoch": 3.552922590837283, "grad_norm": 0.29074087738990784, "learning_rate": 0.00011219261179576928, "loss": 0.1794925183057785, "mean_token_accuracy": 0.9241160750389099, "num_tokens": 83227908.0, "step": 6747 }, { "entropy": 1.1947501301765442, "epoch": 3.553449183780937, "grad_norm": 0.3051902949810028, "learning_rate": 0.00011217068995187172, "loss": 0.18434175848960876, "mean_token_accuracy": 0.9224974811077118, "num_tokens": 83240244.0, "step": 6748 }, { "entropy": 1.1320153772830963, "epoch": 3.5539757767245916, "grad_norm": 0.2957667112350464, "learning_rate": 0.00011214876797911292, "loss": 0.18279367685317993, "mean_token_accuracy": 0.9267748147249222, "num_tokens": 83252580.0, "step": 6749 }, { "entropy": 1.1726331114768982, "epoch": 3.5545023696682465, "grad_norm": 0.27514028549194336, "learning_rate": 0.00011212684587879427, "loss": 0.1648423969745636, "mean_token_accuracy": 0.9331820756196976, "num_tokens": 83264916.0, "step": 6750 }, { "entropy": 1.1044942140579224, "epoch": 3.555028962611901, "grad_norm": 0.2936144769191742, "learning_rate": 0.00011210492365221719, "loss": 0.18164953589439392, "mean_token_accuracy": 0.9242898970842361, "num_tokens": 83277252.0, "step": 6751 }, { "entropy": 1.1623157262802124, "epoch": 3.5555555555555554, "grad_norm": 0.2973748743534088, "learning_rate": 0.00011208300130068308, "loss": 0.1812804937362671, "mean_token_accuracy": 0.9253558069467545, "num_tokens": 83289588.0, "step": 6752 }, { "entropy": 1.2013108432292938, "epoch": 3.5560821484992102, "grad_norm": 0.3230435848236084, "learning_rate": 0.00011206107882549333, "loss": 0.19521446526050568, "mean_token_accuracy": 0.913422480225563, "num_tokens": 83301924.0, "step": 6753 }, { "entropy": 1.1237129867076874, "epoch": 3.5566087414428647, "grad_norm": 0.25985023379325867, "learning_rate": 0.00011203915622794934, "loss": 0.16712124645709991, "mean_token_accuracy": 0.9284080117940903, "num_tokens": 83314260.0, "step": 6754 }, { "entropy": 1.1246764659881592, "epoch": 3.557135334386519, "grad_norm": 0.2639875113964081, "learning_rate": 0.00011201723350935249, "loss": 0.1713811457157135, "mean_token_accuracy": 0.92882439494133, "num_tokens": 83326596.0, "step": 6755 }, { "entropy": 1.1077988743782043, "epoch": 3.557661927330174, "grad_norm": 0.27503833174705505, "learning_rate": 0.00011199531067100426, "loss": 0.17916113138198853, "mean_token_accuracy": 0.9328770935535431, "num_tokens": 83338932.0, "step": 6756 }, { "entropy": 1.1336831152439117, "epoch": 3.5581885202738284, "grad_norm": 0.3099113702774048, "learning_rate": 0.00011197338771420608, "loss": 0.18660598993301392, "mean_token_accuracy": 0.9220423400402069, "num_tokens": 83351268.0, "step": 6757 }, { "entropy": 1.1971750855445862, "epoch": 3.558715113217483, "grad_norm": 0.27214622497558594, "learning_rate": 0.00011195146464025936, "loss": 0.17578336596488953, "mean_token_accuracy": 0.9273701459169388, "num_tokens": 83363604.0, "step": 6758 }, { "entropy": 1.1493057310581207, "epoch": 3.5592417061611377, "grad_norm": 0.29546862840652466, "learning_rate": 0.00011192954145046556, "loss": 0.1825748085975647, "mean_token_accuracy": 0.9244335293769836, "num_tokens": 83375940.0, "step": 6759 }, { "entropy": 1.1059208512306213, "epoch": 3.559768299104792, "grad_norm": 0.26903000473976135, "learning_rate": 0.00011190761814612616, "loss": 0.18101567029953003, "mean_token_accuracy": 0.9220552444458008, "num_tokens": 83388276.0, "step": 6760 }, { "entropy": 1.150664508342743, "epoch": 3.5602948920484465, "grad_norm": 0.30451393127441406, "learning_rate": 0.00011188569472854256, "loss": 0.20869070291519165, "mean_token_accuracy": 0.9107763916254044, "num_tokens": 83400612.0, "step": 6761 }, { "entropy": 1.1247061789035797, "epoch": 3.5608214849921014, "grad_norm": 0.28411510586738586, "learning_rate": 0.00011186377119901625, "loss": 0.1772649884223938, "mean_token_accuracy": 0.922274649143219, "num_tokens": 83412948.0, "step": 6762 }, { "entropy": 1.091322273015976, "epoch": 3.561348077935756, "grad_norm": 0.30867794156074524, "learning_rate": 0.00011184184755884872, "loss": 0.20318832993507385, "mean_token_accuracy": 0.9137501269578934, "num_tokens": 83425284.0, "step": 6763 }, { "entropy": 1.1086713373661041, "epoch": 3.5618746708794102, "grad_norm": 0.28916677832603455, "learning_rate": 0.00011181992380934144, "loss": 0.18094968795776367, "mean_token_accuracy": 0.9253650158643723, "num_tokens": 83437620.0, "step": 6764 }, { "entropy": 1.0924776494503021, "epoch": 3.5624012638230647, "grad_norm": 0.2812732756137848, "learning_rate": 0.00011179799995179585, "loss": 0.1750286966562271, "mean_token_accuracy": 0.9251724034547806, "num_tokens": 83449956.0, "step": 6765 }, { "entropy": 1.0866563320159912, "epoch": 3.562927856766719, "grad_norm": 0.30919456481933594, "learning_rate": 0.00011177607598751354, "loss": 0.1673109233379364, "mean_token_accuracy": 0.9293659329414368, "num_tokens": 83462292.0, "step": 6766 }, { "entropy": 1.0872103571891785, "epoch": 3.563454449710374, "grad_norm": 0.2803879976272583, "learning_rate": 0.00011175415191779593, "loss": 0.17549145221710205, "mean_token_accuracy": 0.9249834716320038, "num_tokens": 83474628.0, "step": 6767 }, { "entropy": 1.1090264022350311, "epoch": 3.5639810426540284, "grad_norm": 0.295563668012619, "learning_rate": 0.00011173222774394455, "loss": 0.19598843157291412, "mean_token_accuracy": 0.9154873639345169, "num_tokens": 83486964.0, "step": 6768 }, { "entropy": 1.0583168864250183, "epoch": 3.564507635597683, "grad_norm": 0.2749026417732239, "learning_rate": 0.00011171030346726088, "loss": 0.17145390808582306, "mean_token_accuracy": 0.9302745312452316, "num_tokens": 83499300.0, "step": 6769 }, { "entropy": 1.0702010095119476, "epoch": 3.5650342285413377, "grad_norm": 0.2993081510066986, "learning_rate": 0.00011168837908904648, "loss": 0.18920329213142395, "mean_token_accuracy": 0.9198135733604431, "num_tokens": 83511636.0, "step": 6770 }, { "entropy": 1.0419896095991135, "epoch": 3.565560821484992, "grad_norm": 0.31577932834625244, "learning_rate": 0.00011166645461060285, "loss": 0.18755492568016052, "mean_token_accuracy": 0.9221476912498474, "num_tokens": 83523972.0, "step": 6771 }, { "entropy": 1.0922668874263763, "epoch": 3.5660874144286465, "grad_norm": 0.31884366273880005, "learning_rate": 0.00011164453003323152, "loss": 0.191270649433136, "mean_token_accuracy": 0.9214844703674316, "num_tokens": 83536308.0, "step": 6772 }, { "entropy": 1.0515078604221344, "epoch": 3.5666140073723014, "grad_norm": 0.27819815278053284, "learning_rate": 0.00011162260535823404, "loss": 0.17676641047000885, "mean_token_accuracy": 0.9244179129600525, "num_tokens": 83548644.0, "step": 6773 }, { "entropy": 1.076279640197754, "epoch": 3.567140600315956, "grad_norm": 0.3012269139289856, "learning_rate": 0.00011160068058691193, "loss": 0.17410975694656372, "mean_token_accuracy": 0.9300138354301453, "num_tokens": 83560980.0, "step": 6774 }, { "entropy": 1.0549605637788773, "epoch": 3.5676671932596102, "grad_norm": 0.2836728096008301, "learning_rate": 0.00011157875572056673, "loss": 0.177901491522789, "mean_token_accuracy": 0.9266462922096252, "num_tokens": 83573316.0, "step": 6775 }, { "entropy": 1.1353142261505127, "epoch": 3.568193786203265, "grad_norm": 0.28448861837387085, "learning_rate": 0.00011155683076050003, "loss": 0.17505420744419098, "mean_token_accuracy": 0.9255066215991974, "num_tokens": 83585652.0, "step": 6776 }, { "entropy": 1.0923458933830261, "epoch": 3.5687203791469195, "grad_norm": 0.29703381657600403, "learning_rate": 0.00011153490570801333, "loss": 0.1849551647901535, "mean_token_accuracy": 0.9206576198339462, "num_tokens": 83597988.0, "step": 6777 }, { "entropy": 1.1172213554382324, "epoch": 3.569246972090574, "grad_norm": 0.30837827920913696, "learning_rate": 0.00011151298056440825, "loss": 0.19131802022457123, "mean_token_accuracy": 0.9169535785913467, "num_tokens": 83610324.0, "step": 6778 }, { "entropy": 1.1013193428516388, "epoch": 3.5697735650342284, "grad_norm": 0.26760244369506836, "learning_rate": 0.0001114910553309863, "loss": 0.16245457530021667, "mean_token_accuracy": 0.9318066239356995, "num_tokens": 83622660.0, "step": 6779 }, { "entropy": 1.069222867488861, "epoch": 3.5703001579778832, "grad_norm": 0.2659068703651428, "learning_rate": 0.0001114691300090491, "loss": 0.16208085417747498, "mean_token_accuracy": 0.9289850294589996, "num_tokens": 83634996.0, "step": 6780 }, { "entropy": 1.0956320464611053, "epoch": 3.5708267509215377, "grad_norm": 0.319746196269989, "learning_rate": 0.00011144720459989824, "loss": 0.19753004610538483, "mean_token_accuracy": 0.919308990240097, "num_tokens": 83647332.0, "step": 6781 }, { "entropy": 1.081997960805893, "epoch": 3.571353343865192, "grad_norm": 0.2700563371181488, "learning_rate": 0.00011142527910483527, "loss": 0.18001338839530945, "mean_token_accuracy": 0.9277038872241974, "num_tokens": 83659668.0, "step": 6782 }, { "entropy": 1.0502025187015533, "epoch": 3.5718799368088465, "grad_norm": 0.27929866313934326, "learning_rate": 0.00011140335352516179, "loss": 0.1719617396593094, "mean_token_accuracy": 0.9303514063358307, "num_tokens": 83672004.0, "step": 6783 }, { "entropy": 1.0725300312042236, "epoch": 3.5724065297525014, "grad_norm": 0.3040179908275604, "learning_rate": 0.00011138142786217936, "loss": 0.19116222858428955, "mean_token_accuracy": 0.9210270047187805, "num_tokens": 83684340.0, "step": 6784 }, { "entropy": 1.0981976985931396, "epoch": 3.572933122696156, "grad_norm": 0.2722747325897217, "learning_rate": 0.00011135950211718961, "loss": 0.1681644171476364, "mean_token_accuracy": 0.9292253851890564, "num_tokens": 83696676.0, "step": 6785 }, { "entropy": 1.1399394571781158, "epoch": 3.5734597156398102, "grad_norm": 0.30738040804862976, "learning_rate": 0.00011133757629149417, "loss": 0.1938926875591278, "mean_token_accuracy": 0.9183665215969086, "num_tokens": 83709012.0, "step": 6786 }, { "entropy": 1.0733324587345123, "epoch": 3.573986308583465, "grad_norm": 0.2664124369621277, "learning_rate": 0.00011131565038639462, "loss": 0.16366492211818695, "mean_token_accuracy": 0.9280208200216293, "num_tokens": 83721348.0, "step": 6787 }, { "entropy": 1.070346713066101, "epoch": 3.5745129015271195, "grad_norm": 0.2684425413608551, "learning_rate": 0.00011129372440319256, "loss": 0.17055614292621613, "mean_token_accuracy": 0.9309419095516205, "num_tokens": 83733684.0, "step": 6788 }, { "entropy": 1.1445283591747284, "epoch": 3.575039494470774, "grad_norm": 0.30912500619888306, "learning_rate": 0.00011127179834318964, "loss": 0.18295526504516602, "mean_token_accuracy": 0.9247478097677231, "num_tokens": 83746020.0, "step": 6789 }, { "entropy": 1.1068629920482635, "epoch": 3.575566087414429, "grad_norm": 0.3023226857185364, "learning_rate": 0.00011124987220768743, "loss": 0.18361878395080566, "mean_token_accuracy": 0.9251338094472885, "num_tokens": 83758356.0, "step": 6790 }, { "entropy": 1.0960930585861206, "epoch": 3.5760926803580833, "grad_norm": 0.32193610072135925, "learning_rate": 0.00011122794599798765, "loss": 0.1902855485677719, "mean_token_accuracy": 0.9249085038900375, "num_tokens": 83770692.0, "step": 6791 }, { "entropy": 1.102184534072876, "epoch": 3.5766192733017377, "grad_norm": 0.30219942331314087, "learning_rate": 0.00011120601971539184, "loss": 0.18872946500778198, "mean_token_accuracy": 0.9205964207649231, "num_tokens": 83783028.0, "step": 6792 }, { "entropy": 1.0089440494775772, "epoch": 3.5771458662453925, "grad_norm": 0.2962239980697632, "learning_rate": 0.00011118409336120163, "loss": 0.17877568304538727, "mean_token_accuracy": 0.9258351624011993, "num_tokens": 83795364.0, "step": 6793 }, { "entropy": 1.0831408500671387, "epoch": 3.577672459189047, "grad_norm": 0.3217921853065491, "learning_rate": 0.00011116216693671875, "loss": 0.19278764724731445, "mean_token_accuracy": 0.9192754030227661, "num_tokens": 83807700.0, "step": 6794 }, { "entropy": 1.0765918493270874, "epoch": 3.5781990521327014, "grad_norm": 0.3078082203865051, "learning_rate": 0.00011114024044324478, "loss": 0.18732166290283203, "mean_token_accuracy": 0.9194670766592026, "num_tokens": 83820036.0, "step": 6795 }, { "entropy": 1.0819332301616669, "epoch": 3.578725645076356, "grad_norm": 0.3063753545284271, "learning_rate": 0.00011111831388208138, "loss": 0.18549399077892303, "mean_token_accuracy": 0.9213854074478149, "num_tokens": 83832372.0, "step": 6796 }, { "entropy": 1.051520049571991, "epoch": 3.5792522380200107, "grad_norm": 0.30566105246543884, "learning_rate": 0.0001110963872545302, "loss": 0.18486547470092773, "mean_token_accuracy": 0.9276604950428009, "num_tokens": 83844708.0, "step": 6797 }, { "entropy": 1.0421344339847565, "epoch": 3.579778830963665, "grad_norm": 0.27134665846824646, "learning_rate": 0.00011107446056189292, "loss": 0.16037064790725708, "mean_token_accuracy": 0.9303885400295258, "num_tokens": 83857044.0, "step": 6798 }, { "entropy": 1.0744150280952454, "epoch": 3.5803054239073195, "grad_norm": 0.29975277185440063, "learning_rate": 0.00011105253380547116, "loss": 0.17214947938919067, "mean_token_accuracy": 0.9243510961532593, "num_tokens": 83869380.0, "step": 6799 }, { "entropy": 1.0933693647384644, "epoch": 3.580832016850974, "grad_norm": 0.3158538341522217, "learning_rate": 0.00011103060698656657, "loss": 0.17609092593193054, "mean_token_accuracy": 0.9244079291820526, "num_tokens": 83881716.0, "step": 6800 }, { "entropy": 1.0673887133598328, "epoch": 3.581358609794629, "grad_norm": 0.31816163659095764, "learning_rate": 0.00011100868010648092, "loss": 0.18575707077980042, "mean_token_accuracy": 0.922477513551712, "num_tokens": 83894052.0, "step": 6801 }, { "entropy": 1.1075579822063446, "epoch": 3.5818852027382833, "grad_norm": 0.3141384720802307, "learning_rate": 0.00011098675316651576, "loss": 0.19477181136608124, "mean_token_accuracy": 0.9194188117980957, "num_tokens": 83906388.0, "step": 6802 }, { "entropy": 1.083218827843666, "epoch": 3.5824117956819377, "grad_norm": 0.27618029713630676, "learning_rate": 0.00011096482616797284, "loss": 0.16593825817108154, "mean_token_accuracy": 0.9309423565864563, "num_tokens": 83918724.0, "step": 6803 }, { "entropy": 1.099007934331894, "epoch": 3.5829383886255926, "grad_norm": 0.2944222688674927, "learning_rate": 0.00011094289911215377, "loss": 0.18428628146648407, "mean_token_accuracy": 0.9252902120351791, "num_tokens": 83931060.0, "step": 6804 }, { "entropy": 1.068886861205101, "epoch": 3.583464981569247, "grad_norm": 0.28556880354881287, "learning_rate": 0.00011092097200036032, "loss": 0.17528092861175537, "mean_token_accuracy": 0.9258764088153839, "num_tokens": 83943396.0, "step": 6805 }, { "entropy": 1.0801942050457, "epoch": 3.5839915745129014, "grad_norm": 0.2890860140323639, "learning_rate": 0.00011089904483389415, "loss": 0.17374573647975922, "mean_token_accuracy": 0.9233235269784927, "num_tokens": 83955732.0, "step": 6806 }, { "entropy": 1.1448765099048615, "epoch": 3.5845181674565563, "grad_norm": 0.30026209354400635, "learning_rate": 0.00011087711761405688, "loss": 0.18570362031459808, "mean_token_accuracy": 0.9220779836177826, "num_tokens": 83968068.0, "step": 6807 }, { "entropy": 1.0914206057786942, "epoch": 3.5850447604002107, "grad_norm": 0.2962283492088318, "learning_rate": 0.00011085519034215027, "loss": 0.18485112488269806, "mean_token_accuracy": 0.9181759804487228, "num_tokens": 83980404.0, "step": 6808 }, { "entropy": 1.117035686969757, "epoch": 3.585571353343865, "grad_norm": 0.29223090410232544, "learning_rate": 0.00011083326301947599, "loss": 0.18125474452972412, "mean_token_accuracy": 0.9249403476715088, "num_tokens": 83992740.0, "step": 6809 }, { "entropy": 1.115389347076416, "epoch": 3.58609794628752, "grad_norm": 0.3016378581523895, "learning_rate": 0.00011081133564733572, "loss": 0.1807543933391571, "mean_token_accuracy": 0.9210816323757172, "num_tokens": 84005076.0, "step": 6810 }, { "entropy": 1.0712342858314514, "epoch": 3.5866245392311744, "grad_norm": 0.2989068925380707, "learning_rate": 0.00011078940822703121, "loss": 0.18486231565475464, "mean_token_accuracy": 0.9215465188026428, "num_tokens": 84017412.0, "step": 6811 }, { "entropy": 1.0903160274028778, "epoch": 3.587151132174829, "grad_norm": 0.27834755182266235, "learning_rate": 0.00011076748075986413, "loss": 0.18570701777935028, "mean_token_accuracy": 0.9223471432924271, "num_tokens": 84029748.0, "step": 6812 }, { "entropy": 1.0887775719165802, "epoch": 3.5876777251184833, "grad_norm": 0.3086070716381073, "learning_rate": 0.0001107455532471362, "loss": 0.2004110962152481, "mean_token_accuracy": 0.9159822016954422, "num_tokens": 84042084.0, "step": 6813 }, { "entropy": 1.0728232264518738, "epoch": 3.588204318062138, "grad_norm": 0.2820192873477936, "learning_rate": 0.0001107236256901491, "loss": 0.17461654543876648, "mean_token_accuracy": 0.925453782081604, "num_tokens": 84054420.0, "step": 6814 }, { "entropy": 1.0823879539966583, "epoch": 3.5887309110057926, "grad_norm": 0.2939518392086029, "learning_rate": 0.00011070169809020456, "loss": 0.1872849017381668, "mean_token_accuracy": 0.9165738672018051, "num_tokens": 84066756.0, "step": 6815 }, { "entropy": 1.1180018484592438, "epoch": 3.589257503949447, "grad_norm": 0.2900797128677368, "learning_rate": 0.00011067977044860432, "loss": 0.18645426630973816, "mean_token_accuracy": 0.9243784248828888, "num_tokens": 84079092.0, "step": 6816 }, { "entropy": 1.0934679508209229, "epoch": 3.5897840968931014, "grad_norm": 0.2787036895751953, "learning_rate": 0.00011065784276665005, "loss": 0.16626539826393127, "mean_token_accuracy": 0.9302684217691422, "num_tokens": 84091428.0, "step": 6817 }, { "entropy": 1.0777550637722015, "epoch": 3.5903106898367563, "grad_norm": 0.29463809728622437, "learning_rate": 0.00011063591504564348, "loss": 0.18691596388816833, "mean_token_accuracy": 0.922309547662735, "num_tokens": 84103764.0, "step": 6818 }, { "entropy": 1.0706429183483124, "epoch": 3.5908372827804107, "grad_norm": 0.29603153467178345, "learning_rate": 0.00011061398728688634, "loss": 0.18845272064208984, "mean_token_accuracy": 0.9194611012935638, "num_tokens": 84116100.0, "step": 6819 }, { "entropy": 1.0385090708732605, "epoch": 3.591363875724065, "grad_norm": 0.2972482442855835, "learning_rate": 0.00011059205949168037, "loss": 0.19239693880081177, "mean_token_accuracy": 0.9183678478002548, "num_tokens": 84128436.0, "step": 6820 }, { "entropy": 1.1171515882015228, "epoch": 3.59189046866772, "grad_norm": 0.2884787321090698, "learning_rate": 0.00011057013166132729, "loss": 0.17812785506248474, "mean_token_accuracy": 0.9246303290128708, "num_tokens": 84140772.0, "step": 6821 }, { "entropy": 1.0698346197605133, "epoch": 3.5924170616113744, "grad_norm": 0.27562543749809265, "learning_rate": 0.0001105482037971288, "loss": 0.16333125531673431, "mean_token_accuracy": 0.9276170432567596, "num_tokens": 84153108.0, "step": 6822 }, { "entropy": 1.105311542749405, "epoch": 3.592943654555029, "grad_norm": 0.3589690327644348, "learning_rate": 0.00011052627590038665, "loss": 0.19951340556144714, "mean_token_accuracy": 0.9194656014442444, "num_tokens": 84165444.0, "step": 6823 }, { "entropy": 1.056771695613861, "epoch": 3.5934702474986837, "grad_norm": 0.31134459376335144, "learning_rate": 0.00011050434797240257, "loss": 0.18938994407653809, "mean_token_accuracy": 0.9203962981700897, "num_tokens": 84177780.0, "step": 6824 }, { "entropy": 1.0244185477495193, "epoch": 3.593996840442338, "grad_norm": 0.31450948119163513, "learning_rate": 0.00011048242001447827, "loss": 0.20221704244613647, "mean_token_accuracy": 0.9144396930932999, "num_tokens": 84190116.0, "step": 6825 }, { "entropy": 1.0762320160865784, "epoch": 3.5945234333859926, "grad_norm": 0.27855023741722107, "learning_rate": 0.00011046049202791553, "loss": 0.1769963800907135, "mean_token_accuracy": 0.9241359382867813, "num_tokens": 84202452.0, "step": 6826 }, { "entropy": 1.0686099827289581, "epoch": 3.5950500263296474, "grad_norm": 0.3128301203250885, "learning_rate": 0.00011043856401401605, "loss": 0.1926872730255127, "mean_token_accuracy": 0.917589545249939, "num_tokens": 84214788.0, "step": 6827 }, { "entropy": 1.1129842102527618, "epoch": 3.595576619273302, "grad_norm": 0.2821250259876251, "learning_rate": 0.00011041663597408157, "loss": 0.18698513507843018, "mean_token_accuracy": 0.925433337688446, "num_tokens": 84227124.0, "step": 6828 }, { "entropy": 1.0851635932922363, "epoch": 3.5961032122169563, "grad_norm": 0.29759037494659424, "learning_rate": 0.00011039470790941384, "loss": 0.17480885982513428, "mean_token_accuracy": 0.9230799973011017, "num_tokens": 84239460.0, "step": 6829 }, { "entropy": 1.0806046724319458, "epoch": 3.5966298051606107, "grad_norm": 0.28347960114479065, "learning_rate": 0.00011037277982131463, "loss": 0.187611386179924, "mean_token_accuracy": 0.918888509273529, "num_tokens": 84251796.0, "step": 6830 }, { "entropy": 1.04977385699749, "epoch": 3.597156398104265, "grad_norm": 0.2821602523326874, "learning_rate": 0.00011035085171108565, "loss": 0.18557719886302948, "mean_token_accuracy": 0.9250794351100922, "num_tokens": 84264132.0, "step": 6831 }, { "entropy": 1.0975022614002228, "epoch": 3.59768299104792, "grad_norm": 0.29911336302757263, "learning_rate": 0.00011032892358002862, "loss": 0.17656078934669495, "mean_token_accuracy": 0.9215593487024307, "num_tokens": 84276468.0, "step": 6832 }, { "entropy": 1.1453993022441864, "epoch": 3.5982095839915744, "grad_norm": 0.2856663167476654, "learning_rate": 0.00011030699542944533, "loss": 0.17330417037010193, "mean_token_accuracy": 0.9261975884437561, "num_tokens": 84288804.0, "step": 6833 }, { "entropy": 1.0889165699481964, "epoch": 3.598736176935229, "grad_norm": 0.2788821756839752, "learning_rate": 0.00011028506726063752, "loss": 0.17634747922420502, "mean_token_accuracy": 0.9255717843770981, "num_tokens": 84301140.0, "step": 6834 }, { "entropy": 1.0964802503585815, "epoch": 3.5992627698788837, "grad_norm": 0.28933143615722656, "learning_rate": 0.00011026313907490693, "loss": 0.1901606321334839, "mean_token_accuracy": 0.9201119393110275, "num_tokens": 84313476.0, "step": 6835 }, { "entropy": 1.1324889659881592, "epoch": 3.599789362822538, "grad_norm": 0.2915611267089844, "learning_rate": 0.00011024121087355527, "loss": 0.1741735190153122, "mean_token_accuracy": 0.9331314861774445, "num_tokens": 84325812.0, "step": 6836 }, { "entropy": 1.0679437518119812, "epoch": 3.6003159557661926, "grad_norm": 0.3005986511707306, "learning_rate": 0.0001102192826578844, "loss": 0.18817023932933807, "mean_token_accuracy": 0.9224089980125427, "num_tokens": 84338148.0, "step": 6837 }, { "entropy": 1.0960251837968826, "epoch": 3.6008425487098474, "grad_norm": 0.2999762296676636, "learning_rate": 0.00011019735442919594, "loss": 0.18257468938827515, "mean_token_accuracy": 0.9245083183050156, "num_tokens": 84350484.0, "step": 6838 }, { "entropy": 1.0532985776662827, "epoch": 3.601369141653502, "grad_norm": 0.31091398000717163, "learning_rate": 0.00011017542618879166, "loss": 0.18717285990715027, "mean_token_accuracy": 0.9183699786663055, "num_tokens": 84362820.0, "step": 6839 }, { "entropy": 1.0669248700141907, "epoch": 3.6018957345971563, "grad_norm": 0.31256037950515747, "learning_rate": 0.00011015349793797345, "loss": 0.17956934869289398, "mean_token_accuracy": 0.9235763698816299, "num_tokens": 84375156.0, "step": 6840 }, { "entropy": 1.1000414490699768, "epoch": 3.602422327540811, "grad_norm": 0.3200954794883728, "learning_rate": 0.0001101315696780429, "loss": 0.18431906402111053, "mean_token_accuracy": 0.9205802828073502, "num_tokens": 84387492.0, "step": 6841 }, { "entropy": 1.0772568136453629, "epoch": 3.6029489204844656, "grad_norm": 0.2726421356201172, "learning_rate": 0.00011010964141030182, "loss": 0.16852417588233948, "mean_token_accuracy": 0.92500339448452, "num_tokens": 84399828.0, "step": 6842 }, { "entropy": 1.0504442304372787, "epoch": 3.60347551342812, "grad_norm": 0.2797470688819885, "learning_rate": 0.00011008771313605199, "loss": 0.17749673128128052, "mean_token_accuracy": 0.9265327602624893, "num_tokens": 84412164.0, "step": 6843 }, { "entropy": 1.098019003868103, "epoch": 3.604002106371775, "grad_norm": 0.3110448718070984, "learning_rate": 0.00011006578485659513, "loss": 0.18846482038497925, "mean_token_accuracy": 0.92154660820961, "num_tokens": 84424500.0, "step": 6844 }, { "entropy": 1.0312111526727676, "epoch": 3.6045286993154293, "grad_norm": 0.30218741297721863, "learning_rate": 0.00011004385657323301, "loss": 0.19102369248867035, "mean_token_accuracy": 0.9235749393701553, "num_tokens": 84436836.0, "step": 6845 }, { "entropy": 1.0944945514202118, "epoch": 3.6050552922590837, "grad_norm": 0.3308318853378296, "learning_rate": 0.0001100219282872674, "loss": 0.17298060655593872, "mean_token_accuracy": 0.928741455078125, "num_tokens": 84449172.0, "step": 6846 }, { "entropy": 1.0642427206039429, "epoch": 3.605581885202738, "grad_norm": 0.28731769323349, "learning_rate": 0.00011000000000000002, "loss": 0.1798696517944336, "mean_token_accuracy": 0.9239630848169327, "num_tokens": 84461508.0, "step": 6847 }, { "entropy": 1.123925805091858, "epoch": 3.6061084781463926, "grad_norm": 0.3246334195137024, "learning_rate": 0.00010997807171273265, "loss": 0.1852877140045166, "mean_token_accuracy": 0.9206551760435104, "num_tokens": 84473844.0, "step": 6848 }, { "entropy": 1.086002677679062, "epoch": 3.6066350710900474, "grad_norm": 0.281442254781723, "learning_rate": 0.000109956143426767, "loss": 0.1753401905298233, "mean_token_accuracy": 0.9272176027297974, "num_tokens": 84486180.0, "step": 6849 }, { "entropy": 1.0604727566242218, "epoch": 3.607161664033702, "grad_norm": 0.2794533967971802, "learning_rate": 0.00010993421514340489, "loss": 0.16479840874671936, "mean_token_accuracy": 0.9340286701917648, "num_tokens": 84498516.0, "step": 6850 }, { "entropy": 1.067774474620819, "epoch": 3.6076882569773563, "grad_norm": 0.2668810784816742, "learning_rate": 0.00010991228686394802, "loss": 0.1580381691455841, "mean_token_accuracy": 0.9306191056966782, "num_tokens": 84510852.0, "step": 6851 }, { "entropy": 1.0851312279701233, "epoch": 3.608214849921011, "grad_norm": 0.2869192659854889, "learning_rate": 0.00010989035858969818, "loss": 0.1692989021539688, "mean_token_accuracy": 0.9321866929531097, "num_tokens": 84523188.0, "step": 6852 }, { "entropy": 1.0702165961265564, "epoch": 3.6087414428646656, "grad_norm": 0.32713115215301514, "learning_rate": 0.00010986843032195713, "loss": 0.1853421926498413, "mean_token_accuracy": 0.9256032258272171, "num_tokens": 84535524.0, "step": 6853 }, { "entropy": 1.063175618648529, "epoch": 3.60926803580832, "grad_norm": 0.31001904606819153, "learning_rate": 0.00010984650206202657, "loss": 0.16657377779483795, "mean_token_accuracy": 0.9314382374286652, "num_tokens": 84547860.0, "step": 6854 }, { "entropy": 1.0820069909095764, "epoch": 3.609794628751975, "grad_norm": 0.2937212586402893, "learning_rate": 0.00010982457381120834, "loss": 0.17677544057369232, "mean_token_accuracy": 0.9208458214998245, "num_tokens": 84560196.0, "step": 6855 }, { "entropy": 1.0830555260181427, "epoch": 3.6103212216956293, "grad_norm": 0.32006511092185974, "learning_rate": 0.0001098026455708041, "loss": 0.19498637318611145, "mean_token_accuracy": 0.9215183705091476, "num_tokens": 84572532.0, "step": 6856 }, { "entropy": 1.0698910057544708, "epoch": 3.6108478146392837, "grad_norm": 0.28908658027648926, "learning_rate": 0.00010978071734211566, "loss": 0.19524383544921875, "mean_token_accuracy": 0.9204393923282623, "num_tokens": 84584868.0, "step": 6857 }, { "entropy": 1.0425672829151154, "epoch": 3.6113744075829386, "grad_norm": 0.28950250148773193, "learning_rate": 0.0001097587891264447, "loss": 0.1864977329969406, "mean_token_accuracy": 0.9201027452945709, "num_tokens": 84597204.0, "step": 6858 }, { "entropy": 1.1237571835517883, "epoch": 3.611901000526593, "grad_norm": 0.30378156900405884, "learning_rate": 0.0001097368609250931, "loss": 0.17740464210510254, "mean_token_accuracy": 0.9226698577404022, "num_tokens": 84609540.0, "step": 6859 }, { "entropy": 1.0304887294769287, "epoch": 3.6124275934702474, "grad_norm": 0.28008705377578735, "learning_rate": 0.00010971493273936251, "loss": 0.19065578281879425, "mean_token_accuracy": 0.9184155315160751, "num_tokens": 84621876.0, "step": 6860 }, { "entropy": 1.0502332746982574, "epoch": 3.6129541864139023, "grad_norm": 0.3209384083747864, "learning_rate": 0.00010969300457055469, "loss": 0.20223379135131836, "mean_token_accuracy": 0.9163955748081207, "num_tokens": 84634212.0, "step": 6861 }, { "entropy": 1.0601438879966736, "epoch": 3.6134807793575567, "grad_norm": 0.32106125354766846, "learning_rate": 0.00010967107641997141, "loss": 0.184079110622406, "mean_token_accuracy": 0.9217220991849899, "num_tokens": 84646548.0, "step": 6862 }, { "entropy": 1.071303516626358, "epoch": 3.614007372301211, "grad_norm": 0.28086385130882263, "learning_rate": 0.0001096491482889144, "loss": 0.1744384467601776, "mean_token_accuracy": 0.9287065863609314, "num_tokens": 84658884.0, "step": 6863 }, { "entropy": 1.091096580028534, "epoch": 3.6145339652448656, "grad_norm": 0.28602415323257446, "learning_rate": 0.00010962722017868541, "loss": 0.19257156550884247, "mean_token_accuracy": 0.9204146265983582, "num_tokens": 84671220.0, "step": 6864 }, { "entropy": 1.0848321914672852, "epoch": 3.61506055818852, "grad_norm": 0.2787522077560425, "learning_rate": 0.00010960529209058617, "loss": 0.18023037910461426, "mean_token_accuracy": 0.9271013885736465, "num_tokens": 84683556.0, "step": 6865 }, { "entropy": 1.1429481208324432, "epoch": 3.615587151132175, "grad_norm": 0.30959388613700867, "learning_rate": 0.00010958336402591844, "loss": 0.1963968276977539, "mean_token_accuracy": 0.9185330718755722, "num_tokens": 84695892.0, "step": 6866 }, { "entropy": 1.1271454393863678, "epoch": 3.6161137440758293, "grad_norm": 0.29112374782562256, "learning_rate": 0.00010956143598598399, "loss": 0.18528416752815247, "mean_token_accuracy": 0.9206521213054657, "num_tokens": 84708228.0, "step": 6867 }, { "entropy": 1.081824392080307, "epoch": 3.6166403370194837, "grad_norm": 0.2598550617694855, "learning_rate": 0.0001095395079720845, "loss": 0.16786476969718933, "mean_token_accuracy": 0.9285723119974136, "num_tokens": 84720564.0, "step": 6868 }, { "entropy": 1.068942368030548, "epoch": 3.6171669299631386, "grad_norm": 0.28704607486724854, "learning_rate": 0.00010951757998552174, "loss": 0.19206884503364563, "mean_token_accuracy": 0.9195718169212341, "num_tokens": 84732900.0, "step": 6869 }, { "entropy": 1.0923133790493011, "epoch": 3.617693522906793, "grad_norm": 0.27027350664138794, "learning_rate": 0.00010949565202759749, "loss": 0.17678622901439667, "mean_token_accuracy": 0.9282222241163254, "num_tokens": 84745236.0, "step": 6870 }, { "entropy": 1.155369907617569, "epoch": 3.6182201158504474, "grad_norm": 0.2801276743412018, "learning_rate": 0.0001094737240996134, "loss": 0.1720304787158966, "mean_token_accuracy": 0.9314807504415512, "num_tokens": 84757572.0, "step": 6871 }, { "entropy": 1.0734200477600098, "epoch": 3.6187467087941023, "grad_norm": 0.2531544864177704, "learning_rate": 0.0001094517962028712, "loss": 0.17671561241149902, "mean_token_accuracy": 0.9305606037378311, "num_tokens": 84769908.0, "step": 6872 }, { "entropy": 1.0713300704956055, "epoch": 3.6192733017377567, "grad_norm": 0.2790954113006592, "learning_rate": 0.00010942986833867272, "loss": 0.18087071180343628, "mean_token_accuracy": 0.9217016994953156, "num_tokens": 84782244.0, "step": 6873 }, { "entropy": 1.0994652807712555, "epoch": 3.619799894681411, "grad_norm": 0.3021692633628845, "learning_rate": 0.00010940794050831964, "loss": 0.18766359984874725, "mean_token_accuracy": 0.9191304445266724, "num_tokens": 84794580.0, "step": 6874 }, { "entropy": 1.0470281392335892, "epoch": 3.620326487625066, "grad_norm": 0.2776238024234772, "learning_rate": 0.00010938601271311368, "loss": 0.17030346393585205, "mean_token_accuracy": 0.9237184375524521, "num_tokens": 84806916.0, "step": 6875 }, { "entropy": 1.0921571552753448, "epoch": 3.6208530805687205, "grad_norm": 0.284041166305542, "learning_rate": 0.00010936408495435654, "loss": 0.16998879611492157, "mean_token_accuracy": 0.9288204312324524, "num_tokens": 84819252.0, "step": 6876 }, { "entropy": 1.0739878714084625, "epoch": 3.621379673512375, "grad_norm": 0.2863426208496094, "learning_rate": 0.00010934215723335, "loss": 0.1693313866853714, "mean_token_accuracy": 0.9308694303035736, "num_tokens": 84831588.0, "step": 6877 }, { "entropy": 1.072409301996231, "epoch": 3.6219062664560298, "grad_norm": 0.2869056463241577, "learning_rate": 0.00010932022955139572, "loss": 0.18741311132907867, "mean_token_accuracy": 0.9215927571058273, "num_tokens": 84843924.0, "step": 6878 }, { "entropy": 1.1229929625988007, "epoch": 3.622432859399684, "grad_norm": 0.3232174813747406, "learning_rate": 0.00010929830190979545, "loss": 0.19894477725028992, "mean_token_accuracy": 0.9182947725057602, "num_tokens": 84856260.0, "step": 6879 }, { "entropy": 1.0645553469657898, "epoch": 3.6229594523433386, "grad_norm": 0.26264068484306335, "learning_rate": 0.00010927637430985091, "loss": 0.16409020125865936, "mean_token_accuracy": 0.9330554455518723, "num_tokens": 84868596.0, "step": 6880 }, { "entropy": 1.0455782115459442, "epoch": 3.623486045286993, "grad_norm": 0.3416646718978882, "learning_rate": 0.00010925444675286382, "loss": 0.21813735365867615, "mean_token_accuracy": 0.9076962023973465, "num_tokens": 84880932.0, "step": 6881 }, { "entropy": 1.076392948627472, "epoch": 3.6240126382306475, "grad_norm": 0.30169451236724854, "learning_rate": 0.00010923251924013589, "loss": 0.17133498191833496, "mean_token_accuracy": 0.9298492968082428, "num_tokens": 84893268.0, "step": 6882 }, { "entropy": 1.0720700770616531, "epoch": 3.6245392311743023, "grad_norm": 0.29317283630371094, "learning_rate": 0.0001092105917729688, "loss": 0.16995534300804138, "mean_token_accuracy": 0.9279211014509201, "num_tokens": 84905604.0, "step": 6883 }, { "entropy": 1.0382179468870163, "epoch": 3.6250658241179567, "grad_norm": 0.2807539701461792, "learning_rate": 0.00010918866435266428, "loss": 0.158788800239563, "mean_token_accuracy": 0.9308933913707733, "num_tokens": 84917940.0, "step": 6884 }, { "entropy": 1.0360213816165924, "epoch": 3.625592417061611, "grad_norm": 0.2820185124874115, "learning_rate": 0.00010916673698052407, "loss": 0.17735148966312408, "mean_token_accuracy": 0.9254759401082993, "num_tokens": 84930276.0, "step": 6885 }, { "entropy": 1.0321247577667236, "epoch": 3.626119010005266, "grad_norm": 0.277366042137146, "learning_rate": 0.00010914480965784974, "loss": 0.16998949646949768, "mean_token_accuracy": 0.9264341443777084, "num_tokens": 84942612.0, "step": 6886 }, { "entropy": 1.11885204911232, "epoch": 3.6266456029489205, "grad_norm": 0.3434223532676697, "learning_rate": 0.00010912288238594312, "loss": 0.19510222971439362, "mean_token_accuracy": 0.9249685257673264, "num_tokens": 84954948.0, "step": 6887 }, { "entropy": 1.0723938047885895, "epoch": 3.627172195892575, "grad_norm": 0.33464300632476807, "learning_rate": 0.00010910095516610587, "loss": 0.18581683933734894, "mean_token_accuracy": 0.9200177937746048, "num_tokens": 84967284.0, "step": 6888 }, { "entropy": 1.0627216696739197, "epoch": 3.6276987888362298, "grad_norm": 0.29970863461494446, "learning_rate": 0.00010907902799963972, "loss": 0.1742255538702011, "mean_token_accuracy": 0.9224542528390884, "num_tokens": 84979620.0, "step": 6889 }, { "entropy": 1.0519684851169586, "epoch": 3.628225381779884, "grad_norm": 0.3227628767490387, "learning_rate": 0.00010905710088784624, "loss": 0.18886661529541016, "mean_token_accuracy": 0.9240933060646057, "num_tokens": 84991956.0, "step": 6890 }, { "entropy": 1.0896053314208984, "epoch": 3.6287519747235386, "grad_norm": 0.2841867208480835, "learning_rate": 0.00010903517383202721, "loss": 0.17191782593727112, "mean_token_accuracy": 0.9256446659564972, "num_tokens": 85004292.0, "step": 6891 }, { "entropy": 1.0260752737522125, "epoch": 3.6292785676671935, "grad_norm": 0.2733602821826935, "learning_rate": 0.00010901324683348428, "loss": 0.1687346249818802, "mean_token_accuracy": 0.9257003366947174, "num_tokens": 85016628.0, "step": 6892 }, { "entropy": 1.071472853422165, "epoch": 3.629805160610848, "grad_norm": 0.31747159361839294, "learning_rate": 0.00010899131989351912, "loss": 0.18207454681396484, "mean_token_accuracy": 0.92514668405056, "num_tokens": 85028964.0, "step": 6893 }, { "entropy": 1.1075446009635925, "epoch": 3.6303317535545023, "grad_norm": 0.28832435607910156, "learning_rate": 0.00010896939301343344, "loss": 0.16811193525791168, "mean_token_accuracy": 0.9267793744802475, "num_tokens": 85041300.0, "step": 6894 }, { "entropy": 1.0397011488676071, "epoch": 3.630858346498157, "grad_norm": 0.2771309018135071, "learning_rate": 0.00010894746619452888, "loss": 0.16865265369415283, "mean_token_accuracy": 0.9260818362236023, "num_tokens": 85053636.0, "step": 6895 }, { "entropy": 1.058392345905304, "epoch": 3.6313849394418116, "grad_norm": 0.3174492120742798, "learning_rate": 0.0001089255394381071, "loss": 0.17661213874816895, "mean_token_accuracy": 0.9262597411870956, "num_tokens": 85065972.0, "step": 6896 }, { "entropy": 1.0779773145914078, "epoch": 3.631911532385466, "grad_norm": 0.2963669002056122, "learning_rate": 0.00010890361274546983, "loss": 0.18939608335494995, "mean_token_accuracy": 0.9218048602342606, "num_tokens": 85078308.0, "step": 6897 }, { "entropy": 1.0529873967170715, "epoch": 3.6324381253291205, "grad_norm": 0.2809640169143677, "learning_rate": 0.00010888168611791864, "loss": 0.187717467546463, "mean_token_accuracy": 0.9181215912103653, "num_tokens": 85090644.0, "step": 6898 }, { "entropy": 1.08050075173378, "epoch": 3.632964718272775, "grad_norm": 0.29269665479660034, "learning_rate": 0.00010885975955675524, "loss": 0.18015234172344208, "mean_token_accuracy": 0.9219858050346375, "num_tokens": 85102980.0, "step": 6899 }, { "entropy": 1.1340832561254501, "epoch": 3.6334913112164298, "grad_norm": 0.29490646719932556, "learning_rate": 0.00010883783306328126, "loss": 0.18035733699798584, "mean_token_accuracy": 0.9175348877906799, "num_tokens": 85115316.0, "step": 6900 }, { "entropy": 1.078901320695877, "epoch": 3.634017904160084, "grad_norm": 0.2814980149269104, "learning_rate": 0.00010881590663879837, "loss": 0.17936724424362183, "mean_token_accuracy": 0.9242068231105804, "num_tokens": 85127652.0, "step": 6901 }, { "entropy": 1.0839639902114868, "epoch": 3.6345444971037386, "grad_norm": 0.2766796946525574, "learning_rate": 0.0001087939802846082, "loss": 0.18048717081546783, "mean_token_accuracy": 0.9242569804191589, "num_tokens": 85139988.0, "step": 6902 }, { "entropy": 1.0977406799793243, "epoch": 3.6350710900473935, "grad_norm": 0.28339245915412903, "learning_rate": 0.00010877205400201238, "loss": 0.17970004677772522, "mean_token_accuracy": 0.9218273609876633, "num_tokens": 85152324.0, "step": 6903 }, { "entropy": 1.0731355249881744, "epoch": 3.635597682991048, "grad_norm": 0.29195013642311096, "learning_rate": 0.0001087501277923126, "loss": 0.19581443071365356, "mean_token_accuracy": 0.9157865047454834, "num_tokens": 85164660.0, "step": 6904 }, { "entropy": 1.0776561498641968, "epoch": 3.6361242759347023, "grad_norm": 0.27677494287490845, "learning_rate": 0.00010872820165681041, "loss": 0.17254780232906342, "mean_token_accuracy": 0.9247097820043564, "num_tokens": 85176996.0, "step": 6905 }, { "entropy": 1.0955494940280914, "epoch": 3.636650868878357, "grad_norm": 0.2864554226398468, "learning_rate": 0.00010870627559680749, "loss": 0.1892591416835785, "mean_token_accuracy": 0.9218159466981888, "num_tokens": 85189332.0, "step": 6906 }, { "entropy": 1.1011942327022552, "epoch": 3.6371774618220116, "grad_norm": 0.279434472322464, "learning_rate": 0.00010868434961360539, "loss": 0.1690611094236374, "mean_token_accuracy": 0.9287009537220001, "num_tokens": 85201668.0, "step": 6907 }, { "entropy": 1.1294350922107697, "epoch": 3.637704054765666, "grad_norm": 0.3198857307434082, "learning_rate": 0.00010866242370850586, "loss": 0.19883982837200165, "mean_token_accuracy": 0.9200601279735565, "num_tokens": 85214004.0, "step": 6908 }, { "entropy": 1.1131604313850403, "epoch": 3.638230647709321, "grad_norm": 0.28839418292045593, "learning_rate": 0.00010864049788281041, "loss": 0.18458659946918488, "mean_token_accuracy": 0.9204800724983215, "num_tokens": 85226340.0, "step": 6909 }, { "entropy": 1.1100212335586548, "epoch": 3.6387572406529753, "grad_norm": 0.2910570502281189, "learning_rate": 0.00010861857213782068, "loss": 0.16764257848262787, "mean_token_accuracy": 0.9310833513736725, "num_tokens": 85238676.0, "step": 6910 }, { "entropy": 1.0589947998523712, "epoch": 3.6392838335966298, "grad_norm": 0.27973130345344543, "learning_rate": 0.00010859664647483825, "loss": 0.1870989054441452, "mean_token_accuracy": 0.9192935824394226, "num_tokens": 85251012.0, "step": 6911 }, { "entropy": 1.0890919864177704, "epoch": 3.639810426540284, "grad_norm": 0.31354379653930664, "learning_rate": 0.00010857472089516476, "loss": 0.19124506413936615, "mean_token_accuracy": 0.9161752760410309, "num_tokens": 85263348.0, "step": 6912 }, { "entropy": 1.1142856180667877, "epoch": 3.640337019483939, "grad_norm": 0.2831694483757019, "learning_rate": 0.0001085527954001018, "loss": 0.1791841685771942, "mean_token_accuracy": 0.9219368547201157, "num_tokens": 85275684.0, "step": 6913 }, { "entropy": 1.087710440158844, "epoch": 3.6408636124275935, "grad_norm": 0.27839532494544983, "learning_rate": 0.0001085308699909509, "loss": 0.15793544054031372, "mean_token_accuracy": 0.9308710992336273, "num_tokens": 85288020.0, "step": 6914 }, { "entropy": 1.104949176311493, "epoch": 3.641390205371248, "grad_norm": 0.3108198046684265, "learning_rate": 0.0001085089446690137, "loss": 0.20564743876457214, "mean_token_accuracy": 0.9142681956291199, "num_tokens": 85300356.0, "step": 6915 }, { "entropy": 1.089268833398819, "epoch": 3.6419167983149023, "grad_norm": 0.2661731541156769, "learning_rate": 0.00010848701943559176, "loss": 0.16525886952877045, "mean_token_accuracy": 0.928042009472847, "num_tokens": 85312692.0, "step": 6916 }, { "entropy": 1.1005620956420898, "epoch": 3.642443391258557, "grad_norm": 0.3060215711593628, "learning_rate": 0.00010846509429198671, "loss": 0.1820535808801651, "mean_token_accuracy": 0.9212777465581894, "num_tokens": 85325028.0, "step": 6917 }, { "entropy": 1.0968313217163086, "epoch": 3.6429699842022116, "grad_norm": 0.29798147082328796, "learning_rate": 0.00010844316923950002, "loss": 0.19336146116256714, "mean_token_accuracy": 0.9188212752342224, "num_tokens": 85337364.0, "step": 6918 }, { "entropy": 1.1311476826667786, "epoch": 3.643496577145866, "grad_norm": 0.33231881260871887, "learning_rate": 0.00010842124427943332, "loss": 0.19728441536426544, "mean_token_accuracy": 0.9228433519601822, "num_tokens": 85349700.0, "step": 6919 }, { "entropy": 1.0722969472408295, "epoch": 3.644023170089521, "grad_norm": 0.29335349798202515, "learning_rate": 0.00010839931941308815, "loss": 0.17789262533187866, "mean_token_accuracy": 0.9251670092344284, "num_tokens": 85362036.0, "step": 6920 }, { "entropy": 1.135120540857315, "epoch": 3.6445497630331753, "grad_norm": 0.31360843777656555, "learning_rate": 0.00010837739464176597, "loss": 0.19223442673683167, "mean_token_accuracy": 0.916714608669281, "num_tokens": 85374372.0, "step": 6921 }, { "entropy": 1.1161190867424011, "epoch": 3.6450763559768298, "grad_norm": 0.30781087279319763, "learning_rate": 0.00010835546996676848, "loss": 0.1870063841342926, "mean_token_accuracy": 0.922933965921402, "num_tokens": 85386708.0, "step": 6922 }, { "entropy": 1.1311403810977936, "epoch": 3.6456029489204846, "grad_norm": 0.30369794368743896, "learning_rate": 0.00010833354538939717, "loss": 0.18748193979263306, "mean_token_accuracy": 0.9215940535068512, "num_tokens": 85399044.0, "step": 6923 }, { "entropy": 1.100357174873352, "epoch": 3.646129541864139, "grad_norm": 0.3031750023365021, "learning_rate": 0.00010831162091095355, "loss": 0.1798853576183319, "mean_token_accuracy": 0.9241892546415329, "num_tokens": 85411380.0, "step": 6924 }, { "entropy": 1.125574380159378, "epoch": 3.6466561348077935, "grad_norm": 0.27512413263320923, "learning_rate": 0.00010828969653273915, "loss": 0.16666743159294128, "mean_token_accuracy": 0.9244058281183243, "num_tokens": 85423716.0, "step": 6925 }, { "entropy": 1.1576015055179596, "epoch": 3.6471827277514484, "grad_norm": 0.3020809590816498, "learning_rate": 0.00010826777225605549, "loss": 0.19194430112838745, "mean_token_accuracy": 0.9175030440092087, "num_tokens": 85436052.0, "step": 6926 }, { "entropy": 1.1278834640979767, "epoch": 3.647709320695103, "grad_norm": 0.26242175698280334, "learning_rate": 0.0001082458480822041, "loss": 0.17175456881523132, "mean_token_accuracy": 0.9282833635807037, "num_tokens": 85448388.0, "step": 6927 }, { "entropy": 1.1385831236839294, "epoch": 3.648235913638757, "grad_norm": 0.28382521867752075, "learning_rate": 0.00010822392401248649, "loss": 0.17114661633968353, "mean_token_accuracy": 0.9304853975772858, "num_tokens": 85460724.0, "step": 6928 }, { "entropy": 1.1503818333148956, "epoch": 3.6487625065824116, "grad_norm": 0.2844337522983551, "learning_rate": 0.00010820200004820414, "loss": 0.18441346287727356, "mean_token_accuracy": 0.9221296608448029, "num_tokens": 85473060.0, "step": 6929 }, { "entropy": 1.1435934901237488, "epoch": 3.6492890995260665, "grad_norm": 0.2975497543811798, "learning_rate": 0.0001081800761906586, "loss": 0.17758281528949738, "mean_token_accuracy": 0.9228782057762146, "num_tokens": 85485396.0, "step": 6930 }, { "entropy": 1.1359702944755554, "epoch": 3.649815692469721, "grad_norm": 0.2905472218990326, "learning_rate": 0.0001081581524411513, "loss": 0.1734602451324463, "mean_token_accuracy": 0.9265166819095612, "num_tokens": 85497732.0, "step": 6931 }, { "entropy": 1.0825994312763214, "epoch": 3.6503422854133754, "grad_norm": 0.2530800700187683, "learning_rate": 0.00010813622880098377, "loss": 0.16221484541893005, "mean_token_accuracy": 0.9289655685424805, "num_tokens": 85510068.0, "step": 6932 }, { "entropy": 1.1005148589611053, "epoch": 3.65086887835703, "grad_norm": 0.29540663957595825, "learning_rate": 0.00010811430527145747, "loss": 0.1880090832710266, "mean_token_accuracy": 0.9217631965875626, "num_tokens": 85522404.0, "step": 6933 }, { "entropy": 1.127230018377304, "epoch": 3.6513954713006846, "grad_norm": 0.30108895897865295, "learning_rate": 0.00010809238185387389, "loss": 0.18256250023841858, "mean_token_accuracy": 0.9247212707996368, "num_tokens": 85534740.0, "step": 6934 }, { "entropy": 1.1048816442489624, "epoch": 3.651922064244339, "grad_norm": 0.2992095351219177, "learning_rate": 0.00010807045854953443, "loss": 0.1793767511844635, "mean_token_accuracy": 0.919749990105629, "num_tokens": 85547076.0, "step": 6935 }, { "entropy": 1.0833216607570648, "epoch": 3.6524486571879935, "grad_norm": 0.27640217542648315, "learning_rate": 0.00010804853535974065, "loss": 0.17367729544639587, "mean_token_accuracy": 0.9288899600505829, "num_tokens": 85559412.0, "step": 6936 }, { "entropy": 1.0898649990558624, "epoch": 3.6529752501316484, "grad_norm": 0.3019793927669525, "learning_rate": 0.00010802661228579396, "loss": 0.17442551255226135, "mean_token_accuracy": 0.927208662033081, "num_tokens": 85571748.0, "step": 6937 }, { "entropy": 1.0895110815763474, "epoch": 3.653501843075303, "grad_norm": 0.27178964018821716, "learning_rate": 0.00010800468932899577, "loss": 0.1709968000650406, "mean_token_accuracy": 0.925664871931076, "num_tokens": 85584084.0, "step": 6938 }, { "entropy": 1.0956975221633911, "epoch": 3.654028436018957, "grad_norm": 0.29212814569473267, "learning_rate": 0.00010798276649064756, "loss": 0.17584949731826782, "mean_token_accuracy": 0.9293852895498276, "num_tokens": 85596420.0, "step": 6939 }, { "entropy": 1.0751636922359467, "epoch": 3.654555028962612, "grad_norm": 0.31412044167518616, "learning_rate": 0.00010796084377205071, "loss": 0.19069185853004456, "mean_token_accuracy": 0.9202124923467636, "num_tokens": 85608756.0, "step": 6940 }, { "entropy": 1.0722732841968536, "epoch": 3.6550816219062665, "grad_norm": 0.2728721499443054, "learning_rate": 0.00010793892117450672, "loss": 0.16478730738162994, "mean_token_accuracy": 0.9310110807418823, "num_tokens": 85621092.0, "step": 6941 }, { "entropy": 1.1176518499851227, "epoch": 3.655608214849921, "grad_norm": 0.3089950680732727, "learning_rate": 0.00010791699869931693, "loss": 0.18918341398239136, "mean_token_accuracy": 0.9210700541734695, "num_tokens": 85633428.0, "step": 6942 }, { "entropy": 1.0875534117221832, "epoch": 3.656134807793576, "grad_norm": 0.2986571788787842, "learning_rate": 0.00010789507634778281, "loss": 0.1821071207523346, "mean_token_accuracy": 0.924040675163269, "num_tokens": 85645764.0, "step": 6943 }, { "entropy": 1.104602336883545, "epoch": 3.6566614007372302, "grad_norm": 0.2819954752922058, "learning_rate": 0.00010787315412120574, "loss": 0.17842718958854675, "mean_token_accuracy": 0.9197171330451965, "num_tokens": 85658100.0, "step": 6944 }, { "entropy": 1.0745837092399597, "epoch": 3.6571879936808847, "grad_norm": 0.2845374643802643, "learning_rate": 0.00010785123202088712, "loss": 0.17215374112129211, "mean_token_accuracy": 0.9247159063816071, "num_tokens": 85670436.0, "step": 6945 }, { "entropy": 1.0754876732826233, "epoch": 3.657714586624539, "grad_norm": 0.30206388235092163, "learning_rate": 0.00010782931004812831, "loss": 0.18929605185985565, "mean_token_accuracy": 0.9201420098543167, "num_tokens": 85682772.0, "step": 6946 }, { "entropy": 1.0547612607479095, "epoch": 3.658241179568194, "grad_norm": 0.2812706232070923, "learning_rate": 0.00010780738820423073, "loss": 0.1781274378299713, "mean_token_accuracy": 0.9253074079751968, "num_tokens": 85695108.0, "step": 6947 }, { "entropy": 1.0610165894031525, "epoch": 3.6587677725118484, "grad_norm": 0.32550254464149475, "learning_rate": 0.00010778546649049574, "loss": 0.1952066421508789, "mean_token_accuracy": 0.9139260500669479, "num_tokens": 85707444.0, "step": 6948 }, { "entropy": 1.0588375329971313, "epoch": 3.659294365455503, "grad_norm": 0.287535160779953, "learning_rate": 0.00010776354490822464, "loss": 0.17247122526168823, "mean_token_accuracy": 0.9268250167369843, "num_tokens": 85719780.0, "step": 6949 }, { "entropy": 1.0423914641141891, "epoch": 3.659820958399157, "grad_norm": 0.2818460166454315, "learning_rate": 0.0001077416234587189, "loss": 0.17156368494033813, "mean_token_accuracy": 0.9256498515605927, "num_tokens": 85732116.0, "step": 6950 }, { "entropy": 1.0398815125226974, "epoch": 3.660347551342812, "grad_norm": 0.2628284692764282, "learning_rate": 0.0001077197021432798, "loss": 0.16416022181510925, "mean_token_accuracy": 0.9331476390361786, "num_tokens": 85744452.0, "step": 6951 }, { "entropy": 1.0208431482315063, "epoch": 3.6608741442864665, "grad_norm": 0.27734678983688354, "learning_rate": 0.00010769778096320873, "loss": 0.17575320601463318, "mean_token_accuracy": 0.92631596326828, "num_tokens": 85756788.0, "step": 6952 }, { "entropy": 1.062884896993637, "epoch": 3.661400737230121, "grad_norm": 0.30154260993003845, "learning_rate": 0.00010767585991980693, "loss": 0.18772351741790771, "mean_token_accuracy": 0.9216388911008835, "num_tokens": 85769124.0, "step": 6953 }, { "entropy": 1.0944669097661972, "epoch": 3.661927330173776, "grad_norm": 0.3269876539707184, "learning_rate": 0.00010765393901437581, "loss": 0.1878005564212799, "mean_token_accuracy": 0.9181205332279205, "num_tokens": 85781460.0, "step": 6954 }, { "entropy": 1.030048444867134, "epoch": 3.6624539231174302, "grad_norm": 0.2715197503566742, "learning_rate": 0.00010763201824821665, "loss": 0.1689884215593338, "mean_token_accuracy": 0.9284142404794693, "num_tokens": 85793796.0, "step": 6955 }, { "entropy": 1.053311824798584, "epoch": 3.6629805160610847, "grad_norm": 0.31180477142333984, "learning_rate": 0.00010761009762263074, "loss": 0.19359172880649567, "mean_token_accuracy": 0.9211233556270599, "num_tokens": 85806132.0, "step": 6956 }, { "entropy": 1.0647279024124146, "epoch": 3.6635071090047395, "grad_norm": 0.2950548529624939, "learning_rate": 0.00010758817713891942, "loss": 0.1748398393392563, "mean_token_accuracy": 0.9264338165521622, "num_tokens": 85818468.0, "step": 6957 }, { "entropy": 1.0664381682872772, "epoch": 3.664033701948394, "grad_norm": 0.2937673330307007, "learning_rate": 0.00010756625679838397, "loss": 0.18024608492851257, "mean_token_accuracy": 0.9259634613990784, "num_tokens": 85830804.0, "step": 6958 }, { "entropy": 1.0663295984268188, "epoch": 3.6645602948920484, "grad_norm": 0.28091055154800415, "learning_rate": 0.00010754433660232568, "loss": 0.1665952354669571, "mean_token_accuracy": 0.929583802819252, "num_tokens": 85843140.0, "step": 6959 }, { "entropy": 1.0400154292583466, "epoch": 3.6650868878357032, "grad_norm": 0.2815306484699249, "learning_rate": 0.0001075224165520458, "loss": 0.16376999020576477, "mean_token_accuracy": 0.930091381072998, "num_tokens": 85855476.0, "step": 6960 }, { "entropy": 1.0289010107517242, "epoch": 3.6656134807793577, "grad_norm": 0.28532126545906067, "learning_rate": 0.00010750049664884561, "loss": 0.17586354911327362, "mean_token_accuracy": 0.9279272109270096, "num_tokens": 85867812.0, "step": 6961 }, { "entropy": 1.0397853255271912, "epoch": 3.666140073723012, "grad_norm": 0.2653680145740509, "learning_rate": 0.00010747857689402637, "loss": 0.15809708833694458, "mean_token_accuracy": 0.9312074035406113, "num_tokens": 85880148.0, "step": 6962 }, { "entropy": 1.03483048081398, "epoch": 3.6666666666666665, "grad_norm": 0.3177836537361145, "learning_rate": 0.0001074566572888893, "loss": 0.1801329106092453, "mean_token_accuracy": 0.9240194410085678, "num_tokens": 85892484.0, "step": 6963 }, { "entropy": 1.0460475087165833, "epoch": 3.6671932596103214, "grad_norm": 0.2922004163265228, "learning_rate": 0.0001074347378347357, "loss": 0.20034848153591156, "mean_token_accuracy": 0.9176178127527237, "num_tokens": 85904820.0, "step": 6964 }, { "entropy": 1.0509907603263855, "epoch": 3.667719852553976, "grad_norm": 0.2957066297531128, "learning_rate": 0.00010741281853286675, "loss": 0.17528370022773743, "mean_token_accuracy": 0.9293950200080872, "num_tokens": 85917156.0, "step": 6965 }, { "entropy": 0.976374089717865, "epoch": 3.6682464454976302, "grad_norm": 0.2763223350048065, "learning_rate": 0.00010739089938458367, "loss": 0.17812931537628174, "mean_token_accuracy": 0.9236332774162292, "num_tokens": 85929492.0, "step": 6966 }, { "entropy": 1.076490581035614, "epoch": 3.6687730384412847, "grad_norm": 0.31013357639312744, "learning_rate": 0.00010736898039118773, "loss": 0.197622150182724, "mean_token_accuracy": 0.9179268032312393, "num_tokens": 85941828.0, "step": 6967 }, { "entropy": 1.0025828033685684, "epoch": 3.6692996313849395, "grad_norm": 0.28579673171043396, "learning_rate": 0.00010734706155398007, "loss": 0.16753435134887695, "mean_token_accuracy": 0.9261990189552307, "num_tokens": 85954164.0, "step": 6968 }, { "entropy": 1.02617509663105, "epoch": 3.669826224328594, "grad_norm": 0.3085153102874756, "learning_rate": 0.00010732514287426188, "loss": 0.19467276334762573, "mean_token_accuracy": 0.9151240140199661, "num_tokens": 85966500.0, "step": 6969 }, { "entropy": 1.0354234278202057, "epoch": 3.6703528172722484, "grad_norm": 0.2686126232147217, "learning_rate": 0.00010730322435333433, "loss": 0.1822713315486908, "mean_token_accuracy": 0.92469722032547, "num_tokens": 85978836.0, "step": 6970 }, { "entropy": 1.0647673606872559, "epoch": 3.6708794102159032, "grad_norm": 0.32261499762535095, "learning_rate": 0.0001072813059924987, "loss": 0.19555431604385376, "mean_token_accuracy": 0.9207833260297775, "num_tokens": 85991172.0, "step": 6971 }, { "entropy": 1.0193777978420258, "epoch": 3.6714060031595577, "grad_norm": 0.2969292402267456, "learning_rate": 0.00010725938779305609, "loss": 0.17920270562171936, "mean_token_accuracy": 0.9244997650384903, "num_tokens": 86003508.0, "step": 6972 }, { "entropy": 1.000598281621933, "epoch": 3.671932596103212, "grad_norm": 0.2639365792274475, "learning_rate": 0.00010723746975630761, "loss": 0.15792196989059448, "mean_token_accuracy": 0.9345228672027588, "num_tokens": 86015844.0, "step": 6973 }, { "entropy": 1.0382906347513199, "epoch": 3.672459189046867, "grad_norm": 0.2822777330875397, "learning_rate": 0.00010721555188355448, "loss": 0.18117579817771912, "mean_token_accuracy": 0.924898087978363, "num_tokens": 86028180.0, "step": 6974 }, { "entropy": 1.0620505809783936, "epoch": 3.6729857819905214, "grad_norm": 0.2701767086982727, "learning_rate": 0.0001071936341760978, "loss": 0.17222149670124054, "mean_token_accuracy": 0.9235534220933914, "num_tokens": 86040516.0, "step": 6975 }, { "entropy": 1.0112586617469788, "epoch": 3.673512374934176, "grad_norm": 0.26706138253211975, "learning_rate": 0.00010717171663523871, "loss": 0.1747536063194275, "mean_token_accuracy": 0.9254122376441956, "num_tokens": 86052852.0, "step": 6976 }, { "entropy": 1.039280742406845, "epoch": 3.6740389678778307, "grad_norm": 0.2836163640022278, "learning_rate": 0.00010714979926227828, "loss": 0.17702583968639374, "mean_token_accuracy": 0.9256714284420013, "num_tokens": 86065188.0, "step": 6977 }, { "entropy": 1.0016122907400131, "epoch": 3.674565560821485, "grad_norm": 0.2784358859062195, "learning_rate": 0.00010712788205851769, "loss": 0.17481949925422668, "mean_token_accuracy": 0.9267537146806717, "num_tokens": 86077524.0, "step": 6978 }, { "entropy": 1.0275622457265854, "epoch": 3.6750921537651395, "grad_norm": 0.31567052006721497, "learning_rate": 0.000107105965025258, "loss": 0.19603204727172852, "mean_token_accuracy": 0.9181112349033356, "num_tokens": 86089860.0, "step": 6979 }, { "entropy": 1.0318071246147156, "epoch": 3.675618746708794, "grad_norm": 0.2872801125049591, "learning_rate": 0.00010708404816380029, "loss": 0.1774379462003708, "mean_token_accuracy": 0.9286105185747147, "num_tokens": 86102196.0, "step": 6980 }, { "entropy": 1.0042276829481125, "epoch": 3.6761453396524484, "grad_norm": 0.30108317732810974, "learning_rate": 0.00010706213147544566, "loss": 0.18309810757637024, "mean_token_accuracy": 0.9228730797767639, "num_tokens": 86114532.0, "step": 6981 }, { "entropy": 0.9636296778917313, "epoch": 3.6766719325961033, "grad_norm": 0.2768324017524719, "learning_rate": 0.00010704021496149517, "loss": 0.1785029023885727, "mean_token_accuracy": 0.9208957850933075, "num_tokens": 86126868.0, "step": 6982 }, { "entropy": 1.031101867556572, "epoch": 3.6771985255397577, "grad_norm": 0.31000271439552307, "learning_rate": 0.00010701829862324984, "loss": 0.18313610553741455, "mean_token_accuracy": 0.9193488359451294, "num_tokens": 86139204.0, "step": 6983 }, { "entropy": 1.032566413283348, "epoch": 3.677725118483412, "grad_norm": 0.28918370604515076, "learning_rate": 0.00010699638246201071, "loss": 0.17839691042900085, "mean_token_accuracy": 0.9232564121484756, "num_tokens": 86151540.0, "step": 6984 }, { "entropy": 1.0230403393507004, "epoch": 3.678251711427067, "grad_norm": 0.29073366522789, "learning_rate": 0.0001069744664790789, "loss": 0.1784803867340088, "mean_token_accuracy": 0.9265795201063156, "num_tokens": 86163876.0, "step": 6985 }, { "entropy": 1.0558317303657532, "epoch": 3.6787783043707214, "grad_norm": 0.27190113067626953, "learning_rate": 0.00010695255067575538, "loss": 0.1662517786026001, "mean_token_accuracy": 0.9308346807956696, "num_tokens": 86176212.0, "step": 6986 }, { "entropy": 1.033191591501236, "epoch": 3.679304897314376, "grad_norm": 0.2988441586494446, "learning_rate": 0.00010693063505334115, "loss": 0.18694527447223663, "mean_token_accuracy": 0.9207980185747147, "num_tokens": 86188548.0, "step": 6987 }, { "entropy": 1.0609621107578278, "epoch": 3.6798314902580307, "grad_norm": 0.2892952263355255, "learning_rate": 0.00010690871961313724, "loss": 0.17166557908058167, "mean_token_accuracy": 0.931251272559166, "num_tokens": 86200884.0, "step": 6988 }, { "entropy": 1.0341887772083282, "epoch": 3.680358083201685, "grad_norm": 0.30244240164756775, "learning_rate": 0.0001068868043564446, "loss": 0.1853313148021698, "mean_token_accuracy": 0.923940971493721, "num_tokens": 86213220.0, "step": 6989 }, { "entropy": 1.049064576625824, "epoch": 3.6808846761453395, "grad_norm": 0.3076011538505554, "learning_rate": 0.00010686488928456428, "loss": 0.20103253424167633, "mean_token_accuracy": 0.9156415909528732, "num_tokens": 86225556.0, "step": 6990 }, { "entropy": 1.0623431205749512, "epoch": 3.6814112690889944, "grad_norm": 0.3282015919685364, "learning_rate": 0.00010684297439879715, "loss": 0.20622855424880981, "mean_token_accuracy": 0.9159451127052307, "num_tokens": 86237892.0, "step": 6991 }, { "entropy": 1.0407926738262177, "epoch": 3.681937862032649, "grad_norm": 0.28654420375823975, "learning_rate": 0.0001068210597004443, "loss": 0.17378610372543335, "mean_token_accuracy": 0.9291479289531708, "num_tokens": 86250228.0, "step": 6992 }, { "entropy": 1.128141850233078, "epoch": 3.6824644549763033, "grad_norm": 0.286441445350647, "learning_rate": 0.00010679914519080655, "loss": 0.18758511543273926, "mean_token_accuracy": 0.9224020689725876, "num_tokens": 86262564.0, "step": 6993 }, { "entropy": 1.1071661114692688, "epoch": 3.682991047919958, "grad_norm": 0.27097955346107483, "learning_rate": 0.00010677723087118495, "loss": 0.17104873061180115, "mean_token_accuracy": 0.9285868257284164, "num_tokens": 86274900.0, "step": 6994 }, { "entropy": 1.1507742702960968, "epoch": 3.6835176408636126, "grad_norm": 0.3454969525337219, "learning_rate": 0.00010675531674288033, "loss": 0.1876622587442398, "mean_token_accuracy": 0.9162978529930115, "num_tokens": 86287236.0, "step": 6995 }, { "entropy": 1.1414210498332977, "epoch": 3.684044233807267, "grad_norm": 0.28427883982658386, "learning_rate": 0.00010673340280719364, "loss": 0.1635189950466156, "mean_token_accuracy": 0.935024231672287, "num_tokens": 86299572.0, "step": 6996 }, { "entropy": 1.0934878289699554, "epoch": 3.6845708267509214, "grad_norm": 0.30094486474990845, "learning_rate": 0.00010671148906542583, "loss": 0.20287704467773438, "mean_token_accuracy": 0.9153666496276855, "num_tokens": 86311908.0, "step": 6997 }, { "entropy": 1.1483174860477448, "epoch": 3.685097419694576, "grad_norm": 0.30192604660987854, "learning_rate": 0.00010668957551887768, "loss": 0.20245520770549774, "mean_token_accuracy": 0.9145628660917282, "num_tokens": 86324244.0, "step": 6998 }, { "entropy": 1.1466923654079437, "epoch": 3.6856240126382307, "grad_norm": 0.2737888991832733, "learning_rate": 0.00010666766216885016, "loss": 0.16557517647743225, "mean_token_accuracy": 0.9325868636369705, "num_tokens": 86336580.0, "step": 6999 }, { "entropy": 1.1706739664077759, "epoch": 3.686150605581885, "grad_norm": 0.309152752161026, "learning_rate": 0.00010664574901664415, "loss": 0.19145433604717255, "mean_token_accuracy": 0.9230051189661026, "num_tokens": 86348916.0, "step": 7000 }, { "entropy": 1.188638299703598, "epoch": 3.6866771985255395, "grad_norm": 0.3105132579803467, "learning_rate": 0.00010662383606356045, "loss": 0.1874886304140091, "mean_token_accuracy": 0.9241949319839478, "num_tokens": 86361252.0, "step": 7001 }, { "entropy": 1.2060999870300293, "epoch": 3.6872037914691944, "grad_norm": 0.28197094798088074, "learning_rate": 0.00010660192331089994, "loss": 0.18086087703704834, "mean_token_accuracy": 0.9176561236381531, "num_tokens": 86373588.0, "step": 7002 }, { "entropy": 1.1158166229724884, "epoch": 3.687730384412849, "grad_norm": 0.2853429615497589, "learning_rate": 0.00010658001075996342, "loss": 0.18830300867557526, "mean_token_accuracy": 0.9259162545204163, "num_tokens": 86385924.0, "step": 7003 }, { "entropy": 1.1557681560516357, "epoch": 3.6882569773565033, "grad_norm": 0.31260934472084045, "learning_rate": 0.00010655809841205173, "loss": 0.18399247527122498, "mean_token_accuracy": 0.9262349903583527, "num_tokens": 86398260.0, "step": 7004 }, { "entropy": 1.162243366241455, "epoch": 3.688783570300158, "grad_norm": 0.3255998194217682, "learning_rate": 0.00010653618626846564, "loss": 0.1905967891216278, "mean_token_accuracy": 0.9187018573284149, "num_tokens": 86410596.0, "step": 7005 }, { "entropy": 1.16911181807518, "epoch": 3.6893101632438126, "grad_norm": 0.28588801622390747, "learning_rate": 0.00010651427433050603, "loss": 0.17679578065872192, "mean_token_accuracy": 0.9221796095371246, "num_tokens": 86422932.0, "step": 7006 }, { "entropy": 1.1541486084461212, "epoch": 3.689836756187467, "grad_norm": 0.3123913109302521, "learning_rate": 0.00010649236259947362, "loss": 0.1948072761297226, "mean_token_accuracy": 0.9239502102136612, "num_tokens": 86435268.0, "step": 7007 }, { "entropy": 1.0990737974643707, "epoch": 3.690363349131122, "grad_norm": 0.28149572014808655, "learning_rate": 0.00010647045107666922, "loss": 0.1947208046913147, "mean_token_accuracy": 0.9193027168512344, "num_tokens": 86447604.0, "step": 7008 }, { "entropy": 1.113670527935028, "epoch": 3.6908899420747763, "grad_norm": 0.29361167550086975, "learning_rate": 0.00010644853976339355, "loss": 0.18384166061878204, "mean_token_accuracy": 0.9195683002471924, "num_tokens": 86459940.0, "step": 7009 }, { "entropy": 1.1258732974529266, "epoch": 3.6914165350184307, "grad_norm": 0.2840478718280792, "learning_rate": 0.00010642662866094737, "loss": 0.17376568913459778, "mean_token_accuracy": 0.9311702698469162, "num_tokens": 86472276.0, "step": 7010 }, { "entropy": 1.0605426728725433, "epoch": 3.6919431279620856, "grad_norm": 0.27593398094177246, "learning_rate": 0.00010640471777063143, "loss": 0.18008655309677124, "mean_token_accuracy": 0.9253093004226685, "num_tokens": 86484612.0, "step": 7011 }, { "entropy": 1.1514114439487457, "epoch": 3.69246972090574, "grad_norm": 0.29216331243515015, "learning_rate": 0.00010638280709374642, "loss": 0.17637720704078674, "mean_token_accuracy": 0.9234650433063507, "num_tokens": 86496948.0, "step": 7012 }, { "entropy": 1.0970701277256012, "epoch": 3.6929963138493944, "grad_norm": 0.28925836086273193, "learning_rate": 0.00010636089663159307, "loss": 0.1796543151140213, "mean_token_accuracy": 0.9250158369541168, "num_tokens": 86509284.0, "step": 7013 }, { "entropy": 1.1331265270709991, "epoch": 3.693522906793049, "grad_norm": 0.27358677983283997, "learning_rate": 0.0001063389863854721, "loss": 0.17291176319122314, "mean_token_accuracy": 0.9264134615659714, "num_tokens": 86521620.0, "step": 7014 }, { "entropy": 1.1059588491916656, "epoch": 3.6940494997367033, "grad_norm": 0.2972795069217682, "learning_rate": 0.00010631707635668418, "loss": 0.17801031470298767, "mean_token_accuracy": 0.9305655509233475, "num_tokens": 86533956.0, "step": 7015 }, { "entropy": 1.1910763084888458, "epoch": 3.694576092680358, "grad_norm": 0.32364970445632935, "learning_rate": 0.00010629516654652996, "loss": 0.2020956575870514, "mean_token_accuracy": 0.919253408908844, "num_tokens": 86546292.0, "step": 7016 }, { "entropy": 1.140288382768631, "epoch": 3.6951026856240126, "grad_norm": 0.2970587909221649, "learning_rate": 0.00010627325695631012, "loss": 0.1709657460451126, "mean_token_accuracy": 0.9261876344680786, "num_tokens": 86558628.0, "step": 7017 }, { "entropy": 1.1525245010852814, "epoch": 3.695629278567667, "grad_norm": 0.3080959916114807, "learning_rate": 0.00010625134758732527, "loss": 0.19118379056453705, "mean_token_accuracy": 0.9182205647230148, "num_tokens": 86570964.0, "step": 7018 }, { "entropy": 1.091363787651062, "epoch": 3.696155871511322, "grad_norm": 0.27670302987098694, "learning_rate": 0.00010622943844087603, "loss": 0.16978196799755096, "mean_token_accuracy": 0.9306501001119614, "num_tokens": 86583300.0, "step": 7019 }, { "entropy": 1.1769406497478485, "epoch": 3.6966824644549763, "grad_norm": 0.3435772657394409, "learning_rate": 0.00010620752951826312, "loss": 0.193936288356781, "mean_token_accuracy": 0.9195510298013687, "num_tokens": 86595636.0, "step": 7020 }, { "entropy": 1.0992920696735382, "epoch": 3.6972090573986307, "grad_norm": 0.2789323627948761, "learning_rate": 0.00010618562082078705, "loss": 0.17331257462501526, "mean_token_accuracy": 0.9258032143115997, "num_tokens": 86607972.0, "step": 7021 }, { "entropy": 1.1387426257133484, "epoch": 3.6977356503422856, "grad_norm": 0.2974391281604767, "learning_rate": 0.00010616371234974845, "loss": 0.18600372970104218, "mean_token_accuracy": 0.9238637983798981, "num_tokens": 86620308.0, "step": 7022 }, { "entropy": 1.145241916179657, "epoch": 3.69826224328594, "grad_norm": 0.26601076126098633, "learning_rate": 0.00010614180410644788, "loss": 0.1715870052576065, "mean_token_accuracy": 0.9243782013654709, "num_tokens": 86632644.0, "step": 7023 }, { "entropy": 1.1596001982688904, "epoch": 3.6987888362295944, "grad_norm": 0.2737334072589874, "learning_rate": 0.0001061198960921859, "loss": 0.17031270265579224, "mean_token_accuracy": 0.9278070032596588, "num_tokens": 86644980.0, "step": 7024 }, { "entropy": 1.1383101642131805, "epoch": 3.6993154291732493, "grad_norm": 0.29354214668273926, "learning_rate": 0.00010609798830826309, "loss": 0.17928820848464966, "mean_token_accuracy": 0.921865239739418, "num_tokens": 86657316.0, "step": 7025 }, { "entropy": 1.1404908895492554, "epoch": 3.6998420221169037, "grad_norm": 0.2634413242340088, "learning_rate": 0.00010607608075597997, "loss": 0.17588280141353607, "mean_token_accuracy": 0.9216579794883728, "num_tokens": 86669652.0, "step": 7026 }, { "entropy": 1.1622402966022491, "epoch": 3.700368615060558, "grad_norm": 0.2730373442173004, "learning_rate": 0.00010605417343663707, "loss": 0.1770833134651184, "mean_token_accuracy": 0.9242895394563675, "num_tokens": 86681988.0, "step": 7027 }, { "entropy": 1.137715607881546, "epoch": 3.700895208004213, "grad_norm": 0.2774525284767151, "learning_rate": 0.00010603226635153487, "loss": 0.18399879336357117, "mean_token_accuracy": 0.9218821078538895, "num_tokens": 86694324.0, "step": 7028 }, { "entropy": 1.0905758738517761, "epoch": 3.7014218009478674, "grad_norm": 0.2718823254108429, "learning_rate": 0.00010601035950197391, "loss": 0.1788283884525299, "mean_token_accuracy": 0.9250014126300812, "num_tokens": 86706660.0, "step": 7029 }, { "entropy": 1.1376757323741913, "epoch": 3.701948393891522, "grad_norm": 0.2840229570865631, "learning_rate": 0.00010598845288925465, "loss": 0.19945470988750458, "mean_token_accuracy": 0.9160834699869156, "num_tokens": 86718996.0, "step": 7030 }, { "entropy": 1.1366423964500427, "epoch": 3.7024749868351763, "grad_norm": 0.2850939929485321, "learning_rate": 0.00010596654651467761, "loss": 0.18090331554412842, "mean_token_accuracy": 0.9235516041517258, "num_tokens": 86731332.0, "step": 7031 }, { "entropy": 1.1042983531951904, "epoch": 3.7030015797788307, "grad_norm": 0.2823299169540405, "learning_rate": 0.00010594464037954315, "loss": 0.17295169830322266, "mean_token_accuracy": 0.9247632920742035, "num_tokens": 86743668.0, "step": 7032 }, { "entropy": 1.1178973019123077, "epoch": 3.7035281727224856, "grad_norm": 0.2881527543067932, "learning_rate": 0.00010592273448515171, "loss": 0.19073688983917236, "mean_token_accuracy": 0.9142032116651535, "num_tokens": 86756004.0, "step": 7033 }, { "entropy": 1.1280372738838196, "epoch": 3.70405476566614, "grad_norm": 0.2831754982471466, "learning_rate": 0.00010590082883280381, "loss": 0.18510054051876068, "mean_token_accuracy": 0.9240960776805878, "num_tokens": 86768340.0, "step": 7034 }, { "entropy": 1.1257420778274536, "epoch": 3.7045813586097944, "grad_norm": 0.2848588228225708, "learning_rate": 0.00010587892342379982, "loss": 0.17345714569091797, "mean_token_accuracy": 0.9254269748926163, "num_tokens": 86780676.0, "step": 7035 }, { "entropy": 1.1075385212898254, "epoch": 3.7051079515534493, "grad_norm": 0.26853349804878235, "learning_rate": 0.0001058570182594401, "loss": 0.163071870803833, "mean_token_accuracy": 0.9308745414018631, "num_tokens": 86793012.0, "step": 7036 }, { "entropy": 1.0885754227638245, "epoch": 3.7056345444971037, "grad_norm": 0.3040599226951599, "learning_rate": 0.00010583511334102507, "loss": 0.20325782895088196, "mean_token_accuracy": 0.9152310937643051, "num_tokens": 86805348.0, "step": 7037 }, { "entropy": 1.143157958984375, "epoch": 3.706161137440758, "grad_norm": 0.3034161627292633, "learning_rate": 0.00010581320866985509, "loss": 0.17412713170051575, "mean_token_accuracy": 0.9315810650587082, "num_tokens": 86817684.0, "step": 7038 }, { "entropy": 1.12423837184906, "epoch": 3.706687730384413, "grad_norm": 0.32303717732429504, "learning_rate": 0.00010579130424723052, "loss": 0.19759589433670044, "mean_token_accuracy": 0.9174207895994186, "num_tokens": 86830020.0, "step": 7039 }, { "entropy": 1.1076728105545044, "epoch": 3.7072143233280674, "grad_norm": 0.2884438633918762, "learning_rate": 0.00010576940007445165, "loss": 0.17870476841926575, "mean_token_accuracy": 0.9225609600543976, "num_tokens": 86842356.0, "step": 7040 }, { "entropy": 1.1127937734127045, "epoch": 3.707740916271722, "grad_norm": 0.3068588376045227, "learning_rate": 0.00010574749615281885, "loss": 0.1765388399362564, "mean_token_accuracy": 0.9259982705116272, "num_tokens": 86854692.0, "step": 7041 }, { "entropy": 1.092573642730713, "epoch": 3.7082675092153767, "grad_norm": 0.28363847732543945, "learning_rate": 0.00010572559248363244, "loss": 0.18522685766220093, "mean_token_accuracy": 0.9234550446271896, "num_tokens": 86867028.0, "step": 7042 }, { "entropy": 1.1002579033374786, "epoch": 3.708794102159031, "grad_norm": 0.4295247197151184, "learning_rate": 0.00010570368906819268, "loss": 0.18969866633415222, "mean_token_accuracy": 0.9216194003820419, "num_tokens": 86879364.0, "step": 7043 }, { "entropy": 1.0092736929655075, "epoch": 3.7093206951026856, "grad_norm": 0.29199665784835815, "learning_rate": 0.00010568178590779986, "loss": 0.18738186359405518, "mean_token_accuracy": 0.92066690325737, "num_tokens": 86891700.0, "step": 7044 }, { "entropy": 1.0848056077957153, "epoch": 3.7098472880463405, "grad_norm": 0.284700870513916, "learning_rate": 0.00010565988300375425, "loss": 0.17852607369422913, "mean_token_accuracy": 0.9268171042203903, "num_tokens": 86904036.0, "step": 7045 }, { "entropy": 1.0516371130943298, "epoch": 3.710373880989995, "grad_norm": 0.2858789265155792, "learning_rate": 0.00010563798035735608, "loss": 0.17847073078155518, "mean_token_accuracy": 0.9252327531576157, "num_tokens": 86916372.0, "step": 7046 }, { "entropy": 1.1216425895690918, "epoch": 3.7109004739336493, "grad_norm": 0.29138556122779846, "learning_rate": 0.00010561607796990556, "loss": 0.17626778781414032, "mean_token_accuracy": 0.9225746989250183, "num_tokens": 86928708.0, "step": 7047 }, { "entropy": 1.0883024036884308, "epoch": 3.7114270668773037, "grad_norm": 0.32015201449394226, "learning_rate": 0.00010559417584270297, "loss": 0.18942302465438843, "mean_token_accuracy": 0.9230293780565262, "num_tokens": 86941044.0, "step": 7048 }, { "entropy": 1.1369044482707977, "epoch": 3.711953659820958, "grad_norm": 0.3087009787559509, "learning_rate": 0.0001055722739770485, "loss": 0.19450201094150543, "mean_token_accuracy": 0.918872594833374, "num_tokens": 86953380.0, "step": 7049 }, { "entropy": 1.0756378769874573, "epoch": 3.712480252764613, "grad_norm": 0.300651490688324, "learning_rate": 0.00010555037237424233, "loss": 0.18945585191249847, "mean_token_accuracy": 0.9195737093687057, "num_tokens": 86965716.0, "step": 7050 }, { "entropy": 1.0762072801589966, "epoch": 3.7130068457082674, "grad_norm": 0.3127416968345642, "learning_rate": 0.00010552847103558457, "loss": 0.19951653480529785, "mean_token_accuracy": 0.9176425486803055, "num_tokens": 86978052.0, "step": 7051 }, { "entropy": 1.0640795826911926, "epoch": 3.713533438651922, "grad_norm": 0.2833158075809479, "learning_rate": 0.00010550656996237545, "loss": 0.17779900133609772, "mean_token_accuracy": 0.9267347902059555, "num_tokens": 86990388.0, "step": 7052 }, { "entropy": 1.0813401639461517, "epoch": 3.7140600315955767, "grad_norm": 0.2971404790878296, "learning_rate": 0.00010548466915591508, "loss": 0.18745601177215576, "mean_token_accuracy": 0.9218907654285431, "num_tokens": 87002724.0, "step": 7053 }, { "entropy": 1.054432064294815, "epoch": 3.714586624539231, "grad_norm": 0.2983354330062866, "learning_rate": 0.00010546276861750355, "loss": 0.1724255532026291, "mean_token_accuracy": 0.926984503865242, "num_tokens": 87015060.0, "step": 7054 }, { "entropy": 1.10925954580307, "epoch": 3.7151132174828856, "grad_norm": 0.3013254404067993, "learning_rate": 0.00010544086834844102, "loss": 0.18378786742687225, "mean_token_accuracy": 0.9229534566402435, "num_tokens": 87027396.0, "step": 7055 }, { "entropy": 1.0945369601249695, "epoch": 3.7156398104265405, "grad_norm": 0.2869090139865875, "learning_rate": 0.00010541896835002758, "loss": 0.17971734702587128, "mean_token_accuracy": 0.9238785058259964, "num_tokens": 87039732.0, "step": 7056 }, { "entropy": 1.0483132302761078, "epoch": 3.716166403370195, "grad_norm": 0.28307098150253296, "learning_rate": 0.00010539706862356329, "loss": 0.16245801746845245, "mean_token_accuracy": 0.9303528666496277, "num_tokens": 87052068.0, "step": 7057 }, { "entropy": 1.0750107169151306, "epoch": 3.7166929963138493, "grad_norm": 0.280137300491333, "learning_rate": 0.0001053751691703482, "loss": 0.1640922725200653, "mean_token_accuracy": 0.9329541176557541, "num_tokens": 87064404.0, "step": 7058 }, { "entropy": 1.0682209730148315, "epoch": 3.717219589257504, "grad_norm": 0.2897961139678955, "learning_rate": 0.00010535326999168235, "loss": 0.1660948097705841, "mean_token_accuracy": 0.9257662445306778, "num_tokens": 87076740.0, "step": 7059 }, { "entropy": 1.0374273657798767, "epoch": 3.7177461822011586, "grad_norm": 0.27872800827026367, "learning_rate": 0.0001053313710888658, "loss": 0.17981553077697754, "mean_token_accuracy": 0.9291188567876816, "num_tokens": 87089076.0, "step": 7060 }, { "entropy": 1.0463912636041641, "epoch": 3.718272775144813, "grad_norm": 0.29372626543045044, "learning_rate": 0.0001053094724631985, "loss": 0.1634107530117035, "mean_token_accuracy": 0.9343952238559723, "num_tokens": 87101412.0, "step": 7061 }, { "entropy": 1.0434607565402985, "epoch": 3.7187993680884674, "grad_norm": 0.3085126280784607, "learning_rate": 0.00010528757411598052, "loss": 0.18878869712352753, "mean_token_accuracy": 0.9215325862169266, "num_tokens": 87113748.0, "step": 7062 }, { "entropy": 1.0086200386285782, "epoch": 3.7193259610321223, "grad_norm": 0.31608739495277405, "learning_rate": 0.00010526567604851178, "loss": 0.19069062173366547, "mean_token_accuracy": 0.9255263060331345, "num_tokens": 87126084.0, "step": 7063 }, { "entropy": 1.043920412659645, "epoch": 3.7198525539757767, "grad_norm": 0.3183654248714447, "learning_rate": 0.00010524377826209229, "loss": 0.1812736988067627, "mean_token_accuracy": 0.9252707064151764, "num_tokens": 87138420.0, "step": 7064 }, { "entropy": 0.9960617870092392, "epoch": 3.720379146919431, "grad_norm": 0.26266780495643616, "learning_rate": 0.00010522188075802195, "loss": 0.1656363606452942, "mean_token_accuracy": 0.9341549277305603, "num_tokens": 87150756.0, "step": 7065 }, { "entropy": 1.0182566493749619, "epoch": 3.7209057398630856, "grad_norm": 0.27417296171188354, "learning_rate": 0.00010519998353760068, "loss": 0.16538512706756592, "mean_token_accuracy": 0.9307667762041092, "num_tokens": 87163092.0, "step": 7066 }, { "entropy": 1.0149471759796143, "epoch": 3.7214323328067405, "grad_norm": 0.27810150384902954, "learning_rate": 0.00010517808660212842, "loss": 0.18155770003795624, "mean_token_accuracy": 0.9208849668502808, "num_tokens": 87175428.0, "step": 7067 }, { "entropy": 1.0324757099151611, "epoch": 3.721958925750395, "grad_norm": 0.32252272963523865, "learning_rate": 0.00010515618995290502, "loss": 0.19960591197013855, "mean_token_accuracy": 0.9167255610227585, "num_tokens": 87187764.0, "step": 7068 }, { "entropy": 1.0477562993764877, "epoch": 3.7224855186940493, "grad_norm": 0.30965742468833923, "learning_rate": 0.00010513429359123046, "loss": 0.20774033665657043, "mean_token_accuracy": 0.9094702899456024, "num_tokens": 87200100.0, "step": 7069 }, { "entropy": 1.0455181300640106, "epoch": 3.723012111637704, "grad_norm": 0.28178003430366516, "learning_rate": 0.0001051123975184045, "loss": 0.16794756054878235, "mean_token_accuracy": 0.9258260428905487, "num_tokens": 87212436.0, "step": 7070 }, { "entropy": 1.027303621172905, "epoch": 3.7235387045813586, "grad_norm": 0.288570374250412, "learning_rate": 0.00010509050173572699, "loss": 0.1763126403093338, "mean_token_accuracy": 0.9280012547969818, "num_tokens": 87224772.0, "step": 7071 }, { "entropy": 1.0355613380670547, "epoch": 3.724065297525013, "grad_norm": 0.3108993172645569, "learning_rate": 0.00010506860624449779, "loss": 0.18876023590564728, "mean_token_accuracy": 0.9230781495571136, "num_tokens": 87237108.0, "step": 7072 }, { "entropy": 1.0131930708885193, "epoch": 3.724591890468668, "grad_norm": 0.24582242965698242, "learning_rate": 0.00010504671104601671, "loss": 0.1521173119544983, "mean_token_accuracy": 0.9366391003131866, "num_tokens": 87249444.0, "step": 7073 }, { "entropy": 1.016406238079071, "epoch": 3.7251184834123223, "grad_norm": 0.29857704043388367, "learning_rate": 0.00010502481614158353, "loss": 0.17020674049854279, "mean_token_accuracy": 0.9255031496286392, "num_tokens": 87261780.0, "step": 7074 }, { "entropy": 0.9883182942867279, "epoch": 3.7256450763559767, "grad_norm": 0.2852786183357239, "learning_rate": 0.00010500292153249798, "loss": 0.189723938703537, "mean_token_accuracy": 0.9228391647338867, "num_tokens": 87274116.0, "step": 7075 }, { "entropy": 1.013285368680954, "epoch": 3.7261716692996316, "grad_norm": 0.30359360575675964, "learning_rate": 0.00010498102722005987, "loss": 0.1763514131307602, "mean_token_accuracy": 0.9228106886148453, "num_tokens": 87286452.0, "step": 7076 }, { "entropy": 0.9790749102830887, "epoch": 3.726698262243286, "grad_norm": 0.2750509977340698, "learning_rate": 0.00010495913320556891, "loss": 0.18288496136665344, "mean_token_accuracy": 0.9239853918552399, "num_tokens": 87298788.0, "step": 7077 }, { "entropy": 1.0321734845638275, "epoch": 3.7272248551869405, "grad_norm": 0.29339393973350525, "learning_rate": 0.00010493723949032486, "loss": 0.17784325778484344, "mean_token_accuracy": 0.9215517640113831, "num_tokens": 87311124.0, "step": 7078 }, { "entropy": 1.030923455953598, "epoch": 3.727751448130595, "grad_norm": 0.27889496088027954, "learning_rate": 0.00010491534607562739, "loss": 0.1686307191848755, "mean_token_accuracy": 0.9292322397232056, "num_tokens": 87323460.0, "step": 7079 }, { "entropy": 1.0209147930145264, "epoch": 3.7282780410742498, "grad_norm": 0.29664507508277893, "learning_rate": 0.0001048934529627762, "loss": 0.18868425488471985, "mean_token_accuracy": 0.9178652465343475, "num_tokens": 87335796.0, "step": 7080 }, { "entropy": 1.016210913658142, "epoch": 3.728804634017904, "grad_norm": 0.3059195876121521, "learning_rate": 0.00010487156015307092, "loss": 0.1921241283416748, "mean_token_accuracy": 0.9246607571840286, "num_tokens": 87348132.0, "step": 7081 }, { "entropy": 1.028878003358841, "epoch": 3.7293312269615586, "grad_norm": 0.29554203152656555, "learning_rate": 0.00010484966764781123, "loss": 0.18789461255073547, "mean_token_accuracy": 0.9193727970123291, "num_tokens": 87360468.0, "step": 7082 }, { "entropy": 0.964047983288765, "epoch": 3.729857819905213, "grad_norm": 0.2756931781768799, "learning_rate": 0.00010482777544829671, "loss": 0.17855557799339294, "mean_token_accuracy": 0.921904906630516, "num_tokens": 87372804.0, "step": 7083 }, { "entropy": 1.0087389796972275, "epoch": 3.730384412848868, "grad_norm": 0.27971115708351135, "learning_rate": 0.00010480588355582708, "loss": 0.17549286782741547, "mean_token_accuracy": 0.9275772571563721, "num_tokens": 87385140.0, "step": 7084 }, { "entropy": 1.0169537961483002, "epoch": 3.7309110057925223, "grad_norm": 0.2893778383731842, "learning_rate": 0.00010478399197170183, "loss": 0.17516522109508514, "mean_token_accuracy": 0.9268490374088287, "num_tokens": 87397476.0, "step": 7085 }, { "entropy": 1.0312487930059433, "epoch": 3.7314375987361768, "grad_norm": 0.27305132150650024, "learning_rate": 0.0001047621006972206, "loss": 0.1587783694267273, "mean_token_accuracy": 0.9328574538230896, "num_tokens": 87409812.0, "step": 7086 }, { "entropy": 1.0589696168899536, "epoch": 3.7319641916798316, "grad_norm": 0.31207895278930664, "learning_rate": 0.00010474020973368293, "loss": 0.18918633460998535, "mean_token_accuracy": 0.9184137284755707, "num_tokens": 87422148.0, "step": 7087 }, { "entropy": 0.9988068491220474, "epoch": 3.732490784623486, "grad_norm": 0.2731066048145294, "learning_rate": 0.00010471831908238834, "loss": 0.16324186325073242, "mean_token_accuracy": 0.9312383532524109, "num_tokens": 87434484.0, "step": 7088 }, { "entropy": 0.9938575476408005, "epoch": 3.7330173775671405, "grad_norm": 0.27274930477142334, "learning_rate": 0.00010469642874463634, "loss": 0.1695559173822403, "mean_token_accuracy": 0.9315649718046188, "num_tokens": 87446820.0, "step": 7089 }, { "entropy": 1.025950849056244, "epoch": 3.7335439705107953, "grad_norm": 0.3154991567134857, "learning_rate": 0.00010467453872172646, "loss": 0.20251576602458954, "mean_token_accuracy": 0.9197258055210114, "num_tokens": 87459156.0, "step": 7090 }, { "entropy": 0.9701757431030273, "epoch": 3.7340705634544498, "grad_norm": 0.27344241738319397, "learning_rate": 0.00010465264901495819, "loss": 0.17037051916122437, "mean_token_accuracy": 0.9294610321521759, "num_tokens": 87471492.0, "step": 7091 }, { "entropy": 1.0319063663482666, "epoch": 3.734597156398104, "grad_norm": 0.34979090094566345, "learning_rate": 0.00010463075962563099, "loss": 0.19255414605140686, "mean_token_accuracy": 0.9198327660560608, "num_tokens": 87483828.0, "step": 7092 }, { "entropy": 1.0084194839000702, "epoch": 3.735123749341759, "grad_norm": 0.3136915862560272, "learning_rate": 0.00010460887055504427, "loss": 0.18214285373687744, "mean_token_accuracy": 0.9235022515058517, "num_tokens": 87496164.0, "step": 7093 }, { "entropy": 0.9943555891513824, "epoch": 3.7356503422854135, "grad_norm": 0.2898204028606415, "learning_rate": 0.0001045869818044975, "loss": 0.1824132204055786, "mean_token_accuracy": 0.9250787794589996, "num_tokens": 87508500.0, "step": 7094 }, { "entropy": 0.9767244309186935, "epoch": 3.736176935229068, "grad_norm": 0.31859782338142395, "learning_rate": 0.0001045650933752901, "loss": 0.18570992350578308, "mean_token_accuracy": 0.9204951971769333, "num_tokens": 87520836.0, "step": 7095 }, { "entropy": 0.9487767368555069, "epoch": 3.7367035281727223, "grad_norm": 0.30867719650268555, "learning_rate": 0.00010454320526872139, "loss": 0.19354388117790222, "mean_token_accuracy": 0.9184281229972839, "num_tokens": 87533172.0, "step": 7096 }, { "entropy": 0.9652345925569534, "epoch": 3.737230121116377, "grad_norm": 0.28436383605003357, "learning_rate": 0.00010452131748609076, "loss": 0.15788644552230835, "mean_token_accuracy": 0.9355803728103638, "num_tokens": 87545508.0, "step": 7097 }, { "entropy": 0.9447768330574036, "epoch": 3.7377567140600316, "grad_norm": 0.3082371950149536, "learning_rate": 0.00010449943002869762, "loss": 0.19267767667770386, "mean_token_accuracy": 0.9179702401161194, "num_tokens": 87557844.0, "step": 7098 }, { "entropy": 0.9711893647909164, "epoch": 3.738283307003686, "grad_norm": 0.3047843873500824, "learning_rate": 0.00010447754289784126, "loss": 0.17203961312770844, "mean_token_accuracy": 0.9273226410150528, "num_tokens": 87570180.0, "step": 7099 }, { "entropy": 0.9295950829982758, "epoch": 3.7388098999473405, "grad_norm": 0.287088543176651, "learning_rate": 0.00010445565609482097, "loss": 0.1747625172138214, "mean_token_accuracy": 0.9251388758420944, "num_tokens": 87582516.0, "step": 7100 }, { "entropy": 1.0014701783657074, "epoch": 3.7393364928909953, "grad_norm": 0.30902376770973206, "learning_rate": 0.00010443376962093607, "loss": 0.1791127324104309, "mean_token_accuracy": 0.925250843167305, "num_tokens": 87594852.0, "step": 7101 }, { "entropy": 0.9752064198255539, "epoch": 3.7398630858346498, "grad_norm": 0.294033944606781, "learning_rate": 0.00010441188347748583, "loss": 0.1893167346715927, "mean_token_accuracy": 0.9265682995319366, "num_tokens": 87607188.0, "step": 7102 }, { "entropy": 0.9655837267637253, "epoch": 3.740389678778304, "grad_norm": 0.30552423000335693, "learning_rate": 0.00010438999766576949, "loss": 0.1884727030992508, "mean_token_accuracy": 0.92208431661129, "num_tokens": 87619524.0, "step": 7103 }, { "entropy": 1.0147232711315155, "epoch": 3.740916271721959, "grad_norm": 0.3045092523097992, "learning_rate": 0.00010436811218708628, "loss": 0.19394133985042572, "mean_token_accuracy": 0.9220876395702362, "num_tokens": 87631860.0, "step": 7104 }, { "entropy": 0.9478363990783691, "epoch": 3.7414428646656135, "grad_norm": 0.29392796754837036, "learning_rate": 0.00010434622704273545, "loss": 0.17552950978279114, "mean_token_accuracy": 0.9269378036260605, "num_tokens": 87644196.0, "step": 7105 }, { "entropy": 0.9850336462259293, "epoch": 3.741969457609268, "grad_norm": 0.29128676652908325, "learning_rate": 0.00010432434223401615, "loss": 0.17779776453971863, "mean_token_accuracy": 0.9280469864606857, "num_tokens": 87656532.0, "step": 7106 }, { "entropy": 0.9837324321269989, "epoch": 3.742496050552923, "grad_norm": 0.3252773880958557, "learning_rate": 0.00010430245776222758, "loss": 0.19084057211875916, "mean_token_accuracy": 0.9230901747941971, "num_tokens": 87668868.0, "step": 7107 }, { "entropy": 1.038240522146225, "epoch": 3.743022643496577, "grad_norm": 0.28228163719177246, "learning_rate": 0.00010428057362866888, "loss": 0.17360344529151917, "mean_token_accuracy": 0.9263254404067993, "num_tokens": 87681204.0, "step": 7108 }, { "entropy": 1.0297512263059616, "epoch": 3.7435492364402316, "grad_norm": 0.2939990758895874, "learning_rate": 0.0001042586898346392, "loss": 0.19297507405281067, "mean_token_accuracy": 0.9198752194643021, "num_tokens": 87693540.0, "step": 7109 }, { "entropy": 0.9940708875656128, "epoch": 3.7440758293838865, "grad_norm": 0.273837685585022, "learning_rate": 0.00010423680638143764, "loss": 0.17688986659049988, "mean_token_accuracy": 0.9205555766820908, "num_tokens": 87705876.0, "step": 7110 }, { "entropy": 1.0277384221553802, "epoch": 3.744602422327541, "grad_norm": 0.28091904520988464, "learning_rate": 0.00010421492327036327, "loss": 0.1765642613172531, "mean_token_accuracy": 0.9265970140695572, "num_tokens": 87718212.0, "step": 7111 }, { "entropy": 0.9914429187774658, "epoch": 3.7451290152711953, "grad_norm": 0.2665352523326874, "learning_rate": 0.00010419304050271519, "loss": 0.17894355952739716, "mean_token_accuracy": 0.922010600566864, "num_tokens": 87730548.0, "step": 7112 }, { "entropy": 1.055834949016571, "epoch": 3.7456556082148498, "grad_norm": 0.28357288241386414, "learning_rate": 0.00010417115807979248, "loss": 0.17035986483097076, "mean_token_accuracy": 0.932903915643692, "num_tokens": 87742884.0, "step": 7113 }, { "entropy": 1.0203563868999481, "epoch": 3.746182201158504, "grad_norm": 0.3063550293445587, "learning_rate": 0.00010414927600289412, "loss": 0.18917737901210785, "mean_token_accuracy": 0.9191833138465881, "num_tokens": 87755220.0, "step": 7114 }, { "entropy": 1.0060118436813354, "epoch": 3.746708794102159, "grad_norm": 0.28606951236724854, "learning_rate": 0.00010412739427331917, "loss": 0.18628007173538208, "mean_token_accuracy": 0.9235791712999344, "num_tokens": 87767556.0, "step": 7115 }, { "entropy": 1.0224921852350235, "epoch": 3.7472353870458135, "grad_norm": 0.27402663230895996, "learning_rate": 0.00010410551289236656, "loss": 0.1804238259792328, "mean_token_accuracy": 0.9233539551496506, "num_tokens": 87779892.0, "step": 7116 }, { "entropy": 1.0892615020275116, "epoch": 3.747761979989468, "grad_norm": 0.28371381759643555, "learning_rate": 0.00010408363186133532, "loss": 0.17050835490226746, "mean_token_accuracy": 0.928670272231102, "num_tokens": 87792228.0, "step": 7117 }, { "entropy": 1.0294643342494965, "epoch": 3.748288572933123, "grad_norm": 0.2943047881126404, "learning_rate": 0.00010406175118152432, "loss": 0.18783560395240784, "mean_token_accuracy": 0.9241560995578766, "num_tokens": 87804564.0, "step": 7118 }, { "entropy": 1.0753727555274963, "epoch": 3.748815165876777, "grad_norm": 0.32707637548446655, "learning_rate": 0.0001040398708542326, "loss": 0.18916916847229004, "mean_token_accuracy": 0.9227591007947922, "num_tokens": 87816900.0, "step": 7119 }, { "entropy": 1.122930258512497, "epoch": 3.7493417588204316, "grad_norm": 0.30631089210510254, "learning_rate": 0.00010401799088075899, "loss": 0.16908381879329681, "mean_token_accuracy": 0.9244441390037537, "num_tokens": 87829236.0, "step": 7120 }, { "entropy": 1.0308923721313477, "epoch": 3.7498683517640865, "grad_norm": 0.2576659321784973, "learning_rate": 0.00010399611126240238, "loss": 0.17816726863384247, "mean_token_accuracy": 0.9263759553432465, "num_tokens": 87841572.0, "step": 7121 }, { "entropy": 1.0776856541633606, "epoch": 3.750394944707741, "grad_norm": 0.2968147397041321, "learning_rate": 0.00010397423200046168, "loss": 0.1893785148859024, "mean_token_accuracy": 0.9209145456552505, "num_tokens": 87853908.0, "step": 7122 }, { "entropy": 1.1022182703018188, "epoch": 3.7509215376513954, "grad_norm": 0.2902420163154602, "learning_rate": 0.0001039523530962357, "loss": 0.1806715726852417, "mean_token_accuracy": 0.9261004626750946, "num_tokens": 87866244.0, "step": 7123 }, { "entropy": 1.0705251097679138, "epoch": 3.7514481305950502, "grad_norm": 0.29407504200935364, "learning_rate": 0.00010393047455102328, "loss": 0.18582364916801453, "mean_token_accuracy": 0.9204881638288498, "num_tokens": 87878580.0, "step": 7124 }, { "entropy": 1.0737611651420593, "epoch": 3.7519747235387046, "grad_norm": 0.2850419580936432, "learning_rate": 0.00010390859636612316, "loss": 0.18563367426395416, "mean_token_accuracy": 0.9202277064323425, "num_tokens": 87890916.0, "step": 7125 }, { "entropy": 1.084518700838089, "epoch": 3.752501316482359, "grad_norm": 0.27986982464790344, "learning_rate": 0.0001038867185428342, "loss": 0.1888093650341034, "mean_token_accuracy": 0.9146895706653595, "num_tokens": 87903252.0, "step": 7126 }, { "entropy": 1.0868968069553375, "epoch": 3.753027909426014, "grad_norm": 0.2747521996498108, "learning_rate": 0.00010386484108245513, "loss": 0.1743554174900055, "mean_token_accuracy": 0.9248699843883514, "num_tokens": 87915588.0, "step": 7127 }, { "entropy": 1.12200728058815, "epoch": 3.7535545023696684, "grad_norm": 0.27726665139198303, "learning_rate": 0.0001038429639862847, "loss": 0.17595049738883972, "mean_token_accuracy": 0.9274223297834396, "num_tokens": 87927924.0, "step": 7128 }, { "entropy": 1.117217406630516, "epoch": 3.754081095313323, "grad_norm": 0.29257217049598694, "learning_rate": 0.00010382108725562161, "loss": 0.17220927774906158, "mean_token_accuracy": 0.9267859756946564, "num_tokens": 87940260.0, "step": 7129 }, { "entropy": 1.0715479254722595, "epoch": 3.754607688256977, "grad_norm": 0.2643260955810547, "learning_rate": 0.00010379921089176454, "loss": 0.14874723553657532, "mean_token_accuracy": 0.9353399723768234, "num_tokens": 87952596.0, "step": 7130 }, { "entropy": 1.1052345633506775, "epoch": 3.7551342812006316, "grad_norm": 0.2888478934764862, "learning_rate": 0.00010377733489601217, "loss": 0.16529148817062378, "mean_token_accuracy": 0.9293965697288513, "num_tokens": 87964932.0, "step": 7131 }, { "entropy": 1.0375074446201324, "epoch": 3.7556608741442865, "grad_norm": 0.26645591855049133, "learning_rate": 0.00010375545926966316, "loss": 0.17097528278827667, "mean_token_accuracy": 0.9303841888904572, "num_tokens": 87977268.0, "step": 7132 }, { "entropy": 1.0503558665513992, "epoch": 3.756187467087941, "grad_norm": 0.31690800189971924, "learning_rate": 0.00010373358401401616, "loss": 0.19033551216125488, "mean_token_accuracy": 0.9215103983879089, "num_tokens": 87989604.0, "step": 7133 }, { "entropy": 1.1111974716186523, "epoch": 3.7567140600315954, "grad_norm": 0.2914089262485504, "learning_rate": 0.00010371170913036974, "loss": 0.16939187049865723, "mean_token_accuracy": 0.9296749085187912, "num_tokens": 88001940.0, "step": 7134 }, { "entropy": 1.149122953414917, "epoch": 3.7572406529752502, "grad_norm": 0.31661757826805115, "learning_rate": 0.00010368983462002251, "loss": 0.17850740253925323, "mean_token_accuracy": 0.9292630702257156, "num_tokens": 88014276.0, "step": 7135 }, { "entropy": 1.104194015264511, "epoch": 3.7577672459189047, "grad_norm": 0.3128017783164978, "learning_rate": 0.000103667960484273, "loss": 0.18695411086082458, "mean_token_accuracy": 0.9218857288360596, "num_tokens": 88026612.0, "step": 7136 }, { "entropy": 1.098086178302765, "epoch": 3.758293838862559, "grad_norm": 0.289302259683609, "learning_rate": 0.0001036460867244198, "loss": 0.16781547665596008, "mean_token_accuracy": 0.9273310452699661, "num_tokens": 88038948.0, "step": 7137 }, { "entropy": 1.0770449936389923, "epoch": 3.758820431806214, "grad_norm": 0.31516364216804504, "learning_rate": 0.00010362421334176138, "loss": 0.18100041151046753, "mean_token_accuracy": 0.9250895977020264, "num_tokens": 88051284.0, "step": 7138 }, { "entropy": 1.082071304321289, "epoch": 3.7593470247498684, "grad_norm": 0.3046118915081024, "learning_rate": 0.00010360234033759621, "loss": 0.17777326703071594, "mean_token_accuracy": 0.9293287992477417, "num_tokens": 88063620.0, "step": 7139 }, { "entropy": 1.1441842019557953, "epoch": 3.759873617693523, "grad_norm": 0.3186715245246887, "learning_rate": 0.00010358046771322287, "loss": 0.1779317408800125, "mean_token_accuracy": 0.9298745840787888, "num_tokens": 88075956.0, "step": 7140 }, { "entropy": 1.1175787448883057, "epoch": 3.7604002106371777, "grad_norm": 0.3357693552970886, "learning_rate": 0.00010355859546993973, "loss": 0.20494714379310608, "mean_token_accuracy": 0.9127781838178635, "num_tokens": 88088292.0, "step": 7141 }, { "entropy": 1.1210220456123352, "epoch": 3.760926803580832, "grad_norm": 0.30628088116645813, "learning_rate": 0.00010353672360904522, "loss": 0.1719299852848053, "mean_token_accuracy": 0.9311191439628601, "num_tokens": 88100628.0, "step": 7142 }, { "entropy": 1.0917105376720428, "epoch": 3.7614533965244865, "grad_norm": 0.2801833152770996, "learning_rate": 0.0001035148521318378, "loss": 0.17148740589618683, "mean_token_accuracy": 0.9297465682029724, "num_tokens": 88112964.0, "step": 7143 }, { "entropy": 1.0566374361515045, "epoch": 3.7619799894681414, "grad_norm": 0.2890241742134094, "learning_rate": 0.00010349298103961577, "loss": 0.17020730674266815, "mean_token_accuracy": 0.9320740401744843, "num_tokens": 88125300.0, "step": 7144 }, { "entropy": 1.1605753600597382, "epoch": 3.762506582411796, "grad_norm": 0.3184696137905121, "learning_rate": 0.00010347111033367754, "loss": 0.18983620405197144, "mean_token_accuracy": 0.9197225421667099, "num_tokens": 88137636.0, "step": 7145 }, { "entropy": 1.1180182695388794, "epoch": 3.7630331753554502, "grad_norm": 0.30830660462379456, "learning_rate": 0.0001034492400153214, "loss": 0.17144691944122314, "mean_token_accuracy": 0.9264721274375916, "num_tokens": 88149972.0, "step": 7146 }, { "entropy": 1.1877989172935486, "epoch": 3.7635597682991047, "grad_norm": 0.29914480447769165, "learning_rate": 0.00010342737008584573, "loss": 0.1823132485151291, "mean_token_accuracy": 0.9239718466997147, "num_tokens": 88162308.0, "step": 7147 }, { "entropy": 1.0980007946491241, "epoch": 3.764086361242759, "grad_norm": 0.2649677097797394, "learning_rate": 0.0001034055005465488, "loss": 0.16298440098762512, "mean_token_accuracy": 0.9309890568256378, "num_tokens": 88174644.0, "step": 7148 }, { "entropy": 1.1103598475456238, "epoch": 3.764612954186414, "grad_norm": 0.27731263637542725, "learning_rate": 0.00010338363139872887, "loss": 0.16658708453178406, "mean_token_accuracy": 0.9308271110057831, "num_tokens": 88186980.0, "step": 7149 }, { "entropy": 1.0874804258346558, "epoch": 3.7651395471300684, "grad_norm": 0.3050479590892792, "learning_rate": 0.00010336176264368418, "loss": 0.1813635528087616, "mean_token_accuracy": 0.9246079325675964, "num_tokens": 88199316.0, "step": 7150 }, { "entropy": 1.0669877976179123, "epoch": 3.765666140073723, "grad_norm": 0.2986302673816681, "learning_rate": 0.00010333989428271294, "loss": 0.1748489886522293, "mean_token_accuracy": 0.9280883967876434, "num_tokens": 88211652.0, "step": 7151 }, { "entropy": 1.130952626466751, "epoch": 3.7661927330173777, "grad_norm": 0.3100493848323822, "learning_rate": 0.00010331802631711335, "loss": 0.19673530757427216, "mean_token_accuracy": 0.9181911945343018, "num_tokens": 88223988.0, "step": 7152 }, { "entropy": 1.1111083626747131, "epoch": 3.766719325961032, "grad_norm": 0.28959664702415466, "learning_rate": 0.00010329615874818359, "loss": 0.1911488175392151, "mean_token_accuracy": 0.9209056049585342, "num_tokens": 88236324.0, "step": 7153 }, { "entropy": 1.1012301445007324, "epoch": 3.7672459189046865, "grad_norm": 0.2829752564430237, "learning_rate": 0.00010327429157722181, "loss": 0.16403992474079132, "mean_token_accuracy": 0.9249609857797623, "num_tokens": 88248660.0, "step": 7154 }, { "entropy": 1.0873798429965973, "epoch": 3.7677725118483414, "grad_norm": 0.30785346031188965, "learning_rate": 0.00010325242480552617, "loss": 0.1962447166442871, "mean_token_accuracy": 0.9166468977928162, "num_tokens": 88260996.0, "step": 7155 }, { "entropy": 1.1623855829238892, "epoch": 3.768299104791996, "grad_norm": 0.28202804923057556, "learning_rate": 0.00010323055843439473, "loss": 0.17079147696495056, "mean_token_accuracy": 0.9259966462850571, "num_tokens": 88273332.0, "step": 7156 }, { "entropy": 1.1565687954425812, "epoch": 3.7688256977356502, "grad_norm": 0.2951604425907135, "learning_rate": 0.00010320869246512557, "loss": 0.18850970268249512, "mean_token_accuracy": 0.9177795052528381, "num_tokens": 88285668.0, "step": 7157 }, { "entropy": 1.0610617399215698, "epoch": 3.769352290679305, "grad_norm": 0.25743353366851807, "learning_rate": 0.00010318682689901677, "loss": 0.16640762984752655, "mean_token_accuracy": 0.9265040755271912, "num_tokens": 88298004.0, "step": 7158 }, { "entropy": 1.0700703561306, "epoch": 3.7698788836229595, "grad_norm": 0.2738151252269745, "learning_rate": 0.00010316496173736636, "loss": 0.1697658896446228, "mean_token_accuracy": 0.9291802495718002, "num_tokens": 88310340.0, "step": 7159 }, { "entropy": 1.1381312012672424, "epoch": 3.770405476566614, "grad_norm": 0.29495909810066223, "learning_rate": 0.00010314309698147226, "loss": 0.1771652102470398, "mean_token_accuracy": 0.9262112379074097, "num_tokens": 88322676.0, "step": 7160 }, { "entropy": 1.1073337495326996, "epoch": 3.770932069510269, "grad_norm": 0.2812015116214752, "learning_rate": 0.00010312123263263258, "loss": 0.1764044165611267, "mean_token_accuracy": 0.9280906170606613, "num_tokens": 88335012.0, "step": 7161 }, { "entropy": 1.0950949639081955, "epoch": 3.7714586624539232, "grad_norm": 0.2788774371147156, "learning_rate": 0.00010309936869214525, "loss": 0.1627884954214096, "mean_token_accuracy": 0.932257205247879, "num_tokens": 88347348.0, "step": 7162 }, { "entropy": 1.105437308549881, "epoch": 3.7719852553975777, "grad_norm": 0.28457725048065186, "learning_rate": 0.00010307750516130815, "loss": 0.17091962695121765, "mean_token_accuracy": 0.9235321432352066, "num_tokens": 88359684.0, "step": 7163 }, { "entropy": 1.091333419084549, "epoch": 3.772511848341232, "grad_norm": 0.29195544123649597, "learning_rate": 0.00010305564204141924, "loss": 0.18163371086120605, "mean_token_accuracy": 0.9292350262403488, "num_tokens": 88372020.0, "step": 7164 }, { "entropy": 1.0755595266819, "epoch": 3.7730384412848865, "grad_norm": 0.28921985626220703, "learning_rate": 0.00010303377933377636, "loss": 0.19467858970165253, "mean_token_accuracy": 0.9174851328134537, "num_tokens": 88384356.0, "step": 7165 }, { "entropy": 1.1279121041297913, "epoch": 3.7735650342285414, "grad_norm": 0.3318541646003723, "learning_rate": 0.00010301191703967742, "loss": 0.20074036717414856, "mean_token_accuracy": 0.9134417325258255, "num_tokens": 88396692.0, "step": 7166 }, { "entropy": 1.0769948661327362, "epoch": 3.774091627172196, "grad_norm": 0.2806553840637207, "learning_rate": 0.00010299005516042022, "loss": 0.17609083652496338, "mean_token_accuracy": 0.9280765205621719, "num_tokens": 88409028.0, "step": 7167 }, { "entropy": 1.100732684135437, "epoch": 3.7746182201158502, "grad_norm": 0.30120766162872314, "learning_rate": 0.00010296819369730258, "loss": 0.19822050631046295, "mean_token_accuracy": 0.9118075370788574, "num_tokens": 88421364.0, "step": 7168 }, { "entropy": 1.095085084438324, "epoch": 3.775144813059505, "grad_norm": 0.27734094858169556, "learning_rate": 0.00010294633265162233, "loss": 0.16742560267448425, "mean_token_accuracy": 0.9289995431900024, "num_tokens": 88433700.0, "step": 7169 }, { "entropy": 1.0630706548690796, "epoch": 3.7756714060031595, "grad_norm": 0.2720811665058136, "learning_rate": 0.00010292447202467716, "loss": 0.1635817140340805, "mean_token_accuracy": 0.9314915537834167, "num_tokens": 88446036.0, "step": 7170 }, { "entropy": 1.0302708148956299, "epoch": 3.776197998946814, "grad_norm": 0.28553077578544617, "learning_rate": 0.00010290261181776488, "loss": 0.18625357747077942, "mean_token_accuracy": 0.9199012070894241, "num_tokens": 88458372.0, "step": 7171 }, { "entropy": 1.0996154844760895, "epoch": 3.776724591890469, "grad_norm": 0.2932043969631195, "learning_rate": 0.00010288075203218315, "loss": 0.18521277606487274, "mean_token_accuracy": 0.9185535311698914, "num_tokens": 88470708.0, "step": 7172 }, { "entropy": 1.123921811580658, "epoch": 3.7772511848341233, "grad_norm": 0.2973147928714752, "learning_rate": 0.0001028588926692297, "loss": 0.18819671869277954, "mean_token_accuracy": 0.9193670153617859, "num_tokens": 88483044.0, "step": 7173 }, { "entropy": 1.0878064036369324, "epoch": 3.7777777777777777, "grad_norm": 0.27763670682907104, "learning_rate": 0.00010283703373020212, "loss": 0.17634183168411255, "mean_token_accuracy": 0.92812779545784, "num_tokens": 88495380.0, "step": 7174 }, { "entropy": 1.1034175157546997, "epoch": 3.7783043707214325, "grad_norm": 0.30256980657577515, "learning_rate": 0.00010281517521639814, "loss": 0.18281732499599457, "mean_token_accuracy": 0.9237858802080154, "num_tokens": 88507716.0, "step": 7175 }, { "entropy": 1.0836420059204102, "epoch": 3.778830963665087, "grad_norm": 0.28862160444259644, "learning_rate": 0.00010279331712911533, "loss": 0.16188812255859375, "mean_token_accuracy": 0.9328870177268982, "num_tokens": 88520052.0, "step": 7176 }, { "entropy": 1.130695253610611, "epoch": 3.7793575566087414, "grad_norm": 0.29959797859191895, "learning_rate": 0.00010277145946965127, "loss": 0.18327149748802185, "mean_token_accuracy": 0.9227287471294403, "num_tokens": 88532388.0, "step": 7177 }, { "entropy": 1.0789493918418884, "epoch": 3.7798841495523963, "grad_norm": 0.30192306637763977, "learning_rate": 0.00010274960223930354, "loss": 0.19548943638801575, "mean_token_accuracy": 0.9164448976516724, "num_tokens": 88544724.0, "step": 7178 }, { "entropy": 1.0900969803333282, "epoch": 3.7804107424960507, "grad_norm": 0.3188364803791046, "learning_rate": 0.00010272774543936968, "loss": 0.1938486248254776, "mean_token_accuracy": 0.9169595688581467, "num_tokens": 88557060.0, "step": 7179 }, { "entropy": 1.0823054313659668, "epoch": 3.780937335439705, "grad_norm": 0.2802466154098511, "learning_rate": 0.00010270588907114716, "loss": 0.1587461233139038, "mean_token_accuracy": 0.9326314032077789, "num_tokens": 88569396.0, "step": 7180 }, { "entropy": 1.068724662065506, "epoch": 3.7814639283833595, "grad_norm": 0.28032195568084717, "learning_rate": 0.00010268403313593349, "loss": 0.1607462763786316, "mean_token_accuracy": 0.9316603094339371, "num_tokens": 88581732.0, "step": 7181 }, { "entropy": 1.0886749029159546, "epoch": 3.781990521327014, "grad_norm": 0.30621814727783203, "learning_rate": 0.00010266217763502613, "loss": 0.1921982765197754, "mean_token_accuracy": 0.9193924516439438, "num_tokens": 88594068.0, "step": 7182 }, { "entropy": 1.0444151908159256, "epoch": 3.782517114270669, "grad_norm": 0.316541463136673, "learning_rate": 0.00010264032256972254, "loss": 0.19500555098056793, "mean_token_accuracy": 0.9189309179782867, "num_tokens": 88606404.0, "step": 7183 }, { "entropy": 1.05389966070652, "epoch": 3.7830437072143233, "grad_norm": 0.30011123418807983, "learning_rate": 0.00010261846794132009, "loss": 0.18319684267044067, "mean_token_accuracy": 0.92215596139431, "num_tokens": 88618740.0, "step": 7184 }, { "entropy": 1.0236373394727707, "epoch": 3.7835703001579777, "grad_norm": 0.27942049503326416, "learning_rate": 0.00010259661375111618, "loss": 0.1714269518852234, "mean_token_accuracy": 0.9292668700218201, "num_tokens": 88631076.0, "step": 7185 }, { "entropy": 1.0853042006492615, "epoch": 3.7840968931016326, "grad_norm": 0.30122044682502747, "learning_rate": 0.00010257476000040816, "loss": 0.1864994615316391, "mean_token_accuracy": 0.9235980659723282, "num_tokens": 88643412.0, "step": 7186 }, { "entropy": 1.0853917300701141, "epoch": 3.784623486045287, "grad_norm": 0.27920642495155334, "learning_rate": 0.00010255290669049336, "loss": 0.16710279881954193, "mean_token_accuracy": 0.9283783286809921, "num_tokens": 88655748.0, "step": 7187 }, { "entropy": 1.0690882205963135, "epoch": 3.7851500789889414, "grad_norm": 0.357407808303833, "learning_rate": 0.00010253105382266906, "loss": 0.21778488159179688, "mean_token_accuracy": 0.9111634343862534, "num_tokens": 88668084.0, "step": 7188 }, { "entropy": 1.0412110090255737, "epoch": 3.7856766719325963, "grad_norm": 0.30147868394851685, "learning_rate": 0.0001025092013982326, "loss": 0.17533808946609497, "mean_token_accuracy": 0.9283206611871719, "num_tokens": 88680420.0, "step": 7189 }, { "entropy": 1.0542258024215698, "epoch": 3.7862032648762507, "grad_norm": 0.29640671610832214, "learning_rate": 0.00010248734941848117, "loss": 0.17819085717201233, "mean_token_accuracy": 0.9252132475376129, "num_tokens": 88692756.0, "step": 7190 }, { "entropy": 1.0278376340866089, "epoch": 3.786729857819905, "grad_norm": 0.310051292181015, "learning_rate": 0.00010246549788471203, "loss": 0.19025927782058716, "mean_token_accuracy": 0.9163366258144379, "num_tokens": 88705092.0, "step": 7191 }, { "entropy": 1.0549766272306442, "epoch": 3.78725645076356, "grad_norm": 0.32528188824653625, "learning_rate": 0.00010244364679822238, "loss": 0.20853351056575775, "mean_token_accuracy": 0.9162613600492477, "num_tokens": 88717428.0, "step": 7192 }, { "entropy": 1.0296104848384857, "epoch": 3.7877830437072144, "grad_norm": 0.2889884412288666, "learning_rate": 0.00010242179616030935, "loss": 0.17803248763084412, "mean_token_accuracy": 0.93204265832901, "num_tokens": 88729764.0, "step": 7193 }, { "entropy": 1.06743985414505, "epoch": 3.788309636650869, "grad_norm": 0.3100864887237549, "learning_rate": 0.00010239994597227014, "loss": 0.17786242067813873, "mean_token_accuracy": 0.9230290651321411, "num_tokens": 88742100.0, "step": 7194 }, { "entropy": 1.0340757369995117, "epoch": 3.7888362295945237, "grad_norm": 0.2721974551677704, "learning_rate": 0.00010237809623540178, "loss": 0.18255293369293213, "mean_token_accuracy": 0.9202168434858322, "num_tokens": 88754436.0, "step": 7195 }, { "entropy": 0.9922773838043213, "epoch": 3.789362822538178, "grad_norm": 0.2785194218158722, "learning_rate": 0.00010235624695100147, "loss": 0.1667042225599289, "mean_token_accuracy": 0.9307727068662643, "num_tokens": 88766772.0, "step": 7196 }, { "entropy": 1.0679470002651215, "epoch": 3.7898894154818326, "grad_norm": 0.279930055141449, "learning_rate": 0.00010233439812036625, "loss": 0.1680060774087906, "mean_token_accuracy": 0.9259512722492218, "num_tokens": 88779108.0, "step": 7197 }, { "entropy": 1.0533702373504639, "epoch": 3.790416008425487, "grad_norm": 0.27056095004081726, "learning_rate": 0.00010231254974479312, "loss": 0.16815969347953796, "mean_token_accuracy": 0.9305378496646881, "num_tokens": 88791444.0, "step": 7198 }, { "entropy": 1.0571512877941132, "epoch": 3.7909426013691414, "grad_norm": 0.33323702216148376, "learning_rate": 0.0001022907018255791, "loss": 0.20830880105495453, "mean_token_accuracy": 0.913742259144783, "num_tokens": 88803780.0, "step": 7199 }, { "entropy": 1.0696991980075836, "epoch": 3.7914691943127963, "grad_norm": 0.2812376320362091, "learning_rate": 0.00010226885436402116, "loss": 0.17021866142749786, "mean_token_accuracy": 0.9285214692354202, "num_tokens": 88816116.0, "step": 7200 }, { "entropy": 1.0224677622318268, "epoch": 3.7919957872564507, "grad_norm": 0.2666688859462738, "learning_rate": 0.0001022470073614163, "loss": 0.15672501921653748, "mean_token_accuracy": 0.9360812902450562, "num_tokens": 88828452.0, "step": 7201 }, { "entropy": 1.0100512653589249, "epoch": 3.792522380200105, "grad_norm": 0.27672815322875977, "learning_rate": 0.00010222516081906139, "loss": 0.17214569449424744, "mean_token_accuracy": 0.9276096075773239, "num_tokens": 88840788.0, "step": 7202 }, { "entropy": 1.0761884450912476, "epoch": 3.79304897314376, "grad_norm": 0.31685155630111694, "learning_rate": 0.0001022033147382534, "loss": 0.18890151381492615, "mean_token_accuracy": 0.9192356020212173, "num_tokens": 88853124.0, "step": 7203 }, { "entropy": 1.0674984157085419, "epoch": 3.7935755660874144, "grad_norm": 0.28930044174194336, "learning_rate": 0.00010218146912028917, "loss": 0.18217478692531586, "mean_token_accuracy": 0.9230011254549026, "num_tokens": 88865460.0, "step": 7204 }, { "entropy": 1.0485822707414627, "epoch": 3.794102159031069, "grad_norm": 0.3020317256450653, "learning_rate": 0.00010215962396646554, "loss": 0.19102491438388824, "mean_token_accuracy": 0.9197740405797958, "num_tokens": 88877796.0, "step": 7205 }, { "entropy": 1.0452226996421814, "epoch": 3.7946287519747237, "grad_norm": 0.279055655002594, "learning_rate": 0.00010213777927807935, "loss": 0.17906352877616882, "mean_token_accuracy": 0.9296561032533646, "num_tokens": 88890132.0, "step": 7206 }, { "entropy": 1.043957456946373, "epoch": 3.795155344918378, "grad_norm": 0.27935850620269775, "learning_rate": 0.00010211593505642738, "loss": 0.17773735523223877, "mean_token_accuracy": 0.9236277043819427, "num_tokens": 88902468.0, "step": 7207 }, { "entropy": 1.0406917482614517, "epoch": 3.7956819378620326, "grad_norm": 0.2945674657821655, "learning_rate": 0.00010209409130280638, "loss": 0.17464163899421692, "mean_token_accuracy": 0.928332194685936, "num_tokens": 88914804.0, "step": 7208 }, { "entropy": 1.0502985268831253, "epoch": 3.7962085308056874, "grad_norm": 0.30945059657096863, "learning_rate": 0.00010207224801851307, "loss": 0.17953622341156006, "mean_token_accuracy": 0.9266233444213867, "num_tokens": 88927140.0, "step": 7209 }, { "entropy": 1.0640967786312103, "epoch": 3.796735123749342, "grad_norm": 0.3158370554447174, "learning_rate": 0.00010205040520484423, "loss": 0.17787714302539825, "mean_token_accuracy": 0.9302430152893066, "num_tokens": 88939476.0, "step": 7210 }, { "entropy": 1.0614418238401413, "epoch": 3.7972617166929963, "grad_norm": 0.2914262115955353, "learning_rate": 0.00010202856286309652, "loss": 0.18282458186149597, "mean_token_accuracy": 0.9210742712020874, "num_tokens": 88951812.0, "step": 7211 }, { "entropy": 1.052042379975319, "epoch": 3.7977883096366507, "grad_norm": 0.3105827867984772, "learning_rate": 0.00010200672099456654, "loss": 0.18357163667678833, "mean_token_accuracy": 0.92650206387043, "num_tokens": 88964148.0, "step": 7212 }, { "entropy": 1.0473193526268005, "epoch": 3.7983149025803056, "grad_norm": 0.2969362437725067, "learning_rate": 0.00010198487960055094, "loss": 0.1796019822359085, "mean_token_accuracy": 0.9263205826282501, "num_tokens": 88976484.0, "step": 7213 }, { "entropy": 0.9956441968679428, "epoch": 3.79884149552396, "grad_norm": 0.29836389422416687, "learning_rate": 0.00010196303868234636, "loss": 0.18609370291233063, "mean_token_accuracy": 0.9226072877645493, "num_tokens": 88988820.0, "step": 7214 }, { "entropy": 1.063538134098053, "epoch": 3.7993680884676144, "grad_norm": 0.30064263939857483, "learning_rate": 0.00010194119824124931, "loss": 0.19918721914291382, "mean_token_accuracy": 0.918574869632721, "num_tokens": 89001156.0, "step": 7215 }, { "entropy": 1.035595253109932, "epoch": 3.799894681411269, "grad_norm": 0.2827257215976715, "learning_rate": 0.0001019193582785563, "loss": 0.17484167218208313, "mean_token_accuracy": 0.9244060963392258, "num_tokens": 89013492.0, "step": 7216 }, { "entropy": 1.0159606635570526, "epoch": 3.8004212743549237, "grad_norm": 0.2863979935646057, "learning_rate": 0.00010189751879556395, "loss": 0.18061409890651703, "mean_token_accuracy": 0.9228454977273941, "num_tokens": 89025828.0, "step": 7217 }, { "entropy": 1.051970288157463, "epoch": 3.800947867298578, "grad_norm": 0.2826246917247772, "learning_rate": 0.00010187567979356867, "loss": 0.17374084889888763, "mean_token_accuracy": 0.930910050868988, "num_tokens": 89038164.0, "step": 7218 }, { "entropy": 1.0662977546453476, "epoch": 3.8014744602422326, "grad_norm": 0.29204562306404114, "learning_rate": 0.00010185384127386692, "loss": 0.18853583931922913, "mean_token_accuracy": 0.9232958853244781, "num_tokens": 89050500.0, "step": 7219 }, { "entropy": 1.131626844406128, "epoch": 3.8020010531858874, "grad_norm": 0.3503033220767975, "learning_rate": 0.00010183200323775515, "loss": 0.19388490915298462, "mean_token_accuracy": 0.9230544865131378, "num_tokens": 89062836.0, "step": 7220 }, { "entropy": 1.082968145608902, "epoch": 3.802527646129542, "grad_norm": 0.28977474570274353, "learning_rate": 0.00010181016568652975, "loss": 0.17399579286575317, "mean_token_accuracy": 0.9243248850107193, "num_tokens": 89075172.0, "step": 7221 }, { "entropy": 1.1116178333759308, "epoch": 3.8030542390731963, "grad_norm": 0.29531964659690857, "learning_rate": 0.00010178832862148706, "loss": 0.17993034422397614, "mean_token_accuracy": 0.9204618185758591, "num_tokens": 89087508.0, "step": 7222 }, { "entropy": 1.042968511581421, "epoch": 3.803580832016851, "grad_norm": 0.26373812556266785, "learning_rate": 0.00010176649204392342, "loss": 0.17210234701633453, "mean_token_accuracy": 0.9245043843984604, "num_tokens": 89099844.0, "step": 7223 }, { "entropy": 1.1081231236457825, "epoch": 3.8041074249605056, "grad_norm": 0.29073357582092285, "learning_rate": 0.00010174465595513516, "loss": 0.17837102711200714, "mean_token_accuracy": 0.9271133542060852, "num_tokens": 89112180.0, "step": 7224 }, { "entropy": 1.0379737168550491, "epoch": 3.80463401790416, "grad_norm": 0.2728631794452667, "learning_rate": 0.00010172282035641858, "loss": 0.1719096601009369, "mean_token_accuracy": 0.9286081343889236, "num_tokens": 89124516.0, "step": 7225 }, { "entropy": 1.0780547708272934, "epoch": 3.805160610847815, "grad_norm": 0.27084219455718994, "learning_rate": 0.00010170098524906994, "loss": 0.179472878575325, "mean_token_accuracy": 0.9250780194997787, "num_tokens": 89136852.0, "step": 7226 }, { "entropy": 1.078784555196762, "epoch": 3.8056872037914693, "grad_norm": 0.30687907338142395, "learning_rate": 0.00010167915063438542, "loss": 0.18293949961662292, "mean_token_accuracy": 0.9218228608369827, "num_tokens": 89149188.0, "step": 7227 }, { "entropy": 1.0638082027435303, "epoch": 3.8062137967351237, "grad_norm": 0.3069583773612976, "learning_rate": 0.00010165731651366122, "loss": 0.1985979974269867, "mean_token_accuracy": 0.9143917560577393, "num_tokens": 89161524.0, "step": 7228 }, { "entropy": 1.0987060964107513, "epoch": 3.806740389678778, "grad_norm": 0.2627451419830322, "learning_rate": 0.00010163548288819351, "loss": 0.17108958959579468, "mean_token_accuracy": 0.92933489382267, "num_tokens": 89173860.0, "step": 7229 }, { "entropy": 1.1162225008010864, "epoch": 3.807266982622433, "grad_norm": 0.293716698884964, "learning_rate": 0.00010161364975927841, "loss": 0.1702927052974701, "mean_token_accuracy": 0.9316524863243103, "num_tokens": 89186196.0, "step": 7230 }, { "entropy": 1.0891296565532684, "epoch": 3.8077935755660874, "grad_norm": 0.29380878806114197, "learning_rate": 0.00010159181712821207, "loss": 0.18582729995250702, "mean_token_accuracy": 0.9171992391347885, "num_tokens": 89198532.0, "step": 7231 }, { "entropy": 1.0300887823104858, "epoch": 3.808320168509742, "grad_norm": 0.28559356927871704, "learning_rate": 0.00010156998499629053, "loss": 0.16330835223197937, "mean_token_accuracy": 0.9303398281335831, "num_tokens": 89210868.0, "step": 7232 }, { "entropy": 1.135662466287613, "epoch": 3.8088467614533963, "grad_norm": 0.2866886854171753, "learning_rate": 0.00010154815336480985, "loss": 0.17558231949806213, "mean_token_accuracy": 0.9255096316337585, "num_tokens": 89223204.0, "step": 7233 }, { "entropy": 1.0409517288208008, "epoch": 3.809373354397051, "grad_norm": 0.27483031153678894, "learning_rate": 0.00010152632223506604, "loss": 0.17298176884651184, "mean_token_accuracy": 0.9237565845251083, "num_tokens": 89235540.0, "step": 7234 }, { "entropy": 1.0508598238229752, "epoch": 3.8098999473407056, "grad_norm": 0.2898114025592804, "learning_rate": 0.00010150449160835511, "loss": 0.16894441843032837, "mean_token_accuracy": 0.9310885369777679, "num_tokens": 89247876.0, "step": 7235 }, { "entropy": 1.07838636636734, "epoch": 3.81042654028436, "grad_norm": 0.30749765038490295, "learning_rate": 0.00010148266148597299, "loss": 0.18928919732570648, "mean_token_accuracy": 0.9212216436862946, "num_tokens": 89260212.0, "step": 7236 }, { "entropy": 1.0341950207948685, "epoch": 3.810953133228015, "grad_norm": 0.31431862711906433, "learning_rate": 0.00010146083186921558, "loss": 0.18621139228343964, "mean_token_accuracy": 0.9205119013786316, "num_tokens": 89272548.0, "step": 7237 }, { "entropy": 1.072775810956955, "epoch": 3.8114797261716693, "grad_norm": 0.3027096688747406, "learning_rate": 0.00010143900275937886, "loss": 0.1710643172264099, "mean_token_accuracy": 0.9289993047714233, "num_tokens": 89284884.0, "step": 7238 }, { "entropy": 1.0736041069030762, "epoch": 3.8120063191153237, "grad_norm": 0.2878359854221344, "learning_rate": 0.0001014171741577586, "loss": 0.17023108899593353, "mean_token_accuracy": 0.928799033164978, "num_tokens": 89297220.0, "step": 7239 }, { "entropy": 1.0706163048744202, "epoch": 3.8125329120589786, "grad_norm": 0.4564668834209442, "learning_rate": 0.00010139534606565073, "loss": 0.16438832879066467, "mean_token_accuracy": 0.9315458983182907, "num_tokens": 89309556.0, "step": 7240 }, { "entropy": 1.119351178407669, "epoch": 3.813059505002633, "grad_norm": 0.3326112926006317, "learning_rate": 0.00010137351848435101, "loss": 0.17732514441013336, "mean_token_accuracy": 0.9268805235624313, "num_tokens": 89321892.0, "step": 7241 }, { "entropy": 1.0823031663894653, "epoch": 3.8135860979462874, "grad_norm": 0.3071443438529968, "learning_rate": 0.00010135169141515522, "loss": 0.18601597845554352, "mean_token_accuracy": 0.9182300120592117, "num_tokens": 89334228.0, "step": 7242 }, { "entropy": 1.0551444292068481, "epoch": 3.8141126908899423, "grad_norm": 0.294696569442749, "learning_rate": 0.00010132986485935909, "loss": 0.18259482085704803, "mean_token_accuracy": 0.9259582459926605, "num_tokens": 89346564.0, "step": 7243 }, { "entropy": 1.066992163658142, "epoch": 3.8146392838335967, "grad_norm": 0.29047083854675293, "learning_rate": 0.0001013080388182583, "loss": 0.16876797378063202, "mean_token_accuracy": 0.9309166371822357, "num_tokens": 89358900.0, "step": 7244 }, { "entropy": 1.1132435202598572, "epoch": 3.815165876777251, "grad_norm": 0.3349572420120239, "learning_rate": 0.00010128621329314867, "loss": 0.19489669799804688, "mean_token_accuracy": 0.9177320748567581, "num_tokens": 89371236.0, "step": 7245 }, { "entropy": 1.1137051582336426, "epoch": 3.8156924697209056, "grad_norm": 0.34975436329841614, "learning_rate": 0.00010126438828532571, "loss": 0.17569835484027863, "mean_token_accuracy": 0.9270328730344772, "num_tokens": 89383572.0, "step": 7246 }, { "entropy": 1.112154096364975, "epoch": 3.8162190626645605, "grad_norm": 0.29454243183135986, "learning_rate": 0.00010124256379608514, "loss": 0.162591814994812, "mean_token_accuracy": 0.9338550865650177, "num_tokens": 89395908.0, "step": 7247 }, { "entropy": 1.0950568318367004, "epoch": 3.816745655608215, "grad_norm": 0.2949798107147217, "learning_rate": 0.0001012207398267225, "loss": 0.17738787829875946, "mean_token_accuracy": 0.9251436740159988, "num_tokens": 89408244.0, "step": 7248 }, { "entropy": 1.1034832000732422, "epoch": 3.8172722485518693, "grad_norm": 0.28425031900405884, "learning_rate": 0.00010119891637853339, "loss": 0.1770511418581009, "mean_token_accuracy": 0.92559814453125, "num_tokens": 89420580.0, "step": 7249 }, { "entropy": 1.098187506198883, "epoch": 3.8177988414955237, "grad_norm": 0.2896685302257538, "learning_rate": 0.0001011770934528133, "loss": 0.1746765673160553, "mean_token_accuracy": 0.9279729723930359, "num_tokens": 89432916.0, "step": 7250 }, { "entropy": 1.0950307846069336, "epoch": 3.8183254344391786, "grad_norm": 0.28907012939453125, "learning_rate": 0.00010115527105085772, "loss": 0.1761474758386612, "mean_token_accuracy": 0.9249496161937714, "num_tokens": 89445252.0, "step": 7251 }, { "entropy": 1.1701862215995789, "epoch": 3.818852027382833, "grad_norm": 0.34673872590065, "learning_rate": 0.00010113344917396215, "loss": 0.20624682307243347, "mean_token_accuracy": 0.9154643565416336, "num_tokens": 89457588.0, "step": 7252 }, { "entropy": 1.1130734384059906, "epoch": 3.8193786203264875, "grad_norm": 0.2743799090385437, "learning_rate": 0.00010111162782342205, "loss": 0.17597100138664246, "mean_token_accuracy": 0.9302635490894318, "num_tokens": 89469924.0, "step": 7253 }, { "entropy": 1.1158782541751862, "epoch": 3.8199052132701423, "grad_norm": 0.28568530082702637, "learning_rate": 0.00010108980700053281, "loss": 0.18606042861938477, "mean_token_accuracy": 0.9275815039873123, "num_tokens": 89482260.0, "step": 7254 }, { "entropy": 1.1550249755382538, "epoch": 3.8204318062137967, "grad_norm": 0.2865970730781555, "learning_rate": 0.00010106798670658979, "loss": 0.1869693100452423, "mean_token_accuracy": 0.9218897372484207, "num_tokens": 89494596.0, "step": 7255 }, { "entropy": 1.131758064031601, "epoch": 3.820958399157451, "grad_norm": 0.28293687105178833, "learning_rate": 0.00010104616694288835, "loss": 0.1857099086046219, "mean_token_accuracy": 0.9230599403381348, "num_tokens": 89506932.0, "step": 7256 }, { "entropy": 1.1339568197727203, "epoch": 3.821484992101106, "grad_norm": 0.28943586349487305, "learning_rate": 0.00010102434771072378, "loss": 0.1801375448703766, "mean_token_accuracy": 0.9199080318212509, "num_tokens": 89519268.0, "step": 7257 }, { "entropy": 1.1382434666156769, "epoch": 3.8220115850447605, "grad_norm": 0.2906562089920044, "learning_rate": 0.00010100252901139131, "loss": 0.1690700650215149, "mean_token_accuracy": 0.9321166574954987, "num_tokens": 89531604.0, "step": 7258 }, { "entropy": 1.1378513276576996, "epoch": 3.822538177988415, "grad_norm": 0.28166836500167847, "learning_rate": 0.00010098071084618632, "loss": 0.17545185983181, "mean_token_accuracy": 0.9237697720527649, "num_tokens": 89543940.0, "step": 7259 }, { "entropy": 1.1416104137897491, "epoch": 3.8230647709320698, "grad_norm": 0.29689937829971313, "learning_rate": 0.00010095889321640395, "loss": 0.1880737990140915, "mean_token_accuracy": 0.9221426397562027, "num_tokens": 89556276.0, "step": 7260 }, { "entropy": 1.1484348773956299, "epoch": 3.823591363875724, "grad_norm": 0.2994082272052765, "learning_rate": 0.0001009370761233394, "loss": 0.18645620346069336, "mean_token_accuracy": 0.9207324832677841, "num_tokens": 89568612.0, "step": 7261 }, { "entropy": 1.1428918242454529, "epoch": 3.8241179568193786, "grad_norm": 0.30418846011161804, "learning_rate": 0.0001009152595682878, "loss": 0.19167828559875488, "mean_token_accuracy": 0.9225038588047028, "num_tokens": 89580948.0, "step": 7262 }, { "entropy": 1.1049898266792297, "epoch": 3.824644549763033, "grad_norm": 0.25247815251350403, "learning_rate": 0.00010089344355254431, "loss": 0.1506982445716858, "mean_token_accuracy": 0.9416893571615219, "num_tokens": 89593284.0, "step": 7263 }, { "entropy": 1.1729646921157837, "epoch": 3.8251711427066875, "grad_norm": 0.2825002372264862, "learning_rate": 0.00010087162807740397, "loss": 0.1731032133102417, "mean_token_accuracy": 0.9266055077314377, "num_tokens": 89605620.0, "step": 7264 }, { "entropy": 1.1801711916923523, "epoch": 3.8256977356503423, "grad_norm": 0.2951127886772156, "learning_rate": 0.00010084981314416189, "loss": 0.17518743872642517, "mean_token_accuracy": 0.9253078103065491, "num_tokens": 89617956.0, "step": 7265 }, { "entropy": 1.1535230875015259, "epoch": 3.8262243285939967, "grad_norm": 0.2761785686016083, "learning_rate": 0.00010082799875411307, "loss": 0.17142808437347412, "mean_token_accuracy": 0.9257194846868515, "num_tokens": 89630292.0, "step": 7266 }, { "entropy": 1.207795798778534, "epoch": 3.826750921537651, "grad_norm": 0.30591529607772827, "learning_rate": 0.0001008061849085525, "loss": 0.19267059862613678, "mean_token_accuracy": 0.9200548529624939, "num_tokens": 89642628.0, "step": 7267 }, { "entropy": 1.1359332203865051, "epoch": 3.827277514481306, "grad_norm": 0.26560959219932556, "learning_rate": 0.00010078437160877514, "loss": 0.15736259520053864, "mean_token_accuracy": 0.9354649782180786, "num_tokens": 89654964.0, "step": 7268 }, { "entropy": 1.1676850616931915, "epoch": 3.8278041074249605, "grad_norm": 0.283997118473053, "learning_rate": 0.00010076255885607593, "loss": 0.18263943493366241, "mean_token_accuracy": 0.921161338686943, "num_tokens": 89667300.0, "step": 7269 }, { "entropy": 1.1453185975551605, "epoch": 3.828330700368615, "grad_norm": 0.25955888628959656, "learning_rate": 0.00010074074665174977, "loss": 0.1715111881494522, "mean_token_accuracy": 0.9292258322238922, "num_tokens": 89679636.0, "step": 7270 }, { "entropy": 1.1053584516048431, "epoch": 3.8288572933122698, "grad_norm": 0.32442501187324524, "learning_rate": 0.00010071893499709153, "loss": 0.18358784914016724, "mean_token_accuracy": 0.9204039126634598, "num_tokens": 89691972.0, "step": 7271 }, { "entropy": 1.1756221950054169, "epoch": 3.829383886255924, "grad_norm": 0.28485652804374695, "learning_rate": 0.00010069712389339596, "loss": 0.17328260838985443, "mean_token_accuracy": 0.9245188385248184, "num_tokens": 89704308.0, "step": 7272 }, { "entropy": 1.2232281565666199, "epoch": 3.8299104791995786, "grad_norm": 0.30336758494377136, "learning_rate": 0.00010067531334195797, "loss": 0.17735067009925842, "mean_token_accuracy": 0.9247820824384689, "num_tokens": 89716644.0, "step": 7273 }, { "entropy": 1.1930607855319977, "epoch": 3.8304370721432335, "grad_norm": 0.31025582551956177, "learning_rate": 0.00010065350334407226, "loss": 0.21691036224365234, "mean_token_accuracy": 0.9097111821174622, "num_tokens": 89728980.0, "step": 7274 }, { "entropy": 1.1593596935272217, "epoch": 3.830963665086888, "grad_norm": 0.29387667775154114, "learning_rate": 0.00010063169390103364, "loss": 0.18222147226333618, "mean_token_accuracy": 0.9236123710870743, "num_tokens": 89741316.0, "step": 7275 }, { "entropy": 1.165407657623291, "epoch": 3.8314902580305423, "grad_norm": 0.3327574133872986, "learning_rate": 0.00010060988501413668, "loss": 0.187834233045578, "mean_token_accuracy": 0.920792430639267, "num_tokens": 89753652.0, "step": 7276 }, { "entropy": 1.1497161388397217, "epoch": 3.832016850974197, "grad_norm": 0.2776005268096924, "learning_rate": 0.00010058807668467615, "loss": 0.16925781965255737, "mean_token_accuracy": 0.9254584312438965, "num_tokens": 89765988.0, "step": 7277 }, { "entropy": 1.149237334728241, "epoch": 3.8325434439178516, "grad_norm": 0.2985914647579193, "learning_rate": 0.00010056626891394665, "loss": 0.16763046383857727, "mean_token_accuracy": 0.925909012556076, "num_tokens": 89778324.0, "step": 7278 }, { "entropy": 1.1808510720729828, "epoch": 3.833070036861506, "grad_norm": 0.29439499974250793, "learning_rate": 0.00010054446170324277, "loss": 0.18559673428535461, "mean_token_accuracy": 0.9183323979377747, "num_tokens": 89790660.0, "step": 7279 }, { "entropy": 1.1405372321605682, "epoch": 3.8335966298051605, "grad_norm": 0.3132508099079132, "learning_rate": 0.00010052265505385907, "loss": 0.1839461326599121, "mean_token_accuracy": 0.9206763058900833, "num_tokens": 89802996.0, "step": 7280 }, { "entropy": 1.1559495031833649, "epoch": 3.834123222748815, "grad_norm": 0.3002241551876068, "learning_rate": 0.00010050084896709014, "loss": 0.19972693920135498, "mean_token_accuracy": 0.9159600734710693, "num_tokens": 89815332.0, "step": 7281 }, { "entropy": 1.1627310514450073, "epoch": 3.8346498156924698, "grad_norm": 0.2774801552295685, "learning_rate": 0.00010047904344423043, "loss": 0.16976918280124664, "mean_token_accuracy": 0.9299463927745819, "num_tokens": 89827668.0, "step": 7282 }, { "entropy": 1.1482534408569336, "epoch": 3.835176408636124, "grad_norm": 0.2664020359516144, "learning_rate": 0.0001004572384865744, "loss": 0.16775798797607422, "mean_token_accuracy": 0.9295926690101624, "num_tokens": 89840004.0, "step": 7283 }, { "entropy": 1.1820363402366638, "epoch": 3.8357030015797786, "grad_norm": 0.27489718794822693, "learning_rate": 0.00010043543409541651, "loss": 0.16735351085662842, "mean_token_accuracy": 0.9299400001764297, "num_tokens": 89852340.0, "step": 7284 }, { "entropy": 1.2132955193519592, "epoch": 3.8362295945234335, "grad_norm": 0.29108142852783203, "learning_rate": 0.00010041363027205115, "loss": 0.1773652583360672, "mean_token_accuracy": 0.9252279847860336, "num_tokens": 89864676.0, "step": 7285 }, { "entropy": 1.1338000297546387, "epoch": 3.836756187467088, "grad_norm": 0.30709701776504517, "learning_rate": 0.0001003918270177727, "loss": 0.18275758624076843, "mean_token_accuracy": 0.9216789901256561, "num_tokens": 89877012.0, "step": 7286 }, { "entropy": 1.1404915750026703, "epoch": 3.8372827804107423, "grad_norm": 0.29424789547920227, "learning_rate": 0.00010037002433387545, "loss": 0.18272551894187927, "mean_token_accuracy": 0.926551342010498, "num_tokens": 89889348.0, "step": 7287 }, { "entropy": 1.1835018694400787, "epoch": 3.837809373354397, "grad_norm": 0.3396196663379669, "learning_rate": 0.00010034822222165377, "loss": 0.21048396825790405, "mean_token_accuracy": 0.9132413268089294, "num_tokens": 89901684.0, "step": 7288 }, { "entropy": 1.1551093757152557, "epoch": 3.8383359662980516, "grad_norm": 0.28068169951438904, "learning_rate": 0.00010032642068240185, "loss": 0.17294597625732422, "mean_token_accuracy": 0.9275632053613663, "num_tokens": 89914020.0, "step": 7289 }, { "entropy": 1.1892271041870117, "epoch": 3.838862559241706, "grad_norm": 0.2994571626186371, "learning_rate": 0.00010030461971741399, "loss": 0.18415969610214233, "mean_token_accuracy": 0.9226613193750381, "num_tokens": 89926356.0, "step": 7290 }, { "entropy": 1.165372908115387, "epoch": 3.839389152185361, "grad_norm": 0.26454928517341614, "learning_rate": 0.00010028281932798431, "loss": 0.17179468274116516, "mean_token_accuracy": 0.928283154964447, "num_tokens": 89938692.0, "step": 7291 }, { "entropy": 1.1823021471500397, "epoch": 3.8399157451290153, "grad_norm": 0.28512468934059143, "learning_rate": 0.00010026101951540703, "loss": 0.1671009212732315, "mean_token_accuracy": 0.9315878450870514, "num_tokens": 89951028.0, "step": 7292 }, { "entropy": 1.1704443991184235, "epoch": 3.8404423380726698, "grad_norm": 0.2963160276412964, "learning_rate": 0.00010023922028097621, "loss": 0.1925249844789505, "mean_token_accuracy": 0.9225925803184509, "num_tokens": 89963364.0, "step": 7293 }, { "entropy": 1.178544044494629, "epoch": 3.8409689310163246, "grad_norm": 0.289794385433197, "learning_rate": 0.00010021742162598606, "loss": 0.17334839701652527, "mean_token_accuracy": 0.9263816773891449, "num_tokens": 89975700.0, "step": 7294 }, { "entropy": 1.192434698343277, "epoch": 3.841495523959979, "grad_norm": 0.3179748058319092, "learning_rate": 0.00010019562355173054, "loss": 0.19346535205841064, "mean_token_accuracy": 0.9140064567327499, "num_tokens": 89988036.0, "step": 7295 }, { "entropy": 1.1856091022491455, "epoch": 3.8420221169036335, "grad_norm": 0.3246690034866333, "learning_rate": 0.00010017382605950372, "loss": 0.19298748672008514, "mean_token_accuracy": 0.9217430502176285, "num_tokens": 90000372.0, "step": 7296 }, { "entropy": 1.215908706188202, "epoch": 3.842548709847288, "grad_norm": 0.29726147651672363, "learning_rate": 0.00010015202915059956, "loss": 0.1933974325656891, "mean_token_accuracy": 0.9189482480287552, "num_tokens": 90012708.0, "step": 7297 }, { "entropy": 1.1829409897327423, "epoch": 3.8430753027909423, "grad_norm": 0.2635277211666107, "learning_rate": 0.00010013023282631204, "loss": 0.16917887330055237, "mean_token_accuracy": 0.9315038621425629, "num_tokens": 90025044.0, "step": 7298 }, { "entropy": 1.1632716357707977, "epoch": 3.843601895734597, "grad_norm": 0.27100130915641785, "learning_rate": 0.00010010843708793507, "loss": 0.17784683406352997, "mean_token_accuracy": 0.9262017607688904, "num_tokens": 90037380.0, "step": 7299 }, { "entropy": 1.24711474776268, "epoch": 3.8441284886782516, "grad_norm": 0.3065671920776367, "learning_rate": 0.00010008664193676251, "loss": 0.17322944104671478, "mean_token_accuracy": 0.9291545897722244, "num_tokens": 90049716.0, "step": 7300 }, { "entropy": 1.1855449378490448, "epoch": 3.844655081621906, "grad_norm": 0.27872559428215027, "learning_rate": 0.00010006484737408825, "loss": 0.17799080908298492, "mean_token_accuracy": 0.9267636239528656, "num_tokens": 90062052.0, "step": 7301 }, { "entropy": 1.1732699871063232, "epoch": 3.845181674565561, "grad_norm": 0.2870476245880127, "learning_rate": 0.00010004305340120612, "loss": 0.1874730885028839, "mean_token_accuracy": 0.9199872314929962, "num_tokens": 90074388.0, "step": 7302 }, { "entropy": 1.1861219704151154, "epoch": 3.8457082675092154, "grad_norm": 0.3155590295791626, "learning_rate": 0.00010002126001940988, "loss": 0.196644589304924, "mean_token_accuracy": 0.9160917550325394, "num_tokens": 90086724.0, "step": 7303 }, { "entropy": 1.2212349772453308, "epoch": 3.8462348604528698, "grad_norm": 0.2800969183444977, "learning_rate": 9.999946722999328e-05, "loss": 0.1710227131843567, "mean_token_accuracy": 0.9273928701877594, "num_tokens": 90099060.0, "step": 7304 }, { "entropy": 1.205515056848526, "epoch": 3.8467614533965246, "grad_norm": 0.26504290103912354, "learning_rate": 9.997767503425e-05, "loss": 0.17037883400917053, "mean_token_accuracy": 0.9252675473690033, "num_tokens": 90111396.0, "step": 7305 }, { "entropy": 1.201006919145584, "epoch": 3.847288046340179, "grad_norm": 0.30139029026031494, "learning_rate": 9.995588343347373e-05, "loss": 0.1959807276725769, "mean_token_accuracy": 0.913934201002121, "num_tokens": 90123732.0, "step": 7306 }, { "entropy": 1.2046195566654205, "epoch": 3.8478146392838335, "grad_norm": 0.2724730372428894, "learning_rate": 9.993409242895808e-05, "loss": 0.18013715744018555, "mean_token_accuracy": 0.9217778146266937, "num_tokens": 90136068.0, "step": 7307 }, { "entropy": 1.2070066034793854, "epoch": 3.8483412322274884, "grad_norm": 0.2678380012512207, "learning_rate": 9.991230202199677e-05, "loss": 0.17368824779987335, "mean_token_accuracy": 0.9266010373830795, "num_tokens": 90148404.0, "step": 7308 }, { "entropy": 1.2179716527462006, "epoch": 3.848867825171143, "grad_norm": 0.31269174814224243, "learning_rate": 9.989051221388328e-05, "loss": 0.1937474012374878, "mean_token_accuracy": 0.9200000315904617, "num_tokens": 90160740.0, "step": 7309 }, { "entropy": 1.2247945666313171, "epoch": 3.849394418114797, "grad_norm": 0.32107073068618774, "learning_rate": 9.986872300591112e-05, "loss": 0.20229271054267883, "mean_token_accuracy": 0.9178968369960785, "num_tokens": 90173076.0, "step": 7310 }, { "entropy": 1.2144478559494019, "epoch": 3.849921011058452, "grad_norm": 0.3409155607223511, "learning_rate": 9.984693439937385e-05, "loss": 0.19109617173671722, "mean_token_accuracy": 0.9212620854377747, "num_tokens": 90185412.0, "step": 7311 }, { "entropy": 1.1986571252346039, "epoch": 3.8504476040021065, "grad_norm": 0.32058560848236084, "learning_rate": 9.98251463955649e-05, "loss": 0.18746724724769592, "mean_token_accuracy": 0.9225563108921051, "num_tokens": 90197748.0, "step": 7312 }, { "entropy": 1.163426399230957, "epoch": 3.850974196945761, "grad_norm": 0.25540074706077576, "learning_rate": 9.980335899577773e-05, "loss": 0.16777797043323517, "mean_token_accuracy": 0.9263751208782196, "num_tokens": 90210084.0, "step": 7313 }, { "entropy": 1.1606984734535217, "epoch": 3.8515007898894154, "grad_norm": 0.27272337675094604, "learning_rate": 9.978157220130566e-05, "loss": 0.17516924440860748, "mean_token_accuracy": 0.928168535232544, "num_tokens": 90222420.0, "step": 7314 }, { "entropy": 1.209740698337555, "epoch": 3.85202738283307, "grad_norm": 0.2787659168243408, "learning_rate": 9.975978601344211e-05, "loss": 0.17293882369995117, "mean_token_accuracy": 0.9250793009996414, "num_tokens": 90234756.0, "step": 7315 }, { "entropy": 1.2494952976703644, "epoch": 3.8525539757767246, "grad_norm": 0.3164391815662384, "learning_rate": 9.97380004334804e-05, "loss": 0.18004949390888214, "mean_token_accuracy": 0.9228081554174423, "num_tokens": 90247092.0, "step": 7316 }, { "entropy": 1.2021544873714447, "epoch": 3.853080568720379, "grad_norm": 0.31024160981178284, "learning_rate": 9.97162154627138e-05, "loss": 0.19099017977714539, "mean_token_accuracy": 0.9227265566587448, "num_tokens": 90259428.0, "step": 7317 }, { "entropy": 1.188399612903595, "epoch": 3.8536071616640335, "grad_norm": 0.28021976351737976, "learning_rate": 9.96944311024355e-05, "loss": 0.18051081895828247, "mean_token_accuracy": 0.922139585018158, "num_tokens": 90271764.0, "step": 7318 }, { "entropy": 1.2218237519264221, "epoch": 3.8541337546076884, "grad_norm": 0.30597159266471863, "learning_rate": 9.967264735393882e-05, "loss": 0.18588949739933014, "mean_token_accuracy": 0.9208100736141205, "num_tokens": 90284100.0, "step": 7319 }, { "entropy": 1.1899022459983826, "epoch": 3.854660347551343, "grad_norm": 0.2929156422615051, "learning_rate": 9.965086421851684e-05, "loss": 0.17718812823295593, "mean_token_accuracy": 0.9276111572980881, "num_tokens": 90296436.0, "step": 7320 }, { "entropy": 1.1932482421398163, "epoch": 3.855186940494997, "grad_norm": 0.293131947517395, "learning_rate": 9.96290816974627e-05, "loss": 0.17138488590717316, "mean_token_accuracy": 0.926831841468811, "num_tokens": 90308772.0, "step": 7321 }, { "entropy": 1.238861232995987, "epoch": 3.855713533438652, "grad_norm": 0.28433671593666077, "learning_rate": 9.960729979206957e-05, "loss": 0.17833887040615082, "mean_token_accuracy": 0.9238818287849426, "num_tokens": 90321108.0, "step": 7322 }, { "entropy": 1.213705599308014, "epoch": 3.8562401263823065, "grad_norm": 0.29272541403770447, "learning_rate": 9.95855185036305e-05, "loss": 0.18631236255168915, "mean_token_accuracy": 0.9275387078523636, "num_tokens": 90333444.0, "step": 7323 }, { "entropy": 1.2195116877555847, "epoch": 3.856766719325961, "grad_norm": 0.29437002539634705, "learning_rate": 9.956373783343847e-05, "loss": 0.18267959356307983, "mean_token_accuracy": 0.9190680831670761, "num_tokens": 90345780.0, "step": 7324 }, { "entropy": 1.1932564079761505, "epoch": 3.857293312269616, "grad_norm": 0.2885369062423706, "learning_rate": 9.954195778278653e-05, "loss": 0.17232061922550201, "mean_token_accuracy": 0.9254325926303864, "num_tokens": 90358116.0, "step": 7325 }, { "entropy": 1.2298594117164612, "epoch": 3.8578199052132702, "grad_norm": 0.30461183190345764, "learning_rate": 9.952017835296754e-05, "loss": 0.1930835098028183, "mean_token_accuracy": 0.9228019863367081, "num_tokens": 90370452.0, "step": 7326 }, { "entropy": 1.2099511325359344, "epoch": 3.8583464981569247, "grad_norm": 0.2939245402812958, "learning_rate": 9.949839954527454e-05, "loss": 0.19376038014888763, "mean_token_accuracy": 0.9188228696584702, "num_tokens": 90382788.0, "step": 7327 }, { "entropy": 1.1923102736473083, "epoch": 3.8588730911005795, "grad_norm": 0.2934664785861969, "learning_rate": 9.947662136100031e-05, "loss": 0.1802346110343933, "mean_token_accuracy": 0.9260061830282211, "num_tokens": 90395124.0, "step": 7328 }, { "entropy": 1.202105551958084, "epoch": 3.859399684044234, "grad_norm": 0.2979043126106262, "learning_rate": 9.945484380143773e-05, "loss": 0.19685573875904083, "mean_token_accuracy": 0.9163574129343033, "num_tokens": 90407460.0, "step": 7329 }, { "entropy": 1.2044208943843842, "epoch": 3.8599262769878884, "grad_norm": 0.29820647835731506, "learning_rate": 9.943306686787964e-05, "loss": 0.19858041405677795, "mean_token_accuracy": 0.9161760061979294, "num_tokens": 90419796.0, "step": 7330 }, { "entropy": 1.2462234199047089, "epoch": 3.860452869931543, "grad_norm": 0.2908308804035187, "learning_rate": 9.941129056161878e-05, "loss": 0.18359780311584473, "mean_token_accuracy": 0.9262418448925018, "num_tokens": 90432132.0, "step": 7331 }, { "entropy": 1.258163183927536, "epoch": 3.860979462875197, "grad_norm": 0.30769476294517517, "learning_rate": 9.938951488394788e-05, "loss": 0.19418224692344666, "mean_token_accuracy": 0.9224050343036652, "num_tokens": 90444468.0, "step": 7332 }, { "entropy": 1.190240353345871, "epoch": 3.861506055818852, "grad_norm": 0.2786393463611603, "learning_rate": 9.936773983615963e-05, "loss": 0.17566590011119843, "mean_token_accuracy": 0.9270531982183456, "num_tokens": 90456804.0, "step": 7333 }, { "entropy": 1.2426856756210327, "epoch": 3.8620326487625065, "grad_norm": 0.2850218713283539, "learning_rate": 9.93459654195467e-05, "loss": 0.18113307654857635, "mean_token_accuracy": 0.9268236309289932, "num_tokens": 90469140.0, "step": 7334 }, { "entropy": 1.20493283867836, "epoch": 3.862559241706161, "grad_norm": 0.27189159393310547, "learning_rate": 9.932419163540169e-05, "loss": 0.17980167269706726, "mean_token_accuracy": 0.9276924729347229, "num_tokens": 90481476.0, "step": 7335 }, { "entropy": 1.2181030809879303, "epoch": 3.863085834649816, "grad_norm": 0.24642521142959595, "learning_rate": 9.930241848501722e-05, "loss": 0.1630403995513916, "mean_token_accuracy": 0.9312721788883209, "num_tokens": 90493812.0, "step": 7336 }, { "entropy": 1.2517006993293762, "epoch": 3.8636124275934702, "grad_norm": 0.2872298061847687, "learning_rate": 9.928064596968581e-05, "loss": 0.1801758110523224, "mean_token_accuracy": 0.9221181422472, "num_tokens": 90506148.0, "step": 7337 }, { "entropy": 1.2343012988567352, "epoch": 3.8641390205371247, "grad_norm": 0.2791367769241333, "learning_rate": 9.925887409069998e-05, "loss": 0.17382994294166565, "mean_token_accuracy": 0.9254388809204102, "num_tokens": 90518484.0, "step": 7338 }, { "entropy": 1.250428467988968, "epoch": 3.8646656134807795, "grad_norm": 0.29819661378860474, "learning_rate": 9.923710284935219e-05, "loss": 0.20673494040966034, "mean_token_accuracy": 0.9112135022878647, "num_tokens": 90530820.0, "step": 7339 }, { "entropy": 1.2244381606578827, "epoch": 3.865192206424434, "grad_norm": 0.25664618611335754, "learning_rate": 9.921533224693488e-05, "loss": 0.1699652373790741, "mean_token_accuracy": 0.9253463894128799, "num_tokens": 90543156.0, "step": 7340 }, { "entropy": 1.1868961453437805, "epoch": 3.8657187993680884, "grad_norm": 0.27383333444595337, "learning_rate": 9.919356228474041e-05, "loss": 0.18589892983436584, "mean_token_accuracy": 0.920842707157135, "num_tokens": 90555492.0, "step": 7341 }, { "entropy": 1.2844567000865936, "epoch": 3.8662453923117432, "grad_norm": 0.30267804861068726, "learning_rate": 9.917179296406116e-05, "loss": 0.19701601564884186, "mean_token_accuracy": 0.9183336347341537, "num_tokens": 90567828.0, "step": 7342 }, { "entropy": 1.3010142147541046, "epoch": 3.8667719852553977, "grad_norm": 0.3052208423614502, "learning_rate": 9.915002428618947e-05, "loss": 0.19094228744506836, "mean_token_accuracy": 0.9229763150215149, "num_tokens": 90580164.0, "step": 7343 }, { "entropy": 1.1697178184986115, "epoch": 3.867298578199052, "grad_norm": 0.2604224383831024, "learning_rate": 9.912825625241759e-05, "loss": 0.16901522874832153, "mean_token_accuracy": 0.9302792698144913, "num_tokens": 90592500.0, "step": 7344 }, { "entropy": 1.2191344797611237, "epoch": 3.867825171142707, "grad_norm": 0.27005285024642944, "learning_rate": 9.910648886403779e-05, "loss": 0.192753404378891, "mean_token_accuracy": 0.9172493368387222, "num_tokens": 90604836.0, "step": 7345 }, { "entropy": 1.262347787618637, "epoch": 3.8683517640863614, "grad_norm": 0.29758551716804504, "learning_rate": 9.908472212234223e-05, "loss": 0.2073061764240265, "mean_token_accuracy": 0.9140929877758026, "num_tokens": 90617172.0, "step": 7346 }, { "entropy": 1.2290584444999695, "epoch": 3.868878357030016, "grad_norm": 0.287990003824234, "learning_rate": 9.906295602862312e-05, "loss": 0.19012236595153809, "mean_token_accuracy": 0.9192764163017273, "num_tokens": 90629508.0, "step": 7347 }, { "entropy": 1.205379992723465, "epoch": 3.8694049499736702, "grad_norm": 0.2572006583213806, "learning_rate": 9.904119058417256e-05, "loss": 0.16958723962306976, "mean_token_accuracy": 0.9291314631700516, "num_tokens": 90641844.0, "step": 7348 }, { "entropy": 1.2571605145931244, "epoch": 3.8699315429173247, "grad_norm": 0.2561599314212799, "learning_rate": 9.901942579028263e-05, "loss": 0.15259096026420593, "mean_token_accuracy": 0.9404455125331879, "num_tokens": 90654180.0, "step": 7349 }, { "entropy": 1.190529614686966, "epoch": 3.8704581358609795, "grad_norm": 0.41509267687797546, "learning_rate": 9.89976616482454e-05, "loss": 0.16672082245349884, "mean_token_accuracy": 0.9305219650268555, "num_tokens": 90666516.0, "step": 7350 }, { "entropy": 1.2418386042118073, "epoch": 3.870984728804634, "grad_norm": 0.3323068916797638, "learning_rate": 9.897589815935286e-05, "loss": 0.20139282941818237, "mean_token_accuracy": 0.9165514260530472, "num_tokens": 90678852.0, "step": 7351 }, { "entropy": 1.2107313871383667, "epoch": 3.8715113217482884, "grad_norm": 0.26844340562820435, "learning_rate": 9.895413532489701e-05, "loss": 0.15874214470386505, "mean_token_accuracy": 0.9347341060638428, "num_tokens": 90691188.0, "step": 7352 }, { "entropy": 1.1857129633426666, "epoch": 3.8720379146919433, "grad_norm": 0.2747436463832855, "learning_rate": 9.893237314616976e-05, "loss": 0.17956000566482544, "mean_token_accuracy": 0.9220409989356995, "num_tokens": 90703524.0, "step": 7353 }, { "entropy": 1.198570877313614, "epoch": 3.8725645076355977, "grad_norm": 0.2919812798500061, "learning_rate": 9.891061162446302e-05, "loss": 0.1921466886997223, "mean_token_accuracy": 0.916918158531189, "num_tokens": 90715860.0, "step": 7354 }, { "entropy": 1.2124747335910797, "epoch": 3.873091100579252, "grad_norm": 0.2959701120853424, "learning_rate": 9.888885076106861e-05, "loss": 0.17341776192188263, "mean_token_accuracy": 0.9281175881624222, "num_tokens": 90728196.0, "step": 7355 }, { "entropy": 1.1563901603221893, "epoch": 3.873617693522907, "grad_norm": 0.2615200877189636, "learning_rate": 9.886709055727834e-05, "loss": 0.16795092821121216, "mean_token_accuracy": 0.9334702044725418, "num_tokens": 90740532.0, "step": 7356 }, { "entropy": 1.2142418324947357, "epoch": 3.8741442864665614, "grad_norm": 0.3013656437397003, "learning_rate": 9.88453310143841e-05, "loss": 0.1777857393026352, "mean_token_accuracy": 0.9271297752857208, "num_tokens": 90752868.0, "step": 7357 }, { "entropy": 1.1635612845420837, "epoch": 3.874670879410216, "grad_norm": 0.28417861461639404, "learning_rate": 9.88235721336775e-05, "loss": 0.17131461203098297, "mean_token_accuracy": 0.9289181679487228, "num_tokens": 90765204.0, "step": 7358 }, { "entropy": 1.2065666019916534, "epoch": 3.8751974723538707, "grad_norm": 0.2814251780509949, "learning_rate": 9.880181391645027e-05, "loss": 0.17419341206550598, "mean_token_accuracy": 0.9259565472602844, "num_tokens": 90777540.0, "step": 7359 }, { "entropy": 1.1907231509685516, "epoch": 3.875724065297525, "grad_norm": 0.3082534968852997, "learning_rate": 9.87800563639941e-05, "loss": 0.18956147134304047, "mean_token_accuracy": 0.9228996187448502, "num_tokens": 90789876.0, "step": 7360 }, { "entropy": 1.2383562326431274, "epoch": 3.8762506582411795, "grad_norm": 0.2990850508213043, "learning_rate": 9.875829947760057e-05, "loss": 0.1762770563364029, "mean_token_accuracy": 0.9269504696130753, "num_tokens": 90802212.0, "step": 7361 }, { "entropy": 1.2204852104187012, "epoch": 3.876777251184834, "grad_norm": 0.29158973693847656, "learning_rate": 9.87365432585613e-05, "loss": 0.1674453616142273, "mean_token_accuracy": 0.9312193691730499, "num_tokens": 90814548.0, "step": 7362 }, { "entropy": 1.1590887606143951, "epoch": 3.877303844128489, "grad_norm": 0.26443982124328613, "learning_rate": 9.871478770816778e-05, "loss": 0.1666359156370163, "mean_token_accuracy": 0.9319517016410828, "num_tokens": 90826884.0, "step": 7363 }, { "entropy": 1.212668776512146, "epoch": 3.8778304370721433, "grad_norm": 0.30860036611557007, "learning_rate": 9.869303282771156e-05, "loss": 0.17729061841964722, "mean_token_accuracy": 0.924604594707489, "num_tokens": 90839220.0, "step": 7364 }, { "entropy": 1.2208824157714844, "epoch": 3.8783570300157977, "grad_norm": 0.31199607253074646, "learning_rate": 9.867127861848407e-05, "loss": 0.19631695747375488, "mean_token_accuracy": 0.9166485667228699, "num_tokens": 90851556.0, "step": 7365 }, { "entropy": 1.1799960136413574, "epoch": 3.878883622959452, "grad_norm": 0.301144540309906, "learning_rate": 9.864952508177673e-05, "loss": 0.1875683218240738, "mean_token_accuracy": 0.921687513589859, "num_tokens": 90863892.0, "step": 7366 }, { "entropy": 1.1755280196666718, "epoch": 3.879410215903107, "grad_norm": 0.29750579595565796, "learning_rate": 9.862777221888095e-05, "loss": 0.19362355768680573, "mean_token_accuracy": 0.9189414232969284, "num_tokens": 90876228.0, "step": 7367 }, { "entropy": 1.2063259780406952, "epoch": 3.8799368088467614, "grad_norm": 0.3054865896701813, "learning_rate": 9.860602003108807e-05, "loss": 0.18168985843658447, "mean_token_accuracy": 0.92440365254879, "num_tokens": 90888564.0, "step": 7368 }, { "entropy": 1.2309964001178741, "epoch": 3.880463401790416, "grad_norm": 0.30633923411369324, "learning_rate": 9.858426851968936e-05, "loss": 0.18840034306049347, "mean_token_accuracy": 0.9172258079051971, "num_tokens": 90900900.0, "step": 7369 }, { "entropy": 1.254058837890625, "epoch": 3.8809899947340707, "grad_norm": 0.2868705689907074, "learning_rate": 9.856251768597605e-05, "loss": 0.17972050607204437, "mean_token_accuracy": 0.9242666363716125, "num_tokens": 90913236.0, "step": 7370 }, { "entropy": 1.2371594905853271, "epoch": 3.881516587677725, "grad_norm": 0.33569571375846863, "learning_rate": 9.854076753123941e-05, "loss": 0.19579902291297913, "mean_token_accuracy": 0.9211303889751434, "num_tokens": 90925572.0, "step": 7371 }, { "entropy": 1.260173887014389, "epoch": 3.8820431806213795, "grad_norm": 0.2709573209285736, "learning_rate": 9.851901805677066e-05, "loss": 0.17761409282684326, "mean_token_accuracy": 0.9270109385251999, "num_tokens": 90937908.0, "step": 7372 }, { "entropy": 1.2311949133872986, "epoch": 3.8825697735650344, "grad_norm": 0.2965104579925537, "learning_rate": 9.849726926386087e-05, "loss": 0.17649513483047485, "mean_token_accuracy": 0.9215144068002701, "num_tokens": 90950244.0, "step": 7373 }, { "entropy": 1.2264364063739777, "epoch": 3.883096366508689, "grad_norm": 0.2903778553009033, "learning_rate": 9.847552115380117e-05, "loss": 0.19147197902202606, "mean_token_accuracy": 0.918977215886116, "num_tokens": 90962580.0, "step": 7374 }, { "entropy": 1.2604758143424988, "epoch": 3.8836229594523433, "grad_norm": 0.2860509753227234, "learning_rate": 9.845377372788259e-05, "loss": 0.16984225809574127, "mean_token_accuracy": 0.9307971298694611, "num_tokens": 90974916.0, "step": 7375 }, { "entropy": 1.1899789869785309, "epoch": 3.884149552395998, "grad_norm": 0.2879489064216614, "learning_rate": 9.843202698739616e-05, "loss": 0.17775698006153107, "mean_token_accuracy": 0.9248269200325012, "num_tokens": 90987252.0, "step": 7376 }, { "entropy": 1.281430572271347, "epoch": 3.8846761453396526, "grad_norm": 0.29807573556900024, "learning_rate": 9.841028093363284e-05, "loss": 0.18883194029331207, "mean_token_accuracy": 0.9234910309314728, "num_tokens": 90999588.0, "step": 7377 }, { "entropy": 1.2089340388774872, "epoch": 3.885202738283307, "grad_norm": 0.2950511872768402, "learning_rate": 9.838853556788366e-05, "loss": 0.20106419920921326, "mean_token_accuracy": 0.9162346571683884, "num_tokens": 91011924.0, "step": 7378 }, { "entropy": 1.2650335431098938, "epoch": 3.8857293312269614, "grad_norm": 0.3102474808692932, "learning_rate": 9.83667908914394e-05, "loss": 0.1975744515657425, "mean_token_accuracy": 0.9211560487747192, "num_tokens": 91024260.0, "step": 7379 }, { "entropy": 1.2446538507938385, "epoch": 3.8862559241706163, "grad_norm": 0.28649139404296875, "learning_rate": 9.834504690559099e-05, "loss": 0.1754469871520996, "mean_token_accuracy": 0.926554948091507, "num_tokens": 91036596.0, "step": 7380 }, { "entropy": 1.2238378524780273, "epoch": 3.8867825171142707, "grad_norm": 0.2706204056739807, "learning_rate": 9.83233036116292e-05, "loss": 0.16986840963363647, "mean_token_accuracy": 0.929158017039299, "num_tokens": 91048932.0, "step": 7381 }, { "entropy": 1.2629105746746063, "epoch": 3.887309110057925, "grad_norm": 0.30980411171913147, "learning_rate": 9.830156101084483e-05, "loss": 0.18923744559288025, "mean_token_accuracy": 0.9220970869064331, "num_tokens": 91061268.0, "step": 7382 }, { "entropy": 1.2490929961204529, "epoch": 3.8878357030015795, "grad_norm": 0.2837015390396118, "learning_rate": 9.827981910452859e-05, "loss": 0.20252351462841034, "mean_token_accuracy": 0.9161817729473114, "num_tokens": 91073604.0, "step": 7383 }, { "entropy": 1.3015010058879852, "epoch": 3.8883622959452344, "grad_norm": 0.27492520213127136, "learning_rate": 9.825807789397115e-05, "loss": 0.1569894552230835, "mean_token_accuracy": 0.9341099411249161, "num_tokens": 91085940.0, "step": 7384 }, { "entropy": 1.3030857145786285, "epoch": 3.888888888888889, "grad_norm": 0.28954070806503296, "learning_rate": 9.82363373804632e-05, "loss": 0.17589737474918365, "mean_token_accuracy": 0.9284959137439728, "num_tokens": 91098276.0, "step": 7385 }, { "entropy": 1.2944543659687042, "epoch": 3.8894154818325433, "grad_norm": 0.27544423937797546, "learning_rate": 9.821459756529536e-05, "loss": 0.16199910640716553, "mean_token_accuracy": 0.9316005408763885, "num_tokens": 91110612.0, "step": 7386 }, { "entropy": 1.2723598182201385, "epoch": 3.889942074776198, "grad_norm": 0.27726244926452637, "learning_rate": 9.819285844975819e-05, "loss": 0.17507168650627136, "mean_token_accuracy": 0.9228856265544891, "num_tokens": 91122948.0, "step": 7387 }, { "entropy": 1.3930054008960724, "epoch": 3.8904686677198526, "grad_norm": 0.3249645233154297, "learning_rate": 9.817112003514218e-05, "loss": 0.174981027841568, "mean_token_accuracy": 0.9266958832740784, "num_tokens": 91135284.0, "step": 7388 }, { "entropy": 1.3319167494773865, "epoch": 3.890995260663507, "grad_norm": 0.2998090982437134, "learning_rate": 9.81493823227378e-05, "loss": 0.18659012019634247, "mean_token_accuracy": 0.9238382875919342, "num_tokens": 91147620.0, "step": 7389 }, { "entropy": 1.280248075723648, "epoch": 3.891521853607162, "grad_norm": 0.30350276827812195, "learning_rate": 9.812764531383556e-05, "loss": 0.1922396868467331, "mean_token_accuracy": 0.9191283881664276, "num_tokens": 91159956.0, "step": 7390 }, { "entropy": 1.3184870779514313, "epoch": 3.8920484465508163, "grad_norm": 0.2840585708618164, "learning_rate": 9.810590900972576e-05, "loss": 0.1652616560459137, "mean_token_accuracy": 0.9287358373403549, "num_tokens": 91172292.0, "step": 7391 }, { "entropy": 1.3189331591129303, "epoch": 3.8925750394944707, "grad_norm": 0.30320435762405396, "learning_rate": 9.808417341169886e-05, "loss": 0.1749056875705719, "mean_token_accuracy": 0.9255077093839645, "num_tokens": 91184628.0, "step": 7392 }, { "entropy": 1.2997994422912598, "epoch": 3.8931016324381256, "grad_norm": 0.29542285203933716, "learning_rate": 9.806243852104516e-05, "loss": 0.18183457851409912, "mean_token_accuracy": 0.9283244013786316, "num_tokens": 91196964.0, "step": 7393 }, { "entropy": 1.273093044757843, "epoch": 3.89362822538178, "grad_norm": 0.2934871017932892, "learning_rate": 9.804070433905486e-05, "loss": 0.17550939321517944, "mean_token_accuracy": 0.9281349778175354, "num_tokens": 91209300.0, "step": 7394 }, { "entropy": 1.247098594903946, "epoch": 3.8941548183254344, "grad_norm": 0.26843369007110596, "learning_rate": 9.801897086701827e-05, "loss": 0.16914314031600952, "mean_token_accuracy": 0.9286849945783615, "num_tokens": 91221636.0, "step": 7395 }, { "entropy": 1.3457880020141602, "epoch": 3.894681411269089, "grad_norm": 0.31451231241226196, "learning_rate": 9.799723810622552e-05, "loss": 0.1843279004096985, "mean_token_accuracy": 0.9233946204185486, "num_tokens": 91233972.0, "step": 7396 }, { "entropy": 1.3243741989135742, "epoch": 3.8952080042127437, "grad_norm": 0.30700138211250305, "learning_rate": 9.797550605796681e-05, "loss": 0.18327546119689941, "mean_token_accuracy": 0.9218372255563736, "num_tokens": 91246308.0, "step": 7397 }, { "entropy": 1.2985079884529114, "epoch": 3.895734597156398, "grad_norm": 0.32867226004600525, "learning_rate": 9.79537747235322e-05, "loss": 0.1934511512517929, "mean_token_accuracy": 0.9179651439189911, "num_tokens": 91258644.0, "step": 7398 }, { "entropy": 1.3588362634181976, "epoch": 3.8962611901000526, "grad_norm": 0.3065076470375061, "learning_rate": 9.793204410421179e-05, "loss": 0.18493646383285522, "mean_token_accuracy": 0.9219991266727448, "num_tokens": 91270980.0, "step": 7399 }, { "entropy": 1.272426277399063, "epoch": 3.896787783043707, "grad_norm": 0.27240192890167236, "learning_rate": 9.79103142012956e-05, "loss": 0.16781708598136902, "mean_token_accuracy": 0.9306810200214386, "num_tokens": 91283316.0, "step": 7400 }, { "entropy": 1.3233053982257843, "epoch": 3.897314375987362, "grad_norm": 0.33670109510421753, "learning_rate": 9.788858501607357e-05, "loss": 0.19102466106414795, "mean_token_accuracy": 0.9206659644842148, "num_tokens": 91295652.0, "step": 7401 }, { "entropy": 1.305526077747345, "epoch": 3.8978409689310163, "grad_norm": 0.3031172752380371, "learning_rate": 9.786685654983567e-05, "loss": 0.18682445585727692, "mean_token_accuracy": 0.9239467233419418, "num_tokens": 91307988.0, "step": 7402 }, { "entropy": 1.3286968767642975, "epoch": 3.8983675618746707, "grad_norm": 0.30504098534584045, "learning_rate": 9.784512880387178e-05, "loss": 0.1931457668542862, "mean_token_accuracy": 0.9222109168767929, "num_tokens": 91320324.0, "step": 7403 }, { "entropy": 1.2467556595802307, "epoch": 3.8988941548183256, "grad_norm": 0.2830975651741028, "learning_rate": 9.782340177947174e-05, "loss": 0.1753942221403122, "mean_token_accuracy": 0.9269160330295563, "num_tokens": 91332660.0, "step": 7404 }, { "entropy": 1.2635121941566467, "epoch": 3.89942074776198, "grad_norm": 0.268989622592926, "learning_rate": 9.780167547792534e-05, "loss": 0.16541332006454468, "mean_token_accuracy": 0.9283698350191116, "num_tokens": 91344996.0, "step": 7405 }, { "entropy": 1.2748238146305084, "epoch": 3.8999473407056344, "grad_norm": 0.2895947992801666, "learning_rate": 9.777994990052242e-05, "loss": 0.18233062326908112, "mean_token_accuracy": 0.9232377111911774, "num_tokens": 91357332.0, "step": 7406 }, { "entropy": 1.371468424797058, "epoch": 3.9004739336492893, "grad_norm": 0.33178168535232544, "learning_rate": 9.775822504855261e-05, "loss": 0.17663978040218353, "mean_token_accuracy": 0.9220523536205292, "num_tokens": 91369668.0, "step": 7407 }, { "entropy": 1.3484316170215607, "epoch": 3.9010005265929437, "grad_norm": 0.3129909634590149, "learning_rate": 9.773650092330566e-05, "loss": 0.17559215426445007, "mean_token_accuracy": 0.923889771103859, "num_tokens": 91382004.0, "step": 7408 }, { "entropy": 1.334187537431717, "epoch": 3.901527119536598, "grad_norm": 0.3251679837703705, "learning_rate": 9.771477752607115e-05, "loss": 0.19099709391593933, "mean_token_accuracy": 0.9230151027441025, "num_tokens": 91394340.0, "step": 7409 }, { "entropy": 1.3830526471138, "epoch": 3.902053712480253, "grad_norm": 0.30658549070358276, "learning_rate": 9.769305485813872e-05, "loss": 0.17843928933143616, "mean_token_accuracy": 0.9258236736059189, "num_tokens": 91406676.0, "step": 7410 }, { "entropy": 1.3029418587684631, "epoch": 3.9025803054239074, "grad_norm": 0.26187410950660706, "learning_rate": 9.767133292079787e-05, "loss": 0.1668580174446106, "mean_token_accuracy": 0.9293637126684189, "num_tokens": 91419012.0, "step": 7411 }, { "entropy": 1.2614350020885468, "epoch": 3.903106898367562, "grad_norm": 0.2766633927822113, "learning_rate": 9.76496117153381e-05, "loss": 0.16704759001731873, "mean_token_accuracy": 0.9306674897670746, "num_tokens": 91431348.0, "step": 7412 }, { "entropy": 1.3585382103919983, "epoch": 3.9036334913112163, "grad_norm": 0.3252298831939697, "learning_rate": 9.762789124304894e-05, "loss": 0.196746826171875, "mean_token_accuracy": 0.9180266261100769, "num_tokens": 91443684.0, "step": 7413 }, { "entropy": 1.3883097469806671, "epoch": 3.9041600842548707, "grad_norm": 0.29954347014427185, "learning_rate": 9.760617150521976e-05, "loss": 0.19299542903900146, "mean_token_accuracy": 0.9197171628475189, "num_tokens": 91456020.0, "step": 7414 }, { "entropy": 1.31036975979805, "epoch": 3.9046866771985256, "grad_norm": 0.284512996673584, "learning_rate": 9.758445250313994e-05, "loss": 0.1800897717475891, "mean_token_accuracy": 0.9242556691169739, "num_tokens": 91468356.0, "step": 7415 }, { "entropy": 1.38027885556221, "epoch": 3.90521327014218, "grad_norm": 0.3107808828353882, "learning_rate": 9.756273423809883e-05, "loss": 0.18819507956504822, "mean_token_accuracy": 0.9225617349147797, "num_tokens": 91480692.0, "step": 7416 }, { "entropy": 1.3482477962970734, "epoch": 3.9057398630858344, "grad_norm": 0.28120309114456177, "learning_rate": 9.754101671138569e-05, "loss": 0.18053530156612396, "mean_token_accuracy": 0.9240847080945969, "num_tokens": 91493028.0, "step": 7417 }, { "entropy": 1.3876953423023224, "epoch": 3.9062664560294893, "grad_norm": 0.3125147223472595, "learning_rate": 9.751929992428976e-05, "loss": 0.20853109657764435, "mean_token_accuracy": 0.9141730666160583, "num_tokens": 91505364.0, "step": 7418 }, { "entropy": 1.3991923928260803, "epoch": 3.9067930489731437, "grad_norm": 0.2972346544265747, "learning_rate": 9.749758387810021e-05, "loss": 0.17821037769317627, "mean_token_accuracy": 0.9238766133785248, "num_tokens": 91517700.0, "step": 7419 }, { "entropy": 1.362459808588028, "epoch": 3.907319641916798, "grad_norm": 0.29278430342674255, "learning_rate": 9.747586857410629e-05, "loss": 0.1727725863456726, "mean_token_accuracy": 0.9270545095205307, "num_tokens": 91530036.0, "step": 7420 }, { "entropy": 1.3600943982601166, "epoch": 3.907846234860453, "grad_norm": 0.2770959138870239, "learning_rate": 9.745415401359706e-05, "loss": 0.17293483018875122, "mean_token_accuracy": 0.9269449561834335, "num_tokens": 91542372.0, "step": 7421 }, { "entropy": 1.363686740398407, "epoch": 3.9083728278041074, "grad_norm": 0.2894051969051361, "learning_rate": 9.743244019786157e-05, "loss": 0.18016286194324493, "mean_token_accuracy": 0.9236745089292526, "num_tokens": 91554708.0, "step": 7422 }, { "entropy": 1.3273597359657288, "epoch": 3.908899420747762, "grad_norm": 0.28462719917297363, "learning_rate": 9.741072712818885e-05, "loss": 0.16882094740867615, "mean_token_accuracy": 0.9264349341392517, "num_tokens": 91567044.0, "step": 7423 }, { "entropy": 1.4484579861164093, "epoch": 3.9094260136914167, "grad_norm": 0.31760042905807495, "learning_rate": 9.738901480586789e-05, "loss": 0.17673248052597046, "mean_token_accuracy": 0.9217555373907089, "num_tokens": 91579380.0, "step": 7424 }, { "entropy": 1.3021227717399597, "epoch": 3.909952606635071, "grad_norm": 0.29617711901664734, "learning_rate": 9.736730323218761e-05, "loss": 0.17839474976062775, "mean_token_accuracy": 0.9257320016622543, "num_tokens": 91591716.0, "step": 7425 }, { "entropy": 1.3438735902309418, "epoch": 3.9104791995787256, "grad_norm": 0.2710460126399994, "learning_rate": 9.73455924084369e-05, "loss": 0.1708822101354599, "mean_token_accuracy": 0.9289853870868683, "num_tokens": 91604052.0, "step": 7426 }, { "entropy": 1.3481594324111938, "epoch": 3.9110057925223805, "grad_norm": 0.3210081160068512, "learning_rate": 9.732388233590463e-05, "loss": 0.20448635518550873, "mean_token_accuracy": 0.9112216532230377, "num_tokens": 91616388.0, "step": 7427 }, { "entropy": 1.2938117980957031, "epoch": 3.911532385466035, "grad_norm": 0.26161590218544006, "learning_rate": 9.730217301587959e-05, "loss": 0.1704331338405609, "mean_token_accuracy": 0.9322764575481415, "num_tokens": 91628724.0, "step": 7428 }, { "entropy": 1.3291106820106506, "epoch": 3.9120589784096893, "grad_norm": 0.3009251058101654, "learning_rate": 9.728046444965051e-05, "loss": 0.17591515183448792, "mean_token_accuracy": 0.9239979386329651, "num_tokens": 91641060.0, "step": 7429 }, { "entropy": 1.3399436473846436, "epoch": 3.9125855713533437, "grad_norm": 0.2723159193992615, "learning_rate": 9.725875663850615e-05, "loss": 0.17526356875896454, "mean_token_accuracy": 0.9254540950059891, "num_tokens": 91653396.0, "step": 7430 }, { "entropy": 1.4018910825252533, "epoch": 3.913112164296998, "grad_norm": 0.295527845621109, "learning_rate": 9.723704958373511e-05, "loss": 0.17586205899715424, "mean_token_accuracy": 0.923242911696434, "num_tokens": 91665732.0, "step": 7431 }, { "entropy": 1.3623782396316528, "epoch": 3.913638757240653, "grad_norm": 0.30898094177246094, "learning_rate": 9.721534328662609e-05, "loss": 0.1770631968975067, "mean_token_accuracy": 0.9300126433372498, "num_tokens": 91678068.0, "step": 7432 }, { "entropy": 1.3543266355991364, "epoch": 3.9141653501843074, "grad_norm": 0.28661686182022095, "learning_rate": 9.719363774846756e-05, "loss": 0.1654135286808014, "mean_token_accuracy": 0.930344969034195, "num_tokens": 91690404.0, "step": 7433 }, { "entropy": 1.3302703201770782, "epoch": 3.914691943127962, "grad_norm": 0.29969698190689087, "learning_rate": 9.717193297054816e-05, "loss": 0.18720367550849915, "mean_token_accuracy": 0.9195693731307983, "num_tokens": 91702740.0, "step": 7434 }, { "entropy": 1.3499610722064972, "epoch": 3.9152185360716167, "grad_norm": 0.2968071401119232, "learning_rate": 9.715022895415634e-05, "loss": 0.18096867203712463, "mean_token_accuracy": 0.9255775958299637, "num_tokens": 91715076.0, "step": 7435 }, { "entropy": 1.3046875596046448, "epoch": 3.915745129015271, "grad_norm": 0.2661040723323822, "learning_rate": 9.712852570058053e-05, "loss": 0.16175732016563416, "mean_token_accuracy": 0.9289435148239136, "num_tokens": 91727412.0, "step": 7436 }, { "entropy": 1.2640199065208435, "epoch": 3.9162717219589256, "grad_norm": 0.26960012316703796, "learning_rate": 9.710682321110913e-05, "loss": 0.16636931896209717, "mean_token_accuracy": 0.9285288751125336, "num_tokens": 91739748.0, "step": 7437 }, { "entropy": 1.302351325750351, "epoch": 3.9167983149025805, "grad_norm": 0.26437661051750183, "learning_rate": 9.708512148703049e-05, "loss": 0.1572932004928589, "mean_token_accuracy": 0.9320330768823624, "num_tokens": 91752084.0, "step": 7438 }, { "entropy": 1.3512612879276276, "epoch": 3.917324907846235, "grad_norm": 0.3063144385814667, "learning_rate": 9.706342052963289e-05, "loss": 0.17273718118667603, "mean_token_accuracy": 0.9298366010189056, "num_tokens": 91764420.0, "step": 7439 }, { "entropy": 1.3201676607131958, "epoch": 3.9178515007898893, "grad_norm": 0.2926127314567566, "learning_rate": 9.70417203402046e-05, "loss": 0.17421020567417145, "mean_token_accuracy": 0.922990620136261, "num_tokens": 91776756.0, "step": 7440 }, { "entropy": 1.3591834604740143, "epoch": 3.918378093733544, "grad_norm": 0.3088493347167969, "learning_rate": 9.702002092003388e-05, "loss": 0.17949983477592468, "mean_token_accuracy": 0.9272099882364273, "num_tokens": 91789092.0, "step": 7441 }, { "entropy": 1.2428484857082367, "epoch": 3.9189046866771986, "grad_norm": 0.29576629400253296, "learning_rate": 9.699832227040885e-05, "loss": 0.17247886955738068, "mean_token_accuracy": 0.9230233579874039, "num_tokens": 91801428.0, "step": 7442 }, { "entropy": 1.266256421804428, "epoch": 3.919431279620853, "grad_norm": 0.28943321108818054, "learning_rate": 9.697662439261768e-05, "loss": 0.18631991744041443, "mean_token_accuracy": 0.9180447310209274, "num_tokens": 91813764.0, "step": 7443 }, { "entropy": 1.3520332872867584, "epoch": 3.919957872564508, "grad_norm": 0.3416178822517395, "learning_rate": 9.695492728794837e-05, "loss": 0.20197802782058716, "mean_token_accuracy": 0.9203462600708008, "num_tokens": 91826100.0, "step": 7444 }, { "entropy": 1.3061773180961609, "epoch": 3.9204844655081623, "grad_norm": 0.31303954124450684, "learning_rate": 9.693323095768902e-05, "loss": 0.1945120394229889, "mean_token_accuracy": 0.9196473807096481, "num_tokens": 91838436.0, "step": 7445 }, { "entropy": 1.2885983288288116, "epoch": 3.9210110584518167, "grad_norm": 0.31333503127098083, "learning_rate": 9.691153540312759e-05, "loss": 0.17745260894298553, "mean_token_accuracy": 0.9222434908151627, "num_tokens": 91850772.0, "step": 7446 }, { "entropy": 1.320429652929306, "epoch": 3.921537651395471, "grad_norm": 0.30087795853614807, "learning_rate": 9.688984062555197e-05, "loss": 0.18600033223628998, "mean_token_accuracy": 0.9226914793252945, "num_tokens": 91863108.0, "step": 7447 }, { "entropy": 1.2709153592586517, "epoch": 3.9220642443391256, "grad_norm": 0.325582891702652, "learning_rate": 9.686814662625017e-05, "loss": 0.189141646027565, "mean_token_accuracy": 0.9198153913021088, "num_tokens": 91875444.0, "step": 7448 }, { "entropy": 1.3018944561481476, "epoch": 3.9225908372827805, "grad_norm": 0.3107694685459137, "learning_rate": 9.684645340650993e-05, "loss": 0.1884014904499054, "mean_token_accuracy": 0.9218618273735046, "num_tokens": 91887780.0, "step": 7449 }, { "entropy": 1.3278419375419617, "epoch": 3.923117430226435, "grad_norm": 0.28061795234680176, "learning_rate": 9.682476096761907e-05, "loss": 0.17283833026885986, "mean_token_accuracy": 0.9281010776758194, "num_tokens": 91900116.0, "step": 7450 }, { "entropy": 1.2768584489822388, "epoch": 3.9236440231700893, "grad_norm": 0.266977459192276, "learning_rate": 9.680306931086543e-05, "loss": 0.16279029846191406, "mean_token_accuracy": 0.926258385181427, "num_tokens": 91912452.0, "step": 7451 }, { "entropy": 1.2815205752849579, "epoch": 3.924170616113744, "grad_norm": 0.2692156136035919, "learning_rate": 9.678137843753659e-05, "loss": 0.16042062640190125, "mean_token_accuracy": 0.9334524720907211, "num_tokens": 91924788.0, "step": 7452 }, { "entropy": 1.341881901025772, "epoch": 3.9246972090573986, "grad_norm": 0.292605459690094, "learning_rate": 9.675968834892029e-05, "loss": 0.17764052748680115, "mean_token_accuracy": 0.9222121387720108, "num_tokens": 91937124.0, "step": 7453 }, { "entropy": 1.3380673825740814, "epoch": 3.925223802001053, "grad_norm": 0.27861467003822327, "learning_rate": 9.673799904630408e-05, "loss": 0.17420029640197754, "mean_token_accuracy": 0.92889104783535, "num_tokens": 91949460.0, "step": 7454 }, { "entropy": 1.3240340948104858, "epoch": 3.925750394944708, "grad_norm": 0.29774072766304016, "learning_rate": 9.671631053097561e-05, "loss": 0.1879979372024536, "mean_token_accuracy": 0.9188611954450607, "num_tokens": 91961796.0, "step": 7455 }, { "entropy": 1.3600371181964874, "epoch": 3.9262769878883623, "grad_norm": 0.28510600328445435, "learning_rate": 9.669462280422234e-05, "loss": 0.17808692157268524, "mean_token_accuracy": 0.9247149080038071, "num_tokens": 91974132.0, "step": 7456 }, { "entropy": 1.336561381816864, "epoch": 3.9268035808320167, "grad_norm": 0.2943764626979828, "learning_rate": 9.667293586733179e-05, "loss": 0.1932375282049179, "mean_token_accuracy": 0.9196823388338089, "num_tokens": 91986468.0, "step": 7457 }, { "entropy": 1.275018721818924, "epoch": 3.9273301737756716, "grad_norm": 0.29437708854675293, "learning_rate": 9.665124972159134e-05, "loss": 0.16790060698986053, "mean_token_accuracy": 0.9270847886800766, "num_tokens": 91998804.0, "step": 7458 }, { "entropy": 1.29185551404953, "epoch": 3.927856766719326, "grad_norm": 0.30873504281044006, "learning_rate": 9.66295643682884e-05, "loss": 0.19838179647922516, "mean_token_accuracy": 0.9141746461391449, "num_tokens": 92011140.0, "step": 7459 }, { "entropy": 1.2768851220607758, "epoch": 3.9283833596629805, "grad_norm": 0.29629775881767273, "learning_rate": 9.66078798087103e-05, "loss": 0.1842423528432846, "mean_token_accuracy": 0.9186161458492279, "num_tokens": 92023476.0, "step": 7460 }, { "entropy": 1.3205865621566772, "epoch": 3.9289099526066353, "grad_norm": 0.2964547276496887, "learning_rate": 9.65861960441443e-05, "loss": 0.18825949728488922, "mean_token_accuracy": 0.9202955067157745, "num_tokens": 92035812.0, "step": 7461 }, { "entropy": 1.3484995067119598, "epoch": 3.9294365455502898, "grad_norm": 0.3002781271934509, "learning_rate": 9.656451307587769e-05, "loss": 0.1901530921459198, "mean_token_accuracy": 0.9150425940752029, "num_tokens": 92048148.0, "step": 7462 }, { "entropy": 1.3245843350887299, "epoch": 3.929963138493944, "grad_norm": 0.30892708897590637, "learning_rate": 9.65428309051976e-05, "loss": 0.1806984543800354, "mean_token_accuracy": 0.9242218285799026, "num_tokens": 92060484.0, "step": 7463 }, { "entropy": 1.2997255325317383, "epoch": 3.9304897314375986, "grad_norm": 0.28640472888946533, "learning_rate": 9.652114953339122e-05, "loss": 0.1763458102941513, "mean_token_accuracy": 0.9265084564685822, "num_tokens": 92072820.0, "step": 7464 }, { "entropy": 1.30248361825943, "epoch": 3.931016324381253, "grad_norm": 0.28299543261528015, "learning_rate": 9.649946896174564e-05, "loss": 0.17997360229492188, "mean_token_accuracy": 0.9239591509103775, "num_tokens": 92085156.0, "step": 7465 }, { "entropy": 1.3352027833461761, "epoch": 3.931542917324908, "grad_norm": 0.28869009017944336, "learning_rate": 9.64777891915479e-05, "loss": 0.16349303722381592, "mean_token_accuracy": 0.9304029792547226, "num_tokens": 92097492.0, "step": 7466 }, { "entropy": 1.3092913031578064, "epoch": 3.9320695102685623, "grad_norm": 0.28738799691200256, "learning_rate": 9.6456110224085e-05, "loss": 0.17659634351730347, "mean_token_accuracy": 0.924927607178688, "num_tokens": 92109828.0, "step": 7467 }, { "entropy": 1.3021188080310822, "epoch": 3.9325961032122168, "grad_norm": 0.28562963008880615, "learning_rate": 9.643443206064386e-05, "loss": 0.17467309534549713, "mean_token_accuracy": 0.9223776757717133, "num_tokens": 92122164.0, "step": 7468 }, { "entropy": 1.304491639137268, "epoch": 3.9331226961558716, "grad_norm": 0.29766130447387695, "learning_rate": 9.641275470251145e-05, "loss": 0.18060892820358276, "mean_token_accuracy": 0.9242375940084457, "num_tokens": 92134500.0, "step": 7469 }, { "entropy": 1.2207664251327515, "epoch": 3.933649289099526, "grad_norm": 0.2631109356880188, "learning_rate": 9.639107815097462e-05, "loss": 0.1687084436416626, "mean_token_accuracy": 0.928931936621666, "num_tokens": 92146836.0, "step": 7470 }, { "entropy": 1.2501631677150726, "epoch": 3.9341758820431805, "grad_norm": 0.2933122217655182, "learning_rate": 9.636940240732015e-05, "loss": 0.1884680986404419, "mean_token_accuracy": 0.9194168895483017, "num_tokens": 92159172.0, "step": 7471 }, { "entropy": 1.2987435460090637, "epoch": 3.9347024749868353, "grad_norm": 0.30980929732322693, "learning_rate": 9.63477274728348e-05, "loss": 0.18887969851493835, "mean_token_accuracy": 0.920253798365593, "num_tokens": 92171508.0, "step": 7472 }, { "entropy": 1.3175013065338135, "epoch": 3.9352290679304898, "grad_norm": 0.2880313992500305, "learning_rate": 9.632605334880531e-05, "loss": 0.16244207322597504, "mean_token_accuracy": 0.9357964843511581, "num_tokens": 92183844.0, "step": 7473 }, { "entropy": 1.249307543039322, "epoch": 3.935755660874144, "grad_norm": 0.3131891191005707, "learning_rate": 9.630438003651833e-05, "loss": 0.19666621088981628, "mean_token_accuracy": 0.9181525409221649, "num_tokens": 92196180.0, "step": 7474 }, { "entropy": 1.2992484867572784, "epoch": 3.936282253817799, "grad_norm": 0.29129382967948914, "learning_rate": 9.628270753726048e-05, "loss": 0.16414833068847656, "mean_token_accuracy": 0.9326082319021225, "num_tokens": 92208516.0, "step": 7475 }, { "entropy": 1.3063248097896576, "epoch": 3.9368088467614535, "grad_norm": 0.3242841064929962, "learning_rate": 9.626103585231834e-05, "loss": 0.18781878054141998, "mean_token_accuracy": 0.921628475189209, "num_tokens": 92220852.0, "step": 7476 }, { "entropy": 1.30518838763237, "epoch": 3.937335439705108, "grad_norm": 0.27939802408218384, "learning_rate": 9.623936498297841e-05, "loss": 0.1684660017490387, "mean_token_accuracy": 0.9288779944181442, "num_tokens": 92233188.0, "step": 7477 }, { "entropy": 1.2671433985233307, "epoch": 3.9378620326487628, "grad_norm": 0.28031885623931885, "learning_rate": 9.621769493052722e-05, "loss": 0.1693497598171234, "mean_token_accuracy": 0.9269088804721832, "num_tokens": 92245524.0, "step": 7478 }, { "entropy": 1.2910725772380829, "epoch": 3.938388625592417, "grad_norm": 0.26939520239830017, "learning_rate": 9.61960256962511e-05, "loss": 0.16636882722377777, "mean_token_accuracy": 0.9293422400951385, "num_tokens": 92257860.0, "step": 7479 }, { "entropy": 1.30040642619133, "epoch": 3.9389152185360716, "grad_norm": 0.2899145483970642, "learning_rate": 9.617435728143654e-05, "loss": 0.17569515109062195, "mean_token_accuracy": 0.9298725128173828, "num_tokens": 92270196.0, "step": 7480 }, { "entropy": 1.3440462350845337, "epoch": 3.939441811479726, "grad_norm": 0.3209908604621887, "learning_rate": 9.615268968736975e-05, "loss": 0.1894574612379074, "mean_token_accuracy": 0.9194609373807907, "num_tokens": 92282532.0, "step": 7481 }, { "entropy": 1.327031284570694, "epoch": 3.9399684044233805, "grad_norm": 0.3005867004394531, "learning_rate": 9.613102291533705e-05, "loss": 0.19162625074386597, "mean_token_accuracy": 0.9237973093986511, "num_tokens": 92294868.0, "step": 7482 }, { "entropy": 1.3306479156017303, "epoch": 3.9404949973670353, "grad_norm": 0.29519328474998474, "learning_rate": 9.610935696662473e-05, "loss": 0.19496075809001923, "mean_token_accuracy": 0.9158709049224854, "num_tokens": 92307204.0, "step": 7483 }, { "entropy": 1.3298758566379547, "epoch": 3.9410215903106898, "grad_norm": 0.2970565855503082, "learning_rate": 9.60876918425189e-05, "loss": 0.1941128969192505, "mean_token_accuracy": 0.9188930094242096, "num_tokens": 92319540.0, "step": 7484 }, { "entropy": 1.32647043466568, "epoch": 3.941548183254344, "grad_norm": 0.2894797623157501, "learning_rate": 9.606602754430576e-05, "loss": 0.18311838805675507, "mean_token_accuracy": 0.9203295111656189, "num_tokens": 92331876.0, "step": 7485 }, { "entropy": 1.3235417902469635, "epoch": 3.942074776197999, "grad_norm": 0.2994464933872223, "learning_rate": 9.60443640732713e-05, "loss": 0.18579910695552826, "mean_token_accuracy": 0.9255027323961258, "num_tokens": 92344212.0, "step": 7486 }, { "entropy": 1.2972019612789154, "epoch": 3.9426013691416535, "grad_norm": 0.28680962324142456, "learning_rate": 9.602270143070164e-05, "loss": 0.16868475079536438, "mean_token_accuracy": 0.9337401539087296, "num_tokens": 92356548.0, "step": 7487 }, { "entropy": 1.3408292531967163, "epoch": 3.943127962085308, "grad_norm": 0.2828841209411621, "learning_rate": 9.600103961788274e-05, "loss": 0.17516160011291504, "mean_token_accuracy": 0.9230733662843704, "num_tokens": 92368884.0, "step": 7488 }, { "entropy": 1.3030468225479126, "epoch": 3.943654555028963, "grad_norm": 0.3317798972129822, "learning_rate": 9.597937863610047e-05, "loss": 0.1834927648305893, "mean_token_accuracy": 0.9237143397331238, "num_tokens": 92381220.0, "step": 7489 }, { "entropy": 1.300564169883728, "epoch": 3.944181147972617, "grad_norm": 0.2664189338684082, "learning_rate": 9.595771848664082e-05, "loss": 0.16435495018959045, "mean_token_accuracy": 0.9301376342773438, "num_tokens": 92393556.0, "step": 7490 }, { "entropy": 1.3278022706508636, "epoch": 3.9447077409162716, "grad_norm": 0.32556602358818054, "learning_rate": 9.593605917078956e-05, "loss": 0.20098881423473358, "mean_token_accuracy": 0.9177375733852386, "num_tokens": 92405892.0, "step": 7491 }, { "entropy": 1.3283456563949585, "epoch": 3.9452343338599265, "grad_norm": 0.30426931381225586, "learning_rate": 9.59144006898325e-05, "loss": 0.18360796570777893, "mean_token_accuracy": 0.9221368879079819, "num_tokens": 92418228.0, "step": 7492 }, { "entropy": 1.2963765859603882, "epoch": 3.945760926803581, "grad_norm": 0.286146879196167, "learning_rate": 9.589274304505537e-05, "loss": 0.1922021359205246, "mean_token_accuracy": 0.9193236529827118, "num_tokens": 92430564.0, "step": 7493 }, { "entropy": 1.314402014017105, "epoch": 3.9462875197472354, "grad_norm": 0.2976517081260681, "learning_rate": 9.587108623774388e-05, "loss": 0.1778688281774521, "mean_token_accuracy": 0.9237999469041824, "num_tokens": 92442900.0, "step": 7494 }, { "entropy": 1.2591935694217682, "epoch": 3.94681411269089, "grad_norm": 0.278967946767807, "learning_rate": 9.584943026918365e-05, "loss": 0.1706763654947281, "mean_token_accuracy": 0.9272800981998444, "num_tokens": 92455236.0, "step": 7495 }, { "entropy": 1.250948041677475, "epoch": 3.9473407056345446, "grad_norm": 0.2639889121055603, "learning_rate": 9.582777514066024e-05, "loss": 0.16510087251663208, "mean_token_accuracy": 0.9280741214752197, "num_tokens": 92467572.0, "step": 7496 }, { "entropy": 1.235801875591278, "epoch": 3.947867298578199, "grad_norm": 0.27677178382873535, "learning_rate": 9.580612085345924e-05, "loss": 0.18638868629932404, "mean_token_accuracy": 0.9201086163520813, "num_tokens": 92479908.0, "step": 7497 }, { "entropy": 1.2722296118736267, "epoch": 3.9483938915218535, "grad_norm": 0.284332811832428, "learning_rate": 9.57844674088661e-05, "loss": 0.17478200793266296, "mean_token_accuracy": 0.9271548986434937, "num_tokens": 92492244.0, "step": 7498 }, { "entropy": 1.340325802564621, "epoch": 3.948920484465508, "grad_norm": 0.2919856011867523, "learning_rate": 9.576281480816631e-05, "loss": 0.18050037324428558, "mean_token_accuracy": 0.9251342415809631, "num_tokens": 92504580.0, "step": 7499 }, { "entropy": 1.3454786837100983, "epoch": 3.949447077409163, "grad_norm": 0.29903966188430786, "learning_rate": 9.57411630526452e-05, "loss": 0.1800300031900406, "mean_token_accuracy": 0.926009476184845, "num_tokens": 92516916.0, "step": 7500 }, { "entropy": 1.3552602529525757, "epoch": 3.949973670352817, "grad_norm": 0.3141869604587555, "learning_rate": 9.571951214358814e-05, "loss": 0.18520255386829376, "mean_token_accuracy": 0.9232632219791412, "num_tokens": 92529252.0, "step": 7501 }, { "entropy": 1.34744131565094, "epoch": 3.9505002632964716, "grad_norm": 0.2958497107028961, "learning_rate": 9.569786208228041e-05, "loss": 0.1796453446149826, "mean_token_accuracy": 0.9225263148546219, "num_tokens": 92541588.0, "step": 7502 }, { "entropy": 1.2951800525188446, "epoch": 3.9510268562401265, "grad_norm": 0.31804752349853516, "learning_rate": 9.567621287000724e-05, "loss": 0.19041743874549866, "mean_token_accuracy": 0.9186290353536606, "num_tokens": 92553924.0, "step": 7503 }, { "entropy": 1.2884739637374878, "epoch": 3.951553449183781, "grad_norm": 0.2896903455257416, "learning_rate": 9.565456450805382e-05, "loss": 0.17561444640159607, "mean_token_accuracy": 0.9240155518054962, "num_tokens": 92566260.0, "step": 7504 }, { "entropy": 1.2947382926940918, "epoch": 3.9520800421274354, "grad_norm": 0.2867039442062378, "learning_rate": 9.563291699770532e-05, "loss": 0.1776714026927948, "mean_token_accuracy": 0.9248031079769135, "num_tokens": 92578596.0, "step": 7505 }, { "entropy": 1.3121528923511505, "epoch": 3.9526066350710902, "grad_norm": 0.30147653818130493, "learning_rate": 9.561127034024677e-05, "loss": 0.17624038457870483, "mean_token_accuracy": 0.9245792776346207, "num_tokens": 92590932.0, "step": 7506 }, { "entropy": 1.3536790311336517, "epoch": 3.9531332280147446, "grad_norm": 0.27647480368614197, "learning_rate": 9.558962453696325e-05, "loss": 0.16962884366512299, "mean_token_accuracy": 0.9276664108037949, "num_tokens": 92603268.0, "step": 7507 }, { "entropy": 1.3156141638755798, "epoch": 3.953659820958399, "grad_norm": 0.28009626269340515, "learning_rate": 9.556797958913972e-05, "loss": 0.16551202535629272, "mean_token_accuracy": 0.9273913949728012, "num_tokens": 92615604.0, "step": 7508 }, { "entropy": 1.347121149301529, "epoch": 3.954186413902054, "grad_norm": 0.31527823209762573, "learning_rate": 9.554633549806116e-05, "loss": 0.16975153982639313, "mean_token_accuracy": 0.9277451187372208, "num_tokens": 92627940.0, "step": 7509 }, { "entropy": 1.3640653491020203, "epoch": 3.9547130068457084, "grad_norm": 0.3153354227542877, "learning_rate": 9.552469226501237e-05, "loss": 0.18295100331306458, "mean_token_accuracy": 0.9233006238937378, "num_tokens": 92640276.0, "step": 7510 }, { "entropy": 1.3119199573993683, "epoch": 3.955239599789363, "grad_norm": 0.2903278172016144, "learning_rate": 9.550304989127828e-05, "loss": 0.1801615059375763, "mean_token_accuracy": 0.9202624261379242, "num_tokens": 92652612.0, "step": 7511 }, { "entropy": 1.2877613604068756, "epoch": 3.955766192733017, "grad_norm": 0.2637787163257599, "learning_rate": 9.548140837814359e-05, "loss": 0.1738012731075287, "mean_token_accuracy": 0.9286294877529144, "num_tokens": 92664948.0, "step": 7512 }, { "entropy": 1.318818360567093, "epoch": 3.956292785676672, "grad_norm": 0.29511192440986633, "learning_rate": 9.545976772689307e-05, "loss": 0.18746647238731384, "mean_token_accuracy": 0.9240599721670151, "num_tokens": 92677284.0, "step": 7513 }, { "entropy": 1.312627375125885, "epoch": 3.9568193786203265, "grad_norm": 0.2809144854545593, "learning_rate": 9.543812793881142e-05, "loss": 0.1732306331396103, "mean_token_accuracy": 0.9288646876811981, "num_tokens": 92689620.0, "step": 7514 }, { "entropy": 1.3550857603549957, "epoch": 3.957345971563981, "grad_norm": 0.30199602246284485, "learning_rate": 9.541648901518323e-05, "loss": 0.18501755595207214, "mean_token_accuracy": 0.9217173457145691, "num_tokens": 92701956.0, "step": 7515 }, { "entropy": 1.3081051707267761, "epoch": 3.9578725645076354, "grad_norm": 0.2714572846889496, "learning_rate": 9.539485095729308e-05, "loss": 0.17930418252944946, "mean_token_accuracy": 0.9250104427337646, "num_tokens": 92714292.0, "step": 7516 }, { "entropy": 1.3340463936328888, "epoch": 3.9583991574512902, "grad_norm": 0.2664049565792084, "learning_rate": 9.537321376642546e-05, "loss": 0.17378565669059753, "mean_token_accuracy": 0.9263237565755844, "num_tokens": 92726628.0, "step": 7517 }, { "entropy": 1.321879804134369, "epoch": 3.9589257503949447, "grad_norm": 0.2919703722000122, "learning_rate": 9.535157744386494e-05, "loss": 0.1797531098127365, "mean_token_accuracy": 0.9261958748102188, "num_tokens": 92738964.0, "step": 7518 }, { "entropy": 1.3287270367145538, "epoch": 3.959452343338599, "grad_norm": 0.2807745039463043, "learning_rate": 9.532994199089588e-05, "loss": 0.1720634400844574, "mean_token_accuracy": 0.9296756684780121, "num_tokens": 92751300.0, "step": 7519 }, { "entropy": 1.3139150440692902, "epoch": 3.959978936282254, "grad_norm": 0.2645365595817566, "learning_rate": 9.530830740880268e-05, "loss": 0.16413986682891846, "mean_token_accuracy": 0.9297731667757034, "num_tokens": 92763636.0, "step": 7520 }, { "entropy": 1.2684156894683838, "epoch": 3.9605055292259084, "grad_norm": 0.28925225138664246, "learning_rate": 9.528667369886961e-05, "loss": 0.18101872503757477, "mean_token_accuracy": 0.9200309365987778, "num_tokens": 92775972.0, "step": 7521 }, { "entropy": 1.2909513413906097, "epoch": 3.961032122169563, "grad_norm": 0.2839042842388153, "learning_rate": 9.526504086238097e-05, "loss": 0.1760377734899521, "mean_token_accuracy": 0.9249915182590485, "num_tokens": 92788308.0, "step": 7522 }, { "entropy": 1.356577455997467, "epoch": 3.9615587151132177, "grad_norm": 0.3162682354450226, "learning_rate": 9.524340890062097e-05, "loss": 0.19605055451393127, "mean_token_accuracy": 0.9202203303575516, "num_tokens": 92800644.0, "step": 7523 }, { "entropy": 1.3656745851039886, "epoch": 3.962085308056872, "grad_norm": 0.31002482771873474, "learning_rate": 9.522177781487378e-05, "loss": 0.18034009635448456, "mean_token_accuracy": 0.9234649538993835, "num_tokens": 92812980.0, "step": 7524 }, { "entropy": 1.295270323753357, "epoch": 3.9626119010005265, "grad_norm": 0.2766196131706238, "learning_rate": 9.52001476064235e-05, "loss": 0.18228909373283386, "mean_token_accuracy": 0.9220178127288818, "num_tokens": 92825316.0, "step": 7525 }, { "entropy": 1.348963350057602, "epoch": 3.9631384939441814, "grad_norm": 0.3193948566913605, "learning_rate": 9.517851827655422e-05, "loss": 0.20217934250831604, "mean_token_accuracy": 0.9191700518131256, "num_tokens": 92837652.0, "step": 7526 }, { "entropy": 1.3162882328033447, "epoch": 3.963665086887836, "grad_norm": 0.27619749307632446, "learning_rate": 9.515688982654991e-05, "loss": 0.1549035906791687, "mean_token_accuracy": 0.9353099465370178, "num_tokens": 92849988.0, "step": 7527 }, { "entropy": 1.3428030014038086, "epoch": 3.9641916798314902, "grad_norm": 0.304727703332901, "learning_rate": 9.513526225769454e-05, "loss": 0.18223881721496582, "mean_token_accuracy": 0.9228622019290924, "num_tokens": 92862324.0, "step": 7528 }, { "entropy": 1.30735844373703, "epoch": 3.9647182727751447, "grad_norm": 0.2727219760417938, "learning_rate": 9.511363557127204e-05, "loss": 0.16652140021324158, "mean_token_accuracy": 0.9266299903392792, "num_tokens": 92874660.0, "step": 7529 }, { "entropy": 1.2992176413536072, "epoch": 3.9652448657187995, "grad_norm": 0.27040427923202515, "learning_rate": 9.509200976856621e-05, "loss": 0.1641957014799118, "mean_token_accuracy": 0.9336581975221634, "num_tokens": 92886996.0, "step": 7530 }, { "entropy": 1.3509510457515717, "epoch": 3.965771458662454, "grad_norm": 0.3059140741825104, "learning_rate": 9.507038485086081e-05, "loss": 0.18820726871490479, "mean_token_accuracy": 0.9169155806303024, "num_tokens": 92899332.0, "step": 7531 }, { "entropy": 1.3464178442955017, "epoch": 3.9662980516061084, "grad_norm": 0.29788780212402344, "learning_rate": 9.504876081943969e-05, "loss": 0.18500803411006927, "mean_token_accuracy": 0.9244650900363922, "num_tokens": 92911668.0, "step": 7532 }, { "entropy": 1.2732579112052917, "epoch": 3.966824644549763, "grad_norm": 0.2813820242881775, "learning_rate": 9.502713767558653e-05, "loss": 0.1802762895822525, "mean_token_accuracy": 0.9253692179918289, "num_tokens": 92924004.0, "step": 7533 }, { "entropy": 1.3419006168842316, "epoch": 3.9673512374934177, "grad_norm": 0.312103271484375, "learning_rate": 9.500551542058492e-05, "loss": 0.17921848595142365, "mean_token_accuracy": 0.9268561005592346, "num_tokens": 92936340.0, "step": 7534 }, { "entropy": 1.2903282344341278, "epoch": 3.967877830437072, "grad_norm": 0.29019781947135925, "learning_rate": 9.498389405571846e-05, "loss": 0.18339002132415771, "mean_token_accuracy": 0.9240312725305557, "num_tokens": 92948676.0, "step": 7535 }, { "entropy": 1.3509527444839478, "epoch": 3.9684044233807265, "grad_norm": 0.2800314128398895, "learning_rate": 9.49622735822707e-05, "loss": 0.1678372621536255, "mean_token_accuracy": 0.9301303774118423, "num_tokens": 92961012.0, "step": 7536 }, { "entropy": 1.299644261598587, "epoch": 3.9689310163243814, "grad_norm": 0.28727006912231445, "learning_rate": 9.494065400152508e-05, "loss": 0.17354363203048706, "mean_token_accuracy": 0.9214708656072617, "num_tokens": 92973348.0, "step": 7537 }, { "entropy": 1.331787645816803, "epoch": 3.969457609268036, "grad_norm": 0.29024335741996765, "learning_rate": 9.491903531476509e-05, "loss": 0.18393193185329437, "mean_token_accuracy": 0.920793890953064, "num_tokens": 92985684.0, "step": 7538 }, { "entropy": 1.311621993780136, "epoch": 3.9699842022116902, "grad_norm": 0.28642910718917847, "learning_rate": 9.489741752327403e-05, "loss": 0.1857396811246872, "mean_token_accuracy": 0.9191377907991409, "num_tokens": 92998020.0, "step": 7539 }, { "entropy": 1.390136182308197, "epoch": 3.970510795155345, "grad_norm": 0.32270437479019165, "learning_rate": 9.487580062833532e-05, "loss": 0.19870172441005707, "mean_token_accuracy": 0.9207863509654999, "num_tokens": 93010356.0, "step": 7540 }, { "entropy": 1.3202392160892487, "epoch": 3.9710373880989995, "grad_norm": 0.3119673430919647, "learning_rate": 9.485418463123215e-05, "loss": 0.18765456974506378, "mean_token_accuracy": 0.9160043448209763, "num_tokens": 93022692.0, "step": 7541 }, { "entropy": 1.3205336928367615, "epoch": 3.971563981042654, "grad_norm": 0.31557634472846985, "learning_rate": 9.483256953324777e-05, "loss": 0.19298219680786133, "mean_token_accuracy": 0.9155784547328949, "num_tokens": 93035028.0, "step": 7542 }, { "entropy": 1.3472093343734741, "epoch": 3.972090573986309, "grad_norm": 0.29996630549430847, "learning_rate": 9.481095533566533e-05, "loss": 0.18451613187789917, "mean_token_accuracy": 0.92573282122612, "num_tokens": 93047364.0, "step": 7543 }, { "entropy": 1.3062803745269775, "epoch": 3.9726171669299633, "grad_norm": 0.2833060622215271, "learning_rate": 9.478934203976797e-05, "loss": 0.1899745911359787, "mean_token_accuracy": 0.9236193895339966, "num_tokens": 93059700.0, "step": 7544 }, { "entropy": 1.3540114164352417, "epoch": 3.9731437598736177, "grad_norm": 0.2676866054534912, "learning_rate": 9.476772964683869e-05, "loss": 0.17042262852191925, "mean_token_accuracy": 0.9254991859197617, "num_tokens": 93072036.0, "step": 7545 }, { "entropy": 1.3275431990623474, "epoch": 3.973670352817272, "grad_norm": 0.26242774724960327, "learning_rate": 9.474611815816048e-05, "loss": 0.17449872195720673, "mean_token_accuracy": 0.9249527454376221, "num_tokens": 93084372.0, "step": 7546 }, { "entropy": 1.3328191637992859, "epoch": 3.974196945760927, "grad_norm": 0.2825845181941986, "learning_rate": 9.472450757501638e-05, "loss": 0.17568956315517426, "mean_token_accuracy": 0.9227619171142578, "num_tokens": 93096708.0, "step": 7547 }, { "entropy": 1.3070374727249146, "epoch": 3.9747235387045814, "grad_norm": 0.2826155424118042, "learning_rate": 9.470289789868924e-05, "loss": 0.17785626649856567, "mean_token_accuracy": 0.9231225848197937, "num_tokens": 93109044.0, "step": 7548 }, { "entropy": 1.3746168613433838, "epoch": 3.975250131648236, "grad_norm": 0.3055529296398163, "learning_rate": 9.468128913046188e-05, "loss": 0.1931118220090866, "mean_token_accuracy": 0.9192795604467392, "num_tokens": 93121380.0, "step": 7549 }, { "entropy": 1.344740629196167, "epoch": 3.9757767245918902, "grad_norm": 0.2886352241039276, "learning_rate": 9.465968127161711e-05, "loss": 0.18964360654354095, "mean_token_accuracy": 0.9224054515361786, "num_tokens": 93133716.0, "step": 7550 }, { "entropy": 1.3456671237945557, "epoch": 3.976303317535545, "grad_norm": 0.28195491433143616, "learning_rate": 9.463807432343763e-05, "loss": 0.17482024431228638, "mean_token_accuracy": 0.9267143756151199, "num_tokens": 93146052.0, "step": 7551 }, { "entropy": 1.3401457071304321, "epoch": 3.9768299104791995, "grad_norm": 0.27699512243270874, "learning_rate": 9.461646828720616e-05, "loss": 0.18693599104881287, "mean_token_accuracy": 0.9195725619792938, "num_tokens": 93158388.0, "step": 7552 }, { "entropy": 1.3148573637008667, "epoch": 3.977356503422854, "grad_norm": 0.2510269284248352, "learning_rate": 9.459486316420527e-05, "loss": 0.16350793838500977, "mean_token_accuracy": 0.9319835603237152, "num_tokens": 93170724.0, "step": 7553 }, { "entropy": 1.3479683995246887, "epoch": 3.977883096366509, "grad_norm": 0.2932959198951721, "learning_rate": 9.45732589557176e-05, "loss": 0.17321151494979858, "mean_token_accuracy": 0.9280009567737579, "num_tokens": 93183060.0, "step": 7554 }, { "entropy": 1.3800325095653534, "epoch": 3.9784096893101633, "grad_norm": 0.31480640172958374, "learning_rate": 9.455165566302565e-05, "loss": 0.1839628666639328, "mean_token_accuracy": 0.9236285239458084, "num_tokens": 93195396.0, "step": 7555 }, { "entropy": 1.3246859014034271, "epoch": 3.9789362822538177, "grad_norm": 0.2820781469345093, "learning_rate": 9.453005328741183e-05, "loss": 0.1780439019203186, "mean_token_accuracy": 0.9251691251993179, "num_tokens": 93207732.0, "step": 7556 }, { "entropy": 1.3023313879966736, "epoch": 3.9794628751974725, "grad_norm": 0.29186537861824036, "learning_rate": 9.450845183015857e-05, "loss": 0.18912522494792938, "mean_token_accuracy": 0.9216838777065277, "num_tokens": 93220068.0, "step": 7557 }, { "entropy": 1.3183483183383942, "epoch": 3.979989468141127, "grad_norm": 0.2793582081794739, "learning_rate": 9.448685129254828e-05, "loss": 0.1669609248638153, "mean_token_accuracy": 0.9317817240953445, "num_tokens": 93232404.0, "step": 7558 }, { "entropy": 1.3475527167320251, "epoch": 3.9805160610847814, "grad_norm": 0.27668139338493347, "learning_rate": 9.44652516758632e-05, "loss": 0.16608241200447083, "mean_token_accuracy": 0.9317691028118134, "num_tokens": 93244740.0, "step": 7559 }, { "entropy": 1.3177028894424438, "epoch": 3.9810426540284363, "grad_norm": 0.3113577663898468, "learning_rate": 9.444365298138553e-05, "loss": 0.18435797095298767, "mean_token_accuracy": 0.9207548052072525, "num_tokens": 93257076.0, "step": 7560 }, { "entropy": 1.2700896859169006, "epoch": 3.9815692469720907, "grad_norm": 0.2768622934818268, "learning_rate": 9.442205521039756e-05, "loss": 0.16947168111801147, "mean_token_accuracy": 0.92853944003582, "num_tokens": 93269412.0, "step": 7561 }, { "entropy": 1.2747684717178345, "epoch": 3.982095839915745, "grad_norm": 0.2852453291416168, "learning_rate": 9.440045836418137e-05, "loss": 0.16986969113349915, "mean_token_accuracy": 0.9299718290567398, "num_tokens": 93281748.0, "step": 7562 }, { "entropy": 1.319030523300171, "epoch": 3.9826224328593995, "grad_norm": 0.32257211208343506, "learning_rate": 9.437886244401906e-05, "loss": 0.18968331813812256, "mean_token_accuracy": 0.9188378304243088, "num_tokens": 93294084.0, "step": 7563 }, { "entropy": 1.3039062321186066, "epoch": 3.983149025803054, "grad_norm": 0.30198219418525696, "learning_rate": 9.435726745119264e-05, "loss": 0.1780025064945221, "mean_token_accuracy": 0.924556702375412, "num_tokens": 93306420.0, "step": 7564 }, { "entropy": 1.3020071685314178, "epoch": 3.983675618746709, "grad_norm": 0.3142753839492798, "learning_rate": 9.433567338698406e-05, "loss": 0.17521704733371735, "mean_token_accuracy": 0.9252939373254776, "num_tokens": 93318756.0, "step": 7565 }, { "entropy": 1.2601705193519592, "epoch": 3.9842022116903633, "grad_norm": 0.2831016480922699, "learning_rate": 9.431408025267525e-05, "loss": 0.19090916216373444, "mean_token_accuracy": 0.9184614717960358, "num_tokens": 93331092.0, "step": 7566 }, { "entropy": 1.2693793177604675, "epoch": 3.9847288046340177, "grad_norm": 0.2954610288143158, "learning_rate": 9.429248804954807e-05, "loss": 0.18366365134716034, "mean_token_accuracy": 0.9261559098958969, "num_tokens": 93343428.0, "step": 7567 }, { "entropy": 1.2716824412345886, "epoch": 3.9852553975776726, "grad_norm": 0.3004774749279022, "learning_rate": 9.427089677888432e-05, "loss": 0.18958234786987305, "mean_token_accuracy": 0.9214614927768707, "num_tokens": 93355764.0, "step": 7568 }, { "entropy": 1.2541852295398712, "epoch": 3.985781990521327, "grad_norm": 0.30183055996894836, "learning_rate": 9.42493064419658e-05, "loss": 0.17600035667419434, "mean_token_accuracy": 0.9274772852659225, "num_tokens": 93368100.0, "step": 7569 }, { "entropy": 1.237665981054306, "epoch": 3.9863085834649814, "grad_norm": 0.28173959255218506, "learning_rate": 9.422771704007409e-05, "loss": 0.1743810623884201, "mean_token_accuracy": 0.9307523667812347, "num_tokens": 93380436.0, "step": 7570 }, { "entropy": 1.2573004364967346, "epoch": 3.9868351764086363, "grad_norm": 0.2884520888328552, "learning_rate": 9.420612857449094e-05, "loss": 0.1682325303554535, "mean_token_accuracy": 0.9293691515922546, "num_tokens": 93392772.0, "step": 7571 }, { "entropy": 1.290991097688675, "epoch": 3.9873617693522907, "grad_norm": 0.29057928919792175, "learning_rate": 9.418454104649785e-05, "loss": 0.17541126906871796, "mean_token_accuracy": 0.9285570681095123, "num_tokens": 93405108.0, "step": 7572 }, { "entropy": 1.293534904718399, "epoch": 3.987888362295945, "grad_norm": 0.30405089259147644, "learning_rate": 9.41629544573764e-05, "loss": 0.17564499378204346, "mean_token_accuracy": 0.9292964190244675, "num_tokens": 93417444.0, "step": 7573 }, { "entropy": 1.3413696885108948, "epoch": 3.9884149552396, "grad_norm": 0.3326863944530487, "learning_rate": 9.4141368808408e-05, "loss": 0.1866447627544403, "mean_token_accuracy": 0.9208780378103256, "num_tokens": 93429780.0, "step": 7574 }, { "entropy": 1.3060389757156372, "epoch": 3.9889415481832544, "grad_norm": 0.27616894245147705, "learning_rate": 9.411978410087414e-05, "loss": 0.150806725025177, "mean_token_accuracy": 0.9384946525096893, "num_tokens": 93442116.0, "step": 7575 }, { "entropy": 1.2838166058063507, "epoch": 3.989468141126909, "grad_norm": 0.2959181070327759, "learning_rate": 9.409820033605614e-05, "loss": 0.18270926177501678, "mean_token_accuracy": 0.9219162911176682, "num_tokens": 93454452.0, "step": 7576 }, { "entropy": 1.3128345012664795, "epoch": 3.9899947340705637, "grad_norm": 0.28953227400779724, "learning_rate": 9.407661751523529e-05, "loss": 0.16359031200408936, "mean_token_accuracy": 0.9269338846206665, "num_tokens": 93466788.0, "step": 7577 }, { "entropy": 1.3239604234695435, "epoch": 3.990521327014218, "grad_norm": 0.2909933030605316, "learning_rate": 9.405503563969289e-05, "loss": 0.1780087947845459, "mean_token_accuracy": 0.9250047355890274, "num_tokens": 93479124.0, "step": 7578 }, { "entropy": 1.2926201224327087, "epoch": 3.9910479199578726, "grad_norm": 0.27546995878219604, "learning_rate": 9.403345471071006e-05, "loss": 0.1740032583475113, "mean_token_accuracy": 0.9257869869470596, "num_tokens": 93491460.0, "step": 7579 }, { "entropy": 1.3467094898223877, "epoch": 3.991574512901527, "grad_norm": 0.2991516590118408, "learning_rate": 9.401187472956796e-05, "loss": 0.19406607747077942, "mean_token_accuracy": 0.9218985587358475, "num_tokens": 93503796.0, "step": 7580 }, { "entropy": 1.2814543843269348, "epoch": 3.9921011058451814, "grad_norm": 0.28001993894577026, "learning_rate": 9.399029569754762e-05, "loss": 0.1770983785390854, "mean_token_accuracy": 0.9243462979793549, "num_tokens": 93516132.0, "step": 7581 }, { "entropy": 1.3417298197746277, "epoch": 3.9926276987888363, "grad_norm": 0.309066504240036, "learning_rate": 9.39687176159302e-05, "loss": 0.19472132623195648, "mean_token_accuracy": 0.9183698892593384, "num_tokens": 93528468.0, "step": 7582 }, { "entropy": 1.2971207201480865, "epoch": 3.9931542917324907, "grad_norm": 0.2736274003982544, "learning_rate": 9.394714048599653e-05, "loss": 0.1718100607395172, "mean_token_accuracy": 0.9273222237825394, "num_tokens": 93540804.0, "step": 7583 }, { "entropy": 1.3284357488155365, "epoch": 3.993680884676145, "grad_norm": 0.30235692858695984, "learning_rate": 9.392556430902759e-05, "loss": 0.18034395575523376, "mean_token_accuracy": 0.9234701097011566, "num_tokens": 93553140.0, "step": 7584 }, { "entropy": 1.2959426939487457, "epoch": 3.9942074776198, "grad_norm": 0.3051435649394989, "learning_rate": 9.39039890863042e-05, "loss": 0.19450972974300385, "mean_token_accuracy": 0.9161807149648666, "num_tokens": 93565476.0, "step": 7585 }, { "entropy": 1.3091471493244171, "epoch": 3.9947340705634544, "grad_norm": 0.27894070744514465, "learning_rate": 9.388241481910716e-05, "loss": 0.1739863008260727, "mean_token_accuracy": 0.9266135543584824, "num_tokens": 93577812.0, "step": 7586 }, { "entropy": 1.3096213042736053, "epoch": 3.995260663507109, "grad_norm": 0.30204686522483826, "learning_rate": 9.386084150871721e-05, "loss": 0.1900097280740738, "mean_token_accuracy": 0.9203787744045258, "num_tokens": 93590148.0, "step": 7587 }, { "entropy": 1.303184688091278, "epoch": 3.9957872564507637, "grad_norm": 0.28003254532814026, "learning_rate": 9.3839269156415e-05, "loss": 0.16158366203308105, "mean_token_accuracy": 0.9301228523254395, "num_tokens": 93602484.0, "step": 7588 }, { "entropy": 1.3454047739505768, "epoch": 3.996313849394418, "grad_norm": 0.31151407957077026, "learning_rate": 9.381769776348124e-05, "loss": 0.2038501352071762, "mean_token_accuracy": 0.9134414196014404, "num_tokens": 93614820.0, "step": 7589 }, { "entropy": 1.3581558465957642, "epoch": 3.9968404423380726, "grad_norm": 0.26742124557495117, "learning_rate": 9.379612733119643e-05, "loss": 0.1595117598772049, "mean_token_accuracy": 0.9353603273630142, "num_tokens": 93627156.0, "step": 7590 }, { "entropy": 1.305214762687683, "epoch": 3.9973670352817274, "grad_norm": 0.2921280562877655, "learning_rate": 9.37745578608411e-05, "loss": 0.18154413998126984, "mean_token_accuracy": 0.9237124472856522, "num_tokens": 93639492.0, "step": 7591 }, { "entropy": 1.304631233215332, "epoch": 3.997893628225382, "grad_norm": 0.2871142029762268, "learning_rate": 9.37529893536957e-05, "loss": 0.1777011752128601, "mean_token_accuracy": 0.9233687371015549, "num_tokens": 93651828.0, "step": 7592 }, { "entropy": 1.3112380504608154, "epoch": 3.9984202211690363, "grad_norm": 0.2854442000389099, "learning_rate": 9.373142181104065e-05, "loss": 0.18337658047676086, "mean_token_accuracy": 0.9219502508640289, "num_tokens": 93664164.0, "step": 7593 }, { "entropy": 1.2995306849479675, "epoch": 3.998946814112691, "grad_norm": 0.28682613372802734, "learning_rate": 9.370985523415623e-05, "loss": 0.18945598602294922, "mean_token_accuracy": 0.9239040315151215, "num_tokens": 93676500.0, "step": 7594 }, { "entropy": 1.3250145316123962, "epoch": 3.9994734070563456, "grad_norm": 0.3174082934856415, "learning_rate": 9.368828962432275e-05, "loss": 0.18585076928138733, "mean_token_accuracy": 0.9195867776870728, "num_tokens": 93688836.0, "step": 7595 }, { "entropy": 1.3290630280971527, "epoch": 4.0, "grad_norm": 0.29731038212776184, "learning_rate": 9.366672498282045e-05, "loss": 0.1742815226316452, "mean_token_accuracy": 0.9284393042325974, "num_tokens": 93700144.0, "step": 7596 }, { "epoch": 4.0, "eval_entropy": 1.3225353589617874, "eval_loss": 0.19561795890331268, "eval_mean_token_accuracy": 0.9197511109256192, "eval_num_tokens": 93700144.0, "eval_runtime": 665.4902, "eval_samples_per_second": 8.561, "eval_steps_per_second": 2.854, "step": 7596 }, { "entropy": 1.3247161507606506, "epoch": 4.000526592943655, "grad_norm": 0.28038930892944336, "learning_rate": 9.364516131092953e-05, "loss": 0.17094804346561432, "mean_token_accuracy": 0.933413103222847, "num_tokens": 93712480.0, "step": 7597 }, { "entropy": 1.3140203058719635, "epoch": 4.001053185887309, "grad_norm": 0.2799552381038666, "learning_rate": 9.362359860993004e-05, "loss": 0.1631288230419159, "mean_token_accuracy": 0.9272639006376266, "num_tokens": 93724816.0, "step": 7598 }, { "entropy": 1.315209150314331, "epoch": 4.001579778830964, "grad_norm": 0.2712099850177765, "learning_rate": 9.360203688110203e-05, "loss": 0.16098222136497498, "mean_token_accuracy": 0.9326698184013367, "num_tokens": 93737152.0, "step": 7599 }, { "entropy": 1.2736327052116394, "epoch": 4.002106371774619, "grad_norm": 0.2905905842781067, "learning_rate": 9.358047612572554e-05, "loss": 0.17343084514141083, "mean_token_accuracy": 0.9266268759965897, "num_tokens": 93749488.0, "step": 7600 }, { "entropy": 1.2937598526477814, "epoch": 4.002632964718273, "grad_norm": 0.2726406753063202, "learning_rate": 9.355891634508048e-05, "loss": 0.15777438879013062, "mean_token_accuracy": 0.9339054971933365, "num_tokens": 93761824.0, "step": 7601 }, { "entropy": 1.2746125161647797, "epoch": 4.003159557661927, "grad_norm": 0.2830272912979126, "learning_rate": 9.353735754044671e-05, "loss": 0.16077198088169098, "mean_token_accuracy": 0.928732693195343, "num_tokens": 93774160.0, "step": 7602 }, { "entropy": 1.2600156366825104, "epoch": 4.003686150605582, "grad_norm": 0.29081904888153076, "learning_rate": 9.351579971310406e-05, "loss": 0.1667558252811432, "mean_token_accuracy": 0.9284805953502655, "num_tokens": 93786496.0, "step": 7603 }, { "entropy": 1.2500266432762146, "epoch": 4.004212743549236, "grad_norm": 0.28229841589927673, "learning_rate": 9.349424286433235e-05, "loss": 0.1627058982849121, "mean_token_accuracy": 0.9333308339118958, "num_tokens": 93798832.0, "step": 7604 }, { "entropy": 1.2111939489841461, "epoch": 4.004739336492891, "grad_norm": 0.25802233815193176, "learning_rate": 9.34726869954112e-05, "loss": 0.15984860062599182, "mean_token_accuracy": 0.9333975464105606, "num_tokens": 93811168.0, "step": 7605 }, { "entropy": 1.279177486896515, "epoch": 4.005265929436545, "grad_norm": 0.28383538126945496, "learning_rate": 9.345113210762033e-05, "loss": 0.1689261943101883, "mean_token_accuracy": 0.9301945567131042, "num_tokens": 93823504.0, "step": 7606 }, { "entropy": 1.189927488565445, "epoch": 4.0057925223802, "grad_norm": 0.2803577780723572, "learning_rate": 9.342957820223928e-05, "loss": 0.16628915071487427, "mean_token_accuracy": 0.9307795763015747, "num_tokens": 93835840.0, "step": 7607 }, { "entropy": 1.2364709079265594, "epoch": 4.006319115323855, "grad_norm": 0.3095937967300415, "learning_rate": 9.340802528054759e-05, "loss": 0.1679101139307022, "mean_token_accuracy": 0.9346950799226761, "num_tokens": 93848176.0, "step": 7608 }, { "entropy": 1.2356630861759186, "epoch": 4.006845708267509, "grad_norm": 0.29372677206993103, "learning_rate": 9.338647334382468e-05, "loss": 0.17340870201587677, "mean_token_accuracy": 0.9274387061595917, "num_tokens": 93860512.0, "step": 7609 }, { "entropy": 1.1975701749324799, "epoch": 4.007372301211164, "grad_norm": 0.2953545153141022, "learning_rate": 9.336492239335009e-05, "loss": 0.16814272105693817, "mean_token_accuracy": 0.930532306432724, "num_tokens": 93872848.0, "step": 7610 }, { "entropy": 1.2367688715457916, "epoch": 4.007898894154819, "grad_norm": 0.32117795944213867, "learning_rate": 9.334337243040308e-05, "loss": 0.17463235557079315, "mean_token_accuracy": 0.9313275516033173, "num_tokens": 93885184.0, "step": 7611 }, { "entropy": 1.1813238263130188, "epoch": 4.008425487098473, "grad_norm": 0.3083871006965637, "learning_rate": 9.332182345626297e-05, "loss": 0.16935645043849945, "mean_token_accuracy": 0.9265637248754501, "num_tokens": 93897520.0, "step": 7612 }, { "entropy": 1.1819349527359009, "epoch": 4.008952080042127, "grad_norm": 0.2872036099433899, "learning_rate": 9.330027547220901e-05, "loss": 0.16818834841251373, "mean_token_accuracy": 0.9316693395376205, "num_tokens": 93909856.0, "step": 7613 }, { "entropy": 1.1806930601596832, "epoch": 4.009478672985782, "grad_norm": 0.30134302377700806, "learning_rate": 9.327872847952033e-05, "loss": 0.16665314137935638, "mean_token_accuracy": 0.9284096360206604, "num_tokens": 93922192.0, "step": 7614 }, { "entropy": 1.2107106745243073, "epoch": 4.010005265929436, "grad_norm": 0.3218785524368286, "learning_rate": 9.32571824794761e-05, "loss": 0.16514340043067932, "mean_token_accuracy": 0.9272081404924393, "num_tokens": 93934528.0, "step": 7615 }, { "entropy": 1.220152109861374, "epoch": 4.010531858873091, "grad_norm": 0.2992253601551056, "learning_rate": 9.323563747335534e-05, "loss": 0.15220335125923157, "mean_token_accuracy": 0.9355946183204651, "num_tokens": 93946864.0, "step": 7616 }, { "entropy": 1.1810352504253387, "epoch": 4.011058451816746, "grad_norm": 0.30068567395210266, "learning_rate": 9.321409346243708e-05, "loss": 0.17050591111183167, "mean_token_accuracy": 0.9311152696609497, "num_tokens": 93959200.0, "step": 7617 }, { "entropy": 1.2200407087802887, "epoch": 4.0115850447604, "grad_norm": 0.3415607511997223, "learning_rate": 9.319255044800026e-05, "loss": 0.19771385192871094, "mean_token_accuracy": 0.9130164235830307, "num_tokens": 93971536.0, "step": 7618 }, { "entropy": 1.22043839097023, "epoch": 4.012111637704055, "grad_norm": 0.29582586884498596, "learning_rate": 9.317100843132376e-05, "loss": 0.16629989445209503, "mean_token_accuracy": 0.9278903901576996, "num_tokens": 93983872.0, "step": 7619 }, { "entropy": 1.1786834001541138, "epoch": 4.01263823064771, "grad_norm": 0.27751415967941284, "learning_rate": 9.31494674136864e-05, "loss": 0.15829351544380188, "mean_token_accuracy": 0.9284335672855377, "num_tokens": 93996208.0, "step": 7620 }, { "entropy": 1.186080425977707, "epoch": 4.013164823591364, "grad_norm": 0.2798832654953003, "learning_rate": 9.312792739636695e-05, "loss": 0.16906145215034485, "mean_token_accuracy": 0.9283495247364044, "num_tokens": 94008544.0, "step": 7621 }, { "entropy": 1.2248172760009766, "epoch": 4.013691416535019, "grad_norm": 0.29892873764038086, "learning_rate": 9.310638838064412e-05, "loss": 0.16769753396511078, "mean_token_accuracy": 0.9286182522773743, "num_tokens": 94020880.0, "step": 7622 }, { "entropy": 1.207178771495819, "epoch": 4.014218009478673, "grad_norm": 0.3020927608013153, "learning_rate": 9.308485036779653e-05, "loss": 0.1729079931974411, "mean_token_accuracy": 0.9266164600849152, "num_tokens": 94033216.0, "step": 7623 }, { "entropy": 1.2358357906341553, "epoch": 4.0147446024223274, "grad_norm": 0.2990860939025879, "learning_rate": 9.306331335910279e-05, "loss": 0.16199710965156555, "mean_token_accuracy": 0.9346498548984528, "num_tokens": 94045552.0, "step": 7624 }, { "entropy": 1.2032581567764282, "epoch": 4.015271195365982, "grad_norm": 0.2720547616481781, "learning_rate": 9.30417773558414e-05, "loss": 0.15510684251785278, "mean_token_accuracy": 0.9321534186601639, "num_tokens": 94057888.0, "step": 7625 }, { "entropy": 1.1826758682727814, "epoch": 4.015797788309636, "grad_norm": 0.2762111723423004, "learning_rate": 9.30202423592909e-05, "loss": 0.1652383804321289, "mean_token_accuracy": 0.9285622835159302, "num_tokens": 94070224.0, "step": 7626 }, { "entropy": 1.2435753345489502, "epoch": 4.016324381253291, "grad_norm": 0.3012768030166626, "learning_rate": 9.299870837072963e-05, "loss": 0.1751018464565277, "mean_token_accuracy": 0.9221531003713608, "num_tokens": 94082560.0, "step": 7627 }, { "entropy": 1.2213923335075378, "epoch": 4.016850974196946, "grad_norm": 0.30483144521713257, "learning_rate": 9.297717539143595e-05, "loss": 0.177472323179245, "mean_token_accuracy": 0.9264393597841263, "num_tokens": 94094896.0, "step": 7628 }, { "entropy": 1.2358782887458801, "epoch": 4.0173775671406, "grad_norm": 0.2983492314815521, "learning_rate": 9.295564342268814e-05, "loss": 0.16957278549671173, "mean_token_accuracy": 0.9324619174003601, "num_tokens": 94107232.0, "step": 7629 }, { "entropy": 1.1866886913776398, "epoch": 4.017904160084255, "grad_norm": 0.2812538146972656, "learning_rate": 9.293411246576442e-05, "loss": 0.16486573219299316, "mean_token_accuracy": 0.9269909560680389, "num_tokens": 94119568.0, "step": 7630 }, { "entropy": 1.1595516502857208, "epoch": 4.01843075302791, "grad_norm": 0.27558693289756775, "learning_rate": 9.291258252194302e-05, "loss": 0.171391099691391, "mean_token_accuracy": 0.9275785386562347, "num_tokens": 94131904.0, "step": 7631 }, { "entropy": 1.2074815928936005, "epoch": 4.018957345971564, "grad_norm": 0.27395132184028625, "learning_rate": 9.289105359250197e-05, "loss": 0.1544472724199295, "mean_token_accuracy": 0.9366539567708969, "num_tokens": 94144240.0, "step": 7632 }, { "entropy": 1.2296015918254852, "epoch": 4.019483938915219, "grad_norm": 0.31429916620254517, "learning_rate": 9.286952567871937e-05, "loss": 0.18945646286010742, "mean_token_accuracy": 0.9228938817977905, "num_tokens": 94156576.0, "step": 7633 }, { "entropy": 1.2256301045417786, "epoch": 4.0200105318588735, "grad_norm": 0.3136304020881653, "learning_rate": 9.284799878187318e-05, "loss": 0.17368486523628235, "mean_token_accuracy": 0.9205718636512756, "num_tokens": 94168912.0, "step": 7634 }, { "entropy": 1.1827037334442139, "epoch": 4.0205371248025275, "grad_norm": 0.27767834067344666, "learning_rate": 9.282647290324131e-05, "loss": 0.15670537948608398, "mean_token_accuracy": 0.9334949851036072, "num_tokens": 94181248.0, "step": 7635 }, { "entropy": 1.160859763622284, "epoch": 4.021063717746182, "grad_norm": 0.28529998660087585, "learning_rate": 9.280494804410167e-05, "loss": 0.17210625112056732, "mean_token_accuracy": 0.92775097489357, "num_tokens": 94193584.0, "step": 7636 }, { "entropy": 1.234814703464508, "epoch": 4.021590310689837, "grad_norm": 0.3064624071121216, "learning_rate": 9.278342420573203e-05, "loss": 0.17227551341056824, "mean_token_accuracy": 0.9232846647500992, "num_tokens": 94205920.0, "step": 7637 }, { "entropy": 1.1790968775749207, "epoch": 4.022116903633491, "grad_norm": 0.2977254092693329, "learning_rate": 9.276190138941016e-05, "loss": 0.16933214664459229, "mean_token_accuracy": 0.9287389814853668, "num_tokens": 94218256.0, "step": 7638 }, { "entropy": 1.2044597268104553, "epoch": 4.022643496577146, "grad_norm": 0.31107184290885925, "learning_rate": 9.274037959641375e-05, "loss": 0.16668042540550232, "mean_token_accuracy": 0.9309228360652924, "num_tokens": 94230592.0, "step": 7639 }, { "entropy": 1.1837238669395447, "epoch": 4.0231700895208, "grad_norm": 0.28915640711784363, "learning_rate": 9.271885882802038e-05, "loss": 0.16029953956604004, "mean_token_accuracy": 0.9349488466978073, "num_tokens": 94242928.0, "step": 7640 }, { "entropy": 1.1911191940307617, "epoch": 4.023696682464455, "grad_norm": 0.2777077257633209, "learning_rate": 9.269733908550766e-05, "loss": 0.15964436531066895, "mean_token_accuracy": 0.9307241886854172, "num_tokens": 94255264.0, "step": 7641 }, { "entropy": 1.197167456150055, "epoch": 4.02422327540811, "grad_norm": 0.319174200296402, "learning_rate": 9.267582037015308e-05, "loss": 0.17807632684707642, "mean_token_accuracy": 0.9253161549568176, "num_tokens": 94267600.0, "step": 7642 }, { "entropy": 1.1747731864452362, "epoch": 4.024749868351764, "grad_norm": 0.3175990879535675, "learning_rate": 9.265430268323405e-05, "loss": 0.17977938055992126, "mean_token_accuracy": 0.9230655282735825, "num_tokens": 94279936.0, "step": 7643 }, { "entropy": 1.2191549837589264, "epoch": 4.025276461295419, "grad_norm": 0.30055975914001465, "learning_rate": 9.263278602602793e-05, "loss": 0.16622185707092285, "mean_token_accuracy": 0.9327243268489838, "num_tokens": 94292272.0, "step": 7644 }, { "entropy": 1.2362992465496063, "epoch": 4.0258030542390735, "grad_norm": 0.2924559414386749, "learning_rate": 9.261127039981212e-05, "loss": 0.15750610828399658, "mean_token_accuracy": 0.9389059543609619, "num_tokens": 94304608.0, "step": 7645 }, { "entropy": 1.2117838263511658, "epoch": 4.0263296471827275, "grad_norm": 0.2834373414516449, "learning_rate": 9.258975580586386e-05, "loss": 0.17272533476352692, "mean_token_accuracy": 0.9291851818561554, "num_tokens": 94316944.0, "step": 7646 }, { "entropy": 1.2353555560112, "epoch": 4.026856240126382, "grad_norm": 0.3317455053329468, "learning_rate": 9.256824224546033e-05, "loss": 0.16746200621128082, "mean_token_accuracy": 0.9323631823062897, "num_tokens": 94329280.0, "step": 7647 }, { "entropy": 1.2107363045215607, "epoch": 4.027382833070037, "grad_norm": 0.30810093879699707, "learning_rate": 9.254672971987863e-05, "loss": 0.16410067677497864, "mean_token_accuracy": 0.9268451780080795, "num_tokens": 94341616.0, "step": 7648 }, { "entropy": 1.2018360793590546, "epoch": 4.027909426013691, "grad_norm": 0.299425333738327, "learning_rate": 9.252521823039586e-05, "loss": 0.16118401288986206, "mean_token_accuracy": 0.9302340000867844, "num_tokens": 94353952.0, "step": 7649 }, { "entropy": 1.183328002691269, "epoch": 4.028436018957346, "grad_norm": 0.3065415322780609, "learning_rate": 9.250370777828903e-05, "loss": 0.17037290334701538, "mean_token_accuracy": 0.9274340569972992, "num_tokens": 94366288.0, "step": 7650 }, { "entropy": 1.2194631397724152, "epoch": 4.028962611901001, "grad_norm": 0.28854551911354065, "learning_rate": 9.24821983648351e-05, "loss": 0.16530030965805054, "mean_token_accuracy": 0.9310954511165619, "num_tokens": 94378624.0, "step": 7651 }, { "entropy": 1.1633674800395966, "epoch": 4.029489204844655, "grad_norm": 0.2949987053871155, "learning_rate": 9.246068999131095e-05, "loss": 0.16954991221427917, "mean_token_accuracy": 0.926768958568573, "num_tokens": 94390960.0, "step": 7652 }, { "entropy": 1.1591119170188904, "epoch": 4.03001579778831, "grad_norm": 0.30837175250053406, "learning_rate": 9.24391826589934e-05, "loss": 0.1687844842672348, "mean_token_accuracy": 0.9251392185688019, "num_tokens": 94403296.0, "step": 7653 }, { "entropy": 1.1513308882713318, "epoch": 4.030542390731965, "grad_norm": 0.27197301387786865, "learning_rate": 9.241767636915923e-05, "loss": 0.15422660112380981, "mean_token_accuracy": 0.9365798979997635, "num_tokens": 94415632.0, "step": 7654 }, { "entropy": 1.1872649192810059, "epoch": 4.031068983675619, "grad_norm": 0.3005768954753876, "learning_rate": 9.239617112308514e-05, "loss": 0.17201045155525208, "mean_token_accuracy": 0.9225270748138428, "num_tokens": 94427968.0, "step": 7655 }, { "entropy": 1.186728149652481, "epoch": 4.0315955766192735, "grad_norm": 0.3057633638381958, "learning_rate": 9.237466692204779e-05, "loss": 0.17150339484214783, "mean_token_accuracy": 0.9274269491434097, "num_tokens": 94440304.0, "step": 7656 }, { "entropy": 1.1701045334339142, "epoch": 4.0321221695629275, "grad_norm": 0.3205059766769409, "learning_rate": 9.235316376732372e-05, "loss": 0.17326562106609344, "mean_token_accuracy": 0.9279216825962067, "num_tokens": 94452640.0, "step": 7657 }, { "entropy": 1.1700592339038849, "epoch": 4.032648762506582, "grad_norm": 0.2768852710723877, "learning_rate": 9.23316616601894e-05, "loss": 0.1595529466867447, "mean_token_accuracy": 0.9313892722129822, "num_tokens": 94464976.0, "step": 7658 }, { "entropy": 1.1968066990375519, "epoch": 4.033175355450237, "grad_norm": 0.3190721869468689, "learning_rate": 9.231016060192144e-05, "loss": 0.17669986188411713, "mean_token_accuracy": 0.9311529695987701, "num_tokens": 94477312.0, "step": 7659 }, { "entropy": 1.1885199844837189, "epoch": 4.033701948393891, "grad_norm": 0.3203064799308777, "learning_rate": 9.22886605937961e-05, "loss": 0.19421350955963135, "mean_token_accuracy": 0.9194667488336563, "num_tokens": 94489648.0, "step": 7660 }, { "entropy": 1.1926580965518951, "epoch": 4.034228541337546, "grad_norm": 0.2843152582645416, "learning_rate": 9.226716163708977e-05, "loss": 0.17572253942489624, "mean_token_accuracy": 0.9240142405033112, "num_tokens": 94501984.0, "step": 7661 }, { "entropy": 1.1637931764125824, "epoch": 4.034755134281201, "grad_norm": 0.29263269901275635, "learning_rate": 9.224566373307868e-05, "loss": 0.1703728288412094, "mean_token_accuracy": 0.9271754175424576, "num_tokens": 94514320.0, "step": 7662 }, { "entropy": 1.1855376064777374, "epoch": 4.035281727224855, "grad_norm": 0.2865487337112427, "learning_rate": 9.222416688303908e-05, "loss": 0.16310441493988037, "mean_token_accuracy": 0.9321675002574921, "num_tokens": 94526656.0, "step": 7663 }, { "entropy": 1.2216345369815826, "epoch": 4.03580832016851, "grad_norm": 0.3266688883304596, "learning_rate": 9.220267108824705e-05, "loss": 0.18946443498134613, "mean_token_accuracy": 0.9214964807033539, "num_tokens": 94538992.0, "step": 7664 }, { "entropy": 1.2222075462341309, "epoch": 4.036334913112165, "grad_norm": 0.2968806028366089, "learning_rate": 9.218117634997872e-05, "loss": 0.1718311607837677, "mean_token_accuracy": 0.9296060502529144, "num_tokens": 94551328.0, "step": 7665 }, { "entropy": 1.2179431319236755, "epoch": 4.036861506055819, "grad_norm": 0.30279970169067383, "learning_rate": 9.21596826695101e-05, "loss": 0.16893449425697327, "mean_token_accuracy": 0.9293600171804428, "num_tokens": 94563664.0, "step": 7666 }, { "entropy": 1.1651307940483093, "epoch": 4.0373880989994735, "grad_norm": 0.29839229583740234, "learning_rate": 9.213819004811713e-05, "loss": 0.16824936866760254, "mean_token_accuracy": 0.9303262531757355, "num_tokens": 94576000.0, "step": 7667 }, { "entropy": 1.1775596141815186, "epoch": 4.037914691943128, "grad_norm": 0.2823132276535034, "learning_rate": 9.211669848707571e-05, "loss": 0.16800472140312195, "mean_token_accuracy": 0.9270628541707993, "num_tokens": 94588336.0, "step": 7668 }, { "entropy": 1.1981311738491058, "epoch": 4.038441284886782, "grad_norm": 0.2845676839351654, "learning_rate": 9.209520798766167e-05, "loss": 0.16031980514526367, "mean_token_accuracy": 0.930248573422432, "num_tokens": 94600672.0, "step": 7669 }, { "entropy": 1.1773464381694794, "epoch": 4.038967877830437, "grad_norm": 0.2765822410583496, "learning_rate": 9.207371855115079e-05, "loss": 0.1604149490594864, "mean_token_accuracy": 0.9327312558889389, "num_tokens": 94613008.0, "step": 7670 }, { "entropy": 1.1805593073368073, "epoch": 4.039494470774091, "grad_norm": 0.30690789222717285, "learning_rate": 9.205223017881876e-05, "loss": 0.16592201590538025, "mean_token_accuracy": 0.9334001690149307, "num_tokens": 94625344.0, "step": 7671 }, { "entropy": 1.2014459669589996, "epoch": 4.040021063717746, "grad_norm": 0.28434988856315613, "learning_rate": 9.203074287194118e-05, "loss": 0.1585979461669922, "mean_token_accuracy": 0.9333416223526001, "num_tokens": 94637680.0, "step": 7672 }, { "entropy": 1.161016583442688, "epoch": 4.040547656661401, "grad_norm": 0.29344049096107483, "learning_rate": 9.200925663179368e-05, "loss": 0.17373454570770264, "mean_token_accuracy": 0.9291245192289352, "num_tokens": 94650016.0, "step": 7673 }, { "entropy": 1.15232253074646, "epoch": 4.041074249605055, "grad_norm": 0.28777480125427246, "learning_rate": 9.198777145965176e-05, "loss": 0.1674036979675293, "mean_token_accuracy": 0.9266617000102997, "num_tokens": 94662352.0, "step": 7674 }, { "entropy": 1.1632183492183685, "epoch": 4.04160084254871, "grad_norm": 0.2981170117855072, "learning_rate": 9.196628735679089e-05, "loss": 0.16659529507160187, "mean_token_accuracy": 0.9293522536754608, "num_tokens": 94674688.0, "step": 7675 }, { "entropy": 1.1899208426475525, "epoch": 4.042127435492365, "grad_norm": 0.30841583013534546, "learning_rate": 9.194480432448642e-05, "loss": 0.16978931427001953, "mean_token_accuracy": 0.9258794486522675, "num_tokens": 94687024.0, "step": 7676 }, { "entropy": 1.1658337712287903, "epoch": 4.042654028436019, "grad_norm": 0.31560614705085754, "learning_rate": 9.192332236401366e-05, "loss": 0.174443319439888, "mean_token_accuracy": 0.9253016412258148, "num_tokens": 94699360.0, "step": 7677 }, { "entropy": 1.1231940388679504, "epoch": 4.0431806213796735, "grad_norm": 0.3076082766056061, "learning_rate": 9.190184147664791e-05, "loss": 0.18150557577610016, "mean_token_accuracy": 0.9241388291120529, "num_tokens": 94711696.0, "step": 7678 }, { "entropy": 1.1360673606395721, "epoch": 4.043707214323328, "grad_norm": 0.2781311273574829, "learning_rate": 9.188036166366434e-05, "loss": 0.14312730729579926, "mean_token_accuracy": 0.9410314112901688, "num_tokens": 94724032.0, "step": 7679 }, { "entropy": 1.1913892030715942, "epoch": 4.044233807266982, "grad_norm": 0.27803662419319153, "learning_rate": 9.185888292633808e-05, "loss": 0.15081775188446045, "mean_token_accuracy": 0.9355782866477966, "num_tokens": 94736368.0, "step": 7680 }, { "entropy": 1.231190025806427, "epoch": 4.044760400210637, "grad_norm": 0.31414955854415894, "learning_rate": 9.183740526594422e-05, "loss": 0.17506641149520874, "mean_token_accuracy": 0.9279109090566635, "num_tokens": 94748704.0, "step": 7681 }, { "entropy": 1.169010728597641, "epoch": 4.045286993154292, "grad_norm": 0.31384047865867615, "learning_rate": 9.181592868375774e-05, "loss": 0.16979721188545227, "mean_token_accuracy": 0.927495077252388, "num_tokens": 94761040.0, "step": 7682 }, { "entropy": 1.1776751279830933, "epoch": 4.045813586097946, "grad_norm": 0.30844661593437195, "learning_rate": 9.179445318105359e-05, "loss": 0.179082989692688, "mean_token_accuracy": 0.9232382923364639, "num_tokens": 94773376.0, "step": 7683 }, { "entropy": 1.1751681566238403, "epoch": 4.046340179041601, "grad_norm": 0.31246253848075867, "learning_rate": 9.177297875910667e-05, "loss": 0.17229889333248138, "mean_token_accuracy": 0.9299486726522446, "num_tokens": 94785712.0, "step": 7684 }, { "entropy": 1.1758607625961304, "epoch": 4.046866771985256, "grad_norm": 0.2907005250453949, "learning_rate": 9.175150541919175e-05, "loss": 0.17025050520896912, "mean_token_accuracy": 0.9275670498609543, "num_tokens": 94798048.0, "step": 7685 }, { "entropy": 1.175299733877182, "epoch": 4.04739336492891, "grad_norm": 0.3472633957862854, "learning_rate": 9.173003316258358e-05, "loss": 0.18637455999851227, "mean_token_accuracy": 0.9222482144832611, "num_tokens": 94810384.0, "step": 7686 }, { "entropy": 1.1338006854057312, "epoch": 4.047919957872565, "grad_norm": 0.31773582100868225, "learning_rate": 9.170856199055686e-05, "loss": 0.1717059314250946, "mean_token_accuracy": 0.9300213307142258, "num_tokens": 94822720.0, "step": 7687 }, { "entropy": 1.1469743847846985, "epoch": 4.048446550816219, "grad_norm": 0.30012696981430054, "learning_rate": 9.16870919043862e-05, "loss": 0.1653796136379242, "mean_token_accuracy": 0.9329687058925629, "num_tokens": 94835056.0, "step": 7688 }, { "entropy": 1.2179695963859558, "epoch": 4.0489731437598735, "grad_norm": 0.3160686790943146, "learning_rate": 9.166562290534617e-05, "loss": 0.1708589345216751, "mean_token_accuracy": 0.9323849081993103, "num_tokens": 94847392.0, "step": 7689 }, { "entropy": 1.1527775526046753, "epoch": 4.049499736703528, "grad_norm": 0.3100028932094574, "learning_rate": 9.164415499471126e-05, "loss": 0.16755883395671844, "mean_token_accuracy": 0.9321497231721878, "num_tokens": 94859728.0, "step": 7690 }, { "entropy": 1.1934599876403809, "epoch": 4.050026329647182, "grad_norm": 0.3215983211994171, "learning_rate": 9.162268817375588e-05, "loss": 0.17192670702934265, "mean_token_accuracy": 0.9277555197477341, "num_tokens": 94872064.0, "step": 7691 }, { "entropy": 1.1944094598293304, "epoch": 4.050552922590837, "grad_norm": 0.3270973265171051, "learning_rate": 9.160122244375438e-05, "loss": 0.17648163437843323, "mean_token_accuracy": 0.9270730316638947, "num_tokens": 94884400.0, "step": 7692 }, { "entropy": 1.085465520620346, "epoch": 4.051079515534492, "grad_norm": 0.2777954339981079, "learning_rate": 9.157975780598102e-05, "loss": 0.1513337343931198, "mean_token_accuracy": 0.9367313086986542, "num_tokens": 94896736.0, "step": 7693 }, { "entropy": 1.1473877131938934, "epoch": 4.051606108478146, "grad_norm": 0.28670284152030945, "learning_rate": 9.155829426171014e-05, "loss": 0.16905376315116882, "mean_token_accuracy": 0.9282949566841125, "num_tokens": 94909072.0, "step": 7694 }, { "entropy": 1.1510609090328217, "epoch": 4.052132701421801, "grad_norm": 0.29587459564208984, "learning_rate": 9.153683181221584e-05, "loss": 0.16510915756225586, "mean_token_accuracy": 0.9254784286022186, "num_tokens": 94921408.0, "step": 7695 }, { "entropy": 1.2123608887195587, "epoch": 4.052659294365456, "grad_norm": 0.30327266454696655, "learning_rate": 9.151537045877221e-05, "loss": 0.16675429046154022, "mean_token_accuracy": 0.9305920749902725, "num_tokens": 94933744.0, "step": 7696 }, { "entropy": 1.13215371966362, "epoch": 4.05318588730911, "grad_norm": 0.28354012966156006, "learning_rate": 9.149391020265329e-05, "loss": 0.1574067920446396, "mean_token_accuracy": 0.9331772923469543, "num_tokens": 94946080.0, "step": 7697 }, { "entropy": 1.1962259411811829, "epoch": 4.053712480252765, "grad_norm": 0.3534603714942932, "learning_rate": 9.14724510451331e-05, "loss": 0.17996813356876373, "mean_token_accuracy": 0.9196730256080627, "num_tokens": 94958416.0, "step": 7698 }, { "entropy": 1.1980598270893097, "epoch": 4.0542390731964195, "grad_norm": 0.31711629033088684, "learning_rate": 9.145099298748548e-05, "loss": 0.18711501359939575, "mean_token_accuracy": 0.9252251833677292, "num_tokens": 94970752.0, "step": 7699 }, { "entropy": 1.1515044569969177, "epoch": 4.0547656661400735, "grad_norm": 0.3168085515499115, "learning_rate": 9.142953603098426e-05, "loss": 0.1905432641506195, "mean_token_accuracy": 0.9175328314304352, "num_tokens": 94983088.0, "step": 7700 }, { "entropy": 1.2119370102882385, "epoch": 4.055292259083728, "grad_norm": 0.3189827501773834, "learning_rate": 9.140808017690327e-05, "loss": 0.17547422647476196, "mean_token_accuracy": 0.9245815277099609, "num_tokens": 94995424.0, "step": 7701 }, { "entropy": 1.1621211171150208, "epoch": 4.055818852027383, "grad_norm": 0.27919694781303406, "learning_rate": 9.138662542651621e-05, "loss": 0.1620962917804718, "mean_token_accuracy": 0.9340144544839859, "num_tokens": 95007760.0, "step": 7702 }, { "entropy": 1.1824475526809692, "epoch": 4.056345444971037, "grad_norm": 0.30076032876968384, "learning_rate": 9.136517178109672e-05, "loss": 0.16206148266792297, "mean_token_accuracy": 0.9283110499382019, "num_tokens": 95020096.0, "step": 7703 }, { "entropy": 1.1707939803600311, "epoch": 4.056872037914692, "grad_norm": 0.2912147641181946, "learning_rate": 9.134371924191835e-05, "loss": 0.16207239031791687, "mean_token_accuracy": 0.9271405339241028, "num_tokens": 95032432.0, "step": 7704 }, { "entropy": 1.1700113713741302, "epoch": 4.057398630858346, "grad_norm": 0.28976571559906006, "learning_rate": 9.132226781025466e-05, "loss": 0.1699160784482956, "mean_token_accuracy": 0.9242600500583649, "num_tokens": 95044768.0, "step": 7705 }, { "entropy": 1.1340029835700989, "epoch": 4.057925223802001, "grad_norm": 0.30861327052116394, "learning_rate": 9.130081748737904e-05, "loss": 0.1820501834154129, "mean_token_accuracy": 0.9228951781988144, "num_tokens": 95057104.0, "step": 7706 }, { "entropy": 1.2257311046123505, "epoch": 4.058451816745656, "grad_norm": 0.29901832342147827, "learning_rate": 9.127936827456487e-05, "loss": 0.1696225255727768, "mean_token_accuracy": 0.92838254570961, "num_tokens": 95069440.0, "step": 7707 }, { "entropy": 1.2083201706409454, "epoch": 4.05897840968931, "grad_norm": 0.3079107999801636, "learning_rate": 9.125792017308553e-05, "loss": 0.18569520115852356, "mean_token_accuracy": 0.9237589240074158, "num_tokens": 95081776.0, "step": 7708 }, { "entropy": 1.1831274926662445, "epoch": 4.059505002632965, "grad_norm": 0.32265934348106384, "learning_rate": 9.123647318421424e-05, "loss": 0.1859566867351532, "mean_token_accuracy": 0.9216562062501907, "num_tokens": 95094112.0, "step": 7709 }, { "entropy": 1.2142370343208313, "epoch": 4.0600315955766195, "grad_norm": 0.2909403443336487, "learning_rate": 9.121502730922418e-05, "loss": 0.14973674714565277, "mean_token_accuracy": 0.9379659593105316, "num_tokens": 95106448.0, "step": 7710 }, { "entropy": 1.199058085680008, "epoch": 4.0605581885202735, "grad_norm": 0.30686154961586, "learning_rate": 9.119358254938845e-05, "loss": 0.15622928738594055, "mean_token_accuracy": 0.9359981417655945, "num_tokens": 95118784.0, "step": 7711 }, { "entropy": 1.2475480735301971, "epoch": 4.061084781463928, "grad_norm": 0.3384522795677185, "learning_rate": 9.11721389059801e-05, "loss": 0.18361498415470123, "mean_token_accuracy": 0.9245945066213608, "num_tokens": 95131120.0, "step": 7712 }, { "entropy": 1.2219036519527435, "epoch": 4.061611374407583, "grad_norm": 0.3108859360218048, "learning_rate": 9.115069638027214e-05, "loss": 0.17015130817890167, "mean_token_accuracy": 0.9291042238473892, "num_tokens": 95143456.0, "step": 7713 }, { "entropy": 1.2195827066898346, "epoch": 4.062137967351237, "grad_norm": 0.319803386926651, "learning_rate": 9.112925497353746e-05, "loss": 0.19158239662647247, "mean_token_accuracy": 0.9158174991607666, "num_tokens": 95155792.0, "step": 7714 }, { "entropy": 1.237177848815918, "epoch": 4.062664560294892, "grad_norm": 0.2918310761451721, "learning_rate": 9.110781468704892e-05, "loss": 0.1691100299358368, "mean_token_accuracy": 0.9284612387418747, "num_tokens": 95168128.0, "step": 7715 }, { "entropy": 1.2189947366714478, "epoch": 4.063191153238547, "grad_norm": 0.326535165309906, "learning_rate": 9.108637552207935e-05, "loss": 0.18463623523712158, "mean_token_accuracy": 0.9204123914241791, "num_tokens": 95180464.0, "step": 7716 }, { "entropy": 1.1953076124191284, "epoch": 4.063717746182201, "grad_norm": 0.32633188366889954, "learning_rate": 9.106493747990139e-05, "loss": 0.17715126276016235, "mean_token_accuracy": 0.9264031648635864, "num_tokens": 95192800.0, "step": 7717 }, { "entropy": 1.2300822734832764, "epoch": 4.064244339125856, "grad_norm": 0.32896727323532104, "learning_rate": 9.104350056178774e-05, "loss": 0.17694605886936188, "mean_token_accuracy": 0.9269661009311676, "num_tokens": 95205136.0, "step": 7718 }, { "entropy": 1.2718767821788788, "epoch": 4.064770932069511, "grad_norm": 0.31029990315437317, "learning_rate": 9.102206476901098e-05, "loss": 0.14992089569568634, "mean_token_accuracy": 0.9372245967388153, "num_tokens": 95217472.0, "step": 7719 }, { "entropy": 1.1803152859210968, "epoch": 4.065297525013165, "grad_norm": 0.28587645292282104, "learning_rate": 9.100063010284366e-05, "loss": 0.15189969539642334, "mean_token_accuracy": 0.9393310397863388, "num_tokens": 95229808.0, "step": 7720 }, { "entropy": 1.2242991924285889, "epoch": 4.0658241179568195, "grad_norm": 0.2987886667251587, "learning_rate": 9.097919656455808e-05, "loss": 0.16917482018470764, "mean_token_accuracy": 0.9314169138669968, "num_tokens": 95242144.0, "step": 7721 }, { "entropy": 1.2272664308547974, "epoch": 4.0663507109004735, "grad_norm": 0.30778566002845764, "learning_rate": 9.095776415542683e-05, "loss": 0.17835679650306702, "mean_token_accuracy": 0.9243713170289993, "num_tokens": 95254480.0, "step": 7722 }, { "entropy": 1.185521274805069, "epoch": 4.066877303844128, "grad_norm": 0.3092713952064514, "learning_rate": 9.093633287672212e-05, "loss": 0.1805608719587326, "mean_token_accuracy": 0.922214686870575, "num_tokens": 95266816.0, "step": 7723 }, { "entropy": 1.2591804265975952, "epoch": 4.067403896787783, "grad_norm": 0.29992327094078064, "learning_rate": 9.091490272971623e-05, "loss": 0.16175399720668793, "mean_token_accuracy": 0.9302794933319092, "num_tokens": 95279152.0, "step": 7724 }, { "entropy": 1.2036868631839752, "epoch": 4.067930489731437, "grad_norm": 0.29974281787872314, "learning_rate": 9.08934737156813e-05, "loss": 0.16755646467208862, "mean_token_accuracy": 0.9305300414562225, "num_tokens": 95291488.0, "step": 7725 }, { "entropy": 1.2664932012557983, "epoch": 4.068457082675092, "grad_norm": 0.30560722947120667, "learning_rate": 9.087204583588951e-05, "loss": 0.1747075617313385, "mean_token_accuracy": 0.9243289828300476, "num_tokens": 95303824.0, "step": 7726 }, { "entropy": 1.2596045136451721, "epoch": 4.068983675618747, "grad_norm": 0.3133663833141327, "learning_rate": 9.085061909161285e-05, "loss": 0.16157250106334686, "mean_token_accuracy": 0.9298543632030487, "num_tokens": 95316160.0, "step": 7727 }, { "entropy": 1.2500620186328888, "epoch": 4.069510268562401, "grad_norm": 0.31191858649253845, "learning_rate": 9.082919348412329e-05, "loss": 0.18304812908172607, "mean_token_accuracy": 0.9186305999755859, "num_tokens": 95328496.0, "step": 7728 }, { "entropy": 1.20553919672966, "epoch": 4.070036861506056, "grad_norm": 0.3020358681678772, "learning_rate": 9.080776901469284e-05, "loss": 0.16491544246673584, "mean_token_accuracy": 0.9246530532836914, "num_tokens": 95340832.0, "step": 7729 }, { "entropy": 1.2194979190826416, "epoch": 4.070563454449711, "grad_norm": 0.2910735011100769, "learning_rate": 9.078634568459324e-05, "loss": 0.1644223928451538, "mean_token_accuracy": 0.9331174492835999, "num_tokens": 95353168.0, "step": 7730 }, { "entropy": 1.2480650544166565, "epoch": 4.071090047393365, "grad_norm": 0.30329522490501404, "learning_rate": 9.076492349509633e-05, "loss": 0.1677975356578827, "mean_token_accuracy": 0.927104040980339, "num_tokens": 95365504.0, "step": 7731 }, { "entropy": 1.2466902136802673, "epoch": 4.0716166403370195, "grad_norm": 0.28745365142822266, "learning_rate": 9.074350244747379e-05, "loss": 0.15721100568771362, "mean_token_accuracy": 0.9370080977678299, "num_tokens": 95377840.0, "step": 7732 }, { "entropy": 1.2403151988983154, "epoch": 4.072143233280674, "grad_norm": 0.2975686192512512, "learning_rate": 9.072208254299727e-05, "loss": 0.1805305778980255, "mean_token_accuracy": 0.9232339859008789, "num_tokens": 95390176.0, "step": 7733 }, { "entropy": 1.2152469158172607, "epoch": 4.072669826224328, "grad_norm": 0.2642306387424469, "learning_rate": 9.070066378293836e-05, "loss": 0.14989545941352844, "mean_token_accuracy": 0.9385390877723694, "num_tokens": 95402512.0, "step": 7734 }, { "entropy": 1.2145140171051025, "epoch": 4.073196419167983, "grad_norm": 0.29692116379737854, "learning_rate": 9.067924616856854e-05, "loss": 0.16534504294395447, "mean_token_accuracy": 0.9297915995121002, "num_tokens": 95414848.0, "step": 7735 }, { "entropy": 1.244487464427948, "epoch": 4.073723012111638, "grad_norm": 0.3275160491466522, "learning_rate": 9.065782970115928e-05, "loss": 0.18590737879276276, "mean_token_accuracy": 0.924352690577507, "num_tokens": 95427184.0, "step": 7736 }, { "entropy": 1.2427468597888947, "epoch": 4.074249605055292, "grad_norm": 0.3044041097164154, "learning_rate": 9.063641438198194e-05, "loss": 0.17704616487026215, "mean_token_accuracy": 0.9291693568229675, "num_tokens": 95439520.0, "step": 7737 }, { "entropy": 1.2756830751895905, "epoch": 4.074776197998947, "grad_norm": 0.35712915658950806, "learning_rate": 9.061500021230782e-05, "loss": 0.16697832942008972, "mean_token_accuracy": 0.930440753698349, "num_tokens": 95451856.0, "step": 7738 }, { "entropy": 1.2054972350597382, "epoch": 4.075302790942601, "grad_norm": 0.3086952269077301, "learning_rate": 9.059358719340816e-05, "loss": 0.16568411886692047, "mean_token_accuracy": 0.926430806517601, "num_tokens": 95464192.0, "step": 7739 }, { "entropy": 1.225044995546341, "epoch": 4.075829383886256, "grad_norm": 0.29447293281555176, "learning_rate": 9.057217532655411e-05, "loss": 0.15924039483070374, "mean_token_accuracy": 0.9344728738069534, "num_tokens": 95476528.0, "step": 7740 }, { "entropy": 1.2552023231983185, "epoch": 4.076355976829911, "grad_norm": 0.3137618601322174, "learning_rate": 9.055076461301677e-05, "loss": 0.17044930160045624, "mean_token_accuracy": 0.9279296547174454, "num_tokens": 95488864.0, "step": 7741 }, { "entropy": 1.2101345360279083, "epoch": 4.076882569773565, "grad_norm": 0.33105573058128357, "learning_rate": 9.052935505406715e-05, "loss": 0.17854714393615723, "mean_token_accuracy": 0.9252999573945999, "num_tokens": 95501200.0, "step": 7742 }, { "entropy": 1.2018029391765594, "epoch": 4.0774091627172195, "grad_norm": 0.3053717613220215, "learning_rate": 9.050794665097628e-05, "loss": 0.1497926563024521, "mean_token_accuracy": 0.9343288093805313, "num_tokens": 95513536.0, "step": 7743 }, { "entropy": 1.2654300034046173, "epoch": 4.077935755660874, "grad_norm": 0.35785624384880066, "learning_rate": 9.048653940501499e-05, "loss": 0.17250262200832367, "mean_token_accuracy": 0.9261425137519836, "num_tokens": 95525872.0, "step": 7744 }, { "entropy": 1.1997900307178497, "epoch": 4.078462348604528, "grad_norm": 0.32767707109451294, "learning_rate": 9.046513331745414e-05, "loss": 0.1583937704563141, "mean_token_accuracy": 0.9334874302148819, "num_tokens": 95538208.0, "step": 7745 }, { "entropy": 1.2555785775184631, "epoch": 4.078988941548183, "grad_norm": 0.3156816363334656, "learning_rate": 9.044372838956446e-05, "loss": 0.17291590571403503, "mean_token_accuracy": 0.9330429434776306, "num_tokens": 95550544.0, "step": 7746 }, { "entropy": 1.194413661956787, "epoch": 4.079515534491838, "grad_norm": 0.3167170584201813, "learning_rate": 9.042232462261664e-05, "loss": 0.1628277599811554, "mean_token_accuracy": 0.9321805536746979, "num_tokens": 95562880.0, "step": 7747 }, { "entropy": 1.2325744330883026, "epoch": 4.080042127435492, "grad_norm": 0.3167288303375244, "learning_rate": 9.040092201788129e-05, "loss": 0.16678446531295776, "mean_token_accuracy": 0.9272855222225189, "num_tokens": 95575216.0, "step": 7748 }, { "entropy": 1.23721382021904, "epoch": 4.080568720379147, "grad_norm": 0.33681100606918335, "learning_rate": 9.037952057662895e-05, "loss": 0.18301434814929962, "mean_token_accuracy": 0.9208259582519531, "num_tokens": 95587552.0, "step": 7749 }, { "entropy": 1.2467168271541595, "epoch": 4.081095313322802, "grad_norm": 0.32016125321388245, "learning_rate": 9.035812030013013e-05, "loss": 0.16686171293258667, "mean_token_accuracy": 0.9261872917413712, "num_tokens": 95599888.0, "step": 7750 }, { "entropy": 1.2390804886817932, "epoch": 4.081621906266456, "grad_norm": 0.31561383605003357, "learning_rate": 9.033672118965526e-05, "loss": 0.16775859892368317, "mean_token_accuracy": 0.9265642762184143, "num_tokens": 95612224.0, "step": 7751 }, { "entropy": 1.2519412338733673, "epoch": 4.082148499210111, "grad_norm": 0.32623958587646484, "learning_rate": 9.031532324647462e-05, "loss": 0.16160587966442108, "mean_token_accuracy": 0.936798706650734, "num_tokens": 95624560.0, "step": 7752 }, { "entropy": 1.2217656672000885, "epoch": 4.082675092153766, "grad_norm": 0.3501085042953491, "learning_rate": 9.02939264718585e-05, "loss": 0.18669341504573822, "mean_token_accuracy": 0.9153125435113907, "num_tokens": 95636896.0, "step": 7753 }, { "entropy": 1.2231608033180237, "epoch": 4.0832016850974195, "grad_norm": 0.295173317193985, "learning_rate": 9.027253086707716e-05, "loss": 0.15407906472682953, "mean_token_accuracy": 0.9321415275335312, "num_tokens": 95649232.0, "step": 7754 }, { "entropy": 1.2381119132041931, "epoch": 4.083728278041074, "grad_norm": 0.3035016655921936, "learning_rate": 9.025113643340064e-05, "loss": 0.16616517305374146, "mean_token_accuracy": 0.9286200404167175, "num_tokens": 95661568.0, "step": 7755 }, { "entropy": 1.2252253592014313, "epoch": 4.084254870984728, "grad_norm": 0.31341826915740967, "learning_rate": 9.022974317209902e-05, "loss": 0.15845082700252533, "mean_token_accuracy": 0.9357934594154358, "num_tokens": 95673904.0, "step": 7756 }, { "entropy": 1.1895354688167572, "epoch": 4.084781463928383, "grad_norm": 0.2934425473213196, "learning_rate": 9.020835108444235e-05, "loss": 0.15976643562316895, "mean_token_accuracy": 0.9344072192907333, "num_tokens": 95686240.0, "step": 7757 }, { "entropy": 1.238107591867447, "epoch": 4.085308056872038, "grad_norm": 0.30392828583717346, "learning_rate": 9.018696017170054e-05, "loss": 0.1551521122455597, "mean_token_accuracy": 0.9287526309490204, "num_tokens": 95698576.0, "step": 7758 }, { "entropy": 1.2240920960903168, "epoch": 4.085834649815692, "grad_norm": 0.3208746612071991, "learning_rate": 9.01655704351434e-05, "loss": 0.1767064332962036, "mean_token_accuracy": 0.9299392402172089, "num_tokens": 95710912.0, "step": 7759 }, { "entropy": 1.2479586005210876, "epoch": 4.086361242759347, "grad_norm": 0.31244781613349915, "learning_rate": 9.014418187604074e-05, "loss": 0.18113332986831665, "mean_token_accuracy": 0.9223150759935379, "num_tokens": 95723248.0, "step": 7760 }, { "entropy": 1.2941612601280212, "epoch": 4.086887835703002, "grad_norm": 0.32946693897247314, "learning_rate": 9.012279449566228e-05, "loss": 0.18078386783599854, "mean_token_accuracy": 0.9275902062654495, "num_tokens": 95735584.0, "step": 7761 }, { "entropy": 1.2265251874923706, "epoch": 4.087414428646656, "grad_norm": 0.2798350155353546, "learning_rate": 9.010140829527767e-05, "loss": 0.16829606890678406, "mean_token_accuracy": 0.9291946738958359, "num_tokens": 95747920.0, "step": 7762 }, { "entropy": 1.2662497758865356, "epoch": 4.087941021590311, "grad_norm": 0.30638816952705383, "learning_rate": 9.008002327615644e-05, "loss": 0.16932989656925201, "mean_token_accuracy": 0.9284424632787704, "num_tokens": 95760256.0, "step": 7763 }, { "entropy": 1.218248039484024, "epoch": 4.088467614533966, "grad_norm": 0.32308030128479004, "learning_rate": 9.005863943956812e-05, "loss": 0.16459035873413086, "mean_token_accuracy": 0.930854395031929, "num_tokens": 95772592.0, "step": 7764 }, { "entropy": 1.2341713905334473, "epoch": 4.0889942074776195, "grad_norm": 0.3084065020084381, "learning_rate": 9.003725678678219e-05, "loss": 0.17533165216445923, "mean_token_accuracy": 0.9273016005754471, "num_tokens": 95784928.0, "step": 7765 }, { "entropy": 1.2990855276584625, "epoch": 4.089520800421274, "grad_norm": 0.30591991543769836, "learning_rate": 9.001587531906794e-05, "loss": 0.15463925898075104, "mean_token_accuracy": 0.9317610263824463, "num_tokens": 95797264.0, "step": 7766 }, { "entropy": 1.225580245256424, "epoch": 4.090047393364929, "grad_norm": 0.2803047001361847, "learning_rate": 8.999449503769472e-05, "loss": 0.15674909949302673, "mean_token_accuracy": 0.935524508357048, "num_tokens": 95809600.0, "step": 7767 }, { "entropy": 1.2573725581169128, "epoch": 4.090573986308583, "grad_norm": 0.3105691075325012, "learning_rate": 8.997311594393172e-05, "loss": 0.16267746686935425, "mean_token_accuracy": 0.9329666048288345, "num_tokens": 95821936.0, "step": 7768 }, { "entropy": 1.2551613450050354, "epoch": 4.091100579252238, "grad_norm": 0.2923014461994171, "learning_rate": 8.995173803904811e-05, "loss": 0.16139426827430725, "mean_token_accuracy": 0.9278410375118256, "num_tokens": 95834272.0, "step": 7769 }, { "entropy": 1.239789605140686, "epoch": 4.091627172195893, "grad_norm": 0.2825500965118408, "learning_rate": 8.993036132431292e-05, "loss": 0.15421581268310547, "mean_token_accuracy": 0.9366891384124756, "num_tokens": 95846608.0, "step": 7770 }, { "entropy": 1.2593735456466675, "epoch": 4.092153765139547, "grad_norm": 0.2957497537136078, "learning_rate": 8.990898580099524e-05, "loss": 0.15918530523777008, "mean_token_accuracy": 0.9337555021047592, "num_tokens": 95858944.0, "step": 7771 }, { "entropy": 1.2203782498836517, "epoch": 4.092680358083202, "grad_norm": 0.2896980941295624, "learning_rate": 8.988761147036397e-05, "loss": 0.1596841812133789, "mean_token_accuracy": 0.9279924631118774, "num_tokens": 95871280.0, "step": 7772 }, { "entropy": 1.2221176326274872, "epoch": 4.093206951026856, "grad_norm": 0.2983795702457428, "learning_rate": 8.986623833368801e-05, "loss": 0.16424298286437988, "mean_token_accuracy": 0.9330798983573914, "num_tokens": 95883616.0, "step": 7773 }, { "entropy": 1.2075627148151398, "epoch": 4.093733543970511, "grad_norm": 0.30806633830070496, "learning_rate": 8.98448663922361e-05, "loss": 0.17070338129997253, "mean_token_accuracy": 0.9266282320022583, "num_tokens": 95895952.0, "step": 7774 }, { "entropy": 1.2562209963798523, "epoch": 4.094260136914166, "grad_norm": 0.3529546856880188, "learning_rate": 8.982349564727699e-05, "loss": 0.17133307456970215, "mean_token_accuracy": 0.9285664856433868, "num_tokens": 95908288.0, "step": 7775 }, { "entropy": 1.2491154372692108, "epoch": 4.0947867298578196, "grad_norm": 0.3027105927467346, "learning_rate": 8.980212610007939e-05, "loss": 0.15416307747364044, "mean_token_accuracy": 0.9330688118934631, "num_tokens": 95920624.0, "step": 7776 }, { "entropy": 1.2435694336891174, "epoch": 4.095313322801474, "grad_norm": 0.30684900283813477, "learning_rate": 8.978075775191177e-05, "loss": 0.1644163578748703, "mean_token_accuracy": 0.9304230064153671, "num_tokens": 95932960.0, "step": 7777 }, { "entropy": 1.220851480960846, "epoch": 4.095839915745129, "grad_norm": 0.32513976097106934, "learning_rate": 8.975939060404277e-05, "loss": 0.17666807770729065, "mean_token_accuracy": 0.9211707562208176, "num_tokens": 95945296.0, "step": 7778 }, { "entropy": 1.2059510946273804, "epoch": 4.096366508688783, "grad_norm": 0.28802773356437683, "learning_rate": 8.973802465774075e-05, "loss": 0.160865917801857, "mean_token_accuracy": 0.9303705394268036, "num_tokens": 95957632.0, "step": 7779 }, { "entropy": 1.2136945128440857, "epoch": 4.096893101632438, "grad_norm": 0.3125780522823334, "learning_rate": 8.971665991427414e-05, "loss": 0.16175074875354767, "mean_token_accuracy": 0.9307304322719574, "num_tokens": 95969968.0, "step": 7780 }, { "entropy": 1.1918500661849976, "epoch": 4.097419694576093, "grad_norm": 0.3186854422092438, "learning_rate": 8.969529637491119e-05, "loss": 0.16778559982776642, "mean_token_accuracy": 0.924680545926094, "num_tokens": 95982304.0, "step": 7781 }, { "entropy": 1.2299046516418457, "epoch": 4.097946287519747, "grad_norm": 0.333080530166626, "learning_rate": 8.967393404092018e-05, "loss": 0.1835906207561493, "mean_token_accuracy": 0.9239201098680496, "num_tokens": 95994640.0, "step": 7782 }, { "entropy": 1.1866918206214905, "epoch": 4.098472880463402, "grad_norm": 0.29609766602516174, "learning_rate": 8.96525729135692e-05, "loss": 0.16436761617660522, "mean_token_accuracy": 0.9310314506292343, "num_tokens": 96006976.0, "step": 7783 }, { "entropy": 1.1631359457969666, "epoch": 4.098999473407057, "grad_norm": 0.3122749328613281, "learning_rate": 8.963121299412636e-05, "loss": 0.18169131875038147, "mean_token_accuracy": 0.9222935438156128, "num_tokens": 96019312.0, "step": 7784 }, { "entropy": 1.2098788022994995, "epoch": 4.099526066350711, "grad_norm": 0.2992385923862457, "learning_rate": 8.96098542838597e-05, "loss": 0.16331830620765686, "mean_token_accuracy": 0.9328923672437668, "num_tokens": 96031648.0, "step": 7785 }, { "entropy": 1.2220342457294464, "epoch": 4.100052659294366, "grad_norm": 0.320968896150589, "learning_rate": 8.958849678403716e-05, "loss": 0.16907034814357758, "mean_token_accuracy": 0.9300814419984818, "num_tokens": 96043984.0, "step": 7786 }, { "entropy": 1.2747842371463776, "epoch": 4.1005792522380204, "grad_norm": 0.3546020984649658, "learning_rate": 8.956714049592661e-05, "loss": 0.19964481890201569, "mean_token_accuracy": 0.9119447022676468, "num_tokens": 96056320.0, "step": 7787 }, { "entropy": 1.244139701128006, "epoch": 4.101105845181674, "grad_norm": 0.3346027731895447, "learning_rate": 8.954578542079584e-05, "loss": 0.174786776304245, "mean_token_accuracy": 0.9248683005571365, "num_tokens": 96068656.0, "step": 7788 }, { "entropy": 1.2504622042179108, "epoch": 4.101632438125329, "grad_norm": 0.33030298352241516, "learning_rate": 8.952443155991257e-05, "loss": 0.1916545033454895, "mean_token_accuracy": 0.9185705184936523, "num_tokens": 96080992.0, "step": 7789 }, { "entropy": 1.2617883086204529, "epoch": 4.102159031068983, "grad_norm": 0.3044522702693939, "learning_rate": 8.950307891454444e-05, "loss": 0.17294572293758392, "mean_token_accuracy": 0.9226913154125214, "num_tokens": 96093328.0, "step": 7790 }, { "entropy": 1.2183136641979218, "epoch": 4.102685624012638, "grad_norm": 0.3035319447517395, "learning_rate": 8.9481727485959e-05, "loss": 0.1683570146560669, "mean_token_accuracy": 0.9234451353549957, "num_tokens": 96105664.0, "step": 7791 }, { "entropy": 1.1727025508880615, "epoch": 4.103212216956293, "grad_norm": 0.2806466221809387, "learning_rate": 8.946037727542389e-05, "loss": 0.16041648387908936, "mean_token_accuracy": 0.9294952601194382, "num_tokens": 96118000.0, "step": 7792 }, { "entropy": 1.2113775610923767, "epoch": 4.103738809899947, "grad_norm": 0.2875956892967224, "learning_rate": 8.943902828420645e-05, "loss": 0.170582577586174, "mean_token_accuracy": 0.9257608503103256, "num_tokens": 96130336.0, "step": 7793 }, { "entropy": 1.1674440205097198, "epoch": 4.104265402843602, "grad_norm": 0.27453169226646423, "learning_rate": 8.941768051357407e-05, "loss": 0.15505698323249817, "mean_token_accuracy": 0.9339439123868942, "num_tokens": 96142672.0, "step": 7794 }, { "entropy": 1.204866111278534, "epoch": 4.104791995787257, "grad_norm": 0.2872864902019501, "learning_rate": 8.939633396479401e-05, "loss": 0.1590895652770996, "mean_token_accuracy": 0.9344259947538376, "num_tokens": 96155008.0, "step": 7795 }, { "entropy": 1.1859584152698517, "epoch": 4.105318588730911, "grad_norm": 0.28996652364730835, "learning_rate": 8.937498863913352e-05, "loss": 0.1534387171268463, "mean_token_accuracy": 0.9312669485807419, "num_tokens": 96167344.0, "step": 7796 }, { "entropy": 1.2309530079364777, "epoch": 4.105845181674566, "grad_norm": 0.34393784403800964, "learning_rate": 8.935364453785975e-05, "loss": 0.18367165327072144, "mean_token_accuracy": 0.923644557595253, "num_tokens": 96179680.0, "step": 7797 }, { "entropy": 1.210770308971405, "epoch": 4.1063717746182204, "grad_norm": 0.2864152193069458, "learning_rate": 8.933230166223973e-05, "loss": 0.15165504813194275, "mean_token_accuracy": 0.9372637122869492, "num_tokens": 96192016.0, "step": 7798 }, { "entropy": 1.1396176218986511, "epoch": 4.106898367561874, "grad_norm": 0.3214961886405945, "learning_rate": 8.931096001354056e-05, "loss": 0.18969902396202087, "mean_token_accuracy": 0.9195330291986465, "num_tokens": 96204352.0, "step": 7799 }, { "entropy": 1.1593232154846191, "epoch": 4.107424960505529, "grad_norm": 0.3097698390483856, "learning_rate": 8.928961959302908e-05, "loss": 0.1748993694782257, "mean_token_accuracy": 0.9295019805431366, "num_tokens": 96216688.0, "step": 7800 }, { "entropy": 1.161198079586029, "epoch": 4.107951553449184, "grad_norm": 0.30992424488067627, "learning_rate": 8.926828040197218e-05, "loss": 0.1573079526424408, "mean_token_accuracy": 0.9285661578178406, "num_tokens": 96229024.0, "step": 7801 }, { "entropy": 1.1368975341320038, "epoch": 4.108478146392838, "grad_norm": 0.2966200113296509, "learning_rate": 8.924694244163665e-05, "loss": 0.16821102797985077, "mean_token_accuracy": 0.9266536235809326, "num_tokens": 96241360.0, "step": 7802 }, { "entropy": 1.1540457904338837, "epoch": 4.109004739336493, "grad_norm": 0.28433090448379517, "learning_rate": 8.922560571328918e-05, "loss": 0.1597246378660202, "mean_token_accuracy": 0.9324362426996231, "num_tokens": 96253696.0, "step": 7803 }, { "entropy": 1.1672990918159485, "epoch": 4.109531332280147, "grad_norm": 0.338194340467453, "learning_rate": 8.920427021819642e-05, "loss": 0.15494990348815918, "mean_token_accuracy": 0.936102956533432, "num_tokens": 96266032.0, "step": 7804 }, { "entropy": 1.0869658887386322, "epoch": 4.110057925223802, "grad_norm": 0.3005244731903076, "learning_rate": 8.918293595762488e-05, "loss": 0.16309787333011627, "mean_token_accuracy": 0.9356388449668884, "num_tokens": 96278368.0, "step": 7805 }, { "entropy": 1.1280148327350616, "epoch": 4.110584518167457, "grad_norm": 0.2926557660102844, "learning_rate": 8.916160293284115e-05, "loss": 0.15952609479427338, "mean_token_accuracy": 0.9271687120199203, "num_tokens": 96290704.0, "step": 7806 }, { "entropy": 1.12529456615448, "epoch": 4.111111111111111, "grad_norm": 0.35064613819122314, "learning_rate": 8.914027114511163e-05, "loss": 0.2010664939880371, "mean_token_accuracy": 0.914945438504219, "num_tokens": 96303040.0, "step": 7807 }, { "entropy": 1.1171996295452118, "epoch": 4.111637704054766, "grad_norm": 0.7903205752372742, "learning_rate": 8.911894059570259e-05, "loss": 0.16090406477451324, "mean_token_accuracy": 0.9351358860731125, "num_tokens": 96315376.0, "step": 7808 }, { "entropy": 1.0898367166519165, "epoch": 4.1121642969984205, "grad_norm": 0.2943427562713623, "learning_rate": 8.909761128588034e-05, "loss": 0.15463635325431824, "mean_token_accuracy": 0.9347275495529175, "num_tokens": 96327712.0, "step": 7809 }, { "entropy": 1.130621761083603, "epoch": 4.112690889942074, "grad_norm": 0.3493938744068146, "learning_rate": 8.90762832169111e-05, "loss": 0.1699773371219635, "mean_token_accuracy": 0.9224660992622375, "num_tokens": 96340048.0, "step": 7810 }, { "entropy": 1.1240656971931458, "epoch": 4.113217482885729, "grad_norm": 0.32472723722457886, "learning_rate": 8.905495639006096e-05, "loss": 0.16446636617183685, "mean_token_accuracy": 0.9324799329042435, "num_tokens": 96352384.0, "step": 7811 }, { "entropy": 1.0538891851902008, "epoch": 4.113744075829384, "grad_norm": 0.30771127343177795, "learning_rate": 8.903363080659596e-05, "loss": 0.1678232103586197, "mean_token_accuracy": 0.9295049905776978, "num_tokens": 96364720.0, "step": 7812 }, { "entropy": 1.1159376204013824, "epoch": 4.114270668773038, "grad_norm": 0.2992302179336548, "learning_rate": 8.901230646778214e-05, "loss": 0.16447745263576508, "mean_token_accuracy": 0.9330683052539825, "num_tokens": 96377056.0, "step": 7813 }, { "entropy": 1.0891575366258621, "epoch": 4.114797261716693, "grad_norm": 0.3098483979701996, "learning_rate": 8.899098337488533e-05, "loss": 0.17213174700737, "mean_token_accuracy": 0.925985649228096, "num_tokens": 96389392.0, "step": 7814 }, { "entropy": 1.0644939839839935, "epoch": 4.115323854660348, "grad_norm": 0.28281939029693604, "learning_rate": 8.896966152917142e-05, "loss": 0.15706969797611237, "mean_token_accuracy": 0.9341888576745987, "num_tokens": 96401728.0, "step": 7815 }, { "entropy": 1.084628701210022, "epoch": 4.115850447604002, "grad_norm": 0.27311787009239197, "learning_rate": 8.89483409319061e-05, "loss": 0.15404914319515228, "mean_token_accuracy": 0.9348626583814621, "num_tokens": 96414064.0, "step": 7816 }, { "entropy": 1.087325781583786, "epoch": 4.116377040547657, "grad_norm": 0.3202205300331116, "learning_rate": 8.892702158435508e-05, "loss": 0.176896333694458, "mean_token_accuracy": 0.9233476519584656, "num_tokens": 96426400.0, "step": 7817 }, { "entropy": 1.072919636964798, "epoch": 4.116903633491312, "grad_norm": 0.28495314717292786, "learning_rate": 8.8905703487784e-05, "loss": 0.16241121292114258, "mean_token_accuracy": 0.9331525415182114, "num_tokens": 96438736.0, "step": 7818 }, { "entropy": 1.0810973346233368, "epoch": 4.117430226434966, "grad_norm": 0.3251652419567108, "learning_rate": 8.888438664345828e-05, "loss": 0.1854064166545868, "mean_token_accuracy": 0.921946182847023, "num_tokens": 96451072.0, "step": 7819 }, { "entropy": 1.0986481010913849, "epoch": 4.1179568193786205, "grad_norm": 0.2982044816017151, "learning_rate": 8.886307105264354e-05, "loss": 0.15907225012779236, "mean_token_accuracy": 0.9335672706365585, "num_tokens": 96463408.0, "step": 7820 }, { "entropy": 1.1077307760715485, "epoch": 4.118483412322275, "grad_norm": 0.318979948759079, "learning_rate": 8.884175671660501e-05, "loss": 0.170145183801651, "mean_token_accuracy": 0.9240032136440277, "num_tokens": 96475744.0, "step": 7821 }, { "entropy": 1.098257452249527, "epoch": 4.119010005265929, "grad_norm": 0.2987666130065918, "learning_rate": 8.882044363660813e-05, "loss": 0.16981391608715057, "mean_token_accuracy": 0.928363248705864, "num_tokens": 96488080.0, "step": 7822 }, { "entropy": 1.0558017492294312, "epoch": 4.119536598209584, "grad_norm": 0.28144413232803345, "learning_rate": 8.879913181391803e-05, "loss": 0.15899887681007385, "mean_token_accuracy": 0.932498574256897, "num_tokens": 96500416.0, "step": 7823 }, { "entropy": 1.1114909052848816, "epoch": 4.120063191153238, "grad_norm": 0.32200029492378235, "learning_rate": 8.877782124979992e-05, "loss": 0.1900215595960617, "mean_token_accuracy": 0.9178457707166672, "num_tokens": 96512752.0, "step": 7824 }, { "entropy": 1.1083886921405792, "epoch": 4.120589784096893, "grad_norm": 0.30182939767837524, "learning_rate": 8.875651194551886e-05, "loss": 0.16824182868003845, "mean_token_accuracy": 0.9271001517772675, "num_tokens": 96525088.0, "step": 7825 }, { "entropy": 1.1638360023498535, "epoch": 4.121116377040548, "grad_norm": 0.29805734753608704, "learning_rate": 8.873520390233985e-05, "loss": 0.1673271805047989, "mean_token_accuracy": 0.9269016534090042, "num_tokens": 96537424.0, "step": 7826 }, { "entropy": 1.0961701571941376, "epoch": 4.121642969984202, "grad_norm": 0.2877432107925415, "learning_rate": 8.871389712152787e-05, "loss": 0.1591220498085022, "mean_token_accuracy": 0.9321826994419098, "num_tokens": 96549760.0, "step": 7827 }, { "entropy": 1.0818660408258438, "epoch": 4.122169562927857, "grad_norm": 0.29051029682159424, "learning_rate": 8.869259160434776e-05, "loss": 0.15846318006515503, "mean_token_accuracy": 0.9337704032659531, "num_tokens": 96562096.0, "step": 7828 }, { "entropy": 1.0876257717609406, "epoch": 4.122696155871512, "grad_norm": 0.2964712381362915, "learning_rate": 8.867128735206427e-05, "loss": 0.17084316909313202, "mean_token_accuracy": 0.9285953342914581, "num_tokens": 96574432.0, "step": 7829 }, { "entropy": 1.081564873456955, "epoch": 4.123222748815166, "grad_norm": 0.29430457949638367, "learning_rate": 8.864998436594214e-05, "loss": 0.16626888513565063, "mean_token_accuracy": 0.9285861700773239, "num_tokens": 96586768.0, "step": 7830 }, { "entropy": 1.1084083318710327, "epoch": 4.1237493417588205, "grad_norm": 0.2968306243419647, "learning_rate": 8.862868264724601e-05, "loss": 0.16054664552211761, "mean_token_accuracy": 0.930002897977829, "num_tokens": 96599104.0, "step": 7831 }, { "entropy": 1.0822164118289948, "epoch": 4.124275934702475, "grad_norm": 0.2795105576515198, "learning_rate": 8.860738219724045e-05, "loss": 0.1478923261165619, "mean_token_accuracy": 0.9389977902173996, "num_tokens": 96611440.0, "step": 7832 }, { "entropy": 1.1297181248664856, "epoch": 4.124802527646129, "grad_norm": 0.3377971351146698, "learning_rate": 8.858608301718987e-05, "loss": 0.17175334692001343, "mean_token_accuracy": 0.9285246282815933, "num_tokens": 96623776.0, "step": 7833 }, { "entropy": 1.069557100534439, "epoch": 4.125329120589784, "grad_norm": 0.29777979850769043, "learning_rate": 8.856478510835878e-05, "loss": 0.1625191867351532, "mean_token_accuracy": 0.9311179369688034, "num_tokens": 96636112.0, "step": 7834 }, { "entropy": 1.1241136193275452, "epoch": 4.125855713533439, "grad_norm": 0.30811306834220886, "learning_rate": 8.854348847201144e-05, "loss": 0.16325482726097107, "mean_token_accuracy": 0.9307897835969925, "num_tokens": 96648448.0, "step": 7835 }, { "entropy": 1.077067494392395, "epoch": 4.126382306477093, "grad_norm": 0.28740742802619934, "learning_rate": 8.852219310941217e-05, "loss": 0.15477372705936432, "mean_token_accuracy": 0.938041016459465, "num_tokens": 96660784.0, "step": 7836 }, { "entropy": 1.1043914556503296, "epoch": 4.126908899420748, "grad_norm": 0.3099571466445923, "learning_rate": 8.850089902182508e-05, "loss": 0.1632595658302307, "mean_token_accuracy": 0.9288739413022995, "num_tokens": 96673120.0, "step": 7837 }, { "entropy": 1.1408192813396454, "epoch": 4.127435492364402, "grad_norm": 0.29412955045700073, "learning_rate": 8.847960621051433e-05, "loss": 0.15991520881652832, "mean_token_accuracy": 0.9341659396886826, "num_tokens": 96685456.0, "step": 7838 }, { "entropy": 1.0586369335651398, "epoch": 4.127962085308057, "grad_norm": 0.3056924343109131, "learning_rate": 8.84583146767439e-05, "loss": 0.16030479967594147, "mean_token_accuracy": 0.933611661195755, "num_tokens": 96697792.0, "step": 7839 }, { "entropy": 1.0581893771886826, "epoch": 4.128488678251712, "grad_norm": 0.32126346230506897, "learning_rate": 8.843702442177777e-05, "loss": 0.1636396050453186, "mean_token_accuracy": 0.9323246031999588, "num_tokens": 96710128.0, "step": 7840 }, { "entropy": 1.0848739743232727, "epoch": 4.129015271195366, "grad_norm": 0.3324814736843109, "learning_rate": 8.841573544687984e-05, "loss": 0.1712619513273239, "mean_token_accuracy": 0.928612694144249, "num_tokens": 96722464.0, "step": 7841 }, { "entropy": 1.1315793097019196, "epoch": 4.1295418641390205, "grad_norm": 0.31529390811920166, "learning_rate": 8.839444775331389e-05, "loss": 0.1689848154783249, "mean_token_accuracy": 0.9284860342741013, "num_tokens": 96734800.0, "step": 7842 }, { "entropy": 1.1421118676662445, "epoch": 4.130068457082675, "grad_norm": 0.33357715606689453, "learning_rate": 8.837316134234366e-05, "loss": 0.17190055549144745, "mean_token_accuracy": 0.9273479878902435, "num_tokens": 96747136.0, "step": 7843 }, { "entropy": 1.1058302819728851, "epoch": 4.130595050026329, "grad_norm": 0.33913272619247437, "learning_rate": 8.835187621523277e-05, "loss": 0.18200349807739258, "mean_token_accuracy": 0.9255418479442596, "num_tokens": 96759472.0, "step": 7844 }, { "entropy": 1.1072732210159302, "epoch": 4.131121642969984, "grad_norm": 0.3066416382789612, "learning_rate": 8.833059237324483e-05, "loss": 0.17035739123821259, "mean_token_accuracy": 0.9298305064439774, "num_tokens": 96771808.0, "step": 7845 }, { "entropy": 1.1339519917964935, "epoch": 4.131648235913639, "grad_norm": 0.3012479543685913, "learning_rate": 8.830930981764331e-05, "loss": 0.15778815746307373, "mean_token_accuracy": 0.9348950833082199, "num_tokens": 96784144.0, "step": 7846 }, { "entropy": 1.0989419221878052, "epoch": 4.132174828857293, "grad_norm": 0.30705466866493225, "learning_rate": 8.828802854969164e-05, "loss": 0.17275996506214142, "mean_token_accuracy": 0.9243705123662949, "num_tokens": 96796480.0, "step": 7847 }, { "entropy": 1.1299847066402435, "epoch": 4.132701421800948, "grad_norm": 0.3280251920223236, "learning_rate": 8.826674857065318e-05, "loss": 0.1808452010154724, "mean_token_accuracy": 0.9271404445171356, "num_tokens": 96808816.0, "step": 7848 }, { "entropy": 1.1137258112430573, "epoch": 4.133228014744603, "grad_norm": 0.31740695238113403, "learning_rate": 8.824546988179118e-05, "loss": 0.16680635511875153, "mean_token_accuracy": 0.9240747690200806, "num_tokens": 96821152.0, "step": 7849 }, { "entropy": 1.1617943942546844, "epoch": 4.133754607688257, "grad_norm": 0.34091678261756897, "learning_rate": 8.822419248436886e-05, "loss": 0.1889715939760208, "mean_token_accuracy": 0.9218580722808838, "num_tokens": 96833488.0, "step": 7850 }, { "entropy": 1.1270453333854675, "epoch": 4.134281200631912, "grad_norm": 0.3339605927467346, "learning_rate": 8.820291637964931e-05, "loss": 0.17558015882968903, "mean_token_accuracy": 0.9282533079385757, "num_tokens": 96845824.0, "step": 7851 }, { "entropy": 1.1447749137878418, "epoch": 4.1348077935755665, "grad_norm": 0.31565946340560913, "learning_rate": 8.818164156889557e-05, "loss": 0.1743800938129425, "mean_token_accuracy": 0.9264811277389526, "num_tokens": 96858160.0, "step": 7852 }, { "entropy": 1.0944451987743378, "epoch": 4.1353343865192205, "grad_norm": 0.2948586046695709, "learning_rate": 8.816036805337057e-05, "loss": 0.1544438749551773, "mean_token_accuracy": 0.9375045746564865, "num_tokens": 96870496.0, "step": 7853 }, { "entropy": 1.140945941209793, "epoch": 4.135860979462875, "grad_norm": 0.2922118604183197, "learning_rate": 8.813909583433722e-05, "loss": 0.15705375373363495, "mean_token_accuracy": 0.9344226717948914, "num_tokens": 96882832.0, "step": 7854 }, { "entropy": 1.146077036857605, "epoch": 4.136387572406529, "grad_norm": 0.3004426658153534, "learning_rate": 8.81178249130584e-05, "loss": 0.15746715664863586, "mean_token_accuracy": 0.9333512932062149, "num_tokens": 96895168.0, "step": 7855 }, { "entropy": 1.113210380077362, "epoch": 4.136914165350184, "grad_norm": 0.2916608154773712, "learning_rate": 8.809655529079672e-05, "loss": 0.1683368980884552, "mean_token_accuracy": 0.9285342842340469, "num_tokens": 96907504.0, "step": 7856 }, { "entropy": 1.1452086865901947, "epoch": 4.137440758293839, "grad_norm": 0.33270788192749023, "learning_rate": 8.807528696881491e-05, "loss": 0.18464891612529755, "mean_token_accuracy": 0.9207575619220734, "num_tokens": 96919840.0, "step": 7857 }, { "entropy": 1.1652954816818237, "epoch": 4.137967351237493, "grad_norm": 0.33288833498954773, "learning_rate": 8.805401994837552e-05, "loss": 0.1774139106273651, "mean_token_accuracy": 0.926798090338707, "num_tokens": 96932176.0, "step": 7858 }, { "entropy": 1.146183341741562, "epoch": 4.138493944181148, "grad_norm": 0.287411630153656, "learning_rate": 8.803275423074108e-05, "loss": 0.1744053065776825, "mean_token_accuracy": 0.9268616735935211, "num_tokens": 96944512.0, "step": 7859 }, { "entropy": 1.2056533992290497, "epoch": 4.139020537124803, "grad_norm": 0.310466468334198, "learning_rate": 8.801148981717397e-05, "loss": 0.17282357811927795, "mean_token_accuracy": 0.9263655841350555, "num_tokens": 96956848.0, "step": 7860 }, { "entropy": 1.2036525011062622, "epoch": 4.139547130068457, "grad_norm": 0.32176509499549866, "learning_rate": 8.799022670893653e-05, "loss": 0.17282113432884216, "mean_token_accuracy": 0.9260594546794891, "num_tokens": 96969184.0, "step": 7861 }, { "entropy": 1.1906183660030365, "epoch": 4.140073723012112, "grad_norm": 0.321964830160141, "learning_rate": 8.796896490729108e-05, "loss": 0.1866556704044342, "mean_token_accuracy": 0.9168805927038193, "num_tokens": 96981520.0, "step": 7862 }, { "entropy": 1.1591020822525024, "epoch": 4.1406003159557665, "grad_norm": 0.29262489080429077, "learning_rate": 8.794770441349973e-05, "loss": 0.1749974638223648, "mean_token_accuracy": 0.923712745308876, "num_tokens": 96993856.0, "step": 7863 }, { "entropy": 1.169787347316742, "epoch": 4.1411269088994205, "grad_norm": 0.279094398021698, "learning_rate": 8.79264452288247e-05, "loss": 0.1488257199525833, "mean_token_accuracy": 0.9390291124582291, "num_tokens": 97006192.0, "step": 7864 }, { "entropy": 1.192745953798294, "epoch": 4.141653501843075, "grad_norm": 0.31311383843421936, "learning_rate": 8.790518735452791e-05, "loss": 0.1840343475341797, "mean_token_accuracy": 0.9203387498855591, "num_tokens": 97018528.0, "step": 7865 }, { "entropy": 1.2096452116966248, "epoch": 4.14218009478673, "grad_norm": 0.2992757558822632, "learning_rate": 8.788393079187143e-05, "loss": 0.18025711178779602, "mean_token_accuracy": 0.9227023422718048, "num_tokens": 97030864.0, "step": 7866 }, { "entropy": 1.2235386669635773, "epoch": 4.142706687730384, "grad_norm": 0.3282581567764282, "learning_rate": 8.786267554211702e-05, "loss": 0.17555806040763855, "mean_token_accuracy": 0.9277769923210144, "num_tokens": 97043200.0, "step": 7867 }, { "entropy": 1.1785718202590942, "epoch": 4.143233280674039, "grad_norm": 0.30684641003608704, "learning_rate": 8.784142160652653e-05, "loss": 0.1687370091676712, "mean_token_accuracy": 0.9266917407512665, "num_tokens": 97055536.0, "step": 7868 }, { "entropy": 1.1978355944156647, "epoch": 4.143759873617694, "grad_norm": 0.3126814067363739, "learning_rate": 8.782016898636171e-05, "loss": 0.1742529571056366, "mean_token_accuracy": 0.9298644214868546, "num_tokens": 97067872.0, "step": 7869 }, { "entropy": 1.1947324872016907, "epoch": 4.144286466561348, "grad_norm": 0.30397486686706543, "learning_rate": 8.77989176828842e-05, "loss": 0.1776277720928192, "mean_token_accuracy": 0.9236465692520142, "num_tokens": 97080208.0, "step": 7870 }, { "entropy": 1.1997438669204712, "epoch": 4.144813059505003, "grad_norm": 0.3125491142272949, "learning_rate": 8.777766769735553e-05, "loss": 0.16377533972263336, "mean_token_accuracy": 0.9303515553474426, "num_tokens": 97092544.0, "step": 7871 }, { "entropy": 1.1845740675926208, "epoch": 4.145339652448657, "grad_norm": 0.31364214420318604, "learning_rate": 8.775641903103722e-05, "loss": 0.1769748330116272, "mean_token_accuracy": 0.9256869256496429, "num_tokens": 97104880.0, "step": 7872 }, { "entropy": 1.2070526480674744, "epoch": 4.145866245392312, "grad_norm": 0.33908551931381226, "learning_rate": 8.773517168519068e-05, "loss": 0.19118264317512512, "mean_token_accuracy": 0.9204799234867096, "num_tokens": 97117216.0, "step": 7873 }, { "entropy": 1.1500370502471924, "epoch": 4.1463928383359665, "grad_norm": 0.30359727144241333, "learning_rate": 8.771392566107719e-05, "loss": 0.15972694754600525, "mean_token_accuracy": 0.9310502260923386, "num_tokens": 97129552.0, "step": 7874 }, { "entropy": 1.1818935573101044, "epoch": 4.1469194312796205, "grad_norm": 0.2914751172065735, "learning_rate": 8.769268095995804e-05, "loss": 0.15774892270565033, "mean_token_accuracy": 0.93589748442173, "num_tokens": 97141888.0, "step": 7875 }, { "entropy": 1.1127046644687653, "epoch": 4.147446024223275, "grad_norm": 0.3282979428768158, "learning_rate": 8.767143758309441e-05, "loss": 0.1835567206144333, "mean_token_accuracy": 0.9219317585229874, "num_tokens": 97154224.0, "step": 7876 }, { "entropy": 1.1789429485797882, "epoch": 4.14797261716693, "grad_norm": 0.3184622824192047, "learning_rate": 8.765019553174743e-05, "loss": 0.16821898519992828, "mean_token_accuracy": 0.9285916388034821, "num_tokens": 97166560.0, "step": 7877 }, { "entropy": 1.1564103364944458, "epoch": 4.148499210110584, "grad_norm": 0.3147515058517456, "learning_rate": 8.762895480717806e-05, "loss": 0.18371067941188812, "mean_token_accuracy": 0.9219361543655396, "num_tokens": 97178896.0, "step": 7878 }, { "entropy": 1.1647071540355682, "epoch": 4.149025803054239, "grad_norm": 0.30860114097595215, "learning_rate": 8.760771541064723e-05, "loss": 0.16761994361877441, "mean_token_accuracy": 0.9280609488487244, "num_tokens": 97191232.0, "step": 7879 }, { "entropy": 1.1906790435314178, "epoch": 4.149552395997894, "grad_norm": 0.3416535258293152, "learning_rate": 8.758647734341585e-05, "loss": 0.17877760529518127, "mean_token_accuracy": 0.9286190420389175, "num_tokens": 97203568.0, "step": 7880 }, { "entropy": 1.1658837795257568, "epoch": 4.150078988941548, "grad_norm": 0.31593748927116394, "learning_rate": 8.756524060674467e-05, "loss": 0.1759740263223648, "mean_token_accuracy": 0.9265497177839279, "num_tokens": 97215904.0, "step": 7881 }, { "entropy": 1.1537308394908905, "epoch": 4.150605581885203, "grad_norm": 0.29740700125694275, "learning_rate": 8.754400520189434e-05, "loss": 0.16418850421905518, "mean_token_accuracy": 0.9289576411247253, "num_tokens": 97228240.0, "step": 7882 }, { "entropy": 1.1212096512317657, "epoch": 4.151132174828858, "grad_norm": 0.3116762340068817, "learning_rate": 8.752277113012561e-05, "loss": 0.18620739877223969, "mean_token_accuracy": 0.9213346540927887, "num_tokens": 97240576.0, "step": 7883 }, { "entropy": 1.156780868768692, "epoch": 4.151658767772512, "grad_norm": 0.31119340658187866, "learning_rate": 8.750153839269893e-05, "loss": 0.17240305244922638, "mean_token_accuracy": 0.9259216040372849, "num_tokens": 97252912.0, "step": 7884 }, { "entropy": 1.1416524350643158, "epoch": 4.1521853607161665, "grad_norm": 0.3117210566997528, "learning_rate": 8.748030699087479e-05, "loss": 0.16234537959098816, "mean_token_accuracy": 0.926701694726944, "num_tokens": 97265248.0, "step": 7885 }, { "entropy": 1.1640398502349854, "epoch": 4.152711953659821, "grad_norm": 0.32278892397880554, "learning_rate": 8.745907692591355e-05, "loss": 0.18029090762138367, "mean_token_accuracy": 0.9224131107330322, "num_tokens": 97277584.0, "step": 7886 }, { "entropy": 1.1261101365089417, "epoch": 4.153238546603475, "grad_norm": 0.30563411116600037, "learning_rate": 8.743784819907555e-05, "loss": 0.1692604422569275, "mean_token_accuracy": 0.9304532557725906, "num_tokens": 97289920.0, "step": 7887 }, { "entropy": 1.0596873760223389, "epoch": 4.15376513954713, "grad_norm": 0.2899622321128845, "learning_rate": 8.741662081162101e-05, "loss": 0.16613377630710602, "mean_token_accuracy": 0.9299019277095795, "num_tokens": 97302256.0, "step": 7888 }, { "entropy": 1.1265613734722137, "epoch": 4.154291732490784, "grad_norm": 0.35447025299072266, "learning_rate": 8.739539476481002e-05, "loss": 0.18643632531166077, "mean_token_accuracy": 0.9222086817026138, "num_tokens": 97314592.0, "step": 7889 }, { "entropy": 1.1076932549476624, "epoch": 4.154818325434439, "grad_norm": 0.3150840997695923, "learning_rate": 8.737417005990273e-05, "loss": 0.18493393063545227, "mean_token_accuracy": 0.9213186651468277, "num_tokens": 97326928.0, "step": 7890 }, { "entropy": 1.1085457503795624, "epoch": 4.155344918378094, "grad_norm": 0.313933789730072, "learning_rate": 8.735294669815907e-05, "loss": 0.17420503497123718, "mean_token_accuracy": 0.9284477382898331, "num_tokens": 97339264.0, "step": 7891 }, { "entropy": 1.1525159180164337, "epoch": 4.155871511321748, "grad_norm": 0.3383539915084839, "learning_rate": 8.733172468083899e-05, "loss": 0.19659945368766785, "mean_token_accuracy": 0.9155688285827637, "num_tokens": 97351600.0, "step": 7892 }, { "entropy": 1.1956713497638702, "epoch": 4.156398104265403, "grad_norm": 0.3446492850780487, "learning_rate": 8.731050400920228e-05, "loss": 0.19122977554798126, "mean_token_accuracy": 0.919826090335846, "num_tokens": 97363936.0, "step": 7893 }, { "entropy": 1.133418470621109, "epoch": 4.156924697209058, "grad_norm": 0.3261299431324005, "learning_rate": 8.728928468450872e-05, "loss": 0.18709659576416016, "mean_token_accuracy": 0.9200118184089661, "num_tokens": 97376272.0, "step": 7894 }, { "entropy": 1.1456515491008759, "epoch": 4.157451290152712, "grad_norm": 0.3069509267807007, "learning_rate": 8.726806670801795e-05, "loss": 0.16389334201812744, "mean_token_accuracy": 0.9278152287006378, "num_tokens": 97388608.0, "step": 7895 }, { "entropy": 1.1480842530727386, "epoch": 4.1579778830963665, "grad_norm": 0.2948766350746155, "learning_rate": 8.724685008098957e-05, "loss": 0.16451896727085114, "mean_token_accuracy": 0.9315945357084274, "num_tokens": 97400944.0, "step": 7896 }, { "entropy": 1.1332952380180359, "epoch": 4.158504476040021, "grad_norm": 0.3097462058067322, "learning_rate": 8.722563480468307e-05, "loss": 0.17155258357524872, "mean_token_accuracy": 0.9271485656499863, "num_tokens": 97413280.0, "step": 7897 }, { "entropy": 1.1336309015750885, "epoch": 4.159031068983675, "grad_norm": 0.33266201615333557, "learning_rate": 8.720442088035792e-05, "loss": 0.18347817659378052, "mean_token_accuracy": 0.923959031701088, "num_tokens": 97425616.0, "step": 7898 }, { "entropy": 1.171826809644699, "epoch": 4.15955766192733, "grad_norm": 0.3139927387237549, "learning_rate": 8.718320830927342e-05, "loss": 0.18313026428222656, "mean_token_accuracy": 0.921869158744812, "num_tokens": 97437952.0, "step": 7899 }, { "entropy": 1.1280116140842438, "epoch": 4.160084254870985, "grad_norm": 0.3097572922706604, "learning_rate": 8.716199709268888e-05, "loss": 0.1742512583732605, "mean_token_accuracy": 0.9275535643100739, "num_tokens": 97450288.0, "step": 7900 }, { "entropy": 1.176198035478592, "epoch": 4.160610847814639, "grad_norm": 0.333377867937088, "learning_rate": 8.714078723186345e-05, "loss": 0.1746947467327118, "mean_token_accuracy": 0.922828882932663, "num_tokens": 97462624.0, "step": 7901 }, { "entropy": 1.0927571058273315, "epoch": 4.161137440758294, "grad_norm": 0.28481024503707886, "learning_rate": 8.711957872805623e-05, "loss": 0.1627894937992096, "mean_token_accuracy": 0.9318502992391586, "num_tokens": 97474960.0, "step": 7902 }, { "entropy": 1.1829233169555664, "epoch": 4.161664033701949, "grad_norm": 0.325119286775589, "learning_rate": 8.709837158252625e-05, "loss": 0.15235716104507446, "mean_token_accuracy": 0.9361916035413742, "num_tokens": 97487296.0, "step": 7903 }, { "entropy": 1.132764995098114, "epoch": 4.162190626645603, "grad_norm": 0.2946729063987732, "learning_rate": 8.707716579653252e-05, "loss": 0.1627139300107956, "mean_token_accuracy": 0.9323912262916565, "num_tokens": 97499632.0, "step": 7904 }, { "entropy": 1.1086375713348389, "epoch": 4.162717219589258, "grad_norm": 0.31512293219566345, "learning_rate": 8.705596137133383e-05, "loss": 0.17438560724258423, "mean_token_accuracy": 0.9283198565244675, "num_tokens": 97511968.0, "step": 7905 }, { "entropy": 1.1292003095149994, "epoch": 4.163243812532912, "grad_norm": 0.3263719379901886, "learning_rate": 8.703475830818897e-05, "loss": 0.18227732181549072, "mean_token_accuracy": 0.9306434243917465, "num_tokens": 97524304.0, "step": 7906 }, { "entropy": 1.1621695756912231, "epoch": 4.1637704054765665, "grad_norm": 0.33717191219329834, "learning_rate": 8.701355660835668e-05, "loss": 0.18825942277908325, "mean_token_accuracy": 0.9183655381202698, "num_tokens": 97536640.0, "step": 7907 }, { "entropy": 1.1358915865421295, "epoch": 4.164296998420221, "grad_norm": 0.2987043559551239, "learning_rate": 8.699235627309555e-05, "loss": 0.16116175055503845, "mean_token_accuracy": 0.9334104210138321, "num_tokens": 97548976.0, "step": 7908 }, { "entropy": 1.1565150618553162, "epoch": 4.164823591363875, "grad_norm": 0.3205986022949219, "learning_rate": 8.697115730366412e-05, "loss": 0.16675369441509247, "mean_token_accuracy": 0.9308912009000778, "num_tokens": 97561312.0, "step": 7909 }, { "entropy": 1.0812119841575623, "epoch": 4.16535018430753, "grad_norm": 0.2919435501098633, "learning_rate": 8.694995970132085e-05, "loss": 0.16248270869255066, "mean_token_accuracy": 0.9337244182825089, "num_tokens": 97573648.0, "step": 7910 }, { "entropy": 1.13819220662117, "epoch": 4.165876777251185, "grad_norm": 0.30222269892692566, "learning_rate": 8.692876346732414e-05, "loss": 0.16139960289001465, "mean_token_accuracy": 0.9313693344593048, "num_tokens": 97585984.0, "step": 7911 }, { "entropy": 1.1090191304683685, "epoch": 4.166403370194839, "grad_norm": 0.30965638160705566, "learning_rate": 8.690756860293228e-05, "loss": 0.17174068093299866, "mean_token_accuracy": 0.9258616119623184, "num_tokens": 97598320.0, "step": 7912 }, { "entropy": 1.1270416676998138, "epoch": 4.166929963138494, "grad_norm": 0.3268696963787079, "learning_rate": 8.688637510940347e-05, "loss": 0.18002545833587646, "mean_token_accuracy": 0.9255077242851257, "num_tokens": 97610656.0, "step": 7913 }, { "entropy": 1.0708400905132294, "epoch": 4.167456556082149, "grad_norm": 0.305288702249527, "learning_rate": 8.686518298799588e-05, "loss": 0.17188933491706848, "mean_token_accuracy": 0.929124191403389, "num_tokens": 97622992.0, "step": 7914 }, { "entropy": 1.150255173444748, "epoch": 4.167983149025803, "grad_norm": 0.319894015789032, "learning_rate": 8.684399223996753e-05, "loss": 0.18005041778087616, "mean_token_accuracy": 0.9222705960273743, "num_tokens": 97635328.0, "step": 7915 }, { "entropy": 1.1469556391239166, "epoch": 4.168509741969458, "grad_norm": 0.2839876413345337, "learning_rate": 8.682280286657638e-05, "loss": 0.15683573484420776, "mean_token_accuracy": 0.9359724968671799, "num_tokens": 97647664.0, "step": 7916 }, { "entropy": 1.130246102809906, "epoch": 4.1690363349131125, "grad_norm": 0.2888103723526001, "learning_rate": 8.680161486908029e-05, "loss": 0.17167188227176666, "mean_token_accuracy": 0.9267813563346863, "num_tokens": 97660000.0, "step": 7917 }, { "entropy": 1.1806441247463226, "epoch": 4.1695629278567665, "grad_norm": 0.31467166543006897, "learning_rate": 8.678042824873718e-05, "loss": 0.16514365375041962, "mean_token_accuracy": 0.9340773224830627, "num_tokens": 97672336.0, "step": 7918 }, { "entropy": 1.1494162380695343, "epoch": 4.170089520800421, "grad_norm": 0.29949796199798584, "learning_rate": 8.675924300680472e-05, "loss": 0.16776269674301147, "mean_token_accuracy": 0.9300021529197693, "num_tokens": 97684672.0, "step": 7919 }, { "entropy": 1.1326565742492676, "epoch": 4.170616113744076, "grad_norm": 0.28281745314598083, "learning_rate": 8.673805914454052e-05, "loss": 0.15195021033287048, "mean_token_accuracy": 0.93742336332798, "num_tokens": 97697008.0, "step": 7920 }, { "entropy": 1.155946284532547, "epoch": 4.17114270668773, "grad_norm": 0.3132133483886719, "learning_rate": 8.671687666320216e-05, "loss": 0.16573591530323029, "mean_token_accuracy": 0.9311816990375519, "num_tokens": 97709344.0, "step": 7921 }, { "entropy": 1.1932643055915833, "epoch": 4.171669299631385, "grad_norm": 0.30656367540359497, "learning_rate": 8.669569556404715e-05, "loss": 0.17846107482910156, "mean_token_accuracy": 0.9251795262098312, "num_tokens": 97721680.0, "step": 7922 }, { "entropy": 1.1108348965644836, "epoch": 4.172195892575039, "grad_norm": 0.28596436977386475, "learning_rate": 8.667451584833286e-05, "loss": 0.16041474044322968, "mean_token_accuracy": 0.932331770658493, "num_tokens": 97734016.0, "step": 7923 }, { "entropy": 1.1430757641792297, "epoch": 4.172722485518694, "grad_norm": 0.29431983828544617, "learning_rate": 8.665333751731657e-05, "loss": 0.16474981606006622, "mean_token_accuracy": 0.9339012801647186, "num_tokens": 97746352.0, "step": 7924 }, { "entropy": 1.1723743379116058, "epoch": 4.173249078462349, "grad_norm": 0.2873007655143738, "learning_rate": 8.66321605722556e-05, "loss": 0.17336371541023254, "mean_token_accuracy": 0.9289100468158722, "num_tokens": 97758688.0, "step": 7925 }, { "entropy": 1.1681491136550903, "epoch": 4.173775671406003, "grad_norm": 0.30883681774139404, "learning_rate": 8.661098501440705e-05, "loss": 0.16132764518260956, "mean_token_accuracy": 0.9322926998138428, "num_tokens": 97771024.0, "step": 7926 }, { "entropy": 1.1442429721355438, "epoch": 4.174302264349658, "grad_norm": 0.2862742841243744, "learning_rate": 8.6589810845028e-05, "loss": 0.1608617901802063, "mean_token_accuracy": 0.9310795217752457, "num_tokens": 97783360.0, "step": 7927 }, { "entropy": 1.1497341990470886, "epoch": 4.1748288572933125, "grad_norm": 0.317093163728714, "learning_rate": 8.656863806537545e-05, "loss": 0.1696247011423111, "mean_token_accuracy": 0.928160235285759, "num_tokens": 97795696.0, "step": 7928 }, { "entropy": 1.1339037120342255, "epoch": 4.1753554502369665, "grad_norm": 0.29926052689552307, "learning_rate": 8.654746667670625e-05, "loss": 0.17137229442596436, "mean_token_accuracy": 0.9275287538766861, "num_tokens": 97808032.0, "step": 7929 }, { "entropy": 1.12783482670784, "epoch": 4.175882043180621, "grad_norm": 0.32092663645744324, "learning_rate": 8.652629668027731e-05, "loss": 0.1702403575181961, "mean_token_accuracy": 0.9298358708620071, "num_tokens": 97820368.0, "step": 7930 }, { "entropy": 1.07560133934021, "epoch": 4.176408636124276, "grad_norm": 0.2888548970222473, "learning_rate": 8.650512807734528e-05, "loss": 0.1581571102142334, "mean_token_accuracy": 0.9314680397510529, "num_tokens": 97832704.0, "step": 7931 }, { "entropy": 1.1324105262756348, "epoch": 4.17693522906793, "grad_norm": 0.3102474808692932, "learning_rate": 8.648396086916689e-05, "loss": 0.16579195857048035, "mean_token_accuracy": 0.9326518923044205, "num_tokens": 97845040.0, "step": 7932 }, { "entropy": 1.1441057622432709, "epoch": 4.177461822011585, "grad_norm": 0.3496611714363098, "learning_rate": 8.646279505699866e-05, "loss": 0.16715586185455322, "mean_token_accuracy": 0.9297567307949066, "num_tokens": 97857376.0, "step": 7933 }, { "entropy": 1.1016460955142975, "epoch": 4.17798841495524, "grad_norm": 0.3026537001132965, "learning_rate": 8.644163064209712e-05, "loss": 0.16574016213417053, "mean_token_accuracy": 0.9266877919435501, "num_tokens": 97869712.0, "step": 7934 }, { "entropy": 1.0845454335212708, "epoch": 4.178515007898894, "grad_norm": 0.3035183250904083, "learning_rate": 8.642046762571865e-05, "loss": 0.1641194224357605, "mean_token_accuracy": 0.9290327280759811, "num_tokens": 97882048.0, "step": 7935 }, { "entropy": 1.1284317672252655, "epoch": 4.179041600842549, "grad_norm": 0.32802003622055054, "learning_rate": 8.639930600911958e-05, "loss": 0.17272982001304626, "mean_token_accuracy": 0.9265357404947281, "num_tokens": 97894384.0, "step": 7936 }, { "entropy": 1.116320550441742, "epoch": 4.179568193786203, "grad_norm": 0.30705663561820984, "learning_rate": 8.637814579355616e-05, "loss": 0.17422252893447876, "mean_token_accuracy": 0.9294481426477432, "num_tokens": 97906720.0, "step": 7937 }, { "entropy": 1.0654830634593964, "epoch": 4.180094786729858, "grad_norm": 0.2974829375743866, "learning_rate": 8.635698698028454e-05, "loss": 0.1572597324848175, "mean_token_accuracy": 0.931130439043045, "num_tokens": 97919056.0, "step": 7938 }, { "entropy": 1.038515031337738, "epoch": 4.1806213796735125, "grad_norm": 0.30022743344306946, "learning_rate": 8.633582957056078e-05, "loss": 0.1798889935016632, "mean_token_accuracy": 0.923603281378746, "num_tokens": 97931392.0, "step": 7939 }, { "entropy": 1.1388559639453888, "epoch": 4.1811479726171665, "grad_norm": 0.3145715594291687, "learning_rate": 8.631467356564094e-05, "loss": 0.179629847407341, "mean_token_accuracy": 0.9220999926328659, "num_tokens": 97943728.0, "step": 7940 }, { "entropy": 1.0842942893505096, "epoch": 4.181674565560821, "grad_norm": 0.3120422959327698, "learning_rate": 8.629351896678087e-05, "loss": 0.16004841029644012, "mean_token_accuracy": 0.9332457929849625, "num_tokens": 97956064.0, "step": 7941 }, { "entropy": 1.117704689502716, "epoch": 4.182201158504476, "grad_norm": 0.3080293834209442, "learning_rate": 8.627236577523638e-05, "loss": 0.17224644124507904, "mean_token_accuracy": 0.9285424053668976, "num_tokens": 97968400.0, "step": 7942 }, { "entropy": 1.092921793460846, "epoch": 4.18272775144813, "grad_norm": 0.2939336597919464, "learning_rate": 8.625121399226325e-05, "loss": 0.1657520979642868, "mean_token_accuracy": 0.9322685897350311, "num_tokens": 97980736.0, "step": 7943 }, { "entropy": 1.1526983082294464, "epoch": 4.183254344391785, "grad_norm": 0.3342089056968689, "learning_rate": 8.623006361911717e-05, "loss": 0.16991101205348969, "mean_token_accuracy": 0.9307911396026611, "num_tokens": 97993072.0, "step": 7944 }, { "entropy": 1.1522125899791718, "epoch": 4.18378093733544, "grad_norm": 0.32566115260124207, "learning_rate": 8.620891465705361e-05, "loss": 0.18175408244132996, "mean_token_accuracy": 0.9232334196567535, "num_tokens": 98005408.0, "step": 7945 }, { "entropy": 1.090649127960205, "epoch": 4.184307530279094, "grad_norm": 0.29311081767082214, "learning_rate": 8.618776710732815e-05, "loss": 0.17214401066303253, "mean_token_accuracy": 0.9269599318504333, "num_tokens": 98017744.0, "step": 7946 }, { "entropy": 1.063426434993744, "epoch": 4.184834123222749, "grad_norm": 0.3156338334083557, "learning_rate": 8.616662097119616e-05, "loss": 0.1816682517528534, "mean_token_accuracy": 0.9186233878135681, "num_tokens": 98030080.0, "step": 7947 }, { "entropy": 1.161031723022461, "epoch": 4.185360716166404, "grad_norm": 0.32171863317489624, "learning_rate": 8.614547624991298e-05, "loss": 0.1648269146680832, "mean_token_accuracy": 0.9334552884101868, "num_tokens": 98042416.0, "step": 7948 }, { "entropy": 1.1177985966205597, "epoch": 4.185887309110058, "grad_norm": 0.2832168936729431, "learning_rate": 8.612433294473388e-05, "loss": 0.15666519105434418, "mean_token_accuracy": 0.9333730190992355, "num_tokens": 98054752.0, "step": 7949 }, { "entropy": 1.1391778588294983, "epoch": 4.1864139020537126, "grad_norm": 0.3128279149532318, "learning_rate": 8.610319105691391e-05, "loss": 0.18297505378723145, "mean_token_accuracy": 0.9255256950855255, "num_tokens": 98067088.0, "step": 7950 }, { "entropy": 1.1098828315734863, "epoch": 4.186940494997367, "grad_norm": 0.2972641587257385, "learning_rate": 8.608205058770824e-05, "loss": 0.17479528486728668, "mean_token_accuracy": 0.9239056408405304, "num_tokens": 98079424.0, "step": 7951 }, { "entropy": 1.090119868516922, "epoch": 4.187467087941021, "grad_norm": 0.2823604941368103, "learning_rate": 8.606091153837177e-05, "loss": 0.17192570865154266, "mean_token_accuracy": 0.926673173904419, "num_tokens": 98091760.0, "step": 7952 }, { "entropy": 1.1354528367519379, "epoch": 4.187993680884676, "grad_norm": 0.3025682270526886, "learning_rate": 8.603977391015952e-05, "loss": 0.1576496660709381, "mean_token_accuracy": 0.9324574172496796, "num_tokens": 98104096.0, "step": 7953 }, { "entropy": 1.0947018563747406, "epoch": 4.188520273828331, "grad_norm": 0.29626360535621643, "learning_rate": 8.601863770432621e-05, "loss": 0.15951457619667053, "mean_token_accuracy": 0.9352555125951767, "num_tokens": 98116432.0, "step": 7954 }, { "entropy": 1.0987676084041595, "epoch": 4.189046866771985, "grad_norm": 0.31504783034324646, "learning_rate": 8.599750292212663e-05, "loss": 0.1648494005203247, "mean_token_accuracy": 0.9316914975643158, "num_tokens": 98128768.0, "step": 7955 }, { "entropy": 1.1356965005397797, "epoch": 4.18957345971564, "grad_norm": 0.33778253197669983, "learning_rate": 8.597636956481539e-05, "loss": 0.1846567839384079, "mean_token_accuracy": 0.9174581170082092, "num_tokens": 98141104.0, "step": 7956 }, { "entropy": 1.1384792923927307, "epoch": 4.190100052659294, "grad_norm": 0.31808388233184814, "learning_rate": 8.595523763364705e-05, "loss": 0.17047390341758728, "mean_token_accuracy": 0.9234932065010071, "num_tokens": 98153440.0, "step": 7957 }, { "entropy": 1.1021815836429596, "epoch": 4.190626645602949, "grad_norm": 0.30722370743751526, "learning_rate": 8.593410712987613e-05, "loss": 0.1636321246623993, "mean_token_accuracy": 0.9300334602594376, "num_tokens": 98165776.0, "step": 7958 }, { "entropy": 1.11932834982872, "epoch": 4.191153238546604, "grad_norm": 0.2899395823478699, "learning_rate": 8.591297805475698e-05, "loss": 0.1672748178243637, "mean_token_accuracy": 0.9299319982528687, "num_tokens": 98178112.0, "step": 7959 }, { "entropy": 1.1545650362968445, "epoch": 4.191679831490258, "grad_norm": 0.4581027030944824, "learning_rate": 8.589185040954397e-05, "loss": 0.17158180475234985, "mean_token_accuracy": 0.926212728023529, "num_tokens": 98190448.0, "step": 7960 }, { "entropy": 1.06837597489357, "epoch": 4.192206424433913, "grad_norm": 0.2880743443965912, "learning_rate": 8.587072419549124e-05, "loss": 0.15795296430587769, "mean_token_accuracy": 0.932521715760231, "num_tokens": 98202784.0, "step": 7961 }, { "entropy": 1.1178251504898071, "epoch": 4.192733017377567, "grad_norm": 0.32974228262901306, "learning_rate": 8.584959941385302e-05, "loss": 0.16619572043418884, "mean_token_accuracy": 0.9276171326637268, "num_tokens": 98215120.0, "step": 7962 }, { "entropy": 1.0960520803928375, "epoch": 4.193259610321221, "grad_norm": 0.2987158000469208, "learning_rate": 8.582847606588331e-05, "loss": 0.1672661453485489, "mean_token_accuracy": 0.934171587228775, "num_tokens": 98227456.0, "step": 7963 }, { "entropy": 1.1045244336128235, "epoch": 4.193786203264876, "grad_norm": 0.3211537003517151, "learning_rate": 8.580735415283611e-05, "loss": 0.16704663634300232, "mean_token_accuracy": 0.9283624291419983, "num_tokens": 98239792.0, "step": 7964 }, { "entropy": 1.110570877790451, "epoch": 4.194312796208531, "grad_norm": 0.2917163074016571, "learning_rate": 8.578623367596528e-05, "loss": 0.15598426759243011, "mean_token_accuracy": 0.9323853105306625, "num_tokens": 98252128.0, "step": 7965 }, { "entropy": 1.1223257184028625, "epoch": 4.194839389152185, "grad_norm": 0.31256887316703796, "learning_rate": 8.576511463652459e-05, "loss": 0.17231056094169617, "mean_token_accuracy": 0.9279206097126007, "num_tokens": 98264464.0, "step": 7966 }, { "entropy": 1.140623539686203, "epoch": 4.19536598209584, "grad_norm": 0.3077540397644043, "learning_rate": 8.574399703576783e-05, "loss": 0.16856276988983154, "mean_token_accuracy": 0.9312508851289749, "num_tokens": 98276800.0, "step": 7967 }, { "entropy": 1.063914641737938, "epoch": 4.195892575039495, "grad_norm": 0.3021930754184723, "learning_rate": 8.57228808749486e-05, "loss": 0.1651664525270462, "mean_token_accuracy": 0.9296476095914841, "num_tokens": 98289136.0, "step": 7968 }, { "entropy": 1.0992920398712158, "epoch": 4.196419167983149, "grad_norm": 0.3029404282569885, "learning_rate": 8.570176615532042e-05, "loss": 0.1661408394575119, "mean_token_accuracy": 0.9296275675296783, "num_tokens": 98301472.0, "step": 7969 }, { "entropy": 1.1151938438415527, "epoch": 4.196945760926804, "grad_norm": 0.3258514106273651, "learning_rate": 8.568065287813676e-05, "loss": 0.17900605499744415, "mean_token_accuracy": 0.9241693019866943, "num_tokens": 98313808.0, "step": 7970 }, { "entropy": 1.0781232714653015, "epoch": 4.197472353870458, "grad_norm": 0.30975598096847534, "learning_rate": 8.565954104465099e-05, "loss": 0.1776178479194641, "mean_token_accuracy": 0.9261597841978073, "num_tokens": 98326144.0, "step": 7971 }, { "entropy": 1.06985804438591, "epoch": 4.197998946814113, "grad_norm": 0.3054265081882477, "learning_rate": 8.563843065611644e-05, "loss": 0.16655519604682922, "mean_token_accuracy": 0.9298802763223648, "num_tokens": 98338480.0, "step": 7972 }, { "entropy": 1.1291494071483612, "epoch": 4.198525539757767, "grad_norm": 0.34682711958885193, "learning_rate": 8.56173217137862e-05, "loss": 0.19172894954681396, "mean_token_accuracy": 0.9177665114402771, "num_tokens": 98350816.0, "step": 7973 }, { "entropy": 1.1112886667251587, "epoch": 4.199052132701421, "grad_norm": 0.3117178678512573, "learning_rate": 8.559621421891351e-05, "loss": 0.17443540692329407, "mean_token_accuracy": 0.9223020076751709, "num_tokens": 98363152.0, "step": 7974 }, { "entropy": 1.0742622911930084, "epoch": 4.199578725645076, "grad_norm": 0.34515872597694397, "learning_rate": 8.557510817275132e-05, "loss": 0.19704975187778473, "mean_token_accuracy": 0.9175226539373398, "num_tokens": 98375488.0, "step": 7975 }, { "entropy": 1.1295852661132812, "epoch": 4.200105318588731, "grad_norm": 0.36591923236846924, "learning_rate": 8.555400357655263e-05, "loss": 0.18784211575984955, "mean_token_accuracy": 0.9206234365701675, "num_tokens": 98387824.0, "step": 7976 }, { "entropy": 1.0534974783658981, "epoch": 4.200631911532385, "grad_norm": 0.3111979365348816, "learning_rate": 8.553290043157023e-05, "loss": 0.16622695326805115, "mean_token_accuracy": 0.929931178689003, "num_tokens": 98400160.0, "step": 7977 }, { "entropy": 1.115527868270874, "epoch": 4.20115850447604, "grad_norm": 0.3002520799636841, "learning_rate": 8.551179873905695e-05, "loss": 0.15955239534378052, "mean_token_accuracy": 0.9324867129325867, "num_tokens": 98412496.0, "step": 7978 }, { "entropy": 1.0896766781806946, "epoch": 4.201685097419695, "grad_norm": 0.2898309826850891, "learning_rate": 8.549069850026548e-05, "loss": 0.16048483550548553, "mean_token_accuracy": 0.9341316372156143, "num_tokens": 98424832.0, "step": 7979 }, { "entropy": 1.0702438354492188, "epoch": 4.202211690363349, "grad_norm": 0.29576775431632996, "learning_rate": 8.54695997164483e-05, "loss": 0.17099790275096893, "mean_token_accuracy": 0.9304496645927429, "num_tokens": 98437168.0, "step": 7980 }, { "entropy": 1.1288506090641022, "epoch": 4.202738283307004, "grad_norm": 0.30057501792907715, "learning_rate": 8.544850238885807e-05, "loss": 0.1682431399822235, "mean_token_accuracy": 0.9278569519519806, "num_tokens": 98449504.0, "step": 7981 }, { "entropy": 1.069754958152771, "epoch": 4.203264876250659, "grad_norm": 0.2968423366546631, "learning_rate": 8.542740651874714e-05, "loss": 0.15609124302864075, "mean_token_accuracy": 0.9299767464399338, "num_tokens": 98461840.0, "step": 7982 }, { "entropy": 1.1045666337013245, "epoch": 4.203791469194313, "grad_norm": 0.31645500659942627, "learning_rate": 8.540631210736792e-05, "loss": 0.1641203612089157, "mean_token_accuracy": 0.9307035803794861, "num_tokens": 98474176.0, "step": 7983 }, { "entropy": 1.0776027143001556, "epoch": 4.204318062137967, "grad_norm": 0.3043416142463684, "learning_rate": 8.538521915597255e-05, "loss": 0.17317499220371246, "mean_token_accuracy": 0.92805016040802, "num_tokens": 98486512.0, "step": 7984 }, { "entropy": 1.0777670294046402, "epoch": 4.204844655081622, "grad_norm": 0.3128795623779297, "learning_rate": 8.536412766581326e-05, "loss": 0.17743663489818573, "mean_token_accuracy": 0.9234709143638611, "num_tokens": 98498848.0, "step": 7985 }, { "entropy": 1.1268915832042694, "epoch": 4.205371248025276, "grad_norm": 0.3350537419319153, "learning_rate": 8.534303763814213e-05, "loss": 0.18315504491329193, "mean_token_accuracy": 0.9224580526351929, "num_tokens": 98511184.0, "step": 7986 }, { "entropy": 1.0878113806247711, "epoch": 4.205897840968931, "grad_norm": 0.30929380655288696, "learning_rate": 8.532194907421111e-05, "loss": 0.1497439742088318, "mean_token_accuracy": 0.9385425448417664, "num_tokens": 98523520.0, "step": 7987 }, { "entropy": 1.1011975407600403, "epoch": 4.206424433912586, "grad_norm": 0.3478199541568756, "learning_rate": 8.530086197527218e-05, "loss": 0.17903770506381989, "mean_token_accuracy": 0.9228616505861282, "num_tokens": 98535856.0, "step": 7988 }, { "entropy": 1.099312573671341, "epoch": 4.20695102685624, "grad_norm": 0.30666959285736084, "learning_rate": 8.52797763425771e-05, "loss": 0.15633097290992737, "mean_token_accuracy": 0.9343074262142181, "num_tokens": 98548192.0, "step": 7989 }, { "entropy": 1.1367004215717316, "epoch": 4.207477619799895, "grad_norm": 0.3231365382671356, "learning_rate": 8.525869217737765e-05, "loss": 0.17650002241134644, "mean_token_accuracy": 0.9277526140213013, "num_tokens": 98560528.0, "step": 7990 }, { "entropy": 1.1399459838867188, "epoch": 4.208004212743549, "grad_norm": 0.3330667316913605, "learning_rate": 8.52376094809254e-05, "loss": 0.16690731048583984, "mean_token_accuracy": 0.9290760457515717, "num_tokens": 98572864.0, "step": 7991 }, { "entropy": 1.1063806414604187, "epoch": 4.208530805687204, "grad_norm": 0.3353106677532196, "learning_rate": 8.521652825447198e-05, "loss": 0.1873796135187149, "mean_token_accuracy": 0.9198074191808701, "num_tokens": 98585200.0, "step": 7992 }, { "entropy": 1.1440241932868958, "epoch": 4.209057398630859, "grad_norm": 0.28894269466400146, "learning_rate": 8.519544849926881e-05, "loss": 0.1548701375722885, "mean_token_accuracy": 0.9302964210510254, "num_tokens": 98597536.0, "step": 7993 }, { "entropy": 1.0891906917095184, "epoch": 4.209583991574513, "grad_norm": 0.3314685523509979, "learning_rate": 8.517437021656729e-05, "loss": 0.18251857161521912, "mean_token_accuracy": 0.9253616034984589, "num_tokens": 98609872.0, "step": 7994 }, { "entropy": 1.1146202385425568, "epoch": 4.210110584518167, "grad_norm": 0.3131825029850006, "learning_rate": 8.51532934076187e-05, "loss": 0.17522290349006653, "mean_token_accuracy": 0.924506425857544, "num_tokens": 98622208.0, "step": 7995 }, { "entropy": 1.1207568645477295, "epoch": 4.210637177461822, "grad_norm": 0.3039415180683136, "learning_rate": 8.513221807367431e-05, "loss": 0.16855962574481964, "mean_token_accuracy": 0.9287214279174805, "num_tokens": 98634544.0, "step": 7996 }, { "entropy": 1.0943831205368042, "epoch": 4.211163770405476, "grad_norm": 0.3006591200828552, "learning_rate": 8.511114421598513e-05, "loss": 0.16578052937984467, "mean_token_accuracy": 0.9278803467750549, "num_tokens": 98646880.0, "step": 7997 }, { "entropy": 1.1078577935695648, "epoch": 4.211690363349131, "grad_norm": 0.3214150667190552, "learning_rate": 8.509007183580233e-05, "loss": 0.17923012375831604, "mean_token_accuracy": 0.9264998435974121, "num_tokens": 98659216.0, "step": 7998 }, { "entropy": 1.1035672426223755, "epoch": 4.212216956292786, "grad_norm": 0.3220691978931427, "learning_rate": 8.506900093437676e-05, "loss": 0.19403526186943054, "mean_token_accuracy": 0.9187631011009216, "num_tokens": 98671552.0, "step": 7999 }, { "entropy": 1.165832370519638, "epoch": 4.21274354923644, "grad_norm": 0.32074758410453796, "learning_rate": 8.504793151295924e-05, "loss": 0.16181930899620056, "mean_token_accuracy": 0.930884599685669, "num_tokens": 98683888.0, "step": 8000 }, { "entropy": 1.1062804758548737, "epoch": 4.213270142180095, "grad_norm": 0.3058002293109894, "learning_rate": 8.502686357280065e-05, "loss": 0.15885786712169647, "mean_token_accuracy": 0.9301334470510483, "num_tokens": 98696224.0, "step": 8001 }, { "entropy": 1.086621880531311, "epoch": 4.21379673512375, "grad_norm": 0.2891179621219635, "learning_rate": 8.500579711515157e-05, "loss": 0.16997601091861725, "mean_token_accuracy": 0.9267712384462357, "num_tokens": 98708560.0, "step": 8002 }, { "entropy": 1.072465568780899, "epoch": 4.214323328067404, "grad_norm": 0.2842663824558258, "learning_rate": 8.498473214126265e-05, "loss": 0.16176854074001312, "mean_token_accuracy": 0.9316033124923706, "num_tokens": 98720896.0, "step": 8003 }, { "entropy": 1.1301456093788147, "epoch": 4.214849921011059, "grad_norm": 0.31222987174987793, "learning_rate": 8.49636686523844e-05, "loss": 0.18115736544132233, "mean_token_accuracy": 0.9255324006080627, "num_tokens": 98733232.0, "step": 8004 }, { "entropy": 1.1585054695606232, "epoch": 4.215376513954713, "grad_norm": 0.29984283447265625, "learning_rate": 8.494260664976723e-05, "loss": 0.16444486379623413, "mean_token_accuracy": 0.9284003525972366, "num_tokens": 98745568.0, "step": 8005 }, { "entropy": 1.1902699172496796, "epoch": 4.2159031068983674, "grad_norm": 0.31386664509773254, "learning_rate": 8.492154613466143e-05, "loss": 0.18429820239543915, "mean_token_accuracy": 0.9183901697397232, "num_tokens": 98757904.0, "step": 8006 }, { "entropy": 1.126481145620346, "epoch": 4.216429699842022, "grad_norm": 0.3164695203304291, "learning_rate": 8.490048710831731e-05, "loss": 0.16379857063293457, "mean_token_accuracy": 0.9324172735214233, "num_tokens": 98770240.0, "step": 8007 }, { "entropy": 1.1338652968406677, "epoch": 4.216956292785676, "grad_norm": 0.2901149392127991, "learning_rate": 8.487942957198494e-05, "loss": 0.16023913025856018, "mean_token_accuracy": 0.9293277263641357, "num_tokens": 98782576.0, "step": 8008 }, { "entropy": 1.1322993040084839, "epoch": 4.217482885729331, "grad_norm": 0.2852417826652527, "learning_rate": 8.485837352691442e-05, "loss": 0.16661527752876282, "mean_token_accuracy": 0.9281364530324936, "num_tokens": 98794912.0, "step": 8009 }, { "entropy": 1.1744911968708038, "epoch": 4.218009478672986, "grad_norm": 0.3385275602340698, "learning_rate": 8.483731897435575e-05, "loss": 0.18559469282627106, "mean_token_accuracy": 0.9225542694330215, "num_tokens": 98807248.0, "step": 8010 }, { "entropy": 1.1092327535152435, "epoch": 4.21853607161664, "grad_norm": 0.3092364966869354, "learning_rate": 8.481626591555876e-05, "loss": 0.16419336199760437, "mean_token_accuracy": 0.9309809654951096, "num_tokens": 98819584.0, "step": 8011 }, { "entropy": 1.1482544243335724, "epoch": 4.219062664560295, "grad_norm": 0.2930870056152344, "learning_rate": 8.479521435177333e-05, "loss": 0.14658129215240479, "mean_token_accuracy": 0.9398646652698517, "num_tokens": 98831920.0, "step": 8012 }, { "entropy": 1.1356305181980133, "epoch": 4.21958925750395, "grad_norm": 0.2949535846710205, "learning_rate": 8.477416428424909e-05, "loss": 0.15849418938159943, "mean_token_accuracy": 0.9352830946445465, "num_tokens": 98844256.0, "step": 8013 }, { "entropy": 1.110932320356369, "epoch": 4.220115850447604, "grad_norm": 0.3075162470340729, "learning_rate": 8.47531157142357e-05, "loss": 0.1856692135334015, "mean_token_accuracy": 0.9179325848817825, "num_tokens": 98856592.0, "step": 8014 }, { "entropy": 1.0929087102413177, "epoch": 4.220642443391259, "grad_norm": 0.28426045179367065, "learning_rate": 8.473206864298267e-05, "loss": 0.15878359973430634, "mean_token_accuracy": 0.9336794316768646, "num_tokens": 98868928.0, "step": 8015 }, { "entropy": 1.1330317258834839, "epoch": 4.2211690363349135, "grad_norm": 0.3047355115413666, "learning_rate": 8.471102307173943e-05, "loss": 0.16607818007469177, "mean_token_accuracy": 0.9291487038135529, "num_tokens": 98881264.0, "step": 8016 }, { "entropy": 1.124397486448288, "epoch": 4.2216956292785675, "grad_norm": 0.3267490565776825, "learning_rate": 8.468997900175537e-05, "loss": 0.17738410830497742, "mean_token_accuracy": 0.9273585677146912, "num_tokens": 98893600.0, "step": 8017 }, { "entropy": 1.083697721362114, "epoch": 4.222222222222222, "grad_norm": 0.3247063457965851, "learning_rate": 8.466893643427975e-05, "loss": 0.17643986642360687, "mean_token_accuracy": 0.923137441277504, "num_tokens": 98905936.0, "step": 8018 }, { "entropy": 1.0832822024822235, "epoch": 4.222748815165877, "grad_norm": 0.2928093671798706, "learning_rate": 8.464789537056173e-05, "loss": 0.1664019078016281, "mean_token_accuracy": 0.9295320510864258, "num_tokens": 98918272.0, "step": 8019 }, { "entropy": 1.0755034387111664, "epoch": 4.223275408109531, "grad_norm": 0.3058106303215027, "learning_rate": 8.462685581185041e-05, "loss": 0.1633222997188568, "mean_token_accuracy": 0.9281518012285233, "num_tokens": 98930608.0, "step": 8020 }, { "entropy": 1.1339251101016998, "epoch": 4.223802001053186, "grad_norm": 0.35978588461875916, "learning_rate": 8.460581775939475e-05, "loss": 0.18212288618087769, "mean_token_accuracy": 0.9245026856660843, "num_tokens": 98942944.0, "step": 8021 }, { "entropy": 1.0699157416820526, "epoch": 4.22432859399684, "grad_norm": 0.30391931533813477, "learning_rate": 8.458478121444371e-05, "loss": 0.1710571050643921, "mean_token_accuracy": 0.9311480075120926, "num_tokens": 98955280.0, "step": 8022 }, { "entropy": 1.1171269714832306, "epoch": 4.224855186940495, "grad_norm": 0.32767462730407715, "learning_rate": 8.456374617824605e-05, "loss": 0.1657298356294632, "mean_token_accuracy": 0.9313566833734512, "num_tokens": 98967616.0, "step": 8023 }, { "entropy": 1.0930550694465637, "epoch": 4.22538177988415, "grad_norm": 0.31651630997657776, "learning_rate": 8.454271265205054e-05, "loss": 0.15753570199012756, "mean_token_accuracy": 0.9354836642742157, "num_tokens": 98979952.0, "step": 8024 }, { "entropy": 1.0365755259990692, "epoch": 4.225908372827804, "grad_norm": 0.2817818820476532, "learning_rate": 8.45216806371058e-05, "loss": 0.1531212478876114, "mean_token_accuracy": 0.9320075809955597, "num_tokens": 98992288.0, "step": 8025 }, { "entropy": 1.0220824927091599, "epoch": 4.226434965771459, "grad_norm": 0.3157874345779419, "learning_rate": 8.450065013466038e-05, "loss": 0.16431528329849243, "mean_token_accuracy": 0.9330697357654572, "num_tokens": 99004624.0, "step": 8026 }, { "entropy": 1.069034457206726, "epoch": 4.2269615587151135, "grad_norm": 0.3280310034751892, "learning_rate": 8.447962114596278e-05, "loss": 0.16932621598243713, "mean_token_accuracy": 0.9302221536636353, "num_tokens": 99016960.0, "step": 8027 }, { "entropy": 1.084026724100113, "epoch": 4.2274881516587675, "grad_norm": 0.34443116188049316, "learning_rate": 8.445859367226128e-05, "loss": 0.17805546522140503, "mean_token_accuracy": 0.9209295958280563, "num_tokens": 99029296.0, "step": 8028 }, { "entropy": 1.0402539670467377, "epoch": 4.228014744602422, "grad_norm": 0.3030589520931244, "learning_rate": 8.443756771480422e-05, "loss": 0.15634694695472717, "mean_token_accuracy": 0.9327075630426407, "num_tokens": 99041632.0, "step": 8029 }, { "entropy": 1.0674857199192047, "epoch": 4.228541337546077, "grad_norm": 0.3273454010486603, "learning_rate": 8.441654327483975e-05, "loss": 0.16213634610176086, "mean_token_accuracy": 0.9327954798936844, "num_tokens": 99053968.0, "step": 8030 }, { "entropy": 1.0766152143478394, "epoch": 4.229067930489731, "grad_norm": 0.32836732268333435, "learning_rate": 8.439552035361602e-05, "loss": 0.17243799567222595, "mean_token_accuracy": 0.9306440651416779, "num_tokens": 99066304.0, "step": 8031 }, { "entropy": 1.0273121744394302, "epoch": 4.229594523433386, "grad_norm": 0.29390573501586914, "learning_rate": 8.437449895238103e-05, "loss": 0.16573050618171692, "mean_token_accuracy": 0.9292726665735245, "num_tokens": 99078640.0, "step": 8032 }, { "entropy": 1.0838201642036438, "epoch": 4.230121116377041, "grad_norm": 0.3103295564651489, "learning_rate": 8.435347907238265e-05, "loss": 0.16615623235702515, "mean_token_accuracy": 0.9277691394090652, "num_tokens": 99090976.0, "step": 8033 }, { "entropy": 1.0215496718883514, "epoch": 4.230647709320695, "grad_norm": 0.3264978528022766, "learning_rate": 8.433246071486875e-05, "loss": 0.17719753086566925, "mean_token_accuracy": 0.924858808517456, "num_tokens": 99103312.0, "step": 8034 }, { "entropy": 1.075823962688446, "epoch": 4.23117430226435, "grad_norm": 0.3413081765174866, "learning_rate": 8.431144388108705e-05, "loss": 0.16930459439754486, "mean_token_accuracy": 0.924733966588974, "num_tokens": 99115648.0, "step": 8035 }, { "entropy": 1.0820096135139465, "epoch": 4.231700895208005, "grad_norm": 0.29625174403190613, "learning_rate": 8.429042857228521e-05, "loss": 0.15780115127563477, "mean_token_accuracy": 0.933433324098587, "num_tokens": 99127984.0, "step": 8036 }, { "entropy": 1.0696033835411072, "epoch": 4.232227488151659, "grad_norm": 0.34695589542388916, "learning_rate": 8.426941478971076e-05, "loss": 0.18729788064956665, "mean_token_accuracy": 0.920822873711586, "num_tokens": 99140320.0, "step": 8037 }, { "entropy": 1.0454368889331818, "epoch": 4.2327540810953135, "grad_norm": 0.30334046483039856, "learning_rate": 8.424840253461122e-05, "loss": 0.16217342019081116, "mean_token_accuracy": 0.9307625442743301, "num_tokens": 99152656.0, "step": 8038 }, { "entropy": 1.082186222076416, "epoch": 4.2332806740389675, "grad_norm": 0.3212319314479828, "learning_rate": 8.42273918082339e-05, "loss": 0.17911629378795624, "mean_token_accuracy": 0.9254394620656967, "num_tokens": 99164992.0, "step": 8039 }, { "entropy": 1.0837086737155914, "epoch": 4.233807266982622, "grad_norm": 0.30776384472846985, "learning_rate": 8.420638261182615e-05, "loss": 0.1589154452085495, "mean_token_accuracy": 0.9329381138086319, "num_tokens": 99177328.0, "step": 8040 }, { "entropy": 1.1049553155899048, "epoch": 4.234333859926277, "grad_norm": 0.33793139457702637, "learning_rate": 8.418537494663508e-05, "loss": 0.16878412663936615, "mean_token_accuracy": 0.9275045096874237, "num_tokens": 99189664.0, "step": 8041 }, { "entropy": 1.0484260320663452, "epoch": 4.234860452869931, "grad_norm": 0.30055221915245056, "learning_rate": 8.416436881390788e-05, "loss": 0.1704391986131668, "mean_token_accuracy": 0.927143931388855, "num_tokens": 99202000.0, "step": 8042 }, { "entropy": 1.091255709528923, "epoch": 4.235387045813586, "grad_norm": 0.28448906540870667, "learning_rate": 8.41433642148915e-05, "loss": 0.16143342852592468, "mean_token_accuracy": 0.9285534769296646, "num_tokens": 99214336.0, "step": 8043 }, { "entropy": 1.0518599450588226, "epoch": 4.235913638757241, "grad_norm": 0.3260214328765869, "learning_rate": 8.412236115083285e-05, "loss": 0.17668919265270233, "mean_token_accuracy": 0.9262640476226807, "num_tokens": 99226672.0, "step": 8044 }, { "entropy": 1.1799680888652802, "epoch": 4.236440231700895, "grad_norm": 0.3557574450969696, "learning_rate": 8.410135962297884e-05, "loss": 0.1807963252067566, "mean_token_accuracy": 0.9215933084487915, "num_tokens": 99239008.0, "step": 8045 }, { "entropy": 1.1260333359241486, "epoch": 4.23696682464455, "grad_norm": 0.30928295850753784, "learning_rate": 8.408035963257617e-05, "loss": 0.17098373174667358, "mean_token_accuracy": 0.930481031537056, "num_tokens": 99251344.0, "step": 8046 }, { "entropy": 1.053674966096878, "epoch": 4.237493417588205, "grad_norm": 0.29614847898483276, "learning_rate": 8.405936118087146e-05, "loss": 0.16931068897247314, "mean_token_accuracy": 0.9240099638700485, "num_tokens": 99263680.0, "step": 8047 }, { "entropy": 1.1174336969852448, "epoch": 4.238020010531859, "grad_norm": 0.2886521816253662, "learning_rate": 8.403836426911129e-05, "loss": 0.15806442499160767, "mean_token_accuracy": 0.9285331666469574, "num_tokens": 99276016.0, "step": 8048 }, { "entropy": 1.0821426808834076, "epoch": 4.2385466034755135, "grad_norm": 0.2885926067829132, "learning_rate": 8.40173688985421e-05, "loss": 0.16343951225280762, "mean_token_accuracy": 0.9332862049341202, "num_tokens": 99288352.0, "step": 8049 }, { "entropy": 1.108601987361908, "epoch": 4.239073196419168, "grad_norm": 0.3193191587924957, "learning_rate": 8.399637507041029e-05, "loss": 0.18125522136688232, "mean_token_accuracy": 0.9237243086099625, "num_tokens": 99300688.0, "step": 8050 }, { "entropy": 1.147266149520874, "epoch": 4.239599789362822, "grad_norm": 0.34496814012527466, "learning_rate": 8.397538278596213e-05, "loss": 0.17239923775196075, "mean_token_accuracy": 0.9295861274003983, "num_tokens": 99313024.0, "step": 8051 }, { "entropy": 1.1571033895015717, "epoch": 4.240126382306477, "grad_norm": 0.3378940224647522, "learning_rate": 8.39543920464438e-05, "loss": 0.164166659116745, "mean_token_accuracy": 0.9328539669513702, "num_tokens": 99325360.0, "step": 8052 }, { "entropy": 1.1600407361984253, "epoch": 4.240652975250132, "grad_norm": 0.30191361904144287, "learning_rate": 8.393340285310143e-05, "loss": 0.15520229935646057, "mean_token_accuracy": 0.9355641454458237, "num_tokens": 99337696.0, "step": 8053 }, { "entropy": 1.1555682718753815, "epoch": 4.241179568193786, "grad_norm": 0.30903249979019165, "learning_rate": 8.391241520718098e-05, "loss": 0.1642795205116272, "mean_token_accuracy": 0.9308182299137115, "num_tokens": 99350032.0, "step": 8054 }, { "entropy": 1.1596508026123047, "epoch": 4.241706161137441, "grad_norm": 0.3145478069782257, "learning_rate": 8.389142910992842e-05, "loss": 0.1676783561706543, "mean_token_accuracy": 0.9271293580532074, "num_tokens": 99362368.0, "step": 8055 }, { "entropy": 1.098535805940628, "epoch": 4.242232754081095, "grad_norm": 0.2904662489891052, "learning_rate": 8.387044456258952e-05, "loss": 0.15562503039836884, "mean_token_accuracy": 0.9329851716756821, "num_tokens": 99374704.0, "step": 8056 }, { "entropy": 1.0891389846801758, "epoch": 4.24275934702475, "grad_norm": 0.29856348037719727, "learning_rate": 8.384946156641007e-05, "loss": 0.17358572781085968, "mean_token_accuracy": 0.9263082295656204, "num_tokens": 99387040.0, "step": 8057 }, { "entropy": 1.0838370621204376, "epoch": 4.243285939968405, "grad_norm": 0.2928997576236725, "learning_rate": 8.38284801226356e-05, "loss": 0.16847765445709229, "mean_token_accuracy": 0.9249438941478729, "num_tokens": 99399376.0, "step": 8058 }, { "entropy": 1.1125162243843079, "epoch": 4.243812532912059, "grad_norm": 0.3397181034088135, "learning_rate": 8.380750023251176e-05, "loss": 0.191731259226799, "mean_token_accuracy": 0.9217439591884613, "num_tokens": 99411712.0, "step": 8059 }, { "entropy": 1.1244372129440308, "epoch": 4.2443391258557135, "grad_norm": 0.3366466462612152, "learning_rate": 8.378652189728398e-05, "loss": 0.16498181223869324, "mean_token_accuracy": 0.9316605627536774, "num_tokens": 99424048.0, "step": 8060 }, { "entropy": 1.0650639832019806, "epoch": 4.244865718799368, "grad_norm": 0.31246834993362427, "learning_rate": 8.376554511819763e-05, "loss": 0.1643528938293457, "mean_token_accuracy": 0.9288981109857559, "num_tokens": 99436384.0, "step": 8061 }, { "entropy": 1.1070029437541962, "epoch": 4.245392311743022, "grad_norm": 0.3298671543598175, "learning_rate": 8.37445698964979e-05, "loss": 0.18249450623989105, "mean_token_accuracy": 0.9227327108383179, "num_tokens": 99448720.0, "step": 8062 }, { "entropy": 1.0613518357276917, "epoch": 4.245918904686677, "grad_norm": 0.29906949400901794, "learning_rate": 8.372359623343008e-05, "loss": 0.17232637107372284, "mean_token_accuracy": 0.9269876629114151, "num_tokens": 99461056.0, "step": 8063 }, { "entropy": 1.0885744094848633, "epoch": 4.246445497630332, "grad_norm": 0.3588619828224182, "learning_rate": 8.37026241302392e-05, "loss": 0.17881016433238983, "mean_token_accuracy": 0.9230170994997025, "num_tokens": 99473392.0, "step": 8064 }, { "entropy": 1.0489404201507568, "epoch": 4.246972090573986, "grad_norm": 0.3277314305305481, "learning_rate": 8.36816535881702e-05, "loss": 0.17448216676712036, "mean_token_accuracy": 0.9284185767173767, "num_tokens": 99485728.0, "step": 8065 }, { "entropy": 1.1063831150531769, "epoch": 4.247498683517641, "grad_norm": 0.31005457043647766, "learning_rate": 8.366068460846808e-05, "loss": 0.16176143288612366, "mean_token_accuracy": 0.9315316379070282, "num_tokens": 99498064.0, "step": 8066 }, { "entropy": 1.0681479573249817, "epoch": 4.248025276461296, "grad_norm": 0.28904494643211365, "learning_rate": 8.363971719237758e-05, "loss": 0.1548696756362915, "mean_token_accuracy": 0.933369517326355, "num_tokens": 99510400.0, "step": 8067 }, { "entropy": 1.0995591580867767, "epoch": 4.24855186940495, "grad_norm": 0.31316521763801575, "learning_rate": 8.361875134114343e-05, "loss": 0.17337429523468018, "mean_token_accuracy": 0.9250330924987793, "num_tokens": 99522736.0, "step": 8068 }, { "entropy": 1.0685006529092789, "epoch": 4.249078462348605, "grad_norm": 0.2747979760169983, "learning_rate": 8.359778705601027e-05, "loss": 0.15470798313617706, "mean_token_accuracy": 0.9313899427652359, "num_tokens": 99535072.0, "step": 8069 }, { "entropy": 1.0539186894893646, "epoch": 4.249605055292259, "grad_norm": 0.27866604924201965, "learning_rate": 8.357682433822257e-05, "loss": 0.17389869689941406, "mean_token_accuracy": 0.9213372319936752, "num_tokens": 99547408.0, "step": 8070 }, { "entropy": 1.0815083235502243, "epoch": 4.2501316482359135, "grad_norm": 0.33380910754203796, "learning_rate": 8.355586318902484e-05, "loss": 0.18013812601566315, "mean_token_accuracy": 0.9280896037817001, "num_tokens": 99559744.0, "step": 8071 }, { "entropy": 1.066886693239212, "epoch": 4.250658241179568, "grad_norm": 0.3224329352378845, "learning_rate": 8.353490360966137e-05, "loss": 0.17354170978069305, "mean_token_accuracy": 0.9260164499282837, "num_tokens": 99572080.0, "step": 8072 }, { "entropy": 1.1515626013278961, "epoch": 4.251184834123222, "grad_norm": 0.295924574136734, "learning_rate": 8.351394560137641e-05, "loss": 0.16896162927150726, "mean_token_accuracy": 0.9296974241733551, "num_tokens": 99584416.0, "step": 8073 }, { "entropy": 1.1497910618782043, "epoch": 4.251711427066877, "grad_norm": 0.29935047030448914, "learning_rate": 8.349298916541415e-05, "loss": 0.1688576340675354, "mean_token_accuracy": 0.9272406250238419, "num_tokens": 99596752.0, "step": 8074 }, { "entropy": 1.1204953491687775, "epoch": 4.252238020010532, "grad_norm": 0.33380720019340515, "learning_rate": 8.347203430301863e-05, "loss": 0.17503707110881805, "mean_token_accuracy": 0.9305144399404526, "num_tokens": 99609088.0, "step": 8075 }, { "entropy": 1.1706304848194122, "epoch": 4.252764612954186, "grad_norm": 0.3090486526489258, "learning_rate": 8.345108101543382e-05, "loss": 0.15380382537841797, "mean_token_accuracy": 0.9374998956918716, "num_tokens": 99621424.0, "step": 8076 }, { "entropy": 1.07712322473526, "epoch": 4.253291205897841, "grad_norm": 0.31502121686935425, "learning_rate": 8.34301293039036e-05, "loss": 0.17999747395515442, "mean_token_accuracy": 0.9227079004049301, "num_tokens": 99633760.0, "step": 8077 }, { "entropy": 1.0868211090564728, "epoch": 4.253817798841496, "grad_norm": 0.31252890825271606, "learning_rate": 8.340917916967171e-05, "loss": 0.17292320728302002, "mean_token_accuracy": 0.9276772290468216, "num_tokens": 99646096.0, "step": 8078 }, { "entropy": 1.1564848721027374, "epoch": 4.25434439178515, "grad_norm": 0.32048600912094116, "learning_rate": 8.338823061398184e-05, "loss": 0.16539078950881958, "mean_token_accuracy": 0.9319958090782166, "num_tokens": 99658432.0, "step": 8079 }, { "entropy": 1.172350913286209, "epoch": 4.254870984728805, "grad_norm": 0.3275053799152374, "learning_rate": 8.336728363807767e-05, "loss": 0.1759481132030487, "mean_token_accuracy": 0.9236879795789719, "num_tokens": 99670768.0, "step": 8080 }, { "entropy": 1.1566478908061981, "epoch": 4.2553975776724595, "grad_norm": 0.3351489305496216, "learning_rate": 8.334633824320264e-05, "loss": 0.18259534239768982, "mean_token_accuracy": 0.9200667142868042, "num_tokens": 99683104.0, "step": 8081 }, { "entropy": 1.1785503327846527, "epoch": 4.2559241706161135, "grad_norm": 0.30122020840644836, "learning_rate": 8.332539443060014e-05, "loss": 0.16306838393211365, "mean_token_accuracy": 0.9354003071784973, "num_tokens": 99695440.0, "step": 8082 }, { "entropy": 1.1457667648792267, "epoch": 4.256450763559768, "grad_norm": 0.3123452365398407, "learning_rate": 8.33044522015135e-05, "loss": 0.1754731982946396, "mean_token_accuracy": 0.9264841824769974, "num_tokens": 99707776.0, "step": 8083 }, { "entropy": 1.118004322052002, "epoch": 4.256977356503423, "grad_norm": 0.29696592688560486, "learning_rate": 8.328351155718597e-05, "loss": 0.16492369771003723, "mean_token_accuracy": 0.9289798140525818, "num_tokens": 99720112.0, "step": 8084 }, { "entropy": 1.1619296073913574, "epoch": 4.257503949447077, "grad_norm": 0.3061583936214447, "learning_rate": 8.326257249886062e-05, "loss": 0.17469191551208496, "mean_token_accuracy": 0.9250694811344147, "num_tokens": 99732448.0, "step": 8085 }, { "entropy": 1.1556996703147888, "epoch": 4.258030542390732, "grad_norm": 0.32471799850463867, "learning_rate": 8.324163502778048e-05, "loss": 0.17089048027992249, "mean_token_accuracy": 0.9294106811285019, "num_tokens": 99744784.0, "step": 8086 }, { "entropy": 1.0968319475650787, "epoch": 4.258557135334387, "grad_norm": 0.29185327887535095, "learning_rate": 8.322069914518853e-05, "loss": 0.1605537384748459, "mean_token_accuracy": 0.933579221367836, "num_tokens": 99757120.0, "step": 8087 }, { "entropy": 1.1535795331001282, "epoch": 4.259083728278041, "grad_norm": 0.32085347175598145, "learning_rate": 8.31997648523276e-05, "loss": 0.16581113636493683, "mean_token_accuracy": 0.9338376224040985, "num_tokens": 99769456.0, "step": 8088 }, { "entropy": 1.1065370440483093, "epoch": 4.259610321221696, "grad_norm": 0.3301770091056824, "learning_rate": 8.317883215044043e-05, "loss": 0.18444573879241943, "mean_token_accuracy": 0.9218945354223251, "num_tokens": 99781792.0, "step": 8089 }, { "entropy": 1.128524899482727, "epoch": 4.26013691416535, "grad_norm": 0.32063019275665283, "learning_rate": 8.315790104076966e-05, "loss": 0.17200259864330292, "mean_token_accuracy": 0.9251203238964081, "num_tokens": 99794128.0, "step": 8090 }, { "entropy": 1.1268632411956787, "epoch": 4.260663507109005, "grad_norm": 0.31877580285072327, "learning_rate": 8.313697152455786e-05, "loss": 0.16964519023895264, "mean_token_accuracy": 0.928652435541153, "num_tokens": 99806464.0, "step": 8091 }, { "entropy": 1.0946198105812073, "epoch": 4.2611901000526595, "grad_norm": 0.3191579282283783, "learning_rate": 8.31160436030475e-05, "loss": 0.15536580979824066, "mean_token_accuracy": 0.936287522315979, "num_tokens": 99818800.0, "step": 8092 }, { "entropy": 1.1416193544864655, "epoch": 4.2617166929963135, "grad_norm": 0.32858961820602417, "learning_rate": 8.309511727748089e-05, "loss": 0.1654105931520462, "mean_token_accuracy": 0.927264392375946, "num_tokens": 99831136.0, "step": 8093 }, { "entropy": 1.1381915807724, "epoch": 4.262243285939968, "grad_norm": 0.33304300904273987, "learning_rate": 8.307419254910039e-05, "loss": 0.17604365944862366, "mean_token_accuracy": 0.9258278459310532, "num_tokens": 99843472.0, "step": 8094 }, { "entropy": 1.1308756172657013, "epoch": 4.262769878883623, "grad_norm": 0.31295496225357056, "learning_rate": 8.305326941914817e-05, "loss": 0.17429137229919434, "mean_token_accuracy": 0.9237045347690582, "num_tokens": 99855808.0, "step": 8095 }, { "entropy": 1.0989869236946106, "epoch": 4.263296471827277, "grad_norm": 0.34125518798828125, "learning_rate": 8.303234788886625e-05, "loss": 0.19118639826774597, "mean_token_accuracy": 0.9206728041172028, "num_tokens": 99868144.0, "step": 8096 }, { "entropy": 1.1231334209442139, "epoch": 4.263823064770932, "grad_norm": 0.31131285429000854, "learning_rate": 8.301142795949668e-05, "loss": 0.16339470446109772, "mean_token_accuracy": 0.933625802397728, "num_tokens": 99880480.0, "step": 8097 }, { "entropy": 1.0876518487930298, "epoch": 4.264349657714587, "grad_norm": 0.3088369369506836, "learning_rate": 8.299050963228133e-05, "loss": 0.17668671905994415, "mean_token_accuracy": 0.9236136674880981, "num_tokens": 99892816.0, "step": 8098 }, { "entropy": 1.0807808935642242, "epoch": 4.264876250658241, "grad_norm": 0.3156672418117523, "learning_rate": 8.296959290846196e-05, "loss": 0.18399551510810852, "mean_token_accuracy": 0.9209917485713959, "num_tokens": 99905152.0, "step": 8099 }, { "entropy": 1.1325292885303497, "epoch": 4.265402843601896, "grad_norm": 0.3002985715866089, "learning_rate": 8.294867778928036e-05, "loss": 0.1714736372232437, "mean_token_accuracy": 0.9298235177993774, "num_tokens": 99917488.0, "step": 8100 }, { "entropy": 1.1102986931800842, "epoch": 4.265929436545551, "grad_norm": 0.31801483035087585, "learning_rate": 8.292776427597806e-05, "loss": 0.17188766598701477, "mean_token_accuracy": 0.925754576921463, "num_tokens": 99929824.0, "step": 8101 }, { "entropy": 1.104709655046463, "epoch": 4.266456029489205, "grad_norm": 0.34049540758132935, "learning_rate": 8.29068523697966e-05, "loss": 0.17808237671852112, "mean_token_accuracy": 0.9203847646713257, "num_tokens": 99942160.0, "step": 8102 }, { "entropy": 1.0856394171714783, "epoch": 4.2669826224328595, "grad_norm": 0.30023178458213806, "learning_rate": 8.288594207197744e-05, "loss": 0.16197536885738373, "mean_token_accuracy": 0.9287407249212265, "num_tokens": 99954496.0, "step": 8103 }, { "entropy": 1.1135685741901398, "epoch": 4.2675092153765135, "grad_norm": 0.3104518949985504, "learning_rate": 8.286503338376186e-05, "loss": 0.1633913815021515, "mean_token_accuracy": 0.9310812950134277, "num_tokens": 99966832.0, "step": 8104 }, { "entropy": 1.1092984676361084, "epoch": 4.268035808320168, "grad_norm": 0.31064674258232117, "learning_rate": 8.28441263063911e-05, "loss": 0.17475390434265137, "mean_token_accuracy": 0.9235182404518127, "num_tokens": 99979168.0, "step": 8105 }, { "entropy": 1.1336276531219482, "epoch": 4.268562401263823, "grad_norm": 0.3191753923892975, "learning_rate": 8.282322084110627e-05, "loss": 0.17750518023967743, "mean_token_accuracy": 0.929021954536438, "num_tokens": 99991504.0, "step": 8106 }, { "entropy": 1.0961753129959106, "epoch": 4.269088994207477, "grad_norm": 0.31571850180625916, "learning_rate": 8.280231698914837e-05, "loss": 0.17665252089500427, "mean_token_accuracy": 0.9285895675420761, "num_tokens": 100003840.0, "step": 8107 }, { "entropy": 1.0950091779232025, "epoch": 4.269615587151132, "grad_norm": 0.27700111269950867, "learning_rate": 8.278141475175844e-05, "loss": 0.15171709656715393, "mean_token_accuracy": 0.936496689915657, "num_tokens": 100016176.0, "step": 8108 }, { "entropy": 1.102284163236618, "epoch": 4.270142180094787, "grad_norm": 0.27984926104545593, "learning_rate": 8.276051413017729e-05, "loss": 0.15890219807624817, "mean_token_accuracy": 0.9340721517801285, "num_tokens": 100028512.0, "step": 8109 }, { "entropy": 1.0916558504104614, "epoch": 4.270668773038441, "grad_norm": 0.32002735137939453, "learning_rate": 8.273961512564566e-05, "loss": 0.1711985170841217, "mean_token_accuracy": 0.9211053550243378, "num_tokens": 100040848.0, "step": 8110 }, { "entropy": 1.1369658708572388, "epoch": 4.271195365982096, "grad_norm": 0.3338232636451721, "learning_rate": 8.271871773940415e-05, "loss": 0.16055558621883392, "mean_token_accuracy": 0.9368612915277481, "num_tokens": 100053184.0, "step": 8111 }, { "entropy": 1.1092744767665863, "epoch": 4.271721958925751, "grad_norm": 0.330318421125412, "learning_rate": 8.26978219726934e-05, "loss": 0.1709112673997879, "mean_token_accuracy": 0.9239360392093658, "num_tokens": 100065520.0, "step": 8112 }, { "entropy": 1.1184650361537933, "epoch": 4.272248551869405, "grad_norm": 0.32604461908340454, "learning_rate": 8.267692782675383e-05, "loss": 0.18035155534744263, "mean_token_accuracy": 0.9268295615911484, "num_tokens": 100077856.0, "step": 8113 }, { "entropy": 1.074916884303093, "epoch": 4.2727751448130595, "grad_norm": 0.3004838228225708, "learning_rate": 8.265603530282576e-05, "loss": 0.16890446841716766, "mean_token_accuracy": 0.9294091016054153, "num_tokens": 100090192.0, "step": 8114 }, { "entropy": 1.0736864805221558, "epoch": 4.273301737756714, "grad_norm": 0.336443156003952, "learning_rate": 8.263514440214952e-05, "loss": 0.1787278950214386, "mean_token_accuracy": 0.9264860451221466, "num_tokens": 100102528.0, "step": 8115 }, { "entropy": 1.1153449714183807, "epoch": 4.273828330700368, "grad_norm": 0.32195696234703064, "learning_rate": 8.261425512596525e-05, "loss": 0.17047405242919922, "mean_token_accuracy": 0.9277778267860413, "num_tokens": 100114864.0, "step": 8116 }, { "entropy": 1.0776326656341553, "epoch": 4.274354923644023, "grad_norm": 0.3388669192790985, "learning_rate": 8.259336747551307e-05, "loss": 0.17405882477760315, "mean_token_accuracy": 0.9185441732406616, "num_tokens": 100127200.0, "step": 8117 }, { "entropy": 1.1092575788497925, "epoch": 4.274881516587678, "grad_norm": 0.3515068292617798, "learning_rate": 8.257248145203291e-05, "loss": 0.18974429368972778, "mean_token_accuracy": 0.918947622179985, "num_tokens": 100139536.0, "step": 8118 }, { "entropy": 1.1126601994037628, "epoch": 4.275408109531332, "grad_norm": 0.33457013964653015, "learning_rate": 8.255159705676467e-05, "loss": 0.17667625844478607, "mean_token_accuracy": 0.9245069324970245, "num_tokens": 100151872.0, "step": 8119 }, { "entropy": 1.0818258821964264, "epoch": 4.275934702474987, "grad_norm": 0.30092358589172363, "learning_rate": 8.253071429094814e-05, "loss": 0.17009970545768738, "mean_token_accuracy": 0.9274181872606277, "num_tokens": 100164208.0, "step": 8120 }, { "entropy": 1.093058466911316, "epoch": 4.276461295418642, "grad_norm": 0.3126024603843689, "learning_rate": 8.250983315582297e-05, "loss": 0.16962504386901855, "mean_token_accuracy": 0.9259705096483231, "num_tokens": 100176544.0, "step": 8121 }, { "entropy": 1.0457747280597687, "epoch": 4.276987888362296, "grad_norm": 0.3177169859409332, "learning_rate": 8.24889536526288e-05, "loss": 0.18231360614299774, "mean_token_accuracy": 0.9204312413930893, "num_tokens": 100188880.0, "step": 8122 }, { "entropy": 1.089835911989212, "epoch": 4.277514481305951, "grad_norm": 0.28656700253486633, "learning_rate": 8.246807578260511e-05, "loss": 0.15455403923988342, "mean_token_accuracy": 0.9351130276918411, "num_tokens": 100201216.0, "step": 8123 }, { "entropy": 1.0800141394138336, "epoch": 4.278041074249605, "grad_norm": 0.31688860058784485, "learning_rate": 8.24471995469913e-05, "loss": 0.17136967182159424, "mean_token_accuracy": 0.9254559725522995, "num_tokens": 100213552.0, "step": 8124 }, { "entropy": 1.0572218894958496, "epoch": 4.2785676671932595, "grad_norm": 0.2976747155189514, "learning_rate": 8.242632494702664e-05, "loss": 0.16170823574066162, "mean_token_accuracy": 0.9315948784351349, "num_tokens": 100225888.0, "step": 8125 }, { "entropy": 1.0977745354175568, "epoch": 4.279094260136914, "grad_norm": 0.31714725494384766, "learning_rate": 8.240545198395038e-05, "loss": 0.1668914258480072, "mean_token_accuracy": 0.9267875403165817, "num_tokens": 100238224.0, "step": 8126 }, { "entropy": 1.0821348428726196, "epoch": 4.279620853080568, "grad_norm": 0.3463470935821533, "learning_rate": 8.238458065900158e-05, "loss": 0.18148234486579895, "mean_token_accuracy": 0.9224915206432343, "num_tokens": 100250560.0, "step": 8127 }, { "entropy": 1.0404681116342545, "epoch": 4.280147446024223, "grad_norm": 0.3089762032032013, "learning_rate": 8.236371097341925e-05, "loss": 0.1620589643716812, "mean_token_accuracy": 0.9293773472309113, "num_tokens": 100262896.0, "step": 8128 }, { "entropy": 1.0546789467334747, "epoch": 4.280674038967878, "grad_norm": 0.311089426279068, "learning_rate": 8.234284292844237e-05, "loss": 0.1701953411102295, "mean_token_accuracy": 0.9255341589450836, "num_tokens": 100275232.0, "step": 8129 }, { "entropy": 1.0441174358129501, "epoch": 4.281200631911532, "grad_norm": 0.297513484954834, "learning_rate": 8.232197652530971e-05, "loss": 0.160035640001297, "mean_token_accuracy": 0.9331898093223572, "num_tokens": 100287568.0, "step": 8130 }, { "entropy": 1.047688141465187, "epoch": 4.281727224855187, "grad_norm": 0.3260231614112854, "learning_rate": 8.230111176525994e-05, "loss": 0.17879530787467957, "mean_token_accuracy": 0.9271712005138397, "num_tokens": 100299904.0, "step": 8131 }, { "entropy": 1.0368105620145798, "epoch": 4.282253817798842, "grad_norm": 0.33203935623168945, "learning_rate": 8.228024864953177e-05, "loss": 0.1704830527305603, "mean_token_accuracy": 0.924525648355484, "num_tokens": 100312240.0, "step": 8132 }, { "entropy": 1.0623641312122345, "epoch": 4.282780410742496, "grad_norm": 0.28985536098480225, "learning_rate": 8.225938717936363e-05, "loss": 0.16252949833869934, "mean_token_accuracy": 0.9282232373952866, "num_tokens": 100324576.0, "step": 8133 }, { "entropy": 1.0668547749519348, "epoch": 4.283307003686151, "grad_norm": 0.3509078621864319, "learning_rate": 8.223852735599402e-05, "loss": 0.18604707717895508, "mean_token_accuracy": 0.9223463833332062, "num_tokens": 100336912.0, "step": 8134 }, { "entropy": 1.0122692286968231, "epoch": 4.283833596629806, "grad_norm": 0.33317187428474426, "learning_rate": 8.22176691806612e-05, "loss": 0.1752258837223053, "mean_token_accuracy": 0.9266980290412903, "num_tokens": 100349248.0, "step": 8135 }, { "entropy": 1.0725390017032623, "epoch": 4.2843601895734595, "grad_norm": 0.3354742228984833, "learning_rate": 8.219681265460347e-05, "loss": 0.17461788654327393, "mean_token_accuracy": 0.9295875281095505, "num_tokens": 100361584.0, "step": 8136 }, { "entropy": 1.0339740365743637, "epoch": 4.284886782517114, "grad_norm": 0.33746543526649475, "learning_rate": 8.217595777905891e-05, "loss": 0.17826615273952484, "mean_token_accuracy": 0.9233043342828751, "num_tokens": 100373920.0, "step": 8137 }, { "entropy": 1.0048495382070541, "epoch": 4.285413375460768, "grad_norm": 0.3237973153591156, "learning_rate": 8.215510455526558e-05, "loss": 0.1711120903491974, "mean_token_accuracy": 0.9247938394546509, "num_tokens": 100386256.0, "step": 8138 }, { "entropy": 1.0556179583072662, "epoch": 4.285939968404423, "grad_norm": 0.329245924949646, "learning_rate": 8.213425298446138e-05, "loss": 0.18409737944602966, "mean_token_accuracy": 0.9237063080072403, "num_tokens": 100398592.0, "step": 8139 }, { "entropy": 0.998849630355835, "epoch": 4.286466561348078, "grad_norm": 0.2911140024662018, "learning_rate": 8.21134030678842e-05, "loss": 0.166805699467659, "mean_token_accuracy": 0.9282380193471909, "num_tokens": 100410928.0, "step": 8140 }, { "entropy": 1.0545998513698578, "epoch": 4.286993154291732, "grad_norm": 0.31316500902175903, "learning_rate": 8.209255480677172e-05, "loss": 0.16142991185188293, "mean_token_accuracy": 0.9323518574237823, "num_tokens": 100423264.0, "step": 8141 }, { "entropy": 1.0759258568286896, "epoch": 4.287519747235387, "grad_norm": 0.3297795057296753, "learning_rate": 8.207170820236156e-05, "loss": 0.16118834912776947, "mean_token_accuracy": 0.930723175406456, "num_tokens": 100435600.0, "step": 8142 }, { "entropy": 1.059980496764183, "epoch": 4.288046340179042, "grad_norm": 0.33654120564460754, "learning_rate": 8.205086325589135e-05, "loss": 0.1766843944787979, "mean_token_accuracy": 0.9282799512147903, "num_tokens": 100447936.0, "step": 8143 }, { "entropy": 1.0725449323654175, "epoch": 4.288572933122696, "grad_norm": 0.2979128956794739, "learning_rate": 8.203001996859851e-05, "loss": 0.17614522576332092, "mean_token_accuracy": 0.9281874150037766, "num_tokens": 100460272.0, "step": 8144 }, { "entropy": 1.0823680460453033, "epoch": 4.289099526066351, "grad_norm": 0.3079119026660919, "learning_rate": 8.200917834172033e-05, "loss": 0.1636887639760971, "mean_token_accuracy": 0.9274661689996719, "num_tokens": 100472608.0, "step": 8145 }, { "entropy": 1.086853265762329, "epoch": 4.289626119010006, "grad_norm": 0.2915719151496887, "learning_rate": 8.198833837649412e-05, "loss": 0.1665974259376526, "mean_token_accuracy": 0.9324109107255936, "num_tokens": 100484944.0, "step": 8146 }, { "entropy": 1.0810329616069794, "epoch": 4.2901527119536595, "grad_norm": 0.35588109493255615, "learning_rate": 8.196750007415697e-05, "loss": 0.2031797468662262, "mean_token_accuracy": 0.9193731099367142, "num_tokens": 100497280.0, "step": 8147 }, { "entropy": 1.1038683354854584, "epoch": 4.290679304897314, "grad_norm": 0.2943333387374878, "learning_rate": 8.194666343594597e-05, "loss": 0.15437810122966766, "mean_token_accuracy": 0.9334327727556229, "num_tokens": 100509616.0, "step": 8148 }, { "entropy": 1.0905348658561707, "epoch": 4.291205897840969, "grad_norm": 0.2971420884132385, "learning_rate": 8.192582846309802e-05, "loss": 0.16804301738739014, "mean_token_accuracy": 0.9282435178756714, "num_tokens": 100521952.0, "step": 8149 }, { "entropy": 1.0975285172462463, "epoch": 4.291732490784623, "grad_norm": 0.30539795756340027, "learning_rate": 8.190499515685001e-05, "loss": 0.1692083477973938, "mean_token_accuracy": 0.928924560546875, "num_tokens": 100534288.0, "step": 8150 }, { "entropy": 1.1452202200889587, "epoch": 4.292259083728278, "grad_norm": 0.326580286026001, "learning_rate": 8.188416351843873e-05, "loss": 0.1752394288778305, "mean_token_accuracy": 0.9249264299869537, "num_tokens": 100546624.0, "step": 8151 }, { "entropy": 1.098305195569992, "epoch": 4.292785676671933, "grad_norm": 0.30398303270339966, "learning_rate": 8.186333354910076e-05, "loss": 0.16921615600585938, "mean_token_accuracy": 0.9286245256662369, "num_tokens": 100558960.0, "step": 8152 }, { "entropy": 1.1302293241024017, "epoch": 4.293312269615587, "grad_norm": 0.3367408812046051, "learning_rate": 8.18425052500727e-05, "loss": 0.17959974706172943, "mean_token_accuracy": 0.9232142269611359, "num_tokens": 100571296.0, "step": 8153 }, { "entropy": 1.132985681295395, "epoch": 4.293838862559242, "grad_norm": 0.3377591669559479, "learning_rate": 8.182167862259098e-05, "loss": 0.18186485767364502, "mean_token_accuracy": 0.9227332919836044, "num_tokens": 100583632.0, "step": 8154 }, { "entropy": 1.086346834897995, "epoch": 4.294365455502897, "grad_norm": 0.29264533519744873, "learning_rate": 8.180085366789199e-05, "loss": 0.1761588454246521, "mean_token_accuracy": 0.9259068518877029, "num_tokens": 100595968.0, "step": 8155 }, { "entropy": 1.1045507341623306, "epoch": 4.294892048446551, "grad_norm": 0.3215351402759552, "learning_rate": 8.178003038721189e-05, "loss": 0.17329712212085724, "mean_token_accuracy": 0.9306823462247849, "num_tokens": 100608304.0, "step": 8156 }, { "entropy": 1.120214581489563, "epoch": 4.295418641390206, "grad_norm": 0.30607500672340393, "learning_rate": 8.175920878178696e-05, "loss": 0.16385003924369812, "mean_token_accuracy": 0.9280714094638824, "num_tokens": 100620640.0, "step": 8157 }, { "entropy": 1.1060186922550201, "epoch": 4.2959452343338596, "grad_norm": 0.3463023900985718, "learning_rate": 8.17383888528532e-05, "loss": 0.18140186369419098, "mean_token_accuracy": 0.9217744767665863, "num_tokens": 100632976.0, "step": 8158 }, { "entropy": 1.11289843916893, "epoch": 4.296471827277514, "grad_norm": 0.3010319471359253, "learning_rate": 8.17175706016466e-05, "loss": 0.17120137810707092, "mean_token_accuracy": 0.9283831566572189, "num_tokens": 100645312.0, "step": 8159 }, { "entropy": 1.0737940967082977, "epoch": 4.296998420221169, "grad_norm": 0.29794272780418396, "learning_rate": 8.169675402940296e-05, "loss": 0.1645357608795166, "mean_token_accuracy": 0.9277155101299286, "num_tokens": 100657648.0, "step": 8160 }, { "entropy": 1.10798978805542, "epoch": 4.297525013164823, "grad_norm": 0.3176315724849701, "learning_rate": 8.167593913735807e-05, "loss": 0.17072540521621704, "mean_token_accuracy": 0.9245764017105103, "num_tokens": 100669984.0, "step": 8161 }, { "entropy": 1.0653933882713318, "epoch": 4.298051606108478, "grad_norm": 0.2844933867454529, "learning_rate": 8.16551259267476e-05, "loss": 0.162329763174057, "mean_token_accuracy": 0.9278407990932465, "num_tokens": 100682320.0, "step": 8162 }, { "entropy": 1.126930981874466, "epoch": 4.298578199052133, "grad_norm": 0.3100861608982086, "learning_rate": 8.163431439880706e-05, "loss": 0.1709498018026352, "mean_token_accuracy": 0.9280589818954468, "num_tokens": 100694656.0, "step": 8163 }, { "entropy": 1.1281602084636688, "epoch": 4.299104791995787, "grad_norm": 0.3464886546134949, "learning_rate": 8.161350455477197e-05, "loss": 0.17898613214492798, "mean_token_accuracy": 0.9198716878890991, "num_tokens": 100706992.0, "step": 8164 }, { "entropy": 1.0705135464668274, "epoch": 4.299631384939442, "grad_norm": 0.292278915643692, "learning_rate": 8.159269639587768e-05, "loss": 0.16062796115875244, "mean_token_accuracy": 0.9355687946081161, "num_tokens": 100719328.0, "step": 8165 }, { "entropy": 1.1133157908916473, "epoch": 4.300157977883097, "grad_norm": 0.30878230929374695, "learning_rate": 8.157188992335942e-05, "loss": 0.1541077047586441, "mean_token_accuracy": 0.9316331744194031, "num_tokens": 100731664.0, "step": 8166 }, { "entropy": 1.1160552203655243, "epoch": 4.300684570826751, "grad_norm": 0.33631134033203125, "learning_rate": 8.155108513845238e-05, "loss": 0.16401691734790802, "mean_token_accuracy": 0.9292161464691162, "num_tokens": 100744000.0, "step": 8167 }, { "entropy": 1.106523036956787, "epoch": 4.301211163770406, "grad_norm": 0.368388831615448, "learning_rate": 8.153028204239157e-05, "loss": 0.1936802864074707, "mean_token_accuracy": 0.9172158390283585, "num_tokens": 100756336.0, "step": 8168 }, { "entropy": 1.1062554717063904, "epoch": 4.3017377567140604, "grad_norm": 0.3216768503189087, "learning_rate": 8.150948063641201e-05, "loss": 0.16468966007232666, "mean_token_accuracy": 0.9298742860555649, "num_tokens": 100768672.0, "step": 8169 }, { "entropy": 1.0903112590312958, "epoch": 4.302264349657714, "grad_norm": 0.3083604872226715, "learning_rate": 8.14886809217485e-05, "loss": 0.16503220796585083, "mean_token_accuracy": 0.9277413338422775, "num_tokens": 100781008.0, "step": 8170 }, { "entropy": 1.1245929300785065, "epoch": 4.302790942601369, "grad_norm": 0.3205699324607849, "learning_rate": 8.146788289963585e-05, "loss": 0.16636714339256287, "mean_token_accuracy": 0.9310216158628464, "num_tokens": 100793344.0, "step": 8171 }, { "entropy": 1.1266671121120453, "epoch": 4.303317535545023, "grad_norm": 0.33314967155456543, "learning_rate": 8.144708657130868e-05, "loss": 0.16889874637126923, "mean_token_accuracy": 0.933164969086647, "num_tokens": 100805680.0, "step": 8172 }, { "entropy": 1.1593082547187805, "epoch": 4.303844128488678, "grad_norm": 0.3262190818786621, "learning_rate": 8.142629193800158e-05, "loss": 0.17436131834983826, "mean_token_accuracy": 0.9216962605714798, "num_tokens": 100818016.0, "step": 8173 }, { "entropy": 1.1116544306278229, "epoch": 4.304370721432333, "grad_norm": 0.31282833218574524, "learning_rate": 8.1405499000949e-05, "loss": 0.1572895646095276, "mean_token_accuracy": 0.9315769672393799, "num_tokens": 100830352.0, "step": 8174 }, { "entropy": 1.1222815811634064, "epoch": 4.304897314375987, "grad_norm": 0.2925593852996826, "learning_rate": 8.138470776138527e-05, "loss": 0.16084107756614685, "mean_token_accuracy": 0.933529332280159, "num_tokens": 100842688.0, "step": 8175 }, { "entropy": 1.0700201392173767, "epoch": 4.305423907319642, "grad_norm": 0.3212798535823822, "learning_rate": 8.136391822054466e-05, "loss": 0.17239071428775787, "mean_token_accuracy": 0.928302064538002, "num_tokens": 100855024.0, "step": 8176 }, { "entropy": 1.171550303697586, "epoch": 4.305950500263297, "grad_norm": 0.3465503752231598, "learning_rate": 8.134313037966126e-05, "loss": 0.16142232716083527, "mean_token_accuracy": 0.9277971833944321, "num_tokens": 100867360.0, "step": 8177 }, { "entropy": 1.1796109676361084, "epoch": 4.306477093206951, "grad_norm": 0.31742334365844727, "learning_rate": 8.132234423996924e-05, "loss": 0.1670718491077423, "mean_token_accuracy": 0.927848294377327, "num_tokens": 100879696.0, "step": 8178 }, { "entropy": 1.130541980266571, "epoch": 4.307003686150606, "grad_norm": 0.31697362661361694, "learning_rate": 8.130155980270251e-05, "loss": 0.16957148909568787, "mean_token_accuracy": 0.9272715300321579, "num_tokens": 100892032.0, "step": 8179 }, { "entropy": 1.090952455997467, "epoch": 4.3075302790942605, "grad_norm": 0.3405947983264923, "learning_rate": 8.12807770690949e-05, "loss": 0.18022146821022034, "mean_token_accuracy": 0.9248402118682861, "num_tokens": 100904368.0, "step": 8180 }, { "entropy": 1.123077630996704, "epoch": 4.308056872037914, "grad_norm": 0.32419994473457336, "learning_rate": 8.125999604038015e-05, "loss": 0.16609665751457214, "mean_token_accuracy": 0.9302123636007309, "num_tokens": 100916704.0, "step": 8181 }, { "entropy": 1.1256820559501648, "epoch": 4.308583464981569, "grad_norm": 0.3087804615497589, "learning_rate": 8.123921671779193e-05, "loss": 0.17110829055309296, "mean_token_accuracy": 0.9277935028076172, "num_tokens": 100929040.0, "step": 8182 }, { "entropy": 1.1385431289672852, "epoch": 4.309110057925224, "grad_norm": 0.3376697599887848, "learning_rate": 8.121843910256379e-05, "loss": 0.17482459545135498, "mean_token_accuracy": 0.924680083990097, "num_tokens": 100941376.0, "step": 8183 }, { "entropy": 1.1289255023002625, "epoch": 4.309636650868878, "grad_norm": 0.29189300537109375, "learning_rate": 8.119766319592917e-05, "loss": 0.17363496124744415, "mean_token_accuracy": 0.9293947070837021, "num_tokens": 100953712.0, "step": 8184 }, { "entropy": 1.1921924948692322, "epoch": 4.310163243812533, "grad_norm": 0.3469204008579254, "learning_rate": 8.11768889991214e-05, "loss": 0.195139542222023, "mean_token_accuracy": 0.9169978052377701, "num_tokens": 100966048.0, "step": 8185 }, { "entropy": 1.1126163601875305, "epoch": 4.310689836756188, "grad_norm": 0.27752256393432617, "learning_rate": 8.115611651337373e-05, "loss": 0.1593462973833084, "mean_token_accuracy": 0.931410163640976, "num_tokens": 100978384.0, "step": 8186 }, { "entropy": 1.1427457630634308, "epoch": 4.311216429699842, "grad_norm": 0.3243776559829712, "learning_rate": 8.113534573991932e-05, "loss": 0.17774705588817596, "mean_token_accuracy": 0.9292377531528473, "num_tokens": 100990720.0, "step": 8187 }, { "entropy": 1.1437013745307922, "epoch": 4.311743022643497, "grad_norm": 0.3289145529270172, "learning_rate": 8.111457667999123e-05, "loss": 0.18479706346988678, "mean_token_accuracy": 0.9234186708927155, "num_tokens": 101003056.0, "step": 8188 }, { "entropy": 1.1382064819335938, "epoch": 4.312269615587151, "grad_norm": 0.3195880651473999, "learning_rate": 8.109380933482234e-05, "loss": 0.18417364358901978, "mean_token_accuracy": 0.9193008244037628, "num_tokens": 101015392.0, "step": 8189 }, { "entropy": 1.1460935473442078, "epoch": 4.312796208530806, "grad_norm": 0.313053160905838, "learning_rate": 8.10730437056455e-05, "loss": 0.169764444231987, "mean_token_accuracy": 0.9266730397939682, "num_tokens": 101027728.0, "step": 8190 }, { "entropy": 1.1244223415851593, "epoch": 4.3133228014744605, "grad_norm": 0.3006483018398285, "learning_rate": 8.105227979369343e-05, "loss": 0.1739342212677002, "mean_token_accuracy": 0.9234243780374527, "num_tokens": 101040064.0, "step": 8191 }, { "entropy": 1.0908695459365845, "epoch": 4.313849394418114, "grad_norm": 0.28290775418281555, "learning_rate": 8.103151760019883e-05, "loss": 0.1659098118543625, "mean_token_accuracy": 0.9311094582080841, "num_tokens": 101052400.0, "step": 8192 }, { "entropy": 1.1070260107517242, "epoch": 4.314375987361769, "grad_norm": 0.2765958309173584, "learning_rate": 8.101075712639418e-05, "loss": 0.15549322962760925, "mean_token_accuracy": 0.9331227988004684, "num_tokens": 101064736.0, "step": 8193 }, { "entropy": 1.1252348721027374, "epoch": 4.314902580305424, "grad_norm": 0.31335318088531494, "learning_rate": 8.098999837351193e-05, "loss": 0.17366810142993927, "mean_token_accuracy": 0.9225934594869614, "num_tokens": 101077072.0, "step": 8194 }, { "entropy": 1.1199999153614044, "epoch": 4.315429173249078, "grad_norm": 0.32513147592544556, "learning_rate": 8.096924134278438e-05, "loss": 0.18315058946609497, "mean_token_accuracy": 0.9197819530963898, "num_tokens": 101089408.0, "step": 8195 }, { "entropy": 1.0830354988574982, "epoch": 4.315955766192733, "grad_norm": 0.3034358322620392, "learning_rate": 8.094848603544376e-05, "loss": 0.17146772146224976, "mean_token_accuracy": 0.9262642115354538, "num_tokens": 101101744.0, "step": 8196 }, { "entropy": 1.1177780628204346, "epoch": 4.316482359136388, "grad_norm": 0.3099781274795532, "learning_rate": 8.092773245272223e-05, "loss": 0.16914069652557373, "mean_token_accuracy": 0.92646524310112, "num_tokens": 101114080.0, "step": 8197 }, { "entropy": 1.1332667469978333, "epoch": 4.317008952080042, "grad_norm": 0.32865744829177856, "learning_rate": 8.090698059585174e-05, "loss": 0.17182783782482147, "mean_token_accuracy": 0.9264388978481293, "num_tokens": 101126416.0, "step": 8198 }, { "entropy": 1.1120539903640747, "epoch": 4.317535545023697, "grad_norm": 0.3232680857181549, "learning_rate": 8.088623046606425e-05, "loss": 0.18395736813545227, "mean_token_accuracy": 0.9195074439048767, "num_tokens": 101138752.0, "step": 8199 }, { "entropy": 1.100280076265335, "epoch": 4.318062137967352, "grad_norm": 0.31531259417533875, "learning_rate": 8.086548206459157e-05, "loss": 0.17667675018310547, "mean_token_accuracy": 0.9256656914949417, "num_tokens": 101151088.0, "step": 8200 }, { "entropy": 1.0641197562217712, "epoch": 4.318588730911006, "grad_norm": 0.2955949306488037, "learning_rate": 8.084473539266544e-05, "loss": 0.18040215969085693, "mean_token_accuracy": 0.9200959354639053, "num_tokens": 101163424.0, "step": 8201 }, { "entropy": 1.1014371812343597, "epoch": 4.3191153238546605, "grad_norm": 0.3408636748790741, "learning_rate": 8.08239904515174e-05, "loss": 0.1776238977909088, "mean_token_accuracy": 0.9219309389591217, "num_tokens": 101175760.0, "step": 8202 }, { "entropy": 1.0921312868595123, "epoch": 4.319641916798314, "grad_norm": 0.301546186208725, "learning_rate": 8.080324724237904e-05, "loss": 0.16484412550926208, "mean_token_accuracy": 0.9259563833475113, "num_tokens": 101188096.0, "step": 8203 }, { "entropy": 1.1107077896595001, "epoch": 4.320168509741969, "grad_norm": 0.3042460083961487, "learning_rate": 8.078250576648171e-05, "loss": 0.15505820512771606, "mean_token_accuracy": 0.9346891492605209, "num_tokens": 101200432.0, "step": 8204 }, { "entropy": 1.110642284154892, "epoch": 4.320695102685624, "grad_norm": 0.2894485890865326, "learning_rate": 8.076176602505667e-05, "loss": 0.16648268699645996, "mean_token_accuracy": 0.9282403737306595, "num_tokens": 101212768.0, "step": 8205 }, { "entropy": 1.0758769810199738, "epoch": 4.321221695629278, "grad_norm": 0.29397353529930115, "learning_rate": 8.07410280193352e-05, "loss": 0.15893948078155518, "mean_token_accuracy": 0.936321809887886, "num_tokens": 101225104.0, "step": 8206 }, { "entropy": 1.1222665905952454, "epoch": 4.321748288572933, "grad_norm": 0.3513292968273163, "learning_rate": 8.07202917505484e-05, "loss": 0.18077202141284943, "mean_token_accuracy": 0.924056202173233, "num_tokens": 101237440.0, "step": 8207 }, { "entropy": 1.130362629890442, "epoch": 4.322274881516588, "grad_norm": 0.3298923671245575, "learning_rate": 8.069955721992719e-05, "loss": 0.18404030799865723, "mean_token_accuracy": 0.9224449396133423, "num_tokens": 101249776.0, "step": 8208 }, { "entropy": 1.096226155757904, "epoch": 4.322801474460242, "grad_norm": 0.32115793228149414, "learning_rate": 8.067882442870249e-05, "loss": 0.18709102272987366, "mean_token_accuracy": 0.9188259690999985, "num_tokens": 101262112.0, "step": 8209 }, { "entropy": 1.0604323893785477, "epoch": 4.323328067403897, "grad_norm": 0.30055803060531616, "learning_rate": 8.065809337810508e-05, "loss": 0.15584015846252441, "mean_token_accuracy": 0.9344631284475327, "num_tokens": 101274448.0, "step": 8210 }, { "entropy": 1.1120015680789948, "epoch": 4.323854660347552, "grad_norm": 0.3131413459777832, "learning_rate": 8.063736406936566e-05, "loss": 0.17670822143554688, "mean_token_accuracy": 0.9243551790714264, "num_tokens": 101286784.0, "step": 8211 }, { "entropy": 1.0935775637626648, "epoch": 4.324381253291206, "grad_norm": 0.3220430016517639, "learning_rate": 8.061663650371478e-05, "loss": 0.17674963176250458, "mean_token_accuracy": 0.9223094582557678, "num_tokens": 101299120.0, "step": 8212 }, { "entropy": 1.0746557414531708, "epoch": 4.3249078462348605, "grad_norm": 0.32474976778030396, "learning_rate": 8.059591068238295e-05, "loss": 0.16875208914279938, "mean_token_accuracy": 0.9258905351161957, "num_tokens": 101311456.0, "step": 8213 }, { "entropy": 1.0265684574842453, "epoch": 4.325434439178515, "grad_norm": 0.29002878069877625, "learning_rate": 8.05751866066005e-05, "loss": 0.16856175661087036, "mean_token_accuracy": 0.931471049785614, "num_tokens": 101323792.0, "step": 8214 }, { "entropy": 1.0913830697536469, "epoch": 4.325961032122169, "grad_norm": 0.31670016050338745, "learning_rate": 8.055446427759776e-05, "loss": 0.17259293794631958, "mean_token_accuracy": 0.9279854148626328, "num_tokens": 101336128.0, "step": 8215 }, { "entropy": 1.1229613423347473, "epoch": 4.326487625065824, "grad_norm": 0.3105393946170807, "learning_rate": 8.053374369660485e-05, "loss": 0.17131748795509338, "mean_token_accuracy": 0.9297657907009125, "num_tokens": 101348464.0, "step": 8216 }, { "entropy": 1.1170935332775116, "epoch": 4.327014218009479, "grad_norm": 0.3121127784252167, "learning_rate": 8.051302486485179e-05, "loss": 0.16797514259815216, "mean_token_accuracy": 0.9313868284225464, "num_tokens": 101360800.0, "step": 8217 }, { "entropy": 1.1099775731563568, "epoch": 4.327540810953133, "grad_norm": 0.3253271281719208, "learning_rate": 8.049230778356864e-05, "loss": 0.18405406177043915, "mean_token_accuracy": 0.9198083132505417, "num_tokens": 101373136.0, "step": 8218 }, { "entropy": 1.0884588360786438, "epoch": 4.328067403896788, "grad_norm": 0.316718190908432, "learning_rate": 8.047159245398512e-05, "loss": 0.16955435276031494, "mean_token_accuracy": 0.9275417774915695, "num_tokens": 101385472.0, "step": 8219 }, { "entropy": 1.0748783946037292, "epoch": 4.328593996840443, "grad_norm": 0.29072773456573486, "learning_rate": 8.045087887733109e-05, "loss": 0.1633455902338028, "mean_token_accuracy": 0.9305248558521271, "num_tokens": 101397808.0, "step": 8220 }, { "entropy": 1.1298742890357971, "epoch": 4.329120589784097, "grad_norm": 0.3651246428489685, "learning_rate": 8.043016705483617e-05, "loss": 0.18680410087108612, "mean_token_accuracy": 0.9223460257053375, "num_tokens": 101410144.0, "step": 8221 }, { "entropy": 1.1025915145874023, "epoch": 4.329647182727752, "grad_norm": 0.33131837844848633, "learning_rate": 8.04094569877299e-05, "loss": 0.18216900527477264, "mean_token_accuracy": 0.9213276356458664, "num_tokens": 101422480.0, "step": 8222 }, { "entropy": 1.1199238896369934, "epoch": 4.330173775671406, "grad_norm": 0.30368417501449585, "learning_rate": 8.038874867724169e-05, "loss": 0.16693207621574402, "mean_token_accuracy": 0.9274206012487411, "num_tokens": 101434816.0, "step": 8223 }, { "entropy": 1.0599284619092941, "epoch": 4.3307003686150605, "grad_norm": 0.2972218990325928, "learning_rate": 8.036804212460085e-05, "loss": 0.1491440236568451, "mean_token_accuracy": 0.939417839050293, "num_tokens": 101447152.0, "step": 8224 }, { "entropy": 1.1089601516723633, "epoch": 4.331226961558715, "grad_norm": 0.42216140031814575, "learning_rate": 8.034733733103667e-05, "loss": 0.17708426713943481, "mean_token_accuracy": 0.922296941280365, "num_tokens": 101459488.0, "step": 8225 }, { "entropy": 1.1045544743537903, "epoch": 4.331753554502369, "grad_norm": 0.33001288771629333, "learning_rate": 8.03266342977782e-05, "loss": 0.16404478251934052, "mean_token_accuracy": 0.9315997511148453, "num_tokens": 101471824.0, "step": 8226 }, { "entropy": 1.053360790014267, "epoch": 4.332280147446024, "grad_norm": 0.2918814420700073, "learning_rate": 8.030593302605455e-05, "loss": 0.1530412882566452, "mean_token_accuracy": 0.9319270551204681, "num_tokens": 101484160.0, "step": 8227 }, { "entropy": 1.090760126709938, "epoch": 4.332806740389679, "grad_norm": 0.32294756174087524, "learning_rate": 8.028523351709459e-05, "loss": 0.1628977656364441, "mean_token_accuracy": 0.9272487610578537, "num_tokens": 101496496.0, "step": 8228 }, { "entropy": 1.0790897905826569, "epoch": 4.333333333333333, "grad_norm": 0.28238362073898315, "learning_rate": 8.026453577212709e-05, "loss": 0.14742904901504517, "mean_token_accuracy": 0.9376995116472244, "num_tokens": 101508832.0, "step": 8229 }, { "entropy": 1.1392150819301605, "epoch": 4.333859926276988, "grad_norm": 0.30798256397247314, "learning_rate": 8.024383979238082e-05, "loss": 0.1569814682006836, "mean_token_accuracy": 0.9336879998445511, "num_tokens": 101521168.0, "step": 8230 }, { "entropy": 1.0673526525497437, "epoch": 4.334386519220643, "grad_norm": 0.31136372685432434, "learning_rate": 8.022314557908433e-05, "loss": 0.17883369326591492, "mean_token_accuracy": 0.9270809441804886, "num_tokens": 101533504.0, "step": 8231 }, { "entropy": 1.0603607296943665, "epoch": 4.334913112164297, "grad_norm": 0.31112179160118103, "learning_rate": 8.020245313346615e-05, "loss": 0.16724520921707153, "mean_token_accuracy": 0.9250359982252121, "num_tokens": 101545840.0, "step": 8232 }, { "entropy": 1.132779985666275, "epoch": 4.335439705107952, "grad_norm": 0.3429107069969177, "learning_rate": 8.018176245675462e-05, "loss": 0.1782541573047638, "mean_token_accuracy": 0.9295335859060287, "num_tokens": 101558176.0, "step": 8233 }, { "entropy": 1.0894978046417236, "epoch": 4.3359662980516065, "grad_norm": 0.3060559630393982, "learning_rate": 8.016107355017808e-05, "loss": 0.16454628109931946, "mean_token_accuracy": 0.933361291885376, "num_tokens": 101570512.0, "step": 8234 }, { "entropy": 1.0907858908176422, "epoch": 4.3364928909952605, "grad_norm": 0.29935285449028015, "learning_rate": 8.014038641496471e-05, "loss": 0.1586533635854721, "mean_token_accuracy": 0.9328591227531433, "num_tokens": 101582848.0, "step": 8235 }, { "entropy": 1.1055465936660767, "epoch": 4.337019483938915, "grad_norm": 0.28609541058540344, "learning_rate": 8.011970105234254e-05, "loss": 0.164537712931633, "mean_token_accuracy": 0.9320068061351776, "num_tokens": 101595184.0, "step": 8236 }, { "entropy": 1.0481821596622467, "epoch": 4.337546076882569, "grad_norm": 0.2869083881378174, "learning_rate": 8.00990174635396e-05, "loss": 0.16271764039993286, "mean_token_accuracy": 0.9291568249464035, "num_tokens": 101607520.0, "step": 8237 }, { "entropy": 1.0833254307508469, "epoch": 4.338072669826224, "grad_norm": 0.30742931365966797, "learning_rate": 8.007833564978368e-05, "loss": 0.16880999505519867, "mean_token_accuracy": 0.9294129312038422, "num_tokens": 101619856.0, "step": 8238 }, { "entropy": 1.0962770581245422, "epoch": 4.338599262769879, "grad_norm": 0.3189244568347931, "learning_rate": 8.005765561230259e-05, "loss": 0.1695052683353424, "mean_token_accuracy": 0.9264257550239563, "num_tokens": 101632192.0, "step": 8239 }, { "entropy": 1.1270262598991394, "epoch": 4.339125855713533, "grad_norm": 0.29804810881614685, "learning_rate": 8.003697735232391e-05, "loss": 0.17976202070713043, "mean_token_accuracy": 0.9248080998659134, "num_tokens": 101644528.0, "step": 8240 }, { "entropy": 1.0901038348674774, "epoch": 4.339652448657188, "grad_norm": 0.290440171957016, "learning_rate": 8.001630087107533e-05, "loss": 0.15589408576488495, "mean_token_accuracy": 0.9316317737102509, "num_tokens": 101656864.0, "step": 8241 }, { "entropy": 1.0958742499351501, "epoch": 4.340179041600843, "grad_norm": 0.29598626494407654, "learning_rate": 7.999562616978418e-05, "loss": 0.16408175230026245, "mean_token_accuracy": 0.9289140403270721, "num_tokens": 101669200.0, "step": 8242 }, { "entropy": 1.1210950911045074, "epoch": 4.340705634544497, "grad_norm": 0.27935031056404114, "learning_rate": 7.99749532496778e-05, "loss": 0.14974689483642578, "mean_token_accuracy": 0.9354144334793091, "num_tokens": 101681536.0, "step": 8243 }, { "entropy": 1.1266154646873474, "epoch": 4.341232227488152, "grad_norm": 0.3143881559371948, "learning_rate": 7.99542821119835e-05, "loss": 0.1778939664363861, "mean_token_accuracy": 0.9241852015256882, "num_tokens": 101693872.0, "step": 8244 }, { "entropy": 1.1384577751159668, "epoch": 4.3417588204318065, "grad_norm": 0.342058002948761, "learning_rate": 7.993361275792832e-05, "loss": 0.179581880569458, "mean_token_accuracy": 0.9234207570552826, "num_tokens": 101706208.0, "step": 8245 }, { "entropy": 1.139938086271286, "epoch": 4.3422854133754605, "grad_norm": 0.3223731815814972, "learning_rate": 7.99129451887393e-05, "loss": 0.1684388965368271, "mean_token_accuracy": 0.927556499838829, "num_tokens": 101718544.0, "step": 8246 }, { "entropy": 1.1553017795085907, "epoch": 4.342812006319115, "grad_norm": 0.3298601508140564, "learning_rate": 7.989227940564337e-05, "loss": 0.17502903938293457, "mean_token_accuracy": 0.9261777848005295, "num_tokens": 101730880.0, "step": 8247 }, { "entropy": 1.1250576972961426, "epoch": 4.34333859926277, "grad_norm": 0.30573534965515137, "learning_rate": 7.987161540986733e-05, "loss": 0.1717490255832672, "mean_token_accuracy": 0.9294047057628632, "num_tokens": 101743216.0, "step": 8248 }, { "entropy": 1.1117684543132782, "epoch": 4.343865192206424, "grad_norm": 0.3257971704006195, "learning_rate": 7.985095320263789e-05, "loss": 0.17920038104057312, "mean_token_accuracy": 0.9236772358417511, "num_tokens": 101755552.0, "step": 8249 }, { "entropy": 1.082334816455841, "epoch": 4.344391785150079, "grad_norm": 0.31119608879089355, "learning_rate": 7.983029278518164e-05, "loss": 0.17083615064620972, "mean_token_accuracy": 0.9256705492734909, "num_tokens": 101767888.0, "step": 8250 }, { "entropy": 1.1682907044887543, "epoch": 4.344918378093734, "grad_norm": 0.3243691623210907, "learning_rate": 7.980963415872504e-05, "loss": 0.16943079233169556, "mean_token_accuracy": 0.9284241944551468, "num_tokens": 101780224.0, "step": 8251 }, { "entropy": 1.0876426696777344, "epoch": 4.345444971037388, "grad_norm": 0.26470980048179626, "learning_rate": 7.978897732449456e-05, "loss": 0.14852547645568848, "mean_token_accuracy": 0.9360248148441315, "num_tokens": 101792560.0, "step": 8252 }, { "entropy": 1.0622229874134064, "epoch": 4.345971563981043, "grad_norm": 0.2839398682117462, "learning_rate": 7.976832228371636e-05, "loss": 0.1672789752483368, "mean_token_accuracy": 0.9297099262475967, "num_tokens": 101804896.0, "step": 8253 }, { "entropy": 1.151972770690918, "epoch": 4.346498156924698, "grad_norm": 0.29570528864860535, "learning_rate": 7.974766903761663e-05, "loss": 0.15970942378044128, "mean_token_accuracy": 0.9289858639240265, "num_tokens": 101817232.0, "step": 8254 }, { "entropy": 1.1545989215373993, "epoch": 4.347024749868352, "grad_norm": 0.3340533971786499, "learning_rate": 7.972701758742151e-05, "loss": 0.1708054095506668, "mean_token_accuracy": 0.9274019151926041, "num_tokens": 101829568.0, "step": 8255 }, { "entropy": 1.1824675798416138, "epoch": 4.3475513428120065, "grad_norm": 0.3400794267654419, "learning_rate": 7.970636793435693e-05, "loss": 0.17325887084007263, "mean_token_accuracy": 0.9251816272735596, "num_tokens": 101841904.0, "step": 8256 }, { "entropy": 1.0942457616329193, "epoch": 4.3480779357556605, "grad_norm": 0.28624141216278076, "learning_rate": 7.968572007964869e-05, "loss": 0.15125054121017456, "mean_token_accuracy": 0.9370819926261902, "num_tokens": 101854240.0, "step": 8257 }, { "entropy": 1.1075288206338882, "epoch": 4.348604528699315, "grad_norm": 0.2798440158367157, "learning_rate": 7.966507402452259e-05, "loss": 0.15465722978115082, "mean_token_accuracy": 0.9323037266731262, "num_tokens": 101866576.0, "step": 8258 }, { "entropy": 1.1464895009994507, "epoch": 4.34913112164297, "grad_norm": 0.31809863448143005, "learning_rate": 7.964442977020423e-05, "loss": 0.16774927079677582, "mean_token_accuracy": 0.9289859533309937, "num_tokens": 101878912.0, "step": 8259 }, { "entropy": 1.073552131652832, "epoch": 4.349657714586624, "grad_norm": 0.32322588562965393, "learning_rate": 7.962378731791913e-05, "loss": 0.18572726845741272, "mean_token_accuracy": 0.9255398958921432, "num_tokens": 101891248.0, "step": 8260 }, { "entropy": 1.1035448908805847, "epoch": 4.350184307530279, "grad_norm": 0.29818570613861084, "learning_rate": 7.960314666889272e-05, "loss": 0.16822704672813416, "mean_token_accuracy": 0.9293882697820663, "num_tokens": 101903584.0, "step": 8261 }, { "entropy": 1.1297992765903473, "epoch": 4.350710900473934, "grad_norm": 0.3098200857639313, "learning_rate": 7.958250782435035e-05, "loss": 0.16754473745822906, "mean_token_accuracy": 0.9317881762981415, "num_tokens": 101915920.0, "step": 8262 }, { "entropy": 1.1439328491687775, "epoch": 4.351237493417588, "grad_norm": 0.3593650460243225, "learning_rate": 7.95618707855172e-05, "loss": 0.19793128967285156, "mean_token_accuracy": 0.9188781529664993, "num_tokens": 101928256.0, "step": 8263 }, { "entropy": 1.0824010372161865, "epoch": 4.351764086361243, "grad_norm": 0.29909494519233704, "learning_rate": 7.954123555361839e-05, "loss": 0.1682833433151245, "mean_token_accuracy": 0.9274113923311234, "num_tokens": 101940592.0, "step": 8264 }, { "entropy": 1.1380861103534698, "epoch": 4.352290679304898, "grad_norm": 0.34476616978645325, "learning_rate": 7.952060212987889e-05, "loss": 0.1827372908592224, "mean_token_accuracy": 0.9255722165107727, "num_tokens": 101952928.0, "step": 8265 }, { "entropy": 1.1156515777111053, "epoch": 4.352817272248552, "grad_norm": 0.3097212612628937, "learning_rate": 7.949997051552358e-05, "loss": 0.17167949676513672, "mean_token_accuracy": 0.928065225481987, "num_tokens": 101965264.0, "step": 8266 }, { "entropy": 1.1728405356407166, "epoch": 4.3533438651922065, "grad_norm": 0.31493303179740906, "learning_rate": 7.947934071177729e-05, "loss": 0.16536009311676025, "mean_token_accuracy": 0.9326711148023605, "num_tokens": 101977600.0, "step": 8267 }, { "entropy": 1.0769576132297516, "epoch": 4.353870458135861, "grad_norm": 0.28808754682540894, "learning_rate": 7.945871271986458e-05, "loss": 0.16274510324001312, "mean_token_accuracy": 0.9312023371458054, "num_tokens": 101989936.0, "step": 8268 }, { "entropy": 1.1095938682556152, "epoch": 4.354397051079515, "grad_norm": 0.32415324449539185, "learning_rate": 7.943808654101012e-05, "loss": 0.18838092684745789, "mean_token_accuracy": 0.9194755703210831, "num_tokens": 102002272.0, "step": 8269 }, { "entropy": 1.1336401998996735, "epoch": 4.35492364402317, "grad_norm": 0.29520735144615173, "learning_rate": 7.941746217643837e-05, "loss": 0.1495727300643921, "mean_token_accuracy": 0.9346309304237366, "num_tokens": 102014608.0, "step": 8270 }, { "entropy": 1.150920331478119, "epoch": 4.355450236966824, "grad_norm": 0.3009397089481354, "learning_rate": 7.939683962737363e-05, "loss": 0.176979199051857, "mean_token_accuracy": 0.921332985162735, "num_tokens": 102026944.0, "step": 8271 }, { "entropy": 1.090204119682312, "epoch": 4.355976829910479, "grad_norm": 0.31908345222473145, "learning_rate": 7.937621889504015e-05, "loss": 0.1687454879283905, "mean_token_accuracy": 0.928538590669632, "num_tokens": 102039280.0, "step": 8272 }, { "entropy": 1.0926564633846283, "epoch": 4.356503422854134, "grad_norm": 0.33169350028038025, "learning_rate": 7.935559998066206e-05, "loss": 0.18119175732135773, "mean_token_accuracy": 0.9230940490961075, "num_tokens": 102051616.0, "step": 8273 }, { "entropy": 1.0917340517044067, "epoch": 4.357030015797788, "grad_norm": 0.33342838287353516, "learning_rate": 7.933498288546339e-05, "loss": 0.18393750488758087, "mean_token_accuracy": 0.9222940355539322, "num_tokens": 102063952.0, "step": 8274 }, { "entropy": 1.145456463098526, "epoch": 4.357556608741443, "grad_norm": 0.3058793842792511, "learning_rate": 7.931436761066801e-05, "loss": 0.16043967008590698, "mean_token_accuracy": 0.9309965074062347, "num_tokens": 102076288.0, "step": 8275 }, { "entropy": 1.1027463674545288, "epoch": 4.358083201685098, "grad_norm": 0.32194235920906067, "learning_rate": 7.929375415749984e-05, "loss": 0.1844458281993866, "mean_token_accuracy": 0.9184555113315582, "num_tokens": 102088624.0, "step": 8276 }, { "entropy": 1.0956955552101135, "epoch": 4.358609794628752, "grad_norm": 0.3411625623703003, "learning_rate": 7.927314252718249e-05, "loss": 0.18235260248184204, "mean_token_accuracy": 0.9206727594137192, "num_tokens": 102100960.0, "step": 8277 }, { "entropy": 1.095288634300232, "epoch": 4.3591363875724065, "grad_norm": 0.2878154516220093, "learning_rate": 7.925253272093959e-05, "loss": 0.15658070147037506, "mean_token_accuracy": 0.933790922164917, "num_tokens": 102113296.0, "step": 8278 }, { "entropy": 1.1430086195468903, "epoch": 4.359662980516061, "grad_norm": 0.3287704885005951, "learning_rate": 7.923192473999461e-05, "loss": 0.16294170916080475, "mean_token_accuracy": 0.9294786006212234, "num_tokens": 102125632.0, "step": 8279 }, { "entropy": 1.0570924878120422, "epoch": 4.360189573459715, "grad_norm": 0.29489120841026306, "learning_rate": 7.921131858557091e-05, "loss": 0.1653260886669159, "mean_token_accuracy": 0.9298093169927597, "num_tokens": 102137968.0, "step": 8280 }, { "entropy": 1.1138690412044525, "epoch": 4.36071616640337, "grad_norm": 0.3456246256828308, "learning_rate": 7.91907142588918e-05, "loss": 0.18220512568950653, "mean_token_accuracy": 0.92311991751194, "num_tokens": 102150304.0, "step": 8281 }, { "entropy": 1.0722036063671112, "epoch": 4.361242759347025, "grad_norm": 0.31399351358413696, "learning_rate": 7.917011176118039e-05, "loss": 0.17284181714057922, "mean_token_accuracy": 0.9255773425102234, "num_tokens": 102162640.0, "step": 8282 }, { "entropy": 1.0678641498088837, "epoch": 4.361769352290679, "grad_norm": 0.2958000600337982, "learning_rate": 7.914951109365978e-05, "loss": 0.1648251712322235, "mean_token_accuracy": 0.9297206252813339, "num_tokens": 102174976.0, "step": 8283 }, { "entropy": 1.087259441614151, "epoch": 4.362295945234334, "grad_norm": 0.3215687870979309, "learning_rate": 7.912891225755288e-05, "loss": 0.1759418547153473, "mean_token_accuracy": 0.9221944957971573, "num_tokens": 102187312.0, "step": 8284 }, { "entropy": 1.0881843864917755, "epoch": 4.362822538177989, "grad_norm": 0.29326653480529785, "learning_rate": 7.910831525408251e-05, "loss": 0.17087194323539734, "mean_token_accuracy": 0.9310245662927628, "num_tokens": 102199648.0, "step": 8285 }, { "entropy": 1.029636561870575, "epoch": 4.363349131121643, "grad_norm": 0.29191556572914124, "learning_rate": 7.908772008447144e-05, "loss": 0.15503615140914917, "mean_token_accuracy": 0.9320820719003677, "num_tokens": 102211984.0, "step": 8286 }, { "entropy": 1.024407148361206, "epoch": 4.363875724065298, "grad_norm": 0.2988927960395813, "learning_rate": 7.906712674994225e-05, "loss": 0.16153010725975037, "mean_token_accuracy": 0.9317641705274582, "num_tokens": 102224320.0, "step": 8287 }, { "entropy": 1.0935994684696198, "epoch": 4.3644023170089525, "grad_norm": 0.32042306661605835, "learning_rate": 7.904653525171746e-05, "loss": 0.17825911939144135, "mean_token_accuracy": 0.9292528629302979, "num_tokens": 102236656.0, "step": 8288 }, { "entropy": 1.036267563700676, "epoch": 4.3649289099526065, "grad_norm": 0.2919551432132721, "learning_rate": 7.902594559101941e-05, "loss": 0.15347644686698914, "mean_token_accuracy": 0.9331680238246918, "num_tokens": 102248992.0, "step": 8289 }, { "entropy": 1.0453420579433441, "epoch": 4.365455502896261, "grad_norm": 0.30875593423843384, "learning_rate": 7.900535776907049e-05, "loss": 0.17227022349834442, "mean_token_accuracy": 0.9263574779033661, "num_tokens": 102261328.0, "step": 8290 }, { "entropy": 0.9784771054983139, "epoch": 4.365982095839915, "grad_norm": 0.31372925639152527, "learning_rate": 7.898477178709283e-05, "loss": 0.17568835616111755, "mean_token_accuracy": 0.922653004527092, "num_tokens": 102273664.0, "step": 8291 }, { "entropy": 1.0353483855724335, "epoch": 4.36650868878357, "grad_norm": 0.3407802879810333, "learning_rate": 7.896418764630848e-05, "loss": 0.16763520240783691, "mean_token_accuracy": 0.9367599487304688, "num_tokens": 102286000.0, "step": 8292 }, { "entropy": 1.0111843794584274, "epoch": 4.367035281727225, "grad_norm": 0.3053271174430847, "learning_rate": 7.894360534793942e-05, "loss": 0.163558229804039, "mean_token_accuracy": 0.9313251227140427, "num_tokens": 102298336.0, "step": 8293 }, { "entropy": 0.990428626537323, "epoch": 4.367561874670879, "grad_norm": 0.3073551654815674, "learning_rate": 7.892302489320753e-05, "loss": 0.16031494736671448, "mean_token_accuracy": 0.9327969402074814, "num_tokens": 102310672.0, "step": 8294 }, { "entropy": 1.025489255785942, "epoch": 4.368088467614534, "grad_norm": 0.30879753828048706, "learning_rate": 7.890244628333449e-05, "loss": 0.16243739426136017, "mean_token_accuracy": 0.9296454042196274, "num_tokens": 102323008.0, "step": 8295 }, { "entropy": 1.015230417251587, "epoch": 4.368615060558189, "grad_norm": 0.3144312798976898, "learning_rate": 7.888186951954197e-05, "loss": 0.185271754860878, "mean_token_accuracy": 0.9228046387434006, "num_tokens": 102335344.0, "step": 8296 }, { "entropy": 0.9996123164892197, "epoch": 4.369141653501843, "grad_norm": 0.3275398313999176, "learning_rate": 7.886129460305147e-05, "loss": 0.17242178320884705, "mean_token_accuracy": 0.9246769696474075, "num_tokens": 102347680.0, "step": 8297 }, { "entropy": 1.019558385014534, "epoch": 4.369668246445498, "grad_norm": 0.3341851234436035, "learning_rate": 7.884072153508444e-05, "loss": 0.17046117782592773, "mean_token_accuracy": 0.9291224926710129, "num_tokens": 102360016.0, "step": 8298 }, { "entropy": 1.0215636640787125, "epoch": 4.3701948393891525, "grad_norm": 0.3042353689670563, "learning_rate": 7.882015031686218e-05, "loss": 0.17030411958694458, "mean_token_accuracy": 0.9261429458856583, "num_tokens": 102372352.0, "step": 8299 }, { "entropy": 1.0183587074279785, "epoch": 4.3707214323328065, "grad_norm": 0.3405551314353943, "learning_rate": 7.879958094960585e-05, "loss": 0.1821388304233551, "mean_token_accuracy": 0.9244387149810791, "num_tokens": 102384688.0, "step": 8300 }, { "entropy": 1.0054609030485153, "epoch": 4.371248025276461, "grad_norm": 0.3741503357887268, "learning_rate": 7.877901343453655e-05, "loss": 0.1840052753686905, "mean_token_accuracy": 0.9217223525047302, "num_tokens": 102397024.0, "step": 8301 }, { "entropy": 1.0249035060405731, "epoch": 4.371774618220116, "grad_norm": 0.31064465641975403, "learning_rate": 7.875844777287526e-05, "loss": 0.16266967356204987, "mean_token_accuracy": 0.9317588061094284, "num_tokens": 102409360.0, "step": 8302 }, { "entropy": 1.0520051419734955, "epoch": 4.37230121116377, "grad_norm": 0.35928305983543396, "learning_rate": 7.873788396584279e-05, "loss": 0.1857140064239502, "mean_token_accuracy": 0.922241285443306, "num_tokens": 102421696.0, "step": 8303 }, { "entropy": 0.9905842542648315, "epoch": 4.372827804107425, "grad_norm": 0.2932959198951721, "learning_rate": 7.871732201465997e-05, "loss": 0.16448016464710236, "mean_token_accuracy": 0.9280882775783539, "num_tokens": 102434032.0, "step": 8304 }, { "entropy": 1.0434667617082596, "epoch": 4.373354397051079, "grad_norm": 0.3276841342449188, "learning_rate": 7.869676192054744e-05, "loss": 0.16333431005477905, "mean_token_accuracy": 0.9330431222915649, "num_tokens": 102446368.0, "step": 8305 }, { "entropy": 1.0375141203403473, "epoch": 4.373880989994734, "grad_norm": 0.30908146500587463, "learning_rate": 7.867620368472568e-05, "loss": 0.17605969309806824, "mean_token_accuracy": 0.9249200969934464, "num_tokens": 102458704.0, "step": 8306 }, { "entropy": 1.0875357389450073, "epoch": 4.374407582938389, "grad_norm": 0.3515836000442505, "learning_rate": 7.865564730841515e-05, "loss": 0.19391240179538727, "mean_token_accuracy": 0.9192430227994919, "num_tokens": 102471040.0, "step": 8307 }, { "entropy": 1.0471609085798264, "epoch": 4.374934175882043, "grad_norm": 0.3264077305793762, "learning_rate": 7.863509279283614e-05, "loss": 0.17311157286167145, "mean_token_accuracy": 0.9325474202632904, "num_tokens": 102483376.0, "step": 8308 }, { "entropy": 1.0320720374584198, "epoch": 4.375460768825698, "grad_norm": 0.29720941185951233, "learning_rate": 7.861454013920886e-05, "loss": 0.16066929697990417, "mean_token_accuracy": 0.9330228120088577, "num_tokens": 102495712.0, "step": 8309 }, { "entropy": 1.0482531040906906, "epoch": 4.3759873617693525, "grad_norm": 0.337213397026062, "learning_rate": 7.859398934875339e-05, "loss": 0.1838356852531433, "mean_token_accuracy": 0.9218758940696716, "num_tokens": 102508048.0, "step": 8310 }, { "entropy": 1.0781738758087158, "epoch": 4.3765139547130065, "grad_norm": 0.30988427996635437, "learning_rate": 7.857344042268975e-05, "loss": 0.16771355271339417, "mean_token_accuracy": 0.9302680045366287, "num_tokens": 102520384.0, "step": 8311 }, { "entropy": 1.0523044168949127, "epoch": 4.377040547656661, "grad_norm": 0.31549984216690063, "learning_rate": 7.855289336223777e-05, "loss": 0.1637999564409256, "mean_token_accuracy": 0.9321995824575424, "num_tokens": 102532720.0, "step": 8312 }, { "entropy": 1.1031942069530487, "epoch": 4.377567140600316, "grad_norm": 0.3448771834373474, "learning_rate": 7.853234816861723e-05, "loss": 0.18763162195682526, "mean_token_accuracy": 0.9227224886417389, "num_tokens": 102545056.0, "step": 8313 }, { "entropy": 1.0884676575660706, "epoch": 4.37809373354397, "grad_norm": 0.2905152440071106, "learning_rate": 7.851180484304779e-05, "loss": 0.1556159406900406, "mean_token_accuracy": 0.9334323853254318, "num_tokens": 102557392.0, "step": 8314 }, { "entropy": 1.0691013932228088, "epoch": 4.378620326487625, "grad_norm": 0.2874990403652191, "learning_rate": 7.849126338674893e-05, "loss": 0.15471886098384857, "mean_token_accuracy": 0.936391144990921, "num_tokens": 102569728.0, "step": 8315 }, { "entropy": 1.1152063310146332, "epoch": 4.37914691943128, "grad_norm": 0.34200170636177063, "learning_rate": 7.847072380094016e-05, "loss": 0.1857263594865799, "mean_token_accuracy": 0.924913078546524, "num_tokens": 102582064.0, "step": 8316 }, { "entropy": 1.084595412015915, "epoch": 4.379673512374934, "grad_norm": 0.3384974002838135, "learning_rate": 7.845018608684069e-05, "loss": 0.1742813140153885, "mean_token_accuracy": 0.9260141849517822, "num_tokens": 102594400.0, "step": 8317 }, { "entropy": 1.0446248650550842, "epoch": 4.380200105318589, "grad_norm": 0.3072529137134552, "learning_rate": 7.842965024566981e-05, "loss": 0.16779743134975433, "mean_token_accuracy": 0.9303091764450073, "num_tokens": 102606736.0, "step": 8318 }, { "entropy": 1.0834141671657562, "epoch": 4.380726698262244, "grad_norm": 0.2832176387310028, "learning_rate": 7.840911627864662e-05, "loss": 0.14648564159870148, "mean_token_accuracy": 0.9374445974826813, "num_tokens": 102619072.0, "step": 8319 }, { "entropy": 1.0966499745845795, "epoch": 4.381253291205898, "grad_norm": 0.34519094228744507, "learning_rate": 7.838858418699006e-05, "loss": 0.18011869490146637, "mean_token_accuracy": 0.9262439161539078, "num_tokens": 102631408.0, "step": 8320 }, { "entropy": 1.0953200459480286, "epoch": 4.3817798841495526, "grad_norm": 0.32482707500457764, "learning_rate": 7.836805397191902e-05, "loss": 0.17221830785274506, "mean_token_accuracy": 0.9294404089450836, "num_tokens": 102643744.0, "step": 8321 }, { "entropy": 1.1350574493408203, "epoch": 4.382306477093207, "grad_norm": 0.35024866461753845, "learning_rate": 7.834752563465225e-05, "loss": 0.18126574158668518, "mean_token_accuracy": 0.9207083135843277, "num_tokens": 102656080.0, "step": 8322 }, { "entropy": 1.0730578005313873, "epoch": 4.382833070036861, "grad_norm": 0.2861269414424896, "learning_rate": 7.832699917640838e-05, "loss": 0.15728303790092468, "mean_token_accuracy": 0.9339731335639954, "num_tokens": 102668416.0, "step": 8323 }, { "entropy": 1.1431684494018555, "epoch": 4.383359662980516, "grad_norm": 0.33823126554489136, "learning_rate": 7.830647459840595e-05, "loss": 0.17363259196281433, "mean_token_accuracy": 0.9255153089761734, "num_tokens": 102680752.0, "step": 8324 }, { "entropy": 1.0835270881652832, "epoch": 4.38388625592417, "grad_norm": 0.3068356215953827, "learning_rate": 7.82859519018634e-05, "loss": 0.16449736058712006, "mean_token_accuracy": 0.9274246692657471, "num_tokens": 102693088.0, "step": 8325 }, { "entropy": 1.0368002653121948, "epoch": 4.384412848867825, "grad_norm": 0.28711849451065063, "learning_rate": 7.826543108799909e-05, "loss": 0.16489332914352417, "mean_token_accuracy": 0.9274584352970123, "num_tokens": 102705424.0, "step": 8326 }, { "entropy": 1.0520197004079819, "epoch": 4.38493944181148, "grad_norm": 0.31600284576416016, "learning_rate": 7.824491215803113e-05, "loss": 0.1721746176481247, "mean_token_accuracy": 0.9221912920475006, "num_tokens": 102717760.0, "step": 8327 }, { "entropy": 1.070871889591217, "epoch": 4.385466034755134, "grad_norm": 0.29123905301094055, "learning_rate": 7.822439511317768e-05, "loss": 0.15711231529712677, "mean_token_accuracy": 0.9360679537057877, "num_tokens": 102730096.0, "step": 8328 }, { "entropy": 1.1568743288516998, "epoch": 4.385992627698789, "grad_norm": 0.3370809853076935, "learning_rate": 7.820387995465665e-05, "loss": 0.1795637607574463, "mean_token_accuracy": 0.9237714856863022, "num_tokens": 102742432.0, "step": 8329 }, { "entropy": 1.118773490190506, "epoch": 4.386519220642444, "grad_norm": 0.3151535987854004, "learning_rate": 7.818336668368597e-05, "loss": 0.1708720177412033, "mean_token_accuracy": 0.9265831559896469, "num_tokens": 102754768.0, "step": 8330 }, { "entropy": 1.1478121280670166, "epoch": 4.387045813586098, "grad_norm": 0.31625819206237793, "learning_rate": 7.816285530148335e-05, "loss": 0.15450188517570496, "mean_token_accuracy": 0.9355681091547012, "num_tokens": 102767104.0, "step": 8331 }, { "entropy": 1.0916865170001984, "epoch": 4.3875724065297526, "grad_norm": 0.3406420648097992, "learning_rate": 7.814234580926649e-05, "loss": 0.186141699552536, "mean_token_accuracy": 0.9204560667276382, "num_tokens": 102779440.0, "step": 8332 }, { "entropy": 1.067175418138504, "epoch": 4.388098999473407, "grad_norm": 0.29393482208251953, "learning_rate": 7.812183820825285e-05, "loss": 0.163357213139534, "mean_token_accuracy": 0.9288803040981293, "num_tokens": 102791776.0, "step": 8333 }, { "entropy": 1.130958765745163, "epoch": 4.388625592417061, "grad_norm": 0.31902971863746643, "learning_rate": 7.81013324996599e-05, "loss": 0.1739107370376587, "mean_token_accuracy": 0.9246774911880493, "num_tokens": 102804112.0, "step": 8334 }, { "entropy": 1.1164607107639313, "epoch": 4.389152185360716, "grad_norm": 0.32076266407966614, "learning_rate": 7.808082868470489e-05, "loss": 0.16847071051597595, "mean_token_accuracy": 0.9282487034797668, "num_tokens": 102816448.0, "step": 8335 }, { "entropy": 1.1388525664806366, "epoch": 4.38967877830437, "grad_norm": 0.33620843291282654, "learning_rate": 7.806032676460506e-05, "loss": 0.1777355670928955, "mean_token_accuracy": 0.923837274312973, "num_tokens": 102828784.0, "step": 8336 }, { "entropy": 1.114677220582962, "epoch": 4.390205371248025, "grad_norm": 0.3161875903606415, "learning_rate": 7.803982674057748e-05, "loss": 0.16435915231704712, "mean_token_accuracy": 0.9287358820438385, "num_tokens": 102841120.0, "step": 8337 }, { "entropy": 1.1199637949466705, "epoch": 4.39073196419168, "grad_norm": 0.3084072470664978, "learning_rate": 7.801932861383907e-05, "loss": 0.1659913957118988, "mean_token_accuracy": 0.9315567314624786, "num_tokens": 102853456.0, "step": 8338 }, { "entropy": 1.1161784827709198, "epoch": 4.391258557135334, "grad_norm": 0.3483307659626007, "learning_rate": 7.799883238560677e-05, "loss": 0.18561196327209473, "mean_token_accuracy": 0.9188537895679474, "num_tokens": 102865792.0, "step": 8339 }, { "entropy": 1.1186930239200592, "epoch": 4.391785150078989, "grad_norm": 0.3259585201740265, "learning_rate": 7.797833805709724e-05, "loss": 0.18975147604942322, "mean_token_accuracy": 0.9193664044141769, "num_tokens": 102878128.0, "step": 8340 }, { "entropy": 1.132372885942459, "epoch": 4.392311743022644, "grad_norm": 0.3266378939151764, "learning_rate": 7.795784562952718e-05, "loss": 0.16240766644477844, "mean_token_accuracy": 0.9322902411222458, "num_tokens": 102890464.0, "step": 8341 }, { "entropy": 1.0790059268474579, "epoch": 4.392838335966298, "grad_norm": 0.28562331199645996, "learning_rate": 7.793735510411302e-05, "loss": 0.1667494922876358, "mean_token_accuracy": 0.926630973815918, "num_tokens": 102902800.0, "step": 8342 }, { "entropy": 1.0901443362236023, "epoch": 4.393364928909953, "grad_norm": 0.31055060029029846, "learning_rate": 7.791686648207124e-05, "loss": 0.17224203050136566, "mean_token_accuracy": 0.9274156838655472, "num_tokens": 102915136.0, "step": 8343 }, { "entropy": 1.1036354005336761, "epoch": 4.393891521853607, "grad_norm": 0.3095247149467468, "learning_rate": 7.78963797646181e-05, "loss": 0.17547622323036194, "mean_token_accuracy": 0.9240781366825104, "num_tokens": 102927472.0, "step": 8344 }, { "entropy": 1.1046380698680878, "epoch": 4.394418114797261, "grad_norm": 0.2952825725078583, "learning_rate": 7.787589495296976e-05, "loss": 0.17367370426654816, "mean_token_accuracy": 0.9269566237926483, "num_tokens": 102939808.0, "step": 8345 }, { "entropy": 1.0728683471679688, "epoch": 4.394944707740916, "grad_norm": 0.313921719789505, "learning_rate": 7.785541204834232e-05, "loss": 0.17117363214492798, "mean_token_accuracy": 0.9291615635156631, "num_tokens": 102952144.0, "step": 8346 }, { "entropy": 1.1034887731075287, "epoch": 4.395471300684571, "grad_norm": 0.2988021671772003, "learning_rate": 7.783493105195172e-05, "loss": 0.16765370965003967, "mean_token_accuracy": 0.9321981817483902, "num_tokens": 102964480.0, "step": 8347 }, { "entropy": 1.0934976935386658, "epoch": 4.395997893628225, "grad_norm": 0.285640150308609, "learning_rate": 7.781445196501378e-05, "loss": 0.16364088654518127, "mean_token_accuracy": 0.929412230849266, "num_tokens": 102976816.0, "step": 8348 }, { "entropy": 1.1029529571533203, "epoch": 4.39652448657188, "grad_norm": 0.3293870985507965, "learning_rate": 7.779397478874424e-05, "loss": 0.17802828550338745, "mean_token_accuracy": 0.9208266884088516, "num_tokens": 102989152.0, "step": 8349 }, { "entropy": 1.1420040726661682, "epoch": 4.397051079515535, "grad_norm": 0.3254111409187317, "learning_rate": 7.777349952435873e-05, "loss": 0.1666165590286255, "mean_token_accuracy": 0.9263311624526978, "num_tokens": 103001488.0, "step": 8350 }, { "entropy": 1.0624985098838806, "epoch": 4.397577672459189, "grad_norm": 0.28192704916000366, "learning_rate": 7.775302617307271e-05, "loss": 0.16333523392677307, "mean_token_accuracy": 0.9288174957036972, "num_tokens": 103013824.0, "step": 8351 }, { "entropy": 1.101064771413803, "epoch": 4.398104265402844, "grad_norm": 0.2985323965549469, "learning_rate": 7.773255473610153e-05, "loss": 0.16419664025306702, "mean_token_accuracy": 0.9274439066648483, "num_tokens": 103026160.0, "step": 8352 }, { "entropy": 1.1078698635101318, "epoch": 4.398630858346499, "grad_norm": 0.29670053720474243, "learning_rate": 7.771208521466054e-05, "loss": 0.15546825528144836, "mean_token_accuracy": 0.9353156536817551, "num_tokens": 103038496.0, "step": 8353 }, { "entropy": 1.0689546167850494, "epoch": 4.399157451290153, "grad_norm": 0.29663437604904175, "learning_rate": 7.769161760996488e-05, "loss": 0.1630391925573349, "mean_token_accuracy": 0.9319390803575516, "num_tokens": 103050832.0, "step": 8354 }, { "entropy": 1.0939607620239258, "epoch": 4.399684044233807, "grad_norm": 0.3043624758720398, "learning_rate": 7.767115192322958e-05, "loss": 0.17216776311397552, "mean_token_accuracy": 0.9238497316837311, "num_tokens": 103063168.0, "step": 8355 }, { "entropy": 1.0829295814037323, "epoch": 4.400210637177461, "grad_norm": 0.2891440689563751, "learning_rate": 7.765068815566954e-05, "loss": 0.1584639698266983, "mean_token_accuracy": 0.9335407316684723, "num_tokens": 103075504.0, "step": 8356 }, { "entropy": 1.102199226617813, "epoch": 4.400737230121116, "grad_norm": 0.2820277810096741, "learning_rate": 7.763022630849958e-05, "loss": 0.1639498770236969, "mean_token_accuracy": 0.9334799498319626, "num_tokens": 103087840.0, "step": 8357 }, { "entropy": 1.14246666431427, "epoch": 4.401263823064771, "grad_norm": 0.322818785905838, "learning_rate": 7.760976638293447e-05, "loss": 0.17627064883708954, "mean_token_accuracy": 0.9249568432569504, "num_tokens": 103100176.0, "step": 8358 }, { "entropy": 1.1458443701267242, "epoch": 4.401790416008425, "grad_norm": 0.314328134059906, "learning_rate": 7.75893083801887e-05, "loss": 0.17229615151882172, "mean_token_accuracy": 0.9282985627651215, "num_tokens": 103112512.0, "step": 8359 }, { "entropy": 1.0990630984306335, "epoch": 4.40231700895208, "grad_norm": 0.3130625784397125, "learning_rate": 7.756885230147679e-05, "loss": 0.16665244102478027, "mean_token_accuracy": 0.931442990899086, "num_tokens": 103124848.0, "step": 8360 }, { "entropy": 1.187071055173874, "epoch": 4.402843601895735, "grad_norm": 0.3278498947620392, "learning_rate": 7.754839814801312e-05, "loss": 0.16480353474617004, "mean_token_accuracy": 0.9343954473733902, "num_tokens": 103137184.0, "step": 8361 }, { "entropy": 1.0789116024971008, "epoch": 4.403370194839389, "grad_norm": 0.31040650606155396, "learning_rate": 7.75279459210119e-05, "loss": 0.16955912113189697, "mean_token_accuracy": 0.9281894862651825, "num_tokens": 103149520.0, "step": 8362 }, { "entropy": 1.1937116384506226, "epoch": 4.403896787783044, "grad_norm": 0.39075520634651184, "learning_rate": 7.750749562168726e-05, "loss": 0.19120678305625916, "mean_token_accuracy": 0.9256240129470825, "num_tokens": 103161856.0, "step": 8363 }, { "entropy": 1.1735577285289764, "epoch": 4.404423380726699, "grad_norm": 0.37804561853408813, "learning_rate": 7.748704725125324e-05, "loss": 0.19023069739341736, "mean_token_accuracy": 0.9222802668809891, "num_tokens": 103174192.0, "step": 8364 }, { "entropy": 1.11763334274292, "epoch": 4.404949973670353, "grad_norm": 0.3547898530960083, "learning_rate": 7.746660081092374e-05, "loss": 0.18030297756195068, "mean_token_accuracy": 0.9217110425233841, "num_tokens": 103186528.0, "step": 8365 }, { "entropy": 1.1391336917877197, "epoch": 4.405476566614007, "grad_norm": 0.33012184500694275, "learning_rate": 7.744615630191246e-05, "loss": 0.1677279770374298, "mean_token_accuracy": 0.928357407450676, "num_tokens": 103198864.0, "step": 8366 }, { "entropy": 1.1174531877040863, "epoch": 4.406003159557662, "grad_norm": 0.32291877269744873, "learning_rate": 7.742571372543319e-05, "loss": 0.16517490148544312, "mean_token_accuracy": 0.9265066087245941, "num_tokens": 103211200.0, "step": 8367 }, { "entropy": 1.1210643649101257, "epoch": 4.406529752501316, "grad_norm": 0.3204652965068817, "learning_rate": 7.740527308269945e-05, "loss": 0.16921760141849518, "mean_token_accuracy": 0.9277530610561371, "num_tokens": 103223536.0, "step": 8368 }, { "entropy": 1.1069200932979584, "epoch": 4.407056345444971, "grad_norm": 0.31456953287124634, "learning_rate": 7.738483437492468e-05, "loss": 0.1544417142868042, "mean_token_accuracy": 0.9324262142181396, "num_tokens": 103235872.0, "step": 8369 }, { "entropy": 1.12002232670784, "epoch": 4.407582938388625, "grad_norm": 0.30929791927337646, "learning_rate": 7.736439760332217e-05, "loss": 0.16462525725364685, "mean_token_accuracy": 0.9314171969890594, "num_tokens": 103248208.0, "step": 8370 }, { "entropy": 1.1748793423175812, "epoch": 4.40810953133228, "grad_norm": 0.2985473573207855, "learning_rate": 7.734396276910518e-05, "loss": 0.1532450169324875, "mean_token_accuracy": 0.9394589960575104, "num_tokens": 103260544.0, "step": 8371 }, { "entropy": 1.1170945763587952, "epoch": 4.408636124275935, "grad_norm": 0.3181641399860382, "learning_rate": 7.732352987348677e-05, "loss": 0.15791934728622437, "mean_token_accuracy": 0.9288433194160461, "num_tokens": 103272880.0, "step": 8372 }, { "entropy": 1.187763661146164, "epoch": 4.409162717219589, "grad_norm": 0.34279096126556396, "learning_rate": 7.730309891767993e-05, "loss": 0.18462227284908295, "mean_token_accuracy": 0.9185385406017303, "num_tokens": 103285216.0, "step": 8373 }, { "entropy": 1.1743906438350677, "epoch": 4.409689310163244, "grad_norm": 0.3374393582344055, "learning_rate": 7.728266990289754e-05, "loss": 0.17026188969612122, "mean_token_accuracy": 0.9263552576303482, "num_tokens": 103297552.0, "step": 8374 }, { "entropy": 1.15870600938797, "epoch": 4.410215903106899, "grad_norm": 0.34642383456230164, "learning_rate": 7.726224283035235e-05, "loss": 0.17768001556396484, "mean_token_accuracy": 0.9258678555488586, "num_tokens": 103309888.0, "step": 8375 }, { "entropy": 1.179932415485382, "epoch": 4.410742496050553, "grad_norm": 0.3416505753993988, "learning_rate": 7.724181770125701e-05, "loss": 0.1815774142742157, "mean_token_accuracy": 0.9244155734777451, "num_tokens": 103322224.0, "step": 8376 }, { "entropy": 1.1441168785095215, "epoch": 4.411269088994207, "grad_norm": 0.34104859828948975, "learning_rate": 7.722139451682399e-05, "loss": 0.1751016527414322, "mean_token_accuracy": 0.9238454103469849, "num_tokens": 103334560.0, "step": 8377 }, { "entropy": 1.150140255689621, "epoch": 4.411795681937862, "grad_norm": 0.33411258459091187, "learning_rate": 7.720097327826577e-05, "loss": 0.169435054063797, "mean_token_accuracy": 0.9205000847578049, "num_tokens": 103346896.0, "step": 8378 }, { "entropy": 1.1098092794418335, "epoch": 4.412322274881516, "grad_norm": 0.28074219822883606, "learning_rate": 7.71805539867946e-05, "loss": 0.1499934196472168, "mean_token_accuracy": 0.9380492717027664, "num_tokens": 103359232.0, "step": 8379 }, { "entropy": 1.1838358938694, "epoch": 4.412848867825171, "grad_norm": 0.3145032823085785, "learning_rate": 7.716013664362258e-05, "loss": 0.16694800555706024, "mean_token_accuracy": 0.9277818500995636, "num_tokens": 103371568.0, "step": 8380 }, { "entropy": 1.1603033542633057, "epoch": 4.413375460768826, "grad_norm": 0.3271830081939697, "learning_rate": 7.713972124996192e-05, "loss": 0.17177407443523407, "mean_token_accuracy": 0.9279496967792511, "num_tokens": 103383904.0, "step": 8381 }, { "entropy": 1.1457706093788147, "epoch": 4.41390205371248, "grad_norm": 0.31502124667167664, "learning_rate": 7.711930780702445e-05, "loss": 0.16537320613861084, "mean_token_accuracy": 0.9297925382852554, "num_tokens": 103396240.0, "step": 8382 }, { "entropy": 1.1601044535636902, "epoch": 4.414428646656135, "grad_norm": 0.322947233915329, "learning_rate": 7.709889631602205e-05, "loss": 0.17435915768146515, "mean_token_accuracy": 0.9245762825012207, "num_tokens": 103408576.0, "step": 8383 }, { "entropy": 1.125311404466629, "epoch": 4.41495523959979, "grad_norm": 0.3117965757846832, "learning_rate": 7.707848677816642e-05, "loss": 0.1723887175321579, "mean_token_accuracy": 0.9227554500102997, "num_tokens": 103420912.0, "step": 8384 }, { "entropy": 1.1340227723121643, "epoch": 4.415481832543444, "grad_norm": 0.32244864106178284, "learning_rate": 7.705807919466914e-05, "loss": 0.1690177619457245, "mean_token_accuracy": 0.9253842532634735, "num_tokens": 103433248.0, "step": 8385 }, { "entropy": 1.14969140291214, "epoch": 4.416008425487099, "grad_norm": 0.32291510701179504, "learning_rate": 7.70376735667417e-05, "loss": 0.16696715354919434, "mean_token_accuracy": 0.9303669035434723, "num_tokens": 103445584.0, "step": 8386 }, { "entropy": 1.1150422990322113, "epoch": 4.4165350184307535, "grad_norm": 0.33403468132019043, "learning_rate": 7.701726989559544e-05, "loss": 0.1756865680217743, "mean_token_accuracy": 0.9245531111955643, "num_tokens": 103457920.0, "step": 8387 }, { "entropy": 1.1605649888515472, "epoch": 4.4170616113744074, "grad_norm": 0.3420243263244629, "learning_rate": 7.699686818244163e-05, "loss": 0.17954641580581665, "mean_token_accuracy": 0.9211717247962952, "num_tokens": 103470256.0, "step": 8388 }, { "entropy": 1.1440449059009552, "epoch": 4.417588204318062, "grad_norm": 0.335814505815506, "learning_rate": 7.697646842849142e-05, "loss": 0.17243674397468567, "mean_token_accuracy": 0.9276414960622787, "num_tokens": 103482592.0, "step": 8389 }, { "entropy": 1.1576780080795288, "epoch": 4.418114797261716, "grad_norm": 0.3149440586566925, "learning_rate": 7.695607063495578e-05, "loss": 0.16912463307380676, "mean_token_accuracy": 0.92839415371418, "num_tokens": 103494928.0, "step": 8390 }, { "entropy": 1.1885141134262085, "epoch": 4.418641390205371, "grad_norm": 0.3676983118057251, "learning_rate": 7.693567480304567e-05, "loss": 0.19174298644065857, "mean_token_accuracy": 0.9174454212188721, "num_tokens": 103507264.0, "step": 8391 }, { "entropy": 1.171632468700409, "epoch": 4.419167983149026, "grad_norm": 0.34532836079597473, "learning_rate": 7.69152809339718e-05, "loss": 0.1755070984363556, "mean_token_accuracy": 0.9248087704181671, "num_tokens": 103519600.0, "step": 8392 }, { "entropy": 1.1931438148021698, "epoch": 4.41969457609268, "grad_norm": 0.3367908298969269, "learning_rate": 7.689488902894489e-05, "loss": 0.17951609194278717, "mean_token_accuracy": 0.9275099188089371, "num_tokens": 103531936.0, "step": 8393 }, { "entropy": 1.1273884773254395, "epoch": 4.420221169036335, "grad_norm": 0.29583027958869934, "learning_rate": 7.687449908917543e-05, "loss": 0.15583457052707672, "mean_token_accuracy": 0.9299625754356384, "num_tokens": 103544272.0, "step": 8394 }, { "entropy": 1.1927360594272614, "epoch": 4.42074776197999, "grad_norm": 0.32044270634651184, "learning_rate": 7.68541111158739e-05, "loss": 0.17775748670101166, "mean_token_accuracy": 0.9299187660217285, "num_tokens": 103556608.0, "step": 8395 }, { "entropy": 1.1787251234054565, "epoch": 4.421274354923644, "grad_norm": 0.3348028063774109, "learning_rate": 7.683372511025064e-05, "loss": 0.17427965998649597, "mean_token_accuracy": 0.9278364479541779, "num_tokens": 103568944.0, "step": 8396 }, { "entropy": 1.1640098690986633, "epoch": 4.421800947867299, "grad_norm": 0.2946585416793823, "learning_rate": 7.681334107351578e-05, "loss": 0.1568325161933899, "mean_token_accuracy": 0.933339461684227, "num_tokens": 103581280.0, "step": 8397 }, { "entropy": 1.2109858095645905, "epoch": 4.4223275408109535, "grad_norm": 0.3569537103176117, "learning_rate": 7.679295900687946e-05, "loss": 0.19348572194576263, "mean_token_accuracy": 0.9151138514280319, "num_tokens": 103593616.0, "step": 8398 }, { "entropy": 1.183549165725708, "epoch": 4.4228541337546075, "grad_norm": 0.3093925416469574, "learning_rate": 7.677257891155163e-05, "loss": 0.15875285863876343, "mean_token_accuracy": 0.9322007298469543, "num_tokens": 103605952.0, "step": 8399 }, { "entropy": 1.1850107312202454, "epoch": 4.423380726698262, "grad_norm": 0.29908472299575806, "learning_rate": 7.67522007887421e-05, "loss": 0.16990849375724792, "mean_token_accuracy": 0.9256811887025833, "num_tokens": 103618288.0, "step": 8400 }, { "entropy": 1.1876828074455261, "epoch": 4.423907319641917, "grad_norm": 0.31594136357307434, "learning_rate": 7.673182463966057e-05, "loss": 0.16882580518722534, "mean_token_accuracy": 0.930813804268837, "num_tokens": 103630624.0, "step": 8401 }, { "entropy": 1.1995342373847961, "epoch": 4.424433912585571, "grad_norm": 0.30118241906166077, "learning_rate": 7.67114504655168e-05, "loss": 0.17157086730003357, "mean_token_accuracy": 0.9306039363145828, "num_tokens": 103642960.0, "step": 8402 }, { "entropy": 1.2159958481788635, "epoch": 4.424960505529226, "grad_norm": 0.3153426945209503, "learning_rate": 7.669107826752015e-05, "loss": 0.16894468665122986, "mean_token_accuracy": 0.9226904064416885, "num_tokens": 103655296.0, "step": 8403 }, { "entropy": 1.1882687211036682, "epoch": 4.42548709847288, "grad_norm": 0.3680673837661743, "learning_rate": 7.667070804688006e-05, "loss": 0.19156639277935028, "mean_token_accuracy": 0.9129916727542877, "num_tokens": 103667632.0, "step": 8404 }, { "entropy": 1.1941133439540863, "epoch": 4.426013691416535, "grad_norm": 0.3307591676712036, "learning_rate": 7.665033980480579e-05, "loss": 0.18654422461986542, "mean_token_accuracy": 0.923293262720108, "num_tokens": 103679968.0, "step": 8405 }, { "entropy": 1.186953067779541, "epoch": 4.42654028436019, "grad_norm": 0.3209822475910187, "learning_rate": 7.662997354250645e-05, "loss": 0.18281899392604828, "mean_token_accuracy": 0.9238188564777374, "num_tokens": 103692304.0, "step": 8406 }, { "entropy": 1.1703291535377502, "epoch": 4.427066877303844, "grad_norm": 0.31133076548576355, "learning_rate": 7.660960926119107e-05, "loss": 0.17949330806732178, "mean_token_accuracy": 0.919961005449295, "num_tokens": 103704640.0, "step": 8407 }, { "entropy": 1.1952329874038696, "epoch": 4.427593470247499, "grad_norm": 0.32679304480552673, "learning_rate": 7.65892469620686e-05, "loss": 0.1816975623369217, "mean_token_accuracy": 0.9183577597141266, "num_tokens": 103716976.0, "step": 8408 }, { "entropy": 1.1395338773727417, "epoch": 4.4281200631911535, "grad_norm": 0.28885093331336975, "learning_rate": 7.656888664634778e-05, "loss": 0.17022892832756042, "mean_token_accuracy": 0.9255540519952774, "num_tokens": 103729312.0, "step": 8409 }, { "entropy": 1.18154376745224, "epoch": 4.4286466561348075, "grad_norm": 0.30899184942245483, "learning_rate": 7.654852831523732e-05, "loss": 0.17996257543563843, "mean_token_accuracy": 0.924812838435173, "num_tokens": 103741648.0, "step": 8410 }, { "entropy": 1.1718483865261078, "epoch": 4.429173249078462, "grad_norm": 0.3028598725795746, "learning_rate": 7.652817196994577e-05, "loss": 0.15958929061889648, "mean_token_accuracy": 0.9312357604503632, "num_tokens": 103753984.0, "step": 8411 }, { "entropy": 1.2056899666786194, "epoch": 4.429699842022117, "grad_norm": 0.34338873624801636, "learning_rate": 7.650781761168157e-05, "loss": 0.18257784843444824, "mean_token_accuracy": 0.9223008453845978, "num_tokens": 103766320.0, "step": 8412 }, { "entropy": 1.1947410106658936, "epoch": 4.430226434965771, "grad_norm": 0.33735391497612, "learning_rate": 7.648746524165302e-05, "loss": 0.1745343655347824, "mean_token_accuracy": 0.927484929561615, "num_tokens": 103778656.0, "step": 8413 }, { "entropy": 1.1994907557964325, "epoch": 4.430753027909426, "grad_norm": 0.31284675002098083, "learning_rate": 7.646711486106834e-05, "loss": 0.1723497062921524, "mean_token_accuracy": 0.9282457530498505, "num_tokens": 103790992.0, "step": 8414 }, { "entropy": 1.173362910747528, "epoch": 4.431279620853081, "grad_norm": 0.2921752333641052, "learning_rate": 7.644676647113558e-05, "loss": 0.15854358673095703, "mean_token_accuracy": 0.9307354688644409, "num_tokens": 103803328.0, "step": 8415 }, { "entropy": 1.1649015545845032, "epoch": 4.431806213796735, "grad_norm": 0.3033360540866852, "learning_rate": 7.642642007306275e-05, "loss": 0.17482881247997284, "mean_token_accuracy": 0.9215189963579178, "num_tokens": 103815664.0, "step": 8416 }, { "entropy": 1.1332653760910034, "epoch": 4.43233280674039, "grad_norm": 0.294369637966156, "learning_rate": 7.640607566805769e-05, "loss": 0.16559576988220215, "mean_token_accuracy": 0.9328326433897018, "num_tokens": 103828000.0, "step": 8417 }, { "entropy": 1.1266019940376282, "epoch": 4.432859399684045, "grad_norm": 0.2806363105773926, "learning_rate": 7.638573325732811e-05, "loss": 0.16257208585739136, "mean_token_accuracy": 0.9307931661605835, "num_tokens": 103840336.0, "step": 8418 }, { "entropy": 1.1631579399108887, "epoch": 4.433385992627699, "grad_norm": 0.3195684254169464, "learning_rate": 7.636539284208162e-05, "loss": 0.18540135025978088, "mean_token_accuracy": 0.9234038889408112, "num_tokens": 103852672.0, "step": 8419 }, { "entropy": 1.1342191100120544, "epoch": 4.4339125855713535, "grad_norm": 0.30643901228904724, "learning_rate": 7.634505442352573e-05, "loss": 0.162317156791687, "mean_token_accuracy": 0.9350567162036896, "num_tokens": 103865008.0, "step": 8420 }, { "entropy": 1.1070061326026917, "epoch": 4.434439178515008, "grad_norm": 0.2911212742328644, "learning_rate": 7.63247180028678e-05, "loss": 0.16851764917373657, "mean_token_accuracy": 0.930103987455368, "num_tokens": 103877344.0, "step": 8421 }, { "entropy": 1.1462253034114838, "epoch": 4.434965771458662, "grad_norm": 0.29653191566467285, "learning_rate": 7.630438358131506e-05, "loss": 0.1634315401315689, "mean_token_accuracy": 0.9309469014406204, "num_tokens": 103889680.0, "step": 8422 }, { "entropy": 1.1170426607131958, "epoch": 4.435492364402317, "grad_norm": 0.28300195932388306, "learning_rate": 7.628405116007472e-05, "loss": 0.15759967267513275, "mean_token_accuracy": 0.9321088343858719, "num_tokens": 103902016.0, "step": 8423 }, { "entropy": 1.1150572001934052, "epoch": 4.436018957345971, "grad_norm": 0.31304875016212463, "learning_rate": 7.626372074035371e-05, "loss": 0.17278333008289337, "mean_token_accuracy": 0.9233694821596146, "num_tokens": 103914352.0, "step": 8424 }, { "entropy": 1.1611599922180176, "epoch": 4.436545550289626, "grad_norm": 0.31712397933006287, "learning_rate": 7.6243392323359e-05, "loss": 0.16291208565235138, "mean_token_accuracy": 0.9327135235071182, "num_tokens": 103926688.0, "step": 8425 }, { "entropy": 1.1345867216587067, "epoch": 4.437072143233281, "grad_norm": 0.32005640864372253, "learning_rate": 7.622306591029733e-05, "loss": 0.17034733295440674, "mean_token_accuracy": 0.9302045255899429, "num_tokens": 103939024.0, "step": 8426 }, { "entropy": 1.130208432674408, "epoch": 4.437598736176935, "grad_norm": 0.32117676734924316, "learning_rate": 7.620274150237537e-05, "loss": 0.1721271127462387, "mean_token_accuracy": 0.9290124922990799, "num_tokens": 103951360.0, "step": 8427 }, { "entropy": 1.1899872124195099, "epoch": 4.43812532912059, "grad_norm": 0.3016345202922821, "learning_rate": 7.618241910079969e-05, "loss": 0.15409058332443237, "mean_token_accuracy": 0.936784103512764, "num_tokens": 103963696.0, "step": 8428 }, { "entropy": 1.1210709512233734, "epoch": 4.438651922064245, "grad_norm": 0.32231977581977844, "learning_rate": 7.616209870677659e-05, "loss": 0.1683426797389984, "mean_token_accuracy": 0.926812157034874, "num_tokens": 103976032.0, "step": 8429 }, { "entropy": 1.1640322506427765, "epoch": 4.439178515007899, "grad_norm": 0.3329298198223114, "learning_rate": 7.614178032151255e-05, "loss": 0.17446720600128174, "mean_token_accuracy": 0.924039363861084, "num_tokens": 103988368.0, "step": 8430 }, { "entropy": 1.1792564988136292, "epoch": 4.4397051079515535, "grad_norm": 0.3173338770866394, "learning_rate": 7.612146394621364e-05, "loss": 0.17538343369960785, "mean_token_accuracy": 0.9262731224298477, "num_tokens": 104000704.0, "step": 8431 }, { "entropy": 1.1290611922740936, "epoch": 4.440231700895208, "grad_norm": 0.3201102912425995, "learning_rate": 7.610114958208601e-05, "loss": 0.17354167997837067, "mean_token_accuracy": 0.9299298077821732, "num_tokens": 104013040.0, "step": 8432 }, { "entropy": 1.169890135526657, "epoch": 4.440758293838862, "grad_norm": 0.42167460918426514, "learning_rate": 7.608083723033552e-05, "loss": 0.19123922288417816, "mean_token_accuracy": 0.9196564853191376, "num_tokens": 104025376.0, "step": 8433 }, { "entropy": 1.1458514034748077, "epoch": 4.441284886782517, "grad_norm": 0.31748509407043457, "learning_rate": 7.6060526892168e-05, "loss": 0.1763705015182495, "mean_token_accuracy": 0.9211138784885406, "num_tokens": 104037712.0, "step": 8434 }, { "entropy": 1.1005293428897858, "epoch": 4.441811479726172, "grad_norm": 0.29628878831863403, "learning_rate": 7.604021856878922e-05, "loss": 0.15931612253189087, "mean_token_accuracy": 0.9339651465415955, "num_tokens": 104050048.0, "step": 8435 }, { "entropy": 1.152970939874649, "epoch": 4.442338072669826, "grad_norm": 0.3029753863811493, "learning_rate": 7.601991226140467e-05, "loss": 0.1684556007385254, "mean_token_accuracy": 0.927347719669342, "num_tokens": 104062384.0, "step": 8436 }, { "entropy": 1.1114393770694733, "epoch": 4.442864665613481, "grad_norm": 0.34585103392601013, "learning_rate": 7.599960797121995e-05, "loss": 0.17668956518173218, "mean_token_accuracy": 0.9263940453529358, "num_tokens": 104074720.0, "step": 8437 }, { "entropy": 1.1421588361263275, "epoch": 4.443391258557135, "grad_norm": 0.30870088934898376, "learning_rate": 7.597930569944029e-05, "loss": 0.1706380546092987, "mean_token_accuracy": 0.9274469017982483, "num_tokens": 104087056.0, "step": 8438 }, { "entropy": 1.1632334291934967, "epoch": 4.44391785150079, "grad_norm": 0.323515921831131, "learning_rate": 7.5959005447271e-05, "loss": 0.1692359447479248, "mean_token_accuracy": 0.9250432997941971, "num_tokens": 104099392.0, "step": 8439 }, { "entropy": 1.1219305992126465, "epoch": 4.444444444444445, "grad_norm": 0.30658406019210815, "learning_rate": 7.593870721591714e-05, "loss": 0.15897363424301147, "mean_token_accuracy": 0.9280763119459152, "num_tokens": 104111728.0, "step": 8440 }, { "entropy": 1.1651221811771393, "epoch": 4.444971037388099, "grad_norm": 0.31844380497932434, "learning_rate": 7.591841100658371e-05, "loss": 0.16563773155212402, "mean_token_accuracy": 0.9349388629198074, "num_tokens": 104124064.0, "step": 8441 }, { "entropy": 1.1618649363517761, "epoch": 4.4454976303317535, "grad_norm": 0.33157169818878174, "learning_rate": 7.589811682047556e-05, "loss": 0.17135582864284515, "mean_token_accuracy": 0.9291810691356659, "num_tokens": 104136400.0, "step": 8442 }, { "entropy": 1.146396517753601, "epoch": 4.446024223275408, "grad_norm": 0.30438268184661865, "learning_rate": 7.587782465879743e-05, "loss": 0.16211694478988647, "mean_token_accuracy": 0.9298663437366486, "num_tokens": 104148736.0, "step": 8443 }, { "entropy": 1.1388017237186432, "epoch": 4.446550816219062, "grad_norm": 0.3000304400920868, "learning_rate": 7.585753452275401e-05, "loss": 0.170515239238739, "mean_token_accuracy": 0.9270701557397842, "num_tokens": 104161072.0, "step": 8444 }, { "entropy": 1.117406189441681, "epoch": 4.447077409162717, "grad_norm": 0.2809015214443207, "learning_rate": 7.583724641354975e-05, "loss": 0.1588825285434723, "mean_token_accuracy": 0.9333102852106094, "num_tokens": 104173408.0, "step": 8445 }, { "entropy": 1.1422425508499146, "epoch": 4.447604002106372, "grad_norm": 0.2744351029396057, "learning_rate": 7.581696033238907e-05, "loss": 0.14139851927757263, "mean_token_accuracy": 0.9374795705080032, "num_tokens": 104185744.0, "step": 8446 }, { "entropy": 1.1064694821834564, "epoch": 4.448130595050026, "grad_norm": 0.31977495551109314, "learning_rate": 7.579667628047622e-05, "loss": 0.17230455577373505, "mean_token_accuracy": 0.9253697097301483, "num_tokens": 104198080.0, "step": 8447 }, { "entropy": 1.1942217946052551, "epoch": 4.448657187993681, "grad_norm": 0.3635144531726837, "learning_rate": 7.577639425901534e-05, "loss": 0.17706610262393951, "mean_token_accuracy": 0.926745280623436, "num_tokens": 104210416.0, "step": 8448 }, { "entropy": 1.1594175398349762, "epoch": 4.449183780937336, "grad_norm": 0.33133333921432495, "learning_rate": 7.575611426921048e-05, "loss": 0.16024044156074524, "mean_token_accuracy": 0.9303994327783585, "num_tokens": 104222752.0, "step": 8449 }, { "entropy": 1.1542670130729675, "epoch": 4.44971037388099, "grad_norm": 0.3534603416919708, "learning_rate": 7.573583631226546e-05, "loss": 0.19002632796764374, "mean_token_accuracy": 0.9212928414344788, "num_tokens": 104235088.0, "step": 8450 }, { "entropy": 1.10170778632164, "epoch": 4.450236966824645, "grad_norm": 0.32598719000816345, "learning_rate": 7.57155603893842e-05, "loss": 0.17832794785499573, "mean_token_accuracy": 0.9255920499563217, "num_tokens": 104247424.0, "step": 8451 }, { "entropy": 1.148159921169281, "epoch": 4.4507635597682995, "grad_norm": 0.33278730511665344, "learning_rate": 7.569528650177029e-05, "loss": 0.1623687446117401, "mean_token_accuracy": 0.932820126414299, "num_tokens": 104259760.0, "step": 8452 }, { "entropy": 1.1053113639354706, "epoch": 4.4512901527119535, "grad_norm": 0.3084471523761749, "learning_rate": 7.567501465062728e-05, "loss": 0.16041335463523865, "mean_token_accuracy": 0.9310987293720245, "num_tokens": 104272096.0, "step": 8453 }, { "entropy": 1.2006906270980835, "epoch": 4.451816745655608, "grad_norm": 0.4248177707195282, "learning_rate": 7.565474483715858e-05, "loss": 0.17785029113292694, "mean_token_accuracy": 0.9251182526350021, "num_tokens": 104284432.0, "step": 8454 }, { "entropy": 1.0966787934303284, "epoch": 4.452343338599263, "grad_norm": 0.3300796449184418, "learning_rate": 7.563447706256747e-05, "loss": 0.1696946769952774, "mean_token_accuracy": 0.9282518625259399, "num_tokens": 104296768.0, "step": 8455 }, { "entropy": 1.1123622953891754, "epoch": 4.452869931542917, "grad_norm": 0.3217577040195465, "learning_rate": 7.56142113280572e-05, "loss": 0.17596352100372314, "mean_token_accuracy": 0.9228823781013489, "num_tokens": 104309104.0, "step": 8456 }, { "entropy": 1.1256005465984344, "epoch": 4.453396524486572, "grad_norm": 0.3379938304424286, "learning_rate": 7.559394763483075e-05, "loss": 0.16395236551761627, "mean_token_accuracy": 0.9304747730493546, "num_tokens": 104321440.0, "step": 8457 }, { "entropy": 1.1497615575790405, "epoch": 4.453923117430226, "grad_norm": 0.33467888832092285, "learning_rate": 7.557368598409111e-05, "loss": 0.17233118414878845, "mean_token_accuracy": 0.9285077452659607, "num_tokens": 104333776.0, "step": 8458 }, { "entropy": 1.1492519974708557, "epoch": 4.454449710373881, "grad_norm": 0.32112306356430054, "learning_rate": 7.555342637704108e-05, "loss": 0.178175151348114, "mean_token_accuracy": 0.9256938993930817, "num_tokens": 104346112.0, "step": 8459 }, { "entropy": 1.1114400625228882, "epoch": 4.454976303317536, "grad_norm": 0.31285762786865234, "learning_rate": 7.553316881488337e-05, "loss": 0.16353988647460938, "mean_token_accuracy": 0.9300347864627838, "num_tokens": 104358448.0, "step": 8460 }, { "entropy": 1.1686404645442963, "epoch": 4.45550289626119, "grad_norm": 0.3369942307472229, "learning_rate": 7.551291329882053e-05, "loss": 0.17610526084899902, "mean_token_accuracy": 0.923306405544281, "num_tokens": 104370784.0, "step": 8461 }, { "entropy": 1.1252988278865814, "epoch": 4.456029489204845, "grad_norm": 0.3011777997016907, "learning_rate": 7.549265983005504e-05, "loss": 0.16479860246181488, "mean_token_accuracy": 0.9301632195711136, "num_tokens": 104383120.0, "step": 8462 }, { "entropy": 1.2057690620422363, "epoch": 4.4565560821484995, "grad_norm": 0.33670660853385925, "learning_rate": 7.547240840978922e-05, "loss": 0.1779303252696991, "mean_token_accuracy": 0.9197793751955032, "num_tokens": 104395456.0, "step": 8463 }, { "entropy": 1.1532905399799347, "epoch": 4.4570826750921535, "grad_norm": 0.315647691488266, "learning_rate": 7.545215903922524e-05, "loss": 0.1743641197681427, "mean_token_accuracy": 0.9221219271421432, "num_tokens": 104407792.0, "step": 8464 }, { "entropy": 1.1454414129257202, "epoch": 4.457609268035808, "grad_norm": 0.3356110155582428, "learning_rate": 7.543191171956519e-05, "loss": 0.18045343458652496, "mean_token_accuracy": 0.9212951511144638, "num_tokens": 104420128.0, "step": 8465 }, { "entropy": 1.1666088700294495, "epoch": 4.458135860979463, "grad_norm": 0.31954318284988403, "learning_rate": 7.541166645201112e-05, "loss": 0.1708226501941681, "mean_token_accuracy": 0.9309587478637695, "num_tokens": 104432464.0, "step": 8466 }, { "entropy": 1.1739060282707214, "epoch": 4.458662453923117, "grad_norm": 0.32615551352500916, "learning_rate": 7.539142323776478e-05, "loss": 0.1824362874031067, "mean_token_accuracy": 0.9265118688344955, "num_tokens": 104444800.0, "step": 8467 }, { "entropy": 1.1715387403964996, "epoch": 4.459189046866772, "grad_norm": 0.3394647538661957, "learning_rate": 7.537118207802796e-05, "loss": 0.18361705541610718, "mean_token_accuracy": 0.9243173897266388, "num_tokens": 104457136.0, "step": 8468 }, { "entropy": 1.125695139169693, "epoch": 4.459715639810426, "grad_norm": 0.336599200963974, "learning_rate": 7.53509429740022e-05, "loss": 0.17182287573814392, "mean_token_accuracy": 0.9275820404291153, "num_tokens": 104469472.0, "step": 8469 }, { "entropy": 1.167458951473236, "epoch": 4.460242232754081, "grad_norm": 0.30065464973449707, "learning_rate": 7.533070592688902e-05, "loss": 0.1620563268661499, "mean_token_accuracy": 0.9307129085063934, "num_tokens": 104481808.0, "step": 8470 }, { "entropy": 1.1041797399520874, "epoch": 4.460768825697736, "grad_norm": 0.3129633665084839, "learning_rate": 7.531047093788977e-05, "loss": 0.16948609054088593, "mean_token_accuracy": 0.931243821978569, "num_tokens": 104494144.0, "step": 8471 }, { "entropy": 1.201309859752655, "epoch": 4.46129541864139, "grad_norm": 0.3466167151927948, "learning_rate": 7.529023800820563e-05, "loss": 0.18264959752559662, "mean_token_accuracy": 0.9177737534046173, "num_tokens": 104506480.0, "step": 8472 }, { "entropy": 1.173547476530075, "epoch": 4.461822011585045, "grad_norm": 0.31830111145973206, "learning_rate": 7.52700071390378e-05, "loss": 0.18476280570030212, "mean_token_accuracy": 0.9239428043365479, "num_tokens": 104518816.0, "step": 8473 }, { "entropy": 1.1615335941314697, "epoch": 4.4623486045286995, "grad_norm": 0.31656646728515625, "learning_rate": 7.524977833158722e-05, "loss": 0.1678553819656372, "mean_token_accuracy": 0.9285225719213486, "num_tokens": 104531152.0, "step": 8474 }, { "entropy": 1.1629353165626526, "epoch": 4.4628751974723535, "grad_norm": 0.29458194971084595, "learning_rate": 7.522955158705474e-05, "loss": 0.1683681160211563, "mean_token_accuracy": 0.9332570284605026, "num_tokens": 104543488.0, "step": 8475 }, { "entropy": 1.1883186399936676, "epoch": 4.463401790416008, "grad_norm": 0.34101203083992004, "learning_rate": 7.520932690664115e-05, "loss": 0.16952675580978394, "mean_token_accuracy": 0.9276389330625534, "num_tokens": 104555824.0, "step": 8476 }, { "entropy": 1.1620250940322876, "epoch": 4.463928383359663, "grad_norm": 0.2982504069805145, "learning_rate": 7.518910429154704e-05, "loss": 0.15610679984092712, "mean_token_accuracy": 0.9357586652040482, "num_tokens": 104568160.0, "step": 8477 }, { "entropy": 1.197614997625351, "epoch": 4.464454976303317, "grad_norm": 0.30682411789894104, "learning_rate": 7.516888374297291e-05, "loss": 0.1719253957271576, "mean_token_accuracy": 0.9263016879558563, "num_tokens": 104580496.0, "step": 8478 }, { "entropy": 1.1783290803432465, "epoch": 4.464981569246972, "grad_norm": 0.3327757716178894, "learning_rate": 7.514866526211912e-05, "loss": 0.17140227556228638, "mean_token_accuracy": 0.9275024682283401, "num_tokens": 104592832.0, "step": 8479 }, { "entropy": 1.162148356437683, "epoch": 4.465508162190627, "grad_norm": 0.3191398084163666, "learning_rate": 7.512844885018594e-05, "loss": 0.1670476347208023, "mean_token_accuracy": 0.9323391020298004, "num_tokens": 104605168.0, "step": 8480 }, { "entropy": 1.1739769876003265, "epoch": 4.466034755134281, "grad_norm": 0.3413907587528229, "learning_rate": 7.510823450837356e-05, "loss": 0.18024437129497528, "mean_token_accuracy": 0.9216061383485794, "num_tokens": 104617504.0, "step": 8481 }, { "entropy": 1.162779986858368, "epoch": 4.466561348077936, "grad_norm": 0.3138342797756195, "learning_rate": 7.508802223788189e-05, "loss": 0.16494205594062805, "mean_token_accuracy": 0.9311954081058502, "num_tokens": 104629840.0, "step": 8482 }, { "entropy": 1.1326565444469452, "epoch": 4.467087941021591, "grad_norm": 0.3279440999031067, "learning_rate": 7.506781203991089e-05, "loss": 0.17870019376277924, "mean_token_accuracy": 0.9224427193403244, "num_tokens": 104642176.0, "step": 8483 }, { "entropy": 1.1368190050125122, "epoch": 4.467614533965245, "grad_norm": 0.3391387462615967, "learning_rate": 7.504760391566025e-05, "loss": 0.17431044578552246, "mean_token_accuracy": 0.9252381324768066, "num_tokens": 104654512.0, "step": 8484 }, { "entropy": 1.1795203983783722, "epoch": 4.4681411269088995, "grad_norm": 0.3195769488811493, "learning_rate": 7.502739786632968e-05, "loss": 0.1850837767124176, "mean_token_accuracy": 0.9250011593103409, "num_tokens": 104666848.0, "step": 8485 }, { "entropy": 1.0992188155651093, "epoch": 4.468667719852554, "grad_norm": 0.2884109318256378, "learning_rate": 7.500719389311864e-05, "loss": 0.16247399151325226, "mean_token_accuracy": 0.9310379177331924, "num_tokens": 104679184.0, "step": 8486 }, { "entropy": 1.1694341599941254, "epoch": 4.469194312796208, "grad_norm": 0.35028311610221863, "learning_rate": 7.498699199722654e-05, "loss": 0.1847420036792755, "mean_token_accuracy": 0.9226665943861008, "num_tokens": 104691520.0, "step": 8487 }, { "entropy": 1.1405926644802094, "epoch": 4.469720905739863, "grad_norm": 0.2975562810897827, "learning_rate": 7.496679217985267e-05, "loss": 0.1603151559829712, "mean_token_accuracy": 0.9311546981334686, "num_tokens": 104703856.0, "step": 8488 }, { "entropy": 1.1884474158287048, "epoch": 4.470247498683517, "grad_norm": 0.3177323341369629, "learning_rate": 7.494659444219616e-05, "loss": 0.15342968702316284, "mean_token_accuracy": 0.9374910742044449, "num_tokens": 104716192.0, "step": 8489 }, { "entropy": 1.1844165325164795, "epoch": 4.470774091627172, "grad_norm": 0.32195863127708435, "learning_rate": 7.492639878545604e-05, "loss": 0.17014195024967194, "mean_token_accuracy": 0.9291600584983826, "num_tokens": 104728528.0, "step": 8490 }, { "entropy": 1.158256620168686, "epoch": 4.471300684570827, "grad_norm": 0.29549679160118103, "learning_rate": 7.490620521083119e-05, "loss": 0.1600731909275055, "mean_token_accuracy": 0.9307269752025604, "num_tokens": 104740864.0, "step": 8491 }, { "entropy": 1.1640253365039825, "epoch": 4.471827277514481, "grad_norm": 0.3163624703884125, "learning_rate": 7.48860137195204e-05, "loss": 0.1576489955186844, "mean_token_accuracy": 0.9304119348526001, "num_tokens": 104753200.0, "step": 8492 }, { "entropy": 1.1176630556583405, "epoch": 4.472353870458136, "grad_norm": 0.3096276521682739, "learning_rate": 7.486582431272227e-05, "loss": 0.17143644392490387, "mean_token_accuracy": 0.9221581369638443, "num_tokens": 104765536.0, "step": 8493 }, { "entropy": 1.1509735584259033, "epoch": 4.472880463401791, "grad_norm": 0.31744223833084106, "learning_rate": 7.48456369916354e-05, "loss": 0.18509355187416077, "mean_token_accuracy": 0.9221777617931366, "num_tokens": 104777872.0, "step": 8494 }, { "entropy": 1.1565062999725342, "epoch": 4.473407056345445, "grad_norm": 0.32583150267601013, "learning_rate": 7.482545175745819e-05, "loss": 0.16323620080947876, "mean_token_accuracy": 0.9322451949119568, "num_tokens": 104790208.0, "step": 8495 }, { "entropy": 1.1247378885746002, "epoch": 4.4739336492890995, "grad_norm": 0.28839007019996643, "learning_rate": 7.48052686113889e-05, "loss": 0.16859430074691772, "mean_token_accuracy": 0.926827684044838, "num_tokens": 104802544.0, "step": 8496 }, { "entropy": 1.1516145467758179, "epoch": 4.474460242232754, "grad_norm": 0.32340723276138306, "learning_rate": 7.478508755462568e-05, "loss": 0.168523907661438, "mean_token_accuracy": 0.925041526556015, "num_tokens": 104814880.0, "step": 8497 }, { "entropy": 1.1144302487373352, "epoch": 4.474986835176408, "grad_norm": 0.29585084319114685, "learning_rate": 7.476490858836655e-05, "loss": 0.1568192094564438, "mean_token_accuracy": 0.9378913789987564, "num_tokens": 104827216.0, "step": 8498 }, { "entropy": 1.124032586812973, "epoch": 4.475513428120063, "grad_norm": 0.3131750226020813, "learning_rate": 7.474473171380942e-05, "loss": 0.17422203719615936, "mean_token_accuracy": 0.9270296394824982, "num_tokens": 104839552.0, "step": 8499 }, { "entropy": 1.170444518327713, "epoch": 4.476040021063718, "grad_norm": 0.3095943331718445, "learning_rate": 7.472455693215207e-05, "loss": 0.1751677393913269, "mean_token_accuracy": 0.9230714440345764, "num_tokens": 104851888.0, "step": 8500 }, { "entropy": 1.1354945302009583, "epoch": 4.476566614007372, "grad_norm": 0.3480255603790283, "learning_rate": 7.470438424459221e-05, "loss": 0.17664237320423126, "mean_token_accuracy": 0.9248726069927216, "num_tokens": 104864224.0, "step": 8501 }, { "entropy": 1.1977665424346924, "epoch": 4.477093206951027, "grad_norm": 0.3040744662284851, "learning_rate": 7.468421365232733e-05, "loss": 0.1657549887895584, "mean_token_accuracy": 0.9289834946393967, "num_tokens": 104876560.0, "step": 8502 }, { "entropy": 1.111277014017105, "epoch": 4.477619799894681, "grad_norm": 0.30074837803840637, "learning_rate": 7.466404515655485e-05, "loss": 0.1681838482618332, "mean_token_accuracy": 0.9249631613492966, "num_tokens": 104888896.0, "step": 8503 }, { "entropy": 1.0993533730506897, "epoch": 4.478146392838336, "grad_norm": 0.3021378517150879, "learning_rate": 7.464387875847205e-05, "loss": 0.16494373977184296, "mean_token_accuracy": 0.9283095747232437, "num_tokens": 104901232.0, "step": 8504 }, { "entropy": 1.1367763876914978, "epoch": 4.478672985781991, "grad_norm": 0.3028930127620697, "learning_rate": 7.462371445927612e-05, "loss": 0.16392675042152405, "mean_token_accuracy": 0.9312854111194611, "num_tokens": 104913568.0, "step": 8505 }, { "entropy": 1.1491846442222595, "epoch": 4.479199578725645, "grad_norm": 0.3246096670627594, "learning_rate": 7.460355226016405e-05, "loss": 0.18212057650089264, "mean_token_accuracy": 0.9192562699317932, "num_tokens": 104925904.0, "step": 8506 }, { "entropy": 1.1474373042583466, "epoch": 4.4797261716692995, "grad_norm": 0.31376343965530396, "learning_rate": 7.458339216233276e-05, "loss": 0.159938246011734, "mean_token_accuracy": 0.9344170987606049, "num_tokens": 104938240.0, "step": 8507 }, { "entropy": 1.1231917142868042, "epoch": 4.480252764612954, "grad_norm": 0.30059564113616943, "learning_rate": 7.456323416697909e-05, "loss": 0.16879117488861084, "mean_token_accuracy": 0.9291982054710388, "num_tokens": 104950576.0, "step": 8508 }, { "entropy": 1.1523529291152954, "epoch": 4.480779357556608, "grad_norm": 0.3439018726348877, "learning_rate": 7.454307827529962e-05, "loss": 0.18372313678264618, "mean_token_accuracy": 0.9249345660209656, "num_tokens": 104962912.0, "step": 8509 }, { "entropy": 1.124235212802887, "epoch": 4.481305950500263, "grad_norm": 0.31315478682518005, "learning_rate": 7.452292448849099e-05, "loss": 0.15979686379432678, "mean_token_accuracy": 0.9314919114112854, "num_tokens": 104975248.0, "step": 8510 }, { "entropy": 1.118671476840973, "epoch": 4.481832543443918, "grad_norm": 0.30271604657173157, "learning_rate": 7.450277280774953e-05, "loss": 0.16365578770637512, "mean_token_accuracy": 0.9299983978271484, "num_tokens": 104987584.0, "step": 8511 }, { "entropy": 1.1343393325805664, "epoch": 4.482359136387572, "grad_norm": 0.34993165731430054, "learning_rate": 7.448262323427157e-05, "loss": 0.1759578436613083, "mean_token_accuracy": 0.9217237085103989, "num_tokens": 104999920.0, "step": 8512 }, { "entropy": 1.144093632698059, "epoch": 4.482885729331227, "grad_norm": 0.3411248028278351, "learning_rate": 7.446247576925325e-05, "loss": 0.18619801104068756, "mean_token_accuracy": 0.9250534325838089, "num_tokens": 105012256.0, "step": 8513 }, { "entropy": 1.1944924592971802, "epoch": 4.483412322274882, "grad_norm": 0.33487844467163086, "learning_rate": 7.444233041389057e-05, "loss": 0.16586452722549438, "mean_token_accuracy": 0.9306043982505798, "num_tokens": 105024592.0, "step": 8514 }, { "entropy": 1.1001003682613373, "epoch": 4.483938915218536, "grad_norm": 0.3087322413921356, "learning_rate": 7.442218716937954e-05, "loss": 0.16738297045230865, "mean_token_accuracy": 0.9300091564655304, "num_tokens": 105036928.0, "step": 8515 }, { "entropy": 1.1125937104225159, "epoch": 4.484465508162191, "grad_norm": 0.302702397108078, "learning_rate": 7.44020460369159e-05, "loss": 0.15746758878231049, "mean_token_accuracy": 0.9346013367176056, "num_tokens": 105049264.0, "step": 8516 }, { "entropy": 1.1246448755264282, "epoch": 4.484992101105846, "grad_norm": 0.3068924844264984, "learning_rate": 7.438190701769528e-05, "loss": 0.15912923216819763, "mean_token_accuracy": 0.9279821664094925, "num_tokens": 105061600.0, "step": 8517 }, { "entropy": 1.1221618354320526, "epoch": 4.4855186940494995, "grad_norm": 0.3064675033092499, "learning_rate": 7.436177011291323e-05, "loss": 0.1689017415046692, "mean_token_accuracy": 0.9291050136089325, "num_tokens": 105073936.0, "step": 8518 }, { "entropy": 1.0712625682353973, "epoch": 4.486045286993154, "grad_norm": 0.2907482087612152, "learning_rate": 7.434163532376521e-05, "loss": 0.15641829371452332, "mean_token_accuracy": 0.9321083426475525, "num_tokens": 105086272.0, "step": 8519 }, { "entropy": 1.0565262734889984, "epoch": 4.486571879936809, "grad_norm": 0.30794206261634827, "learning_rate": 7.432150265144643e-05, "loss": 0.16304053366184235, "mean_token_accuracy": 0.9296928197145462, "num_tokens": 105098608.0, "step": 8520 }, { "entropy": 1.104030430316925, "epoch": 4.487098472880463, "grad_norm": 0.485408753156662, "learning_rate": 7.430137209715211e-05, "loss": 0.18189111351966858, "mean_token_accuracy": 0.924937978386879, "num_tokens": 105110944.0, "step": 8521 }, { "entropy": 1.0996279120445251, "epoch": 4.487625065824118, "grad_norm": 0.312265008687973, "learning_rate": 7.428124366207727e-05, "loss": 0.1506020873785019, "mean_token_accuracy": 0.933230385184288, "num_tokens": 105123280.0, "step": 8522 }, { "entropy": 1.1094778776168823, "epoch": 4.488151658767772, "grad_norm": 0.3368557393550873, "learning_rate": 7.426111734741679e-05, "loss": 0.17881613969802856, "mean_token_accuracy": 0.9285390824079514, "num_tokens": 105135616.0, "step": 8523 }, { "entropy": 1.140645056962967, "epoch": 4.488678251711427, "grad_norm": 0.3306402266025543, "learning_rate": 7.424099315436548e-05, "loss": 0.17833511531352997, "mean_token_accuracy": 0.9260087609291077, "num_tokens": 105147952.0, "step": 8524 }, { "entropy": 1.1619056463241577, "epoch": 4.489204844655082, "grad_norm": 0.33646610379219055, "learning_rate": 7.4220871084118e-05, "loss": 0.16644509136676788, "mean_token_accuracy": 0.9322192668914795, "num_tokens": 105160288.0, "step": 8525 }, { "entropy": 1.085435301065445, "epoch": 4.489731437598736, "grad_norm": 0.30755895376205444, "learning_rate": 7.420075113786886e-05, "loss": 0.16950206458568573, "mean_token_accuracy": 0.9276347011327744, "num_tokens": 105172624.0, "step": 8526 }, { "entropy": 1.086694598197937, "epoch": 4.490258030542391, "grad_norm": 0.31825414299964905, "learning_rate": 7.418063331681247e-05, "loss": 0.16300199925899506, "mean_token_accuracy": 0.9320763200521469, "num_tokens": 105184960.0, "step": 8527 }, { "entropy": 1.153379887342453, "epoch": 4.490784623486046, "grad_norm": 0.3786374628543854, "learning_rate": 7.416051762214307e-05, "loss": 0.1907190978527069, "mean_token_accuracy": 0.9148112684488297, "num_tokens": 105197296.0, "step": 8528 }, { "entropy": 1.0967216789722443, "epoch": 4.4913112164296995, "grad_norm": 0.32600608468055725, "learning_rate": 7.41404040550549e-05, "loss": 0.1884557604789734, "mean_token_accuracy": 0.9216152876615524, "num_tokens": 105209632.0, "step": 8529 }, { "entropy": 1.1392711102962494, "epoch": 4.491837809373354, "grad_norm": 0.33852773904800415, "learning_rate": 7.412029261674191e-05, "loss": 0.17196306586265564, "mean_token_accuracy": 0.9291158318519592, "num_tokens": 105221968.0, "step": 8530 }, { "entropy": 1.1099463403224945, "epoch": 4.492364402317009, "grad_norm": 0.30658501386642456, "learning_rate": 7.410018330839805e-05, "loss": 0.1679382622241974, "mean_token_accuracy": 0.9314810335636139, "num_tokens": 105234304.0, "step": 8531 }, { "entropy": 1.1185071468353271, "epoch": 4.492890995260663, "grad_norm": 0.3201732337474823, "learning_rate": 7.408007613121706e-05, "loss": 0.17588239908218384, "mean_token_accuracy": 0.9251694977283478, "num_tokens": 105246640.0, "step": 8532 }, { "entropy": 1.0944017171859741, "epoch": 4.493417588204318, "grad_norm": 0.3167847692966461, "learning_rate": 7.405997108639258e-05, "loss": 0.17677423357963562, "mean_token_accuracy": 0.924406886100769, "num_tokens": 105258976.0, "step": 8533 }, { "entropy": 1.1053787171840668, "epoch": 4.493944181147973, "grad_norm": 0.30526003241539, "learning_rate": 7.403986817511814e-05, "loss": 0.16546492278575897, "mean_token_accuracy": 0.9274102002382278, "num_tokens": 105271312.0, "step": 8534 }, { "entropy": 1.087305873632431, "epoch": 4.494470774091627, "grad_norm": 0.32260844111442566, "learning_rate": 7.401976739858714e-05, "loss": 0.1721532940864563, "mean_token_accuracy": 0.9245280623435974, "num_tokens": 105283648.0, "step": 8535 }, { "entropy": 1.149102807044983, "epoch": 4.494997367035282, "grad_norm": 0.3301563858985901, "learning_rate": 7.399966875799282e-05, "loss": 0.1612205058336258, "mean_token_accuracy": 0.930897980928421, "num_tokens": 105295984.0, "step": 8536 }, { "entropy": 1.1381434500217438, "epoch": 4.495523959978936, "grad_norm": 0.3319721817970276, "learning_rate": 7.397957225452838e-05, "loss": 0.17157316207885742, "mean_token_accuracy": 0.9277976751327515, "num_tokens": 105308320.0, "step": 8537 }, { "entropy": 1.0968379527330399, "epoch": 4.496050552922591, "grad_norm": 0.3020884394645691, "learning_rate": 7.395947788938677e-05, "loss": 0.16621725261211395, "mean_token_accuracy": 0.9268390387296677, "num_tokens": 105320656.0, "step": 8538 }, { "entropy": 1.1605389714241028, "epoch": 4.496577145866246, "grad_norm": 0.3507307469844818, "learning_rate": 7.393938566376091e-05, "loss": 0.16039294004440308, "mean_token_accuracy": 0.9318993240594864, "num_tokens": 105332992.0, "step": 8539 }, { "entropy": 1.137021780014038, "epoch": 4.4971037388098996, "grad_norm": 0.32756632566452026, "learning_rate": 7.391929557884354e-05, "loss": 0.16134996712207794, "mean_token_accuracy": 0.9335807263851166, "num_tokens": 105345328.0, "step": 8540 }, { "entropy": 1.0737043917179108, "epoch": 4.497630331753554, "grad_norm": 0.3067854940891266, "learning_rate": 7.389920763582729e-05, "loss": 0.16501881182193756, "mean_token_accuracy": 0.9256889075040817, "num_tokens": 105357664.0, "step": 8541 }, { "entropy": 1.1259743571281433, "epoch": 4.498156924697209, "grad_norm": 0.3393458127975464, "learning_rate": 7.387912183590466e-05, "loss": 0.17241157591342926, "mean_token_accuracy": 0.9270386695861816, "num_tokens": 105370000.0, "step": 8542 }, { "entropy": 1.117572009563446, "epoch": 4.498683517640863, "grad_norm": 0.3278200030326843, "learning_rate": 7.385903818026804e-05, "loss": 0.16908778250217438, "mean_token_accuracy": 0.9263511300086975, "num_tokens": 105382336.0, "step": 8543 }, { "entropy": 1.0400933921337128, "epoch": 4.499210110584518, "grad_norm": 0.31926998496055603, "learning_rate": 7.383895667010969e-05, "loss": 0.17449776828289032, "mean_token_accuracy": 0.9278433322906494, "num_tokens": 105394672.0, "step": 8544 }, { "entropy": 1.1213461458683014, "epoch": 4.499736703528173, "grad_norm": 0.3107103705406189, "learning_rate": 7.381887730662176e-05, "loss": 0.15966379642486572, "mean_token_accuracy": 0.9357942491769791, "num_tokens": 105407008.0, "step": 8545 }, { "entropy": 1.088557094335556, "epoch": 4.500263296471827, "grad_norm": 0.33047419786453247, "learning_rate": 7.379880009099616e-05, "loss": 0.16721244156360626, "mean_token_accuracy": 0.9257785826921463, "num_tokens": 105419344.0, "step": 8546 }, { "entropy": 1.118956983089447, "epoch": 4.500789889415482, "grad_norm": 0.31375518441200256, "learning_rate": 7.377872502442483e-05, "loss": 0.15484580397605896, "mean_token_accuracy": 0.936336100101471, "num_tokens": 105431680.0, "step": 8547 }, { "entropy": 1.080495923757553, "epoch": 4.501316482359137, "grad_norm": 0.27866771817207336, "learning_rate": 7.375865210809945e-05, "loss": 0.1486835777759552, "mean_token_accuracy": 0.9381964206695557, "num_tokens": 105444016.0, "step": 8548 }, { "entropy": 1.0975594818592072, "epoch": 4.501843075302791, "grad_norm": 0.3373928368091583, "learning_rate": 7.373858134321168e-05, "loss": 0.17517077922821045, "mean_token_accuracy": 0.9238870292901993, "num_tokens": 105456352.0, "step": 8549 }, { "entropy": 1.136119544506073, "epoch": 4.502369668246446, "grad_norm": 0.3324989080429077, "learning_rate": 7.371851273095297e-05, "loss": 0.16266067326068878, "mean_token_accuracy": 0.9347175359725952, "num_tokens": 105468688.0, "step": 8550 }, { "entropy": 1.0626960098743439, "epoch": 4.5028962611901004, "grad_norm": 0.2993353307247162, "learning_rate": 7.36984462725147e-05, "loss": 0.15661530196666718, "mean_token_accuracy": 0.9310466200113297, "num_tokens": 105481024.0, "step": 8551 }, { "entropy": 1.086951494216919, "epoch": 4.503422854133754, "grad_norm": 0.33778616786003113, "learning_rate": 7.36783819690881e-05, "loss": 0.1886535882949829, "mean_token_accuracy": 0.9179743528366089, "num_tokens": 105493360.0, "step": 8552 }, { "entropy": 1.052822306752205, "epoch": 4.503949447077409, "grad_norm": 0.30305930972099304, "learning_rate": 7.365831982186427e-05, "loss": 0.1595156341791153, "mean_token_accuracy": 0.9331249743700027, "num_tokens": 105505696.0, "step": 8553 }, { "entropy": 1.0562293082475662, "epoch": 4.504476040021064, "grad_norm": 0.2993280291557312, "learning_rate": 7.363825983203416e-05, "loss": 0.15765467286109924, "mean_token_accuracy": 0.933802455663681, "num_tokens": 105518032.0, "step": 8554 }, { "entropy": 1.0926483571529388, "epoch": 4.505002632964718, "grad_norm": 0.304964542388916, "learning_rate": 7.361820200078867e-05, "loss": 0.1578100025653839, "mean_token_accuracy": 0.9362167567014694, "num_tokens": 105530368.0, "step": 8555 }, { "entropy": 1.0794464945793152, "epoch": 4.505529225908373, "grad_norm": 0.3184886872768402, "learning_rate": 7.359814632931842e-05, "loss": 0.16962140798568726, "mean_token_accuracy": 0.9269872158765793, "num_tokens": 105542704.0, "step": 8556 }, { "entropy": 1.0823484659194946, "epoch": 4.506055818852027, "grad_norm": 0.3482179641723633, "learning_rate": 7.35780928188141e-05, "loss": 0.16899374127388, "mean_token_accuracy": 0.9297892153263092, "num_tokens": 105555040.0, "step": 8557 }, { "entropy": 1.0916792750358582, "epoch": 4.506582411795682, "grad_norm": 0.30531033873558044, "learning_rate": 7.35580414704661e-05, "loss": 0.1647178828716278, "mean_token_accuracy": 0.9307073503732681, "num_tokens": 105567376.0, "step": 8558 }, { "entropy": 1.0854963660240173, "epoch": 4.507109004739337, "grad_norm": 0.3209065794944763, "learning_rate": 7.353799228546481e-05, "loss": 0.17538440227508545, "mean_token_accuracy": 0.924390122294426, "num_tokens": 105579712.0, "step": 8559 }, { "entropy": 1.061386227607727, "epoch": 4.507635597682991, "grad_norm": 0.3283348083496094, "learning_rate": 7.351794526500038e-05, "loss": 0.1658862680196762, "mean_token_accuracy": 0.9272024780511856, "num_tokens": 105592048.0, "step": 8560 }, { "entropy": 1.0981746166944504, "epoch": 4.508162190626646, "grad_norm": 0.3161288797855377, "learning_rate": 7.349790041026292e-05, "loss": 0.16507594287395477, "mean_token_accuracy": 0.937386766076088, "num_tokens": 105604384.0, "step": 8561 }, { "entropy": 1.1265353560447693, "epoch": 4.5086887835703005, "grad_norm": 0.3288407027721405, "learning_rate": 7.347785772244236e-05, "loss": 0.18043377995491028, "mean_token_accuracy": 0.924061119556427, "num_tokens": 105616720.0, "step": 8562 }, { "entropy": 1.140741229057312, "epoch": 4.509215376513954, "grad_norm": 0.3171781003475189, "learning_rate": 7.345781720272849e-05, "loss": 0.16179314255714417, "mean_token_accuracy": 0.9300349056720734, "num_tokens": 105629056.0, "step": 8563 }, { "entropy": 1.077030524611473, "epoch": 4.509741969457609, "grad_norm": 0.3282569348812103, "learning_rate": 7.343777885231105e-05, "loss": 0.16976416110992432, "mean_token_accuracy": 0.9266364425420761, "num_tokens": 105641392.0, "step": 8564 }, { "entropy": 1.0798559784889221, "epoch": 4.510268562401264, "grad_norm": 0.33072084188461304, "learning_rate": 7.341774267237957e-05, "loss": 0.1782056838274002, "mean_token_accuracy": 0.9258958399295807, "num_tokens": 105653728.0, "step": 8565 }, { "entropy": 1.122019350528717, "epoch": 4.510795155344918, "grad_norm": 0.3206283748149872, "learning_rate": 7.339770866412349e-05, "loss": 0.15470805764198303, "mean_token_accuracy": 0.9337612390518188, "num_tokens": 105666064.0, "step": 8566 }, { "entropy": 1.1067062616348267, "epoch": 4.511321748288573, "grad_norm": 0.3272755742073059, "learning_rate": 7.337767682873214e-05, "loss": 0.178415447473526, "mean_token_accuracy": 0.9239523708820343, "num_tokens": 105678400.0, "step": 8567 }, { "entropy": 1.0962112545967102, "epoch": 4.511848341232227, "grad_norm": 0.31566762924194336, "learning_rate": 7.335764716739463e-05, "loss": 0.16647085547447205, "mean_token_accuracy": 0.9280145019292831, "num_tokens": 105690736.0, "step": 8568 }, { "entropy": 1.070769488811493, "epoch": 4.512374934175882, "grad_norm": 0.29418423771858215, "learning_rate": 7.333761968130007e-05, "loss": 0.16237285733222961, "mean_token_accuracy": 0.9303525388240814, "num_tokens": 105703072.0, "step": 8569 }, { "entropy": 1.154471606016159, "epoch": 4.512901527119537, "grad_norm": 0.35960978269577026, "learning_rate": 7.33175943716373e-05, "loss": 0.1800576001405716, "mean_token_accuracy": 0.9220800697803497, "num_tokens": 105715408.0, "step": 8570 }, { "entropy": 1.1531608998775482, "epoch": 4.513428120063191, "grad_norm": 0.327642560005188, "learning_rate": 7.32975712395952e-05, "loss": 0.17608018219470978, "mean_token_accuracy": 0.9217364192008972, "num_tokens": 105727744.0, "step": 8571 }, { "entropy": 1.0929425954818726, "epoch": 4.513954713006846, "grad_norm": 0.3168841302394867, "learning_rate": 7.327755028636236e-05, "loss": 0.16714897751808167, "mean_token_accuracy": 0.9331997483968735, "num_tokens": 105740080.0, "step": 8572 }, { "entropy": 1.1154712438583374, "epoch": 4.5144813059505005, "grad_norm": 0.3164999783039093, "learning_rate": 7.325753151312731e-05, "loss": 0.17461040616035461, "mean_token_accuracy": 0.9234779328107834, "num_tokens": 105752416.0, "step": 8573 }, { "entropy": 1.1246903836727142, "epoch": 4.515007898894154, "grad_norm": 0.31671062111854553, "learning_rate": 7.32375149210785e-05, "loss": 0.1774444580078125, "mean_token_accuracy": 0.9238055646419525, "num_tokens": 105764752.0, "step": 8574 }, { "entropy": 1.1531439423561096, "epoch": 4.515534491837809, "grad_norm": 0.32286152243614197, "learning_rate": 7.321750051140415e-05, "loss": 0.1749352514743805, "mean_token_accuracy": 0.9257891327142715, "num_tokens": 105777088.0, "step": 8575 }, { "entropy": 1.1073280274868011, "epoch": 4.516061084781464, "grad_norm": 0.29248252511024475, "learning_rate": 7.319748828529238e-05, "loss": 0.16649188101291656, "mean_token_accuracy": 0.9266532808542252, "num_tokens": 105789424.0, "step": 8576 }, { "entropy": 1.0988223552703857, "epoch": 4.516587677725118, "grad_norm": 0.296479731798172, "learning_rate": 7.317747824393121e-05, "loss": 0.17069338262081146, "mean_token_accuracy": 0.9276268184185028, "num_tokens": 105801760.0, "step": 8577 }, { "entropy": 1.1450729966163635, "epoch": 4.517114270668773, "grad_norm": 0.3118171989917755, "learning_rate": 7.315747038850863e-05, "loss": 0.15814495086669922, "mean_token_accuracy": 0.9315481334924698, "num_tokens": 105814096.0, "step": 8578 }, { "entropy": 1.1546815037727356, "epoch": 4.517640863612428, "grad_norm": 0.33646687865257263, "learning_rate": 7.313746472021224e-05, "loss": 0.17359524965286255, "mean_token_accuracy": 0.9252714812755585, "num_tokens": 105826432.0, "step": 8579 }, { "entropy": 1.139982283115387, "epoch": 4.518167456556082, "grad_norm": 0.3143118619918823, "learning_rate": 7.311746124022971e-05, "loss": 0.16783250868320465, "mean_token_accuracy": 0.9310547113418579, "num_tokens": 105838768.0, "step": 8580 }, { "entropy": 1.132720172405243, "epoch": 4.518694049499737, "grad_norm": 0.33125928044319153, "learning_rate": 7.309745994974854e-05, "loss": 0.1766769289970398, "mean_token_accuracy": 0.9286185204982758, "num_tokens": 105851104.0, "step": 8581 }, { "entropy": 1.131675124168396, "epoch": 4.519220642443392, "grad_norm": 0.31773433089256287, "learning_rate": 7.307746084995613e-05, "loss": 0.1767442226409912, "mean_token_accuracy": 0.9222896993160248, "num_tokens": 105863440.0, "step": 8582 }, { "entropy": 1.0698230564594269, "epoch": 4.519747235387046, "grad_norm": 0.2915615141391754, "learning_rate": 7.305746394203963e-05, "loss": 0.1695348471403122, "mean_token_accuracy": 0.9268006384372711, "num_tokens": 105875776.0, "step": 8583 }, { "entropy": 1.1281887292861938, "epoch": 4.5202738283307005, "grad_norm": 0.31251072883605957, "learning_rate": 7.303746922718617e-05, "loss": 0.17473962903022766, "mean_token_accuracy": 0.9253868460655212, "num_tokens": 105888112.0, "step": 8584 }, { "entropy": 1.122416466474533, "epoch": 4.520800421274355, "grad_norm": 0.3060236871242523, "learning_rate": 7.301747670658275e-05, "loss": 0.16630981862545013, "mean_token_accuracy": 0.922129675745964, "num_tokens": 105900448.0, "step": 8585 }, { "entropy": 1.0944432616233826, "epoch": 4.521327014218009, "grad_norm": 0.3030654788017273, "learning_rate": 7.299748638141617e-05, "loss": 0.15867483615875244, "mean_token_accuracy": 0.9311196506023407, "num_tokens": 105912784.0, "step": 8586 }, { "entropy": 1.1073821485042572, "epoch": 4.521853607161664, "grad_norm": 0.3436656594276428, "learning_rate": 7.297749825287317e-05, "loss": 0.1834273338317871, "mean_token_accuracy": 0.9229354411363602, "num_tokens": 105925120.0, "step": 8587 }, { "entropy": 1.1482012867927551, "epoch": 4.522380200105319, "grad_norm": 0.3048330843448639, "learning_rate": 7.29575123221403e-05, "loss": 0.1720239818096161, "mean_token_accuracy": 0.926640197634697, "num_tokens": 105937456.0, "step": 8588 }, { "entropy": 1.1464100182056427, "epoch": 4.522906793048973, "grad_norm": 0.29938042163848877, "learning_rate": 7.293752859040408e-05, "loss": 0.15156853199005127, "mean_token_accuracy": 0.9363648891448975, "num_tokens": 105949792.0, "step": 8589 }, { "entropy": 1.1625692248344421, "epoch": 4.523433385992628, "grad_norm": 0.404100626707077, "learning_rate": 7.291754705885073e-05, "loss": 0.20120716094970703, "mean_token_accuracy": 0.9150242507457733, "num_tokens": 105962128.0, "step": 8590 }, { "entropy": 1.1558034420013428, "epoch": 4.523959978936282, "grad_norm": 0.32560110092163086, "learning_rate": 7.289756772866642e-05, "loss": 0.16128265857696533, "mean_token_accuracy": 0.9327718168497086, "num_tokens": 105974464.0, "step": 8591 }, { "entropy": 1.121302604675293, "epoch": 4.524486571879937, "grad_norm": 0.314691424369812, "learning_rate": 7.287759060103734e-05, "loss": 0.16107745468616486, "mean_token_accuracy": 0.9332721680402756, "num_tokens": 105986800.0, "step": 8592 }, { "entropy": 1.1109824180603027, "epoch": 4.525013164823592, "grad_norm": 0.30954957008361816, "learning_rate": 7.285761567714933e-05, "loss": 0.17070379853248596, "mean_token_accuracy": 0.9300545454025269, "num_tokens": 105999136.0, "step": 8593 }, { "entropy": 1.1232934296131134, "epoch": 4.525539757767246, "grad_norm": 0.31915655732154846, "learning_rate": 7.283764295818818e-05, "loss": 0.15884867310523987, "mean_token_accuracy": 0.9324177652597427, "num_tokens": 106011472.0, "step": 8594 }, { "entropy": 1.0580084770917892, "epoch": 4.5260663507109005, "grad_norm": 0.3162199556827545, "learning_rate": 7.28176724453396e-05, "loss": 0.17864418029785156, "mean_token_accuracy": 0.9264102429151535, "num_tokens": 106023808.0, "step": 8595 }, { "entropy": 1.0718005001544952, "epoch": 4.526592943654555, "grad_norm": 0.302757203578949, "learning_rate": 7.279770413978905e-05, "loss": 0.17261910438537598, "mean_token_accuracy": 0.927869588136673, "num_tokens": 106036144.0, "step": 8596 }, { "entropy": 1.0653924643993378, "epoch": 4.527119536598209, "grad_norm": 0.3032852113246918, "learning_rate": 7.277773804272199e-05, "loss": 0.1635109782218933, "mean_token_accuracy": 0.9316293299198151, "num_tokens": 106048480.0, "step": 8597 }, { "entropy": 1.0054285675287247, "epoch": 4.527646129541864, "grad_norm": 0.29458484053611755, "learning_rate": 7.275777415532368e-05, "loss": 0.16193795204162598, "mean_token_accuracy": 0.9285301566123962, "num_tokens": 106060816.0, "step": 8598 }, { "entropy": 1.0754818618297577, "epoch": 4.528172722485519, "grad_norm": 0.3533173203468323, "learning_rate": 7.273781247877922e-05, "loss": 0.1745351403951645, "mean_token_accuracy": 0.9249437004327774, "num_tokens": 106073152.0, "step": 8599 }, { "entropy": 1.0397689640522003, "epoch": 4.528699315429173, "grad_norm": 0.3107565939426422, "learning_rate": 7.271785301427369e-05, "loss": 0.17134985327720642, "mean_token_accuracy": 0.9243182092905045, "num_tokens": 106085488.0, "step": 8600 }, { "entropy": 1.055548071861267, "epoch": 4.529225908372828, "grad_norm": 0.31921958923339844, "learning_rate": 7.269789576299192e-05, "loss": 0.17372101545333862, "mean_token_accuracy": 0.9243157655000687, "num_tokens": 106097824.0, "step": 8601 }, { "entropy": 1.0808067321777344, "epoch": 4.529752501316482, "grad_norm": 0.2958208918571472, "learning_rate": 7.267794072611869e-05, "loss": 0.1557004600763321, "mean_token_accuracy": 0.9333107024431229, "num_tokens": 106110160.0, "step": 8602 }, { "entropy": 1.0594066977500916, "epoch": 4.530279094260137, "grad_norm": 0.3041718304157257, "learning_rate": 7.265798790483855e-05, "loss": 0.16468429565429688, "mean_token_accuracy": 0.9312732368707657, "num_tokens": 106122496.0, "step": 8603 }, { "entropy": 1.1187460720539093, "epoch": 4.530805687203792, "grad_norm": 0.29810383915901184, "learning_rate": 7.263803730033607e-05, "loss": 0.17059026658535004, "mean_token_accuracy": 0.9303388297557831, "num_tokens": 106134832.0, "step": 8604 }, { "entropy": 1.1017462611198425, "epoch": 4.531332280147446, "grad_norm": 0.33466941118240356, "learning_rate": 7.261808891379549e-05, "loss": 0.17381291091442108, "mean_token_accuracy": 0.9265600442886353, "num_tokens": 106147168.0, "step": 8605 }, { "entropy": 1.0778556764125824, "epoch": 4.5318588730911005, "grad_norm": 0.328126460313797, "learning_rate": 7.259814274640114e-05, "loss": 0.17598795890808105, "mean_token_accuracy": 0.9262767136096954, "num_tokens": 106159504.0, "step": 8606 }, { "entropy": 1.1326199769973755, "epoch": 4.532385466034755, "grad_norm": 0.3385554850101471, "learning_rate": 7.257819879933703e-05, "loss": 0.18585970997810364, "mean_token_accuracy": 0.9193847179412842, "num_tokens": 106171840.0, "step": 8607 }, { "entropy": 1.0936433672904968, "epoch": 4.532912058978409, "grad_norm": 0.3459876477718353, "learning_rate": 7.255825707378719e-05, "loss": 0.17953082919120789, "mean_token_accuracy": 0.9288031160831451, "num_tokens": 106184176.0, "step": 8608 }, { "entropy": 1.1019591391086578, "epoch": 4.533438651922064, "grad_norm": 0.331623375415802, "learning_rate": 7.253831757093534e-05, "loss": 0.18319639563560486, "mean_token_accuracy": 0.9238258898258209, "num_tokens": 106196512.0, "step": 8609 }, { "entropy": 1.0682066679000854, "epoch": 4.533965244865719, "grad_norm": 0.326761394739151, "learning_rate": 7.251838029196528e-05, "loss": 0.17491675913333893, "mean_token_accuracy": 0.9245114624500275, "num_tokens": 106208848.0, "step": 8610 }, { "entropy": 1.1281436085700989, "epoch": 4.534491837809373, "grad_norm": 0.311954528093338, "learning_rate": 7.249844523806049e-05, "loss": 0.16504040360450745, "mean_token_accuracy": 0.9301846921443939, "num_tokens": 106221184.0, "step": 8611 }, { "entropy": 1.0995433032512665, "epoch": 4.535018430753028, "grad_norm": 0.3156920075416565, "learning_rate": 7.247851241040446e-05, "loss": 0.16396453976631165, "mean_token_accuracy": 0.9300717115402222, "num_tokens": 106233520.0, "step": 8612 }, { "entropy": 1.060952678322792, "epoch": 4.535545023696683, "grad_norm": 0.30757302045822144, "learning_rate": 7.245858181018044e-05, "loss": 0.1719992756843567, "mean_token_accuracy": 0.929116889834404, "num_tokens": 106245856.0, "step": 8613 }, { "entropy": 1.097676694393158, "epoch": 4.536071616640337, "grad_norm": 0.3066072463989258, "learning_rate": 7.243865343857163e-05, "loss": 0.16438062489032745, "mean_token_accuracy": 0.9286708384752274, "num_tokens": 106258192.0, "step": 8614 }, { "entropy": 1.1292257606983185, "epoch": 4.536598209583992, "grad_norm": 0.3034124970436096, "learning_rate": 7.241872729676102e-05, "loss": 0.1616891324520111, "mean_token_accuracy": 0.9323288798332214, "num_tokens": 106270528.0, "step": 8615 }, { "entropy": 1.1192235052585602, "epoch": 4.5371248025276465, "grad_norm": 0.3250950574874878, "learning_rate": 7.239880338593152e-05, "loss": 0.1760547012090683, "mean_token_accuracy": 0.9272078275680542, "num_tokens": 106282864.0, "step": 8616 }, { "entropy": 1.1232163608074188, "epoch": 4.5376513954713005, "grad_norm": 0.3211779296398163, "learning_rate": 7.237888170726595e-05, "loss": 0.17828568816184998, "mean_token_accuracy": 0.9265819787979126, "num_tokens": 106295200.0, "step": 8617 }, { "entropy": 1.1110897064208984, "epoch": 4.538177988414955, "grad_norm": 0.31655165553092957, "learning_rate": 7.235896226194687e-05, "loss": 0.16581428050994873, "mean_token_accuracy": 0.9282494932413101, "num_tokens": 106307536.0, "step": 8618 }, { "entropy": 1.059042513370514, "epoch": 4.53870458135861, "grad_norm": 0.2922663688659668, "learning_rate": 7.233904505115676e-05, "loss": 0.16460026800632477, "mean_token_accuracy": 0.9286544919013977, "num_tokens": 106319872.0, "step": 8619 }, { "entropy": 1.0846833884716034, "epoch": 4.539231174302264, "grad_norm": 0.29960334300994873, "learning_rate": 7.231913007607813e-05, "loss": 0.16176140308380127, "mean_token_accuracy": 0.9320085644721985, "num_tokens": 106332208.0, "step": 8620 }, { "entropy": 1.1031128764152527, "epoch": 4.539757767245919, "grad_norm": 0.32958582043647766, "learning_rate": 7.22992173378931e-05, "loss": 0.18814656138420105, "mean_token_accuracy": 0.9222319424152374, "num_tokens": 106344544.0, "step": 8621 }, { "entropy": 1.0944068729877472, "epoch": 4.540284360189574, "grad_norm": 0.32673224806785583, "learning_rate": 7.227930683778381e-05, "loss": 0.1563873142004013, "mean_token_accuracy": 0.934342235326767, "num_tokens": 106356880.0, "step": 8622 }, { "entropy": 1.1245568096637726, "epoch": 4.540810953133228, "grad_norm": 0.32896438241004944, "learning_rate": 7.22593985769322e-05, "loss": 0.16392138600349426, "mean_token_accuracy": 0.9313053041696548, "num_tokens": 106369216.0, "step": 8623 }, { "entropy": 1.1108445227146149, "epoch": 4.541337546076883, "grad_norm": 0.3246438503265381, "learning_rate": 7.223949255652014e-05, "loss": 0.16873814165592194, "mean_token_accuracy": 0.9327792525291443, "num_tokens": 106381552.0, "step": 8624 }, { "entropy": 1.1474404633045197, "epoch": 4.541864139020537, "grad_norm": 0.3198279142379761, "learning_rate": 7.221958877772932e-05, "loss": 0.17041805386543274, "mean_token_accuracy": 0.9279144108295441, "num_tokens": 106393888.0, "step": 8625 }, { "entropy": 1.0965960025787354, "epoch": 4.542390731964192, "grad_norm": 0.34083613753318787, "learning_rate": 7.219968724174125e-05, "loss": 0.16393917798995972, "mean_token_accuracy": 0.9325901865959167, "num_tokens": 106406224.0, "step": 8626 }, { "entropy": 1.141867220401764, "epoch": 4.5429173249078465, "grad_norm": 0.3511935770511627, "learning_rate": 7.21797879497375e-05, "loss": 0.1670934408903122, "mean_token_accuracy": 0.9295719414949417, "num_tokens": 106418560.0, "step": 8627 }, { "entropy": 1.0650420784950256, "epoch": 4.5434439178515005, "grad_norm": 0.29902124404907227, "learning_rate": 7.215989090289928e-05, "loss": 0.16046491265296936, "mean_token_accuracy": 0.9318942427635193, "num_tokens": 106430896.0, "step": 8628 }, { "entropy": 1.1215861141681671, "epoch": 4.543970510795155, "grad_norm": 0.3233654201030731, "learning_rate": 7.21399961024078e-05, "loss": 0.16879481077194214, "mean_token_accuracy": 0.927575096487999, "num_tokens": 106443232.0, "step": 8629 }, { "entropy": 1.1291065514087677, "epoch": 4.54449710373881, "grad_norm": 0.32695838809013367, "learning_rate": 7.212010354944409e-05, "loss": 0.17683281004428864, "mean_token_accuracy": 0.9240487813949585, "num_tokens": 106455568.0, "step": 8630 }, { "entropy": 1.073424756526947, "epoch": 4.545023696682464, "grad_norm": 0.3119884729385376, "learning_rate": 7.21002132451891e-05, "loss": 0.16512653231620789, "mean_token_accuracy": 0.9337073564529419, "num_tokens": 106467904.0, "step": 8631 }, { "entropy": 1.1196120381355286, "epoch": 4.545550289626119, "grad_norm": 0.35574230551719666, "learning_rate": 7.20803251908235e-05, "loss": 0.17509186267852783, "mean_token_accuracy": 0.9257360398769379, "num_tokens": 106480240.0, "step": 8632 }, { "entropy": 1.0766751170158386, "epoch": 4.546076882569774, "grad_norm": 0.31140777468681335, "learning_rate": 7.206043938752796e-05, "loss": 0.16393479704856873, "mean_token_accuracy": 0.9272533506155014, "num_tokens": 106492576.0, "step": 8633 }, { "entropy": 1.1171353459358215, "epoch": 4.546603475513428, "grad_norm": 0.3182012140750885, "learning_rate": 7.204055583648301e-05, "loss": 0.15968182682991028, "mean_token_accuracy": 0.9303576350212097, "num_tokens": 106504912.0, "step": 8634 }, { "entropy": 1.0699645578861237, "epoch": 4.547130068457083, "grad_norm": 0.3135298192501068, "learning_rate": 7.202067453886902e-05, "loss": 0.16891828179359436, "mean_token_accuracy": 0.9271212965250015, "num_tokens": 106517248.0, "step": 8635 }, { "entropy": 1.1310140788555145, "epoch": 4.547656661400737, "grad_norm": 0.3326754570007324, "learning_rate": 7.200079549586627e-05, "loss": 0.15686854720115662, "mean_token_accuracy": 0.933062732219696, "num_tokens": 106529584.0, "step": 8636 }, { "entropy": 1.087046355009079, "epoch": 4.548183254344392, "grad_norm": 0.30275726318359375, "learning_rate": 7.198091870865475e-05, "loss": 0.16297847032546997, "mean_token_accuracy": 0.9343578368425369, "num_tokens": 106541920.0, "step": 8637 }, { "entropy": 1.1067259907722473, "epoch": 4.5487098472880465, "grad_norm": 0.32432666420936584, "learning_rate": 7.196104417841456e-05, "loss": 0.1783636063337326, "mean_token_accuracy": 0.9246051460504532, "num_tokens": 106554256.0, "step": 8638 }, { "entropy": 1.0900868475437164, "epoch": 4.5492364402317005, "grad_norm": 0.3207528293132782, "learning_rate": 7.19411719063254e-05, "loss": 0.17123816907405853, "mean_token_accuracy": 0.9290398508310318, "num_tokens": 106566592.0, "step": 8639 }, { "entropy": 1.061654806137085, "epoch": 4.549763033175355, "grad_norm": 0.282748818397522, "learning_rate": 7.192130189356709e-05, "loss": 0.15271571278572083, "mean_token_accuracy": 0.9335532784461975, "num_tokens": 106578928.0, "step": 8640 }, { "entropy": 1.0427027940750122, "epoch": 4.55028962611901, "grad_norm": 0.28999966382980347, "learning_rate": 7.190143414131916e-05, "loss": 0.15280868113040924, "mean_token_accuracy": 0.9352436363697052, "num_tokens": 106591264.0, "step": 8641 }, { "entropy": 1.0661968886852264, "epoch": 4.550816219062664, "grad_norm": 0.3222913444042206, "learning_rate": 7.188156865076099e-05, "loss": 0.16964468359947205, "mean_token_accuracy": 0.9289585947990417, "num_tokens": 106603600.0, "step": 8642 }, { "entropy": 1.0490186661481857, "epoch": 4.551342812006319, "grad_norm": 0.2893037796020508, "learning_rate": 7.186170542307193e-05, "loss": 0.1633986383676529, "mean_token_accuracy": 0.9309844374656677, "num_tokens": 106615936.0, "step": 8643 }, { "entropy": 1.129934698343277, "epoch": 4.551869404949974, "grad_norm": 0.3267245590686798, "learning_rate": 7.184184445943111e-05, "loss": 0.1662716567516327, "mean_token_accuracy": 0.9279222786426544, "num_tokens": 106628272.0, "step": 8644 }, { "entropy": 1.0623022317886353, "epoch": 4.552395997893628, "grad_norm": 0.3231813311576843, "learning_rate": 7.182198576101762e-05, "loss": 0.1643461138010025, "mean_token_accuracy": 0.9299049526453018, "num_tokens": 106640608.0, "step": 8645 }, { "entropy": 1.1140716075897217, "epoch": 4.552922590837283, "grad_norm": 0.31757470965385437, "learning_rate": 7.180212932901031e-05, "loss": 0.16377797722816467, "mean_token_accuracy": 0.9325571209192276, "num_tokens": 106652944.0, "step": 8646 }, { "entropy": 1.0587803423404694, "epoch": 4.553449183780938, "grad_norm": 0.31495264172554016, "learning_rate": 7.178227516458789e-05, "loss": 0.16437000036239624, "mean_token_accuracy": 0.9316940456628799, "num_tokens": 106665280.0, "step": 8647 }, { "entropy": 1.0641800165176392, "epoch": 4.553975776724592, "grad_norm": 0.3161664307117462, "learning_rate": 7.17624232689291e-05, "loss": 0.16967880725860596, "mean_token_accuracy": 0.9243513494729996, "num_tokens": 106677616.0, "step": 8648 }, { "entropy": 1.064298003911972, "epoch": 4.5545023696682465, "grad_norm": 0.3035197854042053, "learning_rate": 7.174257364321239e-05, "loss": 0.1707356572151184, "mean_token_accuracy": 0.9280406534671783, "num_tokens": 106689952.0, "step": 8649 }, { "entropy": 1.0933890044689178, "epoch": 4.555028962611901, "grad_norm": 0.33313021063804626, "learning_rate": 7.17227262886161e-05, "loss": 0.1591399610042572, "mean_token_accuracy": 0.9340995401144028, "num_tokens": 106702288.0, "step": 8650 }, { "entropy": 1.0891567170619965, "epoch": 4.555555555555555, "grad_norm": 0.3368584215641022, "learning_rate": 7.170288120631843e-05, "loss": 0.18220099806785583, "mean_token_accuracy": 0.9209961295127869, "num_tokens": 106714624.0, "step": 8651 }, { "entropy": 1.1064401865005493, "epoch": 4.55608214849921, "grad_norm": 0.36571386456489563, "learning_rate": 7.16830383974975e-05, "loss": 0.1797991842031479, "mean_token_accuracy": 0.9172768592834473, "num_tokens": 106726960.0, "step": 8652 }, { "entropy": 1.0690472424030304, "epoch": 4.556608741442865, "grad_norm": 0.3507973849773407, "learning_rate": 7.166319786333125e-05, "loss": 0.1866639405488968, "mean_token_accuracy": 0.9236337691545486, "num_tokens": 106739296.0, "step": 8653 }, { "entropy": 0.9976196885108948, "epoch": 4.557135334386519, "grad_norm": 0.31047511100769043, "learning_rate": 7.164335960499744e-05, "loss": 0.16871517896652222, "mean_token_accuracy": 0.9263797998428345, "num_tokens": 106751632.0, "step": 8654 }, { "entropy": 1.0752581059932709, "epoch": 4.557661927330174, "grad_norm": 0.32285797595977783, "learning_rate": 7.162352362367385e-05, "loss": 0.16266748309135437, "mean_token_accuracy": 0.9306293576955795, "num_tokens": 106763968.0, "step": 8655 }, { "entropy": 1.1051332354545593, "epoch": 4.558188520273829, "grad_norm": 0.3700147867202759, "learning_rate": 7.160368992053803e-05, "loss": 0.19394490122795105, "mean_token_accuracy": 0.9186254739761353, "num_tokens": 106776304.0, "step": 8656 }, { "entropy": 1.0695521384477615, "epoch": 4.558715113217483, "grad_norm": 0.31823670864105225, "learning_rate": 7.158385849676732e-05, "loss": 0.16147494316101074, "mean_token_accuracy": 0.9299113750457764, "num_tokens": 106788640.0, "step": 8657 }, { "entropy": 1.0720454156398773, "epoch": 4.559241706161138, "grad_norm": 0.3523479700088501, "learning_rate": 7.156402935353903e-05, "loss": 0.16577114164829254, "mean_token_accuracy": 0.9317851662635803, "num_tokens": 106800976.0, "step": 8658 }, { "entropy": 1.092285007238388, "epoch": 4.559768299104792, "grad_norm": 0.35989680886268616, "learning_rate": 7.154420249203028e-05, "loss": 0.1683732271194458, "mean_token_accuracy": 0.9251654595136642, "num_tokens": 106813312.0, "step": 8659 }, { "entropy": 1.048419177532196, "epoch": 4.5602948920484465, "grad_norm": 0.2887498438358307, "learning_rate": 7.152437791341814e-05, "loss": 0.1596927046775818, "mean_token_accuracy": 0.9350206553936005, "num_tokens": 106825648.0, "step": 8660 }, { "entropy": 1.0721503496170044, "epoch": 4.560821484992101, "grad_norm": 0.32527533173561096, "learning_rate": 7.150455561887937e-05, "loss": 0.16587302088737488, "mean_token_accuracy": 0.9299864172935486, "num_tokens": 106837984.0, "step": 8661 }, { "entropy": 1.1039204895496368, "epoch": 4.561348077935755, "grad_norm": 0.3423987329006195, "learning_rate": 7.148473560959077e-05, "loss": 0.1740478277206421, "mean_token_accuracy": 0.9244489520788193, "num_tokens": 106850320.0, "step": 8662 }, { "entropy": 1.0168361812829971, "epoch": 4.56187467087941, "grad_norm": 0.32267218828201294, "learning_rate": 7.146491788672895e-05, "loss": 0.1730199158191681, "mean_token_accuracy": 0.9277898073196411, "num_tokens": 106862656.0, "step": 8663 }, { "entropy": 1.0239315032958984, "epoch": 4.562401263823065, "grad_norm": 0.311694860458374, "learning_rate": 7.144510245147038e-05, "loss": 0.1736176609992981, "mean_token_accuracy": 0.9258221387863159, "num_tokens": 106874992.0, "step": 8664 }, { "entropy": 1.0748440623283386, "epoch": 4.562927856766719, "grad_norm": 0.328838974237442, "learning_rate": 7.142528930499133e-05, "loss": 0.17330893874168396, "mean_token_accuracy": 0.9279798716306686, "num_tokens": 106887328.0, "step": 8665 }, { "entropy": 1.0589421093463898, "epoch": 4.563454449710374, "grad_norm": 0.31295597553253174, "learning_rate": 7.140547844846803e-05, "loss": 0.15671877562999725, "mean_token_accuracy": 0.9362427443265915, "num_tokens": 106899664.0, "step": 8666 }, { "entropy": 1.0276417583227158, "epoch": 4.563981042654029, "grad_norm": 0.32179734110832214, "learning_rate": 7.138566988307654e-05, "loss": 0.16797716915607452, "mean_token_accuracy": 0.9260842502117157, "num_tokens": 106912000.0, "step": 8667 }, { "entropy": 1.118698626756668, "epoch": 4.564507635597683, "grad_norm": 0.3249455690383911, "learning_rate": 7.136586360999275e-05, "loss": 0.19012728333473206, "mean_token_accuracy": 0.9203059673309326, "num_tokens": 106924336.0, "step": 8668 }, { "entropy": 1.0857931673526764, "epoch": 4.565034228541338, "grad_norm": 0.32796764373779297, "learning_rate": 7.134605963039245e-05, "loss": 0.17321154475212097, "mean_token_accuracy": 0.9267846494913101, "num_tokens": 106936672.0, "step": 8669 }, { "entropy": 1.0889154821634293, "epoch": 4.565560821484992, "grad_norm": 0.3461117446422577, "learning_rate": 7.132625794545134e-05, "loss": 0.18601475656032562, "mean_token_accuracy": 0.9206071197986603, "num_tokens": 106949008.0, "step": 8670 }, { "entropy": 1.1496550142765045, "epoch": 4.5660874144286465, "grad_norm": 0.33955106139183044, "learning_rate": 7.130645855634486e-05, "loss": 0.18470525741577148, "mean_token_accuracy": 0.9172615110874176, "num_tokens": 106961344.0, "step": 8671 }, { "entropy": 1.1040054261684418, "epoch": 4.566614007372301, "grad_norm": 0.3226144015789032, "learning_rate": 7.12866614642484e-05, "loss": 0.1825535148382187, "mean_token_accuracy": 0.922840341925621, "num_tokens": 106973680.0, "step": 8672 }, { "entropy": 1.1121874451637268, "epoch": 4.567140600315955, "grad_norm": 0.31177595257759094, "learning_rate": 7.126686667033724e-05, "loss": 0.18004962801933289, "mean_token_accuracy": 0.9256362766027451, "num_tokens": 106986016.0, "step": 8673 }, { "entropy": 1.1306947767734528, "epoch": 4.56766719325961, "grad_norm": 0.3360869586467743, "learning_rate": 7.124707417578645e-05, "loss": 0.18021290004253387, "mean_token_accuracy": 0.9254167079925537, "num_tokens": 106998352.0, "step": 8674 }, { "entropy": 1.0924843549728394, "epoch": 4.568193786203265, "grad_norm": 0.2975752055644989, "learning_rate": 7.122728398177095e-05, "loss": 0.15803509950637817, "mean_token_accuracy": 0.9346482157707214, "num_tokens": 107010688.0, "step": 8675 }, { "entropy": 1.0998488664627075, "epoch": 4.568720379146919, "grad_norm": 0.30178508162498474, "learning_rate": 7.120749608946565e-05, "loss": 0.17362216114997864, "mean_token_accuracy": 0.9280165731906891, "num_tokens": 107023024.0, "step": 8676 }, { "entropy": 1.1455123126506805, "epoch": 4.569246972090574, "grad_norm": 0.3140106499195099, "learning_rate": 7.11877105000452e-05, "loss": 0.18174360692501068, "mean_token_accuracy": 0.9210865646600723, "num_tokens": 107035360.0, "step": 8677 }, { "entropy": 1.045901894569397, "epoch": 4.569773565034229, "grad_norm": 0.29214707016944885, "learning_rate": 7.116792721468417e-05, "loss": 0.1577940732240677, "mean_token_accuracy": 0.936051145195961, "num_tokens": 107047696.0, "step": 8678 }, { "entropy": 1.044377788901329, "epoch": 4.570300157977883, "grad_norm": 0.2773629128932953, "learning_rate": 7.1148146234557e-05, "loss": 0.15500973165035248, "mean_token_accuracy": 0.9314758628606796, "num_tokens": 107060032.0, "step": 8679 }, { "entropy": 1.1480259597301483, "epoch": 4.570826750921538, "grad_norm": 0.3102291226387024, "learning_rate": 7.112836756083791e-05, "loss": 0.16833597421646118, "mean_token_accuracy": 0.9297477602958679, "num_tokens": 107072368.0, "step": 8680 }, { "entropy": 1.1289499998092651, "epoch": 4.5713533438651925, "grad_norm": 0.31731173396110535, "learning_rate": 7.110859119470107e-05, "loss": 0.16683533787727356, "mean_token_accuracy": 0.9299915730953217, "num_tokens": 107084704.0, "step": 8681 }, { "entropy": 1.1283690333366394, "epoch": 4.5718799368088465, "grad_norm": 0.317582905292511, "learning_rate": 7.108881713732049e-05, "loss": 0.17901158332824707, "mean_token_accuracy": 0.9264525324106216, "num_tokens": 107097040.0, "step": 8682 }, { "entropy": 1.1011227369308472, "epoch": 4.572406529752501, "grad_norm": 0.2942031919956207, "learning_rate": 7.106904538987006e-05, "loss": 0.17026060819625854, "mean_token_accuracy": 0.9274697154760361, "num_tokens": 107109376.0, "step": 8683 }, { "entropy": 1.1156458854675293, "epoch": 4.572933122696156, "grad_norm": 0.30721092224121094, "learning_rate": 7.10492759535235e-05, "loss": 0.18025022745132446, "mean_token_accuracy": 0.9253346472978592, "num_tokens": 107121712.0, "step": 8684 }, { "entropy": 1.0282520651817322, "epoch": 4.57345971563981, "grad_norm": 0.29607510566711426, "learning_rate": 7.10295088294544e-05, "loss": 0.16659298539161682, "mean_token_accuracy": 0.9305984079837799, "num_tokens": 107134048.0, "step": 8685 }, { "entropy": 1.1497196555137634, "epoch": 4.573986308583465, "grad_norm": 0.3343541622161865, "learning_rate": 7.100974401883622e-05, "loss": 0.17614148557186127, "mean_token_accuracy": 0.9200554937124252, "num_tokens": 107146384.0, "step": 8686 }, { "entropy": 1.1118314564228058, "epoch": 4.57451290152712, "grad_norm": 0.31019845604896545, "learning_rate": 7.098998152284229e-05, "loss": 0.17119279503822327, "mean_token_accuracy": 0.923244521021843, "num_tokens": 107158720.0, "step": 8687 }, { "entropy": 1.0423270016908646, "epoch": 4.575039494470774, "grad_norm": 0.2982739210128784, "learning_rate": 7.09702213426458e-05, "loss": 0.1640046238899231, "mean_token_accuracy": 0.9256590902805328, "num_tokens": 107171056.0, "step": 8688 }, { "entropy": 1.08947092294693, "epoch": 4.575566087414429, "grad_norm": 0.3556402921676636, "learning_rate": 7.095046347941978e-05, "loss": 0.18411381542682648, "mean_token_accuracy": 0.9257789105176926, "num_tokens": 107183392.0, "step": 8689 }, { "entropy": 1.0914960205554962, "epoch": 4.576092680358084, "grad_norm": 0.321100652217865, "learning_rate": 7.093070793433714e-05, "loss": 0.1736738234758377, "mean_token_accuracy": 0.9281085878610611, "num_tokens": 107195728.0, "step": 8690 }, { "entropy": 1.0638926923274994, "epoch": 4.576619273301738, "grad_norm": 0.3066602051258087, "learning_rate": 7.091095470857066e-05, "loss": 0.15998324751853943, "mean_token_accuracy": 0.9323301017284393, "num_tokens": 107208064.0, "step": 8691 }, { "entropy": 1.0748650431632996, "epoch": 4.5771458662453925, "grad_norm": 0.32310837507247925, "learning_rate": 7.089120380329298e-05, "loss": 0.1661323606967926, "mean_token_accuracy": 0.9274686872959137, "num_tokens": 107220400.0, "step": 8692 }, { "entropy": 1.0882180035114288, "epoch": 4.5776724591890465, "grad_norm": 0.3006623089313507, "learning_rate": 7.087145521967658e-05, "loss": 0.16791214048862457, "mean_token_accuracy": 0.9302281737327576, "num_tokens": 107232736.0, "step": 8693 }, { "entropy": 1.0967628061771393, "epoch": 4.578199052132701, "grad_norm": 0.31030550599098206, "learning_rate": 7.085170895889382e-05, "loss": 0.1743021011352539, "mean_token_accuracy": 0.9264057874679565, "num_tokens": 107245072.0, "step": 8694 }, { "entropy": 1.0810537934303284, "epoch": 4.578725645076356, "grad_norm": 0.3004099130630493, "learning_rate": 7.083196502211693e-05, "loss": 0.16865485906600952, "mean_token_accuracy": 0.9283222258090973, "num_tokens": 107257408.0, "step": 8695 }, { "entropy": 1.064576044678688, "epoch": 4.57925223802001, "grad_norm": 0.3168226480484009, "learning_rate": 7.081222341051794e-05, "loss": 0.17242692410945892, "mean_token_accuracy": 0.9287631809711456, "num_tokens": 107269744.0, "step": 8696 }, { "entropy": 0.9771599024534225, "epoch": 4.579778830963665, "grad_norm": 0.2934156656265259, "learning_rate": 7.079248412526888e-05, "loss": 0.16696205735206604, "mean_token_accuracy": 0.9282114207744598, "num_tokens": 107282080.0, "step": 8697 }, { "entropy": 1.0334157943725586, "epoch": 4.58030542390732, "grad_norm": 0.3131554424762726, "learning_rate": 7.077274716754156e-05, "loss": 0.16662999987602234, "mean_token_accuracy": 0.9287344515323639, "num_tokens": 107294416.0, "step": 8698 }, { "entropy": 0.9986395239830017, "epoch": 4.580832016850974, "grad_norm": 0.32664307951927185, "learning_rate": 7.075301253850759e-05, "loss": 0.17536792159080505, "mean_token_accuracy": 0.9243778139352798, "num_tokens": 107306752.0, "step": 8699 }, { "entropy": 1.0363193899393082, "epoch": 4.581358609794629, "grad_norm": 0.33753758668899536, "learning_rate": 7.073328023933849e-05, "loss": 0.17446276545524597, "mean_token_accuracy": 0.9281366765499115, "num_tokens": 107319088.0, "step": 8700 }, { "entropy": 1.0517511069774628, "epoch": 4.581885202738283, "grad_norm": 0.3835679590702057, "learning_rate": 7.07135502712057e-05, "loss": 0.1867254376411438, "mean_token_accuracy": 0.9165402054786682, "num_tokens": 107331424.0, "step": 8701 }, { "entropy": 1.0205737203359604, "epoch": 4.582411795681938, "grad_norm": 0.31008943915367126, "learning_rate": 7.069382263528043e-05, "loss": 0.16276168823242188, "mean_token_accuracy": 0.9319659471511841, "num_tokens": 107343760.0, "step": 8702 }, { "entropy": 0.9978193044662476, "epoch": 4.5829383886255926, "grad_norm": 0.329265296459198, "learning_rate": 7.06740973327338e-05, "loss": 0.16471801698207855, "mean_token_accuracy": 0.925895556807518, "num_tokens": 107356096.0, "step": 8703 }, { "entropy": 1.0166545361280441, "epoch": 4.5834649815692465, "grad_norm": 0.31310710310935974, "learning_rate": 7.065437436473683e-05, "loss": 0.1673336625099182, "mean_token_accuracy": 0.9306180328130722, "num_tokens": 107368432.0, "step": 8704 }, { "entropy": 0.9913676977157593, "epoch": 4.583991574512901, "grad_norm": 0.30291885137557983, "learning_rate": 7.063465373246032e-05, "loss": 0.1598743349313736, "mean_token_accuracy": 0.9280618876218796, "num_tokens": 107380768.0, "step": 8705 }, { "entropy": 0.9993337392807007, "epoch": 4.584518167456556, "grad_norm": 0.3154926300048828, "learning_rate": 7.061493543707501e-05, "loss": 0.16369374096393585, "mean_token_accuracy": 0.9313799887895584, "num_tokens": 107393104.0, "step": 8706 }, { "entropy": 1.044825702905655, "epoch": 4.58504476040021, "grad_norm": 0.33816179633140564, "learning_rate": 7.059521947975139e-05, "loss": 0.19750162959098816, "mean_token_accuracy": 0.9153089374303818, "num_tokens": 107405440.0, "step": 8707 }, { "entropy": 1.047785148024559, "epoch": 4.585571353343865, "grad_norm": 0.3284870684146881, "learning_rate": 7.057550586165993e-05, "loss": 0.17213356494903564, "mean_token_accuracy": 0.9218959957361221, "num_tokens": 107417776.0, "step": 8708 }, { "entropy": 0.9950270652770996, "epoch": 4.58609794628752, "grad_norm": 0.4453790783882141, "learning_rate": 7.055579458397097e-05, "loss": 0.16260553896427155, "mean_token_accuracy": 0.9297661185264587, "num_tokens": 107430112.0, "step": 8709 }, { "entropy": 1.0443234890699387, "epoch": 4.586624539231174, "grad_norm": 0.3269834518432617, "learning_rate": 7.05360856478545e-05, "loss": 0.17089609801769257, "mean_token_accuracy": 0.9307948648929596, "num_tokens": 107442448.0, "step": 8710 }, { "entropy": 1.0410026907920837, "epoch": 4.587151132174829, "grad_norm": 0.2909794747829437, "learning_rate": 7.051637905448063e-05, "loss": 0.15479862689971924, "mean_token_accuracy": 0.9330165535211563, "num_tokens": 107454784.0, "step": 8711 }, { "entropy": 1.0876724123954773, "epoch": 4.587677725118484, "grad_norm": 0.3122361898422241, "learning_rate": 7.049667480501922e-05, "loss": 0.1811986118555069, "mean_token_accuracy": 0.9227711260318756, "num_tokens": 107467120.0, "step": 8712 }, { "entropy": 1.0514351725578308, "epoch": 4.588204318062138, "grad_norm": 0.33499598503112793, "learning_rate": 7.047697290063997e-05, "loss": 0.1878758668899536, "mean_token_accuracy": 0.9214672744274139, "num_tokens": 107479456.0, "step": 8713 }, { "entropy": 0.9934461116790771, "epoch": 4.588730911005793, "grad_norm": 0.3381115198135376, "learning_rate": 7.04572733425125e-05, "loss": 0.18743182718753815, "mean_token_accuracy": 0.9202657341957092, "num_tokens": 107491792.0, "step": 8714 }, { "entropy": 1.0088402181863785, "epoch": 4.589257503949447, "grad_norm": 0.2974151074886322, "learning_rate": 7.043757613180623e-05, "loss": 0.16457468271255493, "mean_token_accuracy": 0.926583006978035, "num_tokens": 107504128.0, "step": 8715 }, { "entropy": 1.0807583034038544, "epoch": 4.589784096893101, "grad_norm": 0.4040805697441101, "learning_rate": 7.041788126969048e-05, "loss": 0.18308116495609283, "mean_token_accuracy": 0.9198445230722427, "num_tokens": 107516464.0, "step": 8716 }, { "entropy": 0.9993950575590134, "epoch": 4.590310689836756, "grad_norm": 0.3046441376209259, "learning_rate": 7.039818875733444e-05, "loss": 0.15982067584991455, "mean_token_accuracy": 0.9315261244773865, "num_tokens": 107528800.0, "step": 8717 }, { "entropy": 1.0157035887241364, "epoch": 4.590837282780411, "grad_norm": 0.2929827868938446, "learning_rate": 7.037849859590708e-05, "loss": 0.15987715125083923, "mean_token_accuracy": 0.9329131245613098, "num_tokens": 107541136.0, "step": 8718 }, { "entropy": 1.053165391087532, "epoch": 4.591363875724065, "grad_norm": 0.3398328125476837, "learning_rate": 7.035881078657736e-05, "loss": 0.17398418486118317, "mean_token_accuracy": 0.9235986769199371, "num_tokens": 107553472.0, "step": 8719 }, { "entropy": 1.1066934168338776, "epoch": 4.59189046866772, "grad_norm": 0.3254387080669403, "learning_rate": 7.033912533051398e-05, "loss": 0.1771440953016281, "mean_token_accuracy": 0.9198944419622421, "num_tokens": 107565808.0, "step": 8720 }, { "entropy": 1.0543211102485657, "epoch": 4.592417061611375, "grad_norm": 0.3355952799320221, "learning_rate": 7.031944222888555e-05, "loss": 0.15953224897384644, "mean_token_accuracy": 0.9345828890800476, "num_tokens": 107578144.0, "step": 8721 }, { "entropy": 1.033324733376503, "epoch": 4.592943654555029, "grad_norm": 0.335302472114563, "learning_rate": 7.02997614828606e-05, "loss": 0.18134362995624542, "mean_token_accuracy": 0.9263257384300232, "num_tokens": 107590480.0, "step": 8722 }, { "entropy": 1.0930776596069336, "epoch": 4.593470247498684, "grad_norm": 0.3225703835487366, "learning_rate": 7.028008309360739e-05, "loss": 0.17418448626995087, "mean_token_accuracy": 0.9256875365972519, "num_tokens": 107602816.0, "step": 8723 }, { "entropy": 1.021464854478836, "epoch": 4.593996840442338, "grad_norm": 0.3606475293636322, "learning_rate": 7.02604070622941e-05, "loss": 0.1569170355796814, "mean_token_accuracy": 0.9325631409883499, "num_tokens": 107615152.0, "step": 8724 }, { "entropy": 1.0355309695005417, "epoch": 4.594523433385993, "grad_norm": 0.29902201890945435, "learning_rate": 7.024073339008887e-05, "loss": 0.1473335176706314, "mean_token_accuracy": 0.9369276762008667, "num_tokens": 107627488.0, "step": 8725 }, { "entropy": 1.0017937123775482, "epoch": 4.595050026329647, "grad_norm": 0.31027984619140625, "learning_rate": 7.022106207815957e-05, "loss": 0.1686737835407257, "mean_token_accuracy": 0.9254660606384277, "num_tokens": 107639824.0, "step": 8726 }, { "entropy": 0.9633382558822632, "epoch": 4.595576619273301, "grad_norm": 0.31015104055404663, "learning_rate": 7.020139312767396e-05, "loss": 0.1631452441215515, "mean_token_accuracy": 0.9335481226444244, "num_tokens": 107652160.0, "step": 8727 }, { "entropy": 0.9984524995088577, "epoch": 4.596103212216956, "grad_norm": 0.32390734553337097, "learning_rate": 7.01817265397997e-05, "loss": 0.1819961965084076, "mean_token_accuracy": 0.9274021834135056, "num_tokens": 107664496.0, "step": 8728 }, { "entropy": 0.9658143371343613, "epoch": 4.596629805160611, "grad_norm": 0.2848398685455322, "learning_rate": 7.016206231570426e-05, "loss": 0.16318723559379578, "mean_token_accuracy": 0.929384633898735, "num_tokens": 107676832.0, "step": 8729 }, { "entropy": 1.0240425169467926, "epoch": 4.597156398104265, "grad_norm": 0.310256689786911, "learning_rate": 7.014240045655494e-05, "loss": 0.17658701539039612, "mean_token_accuracy": 0.9227228760719299, "num_tokens": 107689168.0, "step": 8730 }, { "entropy": 1.0089117288589478, "epoch": 4.59768299104792, "grad_norm": 0.3132132589817047, "learning_rate": 7.012274096351898e-05, "loss": 0.18013951182365417, "mean_token_accuracy": 0.9222273379564285, "num_tokens": 107701504.0, "step": 8731 }, { "entropy": 1.0355899930000305, "epoch": 4.598209583991575, "grad_norm": 0.3282855451107025, "learning_rate": 7.010308383776352e-05, "loss": 0.1806597262620926, "mean_token_accuracy": 0.923142671585083, "num_tokens": 107713840.0, "step": 8732 }, { "entropy": 1.0216601938009262, "epoch": 4.598736176935229, "grad_norm": 0.3035755455493927, "learning_rate": 7.008342908045542e-05, "loss": 0.17160706222057343, "mean_token_accuracy": 0.9253741949796677, "num_tokens": 107726176.0, "step": 8733 }, { "entropy": 1.0056361258029938, "epoch": 4.599262769878884, "grad_norm": 0.28573930263519287, "learning_rate": 7.006377669276147e-05, "loss": 0.15307191014289856, "mean_token_accuracy": 0.9353896081447601, "num_tokens": 107738512.0, "step": 8734 }, { "entropy": 1.0611897706985474, "epoch": 4.599789362822538, "grad_norm": 0.32753387093544006, "learning_rate": 7.004412667584834e-05, "loss": 0.17335793375968933, "mean_token_accuracy": 0.9274525344371796, "num_tokens": 107750848.0, "step": 8735 }, { "entropy": 1.003476321697235, "epoch": 4.600315955766193, "grad_norm": 0.3149878978729248, "learning_rate": 7.002447903088254e-05, "loss": 0.16786393523216248, "mean_token_accuracy": 0.928516298532486, "num_tokens": 107763184.0, "step": 8736 }, { "entropy": 1.010802537202835, "epoch": 4.600842548709847, "grad_norm": 0.2895418107509613, "learning_rate": 7.000483375903045e-05, "loss": 0.15088866651058197, "mean_token_accuracy": 0.9328432381153107, "num_tokens": 107775520.0, "step": 8737 }, { "entropy": 0.9834362864494324, "epoch": 4.601369141653501, "grad_norm": 0.3100012242794037, "learning_rate": 6.998519086145822e-05, "loss": 0.16654789447784424, "mean_token_accuracy": 0.9275851845741272, "num_tokens": 107787856.0, "step": 8738 }, { "entropy": 0.9788924306631088, "epoch": 4.601895734597156, "grad_norm": 0.33185940980911255, "learning_rate": 6.9965550339332e-05, "loss": 0.1668771505355835, "mean_token_accuracy": 0.9286605268716812, "num_tokens": 107800192.0, "step": 8739 }, { "entropy": 0.9902924746274948, "epoch": 4.602422327540811, "grad_norm": 0.3223089873790741, "learning_rate": 6.994591219381774e-05, "loss": 0.1609772890806198, "mean_token_accuracy": 0.9281881749629974, "num_tokens": 107812528.0, "step": 8740 }, { "entropy": 0.9932299852371216, "epoch": 4.602948920484465, "grad_norm": 0.31837165355682373, "learning_rate": 6.992627642608118e-05, "loss": 0.1766543835401535, "mean_token_accuracy": 0.9214552193880081, "num_tokens": 107824864.0, "step": 8741 }, { "entropy": 1.0190290212631226, "epoch": 4.60347551342812, "grad_norm": 0.35585761070251465, "learning_rate": 6.990664303728804e-05, "loss": 0.18412742018699646, "mean_token_accuracy": 0.923671618103981, "num_tokens": 107837200.0, "step": 8742 }, { "entropy": 0.9401917308568954, "epoch": 4.604002106371775, "grad_norm": 0.2916022539138794, "learning_rate": 6.988701202860384e-05, "loss": 0.15726128220558167, "mean_token_accuracy": 0.931135967373848, "num_tokens": 107849536.0, "step": 8743 }, { "entropy": 0.9833636432886124, "epoch": 4.604528699315429, "grad_norm": 0.35866621136665344, "learning_rate": 6.986738340119392e-05, "loss": 0.18105976283550262, "mean_token_accuracy": 0.9182242453098297, "num_tokens": 107861872.0, "step": 8744 }, { "entropy": 0.9567048400640488, "epoch": 4.605055292259084, "grad_norm": 0.3104209899902344, "learning_rate": 6.98477571562235e-05, "loss": 0.17179551720619202, "mean_token_accuracy": 0.9252661168575287, "num_tokens": 107874208.0, "step": 8745 }, { "entropy": 0.9775879085063934, "epoch": 4.605581885202739, "grad_norm": 0.3023075759410858, "learning_rate": 6.982813329485776e-05, "loss": 0.15816596150398254, "mean_token_accuracy": 0.9306709617376328, "num_tokens": 107886544.0, "step": 8746 }, { "entropy": 0.9464512020349503, "epoch": 4.606108478146393, "grad_norm": 0.30875155329704285, "learning_rate": 6.980851181826162e-05, "loss": 0.1684526652097702, "mean_token_accuracy": 0.9325686395168304, "num_tokens": 107898880.0, "step": 8747 }, { "entropy": 0.9552883207798004, "epoch": 4.606635071090047, "grad_norm": 0.3210124671459198, "learning_rate": 6.978889272759987e-05, "loss": 0.17382028698921204, "mean_token_accuracy": 0.9314020872116089, "num_tokens": 107911216.0, "step": 8748 }, { "entropy": 0.9750551283359528, "epoch": 4.607161664033702, "grad_norm": 0.2832907736301422, "learning_rate": 6.976927602403718e-05, "loss": 0.14793327450752258, "mean_token_accuracy": 0.9364615827798843, "num_tokens": 107923552.0, "step": 8749 }, { "entropy": 0.9648535847663879, "epoch": 4.607688256977356, "grad_norm": 0.30289632081985474, "learning_rate": 6.97496617087381e-05, "loss": 0.1678515374660492, "mean_token_accuracy": 0.9286443442106247, "num_tokens": 107935888.0, "step": 8750 }, { "entropy": 1.0221524238586426, "epoch": 4.608214849921011, "grad_norm": 0.3171069920063019, "learning_rate": 6.9730049782867e-05, "loss": 0.1789323091506958, "mean_token_accuracy": 0.9245229810476303, "num_tokens": 107948224.0, "step": 8751 }, { "entropy": 1.0002122968435287, "epoch": 4.608741442864666, "grad_norm": 0.3247002065181732, "learning_rate": 6.97104402475881e-05, "loss": 0.1693766862154007, "mean_token_accuracy": 0.9273964613676071, "num_tokens": 107960560.0, "step": 8752 }, { "entropy": 1.0298629105091095, "epoch": 4.60926803580832, "grad_norm": 0.31016674637794495, "learning_rate": 6.969083310406554e-05, "loss": 0.15787182748317719, "mean_token_accuracy": 0.935954675078392, "num_tokens": 107972896.0, "step": 8753 }, { "entropy": 0.9574241787195206, "epoch": 4.609794628751975, "grad_norm": 0.2948024570941925, "learning_rate": 6.967122835346334e-05, "loss": 0.15867428481578827, "mean_token_accuracy": 0.9365124106407166, "num_tokens": 107985232.0, "step": 8754 }, { "entropy": 0.996378943324089, "epoch": 4.61032122169563, "grad_norm": 0.2876661419868469, "learning_rate": 6.965162599694521e-05, "loss": 0.15610000491142273, "mean_token_accuracy": 0.9314628392457962, "num_tokens": 107997568.0, "step": 8755 }, { "entropy": 0.9925418645143509, "epoch": 4.610847814639284, "grad_norm": 0.32017311453819275, "learning_rate": 6.963202603567489e-05, "loss": 0.1787632256746292, "mean_token_accuracy": 0.9199665635824203, "num_tokens": 108009904.0, "step": 8756 }, { "entropy": 1.0136579424142838, "epoch": 4.611374407582939, "grad_norm": 0.3359333574771881, "learning_rate": 6.96124284708159e-05, "loss": 0.18175891041755676, "mean_token_accuracy": 0.9239500015974045, "num_tokens": 108022240.0, "step": 8757 }, { "entropy": 1.0320144146680832, "epoch": 4.611901000526593, "grad_norm": 0.33800309896469116, "learning_rate": 6.959283330353168e-05, "loss": 0.18834570050239563, "mean_token_accuracy": 0.9215432703495026, "num_tokens": 108034576.0, "step": 8758 }, { "entropy": 0.9942899644374847, "epoch": 4.6124275934702474, "grad_norm": 0.3465676009654999, "learning_rate": 6.957324053498535e-05, "loss": 0.18794047832489014, "mean_token_accuracy": 0.9213247150182724, "num_tokens": 108046912.0, "step": 8759 }, { "entropy": 0.9882669001817703, "epoch": 4.612954186413902, "grad_norm": 0.3110610842704773, "learning_rate": 6.955365016634016e-05, "loss": 0.16755543649196625, "mean_token_accuracy": 0.9325612932443619, "num_tokens": 108059248.0, "step": 8760 }, { "entropy": 1.0631378889083862, "epoch": 4.613480779357556, "grad_norm": 0.33182603120803833, "learning_rate": 6.953406219875902e-05, "loss": 0.18475112318992615, "mean_token_accuracy": 0.9203294217586517, "num_tokens": 108071584.0, "step": 8761 }, { "entropy": 1.0360340029001236, "epoch": 4.614007372301211, "grad_norm": 0.3316214382648468, "learning_rate": 6.951447663340474e-05, "loss": 0.17253397405147552, "mean_token_accuracy": 0.9253484904766083, "num_tokens": 108083920.0, "step": 8762 }, { "entropy": 0.9969138652086258, "epoch": 4.614533965244866, "grad_norm": 0.28674861788749695, "learning_rate": 6.949489347144002e-05, "loss": 0.15221770107746124, "mean_token_accuracy": 0.9338681846857071, "num_tokens": 108096256.0, "step": 8763 }, { "entropy": 0.9754995256662369, "epoch": 4.61506055818852, "grad_norm": 0.3082277476787567, "learning_rate": 6.947531271402738e-05, "loss": 0.16877172887325287, "mean_token_accuracy": 0.9282251596450806, "num_tokens": 108108592.0, "step": 8764 }, { "entropy": 1.0329546630382538, "epoch": 4.615587151132175, "grad_norm": 0.3272295594215393, "learning_rate": 6.945573436232924e-05, "loss": 0.17032533884048462, "mean_token_accuracy": 0.9320805817842484, "num_tokens": 108120928.0, "step": 8765 }, { "entropy": 1.024133563041687, "epoch": 4.61611374407583, "grad_norm": 0.3026040196418762, "learning_rate": 6.943615841750783e-05, "loss": 0.16396477818489075, "mean_token_accuracy": 0.9272926896810532, "num_tokens": 108133264.0, "step": 8766 }, { "entropy": 1.0271407514810562, "epoch": 4.616640337019484, "grad_norm": 0.32383832335472107, "learning_rate": 6.94165848807253e-05, "loss": 0.1656980812549591, "mean_token_accuracy": 0.9300740510225296, "num_tokens": 108145600.0, "step": 8767 }, { "entropy": 1.054329827427864, "epoch": 4.617166929963139, "grad_norm": 0.3429238796234131, "learning_rate": 6.939701375314358e-05, "loss": 0.17477953433990479, "mean_token_accuracy": 0.9288169890642166, "num_tokens": 108157936.0, "step": 8768 }, { "entropy": 1.020611047744751, "epoch": 4.617693522906793, "grad_norm": 0.32155418395996094, "learning_rate": 6.937744503592448e-05, "loss": 0.16102604568004608, "mean_token_accuracy": 0.9318195581436157, "num_tokens": 108170272.0, "step": 8769 }, { "entropy": 0.9947672635316849, "epoch": 4.6182201158504474, "grad_norm": 0.3039378821849823, "learning_rate": 6.935787873022971e-05, "loss": 0.16173730790615082, "mean_token_accuracy": 0.9321751296520233, "num_tokens": 108182608.0, "step": 8770 }, { "entropy": 0.993101179599762, "epoch": 4.618746708794102, "grad_norm": 0.3157470226287842, "learning_rate": 6.93383148372208e-05, "loss": 0.17102232575416565, "mean_token_accuracy": 0.9239119738340378, "num_tokens": 108194944.0, "step": 8771 }, { "entropy": 1.037236139178276, "epoch": 4.619273301737756, "grad_norm": 0.30419865250587463, "learning_rate": 6.931875335805915e-05, "loss": 0.17111724615097046, "mean_token_accuracy": 0.9261699765920639, "num_tokens": 108207280.0, "step": 8772 }, { "entropy": 1.0121787637472153, "epoch": 4.619799894681411, "grad_norm": 0.30403435230255127, "learning_rate": 6.929919429390597e-05, "loss": 0.1617126315832138, "mean_token_accuracy": 0.9305363595485687, "num_tokens": 108219616.0, "step": 8773 }, { "entropy": 0.9898070394992828, "epoch": 4.620326487625066, "grad_norm": 0.3091951608657837, "learning_rate": 6.927963764592242e-05, "loss": 0.17442327737808228, "mean_token_accuracy": 0.9246090650558472, "num_tokens": 108231952.0, "step": 8774 }, { "entropy": 1.0206804275512695, "epoch": 4.62085308056872, "grad_norm": 0.3396073281764984, "learning_rate": 6.926008341526947e-05, "loss": 0.17265398800373077, "mean_token_accuracy": 0.930071085691452, "num_tokens": 108244288.0, "step": 8775 }, { "entropy": 1.0402859449386597, "epoch": 4.621379673512375, "grad_norm": 0.31713059544563293, "learning_rate": 6.924053160310791e-05, "loss": 0.16856266558170319, "mean_token_accuracy": 0.9330925494432449, "num_tokens": 108256624.0, "step": 8776 }, { "entropy": 0.9876909554004669, "epoch": 4.62190626645603, "grad_norm": 0.31122639775276184, "learning_rate": 6.922098221059845e-05, "loss": 0.16525253653526306, "mean_token_accuracy": 0.9351381659507751, "num_tokens": 108268960.0, "step": 8777 }, { "entropy": 0.9891609102487564, "epoch": 4.622432859399684, "grad_norm": 0.31381669640541077, "learning_rate": 6.920143523890156e-05, "loss": 0.17055228352546692, "mean_token_accuracy": 0.9297476559877396, "num_tokens": 108281296.0, "step": 8778 }, { "entropy": 0.9974513947963715, "epoch": 4.622959452343339, "grad_norm": 0.3451111316680908, "learning_rate": 6.918189068917769e-05, "loss": 0.17237506806850433, "mean_token_accuracy": 0.9254035949707031, "num_tokens": 108293632.0, "step": 8779 }, { "entropy": 1.0044319182634354, "epoch": 4.6234860452869935, "grad_norm": 0.29564011096954346, "learning_rate": 6.916234856258701e-05, "loss": 0.15609613060951233, "mean_token_accuracy": 0.9366973489522934, "num_tokens": 108305968.0, "step": 8780 }, { "entropy": 0.9985024929046631, "epoch": 4.6240126382306475, "grad_norm": 0.33756110072135925, "learning_rate": 6.914280886028974e-05, "loss": 0.17060284316539764, "mean_token_accuracy": 0.9281386137008667, "num_tokens": 108318304.0, "step": 8781 }, { "entropy": 1.0304796695709229, "epoch": 4.624539231174302, "grad_norm": 0.31444182991981506, "learning_rate": 6.912327158344574e-05, "loss": 0.1649145632982254, "mean_token_accuracy": 0.9314026683568954, "num_tokens": 108330640.0, "step": 8782 }, { "entropy": 1.002663105726242, "epoch": 4.625065824117957, "grad_norm": 0.3058187961578369, "learning_rate": 6.910373673321486e-05, "loss": 0.15711860358715057, "mean_token_accuracy": 0.9331463426351547, "num_tokens": 108342976.0, "step": 8783 }, { "entropy": 0.9933810830116272, "epoch": 4.625592417061611, "grad_norm": 0.3585160970687866, "learning_rate": 6.908420431075678e-05, "loss": 0.18280671536922455, "mean_token_accuracy": 0.9210616052150726, "num_tokens": 108355312.0, "step": 8784 }, { "entropy": 0.9912279844284058, "epoch": 4.626119010005266, "grad_norm": 0.3315320611000061, "learning_rate": 6.906467431723103e-05, "loss": 0.17114242911338806, "mean_token_accuracy": 0.9239901006221771, "num_tokens": 108367648.0, "step": 8785 }, { "entropy": 0.97652168571949, "epoch": 4.626645602948921, "grad_norm": 0.34236273169517517, "learning_rate": 6.904514675379695e-05, "loss": 0.17682960629463196, "mean_token_accuracy": 0.9264667481184006, "num_tokens": 108379984.0, "step": 8786 }, { "entropy": 0.9817781150341034, "epoch": 4.627172195892575, "grad_norm": 0.32331737875938416, "learning_rate": 6.902562162161381e-05, "loss": 0.17068400979042053, "mean_token_accuracy": 0.9266734570264816, "num_tokens": 108392320.0, "step": 8787 }, { "entropy": 1.0087388455867767, "epoch": 4.62769878883623, "grad_norm": 0.35012075304985046, "learning_rate": 6.900609892184071e-05, "loss": 0.17089639604091644, "mean_token_accuracy": 0.9257703721523285, "num_tokens": 108404656.0, "step": 8788 }, { "entropy": 0.946434274315834, "epoch": 4.628225381779885, "grad_norm": 0.2971382737159729, "learning_rate": 6.898657865563657e-05, "loss": 0.1607464849948883, "mean_token_accuracy": 0.9312983602285385, "num_tokens": 108416992.0, "step": 8789 }, { "entropy": 0.9486940801143646, "epoch": 4.628751974723539, "grad_norm": 0.31900492310523987, "learning_rate": 6.896706082416022e-05, "loss": 0.16454634070396423, "mean_token_accuracy": 0.9287359267473221, "num_tokens": 108429328.0, "step": 8790 }, { "entropy": 0.9518442749977112, "epoch": 4.6292785676671935, "grad_norm": 0.32260754704475403, "learning_rate": 6.894754542857031e-05, "loss": 0.17235061526298523, "mean_token_accuracy": 0.9254087507724762, "num_tokens": 108441664.0, "step": 8791 }, { "entropy": 0.981766864657402, "epoch": 4.6298051606108475, "grad_norm": 0.3477701246738434, "learning_rate": 6.892803247002535e-05, "loss": 0.18203023076057434, "mean_token_accuracy": 0.9227351993322372, "num_tokens": 108454000.0, "step": 8792 }, { "entropy": 0.9812089949846268, "epoch": 4.630331753554502, "grad_norm": 0.34699487686157227, "learning_rate": 6.890852194968374e-05, "loss": 0.17964249849319458, "mean_token_accuracy": 0.918544813990593, "num_tokens": 108466336.0, "step": 8793 }, { "entropy": 1.016109973192215, "epoch": 4.630858346498157, "grad_norm": 0.33892375230789185, "learning_rate": 6.888901386870361e-05, "loss": 0.1662784069776535, "mean_token_accuracy": 0.931085929274559, "num_tokens": 108478672.0, "step": 8794 }, { "entropy": 0.9515203684568405, "epoch": 4.631384939441811, "grad_norm": 0.2908926010131836, "learning_rate": 6.886950822824319e-05, "loss": 0.1586223542690277, "mean_token_accuracy": 0.932471439242363, "num_tokens": 108491008.0, "step": 8795 }, { "entropy": 0.9727869927883148, "epoch": 4.631911532385466, "grad_norm": 0.3081713020801544, "learning_rate": 6.885000502946035e-05, "loss": 0.1696777045726776, "mean_token_accuracy": 0.9311618357896805, "num_tokens": 108503344.0, "step": 8796 }, { "entropy": 0.9695296436548233, "epoch": 4.632438125329121, "grad_norm": 0.3235263228416443, "learning_rate": 6.883050427351283e-05, "loss": 0.16967125236988068, "mean_token_accuracy": 0.9278686344623566, "num_tokens": 108515680.0, "step": 8797 }, { "entropy": 0.9924297034740448, "epoch": 4.632964718272775, "grad_norm": 0.33361580967903137, "learning_rate": 6.881100596155833e-05, "loss": 0.16959601640701294, "mean_token_accuracy": 0.9281372725963593, "num_tokens": 108528016.0, "step": 8798 }, { "entropy": 0.9642326831817627, "epoch": 4.63349131121643, "grad_norm": 0.3119698166847229, "learning_rate": 6.879151009475433e-05, "loss": 0.18061037361621857, "mean_token_accuracy": 0.922494113445282, "num_tokens": 108540352.0, "step": 8799 }, { "entropy": 0.9996363669633865, "epoch": 4.634017904160085, "grad_norm": 0.3007625341415405, "learning_rate": 6.87720166742582e-05, "loss": 0.1670391857624054, "mean_token_accuracy": 0.9293374568223953, "num_tokens": 108552688.0, "step": 8800 }, { "entropy": 1.0450481325387955, "epoch": 4.634544497103739, "grad_norm": 0.3554733693599701, "learning_rate": 6.875252570122712e-05, "loss": 0.1709325611591339, "mean_token_accuracy": 0.9246032536029816, "num_tokens": 108565024.0, "step": 8801 }, { "entropy": 1.0150825679302216, "epoch": 4.6350710900473935, "grad_norm": 0.325372576713562, "learning_rate": 6.87330371768182e-05, "loss": 0.17957626283168793, "mean_token_accuracy": 0.9251673370599747, "num_tokens": 108577360.0, "step": 8802 }, { "entropy": 1.0115544945001602, "epoch": 4.6355976829910475, "grad_norm": 0.328909307718277, "learning_rate": 6.871355110218834e-05, "loss": 0.17813214659690857, "mean_token_accuracy": 0.9213647395372391, "num_tokens": 108589696.0, "step": 8803 }, { "entropy": 1.015116199851036, "epoch": 4.636124275934702, "grad_norm": 0.31800439953804016, "learning_rate": 6.869406747849433e-05, "loss": 0.17300941050052643, "mean_token_accuracy": 0.9271139949560165, "num_tokens": 108602032.0, "step": 8804 }, { "entropy": 0.9945334792137146, "epoch": 4.636650868878357, "grad_norm": 0.31376081705093384, "learning_rate": 6.867458630689277e-05, "loss": 0.18528945744037628, "mean_token_accuracy": 0.920944482088089, "num_tokens": 108614368.0, "step": 8805 }, { "entropy": 1.0312229245901108, "epoch": 4.637177461822011, "grad_norm": 0.30054622888565063, "learning_rate": 6.865510758854017e-05, "loss": 0.16745856404304504, "mean_token_accuracy": 0.9292907565832138, "num_tokens": 108626704.0, "step": 8806 }, { "entropy": 1.053056538105011, "epoch": 4.637704054765666, "grad_norm": 0.357748806476593, "learning_rate": 6.863563132459287e-05, "loss": 0.18521693348884583, "mean_token_accuracy": 0.9175962060689926, "num_tokens": 108639040.0, "step": 8807 }, { "entropy": 1.073351889848709, "epoch": 4.638230647709321, "grad_norm": 0.32469242811203003, "learning_rate": 6.861615751620701e-05, "loss": 0.16757342219352722, "mean_token_accuracy": 0.927339494228363, "num_tokens": 108651376.0, "step": 8808 }, { "entropy": 0.9891101121902466, "epoch": 4.638757240652975, "grad_norm": 0.27564358711242676, "learning_rate": 6.859668616453869e-05, "loss": 0.1580924689769745, "mean_token_accuracy": 0.9324152171611786, "num_tokens": 108663712.0, "step": 8809 }, { "entropy": 1.0437711328268051, "epoch": 4.63928383359663, "grad_norm": 0.3324485421180725, "learning_rate": 6.85772172707438e-05, "loss": 0.18268510699272156, "mean_token_accuracy": 0.9208597838878632, "num_tokens": 108676048.0, "step": 8810 }, { "entropy": 1.0445916056632996, "epoch": 4.639810426540285, "grad_norm": 0.31860390305519104, "learning_rate": 6.855775083597808e-05, "loss": 0.16359257698059082, "mean_token_accuracy": 0.9334599822759628, "num_tokens": 108688384.0, "step": 8811 }, { "entropy": 1.0297775864601135, "epoch": 4.640337019483939, "grad_norm": 0.3371516764163971, "learning_rate": 6.853828686139716e-05, "loss": 0.18046995997428894, "mean_token_accuracy": 0.9293525815010071, "num_tokens": 108700720.0, "step": 8812 }, { "entropy": 1.0049115121364594, "epoch": 4.6408636124275935, "grad_norm": 0.29611310362815857, "learning_rate": 6.851882534815649e-05, "loss": 0.15877759456634521, "mean_token_accuracy": 0.9356518685817719, "num_tokens": 108713056.0, "step": 8813 }, { "entropy": 1.0410502701997757, "epoch": 4.641390205371248, "grad_norm": 0.27554795145988464, "learning_rate": 6.849936629741138e-05, "loss": 0.15286138653755188, "mean_token_accuracy": 0.933782085776329, "num_tokens": 108725392.0, "step": 8814 }, { "entropy": 1.0450260192155838, "epoch": 4.641916798314902, "grad_norm": 0.29855507612228394, "learning_rate": 6.847990971031704e-05, "loss": 0.1780097931623459, "mean_token_accuracy": 0.9241447150707245, "num_tokens": 108737728.0, "step": 8815 }, { "entropy": 1.0352587401866913, "epoch": 4.642443391258557, "grad_norm": 0.30585408210754395, "learning_rate": 6.846045558802842e-05, "loss": 0.1605367362499237, "mean_token_accuracy": 0.9307635575532913, "num_tokens": 108750064.0, "step": 8816 }, { "entropy": 0.9806309789419174, "epoch": 4.642969984202212, "grad_norm": 0.2845015525817871, "learning_rate": 6.844100393170047e-05, "loss": 0.1599006950855255, "mean_token_accuracy": 0.9303335249423981, "num_tokens": 108762400.0, "step": 8817 }, { "entropy": 1.057199478149414, "epoch": 4.643496577145866, "grad_norm": 0.3356047570705414, "learning_rate": 6.84215547424879e-05, "loss": 0.15979963541030884, "mean_token_accuracy": 0.9306587725877762, "num_tokens": 108774736.0, "step": 8818 }, { "entropy": 1.0132673531770706, "epoch": 4.644023170089521, "grad_norm": 0.2916070520877838, "learning_rate": 6.840210802154525e-05, "loss": 0.16350027918815613, "mean_token_accuracy": 0.9252615720033646, "num_tokens": 108787072.0, "step": 8819 }, { "entropy": 1.0183844417333603, "epoch": 4.644549763033176, "grad_norm": 0.2789771854877472, "learning_rate": 6.838266377002702e-05, "loss": 0.14993609488010406, "mean_token_accuracy": 0.9347283989191055, "num_tokens": 108799408.0, "step": 8820 }, { "entropy": 0.9974929839372635, "epoch": 4.64507635597683, "grad_norm": 0.3179318308830261, "learning_rate": 6.83632219890875e-05, "loss": 0.17396214604377747, "mean_token_accuracy": 0.9251264482736588, "num_tokens": 108811744.0, "step": 8821 }, { "entropy": 1.0086408704519272, "epoch": 4.645602948920485, "grad_norm": 0.3315167725086212, "learning_rate": 6.834378267988072e-05, "loss": 0.1686999499797821, "mean_token_accuracy": 0.9279903620481491, "num_tokens": 108824080.0, "step": 8822 }, { "entropy": 1.0120555758476257, "epoch": 4.6461295418641395, "grad_norm": 0.31629952788352966, "learning_rate": 6.832434584356084e-05, "loss": 0.16480788588523865, "mean_token_accuracy": 0.930375799536705, "num_tokens": 108836416.0, "step": 8823 }, { "entropy": 1.036504328250885, "epoch": 4.6466561348077935, "grad_norm": 0.33338403701782227, "learning_rate": 6.830491148128166e-05, "loss": 0.16853323578834534, "mean_token_accuracy": 0.9285017400979996, "num_tokens": 108848752.0, "step": 8824 }, { "entropy": 1.0557902306318283, "epoch": 4.647182727751448, "grad_norm": 0.3519696593284607, "learning_rate": 6.828547959419688e-05, "loss": 0.18914440274238586, "mean_token_accuracy": 0.9214043617248535, "num_tokens": 108861088.0, "step": 8825 }, { "entropy": 1.0277077853679657, "epoch": 4.647709320695102, "grad_norm": 0.3393276631832123, "learning_rate": 6.826605018346004e-05, "loss": 0.16981624066829681, "mean_token_accuracy": 0.9295682162046432, "num_tokens": 108873424.0, "step": 8826 }, { "entropy": 0.9834050834178925, "epoch": 4.648235913638757, "grad_norm": 0.3136768639087677, "learning_rate": 6.824662325022451e-05, "loss": 0.15382970869541168, "mean_token_accuracy": 0.9335749596357346, "num_tokens": 108885760.0, "step": 8827 }, { "entropy": 1.0283687263727188, "epoch": 4.648762506582412, "grad_norm": 0.31119608879089355, "learning_rate": 6.822719879564364e-05, "loss": 0.14895489811897278, "mean_token_accuracy": 0.935601681470871, "num_tokens": 108898096.0, "step": 8828 }, { "entropy": 0.9725286513566971, "epoch": 4.649289099526066, "grad_norm": 0.30130234360694885, "learning_rate": 6.820777682087044e-05, "loss": 0.1579904854297638, "mean_token_accuracy": 0.9328674077987671, "num_tokens": 108910432.0, "step": 8829 }, { "entropy": 0.9630727767944336, "epoch": 4.649815692469721, "grad_norm": 0.2871607840061188, "learning_rate": 6.818835732705799e-05, "loss": 0.1505204439163208, "mean_token_accuracy": 0.938169002532959, "num_tokens": 108922768.0, "step": 8830 }, { "entropy": 1.0013564974069595, "epoch": 4.650342285413376, "grad_norm": 0.29978296160697937, "learning_rate": 6.816894031535908e-05, "loss": 0.17103968560695648, "mean_token_accuracy": 0.9303154200315475, "num_tokens": 108935104.0, "step": 8831 }, { "entropy": 1.035158023238182, "epoch": 4.65086887835703, "grad_norm": 0.3239688575267792, "learning_rate": 6.814952578692637e-05, "loss": 0.1669498085975647, "mean_token_accuracy": 0.9296908974647522, "num_tokens": 108947440.0, "step": 8832 }, { "entropy": 0.9917216300964355, "epoch": 4.651395471300685, "grad_norm": 0.3029177188873291, "learning_rate": 6.81301137429124e-05, "loss": 0.17024460434913635, "mean_token_accuracy": 0.9244478642940521, "num_tokens": 108959776.0, "step": 8833 }, { "entropy": 0.9994790703058243, "epoch": 4.651922064244339, "grad_norm": 0.3118470013141632, "learning_rate": 6.811070418446953e-05, "loss": 0.16566264629364014, "mean_token_accuracy": 0.9256698489189148, "num_tokens": 108972112.0, "step": 8834 }, { "entropy": 0.9939791262149811, "epoch": 4.6524486571879935, "grad_norm": 0.3334689736366272, "learning_rate": 6.809129711275e-05, "loss": 0.17950989305973053, "mean_token_accuracy": 0.9242898970842361, "num_tokens": 108984448.0, "step": 8835 }, { "entropy": 0.9304020404815674, "epoch": 4.652975250131648, "grad_norm": 0.33595287799835205, "learning_rate": 6.80718925289059e-05, "loss": 0.17988379299640656, "mean_token_accuracy": 0.9204196929931641, "num_tokens": 108996784.0, "step": 8836 }, { "entropy": 1.0219557583332062, "epoch": 4.653501843075302, "grad_norm": 0.3548906743526459, "learning_rate": 6.805249043408918e-05, "loss": 0.1703854650259018, "mean_token_accuracy": 0.9284821301698685, "num_tokens": 109009120.0, "step": 8837 }, { "entropy": 0.9631175994873047, "epoch": 4.654028436018957, "grad_norm": 0.3329707980155945, "learning_rate": 6.803309082945159e-05, "loss": 0.1741081178188324, "mean_token_accuracy": 0.9273754209280014, "num_tokens": 109021456.0, "step": 8838 }, { "entropy": 1.0109445601701736, "epoch": 4.654555028962612, "grad_norm": 0.34718072414398193, "learning_rate": 6.80136937161448e-05, "loss": 0.17463737726211548, "mean_token_accuracy": 0.9279660135507584, "num_tokens": 109033792.0, "step": 8839 }, { "entropy": 0.97547547519207, "epoch": 4.655081621906266, "grad_norm": 0.3017706871032715, "learning_rate": 6.799429909532032e-05, "loss": 0.15317855775356293, "mean_token_accuracy": 0.9332242012023926, "num_tokens": 109046128.0, "step": 8840 }, { "entropy": 0.9765388518571854, "epoch": 4.655608214849921, "grad_norm": 0.3442109525203705, "learning_rate": 6.797490696812948e-05, "loss": 0.17506183683872223, "mean_token_accuracy": 0.9238266944885254, "num_tokens": 109058464.0, "step": 8841 }, { "entropy": 0.992646723985672, "epoch": 4.656134807793576, "grad_norm": 0.33706432580947876, "learning_rate": 6.795551733572342e-05, "loss": 0.1667737364768982, "mean_token_accuracy": 0.9309960454702377, "num_tokens": 109070800.0, "step": 8842 }, { "entropy": 0.9908954352140427, "epoch": 4.65666140073723, "grad_norm": 0.31130319833755493, "learning_rate": 6.793613019925326e-05, "loss": 0.17460176348686218, "mean_token_accuracy": 0.9256035834550858, "num_tokens": 109083136.0, "step": 8843 }, { "entropy": 1.02932608127594, "epoch": 4.657187993680885, "grad_norm": 0.3063564598560333, "learning_rate": 6.791674555986994e-05, "loss": 0.1669730693101883, "mean_token_accuracy": 0.9289689511060715, "num_tokens": 109095472.0, "step": 8844 }, { "entropy": 1.0227219462394714, "epoch": 4.6577145866245395, "grad_norm": 0.3334781527519226, "learning_rate": 6.78973634187241e-05, "loss": 0.16546808183193207, "mean_token_accuracy": 0.9333768039941788, "num_tokens": 109107808.0, "step": 8845 }, { "entropy": 0.9633027613162994, "epoch": 4.6582411795681935, "grad_norm": 0.30114901065826416, "learning_rate": 6.787798377696641e-05, "loss": 0.1666855365037918, "mean_token_accuracy": 0.9321528971195221, "num_tokens": 109120144.0, "step": 8846 }, { "entropy": 1.0001439154148102, "epoch": 4.658767772511848, "grad_norm": 0.3661600351333618, "learning_rate": 6.785860663574735e-05, "loss": 0.16610540449619293, "mean_token_accuracy": 0.9269569218158722, "num_tokens": 109132480.0, "step": 8847 }, { "entropy": 0.9895338863134384, "epoch": 4.659294365455503, "grad_norm": 0.3270148038864136, "learning_rate": 6.783923199621716e-05, "loss": 0.17534351348876953, "mean_token_accuracy": 0.9320991188287735, "num_tokens": 109144816.0, "step": 8848 }, { "entropy": 0.9660409092903137, "epoch": 4.659820958399157, "grad_norm": 0.2960972785949707, "learning_rate": 6.781985985952604e-05, "loss": 0.157662034034729, "mean_token_accuracy": 0.9349133521318436, "num_tokens": 109157152.0, "step": 8849 }, { "entropy": 0.9822867512702942, "epoch": 4.660347551342812, "grad_norm": 0.3005823493003845, "learning_rate": 6.780049022682396e-05, "loss": 0.15429461002349854, "mean_token_accuracy": 0.9349739104509354, "num_tokens": 109169488.0, "step": 8850 }, { "entropy": 0.9865624308586121, "epoch": 4.660874144286467, "grad_norm": 0.3327685296535492, "learning_rate": 6.778112309926085e-05, "loss": 0.1758040487766266, "mean_token_accuracy": 0.9246583431959152, "num_tokens": 109181824.0, "step": 8851 }, { "entropy": 0.977432519197464, "epoch": 4.661400737230121, "grad_norm": 0.28886678814888, "learning_rate": 6.776175847798641e-05, "loss": 0.16094927489757538, "mean_token_accuracy": 0.9336694926023483, "num_tokens": 109194160.0, "step": 8852 }, { "entropy": 1.0480350255966187, "epoch": 4.661927330173776, "grad_norm": 0.32053396105766296, "learning_rate": 6.774239636415016e-05, "loss": 0.170475035905838, "mean_token_accuracy": 0.9263121783733368, "num_tokens": 109206496.0, "step": 8853 }, { "entropy": 0.9531082808971405, "epoch": 4.662453923117431, "grad_norm": 0.3278583884239197, "learning_rate": 6.772303675890158e-05, "loss": 0.17197012901306152, "mean_token_accuracy": 0.9243444502353668, "num_tokens": 109218832.0, "step": 8854 }, { "entropy": 0.9761087149381638, "epoch": 4.662980516061085, "grad_norm": 0.3090464174747467, "learning_rate": 6.77036796633899e-05, "loss": 0.17255406081676483, "mean_token_accuracy": 0.9278616309165955, "num_tokens": 109231168.0, "step": 8855 }, { "entropy": 1.0074574649333954, "epoch": 4.6635071090047395, "grad_norm": 0.3336094319820404, "learning_rate": 6.768432507876421e-05, "loss": 0.17501670122146606, "mean_token_accuracy": 0.9241137206554413, "num_tokens": 109243504.0, "step": 8856 }, { "entropy": 1.0223061740398407, "epoch": 4.6640337019483935, "grad_norm": 0.3564497232437134, "learning_rate": 6.766497300617347e-05, "loss": 0.1735677570104599, "mean_token_accuracy": 0.9331323206424713, "num_tokens": 109255840.0, "step": 8857 }, { "entropy": 0.9463786333799362, "epoch": 4.664560294892048, "grad_norm": 0.30366936326026917, "learning_rate": 6.764562344676658e-05, "loss": 0.1649957001209259, "mean_token_accuracy": 0.9283649027347565, "num_tokens": 109268176.0, "step": 8858 }, { "entropy": 0.9768461138010025, "epoch": 4.665086887835703, "grad_norm": 0.30928438901901245, "learning_rate": 6.762627640169216e-05, "loss": 0.16720689833164215, "mean_token_accuracy": 0.9308343380689621, "num_tokens": 109280512.0, "step": 8859 }, { "entropy": 1.016520380973816, "epoch": 4.665613480779357, "grad_norm": 0.32247668504714966, "learning_rate": 6.760693187209875e-05, "loss": 0.17250953614711761, "mean_token_accuracy": 0.9311464577913284, "num_tokens": 109292848.0, "step": 8860 }, { "entropy": 0.9843768626451492, "epoch": 4.666140073723012, "grad_norm": 0.3198558986186981, "learning_rate": 6.758758985913468e-05, "loss": 0.1559639275074005, "mean_token_accuracy": 0.9342668056488037, "num_tokens": 109305184.0, "step": 8861 }, { "entropy": 0.9267884641885757, "epoch": 4.666666666666667, "grad_norm": 0.2985943853855133, "learning_rate": 6.756825036394822e-05, "loss": 0.16593988239765167, "mean_token_accuracy": 0.9271457940340042, "num_tokens": 109317520.0, "step": 8862 }, { "entropy": 0.9875479191541672, "epoch": 4.667193259610321, "grad_norm": 0.3236728310585022, "learning_rate": 6.754891338768742e-05, "loss": 0.15824377536773682, "mean_token_accuracy": 0.9307315498590469, "num_tokens": 109329856.0, "step": 8863 }, { "entropy": 0.9694172888994217, "epoch": 4.667719852553976, "grad_norm": 0.33678045868873596, "learning_rate": 6.75295789315002e-05, "loss": 0.1783120334148407, "mean_token_accuracy": 0.9196342825889587, "num_tokens": 109342192.0, "step": 8864 }, { "entropy": 0.9831208437681198, "epoch": 4.668246445497631, "grad_norm": 0.3103920519351959, "learning_rate": 6.751024699653436e-05, "loss": 0.17995822429656982, "mean_token_accuracy": 0.9253063350915909, "num_tokens": 109354528.0, "step": 8865 }, { "entropy": 0.9898233413696289, "epoch": 4.668773038441285, "grad_norm": 0.34138306975364685, "learning_rate": 6.749091758393751e-05, "loss": 0.17750176787376404, "mean_token_accuracy": 0.9203987568616867, "num_tokens": 109366864.0, "step": 8866 }, { "entropy": 1.002127543091774, "epoch": 4.6692996313849395, "grad_norm": 0.33900532126426697, "learning_rate": 6.747159069485711e-05, "loss": 0.1801394820213318, "mean_token_accuracy": 0.9212726056575775, "num_tokens": 109379200.0, "step": 8867 }, { "entropy": 0.9915066063404083, "epoch": 4.6698262243285935, "grad_norm": 0.3155921697616577, "learning_rate": 6.74522663304405e-05, "loss": 0.1677819937467575, "mean_token_accuracy": 0.9282025843858719, "num_tokens": 109391536.0, "step": 8868 }, { "entropy": 0.9988605678081512, "epoch": 4.670352817272248, "grad_norm": 0.34599870443344116, "learning_rate": 6.743294449183484e-05, "loss": 0.18143510818481445, "mean_token_accuracy": 0.9232761263847351, "num_tokens": 109403872.0, "step": 8869 }, { "entropy": 0.9647913128137589, "epoch": 4.670879410215903, "grad_norm": 0.32590943574905396, "learning_rate": 6.741362518018717e-05, "loss": 0.17814356088638306, "mean_token_accuracy": 0.9267314821481705, "num_tokens": 109416208.0, "step": 8870 }, { "entropy": 1.0397229194641113, "epoch": 4.671406003159557, "grad_norm": 0.37251850962638855, "learning_rate": 6.739430839664433e-05, "loss": 0.1976044923067093, "mean_token_accuracy": 0.9167015850543976, "num_tokens": 109428544.0, "step": 8871 }, { "entropy": 0.9867613464593887, "epoch": 4.671932596103212, "grad_norm": 0.33050283789634705, "learning_rate": 6.737499414235311e-05, "loss": 0.17148789763450623, "mean_token_accuracy": 0.9267898797988892, "num_tokens": 109440880.0, "step": 8872 }, { "entropy": 1.0076529681682587, "epoch": 4.672459189046867, "grad_norm": 0.3122973144054413, "learning_rate": 6.735568241846006e-05, "loss": 0.17840178310871124, "mean_token_accuracy": 0.9209193140268326, "num_tokens": 109453216.0, "step": 8873 }, { "entropy": 1.0246639102697372, "epoch": 4.672985781990521, "grad_norm": 0.36017894744873047, "learning_rate": 6.733637322611162e-05, "loss": 0.17562445998191833, "mean_token_accuracy": 0.9206981956958771, "num_tokens": 109465552.0, "step": 8874 }, { "entropy": 1.0051601976156235, "epoch": 4.673512374934176, "grad_norm": 0.3045935034751892, "learning_rate": 6.7317066566454e-05, "loss": 0.17342790961265564, "mean_token_accuracy": 0.9259002655744553, "num_tokens": 109477888.0, "step": 8875 }, { "entropy": 1.0023014098405838, "epoch": 4.674038967877831, "grad_norm": 0.30328163504600525, "learning_rate": 6.729776244063338e-05, "loss": 0.17087529599666595, "mean_token_accuracy": 0.9310528039932251, "num_tokens": 109490224.0, "step": 8876 }, { "entropy": 1.069144368171692, "epoch": 4.674565560821485, "grad_norm": 0.34419316053390503, "learning_rate": 6.727846084979569e-05, "loss": 0.18067161738872528, "mean_token_accuracy": 0.9256099611520767, "num_tokens": 109502560.0, "step": 8877 }, { "entropy": 1.006365492939949, "epoch": 4.6750921537651395, "grad_norm": 0.31279006600379944, "learning_rate": 6.725916179508677e-05, "loss": 0.170567125082016, "mean_token_accuracy": 0.9316010475158691, "num_tokens": 109514896.0, "step": 8878 }, { "entropy": 1.003068968653679, "epoch": 4.675618746708794, "grad_norm": 0.3209126591682434, "learning_rate": 6.723986527765232e-05, "loss": 0.1880316585302353, "mean_token_accuracy": 0.9221562743186951, "num_tokens": 109527232.0, "step": 8879 }, { "entropy": 0.9958730340003967, "epoch": 4.676145339652448, "grad_norm": 0.34401512145996094, "learning_rate": 6.722057129863784e-05, "loss": 0.18341436982154846, "mean_token_accuracy": 0.9197598397731781, "num_tokens": 109539568.0, "step": 8880 }, { "entropy": 1.0369246304035187, "epoch": 4.676671932596103, "grad_norm": 0.315122127532959, "learning_rate": 6.720127985918872e-05, "loss": 0.16368912160396576, "mean_token_accuracy": 0.93260657787323, "num_tokens": 109551904.0, "step": 8881 }, { "entropy": 0.9783090353012085, "epoch": 4.677198525539758, "grad_norm": 0.2675493061542511, "learning_rate": 6.718199096045017e-05, "loss": 0.14673762023448944, "mean_token_accuracy": 0.9364724457263947, "num_tokens": 109564240.0, "step": 8882 }, { "entropy": 0.9681363850831985, "epoch": 4.677725118483412, "grad_norm": 0.30054959654808044, "learning_rate": 6.716270460356724e-05, "loss": 0.1793966293334961, "mean_token_accuracy": 0.9206178188323975, "num_tokens": 109576576.0, "step": 8883 }, { "entropy": 0.9800532460212708, "epoch": 4.678251711427067, "grad_norm": 0.3233085572719574, "learning_rate": 6.714342078968485e-05, "loss": 0.17788507044315338, "mean_token_accuracy": 0.9231614917516708, "num_tokens": 109588912.0, "step": 8884 }, { "entropy": 0.9717035740613937, "epoch": 4.678778304370722, "grad_norm": 0.30318590998649597, "learning_rate": 6.71241395199478e-05, "loss": 0.1675342321395874, "mean_token_accuracy": 0.9272963255643845, "num_tokens": 109601248.0, "step": 8885 }, { "entropy": 0.9713033586740494, "epoch": 4.679304897314376, "grad_norm": 0.30094268918037415, "learning_rate": 6.710486079550067e-05, "loss": 0.15500126779079437, "mean_token_accuracy": 0.9303532838821411, "num_tokens": 109613584.0, "step": 8886 }, { "entropy": 0.9672758132219315, "epoch": 4.679831490258031, "grad_norm": 0.35199296474456787, "learning_rate": 6.708558461748798e-05, "loss": 0.18320858478546143, "mean_token_accuracy": 0.9226799160242081, "num_tokens": 109625920.0, "step": 8887 }, { "entropy": 0.9596314132213593, "epoch": 4.680358083201686, "grad_norm": 0.3195297420024872, "learning_rate": 6.706631098705398e-05, "loss": 0.17051655054092407, "mean_token_accuracy": 0.9298547506332397, "num_tokens": 109638256.0, "step": 8888 }, { "entropy": 0.9257749915122986, "epoch": 4.6808846761453395, "grad_norm": 0.3066015839576721, "learning_rate": 6.704703990534286e-05, "loss": 0.1655864417552948, "mean_token_accuracy": 0.9320216923952103, "num_tokens": 109650592.0, "step": 8889 }, { "entropy": 0.9602459818124771, "epoch": 4.681411269088994, "grad_norm": 0.30135196447372437, "learning_rate": 6.702777137349863e-05, "loss": 0.15446868538856506, "mean_token_accuracy": 0.934455156326294, "num_tokens": 109662928.0, "step": 8890 }, { "entropy": 0.9682223051786423, "epoch": 4.681937862032648, "grad_norm": 0.3189322352409363, "learning_rate": 6.700850539266517e-05, "loss": 0.16403675079345703, "mean_token_accuracy": 0.9304446130990982, "num_tokens": 109675264.0, "step": 8891 }, { "entropy": 0.9647337943315506, "epoch": 4.682464454976303, "grad_norm": 0.36465713381767273, "learning_rate": 6.698924196398611e-05, "loss": 0.1772146224975586, "mean_token_accuracy": 0.9272486418485641, "num_tokens": 109687600.0, "step": 8892 }, { "entropy": 0.9535428136587143, "epoch": 4.682991047919958, "grad_norm": 0.34932729601860046, "learning_rate": 6.696998108860515e-05, "loss": 0.18551796674728394, "mean_token_accuracy": 0.9200732558965683, "num_tokens": 109699936.0, "step": 8893 }, { "entropy": 0.9440125077962875, "epoch": 4.683517640863612, "grad_norm": 0.31598344445228577, "learning_rate": 6.695072276766558e-05, "loss": 0.1678483486175537, "mean_token_accuracy": 0.9258812069892883, "num_tokens": 109712272.0, "step": 8894 }, { "entropy": 0.926901325583458, "epoch": 4.684044233807267, "grad_norm": 0.29600900411605835, "learning_rate": 6.693146700231071e-05, "loss": 0.15550197660923004, "mean_token_accuracy": 0.9305247664451599, "num_tokens": 109724608.0, "step": 8895 }, { "entropy": 0.9396387040615082, "epoch": 4.684570826750922, "grad_norm": 0.2947285771369934, "learning_rate": 6.69122137936836e-05, "loss": 0.1678035855293274, "mean_token_accuracy": 0.9310602843761444, "num_tokens": 109736944.0, "step": 8896 }, { "entropy": 0.9233750700950623, "epoch": 4.685097419694576, "grad_norm": 0.307919442653656, "learning_rate": 6.689296314292723e-05, "loss": 0.17454837262630463, "mean_token_accuracy": 0.9254536330699921, "num_tokens": 109749280.0, "step": 8897 }, { "entropy": 0.9896024316549301, "epoch": 4.685624012638231, "grad_norm": 0.33286166191101074, "learning_rate": 6.687371505118438e-05, "loss": 0.17996010184288025, "mean_token_accuracy": 0.9221208244562149, "num_tokens": 109761616.0, "step": 8898 }, { "entropy": 0.936344787478447, "epoch": 4.686150605581886, "grad_norm": 0.31250613927841187, "learning_rate": 6.685446951959769e-05, "loss": 0.175594300031662, "mean_token_accuracy": 0.9231078326702118, "num_tokens": 109773952.0, "step": 8899 }, { "entropy": 0.9215246587991714, "epoch": 4.6866771985255395, "grad_norm": 0.31440743803977966, "learning_rate": 6.683522654930969e-05, "loss": 0.16845035552978516, "mean_token_accuracy": 0.9260395914316177, "num_tokens": 109786288.0, "step": 8900 }, { "entropy": 0.950299933552742, "epoch": 4.687203791469194, "grad_norm": 0.3220463991165161, "learning_rate": 6.681598614146272e-05, "loss": 0.17246970534324646, "mean_token_accuracy": 0.9272022545337677, "num_tokens": 109798624.0, "step": 8901 }, { "entropy": 0.9349493682384491, "epoch": 4.687730384412848, "grad_norm": 0.30960309505462646, "learning_rate": 6.679674829719895e-05, "loss": 0.16517576575279236, "mean_token_accuracy": 0.926237940788269, "num_tokens": 109810960.0, "step": 8902 }, { "entropy": 0.9120568186044693, "epoch": 4.688256977356503, "grad_norm": 0.32024478912353516, "learning_rate": 6.677751301766043e-05, "loss": 0.17596381902694702, "mean_token_accuracy": 0.9267518371343613, "num_tokens": 109823296.0, "step": 8903 }, { "entropy": 0.9350269734859467, "epoch": 4.688783570300158, "grad_norm": 0.3189983665943146, "learning_rate": 6.675828030398907e-05, "loss": 0.1608733981847763, "mean_token_accuracy": 0.9338311553001404, "num_tokens": 109835632.0, "step": 8904 }, { "entropy": 0.931309312582016, "epoch": 4.689310163243812, "grad_norm": 0.3168869614601135, "learning_rate": 6.673905015732656e-05, "loss": 0.17592725157737732, "mean_token_accuracy": 0.9236612617969513, "num_tokens": 109847968.0, "step": 8905 }, { "entropy": 0.9076910465955734, "epoch": 4.689836756187467, "grad_norm": 0.31664350628852844, "learning_rate": 6.671982257881444e-05, "loss": 0.18773403763771057, "mean_token_accuracy": 0.9247518628835678, "num_tokens": 109860304.0, "step": 8906 }, { "entropy": 0.8888674080371857, "epoch": 4.690363349131122, "grad_norm": 0.28577545285224915, "learning_rate": 6.670059756959424e-05, "loss": 0.15422120690345764, "mean_token_accuracy": 0.9305146485567093, "num_tokens": 109872640.0, "step": 8907 }, { "entropy": 0.9113831967115402, "epoch": 4.690889942074776, "grad_norm": 0.30585935711860657, "learning_rate": 6.668137513080722e-05, "loss": 0.17351096868515015, "mean_token_accuracy": 0.9245708882808685, "num_tokens": 109884976.0, "step": 8908 }, { "entropy": 0.9621010273694992, "epoch": 4.691416535018431, "grad_norm": 0.35061115026474, "learning_rate": 6.666215526359443e-05, "loss": 0.19477160274982452, "mean_token_accuracy": 0.9192596524953842, "num_tokens": 109897312.0, "step": 8909 }, { "entropy": 0.8926963806152344, "epoch": 4.691943127962086, "grad_norm": 0.27797988057136536, "learning_rate": 6.664293796909693e-05, "loss": 0.16123740375041962, "mean_token_accuracy": 0.9285058081150055, "num_tokens": 109909648.0, "step": 8910 }, { "entropy": 0.9432859420776367, "epoch": 4.6924697209057395, "grad_norm": 0.3051757514476776, "learning_rate": 6.662372324845547e-05, "loss": 0.16980287432670593, "mean_token_accuracy": 0.927488312125206, "num_tokens": 109921984.0, "step": 8911 }, { "entropy": 0.8997198194265366, "epoch": 4.692996313849394, "grad_norm": 0.3046535551548004, "learning_rate": 6.660451110281076e-05, "loss": 0.1756792515516281, "mean_token_accuracy": 0.9270216971635818, "num_tokens": 109934320.0, "step": 8912 }, { "entropy": 0.9536482244729996, "epoch": 4.693522906793049, "grad_norm": 0.3259578347206116, "learning_rate": 6.65853015333033e-05, "loss": 0.17409871518611908, "mean_token_accuracy": 0.9254413843154907, "num_tokens": 109946656.0, "step": 8913 }, { "entropy": 0.9118822365999222, "epoch": 4.694049499736703, "grad_norm": 0.28276440501213074, "learning_rate": 6.656609454107344e-05, "loss": 0.15779581665992737, "mean_token_accuracy": 0.9322579503059387, "num_tokens": 109958992.0, "step": 8914 }, { "entropy": 0.9214333295822144, "epoch": 4.694576092680358, "grad_norm": 0.3079218864440918, "learning_rate": 6.65468901272614e-05, "loss": 0.16822515428066254, "mean_token_accuracy": 0.9315666556358337, "num_tokens": 109971328.0, "step": 8915 }, { "entropy": 0.869530126452446, "epoch": 4.695102685624013, "grad_norm": 0.2858998477458954, "learning_rate": 6.652768829300723e-05, "loss": 0.14545699954032898, "mean_token_accuracy": 0.939204603433609, "num_tokens": 109983664.0, "step": 8916 }, { "entropy": 0.8881965726613998, "epoch": 4.695629278567667, "grad_norm": 0.3210907280445099, "learning_rate": 6.650848903945083e-05, "loss": 0.17202621698379517, "mean_token_accuracy": 0.9288241863250732, "num_tokens": 109996000.0, "step": 8917 }, { "entropy": 0.8845930248498917, "epoch": 4.696155871511322, "grad_norm": 0.29390251636505127, "learning_rate": 6.648929236773196e-05, "loss": 0.16244374215602875, "mean_token_accuracy": 0.9327209442853928, "num_tokens": 110008336.0, "step": 8918 }, { "entropy": 0.8755250722169876, "epoch": 4.696682464454977, "grad_norm": 0.315922349691391, "learning_rate": 6.647009827899016e-05, "loss": 0.1748252511024475, "mean_token_accuracy": 0.9285299479961395, "num_tokens": 110020672.0, "step": 8919 }, { "entropy": 0.8949416726827621, "epoch": 4.697209057398631, "grad_norm": 0.3261052668094635, "learning_rate": 6.645090677436496e-05, "loss": 0.18132631480693817, "mean_token_accuracy": 0.9244782775640488, "num_tokens": 110033008.0, "step": 8920 }, { "entropy": 0.9308057427406311, "epoch": 4.697735650342286, "grad_norm": 0.3599795401096344, "learning_rate": 6.643171785499555e-05, "loss": 0.1775147169828415, "mean_token_accuracy": 0.924231082201004, "num_tokens": 110045344.0, "step": 8921 }, { "entropy": 0.8848343342542648, "epoch": 4.69826224328594, "grad_norm": 0.31419074535369873, "learning_rate": 6.641253152202115e-05, "loss": 0.1590585708618164, "mean_token_accuracy": 0.930869922041893, "num_tokens": 110057680.0, "step": 8922 }, { "entropy": 0.8654780089855194, "epoch": 4.698788836229594, "grad_norm": 0.32970088720321655, "learning_rate": 6.639334777658075e-05, "loss": 0.16258922219276428, "mean_token_accuracy": 0.933304637670517, "num_tokens": 110070016.0, "step": 8923 }, { "entropy": 0.8566028475761414, "epoch": 4.699315429173249, "grad_norm": 0.2976810932159424, "learning_rate": 6.637416661981308e-05, "loss": 0.1670779585838318, "mean_token_accuracy": 0.9328662753105164, "num_tokens": 110082352.0, "step": 8924 }, { "entropy": 0.8485848903656006, "epoch": 4.699842022116903, "grad_norm": 0.3209967017173767, "learning_rate": 6.635498805285687e-05, "loss": 0.1709061563014984, "mean_token_accuracy": 0.9276284873485565, "num_tokens": 110094688.0, "step": 8925 }, { "entropy": 0.8869950175285339, "epoch": 4.700368615060558, "grad_norm": 0.31358617544174194, "learning_rate": 6.633581207685065e-05, "loss": 0.16815422475337982, "mean_token_accuracy": 0.9248718768358231, "num_tokens": 110107024.0, "step": 8926 }, { "entropy": 0.8591439723968506, "epoch": 4.700895208004213, "grad_norm": 0.3258786201477051, "learning_rate": 6.631663869293278e-05, "loss": 0.15920323133468628, "mean_token_accuracy": 0.933823436498642, "num_tokens": 110119360.0, "step": 8927 }, { "entropy": 0.894145056605339, "epoch": 4.701421800947867, "grad_norm": 0.33094823360443115, "learning_rate": 6.62974679022414e-05, "loss": 0.17090025544166565, "mean_token_accuracy": 0.9283482134342194, "num_tokens": 110131696.0, "step": 8928 }, { "entropy": 0.9194226413965225, "epoch": 4.701948393891522, "grad_norm": 0.3311615586280823, "learning_rate": 6.627829970591469e-05, "loss": 0.1723853498697281, "mean_token_accuracy": 0.9209810793399811, "num_tokens": 110144032.0, "step": 8929 }, { "entropy": 0.8927403390407562, "epoch": 4.702474986835177, "grad_norm": 0.32033735513687134, "learning_rate": 6.62591341050905e-05, "loss": 0.17580394446849823, "mean_token_accuracy": 0.9258732199668884, "num_tokens": 110156368.0, "step": 8930 }, { "entropy": 0.8567298799753189, "epoch": 4.703001579778831, "grad_norm": 0.32278972864151, "learning_rate": 6.623997110090656e-05, "loss": 0.1617378145456314, "mean_token_accuracy": 0.9279116094112396, "num_tokens": 110168704.0, "step": 8931 }, { "entropy": 0.9135367274284363, "epoch": 4.703528172722486, "grad_norm": 0.3466006815433502, "learning_rate": 6.62208106945005e-05, "loss": 0.17141148447990417, "mean_token_accuracy": 0.9257617443799973, "num_tokens": 110181040.0, "step": 8932 }, { "entropy": 0.9058708250522614, "epoch": 4.7040547656661404, "grad_norm": 0.3600664436817169, "learning_rate": 6.620165288700974e-05, "loss": 0.1806974560022354, "mean_token_accuracy": 0.9254732429981232, "num_tokens": 110193376.0, "step": 8933 }, { "entropy": 0.8960120677947998, "epoch": 4.704581358609794, "grad_norm": 0.31437167525291443, "learning_rate": 6.618249767957158e-05, "loss": 0.16793763637542725, "mean_token_accuracy": 0.9310059249401093, "num_tokens": 110205712.0, "step": 8934 }, { "entropy": 0.9051641076803207, "epoch": 4.705107951553449, "grad_norm": 0.2790035605430603, "learning_rate": 6.616334507332312e-05, "loss": 0.14643120765686035, "mean_token_accuracy": 0.9365227818489075, "num_tokens": 110218048.0, "step": 8935 }, { "entropy": 0.8888637870550156, "epoch": 4.705634544497103, "grad_norm": 0.29089266061782837, "learning_rate": 6.614419506940137e-05, "loss": 0.1581224799156189, "mean_token_accuracy": 0.9336483627557755, "num_tokens": 110230384.0, "step": 8936 }, { "entropy": 0.8958435654640198, "epoch": 4.706161137440758, "grad_norm": 0.3086511790752411, "learning_rate": 6.612504766894316e-05, "loss": 0.15827912092208862, "mean_token_accuracy": 0.9326409995555878, "num_tokens": 110242720.0, "step": 8937 }, { "entropy": 0.9101904034614563, "epoch": 4.706687730384413, "grad_norm": 0.3037155568599701, "learning_rate": 6.610590287308514e-05, "loss": 0.1719973385334015, "mean_token_accuracy": 0.9325263053178787, "num_tokens": 110255056.0, "step": 8938 }, { "entropy": 0.8873958140611649, "epoch": 4.707214323328067, "grad_norm": 0.32435721158981323, "learning_rate": 6.608676068296382e-05, "loss": 0.17124015092849731, "mean_token_accuracy": 0.9277086555957794, "num_tokens": 110267392.0, "step": 8939 }, { "entropy": 0.9239481985569, "epoch": 4.707740916271722, "grad_norm": 0.33015745878219604, "learning_rate": 6.606762109971561e-05, "loss": 0.1701054871082306, "mean_token_accuracy": 0.9306849241256714, "num_tokens": 110279728.0, "step": 8940 }, { "entropy": 0.9267433881759644, "epoch": 4.708267509215377, "grad_norm": 0.34128713607788086, "learning_rate": 6.604848412447663e-05, "loss": 0.18052354454994202, "mean_token_accuracy": 0.9229462891817093, "num_tokens": 110292064.0, "step": 8941 }, { "entropy": 0.914429098367691, "epoch": 4.708794102159031, "grad_norm": 0.35832804441452026, "learning_rate": 6.602934975838301e-05, "loss": 0.18640364706516266, "mean_token_accuracy": 0.9196774363517761, "num_tokens": 110304400.0, "step": 8942 }, { "entropy": 0.9277569949626923, "epoch": 4.709320695102686, "grad_norm": 0.33268260955810547, "learning_rate": 6.601021800257061e-05, "loss": 0.1887909471988678, "mean_token_accuracy": 0.9203357994556427, "num_tokens": 110316736.0, "step": 8943 }, { "entropy": 0.9191337078809738, "epoch": 4.7098472880463405, "grad_norm": 0.31906694173812866, "learning_rate": 6.599108885817517e-05, "loss": 0.18403413891792297, "mean_token_accuracy": 0.9191030859947205, "num_tokens": 110329072.0, "step": 8944 }, { "entropy": 0.9383554905653, "epoch": 4.710373880989994, "grad_norm": 0.34196263551712036, "learning_rate": 6.597196232633229e-05, "loss": 0.17426656186580658, "mean_token_accuracy": 0.9295345395803452, "num_tokens": 110341408.0, "step": 8945 }, { "entropy": 0.9343491792678833, "epoch": 4.710900473933649, "grad_norm": 0.31792646646499634, "learning_rate": 6.595283840817739e-05, "loss": 0.16848713159561157, "mean_token_accuracy": 0.9252421706914902, "num_tokens": 110353744.0, "step": 8946 }, { "entropy": 0.9486443549394608, "epoch": 4.711427066877304, "grad_norm": 0.32646486163139343, "learning_rate": 6.593371710484574e-05, "loss": 0.1752864569425583, "mean_token_accuracy": 0.9279747307300568, "num_tokens": 110366080.0, "step": 8947 }, { "entropy": 0.9161777049303055, "epoch": 4.711953659820958, "grad_norm": 0.3029508590698242, "learning_rate": 6.591459841747247e-05, "loss": 0.15937493741512299, "mean_token_accuracy": 0.9336031377315521, "num_tokens": 110378416.0, "step": 8948 }, { "entropy": 0.9352288544178009, "epoch": 4.712480252764613, "grad_norm": 0.34143126010894775, "learning_rate": 6.58954823471925e-05, "loss": 0.174641415476799, "mean_token_accuracy": 0.9258183240890503, "num_tokens": 110390752.0, "step": 8949 }, { "entropy": 0.9488516598939896, "epoch": 4.713006845708268, "grad_norm": 0.32799118757247925, "learning_rate": 6.587636889514073e-05, "loss": 0.1729208379983902, "mean_token_accuracy": 0.9303274303674698, "num_tokens": 110403088.0, "step": 8950 }, { "entropy": 0.9332128018140793, "epoch": 4.713533438651922, "grad_norm": 0.30908095836639404, "learning_rate": 6.585725806245178e-05, "loss": 0.1610102653503418, "mean_token_accuracy": 0.9325119704008102, "num_tokens": 110415424.0, "step": 8951 }, { "entropy": 0.9808033108711243, "epoch": 4.714060031595577, "grad_norm": 0.3266369104385376, "learning_rate": 6.58381498502601e-05, "loss": 0.1728314310312271, "mean_token_accuracy": 0.9239996820688248, "num_tokens": 110427760.0, "step": 8952 }, { "entropy": 0.9401232153177261, "epoch": 4.714586624539232, "grad_norm": 0.34261366724967957, "learning_rate": 6.581904425970011e-05, "loss": 0.187231183052063, "mean_token_accuracy": 0.9219857454299927, "num_tokens": 110440096.0, "step": 8953 }, { "entropy": 0.9308113306760788, "epoch": 4.715113217482886, "grad_norm": 0.3259502947330475, "learning_rate": 6.579994129190594e-05, "loss": 0.17536687850952148, "mean_token_accuracy": 0.9281197637319565, "num_tokens": 110452432.0, "step": 8954 }, { "entropy": 0.9176206141710281, "epoch": 4.7156398104265405, "grad_norm": 0.3092325031757355, "learning_rate": 6.578084094801165e-05, "loss": 0.16749367117881775, "mean_token_accuracy": 0.9292961359024048, "num_tokens": 110464768.0, "step": 8955 }, { "entropy": 0.932731881737709, "epoch": 4.716166403370195, "grad_norm": 0.32101449370384216, "learning_rate": 6.576174322915104e-05, "loss": 0.1671086847782135, "mean_token_accuracy": 0.9271100908517838, "num_tokens": 110477104.0, "step": 8956 }, { "entropy": 0.9705034643411636, "epoch": 4.716692996313849, "grad_norm": 0.34419867396354675, "learning_rate": 6.574264813645794e-05, "loss": 0.18329662084579468, "mean_token_accuracy": 0.9214195013046265, "num_tokens": 110489440.0, "step": 8957 }, { "entropy": 0.9514918476343155, "epoch": 4.717219589257504, "grad_norm": 0.31465935707092285, "learning_rate": 6.572355567106588e-05, "loss": 0.1708117127418518, "mean_token_accuracy": 0.9297067523002625, "num_tokens": 110501776.0, "step": 8958 }, { "entropy": 0.9665895402431488, "epoch": 4.717746182201158, "grad_norm": 0.32876408100128174, "learning_rate": 6.570446583410823e-05, "loss": 0.17325656116008759, "mean_token_accuracy": 0.9287900924682617, "num_tokens": 110514112.0, "step": 8959 }, { "entropy": 0.9653350561857224, "epoch": 4.718272775144813, "grad_norm": 0.2947167754173279, "learning_rate": 6.568537862671828e-05, "loss": 0.14871157705783844, "mean_token_accuracy": 0.9373853355646133, "num_tokens": 110526448.0, "step": 8960 }, { "entropy": 0.9705002754926682, "epoch": 4.718799368088468, "grad_norm": 0.33642247319221497, "learning_rate": 6.566629405002914e-05, "loss": 0.17432236671447754, "mean_token_accuracy": 0.9288565516471863, "num_tokens": 110538784.0, "step": 8961 }, { "entropy": 0.9390337914228439, "epoch": 4.719325961032122, "grad_norm": 0.27955207228660583, "learning_rate": 6.564721210517369e-05, "loss": 0.16462326049804688, "mean_token_accuracy": 0.927482396364212, "num_tokens": 110551120.0, "step": 8962 }, { "entropy": 0.9465681612491608, "epoch": 4.719852553975777, "grad_norm": 0.33623427152633667, "learning_rate": 6.562813279328477e-05, "loss": 0.173857644200325, "mean_token_accuracy": 0.9263188689947128, "num_tokens": 110563456.0, "step": 8963 }, { "entropy": 0.9599556177854538, "epoch": 4.720379146919432, "grad_norm": 0.335986852645874, "learning_rate": 6.5609056115495e-05, "loss": 0.1687793731689453, "mean_token_accuracy": 0.9257626086473465, "num_tokens": 110575792.0, "step": 8964 }, { "entropy": 0.9443381130695343, "epoch": 4.720905739863086, "grad_norm": 0.3181096613407135, "learning_rate": 6.55899820729368e-05, "loss": 0.18053269386291504, "mean_token_accuracy": 0.9224587678909302, "num_tokens": 110588128.0, "step": 8965 }, { "entropy": 0.9383203834295273, "epoch": 4.7214323328067405, "grad_norm": 0.33349719643592834, "learning_rate": 6.557091066674255e-05, "loss": 0.18003800511360168, "mean_token_accuracy": 0.922263890504837, "num_tokens": 110600464.0, "step": 8966 }, { "entropy": 0.932285413146019, "epoch": 4.721958925750395, "grad_norm": 0.32349494099617004, "learning_rate": 6.555184189804437e-05, "loss": 0.15404555201530457, "mean_token_accuracy": 0.9335178434848785, "num_tokens": 110612800.0, "step": 8967 }, { "entropy": 0.9489399194717407, "epoch": 4.722485518694049, "grad_norm": 0.32240861654281616, "learning_rate": 6.553277576797427e-05, "loss": 0.1671348512172699, "mean_token_accuracy": 0.9278327971696854, "num_tokens": 110625136.0, "step": 8968 }, { "entropy": 0.9735501110553741, "epoch": 4.723012111637704, "grad_norm": 0.3254861831665039, "learning_rate": 6.551371227766412e-05, "loss": 0.16706396639347076, "mean_token_accuracy": 0.929393544793129, "num_tokens": 110637472.0, "step": 8969 }, { "entropy": 0.934670940041542, "epoch": 4.723538704581358, "grad_norm": 0.314018577337265, "learning_rate": 6.549465142824554e-05, "loss": 0.16582143306732178, "mean_token_accuracy": 0.9346720725297928, "num_tokens": 110649808.0, "step": 8970 }, { "entropy": 0.9515503495931625, "epoch": 4.724065297525013, "grad_norm": 0.35136815905570984, "learning_rate": 6.547559322085013e-05, "loss": 0.1879626214504242, "mean_token_accuracy": 0.9235444515943527, "num_tokens": 110662144.0, "step": 8971 }, { "entropy": 0.9929835647344589, "epoch": 4.724591890468668, "grad_norm": 0.3528837263584137, "learning_rate": 6.545653765660929e-05, "loss": 0.17926721274852753, "mean_token_accuracy": 0.9293420314788818, "num_tokens": 110674480.0, "step": 8972 }, { "entropy": 0.9760604649782181, "epoch": 4.725118483412322, "grad_norm": 0.32862380146980286, "learning_rate": 6.543748473665417e-05, "loss": 0.16842186450958252, "mean_token_accuracy": 0.9320703595876694, "num_tokens": 110686816.0, "step": 8973 }, { "entropy": 0.9648343026638031, "epoch": 4.725645076355977, "grad_norm": 0.33077824115753174, "learning_rate": 6.541843446211584e-05, "loss": 0.17277027666568756, "mean_token_accuracy": 0.9269263595342636, "num_tokens": 110699152.0, "step": 8974 }, { "entropy": 0.9570888429880142, "epoch": 4.726171669299632, "grad_norm": 0.30975818634033203, "learning_rate": 6.539938683412519e-05, "loss": 0.17477139830589294, "mean_token_accuracy": 0.9248654693365097, "num_tokens": 110711488.0, "step": 8975 }, { "entropy": 0.972335085272789, "epoch": 4.726698262243286, "grad_norm": 0.3457125425338745, "learning_rate": 6.538034185381301e-05, "loss": 0.17971360683441162, "mean_token_accuracy": 0.9200064539909363, "num_tokens": 110723824.0, "step": 8976 }, { "entropy": 0.943258211016655, "epoch": 4.7272248551869405, "grad_norm": 0.3156683146953583, "learning_rate": 6.536129952230985e-05, "loss": 0.1600583791732788, "mean_token_accuracy": 0.9336526691913605, "num_tokens": 110736160.0, "step": 8977 }, { "entropy": 0.9720461964607239, "epoch": 4.727751448130595, "grad_norm": 0.35263144969940186, "learning_rate": 6.534225984074618e-05, "loss": 0.18373900651931763, "mean_token_accuracy": 0.9243020862340927, "num_tokens": 110748496.0, "step": 8978 }, { "entropy": 0.955377921462059, "epoch": 4.728278041074249, "grad_norm": 0.29776355624198914, "learning_rate": 6.532322281025226e-05, "loss": 0.16605469584465027, "mean_token_accuracy": 0.9235288351774216, "num_tokens": 110760832.0, "step": 8979 }, { "entropy": 0.9818824827671051, "epoch": 4.728804634017904, "grad_norm": 0.3629790246486664, "learning_rate": 6.530418843195821e-05, "loss": 0.1792069971561432, "mean_token_accuracy": 0.9269376397132874, "num_tokens": 110773168.0, "step": 8980 }, { "entropy": 0.940108060836792, "epoch": 4.729331226961559, "grad_norm": 0.29533788561820984, "learning_rate": 6.5285156706994e-05, "loss": 0.1598343700170517, "mean_token_accuracy": 0.9303691387176514, "num_tokens": 110785504.0, "step": 8981 }, { "entropy": 0.9668853133916855, "epoch": 4.729857819905213, "grad_norm": 0.3225063383579254, "learning_rate": 6.526612763648939e-05, "loss": 0.17831671237945557, "mean_token_accuracy": 0.9203702360391617, "num_tokens": 110797840.0, "step": 8982 }, { "entropy": 0.976748988032341, "epoch": 4.730384412848868, "grad_norm": 0.36254167556762695, "learning_rate": 6.524710122157411e-05, "loss": 0.181860089302063, "mean_token_accuracy": 0.9245222508907318, "num_tokens": 110810176.0, "step": 8983 }, { "entropy": 0.9795864969491959, "epoch": 4.730911005792523, "grad_norm": 0.3496047258377075, "learning_rate": 6.522807746337752e-05, "loss": 0.17530706524848938, "mean_token_accuracy": 0.9220332503318787, "num_tokens": 110822512.0, "step": 8984 }, { "entropy": 0.9837092906236649, "epoch": 4.731437598736177, "grad_norm": 0.28007742762565613, "learning_rate": 6.520905636302904e-05, "loss": 0.15277674794197083, "mean_token_accuracy": 0.9338098019361496, "num_tokens": 110834848.0, "step": 8985 }, { "entropy": 1.0120174884796143, "epoch": 4.731964191679832, "grad_norm": 0.3262519836425781, "learning_rate": 6.519003792165783e-05, "loss": 0.16972126066684723, "mean_token_accuracy": 0.9269426912069321, "num_tokens": 110847184.0, "step": 8986 }, { "entropy": 0.9969107508659363, "epoch": 4.7324907846234865, "grad_norm": 0.3321049213409424, "learning_rate": 6.51710221403929e-05, "loss": 0.16228239238262177, "mean_token_accuracy": 0.9264969974756241, "num_tokens": 110859520.0, "step": 8987 }, { "entropy": 0.928468719124794, "epoch": 4.7330173775671405, "grad_norm": 0.32601937651634216, "learning_rate": 6.515200902036309e-05, "loss": 0.16544225811958313, "mean_token_accuracy": 0.9298947602510452, "num_tokens": 110871856.0, "step": 8988 }, { "entropy": 0.9660092294216156, "epoch": 4.733543970510795, "grad_norm": 0.4767933785915375, "learning_rate": 6.513299856269713e-05, "loss": 0.16338896751403809, "mean_token_accuracy": 0.9304181486368179, "num_tokens": 110884192.0, "step": 8989 }, { "entropy": 0.9938349425792694, "epoch": 4.73407056345445, "grad_norm": 0.33547815680503845, "learning_rate": 6.511399076852354e-05, "loss": 0.17066051065921783, "mean_token_accuracy": 0.9304036498069763, "num_tokens": 110896528.0, "step": 8990 }, { "entropy": 0.9267756044864655, "epoch": 4.734597156398104, "grad_norm": 0.2973441481590271, "learning_rate": 6.509498563897068e-05, "loss": 0.1597248911857605, "mean_token_accuracy": 0.9334191530942917, "num_tokens": 110908864.0, "step": 8991 }, { "entropy": 0.9660896360874176, "epoch": 4.735123749341759, "grad_norm": 0.30963265895843506, "learning_rate": 6.50759831751668e-05, "loss": 0.173097163438797, "mean_token_accuracy": 0.9288729876279831, "num_tokens": 110921200.0, "step": 8992 }, { "entropy": 0.9519427716732025, "epoch": 4.735650342285413, "grad_norm": 0.3269384503364563, "learning_rate": 6.505698337823997e-05, "loss": 0.17985959351062775, "mean_token_accuracy": 0.9229910671710968, "num_tokens": 110933536.0, "step": 8993 }, { "entropy": 0.9285813122987747, "epoch": 4.736176935229068, "grad_norm": 0.2939811646938324, "learning_rate": 6.503798624931809e-05, "loss": 0.16949841380119324, "mean_token_accuracy": 0.92819844186306, "num_tokens": 110945872.0, "step": 8994 }, { "entropy": 0.9772068858146667, "epoch": 4.736703528172723, "grad_norm": 0.31877076625823975, "learning_rate": 6.501899178952891e-05, "loss": 0.167781800031662, "mean_token_accuracy": 0.9289694726467133, "num_tokens": 110958208.0, "step": 8995 }, { "entropy": 0.9644787162542343, "epoch": 4.737230121116377, "grad_norm": 0.35433515906333923, "learning_rate": 6.500000000000002e-05, "loss": 0.170842707157135, "mean_token_accuracy": 0.9287001937627792, "num_tokens": 110970544.0, "step": 8996 }, { "entropy": 0.9160168617963791, "epoch": 4.737756714060032, "grad_norm": 0.3172443211078644, "learning_rate": 6.498101088185886e-05, "loss": 0.16134260594844818, "mean_token_accuracy": 0.9317062944173813, "num_tokens": 110982880.0, "step": 8997 }, { "entropy": 0.961934044957161, "epoch": 4.7382833070036865, "grad_norm": 0.3247859477996826, "learning_rate": 6.496202443623262e-05, "loss": 0.17156106233596802, "mean_token_accuracy": 0.9250394701957703, "num_tokens": 110995216.0, "step": 8998 }, { "entropy": 0.9096788316965103, "epoch": 4.7388098999473405, "grad_norm": 0.30898916721343994, "learning_rate": 6.494304066424857e-05, "loss": 0.1646384447813034, "mean_token_accuracy": 0.9309989959001541, "num_tokens": 111007552.0, "step": 8999 }, { "entropy": 0.947771430015564, "epoch": 4.739336492890995, "grad_norm": 0.3102348744869232, "learning_rate": 6.492405956703356e-05, "loss": 0.15817317366600037, "mean_token_accuracy": 0.9337723106145859, "num_tokens": 111019888.0, "step": 9000 }, { "entropy": 0.9348080158233643, "epoch": 4.739863085834649, "grad_norm": 0.32881397008895874, "learning_rate": 6.490508114571445e-05, "loss": 0.16392850875854492, "mean_token_accuracy": 0.9309188723564148, "num_tokens": 111032224.0, "step": 9001 }, { "entropy": 0.9109790027141571, "epoch": 4.740389678778304, "grad_norm": 0.35365355014801025, "learning_rate": 6.488610540141779e-05, "loss": 0.1841769814491272, "mean_token_accuracy": 0.9249490648508072, "num_tokens": 111044560.0, "step": 9002 }, { "entropy": 0.8916398137807846, "epoch": 4.740916271721959, "grad_norm": 0.29434317350387573, "learning_rate": 6.486713233527013e-05, "loss": 0.1550382375717163, "mean_token_accuracy": 0.9333101511001587, "num_tokens": 111056896.0, "step": 9003 }, { "entropy": 0.97572922706604, "epoch": 4.741442864665613, "grad_norm": 0.36800870299339294, "learning_rate": 6.484816194839775e-05, "loss": 0.1771194338798523, "mean_token_accuracy": 0.9240408539772034, "num_tokens": 111069232.0, "step": 9004 }, { "entropy": 0.9397173225879669, "epoch": 4.741969457609268, "grad_norm": 0.36061525344848633, "learning_rate": 6.482919424192681e-05, "loss": 0.16837380826473236, "mean_token_accuracy": 0.9230096936225891, "num_tokens": 111081568.0, "step": 9005 }, { "entropy": 0.9172497689723969, "epoch": 4.742496050552923, "grad_norm": 0.3479461967945099, "learning_rate": 6.481022921698336e-05, "loss": 0.18055102229118347, "mean_token_accuracy": 0.9213292896747589, "num_tokens": 111093904.0, "step": 9006 }, { "entropy": 0.9395283907651901, "epoch": 4.743022643496577, "grad_norm": 0.33629798889160156, "learning_rate": 6.479126687469321e-05, "loss": 0.16937856376171112, "mean_token_accuracy": 0.9283296167850494, "num_tokens": 111106240.0, "step": 9007 }, { "entropy": 0.9321241974830627, "epoch": 4.743549236440232, "grad_norm": 0.31431910395622253, "learning_rate": 6.477230721618206e-05, "loss": 0.17476430535316467, "mean_token_accuracy": 0.9284104853868484, "num_tokens": 111118576.0, "step": 9008 }, { "entropy": 0.9074824899435043, "epoch": 4.7440758293838865, "grad_norm": 0.3159473240375519, "learning_rate": 6.475335024257543e-05, "loss": 0.17281442880630493, "mean_token_accuracy": 0.932155430316925, "num_tokens": 111130912.0, "step": 9009 }, { "entropy": 0.9505660831928253, "epoch": 4.7446024223275405, "grad_norm": 0.3291624188423157, "learning_rate": 6.473439595499867e-05, "loss": 0.1661178171634674, "mean_token_accuracy": 0.9278183430433273, "num_tokens": 111143248.0, "step": 9010 }, { "entropy": 0.899037092924118, "epoch": 4.745129015271195, "grad_norm": 0.31241390109062195, "learning_rate": 6.4715444354577e-05, "loss": 0.16685061156749725, "mean_token_accuracy": 0.9238582998514175, "num_tokens": 111155584.0, "step": 9011 }, { "entropy": 0.955901101231575, "epoch": 4.74565560821485, "grad_norm": 0.3158174157142639, "learning_rate": 6.469649544243543e-05, "loss": 0.16738471388816833, "mean_token_accuracy": 0.9265148341655731, "num_tokens": 111167920.0, "step": 9012 }, { "entropy": 0.9404389709234238, "epoch": 4.746182201158504, "grad_norm": 0.3212829530239105, "learning_rate": 6.467754921969891e-05, "loss": 0.17458640038967133, "mean_token_accuracy": 0.9287828207015991, "num_tokens": 111180256.0, "step": 9013 }, { "entropy": 0.9119441509246826, "epoch": 4.746708794102159, "grad_norm": 0.3021114766597748, "learning_rate": 6.465860568749212e-05, "loss": 0.16936270892620087, "mean_token_accuracy": 0.9257699996232986, "num_tokens": 111192592.0, "step": 9014 }, { "entropy": 0.9254357069730759, "epoch": 4.747235387045814, "grad_norm": 0.30540579557418823, "learning_rate": 6.463966484693966e-05, "loss": 0.16780777275562286, "mean_token_accuracy": 0.931959256529808, "num_tokens": 111204928.0, "step": 9015 }, { "entropy": 0.9446334689855576, "epoch": 4.747761979989468, "grad_norm": 0.325285941362381, "learning_rate": 6.46207266991659e-05, "loss": 0.17704302072525024, "mean_token_accuracy": 0.9249174743890762, "num_tokens": 111217264.0, "step": 9016 }, { "entropy": 0.9317489713430405, "epoch": 4.748288572933123, "grad_norm": 0.29853665828704834, "learning_rate": 6.46017912452951e-05, "loss": 0.16018593311309814, "mean_token_accuracy": 0.92707958817482, "num_tokens": 111229600.0, "step": 9017 }, { "entropy": 0.9343649744987488, "epoch": 4.748815165876778, "grad_norm": 0.31143051385879517, "learning_rate": 6.458285848645136e-05, "loss": 0.16280323266983032, "mean_token_accuracy": 0.9271020591259003, "num_tokens": 111241936.0, "step": 9018 }, { "entropy": 0.9551049172878265, "epoch": 4.749341758820432, "grad_norm": 0.28899648785591125, "learning_rate": 6.456392842375858e-05, "loss": 0.1555640995502472, "mean_token_accuracy": 0.9314574897289276, "num_tokens": 111254272.0, "step": 9019 }, { "entropy": 0.9203036278486252, "epoch": 4.7498683517640865, "grad_norm": 0.31474632024765015, "learning_rate": 6.454500105834058e-05, "loss": 0.16402553021907806, "mean_token_accuracy": 0.9308990687131882, "num_tokens": 111266608.0, "step": 9020 }, { "entropy": 0.9286926239728928, "epoch": 4.750394944707741, "grad_norm": 0.33371585607528687, "learning_rate": 6.452607639132093e-05, "loss": 0.18327629566192627, "mean_token_accuracy": 0.921772688627243, "num_tokens": 111278944.0, "step": 9021 }, { "entropy": 0.946032926440239, "epoch": 4.750921537651395, "grad_norm": 0.3166511654853821, "learning_rate": 6.450715442382308e-05, "loss": 0.1802721470594406, "mean_token_accuracy": 0.9210911840200424, "num_tokens": 111291280.0, "step": 9022 }, { "entropy": 0.9355271309614182, "epoch": 4.75144813059505, "grad_norm": 0.3164330720901489, "learning_rate": 6.448823515697031e-05, "loss": 0.17939233779907227, "mean_token_accuracy": 0.9239465445280075, "num_tokens": 111303616.0, "step": 9023 }, { "entropy": 0.9391446709632874, "epoch": 4.751974723538704, "grad_norm": 0.34126725792884827, "learning_rate": 6.446931859188576e-05, "loss": 0.17269359529018402, "mean_token_accuracy": 0.9273637980222702, "num_tokens": 111315952.0, "step": 9024 }, { "entropy": 0.9569701850414276, "epoch": 4.752501316482359, "grad_norm": 0.34143349528312683, "learning_rate": 6.445040472969241e-05, "loss": 0.17444859445095062, "mean_token_accuracy": 0.9257920831441879, "num_tokens": 111328288.0, "step": 9025 }, { "entropy": 0.9466724842786789, "epoch": 4.753027909426014, "grad_norm": 0.3243260681629181, "learning_rate": 6.443149357151299e-05, "loss": 0.18756012618541718, "mean_token_accuracy": 0.9216291159391403, "num_tokens": 111340624.0, "step": 9026 }, { "entropy": 0.9434637129306793, "epoch": 4.753554502369668, "grad_norm": 0.3246390223503113, "learning_rate": 6.441258511847024e-05, "loss": 0.17142389714717865, "mean_token_accuracy": 0.9252357184886932, "num_tokens": 111352960.0, "step": 9027 }, { "entropy": 0.9123575240373611, "epoch": 4.754081095313323, "grad_norm": 0.2930547297000885, "learning_rate": 6.439367937168662e-05, "loss": 0.15911197662353516, "mean_token_accuracy": 0.933475911617279, "num_tokens": 111365296.0, "step": 9028 }, { "entropy": 0.928584486246109, "epoch": 4.754607688256978, "grad_norm": 0.27964845299720764, "learning_rate": 6.437477633228443e-05, "loss": 0.15053358674049377, "mean_token_accuracy": 0.9340831637382507, "num_tokens": 111377632.0, "step": 9029 }, { "entropy": 0.9594197422266006, "epoch": 4.755134281200632, "grad_norm": 0.3099207282066345, "learning_rate": 6.435587600138587e-05, "loss": 0.1709914356470108, "mean_token_accuracy": 0.9311748147010803, "num_tokens": 111389968.0, "step": 9030 }, { "entropy": 0.9574659168720245, "epoch": 4.7556608741442865, "grad_norm": 0.3323180377483368, "learning_rate": 6.433697838011292e-05, "loss": 0.17146876454353333, "mean_token_accuracy": 0.9289543330669403, "num_tokens": 111402304.0, "step": 9031 }, { "entropy": 0.9474862664937973, "epoch": 4.756187467087941, "grad_norm": 0.30546411871910095, "learning_rate": 6.43180834695874e-05, "loss": 0.15925800800323486, "mean_token_accuracy": 0.9380460530519485, "num_tokens": 111414640.0, "step": 9032 }, { "entropy": 0.9810915142297745, "epoch": 4.756714060031595, "grad_norm": 0.3353631794452667, "learning_rate": 6.429919127093098e-05, "loss": 0.17721283435821533, "mean_token_accuracy": 0.9227162003517151, "num_tokens": 111426976.0, "step": 9033 }, { "entropy": 1.0023733377456665, "epoch": 4.75724065297525, "grad_norm": 0.3292175531387329, "learning_rate": 6.428030178526522e-05, "loss": 0.17148852348327637, "mean_token_accuracy": 0.9293312579393387, "num_tokens": 111439312.0, "step": 9034 }, { "entropy": 0.9760813117027283, "epoch": 4.757767245918904, "grad_norm": 0.32482001185417175, "learning_rate": 6.426141501371151e-05, "loss": 0.17811252176761627, "mean_token_accuracy": 0.9272367805242538, "num_tokens": 111451648.0, "step": 9035 }, { "entropy": 0.901419147849083, "epoch": 4.758293838862559, "grad_norm": 0.3026784062385559, "learning_rate": 6.424253095739097e-05, "loss": 0.1650366485118866, "mean_token_accuracy": 0.9297737032175064, "num_tokens": 111463984.0, "step": 9036 }, { "entropy": 0.9676057994365692, "epoch": 4.758820431806214, "grad_norm": 0.32503530383110046, "learning_rate": 6.422364961742468e-05, "loss": 0.16921848058700562, "mean_token_accuracy": 0.928037241101265, "num_tokens": 111476320.0, "step": 9037 }, { "entropy": 0.9711627960205078, "epoch": 4.759347024749868, "grad_norm": 0.3061572015285492, "learning_rate": 6.420477099493352e-05, "loss": 0.1675848662853241, "mean_token_accuracy": 0.9253803789615631, "num_tokens": 111488656.0, "step": 9038 }, { "entropy": 0.9869196563959122, "epoch": 4.759873617693523, "grad_norm": 0.3351416289806366, "learning_rate": 6.418589509103818e-05, "loss": 0.18046732246875763, "mean_token_accuracy": 0.922397568821907, "num_tokens": 111500992.0, "step": 9039 }, { "entropy": 0.9444341063499451, "epoch": 4.760400210637178, "grad_norm": 0.33065369725227356, "learning_rate": 6.416702190685922e-05, "loss": 0.18055486679077148, "mean_token_accuracy": 0.9234813004732132, "num_tokens": 111513328.0, "step": 9040 }, { "entropy": 0.9259567856788635, "epoch": 4.760926803580832, "grad_norm": 0.3338969647884369, "learning_rate": 6.414815144351705e-05, "loss": 0.18156734108924866, "mean_token_accuracy": 0.9217091202735901, "num_tokens": 111525664.0, "step": 9041 }, { "entropy": 0.9558723270893097, "epoch": 4.7614533965244865, "grad_norm": 0.35250309109687805, "learning_rate": 6.412928370213186e-05, "loss": 0.17602044343948364, "mean_token_accuracy": 0.9272420257329941, "num_tokens": 111538000.0, "step": 9042 }, { "entropy": 0.9206525087356567, "epoch": 4.761979989468141, "grad_norm": 0.31426510214805603, "learning_rate": 6.411041868382376e-05, "loss": 0.1601458340883255, "mean_token_accuracy": 0.9292854964733124, "num_tokens": 111550336.0, "step": 9043 }, { "entropy": 0.970268115401268, "epoch": 4.762506582411795, "grad_norm": 0.32940199971199036, "learning_rate": 6.409155638971264e-05, "loss": 0.15830670297145844, "mean_token_accuracy": 0.931570902466774, "num_tokens": 111562672.0, "step": 9044 }, { "entropy": 0.9746520668268204, "epoch": 4.76303317535545, "grad_norm": 0.3464902937412262, "learning_rate": 6.407269682091823e-05, "loss": 0.1703244149684906, "mean_token_accuracy": 0.9258856028318405, "num_tokens": 111575008.0, "step": 9045 }, { "entropy": 0.9502895623445511, "epoch": 4.763559768299105, "grad_norm": 0.30303528904914856, "learning_rate": 6.405383997856014e-05, "loss": 0.16198208928108215, "mean_token_accuracy": 0.9311043471097946, "num_tokens": 111587344.0, "step": 9046 }, { "entropy": 0.9064134359359741, "epoch": 4.764086361242759, "grad_norm": 0.30101168155670166, "learning_rate": 6.403498586375774e-05, "loss": 0.16409745812416077, "mean_token_accuracy": 0.9261920154094696, "num_tokens": 111599680.0, "step": 9047 }, { "entropy": 0.9261251986026764, "epoch": 4.764612954186414, "grad_norm": 0.28687286376953125, "learning_rate": 6.401613447763036e-05, "loss": 0.16393136978149414, "mean_token_accuracy": 0.929685965180397, "num_tokens": 111612016.0, "step": 9048 }, { "entropy": 0.9612890779972076, "epoch": 4.765139547130069, "grad_norm": 0.3660378158092499, "learning_rate": 6.399728582129704e-05, "loss": 0.18570277094841003, "mean_token_accuracy": 0.9182675331830978, "num_tokens": 111624352.0, "step": 9049 }, { "entropy": 0.9497331380844116, "epoch": 4.765666140073723, "grad_norm": 0.3135928511619568, "learning_rate": 6.397843989587677e-05, "loss": 0.16727733612060547, "mean_token_accuracy": 0.9272850453853607, "num_tokens": 111636688.0, "step": 9050 }, { "entropy": 0.9651635140180588, "epoch": 4.766192733017378, "grad_norm": 0.2958713173866272, "learning_rate": 6.395959670248827e-05, "loss": 0.15490230917930603, "mean_token_accuracy": 0.9338932633399963, "num_tokens": 111649024.0, "step": 9051 }, { "entropy": 0.9416981935501099, "epoch": 4.7667193259610325, "grad_norm": 0.33557194471359253, "learning_rate": 6.394075624225019e-05, "loss": 0.1833014041185379, "mean_token_accuracy": 0.923352062702179, "num_tokens": 111661360.0, "step": 9052 }, { "entropy": 0.924249678850174, "epoch": 4.7672459189046865, "grad_norm": 0.32141128182411194, "learning_rate": 6.392191851628094e-05, "loss": 0.17952987551689148, "mean_token_accuracy": 0.9223910272121429, "num_tokens": 111673696.0, "step": 9053 }, { "entropy": 0.9650433510541916, "epoch": 4.767772511848341, "grad_norm": 0.34635400772094727, "learning_rate": 6.390308352569878e-05, "loss": 0.1668970137834549, "mean_token_accuracy": 0.9306865334510803, "num_tokens": 111686032.0, "step": 9054 }, { "entropy": 0.9683272689580917, "epoch": 4.768299104791996, "grad_norm": 0.32868492603302, "learning_rate": 6.388425127162192e-05, "loss": 0.17090605199337006, "mean_token_accuracy": 0.9256576895713806, "num_tokens": 111698368.0, "step": 9055 }, { "entropy": 0.9745743274688721, "epoch": 4.76882569773565, "grad_norm": 0.34252041578292847, "learning_rate": 6.386542175516828e-05, "loss": 0.183536559343338, "mean_token_accuracy": 0.9262122213840485, "num_tokens": 111710704.0, "step": 9056 }, { "entropy": 0.95796699821949, "epoch": 4.769352290679305, "grad_norm": 0.3901304304599762, "learning_rate": 6.384659497745566e-05, "loss": 0.1622026264667511, "mean_token_accuracy": 0.9298348277807236, "num_tokens": 111723040.0, "step": 9057 }, { "entropy": 0.964602530002594, "epoch": 4.769878883622959, "grad_norm": 0.3439449071884155, "learning_rate": 6.382777093960169e-05, "loss": 0.1925317943096161, "mean_token_accuracy": 0.920476108789444, "num_tokens": 111735376.0, "step": 9058 }, { "entropy": 0.9869271069765091, "epoch": 4.770405476566614, "grad_norm": 0.316421777009964, "learning_rate": 6.380894964272384e-05, "loss": 0.1708654910326004, "mean_token_accuracy": 0.9293173998594284, "num_tokens": 111747712.0, "step": 9059 }, { "entropy": 0.9626688212156296, "epoch": 4.770932069510269, "grad_norm": 0.29398012161254883, "learning_rate": 6.379013108793945e-05, "loss": 0.1604207158088684, "mean_token_accuracy": 0.9344052374362946, "num_tokens": 111760048.0, "step": 9060 }, { "entropy": 0.9678095579147339, "epoch": 4.771458662453923, "grad_norm": 0.3171744644641876, "learning_rate": 6.377131527636564e-05, "loss": 0.1560574471950531, "mean_token_accuracy": 0.9331692159175873, "num_tokens": 111772384.0, "step": 9061 }, { "entropy": 1.0159512609243393, "epoch": 4.771985255397578, "grad_norm": 0.33914652466773987, "learning_rate": 6.375250220911939e-05, "loss": 0.16417792439460754, "mean_token_accuracy": 0.9308343529701233, "num_tokens": 111784720.0, "step": 9062 }, { "entropy": 0.959560289978981, "epoch": 4.7725118483412325, "grad_norm": 0.30077576637268066, "learning_rate": 6.373369188731752e-05, "loss": 0.16021844744682312, "mean_token_accuracy": 0.932145431637764, "num_tokens": 111797056.0, "step": 9063 }, { "entropy": 0.981648176908493, "epoch": 4.7730384412848865, "grad_norm": 0.3147124648094177, "learning_rate": 6.371488431207671e-05, "loss": 0.16345477104187012, "mean_token_accuracy": 0.9277648627758026, "num_tokens": 111809392.0, "step": 9064 }, { "entropy": 0.9431145936250687, "epoch": 4.773565034228541, "grad_norm": 0.3094829320907593, "learning_rate": 6.369607948451346e-05, "loss": 0.15901650488376617, "mean_token_accuracy": 0.9305784106254578, "num_tokens": 111821728.0, "step": 9065 }, { "entropy": 0.9495803564786911, "epoch": 4.774091627172196, "grad_norm": 0.33323946595191956, "learning_rate": 6.36772774057441e-05, "loss": 0.17987127602100372, "mean_token_accuracy": 0.9216539263725281, "num_tokens": 111834064.0, "step": 9066 }, { "entropy": 0.9451373517513275, "epoch": 4.77461822011585, "grad_norm": 0.31161990761756897, "learning_rate": 6.365847807688478e-05, "loss": 0.1630258560180664, "mean_token_accuracy": 0.9296188056468964, "num_tokens": 111846400.0, "step": 9067 }, { "entropy": 0.9265732914209366, "epoch": 4.775144813059505, "grad_norm": 0.2965737283229828, "learning_rate": 6.363968149905148e-05, "loss": 0.16398824751377106, "mean_token_accuracy": 0.9289033710956573, "num_tokens": 111858736.0, "step": 9068 }, { "entropy": 0.9546487033367157, "epoch": 4.775671406003159, "grad_norm": 0.3014756739139557, "learning_rate": 6.362088767336014e-05, "loss": 0.16929973661899567, "mean_token_accuracy": 0.9295613765716553, "num_tokens": 111871072.0, "step": 9069 }, { "entropy": 0.9728638082742691, "epoch": 4.776197998946814, "grad_norm": 0.3430885672569275, "learning_rate": 6.360209660092637e-05, "loss": 0.18163266777992249, "mean_token_accuracy": 0.9220084995031357, "num_tokens": 111883408.0, "step": 9070 }, { "entropy": 0.9284171313047409, "epoch": 4.776724591890469, "grad_norm": 0.31685933470726013, "learning_rate": 6.358330828286567e-05, "loss": 0.16648146510124207, "mean_token_accuracy": 0.9305678457021713, "num_tokens": 111895744.0, "step": 9071 }, { "entropy": 0.9554715007543564, "epoch": 4.777251184834123, "grad_norm": 0.3176212012767792, "learning_rate": 6.356452272029344e-05, "loss": 0.1680004894733429, "mean_token_accuracy": 0.9303200393915176, "num_tokens": 111908080.0, "step": 9072 }, { "entropy": 0.9570530503988266, "epoch": 4.777777777777778, "grad_norm": 0.35659483075141907, "learning_rate": 6.354573991432485e-05, "loss": 0.1893249899148941, "mean_token_accuracy": 0.9239123463630676, "num_tokens": 111920416.0, "step": 9073 }, { "entropy": 0.9419193267822266, "epoch": 4.7783043707214325, "grad_norm": 0.3028180003166199, "learning_rate": 6.352695986607493e-05, "loss": 0.16518285870552063, "mean_token_accuracy": 0.9283025413751602, "num_tokens": 111932752.0, "step": 9074 }, { "entropy": 0.9351107627153397, "epoch": 4.7788309636650865, "grad_norm": 0.29300156235694885, "learning_rate": 6.350818257665849e-05, "loss": 0.16043254733085632, "mean_token_accuracy": 0.9351049810647964, "num_tokens": 111945088.0, "step": 9075 }, { "entropy": 0.9588852375745773, "epoch": 4.779357556608741, "grad_norm": 0.30463680624961853, "learning_rate": 6.34894080471903e-05, "loss": 0.1685238480567932, "mean_token_accuracy": 0.9276732206344604, "num_tokens": 111957424.0, "step": 9076 }, { "entropy": 0.9524371176958084, "epoch": 4.779884149552396, "grad_norm": 0.31636473536491394, "learning_rate": 6.34706362787849e-05, "loss": 0.16936713457107544, "mean_token_accuracy": 0.9265929758548737, "num_tokens": 111969760.0, "step": 9077 }, { "entropy": 0.9338591247797012, "epoch": 4.78041074249605, "grad_norm": 0.31156182289123535, "learning_rate": 6.345186727255661e-05, "loss": 0.17318032681941986, "mean_token_accuracy": 0.9255554527044296, "num_tokens": 111982096.0, "step": 9078 }, { "entropy": 0.9713913351297379, "epoch": 4.780937335439705, "grad_norm": 0.3218269944190979, "learning_rate": 6.343310102961966e-05, "loss": 0.1645289808511734, "mean_token_accuracy": 0.9315515011548996, "num_tokens": 111994432.0, "step": 9079 }, { "entropy": 0.9637110829353333, "epoch": 4.78146392838336, "grad_norm": 0.33749082684516907, "learning_rate": 6.341433755108813e-05, "loss": 0.17996618151664734, "mean_token_accuracy": 0.9206294417381287, "num_tokens": 112006768.0, "step": 9080 }, { "entropy": 0.9192416071891785, "epoch": 4.781990521327014, "grad_norm": 0.28524866700172424, "learning_rate": 6.339557683807581e-05, "loss": 0.15543463826179504, "mean_token_accuracy": 0.934823215007782, "num_tokens": 112019104.0, "step": 9081 }, { "entropy": 0.9043999761343002, "epoch": 4.782517114270669, "grad_norm": 0.3133680820465088, "learning_rate": 6.337681889169643e-05, "loss": 0.16104987263679504, "mean_token_accuracy": 0.929581955075264, "num_tokens": 112031440.0, "step": 9082 }, { "entropy": 0.9359278827905655, "epoch": 4.783043707214324, "grad_norm": 0.30294913053512573, "learning_rate": 6.33580637130636e-05, "loss": 0.16375668346881866, "mean_token_accuracy": 0.9279943853616714, "num_tokens": 112043776.0, "step": 9083 }, { "entropy": 0.9404270648956299, "epoch": 4.783570300157978, "grad_norm": 0.3146786093711853, "learning_rate": 6.333931130329069e-05, "loss": 0.17909596860408783, "mean_token_accuracy": 0.9296393245458603, "num_tokens": 112056112.0, "step": 9084 }, { "entropy": 0.9564862996339798, "epoch": 4.7840968931016326, "grad_norm": 0.34017446637153625, "learning_rate": 6.332056166349091e-05, "loss": 0.1690351665019989, "mean_token_accuracy": 0.9247809499502182, "num_tokens": 112068448.0, "step": 9085 }, { "entropy": 0.9514518976211548, "epoch": 4.784623486045287, "grad_norm": 0.30882126092910767, "learning_rate": 6.330181479477733e-05, "loss": 0.16744601726531982, "mean_token_accuracy": 0.9311587661504745, "num_tokens": 112080784.0, "step": 9086 }, { "entropy": 0.9229488521814346, "epoch": 4.785150078988941, "grad_norm": 0.33422407507896423, "learning_rate": 6.32830706982628e-05, "loss": 0.17872753739356995, "mean_token_accuracy": 0.9267108738422394, "num_tokens": 112093120.0, "step": 9087 }, { "entropy": 0.9272540509700775, "epoch": 4.785676671932596, "grad_norm": 0.3081918954849243, "learning_rate": 6.326432937506009e-05, "loss": 0.17642512917518616, "mean_token_accuracy": 0.9253614991903305, "num_tokens": 112105456.0, "step": 9088 }, { "entropy": 0.9433393478393555, "epoch": 4.786203264876251, "grad_norm": 0.3381654620170593, "learning_rate": 6.324559082628175e-05, "loss": 0.18298709392547607, "mean_token_accuracy": 0.9250814318656921, "num_tokens": 112117792.0, "step": 9089 }, { "entropy": 0.9583987295627594, "epoch": 4.786729857819905, "grad_norm": 0.29826247692108154, "learning_rate": 6.322685505304018e-05, "loss": 0.15026958286762238, "mean_token_accuracy": 0.936936229467392, "num_tokens": 112130128.0, "step": 9090 }, { "entropy": 0.9661408960819244, "epoch": 4.78725645076356, "grad_norm": 0.32385575771331787, "learning_rate": 6.32081220564476e-05, "loss": 0.17515888810157776, "mean_token_accuracy": 0.9241830855607986, "num_tokens": 112142464.0, "step": 9091 }, { "entropy": 0.8939239084720612, "epoch": 4.787783043707214, "grad_norm": 0.3073534369468689, "learning_rate": 6.31893918376161e-05, "loss": 0.15793702006340027, "mean_token_accuracy": 0.9343563467264175, "num_tokens": 112154800.0, "step": 9092 }, { "entropy": 0.906022310256958, "epoch": 4.788309636650869, "grad_norm": 0.3248325288295746, "learning_rate": 6.317066439765756e-05, "loss": 0.18267102539539337, "mean_token_accuracy": 0.9195359200239182, "num_tokens": 112167136.0, "step": 9093 }, { "entropy": 0.9159866869449615, "epoch": 4.788836229594524, "grad_norm": 0.30191734433174133, "learning_rate": 6.315193973768374e-05, "loss": 0.17407076060771942, "mean_token_accuracy": 0.9262288957834244, "num_tokens": 112179472.0, "step": 9094 }, { "entropy": 0.9487686604261398, "epoch": 4.789362822538178, "grad_norm": 0.31542494893074036, "learning_rate": 6.313321785880621e-05, "loss": 0.1765207052230835, "mean_token_accuracy": 0.9244837909936905, "num_tokens": 112191808.0, "step": 9095 }, { "entropy": 0.9285544902086258, "epoch": 4.789889415481833, "grad_norm": 0.318965345621109, "learning_rate": 6.311449876213633e-05, "loss": 0.1790979951620102, "mean_token_accuracy": 0.9226861447095871, "num_tokens": 112204144.0, "step": 9096 }, { "entropy": 0.9164725095033646, "epoch": 4.790416008425487, "grad_norm": 0.31515586376190186, "learning_rate": 6.309578244878544e-05, "loss": 0.1683732271194458, "mean_token_accuracy": 0.9258377999067307, "num_tokens": 112216480.0, "step": 9097 }, { "entropy": 0.9288828819990158, "epoch": 4.790942601369141, "grad_norm": 0.3244929015636444, "learning_rate": 6.307706891986456e-05, "loss": 0.1691761016845703, "mean_token_accuracy": 0.9247510433197021, "num_tokens": 112228816.0, "step": 9098 }, { "entropy": 0.9310002326965332, "epoch": 4.791469194312796, "grad_norm": 0.3144392669200897, "learning_rate": 6.305835817648464e-05, "loss": 0.1585865616798401, "mean_token_accuracy": 0.9319644272327423, "num_tokens": 112241152.0, "step": 9099 }, { "entropy": 0.9388798475265503, "epoch": 4.791995787256451, "grad_norm": 0.32102328538894653, "learning_rate": 6.303965021975636e-05, "loss": 0.17396274209022522, "mean_token_accuracy": 0.9284583330154419, "num_tokens": 112253488.0, "step": 9100 }, { "entropy": 0.9336607456207275, "epoch": 4.792522380200105, "grad_norm": 0.2871127128601074, "learning_rate": 6.302094505079035e-05, "loss": 0.15618155896663666, "mean_token_accuracy": 0.9364693909883499, "num_tokens": 112265824.0, "step": 9101 }, { "entropy": 0.938468337059021, "epoch": 4.79304897314376, "grad_norm": 0.29081955552101135, "learning_rate": 6.300224267069702e-05, "loss": 0.15577498078346252, "mean_token_accuracy": 0.9322134852409363, "num_tokens": 112278160.0, "step": 9102 }, { "entropy": 0.9274968355894089, "epoch": 4.793575566087414, "grad_norm": 0.33888524770736694, "learning_rate": 6.298354308058658e-05, "loss": 0.17000727355480194, "mean_token_accuracy": 0.9261871576309204, "num_tokens": 112290496.0, "step": 9103 }, { "entropy": 0.9365573227405548, "epoch": 4.794102159031069, "grad_norm": 0.31890496611595154, "learning_rate": 6.296484628156918e-05, "loss": 0.16275769472122192, "mean_token_accuracy": 0.9281330853700638, "num_tokens": 112302832.0, "step": 9104 }, { "entropy": 0.9545449614524841, "epoch": 4.794628751974724, "grad_norm": 0.3689518868923187, "learning_rate": 6.294615227475474e-05, "loss": 0.18185900151729584, "mean_token_accuracy": 0.9226024895906448, "num_tokens": 112315168.0, "step": 9105 }, { "entropy": 0.9652837216854095, "epoch": 4.795155344918378, "grad_norm": 0.34969696402549744, "learning_rate": 6.292746106125297e-05, "loss": 0.18228575587272644, "mean_token_accuracy": 0.921035885810852, "num_tokens": 112327504.0, "step": 9106 }, { "entropy": 0.92081518471241, "epoch": 4.795681937862033, "grad_norm": 0.3451554775238037, "learning_rate": 6.290877264217347e-05, "loss": 0.19245527684688568, "mean_token_accuracy": 0.9229613840579987, "num_tokens": 112339840.0, "step": 9107 }, { "entropy": 0.9458408206701279, "epoch": 4.796208530805687, "grad_norm": 0.32558906078338623, "learning_rate": 6.289008701862569e-05, "loss": 0.16560578346252441, "mean_token_accuracy": 0.9308914095163345, "num_tokens": 112352176.0, "step": 9108 }, { "entropy": 0.9107428342103958, "epoch": 4.796735123749341, "grad_norm": 0.30025514960289, "learning_rate": 6.287140419171885e-05, "loss": 0.1743806004524231, "mean_token_accuracy": 0.9275696724653244, "num_tokens": 112364512.0, "step": 9109 }, { "entropy": 0.9333881288766861, "epoch": 4.797261716692996, "grad_norm": 0.31256020069122314, "learning_rate": 6.285272416256207e-05, "loss": 0.16271354258060455, "mean_token_accuracy": 0.9293209463357925, "num_tokens": 112376848.0, "step": 9110 }, { "entropy": 0.9459578990936279, "epoch": 4.797788309636651, "grad_norm": 0.32335054874420166, "learning_rate": 6.283404693226424e-05, "loss": 0.17523100972175598, "mean_token_accuracy": 0.9279122352600098, "num_tokens": 112389184.0, "step": 9111 }, { "entropy": 0.9072926044464111, "epoch": 4.798314902580305, "grad_norm": 0.2974752187728882, "learning_rate": 6.281537250193417e-05, "loss": 0.15954649448394775, "mean_token_accuracy": 0.930755153298378, "num_tokens": 112401520.0, "step": 9112 }, { "entropy": 0.970455676317215, "epoch": 4.79884149552396, "grad_norm": 0.3365978002548218, "learning_rate": 6.27967008726804e-05, "loss": 0.17074136435985565, "mean_token_accuracy": 0.9294116944074631, "num_tokens": 112413856.0, "step": 9113 }, { "entropy": 0.9673090875148773, "epoch": 4.799368088467615, "grad_norm": 0.3307856023311615, "learning_rate": 6.277803204561138e-05, "loss": 0.16063982248306274, "mean_token_accuracy": 0.9351110458374023, "num_tokens": 112426192.0, "step": 9114 }, { "entropy": 0.9420793056488037, "epoch": 4.799894681411269, "grad_norm": 0.3055140972137451, "learning_rate": 6.275936602183537e-05, "loss": 0.16511839628219604, "mean_token_accuracy": 0.9317631870508194, "num_tokens": 112438528.0, "step": 9115 }, { "entropy": 0.965690553188324, "epoch": 4.800421274354924, "grad_norm": 0.335700124502182, "learning_rate": 6.274070280246047e-05, "loss": 0.18881773948669434, "mean_token_accuracy": 0.9202330857515335, "num_tokens": 112450864.0, "step": 9116 }, { "entropy": 0.9024168848991394, "epoch": 4.800947867298579, "grad_norm": 0.31919345259666443, "learning_rate": 6.272204238859453e-05, "loss": 0.17541448771953583, "mean_token_accuracy": 0.9276711642742157, "num_tokens": 112463200.0, "step": 9117 }, { "entropy": 0.9271547645330429, "epoch": 4.801474460242233, "grad_norm": 0.3327969014644623, "learning_rate": 6.270338478134547e-05, "loss": 0.1676233410835266, "mean_token_accuracy": 0.9297514259815216, "num_tokens": 112475536.0, "step": 9118 }, { "entropy": 0.9096930176019669, "epoch": 4.802001053185887, "grad_norm": 0.290777325630188, "learning_rate": 6.268472998182076e-05, "loss": 0.1540253609418869, "mean_token_accuracy": 0.9340391308069229, "num_tokens": 112487872.0, "step": 9119 }, { "entropy": 0.9078056812286377, "epoch": 4.802527646129542, "grad_norm": 0.2970122992992401, "learning_rate": 6.266607799112786e-05, "loss": 0.16196846961975098, "mean_token_accuracy": 0.9300400167703629, "num_tokens": 112500208.0, "step": 9120 }, { "entropy": 0.9710754305124283, "epoch": 4.803054239073196, "grad_norm": 0.3165084719657898, "learning_rate": 6.264742881037401e-05, "loss": 0.17036688327789307, "mean_token_accuracy": 0.9278738349676132, "num_tokens": 112512544.0, "step": 9121 }, { "entropy": 0.8850185126066208, "epoch": 4.803580832016851, "grad_norm": 0.320492148399353, "learning_rate": 6.262878244066632e-05, "loss": 0.1639227271080017, "mean_token_accuracy": 0.931957870721817, "num_tokens": 112524880.0, "step": 9122 }, { "entropy": 0.8749157786369324, "epoch": 4.804107424960506, "grad_norm": 0.30157896876335144, "learning_rate": 6.261013888311173e-05, "loss": 0.1490166187286377, "mean_token_accuracy": 0.9377554953098297, "num_tokens": 112537216.0, "step": 9123 }, { "entropy": 0.9255085736513138, "epoch": 4.80463401790416, "grad_norm": 0.32794201374053955, "learning_rate": 6.259149813881695e-05, "loss": 0.17577221989631653, "mean_token_accuracy": 0.9207169562578201, "num_tokens": 112549552.0, "step": 9124 }, { "entropy": 0.9130100309848785, "epoch": 4.805160610847815, "grad_norm": 0.29243433475494385, "learning_rate": 6.257286020888863e-05, "loss": 0.17095312476158142, "mean_token_accuracy": 0.9262748509645462, "num_tokens": 112561888.0, "step": 9125 }, { "entropy": 0.9452150911092758, "epoch": 4.805687203791469, "grad_norm": 0.30524101853370667, "learning_rate": 6.255422509443318e-05, "loss": 0.1610173135995865, "mean_token_accuracy": 0.9299993216991425, "num_tokens": 112574224.0, "step": 9126 }, { "entropy": 0.9425390809774399, "epoch": 4.806213796735124, "grad_norm": 0.30706319212913513, "learning_rate": 6.253559279655685e-05, "loss": 0.16968831419944763, "mean_token_accuracy": 0.924667090177536, "num_tokens": 112586560.0, "step": 9127 }, { "entropy": 0.919682040810585, "epoch": 4.806740389678779, "grad_norm": 0.2983159124851227, "learning_rate": 6.251696331636572e-05, "loss": 0.1572701781988144, "mean_token_accuracy": 0.9339618682861328, "num_tokens": 112598896.0, "step": 9128 }, { "entropy": 0.8853818327188492, "epoch": 4.807266982622433, "grad_norm": 0.3081471025943756, "learning_rate": 6.249833665496578e-05, "loss": 0.16573485732078552, "mean_token_accuracy": 0.9274046123027802, "num_tokens": 112611232.0, "step": 9129 }, { "entropy": 0.9164557904005051, "epoch": 4.807793575566087, "grad_norm": 0.3027510941028595, "learning_rate": 6.24797128134627e-05, "loss": 0.17423248291015625, "mean_token_accuracy": 0.9266597628593445, "num_tokens": 112623568.0, "step": 9130 }, { "entropy": 0.9424787163734436, "epoch": 4.808320168509742, "grad_norm": 0.32579028606414795, "learning_rate": 6.246109179296205e-05, "loss": 0.18080949783325195, "mean_token_accuracy": 0.922933965921402, "num_tokens": 112635904.0, "step": 9131 }, { "entropy": 0.9282560646533966, "epoch": 4.808846761453396, "grad_norm": 0.3106735944747925, "learning_rate": 6.244247359456935e-05, "loss": 0.16808384656906128, "mean_token_accuracy": 0.9309414029121399, "num_tokens": 112648240.0, "step": 9132 }, { "entropy": 0.94905224442482, "epoch": 4.809373354397051, "grad_norm": 0.3005760908126831, "learning_rate": 6.242385821938978e-05, "loss": 0.15837016701698303, "mean_token_accuracy": 0.9334435909986496, "num_tokens": 112660576.0, "step": 9133 }, { "entropy": 0.9732349216938019, "epoch": 4.809899947340705, "grad_norm": 0.3310624361038208, "learning_rate": 6.240524566852847e-05, "loss": 0.17375272512435913, "mean_token_accuracy": 0.9251791536808014, "num_tokens": 112672912.0, "step": 9134 }, { "entropy": 0.9393926411867142, "epoch": 4.81042654028436, "grad_norm": 0.32279565930366516, "learning_rate": 6.238663594309034e-05, "loss": 0.18074797093868256, "mean_token_accuracy": 0.923829197883606, "num_tokens": 112685248.0, "step": 9135 }, { "entropy": 0.8982023596763611, "epoch": 4.810953133228015, "grad_norm": 0.29356688261032104, "learning_rate": 6.23680290441801e-05, "loss": 0.16551603376865387, "mean_token_accuracy": 0.927782729268074, "num_tokens": 112697584.0, "step": 9136 }, { "entropy": 0.9252886474132538, "epoch": 4.811479726171669, "grad_norm": 0.3066103756427765, "learning_rate": 6.234942497290236e-05, "loss": 0.16104555130004883, "mean_token_accuracy": 0.931676521897316, "num_tokens": 112709920.0, "step": 9137 }, { "entropy": 0.9413758218288422, "epoch": 4.812006319115324, "grad_norm": 0.31761816143989563, "learning_rate": 6.233082373036153e-05, "loss": 0.1703198105096817, "mean_token_accuracy": 0.9248000532388687, "num_tokens": 112722256.0, "step": 9138 }, { "entropy": 0.941258043050766, "epoch": 4.812532912058979, "grad_norm": 0.35805585980415344, "learning_rate": 6.231222531766185e-05, "loss": 0.1860889196395874, "mean_token_accuracy": 0.9257703423500061, "num_tokens": 112734592.0, "step": 9139 }, { "entropy": 0.9381390064954758, "epoch": 4.813059505002633, "grad_norm": 0.2907848358154297, "learning_rate": 6.229362973590742e-05, "loss": 0.14537650346755981, "mean_token_accuracy": 0.9363595247268677, "num_tokens": 112746928.0, "step": 9140 }, { "entropy": 0.9168024659156799, "epoch": 4.8135860979462874, "grad_norm": 0.3004358410835266, "learning_rate": 6.227503698620216e-05, "loss": 0.15760137140750885, "mean_token_accuracy": 0.933418795466423, "num_tokens": 112759264.0, "step": 9141 }, { "entropy": 0.9295596182346344, "epoch": 4.814112690889942, "grad_norm": 0.3019280433654785, "learning_rate": 6.225644706964974e-05, "loss": 0.16697147488594055, "mean_token_accuracy": 0.929103896021843, "num_tokens": 112771600.0, "step": 9142 }, { "entropy": 0.9131826758384705, "epoch": 4.814639283833596, "grad_norm": 0.3130643665790558, "learning_rate": 6.223785998735382e-05, "loss": 0.1685619056224823, "mean_token_accuracy": 0.9274730831384659, "num_tokens": 112783936.0, "step": 9143 }, { "entropy": 0.923699751496315, "epoch": 4.815165876777251, "grad_norm": 0.31038033962249756, "learning_rate": 6.221927574041779e-05, "loss": 0.1619996428489685, "mean_token_accuracy": 0.9313331842422485, "num_tokens": 112796272.0, "step": 9144 }, { "entropy": 0.9440527558326721, "epoch": 4.815692469720906, "grad_norm": 0.3447670638561249, "learning_rate": 6.220069432994481e-05, "loss": 0.16763903200626373, "mean_token_accuracy": 0.9285595715045929, "num_tokens": 112808608.0, "step": 9145 }, { "entropy": 0.8979533016681671, "epoch": 4.81621906266456, "grad_norm": 0.29874899983406067, "learning_rate": 6.218211575703805e-05, "loss": 0.17092090845108032, "mean_token_accuracy": 0.9283223152160645, "num_tokens": 112820944.0, "step": 9146 }, { "entropy": 0.9298407733440399, "epoch": 4.816745655608215, "grad_norm": 0.3201086223125458, "learning_rate": 6.216354002280037e-05, "loss": 0.1501120924949646, "mean_token_accuracy": 0.9355747103691101, "num_tokens": 112833280.0, "step": 9147 }, { "entropy": 0.9380588829517365, "epoch": 4.81727224855187, "grad_norm": 0.3264695107936859, "learning_rate": 6.214496712833455e-05, "loss": 0.15935201942920685, "mean_token_accuracy": 0.9295739084482193, "num_tokens": 112845616.0, "step": 9148 }, { "entropy": 0.9423897117376328, "epoch": 4.817798841495524, "grad_norm": 0.36109310388565063, "learning_rate": 6.212639707474308e-05, "loss": 0.18861493468284607, "mean_token_accuracy": 0.916970893740654, "num_tokens": 112857952.0, "step": 9149 }, { "entropy": 0.8985049575567245, "epoch": 4.818325434439179, "grad_norm": 0.30845433473587036, "learning_rate": 6.210782986312838e-05, "loss": 0.16502808034420013, "mean_token_accuracy": 0.9298705011606216, "num_tokens": 112870288.0, "step": 9150 }, { "entropy": 0.9010489583015442, "epoch": 4.8188520273828335, "grad_norm": 0.34794074296951294, "learning_rate": 6.208926549459268e-05, "loss": 0.18474933505058289, "mean_token_accuracy": 0.921579048037529, "num_tokens": 112882624.0, "step": 9151 }, { "entropy": 0.9137450605630875, "epoch": 4.8193786203264875, "grad_norm": 0.30454927682876587, "learning_rate": 6.207070397023803e-05, "loss": 0.16628552973270416, "mean_token_accuracy": 0.925239771604538, "num_tokens": 112894960.0, "step": 9152 }, { "entropy": 0.9247958213090897, "epoch": 4.819905213270142, "grad_norm": 0.30902260541915894, "learning_rate": 6.205214529116634e-05, "loss": 0.16501721739768982, "mean_token_accuracy": 0.9277013838291168, "num_tokens": 112907296.0, "step": 9153 }, { "entropy": 0.9595179408788681, "epoch": 4.820431806213797, "grad_norm": 0.34334465861320496, "learning_rate": 6.203358945847935e-05, "loss": 0.18191400170326233, "mean_token_accuracy": 0.9258522987365723, "num_tokens": 112919632.0, "step": 9154 }, { "entropy": 0.9212562143802643, "epoch": 4.820958399157451, "grad_norm": 0.31868496537208557, "learning_rate": 6.201503647327855e-05, "loss": 0.17826935648918152, "mean_token_accuracy": 0.9231353104114532, "num_tokens": 112931968.0, "step": 9155 }, { "entropy": 0.9315204322338104, "epoch": 4.821484992101106, "grad_norm": 0.29482823610305786, "learning_rate": 6.199648633666538e-05, "loss": 0.16608521342277527, "mean_token_accuracy": 0.9294846951961517, "num_tokens": 112944304.0, "step": 9156 }, { "entropy": 0.9712758958339691, "epoch": 4.82201158504476, "grad_norm": 0.31313827633857727, "learning_rate": 6.197793904974104e-05, "loss": 0.17441165447235107, "mean_token_accuracy": 0.9243512004613876, "num_tokens": 112956640.0, "step": 9157 }, { "entropy": 0.9236172586679459, "epoch": 4.822538177988415, "grad_norm": 0.29153314232826233, "learning_rate": 6.195939461360654e-05, "loss": 0.1600339561700821, "mean_token_accuracy": 0.9282103329896927, "num_tokens": 112968976.0, "step": 9158 }, { "entropy": 0.9531195908784866, "epoch": 4.82306477093207, "grad_norm": 0.33459538221359253, "learning_rate": 6.194085302936278e-05, "loss": 0.18222567439079285, "mean_token_accuracy": 0.9229590743780136, "num_tokens": 112981312.0, "step": 9159 }, { "entropy": 0.9638189673423767, "epoch": 4.823591363875724, "grad_norm": 0.3411768674850464, "learning_rate": 6.192231429811048e-05, "loss": 0.18856140971183777, "mean_token_accuracy": 0.9173770844936371, "num_tokens": 112993648.0, "step": 9160 }, { "entropy": 0.9931163936853409, "epoch": 4.824117956819379, "grad_norm": 0.3286246061325073, "learning_rate": 6.190377842095017e-05, "loss": 0.18306970596313477, "mean_token_accuracy": 0.922531470656395, "num_tokens": 113005984.0, "step": 9161 }, { "entropy": 0.87714883685112, "epoch": 4.8246445497630335, "grad_norm": 0.2968125641345978, "learning_rate": 6.188524539898219e-05, "loss": 0.15188772976398468, "mean_token_accuracy": 0.9343786090612411, "num_tokens": 113018320.0, "step": 9162 }, { "entropy": 0.9333531558513641, "epoch": 4.8251711427066875, "grad_norm": 0.31941041350364685, "learning_rate": 6.186671523330676e-05, "loss": 0.17567633092403412, "mean_token_accuracy": 0.9214246571063995, "num_tokens": 113030656.0, "step": 9163 }, { "entropy": 0.9728813916444778, "epoch": 4.825697735650342, "grad_norm": 0.32849058508872986, "learning_rate": 6.184818792502391e-05, "loss": 0.1731397807598114, "mean_token_accuracy": 0.9273866266012192, "num_tokens": 113042992.0, "step": 9164 }, { "entropy": 0.9401708841323853, "epoch": 4.826224328593997, "grad_norm": 0.30741560459136963, "learning_rate": 6.182966347523349e-05, "loss": 0.17288266122341156, "mean_token_accuracy": 0.9284588396549225, "num_tokens": 113055328.0, "step": 9165 }, { "entropy": 0.9812659025192261, "epoch": 4.826750921537651, "grad_norm": 0.3393278121948242, "learning_rate": 6.181114188503516e-05, "loss": 0.1769835650920868, "mean_token_accuracy": 0.9237487763166428, "num_tokens": 113067664.0, "step": 9166 }, { "entropy": 0.9631835669279099, "epoch": 4.827277514481306, "grad_norm": 0.31807562708854675, "learning_rate": 6.179262315552853e-05, "loss": 0.17839747667312622, "mean_token_accuracy": 0.9289010018110275, "num_tokens": 113080000.0, "step": 9167 }, { "entropy": 0.9522756934165955, "epoch": 4.82780410742496, "grad_norm": 0.3397252559661865, "learning_rate": 6.177410728781287e-05, "loss": 0.1738055795431137, "mean_token_accuracy": 0.9253265112638474, "num_tokens": 113092336.0, "step": 9168 }, { "entropy": 0.9829897880554199, "epoch": 4.828330700368615, "grad_norm": 0.3597947955131531, "learning_rate": 6.175559428298737e-05, "loss": 0.18888182938098907, "mean_token_accuracy": 0.9227168262004852, "num_tokens": 113104672.0, "step": 9169 }, { "entropy": 0.9550391584634781, "epoch": 4.82885729331227, "grad_norm": 0.2912638783454895, "learning_rate": 6.173708414215105e-05, "loss": 0.1649709939956665, "mean_token_accuracy": 0.9291027784347534, "num_tokens": 113117008.0, "step": 9170 }, { "entropy": 0.8955940455198288, "epoch": 4.829383886255924, "grad_norm": 0.28251731395721436, "learning_rate": 6.171857686640274e-05, "loss": 0.14913088083267212, "mean_token_accuracy": 0.9360662996768951, "num_tokens": 113129344.0, "step": 9171 }, { "entropy": 0.9660614132881165, "epoch": 4.829910479199579, "grad_norm": 0.3158622682094574, "learning_rate": 6.170007245684113e-05, "loss": 0.16393935680389404, "mean_token_accuracy": 0.9336477220058441, "num_tokens": 113141680.0, "step": 9172 }, { "entropy": 0.9383984357118607, "epoch": 4.8304370721432335, "grad_norm": 0.32235682010650635, "learning_rate": 6.168157091456466e-05, "loss": 0.17803451418876648, "mean_token_accuracy": 0.9236116111278534, "num_tokens": 113154016.0, "step": 9173 }, { "entropy": 0.9070072770118713, "epoch": 4.8309636650868875, "grad_norm": 0.29480841755867004, "learning_rate": 6.166307224067173e-05, "loss": 0.164914071559906, "mean_token_accuracy": 0.9274289160966873, "num_tokens": 113166352.0, "step": 9174 }, { "entropy": 0.945151075720787, "epoch": 4.831490258030542, "grad_norm": 0.3259155750274658, "learning_rate": 6.16445764362605e-05, "loss": 0.17770960927009583, "mean_token_accuracy": 0.9249714463949203, "num_tokens": 113178688.0, "step": 9175 }, { "entropy": 0.9563282877206802, "epoch": 4.832016850974197, "grad_norm": 0.31394654512405396, "learning_rate": 6.162608350242888e-05, "loss": 0.16683940589427948, "mean_token_accuracy": 0.9329259991645813, "num_tokens": 113191024.0, "step": 9176 }, { "entropy": 0.9816624969244003, "epoch": 4.832543443917851, "grad_norm": 0.34521687030792236, "learning_rate": 6.160759344027482e-05, "loss": 0.1855495572090149, "mean_token_accuracy": 0.9137884080410004, "num_tokens": 113203360.0, "step": 9177 }, { "entropy": 0.9625774472951889, "epoch": 4.833070036861506, "grad_norm": 0.33744141459465027, "learning_rate": 6.158910625089584e-05, "loss": 0.1721527874469757, "mean_token_accuracy": 0.9258444309234619, "num_tokens": 113215696.0, "step": 9178 }, { "entropy": 0.9747310727834702, "epoch": 4.833596629805161, "grad_norm": 0.3287394642829895, "learning_rate": 6.157062193538945e-05, "loss": 0.1844010353088379, "mean_token_accuracy": 0.9236720949411392, "num_tokens": 113228032.0, "step": 9179 }, { "entropy": 0.9509319812059402, "epoch": 4.834123222748815, "grad_norm": 0.3232387900352478, "learning_rate": 6.155214049485294e-05, "loss": 0.1758861392736435, "mean_token_accuracy": 0.9263638705015182, "num_tokens": 113240368.0, "step": 9180 }, { "entropy": 0.9433962553739548, "epoch": 4.83464981569247, "grad_norm": 0.32960569858551025, "learning_rate": 6.15336619303835e-05, "loss": 0.17984148859977722, "mean_token_accuracy": 0.9253224283456802, "num_tokens": 113252704.0, "step": 9181 }, { "entropy": 0.9309116154909134, "epoch": 4.835176408636125, "grad_norm": 0.31888312101364136, "learning_rate": 6.151518624307808e-05, "loss": 0.1658877581357956, "mean_token_accuracy": 0.9319590628147125, "num_tokens": 113265040.0, "step": 9182 }, { "entropy": 0.9187856763601303, "epoch": 4.835703001579779, "grad_norm": 0.3147662878036499, "learning_rate": 6.149671343403347e-05, "loss": 0.17353439331054688, "mean_token_accuracy": 0.9259817600250244, "num_tokens": 113277376.0, "step": 9183 }, { "entropy": 0.9754699617624283, "epoch": 4.8362295945234335, "grad_norm": 0.32784178853034973, "learning_rate": 6.147824350434628e-05, "loss": 0.1768968254327774, "mean_token_accuracy": 0.9237811714410782, "num_tokens": 113289712.0, "step": 9184 }, { "entropy": 0.9289213418960571, "epoch": 4.836756187467088, "grad_norm": 0.30313992500305176, "learning_rate": 6.145977645511296e-05, "loss": 0.1519276350736618, "mean_token_accuracy": 0.9341972172260284, "num_tokens": 113302048.0, "step": 9185 }, { "entropy": 0.9625039547681808, "epoch": 4.837282780410742, "grad_norm": 0.3229649066925049, "learning_rate": 6.144131228742979e-05, "loss": 0.17990517616271973, "mean_token_accuracy": 0.9261969178915024, "num_tokens": 113314384.0, "step": 9186 }, { "entropy": 0.9287969917058945, "epoch": 4.837809373354397, "grad_norm": 0.3233555853366852, "learning_rate": 6.142285100239289e-05, "loss": 0.1754463016986847, "mean_token_accuracy": 0.9251480847597122, "num_tokens": 113326720.0, "step": 9187 }, { "entropy": 0.9506050199270248, "epoch": 4.838335966298052, "grad_norm": 0.3280300796031952, "learning_rate": 6.140439260109821e-05, "loss": 0.17056047916412354, "mean_token_accuracy": 0.9295740723609924, "num_tokens": 113339056.0, "step": 9188 }, { "entropy": 0.9726871848106384, "epoch": 4.838862559241706, "grad_norm": 0.3280206024646759, "learning_rate": 6.138593708464149e-05, "loss": 0.1634208709001541, "mean_token_accuracy": 0.932182252407074, "num_tokens": 113351392.0, "step": 9189 }, { "entropy": 0.949202686548233, "epoch": 4.839389152185361, "grad_norm": 0.31370067596435547, "learning_rate": 6.136748445411835e-05, "loss": 0.17531146109104156, "mean_token_accuracy": 0.9205900281667709, "num_tokens": 113363728.0, "step": 9190 }, { "entropy": 0.9522519260644913, "epoch": 4.839915745129015, "grad_norm": 0.31930145621299744, "learning_rate": 6.134903471062421e-05, "loss": 0.16543881595134735, "mean_token_accuracy": 0.9292179048061371, "num_tokens": 113376064.0, "step": 9191 }, { "entropy": 0.949477881193161, "epoch": 4.84044233807267, "grad_norm": 0.2924252450466156, "learning_rate": 6.133058785525431e-05, "loss": 0.1596398502588272, "mean_token_accuracy": 0.9307438880205154, "num_tokens": 113388400.0, "step": 9192 }, { "entropy": 0.9458207190036774, "epoch": 4.840968931016325, "grad_norm": 0.3245888650417328, "learning_rate": 6.131214388910374e-05, "loss": 0.17272739112377167, "mean_token_accuracy": 0.929176926612854, "num_tokens": 113400736.0, "step": 9193 }, { "entropy": 0.9470962882041931, "epoch": 4.841495523959979, "grad_norm": 0.334036648273468, "learning_rate": 6.129370281326738e-05, "loss": 0.18349584937095642, "mean_token_accuracy": 0.9212116599082947, "num_tokens": 113413072.0, "step": 9194 }, { "entropy": 0.963790088891983, "epoch": 4.8420221169036335, "grad_norm": 0.305763304233551, "learning_rate": 6.127526462884005e-05, "loss": 0.17330719530582428, "mean_token_accuracy": 0.9286128431558609, "num_tokens": 113425408.0, "step": 9195 }, { "entropy": 0.9783694744110107, "epoch": 4.842548709847288, "grad_norm": 0.3513582944869995, "learning_rate": 6.125682933691629e-05, "loss": 0.18046358227729797, "mean_token_accuracy": 0.9242364913225174, "num_tokens": 113437744.0, "step": 9196 }, { "entropy": 0.9755796492099762, "epoch": 4.843075302790942, "grad_norm": 0.32847991585731506, "learning_rate": 6.123839693859045e-05, "loss": 0.16616854071617126, "mean_token_accuracy": 0.9285303205251694, "num_tokens": 113450080.0, "step": 9197 }, { "entropy": 0.9715100824832916, "epoch": 4.843601895734597, "grad_norm": 0.32819437980651855, "learning_rate": 6.121996743495678e-05, "loss": 0.18121594190597534, "mean_token_accuracy": 0.9218470752239227, "num_tokens": 113462416.0, "step": 9198 }, { "entropy": 0.9456192255020142, "epoch": 4.844128488678252, "grad_norm": 0.3316733241081238, "learning_rate": 6.120154082710932e-05, "loss": 0.17713892459869385, "mean_token_accuracy": 0.9244439750909805, "num_tokens": 113474752.0, "step": 9199 }, { "entropy": 0.9350262731313705, "epoch": 4.844655081621906, "grad_norm": 0.3105098605155945, "learning_rate": 6.118311711614198e-05, "loss": 0.171644926071167, "mean_token_accuracy": 0.9325538128614426, "num_tokens": 113487088.0, "step": 9200 }, { "entropy": 0.9254423081874847, "epoch": 4.845181674565561, "grad_norm": 0.3185507655143738, "learning_rate": 6.11646963031484e-05, "loss": 0.15326949954032898, "mean_token_accuracy": 0.935181513428688, "num_tokens": 113499424.0, "step": 9201 }, { "entropy": 0.9758787006139755, "epoch": 4.845708267509215, "grad_norm": 0.34665438532829285, "learning_rate": 6.11462783892222e-05, "loss": 0.1998121738433838, "mean_token_accuracy": 0.9098737090826035, "num_tokens": 113511760.0, "step": 9202 }, { "entropy": 0.9731664806604385, "epoch": 4.84623486045287, "grad_norm": 0.30735206604003906, "learning_rate": 6.112786337545671e-05, "loss": 0.16850310564041138, "mean_token_accuracy": 0.9308719336986542, "num_tokens": 113524096.0, "step": 9203 }, { "entropy": 0.9057483524084091, "epoch": 4.846761453396525, "grad_norm": 0.2996695935726166, "learning_rate": 6.110945126294514e-05, "loss": 0.16708335280418396, "mean_token_accuracy": 0.929191917181015, "num_tokens": 113536432.0, "step": 9204 }, { "entropy": 0.9213566184043884, "epoch": 4.847288046340179, "grad_norm": 0.2910383641719818, "learning_rate": 6.109104205278049e-05, "loss": 0.1677648276090622, "mean_token_accuracy": 0.93411485850811, "num_tokens": 113548768.0, "step": 9205 }, { "entropy": 0.8875181376934052, "epoch": 4.8478146392838335, "grad_norm": 0.3171277642250061, "learning_rate": 6.10726357460556e-05, "loss": 0.17253826558589935, "mean_token_accuracy": 0.9264390170574188, "num_tokens": 113561104.0, "step": 9206 }, { "entropy": 0.9762510508298874, "epoch": 4.848341232227488, "grad_norm": 0.33811476826667786, "learning_rate": 6.10542323438632e-05, "loss": 0.17586681246757507, "mean_token_accuracy": 0.9236846566200256, "num_tokens": 113573440.0, "step": 9207 }, { "entropy": 0.978374108672142, "epoch": 4.848867825171142, "grad_norm": 0.31238728761672974, "learning_rate": 6.103583184729566e-05, "loss": 0.16370560228824615, "mean_token_accuracy": 0.9349195510149002, "num_tokens": 113585776.0, "step": 9208 }, { "entropy": 0.9273306876420975, "epoch": 4.849394418114797, "grad_norm": 0.30583444237709045, "learning_rate": 6.101743425744546e-05, "loss": 0.15903574228286743, "mean_token_accuracy": 0.9286919683218002, "num_tokens": 113598112.0, "step": 9209 }, { "entropy": 0.9907515197992325, "epoch": 4.849921011058452, "grad_norm": 0.3668973743915558, "learning_rate": 6.099903957540467e-05, "loss": 0.17592556774616241, "mean_token_accuracy": 0.9220422655344009, "num_tokens": 113610448.0, "step": 9210 }, { "entropy": 0.9322537630796432, "epoch": 4.850447604002106, "grad_norm": 0.33347219228744507, "learning_rate": 6.098064780226531e-05, "loss": 0.17654946446418762, "mean_token_accuracy": 0.9239524006843567, "num_tokens": 113622784.0, "step": 9211 }, { "entropy": 0.9455699473619461, "epoch": 4.850974196945761, "grad_norm": 0.290907621383667, "learning_rate": 6.09622589391192e-05, "loss": 0.16271138191223145, "mean_token_accuracy": 0.9278527349233627, "num_tokens": 113635120.0, "step": 9212 }, { "entropy": 0.912358745932579, "epoch": 4.851500789889416, "grad_norm": 0.28543636202812195, "learning_rate": 6.094387298705795e-05, "loss": 0.16902172565460205, "mean_token_accuracy": 0.9293874204158783, "num_tokens": 113647456.0, "step": 9213 }, { "entropy": 0.9107921272516251, "epoch": 4.85202738283307, "grad_norm": 0.28984534740448, "learning_rate": 6.092548994717303e-05, "loss": 0.16308516263961792, "mean_token_accuracy": 0.9295253306627274, "num_tokens": 113659792.0, "step": 9214 }, { "entropy": 0.9483311921358109, "epoch": 4.852553975776725, "grad_norm": 0.3155252933502197, "learning_rate": 6.0907109820555764e-05, "loss": 0.16149048507213593, "mean_token_accuracy": 0.9389007091522217, "num_tokens": 113672128.0, "step": 9215 }, { "entropy": 0.9115438163280487, "epoch": 4.8530805687203795, "grad_norm": 0.3140206038951874, "learning_rate": 6.088873260829724e-05, "loss": 0.16763517260551453, "mean_token_accuracy": 0.9338799566030502, "num_tokens": 113684464.0, "step": 9216 }, { "entropy": 0.9212208986282349, "epoch": 4.8536071616640335, "grad_norm": 0.3106561601161957, "learning_rate": 6.0870358311488415e-05, "loss": 0.16700613498687744, "mean_token_accuracy": 0.9301815181970596, "num_tokens": 113696800.0, "step": 9217 }, { "entropy": 0.9526770710945129, "epoch": 4.854133754607688, "grad_norm": 0.34409135580062866, "learning_rate": 6.0851986931220075e-05, "loss": 0.20234370231628418, "mean_token_accuracy": 0.9196347147226334, "num_tokens": 113709136.0, "step": 9218 }, { "entropy": 0.9145548343658447, "epoch": 4.854660347551343, "grad_norm": 0.3165554106235504, "learning_rate": 6.083361846858281e-05, "loss": 0.16674527525901794, "mean_token_accuracy": 0.9236103445291519, "num_tokens": 113721472.0, "step": 9219 }, { "entropy": 0.9819770008325577, "epoch": 4.855186940494997, "grad_norm": 0.3707553446292877, "learning_rate": 6.081525292466706e-05, "loss": 0.19176122546195984, "mean_token_accuracy": 0.9174077808856964, "num_tokens": 113733808.0, "step": 9220 }, { "entropy": 0.997324988245964, "epoch": 4.855713533438652, "grad_norm": 0.3498297333717346, "learning_rate": 6.079689030056308e-05, "loss": 0.19261667132377625, "mean_token_accuracy": 0.9157433807849884, "num_tokens": 113746144.0, "step": 9221 }, { "entropy": 0.944717675447464, "epoch": 4.856240126382307, "grad_norm": 0.2912974953651428, "learning_rate": 6.0778530597360895e-05, "loss": 0.1591337025165558, "mean_token_accuracy": 0.9307748228311539, "num_tokens": 113758480.0, "step": 9222 }, { "entropy": 0.9538642019033432, "epoch": 4.856766719325961, "grad_norm": 0.3185594379901886, "learning_rate": 6.07601738161505e-05, "loss": 0.1545395702123642, "mean_token_accuracy": 0.9348485469818115, "num_tokens": 113770816.0, "step": 9223 }, { "entropy": 0.9914166331291199, "epoch": 4.857293312269616, "grad_norm": 0.3420868515968323, "learning_rate": 6.074181995802159e-05, "loss": 0.18674421310424805, "mean_token_accuracy": 0.9197226315736771, "num_tokens": 113783152.0, "step": 9224 }, { "entropy": 0.9152809083461761, "epoch": 4.85781990521327, "grad_norm": 0.30477678775787354, "learning_rate": 6.072346902406375e-05, "loss": 0.1771145910024643, "mean_token_accuracy": 0.9249708354473114, "num_tokens": 113795488.0, "step": 9225 }, { "entropy": 0.9725821763277054, "epoch": 4.858346498156925, "grad_norm": 0.32783952355384827, "learning_rate": 6.070512101536637e-05, "loss": 0.16451381146907806, "mean_token_accuracy": 0.9245587736368179, "num_tokens": 113807824.0, "step": 9226 }, { "entropy": 0.9453549236059189, "epoch": 4.8588730911005795, "grad_norm": 0.3178243041038513, "learning_rate": 6.068677593301861e-05, "loss": 0.16712918877601624, "mean_token_accuracy": 0.9319606870412827, "num_tokens": 113820160.0, "step": 9227 }, { "entropy": 0.9540058225393295, "epoch": 4.8593996840442335, "grad_norm": 0.316835880279541, "learning_rate": 6.0668433778109545e-05, "loss": 0.16519233584403992, "mean_token_accuracy": 0.9322793334722519, "num_tokens": 113832496.0, "step": 9228 }, { "entropy": 1.006719246506691, "epoch": 4.859926276987888, "grad_norm": 0.358338326215744, "learning_rate": 6.065009455172801e-05, "loss": 0.17126135528087616, "mean_token_accuracy": 0.9240893870592117, "num_tokens": 113844832.0, "step": 9229 }, { "entropy": 1.0083835273981094, "epoch": 4.860452869931543, "grad_norm": 0.2907813489437103, "learning_rate": 6.0631758254962754e-05, "loss": 0.15603706240653992, "mean_token_accuracy": 0.9350569695234299, "num_tokens": 113857168.0, "step": 9230 }, { "entropy": 0.9859584420919418, "epoch": 4.860979462875197, "grad_norm": 0.3402427136898041, "learning_rate": 6.061342488890227e-05, "loss": 0.17818543314933777, "mean_token_accuracy": 0.9255679994821548, "num_tokens": 113869504.0, "step": 9231 }, { "entropy": 1.0371097922325134, "epoch": 4.861506055818852, "grad_norm": 0.32408174872398376, "learning_rate": 6.0595094454634915e-05, "loss": 0.16809692978858948, "mean_token_accuracy": 0.922844797372818, "num_tokens": 113881840.0, "step": 9232 }, { "entropy": 0.9761839061975479, "epoch": 4.862032648762507, "grad_norm": 0.3168609142303467, "learning_rate": 6.057676695324883e-05, "loss": 0.16999582946300507, "mean_token_accuracy": 0.9267615675926208, "num_tokens": 113894176.0, "step": 9233 }, { "entropy": 0.9961191415786743, "epoch": 4.862559241706161, "grad_norm": 0.31248804926872253, "learning_rate": 6.0558442385832047e-05, "loss": 0.16822709143161774, "mean_token_accuracy": 0.9302322715520859, "num_tokens": 113906512.0, "step": 9234 }, { "entropy": 0.9907224774360657, "epoch": 4.863085834649816, "grad_norm": 0.32921966910362244, "learning_rate": 6.054012075347237e-05, "loss": 0.1776476502418518, "mean_token_accuracy": 0.9271745085716248, "num_tokens": 113918848.0, "step": 9235 }, { "entropy": 0.9873936325311661, "epoch": 4.86361242759347, "grad_norm": 0.3174605071544647, "learning_rate": 6.052180205725745e-05, "loss": 0.1837022453546524, "mean_token_accuracy": 0.9242022931575775, "num_tokens": 113931184.0, "step": 9236 }, { "entropy": 0.9924033582210541, "epoch": 4.864139020537125, "grad_norm": 0.33693379163742065, "learning_rate": 6.050348629827476e-05, "loss": 0.18274997174739838, "mean_token_accuracy": 0.9257642328739166, "num_tokens": 113943520.0, "step": 9237 }, { "entropy": 0.9944822788238525, "epoch": 4.8646656134807795, "grad_norm": 0.32839271426200867, "learning_rate": 6.0485173477611604e-05, "loss": 0.17032325267791748, "mean_token_accuracy": 0.9244238436222076, "num_tokens": 113955856.0, "step": 9238 }, { "entropy": 0.9427923858165741, "epoch": 4.8651922064244335, "grad_norm": 0.2775003910064697, "learning_rate": 6.046686359635509e-05, "loss": 0.15462589263916016, "mean_token_accuracy": 0.9338415265083313, "num_tokens": 113968192.0, "step": 9239 }, { "entropy": 0.981944665312767, "epoch": 4.865718799368088, "grad_norm": 0.3248477280139923, "learning_rate": 6.0448556655592194e-05, "loss": 0.17406399548053741, "mean_token_accuracy": 0.9296783953905106, "num_tokens": 113980528.0, "step": 9240 }, { "entropy": 0.9421994984149933, "epoch": 4.866245392311743, "grad_norm": 0.33592692017555237, "learning_rate": 6.043025265640969e-05, "loss": 0.17528413236141205, "mean_token_accuracy": 0.9240370690822601, "num_tokens": 113992864.0, "step": 9241 }, { "entropy": 0.9783306866884232, "epoch": 4.866771985255397, "grad_norm": 0.31253552436828613, "learning_rate": 6.041195159989415e-05, "loss": 0.17901182174682617, "mean_token_accuracy": 0.9209093749523163, "num_tokens": 114005200.0, "step": 9242 }, { "entropy": 0.9683476388454437, "epoch": 4.867298578199052, "grad_norm": 0.3116768002510071, "learning_rate": 6.0393653487132004e-05, "loss": 0.17576105892658234, "mean_token_accuracy": 0.9291523545980453, "num_tokens": 114017536.0, "step": 9243 }, { "entropy": 0.9654994159936905, "epoch": 4.867825171142707, "grad_norm": 0.3077673316001892, "learning_rate": 6.037535831920955e-05, "loss": 0.17306140065193176, "mean_token_accuracy": 0.9240833222866058, "num_tokens": 114029872.0, "step": 9244 }, { "entropy": 0.9287323951721191, "epoch": 4.868351764086361, "grad_norm": 0.30974891781806946, "learning_rate": 6.035706609721288e-05, "loss": 0.1807565838098526, "mean_token_accuracy": 0.9256379753351212, "num_tokens": 114042208.0, "step": 9245 }, { "entropy": 0.986062690615654, "epoch": 4.868878357030016, "grad_norm": 0.2962946891784668, "learning_rate": 6.033877682222782e-05, "loss": 0.17127250134944916, "mean_token_accuracy": 0.9312177151441574, "num_tokens": 114054544.0, "step": 9246 }, { "entropy": 0.9835542589426041, "epoch": 4.869404949973671, "grad_norm": 0.30986228585243225, "learning_rate": 6.032049049534012e-05, "loss": 0.16538189351558685, "mean_token_accuracy": 0.9298783987760544, "num_tokens": 114066880.0, "step": 9247 }, { "entropy": 0.9464733898639679, "epoch": 4.869931542917325, "grad_norm": 0.3071298599243164, "learning_rate": 6.030220711763536e-05, "loss": 0.16907981038093567, "mean_token_accuracy": 0.9315258413553238, "num_tokens": 114079216.0, "step": 9248 }, { "entropy": 0.9497257322072983, "epoch": 4.8704581358609795, "grad_norm": 0.31876394152641296, "learning_rate": 6.0283926690198887e-05, "loss": 0.16890285909175873, "mean_token_accuracy": 0.9297789037227631, "num_tokens": 114091552.0, "step": 9249 }, { "entropy": 0.9604268223047256, "epoch": 4.870984728804634, "grad_norm": 0.3041291832923889, "learning_rate": 6.0265649214115904e-05, "loss": 0.16234137117862701, "mean_token_accuracy": 0.9319205433130264, "num_tokens": 114103888.0, "step": 9250 }, { "entropy": 0.9527145028114319, "epoch": 4.871511321748288, "grad_norm": 0.2935594916343689, "learning_rate": 6.024737469047147e-05, "loss": 0.15775327384471893, "mean_token_accuracy": 0.9312833100557327, "num_tokens": 114116224.0, "step": 9251 }, { "entropy": 0.9280911386013031, "epoch": 4.872037914691943, "grad_norm": 0.29950031638145447, "learning_rate": 6.0229103120350436e-05, "loss": 0.16385899484157562, "mean_token_accuracy": 0.9287741333246231, "num_tokens": 114128560.0, "step": 9252 }, { "entropy": 0.9573824107646942, "epoch": 4.872564507635598, "grad_norm": 0.3072300851345062, "learning_rate": 6.021083450483745e-05, "loss": 0.16058257222175598, "mean_token_accuracy": 0.9300986230373383, "num_tokens": 114140896.0, "step": 9253 }, { "entropy": 0.9535968005657196, "epoch": 4.873091100579252, "grad_norm": 0.3601013720035553, "learning_rate": 6.0192568845017025e-05, "loss": 0.19131764769554138, "mean_token_accuracy": 0.9160570949316025, "num_tokens": 114153232.0, "step": 9254 }, { "entropy": 0.9700489640235901, "epoch": 4.873617693522907, "grad_norm": 0.3587206304073334, "learning_rate": 6.0174306141973504e-05, "loss": 0.18195636570453644, "mean_token_accuracy": 0.9237683862447739, "num_tokens": 114165568.0, "step": 9255 }, { "entropy": 0.9935056418180466, "epoch": 4.874144286466562, "grad_norm": 0.31666064262390137, "learning_rate": 6.015604639679104e-05, "loss": 0.16849590837955475, "mean_token_accuracy": 0.9301074743270874, "num_tokens": 114177904.0, "step": 9256 }, { "entropy": 0.9813852608203888, "epoch": 4.874670879410216, "grad_norm": 0.34814703464508057, "learning_rate": 6.013778961055352e-05, "loss": 0.1790965497493744, "mean_token_accuracy": 0.926289826631546, "num_tokens": 114190240.0, "step": 9257 }, { "entropy": 0.9306141138076782, "epoch": 4.875197472353871, "grad_norm": 0.3174811899662018, "learning_rate": 6.011953578434486e-05, "loss": 0.1767577826976776, "mean_token_accuracy": 0.9272280782461166, "num_tokens": 114202576.0, "step": 9258 }, { "entropy": 0.932680755853653, "epoch": 4.875724065297525, "grad_norm": 0.30817291140556335, "learning_rate": 6.010128491924862e-05, "loss": 0.15768198668956757, "mean_token_accuracy": 0.9350852966308594, "num_tokens": 114214912.0, "step": 9259 }, { "entropy": 0.9436093419790268, "epoch": 4.8762506582411795, "grad_norm": 0.44346994161605835, "learning_rate": 6.008303701634827e-05, "loss": 0.19806651771068573, "mean_token_accuracy": 0.9160618036985397, "num_tokens": 114227248.0, "step": 9260 }, { "entropy": 0.9407719373703003, "epoch": 4.876777251184834, "grad_norm": 0.3240104615688324, "learning_rate": 6.006479207672708e-05, "loss": 0.17336773872375488, "mean_token_accuracy": 0.9298413693904877, "num_tokens": 114239584.0, "step": 9261 }, { "entropy": 0.9401187151670456, "epoch": 4.877303844128488, "grad_norm": 0.3415816128253937, "learning_rate": 6.0046550101468135e-05, "loss": 0.17950160801410675, "mean_token_accuracy": 0.925504520535469, "num_tokens": 114251920.0, "step": 9262 }, { "entropy": 0.9379282146692276, "epoch": 4.877830437072143, "grad_norm": 0.3367367684841156, "learning_rate": 6.002831109165435e-05, "loss": 0.17652186751365662, "mean_token_accuracy": 0.9250429421663284, "num_tokens": 114264256.0, "step": 9263 }, { "entropy": 0.9016122072935104, "epoch": 4.878357030015798, "grad_norm": 0.2723939120769501, "learning_rate": 6.001007504836848e-05, "loss": 0.13771790266036987, "mean_token_accuracy": 0.9420016556978226, "num_tokens": 114276592.0, "step": 9264 }, { "entropy": 0.916037529706955, "epoch": 4.878883622959452, "grad_norm": 0.32042205333709717, "learning_rate": 5.9991841972693107e-05, "loss": 0.17149311304092407, "mean_token_accuracy": 0.9224643856287003, "num_tokens": 114288928.0, "step": 9265 }, { "entropy": 0.9284915775060654, "epoch": 4.879410215903107, "grad_norm": 0.3282214403152466, "learning_rate": 5.99736118657106e-05, "loss": 0.17957088351249695, "mean_token_accuracy": 0.9195956438779831, "num_tokens": 114301264.0, "step": 9266 }, { "entropy": 0.9315703809261322, "epoch": 4.879936808846761, "grad_norm": 0.3315577507019043, "learning_rate": 5.995538472850317e-05, "loss": 0.17412766814231873, "mean_token_accuracy": 0.9253064095973969, "num_tokens": 114313600.0, "step": 9267 }, { "entropy": 0.915994867682457, "epoch": 4.880463401790416, "grad_norm": 0.30813804268836975, "learning_rate": 5.993716056215288e-05, "loss": 0.16539320349693298, "mean_token_accuracy": 0.9329143762588501, "num_tokens": 114325936.0, "step": 9268 }, { "entropy": 0.9077543020248413, "epoch": 4.880989994734071, "grad_norm": 0.30946749448776245, "learning_rate": 5.9918939367741577e-05, "loss": 0.16349415481090546, "mean_token_accuracy": 0.9320286363363266, "num_tokens": 114338272.0, "step": 9269 }, { "entropy": 0.9378580302000046, "epoch": 4.881516587677725, "grad_norm": 0.3118128478527069, "learning_rate": 5.990072114635095e-05, "loss": 0.1628214418888092, "mean_token_accuracy": 0.92903071641922, "num_tokens": 114350608.0, "step": 9270 }, { "entropy": 0.915115088224411, "epoch": 4.8820431806213795, "grad_norm": 0.3057735562324524, "learning_rate": 5.9882505899062456e-05, "loss": 0.14752550423145294, "mean_token_accuracy": 0.9344717413187027, "num_tokens": 114362944.0, "step": 9271 }, { "entropy": 0.9090307652950287, "epoch": 4.882569773565034, "grad_norm": 0.30963030457496643, "learning_rate": 5.9864293626957534e-05, "loss": 0.15232141315937042, "mean_token_accuracy": 0.9346283227205276, "num_tokens": 114375280.0, "step": 9272 }, { "entropy": 0.9352599084377289, "epoch": 4.883096366508688, "grad_norm": 0.3679341673851013, "learning_rate": 5.984608433111728e-05, "loss": 0.17839781939983368, "mean_token_accuracy": 0.9244855046272278, "num_tokens": 114387616.0, "step": 9273 }, { "entropy": 0.8894796818494797, "epoch": 4.883622959452343, "grad_norm": 0.2971315383911133, "learning_rate": 5.982787801262267e-05, "loss": 0.16099128127098083, "mean_token_accuracy": 0.9308123588562012, "num_tokens": 114399952.0, "step": 9274 }, { "entropy": 0.915225937962532, "epoch": 4.884149552395998, "grad_norm": 0.32512086629867554, "learning_rate": 5.9809674672554575e-05, "loss": 0.16589084267616272, "mean_token_accuracy": 0.9319024235010147, "num_tokens": 114412288.0, "step": 9275 }, { "entropy": 0.8668423146009445, "epoch": 4.884676145339652, "grad_norm": 0.3217252790927887, "learning_rate": 5.9791474311993514e-05, "loss": 0.16443023085594177, "mean_token_accuracy": 0.9309308081865311, "num_tokens": 114424624.0, "step": 9276 }, { "entropy": 0.906637892127037, "epoch": 4.885202738283307, "grad_norm": 0.35782021284103394, "learning_rate": 5.977327693201997e-05, "loss": 0.1807124763727188, "mean_token_accuracy": 0.9191261976957321, "num_tokens": 114436960.0, "step": 9277 }, { "entropy": 0.907283827662468, "epoch": 4.885729331226962, "grad_norm": 0.30407586693763733, "learning_rate": 5.9755082533714224e-05, "loss": 0.17008894681930542, "mean_token_accuracy": 0.9289335012435913, "num_tokens": 114449296.0, "step": 9278 }, { "entropy": 0.9228288233280182, "epoch": 4.886255924170616, "grad_norm": 0.3472314178943634, "learning_rate": 5.973689111815641e-05, "loss": 0.17782555520534515, "mean_token_accuracy": 0.9241014868021011, "num_tokens": 114461632.0, "step": 9279 }, { "entropy": 0.8673435002565384, "epoch": 4.886782517114271, "grad_norm": 0.29873529076576233, "learning_rate": 5.97187026864264e-05, "loss": 0.1670108437538147, "mean_token_accuracy": 0.9309113919734955, "num_tokens": 114473968.0, "step": 9280 }, { "entropy": 0.885276660323143, "epoch": 4.887309110057926, "grad_norm": 0.3258194029331207, "learning_rate": 5.9700517239603945e-05, "loss": 0.16862691938877106, "mean_token_accuracy": 0.9275283068418503, "num_tokens": 114486304.0, "step": 9281 }, { "entropy": 0.9040714204311371, "epoch": 4.8878357030015795, "grad_norm": 0.317599892616272, "learning_rate": 5.968233477876863e-05, "loss": 0.16430729627609253, "mean_token_accuracy": 0.9300103485584259, "num_tokens": 114498640.0, "step": 9282 }, { "entropy": 0.9044928401708603, "epoch": 4.888362295945234, "grad_norm": 0.3313135802745819, "learning_rate": 5.966415530499983e-05, "loss": 0.1630789339542389, "mean_token_accuracy": 0.9265755712985992, "num_tokens": 114510976.0, "step": 9283 }, { "entropy": 0.8958253413438797, "epoch": 4.888888888888889, "grad_norm": 0.32161232829093933, "learning_rate": 5.9645978819376736e-05, "loss": 0.1587880551815033, "mean_token_accuracy": 0.935462549328804, "num_tokens": 114523312.0, "step": 9284 }, { "entropy": 0.8946435302495956, "epoch": 4.889415481832543, "grad_norm": 0.3051639199256897, "learning_rate": 5.9627805322978405e-05, "loss": 0.16082033514976501, "mean_token_accuracy": 0.9311655312776566, "num_tokens": 114535648.0, "step": 9285 }, { "entropy": 0.8826522082090378, "epoch": 4.889942074776198, "grad_norm": 0.32270345091819763, "learning_rate": 5.960963481688366e-05, "loss": 0.16354745626449585, "mean_token_accuracy": 0.929367408156395, "num_tokens": 114547984.0, "step": 9286 }, { "entropy": 0.8944514393806458, "epoch": 4.890468667719853, "grad_norm": 0.3517097532749176, "learning_rate": 5.959146730217122e-05, "loss": 0.19123712182044983, "mean_token_accuracy": 0.9202098995447159, "num_tokens": 114560320.0, "step": 9287 }, { "entropy": 0.878686398267746, "epoch": 4.890995260663507, "grad_norm": 0.31580930948257446, "learning_rate": 5.957330277991956e-05, "loss": 0.16787363588809967, "mean_token_accuracy": 0.9280426502227783, "num_tokens": 114572656.0, "step": 9288 }, { "entropy": 0.9311894774436951, "epoch": 4.891521853607162, "grad_norm": 0.32805290818214417, "learning_rate": 5.9555141251207e-05, "loss": 0.17731031775474548, "mean_token_accuracy": 0.9237784296274185, "num_tokens": 114584992.0, "step": 9289 }, { "entropy": 0.9274815768003464, "epoch": 4.892048446550816, "grad_norm": 0.32746708393096924, "learning_rate": 5.9536982717111686e-05, "loss": 0.17079785466194153, "mean_token_accuracy": 0.9303460121154785, "num_tokens": 114597328.0, "step": 9290 }, { "entropy": 0.8722960203886032, "epoch": 4.892575039494471, "grad_norm": 0.31166478991508484, "learning_rate": 5.951882717871159e-05, "loss": 0.1584705412387848, "mean_token_accuracy": 0.9311783015727997, "num_tokens": 114609664.0, "step": 9291 }, { "entropy": 0.8913536667823792, "epoch": 4.893101632438126, "grad_norm": 0.33785316348075867, "learning_rate": 5.950067463708446e-05, "loss": 0.1690533310174942, "mean_token_accuracy": 0.9239986538887024, "num_tokens": 114622000.0, "step": 9292 }, { "entropy": 0.9379396438598633, "epoch": 4.8936282253817796, "grad_norm": 0.3421578109264374, "learning_rate": 5.9482525093307984e-05, "loss": 0.17159180343151093, "mean_token_accuracy": 0.9270720034837723, "num_tokens": 114634336.0, "step": 9293 }, { "entropy": 0.9428474754095078, "epoch": 4.894154818325434, "grad_norm": 0.3197522461414337, "learning_rate": 5.94643785484596e-05, "loss": 0.1563556045293808, "mean_token_accuracy": 0.9327787607908249, "num_tokens": 114646672.0, "step": 9294 }, { "entropy": 0.9069431126117706, "epoch": 4.894681411269089, "grad_norm": 0.2848811447620392, "learning_rate": 5.944623500361647e-05, "loss": 0.15425236523151398, "mean_token_accuracy": 0.9341136962175369, "num_tokens": 114659008.0, "step": 9295 }, { "entropy": 0.9342851489782333, "epoch": 4.895208004212743, "grad_norm": 0.3387324810028076, "learning_rate": 5.942809445985572e-05, "loss": 0.1770627349615097, "mean_token_accuracy": 0.9250018894672394, "num_tokens": 114671344.0, "step": 9296 }, { "entropy": 0.9041187316179276, "epoch": 4.895734597156398, "grad_norm": 0.3387044668197632, "learning_rate": 5.940995691825424e-05, "loss": 0.17872977256774902, "mean_token_accuracy": 0.9281503856182098, "num_tokens": 114683680.0, "step": 9297 }, { "entropy": 0.9258536696434021, "epoch": 4.896261190100053, "grad_norm": 0.3150176405906677, "learning_rate": 5.9391822379888764e-05, "loss": 0.16436132788658142, "mean_token_accuracy": 0.9273700267076492, "num_tokens": 114696016.0, "step": 9298 }, { "entropy": 0.9141188710927963, "epoch": 4.896787783043707, "grad_norm": 0.3235010802745819, "learning_rate": 5.9373690845835795e-05, "loss": 0.17278021574020386, "mean_token_accuracy": 0.9272926151752472, "num_tokens": 114708352.0, "step": 9299 }, { "entropy": 0.9123374670743942, "epoch": 4.897314375987362, "grad_norm": 0.3486504852771759, "learning_rate": 5.9355562317171766e-05, "loss": 0.17186430096626282, "mean_token_accuracy": 0.9291986376047134, "num_tokens": 114720688.0, "step": 9300 }, { "entropy": 0.8895768821239471, "epoch": 4.897840968931016, "grad_norm": 0.3237471878528595, "learning_rate": 5.933743679497281e-05, "loss": 0.1654815971851349, "mean_token_accuracy": 0.9295766353607178, "num_tokens": 114733024.0, "step": 9301 }, { "entropy": 0.9308163225650787, "epoch": 4.898367561874671, "grad_norm": 0.3276287913322449, "learning_rate": 5.9319314280314954e-05, "loss": 0.17924335598945618, "mean_token_accuracy": 0.9244420826435089, "num_tokens": 114745360.0, "step": 9302 }, { "entropy": 0.8628402054309845, "epoch": 4.898894154818326, "grad_norm": 0.2934078872203827, "learning_rate": 5.930119477427403e-05, "loss": 0.15336529910564423, "mean_token_accuracy": 0.9310443699359894, "num_tokens": 114757696.0, "step": 9303 }, { "entropy": 0.913166880607605, "epoch": 4.8994207477619796, "grad_norm": 0.2994149625301361, "learning_rate": 5.9283078277925654e-05, "loss": 0.1591852307319641, "mean_token_accuracy": 0.9312534183263779, "num_tokens": 114770032.0, "step": 9304 }, { "entropy": 0.9578994661569595, "epoch": 4.899947340705634, "grad_norm": 0.3304392397403717, "learning_rate": 5.9264964792345353e-05, "loss": 0.1748179942369461, "mean_token_accuracy": 0.921977162361145, "num_tokens": 114782368.0, "step": 9305 }, { "entropy": 0.9136923551559448, "epoch": 4.900473933649289, "grad_norm": 0.3101983368396759, "learning_rate": 5.9246854318608344e-05, "loss": 0.1654844731092453, "mean_token_accuracy": 0.9304972290992737, "num_tokens": 114794704.0, "step": 9306 }, { "entropy": 0.8925996571779251, "epoch": 4.901000526592943, "grad_norm": 0.33955803513526917, "learning_rate": 5.922874685778981e-05, "loss": 0.17222380638122559, "mean_token_accuracy": 0.9257993996143341, "num_tokens": 114807040.0, "step": 9307 }, { "entropy": 0.8864023834466934, "epoch": 4.901527119536598, "grad_norm": 0.3239210546016693, "learning_rate": 5.9210642410964645e-05, "loss": 0.17786379158496857, "mean_token_accuracy": 0.925503745675087, "num_tokens": 114819376.0, "step": 9308 }, { "entropy": 0.8842435479164124, "epoch": 4.902053712480253, "grad_norm": 0.33383238315582275, "learning_rate": 5.9192540979207637e-05, "loss": 0.1707066297531128, "mean_token_accuracy": 0.9289665967226028, "num_tokens": 114831712.0, "step": 9309 }, { "entropy": 0.9077869206666946, "epoch": 4.902580305423907, "grad_norm": 0.29188287258148193, "learning_rate": 5.917444256359332e-05, "loss": 0.16449929773807526, "mean_token_accuracy": 0.9325157999992371, "num_tokens": 114844048.0, "step": 9310 }, { "entropy": 0.9428171515464783, "epoch": 4.903106898367562, "grad_norm": 0.3549969792366028, "learning_rate": 5.9156347165196134e-05, "loss": 0.18001793324947357, "mean_token_accuracy": 0.9223020523786545, "num_tokens": 114856384.0, "step": 9311 }, { "entropy": 0.9449672996997833, "epoch": 4.903633491311217, "grad_norm": 0.31514841318130493, "learning_rate": 5.913825478509025e-05, "loss": 0.16791656613349915, "mean_token_accuracy": 0.9291617125272751, "num_tokens": 114868720.0, "step": 9312 }, { "entropy": 0.9265694469213486, "epoch": 4.904160084254871, "grad_norm": 0.30857884883880615, "learning_rate": 5.912016542434976e-05, "loss": 0.16086161136627197, "mean_token_accuracy": 0.9276047050952911, "num_tokens": 114881056.0, "step": 9313 }, { "entropy": 0.8907498270273209, "epoch": 4.904686677198526, "grad_norm": 0.32661426067352295, "learning_rate": 5.91020790840485e-05, "loss": 0.16189296543598175, "mean_token_accuracy": 0.932487428188324, "num_tokens": 114893392.0, "step": 9314 }, { "entropy": 0.9333143979310989, "epoch": 4.9052132701421804, "grad_norm": 0.32313498854637146, "learning_rate": 5.9083995765260134e-05, "loss": 0.174815833568573, "mean_token_accuracy": 0.9240923523902893, "num_tokens": 114905728.0, "step": 9315 }, { "entropy": 0.9181988686323166, "epoch": 4.905739863085834, "grad_norm": 0.3207535147666931, "learning_rate": 5.9065915469058177e-05, "loss": 0.1609046757221222, "mean_token_accuracy": 0.9294731467962265, "num_tokens": 114918064.0, "step": 9316 }, { "entropy": 0.9402085095643997, "epoch": 4.906266456029489, "grad_norm": 0.33442455530166626, "learning_rate": 5.904783819651597e-05, "loss": 0.17129158973693848, "mean_token_accuracy": 0.928265392780304, "num_tokens": 114930400.0, "step": 9317 }, { "entropy": 0.9600818157196045, "epoch": 4.906793048973144, "grad_norm": 0.3433302640914917, "learning_rate": 5.902976394870663e-05, "loss": 0.173824280500412, "mean_token_accuracy": 0.9248096644878387, "num_tokens": 114942736.0, "step": 9318 }, { "entropy": 0.9292252659797668, "epoch": 4.907319641916798, "grad_norm": 0.321300745010376, "learning_rate": 5.9011692726703116e-05, "loss": 0.17256402969360352, "mean_token_accuracy": 0.9269725978374481, "num_tokens": 114955072.0, "step": 9319 }, { "entropy": 0.8997122347354889, "epoch": 4.907846234860453, "grad_norm": 0.2938885986804962, "learning_rate": 5.8993624531578195e-05, "loss": 0.16067785024642944, "mean_token_accuracy": 0.932793065905571, "num_tokens": 114967408.0, "step": 9320 }, { "entropy": 0.9118629992008209, "epoch": 4.908372827804108, "grad_norm": 0.29671382904052734, "learning_rate": 5.897555936440453e-05, "loss": 0.1600441336631775, "mean_token_accuracy": 0.9317707270383835, "num_tokens": 114979744.0, "step": 9321 }, { "entropy": 0.9408626407384872, "epoch": 4.908899420747762, "grad_norm": 0.3658956289291382, "learning_rate": 5.895749722625452e-05, "loss": 0.1817052662372589, "mean_token_accuracy": 0.9241613149642944, "num_tokens": 114992080.0, "step": 9322 }, { "entropy": 0.877708300948143, "epoch": 4.909426013691417, "grad_norm": 0.33023250102996826, "learning_rate": 5.893943811820041e-05, "loss": 0.1727953851222992, "mean_token_accuracy": 0.9252429157495499, "num_tokens": 115004416.0, "step": 9323 }, { "entropy": 0.9067173004150391, "epoch": 4.909952606635071, "grad_norm": 0.35036468505859375, "learning_rate": 5.8921382041314275e-05, "loss": 0.16596205532550812, "mean_token_accuracy": 0.930809497833252, "num_tokens": 115016752.0, "step": 9324 }, { "entropy": 0.9250523298978806, "epoch": 4.910479199578726, "grad_norm": 0.32527902722358704, "learning_rate": 5.890332899666794e-05, "loss": 0.16674506664276123, "mean_token_accuracy": 0.9266581237316132, "num_tokens": 115029088.0, "step": 9325 }, { "entropy": 0.9385227710008621, "epoch": 4.9110057925223805, "grad_norm": 0.30357611179351807, "learning_rate": 5.8885278985333156e-05, "loss": 0.15314704179763794, "mean_token_accuracy": 0.9332702606916428, "num_tokens": 115041424.0, "step": 9326 }, { "entropy": 0.9614623934030533, "epoch": 4.911532385466034, "grad_norm": 0.35474637150764465, "learning_rate": 5.886723200838141e-05, "loss": 0.1641876995563507, "mean_token_accuracy": 0.9266858845949173, "num_tokens": 115053760.0, "step": 9327 }, { "entropy": 0.9489174485206604, "epoch": 4.912058978409689, "grad_norm": 0.3305496871471405, "learning_rate": 5.8849188066884106e-05, "loss": 0.15400606393814087, "mean_token_accuracy": 0.936336025595665, "num_tokens": 115066096.0, "step": 9328 }, { "entropy": 0.9381827712059021, "epoch": 4.912585571353344, "grad_norm": 0.34921711683273315, "learning_rate": 5.883114716191238e-05, "loss": 0.17779318988323212, "mean_token_accuracy": 0.9265210777521133, "num_tokens": 115078432.0, "step": 9329 }, { "entropy": 0.9520251005887985, "epoch": 4.913112164296998, "grad_norm": 0.3424340784549713, "learning_rate": 5.881310929453721e-05, "loss": 0.18406268954277039, "mean_token_accuracy": 0.9192226380109787, "num_tokens": 115090768.0, "step": 9330 }, { "entropy": 0.904927521944046, "epoch": 4.913638757240653, "grad_norm": 0.30872711539268494, "learning_rate": 5.879507446582939e-05, "loss": 0.15748125314712524, "mean_token_accuracy": 0.9327780157327652, "num_tokens": 115103104.0, "step": 9331 }, { "entropy": 0.9044003784656525, "epoch": 4.914165350184308, "grad_norm": 0.3096369504928589, "learning_rate": 5.877704267685956e-05, "loss": 0.16523298621177673, "mean_token_accuracy": 0.9302665144205093, "num_tokens": 115115440.0, "step": 9332 }, { "entropy": 0.9648252129554749, "epoch": 4.914691943127962, "grad_norm": 0.34394344687461853, "learning_rate": 5.875901392869816e-05, "loss": 0.18030229210853577, "mean_token_accuracy": 0.9267686456441879, "num_tokens": 115127776.0, "step": 9333 }, { "entropy": 0.9282388240098953, "epoch": 4.915218536071617, "grad_norm": 0.2991066575050354, "learning_rate": 5.874098822241545e-05, "loss": 0.14410465955734253, "mean_token_accuracy": 0.9370485544204712, "num_tokens": 115140112.0, "step": 9334 }, { "entropy": 0.9554052501916885, "epoch": 4.915745129015271, "grad_norm": 0.30297887325286865, "learning_rate": 5.87229655590815e-05, "loss": 0.1640850305557251, "mean_token_accuracy": 0.9307016283273697, "num_tokens": 115152448.0, "step": 9335 }, { "entropy": 0.9423719644546509, "epoch": 4.916271721958926, "grad_norm": 0.3117614984512329, "learning_rate": 5.8704945939766234e-05, "loss": 0.1675664633512497, "mean_token_accuracy": 0.9258502274751663, "num_tokens": 115164784.0, "step": 9336 }, { "entropy": 0.9139404147863388, "epoch": 4.9167983149025805, "grad_norm": 0.30298396944999695, "learning_rate": 5.868692936553935e-05, "loss": 0.16482360661029816, "mean_token_accuracy": 0.9292973428964615, "num_tokens": 115177120.0, "step": 9337 }, { "entropy": 0.9500172883272171, "epoch": 4.917324907846234, "grad_norm": 0.316505491733551, "learning_rate": 5.866891583747038e-05, "loss": 0.15865392982959747, "mean_token_accuracy": 0.9338560700416565, "num_tokens": 115189456.0, "step": 9338 }, { "entropy": 0.91290383040905, "epoch": 4.917851500789889, "grad_norm": 0.2912936806678772, "learning_rate": 5.865090535662871e-05, "loss": 0.15202707052230835, "mean_token_accuracy": 0.9352873414754868, "num_tokens": 115201792.0, "step": 9339 }, { "entropy": 0.9219886958599091, "epoch": 4.918378093733544, "grad_norm": 0.33818334341049194, "learning_rate": 5.863289792408351e-05, "loss": 0.17483165860176086, "mean_token_accuracy": 0.9254404604434967, "num_tokens": 115214128.0, "step": 9340 }, { "entropy": 0.9819406718015671, "epoch": 4.918904686677198, "grad_norm": 0.35899922251701355, "learning_rate": 5.861489354090373e-05, "loss": 0.19326823949813843, "mean_token_accuracy": 0.9183540940284729, "num_tokens": 115226464.0, "step": 9341 }, { "entropy": 0.9774647802114487, "epoch": 4.919431279620853, "grad_norm": 0.3061813712120056, "learning_rate": 5.859689220815826e-05, "loss": 0.15899212658405304, "mean_token_accuracy": 0.9301170408725739, "num_tokens": 115238800.0, "step": 9342 }, { "entropy": 0.9548447728157043, "epoch": 4.919957872564508, "grad_norm": 0.37087732553482056, "learning_rate": 5.8578893926915733e-05, "loss": 0.1835373044013977, "mean_token_accuracy": 0.9208451062440872, "num_tokens": 115251136.0, "step": 9343 }, { "entropy": 0.9868229180574417, "epoch": 4.920484465508162, "grad_norm": 0.4365648329257965, "learning_rate": 5.856089869824453e-05, "loss": 0.16759006679058075, "mean_token_accuracy": 0.9274678826332092, "num_tokens": 115263472.0, "step": 9344 }, { "entropy": 0.9716550260782242, "epoch": 4.921011058451817, "grad_norm": 0.3230785131454468, "learning_rate": 5.8542906523212985e-05, "loss": 0.15922094881534576, "mean_token_accuracy": 0.9334453046321869, "num_tokens": 115275808.0, "step": 9345 }, { "entropy": 0.9856964349746704, "epoch": 4.921537651395472, "grad_norm": 0.3701082766056061, "learning_rate": 5.852491740288913e-05, "loss": 0.19076339900493622, "mean_token_accuracy": 0.9177150577306747, "num_tokens": 115288144.0, "step": 9346 }, { "entropy": 0.9459339380264282, "epoch": 4.922064244339126, "grad_norm": 0.3227887451648712, "learning_rate": 5.850693133834093e-05, "loss": 0.1690850853919983, "mean_token_accuracy": 0.9287611097097397, "num_tokens": 115300480.0, "step": 9347 }, { "entropy": 0.9395811706781387, "epoch": 4.9225908372827805, "grad_norm": 0.3116438090801239, "learning_rate": 5.848894833063605e-05, "loss": 0.17614488303661346, "mean_token_accuracy": 0.9265125244855881, "num_tokens": 115312816.0, "step": 9348 }, { "entropy": 0.9723171889781952, "epoch": 4.923117430226435, "grad_norm": 0.3122919499874115, "learning_rate": 5.8470968380842116e-05, "loss": 0.16692239046096802, "mean_token_accuracy": 0.9280216097831726, "num_tokens": 115325152.0, "step": 9349 }, { "entropy": 0.9282762259244919, "epoch": 4.923644023170089, "grad_norm": 0.319529265165329, "learning_rate": 5.8452991490026456e-05, "loss": 0.17438848316669464, "mean_token_accuracy": 0.9270227700471878, "num_tokens": 115337488.0, "step": 9350 }, { "entropy": 0.9387772977352142, "epoch": 4.924170616113744, "grad_norm": 0.2963738441467285, "learning_rate": 5.843501765925625e-05, "loss": 0.14648286998271942, "mean_token_accuracy": 0.9406982809305191, "num_tokens": 115349824.0, "step": 9351 }, { "entropy": 0.9783714413642883, "epoch": 4.924697209057399, "grad_norm": 0.33284756541252136, "learning_rate": 5.841704688959851e-05, "loss": 0.1824008822441101, "mean_token_accuracy": 0.9226804673671722, "num_tokens": 115362160.0, "step": 9352 }, { "entropy": 1.0005029290914536, "epoch": 4.925223802001053, "grad_norm": 0.3474387228488922, "learning_rate": 5.839907918212004e-05, "loss": 0.17754733562469482, "mean_token_accuracy": 0.9215953201055527, "num_tokens": 115374496.0, "step": 9353 }, { "entropy": 0.9703384190797806, "epoch": 4.925750394944708, "grad_norm": 0.3040783107280731, "learning_rate": 5.8381114537887525e-05, "loss": 0.161107137799263, "mean_token_accuracy": 0.9309516549110413, "num_tokens": 115386832.0, "step": 9354 }, { "entropy": 0.9523343741893768, "epoch": 4.926276987888363, "grad_norm": 0.3469637334346771, "learning_rate": 5.8363152957967307e-05, "loss": 0.17863255739212036, "mean_token_accuracy": 0.9232510924339294, "num_tokens": 115399168.0, "step": 9355 }, { "entropy": 0.9407844543457031, "epoch": 4.926803580832017, "grad_norm": 0.30398619174957275, "learning_rate": 5.834519444342577e-05, "loss": 0.16317002475261688, "mean_token_accuracy": 0.9284565448760986, "num_tokens": 115411504.0, "step": 9356 }, { "entropy": 0.9656679928302765, "epoch": 4.927330173775672, "grad_norm": 0.30141156911849976, "learning_rate": 5.832723899532897e-05, "loss": 0.14263194799423218, "mean_token_accuracy": 0.9430341720581055, "num_tokens": 115423840.0, "step": 9357 }, { "entropy": 0.9619395136833191, "epoch": 4.927856766719326, "grad_norm": 0.32897594571113586, "learning_rate": 5.830928661474282e-05, "loss": 0.187732994556427, "mean_token_accuracy": 0.9198961853981018, "num_tokens": 115436176.0, "step": 9358 }, { "entropy": 0.9617651253938675, "epoch": 4.9283833596629805, "grad_norm": 0.31268131732940674, "learning_rate": 5.829133730273306e-05, "loss": 0.17076878249645233, "mean_token_accuracy": 0.9300666600465775, "num_tokens": 115448512.0, "step": 9359 }, { "entropy": 1.0081706196069717, "epoch": 4.928909952606635, "grad_norm": 0.3417055308818817, "learning_rate": 5.827339106036521e-05, "loss": 0.18210983276367188, "mean_token_accuracy": 0.9194571822881699, "num_tokens": 115460848.0, "step": 9360 }, { "entropy": 0.9907486289739609, "epoch": 4.929436545550289, "grad_norm": 0.3143501579761505, "learning_rate": 5.825544788870465e-05, "loss": 0.1710372418165207, "mean_token_accuracy": 0.9332590699195862, "num_tokens": 115473184.0, "step": 9361 }, { "entropy": 0.9614686220884323, "epoch": 4.929963138493944, "grad_norm": 0.3213489353656769, "learning_rate": 5.823750778881657e-05, "loss": 0.16459202766418457, "mean_token_accuracy": 0.9330161213874817, "num_tokens": 115485520.0, "step": 9362 }, { "entropy": 0.9386411756277084, "epoch": 4.930489731437599, "grad_norm": 0.29499050974845886, "learning_rate": 5.821957076176594e-05, "loss": 0.16460591554641724, "mean_token_accuracy": 0.9271390736103058, "num_tokens": 115497856.0, "step": 9363 }, { "entropy": 0.967206209897995, "epoch": 4.931016324381253, "grad_norm": 0.32410702109336853, "learning_rate": 5.820163680861761e-05, "loss": 0.17515471577644348, "mean_token_accuracy": 0.9262986332178116, "num_tokens": 115510192.0, "step": 9364 }, { "entropy": 0.997588574886322, "epoch": 4.931542917324908, "grad_norm": 0.32928773760795593, "learning_rate": 5.8183705930436186e-05, "loss": 0.172166645526886, "mean_token_accuracy": 0.9269043803215027, "num_tokens": 115522528.0, "step": 9365 }, { "entropy": 0.9945474416017532, "epoch": 4.932069510268563, "grad_norm": 0.3223489820957184, "learning_rate": 5.816577812828614e-05, "loss": 0.1568552851676941, "mean_token_accuracy": 0.9318364411592484, "num_tokens": 115534864.0, "step": 9366 }, { "entropy": 0.9689517766237259, "epoch": 4.932596103212217, "grad_norm": 0.3623938262462616, "learning_rate": 5.814785340323173e-05, "loss": 0.179118812084198, "mean_token_accuracy": 0.9249956458806992, "num_tokens": 115547200.0, "step": 9367 }, { "entropy": 0.9781549423933029, "epoch": 4.933122696155872, "grad_norm": 0.3357399106025696, "learning_rate": 5.8129931756337056e-05, "loss": 0.16774648427963257, "mean_token_accuracy": 0.9244172424077988, "num_tokens": 115559536.0, "step": 9368 }, { "entropy": 0.9704612046480179, "epoch": 4.933649289099526, "grad_norm": 0.32363811135292053, "learning_rate": 5.811201318866597e-05, "loss": 0.1788511425256729, "mean_token_accuracy": 0.9203287065029144, "num_tokens": 115571872.0, "step": 9369 }, { "entropy": 0.9416558891534805, "epoch": 4.9341758820431805, "grad_norm": 0.2980855405330658, "learning_rate": 5.809409770128227e-05, "loss": 0.16315722465515137, "mean_token_accuracy": 0.9311324954032898, "num_tokens": 115584208.0, "step": 9370 }, { "entropy": 0.9185937494039536, "epoch": 4.934702474986835, "grad_norm": 0.31508633494377136, "learning_rate": 5.807618529524945e-05, "loss": 0.15790027379989624, "mean_token_accuracy": 0.9321376830339432, "num_tokens": 115596544.0, "step": 9371 }, { "entropy": 0.9664212763309479, "epoch": 4.935229067930489, "grad_norm": 0.3180954158306122, "learning_rate": 5.8058275971630915e-05, "loss": 0.17068061232566833, "mean_token_accuracy": 0.9232131242752075, "num_tokens": 115608880.0, "step": 9372 }, { "entropy": 0.9768130630254745, "epoch": 4.935755660874144, "grad_norm": 0.34208452701568604, "learning_rate": 5.804036973148976e-05, "loss": 0.162981778383255, "mean_token_accuracy": 0.9295215010643005, "num_tokens": 115621216.0, "step": 9373 }, { "entropy": 0.9430342763662338, "epoch": 4.936282253817799, "grad_norm": 0.3556082546710968, "learning_rate": 5.802246657588901e-05, "loss": 0.17354175448417664, "mean_token_accuracy": 0.928137943148613, "num_tokens": 115633552.0, "step": 9374 }, { "entropy": 0.881765827536583, "epoch": 4.936808846761453, "grad_norm": 0.29666128754615784, "learning_rate": 5.8004566505891475e-05, "loss": 0.15805462002754211, "mean_token_accuracy": 0.9287291318178177, "num_tokens": 115645888.0, "step": 9375 }, { "entropy": 0.9361718595027924, "epoch": 4.937335439705108, "grad_norm": 0.3010590970516205, "learning_rate": 5.798666952255976e-05, "loss": 0.16552048921585083, "mean_token_accuracy": 0.9276218116283417, "num_tokens": 115658224.0, "step": 9376 }, { "entropy": 0.9072093516588211, "epoch": 4.937862032648763, "grad_norm": 0.3231160640716553, "learning_rate": 5.796877562695633e-05, "loss": 0.16154517233371735, "mean_token_accuracy": 0.9288052469491959, "num_tokens": 115670560.0, "step": 9377 }, { "entropy": 0.9381129592657089, "epoch": 4.938388625592417, "grad_norm": 0.35191112756729126, "learning_rate": 5.795088482014342e-05, "loss": 0.17764237523078918, "mean_token_accuracy": 0.9273613542318344, "num_tokens": 115682896.0, "step": 9378 }, { "entropy": 0.9498243778944016, "epoch": 4.938915218536072, "grad_norm": 0.3514261245727539, "learning_rate": 5.793299710318314e-05, "loss": 0.18616883456707, "mean_token_accuracy": 0.9251926690340042, "num_tokens": 115695232.0, "step": 9379 }, { "entropy": 0.9347743093967438, "epoch": 4.9394418114797265, "grad_norm": 0.33045297861099243, "learning_rate": 5.7915112477137335e-05, "loss": 0.17543768882751465, "mean_token_accuracy": 0.9261060506105423, "num_tokens": 115707568.0, "step": 9380 }, { "entropy": 0.9594391584396362, "epoch": 4.9399684044233805, "grad_norm": 0.3461679518222809, "learning_rate": 5.7897230943067734e-05, "loss": 0.1716955453157425, "mean_token_accuracy": 0.9220835864543915, "num_tokens": 115719904.0, "step": 9381 }, { "entropy": 0.912274107336998, "epoch": 4.940494997367035, "grad_norm": 0.3083917498588562, "learning_rate": 5.787935250203585e-05, "loss": 0.1601388305425644, "mean_token_accuracy": 0.9297442883253098, "num_tokens": 115732240.0, "step": 9382 }, { "entropy": 0.913392573595047, "epoch": 4.94102159031069, "grad_norm": 0.3031776547431946, "learning_rate": 5.786147715510306e-05, "loss": 0.1611706018447876, "mean_token_accuracy": 0.9329336583614349, "num_tokens": 115744576.0, "step": 9383 }, { "entropy": 0.9634020626544952, "epoch": 4.941548183254344, "grad_norm": 0.3595740497112274, "learning_rate": 5.784360490333042e-05, "loss": 0.1803797483444214, "mean_token_accuracy": 0.9214609563350677, "num_tokens": 115756912.0, "step": 9384 }, { "entropy": 0.9271872788667679, "epoch": 4.942074776197999, "grad_norm": 0.33162611722946167, "learning_rate": 5.782573574777899e-05, "loss": 0.16804532706737518, "mean_token_accuracy": 0.9263215363025665, "num_tokens": 115769248.0, "step": 9385 }, { "entropy": 0.92726831138134, "epoch": 4.942601369141654, "grad_norm": 0.32566916942596436, "learning_rate": 5.7807869689509554e-05, "loss": 0.18525749444961548, "mean_token_accuracy": 0.9209079444408417, "num_tokens": 115781584.0, "step": 9386 }, { "entropy": 0.9415363818407059, "epoch": 4.943127962085308, "grad_norm": 0.3226025104522705, "learning_rate": 5.779000672958268e-05, "loss": 0.16038167476654053, "mean_token_accuracy": 0.9302356839179993, "num_tokens": 115793920.0, "step": 9387 }, { "entropy": 0.9243748486042023, "epoch": 4.943654555028963, "grad_norm": 0.32364335656166077, "learning_rate": 5.777214686905881e-05, "loss": 0.157021626830101, "mean_token_accuracy": 0.9371575564146042, "num_tokens": 115806256.0, "step": 9388 }, { "entropy": 0.9075966626405716, "epoch": 4.944181147972618, "grad_norm": 0.30498507618904114, "learning_rate": 5.7754290108998175e-05, "loss": 0.15704648196697235, "mean_token_accuracy": 0.9347554445266724, "num_tokens": 115818592.0, "step": 9389 }, { "entropy": 0.9089589267969131, "epoch": 4.944707740916272, "grad_norm": 0.31486794352531433, "learning_rate": 5.773643645046083e-05, "loss": 0.17221665382385254, "mean_token_accuracy": 0.9295891523361206, "num_tokens": 115830928.0, "step": 9390 }, { "entropy": 0.922472670674324, "epoch": 4.9452343338599265, "grad_norm": 0.3181609511375427, "learning_rate": 5.771858589450663e-05, "loss": 0.16150923073291779, "mean_token_accuracy": 0.9333121627569199, "num_tokens": 115843264.0, "step": 9391 }, { "entropy": 0.915450856089592, "epoch": 4.9457609268035805, "grad_norm": 0.28799742460250854, "learning_rate": 5.7700738442195256e-05, "loss": 0.15151140093803406, "mean_token_accuracy": 0.9380517452955246, "num_tokens": 115855600.0, "step": 9392 }, { "entropy": 0.9430654495954514, "epoch": 4.946287519747235, "grad_norm": 0.3145394027233124, "learning_rate": 5.7682894094586224e-05, "loss": 0.16287337243556976, "mean_token_accuracy": 0.9282755255699158, "num_tokens": 115867936.0, "step": 9393 }, { "entropy": 0.9298929274082184, "epoch": 4.94681411269089, "grad_norm": 0.3063369691371918, "learning_rate": 5.7665052852738846e-05, "loss": 0.16224738955497742, "mean_token_accuracy": 0.93083256483078, "num_tokens": 115880272.0, "step": 9394 }, { "entropy": 0.8956407159566879, "epoch": 4.947340705634544, "grad_norm": 0.32702919840812683, "learning_rate": 5.764721471771224e-05, "loss": 0.1812189370393753, "mean_token_accuracy": 0.923660010099411, "num_tokens": 115892608.0, "step": 9395 }, { "entropy": 0.9093689769506454, "epoch": 4.947867298578199, "grad_norm": 0.3080686032772064, "learning_rate": 5.762937969056538e-05, "loss": 0.15826645493507385, "mean_token_accuracy": 0.9359744638204575, "num_tokens": 115904944.0, "step": 9396 }, { "entropy": 0.9180983453989029, "epoch": 4.948393891521854, "grad_norm": 0.30890801548957825, "learning_rate": 5.7611547772357e-05, "loss": 0.17149624228477478, "mean_token_accuracy": 0.9241906851530075, "num_tokens": 115917280.0, "step": 9397 }, { "entropy": 0.8848812580108643, "epoch": 4.948920484465508, "grad_norm": 0.3318977952003479, "learning_rate": 5.759371896414565e-05, "loss": 0.18148359656333923, "mean_token_accuracy": 0.9215588569641113, "num_tokens": 115929616.0, "step": 9398 }, { "entropy": 0.9263090342283249, "epoch": 4.949447077409163, "grad_norm": 0.3431561589241028, "learning_rate": 5.7575893266989785e-05, "loss": 0.17720580101013184, "mean_token_accuracy": 0.9285667836666107, "num_tokens": 115941952.0, "step": 9399 }, { "entropy": 0.8653641939163208, "epoch": 4.949973670352818, "grad_norm": 0.3527938723564148, "learning_rate": 5.755807068194759e-05, "loss": 0.1529770791530609, "mean_token_accuracy": 0.9344857335090637, "num_tokens": 115954288.0, "step": 9400 }, { "entropy": 0.8993526250123978, "epoch": 4.950500263296472, "grad_norm": 0.3243945240974426, "learning_rate": 5.754025121007709e-05, "loss": 0.16913282871246338, "mean_token_accuracy": 0.9260164946317673, "num_tokens": 115966624.0, "step": 9401 }, { "entropy": 0.8799459934234619, "epoch": 4.9510268562401265, "grad_norm": 0.29280006885528564, "learning_rate": 5.7522434852436146e-05, "loss": 0.16644714772701263, "mean_token_accuracy": 0.9297489523887634, "num_tokens": 115978960.0, "step": 9402 }, { "entropy": 0.9246260076761246, "epoch": 4.9515534491837805, "grad_norm": 0.3270162045955658, "learning_rate": 5.7504621610082354e-05, "loss": 0.1706567257642746, "mean_token_accuracy": 0.9282507449388504, "num_tokens": 115991296.0, "step": 9403 }, { "entropy": 0.9047050178050995, "epoch": 4.952080042127435, "grad_norm": 0.32847970724105835, "learning_rate": 5.74868114840732e-05, "loss": 0.1750563681125641, "mean_token_accuracy": 0.9257060140371323, "num_tokens": 116003632.0, "step": 9404 }, { "entropy": 0.9128126055002213, "epoch": 4.95260663507109, "grad_norm": 0.31370076537132263, "learning_rate": 5.7469004475465945e-05, "loss": 0.16696500778198242, "mean_token_accuracy": 0.9307531118392944, "num_tokens": 116015968.0, "step": 9405 }, { "entropy": 0.9282513111829758, "epoch": 4.953133228014744, "grad_norm": 0.29254990816116333, "learning_rate": 5.745120058531777e-05, "loss": 0.14533621072769165, "mean_token_accuracy": 0.9334218353033066, "num_tokens": 116028304.0, "step": 9406 }, { "entropy": 0.8847913295030594, "epoch": 4.953659820958399, "grad_norm": 0.31924283504486084, "learning_rate": 5.743339981468553e-05, "loss": 0.168746680021286, "mean_token_accuracy": 0.930860698223114, "num_tokens": 116040640.0, "step": 9407 }, { "entropy": 0.8906414955854416, "epoch": 4.954186413902054, "grad_norm": 0.31640809774398804, "learning_rate": 5.741560216462596e-05, "loss": 0.17188094556331635, "mean_token_accuracy": 0.9263556897640228, "num_tokens": 116052976.0, "step": 9408 }, { "entropy": 0.8946892470121384, "epoch": 4.954713006845708, "grad_norm": 0.3183387815952301, "learning_rate": 5.73978076361956e-05, "loss": 0.16452908515930176, "mean_token_accuracy": 0.9298630207777023, "num_tokens": 116065312.0, "step": 9409 }, { "entropy": 0.9338386058807373, "epoch": 4.955239599789363, "grad_norm": 0.3612841069698334, "learning_rate": 5.738001623045082e-05, "loss": 0.18146231770515442, "mean_token_accuracy": 0.9221067875623703, "num_tokens": 116077648.0, "step": 9410 }, { "entropy": 0.9196339249610901, "epoch": 4.955766192733018, "grad_norm": 0.3265555500984192, "learning_rate": 5.736222794844779e-05, "loss": 0.17468717694282532, "mean_token_accuracy": 0.9233785420656204, "num_tokens": 116089984.0, "step": 9411 }, { "entropy": 0.9070274978876114, "epoch": 4.956292785676672, "grad_norm": 0.3427065908908844, "learning_rate": 5.734444279124247e-05, "loss": 0.1812526136636734, "mean_token_accuracy": 0.9283244758844376, "num_tokens": 116102320.0, "step": 9412 }, { "entropy": 0.9212836623191833, "epoch": 4.9568193786203265, "grad_norm": 0.33548495173454285, "learning_rate": 5.732666075989069e-05, "loss": 0.16622008383274078, "mean_token_accuracy": 0.9248946905136108, "num_tokens": 116114656.0, "step": 9413 }, { "entropy": 0.884115681052208, "epoch": 4.957345971563981, "grad_norm": 0.3081040680408478, "learning_rate": 5.730888185544807e-05, "loss": 0.1468859314918518, "mean_token_accuracy": 0.9315646439790726, "num_tokens": 116126992.0, "step": 9414 }, { "entropy": 0.9673860967159271, "epoch": 4.957872564507635, "grad_norm": 0.37031683325767517, "learning_rate": 5.7291106078970014e-05, "loss": 0.18177001178264618, "mean_token_accuracy": 0.9270854294300079, "num_tokens": 116139328.0, "step": 9415 }, { "entropy": 0.9081185907125473, "epoch": 4.95839915745129, "grad_norm": 0.32079094648361206, "learning_rate": 5.7273333431511776e-05, "loss": 0.16575801372528076, "mean_token_accuracy": 0.9265887588262558, "num_tokens": 116151664.0, "step": 9416 }, { "entropy": 0.8875092566013336, "epoch": 4.958925750394945, "grad_norm": 0.3274156153202057, "learning_rate": 5.725556391412843e-05, "loss": 0.1604728102684021, "mean_token_accuracy": 0.9308022409677505, "num_tokens": 116164000.0, "step": 9417 }, { "entropy": 0.9134371280670166, "epoch": 4.959452343338599, "grad_norm": 0.31842270493507385, "learning_rate": 5.7237797527874824e-05, "loss": 0.16845707595348358, "mean_token_accuracy": 0.9241103827953339, "num_tokens": 116176336.0, "step": 9418 }, { "entropy": 0.9297776818275452, "epoch": 4.959978936282254, "grad_norm": 0.31639397144317627, "learning_rate": 5.722003427380562e-05, "loss": 0.1701333224773407, "mean_token_accuracy": 0.92668816447258, "num_tokens": 116188672.0, "step": 9419 }, { "entropy": 0.9101113528013229, "epoch": 4.960505529225909, "grad_norm": 0.3030407726764679, "learning_rate": 5.720227415297541e-05, "loss": 0.1549828201532364, "mean_token_accuracy": 0.9333423227071762, "num_tokens": 116201008.0, "step": 9420 }, { "entropy": 0.9348535239696503, "epoch": 4.961032122169563, "grad_norm": 0.29994162917137146, "learning_rate": 5.718451716643849e-05, "loss": 0.15588951110839844, "mean_token_accuracy": 0.9349348545074463, "num_tokens": 116213344.0, "step": 9421 }, { "entropy": 0.9469076693058014, "epoch": 4.961558715113218, "grad_norm": 0.3399045765399933, "learning_rate": 5.716676331524891e-05, "loss": 0.17242883145809174, "mean_token_accuracy": 0.9294859617948532, "num_tokens": 116225680.0, "step": 9422 }, { "entropy": 0.9611606448888779, "epoch": 4.9620853080568725, "grad_norm": 0.3694673478603363, "learning_rate": 5.714901260046064e-05, "loss": 0.18450355529785156, "mean_token_accuracy": 0.918832927942276, "num_tokens": 116238016.0, "step": 9423 }, { "entropy": 0.9355585128068924, "epoch": 4.9626119010005265, "grad_norm": 0.29991161823272705, "learning_rate": 5.713126502312748e-05, "loss": 0.1599108874797821, "mean_token_accuracy": 0.9283605962991714, "num_tokens": 116250352.0, "step": 9424 }, { "entropy": 0.9244567900896072, "epoch": 4.963138493944181, "grad_norm": 0.3170728087425232, "learning_rate": 5.711352058430295e-05, "loss": 0.1609768271446228, "mean_token_accuracy": 0.9301342666149139, "num_tokens": 116262688.0, "step": 9425 }, { "entropy": 0.8927604705095291, "epoch": 4.963665086887835, "grad_norm": 0.3002975583076477, "learning_rate": 5.709577928504044e-05, "loss": 0.1746864914894104, "mean_token_accuracy": 0.9230528324842453, "num_tokens": 116275024.0, "step": 9426 }, { "entropy": 0.9116622805595398, "epoch": 4.96419167983149, "grad_norm": 0.33546826243400574, "learning_rate": 5.707804112639319e-05, "loss": 0.16620329022407532, "mean_token_accuracy": 0.9282449781894684, "num_tokens": 116287360.0, "step": 9427 }, { "entropy": 0.9299652725458145, "epoch": 4.964718272775145, "grad_norm": 0.31117022037506104, "learning_rate": 5.7060306109414196e-05, "loss": 0.16363778710365295, "mean_token_accuracy": 0.9270086139440536, "num_tokens": 116299696.0, "step": 9428 }, { "entropy": 0.9201690256595612, "epoch": 4.965244865718799, "grad_norm": 0.3294250965118408, "learning_rate": 5.7042574235156266e-05, "loss": 0.1854371726512909, "mean_token_accuracy": 0.9225277602672577, "num_tokens": 116312032.0, "step": 9429 }, { "entropy": 0.8899281024932861, "epoch": 4.965771458662454, "grad_norm": 0.2941740155220032, "learning_rate": 5.702484550467204e-05, "loss": 0.16896389424800873, "mean_token_accuracy": 0.922933891415596, "num_tokens": 116324368.0, "step": 9430 }, { "entropy": 0.9170496612787247, "epoch": 4.966298051606109, "grad_norm": 0.3286184072494507, "learning_rate": 5.7007119919013974e-05, "loss": 0.18167276680469513, "mean_token_accuracy": 0.9213146716356277, "num_tokens": 116336704.0, "step": 9431 }, { "entropy": 0.9412564933300018, "epoch": 4.966824644549763, "grad_norm": 0.36381611227989197, "learning_rate": 5.6989397479234374e-05, "loss": 0.18499529361724854, "mean_token_accuracy": 0.9203563630580902, "num_tokens": 116349040.0, "step": 9432 }, { "entropy": 0.8793033510446548, "epoch": 4.967351237493418, "grad_norm": 0.2695026993751526, "learning_rate": 5.6971678186385204e-05, "loss": 0.14900889992713928, "mean_token_accuracy": 0.9365333318710327, "num_tokens": 116361376.0, "step": 9433 }, { "entropy": 0.8892877399921417, "epoch": 4.967877830437072, "grad_norm": 0.3132728338241577, "learning_rate": 5.695396204151846e-05, "loss": 0.1662237048149109, "mean_token_accuracy": 0.930364578962326, "num_tokens": 116373712.0, "step": 9434 }, { "entropy": 0.9384078681468964, "epoch": 4.9684044233807265, "grad_norm": 0.3141588866710663, "learning_rate": 5.693624904568582e-05, "loss": 0.16861280798912048, "mean_token_accuracy": 0.9259446710348129, "num_tokens": 116386048.0, "step": 9435 }, { "entropy": 0.8881506472826004, "epoch": 4.968931016324381, "grad_norm": 0.29548725485801697, "learning_rate": 5.6918539199938794e-05, "loss": 0.1610819697380066, "mean_token_accuracy": 0.9345932602882385, "num_tokens": 116398384.0, "step": 9436 }, { "entropy": 0.920554518699646, "epoch": 4.969457609268035, "grad_norm": 0.33068493008613586, "learning_rate": 5.690083250532869e-05, "loss": 0.17839539051055908, "mean_token_accuracy": 0.9240716248750687, "num_tokens": 116410720.0, "step": 9437 }, { "entropy": 0.9246425628662109, "epoch": 4.96998420221169, "grad_norm": 0.3303989768028259, "learning_rate": 5.688312896290671e-05, "loss": 0.1687246561050415, "mean_token_accuracy": 0.9263402670621872, "num_tokens": 116423056.0, "step": 9438 }, { "entropy": 0.9381060898303986, "epoch": 4.970510795155345, "grad_norm": 0.3343820571899414, "learning_rate": 5.6865428573723756e-05, "loss": 0.18233567476272583, "mean_token_accuracy": 0.9212479740381241, "num_tokens": 116435392.0, "step": 9439 }, { "entropy": 0.9213667809963226, "epoch": 4.971037388098999, "grad_norm": 0.2734557092189789, "learning_rate": 5.6847731338830614e-05, "loss": 0.15063132345676422, "mean_token_accuracy": 0.9358962327241898, "num_tokens": 116447728.0, "step": 9440 }, { "entropy": 0.890294760465622, "epoch": 4.971563981042654, "grad_norm": 0.34502044320106506, "learning_rate": 5.683003725927788e-05, "loss": 0.18147170543670654, "mean_token_accuracy": 0.925027921795845, "num_tokens": 116460064.0, "step": 9441 }, { "entropy": 0.9339338093996048, "epoch": 4.972090573986309, "grad_norm": 0.33315202593803406, "learning_rate": 5.681234633611593e-05, "loss": 0.17026439309120178, "mean_token_accuracy": 0.923798143863678, "num_tokens": 116472400.0, "step": 9442 }, { "entropy": 0.9210115224123001, "epoch": 4.972617166929963, "grad_norm": 0.33159175515174866, "learning_rate": 5.679465857039497e-05, "loss": 0.1778094321489334, "mean_token_accuracy": 0.9244426190853119, "num_tokens": 116484736.0, "step": 9443 }, { "entropy": 0.9362052083015442, "epoch": 4.973143759873618, "grad_norm": 0.3639310598373413, "learning_rate": 5.6776973963165035e-05, "loss": 0.19108359515666962, "mean_token_accuracy": 0.9217455983161926, "num_tokens": 116497072.0, "step": 9444 }, { "entropy": 0.9329159706830978, "epoch": 4.9736703528172725, "grad_norm": 0.3310304582118988, "learning_rate": 5.6759292515475936e-05, "loss": 0.16485299170017242, "mean_token_accuracy": 0.9283944219350815, "num_tokens": 116509408.0, "step": 9445 }, { "entropy": 0.9604510962963104, "epoch": 4.9741969457609265, "grad_norm": 0.36326339840888977, "learning_rate": 5.674161422837734e-05, "loss": 0.18484851717948914, "mean_token_accuracy": 0.922455444931984, "num_tokens": 116521744.0, "step": 9446 }, { "entropy": 0.9065830409526825, "epoch": 4.974723538704581, "grad_norm": 0.3017370104789734, "learning_rate": 5.6723939102918665e-05, "loss": 0.14546704292297363, "mean_token_accuracy": 0.9372200965881348, "num_tokens": 116534080.0, "step": 9447 }, { "entropy": 0.9202283024787903, "epoch": 4.975250131648236, "grad_norm": 0.2993650436401367, "learning_rate": 5.670626714014925e-05, "loss": 0.15203902125358582, "mean_token_accuracy": 0.9337811768054962, "num_tokens": 116546416.0, "step": 9448 }, { "entropy": 0.9600692093372345, "epoch": 4.97577672459189, "grad_norm": 0.3401379883289337, "learning_rate": 5.6688598341118124e-05, "loss": 0.1808190643787384, "mean_token_accuracy": 0.9247889965772629, "num_tokens": 116558752.0, "step": 9449 }, { "entropy": 0.8913252055644989, "epoch": 4.976303317535545, "grad_norm": 0.3390532433986664, "learning_rate": 5.667093270687418e-05, "loss": 0.16844721138477325, "mean_token_accuracy": 0.9272169321775436, "num_tokens": 116571088.0, "step": 9450 }, { "entropy": 0.9043051451444626, "epoch": 4.9768299104792, "grad_norm": 0.333987832069397, "learning_rate": 5.665327023846618e-05, "loss": 0.16089186072349548, "mean_token_accuracy": 0.9296596944332123, "num_tokens": 116583424.0, "step": 9451 }, { "entropy": 0.8988510817289352, "epoch": 4.977356503422854, "grad_norm": 0.3078000545501709, "learning_rate": 5.6635610936942565e-05, "loss": 0.15991199016571045, "mean_token_accuracy": 0.9318134486675262, "num_tokens": 116595760.0, "step": 9452 }, { "entropy": 0.9012234061956406, "epoch": 4.977883096366509, "grad_norm": 0.3006126880645752, "learning_rate": 5.66179548033517e-05, "loss": 0.16226999461650848, "mean_token_accuracy": 0.9322975128889084, "num_tokens": 116608096.0, "step": 9453 }, { "entropy": 0.940825805068016, "epoch": 4.978409689310164, "grad_norm": 0.33715713024139404, "learning_rate": 5.660030183874168e-05, "loss": 0.1778339147567749, "mean_token_accuracy": 0.9256445169448853, "num_tokens": 116620432.0, "step": 9454 }, { "entropy": 0.9499392062425613, "epoch": 4.978936282253818, "grad_norm": 0.35110846161842346, "learning_rate": 5.6582652044160556e-05, "loss": 0.16285377740859985, "mean_token_accuracy": 0.9258364588022232, "num_tokens": 116632768.0, "step": 9455 }, { "entropy": 0.9032035619020462, "epoch": 4.9794628751974725, "grad_norm": 0.347312331199646, "learning_rate": 5.656500542065603e-05, "loss": 0.19477276504039764, "mean_token_accuracy": 0.9145398288965225, "num_tokens": 116645104.0, "step": 9456 }, { "entropy": 0.905480682849884, "epoch": 4.9799894681411265, "grad_norm": 0.31421568989753723, "learning_rate": 5.654736196927568e-05, "loss": 0.16706067323684692, "mean_token_accuracy": 0.9269927889108658, "num_tokens": 116657440.0, "step": 9457 }, { "entropy": 0.9130947887897491, "epoch": 4.980516061084781, "grad_norm": 0.316919207572937, "learning_rate": 5.652972169106692e-05, "loss": 0.172123521566391, "mean_token_accuracy": 0.9237474501132965, "num_tokens": 116669776.0, "step": 9458 }, { "entropy": 0.9133815616369247, "epoch": 4.981042654028436, "grad_norm": 0.3086302876472473, "learning_rate": 5.6512084587076916e-05, "loss": 0.16468968987464905, "mean_token_accuracy": 0.9326214045286179, "num_tokens": 116682112.0, "step": 9459 }, { "entropy": 0.9098835438489914, "epoch": 4.98156924697209, "grad_norm": 0.30872488021850586, "learning_rate": 5.64944506583527e-05, "loss": 0.17147888243198395, "mean_token_accuracy": 0.9259092956781387, "num_tokens": 116694448.0, "step": 9460 }, { "entropy": 0.9035718142986298, "epoch": 4.982095839915745, "grad_norm": 0.3328627347946167, "learning_rate": 5.6476819905941114e-05, "loss": 0.18064668774604797, "mean_token_accuracy": 0.9239556342363358, "num_tokens": 116706784.0, "step": 9461 }, { "entropy": 0.8842890411615372, "epoch": 4.9826224328594, "grad_norm": 0.294079452753067, "learning_rate": 5.645919233088877e-05, "loss": 0.15284819900989532, "mean_token_accuracy": 0.9346184283494949, "num_tokens": 116719120.0, "step": 9462 }, { "entropy": 0.9337745606899261, "epoch": 4.983149025803054, "grad_norm": 0.35992324352264404, "learning_rate": 5.64415679342421e-05, "loss": 0.18033114075660706, "mean_token_accuracy": 0.9219166487455368, "num_tokens": 116731456.0, "step": 9463 }, { "entropy": 0.8690318018198013, "epoch": 4.983675618746709, "grad_norm": 0.32860904932022095, "learning_rate": 5.6423946717047406e-05, "loss": 0.16652944684028625, "mean_token_accuracy": 0.9334118962287903, "num_tokens": 116743792.0, "step": 9464 }, { "entropy": 0.8971494138240814, "epoch": 4.984202211690364, "grad_norm": 0.29319801926612854, "learning_rate": 5.6406328680350706e-05, "loss": 0.1558331549167633, "mean_token_accuracy": 0.934053510427475, "num_tokens": 116756128.0, "step": 9465 }, { "entropy": 0.8544014245271683, "epoch": 4.984728804634018, "grad_norm": 0.33784765005111694, "learning_rate": 5.6388713825197915e-05, "loss": 0.1779947578907013, "mean_token_accuracy": 0.9300804436206818, "num_tokens": 116768464.0, "step": 9466 }, { "entropy": 0.9156675636768341, "epoch": 4.9852553975776726, "grad_norm": 0.3178240954875946, "learning_rate": 5.6371102152634705e-05, "loss": 0.15659943222999573, "mean_token_accuracy": 0.9356032758951187, "num_tokens": 116780800.0, "step": 9467 }, { "entropy": 0.8807658702135086, "epoch": 4.9857819905213265, "grad_norm": 0.3392799198627472, "learning_rate": 5.6353493663706567e-05, "loss": 0.17571623623371124, "mean_token_accuracy": 0.9243208914995193, "num_tokens": 116793136.0, "step": 9468 }, { "entropy": 0.9186313897371292, "epoch": 4.986308583464981, "grad_norm": 0.3488842844963074, "learning_rate": 5.6335888359458866e-05, "loss": 0.16939771175384521, "mean_token_accuracy": 0.926127165555954, "num_tokens": 116805472.0, "step": 9469 }, { "entropy": 0.9254487901926041, "epoch": 4.986835176408636, "grad_norm": 0.31008264422416687, "learning_rate": 5.6318286240936713e-05, "loss": 0.16387975215911865, "mean_token_accuracy": 0.9316154420375824, "num_tokens": 116817808.0, "step": 9470 }, { "entropy": 0.9040963053703308, "epoch": 4.98736176935229, "grad_norm": 0.32900792360305786, "learning_rate": 5.630068730918501e-05, "loss": 0.16915391385555267, "mean_token_accuracy": 0.928293913602829, "num_tokens": 116830144.0, "step": 9471 }, { "entropy": 0.9082885682582855, "epoch": 4.987888362295945, "grad_norm": 0.3768515884876251, "learning_rate": 5.6283091565248517e-05, "loss": 0.18894949555397034, "mean_token_accuracy": 0.9235462546348572, "num_tokens": 116842480.0, "step": 9472 }, { "entropy": 0.9041440486907959, "epoch": 4.9884149552396, "grad_norm": 0.3412855863571167, "learning_rate": 5.626549901017177e-05, "loss": 0.16429667174816132, "mean_token_accuracy": 0.9322096705436707, "num_tokens": 116854816.0, "step": 9473 }, { "entropy": 0.91483274102211, "epoch": 4.988941548183254, "grad_norm": 0.3402027487754822, "learning_rate": 5.6247909644999176e-05, "loss": 0.1718006283044815, "mean_token_accuracy": 0.9307664930820465, "num_tokens": 116867152.0, "step": 9474 }, { "entropy": 0.9492096453905106, "epoch": 4.989468141126909, "grad_norm": 0.3414507806301117, "learning_rate": 5.623032347077487e-05, "loss": 0.1570313274860382, "mean_token_accuracy": 0.9314261972904205, "num_tokens": 116879488.0, "step": 9475 }, { "entropy": 0.9157185554504395, "epoch": 4.989994734070564, "grad_norm": 0.31004396080970764, "learning_rate": 5.621274048854289e-05, "loss": 0.15961430966854095, "mean_token_accuracy": 0.9323617666959763, "num_tokens": 116891824.0, "step": 9476 }, { "entropy": 0.9423941224813461, "epoch": 4.990521327014218, "grad_norm": 0.35401451587677, "learning_rate": 5.6195160699347004e-05, "loss": 0.17788419127464294, "mean_token_accuracy": 0.9256136417388916, "num_tokens": 116904160.0, "step": 9477 }, { "entropy": 0.9306418746709824, "epoch": 4.991047919957873, "grad_norm": 0.32740211486816406, "learning_rate": 5.617758410423084e-05, "loss": 0.15795734524726868, "mean_token_accuracy": 0.9341577291488647, "num_tokens": 116916496.0, "step": 9478 }, { "entropy": 0.9015368968248367, "epoch": 4.991574512901527, "grad_norm": 0.36364123225212097, "learning_rate": 5.61600107042378e-05, "loss": 0.18496762216091156, "mean_token_accuracy": 0.9203061461448669, "num_tokens": 116928832.0, "step": 9479 }, { "entropy": 0.9284609705209732, "epoch": 4.992101105845181, "grad_norm": 0.31846433877944946, "learning_rate": 5.614244050041113e-05, "loss": 0.17823076248168945, "mean_token_accuracy": 0.9223919361829758, "num_tokens": 116941168.0, "step": 9480 }, { "entropy": 0.9006500244140625, "epoch": 4.992627698788836, "grad_norm": 0.34518757462501526, "learning_rate": 5.6124873493793884e-05, "loss": 0.17152202129364014, "mean_token_accuracy": 0.9256195574998856, "num_tokens": 116953504.0, "step": 9481 }, { "entropy": 0.933140829205513, "epoch": 4.993154291732491, "grad_norm": 0.3343666195869446, "learning_rate": 5.6107309685428834e-05, "loss": 0.17478488385677338, "mean_token_accuracy": 0.9261410385370255, "num_tokens": 116965840.0, "step": 9482 }, { "entropy": 0.9274118393659592, "epoch": 4.993680884676145, "grad_norm": 0.30102184414863586, "learning_rate": 5.608974907635872e-05, "loss": 0.15346240997314453, "mean_token_accuracy": 0.9328440576791763, "num_tokens": 116978176.0, "step": 9483 }, { "entropy": 0.9209228157997131, "epoch": 4.9942074776198, "grad_norm": 0.30850332975387573, "learning_rate": 5.6072191667626006e-05, "loss": 0.1682778298854828, "mean_token_accuracy": 0.9296342134475708, "num_tokens": 116990512.0, "step": 9484 }, { "entropy": 0.9228739440441132, "epoch": 4.994734070563455, "grad_norm": 0.33433517813682556, "learning_rate": 5.605463746027294e-05, "loss": 0.1794205904006958, "mean_token_accuracy": 0.9201393127441406, "num_tokens": 117002848.0, "step": 9485 }, { "entropy": 0.8917040377855301, "epoch": 4.995260663507109, "grad_norm": 0.30780935287475586, "learning_rate": 5.603708645534165e-05, "loss": 0.1697072684764862, "mean_token_accuracy": 0.9269426912069321, "num_tokens": 117015184.0, "step": 9486 }, { "entropy": 0.9531418681144714, "epoch": 4.995787256450764, "grad_norm": 0.3103603422641754, "learning_rate": 5.6019538653873994e-05, "loss": 0.17060068249702454, "mean_token_accuracy": 0.9268237501382828, "num_tokens": 117027520.0, "step": 9487 }, { "entropy": 0.9021676480770111, "epoch": 4.996313849394419, "grad_norm": 0.32364600896835327, "learning_rate": 5.600199405691171e-05, "loss": 0.16891726851463318, "mean_token_accuracy": 0.9244484603404999, "num_tokens": 117039856.0, "step": 9488 }, { "entropy": 0.9253650903701782, "epoch": 4.996840442338073, "grad_norm": 0.31460437178611755, "learning_rate": 5.5984452665496346e-05, "loss": 0.15997791290283203, "mean_token_accuracy": 0.9296991527080536, "num_tokens": 117052192.0, "step": 9489 }, { "entropy": 0.9130527228116989, "epoch": 4.997367035281727, "grad_norm": 0.3126857876777649, "learning_rate": 5.596691448066916e-05, "loss": 0.17209011316299438, "mean_token_accuracy": 0.9269836246967316, "num_tokens": 117064528.0, "step": 9490 }, { "entropy": 0.9370010644197464, "epoch": 4.997893628225381, "grad_norm": 0.314369797706604, "learning_rate": 5.594937950347137e-05, "loss": 0.16863462328910828, "mean_token_accuracy": 0.9340494722127914, "num_tokens": 117076864.0, "step": 9491 }, { "entropy": 0.9399919509887695, "epoch": 4.998420221169036, "grad_norm": 0.3283589780330658, "learning_rate": 5.5931847734943865e-05, "loss": 0.18404729664325714, "mean_token_accuracy": 0.9177678525447845, "num_tokens": 117089200.0, "step": 9492 }, { "entropy": 0.9053280353546143, "epoch": 4.998946814112691, "grad_norm": 0.31343698501586914, "learning_rate": 5.5914319176127416e-05, "loss": 0.16595865786075592, "mean_token_accuracy": 0.925357311964035, "num_tokens": 117101536.0, "step": 9493 }, { "entropy": 0.8777082115411758, "epoch": 4.999473407056345, "grad_norm": 0.28059449791908264, "learning_rate": 5.589679382806262e-05, "loss": 0.15285533666610718, "mean_token_accuracy": 0.9359864443540573, "num_tokens": 117113872.0, "step": 9494 }, { "entropy": 0.8763579279184341, "epoch": 5.0, "grad_norm": 0.3026115596294403, "learning_rate": 5.587927169178984e-05, "loss": 0.1645173877477646, "mean_token_accuracy": 0.9272801280021667, "num_tokens": 117125180.0, "step": 9495 }, { "epoch": 5.0, "eval_entropy": 0.8973508889327368, "eval_loss": 0.19531196355819702, "eval_mean_token_accuracy": 0.9202164551532539, "eval_num_tokens": 117125180.0, "eval_runtime": 665.3223, "eval_samples_per_second": 8.563, "eval_steps_per_second": 2.854, "step": 9495 } ], "logging_steps": 1, "max_steps": 13293, "num_input_tokens_seen": 0, "num_train_epochs": 7, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8.173011364224306e+19, "train_batch_size": 3, "trial_name": null, "trial_params": null }