{ "best_global_step": 43000, "best_metric": 1.4149765968322754, "best_model_checkpoint": "/home/mkurman/gitlab/ai/model-trainer/results/convgpt_v2_long_2d/convgpt_v2_rope_nope_hybrid_clean_h512_l16_seq512_bs8_fullloss_20260523_161605/checkpoint-43000", "epoch": 0.26994285112322564, "eval_steps": 1000, "global_step": 114000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00013167943957230517, "grad_norm": 1.5129085779190063, "learning_rate": 1.8762343647136274e-05, "loss": 10.0451, "step": 20 }, { "epoch": 0.00026335887914461035, "grad_norm": 1.4276129007339478, "learning_rate": 3.851217906517446e-05, "loss": 9.11, "step": 40 }, { "epoch": 0.00039503831871691555, "grad_norm": 1.3658931255340576, "learning_rate": 5.8262014483212636e-05, "loss": 8.3876, "step": 60 }, { "epoch": 0.0005267177582892207, "grad_norm": 1.8227916955947876, "learning_rate": 7.801184990125083e-05, "loss": 7.7517, "step": 80 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.8309405446052551, "learning_rate": 9.7761685319289e-05, "loss": 7.1243, "step": 100 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.6047381162643433, "learning_rate": 0.00011751152073732718, "loss": 6.5642, "step": 120 }, { "epoch": 0.0009217560770061363, "grad_norm": 6.724730014801025, "learning_rate": 0.00013726135615536539, "loss": 6.1814, "step": 140 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.4805045425891876, "learning_rate": 0.00015701119157340358, "loss": 5.8953, "step": 160 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.4253923296928406, "learning_rate": 0.00017676102699144174, "loss": 5.656, "step": 180 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.479189395904541, "learning_rate": 0.0001965108624094799, "loss": 5.453, "step": 200 }, { "epoch": 0.001448473835295357, "grad_norm": 0.4821586310863495, "learning_rate": 0.0002162606978275181, "loss": 5.2631, "step": 220 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.5253534913063049, "learning_rate": 0.0002360105332455563, "loss": 5.1262, "step": 240 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.3778499662876129, "learning_rate": 0.0002557603686635945, "loss": 4.9729, "step": 260 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.40282198786735535, "learning_rate": 0.0002755102040816327, "loss": 4.8491, "step": 280 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.40169110894203186, "learning_rate": 0.00029526003949967083, "loss": 4.7163, "step": 300 }, { "epoch": 0.002106871033156883, "grad_norm": 0.4091223180294037, "learning_rate": 0.000315009874917709, "loss": 4.6122, "step": 320 }, { "epoch": 0.002238550472729188, "grad_norm": 0.3836401402950287, "learning_rate": 0.0003347597103357472, "loss": 4.5315, "step": 340 }, { "epoch": 0.002370229912301493, "grad_norm": 0.37077072262763977, "learning_rate": 0.0003545095457537854, "loss": 4.4403, "step": 360 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.3423950970172882, "learning_rate": 0.0003742593811718236, "loss": 4.3758, "step": 380 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.3271167576313019, "learning_rate": 0.00039400921658986173, "loss": 4.2859, "step": 400 }, { "epoch": 0.002765268231018409, "grad_norm": 0.32271647453308105, "learning_rate": 0.0004137590520079, "loss": 4.2281, "step": 420 }, { "epoch": 0.002896947670590714, "grad_norm": 0.3268634080886841, "learning_rate": 0.00043350888742593816, "loss": 4.152, "step": 440 }, { "epoch": 0.003028627110163019, "grad_norm": 0.3095104992389679, "learning_rate": 0.00045325872284397636, "loss": 4.0894, "step": 460 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.33799174427986145, "learning_rate": 0.00047300855826201455, "loss": 4.0365, "step": 480 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.39443933963775635, "learning_rate": 0.0004927583936800527, "loss": 3.9868, "step": 500 }, { "epoch": 0.003423665428879935, "grad_norm": 0.32354313135147095, "learning_rate": 0.0005125082290980909, "loss": 3.9136, "step": 520 }, { "epoch": 0.00355534486845224, "grad_norm": 0.31924670934677124, "learning_rate": 0.0005322580645161291, "loss": 3.8859, "step": 540 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.2883984446525574, "learning_rate": 0.0005520078999341672, "loss": 3.8321, "step": 560 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.31237614154815674, "learning_rate": 0.0005717577353522054, "loss": 3.799, "step": 580 }, { "epoch": 0.003950383187169155, "grad_norm": 0.29551151394844055, "learning_rate": 0.0005915075707702436, "loss": 3.7745, "step": 600 }, { "epoch": 0.004082062626741461, "grad_norm": 0.2833958566188812, "learning_rate": 0.0006112574061882818, "loss": 3.7411, "step": 620 }, { "epoch": 0.004213742066313766, "grad_norm": 0.28037381172180176, "learning_rate": 0.00063100724160632, "loss": 3.6861, "step": 640 }, { "epoch": 0.004345421505886071, "grad_norm": 0.39652886986732483, "learning_rate": 0.0006507570770243582, "loss": 3.6568, "step": 660 }, { "epoch": 0.004477100945458376, "grad_norm": 0.2646957337856293, "learning_rate": 0.0006705069124423963, "loss": 3.6185, "step": 680 }, { "epoch": 0.004608780385030682, "grad_norm": 0.2843409478664398, "learning_rate": 0.0006902567478604345, "loss": 3.5845, "step": 700 }, { "epoch": 0.004740459824602986, "grad_norm": 0.27913448214530945, "learning_rate": 0.0007100065832784727, "loss": 3.5546, "step": 720 }, { "epoch": 0.004872139264175292, "grad_norm": 0.2710491418838501, "learning_rate": 0.0007297564186965109, "loss": 3.5176, "step": 740 }, { "epoch": 0.005003818703747597, "grad_norm": 0.28077027201652527, "learning_rate": 0.0007495062541145491, "loss": 3.497, "step": 760 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.27605777978897095, "learning_rate": 0.0007692560895325872, "loss": 3.4649, "step": 780 }, { "epoch": 0.005267177582892207, "grad_norm": 0.29779553413391113, "learning_rate": 0.0007890059249506255, "loss": 3.4509, "step": 800 }, { "epoch": 0.005398857022464512, "grad_norm": 0.3055330812931061, "learning_rate": 0.0008087557603686636, "loss": 3.4085, "step": 820 }, { "epoch": 0.005530536462036818, "grad_norm": 0.26349249482154846, "learning_rate": 0.0008285055957867019, "loss": 3.3842, "step": 840 }, { "epoch": 0.005662215901609122, "grad_norm": 0.2677903175354004, "learning_rate": 0.00084825543120474, "loss": 3.3555, "step": 860 }, { "epoch": 0.005793895341181428, "grad_norm": 0.2856537699699402, "learning_rate": 0.0008680052666227783, "loss": 3.3358, "step": 880 }, { "epoch": 0.005925574780753733, "grad_norm": 0.2631045877933502, "learning_rate": 0.0008877551020408163, "loss": 3.3164, "step": 900 }, { "epoch": 0.006057254220326038, "grad_norm": 0.2708953619003296, "learning_rate": 0.0009075049374588546, "loss": 3.2944, "step": 920 }, { "epoch": 0.006188933659898343, "grad_norm": 0.24445629119873047, "learning_rate": 0.0009272547728768927, "loss": 3.2718, "step": 940 }, { "epoch": 0.006320613099470649, "grad_norm": 0.2704775035381317, "learning_rate": 0.0009470046082949309, "loss": 3.249, "step": 960 }, { "epoch": 0.006452292539042954, "grad_norm": 0.25395041704177856, "learning_rate": 0.000966754443712969, "loss": 3.2161, "step": 980 }, { "epoch": 0.006583971978615259, "grad_norm": 0.2632465064525604, "learning_rate": 0.0009865042791310074, "loss": 3.1973, "step": 1000 }, { "epoch": 0.006583971978615259, "eval_loss": 3.229322671890259, "eval_runtime": 68.051, "eval_samples_per_second": 14.695, "eval_steps_per_second": 14.695, "step": 1000 }, { "epoch": 0.006715651418187564, "grad_norm": 0.268993079662323, "learning_rate": 0.0010062541145490454, "loss": 3.1752, "step": 1020 }, { "epoch": 0.00684733085775987, "grad_norm": 0.2427850067615509, "learning_rate": 0.0010260039499670837, "loss": 3.1407, "step": 1040 }, { "epoch": 0.006979010297332174, "grad_norm": 0.2634700834751129, "learning_rate": 0.0010457537853851217, "loss": 3.122, "step": 1060 }, { "epoch": 0.00711068973690448, "grad_norm": 0.23194676637649536, "learning_rate": 0.00106550362080316, "loss": 3.0935, "step": 1080 }, { "epoch": 0.007242369176476785, "grad_norm": 0.25881442427635193, "learning_rate": 0.0010852534562211982, "loss": 3.0758, "step": 1100 }, { "epoch": 0.0073740486160490904, "grad_norm": 0.2772982716560364, "learning_rate": 0.0011050032916392364, "loss": 3.0621, "step": 1120 }, { "epoch": 0.007505728055621395, "grad_norm": 0.25508975982666016, "learning_rate": 0.0011247531270572745, "loss": 3.0338, "step": 1140 }, { "epoch": 0.007637407495193701, "grad_norm": 0.2273252010345459, "learning_rate": 0.0011445029624753127, "loss": 3.0122, "step": 1160 }, { "epoch": 0.007769086934766006, "grad_norm": 0.25050970911979675, "learning_rate": 0.001164252797893351, "loss": 3.0121, "step": 1180 }, { "epoch": 0.00790076637433831, "grad_norm": 0.24488165974617004, "learning_rate": 0.0011840026333113892, "loss": 2.9993, "step": 1200 }, { "epoch": 0.008032445813910615, "grad_norm": 0.23485834896564484, "learning_rate": 0.0012037524687294272, "loss": 2.9679, "step": 1220 }, { "epoch": 0.008164125253482922, "grad_norm": 0.23405972123146057, "learning_rate": 0.0012235023041474655, "loss": 2.9485, "step": 1240 }, { "epoch": 0.008295804693055226, "grad_norm": 0.20557770133018494, "learning_rate": 0.0012432521395655035, "loss": 2.931, "step": 1260 }, { "epoch": 0.008427484132627531, "grad_norm": 0.22637082636356354, "learning_rate": 0.001263001974983542, "loss": 2.9185, "step": 1280 }, { "epoch": 0.008559163572199836, "grad_norm": 0.21511614322662354, "learning_rate": 0.00128275181040158, "loss": 2.9059, "step": 1300 }, { "epoch": 0.008690843011772142, "grad_norm": 0.20529645681381226, "learning_rate": 0.0013025016458196182, "loss": 2.8874, "step": 1320 }, { "epoch": 0.008822522451344447, "grad_norm": 0.19764812290668488, "learning_rate": 0.0013222514812376563, "loss": 2.8646, "step": 1340 }, { "epoch": 0.008954201890916752, "grad_norm": 0.2055043876171112, "learning_rate": 0.0013420013166556945, "loss": 2.849, "step": 1360 }, { "epoch": 0.009085881330489057, "grad_norm": 0.1990618258714676, "learning_rate": 0.0013617511520737328, "loss": 2.8303, "step": 1380 }, { "epoch": 0.009217560770061363, "grad_norm": 0.19160950183868408, "learning_rate": 0.001381500987491771, "loss": 2.827, "step": 1400 }, { "epoch": 0.009349240209633668, "grad_norm": 0.19032776355743408, "learning_rate": 0.001401250822909809, "loss": 2.8059, "step": 1420 }, { "epoch": 0.009480919649205973, "grad_norm": 0.18810242414474487, "learning_rate": 0.0014210006583278473, "loss": 2.8056, "step": 1440 }, { "epoch": 0.009612599088778278, "grad_norm": 0.18992900848388672, "learning_rate": 0.0014407504937458853, "loss": 2.7846, "step": 1460 }, { "epoch": 0.009744278528350584, "grad_norm": 0.18800954520702362, "learning_rate": 0.0014605003291639238, "loss": 2.7688, "step": 1480 }, { "epoch": 0.009875957967922889, "grad_norm": 0.19007734954357147, "learning_rate": 0.0014802501645819618, "loss": 2.7639, "step": 1500 }, { "epoch": 0.010007637407495194, "grad_norm": 0.18421195447444916, "learning_rate": 0.0015, "loss": 2.7567, "step": 1520 }, { "epoch": 0.010139316847067498, "grad_norm": 0.182477667927742, "learning_rate": 0.001519749835418038, "loss": 2.7508, "step": 1540 }, { "epoch": 0.010270996286639805, "grad_norm": 0.18245883285999298, "learning_rate": 0.0015394996708360765, "loss": 2.7286, "step": 1560 }, { "epoch": 0.01040267572621211, "grad_norm": 0.18001046776771545, "learning_rate": 0.0015592495062541148, "loss": 2.7224, "step": 1580 }, { "epoch": 0.010534355165784414, "grad_norm": 0.17572300136089325, "learning_rate": 0.0015789993416721528, "loss": 2.7126, "step": 1600 }, { "epoch": 0.01066603460535672, "grad_norm": 0.17919962108135223, "learning_rate": 0.0015987491770901908, "loss": 2.7043, "step": 1620 }, { "epoch": 0.010797714044929024, "grad_norm": 0.17204663157463074, "learning_rate": 0.0016184990125082293, "loss": 2.6945, "step": 1640 }, { "epoch": 0.01092939348450133, "grad_norm": 0.17742666602134705, "learning_rate": 0.0016382488479262673, "loss": 2.6981, "step": 1660 }, { "epoch": 0.011061072924073635, "grad_norm": 0.18275167047977448, "learning_rate": 0.0016579986833443056, "loss": 2.6782, "step": 1680 }, { "epoch": 0.01119275236364594, "grad_norm": 0.18246972560882568, "learning_rate": 0.0016777485187623436, "loss": 2.6805, "step": 1700 }, { "epoch": 0.011324431803218245, "grad_norm": 0.17320232093334198, "learning_rate": 0.001697498354180382, "loss": 2.6698, "step": 1720 }, { "epoch": 0.011456111242790551, "grad_norm": 0.16316188871860504, "learning_rate": 0.00171724818959842, "loss": 2.6563, "step": 1740 }, { "epoch": 0.011587790682362856, "grad_norm": 0.17399418354034424, "learning_rate": 0.001736998025016458, "loss": 2.6639, "step": 1760 }, { "epoch": 0.01171947012193516, "grad_norm": 0.16352471709251404, "learning_rate": 0.0017567478604344963, "loss": 2.6778, "step": 1780 }, { "epoch": 0.011851149561507466, "grad_norm": 0.167058527469635, "learning_rate": 0.0017764976958525348, "loss": 2.6616, "step": 1800 }, { "epoch": 0.011982829001079772, "grad_norm": 0.18267591297626495, "learning_rate": 0.0017962475312705728, "loss": 2.6714, "step": 1820 }, { "epoch": 0.012114508440652077, "grad_norm": 0.17048963904380798, "learning_rate": 0.0018159973666886109, "loss": 2.6543, "step": 1840 }, { "epoch": 0.012246187880224382, "grad_norm": 0.16198118031024933, "learning_rate": 0.0018357472021066491, "loss": 2.6529, "step": 1860 }, { "epoch": 0.012377867319796686, "grad_norm": 0.1616767942905426, "learning_rate": 0.0018554970375246874, "loss": 2.6387, "step": 1880 }, { "epoch": 0.012509546759368993, "grad_norm": 0.1541590839624405, "learning_rate": 0.0018752468729427256, "loss": 2.6181, "step": 1900 }, { "epoch": 0.012641226198941298, "grad_norm": 0.15989308059215546, "learning_rate": 0.0018949967083607636, "loss": 2.6226, "step": 1920 }, { "epoch": 0.012772905638513602, "grad_norm": 0.1667192429304123, "learning_rate": 0.0019147465437788017, "loss": 2.6192, "step": 1940 }, { "epoch": 0.012904585078085907, "grad_norm": 0.15245971083641052, "learning_rate": 0.0019344963791968401, "loss": 2.6103, "step": 1960 }, { "epoch": 0.013036264517658214, "grad_norm": 0.16327407956123352, "learning_rate": 0.001954246214614878, "loss": 2.5959, "step": 1980 }, { "epoch": 0.013167943957230518, "grad_norm": 0.1521947681903839, "learning_rate": 0.001973996050032916, "loss": 2.5968, "step": 2000 }, { "epoch": 0.013167943957230518, "eval_loss": 2.627993106842041, "eval_runtime": 67.8897, "eval_samples_per_second": 14.73, "eval_steps_per_second": 14.73, "step": 2000 }, { "epoch": 0.013299623396802823, "grad_norm": 0.14737296104431152, "learning_rate": 0.0019937458854509546, "loss": 2.5906, "step": 2020 }, { "epoch": 0.013431302836375128, "grad_norm": 0.1449994295835495, "learning_rate": 0.002013495720868993, "loss": 2.5751, "step": 2040 }, { "epoch": 0.013562982275947433, "grad_norm": 0.15211527049541473, "learning_rate": 0.002033245556287031, "loss": 2.5802, "step": 2060 }, { "epoch": 0.01369466171551974, "grad_norm": 0.1509827822446823, "learning_rate": 0.002052995391705069, "loss": 2.5624, "step": 2080 }, { "epoch": 0.013826341155092044, "grad_norm": 0.1424606740474701, "learning_rate": 0.002072745227123107, "loss": 2.5616, "step": 2100 }, { "epoch": 0.013958020594664349, "grad_norm": 0.1456785947084427, "learning_rate": 0.0020924950625411456, "loss": 2.5614, "step": 2120 }, { "epoch": 0.014089700034236654, "grad_norm": 0.1454639583826065, "learning_rate": 0.0021122448979591837, "loss": 2.548, "step": 2140 }, { "epoch": 0.01422137947380896, "grad_norm": 0.15996553003787994, "learning_rate": 0.0021319947333772217, "loss": 2.5564, "step": 2160 }, { "epoch": 0.014353058913381265, "grad_norm": 0.14995744824409485, "learning_rate": 0.0021517445687952597, "loss": 2.537, "step": 2180 }, { "epoch": 0.01448473835295357, "grad_norm": 0.1442878395318985, "learning_rate": 0.002171494404213298, "loss": 2.5322, "step": 2200 }, { "epoch": 0.014616417792525874, "grad_norm": 0.14572259783744812, "learning_rate": 0.0021912442396313367, "loss": 2.5248, "step": 2220 }, { "epoch": 0.014748097232098181, "grad_norm": 0.14792700111865997, "learning_rate": 0.0022109940750493747, "loss": 2.5214, "step": 2240 }, { "epoch": 0.014879776671670486, "grad_norm": 0.13958069682121277, "learning_rate": 0.0022307439104674127, "loss": 2.5081, "step": 2260 }, { "epoch": 0.01501145611124279, "grad_norm": 0.1351982206106186, "learning_rate": 0.002250493745885451, "loss": 2.5116, "step": 2280 }, { "epoch": 0.015143135550815095, "grad_norm": 0.14376430213451385, "learning_rate": 0.002270243581303489, "loss": 2.4984, "step": 2300 }, { "epoch": 0.015274814990387402, "grad_norm": 0.15098074078559875, "learning_rate": 0.0022899934167215272, "loss": 2.4982, "step": 2320 }, { "epoch": 0.015406494429959706, "grad_norm": 0.13247129321098328, "learning_rate": 0.0023097432521395657, "loss": 2.4841, "step": 2340 }, { "epoch": 0.015538173869532011, "grad_norm": 0.14014942944049835, "learning_rate": 0.0023294930875576037, "loss": 2.4941, "step": 2360 }, { "epoch": 0.015669853309104316, "grad_norm": 0.13669346272945404, "learning_rate": 0.0023492429229756417, "loss": 2.5085, "step": 2380 }, { "epoch": 0.01580153274867662, "grad_norm": 0.12908074259757996, "learning_rate": 0.00236899275839368, "loss": 2.4982, "step": 2400 }, { "epoch": 0.015933212188248926, "grad_norm": 0.12701626121997833, "learning_rate": 0.0023887425938117182, "loss": 2.4868, "step": 2420 }, { "epoch": 0.01606489162782123, "grad_norm": 0.13361623883247375, "learning_rate": 0.0024084924292297567, "loss": 2.4894, "step": 2440 }, { "epoch": 0.01619657106739354, "grad_norm": 0.12999138236045837, "learning_rate": 0.0024282422646477947, "loss": 2.4742, "step": 2460 }, { "epoch": 0.016328250506965843, "grad_norm": 0.12473666667938232, "learning_rate": 0.0024479921000658328, "loss": 2.466, "step": 2480 }, { "epoch": 0.016459929946538148, "grad_norm": 0.12962856888771057, "learning_rate": 0.002467741935483871, "loss": 2.4635, "step": 2500 }, { "epoch": 0.016591609386110453, "grad_norm": 0.13669155538082123, "learning_rate": 0.0024874917709019092, "loss": 2.4574, "step": 2520 }, { "epoch": 0.016723288825682758, "grad_norm": 0.1261315792798996, "learning_rate": 0.0025072416063199473, "loss": 2.4559, "step": 2540 }, { "epoch": 0.016854968265255062, "grad_norm": 0.1260860413312912, "learning_rate": 0.0025269914417379853, "loss": 2.4436, "step": 2560 }, { "epoch": 0.016986647704827367, "grad_norm": 0.11925692856311798, "learning_rate": 0.0025467412771560238, "loss": 2.4467, "step": 2580 }, { "epoch": 0.017118327144399672, "grad_norm": 0.12199912220239639, "learning_rate": 0.002566491112574062, "loss": 2.4395, "step": 2600 }, { "epoch": 0.01725000658397198, "grad_norm": 0.13121625781059265, "learning_rate": 0.0025862409479921003, "loss": 2.4364, "step": 2620 }, { "epoch": 0.017381686023544285, "grad_norm": 0.1242750957608223, "learning_rate": 0.0026059907834101383, "loss": 2.425, "step": 2640 }, { "epoch": 0.01751336546311659, "grad_norm": 0.11995479464530945, "learning_rate": 0.0026257406188281767, "loss": 2.4223, "step": 2660 }, { "epoch": 0.017645044902688894, "grad_norm": 0.11676183342933655, "learning_rate": 0.0026454904542462148, "loss": 2.4124, "step": 2680 }, { "epoch": 0.0177767243422612, "grad_norm": 0.11701571941375732, "learning_rate": 0.002665240289664253, "loss": 2.4044, "step": 2700 }, { "epoch": 0.017908403781833504, "grad_norm": 0.1141498014330864, "learning_rate": 0.002684990125082291, "loss": 2.4086, "step": 2720 }, { "epoch": 0.01804008322140581, "grad_norm": 0.11457623541355133, "learning_rate": 0.0027047399605003293, "loss": 2.405, "step": 2740 }, { "epoch": 0.018171762660978114, "grad_norm": 0.11170320957899094, "learning_rate": 0.0027244897959183673, "loss": 2.4041, "step": 2760 }, { "epoch": 0.018303442100550422, "grad_norm": 0.11429501324892044, "learning_rate": 0.0027442396313364053, "loss": 2.3886, "step": 2780 }, { "epoch": 0.018435121540122727, "grad_norm": 0.11575177311897278, "learning_rate": 0.002763989466754444, "loss": 2.3928, "step": 2800 }, { "epoch": 0.01856680097969503, "grad_norm": 0.11174377053976059, "learning_rate": 0.0027837393021724823, "loss": 2.3923, "step": 2820 }, { "epoch": 0.018698480419267336, "grad_norm": 0.11565430462360382, "learning_rate": 0.0028034891375905203, "loss": 2.3876, "step": 2840 }, { "epoch": 0.01883015985883964, "grad_norm": 0.1113847866654396, "learning_rate": 0.0028232389730085583, "loss": 2.3715, "step": 2860 }, { "epoch": 0.018961839298411946, "grad_norm": 0.11279511451721191, "learning_rate": 0.0028429888084265964, "loss": 2.3877, "step": 2880 }, { "epoch": 0.01909351873798425, "grad_norm": 0.10945755243301392, "learning_rate": 0.002862738643844635, "loss": 2.3713, "step": 2900 }, { "epoch": 0.019225198177556555, "grad_norm": 0.11334076523780823, "learning_rate": 0.002882488479262673, "loss": 2.3714, "step": 2920 }, { "epoch": 0.01935687761712886, "grad_norm": 0.11575334519147873, "learning_rate": 0.002902238314680711, "loss": 2.3841, "step": 2940 }, { "epoch": 0.019488557056701168, "grad_norm": 0.10688841342926025, "learning_rate": 0.002921988150098749, "loss": 2.4039, "step": 2960 }, { "epoch": 0.019620236496273473, "grad_norm": 0.10941021889448166, "learning_rate": 0.0029417379855167874, "loss": 2.4104, "step": 2980 }, { "epoch": 0.019751915935845778, "grad_norm": 0.10736847668886185, "learning_rate": 0.002961487820934826, "loss": 2.4152, "step": 3000 }, { "epoch": 0.019751915935845778, "eval_loss": 2.4375340938568115, "eval_runtime": 68.5796, "eval_samples_per_second": 14.582, "eval_steps_per_second": 14.582, "step": 3000 }, { "epoch": 0.019883595375418082, "grad_norm": 0.10122061520814896, "learning_rate": 0.002981237656352864, "loss": 2.4102, "step": 3020 }, { "epoch": 0.020015274814990387, "grad_norm": 0.10470600426197052, "learning_rate": 0.002999999999665892, "loss": 2.4042, "step": 3040 }, { "epoch": 0.020146954254562692, "grad_norm": 0.10254276543855667, "learning_rate": 0.002999999852658443, "loss": 2.4062, "step": 3060 }, { "epoch": 0.020278633694134997, "grad_norm": 0.10125599801540375, "learning_rate": 0.0029999994383647483, "loss": 2.3965, "step": 3080 }, { "epoch": 0.0204103131337073, "grad_norm": 0.10337845981121063, "learning_rate": 0.0029999987567848824, "loss": 2.3924, "step": 3100 }, { "epoch": 0.02054199257327961, "grad_norm": 0.09914848208427429, "learning_rate": 0.002999997807918967, "loss": 2.3903, "step": 3120 }, { "epoch": 0.020673672012851915, "grad_norm": 0.10522714257240295, "learning_rate": 0.0029999965917671696, "loss": 2.3765, "step": 3140 }, { "epoch": 0.02080535145242422, "grad_norm": 0.10708487033843994, "learning_rate": 0.0029999951083297086, "loss": 2.3739, "step": 3160 }, { "epoch": 0.020937030891996524, "grad_norm": 0.09805380553007126, "learning_rate": 0.002999993357606847, "loss": 2.3596, "step": 3180 }, { "epoch": 0.02106871033156883, "grad_norm": 0.09819849580526352, "learning_rate": 0.002999991339598898, "loss": 2.3597, "step": 3200 }, { "epoch": 0.021200389771141134, "grad_norm": 0.09890013933181763, "learning_rate": 0.0029999890543062208, "loss": 2.3504, "step": 3220 }, { "epoch": 0.02133206921071344, "grad_norm": 0.09736858308315277, "learning_rate": 0.002999986501729222, "loss": 2.3472, "step": 3240 }, { "epoch": 0.021463748650285743, "grad_norm": 0.09881199896335602, "learning_rate": 0.002999983681868357, "loss": 2.3522, "step": 3260 }, { "epoch": 0.021595428089858048, "grad_norm": 0.09606959670782089, "learning_rate": 0.0029999805947241278, "loss": 2.3455, "step": 3280 }, { "epoch": 0.021727107529430356, "grad_norm": 0.09520818293094635, "learning_rate": 0.0029999772402970856, "loss": 2.3422, "step": 3300 }, { "epoch": 0.02185878696900266, "grad_norm": 0.09379695355892181, "learning_rate": 0.0029999736185878268, "loss": 2.3387, "step": 3320 }, { "epoch": 0.021990466408574966, "grad_norm": 0.0959760919213295, "learning_rate": 0.0029999697295969977, "loss": 2.3281, "step": 3340 }, { "epoch": 0.02212214584814727, "grad_norm": 0.0942387580871582, "learning_rate": 0.002999965573325291, "loss": 2.3259, "step": 3360 }, { "epoch": 0.022253825287719575, "grad_norm": 0.09221373498439789, "learning_rate": 0.002999961149773447, "loss": 2.3186, "step": 3380 }, { "epoch": 0.02238550472729188, "grad_norm": 0.08974644541740417, "learning_rate": 0.0029999564589422542, "loss": 2.3115, "step": 3400 }, { "epoch": 0.022517184166864185, "grad_norm": 0.09186951071023941, "learning_rate": 0.0029999515008325484, "loss": 2.3165, "step": 3420 }, { "epoch": 0.02264886360643649, "grad_norm": 0.08975733816623688, "learning_rate": 0.002999946275445213, "loss": 2.3027, "step": 3440 }, { "epoch": 0.022780543046008798, "grad_norm": 0.08940092474222183, "learning_rate": 0.0029999407827811797, "loss": 2.3092, "step": 3460 }, { "epoch": 0.022912222485581103, "grad_norm": 0.08854611217975616, "learning_rate": 0.0029999350228414262, "loss": 2.3091, "step": 3480 }, { "epoch": 0.023043901925153407, "grad_norm": 0.10679975897073746, "learning_rate": 0.0029999289956269804, "loss": 2.2952, "step": 3500 }, { "epoch": 0.023175581364725712, "grad_norm": 0.08808766305446625, "learning_rate": 0.002999922701138914, "loss": 2.294, "step": 3520 }, { "epoch": 0.023307260804298017, "grad_norm": 0.0875706821680069, "learning_rate": 0.0029999161393783513, "loss": 2.2998, "step": 3540 }, { "epoch": 0.02343894024387032, "grad_norm": 0.0930817723274231, "learning_rate": 0.0029999093103464593, "loss": 2.302, "step": 3560 }, { "epoch": 0.023570619683442626, "grad_norm": 0.08741556853055954, "learning_rate": 0.0029999022140444562, "loss": 2.2977, "step": 3580 }, { "epoch": 0.02370229912301493, "grad_norm": 0.08739639818668365, "learning_rate": 0.002999894850473606, "loss": 2.2979, "step": 3600 }, { "epoch": 0.023833978562587236, "grad_norm": 0.08801335841417313, "learning_rate": 0.0029998872196352207, "loss": 2.2972, "step": 3620 }, { "epoch": 0.023965658002159544, "grad_norm": 0.08532336354255676, "learning_rate": 0.0029998793215306606, "loss": 2.2853, "step": 3640 }, { "epoch": 0.02409733744173185, "grad_norm": 0.08780607581138611, "learning_rate": 0.0029998711561613324, "loss": 2.2747, "step": 3660 }, { "epoch": 0.024229016881304154, "grad_norm": 0.08572492003440857, "learning_rate": 0.0029998627235286917, "loss": 2.2817, "step": 3680 }, { "epoch": 0.02436069632087646, "grad_norm": 0.0868530198931694, "learning_rate": 0.0029998540236342405, "loss": 2.2666, "step": 3700 }, { "epoch": 0.024492375760448763, "grad_norm": 0.0859028622508049, "learning_rate": 0.00299984505647953, "loss": 2.2736, "step": 3720 }, { "epoch": 0.024624055200021068, "grad_norm": 0.08333039283752441, "learning_rate": 0.0029998358220661566, "loss": 2.264, "step": 3740 }, { "epoch": 0.024755734639593373, "grad_norm": 0.08496104925870895, "learning_rate": 0.002999826320395767, "loss": 2.2508, "step": 3760 }, { "epoch": 0.024887414079165678, "grad_norm": 0.08279310911893845, "learning_rate": 0.002999816551470054, "loss": 2.2428, "step": 3780 }, { "epoch": 0.025019093518737986, "grad_norm": 0.08103163540363312, "learning_rate": 0.0029998065152907582, "loss": 2.2534, "step": 3800 }, { "epoch": 0.02515077295831029, "grad_norm": 0.08208036422729492, "learning_rate": 0.002999796211859668, "loss": 2.244, "step": 3820 }, { "epoch": 0.025282452397882595, "grad_norm": 0.08271029591560364, "learning_rate": 0.0029997856411786194, "loss": 2.2451, "step": 3840 }, { "epoch": 0.0254141318374549, "grad_norm": 0.08439147472381592, "learning_rate": 0.002999774803249496, "loss": 2.2411, "step": 3860 }, { "epoch": 0.025545811277027205, "grad_norm": 0.08189237862825394, "learning_rate": 0.0029997636980742294, "loss": 2.2461, "step": 3880 }, { "epoch": 0.02567749071659951, "grad_norm": 0.08077215403318405, "learning_rate": 0.002999752325654798, "loss": 2.2334, "step": 3900 }, { "epoch": 0.025809170156171814, "grad_norm": 0.07819052785634995, "learning_rate": 0.002999740685993228, "loss": 2.2288, "step": 3920 }, { "epoch": 0.02594084959574412, "grad_norm": 0.08109986782073975, "learning_rate": 0.002999728779091594, "loss": 2.2333, "step": 3940 }, { "epoch": 0.026072529035316427, "grad_norm": 0.0791846290230751, "learning_rate": 0.0029997166049520172, "loss": 2.2197, "step": 3960 }, { "epoch": 0.026204208474888732, "grad_norm": 0.08189737796783447, "learning_rate": 0.0029997041635766676, "loss": 2.2204, "step": 3980 }, { "epoch": 0.026335887914461037, "grad_norm": 0.08211075514554977, "learning_rate": 0.0029996914549677615, "loss": 2.2199, "step": 4000 }, { "epoch": 0.026335887914461037, "eval_loss": 2.2871885299682617, "eval_runtime": 67.7873, "eval_samples_per_second": 14.752, "eval_steps_per_second": 14.752, "step": 4000 }, { "epoch": 0.02646756735403334, "grad_norm": 0.08011506497859955, "learning_rate": 0.0029996784791275636, "loss": 2.211, "step": 4020 }, { "epoch": 0.026599246793605646, "grad_norm": 0.08271001279354095, "learning_rate": 0.0029996652360583863, "loss": 2.2097, "step": 4040 }, { "epoch": 0.02673092623317795, "grad_norm": 0.08106506615877151, "learning_rate": 0.0029996517257625892, "loss": 2.2117, "step": 4060 }, { "epoch": 0.026862605672750256, "grad_norm": 0.08120162785053253, "learning_rate": 0.0029996379482425803, "loss": 2.2011, "step": 4080 }, { "epoch": 0.02699428511232256, "grad_norm": 0.07838305830955505, "learning_rate": 0.002999623903500814, "loss": 2.209, "step": 4100 }, { "epoch": 0.027125964551894866, "grad_norm": 0.07733200490474701, "learning_rate": 0.0029996095915397927, "loss": 2.2049, "step": 4120 }, { "epoch": 0.027257643991467174, "grad_norm": 0.08035876601934433, "learning_rate": 0.002999595012362067, "loss": 2.2351, "step": 4140 }, { "epoch": 0.02738932343103948, "grad_norm": 0.07693365216255188, "learning_rate": 0.0029995801659702353, "loss": 2.2437, "step": 4160 }, { "epoch": 0.027521002870611783, "grad_norm": 0.07832279056310654, "learning_rate": 0.002999565052366942, "loss": 2.2516, "step": 4180 }, { "epoch": 0.027652682310184088, "grad_norm": 0.07737457007169724, "learning_rate": 0.0029995496715548814, "loss": 2.2528, "step": 4200 }, { "epoch": 0.027784361749756393, "grad_norm": 0.07880548387765884, "learning_rate": 0.0029995340235367935, "loss": 2.2481, "step": 4220 }, { "epoch": 0.027916041189328698, "grad_norm": 0.07748763263225555, "learning_rate": 0.0029995181083154665, "loss": 2.2366, "step": 4240 }, { "epoch": 0.028047720628901002, "grad_norm": 0.07669378817081451, "learning_rate": 0.0029995019258937366, "loss": 2.2354, "step": 4260 }, { "epoch": 0.028179400068473307, "grad_norm": 0.07612152397632599, "learning_rate": 0.0029994854762744874, "loss": 2.2306, "step": 4280 }, { "epoch": 0.028311079508045615, "grad_norm": 0.07380878925323486, "learning_rate": 0.0029994687594606505, "loss": 2.2222, "step": 4300 }, { "epoch": 0.02844275894761792, "grad_norm": 0.08108644932508469, "learning_rate": 0.0029994517754552037, "loss": 2.2188, "step": 4320 }, { "epoch": 0.028574438387190225, "grad_norm": 0.07742933928966522, "learning_rate": 0.002999434524261174, "loss": 2.2244, "step": 4340 }, { "epoch": 0.02870611782676253, "grad_norm": 0.07378648966550827, "learning_rate": 0.0029994170058816358, "loss": 2.2179, "step": 4360 }, { "epoch": 0.028837797266334834, "grad_norm": 0.07612361758947372, "learning_rate": 0.0029993992203197098, "loss": 2.215, "step": 4380 }, { "epoch": 0.02896947670590714, "grad_norm": 0.07602405548095703, "learning_rate": 0.0029993811675785654, "loss": 2.2174, "step": 4400 }, { "epoch": 0.029101156145479444, "grad_norm": 0.07372742891311646, "learning_rate": 0.00299936284766142, "loss": 2.2115, "step": 4420 }, { "epoch": 0.02923283558505175, "grad_norm": 0.07210436463356018, "learning_rate": 0.002999344260571538, "loss": 2.2031, "step": 4440 }, { "epoch": 0.029364515024624054, "grad_norm": 0.07500762492418289, "learning_rate": 0.002999325406312231, "loss": 2.2029, "step": 4460 }, { "epoch": 0.029496194464196362, "grad_norm": 0.0756341964006424, "learning_rate": 0.0029993062848868582, "loss": 2.2036, "step": 4480 }, { "epoch": 0.029627873903768667, "grad_norm": 0.07349260151386261, "learning_rate": 0.0029992868962988284, "loss": 2.199, "step": 4500 }, { "epoch": 0.02975955334334097, "grad_norm": 0.07115154713392258, "learning_rate": 0.002999267240551595, "loss": 2.1924, "step": 4520 }, { "epoch": 0.029891232782913276, "grad_norm": 0.07597554475069046, "learning_rate": 0.0029992473176486613, "loss": 2.2, "step": 4540 }, { "epoch": 0.03002291222248558, "grad_norm": 0.07525033503770828, "learning_rate": 0.0029992271275935773, "loss": 2.19, "step": 4560 }, { "epoch": 0.030154591662057886, "grad_norm": 0.07225248217582703, "learning_rate": 0.0029992066703899405, "loss": 2.1817, "step": 4580 }, { "epoch": 0.03028627110163019, "grad_norm": 0.07293014973402023, "learning_rate": 0.002999185946041396, "loss": 2.1886, "step": 4600 }, { "epoch": 0.030417950541202495, "grad_norm": 0.07140370458364487, "learning_rate": 0.002999164954551637, "loss": 2.1811, "step": 4620 }, { "epoch": 0.030549629980774803, "grad_norm": 0.0731213241815567, "learning_rate": 0.0029991436959244037, "loss": 2.1827, "step": 4640 }, { "epoch": 0.030681309420347108, "grad_norm": 0.06939541548490524, "learning_rate": 0.0029991221701634843, "loss": 2.1807, "step": 4660 }, { "epoch": 0.030812988859919413, "grad_norm": 0.0718071386218071, "learning_rate": 0.0029991003772727146, "loss": 2.1807, "step": 4680 }, { "epoch": 0.030944668299491718, "grad_norm": 0.0721597746014595, "learning_rate": 0.002999078317255978, "loss": 2.1679, "step": 4700 }, { "epoch": 0.031076347739064022, "grad_norm": 0.388390451669693, "learning_rate": 0.0029990559901172053, "loss": 2.4076, "step": 4720 }, { "epoch": 0.031208027178636327, "grad_norm": 0.12360863387584686, "learning_rate": 0.0029990333958603748, "loss": 2.7131, "step": 4740 }, { "epoch": 0.03133970661820863, "grad_norm": 0.088360495865345, "learning_rate": 0.002999010534489513, "loss": 2.425, "step": 4760 }, { "epoch": 0.03147138605778094, "grad_norm": 0.07668942958116531, "learning_rate": 0.002998987406008693, "loss": 2.3163, "step": 4780 }, { "epoch": 0.03160306549735324, "grad_norm": 0.07627064734697342, "learning_rate": 0.0029989640104220363, "loss": 2.2667, "step": 4800 }, { "epoch": 0.031734744936925546, "grad_norm": 0.07259105890989304, "learning_rate": 0.0029989403477337123, "loss": 2.2479, "step": 4820 }, { "epoch": 0.03186642437649785, "grad_norm": 0.06848350912332535, "learning_rate": 0.0029989164179479366, "loss": 2.2312, "step": 4840 }, { "epoch": 0.031998103816070156, "grad_norm": 0.0695989802479744, "learning_rate": 0.0029988922210689743, "loss": 2.2274, "step": 4860 }, { "epoch": 0.03212978325564246, "grad_norm": 0.07058060169219971, "learning_rate": 0.002998867757101136, "loss": 2.2065, "step": 4880 }, { "epoch": 0.03226146269521477, "grad_norm": 0.07192632555961609, "learning_rate": 0.0029988430260487822, "loss": 2.1976, "step": 4900 }, { "epoch": 0.03239314213478708, "grad_norm": 0.07093453407287598, "learning_rate": 0.002998818027916318, "loss": 2.1925, "step": 4920 }, { "epoch": 0.03252482157435938, "grad_norm": 0.0686832144856453, "learning_rate": 0.002998792762708199, "loss": 2.1805, "step": 4940 }, { "epoch": 0.03265650101393169, "grad_norm": 0.06718004494905472, "learning_rate": 0.0029987672304289275, "loss": 2.177, "step": 4960 }, { "epoch": 0.03278818045350399, "grad_norm": 0.07362579554319382, "learning_rate": 0.0029987414310830526, "loss": 2.173, "step": 4980 }, { "epoch": 0.032919859893076296, "grad_norm": 0.06656539440155029, "learning_rate": 0.0029987153646751715, "loss": 2.1698, "step": 5000 }, { "epoch": 0.032919859893076296, "eval_loss": 2.136354446411133, "eval_runtime": 67.5662, "eval_samples_per_second": 14.8, "eval_steps_per_second": 14.8, "step": 5000 }, { "epoch": 0.0330515393326486, "grad_norm": 0.06965313106775284, "learning_rate": 0.0029986890312099284, "loss": 2.1551, "step": 5020 }, { "epoch": 0.033183218772220906, "grad_norm": 0.06893343478441238, "learning_rate": 0.0029986624306920177, "loss": 2.1559, "step": 5040 }, { "epoch": 0.03331489821179321, "grad_norm": 0.06808198988437653, "learning_rate": 0.0029986355631261767, "loss": 2.1516, "step": 5060 }, { "epoch": 0.033446577651365515, "grad_norm": 0.06501699984073639, "learning_rate": 0.002998608428517195, "loss": 2.1496, "step": 5080 }, { "epoch": 0.03357825709093782, "grad_norm": 0.0687108114361763, "learning_rate": 0.002998581026869907, "loss": 2.1428, "step": 5100 }, { "epoch": 0.033709936530510125, "grad_norm": 0.06481294333934784, "learning_rate": 0.0029985533581891955, "loss": 2.1408, "step": 5120 }, { "epoch": 0.03384161597008243, "grad_norm": 0.06615699827671051, "learning_rate": 0.002998525422479991, "loss": 2.1389, "step": 5140 }, { "epoch": 0.033973295409654734, "grad_norm": 0.06763967871665955, "learning_rate": 0.00299849721974727, "loss": 2.1272, "step": 5160 }, { "epoch": 0.03410497484922704, "grad_norm": 0.0660347044467926, "learning_rate": 0.0029984687499960603, "loss": 2.1297, "step": 5180 }, { "epoch": 0.034236654288799344, "grad_norm": 0.06650801748037338, "learning_rate": 0.002998440013231433, "loss": 2.131, "step": 5200 }, { "epoch": 0.03436833372837165, "grad_norm": 0.06661241501569748, "learning_rate": 0.0029984110094585102, "loss": 2.1246, "step": 5220 }, { "epoch": 0.03450001316794396, "grad_norm": 0.06411544978618622, "learning_rate": 0.0029983817386824586, "loss": 2.1241, "step": 5240 }, { "epoch": 0.034631692607516265, "grad_norm": 0.06469565629959106, "learning_rate": 0.0029983522009084953, "loss": 2.1161, "step": 5260 }, { "epoch": 0.03476337204708857, "grad_norm": 0.06469576805830002, "learning_rate": 0.0029983223961418835, "loss": 2.121, "step": 5280 }, { "epoch": 0.034895051486660875, "grad_norm": 0.06342877447605133, "learning_rate": 0.002998292324387933, "loss": 2.1244, "step": 5300 }, { "epoch": 0.03502673092623318, "grad_norm": 0.06592860817909241, "learning_rate": 0.0029982619856520035, "loss": 2.1312, "step": 5320 }, { "epoch": 0.035158410365805484, "grad_norm": 0.06745469570159912, "learning_rate": 0.0029982313799395005, "loss": 2.1259, "step": 5340 }, { "epoch": 0.03529008980537779, "grad_norm": 0.06721679121255875, "learning_rate": 0.0029982005072558774, "loss": 2.1212, "step": 5360 }, { "epoch": 0.035421769244950094, "grad_norm": 0.0677921324968338, "learning_rate": 0.0029981693676066367, "loss": 2.1187, "step": 5380 }, { "epoch": 0.0355534486845224, "grad_norm": 0.06510468572378159, "learning_rate": 0.0029981379609973257, "loss": 2.1186, "step": 5400 }, { "epoch": 0.0356851281240947, "grad_norm": 0.06507667899131775, "learning_rate": 0.002998106287433542, "loss": 2.1085, "step": 5420 }, { "epoch": 0.03581680756366701, "grad_norm": 0.06307834386825562, "learning_rate": 0.0029980743469209285, "loss": 2.1086, "step": 5440 }, { "epoch": 0.03594848700323931, "grad_norm": 0.06396503001451492, "learning_rate": 0.0029980421394651775, "loss": 2.1012, "step": 5460 }, { "epoch": 0.03608016644281162, "grad_norm": 0.0639200434088707, "learning_rate": 0.0029980096650720277, "loss": 2.1048, "step": 5480 }, { "epoch": 0.03621184588238392, "grad_norm": 0.06461615860462189, "learning_rate": 0.0029979769237472656, "loss": 2.098, "step": 5500 }, { "epoch": 0.03634352532195623, "grad_norm": 0.06527513265609741, "learning_rate": 0.0029979439154967256, "loss": 2.0921, "step": 5520 }, { "epoch": 0.03647520476152853, "grad_norm": 0.06093462184071541, "learning_rate": 0.0029979106403262897, "loss": 2.0834, "step": 5540 }, { "epoch": 0.036606884201100844, "grad_norm": 0.06476835161447525, "learning_rate": 0.002997877098241887, "loss": 2.0851, "step": 5560 }, { "epoch": 0.03673856364067315, "grad_norm": 0.06311192363500595, "learning_rate": 0.002997843289249494, "loss": 2.0799, "step": 5580 }, { "epoch": 0.03687024308024545, "grad_norm": 0.06339168548583984, "learning_rate": 0.002997809213355136, "loss": 2.0858, "step": 5600 }, { "epoch": 0.03700192251981776, "grad_norm": 0.06146325170993805, "learning_rate": 0.002997774870564884, "loss": 2.0948, "step": 5620 }, { "epoch": 0.03713360195939006, "grad_norm": 0.06187060475349426, "learning_rate": 0.0029977402608848585, "loss": 2.0822, "step": 5640 }, { "epoch": 0.03726528139896237, "grad_norm": 0.06805236637592316, "learning_rate": 0.0029977053843212266, "loss": 2.0759, "step": 5660 }, { "epoch": 0.03739696083853467, "grad_norm": 0.06448160111904144, "learning_rate": 0.002997670240880202, "loss": 2.08, "step": 5680 }, { "epoch": 0.03752864027810698, "grad_norm": 0.06372448801994324, "learning_rate": 0.002997634830568048, "loss": 2.0823, "step": 5700 }, { "epoch": 0.03766031971767928, "grad_norm": 0.061139971017837524, "learning_rate": 0.0029975991533910734, "loss": 2.0742, "step": 5720 }, { "epoch": 0.037791999157251586, "grad_norm": 0.06403601914644241, "learning_rate": 0.0029975632093556365, "loss": 2.0664, "step": 5740 }, { "epoch": 0.03792367859682389, "grad_norm": 0.06160760670900345, "learning_rate": 0.002997526998468142, "loss": 2.0591, "step": 5760 }, { "epoch": 0.038055358036396196, "grad_norm": 0.06119397282600403, "learning_rate": 0.0029974905207350417, "loss": 2.0637, "step": 5780 }, { "epoch": 0.0381870374759685, "grad_norm": 0.062456753104925156, "learning_rate": 0.0029974537761628364, "loss": 2.0611, "step": 5800 }, { "epoch": 0.038318716915540806, "grad_norm": 0.06182549521327019, "learning_rate": 0.002997416764758073, "loss": 2.0619, "step": 5820 }, { "epoch": 0.03845039635511311, "grad_norm": 0.06361284852027893, "learning_rate": 0.002997379486527347, "loss": 2.054, "step": 5840 }, { "epoch": 0.038582075794685415, "grad_norm": 0.06169150397181511, "learning_rate": 0.0029973419414773017, "loss": 2.058, "step": 5860 }, { "epoch": 0.03871375523425772, "grad_norm": 0.06227455288171768, "learning_rate": 0.002997304129614625, "loss": 2.0513, "step": 5880 }, { "epoch": 0.03884543467383003, "grad_norm": 0.06137228012084961, "learning_rate": 0.0029972660509460574, "loss": 2.0706, "step": 5900 }, { "epoch": 0.038977114113402336, "grad_norm": 0.06067802384495735, "learning_rate": 0.0029972277054783826, "loss": 2.0988, "step": 5920 }, { "epoch": 0.03910879355297464, "grad_norm": 0.062081821262836456, "learning_rate": 0.0029971890932184338, "loss": 2.1072, "step": 5940 }, { "epoch": 0.039240472992546946, "grad_norm": 0.058524634689092636, "learning_rate": 0.0029971502141730912, "loss": 2.112, "step": 5960 }, { "epoch": 0.03937215243211925, "grad_norm": 0.06115134805440903, "learning_rate": 0.0029971110683492826, "loss": 2.1138, "step": 5980 }, { "epoch": 0.039503831871691555, "grad_norm": 0.05962108075618744, "learning_rate": 0.0029970716557539837, "loss": 2.1112, "step": 6000 }, { "epoch": 0.039503831871691555, "eval_loss": 2.0984599590301514, "eval_runtime": 67.374, "eval_samples_per_second": 14.843, "eval_steps_per_second": 14.843, "step": 6000 }, { "epoch": 0.03963551131126386, "grad_norm": 0.06020989269018173, "learning_rate": 0.0029970319763942175, "loss": 2.1038, "step": 6020 }, { "epoch": 0.039767190750836165, "grad_norm": 0.059578102082014084, "learning_rate": 0.0029969920302770543, "loss": 2.0974, "step": 6040 }, { "epoch": 0.03989887019040847, "grad_norm": 0.05818217247724533, "learning_rate": 0.002996951817409612, "loss": 2.1037, "step": 6060 }, { "epoch": 0.040030549629980774, "grad_norm": 0.05842572823166847, "learning_rate": 0.0029969113377990566, "loss": 2.0998, "step": 6080 }, { "epoch": 0.04016222906955308, "grad_norm": 0.057952892035245895, "learning_rate": 0.002996870591452601, "loss": 2.1024, "step": 6100 }, { "epoch": 0.040293908509125384, "grad_norm": 0.0585886612534523, "learning_rate": 0.0029968295783775055, "loss": 2.0989, "step": 6120 }, { "epoch": 0.04042558794869769, "grad_norm": 0.061875827610492706, "learning_rate": 0.0029967882985810785, "loss": 2.0848, "step": 6140 }, { "epoch": 0.040557267388269994, "grad_norm": 0.059371497482061386, "learning_rate": 0.002996746752070676, "loss": 2.0865, "step": 6160 }, { "epoch": 0.0406889468278423, "grad_norm": 0.06270122528076172, "learning_rate": 0.002996704938853701, "loss": 2.0847, "step": 6180 }, { "epoch": 0.0408206262674146, "grad_norm": 0.05946968123316765, "learning_rate": 0.002996662858937604, "loss": 2.0773, "step": 6200 }, { "epoch": 0.04095230570698691, "grad_norm": 0.05964416265487671, "learning_rate": 0.002996620512329883, "loss": 2.0827, "step": 6220 }, { "epoch": 0.04108398514655922, "grad_norm": 0.059607379138469696, "learning_rate": 0.0029965778990380847, "loss": 2.0802, "step": 6240 }, { "epoch": 0.041215664586131524, "grad_norm": 0.059771690517663956, "learning_rate": 0.0029965350190698016, "loss": 2.0753, "step": 6260 }, { "epoch": 0.04134734402570383, "grad_norm": 0.05873079225420952, "learning_rate": 0.002996491872432675, "loss": 2.0742, "step": 6280 }, { "epoch": 0.041479023465276134, "grad_norm": 0.05816845968365669, "learning_rate": 0.0029964484591343933, "loss": 2.0689, "step": 6300 }, { "epoch": 0.04161070290484844, "grad_norm": 0.057672835886478424, "learning_rate": 0.002996404779182692, "loss": 2.0648, "step": 6320 }, { "epoch": 0.04174238234442074, "grad_norm": 0.06043649837374687, "learning_rate": 0.0029963608325853544, "loss": 2.0719, "step": 6340 }, { "epoch": 0.04187406178399305, "grad_norm": 0.05902590975165367, "learning_rate": 0.0029963166193502115, "loss": 2.0662, "step": 6360 }, { "epoch": 0.04200574122356535, "grad_norm": 0.061324600130319595, "learning_rate": 0.002996272139485142, "loss": 2.0672, "step": 6380 }, { "epoch": 0.04213742066313766, "grad_norm": 0.05997491627931595, "learning_rate": 0.002996227392998071, "loss": 2.0733, "step": 6400 }, { "epoch": 0.04226910010270996, "grad_norm": 0.0597202442586422, "learning_rate": 0.0029961823798969733, "loss": 2.062, "step": 6420 }, { "epoch": 0.04240077954228227, "grad_norm": 0.10704315453767776, "learning_rate": 0.002996137100189868, "loss": 2.0669, "step": 6440 }, { "epoch": 0.04253245898185457, "grad_norm": 0.056581802666187286, "learning_rate": 0.0029960915538848254, "loss": 2.0585, "step": 6460 }, { "epoch": 0.04266413842142688, "grad_norm": 0.0565234012901783, "learning_rate": 0.00299604574098996, "loss": 2.0554, "step": 6480 }, { "epoch": 0.04279581786099918, "grad_norm": 0.056596871465444565, "learning_rate": 0.0029959996615134357, "loss": 2.077, "step": 6500 }, { "epoch": 0.042927497300571486, "grad_norm": 0.05787625536322594, "learning_rate": 0.002995953315463464, "loss": 2.0741, "step": 6520 }, { "epoch": 0.04305917674014379, "grad_norm": 0.059064172208309174, "learning_rate": 0.002995906702848302, "loss": 2.0792, "step": 6540 }, { "epoch": 0.043190856179716096, "grad_norm": 0.057197242975234985, "learning_rate": 0.0029958598236762574, "loss": 2.0702, "step": 6560 }, { "epoch": 0.04332253561928841, "grad_norm": 0.05579278990626335, "learning_rate": 0.002995812677955683, "loss": 2.0677, "step": 6580 }, { "epoch": 0.04345421505886071, "grad_norm": 0.05777699500322342, "learning_rate": 0.0029957652656949787, "loss": 2.0649, "step": 6600 }, { "epoch": 0.04358589449843302, "grad_norm": 0.05634402483701706, "learning_rate": 0.002995717586902594, "loss": 2.0681, "step": 6620 }, { "epoch": 0.04371757393800532, "grad_norm": 0.05572090670466423, "learning_rate": 0.0029956696415870242, "loss": 2.0587, "step": 6640 }, { "epoch": 0.04384925337757763, "grad_norm": 0.05806443840265274, "learning_rate": 0.0029956214297568134, "loss": 2.0555, "step": 6660 }, { "epoch": 0.04398093281714993, "grad_norm": 0.05726337805390358, "learning_rate": 0.0029955729514205523, "loss": 2.0474, "step": 6680 }, { "epoch": 0.044112612256722236, "grad_norm": 0.05729576200246811, "learning_rate": 0.0029955242065868794, "loss": 2.0489, "step": 6700 }, { "epoch": 0.04424429169629454, "grad_norm": 0.06136414781212807, "learning_rate": 0.0029954751952644795, "loss": 2.0509, "step": 6720 }, { "epoch": 0.044375971135866846, "grad_norm": 0.058006297796964645, "learning_rate": 0.0029954259174620875, "loss": 2.0515, "step": 6740 }, { "epoch": 0.04450765057543915, "grad_norm": 0.05813615396618843, "learning_rate": 0.0029953763731884833, "loss": 2.048, "step": 6760 }, { "epoch": 0.044639330015011455, "grad_norm": 0.05697380378842354, "learning_rate": 0.0029953265624524956, "loss": 2.0433, "step": 6780 }, { "epoch": 0.04477100945458376, "grad_norm": 0.05840064957737923, "learning_rate": 0.002995276485263, "loss": 2.0405, "step": 6800 }, { "epoch": 0.044902688894156065, "grad_norm": 0.05951813980937004, "learning_rate": 0.00299522614162892, "loss": 2.0418, "step": 6820 }, { "epoch": 0.04503436833372837, "grad_norm": 0.05788157880306244, "learning_rate": 0.0029951755315592264, "loss": 2.0378, "step": 6840 }, { "epoch": 0.045166047773300674, "grad_norm": 0.05446796864271164, "learning_rate": 0.002995124655062937, "loss": 2.0412, "step": 6860 }, { "epoch": 0.04529772721287298, "grad_norm": 0.05822540074586868, "learning_rate": 0.002995073512149118, "loss": 2.0357, "step": 6880 }, { "epoch": 0.045429406652445284, "grad_norm": 0.0586545467376709, "learning_rate": 0.002995022102826883, "loss": 2.0284, "step": 6900 }, { "epoch": 0.045561086092017596, "grad_norm": 0.056676048785448074, "learning_rate": 0.0029949704271053914, "loss": 2.0363, "step": 6920 }, { "epoch": 0.0456927655315899, "grad_norm": 0.0642879530787468, "learning_rate": 0.0029949184849938524, "loss": 2.0271, "step": 6940 }, { "epoch": 0.045824444971162205, "grad_norm": 0.054941147565841675, "learning_rate": 0.002994866276501521, "loss": 2.0297, "step": 6960 }, { "epoch": 0.04595612441073451, "grad_norm": 0.057689156383275986, "learning_rate": 0.0029948138016377005, "loss": 2.032, "step": 6980 }, { "epoch": 0.046087803850306815, "grad_norm": 0.05917928367853165, "learning_rate": 0.0029947610604117423, "loss": 2.0272, "step": 7000 }, { "epoch": 0.046087803850306815, "eval_loss": 1.9085378646850586, "eval_runtime": 68.9073, "eval_samples_per_second": 14.512, "eval_steps_per_second": 14.512, "step": 7000 }, { "epoch": 0.04621948328987912, "grad_norm": 0.05777193233370781, "learning_rate": 0.002994708052833043, "loss": 2.0243, "step": 7020 }, { "epoch": 0.046351162729451424, "grad_norm": 0.056196246296167374, "learning_rate": 0.0029946547789110487, "loss": 2.0237, "step": 7040 }, { "epoch": 0.04648284216902373, "grad_norm": 0.05449189990758896, "learning_rate": 0.002994601238655252, "loss": 2.0229, "step": 7060 }, { "epoch": 0.046614521608596034, "grad_norm": 0.05653191730380058, "learning_rate": 0.0029945474320751944, "loss": 2.0243, "step": 7080 }, { "epoch": 0.04674620104816834, "grad_norm": 0.05763334780931473, "learning_rate": 0.0029944933591804623, "loss": 2.0279, "step": 7100 }, { "epoch": 0.04687788048774064, "grad_norm": 0.05874243751168251, "learning_rate": 0.002994439019980692, "loss": 2.0081, "step": 7120 }, { "epoch": 0.04700955992731295, "grad_norm": 0.06031106784939766, "learning_rate": 0.0029943844144855658, "loss": 1.9983, "step": 7140 }, { "epoch": 0.04714123936688525, "grad_norm": 0.05547622591257095, "learning_rate": 0.002994329542704814, "loss": 1.9954, "step": 7160 }, { "epoch": 0.04727291880645756, "grad_norm": 0.05814756825566292, "learning_rate": 0.002994274404648214, "loss": 1.9944, "step": 7180 }, { "epoch": 0.04740459824602986, "grad_norm": 0.05669866129755974, "learning_rate": 0.002994219000325591, "loss": 1.9852, "step": 7200 }, { "epoch": 0.04753627768560217, "grad_norm": 0.05776144191622734, "learning_rate": 0.0029941633297468177, "loss": 1.9788, "step": 7220 }, { "epoch": 0.04766795712517447, "grad_norm": 0.05656075105071068, "learning_rate": 0.002994107392921814, "loss": 1.9872, "step": 7240 }, { "epoch": 0.047799636564746784, "grad_norm": 0.05627656355500221, "learning_rate": 0.0029940511898605476, "loss": 1.9787, "step": 7260 }, { "epoch": 0.04793131600431909, "grad_norm": 0.05843086168169975, "learning_rate": 0.002993994720573033, "loss": 1.9782, "step": 7280 }, { "epoch": 0.04806299544389139, "grad_norm": 0.05826539546251297, "learning_rate": 0.002993937985069333, "loss": 1.9819, "step": 7300 }, { "epoch": 0.0481946748834637, "grad_norm": 0.06292963773012161, "learning_rate": 0.0029938809833595565, "loss": 1.9696, "step": 7320 }, { "epoch": 0.048326354323036, "grad_norm": 0.057060081511735916, "learning_rate": 0.0029938237154538616, "loss": 1.9633, "step": 7340 }, { "epoch": 0.04845803376260831, "grad_norm": 0.06161024048924446, "learning_rate": 0.0029937661813624525, "loss": 1.9623, "step": 7360 }, { "epoch": 0.04858971320218061, "grad_norm": 0.05789177492260933, "learning_rate": 0.0029937083810955807, "loss": 1.9724, "step": 7380 }, { "epoch": 0.04872139264175292, "grad_norm": 0.055680371820926666, "learning_rate": 0.0029936503146635466, "loss": 1.9657, "step": 7400 }, { "epoch": 0.04885307208132522, "grad_norm": 0.05655812472105026, "learning_rate": 0.0029935919820766967, "loss": 1.9664, "step": 7420 }, { "epoch": 0.048984751520897526, "grad_norm": 0.05809199810028076, "learning_rate": 0.0029935333833454253, "loss": 1.9728, "step": 7440 }, { "epoch": 0.04911643096046983, "grad_norm": 0.057024531066417694, "learning_rate": 0.0029934745184801745, "loss": 1.9637, "step": 7460 }, { "epoch": 0.049248110400042136, "grad_norm": 0.05507376790046692, "learning_rate": 0.0029934153874914327, "loss": 1.9646, "step": 7480 }, { "epoch": 0.04937978983961444, "grad_norm": 0.0562782883644104, "learning_rate": 0.0029933559903897373, "loss": 1.9642, "step": 7500 }, { "epoch": 0.049511469279186746, "grad_norm": 0.05876750499010086, "learning_rate": 0.002993296327185672, "loss": 1.96, "step": 7520 }, { "epoch": 0.04964314871875905, "grad_norm": 0.0542948879301548, "learning_rate": 0.0029932363978898684, "loss": 1.957, "step": 7540 }, { "epoch": 0.049774828158331355, "grad_norm": 0.05514788627624512, "learning_rate": 0.0029931762025130052, "loss": 1.956, "step": 7560 }, { "epoch": 0.04990650759790366, "grad_norm": 0.055275484919548035, "learning_rate": 0.0029931157410658087, "loss": 1.9586, "step": 7580 }, { "epoch": 0.05003818703747597, "grad_norm": 0.06243159994482994, "learning_rate": 0.0029930550135590524, "loss": 1.9528, "step": 7600 }, { "epoch": 0.050169866477048276, "grad_norm": 0.055291496217250824, "learning_rate": 0.0029929940200035575, "loss": 1.9535, "step": 7620 }, { "epoch": 0.05030154591662058, "grad_norm": 0.0554860420525074, "learning_rate": 0.002992932760410193, "loss": 1.9573, "step": 7640 }, { "epoch": 0.050433225356192886, "grad_norm": 0.058307211846113205, "learning_rate": 0.0029928712347898736, "loss": 1.9489, "step": 7660 }, { "epoch": 0.05056490479576519, "grad_norm": 0.057058483362197876, "learning_rate": 0.0029928094431535637, "loss": 1.9564, "step": 7680 }, { "epoch": 0.050696584235337495, "grad_norm": 0.055521443486213684, "learning_rate": 0.0029927473855122736, "loss": 1.967, "step": 7700 }, { "epoch": 0.0508282636749098, "grad_norm": 0.05751781165599823, "learning_rate": 0.0029926850618770618, "loss": 1.9694, "step": 7720 }, { "epoch": 0.050959943114482105, "grad_norm": 0.05835530161857605, "learning_rate": 0.002992622472259033, "loss": 1.9706, "step": 7740 }, { "epoch": 0.05109162255405441, "grad_norm": 0.05460565164685249, "learning_rate": 0.0029925596166693403, "loss": 1.9652, "step": 7760 }, { "epoch": 0.051223301993626714, "grad_norm": 0.05999600142240524, "learning_rate": 0.0029924964951191847, "loss": 1.9628, "step": 7780 }, { "epoch": 0.05135498143319902, "grad_norm": 0.05896478518843651, "learning_rate": 0.0029924331076198133, "loss": 1.9625, "step": 7800 }, { "epoch": 0.051486660872771324, "grad_norm": 0.05324622988700867, "learning_rate": 0.0029923694541825214, "loss": 1.9593, "step": 7820 }, { "epoch": 0.05161834031234363, "grad_norm": 0.056877490133047104, "learning_rate": 0.002992305534818651, "loss": 1.9547, "step": 7840 }, { "epoch": 0.051750019751915934, "grad_norm": 0.05267615243792534, "learning_rate": 0.0029922413495395927, "loss": 1.9584, "step": 7860 }, { "epoch": 0.05188169919148824, "grad_norm": 0.05451074242591858, "learning_rate": 0.002992176898356783, "loss": 1.957, "step": 7880 }, { "epoch": 0.05201337863106054, "grad_norm": 0.0581444576382637, "learning_rate": 0.0029921121812817074, "loss": 1.948, "step": 7900 }, { "epoch": 0.052145058070632855, "grad_norm": 0.0567544661462307, "learning_rate": 0.0029920471983258964, "loss": 1.947, "step": 7920 }, { "epoch": 0.05227673751020516, "grad_norm": 0.05727114900946617, "learning_rate": 0.0029919819495009313, "loss": 1.9494, "step": 7940 }, { "epoch": 0.052408416949777464, "grad_norm": 0.05433478206396103, "learning_rate": 0.002991916434818437, "loss": 1.9443, "step": 7960 }, { "epoch": 0.05254009638934977, "grad_norm": 0.055305104702711105, "learning_rate": 0.002991850654290089, "loss": 1.9461, "step": 7980 }, { "epoch": 0.052671775828922074, "grad_norm": 0.056631047278642654, "learning_rate": 0.0029917846079276084, "loss": 1.9424, "step": 8000 }, { "epoch": 0.052671775828922074, "eval_loss": 1.780034065246582, "eval_runtime": 67.4451, "eval_samples_per_second": 14.827, "eval_steps_per_second": 14.827, "step": 8000 }, { "epoch": 0.05280345526849438, "grad_norm": 0.06008228659629822, "learning_rate": 0.002991718295742763, "loss": 1.9402, "step": 8020 }, { "epoch": 0.05293513470806668, "grad_norm": 0.05446495860815048, "learning_rate": 0.0029916517177473708, "loss": 1.942, "step": 8040 }, { "epoch": 0.05306681414763899, "grad_norm": 0.06055721640586853, "learning_rate": 0.002991584873953294, "loss": 1.9409, "step": 8060 }, { "epoch": 0.05319849358721129, "grad_norm": 0.056658077985048294, "learning_rate": 0.002991517764372444, "loss": 1.9384, "step": 8080 }, { "epoch": 0.0533301730267836, "grad_norm": 0.054917097091674805, "learning_rate": 0.00299145038901678, "loss": 1.9312, "step": 8100 }, { "epoch": 0.0534618524663559, "grad_norm": 0.05398482084274292, "learning_rate": 0.0029913827478983057, "loss": 1.9454, "step": 8120 }, { "epoch": 0.05359353190592821, "grad_norm": 0.05773143097758293, "learning_rate": 0.002991314841029076, "loss": 1.9394, "step": 8140 }, { "epoch": 0.05372521134550051, "grad_norm": 0.0562208853662014, "learning_rate": 0.0029912466684211907, "loss": 1.94, "step": 8160 }, { "epoch": 0.05385689078507282, "grad_norm": 0.05213721841573715, "learning_rate": 0.002991178230086797, "loss": 1.928, "step": 8180 }, { "epoch": 0.05398857022464512, "grad_norm": 0.05434253811836243, "learning_rate": 0.0029911095260380903, "loss": 1.9361, "step": 8200 }, { "epoch": 0.054120249664217426, "grad_norm": 0.0537894032895565, "learning_rate": 0.0029910405562873135, "loss": 1.9368, "step": 8220 }, { "epoch": 0.05425192910378973, "grad_norm": 0.055712759494781494, "learning_rate": 0.0029909713208467557, "loss": 1.9253, "step": 8240 }, { "epoch": 0.05438360854336204, "grad_norm": 0.0564916618168354, "learning_rate": 0.0029909018197287543, "loss": 1.936, "step": 8260 }, { "epoch": 0.05451528798293435, "grad_norm": 0.059347622096538544, "learning_rate": 0.002990832052945694, "loss": 1.9872, "step": 8280 }, { "epoch": 0.05464696742250665, "grad_norm": 0.05435614287853241, "learning_rate": 0.002990762020510006, "loss": 2.0069, "step": 8300 }, { "epoch": 0.05477864686207896, "grad_norm": 0.05343768745660782, "learning_rate": 0.0029906917224341704, "loss": 2.0144, "step": 8320 }, { "epoch": 0.05491032630165126, "grad_norm": 0.054454583674669266, "learning_rate": 0.0029906211587307128, "loss": 2.0294, "step": 8340 }, { "epoch": 0.05504200574122357, "grad_norm": 0.05322398245334625, "learning_rate": 0.002990550329412207, "loss": 2.0255, "step": 8360 }, { "epoch": 0.05517368518079587, "grad_norm": 0.0558038055896759, "learning_rate": 0.002990479234491275, "loss": 2.0239, "step": 8380 }, { "epoch": 0.055305364620368176, "grad_norm": 0.0529707595705986, "learning_rate": 0.002990407873980584, "loss": 2.0235, "step": 8400 }, { "epoch": 0.05543704405994048, "grad_norm": 0.049640074372291565, "learning_rate": 0.002990336247892851, "loss": 2.0226, "step": 8420 }, { "epoch": 0.055568723499512786, "grad_norm": 0.05250220373272896, "learning_rate": 0.0029902643562408388, "loss": 2.0082, "step": 8440 }, { "epoch": 0.05570040293908509, "grad_norm": 0.05764392018318176, "learning_rate": 0.0029901921990373574, "loss": 2.0135, "step": 8460 }, { "epoch": 0.055832082378657395, "grad_norm": 0.0569184236228466, "learning_rate": 0.0029901197762952645, "loss": 2.0064, "step": 8480 }, { "epoch": 0.0559637618182297, "grad_norm": 0.05316290259361267, "learning_rate": 0.0029900470880274655, "loss": 1.9979, "step": 8500 }, { "epoch": 0.056095441257802005, "grad_norm": 0.05095953494310379, "learning_rate": 0.002989974134246913, "loss": 2.0072, "step": 8520 }, { "epoch": 0.05622712069737431, "grad_norm": 0.06118274852633476, "learning_rate": 0.002989900914966606, "loss": 2.0055, "step": 8540 }, { "epoch": 0.056358800136946614, "grad_norm": 0.05806516483426094, "learning_rate": 0.0029898274301995926, "loss": 1.9939, "step": 8560 }, { "epoch": 0.05649047957651892, "grad_norm": 0.05719646438956261, "learning_rate": 0.0029897536799589662, "loss": 1.9945, "step": 8580 }, { "epoch": 0.05662215901609123, "grad_norm": 0.05527440831065178, "learning_rate": 0.0029896796642578686, "loss": 1.9894, "step": 8600 }, { "epoch": 0.056753838455663536, "grad_norm": 0.0631207823753357, "learning_rate": 0.002989605383109489, "loss": 1.994, "step": 8620 }, { "epoch": 0.05688551789523584, "grad_norm": 0.054478082805871964, "learning_rate": 0.002989530836527063, "loss": 1.9867, "step": 8640 }, { "epoch": 0.057017197334808145, "grad_norm": 0.05206460878252983, "learning_rate": 0.002989456024523875, "loss": 1.9807, "step": 8660 }, { "epoch": 0.05714887677438045, "grad_norm": 0.05099276080727577, "learning_rate": 0.002989380947113255, "loss": 1.983, "step": 8680 }, { "epoch": 0.057280556213952755, "grad_norm": 0.05928613618016243, "learning_rate": 0.0029893056043085813, "loss": 1.9792, "step": 8700 }, { "epoch": 0.05741223565352506, "grad_norm": 0.04971221461892128, "learning_rate": 0.0029892299961232797, "loss": 1.9756, "step": 8720 }, { "epoch": 0.057543915093097364, "grad_norm": 0.060248006135225296, "learning_rate": 0.002989154122570823, "loss": 1.9837, "step": 8740 }, { "epoch": 0.05767559453266967, "grad_norm": 0.058486610651016235, "learning_rate": 0.0029890779836647305, "loss": 1.9781, "step": 8760 }, { "epoch": 0.057807273972241974, "grad_norm": 0.05129622295498848, "learning_rate": 0.00298900157941857, "loss": 1.972, "step": 8780 }, { "epoch": 0.05793895341181428, "grad_norm": 0.052501507103443146, "learning_rate": 0.002988924909845955, "loss": 1.9731, "step": 8800 }, { "epoch": 0.05807063285138658, "grad_norm": 0.055490028113126755, "learning_rate": 0.0029888479749605487, "loss": 1.9697, "step": 8820 }, { "epoch": 0.05820231229095889, "grad_norm": 0.05250798165798187, "learning_rate": 0.0029887707747760597, "loss": 1.9722, "step": 8840 }, { "epoch": 0.05833399173053119, "grad_norm": 0.053195856511592865, "learning_rate": 0.0029886933093062444, "loss": 1.9829, "step": 8860 }, { "epoch": 0.0584656711701035, "grad_norm": 0.05129017308354378, "learning_rate": 0.002988615578564906, "loss": 1.9818, "step": 8880 }, { "epoch": 0.0585973506096758, "grad_norm": 0.05016680434346199, "learning_rate": 0.0029885375825658956, "loss": 1.9915, "step": 8900 }, { "epoch": 0.05872903004924811, "grad_norm": 0.054276566952466965, "learning_rate": 0.0029884593213231115, "loss": 1.986, "step": 8920 }, { "epoch": 0.05886070948882042, "grad_norm": 0.05341557413339615, "learning_rate": 0.0029883807948504998, "loss": 1.9816, "step": 8940 }, { "epoch": 0.058992388928392724, "grad_norm": 0.05010661855340004, "learning_rate": 0.002988302003162052, "loss": 1.9822, "step": 8960 }, { "epoch": 0.05912406836796503, "grad_norm": 0.06433503329753876, "learning_rate": 0.0029882229462718088, "loss": 1.9838, "step": 8980 }, { "epoch": 0.05925574780753733, "grad_norm": 0.0578884556889534, "learning_rate": 0.002988143624193857, "loss": 1.9786, "step": 9000 }, { "epoch": 0.05925574780753733, "eval_loss": 1.9106996059417725, "eval_runtime": 67.8585, "eval_samples_per_second": 14.737, "eval_steps_per_second": 14.737, "step": 9000 }, { "epoch": 0.05938742724710964, "grad_norm": 0.0511951707303524, "learning_rate": 0.0029880640369423315, "loss": 1.9788, "step": 9020 }, { "epoch": 0.05951910668668194, "grad_norm": 0.04770907759666443, "learning_rate": 0.0029879841845314135, "loss": 1.975, "step": 9040 }, { "epoch": 0.05965078612625425, "grad_norm": 0.052814580500125885, "learning_rate": 0.0029879040669753324, "loss": 1.9674, "step": 9060 }, { "epoch": 0.05978246556582655, "grad_norm": 0.05619759112596512, "learning_rate": 0.0029878236842883644, "loss": 1.9686, "step": 9080 }, { "epoch": 0.05991414500539886, "grad_norm": 0.052855897694826126, "learning_rate": 0.0029877430364848327, "loss": 1.9591, "step": 9100 }, { "epoch": 0.06004582444497116, "grad_norm": 0.06869558244943619, "learning_rate": 0.002987662123579108, "loss": 1.9603, "step": 9120 }, { "epoch": 0.060177503884543466, "grad_norm": 0.04893792048096657, "learning_rate": 0.002987580945585609, "loss": 1.9669, "step": 9140 }, { "epoch": 0.06030918332411577, "grad_norm": 0.06035724654793739, "learning_rate": 0.0029874995025188, "loss": 1.9693, "step": 9160 }, { "epoch": 0.060440862763688076, "grad_norm": 0.05003412812948227, "learning_rate": 0.002987417794393193, "loss": 1.961, "step": 9180 }, { "epoch": 0.06057254220326038, "grad_norm": 0.051062557846307755, "learning_rate": 0.002987335821223349, "loss": 1.9568, "step": 9200 }, { "epoch": 0.060704221642832686, "grad_norm": 0.05019828677177429, "learning_rate": 0.002987253583023874, "loss": 1.9529, "step": 9220 }, { "epoch": 0.06083590108240499, "grad_norm": 0.05402472987771034, "learning_rate": 0.0029871710798094224, "loss": 1.9579, "step": 9240 }, { "epoch": 0.060967580521977295, "grad_norm": 0.06498553603887558, "learning_rate": 0.002987088311594695, "loss": 1.9526, "step": 9260 }, { "epoch": 0.06109925996154961, "grad_norm": 0.06526941061019897, "learning_rate": 0.0029870052783944412, "loss": 1.9554, "step": 9280 }, { "epoch": 0.06123093940112191, "grad_norm": 0.051123786717653275, "learning_rate": 0.002986921980223456, "loss": 1.9449, "step": 9300 }, { "epoch": 0.061362618840694216, "grad_norm": 0.05042225867509842, "learning_rate": 0.002986838417096583, "loss": 1.952, "step": 9320 }, { "epoch": 0.06149429828026652, "grad_norm": 0.052252884954214096, "learning_rate": 0.002986754589028711, "loss": 1.9459, "step": 9340 }, { "epoch": 0.061625977719838826, "grad_norm": 0.049406830221414566, "learning_rate": 0.002986670496034779, "loss": 1.9478, "step": 9360 }, { "epoch": 0.06175765715941113, "grad_norm": 0.051424238830804825, "learning_rate": 0.0029865861381297714, "loss": 1.9434, "step": 9380 }, { "epoch": 0.061889336598983435, "grad_norm": 0.05527883395552635, "learning_rate": 0.0029865015153287193, "loss": 1.9428, "step": 9400 }, { "epoch": 0.06202101603855574, "grad_norm": 0.048182398080825806, "learning_rate": 0.0029864166276467024, "loss": 1.9404, "step": 9420 }, { "epoch": 0.062152695478128045, "grad_norm": 0.04890589416027069, "learning_rate": 0.002986331475098846, "loss": 1.9342, "step": 9440 }, { "epoch": 0.06228437491770035, "grad_norm": 0.052375294268131256, "learning_rate": 0.0029862460577003247, "loss": 1.9291, "step": 9460 }, { "epoch": 0.062416054357272654, "grad_norm": 0.0541619248688221, "learning_rate": 0.002986160375466358, "loss": 1.883, "step": 9480 }, { "epoch": 0.06254773379684496, "grad_norm": 0.05440934747457504, "learning_rate": 0.002986074428412214, "loss": 1.8321, "step": 9500 }, { "epoch": 0.06267941323641726, "grad_norm": 0.06579524278640747, "learning_rate": 0.0029859882165532087, "loss": 1.8184, "step": 9520 }, { "epoch": 0.06281109267598957, "grad_norm": 0.050777874886989594, "learning_rate": 0.0029859017399047026, "loss": 1.8232, "step": 9540 }, { "epoch": 0.06294277211556187, "grad_norm": 0.05892116203904152, "learning_rate": 0.002985814998482106, "loss": 1.8241, "step": 9560 }, { "epoch": 0.06307445155513418, "grad_norm": 0.054253749549388885, "learning_rate": 0.0029857279923008757, "loss": 1.812, "step": 9580 }, { "epoch": 0.06320613099470648, "grad_norm": 0.05559428408741951, "learning_rate": 0.0029856407213765144, "loss": 1.8166, "step": 9600 }, { "epoch": 0.06333781043427879, "grad_norm": 0.0527789331972599, "learning_rate": 0.0029855531857245735, "loss": 1.8244, "step": 9620 }, { "epoch": 0.06346948987385109, "grad_norm": 0.05062944442033768, "learning_rate": 0.0029854653853606515, "loss": 1.8276, "step": 9640 }, { "epoch": 0.0636011693134234, "grad_norm": 0.05144268646836281, "learning_rate": 0.002985377320300393, "loss": 1.8178, "step": 9660 }, { "epoch": 0.0637328487529957, "grad_norm": 0.051822349429130554, "learning_rate": 0.0029852889905594903, "loss": 1.8238, "step": 9680 }, { "epoch": 0.06386452819256801, "grad_norm": 0.05682462826371193, "learning_rate": 0.0029852003961536844, "loss": 1.8207, "step": 9700 }, { "epoch": 0.06399620763214031, "grad_norm": 0.06278064101934433, "learning_rate": 0.00298511153709876, "loss": 1.8311, "step": 9720 }, { "epoch": 0.06412788707171262, "grad_norm": 0.052284616976976395, "learning_rate": 0.0029850224134105514, "loss": 1.8243, "step": 9740 }, { "epoch": 0.06425956651128492, "grad_norm": 0.06791289150714874, "learning_rate": 0.0029849330251049406, "loss": 1.8252, "step": 9760 }, { "epoch": 0.06439124595085724, "grad_norm": 0.05337266996502876, "learning_rate": 0.0029848433721978555, "loss": 1.829, "step": 9780 }, { "epoch": 0.06452292539042954, "grad_norm": 0.05477340891957283, "learning_rate": 0.002984753454705271, "loss": 1.8226, "step": 9800 }, { "epoch": 0.06465460483000185, "grad_norm": 0.055485792458057404, "learning_rate": 0.00298466327264321, "loss": 1.8205, "step": 9820 }, { "epoch": 0.06478628426957415, "grad_norm": 0.05361747369170189, "learning_rate": 0.0029845728260277414, "loss": 1.8327, "step": 9840 }, { "epoch": 0.06491796370914646, "grad_norm": 0.06504777073860168, "learning_rate": 0.0029844821148749825, "loss": 1.8292, "step": 9860 }, { "epoch": 0.06504964314871876, "grad_norm": 0.05408887565135956, "learning_rate": 0.002984391139201097, "loss": 1.8295, "step": 9880 }, { "epoch": 0.06518132258829107, "grad_norm": 0.0615227073431015, "learning_rate": 0.0029842998990222964, "loss": 1.8233, "step": 9900 }, { "epoch": 0.06531300202786337, "grad_norm": 0.05818536877632141, "learning_rate": 0.002984208394354838, "loss": 1.8261, "step": 9920 }, { "epoch": 0.06544468146743568, "grad_norm": 0.057526398450136185, "learning_rate": 0.0029841166252150284, "loss": 1.8294, "step": 9940 }, { "epoch": 0.06557636090700798, "grad_norm": 0.05408645048737526, "learning_rate": 0.002984024591619219, "loss": 1.8248, "step": 9960 }, { "epoch": 0.06570804034658029, "grad_norm": 0.05534709617495537, "learning_rate": 0.0029839322935838095, "loss": 1.8263, "step": 9980 }, { "epoch": 0.06583971978615259, "grad_norm": 0.05544685944914818, "learning_rate": 0.002983839731125246, "loss": 1.8239, "step": 10000 }, { "epoch": 0.06583971978615259, "eval_loss": 1.968814492225647, "eval_runtime": 68.0355, "eval_samples_per_second": 14.698, "eval_steps_per_second": 14.698, "step": 10000 }, { "epoch": 0.0659713992257249, "grad_norm": 0.052884284406900406, "learning_rate": 0.002983746904260024, "loss": 1.8226, "step": 10020 }, { "epoch": 0.0661030786652972, "grad_norm": 0.06210578605532646, "learning_rate": 0.002983653813004683, "loss": 1.8562, "step": 10040 }, { "epoch": 0.0662347581048695, "grad_norm": 0.05301567539572716, "learning_rate": 0.002983560457375811, "loss": 1.9107, "step": 10060 }, { "epoch": 0.06636643754444181, "grad_norm": 0.056775398552417755, "learning_rate": 0.0029834668373900437, "loss": 1.9256, "step": 10080 }, { "epoch": 0.06649811698401412, "grad_norm": 0.05117955058813095, "learning_rate": 0.002983372953064063, "loss": 1.9391, "step": 10100 }, { "epoch": 0.06662979642358642, "grad_norm": 0.04930364713072777, "learning_rate": 0.0029832788044145985, "loss": 1.9415, "step": 10120 }, { "epoch": 0.06676147586315873, "grad_norm": 0.0544724240899086, "learning_rate": 0.002983184391458426, "loss": 1.9422, "step": 10140 }, { "epoch": 0.06689315530273103, "grad_norm": 0.05356570705771446, "learning_rate": 0.0029830897142123698, "loss": 1.9259, "step": 10160 }, { "epoch": 0.06702483474230334, "grad_norm": 0.05016016215085983, "learning_rate": 0.0029829947726933005, "loss": 1.9262, "step": 10180 }, { "epoch": 0.06715651418187564, "grad_norm": 0.05329560115933418, "learning_rate": 0.002982899566918135, "loss": 1.9342, "step": 10200 }, { "epoch": 0.06728819362144794, "grad_norm": 0.053507186472415924, "learning_rate": 0.0029828040969038386, "loss": 1.9217, "step": 10220 }, { "epoch": 0.06741987306102025, "grad_norm": 0.05592430755496025, "learning_rate": 0.002982708362667423, "loss": 1.9244, "step": 10240 }, { "epoch": 0.06755155250059255, "grad_norm": 0.05031822621822357, "learning_rate": 0.0029826123642259475, "loss": 1.9163, "step": 10260 }, { "epoch": 0.06768323194016486, "grad_norm": 0.05068674683570862, "learning_rate": 0.0029825161015965183, "loss": 1.9224, "step": 10280 }, { "epoch": 0.06781491137973716, "grad_norm": 0.05538354441523552, "learning_rate": 0.002982419574796288, "loss": 1.9166, "step": 10300 }, { "epoch": 0.06794659081930947, "grad_norm": 0.04972713813185692, "learning_rate": 0.002982322783842457, "loss": 1.9165, "step": 10320 }, { "epoch": 0.06807827025888177, "grad_norm": 0.05182690918445587, "learning_rate": 0.0029822257287522727, "loss": 1.9025, "step": 10340 }, { "epoch": 0.06820994969845408, "grad_norm": 0.0539088249206543, "learning_rate": 0.002982128409543029, "loss": 1.9039, "step": 10360 }, { "epoch": 0.06834162913802638, "grad_norm": 0.0529555045068264, "learning_rate": 0.0029820308262320677, "loss": 1.8987, "step": 10380 }, { "epoch": 0.06847330857759869, "grad_norm": 0.04998824745416641, "learning_rate": 0.0029819329788367773, "loss": 1.9015, "step": 10400 }, { "epoch": 0.06860498801717099, "grad_norm": 0.055027175694704056, "learning_rate": 0.0029818348673745928, "loss": 1.9022, "step": 10420 }, { "epoch": 0.0687366674567433, "grad_norm": 0.04936603456735611, "learning_rate": 0.002981736491862997, "loss": 1.8981, "step": 10440 }, { "epoch": 0.06886834689631562, "grad_norm": 0.05445968732237816, "learning_rate": 0.00298163785231952, "loss": 1.8922, "step": 10460 }, { "epoch": 0.06900002633588792, "grad_norm": 0.0514165423810482, "learning_rate": 0.0029815389487617377, "loss": 1.8941, "step": 10480 }, { "epoch": 0.06913170577546023, "grad_norm": 0.054617028683423996, "learning_rate": 0.002981439781207275, "loss": 1.8771, "step": 10500 }, { "epoch": 0.06926338521503253, "grad_norm": 0.051449310034513474, "learning_rate": 0.002981340349673801, "loss": 1.8979, "step": 10520 }, { "epoch": 0.06939506465460483, "grad_norm": 0.04865436255931854, "learning_rate": 0.0029812406541790347, "loss": 1.8929, "step": 10540 }, { "epoch": 0.06952674409417714, "grad_norm": 0.06338293850421906, "learning_rate": 0.0029811406947407404, "loss": 1.8849, "step": 10560 }, { "epoch": 0.06965842353374944, "grad_norm": 0.058406732976436615, "learning_rate": 0.00298104047137673, "loss": 1.8869, "step": 10580 }, { "epoch": 0.06979010297332175, "grad_norm": 0.05265038460493088, "learning_rate": 0.002980939984104863, "loss": 1.8807, "step": 10600 }, { "epoch": 0.06992178241289405, "grad_norm": 0.05860557034611702, "learning_rate": 0.0029808392329430445, "loss": 1.8926, "step": 10620 }, { "epoch": 0.07005346185246636, "grad_norm": 0.05650535598397255, "learning_rate": 0.0029807382179092277, "loss": 1.9136, "step": 10640 }, { "epoch": 0.07018514129203866, "grad_norm": 0.05268057808279991, "learning_rate": 0.0029806369390214123, "loss": 1.9313, "step": 10660 }, { "epoch": 0.07031682073161097, "grad_norm": 0.05681426078081131, "learning_rate": 0.002980535396297646, "loss": 1.9358, "step": 10680 }, { "epoch": 0.07044850017118327, "grad_norm": 0.06345421820878983, "learning_rate": 0.002980433589756022, "loss": 1.9411, "step": 10700 }, { "epoch": 0.07058017961075558, "grad_norm": 0.04853732883930206, "learning_rate": 0.002980331519414682, "loss": 1.9494, "step": 10720 }, { "epoch": 0.07071185905032788, "grad_norm": 0.047528378665447235, "learning_rate": 0.002980229185291814, "loss": 1.9364, "step": 10740 }, { "epoch": 0.07084353848990019, "grad_norm": 0.05809812992811203, "learning_rate": 0.002980126587405652, "loss": 1.9358, "step": 10760 }, { "epoch": 0.07097521792947249, "grad_norm": 0.05844232812523842, "learning_rate": 0.0029800237257744788, "loss": 1.9357, "step": 10780 }, { "epoch": 0.0711068973690448, "grad_norm": 0.04900583252310753, "learning_rate": 0.0029799206004166236, "loss": 1.9339, "step": 10800 }, { "epoch": 0.0712385768086171, "grad_norm": 0.056056343019008636, "learning_rate": 0.002979817211350462, "loss": 1.9213, "step": 10820 }, { "epoch": 0.0713702562481894, "grad_norm": 0.04929627478122711, "learning_rate": 0.002979713558594416, "loss": 1.9238, "step": 10840 }, { "epoch": 0.07150193568776171, "grad_norm": 0.051502469927072525, "learning_rate": 0.002979609642166958, "loss": 1.9297, "step": 10860 }, { "epoch": 0.07163361512733402, "grad_norm": 0.055544495582580566, "learning_rate": 0.002979505462086603, "loss": 1.9126, "step": 10880 }, { "epoch": 0.07176529456690632, "grad_norm": 0.05013841763138771, "learning_rate": 0.002979401018371915, "loss": 1.9167, "step": 10900 }, { "epoch": 0.07189697400647863, "grad_norm": 0.05101664736866951, "learning_rate": 0.002979296311041506, "loss": 1.9099, "step": 10920 }, { "epoch": 0.07202865344605093, "grad_norm": 0.06268607825040817, "learning_rate": 0.0029791913401140332, "loss": 1.9139, "step": 10940 }, { "epoch": 0.07216033288562324, "grad_norm": 0.05222015082836151, "learning_rate": 0.002979086105608202, "loss": 1.911, "step": 10960 }, { "epoch": 0.07229201232519554, "grad_norm": 0.054124996066093445, "learning_rate": 0.002978980607542763, "loss": 1.9097, "step": 10980 }, { "epoch": 0.07242369176476784, "grad_norm": 0.05831436067819595, "learning_rate": 0.0029788748459365164, "loss": 1.9166, "step": 11000 }, { "epoch": 0.07242369176476784, "eval_loss": 1.9284849166870117, "eval_runtime": 67.5794, "eval_samples_per_second": 14.797, "eval_steps_per_second": 14.797, "step": 11000 }, { "epoch": 0.07255537120434015, "grad_norm": 0.056505072861909866, "learning_rate": 0.0029787688208083073, "loss": 1.9091, "step": 11020 }, { "epoch": 0.07268705064391245, "grad_norm": 0.04782087355852127, "learning_rate": 0.002978662532177028, "loss": 1.9054, "step": 11040 }, { "epoch": 0.07281873008348476, "grad_norm": 0.05616345256567001, "learning_rate": 0.002978555980061619, "loss": 1.9027, "step": 11060 }, { "epoch": 0.07295040952305706, "grad_norm": 0.0646371841430664, "learning_rate": 0.002978449164481066, "loss": 1.8956, "step": 11080 }, { "epoch": 0.07308208896262937, "grad_norm": 0.0588691271841526, "learning_rate": 0.0029783420854544037, "loss": 1.8958, "step": 11100 }, { "epoch": 0.07321376840220169, "grad_norm": 0.05876161903142929, "learning_rate": 0.0029782347430007115, "loss": 1.898, "step": 11120 }, { "epoch": 0.07334544784177399, "grad_norm": 0.05978132411837578, "learning_rate": 0.0029781271371391175, "loss": 1.9033, "step": 11140 }, { "epoch": 0.0734771272813463, "grad_norm": 0.05216595530509949, "learning_rate": 0.0029780192678887964, "loss": 1.8997, "step": 11160 }, { "epoch": 0.0736088067209186, "grad_norm": 0.0518871508538723, "learning_rate": 0.002977911135268968, "loss": 1.9014, "step": 11180 }, { "epoch": 0.0737404861604909, "grad_norm": 0.05054188892245293, "learning_rate": 0.0029778027392989024, "loss": 1.8899, "step": 11200 }, { "epoch": 0.07387216560006321, "grad_norm": 0.059255532920360565, "learning_rate": 0.002977694079997913, "loss": 1.8928, "step": 11220 }, { "epoch": 0.07400384503963552, "grad_norm": 0.06282193213701248, "learning_rate": 0.002977585157385364, "loss": 1.9071, "step": 11240 }, { "epoch": 0.07413552447920782, "grad_norm": 0.048698440194129944, "learning_rate": 0.0029774759714806622, "loss": 1.9165, "step": 11260 }, { "epoch": 0.07426720391878013, "grad_norm": 0.05037577450275421, "learning_rate": 0.0029773665223032653, "loss": 1.9154, "step": 11280 }, { "epoch": 0.07439888335835243, "grad_norm": 0.049512796103954315, "learning_rate": 0.002977256809872675, "loss": 1.911, "step": 11300 }, { "epoch": 0.07453056279792473, "grad_norm": 0.05632052198052406, "learning_rate": 0.0029771468342084414, "loss": 1.9104, "step": 11320 }, { "epoch": 0.07466224223749704, "grad_norm": 0.050531480461359024, "learning_rate": 0.0029770365953301616, "loss": 1.9071, "step": 11340 }, { "epoch": 0.07479392167706934, "grad_norm": 0.057267602533102036, "learning_rate": 0.0029769260932574785, "loss": 1.9078, "step": 11360 }, { "epoch": 0.07492560111664165, "grad_norm": 0.05797697231173515, "learning_rate": 0.002976815328010083, "loss": 1.898, "step": 11380 }, { "epoch": 0.07505728055621395, "grad_norm": 0.04657141864299774, "learning_rate": 0.0029767042996077116, "loss": 1.8966, "step": 11400 }, { "epoch": 0.07518895999578626, "grad_norm": 0.05821000784635544, "learning_rate": 0.00297659300807015, "loss": 1.897, "step": 11420 }, { "epoch": 0.07532063943535856, "grad_norm": 0.050238363444805145, "learning_rate": 0.0029764814534172282, "loss": 1.8937, "step": 11440 }, { "epoch": 0.07545231887493087, "grad_norm": 0.04804101213812828, "learning_rate": 0.0029763696356688244, "loss": 1.8935, "step": 11460 }, { "epoch": 0.07558399831450317, "grad_norm": 0.057969000190496445, "learning_rate": 0.002976257554844864, "loss": 1.8896, "step": 11480 }, { "epoch": 0.07571567775407548, "grad_norm": 0.05278369039297104, "learning_rate": 0.002976145210965319, "loss": 1.8918, "step": 11500 }, { "epoch": 0.07584735719364778, "grad_norm": 0.05272908881306648, "learning_rate": 0.0029760326040502065, "loss": 1.8896, "step": 11520 }, { "epoch": 0.07597903663322009, "grad_norm": 0.0534030944108963, "learning_rate": 0.0029759197341195933, "loss": 1.8833, "step": 11540 }, { "epoch": 0.07611071607279239, "grad_norm": 0.05342519283294678, "learning_rate": 0.002975806601193592, "loss": 1.8828, "step": 11560 }, { "epoch": 0.0762423955123647, "grad_norm": 0.05289285629987717, "learning_rate": 0.002975693205292361, "loss": 1.8786, "step": 11580 }, { "epoch": 0.076374074951937, "grad_norm": 0.05132855102419853, "learning_rate": 0.0029755795464361063, "loss": 1.882, "step": 11600 }, { "epoch": 0.0765057543915093, "grad_norm": 0.057877812534570694, "learning_rate": 0.0029754656246450822, "loss": 1.8881, "step": 11620 }, { "epoch": 0.07663743383108161, "grad_norm": 0.054198529571294785, "learning_rate": 0.002975351439939587, "loss": 1.8849, "step": 11640 }, { "epoch": 0.07676911327065392, "grad_norm": 0.04742525890469551, "learning_rate": 0.0029752369923399685, "loss": 1.8819, "step": 11660 }, { "epoch": 0.07690079271022622, "grad_norm": 0.057487789541482925, "learning_rate": 0.002975122281866619, "loss": 1.8751, "step": 11680 }, { "epoch": 0.07703247214979853, "grad_norm": 0.04776060953736305, "learning_rate": 0.002975007308539981, "loss": 1.8726, "step": 11700 }, { "epoch": 0.07716415158937083, "grad_norm": 0.05077700316905975, "learning_rate": 0.002974892072380539, "loss": 1.876, "step": 11720 }, { "epoch": 0.07729583102894313, "grad_norm": 0.0542939268052578, "learning_rate": 0.0029747765734088284, "loss": 1.8788, "step": 11740 }, { "epoch": 0.07742751046851544, "grad_norm": 0.04847322776913643, "learning_rate": 0.0029746608116454306, "loss": 1.8705, "step": 11760 }, { "epoch": 0.07755918990808774, "grad_norm": 0.0494987815618515, "learning_rate": 0.0029745447871109727, "loss": 1.8776, "step": 11780 }, { "epoch": 0.07769086934766006, "grad_norm": 0.05288725346326828, "learning_rate": 0.0029744284998261287, "loss": 1.8733, "step": 11800 }, { "epoch": 0.07782254878723237, "grad_norm": 0.0571809746325016, "learning_rate": 0.0029743119498116203, "loss": 1.8761, "step": 11820 }, { "epoch": 0.07795422822680467, "grad_norm": 0.050889961421489716, "learning_rate": 0.0029741951370882164, "loss": 1.8692, "step": 11840 }, { "epoch": 0.07808590766637698, "grad_norm": 0.0550447441637516, "learning_rate": 0.002974078061676731, "loss": 1.8739, "step": 11860 }, { "epoch": 0.07821758710594928, "grad_norm": 0.05145235359668732, "learning_rate": 0.002973960723598026, "loss": 1.8653, "step": 11880 }, { "epoch": 0.07834926654552159, "grad_norm": 0.05060429126024246, "learning_rate": 0.0029738431228730107, "loss": 1.8529, "step": 11900 }, { "epoch": 0.07848094598509389, "grad_norm": 0.05473101884126663, "learning_rate": 0.0029737252595226395, "loss": 1.8513, "step": 11920 }, { "epoch": 0.0786126254246662, "grad_norm": 0.05369679257273674, "learning_rate": 0.002973607133567915, "loss": 1.8473, "step": 11940 }, { "epoch": 0.0787443048642385, "grad_norm": 0.06132115051150322, "learning_rate": 0.0029734887450298866, "loss": 1.8426, "step": 11960 }, { "epoch": 0.0788759843038108, "grad_norm": 0.049720194190740585, "learning_rate": 0.0029733700939296487, "loss": 1.8412, "step": 11980 }, { "epoch": 0.07900766374338311, "grad_norm": 0.048152726143598557, "learning_rate": 0.0029732511802883456, "loss": 1.8388, "step": 12000 }, { "epoch": 0.07900766374338311, "eval_loss": 1.7857414484024048, "eval_runtime": 68.3192, "eval_samples_per_second": 14.637, "eval_steps_per_second": 14.637, "step": 12000 }, { "epoch": 0.07913934318295542, "grad_norm": 0.05637095496058464, "learning_rate": 0.0029731320041271655, "loss": 1.8317, "step": 12020 }, { "epoch": 0.07927102262252772, "grad_norm": 0.05279828608036041, "learning_rate": 0.002973012565467345, "loss": 1.8265, "step": 12040 }, { "epoch": 0.07940270206210003, "grad_norm": 0.05788380280137062, "learning_rate": 0.0029728928643301664, "loss": 1.8285, "step": 12060 }, { "epoch": 0.07953438150167233, "grad_norm": 0.05116511508822441, "learning_rate": 0.0029727729007369597, "loss": 1.8305, "step": 12080 }, { "epoch": 0.07966606094124463, "grad_norm": 0.05228397622704506, "learning_rate": 0.0029726526747091016, "loss": 1.8299, "step": 12100 }, { "epoch": 0.07979774038081694, "grad_norm": 0.06771951913833618, "learning_rate": 0.0029725321862680144, "loss": 1.8221, "step": 12120 }, { "epoch": 0.07992941982038924, "grad_norm": 0.05031878501176834, "learning_rate": 0.002972411435435169, "loss": 1.8244, "step": 12140 }, { "epoch": 0.08006109925996155, "grad_norm": 0.057394348084926605, "learning_rate": 0.0029722904222320825, "loss": 1.8279, "step": 12160 }, { "epoch": 0.08019277869953385, "grad_norm": 0.05116160586476326, "learning_rate": 0.0029721691466803165, "loss": 1.8192, "step": 12180 }, { "epoch": 0.08032445813910616, "grad_norm": 0.05168084427714348, "learning_rate": 0.002972047608801483, "loss": 1.8265, "step": 12200 }, { "epoch": 0.08045613757867846, "grad_norm": 0.053319819271564484, "learning_rate": 0.0029719258086172377, "loss": 1.8237, "step": 12220 }, { "epoch": 0.08058781701825077, "grad_norm": 0.09060586988925934, "learning_rate": 0.002971803746149285, "loss": 1.8176, "step": 12240 }, { "epoch": 0.08071949645782307, "grad_norm": 0.05889497324824333, "learning_rate": 0.002971681421419375, "loss": 1.8166, "step": 12260 }, { "epoch": 0.08085117589739538, "grad_norm": 0.056241389364004135, "learning_rate": 0.002971558834449305, "loss": 1.8189, "step": 12280 }, { "epoch": 0.08098285533696768, "grad_norm": 0.07331902533769608, "learning_rate": 0.002971435985260919, "loss": 1.8173, "step": 12300 }, { "epoch": 0.08111453477653999, "grad_norm": 0.05276619270443916, "learning_rate": 0.002971312873876107, "loss": 1.8194, "step": 12320 }, { "epoch": 0.08124621421611229, "grad_norm": 0.052701130509376526, "learning_rate": 0.002971189500316807, "loss": 1.808, "step": 12340 }, { "epoch": 0.0813778936556846, "grad_norm": 0.05825614184141159, "learning_rate": 0.0029710658646050028, "loss": 1.8206, "step": 12360 }, { "epoch": 0.0815095730952569, "grad_norm": 0.05325302854180336, "learning_rate": 0.002970941966762725, "loss": 1.8072, "step": 12380 }, { "epoch": 0.0816412525348292, "grad_norm": 0.05424511805176735, "learning_rate": 0.0029708178068120514, "loss": 1.814, "step": 12400 }, { "epoch": 0.08177293197440151, "grad_norm": 0.05035754665732384, "learning_rate": 0.002970693384775106, "loss": 1.8281, "step": 12420 }, { "epoch": 0.08190461141397382, "grad_norm": 0.0715329572558403, "learning_rate": 0.0029705687006740594, "loss": 1.8342, "step": 12440 }, { "epoch": 0.08203629085354612, "grad_norm": 0.05069407820701599, "learning_rate": 0.002970443754531129, "loss": 1.8306, "step": 12460 }, { "epoch": 0.08216797029311844, "grad_norm": 0.05642094835639, "learning_rate": 0.00297031854636858, "loss": 1.8252, "step": 12480 }, { "epoch": 0.08229964973269074, "grad_norm": 0.05098734796047211, "learning_rate": 0.0029701930762087232, "loss": 1.8283, "step": 12500 }, { "epoch": 0.08243132917226305, "grad_norm": 0.05360301956534386, "learning_rate": 0.002970067344073915, "loss": 1.8121, "step": 12520 }, { "epoch": 0.08256300861183535, "grad_norm": 0.064446359872818, "learning_rate": 0.002969941349986561, "loss": 1.8167, "step": 12540 }, { "epoch": 0.08269468805140766, "grad_norm": 0.05934213101863861, "learning_rate": 0.002969815093969112, "loss": 1.8104, "step": 12560 }, { "epoch": 0.08282636749097996, "grad_norm": 0.05697745084762573, "learning_rate": 0.0029696885760440647, "loss": 1.8118, "step": 12580 }, { "epoch": 0.08295804693055227, "grad_norm": 0.05313008651137352, "learning_rate": 0.0029695617962339645, "loss": 1.8073, "step": 12600 }, { "epoch": 0.08308972637012457, "grad_norm": 0.05284099653363228, "learning_rate": 0.002969434754561402, "loss": 1.8142, "step": 12620 }, { "epoch": 0.08322140580969688, "grad_norm": 0.054485708475112915, "learning_rate": 0.0029693074510490154, "loss": 1.8067, "step": 12640 }, { "epoch": 0.08335308524926918, "grad_norm": 0.050835754722356796, "learning_rate": 0.0029691798857194884, "loss": 1.8094, "step": 12660 }, { "epoch": 0.08348476468884149, "grad_norm": 0.05048472061753273, "learning_rate": 0.0029690520585955514, "loss": 1.8019, "step": 12680 }, { "epoch": 0.08361644412841379, "grad_norm": 0.05250314995646477, "learning_rate": 0.0029689239696999836, "loss": 1.7949, "step": 12700 }, { "epoch": 0.0837481235679861, "grad_norm": 0.05029289051890373, "learning_rate": 0.0029687956190556078, "loss": 1.8036, "step": 12720 }, { "epoch": 0.0838798030075584, "grad_norm": 0.053878892213106155, "learning_rate": 0.002968667006685296, "loss": 1.8019, "step": 12740 }, { "epoch": 0.0840114824471307, "grad_norm": 0.05751722306013107, "learning_rate": 0.0029685381326119645, "loss": 1.8014, "step": 12760 }, { "epoch": 0.08414316188670301, "grad_norm": 0.05387134477496147, "learning_rate": 0.002968408996858579, "loss": 1.7998, "step": 12780 }, { "epoch": 0.08427484132627532, "grad_norm": 0.056205861270427704, "learning_rate": 0.002968279599448149, "loss": 1.8051, "step": 12800 }, { "epoch": 0.08440652076584762, "grad_norm": 0.052303776144981384, "learning_rate": 0.0029681499404037325, "loss": 1.7967, "step": 12820 }, { "epoch": 0.08453820020541992, "grad_norm": 0.06636688113212585, "learning_rate": 0.002968020019748434, "loss": 1.799, "step": 12840 }, { "epoch": 0.08466987964499223, "grad_norm": 0.05160198360681534, "learning_rate": 0.0029678898375054036, "loss": 1.7987, "step": 12860 }, { "epoch": 0.08480155908456453, "grad_norm": 0.05559029057621956, "learning_rate": 0.002967759393697839, "loss": 1.8034, "step": 12880 }, { "epoch": 0.08493323852413684, "grad_norm": 0.057246867567300797, "learning_rate": 0.002967628688348983, "loss": 1.7888, "step": 12900 }, { "epoch": 0.08506491796370914, "grad_norm": 0.06301821768283844, "learning_rate": 0.0029674977214821274, "loss": 1.801, "step": 12920 }, { "epoch": 0.08519659740328145, "grad_norm": 0.055293645709753036, "learning_rate": 0.0029673664931206085, "loss": 1.7955, "step": 12940 }, { "epoch": 0.08532827684285375, "grad_norm": 0.05522451177239418, "learning_rate": 0.0029672350032878105, "loss": 1.788, "step": 12960 }, { "epoch": 0.08545995628242606, "grad_norm": 0.057026926428079605, "learning_rate": 0.0029671032520071634, "loss": 1.7898, "step": 12980 }, { "epoch": 0.08559163572199836, "grad_norm": 0.06190698221325874, "learning_rate": 0.002966971239302144, "loss": 1.8188, "step": 13000 }, { "epoch": 0.08559163572199836, "eval_loss": 1.6987569332122803, "eval_runtime": 70.9806, "eval_samples_per_second": 14.088, "eval_steps_per_second": 14.088, "step": 13000 }, { "epoch": 0.08572331516157067, "grad_norm": 0.05302195996046066, "learning_rate": 0.002966838965196276, "loss": 1.8589, "step": 13020 }, { "epoch": 0.08585499460114297, "grad_norm": 0.051264405250549316, "learning_rate": 0.0029667064297131296, "loss": 1.8669, "step": 13040 }, { "epoch": 0.08598667404071528, "grad_norm": 0.05437634140253067, "learning_rate": 0.0029665736328763205, "loss": 1.8685, "step": 13060 }, { "epoch": 0.08611835348028758, "grad_norm": 0.05606294050812721, "learning_rate": 0.0029664405747095134, "loss": 1.8787, "step": 13080 }, { "epoch": 0.08625003291985989, "grad_norm": 0.053556881844997406, "learning_rate": 0.0029663072552364163, "loss": 1.8788, "step": 13100 }, { "epoch": 0.08638171235943219, "grad_norm": 0.06021646037697792, "learning_rate": 0.0029661736744807867, "loss": 1.8733, "step": 13120 }, { "epoch": 0.08651339179900451, "grad_norm": 0.06918266415596008, "learning_rate": 0.002966039832466427, "loss": 1.8827, "step": 13140 }, { "epoch": 0.08664507123857682, "grad_norm": 0.052268948405981064, "learning_rate": 0.002965905729217187, "loss": 1.8688, "step": 13160 }, { "epoch": 0.08677675067814912, "grad_norm": 0.0564788356423378, "learning_rate": 0.0029657713647569623, "loss": 1.8599, "step": 13180 }, { "epoch": 0.08690843011772142, "grad_norm": 0.04878311604261398, "learning_rate": 0.0029656367391096955, "loss": 1.8654, "step": 13200 }, { "epoch": 0.08704010955729373, "grad_norm": 0.051273491233587265, "learning_rate": 0.002965501852299376, "loss": 1.8634, "step": 13220 }, { "epoch": 0.08717178899686603, "grad_norm": 0.06505248695611954, "learning_rate": 0.002965366704350039, "loss": 1.859, "step": 13240 }, { "epoch": 0.08730346843643834, "grad_norm": 0.05197957530617714, "learning_rate": 0.002965231295285767, "loss": 1.8631, "step": 13260 }, { "epoch": 0.08743514787601064, "grad_norm": 0.05774524062871933, "learning_rate": 0.0029650956251306877, "loss": 1.8508, "step": 13280 }, { "epoch": 0.08756682731558295, "grad_norm": 0.04711959511041641, "learning_rate": 0.0029649596939089772, "loss": 1.8488, "step": 13300 }, { "epoch": 0.08769850675515525, "grad_norm": 0.04737945273518562, "learning_rate": 0.0029648235016448573, "loss": 1.8546, "step": 13320 }, { "epoch": 0.08783018619472756, "grad_norm": 0.051619525998830795, "learning_rate": 0.0029646870483625953, "loss": 1.8514, "step": 13340 }, { "epoch": 0.08796186563429986, "grad_norm": 0.05580944940447807, "learning_rate": 0.002964550334086507, "loss": 1.85, "step": 13360 }, { "epoch": 0.08809354507387217, "grad_norm": 0.05655309185385704, "learning_rate": 0.002964413358840953, "loss": 1.8456, "step": 13380 }, { "epoch": 0.08822522451344447, "grad_norm": 0.05536419898271561, "learning_rate": 0.0029642761226503413, "loss": 1.8375, "step": 13400 }, { "epoch": 0.08835690395301678, "grad_norm": 0.055286381393671036, "learning_rate": 0.002964138625539126, "loss": 1.8406, "step": 13420 }, { "epoch": 0.08848858339258908, "grad_norm": 0.07900959998369217, "learning_rate": 0.0029640008675318077, "loss": 1.847, "step": 13440 }, { "epoch": 0.08862026283216139, "grad_norm": 0.05409523472189903, "learning_rate": 0.002963862848652934, "loss": 1.8483, "step": 13460 }, { "epoch": 0.08875194227173369, "grad_norm": 0.04646017774939537, "learning_rate": 0.0029637245689270978, "loss": 1.8357, "step": 13480 }, { "epoch": 0.088883621711306, "grad_norm": 0.05184982717037201, "learning_rate": 0.0029635860283789405, "loss": 1.8407, "step": 13500 }, { "epoch": 0.0890153011508783, "grad_norm": 0.05196777358651161, "learning_rate": 0.0029634472270331476, "loss": 1.8404, "step": 13520 }, { "epoch": 0.0891469805904506, "grad_norm": 0.0526873879134655, "learning_rate": 0.0029633081649144528, "loss": 1.8403, "step": 13540 }, { "epoch": 0.08927866003002291, "grad_norm": 0.06644752621650696, "learning_rate": 0.0029631688420476356, "loss": 1.8312, "step": 13560 }, { "epoch": 0.08941033946959522, "grad_norm": 0.06348369270563126, "learning_rate": 0.002963029258457522, "loss": 1.8343, "step": 13580 }, { "epoch": 0.08954201890916752, "grad_norm": 0.06941412389278412, "learning_rate": 0.002962889414168985, "loss": 1.8488, "step": 13600 }, { "epoch": 0.08967369834873982, "grad_norm": 0.0526285357773304, "learning_rate": 0.0029627493092069432, "loss": 1.8645, "step": 13620 }, { "epoch": 0.08980537778831213, "grad_norm": 0.04776741564273834, "learning_rate": 0.002962608943596362, "loss": 1.8647, "step": 13640 }, { "epoch": 0.08993705722788443, "grad_norm": 0.05642177537083626, "learning_rate": 0.0029624683173622526, "loss": 1.8651, "step": 13660 }, { "epoch": 0.09006873666745674, "grad_norm": 0.04894222691655159, "learning_rate": 0.0029623274305296743, "loss": 1.8652, "step": 13680 }, { "epoch": 0.09020041610702904, "grad_norm": 0.05177977308630943, "learning_rate": 0.0029621862831237314, "loss": 1.8606, "step": 13700 }, { "epoch": 0.09033209554660135, "grad_norm": 0.05325636267662048, "learning_rate": 0.0029620448751695757, "loss": 1.8562, "step": 13720 }, { "epoch": 0.09046377498617365, "grad_norm": 0.053102049976587296, "learning_rate": 0.0029619032066924037, "loss": 1.8607, "step": 13740 }, { "epoch": 0.09059545442574596, "grad_norm": 0.06039892137050629, "learning_rate": 0.0029617612777174604, "loss": 1.8598, "step": 13760 }, { "epoch": 0.09072713386531826, "grad_norm": 0.05456007272005081, "learning_rate": 0.0029616190882700358, "loss": 1.855, "step": 13780 }, { "epoch": 0.09085881330489057, "grad_norm": 0.05931520834565163, "learning_rate": 0.002961476638375467, "loss": 1.8562, "step": 13800 }, { "epoch": 0.09099049274446289, "grad_norm": 0.05977236106991768, "learning_rate": 0.0029613339280591365, "loss": 1.8562, "step": 13820 }, { "epoch": 0.09112217218403519, "grad_norm": 0.06268831342458725, "learning_rate": 0.0029611909573464745, "loss": 1.8472, "step": 13840 }, { "epoch": 0.0912538516236075, "grad_norm": 0.05633818358182907, "learning_rate": 0.002961047726262958, "loss": 1.8403, "step": 13860 }, { "epoch": 0.0913855310631798, "grad_norm": 0.0659051239490509, "learning_rate": 0.0029609042348341078, "loss": 1.8382, "step": 13880 }, { "epoch": 0.0915172105027521, "grad_norm": 0.050592195242643356, "learning_rate": 0.0029607604830854937, "loss": 1.8452, "step": 13900 }, { "epoch": 0.09164888994232441, "grad_norm": 0.049383338540792465, "learning_rate": 0.0029606164710427314, "loss": 1.8443, "step": 13920 }, { "epoch": 0.09178056938189671, "grad_norm": 0.06528118252754211, "learning_rate": 0.002960472198731481, "loss": 1.8422, "step": 13940 }, { "epoch": 0.09191224882146902, "grad_norm": 0.05411006882786751, "learning_rate": 0.002960327666177452, "loss": 1.8465, "step": 13960 }, { "epoch": 0.09204392826104132, "grad_norm": 0.0483255498111248, "learning_rate": 0.0029601828734063984, "loss": 1.8427, "step": 13980 }, { "epoch": 0.09217560770061363, "grad_norm": 0.050317153334617615, "learning_rate": 0.0029600378204441206, "loss": 1.8339, "step": 14000 }, { "epoch": 0.09217560770061363, "eval_loss": 1.785549283027649, "eval_runtime": 68.197, "eval_samples_per_second": 14.663, "eval_steps_per_second": 14.663, "step": 14000 }, { "epoch": 0.09230728714018593, "grad_norm": 0.05255632847547531, "learning_rate": 0.0029598925073164657, "loss": 1.8319, "step": 14020 }, { "epoch": 0.09243896657975824, "grad_norm": 0.053322333842515945, "learning_rate": 0.0029597469340493275, "loss": 1.8343, "step": 14040 }, { "epoch": 0.09257064601933054, "grad_norm": 0.046458128839731216, "learning_rate": 0.0029596011006686454, "loss": 1.8335, "step": 14060 }, { "epoch": 0.09270232545890285, "grad_norm": 0.051327046006917953, "learning_rate": 0.0029594550072004062, "loss": 1.8295, "step": 14080 }, { "epoch": 0.09283400489847515, "grad_norm": 0.06848567724227905, "learning_rate": 0.002959308653670642, "loss": 1.8375, "step": 14100 }, { "epoch": 0.09296568433804746, "grad_norm": 0.05707765370607376, "learning_rate": 0.0029591620401054316, "loss": 1.8341, "step": 14120 }, { "epoch": 0.09309736377761976, "grad_norm": 0.050898268818855286, "learning_rate": 0.0029590151665309004, "loss": 1.8324, "step": 14140 }, { "epoch": 0.09322904321719207, "grad_norm": 0.06690908968448639, "learning_rate": 0.0029588680329732196, "loss": 1.8357, "step": 14160 }, { "epoch": 0.09336072265676437, "grad_norm": 0.05576496198773384, "learning_rate": 0.0029587206394586073, "loss": 1.827, "step": 14180 }, { "epoch": 0.09349240209633668, "grad_norm": 0.060783933848142624, "learning_rate": 0.002958572986013328, "loss": 1.827, "step": 14200 }, { "epoch": 0.09362408153590898, "grad_norm": 0.05840138718485832, "learning_rate": 0.0029584250726636917, "loss": 1.8005, "step": 14220 }, { "epoch": 0.09375576097548129, "grad_norm": 0.06067179888486862, "learning_rate": 0.0029582768994360557, "loss": 1.7913, "step": 14240 }, { "epoch": 0.09388744041505359, "grad_norm": 0.04877826198935509, "learning_rate": 0.002958128466356822, "loss": 1.7808, "step": 14260 }, { "epoch": 0.0940191198546259, "grad_norm": 0.07199737429618835, "learning_rate": 0.0029579797734524413, "loss": 1.7692, "step": 14280 }, { "epoch": 0.0941507992941982, "grad_norm": 0.05159222334623337, "learning_rate": 0.002957830820749409, "loss": 1.7735, "step": 14300 }, { "epoch": 0.0942824787337705, "grad_norm": 0.05802571773529053, "learning_rate": 0.0029576816082742662, "loss": 1.7648, "step": 14320 }, { "epoch": 0.09441415817334281, "grad_norm": 0.05139509588479996, "learning_rate": 0.0029575321360536025, "loss": 1.7667, "step": 14340 }, { "epoch": 0.09454583761291512, "grad_norm": 0.06891103833913803, "learning_rate": 0.002957382404114052, "loss": 1.766, "step": 14360 }, { "epoch": 0.09467751705248742, "grad_norm": 0.054211389273405075, "learning_rate": 0.0029572324124822955, "loss": 1.7576, "step": 14380 }, { "epoch": 0.09480919649205972, "grad_norm": 0.0536891408264637, "learning_rate": 0.0029570821611850594, "loss": 1.7597, "step": 14400 }, { "epoch": 0.09494087593163203, "grad_norm": 0.052394088357686996, "learning_rate": 0.0029569316502491183, "loss": 1.7645, "step": 14420 }, { "epoch": 0.09507255537120433, "grad_norm": 0.05916254222393036, "learning_rate": 0.002956780879701291, "loss": 1.7631, "step": 14440 }, { "epoch": 0.09520423481077664, "grad_norm": 0.060256022959947586, "learning_rate": 0.0029566298495684444, "loss": 1.7566, "step": 14460 }, { "epoch": 0.09533591425034894, "grad_norm": 0.055872827768325806, "learning_rate": 0.0029564785598774897, "loss": 1.7536, "step": 14480 }, { "epoch": 0.09546759368992126, "grad_norm": 0.053552061319351196, "learning_rate": 0.0029563270106553858, "loss": 1.7567, "step": 14500 }, { "epoch": 0.09559927312949357, "grad_norm": 0.07257280498743057, "learning_rate": 0.0029561752019291376, "loss": 1.7526, "step": 14520 }, { "epoch": 0.09573095256906587, "grad_norm": 0.061258714646101, "learning_rate": 0.002956023133725795, "loss": 1.7556, "step": 14540 }, { "epoch": 0.09586263200863818, "grad_norm": 0.05536385625600815, "learning_rate": 0.002955870806072457, "loss": 1.7482, "step": 14560 }, { "epoch": 0.09599431144821048, "grad_norm": 0.05093999579548836, "learning_rate": 0.002955718218996265, "loss": 1.7564, "step": 14580 }, { "epoch": 0.09612599088778279, "grad_norm": 0.05484277009963989, "learning_rate": 0.00295556537252441, "loss": 1.7491, "step": 14600 }, { "epoch": 0.09625767032735509, "grad_norm": 0.05289185419678688, "learning_rate": 0.002955412266684127, "loss": 1.7516, "step": 14620 }, { "epoch": 0.0963893497669274, "grad_norm": 0.05835564061999321, "learning_rate": 0.0029552589015026986, "loss": 1.7516, "step": 14640 }, { "epoch": 0.0965210292064997, "grad_norm": 0.05260492116212845, "learning_rate": 0.0029551052770074525, "loss": 1.7534, "step": 14660 }, { "epoch": 0.096652708646072, "grad_norm": 0.052535686641931534, "learning_rate": 0.002954951393225764, "loss": 1.7482, "step": 14680 }, { "epoch": 0.09678438808564431, "grad_norm": 0.062096912413835526, "learning_rate": 0.0029547972501850536, "loss": 1.7496, "step": 14700 }, { "epoch": 0.09691606752521661, "grad_norm": 0.07016194611787796, "learning_rate": 0.0029546428479127877, "loss": 1.7456, "step": 14720 }, { "epoch": 0.09704774696478892, "grad_norm": 0.06487017124891281, "learning_rate": 0.0029544881864364794, "loss": 1.7443, "step": 14740 }, { "epoch": 0.09717942640436122, "grad_norm": 0.060498468577861786, "learning_rate": 0.002954333265783688, "loss": 1.7516, "step": 14760 }, { "epoch": 0.09731110584393353, "grad_norm": 0.0497431606054306, "learning_rate": 0.0029541780859820197, "loss": 1.7635, "step": 14780 }, { "epoch": 0.09744278528350583, "grad_norm": 0.06207452341914177, "learning_rate": 0.002954022647059125, "loss": 1.7834, "step": 14800 }, { "epoch": 0.09757446472307814, "grad_norm": 0.06484688818454742, "learning_rate": 0.002953866949042703, "loss": 1.7779, "step": 14820 }, { "epoch": 0.09770614416265044, "grad_norm": 0.06074841320514679, "learning_rate": 0.002953710991960496, "loss": 1.7828, "step": 14840 }, { "epoch": 0.09783782360222275, "grad_norm": 0.05373964086174965, "learning_rate": 0.0029535547758402954, "loss": 1.7808, "step": 14860 }, { "epoch": 0.09796950304179505, "grad_norm": 0.06373169273138046, "learning_rate": 0.002953398300709937, "loss": 1.7843, "step": 14880 }, { "epoch": 0.09810118248136736, "grad_norm": 0.05869118869304657, "learning_rate": 0.0029532415665973035, "loss": 1.7826, "step": 14900 }, { "epoch": 0.09823286192093966, "grad_norm": 0.05736270919442177, "learning_rate": 0.002953084573530323, "loss": 1.774, "step": 14920 }, { "epoch": 0.09836454136051197, "grad_norm": 0.07032917439937592, "learning_rate": 0.0029529273215369704, "loss": 1.7702, "step": 14940 }, { "epoch": 0.09849622080008427, "grad_norm": 0.0598934143781662, "learning_rate": 0.002952769810645267, "loss": 1.7708, "step": 14960 }, { "epoch": 0.09862790023965658, "grad_norm": 0.06163979694247246, "learning_rate": 0.0029526120408832793, "loss": 1.7771, "step": 14980 }, { "epoch": 0.09875957967922888, "grad_norm": 0.055272020399570465, "learning_rate": 0.002952454012279121, "loss": 1.7675, "step": 15000 }, { "epoch": 0.09875957967922888, "eval_loss": 1.6859747171401978, "eval_runtime": 68.5865, "eval_samples_per_second": 14.58, "eval_steps_per_second": 14.58, "step": 15000 }, { "epoch": 0.09889125911880119, "grad_norm": 0.06086422875523567, "learning_rate": 0.0029522957248609505, "loss": 1.7656, "step": 15020 }, { "epoch": 0.09902293855837349, "grad_norm": 0.061683736741542816, "learning_rate": 0.0029521371786569743, "loss": 1.7571, "step": 15040 }, { "epoch": 0.0991546179979458, "grad_norm": 0.0584699846804142, "learning_rate": 0.0029519783736954427, "loss": 1.7654, "step": 15060 }, { "epoch": 0.0992862974375181, "grad_norm": 0.052420806139707565, "learning_rate": 0.002951819310004654, "loss": 1.764, "step": 15080 }, { "epoch": 0.0994179768770904, "grad_norm": 0.0528109036386013, "learning_rate": 0.0029516599876129516, "loss": 1.7611, "step": 15100 }, { "epoch": 0.09954965631666271, "grad_norm": 0.061885856091976166, "learning_rate": 0.0029515004065487254, "loss": 1.7628, "step": 15120 }, { "epoch": 0.09968133575623501, "grad_norm": 0.04771438241004944, "learning_rate": 0.0029513405668404116, "loss": 1.7652, "step": 15140 }, { "epoch": 0.09981301519580732, "grad_norm": 0.05954625830054283, "learning_rate": 0.0029511804685164915, "loss": 1.7554, "step": 15160 }, { "epoch": 0.09994469463537964, "grad_norm": 0.05653547868132591, "learning_rate": 0.002951020111605494, "loss": 1.7607, "step": 15180 }, { "epoch": 0.10007637407495194, "grad_norm": 0.05563562363386154, "learning_rate": 0.0029508594961359922, "loss": 1.759, "step": 15200 }, { "epoch": 0.10020805351452425, "grad_norm": 0.07335685193538666, "learning_rate": 0.002950698622136607, "loss": 1.7543, "step": 15220 }, { "epoch": 0.10033973295409655, "grad_norm": 0.06355411559343338, "learning_rate": 0.0029505374896360045, "loss": 1.7564, "step": 15240 }, { "epoch": 0.10047141239366886, "grad_norm": 0.05546756461262703, "learning_rate": 0.0029503760986628975, "loss": 1.7522, "step": 15260 }, { "epoch": 0.10060309183324116, "grad_norm": 0.058881357312202454, "learning_rate": 0.002950214449246043, "loss": 1.7544, "step": 15280 }, { "epoch": 0.10073477127281347, "grad_norm": 0.06903751194477081, "learning_rate": 0.0029500525414142475, "loss": 1.7531, "step": 15300 }, { "epoch": 0.10086645071238577, "grad_norm": 0.053250331431627274, "learning_rate": 0.00294989037519636, "loss": 1.753, "step": 15320 }, { "epoch": 0.10099813015195808, "grad_norm": 0.059820231050252914, "learning_rate": 0.002949727950621277, "loss": 1.7506, "step": 15340 }, { "epoch": 0.10112980959153038, "grad_norm": 0.06770730763673782, "learning_rate": 0.0029495652677179423, "loss": 1.76, "step": 15360 }, { "epoch": 0.10126148903110269, "grad_norm": 0.0625774934887886, "learning_rate": 0.0029494023265153432, "loss": 1.7919, "step": 15380 }, { "epoch": 0.10139316847067499, "grad_norm": 0.06113676354289055, "learning_rate": 0.002949239127042515, "loss": 1.814, "step": 15400 }, { "epoch": 0.1015248479102473, "grad_norm": 0.06288577616214752, "learning_rate": 0.002949075669328538, "loss": 1.8281, "step": 15420 }, { "epoch": 0.1016565273498196, "grad_norm": 0.05384008586406708, "learning_rate": 0.0029489119534025394, "loss": 1.8323, "step": 15440 }, { "epoch": 0.1017882067893919, "grad_norm": 0.06467036157846451, "learning_rate": 0.002948747979293692, "loss": 1.8343, "step": 15460 }, { "epoch": 0.10191988622896421, "grad_norm": 0.05992506816983223, "learning_rate": 0.0029485837470312128, "loss": 1.8315, "step": 15480 }, { "epoch": 0.10205156566853651, "grad_norm": 0.054823681712150574, "learning_rate": 0.002948419256644369, "loss": 1.8361, "step": 15500 }, { "epoch": 0.10218324510810882, "grad_norm": 0.07598422467708588, "learning_rate": 0.002948254508162469, "loss": 1.8395, "step": 15520 }, { "epoch": 0.10231492454768112, "grad_norm": 0.060086604207754135, "learning_rate": 0.002948089501614871, "loss": 1.8341, "step": 15540 }, { "epoch": 0.10244660398725343, "grad_norm": 0.05407283455133438, "learning_rate": 0.0029479242370309766, "loss": 1.8277, "step": 15560 }, { "epoch": 0.10257828342682573, "grad_norm": 0.057680752128362656, "learning_rate": 0.0029477587144402357, "loss": 1.8196, "step": 15580 }, { "epoch": 0.10270996286639804, "grad_norm": 0.0544477254152298, "learning_rate": 0.0029475929338721417, "loss": 1.8108, "step": 15600 }, { "epoch": 0.10284164230597034, "grad_norm": 0.054894376546144485, "learning_rate": 0.002947426895356236, "loss": 1.8139, "step": 15620 }, { "epoch": 0.10297332174554265, "grad_norm": 0.061300814151763916, "learning_rate": 0.0029472605989221043, "loss": 1.8116, "step": 15640 }, { "epoch": 0.10310500118511495, "grad_norm": 0.07517964392900467, "learning_rate": 0.00294709404459938, "loss": 1.806, "step": 15660 }, { "epoch": 0.10323668062468726, "grad_norm": 0.06433480978012085, "learning_rate": 0.0029469272324177415, "loss": 1.8092, "step": 15680 }, { "epoch": 0.10336836006425956, "grad_norm": 0.05521683767437935, "learning_rate": 0.0029467601624069122, "loss": 1.814, "step": 15700 }, { "epoch": 0.10350003950383187, "grad_norm": 0.0895058736205101, "learning_rate": 0.002946592834596663, "loss": 1.81, "step": 15720 }, { "epoch": 0.10363171894340417, "grad_norm": 0.0530746690928936, "learning_rate": 0.0029464252490168114, "loss": 1.8098, "step": 15740 }, { "epoch": 0.10376339838297648, "grad_norm": 0.05384887382388115, "learning_rate": 0.0029462574056972174, "loss": 1.8097, "step": 15760 }, { "epoch": 0.10389507782254878, "grad_norm": 0.05644648149609566, "learning_rate": 0.002946089304667791, "loss": 1.8032, "step": 15780 }, { "epoch": 0.10402675726212109, "grad_norm": 0.06337836384773254, "learning_rate": 0.002945920945958485, "loss": 1.7987, "step": 15800 }, { "epoch": 0.10415843670169339, "grad_norm": 0.05301804468035698, "learning_rate": 0.0029457523295993, "loss": 1.7936, "step": 15820 }, { "epoch": 0.10429011614126571, "grad_norm": 0.0584891214966774, "learning_rate": 0.002945583455620282, "loss": 1.7933, "step": 15840 }, { "epoch": 0.10442179558083801, "grad_norm": 0.058483339846134186, "learning_rate": 0.0029454143240515225, "loss": 1.7977, "step": 15860 }, { "epoch": 0.10455347502041032, "grad_norm": 0.057218778878450394, "learning_rate": 0.0029452449349231594, "loss": 1.7886, "step": 15880 }, { "epoch": 0.10468515445998262, "grad_norm": 0.0614253394305706, "learning_rate": 0.0029450752882653757, "loss": 1.7898, "step": 15900 }, { "epoch": 0.10481683389955493, "grad_norm": 0.05331398919224739, "learning_rate": 0.0029449053841084016, "loss": 1.7881, "step": 15920 }, { "epoch": 0.10494851333912723, "grad_norm": 0.05099445581436157, "learning_rate": 0.002944735222482512, "loss": 1.7937, "step": 15940 }, { "epoch": 0.10508019277869954, "grad_norm": 0.05356656014919281, "learning_rate": 0.0029445648034180294, "loss": 1.7943, "step": 15960 }, { "epoch": 0.10521187221827184, "grad_norm": 0.07416883111000061, "learning_rate": 0.0029443941269453188, "loss": 1.8186, "step": 15980 }, { "epoch": 0.10534355165784415, "grad_norm": 0.05611014366149902, "learning_rate": 0.002944223193094795, "loss": 1.8195, "step": 16000 }, { "epoch": 0.10534355165784415, "eval_loss": 1.753896713256836, "eval_runtime": 68.3324, "eval_samples_per_second": 14.634, "eval_steps_per_second": 14.634, "step": 16000 }, { "epoch": 0.00013167943957230517, "grad_norm": 0.06669767946004868, "learning_rate": 0.0029440520018969153, "loss": 1.9527, "step": 16020 }, { "epoch": 0.00026335887914461035, "grad_norm": 0.05156511813402176, "learning_rate": 0.0029438805533821863, "loss": 1.9455, "step": 16040 }, { "epoch": 0.00039503831871691555, "grad_norm": 0.05357939004898071, "learning_rate": 0.0029437088475811565, "loss": 1.9429, "step": 16060 }, { "epoch": 0.0005267177582892207, "grad_norm": 0.05948431417346001, "learning_rate": 0.002943536884524424, "loss": 1.9276, "step": 16080 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.05270468071103096, "learning_rate": 0.00294336466424263, "loss": 1.925, "step": 16100 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.05456703528761864, "learning_rate": 0.002943192186766463, "loss": 1.9325, "step": 16120 }, { "epoch": 0.0009217560770061363, "grad_norm": 0.056205980479717255, "learning_rate": 0.0029430194521266563, "loss": 1.923, "step": 16140 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.052037931978702545, "learning_rate": 0.002942846460353991, "loss": 1.925, "step": 16160 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.05397897586226463, "learning_rate": 0.0029426732114792914, "loss": 1.9119, "step": 16180 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.06542910635471344, "learning_rate": 0.0029424997055334293, "loss": 1.9183, "step": 16200 }, { "epoch": 0.001448473835295357, "grad_norm": 0.07107926905155182, "learning_rate": 0.002942325942547322, "loss": 1.917, "step": 16220 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.051881249994039536, "learning_rate": 0.0029421519225519316, "loss": 1.905, "step": 16240 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.06571921706199646, "learning_rate": 0.0029419776455782685, "loss": 1.9101, "step": 16260 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.08709180355072021, "learning_rate": 0.0029418031116573854, "loss": 1.9145, "step": 16280 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.05184926837682724, "learning_rate": 0.0029416283208203845, "loss": 1.9066, "step": 16300 }, { "epoch": 0.002106871033156883, "grad_norm": 0.06952713429927826, "learning_rate": 0.0029414532730984103, "loss": 1.9042, "step": 16320 }, { "epoch": 0.002238550472729188, "grad_norm": 0.06200730428099632, "learning_rate": 0.002941277968522656, "loss": 1.9042, "step": 16340 }, { "epoch": 0.002370229912301493, "grad_norm": 0.06455907970666885, "learning_rate": 0.0029411024071243587, "loss": 1.8952, "step": 16360 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.051165301352739334, "learning_rate": 0.0029409265889348015, "loss": 1.8987, "step": 16380 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.0553780272603035, "learning_rate": 0.0029407505139853137, "loss": 1.9017, "step": 16400 }, { "epoch": 0.002765268231018409, "grad_norm": 0.06370244920253754, "learning_rate": 0.002940574182307271, "loss": 1.8952, "step": 16420 }, { "epoch": 0.002896947670590714, "grad_norm": 0.05009014904499054, "learning_rate": 0.0029403975939320936, "loss": 1.9018, "step": 16440 }, { "epoch": 0.003028627110163019, "grad_norm": 0.053404245525598526, "learning_rate": 0.0029402207488912475, "loss": 1.895, "step": 16460 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.060919389128685, "learning_rate": 0.0029400436472162453, "loss": 1.8967, "step": 16480 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.05715464800596237, "learning_rate": 0.002939866288938645, "loss": 1.9042, "step": 16500 }, { "epoch": 0.003423665428879935, "grad_norm": 0.07242151349782944, "learning_rate": 0.0029396886740900496, "loss": 1.889, "step": 16520 }, { "epoch": 0.00355534486845224, "grad_norm": 0.07230902463197708, "learning_rate": 0.0029395108027021094, "loss": 1.8924, "step": 16540 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.05646587163209915, "learning_rate": 0.002939332674806519, "loss": 1.8873, "step": 16560 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.06602409482002258, "learning_rate": 0.002939154290435019, "loss": 1.8926, "step": 16580 }, { "epoch": 0.003950383187169155, "grad_norm": 0.051282357424497604, "learning_rate": 0.002938975649619396, "loss": 1.9128, "step": 16600 }, { "epoch": 0.004082062626741461, "grad_norm": 0.04802711680531502, "learning_rate": 0.002938796752391482, "loss": 1.9163, "step": 16620 }, { "epoch": 0.004213742066313766, "grad_norm": 0.05548110231757164, "learning_rate": 0.002938617598783155, "loss": 1.9177, "step": 16640 }, { "epoch": 0.004345421505886071, "grad_norm": 0.06551088392734528, "learning_rate": 0.002938438188826339, "loss": 1.9084, "step": 16660 }, { "epoch": 0.004477100945458376, "grad_norm": 0.051025088876485825, "learning_rate": 0.002938258522553002, "loss": 1.9111, "step": 16680 }, { "epoch": 0.004608780385030682, "grad_norm": 0.06420248001813889, "learning_rate": 0.00293807859999516, "loss": 1.9021, "step": 16700 }, { "epoch": 0.004740459824602986, "grad_norm": 0.05957198888063431, "learning_rate": 0.0029378984211848734, "loss": 1.9114, "step": 16720 }, { "epoch": 0.004872139264175292, "grad_norm": 0.05393804982304573, "learning_rate": 0.002937717986154248, "loss": 1.9018, "step": 16740 }, { "epoch": 0.005003818703747597, "grad_norm": 0.052903495728969574, "learning_rate": 0.0029375372949354355, "loss": 1.9099, "step": 16760 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.0786515399813652, "learning_rate": 0.0029373563475606343, "loss": 1.8988, "step": 16780 }, { "epoch": 0.005267177582892207, "grad_norm": 0.05307811498641968, "learning_rate": 0.002937175144062087, "loss": 1.901, "step": 16800 }, { "epoch": 0.005398857022464512, "grad_norm": 0.07106801867485046, "learning_rate": 0.0029369936844720825, "loss": 1.8994, "step": 16820 }, { "epoch": 0.005530536462036818, "grad_norm": 0.05467914044857025, "learning_rate": 0.0029368119688229547, "loss": 1.8971, "step": 16840 }, { "epoch": 0.005662215901609122, "grad_norm": 0.07325299084186554, "learning_rate": 0.0029366299971470846, "loss": 1.8895, "step": 16860 }, { "epoch": 0.005793895341181428, "grad_norm": 0.05642605945467949, "learning_rate": 0.002936447769476897, "loss": 1.8979, "step": 16880 }, { "epoch": 0.005925574780753733, "grad_norm": 0.05529412254691124, "learning_rate": 0.0029362652858448642, "loss": 1.8891, "step": 16900 }, { "epoch": 0.006057254220326038, "grad_norm": 0.06359060108661652, "learning_rate": 0.0029360825462835024, "loss": 1.8841, "step": 16920 }, { "epoch": 0.006188933659898343, "grad_norm": 0.06403638422489166, "learning_rate": 0.002935899550825374, "loss": 1.8846, "step": 16940 }, { "epoch": 0.006320613099470649, "grad_norm": 0.06129438802599907, "learning_rate": 0.0029357162995030882, "loss": 1.8845, "step": 16960 }, { "epoch": 0.006452292539042954, "grad_norm": 0.059139031916856766, "learning_rate": 0.002935532792349297, "loss": 1.8841, "step": 16980 }, { "epoch": 0.006583971978615259, "grad_norm": 0.056415166705846786, "learning_rate": 0.002935349029396701, "loss": 1.8768, "step": 17000 }, { "epoch": 0.006583971978615259, "eval_loss": 1.7990331649780273, "eval_runtime": 68.3369, "eval_samples_per_second": 14.633, "eval_steps_per_second": 14.633, "step": 17000 }, { "epoch": 0.006715651418187564, "grad_norm": 0.05324932560324669, "learning_rate": 0.002935165010678045, "loss": 1.877, "step": 17020 }, { "epoch": 0.00684733085775987, "grad_norm": 0.09261898696422577, "learning_rate": 0.0029349807362261185, "loss": 1.8822, "step": 17040 }, { "epoch": 0.006979010297332174, "grad_norm": 0.05834802985191345, "learning_rate": 0.0029347962060737583, "loss": 1.8869, "step": 17060 }, { "epoch": 0.00711068973690448, "grad_norm": 0.058308567851781845, "learning_rate": 0.0029346114202538458, "loss": 1.8808, "step": 17080 }, { "epoch": 0.007242369176476785, "grad_norm": 0.06321283429861069, "learning_rate": 0.0029344263787993087, "loss": 1.88, "step": 17100 }, { "epoch": 0.0073740486160490904, "grad_norm": 0.05077283829450607, "learning_rate": 0.0029342410817431185, "loss": 1.8774, "step": 17120 }, { "epoch": 0.007505728055621395, "grad_norm": 0.06091293692588806, "learning_rate": 0.0029340555291182944, "loss": 1.8779, "step": 17140 }, { "epoch": 0.007637407495193701, "grad_norm": 0.06410450488328934, "learning_rate": 0.0029338697209579, "loss": 1.8789, "step": 17160 }, { "epoch": 0.007769086934766006, "grad_norm": 0.08083081990480423, "learning_rate": 0.002933683657295044, "loss": 1.899, "step": 17180 }, { "epoch": 0.00790076637433831, "grad_norm": 0.06501522660255432, "learning_rate": 0.002933497338162883, "loss": 1.9053, "step": 17200 }, { "epoch": 0.008032445813910615, "grad_norm": 0.048091478645801544, "learning_rate": 0.0029333107635946152, "loss": 1.9089, "step": 17220 }, { "epoch": 0.008164125253482922, "grad_norm": 0.053573913872241974, "learning_rate": 0.0029331239336234873, "loss": 1.9014, "step": 17240 }, { "epoch": 0.008295804693055226, "grad_norm": 0.07217760384082794, "learning_rate": 0.0029329368482827905, "loss": 1.9048, "step": 17260 }, { "epoch": 0.008427484132627531, "grad_norm": 0.053729306906461716, "learning_rate": 0.0029327495076058624, "loss": 1.8983, "step": 17280 }, { "epoch": 0.008559163572199836, "grad_norm": 0.05567470192909241, "learning_rate": 0.002932561911626085, "loss": 1.8935, "step": 17300 }, { "epoch": 0.008690843011772142, "grad_norm": 0.06024245545268059, "learning_rate": 0.002932374060376886, "loss": 1.8916, "step": 17320 }, { "epoch": 0.008822522451344447, "grad_norm": 0.05578263849020004, "learning_rate": 0.0029321859538917394, "loss": 1.8964, "step": 17340 }, { "epoch": 0.008954201890916752, "grad_norm": 0.0536380261182785, "learning_rate": 0.0029319975922041633, "loss": 1.8874, "step": 17360 }, { "epoch": 0.009085881330489057, "grad_norm": 0.04501722753047943, "learning_rate": 0.002931808975347722, "loss": 1.8824, "step": 17380 }, { "epoch": 0.009217560770061363, "grad_norm": 0.06172627955675125, "learning_rate": 0.0029316201033560262, "loss": 1.8865, "step": 17400 }, { "epoch": 0.009349240209633668, "grad_norm": 0.05938473343849182, "learning_rate": 0.00293143097626273, "loss": 1.8845, "step": 17420 }, { "epoch": 0.009480919649205973, "grad_norm": 0.06107376888394356, "learning_rate": 0.0029312415941015347, "loss": 1.8892, "step": 17440 }, { "epoch": 0.009612599088778278, "grad_norm": 0.05630321800708771, "learning_rate": 0.0029310519569061867, "loss": 1.885, "step": 17460 }, { "epoch": 0.009744278528350584, "grad_norm": 0.05061402544379234, "learning_rate": 0.0029308620647104772, "loss": 1.8818, "step": 17480 }, { "epoch": 0.009875957967922889, "grad_norm": 0.059643711894750595, "learning_rate": 0.0029306719175482437, "loss": 1.877, "step": 17500 }, { "epoch": 0.010007637407495194, "grad_norm": 0.060052718967199326, "learning_rate": 0.0029304815154533683, "loss": 1.8752, "step": 17520 }, { "epoch": 0.010139316847067498, "grad_norm": 0.0526292622089386, "learning_rate": 0.002930290858459779, "loss": 1.8804, "step": 17540 }, { "epoch": 0.010270996286639805, "grad_norm": 0.08102289587259293, "learning_rate": 0.0029300999466014494, "loss": 1.8775, "step": 17560 }, { "epoch": 0.01040267572621211, "grad_norm": 0.07066734880208969, "learning_rate": 0.0029299087799123974, "loss": 1.8757, "step": 17580 }, { "epoch": 0.010534355165784414, "grad_norm": 0.08068786561489105, "learning_rate": 0.002929717358426688, "loss": 1.8798, "step": 17600 }, { "epoch": 0.01066603460535672, "grad_norm": 0.06165233626961708, "learning_rate": 0.0029295256821784306, "loss": 1.8741, "step": 17620 }, { "epoch": 0.010797714044929024, "grad_norm": 0.05444507673382759, "learning_rate": 0.0029293337512017797, "loss": 1.8754, "step": 17640 }, { "epoch": 0.01092939348450133, "grad_norm": 0.06841527670621872, "learning_rate": 0.002929141565530937, "loss": 1.8747, "step": 17660 }, { "epoch": 0.011061072924073635, "grad_norm": 0.06230770796537399, "learning_rate": 0.0029289491252001464, "loss": 1.8765, "step": 17680 }, { "epoch": 0.01119275236364594, "grad_norm": 0.07215554267168045, "learning_rate": 0.0029287564302437, "loss": 1.8755, "step": 17700 }, { "epoch": 0.011324431803218245, "grad_norm": 0.05525139719247818, "learning_rate": 0.002928563480695934, "loss": 1.8625, "step": 17720 }, { "epoch": 0.011456111242790551, "grad_norm": 0.08375394344329834, "learning_rate": 0.0029283702765912304, "loss": 1.8653, "step": 17740 }, { "epoch": 0.011587790682362856, "grad_norm": 0.07031811773777008, "learning_rate": 0.0029281768179640166, "loss": 1.8788, "step": 17760 }, { "epoch": 0.01171947012193516, "grad_norm": 0.07093445956707001, "learning_rate": 0.0029279831048487645, "loss": 1.8865, "step": 17780 }, { "epoch": 0.011851149561507466, "grad_norm": 0.07754283398389816, "learning_rate": 0.0029277891372799926, "loss": 1.8915, "step": 17800 }, { "epoch": 0.011982829001079772, "grad_norm": 0.06764809042215347, "learning_rate": 0.002927594915292264, "loss": 1.906, "step": 17820 }, { "epoch": 0.012114508440652077, "grad_norm": 0.05239294841885567, "learning_rate": 0.0029274004389201872, "loss": 1.8853, "step": 17840 }, { "epoch": 0.012246187880224382, "grad_norm": 0.060666222125291824, "learning_rate": 0.002927205708198416, "loss": 1.8856, "step": 17860 }, { "epoch": 0.012377867319796686, "grad_norm": 0.05473129451274872, "learning_rate": 0.00292701072316165, "loss": 1.8849, "step": 17880 }, { "epoch": 0.012509546759368993, "grad_norm": 0.054005883634090424, "learning_rate": 0.0029268154838446338, "loss": 1.8877, "step": 17900 }, { "epoch": 0.012641226198941298, "grad_norm": 0.07338313013315201, "learning_rate": 0.0029266199902821563, "loss": 1.8815, "step": 17920 }, { "epoch": 0.012772905638513602, "grad_norm": 0.06305193156003952, "learning_rate": 0.002926424242509054, "loss": 1.8775, "step": 17940 }, { "epoch": 0.012904585078085907, "grad_norm": 0.06329913437366486, "learning_rate": 0.0029262282405602066, "loss": 1.8759, "step": 17960 }, { "epoch": 0.013036264517658214, "grad_norm": 0.08256923407316208, "learning_rate": 0.0029260319844705398, "loss": 1.8779, "step": 17980 }, { "epoch": 0.013167943957230518, "grad_norm": 0.0697188749909401, "learning_rate": 0.002925835474275025, "loss": 1.8799, "step": 18000 }, { "epoch": 0.013167943957230518, "eval_loss": 1.8294225931167603, "eval_runtime": 65.8499, "eval_samples_per_second": 15.186, "eval_steps_per_second": 15.186, "step": 18000 }, { "epoch": 0.013299623396802823, "grad_norm": 0.05664549395442009, "learning_rate": 0.002925638710008678, "loss": 1.8665, "step": 18020 }, { "epoch": 0.013431302836375128, "grad_norm": 0.063201904296875, "learning_rate": 0.002925441691706561, "loss": 1.875, "step": 18040 }, { "epoch": 0.013562982275947433, "grad_norm": 0.05750538036227226, "learning_rate": 0.0029252444194037804, "loss": 1.86, "step": 18060 }, { "epoch": 0.01369466171551974, "grad_norm": 0.073476642370224, "learning_rate": 0.0029250468931354885, "loss": 1.8567, "step": 18080 }, { "epoch": 0.013826341155092044, "grad_norm": 0.05800202861428261, "learning_rate": 0.002924849112936883, "loss": 1.8669, "step": 18100 }, { "epoch": 0.013958020594664349, "grad_norm": 0.053366515785455704, "learning_rate": 0.002924651078843206, "loss": 1.8683, "step": 18120 }, { "epoch": 0.014089700034236654, "grad_norm": 0.06024957075715065, "learning_rate": 0.0029244527908897453, "loss": 1.8654, "step": 18140 }, { "epoch": 0.01422137947380896, "grad_norm": 0.06702018529176712, "learning_rate": 0.0029242542491118343, "loss": 1.8669, "step": 18160 }, { "epoch": 0.014353058913381265, "grad_norm": 0.050999585539102554, "learning_rate": 0.002924055453544852, "loss": 1.863, "step": 18180 }, { "epoch": 0.01448473835295357, "grad_norm": 0.05390724167227745, "learning_rate": 0.0029238564042242204, "loss": 1.8686, "step": 18200 }, { "epoch": 0.014616417792525874, "grad_norm": 0.08430622518062592, "learning_rate": 0.0029236571011854095, "loss": 1.8591, "step": 18220 }, { "epoch": 0.014748097232098181, "grad_norm": 0.07103120535612106, "learning_rate": 0.0029234575444639327, "loss": 1.8687, "step": 18240 }, { "epoch": 0.014879776671670486, "grad_norm": 0.0677858293056488, "learning_rate": 0.0029232577340953495, "loss": 1.8611, "step": 18260 }, { "epoch": 0.01501145611124279, "grad_norm": 0.07199349999427795, "learning_rate": 0.002923057670115264, "loss": 1.8613, "step": 18280 }, { "epoch": 0.015143135550815095, "grad_norm": 0.04802101105451584, "learning_rate": 0.002922857352559326, "loss": 1.8585, "step": 18300 }, { "epoch": 0.015274814990387402, "grad_norm": 0.06592894345521927, "learning_rate": 0.00292265678146323, "loss": 1.8627, "step": 18320 }, { "epoch": 0.015406494429959706, "grad_norm": 0.06502063572406769, "learning_rate": 0.0029224559568627162, "loss": 1.8542, "step": 18340 }, { "epoch": 0.015538173869532011, "grad_norm": 0.08361044526100159, "learning_rate": 0.0029222548787935696, "loss": 1.8558, "step": 18360 }, { "epoch": 0.015669853309104316, "grad_norm": 0.09134091436862946, "learning_rate": 0.002922053547291621, "loss": 1.8395, "step": 18380 }, { "epoch": 0.01580153274867662, "grad_norm": 0.06279317289590836, "learning_rate": 0.0029218519623927445, "loss": 1.7925, "step": 18400 }, { "epoch": 0.015933212188248926, "grad_norm": 0.05970417335629463, "learning_rate": 0.0029216501241328616, "loss": 1.7958, "step": 18420 }, { "epoch": 0.01606489162782123, "grad_norm": 0.05772954598069191, "learning_rate": 0.0029214480325479384, "loss": 1.7899, "step": 18440 }, { "epoch": 0.01619657106739354, "grad_norm": 0.05578155443072319, "learning_rate": 0.002921245687673985, "loss": 1.7772, "step": 18460 }, { "epoch": 0.016328250506965843, "grad_norm": 0.05890611186623573, "learning_rate": 0.0029210430895470576, "loss": 1.7791, "step": 18480 }, { "epoch": 0.016459929946538148, "grad_norm": 0.053837426006793976, "learning_rate": 0.0029208402382032575, "loss": 1.7787, "step": 18500 }, { "epoch": 0.016591609386110453, "grad_norm": 0.05714136362075806, "learning_rate": 0.002920637133678731, "loss": 1.7725, "step": 18520 }, { "epoch": 0.016723288825682758, "grad_norm": 0.06816162914037704, "learning_rate": 0.0029204337760096693, "loss": 1.7821, "step": 18540 }, { "epoch": 0.016854968265255062, "grad_norm": 0.05500810220837593, "learning_rate": 0.002920230165232309, "loss": 1.77, "step": 18560 }, { "epoch": 0.016986647704827367, "grad_norm": 0.05971973389387131, "learning_rate": 0.0029200263013829312, "loss": 1.7673, "step": 18580 }, { "epoch": 0.017118327144399672, "grad_norm": 0.05585896596312523, "learning_rate": 0.0029198221844978635, "loss": 1.7719, "step": 18600 }, { "epoch": 0.01725000658397198, "grad_norm": 0.05968007817864418, "learning_rate": 0.0029196178146134767, "loss": 1.7725, "step": 18620 }, { "epoch": 0.017381686023544285, "grad_norm": 0.06808626651763916, "learning_rate": 0.0029194131917661885, "loss": 1.7704, "step": 18640 }, { "epoch": 0.01751336546311659, "grad_norm": 0.057727713137865067, "learning_rate": 0.00291920831599246, "loss": 1.7752, "step": 18660 }, { "epoch": 0.017645044902688894, "grad_norm": 0.05363877862691879, "learning_rate": 0.0029190031873287986, "loss": 1.7682, "step": 18680 }, { "epoch": 0.0177767243422612, "grad_norm": 0.08140948414802551, "learning_rate": 0.0029187978058117566, "loss": 1.7621, "step": 18700 }, { "epoch": 0.017908403781833504, "grad_norm": 0.05746082961559296, "learning_rate": 0.0029185921714779306, "loss": 1.7743, "step": 18720 }, { "epoch": 0.01804008322140581, "grad_norm": 0.06933200359344482, "learning_rate": 0.0029183862843639636, "loss": 1.7783, "step": 18740 }, { "epoch": 0.018171762660978114, "grad_norm": 0.06859739869832993, "learning_rate": 0.0029181801445065415, "loss": 1.7723, "step": 18760 }, { "epoch": 0.018303442100550422, "grad_norm": 0.05922358110547066, "learning_rate": 0.002917973751942397, "loss": 1.7745, "step": 18780 }, { "epoch": 0.018435121540122727, "grad_norm": 0.0643932893872261, "learning_rate": 0.0029177671067083084, "loss": 1.7625, "step": 18800 }, { "epoch": 0.01856680097969503, "grad_norm": 0.060253337025642395, "learning_rate": 0.002917560208841097, "loss": 1.7739, "step": 18820 }, { "epoch": 0.018698480419267336, "grad_norm": 0.06834478676319122, "learning_rate": 0.00291735305837763, "loss": 1.7714, "step": 18840 }, { "epoch": 0.01883015985883964, "grad_norm": 0.06220484897494316, "learning_rate": 0.00291714565535482, "loss": 1.7794, "step": 18860 }, { "epoch": 0.018961839298411946, "grad_norm": 0.059682924300432205, "learning_rate": 0.0029169379998096245, "loss": 1.7751, "step": 18880 }, { "epoch": 0.01909351873798425, "grad_norm": 0.06003641337156296, "learning_rate": 0.002916730091779046, "loss": 1.7709, "step": 18900 }, { "epoch": 0.019225198177556555, "grad_norm": 0.05494799092411995, "learning_rate": 0.0029165219313001304, "loss": 1.7704, "step": 18920 }, { "epoch": 0.01935687761712886, "grad_norm": 0.05533396452665329, "learning_rate": 0.002916313518409972, "loss": 1.7788, "step": 18940 }, { "epoch": 0.019488557056701168, "grad_norm": 0.06435955315828323, "learning_rate": 0.0029161048531457065, "loss": 1.8023, "step": 18960 }, { "epoch": 0.019620236496273473, "grad_norm": 0.056616947054862976, "learning_rate": 0.0029158959355445177, "loss": 1.8187, "step": 18980 }, { "epoch": 0.019751915935845778, "grad_norm": 0.05237163230776787, "learning_rate": 0.002915686765643631, "loss": 1.8274, "step": 19000 }, { "epoch": 0.019751915935845778, "eval_loss": 1.8479809761047363, "eval_runtime": 65.9646, "eval_samples_per_second": 15.16, "eval_steps_per_second": 15.16, "step": 19000 }, { "epoch": 0.019883595375418082, "grad_norm": 0.06315074861049652, "learning_rate": 0.00291547734348032, "loss": 1.8249, "step": 19020 }, { "epoch": 0.020015274814990387, "grad_norm": 0.061322640627622604, "learning_rate": 0.002915267669091901, "loss": 1.8305, "step": 19040 }, { "epoch": 0.020146954254562692, "grad_norm": 0.06135581433773041, "learning_rate": 0.0029150577425157355, "loss": 1.8285, "step": 19060 }, { "epoch": 0.020278633694134997, "grad_norm": 0.06242895498871803, "learning_rate": 0.0029148475637892322, "loss": 1.8291, "step": 19080 }, { "epoch": 0.0204103131337073, "grad_norm": 0.07442411780357361, "learning_rate": 0.002914637132949842, "loss": 1.8167, "step": 19100 }, { "epoch": 0.02054199257327961, "grad_norm": 0.07312595844268799, "learning_rate": 0.0029144264500350616, "loss": 1.8139, "step": 19120 }, { "epoch": 0.020673672012851915, "grad_norm": 0.07727395743131638, "learning_rate": 0.0029142155150824333, "loss": 1.8121, "step": 19140 }, { "epoch": 0.02080535145242422, "grad_norm": 0.06504666805267334, "learning_rate": 0.0029140043281295435, "loss": 1.8162, "step": 19160 }, { "epoch": 0.020937030891996524, "grad_norm": 0.06606578081846237, "learning_rate": 0.0029137928892140237, "loss": 1.8141, "step": 19180 }, { "epoch": 0.02106871033156883, "grad_norm": 0.07460979372262955, "learning_rate": 0.0029135811983735504, "loss": 1.811, "step": 19200 }, { "epoch": 0.021200389771141134, "grad_norm": 0.05553029850125313, "learning_rate": 0.002913369255645845, "loss": 1.8122, "step": 19220 }, { "epoch": 0.02133206921071344, "grad_norm": 0.1024724543094635, "learning_rate": 0.002913157061068674, "loss": 1.8186, "step": 19240 }, { "epoch": 0.021463748650285743, "grad_norm": 0.07562136650085449, "learning_rate": 0.002912944614679848, "loss": 1.8238, "step": 19260 }, { "epoch": 0.021595428089858048, "grad_norm": 0.054396726191043854, "learning_rate": 0.002912731916517224, "loss": 1.8072, "step": 19280 }, { "epoch": 0.021727107529430356, "grad_norm": 0.07781907916069031, "learning_rate": 0.0029125189666187015, "loss": 1.8066, "step": 19300 }, { "epoch": 0.02185878696900266, "grad_norm": 0.05102219805121422, "learning_rate": 0.0029123057650222274, "loss": 1.803, "step": 19320 }, { "epoch": 0.021990466408574966, "grad_norm": 0.05836215242743492, "learning_rate": 0.002912092311765792, "loss": 1.8013, "step": 19340 }, { "epoch": 0.02212214584814727, "grad_norm": 0.0890396237373352, "learning_rate": 0.0029118786068874298, "loss": 1.804, "step": 19360 }, { "epoch": 0.022253825287719575, "grad_norm": 0.06296063959598541, "learning_rate": 0.002911664650425222, "loss": 1.7988, "step": 19380 }, { "epoch": 0.02238550472729188, "grad_norm": 0.07317844778299332, "learning_rate": 0.0029114504424172937, "loss": 1.7993, "step": 19400 }, { "epoch": 0.022517184166864185, "grad_norm": 0.061669182032346725, "learning_rate": 0.002911235982901814, "loss": 1.7971, "step": 19420 }, { "epoch": 0.02264886360643649, "grad_norm": 0.07136490941047668, "learning_rate": 0.002911021271916998, "loss": 1.8064, "step": 19440 }, { "epoch": 0.022780543046008798, "grad_norm": 0.05423993617296219, "learning_rate": 0.0029108063095011063, "loss": 1.8017, "step": 19460 }, { "epoch": 0.022912222485581103, "grad_norm": 0.0703122541308403, "learning_rate": 0.002910591095692442, "loss": 1.7979, "step": 19480 }, { "epoch": 0.023043901925153407, "grad_norm": 0.06629758328199387, "learning_rate": 0.0029103756305293546, "loss": 1.7959, "step": 19500 }, { "epoch": 0.023175581364725712, "grad_norm": 0.06768941134214401, "learning_rate": 0.002910159914050238, "loss": 1.796, "step": 19520 }, { "epoch": 0.023307260804298017, "grad_norm": 0.060242656618356705, "learning_rate": 0.002909943946293531, "loss": 1.802, "step": 19540 }, { "epoch": 0.02343894024387032, "grad_norm": 0.06179652363061905, "learning_rate": 0.0029097277272977164, "loss": 1.8097, "step": 19560 }, { "epoch": 0.023570619683442626, "grad_norm": 0.10733772069215775, "learning_rate": 0.0029095112571013238, "loss": 1.8088, "step": 19580 }, { "epoch": 0.02370229912301493, "grad_norm": 0.07508611679077148, "learning_rate": 0.002909294535742925, "loss": 1.8135, "step": 19600 }, { "epoch": 0.023833978562587236, "grad_norm": 0.057078372687101364, "learning_rate": 0.0029090775632611377, "loss": 1.811, "step": 19620 }, { "epoch": 0.023965658002159544, "grad_norm": 0.06910204887390137, "learning_rate": 0.002908860339694626, "loss": 1.8024, "step": 19640 }, { "epoch": 0.02409733744173185, "grad_norm": 0.05256013572216034, "learning_rate": 0.0029086428650820953, "loss": 1.8001, "step": 19660 }, { "epoch": 0.024229016881304154, "grad_norm": 0.05280625820159912, "learning_rate": 0.0029084251394622986, "loss": 1.7961, "step": 19680 }, { "epoch": 0.02436069632087646, "grad_norm": 0.07600513845682144, "learning_rate": 0.0029082071628740323, "loss": 1.7916, "step": 19700 }, { "epoch": 0.024492375760448763, "grad_norm": 0.060011059045791626, "learning_rate": 0.002907988935356138, "loss": 1.7981, "step": 19720 }, { "epoch": 0.024624055200021068, "grad_norm": 0.06662587076425552, "learning_rate": 0.002907770456947501, "loss": 1.7979, "step": 19740 }, { "epoch": 0.024755734639593373, "grad_norm": 0.06288140267133713, "learning_rate": 0.002907551727687054, "loss": 1.7918, "step": 19760 }, { "epoch": 0.024887414079165678, "grad_norm": 0.07184966653585434, "learning_rate": 0.002907332747613771, "loss": 1.7932, "step": 19780 }, { "epoch": 0.025019093518737986, "grad_norm": 0.062474627047777176, "learning_rate": 0.0029071135167666722, "loss": 1.7897, "step": 19800 }, { "epoch": 0.02515077295831029, "grad_norm": 0.055238522589206696, "learning_rate": 0.0029068940351848235, "loss": 1.7866, "step": 19820 }, { "epoch": 0.025282452397882595, "grad_norm": 0.060174524784088135, "learning_rate": 0.002906674302907334, "loss": 1.7854, "step": 19840 }, { "epoch": 0.0254141318374549, "grad_norm": 0.05686888098716736, "learning_rate": 0.002906454319973358, "loss": 1.7794, "step": 19860 }, { "epoch": 0.025545811277027205, "grad_norm": 0.05989696830511093, "learning_rate": 0.002906234086422094, "loss": 1.7802, "step": 19880 }, { "epoch": 0.02567749071659951, "grad_norm": 0.05739467218518257, "learning_rate": 0.0029060136022927867, "loss": 1.7859, "step": 19900 }, { "epoch": 0.025809170156171814, "grad_norm": 0.06893962621688843, "learning_rate": 0.0029057928676247233, "loss": 1.7903, "step": 19920 }, { "epoch": 0.02594084959574412, "grad_norm": 0.05944626033306122, "learning_rate": 0.002905571882457237, "loss": 1.7905, "step": 19940 }, { "epoch": 0.026072529035316427, "grad_norm": 0.10011964291334152, "learning_rate": 0.002905350646829706, "loss": 1.7824, "step": 19960 }, { "epoch": 0.026204208474888732, "grad_norm": 0.055610090494155884, "learning_rate": 0.0029051291607815515, "loss": 1.7803, "step": 19980 }, { "epoch": 0.026335887914461037, "grad_norm": 0.061704959720373154, "learning_rate": 0.0029049074243522404, "loss": 1.7793, "step": 20000 }, { "epoch": 0.026335887914461037, "eval_loss": 1.8498175144195557, "eval_runtime": 65.8184, "eval_samples_per_second": 15.193, "eval_steps_per_second": 15.193, "step": 20000 }, { "epoch": 0.02646756735403334, "grad_norm": 0.06252337247133255, "learning_rate": 0.002904685437581285, "loss": 1.7794, "step": 20020 }, { "epoch": 0.026599246793605646, "grad_norm": 0.05822984129190445, "learning_rate": 0.00290446320050824, "loss": 1.7819, "step": 20040 }, { "epoch": 0.02673092623317795, "grad_norm": 0.05482339486479759, "learning_rate": 0.0029042407131727073, "loss": 1.7867, "step": 20060 }, { "epoch": 0.026862605672750256, "grad_norm": 0.05103064700961113, "learning_rate": 0.0029040179756143316, "loss": 1.7764, "step": 20080 }, { "epoch": 0.02699428511232256, "grad_norm": 0.06983567029237747, "learning_rate": 0.002903794987872802, "loss": 1.779, "step": 20100 }, { "epoch": 0.027125964551894866, "grad_norm": 0.06782662123441696, "learning_rate": 0.0029035717499878537, "loss": 1.7814, "step": 20120 }, { "epoch": 0.027257643991467174, "grad_norm": 0.07617141306400299, "learning_rate": 0.0029033482619992656, "loss": 1.8055, "step": 20140 }, { "epoch": 0.02738932343103948, "grad_norm": 0.07056764513254166, "learning_rate": 0.002903124523946861, "loss": 1.8267, "step": 20160 }, { "epoch": 0.027521002870611783, "grad_norm": 0.05244629457592964, "learning_rate": 0.0029029005358705085, "loss": 1.8346, "step": 20180 }, { "epoch": 0.027652682310184088, "grad_norm": 0.05634482949972153, "learning_rate": 0.0029026762978101197, "loss": 1.8347, "step": 20200 }, { "epoch": 0.027784361749756393, "grad_norm": 0.060985077172517776, "learning_rate": 0.0029024518098056526, "loss": 1.8397, "step": 20220 }, { "epoch": 0.027916041189328698, "grad_norm": 0.060473646968603134, "learning_rate": 0.0029022270718971083, "loss": 1.8363, "step": 20240 }, { "epoch": 0.028047720628901002, "grad_norm": 0.05223367363214493, "learning_rate": 0.002902002084124533, "loss": 1.8378, "step": 20260 }, { "epoch": 0.028179400068473307, "grad_norm": 0.06747066229581833, "learning_rate": 0.0029017768465280187, "loss": 1.8394, "step": 20280 }, { "epoch": 0.028311079508045615, "grad_norm": 0.06481572240591049, "learning_rate": 0.0029015513591476995, "loss": 1.829, "step": 20300 }, { "epoch": 0.02844275894761792, "grad_norm": 0.07189793139696121, "learning_rate": 0.002901325622023755, "loss": 1.8283, "step": 20320 }, { "epoch": 0.028574438387190225, "grad_norm": 0.0644344687461853, "learning_rate": 0.0029010996351964105, "loss": 1.8265, "step": 20340 }, { "epoch": 0.02870611782676253, "grad_norm": 0.06990751624107361, "learning_rate": 0.002900873398705934, "loss": 1.824, "step": 20360 }, { "epoch": 0.028837797266334834, "grad_norm": 0.07374297082424164, "learning_rate": 0.0029006469125926397, "loss": 1.8223, "step": 20380 }, { "epoch": 0.02896947670590714, "grad_norm": 0.08984444290399551, "learning_rate": 0.0029004201768968838, "loss": 1.8232, "step": 20400 }, { "epoch": 0.029101156145479444, "grad_norm": 0.06562740355730057, "learning_rate": 0.00290019319165907, "loss": 1.8235, "step": 20420 }, { "epoch": 0.02923283558505175, "grad_norm": 0.07431894540786743, "learning_rate": 0.0028999659569196442, "loss": 1.8141, "step": 20440 }, { "epoch": 0.029364515024624054, "grad_norm": 0.057788606733083725, "learning_rate": 0.0028997384727190976, "loss": 1.8159, "step": 20460 }, { "epoch": 0.029496194464196362, "grad_norm": 0.07726121693849564, "learning_rate": 0.002899510739097966, "loss": 1.8156, "step": 20480 }, { "epoch": 0.029627873903768667, "grad_norm": 0.07005012780427933, "learning_rate": 0.0028992827560968297, "loss": 1.8172, "step": 20500 }, { "epoch": 0.02975955334334097, "grad_norm": 0.06550168991088867, "learning_rate": 0.002899054523756313, "loss": 1.8067, "step": 20520 }, { "epoch": 0.029891232782913276, "grad_norm": 0.07354078441858292, "learning_rate": 0.002898826042117084, "loss": 1.8109, "step": 20540 }, { "epoch": 0.03002291222248558, "grad_norm": 0.06678362935781479, "learning_rate": 0.0028985973112198573, "loss": 1.8158, "step": 20560 }, { "epoch": 0.030154591662057886, "grad_norm": 0.08662049472332001, "learning_rate": 0.0028983683311053898, "loss": 1.8077, "step": 20580 }, { "epoch": 0.03028627110163019, "grad_norm": 0.06835264712572098, "learning_rate": 0.0028981391018144845, "loss": 1.8074, "step": 20600 }, { "epoch": 0.030417950541202495, "grad_norm": 0.06030866131186485, "learning_rate": 0.0028979096233879872, "loss": 1.8096, "step": 20620 }, { "epoch": 0.030549629980774803, "grad_norm": 0.07386446744203568, "learning_rate": 0.0028976798958667885, "loss": 1.8134, "step": 20640 }, { "epoch": 0.030681309420347108, "grad_norm": 0.07323277741670609, "learning_rate": 0.002897449919291825, "loss": 1.8073, "step": 20660 }, { "epoch": 0.030812988859919413, "grad_norm": 0.08217355608940125, "learning_rate": 0.0028972196937040754, "loss": 1.8044, "step": 20680 }, { "epoch": 0.030944668299491718, "grad_norm": 0.06611933559179306, "learning_rate": 0.002896989219144564, "loss": 1.8016, "step": 20700 }, { "epoch": 0.031076347739064022, "grad_norm": 0.06082133203744888, "learning_rate": 0.0028967584956543597, "loss": 1.7986, "step": 20720 }, { "epoch": 0.031208027178636327, "grad_norm": 0.06548244506120682, "learning_rate": 0.002896527523274575, "loss": 1.8025, "step": 20740 }, { "epoch": 0.03133970661820863, "grad_norm": 0.08356646448373795, "learning_rate": 0.0028962963020463667, "loss": 1.783, "step": 20760 }, { "epoch": 0.03147138605778094, "grad_norm": 0.06322002410888672, "learning_rate": 0.002896064832010937, "loss": 1.774, "step": 20780 }, { "epoch": 0.03160306549735324, "grad_norm": 0.0772123858332634, "learning_rate": 0.002895833113209531, "loss": 1.7628, "step": 20800 }, { "epoch": 0.031734744936925546, "grad_norm": 0.0836576297879219, "learning_rate": 0.0028956011456834395, "loss": 1.7589, "step": 20820 }, { "epoch": 0.03186642437649785, "grad_norm": 0.06800664216279984, "learning_rate": 0.002895368929473997, "loss": 1.7455, "step": 20840 }, { "epoch": 0.031998103816070156, "grad_norm": 0.058029696345329285, "learning_rate": 0.0028951364646225826, "loss": 1.745, "step": 20860 }, { "epoch": 0.03212978325564246, "grad_norm": 0.05537112057209015, "learning_rate": 0.0028949037511706178, "loss": 1.748, "step": 20880 }, { "epoch": 0.03226146269521477, "grad_norm": 0.06035890802741051, "learning_rate": 0.0028946707891595717, "loss": 1.7463, "step": 20900 }, { "epoch": 0.03239314213478708, "grad_norm": 0.06673149764537811, "learning_rate": 0.002894437578630955, "loss": 1.7429, "step": 20920 }, { "epoch": 0.03252482157435938, "grad_norm": 0.08091327548027039, "learning_rate": 0.0028942041196263245, "loss": 1.7388, "step": 20940 }, { "epoch": 0.03265650101393169, "grad_norm": 0.05750538781285286, "learning_rate": 0.00289397041218728, "loss": 1.7322, "step": 20960 }, { "epoch": 0.03278818045350399, "grad_norm": 0.059635717421770096, "learning_rate": 0.0028937364563554656, "loss": 1.7425, "step": 20980 }, { "epoch": 0.032919859893076296, "grad_norm": 0.07420338690280914, "learning_rate": 0.002893502252172571, "loss": 1.7369, "step": 21000 }, { "epoch": 0.032919859893076296, "eval_loss": 1.7132776975631714, "eval_runtime": 66.0009, "eval_samples_per_second": 15.151, "eval_steps_per_second": 15.151, "step": 21000 }, { "epoch": 0.0330515393326486, "grad_norm": 0.06639964133501053, "learning_rate": 0.0028932677996803286, "loss": 1.7301, "step": 21020 }, { "epoch": 0.033183218772220906, "grad_norm": 0.06292149424552917, "learning_rate": 0.0028930330989205156, "loss": 1.7371, "step": 21040 }, { "epoch": 0.03331489821179321, "grad_norm": 0.07750008255243301, "learning_rate": 0.002892798149934954, "loss": 1.7395, "step": 21060 }, { "epoch": 0.033446577651365515, "grad_norm": 0.056288789957761765, "learning_rate": 0.0028925629527655097, "loss": 1.7346, "step": 21080 }, { "epoch": 0.03357825709093782, "grad_norm": 0.07288241386413574, "learning_rate": 0.002892327507454092, "loss": 1.7306, "step": 21100 }, { "epoch": 0.033709936530510125, "grad_norm": 0.06977301836013794, "learning_rate": 0.002892091814042655, "loss": 1.7293, "step": 21120 }, { "epoch": 0.03384161597008243, "grad_norm": 0.07677018642425537, "learning_rate": 0.0028918558725731986, "loss": 1.7334, "step": 21140 }, { "epoch": 0.033973295409654734, "grad_norm": 0.06132907420396805, "learning_rate": 0.0028916196830877637, "loss": 1.7352, "step": 21160 }, { "epoch": 0.03410497484922704, "grad_norm": 0.08819183707237244, "learning_rate": 0.0028913832456284377, "loss": 1.7383, "step": 21180 }, { "epoch": 0.034236654288799344, "grad_norm": 0.0902981087565422, "learning_rate": 0.0028911465602373524, "loss": 1.7296, "step": 21200 }, { "epoch": 0.03436833372837165, "grad_norm": 0.07254979014396667, "learning_rate": 0.0028909096269566815, "loss": 1.7314, "step": 21220 }, { "epoch": 0.03450001316794396, "grad_norm": 0.08108898252248764, "learning_rate": 0.0028906724458286456, "loss": 1.7365, "step": 21240 }, { "epoch": 0.034631692607516265, "grad_norm": 0.061406515538692474, "learning_rate": 0.002890435016895507, "loss": 1.7338, "step": 21260 }, { "epoch": 0.03476337204708857, "grad_norm": 0.07603522390127182, "learning_rate": 0.0028901973401995744, "loss": 1.727, "step": 21280 }, { "epoch": 0.034895051486660875, "grad_norm": 0.08022353053092957, "learning_rate": 0.002889959415783199, "loss": 1.7258, "step": 21300 }, { "epoch": 0.03502673092623318, "grad_norm": 0.061437543481588364, "learning_rate": 0.0028897212436887775, "loss": 1.7416, "step": 21320 }, { "epoch": 0.035158410365805484, "grad_norm": 0.07316586375236511, "learning_rate": 0.0028894828239587494, "loss": 1.7415, "step": 21340 }, { "epoch": 0.03529008980537779, "grad_norm": 0.09495033323764801, "learning_rate": 0.002889244156635599, "loss": 1.7403, "step": 21360 }, { "epoch": 0.035421769244950094, "grad_norm": 0.06723074615001678, "learning_rate": 0.002889005241761854, "loss": 1.7497, "step": 21380 }, { "epoch": 0.0355534486845224, "grad_norm": 0.05688747763633728, "learning_rate": 0.002888766079380088, "loss": 1.7408, "step": 21400 }, { "epoch": 0.0356851281240947, "grad_norm": 0.06509803235530853, "learning_rate": 0.002888526669532917, "loss": 1.7461, "step": 21420 }, { "epoch": 0.03581680756366701, "grad_norm": 0.07571250200271606, "learning_rate": 0.002888287012263002, "loss": 1.7385, "step": 21440 }, { "epoch": 0.03594848700323931, "grad_norm": 0.0633770301938057, "learning_rate": 0.002888047107613047, "loss": 1.743, "step": 21460 }, { "epoch": 0.03608016644281162, "grad_norm": 0.07172537595033646, "learning_rate": 0.0028878069556258013, "loss": 1.7289, "step": 21480 }, { "epoch": 0.03621184588238392, "grad_norm": 0.09092337638139725, "learning_rate": 0.002887566556344058, "loss": 1.7392, "step": 21500 }, { "epoch": 0.03634352532195623, "grad_norm": 0.06401342898607254, "learning_rate": 0.002887325909810653, "loss": 1.7372, "step": 21520 }, { "epoch": 0.03647520476152853, "grad_norm": 0.06551776826381683, "learning_rate": 0.0028870850160684688, "loss": 1.7221, "step": 21540 }, { "epoch": 0.036606884201100844, "grad_norm": 0.08069788664579391, "learning_rate": 0.0028868438751604294, "loss": 1.7201, "step": 21560 }, { "epoch": 0.03673856364067315, "grad_norm": 0.05819667875766754, "learning_rate": 0.002886602487129504, "loss": 1.7256, "step": 21580 }, { "epoch": 0.03687024308024545, "grad_norm": 0.06299937516450882, "learning_rate": 0.0028863608520187066, "loss": 1.7216, "step": 21600 }, { "epoch": 0.03700192251981776, "grad_norm": 0.08698736876249313, "learning_rate": 0.002886118969871093, "loss": 1.7208, "step": 21620 }, { "epoch": 0.03713360195939006, "grad_norm": 0.07046283036470413, "learning_rate": 0.0028858768407297656, "loss": 1.7141, "step": 21640 }, { "epoch": 0.03726528139896237, "grad_norm": 0.06260740756988525, "learning_rate": 0.0028856344646378687, "loss": 1.7243, "step": 21660 }, { "epoch": 0.03739696083853467, "grad_norm": 0.0720597505569458, "learning_rate": 0.0028853918416385928, "loss": 1.7195, "step": 21680 }, { "epoch": 0.03752864027810698, "grad_norm": 0.07073231786489487, "learning_rate": 0.0028851489717751696, "loss": 1.7241, "step": 21700 }, { "epoch": 0.03766031971767928, "grad_norm": 0.05944892391562462, "learning_rate": 0.0028849058550908767, "loss": 1.7201, "step": 21720 }, { "epoch": 0.037791999157251586, "grad_norm": 0.06408489495515823, "learning_rate": 0.0028846624916290357, "loss": 1.7228, "step": 21740 }, { "epoch": 0.03792367859682389, "grad_norm": 0.07245621085166931, "learning_rate": 0.002884418881433012, "loss": 1.7191, "step": 21760 }, { "epoch": 0.038055358036396196, "grad_norm": 0.06913050264120102, "learning_rate": 0.0028841750245462137, "loss": 1.7228, "step": 21780 }, { "epoch": 0.0381870374759685, "grad_norm": 0.057451095432043076, "learning_rate": 0.002883930921012094, "loss": 1.7163, "step": 21800 }, { "epoch": 0.038318716915540806, "grad_norm": 0.07231597602367401, "learning_rate": 0.002883686570874151, "loss": 1.7143, "step": 21820 }, { "epoch": 0.03845039635511311, "grad_norm": 0.08483259379863739, "learning_rate": 0.0028834419741759244, "loss": 1.7216, "step": 21840 }, { "epoch": 0.038582075794685415, "grad_norm": 0.0528041310608387, "learning_rate": 0.0028831971309610004, "loss": 1.7174, "step": 21860 }, { "epoch": 0.03871375523425772, "grad_norm": 0.06268829107284546, "learning_rate": 0.0028829520412730065, "loss": 1.721, "step": 21880 }, { "epoch": 0.03884543467383003, "grad_norm": 0.08661678433418274, "learning_rate": 0.0028827067051556163, "loss": 1.7196, "step": 21900 }, { "epoch": 0.038977114113402336, "grad_norm": 0.062315549701452255, "learning_rate": 0.0028824611226525455, "loss": 1.7481, "step": 21920 }, { "epoch": 0.03910879355297464, "grad_norm": 0.0838395208120346, "learning_rate": 0.002882215293807556, "loss": 1.7647, "step": 21940 }, { "epoch": 0.039240472992546946, "grad_norm": 0.06503219902515411, "learning_rate": 0.0028819692186644514, "loss": 1.7775, "step": 21960 }, { "epoch": 0.03937215243211925, "grad_norm": 0.06856662034988403, "learning_rate": 0.0028817228972670803, "loss": 1.7717, "step": 21980 }, { "epoch": 0.039503831871691555, "grad_norm": 0.055163074284791946, "learning_rate": 0.002881476329659335, "loss": 1.7772, "step": 22000 }, { "epoch": 0.039503831871691555, "eval_loss": 1.7622946500778198, "eval_runtime": 67.7091, "eval_samples_per_second": 14.769, "eval_steps_per_second": 14.769, "step": 22000 }, { "epoch": 0.03963551131126386, "grad_norm": 0.09752371162176132, "learning_rate": 0.002881229515885151, "loss": 1.7653, "step": 22020 }, { "epoch": 0.039767190750836165, "grad_norm": 0.09371519088745117, "learning_rate": 0.0028809824559885085, "loss": 1.7757, "step": 22040 }, { "epoch": 0.03989887019040847, "grad_norm": 0.06047109514474869, "learning_rate": 0.002880735150013432, "loss": 1.7666, "step": 22060 }, { "epoch": 0.040030549629980774, "grad_norm": 0.07913815230131149, "learning_rate": 0.0028804875980039885, "loss": 1.7664, "step": 22080 }, { "epoch": 0.04016222906955308, "grad_norm": 0.06452839821577072, "learning_rate": 0.0028802398000042895, "loss": 1.7689, "step": 22100 }, { "epoch": 0.040293908509125384, "grad_norm": 0.07609876990318298, "learning_rate": 0.0028799917560584907, "loss": 1.767, "step": 22120 }, { "epoch": 0.04042558794869769, "grad_norm": 0.07160958647727966, "learning_rate": 0.0028797434662107906, "loss": 1.7677, "step": 22140 }, { "epoch": 0.040557267388269994, "grad_norm": 0.06023573875427246, "learning_rate": 0.002879494930505433, "loss": 1.766, "step": 22160 }, { "epoch": 0.0406889468278423, "grad_norm": 0.06579054147005081, "learning_rate": 0.0028792461489867043, "loss": 1.7568, "step": 22180 }, { "epoch": 0.0408206262674146, "grad_norm": 0.065089151263237, "learning_rate": 0.0028789971216989347, "loss": 1.7607, "step": 22200 }, { "epoch": 0.04095230570698691, "grad_norm": 0.06882410496473312, "learning_rate": 0.002878747848686499, "loss": 1.7594, "step": 22220 }, { "epoch": 0.04108398514655922, "grad_norm": 0.08353780955076218, "learning_rate": 0.0028784983299938163, "loss": 1.7538, "step": 22240 }, { "epoch": 0.041215664586131524, "grad_norm": 0.06264527142047882, "learning_rate": 0.002878248565665347, "loss": 1.7511, "step": 22260 }, { "epoch": 0.04134734402570383, "grad_norm": 0.06513512134552002, "learning_rate": 0.0028779985557455968, "loss": 1.7527, "step": 22280 }, { "epoch": 0.041479023465276134, "grad_norm": 0.06116553023457527, "learning_rate": 0.0028777483002791165, "loss": 1.7505, "step": 22300 }, { "epoch": 0.04161070290484844, "grad_norm": 0.07746737450361252, "learning_rate": 0.002877497799310498, "loss": 1.7506, "step": 22320 }, { "epoch": 0.04174238234442074, "grad_norm": 0.05574808269739151, "learning_rate": 0.00287724705288438, "loss": 1.7452, "step": 22340 }, { "epoch": 0.04187406178399305, "grad_norm": 0.0626768171787262, "learning_rate": 0.002876996061045441, "loss": 1.7506, "step": 22360 }, { "epoch": 0.04200574122356535, "grad_norm": 0.07668133080005646, "learning_rate": 0.0028767448238384073, "loss": 1.7489, "step": 22380 }, { "epoch": 0.04213742066313766, "grad_norm": 0.08054382354021072, "learning_rate": 0.002876493341308046, "loss": 1.7492, "step": 22400 }, { "epoch": 0.04226910010270996, "grad_norm": 0.06886732578277588, "learning_rate": 0.0028762416134991697, "loss": 1.7482, "step": 22420 }, { "epoch": 0.04240077954228227, "grad_norm": 0.11965472251176834, "learning_rate": 0.0028759896404566333, "loss": 1.7443, "step": 22440 }, { "epoch": 0.04253245898185457, "grad_norm": 0.07691692560911179, "learning_rate": 0.0028757374222253365, "loss": 1.7421, "step": 22460 }, { "epoch": 0.04266413842142688, "grad_norm": 0.06630564481019974, "learning_rate": 0.002875484958850222, "loss": 1.7439, "step": 22480 }, { "epoch": 0.04279581786099918, "grad_norm": 0.06624884158372879, "learning_rate": 0.002875232250376277, "loss": 1.7532, "step": 22500 }, { "epoch": 0.042927497300571486, "grad_norm": 0.06218545883893967, "learning_rate": 0.002874979296848531, "loss": 1.7689, "step": 22520 }, { "epoch": 0.04305917674014379, "grad_norm": 0.08492391556501389, "learning_rate": 0.002874726098312059, "loss": 1.7707, "step": 22540 }, { "epoch": 0.043190856179716096, "grad_norm": 0.07384103536605835, "learning_rate": 0.0028744726548119784, "loss": 1.7758, "step": 22560 }, { "epoch": 0.04332253561928841, "grad_norm": 0.07037446647882462, "learning_rate": 0.0028742189663934496, "loss": 1.7694, "step": 22580 }, { "epoch": 0.04345421505886071, "grad_norm": 0.06753331422805786, "learning_rate": 0.0028739650331016785, "loss": 1.7684, "step": 22600 }, { "epoch": 0.04358589449843302, "grad_norm": 0.0832001268863678, "learning_rate": 0.0028737108549819136, "loss": 1.7703, "step": 22620 }, { "epoch": 0.04371757393800532, "grad_norm": 0.07064741849899292, "learning_rate": 0.002873456432079447, "loss": 1.7782, "step": 22640 }, { "epoch": 0.04384925337757763, "grad_norm": 0.06530604511499405, "learning_rate": 0.0028732017644396137, "loss": 1.7668, "step": 22660 }, { "epoch": 0.04398093281714993, "grad_norm": 0.09668663144111633, "learning_rate": 0.002872946852107795, "loss": 1.7674, "step": 22680 }, { "epoch": 0.044112612256722236, "grad_norm": 0.07591857761144638, "learning_rate": 0.002872691695129412, "loss": 1.7575, "step": 22700 }, { "epoch": 0.04424429169629454, "grad_norm": 0.08346087485551834, "learning_rate": 0.002872436293549932, "loss": 1.7595, "step": 22720 }, { "epoch": 0.044375971135866846, "grad_norm": 0.06290127336978912, "learning_rate": 0.0028721806474148663, "loss": 1.7576, "step": 22740 }, { "epoch": 0.04450765057543915, "grad_norm": 0.06168945133686066, "learning_rate": 0.002871924756769767, "loss": 1.7596, "step": 22760 }, { "epoch": 0.044639330015011455, "grad_norm": 0.07243330031633377, "learning_rate": 0.002871668621660233, "loss": 1.7604, "step": 22780 }, { "epoch": 0.04477100945458376, "grad_norm": 0.06622735410928726, "learning_rate": 0.002871412242131904, "loss": 1.7537, "step": 22800 }, { "epoch": 0.044902688894156065, "grad_norm": 0.057980917394161224, "learning_rate": 0.0028711556182304653, "loss": 1.7485, "step": 22820 }, { "epoch": 0.04503436833372837, "grad_norm": 0.07098107784986496, "learning_rate": 0.0028708987500016443, "loss": 1.748, "step": 22840 }, { "epoch": 0.045166047773300674, "grad_norm": 0.08247384428977966, "learning_rate": 0.002870641637491213, "loss": 1.7512, "step": 22860 }, { "epoch": 0.04529772721287298, "grad_norm": 0.07915489375591278, "learning_rate": 0.002870384280744987, "loss": 1.7551, "step": 22880 }, { "epoch": 0.045429406652445284, "grad_norm": 0.08467677235603333, "learning_rate": 0.0028701266798088236, "loss": 1.7454, "step": 22900 }, { "epoch": 0.045561086092017596, "grad_norm": 0.0650927871465683, "learning_rate": 0.002869868834728626, "loss": 1.7409, "step": 22920 }, { "epoch": 0.0456927655315899, "grad_norm": 0.08258968591690063, "learning_rate": 0.002869610745550339, "loss": 1.747, "step": 22940 }, { "epoch": 0.045824444971162205, "grad_norm": 0.06526441127061844, "learning_rate": 0.0028693524123199524, "loss": 1.7494, "step": 22960 }, { "epoch": 0.04595612441073451, "grad_norm": 0.08214429020881653, "learning_rate": 0.0028690938350834994, "loss": 1.7537, "step": 22980 }, { "epoch": 0.046087803850306815, "grad_norm": 0.06021787226200104, "learning_rate": 0.0028688350138870544, "loss": 1.7492, "step": 23000 }, { "epoch": 0.046087803850306815, "eval_loss": 1.614139437675476, "eval_runtime": 64.9061, "eval_samples_per_second": 15.407, "eval_steps_per_second": 15.407, "step": 23000 }, { "epoch": 0.04621948328987912, "grad_norm": 0.09553001075983047, "learning_rate": 0.002868575948776738, "loss": 1.751, "step": 23020 }, { "epoch": 0.046351162729451424, "grad_norm": 0.06959230452775955, "learning_rate": 0.0028683166397987137, "loss": 1.7443, "step": 23040 }, { "epoch": 0.04648284216902373, "grad_norm": 0.07799062877893448, "learning_rate": 0.0028680570869991863, "loss": 1.7412, "step": 23060 }, { "epoch": 0.046614521608596034, "grad_norm": 0.06044070050120354, "learning_rate": 0.002867797290424408, "loss": 1.7404, "step": 23080 }, { "epoch": 0.04674620104816834, "grad_norm": 0.06427774578332901, "learning_rate": 0.00286753725012067, "loss": 1.7424, "step": 23100 }, { "epoch": 0.04687788048774064, "grad_norm": 0.0699395090341568, "learning_rate": 0.002867276966134311, "loss": 1.7364, "step": 23120 }, { "epoch": 0.04700955992731295, "grad_norm": 0.05850491672754288, "learning_rate": 0.00286701643851171, "loss": 1.6901, "step": 23140 }, { "epoch": 0.04714123936688525, "grad_norm": 0.07173515111207962, "learning_rate": 0.002866755667299291, "loss": 1.6853, "step": 23160 }, { "epoch": 0.04727291880645756, "grad_norm": 0.10769501328468323, "learning_rate": 0.002866494652543521, "loss": 1.6832, "step": 23180 }, { "epoch": 0.04740459824602986, "grad_norm": 0.08263743668794632, "learning_rate": 0.0028662333942909104, "loss": 1.6789, "step": 23200 }, { "epoch": 0.04753627768560217, "grad_norm": 0.06656038016080856, "learning_rate": 0.0028659718925880128, "loss": 1.6759, "step": 23220 }, { "epoch": 0.04766795712517447, "grad_norm": 0.0891193225979805, "learning_rate": 0.0028657101474814264, "loss": 1.6761, "step": 23240 }, { "epoch": 0.047799636564746784, "grad_norm": 0.08038073033094406, "learning_rate": 0.0028654481590177907, "loss": 1.6701, "step": 23260 }, { "epoch": 0.04793131600431909, "grad_norm": 0.08320681005716324, "learning_rate": 0.0028651859272437897, "loss": 1.6733, "step": 23280 }, { "epoch": 0.04806299544389139, "grad_norm": 0.0696556568145752, "learning_rate": 0.0028649234522061516, "loss": 1.6736, "step": 23300 }, { "epoch": 0.0481946748834637, "grad_norm": 0.08962351828813553, "learning_rate": 0.002864660733951646, "loss": 1.6655, "step": 23320 }, { "epoch": 0.048326354323036, "grad_norm": 0.07071159034967422, "learning_rate": 0.0028643977725270877, "loss": 1.6765, "step": 23340 }, { "epoch": 0.04845803376260831, "grad_norm": 0.07777654379606247, "learning_rate": 0.0028641345679793337, "loss": 1.6659, "step": 23360 }, { "epoch": 0.04858971320218061, "grad_norm": 0.0689220279455185, "learning_rate": 0.002863871120355285, "loss": 1.6657, "step": 23380 }, { "epoch": 0.04872139264175292, "grad_norm": 0.08802857995033264, "learning_rate": 0.002863607429701884, "loss": 1.67, "step": 23400 }, { "epoch": 0.04885307208132522, "grad_norm": 0.06455916166305542, "learning_rate": 0.00286334349606612, "loss": 1.6648, "step": 23420 }, { "epoch": 0.048984751520897526, "grad_norm": 0.06590025126934052, "learning_rate": 0.0028630793194950226, "loss": 1.6652, "step": 23440 }, { "epoch": 0.04911643096046983, "grad_norm": 0.07274986058473587, "learning_rate": 0.0028628149000356658, "loss": 1.6589, "step": 23460 }, { "epoch": 0.049248110400042136, "grad_norm": 0.079200379550457, "learning_rate": 0.0028625502377351664, "loss": 1.6592, "step": 23480 }, { "epoch": 0.04937978983961444, "grad_norm": 0.08473269641399384, "learning_rate": 0.0028622853326406854, "loss": 1.6639, "step": 23500 }, { "epoch": 0.049511469279186746, "grad_norm": 0.0783248320221901, "learning_rate": 0.002862020184799426, "loss": 1.6609, "step": 23520 }, { "epoch": 0.04964314871875905, "grad_norm": 0.08220840990543365, "learning_rate": 0.002861754794258635, "loss": 1.6648, "step": 23540 }, { "epoch": 0.049774828158331355, "grad_norm": 0.06549611687660217, "learning_rate": 0.002861489161065603, "loss": 1.6619, "step": 23560 }, { "epoch": 0.04990650759790366, "grad_norm": 0.07199726998806, "learning_rate": 0.0028612232852676636, "loss": 1.6671, "step": 23580 }, { "epoch": 0.05003818703747597, "grad_norm": 0.08660496026277542, "learning_rate": 0.0028609571669121927, "loss": 1.6667, "step": 23600 }, { "epoch": 0.050169866477048276, "grad_norm": 0.10165523737668991, "learning_rate": 0.002860690806046611, "loss": 1.6579, "step": 23620 }, { "epoch": 0.05030154591662058, "grad_norm": 0.07491469383239746, "learning_rate": 0.00286042420271838, "loss": 1.662, "step": 23640 }, { "epoch": 0.050433225356192886, "grad_norm": 0.08252348750829697, "learning_rate": 0.0028601573569750085, "loss": 1.6665, "step": 23660 }, { "epoch": 0.05056490479576519, "grad_norm": 0.06357965618371964, "learning_rate": 0.0028598902688640434, "loss": 1.6753, "step": 23680 }, { "epoch": 0.050696584235337495, "grad_norm": 0.06429125368595123, "learning_rate": 0.0028596229384330787, "loss": 1.6727, "step": 23700 }, { "epoch": 0.0508282636749098, "grad_norm": 0.0685480460524559, "learning_rate": 0.0028593553657297504, "loss": 1.6862, "step": 23720 }, { "epoch": 0.050959943114482105, "grad_norm": 0.06911630928516388, "learning_rate": 0.002859087550801737, "loss": 1.6896, "step": 23740 }, { "epoch": 0.05109162255405441, "grad_norm": 0.06673968583345413, "learning_rate": 0.0028588194936967604, "loss": 1.6872, "step": 23760 }, { "epoch": 0.051223301993626714, "grad_norm": 0.08397223055362701, "learning_rate": 0.0028585511944625866, "loss": 1.6822, "step": 23780 }, { "epoch": 0.05135498143319902, "grad_norm": 0.0685010775923729, "learning_rate": 0.002858282653147024, "loss": 1.6926, "step": 23800 }, { "epoch": 0.051486660872771324, "grad_norm": 0.06479799002408981, "learning_rate": 0.0028580138697979237, "loss": 1.6875, "step": 23820 }, { "epoch": 0.05161834031234363, "grad_norm": 0.06732255220413208, "learning_rate": 0.002857744844463181, "loss": 1.6848, "step": 23840 }, { "epoch": 0.051750019751915934, "grad_norm": 0.06983063369989395, "learning_rate": 0.0028574755771907335, "loss": 1.6812, "step": 23860 }, { "epoch": 0.05188169919148824, "grad_norm": 0.07041189819574356, "learning_rate": 0.0028572060680285617, "loss": 1.6756, "step": 23880 }, { "epoch": 0.05201337863106054, "grad_norm": 0.06055330112576485, "learning_rate": 0.0028569363170246904, "loss": 1.6781, "step": 23900 }, { "epoch": 0.052145058070632855, "grad_norm": 0.07243553549051285, "learning_rate": 0.0028566663242271862, "loss": 1.6781, "step": 23920 }, { "epoch": 0.05227673751020516, "grad_norm": 0.08006641268730164, "learning_rate": 0.00285639608968416, "loss": 1.6846, "step": 23940 }, { "epoch": 0.052408416949777464, "grad_norm": 0.10588499903678894, "learning_rate": 0.0028561256134437647, "loss": 1.6757, "step": 23960 }, { "epoch": 0.05254009638934977, "grad_norm": 0.07262659072875977, "learning_rate": 0.0028558548955541965, "loss": 1.6781, "step": 23980 }, { "epoch": 0.052671775828922074, "grad_norm": 0.06767702847719193, "learning_rate": 0.002855583936063695, "loss": 1.672, "step": 24000 }, { "epoch": 0.052671775828922074, "eval_loss": 1.5004775524139404, "eval_runtime": 67.8841, "eval_samples_per_second": 14.731, "eval_steps_per_second": 14.731, "step": 24000 }, { "epoch": 0.05280345526849438, "grad_norm": 0.08169445395469666, "learning_rate": 0.002855312735020543, "loss": 1.675, "step": 24020 }, { "epoch": 0.05293513470806668, "grad_norm": 0.06959936767816544, "learning_rate": 0.0028550412924730657, "loss": 1.6778, "step": 24040 }, { "epoch": 0.05306681414763899, "grad_norm": 0.08186500519514084, "learning_rate": 0.002854769608469632, "loss": 1.6797, "step": 24060 }, { "epoch": 0.05319849358721129, "grad_norm": 0.07614962756633759, "learning_rate": 0.002854497683058653, "loss": 1.6682, "step": 24080 }, { "epoch": 0.0533301730267836, "grad_norm": 0.06458086520433426, "learning_rate": 0.002854225516288584, "loss": 1.6777, "step": 24100 }, { "epoch": 0.0534618524663559, "grad_norm": 0.07567057013511658, "learning_rate": 0.002853953108207922, "loss": 1.6709, "step": 24120 }, { "epoch": 0.05359353190592821, "grad_norm": 0.06437589973211288, "learning_rate": 0.002853680458865208, "loss": 1.672, "step": 24140 }, { "epoch": 0.05372521134550051, "grad_norm": 0.09382762014865875, "learning_rate": 0.0028534075683090254, "loss": 1.6754, "step": 24160 }, { "epoch": 0.05385689078507282, "grad_norm": 0.06308145076036453, "learning_rate": 0.002853134436588001, "loss": 1.6796, "step": 24180 }, { "epoch": 0.05398857022464512, "grad_norm": 0.07414955645799637, "learning_rate": 0.002852861063750804, "loss": 1.6753, "step": 24200 }, { "epoch": 0.054120249664217426, "grad_norm": 0.08207368105649948, "learning_rate": 0.0028525874498461475, "loss": 1.6737, "step": 24220 }, { "epoch": 0.05425192910378973, "grad_norm": 0.1388959437608719, "learning_rate": 0.0028523135949227864, "loss": 1.6711, "step": 24240 }, { "epoch": 0.05438360854336204, "grad_norm": 0.07871943712234497, "learning_rate": 0.0028520394990295193, "loss": 1.6799, "step": 24260 }, { "epoch": 0.05451528798293435, "grad_norm": 0.0691281110048294, "learning_rate": 0.0028517651622151884, "loss": 1.6845, "step": 24280 }, { "epoch": 0.05464696742250665, "grad_norm": 0.07609487324953079, "learning_rate": 0.002851490584528677, "loss": 1.7203, "step": 24300 }, { "epoch": 0.05477864686207896, "grad_norm": 0.07939011603593826, "learning_rate": 0.002851215766018913, "loss": 1.7355, "step": 24320 }, { "epoch": 0.05491032630165126, "grad_norm": 0.0882917046546936, "learning_rate": 0.0028509407067348652, "loss": 1.7458, "step": 24340 }, { "epoch": 0.05504200574122357, "grad_norm": 0.08259212225675583, "learning_rate": 0.0028506654067255487, "loss": 1.7469, "step": 24360 }, { "epoch": 0.05517368518079587, "grad_norm": 0.0653611272573471, "learning_rate": 0.0028503898660400175, "loss": 1.7565, "step": 24380 }, { "epoch": 0.055305364620368176, "grad_norm": 0.07420220971107483, "learning_rate": 0.002850114084727372, "loss": 1.7467, "step": 24400 }, { "epoch": 0.05543704405994048, "grad_norm": 0.12061482667922974, "learning_rate": 0.002849838062836753, "loss": 1.7476, "step": 24420 }, { "epoch": 0.055568723499512786, "grad_norm": 0.08582179993391037, "learning_rate": 0.0028495618004173453, "loss": 1.743, "step": 24440 }, { "epoch": 0.05570040293908509, "grad_norm": 0.11333516985177994, "learning_rate": 0.0028492852975183767, "loss": 1.7446, "step": 24460 }, { "epoch": 0.055832082378657395, "grad_norm": 0.06701093912124634, "learning_rate": 0.0028490085541891166, "loss": 1.7329, "step": 24480 }, { "epoch": 0.0559637618182297, "grad_norm": 0.07070864737033844, "learning_rate": 0.0028487315704788787, "loss": 1.741, "step": 24500 }, { "epoch": 0.056095441257802005, "grad_norm": 0.08799562603235245, "learning_rate": 0.0028484543464370187, "loss": 1.7349, "step": 24520 }, { "epoch": 0.05622712069737431, "grad_norm": 0.08984426409006119, "learning_rate": 0.002848176882112936, "loss": 1.7277, "step": 24540 }, { "epoch": 0.056358800136946614, "grad_norm": 0.08583886176347733, "learning_rate": 0.002847899177556072, "loss": 1.7304, "step": 24560 }, { "epoch": 0.05649047957651892, "grad_norm": 0.07309599220752716, "learning_rate": 0.0028476212328159105, "loss": 1.736, "step": 24580 }, { "epoch": 0.05662215901609123, "grad_norm": 0.10758428275585175, "learning_rate": 0.0028473430479419794, "loss": 1.7309, "step": 24600 }, { "epoch": 0.056753838455663536, "grad_norm": 0.07512976229190826, "learning_rate": 0.0028470646229838475, "loss": 1.7258, "step": 24620 }, { "epoch": 0.05688551789523584, "grad_norm": 0.09403645247220993, "learning_rate": 0.00284678595799113, "loss": 1.7245, "step": 24640 }, { "epoch": 0.057017197334808145, "grad_norm": 0.06885070353746414, "learning_rate": 0.0028465070530134797, "loss": 1.7257, "step": 24660 }, { "epoch": 0.05714887677438045, "grad_norm": 0.07384008169174194, "learning_rate": 0.0028462279081005967, "loss": 1.7237, "step": 24680 }, { "epoch": 0.057280556213952755, "grad_norm": 0.08138833940029144, "learning_rate": 0.0028459485233022215, "loss": 1.7216, "step": 24700 }, { "epoch": 0.05741223565352506, "grad_norm": 0.057137709110975266, "learning_rate": 0.002845668898668138, "loss": 1.7229, "step": 24720 }, { "epoch": 0.057543915093097364, "grad_norm": 0.06821935623884201, "learning_rate": 0.0028453890342481727, "loss": 1.7139, "step": 24740 }, { "epoch": 0.05767559453266967, "grad_norm": 0.07039092481136322, "learning_rate": 0.002845108930092195, "loss": 1.7257, "step": 24760 }, { "epoch": 0.057807273972241974, "grad_norm": 0.06676448881626129, "learning_rate": 0.0028448285862501164, "loss": 1.7204, "step": 24780 }, { "epoch": 0.05793895341181428, "grad_norm": 0.0648011863231659, "learning_rate": 0.0028445480027718922, "loss": 1.7128, "step": 24800 }, { "epoch": 0.05807063285138658, "grad_norm": 0.07681864500045776, "learning_rate": 0.0028442671797075194, "loss": 1.7201, "step": 24820 }, { "epoch": 0.05820231229095889, "grad_norm": 0.06368867307901382, "learning_rate": 0.0028439861171070386, "loss": 1.7169, "step": 24840 }, { "epoch": 0.05833399173053119, "grad_norm": 0.08015841245651245, "learning_rate": 0.0028437048150205322, "loss": 1.7143, "step": 24860 }, { "epoch": 0.0584656711701035, "grad_norm": 0.06920666247606277, "learning_rate": 0.0028434232734981255, "loss": 1.7262, "step": 24880 }, { "epoch": 0.0585973506096758, "grad_norm": 0.1089114099740982, "learning_rate": 0.002843141492589987, "loss": 1.7356, "step": 24900 }, { "epoch": 0.05872903004924811, "grad_norm": 0.06988651305437088, "learning_rate": 0.0028428594723463275, "loss": 1.7347, "step": 24920 }, { "epoch": 0.05886070948882042, "grad_norm": 0.076754629611969, "learning_rate": 0.0028425772128173998, "loss": 1.7332, "step": 24940 }, { "epoch": 0.058992388928392724, "grad_norm": 0.07548579573631287, "learning_rate": 0.0028422947140535008, "loss": 1.7258, "step": 24960 }, { "epoch": 0.05912406836796503, "grad_norm": 0.0791606530547142, "learning_rate": 0.0028420119761049687, "loss": 1.7298, "step": 24980 }, { "epoch": 0.05925574780753733, "grad_norm": 0.06826753914356232, "learning_rate": 0.0028417289990221853, "loss": 1.7286, "step": 25000 }, { "epoch": 0.05925574780753733, "eval_loss": 1.641815423965454, "eval_runtime": 66.1639, "eval_samples_per_second": 15.114, "eval_steps_per_second": 15.114, "step": 25000 }, { "epoch": 0.05938742724710964, "grad_norm": 0.06096088886260986, "learning_rate": 0.0028414457828555735, "loss": 1.7278, "step": 25020 }, { "epoch": 0.05951910668668194, "grad_norm": 0.0753740519285202, "learning_rate": 0.0028411623276556005, "loss": 1.7184, "step": 25040 }, { "epoch": 0.05965078612625425, "grad_norm": 0.06860582530498505, "learning_rate": 0.0028408786334727758, "loss": 1.7238, "step": 25060 }, { "epoch": 0.05978246556582655, "grad_norm": 0.08930736780166626, "learning_rate": 0.0028405947003576505, "loss": 1.717, "step": 25080 }, { "epoch": 0.05991414500539886, "grad_norm": 0.06507642567157745, "learning_rate": 0.002840310528360819, "loss": 1.7187, "step": 25100 }, { "epoch": 0.06004582444497116, "grad_norm": 0.07465964555740356, "learning_rate": 0.0028400261175329186, "loss": 1.7214, "step": 25120 }, { "epoch": 0.060177503884543466, "grad_norm": 0.08822104334831238, "learning_rate": 0.002839741467924628, "loss": 1.7129, "step": 25140 }, { "epoch": 0.06030918332411577, "grad_norm": 0.12070819735527039, "learning_rate": 0.00283945657958667, "loss": 1.7093, "step": 25160 }, { "epoch": 0.060440862763688076, "grad_norm": 0.06325086951255798, "learning_rate": 0.002839171452569808, "loss": 1.7043, "step": 25180 }, { "epoch": 0.06057254220326038, "grad_norm": 0.07239518314599991, "learning_rate": 0.00283888608692485, "loss": 1.7006, "step": 25200 }, { "epoch": 0.060704221642832686, "grad_norm": 0.08891430497169495, "learning_rate": 0.002838600482702645, "loss": 1.7102, "step": 25220 }, { "epoch": 0.06083590108240499, "grad_norm": 0.06925225257873535, "learning_rate": 0.0028383146399540856, "loss": 1.7128, "step": 25240 }, { "epoch": 0.060967580521977295, "grad_norm": 0.10547026246786118, "learning_rate": 0.0028380285587301054, "loss": 1.7051, "step": 25260 }, { "epoch": 0.06109925996154961, "grad_norm": 0.07027033716440201, "learning_rate": 0.0028377422390816823, "loss": 1.7204, "step": 25280 }, { "epoch": 0.06123093940112191, "grad_norm": 0.06962334364652634, "learning_rate": 0.0028374556810598357, "loss": 1.714, "step": 25300 }, { "epoch": 0.061362618840694216, "grad_norm": 0.09216281771659851, "learning_rate": 0.0028371688847156277, "loss": 1.7058, "step": 25320 }, { "epoch": 0.06149429828026652, "grad_norm": 0.07846725732088089, "learning_rate": 0.0028368818501001624, "loss": 1.712, "step": 25340 }, { "epoch": 0.061625977719838826, "grad_norm": 0.11076796799898148, "learning_rate": 0.002836594577264587, "loss": 1.7075, "step": 25360 }, { "epoch": 0.06175765715941113, "grad_norm": 0.07543148845434189, "learning_rate": 0.00283630706626009, "loss": 1.7033, "step": 25380 }, { "epoch": 0.061889336598983435, "grad_norm": 0.08785652369260788, "learning_rate": 0.002836019317137905, "loss": 1.7076, "step": 25400 }, { "epoch": 0.06202101603855574, "grad_norm": 0.0767190009355545, "learning_rate": 0.002835731329949305, "loss": 1.6997, "step": 25420 }, { "epoch": 0.062152695478128045, "grad_norm": 0.06853576004505157, "learning_rate": 0.002835443104745607, "loss": 1.7111, "step": 25440 }, { "epoch": 0.06228437491770035, "grad_norm": 0.07039535045623779, "learning_rate": 0.0028351546415781703, "loss": 1.6986, "step": 25460 }, { "epoch": 0.062416054357272654, "grad_norm": 0.06429757922887802, "learning_rate": 0.002834865940498396, "loss": 1.7016, "step": 25480 }, { "epoch": 0.06254773379684496, "grad_norm": 0.06879903376102448, "learning_rate": 0.0028345770015577275, "loss": 1.6425, "step": 25500 }, { "epoch": 0.06267941323641726, "grad_norm": 0.0694214403629303, "learning_rate": 0.0028342878248076527, "loss": 1.5967, "step": 25520 }, { "epoch": 0.06281109267598957, "grad_norm": 0.07605341076850891, "learning_rate": 0.002833998410299699, "loss": 1.5833, "step": 25540 }, { "epoch": 0.06294277211556187, "grad_norm": 0.06291548907756805, "learning_rate": 0.002833708758085438, "loss": 1.5772, "step": 25560 }, { "epoch": 0.06307445155513418, "grad_norm": 0.06334402412176132, "learning_rate": 0.0028334188682164825, "loss": 1.5762, "step": 25580 }, { "epoch": 0.06320613099470648, "grad_norm": 0.0940147116780281, "learning_rate": 0.002833128740744488, "loss": 1.5723, "step": 25600 }, { "epoch": 0.06333781043427879, "grad_norm": 0.0760306864976883, "learning_rate": 0.002832838375721154, "loss": 1.5759, "step": 25620 }, { "epoch": 0.06346948987385109, "grad_norm": 0.08564443141222, "learning_rate": 0.0028325477731982194, "loss": 1.5828, "step": 25640 }, { "epoch": 0.0636011693134234, "grad_norm": 0.07691756635904312, "learning_rate": 0.0028322569332274675, "loss": 1.5797, "step": 25660 }, { "epoch": 0.0637328487529957, "grad_norm": 0.07960242033004761, "learning_rate": 0.002831965855860723, "loss": 1.575, "step": 25680 }, { "epoch": 0.06386452819256801, "grad_norm": 0.08058685809373856, "learning_rate": 0.0028316745411498543, "loss": 1.5784, "step": 25700 }, { "epoch": 0.06399620763214031, "grad_norm": 0.07303532212972641, "learning_rate": 0.00283138298914677, "loss": 1.5821, "step": 25720 }, { "epoch": 0.06412788707171262, "grad_norm": 0.09177567064762115, "learning_rate": 0.002831091199903422, "loss": 1.5731, "step": 25740 }, { "epoch": 0.06425956651128492, "grad_norm": 0.07598966360092163, "learning_rate": 0.0028307991734718044, "loss": 1.5735, "step": 25760 }, { "epoch": 0.06439124595085724, "grad_norm": 0.07235264033079147, "learning_rate": 0.0028305069099039543, "loss": 1.5749, "step": 25780 }, { "epoch": 0.06452292539042954, "grad_norm": 0.08868271857500076, "learning_rate": 0.00283021440925195, "loss": 1.5741, "step": 25800 }, { "epoch": 0.06465460483000185, "grad_norm": 0.08162138611078262, "learning_rate": 0.0028299216715679124, "loss": 1.578, "step": 25820 }, { "epoch": 0.06478628426957415, "grad_norm": 0.0805659294128418, "learning_rate": 0.002829628696904005, "loss": 1.5809, "step": 25840 }, { "epoch": 0.06491796370914646, "grad_norm": 0.07114304602146149, "learning_rate": 0.0028293354853124327, "loss": 1.5869, "step": 25860 }, { "epoch": 0.06504964314871876, "grad_norm": 0.06668581813573837, "learning_rate": 0.0028290420368454433, "loss": 1.5876, "step": 25880 }, { "epoch": 0.06518132258829107, "grad_norm": 0.07414104044437408, "learning_rate": 0.0028287483515553272, "loss": 1.5846, "step": 25900 }, { "epoch": 0.06531300202786337, "grad_norm": 0.07118961215019226, "learning_rate": 0.002828454429494415, "loss": 1.5878, "step": 25920 }, { "epoch": 0.06544468146743568, "grad_norm": 0.08453836292028427, "learning_rate": 0.0028281602707150824, "loss": 1.5897, "step": 25940 }, { "epoch": 0.06557636090700798, "grad_norm": 0.07505936175584793, "learning_rate": 0.0028278658752697453, "loss": 1.5864, "step": 25960 }, { "epoch": 0.06570804034658029, "grad_norm": 0.07345987111330032, "learning_rate": 0.0028275712432108626, "loss": 1.5844, "step": 25980 }, { "epoch": 0.06583971978615259, "grad_norm": 0.09382303059101105, "learning_rate": 0.002827276374590934, "loss": 1.5951, "step": 26000 }, { "epoch": 0.06583971978615259, "eval_loss": 1.7229478359222412, "eval_runtime": 67.2917, "eval_samples_per_second": 14.861, "eval_steps_per_second": 14.861, "step": 26000 }, { "epoch": 0.0659713992257249, "grad_norm": 0.07171901315450668, "learning_rate": 0.0028269812694625036, "loss": 1.5965, "step": 26020 }, { "epoch": 0.0661030786652972, "grad_norm": 0.11737576127052307, "learning_rate": 0.002826685927878155, "loss": 1.5861, "step": 26040 }, { "epoch": 0.0662347581048695, "grad_norm": 0.1007668673992157, "learning_rate": 0.002826390349890517, "loss": 1.6206, "step": 26060 }, { "epoch": 0.06636643754444181, "grad_norm": 0.07489984482526779, "learning_rate": 0.0028260945355522583, "loss": 1.6584, "step": 26080 }, { "epoch": 0.06649811698401412, "grad_norm": 0.07443971931934357, "learning_rate": 0.0028257984849160895, "loss": 1.6751, "step": 26100 }, { "epoch": 0.06662979642358642, "grad_norm": 0.07076618820428848, "learning_rate": 0.0028255021980347654, "loss": 1.6871, "step": 26120 }, { "epoch": 0.06676147586315873, "grad_norm": 0.08177798986434937, "learning_rate": 0.0028252056749610804, "loss": 1.6991, "step": 26140 }, { "epoch": 0.06689315530273103, "grad_norm": 0.08380310237407684, "learning_rate": 0.0028249089157478735, "loss": 1.6959, "step": 26160 }, { "epoch": 0.06702483474230334, "grad_norm": 0.08319336175918579, "learning_rate": 0.0028246119204480232, "loss": 1.6876, "step": 26180 }, { "epoch": 0.06715651418187564, "grad_norm": 0.07932873070240021, "learning_rate": 0.0028243146891144518, "loss": 1.6902, "step": 26200 }, { "epoch": 0.06728819362144794, "grad_norm": 0.06260685622692108, "learning_rate": 0.0028240172218001233, "loss": 1.6899, "step": 26220 }, { "epoch": 0.06741987306102025, "grad_norm": 0.09259559959173203, "learning_rate": 0.002823719518558044, "loss": 1.6746, "step": 26240 }, { "epoch": 0.06755155250059255, "grad_norm": 0.08179523050785065, "learning_rate": 0.0028234215794412615, "loss": 1.6782, "step": 26260 }, { "epoch": 0.06768323194016486, "grad_norm": 0.08897533267736435, "learning_rate": 0.002823123404502866, "loss": 1.6725, "step": 26280 }, { "epoch": 0.06781491137973716, "grad_norm": 0.06979696452617645, "learning_rate": 0.0028228249937959893, "loss": 1.6782, "step": 26300 }, { "epoch": 0.06794659081930947, "grad_norm": 0.08062341064214706, "learning_rate": 0.002822526347373805, "loss": 1.6731, "step": 26320 }, { "epoch": 0.06807827025888177, "grad_norm": 0.08686768263578415, "learning_rate": 0.0028222274652895305, "loss": 1.6711, "step": 26340 }, { "epoch": 0.06820994969845408, "grad_norm": 0.07862361520528793, "learning_rate": 0.0028219283475964226, "loss": 1.6678, "step": 26360 }, { "epoch": 0.06834162913802638, "grad_norm": 0.08037963509559631, "learning_rate": 0.0028216289943477817, "loss": 1.6723, "step": 26380 }, { "epoch": 0.06847330857759869, "grad_norm": 0.06775148212909698, "learning_rate": 0.0028213294055969506, "loss": 1.6675, "step": 26400 }, { "epoch": 0.06860498801717099, "grad_norm": 0.07389701157808304, "learning_rate": 0.0028210295813973123, "loss": 1.6645, "step": 26420 }, { "epoch": 0.0687366674567433, "grad_norm": 0.0821567252278328, "learning_rate": 0.0028207295218022925, "loss": 1.664, "step": 26440 }, { "epoch": 0.06886834689631562, "grad_norm": 0.0829467922449112, "learning_rate": 0.0028204292268653604, "loss": 1.66, "step": 26460 }, { "epoch": 0.06900002633588792, "grad_norm": 0.07580474019050598, "learning_rate": 0.0028201286966400246, "loss": 1.6631, "step": 26480 }, { "epoch": 0.06913170577546023, "grad_norm": 0.07539396733045578, "learning_rate": 0.0028198279311798372, "loss": 1.6594, "step": 26500 }, { "epoch": 0.06926338521503253, "grad_norm": 0.08187814056873322, "learning_rate": 0.0028195269305383917, "loss": 1.6656, "step": 26520 }, { "epoch": 0.06939506465460483, "grad_norm": 0.08854663372039795, "learning_rate": 0.0028192256947693244, "loss": 1.6616, "step": 26540 }, { "epoch": 0.06952674409417714, "grad_norm": 0.08540527522563934, "learning_rate": 0.0028189242239263124, "loss": 1.6572, "step": 26560 }, { "epoch": 0.06965842353374944, "grad_norm": 0.07513197511434555, "learning_rate": 0.0028186225180630744, "loss": 1.658, "step": 26580 }, { "epoch": 0.06979010297332175, "grad_norm": 0.09598047286272049, "learning_rate": 0.002818320577233372, "loss": 1.667, "step": 26600 }, { "epoch": 0.06992178241289405, "grad_norm": 0.07224708050489426, "learning_rate": 0.0028180184014910082, "loss": 1.6529, "step": 26620 }, { "epoch": 0.07005346185246636, "grad_norm": 0.08062656968832016, "learning_rate": 0.0028177159908898282, "loss": 1.6542, "step": 26640 }, { "epoch": 0.07018514129203866, "grad_norm": 0.07291059195995331, "learning_rate": 0.0028174133454837193, "loss": 1.6783, "step": 26660 }, { "epoch": 0.07031682073161097, "grad_norm": 0.07700487226247787, "learning_rate": 0.002817110465326609, "loss": 1.7044, "step": 26680 }, { "epoch": 0.07044850017118327, "grad_norm": 0.23015104234218597, "learning_rate": 0.002816807350472469, "loss": 1.7165, "step": 26700 }, { "epoch": 0.07058017961075558, "grad_norm": 0.10937873274087906, "learning_rate": 0.00281650400097531, "loss": 1.7157, "step": 26720 }, { "epoch": 0.07071185905032788, "grad_norm": 0.0746932178735733, "learning_rate": 0.0028162004168891877, "loss": 1.7176, "step": 26740 }, { "epoch": 0.07084353848990019, "grad_norm": 0.07187461853027344, "learning_rate": 0.0028158965982681976, "loss": 1.7088, "step": 26760 }, { "epoch": 0.07097521792947249, "grad_norm": 0.0845644474029541, "learning_rate": 0.0028155925451664766, "loss": 1.7109, "step": 26780 }, { "epoch": 0.0711068973690448, "grad_norm": 0.0642613023519516, "learning_rate": 0.002815288257638205, "loss": 1.7109, "step": 26800 }, { "epoch": 0.0712385768086171, "grad_norm": 0.06674417108297348, "learning_rate": 0.0028149837357376033, "loss": 1.7072, "step": 26820 }, { "epoch": 0.0713702562481894, "grad_norm": 0.0797337219119072, "learning_rate": 0.0028146789795189353, "loss": 1.7036, "step": 26840 }, { "epoch": 0.07150193568776171, "grad_norm": 0.06999875605106354, "learning_rate": 0.0028143739890365053, "loss": 1.6998, "step": 26860 }, { "epoch": 0.07163361512733402, "grad_norm": 0.10101525485515594, "learning_rate": 0.0028140687643446603, "loss": 1.6987, "step": 26880 }, { "epoch": 0.07176529456690632, "grad_norm": 0.06726180762052536, "learning_rate": 0.002813763305497788, "loss": 1.7011, "step": 26900 }, { "epoch": 0.07189697400647863, "grad_norm": 0.07989557832479477, "learning_rate": 0.002813457612550319, "loss": 1.6982, "step": 26920 }, { "epoch": 0.07202865344605093, "grad_norm": 0.08156982809305191, "learning_rate": 0.0028131516855567236, "loss": 1.6946, "step": 26940 }, { "epoch": 0.07216033288562324, "grad_norm": 0.09064619243144989, "learning_rate": 0.0028128455245715173, "loss": 1.6942, "step": 26960 }, { "epoch": 0.07229201232519554, "grad_norm": 0.08123116940259933, "learning_rate": 0.0028125391296492533, "loss": 1.6931, "step": 26980 }, { "epoch": 0.07242369176476784, "grad_norm": 0.07538691908121109, "learning_rate": 0.00281223250084453, "loss": 1.6849, "step": 27000 }, { "epoch": 0.07242369176476784, "eval_loss": 1.7134445905685425, "eval_runtime": 66.2906, "eval_samples_per_second": 15.085, "eval_steps_per_second": 15.085, "step": 27000 }, { "epoch": 0.07255537120434015, "grad_norm": 0.07675933837890625, "learning_rate": 0.0028119256382119844, "loss": 1.6956, "step": 27020 }, { "epoch": 0.07268705064391245, "grad_norm": 0.07131894677877426, "learning_rate": 0.0028116185418062965, "loss": 1.6849, "step": 27040 }, { "epoch": 0.07281873008348476, "grad_norm": 0.07346808910369873, "learning_rate": 0.0028113112116821895, "loss": 1.6826, "step": 27060 }, { "epoch": 0.07295040952305706, "grad_norm": 0.10725018382072449, "learning_rate": 0.002811003647894426, "loss": 1.6802, "step": 27080 }, { "epoch": 0.07308208896262937, "grad_norm": 0.07160640507936478, "learning_rate": 0.0028106958504978113, "loss": 1.6832, "step": 27100 }, { "epoch": 0.07321376840220169, "grad_norm": 0.09838573634624481, "learning_rate": 0.0028103878195471915, "loss": 1.6867, "step": 27120 }, { "epoch": 0.07334544784177399, "grad_norm": 0.08039765805006027, "learning_rate": 0.0028100795550974555, "loss": 1.6859, "step": 27140 }, { "epoch": 0.0734771272813463, "grad_norm": 0.096266008913517, "learning_rate": 0.0028097710572035327, "loss": 1.6887, "step": 27160 }, { "epoch": 0.0736088067209186, "grad_norm": 0.08196264505386353, "learning_rate": 0.0028094623259203953, "loss": 1.681, "step": 27180 }, { "epoch": 0.0737404861604909, "grad_norm": 0.0661395713686943, "learning_rate": 0.002809153361303056, "loss": 1.6812, "step": 27200 }, { "epoch": 0.07387216560006321, "grad_norm": 0.07243622839450836, "learning_rate": 0.002808844163406569, "loss": 1.6778, "step": 27220 }, { "epoch": 0.07400384503963552, "grad_norm": 0.06151533126831055, "learning_rate": 0.002808534732286032, "loss": 1.684, "step": 27240 }, { "epoch": 0.07413552447920782, "grad_norm": 0.06907381862401962, "learning_rate": 0.0028082250679965803, "loss": 1.6891, "step": 27260 }, { "epoch": 0.07426720391878013, "grad_norm": 0.07179991155862808, "learning_rate": 0.0028079151705933955, "loss": 1.7013, "step": 27280 }, { "epoch": 0.07439888335835243, "grad_norm": 0.0859934464097023, "learning_rate": 0.002807605040131698, "loss": 1.6998, "step": 27300 }, { "epoch": 0.07453056279792473, "grad_norm": 0.05939393863081932, "learning_rate": 0.0028072946766667497, "loss": 1.7046, "step": 27320 }, { "epoch": 0.07466224223749704, "grad_norm": 0.08368372917175293, "learning_rate": 0.0028069840802538546, "loss": 1.7019, "step": 27340 }, { "epoch": 0.07479392167706934, "grad_norm": 0.06464136391878128, "learning_rate": 0.0028066732509483584, "loss": 1.7044, "step": 27360 }, { "epoch": 0.07492560111664165, "grad_norm": 0.08051209896802902, "learning_rate": 0.002806362188805648, "loss": 1.7057, "step": 27380 }, { "epoch": 0.07505728055621395, "grad_norm": 0.08102471381425858, "learning_rate": 0.0028060508938811514, "loss": 1.6942, "step": 27400 }, { "epoch": 0.07518895999578626, "grad_norm": 0.0877891480922699, "learning_rate": 0.002805739366230339, "loss": 1.6992, "step": 27420 }, { "epoch": 0.07532063943535856, "grad_norm": 0.0812918171286583, "learning_rate": 0.002805427605908722, "loss": 1.6922, "step": 27440 }, { "epoch": 0.07545231887493087, "grad_norm": 0.07641803473234177, "learning_rate": 0.0028051156129718538, "loss": 1.6876, "step": 27460 }, { "epoch": 0.07558399831450317, "grad_norm": 0.12771321833133698, "learning_rate": 0.0028048033874753277, "loss": 1.6847, "step": 27480 }, { "epoch": 0.07571567775407548, "grad_norm": 0.06846945732831955, "learning_rate": 0.00280449092947478, "loss": 1.6961, "step": 27500 }, { "epoch": 0.07584735719364778, "grad_norm": 0.0757148414850235, "learning_rate": 0.0028041782390258872, "loss": 1.6922, "step": 27520 }, { "epoch": 0.07597903663322009, "grad_norm": 0.07266736030578613, "learning_rate": 0.0028038653161843686, "loss": 1.6867, "step": 27540 }, { "epoch": 0.07611071607279239, "grad_norm": 0.10380854457616806, "learning_rate": 0.0028035521610059845, "loss": 1.686, "step": 27560 }, { "epoch": 0.0762423955123647, "grad_norm": 0.063069187104702, "learning_rate": 0.0028032387735465354, "loss": 1.6815, "step": 27580 }, { "epoch": 0.076374074951937, "grad_norm": 0.08514589071273804, "learning_rate": 0.0028029251538618646, "loss": 1.6811, "step": 27600 }, { "epoch": 0.0765057543915093, "grad_norm": 0.07171927392482758, "learning_rate": 0.002802611302007856, "loss": 1.6866, "step": 27620 }, { "epoch": 0.07663743383108161, "grad_norm": 0.07096509635448456, "learning_rate": 0.002802297218040436, "loss": 1.6754, "step": 27640 }, { "epoch": 0.07676911327065392, "grad_norm": 0.07615986466407776, "learning_rate": 0.0028019829020155696, "loss": 1.679, "step": 27660 }, { "epoch": 0.07690079271022622, "grad_norm": 0.09297886490821838, "learning_rate": 0.0028016683539892665, "loss": 1.6825, "step": 27680 }, { "epoch": 0.07703247214979853, "grad_norm": 0.07821375876665115, "learning_rate": 0.002801353574017576, "loss": 1.6857, "step": 27700 }, { "epoch": 0.07716415158937083, "grad_norm": 0.08595246821641922, "learning_rate": 0.002801038562156589, "loss": 1.6732, "step": 27720 }, { "epoch": 0.07729583102894313, "grad_norm": 0.08263617008924484, "learning_rate": 0.0028007233184624385, "loss": 1.6812, "step": 27740 }, { "epoch": 0.07742751046851544, "grad_norm": 0.06740175932645798, "learning_rate": 0.002800407842991296, "loss": 1.6786, "step": 27760 }, { "epoch": 0.07755918990808774, "grad_norm": 0.07347702234983444, "learning_rate": 0.002800092135799378, "loss": 1.6849, "step": 27780 }, { "epoch": 0.07769086934766006, "grad_norm": 0.06432320922613144, "learning_rate": 0.0027997761969429406, "loss": 1.6729, "step": 27800 }, { "epoch": 0.07782254878723237, "grad_norm": 0.06912487000226974, "learning_rate": 0.0027994600264782806, "loss": 1.6729, "step": 27820 }, { "epoch": 0.07795422822680467, "grad_norm": 0.07025229185819626, "learning_rate": 0.0027991436244617367, "loss": 1.6717, "step": 27840 }, { "epoch": 0.07808590766637698, "grad_norm": 0.06698182970285416, "learning_rate": 0.002798826990949689, "loss": 1.6741, "step": 27860 }, { "epoch": 0.07821758710594928, "grad_norm": 0.07972477376461029, "learning_rate": 0.0027985101259985594, "loss": 1.6626, "step": 27880 }, { "epoch": 0.07834926654552159, "grad_norm": 0.08026134967803955, "learning_rate": 0.0027981930296648084, "loss": 1.6533, "step": 27900 }, { "epoch": 0.07848094598509389, "grad_norm": 0.07009740173816681, "learning_rate": 0.002797875702004942, "loss": 1.6447, "step": 27920 }, { "epoch": 0.0786126254246662, "grad_norm": 0.0895591527223587, "learning_rate": 0.002797558143075504, "loss": 1.6316, "step": 27940 }, { "epoch": 0.0787443048642385, "grad_norm": 0.07302293926477432, "learning_rate": 0.00279724035293308, "loss": 1.6278, "step": 27960 }, { "epoch": 0.0788759843038108, "grad_norm": 0.06689465790987015, "learning_rate": 0.002796922331634298, "loss": 1.6277, "step": 27980 }, { "epoch": 0.07900766374338311, "grad_norm": 0.12900836765766144, "learning_rate": 0.002796604079235826, "loss": 1.6216, "step": 28000 }, { "epoch": 0.07900766374338311, "eval_loss": 1.57399582862854, "eval_runtime": 67.3732, "eval_samples_per_second": 14.843, "eval_steps_per_second": 14.843, "step": 28000 }, { "epoch": 0.07913934318295542, "grad_norm": 0.09559524804353714, "learning_rate": 0.002796285595794375, "loss": 1.6188, "step": 28020 }, { "epoch": 0.07927102262252772, "grad_norm": 0.09647485613822937, "learning_rate": 0.002795966881366694, "loss": 1.6111, "step": 28040 }, { "epoch": 0.07940270206210003, "grad_norm": 0.0804126113653183, "learning_rate": 0.002795647936009576, "loss": 1.624, "step": 28060 }, { "epoch": 0.07953438150167233, "grad_norm": 0.1041126698255539, "learning_rate": 0.0027953287597798538, "loss": 1.6142, "step": 28080 }, { "epoch": 0.07966606094124463, "grad_norm": 0.070301353931427, "learning_rate": 0.002795009352734402, "loss": 1.6135, "step": 28100 }, { "epoch": 0.07979774038081694, "grad_norm": 0.07575052231550217, "learning_rate": 0.0027946897149301354, "loss": 1.6113, "step": 28120 }, { "epoch": 0.07992941982038924, "grad_norm": 0.0882832482457161, "learning_rate": 0.0027943698464240117, "loss": 1.6073, "step": 28140 }, { "epoch": 0.08006109925996155, "grad_norm": 0.07412759959697723, "learning_rate": 0.002794049747273027, "loss": 1.6025, "step": 28160 }, { "epoch": 0.08019277869953385, "grad_norm": 0.10568110644817352, "learning_rate": 0.002793729417534221, "loss": 1.6053, "step": 28180 }, { "epoch": 0.08032445813910616, "grad_norm": 0.07552295923233032, "learning_rate": 0.002793408857264674, "loss": 1.6057, "step": 28200 }, { "epoch": 0.08045613757867846, "grad_norm": 0.07230095565319061, "learning_rate": 0.0027930880665215057, "loss": 1.6072, "step": 28220 }, { "epoch": 0.08058781701825077, "grad_norm": 0.07529731094837189, "learning_rate": 0.002792767045361879, "loss": 1.6136, "step": 28240 }, { "epoch": 0.08071949645782307, "grad_norm": 0.08432866632938385, "learning_rate": 0.0027924457938429967, "loss": 1.6122, "step": 28260 }, { "epoch": 0.08085117589739538, "grad_norm": 0.08389344066381454, "learning_rate": 0.002792124312022102, "loss": 1.6049, "step": 28280 }, { "epoch": 0.08098285533696768, "grad_norm": 0.08148514479398727, "learning_rate": 0.0027918025999564815, "loss": 1.6022, "step": 28300 }, { "epoch": 0.08111453477653999, "grad_norm": 0.07762300223112106, "learning_rate": 0.00279148065770346, "loss": 1.6088, "step": 28320 }, { "epoch": 0.08124621421611229, "grad_norm": 0.08115459978580475, "learning_rate": 0.0027911584853204056, "loss": 1.6068, "step": 28340 }, { "epoch": 0.0813778936556846, "grad_norm": 0.08367536962032318, "learning_rate": 0.0027908360828647265, "loss": 1.5971, "step": 28360 }, { "epoch": 0.0815095730952569, "grad_norm": 0.08000832796096802, "learning_rate": 0.002790513450393871, "loss": 1.6084, "step": 28380 }, { "epoch": 0.0816412525348292, "grad_norm": 0.08210103958845139, "learning_rate": 0.00279019058796533, "loss": 1.6077, "step": 28400 }, { "epoch": 0.08177293197440151, "grad_norm": 0.07329817861318588, "learning_rate": 0.002789867495636635, "loss": 1.61, "step": 28420 }, { "epoch": 0.08190461141397382, "grad_norm": 0.06839757412672043, "learning_rate": 0.002789544173465357, "loss": 1.6128, "step": 28440 }, { "epoch": 0.08203629085354612, "grad_norm": 0.06943529099225998, "learning_rate": 0.002789220621509109, "loss": 1.6285, "step": 28460 }, { "epoch": 0.08216797029311844, "grad_norm": 0.10486973077058792, "learning_rate": 0.0027888968398255467, "loss": 1.6335, "step": 28480 }, { "epoch": 0.08229964973269074, "grad_norm": 0.07937227934598923, "learning_rate": 0.0027885728284723628, "loss": 1.6372, "step": 28500 }, { "epoch": 0.08243132917226305, "grad_norm": 0.07697343081235886, "learning_rate": 0.002788248587507295, "loss": 1.6282, "step": 28520 }, { "epoch": 0.08256300861183535, "grad_norm": 0.08481860160827637, "learning_rate": 0.0027879241169881186, "loss": 1.6265, "step": 28540 }, { "epoch": 0.08269468805140766, "grad_norm": 0.08266434073448181, "learning_rate": 0.0027875994169726526, "loss": 1.628, "step": 28560 }, { "epoch": 0.08282636749097996, "grad_norm": 0.07758313417434692, "learning_rate": 0.0027872744875187547, "loss": 1.6168, "step": 28580 }, { "epoch": 0.08295804693055227, "grad_norm": 0.07969856262207031, "learning_rate": 0.002786949328684325, "loss": 1.6218, "step": 28600 }, { "epoch": 0.08308972637012457, "grad_norm": 0.06928009539842606, "learning_rate": 0.002786623940527303, "loss": 1.614, "step": 28620 }, { "epoch": 0.08322140580969688, "grad_norm": 0.08013467490673065, "learning_rate": 0.0027862983231056707, "loss": 1.6131, "step": 28640 }, { "epoch": 0.08335308524926918, "grad_norm": 0.07733161002397537, "learning_rate": 0.0027859724764774494, "loss": 1.6108, "step": 28660 }, { "epoch": 0.08348476468884149, "grad_norm": 0.10586979240179062, "learning_rate": 0.0027856464007007028, "loss": 1.6141, "step": 28680 }, { "epoch": 0.08361644412841379, "grad_norm": 0.07554934173822403, "learning_rate": 0.002785320095833534, "loss": 1.6104, "step": 28700 }, { "epoch": 0.0837481235679861, "grad_norm": 0.08737286925315857, "learning_rate": 0.0027849935619340873, "loss": 1.6126, "step": 28720 }, { "epoch": 0.0838798030075584, "grad_norm": 0.07767580449581146, "learning_rate": 0.002784666799060549, "loss": 1.6056, "step": 28740 }, { "epoch": 0.0840114824471307, "grad_norm": 0.09215500950813293, "learning_rate": 0.0027843398072711447, "loss": 1.605, "step": 28760 }, { "epoch": 0.08414316188670301, "grad_norm": 0.09147578477859497, "learning_rate": 0.002784012586624141, "loss": 1.6081, "step": 28780 }, { "epoch": 0.08427484132627532, "grad_norm": 0.09132102876901627, "learning_rate": 0.002783685137177846, "loss": 1.6054, "step": 28800 }, { "epoch": 0.08440652076584762, "grad_norm": 0.09715555608272552, "learning_rate": 0.0027833574589906087, "loss": 1.6011, "step": 28820 }, { "epoch": 0.08453820020541992, "grad_norm": 0.09655196219682693, "learning_rate": 0.0027830295521208176, "loss": 1.602, "step": 28840 }, { "epoch": 0.08466987964499223, "grad_norm": 0.09575804322957993, "learning_rate": 0.002782701416626903, "loss": 1.606, "step": 28860 }, { "epoch": 0.08480155908456453, "grad_norm": 0.08992674201726913, "learning_rate": 0.002782373052567336, "loss": 1.6016, "step": 28880 }, { "epoch": 0.08493323852413684, "grad_norm": 0.13212674856185913, "learning_rate": 0.002782044460000627, "loss": 1.6017, "step": 28900 }, { "epoch": 0.08506491796370914, "grad_norm": 0.08106255531311035, "learning_rate": 0.002781715638985329, "loss": 1.6053, "step": 28920 }, { "epoch": 0.08519659740328145, "grad_norm": 0.09823165833950043, "learning_rate": 0.002781386589580035, "loss": 1.6067, "step": 28940 }, { "epoch": 0.08532827684285375, "grad_norm": 0.07196325063705444, "learning_rate": 0.002781057311843379, "loss": 1.6017, "step": 28960 }, { "epoch": 0.08545995628242606, "grad_norm": 0.0797024518251419, "learning_rate": 0.0027807278058340334, "loss": 1.6051, "step": 28980 }, { "epoch": 0.08559163572199836, "grad_norm": 0.08300334960222244, "learning_rate": 0.0027803980716107147, "loss": 1.6088, "step": 29000 }, { "epoch": 0.08559163572199836, "eval_loss": 1.4939472675323486, "eval_runtime": 71.0831, "eval_samples_per_second": 14.068, "eval_steps_per_second": 14.068, "step": 29000 }, { "epoch": 0.08572331516157067, "grad_norm": 0.07488060742616653, "learning_rate": 0.0027800681092321785, "loss": 1.6085, "step": 29020 }, { "epoch": 0.08585499460114297, "grad_norm": 0.07563740015029907, "learning_rate": 0.0027797379187572205, "loss": 1.6419, "step": 29040 }, { "epoch": 0.08598667404071528, "grad_norm": 0.07274390012025833, "learning_rate": 0.0027794075002446775, "loss": 1.6611, "step": 29060 }, { "epoch": 0.08611835348028758, "grad_norm": 0.07751382887363434, "learning_rate": 0.0027790768537534283, "loss": 1.6802, "step": 29080 }, { "epoch": 0.08625003291985989, "grad_norm": 0.08200586587190628, "learning_rate": 0.0027787459793423897, "loss": 1.6833, "step": 29100 }, { "epoch": 0.08638171235943219, "grad_norm": 0.07423494756221771, "learning_rate": 0.002778414877070521, "loss": 1.6816, "step": 29120 }, { "epoch": 0.08651339179900451, "grad_norm": 0.09629736840724945, "learning_rate": 0.002778083546996822, "loss": 1.6779, "step": 29140 }, { "epoch": 0.08664507123857682, "grad_norm": 0.09053540974855423, "learning_rate": 0.002777751989180333, "loss": 1.6756, "step": 29160 }, { "epoch": 0.08677675067814912, "grad_norm": 0.08008238673210144, "learning_rate": 0.0027774202036801323, "loss": 1.6745, "step": 29180 }, { "epoch": 0.08690843011772142, "grad_norm": 0.07499855756759644, "learning_rate": 0.0027770881905553432, "loss": 1.669, "step": 29200 }, { "epoch": 0.08704010955729373, "grad_norm": 0.08784040063619614, "learning_rate": 0.002776755949865127, "loss": 1.6681, "step": 29220 }, { "epoch": 0.08717178899686603, "grad_norm": 0.10526277124881744, "learning_rate": 0.0027764234816686864, "loss": 1.6645, "step": 29240 }, { "epoch": 0.08730346843643834, "grad_norm": 0.08847960829734802, "learning_rate": 0.0027760907860252624, "loss": 1.659, "step": 29260 }, { "epoch": 0.08743514787601064, "grad_norm": 0.09215822070837021, "learning_rate": 0.00277575786299414, "loss": 1.6612, "step": 29280 }, { "epoch": 0.08756682731558295, "grad_norm": 0.08477826416492462, "learning_rate": 0.002775424712634642, "loss": 1.6656, "step": 29300 }, { "epoch": 0.08769850675515525, "grad_norm": 0.07661165297031403, "learning_rate": 0.002775091335006134, "loss": 1.6627, "step": 29320 }, { "epoch": 0.08783018619472756, "grad_norm": 0.06484279781579971, "learning_rate": 0.0027747577301680195, "loss": 1.6595, "step": 29340 }, { "epoch": 0.08796186563429986, "grad_norm": 0.0724259540438652, "learning_rate": 0.0027744238981797452, "loss": 1.6561, "step": 29360 }, { "epoch": 0.08809354507387217, "grad_norm": 0.07707709074020386, "learning_rate": 0.0027740898391007958, "loss": 1.6538, "step": 29380 }, { "epoch": 0.08822522451344447, "grad_norm": 0.08440696448087692, "learning_rate": 0.002773755552990697, "loss": 1.6546, "step": 29400 }, { "epoch": 0.08835690395301678, "grad_norm": 0.07948070019483566, "learning_rate": 0.0027734210399090174, "loss": 1.6462, "step": 29420 }, { "epoch": 0.08848858339258908, "grad_norm": 0.08475562930107117, "learning_rate": 0.002773086299915363, "loss": 1.6494, "step": 29440 }, { "epoch": 0.08862026283216139, "grad_norm": 0.0809844508767128, "learning_rate": 0.0027727513330693815, "loss": 1.6581, "step": 29460 }, { "epoch": 0.08875194227173369, "grad_norm": 0.07043874263763428, "learning_rate": 0.002772416139430761, "loss": 1.6499, "step": 29480 }, { "epoch": 0.088883621711306, "grad_norm": 0.079310841858387, "learning_rate": 0.0027720807190592302, "loss": 1.6508, "step": 29500 }, { "epoch": 0.0890153011508783, "grad_norm": 0.07824884355068207, "learning_rate": 0.002771745072014558, "loss": 1.6486, "step": 29520 }, { "epoch": 0.0891469805904506, "grad_norm": 0.06876828521490097, "learning_rate": 0.0027714091983565524, "loss": 1.6493, "step": 29540 }, { "epoch": 0.08927866003002291, "grad_norm": 0.09782326221466064, "learning_rate": 0.0027710730981450643, "loss": 1.654, "step": 29560 }, { "epoch": 0.08941033946959522, "grad_norm": 0.08521437644958496, "learning_rate": 0.0027707367714399837, "loss": 1.6469, "step": 29580 }, { "epoch": 0.08954201890916752, "grad_norm": 0.07844710350036621, "learning_rate": 0.0027704002183012405, "loss": 1.6494, "step": 29600 }, { "epoch": 0.08967369834873982, "grad_norm": 0.09010956436395645, "learning_rate": 0.002770063438788805, "loss": 1.6534, "step": 29620 }, { "epoch": 0.08980537778831213, "grad_norm": 0.07454434037208557, "learning_rate": 0.002769726432962689, "loss": 1.668, "step": 29640 }, { "epoch": 0.08993705722788443, "grad_norm": 0.09403835237026215, "learning_rate": 0.0027693892008829437, "loss": 1.6764, "step": 29660 }, { "epoch": 0.09006873666745674, "grad_norm": 0.09171565622091293, "learning_rate": 0.0027690517426096606, "loss": 1.6795, "step": 29680 }, { "epoch": 0.09020041610702904, "grad_norm": 0.08323973417282104, "learning_rate": 0.0027687140582029713, "loss": 1.6813, "step": 29700 }, { "epoch": 0.09033209554660135, "grad_norm": 0.06903329491615295, "learning_rate": 0.0027683761477230485, "loss": 1.6718, "step": 29720 }, { "epoch": 0.09046377498617365, "grad_norm": 0.06989486515522003, "learning_rate": 0.002768038011230105, "loss": 1.6684, "step": 29740 }, { "epoch": 0.09059545442574596, "grad_norm": 0.08322389423847198, "learning_rate": 0.002767699648784393, "loss": 1.6708, "step": 29760 }, { "epoch": 0.09072713386531826, "grad_norm": 0.09357618540525436, "learning_rate": 0.002767361060446206, "loss": 1.6716, "step": 29780 }, { "epoch": 0.09085881330489057, "grad_norm": 0.08602355420589447, "learning_rate": 0.0027670222462758774, "loss": 1.6658, "step": 29800 }, { "epoch": 0.09099049274446289, "grad_norm": 0.07419178634881973, "learning_rate": 0.0027666832063337806, "loss": 1.6682, "step": 29820 }, { "epoch": 0.09112217218403519, "grad_norm": 0.09919148683547974, "learning_rate": 0.0027663439406803293, "loss": 1.6616, "step": 29840 }, { "epoch": 0.0912538516236075, "grad_norm": 0.07616308331489563, "learning_rate": 0.002766004449375978, "loss": 1.661, "step": 29860 }, { "epoch": 0.0913855310631798, "grad_norm": 0.0842098742723465, "learning_rate": 0.002765664732481221, "loss": 1.6573, "step": 29880 }, { "epoch": 0.0915172105027521, "grad_norm": 0.09518759697675705, "learning_rate": 0.002765324790056592, "loss": 1.6638, "step": 29900 }, { "epoch": 0.09164888994232441, "grad_norm": 0.07474862039089203, "learning_rate": 0.002764984622162666, "loss": 1.66, "step": 29920 }, { "epoch": 0.09178056938189671, "grad_norm": 0.17661775648593903, "learning_rate": 0.0027646442288600578, "loss": 1.6541, "step": 29940 }, { "epoch": 0.09191224882146902, "grad_norm": 0.1082674190402031, "learning_rate": 0.002764303610209422, "loss": 1.6583, "step": 29960 }, { "epoch": 0.09204392826104132, "grad_norm": 0.0656692162156105, "learning_rate": 0.0027639627662714547, "loss": 1.6548, "step": 29980 }, { "epoch": 0.09217560770061363, "grad_norm": 0.06664387881755829, "learning_rate": 0.0027636216971068904, "loss": 1.6536, "step": 30000 }, { "epoch": 0.09217560770061363, "eval_loss": 1.593057632446289, "eval_runtime": 66.8776, "eval_samples_per_second": 14.953, "eval_steps_per_second": 14.953, "step": 30000 }, { "epoch": 0.09230728714018593, "grad_norm": 0.11122573167085648, "learning_rate": 0.0027632804027765048, "loss": 1.6526, "step": 30020 }, { "epoch": 0.09243896657975824, "grad_norm": 0.08378654718399048, "learning_rate": 0.0027629388833411133, "loss": 1.6516, "step": 30040 }, { "epoch": 0.09257064601933054, "grad_norm": 0.0903952419757843, "learning_rate": 0.0027625971388615714, "loss": 1.6495, "step": 30060 }, { "epoch": 0.09270232545890285, "grad_norm": 0.10157206654548645, "learning_rate": 0.002762255169398775, "loss": 1.6479, "step": 30080 }, { "epoch": 0.09283400489847515, "grad_norm": 0.06507019698619843, "learning_rate": 0.00276191297501366, "loss": 1.651, "step": 30100 }, { "epoch": 0.09296568433804746, "grad_norm": 0.07820893824100494, "learning_rate": 0.0027615705557672023, "loss": 1.6566, "step": 30120 }, { "epoch": 0.09309736377761976, "grad_norm": 0.07816014438867569, "learning_rate": 0.002761227911720418, "loss": 1.6532, "step": 30140 }, { "epoch": 0.09322904321719207, "grad_norm": 0.10330802947282791, "learning_rate": 0.002760885042934363, "loss": 1.6467, "step": 30160 }, { "epoch": 0.09336072265676437, "grad_norm": 0.07946458458900452, "learning_rate": 0.0027605419494701328, "loss": 1.651, "step": 30180 }, { "epoch": 0.09349240209633668, "grad_norm": 0.08045420050621033, "learning_rate": 0.002760198631388864, "loss": 1.6483, "step": 30200 }, { "epoch": 0.09362408153590898, "grad_norm": 0.08808773756027222, "learning_rate": 0.0027598550887517333, "loss": 1.6419, "step": 30220 }, { "epoch": 0.09375576097548129, "grad_norm": 0.12588857114315033, "learning_rate": 0.002759511321619956, "loss": 1.6357, "step": 30240 }, { "epoch": 0.09388744041505359, "grad_norm": 0.07971849292516708, "learning_rate": 0.002759167330054789, "loss": 1.6015, "step": 30260 }, { "epoch": 0.0940191198546259, "grad_norm": 0.09091313183307648, "learning_rate": 0.002758823114117527, "loss": 1.6004, "step": 30280 }, { "epoch": 0.0941507992941982, "grad_norm": 0.0841759741306305, "learning_rate": 0.0027584786738695083, "loss": 1.5936, "step": 30300 }, { "epoch": 0.0942824787337705, "grad_norm": 0.09897656738758087, "learning_rate": 0.0027581340093721075, "loss": 1.5878, "step": 30320 }, { "epoch": 0.09441415817334281, "grad_norm": 0.09095700830221176, "learning_rate": 0.002757789120686741, "loss": 1.5916, "step": 30340 }, { "epoch": 0.09454583761291512, "grad_norm": 0.07832010090351105, "learning_rate": 0.0027574440078748648, "loss": 1.589, "step": 30360 }, { "epoch": 0.09467751705248742, "grad_norm": 0.07373721152544022, "learning_rate": 0.0027570986709979746, "loss": 1.5799, "step": 30380 }, { "epoch": 0.09480919649205972, "grad_norm": 0.07081932574510574, "learning_rate": 0.002756753110117607, "loss": 1.5791, "step": 30400 }, { "epoch": 0.09494087593163203, "grad_norm": 0.08223600685596466, "learning_rate": 0.0027564073252953373, "loss": 1.5766, "step": 30420 }, { "epoch": 0.09507255537120433, "grad_norm": 0.08098476380109787, "learning_rate": 0.002756061316592781, "loss": 1.5818, "step": 30440 }, { "epoch": 0.09520423481077664, "grad_norm": 0.07812890410423279, "learning_rate": 0.002755715084071594, "loss": 1.5761, "step": 30460 }, { "epoch": 0.09533591425034894, "grad_norm": 0.07554410398006439, "learning_rate": 0.002755368627793472, "loss": 1.5781, "step": 30480 }, { "epoch": 0.09546759368992126, "grad_norm": 0.08680091798305511, "learning_rate": 0.002755021947820149, "loss": 1.5784, "step": 30500 }, { "epoch": 0.09559927312949357, "grad_norm": 0.08017537742853165, "learning_rate": 0.002754675044213402, "loss": 1.578, "step": 30520 }, { "epoch": 0.09573095256906587, "grad_norm": 0.08503107726573944, "learning_rate": 0.002754327917035045, "loss": 1.5727, "step": 30540 }, { "epoch": 0.09586263200863818, "grad_norm": 0.09204825013875961, "learning_rate": 0.002753980566346934, "loss": 1.5775, "step": 30560 }, { "epoch": 0.09599431144821048, "grad_norm": 0.07686753571033478, "learning_rate": 0.0027536329922109616, "loss": 1.5747, "step": 30580 }, { "epoch": 0.09612599088778279, "grad_norm": 0.08408256620168686, "learning_rate": 0.002753285194689064, "loss": 1.5722, "step": 30600 }, { "epoch": 0.09625767032735509, "grad_norm": 0.09992122650146484, "learning_rate": 0.0027529371738432154, "loss": 1.5725, "step": 30620 }, { "epoch": 0.0963893497669274, "grad_norm": 0.07421014457941055, "learning_rate": 0.0027525889297354295, "loss": 1.5709, "step": 30640 }, { "epoch": 0.0965210292064997, "grad_norm": 0.08402437716722488, "learning_rate": 0.0027522404624277606, "loss": 1.5711, "step": 30660 }, { "epoch": 0.096652708646072, "grad_norm": 0.10464178025722504, "learning_rate": 0.0027518917719823017, "loss": 1.5724, "step": 30680 }, { "epoch": 0.09678438808564431, "grad_norm": 0.09930146485567093, "learning_rate": 0.002751542858461187, "loss": 1.5768, "step": 30700 }, { "epoch": 0.09691606752521661, "grad_norm": 0.08711190521717072, "learning_rate": 0.0027511937219265896, "loss": 1.5783, "step": 30720 }, { "epoch": 0.09704774696478892, "grad_norm": 0.07746979594230652, "learning_rate": 0.0027508443624407217, "loss": 1.5724, "step": 30740 }, { "epoch": 0.09717942640436122, "grad_norm": 0.09594020992517471, "learning_rate": 0.0027504947800658366, "loss": 1.5755, "step": 30760 }, { "epoch": 0.09731110584393353, "grad_norm": 0.0837220624089241, "learning_rate": 0.002750144974864227, "loss": 1.5692, "step": 30780 }, { "epoch": 0.09744278528350583, "grad_norm": 0.07753045111894608, "learning_rate": 0.0027497949468982237, "loss": 1.5723, "step": 30800 }, { "epoch": 0.09757446472307814, "grad_norm": 0.0966426357626915, "learning_rate": 0.0027494446962302004, "loss": 1.5948, "step": 30820 }, { "epoch": 0.09770614416265044, "grad_norm": 0.0724552646279335, "learning_rate": 0.002749094222922567, "loss": 1.6, "step": 30840 }, { "epoch": 0.09783782360222275, "grad_norm": 0.07575785368680954, "learning_rate": 0.002748743527037775, "loss": 1.6046, "step": 30860 }, { "epoch": 0.09796950304179505, "grad_norm": 0.10300685465335846, "learning_rate": 0.0027483926086383156, "loss": 1.6014, "step": 30880 }, { "epoch": 0.09810118248136736, "grad_norm": 0.07341894507408142, "learning_rate": 0.0027480414677867188, "loss": 1.6002, "step": 30900 }, { "epoch": 0.09823286192093966, "grad_norm": 0.09823710471391678, "learning_rate": 0.002747690104545555, "loss": 1.5955, "step": 30920 }, { "epoch": 0.09836454136051197, "grad_norm": 0.08126625418663025, "learning_rate": 0.0027473385189774337, "loss": 1.5951, "step": 30940 }, { "epoch": 0.09849622080008427, "grad_norm": 0.08654072135686874, "learning_rate": 0.0027469867111450043, "loss": 1.592, "step": 30960 }, { "epoch": 0.09862790023965658, "grad_norm": 0.08610561490058899, "learning_rate": 0.002746634681110956, "loss": 1.5866, "step": 30980 }, { "epoch": 0.09875957967922888, "grad_norm": 0.10982340574264526, "learning_rate": 0.0027462824289380167, "loss": 1.5916, "step": 31000 }, { "epoch": 0.09875957967922888, "eval_loss": 1.4958887100219727, "eval_runtime": 65.9246, "eval_samples_per_second": 15.169, "eval_steps_per_second": 15.169, "step": 31000 }, { "epoch": 0.09889125911880119, "grad_norm": 0.08077514916658401, "learning_rate": 0.002745929954688955, "loss": 1.5905, "step": 31020 }, { "epoch": 0.09902293855837349, "grad_norm": 0.08327169716358185, "learning_rate": 0.0027455772584265782, "loss": 1.5853, "step": 31040 }, { "epoch": 0.0991546179979458, "grad_norm": 0.07334230840206146, "learning_rate": 0.0027452243402137345, "loss": 1.5903, "step": 31060 }, { "epoch": 0.0992862974375181, "grad_norm": 0.0786149725317955, "learning_rate": 0.0027448712001133095, "loss": 1.5844, "step": 31080 }, { "epoch": 0.0994179768770904, "grad_norm": 0.08628056943416595, "learning_rate": 0.00274451783818823, "loss": 1.5821, "step": 31100 }, { "epoch": 0.09954965631666271, "grad_norm": 0.09965677559375763, "learning_rate": 0.0027441642545014623, "loss": 1.5788, "step": 31120 }, { "epoch": 0.09968133575623501, "grad_norm": 0.09084340184926987, "learning_rate": 0.002743810449116011, "loss": 1.5821, "step": 31140 }, { "epoch": 0.09981301519580732, "grad_norm": 0.08165693283081055, "learning_rate": 0.002743456422094922, "loss": 1.5779, "step": 31160 }, { "epoch": 0.09994469463537964, "grad_norm": 0.08033919334411621, "learning_rate": 0.002743102173501278, "loss": 1.5799, "step": 31180 }, { "epoch": 0.10007637407495194, "grad_norm": 0.09969887882471085, "learning_rate": 0.0027427477033982045, "loss": 1.577, "step": 31200 }, { "epoch": 0.10020805351452425, "grad_norm": 0.08198243379592896, "learning_rate": 0.0027423930118488644, "loss": 1.5756, "step": 31220 }, { "epoch": 0.10033973295409655, "grad_norm": 0.08875197172164917, "learning_rate": 0.00274203809891646, "loss": 1.5766, "step": 31240 }, { "epoch": 0.10047141239366886, "grad_norm": 0.07156415283679962, "learning_rate": 0.002741682964664234, "loss": 1.5795, "step": 31260 }, { "epoch": 0.10060309183324116, "grad_norm": 0.1065966859459877, "learning_rate": 0.0027413276091554683, "loss": 1.5865, "step": 31280 }, { "epoch": 0.10073477127281347, "grad_norm": 0.08343872427940369, "learning_rate": 0.0027409720324534834, "loss": 1.58, "step": 31300 }, { "epoch": 0.10086645071238577, "grad_norm": 0.08024212718009949, "learning_rate": 0.00274061623462164, "loss": 1.5828, "step": 31320 }, { "epoch": 0.10099813015195808, "grad_norm": 0.08566683530807495, "learning_rate": 0.0027402602157233376, "loss": 1.5695, "step": 31340 }, { "epoch": 0.10112980959153038, "grad_norm": 0.08198649436235428, "learning_rate": 0.002739903975822016, "loss": 1.5811, "step": 31360 }, { "epoch": 0.10126148903110269, "grad_norm": 0.10375852882862091, "learning_rate": 0.0027395475149811542, "loss": 1.5786, "step": 31380 }, { "epoch": 0.10139316847067499, "grad_norm": 0.11077110469341278, "learning_rate": 0.0027391908332642704, "loss": 1.5964, "step": 31400 }, { "epoch": 0.1015248479102473, "grad_norm": 0.08183398842811584, "learning_rate": 0.0027388339307349205, "loss": 1.6251, "step": 31420 }, { "epoch": 0.1016565273498196, "grad_norm": 0.08363300561904907, "learning_rate": 0.002738476807456703, "loss": 1.6606, "step": 31440 }, { "epoch": 0.1017882067893919, "grad_norm": 0.07447555661201477, "learning_rate": 0.0027381194634932536, "loss": 1.6706, "step": 31460 }, { "epoch": 0.10191988622896421, "grad_norm": 0.10050380229949951, "learning_rate": 0.0027377618989082465, "loss": 1.6575, "step": 31480 }, { "epoch": 0.10205156566853651, "grad_norm": 0.07040868699550629, "learning_rate": 0.002737404113765398, "loss": 1.6624, "step": 31500 }, { "epoch": 0.10218324510810882, "grad_norm": 0.08749683946371078, "learning_rate": 0.002737046108128461, "loss": 1.6537, "step": 31520 }, { "epoch": 0.10231492454768112, "grad_norm": 0.09317103773355484, "learning_rate": 0.00273668788206123, "loss": 1.6564, "step": 31540 }, { "epoch": 0.10244660398725343, "grad_norm": 0.07827817648649216, "learning_rate": 0.0027363294356275367, "loss": 1.6535, "step": 31560 }, { "epoch": 0.10257828342682573, "grad_norm": 0.08093781024217606, "learning_rate": 0.002735970768891253, "loss": 1.643, "step": 31580 }, { "epoch": 0.10270996286639804, "grad_norm": 0.08157644420862198, "learning_rate": 0.00273561188191629, "loss": 1.6449, "step": 31600 }, { "epoch": 0.10284164230597034, "grad_norm": 0.09422040730714798, "learning_rate": 0.0027352527747665986, "loss": 1.6457, "step": 31620 }, { "epoch": 0.10297332174554265, "grad_norm": 0.08076277375221252, "learning_rate": 0.0027348934475061684, "loss": 1.641, "step": 31640 }, { "epoch": 0.10310500118511495, "grad_norm": 0.09262409806251526, "learning_rate": 0.0027345339001990272, "loss": 1.6404, "step": 31660 }, { "epoch": 0.10323668062468726, "grad_norm": 0.08169291168451309, "learning_rate": 0.0027341741329092446, "loss": 1.6405, "step": 31680 }, { "epoch": 0.10336836006425956, "grad_norm": 0.07819892466068268, "learning_rate": 0.002733814145700927, "loss": 1.6315, "step": 31700 }, { "epoch": 0.10350003950383187, "grad_norm": 0.07450778037309647, "learning_rate": 0.00273345393863822, "loss": 1.6268, "step": 31720 }, { "epoch": 0.10363171894340417, "grad_norm": 0.08458829671144485, "learning_rate": 0.0027330935117853106, "loss": 1.6344, "step": 31740 }, { "epoch": 0.10376339838297648, "grad_norm": 0.07392025738954544, "learning_rate": 0.0027327328652064233, "loss": 1.6322, "step": 31760 }, { "epoch": 0.10389507782254878, "grad_norm": 0.09063839167356491, "learning_rate": 0.002732371998965821, "loss": 1.636, "step": 31780 }, { "epoch": 0.10402675726212109, "grad_norm": 0.09151460975408554, "learning_rate": 0.002732010913127808, "loss": 1.6305, "step": 31800 }, { "epoch": 0.10415843670169339, "grad_norm": 0.07469334453344345, "learning_rate": 0.002731649607756726, "loss": 1.6291, "step": 31820 }, { "epoch": 0.10429011614126571, "grad_norm": 0.07378929853439331, "learning_rate": 0.0027312880829169564, "loss": 1.6337, "step": 31840 }, { "epoch": 0.10442179558083801, "grad_norm": 0.08763482421636581, "learning_rate": 0.002730926338672919, "loss": 1.6221, "step": 31860 }, { "epoch": 0.10455347502041032, "grad_norm": 0.09730922430753708, "learning_rate": 0.0027305643750890744, "loss": 1.6251, "step": 31880 }, { "epoch": 0.10468515445998262, "grad_norm": 0.0719449371099472, "learning_rate": 0.0027302021922299205, "loss": 1.6316, "step": 31900 }, { "epoch": 0.10481683389955493, "grad_norm": 0.08451465517282486, "learning_rate": 0.0027298397901599947, "loss": 1.6271, "step": 31920 }, { "epoch": 0.10494851333912723, "grad_norm": 0.07725101709365845, "learning_rate": 0.0027294771689438746, "loss": 1.6333, "step": 31940 }, { "epoch": 0.10508019277869954, "grad_norm": 0.10085799545049667, "learning_rate": 0.0027291143286461753, "loss": 1.6231, "step": 31960 }, { "epoch": 0.10521187221827184, "grad_norm": 0.10356923937797546, "learning_rate": 0.002728751269331552, "loss": 1.6268, "step": 31980 }, { "epoch": 0.10534355165784415, "grad_norm": 0.0808652937412262, "learning_rate": 0.0027283879910646983, "loss": 1.6371, "step": 32000 }, { "epoch": 0.10534355165784415, "eval_loss": 1.5755228996276855, "eval_runtime": 66.1417, "eval_samples_per_second": 15.119, "eval_steps_per_second": 15.119, "step": 32000 }, { "epoch": 0.10547523109741645, "grad_norm": 0.10892391949892044, "learning_rate": 0.002728024493910347, "loss": 1.6455, "step": 32020 }, { "epoch": 0.10560691053698876, "grad_norm": 0.08325547724962234, "learning_rate": 0.00272766077793327, "loss": 1.6526, "step": 32040 }, { "epoch": 0.10573858997656106, "grad_norm": 0.10805673897266388, "learning_rate": 0.0027272968431982787, "loss": 1.6663, "step": 32060 }, { "epoch": 0.10587026941613337, "grad_norm": 0.09780491143465042, "learning_rate": 0.0027269326897702223, "loss": 1.6522, "step": 32080 }, { "epoch": 0.10600194885570567, "grad_norm": 0.09470649063587189, "learning_rate": 0.0027265683177139896, "loss": 1.6546, "step": 32100 }, { "epoch": 0.10613362829527798, "grad_norm": 0.07851683348417282, "learning_rate": 0.002726203727094509, "loss": 1.6458, "step": 32120 }, { "epoch": 0.10626530773485028, "grad_norm": 0.0761096403002739, "learning_rate": 0.0027258389179767467, "loss": 1.6525, "step": 32140 }, { "epoch": 0.10639698717442259, "grad_norm": 0.1286764144897461, "learning_rate": 0.0027254738904257084, "loss": 1.6486, "step": 32160 }, { "epoch": 0.10652866661399489, "grad_norm": 0.0972808375954628, "learning_rate": 0.002725108644506438, "loss": 1.6394, "step": 32180 }, { "epoch": 0.1066603460535672, "grad_norm": 0.07394243031740189, "learning_rate": 0.0027247431802840207, "loss": 1.6393, "step": 32200 }, { "epoch": 0.1067920254931395, "grad_norm": 0.07845206558704376, "learning_rate": 0.0027243774978235775, "loss": 1.6381, "step": 32220 }, { "epoch": 0.1069237049327118, "grad_norm": 0.07898611575365067, "learning_rate": 0.00272401159719027, "loss": 1.6394, "step": 32240 }, { "epoch": 0.10705538437228411, "grad_norm": 0.08906087279319763, "learning_rate": 0.002723645478449298, "loss": 1.6368, "step": 32260 }, { "epoch": 0.10718706381185641, "grad_norm": 0.0694982185959816, "learning_rate": 0.0027232791416659016, "loss": 1.6367, "step": 32280 }, { "epoch": 0.10731874325142872, "grad_norm": 0.07341042160987854, "learning_rate": 0.0027229125869053577, "loss": 1.6301, "step": 32300 }, { "epoch": 0.10745042269100102, "grad_norm": 0.1038580909371376, "learning_rate": 0.0027225458142329834, "loss": 1.6339, "step": 32320 }, { "epoch": 0.10758210213057333, "grad_norm": 0.09001409262418747, "learning_rate": 0.002722178823714134, "loss": 1.6368, "step": 32340 }, { "epoch": 0.10771378157014563, "grad_norm": 0.07618994265794754, "learning_rate": 0.0027218116154142037, "loss": 1.6209, "step": 32360 }, { "epoch": 0.10784546100971794, "grad_norm": 0.08030746132135391, "learning_rate": 0.0027214441893986256, "loss": 1.6342, "step": 32380 }, { "epoch": 0.10797714044929024, "grad_norm": 0.07523296028375626, "learning_rate": 0.0027210765457328723, "loss": 1.6318, "step": 32400 }, { "epoch": 0.10810881988886255, "grad_norm": 0.08324859291315079, "learning_rate": 0.0027207086844824543, "loss": 1.6366, "step": 32420 }, { "epoch": 0.10824049932843485, "grad_norm": 0.09114082902669907, "learning_rate": 0.002720340605712921, "loss": 1.6323, "step": 32440 }, { "epoch": 0.10837217876800716, "grad_norm": 0.14000263810157776, "learning_rate": 0.0027199723094898606, "loss": 1.6284, "step": 32460 }, { "epoch": 0.10850385820757946, "grad_norm": 0.09753448516130447, "learning_rate": 0.0027196037958789002, "loss": 1.633, "step": 32480 }, { "epoch": 0.10863553764715177, "grad_norm": 0.09878184646368027, "learning_rate": 0.0027192350649457055, "loss": 1.6316, "step": 32500 }, { "epoch": 0.10876721708672409, "grad_norm": 0.08344288915395737, "learning_rate": 0.002718866116755981, "loss": 1.6188, "step": 32520 }, { "epoch": 0.10889889652629639, "grad_norm": 0.09065096825361252, "learning_rate": 0.00271849695137547, "loss": 1.6279, "step": 32540 }, { "epoch": 0.1090305759658687, "grad_norm": 0.08262189477682114, "learning_rate": 0.002718127568869954, "loss": 1.6301, "step": 32560 }, { "epoch": 0.109162255405441, "grad_norm": 0.11573157459497452, "learning_rate": 0.002717757969305254, "loss": 1.6204, "step": 32580 }, { "epoch": 0.1092939348450133, "grad_norm": 0.09369558840990067, "learning_rate": 0.002717388152747229, "loss": 1.6258, "step": 32600 }, { "epoch": 0.10942561428458561, "grad_norm": 0.08298981189727783, "learning_rate": 0.0027170181192617774, "loss": 1.597, "step": 32620 }, { "epoch": 0.10955729372415791, "grad_norm": 0.0729466900229454, "learning_rate": 0.0027166478689148355, "loss": 1.5801, "step": 32640 }, { "epoch": 0.10968897316373022, "grad_norm": 0.08472312241792679, "learning_rate": 0.002716277401772378, "loss": 1.574, "step": 32660 }, { "epoch": 0.10982065260330252, "grad_norm": 0.08250225335359573, "learning_rate": 0.00271590671790042, "loss": 1.5731, "step": 32680 }, { "epoch": 0.10995233204287483, "grad_norm": 0.07867790013551712, "learning_rate": 0.0027155358173650123, "loss": 1.5637, "step": 32700 }, { "epoch": 0.11008401148244713, "grad_norm": 0.10871689021587372, "learning_rate": 0.002715164700232247, "loss": 1.5652, "step": 32720 }, { "epoch": 0.11021569092201944, "grad_norm": 0.09244067221879959, "learning_rate": 0.002714793366568254, "loss": 1.564, "step": 32740 }, { "epoch": 0.11034737036159174, "grad_norm": 0.10256188362836838, "learning_rate": 0.0027144218164392012, "loss": 1.5575, "step": 32760 }, { "epoch": 0.11047904980116405, "grad_norm": 0.10790042579174042, "learning_rate": 0.0027140500499112956, "loss": 1.5585, "step": 32780 }, { "epoch": 0.11061072924073635, "grad_norm": 0.07326998561620712, "learning_rate": 0.002713678067050782, "loss": 1.5602, "step": 32800 }, { "epoch": 0.11074240868030866, "grad_norm": 0.12128879874944687, "learning_rate": 0.0027133058679239446, "loss": 1.5558, "step": 32820 }, { "epoch": 0.11087408811988096, "grad_norm": 0.0924782082438469, "learning_rate": 0.0027129334525971068, "loss": 1.5546, "step": 32840 }, { "epoch": 0.11100576755945327, "grad_norm": 0.10736776888370514, "learning_rate": 0.002712560821136628, "loss": 1.5555, "step": 32860 }, { "epoch": 0.11113744699902557, "grad_norm": 0.11395737528800964, "learning_rate": 0.0027121879736089097, "loss": 1.5535, "step": 32880 }, { "epoch": 0.11126912643859788, "grad_norm": 0.08395570516586304, "learning_rate": 0.0027118149100803877, "loss": 1.5501, "step": 32900 }, { "epoch": 0.11140080587817018, "grad_norm": 0.08537106215953827, "learning_rate": 0.0027114416306175397, "loss": 1.5457, "step": 32920 }, { "epoch": 0.11153248531774249, "grad_norm": 0.06968770921230316, "learning_rate": 0.002711068135286881, "loss": 1.5526, "step": 32940 }, { "epoch": 0.11166416475731479, "grad_norm": 0.10123132914304733, "learning_rate": 0.0027106944241549647, "loss": 1.5524, "step": 32960 }, { "epoch": 0.1117958441968871, "grad_norm": 0.11128298938274384, "learning_rate": 0.0027103204972883824, "loss": 1.5412, "step": 32980 }, { "epoch": 0.1119275236364594, "grad_norm": 0.08465181291103363, "learning_rate": 0.002709946354753765, "loss": 1.5507, "step": 33000 }, { "epoch": 0.1119275236364594, "eval_loss": 1.6168590784072876, "eval_runtime": 66.027, "eval_samples_per_second": 15.145, "eval_steps_per_second": 15.145, "step": 33000 }, { "epoch": 0.1120592030760317, "grad_norm": 0.09486215561628342, "learning_rate": 0.0027095719966177805, "loss": 1.5482, "step": 33020 }, { "epoch": 0.11219088251560401, "grad_norm": 0.09311071038246155, "learning_rate": 0.0027091974229471365, "loss": 1.5502, "step": 33040 }, { "epoch": 0.11232256195517631, "grad_norm": 0.16168630123138428, "learning_rate": 0.002708822633808579, "loss": 1.5475, "step": 33060 }, { "epoch": 0.11245424139474862, "grad_norm": 0.09388844668865204, "learning_rate": 0.002708447629268891, "loss": 1.5533, "step": 33080 }, { "epoch": 0.11258592083432092, "grad_norm": 0.08351096510887146, "learning_rate": 0.002708072409394896, "loss": 1.5522, "step": 33100 }, { "epoch": 0.11271760027389323, "grad_norm": 0.07432214170694351, "learning_rate": 0.0027076969742534543, "loss": 1.5471, "step": 33120 }, { "epoch": 0.11284927971346553, "grad_norm": 0.09724659472703934, "learning_rate": 0.002707321323911465, "loss": 1.5502, "step": 33140 }, { "epoch": 0.11298095915303784, "grad_norm": 0.08879043906927109, "learning_rate": 0.0027069454584358658, "loss": 1.5441, "step": 33160 }, { "epoch": 0.11311263859261014, "grad_norm": 0.07506344467401505, "learning_rate": 0.0027065693778936316, "loss": 1.5691, "step": 33180 }, { "epoch": 0.11324431803218246, "grad_norm": 0.10346978157758713, "learning_rate": 0.0027061930823517777, "loss": 1.5975, "step": 33200 }, { "epoch": 0.11337599747175477, "grad_norm": 0.08535962551832199, "learning_rate": 0.002705816571877355, "loss": 1.6033, "step": 33220 }, { "epoch": 0.11350767691132707, "grad_norm": 0.10019640624523163, "learning_rate": 0.002705439846537456, "loss": 1.6107, "step": 33240 }, { "epoch": 0.11363935635089938, "grad_norm": 0.08656740933656693, "learning_rate": 0.002705062906399209, "loss": 1.6062, "step": 33260 }, { "epoch": 0.11377103579047168, "grad_norm": 0.10879825055599213, "learning_rate": 0.0027046857515297808, "loss": 1.6123, "step": 33280 }, { "epoch": 0.11390271523004399, "grad_norm": 0.11161535233259201, "learning_rate": 0.002704308381996377, "loss": 1.6132, "step": 33300 }, { "epoch": 0.11403439466961629, "grad_norm": 0.07457931339740753, "learning_rate": 0.002703930797866242, "loss": 1.6062, "step": 33320 }, { "epoch": 0.1141660741091886, "grad_norm": 0.08514375239610672, "learning_rate": 0.002703552999206657, "loss": 1.6045, "step": 33340 }, { "epoch": 0.1142977535487609, "grad_norm": 0.07797901332378387, "learning_rate": 0.0027031749860849438, "loss": 1.6044, "step": 33360 }, { "epoch": 0.1144294329883332, "grad_norm": 0.10032613575458527, "learning_rate": 0.0027027967585684597, "loss": 1.6016, "step": 33380 }, { "epoch": 0.11456111242790551, "grad_norm": 0.07706362754106522, "learning_rate": 0.0027024183167246012, "loss": 1.5949, "step": 33400 }, { "epoch": 0.11469279186747781, "grad_norm": 0.07698775827884674, "learning_rate": 0.0027020396606208036, "loss": 1.6026, "step": 33420 }, { "epoch": 0.11482447130705012, "grad_norm": 0.09712442755699158, "learning_rate": 0.00270166079032454, "loss": 1.5968, "step": 33440 }, { "epoch": 0.11495615074662242, "grad_norm": 0.0798928514122963, "learning_rate": 0.002701281705903321, "loss": 1.5939, "step": 33460 }, { "epoch": 0.11508783018619473, "grad_norm": 0.09378674626350403, "learning_rate": 0.002700902407424697, "loss": 1.5946, "step": 33480 }, { "epoch": 0.11521950962576703, "grad_norm": 0.1083533987402916, "learning_rate": 0.0027005228949562544, "loss": 1.5982, "step": 33500 }, { "epoch": 0.11535118906533934, "grad_norm": 0.09362529218196869, "learning_rate": 0.00270014316856562, "loss": 1.5938, "step": 33520 }, { "epoch": 0.11548286850491164, "grad_norm": 0.10311439633369446, "learning_rate": 0.002699763228320457, "loss": 1.5909, "step": 33540 }, { "epoch": 0.11561454794448395, "grad_norm": 0.07770277559757233, "learning_rate": 0.0026993830742884674, "loss": 1.5921, "step": 33560 }, { "epoch": 0.11574622738405625, "grad_norm": 0.08439300209283829, "learning_rate": 0.002699002706537391, "loss": 1.5847, "step": 33580 }, { "epoch": 0.11587790682362856, "grad_norm": 0.09440808743238449, "learning_rate": 0.0026986221251350056, "loss": 1.5852, "step": 33600 }, { "epoch": 0.11600958626320086, "grad_norm": 0.08001919090747833, "learning_rate": 0.0026982413301491277, "loss": 1.5938, "step": 33620 }, { "epoch": 0.11614126570277317, "grad_norm": 0.11483153700828552, "learning_rate": 0.002697860321647611, "loss": 1.5927, "step": 33640 }, { "epoch": 0.11627294514234547, "grad_norm": 0.10114043205976486, "learning_rate": 0.0026974790996983486, "loss": 1.5898, "step": 33660 }, { "epoch": 0.11640462458191778, "grad_norm": 0.08223793655633926, "learning_rate": 0.002697097664369271, "loss": 1.5898, "step": 33680 }, { "epoch": 0.11653630402149008, "grad_norm": 0.0857810378074646, "learning_rate": 0.002696716015728345, "loss": 1.5936, "step": 33700 }, { "epoch": 0.11666798346106239, "grad_norm": 0.12150619924068451, "learning_rate": 0.0026963341538435775, "loss": 1.587, "step": 33720 }, { "epoch": 0.11679966290063469, "grad_norm": 0.09355217963457108, "learning_rate": 0.0026959520787830133, "loss": 1.5856, "step": 33740 }, { "epoch": 0.116931342340207, "grad_norm": 0.08837936073541641, "learning_rate": 0.0026955697906147344, "loss": 1.5895, "step": 33760 }, { "epoch": 0.1170630217797793, "grad_norm": 0.08591131120920181, "learning_rate": 0.002695187289406861, "loss": 1.5967, "step": 33780 }, { "epoch": 0.1171947012193516, "grad_norm": 0.11289795488119125, "learning_rate": 0.002694804575227551, "loss": 1.5971, "step": 33800 }, { "epoch": 0.11732638065892391, "grad_norm": 0.09001953154802322, "learning_rate": 0.002694421648145001, "loss": 1.6129, "step": 33820 }, { "epoch": 0.11745806009849621, "grad_norm": 0.10741370916366577, "learning_rate": 0.002694038508227445, "loss": 1.6142, "step": 33840 }, { "epoch": 0.11758973953806853, "grad_norm": 0.08802719414234161, "learning_rate": 0.0026936551555431553, "loss": 1.6164, "step": 33860 }, { "epoch": 0.11772141897764084, "grad_norm": 0.10249514877796173, "learning_rate": 0.002693271590160441, "loss": 1.6068, "step": 33880 }, { "epoch": 0.11785309841721314, "grad_norm": 0.12778210639953613, "learning_rate": 0.002692887812147651, "loss": 1.604, "step": 33900 }, { "epoch": 0.11798477785678545, "grad_norm": 0.10118341445922852, "learning_rate": 0.0026925038215731703, "loss": 1.6052, "step": 33920 }, { "epoch": 0.11811645729635775, "grad_norm": 0.12567481398582458, "learning_rate": 0.002692119618505423, "loss": 1.6026, "step": 33940 }, { "epoch": 0.11824813673593006, "grad_norm": 0.0919373631477356, "learning_rate": 0.0026917352030128698, "loss": 1.5962, "step": 33960 }, { "epoch": 0.11837981617550236, "grad_norm": 0.10136484354734421, "learning_rate": 0.002691350575164011, "loss": 1.5898, "step": 33980 }, { "epoch": 0.11851149561507467, "grad_norm": 0.07460084557533264, "learning_rate": 0.0026909657350273827, "loss": 1.5924, "step": 34000 }, { "epoch": 0.11851149561507467, "eval_loss": 1.5006837844848633, "eval_runtime": 66.9994, "eval_samples_per_second": 14.926, "eval_steps_per_second": 14.926, "step": 34000 }, { "epoch": 0.11864317505464697, "grad_norm": 0.09306183457374573, "learning_rate": 0.0026905806826715605, "loss": 1.5871, "step": 34020 }, { "epoch": 0.11877485449421928, "grad_norm": 0.08243928104639053, "learning_rate": 0.002690195418165158, "loss": 1.5946, "step": 34040 }, { "epoch": 0.11890653393379158, "grad_norm": 0.08196361362934113, "learning_rate": 0.002689809941576824, "loss": 1.5878, "step": 34060 }, { "epoch": 0.11903821337336389, "grad_norm": 0.09074049443006516, "learning_rate": 0.0026894242529752485, "loss": 1.5903, "step": 34080 }, { "epoch": 0.11916989281293619, "grad_norm": 0.08904928714036942, "learning_rate": 0.002689038352429157, "loss": 1.5858, "step": 34100 }, { "epoch": 0.1193015722525085, "grad_norm": 0.08144096285104752, "learning_rate": 0.0026886522400073136, "loss": 1.5845, "step": 34120 }, { "epoch": 0.1194332516920808, "grad_norm": 0.1431560218334198, "learning_rate": 0.00268826591577852, "loss": 1.5868, "step": 34140 }, { "epoch": 0.1195649311316531, "grad_norm": 0.09951731562614441, "learning_rate": 0.002687879379811615, "loss": 1.5827, "step": 34160 }, { "epoch": 0.11969661057122541, "grad_norm": 0.12058053910732269, "learning_rate": 0.0026874926321754766, "loss": 1.5822, "step": 34180 }, { "epoch": 0.11982829001079771, "grad_norm": 0.10634467750787735, "learning_rate": 0.0026871056729390196, "loss": 1.5869, "step": 34200 }, { "epoch": 0.11995996945037002, "grad_norm": 0.09280095249414444, "learning_rate": 0.002686718502171196, "loss": 1.5891, "step": 34220 }, { "epoch": 0.12009164888994232, "grad_norm": 0.11709116399288177, "learning_rate": 0.002686331119940997, "loss": 1.5816, "step": 34240 }, { "epoch": 0.12022332832951463, "grad_norm": 0.07095829397439957, "learning_rate": 0.00268594352631745, "loss": 1.5885, "step": 34260 }, { "epoch": 0.12035500776908693, "grad_norm": 0.0902029350399971, "learning_rate": 0.00268555572136962, "loss": 1.5819, "step": 34280 }, { "epoch": 0.12048668720865924, "grad_norm": 0.08400021493434906, "learning_rate": 0.0026851677051666113, "loss": 1.5836, "step": 34300 }, { "epoch": 0.12061836664823154, "grad_norm": 0.07917217165231705, "learning_rate": 0.002684779477777565, "loss": 1.5784, "step": 34320 }, { "epoch": 0.12075004608780385, "grad_norm": 0.10317684710025787, "learning_rate": 0.002684391039271659, "loss": 1.5754, "step": 34340 }, { "epoch": 0.12088172552737615, "grad_norm": 0.08167439699172974, "learning_rate": 0.0026840023897181098, "loss": 1.586, "step": 34360 }, { "epoch": 0.12101340496694846, "grad_norm": 0.0829315185546875, "learning_rate": 0.00268361352918617, "loss": 1.6143, "step": 34380 }, { "epoch": 0.12114508440652076, "grad_norm": 0.08923465013504028, "learning_rate": 0.0026832244577451336, "loss": 1.6303, "step": 34400 }, { "epoch": 0.12127676384609307, "grad_norm": 0.0999564528465271, "learning_rate": 0.002682835175464327, "loss": 1.632, "step": 34420 }, { "epoch": 0.12140844328566537, "grad_norm": 0.08035658299922943, "learning_rate": 0.002682445682413118, "loss": 1.6289, "step": 34440 }, { "epoch": 0.12154012272523768, "grad_norm": 0.06893916428089142, "learning_rate": 0.0026820559786609106, "loss": 1.6304, "step": 34460 }, { "epoch": 0.12167180216480998, "grad_norm": 0.10471726953983307, "learning_rate": 0.0026816660642771466, "loss": 1.6257, "step": 34480 }, { "epoch": 0.12180348160438229, "grad_norm": 0.06977444887161255, "learning_rate": 0.0026812759393313045, "loss": 1.6235, "step": 34500 }, { "epoch": 0.12193516104395459, "grad_norm": 0.0887407585978508, "learning_rate": 0.0026808856038929014, "loss": 1.6233, "step": 34520 }, { "epoch": 0.12206684048352691, "grad_norm": 0.09635386615991592, "learning_rate": 0.0026804950580314917, "loss": 1.6219, "step": 34540 }, { "epoch": 0.12219851992309921, "grad_norm": 0.0804891362786293, "learning_rate": 0.0026801043018166667, "loss": 1.619, "step": 34560 }, { "epoch": 0.12233019936267152, "grad_norm": 0.08388678729534149, "learning_rate": 0.0026797133353180557, "loss": 1.6072, "step": 34580 }, { "epoch": 0.12246187880224382, "grad_norm": 0.1082354336977005, "learning_rate": 0.0026793221586053255, "loss": 1.6141, "step": 34600 }, { "epoch": 0.12259355824181613, "grad_norm": 0.08664815127849579, "learning_rate": 0.0026789307717481805, "loss": 1.6101, "step": 34620 }, { "epoch": 0.12272523768138843, "grad_norm": 0.09746722877025604, "learning_rate": 0.002678539174816361, "loss": 1.6086, "step": 34640 }, { "epoch": 0.12285691712096074, "grad_norm": 0.08757676929235458, "learning_rate": 0.0026781473678796474, "loss": 1.6021, "step": 34660 }, { "epoch": 0.12298859656053304, "grad_norm": 0.10005202144384384, "learning_rate": 0.0026777553510078556, "loss": 1.6083, "step": 34680 }, { "epoch": 0.12312027600010535, "grad_norm": 0.0922529324889183, "learning_rate": 0.0026773631242708396, "loss": 1.6052, "step": 34700 }, { "epoch": 0.12325195543967765, "grad_norm": 0.0967714935541153, "learning_rate": 0.00267697068773849, "loss": 1.6057, "step": 34720 }, { "epoch": 0.12338363487924996, "grad_norm": 0.07341698557138443, "learning_rate": 0.002676578041480736, "loss": 1.6049, "step": 34740 }, { "epoch": 0.12351531431882226, "grad_norm": 0.09357757121324539, "learning_rate": 0.0026761851855675433, "loss": 1.6074, "step": 34760 }, { "epoch": 0.12364699375839457, "grad_norm": 0.07980691641569138, "learning_rate": 0.0026757921200689155, "loss": 1.6043, "step": 34780 }, { "epoch": 0.12377867319796687, "grad_norm": 0.1163335070014, "learning_rate": 0.002675398845054893, "loss": 1.6085, "step": 34800 }, { "epoch": 0.12391035263753918, "grad_norm": 0.08081631362438202, "learning_rate": 0.0026750053605955537, "loss": 1.6018, "step": 34820 }, { "epoch": 0.12404203207711148, "grad_norm": 0.0792580246925354, "learning_rate": 0.002674611666761013, "loss": 1.6092, "step": 34840 }, { "epoch": 0.12417371151668379, "grad_norm": 0.0822744071483612, "learning_rate": 0.002674217763621424, "loss": 1.6052, "step": 34860 }, { "epoch": 0.12430539095625609, "grad_norm": 0.10850385576486588, "learning_rate": 0.002673823651246976, "loss": 1.6001, "step": 34880 }, { "epoch": 0.1244370703958284, "grad_norm": 0.10312029719352722, "learning_rate": 0.002673429329707897, "loss": 1.599, "step": 34900 }, { "epoch": 0.1245687498354007, "grad_norm": 0.09553300589323044, "learning_rate": 0.0026730347990744506, "loss": 1.6001, "step": 34920 }, { "epoch": 0.124700429274973, "grad_norm": 0.07871738821268082, "learning_rate": 0.0026726400594169392, "loss": 1.5985, "step": 34940 }, { "epoch": 0.12483210871454531, "grad_norm": 0.1027330532670021, "learning_rate": 0.0026722451108057016, "loss": 1.5977, "step": 34960 }, { "epoch": 0.12496378815411761, "grad_norm": 0.08380601555109024, "learning_rate": 0.0026718499533111137, "loss": 1.6039, "step": 34980 }, { "epoch": 0.12509546759368992, "grad_norm": 0.09733425080776215, "learning_rate": 0.002671454587003589, "loss": 1.6059, "step": 35000 }, { "epoch": 0.12509546759368992, "eval_loss": 1.5703957080841064, "eval_runtime": 66.1504, "eval_samples_per_second": 15.117, "eval_steps_per_second": 15.117, "step": 35000 }, { "epoch": 0.12522714703326224, "grad_norm": 0.08837222307920456, "learning_rate": 0.0026710590119535787, "loss": 1.5829, "step": 35020 }, { "epoch": 0.12535882647283453, "grad_norm": 0.09444919973611832, "learning_rate": 0.0026706632282315706, "loss": 1.5766, "step": 35040 }, { "epoch": 0.12549050591240685, "grad_norm": 0.09045890718698502, "learning_rate": 0.0026702672359080887, "loss": 1.5706, "step": 35060 }, { "epoch": 0.12562218535197914, "grad_norm": 0.10616089403629303, "learning_rate": 0.002669871035053697, "loss": 1.5704, "step": 35080 }, { "epoch": 0.12575386479155146, "grad_norm": 0.08494651317596436, "learning_rate": 0.002669474625738993, "loss": 1.5693, "step": 35100 }, { "epoch": 0.12588554423112375, "grad_norm": 0.09198006242513657, "learning_rate": 0.0026690780080346143, "loss": 1.5588, "step": 35120 }, { "epoch": 0.12601722367069607, "grad_norm": 0.07722193002700806, "learning_rate": 0.0026686811820112346, "loss": 1.5653, "step": 35140 }, { "epoch": 0.12614890311026836, "grad_norm": 0.08537338674068451, "learning_rate": 0.002668284147739564, "loss": 1.5594, "step": 35160 }, { "epoch": 0.12628058254984068, "grad_norm": 0.10831312835216522, "learning_rate": 0.002667886905290351, "loss": 1.5523, "step": 35180 }, { "epoch": 0.12641226198941297, "grad_norm": 0.0943257287144661, "learning_rate": 0.00266748945473438, "loss": 1.553, "step": 35200 }, { "epoch": 0.12654394142898528, "grad_norm": 0.1066376119852066, "learning_rate": 0.0026670917961424735, "loss": 1.5569, "step": 35220 }, { "epoch": 0.12667562086855758, "grad_norm": 0.09195302426815033, "learning_rate": 0.0026666939295854905, "loss": 1.5524, "step": 35240 }, { "epoch": 0.1268073003081299, "grad_norm": 0.09674491733312607, "learning_rate": 0.002666295855134327, "loss": 1.5522, "step": 35260 }, { "epoch": 0.12693897974770219, "grad_norm": 0.12088479846715927, "learning_rate": 0.0026658975728599166, "loss": 1.5529, "step": 35280 }, { "epoch": 0.1270706591872745, "grad_norm": 0.09849090874195099, "learning_rate": 0.0026654990828332294, "loss": 1.5502, "step": 35300 }, { "epoch": 0.1272023386268468, "grad_norm": 0.08557942509651184, "learning_rate": 0.0026651003851252725, "loss": 1.5469, "step": 35320 }, { "epoch": 0.1273340180664191, "grad_norm": 0.0989651307463646, "learning_rate": 0.00266470147980709, "loss": 1.5467, "step": 35340 }, { "epoch": 0.1274656975059914, "grad_norm": 0.08966153860092163, "learning_rate": 0.002664302366949764, "loss": 1.5445, "step": 35360 }, { "epoch": 0.12759737694556372, "grad_norm": 0.0903390496969223, "learning_rate": 0.002663903046624412, "loss": 1.5489, "step": 35380 }, { "epoch": 0.12772905638513601, "grad_norm": 0.0847504660487175, "learning_rate": 0.0026635035189021892, "loss": 1.5421, "step": 35400 }, { "epoch": 0.12786073582470833, "grad_norm": 0.11433856189250946, "learning_rate": 0.0026631037838542883, "loss": 1.5404, "step": 35420 }, { "epoch": 0.12799241526428062, "grad_norm": 0.09573832899332047, "learning_rate": 0.0026627038415519386, "loss": 1.5505, "step": 35440 }, { "epoch": 0.12812409470385294, "grad_norm": 0.10996285080909729, "learning_rate": 0.002662303692066405, "loss": 1.5422, "step": 35460 }, { "epoch": 0.12825577414342523, "grad_norm": 0.13538189232349396, "learning_rate": 0.0026619033354689917, "loss": 1.5431, "step": 35480 }, { "epoch": 0.12838745358299755, "grad_norm": 0.09150131791830063, "learning_rate": 0.0026615027718310375, "loss": 1.5489, "step": 35500 }, { "epoch": 0.12851913302256984, "grad_norm": 0.08535768836736679, "learning_rate": 0.00266110200122392, "loss": 1.5474, "step": 35520 }, { "epoch": 0.12865081246214216, "grad_norm": 0.0952446460723877, "learning_rate": 0.002660701023719053, "loss": 1.5451, "step": 35540 }, { "epoch": 0.12878249190171448, "grad_norm": 0.1442309468984604, "learning_rate": 0.0026602998393878865, "loss": 1.5548, "step": 35560 }, { "epoch": 0.12891417134128677, "grad_norm": 0.08960012346506119, "learning_rate": 0.0026598984483019077, "loss": 1.5595, "step": 35580 }, { "epoch": 0.1290458507808591, "grad_norm": 0.09016614407300949, "learning_rate": 0.002659496850532641, "loss": 1.5564, "step": 35600 }, { "epoch": 0.12917753022043138, "grad_norm": 0.11049813777208328, "learning_rate": 0.0026590950461516482, "loss": 1.5583, "step": 35620 }, { "epoch": 0.1293092096600037, "grad_norm": 0.11803802847862244, "learning_rate": 0.002658693035230526, "loss": 1.5528, "step": 35640 }, { "epoch": 0.129440889099576, "grad_norm": 0.12277698516845703, "learning_rate": 0.00265829081784091, "loss": 1.5452, "step": 35660 }, { "epoch": 0.1295725685391483, "grad_norm": 0.08969718217849731, "learning_rate": 0.002657888394054471, "loss": 1.5436, "step": 35680 }, { "epoch": 0.1297042479787206, "grad_norm": 0.07710202783346176, "learning_rate": 0.002657485763942918, "loss": 1.5429, "step": 35700 }, { "epoch": 0.12983592741829292, "grad_norm": 0.10966431349515915, "learning_rate": 0.0026570829275779947, "loss": 1.5381, "step": 35720 }, { "epoch": 0.1299676068578652, "grad_norm": 0.09629274159669876, "learning_rate": 0.002656679885031484, "loss": 1.5386, "step": 35740 }, { "epoch": 0.13009928629743753, "grad_norm": 0.11513884365558624, "learning_rate": 0.0026562766363752042, "loss": 1.5343, "step": 35760 }, { "epoch": 0.13023096573700982, "grad_norm": 0.10110338777303696, "learning_rate": 0.0026558731816810105, "loss": 1.5315, "step": 35780 }, { "epoch": 0.13036264517658214, "grad_norm": 0.08176104724407196, "learning_rate": 0.0026554695210207944, "loss": 1.5365, "step": 35800 }, { "epoch": 0.13049432461615443, "grad_norm": 0.09711804240942001, "learning_rate": 0.0026550656544664848, "loss": 1.5305, "step": 35820 }, { "epoch": 0.13062600405572675, "grad_norm": 0.09326780587434769, "learning_rate": 0.0026546615820900467, "loss": 1.5236, "step": 35840 }, { "epoch": 0.13075768349529904, "grad_norm": 0.10439273715019226, "learning_rate": 0.002654257303963483, "loss": 1.5217, "step": 35860 }, { "epoch": 0.13088936293487136, "grad_norm": 0.09977664798498154, "learning_rate": 0.002653852820158832, "loss": 1.5241, "step": 35880 }, { "epoch": 0.13102104237444365, "grad_norm": 0.08770251274108887, "learning_rate": 0.0026534481307481685, "loss": 1.5319, "step": 35900 }, { "epoch": 0.13115272181401597, "grad_norm": 0.10881366580724716, "learning_rate": 0.002653043235803605, "loss": 1.5383, "step": 35920 }, { "epoch": 0.13128440125358826, "grad_norm": 0.09104442596435547, "learning_rate": 0.0026526381353972894, "loss": 1.5326, "step": 35940 }, { "epoch": 0.13141608069316058, "grad_norm": 0.12487766891717911, "learning_rate": 0.0026522328296014076, "loss": 1.5339, "step": 35960 }, { "epoch": 0.13154776013273287, "grad_norm": 0.15558366477489471, "learning_rate": 0.0026518273184881814, "loss": 1.5229, "step": 35980 }, { "epoch": 0.13167943957230518, "grad_norm": 0.1283443719148636, "learning_rate": 0.0026514216021298687, "loss": 1.5299, "step": 36000 }, { "epoch": 0.13167943957230518, "eval_loss": 1.617323875427246, "eval_runtime": 67.0387, "eval_samples_per_second": 14.917, "eval_steps_per_second": 14.917, "step": 36000 }, { "epoch": 0.13181111901187748, "grad_norm": 0.14764146506786346, "learning_rate": 0.0026510156805987645, "loss": 1.5301, "step": 36020 }, { "epoch": 0.1319427984514498, "grad_norm": 0.09800808131694794, "learning_rate": 0.0026506095539672006, "loss": 1.5251, "step": 36040 }, { "epoch": 0.13207447789102209, "grad_norm": 0.09196116775274277, "learning_rate": 0.0026502032223075446, "loss": 1.5279, "step": 36060 }, { "epoch": 0.1322061573305944, "grad_norm": 0.10031158477067947, "learning_rate": 0.0026497966856922016, "loss": 1.5282, "step": 36080 }, { "epoch": 0.1323378367701667, "grad_norm": 0.12328962981700897, "learning_rate": 0.0026493899441936124, "loss": 1.5328, "step": 36100 }, { "epoch": 0.132469516209739, "grad_norm": 0.1079377755522728, "learning_rate": 0.0026489829978842546, "loss": 1.5307, "step": 36120 }, { "epoch": 0.1326011956493113, "grad_norm": 0.08541183918714523, "learning_rate": 0.0026485758468366427, "loss": 1.5356, "step": 36140 }, { "epoch": 0.13273287508888362, "grad_norm": 0.10611236095428467, "learning_rate": 0.0026481684911233267, "loss": 1.5834, "step": 36160 }, { "epoch": 0.1328645545284559, "grad_norm": 0.087572380900383, "learning_rate": 0.0026477609308168944, "loss": 1.6016, "step": 36180 }, { "epoch": 0.13299623396802823, "grad_norm": 0.1034546047449112, "learning_rate": 0.002647353165989968, "loss": 1.6119, "step": 36200 }, { "epoch": 0.13312791340760055, "grad_norm": 0.09647917747497559, "learning_rate": 0.002646945196715209, "loss": 1.6142, "step": 36220 }, { "epoch": 0.13325959284717284, "grad_norm": 0.08855011314153671, "learning_rate": 0.002646537023065313, "loss": 1.6148, "step": 36240 }, { "epoch": 0.13339127228674516, "grad_norm": 0.10243046283721924, "learning_rate": 0.0026461286451130127, "loss": 1.6155, "step": 36260 }, { "epoch": 0.13352295172631745, "grad_norm": 0.105488620698452, "learning_rate": 0.0026457200629310777, "loss": 1.614, "step": 36280 }, { "epoch": 0.13365463116588977, "grad_norm": 0.08305686712265015, "learning_rate": 0.0026453112765923133, "loss": 1.6059, "step": 36300 }, { "epoch": 0.13378631060546206, "grad_norm": 0.09603402763605118, "learning_rate": 0.0026449022861695618, "loss": 1.6018, "step": 36320 }, { "epoch": 0.13391799004503438, "grad_norm": 0.11666828393936157, "learning_rate": 0.0026444930917357014, "loss": 1.6017, "step": 36340 }, { "epoch": 0.13404966948460667, "grad_norm": 0.1235344409942627, "learning_rate": 0.0026440836933636466, "loss": 1.5965, "step": 36360 }, { "epoch": 0.134181348924179, "grad_norm": 0.11957265436649323, "learning_rate": 0.002643674091126349, "loss": 1.5957, "step": 36380 }, { "epoch": 0.13431302836375128, "grad_norm": 0.11756687611341476, "learning_rate": 0.0026432642850967953, "loss": 1.5999, "step": 36400 }, { "epoch": 0.1344447078033236, "grad_norm": 0.10342928767204285, "learning_rate": 0.002642854275348009, "loss": 1.592, "step": 36420 }, { "epoch": 0.1345763872428959, "grad_norm": 0.10075769573450089, "learning_rate": 0.002642444061953051, "loss": 1.5932, "step": 36440 }, { "epoch": 0.1347080666824682, "grad_norm": 0.10493767261505127, "learning_rate": 0.002642033644985017, "loss": 1.5928, "step": 36460 }, { "epoch": 0.1348397461220405, "grad_norm": 0.1051807627081871, "learning_rate": 0.00264162302451704, "loss": 1.5842, "step": 36480 }, { "epoch": 0.13497142556161282, "grad_norm": 0.10073640197515488, "learning_rate": 0.0026412122006222883, "loss": 1.5831, "step": 36500 }, { "epoch": 0.1351031050011851, "grad_norm": 0.10793869942426682, "learning_rate": 0.0026408011733739674, "loss": 1.5888, "step": 36520 }, { "epoch": 0.13523478444075743, "grad_norm": 0.08608701080083847, "learning_rate": 0.002640389942845318, "loss": 1.588, "step": 36540 }, { "epoch": 0.13536646388032972, "grad_norm": 0.08790282160043716, "learning_rate": 0.0026399785091096176, "loss": 1.5869, "step": 36560 }, { "epoch": 0.13549814331990204, "grad_norm": 0.08713233470916748, "learning_rate": 0.002639566872240181, "loss": 1.5829, "step": 36580 }, { "epoch": 0.13562982275947433, "grad_norm": 0.08939250558614731, "learning_rate": 0.0026391550323103573, "loss": 1.582, "step": 36600 }, { "epoch": 0.13576150219904665, "grad_norm": 0.09528082609176636, "learning_rate": 0.0026387429893935327, "loss": 1.5845, "step": 36620 }, { "epoch": 0.13589318163861894, "grad_norm": 0.12500585615634918, "learning_rate": 0.0026383307435631294, "loss": 1.5823, "step": 36640 }, { "epoch": 0.13602486107819126, "grad_norm": 0.0984441414475441, "learning_rate": 0.0026379182948926055, "loss": 1.5762, "step": 36660 }, { "epoch": 0.13615654051776355, "grad_norm": 0.11194117367267609, "learning_rate": 0.0026375056434554565, "loss": 1.5809, "step": 36680 }, { "epoch": 0.13628821995733587, "grad_norm": 0.11597609519958496, "learning_rate": 0.002637092789325212, "loss": 1.5774, "step": 36700 }, { "epoch": 0.13641989939690816, "grad_norm": 0.07991953939199448, "learning_rate": 0.0026366797325754403, "loss": 1.581, "step": 36720 }, { "epoch": 0.13655157883648048, "grad_norm": 0.10064183175563812, "learning_rate": 0.0026362664732797426, "loss": 1.5853, "step": 36740 }, { "epoch": 0.13668325827605277, "grad_norm": 0.1042194738984108, "learning_rate": 0.0026358530115117595, "loss": 1.5975, "step": 36760 }, { "epoch": 0.13681493771562508, "grad_norm": 0.10666348040103912, "learning_rate": 0.002635439347345165, "loss": 1.6029, "step": 36780 }, { "epoch": 0.13694661715519738, "grad_norm": 0.1007642075419426, "learning_rate": 0.0026350254808536707, "loss": 1.6028, "step": 36800 }, { "epoch": 0.1370782965947697, "grad_norm": 0.08334644138813019, "learning_rate": 0.002634611412111024, "loss": 1.6097, "step": 36820 }, { "epoch": 0.13720997603434198, "grad_norm": 0.09047345817089081, "learning_rate": 0.0026341971411910077, "loss": 1.6055, "step": 36840 }, { "epoch": 0.1373416554739143, "grad_norm": 0.16159166395664215, "learning_rate": 0.002633782668167442, "loss": 1.5987, "step": 36860 }, { "epoch": 0.1374733349134866, "grad_norm": 0.10918816179037094, "learning_rate": 0.002633367993114181, "loss": 1.604, "step": 36880 }, { "epoch": 0.1376050143530589, "grad_norm": 0.10157617926597595, "learning_rate": 0.002632953116105116, "loss": 1.5927, "step": 36900 }, { "epoch": 0.13773669379263123, "grad_norm": 0.09241142123937607, "learning_rate": 0.0026325380372141756, "loss": 1.5981, "step": 36920 }, { "epoch": 0.13786837323220352, "grad_norm": 0.12108739465475082, "learning_rate": 0.002632122756515322, "loss": 1.592, "step": 36940 }, { "epoch": 0.13800005267177584, "grad_norm": 0.09442280977964401, "learning_rate": 0.0026317072740825545, "loss": 1.5884, "step": 36960 }, { "epoch": 0.13813173211134813, "grad_norm": 0.09058595448732376, "learning_rate": 0.0026312915899899085, "loss": 1.5859, "step": 36980 }, { "epoch": 0.13826341155092045, "grad_norm": 0.08916100859642029, "learning_rate": 0.002630875704311455, "loss": 1.5841, "step": 37000 }, { "epoch": 0.13826341155092045, "eval_loss": 1.493425726890564, "eval_runtime": 67.4059, "eval_samples_per_second": 14.836, "eval_steps_per_second": 14.836, "step": 37000 }, { "epoch": 0.13839509099049274, "grad_norm": 0.08742368966341019, "learning_rate": 0.0026304596171213015, "loss": 1.588, "step": 37020 }, { "epoch": 0.13852677043006506, "grad_norm": 0.07880369573831558, "learning_rate": 0.0026300433284935907, "loss": 1.5861, "step": 37040 }, { "epoch": 0.13865844986963735, "grad_norm": 0.08849447965621948, "learning_rate": 0.0026296268385025004, "loss": 1.5832, "step": 37060 }, { "epoch": 0.13879012930920967, "grad_norm": 0.08267071843147278, "learning_rate": 0.002629210147222247, "loss": 1.585, "step": 37080 }, { "epoch": 0.13892180874878196, "grad_norm": 0.08915061503648758, "learning_rate": 0.0026287932547270796, "loss": 1.5886, "step": 37100 }, { "epoch": 0.13905348818835428, "grad_norm": 0.11180838197469711, "learning_rate": 0.0026283761610912853, "loss": 1.5786, "step": 37120 }, { "epoch": 0.13918516762792657, "grad_norm": 0.14976435899734497, "learning_rate": 0.002627958866389186, "loss": 1.5809, "step": 37140 }, { "epoch": 0.1393168470674989, "grad_norm": 0.09413915127515793, "learning_rate": 0.002627541370695141, "loss": 1.5791, "step": 37160 }, { "epoch": 0.13944852650707118, "grad_norm": 0.10926341265439987, "learning_rate": 0.0026271236740835428, "loss": 1.5841, "step": 37180 }, { "epoch": 0.1395802059466435, "grad_norm": 0.09298263490200043, "learning_rate": 0.002626705776628822, "loss": 1.587, "step": 37200 }, { "epoch": 0.1397118853862158, "grad_norm": 0.1033315360546112, "learning_rate": 0.002626287678405443, "loss": 1.5787, "step": 37220 }, { "epoch": 0.1398435648257881, "grad_norm": 0.10745333135128021, "learning_rate": 0.002625869379487908, "loss": 1.5761, "step": 37240 }, { "epoch": 0.1399752442653604, "grad_norm": 0.11225748062133789, "learning_rate": 0.0026254508799507543, "loss": 1.5859, "step": 37260 }, { "epoch": 0.14010692370493272, "grad_norm": 0.09762544184923172, "learning_rate": 0.002625032179868554, "loss": 1.5775, "step": 37280 }, { "epoch": 0.140238603144505, "grad_norm": 0.0946531891822815, "learning_rate": 0.002624613279315916, "loss": 1.5794, "step": 37300 }, { "epoch": 0.14037028258407733, "grad_norm": 0.07943738996982574, "learning_rate": 0.0026241941783674842, "loss": 1.5804, "step": 37320 }, { "epoch": 0.14050196202364962, "grad_norm": 0.09314402937889099, "learning_rate": 0.0026237748770979387, "loss": 1.5749, "step": 37340 }, { "epoch": 0.14063364146322194, "grad_norm": 0.104873888194561, "learning_rate": 0.0026233553755819956, "loss": 1.5279, "step": 37360 }, { "epoch": 0.14076532090279423, "grad_norm": 0.09734835475683212, "learning_rate": 0.0026229356738944054, "loss": 1.4679, "step": 37380 }, { "epoch": 0.14089700034236655, "grad_norm": 0.10877981036901474, "learning_rate": 0.0026225157721099556, "loss": 1.4734, "step": 37400 }, { "epoch": 0.14102867978193884, "grad_norm": 0.10789605230093002, "learning_rate": 0.002622095670303469, "loss": 1.4646, "step": 37420 }, { "epoch": 0.14116035922151116, "grad_norm": 0.08844413608312607, "learning_rate": 0.0026216753685498035, "loss": 1.4594, "step": 37440 }, { "epoch": 0.14129203866108345, "grad_norm": 0.07974802702665329, "learning_rate": 0.0026212548669238534, "loss": 1.4563, "step": 37460 }, { "epoch": 0.14142371810065577, "grad_norm": 0.1050298884510994, "learning_rate": 0.002620834165500548, "loss": 1.4593, "step": 37480 }, { "epoch": 0.14155539754022806, "grad_norm": 0.11050856858491898, "learning_rate": 0.0026204132643548525, "loss": 1.4532, "step": 37500 }, { "epoch": 0.14168707697980037, "grad_norm": 0.09087752550840378, "learning_rate": 0.0026199921635617672, "loss": 1.4568, "step": 37520 }, { "epoch": 0.14181875641937267, "grad_norm": 0.08688180893659592, "learning_rate": 0.0026195708631963294, "loss": 1.4584, "step": 37540 }, { "epoch": 0.14195043585894498, "grad_norm": 0.08796868473291397, "learning_rate": 0.00261914936333361, "loss": 1.4513, "step": 37560 }, { "epoch": 0.1420821152985173, "grad_norm": 0.1213894784450531, "learning_rate": 0.002618727664048717, "loss": 1.4539, "step": 37580 }, { "epoch": 0.1422137947380896, "grad_norm": 0.11895439028739929, "learning_rate": 0.0026183057654167933, "loss": 1.4568, "step": 37600 }, { "epoch": 0.1423454741776619, "grad_norm": 0.10927541553974152, "learning_rate": 0.002617883667513017, "loss": 1.4576, "step": 37620 }, { "epoch": 0.1424771536172342, "grad_norm": 0.11971597373485565, "learning_rate": 0.0026174613704126027, "loss": 1.4586, "step": 37640 }, { "epoch": 0.14260883305680652, "grad_norm": 0.11147040128707886, "learning_rate": 0.0026170388741907995, "loss": 1.4556, "step": 37660 }, { "epoch": 0.1427405124963788, "grad_norm": 0.09948437660932541, "learning_rate": 0.0026166161789228917, "loss": 1.4559, "step": 37680 }, { "epoch": 0.14287219193595113, "grad_norm": 0.11996204406023026, "learning_rate": 0.0026161932846842013, "loss": 1.458, "step": 37700 }, { "epoch": 0.14300387137552342, "grad_norm": 0.1091773509979248, "learning_rate": 0.0026157701915500826, "loss": 1.4576, "step": 37720 }, { "epoch": 0.14313555081509574, "grad_norm": 0.27840930223464966, "learning_rate": 0.002615346899595928, "loss": 1.464, "step": 37740 }, { "epoch": 0.14326723025466803, "grad_norm": 0.09474640339612961, "learning_rate": 0.002614923408897164, "loss": 1.4745, "step": 37760 }, { "epoch": 0.14339890969424035, "grad_norm": 0.13245952129364014, "learning_rate": 0.002614499719529252, "loss": 1.4685, "step": 37780 }, { "epoch": 0.14353058913381264, "grad_norm": 0.10501421242952347, "learning_rate": 0.0026140758315676906, "loss": 1.4674, "step": 37800 }, { "epoch": 0.14366226857338496, "grad_norm": 0.10588248074054718, "learning_rate": 0.0026136517450880124, "loss": 1.4648, "step": 37820 }, { "epoch": 0.14379394801295725, "grad_norm": 0.10599175095558167, "learning_rate": 0.0026132274601657853, "loss": 1.4685, "step": 37840 }, { "epoch": 0.14392562745252957, "grad_norm": 0.11727793514728546, "learning_rate": 0.002612802976876614, "loss": 1.4643, "step": 37860 }, { "epoch": 0.14405730689210186, "grad_norm": 0.09941857308149338, "learning_rate": 0.0026123782952961363, "loss": 1.4645, "step": 37880 }, { "epoch": 0.14418898633167418, "grad_norm": 0.09774893522262573, "learning_rate": 0.0026119534155000274, "loss": 1.4684, "step": 37900 }, { "epoch": 0.14432066577124647, "grad_norm": 0.10435054451227188, "learning_rate": 0.002611528337563997, "loss": 1.4912, "step": 37920 }, { "epoch": 0.1444523452108188, "grad_norm": 0.1452368199825287, "learning_rate": 0.0026111030615637893, "loss": 1.5458, "step": 37940 }, { "epoch": 0.14458402465039108, "grad_norm": 0.1285165399312973, "learning_rate": 0.0026106775875751856, "loss": 1.5752, "step": 37960 }, { "epoch": 0.1447157040899634, "grad_norm": 0.11321987956762314, "learning_rate": 0.0026102519156740007, "loss": 1.5846, "step": 37980 }, { "epoch": 0.1448473835295357, "grad_norm": 0.0958334282040596, "learning_rate": 0.0026098260459360865, "loss": 1.5965, "step": 38000 }, { "epoch": 0.1448473835295357, "eval_loss": 1.5834728479385376, "eval_runtime": 67.4429, "eval_samples_per_second": 14.827, "eval_steps_per_second": 14.827, "step": 38000 }, { "epoch": 0.144979062969108, "grad_norm": 0.12879179418087006, "learning_rate": 0.0026093999784373273, "loss": 1.595, "step": 38020 }, { "epoch": 0.1451107424086803, "grad_norm": 0.10820400714874268, "learning_rate": 0.0026089737132536464, "loss": 1.5911, "step": 38040 }, { "epoch": 0.14524242184825262, "grad_norm": 0.09675215184688568, "learning_rate": 0.002608547250460999, "loss": 1.589, "step": 38060 }, { "epoch": 0.1453741012878249, "grad_norm": 0.11472152918577194, "learning_rate": 0.0026081205901353774, "loss": 1.5921, "step": 38080 }, { "epoch": 0.14550578072739723, "grad_norm": 0.12123990058898926, "learning_rate": 0.0026076937323528085, "loss": 1.5846, "step": 38100 }, { "epoch": 0.14563746016696952, "grad_norm": 0.11360788345336914, "learning_rate": 0.0026072666771893545, "loss": 1.586, "step": 38120 }, { "epoch": 0.14576913960654184, "grad_norm": 0.10187938064336777, "learning_rate": 0.0026068394247211126, "loss": 1.5779, "step": 38140 }, { "epoch": 0.14590081904611413, "grad_norm": 0.1109524741768837, "learning_rate": 0.002606411975024215, "loss": 1.582, "step": 38160 }, { "epoch": 0.14603249848568645, "grad_norm": 0.13011963665485382, "learning_rate": 0.0026059843281748298, "loss": 1.5822, "step": 38180 }, { "epoch": 0.14616417792525874, "grad_norm": 0.14091023802757263, "learning_rate": 0.0026055564842491596, "loss": 1.5789, "step": 38200 }, { "epoch": 0.14629585736483106, "grad_norm": 0.11127016693353653, "learning_rate": 0.002605128443323442, "loss": 1.5769, "step": 38220 }, { "epoch": 0.14642753680440337, "grad_norm": 0.11978462338447571, "learning_rate": 0.002604700205473951, "loss": 1.5744, "step": 38240 }, { "epoch": 0.14655921624397567, "grad_norm": 0.09419921040534973, "learning_rate": 0.002604271770776993, "loss": 1.5677, "step": 38260 }, { "epoch": 0.14669089568354798, "grad_norm": 0.10313443094491959, "learning_rate": 0.0026038431393089127, "loss": 1.5681, "step": 38280 }, { "epoch": 0.14682257512312027, "grad_norm": 0.12435714900493622, "learning_rate": 0.0026034143111460877, "loss": 1.5635, "step": 38300 }, { "epoch": 0.1469542545626926, "grad_norm": 0.09440986067056656, "learning_rate": 0.002602985286364931, "loss": 1.5695, "step": 38320 }, { "epoch": 0.14708593400226488, "grad_norm": 0.12459173798561096, "learning_rate": 0.0026025560650418914, "loss": 1.5649, "step": 38340 }, { "epoch": 0.1472176134418372, "grad_norm": 0.1102808341383934, "learning_rate": 0.0026021266472534515, "loss": 1.5629, "step": 38360 }, { "epoch": 0.1473492928814095, "grad_norm": 0.10280980169773102, "learning_rate": 0.00260169703307613, "loss": 1.5676, "step": 38380 }, { "epoch": 0.1474809723209818, "grad_norm": 0.1017128974199295, "learning_rate": 0.0026012672225864805, "loss": 1.5665, "step": 38400 }, { "epoch": 0.1476126517605541, "grad_norm": 0.11201263964176178, "learning_rate": 0.002600837215861091, "loss": 1.5607, "step": 38420 }, { "epoch": 0.14774433120012642, "grad_norm": 0.09382157772779465, "learning_rate": 0.0026004070129765845, "loss": 1.5699, "step": 38440 }, { "epoch": 0.1478760106396987, "grad_norm": 0.09265664219856262, "learning_rate": 0.00259997661400962, "loss": 1.5608, "step": 38460 }, { "epoch": 0.14800769007927103, "grad_norm": 0.13978609442710876, "learning_rate": 0.00259954601903689, "loss": 1.5632, "step": 38480 }, { "epoch": 0.14813936951884332, "grad_norm": 0.09976094961166382, "learning_rate": 0.0025991152281351223, "loss": 1.5662, "step": 38500 }, { "epoch": 0.14827104895841564, "grad_norm": 0.13578425347805023, "learning_rate": 0.002598684241381081, "loss": 1.5691, "step": 38520 }, { "epoch": 0.14840272839798793, "grad_norm": 0.09976605325937271, "learning_rate": 0.002598253058851563, "loss": 1.5962, "step": 38540 }, { "epoch": 0.14853440783756025, "grad_norm": 0.10971450805664062, "learning_rate": 0.0025978216806234015, "loss": 1.592, "step": 38560 }, { "epoch": 0.14866608727713254, "grad_norm": 0.11708176881074905, "learning_rate": 0.0025973901067734644, "loss": 1.5908, "step": 38580 }, { "epoch": 0.14879776671670486, "grad_norm": 0.08862312138080597, "learning_rate": 0.0025969583373786536, "loss": 1.5871, "step": 38600 }, { "epoch": 0.14892944615627715, "grad_norm": 0.12013594061136246, "learning_rate": 0.0025965263725159066, "loss": 1.5808, "step": 38620 }, { "epoch": 0.14906112559584947, "grad_norm": 0.093787781894207, "learning_rate": 0.0025960942122621963, "loss": 1.5854, "step": 38640 }, { "epoch": 0.14919280503542176, "grad_norm": 0.08362217992544174, "learning_rate": 0.0025956618566945287, "loss": 1.5826, "step": 38660 }, { "epoch": 0.14932448447499408, "grad_norm": 0.1498386114835739, "learning_rate": 0.002595229305889946, "loss": 1.5732, "step": 38680 }, { "epoch": 0.14945616391456637, "grad_norm": 0.09603530913591385, "learning_rate": 0.0025947965599255247, "loss": 1.5698, "step": 38700 }, { "epoch": 0.1495878433541387, "grad_norm": 0.0774497240781784, "learning_rate": 0.0025943636188783766, "loss": 1.5715, "step": 38720 }, { "epoch": 0.14971952279371098, "grad_norm": 0.08751595765352249, "learning_rate": 0.002593930482825647, "loss": 1.576, "step": 38740 }, { "epoch": 0.1498512022332833, "grad_norm": 0.0924377366900444, "learning_rate": 0.002593497151844518, "loss": 1.5715, "step": 38760 }, { "epoch": 0.1499828816728556, "grad_norm": 0.10947736352682114, "learning_rate": 0.0025930636260122044, "loss": 1.5582, "step": 38780 }, { "epoch": 0.1501145611124279, "grad_norm": 0.09718424081802368, "learning_rate": 0.0025926299054059567, "loss": 1.5644, "step": 38800 }, { "epoch": 0.1502462405520002, "grad_norm": 0.1110563725233078, "learning_rate": 0.0025921959901030597, "loss": 1.5656, "step": 38820 }, { "epoch": 0.15037791999157252, "grad_norm": 0.09171340614557266, "learning_rate": 0.0025917618801808333, "loss": 1.5597, "step": 38840 }, { "epoch": 0.1505095994311448, "grad_norm": 0.12216000258922577, "learning_rate": 0.0025913275757166324, "loss": 1.5548, "step": 38860 }, { "epoch": 0.15064127887071713, "grad_norm": 0.08841335028409958, "learning_rate": 0.002590893076787845, "loss": 1.5601, "step": 38880 }, { "epoch": 0.15077295831028942, "grad_norm": 0.10563861578702927, "learning_rate": 0.002590458383471896, "loss": 1.5535, "step": 38900 }, { "epoch": 0.15090463774986174, "grad_norm": 0.08755604177713394, "learning_rate": 0.0025900234958462433, "loss": 1.5501, "step": 38920 }, { "epoch": 0.15103631718943406, "grad_norm": 0.13694095611572266, "learning_rate": 0.0025895884139883795, "loss": 1.5627, "step": 38940 }, { "epoch": 0.15116799662900635, "grad_norm": 0.10837943106889725, "learning_rate": 0.002589153137975833, "loss": 1.5613, "step": 38960 }, { "epoch": 0.15129967606857866, "grad_norm": 0.08162432163953781, "learning_rate": 0.0025887176678861647, "loss": 1.5607, "step": 38980 }, { "epoch": 0.15143135550815096, "grad_norm": 0.14715518057346344, "learning_rate": 0.002588282003796973, "loss": 1.5544, "step": 39000 }, { "epoch": 0.15143135550815096, "eval_loss": 1.427059292793274, "eval_runtime": 66.7992, "eval_samples_per_second": 14.97, "eval_steps_per_second": 14.97, "step": 39000 }, { "epoch": 0.15156303494772327, "grad_norm": 0.10396742075681686, "learning_rate": 0.002587846145785888, "loss": 1.5584, "step": 39020 }, { "epoch": 0.15169471438729557, "grad_norm": 0.12578904628753662, "learning_rate": 0.002587410093930576, "loss": 1.5543, "step": 39040 }, { "epoch": 0.15182639382686788, "grad_norm": 0.12245041877031326, "learning_rate": 0.0025869738483087386, "loss": 1.5484, "step": 39060 }, { "epoch": 0.15195807326644017, "grad_norm": 0.10764380544424057, "learning_rate": 0.0025865374089981087, "loss": 1.5526, "step": 39080 }, { "epoch": 0.1520897527060125, "grad_norm": 0.10245970636606216, "learning_rate": 0.002586100776076457, "loss": 1.5609, "step": 39100 }, { "epoch": 0.15222143214558478, "grad_norm": 0.11582383513450623, "learning_rate": 0.0025856639496215873, "loss": 1.5789, "step": 39120 }, { "epoch": 0.1523531115851571, "grad_norm": 0.09922783076763153, "learning_rate": 0.0025852269297113382, "loss": 1.6029, "step": 39140 }, { "epoch": 0.1524847910247294, "grad_norm": 0.08174051344394684, "learning_rate": 0.002584789716423583, "loss": 1.5928, "step": 39160 }, { "epoch": 0.1526164704643017, "grad_norm": 0.14259853959083557, "learning_rate": 0.0025843523098362277, "loss": 1.6008, "step": 39180 }, { "epoch": 0.152748149903874, "grad_norm": 0.10020045936107635, "learning_rate": 0.0025839147100272155, "loss": 1.6035, "step": 39200 }, { "epoch": 0.15287982934344632, "grad_norm": 0.1230427622795105, "learning_rate": 0.002583476917074522, "loss": 1.6032, "step": 39220 }, { "epoch": 0.1530115087830186, "grad_norm": 0.0876646339893341, "learning_rate": 0.002583038931056159, "loss": 1.5921, "step": 39240 }, { "epoch": 0.15314318822259093, "grad_norm": 0.14442962408065796, "learning_rate": 0.0025826007520501704, "loss": 1.5894, "step": 39260 }, { "epoch": 0.15327486766216322, "grad_norm": 0.130369171500206, "learning_rate": 0.0025821623801346354, "loss": 1.5833, "step": 39280 }, { "epoch": 0.15340654710173554, "grad_norm": 0.09191744774580002, "learning_rate": 0.002581723815387669, "loss": 1.5819, "step": 39300 }, { "epoch": 0.15353822654130783, "grad_norm": 0.12108132243156433, "learning_rate": 0.002581285057887419, "loss": 1.5859, "step": 39320 }, { "epoch": 0.15366990598088015, "grad_norm": 0.09722419083118439, "learning_rate": 0.002580846107712068, "loss": 1.5811, "step": 39340 }, { "epoch": 0.15380158542045244, "grad_norm": 0.0996871218085289, "learning_rate": 0.0025804069649398324, "loss": 1.5806, "step": 39360 }, { "epoch": 0.15393326486002476, "grad_norm": 0.1356852501630783, "learning_rate": 0.002579967629648964, "loss": 1.5764, "step": 39380 }, { "epoch": 0.15406494429959705, "grad_norm": 0.0935957059264183, "learning_rate": 0.0025795281019177483, "loss": 1.5694, "step": 39400 }, { "epoch": 0.15419662373916937, "grad_norm": 0.10903099179267883, "learning_rate": 0.002579088381824505, "loss": 1.5665, "step": 39420 }, { "epoch": 0.15432830317874166, "grad_norm": 0.10038184374570847, "learning_rate": 0.0025786484694475882, "loss": 1.5714, "step": 39440 }, { "epoch": 0.15445998261831398, "grad_norm": 0.08461392670869827, "learning_rate": 0.002578208364865386, "loss": 1.5699, "step": 39460 }, { "epoch": 0.15459166205788627, "grad_norm": 0.09134264290332794, "learning_rate": 0.0025777680681563215, "loss": 1.5695, "step": 39480 }, { "epoch": 0.1547233414974586, "grad_norm": 0.11467129737138748, "learning_rate": 0.002577327579398851, "loss": 1.5743, "step": 39500 }, { "epoch": 0.15485502093703088, "grad_norm": 0.09146096557378769, "learning_rate": 0.002576886898671466, "loss": 1.5711, "step": 39520 }, { "epoch": 0.1549867003766032, "grad_norm": 0.08838360756635666, "learning_rate": 0.0025764460260526917, "loss": 1.5699, "step": 39540 }, { "epoch": 0.1551183798161755, "grad_norm": 0.09347314387559891, "learning_rate": 0.0025760049616210872, "loss": 1.568, "step": 39560 }, { "epoch": 0.1552500592557478, "grad_norm": 0.11676613986492157, "learning_rate": 0.002575563705455247, "loss": 1.5667, "step": 39580 }, { "epoch": 0.15538173869532013, "grad_norm": 0.11522109806537628, "learning_rate": 0.002575122257633798, "loss": 1.5708, "step": 39600 }, { "epoch": 0.15551341813489242, "grad_norm": 0.09783374518156052, "learning_rate": 0.0025746806182354023, "loss": 1.5925, "step": 39620 }, { "epoch": 0.15564509757446474, "grad_norm": 0.0943576991558075, "learning_rate": 0.0025742387873387567, "loss": 1.5825, "step": 39640 }, { "epoch": 0.15577677701403703, "grad_norm": 0.09120535105466843, "learning_rate": 0.0025737967650225906, "loss": 1.5754, "step": 39660 }, { "epoch": 0.15590845645360935, "grad_norm": 0.11549575626850128, "learning_rate": 0.0025733545513656683, "loss": 1.5741, "step": 39680 }, { "epoch": 0.15604013589318164, "grad_norm": 0.08214199542999268, "learning_rate": 0.0025729121464467897, "loss": 1.5684, "step": 39700 }, { "epoch": 0.15617181533275395, "grad_norm": 0.09407494962215424, "learning_rate": 0.0025724695503447853, "loss": 1.5623, "step": 39720 }, { "epoch": 0.15630349477232625, "grad_norm": 0.10400024056434631, "learning_rate": 0.0025720267631385227, "loss": 1.5565, "step": 39740 }, { "epoch": 0.15643517421189856, "grad_norm": 0.09701120853424072, "learning_rate": 0.002571583784906902, "loss": 1.5475, "step": 39760 }, { "epoch": 0.15656685365147086, "grad_norm": 0.09145724773406982, "learning_rate": 0.0025711406157288594, "loss": 1.5366, "step": 39780 }, { "epoch": 0.15669853309104317, "grad_norm": 0.10197409987449646, "learning_rate": 0.0025706972556833615, "loss": 1.5368, "step": 39800 }, { "epoch": 0.15683021253061546, "grad_norm": 0.10949882119894028, "learning_rate": 0.0025702537048494126, "loss": 1.5324, "step": 39820 }, { "epoch": 0.15696189197018778, "grad_norm": 0.08680877834558487, "learning_rate": 0.0025698099633060484, "loss": 1.5246, "step": 39840 }, { "epoch": 0.15709357140976007, "grad_norm": 0.09298034757375717, "learning_rate": 0.0025693660311323398, "loss": 1.5244, "step": 39860 }, { "epoch": 0.1572252508493324, "grad_norm": 0.08509939163923264, "learning_rate": 0.002568921908407392, "loss": 1.5269, "step": 39880 }, { "epoch": 0.15735693028890468, "grad_norm": 0.13192257285118103, "learning_rate": 0.002568477595210343, "loss": 1.5189, "step": 39900 }, { "epoch": 0.157488609728477, "grad_norm": 0.09820321202278137, "learning_rate": 0.0025680330916203653, "loss": 1.5172, "step": 39920 }, { "epoch": 0.1576202891680493, "grad_norm": 0.12466151267290115, "learning_rate": 0.0025675883977166656, "loss": 1.5168, "step": 39940 }, { "epoch": 0.1577519686076216, "grad_norm": 0.1055043414235115, "learning_rate": 0.002567143513578485, "loss": 1.5127, "step": 39960 }, { "epoch": 0.1578836480471939, "grad_norm": 0.0885360836982727, "learning_rate": 0.0025666984392850966, "loss": 1.5102, "step": 39980 }, { "epoch": 0.15801532748676622, "grad_norm": 0.09092732518911362, "learning_rate": 0.0025662531749158085, "loss": 1.5128, "step": 40000 }, { "epoch": 0.15801532748676622, "eval_loss": 1.5180437564849854, "eval_runtime": 66.3341, "eval_samples_per_second": 15.075, "eval_steps_per_second": 15.075, "step": 40000 }, { "epoch": 0.1581470069263385, "grad_norm": 0.11039165407419205, "learning_rate": 0.002565807720549964, "loss": 1.5056, "step": 40020 }, { "epoch": 0.15827868636591083, "grad_norm": 0.09053885191679001, "learning_rate": 0.002565362076266938, "loss": 1.5117, "step": 40040 }, { "epoch": 0.15841036580548312, "grad_norm": 0.10280958563089371, "learning_rate": 0.002564916242146141, "loss": 1.5026, "step": 40060 }, { "epoch": 0.15854204524505544, "grad_norm": 0.10042385011911392, "learning_rate": 0.0025644702182670153, "loss": 1.5079, "step": 40080 }, { "epoch": 0.15867372468462773, "grad_norm": 0.15328729152679443, "learning_rate": 0.0025640240047090394, "loss": 1.5084, "step": 40100 }, { "epoch": 0.15880540412420005, "grad_norm": 0.10443607717752457, "learning_rate": 0.002563577601551724, "loss": 1.5017, "step": 40120 }, { "epoch": 0.15893708356377234, "grad_norm": 0.1254567801952362, "learning_rate": 0.0025631310088746143, "loss": 1.5015, "step": 40140 }, { "epoch": 0.15906876300334466, "grad_norm": 0.11930776387453079, "learning_rate": 0.002562684226757289, "loss": 1.508, "step": 40160 }, { "epoch": 0.15920044244291695, "grad_norm": 0.08289260417222977, "learning_rate": 0.0025622372552793603, "loss": 1.5091, "step": 40180 }, { "epoch": 0.15933212188248927, "grad_norm": 0.10695404559373856, "learning_rate": 0.0025617900945204743, "loss": 1.5045, "step": 40200 }, { "epoch": 0.15946380132206156, "grad_norm": 0.11500686407089233, "learning_rate": 0.0025613427445603117, "loss": 1.5029, "step": 40220 }, { "epoch": 0.15959548076163388, "grad_norm": 0.09452733397483826, "learning_rate": 0.0025608952054785856, "loss": 1.5029, "step": 40240 }, { "epoch": 0.1597271602012062, "grad_norm": 0.10225624591112137, "learning_rate": 0.002560447477355043, "loss": 1.5061, "step": 40260 }, { "epoch": 0.1598588396407785, "grad_norm": 0.10620761662721634, "learning_rate": 0.002559999560269466, "loss": 1.5015, "step": 40280 }, { "epoch": 0.1599905190803508, "grad_norm": 0.11584058403968811, "learning_rate": 0.002559551454301669, "loss": 1.5255, "step": 40300 }, { "epoch": 0.1601221985199231, "grad_norm": 0.12006339430809021, "learning_rate": 0.0025591031595314996, "loss": 1.5512, "step": 40320 }, { "epoch": 0.16025387795949542, "grad_norm": 0.10483147948980331, "learning_rate": 0.0025586546760388413, "loss": 1.5584, "step": 40340 }, { "epoch": 0.1603855573990677, "grad_norm": 0.12490592896938324, "learning_rate": 0.002558206003903608, "loss": 1.5647, "step": 40360 }, { "epoch": 0.16051723683864003, "grad_norm": 0.09851817041635513, "learning_rate": 0.0025577571432057497, "loss": 1.558, "step": 40380 }, { "epoch": 0.16064891627821232, "grad_norm": 0.10723355412483215, "learning_rate": 0.0025573080940252497, "loss": 1.5505, "step": 40400 }, { "epoch": 0.16078059571778464, "grad_norm": 0.08668304234743118, "learning_rate": 0.002556858856442124, "loss": 1.5473, "step": 40420 }, { "epoch": 0.16091227515735693, "grad_norm": 0.13923218846321106, "learning_rate": 0.002556409430536423, "loss": 1.5451, "step": 40440 }, { "epoch": 0.16104395459692925, "grad_norm": 0.11584249883890152, "learning_rate": 0.00255595981638823, "loss": 1.5435, "step": 40460 }, { "epoch": 0.16117563403650154, "grad_norm": 0.09080822020769119, "learning_rate": 0.0025555100140776618, "loss": 1.5435, "step": 40480 }, { "epoch": 0.16130731347607385, "grad_norm": 0.0972919836640358, "learning_rate": 0.0025550600236848697, "loss": 1.5367, "step": 40500 }, { "epoch": 0.16143899291564615, "grad_norm": 0.10431429743766785, "learning_rate": 0.0025546098452900374, "loss": 1.5362, "step": 40520 }, { "epoch": 0.16157067235521846, "grad_norm": 0.1297275573015213, "learning_rate": 0.002554159478973383, "loss": 1.5287, "step": 40540 }, { "epoch": 0.16170235179479076, "grad_norm": 0.08693351596593857, "learning_rate": 0.002553708924815157, "loss": 1.5322, "step": 40560 }, { "epoch": 0.16183403123436307, "grad_norm": 0.10223674029111862, "learning_rate": 0.002553258182895645, "loss": 1.5283, "step": 40580 }, { "epoch": 0.16196571067393536, "grad_norm": 0.13661502301692963, "learning_rate": 0.0025528072532951646, "loss": 1.5335, "step": 40600 }, { "epoch": 0.16209739011350768, "grad_norm": 0.0959714725613594, "learning_rate": 0.0025523561360940666, "loss": 1.5409, "step": 40620 }, { "epoch": 0.16222906955307997, "grad_norm": 0.11499602347612381, "learning_rate": 0.0025519048313727365, "loss": 1.534, "step": 40640 }, { "epoch": 0.1623607489926523, "grad_norm": 0.10685988515615463, "learning_rate": 0.0025514533392115932, "loss": 1.5268, "step": 40660 }, { "epoch": 0.16249242843222458, "grad_norm": 0.12656660377979279, "learning_rate": 0.002551001659691088, "loss": 1.5253, "step": 40680 }, { "epoch": 0.1626241078717969, "grad_norm": 0.11715365201234818, "learning_rate": 0.002550549792891706, "loss": 1.5259, "step": 40700 }, { "epoch": 0.1627557873113692, "grad_norm": 0.1329299360513687, "learning_rate": 0.0025500977388939667, "loss": 1.525, "step": 40720 }, { "epoch": 0.1628874667509415, "grad_norm": 0.0944843739271164, "learning_rate": 0.00254964549777842, "loss": 1.5223, "step": 40740 }, { "epoch": 0.1630191461905138, "grad_norm": 0.09008379280567169, "learning_rate": 0.002549193069625653, "loss": 1.5215, "step": 40760 }, { "epoch": 0.16315082563008612, "grad_norm": 0.1306624561548233, "learning_rate": 0.0025487404545162825, "loss": 1.5174, "step": 40780 }, { "epoch": 0.1632825050696584, "grad_norm": 0.08844735473394394, "learning_rate": 0.0025482876525309618, "loss": 1.5239, "step": 40800 }, { "epoch": 0.16341418450923073, "grad_norm": 0.09808750450611115, "learning_rate": 0.0025478346637503764, "loss": 1.5219, "step": 40820 }, { "epoch": 0.16354586394880302, "grad_norm": 0.10559525340795517, "learning_rate": 0.002547381488255243, "loss": 1.5201, "step": 40840 }, { "epoch": 0.16367754338837534, "grad_norm": 0.09977331012487411, "learning_rate": 0.0025469281261263155, "loss": 1.5204, "step": 40860 }, { "epoch": 0.16380922282794763, "grad_norm": 0.11581449955701828, "learning_rate": 0.0025464745774443766, "loss": 1.5199, "step": 40880 }, { "epoch": 0.16394090226751995, "grad_norm": 0.10969722270965576, "learning_rate": 0.0025460208422902458, "loss": 1.5318, "step": 40900 }, { "epoch": 0.16407258170709224, "grad_norm": 0.12273216247558594, "learning_rate": 0.0025455669207447747, "loss": 1.5515, "step": 40920 }, { "epoch": 0.16420426114666456, "grad_norm": 0.09553756564855576, "learning_rate": 0.0025451128128888474, "loss": 1.5507, "step": 40940 }, { "epoch": 0.16433594058623688, "grad_norm": 0.1060953214764595, "learning_rate": 0.002544658518803382, "loss": 1.5528, "step": 40960 }, { "epoch": 0.16446762002580917, "grad_norm": 0.12041070312261581, "learning_rate": 0.00254420403856933, "loss": 1.5417, "step": 40980 }, { "epoch": 0.1645992994653815, "grad_norm": 0.09940062463283539, "learning_rate": 0.0025437493722676747, "loss": 1.5393, "step": 41000 }, { "epoch": 0.1645992994653815, "eval_loss": 1.5645551681518555, "eval_runtime": 67.891, "eval_samples_per_second": 14.729, "eval_steps_per_second": 14.729, "step": 41000 }, { "epoch": 0.16473097890495378, "grad_norm": 0.09117773175239563, "learning_rate": 0.0025432945199794343, "loss": 1.5385, "step": 41020 }, { "epoch": 0.1648626583445261, "grad_norm": 0.10133585333824158, "learning_rate": 0.0025428394817856585, "loss": 1.5357, "step": 41040 }, { "epoch": 0.1649943377840984, "grad_norm": 0.09552034735679626, "learning_rate": 0.0025423842577674315, "loss": 1.5355, "step": 41060 }, { "epoch": 0.1651260172236707, "grad_norm": 0.11098198592662811, "learning_rate": 0.00254192884800587, "loss": 1.5294, "step": 41080 }, { "epoch": 0.165257696663243, "grad_norm": 0.11762163043022156, "learning_rate": 0.0025414732525821243, "loss": 1.5263, "step": 41100 }, { "epoch": 0.16538937610281532, "grad_norm": 0.10004954785108566, "learning_rate": 0.0025410174715773766, "loss": 1.5232, "step": 41120 }, { "epoch": 0.1655210555423876, "grad_norm": 0.10917594283819199, "learning_rate": 0.0025405615050728427, "loss": 1.5209, "step": 41140 }, { "epoch": 0.16565273498195993, "grad_norm": 0.09700624644756317, "learning_rate": 0.002540105353149773, "loss": 1.5246, "step": 41160 }, { "epoch": 0.16578441442153222, "grad_norm": 0.1017017513513565, "learning_rate": 0.002539649015889448, "loss": 1.5235, "step": 41180 }, { "epoch": 0.16591609386110454, "grad_norm": 0.09013497084379196, "learning_rate": 0.002539192493373184, "loss": 1.5123, "step": 41200 }, { "epoch": 0.16604777330067683, "grad_norm": 0.117029570043087, "learning_rate": 0.0025387357856823277, "loss": 1.5192, "step": 41220 }, { "epoch": 0.16617945274024915, "grad_norm": 0.11237141489982605, "learning_rate": 0.002538278892898262, "loss": 1.5113, "step": 41240 }, { "epoch": 0.16631113217982144, "grad_norm": 0.09884624928236008, "learning_rate": 0.0025378218151024, "loss": 1.5188, "step": 41260 }, { "epoch": 0.16644281161939375, "grad_norm": 0.11448849737644196, "learning_rate": 0.002537364552376189, "loss": 1.5255, "step": 41280 }, { "epoch": 0.16657449105896605, "grad_norm": 0.12878195941448212, "learning_rate": 0.0025369071048011093, "loss": 1.5255, "step": 41300 }, { "epoch": 0.16670617049853836, "grad_norm": 0.12284272909164429, "learning_rate": 0.0025364494724586734, "loss": 1.5184, "step": 41320 }, { "epoch": 0.16683784993811066, "grad_norm": 0.0931035578250885, "learning_rate": 0.0025359916554304274, "loss": 1.5149, "step": 41340 }, { "epoch": 0.16696952937768297, "grad_norm": 0.09691374748945236, "learning_rate": 0.0025355336537979498, "loss": 1.5157, "step": 41360 }, { "epoch": 0.16710120881725526, "grad_norm": 0.09920854866504669, "learning_rate": 0.0025350754676428527, "loss": 1.5215, "step": 41380 }, { "epoch": 0.16723288825682758, "grad_norm": 0.13028231263160706, "learning_rate": 0.0025346170970467806, "loss": 1.5156, "step": 41400 }, { "epoch": 0.16736456769639987, "grad_norm": 0.09974183887243271, "learning_rate": 0.002534158542091411, "loss": 1.5231, "step": 41420 }, { "epoch": 0.1674962471359722, "grad_norm": 0.09403842687606812, "learning_rate": 0.0025336998028584546, "loss": 1.5189, "step": 41440 }, { "epoch": 0.16762792657554448, "grad_norm": 0.10986328125, "learning_rate": 0.0025332408794296528, "loss": 1.5196, "step": 41460 }, { "epoch": 0.1677596060151168, "grad_norm": 0.11757822334766388, "learning_rate": 0.0025327817718867837, "loss": 1.5365, "step": 41480 }, { "epoch": 0.1678912854546891, "grad_norm": 0.11819227039813995, "learning_rate": 0.002532322480311655, "loss": 1.5616, "step": 41500 }, { "epoch": 0.1680229648942614, "grad_norm": 0.12360888719558716, "learning_rate": 0.0025318630047861082, "loss": 1.5725, "step": 41520 }, { "epoch": 0.1681546443338337, "grad_norm": 0.09366869181394577, "learning_rate": 0.0025314033453920186, "loss": 1.5816, "step": 41540 }, { "epoch": 0.16828632377340602, "grad_norm": 0.09530407935380936, "learning_rate": 0.0025309435022112916, "loss": 1.5805, "step": 41560 }, { "epoch": 0.1684180032129783, "grad_norm": 0.12878450751304626, "learning_rate": 0.0025304834753258685, "loss": 1.5807, "step": 41580 }, { "epoch": 0.16854968265255063, "grad_norm": 0.1358455866575241, "learning_rate": 0.0025300232648177213, "loss": 1.5794, "step": 41600 }, { "epoch": 0.16868136209212295, "grad_norm": 0.12388956546783447, "learning_rate": 0.002529562870768855, "loss": 1.5766, "step": 41620 }, { "epoch": 0.16881304153169524, "grad_norm": 0.10921106487512589, "learning_rate": 0.002529102293261308, "loss": 1.5705, "step": 41640 }, { "epoch": 0.16894472097126756, "grad_norm": 0.1032082810997963, "learning_rate": 0.0025286415323771514, "loss": 1.5692, "step": 41660 }, { "epoch": 0.16907640041083985, "grad_norm": 0.10300302505493164, "learning_rate": 0.0025281805881984887, "loss": 1.567, "step": 41680 }, { "epoch": 0.16920807985041217, "grad_norm": 0.10055007040500641, "learning_rate": 0.002527719460807454, "loss": 1.566, "step": 41700 }, { "epoch": 0.16933975928998446, "grad_norm": 0.12738655507564545, "learning_rate": 0.0025272581502862185, "loss": 1.561, "step": 41720 }, { "epoch": 0.16947143872955678, "grad_norm": 0.10861164331436157, "learning_rate": 0.0025267966567169816, "loss": 1.567, "step": 41740 }, { "epoch": 0.16960311816912907, "grad_norm": 0.12459450215101242, "learning_rate": 0.0025263349801819784, "loss": 1.5651, "step": 41760 }, { "epoch": 0.1697347976087014, "grad_norm": 0.09590265899896622, "learning_rate": 0.0025258731207634753, "loss": 1.5661, "step": 41780 }, { "epoch": 0.16986647704827368, "grad_norm": 0.11365272849798203, "learning_rate": 0.002525411078543771, "loss": 1.5619, "step": 41800 }, { "epoch": 0.169998156487846, "grad_norm": 0.08910445868968964, "learning_rate": 0.0025249488536051965, "loss": 1.5585, "step": 41820 }, { "epoch": 0.1701298359274183, "grad_norm": 0.18229752779006958, "learning_rate": 0.0025244864460301176, "loss": 1.5526, "step": 41840 }, { "epoch": 0.1702615153669906, "grad_norm": 0.09740415215492249, "learning_rate": 0.0025240238559009307, "loss": 1.5529, "step": 41860 }, { "epoch": 0.1703931948065629, "grad_norm": 0.12560056149959564, "learning_rate": 0.0025235610833000644, "loss": 1.5509, "step": 41880 }, { "epoch": 0.17052487424613522, "grad_norm": 0.15917159616947174, "learning_rate": 0.002523098128309981, "loss": 1.5542, "step": 41900 }, { "epoch": 0.1706565536857075, "grad_norm": 0.13030411303043365, "learning_rate": 0.002522634991013175, "loss": 1.5513, "step": 41920 }, { "epoch": 0.17078823312527983, "grad_norm": 0.09367945790290833, "learning_rate": 0.0025221716714921728, "loss": 1.5559, "step": 41940 }, { "epoch": 0.17091991256485212, "grad_norm": 0.10787492990493774, "learning_rate": 0.0025217081698295342, "loss": 1.5554, "step": 41960 }, { "epoch": 0.17105159200442444, "grad_norm": 0.10562490671873093, "learning_rate": 0.0025212444861078503, "loss": 1.5504, "step": 41980 }, { "epoch": 0.17118327144399673, "grad_norm": 0.1048375815153122, "learning_rate": 0.0025207806204097464, "loss": 1.5566, "step": 42000 }, { "epoch": 0.17118327144399673, "eval_loss": 1.424837350845337, "eval_runtime": 66.5617, "eval_samples_per_second": 15.024, "eval_steps_per_second": 15.024, "step": 42000 }, { "epoch": 0.00013167943957230517, "grad_norm": 0.10541951656341553, "learning_rate": 0.0025203165728178776, "loss": 1.4444, "step": 42020 }, { "epoch": 0.00026335887914461035, "grad_norm": 0.12595529854297638, "learning_rate": 0.0025198523434149345, "loss": 1.435, "step": 42040 }, { "epoch": 0.00039503831871691555, "grad_norm": 0.1330813616514206, "learning_rate": 0.002519387932283637, "loss": 1.4314, "step": 42060 }, { "epoch": 0.0005267177582892207, "grad_norm": 0.10303393006324768, "learning_rate": 0.00251892333950674, "loss": 1.4189, "step": 42080 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.13066118955612183, "learning_rate": 0.00251845856516703, "loss": 1.4188, "step": 42100 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.09912826120853424, "learning_rate": 0.002517993609347324, "loss": 1.4279, "step": 42120 }, { "epoch": 0.0009217560770061363, "grad_norm": 0.16035521030426025, "learning_rate": 0.0025175284721304747, "loss": 1.4217, "step": 42140 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.09864924103021622, "learning_rate": 0.002517063153599363, "loss": 1.4261, "step": 42160 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.09063073992729187, "learning_rate": 0.002516597653836907, "loss": 1.4148, "step": 42180 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.10235504806041718, "learning_rate": 0.0025161319729260527, "loss": 1.4225, "step": 42200 }, { "epoch": 0.001448473835295357, "grad_norm": 0.10286398977041245, "learning_rate": 0.002515666110949781, "loss": 1.4209, "step": 42220 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.11597388982772827, "learning_rate": 0.002515200067991104, "loss": 1.4143, "step": 42240 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.1071164458990097, "learning_rate": 0.0025147338441330663, "loss": 1.4171, "step": 42260 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.11942466348409653, "learning_rate": 0.0025142674394587447, "loss": 1.4249, "step": 42280 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.11480249464511871, "learning_rate": 0.002513800854051248, "loss": 1.4203, "step": 42300 }, { "epoch": 0.002106871033156883, "grad_norm": 0.10616378486156464, "learning_rate": 0.002513334087993718, "loss": 1.423, "step": 42320 }, { "epoch": 0.002238550472729188, "grad_norm": 0.09758572280406952, "learning_rate": 0.0025128671413693275, "loss": 1.4221, "step": 42340 }, { "epoch": 0.002370229912301493, "grad_norm": 0.16627156734466553, "learning_rate": 0.002512400014261283, "loss": 1.4268, "step": 42360 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.11762084066867828, "learning_rate": 0.0025119327067528213, "loss": 1.436, "step": 42380 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.11083631217479706, "learning_rate": 0.0025114652189272128, "loss": 1.4393, "step": 42400 }, { "epoch": 0.002765268231018409, "grad_norm": 0.521308183670044, "learning_rate": 0.0025109975508677594, "loss": 1.4376, "step": 42420 }, { "epoch": 0.002896947670590714, "grad_norm": 0.11644919961690903, "learning_rate": 0.0025105297026577953, "loss": 1.4641, "step": 42440 }, { "epoch": 0.003028627110163019, "grad_norm": 0.09482905268669128, "learning_rate": 0.002510061674380687, "loss": 1.4611, "step": 42460 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.14098559319972992, "learning_rate": 0.0025095934661198333, "loss": 1.4756, "step": 42480 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.10550355911254883, "learning_rate": 0.002509125077958663, "loss": 1.5066, "step": 42500 }, { "epoch": 0.003423665428879935, "grad_norm": 0.10194244980812073, "learning_rate": 0.00250865650998064, "loss": 1.5265, "step": 42520 }, { "epoch": 0.00355534486845224, "grad_norm": 0.12069813162088394, "learning_rate": 0.0025081877622692584, "loss": 1.5486, "step": 42540 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.09516333788633347, "learning_rate": 0.002507718834908045, "loss": 1.5594, "step": 42560 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.11514731496572495, "learning_rate": 0.002507249727980558, "loss": 1.5632, "step": 42580 }, { "epoch": 0.003950383187169155, "grad_norm": 0.10155905038118362, "learning_rate": 0.002506780441570388, "loss": 1.5779, "step": 42600 }, { "epoch": 0.004082062626741461, "grad_norm": 0.09767820686101913, "learning_rate": 0.002506310975761158, "loss": 1.5785, "step": 42620 }, { "epoch": 0.004213742066313766, "grad_norm": 0.09538809210062027, "learning_rate": 0.0025058413306365216, "loss": 1.5823, "step": 42640 }, { "epoch": 0.004345421505886071, "grad_norm": 0.09154420346021652, "learning_rate": 0.0025053715062801664, "loss": 1.5665, "step": 42660 }, { "epoch": 0.004477100945458376, "grad_norm": 0.1306425929069519, "learning_rate": 0.0025049015027758096, "loss": 1.5653, "step": 42680 }, { "epoch": 0.004608780385030682, "grad_norm": 0.12897877395153046, "learning_rate": 0.002504431320207203, "loss": 1.5562, "step": 42700 }, { "epoch": 0.004740459824602986, "grad_norm": 0.10444645583629608, "learning_rate": 0.002503960958658127, "loss": 1.5588, "step": 42720 }, { "epoch": 0.004872139264175292, "grad_norm": 0.11443938314914703, "learning_rate": 0.0025034904182123976, "loss": 1.5489, "step": 42740 }, { "epoch": 0.005003818703747597, "grad_norm": 0.11464277654886246, "learning_rate": 0.002503019698953859, "loss": 1.5547, "step": 42760 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.13487665355205536, "learning_rate": 0.0025025488009663907, "loss": 1.5458, "step": 42780 }, { "epoch": 0.005267177582892207, "grad_norm": 0.11822563409805298, "learning_rate": 0.002502077724333901, "loss": 1.5472, "step": 42800 }, { "epoch": 0.005398857022464512, "grad_norm": 0.08794966340065002, "learning_rate": 0.002501606469140333, "loss": 1.5441, "step": 42820 }, { "epoch": 0.005530536462036818, "grad_norm": 0.09283588081598282, "learning_rate": 0.0025011350354696583, "loss": 1.5405, "step": 42840 }, { "epoch": 0.005662215901609122, "grad_norm": 0.11356227099895477, "learning_rate": 0.0025006634234058835, "loss": 1.534, "step": 42860 }, { "epoch": 0.005793895341181428, "grad_norm": 0.10243146866559982, "learning_rate": 0.0025001916330330454, "loss": 1.5381, "step": 42880 }, { "epoch": 0.005925574780753733, "grad_norm": 0.13794657588005066, "learning_rate": 0.0024997196644352114, "loss": 1.5302, "step": 42900 }, { "epoch": 0.006057254220326038, "grad_norm": 0.11851724237203598, "learning_rate": 0.0024992475176964834, "loss": 1.5267, "step": 42920 }, { "epoch": 0.006188933659898343, "grad_norm": 0.1327144056558609, "learning_rate": 0.002498775192900993, "loss": 1.5292, "step": 42940 }, { "epoch": 0.006320613099470649, "grad_norm": 0.09289969503879547, "learning_rate": 0.0024983026901329044, "loss": 1.5283, "step": 42960 }, { "epoch": 0.006452292539042954, "grad_norm": 0.10237723588943481, "learning_rate": 0.002497830009476413, "loss": 1.5254, "step": 42980 }, { "epoch": 0.006583971978615259, "grad_norm": 0.10176314413547516, "learning_rate": 0.0024973571510157467, "loss": 1.5199, "step": 43000 }, { "epoch": 0.006583971978615259, "eval_loss": 1.4149765968322754, "eval_runtime": 65.3786, "eval_samples_per_second": 15.296, "eval_steps_per_second": 15.296, "step": 43000 }, { "epoch": 0.006715651418187564, "grad_norm": 0.09919629245996475, "learning_rate": 0.0024968841148351635, "loss": 1.5191, "step": 43020 }, { "epoch": 0.00684733085775987, "grad_norm": 0.10323656350374222, "learning_rate": 0.0024964109010189557, "loss": 1.5233, "step": 43040 }, { "epoch": 0.006979010297332174, "grad_norm": 0.1806810349225998, "learning_rate": 0.002495937509651444, "loss": 1.5246, "step": 43060 }, { "epoch": 0.00711068973690448, "grad_norm": 0.11572176963090897, "learning_rate": 0.0024954639408169836, "loss": 1.5231, "step": 43080 }, { "epoch": 0.007242369176476785, "grad_norm": 0.11550699919462204, "learning_rate": 0.0024949901945999593, "loss": 1.5218, "step": 43100 }, { "epoch": 0.0073740486160490904, "grad_norm": 0.10549616813659668, "learning_rate": 0.002494516271084789, "loss": 1.5182, "step": 43120 }, { "epoch": 0.007505728055621395, "grad_norm": 0.09112010896205902, "learning_rate": 0.0024940421703559218, "loss": 1.5215, "step": 43140 }, { "epoch": 0.007637407495193701, "grad_norm": 0.10110776126384735, "learning_rate": 0.002493567892497837, "loss": 1.5225, "step": 43160 }, { "epoch": 0.007769086934766006, "grad_norm": 0.12719328701496124, "learning_rate": 0.002493093437595047, "loss": 1.5472, "step": 43180 }, { "epoch": 0.00790076637433831, "grad_norm": 0.13183355331420898, "learning_rate": 0.002492618805732096, "loss": 1.5569, "step": 43200 }, { "epoch": 0.008032445813910615, "grad_norm": 0.1020386666059494, "learning_rate": 0.0024921439969935585, "loss": 1.561, "step": 43220 }, { "epoch": 0.008164125253482922, "grad_norm": 0.14664006233215332, "learning_rate": 0.002491669011464041, "loss": 1.5541, "step": 43240 }, { "epoch": 0.008295804693055226, "grad_norm": 0.09918078035116196, "learning_rate": 0.0024911938492281813, "loss": 1.5547, "step": 43260 }, { "epoch": 0.008427484132627531, "grad_norm": 0.10724213719367981, "learning_rate": 0.0024907185103706497, "loss": 1.5512, "step": 43280 }, { "epoch": 0.008559163572199836, "grad_norm": 0.0950016900897026, "learning_rate": 0.0024902429949761468, "loss": 1.5441, "step": 43300 }, { "epoch": 0.008690843011772142, "grad_norm": 0.10287702083587646, "learning_rate": 0.002489767303129405, "loss": 1.5428, "step": 43320 }, { "epoch": 0.008822522451344447, "grad_norm": 0.09938202053308487, "learning_rate": 0.0024892914349151887, "loss": 1.5466, "step": 43340 }, { "epoch": 0.008954201890916752, "grad_norm": 0.09565220773220062, "learning_rate": 0.002488815390418293, "loss": 1.5379, "step": 43360 }, { "epoch": 0.009085881330489057, "grad_norm": 0.13361500203609467, "learning_rate": 0.0024883391697235442, "loss": 1.5327, "step": 43380 }, { "epoch": 0.009217560770061363, "grad_norm": 0.09708066284656525, "learning_rate": 0.002487862772915802, "loss": 1.5391, "step": 43400 }, { "epoch": 0.009349240209633668, "grad_norm": 0.10566909611225128, "learning_rate": 0.0024873862000799538, "loss": 1.5424, "step": 43420 }, { "epoch": 0.009480919649205973, "grad_norm": 0.08183527737855911, "learning_rate": 0.002486909451300922, "loss": 1.5419, "step": 43440 }, { "epoch": 0.009612599088778278, "grad_norm": 0.09500976651906967, "learning_rate": 0.0024864325266636587, "loss": 1.5366, "step": 43460 }, { "epoch": 0.009744278528350584, "grad_norm": 0.11120256781578064, "learning_rate": 0.0024859554262531467, "loss": 1.5349, "step": 43480 }, { "epoch": 0.009875957967922889, "grad_norm": 0.13951987028121948, "learning_rate": 0.0024854781501544017, "loss": 1.5282, "step": 43500 }, { "epoch": 0.010007637407495194, "grad_norm": 0.10958447307348251, "learning_rate": 0.0024850006984524693, "loss": 1.5272, "step": 43520 }, { "epoch": 0.010139316847067498, "grad_norm": 0.09942590445280075, "learning_rate": 0.002484523071232428, "loss": 1.5326, "step": 43540 }, { "epoch": 0.010270996286639805, "grad_norm": 0.1157267838716507, "learning_rate": 0.002484045268579386, "loss": 1.5296, "step": 43560 }, { "epoch": 0.01040267572621211, "grad_norm": 0.1331472247838974, "learning_rate": 0.0024835672905784835, "loss": 1.5249, "step": 43580 }, { "epoch": 0.010534355165784414, "grad_norm": 0.13041837513446808, "learning_rate": 0.0024830891373148916, "loss": 1.5287, "step": 43600 }, { "epoch": 0.01066603460535672, "grad_norm": 0.13223400712013245, "learning_rate": 0.0024826108088738122, "loss": 1.5229, "step": 43620 }, { "epoch": 0.010797714044929024, "grad_norm": 0.11160468310117722, "learning_rate": 0.002482132305340481, "loss": 1.5257, "step": 43640 }, { "epoch": 0.01092939348450133, "grad_norm": 0.1368405967950821, "learning_rate": 0.002481653626800161, "loss": 1.5232, "step": 43660 }, { "epoch": 0.011061072924073635, "grad_norm": 0.11044129729270935, "learning_rate": 0.002481174773338149, "loss": 1.5258, "step": 43680 }, { "epoch": 0.01119275236364594, "grad_norm": 0.11385578662157059, "learning_rate": 0.002480695745039773, "loss": 1.5252, "step": 43700 }, { "epoch": 0.011324431803218245, "grad_norm": 0.13926897943019867, "learning_rate": 0.00248021654199039, "loss": 1.5145, "step": 43720 }, { "epoch": 0.011456111242790551, "grad_norm": 0.10542988032102585, "learning_rate": 0.002479737164275391, "loss": 1.518, "step": 43740 }, { "epoch": 0.011587790682362856, "grad_norm": 0.19769559800624847, "learning_rate": 0.002479257611980196, "loss": 1.5328, "step": 43760 }, { "epoch": 0.01171947012193516, "grad_norm": 0.14825715124607086, "learning_rate": 0.002478777885190257, "loss": 1.5437, "step": 43780 }, { "epoch": 0.011851149561507466, "grad_norm": 0.12765994668006897, "learning_rate": 0.002478297983991057, "loss": 1.5491, "step": 43800 }, { "epoch": 0.011982829001079772, "grad_norm": 0.12340036034584045, "learning_rate": 0.00247781790846811, "loss": 1.5623, "step": 43820 }, { "epoch": 0.012114508440652077, "grad_norm": 0.12714795768260956, "learning_rate": 0.002477337658706961, "loss": 1.5452, "step": 43840 }, { "epoch": 0.012246187880224382, "grad_norm": 0.10861831903457642, "learning_rate": 0.0024768572347931856, "loss": 1.5451, "step": 43860 }, { "epoch": 0.012377867319796686, "grad_norm": 0.09523173421621323, "learning_rate": 0.002476376636812392, "loss": 1.5425, "step": 43880 }, { "epoch": 0.012509546759368993, "grad_norm": 0.09822442382574081, "learning_rate": 0.002475895864850217, "loss": 1.545, "step": 43900 }, { "epoch": 0.012641226198941298, "grad_norm": 0.11365661770105362, "learning_rate": 0.0024754149189923315, "loss": 1.5376, "step": 43920 }, { "epoch": 0.012772905638513602, "grad_norm": 0.10581135004758835, "learning_rate": 0.002474933799324434, "loss": 1.5364, "step": 43940 }, { "epoch": 0.012904585078085907, "grad_norm": 0.11580084264278412, "learning_rate": 0.002474452505932257, "loss": 1.5321, "step": 43960 }, { "epoch": 0.013036264517658214, "grad_norm": 0.08592469990253448, "learning_rate": 0.0024739710389015614, "loss": 1.5331, "step": 43980 }, { "epoch": 0.013167943957230518, "grad_norm": 0.10360794514417648, "learning_rate": 0.0024734893983181408, "loss": 1.5342, "step": 44000 }, { "epoch": 0.013167943957230518, "eval_loss": 1.4869463443756104, "eval_runtime": 63.1265, "eval_samples_per_second": 15.841, "eval_steps_per_second": 15.841, "step": 44000 }, { "epoch": 0.013299623396802823, "grad_norm": 0.11372421681880951, "learning_rate": 0.002473007584267819, "loss": 1.5213, "step": 44020 }, { "epoch": 0.013431302836375128, "grad_norm": 0.1096460372209549, "learning_rate": 0.002472525596836451, "loss": 1.5294, "step": 44040 }, { "epoch": 0.013562982275947433, "grad_norm": 0.12670129537582397, "learning_rate": 0.0024720434361099226, "loss": 1.5169, "step": 44060 }, { "epoch": 0.01369466171551974, "grad_norm": 0.09985670447349548, "learning_rate": 0.00247156110217415, "loss": 1.513, "step": 44080 }, { "epoch": 0.013826341155092044, "grad_norm": 0.1046002060174942, "learning_rate": 0.002471078595115081, "loss": 1.5224, "step": 44100 }, { "epoch": 0.013958020594664349, "grad_norm": 0.15750165283679962, "learning_rate": 0.0024705959150186944, "loss": 1.5242, "step": 44120 }, { "epoch": 0.014089700034236654, "grad_norm": 0.1028977781534195, "learning_rate": 0.0024701130619709986, "loss": 1.5234, "step": 44140 }, { "epoch": 0.01422137947380896, "grad_norm": 0.16695408523082733, "learning_rate": 0.0024696300360580337, "loss": 1.522, "step": 44160 }, { "epoch": 0.014353058913381265, "grad_norm": 0.12498366087675095, "learning_rate": 0.0024691468373658713, "loss": 1.5188, "step": 44180 }, { "epoch": 0.01448473835295357, "grad_norm": 0.09633167088031769, "learning_rate": 0.002468663465980612, "loss": 1.5245, "step": 44200 }, { "epoch": 0.014616417792525874, "grad_norm": 0.1630498468875885, "learning_rate": 0.002468179921988389, "loss": 1.5192, "step": 44220 }, { "epoch": 0.014748097232098181, "grad_norm": 0.11872150003910065, "learning_rate": 0.0024676962054753643, "loss": 1.5278, "step": 44240 }, { "epoch": 0.014879776671670486, "grad_norm": 0.17083382606506348, "learning_rate": 0.0024672123165277323, "loss": 1.5212, "step": 44260 }, { "epoch": 0.01501145611124279, "grad_norm": 0.12562261521816254, "learning_rate": 0.002466728255231718, "loss": 1.5217, "step": 44280 }, { "epoch": 0.015143135550815095, "grad_norm": 0.11627357453107834, "learning_rate": 0.002466244021673577, "loss": 1.521, "step": 44300 }, { "epoch": 0.015274814990387402, "grad_norm": 0.10252583771944046, "learning_rate": 0.0024657596159395937, "loss": 1.5237, "step": 44320 }, { "epoch": 0.015406494429959706, "grad_norm": 0.1185808777809143, "learning_rate": 0.0024652750381160865, "loss": 1.5174, "step": 44340 }, { "epoch": 0.015538173869532011, "grad_norm": 0.0919899195432663, "learning_rate": 0.002464790288289401, "loss": 1.5184, "step": 44360 }, { "epoch": 0.015669853309104316, "grad_norm": 0.16310234367847443, "learning_rate": 0.0024643053665459173, "loss": 1.5144, "step": 44380 }, { "epoch": 0.01580153274867662, "grad_norm": 0.16470354795455933, "learning_rate": 0.0024638202729720424, "loss": 1.4866, "step": 44400 }, { "epoch": 0.015933212188248926, "grad_norm": 0.12554654479026794, "learning_rate": 0.0024633350076542155, "loss": 1.4843, "step": 44420 }, { "epoch": 0.01606489162782123, "grad_norm": 0.13595227897167206, "learning_rate": 0.0024628495706789074, "loss": 1.4784, "step": 44440 }, { "epoch": 0.01619657106739354, "grad_norm": 0.10951948165893555, "learning_rate": 0.002462363962132618, "loss": 1.4678, "step": 44460 }, { "epoch": 0.016328250506965843, "grad_norm": 0.14208072423934937, "learning_rate": 0.0024618781821018785, "loss": 1.4665, "step": 44480 }, { "epoch": 0.016459929946538148, "grad_norm": 0.10121913254261017, "learning_rate": 0.0024613922306732506, "loss": 1.4681, "step": 44500 }, { "epoch": 0.016591609386110453, "grad_norm": 0.11362706124782562, "learning_rate": 0.0024609061079333256, "loss": 1.4584, "step": 44520 }, { "epoch": 0.016723288825682758, "grad_norm": 0.14318877458572388, "learning_rate": 0.0024604198139687268, "loss": 1.4655, "step": 44540 }, { "epoch": 0.016854968265255062, "grad_norm": 0.12110181897878647, "learning_rate": 0.002459933348866107, "loss": 1.4528, "step": 44560 }, { "epoch": 0.016986647704827367, "grad_norm": 0.11001115292310715, "learning_rate": 0.0024594467127121507, "loss": 1.4501, "step": 44580 }, { "epoch": 0.017118327144399672, "grad_norm": 0.16570629179477692, "learning_rate": 0.0024589599055935708, "loss": 1.4536, "step": 44600 }, { "epoch": 0.01725000658397198, "grad_norm": 0.11245054006576538, "learning_rate": 0.002458472927597112, "loss": 1.4548, "step": 44620 }, { "epoch": 0.017381686023544285, "grad_norm": 0.13176459074020386, "learning_rate": 0.0024579857788095505, "loss": 1.4485, "step": 44640 }, { "epoch": 0.01751336546311659, "grad_norm": 0.09991902112960815, "learning_rate": 0.002457498459317691, "loss": 1.4534, "step": 44660 }, { "epoch": 0.017645044902688894, "grad_norm": 0.0981200635433197, "learning_rate": 0.002457010969208369, "loss": 1.4469, "step": 44680 }, { "epoch": 0.0177767243422612, "grad_norm": 0.11083146929740906, "learning_rate": 0.0024565233085684507, "loss": 1.442, "step": 44700 }, { "epoch": 0.017908403781833504, "grad_norm": 0.09444429725408554, "learning_rate": 0.002456035477484834, "loss": 1.4514, "step": 44720 }, { "epoch": 0.01804008322140581, "grad_norm": 0.11763214319944382, "learning_rate": 0.0024555474760444445, "loss": 1.4521, "step": 44740 }, { "epoch": 0.018171762660978114, "grad_norm": 0.12316908687353134, "learning_rate": 0.00245505930433424, "loss": 1.449, "step": 44760 }, { "epoch": 0.018303442100550422, "grad_norm": 0.1016848236322403, "learning_rate": 0.0024545709624412093, "loss": 1.4494, "step": 44780 }, { "epoch": 0.018435121540122727, "grad_norm": 0.10764171183109283, "learning_rate": 0.002454082450452369, "loss": 1.4399, "step": 44800 }, { "epoch": 0.01856680097969503, "grad_norm": 0.11485065519809723, "learning_rate": 0.0024535937684547686, "loss": 1.4497, "step": 44820 }, { "epoch": 0.018698480419267336, "grad_norm": 0.1278896927833557, "learning_rate": 0.0024531049165354853, "loss": 1.4439, "step": 44840 }, { "epoch": 0.01883015985883964, "grad_norm": 0.14847633242607117, "learning_rate": 0.0024526158947816294, "loss": 1.4523, "step": 44860 }, { "epoch": 0.018961839298411946, "grad_norm": 0.105763278901577, "learning_rate": 0.00245212670328034, "loss": 1.4496, "step": 44880 }, { "epoch": 0.01909351873798425, "grad_norm": 0.1055736318230629, "learning_rate": 0.0024516373421187856, "loss": 1.446, "step": 44900 }, { "epoch": 0.019225198177556555, "grad_norm": 0.0994647964835167, "learning_rate": 0.002451147811384167, "loss": 1.4465, "step": 44920 }, { "epoch": 0.01935687761712886, "grad_norm": 0.10782650858163834, "learning_rate": 0.0024506581111637137, "loss": 1.4587, "step": 44940 }, { "epoch": 0.019488557056701168, "grad_norm": 0.12616658210754395, "learning_rate": 0.0024501682415446853, "loss": 1.496, "step": 44960 }, { "epoch": 0.019620236496273473, "grad_norm": 0.12615470588207245, "learning_rate": 0.002449678202614372, "loss": 1.5177, "step": 44980 }, { "epoch": 0.019751915935845778, "grad_norm": 0.10382698476314545, "learning_rate": 0.0024491879944600957, "loss": 1.5299, "step": 45000 }, { "epoch": 0.019751915935845778, "eval_loss": 1.5385295152664185, "eval_runtime": 66.2896, "eval_samples_per_second": 15.085, "eval_steps_per_second": 15.085, "step": 45000 }, { "epoch": 0.019883595375418082, "grad_norm": 0.11794433742761612, "learning_rate": 0.0024486976171692056, "loss": 1.528, "step": 45020 }, { "epoch": 0.020015274814990387, "grad_norm": 0.1409338116645813, "learning_rate": 0.002448207070829083, "loss": 1.5341, "step": 45040 }, { "epoch": 0.020146954254562692, "grad_norm": 0.12568840384483337, "learning_rate": 0.002447716355527138, "loss": 1.5318, "step": 45060 }, { "epoch": 0.020278633694134997, "grad_norm": 0.15237917006015778, "learning_rate": 0.0024472254713508133, "loss": 1.5449, "step": 45080 }, { "epoch": 0.0204103131337073, "grad_norm": 0.11090464144945145, "learning_rate": 0.002446734418387578, "loss": 1.5253, "step": 45100 }, { "epoch": 0.02054199257327961, "grad_norm": 0.11170685291290283, "learning_rate": 0.0024462431967249344, "loss": 1.5203, "step": 45120 }, { "epoch": 0.020673672012851915, "grad_norm": 0.10791482031345367, "learning_rate": 0.0024457518064504133, "loss": 1.5176, "step": 45140 }, { "epoch": 0.02080535145242422, "grad_norm": 0.09597095102071762, "learning_rate": 0.002445260247651576, "loss": 1.5193, "step": 45160 }, { "epoch": 0.020937030891996524, "grad_norm": 0.34346190094947815, "learning_rate": 0.0024447685204160145, "loss": 1.5182, "step": 45180 }, { "epoch": 0.02106871033156883, "grad_norm": 0.15261825919151306, "learning_rate": 0.0024442766248313494, "loss": 1.5151, "step": 45200 }, { "epoch": 0.021200389771141134, "grad_norm": 0.1070566177368164, "learning_rate": 0.0024437845609852314, "loss": 1.516, "step": 45220 }, { "epoch": 0.02133206921071344, "grad_norm": 0.10885826498270035, "learning_rate": 0.0024432923289653425, "loss": 1.5128, "step": 45240 }, { "epoch": 0.021463748650285743, "grad_norm": 0.13303355872631073, "learning_rate": 0.002442799928859394, "loss": 1.5122, "step": 45260 }, { "epoch": 0.021595428089858048, "grad_norm": 0.10217521339654922, "learning_rate": 0.002442307360755127, "loss": 1.5032, "step": 45280 }, { "epoch": 0.021727107529430356, "grad_norm": 0.11426650732755661, "learning_rate": 0.0024418146247403125, "loss": 1.5029, "step": 45300 }, { "epoch": 0.02185878696900266, "grad_norm": 0.09248542040586472, "learning_rate": 0.0024413217209027518, "loss": 1.4998, "step": 45320 }, { "epoch": 0.021990466408574966, "grad_norm": 0.12633563578128815, "learning_rate": 0.0024408286493302757, "loss": 1.4982, "step": 45340 }, { "epoch": 0.02212214584814727, "grad_norm": 0.16023258864879608, "learning_rate": 0.0024403354101107445, "loss": 1.5003, "step": 45360 }, { "epoch": 0.022253825287719575, "grad_norm": 0.12979178130626678, "learning_rate": 0.00243984200333205, "loss": 1.4963, "step": 45380 }, { "epoch": 0.02238550472729188, "grad_norm": 0.127953439950943, "learning_rate": 0.002439348429082112, "loss": 1.4973, "step": 45400 }, { "epoch": 0.022517184166864185, "grad_norm": 0.10096823424100876, "learning_rate": 0.002438854687448881, "loss": 1.4964, "step": 45420 }, { "epoch": 0.02264886360643649, "grad_norm": 0.1225760206580162, "learning_rate": 0.0024383607785203377, "loss": 1.5038, "step": 45440 }, { "epoch": 0.022780543046008798, "grad_norm": 0.15798920392990112, "learning_rate": 0.002437866702384491, "loss": 1.5002, "step": 45460 }, { "epoch": 0.022912222485581103, "grad_norm": 0.11615593731403351, "learning_rate": 0.0024373724591293827, "loss": 1.4992, "step": 45480 }, { "epoch": 0.023043901925153407, "grad_norm": 0.11516784876585007, "learning_rate": 0.0024368780488430806, "loss": 1.4973, "step": 45500 }, { "epoch": 0.023175581364725712, "grad_norm": 0.13365384936332703, "learning_rate": 0.002436383471613685, "loss": 1.4992, "step": 45520 }, { "epoch": 0.023307260804298017, "grad_norm": 0.13123133778572083, "learning_rate": 0.0024358887275293243, "loss": 1.5064, "step": 45540 }, { "epoch": 0.02343894024387032, "grad_norm": 0.106318898499012, "learning_rate": 0.0024353938166781584, "loss": 1.5163, "step": 45560 }, { "epoch": 0.023570619683442626, "grad_norm": 0.10438498854637146, "learning_rate": 0.0024348987391483753, "loss": 1.5152, "step": 45580 }, { "epoch": 0.02370229912301493, "grad_norm": 0.1130092591047287, "learning_rate": 0.0024344034950281933, "loss": 1.519, "step": 45600 }, { "epoch": 0.023833978562587236, "grad_norm": 0.12775199115276337, "learning_rate": 0.0024339080844058606, "loss": 1.5139, "step": 45620 }, { "epoch": 0.023965658002159544, "grad_norm": 0.09360072016716003, "learning_rate": 0.002433412507369654, "loss": 1.5066, "step": 45640 }, { "epoch": 0.02409733744173185, "grad_norm": 0.1027098149061203, "learning_rate": 0.002432916764007882, "loss": 1.5034, "step": 45660 }, { "epoch": 0.024229016881304154, "grad_norm": 0.11048934608697891, "learning_rate": 0.0024324208544088803, "loss": 1.4977, "step": 45680 }, { "epoch": 0.02436069632087646, "grad_norm": 0.11964282393455505, "learning_rate": 0.002431924778661017, "loss": 1.4941, "step": 45700 }, { "epoch": 0.024492375760448763, "grad_norm": 0.12463732808828354, "learning_rate": 0.002431428536852687, "loss": 1.4987, "step": 45720 }, { "epoch": 0.024624055200021068, "grad_norm": 0.13735800981521606, "learning_rate": 0.0024309321290723164, "loss": 1.4951, "step": 45740 }, { "epoch": 0.024755734639593373, "grad_norm": 0.11579196900129318, "learning_rate": 0.0024304355554083607, "loss": 1.4909, "step": 45760 }, { "epoch": 0.024887414079165678, "grad_norm": 0.1210319772362709, "learning_rate": 0.002429938815949304, "loss": 1.49, "step": 45780 }, { "epoch": 0.025019093518737986, "grad_norm": 0.11229152232408524, "learning_rate": 0.0024294419107836625, "loss": 1.4849, "step": 45800 }, { "epoch": 0.02515077295831029, "grad_norm": 0.09796669334173203, "learning_rate": 0.002428944839999978, "loss": 1.4831, "step": 45820 }, { "epoch": 0.025282452397882595, "grad_norm": 0.12028352171182632, "learning_rate": 0.0024284476036868256, "loss": 1.4836, "step": 45840 }, { "epoch": 0.0254141318374549, "grad_norm": 0.11071626096963882, "learning_rate": 0.002427950201932807, "loss": 1.4798, "step": 45860 }, { "epoch": 0.025545811277027205, "grad_norm": 0.10366615653038025, "learning_rate": 0.002427452634826556, "loss": 1.4781, "step": 45880 }, { "epoch": 0.02567749071659951, "grad_norm": 0.10610003024339676, "learning_rate": 0.0024269549024567333, "loss": 1.4838, "step": 45900 }, { "epoch": 0.025809170156171814, "grad_norm": 0.0969921201467514, "learning_rate": 0.002426457004912031, "loss": 1.4874, "step": 45920 }, { "epoch": 0.02594084959574412, "grad_norm": 0.11021365970373154, "learning_rate": 0.00242595894228117, "loss": 1.4853, "step": 45940 }, { "epoch": 0.026072529035316427, "grad_norm": 0.11574053019285202, "learning_rate": 0.0024254607146528993, "loss": 1.4812, "step": 45960 }, { "epoch": 0.026204208474888732, "grad_norm": 0.09534565359354019, "learning_rate": 0.002424962322116, "loss": 1.478, "step": 45980 }, { "epoch": 0.026335887914461037, "grad_norm": 0.10188112407922745, "learning_rate": 0.0024244637647592797, "loss": 1.4782, "step": 46000 }, { "epoch": 0.026335887914461037, "eval_loss": 1.558879017829895, "eval_runtime": 77.2288, "eval_samples_per_second": 12.949, "eval_steps_per_second": 12.949, "step": 46000 }, { "epoch": 2e-06, "grad_norm": 0.1454385668039322, "learning_rate": 0.000690285, "loss": 2.076281929016113, "step": 46020 }, { "epoch": 4e-06, "grad_norm": 0.07851192355155945, "learning_rate": 0.0006905850000000001, "loss": 2.036176300048828, "step": 46040 }, { "epoch": 6e-06, "grad_norm": 0.057373788207769394, "learning_rate": 0.000690885, "loss": 2.018076515197754, "step": 46060 }, { "epoch": 8e-06, "grad_norm": 0.058911461383104324, "learning_rate": 0.000691185, "loss": 2.0062496185302736, "step": 46080 }, { "epoch": 1e-05, "grad_norm": 0.08635017275810242, "learning_rate": 0.000691485, "loss": 2.0066757202148438, "step": 46100 }, { "epoch": 1.2e-05, "grad_norm": 0.0559137687087059, "learning_rate": 0.000691785, "loss": 1.999479103088379, "step": 46120 }, { "epoch": 1.4e-05, "grad_norm": 0.07066166400909424, "learning_rate": 0.000692085, "loss": 1.9976621627807618, "step": 46140 }, { "epoch": 1.6e-05, "grad_norm": 0.06597048789262772, "learning_rate": 0.000692385, "loss": 1.9841796875, "step": 46160 }, { "epoch": 1.8e-05, "grad_norm": 0.07282619923353195, "learning_rate": 0.000692685, "loss": 1.9873577117919923, "step": 46180 }, { "epoch": 2e-05, "grad_norm": 0.06868898123502731, "learning_rate": 0.000692985, "loss": 1.9878196716308594, "step": 46200 }, { "epoch": 2.2e-05, "grad_norm": 0.056995589286088943, "learning_rate": 0.000693285, "loss": 1.9771448135375977, "step": 46220 }, { "epoch": 2.4e-05, "grad_norm": 0.0641326829791069, "learning_rate": 0.000693585, "loss": 1.9761754989624023, "step": 46240 }, { "epoch": 2.6e-05, "grad_norm": 0.07175535708665848, "learning_rate": 0.000693885, "loss": 1.970853042602539, "step": 46260 }, { "epoch": 2.8e-05, "grad_norm": 0.06924993544816971, "learning_rate": 0.0006941849999999999, "loss": 1.9718612670898437, "step": 46280 }, { "epoch": 3e-05, "grad_norm": 0.06896559149026871, "learning_rate": 0.000694485, "loss": 1.9643774032592773, "step": 46300 }, { "epoch": 3.2e-05, "grad_norm": 0.058981869369745255, "learning_rate": 0.000694785, "loss": 1.9701652526855469, "step": 46320 }, { "epoch": 3.4e-05, "grad_norm": 0.06701400130987167, "learning_rate": 0.000695085, "loss": 1.957753562927246, "step": 46340 }, { "epoch": 3.6e-05, "grad_norm": 0.07226961851119995, "learning_rate": 0.000695385, "loss": 1.9627220153808593, "step": 46360 }, { "epoch": 3.8e-05, "grad_norm": 0.07805868238210678, "learning_rate": 0.000695685, "loss": 1.9605262756347657, "step": 46380 }, { "epoch": 4e-05, "grad_norm": 0.07272197306156158, "learning_rate": 0.000695985, "loss": 1.9611610412597655, "step": 46400 }, { "epoch": 4.2e-05, "grad_norm": 0.06122796609997749, "learning_rate": 0.000696285, "loss": 1.947123146057129, "step": 46420 }, { "epoch": 4.4e-05, "grad_norm": 0.08275068551301956, "learning_rate": 0.000696585, "loss": 1.9539257049560548, "step": 46440 }, { "epoch": 4.6e-05, "grad_norm": 0.0847841426730156, "learning_rate": 0.0006968850000000001, "loss": 1.9514825820922852, "step": 46460 }, { "epoch": 4.8e-05, "grad_norm": 0.05611637979745865, "learning_rate": 0.000697185, "loss": 1.948338508605957, "step": 46480 }, { "epoch": 5e-05, "grad_norm": 0.06900504976511002, "learning_rate": 0.0006974850000000001, "loss": 1.9451566696166993, "step": 46500 }, { "epoch": 5.2e-05, "grad_norm": 0.07195140421390533, "learning_rate": 0.000697785, "loss": 1.9498029708862306, "step": 46520 }, { "epoch": 5.4e-05, "grad_norm": 0.07324763387441635, "learning_rate": 0.0006980850000000001, "loss": 1.9459251403808593, "step": 46540 }, { "epoch": 5.6e-05, "grad_norm": 0.056651510298252106, "learning_rate": 0.000698385, "loss": 1.9457489013671876, "step": 46560 }, { "epoch": 5.8e-05, "grad_norm": 0.08276001363992691, "learning_rate": 0.000698685, "loss": 1.9360223770141602, "step": 46580 }, { "epoch": 6e-05, "grad_norm": 0.08096142113208771, "learning_rate": 0.0006989850000000001, "loss": 1.9375598907470704, "step": 46600 }, { "epoch": 6.2e-05, "grad_norm": 0.0721917450428009, "learning_rate": 0.000699285, "loss": 1.9336822509765625, "step": 46620 }, { "epoch": 6.4e-05, "grad_norm": 0.0872625857591629, "learning_rate": 0.0006995850000000001, "loss": 1.9410781860351562, "step": 46640 }, { "epoch": 6.6e-05, "grad_norm": 0.05740909278392792, "learning_rate": 0.000699885, "loss": 1.9338249206542968, "step": 46660 }, { "epoch": 6.8e-05, "grad_norm": 0.06273666769266129, "learning_rate": 0.000700185, "loss": 1.9296646118164062, "step": 46680 }, { "epoch": 7e-05, "grad_norm": 0.07139860838651657, "learning_rate": 0.000700485, "loss": 1.941641616821289, "step": 46700 }, { "epoch": 7.2e-05, "grad_norm": 0.07698002457618713, "learning_rate": 0.000700785, "loss": 1.9317914962768554, "step": 46720 }, { "epoch": 7.4e-05, "grad_norm": 0.062162358313798904, "learning_rate": 0.0007010850000000001, "loss": 1.9283344268798828, "step": 46740 }, { "epoch": 7.6e-05, "grad_norm": 0.0760132372379303, "learning_rate": 0.000701385, "loss": 1.9273748397827148, "step": 46760 }, { "epoch": 7.8e-05, "grad_norm": 0.09244687855243683, "learning_rate": 0.000701685, "loss": 1.9315763473510743, "step": 46780 }, { "epoch": 8e-05, "grad_norm": 0.06585084646940231, "learning_rate": 0.000701985, "loss": 1.9171140670776368, "step": 46800 }, { "epoch": 8.2e-05, "grad_norm": 0.07399197667837143, "learning_rate": 0.000702285, "loss": 1.9259872436523438, "step": 46820 }, { "epoch": 8.4e-05, "grad_norm": 0.0975058525800705, "learning_rate": 0.0007025849999999999, "loss": 1.9262987136840821, "step": 46840 }, { "epoch": 8.6e-05, "grad_norm": 0.062050431966781616, "learning_rate": 0.000702885, "loss": 1.9207113265991211, "step": 46860 }, { "epoch": 8.8e-05, "grad_norm": 0.06593676656484604, "learning_rate": 0.0007031849999999999, "loss": 1.9189161300659179, "step": 46880 }, { "epoch": 9e-05, "grad_norm": 0.0780588909983635, "learning_rate": 0.000703485, "loss": 1.9223506927490235, "step": 46900 }, { "epoch": 9.2e-05, "grad_norm": 0.06823083758354187, "learning_rate": 0.000703785, "loss": 1.912630844116211, "step": 46920 }, { "epoch": 9.4e-05, "grad_norm": 0.08263996988534927, "learning_rate": 0.000704085, "loss": 1.9180915832519532, "step": 46940 }, { "epoch": 9.6e-05, "grad_norm": 0.06720611453056335, "learning_rate": 0.000704385, "loss": 1.9188003540039062, "step": 46960 }, { "epoch": 9.8e-05, "grad_norm": 0.09634207934141159, "learning_rate": 0.000704685, "loss": 1.9179636001586915, "step": 46980 }, { "epoch": 0.0001, "grad_norm": 0.1031593307852745, "learning_rate": 0.0007049850000000001, "loss": 1.9118635177612304, "step": 47000 }, { "epoch": 0.0001, "eval_loss": 1.8519573211669922, "eval_runtime": 103.0547, "eval_samples_per_second": 9.704, "eval_steps_per_second": 9.704, "step": 47000 }, { "epoch": 0.000102, "grad_norm": 0.06469423323869705, "learning_rate": 0.000705285, "loss": 1.9127388000488281, "step": 47020 }, { "epoch": 0.000104, "grad_norm": 0.0648200586438179, "learning_rate": 0.000705585, "loss": 1.9220613479614257, "step": 47040 }, { "epoch": 0.000106, "grad_norm": 0.08908385783433914, "learning_rate": 0.0007058850000000001, "loss": 1.9115385055541991, "step": 47060 }, { "epoch": 0.000108, "grad_norm": 0.0783170759677887, "learning_rate": 0.000706185, "loss": 1.9148534774780273, "step": 47080 }, { "epoch": 0.00011, "grad_norm": 0.08982904255390167, "learning_rate": 0.0007064850000000001, "loss": 1.9030448913574218, "step": 47100 }, { "epoch": 0.000112, "grad_norm": 0.0841226652264595, "learning_rate": 0.000706785, "loss": 1.912649154663086, "step": 47120 }, { "epoch": 0.000114, "grad_norm": 0.08642134070396423, "learning_rate": 0.000707085, "loss": 1.9114418029785156, "step": 47140 }, { "epoch": 0.000116, "grad_norm": 0.06373965740203857, "learning_rate": 0.000707385, "loss": 1.9125936508178711, "step": 47160 }, { "epoch": 0.000118, "grad_norm": 0.07079387456178665, "learning_rate": 0.000707685, "loss": 1.9213525772094726, "step": 47180 }, { "epoch": 0.00012, "grad_norm": 0.07068858295679092, "learning_rate": 0.0007079850000000001, "loss": 1.9196317672729493, "step": 47200 }, { "epoch": 0.000122, "grad_norm": 0.0658358484506607, "learning_rate": 0.000708285, "loss": 1.928008460998535, "step": 47220 }, { "epoch": 0.000124, "grad_norm": 0.07867607474327087, "learning_rate": 0.000708585, "loss": 1.9092967987060547, "step": 47240 }, { "epoch": 0.000126, "grad_norm": 0.0598660483956337, "learning_rate": 0.000708885, "loss": 1.914600944519043, "step": 47260 }, { "epoch": 0.000128, "grad_norm": 0.06065090373158455, "learning_rate": 0.000709185, "loss": 1.9233844757080079, "step": 47280 }, { "epoch": 0.00013, "grad_norm": 0.09242924302816391, "learning_rate": 0.000709485, "loss": 1.9209175109863281, "step": 47300 }, { "epoch": 0.000132, "grad_norm": 0.06336706876754761, "learning_rate": 0.000709785, "loss": 1.9172807693481446, "step": 47320 }, { "epoch": 0.000134, "grad_norm": 0.06539217382669449, "learning_rate": 0.000710085, "loss": 1.921341896057129, "step": 47340 }, { "epoch": 0.000136, "grad_norm": 0.06496850401163101, "learning_rate": 0.000710385, "loss": 1.9217124938964845, "step": 47360 }, { "epoch": 0.000138, "grad_norm": 0.06589950621128082, "learning_rate": 0.000710685, "loss": 1.917654037475586, "step": 47380 }, { "epoch": 0.00014, "grad_norm": 0.10992733389139175, "learning_rate": 0.000710985, "loss": 1.909129524230957, "step": 47400 }, { "epoch": 0.000142, "grad_norm": 0.07374437898397446, "learning_rate": 0.000711285, "loss": 1.9101346969604491, "step": 47420 }, { "epoch": 0.000144, "grad_norm": 0.062163710594177246, "learning_rate": 0.0007115849999999999, "loss": 1.9079486846923828, "step": 47440 }, { "epoch": 0.000146, "grad_norm": 0.08394552022218704, "learning_rate": 0.000711885, "loss": 1.9161951065063476, "step": 47460 }, { "epoch": 0.000148, "grad_norm": 0.11592655628919601, "learning_rate": 0.000712185, "loss": 1.9125499725341797, "step": 47480 }, { "epoch": 0.00015, "grad_norm": 0.07041492313146591, "learning_rate": 0.000712485, "loss": 1.9119735717773438, "step": 47500 }, { "epoch": 0.000152, "grad_norm": 0.05417707934975624, "learning_rate": 0.0007127850000000001, "loss": 1.9030326843261718, "step": 47520 }, { "epoch": 0.000154, "grad_norm": 0.0702233612537384, "learning_rate": 0.000713085, "loss": 1.9038074493408204, "step": 47540 }, { "epoch": 0.000156, "grad_norm": 0.05859832465648651, "learning_rate": 0.0007133850000000001, "loss": 1.900547981262207, "step": 47560 }, { "epoch": 0.000158, "grad_norm": 0.08888107538223267, "learning_rate": 0.000713685, "loss": 1.9098312377929687, "step": 47580 }, { "epoch": 0.00016, "grad_norm": 0.0922444686293602, "learning_rate": 0.0007139850000000001, "loss": 1.902810287475586, "step": 47600 }, { "epoch": 0.000162, "grad_norm": 0.06493257731199265, "learning_rate": 0.000714285, "loss": 1.9034292221069335, "step": 47620 }, { "epoch": 0.000164, "grad_norm": 0.07373186200857162, "learning_rate": 0.000714585, "loss": 1.9035234451293945, "step": 47640 }, { "epoch": 0.000166, "grad_norm": 0.06822580099105835, "learning_rate": 0.0007148850000000001, "loss": 1.902390480041504, "step": 47660 }, { "epoch": 0.000168, "grad_norm": 0.06901398301124573, "learning_rate": 0.000715185, "loss": 1.89398136138916, "step": 47680 }, { "epoch": 0.00017, "grad_norm": 0.09062466770410538, "learning_rate": 0.0007154850000000001, "loss": 1.9004844665527343, "step": 47700 }, { "epoch": 0.000172, "grad_norm": 0.14246119558811188, "learning_rate": 0.000715785, "loss": 1.8940235137939454, "step": 47720 }, { "epoch": 0.000174, "grad_norm": 0.09346599876880646, "learning_rate": 0.000716085, "loss": 1.8926639556884766, "step": 47740 }, { "epoch": 0.000176, "grad_norm": 0.07609276473522186, "learning_rate": 0.000716385, "loss": 1.8961585998535155, "step": 47760 }, { "epoch": 0.000178, "grad_norm": 0.06778562813997269, "learning_rate": 0.000716685, "loss": 1.8936416625976562, "step": 47780 }, { "epoch": 0.00018, "grad_norm": 0.12500469386577606, "learning_rate": 0.0007169850000000001, "loss": 1.8971038818359376, "step": 47800 }, { "epoch": 0.000182, "grad_norm": 0.0834629014134407, "learning_rate": 0.000717285, "loss": 1.9050609588623046, "step": 47820 }, { "epoch": 0.000184, "grad_norm": 0.07134594768285751, "learning_rate": 0.000717585, "loss": 1.894935417175293, "step": 47840 }, { "epoch": 0.000186, "grad_norm": 0.06053246557712555, "learning_rate": 0.000717885, "loss": 1.8934173583984375, "step": 47860 }, { "epoch": 0.000188, "grad_norm": 0.07200822979211807, "learning_rate": 0.000718185, "loss": 1.895335578918457, "step": 47880 }, { "epoch": 0.00019, "grad_norm": 0.07255461066961288, "learning_rate": 0.000718485, "loss": 1.8858306884765625, "step": 47900 }, { "epoch": 0.000192, "grad_norm": 0.1142456904053688, "learning_rate": 0.000718785, "loss": 1.8956653594970703, "step": 47920 }, { "epoch": 0.000194, "grad_norm": 0.11873633414506912, "learning_rate": 0.000719085, "loss": 1.8932693481445313, "step": 47940 }, { "epoch": 0.000196, "grad_norm": 0.06071966513991356, "learning_rate": 0.000719385, "loss": 1.8919456481933594, "step": 47960 }, { "epoch": 0.000198, "grad_norm": 0.10144706070423126, "learning_rate": 0.000719685, "loss": 1.886199951171875, "step": 47980 }, { "epoch": 0.0002, "grad_norm": 0.07306289672851562, "learning_rate": 0.000719985, "loss": 1.886566734313965, "step": 48000 }, { "epoch": 0.0002, "eval_loss": 1.8350651264190674, "eval_runtime": 99.0695, "eval_samples_per_second": 10.094, "eval_steps_per_second": 10.094, "step": 48000 }, { "epoch": 0.000202, "grad_norm": 0.07433490455150604, "learning_rate": 0.000720285, "loss": 1.8901538848876953, "step": 48020 }, { "epoch": 0.000204, "grad_norm": 0.06506136059761047, "learning_rate": 0.000720585, "loss": 1.8856683731079102, "step": 48040 }, { "epoch": 0.000206, "grad_norm": 0.07532741129398346, "learning_rate": 0.000720885, "loss": 1.885334587097168, "step": 48060 }, { "epoch": 0.000208, "grad_norm": 0.08687019348144531, "learning_rate": 0.0007211850000000001, "loss": 1.8871675491333009, "step": 48080 }, { "epoch": 0.00021, "grad_norm": 0.06796624511480331, "learning_rate": 0.000721485, "loss": 1.88447265625, "step": 48100 }, { "epoch": 0.000212, "grad_norm": 0.07211881875991821, "learning_rate": 0.0007217850000000001, "loss": 1.8851350784301757, "step": 48120 }, { "epoch": 0.000214, "grad_norm": 0.09619178622961044, "learning_rate": 0.000722085, "loss": 1.8860481262207032, "step": 48140 }, { "epoch": 0.000216, "grad_norm": 0.09473865479230881, "learning_rate": 0.0007223850000000001, "loss": 1.8759679794311523, "step": 48160 }, { "epoch": 0.000218, "grad_norm": 0.06743013858795166, "learning_rate": 0.000722685, "loss": 1.8819561004638672, "step": 48180 }, { "epoch": 0.00022, "grad_norm": 0.08684151619672775, "learning_rate": 0.000722985, "loss": 1.877330207824707, "step": 48200 }, { "epoch": 0.000222, "grad_norm": 0.06397704780101776, "learning_rate": 0.000723285, "loss": 1.8899486541748047, "step": 48220 }, { "epoch": 0.000224, "grad_norm": 0.0900849923491478, "learning_rate": 0.000723585, "loss": 1.8874429702758788, "step": 48240 }, { "epoch": 0.000226, "grad_norm": 0.07488174736499786, "learning_rate": 0.0007238850000000001, "loss": 1.8861740112304688, "step": 48260 }, { "epoch": 0.000228, "grad_norm": 0.09316900372505188, "learning_rate": 0.000724185, "loss": 1.8858060836791992, "step": 48280 }, { "epoch": 0.00023, "grad_norm": 0.0723276361823082, "learning_rate": 0.000724485, "loss": 1.8740653991699219, "step": 48300 }, { "epoch": 0.000232, "grad_norm": 0.0841292217373848, "learning_rate": 0.000724785, "loss": 1.8807933807373047, "step": 48320 }, { "epoch": 0.000234, "grad_norm": 0.09044871479272842, "learning_rate": 0.000725085, "loss": 1.8928699493408203, "step": 48340 }, { "epoch": 0.000236, "grad_norm": 0.08968909084796906, "learning_rate": 0.000725385, "loss": 1.8885452270507812, "step": 48360 }, { "epoch": 0.000238, "grad_norm": 0.07492511719465256, "learning_rate": 0.000725685, "loss": 1.881599235534668, "step": 48380 }, { "epoch": 0.00024, "grad_norm": 0.06670362502336502, "learning_rate": 0.000725985, "loss": 1.886728858947754, "step": 48400 }, { "epoch": 0.000242, "grad_norm": 0.06100883707404137, "learning_rate": 0.000726285, "loss": 1.898359489440918, "step": 48420 }, { "epoch": 0.000244, "grad_norm": 0.07540082186460495, "learning_rate": 0.000726585, "loss": 1.8863595962524413, "step": 48440 }, { "epoch": 0.000246, "grad_norm": 0.06365904211997986, "learning_rate": 0.000726885, "loss": 1.8902715682983398, "step": 48460 }, { "epoch": 0.000248, "grad_norm": 0.07440081238746643, "learning_rate": 0.000727185, "loss": 1.8887521743774414, "step": 48480 }, { "epoch": 0.00025, "grad_norm": 0.06741853058338165, "learning_rate": 0.0007274849999999999, "loss": 1.8897829055786133, "step": 48500 }, { "epoch": 0.000252, "grad_norm": 0.06400787085294724, "learning_rate": 0.000727785, "loss": 1.892916488647461, "step": 48520 }, { "epoch": 0.000254, "grad_norm": 0.084056057035923, "learning_rate": 0.000728085, "loss": 1.8810224533081055, "step": 48540 }, { "epoch": 0.000256, "grad_norm": 0.07808465510606766, "learning_rate": 0.000728385, "loss": 1.8811614990234375, "step": 48560 }, { "epoch": 0.000258, "grad_norm": 0.06912193447351456, "learning_rate": 0.000728685, "loss": 1.8807933807373047, "step": 48580 }, { "epoch": 0.00026, "grad_norm": 0.11728200316429138, "learning_rate": 0.000728985, "loss": 1.8793157577514648, "step": 48600 }, { "epoch": 0.000262, "grad_norm": 0.07116056978702545, "learning_rate": 0.000729285, "loss": 1.8806476593017578, "step": 48620 }, { "epoch": 0.000264, "grad_norm": 0.07659170776605606, "learning_rate": 0.000729585, "loss": 1.8804895401000976, "step": 48640 }, { "epoch": 0.000266, "grad_norm": 0.05822935327887535, "learning_rate": 0.000729885, "loss": 1.8786319732666015, "step": 48660 }, { "epoch": 0.000268, "grad_norm": 0.07382626831531525, "learning_rate": 0.0007301850000000001, "loss": 1.8767101287841796, "step": 48680 }, { "epoch": 0.00027, "grad_norm": 0.07334620505571365, "learning_rate": 0.000730485, "loss": 1.8743818283081055, "step": 48700 }, { "epoch": 0.000272, "grad_norm": 0.07567453384399414, "learning_rate": 0.0007307850000000001, "loss": 1.8763639450073242, "step": 48720 }, { "epoch": 0.000274, "grad_norm": 0.08777511864900589, "learning_rate": 0.000731085, "loss": 1.8786584854125976, "step": 48740 }, { "epoch": 0.000276, "grad_norm": 0.09745394438505173, "learning_rate": 0.0007313850000000001, "loss": 1.8746225357055664, "step": 48760 }, { "epoch": 0.000278, "grad_norm": 0.06679695099592209, "learning_rate": 0.000731685, "loss": 1.8859651565551758, "step": 48780 }, { "epoch": 0.00028, "grad_norm": 0.054582711309194565, "learning_rate": 0.000731985, "loss": 1.8781494140625, "step": 48800 }, { "epoch": 0.000282, "grad_norm": 0.06270311772823334, "learning_rate": 0.000732285, "loss": 1.8780647277832032, "step": 48820 }, { "epoch": 0.000284, "grad_norm": 0.07959431409835815, "learning_rate": 0.000732585, "loss": 1.872858428955078, "step": 48840 }, { "epoch": 0.000286, "grad_norm": 0.08098466694355011, "learning_rate": 0.0007328850000000001, "loss": 1.8745456695556642, "step": 48860 }, { "epoch": 0.000288, "grad_norm": 0.0944877415895462, "learning_rate": 0.000733185, "loss": 1.8757490158081054, "step": 48880 }, { "epoch": 0.00029, "grad_norm": 0.09513352811336517, "learning_rate": 0.000733485, "loss": 1.886286735534668, "step": 48900 }, { "epoch": 0.000292, "grad_norm": 0.10484618693590164, "learning_rate": 0.000733785, "loss": 1.8716920852661132, "step": 48920 }, { "epoch": 0.000294, "grad_norm": 0.06396955996751785, "learning_rate": 0.000734085, "loss": 1.876509666442871, "step": 48940 }, { "epoch": 0.000296, "grad_norm": 0.06441602110862732, "learning_rate": 0.000734385, "loss": 1.8659820556640625, "step": 48960 }, { "epoch": 0.000298, "grad_norm": 0.08893131464719772, "learning_rate": 0.000734685, "loss": 1.865779495239258, "step": 48980 }, { "epoch": 0.0003, "grad_norm": 0.07854273170232773, "learning_rate": 0.000734985, "loss": 1.8671316146850585, "step": 49000 }, { "epoch": 0.0003, "eval_loss": 1.8231958150863647, "eval_runtime": 99.9569, "eval_samples_per_second": 10.004, "eval_steps_per_second": 10.004, "step": 49000 }, { "epoch": 0.000302, "grad_norm": 0.08891486376523972, "learning_rate": 0.000735285, "loss": 1.8616506576538085, "step": 49020 }, { "epoch": 0.000304, "grad_norm": 0.08781826496124268, "learning_rate": 0.000735585, "loss": 1.865854835510254, "step": 49040 }, { "epoch": 0.000306, "grad_norm": 0.12502416968345642, "learning_rate": 0.000735885, "loss": 1.8626695632934571, "step": 49060 }, { "epoch": 0.000308, "grad_norm": 0.06342129409313202, "learning_rate": 0.000736185, "loss": 1.8653135299682617, "step": 49080 }, { "epoch": 0.00031, "grad_norm": 0.08215075731277466, "learning_rate": 0.0007364849999999999, "loss": 1.8684637069702148, "step": 49100 }, { "epoch": 0.000312, "grad_norm": 0.09643544256687164, "learning_rate": 0.000736785, "loss": 1.8758543014526368, "step": 49120 }, { "epoch": 0.000314, "grad_norm": 0.08002220094203949, "learning_rate": 0.000737085, "loss": 1.8670568466186523, "step": 49140 }, { "epoch": 0.000316, "grad_norm": 0.05769426375627518, "learning_rate": 0.000737385, "loss": 1.8668659210205079, "step": 49160 }, { "epoch": 0.000318, "grad_norm": 0.09401297569274902, "learning_rate": 0.0007376850000000001, "loss": 1.8710269927978516, "step": 49180 }, { "epoch": 0.00032, "grad_norm": 0.1117960587143898, "learning_rate": 0.000737985, "loss": 1.870610237121582, "step": 49200 }, { "epoch": 0.000322, "grad_norm": 0.08143491297960281, "learning_rate": 0.0007382850000000001, "loss": 1.866176223754883, "step": 49220 }, { "epoch": 0.000324, "grad_norm": 0.0771065503358841, "learning_rate": 0.000738585, "loss": 1.867238426208496, "step": 49240 }, { "epoch": 0.000326, "grad_norm": 0.04945933073759079, "learning_rate": 0.000738885, "loss": 1.8657207489013672, "step": 49260 }, { "epoch": 0.000328, "grad_norm": 0.08263809978961945, "learning_rate": 0.0007391850000000001, "loss": 1.8570655822753905, "step": 49280 }, { "epoch": 0.00033, "grad_norm": 0.0943840742111206, "learning_rate": 0.000739485, "loss": 1.8613241195678711, "step": 49300 }, { "epoch": 0.000332, "grad_norm": 0.06208841875195503, "learning_rate": 0.0007397850000000001, "loss": 1.8662214279174805, "step": 49320 }, { "epoch": 0.000334, "grad_norm": 0.06485865265130997, "learning_rate": 0.000740085, "loss": 1.8635101318359375, "step": 49340 }, { "epoch": 0.000336, "grad_norm": 0.08560191094875336, "learning_rate": 0.000740385, "loss": 1.8564205169677734, "step": 49360 }, { "epoch": 0.000338, "grad_norm": 0.12357484549283981, "learning_rate": 0.000740685, "loss": 1.8634933471679687, "step": 49380 }, { "epoch": 0.00034, "grad_norm": 0.08451298624277115, "learning_rate": 0.000740985, "loss": 1.8603437423706055, "step": 49400 }, { "epoch": 0.000342, "grad_norm": 0.09098716825246811, "learning_rate": 0.0007412850000000001, "loss": 1.8705177307128906, "step": 49420 }, { "epoch": 0.000344, "grad_norm": 0.0718744546175003, "learning_rate": 0.000741585, "loss": 1.8548259735107422, "step": 49440 }, { "epoch": 0.000346, "grad_norm": 0.06135766953229904, "learning_rate": 0.000741885, "loss": 1.8501501083374023, "step": 49460 }, { "epoch": 0.000348, "grad_norm": 0.09332036226987839, "learning_rate": 0.000742185, "loss": 1.8546777725219727, "step": 49480 }, { "epoch": 0.00035, "grad_norm": 0.1360894739627838, "learning_rate": 0.000742485, "loss": 1.864227294921875, "step": 49500 }, { "epoch": 0.000352, "grad_norm": 0.08547444641590118, "learning_rate": 0.000742785, "loss": 1.8685710906982422, "step": 49520 }, { "epoch": 0.000354, "grad_norm": 0.10424457490444183, "learning_rate": 0.000743085, "loss": 1.8618698120117188, "step": 49540 }, { "epoch": 0.000356, "grad_norm": 0.09299690276384354, "learning_rate": 0.0007433849999999999, "loss": 1.8716371536254883, "step": 49560 }, { "epoch": 0.000358, "grad_norm": 0.06361870467662811, "learning_rate": 0.000743685, "loss": 1.8801010131835938, "step": 49580 }, { "epoch": 0.00036, "grad_norm": 0.08042526245117188, "learning_rate": 0.000743985, "loss": 1.8659257888793945, "step": 49600 }, { "epoch": 0.000362, "grad_norm": 0.10201700031757355, "learning_rate": 0.000744285, "loss": 1.8701637268066407, "step": 49620 }, { "epoch": 0.000364, "grad_norm": 0.10048798471689224, "learning_rate": 0.000744585, "loss": 1.8687246322631836, "step": 49640 }, { "epoch": 0.000366, "grad_norm": 0.10112548619508743, "learning_rate": 0.0007448849999999999, "loss": 1.867312240600586, "step": 49660 }, { "epoch": 0.000368, "grad_norm": 0.06898175179958344, "learning_rate": 0.000745185, "loss": 1.8694904327392579, "step": 49680 }, { "epoch": 0.00037, "grad_norm": 0.08607565611600876, "learning_rate": 0.000745485, "loss": 1.8709667205810547, "step": 49700 }, { "epoch": 0.000372, "grad_norm": 0.08153693377971649, "learning_rate": 0.000745785, "loss": 1.8627836227416992, "step": 49720 }, { "epoch": 0.000374, "grad_norm": 0.07933573424816132, "learning_rate": 0.0007460850000000001, "loss": 1.8717823028564453, "step": 49740 }, { "epoch": 0.000376, "grad_norm": 0.0822339653968811, "learning_rate": 0.000746385, "loss": 1.8707391738891601, "step": 49760 }, { "epoch": 0.000378, "grad_norm": 0.08838674426078796, "learning_rate": 0.0007466850000000001, "loss": 1.8709238052368165, "step": 49780 }, { "epoch": 0.00038, "grad_norm": 0.09605666249990463, "learning_rate": 0.000746985, "loss": 1.8747797012329102, "step": 49800 }, { "epoch": 0.000382, "grad_norm": 0.07646477222442627, "learning_rate": 0.0007472850000000001, "loss": 1.859670639038086, "step": 49820 }, { "epoch": 0.000384, "grad_norm": 0.07252638041973114, "learning_rate": 0.000747585, "loss": 1.856839942932129, "step": 49840 }, { "epoch": 0.000386, "grad_norm": 0.08199745416641235, "learning_rate": 0.000747885, "loss": 1.867083740234375, "step": 49860 }, { "epoch": 0.000388, "grad_norm": 0.07510737329721451, "learning_rate": 0.0007481850000000001, "loss": 1.8708480834960937, "step": 49880 }, { "epoch": 0.00039, "grad_norm": 0.10873018205165863, "learning_rate": 0.000748485, "loss": 1.8570371627807618, "step": 49900 }, { "epoch": 0.000392, "grad_norm": 0.07855768501758575, "learning_rate": 0.0007487850000000001, "loss": 1.8611907958984375, "step": 49920 }, { "epoch": 0.000394, "grad_norm": 0.0734357237815857, "learning_rate": 0.000749085, "loss": 1.8603155136108398, "step": 49940 }, { "epoch": 0.000396, "grad_norm": 0.11408625543117523, "learning_rate": 0.000749385, "loss": 1.862259292602539, "step": 49960 }, { "epoch": 0.000398, "grad_norm": 0.10029411315917969, "learning_rate": 0.000749685, "loss": 1.86767578125, "step": 49980 }, { "epoch": 0.0004, "grad_norm": 0.07305110991001129, "learning_rate": 0.000749985, "loss": 1.8574264526367188, "step": 50000 }, { "epoch": 0.0004, "eval_loss": 1.8127195835113525, "eval_runtime": 104.6958, "eval_samples_per_second": 9.551, "eval_steps_per_second": 9.551, "step": 50000 }, { "epoch": 0.000402, "grad_norm": 0.07434222847223282, "learning_rate": 0.0007502850000000001, "loss": 1.8548992156982422, "step": 50020 }, { "epoch": 0.000404, "grad_norm": 0.10143296420574188, "learning_rate": 0.000750585, "loss": 1.853312110900879, "step": 50040 }, { "epoch": 0.000406, "grad_norm": 0.08113838732242584, "learning_rate": 0.000750885, "loss": 1.8585927963256836, "step": 50060 }, { "epoch": 0.000408, "grad_norm": 0.06600955873727798, "learning_rate": 0.0007511849999999999, "loss": 1.853336715698242, "step": 50080 }, { "epoch": 0.00041, "grad_norm": 0.09208826720714569, "learning_rate": 0.0007514850000000001, "loss": 1.8564899444580079, "step": 50100 }, { "epoch": 0.000412, "grad_norm": 0.05692492425441742, "learning_rate": 0.000751785, "loss": 1.8583003997802734, "step": 50120 }, { "epoch": 0.000414, "grad_norm": 0.09818264096975327, "learning_rate": 0.000752085, "loss": 1.851161575317383, "step": 50140 }, { "epoch": 0.000416, "grad_norm": 0.11614762246608734, "learning_rate": 0.000752385, "loss": 1.8539705276489258, "step": 50160 }, { "epoch": 0.000418, "grad_norm": 0.06572745740413666, "learning_rate": 0.0007526849999999999, "loss": 1.862236785888672, "step": 50180 }, { "epoch": 0.00042, "grad_norm": 0.08823873102664948, "learning_rate": 0.0007529850000000001, "loss": 1.8488019943237304, "step": 50200 }, { "epoch": 0.000422, "grad_norm": 0.06876957416534424, "learning_rate": 0.000753285, "loss": 1.854522132873535, "step": 50220 }, { "epoch": 0.000424, "grad_norm": 0.1036091297864914, "learning_rate": 0.000753585, "loss": 1.8490419387817383, "step": 50240 }, { "epoch": 0.000426, "grad_norm": 0.08654841780662537, "learning_rate": 0.000753885, "loss": 1.8570022583007812, "step": 50260 }, { "epoch": 0.000428, "grad_norm": 0.0797325074672699, "learning_rate": 0.000754185, "loss": 1.852284049987793, "step": 50280 }, { "epoch": 0.00043, "grad_norm": 0.09358066320419312, "learning_rate": 0.000754485, "loss": 1.845249557495117, "step": 50300 }, { "epoch": 0.000432, "grad_norm": 0.09743467718362808, "learning_rate": 0.000754785, "loss": 1.8510974884033202, "step": 50320 }, { "epoch": 0.000434, "grad_norm": 0.07994414120912552, "learning_rate": 0.0007550850000000001, "loss": 1.8470056533813477, "step": 50340 }, { "epoch": 0.000436, "grad_norm": 0.07373213022947311, "learning_rate": 0.000755385, "loss": 1.8472797393798828, "step": 50360 }, { "epoch": 0.000438, "grad_norm": 0.07436708360910416, "learning_rate": 0.000755685, "loss": 1.8461109161376954, "step": 50380 }, { "epoch": 0.00044, "grad_norm": 0.06742985546588898, "learning_rate": 0.0007559850000000001, "loss": 1.8556638717651368, "step": 50400 }, { "epoch": 0.000442, "grad_norm": 0.07899279147386551, "learning_rate": 0.0007562850000000001, "loss": 1.8491823196411132, "step": 50420 }, { "epoch": 0.000444, "grad_norm": 0.0626215934753418, "learning_rate": 0.000756585, "loss": 1.8468595504760743, "step": 50440 }, { "epoch": 0.000446, "grad_norm": 0.07054529339075089, "learning_rate": 0.000756885, "loss": 1.8442632675170898, "step": 50460 }, { "epoch": 0.000448, "grad_norm": 0.08473960310220718, "learning_rate": 0.000757185, "loss": 1.8389867782592773, "step": 50480 }, { "epoch": 0.00045, "grad_norm": 0.08779094368219376, "learning_rate": 0.0007574850000000001, "loss": 1.847212028503418, "step": 50500 }, { "epoch": 0.000452, "grad_norm": 0.06304117292165756, "learning_rate": 0.0007577850000000001, "loss": 1.838887596130371, "step": 50520 }, { "epoch": 0.000454, "grad_norm": 0.07276386022567749, "learning_rate": 0.000758085, "loss": 1.8409353256225587, "step": 50540 }, { "epoch": 0.000456, "grad_norm": 0.07081222534179688, "learning_rate": 0.000758385, "loss": 1.8434917449951171, "step": 50560 }, { "epoch": 0.000458, "grad_norm": 0.09153230488300323, "learning_rate": 0.0007586849999999999, "loss": 1.8405410766601562, "step": 50580 }, { "epoch": 0.00046, "grad_norm": 0.08038565516471863, "learning_rate": 0.0007589850000000001, "loss": 1.8444704055786132, "step": 50600 }, { "epoch": 0.000462, "grad_norm": 0.08140019327402115, "learning_rate": 0.0007592850000000001, "loss": 1.8456674575805665, "step": 50620 }, { "epoch": 0.000464, "grad_norm": 0.07837044447660446, "learning_rate": 0.000759585, "loss": 1.8389007568359375, "step": 50640 }, { "epoch": 0.000466, "grad_norm": 0.08453674614429474, "learning_rate": 0.000759885, "loss": 1.8354032516479493, "step": 50660 }, { "epoch": 0.000468, "grad_norm": 0.08782172948122025, "learning_rate": 0.0007601849999999999, "loss": 1.8379409790039063, "step": 50680 }, { "epoch": 0.00047, "grad_norm": 0.06480462849140167, "learning_rate": 0.0007604850000000001, "loss": 1.8450876235961915, "step": 50700 }, { "epoch": 0.000472, "grad_norm": 0.09490370750427246, "learning_rate": 0.000760785, "loss": 1.8424947738647461, "step": 50720 }, { "epoch": 0.000474, "grad_norm": 0.09134998172521591, "learning_rate": 0.000761085, "loss": 1.8489044189453125, "step": 50740 }, { "epoch": 0.000476, "grad_norm": 0.08516672253608704, "learning_rate": 0.000761385, "loss": 1.8510494232177734, "step": 50760 }, { "epoch": 0.000478, "grad_norm": 0.09990148991346359, "learning_rate": 0.000761685, "loss": 1.8433395385742188, "step": 50780 }, { "epoch": 0.00048, "grad_norm": 0.07432044297456741, "learning_rate": 0.0007619850000000001, "loss": 1.8616621017456054, "step": 50800 }, { "epoch": 0.000482, "grad_norm": 0.07730050384998322, "learning_rate": 0.000762285, "loss": 1.857870101928711, "step": 50820 }, { "epoch": 0.000484, "grad_norm": 0.09263300895690918, "learning_rate": 0.000762585, "loss": 1.852854347229004, "step": 50840 }, { "epoch": 0.000486, "grad_norm": 0.1193644255399704, "learning_rate": 0.000762885, "loss": 1.8558570861816406, "step": 50860 }, { "epoch": 0.000488, "grad_norm": 0.06789831817150116, "learning_rate": 0.000763185, "loss": 1.8561784744262695, "step": 50880 }, { "epoch": 0.00049, "grad_norm": 0.09891850501298904, "learning_rate": 0.000763485, "loss": 1.8547218322753907, "step": 50900 }, { "epoch": 0.000492, "grad_norm": 0.07384803146123886, "learning_rate": 0.0007637850000000001, "loss": 1.856735610961914, "step": 50920 }, { "epoch": 0.000494, "grad_norm": 0.07126709073781967, "learning_rate": 0.0007640850000000001, "loss": 1.855617141723633, "step": 50940 }, { "epoch": 0.000496, "grad_norm": 0.0794643834233284, "learning_rate": 0.000764385, "loss": 1.851529312133789, "step": 50960 }, { "epoch": 0.000498, "grad_norm": 0.07430235296487808, "learning_rate": 0.000764685, "loss": 1.84918270111084, "step": 50980 }, { "epoch": 0.0005, "grad_norm": 0.05850321426987648, "learning_rate": 0.0007649850000000001, "loss": 1.8446617126464844, "step": 51000 }, { "epoch": 0.0005, "eval_loss": 1.8034069538116455, "eval_runtime": 99.2653, "eval_samples_per_second": 10.074, "eval_steps_per_second": 10.074, "step": 51000 }, { "epoch": 0.000502, "grad_norm": 0.07530247420072556, "learning_rate": 0.0007652850000000001, "loss": 1.8506610870361329, "step": 51020 }, { "epoch": 0.000504, "grad_norm": 0.11097286641597748, "learning_rate": 0.000765585, "loss": 1.8453807830810547, "step": 51040 }, { "epoch": 0.000506, "grad_norm": 0.06734902411699295, "learning_rate": 0.000765885, "loss": 1.8480216979980468, "step": 51060 }, { "epoch": 0.000508, "grad_norm": 0.08474509418010712, "learning_rate": 0.000766185, "loss": 1.847792625427246, "step": 51080 }, { "epoch": 0.00051, "grad_norm": 0.07088479399681091, "learning_rate": 0.0007664850000000001, "loss": 1.8439413070678712, "step": 51100 }, { "epoch": 0.000512, "grad_norm": 0.08443014323711395, "learning_rate": 0.0007667850000000001, "loss": 1.8392679214477539, "step": 51120 }, { "epoch": 0.000514, "grad_norm": 0.07145456969738007, "learning_rate": 0.000767085, "loss": 1.840279769897461, "step": 51140 }, { "epoch": 0.000516, "grad_norm": 0.07933073490858078, "learning_rate": 0.000767385, "loss": 1.8390647888183593, "step": 51160 }, { "epoch": 0.000518, "grad_norm": 0.0909983366727829, "learning_rate": 0.0007676849999999999, "loss": 1.846038246154785, "step": 51180 }, { "epoch": 0.00052, "grad_norm": 0.06586463749408722, "learning_rate": 0.0007679849999999999, "loss": 1.841064453125, "step": 51200 }, { "epoch": 0.000522, "grad_norm": 0.10752559453248978, "learning_rate": 0.0007682850000000001, "loss": 1.8423982620239259, "step": 51220 }, { "epoch": 0.000524, "grad_norm": 0.09651283174753189, "learning_rate": 0.000768585, "loss": 1.8416040420532227, "step": 51240 }, { "epoch": 0.000526, "grad_norm": 0.08183816075325012, "learning_rate": 0.000768885, "loss": 1.832880401611328, "step": 51260 }, { "epoch": 0.000528, "grad_norm": 0.08817758411169052, "learning_rate": 0.0007691849999999999, "loss": 1.8434953689575195, "step": 51280 }, { "epoch": 0.00053, "grad_norm": 0.09007537364959717, "learning_rate": 0.000769485, "loss": 1.83581485748291, "step": 51300 }, { "epoch": 0.000532, "grad_norm": 0.06463437527418137, "learning_rate": 0.000769785, "loss": 1.8326082229614258, "step": 51320 }, { "epoch": 0.000534, "grad_norm": 0.09915205091238022, "learning_rate": 0.000770085, "loss": 1.832014274597168, "step": 51340 }, { "epoch": 0.000536, "grad_norm": 0.06702706217765808, "learning_rate": 0.000770385, "loss": 1.8369335174560546, "step": 51360 }, { "epoch": 0.000538, "grad_norm": 0.08649089932441711, "learning_rate": 0.000770685, "loss": 1.8364547729492187, "step": 51380 }, { "epoch": 0.00054, "grad_norm": 0.0951608344912529, "learning_rate": 0.000770985, "loss": 1.8306005477905274, "step": 51400 }, { "epoch": 0.000542, "grad_norm": 0.09944529086351395, "learning_rate": 0.000771285, "loss": 1.8428287506103516, "step": 51420 }, { "epoch": 0.000544, "grad_norm": 0.07423659414052963, "learning_rate": 0.0007715850000000001, "loss": 1.8415821075439454, "step": 51440 }, { "epoch": 0.000546, "grad_norm": 0.08337030559778214, "learning_rate": 0.000771885, "loss": 1.8288591384887696, "step": 51460 }, { "epoch": 0.000548, "grad_norm": 0.06490614265203476, "learning_rate": 0.000772185, "loss": 1.8359104156494142, "step": 51480 }, { "epoch": 0.00055, "grad_norm": 0.09034062176942825, "learning_rate": 0.000772485, "loss": 1.8376876831054687, "step": 51500 }, { "epoch": 0.000552, "grad_norm": 0.11499785631895065, "learning_rate": 0.0007727850000000001, "loss": 1.8324405670166015, "step": 51520 }, { "epoch": 0.000554, "grad_norm": 0.10064467787742615, "learning_rate": 0.0007730850000000001, "loss": 1.8379056930541993, "step": 51540 }, { "epoch": 0.000556, "grad_norm": 0.08637844771146774, "learning_rate": 0.000773385, "loss": 1.8284292221069336, "step": 51560 }, { "epoch": 0.000558, "grad_norm": 0.08579288423061371, "learning_rate": 0.000773685, "loss": 1.8326189041137695, "step": 51580 }, { "epoch": 0.00056, "grad_norm": 0.08832810819149017, "learning_rate": 0.0007739849999999999, "loss": 1.827412223815918, "step": 51600 }, { "epoch": 0.000562, "grad_norm": 0.06998966634273529, "learning_rate": 0.0007742850000000001, "loss": 1.8301448822021484, "step": 51620 }, { "epoch": 0.000564, "grad_norm": 0.06854008883237839, "learning_rate": 0.000774585, "loss": 1.8331510543823242, "step": 51640 }, { "epoch": 0.000566, "grad_norm": 0.09752868115901947, "learning_rate": 0.000774885, "loss": 1.8248409271240233, "step": 51660 }, { "epoch": 0.000568, "grad_norm": 0.07244161516427994, "learning_rate": 0.000775185, "loss": 1.8324460983276367, "step": 51680 }, { "epoch": 0.00057, "grad_norm": 0.15373754501342773, "learning_rate": 0.0007754849999999999, "loss": 1.8331266403198243, "step": 51700 }, { "epoch": 0.000572, "grad_norm": 0.08941349387168884, "learning_rate": 0.0007757850000000001, "loss": 1.8267711639404296, "step": 51720 }, { "epoch": 0.000574, "grad_norm": 0.07003956288099289, "learning_rate": 0.000776085, "loss": 1.8321565628051757, "step": 51740 }, { "epoch": 0.000576, "grad_norm": 0.11117007583379745, "learning_rate": 0.000776385, "loss": 1.8288171768188477, "step": 51760 }, { "epoch": 0.000578, "grad_norm": 0.09099876880645752, "learning_rate": 0.0007766849999999999, "loss": 1.8312715530395507, "step": 51780 }, { "epoch": 0.00058, "grad_norm": 0.07872996479272842, "learning_rate": 0.0007769849999999999, "loss": 1.8285728454589845, "step": 51800 }, { "epoch": 0.000582, "grad_norm": 0.06602588295936584, "learning_rate": 0.0007772850000000001, "loss": 1.8299373626708983, "step": 51820 }, { "epoch": 0.000584, "grad_norm": 0.09315641224384308, "learning_rate": 0.000777585, "loss": 1.8216743469238281, "step": 51840 }, { "epoch": 0.000586, "grad_norm": 0.07509292662143707, "learning_rate": 0.000777885, "loss": 1.8301273345947267, "step": 51860 }, { "epoch": 0.000588, "grad_norm": 0.06267867982387543, "learning_rate": 0.0007781849999999999, "loss": 1.8248620986938477, "step": 51880 }, { "epoch": 0.00059, "grad_norm": 0.07973038405179977, "learning_rate": 0.000778485, "loss": 1.8356369018554688, "step": 51900 }, { "epoch": 0.000592, "grad_norm": 0.08409136533737183, "learning_rate": 0.000778785, "loss": 1.843098258972168, "step": 51920 }, { "epoch": 0.000594, "grad_norm": 0.0873011127114296, "learning_rate": 0.000779085, "loss": 1.8354225158691406, "step": 51940 }, { "epoch": 0.000596, "grad_norm": 0.07883521914482117, "learning_rate": 0.0007793850000000001, "loss": 1.8480518341064454, "step": 51960 }, { "epoch": 0.000598, "grad_norm": 0.0805177241563797, "learning_rate": 0.000779685, "loss": 1.8400152206420899, "step": 51980 }, { "epoch": 0.0006, "grad_norm": 0.08319337666034698, "learning_rate": 0.000779985, "loss": 1.8391363143920898, "step": 52000 }, { "epoch": 0.0006, "eval_loss": 1.7966078519821167, "eval_runtime": 99.67, "eval_samples_per_second": 10.033, "eval_steps_per_second": 10.033, "step": 52000 }, { "epoch": 0.000602, "grad_norm": 0.07502605020999908, "learning_rate": 0.000780285, "loss": 1.846877098083496, "step": 52020 }, { "epoch": 0.000604, "grad_norm": 0.09582391381263733, "learning_rate": 0.0007805850000000001, "loss": 1.8414690017700195, "step": 52040 }, { "epoch": 0.000606, "grad_norm": 0.0701102539896965, "learning_rate": 0.000780885, "loss": 1.829909896850586, "step": 52060 }, { "epoch": 0.000608, "grad_norm": 0.08239813148975372, "learning_rate": 0.000781185, "loss": 1.8336013793945312, "step": 52080 }, { "epoch": 0.00061, "grad_norm": 0.07423824071884155, "learning_rate": 0.000781485, "loss": 1.8355764389038085, "step": 52100 }, { "epoch": 0.000612, "grad_norm": 0.0922013521194458, "learning_rate": 0.0007817850000000001, "loss": 1.8389268875122071, "step": 52120 }, { "epoch": 0.000614, "grad_norm": 0.09734614938497543, "learning_rate": 0.0007820850000000001, "loss": 1.8420366287231444, "step": 52140 }, { "epoch": 0.000616, "grad_norm": 0.0785527154803276, "learning_rate": 0.000782385, "loss": 1.8435489654541015, "step": 52160 }, { "epoch": 0.000618, "grad_norm": 0.07604758441448212, "learning_rate": 0.000782685, "loss": 1.8343082427978517, "step": 52180 }, { "epoch": 0.00062, "grad_norm": 0.09369660168886185, "learning_rate": 0.0007829849999999999, "loss": 1.832362747192383, "step": 52200 }, { "epoch": 0.000622, "grad_norm": 0.06830932945013046, "learning_rate": 0.0007832850000000001, "loss": 1.8346200942993165, "step": 52220 }, { "epoch": 0.000624, "grad_norm": 0.08439896255731583, "learning_rate": 0.000783585, "loss": 1.8268022537231445, "step": 52240 }, { "epoch": 0.000626, "grad_norm": 0.08515721559524536, "learning_rate": 0.000783885, "loss": 1.8351348876953124, "step": 52260 }, { "epoch": 0.000628, "grad_norm": 0.0754883736371994, "learning_rate": 0.000784185, "loss": 1.83795166015625, "step": 52280 }, { "epoch": 0.00063, "grad_norm": 0.132758229970932, "learning_rate": 0.0007844849999999999, "loss": 1.8354440689086915, "step": 52300 }, { "epoch": 0.000632, "grad_norm": 0.08209332078695297, "learning_rate": 0.0007847850000000001, "loss": 1.8279428482055664, "step": 52320 }, { "epoch": 0.000634, "grad_norm": 0.08820170909166336, "learning_rate": 0.000785085, "loss": 1.8352716445922852, "step": 52340 }, { "epoch": 0.000636, "grad_norm": 0.09391432255506516, "learning_rate": 0.000785385, "loss": 1.838319969177246, "step": 52360 }, { "epoch": 0.000638, "grad_norm": 0.0945584699511528, "learning_rate": 0.0007856849999999999, "loss": 1.8296791076660157, "step": 52380 }, { "epoch": 0.00064, "grad_norm": 0.06577519327402115, "learning_rate": 0.000785985, "loss": 1.8366313934326173, "step": 52400 }, { "epoch": 0.000642, "grad_norm": 0.10168013721704483, "learning_rate": 0.0007862850000000001, "loss": 1.829878044128418, "step": 52420 }, { "epoch": 0.000644, "grad_norm": 0.10518037527799606, "learning_rate": 0.000786585, "loss": 1.8307470321655273, "step": 52440 }, { "epoch": 0.000646, "grad_norm": 0.10130952298641205, "learning_rate": 0.000786885, "loss": 1.822878646850586, "step": 52460 }, { "epoch": 0.000648, "grad_norm": 0.10156406462192535, "learning_rate": 0.000787185, "loss": 1.8218299865722656, "step": 52480 }, { "epoch": 0.00065, "grad_norm": 0.1337849199771881, "learning_rate": 0.000787485, "loss": 1.8343978881835938, "step": 52500 }, { "epoch": 0.000652, "grad_norm": 0.11971254646778107, "learning_rate": 0.000787785, "loss": 1.8258487701416015, "step": 52520 }, { "epoch": 0.000654, "grad_norm": 0.08975455164909363, "learning_rate": 0.000788085, "loss": 1.8330595016479492, "step": 52540 }, { "epoch": 0.000656, "grad_norm": 0.10773259401321411, "learning_rate": 0.0007883850000000001, "loss": 1.8237396240234376, "step": 52560 }, { "epoch": 0.000658, "grad_norm": 0.08031214028596878, "learning_rate": 0.000788685, "loss": 1.8248126983642579, "step": 52580 }, { "epoch": 0.00066, "grad_norm": 0.10008715838193893, "learning_rate": 0.000788985, "loss": 1.8211429595947266, "step": 52600 }, { "epoch": 0.000662, "grad_norm": 0.0784764438867569, "learning_rate": 0.0007892850000000001, "loss": 1.8209182739257812, "step": 52620 }, { "epoch": 0.000664, "grad_norm": 0.07093469053506851, "learning_rate": 0.0007895850000000001, "loss": 1.827080535888672, "step": 52640 }, { "epoch": 0.000666, "grad_norm": 0.08998201787471771, "learning_rate": 0.000789885, "loss": 1.8244873046875, "step": 52660 }, { "epoch": 0.000668, "grad_norm": 0.06582771241664886, "learning_rate": 0.000790185, "loss": 1.8138311386108399, "step": 52680 }, { "epoch": 0.00067, "grad_norm": 0.0939745232462883, "learning_rate": 0.000790485, "loss": 1.8177841186523438, "step": 52700 }, { "epoch": 0.000672, "grad_norm": 0.09036336094141006, "learning_rate": 0.0007907850000000001, "loss": 1.8163984298706055, "step": 52720 }, { "epoch": 0.000674, "grad_norm": 0.10736818611621857, "learning_rate": 0.0007910850000000001, "loss": 1.817758560180664, "step": 52740 }, { "epoch": 0.000676, "grad_norm": 0.14584214985370636, "learning_rate": 0.000791385, "loss": 1.8186847686767578, "step": 52760 }, { "epoch": 0.000678, "grad_norm": 0.09771035611629486, "learning_rate": 0.000791685, "loss": 1.828989601135254, "step": 52780 }, { "epoch": 0.00068, "grad_norm": 0.0757264718413353, "learning_rate": 0.0007919849999999999, "loss": 1.8295337677001953, "step": 52800 }, { "epoch": 0.000682, "grad_norm": 0.0830211341381073, "learning_rate": 0.0007922850000000001, "loss": 1.816922950744629, "step": 52820 }, { "epoch": 0.000684, "grad_norm": 0.13753241300582886, "learning_rate": 0.0007925850000000001, "loss": 1.8184217453002929, "step": 52840 }, { "epoch": 0.000686, "grad_norm": 0.08165712654590607, "learning_rate": 0.000792885, "loss": 1.8111629486083984, "step": 52860 }, { "epoch": 0.000688, "grad_norm": 0.08611007779836655, "learning_rate": 0.000793185, "loss": 1.8186038970947265, "step": 52880 }, { "epoch": 0.00069, "grad_norm": 0.08151885122060776, "learning_rate": 0.0007934849999999999, "loss": 1.8108427047729492, "step": 52900 }, { "epoch": 0.000692, "grad_norm": 0.07097958028316498, "learning_rate": 0.0007937850000000001, "loss": 1.8154457092285157, "step": 52920 }, { "epoch": 0.000694, "grad_norm": 0.06560239940881729, "learning_rate": 0.000794085, "loss": 1.8204071044921875, "step": 52940 }, { "epoch": 0.000696, "grad_norm": 0.0753859281539917, "learning_rate": 0.000794385, "loss": 1.8198514938354493, "step": 52960 }, { "epoch": 0.000698, "grad_norm": 0.14132261276245117, "learning_rate": 0.0007946849999999999, "loss": 1.8124382019042968, "step": 52980 }, { "epoch": 0.0007, "grad_norm": 0.07146037369966507, "learning_rate": 0.000794985, "loss": 1.8026058197021484, "step": 53000 }, { "epoch": 0.0007, "eval_loss": 1.7909702062606812, "eval_runtime": 98.0311, "eval_samples_per_second": 10.201, "eval_steps_per_second": 10.201, "step": 53000 }, { "epoch": 0.000702, "grad_norm": 0.06795086711645126, "learning_rate": 0.0007952850000000001, "loss": 1.8154428482055665, "step": 53020 }, { "epoch": 0.000704, "grad_norm": 0.09198163449764252, "learning_rate": 0.000795585, "loss": 1.8090250015258789, "step": 53040 }, { "epoch": 0.000706, "grad_norm": 0.07970103621482849, "learning_rate": 0.000795885, "loss": 1.8174896240234375, "step": 53060 }, { "epoch": 0.000708, "grad_norm": 0.09615591913461685, "learning_rate": 0.000796185, "loss": 1.820881462097168, "step": 53080 }, { "epoch": 0.00071, "grad_norm": 0.09093371033668518, "learning_rate": 0.000796485, "loss": 1.8219066619873048, "step": 53100 }, { "epoch": 0.000712, "grad_norm": 0.10867125540971756, "learning_rate": 0.000796785, "loss": 1.8259807586669923, "step": 53120 }, { "epoch": 0.000714, "grad_norm": 0.1117551326751709, "learning_rate": 0.0007970850000000001, "loss": 1.8272289276123046, "step": 53140 }, { "epoch": 0.000716, "grad_norm": 0.09976839274168015, "learning_rate": 0.0007973850000000001, "loss": 1.8372200012207032, "step": 53160 }, { "epoch": 0.000718, "grad_norm": 0.05409502238035202, "learning_rate": 0.000797685, "loss": 1.8297842025756836, "step": 53180 }, { "epoch": 0.00072, "grad_norm": 0.09373551607131958, "learning_rate": 0.000797985, "loss": 1.8313852310180665, "step": 53200 }, { "epoch": 0.000722, "grad_norm": 0.06937111169099808, "learning_rate": 0.0007982850000000001, "loss": 1.8413938522338866, "step": 53220 }, { "epoch": 0.000724, "grad_norm": 0.10701680183410645, "learning_rate": 0.0007985850000000001, "loss": 1.830308723449707, "step": 53240 }, { "epoch": 0.000726, "grad_norm": 0.1108751967549324, "learning_rate": 0.000798885, "loss": 1.838094139099121, "step": 53260 }, { "epoch": 0.000728, "grad_norm": 0.07272954285144806, "learning_rate": 0.000799185, "loss": 1.8260072708129882, "step": 53280 }, { "epoch": 0.00073, "grad_norm": 0.08393100649118423, "learning_rate": 0.000799485, "loss": 1.8310443878173828, "step": 53300 }, { "epoch": 0.000732, "grad_norm": 0.09824348986148834, "learning_rate": 0.0007997850000000001, "loss": 1.8303199768066407, "step": 53320 }, { "epoch": 0.000734, "grad_norm": 0.08609996736049652, "learning_rate": 0.0008000850000000001, "loss": 1.836837387084961, "step": 53340 }, { "epoch": 0.000736, "grad_norm": 0.12561504542827606, "learning_rate": 0.000800385, "loss": 1.8288450241088867, "step": 53360 }, { "epoch": 0.000738, "grad_norm": 0.09802212566137314, "learning_rate": 0.000800685, "loss": 1.8354440689086915, "step": 53380 }, { "epoch": 0.00074, "grad_norm": 0.08278319239616394, "learning_rate": 0.0008009849999999999, "loss": 1.8270971298217773, "step": 53400 }, { "epoch": 0.000742, "grad_norm": 0.13082146644592285, "learning_rate": 0.0008012850000000001, "loss": 1.8322364807128906, "step": 53420 }, { "epoch": 0.000744, "grad_norm": 0.07086450606584549, "learning_rate": 0.0008015850000000001, "loss": 1.826413917541504, "step": 53440 }, { "epoch": 0.000746, "grad_norm": 0.10642746835947037, "learning_rate": 0.000801885, "loss": 1.8282964706420899, "step": 53460 }, { "epoch": 0.000748, "grad_norm": 0.08327937126159668, "learning_rate": 0.000802185, "loss": 1.826943588256836, "step": 53480 }, { "epoch": 0.00075, "grad_norm": 0.10795646160840988, "learning_rate": 0.0008024849999999999, "loss": 1.8284631729125977, "step": 53500 }, { "epoch": 0.000752, "grad_norm": 0.08492525666952133, "learning_rate": 0.0008027850000000001, "loss": 1.8233604431152344, "step": 53520 }, { "epoch": 0.000754, "grad_norm": 0.06594720482826233, "learning_rate": 0.000803085, "loss": 1.8216796875, "step": 53540 }, { "epoch": 0.000756, "grad_norm": 0.12677860260009766, "learning_rate": 0.000803385, "loss": 1.8157302856445312, "step": 53560 }, { "epoch": 0.000758, "grad_norm": 0.09722927212715149, "learning_rate": 0.000803685, "loss": 1.8294761657714844, "step": 53580 }, { "epoch": 0.00076, "grad_norm": 0.11191555112600327, "learning_rate": 0.000803985, "loss": 1.8252492904663087, "step": 53600 }, { "epoch": 0.000762, "grad_norm": 0.11013641208410263, "learning_rate": 0.0008042850000000001, "loss": 1.8220636367797851, "step": 53620 }, { "epoch": 0.000764, "grad_norm": 0.07095854729413986, "learning_rate": 0.000804585, "loss": 1.818947982788086, "step": 53640 }, { "epoch": 0.000766, "grad_norm": 0.07869666814804077, "learning_rate": 0.0008048850000000001, "loss": 1.8186241149902345, "step": 53660 }, { "epoch": 0.000768, "grad_norm": 0.13918404281139374, "learning_rate": 0.000805185, "loss": 1.825152587890625, "step": 53680 }, { "epoch": 0.00077, "grad_norm": 0.08962216973304749, "learning_rate": 0.000805485, "loss": 1.821095848083496, "step": 53700 }, { "epoch": 0.000772, "grad_norm": 0.06319589167833328, "learning_rate": 0.0008057849999999999, "loss": 1.8147672653198241, "step": 53720 }, { "epoch": 0.000774, "grad_norm": 0.06963087618350983, "learning_rate": 0.0008060850000000001, "loss": 1.8127172470092774, "step": 53740 }, { "epoch": 0.000776, "grad_norm": 0.099605992436409, "learning_rate": 0.0008063850000000001, "loss": 1.8179948806762696, "step": 53760 }, { "epoch": 0.000778, "grad_norm": 0.13146516680717468, "learning_rate": 0.000806685, "loss": 1.8190895080566407, "step": 53780 }, { "epoch": 0.00078, "grad_norm": 0.09383892267942429, "learning_rate": 0.000806985, "loss": 1.8101465225219726, "step": 53800 }, { "epoch": 0.000782, "grad_norm": 0.06841962784528732, "learning_rate": 0.0008072849999999999, "loss": 1.8121726989746094, "step": 53820 }, { "epoch": 0.000784, "grad_norm": 0.09442818909883499, "learning_rate": 0.0008075850000000001, "loss": 1.8150535583496095, "step": 53840 }, { "epoch": 0.000786, "grad_norm": 0.07694031298160553, "learning_rate": 0.000807885, "loss": 1.8190279006958008, "step": 53860 }, { "epoch": 0.000788, "grad_norm": 0.087990403175354, "learning_rate": 0.000808185, "loss": 1.8216196060180665, "step": 53880 }, { "epoch": 0.00079, "grad_norm": 0.08122462034225464, "learning_rate": 0.000808485, "loss": 1.81506404876709, "step": 53900 }, { "epoch": 0.000792, "grad_norm": 0.08414269983768463, "learning_rate": 0.0008087849999999999, "loss": 1.8170902252197265, "step": 53920 }, { "epoch": 0.000794, "grad_norm": 0.10983981192111969, "learning_rate": 0.0008090850000000001, "loss": 1.8090068817138671, "step": 53940 }, { "epoch": 0.000796, "grad_norm": 0.10096807777881622, "learning_rate": 0.000809385, "loss": 1.812697982788086, "step": 53960 }, { "epoch": 0.000798, "grad_norm": 0.10480429977178574, "learning_rate": 0.000809685, "loss": 1.8131752014160156, "step": 53980 }, { "epoch": 0.0008, "grad_norm": 0.0834827795624733, "learning_rate": 0.0008099849999999999, "loss": 1.8161527633666992, "step": 54000 }, { "epoch": 0.0008, "eval_loss": 1.7843924760818481, "eval_runtime": 101.0883, "eval_samples_per_second": 9.892, "eval_steps_per_second": 9.892, "step": 54000 }, { "epoch": 0.000802, "grad_norm": 0.09298814833164215, "learning_rate": 0.0008102849999999999, "loss": 1.8114311218261718, "step": 54020 }, { "epoch": 0.000804, "grad_norm": 0.0750308409333229, "learning_rate": 0.0008105850000000001, "loss": 1.813578224182129, "step": 54040 }, { "epoch": 0.000806, "grad_norm": 0.08869277685880661, "learning_rate": 0.000810885, "loss": 1.8096160888671875, "step": 54060 }, { "epoch": 0.000808, "grad_norm": 0.08057360351085663, "learning_rate": 0.000811185, "loss": 1.8082204818725587, "step": 54080 }, { "epoch": 0.00081, "grad_norm": 0.07752317935228348, "learning_rate": 0.0008114849999999999, "loss": 1.809225082397461, "step": 54100 }, { "epoch": 0.000812, "grad_norm": 0.10853946208953857, "learning_rate": 0.000811785, "loss": 1.8025445938110352, "step": 54120 }, { "epoch": 0.000814, "grad_norm": 0.08279047906398773, "learning_rate": 0.000812085, "loss": 1.8129579544067382, "step": 54140 }, { "epoch": 0.000816, "grad_norm": 0.08732631057500839, "learning_rate": 0.000812385, "loss": 1.821772003173828, "step": 54160 }, { "epoch": 0.000818, "grad_norm": 0.06940227001905441, "learning_rate": 0.0008126850000000001, "loss": 1.8139148712158204, "step": 54180 }, { "epoch": 0.00082, "grad_norm": 0.09871824830770493, "learning_rate": 0.000812985, "loss": 1.8094743728637694, "step": 54200 }, { "epoch": 0.000822, "grad_norm": 0.0697028711438179, "learning_rate": 0.000813285, "loss": 1.8084943771362305, "step": 54220 }, { "epoch": 0.000824, "grad_norm": 0.10332415997982025, "learning_rate": 0.000813585, "loss": 1.8151615142822266, "step": 54240 }, { "epoch": 0.000826, "grad_norm": 0.12199199944734573, "learning_rate": 0.0008138850000000001, "loss": 1.81812744140625, "step": 54260 }, { "epoch": 0.000828, "grad_norm": 0.07809198647737503, "learning_rate": 0.000814185, "loss": 1.8145551681518555, "step": 54280 }, { "epoch": 0.00083, "grad_norm": 0.07807798683643341, "learning_rate": 0.000814485, "loss": 1.8237224578857423, "step": 54300 }, { "epoch": 0.000832, "grad_norm": 0.09394682198762894, "learning_rate": 0.0008147849999999999, "loss": 1.823185920715332, "step": 54320 }, { "epoch": 0.000834, "grad_norm": 0.07117526233196259, "learning_rate": 0.0008150850000000001, "loss": 1.8289709091186523, "step": 54340 }, { "epoch": 0.000836, "grad_norm": 0.09141800552606583, "learning_rate": 0.0008153850000000001, "loss": 1.8260204315185546, "step": 54360 }, { "epoch": 0.000838, "grad_norm": 0.08138151466846466, "learning_rate": 0.000815685, "loss": 1.8253677368164063, "step": 54380 }, { "epoch": 0.00084, "grad_norm": 0.1094491258263588, "learning_rate": 0.000815985, "loss": 1.8203096389770508, "step": 54400 }, { "epoch": 0.000842, "grad_norm": 0.11064698547124863, "learning_rate": 0.0008162849999999999, "loss": 1.82598876953125, "step": 54420 }, { "epoch": 0.000844, "grad_norm": 0.0654069036245346, "learning_rate": 0.0008165850000000001, "loss": 1.8315662384033202, "step": 54440 }, { "epoch": 0.000846, "grad_norm": 0.08133042603731155, "learning_rate": 0.000816885, "loss": 1.8194246292114258, "step": 54460 }, { "epoch": 0.000848, "grad_norm": 0.10478977859020233, "learning_rate": 0.000817185, "loss": 1.829688835144043, "step": 54480 }, { "epoch": 0.00085, "grad_norm": 0.07572335749864578, "learning_rate": 0.000817485, "loss": 1.8275995254516602, "step": 54500 }, { "epoch": 0.000852, "grad_norm": 0.07680771499872208, "learning_rate": 0.0008177849999999999, "loss": 1.8319358825683594, "step": 54520 }, { "epoch": 0.000854, "grad_norm": 0.07684208452701569, "learning_rate": 0.0008180850000000001, "loss": 1.8229276657104492, "step": 54540 }, { "epoch": 0.000856, "grad_norm": 0.09422148764133453, "learning_rate": 0.000818385, "loss": 1.8243440628051757, "step": 54560 }, { "epoch": 0.000858, "grad_norm": 0.10780831426382065, "learning_rate": 0.000818685, "loss": 1.823923110961914, "step": 54580 }, { "epoch": 0.00086, "grad_norm": 0.07486619055271149, "learning_rate": 0.0008189849999999999, "loss": 1.8238357543945312, "step": 54600 }, { "epoch": 0.000862, "grad_norm": 0.07407692819833755, "learning_rate": 0.000819285, "loss": 1.8205194473266602, "step": 54620 }, { "epoch": 0.000864, "grad_norm": 0.09588978439569473, "learning_rate": 0.0008195850000000001, "loss": 1.8264301300048829, "step": 54640 }, { "epoch": 0.000866, "grad_norm": 0.06922370940446854, "learning_rate": 0.000819885, "loss": 1.8174089431762694, "step": 54660 }, { "epoch": 0.000868, "grad_norm": 0.06955870240926743, "learning_rate": 0.000820185, "loss": 1.8233623504638672, "step": 54680 }, { "epoch": 0.00087, "grad_norm": 0.09113681316375732, "learning_rate": 0.000820485, "loss": 1.8206260681152344, "step": 54700 }, { "epoch": 0.000872, "grad_norm": 0.11233562231063843, "learning_rate": 0.000820785, "loss": 1.8202404022216796, "step": 54720 }, { "epoch": 0.000874, "grad_norm": 0.0829581469297409, "learning_rate": 0.000821085, "loss": 1.8094083786010742, "step": 54740 }, { "epoch": 0.000876, "grad_norm": 0.11381429433822632, "learning_rate": 0.000821385, "loss": 1.8112443923950194, "step": 54760 }, { "epoch": 0.000878, "grad_norm": 0.0887814611196518, "learning_rate": 0.0008216850000000001, "loss": 1.8204311370849608, "step": 54780 }, { "epoch": 0.00088, "grad_norm": 0.06194445863366127, "learning_rate": 0.000821985, "loss": 1.8063531875610352, "step": 54800 }, { "epoch": 0.000882, "grad_norm": 0.14742892980575562, "learning_rate": 0.000822285, "loss": 1.8119380950927735, "step": 54820 }, { "epoch": 0.000884, "grad_norm": 0.11888439953327179, "learning_rate": 0.0008225850000000001, "loss": 1.8191036224365233, "step": 54840 }, { "epoch": 0.000886, "grad_norm": 0.10441844910383224, "learning_rate": 0.0008228850000000001, "loss": 1.8138225555419922, "step": 54860 }, { "epoch": 0.000888, "grad_norm": 0.07273080199956894, "learning_rate": 0.000823185, "loss": 1.8145854949951172, "step": 54880 }, { "epoch": 0.00089, "grad_norm": 0.09075014293193817, "learning_rate": 0.000823485, "loss": 1.8046476364135742, "step": 54900 }, { "epoch": 0.000892, "grad_norm": 0.07432058453559875, "learning_rate": 0.000823785, "loss": 1.8108104705810546, "step": 54920 }, { "epoch": 0.000894, "grad_norm": 0.06345789134502411, "learning_rate": 0.0008240850000000001, "loss": 1.8109086990356444, "step": 54940 }, { "epoch": 0.000896, "grad_norm": 0.08759179711341858, "learning_rate": 0.0008243850000000001, "loss": 1.8053667068481445, "step": 54960 }, { "epoch": 0.000898, "grad_norm": 0.07735589891672134, "learning_rate": 0.000824685, "loss": 1.8095775604248048, "step": 54980 }, { "epoch": 0.0009, "grad_norm": 0.06968027353286743, "learning_rate": 0.000824985, "loss": 1.8140180587768555, "step": 55000 }, { "epoch": 0.0009, "eval_loss": 1.7782225608825684, "eval_runtime": 105.1123, "eval_samples_per_second": 9.514, "eval_steps_per_second": 9.514, "step": 55000 }, { "epoch": 0.000902, "grad_norm": 0.09342938661575317, "learning_rate": 0.0008252849999999999, "loss": 1.806143569946289, "step": 55020 }, { "epoch": 0.000904, "grad_norm": 0.12704946100711823, "learning_rate": 0.0008255850000000001, "loss": 1.8222143173217773, "step": 55040 }, { "epoch": 0.000906, "grad_norm": 0.08495233952999115, "learning_rate": 0.000825885, "loss": 1.8138565063476562, "step": 55060 }, { "epoch": 0.000908, "grad_norm": 0.0882241502404213, "learning_rate": 0.000826185, "loss": 1.816044807434082, "step": 55080 }, { "epoch": 0.00091, "grad_norm": 0.07508769631385803, "learning_rate": 0.000826485, "loss": 1.8081441879272462, "step": 55100 }, { "epoch": 0.000912, "grad_norm": 0.07477625459432602, "learning_rate": 0.0008267849999999999, "loss": 1.813369369506836, "step": 55120 }, { "epoch": 0.000914, "grad_norm": 0.10097239911556244, "learning_rate": 0.0008270850000000001, "loss": 1.807389259338379, "step": 55140 }, { "epoch": 0.000916, "grad_norm": 0.0737549215555191, "learning_rate": 0.000827385, "loss": 1.8057111740112304, "step": 55160 }, { "epoch": 0.000918, "grad_norm": 0.09195511788129807, "learning_rate": 0.000827685, "loss": 1.8020875930786133, "step": 55180 }, { "epoch": 0.00092, "grad_norm": 0.06454228609800339, "learning_rate": 0.0008279849999999999, "loss": 1.8037670135498047, "step": 55200 }, { "epoch": 0.000922, "grad_norm": 0.08498887717723846, "learning_rate": 0.000828285, "loss": 1.8082290649414063, "step": 55220 }, { "epoch": 0.000924, "grad_norm": 0.07089615613222122, "learning_rate": 0.0008285850000000001, "loss": 1.8005500793457032, "step": 55240 }, { "epoch": 0.000926, "grad_norm": 0.08960192650556564, "learning_rate": 0.000828885, "loss": 1.7943479537963867, "step": 55260 }, { "epoch": 0.000928, "grad_norm": 0.08665843307971954, "learning_rate": 0.000829185, "loss": 1.794640350341797, "step": 55280 }, { "epoch": 0.00093, "grad_norm": 0.08016286045312881, "learning_rate": 0.000829485, "loss": 1.8026283264160157, "step": 55300 }, { "epoch": 0.000932, "grad_norm": 0.06712556630373001, "learning_rate": 0.000829785, "loss": 1.7970748901367188, "step": 55320 }, { "epoch": 0.000934, "grad_norm": 0.09190410375595093, "learning_rate": 0.000830085, "loss": 1.7996068954467774, "step": 55340 }, { "epoch": 0.000936, "grad_norm": 0.06959818303585052, "learning_rate": 0.0008303850000000001, "loss": 1.8049400329589844, "step": 55360 }, { "epoch": 0.000938, "grad_norm": 0.09189862757921219, "learning_rate": 0.0008306850000000001, "loss": 1.8001893997192382, "step": 55380 }, { "epoch": 0.00094, "grad_norm": 0.0734458640217781, "learning_rate": 0.000830985, "loss": 1.8056737899780273, "step": 55400 }, { "epoch": 0.000942, "grad_norm": 0.08112155646085739, "learning_rate": 0.000831285, "loss": 1.8051637649536132, "step": 55420 }, { "epoch": 0.000944, "grad_norm": 0.10185881704092026, "learning_rate": 0.0008315850000000001, "loss": 1.8078388214111327, "step": 55440 }, { "epoch": 0.000946, "grad_norm": 0.07119335979223251, "learning_rate": 0.0008318850000000001, "loss": 1.8174514770507812, "step": 55460 }, { "epoch": 0.000948, "grad_norm": 0.06879117339849472, "learning_rate": 0.000832185, "loss": 1.8166082382202149, "step": 55480 }, { "epoch": 0.00095, "grad_norm": 0.07796020805835724, "learning_rate": 0.000832485, "loss": 1.811993408203125, "step": 55500 }, { "epoch": 0.000952, "grad_norm": 0.08357212692499161, "learning_rate": 0.000832785, "loss": 1.8183017730712892, "step": 55520 }, { "epoch": 0.000954, "grad_norm": 0.08831249177455902, "learning_rate": 0.0008330850000000001, "loss": 1.8182289123535156, "step": 55540 }, { "epoch": 0.000956, "grad_norm": 0.06869123876094818, "learning_rate": 0.0008333850000000001, "loss": 1.8175786972045898, "step": 55560 }, { "epoch": 0.000958, "grad_norm": 0.10531241446733475, "learning_rate": 0.000833685, "loss": 1.8232967376708984, "step": 55580 }, { "epoch": 0.00096, "grad_norm": 0.0827803835272789, "learning_rate": 0.000833985, "loss": 1.8102272033691407, "step": 55600 }, { "epoch": 0.000962, "grad_norm": 0.09131187945604324, "learning_rate": 0.0008342849999999999, "loss": 1.8116649627685546, "step": 55620 }, { "epoch": 0.000964, "grad_norm": 0.09667201340198517, "learning_rate": 0.0008345850000000001, "loss": 1.814039421081543, "step": 55640 }, { "epoch": 0.000966, "grad_norm": 0.08257482945919037, "learning_rate": 0.000834885, "loss": 1.8080272674560547, "step": 55660 }, { "epoch": 0.000968, "grad_norm": 0.1165599524974823, "learning_rate": 0.000835185, "loss": 1.8163698196411133, "step": 55680 }, { "epoch": 0.00097, "grad_norm": 0.08054927736520767, "learning_rate": 0.000835485, "loss": 1.820367431640625, "step": 55700 }, { "epoch": 0.000972, "grad_norm": 0.11378245800733566, "learning_rate": 0.0008357849999999999, "loss": 1.8148984909057617, "step": 55720 }, { "epoch": 0.000974, "grad_norm": 0.08413427323102951, "learning_rate": 0.0008360850000000001, "loss": 1.8135534286499024, "step": 55740 }, { "epoch": 0.000976, "grad_norm": 0.09522600471973419, "learning_rate": 0.000836385, "loss": 1.806572151184082, "step": 55760 }, { "epoch": 0.000978, "grad_norm": 0.12314817309379578, "learning_rate": 0.000836685, "loss": 1.8052108764648438, "step": 55780 }, { "epoch": 0.00098, "grad_norm": 0.12068308889865875, "learning_rate": 0.0008369849999999999, "loss": 1.8041009902954102, "step": 55800 }, { "epoch": 0.000982, "grad_norm": 0.06996431946754456, "learning_rate": 0.000837285, "loss": 1.8152761459350586, "step": 55820 }, { "epoch": 0.000984, "grad_norm": 0.09179938584566116, "learning_rate": 0.0008375850000000001, "loss": 1.8125650405883789, "step": 55840 }, { "epoch": 0.000986, "grad_norm": 0.09448322653770447, "learning_rate": 0.000837885, "loss": 1.8097614288330077, "step": 55860 }, { "epoch": 0.000988, "grad_norm": 0.09040167927742004, "learning_rate": 0.0008381850000000001, "loss": 1.8013286590576172, "step": 55880 }, { "epoch": 0.00099, "grad_norm": 0.08906266838312149, "learning_rate": 0.000838485, "loss": 1.8066373825073243, "step": 55900 }, { "epoch": 0.000992, "grad_norm": 0.1082487404346466, "learning_rate": 0.000838785, "loss": 1.8038511276245117, "step": 55920 }, { "epoch": 0.000994, "grad_norm": 0.09656911343336105, "learning_rate": 0.000839085, "loss": 1.8036479949951172, "step": 55940 }, { "epoch": 0.000996, "grad_norm": 0.10782207548618317, "learning_rate": 0.0008393850000000001, "loss": 1.8062810897827148, "step": 55960 }, { "epoch": 0.000998, "grad_norm": 0.0980667844414711, "learning_rate": 0.0008396850000000001, "loss": 1.806480598449707, "step": 55980 }, { "epoch": 0.001, "grad_norm": 0.07666339725255966, "learning_rate": 0.000839985, "loss": 1.807319450378418, "step": 56000 }, { "epoch": 0.001, "eval_loss": 1.7735828161239624, "eval_runtime": 100.1932, "eval_samples_per_second": 9.981, "eval_steps_per_second": 9.981, "step": 56000 }, { "epoch": 0.001002, "grad_norm": 0.06917919218540192, "learning_rate": 0.000840285, "loss": 1.8006320953369142, "step": 56020 }, { "epoch": 0.001004, "grad_norm": 0.10188503563404083, "learning_rate": 0.0008405850000000001, "loss": 1.7991653442382813, "step": 56040 }, { "epoch": 0.001006, "grad_norm": 0.10053511708974838, "learning_rate": 0.0008408850000000001, "loss": 1.8023815155029297, "step": 56060 }, { "epoch": 0.001008, "grad_norm": 0.0830378606915474, "learning_rate": 0.000841185, "loss": 1.7994457244873048, "step": 56080 }, { "epoch": 0.00101, "grad_norm": 0.10750024765729904, "learning_rate": 0.000841485, "loss": 1.8020074844360352, "step": 56100 }, { "epoch": 0.001012, "grad_norm": 0.09629049152135849, "learning_rate": 0.000841785, "loss": 1.8058887481689454, "step": 56120 }, { "epoch": 0.001014, "grad_norm": 0.09682925790548325, "learning_rate": 0.0008420849999999999, "loss": 1.8038902282714844, "step": 56140 }, { "epoch": 0.001016, "grad_norm": 0.0911613404750824, "learning_rate": 0.0008423850000000001, "loss": 1.804712677001953, "step": 56160 }, { "epoch": 0.001018, "grad_norm": 0.08601225167512894, "learning_rate": 0.000842685, "loss": 1.7994209289550782, "step": 56180 }, { "epoch": 0.00102, "grad_norm": 0.10935106873512268, "learning_rate": 0.000842985, "loss": 1.7846817016601562, "step": 56200 }, { "epoch": 0.001022, "grad_norm": 0.06160512566566467, "learning_rate": 0.0008432849999999999, "loss": 1.7995597839355468, "step": 56220 }, { "epoch": 0.001024, "grad_norm": 0.09608394652605057, "learning_rate": 0.0008435849999999999, "loss": 1.8008371353149415, "step": 56240 }, { "epoch": 0.001026, "grad_norm": 0.07297331094741821, "learning_rate": 0.0008438850000000001, "loss": 1.7997770309448242, "step": 56260 }, { "epoch": 0.001028, "grad_norm": 0.06868540495634079, "learning_rate": 0.000844185, "loss": 1.7942707061767578, "step": 56280 }, { "epoch": 0.00103, "grad_norm": 0.09523054957389832, "learning_rate": 0.000844485, "loss": 1.8014406204223632, "step": 56300 }, { "epoch": 0.001032, "grad_norm": 0.07361695170402527, "learning_rate": 0.000844785, "loss": 1.7993066787719727, "step": 56320 }, { "epoch": 0.001034, "grad_norm": 0.07631966471672058, "learning_rate": 0.000845085, "loss": 1.7900287628173828, "step": 56340 }, { "epoch": 0.001036, "grad_norm": 0.07280699908733368, "learning_rate": 0.000845385, "loss": 1.7911439895629884, "step": 56360 }, { "epoch": 0.001038, "grad_norm": 0.07538430392742157, "learning_rate": 0.000845685, "loss": 1.802274513244629, "step": 56380 }, { "epoch": 0.00104, "grad_norm": 0.1117163896560669, "learning_rate": 0.000845985, "loss": 1.8023576736450195, "step": 56400 }, { "epoch": 0.001042, "grad_norm": 0.08323267102241516, "learning_rate": 0.000846285, "loss": 1.796982192993164, "step": 56420 }, { "epoch": 0.001044, "grad_norm": 0.08631003648042679, "learning_rate": 0.000846585, "loss": 1.7945629119873048, "step": 56440 }, { "epoch": 0.001046, "grad_norm": 0.09242662787437439, "learning_rate": 0.000846885, "loss": 1.7980558395385742, "step": 56460 }, { "epoch": 0.001048, "grad_norm": 0.09422673285007477, "learning_rate": 0.0008471850000000001, "loss": 1.790669822692871, "step": 56480 }, { "epoch": 0.00105, "grad_norm": 0.08711153268814087, "learning_rate": 0.000847485, "loss": 1.7953336715698243, "step": 56500 }, { "epoch": 0.001052, "grad_norm": 0.0852414071559906, "learning_rate": 0.000847785, "loss": 1.7831697463989258, "step": 56520 }, { "epoch": 0.001054, "grad_norm": 0.1263018548488617, "learning_rate": 0.0008480849999999999, "loss": 1.7890201568603517, "step": 56540 }, { "epoch": 0.001056, "grad_norm": 0.08097770065069199, "learning_rate": 0.0008483850000000001, "loss": 1.7894300460815429, "step": 56560 }, { "epoch": 0.001058, "grad_norm": 0.08591044694185257, "learning_rate": 0.0008486850000000001, "loss": 1.7861698150634766, "step": 56580 }, { "epoch": 0.00106, "grad_norm": 0.1244858130812645, "learning_rate": 0.000848985, "loss": 1.7880922317504884, "step": 56600 }, { "epoch": 0.001062, "grad_norm": 0.07644981890916824, "learning_rate": 0.000849285, "loss": 1.7950071334838866, "step": 56620 }, { "epoch": 0.001064, "grad_norm": 0.06376186013221741, "learning_rate": 0.0008495849999999999, "loss": 1.7975915908813476, "step": 56640 }, { "epoch": 0.001066, "grad_norm": 0.08314666152000427, "learning_rate": 0.0008498850000000001, "loss": 1.8020807266235352, "step": 56660 }, { "epoch": 0.001068, "grad_norm": 0.0650612935423851, "learning_rate": 0.000850185, "loss": 1.8081113815307617, "step": 56680 }, { "epoch": 0.00107, "grad_norm": 0.09447851032018661, "learning_rate": 0.000850485, "loss": 1.8041149139404298, "step": 56700 }, { "epoch": 0.001072, "grad_norm": 0.12133060395717621, "learning_rate": 0.000850785, "loss": 1.8069007873535157, "step": 56720 }, { "epoch": 0.001074, "grad_norm": 0.10875920951366425, "learning_rate": 0.0008510849999999999, "loss": 1.8077239990234375, "step": 56740 }, { "epoch": 0.001076, "grad_norm": 0.09694947302341461, "learning_rate": 0.0008513850000000001, "loss": 1.8075384140014648, "step": 56760 }, { "epoch": 0.001078, "grad_norm": 0.06666617840528488, "learning_rate": 0.000851685, "loss": 1.8122877120971679, "step": 56780 }, { "epoch": 0.00108, "grad_norm": 0.08390645682811737, "learning_rate": 0.000851985, "loss": 1.803468894958496, "step": 56800 }, { "epoch": 0.001082, "grad_norm": 0.10730978846549988, "learning_rate": 0.0008522849999999999, "loss": 1.8112421035766602, "step": 56820 }, { "epoch": 0.001084, "grad_norm": 0.08279474824666977, "learning_rate": 0.000852585, "loss": 1.8050979614257812, "step": 56840 }, { "epoch": 0.001086, "grad_norm": 0.07948900759220123, "learning_rate": 0.0008528850000000001, "loss": 1.7999177932739259, "step": 56860 }, { "epoch": 0.001088, "grad_norm": 0.06034329906105995, "learning_rate": 0.000853185, "loss": 1.8109682083129883, "step": 56880 }, { "epoch": 0.00109, "grad_norm": 0.1001698300242424, "learning_rate": 0.000853485, "loss": 1.808699607849121, "step": 56900 }, { "epoch": 0.001092, "grad_norm": 0.09527815878391266, "learning_rate": 0.000853785, "loss": 1.7977937698364257, "step": 56920 }, { "epoch": 0.001094, "grad_norm": 0.1068359762430191, "learning_rate": 0.000854085, "loss": 1.797940444946289, "step": 56940 }, { "epoch": 0.001096, "grad_norm": 0.09304238855838776, "learning_rate": 0.000854385, "loss": 1.8067825317382813, "step": 56960 }, { "epoch": 0.001098, "grad_norm": 0.07920155674219131, "learning_rate": 0.000854685, "loss": 1.8016019821166993, "step": 56980 }, { "epoch": 0.0011, "grad_norm": 0.08701524138450623, "learning_rate": 0.0008549850000000001, "loss": 1.8006498336791992, "step": 57000 }, { "epoch": 0.0011, "eval_loss": 1.7683178186416626, "eval_runtime": 99.6685, "eval_samples_per_second": 10.033, "eval_steps_per_second": 10.033, "step": 57000 }, { "epoch": 0.001102, "grad_norm": 0.0937202125787735, "learning_rate": 0.000855285, "loss": 1.801673698425293, "step": 57020 }, { "epoch": 0.001104, "grad_norm": 0.10670318454504013, "learning_rate": 0.000855585, "loss": 1.8076778411865235, "step": 57040 }, { "epoch": 0.001106, "grad_norm": 0.10937001556158066, "learning_rate": 0.0008558850000000001, "loss": 1.7999671936035155, "step": 57060 }, { "epoch": 0.001108, "grad_norm": 0.0757187157869339, "learning_rate": 0.0008561850000000001, "loss": 1.8009063720703125, "step": 57080 }, { "epoch": 0.00111, "grad_norm": 0.0944443792104721, "learning_rate": 0.000856485, "loss": 1.8032840728759765, "step": 57100 }, { "epoch": 0.001112, "grad_norm": 0.09052728861570358, "learning_rate": 0.000856785, "loss": 1.8027692794799806, "step": 57120 }, { "epoch": 0.001114, "grad_norm": 0.0733652412891388, "learning_rate": 0.0008570849999999999, "loss": 1.8043195724487304, "step": 57140 }, { "epoch": 0.001116, "grad_norm": 0.07075349986553192, "learning_rate": 0.0008573850000000001, "loss": 1.791477584838867, "step": 57160 }, { "epoch": 0.001118, "grad_norm": 0.07513801753520966, "learning_rate": 0.0008576850000000001, "loss": 1.8048818588256836, "step": 57180 }, { "epoch": 0.00112, "grad_norm": 0.06912592053413391, "learning_rate": 0.000857985, "loss": 1.7968517303466798, "step": 57200 }, { "epoch": 0.001122, "grad_norm": 0.09329573810100555, "learning_rate": 0.000858285, "loss": 1.7901058197021484, "step": 57220 }, { "epoch": 0.001124, "grad_norm": 0.06965938210487366, "learning_rate": 0.0008585849999999999, "loss": 1.8001869201660157, "step": 57240 }, { "epoch": 0.001126, "grad_norm": 0.09302552044391632, "learning_rate": 0.0008588850000000001, "loss": 1.7976009368896484, "step": 57260 }, { "epoch": 0.001128, "grad_norm": 0.09167779982089996, "learning_rate": 0.000859185, "loss": 1.7888769149780273, "step": 57280 }, { "epoch": 0.00113, "grad_norm": 0.09916319698095322, "learning_rate": 0.000859485, "loss": 1.7904916763305665, "step": 57300 }, { "epoch": 0.001132, "grad_norm": 0.09171207249164581, "learning_rate": 0.000859785, "loss": 1.7911870956420899, "step": 57320 }, { "epoch": 0.001134, "grad_norm": 0.069407157599926, "learning_rate": 0.0008600849999999999, "loss": 1.7973270416259766, "step": 57340 }, { "epoch": 0.001136, "grad_norm": 0.078703872859478, "learning_rate": 0.0008603850000000001, "loss": 1.7949394226074218, "step": 57360 }, { "epoch": 0.001138, "grad_norm": 0.10920059680938721, "learning_rate": 0.000860685, "loss": 1.7930070877075195, "step": 57380 }, { "epoch": 0.00114, "grad_norm": 0.11591575294733047, "learning_rate": 0.000860985, "loss": 1.7912139892578125, "step": 57400 }, { "epoch": 0.001142, "grad_norm": 0.12172117084264755, "learning_rate": 0.0008612849999999999, "loss": 1.7863794326782227, "step": 57420 }, { "epoch": 0.001144, "grad_norm": 0.06724731624126434, "learning_rate": 0.000861585, "loss": 1.7922708511352539, "step": 57440 }, { "epoch": 0.001146, "grad_norm": 0.11076223105192184, "learning_rate": 0.0008618850000000001, "loss": 1.7924116134643555, "step": 57460 }, { "epoch": 0.001148, "grad_norm": 0.10175531357526779, "learning_rate": 0.000862185, "loss": 1.791329574584961, "step": 57480 }, { "epoch": 0.00115, "grad_norm": 0.08731532096862793, "learning_rate": 0.000862485, "loss": 1.7879472732543946, "step": 57500 }, { "epoch": 0.001152, "grad_norm": 0.09933855384588242, "learning_rate": 0.000862785, "loss": 1.789200210571289, "step": 57520 }, { "epoch": 0.001154, "grad_norm": 0.09416564553976059, "learning_rate": 0.000863085, "loss": 1.7867406845092773, "step": 57540 }, { "epoch": 0.001156, "grad_norm": 0.11345028132200241, "learning_rate": 0.000863385, "loss": 1.7869626998901367, "step": 57560 }, { "epoch": 0.001158, "grad_norm": 0.10422199219465256, "learning_rate": 0.0008636850000000001, "loss": 1.792588233947754, "step": 57580 }, { "epoch": 0.00116, "grad_norm": 0.11995210498571396, "learning_rate": 0.0008639850000000001, "loss": 1.785790252685547, "step": 57600 }, { "epoch": 0.001162, "grad_norm": 0.08032912760972977, "learning_rate": 0.000864285, "loss": 1.7840200424194337, "step": 57620 }, { "epoch": 0.001164, "grad_norm": 0.10984625667333603, "learning_rate": 0.000864585, "loss": 1.7997098922729493, "step": 57640 }, { "epoch": 0.001166, "grad_norm": 0.08549176901578903, "learning_rate": 0.0008648850000000001, "loss": 1.7887275695800782, "step": 57660 }, { "epoch": 0.001168, "grad_norm": 0.0953085646033287, "learning_rate": 0.0008651850000000001, "loss": 1.7921417236328125, "step": 57680 }, { "epoch": 0.00117, "grad_norm": 0.08001036196947098, "learning_rate": 0.000865485, "loss": 1.7886322021484375, "step": 57700 }, { "epoch": 0.001172, "grad_norm": 0.1295686960220337, "learning_rate": 0.000865785, "loss": 1.7780420303344726, "step": 57720 }, { "epoch": 0.001174, "grad_norm": 0.09134498238563538, "learning_rate": 0.0008660849999999999, "loss": 1.7858009338378906, "step": 57740 }, { "epoch": 0.001176, "grad_norm": 0.06826510280370712, "learning_rate": 0.0008663850000000001, "loss": 1.794895553588867, "step": 57760 }, { "epoch": 0.001178, "grad_norm": 0.09383084625005722, "learning_rate": 0.0008666850000000001, "loss": 1.7879268646240234, "step": 57780 }, { "epoch": 0.00118, "grad_norm": 0.09734877943992615, "learning_rate": 0.000866985, "loss": 1.7864860534667968, "step": 57800 }, { "epoch": 0.001182, "grad_norm": 0.07767576724290848, "learning_rate": 0.000867285, "loss": 1.799258041381836, "step": 57820 }, { "epoch": 0.001184, "grad_norm": 0.06870760768651962, "learning_rate": 0.0008675849999999999, "loss": 1.7924396514892578, "step": 57840 }, { "epoch": 0.001186, "grad_norm": 0.07649760693311691, "learning_rate": 0.0008678850000000001, "loss": 1.8006465911865235, "step": 57860 }, { "epoch": 0.001188, "grad_norm": 0.0633130595088005, "learning_rate": 0.000868185, "loss": 1.8013498306274414, "step": 57880 }, { "epoch": 0.00119, "grad_norm": 0.06914418190717697, "learning_rate": 0.000868485, "loss": 1.8069189071655274, "step": 57900 }, { "epoch": 0.001192, "grad_norm": 0.0731736272573471, "learning_rate": 0.000868785, "loss": 1.7978586196899413, "step": 57920 }, { "epoch": 0.001194, "grad_norm": 0.09937088936567307, "learning_rate": 0.0008690849999999999, "loss": 1.7953372955322267, "step": 57940 }, { "epoch": 0.001196, "grad_norm": 0.07816176116466522, "learning_rate": 0.0008693850000000001, "loss": 1.8023591995239259, "step": 57960 }, { "epoch": 0.001198, "grad_norm": 0.07683317363262177, "learning_rate": 0.000869685, "loss": 1.7934598922729492, "step": 57980 }, { "epoch": 0.0012, "grad_norm": 0.09890981763601303, "learning_rate": 0.000869985, "loss": 1.8024948120117188, "step": 58000 }, { "epoch": 0.0012, "eval_loss": 1.7639732360839844, "eval_runtime": 101.1214, "eval_samples_per_second": 9.889, "eval_steps_per_second": 9.889, "step": 58000 }, { "epoch": 0.001202, "grad_norm": 0.08846702426671982, "learning_rate": 0.000870285, "loss": 1.7955366134643556, "step": 58020 }, { "epoch": 0.001204, "grad_norm": 0.07499402016401291, "learning_rate": 0.000870585, "loss": 1.7973455429077148, "step": 58040 }, { "epoch": 0.001206, "grad_norm": 0.10481803119182587, "learning_rate": 0.0008708850000000001, "loss": 1.793146514892578, "step": 58060 }, { "epoch": 0.001208, "grad_norm": 0.064764603972435, "learning_rate": 0.000871185, "loss": 1.8076301574707032, "step": 58080 }, { "epoch": 0.00121, "grad_norm": 0.08116547018289566, "learning_rate": 0.0008714850000000001, "loss": 1.798056411743164, "step": 58100 }, { "epoch": 0.001212, "grad_norm": 0.10666067898273468, "learning_rate": 0.000871785, "loss": 1.7961101531982422, "step": 58120 }, { "epoch": 0.001214, "grad_norm": 0.15765641629695892, "learning_rate": 0.000872085, "loss": 1.7949405670166017, "step": 58140 }, { "epoch": 0.001216, "grad_norm": 0.11962568014860153, "learning_rate": 0.000872385, "loss": 1.802354621887207, "step": 58160 }, { "epoch": 0.001218, "grad_norm": 0.0923636183142662, "learning_rate": 0.0008726850000000001, "loss": 1.8007795333862304, "step": 58180 }, { "epoch": 0.00122, "grad_norm": 0.10511373728513718, "learning_rate": 0.0008729850000000001, "loss": 1.7984931945800782, "step": 58200 }, { "epoch": 0.001222, "grad_norm": 0.10952931642532349, "learning_rate": 0.000873285, "loss": 1.7882881164550781, "step": 58220 }, { "epoch": 0.001224, "grad_norm": 0.07120373845100403, "learning_rate": 0.000873585, "loss": 1.7912660598754884, "step": 58240 }, { "epoch": 0.001226, "grad_norm": 0.13143955171108246, "learning_rate": 0.0008738850000000001, "loss": 1.7980297088623047, "step": 58260 }, { "epoch": 0.001228, "grad_norm": 0.07388322055339813, "learning_rate": 0.0008741850000000001, "loss": 1.7870193481445313, "step": 58280 }, { "epoch": 0.00123, "grad_norm": 0.08142983913421631, "learning_rate": 0.000874485, "loss": 1.7930824279785156, "step": 58300 }, { "epoch": 0.001232, "grad_norm": 0.08841890096664429, "learning_rate": 0.000874785, "loss": 1.7895841598510742, "step": 58320 }, { "epoch": 0.001234, "grad_norm": 0.0918579250574112, "learning_rate": 0.000875085, "loss": 1.7884759902954102, "step": 58340 }, { "epoch": 0.001236, "grad_norm": 0.09915296733379364, "learning_rate": 0.0008753850000000001, "loss": 1.7873065948486329, "step": 58360 }, { "epoch": 0.001238, "grad_norm": 0.06550557166337967, "learning_rate": 0.0008756850000000001, "loss": 1.788595962524414, "step": 58380 }, { "epoch": 0.00124, "grad_norm": 0.07651044428348541, "learning_rate": 0.000875985, "loss": 1.791623306274414, "step": 58400 }, { "epoch": 0.001242, "grad_norm": 0.1300506591796875, "learning_rate": 0.000876285, "loss": 1.7822643280029298, "step": 58420 }, { "epoch": 0.001244, "grad_norm": 0.0868898332118988, "learning_rate": 0.0008765849999999999, "loss": 1.7846914291381837, "step": 58440 }, { "epoch": 0.001246, "grad_norm": 0.08382240682840347, "learning_rate": 0.0008768850000000001, "loss": 1.791547966003418, "step": 58460 }, { "epoch": 0.001248, "grad_norm": 0.08530152589082718, "learning_rate": 0.000877185, "loss": 1.7961118698120118, "step": 58480 }, { "epoch": 0.00125, "grad_norm": 0.09241317957639694, "learning_rate": 0.000877485, "loss": 1.7916952133178712, "step": 58500 }, { "epoch": 0.001252, "grad_norm": 0.08250889182090759, "learning_rate": 0.000877785, "loss": 1.786859130859375, "step": 58520 }, { "epoch": 0.001254, "grad_norm": 0.06770889461040497, "learning_rate": 0.000878085, "loss": 1.7918638229370116, "step": 58540 }, { "epoch": 0.001256, "grad_norm": 0.06325265765190125, "learning_rate": 0.0008783850000000001, "loss": 1.7936885833740235, "step": 58560 }, { "epoch": 0.001258, "grad_norm": 0.06696333736181259, "learning_rate": 0.000878685, "loss": 1.7841094970703124, "step": 58580 }, { "epoch": 0.00126, "grad_norm": 0.09796358644962311, "learning_rate": 0.000878985, "loss": 1.7848304748535155, "step": 58600 }, { "epoch": 0.001262, "grad_norm": 0.09959303587675095, "learning_rate": 0.000879285, "loss": 1.7836418151855469, "step": 58620 }, { "epoch": 0.001264, "grad_norm": 0.09237895905971527, "learning_rate": 0.000879585, "loss": 1.783563232421875, "step": 58640 }, { "epoch": 0.001266, "grad_norm": 0.07377872616052628, "learning_rate": 0.000879885, "loss": 1.7867752075195313, "step": 58660 }, { "epoch": 0.001268, "grad_norm": 0.08524210751056671, "learning_rate": 0.000880185, "loss": 1.7875303268432616, "step": 58680 }, { "epoch": 0.00127, "grad_norm": 0.08337651193141937, "learning_rate": 0.0008804850000000001, "loss": 1.787185287475586, "step": 58700 }, { "epoch": 0.001272, "grad_norm": 0.09430639445781708, "learning_rate": 0.000880785, "loss": 1.7876216888427734, "step": 58720 }, { "epoch": 0.001274, "grad_norm": 0.07649505138397217, "learning_rate": 0.000881085, "loss": 1.790460205078125, "step": 58740 }, { "epoch": 0.001276, "grad_norm": 0.09520697593688965, "learning_rate": 0.0008813849999999999, "loss": 1.7819580078125, "step": 58760 }, { "epoch": 0.001278, "grad_norm": 0.10098861902952194, "learning_rate": 0.0008816850000000001, "loss": 1.7848100662231445, "step": 58780 }, { "epoch": 0.00128, "grad_norm": 0.13069051504135132, "learning_rate": 0.0008819850000000001, "loss": 1.781412696838379, "step": 58800 }, { "epoch": 0.001282, "grad_norm": 0.0984887182712555, "learning_rate": 0.000882285, "loss": 1.7869014739990234, "step": 58820 }, { "epoch": 0.001284, "grad_norm": 0.098292276263237, "learning_rate": 0.000882585, "loss": 1.7787504196166992, "step": 58840 }, { "epoch": 0.001286, "grad_norm": 0.14762945473194122, "learning_rate": 0.0008828849999999999, "loss": 1.785466766357422, "step": 58860 }, { "epoch": 0.001288, "grad_norm": 0.07387299090623856, "learning_rate": 0.0008831850000000001, "loss": 1.7865690231323241, "step": 58880 }, { "epoch": 0.00129, "grad_norm": 0.09571004658937454, "learning_rate": 0.000883485, "loss": 1.7807199478149414, "step": 58900 }, { "epoch": 0.001292, "grad_norm": 0.09966664761304855, "learning_rate": 0.000883785, "loss": 1.7810815811157226, "step": 58920 }, { "epoch": 0.001294, "grad_norm": 0.061778098344802856, "learning_rate": 0.000884085, "loss": 1.7799869537353517, "step": 58940 }, { "epoch": 0.001296, "grad_norm": 0.09198242425918579, "learning_rate": 0.0008843849999999999, "loss": 1.7813076019287108, "step": 58960 }, { "epoch": 0.001298, "grad_norm": 0.0708242729306221, "learning_rate": 0.0008846850000000001, "loss": 1.7849723815917968, "step": 58980 }, { "epoch": 0.0013, "grad_norm": 0.0876058042049408, "learning_rate": 0.000884985, "loss": 1.7796497344970703, "step": 59000 }, { "epoch": 0.0013, "eval_loss": 1.7605947256088257, "eval_runtime": 102.4761, "eval_samples_per_second": 9.758, "eval_steps_per_second": 9.758, "step": 59000 }, { "epoch": 0.001302, "grad_norm": 0.11163485050201416, "learning_rate": 0.000885285, "loss": 1.7904579162597656, "step": 59020 }, { "epoch": 0.001304, "grad_norm": 0.07118188589811325, "learning_rate": 0.0008855849999999999, "loss": 1.7947458267211913, "step": 59040 }, { "epoch": 0.001306, "grad_norm": 0.11685152351856232, "learning_rate": 0.000885885, "loss": 1.800405502319336, "step": 59060 }, { "epoch": 0.001308, "grad_norm": 0.08772759139537811, "learning_rate": 0.0008861850000000001, "loss": 1.8008148193359375, "step": 59080 }, { "epoch": 0.00131, "grad_norm": 0.08764131367206573, "learning_rate": 0.000886485, "loss": 1.7950908660888671, "step": 59100 }, { "epoch": 0.001312, "grad_norm": 0.09448276460170746, "learning_rate": 0.000886785, "loss": 1.7981008529663085, "step": 59120 }, { "epoch": 0.001314, "grad_norm": 0.08192802965641022, "learning_rate": 0.000887085, "loss": 1.7959772109985352, "step": 59140 }, { "epoch": 0.001316, "grad_norm": 0.13744975626468658, "learning_rate": 0.000887385, "loss": 1.802775764465332, "step": 59160 }, { "epoch": 0.001318, "grad_norm": 0.07230217009782791, "learning_rate": 0.000887685, "loss": 1.7934690475463868, "step": 59180 }, { "epoch": 0.00132, "grad_norm": 0.08101034164428711, "learning_rate": 0.000887985, "loss": 1.7986469268798828, "step": 59200 }, { "epoch": 0.001322, "grad_norm": 0.07884607464075089, "learning_rate": 0.000888285, "loss": 1.7923391342163086, "step": 59220 }, { "epoch": 0.001324, "grad_norm": 0.09071575105190277, "learning_rate": 0.000888585, "loss": 1.7922843933105468, "step": 59240 }, { "epoch": 0.001326, "grad_norm": 0.10291945189237595, "learning_rate": 0.000888885, "loss": 1.7996133804321288, "step": 59260 }, { "epoch": 0.001328, "grad_norm": 0.10892489552497864, "learning_rate": 0.0008891850000000001, "loss": 1.7933570861816406, "step": 59280 }, { "epoch": 0.00133, "grad_norm": 0.07337154448032379, "learning_rate": 0.0008894850000000001, "loss": 1.7932397842407226, "step": 59300 }, { "epoch": 0.001332, "grad_norm": 0.09053796529769897, "learning_rate": 0.000889785, "loss": 1.7875089645385742, "step": 59320 }, { "epoch": 0.001334, "grad_norm": 0.11005237698554993, "learning_rate": 0.000890085, "loss": 1.7968561172485351, "step": 59340 }, { "epoch": 0.001336, "grad_norm": 0.08401455730199814, "learning_rate": 0.0008903849999999999, "loss": 1.7960100173950195, "step": 59360 }, { "epoch": 0.001338, "grad_norm": 0.08846209198236465, "learning_rate": 0.0008906850000000001, "loss": 1.7931608200073241, "step": 59380 }, { "epoch": 0.00134, "grad_norm": 0.06116236373782158, "learning_rate": 0.0008909850000000001, "loss": 1.790717887878418, "step": 59400 }, { "epoch": 0.001342, "grad_norm": 0.07480533421039581, "learning_rate": 0.000891285, "loss": 1.7880945205688477, "step": 59420 }, { "epoch": 0.001344, "grad_norm": 0.08431543409824371, "learning_rate": 0.000891585, "loss": 1.7937543869018555, "step": 59440 }, { "epoch": 0.001346, "grad_norm": 0.09316226094961166, "learning_rate": 0.0008918849999999999, "loss": 1.7945869445800782, "step": 59460 }, { "epoch": 0.001348, "grad_norm": 0.12234386801719666, "learning_rate": 0.0008921850000000001, "loss": 1.7928190231323242, "step": 59480 }, { "epoch": 0.00135, "grad_norm": 0.1400688886642456, "learning_rate": 0.000892485, "loss": 1.793172264099121, "step": 59500 }, { "epoch": 0.001352, "grad_norm": 0.12014756351709366, "learning_rate": 0.000892785, "loss": 1.7820804595947266, "step": 59520 }, { "epoch": 0.001354, "grad_norm": 0.07136882096529007, "learning_rate": 0.000893085, "loss": 1.7874395370483398, "step": 59540 }, { "epoch": 0.001356, "grad_norm": 0.10591576993465424, "learning_rate": 0.0008933849999999999, "loss": 1.7914464950561524, "step": 59560 }, { "epoch": 0.001358, "grad_norm": 0.13441281020641327, "learning_rate": 0.0008936850000000001, "loss": 1.787251853942871, "step": 59580 }, { "epoch": 0.00136, "grad_norm": 0.08462520688772202, "learning_rate": 0.000893985, "loss": 1.7891172409057616, "step": 59600 }, { "epoch": 0.001362, "grad_norm": 0.1170402392745018, "learning_rate": 0.000894285, "loss": 1.7866937637329101, "step": 59620 }, { "epoch": 0.001364, "grad_norm": 0.13150587677955627, "learning_rate": 0.0008945849999999999, "loss": 1.786465835571289, "step": 59640 }, { "epoch": 0.001366, "grad_norm": 0.10751062631607056, "learning_rate": 0.000894885, "loss": 1.7842748641967774, "step": 59660 }, { "epoch": 0.001368, "grad_norm": 0.15118949115276337, "learning_rate": 0.0008951850000000001, "loss": 1.792129135131836, "step": 59680 }, { "epoch": 0.00137, "grad_norm": 0.11457185447216034, "learning_rate": 0.000895485, "loss": 1.789076042175293, "step": 59700 }, { "epoch": 0.001372, "grad_norm": 0.09175355732440948, "learning_rate": 0.000895785, "loss": 1.7840227127075194, "step": 59720 }, { "epoch": 0.001374, "grad_norm": 0.0791926383972168, "learning_rate": 0.000896085, "loss": 1.7862699508666993, "step": 59740 }, { "epoch": 0.001376, "grad_norm": 0.07817155122756958, "learning_rate": 0.000896385, "loss": 1.7845630645751953, "step": 59760 }, { "epoch": 0.001378, "grad_norm": 0.07499396055936813, "learning_rate": 0.000896685, "loss": 1.7851142883300781, "step": 59780 }, { "epoch": 0.00138, "grad_norm": 0.09369134157896042, "learning_rate": 0.0008969850000000001, "loss": 1.777730369567871, "step": 59800 }, { "epoch": 0.001382, "grad_norm": 0.07674891501665115, "learning_rate": 0.000897285, "loss": 1.7841289520263672, "step": 59820 }, { "epoch": 0.001384, "grad_norm": 0.10798847675323486, "learning_rate": 0.000897585, "loss": 1.7842435836791992, "step": 59840 }, { "epoch": 0.001386, "grad_norm": 0.12474353611469269, "learning_rate": 0.000897885, "loss": 1.7782463073730468, "step": 59860 }, { "epoch": 0.001388, "grad_norm": 0.07487408816814423, "learning_rate": 0.0008981850000000001, "loss": 1.788216781616211, "step": 59880 }, { "epoch": 0.00139, "grad_norm": 0.08795047551393509, "learning_rate": 0.0008984850000000001, "loss": 1.788589096069336, "step": 59900 }, { "epoch": 0.001392, "grad_norm": 0.06374309211969376, "learning_rate": 0.000898785, "loss": 1.7882522583007812, "step": 59920 }, { "epoch": 0.001394, "grad_norm": 0.08231166005134583, "learning_rate": 0.000899085, "loss": 1.7771085739135741, "step": 59940 }, { "epoch": 0.001396, "grad_norm": 0.09305830299854279, "learning_rate": 0.0008993849999999999, "loss": 1.7856315612792968, "step": 59960 }, { "epoch": 0.001398, "grad_norm": 0.07728376984596252, "learning_rate": 0.0008996850000000001, "loss": 1.7800445556640625, "step": 59980 }, { "epoch": 0.0014, "grad_norm": 0.14031851291656494, "learning_rate": 0.0008999850000000001, "loss": 1.7799678802490235, "step": 60000 }, { "epoch": 0.0014, "eval_loss": 1.757127285003662, "eval_runtime": 101.7258, "eval_samples_per_second": 9.83, "eval_steps_per_second": 9.83, "step": 60000 }, { "epoch": 0.001402, "grad_norm": 0.07864392548799515, "learning_rate": 0.000900285, "loss": 1.780336570739746, "step": 60020 }, { "epoch": 0.001404, "grad_norm": 0.10762085765600204, "learning_rate": 0.000900585, "loss": 1.774503517150879, "step": 60040 }, { "epoch": 0.001406, "grad_norm": 0.08554880321025848, "learning_rate": 0.0009008849999999999, "loss": 1.7854381561279298, "step": 60060 }, { "epoch": 0.001408, "grad_norm": 0.12507252395153046, "learning_rate": 0.0009011850000000001, "loss": 1.7746183395385742, "step": 60080 }, { "epoch": 0.00141, "grad_norm": 0.0879814401268959, "learning_rate": 0.000901485, "loss": 1.7791704177856444, "step": 60100 }, { "epoch": 0.001412, "grad_norm": 0.09369395673274994, "learning_rate": 0.000901785, "loss": 1.7811712265014648, "step": 60120 }, { "epoch": 0.001414, "grad_norm": 0.12184352427721024, "learning_rate": 0.000902085, "loss": 1.7823884963989258, "step": 60140 }, { "epoch": 0.001416, "grad_norm": 0.0922425165772438, "learning_rate": 0.0009023849999999999, "loss": 1.784942054748535, "step": 60160 }, { "epoch": 0.001418, "grad_norm": 0.11703264713287354, "learning_rate": 0.0009026850000000001, "loss": 1.7911079406738282, "step": 60180 }, { "epoch": 0.00142, "grad_norm": 0.06786137819290161, "learning_rate": 0.000902985, "loss": 1.7841667175292968, "step": 60200 }, { "epoch": 0.001422, "grad_norm": 0.12831048667430878, "learning_rate": 0.000903285, "loss": 1.7822101593017579, "step": 60220 }, { "epoch": 0.001424, "grad_norm": 0.06657948344945908, "learning_rate": 0.000903585, "loss": 1.7872278213500976, "step": 60240 }, { "epoch": 0.001426, "grad_norm": 0.11561829596757889, "learning_rate": 0.000903885, "loss": 1.7912164688110352, "step": 60260 }, { "epoch": 0.001428, "grad_norm": 0.06207296624779701, "learning_rate": 0.0009041850000000001, "loss": 1.7937608718872071, "step": 60280 }, { "epoch": 0.00143, "grad_norm": 0.12583515048027039, "learning_rate": 0.000904485, "loss": 1.7964292526245118, "step": 60300 }, { "epoch": 0.001432, "grad_norm": 0.08955791592597961, "learning_rate": 0.0009047850000000001, "loss": 1.793429183959961, "step": 60320 }, { "epoch": 0.001434, "grad_norm": 0.15952014923095703, "learning_rate": 0.000905085, "loss": 1.7835594177246095, "step": 60340 }, { "epoch": 0.001436, "grad_norm": 0.13086777925491333, "learning_rate": 0.000905385, "loss": 1.789198112487793, "step": 60360 }, { "epoch": 0.001438, "grad_norm": 0.11018704622983932, "learning_rate": 0.000905685, "loss": 1.7987808227539062, "step": 60380 }, { "epoch": 0.00144, "grad_norm": 0.12111669778823853, "learning_rate": 0.0009059850000000001, "loss": 1.785379409790039, "step": 60400 }, { "epoch": 0.001442, "grad_norm": 0.10074923187494278, "learning_rate": 0.0009062850000000001, "loss": 1.7914039611816406, "step": 60420 }, { "epoch": 0.001444, "grad_norm": 0.12976816296577454, "learning_rate": 0.000906585, "loss": 1.782525634765625, "step": 60440 }, { "epoch": 0.001446, "grad_norm": 0.11517872661352158, "learning_rate": 0.000906885, "loss": 1.7910505294799806, "step": 60460 }, { "epoch": 0.001448, "grad_norm": 0.07611226290464401, "learning_rate": 0.0009071850000000001, "loss": 1.7883560180664062, "step": 60480 }, { "epoch": 0.00145, "grad_norm": 0.09393489360809326, "learning_rate": 0.0009074850000000001, "loss": 1.7844127655029296, "step": 60500 }, { "epoch": 0.001452, "grad_norm": 0.06728903949260712, "learning_rate": 0.000907785, "loss": 1.7861913681030273, "step": 60520 }, { "epoch": 0.001454, "grad_norm": 0.08470039069652557, "learning_rate": 0.000908085, "loss": 1.7802160263061524, "step": 60540 }, { "epoch": 0.001456, "grad_norm": 0.09300052374601364, "learning_rate": 0.0009083849999999999, "loss": 1.7824180603027344, "step": 60560 }, { "epoch": 0.001458, "grad_norm": 0.07797509431838989, "learning_rate": 0.0009086850000000001, "loss": 1.7897750854492187, "step": 60580 }, { "epoch": 0.00146, "grad_norm": 0.07057961076498032, "learning_rate": 0.0009089850000000001, "loss": 1.7705690383911132, "step": 60600 }, { "epoch": 0.001462, "grad_norm": 0.09517934918403625, "learning_rate": 0.000909285, "loss": 1.7854423522949219, "step": 60620 }, { "epoch": 0.001464, "grad_norm": 0.08621353656053543, "learning_rate": 0.000909585, "loss": 1.782230758666992, "step": 60640 }, { "epoch": 0.001466, "grad_norm": 0.1416175216436386, "learning_rate": 0.0009098849999999999, "loss": 1.7808948516845704, "step": 60660 }, { "epoch": 0.001468, "grad_norm": 0.08531250059604645, "learning_rate": 0.0009101850000000001, "loss": 1.7843456268310547, "step": 60680 }, { "epoch": 0.00147, "grad_norm": 0.0890691876411438, "learning_rate": 0.000910485, "loss": 1.775352668762207, "step": 60700 }, { "epoch": 0.001472, "grad_norm": 0.08158216625452042, "learning_rate": 0.000910785, "loss": 1.7796384811401367, "step": 60720 }, { "epoch": 0.001474, "grad_norm": 0.07983843237161636, "learning_rate": 0.000911085, "loss": 1.778581428527832, "step": 60740 }, { "epoch": 0.001476, "grad_norm": 0.07468003034591675, "learning_rate": 0.000911385, "loss": 1.7876134872436524, "step": 60760 }, { "epoch": 0.001478, "grad_norm": 0.0966465175151825, "learning_rate": 0.0009116850000000001, "loss": 1.7833978652954101, "step": 60780 }, { "epoch": 0.00148, "grad_norm": 0.102341428399086, "learning_rate": 0.000911985, "loss": 1.7740676879882813, "step": 60800 }, { "epoch": 0.001482, "grad_norm": 0.07008518278598785, "learning_rate": 0.000912285, "loss": 1.7881011962890625, "step": 60820 }, { "epoch": 0.001484, "grad_norm": 0.07029026001691818, "learning_rate": 0.000912585, "loss": 1.7808820724487304, "step": 60840 }, { "epoch": 0.001486, "grad_norm": 0.06320752203464508, "learning_rate": 0.000912885, "loss": 1.7813623428344727, "step": 60860 }, { "epoch": 0.001488, "grad_norm": 0.08225560933351517, "learning_rate": 0.0009131850000000001, "loss": 1.7788610458374023, "step": 60880 }, { "epoch": 0.00149, "grad_norm": 0.14620341360569, "learning_rate": 0.000913485, "loss": 1.7807167053222657, "step": 60900 }, { "epoch": 0.001492, "grad_norm": 0.091734878718853, "learning_rate": 0.0009137850000000001, "loss": 1.7744346618652345, "step": 60920 }, { "epoch": 0.001494, "grad_norm": 0.11475755274295807, "learning_rate": 0.000914085, "loss": 1.7763957977294922, "step": 60940 }, { "epoch": 0.001496, "grad_norm": 0.08693142980337143, "learning_rate": 0.000914385, "loss": 1.7710250854492187, "step": 60960 }, { "epoch": 0.001498, "grad_norm": 0.08143222332000732, "learning_rate": 0.0009146850000000002, "loss": 1.776578140258789, "step": 60980 }, { "epoch": 0.0015, "grad_norm": 0.08184456825256348, "learning_rate": 0.0009149850000000001, "loss": 1.7720607757568358, "step": 61000 }, { "epoch": 0.0015, "eval_loss": 1.7527116537094116, "eval_runtime": 96.9294, "eval_samples_per_second": 10.317, "eval_steps_per_second": 10.317, "step": 61000 }, { "epoch": 0.00013167943957230517, "grad_norm": 0.15917663276195526, "learning_rate": 0.0019556872017675816, "loss": 1.7689592361450195, "step": 61020, "train_bpb": 0.624479159802406, "train_bytes": 57285.4875, "train_loss_nats_per_token": 1.769419271408239 }, { "epoch": 0.00026335887914461035, "grad_norm": 0.19207613170146942, "learning_rate": 0.0019550959649518944, "loss": 1.7878398895263672, "step": 61040, "train_bpb": 0.6332869627067964, "train_bytes": 56225.5125, "train_loss_nats_per_token": 1.7878394894029352 }, { "epoch": 0.00039503831871691555, "grad_norm": 0.13957324624061584, "learning_rate": 0.0019545046502539264, "loss": 1.779135513305664, "step": 61060, "train_bpb": 0.6284148166299693, "train_bytes": 56917.51875, "train_loss_nats_per_token": 1.7795955909258072 }, { "epoch": 0.0005267177582892207, "grad_norm": 0.19360390305519104, "learning_rate": 0.001953913257774871, "loss": 1.7846166610717773, "step": 61080, "train_bpb": 0.6320205535939892, "train_bytes": 56260.525, "train_loss_nats_per_token": 1.784514928130163 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.1390513926744461, "learning_rate": 0.0019533217876159356, "loss": 1.791531753540039, "step": 61100, "train_bpb": 0.6323405783127461, "train_bytes": 56795.56875, "train_loss_nats_per_token": 1.7918770866024658 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.11623669415712357, "learning_rate": 0.0019527302398783402, "loss": 1.786199951171875, "step": 61120, "train_bpb": 0.629222283258163, "train_bytes": 56929.99375, "train_loss_nats_per_token": 1.7862105658113954 }, { "epoch": 0.0009217560770061363, "grad_norm": 0.12392310798168182, "learning_rate": 0.0019521386146633202, "loss": 1.779733657836914, "step": 61140, "train_bpb": 0.6278814477540333, "train_bytes": 56964.9875, "train_loss_nats_per_token": 1.7801071181111832 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.14329653978347778, "learning_rate": 0.0019515469120721205, "loss": 1.7768293380737306, "step": 61160, "train_bpb": 0.6293027708173399, "train_bytes": 56336.2625, "train_loss_nats_per_token": 1.7768973502036727 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.14658844470977783, "learning_rate": 0.0019509551322060036, "loss": 1.781470489501953, "step": 61180, "train_bpb": 0.6308210419779954, "train_bytes": 56659.75, "train_loss_nats_per_token": 1.781694116903357 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.1357489973306656, "learning_rate": 0.0019503632751662406, "loss": 1.784101676940918, "step": 61200, "train_bpb": 0.6286416572116313, "train_bytes": 56591.2375, "train_loss_nats_per_token": 1.783926969335869 }, { "epoch": 0.001448473835295357, "grad_norm": 0.14259649813175201, "learning_rate": 0.0019497713410541204, "loss": 1.7761362075805665, "step": 61220, "train_bpb": 0.6287786742181933, "train_bytes": 56428.475, "train_loss_nats_per_token": 1.776385602011495 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.17029036581516266, "learning_rate": 0.0019491793299709415, "loss": 1.7787519454956056, "step": 61240, "train_bpb": 0.6290644850335212, "train_bytes": 56637.1375, "train_loss_nats_per_token": 1.7787108882641405 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.11382069438695908, "learning_rate": 0.0019485872420180175, "loss": 1.7769920349121093, "step": 61260, "train_bpb": 0.6269067905517248, "train_bytes": 56402.74375, "train_loss_nats_per_token": 1.777183683296432 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.12319232523441315, "learning_rate": 0.0019479950772966746, "loss": 1.7725486755371094, "step": 61280, "train_bpb": 0.6284571601177934, "train_bytes": 56227.9125, "train_loss_nats_per_token": 1.772665407526244 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.17766621708869934, "learning_rate": 0.0019474028359082523, "loss": 1.7788896560668945, "step": 61300, "train_bpb": 0.6282757738097056, "train_bytes": 56507.2, "train_loss_nats_per_token": 1.7795000779698864 }, { "epoch": 0.002106871033156883, "grad_norm": 0.22157756984233856, "learning_rate": 0.0019468105179541028, "loss": 1.7859193801879882, "step": 61320, "train_bpb": 0.6335497836523014, "train_bytes": 56519.20625, "train_loss_nats_per_token": 1.7861596322588515 }, { "epoch": 0.002238550472729188, "grad_norm": 0.12757186591625214, "learning_rate": 0.001946218123535592, "loss": 1.7696149826049805, "step": 61340, "train_bpb": 0.6261421234611524, "train_bytes": 56722.08125, "train_loss_nats_per_token": 1.769633024052579 }, { "epoch": 0.002370229912301493, "grad_norm": 0.18443775177001953, "learning_rate": 0.0019456256527540983, "loss": 1.7801097869873046, "step": 61360, "train_bpb": 0.6293789668013736, "train_bytes": 56245.75625, "train_loss_nats_per_token": 1.7799704810381 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.12420649081468582, "learning_rate": 0.0019450331057110136, "loss": 1.7689334869384765, "step": 61380, "train_bpb": 0.6236885630055263, "train_bytes": 56647.2625, "train_loss_nats_per_token": 1.769181311484778 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.10011699050664902, "learning_rate": 0.0019444404825077427, "loss": 1.7718803405761718, "step": 61400, "train_bpb": 0.625751695792086, "train_bytes": 56474.55, "train_loss_nats_per_token": 1.7719611993729882 }, { "epoch": 0.002765268231018409, "grad_norm": 0.18567967414855957, "learning_rate": 0.0019438477832457034, "loss": 1.768364143371582, "step": 61420, "train_bpb": 0.6258864428153574, "train_bytes": 56596.68125, "train_loss_nats_per_token": 1.7687656445781466 }, { "epoch": 0.002896947670590714, "grad_norm": 0.12001682817935944, "learning_rate": 0.0019432550080263264, "loss": 1.7719749450683593, "step": 61440, "train_bpb": 0.6255797476519676, "train_bytes": 56797.4375, "train_loss_nats_per_token": 1.7721568359050004 }, { "epoch": 0.003028627110163019, "grad_norm": 0.185967355966568, "learning_rate": 0.0019426621569510558, "loss": 1.7698919296264648, "step": 61460, "train_bpb": 0.6261617893357267, "train_bytes": 56435.13125, "train_loss_nats_per_token": 1.7706792069937654 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.10721507668495178, "learning_rate": 0.0019420692301213487, "loss": 1.7653749465942383, "step": 61480, "train_bpb": 0.6244445340312212, "train_bytes": 56318.2375, "train_loss_nats_per_token": 1.7654478981667845 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.12992048263549805, "learning_rate": 0.0019414762276386743, "loss": 1.7670888900756836, "step": 61500, "train_bpb": 0.624206059839131, "train_bytes": 56514.575, "train_loss_nats_per_token": 1.7675337122113983 }, { "epoch": 0.003423665428879935, "grad_norm": 0.1378113329410553, "learning_rate": 0.0019408831496045154, "loss": 1.773330307006836, "step": 61520, "train_bpb": 0.6270799829395985, "train_bytes": 56427.11875, "train_loss_nats_per_token": 1.7733300012285775 }, { "epoch": 0.00355534486845224, "grad_norm": 0.12402597069740295, "learning_rate": 0.0019402899961203683, "loss": 1.7699850082397461, "step": 61540, "train_bpb": 0.6219710775982273, "train_bytes": 57043.95625, "train_loss_nats_per_token": 1.7697111884815084 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.14671672880649567, "learning_rate": 0.001939696767287741, "loss": 1.7713808059692382, "step": 61560, "train_bpb": 0.6249592885172314, "train_bytes": 56782.99375, "train_loss_nats_per_token": 1.7713262999885007 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.12456189841032028, "learning_rate": 0.0019391034632081545, "loss": 1.764181137084961, "step": 61580, "train_bpb": 0.6241034138153788, "train_bytes": 56805.15625, "train_loss_nats_per_token": 1.7643190451817365 }, { "epoch": 0.003950383187169155, "grad_norm": 0.15086525678634644, "learning_rate": 0.0019385100839831443, "loss": 1.7586599349975587, "step": 61600, "train_bpb": 0.6227038171288081, "train_bytes": 56589.7875, "train_loss_nats_per_token": 1.759477132181976 }, { "epoch": 0.004082062626741461, "grad_norm": 0.16914771497249603, "learning_rate": 0.0019379166297142567, "loss": 1.7645421981811524, "step": 61620, "train_bpb": 0.62015483966336, "train_bytes": 56854.9125, "train_loss_nats_per_token": 1.7646593074728114 }, { "epoch": 0.004213742066313766, "grad_norm": 0.11670731008052826, "learning_rate": 0.0019373231005030528, "loss": 1.7573347091674805, "step": 61640, "train_bpb": 0.6225102203640901, "train_bytes": 56336.725, "train_loss_nats_per_token": 1.757779225033308 }, { "epoch": 0.004345421505886071, "grad_norm": 0.10884126275777817, "learning_rate": 0.0019367294964511043, "loss": 1.7507289886474608, "step": 61660, "train_bpb": 0.6195339281154585, "train_bytes": 56340.48125, "train_loss_nats_per_token": 1.7508099629251495 }, { "epoch": 0.004477100945458376, "grad_norm": 0.11791188269853592, "learning_rate": 0.0019361358176599975, "loss": 1.7582103729248046, "step": 61680, "train_bpb": 0.6205540484489418, "train_bytes": 56740.71875, "train_loss_nats_per_token": 1.7584190099908747 }, { "epoch": 0.004608780385030682, "grad_norm": 0.12153310328722, "learning_rate": 0.001935542064231331, "loss": 1.7683916091918945, "step": 61700, "train_bpb": 0.6241386862791074, "train_bytes": 56807.6375, "train_loss_nats_per_token": 1.7682926791779185 }, { "epoch": 0.004740459824602986, "grad_norm": 0.13308590650558472, "learning_rate": 0.0019349482362667157, "loss": 1.7664407730102538, "step": 61720, "train_bpb": 0.6248957458670582, "train_bytes": 56490.375, "train_loss_nats_per_token": 1.7662560395613687 }, { "epoch": 0.004872139264175292, "grad_norm": 0.10582863539457321, "learning_rate": 0.0019343543338677755, "loss": 1.759979248046875, "step": 61740, "train_bpb": 0.6206605576975344, "train_bytes": 57022.98125, "train_loss_nats_per_token": 1.7601138167693002 }, { "epoch": 0.005003818703747597, "grad_norm": 0.10867858678102493, "learning_rate": 0.0019337603571361476, "loss": 1.7591859817504882, "step": 61760, "train_bpb": 0.618893283201909, "train_bytes": 56616.2625, "train_loss_nats_per_token": 1.759045233716199 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.14677183330059052, "learning_rate": 0.0019331663061734812, "loss": 1.7576532363891602, "step": 61780, "train_bpb": 0.6208415237457225, "train_bytes": 56404.51875, "train_loss_nats_per_token": 1.7577388332129984 }, { "epoch": 0.005267177582892207, "grad_norm": 0.16370470821857452, "learning_rate": 0.001932572181081439, "loss": 1.756208610534668, "step": 61800, "train_bpb": 0.6233595229684551, "train_bytes": 56361.63125, "train_loss_nats_per_token": 1.756642322315988 }, { "epoch": 0.005398857022464512, "grad_norm": 0.09954705089330673, "learning_rate": 0.0019319779819616948, "loss": 1.7551448822021485, "step": 61820, "train_bpb": 0.6218136553711042, "train_bytes": 56126.94375, "train_loss_nats_per_token": 1.7554528966019356 }, { "epoch": 0.005530536462036818, "grad_norm": 0.11029256135225296, "learning_rate": 0.001931383708915937, "loss": 1.7559398651123046, "step": 61840, "train_bpb": 0.6218979482827408, "train_bytes": 56335.15625, "train_loss_nats_per_token": 1.7561260614847012 }, { "epoch": 0.005662215901609122, "grad_norm": 0.14724649488925934, "learning_rate": 0.0019307893620458653, "loss": 1.7482669830322266, "step": 61860, "train_bpb": 0.617477358553122, "train_bytes": 56943.975, "train_loss_nats_per_token": 1.7486346369206247 }, { "epoch": 0.005793895341181428, "grad_norm": 0.1846814900636673, "learning_rate": 0.0019301949414531933, "loss": 1.7496850967407227, "step": 61880, "train_bpb": 0.6193719113692033, "train_bytes": 56260.18125, "train_loss_nats_per_token": 1.7503986545670658 }, { "epoch": 0.005925574780753733, "grad_norm": 0.10130450874567032, "learning_rate": 0.0019296004472396453, "loss": 1.747451400756836, "step": 61900, "train_bpb": 0.6197803302719931, "train_bytes": 56512.725, "train_loss_nats_per_token": 1.7479678488224406 }, { "epoch": 0.006057254220326038, "grad_norm": 0.17764247953891754, "learning_rate": 0.0019290058795069598, "loss": 1.7549179077148438, "step": 61920, "train_bpb": 0.6192572646787224, "train_bytes": 57069.98125, "train_loss_nats_per_token": 1.7551316356885147 }, { "epoch": 0.006188933659898343, "grad_norm": 0.10288644582033157, "learning_rate": 0.0019284112383568873, "loss": 1.7472471237182616, "step": 61940, "train_bpb": 0.6196760913387858, "train_bytes": 56464.46875, "train_loss_nats_per_token": 1.7474695581962063 }, { "epoch": 0.006320613099470649, "grad_norm": 0.11297981441020966, "learning_rate": 0.0019278165238911919, "loss": 1.7463382720947265, "step": 61960, "train_bpb": 0.6188157375860189, "train_bytes": 56099.6125, "train_loss_nats_per_token": 1.7464515904967113 }, { "epoch": 0.006452292539042954, "grad_norm": 0.16920043528079987, "learning_rate": 0.0019272217362116479, "loss": 1.7490440368652345, "step": 61980, "train_bpb": 0.619358771840242, "train_bytes": 56585.25625, "train_loss_nats_per_token": 1.749905126971789 }, { "epoch": 0.006583971978615259, "grad_norm": 0.16473084688186646, "learning_rate": 0.0019266268754200445, "loss": 1.7610960006713867, "step": 62000, "train_bpb": 0.6228261719429556, "train_bytes": 56809.4875, "train_loss_nats_per_token": 1.761069376979445 }, { "epoch": 0.006583971978615259, "eval_loss": 1.6318442821502686, "eval_runtime": 76.4764, "eval_samples_per_second": 13.076, "eval_steps_per_second": 13.076, "step": 62000, "train_bpb": 0.5753292046172002, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.6383147618233447 }, { "epoch": 0.006715651418187564, "grad_norm": 0.1256142556667328, "learning_rate": 0.0019260319416181818, "loss": 1.749222183227539, "step": 62020, "train_bpb": 0.6194383199517238, "train_bytes": 56232.99375, "train_loss_nats_per_token": 1.7494376755114711 }, { "epoch": 0.00684733085775987, "grad_norm": 0.10894767194986343, "learning_rate": 0.001925436934907874, "loss": 1.7566429138183595, "step": 62040, "train_bpb": 0.6197786026097003, "train_bytes": 56887.6125, "train_loss_nats_per_token": 1.756597370621486 }, { "epoch": 0.006979010297332174, "grad_norm": 0.14489591121673584, "learning_rate": 0.001924841855390946, "loss": 1.7518857955932616, "step": 62060, "train_bpb": 0.6210999759219875, "train_bytes": 56366.05, "train_loss_nats_per_token": 1.7519024670890846 }, { "epoch": 0.00711068973690448, "grad_norm": 0.13368278741836548, "learning_rate": 0.0019242467031692363, "loss": 1.7452600479125977, "step": 62080, "train_bpb": 0.6198154727116922, "train_bytes": 56245.95, "train_loss_nats_per_token": 1.7455805433087832 }, { "epoch": 0.007242369176476785, "grad_norm": 0.14757318794727325, "learning_rate": 0.001923651478344595, "loss": 1.7458837509155274, "step": 62100, "train_bpb": 0.6158564324662211, "train_bytes": 57026.4375, "train_loss_nats_per_token": 1.7462066170855792 }, { "epoch": 0.0073740486160490904, "grad_norm": 0.15032793581485748, "learning_rate": 0.001923056181018886, "loss": 1.7416406631469727, "step": 62120, "train_bpb": 0.6162609450539549, "train_bytes": 56746.2, "train_loss_nats_per_token": 1.7418991365423 }, { "epoch": 0.007505728055621395, "grad_norm": 0.14605239033699036, "learning_rate": 0.0019224608112939849, "loss": 1.7678943634033204, "step": 62140, "train_bpb": 0.6240668820964694, "train_bytes": 56957.3375, "train_loss_nats_per_token": 1.7683509430533095 }, { "epoch": 0.007637407495193701, "grad_norm": 0.1225280612707138, "learning_rate": 0.0019218653692717786, "loss": 1.7646080017089845, "step": 62160, "train_bpb": 0.6230380722542049, "train_bytes": 56879.6875, "train_loss_nats_per_token": 1.7649099922848515 }, { "epoch": 0.007769086934766006, "grad_norm": 0.10790197551250458, "learning_rate": 0.001921269855054168, "loss": 1.7782413482666015, "step": 62180, "train_bpb": 0.6289258402187764, "train_bytes": 56811.31875, "train_loss_nats_per_token": 1.777947698688714 }, { "epoch": 0.00790076637433831, "grad_norm": 0.18440155684947968, "learning_rate": 0.0019206742687430652, "loss": 1.7857942581176758, "step": 62200, "train_bpb": 0.6324715817001405, "train_bytes": 56628.66875, "train_loss_nats_per_token": 1.7857893620119016 }, { "epoch": 0.008032445813910615, "grad_norm": 0.10779275000095367, "learning_rate": 0.001920078610440396, "loss": 1.780332374572754, "step": 62220, "train_bpb": 0.6298762410393011, "train_bytes": 56580.625, "train_loss_nats_per_token": 1.7802636853303637 }, { "epoch": 0.008164125253482922, "grad_norm": 0.13158485293388367, "learning_rate": 0.0019194828802480963, "loss": 1.7823537826538085, "step": 62240, "train_bpb": 0.6339872730882118, "train_bytes": 56310.4375, "train_loss_nats_per_token": 1.7825659222181989 }, { "epoch": 0.008295804693055226, "grad_norm": 0.16808313131332397, "learning_rate": 0.0019188870782681168, "loss": 1.7894079208374023, "step": 62260, "train_bpb": 0.6345407967084842, "train_bytes": 56110.89375, "train_loss_nats_per_token": 1.7894951838512705 }, { "epoch": 0.008427484132627531, "grad_norm": 0.12873749434947968, "learning_rate": 0.0019182912046024187, "loss": 1.7840421676635743, "step": 62280, "train_bpb": 0.6279641668705678, "train_bytes": 56729.65625, "train_loss_nats_per_token": 1.7844275292619907 }, { "epoch": 0.008559163572199836, "grad_norm": 0.09539773315191269, "learning_rate": 0.0019176952593529765, "loss": 1.7863594055175782, "step": 62300, "train_bpb": 0.6326230796725983, "train_bytes": 56848.3875, "train_loss_nats_per_token": 1.7864485314199083 }, { "epoch": 0.008690843011772142, "grad_norm": 0.13712987303733826, "learning_rate": 0.0019170992426217762, "loss": 1.7881772994995118, "step": 62320, "train_bpb": 0.6323951089147853, "train_bytes": 56451.55, "train_loss_nats_per_token": 1.7879271602087115 }, { "epoch": 0.008822522451344447, "grad_norm": 0.1305018663406372, "learning_rate": 0.0019165031545108166, "loss": 1.7841411590576173, "step": 62340, "train_bpb": 0.631782897863029, "train_bytes": 56490.375, "train_loss_nats_per_token": 1.7841061871123294 }, { "epoch": 0.008954201890916752, "grad_norm": 0.1645195484161377, "learning_rate": 0.0019159069951221084, "loss": 1.7844476699829102, "step": 62360, "train_bpb": 0.630962180052814, "train_bytes": 56500.6875, "train_loss_nats_per_token": 1.7846340580462452 }, { "epoch": 0.009085881330489057, "grad_norm": 0.1745644360780716, "learning_rate": 0.001915310764557675, "loss": 1.7839271545410156, "step": 62380, "train_bpb": 0.6308853752474692, "train_bytes": 56790.86875, "train_loss_nats_per_token": 1.784064362990375 }, { "epoch": 0.009217560770061363, "grad_norm": 0.11974461376667023, "learning_rate": 0.0019147144629195507, "loss": 1.7823247909545898, "step": 62400, "train_bpb": 0.6296805458689111, "train_bytes": 56872.10625, "train_loss_nats_per_token": 1.7821394146094667 }, { "epoch": 0.009349240209633668, "grad_norm": 0.10348714888095856, "learning_rate": 0.0019141180903097835, "loss": 1.7801977157592774, "step": 62420, "train_bpb": 0.6313352425793528, "train_bytes": 56365.9875, "train_loss_nats_per_token": 1.780152054294454 }, { "epoch": 0.009480919649205973, "grad_norm": 0.13203227519989014, "learning_rate": 0.0019135216468304326, "loss": 1.7769199371337892, "step": 62440, "train_bpb": 0.6267474640872642, "train_bytes": 56837.74375, "train_loss_nats_per_token": 1.7767191338797004 }, { "epoch": 0.009612599088778278, "grad_norm": 0.1405482441186905, "learning_rate": 0.0019129251325835702, "loss": 1.7821220397949218, "step": 62460, "train_bpb": 0.6302602500125095, "train_bytes": 56581.3625, "train_loss_nats_per_token": 1.7823484634280262 }, { "epoch": 0.009744278528350584, "grad_norm": 0.1541583240032196, "learning_rate": 0.0019123285476712792, "loss": 1.7782817840576173, "step": 62480, "train_bpb": 0.6305136153492834, "train_bytes": 56223.50625, "train_loss_nats_per_token": 1.7782694956744676 }, { "epoch": 0.009875957967922889, "grad_norm": 0.1275201290845871, "learning_rate": 0.0019117318921956557, "loss": 1.7782909393310546, "step": 62500, "train_bpb": 0.6289028247919872, "train_bytes": 56647.58125, "train_loss_nats_per_token": 1.7786777735987562 }, { "epoch": 0.010007637407495194, "grad_norm": 0.11479001492261887, "learning_rate": 0.0019111351662588084, "loss": 1.7755208969116212, "step": 62520, "train_bpb": 0.6285422568344066, "train_bytes": 56485.15, "train_loss_nats_per_token": 1.776023522359223 }, { "epoch": 0.010139316847067498, "grad_norm": 0.10506820678710938, "learning_rate": 0.0019105383699628557, "loss": 1.7753276824951172, "step": 62540, "train_bpb": 0.6274289420284491, "train_bytes": 56672.8875, "train_loss_nats_per_token": 1.7754618883462472 }, { "epoch": 0.010270996286639805, "grad_norm": 0.12774519622325897, "learning_rate": 0.001909941503409931, "loss": 1.7802400588989258, "step": 62560, "train_bpb": 0.6279683699626438, "train_bytes": 56896.3, "train_loss_nats_per_token": 1.7803536156554023 }, { "epoch": 0.01040267572621211, "grad_norm": 0.22679783403873444, "learning_rate": 0.0019093445667021773, "loss": 1.782571792602539, "step": 62580, "train_bpb": 0.6291236840313551, "train_bytes": 56624.2875, "train_loss_nats_per_token": 1.7826451114434476 }, { "epoch": 0.010534355165784414, "grad_norm": 0.16639713943004608, "learning_rate": 0.0019087475599417513, "loss": 1.764303970336914, "step": 62600, "train_bpb": 0.6238385290748507, "train_bytes": 56356.5125, "train_loss_nats_per_token": 1.764926861250679 }, { "epoch": 0.01066603460535672, "grad_norm": 0.11111053824424744, "learning_rate": 0.0019081504832308208, "loss": 1.7819591522216798, "step": 62620, "train_bpb": 0.6309396241865605, "train_bytes": 56803.475, "train_loss_nats_per_token": 1.7824450168003851 }, { "epoch": 0.010797714044929024, "grad_norm": 0.11637653410434723, "learning_rate": 0.0019075533366715652, "loss": 1.7749759674072265, "step": 62640, "train_bpb": 0.6292787672802677, "train_bytes": 56288.28125, "train_loss_nats_per_token": 1.7755232804437795 }, { "epoch": 0.01092939348450133, "grad_norm": 0.13422615826129913, "learning_rate": 0.0019069561203661773, "loss": 1.764759635925293, "step": 62660, "train_bpb": 0.6242687437618313, "train_bytes": 56677.775, "train_loss_nats_per_token": 1.7651633215061844 }, { "epoch": 0.011061072924073635, "grad_norm": 0.10001391172409058, "learning_rate": 0.0019063588344168606, "loss": 1.766859245300293, "step": 62680, "train_bpb": 0.6254109753392681, "train_bytes": 56835.45625, "train_loss_nats_per_token": 1.76704123926647 }, { "epoch": 0.01119275236364594, "grad_norm": 0.1593712717294693, "learning_rate": 0.0019057614789258315, "loss": 1.7658124923706056, "step": 62700, "train_bpb": 0.6251774189747066, "train_bytes": 56348.6125, "train_loss_nats_per_token": 1.7658522646313781 }, { "epoch": 0.011324431803218245, "grad_norm": 0.12488920241594315, "learning_rate": 0.0019051640539953165, "loss": 1.765009307861328, "step": 62720, "train_bpb": 0.6241584859053644, "train_bytes": 56671.65625, "train_loss_nats_per_token": 1.7651890734167304 }, { "epoch": 0.011456111242790551, "grad_norm": 0.12321136146783829, "learning_rate": 0.0019045665597275557, "loss": 1.76617488861084, "step": 62740, "train_bpb": 0.625018202988811, "train_bytes": 56977.73125, "train_loss_nats_per_token": 1.7662115398192562 }, { "epoch": 0.011587790682362856, "grad_norm": 0.17460301518440247, "learning_rate": 0.0019039689962248006, "loss": 1.7706453323364257, "step": 62760, "train_bpb": 0.625686146306743, "train_bytes": 56931.0625, "train_loss_nats_per_token": 1.770448040197434 }, { "epoch": 0.01171947012193516, "grad_norm": 0.13196802139282227, "learning_rate": 0.0019033713635893147, "loss": 1.7548862457275392, "step": 62780, "train_bpb": 0.620246503945001, "train_bytes": 56546.1, "train_loss_nats_per_token": 1.7550993743355772 }, { "epoch": 0.011851149561507466, "grad_norm": 0.12338767945766449, "learning_rate": 0.0019027736619233733, "loss": 1.771772575378418, "step": 62800, "train_bpb": 0.6262262794625532, "train_bytes": 56334.225, "train_loss_nats_per_token": 1.7719592272943585 }, { "epoch": 0.011982829001079772, "grad_norm": 0.1355729103088379, "learning_rate": 0.0019021758913292627, "loss": 1.7570314407348633, "step": 62820, "train_bpb": 0.6241798579179059, "train_bytes": 56423.4375, "train_loss_nats_per_token": 1.7573517604230546 }, { "epoch": 0.012114508440652077, "grad_norm": 0.10685624182224274, "learning_rate": 0.001901578051909282, "loss": 1.7627410888671875, "step": 62840, "train_bpb": 0.6245839674159255, "train_bytes": 56612.975, "train_loss_nats_per_token": 1.7631987235371274 }, { "epoch": 0.012246187880224382, "grad_norm": 0.10736310482025146, "learning_rate": 0.001900980143765741, "loss": 1.763224983215332, "step": 62860, "train_bpb": 0.6232148387915107, "train_bytes": 56977.6875, "train_loss_nats_per_token": 1.7631862984563045 }, { "epoch": 0.012377867319796686, "grad_norm": 0.1110725849866867, "learning_rate": 0.0019003821670009631, "loss": 1.7600982666015625, "step": 62880, "train_bpb": 0.6221150330970139, "train_bytes": 56202.7875, "train_loss_nats_per_token": 1.7603128476681416 }, { "epoch": 0.012509546759368993, "grad_norm": 0.142109677195549, "learning_rate": 0.0018997841217172817, "loss": 1.765638542175293, "step": 62900, "train_bpb": 0.6263326242417033, "train_bytes": 56763.74375, "train_loss_nats_per_token": 1.7657771681581687 }, { "epoch": 0.012641226198941298, "grad_norm": 0.11788687855005264, "learning_rate": 0.0018991860080170425, "loss": 1.7701026916503906, "step": 62920, "train_bpb": 0.6249529635580896, "train_bytes": 56617.75, "train_loss_nats_per_token": 1.769762746749469 }, { "epoch": 0.012772905638513602, "grad_norm": 0.13505342602729797, "learning_rate": 0.0018985878260026029, "loss": 1.7570180892944336, "step": 62940, "train_bpb": 0.6229104624324007, "train_bytes": 56246.03125, "train_loss_nats_per_token": 1.7575544249140818 }, { "epoch": 0.012904585078085907, "grad_norm": 0.12131771445274353, "learning_rate": 0.0018979895757763325, "loss": 1.7501750946044923, "step": 62960, "train_bpb": 0.6207484221809032, "train_bytes": 56215.50625, "train_loss_nats_per_token": 1.7507055911000742 }, { "epoch": 0.013036264517658214, "grad_norm": 0.10991626977920532, "learning_rate": 0.0018973912574406114, "loss": 1.7573970794677733, "step": 62980, "train_bpb": 0.6213573178950063, "train_bytes": 56764.69375, "train_loss_nats_per_token": 1.757403989004647 }, { "epoch": 0.013167943957230518, "grad_norm": 0.1373276561498642, "learning_rate": 0.0018967928710978323, "loss": 1.7590560913085938, "step": 63000, "train_bpb": 0.620224440561614, "train_bytes": 56735.33125, "train_loss_nats_per_token": 1.759084572150992 }, { "epoch": 0.013167943957230518, "eval_loss": 1.6689921617507935, "eval_runtime": 75.5423, "eval_samples_per_second": 13.238, "eval_steps_per_second": 13.238, "step": 63000, "train_bpb": 0.5884653517859451, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.6757214216058254 }, { "epoch": 0.013299623396802823, "grad_norm": 0.10157153755426407, "learning_rate": 0.0018961944168503998, "loss": 1.7591888427734375, "step": 63020, "train_bpb": 0.6232433336735923, "train_bytes": 56429.2, "train_loss_nats_per_token": 1.7587621873640193 }, { "epoch": 0.013431302836375128, "grad_norm": 0.15738347172737122, "learning_rate": 0.0018955958948007295, "loss": 1.7578702926635743, "step": 63040, "train_bpb": 0.6188185276412344, "train_bytes": 57377.70625, "train_loss_nats_per_token": 1.7579316182949518 }, { "epoch": 0.013562982275947433, "grad_norm": 0.14567504823207855, "learning_rate": 0.0018949973050512484, "loss": 1.7547531127929688, "step": 63060, "train_bpb": 0.6214245267423555, "train_bytes": 56121.5375, "train_loss_nats_per_token": 1.7547137869808678 }, { "epoch": 0.01369466171551974, "grad_norm": 0.14020739495754242, "learning_rate": 0.0018943986477043952, "loss": 1.7541475296020508, "step": 63080, "train_bpb": 0.6212041545249202, "train_bytes": 56662.075, "train_loss_nats_per_token": 1.7544456229688312 }, { "epoch": 0.013826341155092044, "grad_norm": 0.1258753389120102, "learning_rate": 0.0018937999228626206, "loss": 1.759600830078125, "step": 63100, "train_bpb": 0.6223455303275037, "train_bytes": 56453.775, "train_loss_nats_per_token": 1.7598081350182893 }, { "epoch": 0.013958020594664349, "grad_norm": 0.12510743737220764, "learning_rate": 0.001893201130628387, "loss": 1.7535943984985352, "step": 63120, "train_bpb": 0.6219306821200631, "train_bytes": 56533.9875, "train_loss_nats_per_token": 1.7542756251746112 }, { "epoch": 0.014089700034236654, "grad_norm": 0.10973630845546722, "learning_rate": 0.0018926022711041675, "loss": 1.752177619934082, "step": 63140, "train_bpb": 0.6214176740896235, "train_bytes": 56140.94375, "train_loss_nats_per_token": 1.7523628737428252 }, { "epoch": 0.01422137947380896, "grad_norm": 0.09221392124891281, "learning_rate": 0.0018920033443924475, "loss": 1.7596546173095704, "step": 63160, "train_bpb": 0.623375675996879, "train_bytes": 56623.3625, "train_loss_nats_per_token": 1.7595694685738439 }, { "epoch": 0.014353058913381265, "grad_norm": 0.14081476628780365, "learning_rate": 0.0018914043505957236, "loss": 1.7529911041259765, "step": 63180, "train_bpb": 0.6203876619404499, "train_bytes": 56282.28125, "train_loss_nats_per_token": 1.7530027847952816 }, { "epoch": 0.01448473835295357, "grad_norm": 0.1228165253996849, "learning_rate": 0.0018908052898165032, "loss": 1.7495676040649415, "step": 63200, "train_bpb": 0.6178718371252654, "train_bytes": 56853.2125, "train_loss_nats_per_token": 1.749477170548349 }, { "epoch": 0.014616417792525874, "grad_norm": 0.1173931360244751, "learning_rate": 0.0018902061621573069, "loss": 1.7528549194335938, "step": 63220, "train_bpb": 0.6206915196457662, "train_bytes": 56691.075, "train_loss_nats_per_token": 1.7530598398560895 }, { "epoch": 0.014748097232098181, "grad_norm": 0.11473619192838669, "learning_rate": 0.0018896069677206645, "loss": 1.7458625793457032, "step": 63240, "train_bpb": 0.616160866441797, "train_bytes": 57091.675, "train_loss_nats_per_token": 1.7462601941385114 }, { "epoch": 0.014879776671670486, "grad_norm": 0.16624103486537933, "learning_rate": 0.0018890077066091194, "loss": 1.7553485870361327, "step": 63260, "train_bpb": 0.6193389547497082, "train_bytes": 56810.96875, "train_loss_nats_per_token": 1.7554144233724656 }, { "epoch": 0.01501145611124279, "grad_norm": 0.1392402946949005, "learning_rate": 0.0018884083789252248, "loss": 1.7427165985107422, "step": 63280, "train_bpb": 0.6185197663124349, "train_bytes": 56270.75, "train_loss_nats_per_token": 1.7426766941230183 }, { "epoch": 0.015143135550815095, "grad_norm": 0.16094620525836945, "learning_rate": 0.0018878089847715461, "loss": 1.7556787490844727, "step": 63300, "train_bpb": 0.6213197895562181, "train_bytes": 56747.20625, "train_loss_nats_per_token": 1.7552802296135943 }, { "epoch": 0.015274814990387402, "grad_norm": 0.09358065575361252, "learning_rate": 0.0018872095242506595, "loss": 1.7495384216308594, "step": 63320, "train_bpb": 0.6203683631858393, "train_bytes": 56604.51875, "train_loss_nats_per_token": 1.7499090098655772 }, { "epoch": 0.015406494429959706, "grad_norm": 0.10762621462345123, "learning_rate": 0.0018866099974651535, "loss": 1.7723360061645508, "step": 63340, "train_bpb": 0.6260602485243288, "train_bytes": 56681.525, "train_loss_nats_per_token": 1.7728629577938502 }, { "epoch": 0.015538173869532011, "grad_norm": 0.11712884157896042, "learning_rate": 0.0018860104045176273, "loss": 1.7746639251708984, "step": 63360, "train_bpb": 0.630135113212128, "train_bytes": 56290.19375, "train_loss_nats_per_token": 1.7751620145902838 }, { "epoch": 0.015669853309104316, "grad_norm": 0.11327071487903595, "learning_rate": 0.001885410745510691, "loss": 1.7801397323608399, "step": 63380, "train_bpb": 0.6312287238150456, "train_bytes": 56405.6625, "train_loss_nats_per_token": 1.780721380447015 }, { "epoch": 0.01580153274867662, "grad_norm": 0.14787380397319794, "learning_rate": 0.0018848110205469672, "loss": 1.7747804641723632, "step": 63400, "train_bpb": 0.6296944305337155, "train_bytes": 56437.2, "train_loss_nats_per_token": 1.7748890159302952 }, { "epoch": 0.015933212188248926, "grad_norm": 0.1872226595878601, "learning_rate": 0.0018842112297290884, "loss": 1.788611602783203, "step": 63420, "train_bpb": 0.6314911638538352, "train_bytes": 56651.86875, "train_loss_nats_per_token": 1.78906582465322 }, { "epoch": 0.01606489162782123, "grad_norm": 0.10592175275087357, "learning_rate": 0.0018836113731596999, "loss": 1.7855497360229493, "step": 63440, "train_bpb": 0.6316710042841067, "train_bytes": 56515.64375, "train_loss_nats_per_token": 1.7864240307371566 }, { "epoch": 0.01619657106739354, "grad_norm": 0.143657848238945, "learning_rate": 0.0018830114509414562, "loss": 1.783848190307617, "step": 63460, "train_bpb": 0.6295041546850556, "train_bytes": 56882.34375, "train_loss_nats_per_token": 1.784866591620197 }, { "epoch": 0.016328250506965843, "grad_norm": 0.12536552548408508, "learning_rate": 0.0018824114631770252, "loss": 1.7773574829101562, "step": 63480, "train_bpb": 0.6308511814468614, "train_bytes": 56164.46875, "train_loss_nats_per_token": 1.77772637637979 }, { "epoch": 0.016459929946538148, "grad_norm": 0.12971702218055725, "learning_rate": 0.0018818114099690844, "loss": 1.771673583984375, "step": 63500, "train_bpb": 0.6277891357960419, "train_bytes": 56333.8625, "train_loss_nats_per_token": 1.7717072206803417 }, { "epoch": 0.016591609386110453, "grad_norm": 0.17239081859588623, "learning_rate": 0.0018812112914203245, "loss": 1.7763727188110352, "step": 63520, "train_bpb": 0.6301139832593678, "train_bytes": 56231.45, "train_loss_nats_per_token": 1.7770076761464229 }, { "epoch": 0.016723288825682758, "grad_norm": 0.17456717789173126, "learning_rate": 0.0018806111076334444, "loss": 1.774092674255371, "step": 63540, "train_bpb": 0.628126843147184, "train_bytes": 56338.0625, "train_loss_nats_per_token": 1.7747051960381766 }, { "epoch": 0.016854968265255062, "grad_norm": 0.1358521580696106, "learning_rate": 0.0018800108587111568, "loss": 1.7809818267822266, "step": 63560, "train_bpb": 0.6299592887645886, "train_bytes": 56605.78125, "train_loss_nats_per_token": 1.7815781158494008 }, { "epoch": 0.016986647704827367, "grad_norm": 0.14188097417354584, "learning_rate": 0.0018794105447561837, "loss": 1.782798957824707, "step": 63580, "train_bpb": 0.6305928052907248, "train_bytes": 56887.49375, "train_loss_nats_per_token": 1.783156637572643 }, { "epoch": 0.017118327144399672, "grad_norm": 0.13208572566509247, "learning_rate": 0.0018788101658712597, "loss": 1.7681951522827148, "step": 63600, "train_bpb": 0.6269960904772092, "train_bytes": 56529.63125, "train_loss_nats_per_token": 1.7688435007406276 }, { "epoch": 0.01725000658397198, "grad_norm": 0.09853200614452362, "learning_rate": 0.0018782097221591305, "loss": 1.7687847137451171, "step": 63620, "train_bpb": 0.6267829371470116, "train_bytes": 57108.78125, "train_loss_nats_per_token": 1.7689105743609053 }, { "epoch": 0.017381686023544285, "grad_norm": 0.09453556686639786, "learning_rate": 0.001877609213722551, "loss": 1.7657785415649414, "step": 63640, "train_bpb": 0.6259778412717085, "train_bytes": 56899.96875, "train_loss_nats_per_token": 1.7660810703050602 }, { "epoch": 0.01751336546311659, "grad_norm": 0.0944974347949028, "learning_rate": 0.0018770086406642889, "loss": 1.778507614135742, "step": 63660, "train_bpb": 0.6296160006790142, "train_bytes": 56525.2125, "train_loss_nats_per_token": 1.7787596021929135 }, { "epoch": 0.017645044902688894, "grad_norm": 0.1238592192530632, "learning_rate": 0.001876408003087123, "loss": 1.758046531677246, "step": 63680, "train_bpb": 0.6220465383516208, "train_bytes": 56769.68125, "train_loss_nats_per_token": 1.7583063961273755 }, { "epoch": 0.0177767243422612, "grad_norm": 0.09906717389822006, "learning_rate": 0.0018758073010938425, "loss": 1.7715818405151367, "step": 63700, "train_bpb": 0.6275071733299665, "train_bytes": 56469.2, "train_loss_nats_per_token": 1.7720170063840168 }, { "epoch": 0.017908403781833504, "grad_norm": 0.1368124634027481, "learning_rate": 0.0018752065347872474, "loss": 1.7624378204345703, "step": 63720, "train_bpb": 0.6234465488804729, "train_bytes": 56413.8875, "train_loss_nats_per_token": 1.7625794176792802 }, { "epoch": 0.01804008322140581, "grad_norm": 0.14230164885520935, "learning_rate": 0.001874605704270149, "loss": 1.7500644683837892, "step": 63740, "train_bpb": 0.619467373070138, "train_bytes": 56640.575, "train_loss_nats_per_token": 1.750377630429683 }, { "epoch": 0.018171762660978114, "grad_norm": 0.1629158854484558, "learning_rate": 0.0018740048096453701, "loss": 1.764028549194336, "step": 63760, "train_bpb": 0.6253701724171671, "train_bytes": 56652.8375, "train_loss_nats_per_token": 1.7637753956522066 }, { "epoch": 0.018303442100550422, "grad_norm": 0.10744798183441162, "learning_rate": 0.0018734038510157445, "loss": 1.772380256652832, "step": 63780, "train_bpb": 0.6260907083496189, "train_bytes": 56680.79375, "train_loss_nats_per_token": 1.7726676117854572 }, { "epoch": 0.018435121540122727, "grad_norm": 0.19269350171089172, "learning_rate": 0.0018728028284841155, "loss": 1.7666484832763671, "step": 63800, "train_bpb": 0.6246088181514404, "train_bytes": 56467.54375, "train_loss_nats_per_token": 1.7665502466919936 }, { "epoch": 0.01856680097969503, "grad_norm": 0.10624369233846664, "learning_rate": 0.001872201742153339, "loss": 1.755765151977539, "step": 63820, "train_bpb": 0.6206369808456745, "train_bytes": 56724.9, "train_loss_nats_per_token": 1.7561542983859995 }, { "epoch": 0.018698480419267336, "grad_norm": 0.13163509964942932, "learning_rate": 0.0018716005921262811, "loss": 1.760056495666504, "step": 63840, "train_bpb": 0.6241102758674527, "train_bytes": 56323.54375, "train_loss_nats_per_token": 1.7605991377660606 }, { "epoch": 0.01883015985883964, "grad_norm": 0.1799865961074829, "learning_rate": 0.0018709993785058184, "loss": 1.767264175415039, "step": 63860, "train_bpb": 0.6249747321895248, "train_bytes": 56390.625, "train_loss_nats_per_token": 1.7678863978477115 }, { "epoch": 0.018961839298411946, "grad_norm": 0.11212833970785141, "learning_rate": 0.0018703981013948395, "loss": 1.761361312866211, "step": 63880, "train_bpb": 0.6256681121569294, "train_bytes": 56332.7, "train_loss_nats_per_token": 1.7617290562776422 }, { "epoch": 0.01909351873798425, "grad_norm": 0.10379034280776978, "learning_rate": 0.0018697967608962425, "loss": 1.750840950012207, "step": 63900, "train_bpb": 0.6187418073742522, "train_bytes": 56721.78125, "train_loss_nats_per_token": 1.7513697635160976 }, { "epoch": 0.019225198177556555, "grad_norm": 0.11276817321777344, "learning_rate": 0.0018691953571129375, "loss": 1.752840232849121, "step": 63920, "train_bpb": 0.6194070158918125, "train_bytes": 56750.60625, "train_loss_nats_per_token": 1.7535155784388747 }, { "epoch": 0.01935687761712886, "grad_norm": 0.10171769559383392, "learning_rate": 0.0018685938901478452, "loss": 1.74127197265625, "step": 63940, "train_bpb": 0.6177999374095071, "train_bytes": 56328.3875, "train_loss_nats_per_token": 1.741209883178063 }, { "epoch": 0.019488557056701168, "grad_norm": 0.1282004714012146, "learning_rate": 0.0018679923601038963, "loss": 1.7464399337768555, "step": 63960, "train_bpb": 0.6178984827703066, "train_bytes": 56676.35625, "train_loss_nats_per_token": 1.7466153875417443 }, { "epoch": 0.019620236496273473, "grad_norm": 0.11716566979885101, "learning_rate": 0.0018673907670840335, "loss": 1.7629877090454102, "step": 63980, "train_bpb": 0.6234754589938167, "train_bytes": 56293.83125, "train_loss_nats_per_token": 1.7628107748577853 }, { "epoch": 0.019751915935845778, "grad_norm": 0.12950582802295685, "learning_rate": 0.001866789111191209, "loss": 1.7497800827026366, "step": 64000, "train_bpb": 0.6188692730032028, "train_bytes": 56513.58125, "train_loss_nats_per_token": 1.7500143344791845 }, { "epoch": 0.019751915935845778, "eval_loss": 1.6860284805297852, "eval_runtime": 76.3352, "eval_samples_per_second": 13.1, "eval_steps_per_second": 13.1, "step": 64000, "train_bpb": 0.5944245585033697, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.6926909344613512 }, { "epoch": 0.019883595375418082, "grad_norm": 0.11891575157642365, "learning_rate": 0.0018661873925283872, "loss": 1.7486011505126953, "step": 64020, "train_bpb": 0.6182613610399195, "train_bytes": 56614.95, "train_loss_nats_per_token": 1.748804598987754 }, { "epoch": 0.020015274814990387, "grad_norm": 0.11116427183151245, "learning_rate": 0.001865585611198542, "loss": 1.754350471496582, "step": 64040, "train_bpb": 0.6181302529823262, "train_bytes": 56913.95, "train_loss_nats_per_token": 1.7542939214731685 }, { "epoch": 0.020146954254562692, "grad_norm": 0.11663824319839478, "learning_rate": 0.0018649837673046586, "loss": 1.754552459716797, "step": 64060, "train_bpb": 0.6189975991535586, "train_bytes": 56580.24375, "train_loss_nats_per_token": 1.754912253416025 }, { "epoch": 0.020278633694134997, "grad_norm": 0.11642865091562271, "learning_rate": 0.0018643818609497328, "loss": 1.752797508239746, "step": 64080, "train_bpb": 0.6185939519742618, "train_bytes": 57080.625, "train_loss_nats_per_token": 1.7528659056755225 }, { "epoch": 0.0204103131337073, "grad_norm": 0.10608592629432678, "learning_rate": 0.001863779892236771, "loss": 1.7468135833740235, "step": 64100, "train_bpb": 0.6204764745195106, "train_bytes": 56546.48125, "train_loss_nats_per_token": 1.7471790382029446 }, { "epoch": 0.02054199257327961, "grad_norm": 0.12963713705539703, "learning_rate": 0.0018631778612687904, "loss": 1.741278839111328, "step": 64120, "train_bpb": 0.6159586242575156, "train_bytes": 56619.5625, "train_loss_nats_per_token": 1.7415755186054052 }, { "epoch": 0.020673672012851915, "grad_norm": 0.10895021259784698, "learning_rate": 0.001862575768148819, "loss": 1.7461044311523437, "step": 64140, "train_bpb": 0.619333920433068, "train_bytes": 56487.0625, "train_loss_nats_per_token": 1.746052368668804 }, { "epoch": 0.02080535145242422, "grad_norm": 0.10060863941907883, "learning_rate": 0.0018619736129798952, "loss": 1.7542665481567383, "step": 64160, "train_bpb": 0.6198888580072623, "train_bytes": 56803.1, "train_loss_nats_per_token": 1.7547309784486051 }, { "epoch": 0.020937030891996524, "grad_norm": 0.096989706158638, "learning_rate": 0.0018613713958650683, "loss": 1.7430753707885742, "step": 64180, "train_bpb": 0.6182423639599679, "train_bytes": 56895.6125, "train_loss_nats_per_token": 1.743417892941417 }, { "epoch": 0.02106871033156883, "grad_norm": 0.15476413071155548, "learning_rate": 0.001860769116907397, "loss": 1.7512142181396484, "step": 64200, "train_bpb": 0.6178615870212195, "train_bytes": 56691.45, "train_loss_nats_per_token": 1.7509542722807538 }, { "epoch": 0.021200389771141134, "grad_norm": 0.10801466554403305, "learning_rate": 0.001860166776209953, "loss": 1.7460174560546875, "step": 64220, "train_bpb": 0.6179986001324165, "train_bytes": 56546.03125, "train_loss_nats_per_token": 1.746380268602827 }, { "epoch": 0.02133206921071344, "grad_norm": 0.13565224409103394, "learning_rate": 0.0018595643738758157, "loss": 1.7497320175170898, "step": 64240, "train_bpb": 0.6213920502587109, "train_bytes": 56025.73125, "train_loss_nats_per_token": 1.7499968006866977 }, { "epoch": 0.021463748650285743, "grad_norm": 0.09991683810949326, "learning_rate": 0.0018589619100080773, "loss": 1.7514360427856446, "step": 64260, "train_bpb": 0.6185526415721219, "train_bytes": 57186.2125, "train_loss_nats_per_token": 1.7517059818730671 }, { "epoch": 0.021595428089858048, "grad_norm": 0.2032524198293686, "learning_rate": 0.0018583593847098397, "loss": 1.7404657363891602, "step": 64280, "train_bpb": 0.6172124215377303, "train_bytes": 56325.1875, "train_loss_nats_per_token": 1.7405247197265576 }, { "epoch": 0.021727107529430356, "grad_norm": 0.12631218135356903, "learning_rate": 0.0018577567980842152, "loss": 1.740738296508789, "step": 64300, "train_bpb": 0.6166500691323835, "train_bytes": 56234.4125, "train_loss_nats_per_token": 1.7408280562102425 }, { "epoch": 0.02185878696900266, "grad_norm": 0.15879036486148834, "learning_rate": 0.0018571541502343265, "loss": 1.7445768356323241, "step": 64320, "train_bpb": 0.6187617837413681, "train_bytes": 56477.63125, "train_loss_nats_per_token": 1.7447102984746279 }, { "epoch": 0.021990466408574966, "grad_norm": 0.1627405881881714, "learning_rate": 0.001856551441263307, "loss": 1.756363868713379, "step": 64340, "train_bpb": 0.6249487041543555, "train_bytes": 55814.64375, "train_loss_nats_per_token": 1.756313111258582 }, { "epoch": 0.02212214584814727, "grad_norm": 0.14653439819812775, "learning_rate": 0.0018559486712743014, "loss": 1.7364974975585938, "step": 64360, "train_bpb": 0.6140769481480213, "train_bytes": 56349.31875, "train_loss_nats_per_token": 1.7361852283069892 }, { "epoch": 0.022253825287719575, "grad_norm": 0.15920495986938477, "learning_rate": 0.0018553458403704627, "loss": 1.73450927734375, "step": 64380, "train_bpb": 0.6111078891715178, "train_bytes": 57159.1, "train_loss_nats_per_token": 1.734520678914937 }, { "epoch": 0.02238550472729188, "grad_norm": 0.11347683519124985, "learning_rate": 0.0018547429486549564, "loss": 1.7384281158447266, "step": 64400, "train_bpb": 0.6120650426387823, "train_bytes": 56840.625, "train_loss_nats_per_token": 1.7387185858763752 }, { "epoch": 0.022517184166864185, "grad_norm": 0.1647258698940277, "learning_rate": 0.0018541399962309572, "loss": 1.738259506225586, "step": 64420, "train_bpb": 0.6164002361385981, "train_bytes": 56125.6875, "train_loss_nats_per_token": 1.7387567187900779 }, { "epoch": 0.02264886360643649, "grad_norm": 0.10896439105272293, "learning_rate": 0.0018535369832016516, "loss": 1.7492368698120118, "step": 64440, "train_bpb": 0.6203626568558797, "train_bytes": 56191.7, "train_loss_nats_per_token": 1.7490111849574443 }, { "epoch": 0.022780543046008798, "grad_norm": 0.1352044939994812, "learning_rate": 0.0018529339096702339, "loss": 1.7411384582519531, "step": 64460, "train_bpb": 0.6168982557176247, "train_bytes": 56629.9875, "train_loss_nats_per_token": 1.7412377135532555 }, { "epoch": 0.022912222485581103, "grad_norm": 0.14860899746418, "learning_rate": 0.0018523307757399114, "loss": 1.746278953552246, "step": 64480, "train_bpb": 0.6198202410283647, "train_bytes": 56680.0875, "train_loss_nats_per_token": 1.7467835496995183 }, { "epoch": 0.023043901925153407, "grad_norm": 0.10923822224140167, "learning_rate": 0.0018517275815139005, "loss": 1.7400382995605468, "step": 64500, "train_bpb": 0.6161985715397423, "train_bytes": 56377.84375, "train_loss_nats_per_token": 1.7399971126612117 }, { "epoch": 0.023175581364725712, "grad_norm": 0.12360353022813797, "learning_rate": 0.001851124327095428, "loss": 1.7517929077148438, "step": 64520, "train_bpb": 0.6202454017697927, "train_bytes": 56585.6625, "train_loss_nats_per_token": 1.7518942951235095 }, { "epoch": 0.023307260804298017, "grad_norm": 0.12313119322061539, "learning_rate": 0.0018505210125877316, "loss": 1.7614748001098632, "step": 64540, "train_bpb": 0.6233375177308366, "train_bytes": 56617.4125, "train_loss_nats_per_token": 1.7616333573553387 }, { "epoch": 0.02343894024387032, "grad_norm": 0.11500637978315353, "learning_rate": 0.001849917638094058, "loss": 1.7622629165649415, "step": 64560, "train_bpb": 0.6250420942604813, "train_bytes": 56750.525, "train_loss_nats_per_token": 1.762733424811165 }, { "epoch": 0.023570619683442626, "grad_norm": 0.09867610037326813, "learning_rate": 0.0018493142037176653, "loss": 1.7768150329589845, "step": 64580, "train_bpb": 0.6297290605516807, "train_bytes": 56673.575, "train_loss_nats_per_token": 1.7767399319535184 }, { "epoch": 0.02370229912301493, "grad_norm": 0.13972672820091248, "learning_rate": 0.0018487107095618213, "loss": 1.770728874206543, "step": 64600, "train_bpb": 0.6266389612114293, "train_bytes": 56233.2875, "train_loss_nats_per_token": 1.770305110369278 }, { "epoch": 0.023833978562587236, "grad_norm": 0.10179337859153748, "learning_rate": 0.0018481071557298044, "loss": 1.7638864517211914, "step": 64620, "train_bpb": 0.6253729867226778, "train_bytes": 56393.3, "train_loss_nats_per_token": 1.763949885914535 }, { "epoch": 0.023965658002159544, "grad_norm": 0.13786236941814423, "learning_rate": 0.0018475035423249028, "loss": 1.7660232543945313, "step": 64640, "train_bpb": 0.6243561986641518, "train_bytes": 56695.4875, "train_loss_nats_per_token": 1.7660139559860533 }, { "epoch": 0.02409733744173185, "grad_norm": 0.1399010866880417, "learning_rate": 0.0018468998694504157, "loss": 1.7764543533325194, "step": 64660, "train_bpb": 0.6305284641897241, "train_bytes": 56538.6125, "train_loss_nats_per_token": 1.7765292885305772 }, { "epoch": 0.024229016881304154, "grad_norm": 0.13358908891677856, "learning_rate": 0.0018462961372096517, "loss": 1.7741411209106446, "step": 64680, "train_bpb": 0.6303620359897038, "train_bytes": 55695.14375, "train_loss_nats_per_token": 1.7748535402419856 }, { "epoch": 0.02436069632087646, "grad_norm": 0.1331121027469635, "learning_rate": 0.001845692345705929, "loss": 1.775316047668457, "step": 64700, "train_bpb": 0.6300734363180864, "train_bytes": 56582.7625, "train_loss_nats_per_token": 1.7757031462974853 }, { "epoch": 0.024492375760448763, "grad_norm": 0.12405195087194443, "learning_rate": 0.0018450884950425776, "loss": 1.779593276977539, "step": 64720, "train_bpb": 0.6295954818215438, "train_bytes": 57312.25625, "train_loss_nats_per_token": 1.7798796339537883 }, { "epoch": 0.024624055200021068, "grad_norm": 0.09632065147161484, "learning_rate": 0.0018444845853229364, "loss": 1.7696037292480469, "step": 64740, "train_bpb": 0.6249528142232548, "train_bytes": 57664.53125, "train_loss_nats_per_token": 1.7700729132273978 }, { "epoch": 0.024755734639593373, "grad_norm": 0.09016328305006027, "learning_rate": 0.0018438806166503547, "loss": 1.7682765960693358, "step": 64760, "train_bpb": 0.6242668477807847, "train_bytes": 56850.3, "train_loss_nats_per_token": 1.7689991943439367 }, { "epoch": 0.024887414079165678, "grad_norm": 0.19884686172008514, "learning_rate": 0.001843276589128192, "loss": 1.773239517211914, "step": 64780, "train_bpb": 0.627552859319553, "train_bytes": 56341.95625, "train_loss_nats_per_token": 1.7733367215224085 }, { "epoch": 0.025019093518737986, "grad_norm": 0.1374020129442215, "learning_rate": 0.0018426725028598179, "loss": 1.773383331298828, "step": 64800, "train_bpb": 0.6264045842882233, "train_bytes": 56400.7125, "train_loss_nats_per_token": 1.773662410248799 }, { "epoch": 0.02515077295831029, "grad_norm": 0.09594950079917908, "learning_rate": 0.0018420683579486116, "loss": 1.7746393203735351, "step": 64820, "train_bpb": 0.6282746280711515, "train_bytes": 56189.0125, "train_loss_nats_per_token": 1.7745663126184987 }, { "epoch": 0.025282452397882595, "grad_norm": 0.13217893242835999, "learning_rate": 0.0018414641544979634, "loss": 1.7749906539916993, "step": 64840, "train_bpb": 0.627326922284183, "train_bytes": 56625.1125, "train_loss_nats_per_token": 1.7755441052309835 }, { "epoch": 0.0254141318374549, "grad_norm": 0.10296190530061722, "learning_rate": 0.0018408598926112723, "loss": 1.7739843368530273, "step": 64860, "train_bpb": 0.6265105961400614, "train_bytes": 56678.225, "train_loss_nats_per_token": 1.7742787289705604 }, { "epoch": 0.025545811277027205, "grad_norm": 0.1072382852435112, "learning_rate": 0.0018402555723919481, "loss": 1.7648448944091797, "step": 64880, "train_bpb": 0.6228117766591573, "train_bytes": 56907.21875, "train_loss_nats_per_token": 1.7657096603425722 }, { "epoch": 0.02567749071659951, "grad_norm": 0.1840733140707016, "learning_rate": 0.00183965119394341, "loss": 1.768271255493164, "step": 64900, "train_bpb": 0.6259557658224123, "train_bytes": 56491.5875, "train_loss_nats_per_token": 1.7686581726309158 }, { "epoch": 0.025809170156171814, "grad_norm": 0.1546754390001297, "learning_rate": 0.0018390467573690882, "loss": 1.7768306732177734, "step": 64920, "train_bpb": 0.6278240144087043, "train_bytes": 56663.7, "train_loss_nats_per_token": 1.7772119911764408 }, { "epoch": 0.02594084959574412, "grad_norm": 0.13413704931735992, "learning_rate": 0.0018384422627724221, "loss": 1.751815414428711, "step": 64940, "train_bpb": 0.6198328666684237, "train_bytes": 56544.1625, "train_loss_nats_per_token": 1.751609169015438 }, { "epoch": 0.026072529035316427, "grad_norm": 0.15267334878444672, "learning_rate": 0.0018378377102568602, "loss": 1.7583040237426757, "step": 64960, "train_bpb": 0.6227295948418429, "train_bytes": 56307.76875, "train_loss_nats_per_token": 1.7584230922792181 }, { "epoch": 0.026204208474888732, "grad_norm": 0.10096501559019089, "learning_rate": 0.0018372330999258631, "loss": 1.7627973556518555, "step": 64980, "train_bpb": 0.625957652171307, "train_bytes": 56465.81875, "train_loss_nats_per_token": 1.7628369077537722 }, { "epoch": 0.026335887914461037, "grad_norm": 0.16672393679618835, "learning_rate": 0.0018366284318828993, "loss": 1.7659345626831056, "step": 65000, "train_bpb": 0.6270829389790146, "train_bytes": 56406.4875, "train_loss_nats_per_token": 1.7657671096486274 }, { "epoch": 0.026335887914461037, "eval_loss": 1.6979228258132935, "eval_runtime": 76.4887, "eval_samples_per_second": 13.074, "eval_steps_per_second": 13.074, "step": 65000, "train_bpb": 0.598578813343806, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.7045206433911992 }, { "epoch": 0.02646756735403334, "grad_norm": 0.1449296921491623, "learning_rate": 0.0018360237062314483, "loss": 1.764761734008789, "step": 65020, "train_bpb": 0.6247281023463409, "train_bytes": 56860.3625, "train_loss_nats_per_token": 1.7651574192646935 }, { "epoch": 0.026599246793605646, "grad_norm": 0.1469276249408722, "learning_rate": 0.0018354189230749987, "loss": 1.7567232131958008, "step": 65040, "train_bpb": 0.6232288213494028, "train_bytes": 56096.725, "train_loss_nats_per_token": 1.7571499905538637 }, { "epoch": 0.02673092623317795, "grad_norm": 0.13042078912258148, "learning_rate": 0.0018348140825170493, "loss": 1.7605409622192383, "step": 65060, "train_bpb": 0.6219806622964095, "train_bytes": 56453.69375, "train_loss_nats_per_token": 1.760820871034311 }, { "epoch": 0.026862605672750256, "grad_norm": 0.12299855798482895, "learning_rate": 0.0018342091846611092, "loss": 1.7583702087402344, "step": 65080, "train_bpb": 0.6214079298422176, "train_bytes": 56648.925, "train_loss_nats_per_token": 1.758430203163433 }, { "epoch": 0.02699428511232256, "grad_norm": 0.13591144979000092, "learning_rate": 0.0018336042296106965, "loss": 1.756865882873535, "step": 65100, "train_bpb": 0.6240011894907073, "train_bytes": 56710.53125, "train_loss_nats_per_token": 1.7572049822968405 }, { "epoch": 0.027125964551894866, "grad_norm": 0.13546569645404816, "learning_rate": 0.0018329992174693397, "loss": 1.7548334121704101, "step": 65120, "train_bpb": 0.6217033584565105, "train_bytes": 56541.9875, "train_loss_nats_per_token": 1.7548741675530646 }, { "epoch": 0.027257643991467174, "grad_norm": 0.11460920423269272, "learning_rate": 0.0018323941483405764, "loss": 1.7566987991333007, "step": 65140, "train_bpb": 0.623240116396315, "train_bytes": 56223.91875, "train_loss_nats_per_token": 1.7571375211013367 }, { "epoch": 0.02738932343103948, "grad_norm": 0.1674625128507614, "learning_rate": 0.0018317890223279545, "loss": 1.7653774261474608, "step": 65160, "train_bpb": 0.6224772056010723, "train_bytes": 56978.26875, "train_loss_nats_per_token": 1.7652682995408318 }, { "epoch": 0.027521002870611783, "grad_norm": 0.12123852968215942, "learning_rate": 0.0018311838395350317, "loss": 1.759901237487793, "step": 65180, "train_bpb": 0.6229555358726437, "train_bytes": 56553.6125, "train_loss_nats_per_token": 1.7602923540342208 }, { "epoch": 0.027652682310184088, "grad_norm": 0.13497740030288696, "learning_rate": 0.001830578600065375, "loss": 1.7630739212036133, "step": 65200, "train_bpb": 0.6244375744003833, "train_bytes": 56943.40625, "train_loss_nats_per_token": 1.7631608077515841 }, { "epoch": 0.027784361749756393, "grad_norm": 0.22097095847129822, "learning_rate": 0.0018299733040225614, "loss": 1.7624841690063477, "step": 65220, "train_bpb": 0.6237964124753153, "train_bytes": 56626.06875, "train_loss_nats_per_token": 1.7628974813268279 }, { "epoch": 0.027916041189328698, "grad_norm": 0.09252142906188965, "learning_rate": 0.001829367951510177, "loss": 1.7568052291870118, "step": 65240, "train_bpb": 0.6207583997114864, "train_bytes": 56470.63125, "train_loss_nats_per_token": 1.7570648183980384 }, { "epoch": 0.028047720628901002, "grad_norm": 0.11635258793830872, "learning_rate": 0.0018287625426318193, "loss": 1.7659467697143554, "step": 65260, "train_bpb": 0.6220320114104386, "train_bytes": 57183.0625, "train_loss_nats_per_token": 1.7658361013661732 }, { "epoch": 0.028179400068473307, "grad_norm": 0.1255776286125183, "learning_rate": 0.0018281570774910927, "loss": 1.761505699157715, "step": 65280, "train_bpb": 0.6234980107049951, "train_bytes": 56402.23125, "train_loss_nats_per_token": 1.7619832968461497 }, { "epoch": 0.028311079508045615, "grad_norm": 0.1569579839706421, "learning_rate": 0.0018275515561916131, "loss": 1.7519027709960937, "step": 65300, "train_bpb": 0.6201181769598428, "train_bytes": 56713.60625, "train_loss_nats_per_token": 1.7524664574916329 }, { "epoch": 0.02844275894761792, "grad_norm": 0.16546931862831116, "learning_rate": 0.0018269459788370064, "loss": 1.752970314025879, "step": 65320, "train_bpb": 0.6216933645845436, "train_bytes": 56975.85, "train_loss_nats_per_token": 1.7533753893797908 }, { "epoch": 0.028574438387190225, "grad_norm": 0.15470819175243378, "learning_rate": 0.0018263403455309071, "loss": 1.7648845672607423, "step": 65340, "train_bpb": 0.6238857778038319, "train_bytes": 56582.70625, "train_loss_nats_per_token": 1.7648973335509013 }, { "epoch": 0.02870611782676253, "grad_norm": 0.11253272742033005, "learning_rate": 0.001825734656376959, "loss": 1.7625997543334961, "step": 65360, "train_bpb": 0.6206929961367598, "train_bytes": 56626.6875, "train_loss_nats_per_token": 1.7628366917120752 }, { "epoch": 0.028837797266334834, "grad_norm": 0.14017771184444427, "learning_rate": 0.001825128911478816, "loss": 1.756396484375, "step": 65380, "train_bpb": 0.6210338866284082, "train_bytes": 56881.60625, "train_loss_nats_per_token": 1.7565847754406243 }, { "epoch": 0.02896947670590714, "grad_norm": 0.15542899072170258, "learning_rate": 0.0018245231109401418, "loss": 1.7564102172851563, "step": 65400, "train_bpb": 0.6220924004438635, "train_bytes": 56891.90625, "train_loss_nats_per_token": 1.7571399155030485 }, { "epoch": 0.029101156145479444, "grad_norm": 0.12630757689476013, "learning_rate": 0.0018239172548646094, "loss": 1.7543754577636719, "step": 65420, "train_bpb": 0.6205444275655627, "train_bytes": 56575.025, "train_loss_nats_per_token": 1.7547273857271557 }, { "epoch": 0.02923283558505175, "grad_norm": 0.14113236963748932, "learning_rate": 0.001823311343355901, "loss": 1.7495370864868165, "step": 65440, "train_bpb": 0.6197702208789982, "train_bytes": 56393.30625, "train_loss_nats_per_token": 1.749519624237272 }, { "epoch": 0.029364515024624054, "grad_norm": 0.14338169991970062, "learning_rate": 0.0018227053765177085, "loss": 1.7608238220214845, "step": 65460, "train_bpb": 0.6218726164086682, "train_bytes": 56771.95625, "train_loss_nats_per_token": 1.76111671116096 }, { "epoch": 0.029496194464196362, "grad_norm": 0.15473738312721252, "learning_rate": 0.001822099354453733, "loss": 1.753028106689453, "step": 65480, "train_bpb": 0.6177273831103326, "train_bytes": 56933.35, "train_loss_nats_per_token": 1.7530954683494138 }, { "epoch": 0.029627873903768667, "grad_norm": 0.09051491320133209, "learning_rate": 0.001821493277267686, "loss": 1.7411779403686523, "step": 65500, "train_bpb": 0.6167592523814037, "train_bytes": 56788.9625, "train_loss_nats_per_token": 1.741119565437549 }, { "epoch": 0.02975955334334097, "grad_norm": 0.1601225584745407, "learning_rate": 0.001820887145063288, "loss": 1.7593490600585937, "step": 65520, "train_bpb": 0.6216045638327056, "train_bytes": 56706.16875, "train_loss_nats_per_token": 1.7596901283170714 }, { "epoch": 0.029891232782913276, "grad_norm": 0.11241374164819717, "learning_rate": 0.0018202809579442672, "loss": 1.753786849975586, "step": 65540, "train_bpb": 0.6157106729157668, "train_bytes": 57101.59375, "train_loss_nats_per_token": 1.7541465125073612 }, { "epoch": 0.03002291222248558, "grad_norm": 0.09816886484622955, "learning_rate": 0.0018196747160143642, "loss": 1.7503389358520507, "step": 65560, "train_bpb": 0.6207686319091456, "train_bytes": 56139.6125, "train_loss_nats_per_token": 1.7505196435903085 }, { "epoch": 0.030154591662057886, "grad_norm": 0.12562932074069977, "learning_rate": 0.0018190684193773266, "loss": 1.7505247116088867, "step": 65580, "train_bpb": 0.6198007644397356, "train_bytes": 56376.78125, "train_loss_nats_per_token": 1.7505287743506492 }, { "epoch": 0.03028627110163019, "grad_norm": 0.1265789270401001, "learning_rate": 0.001818462068136913, "loss": 1.7560331344604492, "step": 65600, "train_bpb": 0.6198455169552516, "train_bytes": 56652.51875, "train_loss_nats_per_token": 1.7561776411340144 }, { "epoch": 0.030417950541202495, "grad_norm": 0.1257970631122589, "learning_rate": 0.0018178556623968895, "loss": 1.7483354568481446, "step": 65620, "train_bpb": 0.6203455526110292, "train_bytes": 56062.5625, "train_loss_nats_per_token": 1.748523833272303 }, { "epoch": 0.030549629980774803, "grad_norm": 0.11794394999742508, "learning_rate": 0.0018172492022610332, "loss": 1.7488901138305664, "step": 65640, "train_bpb": 0.6185016746549021, "train_bytes": 56726.2875, "train_loss_nats_per_token": 1.7492824802816638 }, { "epoch": 0.030681309420347108, "grad_norm": 0.11422976106405258, "learning_rate": 0.0018166426878331295, "loss": 1.7469724655151366, "step": 65660, "train_bpb": 0.617713472483144, "train_bytes": 56921.075, "train_loss_nats_per_token": 1.7468044787614034 }, { "epoch": 0.030812988859919413, "grad_norm": 0.14921388030052185, "learning_rate": 0.0018160361192169744, "loss": 1.7458086013793945, "step": 65680, "train_bpb": 0.6179938197094433, "train_bytes": 56531.49375, "train_loss_nats_per_token": 1.7457549452421053 }, { "epoch": 0.030944668299491718, "grad_norm": 0.11006993055343628, "learning_rate": 0.0018154294965163713, "loss": 1.7656284332275392, "step": 65700, "train_bpb": 0.6263072003851187, "train_bytes": 56209.525, "train_loss_nats_per_token": 1.7654404403499142 }, { "epoch": 0.031076347739064022, "grad_norm": 0.1039053276181221, "learning_rate": 0.0018148228198351345, "loss": 1.7642967224121093, "step": 65720, "train_bpb": 0.6230630903543636, "train_bytes": 56712.09375, "train_loss_nats_per_token": 1.7644624194393979 }, { "epoch": 0.031208027178636327, "grad_norm": 0.09604157507419586, "learning_rate": 0.001814216089277086, "loss": 1.7636005401611328, "step": 65740, "train_bpb": 0.6265372805966687, "train_bytes": 56490.51875, "train_loss_nats_per_token": 1.7637435847300076 }, { "epoch": 0.03133970661820863, "grad_norm": 0.10771388560533524, "learning_rate": 0.0018136093049460592, "loss": 1.7675922393798829, "step": 65760, "train_bpb": 0.6237371774289967, "train_bytes": 56715.9875, "train_loss_nats_per_token": 1.7682601492006724 }, { "epoch": 0.03147138605778094, "grad_norm": 0.11332212388515472, "learning_rate": 0.0018130024669458945, "loss": 1.7697988510131837, "step": 65780, "train_bpb": 0.6265499739289517, "train_bytes": 56458.05625, "train_loss_nats_per_token": 1.7705935118330733 }, { "epoch": 0.03160306549735324, "grad_norm": 0.12479856610298157, "learning_rate": 0.001812395575380442, "loss": 1.7784015655517578, "step": 65800, "train_bpb": 0.6278925316064734, "train_bytes": 57141.40625, "train_loss_nats_per_token": 1.7788287704230288 }, { "epoch": 0.031734744936925546, "grad_norm": 0.12110721319913864, "learning_rate": 0.001811788630353562, "loss": 1.766665267944336, "step": 65820, "train_bpb": 0.6230609577966217, "train_bytes": 56760.875, "train_loss_nats_per_token": 1.7665642790693865 }, { "epoch": 0.03186642437649785, "grad_norm": 0.19775579869747162, "learning_rate": 0.0018111816319691235, "loss": 1.7672605514526367, "step": 65840, "train_bpb": 0.6236691055741445, "train_bytes": 56890.26875, "train_loss_nats_per_token": 1.7675389585016865 }, { "epoch": 0.031998103816070156, "grad_norm": 0.14023685455322266, "learning_rate": 0.0018105745803310034, "loss": 1.7728460311889649, "step": 65860, "train_bpb": 0.625798046455789, "train_bytes": 56530.7375, "train_loss_nats_per_token": 1.7732510383569562 }, { "epoch": 0.03212978325564246, "grad_norm": 0.15388800203800201, "learning_rate": 0.0018099674755430901, "loss": 1.7743217468261718, "step": 65880, "train_bpb": 0.6279809614975778, "train_bytes": 56400.76875, "train_loss_nats_per_token": 1.7744856895916747 }, { "epoch": 0.03226146269521477, "grad_norm": 0.12709969282150269, "learning_rate": 0.0018093603177092785, "loss": 1.7691682815551757, "step": 65900, "train_bpb": 0.625270396575003, "train_bytes": 56467.83125, "train_loss_nats_per_token": 1.7691966060706008 }, { "epoch": 0.03239314213478708, "grad_norm": 0.15010589361190796, "learning_rate": 0.0018087531069334744, "loss": 1.7673063278198242, "step": 65920, "train_bpb": 0.6275227008246463, "train_bytes": 55934.75625, "train_loss_nats_per_token": 1.7674214690697925 }, { "epoch": 0.03252482157435938, "grad_norm": 0.1336129754781723, "learning_rate": 0.0018081458433195918, "loss": 1.7614648818969727, "step": 65940, "train_bpb": 0.6230878764601391, "train_bytes": 56558.85, "train_loss_nats_per_token": 1.7619812037638864 }, { "epoch": 0.03265650101393169, "grad_norm": 0.13220910727977753, "learning_rate": 0.0018075385269715539, "loss": 1.7579992294311524, "step": 65960, "train_bpb": 0.6211978255997455, "train_bytes": 56919.875, "train_loss_nats_per_token": 1.7582092947413452 }, { "epoch": 0.03278818045350399, "grad_norm": 0.1266823709011078, "learning_rate": 0.0018069311579932933, "loss": 1.7622156143188477, "step": 65980, "train_bpb": 0.6183411872327591, "train_bytes": 57334.23125, "train_loss_nats_per_token": 1.7620647453225977 }, { "epoch": 0.032919859893076296, "grad_norm": 0.12702882289886475, "learning_rate": 0.0018063237364887518, "loss": 1.7586977005004882, "step": 66000, "train_bpb": 0.6207428124755741, "train_bytes": 56569.9375, "train_loss_nats_per_token": 1.7588783488443647 }, { "epoch": 0.032919859893076296, "eval_loss": 1.7008097171783447, "eval_runtime": 81.7538, "eval_samples_per_second": 12.232, "eval_steps_per_second": 12.232, "step": 66000, "train_bpb": 0.5996274187923551, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.7075066656057853 }, { "epoch": 0.0330515393326486, "grad_norm": 0.15249976515769958, "learning_rate": 0.0018057162625618789, "loss": 1.7588695526123046, "step": 66020, "train_bpb": 0.624592722349535, "train_bytes": 56125.48125, "train_loss_nats_per_token": 1.7591930810030552 }, { "epoch": 0.033183218772220906, "grad_norm": 0.1460212767124176, "learning_rate": 0.001805108736316634, "loss": 1.766263198852539, "step": 66040, "train_bpb": 0.6235381914002261, "train_bytes": 56595.71875, "train_loss_nats_per_token": 1.7665981634587216 }, { "epoch": 0.03331489821179321, "grad_norm": 0.12443271279335022, "learning_rate": 0.0018045011578569858, "loss": 1.7620964050292969, "step": 66060, "train_bpb": 0.6233628803926721, "train_bytes": 56528.84375, "train_loss_nats_per_token": 1.76215176147603 }, { "epoch": 0.033446577651365515, "grad_norm": 0.163056880235672, "learning_rate": 0.0018038935272869114, "loss": 1.7523185729980468, "step": 66080, "train_bpb": 0.6186325096948139, "train_bytes": 56296.86875, "train_loss_nats_per_token": 1.7524383691705372 }, { "epoch": 0.03357825709093782, "grad_norm": 0.12493759393692017, "learning_rate": 0.0018032858447103962, "loss": 1.7620996475219726, "step": 66100, "train_bpb": 0.6225525785862202, "train_bytes": 56928.84375, "train_loss_nats_per_token": 1.7628248432181859 }, { "epoch": 0.033709936530510125, "grad_norm": 0.14240586757659912, "learning_rate": 0.001802678110231436, "loss": 1.761892318725586, "step": 66120, "train_bpb": 0.6252467818820139, "train_bytes": 56321.4375, "train_loss_nats_per_token": 1.7624442429414948 }, { "epoch": 0.03384161597008243, "grad_norm": 0.09770048409700394, "learning_rate": 0.0018020703239540342, "loss": 1.7538791656494142, "step": 66140, "train_bpb": 0.6191778857642194, "train_bytes": 56488.375, "train_loss_nats_per_token": 1.7544684337652827 }, { "epoch": 0.033973295409654734, "grad_norm": 0.1390150487422943, "learning_rate": 0.001801462485982204, "loss": 1.7467054367065429, "step": 66160, "train_bpb": 0.6174334814935363, "train_bytes": 56470.59375, "train_loss_nats_per_token": 1.7471446982719476 }, { "epoch": 0.03410497484922704, "grad_norm": 0.1429586410522461, "learning_rate": 0.0018008545964199668, "loss": 1.752676010131836, "step": 66180, "train_bpb": 0.6216720224222492, "train_bytes": 56674.525, "train_loss_nats_per_token": 1.7529384301993816 }, { "epoch": 0.034236654288799344, "grad_norm": 0.18586716055870056, "learning_rate": 0.0018002466553713528, "loss": 1.7621088027954102, "step": 66200, "train_bpb": 0.6217908048591073, "train_bytes": 56513.40625, "train_loss_nats_per_token": 1.7625979740861133 }, { "epoch": 0.03436833372837165, "grad_norm": 0.12195756286382675, "learning_rate": 0.001799638662940402, "loss": 1.7651048660278321, "step": 66220, "train_bpb": 0.6232921951197159, "train_bytes": 56688.8625, "train_loss_nats_per_token": 1.7652163542048624 }, { "epoch": 0.03450001316794396, "grad_norm": 0.10573576390743256, "learning_rate": 0.0017990306192311612, "loss": 1.752359390258789, "step": 66240, "train_bpb": 0.6188294960333599, "train_bytes": 56660.86875, "train_loss_nats_per_token": 1.7528776344995158 }, { "epoch": 0.034631692607516265, "grad_norm": 0.13356566429138184, "learning_rate": 0.0017984225243476886, "loss": 1.7536745071411133, "step": 66260, "train_bpb": 0.6195871621221298, "train_bytes": 57073.275, "train_loss_nats_per_token": 1.7535562739748414 }, { "epoch": 0.03476337204708857, "grad_norm": 0.09456772357225418, "learning_rate": 0.0017978143783940483, "loss": 1.7552976608276367, "step": 66280, "train_bpb": 0.6188659969874808, "train_bytes": 56922.2625, "train_loss_nats_per_token": 1.755385950676788 }, { "epoch": 0.034895051486660875, "grad_norm": 0.0951802209019661, "learning_rate": 0.001797206181474315, "loss": 1.7546072006225586, "step": 66300, "train_bpb": 0.6192131836576023, "train_bytes": 56918.5375, "train_loss_nats_per_token": 1.7552833623320838 }, { "epoch": 0.03502673092623318, "grad_norm": 0.13678394258022308, "learning_rate": 0.0017965979336925725, "loss": 1.7563016891479493, "step": 66320, "train_bpb": 0.6196448861316511, "train_bytes": 56496.45, "train_loss_nats_per_token": 1.7565654665860242 }, { "epoch": 0.035158410365805484, "grad_norm": 0.16776540875434875, "learning_rate": 0.0017959896351529125, "loss": 1.7483545303344727, "step": 66340, "train_bpb": 0.6202139063161629, "train_bytes": 56304.725, "train_loss_nats_per_token": 1.748271362823276 }, { "epoch": 0.03529008980537779, "grad_norm": 0.1053045317530632, "learning_rate": 0.0017953812859594343, "loss": 1.7525400161743163, "step": 66360, "train_bpb": 0.6209972310402241, "train_bytes": 56168.525, "train_loss_nats_per_token": 1.752245503875135 }, { "epoch": 0.035421769244950094, "grad_norm": 0.1314372569322586, "learning_rate": 0.0017947728862162478, "loss": 1.7510343551635743, "step": 66380, "train_bpb": 0.6150260942727382, "train_bytes": 56974.29375, "train_loss_nats_per_token": 1.7511385719703114 }, { "epoch": 0.0355534486845224, "grad_norm": 0.17896795272827148, "learning_rate": 0.0017941644360274704, "loss": 1.7495370864868165, "step": 66400, "train_bpb": 0.6215426660082521, "train_bytes": 55688.65625, "train_loss_nats_per_token": 1.7493696345689318 }, { "epoch": 0.0356851281240947, "grad_norm": 0.11911572515964508, "learning_rate": 0.001793555935497229, "loss": 1.752629852294922, "step": 66420, "train_bpb": 0.6228956421775866, "train_bytes": 55803.6, "train_loss_nats_per_token": 1.7527154969445022 }, { "epoch": 0.03581680756366701, "grad_norm": 0.12834225594997406, "learning_rate": 0.001792947384729658, "loss": 1.7501964569091797, "step": 66440, "train_bpb": 0.6172468001757329, "train_bytes": 56913.025, "train_loss_nats_per_token": 1.75032659237265 }, { "epoch": 0.03594848700323931, "grad_norm": 0.15553921461105347, "learning_rate": 0.0017923387838289012, "loss": 1.749886703491211, "step": 66460, "train_bpb": 0.618462011805435, "train_bytes": 56846.425, "train_loss_nats_per_token": 1.7499113029521385 }, { "epoch": 0.03608016644281162, "grad_norm": 0.09298575669527054, "learning_rate": 0.001791730132899111, "loss": 1.7404754638671875, "step": 66480, "train_bpb": 0.614989341188935, "train_bytes": 56388.86875, "train_loss_nats_per_token": 1.7407633360958215 }, { "epoch": 0.03621184588238392, "grad_norm": 0.11655056476593018, "learning_rate": 0.0017911214320444479, "loss": 1.7440576553344727, "step": 66500, "train_bpb": 0.6155722123024193, "train_bytes": 56415.15, "train_loss_nats_per_token": 1.74406598547166 }, { "epoch": 0.03634352532195623, "grad_norm": 0.14331884682178497, "learning_rate": 0.001790512681369081, "loss": 1.7484418869018554, "step": 66520, "train_bpb": 0.6180610198459969, "train_bytes": 56891.76875, "train_loss_nats_per_token": 1.7488530196279009 }, { "epoch": 0.03647520476152853, "grad_norm": 0.12300813943147659, "learning_rate": 0.0017899038809771881, "loss": 1.743328857421875, "step": 66540, "train_bpb": 0.6170337864228076, "train_bytes": 56102.16875, "train_loss_nats_per_token": 1.7437316255454356 }, { "epoch": 0.036606884201100844, "grad_norm": 0.13815417885780334, "learning_rate": 0.001789295030972956, "loss": 1.7601776123046875, "step": 66560, "train_bpb": 0.6194021385093481, "train_bytes": 57203.05625, "train_loss_nats_per_token": 1.7606276156888827 }, { "epoch": 0.03673856364067315, "grad_norm": 0.14032725989818573, "learning_rate": 0.0017886861314605786, "loss": 1.7567913055419921, "step": 66580, "train_bpb": 0.6199468199055402, "train_bytes": 56865.30625, "train_loss_nats_per_token": 1.757169024104401 }, { "epoch": 0.03687024308024545, "grad_norm": 0.1347580850124359, "learning_rate": 0.0017880771825442604, "loss": 1.7457803726196288, "step": 66600, "train_bpb": 0.6163708444652597, "train_bytes": 56751.0625, "train_loss_nats_per_token": 1.745700699066743 }, { "epoch": 0.03700192251981776, "grad_norm": 0.19887541234493256, "learning_rate": 0.001787468184328212, "loss": 1.7487092971801759, "step": 66620, "train_bpb": 0.6171008289517163, "train_bytes": 57321.1625, "train_loss_nats_per_token": 1.748885370347079 }, { "epoch": 0.03713360195939006, "grad_norm": 0.13883525133132935, "learning_rate": 0.0017868591369166534, "loss": 1.7465459823608398, "step": 66640, "train_bpb": 0.6149444312621742, "train_bytes": 56662.21875, "train_loss_nats_per_token": 1.7466786428687333 }, { "epoch": 0.03726528139896237, "grad_norm": 0.13278844952583313, "learning_rate": 0.0017862500404138145, "loss": 1.7519451141357423, "step": 66660, "train_bpb": 0.6178016851313282, "train_bytes": 56644.18125, "train_loss_nats_per_token": 1.7520183793194921 }, { "epoch": 0.03739696083853467, "grad_norm": 0.10344759374856949, "learning_rate": 0.0017856408949239312, "loss": 1.7436071395874024, "step": 66680, "train_bpb": 0.6184387369687167, "train_bytes": 56764.76875, "train_loss_nats_per_token": 1.7437897883646776 }, { "epoch": 0.03752864027810698, "grad_norm": 0.13819292187690735, "learning_rate": 0.001785031700551249, "loss": 1.7461376190185547, "step": 66700, "train_bpb": 0.6169420069801362, "train_bytes": 56521.2375, "train_loss_nats_per_token": 1.7462954495282543 }, { "epoch": 0.03766031971767928, "grad_norm": 0.1457120180130005, "learning_rate": 0.0017844224574000216, "loss": 1.7445207595825196, "step": 66720, "train_bpb": 0.6184810084453779, "train_bytes": 56164.75, "train_loss_nats_per_token": 1.744687667282129 }, { "epoch": 0.037791999157251586, "grad_norm": 0.16211169958114624, "learning_rate": 0.0017838131655745118, "loss": 1.7469778060913086, "step": 66740, "train_bpb": 0.6153671493928917, "train_bytes": 56843.1375, "train_loss_nats_per_token": 1.747055975662981 }, { "epoch": 0.03792367859682389, "grad_norm": 0.11522988229990005, "learning_rate": 0.001783203825178989, "loss": 1.7457515716552734, "step": 66760, "train_bpb": 0.6179757612927224, "train_bytes": 56477.0125, "train_loss_nats_per_token": 1.7462300899232337 }, { "epoch": 0.038055358036396196, "grad_norm": 0.11231429129838943, "learning_rate": 0.0017825944363177324, "loss": 1.7401166915893556, "step": 66780, "train_bpb": 0.6163746126463402, "train_bytes": 56618.8625, "train_loss_nats_per_token": 1.7400333568828559 }, { "epoch": 0.0381870374759685, "grad_norm": 0.12767936289310455, "learning_rate": 0.0017819849990950288, "loss": 1.7431921005249023, "step": 66800, "train_bpb": 0.6163695552473107, "train_bytes": 56765.98125, "train_loss_nats_per_token": 1.7433584176589085 }, { "epoch": 0.038318716915540806, "grad_norm": 0.1538705676794052, "learning_rate": 0.0017813755136151736, "loss": 1.7457315444946289, "step": 66820, "train_bpb": 0.6149550231911648, "train_bytes": 56774.54375, "train_loss_nats_per_token": 1.7459854995840276 }, { "epoch": 0.03845039635511311, "grad_norm": 0.14725592732429504, "learning_rate": 0.001780765979982471, "loss": 1.7449726104736327, "step": 66840, "train_bpb": 0.6165792861893301, "train_bytes": 56858.1125, "train_loss_nats_per_token": 1.7456903246413549 }, { "epoch": 0.038582075794685415, "grad_norm": 0.12791959941387177, "learning_rate": 0.0017801563983012314, "loss": 1.7406732559204101, "step": 66860, "train_bpb": 0.6161965954725481, "train_bytes": 56441.95, "train_loss_nats_per_token": 1.7407915660092583 }, { "epoch": 0.03871375523425772, "grad_norm": 0.11042622476816177, "learning_rate": 0.001779546768675776, "loss": 1.7495645523071288, "step": 66880, "train_bpb": 0.6205376471774464, "train_bytes": 56415.53125, "train_loss_nats_per_token": 1.749932557153842 }, { "epoch": 0.03884543467383003, "grad_norm": 0.1126914694905281, "learning_rate": 0.0017789370912104324, "loss": 1.7535797119140626, "step": 66900, "train_bpb": 0.6234788506550774, "train_bytes": 56045.0875, "train_loss_nats_per_token": 1.7542937700299657 }, { "epoch": 0.038977114113402336, "grad_norm": 0.11664934456348419, "learning_rate": 0.0017783273660095373, "loss": 1.7551143646240235, "step": 66920, "train_bpb": 0.6224607271076271, "train_bytes": 56493.70625, "train_loss_nats_per_token": 1.7551458711581926 }, { "epoch": 0.03910879355297464, "grad_norm": 0.1340067982673645, "learning_rate": 0.0017777175931774347, "loss": 1.7696012496948241, "step": 66940, "train_bpb": 0.6226550311718331, "train_bytes": 57032.6375, "train_loss_nats_per_token": 1.7699110833822245 }, { "epoch": 0.039240472992546946, "grad_norm": 0.097479909658432, "learning_rate": 0.0017771077728184776, "loss": 1.760063934326172, "step": 66960, "train_bpb": 0.6227016687373202, "train_bytes": 56887.34375, "train_loss_nats_per_token": 1.7605088174679737 }, { "epoch": 0.03937215243211925, "grad_norm": 0.13523787260055542, "learning_rate": 0.0017764979050370275, "loss": 1.7656450271606445, "step": 66980, "train_bpb": 0.6244439069290668, "train_bytes": 56544.89375, "train_loss_nats_per_token": 1.7657375092479677 }, { "epoch": 0.039503831871691555, "grad_norm": 0.13579709827899933, "learning_rate": 0.0017758879899374528, "loss": 1.7569351196289062, "step": 67000, "train_bpb": 0.6229136680140755, "train_bytes": 56638.6, "train_loss_nats_per_token": 1.7569829496245493 }, { "epoch": 0.039503831871691555, "eval_loss": 1.7040061950683594, "eval_runtime": 77.6286, "eval_samples_per_second": 12.882, "eval_steps_per_second": 12.882, "step": 67000, "train_bpb": 0.6008410639518487, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.710962657000724 }, { "epoch": 0.03963551131126386, "grad_norm": 0.09360861778259277, "learning_rate": 0.0017752780276241303, "loss": 1.7670032501220703, "step": 67020, "train_bpb": 0.6236583269995207, "train_bytes": 56976.25, "train_loss_nats_per_token": 1.767141132471578 }, { "epoch": 0.039767190750836165, "grad_norm": 0.11249420046806335, "learning_rate": 0.0017746680182014452, "loss": 1.7691740036010741, "step": 67040, "train_bpb": 0.6238294211724529, "train_bytes": 56993.83125, "train_loss_nats_per_token": 1.7694869478251816 }, { "epoch": 0.03989887019040847, "grad_norm": 0.09180234372615814, "learning_rate": 0.0017740579617737911, "loss": 1.7611234664916993, "step": 67060, "train_bpb": 0.6238162656175731, "train_bytes": 56519.2, "train_loss_nats_per_token": 1.7612488273112437 }, { "epoch": 0.040030549629980774, "grad_norm": 0.10045190155506134, "learning_rate": 0.0017734478584455694, "loss": 1.7568624496459961, "step": 67080, "train_bpb": 0.617996706069556, "train_bytes": 56856.35625, "train_loss_nats_per_token": 1.7568037119747608 }, { "epoch": 0.04016222906955308, "grad_norm": 0.10826700180768967, "learning_rate": 0.0017728377083211888, "loss": 1.7566032409667969, "step": 67100, "train_bpb": 0.6232963562197034, "train_bytes": 56566.99375, "train_loss_nats_per_token": 1.7564162333608198 }, { "epoch": 0.040293908509125384, "grad_norm": 0.10119092464447021, "learning_rate": 0.0017722275115050667, "loss": 1.757288360595703, "step": 67120, "train_bpb": 0.6215623137792535, "train_bytes": 56722.6375, "train_loss_nats_per_token": 1.7573603106623414 }, { "epoch": 0.04042558794869769, "grad_norm": 0.12433522194623947, "learning_rate": 0.0017716172681016286, "loss": 1.7549156188964843, "step": 67140, "train_bpb": 0.6213598291513881, "train_bytes": 56418.4375, "train_loss_nats_per_token": 1.7554326672327378 }, { "epoch": 0.040557267388269994, "grad_norm": 0.09853285551071167, "learning_rate": 0.0017710069782153081, "loss": 1.7516807556152343, "step": 67160, "train_bpb": 0.6189448389318585, "train_bytes": 56897.15, "train_loss_nats_per_token": 1.7522361747963928 }, { "epoch": 0.0406889468278423, "grad_norm": 0.13604235649108887, "learning_rate": 0.0017703966419505455, "loss": 1.7534589767456055, "step": 67180, "train_bpb": 0.6203768075883531, "train_bytes": 56617.00625, "train_loss_nats_per_token": 1.7537672887711941 }, { "epoch": 0.0408206262674146, "grad_norm": 0.14241044223308563, "learning_rate": 0.00176978625941179, "loss": 1.7579910278320312, "step": 67200, "train_bpb": 0.6229967646108036, "train_bytes": 56278.03125, "train_loss_nats_per_token": 1.7583335180996678 }, { "epoch": 0.04095230570698691, "grad_norm": 0.1128389984369278, "learning_rate": 0.0017691758307035, "loss": 1.7534194946289063, "step": 67220, "train_bpb": 0.6214707995517762, "train_bytes": 56374.51875, "train_loss_nats_per_token": 1.7535298729957822 }, { "epoch": 0.04108398514655922, "grad_norm": 0.13558615744113922, "learning_rate": 0.0017685653559301386, "loss": 1.7532293319702148, "step": 67240, "train_bpb": 0.6217942717983311, "train_bytes": 56389.73125, "train_loss_nats_per_token": 1.7533453112727206 }, { "epoch": 0.041215664586131524, "grad_norm": 0.13748236000537872, "learning_rate": 0.0017679548351961802, "loss": 1.7481494903564454, "step": 67260, "train_bpb": 0.6196174261900729, "train_bytes": 56398.7625, "train_loss_nats_per_token": 1.7480007195649503 }, { "epoch": 0.04134734402570383, "grad_norm": 0.1321163773536682, "learning_rate": 0.0017673442686061045, "loss": 1.746068000793457, "step": 67280, "train_bpb": 0.6181315137673794, "train_bytes": 56461.6625, "train_loss_nats_per_token": 1.746235650512362 }, { "epoch": 0.041479023465276134, "grad_norm": 0.13446910679340363, "learning_rate": 0.0017667336562644004, "loss": 1.760188674926758, "step": 67300, "train_bpb": 0.6209666745987066, "train_bytes": 56890.24375, "train_loss_nats_per_token": 1.7609668727931076 }, { "epoch": 0.04161070290484844, "grad_norm": 0.1080336719751358, "learning_rate": 0.0017661229982755644, "loss": 1.7537275314331056, "step": 67320, "train_bpb": 0.6195863320355377, "train_bytes": 56655.2375, "train_loss_nats_per_token": 1.754067396179894 }, { "epoch": 0.04174238234442074, "grad_norm": 0.09537260234355927, "learning_rate": 0.0017655122947441003, "loss": 1.7485750198364258, "step": 67340, "train_bpb": 0.6177257371963593, "train_bytes": 56513.55, "train_loss_nats_per_token": 1.748717448957636 }, { "epoch": 0.04187406178399305, "grad_norm": 0.10151863843202591, "learning_rate": 0.0017649015457745206, "loss": 1.7487253189086913, "step": 67360, "train_bpb": 0.6204957581888882, "train_bytes": 56609.9125, "train_loss_nats_per_token": 1.7484851477018268 }, { "epoch": 0.04200574122356535, "grad_norm": 0.09507983177900314, "learning_rate": 0.0017642907514713447, "loss": 1.7460172653198243, "step": 67380, "train_bpb": 0.6169298622778249, "train_bytes": 56561.5875, "train_loss_nats_per_token": 1.7465896762049213 }, { "epoch": 0.04213742066313766, "grad_norm": 0.13690172135829926, "learning_rate": 0.0017636799119391002, "loss": 1.756070899963379, "step": 67400, "train_bpb": 0.6213987968903883, "train_bytes": 56845.0, "train_loss_nats_per_token": 1.7562377563249345 }, { "epoch": 0.04226910010270996, "grad_norm": 0.15823432803153992, "learning_rate": 0.0017630690272823224, "loss": 1.740869140625, "step": 67420, "train_bpb": 0.6151957104794983, "train_bytes": 56517.7375, "train_loss_nats_per_token": 1.7411604824234483 }, { "epoch": 0.04240077954228227, "grad_norm": 0.12306880205869675, "learning_rate": 0.0017624580976055544, "loss": 1.741773796081543, "step": 67440, "train_bpb": 0.6158144340485345, "train_bytes": 56512.61875, "train_loss_nats_per_token": 1.7420120230476879 }, { "epoch": 0.04253245898185457, "grad_norm": 0.11631748080253601, "learning_rate": 0.0017618471230133467, "loss": 1.7460275650024415, "step": 67460, "train_bpb": 0.6177208805966827, "train_bytes": 56481.4, "train_loss_nats_per_token": 1.7464735595677119 }, { "epoch": 0.04266413842142688, "grad_norm": 0.09470163285732269, "learning_rate": 0.001761236103610258, "loss": 1.7367265701293946, "step": 67480, "train_bpb": 0.6134675144148757, "train_bytes": 56726.90625, "train_loss_nats_per_token": 1.7370055763316743 }, { "epoch": 0.04279581786099918, "grad_norm": 0.12938092648983002, "learning_rate": 0.0017606250395008538, "loss": 1.741774559020996, "step": 67500, "train_bpb": 0.6171220087229113, "train_bytes": 56150.19375, "train_loss_nats_per_token": 1.7420209388436092 }, { "epoch": 0.042927497300571486, "grad_norm": 0.11507653445005417, "learning_rate": 0.0017600139307897083, "loss": 1.7440778732299804, "step": 67520, "train_bpb": 0.6183366422768851, "train_bytes": 56630.9875, "train_loss_nats_per_token": 1.7443673502022963 }, { "epoch": 0.04305917674014379, "grad_norm": 0.17593999207019806, "learning_rate": 0.0017594027775814022, "loss": 1.7396682739257812, "step": 67540, "train_bpb": 0.6140619992632864, "train_bytes": 56857.375, "train_loss_nats_per_token": 1.7397194195175951 }, { "epoch": 0.043190856179716096, "grad_norm": 0.1112256571650505, "learning_rate": 0.0017587915799805256, "loss": 1.735092544555664, "step": 67560, "train_bpb": 0.6165102860668541, "train_bytes": 56652.1, "train_loss_nats_per_token": 1.7354498519908024 }, { "epoch": 0.04332253561928841, "grad_norm": 0.14560790359973907, "learning_rate": 0.0017581803380916738, "loss": 1.7365510940551758, "step": 67580, "train_bpb": 0.6128233785403452, "train_bytes": 56718.6, "train_loss_nats_per_token": 1.7368788037345353 }, { "epoch": 0.04345421505886071, "grad_norm": 0.10159141570329666, "learning_rate": 0.0017575690520194517, "loss": 1.7316078186035155, "step": 67600, "train_bpb": 0.6124350196610958, "train_bytes": 56614.93125, "train_loss_nats_per_token": 1.7315756374548232 }, { "epoch": 0.04358589449843302, "grad_norm": 0.11562483012676239, "learning_rate": 0.0017569577218684703, "loss": 1.7388174057006835, "step": 67620, "train_bpb": 0.6151768976166229, "train_bytes": 56390.55625, "train_loss_nats_per_token": 1.7388074148680368 }, { "epoch": 0.04371757393800532, "grad_norm": 0.11210903525352478, "learning_rate": 0.0017563463477433493, "loss": 1.7354507446289062, "step": 67640, "train_bpb": 0.6152106429109979, "train_bytes": 56700.79375, "train_loss_nats_per_token": 1.735841718937821 }, { "epoch": 0.04384925337757763, "grad_norm": 0.1369801014661789, "learning_rate": 0.001755734929748716, "loss": 1.7322216033935547, "step": 67660, "train_bpb": 0.6116273896536198, "train_bytes": 57202.11875, "train_loss_nats_per_token": 1.7322703058011828 }, { "epoch": 0.04398093281714993, "grad_norm": 0.12356609106063843, "learning_rate": 0.0017551234679892035, "loss": 1.7473564147949219, "step": 67680, "train_bpb": 0.6199849624523359, "train_bytes": 55882.45, "train_loss_nats_per_token": 1.7473876058139115 }, { "epoch": 0.044112612256722236, "grad_norm": 0.11192473024129868, "learning_rate": 0.001754511962569454, "loss": 1.742447853088379, "step": 67700, "train_bpb": 0.6169144961250653, "train_bytes": 56453.80625, "train_loss_nats_per_token": 1.742646248635758 }, { "epoch": 0.04424429169629454, "grad_norm": 0.10719604790210724, "learning_rate": 0.001753900413594117, "loss": 1.7382843017578125, "step": 67720, "train_bpb": 0.6136890019807035, "train_bytes": 56552.4875, "train_loss_nats_per_token": 1.7390366883250192 }, { "epoch": 0.044375971135866846, "grad_norm": 0.14761324226856232, "learning_rate": 0.0017532888211678488, "loss": 1.7392040252685548, "step": 67740, "train_bpb": 0.6134338593834235, "train_bytes": 56694.51875, "train_loss_nats_per_token": 1.7393057943361554 }, { "epoch": 0.04450765057543915, "grad_norm": 0.161391943693161, "learning_rate": 0.0017526771853953141, "loss": 1.7323968887329102, "step": 67760, "train_bpb": 0.614033526876579, "train_bytes": 56603.98125, "train_loss_nats_per_token": 1.7328535424486953 }, { "epoch": 0.044639330015011455, "grad_norm": 0.10537908971309662, "learning_rate": 0.0017520655063811834, "loss": 1.7267471313476563, "step": 67780, "train_bpb": 0.6128659674269545, "train_bytes": 56500.8875, "train_loss_nats_per_token": 1.726705043029541 }, { "epoch": 0.04477100945458376, "grad_norm": 0.10909292846918106, "learning_rate": 0.0017514537842301366, "loss": 1.736473274230957, "step": 67800, "train_bpb": 0.6135659765923749, "train_bytes": 57046.35625, "train_loss_nats_per_token": 1.7367529796582186 }, { "epoch": 0.044902688894156065, "grad_norm": 0.1095421090722084, "learning_rate": 0.0017508420190468596, "loss": 1.7249736785888672, "step": 67820, "train_bpb": 0.6086770957100722, "train_bytes": 56954.78125, "train_loss_nats_per_token": 1.7248702032081378 }, { "epoch": 0.04503436833372837, "grad_norm": 0.14420661330223083, "learning_rate": 0.0017502302109360464, "loss": 1.7368558883666991, "step": 67840, "train_bpb": 0.6140440529376019, "train_bytes": 56440.0125, "train_loss_nats_per_token": 1.7367351233042918 }, { "epoch": 0.045166047773300674, "grad_norm": 0.09497535973787308, "learning_rate": 0.001749618360002397, "loss": 1.7399438858032226, "step": 67860, "train_bpb": 0.6151114929104627, "train_bytes": 56447.8625, "train_loss_nats_per_token": 1.740213225077458 }, { "epoch": 0.04529772721287298, "grad_norm": 0.12421896308660507, "learning_rate": 0.0017490064663506213, "loss": 1.7372198104858398, "step": 67880, "train_bpb": 0.615126999210811, "train_bytes": 56581.3375, "train_loss_nats_per_token": 1.7373263721863839 }, { "epoch": 0.045429406652445284, "grad_norm": 0.11862685531377792, "learning_rate": 0.0017483945300854338, "loss": 1.7286647796630858, "step": 67900, "train_bpb": 0.6118446641386429, "train_bytes": 56999.275, "train_loss_nats_per_token": 1.72905574229308 }, { "epoch": 0.045561086092017596, "grad_norm": 0.09324538707733154, "learning_rate": 0.0017477825513115578, "loss": 1.7306053161621093, "step": 67920, "train_bpb": 0.6133278384191984, "train_bytes": 56360.91875, "train_loss_nats_per_token": 1.7308761092940137 }, { "epoch": 0.0456927655315899, "grad_norm": 0.10412263870239258, "learning_rate": 0.0017471705301337235, "loss": 1.7286174774169922, "step": 67940, "train_bpb": 0.6128565196237855, "train_bytes": 56467.16875, "train_loss_nats_per_token": 1.7283842384542525 }, { "epoch": 0.045824444971162205, "grad_norm": 0.15043815970420837, "learning_rate": 0.0017465584666566682, "loss": 1.723621940612793, "step": 67960, "train_bpb": 0.6094278776616899, "train_bytes": 56924.7875, "train_loss_nats_per_token": 1.7240131154435057 }, { "epoch": 0.04595612441073451, "grad_norm": 0.14227575063705444, "learning_rate": 0.0017459463609851371, "loss": 1.7290281295776366, "step": 67980, "train_bpb": 0.6120607583849192, "train_bytes": 56308.90625, "train_loss_nats_per_token": 1.7286040539834282 }, { "epoch": 0.046087803850306815, "grad_norm": 0.13114085793495178, "learning_rate": 0.0017453342132238816, "loss": 1.7311513900756836, "step": 68000, "train_bpb": 0.6129886794106906, "train_bytes": 56468.29375, "train_loss_nats_per_token": 1.7314214196483904 }, { "epoch": 0.046087803850306815, "eval_loss": 1.7090251445770264, "eval_runtime": 77.0267, "eval_samples_per_second": 12.983, "eval_steps_per_second": 12.983, "step": 68000, "train_bpb": 0.6025960351215127, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.7159601352284226 }, { "epoch": 0.04621948328987912, "grad_norm": 0.10921578109264374, "learning_rate": 0.0017447220234776612, "loss": 1.7251373291015626, "step": 68020, "train_bpb": 0.6115475274116592, "train_bytes": 56375.675, "train_loss_nats_per_token": 1.7255044342613135 }, { "epoch": 0.046351162729451424, "grad_norm": 0.13529512286186218, "learning_rate": 0.0017441097918512423, "loss": 1.7334465026855468, "step": 68040, "train_bpb": 0.6110133269032632, "train_bytes": 56734.775, "train_loss_nats_per_token": 1.7334008243931935 }, { "epoch": 0.04648284216902373, "grad_norm": 0.11603549867868423, "learning_rate": 0.001743497518449398, "loss": 1.7373937606811523, "step": 68060, "train_bpb": 0.6171029394317212, "train_bytes": 56126.11875, "train_loss_nats_per_token": 1.737871382844481 }, { "epoch": 0.046614521608596034, "grad_norm": 0.09091587364673615, "learning_rate": 0.0017428852033769095, "loss": 1.7389154434204102, "step": 68080, "train_bpb": 0.6147109546742388, "train_bytes": 56878.40625, "train_loss_nats_per_token": 1.7386096613134066 }, { "epoch": 0.04674620104816834, "grad_norm": 0.1033649668097496, "learning_rate": 0.001742272846738564, "loss": 1.7550987243652343, "step": 68100, "train_bpb": 0.6185158068779705, "train_bytes": 57026.08125, "train_loss_nats_per_token": 1.755273755547577 }, { "epoch": 0.04687788048774064, "grad_norm": 0.14353741705417633, "learning_rate": 0.0017416604486391563, "loss": 1.7560901641845703, "step": 68120, "train_bpb": 0.6235896493857019, "train_bytes": 56309.36875, "train_loss_nats_per_token": 1.7562710140016489 }, { "epoch": 0.04700955992731295, "grad_norm": 0.0961536392569542, "learning_rate": 0.0017410480091834895, "loss": 1.7523826599121093, "step": 68140, "train_bpb": 0.6194768366821667, "train_bytes": 56679.04375, "train_loss_nats_per_token": 1.7529202459610875 }, { "epoch": 0.04714123936688525, "grad_norm": 0.15177172422409058, "learning_rate": 0.0017404355284763714, "loss": 1.7572574615478516, "step": 68160, "train_bpb": 0.621021079488049, "train_bytes": 56584.80625, "train_loss_nats_per_token": 1.757046372831132 }, { "epoch": 0.04727291880645756, "grad_norm": 0.12996254861354828, "learning_rate": 0.0017398230066226186, "loss": 1.7646583557128905, "step": 68180, "train_bpb": 0.6225724409338139, "train_bytes": 56778.675, "train_loss_nats_per_token": 1.7651770035685148 }, { "epoch": 0.04740459824602986, "grad_norm": 0.11878655105829239, "learning_rate": 0.0017392104437270542, "loss": 1.7624086380004882, "step": 68200, "train_bpb": 0.6230825685856506, "train_bytes": 56409.85625, "train_loss_nats_per_token": 1.762604092799269 }, { "epoch": 0.04753627768560217, "grad_norm": 0.13612288236618042, "learning_rate": 0.001738597839894509, "loss": 1.7658885955810546, "step": 68220, "train_bpb": 0.6232623748955158, "train_bytes": 56701.68125, "train_loss_nats_per_token": 1.765788759889759 }, { "epoch": 0.04766795712517447, "grad_norm": 0.10974232107400894, "learning_rate": 0.0017379851952298193, "loss": 1.7685802459716797, "step": 68240, "train_bpb": 0.6222600549721502, "train_bytes": 56651.49375, "train_loss_nats_per_token": 1.7686877999693724 }, { "epoch": 0.047799636564746784, "grad_norm": 0.11873923242092133, "learning_rate": 0.00173737250983783, "loss": 1.7656290054321289, "step": 68260, "train_bpb": 0.6250789491792549, "train_bytes": 56180.08125, "train_loss_nats_per_token": 1.7658805718257007 }, { "epoch": 0.04793131600431909, "grad_norm": 0.1710149198770523, "learning_rate": 0.0017367597838233914, "loss": 1.7614166259765625, "step": 68280, "train_bpb": 0.6208008721918539, "train_bytes": 57233.575, "train_loss_nats_per_token": 1.7611134717273722 }, { "epoch": 0.04806299544389139, "grad_norm": 0.11897904425859451, "learning_rate": 0.0017361470172913623, "loss": 1.765839195251465, "step": 68300, "train_bpb": 0.623545314892095, "train_bytes": 56690.95, "train_loss_nats_per_token": 1.7659982392578804 }, { "epoch": 0.0481946748834637, "grad_norm": 0.18269097805023193, "learning_rate": 0.0017355342103466077, "loss": 1.7584772109985352, "step": 68320, "train_bpb": 0.6217732863748514, "train_bytes": 56256.25, "train_loss_nats_per_token": 1.759060600845679 }, { "epoch": 0.048326354323036, "grad_norm": 0.15134495496749878, "learning_rate": 0.001734921363093999, "loss": 1.7594259262084961, "step": 68340, "train_bpb": 0.6232673870762894, "train_bytes": 56461.33125, "train_loss_nats_per_token": 1.7595840061438315 }, { "epoch": 0.04845803376260831, "grad_norm": 0.09823567420244217, "learning_rate": 0.0017343084756384157, "loss": 1.7585054397583009, "step": 68360, "train_bpb": 0.6209600565617838, "train_bytes": 56973.90625, "train_loss_nats_per_token": 1.7586542818122133 }, { "epoch": 0.04858971320218061, "grad_norm": 0.1364130675792694, "learning_rate": 0.0017336955480847431, "loss": 1.7574592590332032, "step": 68380, "train_bpb": 0.6192021826273473, "train_bytes": 57058.00625, "train_loss_nats_per_token": 1.757493230371645 }, { "epoch": 0.04872139264175292, "grad_norm": 0.1746111512184143, "learning_rate": 0.0017330825805378742, "loss": 1.7584991455078125, "step": 68400, "train_bpb": 0.622764713164824, "train_bytes": 56883.325, "train_loss_nats_per_token": 1.7587696458421187 }, { "epoch": 0.04885307208132522, "grad_norm": 0.11517908424139023, "learning_rate": 0.001732469573102708, "loss": 1.7667497634887694, "step": 68420, "train_bpb": 0.6242446506450197, "train_bytes": 56232.9625, "train_loss_nats_per_token": 1.7668788070493633 }, { "epoch": 0.048984751520897526, "grad_norm": 0.13675005733966827, "learning_rate": 0.0017318565258841508, "loss": 1.7575536727905274, "step": 68440, "train_bpb": 0.6209206468630436, "train_bytes": 57093.8625, "train_loss_nats_per_token": 1.7577409997273379 }, { "epoch": 0.04911643096046983, "grad_norm": 0.12679851055145264, "learning_rate": 0.0017312434389871161, "loss": 1.746677780151367, "step": 68460, "train_bpb": 0.6177383631562708, "train_bytes": 56563.96875, "train_loss_nats_per_token": 1.7467818845764715 }, { "epoch": 0.049248110400042136, "grad_norm": 0.11655280739068985, "learning_rate": 0.0017306303125165239, "loss": 1.752352523803711, "step": 68480, "train_bpb": 0.620831822368447, "train_bytes": 56478.725, "train_loss_nats_per_token": 1.7523662484318059 }, { "epoch": 0.04937978983961444, "grad_norm": 0.10246056318283081, "learning_rate": 0.0017300171465772997, "loss": 1.7455577850341797, "step": 68500, "train_bpb": 0.6153996709588182, "train_bytes": 57018.55, "train_loss_nats_per_token": 1.74554273515667 }, { "epoch": 0.049511469279186746, "grad_norm": 0.09432516992092133, "learning_rate": 0.001729403941274378, "loss": 1.7478919982910157, "step": 68520, "train_bpb": 0.6205918223422805, "train_bytes": 56523.1375, "train_loss_nats_per_token": 1.7485859010465665 }, { "epoch": 0.04964314871875905, "grad_norm": 0.11579181253910065, "learning_rate": 0.0017287906967126982, "loss": 1.7549814224243163, "step": 68540, "train_bpb": 0.6202859084648602, "train_bytes": 56396.2, "train_loss_nats_per_token": 1.7549782185664973 }, { "epoch": 0.049774828158331355, "grad_norm": 0.1416843831539154, "learning_rate": 0.001728177412997208, "loss": 1.7442008972167968, "step": 68560, "train_bpb": 0.6157051851909401, "train_bytes": 57301.9125, "train_loss_nats_per_token": 1.744458392355261 }, { "epoch": 0.04990650759790366, "grad_norm": 0.14826159179210663, "learning_rate": 0.0017275640902328605, "loss": 1.7515270233154296, "step": 68580, "train_bpb": 0.6209420832957769, "train_bytes": 56354.1625, "train_loss_nats_per_token": 1.7517042397500462 }, { "epoch": 0.05003818703747597, "grad_norm": 0.11685791611671448, "learning_rate": 0.0017269507285246157, "loss": 1.7559333801269532, "step": 68600, "train_bpb": 0.6175162165306306, "train_bytes": 57085.975, "train_loss_nats_per_token": 1.7564189752528365 }, { "epoch": 0.050169866477048276, "grad_norm": 0.1643613874912262, "learning_rate": 0.0017263373279774404, "loss": 1.7419418334960937, "step": 68620, "train_bpb": 0.6172206912005452, "train_bytes": 56387.73125, "train_loss_nats_per_token": 1.7421362808101473 }, { "epoch": 0.05030154591662058, "grad_norm": 0.1384725421667099, "learning_rate": 0.001725723888696309, "loss": 1.7476787567138672, "step": 68640, "train_bpb": 0.6180279411541335, "train_bytes": 56427.66875, "train_loss_nats_per_token": 1.7474382829167567 }, { "epoch": 0.050433225356192886, "grad_norm": 0.12071803212165833, "learning_rate": 0.0017251104107862004, "loss": 1.7565793991088867, "step": 68660, "train_bpb": 0.6210563364255954, "train_bytes": 56850.3, "train_loss_nats_per_token": 1.7568386093380413 }, { "epoch": 0.05056490479576519, "grad_norm": 0.10008357465267181, "learning_rate": 0.0017244968943521022, "loss": 1.7440914154052733, "step": 68680, "train_bpb": 0.6162997056095562, "train_bytes": 56886.16875, "train_loss_nats_per_token": 1.7444556594645395 }, { "epoch": 0.050696584235337495, "grad_norm": 0.1577955037355423, "learning_rate": 0.0017238833394990075, "loss": 1.7482124328613282, "step": 68700, "train_bpb": 0.6173269428811814, "train_bytes": 56585.49375, "train_loss_nats_per_token": 1.7484099260329644 }, { "epoch": 0.0508282636749098, "grad_norm": 0.10657801479101181, "learning_rate": 0.001723269746331917, "loss": 1.7553913116455078, "step": 68720, "train_bpb": 0.6222485739480147, "train_bytes": 56274.2125, "train_loss_nats_per_token": 1.7561646140981897 }, { "epoch": 0.050959943114482105, "grad_norm": 0.10856018960475922, "learning_rate": 0.0017226561149558358, "loss": 1.7502891540527343, "step": 68740, "train_bpb": 0.6170116687959734, "train_bytes": 57069.4, "train_loss_nats_per_token": 1.7500548441059178 }, { "epoch": 0.05109162255405441, "grad_norm": 0.1475059539079666, "learning_rate": 0.001722042445475778, "loss": 1.747053337097168, "step": 68760, "train_bpb": 0.6156250378610987, "train_bytes": 57221.7125, "train_loss_nats_per_token": 1.747127300390797 }, { "epoch": 0.051223301993626714, "grad_norm": 0.12851455807685852, "learning_rate": 0.001721428737996763, "loss": 1.7425302505493163, "step": 68780, "train_bpb": 0.6164560004783338, "train_bytes": 56138.06875, "train_loss_nats_per_token": 1.742838368126903 }, { "epoch": 0.05135498143319902, "grad_norm": 0.16194961965084076, "learning_rate": 0.0017208149926238169, "loss": 1.7439794540405273, "step": 68800, "train_bpb": 0.6173377218020162, "train_bytes": 56668.3, "train_loss_nats_per_token": 1.744229235499699 }, { "epoch": 0.051486660872771324, "grad_norm": 0.095216304063797, "learning_rate": 0.0017202012094619714, "loss": 1.7384283065795898, "step": 68820, "train_bpb": 0.6145405936657983, "train_bytes": 56696.5625, "train_loss_nats_per_token": 1.7382362064658126 }, { "epoch": 0.05161834031234363, "grad_norm": 0.21598264575004578, "learning_rate": 0.0017195873886162664, "loss": 1.7452983856201172, "step": 68840, "train_bpb": 0.6160506063810075, "train_bytes": 56775.7625, "train_loss_nats_per_token": 1.745511476624749 }, { "epoch": 0.051750019751915934, "grad_norm": 0.11842844635248184, "learning_rate": 0.0017189735301917472, "loss": 1.730061912536621, "step": 68860, "train_bpb": 0.6087630219260115, "train_bytes": 56862.01875, "train_loss_nats_per_token": 1.7300446424346565 }, { "epoch": 0.05188169919148824, "grad_norm": 0.10631615668535233, "learning_rate": 0.0017183596342934663, "loss": 1.7397266387939454, "step": 68880, "train_bpb": 0.6164614294438222, "train_bytes": 56315.61875, "train_loss_nats_per_token": 1.7397570064581627 }, { "epoch": 0.05201337863106054, "grad_norm": 0.12083332240581512, "learning_rate": 0.001717745701026481, "loss": 1.740973663330078, "step": 68900, "train_bpb": 0.616411443293268, "train_bytes": 56695.79375, "train_loss_nats_per_token": 1.7413172859225161 }, { "epoch": 0.052145058070632855, "grad_norm": 0.13787798583507538, "learning_rate": 0.0017171317304958563, "loss": 1.7352323532104492, "step": 68920, "train_bpb": 0.6162682569082368, "train_bytes": 56357.09375, "train_loss_nats_per_token": 1.7355473556781398 }, { "epoch": 0.05227673751020516, "grad_norm": 0.10850312560796738, "learning_rate": 0.0017165177228066631, "loss": 1.7462282180786133, "step": 68940, "train_bpb": 0.6182496216850144, "train_bytes": 56452.36875, "train_loss_nats_per_token": 1.7461896455725718 }, { "epoch": 0.052408416949777464, "grad_norm": 0.13137702643871307, "learning_rate": 0.0017159036780639793, "loss": 1.7392492294311523, "step": 68960, "train_bpb": 0.6141070916476461, "train_bytes": 56893.28125, "train_loss_nats_per_token": 1.739371976185883 }, { "epoch": 0.05254009638934977, "grad_norm": 0.1069563552737236, "learning_rate": 0.0017152895963728888, "loss": 1.7405105590820313, "step": 68980, "train_bpb": 0.6125047844276247, "train_bytes": 57031.45625, "train_loss_nats_per_token": 1.7408326086229375 }, { "epoch": 0.052671775828922074, "grad_norm": 0.13045178353786469, "learning_rate": 0.001714675477838481, "loss": 1.7295398712158203, "step": 69000, "train_bpb": 0.6123255195523242, "train_bytes": 56595.43125, "train_loss_nats_per_token": 1.7298144601926728 }, { "epoch": 0.052671775828922074, "eval_loss": 1.7077986001968384, "eval_runtime": 76.078, "eval_samples_per_second": 13.144, "eval_steps_per_second": 13.144, "step": 69000, "train_bpb": 0.6021220914123413, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.7146105270931549 }, { "epoch": 0.05280345526849438, "grad_norm": 0.1225469782948494, "learning_rate": 0.0017140613225658527, "loss": 1.7407466888427734, "step": 69020, "train_bpb": 0.6173213258428758, "train_bytes": 56299.6, "train_loss_nats_per_token": 1.7408929193114084 }, { "epoch": 0.05293513470806668, "grad_norm": 0.10395469516515732, "learning_rate": 0.0017134471306601065, "loss": 1.7372333526611328, "step": 69040, "train_bpb": 0.6125325162995318, "train_bytes": 56808.5, "train_loss_nats_per_token": 1.7374533543451227 }, { "epoch": 0.05306681414763899, "grad_norm": 0.11525048315525055, "learning_rate": 0.0017128329022263516, "loss": 1.7353818893432618, "step": 69060, "train_bpb": 0.6135367113849752, "train_bytes": 56846.1625, "train_loss_nats_per_token": 1.7361660583913963 }, { "epoch": 0.05319849358721129, "grad_norm": 0.11179927736520767, "learning_rate": 0.0017122186373697032, "loss": 1.739413070678711, "step": 69080, "train_bpb": 0.6155279274541076, "train_bytes": 56347.83125, "train_loss_nats_per_token": 1.7393776121895528 }, { "epoch": 0.0533301730267836, "grad_norm": 0.11327791959047318, "learning_rate": 0.0017116043361952826, "loss": 1.729496955871582, "step": 69100, "train_bpb": 0.6113152432995336, "train_bytes": 56882.04375, "train_loss_nats_per_token": 1.729431618670918 }, { "epoch": 0.0534618524663559, "grad_norm": 0.1354941576719284, "learning_rate": 0.0017109899988082173, "loss": 1.7394012451171874, "step": 69120, "train_bpb": 0.6132968255217918, "train_bytes": 56558.925, "train_loss_nats_per_token": 1.7397471695862141 }, { "epoch": 0.05359353190592821, "grad_norm": 0.09174686670303345, "learning_rate": 0.0017103756253136415, "loss": 1.7353641510009765, "step": 69140, "train_bpb": 0.6130863372569343, "train_bytes": 56862.71875, "train_loss_nats_per_token": 1.7356672193047846 }, { "epoch": 0.05372521134550051, "grad_norm": 0.11450312286615372, "learning_rate": 0.001709761215816695, "loss": 1.7372150421142578, "step": 69160, "train_bpb": 0.6145474279745945, "train_bytes": 56459.9875, "train_loss_nats_per_token": 1.7374880196398537 }, { "epoch": 0.05385689078507282, "grad_norm": 0.1526605784893036, "learning_rate": 0.001709146770422524, "loss": 1.7390140533447265, "step": 69180, "train_bpb": 0.6154099068346034, "train_bytes": 56327.4875, "train_loss_nats_per_token": 1.739540305426811 }, { "epoch": 0.05398857022464512, "grad_norm": 0.10622841864824295, "learning_rate": 0.0017085322892362812, "loss": 1.7387792587280273, "step": 69200, "train_bpb": 0.61279876717947, "train_bytes": 56989.6, "train_loss_nats_per_token": 1.7391239176506326 }, { "epoch": 0.054120249664217426, "grad_norm": 0.12610821425914764, "learning_rate": 0.001707917772363125, "loss": 1.732680320739746, "step": 69220, "train_bpb": 0.6141240193476185, "train_bytes": 56600.40625, "train_loss_nats_per_token": 1.7331256781664515 }, { "epoch": 0.05425192910378973, "grad_norm": 0.14352662861347198, "learning_rate": 0.0017073032199082195, "loss": 1.7382108688354492, "step": 69240, "train_bpb": 0.6139356629472409, "train_bytes": 56423.9875, "train_loss_nats_per_token": 1.7391779951213489 }, { "epoch": 0.05438360854336204, "grad_norm": 0.15801072120666504, "learning_rate": 0.0017066886319767362, "loss": 1.7301963806152343, "step": 69260, "train_bpb": 0.6140750612880286, "train_bytes": 56379.975, "train_loss_nats_per_token": 1.7307841963896125 }, { "epoch": 0.05451528798293435, "grad_norm": 0.10234980285167694, "learning_rate": 0.0017060740086738506, "loss": 1.746319580078125, "step": 69280, "train_bpb": 0.6164914236372138, "train_bytes": 56445.425, "train_loss_nats_per_token": 1.7462973415398992 }, { "epoch": 0.05464696742250665, "grad_norm": 0.12496054917573929, "learning_rate": 0.001705459350104747, "loss": 1.7547456741333007, "step": 69300, "train_bpb": 0.6205446350942906, "train_bytes": 56881.825, "train_loss_nats_per_token": 1.7549401517671939 }, { "epoch": 0.05477864686207896, "grad_norm": 0.14522233605384827, "learning_rate": 0.0017048446563746127, "loss": 1.7491983413696288, "step": 69320, "train_bpb": 0.6174673684406435, "train_bytes": 56558.43125, "train_loss_nats_per_token": 1.7492241130022306 }, { "epoch": 0.05491032630165126, "grad_norm": 0.12734948098659515, "learning_rate": 0.001704229927588643, "loss": 1.7614456176757813, "step": 69340, "train_bpb": 0.623121029349792, "train_bytes": 56584.1375, "train_loss_nats_per_token": 1.7618746780887151 }, { "epoch": 0.05504200574122357, "grad_norm": 0.0992262065410614, "learning_rate": 0.0017036151638520397, "loss": 1.758976364135742, "step": 69360, "train_bpb": 0.6201070320938017, "train_bytes": 56540.275, "train_loss_nats_per_token": 1.7592686112815306 }, { "epoch": 0.05517368518079587, "grad_norm": 0.1127210259437561, "learning_rate": 0.001703000365270009, "loss": 1.750307846069336, "step": 69380, "train_bpb": 0.622080619797096, "train_bytes": 56129.94375, "train_loss_nats_per_token": 1.750815083751808 }, { "epoch": 0.055305364620368176, "grad_norm": 0.09238316863775253, "learning_rate": 0.0017023855319477635, "loss": 1.7503311157226562, "step": 69400, "train_bpb": 0.6192341868648507, "train_bytes": 56736.53125, "train_loss_nats_per_token": 1.750419272156487 }, { "epoch": 0.05543704405994048, "grad_norm": 0.12219781428575516, "learning_rate": 0.0017017706639905219, "loss": 1.7535955429077148, "step": 69420, "train_bpb": 0.6207696140583399, "train_bytes": 56559.375, "train_loss_nats_per_token": 1.753436395092286 }, { "epoch": 0.055568723499512786, "grad_norm": 0.1062895879149437, "learning_rate": 0.0017011557615035089, "loss": 1.753286361694336, "step": 69440, "train_bpb": 0.6193588906059371, "train_bytes": 56408.63125, "train_loss_nats_per_token": 1.753504742411463 }, { "epoch": 0.05570040293908509, "grad_norm": 0.1761479526758194, "learning_rate": 0.0017005408245919556, "loss": 1.7424940109252929, "step": 69460, "train_bpb": 0.6174386403188719, "train_bytes": 56477.56875, "train_loss_nats_per_token": 1.7430160670085064 }, { "epoch": 0.055832082378657395, "grad_norm": 0.13355162739753723, "learning_rate": 0.0016999258533610978, "loss": 1.7458745956420898, "step": 69480, "train_bpb": 0.6203716513401007, "train_bytes": 56572.13125, "train_loss_nats_per_token": 1.7463808541555619 }, { "epoch": 0.0559637618182297, "grad_norm": 0.126582071185112, "learning_rate": 0.0016993108479161781, "loss": 1.7483613967895508, "step": 69500, "train_bpb": 0.6190523892407079, "train_bytes": 56541.94375, "train_loss_nats_per_token": 1.7481453897856212 }, { "epoch": 0.056095441257802005, "grad_norm": 0.08464136719703674, "learning_rate": 0.0016986958083624448, "loss": 1.7501449584960938, "step": 69520, "train_bpb": 0.6175621802040345, "train_bytes": 56928.3875, "train_loss_nats_per_token": 1.7503245677669448 }, { "epoch": 0.05622712069737431, "grad_norm": 0.11908835172653198, "learning_rate": 0.0016980807348051519, "loss": 1.7422473907470704, "step": 69540, "train_bpb": 0.6148987873775886, "train_bytes": 56819.85625, "train_loss_nats_per_token": 1.742675676499577 }, { "epoch": 0.056358800136946614, "grad_norm": 0.11111199110746384, "learning_rate": 0.0016974656273495592, "loss": 1.742528533935547, "step": 69560, "train_bpb": 0.6169755639461678, "train_bytes": 56647.8375, "train_loss_nats_per_token": 1.743079626083265 }, { "epoch": 0.05649047957651892, "grad_norm": 0.09571356326341629, "learning_rate": 0.0016968504861009323, "loss": 1.744684600830078, "step": 69580, "train_bpb": 0.616837827646692, "train_bytes": 57212.075, "train_loss_nats_per_token": 1.74527530549901 }, { "epoch": 0.05662215901609123, "grad_norm": 0.12213265895843506, "learning_rate": 0.0016962353111645428, "loss": 1.7419164657592774, "step": 69600, "train_bpb": 0.6154208974511606, "train_bytes": 56664.5625, "train_loss_nats_per_token": 1.741979311937543 }, { "epoch": 0.056753838455663536, "grad_norm": 0.12492791563272476, "learning_rate": 0.0016956201026456675, "loss": 1.7392982482910155, "step": 69620, "train_bpb": 0.6130576836738212, "train_bytes": 57048.7125, "train_loss_nats_per_token": 1.7396449114742225 }, { "epoch": 0.05688551789523584, "grad_norm": 0.1087220087647438, "learning_rate": 0.00169500486064959, "loss": 1.742051887512207, "step": 69640, "train_bpb": 0.6162406794571267, "train_bytes": 56449.46875, "train_loss_nats_per_token": 1.7424652388772763 }, { "epoch": 0.057017197334808145, "grad_norm": 0.1329224854707718, "learning_rate": 0.0016943895852815978, "loss": 1.7451723098754883, "step": 69660, "train_bpb": 0.6159571353748223, "train_bytes": 56936.73125, "train_loss_nats_per_token": 1.7450497703284857 }, { "epoch": 0.05714887677438045, "grad_norm": 0.12450263649225235, "learning_rate": 0.0016937742766469867, "loss": 1.7396595001220703, "step": 69680, "train_bpb": 0.6166808304368355, "train_bytes": 56815.225, "train_loss_nats_per_token": 1.7399126535227893 }, { "epoch": 0.057280556213952755, "grad_norm": 0.11714454740285873, "learning_rate": 0.0016931589348510557, "loss": 1.7390140533447265, "step": 69700, "train_bpb": 0.6150732177978109, "train_bytes": 56409.1, "train_loss_nats_per_token": 1.7390569824773097 }, { "epoch": 0.05741223565352506, "grad_norm": 0.16534774005413055, "learning_rate": 0.0016925435599991117, "loss": 1.7341142654418946, "step": 69720, "train_bpb": 0.6140955378791789, "train_bytes": 56142.9, "train_loss_nats_per_token": 1.7339835929050185 }, { "epoch": 0.057543915093097364, "grad_norm": 0.11600124090909958, "learning_rate": 0.0016919281521964645, "loss": 1.7265274047851562, "step": 69740, "train_bpb": 0.6107997371248053, "train_bytes": 56830.3875, "train_loss_nats_per_token": 1.7267834583836086 }, { "epoch": 0.05767559453266967, "grad_norm": 0.11774647235870361, "learning_rate": 0.0016913127115484325, "loss": 1.7297332763671875, "step": 69760, "train_bpb": 0.6132577050049317, "train_bytes": 56366.1875, "train_loss_nats_per_token": 1.729661553023296 }, { "epoch": 0.057807273972241974, "grad_norm": 0.10113774985074997, "learning_rate": 0.0016906972381603373, "loss": 1.7259651184082032, "step": 69780, "train_bpb": 0.6119835080602994, "train_bytes": 56741.73125, "train_loss_nats_per_token": 1.7262548670144278 }, { "epoch": 0.05793895341181428, "grad_norm": 0.10899896919727325, "learning_rate": 0.0016900817321375088, "loss": 1.7294694900512695, "step": 69800, "train_bpb": 0.6118528756406227, "train_bytes": 56609.8875, "train_loss_nats_per_token": 1.7295466150898573 }, { "epoch": 0.05807063285138658, "grad_norm": 0.11490485072135925, "learning_rate": 0.0016894661935852792, "loss": 1.7334844589233398, "step": 69820, "train_bpb": 0.6132031127826746, "train_bytes": 56777.7, "train_loss_nats_per_token": 1.733611574917725 }, { "epoch": 0.05820231229095889, "grad_norm": 0.10855840146541595, "learning_rate": 0.0016888506226089887, "loss": 1.7322589874267578, "step": 69840, "train_bpb": 0.6135158164201966, "train_bytes": 56374.85625, "train_loss_nats_per_token": 1.7324041798790237 }, { "epoch": 0.05833399173053119, "grad_norm": 0.12649796903133392, "learning_rate": 0.001688235019313982, "loss": 1.726606559753418, "step": 69860, "train_bpb": 0.6126670872670965, "train_bytes": 56248.41875, "train_loss_nats_per_token": 1.7267943418023541 }, { "epoch": 0.0584656711701035, "grad_norm": 0.13009482622146606, "learning_rate": 0.00168761938380561, "loss": 1.7286685943603515, "step": 69880, "train_bpb": 0.6128696995384272, "train_bytes": 56397.7875, "train_loss_nats_per_token": 1.729129031306117 }, { "epoch": 0.0585973506096758, "grad_norm": 0.17691923677921295, "learning_rate": 0.001687003716189228, "loss": 1.7346275329589844, "step": 69900, "train_bpb": 0.6134444170112492, "train_bytes": 56472.4625, "train_loss_nats_per_token": 1.7349626749286056 }, { "epoch": 0.05872903004924811, "grad_norm": 0.14012116193771362, "learning_rate": 0.0016863880165701986, "loss": 1.7250659942626954, "step": 69920, "train_bpb": 0.6108768691874755, "train_bytes": 56664.36875, "train_loss_nats_per_token": 1.7255679415405765 }, { "epoch": 0.05886070948882042, "grad_norm": 0.1260337233543396, "learning_rate": 0.0016857722850538877, "loss": 1.7241352081298829, "step": 69940, "train_bpb": 0.6139030559591308, "train_bytes": 56211.06875, "train_loss_nats_per_token": 1.7244456177682976 }, { "epoch": 0.058992388928392724, "grad_norm": 0.11018558591604233, "learning_rate": 0.0016851565217456685, "loss": 1.7331155776977538, "step": 69960, "train_bpb": 0.6136229190075132, "train_bytes": 56421.60625, "train_loss_nats_per_token": 1.7327153121611258 }, { "epoch": 0.05912406836796503, "grad_norm": 0.1260758489370346, "learning_rate": 0.0016845407267509183, "loss": 1.7309453964233399, "step": 69980, "train_bpb": 0.6120464660805914, "train_bytes": 56793.09375, "train_loss_nats_per_token": 1.7313789499659564 }, { "epoch": 0.05925574780753733, "grad_norm": 0.1335260570049286, "learning_rate": 0.0016839249001750207, "loss": 1.7260385513305665, "step": 70000, "train_bpb": 0.6106149463565073, "train_bytes": 56727.95, "train_loss_nats_per_token": 1.7264429535564472 }, { "epoch": 0.05925574780753733, "eval_loss": 1.708622932434082, "eval_runtime": 76.2224, "eval_samples_per_second": 13.12, "eval_steps_per_second": 13.12, "step": 70000, "train_bpb": 0.6024171539537923, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.7154507509396795 }, { "epoch": 0.05938742724710964, "grad_norm": 0.11723925173282623, "learning_rate": 0.0016833090421233643, "loss": 1.728260612487793, "step": 70020, "train_bpb": 0.614048495469996, "train_bytes": 56222.0375, "train_loss_nats_per_token": 1.7279937607344358 }, { "epoch": 0.05951910668668194, "grad_norm": 0.12407031655311584, "learning_rate": 0.0016826931527013438, "loss": 1.735132598876953, "step": 70040, "train_bpb": 0.6153942704154657, "train_bytes": 56226.86875, "train_loss_nats_per_token": 1.734984353114614 }, { "epoch": 0.05965078612625425, "grad_norm": 0.10960811376571655, "learning_rate": 0.0016820772320143577, "loss": 1.734769058227539, "step": 70060, "train_bpb": 0.6112482532321764, "train_bytes": 56999.6625, "train_loss_nats_per_token": 1.7350719229571512 }, { "epoch": 0.05978246556582655, "grad_norm": 0.1727869063615799, "learning_rate": 0.0016814612801678112, "loss": 1.7230836868286132, "step": 70080, "train_bpb": 0.6129491667514666, "train_bytes": 55904.26875, "train_loss_nats_per_token": 1.7233316311462958 }, { "epoch": 0.05991414500539886, "grad_norm": 0.13737550377845764, "learning_rate": 0.0016808452972671146, "loss": 1.722420883178711, "step": 70100, "train_bpb": 0.6092397554413067, "train_bytes": 56483.29375, "train_loss_nats_per_token": 1.7228855741308597 }, { "epoch": 0.06004582444497116, "grad_norm": 0.10050071775913239, "learning_rate": 0.001680229283417684, "loss": 1.7264396667480468, "step": 70120, "train_bpb": 0.6091772931503967, "train_bytes": 56932.86875, "train_loss_nats_per_token": 1.7267777945271359 }, { "epoch": 0.060177503884543466, "grad_norm": 0.11976324021816254, "learning_rate": 0.0016796132387249388, "loss": 1.7167184829711915, "step": 70140, "train_bpb": 0.6070952017883269, "train_bytes": 56494.1, "train_loss_nats_per_token": 1.7168409189112321 }, { "epoch": 0.06030918332411577, "grad_norm": 0.16113649308681488, "learning_rate": 0.0016789971632943056, "loss": 1.7265333175659179, "step": 70160, "train_bpb": 0.6135580918386941, "train_bytes": 56034.38125, "train_loss_nats_per_token": 1.7263787768047185 }, { "epoch": 0.060440862763688076, "grad_norm": 0.12247829139232635, "learning_rate": 0.0016783810572312161, "loss": 1.7122283935546876, "step": 70180, "train_bpb": 0.6081704962068927, "train_bytes": 55877.75625, "train_loss_nats_per_token": 1.7121256995309875 }, { "epoch": 0.06057254220326038, "grad_norm": 0.12242767214775085, "learning_rate": 0.0016777649206411063, "loss": 1.7215398788452148, "step": 70200, "train_bpb": 0.6097714338909879, "train_bytes": 56231.65625, "train_loss_nats_per_token": 1.7218059009603544 }, { "epoch": 0.060704221642832686, "grad_norm": 0.1449415683746338, "learning_rate": 0.0016771487536294187, "loss": 1.7272953033447265, "step": 70220, "train_bpb": 0.6129781387290184, "train_bytes": 56352.31875, "train_loss_nats_per_token": 1.7275676655302235 }, { "epoch": 0.06083590108240499, "grad_norm": 0.10652636736631393, "learning_rate": 0.0016765325563015995, "loss": 1.7169567108154298, "step": 70240, "train_bpb": 0.6098153517664727, "train_bytes": 56196.2375, "train_loss_nats_per_token": 1.717069187983726 }, { "epoch": 0.060967580521977295, "grad_norm": 0.12485978752374649, "learning_rate": 0.0016759163287631015, "loss": 1.7214468002319336, "step": 70260, "train_bpb": 0.6082817973616951, "train_bytes": 56830.1125, "train_loss_nats_per_token": 1.7215578818912602 }, { "epoch": 0.06109925996154961, "grad_norm": 0.11328538507223129, "learning_rate": 0.0016753000711193814, "loss": 1.7303829193115234, "step": 70280, "train_bpb": 0.6125591514820903, "train_bytes": 56794.1, "train_loss_nats_per_token": 1.7310523647411433 }, { "epoch": 0.06123093940112191, "grad_norm": 0.12800779938697815, "learning_rate": 0.0016746837834759022, "loss": 1.7200902938842773, "step": 70300, "train_bpb": 0.60926083366337, "train_bytes": 56475.4875, "train_loss_nats_per_token": 1.7199397792297708 }, { "epoch": 0.061362618840694216, "grad_norm": 0.1265990138053894, "learning_rate": 0.001674067465938131, "loss": 1.7249839782714844, "step": 70320, "train_bpb": 0.6135400678742169, "train_bytes": 55990.325, "train_loss_nats_per_token": 1.7251777562486754 }, { "epoch": 0.06149429828026652, "grad_norm": 0.160077303647995, "learning_rate": 0.0016734511186115406, "loss": 1.7144487380981446, "step": 70340, "train_bpb": 0.606027768744676, "train_bytes": 56429.2625, "train_loss_nats_per_token": 1.7144616318188752 }, { "epoch": 0.061625977719838826, "grad_norm": 0.10297481715679169, "learning_rate": 0.0016728347416016095, "loss": 1.7148799896240234, "step": 70360, "train_bpb": 0.6078560697334697, "train_bytes": 56579.375, "train_loss_nats_per_token": 1.71552904384059 }, { "epoch": 0.06175765715941113, "grad_norm": 0.0975503996014595, "learning_rate": 0.0016722183350138203, "loss": 1.7149600982666016, "step": 70380, "train_bpb": 0.6050268012199196, "train_bytes": 56538.95625, "train_loss_nats_per_token": 1.7149804021778317 }, { "epoch": 0.061889336598983435, "grad_norm": 0.09516748040914536, "learning_rate": 0.0016716018989536604, "loss": 1.7078044891357422, "step": 70400, "train_bpb": 0.6041377834553053, "train_bytes": 56488.6375, "train_loss_nats_per_token": 1.7080146831087335 }, { "epoch": 0.06202101603855574, "grad_norm": 0.11138808727264404, "learning_rate": 0.0016709854335266237, "loss": 1.7088891983032226, "step": 70420, "train_bpb": 0.6075465243476268, "train_bytes": 56089.08125, "train_loss_nats_per_token": 1.7091005941338204 }, { "epoch": 0.062152695478128045, "grad_norm": 0.12611979246139526, "learning_rate": 0.0016703689388382072, "loss": 1.7307512283325195, "step": 70440, "train_bpb": 0.6113745667241797, "train_bytes": 56751.8625, "train_loss_nats_per_token": 1.7311320541348638 }, { "epoch": 0.06228437491770035, "grad_norm": 0.12514522671699524, "learning_rate": 0.0016697524149939151, "loss": 1.736818504333496, "step": 70460, "train_bpb": 0.6150994773628278, "train_bytes": 56765.0375, "train_loss_nats_per_token": 1.7367502629630909 }, { "epoch": 0.062416054357272654, "grad_norm": 0.10736590623855591, "learning_rate": 0.001669135862099255, "loss": 1.7401582717895507, "step": 70480, "train_bpb": 0.6181157918050021, "train_bytes": 56506.35, "train_loss_nats_per_token": 1.7404170418593434 }, { "epoch": 0.06254773379684496, "grad_norm": 0.14283962547779083, "learning_rate": 0.0016685192802597393, "loss": 1.7577373504638671, "step": 70500, "train_bpb": 0.6231688943493459, "train_bytes": 56250.04375, "train_loss_nats_per_token": 1.7577777368480905 }, { "epoch": 0.06267941323641726, "grad_norm": 0.12723104655742645, "learning_rate": 0.0016679026695808866, "loss": 1.7486257553100586, "step": 70520, "train_bpb": 0.618228737184438, "train_bytes": 56622.96875, "train_loss_nats_per_token": 1.749164879999252 }, { "epoch": 0.06281109267598957, "grad_norm": 0.13018546998500824, "learning_rate": 0.0016672860301682202, "loss": 1.7432897567749024, "step": 70540, "train_bpb": 0.6176969933107593, "train_bytes": 56626.5125, "train_loss_nats_per_token": 1.7437919568444689 }, { "epoch": 0.06294277211556187, "grad_norm": 0.12599371373653412, "learning_rate": 0.001666669362127267, "loss": 1.753157615661621, "step": 70560, "train_bpb": 0.6211562371040046, "train_bytes": 56259.3125, "train_loss_nats_per_token": 1.7537857759291664 }, { "epoch": 0.06307445155513418, "grad_norm": 0.1453937292098999, "learning_rate": 0.00166605266556356, "loss": 1.7625577926635743, "step": 70580, "train_bpb": 0.6253466411302103, "train_bytes": 56367.29375, "train_loss_nats_per_token": 1.7632490252769193 }, { "epoch": 0.06320613099470648, "grad_norm": 0.10890887677669525, "learning_rate": 0.0016654359405826372, "loss": 1.7604036331176758, "step": 70600, "train_bpb": 0.623631509564101, "train_bytes": 56561.1625, "train_loss_nats_per_token": 1.7606165132253153 }, { "epoch": 0.06333781043427879, "grad_norm": 0.11065804213285446, "learning_rate": 0.0016648191872900406, "loss": 1.744016456604004, "step": 70620, "train_bpb": 0.6200061717587104, "train_bytes": 56169.30625, "train_loss_nats_per_token": 1.7439665910391142 }, { "epoch": 0.06346948987385109, "grad_norm": 0.09765302389860153, "learning_rate": 0.0016642024057913177, "loss": 1.7491018295288085, "step": 70640, "train_bpb": 0.6176018977724999, "train_bytes": 57193.025, "train_loss_nats_per_token": 1.7493124958833655 }, { "epoch": 0.0636011693134234, "grad_norm": 0.11611080914735794, "learning_rate": 0.0016635855961920206, "loss": 1.7449129104614258, "step": 70660, "train_bpb": 0.6192326264690533, "train_bytes": 56440.03125, "train_loss_nats_per_token": 1.7455725097672743 }, { "epoch": 0.0637328487529957, "grad_norm": 0.1460847556591034, "learning_rate": 0.0016629687585977063, "loss": 1.739097785949707, "step": 70680, "train_bpb": 0.6159001536931346, "train_bytes": 56792.0125, "train_loss_nats_per_token": 1.739522967115571 }, { "epoch": 0.06386452819256801, "grad_norm": 0.1376514732837677, "learning_rate": 0.0016623518931139368, "loss": 1.7437063217163087, "step": 70700, "train_bpb": 0.6152075654557415, "train_bytes": 56502.11875, "train_loss_nats_per_token": 1.744027426332224 }, { "epoch": 0.06399620763214031, "grad_norm": 0.12957990169525146, "learning_rate": 0.0016617349998462778, "loss": 1.7469324111938476, "step": 70720, "train_bpb": 0.6190832597592519, "train_bytes": 56658.86875, "train_loss_nats_per_token": 1.7472180849594559 }, { "epoch": 0.06412788707171262, "grad_norm": 0.13546597957611084, "learning_rate": 0.001661118078900301, "loss": 1.7548362731933593, "step": 70740, "train_bpb": 0.6182153888493394, "train_bytes": 56655.26875, "train_loss_nats_per_token": 1.7546254715137541 }, { "epoch": 0.06425956651128492, "grad_norm": 0.13813762366771698, "learning_rate": 0.0016605011303815827, "loss": 1.7449028015136718, "step": 70760, "train_bpb": 0.6200660618366913, "train_bytes": 56137.34375, "train_loss_nats_per_token": 1.745447097549602 }, { "epoch": 0.06439124595085724, "grad_norm": 0.13575415313243866, "learning_rate": 0.0016598841543957034, "loss": 1.7423234939575196, "step": 70780, "train_bpb": 0.615964293644564, "train_bytes": 56967.61875, "train_loss_nats_per_token": 1.742311429084816 }, { "epoch": 0.06452292539042954, "grad_norm": 0.1525917649269104, "learning_rate": 0.0016592671510482484, "loss": 1.7458593368530273, "step": 70800, "train_bpb": 0.6181027617641297, "train_bytes": 56794.2125, "train_loss_nats_per_token": 1.7461349301458584 }, { "epoch": 0.06465460483000185, "grad_norm": 0.11188030242919922, "learning_rate": 0.0016586501204448076, "loss": 1.7294391632080077, "step": 70820, "train_bpb": 0.6119886426607365, "train_bytes": 56476.65, "train_loss_nats_per_token": 1.7297255453313998 }, { "epoch": 0.06478628426957415, "grad_norm": 0.10109905153512955, "learning_rate": 0.0016580330626909763, "loss": 1.7318866729736329, "step": 70840, "train_bpb": 0.6155574822844228, "train_bytes": 55971.71875, "train_loss_nats_per_token": 1.7323092691759738 }, { "epoch": 0.06491796370914646, "grad_norm": 0.13708457350730896, "learning_rate": 0.0016574159778923534, "loss": 1.7374021530151367, "step": 70860, "train_bpb": 0.6147100444195666, "train_bytes": 56535.1125, "train_loss_nats_per_token": 1.7375175564745915 }, { "epoch": 0.06504964314871876, "grad_norm": 0.1093808263540268, "learning_rate": 0.0016567988661545438, "loss": 1.7440547943115234, "step": 70880, "train_bpb": 0.6171141453417007, "train_bytes": 57230.61875, "train_loss_nats_per_token": 1.7441008603680765 }, { "epoch": 0.06518132258829107, "grad_norm": 0.131907656788826, "learning_rate": 0.0016561817275831552, "loss": 1.732374382019043, "step": 70900, "train_bpb": 0.615146737721091, "train_bytes": 56142.31875, "train_loss_nats_per_token": 1.7326922829253888 }, { "epoch": 0.06531300202786337, "grad_norm": 0.13402847945690155, "learning_rate": 0.0016555645622838018, "loss": 1.7278533935546876, "step": 70920, "train_bpb": 0.6107299593486855, "train_bytes": 56364.76875, "train_loss_nats_per_token": 1.7282653293037038 }, { "epoch": 0.06544468146743568, "grad_norm": 0.1502784937620163, "learning_rate": 0.0016549473703620999, "loss": 1.7302972793579101, "step": 70940, "train_bpb": 0.6146126903053569, "train_bytes": 56537.76875, "train_loss_nats_per_token": 1.730223615416695 }, { "epoch": 0.06557636090700798, "grad_norm": 0.18078316748142242, "learning_rate": 0.0016543301519236736, "loss": 1.734229850769043, "step": 70960, "train_bpb": 0.6141017771060868, "train_bytes": 56502.43125, "train_loss_nats_per_token": 1.7346525125915466 }, { "epoch": 0.06570804034658029, "grad_norm": 0.12838701903820038, "learning_rate": 0.0016537129070741483, "loss": 1.7317693710327149, "step": 70980, "train_bpb": 0.6138193708580245, "train_bytes": 56220.04375, "train_loss_nats_per_token": 1.7319386251444162 }, { "epoch": 0.06583971978615259, "grad_norm": 0.1093895435333252, "learning_rate": 0.0016530956359191561, "loss": 1.728123664855957, "step": 71000, "train_bpb": 0.6105586230902067, "train_bytes": 57043.35, "train_loss_nats_per_token": 1.7282908279299771 }, { "epoch": 0.06583971978615259, "eval_loss": 1.7092033624649048, "eval_runtime": 75.7277, "eval_samples_per_second": 13.205, "eval_steps_per_second": 13.205, "step": 71000, "train_bpb": 0.6025922458621559, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.715949344885276 }, { "epoch": 0.0659713992257249, "grad_norm": 0.11919566243886948, "learning_rate": 0.001652478338564333, "loss": 1.724302101135254, "step": 71020, "train_bpb": 0.6117374809768809, "train_bytes": 56258.7375, "train_loss_nats_per_token": 1.724505361433923 }, { "epoch": 0.0661030786652972, "grad_norm": 0.15619410574436188, "learning_rate": 0.00165186101511532, "loss": 1.726461410522461, "step": 71040, "train_bpb": 0.6093908417187494, "train_bytes": 56966.9, "train_loss_nats_per_token": 1.7266057121214669 }, { "epoch": 0.0662347581048695, "grad_norm": 0.1135774478316307, "learning_rate": 0.0016512436656777607, "loss": 1.7218477249145507, "step": 71060, "train_bpb": 0.6092447383856506, "train_bytes": 56899.9, "train_loss_nats_per_token": 1.7220879233533668 }, { "epoch": 0.06636643754444181, "grad_norm": 0.14298568665981293, "learning_rate": 0.001650626290357305, "loss": 1.7199974060058594, "step": 71080, "train_bpb": 0.6101781735925247, "train_bytes": 56398.225, "train_loss_nats_per_token": 1.7200728717688805 }, { "epoch": 0.06649811698401412, "grad_norm": 0.09896348416805267, "learning_rate": 0.0016500088892596066, "loss": 1.7274444580078125, "step": 71100, "train_bpb": 0.6118988684837444, "train_bytes": 56332.4375, "train_loss_nats_per_token": 1.7274979112740982 }, { "epoch": 0.06662979642358642, "grad_norm": 0.15846510231494904, "learning_rate": 0.0016493914624903243, "loss": 1.7200828552246095, "step": 71120, "train_bpb": 0.6085765182013464, "train_bytes": 56063.675, "train_loss_nats_per_token": 1.7209894034203321 }, { "epoch": 0.06676147586315873, "grad_norm": 0.18469329178333282, "learning_rate": 0.00164877401015512, "loss": 1.7234525680541992, "step": 71140, "train_bpb": 0.6112608960506302, "train_bytes": 56582.425, "train_loss_nats_per_token": 1.72394963773795 }, { "epoch": 0.06689315530273103, "grad_norm": 0.13529664278030396, "learning_rate": 0.0016481565323596605, "loss": 1.732782745361328, "step": 71160, "train_bpb": 0.6113875785829038, "train_bytes": 56997.05, "train_loss_nats_per_token": 1.7330524729816492 }, { "epoch": 0.06702483474230334, "grad_norm": 0.10092106461524963, "learning_rate": 0.0016475390292096175, "loss": 1.7226762771606445, "step": 71180, "train_bpb": 0.6074358284404875, "train_bytes": 56832.825, "train_loss_nats_per_token": 1.7230423656369795 }, { "epoch": 0.06715651418187564, "grad_norm": 0.14729367196559906, "learning_rate": 0.001646921500810667, "loss": 1.72320556640625, "step": 71200, "train_bpb": 0.6081825530066466, "train_bytes": 56785.31875, "train_loss_nats_per_token": 1.7234105453259798 }, { "epoch": 0.06728819362144794, "grad_norm": 0.1045590415596962, "learning_rate": 0.001646303947268488, "loss": 1.7256038665771485, "step": 71220, "train_bpb": 0.608943317838007, "train_bytes": 56936.70625, "train_loss_nats_per_token": 1.7257288810909603 }, { "epoch": 0.06741987306102025, "grad_norm": 0.11669188737869263, "learning_rate": 0.0016456863686887652, "loss": 1.7214010238647461, "step": 71240, "train_bpb": 0.6103645246998539, "train_bytes": 56337.40625, "train_loss_nats_per_token": 1.7220287525938902 }, { "epoch": 0.06755155250059255, "grad_norm": 0.11126547306776047, "learning_rate": 0.0016450687651771872, "loss": 1.7150197982788087, "step": 71260, "train_bpb": 0.6071630393895509, "train_bytes": 56460.14375, "train_loss_nats_per_token": 1.7155794793591064 }, { "epoch": 0.06768323194016486, "grad_norm": 0.1291969120502472, "learning_rate": 0.0016444511368394468, "loss": 1.715569305419922, "step": 71280, "train_bpb": 0.6085523321541806, "train_bytes": 56352.50625, "train_loss_nats_per_token": 1.7157522906986251 }, { "epoch": 0.06781491137973716, "grad_norm": 0.12901835143566132, "learning_rate": 0.0016438334837812411, "loss": 1.7156465530395508, "step": 71300, "train_bpb": 0.6084001484620973, "train_bytes": 56433.86875, "train_loss_nats_per_token": 1.7161198458896971 }, { "epoch": 0.06794659081930947, "grad_norm": 0.1267179399728775, "learning_rate": 0.0016432158061082715, "loss": 1.7197763442993164, "step": 71320, "train_bpb": 0.6077062293708, "train_bytes": 57072.13125, "train_loss_nats_per_token": 1.7200563498560202 }, { "epoch": 0.06807827025888177, "grad_norm": 0.11829151213169098, "learning_rate": 0.001642598103926243, "loss": 1.7226211547851562, "step": 71340, "train_bpb": 0.6099430547258506, "train_bytes": 56532.575, "train_loss_nats_per_token": 1.7228017594491085 }, { "epoch": 0.06820994969845408, "grad_norm": 0.11463771015405655, "learning_rate": 0.0016419803773408657, "loss": 1.7218378067016602, "step": 71360, "train_bpb": 0.6120618539150146, "train_bytes": 56184.2375, "train_loss_nats_per_token": 1.7221156205536312 }, { "epoch": 0.06834162913802638, "grad_norm": 0.09724868834018707, "learning_rate": 0.0016413626264578534, "loss": 1.7229814529418945, "step": 71380, "train_bpb": 0.6103464550334596, "train_bytes": 56799.8875, "train_loss_nats_per_token": 1.7227684744309246 }, { "epoch": 0.06847330857759869, "grad_norm": 0.09809409826993942, "learning_rate": 0.0016407448513829238, "loss": 1.7184297561645507, "step": 71400, "train_bpb": 0.6108586800933717, "train_bytes": 56239.04375, "train_loss_nats_per_token": 1.718839100102499 }, { "epoch": 0.06860498801717099, "grad_norm": 0.1500450223684311, "learning_rate": 0.0016401270522217995, "loss": 1.7198804855346679, "step": 71420, "train_bpb": 0.6092755659131849, "train_bytes": 56865.58125, "train_loss_nats_per_token": 1.7201146806015526 }, { "epoch": 0.0687366674567433, "grad_norm": 0.11599515378475189, "learning_rate": 0.001639509229080207, "loss": 1.7190250396728515, "step": 71440, "train_bpb": 0.6059822561369491, "train_bytes": 56989.7875, "train_loss_nats_per_token": 1.719485505872185 }, { "epoch": 0.06886834689631562, "grad_norm": 0.1430763453245163, "learning_rate": 0.001638891382063876, "loss": 1.7030101776123048, "step": 71460, "train_bpb": 0.604173371473607, "train_bytes": 56659.33125, "train_loss_nats_per_token": 1.7030915959266086 }, { "epoch": 0.06900002633588792, "grad_norm": 0.0973486453294754, "learning_rate": 0.0016382735112785412, "loss": 1.7186796188354492, "step": 71480, "train_bpb": 0.6081657472407901, "train_bytes": 56952.71875, "train_loss_nats_per_token": 1.7189721911431586 }, { "epoch": 0.06913170577546023, "grad_norm": 0.1076570525765419, "learning_rate": 0.0016376556168299413, "loss": 1.7165727615356445, "step": 71500, "train_bpb": 0.6045361803205116, "train_bytes": 57100.9875, "train_loss_nats_per_token": 1.7167424022519884 }, { "epoch": 0.06926338521503253, "grad_norm": 0.12373335659503937, "learning_rate": 0.0016370376988238196, "loss": 1.7227867126464844, "step": 71520, "train_bpb": 0.6085833517510988, "train_bytes": 56597.475, "train_loss_nats_per_token": 1.7229993801969161 }, { "epoch": 0.06939506465460483, "grad_norm": 0.12103434652090073, "learning_rate": 0.0016364197573659213, "loss": 1.7057281494140626, "step": 71540, "train_bpb": 0.6053079145973422, "train_bytes": 56078.70625, "train_loss_nats_per_token": 1.7058833424083462 }, { "epoch": 0.06952674409417714, "grad_norm": 0.10595158487558365, "learning_rate": 0.001635801792561998, "loss": 1.710403823852539, "step": 71560, "train_bpb": 0.6058205621963992, "train_bytes": 56812.1375, "train_loss_nats_per_token": 1.7105977606692377 }, { "epoch": 0.06965842353374944, "grad_norm": 0.11148687452077866, "learning_rate": 0.0016351838045178038, "loss": 1.7094232559204101, "step": 71580, "train_bpb": 0.6055061822212908, "train_bytes": 56703.91875, "train_loss_nats_per_token": 1.7097280856574515 }, { "epoch": 0.06979010297332175, "grad_norm": 0.12053634971380234, "learning_rate": 0.0016345657933390981, "loss": 1.713827133178711, "step": 71600, "train_bpb": 0.603892384137233, "train_bytes": 56905.95625, "train_loss_nats_per_token": 1.714241784882135 }, { "epoch": 0.06992178241289405, "grad_norm": 0.1122678741812706, "learning_rate": 0.0016339477591316425, "loss": 1.717440414428711, "step": 71620, "train_bpb": 0.6102322694953081, "train_bytes": 56292.8125, "train_loss_nats_per_token": 1.717616268539819 }, { "epoch": 0.07005346185246636, "grad_norm": 0.10120486468076706, "learning_rate": 0.0016333297020012043, "loss": 1.7225513458251953, "step": 71640, "train_bpb": 0.61121048317341, "train_bytes": 56836.48125, "train_loss_nats_per_token": 1.7229750840203661 }, { "epoch": 0.07018514129203866, "grad_norm": 0.17207732796669006, "learning_rate": 0.0016327116220535536, "loss": 1.7349845886230468, "step": 71660, "train_bpb": 0.6145903199986357, "train_bytes": 56086.7625, "train_loss_nats_per_token": 1.7347633651226644 }, { "epoch": 0.07031682073161097, "grad_norm": 0.11795572191476822, "learning_rate": 0.0016320935193944643, "loss": 1.7330524444580078, "step": 71680, "train_bpb": 0.614798482300221, "train_bytes": 56718.08125, "train_loss_nats_per_token": 1.733380718681982 }, { "epoch": 0.07044850017118327, "grad_norm": 0.10767831653356552, "learning_rate": 0.001631475394129716, "loss": 1.7416828155517579, "step": 71700, "train_bpb": 0.6188487496778015, "train_bytes": 56419.2625, "train_loss_nats_per_token": 1.7416232737082304 }, { "epoch": 0.07058017961075558, "grad_norm": 0.11837542802095413, "learning_rate": 0.001630857246365089, "loss": 1.74798526763916, "step": 71720, "train_bpb": 0.6162879874937426, "train_bytes": 56814.8, "train_loss_nats_per_token": 1.7479281994154792 }, { "epoch": 0.07071185905032788, "grad_norm": 0.12259206920862198, "learning_rate": 0.0016302390762063703, "loss": 1.7506153106689453, "step": 71740, "train_bpb": 0.6186883874564812, "train_bytes": 56948.1, "train_loss_nats_per_token": 1.7509363924609516 }, { "epoch": 0.07084353848990019, "grad_norm": 0.11306197941303253, "learning_rate": 0.0016296208837593496, "loss": 1.7488338470458984, "step": 71760, "train_bpb": 0.6162607311573529, "train_bytes": 56986.775, "train_loss_nats_per_token": 1.749336721684199 }, { "epoch": 0.07097521792947249, "grad_norm": 0.11263972520828247, "learning_rate": 0.001629002669129821, "loss": 1.7487022399902343, "step": 71780, "train_bpb": 0.6215779662693873, "train_bytes": 56289.68125, "train_loss_nats_per_token": 1.7488157402855165 }, { "epoch": 0.0711068973690448, "grad_norm": 0.1300438642501831, "learning_rate": 0.0016283844324235805, "loss": 1.7524848937988282, "step": 71800, "train_bpb": 0.6155699254534809, "train_bytes": 56935.6875, "train_loss_nats_per_token": 1.7525125538398105 }, { "epoch": 0.0712385768086171, "grad_norm": 0.15386012196540833, "learning_rate": 0.0016277661737464303, "loss": 1.7368692398071288, "step": 71820, "train_bpb": 0.6153376896648146, "train_bytes": 56513.8, "train_loss_nats_per_token": 1.7369547754161698 }, { "epoch": 0.0713702562481894, "grad_norm": 0.1374281346797943, "learning_rate": 0.0016271478932041751, "loss": 1.744148063659668, "step": 71840, "train_bpb": 0.6145342341015109, "train_bytes": 56839.9375, "train_loss_nats_per_token": 1.7439506266814335 }, { "epoch": 0.07150193568776171, "grad_norm": 0.1284988820552826, "learning_rate": 0.001626529590902624, "loss": 1.7425407409667968, "step": 71860, "train_bpb": 0.6150197115604336, "train_bytes": 56646.05, "train_loss_nats_per_token": 1.7427704207597707 }, { "epoch": 0.07163361512733402, "grad_norm": 0.10182293504476547, "learning_rate": 0.0016259112669475884, "loss": 1.7423788070678712, "step": 71880, "train_bpb": 0.6153247670561129, "train_bytes": 56537.175, "train_loss_nats_per_token": 1.7424803210877673 }, { "epoch": 0.07176529456690632, "grad_norm": 0.13725511729717255, "learning_rate": 0.0016252929214448848, "loss": 1.7372566223144532, "step": 71900, "train_bpb": 0.6132936695496747, "train_bytes": 57149.7875, "train_loss_nats_per_token": 1.737975780747699 }, { "epoch": 0.07189697400647863, "grad_norm": 0.08208240568637848, "learning_rate": 0.0016246745545003339, "loss": 1.7482172012329102, "step": 71920, "train_bpb": 0.6172820785385734, "train_bytes": 56559.3625, "train_loss_nats_per_token": 1.7478683407324802 }, { "epoch": 0.07202865344605093, "grad_norm": 0.11876673996448517, "learning_rate": 0.0016240561662197578, "loss": 1.7321107864379883, "step": 71940, "train_bpb": 0.6128042754341014, "train_bytes": 56405.1875, "train_loss_nats_per_token": 1.7323290029958267 }, { "epoch": 0.07216033288562324, "grad_norm": 0.1616792231798172, "learning_rate": 0.0016234377567089847, "loss": 1.7484973907470702, "step": 71960, "train_bpb": 0.6172946291742573, "train_bytes": 57264.21875, "train_loss_nats_per_token": 1.7489317075865471 }, { "epoch": 0.07229201232519554, "grad_norm": 0.1094522476196289, "learning_rate": 0.0016228193260738447, "loss": 1.7411638259887696, "step": 71980, "train_bpb": 0.6155997397109138, "train_bytes": 56884.71875, "train_loss_nats_per_token": 1.7412159669421714 }, { "epoch": 0.07242369176476784, "grad_norm": 0.09437184780836105, "learning_rate": 0.0016222008744201722, "loss": 1.7375732421875, "step": 72000, "train_bpb": 0.6143334385262982, "train_bytes": 56584.13125, "train_loss_nats_per_token": 1.73765470490181 }, { "epoch": 0.07242369176476784, "eval_loss": 1.7067722082138062, "eval_runtime": 79.2499, "eval_samples_per_second": 12.618, "eval_steps_per_second": 12.618, "step": 72000, "train_bpb": 0.60171914566472, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.7134630936563626 }, { "epoch": 0.00013167943957230517, "grad_norm": 0.15449965000152588, "learning_rate": 0.0016215824018538053, "loss": 1.725496482849121, "step": 72020, "train_bpb": 0.6091751735509844, "train_bytes": 57285.4875, "train_loss_nats_per_token": 1.726056466136722 }, { "epoch": 0.00026335887914461035, "grad_norm": 0.12627114355564117, "learning_rate": 0.0016209639084805857, "loss": 1.723215103149414, "step": 72040, "train_bpb": 0.6104391500380569, "train_bytes": 56225.5125, "train_loss_nats_per_token": 1.7233375745663202 }, { "epoch": 0.00039503831871691555, "grad_norm": 0.10122272372245789, "learning_rate": 0.0016203453944063576, "loss": 1.7076606750488281, "step": 72060, "train_bpb": 0.6031983406548199, "train_bytes": 56917.51875, "train_loss_nats_per_token": 1.7081855473104817 }, { "epoch": 0.0005267177582892207, "grad_norm": 0.13552120327949524, "learning_rate": 0.0016197268597369708, "loss": 1.7114341735839844, "step": 72080, "train_bpb": 0.6061487056094189, "train_bytes": 56260.525, "train_loss_nats_per_token": 1.7114655649658777 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.13187319040298462, "learning_rate": 0.0016191083045782773, "loss": 1.7146881103515625, "step": 72100, "train_bpb": 0.6052567469578705, "train_bytes": 56795.56875, "train_loss_nats_per_token": 1.7151290516246989 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.12753134965896606, "learning_rate": 0.001618489729036132, "loss": 1.709431266784668, "step": 72120, "train_bpb": 0.6022253949259472, "train_bytes": 56929.99375, "train_loss_nats_per_token": 1.7095728998130832 }, { "epoch": 0.0009217560770061363, "grad_norm": 0.0886593610048294, "learning_rate": 0.0016178711332163946, "loss": 1.7021554946899413, "step": 72140, "train_bpb": 0.6005572001518301, "train_bytes": 56964.9875, "train_loss_nats_per_token": 1.7026401252135541 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.31866204738616943, "learning_rate": 0.0016172525172249276, "loss": 1.7134624481201173, "step": 72160, "train_bpb": 0.6068890613093276, "train_bytes": 56336.2625, "train_loss_nats_per_token": 1.7136100696132897 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.22569464147090912, "learning_rate": 0.0016166338811675974, "loss": 1.7874439239501954, "step": 72180, "train_bpb": 0.6330766184147425, "train_bytes": 56659.75, "train_loss_nats_per_token": 1.788064778311506 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.15891608595848083, "learning_rate": 0.0016160152251502727, "loss": 1.7477151870727539, "step": 72200, "train_bpb": 0.6158914091005846, "train_bytes": 56591.2375, "train_loss_nats_per_token": 1.747744970879215 }, { "epoch": 0.001448473835295357, "grad_norm": 0.1306278556585312, "learning_rate": 0.0016153965492788276, "loss": 1.721139144897461, "step": 72220, "train_bpb": 0.6093591217463528, "train_bytes": 56428.475, "train_loss_nats_per_token": 1.7215227149210937 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.10164865106344223, "learning_rate": 0.0016147778536591373, "loss": 1.7148557662963868, "step": 72240, "train_bpb": 0.6065040706320316, "train_bytes": 56637.1375, "train_loss_nats_per_token": 1.7149202027392019 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.10884436964988708, "learning_rate": 0.0016141591383970822, "loss": 1.7097047805786132, "step": 72260, "train_bpb": 0.603235428907351, "train_bytes": 56402.74375, "train_loss_nats_per_token": 1.7100790382203002 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.13649609684944153, "learning_rate": 0.001613540403598545, "loss": 1.703007698059082, "step": 72280, "train_bpb": 0.6038516014115232, "train_bytes": 56227.9125, "train_loss_nats_per_token": 1.7032614361508744 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.11490056663751602, "learning_rate": 0.0016129216493694124, "loss": 1.7086153030395508, "step": 72300, "train_bpb": 0.6035022995157558, "train_bytes": 56507.2, "train_loss_nats_per_token": 1.7093328022680854 }, { "epoch": 0.002106871033156883, "grad_norm": 0.13819620013237, "learning_rate": 0.001612302875815574, "loss": 1.7154592514038085, "step": 72320, "train_bpb": 0.6086047029872668, "train_bytes": 56519.20625, "train_loss_nats_per_token": 1.7158322526952936 }, { "epoch": 0.002238550472729188, "grad_norm": 0.12772710621356964, "learning_rate": 0.0016116840830429227, "loss": 1.6987539291381837, "step": 72340, "train_bpb": 0.601109093888735, "train_bytes": 56722.08125, "train_loss_nats_per_token": 1.6988834702954234 }, { "epoch": 0.002370229912301493, "grad_norm": 0.14496876299381256, "learning_rate": 0.001611065271157355, "loss": 1.7073875427246095, "step": 72360, "train_bpb": 0.6037231040715965, "train_bytes": 56245.75625, "train_loss_nats_per_token": 1.707412164453968 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.10883032530546188, "learning_rate": 0.0016104464402647706, "loss": 1.6967897415161133, "step": 72380, "train_bpb": 0.5983027296788535, "train_bytes": 56647.2625, "train_loss_nats_per_token": 1.6971707848180926 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.09636475890874863, "learning_rate": 0.0016098275904710716, "loss": 1.701212501525879, "step": 72400, "train_bpb": 0.6008284114300351, "train_bytes": 56474.55, "train_loss_nats_per_token": 1.7013851335828811 }, { "epoch": 0.002765268231018409, "grad_norm": 0.11111840605735779, "learning_rate": 0.0016092087218821656, "loss": 1.6979570388793945, "step": 72420, "train_bpb": 0.6010211417240093, "train_bytes": 56596.68125, "train_loss_nats_per_token": 1.6984958842768476 }, { "epoch": 0.002896947670590714, "grad_norm": 0.12723204493522644, "learning_rate": 0.0016085898346039605, "loss": 1.699591827392578, "step": 72440, "train_bpb": 0.6000812893431525, "train_bytes": 56797.4375, "train_loss_nats_per_token": 1.6999242111011923 }, { "epoch": 0.003028627110163019, "grad_norm": 0.16377851366996765, "learning_rate": 0.0016079709287423693, "loss": 1.6973066329956055, "step": 72460, "train_bpb": 0.6005314734778388, "train_bytes": 56435.13125, "train_loss_nats_per_token": 1.698201026224559 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.13833080232143402, "learning_rate": 0.0016073520044033078, "loss": 1.6920793533325196, "step": 72480, "train_bpb": 0.5985669862924708, "train_bytes": 56318.2375, "train_loss_nats_per_token": 1.692286136352397 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.10332290828227997, "learning_rate": 0.0016067330616926945, "loss": 1.6931743621826172, "step": 72500, "train_bpb": 0.5981398847692849, "train_bytes": 56514.575, "train_loss_nats_per_token": 1.6937234015645726 }, { "epoch": 0.003423665428879935, "grad_norm": 0.11617614328861237, "learning_rate": 0.0016061141007164522, "loss": 1.6989873886108398, "step": 72520, "train_bpb": 0.6008447463677097, "train_bytes": 56427.11875, "train_loss_nats_per_token": 1.699138935705853 }, { "epoch": 0.00355534486845224, "grad_norm": 0.09954865276813507, "learning_rate": 0.001605495121580505, "loss": 1.6973705291748047, "step": 72540, "train_bpb": 0.596505904687564, "train_bytes": 57043.95625, "train_loss_nats_per_token": 1.6972544408291232 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.12463074922561646, "learning_rate": 0.0016048761243907818, "loss": 1.6974618911743165, "step": 72560, "train_bpb": 0.5989444007879423, "train_bytes": 56782.99375, "train_loss_nats_per_token": 1.6975921293428122 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.10350430756807327, "learning_rate": 0.0016042571092532132, "loss": 1.690636444091797, "step": 72580, "train_bpb": 0.5981325630720336, "train_bytes": 56805.15625, "train_loss_nats_per_token": 1.6909003367245345 }, { "epoch": 0.003950383187169155, "grad_norm": 0.13256074488162994, "learning_rate": 0.0016036380762737348, "loss": 1.6859991073608398, "step": 72600, "train_bpb": 0.597013656231901, "train_bytes": 56589.7875, "train_loss_nats_per_token": 1.6868884481610575 }, { "epoch": 0.004082062626741461, "grad_norm": 0.10376463830471039, "learning_rate": 0.001603019025558283, "loss": 1.691042709350586, "step": 72620, "train_bpb": 0.5943725190608985, "train_bytes": 56854.9125, "train_loss_nats_per_token": 1.691295352038584 }, { "epoch": 0.004213742066313766, "grad_norm": 0.1583099216222763, "learning_rate": 0.0016023999572127986, "loss": 1.684712028503418, "step": 72640, "train_bpb": 0.5968347774124692, "train_bytes": 56336.725, "train_loss_nats_per_token": 1.6852795957300482 }, { "epoch": 0.004345421505886071, "grad_norm": 0.11464938521385193, "learning_rate": 0.001601780871343225, "loss": 1.6776395797729493, "step": 72660, "train_bpb": 0.593727140468275, "train_bytes": 56340.48125, "train_loss_nats_per_token": 1.6778796860293814 }, { "epoch": 0.004477100945458376, "grad_norm": 0.14877471327781677, "learning_rate": 0.001601161768055509, "loss": 1.6856382369995118, "step": 72680, "train_bpb": 0.594993200192308, "train_bytes": 56740.71875, "train_loss_nats_per_token": 1.6859890877330137 }, { "epoch": 0.004608780385030682, "grad_norm": 0.15782245993614197, "learning_rate": 0.0016005426474555997, "loss": 1.6960277557373047, "step": 72700, "train_bpb": 0.598645971946582, "train_bytes": 56807.6375, "train_loss_nats_per_token": 1.6960674172007766 }, { "epoch": 0.004740459824602986, "grad_norm": 0.10218894481658936, "learning_rate": 0.0015999235096494492, "loss": 1.6943191528320312, "step": 72720, "train_bpb": 0.5994310939101938, "train_bytes": 56490.375, "train_loss_nats_per_token": 1.6942806810930007 }, { "epoch": 0.004872139264175292, "grad_norm": 0.12775462865829468, "learning_rate": 0.0015993043547430136, "loss": 1.6895364761352538, "step": 72740, "train_bpb": 0.5958638177705871, "train_bytes": 57022.98125, "train_loss_nats_per_token": 1.6897934395277285 }, { "epoch": 0.005003818703747597, "grad_norm": 0.12436585128307343, "learning_rate": 0.0015986851828422514, "loss": 1.6877307891845703, "step": 72760, "train_bpb": 0.5938062580319832, "train_bytes": 56616.2625, "train_loss_nats_per_token": 1.6877418066940648 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.1008092388510704, "learning_rate": 0.0015980659940531229, "loss": 1.685641098022461, "step": 72780, "train_bpb": 0.5954617317598055, "train_bytes": 56404.51875, "train_loss_nats_per_token": 1.6858830628654178 }, { "epoch": 0.005267177582892207, "grad_norm": 0.17052553594112396, "learning_rate": 0.0015974467884815927, "loss": 1.6841962814331055, "step": 72800, "train_bpb": 0.5978342619190784, "train_bytes": 56361.63125, "train_loss_nats_per_token": 1.6847115148198968 }, { "epoch": 0.005398857022464512, "grad_norm": 0.13889636099338531, "learning_rate": 0.0015968275662336274, "loss": 1.6835893630981444, "step": 72820, "train_bpb": 0.5964955160107622, "train_bytes": 56126.94375, "train_loss_nats_per_token": 1.6839768190137738 }, { "epoch": 0.005530536462036818, "grad_norm": 0.13935205340385437, "learning_rate": 0.0015962083274151978, "loss": 1.6845739364624024, "step": 72840, "train_bpb": 0.5966641695329269, "train_bytes": 56335.15625, "train_loss_nats_per_token": 1.6848704855262153 }, { "epoch": 0.005662215901609122, "grad_norm": 0.14388425648212433, "learning_rate": 0.0015955890721322758, "loss": 1.6780147552490234, "step": 72860, "train_bpb": 0.592713296119889, "train_bytes": 56943.975, "train_loss_nats_per_token": 1.6785052682534338 }, { "epoch": 0.005793895341181428, "grad_norm": 0.1418432742357254, "learning_rate": 0.001594969800490837, "loss": 1.677579116821289, "step": 72880, "train_bpb": 0.5939071092977515, "train_bytes": 56260.18125, "train_loss_nats_per_token": 1.678432918849168 }, { "epoch": 0.005925574780753733, "grad_norm": 0.126267671585083, "learning_rate": 0.0015943505125968593, "loss": 1.6756200790405273, "step": 72900, "train_bpb": 0.5943658836639266, "train_bytes": 56512.725, "train_loss_nats_per_token": 1.6762914283283932 }, { "epoch": 0.006057254220326038, "grad_norm": 0.11142408102750778, "learning_rate": 0.0015937312085563245, "loss": 1.6847494125366211, "step": 72920, "train_bpb": 0.5945321390649752, "train_bytes": 57069.98125, "train_loss_nats_per_token": 1.685054379213251 }, { "epoch": 0.006188933659898343, "grad_norm": 0.14940614998340607, "learning_rate": 0.0015931118884752156, "loss": 1.6771839141845704, "step": 72940, "train_bpb": 0.5948652890074361, "train_bytes": 56464.46875, "train_loss_nats_per_token": 1.6775037770494992 }, { "epoch": 0.006320613099470649, "grad_norm": 0.09686575084924698, "learning_rate": 0.0015924925524595204, "loss": 1.6759767532348633, "step": 72960, "train_bpb": 0.5939348747239063, "train_bytes": 56099.6125, "train_loss_nats_per_token": 1.6762316205134384 }, { "epoch": 0.006452292539042954, "grad_norm": 0.12070279568433762, "learning_rate": 0.0015918732006152273, "loss": 1.6790449142456054, "step": 72980, "train_bpb": 0.5946351798986301, "train_bytes": 56585.25625, "train_loss_nats_per_token": 1.6800523336267634 }, { "epoch": 0.006583971978615259, "grad_norm": 0.11836624890565872, "learning_rate": 0.001591253833048328, "loss": 1.6910829544067383, "step": 73000, "train_bpb": 0.5981143828668243, "train_bytes": 56809.4875, "train_loss_nats_per_token": 1.6911956675035107 }, { "epoch": 0.006583971978615259, "eval_loss": 1.5881518125534058, "eval_runtime": 77.8099, "eval_samples_per_second": 12.852, "eval_steps_per_second": 12.852, "step": 73000, "train_bpb": 0.5601338796282249, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5950443610852034 }, { "epoch": 0.00013167943957230517, "grad_norm": 0.2041015625, "learning_rate": 0.0016029141173155728, "loss": 1.592186737060547, "step": 73020, "train_bpb": 0.5599881403174174, "train_bytes": 28694.4625, "train_loss_nats_per_token": 1.5932105636219485 }, { "epoch": 0.00026335887914461035, "grad_norm": 0.140625, "learning_rate": 0.001602291932649563, "loss": 1.6086257934570312, "step": 73040, "train_bpb": 0.5706939774614106, "train_bytes": 28591.025, "train_loss_nats_per_token": 1.6104061516763877 }, { "epoch": 0.00039503831871691555, "grad_norm": 0.201171875, "learning_rate": 0.0016016697303014378, "loss": 1.5989774703979491, "step": 73060, "train_bpb": 0.5676456127440689, "train_bytes": 27972.325, "train_loss_nats_per_token": 1.6003658039525157 }, { "epoch": 0.0005267177582892207, "grad_norm": 0.1962890625, "learning_rate": 0.0016010475103787497, "loss": 1.595706844329834, "step": 73080, "train_bpb": 0.5646298466515326, "train_bytes": 28253.1875, "train_loss_nats_per_token": 1.59614655598072 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.1435546875, "learning_rate": 0.0016004252729890556, "loss": 1.5810138702392578, "step": 73100, "train_bpb": 0.5591420001623094, "train_bytes": 28480.175, "train_loss_nats_per_token": 1.5822857819845237 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.19140625, "learning_rate": 0.0015998030182399151, "loss": 1.587076187133789, "step": 73120, "train_bpb": 0.5604837484446706, "train_bytes": 28437.34375, "train_loss_nats_per_token": 1.5883665017345823 }, { "epoch": 0.0009217560770061363, "grad_norm": 0.169921875, "learning_rate": 0.0015991807462388907, "loss": 1.5789700508117677, "step": 73140, "train_bpb": 0.5617871232698132, "train_bytes": 27932.15, "train_loss_nats_per_token": 1.5792691564310128 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.1484375, "learning_rate": 0.0015985584570935483, "loss": 1.5959596633911133, "step": 73160, "train_bpb": 0.563014167146227, "train_bytes": 28328.375, "train_loss_nats_per_token": 1.5965939944002183 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.126953125, "learning_rate": 0.001597936150911456, "loss": 1.5944327354431151, "step": 73180, "train_bpb": 0.5644041647604972, "train_bytes": 28231.58125, "train_loss_nats_per_token": 1.596213823182813 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.1591796875, "learning_rate": 0.001597313827800185, "loss": 1.5846613883972167, "step": 73200, "train_bpb": 0.5582516107872993, "train_bytes": 28563.9875, "train_loss_nats_per_token": 1.5850214806463594 }, { "epoch": 0.001448473835295357, "grad_norm": 0.1533203125, "learning_rate": 0.00159669148786731, "loss": 1.5893366813659668, "step": 73220, "train_bpb": 0.5591593800172568, "train_bytes": 28503.2375, "train_loss_nats_per_token": 1.5889347792028603 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.1923828125, "learning_rate": 0.0015960691312204083, "loss": 1.582364845275879, "step": 73240, "train_bpb": 0.5582639832260436, "train_bytes": 28426.75625, "train_loss_nats_per_token": 1.5831626480498469 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.1728515625, "learning_rate": 0.0015954467579670601, "loss": 1.5725903511047363, "step": 73260, "train_bpb": 0.5559986728500919, "train_bytes": 28296.7625, "train_loss_nats_per_token": 1.5741684470592063 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.16015625, "learning_rate": 0.0015948243682148483, "loss": 1.5882252693176269, "step": 73280, "train_bpb": 0.5598052856772612, "train_bytes": 28668.225, "train_loss_nats_per_token": 1.5892405945602297 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.177734375, "learning_rate": 0.0015942019620713587, "loss": 1.5795911788940429, "step": 73300, "train_bpb": 0.5606502595530488, "train_bytes": 28055.3625, "train_loss_nats_per_token": 1.5802993426900829 }, { "epoch": 0.002106871033156883, "grad_norm": 0.15234375, "learning_rate": 0.0015935795396441802, "loss": 1.5844932556152345, "step": 73320, "train_bpb": 0.5602806886470049, "train_bytes": 28280.9, "train_loss_nats_per_token": 1.5847435389526907 }, { "epoch": 0.002238550472729188, "grad_norm": 0.2119140625, "learning_rate": 0.001592957101040904, "loss": 1.6027862548828125, "step": 73340, "train_bpb": 0.5653479681935242, "train_bytes": 28529.8, "train_loss_nats_per_token": 1.6037244698281736 }, { "epoch": 0.002370229912301493, "grad_norm": 0.171875, "learning_rate": 0.0015923346463691253, "loss": 1.5963197708129884, "step": 73360, "train_bpb": 0.5677904243266144, "train_bytes": 28129.95, "train_loss_nats_per_token": 1.59664957142697 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.173828125, "learning_rate": 0.0015917121757364396, "loss": 1.5965024948120117, "step": 73380, "train_bpb": 0.5597450877664376, "train_bytes": 28551.35625, "train_loss_nats_per_token": 1.5969119617574403 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.1708984375, "learning_rate": 0.0015910896892504486, "loss": 1.5944787979125976, "step": 73400, "train_bpb": 0.5652599910109858, "train_bytes": 28039.88125, "train_loss_nats_per_token": 1.5954226918295644 }, { "epoch": 0.002765268231018409, "grad_norm": 0.142578125, "learning_rate": 0.001590467187018754, "loss": 1.5803529739379882, "step": 73420, "train_bpb": 0.5587901739811837, "train_bytes": 28373.16875, "train_loss_nats_per_token": 1.5819137839904636 }, { "epoch": 0.002896947670590714, "grad_norm": 0.1767578125, "learning_rate": 0.0015898446691489606, "loss": 1.5897476196289062, "step": 73440, "train_bpb": 0.5641648602802536, "train_bytes": 28055.30625, "train_loss_nats_per_token": 1.5905326868196887 }, { "epoch": 0.003028627110163019, "grad_norm": 0.1533203125, "learning_rate": 0.0015892221357486777, "loss": 1.5847281455993651, "step": 73460, "train_bpb": 0.5606552358575446, "train_bytes": 28229.7125, "train_loss_nats_per_token": 1.5851970873722565 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.1513671875, "learning_rate": 0.0015885995869255147, "loss": 1.586777114868164, "step": 73480, "train_bpb": 0.5613727963765612, "train_bytes": 28407.425, "train_loss_nats_per_token": 1.5873921618015034 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.1826171875, "learning_rate": 0.001587977022787086, "loss": 1.5865592956542969, "step": 73500, "train_bpb": 0.561959891270781, "train_bytes": 28123.025, "train_loss_nats_per_token": 1.5873968212509781 }, { "epoch": 0.003423665428879935, "grad_norm": 0.1865234375, "learning_rate": 0.0015873544434410068, "loss": 1.582630443572998, "step": 73520, "train_bpb": 0.5566792007314799, "train_bytes": 28279.71875, "train_loss_nats_per_token": 1.5837273283612001 }, { "epoch": 0.00355534486845224, "grad_norm": 0.1669921875, "learning_rate": 0.0015867318489948966, "loss": 1.584315586090088, "step": 73540, "train_bpb": 0.561889635884137, "train_bytes": 28275.45625, "train_loss_nats_per_token": 1.584448973231327 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.1494140625, "learning_rate": 0.0015861092395563759, "loss": 1.5738457679748534, "step": 73560, "train_bpb": 0.558196107799709, "train_bytes": 27952.45625, "train_loss_nats_per_token": 1.5749371146101163 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.138671875, "learning_rate": 0.0015854866152330692, "loss": 1.589449405670166, "step": 73580, "train_bpb": 0.5619597211596302, "train_bytes": 28375.91875, "train_loss_nats_per_token": 1.5911625232173465 }, { "epoch": 0.003950383187169155, "grad_norm": 0.1689453125, "learning_rate": 0.0015848639761326022, "loss": 1.5813647270202638, "step": 73600, "train_bpb": 0.5585138753605037, "train_bytes": 28131.28125, "train_loss_nats_per_token": 1.5824181553548304 }, { "epoch": 0.004082062626741461, "grad_norm": 0.1669921875, "learning_rate": 0.0015842413223626048, "loss": 1.594572162628174, "step": 73620, "train_bpb": 0.5656825517102925, "train_bytes": 28159.8125, "train_loss_nats_per_token": 1.5955778038450814 }, { "epoch": 0.004213742066313766, "grad_norm": 0.216796875, "learning_rate": 0.0015836186540307076, "loss": 1.5894320487976075, "step": 73640, "train_bpb": 0.564431334714108, "train_bytes": 28359.39375, "train_loss_nats_per_token": 1.590546985071196 }, { "epoch": 0.004345421505886071, "grad_norm": 0.142578125, "learning_rate": 0.0015829959712445453, "loss": 1.5876875877380372, "step": 73660, "train_bpb": 0.5608448736333357, "train_bytes": 28469.91875, "train_loss_nats_per_token": 1.5877379663501627 }, { "epoch": 0.004477100945458376, "grad_norm": 0.234375, "learning_rate": 0.0015823732741117541, "loss": 1.5697440147399901, "step": 73680, "train_bpb": 0.5565767771535242, "train_bytes": 28252.1625, "train_loss_nats_per_token": 1.5703816880095134 }, { "epoch": 0.004608780385030682, "grad_norm": 0.154296875, "learning_rate": 0.0015817505627399734, "loss": 1.5881710052490234, "step": 73700, "train_bpb": 0.5620400833259139, "train_bytes": 28079.51875, "train_loss_nats_per_token": 1.589467205841437 }, { "epoch": 0.004740459824602986, "grad_norm": 0.1591796875, "learning_rate": 0.001581127837236844, "loss": 1.580660629272461, "step": 73720, "train_bpb": 0.5590396599244891, "train_bytes": 28166.2375, "train_loss_nats_per_token": 1.581100357806571 }, { "epoch": 0.004872139264175292, "grad_norm": 0.1318359375, "learning_rate": 0.0015805050977100103, "loss": 1.577392864227295, "step": 73740, "train_bpb": 0.5554805053013988, "train_bytes": 28459.70625, "train_loss_nats_per_token": 1.5781767405761897 }, { "epoch": 0.005003818703747597, "grad_norm": 0.259765625, "learning_rate": 0.0015798823442671188, "loss": 1.574063205718994, "step": 73760, "train_bpb": 0.5560501011778881, "train_bytes": 28187.55625, "train_loss_nats_per_token": 1.5748193122840677 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.1279296875, "learning_rate": 0.0015792595770158177, "loss": 1.5776287078857423, "step": 73780, "train_bpb": 0.5572755264243989, "train_bytes": 28293.2125, "train_loss_nats_per_token": 1.5783474085513425 }, { "epoch": 0.005267177582892207, "grad_norm": 0.138671875, "learning_rate": 0.0015786367960637585, "loss": 1.5812874794006349, "step": 73800, "train_bpb": 0.5589773562947692, "train_bytes": 28181.3375, "train_loss_nats_per_token": 1.5825798271273435 }, { "epoch": 0.005398857022464512, "grad_norm": 0.15625, "learning_rate": 0.001578014001518595, "loss": 1.5758980751037597, "step": 73820, "train_bpb": 0.5566159121216685, "train_bytes": 28359.1, "train_loss_nats_per_token": 1.5771097580336526 }, { "epoch": 0.005530536462036818, "grad_norm": 0.1640625, "learning_rate": 0.001577391193487982, "loss": 1.5748394012451172, "step": 73840, "train_bpb": 0.5590531266898022, "train_bytes": 28237.58125, "train_loss_nats_per_token": 1.5757755903859092 }, { "epoch": 0.005662215901609122, "grad_norm": 0.142578125, "learning_rate": 0.0015767683720795788, "loss": 1.578141212463379, "step": 73860, "train_bpb": 0.5576983832665993, "train_bytes": 28213.18125, "train_loss_nats_per_token": 1.5795581900185156 }, { "epoch": 0.005793895341181428, "grad_norm": 0.1572265625, "learning_rate": 0.0015761455374010453, "loss": 1.577780532836914, "step": 73880, "train_bpb": 0.5572845071833317, "train_bytes": 28584.25625, "train_loss_nats_per_token": 1.5789871952338266 }, { "epoch": 0.005925574780753733, "grad_norm": 0.12890625, "learning_rate": 0.001575522689560045, "loss": 1.575568389892578, "step": 73900, "train_bpb": 0.5577287429732204, "train_bytes": 28175.975, "train_loss_nats_per_token": 1.576483619401618 }, { "epoch": 0.006057254220326038, "grad_norm": 0.138671875, "learning_rate": 0.0015748998286642414, "loss": 1.5794594764709473, "step": 73920, "train_bpb": 0.5589077219881732, "train_bytes": 28259.15625, "train_loss_nats_per_token": 1.5811746949313352 }, { "epoch": 0.006188933659898343, "grad_norm": 0.1865234375, "learning_rate": 0.001574276954821304, "loss": 1.5750330924987792, "step": 73940, "train_bpb": 0.5582957920628506, "train_bytes": 27874.025, "train_loss_nats_per_token": 1.5757405908570157 }, { "epoch": 0.006320613099470649, "grad_norm": 0.181640625, "learning_rate": 0.0015736540681389006, "loss": 1.5678739547729492, "step": 73960, "train_bpb": 0.5538328218213514, "train_bytes": 28444.2125, "train_loss_nats_per_token": 1.5684359043791458 }, { "epoch": 0.006452292539042954, "grad_norm": 0.16796875, "learning_rate": 0.0015730311687247036, "loss": 1.5716561317443847, "step": 73980, "train_bpb": 0.5539903875349109, "train_bytes": 28337.29375, "train_loss_nats_per_token": 1.5727397192388193 }, { "epoch": 0.006583971978615259, "grad_norm": 0.1357421875, "learning_rate": 0.0015724082566863874, "loss": 1.5730464935302735, "step": 74000, "train_bpb": 0.5573164511853499, "train_bytes": 28177.28125, "train_loss_nats_per_token": 1.5740670786065045 }, { "epoch": 0.006583971978615259, "eval_loss": 1.477449655532837, "eval_runtime": 72.8312, "eval_samples_per_second": 13.73, "eval_steps_per_second": 13.73, "step": 74000, "train_bpb": 0.5216204844879215, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.4853731271552733 }, { "epoch": 0.006715651418187564, "grad_norm": 0.1865234375, "learning_rate": 0.001571785332131627, "loss": 1.5744507789611817, "step": 74020, "train_bpb": 0.5562337363829174, "train_bytes": 28422.79375, "train_loss_nats_per_token": 1.5752765578112857 }, { "epoch": 0.00684733085775987, "grad_norm": 0.1103515625, "learning_rate": 0.001571162395168102, "loss": 1.5810954093933105, "step": 74040, "train_bpb": 0.5601201036906998, "train_bytes": 28004.325, "train_loss_nats_per_token": 1.581635515245129 }, { "epoch": 0.006979010297332174, "grad_norm": 0.13671875, "learning_rate": 0.0015705394459034924, "loss": 1.5800589561462401, "step": 74060, "train_bpb": 0.5545474606637948, "train_bytes": 28615.3625, "train_loss_nats_per_token": 1.5811100876353916 }, { "epoch": 0.00711068973690448, "grad_norm": 0.16015625, "learning_rate": 0.0015699164844454807, "loss": 1.5750792503356934, "step": 74080, "train_bpb": 0.5548507584496235, "train_bytes": 28428.59375, "train_loss_nats_per_token": 1.5754810974875266 }, { "epoch": 0.007242369176476785, "grad_norm": 0.205078125, "learning_rate": 0.0015692935109017517, "loss": 1.5759275436401368, "step": 74100, "train_bpb": 0.5568817643952387, "train_bytes": 28326.43125, "train_loss_nats_per_token": 1.577001501838015 }, { "epoch": 0.0073740486160490904, "grad_norm": 0.1748046875, "learning_rate": 0.0015686705253799913, "loss": 1.5777870178222657, "step": 74120, "train_bpb": 0.5564597636998894, "train_bytes": 28456.5625, "train_loss_nats_per_token": 1.578544914712156 }, { "epoch": 0.007505728055621395, "grad_norm": 0.154296875, "learning_rate": 0.00156804752798789, "loss": 1.5707834243774415, "step": 74140, "train_bpb": 0.558129414990807, "train_bytes": 28408.86875, "train_loss_nats_per_token": 1.5720996041278887 }, { "epoch": 0.007637407495193701, "grad_norm": 0.1552734375, "learning_rate": 0.0015674245188331383, "loss": 1.5707672119140625, "step": 74160, "train_bpb": 0.5536355399140668, "train_bytes": 28396.2875, "train_loss_nats_per_token": 1.5708198483404252 }, { "epoch": 0.007769086934766006, "grad_norm": 0.203125, "learning_rate": 0.0015668014980234279, "loss": 1.5606981277465821, "step": 74180, "train_bpb": 0.5538207382261222, "train_bytes": 28162.23125, "train_loss_nats_per_token": 1.5626381454580394 }, { "epoch": 0.00790076637433831, "grad_norm": 0.1591796875, "learning_rate": 0.0015661784656664554, "loss": 1.5741880416870118, "step": 74200, "train_bpb": 0.5568233925866455, "train_bytes": 28427.55625, "train_loss_nats_per_token": 1.575533333207125 }, { "epoch": 0.008032445813910615, "grad_norm": 0.1484375, "learning_rate": 0.0015655554218699165, "loss": 1.5715331077575683, "step": 74220, "train_bpb": 0.5518584027902971, "train_bytes": 28702.625, "train_loss_nats_per_token": 1.5724491921795825 }, { "epoch": 0.008164125253482922, "grad_norm": 0.17578125, "learning_rate": 0.0015649323667415109, "loss": 1.5791749000549316, "step": 74240, "train_bpb": 0.5561635112104989, "train_bytes": 28152.2875, "train_loss_nats_per_token": 1.5803901635186557 }, { "epoch": 0.008295804693055226, "grad_norm": 0.154296875, "learning_rate": 0.0015643093003889393, "loss": 1.5692078590393066, "step": 74260, "train_bpb": 0.5550204172363222, "train_bytes": 28206.275, "train_loss_nats_per_token": 1.5705053779508573 }, { "epoch": 0.008427484132627531, "grad_norm": 0.14453125, "learning_rate": 0.0015636862229199042, "loss": 1.5650456428527832, "step": 74280, "train_bpb": 0.5558786511490051, "train_bytes": 28130.45, "train_loss_nats_per_token": 1.566335065893594 }, { "epoch": 0.008559163572199836, "grad_norm": 0.19921875, "learning_rate": 0.001563063134442111, "loss": 1.5672988891601562, "step": 74300, "train_bpb": 0.5535600973571339, "train_bytes": 28267.69375, "train_loss_nats_per_token": 1.5681328532755165 }, { "epoch": 0.008690843011772142, "grad_norm": 0.1611328125, "learning_rate": 0.0015624400350632657, "loss": 1.550775146484375, "step": 74320, "train_bpb": 0.5504566075595797, "train_bytes": 28072.7875, "train_loss_nats_per_token": 1.5518442172369467 }, { "epoch": 0.008822522451344447, "grad_norm": 0.1669921875, "learning_rate": 0.001561816924891077, "loss": 1.564197063446045, "step": 74340, "train_bpb": 0.5535591836597159, "train_bytes": 28460.01875, "train_loss_nats_per_token": 1.5648949188094827 }, { "epoch": 0.008954201890916752, "grad_norm": 0.138671875, "learning_rate": 0.0015611938040332562, "loss": 1.5656596183776856, "step": 74360, "train_bpb": 0.5517018916543559, "train_bytes": 28280.7, "train_loss_nats_per_token": 1.5670316800905286 }, { "epoch": 0.009085881330489057, "grad_norm": 0.130859375, "learning_rate": 0.0015605706725975142, "loss": 1.583462619781494, "step": 74380, "train_bpb": 0.5585583146972305, "train_bytes": 28369.1, "train_loss_nats_per_token": 1.5838620104965704 }, { "epoch": 0.009217560770061363, "grad_norm": 0.1669921875, "learning_rate": 0.0015599475306915661, "loss": 1.5689911842346191, "step": 74400, "train_bpb": 0.5544911468375859, "train_bytes": 28438.5375, "train_loss_nats_per_token": 1.5696149603656444 }, { "epoch": 0.009349240209633668, "grad_norm": 0.130859375, "learning_rate": 0.0015593243784231268, "loss": 1.5685805320739745, "step": 74420, "train_bpb": 0.5558463096787437, "train_bytes": 28460.14375, "train_loss_nats_per_token": 1.5702001797375915 }, { "epoch": 0.009480919649205973, "grad_norm": 0.150390625, "learning_rate": 0.0015587012158999154, "loss": 1.5755216598510742, "step": 74440, "train_bpb": 0.5573074686488436, "train_bytes": 28030.23125, "train_loss_nats_per_token": 1.5761250191474656 }, { "epoch": 0.009612599088778278, "grad_norm": 0.12353515625, "learning_rate": 0.0015580780432296497, "loss": 1.564333152770996, "step": 74460, "train_bpb": 0.5522971700002125, "train_bytes": 28535.60625, "train_loss_nats_per_token": 1.5654459611801201 }, { "epoch": 0.009744278528350584, "grad_norm": 0.158203125, "learning_rate": 0.0015574548605200526, "loss": 1.5712315559387207, "step": 74480, "train_bpb": 0.5541527227911907, "train_bytes": 28487.375, "train_loss_nats_per_token": 1.5723090218140265 }, { "epoch": 0.009875957967922889, "grad_norm": 0.1640625, "learning_rate": 0.001556831667878846, "loss": 1.5666656494140625, "step": 74500, "train_bpb": 0.552333623789545, "train_bytes": 28114.975, "train_loss_nats_per_token": 1.5681377378127197 }, { "epoch": 0.010007637407495194, "grad_norm": 0.1591796875, "learning_rate": 0.0015562084654137545, "loss": 1.5616464614868164, "step": 74520, "train_bpb": 0.5491347139391304, "train_bytes": 28501.2875, "train_loss_nats_per_token": 1.5624735777659593 }, { "epoch": 0.010139316847067498, "grad_norm": 0.1298828125, "learning_rate": 0.001555585253232505, "loss": 1.563005256652832, "step": 74540, "train_bpb": 0.5507192316876633, "train_bytes": 28419.2625, "train_loss_nats_per_token": 1.5641013887552873 }, { "epoch": 0.010270996286639805, "grad_norm": 0.15234375, "learning_rate": 0.001554962031442825, "loss": 1.5604401588439942, "step": 74560, "train_bpb": 0.553492905750133, "train_bytes": 27985.25625, "train_loss_nats_per_token": 1.5620963813636548 }, { "epoch": 0.01040267572621211, "grad_norm": 0.1669921875, "learning_rate": 0.001554338800152445, "loss": 1.5647913932800293, "step": 74580, "train_bpb": 0.5552533402198039, "train_bytes": 28187.1875, "train_loss_nats_per_token": 1.5657178170419053 }, { "epoch": 0.010534355165784414, "grad_norm": 0.15625, "learning_rate": 0.0015537155594690958, "loss": 1.559356689453125, "step": 74600, "train_bpb": 0.5542230174088485, "train_bytes": 28174.44375, "train_loss_nats_per_token": 1.560816269017442 }, { "epoch": 0.01066603460535672, "grad_norm": 0.2001953125, "learning_rate": 0.0015530923095005103, "loss": 1.5635217666625976, "step": 74620, "train_bpb": 0.5513200419319951, "train_bytes": 28165.88125, "train_loss_nats_per_token": 1.564306806548203 }, { "epoch": 0.010797714044929024, "grad_norm": 0.173828125, "learning_rate": 0.0015524690503544232, "loss": 1.556387996673584, "step": 74640, "train_bpb": 0.5541877481896906, "train_bytes": 27961.0625, "train_loss_nats_per_token": 1.5566525287539923 }, { "epoch": 0.01092939348450133, "grad_norm": 0.1337890625, "learning_rate": 0.0015518457821385705, "loss": 1.554613208770752, "step": 74660, "train_bpb": 0.5539171639574071, "train_bytes": 27954.55, "train_loss_nats_per_token": 1.5560995479062423 }, { "epoch": 0.011061072924073635, "grad_norm": 0.134765625, "learning_rate": 0.0015512225049606908, "loss": 1.5648545265197753, "step": 74680, "train_bpb": 0.5516196598853382, "train_bytes": 28380.60625, "train_loss_nats_per_token": 1.565662018057668 }, { "epoch": 0.01119275236364594, "grad_norm": 0.1435546875, "learning_rate": 0.0015505992189285224, "loss": 1.5547642707824707, "step": 74700, "train_bpb": 0.547843172992642, "train_bytes": 28643.375, "train_loss_nats_per_token": 1.55568603761146 }, { "epoch": 0.011324431803218245, "grad_norm": 0.1513671875, "learning_rate": 0.001549975924149806, "loss": 1.5564884185791015, "step": 74720, "train_bpb": 0.551440398182455, "train_bytes": 28300.6, "train_loss_nats_per_token": 1.5573200329976051 }, { "epoch": 0.011456111242790551, "grad_norm": 0.2099609375, "learning_rate": 0.0015493526207322847, "loss": 1.5572917938232422, "step": 74740, "train_bpb": 0.5535949708036367, "train_bytes": 28045.7, "train_loss_nats_per_token": 1.5587709814865358 }, { "epoch": 0.011587790682362856, "grad_norm": 0.240234375, "learning_rate": 0.0015487293087837017, "loss": 1.548112392425537, "step": 74760, "train_bpb": 0.5460967292252629, "train_bytes": 28214.48125, "train_loss_nats_per_token": 1.5489828675298742 }, { "epoch": 0.01171947012193516, "grad_norm": 0.1650390625, "learning_rate": 0.0015481059884118028, "loss": 1.5530743598937988, "step": 74780, "train_bpb": 0.5500423190124716, "train_bytes": 28652.88125, "train_loss_nats_per_token": 1.5540916540493122 }, { "epoch": 0.011851149561507466, "grad_norm": 0.1669921875, "learning_rate": 0.0015474826597243348, "loss": 1.5470980644226073, "step": 74800, "train_bpb": 0.5504128433171094, "train_bytes": 27859.84375, "train_loss_nats_per_token": 1.5494532344387058 }, { "epoch": 0.011982829001079772, "grad_norm": 0.185546875, "learning_rate": 0.001546859322829045, "loss": 1.5589518547058105, "step": 74820, "train_bpb": 0.5495562192071525, "train_bytes": 28587.7375, "train_loss_nats_per_token": 1.5600657296533875 }, { "epoch": 0.012114508440652077, "grad_norm": 0.1416015625, "learning_rate": 0.0015462359778336838, "loss": 1.5604893684387207, "step": 74840, "train_bpb": 0.5519293226883446, "train_bytes": 28482.24375, "train_loss_nats_per_token": 1.561810759025593 }, { "epoch": 0.012246187880224382, "grad_norm": 0.1484375, "learning_rate": 0.0015456126248460016, "loss": 1.5527351379394532, "step": 74860, "train_bpb": 0.5517418499045682, "train_bytes": 28330.6625, "train_loss_nats_per_token": 1.5544932656505142 }, { "epoch": 0.012377867319796686, "grad_norm": 0.166015625, "learning_rate": 0.001544989263973752, "loss": 1.5497429847717286, "step": 74880, "train_bpb": 0.5490881968079216, "train_bytes": 28133.80625, "train_loss_nats_per_token": 1.5498228063949484 }, { "epoch": 0.012509546759368993, "grad_norm": 0.146484375, "learning_rate": 0.0015443658953246872, "loss": 1.5383386611938477, "step": 74900, "train_bpb": 0.5454707644723968, "train_bytes": 28137.425, "train_loss_nats_per_token": 1.5395291745952453 }, { "epoch": 0.012641226198941298, "grad_norm": 0.138671875, "learning_rate": 0.0015437425190065635, "loss": 1.5592269897460938, "step": 74920, "train_bpb": 0.552839411903882, "train_bytes": 27962.1875, "train_loss_nats_per_token": 1.5601732361608407 }, { "epoch": 0.012772905638513602, "grad_norm": 0.154296875, "learning_rate": 0.0015431191351271368, "loss": 1.5533102989196776, "step": 74940, "train_bpb": 0.5489894472640253, "train_bytes": 28338.075, "train_loss_nats_per_token": 1.5549823753708083 }, { "epoch": 0.012904585078085907, "grad_norm": 0.162109375, "learning_rate": 0.0015424957437941646, "loss": 1.5557566642761231, "step": 74960, "train_bpb": 0.552691386546919, "train_bytes": 28247.18125, "train_loss_nats_per_token": 1.5576320572330036 }, { "epoch": 0.013036264517658214, "grad_norm": 0.1806640625, "learning_rate": 0.0015418723451154064, "loss": 1.582798385620117, "step": 74980, "train_bpb": 0.5601996444626259, "train_bytes": 28274.875, "train_loss_nats_per_token": 1.583609778763813 }, { "epoch": 0.013167943957230518, "grad_norm": 0.1796875, "learning_rate": 0.0015412489391986221, "loss": 1.600499153137207, "step": 75000, "train_bpb": 0.566216897723917, "train_bytes": 28534.6125, "train_loss_nats_per_token": 1.6013850815541846 }, { "epoch": 0.013167943957230518, "eval_loss": 1.4872945547103882, "eval_runtime": 78.4431, "eval_samples_per_second": 12.748, "eval_steps_per_second": 12.748, "step": 75000, "train_bpb": 0.5250395812876856, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.4951093906965687 }, { "epoch": 0.013299623396802823, "grad_norm": 0.18359375, "learning_rate": 0.0015406255261515734, "loss": 1.6694866180419923, "step": 75020, "train_bpb": 0.5936911148401095, "train_bytes": 28019.63125, "train_loss_nats_per_token": 1.6701546453360645 }, { "epoch": 0.013431302836375128, "grad_norm": 0.1435546875, "learning_rate": 0.0015400021060820233, "loss": 1.666590690612793, "step": 75040, "train_bpb": 0.5880051324875046, "train_bytes": 28213.3625, "train_loss_nats_per_token": 1.6671732623202768 }, { "epoch": 0.013562982275947433, "grad_norm": 0.1416015625, "learning_rate": 0.0015393786790977354, "loss": 1.6741701126098634, "step": 75060, "train_bpb": 0.5913699015546002, "train_bytes": 28467.725, "train_loss_nats_per_token": 1.674363846972515 }, { "epoch": 0.01369466171551974, "grad_norm": 0.12890625, "learning_rate": 0.001538755245306475, "loss": 1.6748661041259765, "step": 75080, "train_bpb": 0.5903863345791336, "train_bytes": 28419.8875, "train_loss_nats_per_token": 1.6750129988804967 }, { "epoch": 0.013826341155092044, "grad_norm": 0.2099609375, "learning_rate": 0.0015381318048160084, "loss": 1.6750896453857422, "step": 75100, "train_bpb": 0.5921392993364749, "train_bytes": 28361.78125, "train_loss_nats_per_token": 1.675275814823876 }, { "epoch": 0.013958020594664349, "grad_norm": 0.1455078125, "learning_rate": 0.0015375083577341033, "loss": 1.6645305633544922, "step": 75120, "train_bpb": 0.592222150410819, "train_bytes": 28004.26875, "train_loss_nats_per_token": 1.665352992610043 }, { "epoch": 0.014089700034236654, "grad_norm": 0.1474609375, "learning_rate": 0.0015368849041685285, "loss": 1.6599254608154297, "step": 75140, "train_bpb": 0.5884418656117291, "train_bytes": 28285.0375, "train_loss_nats_per_token": 1.6600235836164843 }, { "epoch": 0.01422137947380896, "grad_norm": 0.150390625, "learning_rate": 0.0015362614442270526, "loss": 1.6665157318115233, "step": 75160, "train_bpb": 0.5931283970519643, "train_bytes": 27960.9125, "train_loss_nats_per_token": 1.6675763940399584 }, { "epoch": 0.014353058913381265, "grad_norm": 0.1728515625, "learning_rate": 0.0015356379780174483, "loss": 1.6711013793945313, "step": 75180, "train_bpb": 0.58903316282213, "train_bytes": 28560.14375, "train_loss_nats_per_token": 1.6716448993158968 }, { "epoch": 0.01448473835295357, "grad_norm": 0.1533203125, "learning_rate": 0.0015350145056474862, "loss": 1.6568284988403321, "step": 75200, "train_bpb": 0.5850687071267588, "train_bytes": 28466.29375, "train_loss_nats_per_token": 1.6574252590793224 }, { "epoch": 0.014616417792525874, "grad_norm": 0.13671875, "learning_rate": 0.00153439102722494, "loss": 1.6590381622314454, "step": 75220, "train_bpb": 0.5855794122071784, "train_bytes": 28553.6375, "train_loss_nats_per_token": 1.6591056390485943 }, { "epoch": 0.014748097232098181, "grad_norm": 0.1484375, "learning_rate": 0.0015337675428575837, "loss": 1.6632837295532226, "step": 75240, "train_bpb": 0.5901135330217718, "train_bytes": 28192.5625, "train_loss_nats_per_token": 1.6640000851409558 }, { "epoch": 0.014879776671670486, "grad_norm": 0.1630859375, "learning_rate": 0.0015331440526531917, "loss": 1.6791948318481444, "step": 75260, "train_bpb": 0.5942014790362995, "train_bytes": 28330.4125, "train_loss_nats_per_token": 1.6799095762340643 }, { "epoch": 0.01501145611124279, "grad_norm": 0.1689453125, "learning_rate": 0.001532520556719541, "loss": 1.6906164169311524, "step": 75280, "train_bpb": 0.5955115756148572, "train_bytes": 28626.925, "train_loss_nats_per_token": 1.69123779729944 }, { "epoch": 0.015143135550815095, "grad_norm": 0.13671875, "learning_rate": 0.0015318970551644081, "loss": 1.6911014556884765, "step": 75300, "train_bpb": 0.5963748137841562, "train_bytes": 28595.59375, "train_loss_nats_per_token": 1.6909372035653074 }, { "epoch": 0.015274814990387402, "grad_norm": 0.1572265625, "learning_rate": 0.0015312735480955716, "loss": 1.6717477798461915, "step": 75320, "train_bpb": 0.5910263667468326, "train_bytes": 28284.09375, "train_loss_nats_per_token": 1.6726712377243502 }, { "epoch": 0.015406494429959706, "grad_norm": 0.1279296875, "learning_rate": 0.0015306500356208103, "loss": 1.687736701965332, "step": 75340, "train_bpb": 0.5977369187849892, "train_bytes": 28533.725, "train_loss_nats_per_token": 1.6886036822422326 }, { "epoch": 0.015538173869532011, "grad_norm": 0.146484375, "learning_rate": 0.0015300265178479035, "loss": 1.7004064559936523, "step": 75360, "train_bpb": 0.6013878829997871, "train_bytes": 28277.59375, "train_loss_nats_per_token": 1.701292763668272 }, { "epoch": 0.015669853309104316, "grad_norm": 0.1318359375, "learning_rate": 0.0015294029948846335, "loss": 1.7031085968017579, "step": 75380, "train_bpb": 0.6021286389709439, "train_bytes": 28377.0875, "train_loss_nats_per_token": 1.7032068490667047 }, { "epoch": 0.01580153274867662, "grad_norm": 0.1884765625, "learning_rate": 0.0015287794668387802, "loss": 1.7029790878295898, "step": 75400, "train_bpb": 0.6044001604829812, "train_bytes": 28251.58125, "train_loss_nats_per_token": 1.7034242497426253 }, { "epoch": 0.015933212188248926, "grad_norm": 0.166015625, "learning_rate": 0.001528155933818128, "loss": 1.7043779373168946, "step": 75420, "train_bpb": 0.6022033207761586, "train_bytes": 28294.3125, "train_loss_nats_per_token": 1.7047206167027291 }, { "epoch": 0.01606489162782123, "grad_norm": 0.16796875, "learning_rate": 0.0015275323959304593, "loss": 1.691830825805664, "step": 75440, "train_bpb": 0.5994582229829127, "train_bytes": 28286.3125, "train_loss_nats_per_token": 1.6916399785509781 }, { "epoch": 0.01619657106739354, "grad_norm": 0.13671875, "learning_rate": 0.001526908853283559, "loss": 1.6931020736694335, "step": 75460, "train_bpb": 0.6042914693703644, "train_bytes": 27965.14375, "train_loss_nats_per_token": 1.6933169015669216 }, { "epoch": 0.016328250506965843, "grad_norm": 0.1904296875, "learning_rate": 0.0015262853059852123, "loss": 1.708877944946289, "step": 75480, "train_bpb": 0.6057177533924603, "train_bytes": 28345.29375, "train_loss_nats_per_token": 1.7088100856803183 }, { "epoch": 0.016459929946538148, "grad_norm": 0.1923828125, "learning_rate": 0.0015256617541432047, "loss": 1.7118890762329102, "step": 75500, "train_bpb": 0.6064259208066819, "train_bytes": 28070.04375, "train_loss_nats_per_token": 1.7125856423455508 }, { "epoch": 0.016591609386110453, "grad_norm": 0.177734375, "learning_rate": 0.0015250381978653231, "loss": 1.7042327880859376, "step": 75520, "train_bpb": 0.6052275814712949, "train_bytes": 28040.85, "train_loss_nats_per_token": 1.7044581734450361 }, { "epoch": 0.016723288825682758, "grad_norm": 0.1494140625, "learning_rate": 0.0015244146372593553, "loss": 1.7097885131835937, "step": 75540, "train_bpb": 0.6044691424627125, "train_bytes": 28057.16875, "train_loss_nats_per_token": 1.7105967815116407 }, { "epoch": 0.016854968265255062, "grad_norm": 0.12451171875, "learning_rate": 0.0015237910724330893, "loss": 1.6979747772216798, "step": 75560, "train_bpb": 0.5951063259464286, "train_bytes": 28672.4875, "train_loss_nats_per_token": 1.6979226664288585 }, { "epoch": 0.016986647704827367, "grad_norm": 0.1455078125, "learning_rate": 0.0015231675034943144, "loss": 1.7128398895263672, "step": 75580, "train_bpb": 0.6087631455216459, "train_bytes": 28486.975, "train_loss_nats_per_token": 1.7132155110925296 }, { "epoch": 0.017118327144399672, "grad_norm": 0.1337890625, "learning_rate": 0.00152254393055082, "loss": 1.7018428802490235, "step": 75600, "train_bpb": 0.60059664884993, "train_bytes": 28361.4125, "train_loss_nats_per_token": 1.7018523541248698 }, { "epoch": 0.01725000658397198, "grad_norm": 0.15625, "learning_rate": 0.0015219203537103966, "loss": 1.702927017211914, "step": 75620, "train_bpb": 0.6030319071485528, "train_bytes": 28105.75625, "train_loss_nats_per_token": 1.7021239630162288 }, { "epoch": 0.017381686023544285, "grad_norm": 0.1640625, "learning_rate": 0.0015212967730808356, "loss": 1.7152244567871093, "step": 75640, "train_bpb": 0.6060655772898017, "train_bytes": 28345.79375, "train_loss_nats_per_token": 1.7162734969393318 }, { "epoch": 0.01751336546311659, "grad_norm": 0.1962890625, "learning_rate": 0.0015206731887699282, "loss": 1.7024728775024414, "step": 75660, "train_bpb": 0.604469538498991, "train_bytes": 28318.4625, "train_loss_nats_per_token": 1.7033641905837682 }, { "epoch": 0.017645044902688894, "grad_norm": 0.1845703125, "learning_rate": 0.0015200496008854671, "loss": 1.7107509613037108, "step": 75680, "train_bpb": 0.6044947831573421, "train_bytes": 28171.9125, "train_loss_nats_per_token": 1.7106922329130037 }, { "epoch": 0.0177767243422612, "grad_norm": 0.166015625, "learning_rate": 0.0015194260095352451, "loss": 1.7138227462768554, "step": 75700, "train_bpb": 0.6048259843771318, "train_bytes": 28319.45, "train_loss_nats_per_token": 1.7151234985579158 }, { "epoch": 0.017908403781833504, "grad_norm": 0.15625, "learning_rate": 0.0015188024148270563, "loss": 1.6984050750732422, "step": 75720, "train_bpb": 0.6020490670473531, "train_bytes": 28181.2375, "train_loss_nats_per_token": 1.6984627924919506 }, { "epoch": 0.01804008322140581, "grad_norm": 0.15625, "learning_rate": 0.001518178816868694, "loss": 1.6987266540527344, "step": 75740, "train_bpb": 0.6011490862655772, "train_bytes": 28430.31875, "train_loss_nats_per_token": 1.6991571998687154 }, { "epoch": 0.018171762660978114, "grad_norm": 0.1552734375, "learning_rate": 0.0015175552157679537, "loss": 1.7149166107177733, "step": 75760, "train_bpb": 0.6063636309813015, "train_bytes": 28360.55, "train_loss_nats_per_token": 1.7155465493116786 }, { "epoch": 0.018303442100550422, "grad_norm": 0.197265625, "learning_rate": 0.0015169316116326306, "loss": 1.718169593811035, "step": 75780, "train_bpb": 0.607957001696512, "train_bytes": 28463.06875, "train_loss_nats_per_token": 1.7182029599618127 }, { "epoch": 0.018435121540122727, "grad_norm": 0.17578125, "learning_rate": 0.00151630800457052, "loss": 1.6933250427246094, "step": 75800, "train_bpb": 0.5975748036884775, "train_bytes": 28409.0375, "train_loss_nats_per_token": 1.6936963251073203 }, { "epoch": 0.01856680097969503, "grad_norm": 0.1494140625, "learning_rate": 0.0015156843946894185, "loss": 1.7072767257690429, "step": 75820, "train_bpb": 0.6066805984846251, "train_bytes": 28236.1, "train_loss_nats_per_token": 1.7077546119102716 }, { "epoch": 0.018698480419267336, "grad_norm": 0.142578125, "learning_rate": 0.0015150607820971229, "loss": 1.692247200012207, "step": 75840, "train_bpb": 0.599306765283134, "train_bytes": 28129.8875, "train_loss_nats_per_token": 1.6927076522534195 }, { "epoch": 0.01883015985883964, "grad_norm": 0.1484375, "learning_rate": 0.0015144371669014304, "loss": 1.695254135131836, "step": 75860, "train_bpb": 0.5997416398897005, "train_bytes": 28418.3625, "train_loss_nats_per_token": 1.6960154043287017 }, { "epoch": 0.018961839298411946, "grad_norm": 0.1591796875, "learning_rate": 0.0015138135492101387, "loss": 1.7058107376098632, "step": 75880, "train_bpb": 0.6005025190168088, "train_bytes": 28419.38125, "train_loss_nats_per_token": 1.706491738621123 }, { "epoch": 0.01909351873798425, "grad_norm": 0.1904296875, "learning_rate": 0.001513189929131046, "loss": 1.7144611358642579, "step": 75900, "train_bpb": 0.6064927030863174, "train_bytes": 28340.45625, "train_loss_nats_per_token": 1.7159107102912807 }, { "epoch": 0.019225198177556555, "grad_norm": 0.1484375, "learning_rate": 0.0015125663067719515, "loss": 1.6979066848754882, "step": 75920, "train_bpb": 0.6009853942990332, "train_bytes": 28240.90625, "train_loss_nats_per_token": 1.6987896518455297 }, { "epoch": 0.01935687761712886, "grad_norm": 0.1259765625, "learning_rate": 0.0015119426822406525, "loss": 1.704678726196289, "step": 75940, "train_bpb": 0.6049253089826331, "train_bytes": 27910.1375, "train_loss_nats_per_token": 1.705151348222937 }, { "epoch": 0.019488557056701168, "grad_norm": 0.197265625, "learning_rate": 0.0015113190556449501, "loss": 1.7023496627807617, "step": 75960, "train_bpb": 0.6032852221612258, "train_bytes": 28313.36875, "train_loss_nats_per_token": 1.7024109922745034 }, { "epoch": 0.019620236496273473, "grad_norm": 0.1533203125, "learning_rate": 0.0015106954270926428, "loss": 1.6948934555053712, "step": 75980, "train_bpb": 0.601727889094302, "train_bytes": 28334.13125, "train_loss_nats_per_token": 1.6959967820560802 }, { "epoch": 0.019751915935845778, "grad_norm": 0.1337890625, "learning_rate": 0.0015100717966915313, "loss": 1.7132913589477539, "step": 76000, "train_bpb": 0.6038593236248951, "train_bytes": 28313.45, "train_loss_nats_per_token": 1.713738578344792 }, { "epoch": 0.019751915935845778, "eval_loss": 1.5080417394638062, "eval_runtime": 71.7507, "eval_samples_per_second": 13.937, "eval_steps_per_second": 13.937, "step": 76000, "train_bpb": 0.5321993268228425, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5154975731615112 }, { "epoch": 0.019883595375418082, "grad_norm": 0.138671875, "learning_rate": 0.0015094481645494154, "loss": 1.6969793319702149, "step": 76020, "train_bpb": 0.603046786263758, "train_bytes": 27906.95625, "train_loss_nats_per_token": 1.6979816521980684 }, { "epoch": 0.020015274814990387, "grad_norm": 0.2294921875, "learning_rate": 0.001508824530774096, "loss": 1.7078634262084962, "step": 76040, "train_bpb": 0.6024889352446463, "train_bytes": 28578.19375, "train_loss_nats_per_token": 1.7083025990454697 }, { "epoch": 0.020146954254562692, "grad_norm": 0.1416015625, "learning_rate": 0.0015082008954733746, "loss": 1.7014331817626953, "step": 76060, "train_bpb": 0.6011586835466952, "train_bytes": 28307.8125, "train_loss_nats_per_token": 1.7013138099816194 }, { "epoch": 0.020278633694134997, "grad_norm": 0.1611328125, "learning_rate": 0.001507577258755051, "loss": 1.7017406463623046, "step": 76080, "train_bpb": 0.6018633562298512, "train_bytes": 28365.075, "train_loss_nats_per_token": 1.7029281163021974 }, { "epoch": 0.0204103131337073, "grad_norm": 0.1474609375, "learning_rate": 0.0015069536207269283, "loss": 1.7114662170410155, "step": 76100, "train_bpb": 0.6052986791601987, "train_bytes": 28283.0125, "train_loss_nats_per_token": 1.7123831095997148 }, { "epoch": 0.02054199257327961, "grad_norm": 0.1748046875, "learning_rate": 0.0015063299814968068, "loss": 1.70513916015625, "step": 76120, "train_bpb": 0.6003230204112259, "train_bytes": 28613.2875, "train_loss_nats_per_token": 1.7056187617092546 }, { "epoch": 0.020673672012851915, "grad_norm": 0.12353515625, "learning_rate": 0.0015057063411724888, "loss": 1.7076837539672851, "step": 76140, "train_bpb": 0.5996614326687789, "train_bytes": 28399.09375, "train_loss_nats_per_token": 1.7078480075584241 }, { "epoch": 0.02080535145242422, "grad_norm": 0.171875, "learning_rate": 0.0015050826998617769, "loss": 1.707564353942871, "step": 76160, "train_bpb": 0.6058346362073295, "train_bytes": 28225.19375, "train_loss_nats_per_token": 1.707915610483521 }, { "epoch": 0.020937030891996524, "grad_norm": 0.1875, "learning_rate": 0.0015044590576724724, "loss": 1.6868814468383788, "step": 76180, "train_bpb": 0.5944696423250446, "train_bytes": 28177.275, "train_loss_nats_per_token": 1.6873169072264074 }, { "epoch": 0.02106871033156883, "grad_norm": 0.1435546875, "learning_rate": 0.001503835414712378, "loss": 1.6960824966430663, "step": 76200, "train_bpb": 0.6017489464908091, "train_bytes": 28179.2375, "train_loss_nats_per_token": 1.6969227678269305 }, { "epoch": 0.021200389771141134, "grad_norm": 0.1572265625, "learning_rate": 0.001503211771089297, "loss": 1.7111825942993164, "step": 76220, "train_bpb": 0.6027817408981636, "train_bytes": 28621.54375, "train_loss_nats_per_token": 1.7120960535556735 }, { "epoch": 0.02133206921071344, "grad_norm": 0.1591796875, "learning_rate": 0.0015025881269110307, "loss": 1.703521156311035, "step": 76240, "train_bpb": 0.6064442054479366, "train_bytes": 28181.93125, "train_loss_nats_per_token": 1.7039459937563208 }, { "epoch": 0.021463748650285743, "grad_norm": 0.1689453125, "learning_rate": 0.0015019644822853828, "loss": 1.7058683395385743, "step": 76260, "train_bpb": 0.6033447203160621, "train_bytes": 28241.4625, "train_loss_nats_per_token": 1.7069218842867002 }, { "epoch": 0.021595428089858048, "grad_norm": 0.1201171875, "learning_rate": 0.0015013408373201558, "loss": 1.6992862701416016, "step": 76280, "train_bpb": 0.6041885052306615, "train_bytes": 28046.81875, "train_loss_nats_per_token": 1.700145063337374 }, { "epoch": 0.021727107529430356, "grad_norm": 0.13671875, "learning_rate": 0.0015007171921231524, "loss": 1.6927122116088866, "step": 76300, "train_bpb": 0.6002775318447614, "train_bytes": 28167.90625, "train_loss_nats_per_token": 1.6934435266482388 }, { "epoch": 0.02185878696900266, "grad_norm": 0.12255859375, "learning_rate": 0.0015000935468021759, "loss": 1.6938488006591796, "step": 76320, "train_bpb": 0.5978432167611251, "train_bytes": 28509.86875, "train_loss_nats_per_token": 1.6942816022843437 }, { "epoch": 0.021990466408574966, "grad_norm": 0.1298828125, "learning_rate": 0.001499469901465029, "loss": 1.694013786315918, "step": 76340, "train_bpb": 0.5989289934774129, "train_bytes": 28565.675, "train_loss_nats_per_token": 1.6948568669030661 }, { "epoch": 0.02212214584814727, "grad_norm": 0.130859375, "learning_rate": 0.0014988462562195142, "loss": 1.695703887939453, "step": 76360, "train_bpb": 0.6013924768536293, "train_bytes": 28269.78125, "train_loss_nats_per_token": 1.6965109318778528 }, { "epoch": 0.022253825287719575, "grad_norm": 0.13671875, "learning_rate": 0.0014982226111734348, "loss": 1.6897285461425782, "step": 76380, "train_bpb": 0.6006277051632831, "train_bytes": 28019.5375, "train_loss_nats_per_token": 1.6899565481967427 }, { "epoch": 0.02238550472729188, "grad_norm": 0.1953125, "learning_rate": 0.0014975989664345938, "loss": 1.701338005065918, "step": 76400, "train_bpb": 0.6000487688670104, "train_bytes": 28329.075, "train_loss_nats_per_token": 1.701400658759598 }, { "epoch": 0.022517184166864185, "grad_norm": 0.1630859375, "learning_rate": 0.0014969753221107942, "loss": 1.699007797241211, "step": 76420, "train_bpb": 0.600005988020775, "train_bytes": 28404.525, "train_loss_nats_per_token": 1.6995310297742416 }, { "epoch": 0.02264886360643649, "grad_norm": 0.212890625, "learning_rate": 0.0014963516783098381, "loss": 1.6897279739379882, "step": 76440, "train_bpb": 0.5986116690979536, "train_bytes": 28267.13125, "train_loss_nats_per_token": 1.6902935626798061 }, { "epoch": 0.022780543046008798, "grad_norm": 0.134765625, "learning_rate": 0.0014957280351395282, "loss": 1.6985048294067382, "step": 76460, "train_bpb": 0.6025473653495584, "train_bytes": 28456.475, "train_loss_nats_per_token": 1.6983640879527147 }, { "epoch": 0.022912222485581103, "grad_norm": 0.1640625, "learning_rate": 0.0014951043927076682, "loss": 1.6952274322509766, "step": 76480, "train_bpb": 0.5985667215462843, "train_bytes": 28521.25625, "train_loss_nats_per_token": 1.695795116854074 }, { "epoch": 0.023043901925153407, "grad_norm": 0.16796875, "learning_rate": 0.001494480751122059, "loss": 1.6972753524780273, "step": 76500, "train_bpb": 0.6027132231234856, "train_bytes": 28195.4125, "train_loss_nats_per_token": 1.697168834703184 }, { "epoch": 0.023175581364725712, "grad_norm": 0.166015625, "learning_rate": 0.0014938571104905034, "loss": 1.7038139343261718, "step": 76520, "train_bpb": 0.5993823301019862, "train_bytes": 28735.65, "train_loss_nats_per_token": 1.7041712015236423 }, { "epoch": 0.023307260804298017, "grad_norm": 0.1416015625, "learning_rate": 0.0014932334709208041, "loss": 1.687881088256836, "step": 76540, "train_bpb": 0.5967475750835051, "train_bytes": 28234.64375, "train_loss_nats_per_token": 1.688416094886661 }, { "epoch": 0.02343894024387032, "grad_norm": 0.130859375, "learning_rate": 0.0014926098325207622, "loss": 1.6829231262207032, "step": 76560, "train_bpb": 0.5953380132879753, "train_bytes": 28311.45625, "train_loss_nats_per_token": 1.6848042125123142 }, { "epoch": 0.023570619683442626, "grad_norm": 0.220703125, "learning_rate": 0.0014919861953981797, "loss": 1.7024517059326172, "step": 76580, "train_bpb": 0.6003695675074735, "train_bytes": 28166.75, "train_loss_nats_per_token": 1.7035286055730423 }, { "epoch": 0.02370229912301493, "grad_norm": 0.2314453125, "learning_rate": 0.0014913625596608582, "loss": 1.7010129928588866, "step": 76600, "train_bpb": 0.6030245977850857, "train_bytes": 28167.475, "train_loss_nats_per_token": 1.7015805870194645 }, { "epoch": 0.023833978562587236, "grad_norm": 0.166015625, "learning_rate": 0.0014907389254165994, "loss": 1.6888458251953125, "step": 76620, "train_bpb": 0.5974920294802359, "train_bytes": 28391.7, "train_loss_nats_per_token": 1.6890990401349033 }, { "epoch": 0.023965658002159544, "grad_norm": 0.150390625, "learning_rate": 0.0014901152927732034, "loss": 1.6858325958251954, "step": 76640, "train_bpb": 0.6015469294089723, "train_bytes": 28031.7375, "train_loss_nats_per_token": 1.686665619826691 }, { "epoch": 0.02409733744173185, "grad_norm": 0.1298828125, "learning_rate": 0.0014894916618384713, "loss": 1.6937061309814454, "step": 76660, "train_bpb": 0.6009291010575714, "train_bytes": 28282.9875, "train_loss_nats_per_token": 1.6942106085208106 }, { "epoch": 0.024229016881304154, "grad_norm": 0.15625, "learning_rate": 0.0014888680327202041, "loss": 1.6931449890136718, "step": 76680, "train_bpb": 0.5994684965717954, "train_bytes": 28329.9875, "train_loss_nats_per_token": 1.6945050347245652 }, { "epoch": 0.02436069632087646, "grad_norm": 0.1552734375, "learning_rate": 0.0014882444055262008, "loss": 1.7016210556030273, "step": 76700, "train_bpb": 0.6010492343219654, "train_bytes": 28483.0625, "train_loss_nats_per_token": 1.7014394882406123 }, { "epoch": 0.024492375760448763, "grad_norm": 0.1875, "learning_rate": 0.001487620780364262, "loss": 1.6894468307495116, "step": 76720, "train_bpb": 0.597506149352703, "train_bytes": 28494.625, "train_loss_nats_per_token": 1.689495317619701 }, { "epoch": 0.024624055200021068, "grad_norm": 0.158203125, "learning_rate": 0.001486997157342187, "loss": 1.6953405380249023, "step": 76740, "train_bpb": 0.6010081086611093, "train_bytes": 28004.44375, "train_loss_nats_per_token": 1.6958803256788928 }, { "epoch": 0.024755734639593373, "grad_norm": 0.1298828125, "learning_rate": 0.0014863735365677753, "loss": 1.685969352722168, "step": 76760, "train_bpb": 0.5943258609033579, "train_bytes": 28198.34375, "train_loss_nats_per_token": 1.686332136067605 }, { "epoch": 0.024887414079165678, "grad_norm": 0.15234375, "learning_rate": 0.0014857499181488243, "loss": 1.7040328979492188, "step": 76780, "train_bpb": 0.6045764965386173, "train_bytes": 28420.71875, "train_loss_nats_per_token": 1.7051891853574401 }, { "epoch": 0.025019093518737986, "grad_norm": 0.1142578125, "learning_rate": 0.0014851263021931332, "loss": 1.688633346557617, "step": 76800, "train_bpb": 0.599263508461098, "train_bytes": 28343.025, "train_loss_nats_per_token": 1.6887206379014172 }, { "epoch": 0.02515077295831029, "grad_norm": 0.1787109375, "learning_rate": 0.0014845026888085002, "loss": 1.6986400604248046, "step": 76820, "train_bpb": 0.602270836737079, "train_bytes": 28216.96875, "train_loss_nats_per_token": 1.698561151857933 }, { "epoch": 0.025282452397882595, "grad_norm": 0.1376953125, "learning_rate": 0.0014838790781027216, "loss": 1.7058876037597657, "step": 76840, "train_bpb": 0.599873220509381, "train_bytes": 28400.78125, "train_loss_nats_per_token": 1.705694650990934 }, { "epoch": 0.0254141318374549, "grad_norm": 0.2099609375, "learning_rate": 0.001483255470183595, "loss": 1.6930063247680665, "step": 76860, "train_bpb": 0.5986707514746962, "train_bytes": 28069.69375, "train_loss_nats_per_token": 1.6935856245126923 }, { "epoch": 0.025545811277027205, "grad_norm": 0.16015625, "learning_rate": 0.0014826318651589175, "loss": 1.6859165191650392, "step": 76880, "train_bpb": 0.5991865874925129, "train_bytes": 28176.3375, "train_loss_nats_per_token": 1.6862288900887301 }, { "epoch": 0.02567749071659951, "grad_norm": 0.171875, "learning_rate": 0.0014820082631364835, "loss": 1.6769113540649414, "step": 76900, "train_bpb": 0.5974146385792365, "train_bytes": 27760.1125, "train_loss_nats_per_token": 1.677211947510569 }, { "epoch": 0.025809170156171814, "grad_norm": 0.162109375, "learning_rate": 0.0014813846642240892, "loss": 1.6901996612548829, "step": 76920, "train_bpb": 0.5969182299132318, "train_bytes": 28455.39375, "train_loss_nats_per_token": 1.6910561112724796 }, { "epoch": 0.02594084959574412, "grad_norm": 0.1376953125, "learning_rate": 0.0014807610685295296, "loss": 1.6899160385131835, "step": 76940, "train_bpb": 0.5998198678080428, "train_bytes": 28247.0, "train_loss_nats_per_token": 1.6906319844775828 }, { "epoch": 0.026072529035316427, "grad_norm": 0.1396484375, "learning_rate": 0.0014801374761605997, "loss": 1.6828527450561523, "step": 76960, "train_bpb": 0.59325101460721, "train_bytes": 28517.69375, "train_loss_nats_per_token": 1.6836876162492407 }, { "epoch": 0.026204208474888732, "grad_norm": 0.12890625, "learning_rate": 0.001479513887225092, "loss": 1.691169548034668, "step": 76980, "train_bpb": 0.5953969454844418, "train_bytes": 28591.95625, "train_loss_nats_per_token": 1.6914461597957424 }, { "epoch": 0.026335887914461037, "grad_norm": 0.14453125, "learning_rate": 0.0014788903018308002, "loss": 1.6903409957885742, "step": 77000, "train_bpb": 0.59709138937149, "train_bytes": 28143.375, "train_loss_nats_per_token": 1.6906540234814413 }, { "epoch": 0.026335887914461037, "eval_loss": 1.51248037815094, "eval_runtime": 71.1393, "eval_samples_per_second": 14.057, "eval_steps_per_second": 14.057, "step": 77000, "train_bpb": 0.5337678942835314, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5199642458162959 }, { "epoch": 0.02646756735403334, "grad_norm": 0.13671875, "learning_rate": 0.0014782667200855175, "loss": 1.6918773651123047, "step": 77020, "train_bpb": 0.5969269471336434, "train_bytes": 28403.1, "train_loss_nats_per_token": 1.6925799611735444 }, { "epoch": 0.026599246793605646, "grad_norm": 0.150390625, "learning_rate": 0.0014776431420970343, "loss": 1.6920934677124024, "step": 77040, "train_bpb": 0.602227170446893, "train_bytes": 28026.1, "train_loss_nats_per_token": 1.691271895935188 }, { "epoch": 0.02673092623317795, "grad_norm": 0.12255859375, "learning_rate": 0.0014770195679731431, "loss": 1.6898454666137694, "step": 77060, "train_bpb": 0.594916740891826, "train_bytes": 28733.775, "train_loss_nats_per_token": 1.6912103140901307 }, { "epoch": 0.026862605672750256, "grad_norm": 0.193359375, "learning_rate": 0.001476395997821635, "loss": 1.692764663696289, "step": 77080, "train_bpb": 0.5964629028088805, "train_bytes": 28643.93125, "train_loss_nats_per_token": 1.6932403539554353 }, { "epoch": 0.02699428511232256, "grad_norm": 0.146484375, "learning_rate": 0.001475772431750298, "loss": 1.6947647094726563, "step": 77100, "train_bpb": 0.5969771780686601, "train_bytes": 28202.75, "train_loss_nats_per_token": 1.6951931822282718 }, { "epoch": 0.027125964551894866, "grad_norm": 0.181640625, "learning_rate": 0.0014751488698669228, "loss": 1.6806833267211914, "step": 77120, "train_bpb": 0.5987335104686332, "train_bytes": 27918.7875, "train_loss_nats_per_token": 1.6811130555721177 }, { "epoch": 0.027257643991467174, "grad_norm": 0.1552734375, "learning_rate": 0.0014745253122792977, "loss": 1.6892797470092773, "step": 77140, "train_bpb": 0.5985712950018136, "train_bytes": 28268.19375, "train_loss_nats_per_token": 1.6895430585771885 }, { "epoch": 0.02738932343103948, "grad_norm": 0.2236328125, "learning_rate": 0.0014739017590952106, "loss": 1.685490608215332, "step": 77160, "train_bpb": 0.5967531324251619, "train_bytes": 28393.88125, "train_loss_nats_per_token": 1.6863646106619994 }, { "epoch": 0.027521002870611783, "grad_norm": 0.1689453125, "learning_rate": 0.0014732782104224477, "loss": 1.691900634765625, "step": 77180, "train_bpb": 0.5977716460492143, "train_bytes": 28279.18125, "train_loss_nats_per_token": 1.6918519679812967 }, { "epoch": 0.027652682310184088, "grad_norm": 0.169921875, "learning_rate": 0.0014726546663687958, "loss": 1.69884033203125, "step": 77200, "train_bpb": 0.6016956155652149, "train_bytes": 28174.59375, "train_loss_nats_per_token": 1.6998718718976658 }, { "epoch": 0.027784361749756393, "grad_norm": 0.146484375, "learning_rate": 0.0014720311270420407, "loss": 1.691525650024414, "step": 77220, "train_bpb": 0.5994898584360675, "train_bytes": 28352.7375, "train_loss_nats_per_token": 1.6922919850739226 }, { "epoch": 0.027916041189328698, "grad_norm": 0.12890625, "learning_rate": 0.001471407592549966, "loss": 1.6833175659179687, "step": 77240, "train_bpb": 0.5978083375540929, "train_bytes": 28181.25, "train_loss_nats_per_token": 1.6849166186445852 }, { "epoch": 0.028047720628901002, "grad_norm": 0.1455078125, "learning_rate": 0.0014707840630003557, "loss": 1.679113006591797, "step": 77260, "train_bpb": 0.596312566703751, "train_bytes": 27955.61875, "train_loss_nats_per_token": 1.679523216492946 }, { "epoch": 0.028179400068473307, "grad_norm": 0.1806640625, "learning_rate": 0.0014701605385009934, "loss": 1.6906530380249023, "step": 77280, "train_bpb": 0.5991973185333034, "train_bytes": 28185.325, "train_loss_nats_per_token": 1.691745482999527 }, { "epoch": 0.028311079508045615, "grad_norm": 0.181640625, "learning_rate": 0.0014695370191596612, "loss": 1.6934459686279297, "step": 77300, "train_bpb": 0.6008071537344541, "train_bytes": 28278.7, "train_loss_nats_per_token": 1.6940196070853306 }, { "epoch": 0.02844275894761792, "grad_norm": 0.1826171875, "learning_rate": 0.0014689135050841389, "loss": 1.6931989669799805, "step": 77320, "train_bpb": 0.59961183843431, "train_bytes": 28344.6625, "train_loss_nats_per_token": 1.6943354801483617 }, { "epoch": 0.028574438387190225, "grad_norm": 0.1962890625, "learning_rate": 0.0014682899963822077, "loss": 1.6785816192626952, "step": 77340, "train_bpb": 0.5924778042681349, "train_bytes": 28327.41875, "train_loss_nats_per_token": 1.6789808384063152 }, { "epoch": 0.02870611782676253, "grad_norm": 0.1640625, "learning_rate": 0.0014676664931616477, "loss": 1.6945840835571289, "step": 77360, "train_bpb": 0.6015608732821868, "train_bytes": 27954.8625, "train_loss_nats_per_token": 1.6948520912494889 }, { "epoch": 0.028837797266334834, "grad_norm": 0.197265625, "learning_rate": 0.0014670429955302355, "loss": 1.683724594116211, "step": 77380, "train_bpb": 0.5963643121994728, "train_bytes": 28370.25625, "train_loss_nats_per_token": 1.6835085919808104 }, { "epoch": 0.02896947670590714, "grad_norm": 0.14453125, "learning_rate": 0.0014664195035957494, "loss": 1.6853879928588866, "step": 77400, "train_bpb": 0.593411469075158, "train_bytes": 28482.95625, "train_loss_nats_per_token": 1.6852748989143622 }, { "epoch": 0.029101156145479444, "grad_norm": 0.1982421875, "learning_rate": 0.0014657960174659663, "loss": 1.691403579711914, "step": 77420, "train_bpb": 0.5987068159370338, "train_bytes": 28486.66875, "train_loss_nats_per_token": 1.6915533810848895 }, { "epoch": 0.02923283558505175, "grad_norm": 0.1640625, "learning_rate": 0.0014651725372486603, "loss": 1.6831640243530273, "step": 77440, "train_bpb": 0.5962832966674679, "train_bytes": 28204.40625, "train_loss_nats_per_token": 1.6835326475216337 }, { "epoch": 0.029364515024624054, "grad_norm": 0.1337890625, "learning_rate": 0.0014645490630516068, "loss": 1.6792739868164062, "step": 77460, "train_bpb": 0.592545261477014, "train_bytes": 28596.05, "train_loss_nats_per_token": 1.6805971827450379 }, { "epoch": 0.029496194464196362, "grad_norm": 0.14453125, "learning_rate": 0.0014639255949825786, "loss": 1.6840660095214843, "step": 77480, "train_bpb": 0.5949640898983676, "train_bytes": 28495.625, "train_loss_nats_per_token": 1.684912807275938 }, { "epoch": 0.029627873903768667, "grad_norm": 0.1337890625, "learning_rate": 0.001463302133149349, "loss": 1.679654312133789, "step": 77500, "train_bpb": 0.5929298385163867, "train_bytes": 28394.25625, "train_loss_nats_per_token": 1.6802236083828608 }, { "epoch": 0.02975955334334097, "grad_norm": 0.2099609375, "learning_rate": 0.0014626786776596877, "loss": 1.7027454376220703, "step": 77520, "train_bpb": 0.6005715877279713, "train_bytes": 28416.7125, "train_loss_nats_per_token": 1.7025641553006783 }, { "epoch": 0.029891232782913276, "grad_norm": 0.15234375, "learning_rate": 0.0014620552286213658, "loss": 1.6862194061279296, "step": 77540, "train_bpb": 0.5948630822944234, "train_bytes": 28368.18125, "train_loss_nats_per_token": 1.687123591694218 }, { "epoch": 0.03002291222248558, "grad_norm": 0.1298828125, "learning_rate": 0.0014614317861421525, "loss": 1.6683383941650392, "step": 77560, "train_bpb": 0.5962533482907953, "train_bytes": 27902.56875, "train_loss_nats_per_token": 1.6687791433679884 }, { "epoch": 0.030154591662057886, "grad_norm": 0.1552734375, "learning_rate": 0.0014608083503298147, "loss": 1.6918952941894532, "step": 77580, "train_bpb": 0.5988071859253181, "train_bytes": 28368.00625, "train_loss_nats_per_token": 1.6919374399187426 }, { "epoch": 0.03028627110163019, "grad_norm": 0.15234375, "learning_rate": 0.0014601849212921192, "loss": 1.6885618209838866, "step": 77600, "train_bpb": 0.5978885111574731, "train_bytes": 28379.2, "train_loss_nats_per_token": 1.688828294292195 }, { "epoch": 0.030417950541202495, "grad_norm": 0.2294921875, "learning_rate": 0.0014595614991368322, "loss": 1.6782169342041016, "step": 77620, "train_bpb": 0.5959217850555917, "train_bytes": 28203.61875, "train_loss_nats_per_token": 1.6793893148442758 }, { "epoch": 0.030549629980774803, "grad_norm": 0.1513671875, "learning_rate": 0.0014589380839717184, "loss": 1.683704948425293, "step": 77640, "train_bpb": 0.5963821721393374, "train_bytes": 28400.9, "train_loss_nats_per_token": 1.683804813832797 }, { "epoch": 0.030681309420347108, "grad_norm": 0.1796875, "learning_rate": 0.0014583146759045399, "loss": 1.7062732696533203, "step": 77660, "train_bpb": 0.6014909888968999, "train_bytes": 28510.99375, "train_loss_nats_per_token": 1.7067502824897496 }, { "epoch": 0.030812988859919413, "grad_norm": 0.1337890625, "learning_rate": 0.0014576912750430585, "loss": 1.6911861419677734, "step": 77680, "train_bpb": 0.599013845968416, "train_bytes": 28170.53125, "train_loss_nats_per_token": 1.6927983939774807 }, { "epoch": 0.030944668299491718, "grad_norm": 0.185546875, "learning_rate": 0.0014570678814950363, "loss": 1.687225914001465, "step": 77700, "train_bpb": 0.6006623103689149, "train_bytes": 28122.7125, "train_loss_nats_per_token": 1.6883400830287894 }, { "epoch": 0.031076347739064022, "grad_norm": 0.17578125, "learning_rate": 0.0014564444953682311, "loss": 1.7040239334106446, "step": 77720, "train_bpb": 0.6039691563589502, "train_bytes": 28167.48125, "train_loss_nats_per_token": 1.7052752188551266 }, { "epoch": 0.031208027178636327, "grad_norm": 0.13671875, "learning_rate": 0.0014558211167704017, "loss": 1.7024145126342773, "step": 77740, "train_bpb": 0.6018275158866624, "train_bytes": 28251.36875, "train_loss_nats_per_token": 1.7034683672715791 }, { "epoch": 0.03133970661820863, "grad_norm": 0.1318359375, "learning_rate": 0.0014551977458093055, "loss": 1.6955022811889648, "step": 77760, "train_bpb": 0.603302269278734, "train_bytes": 28154.29375, "train_loss_nats_per_token": 1.6962553302875338 }, { "epoch": 0.03147138605778094, "grad_norm": 0.150390625, "learning_rate": 0.0014545743825926968, "loss": 1.6970550537109375, "step": 77780, "train_bpb": 0.6017438206020793, "train_bytes": 28263.69375, "train_loss_nats_per_token": 1.6972357920636003 }, { "epoch": 0.03160306549735324, "grad_norm": 0.13671875, "learning_rate": 0.0014539510272283303, "loss": 1.6896766662597655, "step": 77800, "train_bpb": 0.600171190726336, "train_bytes": 28173.50625, "train_loss_nats_per_token": 1.6905443512615685 }, { "epoch": 0.031734744936925546, "grad_norm": 0.1630859375, "learning_rate": 0.0014533276798239588, "loss": 1.7068660736083985, "step": 77820, "train_bpb": 0.6034759652236055, "train_bytes": 28311.60625, "train_loss_nats_per_token": 1.7073819642579178 }, { "epoch": 0.03186642437649785, "grad_norm": 0.13671875, "learning_rate": 0.0014527043404873343, "loss": 1.7061237335205077, "step": 77840, "train_bpb": 0.601691573614774, "train_bytes": 28340.2625, "train_loss_nats_per_token": 1.7069527646979812 }, { "epoch": 0.031998103816070156, "grad_norm": 0.1318359375, "learning_rate": 0.0014520810093262059, "loss": 1.7061399459838866, "step": 77860, "train_bpb": 0.6054697855871355, "train_bytes": 27968.66875, "train_loss_nats_per_token": 1.7071916872715525 }, { "epoch": 0.03212978325564246, "grad_norm": 0.130859375, "learning_rate": 0.0014514576864483224, "loss": 1.700141716003418, "step": 77880, "train_bpb": 0.5995806171725112, "train_bytes": 28546.975, "train_loss_nats_per_token": 1.7006791548335223 }, { "epoch": 0.03226146269521477, "grad_norm": 0.1376953125, "learning_rate": 0.001450834371961432, "loss": 1.7026840209960938, "step": 77900, "train_bpb": 0.6033344477637109, "train_bytes": 28131.76875, "train_loss_nats_per_token": 1.7039646284567986 }, { "epoch": 0.03239314213478708, "grad_norm": 0.140625, "learning_rate": 0.0014502110659732786, "loss": 1.7021163940429687, "step": 77920, "train_bpb": 0.5984496442235387, "train_bytes": 28750.575, "train_loss_nats_per_token": 1.7033711652540575 }, { "epoch": 0.03252482157435938, "grad_norm": 0.134765625, "learning_rate": 0.0014495877685916077, "loss": 1.692356491088867, "step": 77940, "train_bpb": 0.6011504301208217, "train_bytes": 27995.56875, "train_loss_nats_per_token": 1.693797662562753 }, { "epoch": 0.03265650101393169, "grad_norm": 0.1787109375, "learning_rate": 0.0014489644799241621, "loss": 1.6980403900146483, "step": 77960, "train_bpb": 0.6025329400949668, "train_bytes": 28168.9, "train_loss_nats_per_token": 1.6981578596447306 }, { "epoch": 0.03278818045350399, "grad_norm": 0.1533203125, "learning_rate": 0.0014483412000786831, "loss": 1.6935537338256836, "step": 77980, "train_bpb": 0.6005694716352866, "train_bytes": 28161.8875, "train_loss_nats_per_token": 1.6940244227912655 }, { "epoch": 0.032919859893076296, "grad_norm": 0.1357421875, "learning_rate": 0.0014477179291629094, "loss": 1.6868318557739257, "step": 78000, "train_bpb": 0.5977817426818478, "train_bytes": 28171.975, "train_loss_nats_per_token": 1.6878839533069174 }, { "epoch": 0.032919859893076296, "eval_loss": 1.5172574520111084, "eval_runtime": 72.0711, "eval_samples_per_second": 13.875, "eval_steps_per_second": 13.875, "step": 78000, "train_bpb": 0.535474876140263, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5248250690660194 }, { "epoch": 0.0330515393326486, "grad_norm": 0.2216796875, "learning_rate": 0.0014470946672845804, "loss": 1.6856176376342773, "step": 78020, "train_bpb": 0.5988610935527097, "train_bytes": 27965.175, "train_loss_nats_per_token": 1.686802723581412 }, { "epoch": 0.033183218772220906, "grad_norm": 0.1650390625, "learning_rate": 0.0014464714145514326, "loss": 1.7101030349731445, "step": 78040, "train_bpb": 0.6058144263479525, "train_bytes": 28266.275, "train_loss_nats_per_token": 1.7105539038504625 }, { "epoch": 0.03331489821179321, "grad_norm": 0.14453125, "learning_rate": 0.0014458481710712002, "loss": 1.7071727752685546, "step": 78060, "train_bpb": 0.6050159864840899, "train_bytes": 28128.2125, "train_loss_nats_per_token": 1.7075656181239889 }, { "epoch": 0.033446577651365515, "grad_norm": 0.1630859375, "learning_rate": 0.0014452249369516171, "loss": 1.6910585403442382, "step": 78080, "train_bpb": 0.5981742809375922, "train_bytes": 28209.85, "train_loss_nats_per_token": 1.6918975736437993 }, { "epoch": 0.03357825709093782, "grad_norm": 0.1787109375, "learning_rate": 0.0014446017123004161, "loss": 1.7041206359863281, "step": 78100, "train_bpb": 0.6012439818354264, "train_bytes": 28403.2875, "train_loss_nats_per_token": 1.7048474672476013 }, { "epoch": 0.033709936530510125, "grad_norm": 0.1298828125, "learning_rate": 0.0014439784972253259, "loss": 1.7038389205932618, "step": 78120, "train_bpb": 0.6049490912061616, "train_bytes": 28202.49375, "train_loss_nats_per_token": 1.7063326803230812 }, { "epoch": 0.03384161597008243, "grad_norm": 0.1220703125, "learning_rate": 0.0014433552918340755, "loss": 1.693025779724121, "step": 78140, "train_bpb": 0.6014002334891742, "train_bytes": 27979.78125, "train_loss_nats_per_token": 1.6933369390119533 }, { "epoch": 0.033973295409654734, "grad_norm": 0.1767578125, "learning_rate": 0.0014427320962343922, "loss": 1.7185195922851562, "step": 78160, "train_bpb": 0.605387625644956, "train_bytes": 28907.7125, "train_loss_nats_per_token": 1.71902666050344 }, { "epoch": 0.03410497484922704, "grad_norm": 0.181640625, "learning_rate": 0.0014421089105340014, "loss": 1.6958621978759765, "step": 78180, "train_bpb": 0.6002582429075636, "train_bytes": 28333.625, "train_loss_nats_per_token": 1.6958689330688002 }, { "epoch": 0.034236654288799344, "grad_norm": 0.1875, "learning_rate": 0.0014414857348406254, "loss": 1.6897453308105468, "step": 78200, "train_bpb": 0.600323375865349, "train_bytes": 28196.00625, "train_loss_nats_per_token": 1.6911343180357603 }, { "epoch": 0.03436833372837165, "grad_norm": 0.1357421875, "learning_rate": 0.0014408625692619867, "loss": 1.6891374588012695, "step": 78220, "train_bpb": 0.5985801659290828, "train_bytes": 28437.3625, "train_loss_nats_per_token": 1.689170184865208 }, { "epoch": 0.03450001316794396, "grad_norm": 0.130859375, "learning_rate": 0.001440239413905806, "loss": 1.6971651077270509, "step": 78240, "train_bpb": 0.6016299962354478, "train_bytes": 28671.41875, "train_loss_nats_per_token": 1.6980697222545529 }, { "epoch": 0.034631692607516265, "grad_norm": 0.123046875, "learning_rate": 0.0014396162688798, "loss": 1.6942461013793946, "step": 78260, "train_bpb": 0.5985557052176707, "train_bytes": 28493.51875, "train_loss_nats_per_token": 1.6948327587595866 }, { "epoch": 0.03476337204708857, "grad_norm": 0.203125, "learning_rate": 0.001438993134291686, "loss": 1.6875732421875, "step": 78280, "train_bpb": 0.6008734786388091, "train_bytes": 28406.45, "train_loss_nats_per_token": 1.6891374196621216 }, { "epoch": 0.034895051486660875, "grad_norm": 0.1318359375, "learning_rate": 0.001438370010249179, "loss": 1.7109525680541993, "step": 78300, "train_bpb": 0.6052625488535335, "train_bytes": 28298.01875, "train_loss_nats_per_token": 1.7121146532832467 }, { "epoch": 0.03502673092623318, "grad_norm": 0.1552734375, "learning_rate": 0.0014377468968599912, "loss": 1.6958467483520507, "step": 78320, "train_bpb": 0.6014291858248885, "train_bytes": 28227.19375, "train_loss_nats_per_token": 1.6969841193272464 }, { "epoch": 0.035158410365805484, "grad_norm": 0.1962890625, "learning_rate": 0.001437123794231833, "loss": 1.6785184860229492, "step": 78340, "train_bpb": 0.5925629994352949, "train_bytes": 28502.6625, "train_loss_nats_per_token": 1.679704532842838 }, { "epoch": 0.03529008980537779, "grad_norm": 0.1328125, "learning_rate": 0.0014365007024724147, "loss": 1.6898578643798827, "step": 78360, "train_bpb": 0.5996792046569441, "train_bytes": 28267.01875, "train_loss_nats_per_token": 1.6902745541524382 }, { "epoch": 0.035421769244950094, "grad_norm": 0.1494140625, "learning_rate": 0.0014358776216894435, "loss": 1.6955854415893554, "step": 78380, "train_bpb": 0.6007074275759285, "train_bytes": 28253.175, "train_loss_nats_per_token": 1.6969436082531852 }, { "epoch": 0.0355534486845224, "grad_norm": 0.1416015625, "learning_rate": 0.001435254551990624, "loss": 1.69860782623291, "step": 78400, "train_bpb": 0.6021478192334722, "train_bytes": 28216.025, "train_loss_nats_per_token": 1.699796544854165 }, { "epoch": 0.0356851281240947, "grad_norm": 0.1845703125, "learning_rate": 0.0014346314934836595, "loss": 1.6828365325927734, "step": 78420, "train_bpb": 0.5950792401683539, "train_bytes": 28388.0, "train_loss_nats_per_token": 1.6832542923455405 }, { "epoch": 0.03581680756366701, "grad_norm": 0.12890625, "learning_rate": 0.0014340084462762528, "loss": 1.6947235107421874, "step": 78440, "train_bpb": 0.6000495165906139, "train_bytes": 28025.8875, "train_loss_nats_per_token": 1.6955410310567858 }, { "epoch": 0.03594848700323931, "grad_norm": 0.1484375, "learning_rate": 0.0014333854104761018, "loss": 1.6782625198364258, "step": 78460, "train_bpb": 0.5943095820941537, "train_bytes": 28320.71875, "train_loss_nats_per_token": 1.679294255000767 }, { "epoch": 0.03608016644281162, "grad_norm": 0.1474609375, "learning_rate": 0.0014327623861909045, "loss": 1.6753961563110351, "step": 78480, "train_bpb": 0.5931270507872257, "train_bytes": 28319.85625, "train_loss_nats_per_token": 1.6759470597849533 }, { "epoch": 0.03621184588238392, "grad_norm": 0.1328125, "learning_rate": 0.0014321393735283574, "loss": 1.688319778442383, "step": 78500, "train_bpb": 0.5995629659704901, "train_bytes": 28268.66875, "train_loss_nats_per_token": 1.6882650267604775 }, { "epoch": 0.03634352532195623, "grad_norm": 0.189453125, "learning_rate": 0.0014315163725961532, "loss": 1.6961109161376953, "step": 78520, "train_bpb": 0.6002832021543034, "train_bytes": 28384.16875, "train_loss_nats_per_token": 1.6957462829809045 }, { "epoch": 0.03647520476152853, "grad_norm": 0.1474609375, "learning_rate": 0.0014308933835019833, "loss": 1.6948938369750977, "step": 78540, "train_bpb": 0.5984438757815312, "train_bytes": 28397.75625, "train_loss_nats_per_token": 1.6953502408159915 }, { "epoch": 0.036606884201100844, "grad_norm": 0.1494140625, "learning_rate": 0.0014302704063535376, "loss": 1.703961181640625, "step": 78560, "train_bpb": 0.6026772704560748, "train_bytes": 28283.0375, "train_loss_nats_per_token": 1.7054070432307815 }, { "epoch": 0.03673856364067315, "grad_norm": 0.12451171875, "learning_rate": 0.0014296474412585042, "loss": 1.6986579895019531, "step": 78580, "train_bpb": 0.5999889219257692, "train_bytes": 28176.50625, "train_loss_nats_per_token": 1.6989717722798094 }, { "epoch": 0.03687024308024545, "grad_norm": 0.1494140625, "learning_rate": 0.0014290244883245669, "loss": 1.689097785949707, "step": 78600, "train_bpb": 0.5982379403071769, "train_bytes": 28291.0375, "train_loss_nats_per_token": 1.6899332219598138 }, { "epoch": 0.03700192251981776, "grad_norm": 0.140625, "learning_rate": 0.0014284015476594095, "loss": 1.6824327468872071, "step": 78620, "train_bpb": 0.5932796998954706, "train_bytes": 28488.99375, "train_loss_nats_per_token": 1.6847080102463428 }, { "epoch": 0.03713360195939006, "grad_norm": 0.140625, "learning_rate": 0.001427778619370714, "loss": 1.6862525939941406, "step": 78640, "train_bpb": 0.598078122277963, "train_bytes": 28235.90625, "train_loss_nats_per_token": 1.6862987486288787 }, { "epoch": 0.03726528139896237, "grad_norm": 0.173828125, "learning_rate": 0.0014271557035661585, "loss": 1.6908929824829102, "step": 78660, "train_bpb": 0.5990516797825473, "train_bytes": 28219.9625, "train_loss_nats_per_token": 1.6916770362515654 }, { "epoch": 0.03739696083853467, "grad_norm": 0.16015625, "learning_rate": 0.0014265328003534195, "loss": 1.6864519119262695, "step": 78680, "train_bpb": 0.598779172492953, "train_bytes": 28103.58125, "train_loss_nats_per_token": 1.6873703836559726 }, { "epoch": 0.03752864027810698, "grad_norm": 0.138671875, "learning_rate": 0.0014259099098401723, "loss": 1.69726619720459, "step": 78700, "train_bpb": 0.6001386549163167, "train_bytes": 28327.1625, "train_loss_nats_per_token": 1.6983433561419947 }, { "epoch": 0.03766031971767928, "grad_norm": 0.16796875, "learning_rate": 0.0014252870321340898, "loss": 1.6958938598632813, "step": 78720, "train_bpb": 0.6000656524414464, "train_bytes": 28063.4625, "train_loss_nats_per_token": 1.6967076976508757 }, { "epoch": 0.037791999157251586, "grad_norm": 0.1455078125, "learning_rate": 0.001424664167342841, "loss": 1.6883604049682617, "step": 78740, "train_bpb": 0.5988855147615418, "train_bytes": 28258.11875, "train_loss_nats_per_token": 1.6889166554582342 }, { "epoch": 0.03792367859682389, "grad_norm": 0.146484375, "learning_rate": 0.0014240413155740944, "loss": 1.693502426147461, "step": 78760, "train_bpb": 0.6027024938771277, "train_bytes": 28074.58125, "train_loss_nats_per_token": 1.694437035277016 }, { "epoch": 0.038055358036396196, "grad_norm": 0.1650390625, "learning_rate": 0.0014234184769355163, "loss": 1.675084686279297, "step": 78780, "train_bpb": 0.5921536451531454, "train_bytes": 28628.925, "train_loss_nats_per_token": 1.676072054057062 }, { "epoch": 0.0381870374759685, "grad_norm": 0.142578125, "learning_rate": 0.0014227956515347698, "loss": 1.6889854431152345, "step": 78800, "train_bpb": 0.5971854423583867, "train_bytes": 28092.85625, "train_loss_nats_per_token": 1.6903938326645067 }, { "epoch": 0.038318716915540806, "grad_norm": 0.138671875, "learning_rate": 0.0014221728394795156, "loss": 1.6822931289672851, "step": 78820, "train_bpb": 0.5940728775505026, "train_bytes": 28380.8625, "train_loss_nats_per_token": 1.683557923669422 }, { "epoch": 0.03845039635511311, "grad_norm": 0.123046875, "learning_rate": 0.0014215500408774134, "loss": 1.6838510513305665, "step": 78840, "train_bpb": 0.5960664582500314, "train_bytes": 28369.74375, "train_loss_nats_per_token": 1.6856742803669826 }, { "epoch": 0.038582075794685415, "grad_norm": 0.1611328125, "learning_rate": 0.0014209272558361192, "loss": 1.670450782775879, "step": 78860, "train_bpb": 0.5936884667207082, "train_bytes": 28001.68125, "train_loss_nats_per_token": 1.6706047697813284 }, { "epoch": 0.03871375523425772, "grad_norm": 0.177734375, "learning_rate": 0.001420304484463287, "loss": 1.6749605178833007, "step": 78880, "train_bpb": 0.593547471472502, "train_bytes": 28326.70625, "train_loss_nats_per_token": 1.6754831282665164 }, { "epoch": 0.03884543467383003, "grad_norm": 0.189453125, "learning_rate": 0.0014196817268665692, "loss": 1.6767765045166017, "step": 78900, "train_bpb": 0.5946737282239993, "train_bytes": 28256.1625, "train_loss_nats_per_token": 1.6778287892948318 }, { "epoch": 0.038977114113402336, "grad_norm": 0.1494140625, "learning_rate": 0.0014190589831536155, "loss": 1.6795551300048828, "step": 78920, "train_bpb": 0.5932495789366724, "train_bytes": 28420.19375, "train_loss_nats_per_token": 1.6800634281104443 }, { "epoch": 0.03910879355297464, "grad_norm": 0.1513671875, "learning_rate": 0.0014184362534320721, "loss": 1.69957275390625, "step": 78940, "train_bpb": 0.6016052998899448, "train_bytes": 28077.78125, "train_loss_nats_per_token": 1.6992799025272918 }, { "epoch": 0.039240472992546946, "grad_norm": 0.1376953125, "learning_rate": 0.001417813537809584, "loss": 1.6916547775268556, "step": 78960, "train_bpb": 0.5978457343914115, "train_bytes": 28216.05, "train_loss_nats_per_token": 1.6920252508584193 }, { "epoch": 0.03937215243211925, "grad_norm": 0.1279296875, "learning_rate": 0.0014171908363937939, "loss": 1.6776002883911132, "step": 78980, "train_bpb": 0.5927188964849116, "train_bytes": 28337.95625, "train_loss_nats_per_token": 1.6784826171359355 }, { "epoch": 0.039503831871691555, "grad_norm": 0.1455078125, "learning_rate": 0.0014165681492923409, "loss": 1.6877754211425782, "step": 79000, "train_bpb": 0.597982654417132, "train_bytes": 28175.625, "train_loss_nats_per_token": 1.6885082508008513 }, { "epoch": 0.039503831871691555, "eval_loss": 1.5184521675109863, "eval_runtime": 71.6968, "eval_samples_per_second": 13.948, "eval_steps_per_second": 13.948, "step": 79000, "train_bpb": 0.5358855726439858, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5259945736544849 }, { "epoch": 0.03963551131126386, "grad_norm": 0.1376953125, "learning_rate": 0.0014159454766128625, "loss": 1.690185546875, "step": 79020, "train_bpb": 0.5967276655260991, "train_bytes": 28411.50625, "train_loss_nats_per_token": 1.6899873574390067 }, { "epoch": 0.039767190750836165, "grad_norm": 0.1689453125, "learning_rate": 0.0014153228184629937, "loss": 1.6728246688842774, "step": 79040, "train_bpb": 0.5924333050418202, "train_bytes": 28203.44375, "train_loss_nats_per_token": 1.6736600456865685 }, { "epoch": 0.03989887019040847, "grad_norm": 0.1650390625, "learning_rate": 0.0014147001749503665, "loss": 1.681999397277832, "step": 79060, "train_bpb": 0.5909319226331758, "train_bytes": 28637.44375, "train_loss_nats_per_token": 1.6818919575827886 }, { "epoch": 0.040030549629980774, "grad_norm": 0.13671875, "learning_rate": 0.0014140775461826108, "loss": 1.6935585021972657, "step": 79080, "train_bpb": 0.5985582476906349, "train_bytes": 28276.50625, "train_loss_nats_per_token": 1.6938629821244626 }, { "epoch": 0.04016222906955308, "grad_norm": 0.18359375, "learning_rate": 0.0014134549322673533, "loss": 1.6753795623779297, "step": 79100, "train_bpb": 0.5934050153063277, "train_bytes": 28056.8, "train_loss_nats_per_token": 1.6763994009199736 }, { "epoch": 0.040293908509125384, "grad_norm": 0.185546875, "learning_rate": 0.00141283233331222, "loss": 1.6987340927124024, "step": 79120, "train_bpb": 0.5975452908814409, "train_bytes": 28523.44375, "train_loss_nats_per_token": 1.7000338848928669 }, { "epoch": 0.04042558794869769, "grad_norm": 0.1826171875, "learning_rate": 0.0014122097494248314, "loss": 1.6816415786743164, "step": 79140, "train_bpb": 0.5944356092277779, "train_bytes": 28695.15625, "train_loss_nats_per_token": 1.6818655300925514 }, { "epoch": 0.040557267388269994, "grad_norm": 0.1640625, "learning_rate": 0.0014115871807128077, "loss": 1.692144012451172, "step": 79160, "train_bpb": 0.5966286411316302, "train_bytes": 28385.46875, "train_loss_nats_per_token": 1.6932140669342586 }, { "epoch": 0.0406889468278423, "grad_norm": 0.1494140625, "learning_rate": 0.0014109646272837657, "loss": 1.6758153915405274, "step": 79180, "train_bpb": 0.5943127181942286, "train_bytes": 28194.91875, "train_loss_nats_per_token": 1.6763453442452272 }, { "epoch": 0.0408206262674146, "grad_norm": 0.1318359375, "learning_rate": 0.0014103420892453194, "loss": 1.6837926864624024, "step": 79200, "train_bpb": 0.5993501095962781, "train_bytes": 28351.5625, "train_loss_nats_per_token": 1.6848514149199854 }, { "epoch": 0.04095230570698691, "grad_norm": 0.15234375, "learning_rate": 0.0014097195667050802, "loss": 1.6758466720581056, "step": 79220, "train_bpb": 0.5943123885685314, "train_bytes": 28334.5125, "train_loss_nats_per_token": 1.6769203373302262 }, { "epoch": 0.04108398514655922, "grad_norm": 0.15625, "learning_rate": 0.001409097059770657, "loss": 1.677947425842285, "step": 79240, "train_bpb": 0.59264406463803, "train_bytes": 28285.05, "train_loss_nats_per_token": 1.6791180866870166 }, { "epoch": 0.041215664586131524, "grad_norm": 0.1318359375, "learning_rate": 0.0014084745685496566, "loss": 1.689889907836914, "step": 79260, "train_bpb": 0.599480964175318, "train_bytes": 28141.0125, "train_loss_nats_per_token": 1.6904960818767496 }, { "epoch": 0.04134734402570383, "grad_norm": 0.1943359375, "learning_rate": 0.0014078520931496813, "loss": 1.6717391967773438, "step": 79280, "train_bpb": 0.5932972172800046, "train_bytes": 28346.05, "train_loss_nats_per_token": 1.672242020617127 }, { "epoch": 0.041479023465276134, "grad_norm": 0.1328125, "learning_rate": 0.0014072296336783325, "loss": 1.6819957733154296, "step": 79300, "train_bpb": 0.5937900921855016, "train_bytes": 28583.7375, "train_loss_nats_per_token": 1.6827284947531986 }, { "epoch": 0.04161070290484844, "grad_norm": 0.1640625, "learning_rate": 0.0014066071902432082, "loss": 1.6983301162719726, "step": 79320, "train_bpb": 0.6010051623684264, "train_bytes": 28219.3625, "train_loss_nats_per_token": 1.6993577706410823 }, { "epoch": 0.04174238234442074, "grad_norm": 0.1298828125, "learning_rate": 0.0014059847629519034, "loss": 1.6806570053100587, "step": 79340, "train_bpb": 0.5950408739369666, "train_bytes": 28480.20625, "train_loss_nats_per_token": 1.6817875380410419 }, { "epoch": 0.04187406178399305, "grad_norm": 0.15234375, "learning_rate": 0.00140536235191201, "loss": 1.6784297943115234, "step": 79360, "train_bpb": 0.5966719431243956, "train_bytes": 28415.40625, "train_loss_nats_per_token": 1.6787914321583952 }, { "epoch": 0.04200574122356535, "grad_norm": 0.2421875, "learning_rate": 0.0014047399572311183, "loss": 1.6877431869506836, "step": 79380, "train_bpb": 0.5952715379446712, "train_bytes": 28221.44375, "train_loss_nats_per_token": 1.688634053136842 }, { "epoch": 0.04213742066313766, "grad_norm": 0.154296875, "learning_rate": 0.0014041175790168148, "loss": 1.685025978088379, "step": 79400, "train_bpb": 0.5953686590397086, "train_bytes": 28470.00625, "train_loss_nats_per_token": 1.6855320235269888 }, { "epoch": 0.04226910010270996, "grad_norm": 0.1650390625, "learning_rate": 0.0014034952173766829, "loss": 1.6749755859375, "step": 79420, "train_bpb": 0.593519256148443, "train_bytes": 28260.725, "train_loss_nats_per_token": 1.676105019521307 }, { "epoch": 0.04240077954228227, "grad_norm": 0.1435546875, "learning_rate": 0.001402872872418304, "loss": 1.6891170501708985, "step": 79440, "train_bpb": 0.5975509446083594, "train_bytes": 28285.30625, "train_loss_nats_per_token": 1.689705869220961 }, { "epoch": 0.04253245898185457, "grad_norm": 0.1572265625, "learning_rate": 0.0014022505442492566, "loss": 1.6830257415771483, "step": 79460, "train_bpb": 0.5965925825152328, "train_bytes": 28132.69375, "train_loss_nats_per_token": 1.683796547507723 }, { "epoch": 0.04266413842142688, "grad_norm": 0.1650390625, "learning_rate": 0.0014016282329771157, "loss": 1.685413932800293, "step": 79480, "train_bpb": 0.5999038285077584, "train_bytes": 27893.0375, "train_loss_nats_per_token": 1.685803577516774 }, { "epoch": 0.04279581786099918, "grad_norm": 0.146484375, "learning_rate": 0.001401005938709453, "loss": 1.6839406967163086, "step": 79500, "train_bpb": 0.5951610860076998, "train_bytes": 28607.975, "train_loss_nats_per_token": 1.6845231091332986 }, { "epoch": 0.042927497300571486, "grad_norm": 0.1220703125, "learning_rate": 0.0014003836615538389, "loss": 1.690140151977539, "step": 79520, "train_bpb": 0.5968120425609973, "train_bytes": 28578.2375, "train_loss_nats_per_token": 1.691081792267875 }, { "epoch": 0.04305917674014379, "grad_norm": 0.1591796875, "learning_rate": 0.0013997614016178393, "loss": 1.6794157028198242, "step": 79540, "train_bpb": 0.5941933407792053, "train_bytes": 28085.25, "train_loss_nats_per_token": 1.6800860787021488 }, { "epoch": 0.043190856179716096, "grad_norm": 0.1591796875, "learning_rate": 0.0013991391590090173, "loss": 1.6722570419311524, "step": 79560, "train_bpb": 0.5948451365533113, "train_bytes": 28239.9375, "train_loss_nats_per_token": 1.6730180931816354 }, { "epoch": 0.04332253561928841, "grad_norm": 0.1552734375, "learning_rate": 0.0013985169338349335, "loss": 1.6765289306640625, "step": 79580, "train_bpb": 0.5944244697027372, "train_bytes": 28193.71875, "train_loss_nats_per_token": 1.6768886987863638 }, { "epoch": 0.04345421505886071, "grad_norm": 0.154296875, "learning_rate": 0.0013978947262031464, "loss": 1.6751808166503905, "step": 79600, "train_bpb": 0.5932654131117767, "train_bytes": 28040.69375, "train_loss_nats_per_token": 1.676013717355352 }, { "epoch": 0.04358589449843302, "grad_norm": 0.12255859375, "learning_rate": 0.0013972725362212087, "loss": 1.6793363571166993, "step": 79620, "train_bpb": 0.5956372972697066, "train_bytes": 28218.20625, "train_loss_nats_per_token": 1.6795753366979191 }, { "epoch": 0.04371757393800532, "grad_norm": 0.15234375, "learning_rate": 0.0013966503639966728, "loss": 1.6790416717529297, "step": 79640, "train_bpb": 0.5956924564448424, "train_bytes": 28259.425, "train_loss_nats_per_token": 1.6795935815125178 }, { "epoch": 0.04384925337757763, "grad_norm": 0.1240234375, "learning_rate": 0.0013960282096370869, "loss": 1.6938724517822266, "step": 79660, "train_bpb": 0.6022727108993942, "train_bytes": 27946.975, "train_loss_nats_per_token": 1.6948478996773066 }, { "epoch": 0.04398093281714993, "grad_norm": 0.1796875, "learning_rate": 0.0013954060732499962, "loss": 1.6894308090209962, "step": 79680, "train_bpb": 0.6022473559581485, "train_bytes": 27867.66875, "train_loss_nats_per_token": 1.6902526580114179 }, { "epoch": 0.044112612256722236, "grad_norm": 0.1552734375, "learning_rate": 0.0013947839549429421, "loss": 1.6719879150390624, "step": 79700, "train_bpb": 0.5913966035613655, "train_bytes": 28140.63125, "train_loss_nats_per_token": 1.6727439005886071 }, { "epoch": 0.04424429169629454, "grad_norm": 0.1318359375, "learning_rate": 0.0013941618548234645, "loss": 1.6761489868164063, "step": 79720, "train_bpb": 0.592904093577309, "train_bytes": 28208.6875, "train_loss_nats_per_token": 1.6756404831771812 }, { "epoch": 0.044375971135866846, "grad_norm": 0.1376953125, "learning_rate": 0.001393539772999099, "loss": 1.6787918090820313, "step": 79740, "train_bpb": 0.5907815882227805, "train_bytes": 28502.19375, "train_loss_nats_per_token": 1.6788864655311335 }, { "epoch": 0.04450765057543915, "grad_norm": 0.1787109375, "learning_rate": 0.0013929177095773776, "loss": 1.6644969940185548, "step": 79760, "train_bpb": 0.5872845240082668, "train_bytes": 28656.90625, "train_loss_nats_per_token": 1.664872146309802 }, { "epoch": 0.044639330015011455, "grad_norm": 0.1259765625, "learning_rate": 0.0013922956646658302, "loss": 1.6802038192749023, "step": 79780, "train_bpb": 0.5910167259922445, "train_bytes": 28349.5375, "train_loss_nats_per_token": 1.6808680617038083 }, { "epoch": 0.04477100945458376, "grad_norm": 0.1611328125, "learning_rate": 0.0013916736383719835, "loss": 1.6703662872314453, "step": 79800, "train_bpb": 0.5889116188888097, "train_bytes": 28491.0875, "train_loss_nats_per_token": 1.671024358420464 }, { "epoch": 0.044902688894156065, "grad_norm": 0.1298828125, "learning_rate": 0.0013910516308033602, "loss": 1.679056167602539, "step": 79820, "train_bpb": 0.5926902685903613, "train_bytes": 28328.2, "train_loss_nats_per_token": 1.6795398629107854 }, { "epoch": 0.04503436833372837, "grad_norm": 0.2490234375, "learning_rate": 0.0013904296420674796, "loss": 1.6793943405151368, "step": 79840, "train_bpb": 0.5983843771982787, "train_bytes": 27797.4875, "train_loss_nats_per_token": 1.6801233019855866 }, { "epoch": 0.045166047773300674, "grad_norm": 0.1513671875, "learning_rate": 0.0013898076722718591, "loss": 1.6926210403442383, "step": 79860, "train_bpb": 0.6006042006369546, "train_bytes": 28126.0875, "train_loss_nats_per_token": 1.6928463414786696 }, { "epoch": 0.04529772721287298, "grad_norm": 0.126953125, "learning_rate": 0.0013891857215240118, "loss": 1.680025291442871, "step": 79880, "train_bpb": 0.595849913869838, "train_bytes": 28065.6125, "train_loss_nats_per_token": 1.680358208409025 }, { "epoch": 0.045429406652445284, "grad_norm": 0.1396484375, "learning_rate": 0.001388563789931447, "loss": 1.6764389038085938, "step": 79900, "train_bpb": 0.5963227749351437, "train_bytes": 28168.28125, "train_loss_nats_per_token": 1.6767384037795787 }, { "epoch": 0.045561086092017596, "grad_norm": 0.171875, "learning_rate": 0.0013879418776016725, "loss": 1.6821218490600587, "step": 79920, "train_bpb": 0.5939690565535533, "train_bytes": 28461.70625, "train_loss_nats_per_token": 1.6828992098727726 }, { "epoch": 0.0456927655315899, "grad_norm": 0.1416015625, "learning_rate": 0.0013873199846421906, "loss": 1.687179946899414, "step": 79940, "train_bpb": 0.5993772565861241, "train_bytes": 28368.3625, "train_loss_nats_per_token": 1.6887570656018305 }, { "epoch": 0.045824444971162205, "grad_norm": 0.1240234375, "learning_rate": 0.001386698111160502, "loss": 1.680758285522461, "step": 79960, "train_bpb": 0.5965812639362278, "train_bytes": 28311.725, "train_loss_nats_per_token": 1.6817041926596337 }, { "epoch": 0.04595612441073451, "grad_norm": 0.1416015625, "learning_rate": 0.001386076257264103, "loss": 1.678987693786621, "step": 79980, "train_bpb": 0.5955642797109776, "train_bytes": 28201.5125, "train_loss_nats_per_token": 1.679466997702721 }, { "epoch": 0.046087803850306815, "grad_norm": 0.1748046875, "learning_rate": 0.0013854544230604872, "loss": 1.6729726791381836, "step": 80000, "train_bpb": 0.5916797092652399, "train_bytes": 28176.33125, "train_loss_nats_per_token": 1.6730188637416572 }, { "epoch": 0.046087803850306815, "eval_loss": 1.5209064483642578, "eval_runtime": 71.4534, "eval_samples_per_second": 13.995, "eval_steps_per_second": 13.995, "step": 80000, "train_bpb": 0.5367353585367478, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5284144347728283 }, { "epoch": 0.04621948328987912, "grad_norm": 0.15625, "learning_rate": 0.0013848326086571441, "loss": 1.6860183715820312, "step": 80020, "train_bpb": 0.5946114987665799, "train_bytes": 28447.6, "train_loss_nats_per_token": 1.6864669909420869 }, { "epoch": 0.046351162729451424, "grad_norm": 0.1318359375, "learning_rate": 0.00138421081416156, "loss": 1.6734783172607421, "step": 80040, "train_bpb": 0.5951679702662056, "train_bytes": 28138.0625, "train_loss_nats_per_token": 1.6740616602680383 }, { "epoch": 0.04648284216902373, "grad_norm": 0.1298828125, "learning_rate": 0.0013835890396812186, "loss": 1.6799339294433593, "step": 80060, "train_bpb": 0.5949380919527701, "train_bytes": 28188.475, "train_loss_nats_per_token": 1.6804634384365604 }, { "epoch": 0.046614521608596034, "grad_norm": 0.1826171875, "learning_rate": 0.0013829672853235987, "loss": 1.689885139465332, "step": 80080, "train_bpb": 0.5977052738270994, "train_bytes": 28428.9375, "train_loss_nats_per_token": 1.6901001892351224 }, { "epoch": 0.04674620104816834, "grad_norm": 0.1611328125, "learning_rate": 0.0013823455511961765, "loss": 1.6892723083496093, "step": 80100, "train_bpb": 0.5962336668344478, "train_bytes": 28796.21875, "train_loss_nats_per_token": 1.6899928553453925 }, { "epoch": 0.04687788048774064, "grad_norm": 0.150390625, "learning_rate": 0.0013817238374064244, "loss": 1.67318115234375, "step": 80120, "train_bpb": 0.5967875337112938, "train_bytes": 27954.30625, "train_loss_nats_per_token": 1.6743707437782804 }, { "epoch": 0.04700955992731295, "grad_norm": 0.1474609375, "learning_rate": 0.0013811021440618123, "loss": 1.6914354324340821, "step": 80140, "train_bpb": 0.5984233946177734, "train_bytes": 28397.3125, "train_loss_nats_per_token": 1.6912813742263877 }, { "epoch": 0.04714123936688525, "grad_norm": 0.134765625, "learning_rate": 0.001380480471269805, "loss": 1.697138786315918, "step": 80160, "train_bpb": 0.6027914522380069, "train_bytes": 28276.2625, "train_loss_nats_per_token": 1.6978453882109996 }, { "epoch": 0.04727291880645756, "grad_norm": 0.1630859375, "learning_rate": 0.0013798588191378642, "loss": 1.6861032485961913, "step": 80180, "train_bpb": 0.5953889154136831, "train_bytes": 28214.1875, "train_loss_nats_per_token": 1.6868173932912476 }, { "epoch": 0.04740459824602986, "grad_norm": 0.12109375, "learning_rate": 0.0013792371877734489, "loss": 1.6891668319702149, "step": 80200, "train_bpb": 0.5994079279021219, "train_bytes": 28019.1, "train_loss_nats_per_token": 1.688540780247276 }, { "epoch": 0.04753627768560217, "grad_norm": 0.1552734375, "learning_rate": 0.0013786155772840137, "loss": 1.6806306838989258, "step": 80220, "train_bpb": 0.5934343357836933, "train_bytes": 28356.44375, "train_loss_nats_per_token": 1.6809400545528588 }, { "epoch": 0.04766795712517447, "grad_norm": 0.12353515625, "learning_rate": 0.0013779939877770094, "loss": 1.6796886444091796, "step": 80240, "train_bpb": 0.5985375327593334, "train_bytes": 28036.85625, "train_loss_nats_per_token": 1.6810979827573358 }, { "epoch": 0.047799636564746784, "grad_norm": 0.169921875, "learning_rate": 0.001377372419359884, "loss": 1.6750242233276367, "step": 80260, "train_bpb": 0.5911241770686695, "train_bytes": 28481.975, "train_loss_nats_per_token": 1.6752721127050278 }, { "epoch": 0.04793131600431909, "grad_norm": 0.1689453125, "learning_rate": 0.001376750872140081, "loss": 1.6896203994750976, "step": 80280, "train_bpb": 0.5989535799353154, "train_bytes": 28213.5125, "train_loss_nats_per_token": 1.690844073407159 }, { "epoch": 0.04806299544389139, "grad_norm": 0.21484375, "learning_rate": 0.001376129346225041, "loss": 1.6883146286010742, "step": 80300, "train_bpb": 0.600050795954489, "train_bytes": 28479.06875, "train_loss_nats_per_token": 1.6894229449119351 }, { "epoch": 0.0481946748834637, "grad_norm": 0.2041015625, "learning_rate": 0.0013755078417222004, "loss": 1.6962020874023438, "step": 80320, "train_bpb": 0.6017344848676283, "train_bytes": 28059.54375, "train_loss_nats_per_token": 1.6966601530999754 }, { "epoch": 0.048326354323036, "grad_norm": 0.1630859375, "learning_rate": 0.0013748863587389924, "loss": 1.693354034423828, "step": 80340, "train_bpb": 0.5989416606235669, "train_bytes": 28015.69375, "train_loss_nats_per_token": 1.6940142282618071 }, { "epoch": 0.04845803376260831, "grad_norm": 0.1484375, "learning_rate": 0.0013742648973828458, "loss": 1.6880977630615235, "step": 80360, "train_bpb": 0.6029248897053727, "train_bytes": 27679.45, "train_loss_nats_per_token": 1.6898991259612708 }, { "epoch": 0.04858971320218061, "grad_norm": 0.154296875, "learning_rate": 0.0013736434577611856, "loss": 1.6885290145874023, "step": 80380, "train_bpb": 0.6001658332200619, "train_bytes": 28196.69375, "train_loss_nats_per_token": 1.68926624367086 }, { "epoch": 0.04872139264175292, "grad_norm": 0.1640625, "learning_rate": 0.0013730220399814344, "loss": 1.6964723587036132, "step": 80400, "train_bpb": 0.601671136022736, "train_bytes": 28386.06875, "train_loss_nats_per_token": 1.6978047369393328 }, { "epoch": 0.04885307208132522, "grad_norm": 0.1396484375, "learning_rate": 0.0013724006441510094, "loss": 1.6990602493286133, "step": 80420, "train_bpb": 0.6015881257220772, "train_bytes": 28622.6, "train_loss_nats_per_token": 1.6999054774124276 }, { "epoch": 0.048984751520897526, "grad_norm": 0.1435546875, "learning_rate": 0.0013717792703773245, "loss": 1.6963205337524414, "step": 80440, "train_bpb": 0.6001737860748544, "train_bytes": 28689.65625, "train_loss_nats_per_token": 1.6974976680156544 }, { "epoch": 0.04911643096046983, "grad_norm": 0.119140625, "learning_rate": 0.0013711579187677908, "loss": 1.6800081253051757, "step": 80460, "train_bpb": 0.5948851709765165, "train_bytes": 28659.85, "train_loss_nats_per_token": 1.6805018213969727 }, { "epoch": 0.049248110400042136, "grad_norm": 0.1455078125, "learning_rate": 0.0013705365894298137, "loss": 1.6963815689086914, "step": 80480, "train_bpb": 0.5978450728350683, "train_bytes": 29004.68125, "train_loss_nats_per_token": 1.6976965769946 }, { "epoch": 0.04937978983961444, "grad_norm": 0.140625, "learning_rate": 0.0013699152824707967, "loss": 1.6943540573120117, "step": 80500, "train_bpb": 0.5955058370692187, "train_bytes": 28697.8625, "train_loss_nats_per_token": 1.6956686889964934 }, { "epoch": 0.049511469279186746, "grad_norm": 0.146484375, "learning_rate": 0.0013692939979981378, "loss": 1.68204345703125, "step": 80520, "train_bpb": 0.5968977122664886, "train_bytes": 28152.4375, "train_loss_nats_per_token": 1.6831754972639685 }, { "epoch": 0.04964314871875905, "grad_norm": 0.1396484375, "learning_rate": 0.0013686727361192322, "loss": 1.6968557357788085, "step": 80540, "train_bpb": 0.6002532425312389, "train_bytes": 28229.29375, "train_loss_nats_per_token": 1.6970010822037747 }, { "epoch": 0.049774828158331355, "grad_norm": 0.154296875, "learning_rate": 0.001368051496941471, "loss": 1.6875120162963868, "step": 80560, "train_bpb": 0.5977573927661388, "train_bytes": 28112.6625, "train_loss_nats_per_token": 1.688334060952872 }, { "epoch": 0.04990650759790366, "grad_norm": 0.1552734375, "learning_rate": 0.0013674302805722406, "loss": 1.6913122177124023, "step": 80580, "train_bpb": 0.5993358393814886, "train_bytes": 28250.025, "train_loss_nats_per_token": 1.6916479430690678 }, { "epoch": 0.05003818703747597, "grad_norm": 0.1318359375, "learning_rate": 0.0013668090871189248, "loss": 1.6952655792236329, "step": 80600, "train_bpb": 0.5968788229343955, "train_bytes": 28150.6875, "train_loss_nats_per_token": 1.6954608215232683 }, { "epoch": 0.050169866477048276, "grad_norm": 0.1572265625, "learning_rate": 0.0013661879166889017, "loss": 1.7020614624023438, "step": 80620, "train_bpb": 0.6023287286107594, "train_bytes": 28237.7625, "train_loss_nats_per_token": 1.7030013203103769 }, { "epoch": 0.05030154591662058, "grad_norm": 0.12158203125, "learning_rate": 0.0013655667693895474, "loss": 1.6853736877441405, "step": 80640, "train_bpb": 0.5975943843936641, "train_bytes": 27951.25, "train_loss_nats_per_token": 1.6861898694470576 }, { "epoch": 0.050433225356192886, "grad_norm": 0.1416015625, "learning_rate": 0.0013649456453282325, "loss": 1.6925846099853517, "step": 80660, "train_bpb": 0.5990186094948922, "train_bytes": 28247.73125, "train_loss_nats_per_token": 1.6937586303225276 }, { "epoch": 0.05056490479576519, "grad_norm": 0.1611328125, "learning_rate": 0.0013643245446123243, "loss": 1.6992395401000977, "step": 80680, "train_bpb": 0.5998189241452371, "train_bytes": 28377.38125, "train_loss_nats_per_token": 1.6993486969437819 }, { "epoch": 0.050696584235337495, "grad_norm": 0.138671875, "learning_rate": 0.0013637034673491858, "loss": 1.6985652923583985, "step": 80700, "train_bpb": 0.5995790608914646, "train_bytes": 28601.7875, "train_loss_nats_per_token": 1.6989992178266677 }, { "epoch": 0.0508282636749098, "grad_norm": 0.173828125, "learning_rate": 0.0013630824136461757, "loss": 1.6913288116455079, "step": 80720, "train_bpb": 0.5979826704446489, "train_bytes": 28076.4375, "train_loss_nats_per_token": 1.6924823177521247 }, { "epoch": 0.050959943114482105, "grad_norm": 0.1484375, "learning_rate": 0.0013624613836106495, "loss": 1.6821475982666017, "step": 80740, "train_bpb": 0.5925132347626911, "train_bytes": 28550.4875, "train_loss_nats_per_token": 1.683530505798816 }, { "epoch": 0.05109162255405441, "grad_norm": 0.154296875, "learning_rate": 0.0013618403773499577, "loss": 1.6938121795654297, "step": 80760, "train_bpb": 0.5990967276548247, "train_bytes": 28356.73125, "train_loss_nats_per_token": 1.694706695733475 }, { "epoch": 0.051223301993626714, "grad_norm": 0.1484375, "learning_rate": 0.001361219394971447, "loss": 1.6846248626708984, "step": 80780, "train_bpb": 0.5960775838381449, "train_bytes": 28199.98125, "train_loss_nats_per_token": 1.684981325751396 }, { "epoch": 0.05135498143319902, "grad_norm": 0.1416015625, "learning_rate": 0.00136059843658246, "loss": 1.6976186752319335, "step": 80800, "train_bpb": 0.601620435752007, "train_bytes": 28291.60625, "train_loss_nats_per_token": 1.6991491647498558 }, { "epoch": 0.051486660872771324, "grad_norm": 0.1435546875, "learning_rate": 0.001359977502290335, "loss": 1.6946918487548828, "step": 80820, "train_bpb": 0.5991872231197406, "train_bytes": 28389.11875, "train_loss_nats_per_token": 1.6953020032534807 }, { "epoch": 0.05161834031234363, "grad_norm": 0.150390625, "learning_rate": 0.001359356592202407, "loss": 1.7050199508666992, "step": 80840, "train_bpb": 0.6023857361792035, "train_bytes": 28274.58125, "train_loss_nats_per_token": 1.7060578689392796 }, { "epoch": 0.051750019751915934, "grad_norm": 0.1552734375, "learning_rate": 0.0013587357064260052, "loss": 1.674178123474121, "step": 80860, "train_bpb": 0.592723131101603, "train_bytes": 28322.6125, "train_loss_nats_per_token": 1.6746162019806126 }, { "epoch": 0.05188169919148824, "grad_norm": 0.2001953125, "learning_rate": 0.0013581148450684563, "loss": 1.6762098312377929, "step": 80880, "train_bpb": 0.5929896870712654, "train_bytes": 28221.55, "train_loss_nats_per_token": 1.6761362684276158 }, { "epoch": 0.05201337863106054, "grad_norm": 0.2158203125, "learning_rate": 0.0013574940082370815, "loss": 1.681930923461914, "step": 80900, "train_bpb": 0.594372831783757, "train_bytes": 28057.475, "train_loss_nats_per_token": 1.6823402565193162 }, { "epoch": 0.052145058070632855, "grad_norm": 0.1728515625, "learning_rate": 0.0013568731960391983, "loss": 1.6799665451049806, "step": 80920, "train_bpb": 0.5963943234370802, "train_bytes": 28250.29375, "train_loss_nats_per_token": 1.6801026358927404 }, { "epoch": 0.05227673751020516, "grad_norm": 0.154296875, "learning_rate": 0.00135625240858212, "loss": 1.6872684478759765, "step": 80940, "train_bpb": 0.5992679289309656, "train_bytes": 28408.0125, "train_loss_nats_per_token": 1.6870032790904523 }, { "epoch": 0.052408416949777464, "grad_norm": 0.12890625, "learning_rate": 0.0013556316459731553, "loss": 1.6849714279174806, "step": 80960, "train_bpb": 0.598131704859762, "train_bytes": 28057.80625, "train_loss_nats_per_token": 1.685149811903678 }, { "epoch": 0.05254009638934977, "grad_norm": 0.1494140625, "learning_rate": 0.0013550109083196094, "loss": 1.6904672622680663, "step": 80980, "train_bpb": 0.6005591427305431, "train_bytes": 28163.6, "train_loss_nats_per_token": 1.6913564162179187 }, { "epoch": 0.052671775828922074, "grad_norm": 0.1923828125, "learning_rate": 0.0013543901957287822, "loss": 1.6871288299560547, "step": 81000, "train_bpb": 0.5991886744677525, "train_bytes": 28242.8875, "train_loss_nats_per_token": 1.686946580379365 }, { "epoch": 0.052671775828922074, "eval_loss": 1.5229506492614746, "eval_runtime": 73.2826, "eval_samples_per_second": 13.646, "eval_steps_per_second": 13.646, "step": 81000, "train_bpb": 0.537466004762407, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5304950322595583 }, { "epoch": 0.05280345526849438, "grad_norm": 0.1474609375, "learning_rate": 0.0013537695083079692, "loss": 1.6855363845825195, "step": 81020, "train_bpb": 0.5976324980058169, "train_bytes": 28474.7375, "train_loss_nats_per_token": 1.6866735188420399 }, { "epoch": 0.05293513470806668, "grad_norm": 0.12158203125, "learning_rate": 0.0013531488461644627, "loss": 1.6917591094970703, "step": 81040, "train_bpb": 0.5982721282178183, "train_bytes": 28385.625, "train_loss_nats_per_token": 1.6923448905370817 }, { "epoch": 0.05306681414763899, "grad_norm": 0.119140625, "learning_rate": 0.0013525282094055495, "loss": 1.6802894592285156, "step": 81060, "train_bpb": 0.596359287487539, "train_bytes": 28148.76875, "train_loss_nats_per_token": 1.681963665465098 }, { "epoch": 0.05319849358721129, "grad_norm": 0.1591796875, "learning_rate": 0.001351907598138513, "loss": 1.6837865829467773, "step": 81080, "train_bpb": 0.5976407131090891, "train_bytes": 27947.95625, "train_loss_nats_per_token": 1.684430728090636 }, { "epoch": 0.0533301730267836, "grad_norm": 0.1533203125, "learning_rate": 0.001351287012470631, "loss": 1.6838973999023437, "step": 81100, "train_bpb": 0.5944631502256849, "train_bytes": 28322.93125, "train_loss_nats_per_token": 1.6844525394515266 }, { "epoch": 0.0534618524663559, "grad_norm": 0.119140625, "learning_rate": 0.0013506664525091783, "loss": 1.6869863510131835, "step": 81120, "train_bpb": 0.5966706537629671, "train_bytes": 28130.7625, "train_loss_nats_per_token": 1.6876216537567497 }, { "epoch": 0.05359353190592821, "grad_norm": 0.1650390625, "learning_rate": 0.0013500459183614238, "loss": 1.6802406311035156, "step": 81140, "train_bpb": 0.5959067724003406, "train_bytes": 28193.49375, "train_loss_nats_per_token": 1.6806005071252768 }, { "epoch": 0.05372521134550051, "grad_norm": 0.16015625, "learning_rate": 0.0013494254101346327, "loss": 1.6862648010253907, "step": 81160, "train_bpb": 0.5942828456153667, "train_bytes": 28455.43125, "train_loss_nats_per_token": 1.6873109471758496 }, { "epoch": 0.05385689078507282, "grad_norm": 0.1494140625, "learning_rate": 0.001348804927936066, "loss": 1.6853225708007813, "step": 81180, "train_bpb": 0.599717286291604, "train_bytes": 28371.0625, "train_loss_nats_per_token": 1.6857710984639187 }, { "epoch": 0.05398857022464512, "grad_norm": 0.134765625, "learning_rate": 0.0013481844718729796, "loss": 1.6798797607421876, "step": 81200, "train_bpb": 0.5957327907494773, "train_bytes": 28339.46875, "train_loss_nats_per_token": 1.6806442134228317 }, { "epoch": 0.054120249664217426, "grad_norm": 0.1650390625, "learning_rate": 0.0013475640420526252, "loss": 1.6787830352783204, "step": 81220, "train_bpb": 0.5952667684430958, "train_bytes": 28164.06875, "train_loss_nats_per_token": 1.6786392574734106 }, { "epoch": 0.05425192910378973, "grad_norm": 0.1962890625, "learning_rate": 0.00134694363858225, "loss": 1.6826528549194335, "step": 81240, "train_bpb": 0.5957772839300642, "train_bytes": 28377.91875, "train_loss_nats_per_token": 1.6832979390755916 }, { "epoch": 0.05438360854336204, "grad_norm": 0.1474609375, "learning_rate": 0.001346323261569096, "loss": 1.684334945678711, "step": 81260, "train_bpb": 0.5976851421418901, "train_bytes": 28286.10625, "train_loss_nats_per_token": 1.6854582107929614 }, { "epoch": 0.05451528798293435, "grad_norm": 0.1943359375, "learning_rate": 0.001345702911120402, "loss": 1.6822532653808593, "step": 81280, "train_bpb": 0.5975568759812289, "train_bytes": 27937.8125, "train_loss_nats_per_token": 1.6843535595091805 }, { "epoch": 0.05464696742250665, "grad_norm": 0.2138671875, "learning_rate": 0.0013450825873434007, "loss": 1.691354751586914, "step": 81300, "train_bpb": 0.5953590408009239, "train_bytes": 28405.75, "train_loss_nats_per_token": 1.6918751791444007 }, { "epoch": 0.05477864686207896, "grad_norm": 0.1279296875, "learning_rate": 0.0013444622903453214, "loss": 1.6942440032958985, "step": 81320, "train_bpb": 0.5988450382001419, "train_bytes": 28572.51875, "train_loss_nats_per_token": 1.6947543112831562 }, { "epoch": 0.05491032630165126, "grad_norm": 0.126953125, "learning_rate": 0.0013438420202333875, "loss": 1.6839797973632813, "step": 81340, "train_bpb": 0.5957952744820788, "train_bytes": 28148.85, "train_loss_nats_per_token": 1.6850407356172643 }, { "epoch": 0.05504200574122357, "grad_norm": 0.1513671875, "learning_rate": 0.001343221777114819, "loss": 1.6895692825317383, "step": 81360, "train_bpb": 0.5988221716341364, "train_bytes": 28404.7625, "train_loss_nats_per_token": 1.690611580318598 }, { "epoch": 0.05517368518079587, "grad_norm": 0.12060546875, "learning_rate": 0.0013426015610968308, "loss": 1.68006591796875, "step": 81380, "train_bpb": 0.5956780641014299, "train_bytes": 28345.9375, "train_loss_nats_per_token": 1.6810544811329224 }, { "epoch": 0.055305364620368176, "grad_norm": 0.1611328125, "learning_rate": 0.0013419813722866326, "loss": 1.699898910522461, "step": 81400, "train_bpb": 0.6018253125018296, "train_bytes": 28597.46875, "train_loss_nats_per_token": 1.7002161461905652 }, { "epoch": 0.05543704405994048, "grad_norm": 0.1357421875, "learning_rate": 0.0013413612107914304, "loss": 1.686505126953125, "step": 81420, "train_bpb": 0.598405903191489, "train_bytes": 28306.25, "train_loss_nats_per_token": 1.6881931938589072 }, { "epoch": 0.055568723499512786, "grad_norm": 0.1728515625, "learning_rate": 0.0013407410767184243, "loss": 1.6890113830566407, "step": 81440, "train_bpb": 0.5968199309697839, "train_bytes": 28319.81875, "train_loss_nats_per_token": 1.6896096144990544 }, { "epoch": 0.05570040293908509, "grad_norm": 0.13671875, "learning_rate": 0.0013401209701748107, "loss": 1.6768486022949218, "step": 81460, "train_bpb": 0.5940226841782027, "train_bytes": 28114.75, "train_loss_nats_per_token": 1.6784408195537357 }, { "epoch": 0.055832082378657395, "grad_norm": 0.15625, "learning_rate": 0.0013395008912677807, "loss": 1.6863988876342773, "step": 81480, "train_bpb": 0.5947682347454777, "train_bytes": 28355.88125, "train_loss_nats_per_token": 1.6864363728009542 }, { "epoch": 0.0559637618182297, "grad_norm": 0.13671875, "learning_rate": 0.0013388808401045204, "loss": 1.6969097137451172, "step": 81500, "train_bpb": 0.5992723495054724, "train_bytes": 28433.29375, "train_loss_nats_per_token": 1.6974673153582236 }, { "epoch": 0.056095441257802005, "grad_norm": 0.1318359375, "learning_rate": 0.0013382608167922122, "loss": 1.6913000106811524, "step": 81520, "train_bpb": 0.594259564651408, "train_bytes": 28749.76875, "train_loss_nats_per_token": 1.6906971982251415 }, { "epoch": 0.05622712069737431, "grad_norm": 0.1494140625, "learning_rate": 0.0013376408214380324, "loss": 1.6933767318725585, "step": 81540, "train_bpb": 0.6002781752983344, "train_bytes": 28297.4, "train_loss_nats_per_token": 1.6936884531518033 }, { "epoch": 0.056358800136946614, "grad_norm": 0.1513671875, "learning_rate": 0.0013370208541491526, "loss": 1.6854103088378907, "step": 81560, "train_bpb": 0.5959389389264093, "train_bytes": 28104.83125, "train_loss_nats_per_token": 1.6867861034190954 }, { "epoch": 0.05649047957651892, "grad_norm": 0.1875, "learning_rate": 0.0013364009150327407, "loss": 1.6857458114624024, "step": 81580, "train_bpb": 0.5948978624013034, "train_bytes": 28469.76875, "train_loss_nats_per_token": 1.6872653160935398 }, { "epoch": 0.05662215901609123, "grad_norm": 0.1591796875, "learning_rate": 0.0013357810041959581, "loss": 1.6742776870727538, "step": 81600, "train_bpb": 0.5948578340545728, "train_bytes": 28243.8375, "train_loss_nats_per_token": 1.675004149899453 }, { "epoch": 0.056753838455663536, "grad_norm": 0.1220703125, "learning_rate": 0.0013351611217459634, "loss": 1.6849441528320312, "step": 81620, "train_bpb": 0.5991228895975063, "train_bytes": 28362.2125, "train_loss_nats_per_token": 1.6859486804140924 }, { "epoch": 0.05688551789523584, "grad_norm": 0.138671875, "learning_rate": 0.001334541267789908, "loss": 1.6755489349365233, "step": 81640, "train_bpb": 0.5931654382655243, "train_bytes": 28613.6375, "train_loss_nats_per_token": 1.6766343782636748 }, { "epoch": 0.057017197334808145, "grad_norm": 0.171875, "learning_rate": 0.00133392144243494, "loss": 1.6879549026489258, "step": 81660, "train_bpb": 0.5968774085729595, "train_bytes": 28350.79375, "train_loss_nats_per_token": 1.6881769591775924 }, { "epoch": 0.05714887677438045, "grad_norm": 0.1806640625, "learning_rate": 0.001333301645788202, "loss": 1.6942483901977539, "step": 81680, "train_bpb": 0.5989629928717642, "train_bytes": 28231.9125, "train_loss_nats_per_token": 1.6947133270682553 }, { "epoch": 0.057280556213952755, "grad_norm": 0.1279296875, "learning_rate": 0.001332681877956831, "loss": 1.6889476776123047, "step": 81700, "train_bpb": 0.5928232433476497, "train_bytes": 28512.875, "train_loss_nats_per_token": 1.689164881695767 }, { "epoch": 0.05741223565352506, "grad_norm": 0.2080078125, "learning_rate": 0.0013320621390479606, "loss": 1.6931175231933593, "step": 81720, "train_bpb": 0.5984241354618112, "train_bytes": 28113.8125, "train_loss_nats_per_token": 1.694015530165898 }, { "epoch": 0.057543915093097364, "grad_norm": 0.146484375, "learning_rate": 0.0013314424291687174, "loss": 1.680215835571289, "step": 81740, "train_bpb": 0.5941480988635712, "train_bytes": 28572.825, "train_loss_nats_per_token": 1.6812305670458005 }, { "epoch": 0.05767559453266967, "grad_norm": 0.1396484375, "learning_rate": 0.0013308227484262252, "loss": 1.6919075012207032, "step": 81760, "train_bpb": 0.5988434987449595, "train_bytes": 28308.78125, "train_loss_nats_per_token": 1.6931163879822435 }, { "epoch": 0.057807273972241974, "grad_norm": 0.1279296875, "learning_rate": 0.0013302030969276008, "loss": 1.6816888809204102, "step": 81780, "train_bpb": 0.5964253280642374, "train_bytes": 28322.75, "train_loss_nats_per_token": 1.6834669838527856 }, { "epoch": 0.05793895341181428, "grad_norm": 0.1640625, "learning_rate": 0.0013295834747799572, "loss": 1.691514015197754, "step": 81800, "train_bpb": 0.5986781310134969, "train_bytes": 28569.15625, "train_loss_nats_per_token": 1.692175339511676 }, { "epoch": 0.05807063285138658, "grad_norm": 0.1455078125, "learning_rate": 0.0013289638820904017, "loss": 1.6840764999389648, "step": 81820, "train_bpb": 0.5982880806549106, "train_bytes": 27968.225, "train_loss_nats_per_token": 1.6850603295375506 }, { "epoch": 0.05820231229095889, "grad_norm": 0.1474609375, "learning_rate": 0.001328344318966036, "loss": 1.6829679489135743, "step": 81840, "train_bpb": 0.5932890439018076, "train_bytes": 28606.8, "train_loss_nats_per_token": 1.6842355084978893 }, { "epoch": 0.05833399173053119, "grad_norm": 0.140625, "learning_rate": 0.0013277247855139585, "loss": 1.6785261154174804, "step": 81860, "train_bpb": 0.596733608759056, "train_bytes": 28184.91875, "train_loss_nats_per_token": 1.6789193836144471 }, { "epoch": 0.0584656711701035, "grad_norm": 0.1533203125, "learning_rate": 0.0013271052818412611, "loss": 1.6809038162231444, "step": 81880, "train_bpb": 0.593515699883417, "train_bytes": 28208.3875, "train_loss_nats_per_token": 1.6809804884833577 }, { "epoch": 0.0585973506096758, "grad_norm": 0.130859375, "learning_rate": 0.00132648580805503, "loss": 1.687033462524414, "step": 81900, "train_bpb": 0.5959941162684491, "train_bytes": 28391.85, "train_loss_nats_per_token": 1.6881547467966032 }, { "epoch": 0.05872903004924811, "grad_norm": 0.1513671875, "learning_rate": 0.0013258663642623477, "loss": 1.6939193725585937, "step": 81920, "train_bpb": 0.598597624992096, "train_bytes": 28380.10625, "train_loss_nats_per_token": 1.6948766566475055 }, { "epoch": 0.05886070948882042, "grad_norm": 0.140625, "learning_rate": 0.001325246950570291, "loss": 1.6873512268066406, "step": 81940, "train_bpb": 0.5961164557683413, "train_bytes": 28369.0625, "train_loss_nats_per_token": 1.6876015013343544 }, { "epoch": 0.058992388928392724, "grad_norm": 0.1484375, "learning_rate": 0.001324627567085931, "loss": 1.681678009033203, "step": 81960, "train_bpb": 0.5912127588298427, "train_bytes": 28564.2875, "train_loss_nats_per_token": 1.681968025560681 }, { "epoch": 0.05912406836796503, "grad_norm": 0.1328125, "learning_rate": 0.0013240082139163339, "loss": 1.6768363952636718, "step": 81980, "train_bpb": 0.5962517402448815, "train_bytes": 28129.9625, "train_loss_nats_per_token": 1.6769990996922117 }, { "epoch": 0.05925574780753733, "grad_norm": 0.15234375, "learning_rate": 0.0013233888911685608, "loss": 1.6683378219604492, "step": 82000, "train_bpb": 0.5888887190488946, "train_bytes": 28659.0, "train_loss_nats_per_token": 1.6685223109770297 }, { "epoch": 0.05925574780753733, "eval_loss": 1.5222294330596924, "eval_runtime": 71.85, "eval_samples_per_second": 13.918, "eval_steps_per_second": 13.918, "step": 82000, "train_bpb": 0.537197435184247, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5297302501123173 }, { "epoch": 0.05938742724710964, "grad_norm": 0.1416015625, "learning_rate": 0.0013227695989496675, "loss": 1.6948740005493164, "step": 82020, "train_bpb": 0.5988969045329386, "train_bytes": 28266.16875, "train_loss_nats_per_token": 1.695329260245143 }, { "epoch": 0.05951910668668194, "grad_norm": 0.1474609375, "learning_rate": 0.001322150337366704, "loss": 1.6843755722045899, "step": 82040, "train_bpb": 0.5953331716558405, "train_bytes": 28440.0, "train_loss_nats_per_token": 1.685396073231479 }, { "epoch": 0.05965078612625425, "grad_norm": 0.1435546875, "learning_rate": 0.0013215311065267162, "loss": 1.6795381546020507, "step": 82060, "train_bpb": 0.5893803144207287, "train_bytes": 28386.68125, "train_loss_nats_per_token": 1.6799298632233723 }, { "epoch": 0.05978246556582655, "grad_norm": 0.16015625, "learning_rate": 0.0013209119065367432, "loss": 1.691514778137207, "step": 82080, "train_bpb": 0.5942651756762901, "train_bytes": 28714.9125, "train_loss_nats_per_token": 1.6922541068920434 }, { "epoch": 0.05991414500539886, "grad_norm": 0.1474609375, "learning_rate": 0.00132029273750382, "loss": 1.6803184509277345, "step": 82100, "train_bpb": 0.5953962020406735, "train_bytes": 28146.06875, "train_loss_nats_per_token": 1.680925382604465 }, { "epoch": 0.06004582444497116, "grad_norm": 0.1240234375, "learning_rate": 0.0013196735995349752, "loss": 1.6839012145996093, "step": 82120, "train_bpb": 0.5981912802481295, "train_bytes": 27993.54375, "train_loss_nats_per_token": 1.6848839469513253 }, { "epoch": 0.060177503884543466, "grad_norm": 0.142578125, "learning_rate": 0.0013190544927372335, "loss": 1.6753915786743163, "step": 82140, "train_bpb": 0.5950881407724389, "train_bytes": 28225.65625, "train_loss_nats_per_token": 1.6760233917265432 }, { "epoch": 0.06030918332411577, "grad_norm": 0.1943359375, "learning_rate": 0.0013184354172176126, "loss": 1.6917684555053711, "step": 82160, "train_bpb": 0.5976267063729928, "train_bytes": 28151.125, "train_loss_nats_per_token": 1.6926695288643587 }, { "epoch": 0.060440862763688076, "grad_norm": 0.1513671875, "learning_rate": 0.0013178163730831255, "loss": 1.6925100326538085, "step": 82180, "train_bpb": 0.5979891743839685, "train_bytes": 28228.275, "train_loss_nats_per_token": 1.6933360137273372 }, { "epoch": 0.06057254220326038, "grad_norm": 0.177734375, "learning_rate": 0.00131719736044078, "loss": 1.6837270736694336, "step": 82200, "train_bpb": 0.5942153659786845, "train_bytes": 28424.24375, "train_loss_nats_per_token": 1.6844670418595575 }, { "epoch": 0.060704221642832686, "grad_norm": 0.12109375, "learning_rate": 0.0013165783793975781, "loss": 1.6692951202392579, "step": 82220, "train_bpb": 0.5961725526060535, "train_bytes": 27804.93125, "train_loss_nats_per_token": 1.6696532572299319 }, { "epoch": 0.06083590108240499, "grad_norm": 0.1376953125, "learning_rate": 0.0013159594300605163, "loss": 1.6890762329101563, "step": 82240, "train_bpb": 0.5956621796178674, "train_bytes": 28257.63125, "train_loss_nats_per_token": 1.689640898011238 }, { "epoch": 0.060967580521977295, "grad_norm": 0.1962890625, "learning_rate": 0.0013153405125365858, "loss": 1.6790447235107422, "step": 82260, "train_bpb": 0.5945637975504028, "train_bytes": 28189.4625, "train_loss_nats_per_token": 1.6792192495480778 }, { "epoch": 0.06109925996154961, "grad_norm": 0.1484375, "learning_rate": 0.0013147216269327727, "loss": 1.6847352981567383, "step": 82280, "train_bpb": 0.5949678722683863, "train_bytes": 28536.825, "train_loss_nats_per_token": 1.6850629200897287 }, { "epoch": 0.06123093940112191, "grad_norm": 0.1513671875, "learning_rate": 0.001314102773356057, "loss": 1.6775861740112306, "step": 82300, "train_bpb": 0.5935896945792616, "train_bytes": 28397.96875, "train_loss_nats_per_token": 1.6776273860846072 }, { "epoch": 0.061362618840694216, "grad_norm": 0.15625, "learning_rate": 0.001313483951913413, "loss": 1.680905532836914, "step": 82320, "train_bpb": 0.5942433124993103, "train_bytes": 28523.10625, "train_loss_nats_per_token": 1.6813907249631592 }, { "epoch": 0.06149429828026652, "grad_norm": 0.16796875, "learning_rate": 0.00131286516271181, "loss": 1.67979736328125, "step": 82340, "train_bpb": 0.594896114137574, "train_bytes": 28318.91875, "train_loss_nats_per_token": 1.6799454935873213 }, { "epoch": 0.061625977719838826, "grad_norm": 0.1533203125, "learning_rate": 0.0013122464058582116, "loss": 1.669745635986328, "step": 82360, "train_bpb": 0.5908309718015442, "train_bytes": 28212.575, "train_loss_nats_per_token": 1.66958328446011 }, { "epoch": 0.06175765715941113, "grad_norm": 0.1513671875, "learning_rate": 0.001311627681459575, "loss": 1.690546417236328, "step": 82380, "train_bpb": 0.6014464348582302, "train_bytes": 27861.35625, "train_loss_nats_per_token": 1.6914439927825105 }, { "epoch": 0.061889336598983435, "grad_norm": 0.1630859375, "learning_rate": 0.0013110089896228537, "loss": 1.6829914093017577, "step": 82400, "train_bpb": 0.5958913159029654, "train_bytes": 28348.16875, "train_loss_nats_per_token": 1.6835372656293528 }, { "epoch": 0.06202101603855574, "grad_norm": 0.12451171875, "learning_rate": 0.0013103903304549935, "loss": 1.6894540786743164, "step": 82420, "train_bpb": 0.5968151258693456, "train_bytes": 28414.6875, "train_loss_nats_per_token": 1.6898638482246988 }, { "epoch": 0.062152695478128045, "grad_norm": 0.1611328125, "learning_rate": 0.0013097717040629353, "loss": 1.6806690216064453, "step": 82440, "train_bpb": 0.5937028031978341, "train_bytes": 28297.40625, "train_loss_nats_per_token": 1.6815828786674487 }, { "epoch": 0.06228437491770035, "grad_norm": 0.162109375, "learning_rate": 0.0013091531105536148, "loss": 1.682087516784668, "step": 82460, "train_bpb": 0.5972473032642082, "train_bytes": 28258.13125, "train_loss_nats_per_token": 1.6833673955413209 }, { "epoch": 0.062416054357272654, "grad_norm": 0.138671875, "learning_rate": 0.0013085345500339618, "loss": 1.6807971954345704, "step": 82480, "train_bpb": 0.5980176509016794, "train_bytes": 28232.3875, "train_loss_nats_per_token": 1.6813824915967301 }, { "epoch": 0.06254773379684496, "grad_norm": 0.2119140625, "learning_rate": 0.0013079160226109002, "loss": 1.6841974258422852, "step": 82500, "train_bpb": 0.5953580061951356, "train_bytes": 28161.9625, "train_loss_nats_per_token": 1.6854190482759874 }, { "epoch": 0.06267941323641726, "grad_norm": 0.1171875, "learning_rate": 0.0013072975283913478, "loss": 1.6862964630126953, "step": 82520, "train_bpb": 0.5943516054519515, "train_bytes": 28554.025, "train_loss_nats_per_token": 1.6873112802804604 }, { "epoch": 0.06281109267598957, "grad_norm": 0.17578125, "learning_rate": 0.0013066790674822178, "loss": 1.6802627563476562, "step": 82540, "train_bpb": 0.594431328153589, "train_bytes": 28320.99375, "train_loss_nats_per_token": 1.681489502200706 }, { "epoch": 0.06294277211556187, "grad_norm": 0.1328125, "learning_rate": 0.0013060606399904167, "loss": 1.6897079467773437, "step": 82560, "train_bpb": 0.599003058746694, "train_bytes": 28137.0625, "train_loss_nats_per_token": 1.6910657582334425 }, { "epoch": 0.06307445155513418, "grad_norm": 0.15234375, "learning_rate": 0.0013054422460228449, "loss": 1.6940731048583983, "step": 82580, "train_bpb": 0.5958966880422284, "train_bytes": 28787.95, "train_loss_nats_per_token": 1.6947679461757257 }, { "epoch": 0.06320613099470648, "grad_norm": 0.19140625, "learning_rate": 0.001304823885686398, "loss": 1.695199203491211, "step": 82600, "train_bpb": 0.6011735529612061, "train_bytes": 28353.45625, "train_loss_nats_per_token": 1.6964421442802085 }, { "epoch": 0.06333781043427879, "grad_norm": 0.1279296875, "learning_rate": 0.001304205559087966, "loss": 1.6792963027954102, "step": 82620, "train_bpb": 0.5941510862470603, "train_bytes": 28292.175, "train_loss_nats_per_token": 1.6795129179622679 }, { "epoch": 0.06346948987385109, "grad_norm": 0.1650390625, "learning_rate": 0.0013035872663344314, "loss": 1.6851119995117188, "step": 82640, "train_bpb": 0.5927201308218829, "train_bytes": 28468.7, "train_loss_nats_per_token": 1.685608994505385 }, { "epoch": 0.0636011693134234, "grad_norm": 0.1337890625, "learning_rate": 0.0013029690075326721, "loss": 1.680490493774414, "step": 82660, "train_bpb": 0.5948308275463122, "train_bytes": 28303.175, "train_loss_nats_per_token": 1.6817729729710331 }, { "epoch": 0.0637328487529957, "grad_norm": 0.1318359375, "learning_rate": 0.0013023507827895605, "loss": 1.6868883132934571, "step": 82680, "train_bpb": 0.5940003318092067, "train_bytes": 28587.09375, "train_loss_nats_per_token": 1.6874637038447382 }, { "epoch": 0.06386452819256801, "grad_norm": 0.1298828125, "learning_rate": 0.001301732592211962, "loss": 1.696150779724121, "step": 82700, "train_bpb": 0.5974968784973308, "train_bytes": 28412.225, "train_loss_nats_per_token": 1.6973483685223838 }, { "epoch": 0.06399620763214031, "grad_norm": 0.1337890625, "learning_rate": 0.0013011144359067366, "loss": 1.680854606628418, "step": 82720, "train_bpb": 0.5950394717700961, "train_bytes": 28118.5125, "train_loss_nats_per_token": 1.6817978954623674 }, { "epoch": 0.06412788707171262, "grad_norm": 0.177734375, "learning_rate": 0.0013004963139807387, "loss": 1.6959037780761719, "step": 82740, "train_bpb": 0.6012350808210131, "train_bytes": 28108.9, "train_loss_nats_per_token": 1.6961423169331091 }, { "epoch": 0.06425956651128492, "grad_norm": 0.1708984375, "learning_rate": 0.0012998782265408162, "loss": 1.6861019134521484, "step": 82760, "train_bpb": 0.5959673887000397, "train_bytes": 28291.86875, "train_loss_nats_per_token": 1.6867593761219064 }, { "epoch": 0.06439124595085724, "grad_norm": 0.134765625, "learning_rate": 0.0012992601736938113, "loss": 1.6949066162109374, "step": 82780, "train_bpb": 0.5992058293947558, "train_bytes": 28232.0625, "train_loss_nats_per_token": 1.6958707050726591 }, { "epoch": 0.06452292539042954, "grad_norm": 0.12890625, "learning_rate": 0.00129864215554656, "loss": 1.6782894134521484, "step": 82800, "train_bpb": 0.593490311937132, "train_bytes": 28235.76875, "train_loss_nats_per_token": 1.6788559225302655 }, { "epoch": 0.06465460483000185, "grad_norm": 0.1904296875, "learning_rate": 0.0012980241722058933, "loss": 1.692189598083496, "step": 82820, "train_bpb": 0.6002851141269571, "train_bytes": 28096.46875, "train_loss_nats_per_token": 1.692920252967665 }, { "epoch": 0.06478628426957415, "grad_norm": 0.142578125, "learning_rate": 0.0012974062237786348, "loss": 1.675914192199707, "step": 82840, "train_bpb": 0.5962252878940378, "train_bytes": 27838.2875, "train_loss_nats_per_token": 1.6770589083347758 }, { "epoch": 0.06491796370914646, "grad_norm": 0.130859375, "learning_rate": 0.0012967883103716022, "loss": 1.6768795013427735, "step": 82860, "train_bpb": 0.5939243774218711, "train_bytes": 28264.1375, "train_loss_nats_per_token": 1.6781834660547266 }, { "epoch": 0.06504964314871876, "grad_norm": 0.1328125, "learning_rate": 0.0012961704320916087, "loss": 1.6827678680419922, "step": 82880, "train_bpb": 0.5946008034786568, "train_bytes": 28294.7125, "train_loss_nats_per_token": 1.6827556028083162 }, { "epoch": 0.06518132258829107, "grad_norm": 0.1435546875, "learning_rate": 0.0012955525890454597, "loss": 1.679183578491211, "step": 82900, "train_bpb": 0.593721729662134, "train_bytes": 28634.35, "train_loss_nats_per_token": 1.6797283016464732 }, { "epoch": 0.06531300202786337, "grad_norm": 0.126953125, "learning_rate": 0.001294934781339955, "loss": 1.6774284362792968, "step": 82920, "train_bpb": 0.592643021355426, "train_bytes": 28285.525, "train_loss_nats_per_token": 1.6781111551253303 }, { "epoch": 0.06544468146743568, "grad_norm": 0.177734375, "learning_rate": 0.0012943170090818886, "loss": 1.6810956954956056, "step": 82940, "train_bpb": 0.5897408910224495, "train_bytes": 28600.675, "train_loss_nats_per_token": 1.6813025218492579 }, { "epoch": 0.06557636090700798, "grad_norm": 0.1484375, "learning_rate": 0.0012936992723780487, "loss": 1.6848194122314453, "step": 82960, "train_bpb": 0.5914707940971033, "train_bytes": 28733.55625, "train_loss_nats_per_token": 1.6847560378412305 }, { "epoch": 0.06570804034658029, "grad_norm": 0.1845703125, "learning_rate": 0.0012930815713352159, "loss": 1.6838251113891602, "step": 82980, "train_bpb": 0.593735729293612, "train_bytes": 28220.78125, "train_loss_nats_per_token": 1.68448056564424 }, { "epoch": 0.06583971978615259, "grad_norm": 0.1787109375, "learning_rate": 0.001292463906060166, "loss": 1.6758907318115235, "step": 83000, "train_bpb": 0.5922398548378753, "train_bytes": 28349.15625, "train_loss_nats_per_token": 1.6760083910422265 }, { "epoch": 0.06583971978615259, "eval_loss": 1.5229840278625488, "eval_runtime": 71.2674, "eval_samples_per_second": 14.032, "eval_steps_per_second": 14.032, "step": 83000, "train_bpb": 0.5374740805164678, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.530518028879554 }, { "epoch": 0.0659713992257249, "grad_norm": 0.1328125, "learning_rate": 0.0012918462766596686, "loss": 1.6808719635009766, "step": 83020, "train_bpb": 0.5951421701363435, "train_bytes": 28196.6375, "train_loss_nats_per_token": 1.6820281737441887 }, { "epoch": 0.0661030786652972, "grad_norm": 0.1689453125, "learning_rate": 0.0012912286832404865, "loss": 1.678431510925293, "step": 83040, "train_bpb": 0.5981603362505087, "train_bytes": 27928.84375, "train_loss_nats_per_token": 1.6789165600657816 }, { "epoch": 0.0662347581048695, "grad_norm": 0.1337890625, "learning_rate": 0.0012906111259093761, "loss": 1.6820060729980468, "step": 83060, "train_bpb": 0.5941953216516153, "train_bytes": 28291.24375, "train_loss_nats_per_token": 1.6833451576290603 }, { "epoch": 0.06636643754444181, "grad_norm": 0.15625, "learning_rate": 0.001289993604773088, "loss": 1.6932994842529296, "step": 83080, "train_bpb": 0.597758100940032, "train_bytes": 28304.475, "train_loss_nats_per_token": 1.6936783797517863 }, { "epoch": 0.06649811698401412, "grad_norm": 0.158203125, "learning_rate": 0.0012893761199383677, "loss": 1.6855173110961914, "step": 83100, "train_bpb": 0.5961728450592921, "train_bytes": 28189.30625, "train_loss_nats_per_token": 1.6857721918886852 }, { "epoch": 0.06662979642358642, "grad_norm": 0.146484375, "learning_rate": 0.0012887586715119516, "loss": 1.681027603149414, "step": 83120, "train_bpb": 0.5951163724205054, "train_bytes": 28339.5375, "train_loss_nats_per_token": 1.6818243624762845 }, { "epoch": 0.06676147586315873, "grad_norm": 0.1787109375, "learning_rate": 0.0012881412596005722, "loss": 1.683403778076172, "step": 83140, "train_bpb": 0.5941547390454629, "train_bytes": 28117.2, "train_loss_nats_per_token": 1.6839303448624137 }, { "epoch": 0.06689315530273103, "grad_norm": 0.1630859375, "learning_rate": 0.001287523884310955, "loss": 1.6665287017822266, "step": 83160, "train_bpb": 0.5886895295700251, "train_bytes": 28179.66875, "train_loss_nats_per_token": 1.6667956721099724 }, { "epoch": 0.06702483474230334, "grad_norm": 0.1904296875, "learning_rate": 0.0012869065457498188, "loss": 1.6845399856567382, "step": 83180, "train_bpb": 0.5980788373445097, "train_bytes": 28448.2875, "train_loss_nats_per_token": 1.6857837520199026 }, { "epoch": 0.06715651418187564, "grad_norm": 0.1552734375, "learning_rate": 0.0012862892440238761, "loss": 1.6857242584228516, "step": 83200, "train_bpb": 0.5931419407141494, "train_bytes": 28480.55625, "train_loss_nats_per_token": 1.6872846104498898 }, { "epoch": 0.06728819362144794, "grad_norm": 0.1513671875, "learning_rate": 0.0012856719792398341, "loss": 1.6749343872070312, "step": 83220, "train_bpb": 0.5988295839188081, "train_bytes": 27911.1, "train_loss_nats_per_token": 1.675248849053073 }, { "epoch": 0.06741987306102025, "grad_norm": 0.1640625, "learning_rate": 0.0012850547515043922, "loss": 1.694100570678711, "step": 83240, "train_bpb": 0.5970350837320166, "train_bytes": 28410.3375, "train_loss_nats_per_token": 1.6955799035875339 }, { "epoch": 0.06755155250059255, "grad_norm": 0.18359375, "learning_rate": 0.001284437560924244, "loss": 1.6757266998291016, "step": 83260, "train_bpb": 0.5905948814400499, "train_bytes": 28219.4, "train_loss_nats_per_token": 1.676063515507613 }, { "epoch": 0.06768323194016486, "grad_norm": 0.1513671875, "learning_rate": 0.0012838204076060765, "loss": 1.6788202285766602, "step": 83280, "train_bpb": 0.5938739246152929, "train_bytes": 28268.975, "train_loss_nats_per_token": 1.6801804017189195 }, { "epoch": 0.06781491137973716, "grad_norm": 0.1513671875, "learning_rate": 0.0012832032916565712, "loss": 1.6686717987060546, "step": 83300, "train_bpb": 0.5918900790325045, "train_bytes": 28152.89375, "train_loss_nats_per_token": 1.6697105063647002 }, { "epoch": 0.06794659081930947, "grad_norm": 0.1435546875, "learning_rate": 0.0012825862131824013, "loss": 1.6725725173950194, "step": 83320, "train_bpb": 0.589486354460976, "train_bytes": 28317.7, "train_loss_nats_per_token": 1.6731980356781742 }, { "epoch": 0.06807827025888177, "grad_norm": 0.1865234375, "learning_rate": 0.001281969172290235, "loss": 1.6723382949829102, "step": 83340, "train_bpb": 0.5932127911003476, "train_bytes": 28275.925, "train_loss_nats_per_token": 1.6734732083891644 }, { "epoch": 0.06820994969845408, "grad_norm": 0.1796875, "learning_rate": 0.0012813521690867341, "loss": 1.6782133102416992, "step": 83360, "train_bpb": 0.5960903021801499, "train_bytes": 28398.6, "train_loss_nats_per_token": 1.680023856593821 }, { "epoch": 0.06834162913802638, "grad_norm": 0.1328125, "learning_rate": 0.0012807352036785528, "loss": 1.6890600204467774, "step": 83380, "train_bpb": 0.5963652862675256, "train_bytes": 28356.76875, "train_loss_nats_per_token": 1.6890941655987808 }, { "epoch": 0.06847330857759869, "grad_norm": 0.150390625, "learning_rate": 0.0012801182761723391, "loss": 1.6843774795532227, "step": 83400, "train_bpb": 0.5943256817531869, "train_bytes": 28156.6375, "train_loss_nats_per_token": 1.6861797138411125 }, { "epoch": 0.06860498801717099, "grad_norm": 0.1748046875, "learning_rate": 0.001279501386674735, "loss": 1.6912076950073243, "step": 83420, "train_bpb": 0.596704489533858, "train_bytes": 28425.675, "train_loss_nats_per_token": 1.6919156579890873 }, { "epoch": 0.0687366674567433, "grad_norm": 0.162109375, "learning_rate": 0.0012788845352923765, "loss": 1.687037467956543, "step": 83440, "train_bpb": 0.5965374942831492, "train_bytes": 28263.1875, "train_loss_nats_per_token": 1.6874406602463965 }, { "epoch": 0.06886834689631562, "grad_norm": 0.12109375, "learning_rate": 0.0012782677221318906, "loss": 1.681224250793457, "step": 83460, "train_bpb": 0.5945458967725845, "train_bytes": 28277.21875, "train_loss_nats_per_token": 1.6831264528374157 }, { "epoch": 0.06900002633588792, "grad_norm": 0.1845703125, "learning_rate": 0.0012776509472998997, "loss": 1.6740007400512695, "step": 83480, "train_bpb": 0.5908404034728957, "train_bytes": 28383.65, "train_loss_nats_per_token": 1.674554251621095 }, { "epoch": 0.06913170577546023, "grad_norm": 0.171875, "learning_rate": 0.0012770342109030201, "loss": 1.6848039627075195, "step": 83500, "train_bpb": 0.595989390769744, "train_bytes": 28503.03125, "train_loss_nats_per_token": 1.6853146686615568 }, { "epoch": 0.06926338521503253, "grad_norm": 0.1328125, "learning_rate": 0.001276417513047859, "loss": 1.676354217529297, "step": 83520, "train_bpb": 0.5918365927719677, "train_bytes": 28570.24375, "train_loss_nats_per_token": 1.676460698225242 }, { "epoch": 0.06939506465460483, "grad_norm": 0.138671875, "learning_rate": 0.0012758008538410188, "loss": 1.6712156295776368, "step": 83540, "train_bpb": 0.5890017427147779, "train_bytes": 28521.0375, "train_loss_nats_per_token": 1.6716333828919347 }, { "epoch": 0.06952674409417714, "grad_norm": 0.1591796875, "learning_rate": 0.0012751842333890955, "loss": 1.690862274169922, "step": 83560, "train_bpb": 0.5965732411175031, "train_bytes": 28401.225, "train_loss_nats_per_token": 1.6911822115734017 }, { "epoch": 0.06965842353374944, "grad_norm": 0.1318359375, "learning_rate": 0.0012745676517986772, "loss": 1.6791257858276367, "step": 83580, "train_bpb": 0.5932094963516304, "train_bytes": 28457.23125, "train_loss_nats_per_token": 1.6803305410361524 }, { "epoch": 0.06979010297332175, "grad_norm": 0.1494140625, "learning_rate": 0.0012739511091763454, "loss": 1.6868148803710938, "step": 83600, "train_bpb": 0.5949259049636684, "train_bytes": 28461.30625, "train_loss_nats_per_token": 1.6876816497561982 }, { "epoch": 0.06992178241289405, "grad_norm": 0.162109375, "learning_rate": 0.0012733346056286756, "loss": 1.6835195541381835, "step": 83620, "train_bpb": 0.5964950584691431, "train_bytes": 28125.25, "train_loss_nats_per_token": 1.6847095593108046 }, { "epoch": 0.07005346185246636, "grad_norm": 0.1376953125, "learning_rate": 0.001272718141262237, "loss": 1.6832542419433594, "step": 83640, "train_bpb": 0.5919468159845679, "train_bytes": 28371.2, "train_loss_nats_per_token": 1.6842222671318654 }, { "epoch": 0.07018514129203866, "grad_norm": 0.1376953125, "learning_rate": 0.00127210171618359, "loss": 1.6769060134887694, "step": 83660, "train_bpb": 0.595269486639258, "train_bytes": 28250.83125, "train_loss_nats_per_token": 1.677093940761592 }, { "epoch": 0.07031682073161097, "grad_norm": 0.2412109375, "learning_rate": 0.0012714853304992898, "loss": 1.6757551193237306, "step": 83680, "train_bpb": 0.5941648015492809, "train_bytes": 28053.89375, "train_loss_nats_per_token": 1.6757125644458537 }, { "epoch": 0.07044850017118327, "grad_norm": 0.142578125, "learning_rate": 0.0012708689843158845, "loss": 1.6834287643432617, "step": 83700, "train_bpb": 0.5960613458911683, "train_bytes": 28093.25, "train_loss_nats_per_token": 1.6834639370779132 }, { "epoch": 0.07058017961075558, "grad_norm": 0.1591796875, "learning_rate": 0.0012702526777399158, "loss": 1.6747058868408202, "step": 83720, "train_bpb": 0.5940303066613284, "train_bytes": 28075.275, "train_loss_nats_per_token": 1.6745821094269884 }, { "epoch": 0.07071185905032788, "grad_norm": 0.14453125, "learning_rate": 0.001269636410877917, "loss": 1.682390022277832, "step": 83740, "train_bpb": 0.5907670527933492, "train_bytes": 28595.6375, "train_loss_nats_per_token": 1.6831416920767315 }, { "epoch": 0.07084353848990019, "grad_norm": 0.1396484375, "learning_rate": 0.0012690201838364162, "loss": 1.6782983779907226, "step": 83760, "train_bpb": 0.589918282266646, "train_bytes": 28378.65625, "train_loss_nats_per_token": 1.6785699581684503 }, { "epoch": 0.07097521792947249, "grad_norm": 0.1318359375, "learning_rate": 0.0012684039967219346, "loss": 1.6815803527832032, "step": 83780, "train_bpb": 0.5967180988954729, "train_bytes": 27905.84375, "train_loss_nats_per_token": 1.6816633162747923 }, { "epoch": 0.0711068973690448, "grad_norm": 0.1787109375, "learning_rate": 0.0012677878496409848, "loss": 1.6723861694335938, "step": 83800, "train_bpb": 0.594877614296969, "train_bytes": 27782.8125, "train_loss_nats_per_token": 1.6721579920266751 }, { "epoch": 0.0712385768086171, "grad_norm": 0.1611328125, "learning_rate": 0.0012671717427000736, "loss": 1.6775707244873046, "step": 83820, "train_bpb": 0.5946114378260482, "train_bytes": 27980.21875, "train_loss_nats_per_token": 1.678326475874152 }, { "epoch": 0.0713702562481894, "grad_norm": 0.169921875, "learning_rate": 0.0012665556760057023, "loss": 1.6807912826538085, "step": 83840, "train_bpb": 0.5994407276111653, "train_bytes": 27823.38125, "train_loss_nats_per_token": 1.681480887813874 }, { "epoch": 0.07150193568776171, "grad_norm": 0.1640625, "learning_rate": 0.001265939649664362, "loss": 1.6715967178344726, "step": 83860, "train_bpb": 0.5910649106268651, "train_bytes": 28202.19375, "train_loss_nats_per_token": 1.6722455623573624 }, { "epoch": 0.07163361512733402, "grad_norm": 0.154296875, "learning_rate": 0.0012653236637825392, "loss": 1.6835262298583984, "step": 83880, "train_bpb": 0.5925094641648339, "train_bytes": 28710.83125, "train_loss_nats_per_token": 1.6839744465743416 }, { "epoch": 0.07176529456690632, "grad_norm": 0.1552734375, "learning_rate": 0.0012647077184667133, "loss": 1.6812711715698243, "step": 83900, "train_bpb": 0.5933603709905616, "train_bytes": 28570.6375, "train_loss_nats_per_token": 1.681652595154694 }, { "epoch": 0.07189697400647863, "grad_norm": 0.19921875, "learning_rate": 0.001264091813823356, "loss": 1.6734937667846679, "step": 83920, "train_bpb": 0.5926739318823212, "train_bytes": 28275.7875, "train_loss_nats_per_token": 1.674163372391998 }, { "epoch": 0.07202865344605093, "grad_norm": 0.138671875, "learning_rate": 0.0012634759499589318, "loss": 1.6619832992553711, "step": 83940, "train_bpb": 0.5895946150721557, "train_bytes": 28205.5125, "train_loss_nats_per_token": 1.6630425432345277 }, { "epoch": 0.07216033288562324, "grad_norm": 0.125, "learning_rate": 0.0012628601269798986, "loss": 1.6773136138916016, "step": 83960, "train_bpb": 0.5906999991724646, "train_bytes": 28183.35625, "train_loss_nats_per_token": 1.6779072924301437 }, { "epoch": 0.07229201232519554, "grad_norm": 0.158203125, "learning_rate": 0.001262244344992708, "loss": 1.6734001159667968, "step": 83980, "train_bpb": 0.5897667491007678, "train_bytes": 28346.0625, "train_loss_nats_per_token": 1.674122685041746 }, { "epoch": 0.07242369176476784, "grad_norm": 0.1484375, "learning_rate": 0.0012616286041038025, "loss": 1.674492645263672, "step": 84000, "train_bpb": 0.5924047488616996, "train_bytes": 28069.0875, "train_loss_nats_per_token": 1.675223674318899 }, { "epoch": 0.07242369176476784, "eval_loss": 1.523167371749878, "eval_runtime": 71.9484, "eval_samples_per_second": 13.899, "eval_steps_per_second": 13.899, "step": 84000, "train_bpb": 0.5375585936490092, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5307586895508707 }, { "epoch": 0.07255537120434015, "grad_norm": 0.150390625, "learning_rate": 0.001261012904419619, "loss": 1.6673892974853515, "step": 84020, "train_bpb": 0.5875464471424601, "train_bytes": 28710.3, "train_loss_nats_per_token": 1.6677406948781348 }, { "epoch": 0.07268705064391245, "grad_norm": 0.19921875, "learning_rate": 0.0012603972460465873, "loss": 1.686715316772461, "step": 84040, "train_bpb": 0.5985901817205982, "train_bytes": 28181.46875, "train_loss_nats_per_token": 1.688363569211867 }, { "epoch": 0.07281873008348476, "grad_norm": 0.158203125, "learning_rate": 0.0012597816290911296, "loss": 1.6639463424682617, "step": 84060, "train_bpb": 0.5899892542726182, "train_bytes": 28028.5875, "train_loss_nats_per_token": 1.665178019086396 }, { "epoch": 0.07295040952305706, "grad_norm": 0.158203125, "learning_rate": 0.0012591660536596606, "loss": 1.6831945419311523, "step": 84080, "train_bpb": 0.5952576168897369, "train_bytes": 28073.58125, "train_loss_nats_per_token": 1.6843394100014972 }, { "epoch": 0.07308208896262937, "grad_norm": 0.134765625, "learning_rate": 0.0012585505198585885, "loss": 1.6873212814331056, "step": 84100, "train_bpb": 0.5908116941197611, "train_bytes": 28722.8125, "train_loss_nats_per_token": 1.6877513065625733 }, { "epoch": 0.07321376840220169, "grad_norm": 0.130859375, "learning_rate": 0.001257935027794315, "loss": 1.6916494369506836, "step": 84120, "train_bpb": 0.5982441744758344, "train_bytes": 28480.24375, "train_loss_nats_per_token": 1.6920031327804812 }, { "epoch": 0.07334544784177399, "grad_norm": 0.16796875, "learning_rate": 0.001257319577573232, "loss": 1.6856298446655273, "step": 84140, "train_bpb": 0.5930342407565562, "train_bytes": 28564.575, "train_loss_nats_per_token": 1.687197327472941 }, { "epoch": 0.0734771272813463, "grad_norm": 0.146484375, "learning_rate": 0.0012567041693017267, "loss": 1.6870885848999024, "step": 84160, "train_bpb": 0.5978531030310676, "train_bytes": 28300.73125, "train_loss_nats_per_token": 1.6881754177965875 }, { "epoch": 0.0736088067209186, "grad_norm": 0.17578125, "learning_rate": 0.0012560888030861788, "loss": 1.6756889343261718, "step": 84180, "train_bpb": 0.5912883522307718, "train_bytes": 28500.50625, "train_loss_nats_per_token": 1.6760457263720592 }, { "epoch": 0.0737404861604909, "grad_norm": 0.189453125, "learning_rate": 0.0012554734790329585, "loss": 1.6769149780273438, "step": 84200, "train_bpb": 0.5927747374604253, "train_bytes": 28250.55625, "train_loss_nats_per_token": 1.677473505841293 }, { "epoch": 0.07387216560006321, "grad_norm": 0.16796875, "learning_rate": 0.0012548581972484313, "loss": 1.670102882385254, "step": 84220, "train_bpb": 0.5926570764280943, "train_bytes": 28389.075, "train_loss_nats_per_token": 1.671875972115792 }, { "epoch": 0.07400384503963552, "grad_norm": 0.1279296875, "learning_rate": 0.0012542429578389544, "loss": 1.688670539855957, "step": 84240, "train_bpb": 0.5932592184528639, "train_bytes": 28932.0875, "train_loss_nats_per_token": 1.688984853259599 }, { "epoch": 0.07413552447920782, "grad_norm": 0.1591796875, "learning_rate": 0.0012536277609108784, "loss": 1.6727073669433594, "step": 84260, "train_bpb": 0.588974025942274, "train_bytes": 28356.775, "train_loss_nats_per_token": 1.6732763492831586 }, { "epoch": 0.07426720391878013, "grad_norm": 0.2080078125, "learning_rate": 0.001253012606570544, "loss": 1.6787992477416993, "step": 84280, "train_bpb": 0.5912859816972108, "train_bytes": 28305.44375, "train_loss_nats_per_token": 1.6791139749043136 }, { "epoch": 0.07439888335835243, "grad_norm": 0.138671875, "learning_rate": 0.0012523974949242877, "loss": 1.6806352615356446, "step": 84300, "train_bpb": 0.5945268514824742, "train_bytes": 28149.7625, "train_loss_nats_per_token": 1.6816038405438924 }, { "epoch": 0.07453056279792473, "grad_norm": 0.1455078125, "learning_rate": 0.0012517824260784376, "loss": 1.6816987991333008, "step": 84320, "train_bpb": 0.591592858695213, "train_bytes": 28494.41875, "train_loss_nats_per_token": 1.6820504604058737 }, { "epoch": 0.07466224223749704, "grad_norm": 0.158203125, "learning_rate": 0.0012511674001393126, "loss": 1.6643041610717773, "step": 84340, "train_bpb": 0.5925685160803889, "train_bytes": 28236.93125, "train_loss_nats_per_token": 1.6656388709635255 }, { "epoch": 0.07479392167706934, "grad_norm": 0.1611328125, "learning_rate": 0.0012505524172132267, "loss": 1.6841060638427734, "step": 84360, "train_bpb": 0.5953845941865986, "train_bytes": 28527.8375, "train_loss_nats_per_token": 1.6839941089253132 }, { "epoch": 0.07492560111664165, "grad_norm": 0.146484375, "learning_rate": 0.0012499374774064859, "loss": 1.6807327270507812, "step": 84380, "train_bpb": 0.594875959163365, "train_bytes": 28347.9375, "train_loss_nats_per_token": 1.681291004680984 }, { "epoch": 0.07505728055621395, "grad_norm": 0.154296875, "learning_rate": 0.0012493225808253871, "loss": 1.6721319198608398, "step": 84400, "train_bpb": 0.5902476438375446, "train_bytes": 28173.3, "train_loss_nats_per_token": 1.673283882932179 }, { "epoch": 0.07518895999578626, "grad_norm": 0.138671875, "learning_rate": 0.0012487077275762217, "loss": 1.6749977111816405, "step": 84420, "train_bpb": 0.5926085727139795, "train_bytes": 28093.50625, "train_loss_nats_per_token": 1.676187489453599 }, { "epoch": 0.07532063943535856, "grad_norm": 0.138671875, "learning_rate": 0.0012480929177652723, "loss": 1.6766271591186523, "step": 84440, "train_bpb": 0.5955891409576829, "train_bytes": 28071.24375, "train_loss_nats_per_token": 1.6756254204311314 }, { "epoch": 0.07545231887493087, "grad_norm": 0.154296875, "learning_rate": 0.0012474781514988157, "loss": 1.6743719100952148, "step": 84460, "train_bpb": 0.5908101177676746, "train_bytes": 28389.98125, "train_loss_nats_per_token": 1.675114907516307 }, { "epoch": 0.07558399831450317, "grad_norm": 0.216796875, "learning_rate": 0.0012468634288831184, "loss": 1.6838315963745116, "step": 84480, "train_bpb": 0.5924890754146738, "train_bytes": 28453.15625, "train_loss_nats_per_token": 1.6843338411000028 }, { "epoch": 0.07571567775407548, "grad_norm": 0.1298828125, "learning_rate": 0.0012462487500244416, "loss": 1.6785634994506835, "step": 84500, "train_bpb": 0.5947727504416801, "train_bytes": 28260.74375, "train_loss_nats_per_token": 1.6794235746040287 }, { "epoch": 0.07584735719364778, "grad_norm": 0.2177734375, "learning_rate": 0.0012456341150290393, "loss": 1.675738525390625, "step": 84520, "train_bpb": 0.5929915719200777, "train_bytes": 28216.26875, "train_loss_nats_per_token": 1.6768728557061134 }, { "epoch": 0.07597903663322009, "grad_norm": 0.1533203125, "learning_rate": 0.001245019524003155, "loss": 1.6829137802124023, "step": 84540, "train_bpb": 0.5925635433997946, "train_bytes": 28656.70625, "train_loss_nats_per_token": 1.6822611236452318 }, { "epoch": 0.07611071607279239, "grad_norm": 0.158203125, "learning_rate": 0.0012444049770530278, "loss": 1.6597244262695312, "step": 84560, "train_bpb": 0.5915203352913493, "train_bytes": 27962.15625, "train_loss_nats_per_token": 1.6603143554890798 }, { "epoch": 0.0762423955123647, "grad_norm": 0.1474609375, "learning_rate": 0.0012437904742848872, "loss": 1.6815107345581055, "step": 84580, "train_bpb": 0.5956666743937562, "train_bytes": 28524.29375, "train_loss_nats_per_token": 1.6817621624579864 }, { "epoch": 0.076374074951937, "grad_norm": 0.146484375, "learning_rate": 0.001243176015804957, "loss": 1.671140480041504, "step": 84600, "train_bpb": 0.5900261451795576, "train_bytes": 28241.6875, "train_loss_nats_per_token": 1.6718999242132873 }, { "epoch": 0.0765057543915093, "grad_norm": 0.15625, "learning_rate": 0.0012425616017194506, "loss": 1.6799137115478515, "step": 84620, "train_bpb": 0.5934216696037043, "train_bytes": 28327.88125, "train_loss_nats_per_token": 1.6809567523928985 }, { "epoch": 0.07663743383108161, "grad_norm": 0.125, "learning_rate": 0.0012419472321345754, "loss": 1.6734209060668945, "step": 84640, "train_bpb": 0.5883106470918749, "train_bytes": 28446.6625, "train_loss_nats_per_token": 1.674195797117619 }, { "epoch": 0.07676911327065392, "grad_norm": 0.171875, "learning_rate": 0.0012413329071565323, "loss": 1.6815177917480468, "step": 84660, "train_bpb": 0.5960256353483925, "train_bytes": 28450.275, "train_loss_nats_per_token": 1.6834029469453553 }, { "epoch": 0.07690079271022622, "grad_norm": 0.15625, "learning_rate": 0.0012407186268915114, "loss": 1.672262191772461, "step": 84680, "train_bpb": 0.5895014412136282, "train_bytes": 28407.8375, "train_loss_nats_per_token": 1.6731020357082371 }, { "epoch": 0.07703247214979853, "grad_norm": 0.154296875, "learning_rate": 0.0012401043914456974, "loss": 1.6746007919311523, "step": 84700, "train_bpb": 0.5907673095872524, "train_bytes": 28535.11875, "train_loss_nats_per_token": 1.6753119228237547 }, { "epoch": 0.07716415158937083, "grad_norm": 0.16796875, "learning_rate": 0.0012394902009252675, "loss": 1.667833137512207, "step": 84720, "train_bpb": 0.592816726757976, "train_bytes": 27906.83125, "train_loss_nats_per_token": 1.6682666496317375 }, { "epoch": 0.07729583102894313, "grad_norm": 0.15234375, "learning_rate": 0.0012388760554363889, "loss": 1.673788833618164, "step": 84740, "train_bpb": 0.5953385392864536, "train_bytes": 28006.84375, "train_loss_nats_per_token": 1.6747798470998143 }, { "epoch": 0.07742751046851544, "grad_norm": 0.1337890625, "learning_rate": 0.0012382619550852228, "loss": 1.679342269897461, "step": 84760, "train_bpb": 0.5941178626965197, "train_bytes": 28408.6875, "train_loss_nats_per_token": 1.6794720641486032 }, { "epoch": 0.07755918990808774, "grad_norm": 0.134765625, "learning_rate": 0.0012376478999779226, "loss": 1.6867462158203126, "step": 84780, "train_bpb": 0.5975794750309301, "train_bytes": 28398.15, "train_loss_nats_per_token": 1.68718671710135 }, { "epoch": 0.07769086934766006, "grad_norm": 0.13671875, "learning_rate": 0.0012370338902206338, "loss": 1.6609907150268555, "step": 84800, "train_bpb": 0.5928093634447988, "train_bytes": 27646.9375, "train_loss_nats_per_token": 1.6621631506018195 }, { "epoch": 0.07782254878723237, "grad_norm": 0.193359375, "learning_rate": 0.0012364199259194922, "loss": 1.665089988708496, "step": 84820, "train_bpb": 0.5893341364621879, "train_bytes": 28646.2375, "train_loss_nats_per_token": 1.6658761401522786 }, { "epoch": 0.07795422822680467, "grad_norm": 0.130859375, "learning_rate": 0.0012358060071806288, "loss": 1.6792274475097657, "step": 84840, "train_bpb": 0.5973282569213456, "train_bytes": 27847.46875, "train_loss_nats_per_token": 1.6799884353528058 }, { "epoch": 0.07808590766637698, "grad_norm": 0.1806640625, "learning_rate": 0.0012351921341101648, "loss": 1.68502197265625, "step": 84860, "train_bpb": 0.5938210187549081, "train_bytes": 28486.85, "train_loss_nats_per_token": 1.6862895392761592 }, { "epoch": 0.07821758710594928, "grad_norm": 0.1572265625, "learning_rate": 0.0012345783068142132, "loss": 1.6819900512695312, "step": 84880, "train_bpb": 0.5915177183360523, "train_bytes": 28545.7875, "train_loss_nats_per_token": 1.683056167328191 }, { "epoch": 0.07834926654552159, "grad_norm": 0.1552734375, "learning_rate": 0.0012339645253988802, "loss": 1.6831527709960938, "step": 84900, "train_bpb": 0.5946556315043824, "train_bytes": 28617.2875, "train_loss_nats_per_token": 1.6851451792124756 }, { "epoch": 0.07848094598509389, "grad_norm": 0.126953125, "learning_rate": 0.0012333507899702644, "loss": 1.6625829696655274, "step": 84920, "train_bpb": 0.5898461447948572, "train_bytes": 28270.05625, "train_loss_nats_per_token": 1.6636932822530839 }, { "epoch": 0.0786126254246662, "grad_norm": 0.154296875, "learning_rate": 0.0012327371006344546, "loss": 1.6766450881958008, "step": 84940, "train_bpb": 0.5928607697190058, "train_bytes": 28298.7625, "train_loss_nats_per_token": 1.6772121883191564 }, { "epoch": 0.0787443048642385, "grad_norm": 0.1220703125, "learning_rate": 0.001232123457497533, "loss": 1.6801450729370118, "step": 84960, "train_bpb": 0.5947668369147635, "train_bytes": 28246.13125, "train_loss_nats_per_token": 1.6810343467653093 }, { "epoch": 0.0788759843038108, "grad_norm": 0.1484375, "learning_rate": 0.0012315098606655737, "loss": 1.659465217590332, "step": 84980, "train_bpb": 0.5897708156756434, "train_bytes": 28286.625, "train_loss_nats_per_token": 1.6597150896052535 }, { "epoch": 0.07900766374338311, "grad_norm": 0.1572265625, "learning_rate": 0.0012308963102446433, "loss": 1.6826343536376953, "step": 85000, "train_bpb": 0.5951501662745441, "train_bytes": 28351.975, "train_loss_nats_per_token": 1.6825021934140068 }, { "epoch": 0.07900766374338311, "eval_loss": 1.5235505104064941, "eval_runtime": 71.4789, "eval_samples_per_second": 13.99, "eval_steps_per_second": 13.99, "step": 85000, "train_bpb": 0.5376893247709781, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5311309611568171 }, { "epoch": 0.07913934318295542, "grad_norm": 0.1376953125, "learning_rate": 0.0012302828063407985, "loss": 1.6908088684082032, "step": 85020, "train_bpb": 0.5964222849655463, "train_bytes": 28410.825, "train_loss_nats_per_token": 1.6920217059513292 }, { "epoch": 0.07927102262252772, "grad_norm": 0.1435546875, "learning_rate": 0.0012296693490600897, "loss": 1.668879508972168, "step": 85040, "train_bpb": 0.5899301987538331, "train_bytes": 28565.425, "train_loss_nats_per_token": 1.6695563108361078 }, { "epoch": 0.07940270206210003, "grad_norm": 0.1435546875, "learning_rate": 0.0012290559385085592, "loss": 1.679759407043457, "step": 85060, "train_bpb": 0.5939315239252698, "train_bytes": 28371.58125, "train_loss_nats_per_token": 1.680145675962945 }, { "epoch": 0.07953438150167233, "grad_norm": 0.11962890625, "learning_rate": 0.00122844257479224, "loss": 1.68770751953125, "step": 85080, "train_bpb": 0.5938495691752068, "train_bytes": 28622.25, "train_loss_nats_per_token": 1.688969370875993 }, { "epoch": 0.07966606094124463, "grad_norm": 0.154296875, "learning_rate": 0.0012278292580171581, "loss": 1.6801836013793945, "step": 85100, "train_bpb": 0.5963068059826565, "train_bytes": 28146.95, "train_loss_nats_per_token": 1.6811844922298713 }, { "epoch": 0.07979774038081694, "grad_norm": 0.1474609375, "learning_rate": 0.0012272159882893308, "loss": 1.6701616287231444, "step": 85120, "train_bpb": 0.5908099167792166, "train_bytes": 28372.25, "train_loss_nats_per_token": 1.6704218908438515 }, { "epoch": 0.07992941982038924, "grad_norm": 0.1328125, "learning_rate": 0.0012266027657147683, "loss": 1.672623062133789, "step": 85140, "train_bpb": 0.5870581402485355, "train_bytes": 28467.06875, "train_loss_nats_per_token": 1.672751807248115 }, { "epoch": 0.08006109925996155, "grad_norm": 0.1484375, "learning_rate": 0.0012259895903994707, "loss": 1.6716455459594726, "step": 85160, "train_bpb": 0.5897226528890281, "train_bytes": 28389.2875, "train_loss_nats_per_token": 1.67251942180053 }, { "epoch": 0.08019277869953385, "grad_norm": 0.1435546875, "learning_rate": 0.0012253764624494316, "loss": 1.6705068588256835, "step": 85180, "train_bpb": 0.5940902357733453, "train_bytes": 28201.21875, "train_loss_nats_per_token": 1.670883258267984 }, { "epoch": 0.08032445813910616, "grad_norm": 0.2080078125, "learning_rate": 0.0012247633819706366, "loss": 1.6725255966186523, "step": 85200, "train_bpb": 0.5924155087369697, "train_bytes": 28365.775, "train_loss_nats_per_token": 1.6726118806112633 }, { "epoch": 0.08045613757867846, "grad_norm": 0.169921875, "learning_rate": 0.0012241503490690612, "loss": 1.6676738739013672, "step": 85220, "train_bpb": 0.5906681250347796, "train_bytes": 28225.5, "train_loss_nats_per_token": 1.6675684601681324 }, { "epoch": 0.08058781701825077, "grad_norm": 0.1201171875, "learning_rate": 0.0012235373638506742, "loss": 1.6812665939331055, "step": 85240, "train_bpb": 0.5937753857125508, "train_bytes": 28497.1375, "train_loss_nats_per_token": 1.6812379644717899 }, { "epoch": 0.08071949645782307, "grad_norm": 0.162109375, "learning_rate": 0.0012229244264214368, "loss": 1.6727476119995117, "step": 85260, "train_bpb": 0.5902396102027905, "train_bytes": 28378.43125, "train_loss_nats_per_token": 1.674503860168765 }, { "epoch": 0.08085117589739538, "grad_norm": 0.1923828125, "learning_rate": 0.0012223115368872994, "loss": 1.6700342178344727, "step": 85280, "train_bpb": 0.5938037010359797, "train_bytes": 28040.00625, "train_loss_nats_per_token": 1.670524629145049 }, { "epoch": 0.08098285533696768, "grad_norm": 0.15234375, "learning_rate": 0.0012216986953542063, "loss": 1.6690286636352538, "step": 85300, "train_bpb": 0.5931085115459174, "train_bytes": 28109.725, "train_loss_nats_per_token": 1.6699861360764903 }, { "epoch": 0.08111453477653999, "grad_norm": 0.1708984375, "learning_rate": 0.0012210859019280932, "loss": 1.6714973449707031, "step": 85320, "train_bpb": 0.5875501109666817, "train_bytes": 28787.425, "train_loss_nats_per_token": 1.672262510568209 }, { "epoch": 0.08124621421611229, "grad_norm": 0.142578125, "learning_rate": 0.0012204731567148875, "loss": 1.667624282836914, "step": 85340, "train_bpb": 0.5908586723701972, "train_bytes": 28323.34375, "train_loss_nats_per_token": 1.6680938207357348 }, { "epoch": 0.0813778936556846, "grad_norm": 0.169921875, "learning_rate": 0.0012198604598205069, "loss": 1.67711181640625, "step": 85360, "train_bpb": 0.5925807267991132, "train_bytes": 28293.6625, "train_loss_nats_per_token": 1.677431793244826 }, { "epoch": 0.0815095730952569, "grad_norm": 0.134765625, "learning_rate": 0.0012192478113508623, "loss": 1.6809501647949219, "step": 85380, "train_bpb": 0.5941380907514697, "train_bytes": 28009.03125, "train_loss_nats_per_token": 1.6813707404448353 }, { "epoch": 0.0816412525348292, "grad_norm": 0.1201171875, "learning_rate": 0.0012186352114118564, "loss": 1.6726613998413087, "step": 85400, "train_bpb": 0.594566674059633, "train_bytes": 28269.0, "train_loss_nats_per_token": 1.6736672785452558 }, { "epoch": 0.08177293197440151, "grad_norm": 0.1650390625, "learning_rate": 0.0012180226601093812, "loss": 1.6713655471801758, "step": 85420, "train_bpb": 0.5916933510448498, "train_bytes": 28131.79375, "train_loss_nats_per_token": 1.6720347851989898 }, { "epoch": 0.08190461141397382, "grad_norm": 0.1328125, "learning_rate": 0.001217410157549323, "loss": 1.6762025833129883, "step": 85440, "train_bpb": 0.5949904159680873, "train_bytes": 28242.725, "train_loss_nats_per_token": 1.67629247262428 }, { "epoch": 0.08203629085354612, "grad_norm": 0.1396484375, "learning_rate": 0.0012167977038375591, "loss": 1.6801307678222657, "step": 85460, "train_bpb": 0.594004644421574, "train_bytes": 28255.6625, "train_loss_nats_per_token": 1.680574740888238 }, { "epoch": 0.08216797029311844, "grad_norm": 0.171875, "learning_rate": 0.0012161852990799566, "loss": 1.6685134887695312, "step": 85480, "train_bpb": 0.5939726849444842, "train_bytes": 28134.06875, "train_loss_nats_per_token": 1.669315955392979 }, { "epoch": 0.08229964973269074, "grad_norm": 0.1826171875, "learning_rate": 0.0012155729433823757, "loss": 1.6649171829223632, "step": 85500, "train_bpb": 0.5911812494651205, "train_bytes": 28068.825, "train_loss_nats_per_token": 1.665124460812262 }, { "epoch": 0.08243132917226305, "grad_norm": 0.134765625, "learning_rate": 0.0012149606368506683, "loss": 1.6748270034790038, "step": 85520, "train_bpb": 0.5927270083237721, "train_bytes": 28329.9375, "train_loss_nats_per_token": 1.6747860933856356 }, { "epoch": 0.08256300861183535, "grad_norm": 0.1337890625, "learning_rate": 0.0012143483795906775, "loss": 1.6630218505859375, "step": 85540, "train_bpb": 0.5908288106446213, "train_bytes": 28159.74375, "train_loss_nats_per_token": 1.663021759673548 }, { "epoch": 0.08269468805140766, "grad_norm": 0.1796875, "learning_rate": 0.001213736171708237, "loss": 1.675245475769043, "step": 85560, "train_bpb": 0.591103195119461, "train_bytes": 28301.91875, "train_loss_nats_per_token": 1.6759797654230928 }, { "epoch": 0.08282636749097996, "grad_norm": 0.1533203125, "learning_rate": 0.0012131240133091724, "loss": 1.6899452209472656, "step": 85580, "train_bpb": 0.5967006886026424, "train_bytes": 28430.85, "train_loss_nats_per_token": 1.691301703801661 }, { "epoch": 0.08295804693055227, "grad_norm": 0.1650390625, "learning_rate": 0.0012125119044993024, "loss": 1.6766450881958008, "step": 85600, "train_bpb": 0.5915042404273273, "train_bytes": 28459.39375, "train_loss_nats_per_token": 1.6782590233211647 }, { "epoch": 0.08308972637012457, "grad_norm": 0.1728515625, "learning_rate": 0.0012118998453844341, "loss": 1.6763154983520507, "step": 85620, "train_bpb": 0.592111467385238, "train_bytes": 28320.75, "train_loss_nats_per_token": 1.6767052577519888 }, { "epoch": 0.08322140580969688, "grad_norm": 0.208984375, "learning_rate": 0.0012112878360703684, "loss": 1.677937889099121, "step": 85640, "train_bpb": 0.5931987387082387, "train_bytes": 28334.4875, "train_loss_nats_per_token": 1.6789429520260326 }, { "epoch": 0.08335308524926918, "grad_norm": 0.1328125, "learning_rate": 0.0012106758766628968, "loss": 1.6800081253051757, "step": 85660, "train_bpb": 0.5920380847137522, "train_bytes": 28210.55, "train_loss_nats_per_token": 1.6802173607079522 }, { "epoch": 0.08348476468884149, "grad_norm": 0.1279296875, "learning_rate": 0.001210063967267803, "loss": 1.6658079147338867, "step": 85680, "train_bpb": 0.5899573088042601, "train_bytes": 28303.0, "train_loss_nats_per_token": 1.665938438419021 }, { "epoch": 0.08361644412841379, "grad_norm": 0.1552734375, "learning_rate": 0.0012094521079908595, "loss": 1.6795059204101563, "step": 85700, "train_bpb": 0.5956184891469047, "train_bytes": 28272.70625, "train_loss_nats_per_token": 1.6798523941860721 }, { "epoch": 0.0837481235679861, "grad_norm": 0.1484375, "learning_rate": 0.001208840298937833, "loss": 1.6650808334350586, "step": 85720, "train_bpb": 0.5914760534617478, "train_bytes": 28337.20625, "train_loss_nats_per_token": 1.6652585456526077 }, { "epoch": 0.0838798030075584, "grad_norm": 0.12255859375, "learning_rate": 0.0012082285402144806, "loss": 1.6740131378173828, "step": 85740, "train_bpb": 0.5907107562632401, "train_bytes": 28327.89375, "train_loss_nats_per_token": 1.6748549810702633 }, { "epoch": 0.0840114824471307, "grad_norm": 0.1416015625, "learning_rate": 0.0012076168319265497, "loss": 1.6671234130859376, "step": 85760, "train_bpb": 0.5900825750648782, "train_bytes": 28233.69375, "train_loss_nats_per_token": 1.6680899311738824 }, { "epoch": 0.08414316188670301, "grad_norm": 0.1279296875, "learning_rate": 0.0012070051741797801, "loss": 1.6807863235473632, "step": 85780, "train_bpb": 0.5959680039573794, "train_bytes": 28380.71875, "train_loss_nats_per_token": 1.6813870600444307 }, { "epoch": 0.08427484132627532, "grad_norm": 0.11669921875, "learning_rate": 0.0012063935670799035, "loss": 1.6822565078735352, "step": 85800, "train_bpb": 0.5943128258364268, "train_bytes": 28464.28125, "train_loss_nats_per_token": 1.682655654380397 }, { "epoch": 0.08440652076584762, "grad_norm": 0.140625, "learning_rate": 0.0012057820107326403, "loss": 1.6690940856933594, "step": 85820, "train_bpb": 0.5890613349687244, "train_bytes": 28473.3, "train_loss_nats_per_token": 1.6701401955418054 }, { "epoch": 0.08453820020541992, "grad_norm": 0.154296875, "learning_rate": 0.0012051705052437047, "loss": 1.6675775527954102, "step": 85840, "train_bpb": 0.5906866064057041, "train_bytes": 28044.4375, "train_loss_nats_per_token": 1.668804161168038 }, { "epoch": 0.08466987964499223, "grad_norm": 0.1484375, "learning_rate": 0.001204559050718801, "loss": 1.6713602066040039, "step": 85860, "train_bpb": 0.5902056205776579, "train_bytes": 28270.61875, "train_loss_nats_per_token": 1.6721248784634528 }, { "epoch": 0.08480155908456453, "grad_norm": 0.130859375, "learning_rate": 0.001203947647263625, "loss": 1.6638267517089844, "step": 85880, "train_bpb": 0.5892998723849271, "train_bytes": 28242.0, "train_loss_nats_per_token": 1.6644620210140446 }, { "epoch": 0.08493323852413684, "grad_norm": 0.134765625, "learning_rate": 0.001203336294983863, "loss": 1.6731527328491211, "step": 85900, "train_bpb": 0.5931703310675642, "train_bytes": 28103.29375, "train_loss_nats_per_token": 1.6741873665204134 }, { "epoch": 0.08506491796370914, "grad_norm": 0.1513671875, "learning_rate": 0.001202724993985193, "loss": 1.6740076065063476, "step": 85920, "train_bpb": 0.5913031263504397, "train_bytes": 28378.10625, "train_loss_nats_per_token": 1.6746306987674473 }, { "epoch": 0.08519659740328145, "grad_norm": 0.140625, "learning_rate": 0.0012021137443732851, "loss": 1.667241668701172, "step": 85940, "train_bpb": 0.5891416018379186, "train_bytes": 28258.94375, "train_loss_nats_per_token": 1.6674914057772763 }, { "epoch": 0.08532827684285375, "grad_norm": 0.1318359375, "learning_rate": 0.001201502546253798, "loss": 1.6643892288208009, "step": 85960, "train_bpb": 0.5879962884387508, "train_bytes": 28467.9625, "train_loss_nats_per_token": 1.6655159754235909 }, { "epoch": 0.08545995628242606, "grad_norm": 0.1396484375, "learning_rate": 0.0012008913997323838, "loss": 1.6715732574462892, "step": 85980, "train_bpb": 0.5940904284288531, "train_bytes": 28075.2125, "train_loss_nats_per_token": 1.6726020575151772 }, { "epoch": 0.08559163572199836, "grad_norm": 0.11865234375, "learning_rate": 0.0012002803049146855, "loss": 1.663926887512207, "step": 86000, "train_bpb": 0.5882134628786162, "train_bytes": 28074.98125, "train_loss_nats_per_token": 1.6648019739293258 }, { "epoch": 0.08559163572199836, "eval_loss": 1.5227795839309692, "eval_runtime": 72.0208, "eval_samples_per_second": 13.885, "eval_steps_per_second": 13.885, "step": 86000, "train_bpb": 0.537440514119413, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5304224447802999 }, { "epoch": 0.08572331516157067, "grad_norm": 0.11669921875, "learning_rate": 0.001199669261906335, "loss": 1.6782615661621094, "step": 86020, "train_bpb": 0.5940914428200406, "train_bytes": 28345.64375, "train_loss_nats_per_token": 1.6794406317724633 }, { "epoch": 0.08585499460114297, "grad_norm": 0.15625, "learning_rate": 0.0011990582708129578, "loss": 1.6656494140625, "step": 86040, "train_bpb": 0.5916539341638238, "train_bytes": 28285.34375, "train_loss_nats_per_token": 1.6656443450127325 }, { "epoch": 0.08598667404071528, "grad_norm": 0.15234375, "learning_rate": 0.0011984473317401692, "loss": 1.6689268112182618, "step": 86060, "train_bpb": 0.5877007919183933, "train_bytes": 28702.93125, "train_loss_nats_per_token": 1.6696737268830995 }, { "epoch": 0.08611835348028758, "grad_norm": 0.134765625, "learning_rate": 0.0011978364447935764, "loss": 1.6694953918457032, "step": 86080, "train_bpb": 0.5910402219580901, "train_bytes": 28154.44375, "train_loss_nats_per_token": 1.6697659026917289 }, { "epoch": 0.08625003291985989, "grad_norm": 0.2119140625, "learning_rate": 0.0011972256100787756, "loss": 1.6693553924560547, "step": 86100, "train_bpb": 0.5925599584522491, "train_bytes": 28336.2625, "train_loss_nats_per_token": 1.6698089032440984 }, { "epoch": 0.08638171235943219, "grad_norm": 0.140625, "learning_rate": 0.001196614827701356, "loss": 1.6602701187133788, "step": 86120, "train_bpb": 0.5908016258812151, "train_bytes": 28315.8375, "train_loss_nats_per_token": 1.661310666630756 }, { "epoch": 0.08651339179900451, "grad_norm": 0.1708984375, "learning_rate": 0.0011960040977668977, "loss": 1.6746963500976562, "step": 86140, "train_bpb": 0.5914965766093578, "train_bytes": 28281.73125, "train_loss_nats_per_token": 1.6752375746134391 }, { "epoch": 0.08664507123857682, "grad_norm": 0.1298828125, "learning_rate": 0.0011953934203809697, "loss": 1.6590734481811524, "step": 86160, "train_bpb": 0.5850792135772475, "train_bytes": 28436.86875, "train_loss_nats_per_token": 1.6594241574667836 }, { "epoch": 0.08677675067814912, "grad_norm": 0.2314453125, "learning_rate": 0.001194782795649134, "loss": 1.663435173034668, "step": 86180, "train_bpb": 0.5893134175778533, "train_bytes": 28344.675, "train_loss_nats_per_token": 1.663868726308109 }, { "epoch": 0.08690843011772142, "grad_norm": 0.2080078125, "learning_rate": 0.001194172223676943, "loss": 1.661760139465332, "step": 86200, "train_bpb": 0.5871881441262362, "train_bytes": 28270.25625, "train_loss_nats_per_token": 1.6625316053089363 }, { "epoch": 0.08704010955729373, "grad_norm": 0.1708984375, "learning_rate": 0.0011935617045699398, "loss": 1.6620721817016602, "step": 86220, "train_bpb": 0.5901174482168987, "train_bytes": 28054.0125, "train_loss_nats_per_token": 1.6615667264679226 }, { "epoch": 0.08717178899686603, "grad_norm": 0.1669921875, "learning_rate": 0.0011929512384336578, "loss": 1.6815225601196289, "step": 86240, "train_bpb": 0.5927697097909344, "train_bytes": 28336.54375, "train_loss_nats_per_token": 1.6818966231722705 }, { "epoch": 0.08730346843643834, "grad_norm": 0.1513671875, "learning_rate": 0.0011923408253736217, "loss": 1.664779281616211, "step": 86260, "train_bpb": 0.5905377904018388, "train_bytes": 28365.725, "train_loss_nats_per_token": 1.6658138833453264 }, { "epoch": 0.08743514787601064, "grad_norm": 0.1318359375, "learning_rate": 0.0011917304654953484, "loss": 1.6672819137573243, "step": 86280, "train_bpb": 0.5911311110829436, "train_bytes": 28335.06875, "train_loss_nats_per_token": 1.6683137954236018 }, { "epoch": 0.08756682731558295, "grad_norm": 0.13671875, "learning_rate": 0.0011911201589043425, "loss": 1.6781049728393556, "step": 86300, "train_bpb": 0.5917089879849037, "train_bytes": 28539.89375, "train_loss_nats_per_token": 1.6786828347427205 }, { "epoch": 0.08769850675515525, "grad_norm": 0.1953125, "learning_rate": 0.001190509905706102, "loss": 1.6516740798950196, "step": 86320, "train_bpb": 0.5843443333338219, "train_bytes": 28662.225, "train_loss_nats_per_token": 1.65222873173356 }, { "epoch": 0.08783018619472756, "grad_norm": 0.205078125, "learning_rate": 0.0011898997060061159, "loss": 1.6738998413085937, "step": 86340, "train_bpb": 0.5963187731403938, "train_bytes": 27623.2, "train_loss_nats_per_token": 1.6748882325657113 }, { "epoch": 0.08796186563429986, "grad_norm": 0.1865234375, "learning_rate": 0.001189289559909861, "loss": 1.6831855773925781, "step": 86360, "train_bpb": 0.595199346773047, "train_bytes": 28259.25, "train_loss_nats_per_token": 1.6832264133306112 }, { "epoch": 0.08809354507387217, "grad_norm": 0.2138671875, "learning_rate": 0.0011886794675228076, "loss": 1.6758611679077149, "step": 86380, "train_bpb": 0.5921643755093319, "train_bytes": 28257.14375, "train_loss_nats_per_token": 1.676844314658929 }, { "epoch": 0.08822522451344447, "grad_norm": 0.177734375, "learning_rate": 0.0011880694289504161, "loss": 1.673537254333496, "step": 86400, "train_bpb": 0.5941292838025998, "train_bytes": 28196.6625, "train_loss_nats_per_token": 1.6741691931154026 }, { "epoch": 0.08835690395301678, "grad_norm": 0.1689453125, "learning_rate": 0.0011874594442981376, "loss": 1.6710268020629884, "step": 86420, "train_bpb": 0.5888901188055795, "train_bytes": 28240.6375, "train_loss_nats_per_token": 1.6719177694578176 }, { "epoch": 0.08848858339258908, "grad_norm": 0.1376953125, "learning_rate": 0.001186849513671413, "loss": 1.6709802627563477, "step": 86440, "train_bpb": 0.5913703020464732, "train_bytes": 28311.85, "train_loss_nats_per_token": 1.672643073109495 }, { "epoch": 0.08862026283216139, "grad_norm": 0.17578125, "learning_rate": 0.0011862396371756744, "loss": 1.6747396469116211, "step": 86460, "train_bpb": 0.5927704574539034, "train_bytes": 28116.4375, "train_loss_nats_per_token": 1.6755163234965187 }, { "epoch": 0.08875194227173369, "grad_norm": 0.1484375, "learning_rate": 0.0011856298149163459, "loss": 1.6689535140991212, "step": 86480, "train_bpb": 0.5872516066866604, "train_bytes": 28578.08125, "train_loss_nats_per_token": 1.670170625457925 }, { "epoch": 0.088883621711306, "grad_norm": 0.16796875, "learning_rate": 0.0011850200469988395, "loss": 1.6686365127563476, "step": 86500, "train_bpb": 0.5907965660369233, "train_bytes": 28280.58125, "train_loss_nats_per_token": 1.6693251383209875 }, { "epoch": 0.0890153011508783, "grad_norm": 0.1474609375, "learning_rate": 0.0011844103335285597, "loss": 1.6618932723999023, "step": 86520, "train_bpb": 0.5901601736832646, "train_bytes": 28323.4, "train_loss_nats_per_token": 1.6634430356914522 }, { "epoch": 0.0891469805904506, "grad_norm": 0.1982421875, "learning_rate": 0.0011838006746109013, "loss": 1.666280746459961, "step": 86540, "train_bpb": 0.5920253523426702, "train_bytes": 28339.13125, "train_loss_nats_per_token": 1.6666495302007487 }, { "epoch": 0.08927866003002291, "grad_norm": 0.1298828125, "learning_rate": 0.00118319107035125, "loss": 1.6548843383789062, "step": 86560, "train_bpb": 0.5869139149592614, "train_bytes": 28161.75625, "train_loss_nats_per_token": 1.6549245917493063 }, { "epoch": 0.08941033946959522, "grad_norm": 0.1376953125, "learning_rate": 0.001182581520854981, "loss": 1.6690713882446289, "step": 86580, "train_bpb": 0.590179230458443, "train_bytes": 28535.63125, "train_loss_nats_per_token": 1.6694332157949607 }, { "epoch": 0.08954201890916752, "grad_norm": 0.1435546875, "learning_rate": 0.0011819720262274604, "loss": 1.670628547668457, "step": 86600, "train_bpb": 0.5901989611521481, "train_bytes": 28510.725, "train_loss_nats_per_token": 1.6717345968875694 }, { "epoch": 0.08967369834873982, "grad_norm": 0.197265625, "learning_rate": 0.001181362586574046, "loss": 1.654507827758789, "step": 86620, "train_bpb": 0.5833624143658261, "train_bytes": 28579.9625, "train_loss_nats_per_token": 1.654944820477801 }, { "epoch": 0.08980537778831213, "grad_norm": 0.1298828125, "learning_rate": 0.0011807532020000843, "loss": 1.662590789794922, "step": 86640, "train_bpb": 0.5873625617511153, "train_bytes": 28374.81875, "train_loss_nats_per_token": 1.6626360599194927 }, { "epoch": 0.08993705722788443, "grad_norm": 0.1708984375, "learning_rate": 0.0011801438726109132, "loss": 1.6724597930908203, "step": 86660, "train_bpb": 0.5907188266243275, "train_bytes": 28283.0625, "train_loss_nats_per_token": 1.6721834647395504 }, { "epoch": 0.09006873666745674, "grad_norm": 0.1689453125, "learning_rate": 0.0011795345985118617, "loss": 1.6685310363769532, "step": 86680, "train_bpb": 0.5903954405827018, "train_bytes": 28156.95, "train_loss_nats_per_token": 1.6684248930004104 }, { "epoch": 0.09020041610702904, "grad_norm": 0.154296875, "learning_rate": 0.0011789253798082473, "loss": 1.6731172561645509, "step": 86700, "train_bpb": 0.5920966599376674, "train_bytes": 28152.33125, "train_loss_nats_per_token": 1.6735137868121326 }, { "epoch": 0.09033209554660135, "grad_norm": 0.208984375, "learning_rate": 0.00117831621660538, "loss": 1.6728673934936524, "step": 86720, "train_bpb": 0.5908930450124514, "train_bytes": 28295.53125, "train_loss_nats_per_token": 1.6732766273524249 }, { "epoch": 0.09046377498617365, "grad_norm": 0.1337890625, "learning_rate": 0.001177707109008559, "loss": 1.6715465545654298, "step": 86740, "train_bpb": 0.5925646585748746, "train_bytes": 28277.3875, "train_loss_nats_per_token": 1.6724248414780076 }, { "epoch": 0.09059545442574596, "grad_norm": 0.169921875, "learning_rate": 0.0011770980571230748, "loss": 1.6690071105957032, "step": 86760, "train_bpb": 0.5907151887189706, "train_bytes": 28303.95, "train_loss_nats_per_token": 1.669553911646702 }, { "epoch": 0.09072713386531826, "grad_norm": 0.140625, "learning_rate": 0.0011764890610542072, "loss": 1.6716501235961914, "step": 86780, "train_bpb": 0.5910444777733592, "train_bytes": 28552.93125, "train_loss_nats_per_token": 1.672279992836953 }, { "epoch": 0.09085881330489057, "grad_norm": 0.1875, "learning_rate": 0.0011758801209072265, "loss": 1.6539083480834962, "step": 86800, "train_bpb": 0.5863033366743433, "train_bytes": 28446.34375, "train_loss_nats_per_token": 1.654885103575704 }, { "epoch": 0.09099049274446289, "grad_norm": 0.1484375, "learning_rate": 0.0011752712367873951, "loss": 1.6672906875610352, "step": 86820, "train_bpb": 0.5943426335984605, "train_bytes": 28061.4125, "train_loss_nats_per_token": 1.668253866544174 }, { "epoch": 0.09112217218403519, "grad_norm": 0.134765625, "learning_rate": 0.0011746624087999623, "loss": 1.6601408004760743, "step": 86840, "train_bpb": 0.5854840892994955, "train_bytes": 28299.50625, "train_loss_nats_per_token": 1.6612282276196673 }, { "epoch": 0.0912538516236075, "grad_norm": 0.177734375, "learning_rate": 0.0011740536370501713, "loss": 1.657553482055664, "step": 86860, "train_bpb": 0.5896290353282763, "train_bytes": 28087.975, "train_loss_nats_per_token": 1.658019549226485 }, { "epoch": 0.0913855310631798, "grad_norm": 0.1455078125, "learning_rate": 0.001173444921643254, "loss": 1.6715084075927735, "step": 86880, "train_bpb": 0.5908846003306149, "train_bytes": 28379.19375, "train_loss_nats_per_token": 1.6712656672231643 }, { "epoch": 0.0915172105027521, "grad_norm": 0.1640625, "learning_rate": 0.001172836262684431, "loss": 1.6624736785888672, "step": 86900, "train_bpb": 0.5897968357021074, "train_bytes": 28325.68125, "train_loss_nats_per_token": 1.6631855980592227 }, { "epoch": 0.09164888994232441, "grad_norm": 0.173828125, "learning_rate": 0.0011722276602789158, "loss": 1.6552536010742187, "step": 86920, "train_bpb": 0.5836753592590206, "train_bytes": 28599.10625, "train_loss_nats_per_token": 1.6563828366576798 }, { "epoch": 0.09178056938189671, "grad_norm": 0.1455078125, "learning_rate": 0.001171619114531911, "loss": 1.6659343719482422, "step": 86940, "train_bpb": 0.5892627194988175, "train_bytes": 28196.21875, "train_loss_nats_per_token": 1.6669488909902352 }, { "epoch": 0.09191224882146902, "grad_norm": 0.1611328125, "learning_rate": 0.00117101062554861, "loss": 1.6610198974609376, "step": 86960, "train_bpb": 0.5890297349932965, "train_bytes": 28112.6875, "train_loss_nats_per_token": 1.6608290695373107 }, { "epoch": 0.09204392826104132, "grad_norm": 0.14453125, "learning_rate": 0.001170402193434194, "loss": 1.6731071472167969, "step": 86980, "train_bpb": 0.5899333527456573, "train_bytes": 28299.3375, "train_loss_nats_per_token": 1.6730513572602386 }, { "epoch": 0.09217560770061363, "grad_norm": 0.1904296875, "learning_rate": 0.0011697938182938378, "loss": 1.6603551864624024, "step": 87000, "train_bpb": 0.5905516181341522, "train_bytes": 28168.95625, "train_loss_nats_per_token": 1.6613119846615094 }, { "epoch": 0.09217560770061363, "eval_loss": 1.5225749015808105, "eval_runtime": 71.5423, "eval_samples_per_second": 13.978, "eval_steps_per_second": 13.978, "step": 87000, "train_bpb": 0.5373803621828489, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5302511553605491 }, { "epoch": 0.09230728714018593, "grad_norm": 0.1708984375, "learning_rate": 0.0011691855002327048, "loss": 1.6513519287109375, "step": 87020, "train_bpb": 0.5872617917298378, "train_bytes": 27999.6125, "train_loss_nats_per_token": 1.6522576618067302 }, { "epoch": 0.09243896657975824, "grad_norm": 0.158203125, "learning_rate": 0.0011685772393559468, "loss": 1.669655990600586, "step": 87040, "train_bpb": 0.5905777350786428, "train_bytes": 28376.0625, "train_loss_nats_per_token": 1.6710513765799133 }, { "epoch": 0.09257064601933054, "grad_norm": 0.1494140625, "learning_rate": 0.0011679690357687088, "loss": 1.6695013046264648, "step": 87060, "train_bpb": 0.5897685133190157, "train_bytes": 28211.94375, "train_loss_nats_per_token": 1.669622825807522 }, { "epoch": 0.09270232545890285, "grad_norm": 0.1630859375, "learning_rate": 0.001167360889576124, "loss": 1.6703397750854492, "step": 87080, "train_bpb": 0.5877191811008047, "train_bytes": 28522.83125, "train_loss_nats_per_token": 1.67078918953937 }, { "epoch": 0.09283400489847515, "grad_norm": 0.138671875, "learning_rate": 0.0011667528008833168, "loss": 1.662278175354004, "step": 87100, "train_bpb": 0.5920153151141699, "train_bytes": 27652.8125, "train_loss_nats_per_token": 1.6632706355286224 }, { "epoch": 0.09296568433804746, "grad_norm": 0.1181640625, "learning_rate": 0.0011661447697954, "loss": 1.6753955841064454, "step": 87120, "train_bpb": 0.5937687004193959, "train_bytes": 28473.30625, "train_loss_nats_per_token": 1.6760231685816935 }, { "epoch": 0.09309736377761976, "grad_norm": 0.146484375, "learning_rate": 0.001165536796417478, "loss": 1.6666479110717773, "step": 87140, "train_bpb": 0.5906223540943617, "train_bytes": 28370.84375, "train_loss_nats_per_token": 1.6672366082683117 }, { "epoch": 0.09322904321719207, "grad_norm": 0.1171875, "learning_rate": 0.0011649288808546448, "loss": 1.6621421813964843, "step": 87160, "train_bpb": 0.5864066598901386, "train_bytes": 28507.5625, "train_loss_nats_per_token": 1.6617718295995856 }, { "epoch": 0.09336072265676437, "grad_norm": 0.1669921875, "learning_rate": 0.0011643210232119838, "loss": 1.6809309005737305, "step": 87180, "train_bpb": 0.5896728608243755, "train_bytes": 28548.66875, "train_loss_nats_per_token": 1.6811281077325135 }, { "epoch": 0.09349240209633668, "grad_norm": 0.1796875, "learning_rate": 0.001163713223594569, "loss": 1.670355987548828, "step": 87200, "train_bpb": 0.5914737791122666, "train_bytes": 28477.4125, "train_loss_nats_per_token": 1.6708524850704918 }, { "epoch": 0.09362408153590898, "grad_norm": 0.166015625, "learning_rate": 0.001163105482107465, "loss": 1.6728534698486328, "step": 87220, "train_bpb": 0.5925013387944075, "train_bytes": 28206.9, "train_loss_nats_per_token": 1.6734527910594705 }, { "epoch": 0.09375576097548129, "grad_norm": 0.1416015625, "learning_rate": 0.0011624977988557248, "loss": 1.6686277389526367, "step": 87240, "train_bpb": 0.5943613786794346, "train_bytes": 28102.46875, "train_loss_nats_per_token": 1.669208735570949 }, { "epoch": 0.09388744041505359, "grad_norm": 0.12255859375, "learning_rate": 0.0011618901739443917, "loss": 1.6749322891235352, "step": 87260, "train_bpb": 0.5902472996675483, "train_bytes": 28641.34375, "train_loss_nats_per_token": 1.6756312964920372 }, { "epoch": 0.0940191198546259, "grad_norm": 0.12060546875, "learning_rate": 0.0011612826074785003, "loss": 1.6614625930786133, "step": 87280, "train_bpb": 0.5892264077570201, "train_bytes": 28037.7, "train_loss_nats_per_token": 1.6618289175289203 }, { "epoch": 0.0941507992941982, "grad_norm": 0.189453125, "learning_rate": 0.0011606750995630743, "loss": 1.6734134674072265, "step": 87300, "train_bpb": 0.5899556772682547, "train_bytes": 28525.5, "train_loss_nats_per_token": 1.6737091643791515 }, { "epoch": 0.0942824787337705, "grad_norm": 0.1572265625, "learning_rate": 0.0011600676503031259, "loss": 1.6651338577270507, "step": 87320, "train_bpb": 0.5903399158002779, "train_bytes": 28059.30625, "train_loss_nats_per_token": 1.665631535008022 }, { "epoch": 0.09441415817334281, "grad_norm": 0.140625, "learning_rate": 0.0011594602598036592, "loss": 1.6758541107177733, "step": 87340, "train_bpb": 0.5907867721346829, "train_bytes": 28305.175, "train_loss_nats_per_token": 1.6774436847103413 }, { "epoch": 0.09454583761291512, "grad_norm": 0.1416015625, "learning_rate": 0.0011588529281696678, "loss": 1.676002311706543, "step": 87360, "train_bpb": 0.5922807723183089, "train_bytes": 28473.5, "train_loss_nats_per_token": 1.6769175750629075 }, { "epoch": 0.09467751705248742, "grad_norm": 0.1748046875, "learning_rate": 0.0011582456555061333, "loss": 1.6726741790771484, "step": 87380, "train_bpb": 0.592189951260311, "train_bytes": 28105.48125, "train_loss_nats_per_token": 1.6734932298324674 }, { "epoch": 0.09480919649205972, "grad_norm": 0.17578125, "learning_rate": 0.0011576384419180292, "loss": 1.6744997024536132, "step": 87400, "train_bpb": 0.5916616243369641, "train_bytes": 28304.375, "train_loss_nats_per_token": 1.6754294273715817 }, { "epoch": 0.09494087593163203, "grad_norm": 0.1484375, "learning_rate": 0.001157031287510319, "loss": 1.669887161254883, "step": 87420, "train_bpb": 0.5890845771112801, "train_bytes": 28408.7125, "train_loss_nats_per_token": 1.6702250365786357 }, { "epoch": 0.09507255537120433, "grad_norm": 0.1435546875, "learning_rate": 0.001156424192387953, "loss": 1.6832225799560547, "step": 87440, "train_bpb": 0.5947772087715947, "train_bytes": 28292.96875, "train_loss_nats_per_token": 1.683804091892692 }, { "epoch": 0.09520423481077664, "grad_norm": 0.150390625, "learning_rate": 0.0011558171566558744, "loss": 1.693549346923828, "step": 87460, "train_bpb": 0.597174188052186, "train_bytes": 28268.325, "train_loss_nats_per_token": 1.6934335444603366 }, { "epoch": 0.09533591425034894, "grad_norm": 0.15234375, "learning_rate": 0.001155210180419015, "loss": 1.6674745559692383, "step": 87480, "train_bpb": 0.585341379160304, "train_bytes": 28383.16875, "train_loss_nats_per_token": 1.6676267961515077 }, { "epoch": 0.09546759368992126, "grad_norm": 0.1318359375, "learning_rate": 0.001154603263782297, "loss": 1.6751436233520507, "step": 87500, "train_bpb": 0.5920685264972915, "train_bytes": 28097.05, "train_loss_nats_per_token": 1.6759408076309945 }, { "epoch": 0.09559927312949357, "grad_norm": 0.130859375, "learning_rate": 0.00115399640685063, "loss": 1.6819177627563477, "step": 87520, "train_bpb": 0.5967360402532546, "train_bytes": 28083.03125, "train_loss_nats_per_token": 1.682479379614896 }, { "epoch": 0.09573095256906587, "grad_norm": 0.197265625, "learning_rate": 0.0011533896097289157, "loss": 1.6728656768798829, "step": 87540, "train_bpb": 0.5907564688579615, "train_bytes": 28569.3, "train_loss_nats_per_token": 1.6731199595602793 }, { "epoch": 0.09586263200863818, "grad_norm": 0.1279296875, "learning_rate": 0.0011527828725220455, "loss": 1.6761903762817383, "step": 87560, "train_bpb": 0.5898826292901429, "train_bytes": 28664.275, "train_loss_nats_per_token": 1.676161491694361 }, { "epoch": 0.09599431144821048, "grad_norm": 0.1787109375, "learning_rate": 0.001152176195334898, "loss": 1.6733413696289063, "step": 87580, "train_bpb": 0.5892124396480541, "train_bytes": 28502.09375, "train_loss_nats_per_token": 1.674040610370329 }, { "epoch": 0.09612599088778279, "grad_norm": 0.14453125, "learning_rate": 0.0011515695782723435, "loss": 1.6838531494140625, "step": 87600, "train_bpb": 0.5966900494594509, "train_bytes": 28188.85625, "train_loss_nats_per_token": 1.684567248798027 }, { "epoch": 0.09625767032735509, "grad_norm": 0.1337890625, "learning_rate": 0.001150963021439242, "loss": 1.672330093383789, "step": 87620, "train_bpb": 0.5924168671875597, "train_bytes": 28154.26875, "train_loss_nats_per_token": 1.6739370117540995 }, { "epoch": 0.0963893497669274, "grad_norm": 0.1748046875, "learning_rate": 0.0011503565249404428, "loss": 1.670847511291504, "step": 87640, "train_bpb": 0.590174661088782, "train_bytes": 28101.98125, "train_loss_nats_per_token": 1.6717372243788167 }, { "epoch": 0.0965210292064997, "grad_norm": 0.1474609375, "learning_rate": 0.0011497500888807833, "loss": 1.6740524291992187, "step": 87660, "train_bpb": 0.5924013022159236, "train_bytes": 28399.025, "train_loss_nats_per_token": 1.6746585883990255 }, { "epoch": 0.096652708646072, "grad_norm": 0.130859375, "learning_rate": 0.0011491437133650923, "loss": 1.674867820739746, "step": 87680, "train_bpb": 0.5943156936015702, "train_bytes": 28062.30625, "train_loss_nats_per_token": 1.675606381562483 }, { "epoch": 0.09678438808564431, "grad_norm": 0.1806640625, "learning_rate": 0.0011485373984981878, "loss": 1.6699365615844726, "step": 87700, "train_bpb": 0.5896574102108159, "train_bytes": 28530.225, "train_loss_nats_per_token": 1.6711379047913828 }, { "epoch": 0.09691606752521661, "grad_norm": 0.130859375, "learning_rate": 0.0011479311443848763, "loss": 1.6781232833862305, "step": 87720, "train_bpb": 0.5930406917307421, "train_bytes": 28443.68125, "train_loss_nats_per_token": 1.6784363803577966 }, { "epoch": 0.09704774696478892, "grad_norm": 0.1220703125, "learning_rate": 0.0011473249511299547, "loss": 1.6656906127929687, "step": 87740, "train_bpb": 0.5862844833149374, "train_bytes": 28660.05, "train_loss_nats_per_token": 1.6657155687342344 }, { "epoch": 0.09717942640436122, "grad_norm": 0.140625, "learning_rate": 0.0011467188188382096, "loss": 1.6831552505493164, "step": 87760, "train_bpb": 0.5936163826694971, "train_bytes": 28397.95625, "train_loss_nats_per_token": 1.6831865479745642 }, { "epoch": 0.09731110584393353, "grad_norm": 0.1455078125, "learning_rate": 0.0011461127476144158, "loss": 1.6755645751953125, "step": 87780, "train_bpb": 0.5928827329682708, "train_bytes": 28519.2125, "train_loss_nats_per_token": 1.6758010753887072 }, { "epoch": 0.09744278528350583, "grad_norm": 0.1708984375, "learning_rate": 0.0011455067375633389, "loss": 1.674932861328125, "step": 87800, "train_bpb": 0.5937973909646829, "train_bytes": 28364.1125, "train_loss_nats_per_token": 1.67553248151111 }, { "epoch": 0.09757446472307814, "grad_norm": 0.1318359375, "learning_rate": 0.0011449007887897333, "loss": 1.6828474044799804, "step": 87820, "train_bpb": 0.5961538604016919, "train_bytes": 28176.15625, "train_loss_nats_per_token": 1.6831083887910854 }, { "epoch": 0.09770614416265044, "grad_norm": 0.16015625, "learning_rate": 0.0011442949013983437, "loss": 1.6827945709228516, "step": 87840, "train_bpb": 0.5931952140155676, "train_bytes": 28056.80625, "train_loss_nats_per_token": 1.6832756937292872 }, { "epoch": 0.09783782360222275, "grad_norm": 0.1650390625, "learning_rate": 0.001143689075493902, "loss": 1.6689956665039063, "step": 87860, "train_bpb": 0.5921351495222825, "train_bytes": 28258.45, "train_loss_nats_per_token": 1.66908097128645 }, { "epoch": 0.09796950304179505, "grad_norm": 0.146484375, "learning_rate": 0.0011430833111811312, "loss": 1.6811298370361327, "step": 87880, "train_bpb": 0.5916456314079457, "train_bytes": 28835.4125, "train_loss_nats_per_token": 1.681950384239801 }, { "epoch": 0.09810118248136736, "grad_norm": 0.1572265625, "learning_rate": 0.0011424776085647444, "loss": 1.666173553466797, "step": 87900, "train_bpb": 0.5882483917819404, "train_bytes": 28431.00625, "train_loss_nats_per_token": 1.6666777835788757 }, { "epoch": 0.09823286192093966, "grad_norm": 0.125, "learning_rate": 0.0011418719677494416, "loss": 1.6630800247192383, "step": 87920, "train_bpb": 0.5895252480707829, "train_bytes": 28132.9625, "train_loss_nats_per_token": 1.6636898283727768 }, { "epoch": 0.09836454136051197, "grad_norm": 0.1572265625, "learning_rate": 0.0011412663888399142, "loss": 1.675796890258789, "step": 87940, "train_bpb": 0.5936669282033088, "train_bytes": 28222.89375, "train_loss_nats_per_token": 1.6766692447696259 }, { "epoch": 0.09849622080008427, "grad_norm": 0.1494140625, "learning_rate": 0.0011406608719408426, "loss": 1.66473388671875, "step": 87960, "train_bpb": 0.5901738357777141, "train_bytes": 28255.83125, "train_loss_nats_per_token": 1.664859825618771 }, { "epoch": 0.09862790023965658, "grad_norm": 0.1513671875, "learning_rate": 0.0011400554171568948, "loss": 1.6667367935180664, "step": 87980, "train_bpb": 0.5874148623817068, "train_bytes": 28478.8625, "train_loss_nats_per_token": 1.667295884021062 }, { "epoch": 0.09875957967922888, "grad_norm": 0.12158203125, "learning_rate": 0.00113945002459273, "loss": 1.6639467239379884, "step": 88000, "train_bpb": 0.5871068885346096, "train_bytes": 28539.6875, "train_loss_nats_per_token": 1.6641662400609079 }, { "epoch": 0.09875957967922888, "eval_loss": 1.5232092142105103, "eval_runtime": 71.3113, "eval_samples_per_second": 14.023, "eval_steps_per_second": 14.023, "step": 88000, "train_bpb": 0.5375787564743064, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.530816105468674 }, { "epoch": 0.09889125911880119, "grad_norm": 0.140625, "learning_rate": 0.0011388446943529959, "loss": 1.6660057067871095, "step": 88020, "train_bpb": 0.5920057045668123, "train_bytes": 28359.0, "train_loss_nats_per_token": 1.6671922240034724 }, { "epoch": 0.09902293855837349, "grad_norm": 0.13671875, "learning_rate": 0.0011382394265423302, "loss": 1.670516014099121, "step": 88040, "train_bpb": 0.5931207192903881, "train_bytes": 28164.1375, "train_loss_nats_per_token": 1.672040537636474 }, { "epoch": 0.0991546179979458, "grad_norm": 0.142578125, "learning_rate": 0.0011376342212653578, "loss": 1.670589065551758, "step": 88060, "train_bpb": 0.5919112177597051, "train_bytes": 28011.75, "train_loss_nats_per_token": 1.6709158435680362 }, { "epoch": 0.0992862974375181, "grad_norm": 0.130859375, "learning_rate": 0.0011370290786266947, "loss": 1.6789680480957032, "step": 88080, "train_bpb": 0.592042217287551, "train_bytes": 28384.45, "train_loss_nats_per_token": 1.6788178987478302 }, { "epoch": 0.0994179768770904, "grad_norm": 0.150390625, "learning_rate": 0.0011364239987309462, "loss": 1.6681821823120118, "step": 88100, "train_bpb": 0.5895091808172432, "train_bytes": 28527.29375, "train_loss_nats_per_token": 1.6685241063640632 }, { "epoch": 0.09954965631666271, "grad_norm": 0.1572265625, "learning_rate": 0.0011358189816827046, "loss": 1.6635183334350585, "step": 88120, "train_bpb": 0.5869176696008002, "train_bytes": 28774.61875, "train_loss_nats_per_token": 1.6645908401295184 }, { "epoch": 0.09968133575623501, "grad_norm": 0.18359375, "learning_rate": 0.0011352140275865533, "loss": 1.678643035888672, "step": 88140, "train_bpb": 0.5947880760812311, "train_bytes": 28341.68125, "train_loss_nats_per_token": 1.6793747721302703 }, { "epoch": 0.09981301519580732, "grad_norm": 0.177734375, "learning_rate": 0.0011346091365470644, "loss": 1.663510513305664, "step": 88160, "train_bpb": 0.5903624748677182, "train_bytes": 28012.48125, "train_loss_nats_per_token": 1.6639821461469815 }, { "epoch": 0.09994469463537964, "grad_norm": 0.14453125, "learning_rate": 0.0011340043086687998, "loss": 1.677802276611328, "step": 88180, "train_bpb": 0.5929164111708853, "train_bytes": 28302.79375, "train_loss_nats_per_token": 1.6783513710205413 }, { "epoch": 0.10007637407495194, "grad_norm": 0.1748046875, "learning_rate": 0.001133399544056308, "loss": 1.6771831512451172, "step": 88200, "train_bpb": 0.5871929377450582, "train_bytes": 28783.18125, "train_loss_nats_per_token": 1.6781310916032768 }, { "epoch": 0.10020805351452425, "grad_norm": 0.1337890625, "learning_rate": 0.0011327948428141292, "loss": 1.6573051452636718, "step": 88220, "train_bpb": 0.5883915710555496, "train_bytes": 27962.15625, "train_loss_nats_per_token": 1.6584086794997654 }, { "epoch": 0.10033973295409655, "grad_norm": 0.17578125, "learning_rate": 0.001132190205046792, "loss": 1.6682657241821288, "step": 88240, "train_bpb": 0.5905583064236286, "train_bytes": 28425.575, "train_loss_nats_per_token": 1.6692130227810835 }, { "epoch": 0.10047141239366886, "grad_norm": 0.125, "learning_rate": 0.0011315856308588123, "loss": 1.6653078079223633, "step": 88260, "train_bpb": 0.5910518215366547, "train_bytes": 28167.5125, "train_loss_nats_per_token": 1.6656622239943997 }, { "epoch": 0.10060309183324116, "grad_norm": 0.1953125, "learning_rate": 0.0011309811203546976, "loss": 1.6746637344360351, "step": 88280, "train_bpb": 0.5904675822641714, "train_bytes": 28260.15625, "train_loss_nats_per_token": 1.6750284023796507 }, { "epoch": 0.10073477127281347, "grad_norm": 0.1787109375, "learning_rate": 0.0011303766736389434, "loss": 1.6878007888793944, "step": 88300, "train_bpb": 0.5956920057195322, "train_bytes": 28409.95, "train_loss_nats_per_token": 1.6881909281601888 }, { "epoch": 0.10086645071238577, "grad_norm": 0.146484375, "learning_rate": 0.0011297722908160327, "loss": 1.6705928802490235, "step": 88320, "train_bpb": 0.5920251410017399, "train_bytes": 28440.35, "train_loss_nats_per_token": 1.6716464037765686 }, { "epoch": 0.10099813015195808, "grad_norm": 0.16796875, "learning_rate": 0.0011291679719904397, "loss": 1.664925765991211, "step": 88340, "train_bpb": 0.5884356897606039, "train_bytes": 28534.025, "train_loss_nats_per_token": 1.665708844602257 }, { "epoch": 0.10112980959153038, "grad_norm": 0.14453125, "learning_rate": 0.0011285637172666258, "loss": 1.6708709716796875, "step": 88360, "train_bpb": 0.5904967308082341, "train_bytes": 28352.14375, "train_loss_nats_per_token": 1.6712951671968233 }, { "epoch": 0.10126148903110269, "grad_norm": 0.1806640625, "learning_rate": 0.0011279595267490435, "loss": 1.6739240646362306, "step": 88380, "train_bpb": 0.5918634424439758, "train_bytes": 28258.06875, "train_loss_nats_per_token": 1.6746200830791484 }, { "epoch": 0.10139316847067499, "grad_norm": 0.1591796875, "learning_rate": 0.0011273554005421312, "loss": 1.667422103881836, "step": 88400, "train_bpb": 0.5882167638117516, "train_bytes": 28327.425, "train_loss_nats_per_token": 1.6676236717664983 }, { "epoch": 0.1015248479102473, "grad_norm": 0.1689453125, "learning_rate": 0.0011267513387503182, "loss": 1.6760103225708007, "step": 88420, "train_bpb": 0.5974019650358472, "train_bytes": 27944.50625, "train_loss_nats_per_token": 1.6780278628591652 }, { "epoch": 0.1016565273498196, "grad_norm": 0.12890625, "learning_rate": 0.0011261473414780232, "loss": 1.6776603698730468, "step": 88440, "train_bpb": 0.5922281846422475, "train_bytes": 28329.70625, "train_loss_nats_per_token": 1.6793481736388922 }, { "epoch": 0.1017882067893919, "grad_norm": 0.146484375, "learning_rate": 0.0011255434088296512, "loss": 1.6810413360595704, "step": 88460, "train_bpb": 0.5909777767314205, "train_bytes": 28632.5125, "train_loss_nats_per_token": 1.6810157618146253 }, { "epoch": 0.10191988622896421, "grad_norm": 0.1337890625, "learning_rate": 0.0011249395409095985, "loss": 1.6690944671630858, "step": 88480, "train_bpb": 0.5902942539105662, "train_bytes": 28436.8875, "train_loss_nats_per_token": 1.66947345162981 }, { "epoch": 0.10205156566853651, "grad_norm": 0.1435546875, "learning_rate": 0.0011243357378222499, "loss": 1.6702360153198241, "step": 88500, "train_bpb": 0.5911096715535124, "train_bytes": 28545.91875, "train_loss_nats_per_token": 1.6709399364686994 }, { "epoch": 0.10218324510810882, "grad_norm": 0.14453125, "learning_rate": 0.001123731999671977, "loss": 1.6735252380371093, "step": 88520, "train_bpb": 0.5873535847046618, "train_bytes": 28675.79375, "train_loss_nats_per_token": 1.6734871737226638 }, { "epoch": 0.10231492454768112, "grad_norm": 0.1572265625, "learning_rate": 0.001123128326563142, "loss": 1.6624927520751953, "step": 88540, "train_bpb": 0.5883811499841098, "train_bytes": 28016.675, "train_loss_nats_per_token": 1.663558627866 }, { "epoch": 0.10244660398725343, "grad_norm": 0.1357421875, "learning_rate": 0.0011225247186000958, "loss": 1.6699954986572265, "step": 88560, "train_bpb": 0.5910153108528724, "train_bytes": 28121.39375, "train_loss_nats_per_token": 1.6708194391827291 }, { "epoch": 0.10257828342682573, "grad_norm": 0.17578125, "learning_rate": 0.0011219211758871784, "loss": 1.6724540710449218, "step": 88580, "train_bpb": 0.5900050565707025, "train_bytes": 28354.6625, "train_loss_nats_per_token": 1.6730940402705798 }, { "epoch": 0.10270996286639804, "grad_norm": 0.2158203125, "learning_rate": 0.0011213176985287164, "loss": 1.6666105270385743, "step": 88600, "train_bpb": 0.5922440241006074, "train_bytes": 28313.6375, "train_loss_nats_per_token": 1.6672511859048136 }, { "epoch": 0.10284164230597034, "grad_norm": 0.1806640625, "learning_rate": 0.0011207142866290266, "loss": 1.6558797836303711, "step": 88620, "train_bpb": 0.5856061869814234, "train_bytes": 28384.5375, "train_loss_nats_per_token": 1.65642324574692 }, { "epoch": 0.10297332174554265, "grad_norm": 0.125, "learning_rate": 0.0011201109402924159, "loss": 1.6693668365478516, "step": 88640, "train_bpb": 0.5903386800182227, "train_bytes": 28312.025, "train_loss_nats_per_token": 1.66975207977184 }, { "epoch": 0.10310500118511495, "grad_norm": 0.146484375, "learning_rate": 0.0011195076596231764, "loss": 1.6798166275024413, "step": 88660, "train_bpb": 0.5930591568641127, "train_bytes": 28359.4125, "train_loss_nats_per_token": 1.6806920363141657 }, { "epoch": 0.10323668062468726, "grad_norm": 0.197265625, "learning_rate": 0.0011189044447255918, "loss": 1.6584182739257813, "step": 88680, "train_bpb": 0.5857698648752939, "train_bytes": 28416.35, "train_loss_nats_per_token": 1.6593947876281936 }, { "epoch": 0.10336836006425956, "grad_norm": 0.1396484375, "learning_rate": 0.0011183012957039335, "loss": 1.6567291259765624, "step": 88700, "train_bpb": 0.5842370218547066, "train_bytes": 28463.14375, "train_loss_nats_per_token": 1.6577078539078145 }, { "epoch": 0.10350003950383187, "grad_norm": 0.1337890625, "learning_rate": 0.001117698212662462, "loss": 1.6554121017456054, "step": 88720, "train_bpb": 0.5819172150065689, "train_bytes": 28398.875, "train_loss_nats_per_token": 1.656391675668537 }, { "epoch": 0.10363171894340417, "grad_norm": 0.12353515625, "learning_rate": 0.0011170951957054241, "loss": 1.6594512939453125, "step": 88740, "train_bpb": 0.588434131239655, "train_bytes": 28204.2625, "train_loss_nats_per_token": 1.66024808312835 }, { "epoch": 0.10376339838297648, "grad_norm": 0.1552734375, "learning_rate": 0.001116492244937058, "loss": 1.6700307846069335, "step": 88760, "train_bpb": 0.591729724742275, "train_bytes": 28111.35625, "train_loss_nats_per_token": 1.6703750966777653 }, { "epoch": 0.10389507782254878, "grad_norm": 0.189453125, "learning_rate": 0.00111588936046159, "loss": 1.6673368453979491, "step": 88780, "train_bpb": 0.5882449142364926, "train_bytes": 28342.35625, "train_loss_nats_per_token": 1.6684033519113883 }, { "epoch": 0.10402675726212109, "grad_norm": 0.1474609375, "learning_rate": 0.0011152865423832328, "loss": 1.6674606323242187, "step": 88800, "train_bpb": 0.5928432928993652, "train_bytes": 28353.4375, "train_loss_nats_per_token": 1.6680883872360552 }, { "epoch": 0.10415843670169339, "grad_norm": 0.1923828125, "learning_rate": 0.00111468379080619, "loss": 1.662862205505371, "step": 88820, "train_bpb": 0.5917808149092678, "train_bytes": 27976.64375, "train_loss_nats_per_token": 1.6639769691949093 }, { "epoch": 0.10429011614126571, "grad_norm": 0.1435546875, "learning_rate": 0.0011140811058346536, "loss": 1.659226417541504, "step": 88840, "train_bpb": 0.5885903293432585, "train_bytes": 28380.45, "train_loss_nats_per_token": 1.6601655522163161 }, { "epoch": 0.10442179558083801, "grad_norm": 0.1396484375, "learning_rate": 0.0011134784875728016, "loss": 1.6600034713745118, "step": 88860, "train_bpb": 0.5907437201655246, "train_bytes": 28049.86875, "train_loss_nats_per_token": 1.66131033392486 }, { "epoch": 0.10455347502041032, "grad_norm": 0.1494140625, "learning_rate": 0.0011128759361248035, "loss": 1.684718132019043, "step": 88880, "train_bpb": 0.5938793311086437, "train_bytes": 28402.5, "train_loss_nats_per_token": 1.6845594914901714 }, { "epoch": 0.10468515445998262, "grad_norm": 0.1376953125, "learning_rate": 0.0011122734515948151, "loss": 1.6525197982788087, "step": 88900, "train_bpb": 0.5834636185966054, "train_bytes": 28589.94375, "train_loss_nats_per_token": 1.65407343579424 }, { "epoch": 0.10481683389955493, "grad_norm": 0.12158203125, "learning_rate": 0.0011116710340869826, "loss": 1.6791912078857423, "step": 88920, "train_bpb": 0.5935113682525719, "train_bytes": 28303.3375, "train_loss_nats_per_token": 1.6795043471009008 }, { "epoch": 0.10494851333912723, "grad_norm": 0.150390625, "learning_rate": 0.0011110686837054384, "loss": 1.6636697769165039, "step": 88940, "train_bpb": 0.5843363624358435, "train_bytes": 28653.875, "train_loss_nats_per_token": 1.6651321016040084 }, { "epoch": 0.10508019277869954, "grad_norm": 0.1591796875, "learning_rate": 0.0011104664005543048, "loss": 1.6734809875488281, "step": 88960, "train_bpb": 0.5905379268654427, "train_bytes": 28377.58125, "train_loss_nats_per_token": 1.6739751485198788 }, { "epoch": 0.10521187221827184, "grad_norm": 0.1611328125, "learning_rate": 0.0011098641847376927, "loss": 1.6471677780151368, "step": 88980, "train_bpb": 0.584364114646745, "train_bytes": 28206.21875, "train_loss_nats_per_token": 1.648754094708039 }, { "epoch": 0.10534355165784415, "grad_norm": 0.1474609375, "learning_rate": 0.0011092620363596993, "loss": 1.66516170501709, "step": 89000, "train_bpb": 0.5887320425301442, "train_bytes": 28389.2125, "train_loss_nats_per_token": 1.665239936537273 }, { "epoch": 0.10534355165784415, "eval_loss": 1.522652506828308, "eval_runtime": 73.7991, "eval_samples_per_second": 13.55, "eval_steps_per_second": 13.55, "step": 89000, "train_bpb": 0.537400586627503, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5303087467464196 }, { "epoch": 0.10547523109741645, "grad_norm": 0.12353515625, "learning_rate": 0.0011086599555244123, "loss": 1.6778255462646485, "step": 89020, "train_bpb": 0.5952491045427132, "train_bytes": 28230.30625, "train_loss_nats_per_token": 1.6781661773670977 }, { "epoch": 0.10560691053698876, "grad_norm": 0.1318359375, "learning_rate": 0.0011080579423359074, "loss": 1.656721305847168, "step": 89040, "train_bpb": 0.5876909652394445, "train_bytes": 28069.29375, "train_loss_nats_per_token": 1.6578113511831054 }, { "epoch": 0.10573858997656106, "grad_norm": 0.1806640625, "learning_rate": 0.0011074559968982482, "loss": 1.6627983093261718, "step": 89060, "train_bpb": 0.5868443416030662, "train_bytes": 28454.475, "train_loss_nats_per_token": 1.6632666298266483 }, { "epoch": 0.10587026941613337, "grad_norm": 0.150390625, "learning_rate": 0.0011068541193154857, "loss": 1.6662485122680664, "step": 89080, "train_bpb": 0.5871640599994792, "train_bytes": 28354.025, "train_loss_nats_per_token": 1.6668250608238924 }, { "epoch": 0.10600194885570567, "grad_norm": 0.150390625, "learning_rate": 0.0011062523096916606, "loss": 1.6551013946533204, "step": 89100, "train_bpb": 0.5862718969085474, "train_bytes": 28396.7375, "train_loss_nats_per_token": 1.6575043503732503 }, { "epoch": 0.10613362829527798, "grad_norm": 0.142578125, "learning_rate": 0.0011056505681308023, "loss": 1.6689748764038086, "step": 89120, "train_bpb": 0.5892921208633939, "train_bytes": 28449.425, "train_loss_nats_per_token": 1.66907586068156 }, { "epoch": 0.10626530773485028, "grad_norm": 0.189453125, "learning_rate": 0.0011050488947369256, "loss": 1.661665916442871, "step": 89140, "train_bpb": 0.5908658795110948, "train_bytes": 28092.825, "train_loss_nats_per_token": 1.6623096126665335 }, { "epoch": 0.10639698717442259, "grad_norm": 0.1669921875, "learning_rate": 0.001104447289614036, "loss": 1.668121910095215, "step": 89160, "train_bpb": 0.5881870416929063, "train_bytes": 28255.00625, "train_loss_nats_per_token": 1.6694834434057275 }, { "epoch": 0.10652866661399489, "grad_norm": 0.255859375, "learning_rate": 0.0011038457528661277, "loss": 1.6636648178100586, "step": 89180, "train_bpb": 0.5891182639461445, "train_bytes": 28431.96875, "train_loss_nats_per_token": 1.6646710187077751 }, { "epoch": 0.1066603460535672, "grad_norm": 0.1650390625, "learning_rate": 0.0011032442845971804, "loss": 1.6499715805053712, "step": 89200, "train_bpb": 0.5827789687315479, "train_bytes": 28450.075, "train_loss_nats_per_token": 1.650648328579086 }, { "epoch": 0.1067920254931395, "grad_norm": 0.138671875, "learning_rate": 0.0011026428849111643, "loss": 1.6622631072998046, "step": 89220, "train_bpb": 0.586934922887601, "train_bytes": 28348.65, "train_loss_nats_per_token": 1.662597241830455 }, { "epoch": 0.1069237049327118, "grad_norm": 0.125, "learning_rate": 0.0011020415539120367, "loss": 1.67215576171875, "step": 89240, "train_bpb": 0.5890577900331692, "train_bytes": 28210.275, "train_loss_nats_per_token": 1.6733838133762748 }, { "epoch": 0.10705538437228411, "grad_norm": 0.138671875, "learning_rate": 0.001101440291703744, "loss": 1.6660005569458007, "step": 89260, "train_bpb": 0.5890759185516077, "train_bytes": 28413.275, "train_loss_nats_per_token": 1.6665827977280685 }, { "epoch": 0.10718706381185641, "grad_norm": 0.140625, "learning_rate": 0.0011008390983902189, "loss": 1.6613252639770508, "step": 89280, "train_bpb": 0.5867012045877086, "train_bytes": 28449.44375, "train_loss_nats_per_token": 1.6620757977287643 }, { "epoch": 0.10731874325142872, "grad_norm": 0.142578125, "learning_rate": 0.0011002379740753837, "loss": 1.6564794540405274, "step": 89300, "train_bpb": 0.5884060752393176, "train_bytes": 28075.46875, "train_loss_nats_per_token": 1.6578951757646188 }, { "epoch": 0.10745042269100102, "grad_norm": 0.158203125, "learning_rate": 0.0010996369188631487, "loss": 1.6716167449951171, "step": 89320, "train_bpb": 0.5894156998873664, "train_bytes": 28384.51875, "train_loss_nats_per_token": 1.6721046089897427 }, { "epoch": 0.10758210213057333, "grad_norm": 0.1513671875, "learning_rate": 0.0010990359328574115, "loss": 1.6585203170776368, "step": 89340, "train_bpb": 0.5896391025934544, "train_bytes": 27907.075, "train_loss_nats_per_token": 1.659855038766223 }, { "epoch": 0.10771378157014563, "grad_norm": 0.15234375, "learning_rate": 0.0010984350161620578, "loss": 1.6747468948364257, "step": 89360, "train_bpb": 0.590492173507608, "train_bytes": 28420.4125, "train_loss_nats_per_token": 1.6758888135625485 }, { "epoch": 0.10784546100971794, "grad_norm": 0.1416015625, "learning_rate": 0.0010978341688809633, "loss": 1.6593469619750976, "step": 89380, "train_bpb": 0.585204054543259, "train_bytes": 28424.625, "train_loss_nats_per_token": 1.6602745260527618 }, { "epoch": 0.10797714044929024, "grad_norm": 0.1513671875, "learning_rate": 0.0010972333911179878, "loss": 1.675338363647461, "step": 89400, "train_bpb": 0.5902572039643922, "train_bytes": 28564.975, "train_loss_nats_per_token": 1.6756887915876015 }, { "epoch": 0.10810881988886255, "grad_norm": 0.1875, "learning_rate": 0.0010966326829769829, "loss": 1.6530267715454101, "step": 89420, "train_bpb": 0.5871545813463499, "train_bytes": 28101.65625, "train_loss_nats_per_token": 1.6538721977623618 }, { "epoch": 0.10824049932843485, "grad_norm": 0.140625, "learning_rate": 0.0010960320445617857, "loss": 1.669907569885254, "step": 89440, "train_bpb": 0.5908455023365329, "train_bytes": 28498.75, "train_loss_nats_per_token": 1.670561371918689 }, { "epoch": 0.10837217876800716, "grad_norm": 0.1279296875, "learning_rate": 0.0010954314759762233, "loss": 1.6656139373779297, "step": 89460, "train_bpb": 0.5911097774983396, "train_bytes": 27816.425, "train_loss_nats_per_token": 1.6671344583792544 }, { "epoch": 0.10850385820757946, "grad_norm": 0.15234375, "learning_rate": 0.0010948309773241086, "loss": 1.6617572784423829, "step": 89480, "train_bpb": 0.5843226033664779, "train_bytes": 28607.5625, "train_loss_nats_per_token": 1.6624463704832106 }, { "epoch": 0.10863553764715177, "grad_norm": 0.2119140625, "learning_rate": 0.0010942305487092437, "loss": 1.6547136306762695, "step": 89500, "train_bpb": 0.5850337568934968, "train_bytes": 28458.9375, "train_loss_nats_per_token": 1.6560865799097082 }, { "epoch": 0.10876721708672409, "grad_norm": 0.130859375, "learning_rate": 0.0010936301902354187, "loss": 1.6432645797729493, "step": 89520, "train_bpb": 0.5860193686763963, "train_bytes": 27921.0375, "train_loss_nats_per_token": 1.6444659792496334 }, { "epoch": 0.10889889652629639, "grad_norm": 0.146484375, "learning_rate": 0.0010930299020064102, "loss": 1.6694574356079102, "step": 89540, "train_bpb": 0.5881922643042964, "train_bytes": 28414.725, "train_loss_nats_per_token": 1.6693053932185613 }, { "epoch": 0.1090305759658687, "grad_norm": 0.1259765625, "learning_rate": 0.0010924296841259842, "loss": 1.6515174865722657, "step": 89560, "train_bpb": 0.5842110500076343, "train_bytes": 28030.7, "train_loss_nats_per_token": 1.6516798742560734 }, { "epoch": 0.109162255405441, "grad_norm": 0.1591796875, "learning_rate": 0.001091829536697894, "loss": 1.664474868774414, "step": 89580, "train_bpb": 0.588089209125206, "train_bytes": 28606.28125, "train_loss_nats_per_token": 1.6657310960126934 }, { "epoch": 0.1092939348450133, "grad_norm": 0.1328125, "learning_rate": 0.0010912294598258811, "loss": 1.6629226684570313, "step": 89600, "train_bpb": 0.589089674557064, "train_bytes": 28275.54375, "train_loss_nats_per_token": 1.6633800596720065 }, { "epoch": 0.10942561428458561, "grad_norm": 0.1328125, "learning_rate": 0.0010906294536136734, "loss": 1.6579742431640625, "step": 89620, "train_bpb": 0.5876204629208254, "train_bytes": 28294.48125, "train_loss_nats_per_token": 1.6587700144956838 }, { "epoch": 0.10955729372415791, "grad_norm": 0.146484375, "learning_rate": 0.0010900295181649885, "loss": 1.6551984786987304, "step": 89640, "train_bpb": 0.5823997344186411, "train_bytes": 28263.95, "train_loss_nats_per_token": 1.655777444928985 }, { "epoch": 0.10968897316373022, "grad_norm": 0.16796875, "learning_rate": 0.0010894296535835307, "loss": 1.6659515380859375, "step": 89660, "train_bpb": 0.5883591523993668, "train_bytes": 28258.06875, "train_loss_nats_per_token": 1.6669790926816492 }, { "epoch": 0.10982065260330252, "grad_norm": 0.1640625, "learning_rate": 0.0010888298599729916, "loss": 1.6679025650024415, "step": 89680, "train_bpb": 0.5913124794354866, "train_bytes": 28326.06875, "train_loss_nats_per_token": 1.6685473468011904 }, { "epoch": 0.10995233204287483, "grad_norm": 0.1318359375, "learning_rate": 0.0010882301374370512, "loss": 1.6624134063720704, "step": 89700, "train_bpb": 0.5867804272698629, "train_bytes": 28044.95625, "train_loss_nats_per_token": 1.663382046804579 }, { "epoch": 0.11008401148244713, "grad_norm": 0.138671875, "learning_rate": 0.0010876304860793782, "loss": 1.6636173248291015, "step": 89720, "train_bpb": 0.5865176289696162, "train_bytes": 28495.31875, "train_loss_nats_per_token": 1.665292138199359 }, { "epoch": 0.11021569092201944, "grad_norm": 0.134765625, "learning_rate": 0.0010870309060036266, "loss": 1.6581533432006836, "step": 89740, "train_bpb": 0.5899447074233422, "train_bytes": 27995.58125, "train_loss_nats_per_token": 1.659114586989539 }, { "epoch": 0.11034737036159174, "grad_norm": 0.15234375, "learning_rate": 0.0010864313973134399, "loss": 1.6521268844604493, "step": 89760, "train_bpb": 0.5870963246529518, "train_bytes": 28134.3625, "train_loss_nats_per_token": 1.6535987348190244 }, { "epoch": 0.11047904980116405, "grad_norm": 0.1396484375, "learning_rate": 0.001085831960112449, "loss": 1.6508611679077148, "step": 89780, "train_bpb": 0.5832598321039333, "train_bytes": 28416.63125, "train_loss_nats_per_token": 1.652034793147826 }, { "epoch": 0.11061072924073635, "grad_norm": 0.1259765625, "learning_rate": 0.0010852325945042724, "loss": 1.6609691619873046, "step": 89800, "train_bpb": 0.5888162883029695, "train_bytes": 28319.9, "train_loss_nats_per_token": 1.6611000575880157 }, { "epoch": 0.11074240868030866, "grad_norm": 0.11767578125, "learning_rate": 0.0010846333005925153, "loss": 1.6481319427490235, "step": 89820, "train_bpb": 0.5852126297909334, "train_bytes": 28297.85, "train_loss_nats_per_token": 1.6488960332205918 }, { "epoch": 0.11087408811988096, "grad_norm": 0.158203125, "learning_rate": 0.0010840340784807716, "loss": 1.6731859207153321, "step": 89840, "train_bpb": 0.5909579104152864, "train_bytes": 28261.525, "train_loss_nats_per_token": 1.6734016213383864 }, { "epoch": 0.11100576755945327, "grad_norm": 0.166015625, "learning_rate": 0.0010834349282726236, "loss": 1.651585578918457, "step": 89860, "train_bpb": 0.5858642188139039, "train_bytes": 28104.71875, "train_loss_nats_per_token": 1.6513606603511302 }, { "epoch": 0.11113744699902557, "grad_norm": 0.19140625, "learning_rate": 0.0010828358500716377, "loss": 1.6715526580810547, "step": 89880, "train_bpb": 0.5880612212996698, "train_bytes": 28303.9125, "train_loss_nats_per_token": 1.6722516847991575 }, { "epoch": 0.11126912643859788, "grad_norm": 0.130859375, "learning_rate": 0.0010822368439813716, "loss": 1.6533075332641602, "step": 89900, "train_bpb": 0.5849700279663773, "train_bytes": 28174.3875, "train_loss_nats_per_token": 1.6544371344463733 }, { "epoch": 0.11140080587817018, "grad_norm": 0.1640625, "learning_rate": 0.0010816379101053694, "loss": 1.6472387313842773, "step": 89920, "train_bpb": 0.5847842147060774, "train_bytes": 28303.18125, "train_loss_nats_per_token": 1.6477804026258294 }, { "epoch": 0.11153248531774249, "grad_norm": 0.1318359375, "learning_rate": 0.0010810390485471615, "loss": 1.652421760559082, "step": 89940, "train_bpb": 0.5878813335743586, "train_bytes": 28277.93125, "train_loss_nats_per_token": 1.6526543420098738 }, { "epoch": 0.11166416475731479, "grad_norm": 0.1494140625, "learning_rate": 0.001080440259410267, "loss": 1.657526397705078, "step": 89960, "train_bpb": 0.5886703396526802, "train_bytes": 28294.2, "train_loss_nats_per_token": 1.6594122958115094 }, { "epoch": 0.1117958441968871, "grad_norm": 0.2001953125, "learning_rate": 0.0010798415427981922, "loss": 1.6534955978393555, "step": 89980, "train_bpb": 0.5850407828183196, "train_bytes": 28190.025, "train_loss_nats_per_token": 1.65323617101865 }, { "epoch": 0.1119275236364594, "grad_norm": 0.1611328125, "learning_rate": 0.0010792428988144317, "loss": 1.6621776580810548, "step": 90000, "train_bpb": 0.5891929993417674, "train_bytes": 28351.91875, "train_loss_nats_per_token": 1.6626889850795932 }, { "epoch": 0.1119275236364594, "eval_loss": 1.5228278636932373, "eval_runtime": 72.6025, "eval_samples_per_second": 13.774, "eval_steps_per_second": 13.774, "step": 90000, "train_bpb": 0.5374662917020719, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5304958493525993 }, { "epoch": 0.1120592030760317, "grad_norm": 0.1474609375, "learning_rate": 0.0010786443275624653, "loss": 1.6574762344360352, "step": 90020, "train_bpb": 0.587173127265416, "train_bytes": 28236.9, "train_loss_nats_per_token": 1.6583724415854477 }, { "epoch": 0.11219088251560401, "grad_norm": 0.1748046875, "learning_rate": 0.0010780458291457626, "loss": 1.661838912963867, "step": 90040, "train_bpb": 0.5844756269747167, "train_bytes": 28691.4875, "train_loss_nats_per_token": 1.6622923639970442 }, { "epoch": 0.11232256195517631, "grad_norm": 0.1552734375, "learning_rate": 0.0010774474036677798, "loss": 1.6563871383666993, "step": 90060, "train_bpb": 0.5857611804900611, "train_bytes": 28462.99375, "train_loss_nats_per_token": 1.6578051689190325 }, { "epoch": 0.11245424139474862, "grad_norm": 0.1669921875, "learning_rate": 0.001076849051231959, "loss": 1.649925994873047, "step": 90080, "train_bpb": 0.5814873891771153, "train_bytes": 28356.8625, "train_loss_nats_per_token": 1.6502750904585077 }, { "epoch": 0.11258592083432092, "grad_norm": 0.146484375, "learning_rate": 0.001076250771941732, "loss": 1.6581758499145507, "step": 90100, "train_bpb": 0.5868758633738443, "train_bytes": 28288.55, "train_loss_nats_per_token": 1.6585842546807987 }, { "epoch": 0.11271760027389323, "grad_norm": 0.12451171875, "learning_rate": 0.0010756525659005168, "loss": 1.6517101287841798, "step": 90120, "train_bpb": 0.5853603305814605, "train_bytes": 28359.2875, "train_loss_nats_per_token": 1.6532210418144593 }, { "epoch": 0.11284927971346553, "grad_norm": 0.2060546875, "learning_rate": 0.00107505443321172, "loss": 1.6518478393554688, "step": 90140, "train_bpb": 0.5861648525279737, "train_bytes": 28475.43125, "train_loss_nats_per_token": 1.6527598331809923 }, { "epoch": 0.11298095915303784, "grad_norm": 0.1328125, "learning_rate": 0.0010744563739787322, "loss": 1.6658706665039062, "step": 90160, "train_bpb": 0.587154702188427, "train_bytes": 28736.64375, "train_loss_nats_per_token": 1.667016672465329 }, { "epoch": 0.11311263859261014, "grad_norm": 0.1259765625, "learning_rate": 0.0010738583883049349, "loss": 1.6608993530273437, "step": 90180, "train_bpb": 0.5877200032195374, "train_bytes": 28268.675, "train_loss_nats_per_token": 1.66151367807448 }, { "epoch": 0.11324431803218246, "grad_norm": 0.140625, "learning_rate": 0.001073260476293696, "loss": 1.6506391525268556, "step": 90200, "train_bpb": 0.5825129893794291, "train_bytes": 28395.8875, "train_loss_nats_per_token": 1.6508663943302366 }, { "epoch": 0.11337599747175477, "grad_norm": 0.12060546875, "learning_rate": 0.001072662638048369, "loss": 1.6690750122070312, "step": 90220, "train_bpb": 0.5831621598927319, "train_bytes": 29032.28125, "train_loss_nats_per_token": 1.6701168780967426 }, { "epoch": 0.11350767691132707, "grad_norm": 0.1552734375, "learning_rate": 0.001072064873672296, "loss": 1.6388826370239258, "step": 90240, "train_bpb": 0.583194261139292, "train_bytes": 28016.43125, "train_loss_nats_per_token": 1.6393351637489708 }, { "epoch": 0.11363935635089938, "grad_norm": 0.1708984375, "learning_rate": 0.001071467183268807, "loss": 1.6682119369506836, "step": 90260, "train_bpb": 0.5883330032433876, "train_bytes": 28436.41875, "train_loss_nats_per_token": 1.6690420541815543 }, { "epoch": 0.11377103579047168, "grad_norm": 0.11376953125, "learning_rate": 0.0010708695669412174, "loss": 1.6473520278930665, "step": 90280, "train_bpb": 0.5848838124847613, "train_bytes": 28013.05, "train_loss_nats_per_token": 1.6482999193166614 }, { "epoch": 0.11390271523004399, "grad_norm": 0.1376953125, "learning_rate": 0.0010702720247928313, "loss": 1.6670915603637695, "step": 90300, "train_bpb": 0.5863917931150495, "train_bytes": 28647.525, "train_loss_nats_per_token": 1.6673908729814675 }, { "epoch": 0.11403439466961629, "grad_norm": 0.1396484375, "learning_rate": 0.001069674556926939, "loss": 1.6557035446166992, "step": 90320, "train_bpb": 0.5865451673804563, "train_bytes": 28289.20625, "train_loss_nats_per_token": 1.6555882624166116 }, { "epoch": 0.1141660741091886, "grad_norm": 0.138671875, "learning_rate": 0.0010690771634468198, "loss": 1.6614673614501954, "step": 90340, "train_bpb": 0.5883901568664452, "train_bytes": 28502.675, "train_loss_nats_per_token": 1.662600367209226 }, { "epoch": 0.1142977535487609, "grad_norm": 0.1376953125, "learning_rate": 0.0010684798444557367, "loss": 1.651504135131836, "step": 90360, "train_bpb": 0.5865137687208294, "train_bytes": 28312.55, "train_loss_nats_per_token": 1.6522902139573032 }, { "epoch": 0.1144294329883332, "grad_norm": 0.2021484375, "learning_rate": 0.001067882600056943, "loss": 1.6665563583374023, "step": 90380, "train_bpb": 0.5892318240485168, "train_bytes": 28402.25, "train_loss_nats_per_token": 1.6668978414143232 }, { "epoch": 0.11456111242790551, "grad_norm": 0.1240234375, "learning_rate": 0.0010672854303536783, "loss": 1.6474483489990235, "step": 90400, "train_bpb": 0.5832452001567723, "train_bytes": 28006.85, "train_loss_nats_per_token": 1.6481592677961712 }, { "epoch": 0.11469279186747781, "grad_norm": 0.140625, "learning_rate": 0.001066688335449168, "loss": 1.6552967071533202, "step": 90420, "train_bpb": 0.5888413813585475, "train_bytes": 27743.0875, "train_loss_nats_per_token": 1.6567869484948672 }, { "epoch": 0.11482447130705012, "grad_norm": 0.1416015625, "learning_rate": 0.001066091315446626, "loss": 1.6467727661132812, "step": 90440, "train_bpb": 0.5811149010225511, "train_bytes": 28399.8125, "train_loss_nats_per_token": 1.6465746417254306 }, { "epoch": 0.11495615074662242, "grad_norm": 0.14453125, "learning_rate": 0.0010654943704492533, "loss": 1.648568344116211, "step": 90460, "train_bpb": 0.582564257825266, "train_bytes": 28429.175, "train_loss_nats_per_token": 1.6489375702271305 }, { "epoch": 0.11508783018619473, "grad_norm": 0.1416015625, "learning_rate": 0.0010648975005602365, "loss": 1.6417482376098633, "step": 90480, "train_bpb": 0.5818995236571685, "train_bytes": 28401.2125, "train_loss_nats_per_token": 1.643106876942397 }, { "epoch": 0.11521950962576703, "grad_norm": 0.1591796875, "learning_rate": 0.0010643007058827503, "loss": 1.6518083572387696, "step": 90500, "train_bpb": 0.5857076441393908, "train_bytes": 28029.14375, "train_loss_nats_per_token": 1.6524018078058846 }, { "epoch": 0.11535118906533934, "grad_norm": 0.1640625, "learning_rate": 0.0010637039865199567, "loss": 1.6452848434448242, "step": 90520, "train_bpb": 0.5837556807308801, "train_bytes": 28337.04375, "train_loss_nats_per_token": 1.6460153692549935 }, { "epoch": 0.11548286850491164, "grad_norm": 0.1494140625, "learning_rate": 0.0010631073425750044, "loss": 1.646645736694336, "step": 90540, "train_bpb": 0.5849079471840434, "train_bytes": 28314.74375, "train_loss_nats_per_token": 1.647257092567346 }, { "epoch": 0.11561454794448395, "grad_norm": 0.1904296875, "learning_rate": 0.001062510774151028, "loss": 1.6453697204589843, "step": 90560, "train_bpb": 0.5826291206878806, "train_bytes": 28426.9875, "train_loss_nats_per_token": 1.6460653918901056 }, { "epoch": 0.11574622738405625, "grad_norm": 0.1650390625, "learning_rate": 0.0010619142813511502, "loss": 1.6562952041625976, "step": 90580, "train_bpb": 0.5831069287103126, "train_bytes": 28589.625, "train_loss_nats_per_token": 1.6570098455091458 }, { "epoch": 0.11587790682362856, "grad_norm": 0.13671875, "learning_rate": 0.0010613178642784815, "loss": 1.6438983917236327, "step": 90600, "train_bpb": 0.5845642976351509, "train_bytes": 28020.2625, "train_loss_nats_per_token": 1.643583468969861 }, { "epoch": 0.11600958626320086, "grad_norm": 0.109375, "learning_rate": 0.001060721523036116, "loss": 1.6561412811279297, "step": 90620, "train_bpb": 0.5852359683786, "train_bytes": 28341.4125, "train_loss_nats_per_token": 1.6562988921385908 }, { "epoch": 0.11614126570277317, "grad_norm": 0.1728515625, "learning_rate": 0.0010601252577271385, "loss": 1.6522760391235352, "step": 90640, "train_bpb": 0.5854504511882686, "train_bytes": 28436.2875, "train_loss_nats_per_token": 1.653405425388383 }, { "epoch": 0.11627294514234547, "grad_norm": 0.1689453125, "learning_rate": 0.0010595290684546185, "loss": 1.6517108917236327, "step": 90660, "train_bpb": 0.5860690562776982, "train_bytes": 28154.06875, "train_loss_nats_per_token": 1.6525552302440272 }, { "epoch": 0.11640462458191778, "grad_norm": 0.22265625, "learning_rate": 0.001058932955321614, "loss": 1.654214859008789, "step": 90680, "train_bpb": 0.5855123945109753, "train_bytes": 28220.7875, "train_loss_nats_per_token": 1.6556755543251431 }, { "epoch": 0.11653630402149008, "grad_norm": 0.1767578125, "learning_rate": 0.0010583369184311666, "loss": 1.6468927383422851, "step": 90700, "train_bpb": 0.5846098532105093, "train_bytes": 28002.29375, "train_loss_nats_per_token": 1.647700866278732 }, { "epoch": 0.11666798346106239, "grad_norm": 0.1435546875, "learning_rate": 0.001057740957886308, "loss": 1.6476205825805663, "step": 90720, "train_bpb": 0.5847652243109156, "train_bytes": 28246.125, "train_loss_nats_per_token": 1.6481676975425823 }, { "epoch": 0.11679966290063469, "grad_norm": 0.130859375, "learning_rate": 0.001057145073790056, "loss": 1.6521656036376953, "step": 90740, "train_bpb": 0.5841784068042842, "train_bytes": 28218.625, "train_loss_nats_per_token": 1.6533781744180842 }, { "epoch": 0.116931342340207, "grad_norm": 0.1708984375, "learning_rate": 0.001056549266245414, "loss": 1.646739387512207, "step": 90760, "train_bpb": 0.5858444548506669, "train_bytes": 28179.1625, "train_loss_nats_per_token": 1.6476938236373897 }, { "epoch": 0.1170630217797793, "grad_norm": 0.138671875, "learning_rate": 0.0010559535353553728, "loss": 1.6551105499267578, "step": 90780, "train_bpb": 0.5841773811815894, "train_bytes": 28158.95, "train_loss_nats_per_token": 1.6556990621854741 }, { "epoch": 0.1171947012193516, "grad_norm": 0.1455078125, "learning_rate": 0.001055357881222911, "loss": 1.6580238342285156, "step": 90800, "train_bpb": 0.587600424775524, "train_bytes": 28313.5125, "train_loss_nats_per_token": 1.6583730798776515 }, { "epoch": 0.11732638065892391, "grad_norm": 0.11572265625, "learning_rate": 0.0010547623039509919, "loss": 1.6495582580566406, "step": 90820, "train_bpb": 0.5838079592505561, "train_bytes": 28444.29375, "train_loss_nats_per_token": 1.65025362881951 }, { "epoch": 0.11745806009849621, "grad_norm": 0.1513671875, "learning_rate": 0.0010541668036425668, "loss": 1.6473817825317383, "step": 90840, "train_bpb": 0.5838823640969559, "train_bytes": 28220.075, "train_loss_nats_per_token": 1.6481595424831903 }, { "epoch": 0.11758973953806853, "grad_norm": 0.13671875, "learning_rate": 0.0010535713804005738, "loss": 1.6497270584106445, "step": 90860, "train_bpb": 0.5846277290018957, "train_bytes": 28294.2875, "train_loss_nats_per_token": 1.6513965988398522 }, { "epoch": 0.11772141897764084, "grad_norm": 0.21875, "learning_rate": 0.001052976034327938, "loss": 1.6420907974243164, "step": 90880, "train_bpb": 0.5878883231441615, "train_bytes": 27916.78125, "train_loss_nats_per_token": 1.6421137099131982 }, { "epoch": 0.11785309841721314, "grad_norm": 0.15625, "learning_rate": 0.0010523807655275692, "loss": 1.661549186706543, "step": 90900, "train_bpb": 0.5870892740955699, "train_bytes": 28428.4375, "train_loss_nats_per_token": 1.6617009465301362 }, { "epoch": 0.11798477785678545, "grad_norm": 0.177734375, "learning_rate": 0.0010517855741023656, "loss": 1.648881721496582, "step": 90920, "train_bpb": 0.5855012267133245, "train_bytes": 27993.16875, "train_loss_nats_per_token": 1.6493655639223543 }, { "epoch": 0.11811645729635775, "grad_norm": 0.16015625, "learning_rate": 0.0010511904601552128, "loss": 1.6557029724121093, "step": 90940, "train_bpb": 0.5849738693838089, "train_bytes": 28334.2125, "train_loss_nats_per_token": 1.6563012750681865 }, { "epoch": 0.11824813673593006, "grad_norm": 0.1533203125, "learning_rate": 0.0010505954237889797, "loss": 1.6528173446655274, "step": 90960, "train_bpb": 0.5851157999579718, "train_bytes": 28458.88125, "train_loss_nats_per_token": 1.6536992164518582 }, { "epoch": 0.11837981617550236, "grad_norm": 0.2060546875, "learning_rate": 0.0010500004651065255, "loss": 1.648295783996582, "step": 90980, "train_bpb": 0.580884207894658, "train_bytes": 28455.61875, "train_loss_nats_per_token": 1.6491166760576232 }, { "epoch": 0.11851149561507467, "grad_norm": 0.1337890625, "learning_rate": 0.0010494055842106935, "loss": 1.6522750854492188, "step": 91000, "train_bpb": 0.5870190021912879, "train_bytes": 28272.33125, "train_loss_nats_per_token": 1.6529348719370043 }, { "epoch": 0.11851149561507467, "eval_loss": 1.521862506866455, "eval_runtime": 82.5642, "eval_samples_per_second": 12.112, "eval_steps_per_second": 12.112, "step": 91000, "train_bpb": 0.5371164472088245, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.52949962772326 }, { "epoch": 0.11864317505464697, "grad_norm": 0.1298828125, "learning_rate": 0.0010488107812043155, "loss": 1.645880126953125, "step": 91020, "train_bpb": 0.5865931099949696, "train_bytes": 28072.68125, "train_loss_nats_per_token": 1.6469520758013476 }, { "epoch": 0.11877485449421928, "grad_norm": 0.1455078125, "learning_rate": 0.0010482160561902075, "loss": 1.657891082763672, "step": 91040, "train_bpb": 0.5877305348637194, "train_bytes": 28149.35625, "train_loss_nats_per_token": 1.6577262449464165 }, { "epoch": 0.11890653393379158, "grad_norm": 0.1279296875, "learning_rate": 0.0010476214092711737, "loss": 1.6586149215698243, "step": 91060, "train_bpb": 0.5898520026586876, "train_bytes": 28011.08125, "train_loss_nats_per_token": 1.658839215003954 }, { "epoch": 0.11903821337336389, "grad_norm": 0.173828125, "learning_rate": 0.0010470268405500052, "loss": 1.6572265625, "step": 91080, "train_bpb": 0.58626535702402, "train_bytes": 28215.7875, "train_loss_nats_per_token": 1.6569600996198464 }, { "epoch": 0.11916989281293619, "grad_norm": 0.1630859375, "learning_rate": 0.0010464323501294772, "loss": 1.6656496047973632, "step": 91100, "train_bpb": 0.5867760747829633, "train_bytes": 28587.70625, "train_loss_nats_per_token": 1.6655720324460586 }, { "epoch": 0.1193015722525085, "grad_norm": 0.15234375, "learning_rate": 0.0010458379381123538, "loss": 1.65361328125, "step": 91120, "train_bpb": 0.5827205875354701, "train_bytes": 28411.95625, "train_loss_nats_per_token": 1.6541279372305273 }, { "epoch": 0.1194332516920808, "grad_norm": 0.142578125, "learning_rate": 0.0010452436046013854, "loss": 1.641702651977539, "step": 91140, "train_bpb": 0.5840219151109761, "train_bytes": 27877.625, "train_loss_nats_per_token": 1.6429485879867793 }, { "epoch": 0.1195649311316531, "grad_norm": 0.1484375, "learning_rate": 0.0010446493496993068, "loss": 1.654024887084961, "step": 91160, "train_bpb": 0.588612674290273, "train_bytes": 28026.64375, "train_loss_nats_per_token": 1.6539602027986482 }, { "epoch": 0.11969661057122541, "grad_norm": 0.1640625, "learning_rate": 0.0010440551735088409, "loss": 1.6348705291748047, "step": 91180, "train_bpb": 0.578834436366552, "train_bytes": 28035.525, "train_loss_nats_per_token": 1.6358533095740326 }, { "epoch": 0.11982829001079771, "grad_norm": 0.1728515625, "learning_rate": 0.0010434610761326968, "loss": 1.6603376388549804, "step": 91200, "train_bpb": 0.5872686661589783, "train_bytes": 28447.76875, "train_loss_nats_per_token": 1.661802374249847 }, { "epoch": 0.11995996945037002, "grad_norm": 0.166015625, "learning_rate": 0.00104286705767357, "loss": 1.644371795654297, "step": 91220, "train_bpb": 0.5807616568402534, "train_bytes": 28411.73125, "train_loss_nats_per_token": 1.6449295545346045 }, { "epoch": 0.12009164888994232, "grad_norm": 0.1533203125, "learning_rate": 0.0010422731182341415, "loss": 1.6593709945678712, "step": 91240, "train_bpb": 0.5853407681355968, "train_bytes": 28521.1375, "train_loss_nats_per_token": 1.6605190213101992 }, { "epoch": 0.12022332832951463, "grad_norm": 0.16796875, "learning_rate": 0.0010416792579170796, "loss": 1.640230369567871, "step": 91260, "train_bpb": 0.5815402245638428, "train_bytes": 28157.75625, "train_loss_nats_per_token": 1.6414897186412227 }, { "epoch": 0.12035500776908693, "grad_norm": 0.1181640625, "learning_rate": 0.0010410854768250395, "loss": 1.6439857482910156, "step": 91280, "train_bpb": 0.5804004653573588, "train_bytes": 28336.34375, "train_loss_nats_per_token": 1.6444180574023475 }, { "epoch": 0.12048668720865924, "grad_norm": 0.14453125, "learning_rate": 0.0010404917750606601, "loss": 1.6515663146972657, "step": 91300, "train_bpb": 0.585642816059866, "train_bytes": 28131.6125, "train_loss_nats_per_token": 1.6513694178685485 }, { "epoch": 0.12061836664823154, "grad_norm": 0.14453125, "learning_rate": 0.0010398981527265693, "loss": 1.6533763885498047, "step": 91320, "train_bpb": 0.5891904748187162, "train_bytes": 27902.76875, "train_loss_nats_per_token": 1.6542436676894396 }, { "epoch": 0.12075004608780385, "grad_norm": 0.138671875, "learning_rate": 0.0010393046099253806, "loss": 1.6411430358886718, "step": 91340, "train_bpb": 0.5828059233510019, "train_bytes": 27656.89375, "train_loss_nats_per_token": 1.6421395364031872 }, { "epoch": 0.12088172552737615, "grad_norm": 0.13671875, "learning_rate": 0.0010387111467596922, "loss": 1.6356903076171876, "step": 91360, "train_bpb": 0.5814878057874309, "train_bytes": 28220.8625, "train_loss_nats_per_token": 1.635621963785558 }, { "epoch": 0.12101340496694846, "grad_norm": 0.1982421875, "learning_rate": 0.0010381177633320905, "loss": 1.6414079666137695, "step": 91380, "train_bpb": 0.5815364266562216, "train_bytes": 28260.1, "train_loss_nats_per_token": 1.6418814013897085 }, { "epoch": 0.12114508440652076, "grad_norm": 0.1630859375, "learning_rate": 0.0010375244597451475, "loss": 1.6544837951660156, "step": 91400, "train_bpb": 0.5860388760680877, "train_bytes": 27971.55625, "train_loss_nats_per_token": 1.6549937048132703 }, { "epoch": 0.12127676384609307, "grad_norm": 0.1552734375, "learning_rate": 0.0010369312361014215, "loss": 1.6572708129882812, "step": 91420, "train_bpb": 0.5878155092044447, "train_bytes": 28161.05, "train_loss_nats_per_token": 1.6583160613093941 }, { "epoch": 0.12140844328566537, "grad_norm": 0.1640625, "learning_rate": 0.001036338092503456, "loss": 1.6482627868652344, "step": 91440, "train_bpb": 0.5856679899892359, "train_bytes": 28191.26875, "train_loss_nats_per_token": 1.6489454458899462 }, { "epoch": 0.12154012272523768, "grad_norm": 0.158203125, "learning_rate": 0.0010357450290537815, "loss": 1.6509916305541992, "step": 91460, "train_bpb": 0.5820183489221818, "train_bytes": 28476.675, "train_loss_nats_per_token": 1.651077207089373 }, { "epoch": 0.12167180216480998, "grad_norm": 0.1376953125, "learning_rate": 0.0010351520458549157, "loss": 1.6348960876464844, "step": 91480, "train_bpb": 0.5854197217189405, "train_bytes": 27719.5625, "train_loss_nats_per_token": 1.6358820918233667 }, { "epoch": 0.12180348160438229, "grad_norm": 0.16015625, "learning_rate": 0.0010345591430093598, "loss": 1.6566421508789062, "step": 91500, "train_bpb": 0.5827018831681295, "train_bytes": 28637.5125, "train_loss_nats_per_token": 1.657216935297194 }, { "epoch": 0.12193516104395459, "grad_norm": 0.1484375, "learning_rate": 0.001033966320619603, "loss": 1.6411352157592773, "step": 91520, "train_bpb": 0.5829075956289864, "train_bytes": 28192.6, "train_loss_nats_per_token": 1.641638391492971 }, { "epoch": 0.12206684048352691, "grad_norm": 0.15625, "learning_rate": 0.0010333735787881205, "loss": 1.655182456970215, "step": 91540, "train_bpb": 0.586763296526593, "train_bytes": 28406.60625, "train_loss_nats_per_token": 1.6559395391264247 }, { "epoch": 0.12219851992309921, "grad_norm": 0.181640625, "learning_rate": 0.0010327809176173739, "loss": 1.6573646545410157, "step": 91560, "train_bpb": 0.5864108845467635, "train_bytes": 28387.49375, "train_loss_nats_per_token": 1.6593805749501942 }, { "epoch": 0.12233019936267152, "grad_norm": 0.1689453125, "learning_rate": 0.0010321883372098085, "loss": 1.6444171905517577, "step": 91580, "train_bpb": 0.5833297249436047, "train_bytes": 28176.85625, "train_loss_nats_per_token": 1.6448551975934746 }, { "epoch": 0.12246187880224382, "grad_norm": 0.1328125, "learning_rate": 0.0010315958376678586, "loss": 1.6493080139160157, "step": 91600, "train_bpb": 0.5838307087941732, "train_bytes": 28298.63125, "train_loss_nats_per_token": 1.6500296953908171 }, { "epoch": 0.12259355824181613, "grad_norm": 0.154296875, "learning_rate": 0.0010310034190939437, "loss": 1.6472599029541015, "step": 91620, "train_bpb": 0.5861741881462754, "train_bytes": 27971.40625, "train_loss_nats_per_token": 1.6479872568408505 }, { "epoch": 0.12272523768138843, "grad_norm": 0.1494140625, "learning_rate": 0.0010304110815904674, "loss": 1.653843879699707, "step": 91640, "train_bpb": 0.5884185947860047, "train_bytes": 28018.91875, "train_loss_nats_per_token": 1.6547826961711016 }, { "epoch": 0.12285691712096074, "grad_norm": 0.12060546875, "learning_rate": 0.0010298188252598215, "loss": 1.6434820175170899, "step": 91660, "train_bpb": 0.5830293036439663, "train_bytes": 27948.45, "train_loss_nats_per_token": 1.6438639430848272 }, { "epoch": 0.12298859656053304, "grad_norm": 0.1611328125, "learning_rate": 0.0010292266502043839, "loss": 1.6417724609375, "step": 91680, "train_bpb": 0.5785073645878682, "train_bytes": 28480.8125, "train_loss_nats_per_token": 1.6420311734420339 }, { "epoch": 0.12312027600010535, "grad_norm": 0.1650390625, "learning_rate": 0.001028634556526516, "loss": 1.6439151763916016, "step": 91700, "train_bpb": 0.5826697899092181, "train_bytes": 28306.63125, "train_loss_nats_per_token": 1.644208517678234 }, { "epoch": 0.12325195543967765, "grad_norm": 0.1435546875, "learning_rate": 0.0010280425443285677, "loss": 1.6410257339477539, "step": 91720, "train_bpb": 0.581948936964297, "train_bytes": 28272.74375, "train_loss_nats_per_token": 1.6426506363770474 }, { "epoch": 0.12338363487924996, "grad_norm": 0.1396484375, "learning_rate": 0.0010274506137128736, "loss": 1.6514909744262696, "step": 91740, "train_bpb": 0.5805428179917033, "train_bytes": 28348.14375, "train_loss_nats_per_token": 1.6520568394804913 }, { "epoch": 0.12351531431882226, "grad_norm": 0.1376953125, "learning_rate": 0.001026858764781755, "loss": 1.636714553833008, "step": 91760, "train_bpb": 0.5801250432235538, "train_bytes": 28190.8125, "train_loss_nats_per_token": 1.637936995471826 }, { "epoch": 0.12364699375839457, "grad_norm": 0.1455078125, "learning_rate": 0.0010262669976375174, "loss": 1.624227523803711, "step": 91780, "train_bpb": 0.5772802686043076, "train_bytes": 28156.44375, "train_loss_nats_per_token": 1.624483597757378 }, { "epoch": 0.12377867319796687, "grad_norm": 0.1181640625, "learning_rate": 0.0010256753123824539, "loss": 1.6495384216308593, "step": 91800, "train_bpb": 0.5809515116614027, "train_bytes": 28332.19375, "train_loss_nats_per_token": 1.6501343911344433 }, { "epoch": 0.12391035263753918, "grad_norm": 0.1796875, "learning_rate": 0.0010250837091188433, "loss": 1.6442987442016601, "step": 91820, "train_bpb": 0.5831027483929362, "train_bytes": 28104.1375, "train_loss_nats_per_token": 1.6443400154342664 }, { "epoch": 0.12404203207711148, "grad_norm": 0.1484375, "learning_rate": 0.0010244921879489488, "loss": 1.626523780822754, "step": 91840, "train_bpb": 0.5800672940741292, "train_bytes": 27984.94375, "train_loss_nats_per_token": 1.6278189229354831 }, { "epoch": 0.12417371151668379, "grad_norm": 0.1474609375, "learning_rate": 0.0010239007489750208, "loss": 1.6402912139892578, "step": 91860, "train_bpb": 0.580718825075893, "train_bytes": 28301.83125, "train_loss_nats_per_token": 1.640903256900264 }, { "epoch": 0.12430539095625609, "grad_norm": 0.130859375, "learning_rate": 0.0010233093922992957, "loss": 1.6546222686767578, "step": 91880, "train_bpb": 0.5835111313785493, "train_bytes": 28450.03125, "train_loss_nats_per_token": 1.6556742439215613 }, { "epoch": 0.1244370703958284, "grad_norm": 0.130859375, "learning_rate": 0.0010227181180239937, "loss": 1.6489694595336915, "step": 91900, "train_bpb": 0.585746816364184, "train_bytes": 28326.8875, "train_loss_nats_per_token": 1.6494054921157857 }, { "epoch": 0.1245687498354007, "grad_norm": 0.1337890625, "learning_rate": 0.0010221269262513228, "loss": 1.6461067199707031, "step": 91920, "train_bpb": 0.581553831941518, "train_bytes": 28438.15, "train_loss_nats_per_token": 1.6464745566980568 }, { "epoch": 0.124700429274973, "grad_norm": 0.1748046875, "learning_rate": 0.0010215358170834758, "loss": 1.6406911849975585, "step": 91940, "train_bpb": 0.5828963671875778, "train_bytes": 28540.975, "train_loss_nats_per_token": 1.6416721380957275 }, { "epoch": 0.12483210871454531, "grad_norm": 0.1357421875, "learning_rate": 0.0010209447906226327, "loss": 1.6498516082763672, "step": 91960, "train_bpb": 0.5865418598013566, "train_bytes": 27965.375, "train_loss_nats_per_token": 1.651081995732319 }, { "epoch": 0.12496378815411761, "grad_norm": 0.1298828125, "learning_rate": 0.001020353846970956, "loss": 1.6619569778442382, "step": 91980, "train_bpb": 0.5894401308568842, "train_bytes": 28145.09375, "train_loss_nats_per_token": 1.6621673540754596 }, { "epoch": 0.12509546759368992, "grad_norm": 0.1328125, "learning_rate": 0.0010197629862305966, "loss": 1.6550022125244142, "step": 92000, "train_bpb": 0.5867121922159895, "train_bytes": 28104.95, "train_loss_nats_per_token": 1.65541414235722 }, { "epoch": 0.12509546759368992, "eval_loss": 1.522338628768921, "eval_runtime": 73.3994, "eval_samples_per_second": 13.624, "eval_steps_per_second": 13.624, "step": 92000, "train_bpb": 0.5372711531547546, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5299401703429023 }, { "epoch": 0.12522714703326224, "grad_norm": 0.1923828125, "learning_rate": 0.0010191722085036911, "loss": 1.6580673217773438, "step": 92020, "train_bpb": 0.5850030312026216, "train_bytes": 28328.48125, "train_loss_nats_per_token": 1.6593306144343476 }, { "epoch": 0.12535882647283453, "grad_norm": 0.1826171875, "learning_rate": 0.0010185815138923594, "loss": 1.6375835418701172, "step": 92040, "train_bpb": 0.5806068498686554, "train_bytes": 28294.4875, "train_loss_nats_per_token": 1.638596047911913 }, { "epoch": 0.12549050591240685, "grad_norm": 0.1376953125, "learning_rate": 0.0010179909024987097, "loss": 1.6411016464233399, "step": 92060, "train_bpb": 0.5820415476979947, "train_bytes": 28063.05625, "train_loss_nats_per_token": 1.6425013773230634 }, { "epoch": 0.12562218535197914, "grad_norm": 0.15234375, "learning_rate": 0.0010174003744248344, "loss": 1.6421289443969727, "step": 92080, "train_bpb": 0.5817530506654525, "train_bytes": 28563.45625, "train_loss_nats_per_token": 1.6429426701190124 }, { "epoch": 0.12575386479155146, "grad_norm": 0.12890625, "learning_rate": 0.0010168099297728124, "loss": 1.654477882385254, "step": 92100, "train_bpb": 0.5873392657560141, "train_bytes": 28013.85625, "train_loss_nats_per_token": 1.655629378178846 }, { "epoch": 0.12588554423112375, "grad_norm": 0.1328125, "learning_rate": 0.0010162195686447063, "loss": 1.6448280334472656, "step": 92120, "train_bpb": 0.5819698473088883, "train_bytes": 28245.45625, "train_loss_nats_per_token": 1.6457851913100412 }, { "epoch": 0.12601722367069607, "grad_norm": 0.1875, "learning_rate": 0.001015629291142566, "loss": 1.6584793090820313, "step": 92140, "train_bpb": 0.5896889831196455, "train_bytes": 28013.53125, "train_loss_nats_per_token": 1.6595985284594337 }, { "epoch": 0.12614890311026836, "grad_norm": 0.12060546875, "learning_rate": 0.001015039097368428, "loss": 1.6620304107666015, "step": 92160, "train_bpb": 0.5886654084029571, "train_bytes": 28353.7625, "train_loss_nats_per_token": 1.662899086074153 }, { "epoch": 0.12628058254984068, "grad_norm": 0.1748046875, "learning_rate": 0.0010144489874243103, "loss": 1.6496299743652343, "step": 92180, "train_bpb": 0.5845815450872199, "train_bytes": 28347.63125, "train_loss_nats_per_token": 1.6503221829136225 }, { "epoch": 0.12641226198941297, "grad_norm": 0.134765625, "learning_rate": 0.0010138589614122203, "loss": 1.6673938751220703, "step": 92200, "train_bpb": 0.5908894016444372, "train_bytes": 28213.53125, "train_loss_nats_per_token": 1.6682305414866971 }, { "epoch": 0.12654394142898528, "grad_norm": 0.166015625, "learning_rate": 0.00101326901943415, "loss": 1.639183235168457, "step": 92220, "train_bpb": 0.5827560665892347, "train_bytes": 28112.13125, "train_loss_nats_per_token": 1.6392528917918443 }, { "epoch": 0.12667562086855758, "grad_norm": 0.16015625, "learning_rate": 0.0010126791615920753, "loss": 1.646695327758789, "step": 92240, "train_bpb": 0.5855711699642648, "train_bytes": 28057.175, "train_loss_nats_per_token": 1.6470424602741693 }, { "epoch": 0.1268073003081299, "grad_norm": 0.13671875, "learning_rate": 0.0010120893879879587, "loss": 1.6496477127075195, "step": 92260, "train_bpb": 0.582351742179787, "train_bytes": 28686.85625, "train_loss_nats_per_token": 1.650911447136993 }, { "epoch": 0.12693897974770219, "grad_norm": 0.1640625, "learning_rate": 0.0010114996987237485, "loss": 1.6464349746704101, "step": 92280, "train_bpb": 0.58224742481962, "train_bytes": 28506.16875, "train_loss_nats_per_token": 1.647724723864236 }, { "epoch": 0.1270706591872745, "grad_norm": 0.15625, "learning_rate": 0.0010109100939013785, "loss": 1.6493152618408202, "step": 92300, "train_bpb": 0.5855280080820345, "train_bytes": 28336.98125, "train_loss_nats_per_token": 1.6508032782288216 }, { "epoch": 0.1272023386268468, "grad_norm": 0.134765625, "learning_rate": 0.0010103205736227664, "loss": 1.6397415161132813, "step": 92320, "train_bpb": 0.5823164747361175, "train_bytes": 28103.05, "train_loss_nats_per_token": 1.6412662345878821 }, { "epoch": 0.1273340180664191, "grad_norm": 0.1357421875, "learning_rate": 0.0010097311379898162, "loss": 1.6342203140258789, "step": 92340, "train_bpb": 0.5797116274374416, "train_bytes": 28387.50625, "train_loss_nats_per_token": 1.6347452634377144 }, { "epoch": 0.1274656975059914, "grad_norm": 0.162109375, "learning_rate": 0.0010091417871044193, "loss": 1.6467384338378905, "step": 92360, "train_bpb": 0.5823511787093468, "train_bytes": 28404.50625, "train_loss_nats_per_token": 1.647355213669335 }, { "epoch": 0.12759737694556372, "grad_norm": 0.13671875, "learning_rate": 0.001008552521068448, "loss": 1.6459430694580077, "step": 92380, "train_bpb": 0.5814755739853568, "train_bytes": 28365.71875, "train_loss_nats_per_token": 1.6462229099161112 }, { "epoch": 0.12772905638513601, "grad_norm": 0.1357421875, "learning_rate": 0.0010079633399837633, "loss": 1.6440181732177734, "step": 92400, "train_bpb": 0.5793609554000012, "train_bytes": 28136.4, "train_loss_nats_per_token": 1.644601932882426 }, { "epoch": 0.12786073582470833, "grad_norm": 0.1533203125, "learning_rate": 0.0010073742439522118, "loss": 1.6473649978637694, "step": 92420, "train_bpb": 0.5816171374551621, "train_bytes": 28600.5125, "train_loss_nats_per_token": 1.6478541811234686 }, { "epoch": 0.12799241526428062, "grad_norm": 0.125, "learning_rate": 0.0010067852330756224, "loss": 1.6511117935180664, "step": 92440, "train_bpb": 0.5878780828290148, "train_bytes": 28058.35625, "train_loss_nats_per_token": 1.652631236494141 }, { "epoch": 0.12812409470385294, "grad_norm": 0.1552734375, "learning_rate": 0.0010061963074558123, "loss": 1.656130027770996, "step": 92460, "train_bpb": 0.5822628486147736, "train_bytes": 28344.2625, "train_loss_nats_per_token": 1.6563004156205432 }, { "epoch": 0.12825577414342523, "grad_norm": 0.19921875, "learning_rate": 0.0010056074671945824, "loss": 1.6581230163574219, "step": 92480, "train_bpb": 0.5857220978238068, "train_bytes": 28311.00625, "train_loss_nats_per_token": 1.6586771401873701 }, { "epoch": 0.12838745358299755, "grad_norm": 0.373046875, "learning_rate": 0.00100501871239372, "loss": 1.6487703323364258, "step": 92500, "train_bpb": 0.5850451124854932, "train_bytes": 28206.23125, "train_loss_nats_per_token": 1.6493373709991574 }, { "epoch": 0.12851913302256984, "grad_norm": 0.1513671875, "learning_rate": 0.0010044300431549958, "loss": 1.647343635559082, "step": 92520, "train_bpb": 0.5865196023492127, "train_bytes": 27931.1125, "train_loss_nats_per_token": 1.648520752665985 }, { "epoch": 0.12865081246214216, "grad_norm": 0.1416015625, "learning_rate": 0.001003841459580167, "loss": 1.6419862747192382, "step": 92540, "train_bpb": 0.5794826690586964, "train_bytes": 28542.40625, "train_loss_nats_per_token": 1.6423175465511581 }, { "epoch": 0.12878249190171448, "grad_norm": 0.171875, "learning_rate": 0.0010032529617709765, "loss": 1.6520280838012695, "step": 92560, "train_bpb": 0.5857527933379937, "train_bytes": 28425.2125, "train_loss_nats_per_token": 1.6536224123537175 }, { "epoch": 0.12891417134128677, "grad_norm": 0.1748046875, "learning_rate": 0.0010026645498291509, "loss": 1.6473070144653321, "step": 92580, "train_bpb": 0.5841889617893415, "train_bytes": 28320.99375, "train_loss_nats_per_token": 1.6481347979576146 }, { "epoch": 0.1290458507808591, "grad_norm": 0.150390625, "learning_rate": 0.0010020762238564026, "loss": 1.6555234909057617, "step": 92600, "train_bpb": 0.5853905834834779, "train_bytes": 28473.21875, "train_loss_nats_per_token": 1.6559158259010953 }, { "epoch": 0.12917753022043138, "grad_norm": 0.1376953125, "learning_rate": 0.0010014879839544298, "loss": 1.6432493209838868, "step": 92620, "train_bpb": 0.5810656120108406, "train_bytes": 28368.9125, "train_loss_nats_per_token": 1.6440623445544527 }, { "epoch": 0.1293092096600037, "grad_norm": 0.1484375, "learning_rate": 0.0010008998302249155, "loss": 1.6284215927124024, "step": 92640, "train_bpb": 0.5768845424064629, "train_bytes": 28107.7375, "train_loss_nats_per_token": 1.6287697392851967 }, { "epoch": 0.129440889099576, "grad_norm": 0.1494140625, "learning_rate": 0.0010003117627695266, "loss": 1.6383855819702149, "step": 92660, "train_bpb": 0.5826340593301126, "train_bytes": 27999.64375, "train_loss_nats_per_token": 1.6391591949540998 }, { "epoch": 0.1295725685391483, "grad_norm": 0.1455078125, "learning_rate": 0.0009997237816899162, "loss": 1.637952995300293, "step": 92680, "train_bpb": 0.5823662193573275, "train_bytes": 27972.075, "train_loss_nats_per_token": 1.6393991615032328 }, { "epoch": 0.1297042479787206, "grad_norm": 0.1328125, "learning_rate": 0.0009991358870877238, "loss": 1.638491439819336, "step": 92700, "train_bpb": 0.5812296527438975, "train_bytes": 28417.075, "train_loss_nats_per_token": 1.639311859971331 }, { "epoch": 0.12983592741829292, "grad_norm": 0.1572265625, "learning_rate": 0.0009985480790645701, "loss": 1.6516521453857422, "step": 92720, "train_bpb": 0.5833148069976498, "train_bytes": 28118.0375, "train_loss_nats_per_token": 1.6524149348295354 }, { "epoch": 0.1299676068578652, "grad_norm": 0.1484375, "learning_rate": 0.000997960357722065, "loss": 1.6462972640991211, "step": 92740, "train_bpb": 0.5821874616949917, "train_bytes": 28743.11875, "train_loss_nats_per_token": 1.6460088975219027 }, { "epoch": 0.13009928629743753, "grad_norm": 0.1328125, "learning_rate": 0.0009973727231618016, "loss": 1.6584039688110352, "step": 92760, "train_bpb": 0.5874727316897969, "train_bytes": 28487.5, "train_loss_nats_per_token": 1.6596983799000156 }, { "epoch": 0.13023096573700982, "grad_norm": 0.1279296875, "learning_rate": 0.0009967851754853565, "loss": 1.6425460815429687, "step": 92780, "train_bpb": 0.5815478792227785, "train_bytes": 28385.2125, "train_loss_nats_per_token": 1.6434872494239412 }, { "epoch": 0.13036264517658214, "grad_norm": 0.171875, "learning_rate": 0.0009961977147942942, "loss": 1.6402830123901366, "step": 92800, "train_bpb": 0.584378815863361, "train_bytes": 27757.10625, "train_loss_nats_per_token": 1.6404817321954228 }, { "epoch": 0.13049432461615443, "grad_norm": 0.12353515625, "learning_rate": 0.0009956103411901621, "loss": 1.6379425048828125, "step": 92820, "train_bpb": 0.5799695682229095, "train_bytes": 28019.85625, "train_loss_nats_per_token": 1.639179273386418 }, { "epoch": 0.13062600405572675, "grad_norm": 0.181640625, "learning_rate": 0.0009950230547744944, "loss": 1.6393461227416992, "step": 92840, "train_bpb": 0.5786610190727342, "train_bytes": 28344.9125, "train_loss_nats_per_token": 1.6395317598748844 }, { "epoch": 0.13075768349529904, "grad_norm": 0.1796875, "learning_rate": 0.0009944358556488071, "loss": 1.6446569442749024, "step": 92860, "train_bpb": 0.5834375266376292, "train_bytes": 28292.95, "train_loss_nats_per_token": 1.6455792267786662 }, { "epoch": 0.13088936293487136, "grad_norm": 0.2060546875, "learning_rate": 0.0009938487439146045, "loss": 1.6358503341674804, "step": 92880, "train_bpb": 0.5823934116195845, "train_bytes": 28244.81875, "train_loss_nats_per_token": 1.6364155601692552 }, { "epoch": 0.13102104237444365, "grad_norm": 0.2734375, "learning_rate": 0.0009932617196733743, "loss": 1.6528505325317382, "step": 92900, "train_bpb": 0.5865781790738925, "train_bytes": 28275.79375, "train_loss_nats_per_token": 1.6540095602635156 }, { "epoch": 0.13115272181401597, "grad_norm": 0.1630859375, "learning_rate": 0.000992674783026588, "loss": 1.6361690521240235, "step": 92920, "train_bpb": 0.578369390011873, "train_bytes": 28226.6375, "train_loss_nats_per_token": 1.6365908461342598 }, { "epoch": 0.13128440125358826, "grad_norm": 0.1474609375, "learning_rate": 0.000992087934075704, "loss": 1.638452911376953, "step": 92940, "train_bpb": 0.58164641690255, "train_bytes": 28157.26875, "train_loss_nats_per_token": 1.6386313894395546 }, { "epoch": 0.13141608069316058, "grad_norm": 0.1318359375, "learning_rate": 0.0009915011729221652, "loss": 1.6468685150146485, "step": 92960, "train_bpb": 0.5830232766323954, "train_bytes": 28062.775, "train_loss_nats_per_token": 1.6475962384124214 }, { "epoch": 0.13154776013273287, "grad_norm": 0.126953125, "learning_rate": 0.0009909144996673972, "loss": 1.6452344894409179, "step": 92980, "train_bpb": 0.5810415241240457, "train_bytes": 28528.35, "train_loss_nats_per_token": 1.6462502851614411 }, { "epoch": 0.13167943957230518, "grad_norm": 0.1376953125, "learning_rate": 0.0009903279144128127, "loss": 1.635453224182129, "step": 93000, "train_bpb": 0.5784049805697793, "train_bytes": 28515.0, "train_loss_nats_per_token": 1.6357706925477409 }, { "epoch": 0.13167943957230518, "eval_loss": 1.5207418203353882, "eval_runtime": 80.0508, "eval_samples_per_second": 12.492, "eval_steps_per_second": 12.492, "step": 93000, "train_bpb": 0.5367355285909665, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5284149190213863 }, { "epoch": 0.13181111901187748, "grad_norm": 0.1279296875, "learning_rate": 0.0009897414172598084, "loss": 1.6389251708984376, "step": 93020, "train_bpb": 0.5806699239516309, "train_bytes": 28311.29375, "train_loss_nats_per_token": 1.6391091293686033 }, { "epoch": 0.1319427984514498, "grad_norm": 0.1474609375, "learning_rate": 0.0009891550083097665, "loss": 1.6327501296997071, "step": 93040, "train_bpb": 0.5802127121826929, "train_bytes": 27947.44375, "train_loss_nats_per_token": 1.6334312756720575 }, { "epoch": 0.13207447789102209, "grad_norm": 0.142578125, "learning_rate": 0.0009885686876640522, "loss": 1.6320764541625976, "step": 93060, "train_bpb": 0.5767750046563411, "train_bytes": 28518.14375, "train_loss_nats_per_token": 1.6332220278737124 }, { "epoch": 0.1322061573305944, "grad_norm": 0.1123046875, "learning_rate": 0.0009879824554240172, "loss": 1.6448060989379882, "step": 93080, "train_bpb": 0.5803251523490913, "train_bytes": 28448.75625, "train_loss_nats_per_token": 1.6452347805811334 }, { "epoch": 0.1323378367701667, "grad_norm": 0.1474609375, "learning_rate": 0.0009873963116909972, "loss": 1.6353975296020509, "step": 93100, "train_bpb": 0.5784559883481786, "train_bytes": 28518.9125, "train_loss_nats_per_token": 1.635643546622248 }, { "epoch": 0.132469516209739, "grad_norm": 0.150390625, "learning_rate": 0.0009868102565663119, "loss": 1.635685348510742, "step": 93120, "train_bpb": 0.5792868328933861, "train_bytes": 28380.9875, "train_loss_nats_per_token": 1.6368228727280694 }, { "epoch": 0.1326011956493113, "grad_norm": 0.1611328125, "learning_rate": 0.0009862242901512667, "loss": 1.6253679275512696, "step": 93140, "train_bpb": 0.5769854645942761, "train_bytes": 28206.5, "train_loss_nats_per_token": 1.6271490551713332 }, { "epoch": 0.13273287508888362, "grad_norm": 0.154296875, "learning_rate": 0.0009856384125471519, "loss": 1.640757942199707, "step": 93160, "train_bpb": 0.582381778913299, "train_bytes": 28191.725, "train_loss_nats_per_token": 1.6410644837538055 }, { "epoch": 0.1328645545284559, "grad_norm": 0.1435546875, "learning_rate": 0.000985052623855242, "loss": 1.6425949096679688, "step": 93180, "train_bpb": 0.5824267749970886, "train_bytes": 27982.99375, "train_loss_nats_per_token": 1.643290423597291 }, { "epoch": 0.13299623396802823, "grad_norm": 0.17578125, "learning_rate": 0.000984466924176795, "loss": 1.6372903823852538, "step": 93200, "train_bpb": 0.5797969313757145, "train_bytes": 28349.44375, "train_loss_nats_per_token": 1.6378548694412585 }, { "epoch": 0.13312791340760055, "grad_norm": 0.1376953125, "learning_rate": 0.0009838813136130553, "loss": 1.6193014144897462, "step": 93220, "train_bpb": 0.5726662391871643, "train_bytes": 27928.5125, "train_loss_nats_per_token": 1.6207853088652464 }, { "epoch": 0.13325959284717284, "grad_norm": 0.12158203125, "learning_rate": 0.0009832957922652516, "loss": 1.648630142211914, "step": 93240, "train_bpb": 0.5839657894336068, "train_bytes": 28135.1625, "train_loss_nats_per_token": 1.6500323235451622 }, { "epoch": 0.13339127228674516, "grad_norm": 0.134765625, "learning_rate": 0.0009827103602345955, "loss": 1.6273887634277344, "step": 93260, "train_bpb": 0.5781067827595611, "train_bytes": 28201.29375, "train_loss_nats_per_token": 1.6292113577505956 }, { "epoch": 0.13352295172631745, "grad_norm": 0.1474609375, "learning_rate": 0.0009821250176222853, "loss": 1.6445343017578125, "step": 93280, "train_bpb": 0.5828774592794409, "train_bytes": 28381.13125, "train_loss_nats_per_token": 1.645136668590566 }, { "epoch": 0.13365463116588977, "grad_norm": 0.1494140625, "learning_rate": 0.000981539764529503, "loss": 1.6506120681762695, "step": 93300, "train_bpb": 0.5834675841563435, "train_bytes": 28300.0375, "train_loss_nats_per_token": 1.6509899008519302 }, { "epoch": 0.13378631060546206, "grad_norm": 0.1376953125, "learning_rate": 0.0009809546010574144, "loss": 1.6416360855102539, "step": 93320, "train_bpb": 0.5787879460790857, "train_bytes": 28697.0125, "train_loss_nats_per_token": 1.643511363507727 }, { "epoch": 0.13391799004503438, "grad_norm": 0.1630859375, "learning_rate": 0.0009803695273071706, "loss": 1.63317813873291, "step": 93340, "train_bpb": 0.5757509868615652, "train_bytes": 28444.45, "train_loss_nats_per_token": 1.6340725488169843 }, { "epoch": 0.13404966948460667, "grad_norm": 0.1474609375, "learning_rate": 0.0009797845433799075, "loss": 1.6400566101074219, "step": 93360, "train_bpb": 0.578785754834215, "train_bytes": 28388.375, "train_loss_nats_per_token": 1.640861599207988 }, { "epoch": 0.134181348924179, "grad_norm": 0.1943359375, "learning_rate": 0.0009791996493767453, "loss": 1.6507171630859374, "step": 93380, "train_bpb": 0.5834919362065605, "train_bytes": 28507.63125, "train_loss_nats_per_token": 1.6518873143294504 }, { "epoch": 0.13431302836375128, "grad_norm": 0.17578125, "learning_rate": 0.0009786148453987875, "loss": 1.6291337966918946, "step": 93400, "train_bpb": 0.5746167399537062, "train_bytes": 28277.6875, "train_loss_nats_per_token": 1.629843895204561 }, { "epoch": 0.1344447078033236, "grad_norm": 0.177734375, "learning_rate": 0.0009780301315471232, "loss": 1.6478610992431642, "step": 93420, "train_bpb": 0.5827818020891855, "train_bytes": 28440.8375, "train_loss_nats_per_token": 1.6479369217411703 }, { "epoch": 0.1345763872428959, "grad_norm": 0.12890625, "learning_rate": 0.0009774455079228264, "loss": 1.6364181518554688, "step": 93440, "train_bpb": 0.5763510245082653, "train_bytes": 28495.86875, "train_loss_nats_per_token": 1.6369828636925599 }, { "epoch": 0.1347080666824682, "grad_norm": 0.1357421875, "learning_rate": 0.0009768609746269538, "loss": 1.642169189453125, "step": 93460, "train_bpb": 0.5816555936933006, "train_bytes": 28142.25625, "train_loss_nats_per_token": 1.6437464333751652 }, { "epoch": 0.1348397461220405, "grad_norm": 0.142578125, "learning_rate": 0.0009762765317605477, "loss": 1.631119728088379, "step": 93480, "train_bpb": 0.579568136894769, "train_bytes": 28195.15, "train_loss_nats_per_token": 1.632451712181244 }, { "epoch": 0.13497142556161282, "grad_norm": 0.12890625, "learning_rate": 0.0009756921794246346, "loss": 1.6327531814575196, "step": 93500, "train_bpb": 0.5774567033538031, "train_bytes": 28424.25625, "train_loss_nats_per_token": 1.6339339031538578 }, { "epoch": 0.1351031050011851, "grad_norm": 0.1416015625, "learning_rate": 0.0009751079177202257, "loss": 1.6300512313842774, "step": 93520, "train_bpb": 0.5783315471306939, "train_bytes": 28035.8875, "train_loss_nats_per_token": 1.6317938331044164 }, { "epoch": 0.13523478444075743, "grad_norm": 0.1806640625, "learning_rate": 0.000974523746748315, "loss": 1.6323549270629882, "step": 93540, "train_bpb": 0.5789512766677246, "train_bytes": 28442.24375, "train_loss_nats_per_token": 1.6322943139505484 }, { "epoch": 0.13536646388032972, "grad_norm": 0.130859375, "learning_rate": 0.0009739396666098829, "loss": 1.6309940338134765, "step": 93560, "train_bpb": 0.5787885218099181, "train_bytes": 27910.2625, "train_loss_nats_per_token": 1.6318369942298707 }, { "epoch": 0.13549814331990204, "grad_norm": 0.1533203125, "learning_rate": 0.0009733556774058932, "loss": 1.6235204696655274, "step": 93580, "train_bpb": 0.5768135571034496, "train_bytes": 28061.35, "train_loss_nats_per_token": 1.6246749710274968 }, { "epoch": 0.13562982275947433, "grad_norm": 0.1376953125, "learning_rate": 0.000972771779237293, "loss": 1.6406171798706055, "step": 93600, "train_bpb": 0.5810520584686545, "train_bytes": 28372.51875, "train_loss_nats_per_token": 1.6413251755304346 }, { "epoch": 0.13576150219904665, "grad_norm": 0.11767578125, "learning_rate": 0.0009721879722050149, "loss": 1.6364131927490235, "step": 93620, "train_bpb": 0.577771386787828, "train_bytes": 28680.55625, "train_loss_nats_per_token": 1.6368827986176986 }, { "epoch": 0.13589318163861894, "grad_norm": 0.1513671875, "learning_rate": 0.0009716042564099761, "loss": 1.6365921020507812, "step": 93640, "train_bpb": 0.5793314372930005, "train_bytes": 28391.575, "train_loss_nats_per_token": 1.63817280888874 }, { "epoch": 0.13602486107819126, "grad_norm": 0.1318359375, "learning_rate": 0.0009710206319530763, "loss": 1.6317621231079102, "step": 93660, "train_bpb": 0.5790224746254963, "train_bytes": 28262.5125, "train_loss_nats_per_token": 1.6331915435909514 }, { "epoch": 0.13615654051776355, "grad_norm": 0.1376953125, "learning_rate": 0.0009704370989352006, "loss": 1.6481637954711914, "step": 93680, "train_bpb": 0.5828419828809386, "train_bytes": 28270.0625, "train_loss_nats_per_token": 1.6485489164176546 }, { "epoch": 0.13628821995733587, "grad_norm": 0.1455078125, "learning_rate": 0.0009698536574572186, "loss": 1.6413450241088867, "step": 93700, "train_bpb": 0.5834136148188732, "train_bytes": 28017.7875, "train_loss_nats_per_token": 1.6419399299187103 }, { "epoch": 0.13641989939690816, "grad_norm": 0.169921875, "learning_rate": 0.0009692703076199841, "loss": 1.6358396530151367, "step": 93720, "train_bpb": 0.5819108772970815, "train_bytes": 28166.45, "train_loss_nats_per_token": 1.636855664130564 }, { "epoch": 0.13655157883648048, "grad_norm": 0.1728515625, "learning_rate": 0.0009686870495243331, "loss": 1.6390090942382813, "step": 93740, "train_bpb": 0.5794541838084171, "train_bytes": 28539.38125, "train_loss_nats_per_token": 1.6392712396179216 }, { "epoch": 0.13668325827605277, "grad_norm": 0.1318359375, "learning_rate": 0.0009681038832710882, "loss": 1.642421340942383, "step": 93760, "train_bpb": 0.5834062757638023, "train_bytes": 28260.50625, "train_loss_nats_per_token": 1.6429824363832295 }, { "epoch": 0.13681493771562508, "grad_norm": 0.1298828125, "learning_rate": 0.0009675208089610553, "loss": 1.6314905166625977, "step": 93780, "train_bpb": 0.579912423650107, "train_bytes": 28158.51875, "train_loss_nats_per_token": 1.6334710763165432 }, { "epoch": 0.13694661715519738, "grad_norm": 0.1396484375, "learning_rate": 0.0009669378266950236, "loss": 1.641739273071289, "step": 93800, "train_bpb": 0.5840175613888222, "train_bytes": 28080.525, "train_loss_nats_per_token": 1.641591275314427 }, { "epoch": 0.1370782965947697, "grad_norm": 0.1279296875, "learning_rate": 0.0009663549365737669, "loss": 1.634971809387207, "step": 93820, "train_bpb": 0.5811269590876371, "train_bytes": 28030.7625, "train_loss_nats_per_token": 1.6356085316724702 }, { "epoch": 0.13720997603434198, "grad_norm": 0.169921875, "learning_rate": 0.0009657721386980444, "loss": 1.6410818099975586, "step": 93840, "train_bpb": 0.5796207371891192, "train_bytes": 28834.81875, "train_loss_nats_per_token": 1.6413060298108042 }, { "epoch": 0.1373416554739143, "grad_norm": 0.1474609375, "learning_rate": 0.0009651894331685969, "loss": 1.6431255340576172, "step": 93860, "train_bpb": 0.5799740617559795, "train_bytes": 28460.84375, "train_loss_nats_per_token": 1.6445700874186084 }, { "epoch": 0.1374733349134866, "grad_norm": 0.1162109375, "learning_rate": 0.0009646068200861509, "loss": 1.6331262588500977, "step": 93880, "train_bpb": 0.5752311236535829, "train_bytes": 28528.94375, "train_loss_nats_per_token": 1.6333350414347365 }, { "epoch": 0.1376050143530589, "grad_norm": 0.130859375, "learning_rate": 0.0009640242995514165, "loss": 1.627403450012207, "step": 93900, "train_bpb": 0.5760421295768119, "train_bytes": 28268.0, "train_loss_nats_per_token": 1.6277944585866193 }, { "epoch": 0.13773669379263123, "grad_norm": 0.197265625, "learning_rate": 0.0009634418716650885, "loss": 1.6177848815917968, "step": 93920, "train_bpb": 0.5755559392429177, "train_bytes": 28391.33125, "train_loss_nats_per_token": 1.6184613156995207 }, { "epoch": 0.13786837323220352, "grad_norm": 0.1826171875, "learning_rate": 0.0009628595365278438, "loss": 1.6467573165893554, "step": 93940, "train_bpb": 0.5853665566712498, "train_bytes": 28304.09375, "train_loss_nats_per_token": 1.647610898349199 }, { "epoch": 0.13800005267177584, "grad_norm": 0.12890625, "learning_rate": 0.000962277294240345, "loss": 1.6300529479980468, "step": 93960, "train_bpb": 0.5744025918495883, "train_bytes": 28648.625, "train_loss_nats_per_token": 1.6303057628529254 }, { "epoch": 0.13813173211134813, "grad_norm": 0.14453125, "learning_rate": 0.0009616951449032388, "loss": 1.6398902893066407, "step": 93980, "train_bpb": 0.5781655156498361, "train_bytes": 28536.28125, "train_loss_nats_per_token": 1.6403228091956785 }, { "epoch": 0.13826341155092045, "grad_norm": 0.140625, "learning_rate": 0.0009611130886171539, "loss": 1.6317173004150392, "step": 94000, "train_bpb": 0.574574292379005, "train_bytes": 28564.70625, "train_loss_nats_per_token": 1.633182431916836 }, { "epoch": 0.13826341155092045, "eval_loss": 1.5201064348220825, "eval_runtime": 74.5416, "eval_samples_per_second": 13.415, "eval_steps_per_second": 13.415, "step": 94000, "train_bpb": 0.5364954144986799, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.527731167077703 }, { "epoch": 0.13839509099049274, "grad_norm": 0.1572265625, "learning_rate": 0.0009605311254827047, "loss": 1.6452445983886719, "step": 94020, "train_bpb": 0.5814499974424292, "train_bytes": 28338.86875, "train_loss_nats_per_token": 1.6454334091449847 }, { "epoch": 0.13852677043006506, "grad_norm": 0.1669921875, "learning_rate": 0.0009599492556004892, "loss": 1.6378572463989258, "step": 94040, "train_bpb": 0.5787217272914725, "train_bytes": 28258.60625, "train_loss_nats_per_token": 1.6392024943994792 }, { "epoch": 0.13865844986963735, "grad_norm": 0.1533203125, "learning_rate": 0.0009593674790710895, "loss": 1.6251667022705079, "step": 94060, "train_bpb": 0.5768404858188622, "train_bytes": 28059.825, "train_loss_nats_per_token": 1.6263154791280021 }, { "epoch": 0.13879012930920967, "grad_norm": 0.1630859375, "learning_rate": 0.0009587857959950697, "loss": 1.6249204635620118, "step": 94080, "train_bpb": 0.5771408185973715, "train_bytes": 28018.88125, "train_loss_nats_per_token": 1.6258425882789178 }, { "epoch": 0.13892180874878196, "grad_norm": 0.16796875, "learning_rate": 0.0009582042064729801, "loss": 1.6348556518554687, "step": 94100, "train_bpb": 0.5788737317790832, "train_bytes": 28406.125, "train_loss_nats_per_token": 1.6355656112289305 }, { "epoch": 0.13905348818835428, "grad_norm": 0.1162109375, "learning_rate": 0.0009576227106053545, "loss": 1.6264799118041993, "step": 94120, "train_bpb": 0.5765611364546928, "train_bytes": 28406.0125, "train_loss_nats_per_token": 1.6269312290543483 }, { "epoch": 0.13918516762792657, "grad_norm": 0.232421875, "learning_rate": 0.0009570413084927083, "loss": 1.6275951385498046, "step": 94140, "train_bpb": 0.5774498153573433, "train_bytes": 28344.60625, "train_loss_nats_per_token": 1.6287598692851253 }, { "epoch": 0.1393168470674989, "grad_norm": 0.1865234375, "learning_rate": 0.000956460000235543, "loss": 1.6336198806762696, "step": 94160, "train_bpb": 0.578213901499634, "train_bytes": 28359.3125, "train_loss_nats_per_token": 1.6344171164196335 }, { "epoch": 0.13944852650707118, "grad_norm": 0.1376953125, "learning_rate": 0.0009558787859343438, "loss": 1.620503044128418, "step": 94180, "train_bpb": 0.5732237403525589, "train_bytes": 28345.08125, "train_loss_nats_per_token": 1.621950364210261 }, { "epoch": 0.1395802059466435, "grad_norm": 0.1474609375, "learning_rate": 0.0009552976656895785, "loss": 1.6453435897827149, "step": 94200, "train_bpb": 0.5783235998398304, "train_bytes": 28560.875, "train_loss_nats_per_token": 1.6469350498230875 }, { "epoch": 0.1397118853862158, "grad_norm": 0.173828125, "learning_rate": 0.0009547166396016986, "loss": 1.6301456451416017, "step": 94220, "train_bpb": 0.580562368368489, "train_bytes": 28165.61875, "train_loss_nats_per_token": 1.6304273274721293 }, { "epoch": 0.1398435648257881, "grad_norm": 0.1259765625, "learning_rate": 0.0009541357077711408, "loss": 1.6377435684204102, "step": 94240, "train_bpb": 0.5808743730524928, "train_bytes": 28127.19375, "train_loss_nats_per_token": 1.6386837738623723 }, { "epoch": 0.1399752442653604, "grad_norm": 0.15625, "learning_rate": 0.0009535548702983245, "loss": 1.6416109085083008, "step": 94260, "train_bpb": 0.5797294337228468, "train_bytes": 28511.50625, "train_loss_nats_per_token": 1.6424763782109293 }, { "epoch": 0.14010692370493272, "grad_norm": 0.14453125, "learning_rate": 0.0009529741272836521, "loss": 1.6242132186889648, "step": 94280, "train_bpb": 0.5793786176937249, "train_bytes": 28324.975, "train_loss_nats_per_token": 1.6250313587233782 }, { "epoch": 0.140238603144505, "grad_norm": 0.1591796875, "learning_rate": 0.000952393478827511, "loss": 1.6468502044677735, "step": 94300, "train_bpb": 0.5847262955680409, "train_bytes": 28057.36875, "train_loss_nats_per_token": 1.6470103565618632 }, { "epoch": 0.14037028258407733, "grad_norm": 0.1669921875, "learning_rate": 0.000951812925030272, "loss": 1.63560791015625, "step": 94320, "train_bpb": 0.5785422667777658, "train_bytes": 28029.39375, "train_loss_nats_per_token": 1.6364519825872534 }, { "epoch": 0.14050196202364962, "grad_norm": 0.1416015625, "learning_rate": 0.0009512324659922889, "loss": 1.6382070541381837, "step": 94340, "train_bpb": 0.5810224012943462, "train_bytes": 28235.75, "train_loss_nats_per_token": 1.6386623892422343 }, { "epoch": 0.14063364146322194, "grad_norm": 0.1630859375, "learning_rate": 0.0009506521018138992, "loss": 1.638409423828125, "step": 94360, "train_bpb": 0.5817802252541879, "train_bytes": 28482.33125, "train_loss_nats_per_token": 1.6397812266192162 }, { "epoch": 0.14076532090279423, "grad_norm": 0.1669921875, "learning_rate": 0.0009500718325954248, "loss": 1.646524429321289, "step": 94380, "train_bpb": 0.585400537523431, "train_bytes": 28148.9875, "train_loss_nats_per_token": 1.648002967519645 }, { "epoch": 0.14089700034236655, "grad_norm": 0.173828125, "learning_rate": 0.0009494916584371706, "loss": 1.641836929321289, "step": 94400, "train_bpb": 0.5838281169366494, "train_bytes": 28270.275, "train_loss_nats_per_token": 1.6425559034311574 }, { "epoch": 0.14102867978193884, "grad_norm": 0.130859375, "learning_rate": 0.0009489115794394244, "loss": 1.6435583114624024, "step": 94420, "train_bpb": 0.5814839128576863, "train_bytes": 28307.80625, "train_loss_nats_per_token": 1.6436073119309822 }, { "epoch": 0.14116035922151116, "grad_norm": 0.138671875, "learning_rate": 0.0009483315957024589, "loss": 1.6572757720947267, "step": 94440, "train_bpb": 0.5826237804398884, "train_bytes": 28506.99375, "train_loss_nats_per_token": 1.6580678011383583 }, { "epoch": 0.14129203866108345, "grad_norm": 0.1875, "learning_rate": 0.0009477517073265304, "loss": 1.657562828063965, "step": 94460, "train_bpb": 0.5868807252162528, "train_bytes": 28348.06875, "train_loss_nats_per_token": 1.6586287851108887 }, { "epoch": 0.14142371810065577, "grad_norm": 0.169921875, "learning_rate": 0.0009471719144118764, "loss": 1.6481866836547852, "step": 94480, "train_bpb": 0.5818581275074746, "train_bytes": 28600.03125, "train_loss_nats_per_token": 1.6489599282044827 }, { "epoch": 0.14155539754022806, "grad_norm": 0.1494140625, "learning_rate": 0.0009465922170587202, "loss": 1.652492141723633, "step": 94500, "train_bpb": 0.580178674023091, "train_bytes": 28580.0375, "train_loss_nats_per_token": 1.6538066730321732 }, { "epoch": 0.14168707697980037, "grad_norm": 0.1357421875, "learning_rate": 0.0009460126153672687, "loss": 1.6488662719726563, "step": 94520, "train_bpb": 0.5837774962052865, "train_bytes": 28406.7375, "train_loss_nats_per_token": 1.6502082525086632 }, { "epoch": 0.14181875641937267, "grad_norm": 0.1376953125, "learning_rate": 0.0009454331094377107, "loss": 1.645648193359375, "step": 94540, "train_bpb": 0.5854806746706581, "train_bytes": 28184.975, "train_loss_nats_per_token": 1.646519872210184 }, { "epoch": 0.14195043585894498, "grad_norm": 0.1875, "learning_rate": 0.000944853699370219, "loss": 1.6547765731811523, "step": 94560, "train_bpb": 0.5879692145038149, "train_bytes": 28104.70625, "train_loss_nats_per_token": 1.6549988689473816 }, { "epoch": 0.1420821152985173, "grad_norm": 0.1494140625, "learning_rate": 0.0009442743852649504, "loss": 1.658769416809082, "step": 94580, "train_bpb": 0.5826363517404373, "train_bytes": 28442.0375, "train_loss_nats_per_token": 1.659264729260412 }, { "epoch": 0.1422137947380896, "grad_norm": 0.1474609375, "learning_rate": 0.0009436951672220454, "loss": 1.650425910949707, "step": 94600, "train_bpb": 0.5802360411389957, "train_bytes": 28493.65, "train_loss_nats_per_token": 1.6514079471978633 }, { "epoch": 0.1423454741776619, "grad_norm": 0.14453125, "learning_rate": 0.0009431160453416258, "loss": 1.6406333923339844, "step": 94620, "train_bpb": 0.5799737341041015, "train_bytes": 28315.83125, "train_loss_nats_per_token": 1.6415696010532645 }, { "epoch": 0.1424771536172342, "grad_norm": 0.171875, "learning_rate": 0.0009425370197237992, "loss": 1.6406391143798829, "step": 94640, "train_bpb": 0.5829979995510036, "train_bytes": 28197.96875, "train_loss_nats_per_token": 1.64121076941771 }, { "epoch": 0.14260883305680652, "grad_norm": 0.15625, "learning_rate": 0.0009419580904686556, "loss": 1.6436012268066407, "step": 94660, "train_bpb": 0.5789030652062247, "train_bytes": 28339.3375, "train_loss_nats_per_token": 1.6436132829790788 }, { "epoch": 0.1427405124963788, "grad_norm": 0.15625, "learning_rate": 0.000941379257676268, "loss": 1.6536056518554687, "step": 94680, "train_bpb": 0.5828618853074086, "train_bytes": 28500.6, "train_loss_nats_per_token": 1.6532911155742551 }, { "epoch": 0.14287219193595113, "grad_norm": 0.1572265625, "learning_rate": 0.0009408005214466931, "loss": 1.6452133178710937, "step": 94700, "train_bpb": 0.5810898274024865, "train_bytes": 28053.91875, "train_loss_nats_per_token": 1.6461940942977464 }, { "epoch": 0.14300387137552342, "grad_norm": 0.16015625, "learning_rate": 0.000940221881879971, "loss": 1.6496334075927734, "step": 94720, "train_bpb": 0.5820344879135189, "train_bytes": 28592.13125, "train_loss_nats_per_token": 1.649723409436925 }, { "epoch": 0.14313555081509574, "grad_norm": 0.146484375, "learning_rate": 0.000939643339076125, "loss": 1.6464969635009765, "step": 94740, "train_bpb": 0.5817830791593307, "train_bytes": 28228.23125, "train_loss_nats_per_token": 1.6472755076889178 }, { "epoch": 0.14326723025466803, "grad_norm": 0.130859375, "learning_rate": 0.0009390648931351613, "loss": 1.6474292755126954, "step": 94760, "train_bpb": 0.5818918219128865, "train_bytes": 28308.94375, "train_loss_nats_per_token": 1.648025441420733 }, { "epoch": 0.14339890969424035, "grad_norm": 0.1591796875, "learning_rate": 0.0009384865441570699, "loss": 1.6391420364379883, "step": 94780, "train_bpb": 0.5811307837592442, "train_bytes": 28350.3, "train_loss_nats_per_token": 1.6395143663317902 }, { "epoch": 0.14353058913381264, "grad_norm": 0.15625, "learning_rate": 0.0009379082922418244, "loss": 1.6482124328613281, "step": 94800, "train_bpb": 0.5796551863757474, "train_bytes": 28799.4875, "train_loss_nats_per_token": 1.6498981773012507 }, { "epoch": 0.14366226857338496, "grad_norm": 0.1162109375, "learning_rate": 0.0009373301374893798, "loss": 1.6547229766845704, "step": 94820, "train_bpb": 0.5837216623609425, "train_bytes": 28373.71875, "train_loss_nats_per_token": 1.6545339362294806 }, { "epoch": 0.14379394801295725, "grad_norm": 0.1416015625, "learning_rate": 0.0009367520799996763, "loss": 1.652752685546875, "step": 94840, "train_bpb": 0.5845069830939993, "train_bytes": 28185.64375, "train_loss_nats_per_token": 1.6533599835151256 }, { "epoch": 0.14392562745252957, "grad_norm": 0.1328125, "learning_rate": 0.0009361741198726367, "loss": 1.6343219757080079, "step": 94860, "train_bpb": 0.5796965977680681, "train_bytes": 28196.325, "train_loss_nats_per_token": 1.6342727343537997 }, { "epoch": 0.14405730689210186, "grad_norm": 0.1318359375, "learning_rate": 0.0009355962572081665, "loss": 1.6453245162963868, "step": 94880, "train_bpb": 0.5808457071978539, "train_bytes": 28208.8625, "train_loss_nats_per_token": 1.646481640841963 }, { "epoch": 0.14418898633167418, "grad_norm": 0.154296875, "learning_rate": 0.0009350184921061544, "loss": 1.6669956207275392, "step": 94900, "train_bpb": 0.5884002951629231, "train_bytes": 28755.925, "train_loss_nats_per_token": 1.6678776666625004 }, { "epoch": 0.14432066577124647, "grad_norm": 0.1650390625, "learning_rate": 0.0009344408246664733, "loss": 1.6457817077636718, "step": 94920, "train_bpb": 0.5818863948329532, "train_bytes": 28508.29375, "train_loss_nats_per_token": 1.6478051998897199 }, { "epoch": 0.1444523452108188, "grad_norm": 0.1494140625, "learning_rate": 0.0009338632549889778, "loss": 1.6459692001342774, "step": 94940, "train_bpb": 0.5826005658931654, "train_bytes": 28511.8375, "train_loss_nats_per_token": 1.646650829200346 }, { "epoch": 0.14458402465039108, "grad_norm": 0.1875, "learning_rate": 0.0009332857831735059, "loss": 1.652542495727539, "step": 94960, "train_bpb": 0.584409893052382, "train_bytes": 28372.88125, "train_loss_nats_per_token": 1.654234975696103 }, { "epoch": 0.1447157040899634, "grad_norm": 0.14453125, "learning_rate": 0.0009327084093198796, "loss": 1.6424230575561523, "step": 94980, "train_bpb": 0.5848413183766428, "train_bytes": 27965.99375, "train_loss_nats_per_token": 1.642665335657267 }, { "epoch": 0.1448473835295357, "grad_norm": 0.169921875, "learning_rate": 0.0009321311335279035, "loss": 1.651705551147461, "step": 95000, "train_bpb": 0.5801450956293323, "train_bytes": 28618.1375, "train_loss_nats_per_token": 1.6523254108516074 }, { "epoch": 0.1448473835295357, "eval_loss": 1.519939661026001, "eval_runtime": 79.3422, "eval_samples_per_second": 12.604, "eval_steps_per_second": 12.604, "step": 95000, "train_bpb": 0.536461736588248, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5276352654315404 }, { "epoch": 0.144979062969108, "grad_norm": 0.12158203125, "learning_rate": 0.0009315539558973648, "loss": 1.7190870285034179, "step": 95020, "train_bpb": 0.6093398436978615, "train_bytes": 27880.66875, "train_loss_nats_per_token": 1.721135540678568 }, { "epoch": 0.1451107424086803, "grad_norm": 0.12255859375, "learning_rate": 0.0009309768765280339, "loss": 1.7090419769287108, "step": 95040, "train_bpb": 0.6041477714139694, "train_bytes": 28201.7625, "train_loss_nats_per_token": 1.7098769798619307 }, { "epoch": 0.14524242184825262, "grad_norm": 0.1728515625, "learning_rate": 0.0009303998955196644, "loss": 1.718939208984375, "step": 95060, "train_bpb": 0.6039750055969214, "train_bytes": 28556.88125, "train_loss_nats_per_token": 1.7188924435925514 }, { "epoch": 0.1453741012878249, "grad_norm": 0.1787109375, "learning_rate": 0.0009298230129719932, "loss": 1.7042245864868164, "step": 95080, "train_bpb": 0.604459977115566, "train_bytes": 28125.21875, "train_loss_nats_per_token": 1.7052208233832642 }, { "epoch": 0.14550578072739723, "grad_norm": 0.13671875, "learning_rate": 0.0009292462289847396, "loss": 1.7076333999633788, "step": 95100, "train_bpb": 0.6025392525074811, "train_bytes": 28126.91875, "train_loss_nats_per_token": 1.708306964476866 }, { "epoch": 0.14563746016696952, "grad_norm": 0.11865234375, "learning_rate": 0.0009286695436576056, "loss": 1.7039628982543946, "step": 95120, "train_bpb": 0.6046959062536605, "train_bytes": 28116.5, "train_loss_nats_per_token": 1.7043294368518065 }, { "epoch": 0.14576913960654184, "grad_norm": 0.1396484375, "learning_rate": 0.000928092957090278, "loss": 1.704327392578125, "step": 95140, "train_bpb": 0.6025830234964993, "train_bytes": 28197.75625, "train_loss_nats_per_token": 1.7049222414936713 }, { "epoch": 0.14590081904611413, "grad_norm": 0.12158203125, "learning_rate": 0.0009275164693824237, "loss": 1.7044149398803712, "step": 95160, "train_bpb": 0.6007837658753755, "train_bytes": 28236.925, "train_loss_nats_per_token": 1.7053525796109748 }, { "epoch": 0.14603249848568645, "grad_norm": 0.1572265625, "learning_rate": 0.0009269400806336947, "loss": 1.7088064193725585, "step": 95180, "train_bpb": 0.6031776911840173, "train_bytes": 28378.55, "train_loss_nats_per_token": 1.7092471634776847 }, { "epoch": 0.14616417792525874, "grad_norm": 0.1572265625, "learning_rate": 0.0009263637909437253, "loss": 1.7114120483398438, "step": 95200, "train_bpb": 0.603227533466954, "train_bytes": 28402.48125, "train_loss_nats_per_token": 1.7117022131647939 }, { "epoch": 0.14629585736483106, "grad_norm": 0.12353515625, "learning_rate": 0.0009257876004121323, "loss": 1.7003568649291991, "step": 95220, "train_bpb": 0.6043115244430842, "train_bytes": 27937.80625, "train_loss_nats_per_token": 1.7021461843510886 }, { "epoch": 0.14642753680440337, "grad_norm": 0.166015625, "learning_rate": 0.0009252115091385154, "loss": 1.7040756225585938, "step": 95240, "train_bpb": 0.6069188233331904, "train_bytes": 27873.28125, "train_loss_nats_per_token": 1.7044773550992087 }, { "epoch": 0.14655921624397567, "grad_norm": 0.130859375, "learning_rate": 0.0009246355172224578, "loss": 1.7194852828979492, "step": 95260, "train_bpb": 0.606944995420696, "train_bytes": 28249.525, "train_loss_nats_per_token": 1.719125608092493 }, { "epoch": 0.14669089568354798, "grad_norm": 0.15234375, "learning_rate": 0.0009240596247635252, "loss": 1.7120227813720703, "step": 95280, "train_bpb": 0.6024481643391331, "train_bytes": 28509.575, "train_loss_nats_per_token": 1.712650265861199 }, { "epoch": 0.14682257512312027, "grad_norm": 0.1337890625, "learning_rate": 0.0009234838318612651, "loss": 1.7068548202514648, "step": 95300, "train_bpb": 0.6044527552130733, "train_bytes": 28106.76875, "train_loss_nats_per_token": 1.7070275614663823 }, { "epoch": 0.1469542545626926, "grad_norm": 0.166015625, "learning_rate": 0.0009229081386152094, "loss": 1.7022993087768554, "step": 95320, "train_bpb": 0.6048014081934504, "train_bytes": 27973.9375, "train_loss_nats_per_token": 1.7022674313030728 }, { "epoch": 0.14708593400226488, "grad_norm": 0.1943359375, "learning_rate": 0.0009223325451248722, "loss": 1.7011146545410156, "step": 95340, "train_bpb": 0.6017001280078664, "train_bytes": 28369.2375, "train_loss_nats_per_token": 1.7015652121006293 }, { "epoch": 0.1472176134418372, "grad_norm": 0.138671875, "learning_rate": 0.0009217570514897499, "loss": 1.7209228515625, "step": 95360, "train_bpb": 0.6051625192227708, "train_bytes": 28491.05, "train_loss_nats_per_token": 1.7208920210000527 }, { "epoch": 0.1473492928814095, "grad_norm": 0.11572265625, "learning_rate": 0.0009211816578093219, "loss": 1.7098424911499024, "step": 95380, "train_bpb": 0.6030886548630252, "train_bytes": 28421.7375, "train_loss_nats_per_token": 1.7111904598482326 }, { "epoch": 0.1474809723209818, "grad_norm": 0.1484375, "learning_rate": 0.0009206063641830504, "loss": 1.7157215118408202, "step": 95400, "train_bpb": 0.6057670401035388, "train_bytes": 28298.6875, "train_loss_nats_per_token": 1.7163405153506792 }, { "epoch": 0.1476126517605541, "grad_norm": 0.134765625, "learning_rate": 0.0009200311707103805, "loss": 1.696200180053711, "step": 95420, "train_bpb": 0.6029178710661375, "train_bytes": 28211.69375, "train_loss_nats_per_token": 1.6966002636933408 }, { "epoch": 0.14774433120012642, "grad_norm": 0.10986328125, "learning_rate": 0.0009194560774907393, "loss": 1.709141731262207, "step": 95440, "train_bpb": 0.6027867672920109, "train_bytes": 28760.21875, "train_loss_nats_per_token": 1.7093699689545967 }, { "epoch": 0.1478760106396987, "grad_norm": 0.13671875, "learning_rate": 0.0009188810846235372, "loss": 1.7037792205810547, "step": 95460, "train_bpb": 0.6016007308799143, "train_bytes": 28113.36875, "train_loss_nats_per_token": 1.7037976985647338 }, { "epoch": 0.14800769007927103, "grad_norm": 0.2021484375, "learning_rate": 0.0009183061922081677, "loss": 1.703654670715332, "step": 95480, "train_bpb": 0.6014951956956033, "train_bytes": 28196.0, "train_loss_nats_per_token": 1.7043104008983683 }, { "epoch": 0.14813936951884332, "grad_norm": 0.126953125, "learning_rate": 0.0009177314003440059, "loss": 1.711880874633789, "step": 95500, "train_bpb": 0.6060015120063672, "train_bytes": 27951.14375, "train_loss_nats_per_token": 1.7118295031936206 }, { "epoch": 0.14827104895841564, "grad_norm": 0.1552734375, "learning_rate": 0.0009171567091304094, "loss": 1.7037710189819335, "step": 95520, "train_bpb": 0.6029902762821988, "train_bytes": 28516.65, "train_loss_nats_per_token": 1.7050110581802866 }, { "epoch": 0.14840272839798793, "grad_norm": 0.2216796875, "learning_rate": 0.0009165821186667198, "loss": 1.707832145690918, "step": 95540, "train_bpb": 0.6003159573354963, "train_bytes": 28524.8375, "train_loss_nats_per_token": 1.7091651455270944 }, { "epoch": 0.14853440783756025, "grad_norm": 0.169921875, "learning_rate": 0.00091600762905226, "loss": 1.7060239791870118, "step": 95560, "train_bpb": 0.6032677126523251, "train_bytes": 28212.21875, "train_loss_nats_per_token": 1.7062051189663858 }, { "epoch": 0.14866608727713254, "grad_norm": 0.12451171875, "learning_rate": 0.0009154332403863356, "loss": 1.715734100341797, "step": 95580, "train_bpb": 0.6033015060307502, "train_bytes": 28664.2125, "train_loss_nats_per_token": 1.7157968431775452 }, { "epoch": 0.14879776671670486, "grad_norm": 0.1630859375, "learning_rate": 0.0009148589527682358, "loss": 1.71593017578125, "step": 95600, "train_bpb": 0.6054203952631815, "train_bytes": 28444.48125, "train_loss_nats_per_token": 1.7162519757206107 }, { "epoch": 0.14892944615627715, "grad_norm": 0.1533203125, "learning_rate": 0.0009142847662972312, "loss": 1.6997478485107422, "step": 95620, "train_bpb": 0.6022188145391113, "train_bytes": 28048.78125, "train_loss_nats_per_token": 1.7007631820559337 }, { "epoch": 0.14906112559584947, "grad_norm": 0.10546875, "learning_rate": 0.0009137106810725748, "loss": 1.7125518798828125, "step": 95640, "train_bpb": 0.6074833296361932, "train_bytes": 28026.99375, "train_loss_nats_per_token": 1.712518161131948 }, { "epoch": 0.14919280503542176, "grad_norm": 0.125, "learning_rate": 0.0009131366971935034, "loss": 1.7098072052001954, "step": 95660, "train_bpb": 0.6033933552938161, "train_bytes": 28333.70625, "train_loss_nats_per_token": 1.7097487609905606 }, { "epoch": 0.14932448447499408, "grad_norm": 0.1484375, "learning_rate": 0.0009125628147592352, "loss": 1.724881362915039, "step": 95680, "train_bpb": 0.6047435795170906, "train_bytes": 28754.51875, "train_loss_nats_per_token": 1.7251962488311847 }, { "epoch": 0.14945616391456637, "grad_norm": 0.1953125, "learning_rate": 0.0009119890338689709, "loss": 1.7066352844238282, "step": 95700, "train_bpb": 0.6020684650221082, "train_bytes": 28427.98125, "train_loss_nats_per_token": 1.7065373493182814 }, { "epoch": 0.1495878433541387, "grad_norm": 0.12890625, "learning_rate": 0.000911415354621894, "loss": 1.7076074600219726, "step": 95720, "train_bpb": 0.606861603950306, "train_bytes": 28210.0125, "train_loss_nats_per_token": 1.708430431438823 }, { "epoch": 0.14971952279371098, "grad_norm": 0.11962890625, "learning_rate": 0.0009108417771171707, "loss": 1.714594841003418, "step": 95740, "train_bpb": 0.6052636527208017, "train_bytes": 28418.81875, "train_loss_nats_per_token": 1.7143597826855599 }, { "epoch": 0.1498512022332833, "grad_norm": 0.1513671875, "learning_rate": 0.0009102683014539488, "loss": 1.702469825744629, "step": 95760, "train_bpb": 0.6032826137453359, "train_bytes": 28148.4875, "train_loss_nats_per_token": 1.7028669598915154 }, { "epoch": 0.1499828816728556, "grad_norm": 0.15625, "learning_rate": 0.0009096949277313588, "loss": 1.719025230407715, "step": 95780, "train_bpb": 0.6063180067553239, "train_bytes": 28704.01875, "train_loss_nats_per_token": 1.7198389428174723 }, { "epoch": 0.1501145611124279, "grad_norm": 0.181640625, "learning_rate": 0.0009091216560485143, "loss": 1.7078948974609376, "step": 95800, "train_bpb": 0.6060050866714778, "train_bytes": 28095.81875, "train_loss_nats_per_token": 1.7088327379287203 }, { "epoch": 0.1502462405520002, "grad_norm": 0.1416015625, "learning_rate": 0.0009085484865045098, "loss": 1.7067127227783203, "step": 95820, "train_bpb": 0.6012260196312187, "train_bytes": 28513.59375, "train_loss_nats_per_token": 1.7070808123446104 }, { "epoch": 0.15037791999157252, "grad_norm": 0.1640625, "learning_rate": 0.0009079754191984239, "loss": 1.6988542556762696, "step": 95840, "train_bpb": 0.5999672096031596, "train_bytes": 28547.86875, "train_loss_nats_per_token": 1.6989293734979778 }, { "epoch": 0.1505095994311448, "grad_norm": 0.138671875, "learning_rate": 0.0009074024542293159, "loss": 1.7154918670654298, "step": 95860, "train_bpb": 0.6080230643400178, "train_bytes": 28127.91875, "train_loss_nats_per_token": 1.7167460852362775 }, { "epoch": 0.15064127887071713, "grad_norm": 0.16796875, "learning_rate": 0.0009068295916962289, "loss": 1.7033304214477538, "step": 95880, "train_bpb": 0.5986086942747421, "train_bytes": 28587.2375, "train_loss_nats_per_token": 1.702841971803792 }, { "epoch": 0.15077295831028942, "grad_norm": 0.1416015625, "learning_rate": 0.0009062568316981871, "loss": 1.7053024291992187, "step": 95900, "train_bpb": 0.6027677403061455, "train_bytes": 28222.88125, "train_loss_nats_per_token": 1.7063917008438354 }, { "epoch": 0.15090463774986174, "grad_norm": 0.15234375, "learning_rate": 0.0009056841743341971, "loss": 1.7176174163818358, "step": 95920, "train_bpb": 0.6068557391141673, "train_bytes": 28444.58125, "train_loss_nats_per_token": 1.7178446729135783 }, { "epoch": 0.15103631718943406, "grad_norm": 0.1572265625, "learning_rate": 0.0009051116197032489, "loss": 1.7154226303100586, "step": 95940, "train_bpb": 0.6080434121678144, "train_bytes": 28380.6375, "train_loss_nats_per_token": 1.7156331425657831 }, { "epoch": 0.15116799662900635, "grad_norm": 0.1279296875, "learning_rate": 0.0009045391679043131, "loss": 1.7020042419433594, "step": 95960, "train_bpb": 0.6033364804956379, "train_bytes": 28177.96875, "train_loss_nats_per_token": 1.7033995423499535 }, { "epoch": 0.15129967606857866, "grad_norm": 0.1484375, "learning_rate": 0.0009039668190363435, "loss": 1.7243108749389648, "step": 95980, "train_bpb": 0.6056138892694818, "train_bytes": 28773.3625, "train_loss_nats_per_token": 1.724319402950242 }, { "epoch": 0.15143135550815096, "grad_norm": 0.126953125, "learning_rate": 0.0009033945731982761, "loss": 1.7056566238403321, "step": 96000, "train_bpb": 0.6028767622741884, "train_bytes": 28477.1625, "train_loss_nats_per_token": 1.7059092342583861 }, { "epoch": 0.15143135550815096, "eval_loss": 1.528017282485962, "eval_runtime": 74.8411, "eval_samples_per_second": 13.362, "eval_steps_per_second": 13.362, "step": 96000, "train_bpb": 0.5392267356371999, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.535508911896853 }, { "epoch": 0.15156303494772327, "grad_norm": 0.154296875, "learning_rate": 0.0009028224304890294, "loss": 1.706231689453125, "step": 96020, "train_bpb": 0.6060019204918843, "train_bytes": 28387.98125, "train_loss_nats_per_token": 1.707734317273735 }, { "epoch": 0.15169471438729557, "grad_norm": 0.1640625, "learning_rate": 0.0009022503910075031, "loss": 1.7198251724243163, "step": 96040, "train_bpb": 0.6074794700145093, "train_bytes": 28474.01875, "train_loss_nats_per_token": 1.7206518929846455 }, { "epoch": 0.15182639382686788, "grad_norm": 0.189453125, "learning_rate": 0.0009016784548525794, "loss": 1.6977010726928712, "step": 96060, "train_bpb": 0.6014357874273449, "train_bytes": 28119.36875, "train_loss_nats_per_token": 1.6990779264767395 }, { "epoch": 0.15195807326644017, "grad_norm": 0.177734375, "learning_rate": 0.0009011066221231232, "loss": 1.719192123413086, "step": 96080, "train_bpb": 0.6048781047917404, "train_bytes": 28546.94375, "train_loss_nats_per_token": 1.7190546590620919 }, { "epoch": 0.1520897527060125, "grad_norm": 0.1435546875, "learning_rate": 0.0009005348929179811, "loss": 1.7105871200561524, "step": 96100, "train_bpb": 0.6052223111212718, "train_bytes": 28158.56875, "train_loss_nats_per_token": 1.710938734980096 }, { "epoch": 0.15222143214558478, "grad_norm": 0.1796875, "learning_rate": 0.0008999632673359813, "loss": 1.7072542190551758, "step": 96120, "train_bpb": 0.6035046026838982, "train_bytes": 28463.2375, "train_loss_nats_per_token": 1.7082235903492253 }, { "epoch": 0.1523531115851571, "grad_norm": 0.1923828125, "learning_rate": 0.0008993917454759355, "loss": 1.71112060546875, "step": 96140, "train_bpb": 0.6059590838598097, "train_bytes": 28385.43125, "train_loss_nats_per_token": 1.7117195670538536 }, { "epoch": 0.1524847910247294, "grad_norm": 0.13671875, "learning_rate": 0.0008988203274366356, "loss": 1.6971397399902344, "step": 96160, "train_bpb": 0.603632027882881, "train_bytes": 28130.36875, "train_loss_nats_per_token": 1.6974154441617888 }, { "epoch": 0.1526164704643017, "grad_norm": 0.1572265625, "learning_rate": 0.0008982490133168574, "loss": 1.7221086502075196, "step": 96180, "train_bpb": 0.6058118429543412, "train_bytes": 28517.55625, "train_loss_nats_per_token": 1.7223230699458898 }, { "epoch": 0.152748149903874, "grad_norm": 0.1279296875, "learning_rate": 0.0008976778032153574, "loss": 1.7185670852661132, "step": 96200, "train_bpb": 0.6061443231201026, "train_bytes": 28597.8, "train_loss_nats_per_token": 1.7187714136538892 }, { "epoch": 0.15287982934344632, "grad_norm": 0.1435546875, "learning_rate": 0.000897106697230875, "loss": 1.7045419692993165, "step": 96220, "train_bpb": 0.6045240271013362, "train_bytes": 27843.35, "train_loss_nats_per_token": 1.7050883946336055 }, { "epoch": 0.1530115087830186, "grad_norm": 0.2041015625, "learning_rate": 0.0008965356954621309, "loss": 1.7011941909790038, "step": 96240, "train_bpb": 0.6009061911394035, "train_bytes": 28124.7875, "train_loss_nats_per_token": 1.7019298212570997 }, { "epoch": 0.15314318822259093, "grad_norm": 0.134765625, "learning_rate": 0.0008959647980078277, "loss": 1.710463523864746, "step": 96260, "train_bpb": 0.6035575734180033, "train_bytes": 28454.475, "train_loss_nats_per_token": 1.7116523490788396 }, { "epoch": 0.15327486766216322, "grad_norm": 0.1396484375, "learning_rate": 0.0008953940049666512, "loss": 1.7112716674804687, "step": 96280, "train_bpb": 0.6038570128749241, "train_bytes": 28446.5875, "train_loss_nats_per_token": 1.7120883846556707 }, { "epoch": 0.15340654710173554, "grad_norm": 0.142578125, "learning_rate": 0.000894823316437268, "loss": 1.6881231307983398, "step": 96300, "train_bpb": 0.5978223964588301, "train_bytes": 28309.91875, "train_loss_nats_per_token": 1.6888068969582133 }, { "epoch": 0.15353822654130783, "grad_norm": 0.66015625, "learning_rate": 0.0008942527325183264, "loss": 1.7038166046142578, "step": 96320, "train_bpb": 0.6028835691462051, "train_bytes": 28224.70625, "train_loss_nats_per_token": 1.7048069897237983 }, { "epoch": 0.15366990598088015, "grad_norm": 0.1376953125, "learning_rate": 0.000893682253308458, "loss": 1.7030439376831055, "step": 96340, "train_bpb": 0.5999882936619342, "train_bytes": 28276.9, "train_loss_nats_per_token": 1.7028061349301482 }, { "epoch": 0.15380158542045244, "grad_norm": 0.1591796875, "learning_rate": 0.0008931118789062748, "loss": 1.7082128524780273, "step": 96360, "train_bpb": 0.6061821979016546, "train_bytes": 28144.8625, "train_loss_nats_per_token": 1.7087083494356845 }, { "epoch": 0.15393326486002476, "grad_norm": 0.1650390625, "learning_rate": 0.0008925416094103718, "loss": 1.7086477279663086, "step": 96380, "train_bpb": 0.606055289736087, "train_bytes": 28250.74375, "train_loss_nats_per_token": 1.7088069354658362 }, { "epoch": 0.15406494429959705, "grad_norm": 0.12890625, "learning_rate": 0.000891971444919325, "loss": 1.7105846405029297, "step": 96400, "train_bpb": 0.6023958296198173, "train_bytes": 28636.58125, "train_loss_nats_per_token": 1.7108318711304142 }, { "epoch": 0.15419662373916937, "grad_norm": 0.1416015625, "learning_rate": 0.0008914013855316932, "loss": 1.7035861968994142, "step": 96420, "train_bpb": 0.6025552046110522, "train_bytes": 28397.0375, "train_loss_nats_per_token": 1.704703117343184 }, { "epoch": 0.15432830317874166, "grad_norm": 0.1572265625, "learning_rate": 0.0008908314313460161, "loss": 1.714505386352539, "step": 96440, "train_bpb": 0.6036161307088231, "train_bytes": 28633.75, "train_loss_nats_per_token": 1.714586539924221 }, { "epoch": 0.15445998261831398, "grad_norm": 0.1845703125, "learning_rate": 0.0008902615824608153, "loss": 1.7022619247436523, "step": 96460, "train_bpb": 0.601748721131171, "train_bytes": 28264.39375, "train_loss_nats_per_token": 1.7034027547309105 }, { "epoch": 0.15459166205788627, "grad_norm": 0.1748046875, "learning_rate": 0.0008896918389745952, "loss": 1.7073741912841798, "step": 96480, "train_bpb": 0.6057777951494951, "train_bytes": 28072.44375, "train_loss_nats_per_token": 1.707238779288468 }, { "epoch": 0.1547233414974586, "grad_norm": 0.1796875, "learning_rate": 0.0008891222009858407, "loss": 1.7049394607543946, "step": 96500, "train_bpb": 0.604837940476666, "train_bytes": 28200.34375, "train_loss_nats_per_token": 1.7054584720351453 }, { "epoch": 0.15485502093703088, "grad_norm": 0.119140625, "learning_rate": 0.0008885526685930196, "loss": 1.715053176879883, "step": 96520, "train_bpb": 0.6088905035527877, "train_bytes": 28176.06875, "train_loss_nats_per_token": 1.7155436687629781 }, { "epoch": 0.1549867003766032, "grad_norm": 0.25, "learning_rate": 0.0008879832418945803, "loss": 1.7019725799560548, "step": 96540, "train_bpb": 0.6013591330646739, "train_bytes": 28205.4625, "train_loss_nats_per_token": 1.7027917725124964 }, { "epoch": 0.1551183798161755, "grad_norm": 0.150390625, "learning_rate": 0.0008874139209889541, "loss": 1.707000732421875, "step": 96560, "train_bpb": 0.6018915109406643, "train_bytes": 28393.4875, "train_loss_nats_per_token": 1.7074380125532977 }, { "epoch": 0.1552500592557478, "grad_norm": 0.1513671875, "learning_rate": 0.0008868447059745533, "loss": 1.7087844848632812, "step": 96580, "train_bpb": 0.6031222530440157, "train_bytes": 28608.50625, "train_loss_nats_per_token": 1.7091980894162164 }, { "epoch": 0.15538173869532013, "grad_norm": 0.20703125, "learning_rate": 0.0008862755969497713, "loss": 1.7120590209960938, "step": 96600, "train_bpb": 0.6046083744577644, "train_bytes": 28232.54375, "train_loss_nats_per_token": 1.7130358858264132 }, { "epoch": 0.15551341813489242, "grad_norm": 0.12890625, "learning_rate": 0.0008857065940129848, "loss": 1.7057601928710937, "step": 96620, "train_bpb": 0.6035767295982335, "train_bytes": 28275.1, "train_loss_nats_per_token": 1.7070263397561918 }, { "epoch": 0.15564509757446474, "grad_norm": 0.140625, "learning_rate": 0.000885137697262551, "loss": 1.7131263732910156, "step": 96640, "train_bpb": 0.6043166280101848, "train_bytes": 28260.75625, "train_loss_nats_per_token": 1.713664412344133 }, { "epoch": 0.15577677701403703, "grad_norm": 0.1474609375, "learning_rate": 0.000884568906796809, "loss": 1.719533348083496, "step": 96660, "train_bpb": 0.6073879069115424, "train_bytes": 28278.8, "train_loss_nats_per_token": 1.7202748816840758 }, { "epoch": 0.15590845645360935, "grad_norm": 0.1376953125, "learning_rate": 0.0008840002227140796, "loss": 1.709517478942871, "step": 96680, "train_bpb": 0.6050861343886899, "train_bytes": 28215.1125, "train_loss_nats_per_token": 1.7108122693164034 }, { "epoch": 0.15604013589318164, "grad_norm": 0.1298828125, "learning_rate": 0.0008834316451126647, "loss": 1.7221654891967773, "step": 96700, "train_bpb": 0.6086486728742158, "train_bytes": 28276.9625, "train_loss_nats_per_token": 1.7222467859825585 }, { "epoch": 0.15617181533275395, "grad_norm": 0.142578125, "learning_rate": 0.000882863174090849, "loss": 1.734154510498047, "step": 96720, "train_bpb": 0.6128983120659469, "train_bytes": 28350.1125, "train_loss_nats_per_token": 1.734993087915622 }, { "epoch": 0.15630349477232625, "grad_norm": 0.1298828125, "learning_rate": 0.0008822948097468975, "loss": 1.714712142944336, "step": 96740, "train_bpb": 0.6072384522388864, "train_bytes": 28334.85, "train_loss_nats_per_token": 1.7162100546288224 }, { "epoch": 0.15643517421189856, "grad_norm": 0.16015625, "learning_rate": 0.0008817265521790576, "loss": 1.7266813278198243, "step": 96760, "train_bpb": 0.6110520394466599, "train_bytes": 28435.4, "train_loss_nats_per_token": 1.7273700217312844 }, { "epoch": 0.15656685365147086, "grad_norm": 0.173828125, "learning_rate": 0.0008811584014855578, "loss": 1.7203510284423829, "step": 96780, "train_bpb": 0.6085557880613963, "train_bytes": 28400.925, "train_loss_nats_per_token": 1.7206878889078276 }, { "epoch": 0.15669853309104317, "grad_norm": 0.158203125, "learning_rate": 0.0008805903577646079, "loss": 1.7153970718383789, "step": 96800, "train_bpb": 0.606132494727477, "train_bytes": 28329.78125, "train_loss_nats_per_token": 1.7163344409025598 }, { "epoch": 0.15683021253061546, "grad_norm": 0.16015625, "learning_rate": 0.0008800224211144001, "loss": 1.7110122680664062, "step": 96820, "train_bpb": 0.6065627877714972, "train_bytes": 28484.8, "train_loss_nats_per_token": 1.7110201995574381 }, { "epoch": 0.15696189197018778, "grad_norm": 0.11328125, "learning_rate": 0.0008794545916331072, "loss": 1.7139879226684571, "step": 96840, "train_bpb": 0.606811151138485, "train_bytes": 27930.3375, "train_loss_nats_per_token": 1.713660448184724 }, { "epoch": 0.15709357140976007, "grad_norm": 0.193359375, "learning_rate": 0.0008788868694188841, "loss": 1.7143594741821289, "step": 96860, "train_bpb": 0.6049792489466518, "train_bytes": 28333.96875, "train_loss_nats_per_token": 1.7154200592725601 }, { "epoch": 0.1572252508493324, "grad_norm": 0.18359375, "learning_rate": 0.0008783192545698669, "loss": 1.71708984375, "step": 96880, "train_bpb": 0.6090678745403622, "train_bytes": 28155.80625, "train_loss_nats_per_token": 1.7178110272128917 }, { "epoch": 0.15735693028890468, "grad_norm": 0.1572265625, "learning_rate": 0.0008777517471841726, "loss": 1.7153387069702148, "step": 96900, "train_bpb": 0.6057009470217097, "train_bytes": 28571.99375, "train_loss_nats_per_token": 1.7152849579287663 }, { "epoch": 0.157488609728477, "grad_norm": 0.14453125, "learning_rate": 0.000877184347359901, "loss": 1.711075210571289, "step": 96920, "train_bpb": 0.6043619921329981, "train_bytes": 28514.25, "train_loss_nats_per_token": 1.712243929863769 }, { "epoch": 0.1576202891680493, "grad_norm": 0.12353515625, "learning_rate": 0.0008766170551951316, "loss": 1.7041330337524414, "step": 96940, "train_bpb": 0.6021504251481438, "train_bytes": 28048.675, "train_loss_nats_per_token": 1.7048742960502872 }, { "epoch": 0.1577519686076216, "grad_norm": 0.1533203125, "learning_rate": 0.0008760498707879267, "loss": 1.7087915420532227, "step": 96960, "train_bpb": 0.6052154186715671, "train_bytes": 28252.86875, "train_loss_nats_per_token": 1.7094547642228997 }, { "epoch": 0.1578836480471939, "grad_norm": 0.1552734375, "learning_rate": 0.0008754827942363294, "loss": 1.7256914138793946, "step": 96980, "train_bpb": 0.6114879569626126, "train_bytes": 28244.14375, "train_loss_nats_per_token": 1.7266259616808284 }, { "epoch": 0.15801532748676622, "grad_norm": 0.1455078125, "learning_rate": 0.0008749158256383636, "loss": 1.705889892578125, "step": 97000, "train_bpb": 0.606905341734699, "train_bytes": 28004.7, "train_loss_nats_per_token": 1.7063754618635965 }, { "epoch": 0.15801532748676622, "eval_loss": 1.53024160861969, "eval_runtime": 75.2645, "eval_samples_per_second": 13.286, "eval_steps_per_second": 13.286, "step": 97000, "train_bpb": 0.5400173376330201, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5377602401973882 }, { "epoch": 0.1581470069263385, "grad_norm": 0.138671875, "learning_rate": 0.0008743489650920363, "loss": 1.7304197311401368, "step": 97020, "train_bpb": 0.6089478310690976, "train_bytes": 28671.1875, "train_loss_nats_per_token": 1.730615188071403 }, { "epoch": 0.15827868636591083, "grad_norm": 0.1728515625, "learning_rate": 0.0008737822126953335, "loss": 1.7193201065063477, "step": 97040, "train_bpb": 0.6073023971280734, "train_bytes": 28385.4125, "train_loss_nats_per_token": 1.720925546352208 }, { "epoch": 0.15841036580548312, "grad_norm": 0.1259765625, "learning_rate": 0.0008732155685462238, "loss": 1.7161243438720704, "step": 97060, "train_bpb": 0.6059167214593474, "train_bytes": 28408.21875, "train_loss_nats_per_token": 1.7167141560421255 }, { "epoch": 0.15854204524505544, "grad_norm": 0.171875, "learning_rate": 0.0008726490327426573, "loss": 1.7215957641601562, "step": 97080, "train_bpb": 0.6066088777475446, "train_bytes": 28712.125, "train_loss_nats_per_token": 1.7213554662610446 }, { "epoch": 0.15867372468462773, "grad_norm": 0.2001953125, "learning_rate": 0.0008720826053825654, "loss": 1.716069221496582, "step": 97100, "train_bpb": 0.605365865632852, "train_bytes": 28448.24375, "train_loss_nats_per_token": 1.7166282863563818 }, { "epoch": 0.15880540412420005, "grad_norm": 0.12060546875, "learning_rate": 0.0008715162865638591, "loss": 1.7131099700927734, "step": 97120, "train_bpb": 0.6055197074311008, "train_bytes": 28483.6875, "train_loss_nats_per_token": 1.7144884847748862 }, { "epoch": 0.15893708356377234, "grad_norm": 0.1279296875, "learning_rate": 0.0008709500763844329, "loss": 1.7149831771850585, "step": 97140, "train_bpb": 0.6085789566606653, "train_bytes": 28200.11875, "train_loss_nats_per_token": 1.7161604078810815 }, { "epoch": 0.15906876300334466, "grad_norm": 0.142578125, "learning_rate": 0.0008703839749421617, "loss": 1.7182350158691406, "step": 97160, "train_bpb": 0.6078313590106988, "train_bytes": 28178.69375, "train_loss_nats_per_token": 1.7188920785687671 }, { "epoch": 0.15920044244291695, "grad_norm": 0.158203125, "learning_rate": 0.0008698179823349006, "loss": 1.709062385559082, "step": 97180, "train_bpb": 0.6059577123704843, "train_bytes": 28143.6, "train_loss_nats_per_token": 1.709836425553916 }, { "epoch": 0.15933212188248927, "grad_norm": 0.16015625, "learning_rate": 0.0008692520986604869, "loss": 1.714494514465332, "step": 97200, "train_bpb": 0.6031134924454211, "train_bytes": 28488.7875, "train_loss_nats_per_token": 1.7143458373452691 }, { "epoch": 0.15946380132206156, "grad_norm": 0.140625, "learning_rate": 0.0008686863240167398, "loss": 1.7206430435180664, "step": 97220, "train_bpb": 0.6076559678718548, "train_bytes": 28225.26875, "train_loss_nats_per_token": 1.7223818850175112 }, { "epoch": 0.15959548076163388, "grad_norm": 0.125, "learning_rate": 0.0008681206585014571, "loss": 1.7276628494262696, "step": 97240, "train_bpb": 0.6048243631957532, "train_bytes": 28562.5125, "train_loss_nats_per_token": 1.7289076399125527 }, { "epoch": 0.1597271602012062, "grad_norm": 0.1396484375, "learning_rate": 0.0008675551022124206, "loss": 1.7185007095336915, "step": 97260, "train_bpb": 0.6068075067571587, "train_bytes": 28477.26875, "train_loss_nats_per_token": 1.7182789695527936 }, { "epoch": 0.1598588396407785, "grad_norm": 0.1513671875, "learning_rate": 0.0008669896552473916, "loss": 1.712815284729004, "step": 97280, "train_bpb": 0.6005482670425654, "train_bytes": 28508.4625, "train_loss_nats_per_token": 1.7129519191164697 }, { "epoch": 0.1599905190803508, "grad_norm": 0.1474609375, "learning_rate": 0.0008664243177041135, "loss": 1.7164598464965821, "step": 97300, "train_bpb": 0.6050641201685442, "train_bytes": 28485.7875, "train_loss_nats_per_token": 1.7172729569392775 }, { "epoch": 0.1601221985199231, "grad_norm": 0.1796875, "learning_rate": 0.000865859089680309, "loss": 1.7093982696533203, "step": 97320, "train_bpb": 0.605378493229492, "train_bytes": 28232.00625, "train_loss_nats_per_token": 1.7090425121480628 }, { "epoch": 0.16025387795949542, "grad_norm": 0.1328125, "learning_rate": 0.0008652939712736836, "loss": 1.7183828353881836, "step": 97340, "train_bpb": 0.6086618942601485, "train_bytes": 28305.73125, "train_loss_nats_per_token": 1.7197025763257117 }, { "epoch": 0.1603855573990677, "grad_norm": 0.14453125, "learning_rate": 0.0008647289625819242, "loss": 1.7179227828979493, "step": 97360, "train_bpb": 0.6059676420068923, "train_bytes": 28309.9125, "train_loss_nats_per_token": 1.7181467725496582 }, { "epoch": 0.16051723683864003, "grad_norm": 0.16796875, "learning_rate": 0.0008641640637026962, "loss": 1.7142154693603515, "step": 97380, "train_bpb": 0.6068293114673411, "train_bytes": 28319.3, "train_loss_nats_per_token": 1.7143144866485434 }, { "epoch": 0.16064891627821232, "grad_norm": 0.1611328125, "learning_rate": 0.0008635992747336483, "loss": 1.7133317947387696, "step": 97400, "train_bpb": 0.6073147627810324, "train_bytes": 28616.14375, "train_loss_nats_per_token": 1.7138099392505834 }, { "epoch": 0.16078059571778464, "grad_norm": 0.1728515625, "learning_rate": 0.0008630345957724104, "loss": 1.7180124282836915, "step": 97420, "train_bpb": 0.607110802717712, "train_bytes": 28559.59375, "train_loss_nats_per_token": 1.7184115894817322 }, { "epoch": 0.16091227515735693, "grad_norm": 0.1865234375, "learning_rate": 0.0008624700269165914, "loss": 1.7253122329711914, "step": 97440, "train_bpb": 0.6075854193226277, "train_bytes": 28439.74375, "train_loss_nats_per_token": 1.7257205164488465 }, { "epoch": 0.16104395459692925, "grad_norm": 0.166015625, "learning_rate": 0.0008619055682637825, "loss": 1.719085693359375, "step": 97460, "train_bpb": 0.6099790475847431, "train_bytes": 28302.075, "train_loss_nats_per_token": 1.7198779892521807 }, { "epoch": 0.16117563403650154, "grad_norm": 0.1533203125, "learning_rate": 0.0008613412199115559, "loss": 1.7108814239501953, "step": 97480, "train_bpb": 0.6052774524330268, "train_bytes": 28393.26875, "train_loss_nats_per_token": 1.7120759206975484 }, { "epoch": 0.16130731347607385, "grad_norm": 0.150390625, "learning_rate": 0.0008607769819574652, "loss": 1.7275371551513672, "step": 97500, "train_bpb": 0.6055734211460039, "train_bytes": 28502.91875, "train_loss_nats_per_token": 1.7288584032081205 }, { "epoch": 0.16143899291564615, "grad_norm": 0.18359375, "learning_rate": 0.0008602128544990428, "loss": 1.7254179000854493, "step": 97520, "train_bpb": 0.6109427265713658, "train_bytes": 28243.95, "train_loss_nats_per_token": 1.7263600183602148 }, { "epoch": 0.16157067235521846, "grad_norm": 0.125, "learning_rate": 0.000859648837633804, "loss": 1.7186656951904298, "step": 97540, "train_bpb": 0.6032398198089199, "train_bytes": 28335.7125, "train_loss_nats_per_token": 1.7186419494544023 }, { "epoch": 0.16170235179479076, "grad_norm": 0.150390625, "learning_rate": 0.0008590849314592448, "loss": 1.7144151687622071, "step": 97560, "train_bpb": 0.6058987004429919, "train_bytes": 28112.8125, "train_loss_nats_per_token": 1.7145826460520721 }, { "epoch": 0.16183403123436307, "grad_norm": 0.126953125, "learning_rate": 0.000858521136072841, "loss": 1.7218326568603515, "step": 97580, "train_bpb": 0.6065899456609052, "train_bytes": 28904.35625, "train_loss_nats_per_token": 1.7224192158746152 }, { "epoch": 0.16196571067393536, "grad_norm": 0.1328125, "learning_rate": 0.0008579574515720502, "loss": 1.7106002807617187, "step": 97600, "train_bpb": 0.6073743519243663, "train_bytes": 28128.39375, "train_loss_nats_per_token": 1.7113961859878613 }, { "epoch": 0.16209739011350768, "grad_norm": 0.11083984375, "learning_rate": 0.0008573938780543103, "loss": 1.7176782608032226, "step": 97620, "train_bpb": 0.6081547906346477, "train_bytes": 28235.74375, "train_loss_nats_per_token": 1.7189271110438356 }, { "epoch": 0.16222906955307997, "grad_norm": 0.1640625, "learning_rate": 0.0008568304156170413, "loss": 1.729477882385254, "step": 97640, "train_bpb": 0.6078741829931008, "train_bytes": 28599.9625, "train_loss_nats_per_token": 1.7296724890486916 }, { "epoch": 0.1623607489926523, "grad_norm": 0.1416015625, "learning_rate": 0.0008562670643576413, "loss": 1.719893455505371, "step": 97660, "train_bpb": 0.6082893848251069, "train_bytes": 28359.5625, "train_loss_nats_per_token": 1.7201737555984198 }, { "epoch": 0.16249242843222458, "grad_norm": 0.1513671875, "learning_rate": 0.0008557038243734915, "loss": 1.719468116760254, "step": 97680, "train_bpb": 0.6093339776202332, "train_bytes": 28189.7, "train_loss_nats_per_token": 1.7200679275291082 }, { "epoch": 0.1626241078717969, "grad_norm": 0.140625, "learning_rate": 0.0008551406957619541, "loss": 1.714750099182129, "step": 97700, "train_bpb": 0.6049638027921196, "train_bytes": 28590.125, "train_loss_nats_per_token": 1.7151751891452074 }, { "epoch": 0.1627557873113692, "grad_norm": 0.1318359375, "learning_rate": 0.0008545776786203699, "loss": 1.7083047866821288, "step": 97720, "train_bpb": 0.6039110102574048, "train_bytes": 28165.26875, "train_loss_nats_per_token": 1.7084498988338368 }, { "epoch": 0.1628874667509415, "grad_norm": 0.171875, "learning_rate": 0.000854014773046062, "loss": 1.7159622192382813, "step": 97740, "train_bpb": 0.6024185436535728, "train_bytes": 28903.1, "train_loss_nats_per_token": 1.7161810777329545 }, { "epoch": 0.1630191461905138, "grad_norm": 0.1494140625, "learning_rate": 0.0008534519791363345, "loss": 1.7127613067626952, "step": 97760, "train_bpb": 0.6034982592877165, "train_bytes": 28747.89375, "train_loss_nats_per_token": 1.7131581973689043 }, { "epoch": 0.16315082563008612, "grad_norm": 0.138671875, "learning_rate": 0.0008528892969884706, "loss": 1.7211023330688477, "step": 97780, "train_bpb": 0.6101770802844396, "train_bytes": 28121.49375, "train_loss_nats_per_token": 1.7218016738728692 }, { "epoch": 0.1632825050696584, "grad_norm": 0.150390625, "learning_rate": 0.0008523267266997358, "loss": 1.727752113342285, "step": 97800, "train_bpb": 0.6110869480679767, "train_bytes": 28174.73125, "train_loss_nats_per_token": 1.7278602744560423 }, { "epoch": 0.16341418450923073, "grad_norm": 0.1484375, "learning_rate": 0.0008517642683673753, "loss": 1.7160152435302733, "step": 97820, "train_bpb": 0.6069225719298871, "train_bytes": 28374.80625, "train_loss_nats_per_token": 1.716572075346511 }, { "epoch": 0.16354586394880302, "grad_norm": 0.1337890625, "learning_rate": 0.0008512019220886162, "loss": 1.710062026977539, "step": 97840, "train_bpb": 0.6054451668792462, "train_bytes": 28085.35, "train_loss_nats_per_token": 1.7106442990689996 }, { "epoch": 0.16367754338837534, "grad_norm": 0.13671875, "learning_rate": 0.0008506396879606638, "loss": 1.7125869750976563, "step": 97860, "train_bpb": 0.6054585653727305, "train_bytes": 28281.94375, "train_loss_nats_per_token": 1.7128850211978395 }, { "epoch": 0.16380922282794763, "grad_norm": 0.1416015625, "learning_rate": 0.0008500775660807064, "loss": 1.7142269134521484, "step": 97880, "train_bpb": 0.6058449924057004, "train_bytes": 28290.15625, "train_loss_nats_per_token": 1.715220093818438 }, { "epoch": 0.16394090226751995, "grad_norm": 0.12109375, "learning_rate": 0.0008495155565459125, "loss": 1.7292591094970704, "step": 97900, "train_bpb": 0.6100066882648117, "train_bytes": 28348.34375, "train_loss_nats_per_token": 1.7289958645609826 }, { "epoch": 0.16407258170709224, "grad_norm": 0.1513671875, "learning_rate": 0.0008489536594534297, "loss": 1.7186697006225586, "step": 97920, "train_bpb": 0.605013457976008, "train_bytes": 28521.99375, "train_loss_nats_per_token": 1.7189750303595905 }, { "epoch": 0.16420426114666456, "grad_norm": 0.1318359375, "learning_rate": 0.0008483918749003874, "loss": 1.7016262054443358, "step": 97940, "train_bpb": 0.6016839415011968, "train_bytes": 28179.3125, "train_loss_nats_per_token": 1.7027716031611484 }, { "epoch": 0.16433594058623688, "grad_norm": 0.1240234375, "learning_rate": 0.0008478302029838955, "loss": 1.7287675857543945, "step": 97960, "train_bpb": 0.6090060524180191, "train_bytes": 28627.775, "train_loss_nats_per_token": 1.7296935820304289 }, { "epoch": 0.16446762002580917, "grad_norm": 0.1630859375, "learning_rate": 0.0008472686438010448, "loss": 1.721968650817871, "step": 97980, "train_bpb": 0.6119809389707593, "train_bytes": 28268.7625, "train_loss_nats_per_token": 1.7223805678943196 }, { "epoch": 0.1645992994653815, "grad_norm": 0.1357421875, "learning_rate": 0.0008467071974489049, "loss": 1.712474250793457, "step": 98000, "train_bpb": 0.6052010390536308, "train_bytes": 28070.2875, "train_loss_nats_per_token": 1.7126385936938964 }, { "epoch": 0.1645992994653815, "eval_loss": 1.5297398567199707, "eval_runtime": 74.5553, "eval_samples_per_second": 13.413, "eval_steps_per_second": 13.413, "step": 98000, "train_bpb": 0.5398403867554646, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5372563526274727 }, { "epoch": 0.16473097890495378, "grad_norm": 0.1328125, "learning_rate": 0.0008461458640245277, "loss": 1.7190916061401367, "step": 98020, "train_bpb": 0.6104271158757798, "train_bytes": 28499.1375, "train_loss_nats_per_token": 1.7193516434281033 }, { "epoch": 0.1648626583445261, "grad_norm": 0.1259765625, "learning_rate": 0.0008455846436249453, "loss": 1.7086805343627929, "step": 98040, "train_bpb": 0.6063408966210563, "train_bytes": 28196.35625, "train_loss_nats_per_token": 1.7098122344233149 }, { "epoch": 0.1649943377840984, "grad_norm": 0.1435546875, "learning_rate": 0.0008450235363471688, "loss": 1.729271125793457, "step": 98060, "train_bpb": 0.6090577869327821, "train_bytes": 28476.31875, "train_loss_nats_per_token": 1.730559467912518 }, { "epoch": 0.1651260172236707, "grad_norm": 0.185546875, "learning_rate": 0.0008444625422881915, "loss": 1.7039188385009765, "step": 98080, "train_bpb": 0.5980624507249618, "train_bytes": 28443.44375, "train_loss_nats_per_token": 1.7044266836625392 }, { "epoch": 0.165257696663243, "grad_norm": 0.126953125, "learning_rate": 0.000843901661544987, "loss": 1.7096662521362305, "step": 98100, "train_bpb": 0.6037787196127933, "train_bytes": 28539.2875, "train_loss_nats_per_token": 1.7109514830304329 }, { "epoch": 0.16538937610281532, "grad_norm": 0.12255859375, "learning_rate": 0.0008433408942145076, "loss": 1.7116558074951171, "step": 98120, "train_bpb": 0.6039160551058638, "train_bytes": 28529.54375, "train_loss_nats_per_token": 1.7116145322589837 }, { "epoch": 0.1655210555423876, "grad_norm": 0.134765625, "learning_rate": 0.0008427802403936879, "loss": 1.7148588180541993, "step": 98140, "train_bpb": 0.6046702581802893, "train_bytes": 28461.75625, "train_loss_nats_per_token": 1.7157061322467473 }, { "epoch": 0.16565273498195993, "grad_norm": 0.14453125, "learning_rate": 0.0008422197001794419, "loss": 1.7082500457763672, "step": 98160, "train_bpb": 0.6081443888780335, "train_bytes": 28111.48125, "train_loss_nats_per_token": 1.708606415646093 }, { "epoch": 0.16578441442153222, "grad_norm": 0.1748046875, "learning_rate": 0.0008416592736686649, "loss": 1.7296689987182616, "step": 98180, "train_bpb": 0.6121502645207342, "train_bytes": 28290.55, "train_loss_nats_per_token": 1.7301523148110614 }, { "epoch": 0.16591609386110454, "grad_norm": 0.1796875, "learning_rate": 0.0008410989609582307, "loss": 1.7085638046264648, "step": 98200, "train_bpb": 0.6009996012724732, "train_bytes": 28638.25625, "train_loss_nats_per_token": 1.7082587135792815 }, { "epoch": 0.16604777330067683, "grad_norm": 0.181640625, "learning_rate": 0.0008405387621449952, "loss": 1.7172508239746094, "step": 98220, "train_bpb": 0.6064729146303544, "train_bytes": 28325.45, "train_loss_nats_per_token": 1.717170468368065 }, { "epoch": 0.16617945274024915, "grad_norm": 0.134765625, "learning_rate": 0.0008399786773257946, "loss": 1.7191389083862305, "step": 98240, "train_bpb": 0.6062303989861966, "train_bytes": 28793.3375, "train_loss_nats_per_token": 1.719450250156713 }, { "epoch": 0.16631113217982144, "grad_norm": 0.1396484375, "learning_rate": 0.0008394187065974436, "loss": 1.7204935073852539, "step": 98260, "train_bpb": 0.6088064192412769, "train_bytes": 28030.24375, "train_loss_nats_per_token": 1.7211064255090154 }, { "epoch": 0.16644281161939375, "grad_norm": 0.13671875, "learning_rate": 0.0008388588500567387, "loss": 1.7084901809692383, "step": 98280, "train_bpb": 0.6084975950430904, "train_bytes": 27850.30625, "train_loss_nats_per_token": 1.7093024185269714 }, { "epoch": 0.16657449105896605, "grad_norm": 0.1513671875, "learning_rate": 0.0008382991078004574, "loss": 1.7106107711791991, "step": 98300, "train_bpb": 0.6019544676799934, "train_bytes": 28701.59375, "train_loss_nats_per_token": 1.711144393432094 }, { "epoch": 0.16670617049853836, "grad_norm": 0.177734375, "learning_rate": 0.0008377394799253549, "loss": 1.713780975341797, "step": 98320, "train_bpb": 0.6035670569783621, "train_bytes": 28649.4875, "train_loss_nats_per_token": 1.714452424117823 }, { "epoch": 0.16683784993811066, "grad_norm": 0.134765625, "learning_rate": 0.0008371799665281687, "loss": 1.7124006271362304, "step": 98340, "train_bpb": 0.6043942447667431, "train_bytes": 28311.2875, "train_loss_nats_per_token": 1.7131267875016363 }, { "epoch": 0.16696952937768297, "grad_norm": 0.1494140625, "learning_rate": 0.000836620567705616, "loss": 1.7109600067138673, "step": 98360, "train_bpb": 0.6034976574511436, "train_bytes": 28286.49375, "train_loss_nats_per_token": 1.7111789977088023 }, { "epoch": 0.16710120881725526, "grad_norm": 0.1181640625, "learning_rate": 0.0008360612835543945, "loss": 1.7092672348022462, "step": 98380, "train_bpb": 0.604774791477713, "train_bytes": 28070.475, "train_loss_nats_per_token": 1.709566531610457 }, { "epoch": 0.16723288825682758, "grad_norm": 0.150390625, "learning_rate": 0.0008355021141711809, "loss": 1.7256145477294922, "step": 98400, "train_bpb": 0.6093451163859357, "train_bytes": 28110.5375, "train_loss_nats_per_token": 1.7259032978432784 }, { "epoch": 0.16736456769639987, "grad_norm": 0.1552734375, "learning_rate": 0.0008349430596526332, "loss": 1.6995357513427733, "step": 98420, "train_bpb": 0.6034598918984085, "train_bytes": 28041.26875, "train_loss_nats_per_token": 1.7000010574771023 }, { "epoch": 0.1674962471359722, "grad_norm": 0.193359375, "learning_rate": 0.0008343841200953897, "loss": 1.7269229888916016, "step": 98440, "train_bpb": 0.6127785937802478, "train_bytes": 28048.58125, "train_loss_nats_per_token": 1.7277718169668634 }, { "epoch": 0.16762792657554448, "grad_norm": 0.1396484375, "learning_rate": 0.0008338252955960672, "loss": 1.712315559387207, "step": 98460, "train_bpb": 0.6079628024282007, "train_bytes": 28285.675, "train_loss_nats_per_token": 1.712605903668746 }, { "epoch": 0.1677596060151168, "grad_norm": 0.173828125, "learning_rate": 0.0008332665862512643, "loss": 1.7140884399414062, "step": 98480, "train_bpb": 0.6072736135331545, "train_bytes": 28154.2125, "train_loss_nats_per_token": 1.71452736784942 }, { "epoch": 0.1678912854546891, "grad_norm": 0.12451171875, "learning_rate": 0.0008327079921575594, "loss": 1.6971839904785155, "step": 98500, "train_bpb": 0.6014676693873197, "train_bytes": 27996.78125, "train_loss_nats_per_token": 1.6973017705106908 }, { "epoch": 0.1680229648942614, "grad_norm": 0.1328125, "learning_rate": 0.0008321495134115108, "loss": 1.720326042175293, "step": 98520, "train_bpb": 0.6064183704207896, "train_bytes": 28440.2, "train_loss_nats_per_token": 1.720628272409161 }, { "epoch": 0.1681546443338337, "grad_norm": 0.142578125, "learning_rate": 0.0008315911501096562, "loss": 1.7241512298583985, "step": 98540, "train_bpb": 0.611213144455298, "train_bytes": 28206.94375, "train_loss_nats_per_token": 1.7256348928056753 }, { "epoch": 0.16828632377340602, "grad_norm": 0.11669921875, "learning_rate": 0.0008310329023485139, "loss": 1.7302265167236328, "step": 98560, "train_bpb": 0.6118881640924947, "train_bytes": 28624.1625, "train_loss_nats_per_token": 1.7306066602594214 }, { "epoch": 0.1684180032129783, "grad_norm": 0.1259765625, "learning_rate": 0.0008304747702245833, "loss": 1.7084726333618163, "step": 98580, "train_bpb": 0.604419066020422, "train_bytes": 28400.1875, "train_loss_nats_per_token": 1.7084899154929776 }, { "epoch": 0.16854968265255063, "grad_norm": 0.1396484375, "learning_rate": 0.0008299167538343414, "loss": 1.7023855209350587, "step": 98600, "train_bpb": 0.6053132862010078, "train_bytes": 27824.5375, "train_loss_nats_per_token": 1.703512656033544 }, { "epoch": 0.16868136209212295, "grad_norm": 0.130859375, "learning_rate": 0.000829358853274247, "loss": 1.7268369674682618, "step": 98620, "train_bpb": 0.6137233236895598, "train_bytes": 28086.26875, "train_loss_nats_per_token": 1.7275244413271749 }, { "epoch": 0.16881304153169524, "grad_norm": 0.1796875, "learning_rate": 0.0008288010686407392, "loss": 1.7012250900268555, "step": 98640, "train_bpb": 0.603841259495656, "train_bytes": 28009.90625, "train_loss_nats_per_token": 1.7016484099588054 }, { "epoch": 0.16894472097126756, "grad_norm": 0.126953125, "learning_rate": 0.0008282434000302351, "loss": 1.7132694244384765, "step": 98660, "train_bpb": 0.6022827731910395, "train_bytes": 28388.0625, "train_loss_nats_per_token": 1.7138569645428656 }, { "epoch": 0.16907640041083985, "grad_norm": 0.12890625, "learning_rate": 0.0008276858475391333, "loss": 1.715043830871582, "step": 98680, "train_bpb": 0.6058273285037009, "train_bytes": 28544.06875, "train_loss_nats_per_token": 1.7161639091177037 }, { "epoch": 0.16920807985041217, "grad_norm": 0.15234375, "learning_rate": 0.0008271284112638121, "loss": 1.7066448211669922, "step": 98700, "train_bpb": 0.6088710556534132, "train_bytes": 28045.34375, "train_loss_nats_per_token": 1.7066987603481278 }, { "epoch": 0.16933975928998446, "grad_norm": 0.1796875, "learning_rate": 0.0008265710913006303, "loss": 1.7165369033813476, "step": 98720, "train_bpb": 0.6065299813050671, "train_bytes": 28157.50625, "train_loss_nats_per_token": 1.7175793453212211 }, { "epoch": 0.16947143872955678, "grad_norm": 0.12890625, "learning_rate": 0.0008260138877459242, "loss": 1.7040063858032226, "step": 98740, "train_bpb": 0.6014568133039462, "train_bytes": 28331.65625, "train_loss_nats_per_token": 1.7043533189302982 }, { "epoch": 0.16960311816912907, "grad_norm": 0.12890625, "learning_rate": 0.0008254568006960129, "loss": 1.705516242980957, "step": 98760, "train_bpb": 0.6075804376057444, "train_bytes": 28441.8375, "train_loss_nats_per_token": 1.7060303830370838 }, { "epoch": 0.1697347976087014, "grad_norm": 0.1494140625, "learning_rate": 0.0008248998302471943, "loss": 1.7089920043945312, "step": 98780, "train_bpb": 0.6092485795245847, "train_bytes": 27916.95625, "train_loss_nats_per_token": 1.7095606063161493 }, { "epoch": 0.16986647704827368, "grad_norm": 0.18359375, "learning_rate": 0.0008243429764957447, "loss": 1.703347396850586, "step": 98800, "train_bpb": 0.6040586417847622, "train_bytes": 28189.59375, "train_loss_nats_per_token": 1.7042558746725247 }, { "epoch": 0.169998156487846, "grad_norm": 0.1396484375, "learning_rate": 0.0008237862395379222, "loss": 1.7211017608642578, "step": 98820, "train_bpb": 0.6076486490437619, "train_bytes": 28254.4, "train_loss_nats_per_token": 1.7213938781106368 }, { "epoch": 0.1701298359274183, "grad_norm": 0.1669921875, "learning_rate": 0.0008232296194699647, "loss": 1.7207374572753906, "step": 98840, "train_bpb": 0.6107331764057847, "train_bytes": 28127.63125, "train_loss_nats_per_token": 1.7205898914532773 }, { "epoch": 0.1702615153669906, "grad_norm": 0.158203125, "learning_rate": 0.0008226731163880878, "loss": 1.7189855575561523, "step": 98860, "train_bpb": 0.6041564987680224, "train_bytes": 28546.78125, "train_loss_nats_per_token": 1.7195533664777962 }, { "epoch": 0.1703931948065629, "grad_norm": 0.138671875, "learning_rate": 0.0008221167303884889, "loss": 1.7200967788696289, "step": 98880, "train_bpb": 0.6057926668848268, "train_bytes": 28439.3625, "train_loss_nats_per_token": 1.7205048012202193 }, { "epoch": 0.17052487424613522, "grad_norm": 0.14453125, "learning_rate": 0.0008215604615673444, "loss": 1.7122968673706054, "step": 98900, "train_bpb": 0.6078475476100818, "train_bytes": 28235.575, "train_loss_nats_per_token": 1.7130680347228098 }, { "epoch": 0.1706565536857075, "grad_norm": 0.11376953125, "learning_rate": 0.0008210043100208114, "loss": 1.7143131256103517, "step": 98920, "train_bpb": 0.6067811330986341, "train_bytes": 28102.7875, "train_loss_nats_per_token": 1.7150462601366303 }, { "epoch": 0.17078823312527983, "grad_norm": 0.12353515625, "learning_rate": 0.0008204482758450244, "loss": 1.7140438079833984, "step": 98940, "train_bpb": 0.6030771184109527, "train_bytes": 28810.89375, "train_loss_nats_per_token": 1.7142933704776697 }, { "epoch": 0.17091991256485212, "grad_norm": 0.1513671875, "learning_rate": 0.0008198923591361, "loss": 1.7017852783203125, "step": 98960, "train_bpb": 0.6011919959965029, "train_bytes": 28232.4625, "train_loss_nats_per_token": 1.7034207279882794 }, { "epoch": 0.17105159200442444, "grad_norm": 0.12890625, "learning_rate": 0.0008193365599901342, "loss": 1.7145067214965821, "step": 98980, "train_bpb": 0.606152321462534, "train_bytes": 28244.34375, "train_loss_nats_per_token": 1.7137983113444877 }, { "epoch": 0.17118327144399673, "grad_norm": 0.126953125, "learning_rate": 0.0008187808785032005, "loss": 1.7050457000732422, "step": 99000, "train_bpb": 0.6023341794205778, "train_bytes": 28331.71875, "train_loss_nats_per_token": 1.7056127088392297 }, { "epoch": 0.17118327144399673, "eval_loss": 1.530900478363037, "eval_runtime": 75.4804, "eval_samples_per_second": 13.248, "eval_steps_per_second": 13.248, "step": 99000, "train_bpb": 0.5402451347589203, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5384089181909038 }, { "epoch": 0.17131495088356904, "grad_norm": 0.146484375, "learning_rate": 0.0008182253147713546, "loss": 1.7091960906982422, "step": 99020, "train_bpb": 0.6057592577314406, "train_bytes": 28354.41875, "train_loss_nats_per_token": 1.7088792187802775 }, { "epoch": 0.17144663032314134, "grad_norm": 0.1337890625, "learning_rate": 0.0008176698688906307, "loss": 1.7110626220703125, "step": 99040, "train_bpb": 0.6044245212759899, "train_bytes": 28589.55625, "train_loss_nats_per_token": 1.7108065955226808 }, { "epoch": 0.17157830976271365, "grad_norm": 0.1669921875, "learning_rate": 0.0008171145409570435, "loss": 1.701681137084961, "step": 99060, "train_bpb": 0.6014767325381046, "train_bytes": 28239.3625, "train_loss_nats_per_token": 1.7020318046549936 }, { "epoch": 0.17170998920228595, "grad_norm": 0.1572265625, "learning_rate": 0.0008165593310665854, "loss": 1.7253955841064452, "step": 99080, "train_bpb": 0.6095285829526143, "train_bytes": 28208.4875, "train_loss_nats_per_token": 1.7261561384299353 }, { "epoch": 0.17184166864185826, "grad_norm": 0.13671875, "learning_rate": 0.0008160042393152301, "loss": 1.715919303894043, "step": 99100, "train_bpb": 0.6063656594684945, "train_bytes": 28473.68125, "train_loss_nats_per_token": 1.7165590893220612 }, { "epoch": 0.17197334808143055, "grad_norm": 0.17578125, "learning_rate": 0.0008154492657989311, "loss": 1.7088752746582032, "step": 99120, "train_bpb": 0.6053602814436779, "train_bytes": 28028.6375, "train_loss_nats_per_token": 1.7100126627106906 }, { "epoch": 0.17210502752100287, "grad_norm": 0.1357421875, "learning_rate": 0.0008148944106136196, "loss": 1.7083175659179688, "step": 99140, "train_bpb": 0.6057815799842475, "train_bytes": 28451.3875, "train_loss_nats_per_token": 1.7084780159511843 }, { "epoch": 0.17223670696057516, "grad_norm": 0.1904296875, "learning_rate": 0.000814339673855208, "loss": 1.7116609573364259, "step": 99160, "train_bpb": 0.6052672812300031, "train_bytes": 28483.33125, "train_loss_nats_per_token": 1.7135081211833276 }, { "epoch": 0.17236838640014748, "grad_norm": 0.14453125, "learning_rate": 0.0008137850556195885, "loss": 1.7148239135742187, "step": 99180, "train_bpb": 0.6044595967613621, "train_bytes": 28304.44375, "train_loss_nats_per_token": 1.7149879229074305 }, { "epoch": 0.17250006583971977, "grad_norm": 0.13671875, "learning_rate": 0.0008132305560026305, "loss": 1.7144504547119142, "step": 99200, "train_bpb": 0.6034975197712241, "train_bytes": 28230.65625, "train_loss_nats_per_token": 1.715142622119932 }, { "epoch": 0.1726317452792921, "grad_norm": 0.1572265625, "learning_rate": 0.0008126761751001855, "loss": 1.7072307586669921, "step": 99220, "train_bpb": 0.6079550013784721, "train_bytes": 27998.48125, "train_loss_nats_per_token": 1.7087491107654298 }, { "epoch": 0.17276342471886438, "grad_norm": 0.142578125, "learning_rate": 0.0008121219130080829, "loss": 1.7078535079956054, "step": 99240, "train_bpb": 0.6089162570926345, "train_bytes": 28098.04375, "train_loss_nats_per_token": 1.7089038800139977 }, { "epoch": 0.1728951041584367, "grad_norm": 0.1484375, "learning_rate": 0.0008115677698221334, "loss": 1.7227144241333008, "step": 99260, "train_bpb": 0.6073538015374224, "train_bytes": 28174.575, "train_loss_nats_per_token": 1.7230689397627048 }, { "epoch": 0.17302678359800902, "grad_norm": 0.1884765625, "learning_rate": 0.0008110137456381237, "loss": 1.7179483413696288, "step": 99280, "train_bpb": 0.6084423846582191, "train_bytes": 28295.1, "train_loss_nats_per_token": 1.7184877545053507 }, { "epoch": 0.1731584630375813, "grad_norm": 0.1396484375, "learning_rate": 0.0008104598405518233, "loss": 1.7095626831054687, "step": 99300, "train_bpb": 0.6044836680194127, "train_bytes": 28443.03125, "train_loss_nats_per_token": 1.7099641874158718 }, { "epoch": 0.17329014247715363, "grad_norm": 0.1806640625, "learning_rate": 0.0008099060546589802, "loss": 1.7113285064697266, "step": 99320, "train_bpb": 0.6035274829464526, "train_bytes": 28616.7875, "train_loss_nats_per_token": 1.712078707344503 }, { "epoch": 0.17342182191672592, "grad_norm": 0.11376953125, "learning_rate": 0.0008093523880553207, "loss": 1.7171113967895508, "step": 99340, "train_bpb": 0.6043304217629453, "train_bytes": 28411.20625, "train_loss_nats_per_token": 1.7167828828516625 }, { "epoch": 0.17355350135629824, "grad_norm": 0.1533203125, "learning_rate": 0.0008087988408365511, "loss": 1.7121242523193358, "step": 99360, "train_bpb": 0.6054240963351649, "train_bytes": 28220.5625, "train_loss_nats_per_token": 1.7126540100281031 }, { "epoch": 0.17368518079587053, "grad_norm": 0.1279296875, "learning_rate": 0.0008082454130983584, "loss": 1.7110103607177733, "step": 99380, "train_bpb": 0.6036020518098235, "train_bytes": 28284.33125, "train_loss_nats_per_token": 1.7113952048626426 }, { "epoch": 0.17381686023544285, "grad_norm": 0.1552734375, "learning_rate": 0.0008076921049364064, "loss": 1.7133922576904297, "step": 99400, "train_bpb": 0.6047075308923741, "train_bytes": 28072.025, "train_loss_nats_per_token": 1.7142744617974457 }, { "epoch": 0.17394853967501514, "grad_norm": 0.130859375, "learning_rate": 0.0008071389164463401, "loss": 1.7145389556884765, "step": 99420, "train_bpb": 0.6044095239768192, "train_bytes": 28584.875, "train_loss_nats_per_token": 1.715571643506368 }, { "epoch": 0.17408021911458746, "grad_norm": 0.130859375, "learning_rate": 0.0008065858477237834, "loss": 1.7208654403686523, "step": 99440, "train_bpb": 0.6056168393202078, "train_bytes": 28627.01875, "train_loss_nats_per_token": 1.7218227316069044 }, { "epoch": 0.17421189855415975, "grad_norm": 0.130859375, "learning_rate": 0.0008060328988643398, "loss": 1.7255056381225586, "step": 99460, "train_bpb": 0.6104983007859154, "train_bytes": 28183.60625, "train_loss_nats_per_token": 1.7255060983044688 }, { "epoch": 0.17434357799373207, "grad_norm": 0.1416015625, "learning_rate": 0.0008054800699635907, "loss": 1.7176660537719726, "step": 99480, "train_bpb": 0.6057379174273597, "train_bytes": 28487.2875, "train_loss_nats_per_token": 1.7193268071791916 }, { "epoch": 0.17447525743330436, "grad_norm": 0.1318359375, "learning_rate": 0.0008049273611170983, "loss": 1.7256902694702148, "step": 99500, "train_bpb": 0.6079764889756745, "train_bytes": 28508.34375, "train_loss_nats_per_token": 1.7268414937940475 }, { "epoch": 0.17460693687287668, "grad_norm": 0.1591796875, "learning_rate": 0.0008043747724204041, "loss": 1.7310585021972655, "step": 99520, "train_bpb": 0.6099261337118278, "train_bytes": 28358.91875, "train_loss_nats_per_token": 1.7313354320536487 }, { "epoch": 0.17473861631244897, "grad_norm": 0.134765625, "learning_rate": 0.0008038223039690268, "loss": 1.7150506973266602, "step": 99540, "train_bpb": 0.6073338987465435, "train_bytes": 28104.8375, "train_loss_nats_per_token": 1.7153307065557193 }, { "epoch": 0.1748702957520213, "grad_norm": 0.119140625, "learning_rate": 0.0008032699558584665, "loss": 1.7215845108032226, "step": 99560, "train_bpb": 0.6089029973440017, "train_bytes": 28332.9, "train_loss_nats_per_token": 1.7222210705935017 }, { "epoch": 0.17500197519159358, "grad_norm": 0.1474609375, "learning_rate": 0.0008027177281842018, "loss": 1.7115571975708008, "step": 99580, "train_bpb": 0.6043789884582225, "train_bytes": 28320.9125, "train_loss_nats_per_token": 1.7118949122471212 }, { "epoch": 0.1751336546311659, "grad_norm": 0.1494140625, "learning_rate": 0.0008021656210416908, "loss": 1.7133068084716796, "step": 99600, "train_bpb": 0.6057264148683396, "train_bytes": 28391.09375, "train_loss_nats_per_token": 1.7133654287959923 }, { "epoch": 0.1752653340707382, "grad_norm": 0.2177734375, "learning_rate": 0.0008016136345263696, "loss": 1.7150516510009766, "step": 99620, "train_bpb": 0.6086218439053479, "train_bytes": 28013.06875, "train_loss_nats_per_token": 1.7151256672514643 }, { "epoch": 0.1753970135103105, "grad_norm": 0.1259765625, "learning_rate": 0.0008010617687336544, "loss": 1.7149160385131836, "step": 99640, "train_bpb": 0.6047765429605888, "train_bytes": 28347.9375, "train_loss_nats_per_token": 1.715084046404025 }, { "epoch": 0.1755286929498828, "grad_norm": 0.13671875, "learning_rate": 0.000800510023758941, "loss": 1.7164749145507812, "step": 99660, "train_bpb": 0.6088968079244084, "train_bytes": 28263.03125, "train_loss_nats_per_token": 1.7168223272377927 }, { "epoch": 0.17566037238945512, "grad_norm": 0.1494140625, "learning_rate": 0.0007999583996976025, "loss": 1.7179901123046875, "step": 99680, "train_bpb": 0.6058905089790146, "train_bytes": 28426.04375, "train_loss_nats_per_token": 1.717828237494739 }, { "epoch": 0.1757920518290274, "grad_norm": 0.1337890625, "learning_rate": 0.000799406896644993, "loss": 1.7204532623291016, "step": 99700, "train_bpb": 0.6050513480757647, "train_bytes": 28666.13125, "train_loss_nats_per_token": 1.7213074662352394 }, { "epoch": 0.17592373126859973, "grad_norm": 0.12451171875, "learning_rate": 0.0007988555146964454, "loss": 1.7150892257690429, "step": 99720, "train_bpb": 0.6094905325916885, "train_bytes": 28097.325, "train_loss_nats_per_token": 1.7162464525218954 }, { "epoch": 0.17605541070817202, "grad_norm": 0.12060546875, "learning_rate": 0.0007983042539472704, "loss": 1.7249879837036133, "step": 99740, "train_bpb": 0.6064728862925047, "train_bytes": 28770.63125, "train_loss_nats_per_token": 1.7257712905348732 }, { "epoch": 0.17618709014774434, "grad_norm": 0.1455078125, "learning_rate": 0.0007977531144927586, "loss": 1.708460807800293, "step": 99760, "train_bpb": 0.604793767403788, "train_bytes": 28356.725, "train_loss_nats_per_token": 1.7087761509619652 }, { "epoch": 0.17631876958731663, "grad_norm": 0.1357421875, "learning_rate": 0.00079720209642818, "loss": 1.7178485870361329, "step": 99780, "train_bpb": 0.6075798956016781, "train_bytes": 28326.26875, "train_loss_nats_per_token": 1.7182869522359443 }, { "epoch": 0.17645044902688894, "grad_norm": 0.134765625, "learning_rate": 0.0007966511998487837, "loss": 1.707650375366211, "step": 99800, "train_bpb": 0.6039461621522236, "train_bytes": 28442.3875, "train_loss_nats_per_token": 1.7081767785422843 }, { "epoch": 0.17658212846646124, "grad_norm": 0.1630859375, "learning_rate": 0.0007961004248497961, "loss": 1.7125701904296875, "step": 99820, "train_bpb": 0.6028096167930157, "train_bytes": 28808.8375, "train_loss_nats_per_token": 1.7142860781182827 }, { "epoch": 0.17671380790603355, "grad_norm": 0.134765625, "learning_rate": 0.0007955497715264244, "loss": 1.7273519515991211, "step": 99840, "train_bpb": 0.6117953790529017, "train_bytes": 28551.53125, "train_loss_nats_per_token": 1.728363533898167 }, { "epoch": 0.17684548734560585, "grad_norm": 0.12890625, "learning_rate": 0.0007949992399738547, "loss": 1.713421630859375, "step": 99860, "train_bpb": 0.6049298910466941, "train_bytes": 28268.59375, "train_loss_nats_per_token": 1.7142723394966803 }, { "epoch": 0.17697716678517816, "grad_norm": 0.12158203125, "learning_rate": 0.0007944488302872506, "loss": 1.7085237503051758, "step": 99880, "train_bpb": 0.6022646480293598, "train_bytes": 28393.6, "train_loss_nats_per_token": 1.7085663994650657 }, { "epoch": 0.17710884622475045, "grad_norm": 0.197265625, "learning_rate": 0.0007938985425617557, "loss": 1.711512565612793, "step": 99900, "train_bpb": 0.6045365318417923, "train_bytes": 28198.03125, "train_loss_nats_per_token": 1.7118646665438977 }, { "epoch": 0.17724052566432277, "grad_norm": 0.26953125, "learning_rate": 0.000793348376892493, "loss": 1.702057456970215, "step": 99920, "train_bpb": 0.6059675497360395, "train_bytes": 27836.68125, "train_loss_nats_per_token": 1.7033098463389584 }, { "epoch": 0.17737220510389506, "grad_norm": 0.1357421875, "learning_rate": 0.0007927983333745638, "loss": 1.7062755584716798, "step": 99940, "train_bpb": 0.6049542504042826, "train_bytes": 28091.54375, "train_loss_nats_per_token": 1.7070497813647456 }, { "epoch": 0.17750388454346738, "grad_norm": 0.13671875, "learning_rate": 0.0007922484121030473, "loss": 1.708414649963379, "step": 99960, "train_bpb": 0.603045859818299, "train_bytes": 28237.4625, "train_loss_nats_per_token": 1.7095268161159607 }, { "epoch": 0.1776355639830397, "grad_norm": 0.1474609375, "learning_rate": 0.0007916986131730032, "loss": 1.7200492858886718, "step": 99980, "train_bpb": 0.6085166724102589, "train_bytes": 28435.0375, "train_loss_nats_per_token": 1.7211559958523552 }, { "epoch": 0.177767243422612, "grad_norm": 0.1552734375, "learning_rate": 0.0007911489366794695, "loss": 1.7172561645507813, "step": 100000, "train_bpb": 0.60895531518613, "train_bytes": 28061.09375, "train_loss_nats_per_token": 1.7185428553433704 }, { "epoch": 0.177767243422612, "eval_loss": 1.5313209295272827, "eval_runtime": 75.2915, "eval_samples_per_second": 13.282, "eval_steps_per_second": 13.282, "step": 100000, "train_bpb": 0.540398401627917, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5388453628767704 }, { "epoch": 0.1778989228621843, "grad_norm": 0.12060546875, "learning_rate": 0.0007905993827174624, "loss": 1.7167840957641602, "step": 100020, "train_bpb": 0.6087509776466988, "train_bytes": 28538.15625, "train_loss_nats_per_token": 1.7178706152883163 }, { "epoch": 0.1780306023017566, "grad_norm": 0.1259765625, "learning_rate": 0.0007900499513819777, "loss": 1.7204923629760742, "step": 100040, "train_bpb": 0.6076193010405541, "train_bytes": 28356.125, "train_loss_nats_per_token": 1.7207347432113693 }, { "epoch": 0.17816228174132892, "grad_norm": 0.13671875, "learning_rate": 0.0007895006427679905, "loss": 1.7271757125854492, "step": 100060, "train_bpb": 0.6134097617666999, "train_bytes": 28193.54375, "train_loss_nats_per_token": 1.7282079014240461 }, { "epoch": 0.1782939611809012, "grad_norm": 0.12353515625, "learning_rate": 0.0007889514569704523, "loss": 1.7135433197021483, "step": 100080, "train_bpb": 0.6067895321651354, "train_bytes": 28406.60625, "train_loss_nats_per_token": 1.7138385167808292 }, { "epoch": 0.17842564062047353, "grad_norm": 0.1357421875, "learning_rate": 0.0007884023940842961, "loss": 1.7119754791259765, "step": 100100, "train_bpb": 0.6009350016588786, "train_bytes": 28632.43125, "train_loss_nats_per_token": 1.7129320371794252 }, { "epoch": 0.17855732006004582, "grad_norm": 0.1357421875, "learning_rate": 0.0007878534542044323, "loss": 1.717801856994629, "step": 100120, "train_bpb": 0.6048367710659845, "train_bytes": 28445.3625, "train_loss_nats_per_token": 1.718033262398536 }, { "epoch": 0.17868899949961814, "grad_norm": 0.30078125, "learning_rate": 0.000787304637425751, "loss": 1.7179838180541993, "step": 100140, "train_bpb": 0.6059939383748452, "train_bytes": 28187.8875, "train_loss_nats_per_token": 1.7181996522258747 }, { "epoch": 0.17882067893919043, "grad_norm": 0.1279296875, "learning_rate": 0.0007867559438431189, "loss": 1.724494743347168, "step": 100160, "train_bpb": 0.608252595621462, "train_bytes": 28581.2375, "train_loss_nats_per_token": 1.7253734896598656 }, { "epoch": 0.17895235837876275, "grad_norm": 0.1220703125, "learning_rate": 0.0007862073735513835, "loss": 1.7229093551635741, "step": 100180, "train_bpb": 0.6088777568697064, "train_bytes": 28148.71875, "train_loss_nats_per_token": 1.7234177679157536 }, { "epoch": 0.17908403781833504, "grad_norm": 0.1513671875, "learning_rate": 0.000785658926645371, "loss": 1.7163408279418946, "step": 100200, "train_bpb": 0.6050391539410881, "train_bytes": 28617.71875, "train_loss_nats_per_token": 1.7173085452271082 }, { "epoch": 0.17921571725790736, "grad_norm": 0.1259765625, "learning_rate": 0.0007851106032198843, "loss": 1.718695831298828, "step": 100220, "train_bpb": 0.6087430105232009, "train_bytes": 28359.5375, "train_loss_nats_per_token": 1.7191858757712688 }, { "epoch": 0.17934739669747965, "grad_norm": 0.1474609375, "learning_rate": 0.0007845624033697068, "loss": 1.702712059020996, "step": 100240, "train_bpb": 0.6041480538244751, "train_bytes": 28200.36875, "train_loss_nats_per_token": 1.7038511294115493 }, { "epoch": 0.17947907613705197, "grad_norm": 0.1484375, "learning_rate": 0.0007840143271896006, "loss": 1.71789608001709, "step": 100260, "train_bpb": 0.6087132299269226, "train_bytes": 28388.7625, "train_loss_nats_per_token": 1.7184892620779058 }, { "epoch": 0.17961075557662426, "grad_norm": 0.146484375, "learning_rate": 0.0007834663747743045, "loss": 1.7133708953857423, "step": 100280, "train_bpb": 0.6047421858381642, "train_bytes": 28527.3125, "train_loss_nats_per_token": 1.7146405335893726 }, { "epoch": 0.17974243501619658, "grad_norm": 0.1396484375, "learning_rate": 0.000782918546218538, "loss": 1.701887321472168, "step": 100300, "train_bpb": 0.604405530369458, "train_bytes": 27955.3875, "train_loss_nats_per_token": 1.7010606533848491 }, { "epoch": 0.17987411445576887, "grad_norm": 0.1669921875, "learning_rate": 0.0007823708416169983, "loss": 1.701384925842285, "step": 100320, "train_bpb": 0.6000763057623231, "train_bytes": 28339.625, "train_loss_nats_per_token": 1.7026163864443613 }, { "epoch": 0.1800057938953412, "grad_norm": 0.123046875, "learning_rate": 0.0007818232610643618, "loss": 1.708353042602539, "step": 100340, "train_bpb": 0.6036893684604004, "train_bytes": 28280.74375, "train_loss_nats_per_token": 1.709009715636542 }, { "epoch": 0.18013747333491348, "grad_norm": 0.1259765625, "learning_rate": 0.0007812758046552816, "loss": 1.707010269165039, "step": 100360, "train_bpb": 0.6072503466349823, "train_bytes": 28058.15, "train_loss_nats_per_token": 1.7075913124246562 }, { "epoch": 0.1802691527744858, "grad_norm": 0.1455078125, "learning_rate": 0.0007807284724843915, "loss": 1.7193119049072265, "step": 100380, "train_bpb": 0.6053270411526699, "train_bytes": 28496.50625, "train_loss_nats_per_token": 1.7198615445028678 }, { "epoch": 0.1804008322140581, "grad_norm": 0.12060546875, "learning_rate": 0.0007801812646463034, "loss": 1.715644645690918, "step": 100400, "train_bpb": 0.6077208034391661, "train_bytes": 28307.5125, "train_loss_nats_per_token": 1.7164410557100531 }, { "epoch": 0.1805325116536304, "grad_norm": 0.16796875, "learning_rate": 0.0007796341812356062, "loss": 1.721978759765625, "step": 100420, "train_bpb": 0.6085072393112133, "train_bytes": 28341.8, "train_loss_nats_per_token": 1.7233036741884498 }, { "epoch": 0.1806641910932027, "grad_norm": 0.12890625, "learning_rate": 0.0007790872223468689, "loss": 1.7172998428344726, "step": 100440, "train_bpb": 0.6048863629085223, "train_bytes": 28359.24375, "train_loss_nats_per_token": 1.7169252554003829 }, { "epoch": 0.18079587053277502, "grad_norm": 0.1728515625, "learning_rate": 0.0007785403880746384, "loss": 1.7093582153320312, "step": 100460, "train_bpb": 0.6068713381440044, "train_bytes": 28050.05, "train_loss_nats_per_token": 1.7097812631886633 }, { "epoch": 0.1809275499723473, "grad_norm": 0.1669921875, "learning_rate": 0.0007779936785134407, "loss": 1.7161571502685546, "step": 100480, "train_bpb": 0.6071857432589549, "train_bytes": 28414.74375, "train_loss_nats_per_token": 1.7167740710615094 }, { "epoch": 0.18105922941191963, "grad_norm": 0.1552734375, "learning_rate": 0.0007774470937577788, "loss": 1.7126033782958985, "step": 100500, "train_bpb": 0.6069997329000859, "train_bytes": 28247.74375, "train_loss_nats_per_token": 1.7132770465920957 }, { "epoch": 0.18119090885149192, "grad_norm": 0.1298828125, "learning_rate": 0.0007769006339021352, "loss": 1.7201522827148437, "step": 100520, "train_bpb": 0.6049429640319315, "train_bytes": 28647.775, "train_loss_nats_per_token": 1.72073628393931 }, { "epoch": 0.18132258829106424, "grad_norm": 0.1435546875, "learning_rate": 0.0007763542990409713, "loss": 1.7055246353149414, "step": 100540, "train_bpb": 0.6026149577503892, "train_bytes": 28239.6, "train_loss_nats_per_token": 1.7058064886953692 }, { "epoch": 0.18145426773063653, "grad_norm": 0.1630859375, "learning_rate": 0.000775808089268725, "loss": 1.7298852920532226, "step": 100560, "train_bpb": 0.609495375818016, "train_bytes": 28056.28125, "train_loss_nats_per_token": 1.7309433021446947 }, { "epoch": 0.18158594717020884, "grad_norm": 0.1650390625, "learning_rate": 0.0007752620046798142, "loss": 1.7199722290039063, "step": 100580, "train_bpb": 0.6061471926489606, "train_bytes": 28416.73125, "train_loss_nats_per_token": 1.7202517356929 }, { "epoch": 0.18171762660978114, "grad_norm": 0.1689453125, "learning_rate": 0.0007747160453686357, "loss": 1.7168107986450196, "step": 100600, "train_bpb": 0.6061097935845976, "train_bytes": 28209.14375, "train_loss_nats_per_token": 1.7172961619734572 }, { "epoch": 0.18184930604935345, "grad_norm": 0.1435546875, "learning_rate": 0.0007741702114295621, "loss": 1.6997573852539063, "step": 100620, "train_bpb": 0.6003078016813199, "train_bytes": 28197.59375, "train_loss_nats_per_token": 1.700293354121843 }, { "epoch": 0.18198098548892577, "grad_norm": 0.185546875, "learning_rate": 0.0007736245029569469, "loss": 1.7111143112182616, "step": 100640, "train_bpb": 0.6027624031699893, "train_bytes": 28568.91875, "train_loss_nats_per_token": 1.7120752009767415 }, { "epoch": 0.18211266492849806, "grad_norm": 0.15625, "learning_rate": 0.0007730789200451201, "loss": 1.7217378616333008, "step": 100660, "train_bpb": 0.6104458040593962, "train_bytes": 28096.64375, "train_loss_nats_per_token": 1.7229052975764283 }, { "epoch": 0.18224434436807038, "grad_norm": 0.1357421875, "learning_rate": 0.0007725334627883924, "loss": 1.7051570892333985, "step": 100680, "train_bpb": 0.6043936393801195, "train_bytes": 28221.875, "train_loss_nats_per_token": 1.7054115283119002 }, { "epoch": 0.18237602380764267, "grad_norm": 0.1279296875, "learning_rate": 0.0007719881312810494, "loss": 1.7110530853271484, "step": 100700, "train_bpb": 0.6048827158059636, "train_bytes": 28397.30625, "train_loss_nats_per_token": 1.7113533249658515 }, { "epoch": 0.182507703247215, "grad_norm": 0.125, "learning_rate": 0.0007714429256173575, "loss": 1.7117719650268555, "step": 100720, "train_bpb": 0.6060149460217931, "train_bytes": 28294.4625, "train_loss_nats_per_token": 1.7119398107681634 }, { "epoch": 0.18263938268678728, "grad_norm": 0.169921875, "learning_rate": 0.0007708978458915611, "loss": 1.7203380584716796, "step": 100740, "train_bpb": 0.6092638517720573, "train_bytes": 28324.43125, "train_loss_nats_per_token": 1.7206620593407969 }, { "epoch": 0.1827710621263596, "grad_norm": 0.169921875, "learning_rate": 0.0007703528921978813, "loss": 1.7069183349609376, "step": 100760, "train_bpb": 0.6029282077485699, "train_bytes": 28403.39375, "train_loss_nats_per_token": 1.707729521072192 }, { "epoch": 0.1829027415659319, "grad_norm": 0.130859375, "learning_rate": 0.0007698080646305187, "loss": 1.7230745315551759, "step": 100780, "train_bpb": 0.6078989598986054, "train_bytes": 28432.2, "train_loss_nats_per_token": 1.723001788610142 }, { "epoch": 0.1830344210055042, "grad_norm": 0.1376953125, "learning_rate": 0.0007692633632836529, "loss": 1.7144948959350585, "step": 100800, "train_bpb": 0.6047152682472555, "train_bytes": 28497.51875, "train_loss_nats_per_token": 1.7143406226565807 }, { "epoch": 0.1831661004450765, "grad_norm": 0.1767578125, "learning_rate": 0.0007687187882514389, "loss": 1.7212818145751954, "step": 100820, "train_bpb": 0.6089392045307271, "train_bytes": 28158.3125, "train_loss_nats_per_token": 1.7230886509852377 }, { "epoch": 0.18329777988464882, "grad_norm": 0.1650390625, "learning_rate": 0.0007681743396280126, "loss": 1.7066696166992188, "step": 100840, "train_bpb": 0.6051763213305867, "train_bytes": 28105.53125, "train_loss_nats_per_token": 1.7074132555006678 }, { "epoch": 0.1834294593242211, "grad_norm": 0.1357421875, "learning_rate": 0.0007676300175074867, "loss": 1.7161203384399415, "step": 100860, "train_bpb": 0.6080161935981793, "train_bytes": 28212.8625, "train_loss_nats_per_token": 1.7171303320765563 }, { "epoch": 0.18356113876379343, "grad_norm": 0.16015625, "learning_rate": 0.0007670858219839535, "loss": 1.7093839645385742, "step": 100880, "train_bpb": 0.6066414504984289, "train_bytes": 27829.76875, "train_loss_nats_per_token": 1.709865298357382 }, { "epoch": 0.18369281820336572, "grad_norm": 0.1953125, "learning_rate": 0.0007665417531514804, "loss": 1.7147165298461915, "step": 100900, "train_bpb": 0.6062294162963617, "train_bytes": 28581.8625, "train_loss_nats_per_token": 1.7148182390148097 }, { "epoch": 0.18382449764293804, "grad_norm": 0.1708984375, "learning_rate": 0.0007659978111041159, "loss": 1.7103452682495117, "step": 100920, "train_bpb": 0.6026542524844247, "train_bytes": 28548.3, "train_loss_nats_per_token": 1.7111876277963867 }, { "epoch": 0.18395617708251033, "grad_norm": 0.1455078125, "learning_rate": 0.0007654539959358859, "loss": 1.7162370681762695, "step": 100940, "train_bpb": 0.6062686566970112, "train_bytes": 28456.16875, "train_loss_nats_per_token": 1.7175446442046631 }, { "epoch": 0.18408785652208265, "grad_norm": 0.1630859375, "learning_rate": 0.0007649103077407923, "loss": 1.709036636352539, "step": 100960, "train_bpb": 0.6036176572400315, "train_bytes": 28372.30625, "train_loss_nats_per_token": 1.7094757404628018 }, { "epoch": 0.18421953596165494, "grad_norm": 0.177734375, "learning_rate": 0.000764366746612818, "loss": 1.7167409896850585, "step": 100980, "train_bpb": 0.6080483883057795, "train_bytes": 28320.1125, "train_loss_nats_per_token": 1.7171358287479197 }, { "epoch": 0.18435121540122726, "grad_norm": 0.1728515625, "learning_rate": 0.0007638233126459222, "loss": 1.710921859741211, "step": 101000, "train_bpb": 0.6054110889723385, "train_bytes": 28385.85625, "train_loss_nats_per_token": 1.7115717597740232 }, { "epoch": 0.18435121540122726, "eval_loss": 1.5314311981201172, "eval_runtime": 74.3001, "eval_samples_per_second": 13.459, "eval_steps_per_second": 13.459, "step": 101000, "train_bpb": 0.5404305075946781, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.538936788236137 }, { "epoch": 0.18448289484079955, "grad_norm": 0.162109375, "learning_rate": 0.0007632800059340434, "loss": 1.7148937225341796, "step": 101020, "train_bpb": 0.607134492519035, "train_bytes": 28436.0625, "train_loss_nats_per_token": 1.715280798939403 }, { "epoch": 0.18461457428037187, "grad_norm": 0.177734375, "learning_rate": 0.0007627368265710955, "loss": 1.720450210571289, "step": 101040, "train_bpb": 0.6061260275672, "train_bytes": 28362.2875, "train_loss_nats_per_token": 1.7212717173018248 }, { "epoch": 0.18474625371994416, "grad_norm": 0.1650390625, "learning_rate": 0.0007621937746509733, "loss": 1.7155824661254884, "step": 101060, "train_bpb": 0.6081273418197752, "train_bytes": 28384.0375, "train_loss_nats_per_token": 1.7160862852166692 }, { "epoch": 0.18487793315951648, "grad_norm": 0.1357421875, "learning_rate": 0.0007616508502675488, "loss": 1.7204551696777344, "step": 101080, "train_bpb": 0.6042092303335671, "train_bytes": 28544.4875, "train_loss_nats_per_token": 1.721241116947048 }, { "epoch": 0.18500961259908877, "grad_norm": 0.1689453125, "learning_rate": 0.0007611080535146705, "loss": 1.7104314804077148, "step": 101100, "train_bpb": 0.6059352133964923, "train_bytes": 28190.2625, "train_loss_nats_per_token": 1.710657630532288 }, { "epoch": 0.1851412920386611, "grad_norm": 0.1357421875, "learning_rate": 0.0007605653844861662, "loss": 1.7129598617553712, "step": 101120, "train_bpb": 0.6042042926390901, "train_bytes": 28342.10625, "train_loss_nats_per_token": 1.7130469304590787 }, { "epoch": 0.18527297147823338, "grad_norm": 0.1552734375, "learning_rate": 0.0007600228432758418, "loss": 1.7103961944580077, "step": 101140, "train_bpb": 0.6039560323453663, "train_bytes": 28176.5, "train_loss_nats_per_token": 1.7112454554420025 }, { "epoch": 0.1854046509178057, "grad_norm": 0.1787109375, "learning_rate": 0.0007594804299774799, "loss": 1.7158056259155274, "step": 101160, "train_bpb": 0.6118472728787063, "train_bytes": 28274.3875, "train_loss_nats_per_token": 1.7164577349802843 }, { "epoch": 0.185536330357378, "grad_norm": 0.14453125, "learning_rate": 0.0007589381446848421, "loss": 1.7085783004760742, "step": 101180, "train_bpb": 0.6090588152018285, "train_bytes": 28055.6625, "train_loss_nats_per_token": 1.7086231144697017 }, { "epoch": 0.1856680097969503, "grad_norm": 0.12353515625, "learning_rate": 0.0007583959874916674, "loss": 1.7189952850341796, "step": 101200, "train_bpb": 0.6052411619984478, "train_bytes": 28554.96875, "train_loss_nats_per_token": 1.7190978096657896 }, { "epoch": 0.1857996892365226, "grad_norm": 0.11962890625, "learning_rate": 0.0007578539584916732, "loss": 1.7140005111694336, "step": 101220, "train_bpb": 0.6058836524071983, "train_bytes": 28024.5375, "train_loss_nats_per_token": 1.7143783652894171 }, { "epoch": 0.18593136867609492, "grad_norm": 0.107421875, "learning_rate": 0.0007573120577785535, "loss": 1.7036310195922852, "step": 101240, "train_bpb": 0.6055692573534937, "train_bytes": 28251.525, "train_loss_nats_per_token": 1.7045094720715293 }, { "epoch": 0.1860630481156672, "grad_norm": 0.126953125, "learning_rate": 0.0007567702854459811, "loss": 1.7151338577270507, "step": 101260, "train_bpb": 0.6034848195357201, "train_bytes": 28665.4375, "train_loss_nats_per_token": 1.7161336052862648 }, { "epoch": 0.18619472755523953, "grad_norm": 0.130859375, "learning_rate": 0.0007562286415876071, "loss": 1.718790054321289, "step": 101280, "train_bpb": 0.6062004908904984, "train_bytes": 28701.65625, "train_loss_nats_per_token": 1.7198805296279798 }, { "epoch": 0.18632640699481182, "grad_norm": 0.1376953125, "learning_rate": 0.0007556871262970588, "loss": 1.6980707168579101, "step": 101300, "train_bpb": 0.6035859018793474, "train_bytes": 28265.65625, "train_loss_nats_per_token": 1.6989402836932508 }, { "epoch": 0.18645808643438413, "grad_norm": 0.1318359375, "learning_rate": 0.0007551457396679423, "loss": 1.7057640075683593, "step": 101320, "train_bpb": 0.6054096356558485, "train_bytes": 28126.1875, "train_loss_nats_per_token": 1.706961394087102 }, { "epoch": 0.18658976587395645, "grad_norm": 0.140625, "learning_rate": 0.0007546044817938422, "loss": 1.716883659362793, "step": 101340, "train_bpb": 0.6030784429296852, "train_bytes": 28245.8875, "train_loss_nats_per_token": 1.7178187697387175 }, { "epoch": 0.18672144531352874, "grad_norm": 0.1396484375, "learning_rate": 0.0007540633527683186, "loss": 1.7117462158203125, "step": 101360, "train_bpb": 0.6053762800776109, "train_bytes": 28324.59375, "train_loss_nats_per_token": 1.71203693165897 }, { "epoch": 0.18685312475310106, "grad_norm": 0.1552734375, "learning_rate": 0.0007535223526849116, "loss": 1.7209459304809571, "step": 101380, "train_bpb": 0.6071346000537007, "train_bytes": 28242.625, "train_loss_nats_per_token": 1.720511874802937 }, { "epoch": 0.18698480419267335, "grad_norm": 0.158203125, "learning_rate": 0.0007529814816371382, "loss": 1.7212331771850586, "step": 101400, "train_bpb": 0.6104621918909413, "train_bytes": 28113.6625, "train_loss_nats_per_token": 1.7218756685922123 }, { "epoch": 0.18711648363224567, "grad_norm": 0.1171875, "learning_rate": 0.0007524407397184931, "loss": 1.7140430450439452, "step": 101420, "train_bpb": 0.6067359908360517, "train_bytes": 28206.5625, "train_loss_nats_per_token": 1.7151416301018898 }, { "epoch": 0.18724816307181796, "grad_norm": 0.1474609375, "learning_rate": 0.0007519001270224477, "loss": 1.706991958618164, "step": 101440, "train_bpb": 0.6057243797665296, "train_bytes": 27928.78125, "train_loss_nats_per_token": 1.7072942615557163 }, { "epoch": 0.18737984251139028, "grad_norm": 0.142578125, "learning_rate": 0.0007513596436424524, "loss": 1.710467529296875, "step": 101460, "train_bpb": 0.6038170236734401, "train_bytes": 28437.9, "train_loss_nats_per_token": 1.7109001776676205 }, { "epoch": 0.18751152195096257, "grad_norm": 0.1494140625, "learning_rate": 0.0007508192896719359, "loss": 1.707286262512207, "step": 101480, "train_bpb": 0.606030577124552, "train_bytes": 28073.13125, "train_loss_nats_per_token": 1.7072651034112225 }, { "epoch": 0.1876432013905349, "grad_norm": 0.1416015625, "learning_rate": 0.0007502790652043017, "loss": 1.7179557800292968, "step": 101500, "train_bpb": 0.605659644794833, "train_bytes": 28275.93125, "train_loss_nats_per_token": 1.7188351352344622 }, { "epoch": 0.18777488083010718, "grad_norm": 0.12890625, "learning_rate": 0.0007497389703329332, "loss": 1.7233518600463866, "step": 101520, "train_bpb": 0.6077103028659134, "train_bytes": 28650.33125, "train_loss_nats_per_token": 1.7239173645258419 }, { "epoch": 0.1879065602696795, "grad_norm": 0.134765625, "learning_rate": 0.0007491990051511913, "loss": 1.7143999099731446, "step": 101540, "train_bpb": 0.6050381872064668, "train_bytes": 28414.725, "train_loss_nats_per_token": 1.71581193210899 }, { "epoch": 0.1880382397092518, "grad_norm": 0.140625, "learning_rate": 0.0007486591697524141, "loss": 1.7236177444458007, "step": 101560, "train_bpb": 0.6075306354785486, "train_bytes": 28445.68125, "train_loss_nats_per_token": 1.7245150851100455 }, { "epoch": 0.1881699191488241, "grad_norm": 0.1552734375, "learning_rate": 0.0007481194642299164, "loss": 1.7167608261108398, "step": 101580, "train_bpb": 0.6098565445028956, "train_bytes": 27739.66875, "train_loss_nats_per_token": 1.7180376432772415 }, { "epoch": 0.1883015985883964, "grad_norm": 0.16015625, "learning_rate": 0.0007475798886769919, "loss": 1.7191995620727538, "step": 101600, "train_bpb": 0.60738248594047, "train_bytes": 28233.88125, "train_loss_nats_per_token": 1.719765016288172 }, { "epoch": 0.18843327802796872, "grad_norm": 0.1474609375, "learning_rate": 0.0007470404431869116, "loss": 1.7210487365722655, "step": 101620, "train_bpb": 0.6121478218511257, "train_bytes": 27902.46875, "train_loss_nats_per_token": 1.7213239963290985 }, { "epoch": 0.188564957467541, "grad_norm": 0.14453125, "learning_rate": 0.0007465011278529228, "loss": 1.7060169219970702, "step": 101640, "train_bpb": 0.6051671161079962, "train_bytes": 28330.475, "train_loss_nats_per_token": 1.7070764870667792 }, { "epoch": 0.18869663690711333, "grad_norm": 0.1552734375, "learning_rate": 0.0007459619427682517, "loss": 1.7150041580200195, "step": 101660, "train_bpb": 0.6062458062808286, "train_bytes": 28264.9, "train_loss_nats_per_token": 1.715770076707731 }, { "epoch": 0.18882831634668562, "grad_norm": 0.1708984375, "learning_rate": 0.0007454228880261013, "loss": 1.7230854034423828, "step": 101680, "train_bpb": 0.6087339727035197, "train_bytes": 28520.9125, "train_loss_nats_per_token": 1.7234506984277114 }, { "epoch": 0.18895999578625794, "grad_norm": 0.142578125, "learning_rate": 0.0007448839637196529, "loss": 1.7103206634521484, "step": 101700, "train_bpb": 0.6025555305608601, "train_bytes": 28561.21875, "train_loss_nats_per_token": 1.71121500664248 }, { "epoch": 0.18909167522583023, "grad_norm": 0.146484375, "learning_rate": 0.0007443451699420636, "loss": 1.7139127731323243, "step": 101720, "train_bpb": 0.6080487434267616, "train_bytes": 28129.1625, "train_loss_nats_per_token": 1.7152426551770596 }, { "epoch": 0.18922335466540255, "grad_norm": 0.1171875, "learning_rate": 0.0007438065067864695, "loss": 1.7171886444091797, "step": 101740, "train_bpb": 0.609776747449147, "train_bytes": 28064.9, "train_loss_nats_per_token": 1.7176925419953455 }, { "epoch": 0.18935503410497484, "grad_norm": 0.169921875, "learning_rate": 0.0007432679743459838, "loss": 1.718115234375, "step": 101760, "train_bpb": 0.6113600776599364, "train_bytes": 28029.15, "train_loss_nats_per_token": 1.7191374171037126 }, { "epoch": 0.18948671354454716, "grad_norm": 0.1396484375, "learning_rate": 0.0007427295727136962, "loss": 1.7171085357666016, "step": 101780, "train_bpb": 0.6058168624991035, "train_bytes": 28267.05, "train_loss_nats_per_token": 1.7174916333500823 }, { "epoch": 0.18961839298411945, "grad_norm": 0.1865234375, "learning_rate": 0.0007421913019826748, "loss": 1.7200515747070313, "step": 101800, "train_bpb": 0.6077505935703752, "train_bytes": 28265.08125, "train_loss_nats_per_token": 1.7214308983590012 }, { "epoch": 0.18975007242369177, "grad_norm": 0.1201171875, "learning_rate": 0.0007416531622459651, "loss": 1.7230222702026368, "step": 101820, "train_bpb": 0.6087167314403233, "train_bytes": 28347.60625, "train_loss_nats_per_token": 1.7237857418843752 }, { "epoch": 0.18988175186326406, "grad_norm": 0.1357421875, "learning_rate": 0.0007411151535965889, "loss": 1.715103530883789, "step": 101840, "train_bpb": 0.6069493766086392, "train_bytes": 28376.04375, "train_loss_nats_per_token": 1.7157897804475504 }, { "epoch": 0.19001343130283638, "grad_norm": 0.1484375, "learning_rate": 0.000740577276127546, "loss": 1.7217174530029298, "step": 101860, "train_bpb": 0.6100865690071415, "train_bytes": 28354.40625, "train_loss_nats_per_token": 1.722091768559236 }, { "epoch": 0.19014511074240867, "grad_norm": 0.1513671875, "learning_rate": 0.000740039529931814, "loss": 1.7194478988647461, "step": 101880, "train_bpb": 0.6080690433341271, "train_bytes": 28426.5875, "train_loss_nats_per_token": 1.7200282849386708 }, { "epoch": 0.190276790181981, "grad_norm": 0.11865234375, "learning_rate": 0.0007395019151023479, "loss": 1.7060201644897461, "step": 101900, "train_bpb": 0.602270520860317, "train_bytes": 28328.125, "train_loss_nats_per_token": 1.7062879121752714 }, { "epoch": 0.19040846962155328, "grad_norm": 0.1396484375, "learning_rate": 0.000738964431732078, "loss": 1.7265584945678711, "step": 101920, "train_bpb": 0.6130172372750888, "train_bytes": 28397.56875, "train_loss_nats_per_token": 1.7275505831960916 }, { "epoch": 0.1905401490611256, "grad_norm": 0.1474609375, "learning_rate": 0.0007384270799139141, "loss": 1.7235631942749023, "step": 101940, "train_bpb": 0.6090238744149794, "train_bytes": 28623.28125, "train_loss_nats_per_token": 1.7247405989360767 }, { "epoch": 0.1906718285006979, "grad_norm": 0.19140625, "learning_rate": 0.000737889859740743, "loss": 1.72259521484375, "step": 101960, "train_bpb": 0.609468077768853, "train_bytes": 28060.28125, "train_loss_nats_per_token": 1.7228914389617602 }, { "epoch": 0.1908035079402702, "grad_norm": 0.126953125, "learning_rate": 0.0007373527713054272, "loss": 1.7236173629760743, "step": 101980, "train_bpb": 0.609370735449265, "train_bytes": 28279.6625, "train_loss_nats_per_token": 1.7240687985412864 }, { "epoch": 0.19093518737984252, "grad_norm": 0.134765625, "learning_rate": 0.0007368158147008078, "loss": 1.719095230102539, "step": 102000, "train_bpb": 0.6085234587287591, "train_bytes": 28564.24375, "train_loss_nats_per_token": 1.7199423472729853 }, { "epoch": 0.19093518737984252, "eval_loss": 1.5306872129440308, "eval_runtime": 73.6021, "eval_samples_per_second": 13.587, "eval_steps_per_second": 13.587, "step": 102000, "train_bpb": 0.5401898278896708, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5382514256464748 }, { "epoch": 0.19106686681941482, "grad_norm": 0.1357421875, "learning_rate": 0.000736278990019703, "loss": 1.7185522079467774, "step": 102020, "train_bpb": 0.6083120693549544, "train_bytes": 28112.85625, "train_loss_nats_per_token": 1.7189730194878872 }, { "epoch": 0.19119854625898713, "grad_norm": 0.14453125, "learning_rate": 0.0007357422973549085, "loss": 1.7193540573120116, "step": 102040, "train_bpb": 0.605364115753269, "train_bytes": 28524.2, "train_loss_nats_per_token": 1.720339244777864 }, { "epoch": 0.19133022569855943, "grad_norm": 0.181640625, "learning_rate": 0.0007352057367991953, "loss": 1.7257465362548827, "step": 102060, "train_bpb": 0.6105480363012236, "train_bytes": 28533.7625, "train_loss_nats_per_token": 1.7264911425400686 }, { "epoch": 0.19146190513813174, "grad_norm": 0.1318359375, "learning_rate": 0.0007346693084453136, "loss": 1.7207143783569336, "step": 102080, "train_bpb": 0.607606930741742, "train_bytes": 28435.575, "train_loss_nats_per_token": 1.7210279834634012 }, { "epoch": 0.19159358457770403, "grad_norm": 0.1484375, "learning_rate": 0.0007341330123859908, "loss": 1.7139589309692382, "step": 102100, "train_bpb": 0.6054684521724346, "train_bytes": 28034.9375, "train_loss_nats_per_token": 1.7142185437623843 }, { "epoch": 0.19172526401727635, "grad_norm": 0.1796875, "learning_rate": 0.0007335968487139291, "loss": 1.7184564590454101, "step": 102120, "train_bpb": 0.6084236577784033, "train_bytes": 28167.59375, "train_loss_nats_per_token": 1.7189031463927855 }, { "epoch": 0.19185694345684864, "grad_norm": 0.125, "learning_rate": 0.0007330608175218103, "loss": 1.7206663131713866, "step": 102140, "train_bpb": 0.6085196118510904, "train_bytes": 28045.7125, "train_loss_nats_per_token": 1.7214328341347749 }, { "epoch": 0.19198862289642096, "grad_norm": 0.1865234375, "learning_rate": 0.000732524918902293, "loss": 1.7207138061523437, "step": 102160, "train_bpb": 0.613257623340907, "train_bytes": 28134.3375, "train_loss_nats_per_token": 1.7210107343088652 }, { "epoch": 0.19212030233599325, "grad_norm": 0.1337890625, "learning_rate": 0.0007319891529480111, "loss": 1.707444953918457, "step": 102180, "train_bpb": 0.6014512677622896, "train_bytes": 28383.15, "train_loss_nats_per_token": 1.7080345129649126 }, { "epoch": 0.19225198177556557, "grad_norm": 0.1640625, "learning_rate": 0.0007314535197515771, "loss": 1.7200021743774414, "step": 102200, "train_bpb": 0.6065868726859733, "train_bytes": 28249.725, "train_loss_nats_per_token": 1.720135744040184 }, { "epoch": 0.19238366121513786, "grad_norm": 0.205078125, "learning_rate": 0.0007309180194055804, "loss": 1.7091594696044923, "step": 102220, "train_bpb": 0.6051033189290767, "train_bytes": 28341.0125, "train_loss_nats_per_token": 1.7097986777900702 }, { "epoch": 0.19251534065471018, "grad_norm": 0.1455078125, "learning_rate": 0.0007303826520025878, "loss": 1.7148029327392578, "step": 102240, "train_bpb": 0.6065890371186491, "train_bytes": 28231.9625, "train_loss_nats_per_token": 1.7152674657575033 }, { "epoch": 0.19264702009428247, "grad_norm": 0.138671875, "learning_rate": 0.0007298474176351413, "loss": 1.7288322448730469, "step": 102260, "train_bpb": 0.6119001685023105, "train_bytes": 28459.59375, "train_loss_nats_per_token": 1.7297260057827228 }, { "epoch": 0.1927786995338548, "grad_norm": 0.1220703125, "learning_rate": 0.0007293123163957619, "loss": 1.7183267593383789, "step": 102280, "train_bpb": 0.6046080241574715, "train_bytes": 28416.5, "train_loss_nats_per_token": 1.718951572678671 }, { "epoch": 0.19291037897342708, "grad_norm": 0.1630859375, "learning_rate": 0.0007287773483769473, "loss": 1.7218795776367188, "step": 102300, "train_bpb": 0.6081578900193235, "train_bytes": 28477.7625, "train_loss_nats_per_token": 1.722060100616185 }, { "epoch": 0.1930420584129994, "grad_norm": 0.134765625, "learning_rate": 0.0007282425136711705, "loss": 1.7273109436035157, "step": 102320, "train_bpb": 0.6120484183059112, "train_bytes": 27986.58125, "train_loss_nats_per_token": 1.7274632735525532 }, { "epoch": 0.1931737378525717, "grad_norm": 0.1298828125, "learning_rate": 0.0007277078123708835, "loss": 1.7139926910400392, "step": 102340, "train_bpb": 0.6088628743465007, "train_bytes": 27878.05625, "train_loss_nats_per_token": 1.7148164920492506 }, { "epoch": 0.193305417292144, "grad_norm": 0.1357421875, "learning_rate": 0.0007271732445685142, "loss": 1.7051162719726562, "step": 102360, "train_bpb": 0.6051917263147639, "train_bytes": 28258.35625, "train_loss_nats_per_token": 1.7065661825379213 }, { "epoch": 0.1934370967317163, "grad_norm": 0.1455078125, "learning_rate": 0.0007266388103564684, "loss": 1.7125562667846679, "step": 102380, "train_bpb": 0.6074828066139109, "train_bytes": 28126.925, "train_loss_nats_per_token": 1.714030662226259 }, { "epoch": 0.19356877617128862, "grad_norm": 0.16015625, "learning_rate": 0.0007261045098271266, "loss": 1.725687026977539, "step": 102400, "train_bpb": 0.6080548273788506, "train_bytes": 28289.7125, "train_loss_nats_per_token": 1.7261955339956898 }, { "epoch": 0.1937004556108609, "grad_norm": 0.181640625, "learning_rate": 0.0007255703430728485, "loss": 1.7319965362548828, "step": 102420, "train_bpb": 0.6121249576111496, "train_bytes": 28343.53125, "train_loss_nats_per_token": 1.7324281353091113 }, { "epoch": 0.19383213505043323, "grad_norm": 0.171875, "learning_rate": 0.0007250363101859702, "loss": 1.7245916366577148, "step": 102440, "train_bpb": 0.6072693344492199, "train_bytes": 28507.68125, "train_loss_nats_per_token": 1.7252888482016489 }, { "epoch": 0.19396381449000552, "grad_norm": 0.1513671875, "learning_rate": 0.0007245024112588033, "loss": 1.7202871322631836, "step": 102460, "train_bpb": 0.6079257641999327, "train_bytes": 28403.125, "train_loss_nats_per_token": 1.720125173867799 }, { "epoch": 0.19409549392957784, "grad_norm": 0.1240234375, "learning_rate": 0.0007239686463836376, "loss": 1.7192422866821289, "step": 102480, "train_bpb": 0.6054386509595725, "train_bytes": 28933.0625, "train_loss_nats_per_token": 1.7199357410410747 }, { "epoch": 0.19422717336915013, "grad_norm": 0.1318359375, "learning_rate": 0.0007234350156527394, "loss": 1.7156333923339844, "step": 102500, "train_bpb": 0.6096551534848579, "train_bytes": 28346.5125, "train_loss_nats_per_token": 1.7163461019796937 }, { "epoch": 0.19435885280872245, "grad_norm": 0.16015625, "learning_rate": 0.0007229015191583522, "loss": 1.7248836517333985, "step": 102520, "train_bpb": 0.6045489441115219, "train_bytes": 28630.8125, "train_loss_nats_per_token": 1.72504679962578 }, { "epoch": 0.19449053224829474, "grad_norm": 0.1474609375, "learning_rate": 0.0007223681569926952, "loss": 1.7164220809936523, "step": 102540, "train_bpb": 0.6044932504121596, "train_bytes": 28227.53125, "train_loss_nats_per_token": 1.7164174702015313 }, { "epoch": 0.19462221168786706, "grad_norm": 0.12890625, "learning_rate": 0.0007218349292479651, "loss": 1.7081613540649414, "step": 102560, "train_bpb": 0.6024691369412569, "train_bytes": 28358.775, "train_loss_nats_per_token": 1.7095375405306816 }, { "epoch": 0.19475389112743935, "grad_norm": 0.1552734375, "learning_rate": 0.0007213018360163362, "loss": 1.7229911804199218, "step": 102580, "train_bpb": 0.6084461047863258, "train_bytes": 28244.76875, "train_loss_nats_per_token": 1.7240224101531758 }, { "epoch": 0.19488557056701167, "grad_norm": 0.171875, "learning_rate": 0.0007207688773899571, "loss": 1.7168275833129882, "step": 102600, "train_bpb": 0.6069604094860346, "train_bytes": 28137.9375, "train_loss_nats_per_token": 1.7170353909911522 }, { "epoch": 0.19501725000658396, "grad_norm": 0.1318359375, "learning_rate": 0.0007202360534609557, "loss": 1.7192375183105468, "step": 102620, "train_bpb": 0.6073204129804627, "train_bytes": 28372.74375, "train_loss_nats_per_token": 1.71938821796426 }, { "epoch": 0.19514892944615628, "grad_norm": 0.1474609375, "learning_rate": 0.0007197033643214358, "loss": 1.706901741027832, "step": 102640, "train_bpb": 0.6050181783000032, "train_bytes": 28207.3, "train_loss_nats_per_token": 1.7070862395811255 }, { "epoch": 0.1952806088857286, "grad_norm": 0.142578125, "learning_rate": 0.0007191708100634767, "loss": 1.7222261428833008, "step": 102660, "train_bpb": 0.6082340187745324, "train_bytes": 28323.98125, "train_loss_nats_per_token": 1.7223780523826449 }, { "epoch": 0.1954122883253009, "grad_norm": 0.1416015625, "learning_rate": 0.000718638390779136, "loss": 1.7033349990844726, "step": 102680, "train_bpb": 0.6046999271284683, "train_bytes": 28062.625, "train_loss_nats_per_token": 1.7028296545323873 }, { "epoch": 0.1955439677648732, "grad_norm": 0.125, "learning_rate": 0.0007181061065604474, "loss": 1.7013946533203126, "step": 102700, "train_bpb": 0.6039046404425162, "train_bytes": 28082.2875, "train_loss_nats_per_token": 1.702180577285521 }, { "epoch": 0.1956756472044455, "grad_norm": 0.16015625, "learning_rate": 0.0007175739574994214, "loss": 1.7230838775634765, "step": 102720, "train_bpb": 0.6075020063651007, "train_bytes": 28794.33125, "train_loss_nats_per_token": 1.7240719284136525 }, { "epoch": 0.19580732664401782, "grad_norm": 0.1337890625, "learning_rate": 0.0007170419436880442, "loss": 1.706479263305664, "step": 102740, "train_bpb": 0.6016132193956905, "train_bytes": 28423.63125, "train_loss_nats_per_token": 1.7075835723660011 }, { "epoch": 0.1959390060835901, "grad_norm": 0.1279296875, "learning_rate": 0.0007165100652182798, "loss": 1.7293163299560548, "step": 102760, "train_bpb": 0.6092731253039964, "train_bytes": 28612.3, "train_loss_nats_per_token": 1.729925259232246 }, { "epoch": 0.19607068552316242, "grad_norm": 0.1728515625, "learning_rate": 0.000715978322182069, "loss": 1.7105342864990234, "step": 102780, "train_bpb": 0.5999461152241912, "train_bytes": 28489.38125, "train_loss_nats_per_token": 1.7104902422089663 }, { "epoch": 0.19620236496273472, "grad_norm": 0.1318359375, "learning_rate": 0.0007154467146713272, "loss": 1.6999525070190429, "step": 102800, "train_bpb": 0.6008359043341676, "train_bytes": 28368.9875, "train_loss_nats_per_token": 1.7010878352282799 }, { "epoch": 0.19633404440230703, "grad_norm": 0.1416015625, "learning_rate": 0.0007149152427779486, "loss": 1.7083927154541017, "step": 102820, "train_bpb": 0.6060183024251159, "train_bytes": 28301.49375, "train_loss_nats_per_token": 1.7097734576544037 }, { "epoch": 0.19646572384187933, "grad_norm": 0.1533203125, "learning_rate": 0.0007143839065938026, "loss": 1.702183151245117, "step": 102840, "train_bpb": 0.6050160597535598, "train_bytes": 28345.84375, "train_loss_nats_per_token": 1.703253226169085 }, { "epoch": 0.19659740328145164, "grad_norm": 0.14453125, "learning_rate": 0.0007138527062107367, "loss": 1.7228355407714844, "step": 102860, "train_bpb": 0.6090192374444691, "train_bytes": 28315.4875, "train_loss_nats_per_token": 1.7234738414048596 }, { "epoch": 0.19672908272102393, "grad_norm": 0.12060546875, "learning_rate": 0.0007133216417205726, "loss": 1.7064359664916993, "step": 102880, "train_bpb": 0.6029894134067182, "train_bytes": 28617.35625, "train_loss_nats_per_token": 1.7067936678945899 }, { "epoch": 0.19686076216059625, "grad_norm": 0.1337890625, "learning_rate": 0.0007127907132151101, "loss": 1.713540267944336, "step": 102900, "train_bpb": 0.6063865375087095, "train_bytes": 28206.4625, "train_loss_nats_per_token": 1.7127222591787332 }, { "epoch": 0.19699244160016854, "grad_norm": 0.158203125, "learning_rate": 0.0007122599207861256, "loss": 1.7130853652954101, "step": 102920, "train_bpb": 0.6076551314133077, "train_bytes": 28037.6125, "train_loss_nats_per_token": 1.7139001968694045 }, { "epoch": 0.19712412103974086, "grad_norm": 0.146484375, "learning_rate": 0.0007117292645253709, "loss": 1.7076053619384766, "step": 102940, "train_bpb": 0.6029636170703139, "train_bytes": 28279.46875, "train_loss_nats_per_token": 1.7076874117573622 }, { "epoch": 0.19725580047931315, "grad_norm": 0.123046875, "learning_rate": 0.0007111987445245751, "loss": 1.717823600769043, "step": 102960, "train_bpb": 0.6066338143047146, "train_bytes": 28281.61875, "train_loss_nats_per_token": 1.7178542626919886 }, { "epoch": 0.19738747991888547, "grad_norm": 0.1259765625, "learning_rate": 0.0007106683608754443, "loss": 1.7014097213745116, "step": 102980, "train_bpb": 0.6013842993990529, "train_bytes": 28502.5625, "train_loss_nats_per_token": 1.7018636551104334 }, { "epoch": 0.19751915935845776, "grad_norm": 0.1474609375, "learning_rate": 0.0007101381136696591, "loss": 1.7156618118286133, "step": 103000, "train_bpb": 0.6047483511121482, "train_bytes": 28700.05625, "train_loss_nats_per_token": 1.7166395962739844 }, { "epoch": 0.19751915935845776, "eval_loss": 1.5306203365325928, "eval_runtime": 74.5015, "eval_samples_per_second": 13.423, "eval_steps_per_second": 13.423, "step": 103000, "train_bpb": 0.5401546188289561, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5381511638772885 }, { "epoch": 0.19765083879803008, "grad_norm": 0.1494140625, "learning_rate": 0.0007096080029988781, "loss": 1.7155488967895507, "step": 103020, "train_bpb": 0.6074612145832063, "train_bytes": 28064.41875, "train_loss_nats_per_token": 1.7155624604654172 }, { "epoch": 0.19778251823760237, "grad_norm": 0.15234375, "learning_rate": 0.0007090780289547361, "loss": 1.7178308486938476, "step": 103040, "train_bpb": 0.6079052993850431, "train_bytes": 28214.125, "train_loss_nats_per_token": 1.7187571483405417 }, { "epoch": 0.1979141976771747, "grad_norm": 0.1640625, "learning_rate": 0.0007085481916288442, "loss": 1.7202323913574218, "step": 103060, "train_bpb": 0.6083923683689451, "train_bytes": 28461.08125, "train_loss_nats_per_token": 1.7205518325120395 }, { "epoch": 0.19804587711674698, "grad_norm": 0.1845703125, "learning_rate": 0.0007080184911127891, "loss": 1.7058071136474608, "step": 103080, "train_bpb": 0.6047446463267262, "train_bytes": 28063.40625, "train_loss_nats_per_token": 1.7060594400833942 }, { "epoch": 0.1981775565563193, "grad_norm": 0.162109375, "learning_rate": 0.0007074889274981349, "loss": 1.7167318344116211, "step": 103100, "train_bpb": 0.6050829053732203, "train_bytes": 28525.875, "train_loss_nats_per_token": 1.717223747514268 }, { "epoch": 0.1983092359958916, "grad_norm": 0.1513671875, "learning_rate": 0.0007069595008764219, "loss": 1.7140432357788087, "step": 103120, "train_bpb": 0.6055800947901985, "train_bytes": 28477.7, "train_loss_nats_per_token": 1.7142683015691424 }, { "epoch": 0.1984409154354639, "grad_norm": 0.1533203125, "learning_rate": 0.0007064302113391656, "loss": 1.7097154617309571, "step": 103140, "train_bpb": 0.6005480783494379, "train_bytes": 28461.0375, "train_loss_nats_per_token": 1.7103486939762464 }, { "epoch": 0.1985725948750362, "grad_norm": 0.1416015625, "learning_rate": 0.0007059010589778593, "loss": 1.7053361892700196, "step": 103160, "train_bpb": 0.603053721960013, "train_bytes": 28425.725, "train_loss_nats_per_token": 1.70599800061727 }, { "epoch": 0.19870427431460852, "grad_norm": 0.1279296875, "learning_rate": 0.0007053720438839717, "loss": 1.7084068298339843, "step": 103180, "train_bpb": 0.6076843011275863, "train_bytes": 27996.08125, "train_loss_nats_per_token": 1.708740486432896 }, { "epoch": 0.1988359537541808, "grad_norm": 0.162109375, "learning_rate": 0.0007048431661489485, "loss": 1.7117549896240234, "step": 103200, "train_bpb": 0.6038128152805657, "train_bytes": 28329.46875, "train_loss_nats_per_token": 1.7122285205238497 }, { "epoch": 0.19896763319375313, "grad_norm": 0.1484375, "learning_rate": 0.0007043144258642103, "loss": 1.7198904037475586, "step": 103220, "train_bpb": 0.6072129309261574, "train_bytes": 28442.9875, "train_loss_nats_per_token": 1.7204453212786261 }, { "epoch": 0.19909931263332542, "grad_norm": 0.1787109375, "learning_rate": 0.0007037858231211551, "loss": 1.7174942016601562, "step": 103240, "train_bpb": 0.6025771778120981, "train_bytes": 28607.38125, "train_loss_nats_per_token": 1.7183916495876312 }, { "epoch": 0.19923099207289774, "grad_norm": 0.1318359375, "learning_rate": 0.0007032573580111574, "loss": 1.7153289794921875, "step": 103260, "train_bpb": 0.6053020835812325, "train_bytes": 28542.175, "train_loss_nats_per_token": 1.715934991793844 }, { "epoch": 0.19936267151247003, "grad_norm": 0.1298828125, "learning_rate": 0.0007027290306255666, "loss": 1.7134557723999024, "step": 103280, "train_bpb": 0.6031459214220974, "train_bytes": 28443.5875, "train_loss_nats_per_token": 1.713692885088924 }, { "epoch": 0.19949435095204235, "grad_norm": 0.142578125, "learning_rate": 0.0007022008410557091, "loss": 1.7105209350585937, "step": 103300, "train_bpb": 0.6053136419630294, "train_bytes": 28649.575, "train_loss_nats_per_token": 1.711375854538351 }, { "epoch": 0.19962603039161464, "grad_norm": 0.140625, "learning_rate": 0.0007016727893928882, "loss": 1.7139432907104493, "step": 103320, "train_bpb": 0.6012759306222347, "train_bytes": 28712.225, "train_loss_nats_per_token": 1.714735127802312 }, { "epoch": 0.19975770983118696, "grad_norm": 0.1171875, "learning_rate": 0.0007011448757283812, "loss": 1.7138561248779296, "step": 103340, "train_bpb": 0.6050024624321598, "train_bytes": 28439.88125, "train_loss_nats_per_token": 1.714458614792112 }, { "epoch": 0.19988938927075928, "grad_norm": 0.1640625, "learning_rate": 0.0007006171001534439, "loss": 1.7115362167358399, "step": 103360, "train_bpb": 0.603043754043916, "train_bytes": 28691.3125, "train_loss_nats_per_token": 1.7124018635605094 }, { "epoch": 0.20002106871033157, "grad_norm": 0.1533203125, "learning_rate": 0.000700089462759307, "loss": 1.7078405380249024, "step": 103380, "train_bpb": 0.6049369827964926, "train_bytes": 28298.75, "train_loss_nats_per_token": 1.708707517569081 }, { "epoch": 0.2001527481499039, "grad_norm": 0.1474609375, "learning_rate": 0.000699561963637178, "loss": 1.7175397872924805, "step": 103400, "train_bpb": 0.6096211770461013, "train_bytes": 28209.36875, "train_loss_nats_per_token": 1.7184376835830364 }, { "epoch": 0.20028442758947618, "grad_norm": 0.1279296875, "learning_rate": 0.000699034602878239, "loss": 1.708108901977539, "step": 103420, "train_bpb": 0.6065117600624069, "train_bytes": 28231.34375, "train_loss_nats_per_token": 1.7082232615355182 }, { "epoch": 0.2004161070290485, "grad_norm": 0.11962890625, "learning_rate": 0.00069850738057365, "loss": 1.7204010009765625, "step": 103440, "train_bpb": 0.6080630280744149, "train_bytes": 28322.76875, "train_loss_nats_per_token": 1.7203452635688297 }, { "epoch": 0.2005477864686208, "grad_norm": 0.138671875, "learning_rate": 0.0006979802968145465, "loss": 1.7097557067871094, "step": 103460, "train_bpb": 0.6066873722065615, "train_bytes": 28742.65625, "train_loss_nats_per_token": 1.7104828176824212 }, { "epoch": 0.2006794659081931, "grad_norm": 0.1982421875, "learning_rate": 0.0006974533516920391, "loss": 1.7121332168579102, "step": 103480, "train_bpb": 0.6064329832955832, "train_bytes": 27884.3625, "train_loss_nats_per_token": 1.7119819966314427 }, { "epoch": 0.2008111453477654, "grad_norm": 0.1630859375, "learning_rate": 0.0006969265452972155, "loss": 1.7142446517944336, "step": 103500, "train_bpb": 0.6050284211741322, "train_bytes": 28533.45625, "train_loss_nats_per_token": 1.7139598924679023 }, { "epoch": 0.20094282478733771, "grad_norm": 0.1416015625, "learning_rate": 0.0006963998777211393, "loss": 1.710982894897461, "step": 103520, "train_bpb": 0.6074754100438411, "train_bytes": 28161.36875, "train_loss_nats_per_token": 1.7124424131434077 }, { "epoch": 0.20107450422691, "grad_norm": 0.142578125, "learning_rate": 0.0006958733490548501, "loss": 1.7028034210205079, "step": 103540, "train_bpb": 0.6029463742949375, "train_bytes": 28304.6875, "train_loss_nats_per_token": 1.7026131622190204 }, { "epoch": 0.20120618366648232, "grad_norm": 0.11962890625, "learning_rate": 0.0006953469593893624, "loss": 1.7154083251953125, "step": 103560, "train_bpb": 0.6053119617483256, "train_bytes": 28133.25625, "train_loss_nats_per_token": 1.7161180413442998 }, { "epoch": 0.20133786310605462, "grad_norm": 0.12890625, "learning_rate": 0.0006948207088156683, "loss": 1.7193016052246093, "step": 103580, "train_bpb": 0.6059165659599106, "train_bytes": 28351.3, "train_loss_nats_per_token": 1.719581821608848 }, { "epoch": 0.20146954254562693, "grad_norm": 0.1123046875, "learning_rate": 0.0006942945974247357, "loss": 1.7105047225952148, "step": 103600, "train_bpb": 0.6053837985244046, "train_bytes": 28253.0125, "train_loss_nats_per_token": 1.7117506010483077 }, { "epoch": 0.20160122198519922, "grad_norm": 0.1875, "learning_rate": 0.0006937686253075064, "loss": 1.7307844161987305, "step": 103620, "train_bpb": 0.6106317457018873, "train_bytes": 28392.825, "train_loss_nats_per_token": 1.731330821591347 }, { "epoch": 0.20173290142477154, "grad_norm": 0.150390625, "learning_rate": 0.0006932427925549002, "loss": 1.7252349853515625, "step": 103640, "train_bpb": 0.6091486281576841, "train_bytes": 28410.625, "train_loss_nats_per_token": 1.7258045228885563 }, { "epoch": 0.20186458086434383, "grad_norm": 0.181640625, "learning_rate": 0.0006927170992578125, "loss": 1.7224868774414062, "step": 103660, "train_bpb": 0.6069122359651079, "train_bytes": 28696.59375, "train_loss_nats_per_token": 1.722323791296876 }, { "epoch": 0.20199626030391615, "grad_norm": 0.130859375, "learning_rate": 0.0006921915455071147, "loss": 1.7186338424682617, "step": 103680, "train_bpb": 0.611267357531768, "train_bytes": 28010.00625, "train_loss_nats_per_token": 1.7189793565199305 }, { "epoch": 0.20212793974348844, "grad_norm": 0.1484375, "learning_rate": 0.0006916661313936524, "loss": 1.714025115966797, "step": 103700, "train_bpb": 0.6062561237851368, "train_bytes": 28307.36875, "train_loss_nats_per_token": 1.7151949979312244 }, { "epoch": 0.20225961918306076, "grad_norm": 0.1162109375, "learning_rate": 0.0006911408570082493, "loss": 1.7145961761474608, "step": 103720, "train_bpb": 0.6032132248070152, "train_bytes": 28554.74375, "train_loss_nats_per_token": 1.715861999517201 }, { "epoch": 0.20239129862263305, "grad_norm": 0.125, "learning_rate": 0.0006906157224417041, "loss": 1.709646224975586, "step": 103740, "train_bpb": 0.6086615834106438, "train_bytes": 28028.9125, "train_loss_nats_per_token": 1.710222862154311 }, { "epoch": 0.20252297806220537, "grad_norm": 0.1279296875, "learning_rate": 0.0006900907277847905, "loss": 1.7176027297973633, "step": 103760, "train_bpb": 0.6052586613055835, "train_bytes": 28361.55625, "train_loss_nats_per_token": 1.718064717241358 }, { "epoch": 0.20265465750177766, "grad_norm": 0.1552734375, "learning_rate": 0.0006895658731282588, "loss": 1.7175174713134767, "step": 103780, "train_bpb": 0.6093336425545787, "train_bytes": 28109.6, "train_loss_nats_per_token": 1.7181254838975186 }, { "epoch": 0.20278633694134998, "grad_norm": 0.1318359375, "learning_rate": 0.000689041158562836, "loss": 1.7052240371704102, "step": 103800, "train_bpb": 0.6049837212918893, "train_bytes": 28412.95, "train_loss_nats_per_token": 1.706599760989407 }, { "epoch": 0.20291801638092227, "grad_norm": 0.1552734375, "learning_rate": 0.0006885165841792227, "loss": 1.7289678573608398, "step": 103820, "train_bpb": 0.6132602327332884, "train_bytes": 28261.08125, "train_loss_nats_per_token": 1.7307605747255326 }, { "epoch": 0.2030496958204946, "grad_norm": 0.1220703125, "learning_rate": 0.0006879921500680971, "loss": 1.7188825607299805, "step": 103840, "train_bpb": 0.6068935201638576, "train_bytes": 28412.675, "train_loss_nats_per_token": 1.7199184407113084 }, { "epoch": 0.20318137526006688, "grad_norm": 0.140625, "learning_rate": 0.0006874678563201121, "loss": 1.7216541290283203, "step": 103860, "train_bpb": 0.6124243295688392, "train_bytes": 28062.6875, "train_loss_nats_per_token": 1.7218278126620408 }, { "epoch": 0.2033130546996392, "grad_norm": 0.150390625, "learning_rate": 0.000686943703025898, "loss": 1.7143280029296875, "step": 103880, "train_bpb": 0.6058383942619678, "train_bytes": 28626.7125, "train_loss_nats_per_token": 1.7148465248125602 }, { "epoch": 0.2034447341392115, "grad_norm": 0.138671875, "learning_rate": 0.0006864196902760578, "loss": 1.7168281555175782, "step": 103900, "train_bpb": 0.6097049924141285, "train_bytes": 28331.28125, "train_loss_nats_per_token": 1.716737119392785 }, { "epoch": 0.2035764135787838, "grad_norm": 0.12353515625, "learning_rate": 0.0006858958181611732, "loss": 1.7144258499145508, "step": 103920, "train_bpb": 0.6099020852411239, "train_bytes": 28222.2, "train_loss_nats_per_token": 1.7149633025113442 }, { "epoch": 0.2037080930183561, "grad_norm": 0.12109375, "learning_rate": 0.0006853720867718004, "loss": 1.720533561706543, "step": 103940, "train_bpb": 0.6109750110556137, "train_bytes": 28208.60625, "train_loss_nats_per_token": 1.7211017176856487 }, { "epoch": 0.20383977245792842, "grad_norm": 0.134765625, "learning_rate": 0.0006848484961984707, "loss": 1.7235706329345704, "step": 103960, "train_bpb": 0.6097549419058147, "train_bytes": 28699.46875, "train_loss_nats_per_token": 1.7244244820150365 }, { "epoch": 0.2039714518975007, "grad_norm": 0.1259765625, "learning_rate": 0.0006843250465316915, "loss": 1.720595932006836, "step": 103980, "train_bpb": 0.6132840560066368, "train_bytes": 28040.33125, "train_loss_nats_per_token": 1.7215851378584128 }, { "epoch": 0.20410313133707303, "grad_norm": 0.1513671875, "learning_rate": 0.0006838017378619466, "loss": 1.7180959701538085, "step": 104000, "train_bpb": 0.6068652904785317, "train_bytes": 28430.9875, "train_loss_nats_per_token": 1.7181006371842489 }, { "epoch": 0.20410313133707303, "eval_loss": 1.5309079885482788, "eval_runtime": 78.2416, "eval_samples_per_second": 12.781, "eval_steps_per_second": 12.781, "step": 104000, "train_bpb": 0.5402574849634552, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.538444086790447 }, { "epoch": 0.20423481077664535, "grad_norm": 0.1748046875, "learning_rate": 0.000683278570279695, "loss": 1.7238460540771485, "step": 104020, "train_bpb": 0.6089925405542901, "train_bytes": 28356.2, "train_loss_nats_per_token": 1.7236844836873 }, { "epoch": 0.20436649021621764, "grad_norm": 0.2119140625, "learning_rate": 0.0006827555438753701, "loss": 1.7282581329345703, "step": 104040, "train_bpb": 0.6121796072631843, "train_bytes": 28403.23125, "train_loss_nats_per_token": 1.7285842577223705 }, { "epoch": 0.20449816965578996, "grad_norm": 0.1298828125, "learning_rate": 0.0006822326587393826, "loss": 1.717844581604004, "step": 104060, "train_bpb": 0.6070943397322817, "train_bytes": 28354.075, "train_loss_nats_per_token": 1.718469203151316 }, { "epoch": 0.20462984909536225, "grad_norm": 0.150390625, "learning_rate": 0.0006817099149621182, "loss": 1.722024917602539, "step": 104080, "train_bpb": 0.6107176696748081, "train_bytes": 28038.43125, "train_loss_nats_per_token": 1.7226993776856738 }, { "epoch": 0.20476152853493457, "grad_norm": 0.1279296875, "learning_rate": 0.0006811873126339372, "loss": 1.717633056640625, "step": 104100, "train_bpb": 0.6065206737175516, "train_bytes": 28323.31875, "train_loss_nats_per_token": 1.7186852927397682 }, { "epoch": 0.20489320797450686, "grad_norm": 0.1708984375, "learning_rate": 0.0006806648518451768, "loss": 1.7206892013549804, "step": 104120, "train_bpb": 0.606998040022982, "train_bytes": 28357.41875, "train_loss_nats_per_token": 1.7209770596040905 }, { "epoch": 0.20502488741407918, "grad_norm": 0.1376953125, "learning_rate": 0.00068014253268615, "loss": 1.717148208618164, "step": 104140, "train_bpb": 0.6028512401781222, "train_bytes": 28643.86875, "train_loss_nats_per_token": 1.7177807153502116 }, { "epoch": 0.20515656685365147, "grad_norm": 0.10986328125, "learning_rate": 0.0006796203552471431, "loss": 1.7080574035644531, "step": 104160, "train_bpb": 0.6039673340134251, "train_bytes": 28523.31875, "train_loss_nats_per_token": 1.7084908737158724 }, { "epoch": 0.2052882462932238, "grad_norm": 0.158203125, "learning_rate": 0.0006790983196184203, "loss": 1.7154590606689453, "step": 104180, "train_bpb": 0.6072924625675665, "train_bytes": 28294.5875, "train_loss_nats_per_token": 1.7164370304386645 }, { "epoch": 0.20541992573279608, "grad_norm": 0.1328125, "learning_rate": 0.0006785764258902198, "loss": 1.7157169342041017, "step": 104200, "train_bpb": 0.6069901089238923, "train_bytes": 28274.59375, "train_loss_nats_per_token": 1.7160116299423764 }, { "epoch": 0.2055516051723684, "grad_norm": 0.224609375, "learning_rate": 0.0006780546741527568, "loss": 1.7221359252929687, "step": 104220, "train_bpb": 0.6085568123285146, "train_bytes": 28461.4125, "train_loss_nats_per_token": 1.7223856577115264 }, { "epoch": 0.2056832846119407, "grad_norm": 0.1376953125, "learning_rate": 0.0006775330644962197, "loss": 1.7172903060913085, "step": 104240, "train_bpb": 0.6088111822625069, "train_bytes": 28060.11875, "train_loss_nats_per_token": 1.7176355969445585 }, { "epoch": 0.205814964051513, "grad_norm": 0.12353515625, "learning_rate": 0.0006770115970107743, "loss": 1.7254148483276368, "step": 104260, "train_bpb": 0.6070506986250913, "train_bytes": 28538.2375, "train_loss_nats_per_token": 1.7260323699065119 }, { "epoch": 0.2059466434910853, "grad_norm": 0.1416015625, "learning_rate": 0.0006764902717865613, "loss": 1.7135713577270508, "step": 104280, "train_bpb": 0.6060553312440886, "train_bytes": 28219.375, "train_loss_nats_per_token": 1.713415099034022 }, { "epoch": 0.20607832293065761, "grad_norm": 0.2021484375, "learning_rate": 0.0006759690889136959, "loss": 1.723668098449707, "step": 104300, "train_bpb": 0.608797068477937, "train_bytes": 28260.6375, "train_loss_nats_per_token": 1.7239572171973694 }, { "epoch": 0.2062100023702299, "grad_norm": 0.13671875, "learning_rate": 0.0006754480484822698, "loss": 1.7208890914916992, "step": 104320, "train_bpb": 0.6085331743865959, "train_bytes": 28185.9375, "train_loss_nats_per_token": 1.7222682373859655 }, { "epoch": 0.20634168180980222, "grad_norm": 0.1689453125, "learning_rate": 0.0006749271505823498, "loss": 1.7136833190917968, "step": 104340, "train_bpb": 0.6052423230915466, "train_bytes": 28379.3, "train_loss_nats_per_token": 1.7140396699401839 }, { "epoch": 0.20647336124937452, "grad_norm": 0.15234375, "learning_rate": 0.0006744063953039784, "loss": 1.717932891845703, "step": 104360, "train_bpb": 0.6077435772854018, "train_bytes": 28645.525, "train_loss_nats_per_token": 1.7182246952743998 }, { "epoch": 0.20660504068894683, "grad_norm": 0.142578125, "learning_rate": 0.000673885782737172, "loss": 1.715194320678711, "step": 104380, "train_bpb": 0.6106789635782507, "train_bytes": 28133.35, "train_loss_nats_per_token": 1.7159394704400501 }, { "epoch": 0.20673672012851912, "grad_norm": 0.1826171875, "learning_rate": 0.000673365312971924, "loss": 1.7236183166503907, "step": 104400, "train_bpb": 0.6095250477196936, "train_bytes": 28468.9625, "train_loss_nats_per_token": 1.7244039083025056 }, { "epoch": 0.20686839956809144, "grad_norm": 0.1396484375, "learning_rate": 0.0006728449860982028, "loss": 1.7086633682250976, "step": 104420, "train_bpb": 0.6052335881405524, "train_bytes": 28072.7875, "train_loss_nats_per_token": 1.709272295590271 }, { "epoch": 0.20700007900766373, "grad_norm": 0.15625, "learning_rate": 0.0006723248022059507, "loss": 1.718056869506836, "step": 104440, "train_bpb": 0.6078974375375952, "train_bytes": 28265.81875, "train_loss_nats_per_token": 1.718895696920498 }, { "epoch": 0.20713175844723605, "grad_norm": 0.140625, "learning_rate": 0.000671804761385087, "loss": 1.7203866958618164, "step": 104460, "train_bpb": 0.6078529911733598, "train_bytes": 27976.875, "train_loss_nats_per_token": 1.7212910760658438 }, { "epoch": 0.20726343788680834, "grad_norm": 0.1669921875, "learning_rate": 0.0006712848637255061, "loss": 1.7186227798461915, "step": 104480, "train_bpb": 0.6083234649409834, "train_bytes": 28354.45, "train_loss_nats_per_token": 1.7196538675449065 }, { "epoch": 0.20739511732638066, "grad_norm": 0.13671875, "learning_rate": 0.000670765109317076, "loss": 1.714698600769043, "step": 104500, "train_bpb": 0.6035145284074829, "train_bytes": 28288.73125, "train_loss_nats_per_token": 1.7134886047982798 }, { "epoch": 0.20752679676595295, "grad_norm": 0.1142578125, "learning_rate": 0.0006702454982496419, "loss": 1.7108556747436523, "step": 104520, "train_bpb": 0.6068797012674186, "train_bytes": 28136.6125, "train_loss_nats_per_token": 1.7117234696275039 }, { "epoch": 0.20765847620552527, "grad_norm": 0.1845703125, "learning_rate": 0.0006697260306130231, "loss": 1.7162343978881835, "step": 104540, "train_bpb": 0.6081083874660773, "train_bytes": 28079.6125, "train_loss_nats_per_token": 1.7173148801739393 }, { "epoch": 0.20779015564509756, "grad_norm": 0.1552734375, "learning_rate": 0.0006692067064970153, "loss": 1.711166763305664, "step": 104560, "train_bpb": 0.6082720758211148, "train_bytes": 28037.41875, "train_loss_nats_per_token": 1.7115825511977243 }, { "epoch": 0.20792183508466988, "grad_norm": 0.177734375, "learning_rate": 0.0006686875259913871, "loss": 1.7155162811279296, "step": 104580, "train_bpb": 0.6070974937047426, "train_bytes": 28130.28125, "train_loss_nats_per_token": 1.7161546767046099 }, { "epoch": 0.20805351452424217, "grad_norm": 0.154296875, "learning_rate": 0.0006681684891858845, "loss": 1.7250349044799804, "step": 104600, "train_bpb": 0.610328567804427, "train_bytes": 28492.9375, "train_loss_nats_per_token": 1.724828466642419 }, { "epoch": 0.2081851939638145, "grad_norm": 0.138671875, "learning_rate": 0.0006676495961702283, "loss": 1.6998973846435548, "step": 104620, "train_bpb": 0.6033033120833902, "train_bytes": 28116.3375, "train_loss_nats_per_token": 1.7002516721467196 }, { "epoch": 0.20831687340338678, "grad_norm": 0.1103515625, "learning_rate": 0.0006671308470341128, "loss": 1.7127973556518554, "step": 104640, "train_bpb": 0.6121916854357496, "train_bytes": 27891.8375, "train_loss_nats_per_token": 1.7133416493494427 }, { "epoch": 0.2084485528429591, "grad_norm": 0.150390625, "learning_rate": 0.0006666122418672097, "loss": 1.7132017135620117, "step": 104660, "train_bpb": 0.6068427515776822, "train_bytes": 28560.4875, "train_loss_nats_per_token": 1.7153429044289568 }, { "epoch": 0.20858023228253142, "grad_norm": 0.11572265625, "learning_rate": 0.0006660937807591639, "loss": 1.7190113067626953, "step": 104680, "train_bpb": 0.609068703296414, "train_bytes": 28368.88125, "train_loss_nats_per_token": 1.7197427972041113 }, { "epoch": 0.2087119117221037, "grad_norm": 0.12109375, "learning_rate": 0.0006655754637995975, "loss": 1.7126890182495118, "step": 104700, "train_bpb": 0.6072472766064669, "train_bytes": 28196.9375, "train_loss_nats_per_token": 1.7128003695131824 }, { "epoch": 0.20884359116167603, "grad_norm": 0.1513671875, "learning_rate": 0.000665057291078105, "loss": 1.7365146636962892, "step": 104720, "train_bpb": 0.6112608092293279, "train_bytes": 28503.71875, "train_loss_nats_per_token": 1.7370571266114427 }, { "epoch": 0.20897527060124832, "grad_norm": 0.138671875, "learning_rate": 0.0006645392626842579, "loss": 1.7157608032226563, "step": 104740, "train_bpb": 0.6098014247885815, "train_bytes": 27991.96875, "train_loss_nats_per_token": 1.7161886964428417 }, { "epoch": 0.20910695004082064, "grad_norm": 0.1865234375, "learning_rate": 0.000664021378707603, "loss": 1.7124557495117188, "step": 104760, "train_bpb": 0.6035940475963457, "train_bytes": 28422.9875, "train_loss_nats_per_token": 1.7136561652459605 }, { "epoch": 0.20923862948039293, "grad_norm": 0.1748046875, "learning_rate": 0.0006635036392376605, "loss": 1.7110015869140625, "step": 104780, "train_bpb": 0.6069905420956747, "train_bytes": 28255.5375, "train_loss_nats_per_token": 1.7117143144150704 }, { "epoch": 0.20937030891996525, "grad_norm": 0.130859375, "learning_rate": 0.0006629860443639263, "loss": 1.718672752380371, "step": 104800, "train_bpb": 0.6116703699718589, "train_bytes": 28148.575, "train_loss_nats_per_token": 1.7196522410700374 }, { "epoch": 0.20950198835953754, "grad_norm": 0.138671875, "learning_rate": 0.0006624685941758722, "loss": 1.7159822463989258, "step": 104820, "train_bpb": 0.6066963746058776, "train_bytes": 28430.2125, "train_loss_nats_per_token": 1.7171608516383947 }, { "epoch": 0.20963366779910986, "grad_norm": 0.130859375, "learning_rate": 0.0006619512887629446, "loss": 1.715170669555664, "step": 104840, "train_bpb": 0.6054655550393834, "train_bytes": 28412.56875, "train_loss_nats_per_token": 1.7154178028597358 }, { "epoch": 0.20976534723868215, "grad_norm": 0.12890625, "learning_rate": 0.0006614341282145633, "loss": 1.7151885986328126, "step": 104860, "train_bpb": 0.6085420389914445, "train_bytes": 28365.89375, "train_loss_nats_per_token": 1.7154129936916387 }, { "epoch": 0.20989702667825447, "grad_norm": 0.1171875, "learning_rate": 0.0006609171126201253, "loss": 1.72290096282959, "step": 104880, "train_bpb": 0.6055309238460435, "train_bytes": 28502.05625, "train_loss_nats_per_token": 1.7234548217023935 }, { "epoch": 0.21002870611782676, "grad_norm": 0.162109375, "learning_rate": 0.0006604002420690018, "loss": 1.712907600402832, "step": 104900, "train_bpb": 0.6108188925679475, "train_bytes": 28154.7875, "train_loss_nats_per_token": 1.7141501233435483 }, { "epoch": 0.21016038555739908, "grad_norm": 0.1591796875, "learning_rate": 0.0006598835166505376, "loss": 1.7082342147827148, "step": 104920, "train_bpb": 0.6023674546594125, "train_bytes": 28409.83125, "train_loss_nats_per_token": 1.708531201782115 }, { "epoch": 0.21029206499697137, "grad_norm": 0.123046875, "learning_rate": 0.0006593669364540544, "loss": 1.7257144927978516, "step": 104940, "train_bpb": 0.6105565197668571, "train_bytes": 27991.9625, "train_loss_nats_per_token": 1.726430101962802 }, { "epoch": 0.21042374443654369, "grad_norm": 0.1513671875, "learning_rate": 0.000658850501568848, "loss": 1.7068458557128907, "step": 104960, "train_bpb": 0.6073382947377641, "train_bytes": 27970.61875, "train_loss_nats_per_token": 1.707422003861775 }, { "epoch": 0.21055542387611598, "grad_norm": 0.1611328125, "learning_rate": 0.0006583342120841881, "loss": 1.7119768142700196, "step": 104980, "train_bpb": 0.609153224164252, "train_bytes": 28228.0375, "train_loss_nats_per_token": 1.713918636385722 }, { "epoch": 0.2106871033156883, "grad_norm": 0.1552734375, "learning_rate": 0.0006578180680893208, "loss": 1.7148191452026367, "step": 105000, "train_bpb": 0.6056955443810895, "train_bytes": 28595.81875, "train_loss_nats_per_token": 1.7155607845218437 }, { "epoch": 0.2106871033156883, "eval_loss": 1.5313955545425415, "eval_runtime": 74.3996, "eval_samples_per_second": 13.441, "eval_steps_per_second": 13.441, "step": 105000, "train_bpb": 0.5404281661694634, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5389301207639081 }, { "epoch": 0.2108187827552606, "grad_norm": 0.201171875, "learning_rate": 0.0006573020696734663, "loss": 1.7184391021728516, "step": 105020, "train_bpb": 0.6086307189959699, "train_bytes": 28439.05, "train_loss_nats_per_token": 1.7196978443963595 }, { "epoch": 0.2109504621948329, "grad_norm": 0.125, "learning_rate": 0.0006567862169258203, "loss": 1.7126445770263672, "step": 105040, "train_bpb": 0.6079568485149714, "train_bytes": 28053.7875, "train_loss_nats_per_token": 1.713207415769085 }, { "epoch": 0.2110821416344052, "grad_norm": 0.1416015625, "learning_rate": 0.0006562705099355517, "loss": 1.7167131423950195, "step": 105060, "train_bpb": 0.6070053249284664, "train_bytes": 28248.1, "train_loss_nats_per_token": 1.7158497589245594 }, { "epoch": 0.21121382107397751, "grad_norm": 0.1513671875, "learning_rate": 0.0006557549487918058, "loss": 1.7219013214111327, "step": 105080, "train_bpb": 0.6080148895837352, "train_bytes": 28326.89375, "train_loss_nats_per_token": 1.7225557167672598 }, { "epoch": 0.2113455005135498, "grad_norm": 0.1318359375, "learning_rate": 0.0006552395335837028, "loss": 1.7111183166503907, "step": 105100, "train_bpb": 0.6082243649619615, "train_bytes": 28119.88125, "train_loss_nats_per_token": 1.7105934532208475 }, { "epoch": 0.21147717995312212, "grad_norm": 0.130859375, "learning_rate": 0.0006547242644003357, "loss": 1.6997434616088867, "step": 105120, "train_bpb": 0.6037413146662185, "train_bytes": 28203.3, "train_loss_nats_per_token": 1.7003786236208807 }, { "epoch": 0.21160885939269442, "grad_norm": 0.1708984375, "learning_rate": 0.0006542091413307744, "loss": 1.7173521041870117, "step": 105140, "train_bpb": 0.6069357281238695, "train_bytes": 28271.15, "train_loss_nats_per_token": 1.7172079160795533 }, { "epoch": 0.21174053883226673, "grad_norm": 0.11474609375, "learning_rate": 0.0006536941644640626, "loss": 1.7219736099243164, "step": 105160, "train_bpb": 0.6090795156389665, "train_bytes": 28336.58125, "train_loss_nats_per_token": 1.7222930458611219 }, { "epoch": 0.21187221827183902, "grad_norm": 0.10888671875, "learning_rate": 0.0006531793338892195, "loss": 1.7104660034179688, "step": 105180, "train_bpb": 0.606042367057452, "train_bytes": 28472.375, "train_loss_nats_per_token": 1.7108107419451464 }, { "epoch": 0.21200389771141134, "grad_norm": 0.1611328125, "learning_rate": 0.0006526646496952371, "loss": 1.7128587722778321, "step": 105200, "train_bpb": 0.6081928125377599, "train_bytes": 28376.63125, "train_loss_nats_per_token": 1.7136939868966279 }, { "epoch": 0.21213557715098363, "grad_norm": 0.2119140625, "learning_rate": 0.000652150111971084, "loss": 1.7185462951660155, "step": 105220, "train_bpb": 0.6140818601255534, "train_bytes": 27814.45625, "train_loss_nats_per_token": 1.7191879477874983 }, { "epoch": 0.21226725659055595, "grad_norm": 0.353515625, "learning_rate": 0.0006516357208057036, "loss": 1.7107929229736327, "step": 105240, "train_bpb": 0.6046300156473288, "train_bytes": 28517.6125, "train_loss_nats_per_token": 1.7117483992844575 }, { "epoch": 0.21239893603012824, "grad_norm": 0.1298828125, "learning_rate": 0.0006511214762880119, "loss": 1.7106115341186523, "step": 105260, "train_bpb": 0.6060287779184297, "train_bytes": 28441.875, "train_loss_nats_per_token": 1.7104138138768605 }, { "epoch": 0.21253061546970056, "grad_norm": 0.1396484375, "learning_rate": 0.0006506073785069015, "loss": 1.7227563858032227, "step": 105280, "train_bpb": 0.6112777008692447, "train_bytes": 28274.95625, "train_loss_nats_per_token": 1.7240129325723368 }, { "epoch": 0.21266229490927285, "grad_norm": 0.1240234375, "learning_rate": 0.0006500934275512393, "loss": 1.7121034622192384, "step": 105300, "train_bpb": 0.6096932805614155, "train_bytes": 28198.80625, "train_loss_nats_per_token": 1.7134030336168302 }, { "epoch": 0.21279397434884517, "grad_norm": 0.109375, "learning_rate": 0.0006495796235098659, "loss": 1.7229665756225585, "step": 105320, "train_bpb": 0.6061609834205433, "train_bytes": 28647.26875, "train_loss_nats_per_token": 1.7228454617363234 }, { "epoch": 0.21292565378841746, "grad_norm": 0.1728515625, "learning_rate": 0.0006490659664715973, "loss": 1.7228912353515624, "step": 105340, "train_bpb": 0.6072038100708202, "train_bytes": 28397.4375, "train_loss_nats_per_token": 1.7234679193947244 }, { "epoch": 0.21305733322798978, "grad_norm": 0.1298828125, "learning_rate": 0.0006485524565252239, "loss": 1.7223651885986329, "step": 105360, "train_bpb": 0.6090724734775174, "train_bytes": 28408.48125, "train_loss_nats_per_token": 1.7230184321199014 }, { "epoch": 0.2131890126675621, "grad_norm": 0.11376953125, "learning_rate": 0.0006480390937595116, "loss": 1.723835563659668, "step": 105380, "train_bpb": 0.605258354602039, "train_bytes": 28717.78125, "train_loss_nats_per_token": 1.7238989532144982 }, { "epoch": 0.2133206921071344, "grad_norm": 0.146484375, "learning_rate": 0.0006475258782631986, "loss": 1.7193965911865234, "step": 105400, "train_bpb": 0.6076250216372088, "train_bytes": 28214.0625, "train_loss_nats_per_token": 1.7193389089886302 }, { "epoch": 0.2134523715467067, "grad_norm": 0.1630859375, "learning_rate": 0.0006470128101249995, "loss": 1.720841407775879, "step": 105420, "train_bpb": 0.6092799076181684, "train_bytes": 28474.95625, "train_loss_nats_per_token": 1.7207628649016107 }, { "epoch": 0.213584050986279, "grad_norm": 0.1630859375, "learning_rate": 0.0006464998894336035, "loss": 1.7101099014282226, "step": 105440, "train_bpb": 0.6052083214562404, "train_bytes": 28417.4125, "train_loss_nats_per_token": 1.7097820935272705 }, { "epoch": 0.21371573042585132, "grad_norm": 0.125, "learning_rate": 0.0006459871162776728, "loss": 1.7060575485229492, "step": 105460, "train_bpb": 0.6044234652939419, "train_bytes": 28131.56875, "train_loss_nats_per_token": 1.7065554277112114 }, { "epoch": 0.2138474098654236, "grad_norm": 0.1435546875, "learning_rate": 0.0006454744907458454, "loss": 1.7157722473144532, "step": 105480, "train_bpb": 0.6110600751074083, "train_bytes": 28156.0875, "train_loss_nats_per_token": 1.716788551562358 }, { "epoch": 0.21397908930499593, "grad_norm": 0.14453125, "learning_rate": 0.0006449620129267335, "loss": 1.7314117431640625, "step": 105500, "train_bpb": 0.6106394668002549, "train_bytes": 28315.6125, "train_loss_nats_per_token": 1.732416066208423 }, { "epoch": 0.21411076874456822, "grad_norm": 0.1416015625, "learning_rate": 0.0006444496829089239, "loss": 1.7174560546875, "step": 105520, "train_bpb": 0.6061648479544343, "train_bytes": 28383.09375, "train_loss_nats_per_token": 1.7168848223896285 }, { "epoch": 0.21424244818414054, "grad_norm": 0.13671875, "learning_rate": 0.000643937500780977, "loss": 1.716644287109375, "step": 105540, "train_bpb": 0.6081077960167981, "train_bytes": 28216.04375, "train_loss_nats_per_token": 1.7179703422502166 }, { "epoch": 0.21437412762371283, "grad_norm": 0.1826171875, "learning_rate": 0.0006434254666314288, "loss": 1.709830093383789, "step": 105560, "train_bpb": 0.6041178154529663, "train_bytes": 28737.86875, "train_loss_nats_per_token": 1.7111620838066743 }, { "epoch": 0.21450580706328515, "grad_norm": 0.1318359375, "learning_rate": 0.0006429135805487893, "loss": 1.7154211044311523, "step": 105580, "train_bpb": 0.6076422746422718, "train_bytes": 28264.9375, "train_loss_nats_per_token": 1.7154128139232139 }, { "epoch": 0.21463748650285744, "grad_norm": 0.1357421875, "learning_rate": 0.0006424018426215422, "loss": 1.711317253112793, "step": 105600, "train_bpb": 0.6070095470424127, "train_bytes": 28460.01875, "train_loss_nats_per_token": 1.7118286750896383 }, { "epoch": 0.21476916594242976, "grad_norm": 0.15234375, "learning_rate": 0.0006418902529381464, "loss": 1.712839698791504, "step": 105620, "train_bpb": 0.6055628010261959, "train_bytes": 28353.85, "train_loss_nats_per_token": 1.7129900835658927 }, { "epoch": 0.21490084538200205, "grad_norm": 0.134765625, "learning_rate": 0.0006413788115870355, "loss": 1.7264759063720703, "step": 105640, "train_bpb": 0.6083656257340693, "train_bytes": 28401.2, "train_loss_nats_per_token": 1.7271204481983646 }, { "epoch": 0.21503252482157437, "grad_norm": 0.1162109375, "learning_rate": 0.0006408675186566161, "loss": 1.72425537109375, "step": 105660, "train_bpb": 0.6109913165496357, "train_bytes": 28191.69375, "train_loss_nats_per_token": 1.7246628002478475 }, { "epoch": 0.21516420426114666, "grad_norm": 0.130859375, "learning_rate": 0.0006403563742352701, "loss": 1.715690803527832, "step": 105680, "train_bpb": 0.6049433436277353, "train_bytes": 28624.58125, "train_loss_nats_per_token": 1.7166761268786432 }, { "epoch": 0.21529588370071898, "grad_norm": 0.12353515625, "learning_rate": 0.0006398453784113539, "loss": 1.7067975997924805, "step": 105700, "train_bpb": 0.6029457543103154, "train_bytes": 28481.0875, "train_loss_nats_per_token": 1.7071716798916388 }, { "epoch": 0.21542756314029127, "grad_norm": 0.1337890625, "learning_rate": 0.0006393345312731983, "loss": 1.7249105453491211, "step": 105720, "train_bpb": 0.6109932766083809, "train_bytes": 28297.3375, "train_loss_nats_per_token": 1.7257000517086654 }, { "epoch": 0.21555924257986359, "grad_norm": 0.1416015625, "learning_rate": 0.000638823832909107, "loss": 1.7119312286376953, "step": 105740, "train_bpb": 0.6090670554617084, "train_bytes": 28121.0625, "train_loss_nats_per_token": 1.7126909902277765 }, { "epoch": 0.21569092201943588, "grad_norm": 0.126953125, "learning_rate": 0.0006383132834073596, "loss": 1.719743537902832, "step": 105760, "train_bpb": 0.6045159677561331, "train_bytes": 28302.3625, "train_loss_nats_per_token": 1.721238448525203 }, { "epoch": 0.2158226014590082, "grad_norm": 0.12890625, "learning_rate": 0.0006378028828562095, "loss": 1.7168598175048828, "step": 105780, "train_bpb": 0.6100905827269262, "train_bytes": 28041.50625, "train_loss_nats_per_token": 1.7179012249157832 }, { "epoch": 0.2159542808985805, "grad_norm": 0.140625, "learning_rate": 0.0006372926313438834, "loss": 1.7206666946411133, "step": 105800, "train_bpb": 0.6099645880202011, "train_bytes": 28167.71875, "train_loss_nats_per_token": 1.7212218849039085 }, { "epoch": 0.2160859603381528, "grad_norm": 0.1328125, "learning_rate": 0.0006367825289585839, "loss": 1.710561752319336, "step": 105820, "train_bpb": 0.6076137635343887, "train_bytes": 28290.7875, "train_loss_nats_per_token": 1.7110209171987005 }, { "epoch": 0.2162176397777251, "grad_norm": 0.1796875, "learning_rate": 0.0006362725757884866, "loss": 1.7135860443115234, "step": 105840, "train_bpb": 0.6014844738336333, "train_bytes": 28755.325, "train_loss_nats_per_token": 1.7134698290421209 }, { "epoch": 0.21634931921729741, "grad_norm": 0.10791015625, "learning_rate": 0.000635762771921742, "loss": 1.7174055099487304, "step": 105860, "train_bpb": 0.6068942187857979, "train_bytes": 28774.24375, "train_loss_nats_per_token": 1.7174609954882507 }, { "epoch": 0.2164809986568697, "grad_norm": 0.1904296875, "learning_rate": 0.0006352531174464737, "loss": 1.721501350402832, "step": 105880, "train_bpb": 0.6073871293481453, "train_bytes": 28512.675, "train_loss_nats_per_token": 1.721936707307247 }, { "epoch": 0.21661267809644202, "grad_norm": 0.130859375, "learning_rate": 0.0006347436124507806, "loss": 1.7168485641479492, "step": 105900, "train_bpb": 0.6048907399023281, "train_bytes": 28574.74375, "train_loss_nats_per_token": 1.7170915649272134 }, { "epoch": 0.21674435753601431, "grad_norm": 0.12890625, "learning_rate": 0.0006342342570227363, "loss": 1.722616958618164, "step": 105920, "train_bpb": 0.6092673348694064, "train_bytes": 28382.55625, "train_loss_nats_per_token": 1.723854201638231 }, { "epoch": 0.21687603697558663, "grad_norm": 0.125, "learning_rate": 0.0006337250512503861, "loss": 1.7116640090942383, "step": 105940, "train_bpb": 0.6042283001021773, "train_bytes": 28423.68125, "train_loss_nats_per_token": 1.712783678650915 }, { "epoch": 0.21700771641515892, "grad_norm": 0.146484375, "learning_rate": 0.0006332159952217518, "loss": 1.7148097991943358, "step": 105960, "train_bpb": 0.6096080958853621, "train_bytes": 27890.125, "train_loss_nats_per_token": 1.7149778161514353 }, { "epoch": 0.21713939585473124, "grad_norm": 0.140625, "learning_rate": 0.0006327070890248285, "loss": 1.7235742568969727, "step": 105980, "train_bpb": 0.6137337629750743, "train_bytes": 27810.5875, "train_loss_nats_per_token": 1.7246800459808125 }, { "epoch": 0.21727107529430353, "grad_norm": 0.125, "learning_rate": 0.0006321983327475855, "loss": 1.7198221206665039, "step": 106000, "train_bpb": 0.6071684165187033, "train_bytes": 28369.275, "train_loss_nats_per_token": 1.720044606062221 }, { "epoch": 0.21727107529430353, "eval_loss": 1.5308316946029663, "eval_runtime": 73.4018, "eval_samples_per_second": 13.624, "eval_steps_per_second": 13.624, "step": 106000, "train_bpb": 0.5402446834069345, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5384076329152505 }, { "epoch": 0.21740275473387585, "grad_norm": 0.1357421875, "learning_rate": 0.0006316897264779656, "loss": 1.7347684860229493, "step": 106020, "train_bpb": 0.6151869426617734, "train_bytes": 27904.575, "train_loss_nats_per_token": 1.7348400816292058 }, { "epoch": 0.21753443417344817, "grad_norm": 0.1376953125, "learning_rate": 0.0006311812703038863, "loss": 1.711555290222168, "step": 106040, "train_bpb": 0.6058534206586828, "train_bytes": 28481.09375, "train_loss_nats_per_token": 1.712440666800259 }, { "epoch": 0.21766611361302046, "grad_norm": 0.1484375, "learning_rate": 0.0006306729643132398, "loss": 1.7205759048461915, "step": 106060, "train_bpb": 0.6086457724682703, "train_bytes": 28269.975, "train_loss_nats_per_token": 1.7211141659192837 }, { "epoch": 0.21779779305259278, "grad_norm": 0.1396484375, "learning_rate": 0.0006301648085938902, "loss": 1.703644371032715, "step": 106080, "train_bpb": 0.6055725420112517, "train_bytes": 28171.00625, "train_loss_nats_per_token": 1.7042983228005564 }, { "epoch": 0.21792947249216507, "grad_norm": 0.1337890625, "learning_rate": 0.0006296568032336777, "loss": 1.7131624221801758, "step": 106100, "train_bpb": 0.6079760804339409, "train_bytes": 28073.16875, "train_loss_nats_per_token": 1.7133186217659988 }, { "epoch": 0.2180611519317374, "grad_norm": 0.1396484375, "learning_rate": 0.0006291489483204161, "loss": 1.7178789138793946, "step": 106120, "train_bpb": 0.6069951088512392, "train_bytes": 28192.23125, "train_loss_nats_per_token": 1.7181292513345352 }, { "epoch": 0.21819283137130968, "grad_norm": 0.125, "learning_rate": 0.000628641243941892, "loss": 1.7275550842285157, "step": 106140, "train_bpb": 0.608776426280242, "train_bytes": 28524.35625, "train_loss_nats_per_token": 1.7272389964155155 }, { "epoch": 0.218324510810882, "grad_norm": 0.1611328125, "learning_rate": 0.0006281336901858672, "loss": 1.7102323532104493, "step": 106160, "train_bpb": 0.6066366002081836, "train_bytes": 28049.24375, "train_loss_nats_per_token": 1.7104696335635023 }, { "epoch": 0.2184561902504543, "grad_norm": 0.142578125, "learning_rate": 0.0006276262871400772, "loss": 1.7197237014770508, "step": 106180, "train_bpb": 0.6079175675017356, "train_bytes": 28063.64375, "train_loss_nats_per_token": 1.7198688085562717 }, { "epoch": 0.2185878696900266, "grad_norm": 0.1318359375, "learning_rate": 0.000627119034892232, "loss": 1.710196304321289, "step": 106200, "train_bpb": 0.6037517366121394, "train_bytes": 28349.80625, "train_loss_nats_per_token": 1.7113305017276688 }, { "epoch": 0.2187195491295989, "grad_norm": 0.1376953125, "learning_rate": 0.0006266119335300136, "loss": 1.7328311920166015, "step": 106220, "train_bpb": 0.6105676536970011, "train_bytes": 28369.48125, "train_loss_nats_per_token": 1.7334890669780711 }, { "epoch": 0.21885122856917122, "grad_norm": 0.1279296875, "learning_rate": 0.00062610498314108, "loss": 1.72625675201416, "step": 106240, "train_bpb": 0.6129195573099393, "train_bytes": 28253.00625, "train_loss_nats_per_token": 1.726891538563 }, { "epoch": 0.2189829080087435, "grad_norm": 0.18359375, "learning_rate": 0.0006255981838130625, "loss": 1.721968650817871, "step": 106260, "train_bpb": 0.6077645010534413, "train_bytes": 28514.6625, "train_loss_nats_per_token": 1.7228378181962571 }, { "epoch": 0.21911458744831583, "grad_norm": 0.1533203125, "learning_rate": 0.0006250915356335653, "loss": 1.7184537887573241, "step": 106280, "train_bpb": 0.6054653154570201, "train_bytes": 28524.275, "train_loss_nats_per_token": 1.718840210632454 }, { "epoch": 0.21924626688788812, "grad_norm": 0.125, "learning_rate": 0.0006245850386901678, "loss": 1.7221229553222657, "step": 106300, "train_bpb": 0.6103876212546021, "train_bytes": 28269.3125, "train_loss_nats_per_token": 1.7225037145203446 }, { "epoch": 0.21937794632746044, "grad_norm": 0.1435546875, "learning_rate": 0.0006240786930704226, "loss": 1.708241081237793, "step": 106320, "train_bpb": 0.604222090445046, "train_bytes": 28377.44375, "train_loss_nats_per_token": 1.7095340660651195 }, { "epoch": 0.21950962576703273, "grad_norm": 0.1142578125, "learning_rate": 0.0006235724988618566, "loss": 1.7204246520996094, "step": 106340, "train_bpb": 0.6093290332871003, "train_bytes": 28130.55625, "train_loss_nats_per_token": 1.7216684673505858 }, { "epoch": 0.21964130520660505, "grad_norm": 0.1640625, "learning_rate": 0.0006230664561519697, "loss": 1.7261377334594727, "step": 106360, "train_bpb": 0.6074104875946648, "train_bytes": 28156.4875, "train_loss_nats_per_token": 1.7260963204621371 }, { "epoch": 0.21977298464617734, "grad_norm": 0.1435546875, "learning_rate": 0.0006225605650282363, "loss": 1.7128728866577148, "step": 106380, "train_bpb": 0.604355954848753, "train_bytes": 28492.69375, "train_loss_nats_per_token": 1.7132347520800588 }, { "epoch": 0.21990466408574966, "grad_norm": 0.193359375, "learning_rate": 0.0006220548255781049, "loss": 1.7114456176757813, "step": 106400, "train_bpb": 0.6055712126459405, "train_bytes": 28166.4625, "train_loss_nats_per_token": 1.71196639651339 }, { "epoch": 0.22003634352532195, "grad_norm": 0.12109375, "learning_rate": 0.0006215492378889964, "loss": 1.7033273696899414, "step": 106420, "train_bpb": 0.6056192543834268, "train_bytes": 28259.0125, "train_loss_nats_per_token": 1.7042124787158712 }, { "epoch": 0.22016802296489427, "grad_norm": 0.15625, "learning_rate": 0.0006210438020483067, "loss": 1.7130559921264648, "step": 106440, "train_bpb": 0.6090153907446476, "train_bytes": 27938.86875, "train_loss_nats_per_token": 1.714159486140583 }, { "epoch": 0.22029970240446656, "grad_norm": 0.134765625, "learning_rate": 0.0006205385181434056, "loss": 1.7182605743408204, "step": 106460, "train_bpb": 0.6097897650513732, "train_bytes": 28477.7125, "train_loss_nats_per_token": 1.7189137550718085 }, { "epoch": 0.22043138184403888, "grad_norm": 0.1923828125, "learning_rate": 0.0006200333862616353, "loss": 1.7306060791015625, "step": 106480, "train_bpb": 0.6099628792540449, "train_bytes": 28501.25625, "train_loss_nats_per_token": 1.7317291547329328 }, { "epoch": 0.22056306128361117, "grad_norm": 0.1748046875, "learning_rate": 0.000619528406490313, "loss": 1.707911491394043, "step": 106500, "train_bpb": 0.6052353329971495, "train_bytes": 28184.65625, "train_loss_nats_per_token": 1.708585714361312 }, { "epoch": 0.22069474072318349, "grad_norm": 0.123046875, "learning_rate": 0.0006190235789167292, "loss": 1.7175241470336915, "step": 106520, "train_bpb": 0.6097032135124539, "train_bytes": 28034.7, "train_loss_nats_per_token": 1.7188059732248262 }, { "epoch": 0.22082642016275578, "grad_norm": 0.1689453125, "learning_rate": 0.0006185189036281485, "loss": 1.7095260620117188, "step": 106540, "train_bpb": 0.6067560206995969, "train_bytes": 28391.86875, "train_loss_nats_per_token": 1.710710638033565 }, { "epoch": 0.2209580996023281, "grad_norm": 0.1171875, "learning_rate": 0.0006180143807118076, "loss": 1.7262996673583983, "step": 106560, "train_bpb": 0.6102336609639822, "train_bytes": 28681.475, "train_loss_nats_per_token": 1.7264419917169043 }, { "epoch": 0.22108977904190039, "grad_norm": 0.1357421875, "learning_rate": 0.0006175100102549188, "loss": 1.7179931640625, "step": 106580, "train_bpb": 0.6088277351096554, "train_bytes": 28170.9375, "train_loss_nats_per_token": 1.7185066845343284 }, { "epoch": 0.2212214584814727, "grad_norm": 0.1708984375, "learning_rate": 0.0006170057923446675, "loss": 1.7212869644165039, "step": 106600, "train_bpb": 0.6067967041741974, "train_bytes": 28217.5875, "train_loss_nats_per_token": 1.7224697566757865 }, { "epoch": 0.221353137921045, "grad_norm": 0.11181640625, "learning_rate": 0.0006165017270682117, "loss": 1.7265918731689454, "step": 106620, "train_bpb": 0.6112220027860229, "train_bytes": 28324.05, "train_loss_nats_per_token": 1.7273336861531026 }, { "epoch": 0.22148481736061731, "grad_norm": 0.1279296875, "learning_rate": 0.0006159978145126842, "loss": 1.7138168334960937, "step": 106640, "train_bpb": 0.6056051158247945, "train_bytes": 28276.7375, "train_loss_nats_per_token": 1.7145229372856476 }, { "epoch": 0.2216164968001896, "grad_norm": 0.125, "learning_rate": 0.0006154940547651907, "loss": 1.7207897186279297, "step": 106660, "train_bpb": 0.6074348516955906, "train_bytes": 28376.0, "train_loss_nats_per_token": 1.7208912113359254 }, { "epoch": 0.22174817623976192, "grad_norm": 0.1884765625, "learning_rate": 0.0006149904479128118, "loss": 1.731637191772461, "step": 106680, "train_bpb": 0.6131447182261865, "train_bytes": 28450.81875, "train_loss_nats_per_token": 1.7316566354479104 }, { "epoch": 0.22187985567933424, "grad_norm": 0.1640625, "learning_rate": 0.0006144869940425992, "loss": 1.7256509780883789, "step": 106700, "train_bpb": 0.6121164208705747, "train_bytes": 28169.3125, "train_loss_nats_per_token": 1.7262456356931302 }, { "epoch": 0.22201153511890653, "grad_norm": 0.11279296875, "learning_rate": 0.0006139836932415805, "loss": 1.718500518798828, "step": 106720, "train_bpb": 0.6064402317399992, "train_bytes": 28555.5875, "train_loss_nats_per_token": 1.7197121280779255 }, { "epoch": 0.22214321455847885, "grad_norm": 0.1220703125, "learning_rate": 0.000613480545596756, "loss": 1.7180770874023437, "step": 106740, "train_bpb": 0.6074739942458086, "train_bytes": 27997.25625, "train_loss_nats_per_token": 1.7189123373941972 }, { "epoch": 0.22227489399805114, "grad_norm": 0.166015625, "learning_rate": 0.0006129775511950988, "loss": 1.71234188079834, "step": 106760, "train_bpb": 0.6041945466364951, "train_bytes": 28504.43125, "train_loss_nats_per_token": 1.7128343203236955 }, { "epoch": 0.22240657343762346, "grad_norm": 0.1513671875, "learning_rate": 0.0006124747101235566, "loss": 1.7257137298583984, "step": 106780, "train_bpb": 0.6075921156423437, "train_bytes": 28485.7625, "train_loss_nats_per_token": 1.7262188986605083 }, { "epoch": 0.22253825287719575, "grad_norm": 0.1259765625, "learning_rate": 0.0006119720224690501, "loss": 1.7173526763916016, "step": 106800, "train_bpb": 0.6124320772139579, "train_bytes": 28212.34375, "train_loss_nats_per_token": 1.7175520180227075 }, { "epoch": 0.22266993231676807, "grad_norm": 0.12109375, "learning_rate": 0.0006114694883184741, "loss": 1.7169116973876952, "step": 106820, "train_bpb": 0.6085430334505443, "train_bytes": 28260.95625, "train_loss_nats_per_token": 1.7179272376606627 }, { "epoch": 0.22280161175634036, "grad_norm": 0.13671875, "learning_rate": 0.0006109671077586953, "loss": 1.7261365890502929, "step": 106840, "train_bpb": 0.6115298997091132, "train_bytes": 28155.5125, "train_loss_nats_per_token": 1.726214997730113 }, { "epoch": 0.22293329119591268, "grad_norm": 0.1396484375, "learning_rate": 0.0006104648808765555, "loss": 1.7346275329589844, "step": 106860, "train_bpb": 0.6118842821029548, "train_bytes": 28357.46875, "train_loss_nats_per_token": 1.7354188514778202 }, { "epoch": 0.22306497063548497, "grad_norm": 0.162109375, "learning_rate": 0.0006099628077588698, "loss": 1.7280017852783203, "step": 106880, "train_bpb": 0.6096177656283989, "train_bytes": 28242.6125, "train_loss_nats_per_token": 1.7288321185618616 }, { "epoch": 0.2231966500750573, "grad_norm": 0.1259765625, "learning_rate": 0.0006094608884924251, "loss": 1.7108613967895507, "step": 106900, "train_bpb": 0.605892091127154, "train_bytes": 28205.7375, "train_loss_nats_per_token": 1.711934015191058 }, { "epoch": 0.22332832951462958, "grad_norm": 0.1201171875, "learning_rate": 0.0006089591231639832, "loss": 1.7271146774291992, "step": 106920, "train_bpb": 0.6101337373549888, "train_bytes": 28421.475, "train_loss_nats_per_token": 1.727165266746005 }, { "epoch": 0.2234600089542019, "grad_norm": 0.1611328125, "learning_rate": 0.0006084575118602797, "loss": 1.7289831161499023, "step": 106940, "train_bpb": 0.6101922042458854, "train_bytes": 28378.63125, "train_loss_nats_per_token": 1.7288601058789903 }, { "epoch": 0.2235916883937742, "grad_norm": 0.134765625, "learning_rate": 0.0006079560546680216, "loss": 1.7106246948242188, "step": 106960, "train_bpb": 0.6035044602010841, "train_bytes": 28382.25, "train_loss_nats_per_token": 1.7111803329856288 }, { "epoch": 0.2237233678333465, "grad_norm": 0.2138671875, "learning_rate": 0.0006074547516738912, "loss": 1.7230567932128906, "step": 106980, "train_bpb": 0.6079578620518418, "train_bytes": 28486.175, "train_loss_nats_per_token": 1.7235444158536908 }, { "epoch": 0.2238550472729188, "grad_norm": 0.1474609375, "learning_rate": 0.0006069536029645431, "loss": 1.7194774627685547, "step": 107000, "train_bpb": 0.6075480830228257, "train_bytes": 28310.7, "train_loss_nats_per_token": 1.719380921402944 }, { "epoch": 0.2238550472729188, "eval_loss": 1.531146764755249, "eval_runtime": 75.127, "eval_samples_per_second": 13.311, "eval_steps_per_second": 13.311, "step": 107000, "train_bpb": 0.540344575315829, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5386920863857438 }, { "epoch": 0.22398672671249112, "grad_norm": 0.154296875, "learning_rate": 0.0006064526086266064, "loss": 1.7129722595214845, "step": 107020, "train_bpb": 0.6060238557524759, "train_bytes": 28135.03125, "train_loss_nats_per_token": 1.7130473064767502 }, { "epoch": 0.2241184061520634, "grad_norm": 0.150390625, "learning_rate": 0.0006059517687466813, "loss": 1.7201192855834961, "step": 107040, "train_bpb": 0.6079625460037821, "train_bytes": 28230.4375, "train_loss_nats_per_token": 1.720604671090603 }, { "epoch": 0.22425008559163573, "grad_norm": 0.123046875, "learning_rate": 0.0006054510834113434, "loss": 1.7103466033935546, "step": 107060, "train_bpb": 0.607794346500623, "train_bytes": 28033.75625, "train_loss_nats_per_token": 1.7112645929477281 }, { "epoch": 0.22438176503120802, "grad_norm": 0.1181640625, "learning_rate": 0.0006049505527071413, "loss": 1.7159767150878906, "step": 107080, "train_bpb": 0.6081059605831196, "train_bytes": 28303.49375, "train_loss_nats_per_token": 1.7171043140756421 }, { "epoch": 0.22451344447078034, "grad_norm": 0.13671875, "learning_rate": 0.0006044501767205951, "loss": 1.7224729537963868, "step": 107100, "train_bpb": 0.6078284181384068, "train_bytes": 28415.66875, "train_loss_nats_per_token": 1.722179429712414 }, { "epoch": 0.22464512391035263, "grad_norm": 0.134765625, "learning_rate": 0.0006039499555382002, "loss": 1.7145904541015624, "step": 107120, "train_bpb": 0.6058403815774877, "train_bytes": 28539.9, "train_loss_nats_per_token": 1.7150094879641484 }, { "epoch": 0.22477680334992495, "grad_norm": 0.2265625, "learning_rate": 0.0006034498892464247, "loss": 1.7223855972290039, "step": 107140, "train_bpb": 0.6056501649054393, "train_bytes": 28475.9875, "train_loss_nats_per_token": 1.7220671699448793 }, { "epoch": 0.22490848278949724, "grad_norm": 0.123046875, "learning_rate": 0.00060294997793171, "loss": 1.7098611831665038, "step": 107160, "train_bpb": 0.6102240863854983, "train_bytes": 28222.2875, "train_loss_nats_per_token": 1.7106841430060542 }, { "epoch": 0.22504016222906956, "grad_norm": 0.12060546875, "learning_rate": 0.0006024502216804694, "loss": 1.7237878799438477, "step": 107180, "train_bpb": 0.6083927388948163, "train_bytes": 28805.725, "train_loss_nats_per_token": 1.7242229680920023 }, { "epoch": 0.22517184166864185, "grad_norm": 0.13671875, "learning_rate": 0.0006019506205790909, "loss": 1.7231651306152345, "step": 107200, "train_bpb": 0.6061589437193531, "train_bytes": 28497.14375, "train_loss_nats_per_token": 1.7224247252806535 }, { "epoch": 0.22530352110821417, "grad_norm": 0.1357421875, "learning_rate": 0.000601451174713936, "loss": 1.7151824951171875, "step": 107220, "train_bpb": 0.6086879165901974, "train_bytes": 28071.70625, "train_loss_nats_per_token": 1.7156390150808274 }, { "epoch": 0.22543520054778646, "grad_norm": 0.12890625, "learning_rate": 0.0006009518841713373, "loss": 1.718593215942383, "step": 107240, "train_bpb": 0.6054656303407289, "train_bytes": 28490.33125, "train_loss_nats_per_token": 1.7194311665231992 }, { "epoch": 0.22556687998735878, "grad_norm": 0.1787109375, "learning_rate": 0.0006004527490376026, "loss": 1.7067354202270508, "step": 107260, "train_bpb": 0.6046234112281871, "train_bytes": 28122.48125, "train_loss_nats_per_token": 1.707150945472496 }, { "epoch": 0.22569855942693107, "grad_norm": 0.130859375, "learning_rate": 0.0005999537693990123, "loss": 1.7171665191650392, "step": 107280, "train_bpb": 0.6060240860803633, "train_bytes": 28418.4375, "train_loss_nats_per_token": 1.7174629953824865 }, { "epoch": 0.22583023886650339, "grad_norm": 0.1552734375, "learning_rate": 0.0005994549453418188, "loss": 1.7168817520141602, "step": 107300, "train_bpb": 0.6030987828244794, "train_bytes": 28653.56875, "train_loss_nats_per_token": 1.717107342553484 }, { "epoch": 0.22596191830607568, "grad_norm": 0.1376953125, "learning_rate": 0.0005989562769522491, "loss": 1.719235610961914, "step": 107320, "train_bpb": 0.6092735278575014, "train_bytes": 28326.21875, "train_loss_nats_per_token": 1.7193217794442646 }, { "epoch": 0.226093597745648, "grad_norm": 0.1591796875, "learning_rate": 0.0005984577643165025, "loss": 1.7027622222900392, "step": 107340, "train_bpb": 0.6050358915370603, "train_bytes": 28639.35, "train_loss_nats_per_token": 1.7031542736191638 }, { "epoch": 0.22622527718522029, "grad_norm": 0.15625, "learning_rate": 0.0005979594075207522, "loss": 1.7075950622558593, "step": 107360, "train_bpb": 0.6088067512904561, "train_bytes": 28142.0625, "train_loss_nats_per_token": 1.708268593345014 }, { "epoch": 0.2263569566247926, "grad_norm": 0.16796875, "learning_rate": 0.0005974612066511427, "loss": 1.718845748901367, "step": 107380, "train_bpb": 0.6085645092050039, "train_bytes": 28370.4, "train_loss_nats_per_token": 1.7197925315061189 }, { "epoch": 0.22648863606436492, "grad_norm": 0.12890625, "learning_rate": 0.0005969631617937934, "loss": 1.7165342330932618, "step": 107400, "train_bpb": 0.6055407316630953, "train_bytes": 28280.25, "train_loss_nats_per_token": 1.7180900000223331 }, { "epoch": 0.22662031550393721, "grad_norm": 0.1455078125, "learning_rate": 0.0005964652730347963, "loss": 1.7166091918945312, "step": 107420, "train_bpb": 0.6129294616458203, "train_bytes": 27741.5375, "train_loss_nats_per_token": 1.7162793412880808 }, { "epoch": 0.22675199494350953, "grad_norm": 0.1396484375, "learning_rate": 0.0005959675404602151, "loss": 1.7068731307983398, "step": 107440, "train_bpb": 0.6038066317490574, "train_bytes": 28234.7625, "train_loss_nats_per_token": 1.7077416626642623 }, { "epoch": 0.22688367438308182, "grad_norm": 0.15625, "learning_rate": 0.0005954699641560881, "loss": 1.7078624725341798, "step": 107460, "train_bpb": 0.6047255800550129, "train_bytes": 28407.15, "train_loss_nats_per_token": 1.708712690142789 }, { "epoch": 0.22701535382265414, "grad_norm": 0.126953125, "learning_rate": 0.0005949725442084262, "loss": 1.7164400100708008, "step": 107480, "train_bpb": 0.6098975208029825, "train_bytes": 28160.68125, "train_loss_nats_per_token": 1.7171730882298255 }, { "epoch": 0.22714703326222643, "grad_norm": 0.1474609375, "learning_rate": 0.0005944752807032132, "loss": 1.7211917877197265, "step": 107500, "train_bpb": 0.6068826875791076, "train_bytes": 28493.9125, "train_loss_nats_per_token": 1.7224134563381002 }, { "epoch": 0.22727871270179875, "grad_norm": 0.1396484375, "learning_rate": 0.000593978173726405, "loss": 1.7207727432250977, "step": 107520, "train_bpb": 0.6116564977814066, "train_bytes": 28068.675, "train_loss_nats_per_token": 1.7208085632866184 }, { "epoch": 0.22741039214137104, "grad_norm": 0.150390625, "learning_rate": 0.0005934812233639316, "loss": 1.7179883956909179, "step": 107540, "train_bpb": 0.6059928906042447, "train_bytes": 28369.49375, "train_loss_nats_per_token": 1.7181989661148813 }, { "epoch": 0.22754207158094336, "grad_norm": 0.1904296875, "learning_rate": 0.0005929844297016962, "loss": 1.713050079345703, "step": 107560, "train_bpb": 0.6085750697151927, "train_bytes": 28198.675, "train_loss_nats_per_token": 1.7139536470411103 }, { "epoch": 0.22767375102051565, "grad_norm": 0.1337890625, "learning_rate": 0.0005924877928255729, "loss": 1.7252456665039062, "step": 107580, "train_bpb": 0.6072617898368788, "train_bytes": 28725.73125, "train_loss_nats_per_token": 1.7260860088075647 }, { "epoch": 0.22780543046008797, "grad_norm": 0.1513671875, "learning_rate": 0.0005919913128214107, "loss": 1.7135778427124024, "step": 107600, "train_bpb": 0.6070662453091336, "train_bytes": 28506.575, "train_loss_nats_per_token": 1.7137861656949074 }, { "epoch": 0.22793710989966026, "grad_norm": 0.1298828125, "learning_rate": 0.0005914949897750314, "loss": 1.7124414443969727, "step": 107620, "train_bpb": 0.6038411765846315, "train_bytes": 28388.325, "train_loss_nats_per_token": 1.7118292193383782 }, { "epoch": 0.22806878933923258, "grad_norm": 0.169921875, "learning_rate": 0.0005909988237722279, "loss": 1.7223165512084961, "step": 107640, "train_bpb": 0.6090400390603576, "train_bytes": 28237.9375, "train_loss_nats_per_token": 1.7224631533944927 }, { "epoch": 0.22820046877880487, "grad_norm": 0.138671875, "learning_rate": 0.0005905028148987676, "loss": 1.7325305938720703, "step": 107660, "train_bpb": 0.6159602584590637, "train_bytes": 28116.41875, "train_loss_nats_per_token": 1.7326275008592351 }, { "epoch": 0.2283321482183772, "grad_norm": 0.1689453125, "learning_rate": 0.0005900069632403906, "loss": 1.7155315399169921, "step": 107680, "train_bpb": 0.6079603679558379, "train_bytes": 28196.85, "train_loss_nats_per_token": 1.7164955148356025 }, { "epoch": 0.22846382765794948, "grad_norm": 0.1513671875, "learning_rate": 0.0005895112688828096, "loss": 1.7189224243164063, "step": 107700, "train_bpb": 0.6089833534259643, "train_bytes": 28080.7375, "train_loss_nats_per_token": 1.7195974088639538 }, { "epoch": 0.2285955070975218, "grad_norm": 0.1513671875, "learning_rate": 0.0005890157319117091, "loss": 1.7288179397583008, "step": 107720, "train_bpb": 0.6095050895906096, "train_bytes": 28456.875, "train_loss_nats_per_token": 1.7299584137519874 }, { "epoch": 0.2287271865370941, "grad_norm": 0.16015625, "learning_rate": 0.0005885203524127479, "loss": 1.711867904663086, "step": 107740, "train_bpb": 0.6066732688103676, "train_bytes": 28125.6125, "train_loss_nats_per_token": 1.7128487683690088 }, { "epoch": 0.2288588659766664, "grad_norm": 0.1474609375, "learning_rate": 0.0005880251304715574, "loss": 1.7254388809204102, "step": 107760, "train_bpb": 0.6082794181148593, "train_bytes": 28500.125, "train_loss_nats_per_token": 1.7261431501856435 }, { "epoch": 0.2289905454162387, "grad_norm": 0.1220703125, "learning_rate": 0.0005875300661737405, "loss": 1.719898796081543, "step": 107780, "train_bpb": 0.6074391365873276, "train_bytes": 28291.7125, "train_loss_nats_per_token": 1.7206135288586537 }, { "epoch": 0.22912222485581102, "grad_norm": 0.130859375, "learning_rate": 0.0005870351596048737, "loss": 1.7326292037963866, "step": 107800, "train_bpb": 0.609294305866522, "train_bytes": 28665.35625, "train_loss_nats_per_token": 1.734155385762589 }, { "epoch": 0.2292539042953833, "grad_norm": 0.185546875, "learning_rate": 0.0005865404108505067, "loss": 1.7211341857910156, "step": 107820, "train_bpb": 0.6075700369599729, "train_bytes": 28279.06875, "train_loss_nats_per_token": 1.7225057417247807 }, { "epoch": 0.22938558373495563, "grad_norm": 0.1279296875, "learning_rate": 0.000586045819996162, "loss": 1.715780258178711, "step": 107840, "train_bpb": 0.6087886054437333, "train_bytes": 28068.975, "train_loss_nats_per_token": 1.7159593781733486 }, { "epoch": 0.22951726317452792, "grad_norm": 0.123046875, "learning_rate": 0.0005855513871273329, "loss": 1.7156642913818358, "step": 107860, "train_bpb": 0.6071478446958256, "train_bytes": 28289.21875, "train_loss_nats_per_token": 1.7157428582221166 }, { "epoch": 0.22964894261410024, "grad_norm": 0.1884765625, "learning_rate": 0.0005850571123294876, "loss": 1.7107980728149415, "step": 107880, "train_bpb": 0.603932756369833, "train_bytes": 28597.7375, "train_loss_nats_per_token": 1.7111992342235725 }, { "epoch": 0.22978062205367253, "grad_norm": 0.138671875, "learning_rate": 0.0005845629956880661, "loss": 1.7211137771606446, "step": 107900, "train_bpb": 0.6100204717062945, "train_bytes": 28319.625, "train_loss_nats_per_token": 1.7222758318814695 }, { "epoch": 0.22991230149324485, "grad_norm": 0.14453125, "learning_rate": 0.0005840690372884806, "loss": 1.7104034423828125, "step": 107920, "train_bpb": 0.6041417167822587, "train_bytes": 28395.6875, "train_loss_nats_per_token": 1.7105670404424986 }, { "epoch": 0.23004398093281714, "grad_norm": 0.232421875, "learning_rate": 0.0005835752372161166, "loss": 1.7140724182128906, "step": 107940, "train_bpb": 0.610530208757801, "train_bytes": 28021.5125, "train_loss_nats_per_token": 1.7146360658885633 }, { "epoch": 0.23017566037238946, "grad_norm": 0.150390625, "learning_rate": 0.0005830815955563322, "loss": 1.7130626678466796, "step": 107960, "train_bpb": 0.6074073854426076, "train_bytes": 28261.65625, "train_loss_nats_per_token": 1.7134673645299414 }, { "epoch": 0.23030733981196175, "grad_norm": 0.1845703125, "learning_rate": 0.0005825881123944585, "loss": 1.7238788604736328, "step": 107980, "train_bpb": 0.6113896450891583, "train_bytes": 28229.05625, "train_loss_nats_per_token": 1.7243691786153388 }, { "epoch": 0.23043901925153407, "grad_norm": 0.140625, "learning_rate": 0.0005820947878157974, "loss": 1.7218250274658202, "step": 108000, "train_bpb": 0.6058042966263257, "train_bytes": 28561.51875, "train_loss_nats_per_token": 1.7226107551756518 }, { "epoch": 0.23043901925153407, "eval_loss": 1.5308159589767456, "eval_runtime": 71.7721, "eval_samples_per_second": 13.933, "eval_steps_per_second": 13.933, "step": 108000, "train_bpb": 0.5402142248871843, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5383208988469441 }, { "epoch": 0.23057069869110636, "grad_norm": 0.1298828125, "learning_rate": 0.0005816016219056256, "loss": 1.7173263549804687, "step": 108020, "train_bpb": 0.6072077613773211, "train_bytes": 28415.55, "train_loss_nats_per_token": 1.7184839594495505 }, { "epoch": 0.23070237813067868, "grad_norm": 0.1279296875, "learning_rate": 0.0005811086147491916, "loss": 1.7182907104492187, "step": 108040, "train_bpb": 0.6095841830846398, "train_bytes": 28399.3, "train_loss_nats_per_token": 1.7184864957330104 }, { "epoch": 0.230834057570251, "grad_norm": 0.1416015625, "learning_rate": 0.0005806157664317155, "loss": 1.7292242050170898, "step": 108060, "train_bpb": 0.6057822205502007, "train_bytes": 28847.48125, "train_loss_nats_per_token": 1.7290781423205301 }, { "epoch": 0.23096573700982329, "grad_norm": 0.12353515625, "learning_rate": 0.0005801230770383912, "loss": 1.7089189529418944, "step": 108080, "train_bpb": 0.6059709434681935, "train_bytes": 28132.2625, "train_loss_nats_per_token": 1.7101140981752456 }, { "epoch": 0.2310974164493956, "grad_norm": 0.1484375, "learning_rate": 0.0005796305466543848, "loss": 1.7077478408813476, "step": 108100, "train_bpb": 0.6094238820947753, "train_bytes": 27791.7125, "train_loss_nats_per_token": 1.70845658809599 }, { "epoch": 0.2312290958889679, "grad_norm": 0.1455078125, "learning_rate": 0.0005791381753648342, "loss": 1.7094461441040039, "step": 108120, "train_bpb": 0.6017607942084623, "train_bytes": 28659.475, "train_loss_nats_per_token": 1.7103334594832227 }, { "epoch": 0.2313607753285402, "grad_norm": 0.19921875, "learning_rate": 0.0005786459632548508, "loss": 1.7104011535644532, "step": 108140, "train_bpb": 0.6091945700452628, "train_bytes": 27961.00625, "train_loss_nats_per_token": 1.710765153996331 }, { "epoch": 0.2314924547681125, "grad_norm": 0.1640625, "learning_rate": 0.0005781539104095179, "loss": 1.7173738479614258, "step": 108160, "train_bpb": 0.6101465068036765, "train_bytes": 28397.51875, "train_loss_nats_per_token": 1.7182398183832976 }, { "epoch": 0.23162413420768482, "grad_norm": 0.12890625, "learning_rate": 0.0005776620169138921, "loss": 1.7154508590698243, "step": 108180, "train_bpb": 0.6065248901910016, "train_bytes": 28079.03125, "train_loss_nats_per_token": 1.7157560570647878 }, { "epoch": 0.23175581364725711, "grad_norm": 0.11962890625, "learning_rate": 0.0005771702828530009, "loss": 1.7011613845825195, "step": 108200, "train_bpb": 0.60558275143236, "train_bytes": 28214.59375, "train_loss_nats_per_token": 1.7018957106798343 }, { "epoch": 0.23188749308682943, "grad_norm": 0.12255859375, "learning_rate": 0.0005766787083118452, "loss": 1.7159107208251954, "step": 108220, "train_bpb": 0.6046435532523695, "train_bytes": 28513.9875, "train_loss_nats_per_token": 1.715926755845011 }, { "epoch": 0.23201917252640172, "grad_norm": 0.1845703125, "learning_rate": 0.0005761872933753992, "loss": 1.7060308456420898, "step": 108240, "train_bpb": 0.6067610908793791, "train_bytes": 28148.78125, "train_loss_nats_per_token": 1.70593498295387 }, { "epoch": 0.23215085196597404, "grad_norm": 0.1376953125, "learning_rate": 0.0005756960381286073, "loss": 1.7148975372314452, "step": 108260, "train_bpb": 0.6051350457845498, "train_bytes": 28440.1875, "train_loss_nats_per_token": 1.7154508034797862 }, { "epoch": 0.23228253140554633, "grad_norm": 0.126953125, "learning_rate": 0.0005752049426563879, "loss": 1.705033302307129, "step": 108280, "train_bpb": 0.6026312502221415, "train_bytes": 28162.95, "train_loss_nats_per_token": 1.705495424861854 }, { "epoch": 0.23241421084511865, "grad_norm": 0.142578125, "learning_rate": 0.0005747140070436324, "loss": 1.7145246505737304, "step": 108300, "train_bpb": 0.6052001290212886, "train_bytes": 28357.10625, "train_loss_nats_per_token": 1.7155266033971246 }, { "epoch": 0.23254589028469094, "grad_norm": 0.15625, "learning_rate": 0.0005742232313752023, "loss": 1.7111528396606446, "step": 108320, "train_bpb": 0.6059250454150029, "train_bytes": 28243.51875, "train_loss_nats_per_token": 1.7111210303339806 }, { "epoch": 0.23267756972426326, "grad_norm": 0.13671875, "learning_rate": 0.0005737326157359334, "loss": 1.7131898880004883, "step": 108340, "train_bpb": 0.6068219245859537, "train_bytes": 28137.51875, "train_loss_nats_per_token": 1.714327360564871 }, { "epoch": 0.23280924916383555, "grad_norm": 0.1494140625, "learning_rate": 0.000573242160210633, "loss": 1.72103271484375, "step": 108360, "train_bpb": 0.6122234404633434, "train_bytes": 28024.75625, "train_loss_nats_per_token": 1.7217080444223718 }, { "epoch": 0.23294092860340787, "grad_norm": 0.1318359375, "learning_rate": 0.0005727518648840816, "loss": 1.7125701904296875, "step": 108380, "train_bpb": 0.6076829190864393, "train_bytes": 28171.8125, "train_loss_nats_per_token": 1.7128139212548084 }, { "epoch": 0.23307260804298016, "grad_norm": 0.15234375, "learning_rate": 0.0005722617298410301, "loss": 1.7110614776611328, "step": 108400, "train_bpb": 0.6054458713536132, "train_bytes": 28343.56875, "train_loss_nats_per_token": 1.711741109382912 }, { "epoch": 0.23320428748255248, "grad_norm": 0.1494140625, "learning_rate": 0.0005717717551662037, "loss": 1.7074930191040039, "step": 108420, "train_bpb": 0.6061113365174405, "train_bytes": 28114.65, "train_loss_nats_per_token": 1.7088628661858374 }, { "epoch": 0.23333596692212477, "grad_norm": 0.138671875, "learning_rate": 0.0005712819409442996, "loss": 1.7253852844238282, "step": 108440, "train_bpb": 0.6109757383584711, "train_bytes": 28330.4125, "train_loss_nats_per_token": 1.7256749065693529 }, { "epoch": 0.2334676463616971, "grad_norm": 0.13671875, "learning_rate": 0.0005707922872599854, "loss": 1.7128511428833009, "step": 108460, "train_bpb": 0.6052645900664183, "train_bytes": 28469.88125, "train_loss_nats_per_token": 1.7133040239590551 }, { "epoch": 0.23359932580126938, "grad_norm": 0.134765625, "learning_rate": 0.0005703027941979033, "loss": 1.7154953002929687, "step": 108480, "train_bpb": 0.6051578801589896, "train_bytes": 28356.075, "train_loss_nats_per_token": 1.7165667625244325 }, { "epoch": 0.2337310052408417, "grad_norm": 0.115234375, "learning_rate": 0.0005698134618426663, "loss": 1.709852409362793, "step": 108500, "train_bpb": 0.605264649403771, "train_bytes": 28336.70625, "train_loss_nats_per_token": 1.7103513954848835 }, { "epoch": 0.233862684680414, "grad_norm": 0.11669921875, "learning_rate": 0.0005693242902788609, "loss": 1.7178932189941407, "step": 108520, "train_bpb": 0.6081595082688723, "train_bytes": 28324.0375, "train_loss_nats_per_token": 1.7183983963193308 }, { "epoch": 0.2339943641199863, "grad_norm": 0.189453125, "learning_rate": 0.0005688352795910439, "loss": 1.7187591552734376, "step": 108540, "train_bpb": 0.6083165034968333, "train_bytes": 28097.70625, "train_loss_nats_per_token": 1.7193900251531884 }, { "epoch": 0.2341260435595586, "grad_norm": 0.12060546875, "learning_rate": 0.0005683464298637458, "loss": 1.7163597106933595, "step": 108560, "train_bpb": 0.6125618401940811, "train_bytes": 28065.19375, "train_loss_nats_per_token": 1.7171484128383314 }, { "epoch": 0.23425772299913092, "grad_norm": 0.1220703125, "learning_rate": 0.0005678577411814691, "loss": 1.713827896118164, "step": 108580, "train_bpb": 0.6082228544941611, "train_bytes": 28177.45, "train_loss_nats_per_token": 1.714507154125086 }, { "epoch": 0.2343894024387032, "grad_norm": 0.1552734375, "learning_rate": 0.0005673692136286877, "loss": 1.7264226913452148, "step": 108600, "train_bpb": 0.6038096250535533, "train_bytes": 28816.6125, "train_loss_nats_per_token": 1.7272234833670739 }, { "epoch": 0.23452108187827553, "grad_norm": 0.15625, "learning_rate": 0.0005668808472898484, "loss": 1.713286781311035, "step": 108620, "train_bpb": 0.6090534227946098, "train_bytes": 28168.625, "train_loss_nats_per_token": 1.7143220498331737 }, { "epoch": 0.23465276131784782, "grad_norm": 0.1328125, "learning_rate": 0.0005663926422493703, "loss": 1.7214759826660155, "step": 108640, "train_bpb": 0.608533088372957, "train_bytes": 28047.74375, "train_loss_nats_per_token": 1.7230734492056647 }, { "epoch": 0.23478444075742014, "grad_norm": 0.154296875, "learning_rate": 0.0005659045985916433, "loss": 1.709956169128418, "step": 108660, "train_bpb": 0.607498283230322, "train_bytes": 28188.3875, "train_loss_nats_per_token": 1.7103107316241728 }, { "epoch": 0.23491612019699243, "grad_norm": 0.2080078125, "learning_rate": 0.0005654167164010307, "loss": 1.717238998413086, "step": 108680, "train_bpb": 0.6066118507865654, "train_bytes": 28281.18125, "train_loss_nats_per_token": 1.7181532972496496 }, { "epoch": 0.23504779963656475, "grad_norm": 0.140625, "learning_rate": 0.0005649289957618678, "loss": 1.7175399780273437, "step": 108700, "train_bpb": 0.607216629541048, "train_bytes": 28186.73125, "train_loss_nats_per_token": 1.7178237851986786 }, { "epoch": 0.23517947907613707, "grad_norm": 0.1484375, "learning_rate": 0.0005644414367584618, "loss": 1.7257413864135742, "step": 108720, "train_bpb": 0.6090097547058116, "train_bytes": 28323.2875, "train_loss_nats_per_token": 1.7264998212179314 }, { "epoch": 0.23531115851570936, "grad_norm": 0.169921875, "learning_rate": 0.0005639540394750911, "loss": 1.7251644134521484, "step": 108740, "train_bpb": 0.6076879210028496, "train_bytes": 28545.9375, "train_loss_nats_per_token": 1.7255031062477242 }, { "epoch": 0.23544283795528168, "grad_norm": 0.12109375, "learning_rate": 0.0005634668039960071, "loss": 1.7279243469238281, "step": 108760, "train_bpb": 0.6112872053472159, "train_bytes": 28490.05625, "train_loss_nats_per_token": 1.7289803621162514 }, { "epoch": 0.23557451739485397, "grad_norm": 0.1767578125, "learning_rate": 0.0005629797304054339, "loss": 1.722403335571289, "step": 108780, "train_bpb": 0.60815141567272, "train_bytes": 28315.825, "train_loss_nats_per_token": 1.7226995978687742 }, { "epoch": 0.23570619683442628, "grad_norm": 0.1259765625, "learning_rate": 0.0005624928187875654, "loss": 1.7309446334838867, "step": 108800, "train_bpb": 0.6121280061689626, "train_bytes": 28302.375, "train_loss_nats_per_token": 1.7308733639353655 }, { "epoch": 0.23583787627399858, "grad_norm": 0.1328125, "learning_rate": 0.0005620060692265692, "loss": 1.7324323654174805, "step": 108820, "train_bpb": 0.607170844267972, "train_bytes": 28826.84375, "train_loss_nats_per_token": 1.7323938153886993 }, { "epoch": 0.2359695557135709, "grad_norm": 0.1357421875, "learning_rate": 0.0005615194818065852, "loss": 1.7320568084716796, "step": 108840, "train_bpb": 0.6129035802732662, "train_bytes": 28347.36875, "train_loss_nats_per_token": 1.732466043058138 }, { "epoch": 0.23610123515314319, "grad_norm": 0.1416015625, "learning_rate": 0.0005610330566117237, "loss": 1.7351024627685547, "step": 108860, "train_bpb": 0.6153305061955024, "train_bytes": 28162.19375, "train_loss_nats_per_token": 1.7364528430350818 }, { "epoch": 0.2362329145927155, "grad_norm": 0.154296875, "learning_rate": 0.0005605467937260684, "loss": 1.7100460052490234, "step": 108880, "train_bpb": 0.605591040179151, "train_bytes": 28022.5875, "train_loss_nats_per_token": 1.710724327413153 }, { "epoch": 0.2363645940322878, "grad_norm": 0.1552734375, "learning_rate": 0.0005600606932336739, "loss": 1.7270521163940429, "step": 108900, "train_bpb": 0.6093298895231944, "train_bytes": 28425.4625, "train_loss_nats_per_token": 1.7270193126118214 }, { "epoch": 0.2364962734718601, "grad_norm": 0.1513671875, "learning_rate": 0.0005595747552185682, "loss": 1.729203224182129, "step": 108920, "train_bpb": 0.6117371685307816, "train_bytes": 28133.58125, "train_loss_nats_per_token": 1.7297896691066685 }, { "epoch": 0.2366279529114324, "grad_norm": 0.1318359375, "learning_rate": 0.000559088979764749, "loss": 1.7223403930664063, "step": 108940, "train_bpb": 0.6073718522980915, "train_bytes": 28357.2125, "train_loss_nats_per_token": 1.722771425179999 }, { "epoch": 0.23675963235100472, "grad_norm": 0.1640625, "learning_rate": 0.0005586033669561876, "loss": 1.7291631698608398, "step": 108960, "train_bpb": 0.6120785469775205, "train_bytes": 28626.8375, "train_loss_nats_per_token": 1.7296118241443563 }, { "epoch": 0.236891311790577, "grad_norm": 0.13671875, "learning_rate": 0.0005581179168768275, "loss": 1.7303485870361328, "step": 108980, "train_bpb": 0.6174768851376106, "train_bytes": 27836.525, "train_loss_nats_per_token": 1.7313244598539426 }, { "epoch": 0.23702299123014933, "grad_norm": 0.142578125, "learning_rate": 0.0005576326296105818, "loss": 1.7170703887939454, "step": 109000, "train_bpb": 0.6083259711237545, "train_bytes": 28022.09375, "train_loss_nats_per_token": 1.717846854498328 }, { "epoch": 0.23702299123014933, "eval_loss": 1.5313774347305298, "eval_runtime": 72.5584, "eval_samples_per_second": 13.782, "eval_steps_per_second": 13.782, "step": 109000, "train_bpb": 0.5404262383322985, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5389246310302742 }, { "epoch": 0.23715467066972162, "grad_norm": 0.1875, "learning_rate": 0.0005571475052413378, "loss": 1.7128055572509766, "step": 109020, "train_bpb": 0.6105407389480004, "train_bytes": 28062.1, "train_loss_nats_per_token": 1.7140311292358776 }, { "epoch": 0.23728635010929394, "grad_norm": 0.1328125, "learning_rate": 0.0005566625438529536, "loss": 1.725593376159668, "step": 109040, "train_bpb": 0.6111737781415142, "train_bytes": 28273.725, "train_loss_nats_per_token": 1.7260245922257986 }, { "epoch": 0.23741802954886623, "grad_norm": 0.16015625, "learning_rate": 0.00055617774552926, "loss": 1.7176311492919922, "step": 109060, "train_bpb": 0.6078887249883094, "train_bytes": 28104.31875, "train_loss_nats_per_token": 1.7175259236701523 }, { "epoch": 0.23754970898843855, "grad_norm": 0.14453125, "learning_rate": 0.0005556931103540577, "loss": 1.7079097747802734, "step": 109080, "train_bpb": 0.6050685075253177, "train_bytes": 28192.36875, "train_loss_nats_per_token": 1.7081533056119687 }, { "epoch": 0.23768138842801084, "grad_norm": 0.1435546875, "learning_rate": 0.000555208638411121, "loss": 1.7133865356445312, "step": 109100, "train_bpb": 0.6076207278439555, "train_bytes": 28116.93125, "train_loss_nats_per_token": 1.7133457369539553 }, { "epoch": 0.23781306786758316, "grad_norm": 0.1376953125, "learning_rate": 0.000554724329784196, "loss": 1.7165584564208984, "step": 109120, "train_bpb": 0.6054530517088031, "train_bytes": 28719.84375, "train_loss_nats_per_token": 1.716677230204716 }, { "epoch": 0.23794474730715545, "grad_norm": 0.1298828125, "learning_rate": 0.0005542401845569989, "loss": 1.7200868606567383, "step": 109140, "train_bpb": 0.6095539795728666, "train_bytes": 28069.48125, "train_loss_nats_per_token": 1.7212585062384516 }, { "epoch": 0.23807642674672777, "grad_norm": 0.12158203125, "learning_rate": 0.000553756202813219, "loss": 1.7180652618408203, "step": 109160, "train_bpb": 0.6073368326212663, "train_bytes": 28485.4875, "train_loss_nats_per_token": 1.7186115470077226 }, { "epoch": 0.23820810618630006, "grad_norm": 0.126953125, "learning_rate": 0.0005532723846365181, "loss": 1.7237993240356446, "step": 109180, "train_bpb": 0.6095170493862317, "train_bytes": 28358.70625, "train_loss_nats_per_token": 1.7235298750872112 }, { "epoch": 0.23833978562587238, "grad_norm": 0.1337890625, "learning_rate": 0.0005527887301105271, "loss": 1.7325426101684571, "step": 109200, "train_bpb": 0.6095913572981506, "train_bytes": 28609.125, "train_loss_nats_per_token": 1.733894820651007 }, { "epoch": 0.23847146506544467, "grad_norm": 0.1533203125, "learning_rate": 0.0005523052393188509, "loss": 1.716433334350586, "step": 109220, "train_bpb": 0.6084774624656242, "train_bytes": 28227.85625, "train_loss_nats_per_token": 1.7169055429222229 }, { "epoch": 0.238603144505017, "grad_norm": 0.1650390625, "learning_rate": 0.0005518219123450656, "loss": 1.7214109420776367, "step": 109240, "train_bpb": 0.6064499681138903, "train_bytes": 28254.575, "train_loss_nats_per_token": 1.7221689475674973 }, { "epoch": 0.23873482394458928, "grad_norm": 0.1220703125, "learning_rate": 0.0005513387492727191, "loss": 1.7091569900512695, "step": 109260, "train_bpb": 0.6083731421558803, "train_bytes": 28143.05, "train_loss_nats_per_token": 1.709988170257561 }, { "epoch": 0.2388665033841616, "grad_norm": 0.1630859375, "learning_rate": 0.0005508557501853298, "loss": 1.7224344253540038, "step": 109280, "train_bpb": 0.6073568128284016, "train_bytes": 28252.9625, "train_loss_nats_per_token": 1.723608554016573 }, { "epoch": 0.2389981828237339, "grad_norm": 0.1376953125, "learning_rate": 0.0005503729151663889, "loss": 1.7244766235351563, "step": 109300, "train_bpb": 0.6087336109725513, "train_bytes": 28553.04375, "train_loss_nats_per_token": 1.7258655384190535 }, { "epoch": 0.2391298622633062, "grad_norm": 0.119140625, "learning_rate": 0.0005498902442993595, "loss": 1.7285398483276366, "step": 109320, "train_bpb": 0.6079736485916568, "train_bytes": 28590.6625, "train_loss_nats_per_token": 1.729560545184019 }, { "epoch": 0.2392615417028785, "grad_norm": 0.115234375, "learning_rate": 0.0005494077376676749, "loss": 1.7117595672607422, "step": 109340, "train_bpb": 0.6073705021374244, "train_bytes": 28244.93125, "train_loss_nats_per_token": 1.7119734069172472 }, { "epoch": 0.23939322114245082, "grad_norm": 0.1669921875, "learning_rate": 0.0005489253953547413, "loss": 1.7290210723876953, "step": 109360, "train_bpb": 0.6121000878594647, "train_bytes": 28393.34375, "train_loss_nats_per_token": 1.7291499581874212 }, { "epoch": 0.2395249005820231, "grad_norm": 0.1513671875, "learning_rate": 0.0005484432174439359, "loss": 1.7199954986572266, "step": 109380, "train_bpb": 0.6070791057127853, "train_bytes": 28465.89375, "train_loss_nats_per_token": 1.72130759711535 }, { "epoch": 0.23965658002159543, "grad_norm": 0.12890625, "learning_rate": 0.0005479612040186085, "loss": 1.7253049850463866, "step": 109400, "train_bpb": 0.6113526255610107, "train_bytes": 28183.29375, "train_loss_nats_per_token": 1.7256483430864382 }, { "epoch": 0.23978825946116775, "grad_norm": 0.138671875, "learning_rate": 0.0005474793551620783, "loss": 1.7236288070678711, "step": 109420, "train_bpb": 0.6068547870305595, "train_bytes": 28283.65, "train_loss_nats_per_token": 1.7244355311420279 }, { "epoch": 0.23991993890074004, "grad_norm": 0.1484375, "learning_rate": 0.0005469976709576381, "loss": 1.7152029037475587, "step": 109440, "train_bpb": 0.6060642581440288, "train_bytes": 28111.8125, "train_loss_nats_per_token": 1.715060186846877 }, { "epoch": 0.24005161834031236, "grad_norm": 0.1337890625, "learning_rate": 0.0005465161514885519, "loss": 1.719838523864746, "step": 109460, "train_bpb": 0.6091773772910223, "train_bytes": 28242.89375, "train_loss_nats_per_token": 1.7210029437373333 }, { "epoch": 0.24018329777988465, "grad_norm": 0.1279296875, "learning_rate": 0.0005460347968380538, "loss": 1.71539363861084, "step": 109480, "train_bpb": 0.6059653364983935, "train_bytes": 28412.4875, "train_loss_nats_per_token": 1.7163443123971907 }, { "epoch": 0.24031497721945697, "grad_norm": 0.1435546875, "learning_rate": 0.000545553607089351, "loss": 1.7126758575439454, "step": 109500, "train_bpb": 0.6022333280013685, "train_bytes": 28340.325, "train_loss_nats_per_token": 1.7132315356369232 }, { "epoch": 0.24044665665902926, "grad_norm": 0.1923828125, "learning_rate": 0.0005450725823256223, "loss": 1.7121431350708007, "step": 109520, "train_bpb": 0.6050907627769729, "train_bytes": 28231.26875, "train_loss_nats_per_token": 1.7116209508190472 }, { "epoch": 0.24057833609860158, "grad_norm": 0.1376953125, "learning_rate": 0.0005445917226300159, "loss": 1.716716194152832, "step": 109540, "train_bpb": 0.6079718244511343, "train_bytes": 28139.86875, "train_loss_nats_per_token": 1.7167060661280713 }, { "epoch": 0.24071001553817387, "grad_norm": 0.1328125, "learning_rate": 0.0005441110280856539, "loss": 1.7298473358154296, "step": 109560, "train_bpb": 0.608670266303459, "train_bytes": 28571.69375, "train_loss_nats_per_token": 1.7305394170576287 }, { "epoch": 0.24084169497774618, "grad_norm": 0.15625, "learning_rate": 0.0005436304987756286, "loss": 1.7012443542480469, "step": 109580, "train_bpb": 0.6041231063880577, "train_bytes": 27878.7, "train_loss_nats_per_token": 1.7017747691710405 }, { "epoch": 0.24097337441731848, "grad_norm": 0.1884765625, "learning_rate": 0.0005431501347830044, "loss": 1.729555320739746, "step": 109600, "train_bpb": 0.6134653519441224, "train_bytes": 27880.60625, "train_loss_nats_per_token": 1.7296765626909203 }, { "epoch": 0.2411050538568908, "grad_norm": 0.11669921875, "learning_rate": 0.0005426699361908157, "loss": 1.7238964080810546, "step": 109620, "train_bpb": 0.6092220760773847, "train_bytes": 28178.7625, "train_loss_nats_per_token": 1.7240647040497041 }, { "epoch": 0.24123673329646309, "grad_norm": 0.1279296875, "learning_rate": 0.00054218990308207, "loss": 1.7256725311279297, "step": 109640, "train_bpb": 0.6136817649520175, "train_bytes": 27857.56875, "train_loss_nats_per_token": 1.7260397357414685 }, { "epoch": 0.2413684127360354, "grad_norm": 0.140625, "learning_rate": 0.000541710035539746, "loss": 1.712358283996582, "step": 109660, "train_bpb": 0.6052372982872503, "train_bytes": 28186.8125, "train_loss_nats_per_token": 1.7123515903022144 }, { "epoch": 0.2415000921756077, "grad_norm": 0.150390625, "learning_rate": 0.0005412303336467921, "loss": 1.7171276092529297, "step": 109680, "train_bpb": 0.6066501353607419, "train_bytes": 28162.325, "train_loss_nats_per_token": 1.7172558839802399 }, { "epoch": 0.24163177161518, "grad_norm": 0.1611328125, "learning_rate": 0.0005407507974861299, "loss": 1.7205854415893556, "step": 109700, "train_bpb": 0.6062772031990313, "train_bytes": 28462.5875, "train_loss_nats_per_token": 1.7215137157450378 }, { "epoch": 0.2417634510547523, "grad_norm": 0.154296875, "learning_rate": 0.0005402714271406521, "loss": 1.7230989456176757, "step": 109720, "train_bpb": 0.6084869047519769, "train_bytes": 28431.7125, "train_loss_nats_per_token": 1.7235944387656332 }, { "epoch": 0.24189513049432462, "grad_norm": 0.23046875, "learning_rate": 0.0005397922226932214, "loss": 1.737328338623047, "step": 109740, "train_bpb": 0.612565096918293, "train_bytes": 28207.36875, "train_loss_nats_per_token": 1.737290917735993 }, { "epoch": 0.2420268099338969, "grad_norm": 0.171875, "learning_rate": 0.0005393131842266731, "loss": 1.716399574279785, "step": 109760, "train_bpb": 0.6071459700176074, "train_bytes": 28592.6, "train_loss_nats_per_token": 1.716697227133653 }, { "epoch": 0.24215848937346923, "grad_norm": 0.12255859375, "learning_rate": 0.0005388343118238138, "loss": 1.7300724029541015, "step": 109780, "train_bpb": 0.6115139981472779, "train_bytes": 28444.80625, "train_loss_nats_per_token": 1.7305803196722498 }, { "epoch": 0.24229016881304152, "grad_norm": 0.1396484375, "learning_rate": 0.0005383556055674214, "loss": 1.723931884765625, "step": 109800, "train_bpb": 0.6150461742296308, "train_bytes": 27780.025, "train_loss_nats_per_token": 1.725591422752 }, { "epoch": 0.24242184825261384, "grad_norm": 0.1982421875, "learning_rate": 0.0005378770655402438, "loss": 1.7160707473754884, "step": 109820, "train_bpb": 0.6056610568983268, "train_bytes": 28198.2875, "train_loss_nats_per_token": 1.7174018621602514 }, { "epoch": 0.24255352769218613, "grad_norm": 0.224609375, "learning_rate": 0.0005373986918250015, "loss": 1.7079870223999023, "step": 109840, "train_bpb": 0.6065989323429885, "train_bytes": 28277.1375, "train_loss_nats_per_token": 1.7082988029088013 }, { "epoch": 0.24268520713175845, "grad_norm": 0.140625, "learning_rate": 0.0005369204845043862, "loss": 1.732179832458496, "step": 109860, "train_bpb": 0.6108098849707743, "train_bytes": 28245.43125, "train_loss_nats_per_token": 1.7327105105902925 }, { "epoch": 0.24281688657133074, "grad_norm": 0.1513671875, "learning_rate": 0.00053644244366106, "loss": 1.7092731475830079, "step": 109880, "train_bpb": 0.6080609336653494, "train_bytes": 27826.04375, "train_loss_nats_per_token": 1.7095324858354546 }, { "epoch": 0.24294856601090306, "grad_norm": 0.1396484375, "learning_rate": 0.0005359645693776569, "loss": 1.714297103881836, "step": 109900, "train_bpb": 0.6033411106360044, "train_bytes": 28477.0625, "train_loss_nats_per_token": 1.7139493156696202 }, { "epoch": 0.24308024545047535, "grad_norm": 0.158203125, "learning_rate": 0.0005354868617367819, "loss": 1.7032630920410157, "step": 109920, "train_bpb": 0.6020015281280506, "train_bytes": 28414.03125, "train_loss_nats_per_token": 1.7033632829651428 }, { "epoch": 0.24321192489004767, "grad_norm": 0.1552734375, "learning_rate": 0.0005350093208210119, "loss": 1.7061830520629884, "step": 109940, "train_bpb": 0.6013642794347593, "train_bytes": 28580.91875, "train_loss_nats_per_token": 1.706705450531454 }, { "epoch": 0.24334360432961996, "grad_norm": 0.1279296875, "learning_rate": 0.0005345319467128932, "loss": 1.7176799774169922, "step": 109960, "train_bpb": 0.605517754257116, "train_bytes": 28566.81875, "train_loss_nats_per_token": 1.7181885057759678 }, { "epoch": 0.24347528376919228, "grad_norm": 0.1328125, "learning_rate": 0.0005340547394949448, "loss": 1.7289253234863282, "step": 109980, "train_bpb": 0.6077271014104756, "train_bytes": 28598.85625, "train_loss_nats_per_token": 1.7286939325561648 }, { "epoch": 0.24360696320876457, "grad_norm": 0.1455078125, "learning_rate": 0.000533577699249657, "loss": 1.7311487197875977, "step": 110000, "train_bpb": 0.6088833164003673, "train_bytes": 28588.975, "train_loss_nats_per_token": 1.73154589592979 }, { "epoch": 0.24360696320876457, "eval_loss": 1.530983805656433, "eval_runtime": 78.3465, "eval_samples_per_second": 12.764, "eval_steps_per_second": 12.764, "step": 110000, "train_bpb": 0.540296077532811, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5385539834818787 }, { "epoch": 0.2437386426483369, "grad_norm": 0.1376953125, "learning_rate": 0.0005331008260594897, "loss": 1.7133548736572266, "step": 110020, "train_bpb": 0.6066081751264738, "train_bytes": 28323.5625, "train_loss_nats_per_token": 1.7135454224409692 }, { "epoch": 0.24387032208790918, "grad_norm": 0.1767578125, "learning_rate": 0.0005326241200068754, "loss": 1.7273595809936524, "step": 110040, "train_bpb": 0.6109324760750152, "train_bytes": 28381.56875, "train_loss_nats_per_token": 1.7271671422742536 }, { "epoch": 0.2440020015274815, "grad_norm": 0.177734375, "learning_rate": 0.0005321475811742177, "loss": 1.717525100708008, "step": 110060, "train_bpb": 0.6084373826531937, "train_bytes": 28274.8875, "train_loss_nats_per_token": 1.7177902723286715 }, { "epoch": 0.24413368096705382, "grad_norm": 0.1689453125, "learning_rate": 0.0005316712096438898, "loss": 1.7221260070800781, "step": 110080, "train_bpb": 0.6063191999165831, "train_bytes": 28637.96875, "train_loss_nats_per_token": 1.722241129909338 }, { "epoch": 0.2442653604066261, "grad_norm": 0.15234375, "learning_rate": 0.0005311950054982373, "loss": 1.7185951232910157, "step": 110100, "train_bpb": 0.6056242323274348, "train_bytes": 28556.7875, "train_loss_nats_per_token": 1.7189510387348754 }, { "epoch": 0.24439703984619843, "grad_norm": 0.1669921875, "learning_rate": 0.0005307189688195765, "loss": 1.71678466796875, "step": 110120, "train_bpb": 0.6042887568552291, "train_bytes": 28806.48125, "train_loss_nats_per_token": 1.716991781546025 }, { "epoch": 0.24452871928577072, "grad_norm": 0.1318359375, "learning_rate": 0.0005302430996901957, "loss": 1.7187725067138673, "step": 110140, "train_bpb": 0.6078782195433409, "train_bytes": 28285.35, "train_loss_nats_per_token": 1.7195792357483342 }, { "epoch": 0.24466039872534304, "grad_norm": 0.1318359375, "learning_rate": 0.0005297673981923519, "loss": 1.7172367095947265, "step": 110160, "train_bpb": 0.6139206138025446, "train_bytes": 27727.20625, "train_loss_nats_per_token": 1.7178320527724205 }, { "epoch": 0.24479207816491533, "grad_norm": 0.177734375, "learning_rate": 0.0005292918644082752, "loss": 1.7222135543823243, "step": 110180, "train_bpb": 0.6086901923634849, "train_bytes": 28396.9625, "train_loss_nats_per_token": 1.723487340195575 }, { "epoch": 0.24492375760448765, "grad_norm": 0.12158203125, "learning_rate": 0.0005288164984201666, "loss": 1.732524299621582, "step": 110200, "train_bpb": 0.6128076869899601, "train_bytes": 28251.1875, "train_loss_nats_per_token": 1.733820723261662 }, { "epoch": 0.24505543704405994, "grad_norm": 0.1240234375, "learning_rate": 0.0005283413003101965, "loss": 1.7187496185302735, "step": 110220, "train_bpb": 0.6061815613840023, "train_bytes": 28493.05625, "train_loss_nats_per_token": 1.7198173548937796 }, { "epoch": 0.24518711648363226, "grad_norm": 0.1298828125, "learning_rate": 0.0005278662701605079, "loss": 1.7262392044067383, "step": 110240, "train_bpb": 0.6071882591588316, "train_bytes": 28726.60625, "train_loss_nats_per_token": 1.725384622561898 }, { "epoch": 0.24531879592320455, "grad_norm": 0.1357421875, "learning_rate": 0.0005273914080532145, "loss": 1.723727035522461, "step": 110260, "train_bpb": 0.6097961211492301, "train_bytes": 28424.2625, "train_loss_nats_per_token": 1.7247261174979744 }, { "epoch": 0.24545047536277687, "grad_norm": 0.126953125, "learning_rate": 0.0005269167140703998, "loss": 1.7121734619140625, "step": 110280, "train_bpb": 0.6024508933054024, "train_bytes": 28409.0375, "train_loss_nats_per_token": 1.712517175175566 }, { "epoch": 0.24558215480234916, "grad_norm": 0.140625, "learning_rate": 0.0005264421882941197, "loss": 1.7159561157226562, "step": 110300, "train_bpb": 0.6117714240617652, "train_bytes": 27900.5125, "train_loss_nats_per_token": 1.7171116955631482 }, { "epoch": 0.24571383424192147, "grad_norm": 0.16015625, "learning_rate": 0.0005259678308064003, "loss": 1.716153335571289, "step": 110320, "train_bpb": 0.6051164509882287, "train_bytes": 28394.63125, "train_loss_nats_per_token": 1.7169959224555715 }, { "epoch": 0.24584551368149377, "grad_norm": 0.12890625, "learning_rate": 0.000525493641689239, "loss": 1.7082075119018554, "step": 110340, "train_bpb": 0.6071661195318043, "train_bytes": 28314.51875, "train_loss_nats_per_token": 1.7086627040554847 }, { "epoch": 0.24597719312106608, "grad_norm": 0.11669921875, "learning_rate": 0.0005250196210246032, "loss": 1.7294771194458007, "step": 110360, "train_bpb": 0.6078692997395342, "train_bytes": 28511.8625, "train_loss_nats_per_token": 1.7302926662340463 }, { "epoch": 0.24610887256063838, "grad_norm": 0.1396484375, "learning_rate": 0.0005245457688944321, "loss": 1.712773895263672, "step": 110380, "train_bpb": 0.608340921063524, "train_bytes": 28148.64375, "train_loss_nats_per_token": 1.7135876807230783 }, { "epoch": 0.2462405520002107, "grad_norm": 0.14453125, "learning_rate": 0.000524072085380636, "loss": 1.7196598052978516, "step": 110400, "train_bpb": 0.6087383450720856, "train_bytes": 28281.78125, "train_loss_nats_per_token": 1.7196287567294788 }, { "epoch": 0.24637223143978298, "grad_norm": 0.154296875, "learning_rate": 0.0005235985705650945, "loss": 1.7198509216308593, "step": 110420, "train_bpb": 0.6060156400826149, "train_bytes": 28456.90625, "train_loss_nats_per_token": 1.7197190346075473 }, { "epoch": 0.2465039108793553, "grad_norm": 0.1650390625, "learning_rate": 0.0005231252245296596, "loss": 1.70921630859375, "step": 110440, "train_bpb": 0.6028280071705281, "train_bytes": 28423.30625, "train_loss_nats_per_token": 1.7091913882609913 }, { "epoch": 0.2466355903189276, "grad_norm": 0.1826171875, "learning_rate": 0.0005226520473561535, "loss": 1.7107978820800782, "step": 110460, "train_bpb": 0.6047288768827188, "train_bytes": 28562.8375, "train_loss_nats_per_token": 1.7114464878363058 }, { "epoch": 0.2467672697584999, "grad_norm": 0.11962890625, "learning_rate": 0.0005221790391263698, "loss": 1.7111249923706056, "step": 110480, "train_bpb": 0.6089268908611674, "train_bytes": 28101.56875, "train_loss_nats_per_token": 1.7116901667161801 }, { "epoch": 0.2468989491980722, "grad_norm": 0.11962890625, "learning_rate": 0.0005217061999220716, "loss": 1.7026735305786134, "step": 110500, "train_bpb": 0.6023416435424647, "train_bytes": 28398.23125, "train_loss_nats_per_token": 1.7035431258954685 }, { "epoch": 0.24703062863764452, "grad_norm": 0.142578125, "learning_rate": 0.0005212335298249938, "loss": 1.7120479583740233, "step": 110520, "train_bpb": 0.6093728747918761, "train_bytes": 28199.15, "train_loss_nats_per_token": 1.7130607247698608 }, { "epoch": 0.2471623080772168, "grad_norm": 0.171875, "learning_rate": 0.0005207610289168426, "loss": 1.7153709411621094, "step": 110540, "train_bpb": 0.609455867818978, "train_bytes": 28101.4875, "train_loss_nats_per_token": 1.716454266885847 }, { "epoch": 0.24729398751678913, "grad_norm": 0.169921875, "learning_rate": 0.0005202886972792928, "loss": 1.704010581970215, "step": 110560, "train_bpb": 0.605125089407355, "train_bytes": 28170.0375, "train_loss_nats_per_token": 1.7044913168867637 }, { "epoch": 0.24742566695636142, "grad_norm": 0.1328125, "learning_rate": 0.0005198165349939922, "loss": 1.7194940567016601, "step": 110580, "train_bpb": 0.6087102664806792, "train_bytes": 28297.46875, "train_loss_nats_per_token": 1.7202708448126132 }, { "epoch": 0.24755734639593374, "grad_norm": 0.1396484375, "learning_rate": 0.000519344542142559, "loss": 1.716411018371582, "step": 110600, "train_bpb": 0.6068147914152704, "train_bytes": 28465.34375, "train_loss_nats_per_token": 1.7162612985182566 }, { "epoch": 0.24768902583550603, "grad_norm": 0.15234375, "learning_rate": 0.0005188727188065802, "loss": 1.7052494049072267, "step": 110620, "train_bpb": 0.6050404382393613, "train_bytes": 28150.70625, "train_loss_nats_per_token": 1.7057670452845866 }, { "epoch": 0.24782070527507835, "grad_norm": 0.126953125, "learning_rate": 0.0005184010650676156, "loss": 1.718343734741211, "step": 110640, "train_bpb": 0.6068865515000433, "train_bytes": 28285.31875, "train_loss_nats_per_token": 1.719187488076989 }, { "epoch": 0.24795238471465064, "grad_norm": 0.12060546875, "learning_rate": 0.000517929581007195, "loss": 1.7160953521728515, "step": 110660, "train_bpb": 0.6041811744691382, "train_bytes": 28409.39375, "train_loss_nats_per_token": 1.7173378763720086 }, { "epoch": 0.24808406415422296, "grad_norm": 0.1357421875, "learning_rate": 0.0005174582667068192, "loss": 1.7242042541503906, "step": 110680, "train_bpb": 0.6072884583073347, "train_bytes": 28305.5, "train_loss_nats_per_token": 1.7247291996603265 }, { "epoch": 0.24821574359379525, "grad_norm": 0.1396484375, "learning_rate": 0.0005169871222479585, "loss": 1.7200180053710938, "step": 110700, "train_bpb": 0.6110822441012885, "train_bytes": 28102.55625, "train_loss_nats_per_token": 1.7202871499579309 }, { "epoch": 0.24834742303336757, "grad_norm": 0.1396484375, "learning_rate": 0.0005165161477120549, "loss": 1.7208019256591798, "step": 110720, "train_bpb": 0.60875974476397, "train_bytes": 28429.51875, "train_loss_nats_per_token": 1.7222909703350535 }, { "epoch": 0.2484791024729399, "grad_norm": 0.1298828125, "learning_rate": 0.0005160453431805212, "loss": 1.7147289276123048, "step": 110740, "train_bpb": 0.6071413445815153, "train_bytes": 28078.40625, "train_loss_nats_per_token": 1.714177607831115 }, { "epoch": 0.24861078191251218, "grad_norm": 0.2021484375, "learning_rate": 0.0005155747087347396, "loss": 1.7195318222045899, "step": 110760, "train_bpb": 0.6087504863404959, "train_bytes": 28189.34375, "train_loss_nats_per_token": 1.7203843224678343 }, { "epoch": 0.2487424613520845, "grad_norm": 0.14453125, "learning_rate": 0.0005151042444560641, "loss": 1.7126714706420898, "step": 110780, "train_bpb": 0.6073245046606789, "train_bytes": 28604.53125, "train_loss_nats_per_token": 1.7130505578020179 }, { "epoch": 0.2488741407916568, "grad_norm": 0.11474609375, "learning_rate": 0.0005146339504258191, "loss": 1.711126708984375, "step": 110800, "train_bpb": 0.6064146114786898, "train_bytes": 28269.38125, "train_loss_nats_per_token": 1.711675118414096 }, { "epoch": 0.2490058202312291, "grad_norm": 0.1484375, "learning_rate": 0.0005141638267252986, "loss": 1.7315103530883789, "step": 110820, "train_bpb": 0.6088363856777435, "train_bytes": 28461.16875, "train_loss_nats_per_token": 1.7315400065633573 }, { "epoch": 0.2491374996708014, "grad_norm": 0.1767578125, "learning_rate": 0.0005136938734357681, "loss": 1.7100589752197266, "step": 110840, "train_bpb": 0.60250674313937, "train_bytes": 28507.25, "train_loss_nats_per_token": 1.710746734289316 }, { "epoch": 0.24926917911037372, "grad_norm": 0.1337890625, "learning_rate": 0.0005132240906384639, "loss": 1.713458251953125, "step": 110860, "train_bpb": 0.603519589186872, "train_bytes": 28862.5875, "train_loss_nats_per_token": 1.7139785757084374 }, { "epoch": 0.249400858549946, "grad_norm": 0.1357421875, "learning_rate": 0.0005127544784145922, "loss": 1.7034481048583985, "step": 110880, "train_bpb": 0.6054166980591544, "train_bytes": 28343.16875, "train_loss_nats_per_token": 1.7044171672853963 }, { "epoch": 0.24953253798951833, "grad_norm": 0.166015625, "learning_rate": 0.0005122850368453294, "loss": 1.7226051330566405, "step": 110900, "train_bpb": 0.6093577901235925, "train_bytes": 28371.075, "train_loss_nats_per_token": 1.7227329061418977 }, { "epoch": 0.24966421742909062, "grad_norm": 0.146484375, "learning_rate": 0.000511815766011823, "loss": 1.7265363693237306, "step": 110920, "train_bpb": 0.6060514527126212, "train_bytes": 28644.575, "train_loss_nats_per_token": 1.7271171242848702 }, { "epoch": 0.24979589686866294, "grad_norm": 0.197265625, "learning_rate": 0.0005113466659951916, "loss": 1.7234535217285156, "step": 110940, "train_bpb": 0.608114782698748, "train_bytes": 28271.975, "train_loss_nats_per_token": 1.722937041423689 }, { "epoch": 0.24992757630823523, "grad_norm": 0.15234375, "learning_rate": 0.0005108777368765223, "loss": 1.7135459899902343, "step": 110960, "train_bpb": 0.6049404326240212, "train_bytes": 28498.6875, "train_loss_nats_per_token": 1.7144110889221391 }, { "epoch": 0.2500592557478075, "grad_norm": 0.1328125, "learning_rate": 0.0005104089787368746, "loss": 1.7162099838256837, "step": 110980, "train_bpb": 0.6036523965807274, "train_bytes": 28699.4875, "train_loss_nats_per_token": 1.716784908323214 }, { "epoch": 0.25019093518737984, "grad_norm": 0.169921875, "learning_rate": 0.0005099403916572775, "loss": 1.697690200805664, "step": 111000, "train_bpb": 0.6018248440265141, "train_bytes": 27917.9375, "train_loss_nats_per_token": 1.6981957732269195 }, { "epoch": 0.25019093518737984, "eval_loss": 1.5307097434997559, "eval_runtime": 71.3307, "eval_samples_per_second": 14.019, "eval_steps_per_second": 14.019, "step": 111000, "train_bpb": 0.5401866277182448, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5382423127976117 }, { "epoch": 0.25032261462695216, "grad_norm": 0.146484375, "learning_rate": 0.0005094719757187312, "loss": 1.7092775344848632, "step": 111020, "train_bpb": 0.603883591297479, "train_bytes": 28454.875, "train_loss_nats_per_token": 1.7094977121273571 }, { "epoch": 0.2504542940665245, "grad_norm": 0.16015625, "learning_rate": 0.0005090037310022051, "loss": 1.7200653076171875, "step": 111040, "train_bpb": 0.6090890038846021, "train_bytes": 27964.54375, "train_loss_nats_per_token": 1.7204837961950978 }, { "epoch": 0.25058597350609674, "grad_norm": 0.1259765625, "learning_rate": 0.0005085356575886397, "loss": 1.704643440246582, "step": 111060, "train_bpb": 0.6056886717822826, "train_bytes": 28160.875, "train_loss_nats_per_token": 1.7064331498352903 }, { "epoch": 0.25071765294566906, "grad_norm": 0.1591796875, "learning_rate": 0.0005080677555589466, "loss": 1.7218650817871093, "step": 111080, "train_bpb": 0.6088785595109363, "train_bytes": 28483.175, "train_loss_nats_per_token": 1.722880672359283 }, { "epoch": 0.2508493323852414, "grad_norm": 0.1435546875, "learning_rate": 0.000507600024994006, "loss": 1.7146593093872071, "step": 111100, "train_bpb": 0.6060350462212769, "train_bytes": 27979.41875, "train_loss_nats_per_token": 1.7151908390925172 }, { "epoch": 0.2509810118248137, "grad_norm": 0.10595703125, "learning_rate": 0.00050713246597467, "loss": 1.720484161376953, "step": 111120, "train_bpb": 0.6102933895605267, "train_bytes": 28158.9125, "train_loss_nats_per_token": 1.72119773493167 }, { "epoch": 0.25111269126438596, "grad_norm": 0.1328125, "learning_rate": 0.000506665078581761, "loss": 1.7080904006958009, "step": 111140, "train_bpb": 0.6042704428741936, "train_bytes": 28240.5875, "train_loss_nats_per_token": 1.7085032963185138 }, { "epoch": 0.2512443707039583, "grad_norm": 0.12109375, "learning_rate": 0.0005061978628960704, "loss": 1.7175691604614258, "step": 111160, "train_bpb": 0.6085034340715189, "train_bytes": 28130.4125, "train_loss_nats_per_token": 1.7179281930742125 }, { "epoch": 0.2513760501435306, "grad_norm": 0.1396484375, "learning_rate": 0.0005057308189983612, "loss": 1.7134090423583985, "step": 111180, "train_bpb": 0.602618320937132, "train_bytes": 28810.325, "train_loss_nats_per_token": 1.7135163658607155 }, { "epoch": 0.2515077295831029, "grad_norm": 0.1435546875, "learning_rate": 0.0005052639469693664, "loss": 1.714719009399414, "step": 111200, "train_bpb": 0.6062915980596542, "train_bytes": 28234.14375, "train_loss_nats_per_token": 1.7162219706241761 }, { "epoch": 0.2516394090226752, "grad_norm": 0.1513671875, "learning_rate": 0.0005047972468897894, "loss": 1.7141870498657226, "step": 111220, "train_bpb": 0.6061759733593478, "train_bytes": 28331.5125, "train_loss_nats_per_token": 1.7139966347819533 }, { "epoch": 0.2517710884622475, "grad_norm": 0.154296875, "learning_rate": 0.000504330718840303, "loss": 1.715096664428711, "step": 111240, "train_bpb": 0.6081405137648035, "train_bytes": 28330.96875, "train_loss_nats_per_token": 1.7158835987984518 }, { "epoch": 0.2519027679018198, "grad_norm": 0.1318359375, "learning_rate": 0.0005038643629015513, "loss": 1.7130468368530274, "step": 111260, "train_bpb": 0.6084881321205253, "train_bytes": 28271.325, "train_loss_nats_per_token": 1.7136901094624934 }, { "epoch": 0.25203444734139213, "grad_norm": 0.11572265625, "learning_rate": 0.0005033981791541487, "loss": 1.7154264450073242, "step": 111280, "train_bpb": 0.6048890789747495, "train_bytes": 28604.85, "train_loss_nats_per_token": 1.7158435371681873 }, { "epoch": 0.2521661267809644, "grad_norm": 0.173828125, "learning_rate": 0.0005029321676786787, "loss": 1.7030086517333984, "step": 111300, "train_bpb": 0.6027850955657593, "train_bytes": 28546.575, "train_loss_nats_per_token": 1.7038263231798993 }, { "epoch": 0.2522978062205367, "grad_norm": 0.125, "learning_rate": 0.0005024663285556958, "loss": 1.728964614868164, "step": 111320, "train_bpb": 0.6118507295796471, "train_bytes": 28513.575, "train_loss_nats_per_token": 1.7290898320939496 }, { "epoch": 0.25242948566010903, "grad_norm": 0.1396484375, "learning_rate": 0.000502000661865725, "loss": 1.6974784851074218, "step": 111340, "train_bpb": 0.5976690582747568, "train_bytes": 28603.725, "train_loss_nats_per_token": 1.6978073338058897 }, { "epoch": 0.25256116509968135, "grad_norm": 0.17578125, "learning_rate": 0.0005015351676892615, "loss": 1.7113729476928712, "step": 111360, "train_bpb": 0.606200240027749, "train_bytes": 28346.825, "train_loss_nats_per_token": 1.711965913932118 }, { "epoch": 0.2526928445392536, "grad_norm": 0.154296875, "learning_rate": 0.0005010698461067692, "loss": 1.7072687149047852, "step": 111380, "train_bpb": 0.6014832676765579, "train_bytes": 28573.9, "train_loss_nats_per_token": 1.7076162193504103 }, { "epoch": 0.25282452397882593, "grad_norm": 0.162109375, "learning_rate": 0.0005006046971986842, "loss": 1.7155813217163085, "step": 111400, "train_bpb": 0.6068864028704268, "train_bytes": 28304.06875, "train_loss_nats_per_token": 1.7173041819440324 }, { "epoch": 0.25295620341839825, "grad_norm": 0.126953125, "learning_rate": 0.0005001397210454119, "loss": 1.7128314971923828, "step": 111420, "train_bpb": 0.6034774117284287, "train_bytes": 28409.05, "train_loss_nats_per_token": 1.7125712569729106 }, { "epoch": 0.25308788285797057, "grad_norm": 0.130859375, "learning_rate": 0.0004996749177273267, "loss": 1.715683937072754, "step": 111440, "train_bpb": 0.606667069059481, "train_bytes": 28639.25625, "train_loss_nats_per_token": 1.7164050993150701 }, { "epoch": 0.2532195622975429, "grad_norm": 0.13671875, "learning_rate": 0.0004992102873247752, "loss": 1.7137563705444336, "step": 111460, "train_bpb": 0.6066630287763765, "train_bytes": 28207.36875, "train_loss_nats_per_token": 1.7136990600438895 }, { "epoch": 0.25335124173711515, "grad_norm": 0.11962890625, "learning_rate": 0.0004987458299180733, "loss": 1.7006565093994142, "step": 111480, "train_bpb": 0.600215443644072, "train_bytes": 28520.69375, "train_loss_nats_per_token": 1.7011776468849154 }, { "epoch": 0.25348292117668747, "grad_norm": 0.1396484375, "learning_rate": 0.0004982815455875056, "loss": 1.706118392944336, "step": 111500, "train_bpb": 0.6092782493958145, "train_bytes": 28301.1375, "train_loss_nats_per_token": 1.7078730053258293 }, { "epoch": 0.2536146006162598, "grad_norm": 0.1513671875, "learning_rate": 0.0004978174344133288, "loss": 1.7184642791748046, "step": 111520, "train_bpb": 0.6064487555674538, "train_bytes": 28667.35625, "train_loss_nats_per_token": 1.7188075259176985 }, { "epoch": 0.2537462800558321, "grad_norm": 0.1455078125, "learning_rate": 0.0004973534964757688, "loss": 1.7124521255493164, "step": 111540, "train_bpb": 0.6063749236344043, "train_bytes": 27849.5375, "train_loss_nats_per_token": 1.7129263964547128 }, { "epoch": 0.25387795949540437, "grad_norm": 0.1337890625, "learning_rate": 0.0004968897318550221, "loss": 1.7051202774047851, "step": 111560, "train_bpb": 0.6061345297228422, "train_bytes": 28160.9125, "train_loss_nats_per_token": 1.7062032075464417 }, { "epoch": 0.2540096389349767, "grad_norm": 0.1484375, "learning_rate": 0.0004964261406312536, "loss": 1.715925407409668, "step": 111580, "train_bpb": 0.6051800429803977, "train_bytes": 28471.525, "train_loss_nats_per_token": 1.7161653550294662 }, { "epoch": 0.254141318374549, "grad_norm": 0.1201171875, "learning_rate": 0.0004959627228846, "loss": 1.7141046524047852, "step": 111600, "train_bpb": 0.6094199993532947, "train_bytes": 28009.15, "train_loss_nats_per_token": 1.7150220908442841 }, { "epoch": 0.2542729978141213, "grad_norm": 0.1513671875, "learning_rate": 0.000495499478695168, "loss": 1.7100229263305664, "step": 111620, "train_bpb": 0.6035648117964871, "train_bytes": 28625.93125, "train_loss_nats_per_token": 1.7104154931107747 }, { "epoch": 0.2544046772536936, "grad_norm": 0.1513671875, "learning_rate": 0.0004950364081430322, "loss": 1.7176681518554688, "step": 111640, "train_bpb": 0.6075025349922759, "train_bytes": 28466.8875, "train_loss_nats_per_token": 1.7187215460579377 }, { "epoch": 0.2545363566932659, "grad_norm": 0.140625, "learning_rate": 0.0004945735113082398, "loss": 1.704604148864746, "step": 111660, "train_bpb": 0.6070905373322671, "train_bytes": 28123.36875, "train_loss_nats_per_token": 1.7050208588627238 }, { "epoch": 0.2546680361328382, "grad_norm": 0.1591796875, "learning_rate": 0.0004941107882708069, "loss": 1.7247371673583984, "step": 111680, "train_bpb": 0.610460336083333, "train_bytes": 28340.2375, "train_loss_nats_per_token": 1.7242095417924008 }, { "epoch": 0.25479971557241055, "grad_norm": 0.123046875, "learning_rate": 0.0004936482391107187, "loss": 1.7220870971679687, "step": 111700, "train_bpb": 0.6104572777608394, "train_bytes": 28287.975, "train_loss_nats_per_token": 1.721901737728078 }, { "epoch": 0.2549313950119828, "grad_norm": 0.1767578125, "learning_rate": 0.0004931858639079318, "loss": 1.7015893936157227, "step": 111720, "train_bpb": 0.6055717020979836, "train_bytes": 27943.59375, "train_loss_nats_per_token": 1.702172804440681 }, { "epoch": 0.2550630744515551, "grad_norm": 0.1484375, "learning_rate": 0.0004927236627423715, "loss": 1.7236068725585938, "step": 111740, "train_bpb": 0.6085609365791291, "train_bytes": 28539.4125, "train_loss_nats_per_token": 1.723566203808513 }, { "epoch": 0.25519475389112745, "grad_norm": 0.1435546875, "learning_rate": 0.0004922616356939348, "loss": 1.7136573791503906, "step": 111760, "train_bpb": 0.6019120764318123, "train_bytes": 28665.94375, "train_loss_nats_per_token": 1.713716402998701 }, { "epoch": 0.25532643333069976, "grad_norm": 0.15625, "learning_rate": 0.0004917997828424858, "loss": 1.7164573669433594, "step": 111780, "train_bpb": 0.6086862311948097, "train_bytes": 28265.29375, "train_loss_nats_per_token": 1.7177257138911732 }, { "epoch": 0.25545811277027203, "grad_norm": 0.169921875, "learning_rate": 0.0004913381042678611, "loss": 1.704574966430664, "step": 111800, "train_bpb": 0.6029668668670033, "train_bytes": 28227.24375, "train_loss_nats_per_token": 1.7054669828493423 }, { "epoch": 0.25558979220984435, "grad_norm": 0.13671875, "learning_rate": 0.0004908766000498661, "loss": 1.7036638259887695, "step": 111820, "train_bpb": 0.6038473825714913, "train_bytes": 28200.1625, "train_loss_nats_per_token": 1.7049524878187874 }, { "epoch": 0.25572147164941667, "grad_norm": 0.1474609375, "learning_rate": 0.0004904152702682754, "loss": 1.7162900924682618, "step": 111840, "train_bpb": 0.6073929639970091, "train_bytes": 28506.7, "train_loss_nats_per_token": 1.7172999344965998 }, { "epoch": 0.255853151088989, "grad_norm": 0.162109375, "learning_rate": 0.0004899541150028349, "loss": 1.6969039916992188, "step": 111860, "train_bpb": 0.602328065602685, "train_bytes": 28287.4125, "train_loss_nats_per_token": 1.6976818773825257 }, { "epoch": 0.25598483052856125, "grad_norm": 0.1552734375, "learning_rate": 0.0004894931343332593, "loss": 1.7218236923217773, "step": 111880, "train_bpb": 0.6088425845203558, "train_bytes": 28088.80625, "train_loss_nats_per_token": 1.7219421839280071 }, { "epoch": 0.25611650996813357, "grad_norm": 0.14453125, "learning_rate": 0.0004890323283392338, "loss": 1.7230216979980468, "step": 111900, "train_bpb": 0.6085402734181506, "train_bytes": 28439.875, "train_loss_nats_per_token": 1.7235669593167688 }, { "epoch": 0.2562481894077059, "grad_norm": 0.10888671875, "learning_rate": 0.0004885716971004124, "loss": 1.7022665023803711, "step": 111920, "train_bpb": 0.6030047785989947, "train_bytes": 28187.33125, "train_loss_nats_per_token": 1.70258879030865 }, { "epoch": 0.2563798688472782, "grad_norm": 0.123046875, "learning_rate": 0.00048811124069641956, "loss": 1.7130685806274415, "step": 111940, "train_bpb": 0.6082516679140363, "train_bytes": 27914.09375, "train_loss_nats_per_token": 1.713804592148435 }, { "epoch": 0.25651154828685047, "grad_norm": 0.1572265625, "learning_rate": 0.00048765095920685035, "loss": 1.7236461639404297, "step": 111960, "train_bpb": 0.6062492082619527, "train_bytes": 28653.68125, "train_loss_nats_per_token": 1.724024815131069 }, { "epoch": 0.2566432277264228, "grad_norm": 0.1513671875, "learning_rate": 0.0004871908527112675, "loss": 1.7081489562988281, "step": 111980, "train_bpb": 0.6028321977596638, "train_bytes": 28279.90625, "train_loss_nats_per_token": 1.709411651885975 }, { "epoch": 0.2567749071659951, "grad_norm": 0.1494140625, "learning_rate": 0.0004867309212892053, "loss": 1.7143125534057617, "step": 112000, "train_bpb": 0.6068712834814083, "train_bytes": 28185.2125, "train_loss_nats_per_token": 1.7147012703252607 }, { "epoch": 0.2567749071659951, "eval_loss": 1.5305503606796265, "eval_runtime": 71.151, "eval_samples_per_second": 14.055, "eval_steps_per_second": 14.055, "step": 112000, "train_bpb": 0.540121442875897, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5380566916113263 }, { "epoch": 0.2569065866055674, "grad_norm": 0.140625, "learning_rate": 0.0004862711650201677, "loss": 1.7164249420166016, "step": 112020, "train_bpb": 0.6078136268400487, "train_bytes": 28189.05625, "train_loss_nats_per_token": 1.7169912113751766 }, { "epoch": 0.2570382660451397, "grad_norm": 0.1337890625, "learning_rate": 0.000485811583983627, "loss": 1.706865119934082, "step": 112040, "train_bpb": 0.6037584335463797, "train_bytes": 28380.28125, "train_loss_nats_per_token": 1.7080429393908394 }, { "epoch": 0.257169945484712, "grad_norm": 0.142578125, "learning_rate": 0.00048535217825902634, "loss": 1.7017990112304688, "step": 112060, "train_bpb": 0.6030641121000396, "train_bytes": 28288.49375, "train_loss_nats_per_token": 1.7033810600883172 }, { "epoch": 0.2573016249242843, "grad_norm": 0.146484375, "learning_rate": 0.0004848929479257783, "loss": 1.7214805603027343, "step": 112080, "train_bpb": 0.6081350041551078, "train_bytes": 28471.1, "train_loss_nats_per_token": 1.7221065726501585 }, { "epoch": 0.25743330436385664, "grad_norm": 0.1337890625, "learning_rate": 0.00048443389306326574, "loss": 1.7167343139648437, "step": 112100, "train_bpb": 0.608112584373705, "train_bytes": 28503.71875, "train_loss_nats_per_token": 1.7164592125369549 }, { "epoch": 0.25756498380342896, "grad_norm": 0.12890625, "learning_rate": 0.00048397501375083965, "loss": 1.7172395706176757, "step": 112120, "train_bpb": 0.6092151974255695, "train_bytes": 28214.025, "train_loss_nats_per_token": 1.7180101701095107 }, { "epoch": 0.2576966632430012, "grad_norm": 0.1396484375, "learning_rate": 0.00048351631006782187, "loss": 1.713209342956543, "step": 112140, "train_bpb": 0.6068497340827084, "train_bytes": 28364.425, "train_loss_nats_per_token": 1.7139942759441225 }, { "epoch": 0.25782834268257354, "grad_norm": 0.1513671875, "learning_rate": 0.0004830577820935044, "loss": 1.7141101837158204, "step": 112160, "train_bpb": 0.6037449846805277, "train_bytes": 28405.3625, "train_loss_nats_per_token": 1.7140870258356051 }, { "epoch": 0.25796002212214586, "grad_norm": 0.177734375, "learning_rate": 0.0004825994299071469, "loss": 1.7246208190917969, "step": 112180, "train_bpb": 0.613724667943373, "train_bytes": 28008.1625, "train_loss_nats_per_token": 1.7250468041779816 }, { "epoch": 0.2580917015617182, "grad_norm": 0.1259765625, "learning_rate": 0.0004821412535879802, "loss": 1.7081174850463867, "step": 112200, "train_bpb": 0.6033620261734498, "train_bytes": 28388.41875, "train_loss_nats_per_token": 1.708607258984731 }, { "epoch": 0.25822338100129044, "grad_norm": 0.1279296875, "learning_rate": 0.00048168325321520515, "loss": 1.7009901046752929, "step": 112220, "train_bpb": 0.6019252613962056, "train_bytes": 28446.05625, "train_loss_nats_per_token": 1.702140259913021 }, { "epoch": 0.25835506044086276, "grad_norm": 0.15625, "learning_rate": 0.00048122542886799044, "loss": 1.7024892807006835, "step": 112240, "train_bpb": 0.6055748821474783, "train_bytes": 28058.36875, "train_loss_nats_per_token": 1.702793153233347 }, { "epoch": 0.2584867398804351, "grad_norm": 0.15625, "learning_rate": 0.00048076778062547534, "loss": 1.718125343322754, "step": 112260, "train_bpb": 0.6076044347258466, "train_bytes": 28177.75625, "train_loss_nats_per_token": 1.718266269497969 }, { "epoch": 0.2586184193200074, "grad_norm": 0.1875, "learning_rate": 0.00048031030856676894, "loss": 1.7126972198486328, "step": 112280, "train_bpb": 0.6065993307118875, "train_bytes": 28167.33125, "train_loss_nats_per_token": 1.7133813861572853 }, { "epoch": 0.25875009875957966, "grad_norm": 0.11962890625, "learning_rate": 0.00047985301277095, "loss": 1.7142704010009766, "step": 112300, "train_bpb": 0.607880849357419, "train_bytes": 28362.20625, "train_loss_nats_per_token": 1.7151537628889677 }, { "epoch": 0.258881778199152, "grad_norm": 0.146484375, "learning_rate": 0.0004793958933170655, "loss": 1.714838409423828, "step": 112320, "train_bpb": 0.6056600826183041, "train_bytes": 28391.6375, "train_loss_nats_per_token": 1.7149576899172854 }, { "epoch": 0.2590134576387243, "grad_norm": 0.12353515625, "learning_rate": 0.0004789389502841331, "loss": 1.7107749938964845, "step": 112340, "train_bpb": 0.6052112239289795, "train_bytes": 28210.96875, "train_loss_nats_per_token": 1.7105637879045545 }, { "epoch": 0.2591451370782966, "grad_norm": 0.126953125, "learning_rate": 0.00047848218375114024, "loss": 1.7149339675903321, "step": 112360, "train_bpb": 0.6010943127128998, "train_bytes": 28716.19375, "train_loss_nats_per_token": 1.715675688374498 }, { "epoch": 0.2592768165178689, "grad_norm": 0.1396484375, "learning_rate": 0.0004780255937970424, "loss": 1.7198221206665039, "step": 112380, "train_bpb": 0.6066426334068056, "train_bytes": 28566.85, "train_loss_nats_per_token": 1.7208736655033792 }, { "epoch": 0.2594084959574412, "grad_norm": 0.13671875, "learning_rate": 0.0004775691805007657, "loss": 1.7077987670898438, "step": 112400, "train_bpb": 0.6055475186456611, "train_bytes": 28338.7, "train_loss_nats_per_token": 1.7080106083102573 }, { "epoch": 0.2595401753970135, "grad_norm": 0.1796875, "learning_rate": 0.00047711294394120544, "loss": 1.7098669052124023, "step": 112420, "train_bpb": 0.6030356619505438, "train_bytes": 28319.66875, "train_loss_nats_per_token": 1.7098653143721545 }, { "epoch": 0.25967185483658584, "grad_norm": 0.16796875, "learning_rate": 0.00047665688419722726, "loss": 1.7018596649169921, "step": 112440, "train_bpb": 0.602684775647238, "train_bytes": 28435.9875, "train_loss_nats_per_token": 1.703121462976093 }, { "epoch": 0.2598035342761581, "grad_norm": 0.1328125, "learning_rate": 0.00047620100134766383, "loss": 1.698480987548828, "step": 112460, "train_bpb": 0.6027962927228817, "train_bytes": 28445.2375, "train_loss_nats_per_token": 1.6984630236905232 }, { "epoch": 0.2599352137157304, "grad_norm": 0.1513671875, "learning_rate": 0.00047574529547131963, "loss": 1.723784828186035, "step": 112480, "train_bpb": 0.6106460399952878, "train_bytes": 28427.0375, "train_loss_nats_per_token": 1.7237769745326263 }, { "epoch": 0.26006689315530274, "grad_norm": 0.158203125, "learning_rate": 0.000475289766646968, "loss": 1.7148386001586915, "step": 112500, "train_bpb": 0.6088000731378229, "train_bytes": 28060.33125, "train_loss_nats_per_token": 1.7153685225670772 }, { "epoch": 0.26019857259487505, "grad_norm": 0.171875, "learning_rate": 0.0004748344149533504, "loss": 1.7064743041992188, "step": 112520, "train_bpb": 0.6002406646347535, "train_bytes": 28479.31875, "train_loss_nats_per_token": 1.7073623279655399 }, { "epoch": 0.2603302520344473, "grad_norm": 0.1484375, "learning_rate": 0.00047437924046917916, "loss": 1.712114143371582, "step": 112540, "train_bpb": 0.6074586178825491, "train_bytes": 28386.30625, "train_loss_nats_per_token": 1.7129235143154453 }, { "epoch": 0.26046193147401964, "grad_norm": 0.162109375, "learning_rate": 0.00047392424327313593, "loss": 1.7185453414916991, "step": 112560, "train_bpb": 0.6036069714108798, "train_bytes": 28584.325, "train_loss_nats_per_token": 1.7188857918034322 }, { "epoch": 0.26059361091359196, "grad_norm": 0.17578125, "learning_rate": 0.0004734694234438701, "loss": 1.716623306274414, "step": 112580, "train_bpb": 0.6066239713880132, "train_bytes": 28549.10625, "train_loss_nats_per_token": 1.7164767336809623 }, { "epoch": 0.2607252903531643, "grad_norm": 0.146484375, "learning_rate": 0.00047301478106000217, "loss": 1.7295755386352538, "step": 112600, "train_bpb": 0.6140024461126097, "train_bytes": 28136.36875, "train_loss_nats_per_token": 1.7308018415229487 }, { "epoch": 0.26085696979273654, "grad_norm": 0.11865234375, "learning_rate": 0.0004725603162001214, "loss": 1.7179555892944336, "step": 112620, "train_bpb": 0.6084629429205003, "train_bytes": 28211.9, "train_loss_nats_per_token": 1.718829849429561 }, { "epoch": 0.26098864923230886, "grad_norm": 0.1181640625, "learning_rate": 0.0004721060289427865, "loss": 1.7047863006591797, "step": 112640, "train_bpb": 0.6081124763512991, "train_bytes": 27917.71875, "train_loss_nats_per_token": 1.7058024423639895 }, { "epoch": 0.2611203286718812, "grad_norm": 0.11767578125, "learning_rate": 0.0004716519193665244, "loss": 1.719975471496582, "step": 112660, "train_bpb": 0.6081313961899354, "train_bytes": 28470.5125, "train_loss_nats_per_token": 1.7207043650465828 }, { "epoch": 0.2612520081114535, "grad_norm": 0.1865234375, "learning_rate": 0.0004711979875498329, "loss": 1.7152769088745117, "step": 112680, "train_bpb": 0.609528783950375, "train_bytes": 28143.38125, "train_loss_nats_per_token": 1.715982512115283 }, { "epoch": 0.26138368755102576, "grad_norm": 0.138671875, "learning_rate": 0.0004707442335711785, "loss": 1.7118122100830078, "step": 112700, "train_bpb": 0.6042736501280693, "train_bytes": 28580.5125, "train_loss_nats_per_token": 1.7128247292152734 }, { "epoch": 0.2615153669905981, "grad_norm": 0.1474609375, "learning_rate": 0.00047029065750899603, "loss": 1.7037208557128907, "step": 112720, "train_bpb": 0.6074102021873128, "train_bytes": 28317.81875, "train_loss_nats_per_token": 1.7042231633268177 }, { "epoch": 0.2616470464301704, "grad_norm": 0.1494140625, "learning_rate": 0.0004698372594416907, "loss": 1.7190345764160155, "step": 112740, "train_bpb": 0.6102740008651131, "train_bytes": 28117.83125, "train_loss_nats_per_token": 1.7202539639469057 }, { "epoch": 0.2617787258697427, "grad_norm": 0.123046875, "learning_rate": 0.00046938403944763737, "loss": 1.7114696502685547, "step": 112760, "train_bpb": 0.6051390401752262, "train_bytes": 28537.7125, "train_loss_nats_per_token": 1.711536615838769 }, { "epoch": 0.26191040530931503, "grad_norm": 0.11865234375, "learning_rate": 0.000468930997605178, "loss": 1.712263298034668, "step": 112780, "train_bpb": 0.6072760984506071, "train_bytes": 28318.525, "train_loss_nats_per_token": 1.7120616890384956 }, { "epoch": 0.2620420847488873, "grad_norm": 0.1181640625, "learning_rate": 0.00046847813399262595, "loss": 1.7162817001342774, "step": 112800, "train_bpb": 0.6072636773829526, "train_bytes": 28283.18125, "train_loss_nats_per_token": 1.7172739362106746 }, { "epoch": 0.2621737641884596, "grad_norm": 0.16015625, "learning_rate": 0.00046802544868826266, "loss": 1.7129501342773437, "step": 112820, "train_bpb": 0.6094690304649477, "train_bytes": 28157.05625, "train_loss_nats_per_token": 1.7134981997544083 }, { "epoch": 0.26230544362803193, "grad_norm": 0.1474609375, "learning_rate": 0.0004675729417703396, "loss": 1.720880126953125, "step": 112840, "train_bpb": 0.6050425873758317, "train_bytes": 28567.89375, "train_loss_nats_per_token": 1.7216139391665986 }, { "epoch": 0.26243712306760425, "grad_norm": 0.1416015625, "learning_rate": 0.0004671206133170758, "loss": 1.710806655883789, "step": 112860, "train_bpb": 0.6065351567335873, "train_bytes": 28112.71875, "train_loss_nats_per_token": 1.711526608406553 }, { "epoch": 0.2625688025071765, "grad_norm": 0.1298828125, "learning_rate": 0.00046666846340666097, "loss": 1.7081989288330077, "step": 112880, "train_bpb": 0.6070527992410725, "train_bytes": 28133.4, "train_loss_nats_per_token": 1.7086262400935721 }, { "epoch": 0.26270048194674883, "grad_norm": 0.12890625, "learning_rate": 0.000466216492117254, "loss": 1.6991611480712892, "step": 112900, "train_bpb": 0.604289872822359, "train_bytes": 28054.51875, "train_loss_nats_per_token": 1.700161947341647 }, { "epoch": 0.26283216138632115, "grad_norm": 0.1396484375, "learning_rate": 0.0004657646995269813, "loss": 1.7058767318725585, "step": 112920, "train_bpb": 0.6058282116422978, "train_bytes": 28264.60625, "train_loss_nats_per_token": 1.7059206532079945 }, { "epoch": 0.26296384082589347, "grad_norm": 0.11962890625, "learning_rate": 0.00046531308571394, "loss": 1.7106138229370118, "step": 112940, "train_bpb": 0.6034655485006826, "train_bytes": 28361.05, "train_loss_nats_per_token": 1.7114970436000156 }, { "epoch": 0.26309552026546573, "grad_norm": 0.130859375, "learning_rate": 0.0004648616507561956, "loss": 1.7054399490356444, "step": 112960, "train_bpb": 0.6037052911064502, "train_bytes": 28316.55, "train_loss_nats_per_token": 1.7063855365560732 }, { "epoch": 0.26322719970503805, "grad_norm": 0.14453125, "learning_rate": 0.00046441039473178345, "loss": 1.7066024780273437, "step": 112980, "train_bpb": 0.6068884148860412, "train_bytes": 28415.41875, "train_loss_nats_per_token": 1.7072612741682422 }, { "epoch": 0.26335887914461037, "grad_norm": 0.1767578125, "learning_rate": 0.0004639593177187065, "loss": 1.714677619934082, "step": 113000, "train_bpb": 0.6069234714716806, "train_bytes": 27944.05625, "train_loss_nats_per_token": 1.7156954596072989 }, { "epoch": 0.26335887914461037, "eval_loss": 1.5305984020233154, "eval_runtime": 71.3986, "eval_samples_per_second": 14.006, "eval_steps_per_second": 14.006, "step": 113000, "train_bpb": 0.5401517620407228, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.538143028850775 }, { "epoch": 0.2634905585841827, "grad_norm": 0.1591796875, "learning_rate": 0.000463508419794938, "loss": 1.7135343551635742, "step": 113020, "train_bpb": 0.6068658256802405, "train_bytes": 28305.2, "train_loss_nats_per_token": 1.714714649027483 }, { "epoch": 0.26362223802375495, "grad_norm": 0.150390625, "learning_rate": 0.00046305770103842025, "loss": 1.7205350875854493, "step": 113040, "train_bpb": 0.6087808245669194, "train_bytes": 28335.5375, "train_loss_nats_per_token": 1.7215228912920213 }, { "epoch": 0.26375391746332727, "grad_norm": 0.138671875, "learning_rate": 0.0004626071615270634, "loss": 1.6999040603637696, "step": 113060, "train_bpb": 0.6012678551163559, "train_bytes": 28305.75, "train_loss_nats_per_token": 1.700166943325421 }, { "epoch": 0.2638855969028996, "grad_norm": 0.1328125, "learning_rate": 0.00046215680133874777, "loss": 1.7151802062988282, "step": 113080, "train_bpb": 0.6041728996450315, "train_bytes": 28361.9875, "train_loss_nats_per_token": 1.7151248777027377 }, { "epoch": 0.2640172763424719, "grad_norm": 0.1435546875, "learning_rate": 0.00046170662055132293, "loss": 1.709501075744629, "step": 113100, "train_bpb": 0.6045809635391713, "train_bytes": 28138.825, "train_loss_nats_per_token": 1.7099256245983965 }, { "epoch": 0.26414895578204417, "grad_norm": 0.146484375, "learning_rate": 0.00046125661924260587, "loss": 1.7165925979614258, "step": 113120, "train_bpb": 0.6044648919706884, "train_bytes": 28589.1125, "train_loss_nats_per_token": 1.7171746950413338 }, { "epoch": 0.2642806352216165, "grad_norm": 0.1787109375, "learning_rate": 0.0004608067974903838, "loss": 1.7125377655029297, "step": 113140, "train_bpb": 0.607021641994782, "train_bytes": 28186.94375, "train_loss_nats_per_token": 1.713827928701598 }, { "epoch": 0.2644123146611888, "grad_norm": 0.134765625, "learning_rate": 0.00046035715537241285, "loss": 1.713718795776367, "step": 113160, "train_bpb": 0.6044116017877804, "train_bytes": 28511.85625, "train_loss_nats_per_token": 1.7142480187138136 }, { "epoch": 0.2645439941007611, "grad_norm": 0.15234375, "learning_rate": 0.0004599076929664182, "loss": 1.7082695007324218, "step": 113180, "train_bpb": 0.6008047397089323, "train_bytes": 28447.45, "train_loss_nats_per_token": 1.7088103813330124 }, { "epoch": 0.2646756735403334, "grad_norm": 0.138671875, "learning_rate": 0.00045945841035009255, "loss": 1.7149255752563477, "step": 113200, "train_bpb": 0.6092861318267723, "train_bytes": 27931.55625, "train_loss_nats_per_token": 1.7162936463557343 }, { "epoch": 0.2648073529799057, "grad_norm": 0.1396484375, "learning_rate": 0.00045900930760109945, "loss": 1.7101079940795898, "step": 113220, "train_bpb": 0.6015243794537583, "train_bytes": 28886.28125, "train_loss_nats_per_token": 1.7097995673389386 }, { "epoch": 0.264939032419478, "grad_norm": 0.1865234375, "learning_rate": 0.00045856038479707056, "loss": 1.715529441833496, "step": 113240, "train_bpb": 0.6071814368791437, "train_bytes": 28046.04375, "train_loss_nats_per_token": 1.7159290228302058 }, { "epoch": 0.26507071185905035, "grad_norm": 0.1533203125, "learning_rate": 0.0004581116420156059, "loss": 1.7139863967895508, "step": 113260, "train_bpb": 0.6062421504683279, "train_bytes": 28404.54375, "train_loss_nats_per_token": 1.7152852945641712 }, { "epoch": 0.2652023912986226, "grad_norm": 0.1572265625, "learning_rate": 0.00045766307933427485, "loss": 1.7228612899780273, "step": 113280, "train_bpb": 0.6077173328906628, "train_bytes": 28572.76875, "train_loss_nats_per_token": 1.723142367235616 }, { "epoch": 0.2653340707381949, "grad_norm": 0.126953125, "learning_rate": 0.00045721469683061627, "loss": 1.7301368713378906, "step": 113300, "train_bpb": 0.6084341900184179, "train_bytes": 28427.31875, "train_loss_nats_per_token": 1.7306240966971547 }, { "epoch": 0.26546575017776725, "grad_norm": 0.1357421875, "learning_rate": 0.00045676649458213664, "loss": 1.7133804321289063, "step": 113320, "train_bpb": 0.6081095458486077, "train_bytes": 28359.675, "train_loss_nats_per_token": 1.7138349273384883 }, { "epoch": 0.26559742961733956, "grad_norm": 0.181640625, "learning_rate": 0.000456318472666312, "loss": 1.7229740142822265, "step": 113340, "train_bpb": 0.6105089165353005, "train_bytes": 28172.775, "train_loss_nats_per_token": 1.7241168277932564 }, { "epoch": 0.2657291090569118, "grad_norm": 0.1201171875, "learning_rate": 0.0004558706311605872, "loss": 1.7158979415893554, "step": 113360, "train_bpb": 0.6090560712507856, "train_bytes": 27968.35625, "train_loss_nats_per_token": 1.716802217532059 }, { "epoch": 0.26586078849648415, "grad_norm": 0.13671875, "learning_rate": 0.00045542297014237635, "loss": 1.721734619140625, "step": 113380, "train_bpb": 0.6067241091338977, "train_bytes": 28407.83125, "train_loss_nats_per_token": 1.7225922791041404 }, { "epoch": 0.26599246793605646, "grad_norm": 0.1181640625, "learning_rate": 0.0004549754896890608, "loss": 1.7202964782714845, "step": 113400, "train_bpb": 0.6074856120060708, "train_bytes": 28357.075, "train_loss_nats_per_token": 1.7209422398077332 }, { "epoch": 0.2661241473756288, "grad_norm": 0.18359375, "learning_rate": 0.0004545281898779925, "loss": 1.7135528564453124, "step": 113420, "train_bpb": 0.6052719786513064, "train_bytes": 28373.28125, "train_loss_nats_per_token": 1.7138017546886177 }, { "epoch": 0.2662558268152011, "grad_norm": 0.1318359375, "learning_rate": 0.0004540810707864915, "loss": 1.7115644454956054, "step": 113440, "train_bpb": 0.6096391865654823, "train_bytes": 27977.01875, "train_loss_nats_per_token": 1.7134301900233024 }, { "epoch": 0.26638750625477337, "grad_norm": 0.1455078125, "learning_rate": 0.00045363413249184574, "loss": 1.7266912460327148, "step": 113460, "train_bpb": 0.606672275655334, "train_bytes": 28304.4875, "train_loss_nats_per_token": 1.7270534722282052 }, { "epoch": 0.2665191856943457, "grad_norm": 0.146484375, "learning_rate": 0.00045318737507131306, "loss": 1.7155292510986329, "step": 113480, "train_bpb": 0.6035953954846283, "train_bytes": 28560.80625, "train_loss_nats_per_token": 1.7155954108349447 }, { "epoch": 0.266650865133918, "grad_norm": 0.12890625, "learning_rate": 0.00045274079860211996, "loss": 1.712361717224121, "step": 113500, "train_bpb": 0.6058649571684436, "train_bytes": 28172.875, "train_loss_nats_per_token": 1.713633408334182 }, { "epoch": 0.2667825445734903, "grad_norm": 0.142578125, "learning_rate": 0.00045229440316146136, "loss": 1.711868667602539, "step": 113520, "train_bpb": 0.6080084028087712, "train_bytes": 28122.1875, "train_loss_nats_per_token": 1.712159864101532 }, { "epoch": 0.2669142240130626, "grad_norm": 0.1376953125, "learning_rate": 0.00045184818882650036, "loss": 1.7225061416625977, "step": 113540, "train_bpb": 0.6088244306338705, "train_bytes": 28372.1125, "train_loss_nats_per_token": 1.723818832982979 }, { "epoch": 0.2670459034526349, "grad_norm": 0.1435546875, "learning_rate": 0.00045140215567436944, "loss": 1.7262224197387694, "step": 113560, "train_bpb": 0.6109339805455727, "train_bytes": 28117.45, "train_loss_nats_per_token": 1.7271963807835657 }, { "epoch": 0.2671775828922072, "grad_norm": 0.1259765625, "learning_rate": 0.00045095630378217023, "loss": 1.7202932357788085, "step": 113580, "train_bpb": 0.6104706339680245, "train_bytes": 28231.73125, "train_loss_nats_per_token": 1.7204895784013816 }, { "epoch": 0.26730926233177954, "grad_norm": 0.1337890625, "learning_rate": 0.0004505106332269713, "loss": 1.6991752624511718, "step": 113600, "train_bpb": 0.6076966382662468, "train_bytes": 27803.8, "train_loss_nats_per_token": 1.699022441903039 }, { "epoch": 0.2674409417713518, "grad_norm": 0.1962890625, "learning_rate": 0.0004500651440858116, "loss": 1.7134334564208984, "step": 113620, "train_bpb": 0.6069317062161361, "train_bytes": 28111.1375, "train_loss_nats_per_token": 1.7128655163227353 }, { "epoch": 0.2675726212109241, "grad_norm": 0.11767578125, "learning_rate": 0.00044961983643569865, "loss": 1.7225822448730468, "step": 113640, "train_bpb": 0.6124373999791285, "train_bytes": 28318.53125, "train_loss_nats_per_token": 1.7228749859482753 }, { "epoch": 0.26770430065049644, "grad_norm": 0.12060546875, "learning_rate": 0.0004491747103536068, "loss": 1.7134218215942383, "step": 113660, "train_bpb": 0.6060777485602616, "train_bytes": 28424.9625, "train_loss_nats_per_token": 1.7142683364093463 }, { "epoch": 0.26783598009006876, "grad_norm": 0.1611328125, "learning_rate": 0.0004487297659164808, "loss": 1.7203998565673828, "step": 113680, "train_bpb": 0.6077761547020325, "train_bytes": 28302.3, "train_loss_nats_per_token": 1.7209322442666701 }, { "epoch": 0.267967659529641, "grad_norm": 0.1474609375, "learning_rate": 0.0004482850032012338, "loss": 1.7139318466186524, "step": 113700, "train_bpb": 0.604821394056659, "train_bytes": 28571.38125, "train_loss_nats_per_token": 1.7140441814450458 }, { "epoch": 0.26809933896921334, "grad_norm": 0.16015625, "learning_rate": 0.00044784042228474707, "loss": 1.7165063858032226, "step": 113720, "train_bpb": 0.604090914441222, "train_bytes": 28267.06875, "train_loss_nats_per_token": 1.7167791320019845 }, { "epoch": 0.26823101840878566, "grad_norm": 0.1396484375, "learning_rate": 0.0004473960232438701, "loss": 1.7189950942993164, "step": 113740, "train_bpb": 0.6078830570675214, "train_bytes": 28394.76875, "train_loss_nats_per_token": 1.7197516479377037 }, { "epoch": 0.268362697848358, "grad_norm": 0.1435546875, "learning_rate": 0.0004469518061554218, "loss": 1.7304641723632812, "step": 113760, "train_bpb": 0.6120029651264004, "train_bytes": 28699.125, "train_loss_nats_per_token": 1.7313797256618875 }, { "epoch": 0.26849437728793024, "grad_norm": 0.1240234375, "learning_rate": 0.0004465077710961895, "loss": 1.7216175079345704, "step": 113780, "train_bpb": 0.6080754872041422, "train_bytes": 28424.18125, "train_loss_nats_per_token": 1.7225035580929 }, { "epoch": 0.26862605672750256, "grad_norm": 0.16015625, "learning_rate": 0.000446063918142928, "loss": 1.712874984741211, "step": 113800, "train_bpb": 0.607395172290262, "train_bytes": 28020.95, "train_loss_nats_per_token": 1.7135570726862321 }, { "epoch": 0.2687577361670749, "grad_norm": 0.1533203125, "learning_rate": 0.0004456202473723621, "loss": 1.716609573364258, "step": 113820, "train_bpb": 0.606213193226077, "train_bytes": 28191.15625, "train_loss_nats_per_token": 1.7178972460123523 }, { "epoch": 0.2688894156066472, "grad_norm": 0.1640625, "learning_rate": 0.00044517675886118416, "loss": 1.7191993713378906, "step": 113840, "train_bpb": 0.6084580788064012, "train_bytes": 28040.65, "train_loss_nats_per_token": 1.720824419316272 }, { "epoch": 0.26902109504621946, "grad_norm": 0.162109375, "learning_rate": 0.00044473345268605574, "loss": 1.7162294387817383, "step": 113860, "train_bpb": 0.6053623360785676, "train_bytes": 28257.3, "train_loss_nats_per_token": 1.716537823632671 }, { "epoch": 0.2691527744857918, "grad_norm": 0.12451171875, "learning_rate": 0.0004442903289236058, "loss": 1.7215482711791992, "step": 113880, "train_bpb": 0.6094090903934227, "train_bytes": 28203.45625, "train_loss_nats_per_token": 1.7224273879086154 }, { "epoch": 0.2692844539253641, "grad_norm": 0.1533203125, "learning_rate": 0.00044384738765043257, "loss": 1.7140342712402343, "step": 113900, "train_bpb": 0.6067352118773068, "train_bytes": 28289.16875, "train_loss_nats_per_token": 1.7145058171535146 }, { "epoch": 0.2694161333649364, "grad_norm": 0.11181640625, "learning_rate": 0.00044340462894310327, "loss": 1.715474510192871, "step": 113920, "train_bpb": 0.6066727888684618, "train_bytes": 28278.5875, "train_loss_nats_per_token": 1.716450873661507 }, { "epoch": 0.2695478128045087, "grad_norm": 0.154296875, "learning_rate": 0.00044296205287815203, "loss": 1.7226783752441406, "step": 113940, "train_bpb": 0.6101393859078104, "train_bytes": 27968.66875, "train_loss_nats_per_token": 1.7240551813035707 }, { "epoch": 0.269679492244081, "grad_norm": 0.1689453125, "learning_rate": 0.0004425196595320825, "loss": 1.731062126159668, "step": 113960, "train_bpb": 0.6130780960461476, "train_bytes": 28228.58125, "train_loss_nats_per_token": 1.731573170187102 }, { "epoch": 0.2698111716836533, "grad_norm": 0.1357421875, "learning_rate": 0.000442077448981367, "loss": 1.7237489700317383, "step": 113980, "train_bpb": 0.6109245109502628, "train_bytes": 28196.06875, "train_loss_nats_per_token": 1.724765200455909 }, { "epoch": 0.26994285112322564, "grad_norm": 0.216796875, "learning_rate": 0.000441635421302445, "loss": 1.7099153518676757, "step": 114000, "train_bpb": 0.6055746093956114, "train_bytes": 28263.025, "train_loss_nats_per_token": 1.7111042386211976 }, { "epoch": 0.26994285112322564, "eval_loss": 1.530694603919983, "eval_runtime": 72.227, "eval_samples_per_second": 13.845, "eval_steps_per_second": 13.845, "step": 114000, "train_bpb": 0.5401847529394688, "train_bytes": 3589.691, "train_loss_nats_per_token": 1.5382369741537192 } ], "logging_steps": 20, "max_steps": 151884, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.876203156799488e+19, "train_batch_size": 32, "trial_name": null, "trial_params": null }