{ "best_global_step": 43000, "best_metric": 1.4149765968322754, "best_model_checkpoint": "/home/mkurman/gitlab/ai/model-trainer/results/convgpt_v2_long_2d/convgpt_v2_rope_nope_hybrid_clean_h512_l16_seq512_bs8_fullloss_20260523_161605/checkpoint-43000", "epoch": 0.0005, "eval_steps": 1000, "global_step": 51000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00013167943957230517, "grad_norm": 1.5129085779190063, "learning_rate": 1.8762343647136274e-05, "loss": 10.0451, "step": 20 }, { "epoch": 0.00026335887914461035, "grad_norm": 1.4276129007339478, "learning_rate": 3.851217906517446e-05, "loss": 9.11, "step": 40 }, { "epoch": 0.00039503831871691555, "grad_norm": 1.3658931255340576, "learning_rate": 5.8262014483212636e-05, "loss": 8.3876, "step": 60 }, { "epoch": 0.0005267177582892207, "grad_norm": 1.8227916955947876, "learning_rate": 7.801184990125083e-05, "loss": 7.7517, "step": 80 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.8309405446052551, "learning_rate": 9.7761685319289e-05, "loss": 7.1243, "step": 100 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.6047381162643433, "learning_rate": 0.00011751152073732718, "loss": 6.5642, "step": 120 }, { "epoch": 0.0009217560770061363, "grad_norm": 6.724730014801025, "learning_rate": 0.00013726135615536539, "loss": 6.1814, "step": 140 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.4805045425891876, "learning_rate": 0.00015701119157340358, "loss": 5.8953, "step": 160 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.4253923296928406, "learning_rate": 0.00017676102699144174, "loss": 5.656, "step": 180 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.479189395904541, "learning_rate": 0.0001965108624094799, "loss": 5.453, "step": 200 }, { "epoch": 0.001448473835295357, "grad_norm": 0.4821586310863495, "learning_rate": 0.0002162606978275181, "loss": 5.2631, "step": 220 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.5253534913063049, "learning_rate": 0.0002360105332455563, "loss": 5.1262, "step": 240 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.3778499662876129, "learning_rate": 0.0002557603686635945, "loss": 4.9729, "step": 260 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.40282198786735535, "learning_rate": 0.0002755102040816327, "loss": 4.8491, "step": 280 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.40169110894203186, "learning_rate": 0.00029526003949967083, "loss": 4.7163, "step": 300 }, { "epoch": 0.002106871033156883, "grad_norm": 0.4091223180294037, "learning_rate": 0.000315009874917709, "loss": 4.6122, "step": 320 }, { "epoch": 0.002238550472729188, "grad_norm": 0.3836401402950287, "learning_rate": 0.0003347597103357472, "loss": 4.5315, "step": 340 }, { "epoch": 0.002370229912301493, "grad_norm": 0.37077072262763977, "learning_rate": 0.0003545095457537854, "loss": 4.4403, "step": 360 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.3423950970172882, "learning_rate": 0.0003742593811718236, "loss": 4.3758, "step": 380 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.3271167576313019, "learning_rate": 0.00039400921658986173, "loss": 4.2859, "step": 400 }, { "epoch": 0.002765268231018409, "grad_norm": 0.32271647453308105, "learning_rate": 0.0004137590520079, "loss": 4.2281, "step": 420 }, { "epoch": 0.002896947670590714, "grad_norm": 0.3268634080886841, "learning_rate": 0.00043350888742593816, "loss": 4.152, "step": 440 }, { "epoch": 0.003028627110163019, "grad_norm": 0.3095104992389679, "learning_rate": 0.00045325872284397636, "loss": 4.0894, "step": 460 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.33799174427986145, "learning_rate": 0.00047300855826201455, "loss": 4.0365, "step": 480 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.39443933963775635, "learning_rate": 0.0004927583936800527, "loss": 3.9868, "step": 500 }, { "epoch": 0.003423665428879935, "grad_norm": 0.32354313135147095, "learning_rate": 0.0005125082290980909, "loss": 3.9136, "step": 520 }, { "epoch": 0.00355534486845224, "grad_norm": 0.31924670934677124, "learning_rate": 0.0005322580645161291, "loss": 3.8859, "step": 540 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.2883984446525574, "learning_rate": 0.0005520078999341672, "loss": 3.8321, "step": 560 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.31237614154815674, "learning_rate": 0.0005717577353522054, "loss": 3.799, "step": 580 }, { "epoch": 0.003950383187169155, "grad_norm": 0.29551151394844055, "learning_rate": 0.0005915075707702436, "loss": 3.7745, "step": 600 }, { "epoch": 0.004082062626741461, "grad_norm": 0.2833958566188812, "learning_rate": 0.0006112574061882818, "loss": 3.7411, "step": 620 }, { "epoch": 0.004213742066313766, "grad_norm": 0.28037381172180176, "learning_rate": 0.00063100724160632, "loss": 3.6861, "step": 640 }, { "epoch": 0.004345421505886071, "grad_norm": 0.39652886986732483, "learning_rate": 0.0006507570770243582, "loss": 3.6568, "step": 660 }, { "epoch": 0.004477100945458376, "grad_norm": 0.2646957337856293, "learning_rate": 0.0006705069124423963, "loss": 3.6185, "step": 680 }, { "epoch": 0.004608780385030682, "grad_norm": 0.2843409478664398, "learning_rate": 0.0006902567478604345, "loss": 3.5845, "step": 700 }, { "epoch": 0.004740459824602986, "grad_norm": 0.27913448214530945, "learning_rate": 0.0007100065832784727, "loss": 3.5546, "step": 720 }, { "epoch": 0.004872139264175292, "grad_norm": 0.2710491418838501, "learning_rate": 0.0007297564186965109, "loss": 3.5176, "step": 740 }, { "epoch": 0.005003818703747597, "grad_norm": 0.28077027201652527, "learning_rate": 0.0007495062541145491, "loss": 3.497, "step": 760 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.27605777978897095, "learning_rate": 0.0007692560895325872, "loss": 3.4649, "step": 780 }, { "epoch": 0.005267177582892207, "grad_norm": 0.29779553413391113, "learning_rate": 0.0007890059249506255, "loss": 3.4509, "step": 800 }, { "epoch": 0.005398857022464512, "grad_norm": 0.3055330812931061, "learning_rate": 0.0008087557603686636, "loss": 3.4085, "step": 820 }, { "epoch": 0.005530536462036818, "grad_norm": 0.26349249482154846, "learning_rate": 0.0008285055957867019, "loss": 3.3842, "step": 840 }, { "epoch": 0.005662215901609122, "grad_norm": 0.2677903175354004, "learning_rate": 0.00084825543120474, "loss": 3.3555, "step": 860 }, { "epoch": 0.005793895341181428, "grad_norm": 0.2856537699699402, "learning_rate": 0.0008680052666227783, "loss": 3.3358, "step": 880 }, { "epoch": 0.005925574780753733, "grad_norm": 0.2631045877933502, "learning_rate": 0.0008877551020408163, "loss": 3.3164, "step": 900 }, { "epoch": 0.006057254220326038, "grad_norm": 0.2708953619003296, "learning_rate": 0.0009075049374588546, "loss": 3.2944, "step": 920 }, { "epoch": 0.006188933659898343, "grad_norm": 0.24445629119873047, "learning_rate": 0.0009272547728768927, "loss": 3.2718, "step": 940 }, { "epoch": 0.006320613099470649, "grad_norm": 0.2704775035381317, "learning_rate": 0.0009470046082949309, "loss": 3.249, "step": 960 }, { "epoch": 0.006452292539042954, "grad_norm": 0.25395041704177856, "learning_rate": 0.000966754443712969, "loss": 3.2161, "step": 980 }, { "epoch": 0.006583971978615259, "grad_norm": 0.2632465064525604, "learning_rate": 0.0009865042791310074, "loss": 3.1973, "step": 1000 }, { "epoch": 0.006583971978615259, "eval_loss": 3.229322671890259, "eval_runtime": 68.051, "eval_samples_per_second": 14.695, "eval_steps_per_second": 14.695, "step": 1000 }, { "epoch": 0.006715651418187564, "grad_norm": 0.268993079662323, "learning_rate": 0.0010062541145490454, "loss": 3.1752, "step": 1020 }, { "epoch": 0.00684733085775987, "grad_norm": 0.2427850067615509, "learning_rate": 0.0010260039499670837, "loss": 3.1407, "step": 1040 }, { "epoch": 0.006979010297332174, "grad_norm": 0.2634700834751129, "learning_rate": 0.0010457537853851217, "loss": 3.122, "step": 1060 }, { "epoch": 0.00711068973690448, "grad_norm": 0.23194676637649536, "learning_rate": 0.00106550362080316, "loss": 3.0935, "step": 1080 }, { "epoch": 0.007242369176476785, "grad_norm": 0.25881442427635193, "learning_rate": 0.0010852534562211982, "loss": 3.0758, "step": 1100 }, { "epoch": 0.0073740486160490904, "grad_norm": 0.2772982716560364, "learning_rate": 0.0011050032916392364, "loss": 3.0621, "step": 1120 }, { "epoch": 0.007505728055621395, "grad_norm": 0.25508975982666016, "learning_rate": 0.0011247531270572745, "loss": 3.0338, "step": 1140 }, { "epoch": 0.007637407495193701, "grad_norm": 0.2273252010345459, "learning_rate": 0.0011445029624753127, "loss": 3.0122, "step": 1160 }, { "epoch": 0.007769086934766006, "grad_norm": 0.25050970911979675, "learning_rate": 0.001164252797893351, "loss": 3.0121, "step": 1180 }, { "epoch": 0.00790076637433831, "grad_norm": 0.24488165974617004, "learning_rate": 0.0011840026333113892, "loss": 2.9993, "step": 1200 }, { "epoch": 0.008032445813910615, "grad_norm": 0.23485834896564484, "learning_rate": 0.0012037524687294272, "loss": 2.9679, "step": 1220 }, { "epoch": 0.008164125253482922, "grad_norm": 0.23405972123146057, "learning_rate": 0.0012235023041474655, "loss": 2.9485, "step": 1240 }, { "epoch": 0.008295804693055226, "grad_norm": 0.20557770133018494, "learning_rate": 0.0012432521395655035, "loss": 2.931, "step": 1260 }, { "epoch": 0.008427484132627531, "grad_norm": 0.22637082636356354, "learning_rate": 0.001263001974983542, "loss": 2.9185, "step": 1280 }, { "epoch": 0.008559163572199836, "grad_norm": 0.21511614322662354, "learning_rate": 0.00128275181040158, "loss": 2.9059, "step": 1300 }, { "epoch": 0.008690843011772142, "grad_norm": 0.20529645681381226, "learning_rate": 0.0013025016458196182, "loss": 2.8874, "step": 1320 }, { "epoch": 0.008822522451344447, "grad_norm": 0.19764812290668488, "learning_rate": 0.0013222514812376563, "loss": 2.8646, "step": 1340 }, { "epoch": 0.008954201890916752, "grad_norm": 0.2055043876171112, "learning_rate": 0.0013420013166556945, "loss": 2.849, "step": 1360 }, { "epoch": 0.009085881330489057, "grad_norm": 0.1990618258714676, "learning_rate": 0.0013617511520737328, "loss": 2.8303, "step": 1380 }, { "epoch": 0.009217560770061363, "grad_norm": 0.19160950183868408, "learning_rate": 0.001381500987491771, "loss": 2.827, "step": 1400 }, { "epoch": 0.009349240209633668, "grad_norm": 0.19032776355743408, "learning_rate": 0.001401250822909809, "loss": 2.8059, "step": 1420 }, { "epoch": 0.009480919649205973, "grad_norm": 0.18810242414474487, "learning_rate": 0.0014210006583278473, "loss": 2.8056, "step": 1440 }, { "epoch": 0.009612599088778278, "grad_norm": 0.18992900848388672, "learning_rate": 0.0014407504937458853, "loss": 2.7846, "step": 1460 }, { "epoch": 0.009744278528350584, "grad_norm": 0.18800954520702362, "learning_rate": 0.0014605003291639238, "loss": 2.7688, "step": 1480 }, { "epoch": 0.009875957967922889, "grad_norm": 0.19007734954357147, "learning_rate": 0.0014802501645819618, "loss": 2.7639, "step": 1500 }, { "epoch": 0.010007637407495194, "grad_norm": 0.18421195447444916, "learning_rate": 0.0015, "loss": 2.7567, "step": 1520 }, { "epoch": 0.010139316847067498, "grad_norm": 0.182477667927742, "learning_rate": 0.001519749835418038, "loss": 2.7508, "step": 1540 }, { "epoch": 0.010270996286639805, "grad_norm": 0.18245883285999298, "learning_rate": 0.0015394996708360765, "loss": 2.7286, "step": 1560 }, { "epoch": 0.01040267572621211, "grad_norm": 0.18001046776771545, "learning_rate": 0.0015592495062541148, "loss": 2.7224, "step": 1580 }, { "epoch": 0.010534355165784414, "grad_norm": 0.17572300136089325, "learning_rate": 0.0015789993416721528, "loss": 2.7126, "step": 1600 }, { "epoch": 0.01066603460535672, "grad_norm": 0.17919962108135223, "learning_rate": 0.0015987491770901908, "loss": 2.7043, "step": 1620 }, { "epoch": 0.010797714044929024, "grad_norm": 0.17204663157463074, "learning_rate": 0.0016184990125082293, "loss": 2.6945, "step": 1640 }, { "epoch": 0.01092939348450133, "grad_norm": 0.17742666602134705, "learning_rate": 0.0016382488479262673, "loss": 2.6981, "step": 1660 }, { "epoch": 0.011061072924073635, "grad_norm": 0.18275167047977448, "learning_rate": 0.0016579986833443056, "loss": 2.6782, "step": 1680 }, { "epoch": 0.01119275236364594, "grad_norm": 0.18246972560882568, "learning_rate": 0.0016777485187623436, "loss": 2.6805, "step": 1700 }, { "epoch": 0.011324431803218245, "grad_norm": 0.17320232093334198, "learning_rate": 0.001697498354180382, "loss": 2.6698, "step": 1720 }, { "epoch": 0.011456111242790551, "grad_norm": 0.16316188871860504, "learning_rate": 0.00171724818959842, "loss": 2.6563, "step": 1740 }, { "epoch": 0.011587790682362856, "grad_norm": 0.17399418354034424, "learning_rate": 0.001736998025016458, "loss": 2.6639, "step": 1760 }, { "epoch": 0.01171947012193516, "grad_norm": 0.16352471709251404, "learning_rate": 0.0017567478604344963, "loss": 2.6778, "step": 1780 }, { "epoch": 0.011851149561507466, "grad_norm": 0.167058527469635, "learning_rate": 0.0017764976958525348, "loss": 2.6616, "step": 1800 }, { "epoch": 0.011982829001079772, "grad_norm": 0.18267591297626495, "learning_rate": 0.0017962475312705728, "loss": 2.6714, "step": 1820 }, { "epoch": 0.012114508440652077, "grad_norm": 0.17048963904380798, "learning_rate": 0.0018159973666886109, "loss": 2.6543, "step": 1840 }, { "epoch": 0.012246187880224382, "grad_norm": 0.16198118031024933, "learning_rate": 0.0018357472021066491, "loss": 2.6529, "step": 1860 }, { "epoch": 0.012377867319796686, "grad_norm": 0.1616767942905426, "learning_rate": 0.0018554970375246874, "loss": 2.6387, "step": 1880 }, { "epoch": 0.012509546759368993, "grad_norm": 0.1541590839624405, "learning_rate": 0.0018752468729427256, "loss": 2.6181, "step": 1900 }, { "epoch": 0.012641226198941298, "grad_norm": 0.15989308059215546, "learning_rate": 0.0018949967083607636, "loss": 2.6226, "step": 1920 }, { "epoch": 0.012772905638513602, "grad_norm": 0.1667192429304123, "learning_rate": 0.0019147465437788017, "loss": 2.6192, "step": 1940 }, { "epoch": 0.012904585078085907, "grad_norm": 0.15245971083641052, "learning_rate": 0.0019344963791968401, "loss": 2.6103, "step": 1960 }, { "epoch": 0.013036264517658214, "grad_norm": 0.16327407956123352, "learning_rate": 0.001954246214614878, "loss": 2.5959, "step": 1980 }, { "epoch": 0.013167943957230518, "grad_norm": 0.1521947681903839, "learning_rate": 0.001973996050032916, "loss": 2.5968, "step": 2000 }, { "epoch": 0.013167943957230518, "eval_loss": 2.627993106842041, "eval_runtime": 67.8897, "eval_samples_per_second": 14.73, "eval_steps_per_second": 14.73, "step": 2000 }, { "epoch": 0.013299623396802823, "grad_norm": 0.14737296104431152, "learning_rate": 0.0019937458854509546, "loss": 2.5906, "step": 2020 }, { "epoch": 0.013431302836375128, "grad_norm": 0.1449994295835495, "learning_rate": 0.002013495720868993, "loss": 2.5751, "step": 2040 }, { "epoch": 0.013562982275947433, "grad_norm": 0.15211527049541473, "learning_rate": 0.002033245556287031, "loss": 2.5802, "step": 2060 }, { "epoch": 0.01369466171551974, "grad_norm": 0.1509827822446823, "learning_rate": 0.002052995391705069, "loss": 2.5624, "step": 2080 }, { "epoch": 0.013826341155092044, "grad_norm": 0.1424606740474701, "learning_rate": 0.002072745227123107, "loss": 2.5616, "step": 2100 }, { "epoch": 0.013958020594664349, "grad_norm": 0.1456785947084427, "learning_rate": 0.0020924950625411456, "loss": 2.5614, "step": 2120 }, { "epoch": 0.014089700034236654, "grad_norm": 0.1454639583826065, "learning_rate": 0.0021122448979591837, "loss": 2.548, "step": 2140 }, { "epoch": 0.01422137947380896, "grad_norm": 0.15996553003787994, "learning_rate": 0.0021319947333772217, "loss": 2.5564, "step": 2160 }, { "epoch": 0.014353058913381265, "grad_norm": 0.14995744824409485, "learning_rate": 0.0021517445687952597, "loss": 2.537, "step": 2180 }, { "epoch": 0.01448473835295357, "grad_norm": 0.1442878395318985, "learning_rate": 0.002171494404213298, "loss": 2.5322, "step": 2200 }, { "epoch": 0.014616417792525874, "grad_norm": 0.14572259783744812, "learning_rate": 0.0021912442396313367, "loss": 2.5248, "step": 2220 }, { "epoch": 0.014748097232098181, "grad_norm": 0.14792700111865997, "learning_rate": 0.0022109940750493747, "loss": 2.5214, "step": 2240 }, { "epoch": 0.014879776671670486, "grad_norm": 0.13958069682121277, "learning_rate": 0.0022307439104674127, "loss": 2.5081, "step": 2260 }, { "epoch": 0.01501145611124279, "grad_norm": 0.1351982206106186, "learning_rate": 0.002250493745885451, "loss": 2.5116, "step": 2280 }, { "epoch": 0.015143135550815095, "grad_norm": 0.14376430213451385, "learning_rate": 0.002270243581303489, "loss": 2.4984, "step": 2300 }, { "epoch": 0.015274814990387402, "grad_norm": 0.15098074078559875, "learning_rate": 0.0022899934167215272, "loss": 2.4982, "step": 2320 }, { "epoch": 0.015406494429959706, "grad_norm": 0.13247129321098328, "learning_rate": 0.0023097432521395657, "loss": 2.4841, "step": 2340 }, { "epoch": 0.015538173869532011, "grad_norm": 0.14014942944049835, "learning_rate": 0.0023294930875576037, "loss": 2.4941, "step": 2360 }, { "epoch": 0.015669853309104316, "grad_norm": 0.13669346272945404, "learning_rate": 0.0023492429229756417, "loss": 2.5085, "step": 2380 }, { "epoch": 0.01580153274867662, "grad_norm": 0.12908074259757996, "learning_rate": 0.00236899275839368, "loss": 2.4982, "step": 2400 }, { "epoch": 0.015933212188248926, "grad_norm": 0.12701626121997833, "learning_rate": 0.0023887425938117182, "loss": 2.4868, "step": 2420 }, { "epoch": 0.01606489162782123, "grad_norm": 0.13361623883247375, "learning_rate": 0.0024084924292297567, "loss": 2.4894, "step": 2440 }, { "epoch": 0.01619657106739354, "grad_norm": 0.12999138236045837, "learning_rate": 0.0024282422646477947, "loss": 2.4742, "step": 2460 }, { "epoch": 0.016328250506965843, "grad_norm": 0.12473666667938232, "learning_rate": 0.0024479921000658328, "loss": 2.466, "step": 2480 }, { "epoch": 0.016459929946538148, "grad_norm": 0.12962856888771057, "learning_rate": 0.002467741935483871, "loss": 2.4635, "step": 2500 }, { "epoch": 0.016591609386110453, "grad_norm": 0.13669155538082123, "learning_rate": 0.0024874917709019092, "loss": 2.4574, "step": 2520 }, { "epoch": 0.016723288825682758, "grad_norm": 0.1261315792798996, "learning_rate": 0.0025072416063199473, "loss": 2.4559, "step": 2540 }, { "epoch": 0.016854968265255062, "grad_norm": 0.1260860413312912, "learning_rate": 0.0025269914417379853, "loss": 2.4436, "step": 2560 }, { "epoch": 0.016986647704827367, "grad_norm": 0.11925692856311798, "learning_rate": 0.0025467412771560238, "loss": 2.4467, "step": 2580 }, { "epoch": 0.017118327144399672, "grad_norm": 0.12199912220239639, "learning_rate": 0.002566491112574062, "loss": 2.4395, "step": 2600 }, { "epoch": 0.01725000658397198, "grad_norm": 0.13121625781059265, "learning_rate": 0.0025862409479921003, "loss": 2.4364, "step": 2620 }, { "epoch": 0.017381686023544285, "grad_norm": 0.1242750957608223, "learning_rate": 0.0026059907834101383, "loss": 2.425, "step": 2640 }, { "epoch": 0.01751336546311659, "grad_norm": 0.11995479464530945, "learning_rate": 0.0026257406188281767, "loss": 2.4223, "step": 2660 }, { "epoch": 0.017645044902688894, "grad_norm": 0.11676183342933655, "learning_rate": 0.0026454904542462148, "loss": 2.4124, "step": 2680 }, { "epoch": 0.0177767243422612, "grad_norm": 0.11701571941375732, "learning_rate": 0.002665240289664253, "loss": 2.4044, "step": 2700 }, { "epoch": 0.017908403781833504, "grad_norm": 0.1141498014330864, "learning_rate": 0.002684990125082291, "loss": 2.4086, "step": 2720 }, { "epoch": 0.01804008322140581, "grad_norm": 0.11457623541355133, "learning_rate": 0.0027047399605003293, "loss": 2.405, "step": 2740 }, { "epoch": 0.018171762660978114, "grad_norm": 0.11170320957899094, "learning_rate": 0.0027244897959183673, "loss": 2.4041, "step": 2760 }, { "epoch": 0.018303442100550422, "grad_norm": 0.11429501324892044, "learning_rate": 0.0027442396313364053, "loss": 2.3886, "step": 2780 }, { "epoch": 0.018435121540122727, "grad_norm": 0.11575177311897278, "learning_rate": 0.002763989466754444, "loss": 2.3928, "step": 2800 }, { "epoch": 0.01856680097969503, "grad_norm": 0.11174377053976059, "learning_rate": 0.0027837393021724823, "loss": 2.3923, "step": 2820 }, { "epoch": 0.018698480419267336, "grad_norm": 0.11565430462360382, "learning_rate": 0.0028034891375905203, "loss": 2.3876, "step": 2840 }, { "epoch": 0.01883015985883964, "grad_norm": 0.1113847866654396, "learning_rate": 0.0028232389730085583, "loss": 2.3715, "step": 2860 }, { "epoch": 0.018961839298411946, "grad_norm": 0.11279511451721191, "learning_rate": 0.0028429888084265964, "loss": 2.3877, "step": 2880 }, { "epoch": 0.01909351873798425, "grad_norm": 0.10945755243301392, "learning_rate": 0.002862738643844635, "loss": 2.3713, "step": 2900 }, { "epoch": 0.019225198177556555, "grad_norm": 0.11334076523780823, "learning_rate": 0.002882488479262673, "loss": 2.3714, "step": 2920 }, { "epoch": 0.01935687761712886, "grad_norm": 0.11575334519147873, "learning_rate": 0.002902238314680711, "loss": 2.3841, "step": 2940 }, { "epoch": 0.019488557056701168, "grad_norm": 0.10688841342926025, "learning_rate": 0.002921988150098749, "loss": 2.4039, "step": 2960 }, { "epoch": 0.019620236496273473, "grad_norm": 0.10941021889448166, "learning_rate": 0.0029417379855167874, "loss": 2.4104, "step": 2980 }, { "epoch": 0.019751915935845778, "grad_norm": 0.10736847668886185, "learning_rate": 0.002961487820934826, "loss": 2.4152, "step": 3000 }, { "epoch": 0.019751915935845778, "eval_loss": 2.4375340938568115, "eval_runtime": 68.5796, "eval_samples_per_second": 14.582, "eval_steps_per_second": 14.582, "step": 3000 }, { "epoch": 0.019883595375418082, "grad_norm": 0.10122061520814896, "learning_rate": 0.002981237656352864, "loss": 2.4102, "step": 3020 }, { "epoch": 0.020015274814990387, "grad_norm": 0.10470600426197052, "learning_rate": 0.002999999999665892, "loss": 2.4042, "step": 3040 }, { "epoch": 0.020146954254562692, "grad_norm": 0.10254276543855667, "learning_rate": 0.002999999852658443, "loss": 2.4062, "step": 3060 }, { "epoch": 0.020278633694134997, "grad_norm": 0.10125599801540375, "learning_rate": 0.0029999994383647483, "loss": 2.3965, "step": 3080 }, { "epoch": 0.0204103131337073, "grad_norm": 0.10337845981121063, "learning_rate": 0.0029999987567848824, "loss": 2.3924, "step": 3100 }, { "epoch": 0.02054199257327961, "grad_norm": 0.09914848208427429, "learning_rate": 0.002999997807918967, "loss": 2.3903, "step": 3120 }, { "epoch": 0.020673672012851915, "grad_norm": 0.10522714257240295, "learning_rate": 0.0029999965917671696, "loss": 2.3765, "step": 3140 }, { "epoch": 0.02080535145242422, "grad_norm": 0.10708487033843994, "learning_rate": 0.0029999951083297086, "loss": 2.3739, "step": 3160 }, { "epoch": 0.020937030891996524, "grad_norm": 0.09805380553007126, "learning_rate": 0.002999993357606847, "loss": 2.3596, "step": 3180 }, { "epoch": 0.02106871033156883, "grad_norm": 0.09819849580526352, "learning_rate": 0.002999991339598898, "loss": 2.3597, "step": 3200 }, { "epoch": 0.021200389771141134, "grad_norm": 0.09890013933181763, "learning_rate": 0.0029999890543062208, "loss": 2.3504, "step": 3220 }, { "epoch": 0.02133206921071344, "grad_norm": 0.09736858308315277, "learning_rate": 0.002999986501729222, "loss": 2.3472, "step": 3240 }, { "epoch": 0.021463748650285743, "grad_norm": 0.09881199896335602, "learning_rate": 0.002999983681868357, "loss": 2.3522, "step": 3260 }, { "epoch": 0.021595428089858048, "grad_norm": 0.09606959670782089, "learning_rate": 0.0029999805947241278, "loss": 2.3455, "step": 3280 }, { "epoch": 0.021727107529430356, "grad_norm": 0.09520818293094635, "learning_rate": 0.0029999772402970856, "loss": 2.3422, "step": 3300 }, { "epoch": 0.02185878696900266, "grad_norm": 0.09379695355892181, "learning_rate": 0.0029999736185878268, "loss": 2.3387, "step": 3320 }, { "epoch": 0.021990466408574966, "grad_norm": 0.0959760919213295, "learning_rate": 0.0029999697295969977, "loss": 2.3281, "step": 3340 }, { "epoch": 0.02212214584814727, "grad_norm": 0.0942387580871582, "learning_rate": 0.002999965573325291, "loss": 2.3259, "step": 3360 }, { "epoch": 0.022253825287719575, "grad_norm": 0.09221373498439789, "learning_rate": 0.002999961149773447, "loss": 2.3186, "step": 3380 }, { "epoch": 0.02238550472729188, "grad_norm": 0.08974644541740417, "learning_rate": 0.0029999564589422542, "loss": 2.3115, "step": 3400 }, { "epoch": 0.022517184166864185, "grad_norm": 0.09186951071023941, "learning_rate": 0.0029999515008325484, "loss": 2.3165, "step": 3420 }, { "epoch": 0.02264886360643649, "grad_norm": 0.08975733816623688, "learning_rate": 0.002999946275445213, "loss": 2.3027, "step": 3440 }, { "epoch": 0.022780543046008798, "grad_norm": 0.08940092474222183, "learning_rate": 0.0029999407827811797, "loss": 2.3092, "step": 3460 }, { "epoch": 0.022912222485581103, "grad_norm": 0.08854611217975616, "learning_rate": 0.0029999350228414262, "loss": 2.3091, "step": 3480 }, { "epoch": 0.023043901925153407, "grad_norm": 0.10679975897073746, "learning_rate": 0.0029999289956269804, "loss": 2.2952, "step": 3500 }, { "epoch": 0.023175581364725712, "grad_norm": 0.08808766305446625, "learning_rate": 0.002999922701138914, "loss": 2.294, "step": 3520 }, { "epoch": 0.023307260804298017, "grad_norm": 0.0875706821680069, "learning_rate": 0.0029999161393783513, "loss": 2.2998, "step": 3540 }, { "epoch": 0.02343894024387032, "grad_norm": 0.0930817723274231, "learning_rate": 0.0029999093103464593, "loss": 2.302, "step": 3560 }, { "epoch": 0.023570619683442626, "grad_norm": 0.08741556853055954, "learning_rate": 0.0029999022140444562, "loss": 2.2977, "step": 3580 }, { "epoch": 0.02370229912301493, "grad_norm": 0.08739639818668365, "learning_rate": 0.002999894850473606, "loss": 2.2979, "step": 3600 }, { "epoch": 0.023833978562587236, "grad_norm": 0.08801335841417313, "learning_rate": 0.0029998872196352207, "loss": 2.2972, "step": 3620 }, { "epoch": 0.023965658002159544, "grad_norm": 0.08532336354255676, "learning_rate": 0.0029998793215306606, "loss": 2.2853, "step": 3640 }, { "epoch": 0.02409733744173185, "grad_norm": 0.08780607581138611, "learning_rate": 0.0029998711561613324, "loss": 2.2747, "step": 3660 }, { "epoch": 0.024229016881304154, "grad_norm": 0.08572492003440857, "learning_rate": 0.0029998627235286917, "loss": 2.2817, "step": 3680 }, { "epoch": 0.02436069632087646, "grad_norm": 0.0868530198931694, "learning_rate": 0.0029998540236342405, "loss": 2.2666, "step": 3700 }, { "epoch": 0.024492375760448763, "grad_norm": 0.0859028622508049, "learning_rate": 0.00299984505647953, "loss": 2.2736, "step": 3720 }, { "epoch": 0.024624055200021068, "grad_norm": 0.08333039283752441, "learning_rate": 0.0029998358220661566, "loss": 2.264, "step": 3740 }, { "epoch": 0.024755734639593373, "grad_norm": 0.08496104925870895, "learning_rate": 0.002999826320395767, "loss": 2.2508, "step": 3760 }, { "epoch": 0.024887414079165678, "grad_norm": 0.08279310911893845, "learning_rate": 0.002999816551470054, "loss": 2.2428, "step": 3780 }, { "epoch": 0.025019093518737986, "grad_norm": 0.08103163540363312, "learning_rate": 0.0029998065152907582, "loss": 2.2534, "step": 3800 }, { "epoch": 0.02515077295831029, "grad_norm": 0.08208036422729492, "learning_rate": 0.002999796211859668, "loss": 2.244, "step": 3820 }, { "epoch": 0.025282452397882595, "grad_norm": 0.08271029591560364, "learning_rate": 0.0029997856411786194, "loss": 2.2451, "step": 3840 }, { "epoch": 0.0254141318374549, "grad_norm": 0.08439147472381592, "learning_rate": 0.002999774803249496, "loss": 2.2411, "step": 3860 }, { "epoch": 0.025545811277027205, "grad_norm": 0.08189237862825394, "learning_rate": 0.0029997636980742294, "loss": 2.2461, "step": 3880 }, { "epoch": 0.02567749071659951, "grad_norm": 0.08077215403318405, "learning_rate": 0.002999752325654798, "loss": 2.2334, "step": 3900 }, { "epoch": 0.025809170156171814, "grad_norm": 0.07819052785634995, "learning_rate": 0.002999740685993228, "loss": 2.2288, "step": 3920 }, { "epoch": 0.02594084959574412, "grad_norm": 0.08109986782073975, "learning_rate": 0.002999728779091594, "loss": 2.2333, "step": 3940 }, { "epoch": 0.026072529035316427, "grad_norm": 0.0791846290230751, "learning_rate": 0.0029997166049520172, "loss": 2.2197, "step": 3960 }, { "epoch": 0.026204208474888732, "grad_norm": 0.08189737796783447, "learning_rate": 0.0029997041635766676, "loss": 2.2204, "step": 3980 }, { "epoch": 0.026335887914461037, "grad_norm": 0.08211075514554977, "learning_rate": 0.0029996914549677615, "loss": 2.2199, "step": 4000 }, { "epoch": 0.026335887914461037, "eval_loss": 2.2871885299682617, "eval_runtime": 67.7873, "eval_samples_per_second": 14.752, "eval_steps_per_second": 14.752, "step": 4000 }, { "epoch": 0.02646756735403334, "grad_norm": 0.08011506497859955, "learning_rate": 0.0029996784791275636, "loss": 2.211, "step": 4020 }, { "epoch": 0.026599246793605646, "grad_norm": 0.08271001279354095, "learning_rate": 0.0029996652360583863, "loss": 2.2097, "step": 4040 }, { "epoch": 0.02673092623317795, "grad_norm": 0.08106506615877151, "learning_rate": 0.0029996517257625892, "loss": 2.2117, "step": 4060 }, { "epoch": 0.026862605672750256, "grad_norm": 0.08120162785053253, "learning_rate": 0.0029996379482425803, "loss": 2.2011, "step": 4080 }, { "epoch": 0.02699428511232256, "grad_norm": 0.07838305830955505, "learning_rate": 0.002999623903500814, "loss": 2.209, "step": 4100 }, { "epoch": 0.027125964551894866, "grad_norm": 0.07733200490474701, "learning_rate": 0.0029996095915397927, "loss": 2.2049, "step": 4120 }, { "epoch": 0.027257643991467174, "grad_norm": 0.08035876601934433, "learning_rate": 0.002999595012362067, "loss": 2.2351, "step": 4140 }, { "epoch": 0.02738932343103948, "grad_norm": 0.07693365216255188, "learning_rate": 0.0029995801659702353, "loss": 2.2437, "step": 4160 }, { "epoch": 0.027521002870611783, "grad_norm": 0.07832279056310654, "learning_rate": 0.002999565052366942, "loss": 2.2516, "step": 4180 }, { "epoch": 0.027652682310184088, "grad_norm": 0.07737457007169724, "learning_rate": 0.0029995496715548814, "loss": 2.2528, "step": 4200 }, { "epoch": 0.027784361749756393, "grad_norm": 0.07880548387765884, "learning_rate": 0.0029995340235367935, "loss": 2.2481, "step": 4220 }, { "epoch": 0.027916041189328698, "grad_norm": 0.07748763263225555, "learning_rate": 0.0029995181083154665, "loss": 2.2366, "step": 4240 }, { "epoch": 0.028047720628901002, "grad_norm": 0.07669378817081451, "learning_rate": 0.0029995019258937366, "loss": 2.2354, "step": 4260 }, { "epoch": 0.028179400068473307, "grad_norm": 0.07612152397632599, "learning_rate": 0.0029994854762744874, "loss": 2.2306, "step": 4280 }, { "epoch": 0.028311079508045615, "grad_norm": 0.07380878925323486, "learning_rate": 0.0029994687594606505, "loss": 2.2222, "step": 4300 }, { "epoch": 0.02844275894761792, "grad_norm": 0.08108644932508469, "learning_rate": 0.0029994517754552037, "loss": 2.2188, "step": 4320 }, { "epoch": 0.028574438387190225, "grad_norm": 0.07742933928966522, "learning_rate": 0.002999434524261174, "loss": 2.2244, "step": 4340 }, { "epoch": 0.02870611782676253, "grad_norm": 0.07378648966550827, "learning_rate": 0.0029994170058816358, "loss": 2.2179, "step": 4360 }, { "epoch": 0.028837797266334834, "grad_norm": 0.07612361758947372, "learning_rate": 0.0029993992203197098, "loss": 2.215, "step": 4380 }, { "epoch": 0.02896947670590714, "grad_norm": 0.07602405548095703, "learning_rate": 0.0029993811675785654, "loss": 2.2174, "step": 4400 }, { "epoch": 0.029101156145479444, "grad_norm": 0.07372742891311646, "learning_rate": 0.00299936284766142, "loss": 2.2115, "step": 4420 }, { "epoch": 0.02923283558505175, "grad_norm": 0.07210436463356018, "learning_rate": 0.002999344260571538, "loss": 2.2031, "step": 4440 }, { "epoch": 0.029364515024624054, "grad_norm": 0.07500762492418289, "learning_rate": 0.002999325406312231, "loss": 2.2029, "step": 4460 }, { "epoch": 0.029496194464196362, "grad_norm": 0.0756341964006424, "learning_rate": 0.0029993062848868582, "loss": 2.2036, "step": 4480 }, { "epoch": 0.029627873903768667, "grad_norm": 0.07349260151386261, "learning_rate": 0.0029992868962988284, "loss": 2.199, "step": 4500 }, { "epoch": 0.02975955334334097, "grad_norm": 0.07115154713392258, "learning_rate": 0.002999267240551595, "loss": 2.1924, "step": 4520 }, { "epoch": 0.029891232782913276, "grad_norm": 0.07597554475069046, "learning_rate": 0.0029992473176486613, "loss": 2.2, "step": 4540 }, { "epoch": 0.03002291222248558, "grad_norm": 0.07525033503770828, "learning_rate": 0.0029992271275935773, "loss": 2.19, "step": 4560 }, { "epoch": 0.030154591662057886, "grad_norm": 0.07225248217582703, "learning_rate": 0.0029992066703899405, "loss": 2.1817, "step": 4580 }, { "epoch": 0.03028627110163019, "grad_norm": 0.07293014973402023, "learning_rate": 0.002999185946041396, "loss": 2.1886, "step": 4600 }, { "epoch": 0.030417950541202495, "grad_norm": 0.07140370458364487, "learning_rate": 0.002999164954551637, "loss": 2.1811, "step": 4620 }, { "epoch": 0.030549629980774803, "grad_norm": 0.0731213241815567, "learning_rate": 0.0029991436959244037, "loss": 2.1827, "step": 4640 }, { "epoch": 0.030681309420347108, "grad_norm": 0.06939541548490524, "learning_rate": 0.0029991221701634843, "loss": 2.1807, "step": 4660 }, { "epoch": 0.030812988859919413, "grad_norm": 0.0718071386218071, "learning_rate": 0.0029991003772727146, "loss": 2.1807, "step": 4680 }, { "epoch": 0.030944668299491718, "grad_norm": 0.0721597746014595, "learning_rate": 0.002999078317255978, "loss": 2.1679, "step": 4700 }, { "epoch": 0.031076347739064022, "grad_norm": 0.388390451669693, "learning_rate": 0.0029990559901172053, "loss": 2.4076, "step": 4720 }, { "epoch": 0.031208027178636327, "grad_norm": 0.12360863387584686, "learning_rate": 0.0029990333958603748, "loss": 2.7131, "step": 4740 }, { "epoch": 0.03133970661820863, "grad_norm": 0.088360495865345, "learning_rate": 0.002999010534489513, "loss": 2.425, "step": 4760 }, { "epoch": 0.03147138605778094, "grad_norm": 0.07668942958116531, "learning_rate": 0.002998987406008693, "loss": 2.3163, "step": 4780 }, { "epoch": 0.03160306549735324, "grad_norm": 0.07627064734697342, "learning_rate": 0.0029989640104220363, "loss": 2.2667, "step": 4800 }, { "epoch": 0.031734744936925546, "grad_norm": 0.07259105890989304, "learning_rate": 0.0029989403477337123, "loss": 2.2479, "step": 4820 }, { "epoch": 0.03186642437649785, "grad_norm": 0.06848350912332535, "learning_rate": 0.0029989164179479366, "loss": 2.2312, "step": 4840 }, { "epoch": 0.031998103816070156, "grad_norm": 0.0695989802479744, "learning_rate": 0.0029988922210689743, "loss": 2.2274, "step": 4860 }, { "epoch": 0.03212978325564246, "grad_norm": 0.07058060169219971, "learning_rate": 0.002998867757101136, "loss": 2.2065, "step": 4880 }, { "epoch": 0.03226146269521477, "grad_norm": 0.07192632555961609, "learning_rate": 0.0029988430260487822, "loss": 2.1976, "step": 4900 }, { "epoch": 0.03239314213478708, "grad_norm": 0.07093453407287598, "learning_rate": 0.002998818027916318, "loss": 2.1925, "step": 4920 }, { "epoch": 0.03252482157435938, "grad_norm": 0.0686832144856453, "learning_rate": 0.002998792762708199, "loss": 2.1805, "step": 4940 }, { "epoch": 0.03265650101393169, "grad_norm": 0.06718004494905472, "learning_rate": 0.0029987672304289275, "loss": 2.177, "step": 4960 }, { "epoch": 0.03278818045350399, "grad_norm": 0.07362579554319382, "learning_rate": 0.0029987414310830526, "loss": 2.173, "step": 4980 }, { "epoch": 0.032919859893076296, "grad_norm": 0.06656539440155029, "learning_rate": 0.0029987153646751715, "loss": 2.1698, "step": 5000 }, { "epoch": 0.032919859893076296, "eval_loss": 2.136354446411133, "eval_runtime": 67.5662, "eval_samples_per_second": 14.8, "eval_steps_per_second": 14.8, "step": 5000 }, { "epoch": 0.0330515393326486, "grad_norm": 0.06965313106775284, "learning_rate": 0.0029986890312099284, "loss": 2.1551, "step": 5020 }, { "epoch": 0.033183218772220906, "grad_norm": 0.06893343478441238, "learning_rate": 0.0029986624306920177, "loss": 2.1559, "step": 5040 }, { "epoch": 0.03331489821179321, "grad_norm": 0.06808198988437653, "learning_rate": 0.0029986355631261767, "loss": 2.1516, "step": 5060 }, { "epoch": 0.033446577651365515, "grad_norm": 0.06501699984073639, "learning_rate": 0.002998608428517195, "loss": 2.1496, "step": 5080 }, { "epoch": 0.03357825709093782, "grad_norm": 0.0687108114361763, "learning_rate": 0.002998581026869907, "loss": 2.1428, "step": 5100 }, { "epoch": 0.033709936530510125, "grad_norm": 0.06481294333934784, "learning_rate": 0.0029985533581891955, "loss": 2.1408, "step": 5120 }, { "epoch": 0.03384161597008243, "grad_norm": 0.06615699827671051, "learning_rate": 0.002998525422479991, "loss": 2.1389, "step": 5140 }, { "epoch": 0.033973295409654734, "grad_norm": 0.06763967871665955, "learning_rate": 0.00299849721974727, "loss": 2.1272, "step": 5160 }, { "epoch": 0.03410497484922704, "grad_norm": 0.0660347044467926, "learning_rate": 0.0029984687499960603, "loss": 2.1297, "step": 5180 }, { "epoch": 0.034236654288799344, "grad_norm": 0.06650801748037338, "learning_rate": 0.002998440013231433, "loss": 2.131, "step": 5200 }, { "epoch": 0.03436833372837165, "grad_norm": 0.06661241501569748, "learning_rate": 0.0029984110094585102, "loss": 2.1246, "step": 5220 }, { "epoch": 0.03450001316794396, "grad_norm": 0.06411544978618622, "learning_rate": 0.0029983817386824586, "loss": 2.1241, "step": 5240 }, { "epoch": 0.034631692607516265, "grad_norm": 0.06469565629959106, "learning_rate": 0.0029983522009084953, "loss": 2.1161, "step": 5260 }, { "epoch": 0.03476337204708857, "grad_norm": 0.06469576805830002, "learning_rate": 0.0029983223961418835, "loss": 2.121, "step": 5280 }, { "epoch": 0.034895051486660875, "grad_norm": 0.06342877447605133, "learning_rate": 0.002998292324387933, "loss": 2.1244, "step": 5300 }, { "epoch": 0.03502673092623318, "grad_norm": 0.06592860817909241, "learning_rate": 0.0029982619856520035, "loss": 2.1312, "step": 5320 }, { "epoch": 0.035158410365805484, "grad_norm": 0.06745469570159912, "learning_rate": 0.0029982313799395005, "loss": 2.1259, "step": 5340 }, { "epoch": 0.03529008980537779, "grad_norm": 0.06721679121255875, "learning_rate": 0.0029982005072558774, "loss": 2.1212, "step": 5360 }, { "epoch": 0.035421769244950094, "grad_norm": 0.0677921324968338, "learning_rate": 0.0029981693676066367, "loss": 2.1187, "step": 5380 }, { "epoch": 0.0355534486845224, "grad_norm": 0.06510468572378159, "learning_rate": 0.0029981379609973257, "loss": 2.1186, "step": 5400 }, { "epoch": 0.0356851281240947, "grad_norm": 0.06507667899131775, "learning_rate": 0.002998106287433542, "loss": 2.1085, "step": 5420 }, { "epoch": 0.03581680756366701, "grad_norm": 0.06307834386825562, "learning_rate": 0.0029980743469209285, "loss": 2.1086, "step": 5440 }, { "epoch": 0.03594848700323931, "grad_norm": 0.06396503001451492, "learning_rate": 0.0029980421394651775, "loss": 2.1012, "step": 5460 }, { "epoch": 0.03608016644281162, "grad_norm": 0.0639200434088707, "learning_rate": 0.0029980096650720277, "loss": 2.1048, "step": 5480 }, { "epoch": 0.03621184588238392, "grad_norm": 0.06461615860462189, "learning_rate": 0.0029979769237472656, "loss": 2.098, "step": 5500 }, { "epoch": 0.03634352532195623, "grad_norm": 0.06527513265609741, "learning_rate": 0.0029979439154967256, "loss": 2.0921, "step": 5520 }, { "epoch": 0.03647520476152853, "grad_norm": 0.06093462184071541, "learning_rate": 0.0029979106403262897, "loss": 2.0834, "step": 5540 }, { "epoch": 0.036606884201100844, "grad_norm": 0.06476835161447525, "learning_rate": 0.002997877098241887, "loss": 2.0851, "step": 5560 }, { "epoch": 0.03673856364067315, "grad_norm": 0.06311192363500595, "learning_rate": 0.002997843289249494, "loss": 2.0799, "step": 5580 }, { "epoch": 0.03687024308024545, "grad_norm": 0.06339168548583984, "learning_rate": 0.002997809213355136, "loss": 2.0858, "step": 5600 }, { "epoch": 0.03700192251981776, "grad_norm": 0.06146325170993805, "learning_rate": 0.002997774870564884, "loss": 2.0948, "step": 5620 }, { "epoch": 0.03713360195939006, "grad_norm": 0.06187060475349426, "learning_rate": 0.0029977402608848585, "loss": 2.0822, "step": 5640 }, { "epoch": 0.03726528139896237, "grad_norm": 0.06805236637592316, "learning_rate": 0.0029977053843212266, "loss": 2.0759, "step": 5660 }, { "epoch": 0.03739696083853467, "grad_norm": 0.06448160111904144, "learning_rate": 0.002997670240880202, "loss": 2.08, "step": 5680 }, { "epoch": 0.03752864027810698, "grad_norm": 0.06372448801994324, "learning_rate": 0.002997634830568048, "loss": 2.0823, "step": 5700 }, { "epoch": 0.03766031971767928, "grad_norm": 0.061139971017837524, "learning_rate": 0.0029975991533910734, "loss": 2.0742, "step": 5720 }, { "epoch": 0.037791999157251586, "grad_norm": 0.06403601914644241, "learning_rate": 0.0029975632093556365, "loss": 2.0664, "step": 5740 }, { "epoch": 0.03792367859682389, "grad_norm": 0.06160760670900345, "learning_rate": 0.002997526998468142, "loss": 2.0591, "step": 5760 }, { "epoch": 0.038055358036396196, "grad_norm": 0.06119397282600403, "learning_rate": 0.0029974905207350417, "loss": 2.0637, "step": 5780 }, { "epoch": 0.0381870374759685, "grad_norm": 0.062456753104925156, "learning_rate": 0.0029974537761628364, "loss": 2.0611, "step": 5800 }, { "epoch": 0.038318716915540806, "grad_norm": 0.06182549521327019, "learning_rate": 0.002997416764758073, "loss": 2.0619, "step": 5820 }, { "epoch": 0.03845039635511311, "grad_norm": 0.06361284852027893, "learning_rate": 0.002997379486527347, "loss": 2.054, "step": 5840 }, { "epoch": 0.038582075794685415, "grad_norm": 0.06169150397181511, "learning_rate": 0.0029973419414773017, "loss": 2.058, "step": 5860 }, { "epoch": 0.03871375523425772, "grad_norm": 0.06227455288171768, "learning_rate": 0.002997304129614625, "loss": 2.0513, "step": 5880 }, { "epoch": 0.03884543467383003, "grad_norm": 0.06137228012084961, "learning_rate": 0.0029972660509460574, "loss": 2.0706, "step": 5900 }, { "epoch": 0.038977114113402336, "grad_norm": 0.06067802384495735, "learning_rate": 0.0029972277054783826, "loss": 2.0988, "step": 5920 }, { "epoch": 0.03910879355297464, "grad_norm": 0.062081821262836456, "learning_rate": 0.0029971890932184338, "loss": 2.1072, "step": 5940 }, { "epoch": 0.039240472992546946, "grad_norm": 0.058524634689092636, "learning_rate": 0.0029971502141730912, "loss": 2.112, "step": 5960 }, { "epoch": 0.03937215243211925, "grad_norm": 0.06115134805440903, "learning_rate": 0.0029971110683492826, "loss": 2.1138, "step": 5980 }, { "epoch": 0.039503831871691555, "grad_norm": 0.05962108075618744, "learning_rate": 0.0029970716557539837, "loss": 2.1112, "step": 6000 }, { "epoch": 0.039503831871691555, "eval_loss": 2.0984599590301514, "eval_runtime": 67.374, "eval_samples_per_second": 14.843, "eval_steps_per_second": 14.843, "step": 6000 }, { "epoch": 0.03963551131126386, "grad_norm": 0.06020989269018173, "learning_rate": 0.0029970319763942175, "loss": 2.1038, "step": 6020 }, { "epoch": 0.039767190750836165, "grad_norm": 0.059578102082014084, "learning_rate": 0.0029969920302770543, "loss": 2.0974, "step": 6040 }, { "epoch": 0.03989887019040847, "grad_norm": 0.05818217247724533, "learning_rate": 0.002996951817409612, "loss": 2.1037, "step": 6060 }, { "epoch": 0.040030549629980774, "grad_norm": 0.05842572823166847, "learning_rate": 0.0029969113377990566, "loss": 2.0998, "step": 6080 }, { "epoch": 0.04016222906955308, "grad_norm": 0.057952892035245895, "learning_rate": 0.002996870591452601, "loss": 2.1024, "step": 6100 }, { "epoch": 0.040293908509125384, "grad_norm": 0.0585886612534523, "learning_rate": 0.0029968295783775055, "loss": 2.0989, "step": 6120 }, { "epoch": 0.04042558794869769, "grad_norm": 0.061875827610492706, "learning_rate": 0.0029967882985810785, "loss": 2.0848, "step": 6140 }, { "epoch": 0.040557267388269994, "grad_norm": 0.059371497482061386, "learning_rate": 0.002996746752070676, "loss": 2.0865, "step": 6160 }, { "epoch": 0.0406889468278423, "grad_norm": 0.06270122528076172, "learning_rate": 0.002996704938853701, "loss": 2.0847, "step": 6180 }, { "epoch": 0.0408206262674146, "grad_norm": 0.05946968123316765, "learning_rate": 0.002996662858937604, "loss": 2.0773, "step": 6200 }, { "epoch": 0.04095230570698691, "grad_norm": 0.05964416265487671, "learning_rate": 0.002996620512329883, "loss": 2.0827, "step": 6220 }, { "epoch": 0.04108398514655922, "grad_norm": 0.059607379138469696, "learning_rate": 0.0029965778990380847, "loss": 2.0802, "step": 6240 }, { "epoch": 0.041215664586131524, "grad_norm": 0.059771690517663956, "learning_rate": 0.0029965350190698016, "loss": 2.0753, "step": 6260 }, { "epoch": 0.04134734402570383, "grad_norm": 0.05873079225420952, "learning_rate": 0.002996491872432675, "loss": 2.0742, "step": 6280 }, { "epoch": 0.041479023465276134, "grad_norm": 0.05816845968365669, "learning_rate": 0.0029964484591343933, "loss": 2.0689, "step": 6300 }, { "epoch": 0.04161070290484844, "grad_norm": 0.057672835886478424, "learning_rate": 0.002996404779182692, "loss": 2.0648, "step": 6320 }, { "epoch": 0.04174238234442074, "grad_norm": 0.06043649837374687, "learning_rate": 0.0029963608325853544, "loss": 2.0719, "step": 6340 }, { "epoch": 0.04187406178399305, "grad_norm": 0.05902590975165367, "learning_rate": 0.0029963166193502115, "loss": 2.0662, "step": 6360 }, { "epoch": 0.04200574122356535, "grad_norm": 0.061324600130319595, "learning_rate": 0.002996272139485142, "loss": 2.0672, "step": 6380 }, { "epoch": 0.04213742066313766, "grad_norm": 0.05997491627931595, "learning_rate": 0.002996227392998071, "loss": 2.0733, "step": 6400 }, { "epoch": 0.04226910010270996, "grad_norm": 0.0597202442586422, "learning_rate": 0.0029961823798969733, "loss": 2.062, "step": 6420 }, { "epoch": 0.04240077954228227, "grad_norm": 0.10704315453767776, "learning_rate": 0.002996137100189868, "loss": 2.0669, "step": 6440 }, { "epoch": 0.04253245898185457, "grad_norm": 0.056581802666187286, "learning_rate": 0.0029960915538848254, "loss": 2.0585, "step": 6460 }, { "epoch": 0.04266413842142688, "grad_norm": 0.0565234012901783, "learning_rate": 0.00299604574098996, "loss": 2.0554, "step": 6480 }, { "epoch": 0.04279581786099918, "grad_norm": 0.056596871465444565, "learning_rate": 0.0029959996615134357, "loss": 2.077, "step": 6500 }, { "epoch": 0.042927497300571486, "grad_norm": 0.05787625536322594, "learning_rate": 0.002995953315463464, "loss": 2.0741, "step": 6520 }, { "epoch": 0.04305917674014379, "grad_norm": 0.059064172208309174, "learning_rate": 0.002995906702848302, "loss": 2.0792, "step": 6540 }, { "epoch": 0.043190856179716096, "grad_norm": 0.057197242975234985, "learning_rate": 0.0029958598236762574, "loss": 2.0702, "step": 6560 }, { "epoch": 0.04332253561928841, "grad_norm": 0.05579278990626335, "learning_rate": 0.002995812677955683, "loss": 2.0677, "step": 6580 }, { "epoch": 0.04345421505886071, "grad_norm": 0.05777699500322342, "learning_rate": 0.0029957652656949787, "loss": 2.0649, "step": 6600 }, { "epoch": 0.04358589449843302, "grad_norm": 0.05634402483701706, "learning_rate": 0.002995717586902594, "loss": 2.0681, "step": 6620 }, { "epoch": 0.04371757393800532, "grad_norm": 0.05572090670466423, "learning_rate": 0.0029956696415870242, "loss": 2.0587, "step": 6640 }, { "epoch": 0.04384925337757763, "grad_norm": 0.05806443840265274, "learning_rate": 0.0029956214297568134, "loss": 2.0555, "step": 6660 }, { "epoch": 0.04398093281714993, "grad_norm": 0.05726337805390358, "learning_rate": 0.0029955729514205523, "loss": 2.0474, "step": 6680 }, { "epoch": 0.044112612256722236, "grad_norm": 0.05729576200246811, "learning_rate": 0.0029955242065868794, "loss": 2.0489, "step": 6700 }, { "epoch": 0.04424429169629454, "grad_norm": 0.06136414781212807, "learning_rate": 0.0029954751952644795, "loss": 2.0509, "step": 6720 }, { "epoch": 0.044375971135866846, "grad_norm": 0.058006297796964645, "learning_rate": 0.0029954259174620875, "loss": 2.0515, "step": 6740 }, { "epoch": 0.04450765057543915, "grad_norm": 0.05813615396618843, "learning_rate": 0.0029953763731884833, "loss": 2.048, "step": 6760 }, { "epoch": 0.044639330015011455, "grad_norm": 0.05697380378842354, "learning_rate": 0.0029953265624524956, "loss": 2.0433, "step": 6780 }, { "epoch": 0.04477100945458376, "grad_norm": 0.05840064957737923, "learning_rate": 0.002995276485263, "loss": 2.0405, "step": 6800 }, { "epoch": 0.044902688894156065, "grad_norm": 0.05951813980937004, "learning_rate": 0.00299522614162892, "loss": 2.0418, "step": 6820 }, { "epoch": 0.04503436833372837, "grad_norm": 0.05788157880306244, "learning_rate": 0.0029951755315592264, "loss": 2.0378, "step": 6840 }, { "epoch": 0.045166047773300674, "grad_norm": 0.05446796864271164, "learning_rate": 0.002995124655062937, "loss": 2.0412, "step": 6860 }, { "epoch": 0.04529772721287298, "grad_norm": 0.05822540074586868, "learning_rate": 0.002995073512149118, "loss": 2.0357, "step": 6880 }, { "epoch": 0.045429406652445284, "grad_norm": 0.0586545467376709, "learning_rate": 0.002995022102826883, "loss": 2.0284, "step": 6900 }, { "epoch": 0.045561086092017596, "grad_norm": 0.056676048785448074, "learning_rate": 0.0029949704271053914, "loss": 2.0363, "step": 6920 }, { "epoch": 0.0456927655315899, "grad_norm": 0.0642879530787468, "learning_rate": 0.0029949184849938524, "loss": 2.0271, "step": 6940 }, { "epoch": 0.045824444971162205, "grad_norm": 0.054941147565841675, "learning_rate": 0.002994866276501521, "loss": 2.0297, "step": 6960 }, { "epoch": 0.04595612441073451, "grad_norm": 0.057689156383275986, "learning_rate": 0.0029948138016377005, "loss": 2.032, "step": 6980 }, { "epoch": 0.046087803850306815, "grad_norm": 0.05917928367853165, "learning_rate": 0.0029947610604117423, "loss": 2.0272, "step": 7000 }, { "epoch": 0.046087803850306815, "eval_loss": 1.9085378646850586, "eval_runtime": 68.9073, "eval_samples_per_second": 14.512, "eval_steps_per_second": 14.512, "step": 7000 }, { "epoch": 0.04621948328987912, "grad_norm": 0.05777193233370781, "learning_rate": 0.002994708052833043, "loss": 2.0243, "step": 7020 }, { "epoch": 0.046351162729451424, "grad_norm": 0.056196246296167374, "learning_rate": 0.0029946547789110487, "loss": 2.0237, "step": 7040 }, { "epoch": 0.04648284216902373, "grad_norm": 0.05449189990758896, "learning_rate": 0.002994601238655252, "loss": 2.0229, "step": 7060 }, { "epoch": 0.046614521608596034, "grad_norm": 0.05653191730380058, "learning_rate": 0.0029945474320751944, "loss": 2.0243, "step": 7080 }, { "epoch": 0.04674620104816834, "grad_norm": 0.05763334780931473, "learning_rate": 0.0029944933591804623, "loss": 2.0279, "step": 7100 }, { "epoch": 0.04687788048774064, "grad_norm": 0.05874243751168251, "learning_rate": 0.002994439019980692, "loss": 2.0081, "step": 7120 }, { "epoch": 0.04700955992731295, "grad_norm": 0.06031106784939766, "learning_rate": 0.0029943844144855658, "loss": 1.9983, "step": 7140 }, { "epoch": 0.04714123936688525, "grad_norm": 0.05547622591257095, "learning_rate": 0.002994329542704814, "loss": 1.9954, "step": 7160 }, { "epoch": 0.04727291880645756, "grad_norm": 0.05814756825566292, "learning_rate": 0.002994274404648214, "loss": 1.9944, "step": 7180 }, { "epoch": 0.04740459824602986, "grad_norm": 0.05669866129755974, "learning_rate": 0.002994219000325591, "loss": 1.9852, "step": 7200 }, { "epoch": 0.04753627768560217, "grad_norm": 0.05776144191622734, "learning_rate": 0.0029941633297468177, "loss": 1.9788, "step": 7220 }, { "epoch": 0.04766795712517447, "grad_norm": 0.05656075105071068, "learning_rate": 0.002994107392921814, "loss": 1.9872, "step": 7240 }, { "epoch": 0.047799636564746784, "grad_norm": 0.05627656355500221, "learning_rate": 0.0029940511898605476, "loss": 1.9787, "step": 7260 }, { "epoch": 0.04793131600431909, "grad_norm": 0.05843086168169975, "learning_rate": 0.002993994720573033, "loss": 1.9782, "step": 7280 }, { "epoch": 0.04806299544389139, "grad_norm": 0.05826539546251297, "learning_rate": 0.002993937985069333, "loss": 1.9819, "step": 7300 }, { "epoch": 0.0481946748834637, "grad_norm": 0.06292963773012161, "learning_rate": 0.0029938809833595565, "loss": 1.9696, "step": 7320 }, { "epoch": 0.048326354323036, "grad_norm": 0.057060081511735916, "learning_rate": 0.0029938237154538616, "loss": 1.9633, "step": 7340 }, { "epoch": 0.04845803376260831, "grad_norm": 0.06161024048924446, "learning_rate": 0.0029937661813624525, "loss": 1.9623, "step": 7360 }, { "epoch": 0.04858971320218061, "grad_norm": 0.05789177492260933, "learning_rate": 0.0029937083810955807, "loss": 1.9724, "step": 7380 }, { "epoch": 0.04872139264175292, "grad_norm": 0.055680371820926666, "learning_rate": 0.0029936503146635466, "loss": 1.9657, "step": 7400 }, { "epoch": 0.04885307208132522, "grad_norm": 0.05655812472105026, "learning_rate": 0.0029935919820766967, "loss": 1.9664, "step": 7420 }, { "epoch": 0.048984751520897526, "grad_norm": 0.05809199810028076, "learning_rate": 0.0029935333833454253, "loss": 1.9728, "step": 7440 }, { "epoch": 0.04911643096046983, "grad_norm": 0.057024531066417694, "learning_rate": 0.0029934745184801745, "loss": 1.9637, "step": 7460 }, { "epoch": 0.049248110400042136, "grad_norm": 0.05507376790046692, "learning_rate": 0.0029934153874914327, "loss": 1.9646, "step": 7480 }, { "epoch": 0.04937978983961444, "grad_norm": 0.0562782883644104, "learning_rate": 0.0029933559903897373, "loss": 1.9642, "step": 7500 }, { "epoch": 0.049511469279186746, "grad_norm": 0.05876750499010086, "learning_rate": 0.002993296327185672, "loss": 1.96, "step": 7520 }, { "epoch": 0.04964314871875905, "grad_norm": 0.0542948879301548, "learning_rate": 0.0029932363978898684, "loss": 1.957, "step": 7540 }, { "epoch": 0.049774828158331355, "grad_norm": 0.05514788627624512, "learning_rate": 0.0029931762025130052, "loss": 1.956, "step": 7560 }, { "epoch": 0.04990650759790366, "grad_norm": 0.055275484919548035, "learning_rate": 0.0029931157410658087, "loss": 1.9586, "step": 7580 }, { "epoch": 0.05003818703747597, "grad_norm": 0.06243159994482994, "learning_rate": 0.0029930550135590524, "loss": 1.9528, "step": 7600 }, { "epoch": 0.050169866477048276, "grad_norm": 0.055291496217250824, "learning_rate": 0.0029929940200035575, "loss": 1.9535, "step": 7620 }, { "epoch": 0.05030154591662058, "grad_norm": 0.0554860420525074, "learning_rate": 0.002992932760410193, "loss": 1.9573, "step": 7640 }, { "epoch": 0.050433225356192886, "grad_norm": 0.058307211846113205, "learning_rate": 0.0029928712347898736, "loss": 1.9489, "step": 7660 }, { "epoch": 0.05056490479576519, "grad_norm": 0.057058483362197876, "learning_rate": 0.0029928094431535637, "loss": 1.9564, "step": 7680 }, { "epoch": 0.050696584235337495, "grad_norm": 0.055521443486213684, "learning_rate": 0.0029927473855122736, "loss": 1.967, "step": 7700 }, { "epoch": 0.0508282636749098, "grad_norm": 0.05751781165599823, "learning_rate": 0.0029926850618770618, "loss": 1.9694, "step": 7720 }, { "epoch": 0.050959943114482105, "grad_norm": 0.05835530161857605, "learning_rate": 0.002992622472259033, "loss": 1.9706, "step": 7740 }, { "epoch": 0.05109162255405441, "grad_norm": 0.05460565164685249, "learning_rate": 0.0029925596166693403, "loss": 1.9652, "step": 7760 }, { "epoch": 0.051223301993626714, "grad_norm": 0.05999600142240524, "learning_rate": 0.0029924964951191847, "loss": 1.9628, "step": 7780 }, { "epoch": 0.05135498143319902, "grad_norm": 0.05896478518843651, "learning_rate": 0.0029924331076198133, "loss": 1.9625, "step": 7800 }, { "epoch": 0.051486660872771324, "grad_norm": 0.05324622988700867, "learning_rate": 0.0029923694541825214, "loss": 1.9593, "step": 7820 }, { "epoch": 0.05161834031234363, "grad_norm": 0.056877490133047104, "learning_rate": 0.002992305534818651, "loss": 1.9547, "step": 7840 }, { "epoch": 0.051750019751915934, "grad_norm": 0.05267615243792534, "learning_rate": 0.0029922413495395927, "loss": 1.9584, "step": 7860 }, { "epoch": 0.05188169919148824, "grad_norm": 0.05451074242591858, "learning_rate": 0.002992176898356783, "loss": 1.957, "step": 7880 }, { "epoch": 0.05201337863106054, "grad_norm": 0.0581444576382637, "learning_rate": 0.0029921121812817074, "loss": 1.948, "step": 7900 }, { "epoch": 0.052145058070632855, "grad_norm": 0.0567544661462307, "learning_rate": 0.0029920471983258964, "loss": 1.947, "step": 7920 }, { "epoch": 0.05227673751020516, "grad_norm": 0.05727114900946617, "learning_rate": 0.0029919819495009313, "loss": 1.9494, "step": 7940 }, { "epoch": 0.052408416949777464, "grad_norm": 0.05433478206396103, "learning_rate": 0.002991916434818437, "loss": 1.9443, "step": 7960 }, { "epoch": 0.05254009638934977, "grad_norm": 0.055305104702711105, "learning_rate": 0.002991850654290089, "loss": 1.9461, "step": 7980 }, { "epoch": 0.052671775828922074, "grad_norm": 0.056631047278642654, "learning_rate": 0.0029917846079276084, "loss": 1.9424, "step": 8000 }, { "epoch": 0.052671775828922074, "eval_loss": 1.780034065246582, "eval_runtime": 67.4451, "eval_samples_per_second": 14.827, "eval_steps_per_second": 14.827, "step": 8000 }, { "epoch": 0.05280345526849438, "grad_norm": 0.06008228659629822, "learning_rate": 0.002991718295742763, "loss": 1.9402, "step": 8020 }, { "epoch": 0.05293513470806668, "grad_norm": 0.05446495860815048, "learning_rate": 0.0029916517177473708, "loss": 1.942, "step": 8040 }, { "epoch": 0.05306681414763899, "grad_norm": 0.06055721640586853, "learning_rate": 0.002991584873953294, "loss": 1.9409, "step": 8060 }, { "epoch": 0.05319849358721129, "grad_norm": 0.056658077985048294, "learning_rate": 0.002991517764372444, "loss": 1.9384, "step": 8080 }, { "epoch": 0.0533301730267836, "grad_norm": 0.054917097091674805, "learning_rate": 0.00299145038901678, "loss": 1.9312, "step": 8100 }, { "epoch": 0.0534618524663559, "grad_norm": 0.05398482084274292, "learning_rate": 0.0029913827478983057, "loss": 1.9454, "step": 8120 }, { "epoch": 0.05359353190592821, "grad_norm": 0.05773143097758293, "learning_rate": 0.002991314841029076, "loss": 1.9394, "step": 8140 }, { "epoch": 0.05372521134550051, "grad_norm": 0.0562208853662014, "learning_rate": 0.0029912466684211907, "loss": 1.94, "step": 8160 }, { "epoch": 0.05385689078507282, "grad_norm": 0.05213721841573715, "learning_rate": 0.002991178230086797, "loss": 1.928, "step": 8180 }, { "epoch": 0.05398857022464512, "grad_norm": 0.05434253811836243, "learning_rate": 0.0029911095260380903, "loss": 1.9361, "step": 8200 }, { "epoch": 0.054120249664217426, "grad_norm": 0.0537894032895565, "learning_rate": 0.0029910405562873135, "loss": 1.9368, "step": 8220 }, { "epoch": 0.05425192910378973, "grad_norm": 0.055712759494781494, "learning_rate": 0.0029909713208467557, "loss": 1.9253, "step": 8240 }, { "epoch": 0.05438360854336204, "grad_norm": 0.0564916618168354, "learning_rate": 0.0029909018197287543, "loss": 1.936, "step": 8260 }, { "epoch": 0.05451528798293435, "grad_norm": 0.059347622096538544, "learning_rate": 0.002990832052945694, "loss": 1.9872, "step": 8280 }, { "epoch": 0.05464696742250665, "grad_norm": 0.05435614287853241, "learning_rate": 0.002990762020510006, "loss": 2.0069, "step": 8300 }, { "epoch": 0.05477864686207896, "grad_norm": 0.05343768745660782, "learning_rate": 0.0029906917224341704, "loss": 2.0144, "step": 8320 }, { "epoch": 0.05491032630165126, "grad_norm": 0.054454583674669266, "learning_rate": 0.0029906211587307128, "loss": 2.0294, "step": 8340 }, { "epoch": 0.05504200574122357, "grad_norm": 0.05322398245334625, "learning_rate": 0.002990550329412207, "loss": 2.0255, "step": 8360 }, { "epoch": 0.05517368518079587, "grad_norm": 0.0558038055896759, "learning_rate": 0.002990479234491275, "loss": 2.0239, "step": 8380 }, { "epoch": 0.055305364620368176, "grad_norm": 0.0529707595705986, "learning_rate": 0.002990407873980584, "loss": 2.0235, "step": 8400 }, { "epoch": 0.05543704405994048, "grad_norm": 0.049640074372291565, "learning_rate": 0.002990336247892851, "loss": 2.0226, "step": 8420 }, { "epoch": 0.055568723499512786, "grad_norm": 0.05250220373272896, "learning_rate": 0.0029902643562408388, "loss": 2.0082, "step": 8440 }, { "epoch": 0.05570040293908509, "grad_norm": 0.05764392018318176, "learning_rate": 0.0029901921990373574, "loss": 2.0135, "step": 8460 }, { "epoch": 0.055832082378657395, "grad_norm": 0.0569184236228466, "learning_rate": 0.0029901197762952645, "loss": 2.0064, "step": 8480 }, { "epoch": 0.0559637618182297, "grad_norm": 0.05316290259361267, "learning_rate": 0.0029900470880274655, "loss": 1.9979, "step": 8500 }, { "epoch": 0.056095441257802005, "grad_norm": 0.05095953494310379, "learning_rate": 0.002989974134246913, "loss": 2.0072, "step": 8520 }, { "epoch": 0.05622712069737431, "grad_norm": 0.06118274852633476, "learning_rate": 0.002989900914966606, "loss": 2.0055, "step": 8540 }, { "epoch": 0.056358800136946614, "grad_norm": 0.05806516483426094, "learning_rate": 0.0029898274301995926, "loss": 1.9939, "step": 8560 }, { "epoch": 0.05649047957651892, "grad_norm": 0.05719646438956261, "learning_rate": 0.0029897536799589662, "loss": 1.9945, "step": 8580 }, { "epoch": 0.05662215901609123, "grad_norm": 0.05527440831065178, "learning_rate": 0.0029896796642578686, "loss": 1.9894, "step": 8600 }, { "epoch": 0.056753838455663536, "grad_norm": 0.0631207823753357, "learning_rate": 0.002989605383109489, "loss": 1.994, "step": 8620 }, { "epoch": 0.05688551789523584, "grad_norm": 0.054478082805871964, "learning_rate": 0.002989530836527063, "loss": 1.9867, "step": 8640 }, { "epoch": 0.057017197334808145, "grad_norm": 0.05206460878252983, "learning_rate": 0.002989456024523875, "loss": 1.9807, "step": 8660 }, { "epoch": 0.05714887677438045, "grad_norm": 0.05099276080727577, "learning_rate": 0.002989380947113255, "loss": 1.983, "step": 8680 }, { "epoch": 0.057280556213952755, "grad_norm": 0.05928613618016243, "learning_rate": 0.0029893056043085813, "loss": 1.9792, "step": 8700 }, { "epoch": 0.05741223565352506, "grad_norm": 0.04971221461892128, "learning_rate": 0.0029892299961232797, "loss": 1.9756, "step": 8720 }, { "epoch": 0.057543915093097364, "grad_norm": 0.060248006135225296, "learning_rate": 0.002989154122570823, "loss": 1.9837, "step": 8740 }, { "epoch": 0.05767559453266967, "grad_norm": 0.058486610651016235, "learning_rate": 0.0029890779836647305, "loss": 1.9781, "step": 8760 }, { "epoch": 0.057807273972241974, "grad_norm": 0.05129622295498848, "learning_rate": 0.00298900157941857, "loss": 1.972, "step": 8780 }, { "epoch": 0.05793895341181428, "grad_norm": 0.052501507103443146, "learning_rate": 0.002988924909845955, "loss": 1.9731, "step": 8800 }, { "epoch": 0.05807063285138658, "grad_norm": 0.055490028113126755, "learning_rate": 0.0029888479749605487, "loss": 1.9697, "step": 8820 }, { "epoch": 0.05820231229095889, "grad_norm": 0.05250798165798187, "learning_rate": 0.0029887707747760597, "loss": 1.9722, "step": 8840 }, { "epoch": 0.05833399173053119, "grad_norm": 0.053195856511592865, "learning_rate": 0.0029886933093062444, "loss": 1.9829, "step": 8860 }, { "epoch": 0.0584656711701035, "grad_norm": 0.05129017308354378, "learning_rate": 0.002988615578564906, "loss": 1.9818, "step": 8880 }, { "epoch": 0.0585973506096758, "grad_norm": 0.05016680434346199, "learning_rate": 0.0029885375825658956, "loss": 1.9915, "step": 8900 }, { "epoch": 0.05872903004924811, "grad_norm": 0.054276566952466965, "learning_rate": 0.0029884593213231115, "loss": 1.986, "step": 8920 }, { "epoch": 0.05886070948882042, "grad_norm": 0.05341557413339615, "learning_rate": 0.0029883807948504998, "loss": 1.9816, "step": 8940 }, { "epoch": 0.058992388928392724, "grad_norm": 0.05010661855340004, "learning_rate": 0.002988302003162052, "loss": 1.9822, "step": 8960 }, { "epoch": 0.05912406836796503, "grad_norm": 0.06433503329753876, "learning_rate": 0.0029882229462718088, "loss": 1.9838, "step": 8980 }, { "epoch": 0.05925574780753733, "grad_norm": 0.0578884556889534, "learning_rate": 0.002988143624193857, "loss": 1.9786, "step": 9000 }, { "epoch": 0.05925574780753733, "eval_loss": 1.9106996059417725, "eval_runtime": 67.8585, "eval_samples_per_second": 14.737, "eval_steps_per_second": 14.737, "step": 9000 }, { "epoch": 0.05938742724710964, "grad_norm": 0.0511951707303524, "learning_rate": 0.0029880640369423315, "loss": 1.9788, "step": 9020 }, { "epoch": 0.05951910668668194, "grad_norm": 0.04770907759666443, "learning_rate": 0.0029879841845314135, "loss": 1.975, "step": 9040 }, { "epoch": 0.05965078612625425, "grad_norm": 0.052814580500125885, "learning_rate": 0.0029879040669753324, "loss": 1.9674, "step": 9060 }, { "epoch": 0.05978246556582655, "grad_norm": 0.05619759112596512, "learning_rate": 0.0029878236842883644, "loss": 1.9686, "step": 9080 }, { "epoch": 0.05991414500539886, "grad_norm": 0.052855897694826126, "learning_rate": 0.0029877430364848327, "loss": 1.9591, "step": 9100 }, { "epoch": 0.06004582444497116, "grad_norm": 0.06869558244943619, "learning_rate": 0.002987662123579108, "loss": 1.9603, "step": 9120 }, { "epoch": 0.060177503884543466, "grad_norm": 0.04893792048096657, "learning_rate": 0.002987580945585609, "loss": 1.9669, "step": 9140 }, { "epoch": 0.06030918332411577, "grad_norm": 0.06035724654793739, "learning_rate": 0.0029874995025188, "loss": 1.9693, "step": 9160 }, { "epoch": 0.060440862763688076, "grad_norm": 0.05003412812948227, "learning_rate": 0.002987417794393193, "loss": 1.961, "step": 9180 }, { "epoch": 0.06057254220326038, "grad_norm": 0.051062557846307755, "learning_rate": 0.002987335821223349, "loss": 1.9568, "step": 9200 }, { "epoch": 0.060704221642832686, "grad_norm": 0.05019828677177429, "learning_rate": 0.002987253583023874, "loss": 1.9529, "step": 9220 }, { "epoch": 0.06083590108240499, "grad_norm": 0.05402472987771034, "learning_rate": 0.0029871710798094224, "loss": 1.9579, "step": 9240 }, { "epoch": 0.060967580521977295, "grad_norm": 0.06498553603887558, "learning_rate": 0.002987088311594695, "loss": 1.9526, "step": 9260 }, { "epoch": 0.06109925996154961, "grad_norm": 0.06526941061019897, "learning_rate": 0.0029870052783944412, "loss": 1.9554, "step": 9280 }, { "epoch": 0.06123093940112191, "grad_norm": 0.051123786717653275, "learning_rate": 0.002986921980223456, "loss": 1.9449, "step": 9300 }, { "epoch": 0.061362618840694216, "grad_norm": 0.05042225867509842, "learning_rate": 0.002986838417096583, "loss": 1.952, "step": 9320 }, { "epoch": 0.06149429828026652, "grad_norm": 0.052252884954214096, "learning_rate": 0.002986754589028711, "loss": 1.9459, "step": 9340 }, { "epoch": 0.061625977719838826, "grad_norm": 0.049406830221414566, "learning_rate": 0.002986670496034779, "loss": 1.9478, "step": 9360 }, { "epoch": 0.06175765715941113, "grad_norm": 0.051424238830804825, "learning_rate": 0.0029865861381297714, "loss": 1.9434, "step": 9380 }, { "epoch": 0.061889336598983435, "grad_norm": 0.05527883395552635, "learning_rate": 0.0029865015153287193, "loss": 1.9428, "step": 9400 }, { "epoch": 0.06202101603855574, "grad_norm": 0.048182398080825806, "learning_rate": 0.0029864166276467024, "loss": 1.9404, "step": 9420 }, { "epoch": 0.062152695478128045, "grad_norm": 0.04890589416027069, "learning_rate": 0.002986331475098846, "loss": 1.9342, "step": 9440 }, { "epoch": 0.06228437491770035, "grad_norm": 0.052375294268131256, "learning_rate": 0.0029862460577003247, "loss": 1.9291, "step": 9460 }, { "epoch": 0.062416054357272654, "grad_norm": 0.0541619248688221, "learning_rate": 0.002986160375466358, "loss": 1.883, "step": 9480 }, { "epoch": 0.06254773379684496, "grad_norm": 0.05440934747457504, "learning_rate": 0.002986074428412214, "loss": 1.8321, "step": 9500 }, { "epoch": 0.06267941323641726, "grad_norm": 0.06579524278640747, "learning_rate": 0.0029859882165532087, "loss": 1.8184, "step": 9520 }, { "epoch": 0.06281109267598957, "grad_norm": 0.050777874886989594, "learning_rate": 0.0029859017399047026, "loss": 1.8232, "step": 9540 }, { "epoch": 0.06294277211556187, "grad_norm": 0.05892116203904152, "learning_rate": 0.002985814998482106, "loss": 1.8241, "step": 9560 }, { "epoch": 0.06307445155513418, "grad_norm": 0.054253749549388885, "learning_rate": 0.0029857279923008757, "loss": 1.812, "step": 9580 }, { "epoch": 0.06320613099470648, "grad_norm": 0.05559428408741951, "learning_rate": 0.0029856407213765144, "loss": 1.8166, "step": 9600 }, { "epoch": 0.06333781043427879, "grad_norm": 0.0527789331972599, "learning_rate": 0.0029855531857245735, "loss": 1.8244, "step": 9620 }, { "epoch": 0.06346948987385109, "grad_norm": 0.05062944442033768, "learning_rate": 0.0029854653853606515, "loss": 1.8276, "step": 9640 }, { "epoch": 0.0636011693134234, "grad_norm": 0.05144268646836281, "learning_rate": 0.002985377320300393, "loss": 1.8178, "step": 9660 }, { "epoch": 0.0637328487529957, "grad_norm": 0.051822349429130554, "learning_rate": 0.0029852889905594903, "loss": 1.8238, "step": 9680 }, { "epoch": 0.06386452819256801, "grad_norm": 0.05682462826371193, "learning_rate": 0.0029852003961536844, "loss": 1.8207, "step": 9700 }, { "epoch": 0.06399620763214031, "grad_norm": 0.06278064101934433, "learning_rate": 0.00298511153709876, "loss": 1.8311, "step": 9720 }, { "epoch": 0.06412788707171262, "grad_norm": 0.052284616976976395, "learning_rate": 0.0029850224134105514, "loss": 1.8243, "step": 9740 }, { "epoch": 0.06425956651128492, "grad_norm": 0.06791289150714874, "learning_rate": 0.0029849330251049406, "loss": 1.8252, "step": 9760 }, { "epoch": 0.06439124595085724, "grad_norm": 0.05337266996502876, "learning_rate": 0.0029848433721978555, "loss": 1.829, "step": 9780 }, { "epoch": 0.06452292539042954, "grad_norm": 0.05477340891957283, "learning_rate": 0.002984753454705271, "loss": 1.8226, "step": 9800 }, { "epoch": 0.06465460483000185, "grad_norm": 0.055485792458057404, "learning_rate": 0.00298466327264321, "loss": 1.8205, "step": 9820 }, { "epoch": 0.06478628426957415, "grad_norm": 0.05361747369170189, "learning_rate": 0.0029845728260277414, "loss": 1.8327, "step": 9840 }, { "epoch": 0.06491796370914646, "grad_norm": 0.06504777073860168, "learning_rate": 0.0029844821148749825, "loss": 1.8292, "step": 9860 }, { "epoch": 0.06504964314871876, "grad_norm": 0.05408887565135956, "learning_rate": 0.002984391139201097, "loss": 1.8295, "step": 9880 }, { "epoch": 0.06518132258829107, "grad_norm": 0.0615227073431015, "learning_rate": 0.0029842998990222964, "loss": 1.8233, "step": 9900 }, { "epoch": 0.06531300202786337, "grad_norm": 0.05818536877632141, "learning_rate": 0.002984208394354838, "loss": 1.8261, "step": 9920 }, { "epoch": 0.06544468146743568, "grad_norm": 0.057526398450136185, "learning_rate": 0.0029841166252150284, "loss": 1.8294, "step": 9940 }, { "epoch": 0.06557636090700798, "grad_norm": 0.05408645048737526, "learning_rate": 0.002984024591619219, "loss": 1.8248, "step": 9960 }, { "epoch": 0.06570804034658029, "grad_norm": 0.05534709617495537, "learning_rate": 0.0029839322935838095, "loss": 1.8263, "step": 9980 }, { "epoch": 0.06583971978615259, "grad_norm": 0.05544685944914818, "learning_rate": 0.002983839731125246, "loss": 1.8239, "step": 10000 }, { "epoch": 0.06583971978615259, "eval_loss": 1.968814492225647, "eval_runtime": 68.0355, "eval_samples_per_second": 14.698, "eval_steps_per_second": 14.698, "step": 10000 }, { "epoch": 0.0659713992257249, "grad_norm": 0.052884284406900406, "learning_rate": 0.002983746904260024, "loss": 1.8226, "step": 10020 }, { "epoch": 0.0661030786652972, "grad_norm": 0.06210578605532646, "learning_rate": 0.002983653813004683, "loss": 1.8562, "step": 10040 }, { "epoch": 0.0662347581048695, "grad_norm": 0.05301567539572716, "learning_rate": 0.002983560457375811, "loss": 1.9107, "step": 10060 }, { "epoch": 0.06636643754444181, "grad_norm": 0.056775398552417755, "learning_rate": 0.0029834668373900437, "loss": 1.9256, "step": 10080 }, { "epoch": 0.06649811698401412, "grad_norm": 0.05117955058813095, "learning_rate": 0.002983372953064063, "loss": 1.9391, "step": 10100 }, { "epoch": 0.06662979642358642, "grad_norm": 0.04930364713072777, "learning_rate": 0.0029832788044145985, "loss": 1.9415, "step": 10120 }, { "epoch": 0.06676147586315873, "grad_norm": 0.0544724240899086, "learning_rate": 0.002983184391458426, "loss": 1.9422, "step": 10140 }, { "epoch": 0.06689315530273103, "grad_norm": 0.05356570705771446, "learning_rate": 0.0029830897142123698, "loss": 1.9259, "step": 10160 }, { "epoch": 0.06702483474230334, "grad_norm": 0.05016016215085983, "learning_rate": 0.0029829947726933005, "loss": 1.9262, "step": 10180 }, { "epoch": 0.06715651418187564, "grad_norm": 0.05329560115933418, "learning_rate": 0.002982899566918135, "loss": 1.9342, "step": 10200 }, { "epoch": 0.06728819362144794, "grad_norm": 0.053507186472415924, "learning_rate": 0.0029828040969038386, "loss": 1.9217, "step": 10220 }, { "epoch": 0.06741987306102025, "grad_norm": 0.05592430755496025, "learning_rate": 0.002982708362667423, "loss": 1.9244, "step": 10240 }, { "epoch": 0.06755155250059255, "grad_norm": 0.05031822621822357, "learning_rate": 0.0029826123642259475, "loss": 1.9163, "step": 10260 }, { "epoch": 0.06768323194016486, "grad_norm": 0.05068674683570862, "learning_rate": 0.0029825161015965183, "loss": 1.9224, "step": 10280 }, { "epoch": 0.06781491137973716, "grad_norm": 0.05538354441523552, "learning_rate": 0.002982419574796288, "loss": 1.9166, "step": 10300 }, { "epoch": 0.06794659081930947, "grad_norm": 0.04972713813185692, "learning_rate": 0.002982322783842457, "loss": 1.9165, "step": 10320 }, { "epoch": 0.06807827025888177, "grad_norm": 0.05182690918445587, "learning_rate": 0.0029822257287522727, "loss": 1.9025, "step": 10340 }, { "epoch": 0.06820994969845408, "grad_norm": 0.0539088249206543, "learning_rate": 0.002982128409543029, "loss": 1.9039, "step": 10360 }, { "epoch": 0.06834162913802638, "grad_norm": 0.0529555045068264, "learning_rate": 0.0029820308262320677, "loss": 1.8987, "step": 10380 }, { "epoch": 0.06847330857759869, "grad_norm": 0.04998824745416641, "learning_rate": 0.0029819329788367773, "loss": 1.9015, "step": 10400 }, { "epoch": 0.06860498801717099, "grad_norm": 0.055027175694704056, "learning_rate": 0.0029818348673745928, "loss": 1.9022, "step": 10420 }, { "epoch": 0.0687366674567433, "grad_norm": 0.04936603456735611, "learning_rate": 0.002981736491862997, "loss": 1.8981, "step": 10440 }, { "epoch": 0.06886834689631562, "grad_norm": 0.05445968732237816, "learning_rate": 0.00298163785231952, "loss": 1.8922, "step": 10460 }, { "epoch": 0.06900002633588792, "grad_norm": 0.0514165423810482, "learning_rate": 0.0029815389487617377, "loss": 1.8941, "step": 10480 }, { "epoch": 0.06913170577546023, "grad_norm": 0.054617028683423996, "learning_rate": 0.002981439781207275, "loss": 1.8771, "step": 10500 }, { "epoch": 0.06926338521503253, "grad_norm": 0.051449310034513474, "learning_rate": 0.002981340349673801, "loss": 1.8979, "step": 10520 }, { "epoch": 0.06939506465460483, "grad_norm": 0.04865436255931854, "learning_rate": 0.0029812406541790347, "loss": 1.8929, "step": 10540 }, { "epoch": 0.06952674409417714, "grad_norm": 0.06338293850421906, "learning_rate": 0.0029811406947407404, "loss": 1.8849, "step": 10560 }, { "epoch": 0.06965842353374944, "grad_norm": 0.058406732976436615, "learning_rate": 0.00298104047137673, "loss": 1.8869, "step": 10580 }, { "epoch": 0.06979010297332175, "grad_norm": 0.05265038460493088, "learning_rate": 0.002980939984104863, "loss": 1.8807, "step": 10600 }, { "epoch": 0.06992178241289405, "grad_norm": 0.05860557034611702, "learning_rate": 0.0029808392329430445, "loss": 1.8926, "step": 10620 }, { "epoch": 0.07005346185246636, "grad_norm": 0.05650535598397255, "learning_rate": 0.0029807382179092277, "loss": 1.9136, "step": 10640 }, { "epoch": 0.07018514129203866, "grad_norm": 0.05268057808279991, "learning_rate": 0.0029806369390214123, "loss": 1.9313, "step": 10660 }, { "epoch": 0.07031682073161097, "grad_norm": 0.05681426078081131, "learning_rate": 0.002980535396297646, "loss": 1.9358, "step": 10680 }, { "epoch": 0.07044850017118327, "grad_norm": 0.06345421820878983, "learning_rate": 0.002980433589756022, "loss": 1.9411, "step": 10700 }, { "epoch": 0.07058017961075558, "grad_norm": 0.04853732883930206, "learning_rate": 0.002980331519414682, "loss": 1.9494, "step": 10720 }, { "epoch": 0.07071185905032788, "grad_norm": 0.047528378665447235, "learning_rate": 0.002980229185291814, "loss": 1.9364, "step": 10740 }, { "epoch": 0.07084353848990019, "grad_norm": 0.05809812992811203, "learning_rate": 0.002980126587405652, "loss": 1.9358, "step": 10760 }, { "epoch": 0.07097521792947249, "grad_norm": 0.05844232812523842, "learning_rate": 0.0029800237257744788, "loss": 1.9357, "step": 10780 }, { "epoch": 0.0711068973690448, "grad_norm": 0.04900583252310753, "learning_rate": 0.0029799206004166236, "loss": 1.9339, "step": 10800 }, { "epoch": 0.0712385768086171, "grad_norm": 0.056056343019008636, "learning_rate": 0.002979817211350462, "loss": 1.9213, "step": 10820 }, { "epoch": 0.0713702562481894, "grad_norm": 0.04929627478122711, "learning_rate": 0.002979713558594416, "loss": 1.9238, "step": 10840 }, { "epoch": 0.07150193568776171, "grad_norm": 0.051502469927072525, "learning_rate": 0.002979609642166958, "loss": 1.9297, "step": 10860 }, { "epoch": 0.07163361512733402, "grad_norm": 0.055544495582580566, "learning_rate": 0.002979505462086603, "loss": 1.9126, "step": 10880 }, { "epoch": 0.07176529456690632, "grad_norm": 0.05013841763138771, "learning_rate": 0.002979401018371915, "loss": 1.9167, "step": 10900 }, { "epoch": 0.07189697400647863, "grad_norm": 0.05101664736866951, "learning_rate": 0.002979296311041506, "loss": 1.9099, "step": 10920 }, { "epoch": 0.07202865344605093, "grad_norm": 0.06268607825040817, "learning_rate": 0.0029791913401140332, "loss": 1.9139, "step": 10940 }, { "epoch": 0.07216033288562324, "grad_norm": 0.05222015082836151, "learning_rate": 0.002979086105608202, "loss": 1.911, "step": 10960 }, { "epoch": 0.07229201232519554, "grad_norm": 0.054124996066093445, "learning_rate": 0.002978980607542763, "loss": 1.9097, "step": 10980 }, { "epoch": 0.07242369176476784, "grad_norm": 0.05831436067819595, "learning_rate": 0.0029788748459365164, "loss": 1.9166, "step": 11000 }, { "epoch": 0.07242369176476784, "eval_loss": 1.9284849166870117, "eval_runtime": 67.5794, "eval_samples_per_second": 14.797, "eval_steps_per_second": 14.797, "step": 11000 }, { "epoch": 0.07255537120434015, "grad_norm": 0.056505072861909866, "learning_rate": 0.0029787688208083073, "loss": 1.9091, "step": 11020 }, { "epoch": 0.07268705064391245, "grad_norm": 0.04782087355852127, "learning_rate": 0.002978662532177028, "loss": 1.9054, "step": 11040 }, { "epoch": 0.07281873008348476, "grad_norm": 0.05616345256567001, "learning_rate": 0.002978555980061619, "loss": 1.9027, "step": 11060 }, { "epoch": 0.07295040952305706, "grad_norm": 0.0646371841430664, "learning_rate": 0.002978449164481066, "loss": 1.8956, "step": 11080 }, { "epoch": 0.07308208896262937, "grad_norm": 0.0588691271841526, "learning_rate": 0.0029783420854544037, "loss": 1.8958, "step": 11100 }, { "epoch": 0.07321376840220169, "grad_norm": 0.05876161903142929, "learning_rate": 0.0029782347430007115, "loss": 1.898, "step": 11120 }, { "epoch": 0.07334544784177399, "grad_norm": 0.05978132411837578, "learning_rate": 0.0029781271371391175, "loss": 1.9033, "step": 11140 }, { "epoch": 0.0734771272813463, "grad_norm": 0.05216595530509949, "learning_rate": 0.0029780192678887964, "loss": 1.8997, "step": 11160 }, { "epoch": 0.0736088067209186, "grad_norm": 0.0518871508538723, "learning_rate": 0.002977911135268968, "loss": 1.9014, "step": 11180 }, { "epoch": 0.0737404861604909, "grad_norm": 0.05054188892245293, "learning_rate": 0.0029778027392989024, "loss": 1.8899, "step": 11200 }, { "epoch": 0.07387216560006321, "grad_norm": 0.059255532920360565, "learning_rate": 0.002977694079997913, "loss": 1.8928, "step": 11220 }, { "epoch": 0.07400384503963552, "grad_norm": 0.06282193213701248, "learning_rate": 0.002977585157385364, "loss": 1.9071, "step": 11240 }, { "epoch": 0.07413552447920782, "grad_norm": 0.048698440194129944, "learning_rate": 0.0029774759714806622, "loss": 1.9165, "step": 11260 }, { "epoch": 0.07426720391878013, "grad_norm": 0.05037577450275421, "learning_rate": 0.0029773665223032653, "loss": 1.9154, "step": 11280 }, { "epoch": 0.07439888335835243, "grad_norm": 0.049512796103954315, "learning_rate": 0.002977256809872675, "loss": 1.911, "step": 11300 }, { "epoch": 0.07453056279792473, "grad_norm": 0.05632052198052406, "learning_rate": 0.0029771468342084414, "loss": 1.9104, "step": 11320 }, { "epoch": 0.07466224223749704, "grad_norm": 0.050531480461359024, "learning_rate": 0.0029770365953301616, "loss": 1.9071, "step": 11340 }, { "epoch": 0.07479392167706934, "grad_norm": 0.057267602533102036, "learning_rate": 0.0029769260932574785, "loss": 1.9078, "step": 11360 }, { "epoch": 0.07492560111664165, "grad_norm": 0.05797697231173515, "learning_rate": 0.002976815328010083, "loss": 1.898, "step": 11380 }, { "epoch": 0.07505728055621395, "grad_norm": 0.04657141864299774, "learning_rate": 0.0029767042996077116, "loss": 1.8966, "step": 11400 }, { "epoch": 0.07518895999578626, "grad_norm": 0.05821000784635544, "learning_rate": 0.00297659300807015, "loss": 1.897, "step": 11420 }, { "epoch": 0.07532063943535856, "grad_norm": 0.050238363444805145, "learning_rate": 0.0029764814534172282, "loss": 1.8937, "step": 11440 }, { "epoch": 0.07545231887493087, "grad_norm": 0.04804101213812828, "learning_rate": 0.0029763696356688244, "loss": 1.8935, "step": 11460 }, { "epoch": 0.07558399831450317, "grad_norm": 0.057969000190496445, "learning_rate": 0.002976257554844864, "loss": 1.8896, "step": 11480 }, { "epoch": 0.07571567775407548, "grad_norm": 0.05278369039297104, "learning_rate": 0.002976145210965319, "loss": 1.8918, "step": 11500 }, { "epoch": 0.07584735719364778, "grad_norm": 0.05272908881306648, "learning_rate": 0.0029760326040502065, "loss": 1.8896, "step": 11520 }, { "epoch": 0.07597903663322009, "grad_norm": 0.0534030944108963, "learning_rate": 0.0029759197341195933, "loss": 1.8833, "step": 11540 }, { "epoch": 0.07611071607279239, "grad_norm": 0.05342519283294678, "learning_rate": 0.002975806601193592, "loss": 1.8828, "step": 11560 }, { "epoch": 0.0762423955123647, "grad_norm": 0.05289285629987717, "learning_rate": 0.002975693205292361, "loss": 1.8786, "step": 11580 }, { "epoch": 0.076374074951937, "grad_norm": 0.05132855102419853, "learning_rate": 0.0029755795464361063, "loss": 1.882, "step": 11600 }, { "epoch": 0.0765057543915093, "grad_norm": 0.057877812534570694, "learning_rate": 0.0029754656246450822, "loss": 1.8881, "step": 11620 }, { "epoch": 0.07663743383108161, "grad_norm": 0.054198529571294785, "learning_rate": 0.002975351439939587, "loss": 1.8849, "step": 11640 }, { "epoch": 0.07676911327065392, "grad_norm": 0.04742525890469551, "learning_rate": 0.0029752369923399685, "loss": 1.8819, "step": 11660 }, { "epoch": 0.07690079271022622, "grad_norm": 0.057487789541482925, "learning_rate": 0.002975122281866619, "loss": 1.8751, "step": 11680 }, { "epoch": 0.07703247214979853, "grad_norm": 0.04776060953736305, "learning_rate": 0.002975007308539981, "loss": 1.8726, "step": 11700 }, { "epoch": 0.07716415158937083, "grad_norm": 0.05077700316905975, "learning_rate": 0.002974892072380539, "loss": 1.876, "step": 11720 }, { "epoch": 0.07729583102894313, "grad_norm": 0.0542939268052578, "learning_rate": 0.0029747765734088284, "loss": 1.8788, "step": 11740 }, { "epoch": 0.07742751046851544, "grad_norm": 0.04847322776913643, "learning_rate": 0.0029746608116454306, "loss": 1.8705, "step": 11760 }, { "epoch": 0.07755918990808774, "grad_norm": 0.0494987815618515, "learning_rate": 0.0029745447871109727, "loss": 1.8776, "step": 11780 }, { "epoch": 0.07769086934766006, "grad_norm": 0.05288725346326828, "learning_rate": 0.0029744284998261287, "loss": 1.8733, "step": 11800 }, { "epoch": 0.07782254878723237, "grad_norm": 0.0571809746325016, "learning_rate": 0.0029743119498116203, "loss": 1.8761, "step": 11820 }, { "epoch": 0.07795422822680467, "grad_norm": 0.050889961421489716, "learning_rate": 0.0029741951370882164, "loss": 1.8692, "step": 11840 }, { "epoch": 0.07808590766637698, "grad_norm": 0.0550447441637516, "learning_rate": 0.002974078061676731, "loss": 1.8739, "step": 11860 }, { "epoch": 0.07821758710594928, "grad_norm": 0.05145235359668732, "learning_rate": 0.002973960723598026, "loss": 1.8653, "step": 11880 }, { "epoch": 0.07834926654552159, "grad_norm": 0.05060429126024246, "learning_rate": 0.0029738431228730107, "loss": 1.8529, "step": 11900 }, { "epoch": 0.07848094598509389, "grad_norm": 0.05473101884126663, "learning_rate": 0.0029737252595226395, "loss": 1.8513, "step": 11920 }, { "epoch": 0.0786126254246662, "grad_norm": 0.05369679257273674, "learning_rate": 0.002973607133567915, "loss": 1.8473, "step": 11940 }, { "epoch": 0.0787443048642385, "grad_norm": 0.06132115051150322, "learning_rate": 0.0029734887450298866, "loss": 1.8426, "step": 11960 }, { "epoch": 0.0788759843038108, "grad_norm": 0.049720194190740585, "learning_rate": 0.0029733700939296487, "loss": 1.8412, "step": 11980 }, { "epoch": 0.07900766374338311, "grad_norm": 0.048152726143598557, "learning_rate": 0.0029732511802883456, "loss": 1.8388, "step": 12000 }, { "epoch": 0.07900766374338311, "eval_loss": 1.7857414484024048, "eval_runtime": 68.3192, "eval_samples_per_second": 14.637, "eval_steps_per_second": 14.637, "step": 12000 }, { "epoch": 0.07913934318295542, "grad_norm": 0.05637095496058464, "learning_rate": 0.0029731320041271655, "loss": 1.8317, "step": 12020 }, { "epoch": 0.07927102262252772, "grad_norm": 0.05279828608036041, "learning_rate": 0.002973012565467345, "loss": 1.8265, "step": 12040 }, { "epoch": 0.07940270206210003, "grad_norm": 0.05788380280137062, "learning_rate": 0.0029728928643301664, "loss": 1.8285, "step": 12060 }, { "epoch": 0.07953438150167233, "grad_norm": 0.05116511508822441, "learning_rate": 0.0029727729007369597, "loss": 1.8305, "step": 12080 }, { "epoch": 0.07966606094124463, "grad_norm": 0.05228397622704506, "learning_rate": 0.0029726526747091016, "loss": 1.8299, "step": 12100 }, { "epoch": 0.07979774038081694, "grad_norm": 0.06771951913833618, "learning_rate": 0.0029725321862680144, "loss": 1.8221, "step": 12120 }, { "epoch": 0.07992941982038924, "grad_norm": 0.05031878501176834, "learning_rate": 0.002972411435435169, "loss": 1.8244, "step": 12140 }, { "epoch": 0.08006109925996155, "grad_norm": 0.057394348084926605, "learning_rate": 0.0029722904222320825, "loss": 1.8279, "step": 12160 }, { "epoch": 0.08019277869953385, "grad_norm": 0.05116160586476326, "learning_rate": 0.0029721691466803165, "loss": 1.8192, "step": 12180 }, { "epoch": 0.08032445813910616, "grad_norm": 0.05168084427714348, "learning_rate": 0.002972047608801483, "loss": 1.8265, "step": 12200 }, { "epoch": 0.08045613757867846, "grad_norm": 0.053319819271564484, "learning_rate": 0.0029719258086172377, "loss": 1.8237, "step": 12220 }, { "epoch": 0.08058781701825077, "grad_norm": 0.09060586988925934, "learning_rate": 0.002971803746149285, "loss": 1.8176, "step": 12240 }, { "epoch": 0.08071949645782307, "grad_norm": 0.05889497324824333, "learning_rate": 0.002971681421419375, "loss": 1.8166, "step": 12260 }, { "epoch": 0.08085117589739538, "grad_norm": 0.056241389364004135, "learning_rate": 0.002971558834449305, "loss": 1.8189, "step": 12280 }, { "epoch": 0.08098285533696768, "grad_norm": 0.07331902533769608, "learning_rate": 0.002971435985260919, "loss": 1.8173, "step": 12300 }, { "epoch": 0.08111453477653999, "grad_norm": 0.05276619270443916, "learning_rate": 0.002971312873876107, "loss": 1.8194, "step": 12320 }, { "epoch": 0.08124621421611229, "grad_norm": 0.052701130509376526, "learning_rate": 0.002971189500316807, "loss": 1.808, "step": 12340 }, { "epoch": 0.0813778936556846, "grad_norm": 0.05825614184141159, "learning_rate": 0.0029710658646050028, "loss": 1.8206, "step": 12360 }, { "epoch": 0.0815095730952569, "grad_norm": 0.05325302854180336, "learning_rate": 0.002970941966762725, "loss": 1.8072, "step": 12380 }, { "epoch": 0.0816412525348292, "grad_norm": 0.05424511805176735, "learning_rate": 0.0029708178068120514, "loss": 1.814, "step": 12400 }, { "epoch": 0.08177293197440151, "grad_norm": 0.05035754665732384, "learning_rate": 0.002970693384775106, "loss": 1.8281, "step": 12420 }, { "epoch": 0.08190461141397382, "grad_norm": 0.0715329572558403, "learning_rate": 0.0029705687006740594, "loss": 1.8342, "step": 12440 }, { "epoch": 0.08203629085354612, "grad_norm": 0.05069407820701599, "learning_rate": 0.002970443754531129, "loss": 1.8306, "step": 12460 }, { "epoch": 0.08216797029311844, "grad_norm": 0.05642094835639, "learning_rate": 0.00297031854636858, "loss": 1.8252, "step": 12480 }, { "epoch": 0.08229964973269074, "grad_norm": 0.05098734796047211, "learning_rate": 0.0029701930762087232, "loss": 1.8283, "step": 12500 }, { "epoch": 0.08243132917226305, "grad_norm": 0.05360301956534386, "learning_rate": 0.002970067344073915, "loss": 1.8121, "step": 12520 }, { "epoch": 0.08256300861183535, "grad_norm": 0.064446359872818, "learning_rate": 0.002969941349986561, "loss": 1.8167, "step": 12540 }, { "epoch": 0.08269468805140766, "grad_norm": 0.05934213101863861, "learning_rate": 0.002969815093969112, "loss": 1.8104, "step": 12560 }, { "epoch": 0.08282636749097996, "grad_norm": 0.05697745084762573, "learning_rate": 0.0029696885760440647, "loss": 1.8118, "step": 12580 }, { "epoch": 0.08295804693055227, "grad_norm": 0.05313008651137352, "learning_rate": 0.0029695617962339645, "loss": 1.8073, "step": 12600 }, { "epoch": 0.08308972637012457, "grad_norm": 0.05284099653363228, "learning_rate": 0.002969434754561402, "loss": 1.8142, "step": 12620 }, { "epoch": 0.08322140580969688, "grad_norm": 0.054485708475112915, "learning_rate": 0.0029693074510490154, "loss": 1.8067, "step": 12640 }, { "epoch": 0.08335308524926918, "grad_norm": 0.050835754722356796, "learning_rate": 0.0029691798857194884, "loss": 1.8094, "step": 12660 }, { "epoch": 0.08348476468884149, "grad_norm": 0.05048472061753273, "learning_rate": 0.0029690520585955514, "loss": 1.8019, "step": 12680 }, { "epoch": 0.08361644412841379, "grad_norm": 0.05250314995646477, "learning_rate": 0.0029689239696999836, "loss": 1.7949, "step": 12700 }, { "epoch": 0.0837481235679861, "grad_norm": 0.05029289051890373, "learning_rate": 0.0029687956190556078, "loss": 1.8036, "step": 12720 }, { "epoch": 0.0838798030075584, "grad_norm": 0.053878892213106155, "learning_rate": 0.002968667006685296, "loss": 1.8019, "step": 12740 }, { "epoch": 0.0840114824471307, "grad_norm": 0.05751722306013107, "learning_rate": 0.0029685381326119645, "loss": 1.8014, "step": 12760 }, { "epoch": 0.08414316188670301, "grad_norm": 0.05387134477496147, "learning_rate": 0.002968408996858579, "loss": 1.7998, "step": 12780 }, { "epoch": 0.08427484132627532, "grad_norm": 0.056205861270427704, "learning_rate": 0.002968279599448149, "loss": 1.8051, "step": 12800 }, { "epoch": 0.08440652076584762, "grad_norm": 0.052303776144981384, "learning_rate": 0.0029681499404037325, "loss": 1.7967, "step": 12820 }, { "epoch": 0.08453820020541992, "grad_norm": 0.06636688113212585, "learning_rate": 0.002968020019748434, "loss": 1.799, "step": 12840 }, { "epoch": 0.08466987964499223, "grad_norm": 0.05160198360681534, "learning_rate": 0.0029678898375054036, "loss": 1.7987, "step": 12860 }, { "epoch": 0.08480155908456453, "grad_norm": 0.05559029057621956, "learning_rate": 0.002967759393697839, "loss": 1.8034, "step": 12880 }, { "epoch": 0.08493323852413684, "grad_norm": 0.057246867567300797, "learning_rate": 0.002967628688348983, "loss": 1.7888, "step": 12900 }, { "epoch": 0.08506491796370914, "grad_norm": 0.06301821768283844, "learning_rate": 0.0029674977214821274, "loss": 1.801, "step": 12920 }, { "epoch": 0.08519659740328145, "grad_norm": 0.055293645709753036, "learning_rate": 0.0029673664931206085, "loss": 1.7955, "step": 12940 }, { "epoch": 0.08532827684285375, "grad_norm": 0.05522451177239418, "learning_rate": 0.0029672350032878105, "loss": 1.788, "step": 12960 }, { "epoch": 0.08545995628242606, "grad_norm": 0.057026926428079605, "learning_rate": 0.0029671032520071634, "loss": 1.7898, "step": 12980 }, { "epoch": 0.08559163572199836, "grad_norm": 0.06190698221325874, "learning_rate": 0.002966971239302144, "loss": 1.8188, "step": 13000 }, { "epoch": 0.08559163572199836, "eval_loss": 1.6987569332122803, "eval_runtime": 70.9806, "eval_samples_per_second": 14.088, "eval_steps_per_second": 14.088, "step": 13000 }, { "epoch": 0.08572331516157067, "grad_norm": 0.05302195996046066, "learning_rate": 0.002966838965196276, "loss": 1.8589, "step": 13020 }, { "epoch": 0.08585499460114297, "grad_norm": 0.051264405250549316, "learning_rate": 0.0029667064297131296, "loss": 1.8669, "step": 13040 }, { "epoch": 0.08598667404071528, "grad_norm": 0.05437634140253067, "learning_rate": 0.0029665736328763205, "loss": 1.8685, "step": 13060 }, { "epoch": 0.08611835348028758, "grad_norm": 0.05606294050812721, "learning_rate": 0.0029664405747095134, "loss": 1.8787, "step": 13080 }, { "epoch": 0.08625003291985989, "grad_norm": 0.053556881844997406, "learning_rate": 0.0029663072552364163, "loss": 1.8788, "step": 13100 }, { "epoch": 0.08638171235943219, "grad_norm": 0.06021646037697792, "learning_rate": 0.0029661736744807867, "loss": 1.8733, "step": 13120 }, { "epoch": 0.08651339179900451, "grad_norm": 0.06918266415596008, "learning_rate": 0.002966039832466427, "loss": 1.8827, "step": 13140 }, { "epoch": 0.08664507123857682, "grad_norm": 0.052268948405981064, "learning_rate": 0.002965905729217187, "loss": 1.8688, "step": 13160 }, { "epoch": 0.08677675067814912, "grad_norm": 0.0564788356423378, "learning_rate": 0.0029657713647569623, "loss": 1.8599, "step": 13180 }, { "epoch": 0.08690843011772142, "grad_norm": 0.04878311604261398, "learning_rate": 0.0029656367391096955, "loss": 1.8654, "step": 13200 }, { "epoch": 0.08704010955729373, "grad_norm": 0.051273491233587265, "learning_rate": 0.002965501852299376, "loss": 1.8634, "step": 13220 }, { "epoch": 0.08717178899686603, "grad_norm": 0.06505248695611954, "learning_rate": 0.002965366704350039, "loss": 1.859, "step": 13240 }, { "epoch": 0.08730346843643834, "grad_norm": 0.05197957530617714, "learning_rate": 0.002965231295285767, "loss": 1.8631, "step": 13260 }, { "epoch": 0.08743514787601064, "grad_norm": 0.05774524062871933, "learning_rate": 0.0029650956251306877, "loss": 1.8508, "step": 13280 }, { "epoch": 0.08756682731558295, "grad_norm": 0.04711959511041641, "learning_rate": 0.0029649596939089772, "loss": 1.8488, "step": 13300 }, { "epoch": 0.08769850675515525, "grad_norm": 0.04737945273518562, "learning_rate": 0.0029648235016448573, "loss": 1.8546, "step": 13320 }, { "epoch": 0.08783018619472756, "grad_norm": 0.051619525998830795, "learning_rate": 0.0029646870483625953, "loss": 1.8514, "step": 13340 }, { "epoch": 0.08796186563429986, "grad_norm": 0.05580944940447807, "learning_rate": 0.002964550334086507, "loss": 1.85, "step": 13360 }, { "epoch": 0.08809354507387217, "grad_norm": 0.05655309185385704, "learning_rate": 0.002964413358840953, "loss": 1.8456, "step": 13380 }, { "epoch": 0.08822522451344447, "grad_norm": 0.05536419898271561, "learning_rate": 0.0029642761226503413, "loss": 1.8375, "step": 13400 }, { "epoch": 0.08835690395301678, "grad_norm": 0.055286381393671036, "learning_rate": 0.002964138625539126, "loss": 1.8406, "step": 13420 }, { "epoch": 0.08848858339258908, "grad_norm": 0.07900959998369217, "learning_rate": 0.0029640008675318077, "loss": 1.847, "step": 13440 }, { "epoch": 0.08862026283216139, "grad_norm": 0.05409523472189903, "learning_rate": 0.002963862848652934, "loss": 1.8483, "step": 13460 }, { "epoch": 0.08875194227173369, "grad_norm": 0.04646017774939537, "learning_rate": 0.0029637245689270978, "loss": 1.8357, "step": 13480 }, { "epoch": 0.088883621711306, "grad_norm": 0.05184982717037201, "learning_rate": 0.0029635860283789405, "loss": 1.8407, "step": 13500 }, { "epoch": 0.0890153011508783, "grad_norm": 0.05196777358651161, "learning_rate": 0.0029634472270331476, "loss": 1.8404, "step": 13520 }, { "epoch": 0.0891469805904506, "grad_norm": 0.0526873879134655, "learning_rate": 0.0029633081649144528, "loss": 1.8403, "step": 13540 }, { "epoch": 0.08927866003002291, "grad_norm": 0.06644752621650696, "learning_rate": 0.0029631688420476356, "loss": 1.8312, "step": 13560 }, { "epoch": 0.08941033946959522, "grad_norm": 0.06348369270563126, "learning_rate": 0.002963029258457522, "loss": 1.8343, "step": 13580 }, { "epoch": 0.08954201890916752, "grad_norm": 0.06941412389278412, "learning_rate": 0.002962889414168985, "loss": 1.8488, "step": 13600 }, { "epoch": 0.08967369834873982, "grad_norm": 0.0526285357773304, "learning_rate": 0.0029627493092069432, "loss": 1.8645, "step": 13620 }, { "epoch": 0.08980537778831213, "grad_norm": 0.04776741564273834, "learning_rate": 0.002962608943596362, "loss": 1.8647, "step": 13640 }, { "epoch": 0.08993705722788443, "grad_norm": 0.05642177537083626, "learning_rate": 0.0029624683173622526, "loss": 1.8651, "step": 13660 }, { "epoch": 0.09006873666745674, "grad_norm": 0.04894222691655159, "learning_rate": 0.0029623274305296743, "loss": 1.8652, "step": 13680 }, { "epoch": 0.09020041610702904, "grad_norm": 0.05177977308630943, "learning_rate": 0.0029621862831237314, "loss": 1.8606, "step": 13700 }, { "epoch": 0.09033209554660135, "grad_norm": 0.05325636267662048, "learning_rate": 0.0029620448751695757, "loss": 1.8562, "step": 13720 }, { "epoch": 0.09046377498617365, "grad_norm": 0.053102049976587296, "learning_rate": 0.0029619032066924037, "loss": 1.8607, "step": 13740 }, { "epoch": 0.09059545442574596, "grad_norm": 0.06039892137050629, "learning_rate": 0.0029617612777174604, "loss": 1.8598, "step": 13760 }, { "epoch": 0.09072713386531826, "grad_norm": 0.05456007272005081, "learning_rate": 0.0029616190882700358, "loss": 1.855, "step": 13780 }, { "epoch": 0.09085881330489057, "grad_norm": 0.05931520834565163, "learning_rate": 0.002961476638375467, "loss": 1.8562, "step": 13800 }, { "epoch": 0.09099049274446289, "grad_norm": 0.05977236106991768, "learning_rate": 0.0029613339280591365, "loss": 1.8562, "step": 13820 }, { "epoch": 0.09112217218403519, "grad_norm": 0.06268831342458725, "learning_rate": 0.0029611909573464745, "loss": 1.8472, "step": 13840 }, { "epoch": 0.0912538516236075, "grad_norm": 0.05633818358182907, "learning_rate": 0.002961047726262958, "loss": 1.8403, "step": 13860 }, { "epoch": 0.0913855310631798, "grad_norm": 0.0659051239490509, "learning_rate": 0.0029609042348341078, "loss": 1.8382, "step": 13880 }, { "epoch": 0.0915172105027521, "grad_norm": 0.050592195242643356, "learning_rate": 0.0029607604830854937, "loss": 1.8452, "step": 13900 }, { "epoch": 0.09164888994232441, "grad_norm": 0.049383338540792465, "learning_rate": 0.0029606164710427314, "loss": 1.8443, "step": 13920 }, { "epoch": 0.09178056938189671, "grad_norm": 0.06528118252754211, "learning_rate": 0.002960472198731481, "loss": 1.8422, "step": 13940 }, { "epoch": 0.09191224882146902, "grad_norm": 0.05411006882786751, "learning_rate": 0.002960327666177452, "loss": 1.8465, "step": 13960 }, { "epoch": 0.09204392826104132, "grad_norm": 0.0483255498111248, "learning_rate": 0.0029601828734063984, "loss": 1.8427, "step": 13980 }, { "epoch": 0.09217560770061363, "grad_norm": 0.050317153334617615, "learning_rate": 0.0029600378204441206, "loss": 1.8339, "step": 14000 }, { "epoch": 0.09217560770061363, "eval_loss": 1.785549283027649, "eval_runtime": 68.197, "eval_samples_per_second": 14.663, "eval_steps_per_second": 14.663, "step": 14000 }, { "epoch": 0.09230728714018593, "grad_norm": 0.05255632847547531, "learning_rate": 0.0029598925073164657, "loss": 1.8319, "step": 14020 }, { "epoch": 0.09243896657975824, "grad_norm": 0.053322333842515945, "learning_rate": 0.0029597469340493275, "loss": 1.8343, "step": 14040 }, { "epoch": 0.09257064601933054, "grad_norm": 0.046458128839731216, "learning_rate": 0.0029596011006686454, "loss": 1.8335, "step": 14060 }, { "epoch": 0.09270232545890285, "grad_norm": 0.051327046006917953, "learning_rate": 0.0029594550072004062, "loss": 1.8295, "step": 14080 }, { "epoch": 0.09283400489847515, "grad_norm": 0.06848567724227905, "learning_rate": 0.002959308653670642, "loss": 1.8375, "step": 14100 }, { "epoch": 0.09296568433804746, "grad_norm": 0.05707765370607376, "learning_rate": 0.0029591620401054316, "loss": 1.8341, "step": 14120 }, { "epoch": 0.09309736377761976, "grad_norm": 0.050898268818855286, "learning_rate": 0.0029590151665309004, "loss": 1.8324, "step": 14140 }, { "epoch": 0.09322904321719207, "grad_norm": 0.06690908968448639, "learning_rate": 0.0029588680329732196, "loss": 1.8357, "step": 14160 }, { "epoch": 0.09336072265676437, "grad_norm": 0.05576496198773384, "learning_rate": 0.0029587206394586073, "loss": 1.827, "step": 14180 }, { "epoch": 0.09349240209633668, "grad_norm": 0.060783933848142624, "learning_rate": 0.002958572986013328, "loss": 1.827, "step": 14200 }, { "epoch": 0.09362408153590898, "grad_norm": 0.05840138718485832, "learning_rate": 0.0029584250726636917, "loss": 1.8005, "step": 14220 }, { "epoch": 0.09375576097548129, "grad_norm": 0.06067179888486862, "learning_rate": 0.0029582768994360557, "loss": 1.7913, "step": 14240 }, { "epoch": 0.09388744041505359, "grad_norm": 0.04877826198935509, "learning_rate": 0.002958128466356822, "loss": 1.7808, "step": 14260 }, { "epoch": 0.0940191198546259, "grad_norm": 0.07199737429618835, "learning_rate": 0.0029579797734524413, "loss": 1.7692, "step": 14280 }, { "epoch": 0.0941507992941982, "grad_norm": 0.05159222334623337, "learning_rate": 0.002957830820749409, "loss": 1.7735, "step": 14300 }, { "epoch": 0.0942824787337705, "grad_norm": 0.05802571773529053, "learning_rate": 0.0029576816082742662, "loss": 1.7648, "step": 14320 }, { "epoch": 0.09441415817334281, "grad_norm": 0.05139509588479996, "learning_rate": 0.0029575321360536025, "loss": 1.7667, "step": 14340 }, { "epoch": 0.09454583761291512, "grad_norm": 0.06891103833913803, "learning_rate": 0.002957382404114052, "loss": 1.766, "step": 14360 }, { "epoch": 0.09467751705248742, "grad_norm": 0.054211389273405075, "learning_rate": 0.0029572324124822955, "loss": 1.7576, "step": 14380 }, { "epoch": 0.09480919649205972, "grad_norm": 0.0536891408264637, "learning_rate": 0.0029570821611850594, "loss": 1.7597, "step": 14400 }, { "epoch": 0.09494087593163203, "grad_norm": 0.052394088357686996, "learning_rate": 0.0029569316502491183, "loss": 1.7645, "step": 14420 }, { "epoch": 0.09507255537120433, "grad_norm": 0.05916254222393036, "learning_rate": 0.002956780879701291, "loss": 1.7631, "step": 14440 }, { "epoch": 0.09520423481077664, "grad_norm": 0.060256022959947586, "learning_rate": 0.0029566298495684444, "loss": 1.7566, "step": 14460 }, { "epoch": 0.09533591425034894, "grad_norm": 0.055872827768325806, "learning_rate": 0.0029564785598774897, "loss": 1.7536, "step": 14480 }, { "epoch": 0.09546759368992126, "grad_norm": 0.053552061319351196, "learning_rate": 0.0029563270106553858, "loss": 1.7567, "step": 14500 }, { "epoch": 0.09559927312949357, "grad_norm": 0.07257280498743057, "learning_rate": 0.0029561752019291376, "loss": 1.7526, "step": 14520 }, { "epoch": 0.09573095256906587, "grad_norm": 0.061258714646101, "learning_rate": 0.002956023133725795, "loss": 1.7556, "step": 14540 }, { "epoch": 0.09586263200863818, "grad_norm": 0.05536385625600815, "learning_rate": 0.002955870806072457, "loss": 1.7482, "step": 14560 }, { "epoch": 0.09599431144821048, "grad_norm": 0.05093999579548836, "learning_rate": 0.002955718218996265, "loss": 1.7564, "step": 14580 }, { "epoch": 0.09612599088778279, "grad_norm": 0.05484277009963989, "learning_rate": 0.00295556537252441, "loss": 1.7491, "step": 14600 }, { "epoch": 0.09625767032735509, "grad_norm": 0.05289185419678688, "learning_rate": 0.002955412266684127, "loss": 1.7516, "step": 14620 }, { "epoch": 0.0963893497669274, "grad_norm": 0.05835564061999321, "learning_rate": 0.0029552589015026986, "loss": 1.7516, "step": 14640 }, { "epoch": 0.0965210292064997, "grad_norm": 0.05260492116212845, "learning_rate": 0.0029551052770074525, "loss": 1.7534, "step": 14660 }, { "epoch": 0.096652708646072, "grad_norm": 0.052535686641931534, "learning_rate": 0.002954951393225764, "loss": 1.7482, "step": 14680 }, { "epoch": 0.09678438808564431, "grad_norm": 0.062096912413835526, "learning_rate": 0.0029547972501850536, "loss": 1.7496, "step": 14700 }, { "epoch": 0.09691606752521661, "grad_norm": 0.07016194611787796, "learning_rate": 0.0029546428479127877, "loss": 1.7456, "step": 14720 }, { "epoch": 0.09704774696478892, "grad_norm": 0.06487017124891281, "learning_rate": 0.0029544881864364794, "loss": 1.7443, "step": 14740 }, { "epoch": 0.09717942640436122, "grad_norm": 0.060498468577861786, "learning_rate": 0.002954333265783688, "loss": 1.7516, "step": 14760 }, { "epoch": 0.09731110584393353, "grad_norm": 0.0497431606054306, "learning_rate": 0.0029541780859820197, "loss": 1.7635, "step": 14780 }, { "epoch": 0.09744278528350583, "grad_norm": 0.06207452341914177, "learning_rate": 0.002954022647059125, "loss": 1.7834, "step": 14800 }, { "epoch": 0.09757446472307814, "grad_norm": 0.06484688818454742, "learning_rate": 0.002953866949042703, "loss": 1.7779, "step": 14820 }, { "epoch": 0.09770614416265044, "grad_norm": 0.06074841320514679, "learning_rate": 0.002953710991960496, "loss": 1.7828, "step": 14840 }, { "epoch": 0.09783782360222275, "grad_norm": 0.05373964086174965, "learning_rate": 0.0029535547758402954, "loss": 1.7808, "step": 14860 }, { "epoch": 0.09796950304179505, "grad_norm": 0.06373169273138046, "learning_rate": 0.002953398300709937, "loss": 1.7843, "step": 14880 }, { "epoch": 0.09810118248136736, "grad_norm": 0.05869118869304657, "learning_rate": 0.0029532415665973035, "loss": 1.7826, "step": 14900 }, { "epoch": 0.09823286192093966, "grad_norm": 0.05736270919442177, "learning_rate": 0.002953084573530323, "loss": 1.774, "step": 14920 }, { "epoch": 0.09836454136051197, "grad_norm": 0.07032917439937592, "learning_rate": 0.0029529273215369704, "loss": 1.7702, "step": 14940 }, { "epoch": 0.09849622080008427, "grad_norm": 0.0598934143781662, "learning_rate": 0.002952769810645267, "loss": 1.7708, "step": 14960 }, { "epoch": 0.09862790023965658, "grad_norm": 0.06163979694247246, "learning_rate": 0.0029526120408832793, "loss": 1.7771, "step": 14980 }, { "epoch": 0.09875957967922888, "grad_norm": 0.055272020399570465, "learning_rate": 0.002952454012279121, "loss": 1.7675, "step": 15000 }, { "epoch": 0.09875957967922888, "eval_loss": 1.6859747171401978, "eval_runtime": 68.5865, "eval_samples_per_second": 14.58, "eval_steps_per_second": 14.58, "step": 15000 }, { "epoch": 0.09889125911880119, "grad_norm": 0.06086422875523567, "learning_rate": 0.0029522957248609505, "loss": 1.7656, "step": 15020 }, { "epoch": 0.09902293855837349, "grad_norm": 0.061683736741542816, "learning_rate": 0.0029521371786569743, "loss": 1.7571, "step": 15040 }, { "epoch": 0.0991546179979458, "grad_norm": 0.0584699846804142, "learning_rate": 0.0029519783736954427, "loss": 1.7654, "step": 15060 }, { "epoch": 0.0992862974375181, "grad_norm": 0.052420806139707565, "learning_rate": 0.002951819310004654, "loss": 1.764, "step": 15080 }, { "epoch": 0.0994179768770904, "grad_norm": 0.0528109036386013, "learning_rate": 0.0029516599876129516, "loss": 1.7611, "step": 15100 }, { "epoch": 0.09954965631666271, "grad_norm": 0.061885856091976166, "learning_rate": 0.0029515004065487254, "loss": 1.7628, "step": 15120 }, { "epoch": 0.09968133575623501, "grad_norm": 0.04771438241004944, "learning_rate": 0.0029513405668404116, "loss": 1.7652, "step": 15140 }, { "epoch": 0.09981301519580732, "grad_norm": 0.05954625830054283, "learning_rate": 0.0029511804685164915, "loss": 1.7554, "step": 15160 }, { "epoch": 0.09994469463537964, "grad_norm": 0.05653547868132591, "learning_rate": 0.002951020111605494, "loss": 1.7607, "step": 15180 }, { "epoch": 0.10007637407495194, "grad_norm": 0.05563562363386154, "learning_rate": 0.0029508594961359922, "loss": 1.759, "step": 15200 }, { "epoch": 0.10020805351452425, "grad_norm": 0.07335685193538666, "learning_rate": 0.002950698622136607, "loss": 1.7543, "step": 15220 }, { "epoch": 0.10033973295409655, "grad_norm": 0.06355411559343338, "learning_rate": 0.0029505374896360045, "loss": 1.7564, "step": 15240 }, { "epoch": 0.10047141239366886, "grad_norm": 0.05546756461262703, "learning_rate": 0.0029503760986628975, "loss": 1.7522, "step": 15260 }, { "epoch": 0.10060309183324116, "grad_norm": 0.058881357312202454, "learning_rate": 0.002950214449246043, "loss": 1.7544, "step": 15280 }, { "epoch": 0.10073477127281347, "grad_norm": 0.06903751194477081, "learning_rate": 0.0029500525414142475, "loss": 1.7531, "step": 15300 }, { "epoch": 0.10086645071238577, "grad_norm": 0.053250331431627274, "learning_rate": 0.00294989037519636, "loss": 1.753, "step": 15320 }, { "epoch": 0.10099813015195808, "grad_norm": 0.059820231050252914, "learning_rate": 0.002949727950621277, "loss": 1.7506, "step": 15340 }, { "epoch": 0.10112980959153038, "grad_norm": 0.06770730763673782, "learning_rate": 0.0029495652677179423, "loss": 1.76, "step": 15360 }, { "epoch": 0.10126148903110269, "grad_norm": 0.0625774934887886, "learning_rate": 0.0029494023265153432, "loss": 1.7919, "step": 15380 }, { "epoch": 0.10139316847067499, "grad_norm": 0.06113676354289055, "learning_rate": 0.002949239127042515, "loss": 1.814, "step": 15400 }, { "epoch": 0.1015248479102473, "grad_norm": 0.06288577616214752, "learning_rate": 0.002949075669328538, "loss": 1.8281, "step": 15420 }, { "epoch": 0.1016565273498196, "grad_norm": 0.05384008586406708, "learning_rate": 0.0029489119534025394, "loss": 1.8323, "step": 15440 }, { "epoch": 0.1017882067893919, "grad_norm": 0.06467036157846451, "learning_rate": 0.002948747979293692, "loss": 1.8343, "step": 15460 }, { "epoch": 0.10191988622896421, "grad_norm": 0.05992506816983223, "learning_rate": 0.0029485837470312128, "loss": 1.8315, "step": 15480 }, { "epoch": 0.10205156566853651, "grad_norm": 0.054823681712150574, "learning_rate": 0.002948419256644369, "loss": 1.8361, "step": 15500 }, { "epoch": 0.10218324510810882, "grad_norm": 0.07598422467708588, "learning_rate": 0.002948254508162469, "loss": 1.8395, "step": 15520 }, { "epoch": 0.10231492454768112, "grad_norm": 0.060086604207754135, "learning_rate": 0.002948089501614871, "loss": 1.8341, "step": 15540 }, { "epoch": 0.10244660398725343, "grad_norm": 0.05407283455133438, "learning_rate": 0.0029479242370309766, "loss": 1.8277, "step": 15560 }, { "epoch": 0.10257828342682573, "grad_norm": 0.057680752128362656, "learning_rate": 0.0029477587144402357, "loss": 1.8196, "step": 15580 }, { "epoch": 0.10270996286639804, "grad_norm": 0.0544477254152298, "learning_rate": 0.0029475929338721417, "loss": 1.8108, "step": 15600 }, { "epoch": 0.10284164230597034, "grad_norm": 0.054894376546144485, "learning_rate": 0.002947426895356236, "loss": 1.8139, "step": 15620 }, { "epoch": 0.10297332174554265, "grad_norm": 0.061300814151763916, "learning_rate": 0.0029472605989221043, "loss": 1.8116, "step": 15640 }, { "epoch": 0.10310500118511495, "grad_norm": 0.07517964392900467, "learning_rate": 0.00294709404459938, "loss": 1.806, "step": 15660 }, { "epoch": 0.10323668062468726, "grad_norm": 0.06433480978012085, "learning_rate": 0.0029469272324177415, "loss": 1.8092, "step": 15680 }, { "epoch": 0.10336836006425956, "grad_norm": 0.05521683767437935, "learning_rate": 0.0029467601624069122, "loss": 1.814, "step": 15700 }, { "epoch": 0.10350003950383187, "grad_norm": 0.0895058736205101, "learning_rate": 0.002946592834596663, "loss": 1.81, "step": 15720 }, { "epoch": 0.10363171894340417, "grad_norm": 0.0530746690928936, "learning_rate": 0.0029464252490168114, "loss": 1.8098, "step": 15740 }, { "epoch": 0.10376339838297648, "grad_norm": 0.05384887382388115, "learning_rate": 0.0029462574056972174, "loss": 1.8097, "step": 15760 }, { "epoch": 0.10389507782254878, "grad_norm": 0.05644648149609566, "learning_rate": 0.002946089304667791, "loss": 1.8032, "step": 15780 }, { "epoch": 0.10402675726212109, "grad_norm": 0.06337836384773254, "learning_rate": 0.002945920945958485, "loss": 1.7987, "step": 15800 }, { "epoch": 0.10415843670169339, "grad_norm": 0.05301804468035698, "learning_rate": 0.0029457523295993, "loss": 1.7936, "step": 15820 }, { "epoch": 0.10429011614126571, "grad_norm": 0.0584891214966774, "learning_rate": 0.002945583455620282, "loss": 1.7933, "step": 15840 }, { "epoch": 0.10442179558083801, "grad_norm": 0.058483339846134186, "learning_rate": 0.0029454143240515225, "loss": 1.7977, "step": 15860 }, { "epoch": 0.10455347502041032, "grad_norm": 0.057218778878450394, "learning_rate": 0.0029452449349231594, "loss": 1.7886, "step": 15880 }, { "epoch": 0.10468515445998262, "grad_norm": 0.0614253394305706, "learning_rate": 0.0029450752882653757, "loss": 1.7898, "step": 15900 }, { "epoch": 0.10481683389955493, "grad_norm": 0.05331398919224739, "learning_rate": 0.0029449053841084016, "loss": 1.7881, "step": 15920 }, { "epoch": 0.10494851333912723, "grad_norm": 0.05099445581436157, "learning_rate": 0.002944735222482512, "loss": 1.7937, "step": 15940 }, { "epoch": 0.10508019277869954, "grad_norm": 0.05356656014919281, "learning_rate": 0.0029445648034180294, "loss": 1.7943, "step": 15960 }, { "epoch": 0.10521187221827184, "grad_norm": 0.07416883111000061, "learning_rate": 0.0029443941269453188, "loss": 1.8186, "step": 15980 }, { "epoch": 0.10534355165784415, "grad_norm": 0.05611014366149902, "learning_rate": 0.002944223193094795, "loss": 1.8195, "step": 16000 }, { "epoch": 0.10534355165784415, "eval_loss": 1.753896713256836, "eval_runtime": 68.3324, "eval_samples_per_second": 14.634, "eval_steps_per_second": 14.634, "step": 16000 }, { "epoch": 0.00013167943957230517, "grad_norm": 0.06669767946004868, "learning_rate": 0.0029440520018969153, "loss": 1.9527, "step": 16020 }, { "epoch": 0.00026335887914461035, "grad_norm": 0.05156511813402176, "learning_rate": 0.0029438805533821863, "loss": 1.9455, "step": 16040 }, { "epoch": 0.00039503831871691555, "grad_norm": 0.05357939004898071, "learning_rate": 0.0029437088475811565, "loss": 1.9429, "step": 16060 }, { "epoch": 0.0005267177582892207, "grad_norm": 0.05948431417346001, "learning_rate": 0.002943536884524424, "loss": 1.9276, "step": 16080 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.05270468071103096, "learning_rate": 0.00294336466424263, "loss": 1.925, "step": 16100 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.05456703528761864, "learning_rate": 0.002943192186766463, "loss": 1.9325, "step": 16120 }, { "epoch": 0.0009217560770061363, "grad_norm": 0.056205980479717255, "learning_rate": 0.0029430194521266563, "loss": 1.923, "step": 16140 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.052037931978702545, "learning_rate": 0.002942846460353991, "loss": 1.925, "step": 16160 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.05397897586226463, "learning_rate": 0.0029426732114792914, "loss": 1.9119, "step": 16180 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.06542910635471344, "learning_rate": 0.0029424997055334293, "loss": 1.9183, "step": 16200 }, { "epoch": 0.001448473835295357, "grad_norm": 0.07107926905155182, "learning_rate": 0.002942325942547322, "loss": 1.917, "step": 16220 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.051881249994039536, "learning_rate": 0.0029421519225519316, "loss": 1.905, "step": 16240 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.06571921706199646, "learning_rate": 0.0029419776455782685, "loss": 1.9101, "step": 16260 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.08709180355072021, "learning_rate": 0.0029418031116573854, "loss": 1.9145, "step": 16280 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.05184926837682724, "learning_rate": 0.0029416283208203845, "loss": 1.9066, "step": 16300 }, { "epoch": 0.002106871033156883, "grad_norm": 0.06952713429927826, "learning_rate": 0.0029414532730984103, "loss": 1.9042, "step": 16320 }, { "epoch": 0.002238550472729188, "grad_norm": 0.06200730428099632, "learning_rate": 0.002941277968522656, "loss": 1.9042, "step": 16340 }, { "epoch": 0.002370229912301493, "grad_norm": 0.06455907970666885, "learning_rate": 0.0029411024071243587, "loss": 1.8952, "step": 16360 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.051165301352739334, "learning_rate": 0.0029409265889348015, "loss": 1.8987, "step": 16380 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.0553780272603035, "learning_rate": 0.0029407505139853137, "loss": 1.9017, "step": 16400 }, { "epoch": 0.002765268231018409, "grad_norm": 0.06370244920253754, "learning_rate": 0.002940574182307271, "loss": 1.8952, "step": 16420 }, { "epoch": 0.002896947670590714, "grad_norm": 0.05009014904499054, "learning_rate": 0.0029403975939320936, "loss": 1.9018, "step": 16440 }, { "epoch": 0.003028627110163019, "grad_norm": 0.053404245525598526, "learning_rate": 0.0029402207488912475, "loss": 1.895, "step": 16460 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.060919389128685, "learning_rate": 0.0029400436472162453, "loss": 1.8967, "step": 16480 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.05715464800596237, "learning_rate": 0.002939866288938645, "loss": 1.9042, "step": 16500 }, { "epoch": 0.003423665428879935, "grad_norm": 0.07242151349782944, "learning_rate": 0.0029396886740900496, "loss": 1.889, "step": 16520 }, { "epoch": 0.00355534486845224, "grad_norm": 0.07230902463197708, "learning_rate": 0.0029395108027021094, "loss": 1.8924, "step": 16540 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.05646587163209915, "learning_rate": 0.002939332674806519, "loss": 1.8873, "step": 16560 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.06602409482002258, "learning_rate": 0.002939154290435019, "loss": 1.8926, "step": 16580 }, { "epoch": 0.003950383187169155, "grad_norm": 0.051282357424497604, "learning_rate": 0.002938975649619396, "loss": 1.9128, "step": 16600 }, { "epoch": 0.004082062626741461, "grad_norm": 0.04802711680531502, "learning_rate": 0.002938796752391482, "loss": 1.9163, "step": 16620 }, { "epoch": 0.004213742066313766, "grad_norm": 0.05548110231757164, "learning_rate": 0.002938617598783155, "loss": 1.9177, "step": 16640 }, { "epoch": 0.004345421505886071, "grad_norm": 0.06551088392734528, "learning_rate": 0.002938438188826339, "loss": 1.9084, "step": 16660 }, { "epoch": 0.004477100945458376, "grad_norm": 0.051025088876485825, "learning_rate": 0.002938258522553002, "loss": 1.9111, "step": 16680 }, { "epoch": 0.004608780385030682, "grad_norm": 0.06420248001813889, "learning_rate": 0.00293807859999516, "loss": 1.9021, "step": 16700 }, { "epoch": 0.004740459824602986, "grad_norm": 0.05957198888063431, "learning_rate": 0.0029378984211848734, "loss": 1.9114, "step": 16720 }, { "epoch": 0.004872139264175292, "grad_norm": 0.05393804982304573, "learning_rate": 0.002937717986154248, "loss": 1.9018, "step": 16740 }, { "epoch": 0.005003818703747597, "grad_norm": 0.052903495728969574, "learning_rate": 0.0029375372949354355, "loss": 1.9099, "step": 16760 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.0786515399813652, "learning_rate": 0.0029373563475606343, "loss": 1.8988, "step": 16780 }, { "epoch": 0.005267177582892207, "grad_norm": 0.05307811498641968, "learning_rate": 0.002937175144062087, "loss": 1.901, "step": 16800 }, { "epoch": 0.005398857022464512, "grad_norm": 0.07106801867485046, "learning_rate": 0.0029369936844720825, "loss": 1.8994, "step": 16820 }, { "epoch": 0.005530536462036818, "grad_norm": 0.05467914044857025, "learning_rate": 0.0029368119688229547, "loss": 1.8971, "step": 16840 }, { "epoch": 0.005662215901609122, "grad_norm": 0.07325299084186554, "learning_rate": 0.0029366299971470846, "loss": 1.8895, "step": 16860 }, { "epoch": 0.005793895341181428, "grad_norm": 0.05642605945467949, "learning_rate": 0.002936447769476897, "loss": 1.8979, "step": 16880 }, { "epoch": 0.005925574780753733, "grad_norm": 0.05529412254691124, "learning_rate": 0.0029362652858448642, "loss": 1.8891, "step": 16900 }, { "epoch": 0.006057254220326038, "grad_norm": 0.06359060108661652, "learning_rate": 0.0029360825462835024, "loss": 1.8841, "step": 16920 }, { "epoch": 0.006188933659898343, "grad_norm": 0.06403638422489166, "learning_rate": 0.002935899550825374, "loss": 1.8846, "step": 16940 }, { "epoch": 0.006320613099470649, "grad_norm": 0.06129438802599907, "learning_rate": 0.0029357162995030882, "loss": 1.8845, "step": 16960 }, { "epoch": 0.006452292539042954, "grad_norm": 0.059139031916856766, "learning_rate": 0.002935532792349297, "loss": 1.8841, "step": 16980 }, { "epoch": 0.006583971978615259, "grad_norm": 0.056415166705846786, "learning_rate": 0.002935349029396701, "loss": 1.8768, "step": 17000 }, { "epoch": 0.006583971978615259, "eval_loss": 1.7990331649780273, "eval_runtime": 68.3369, "eval_samples_per_second": 14.633, "eval_steps_per_second": 14.633, "step": 17000 }, { "epoch": 0.006715651418187564, "grad_norm": 0.05324932560324669, "learning_rate": 0.002935165010678045, "loss": 1.877, "step": 17020 }, { "epoch": 0.00684733085775987, "grad_norm": 0.09261898696422577, "learning_rate": 0.0029349807362261185, "loss": 1.8822, "step": 17040 }, { "epoch": 0.006979010297332174, "grad_norm": 0.05834802985191345, "learning_rate": 0.0029347962060737583, "loss": 1.8869, "step": 17060 }, { "epoch": 0.00711068973690448, "grad_norm": 0.058308567851781845, "learning_rate": 0.0029346114202538458, "loss": 1.8808, "step": 17080 }, { "epoch": 0.007242369176476785, "grad_norm": 0.06321283429861069, "learning_rate": 0.0029344263787993087, "loss": 1.88, "step": 17100 }, { "epoch": 0.0073740486160490904, "grad_norm": 0.05077283829450607, "learning_rate": 0.0029342410817431185, "loss": 1.8774, "step": 17120 }, { "epoch": 0.007505728055621395, "grad_norm": 0.06091293692588806, "learning_rate": 0.0029340555291182944, "loss": 1.8779, "step": 17140 }, { "epoch": 0.007637407495193701, "grad_norm": 0.06410450488328934, "learning_rate": 0.0029338697209579, "loss": 1.8789, "step": 17160 }, { "epoch": 0.007769086934766006, "grad_norm": 0.08083081990480423, "learning_rate": 0.002933683657295044, "loss": 1.899, "step": 17180 }, { "epoch": 0.00790076637433831, "grad_norm": 0.06501522660255432, "learning_rate": 0.002933497338162883, "loss": 1.9053, "step": 17200 }, { "epoch": 0.008032445813910615, "grad_norm": 0.048091478645801544, "learning_rate": 0.0029333107635946152, "loss": 1.9089, "step": 17220 }, { "epoch": 0.008164125253482922, "grad_norm": 0.053573913872241974, "learning_rate": 0.0029331239336234873, "loss": 1.9014, "step": 17240 }, { "epoch": 0.008295804693055226, "grad_norm": 0.07217760384082794, "learning_rate": 0.0029329368482827905, "loss": 1.9048, "step": 17260 }, { "epoch": 0.008427484132627531, "grad_norm": 0.053729306906461716, "learning_rate": 0.0029327495076058624, "loss": 1.8983, "step": 17280 }, { "epoch": 0.008559163572199836, "grad_norm": 0.05567470192909241, "learning_rate": 0.002932561911626085, "loss": 1.8935, "step": 17300 }, { "epoch": 0.008690843011772142, "grad_norm": 0.06024245545268059, "learning_rate": 0.002932374060376886, "loss": 1.8916, "step": 17320 }, { "epoch": 0.008822522451344447, "grad_norm": 0.05578263849020004, "learning_rate": 0.0029321859538917394, "loss": 1.8964, "step": 17340 }, { "epoch": 0.008954201890916752, "grad_norm": 0.0536380261182785, "learning_rate": 0.0029319975922041633, "loss": 1.8874, "step": 17360 }, { "epoch": 0.009085881330489057, "grad_norm": 0.04501722753047943, "learning_rate": 0.002931808975347722, "loss": 1.8824, "step": 17380 }, { "epoch": 0.009217560770061363, "grad_norm": 0.06172627955675125, "learning_rate": 0.0029316201033560262, "loss": 1.8865, "step": 17400 }, { "epoch": 0.009349240209633668, "grad_norm": 0.05938473343849182, "learning_rate": 0.00293143097626273, "loss": 1.8845, "step": 17420 }, { "epoch": 0.009480919649205973, "grad_norm": 0.06107376888394356, "learning_rate": 0.0029312415941015347, "loss": 1.8892, "step": 17440 }, { "epoch": 0.009612599088778278, "grad_norm": 0.05630321800708771, "learning_rate": 0.0029310519569061867, "loss": 1.885, "step": 17460 }, { "epoch": 0.009744278528350584, "grad_norm": 0.05061402544379234, "learning_rate": 0.0029308620647104772, "loss": 1.8818, "step": 17480 }, { "epoch": 0.009875957967922889, "grad_norm": 0.059643711894750595, "learning_rate": 0.0029306719175482437, "loss": 1.877, "step": 17500 }, { "epoch": 0.010007637407495194, "grad_norm": 0.060052718967199326, "learning_rate": 0.0029304815154533683, "loss": 1.8752, "step": 17520 }, { "epoch": 0.010139316847067498, "grad_norm": 0.0526292622089386, "learning_rate": 0.002930290858459779, "loss": 1.8804, "step": 17540 }, { "epoch": 0.010270996286639805, "grad_norm": 0.08102289587259293, "learning_rate": 0.0029300999466014494, "loss": 1.8775, "step": 17560 }, { "epoch": 0.01040267572621211, "grad_norm": 0.07066734880208969, "learning_rate": 0.0029299087799123974, "loss": 1.8757, "step": 17580 }, { "epoch": 0.010534355165784414, "grad_norm": 0.08068786561489105, "learning_rate": 0.002929717358426688, "loss": 1.8798, "step": 17600 }, { "epoch": 0.01066603460535672, "grad_norm": 0.06165233626961708, "learning_rate": 0.0029295256821784306, "loss": 1.8741, "step": 17620 }, { "epoch": 0.010797714044929024, "grad_norm": 0.05444507673382759, "learning_rate": 0.0029293337512017797, "loss": 1.8754, "step": 17640 }, { "epoch": 0.01092939348450133, "grad_norm": 0.06841527670621872, "learning_rate": 0.002929141565530937, "loss": 1.8747, "step": 17660 }, { "epoch": 0.011061072924073635, "grad_norm": 0.06230770796537399, "learning_rate": 0.0029289491252001464, "loss": 1.8765, "step": 17680 }, { "epoch": 0.01119275236364594, "grad_norm": 0.07215554267168045, "learning_rate": 0.0029287564302437, "loss": 1.8755, "step": 17700 }, { "epoch": 0.011324431803218245, "grad_norm": 0.05525139719247818, "learning_rate": 0.002928563480695934, "loss": 1.8625, "step": 17720 }, { "epoch": 0.011456111242790551, "grad_norm": 0.08375394344329834, "learning_rate": 0.0029283702765912304, "loss": 1.8653, "step": 17740 }, { "epoch": 0.011587790682362856, "grad_norm": 0.07031811773777008, "learning_rate": 0.0029281768179640166, "loss": 1.8788, "step": 17760 }, { "epoch": 0.01171947012193516, "grad_norm": 0.07093445956707001, "learning_rate": 0.0029279831048487645, "loss": 1.8865, "step": 17780 }, { "epoch": 0.011851149561507466, "grad_norm": 0.07754283398389816, "learning_rate": 0.0029277891372799926, "loss": 1.8915, "step": 17800 }, { "epoch": 0.011982829001079772, "grad_norm": 0.06764809042215347, "learning_rate": 0.002927594915292264, "loss": 1.906, "step": 17820 }, { "epoch": 0.012114508440652077, "grad_norm": 0.05239294841885567, "learning_rate": 0.0029274004389201872, "loss": 1.8853, "step": 17840 }, { "epoch": 0.012246187880224382, "grad_norm": 0.060666222125291824, "learning_rate": 0.002927205708198416, "loss": 1.8856, "step": 17860 }, { "epoch": 0.012377867319796686, "grad_norm": 0.05473129451274872, "learning_rate": 0.00292701072316165, "loss": 1.8849, "step": 17880 }, { "epoch": 0.012509546759368993, "grad_norm": 0.054005883634090424, "learning_rate": 0.0029268154838446338, "loss": 1.8877, "step": 17900 }, { "epoch": 0.012641226198941298, "grad_norm": 0.07338313013315201, "learning_rate": 0.0029266199902821563, "loss": 1.8815, "step": 17920 }, { "epoch": 0.012772905638513602, "grad_norm": 0.06305193156003952, "learning_rate": 0.002926424242509054, "loss": 1.8775, "step": 17940 }, { "epoch": 0.012904585078085907, "grad_norm": 0.06329913437366486, "learning_rate": 0.0029262282405602066, "loss": 1.8759, "step": 17960 }, { "epoch": 0.013036264517658214, "grad_norm": 0.08256923407316208, "learning_rate": 0.0029260319844705398, "loss": 1.8779, "step": 17980 }, { "epoch": 0.013167943957230518, "grad_norm": 0.0697188749909401, "learning_rate": 0.002925835474275025, "loss": 1.8799, "step": 18000 }, { "epoch": 0.013167943957230518, "eval_loss": 1.8294225931167603, "eval_runtime": 65.8499, "eval_samples_per_second": 15.186, "eval_steps_per_second": 15.186, "step": 18000 }, { "epoch": 0.013299623396802823, "grad_norm": 0.05664549395442009, "learning_rate": 0.002925638710008678, "loss": 1.8665, "step": 18020 }, { "epoch": 0.013431302836375128, "grad_norm": 0.063201904296875, "learning_rate": 0.002925441691706561, "loss": 1.875, "step": 18040 }, { "epoch": 0.013562982275947433, "grad_norm": 0.05750538036227226, "learning_rate": 0.0029252444194037804, "loss": 1.86, "step": 18060 }, { "epoch": 0.01369466171551974, "grad_norm": 0.073476642370224, "learning_rate": 0.0029250468931354885, "loss": 1.8567, "step": 18080 }, { "epoch": 0.013826341155092044, "grad_norm": 0.05800202861428261, "learning_rate": 0.002924849112936883, "loss": 1.8669, "step": 18100 }, { "epoch": 0.013958020594664349, "grad_norm": 0.053366515785455704, "learning_rate": 0.002924651078843206, "loss": 1.8683, "step": 18120 }, { "epoch": 0.014089700034236654, "grad_norm": 0.06024957075715065, "learning_rate": 0.0029244527908897453, "loss": 1.8654, "step": 18140 }, { "epoch": 0.01422137947380896, "grad_norm": 0.06702018529176712, "learning_rate": 0.0029242542491118343, "loss": 1.8669, "step": 18160 }, { "epoch": 0.014353058913381265, "grad_norm": 0.050999585539102554, "learning_rate": 0.002924055453544852, "loss": 1.863, "step": 18180 }, { "epoch": 0.01448473835295357, "grad_norm": 0.05390724167227745, "learning_rate": 0.0029238564042242204, "loss": 1.8686, "step": 18200 }, { "epoch": 0.014616417792525874, "grad_norm": 0.08430622518062592, "learning_rate": 0.0029236571011854095, "loss": 1.8591, "step": 18220 }, { "epoch": 0.014748097232098181, "grad_norm": 0.07103120535612106, "learning_rate": 0.0029234575444639327, "loss": 1.8687, "step": 18240 }, { "epoch": 0.014879776671670486, "grad_norm": 0.0677858293056488, "learning_rate": 0.0029232577340953495, "loss": 1.8611, "step": 18260 }, { "epoch": 0.01501145611124279, "grad_norm": 0.07199349999427795, "learning_rate": 0.002923057670115264, "loss": 1.8613, "step": 18280 }, { "epoch": 0.015143135550815095, "grad_norm": 0.04802101105451584, "learning_rate": 0.002922857352559326, "loss": 1.8585, "step": 18300 }, { "epoch": 0.015274814990387402, "grad_norm": 0.06592894345521927, "learning_rate": 0.00292265678146323, "loss": 1.8627, "step": 18320 }, { "epoch": 0.015406494429959706, "grad_norm": 0.06502063572406769, "learning_rate": 0.0029224559568627162, "loss": 1.8542, "step": 18340 }, { "epoch": 0.015538173869532011, "grad_norm": 0.08361044526100159, "learning_rate": 0.0029222548787935696, "loss": 1.8558, "step": 18360 }, { "epoch": 0.015669853309104316, "grad_norm": 0.09134091436862946, "learning_rate": 0.002922053547291621, "loss": 1.8395, "step": 18380 }, { "epoch": 0.01580153274867662, "grad_norm": 0.06279317289590836, "learning_rate": 0.0029218519623927445, "loss": 1.7925, "step": 18400 }, { "epoch": 0.015933212188248926, "grad_norm": 0.05970417335629463, "learning_rate": 0.0029216501241328616, "loss": 1.7958, "step": 18420 }, { "epoch": 0.01606489162782123, "grad_norm": 0.05772954598069191, "learning_rate": 0.0029214480325479384, "loss": 1.7899, "step": 18440 }, { "epoch": 0.01619657106739354, "grad_norm": 0.05578155443072319, "learning_rate": 0.002921245687673985, "loss": 1.7772, "step": 18460 }, { "epoch": 0.016328250506965843, "grad_norm": 0.05890611186623573, "learning_rate": 0.0029210430895470576, "loss": 1.7791, "step": 18480 }, { "epoch": 0.016459929946538148, "grad_norm": 0.053837426006793976, "learning_rate": 0.0029208402382032575, "loss": 1.7787, "step": 18500 }, { "epoch": 0.016591609386110453, "grad_norm": 0.05714136362075806, "learning_rate": 0.002920637133678731, "loss": 1.7725, "step": 18520 }, { "epoch": 0.016723288825682758, "grad_norm": 0.06816162914037704, "learning_rate": 0.0029204337760096693, "loss": 1.7821, "step": 18540 }, { "epoch": 0.016854968265255062, "grad_norm": 0.05500810220837593, "learning_rate": 0.002920230165232309, "loss": 1.77, "step": 18560 }, { "epoch": 0.016986647704827367, "grad_norm": 0.05971973389387131, "learning_rate": 0.0029200263013829312, "loss": 1.7673, "step": 18580 }, { "epoch": 0.017118327144399672, "grad_norm": 0.05585896596312523, "learning_rate": 0.0029198221844978635, "loss": 1.7719, "step": 18600 }, { "epoch": 0.01725000658397198, "grad_norm": 0.05968007817864418, "learning_rate": 0.0029196178146134767, "loss": 1.7725, "step": 18620 }, { "epoch": 0.017381686023544285, "grad_norm": 0.06808626651763916, "learning_rate": 0.0029194131917661885, "loss": 1.7704, "step": 18640 }, { "epoch": 0.01751336546311659, "grad_norm": 0.057727713137865067, "learning_rate": 0.00291920831599246, "loss": 1.7752, "step": 18660 }, { "epoch": 0.017645044902688894, "grad_norm": 0.05363877862691879, "learning_rate": 0.0029190031873287986, "loss": 1.7682, "step": 18680 }, { "epoch": 0.0177767243422612, "grad_norm": 0.08140948414802551, "learning_rate": 0.0029187978058117566, "loss": 1.7621, "step": 18700 }, { "epoch": 0.017908403781833504, "grad_norm": 0.05746082961559296, "learning_rate": 0.0029185921714779306, "loss": 1.7743, "step": 18720 }, { "epoch": 0.01804008322140581, "grad_norm": 0.06933200359344482, "learning_rate": 0.0029183862843639636, "loss": 1.7783, "step": 18740 }, { "epoch": 0.018171762660978114, "grad_norm": 0.06859739869832993, "learning_rate": 0.0029181801445065415, "loss": 1.7723, "step": 18760 }, { "epoch": 0.018303442100550422, "grad_norm": 0.05922358110547066, "learning_rate": 0.002917973751942397, "loss": 1.7745, "step": 18780 }, { "epoch": 0.018435121540122727, "grad_norm": 0.0643932893872261, "learning_rate": 0.0029177671067083084, "loss": 1.7625, "step": 18800 }, { "epoch": 0.01856680097969503, "grad_norm": 0.060253337025642395, "learning_rate": 0.002917560208841097, "loss": 1.7739, "step": 18820 }, { "epoch": 0.018698480419267336, "grad_norm": 0.06834478676319122, "learning_rate": 0.00291735305837763, "loss": 1.7714, "step": 18840 }, { "epoch": 0.01883015985883964, "grad_norm": 0.06220484897494316, "learning_rate": 0.00291714565535482, "loss": 1.7794, "step": 18860 }, { "epoch": 0.018961839298411946, "grad_norm": 0.059682924300432205, "learning_rate": 0.0029169379998096245, "loss": 1.7751, "step": 18880 }, { "epoch": 0.01909351873798425, "grad_norm": 0.06003641337156296, "learning_rate": 0.002916730091779046, "loss": 1.7709, "step": 18900 }, { "epoch": 0.019225198177556555, "grad_norm": 0.05494799092411995, "learning_rate": 0.0029165219313001304, "loss": 1.7704, "step": 18920 }, { "epoch": 0.01935687761712886, "grad_norm": 0.05533396452665329, "learning_rate": 0.002916313518409972, "loss": 1.7788, "step": 18940 }, { "epoch": 0.019488557056701168, "grad_norm": 0.06435955315828323, "learning_rate": 0.0029161048531457065, "loss": 1.8023, "step": 18960 }, { "epoch": 0.019620236496273473, "grad_norm": 0.056616947054862976, "learning_rate": 0.0029158959355445177, "loss": 1.8187, "step": 18980 }, { "epoch": 0.019751915935845778, "grad_norm": 0.05237163230776787, "learning_rate": 0.002915686765643631, "loss": 1.8274, "step": 19000 }, { "epoch": 0.019751915935845778, "eval_loss": 1.8479809761047363, "eval_runtime": 65.9646, "eval_samples_per_second": 15.16, "eval_steps_per_second": 15.16, "step": 19000 }, { "epoch": 0.019883595375418082, "grad_norm": 0.06315074861049652, "learning_rate": 0.00291547734348032, "loss": 1.8249, "step": 19020 }, { "epoch": 0.020015274814990387, "grad_norm": 0.061322640627622604, "learning_rate": 0.002915267669091901, "loss": 1.8305, "step": 19040 }, { "epoch": 0.020146954254562692, "grad_norm": 0.06135581433773041, "learning_rate": 0.0029150577425157355, "loss": 1.8285, "step": 19060 }, { "epoch": 0.020278633694134997, "grad_norm": 0.06242895498871803, "learning_rate": 0.0029148475637892322, "loss": 1.8291, "step": 19080 }, { "epoch": 0.0204103131337073, "grad_norm": 0.07442411780357361, "learning_rate": 0.002914637132949842, "loss": 1.8167, "step": 19100 }, { "epoch": 0.02054199257327961, "grad_norm": 0.07312595844268799, "learning_rate": 0.0029144264500350616, "loss": 1.8139, "step": 19120 }, { "epoch": 0.020673672012851915, "grad_norm": 0.07727395743131638, "learning_rate": 0.0029142155150824333, "loss": 1.8121, "step": 19140 }, { "epoch": 0.02080535145242422, "grad_norm": 0.06504666805267334, "learning_rate": 0.0029140043281295435, "loss": 1.8162, "step": 19160 }, { "epoch": 0.020937030891996524, "grad_norm": 0.06606578081846237, "learning_rate": 0.0029137928892140237, "loss": 1.8141, "step": 19180 }, { "epoch": 0.02106871033156883, "grad_norm": 0.07460979372262955, "learning_rate": 0.0029135811983735504, "loss": 1.811, "step": 19200 }, { "epoch": 0.021200389771141134, "grad_norm": 0.05553029850125313, "learning_rate": 0.002913369255645845, "loss": 1.8122, "step": 19220 }, { "epoch": 0.02133206921071344, "grad_norm": 0.1024724543094635, "learning_rate": 0.002913157061068674, "loss": 1.8186, "step": 19240 }, { "epoch": 0.021463748650285743, "grad_norm": 0.07562136650085449, "learning_rate": 0.002912944614679848, "loss": 1.8238, "step": 19260 }, { "epoch": 0.021595428089858048, "grad_norm": 0.054396726191043854, "learning_rate": 0.002912731916517224, "loss": 1.8072, "step": 19280 }, { "epoch": 0.021727107529430356, "grad_norm": 0.07781907916069031, "learning_rate": 0.0029125189666187015, "loss": 1.8066, "step": 19300 }, { "epoch": 0.02185878696900266, "grad_norm": 0.05102219805121422, "learning_rate": 0.0029123057650222274, "loss": 1.803, "step": 19320 }, { "epoch": 0.021990466408574966, "grad_norm": 0.05836215242743492, "learning_rate": 0.002912092311765792, "loss": 1.8013, "step": 19340 }, { "epoch": 0.02212214584814727, "grad_norm": 0.0890396237373352, "learning_rate": 0.0029118786068874298, "loss": 1.804, "step": 19360 }, { "epoch": 0.022253825287719575, "grad_norm": 0.06296063959598541, "learning_rate": 0.002911664650425222, "loss": 1.7988, "step": 19380 }, { "epoch": 0.02238550472729188, "grad_norm": 0.07317844778299332, "learning_rate": 0.0029114504424172937, "loss": 1.7993, "step": 19400 }, { "epoch": 0.022517184166864185, "grad_norm": 0.061669182032346725, "learning_rate": 0.002911235982901814, "loss": 1.7971, "step": 19420 }, { "epoch": 0.02264886360643649, "grad_norm": 0.07136490941047668, "learning_rate": 0.002911021271916998, "loss": 1.8064, "step": 19440 }, { "epoch": 0.022780543046008798, "grad_norm": 0.05423993617296219, "learning_rate": 0.0029108063095011063, "loss": 1.8017, "step": 19460 }, { "epoch": 0.022912222485581103, "grad_norm": 0.0703122541308403, "learning_rate": 0.002910591095692442, "loss": 1.7979, "step": 19480 }, { "epoch": 0.023043901925153407, "grad_norm": 0.06629758328199387, "learning_rate": 0.0029103756305293546, "loss": 1.7959, "step": 19500 }, { "epoch": 0.023175581364725712, "grad_norm": 0.06768941134214401, "learning_rate": 0.002910159914050238, "loss": 1.796, "step": 19520 }, { "epoch": 0.023307260804298017, "grad_norm": 0.060242656618356705, "learning_rate": 0.002909943946293531, "loss": 1.802, "step": 19540 }, { "epoch": 0.02343894024387032, "grad_norm": 0.06179652363061905, "learning_rate": 0.0029097277272977164, "loss": 1.8097, "step": 19560 }, { "epoch": 0.023570619683442626, "grad_norm": 0.10733772069215775, "learning_rate": 0.0029095112571013238, "loss": 1.8088, "step": 19580 }, { "epoch": 0.02370229912301493, "grad_norm": 0.07508611679077148, "learning_rate": 0.002909294535742925, "loss": 1.8135, "step": 19600 }, { "epoch": 0.023833978562587236, "grad_norm": 0.057078372687101364, "learning_rate": 0.0029090775632611377, "loss": 1.811, "step": 19620 }, { "epoch": 0.023965658002159544, "grad_norm": 0.06910204887390137, "learning_rate": 0.002908860339694626, "loss": 1.8024, "step": 19640 }, { "epoch": 0.02409733744173185, "grad_norm": 0.05256013572216034, "learning_rate": 0.0029086428650820953, "loss": 1.8001, "step": 19660 }, { "epoch": 0.024229016881304154, "grad_norm": 0.05280625820159912, "learning_rate": 0.0029084251394622986, "loss": 1.7961, "step": 19680 }, { "epoch": 0.02436069632087646, "grad_norm": 0.07600513845682144, "learning_rate": 0.0029082071628740323, "loss": 1.7916, "step": 19700 }, { "epoch": 0.024492375760448763, "grad_norm": 0.060011059045791626, "learning_rate": 0.002907988935356138, "loss": 1.7981, "step": 19720 }, { "epoch": 0.024624055200021068, "grad_norm": 0.06662587076425552, "learning_rate": 0.002907770456947501, "loss": 1.7979, "step": 19740 }, { "epoch": 0.024755734639593373, "grad_norm": 0.06288140267133713, "learning_rate": 0.002907551727687054, "loss": 1.7918, "step": 19760 }, { "epoch": 0.024887414079165678, "grad_norm": 0.07184966653585434, "learning_rate": 0.002907332747613771, "loss": 1.7932, "step": 19780 }, { "epoch": 0.025019093518737986, "grad_norm": 0.062474627047777176, "learning_rate": 0.0029071135167666722, "loss": 1.7897, "step": 19800 }, { "epoch": 0.02515077295831029, "grad_norm": 0.055238522589206696, "learning_rate": 0.0029068940351848235, "loss": 1.7866, "step": 19820 }, { "epoch": 0.025282452397882595, "grad_norm": 0.060174524784088135, "learning_rate": 0.002906674302907334, "loss": 1.7854, "step": 19840 }, { "epoch": 0.0254141318374549, "grad_norm": 0.05686888098716736, "learning_rate": 0.002906454319973358, "loss": 1.7794, "step": 19860 }, { "epoch": 0.025545811277027205, "grad_norm": 0.05989696830511093, "learning_rate": 0.002906234086422094, "loss": 1.7802, "step": 19880 }, { "epoch": 0.02567749071659951, "grad_norm": 0.05739467218518257, "learning_rate": 0.0029060136022927867, "loss": 1.7859, "step": 19900 }, { "epoch": 0.025809170156171814, "grad_norm": 0.06893962621688843, "learning_rate": 0.0029057928676247233, "loss": 1.7903, "step": 19920 }, { "epoch": 0.02594084959574412, "grad_norm": 0.05944626033306122, "learning_rate": 0.002905571882457237, "loss": 1.7905, "step": 19940 }, { "epoch": 0.026072529035316427, "grad_norm": 0.10011964291334152, "learning_rate": 0.002905350646829706, "loss": 1.7824, "step": 19960 }, { "epoch": 0.026204208474888732, "grad_norm": 0.055610090494155884, "learning_rate": 0.0029051291607815515, "loss": 1.7803, "step": 19980 }, { "epoch": 0.026335887914461037, "grad_norm": 0.061704959720373154, "learning_rate": 0.0029049074243522404, "loss": 1.7793, "step": 20000 }, { "epoch": 0.026335887914461037, "eval_loss": 1.8498175144195557, "eval_runtime": 65.8184, "eval_samples_per_second": 15.193, "eval_steps_per_second": 15.193, "step": 20000 }, { "epoch": 0.02646756735403334, "grad_norm": 0.06252337247133255, "learning_rate": 0.002904685437581285, "loss": 1.7794, "step": 20020 }, { "epoch": 0.026599246793605646, "grad_norm": 0.05822984129190445, "learning_rate": 0.00290446320050824, "loss": 1.7819, "step": 20040 }, { "epoch": 0.02673092623317795, "grad_norm": 0.05482339486479759, "learning_rate": 0.0029042407131727073, "loss": 1.7867, "step": 20060 }, { "epoch": 0.026862605672750256, "grad_norm": 0.05103064700961113, "learning_rate": 0.0029040179756143316, "loss": 1.7764, "step": 20080 }, { "epoch": 0.02699428511232256, "grad_norm": 0.06983567029237747, "learning_rate": 0.002903794987872802, "loss": 1.779, "step": 20100 }, { "epoch": 0.027125964551894866, "grad_norm": 0.06782662123441696, "learning_rate": 0.0029035717499878537, "loss": 1.7814, "step": 20120 }, { "epoch": 0.027257643991467174, "grad_norm": 0.07617141306400299, "learning_rate": 0.0029033482619992656, "loss": 1.8055, "step": 20140 }, { "epoch": 0.02738932343103948, "grad_norm": 0.07056764513254166, "learning_rate": 0.002903124523946861, "loss": 1.8267, "step": 20160 }, { "epoch": 0.027521002870611783, "grad_norm": 0.05244629457592964, "learning_rate": 0.0029029005358705085, "loss": 1.8346, "step": 20180 }, { "epoch": 0.027652682310184088, "grad_norm": 0.05634482949972153, "learning_rate": 0.0029026762978101197, "loss": 1.8347, "step": 20200 }, { "epoch": 0.027784361749756393, "grad_norm": 0.060985077172517776, "learning_rate": 0.0029024518098056526, "loss": 1.8397, "step": 20220 }, { "epoch": 0.027916041189328698, "grad_norm": 0.060473646968603134, "learning_rate": 0.0029022270718971083, "loss": 1.8363, "step": 20240 }, { "epoch": 0.028047720628901002, "grad_norm": 0.05223367363214493, "learning_rate": 0.002902002084124533, "loss": 1.8378, "step": 20260 }, { "epoch": 0.028179400068473307, "grad_norm": 0.06747066229581833, "learning_rate": 0.0029017768465280187, "loss": 1.8394, "step": 20280 }, { "epoch": 0.028311079508045615, "grad_norm": 0.06481572240591049, "learning_rate": 0.0029015513591476995, "loss": 1.829, "step": 20300 }, { "epoch": 0.02844275894761792, "grad_norm": 0.07189793139696121, "learning_rate": 0.002901325622023755, "loss": 1.8283, "step": 20320 }, { "epoch": 0.028574438387190225, "grad_norm": 0.0644344687461853, "learning_rate": 0.0029010996351964105, "loss": 1.8265, "step": 20340 }, { "epoch": 0.02870611782676253, "grad_norm": 0.06990751624107361, "learning_rate": 0.002900873398705934, "loss": 1.824, "step": 20360 }, { "epoch": 0.028837797266334834, "grad_norm": 0.07374297082424164, "learning_rate": 0.0029006469125926397, "loss": 1.8223, "step": 20380 }, { "epoch": 0.02896947670590714, "grad_norm": 0.08984444290399551, "learning_rate": 0.0029004201768968838, "loss": 1.8232, "step": 20400 }, { "epoch": 0.029101156145479444, "grad_norm": 0.06562740355730057, "learning_rate": 0.00290019319165907, "loss": 1.8235, "step": 20420 }, { "epoch": 0.02923283558505175, "grad_norm": 0.07431894540786743, "learning_rate": 0.0028999659569196442, "loss": 1.8141, "step": 20440 }, { "epoch": 0.029364515024624054, "grad_norm": 0.057788606733083725, "learning_rate": 0.0028997384727190976, "loss": 1.8159, "step": 20460 }, { "epoch": 0.029496194464196362, "grad_norm": 0.07726121693849564, "learning_rate": 0.002899510739097966, "loss": 1.8156, "step": 20480 }, { "epoch": 0.029627873903768667, "grad_norm": 0.07005012780427933, "learning_rate": 0.0028992827560968297, "loss": 1.8172, "step": 20500 }, { "epoch": 0.02975955334334097, "grad_norm": 0.06550168991088867, "learning_rate": 0.002899054523756313, "loss": 1.8067, "step": 20520 }, { "epoch": 0.029891232782913276, "grad_norm": 0.07354078441858292, "learning_rate": 0.002898826042117084, "loss": 1.8109, "step": 20540 }, { "epoch": 0.03002291222248558, "grad_norm": 0.06678362935781479, "learning_rate": 0.0028985973112198573, "loss": 1.8158, "step": 20560 }, { "epoch": 0.030154591662057886, "grad_norm": 0.08662049472332001, "learning_rate": 0.0028983683311053898, "loss": 1.8077, "step": 20580 }, { "epoch": 0.03028627110163019, "grad_norm": 0.06835264712572098, "learning_rate": 0.0028981391018144845, "loss": 1.8074, "step": 20600 }, { "epoch": 0.030417950541202495, "grad_norm": 0.06030866131186485, "learning_rate": 0.0028979096233879872, "loss": 1.8096, "step": 20620 }, { "epoch": 0.030549629980774803, "grad_norm": 0.07386446744203568, "learning_rate": 0.0028976798958667885, "loss": 1.8134, "step": 20640 }, { "epoch": 0.030681309420347108, "grad_norm": 0.07323277741670609, "learning_rate": 0.002897449919291825, "loss": 1.8073, "step": 20660 }, { "epoch": 0.030812988859919413, "grad_norm": 0.08217355608940125, "learning_rate": 0.0028972196937040754, "loss": 1.8044, "step": 20680 }, { "epoch": 0.030944668299491718, "grad_norm": 0.06611933559179306, "learning_rate": 0.002896989219144564, "loss": 1.8016, "step": 20700 }, { "epoch": 0.031076347739064022, "grad_norm": 0.06082133203744888, "learning_rate": 0.0028967584956543597, "loss": 1.7986, "step": 20720 }, { "epoch": 0.031208027178636327, "grad_norm": 0.06548244506120682, "learning_rate": 0.002896527523274575, "loss": 1.8025, "step": 20740 }, { "epoch": 0.03133970661820863, "grad_norm": 0.08356646448373795, "learning_rate": 0.0028962963020463667, "loss": 1.783, "step": 20760 }, { "epoch": 0.03147138605778094, "grad_norm": 0.06322002410888672, "learning_rate": 0.002896064832010937, "loss": 1.774, "step": 20780 }, { "epoch": 0.03160306549735324, "grad_norm": 0.0772123858332634, "learning_rate": 0.002895833113209531, "loss": 1.7628, "step": 20800 }, { "epoch": 0.031734744936925546, "grad_norm": 0.0836576297879219, "learning_rate": 0.0028956011456834395, "loss": 1.7589, "step": 20820 }, { "epoch": 0.03186642437649785, "grad_norm": 0.06800664216279984, "learning_rate": 0.002895368929473997, "loss": 1.7455, "step": 20840 }, { "epoch": 0.031998103816070156, "grad_norm": 0.058029696345329285, "learning_rate": 0.0028951364646225826, "loss": 1.745, "step": 20860 }, { "epoch": 0.03212978325564246, "grad_norm": 0.05537112057209015, "learning_rate": 0.0028949037511706178, "loss": 1.748, "step": 20880 }, { "epoch": 0.03226146269521477, "grad_norm": 0.06035890802741051, "learning_rate": 0.0028946707891595717, "loss": 1.7463, "step": 20900 }, { "epoch": 0.03239314213478708, "grad_norm": 0.06673149764537811, "learning_rate": 0.002894437578630955, "loss": 1.7429, "step": 20920 }, { "epoch": 0.03252482157435938, "grad_norm": 0.08091327548027039, "learning_rate": 0.0028942041196263245, "loss": 1.7388, "step": 20940 }, { "epoch": 0.03265650101393169, "grad_norm": 0.05750538781285286, "learning_rate": 0.00289397041218728, "loss": 1.7322, "step": 20960 }, { "epoch": 0.03278818045350399, "grad_norm": 0.059635717421770096, "learning_rate": 0.0028937364563554656, "loss": 1.7425, "step": 20980 }, { "epoch": 0.032919859893076296, "grad_norm": 0.07420338690280914, "learning_rate": 0.002893502252172571, "loss": 1.7369, "step": 21000 }, { "epoch": 0.032919859893076296, "eval_loss": 1.7132776975631714, "eval_runtime": 66.0009, "eval_samples_per_second": 15.151, "eval_steps_per_second": 15.151, "step": 21000 }, { "epoch": 0.0330515393326486, "grad_norm": 0.06639964133501053, "learning_rate": 0.0028932677996803286, "loss": 1.7301, "step": 21020 }, { "epoch": 0.033183218772220906, "grad_norm": 0.06292149424552917, "learning_rate": 0.0028930330989205156, "loss": 1.7371, "step": 21040 }, { "epoch": 0.03331489821179321, "grad_norm": 0.07750008255243301, "learning_rate": 0.002892798149934954, "loss": 1.7395, "step": 21060 }, { "epoch": 0.033446577651365515, "grad_norm": 0.056288789957761765, "learning_rate": 0.0028925629527655097, "loss": 1.7346, "step": 21080 }, { "epoch": 0.03357825709093782, "grad_norm": 0.07288241386413574, "learning_rate": 0.002892327507454092, "loss": 1.7306, "step": 21100 }, { "epoch": 0.033709936530510125, "grad_norm": 0.06977301836013794, "learning_rate": 0.002892091814042655, "loss": 1.7293, "step": 21120 }, { "epoch": 0.03384161597008243, "grad_norm": 0.07677018642425537, "learning_rate": 0.0028918558725731986, "loss": 1.7334, "step": 21140 }, { "epoch": 0.033973295409654734, "grad_norm": 0.06132907420396805, "learning_rate": 0.0028916196830877637, "loss": 1.7352, "step": 21160 }, { "epoch": 0.03410497484922704, "grad_norm": 0.08819183707237244, "learning_rate": 0.0028913832456284377, "loss": 1.7383, "step": 21180 }, { "epoch": 0.034236654288799344, "grad_norm": 0.0902981087565422, "learning_rate": 0.0028911465602373524, "loss": 1.7296, "step": 21200 }, { "epoch": 0.03436833372837165, "grad_norm": 0.07254979014396667, "learning_rate": 0.0028909096269566815, "loss": 1.7314, "step": 21220 }, { "epoch": 0.03450001316794396, "grad_norm": 0.08108898252248764, "learning_rate": 0.0028906724458286456, "loss": 1.7365, "step": 21240 }, { "epoch": 0.034631692607516265, "grad_norm": 0.061406515538692474, "learning_rate": 0.002890435016895507, "loss": 1.7338, "step": 21260 }, { "epoch": 0.03476337204708857, "grad_norm": 0.07603522390127182, "learning_rate": 0.0028901973401995744, "loss": 1.727, "step": 21280 }, { "epoch": 0.034895051486660875, "grad_norm": 0.08022353053092957, "learning_rate": 0.002889959415783199, "loss": 1.7258, "step": 21300 }, { "epoch": 0.03502673092623318, "grad_norm": 0.061437543481588364, "learning_rate": 0.0028897212436887775, "loss": 1.7416, "step": 21320 }, { "epoch": 0.035158410365805484, "grad_norm": 0.07316586375236511, "learning_rate": 0.0028894828239587494, "loss": 1.7415, "step": 21340 }, { "epoch": 0.03529008980537779, "grad_norm": 0.09495033323764801, "learning_rate": 0.002889244156635599, "loss": 1.7403, "step": 21360 }, { "epoch": 0.035421769244950094, "grad_norm": 0.06723074615001678, "learning_rate": 0.002889005241761854, "loss": 1.7497, "step": 21380 }, { "epoch": 0.0355534486845224, "grad_norm": 0.05688747763633728, "learning_rate": 0.002888766079380088, "loss": 1.7408, "step": 21400 }, { "epoch": 0.0356851281240947, "grad_norm": 0.06509803235530853, "learning_rate": 0.002888526669532917, "loss": 1.7461, "step": 21420 }, { "epoch": 0.03581680756366701, "grad_norm": 0.07571250200271606, "learning_rate": 0.002888287012263002, "loss": 1.7385, "step": 21440 }, { "epoch": 0.03594848700323931, "grad_norm": 0.0633770301938057, "learning_rate": 0.002888047107613047, "loss": 1.743, "step": 21460 }, { "epoch": 0.03608016644281162, "grad_norm": 0.07172537595033646, "learning_rate": 0.0028878069556258013, "loss": 1.7289, "step": 21480 }, { "epoch": 0.03621184588238392, "grad_norm": 0.09092337638139725, "learning_rate": 0.002887566556344058, "loss": 1.7392, "step": 21500 }, { "epoch": 0.03634352532195623, "grad_norm": 0.06401342898607254, "learning_rate": 0.002887325909810653, "loss": 1.7372, "step": 21520 }, { "epoch": 0.03647520476152853, "grad_norm": 0.06551776826381683, "learning_rate": 0.0028870850160684688, "loss": 1.7221, "step": 21540 }, { "epoch": 0.036606884201100844, "grad_norm": 0.08069788664579391, "learning_rate": 0.0028868438751604294, "loss": 1.7201, "step": 21560 }, { "epoch": 0.03673856364067315, "grad_norm": 0.05819667875766754, "learning_rate": 0.002886602487129504, "loss": 1.7256, "step": 21580 }, { "epoch": 0.03687024308024545, "grad_norm": 0.06299937516450882, "learning_rate": 0.0028863608520187066, "loss": 1.7216, "step": 21600 }, { "epoch": 0.03700192251981776, "grad_norm": 0.08698736876249313, "learning_rate": 0.002886118969871093, "loss": 1.7208, "step": 21620 }, { "epoch": 0.03713360195939006, "grad_norm": 0.07046283036470413, "learning_rate": 0.0028858768407297656, "loss": 1.7141, "step": 21640 }, { "epoch": 0.03726528139896237, "grad_norm": 0.06260740756988525, "learning_rate": 0.0028856344646378687, "loss": 1.7243, "step": 21660 }, { "epoch": 0.03739696083853467, "grad_norm": 0.0720597505569458, "learning_rate": 0.0028853918416385928, "loss": 1.7195, "step": 21680 }, { "epoch": 0.03752864027810698, "grad_norm": 0.07073231786489487, "learning_rate": 0.0028851489717751696, "loss": 1.7241, "step": 21700 }, { "epoch": 0.03766031971767928, "grad_norm": 0.05944892391562462, "learning_rate": 0.0028849058550908767, "loss": 1.7201, "step": 21720 }, { "epoch": 0.037791999157251586, "grad_norm": 0.06408489495515823, "learning_rate": 0.0028846624916290357, "loss": 1.7228, "step": 21740 }, { "epoch": 0.03792367859682389, "grad_norm": 0.07245621085166931, "learning_rate": 0.002884418881433012, "loss": 1.7191, "step": 21760 }, { "epoch": 0.038055358036396196, "grad_norm": 0.06913050264120102, "learning_rate": 0.0028841750245462137, "loss": 1.7228, "step": 21780 }, { "epoch": 0.0381870374759685, "grad_norm": 0.057451095432043076, "learning_rate": 0.002883930921012094, "loss": 1.7163, "step": 21800 }, { "epoch": 0.038318716915540806, "grad_norm": 0.07231597602367401, "learning_rate": 0.002883686570874151, "loss": 1.7143, "step": 21820 }, { "epoch": 0.03845039635511311, "grad_norm": 0.08483259379863739, "learning_rate": 0.0028834419741759244, "loss": 1.7216, "step": 21840 }, { "epoch": 0.038582075794685415, "grad_norm": 0.0528041310608387, "learning_rate": 0.0028831971309610004, "loss": 1.7174, "step": 21860 }, { "epoch": 0.03871375523425772, "grad_norm": 0.06268829107284546, "learning_rate": 0.0028829520412730065, "loss": 1.721, "step": 21880 }, { "epoch": 0.03884543467383003, "grad_norm": 0.08661678433418274, "learning_rate": 0.0028827067051556163, "loss": 1.7196, "step": 21900 }, { "epoch": 0.038977114113402336, "grad_norm": 0.062315549701452255, "learning_rate": 0.0028824611226525455, "loss": 1.7481, "step": 21920 }, { "epoch": 0.03910879355297464, "grad_norm": 0.0838395208120346, "learning_rate": 0.002882215293807556, "loss": 1.7647, "step": 21940 }, { "epoch": 0.039240472992546946, "grad_norm": 0.06503219902515411, "learning_rate": 0.0028819692186644514, "loss": 1.7775, "step": 21960 }, { "epoch": 0.03937215243211925, "grad_norm": 0.06856662034988403, "learning_rate": 0.0028817228972670803, "loss": 1.7717, "step": 21980 }, { "epoch": 0.039503831871691555, "grad_norm": 0.055163074284791946, "learning_rate": 0.002881476329659335, "loss": 1.7772, "step": 22000 }, { "epoch": 0.039503831871691555, "eval_loss": 1.7622946500778198, "eval_runtime": 67.7091, "eval_samples_per_second": 14.769, "eval_steps_per_second": 14.769, "step": 22000 }, { "epoch": 0.03963551131126386, "grad_norm": 0.09752371162176132, "learning_rate": 0.002881229515885151, "loss": 1.7653, "step": 22020 }, { "epoch": 0.039767190750836165, "grad_norm": 0.09371519088745117, "learning_rate": 0.0028809824559885085, "loss": 1.7757, "step": 22040 }, { "epoch": 0.03989887019040847, "grad_norm": 0.06047109514474869, "learning_rate": 0.002880735150013432, "loss": 1.7666, "step": 22060 }, { "epoch": 0.040030549629980774, "grad_norm": 0.07913815230131149, "learning_rate": 0.0028804875980039885, "loss": 1.7664, "step": 22080 }, { "epoch": 0.04016222906955308, "grad_norm": 0.06452839821577072, "learning_rate": 0.0028802398000042895, "loss": 1.7689, "step": 22100 }, { "epoch": 0.040293908509125384, "grad_norm": 0.07609876990318298, "learning_rate": 0.0028799917560584907, "loss": 1.767, "step": 22120 }, { "epoch": 0.04042558794869769, "grad_norm": 0.07160958647727966, "learning_rate": 0.0028797434662107906, "loss": 1.7677, "step": 22140 }, { "epoch": 0.040557267388269994, "grad_norm": 0.06023573875427246, "learning_rate": 0.002879494930505433, "loss": 1.766, "step": 22160 }, { "epoch": 0.0406889468278423, "grad_norm": 0.06579054147005081, "learning_rate": 0.0028792461489867043, "loss": 1.7568, "step": 22180 }, { "epoch": 0.0408206262674146, "grad_norm": 0.065089151263237, "learning_rate": 0.0028789971216989347, "loss": 1.7607, "step": 22200 }, { "epoch": 0.04095230570698691, "grad_norm": 0.06882410496473312, "learning_rate": 0.002878747848686499, "loss": 1.7594, "step": 22220 }, { "epoch": 0.04108398514655922, "grad_norm": 0.08353780955076218, "learning_rate": 0.0028784983299938163, "loss": 1.7538, "step": 22240 }, { "epoch": 0.041215664586131524, "grad_norm": 0.06264527142047882, "learning_rate": 0.002878248565665347, "loss": 1.7511, "step": 22260 }, { "epoch": 0.04134734402570383, "grad_norm": 0.06513512134552002, "learning_rate": 0.0028779985557455968, "loss": 1.7527, "step": 22280 }, { "epoch": 0.041479023465276134, "grad_norm": 0.06116553023457527, "learning_rate": 0.0028777483002791165, "loss": 1.7505, "step": 22300 }, { "epoch": 0.04161070290484844, "grad_norm": 0.07746737450361252, "learning_rate": 0.002877497799310498, "loss": 1.7506, "step": 22320 }, { "epoch": 0.04174238234442074, "grad_norm": 0.05574808269739151, "learning_rate": 0.00287724705288438, "loss": 1.7452, "step": 22340 }, { "epoch": 0.04187406178399305, "grad_norm": 0.0626768171787262, "learning_rate": 0.002876996061045441, "loss": 1.7506, "step": 22360 }, { "epoch": 0.04200574122356535, "grad_norm": 0.07668133080005646, "learning_rate": 0.0028767448238384073, "loss": 1.7489, "step": 22380 }, { "epoch": 0.04213742066313766, "grad_norm": 0.08054382354021072, "learning_rate": 0.002876493341308046, "loss": 1.7492, "step": 22400 }, { "epoch": 0.04226910010270996, "grad_norm": 0.06886732578277588, "learning_rate": 0.0028762416134991697, "loss": 1.7482, "step": 22420 }, { "epoch": 0.04240077954228227, "grad_norm": 0.11965472251176834, "learning_rate": 0.0028759896404566333, "loss": 1.7443, "step": 22440 }, { "epoch": 0.04253245898185457, "grad_norm": 0.07691692560911179, "learning_rate": 0.0028757374222253365, "loss": 1.7421, "step": 22460 }, { "epoch": 0.04266413842142688, "grad_norm": 0.06630564481019974, "learning_rate": 0.002875484958850222, "loss": 1.7439, "step": 22480 }, { "epoch": 0.04279581786099918, "grad_norm": 0.06624884158372879, "learning_rate": 0.002875232250376277, "loss": 1.7532, "step": 22500 }, { "epoch": 0.042927497300571486, "grad_norm": 0.06218545883893967, "learning_rate": 0.002874979296848531, "loss": 1.7689, "step": 22520 }, { "epoch": 0.04305917674014379, "grad_norm": 0.08492391556501389, "learning_rate": 0.002874726098312059, "loss": 1.7707, "step": 22540 }, { "epoch": 0.043190856179716096, "grad_norm": 0.07384103536605835, "learning_rate": 0.0028744726548119784, "loss": 1.7758, "step": 22560 }, { "epoch": 0.04332253561928841, "grad_norm": 0.07037446647882462, "learning_rate": 0.0028742189663934496, "loss": 1.7694, "step": 22580 }, { "epoch": 0.04345421505886071, "grad_norm": 0.06753331422805786, "learning_rate": 0.0028739650331016785, "loss": 1.7684, "step": 22600 }, { "epoch": 0.04358589449843302, "grad_norm": 0.0832001268863678, "learning_rate": 0.0028737108549819136, "loss": 1.7703, "step": 22620 }, { "epoch": 0.04371757393800532, "grad_norm": 0.07064741849899292, "learning_rate": 0.002873456432079447, "loss": 1.7782, "step": 22640 }, { "epoch": 0.04384925337757763, "grad_norm": 0.06530604511499405, "learning_rate": 0.0028732017644396137, "loss": 1.7668, "step": 22660 }, { "epoch": 0.04398093281714993, "grad_norm": 0.09668663144111633, "learning_rate": 0.002872946852107795, "loss": 1.7674, "step": 22680 }, { "epoch": 0.044112612256722236, "grad_norm": 0.07591857761144638, "learning_rate": 0.002872691695129412, "loss": 1.7575, "step": 22700 }, { "epoch": 0.04424429169629454, "grad_norm": 0.08346087485551834, "learning_rate": 0.002872436293549932, "loss": 1.7595, "step": 22720 }, { "epoch": 0.044375971135866846, "grad_norm": 0.06290127336978912, "learning_rate": 0.0028721806474148663, "loss": 1.7576, "step": 22740 }, { "epoch": 0.04450765057543915, "grad_norm": 0.06168945133686066, "learning_rate": 0.002871924756769767, "loss": 1.7596, "step": 22760 }, { "epoch": 0.044639330015011455, "grad_norm": 0.07243330031633377, "learning_rate": 0.002871668621660233, "loss": 1.7604, "step": 22780 }, { "epoch": 0.04477100945458376, "grad_norm": 0.06622735410928726, "learning_rate": 0.002871412242131904, "loss": 1.7537, "step": 22800 }, { "epoch": 0.044902688894156065, "grad_norm": 0.057980917394161224, "learning_rate": 0.0028711556182304653, "loss": 1.7485, "step": 22820 }, { "epoch": 0.04503436833372837, "grad_norm": 0.07098107784986496, "learning_rate": 0.0028708987500016443, "loss": 1.748, "step": 22840 }, { "epoch": 0.045166047773300674, "grad_norm": 0.08247384428977966, "learning_rate": 0.002870641637491213, "loss": 1.7512, "step": 22860 }, { "epoch": 0.04529772721287298, "grad_norm": 0.07915489375591278, "learning_rate": 0.002870384280744987, "loss": 1.7551, "step": 22880 }, { "epoch": 0.045429406652445284, "grad_norm": 0.08467677235603333, "learning_rate": 0.0028701266798088236, "loss": 1.7454, "step": 22900 }, { "epoch": 0.045561086092017596, "grad_norm": 0.0650927871465683, "learning_rate": 0.002869868834728626, "loss": 1.7409, "step": 22920 }, { "epoch": 0.0456927655315899, "grad_norm": 0.08258968591690063, "learning_rate": 0.002869610745550339, "loss": 1.747, "step": 22940 }, { "epoch": 0.045824444971162205, "grad_norm": 0.06526441127061844, "learning_rate": 0.0028693524123199524, "loss": 1.7494, "step": 22960 }, { "epoch": 0.04595612441073451, "grad_norm": 0.08214429020881653, "learning_rate": 0.0028690938350834994, "loss": 1.7537, "step": 22980 }, { "epoch": 0.046087803850306815, "grad_norm": 0.06021787226200104, "learning_rate": 0.0028688350138870544, "loss": 1.7492, "step": 23000 }, { "epoch": 0.046087803850306815, "eval_loss": 1.614139437675476, "eval_runtime": 64.9061, "eval_samples_per_second": 15.407, "eval_steps_per_second": 15.407, "step": 23000 }, { "epoch": 0.04621948328987912, "grad_norm": 0.09553001075983047, "learning_rate": 0.002868575948776738, "loss": 1.751, "step": 23020 }, { "epoch": 0.046351162729451424, "grad_norm": 0.06959230452775955, "learning_rate": 0.0028683166397987137, "loss": 1.7443, "step": 23040 }, { "epoch": 0.04648284216902373, "grad_norm": 0.07799062877893448, "learning_rate": 0.0028680570869991863, "loss": 1.7412, "step": 23060 }, { "epoch": 0.046614521608596034, "grad_norm": 0.06044070050120354, "learning_rate": 0.002867797290424408, "loss": 1.7404, "step": 23080 }, { "epoch": 0.04674620104816834, "grad_norm": 0.06427774578332901, "learning_rate": 0.00286753725012067, "loss": 1.7424, "step": 23100 }, { "epoch": 0.04687788048774064, "grad_norm": 0.0699395090341568, "learning_rate": 0.002867276966134311, "loss": 1.7364, "step": 23120 }, { "epoch": 0.04700955992731295, "grad_norm": 0.05850491672754288, "learning_rate": 0.00286701643851171, "loss": 1.6901, "step": 23140 }, { "epoch": 0.04714123936688525, "grad_norm": 0.07173515111207962, "learning_rate": 0.002866755667299291, "loss": 1.6853, "step": 23160 }, { "epoch": 0.04727291880645756, "grad_norm": 0.10769501328468323, "learning_rate": 0.002866494652543521, "loss": 1.6832, "step": 23180 }, { "epoch": 0.04740459824602986, "grad_norm": 0.08263743668794632, "learning_rate": 0.0028662333942909104, "loss": 1.6789, "step": 23200 }, { "epoch": 0.04753627768560217, "grad_norm": 0.06656038016080856, "learning_rate": 0.0028659718925880128, "loss": 1.6759, "step": 23220 }, { "epoch": 0.04766795712517447, "grad_norm": 0.0891193225979805, "learning_rate": 0.0028657101474814264, "loss": 1.6761, "step": 23240 }, { "epoch": 0.047799636564746784, "grad_norm": 0.08038073033094406, "learning_rate": 0.0028654481590177907, "loss": 1.6701, "step": 23260 }, { "epoch": 0.04793131600431909, "grad_norm": 0.08320681005716324, "learning_rate": 0.0028651859272437897, "loss": 1.6733, "step": 23280 }, { "epoch": 0.04806299544389139, "grad_norm": 0.0696556568145752, "learning_rate": 0.0028649234522061516, "loss": 1.6736, "step": 23300 }, { "epoch": 0.0481946748834637, "grad_norm": 0.08962351828813553, "learning_rate": 0.002864660733951646, "loss": 1.6655, "step": 23320 }, { "epoch": 0.048326354323036, "grad_norm": 0.07071159034967422, "learning_rate": 0.0028643977725270877, "loss": 1.6765, "step": 23340 }, { "epoch": 0.04845803376260831, "grad_norm": 0.07777654379606247, "learning_rate": 0.0028641345679793337, "loss": 1.6659, "step": 23360 }, { "epoch": 0.04858971320218061, "grad_norm": 0.0689220279455185, "learning_rate": 0.002863871120355285, "loss": 1.6657, "step": 23380 }, { "epoch": 0.04872139264175292, "grad_norm": 0.08802857995033264, "learning_rate": 0.002863607429701884, "loss": 1.67, "step": 23400 }, { "epoch": 0.04885307208132522, "grad_norm": 0.06455916166305542, "learning_rate": 0.00286334349606612, "loss": 1.6648, "step": 23420 }, { "epoch": 0.048984751520897526, "grad_norm": 0.06590025126934052, "learning_rate": 0.0028630793194950226, "loss": 1.6652, "step": 23440 }, { "epoch": 0.04911643096046983, "grad_norm": 0.07274986058473587, "learning_rate": 0.0028628149000356658, "loss": 1.6589, "step": 23460 }, { "epoch": 0.049248110400042136, "grad_norm": 0.079200379550457, "learning_rate": 0.0028625502377351664, "loss": 1.6592, "step": 23480 }, { "epoch": 0.04937978983961444, "grad_norm": 0.08473269641399384, "learning_rate": 0.0028622853326406854, "loss": 1.6639, "step": 23500 }, { "epoch": 0.049511469279186746, "grad_norm": 0.0783248320221901, "learning_rate": 0.002862020184799426, "loss": 1.6609, "step": 23520 }, { "epoch": 0.04964314871875905, "grad_norm": 0.08220840990543365, "learning_rate": 0.002861754794258635, "loss": 1.6648, "step": 23540 }, { "epoch": 0.049774828158331355, "grad_norm": 0.06549611687660217, "learning_rate": 0.002861489161065603, "loss": 1.6619, "step": 23560 }, { "epoch": 0.04990650759790366, "grad_norm": 0.07199726998806, "learning_rate": 0.0028612232852676636, "loss": 1.6671, "step": 23580 }, { "epoch": 0.05003818703747597, "grad_norm": 0.08660496026277542, "learning_rate": 0.0028609571669121927, "loss": 1.6667, "step": 23600 }, { "epoch": 0.050169866477048276, "grad_norm": 0.10165523737668991, "learning_rate": 0.002860690806046611, "loss": 1.6579, "step": 23620 }, { "epoch": 0.05030154591662058, "grad_norm": 0.07491469383239746, "learning_rate": 0.00286042420271838, "loss": 1.662, "step": 23640 }, { "epoch": 0.050433225356192886, "grad_norm": 0.08252348750829697, "learning_rate": 0.0028601573569750085, "loss": 1.6665, "step": 23660 }, { "epoch": 0.05056490479576519, "grad_norm": 0.06357965618371964, "learning_rate": 0.0028598902688640434, "loss": 1.6753, "step": 23680 }, { "epoch": 0.050696584235337495, "grad_norm": 0.06429125368595123, "learning_rate": 0.0028596229384330787, "loss": 1.6727, "step": 23700 }, { "epoch": 0.0508282636749098, "grad_norm": 0.0685480460524559, "learning_rate": 0.0028593553657297504, "loss": 1.6862, "step": 23720 }, { "epoch": 0.050959943114482105, "grad_norm": 0.06911630928516388, "learning_rate": 0.002859087550801737, "loss": 1.6896, "step": 23740 }, { "epoch": 0.05109162255405441, "grad_norm": 0.06673968583345413, "learning_rate": 0.0028588194936967604, "loss": 1.6872, "step": 23760 }, { "epoch": 0.051223301993626714, "grad_norm": 0.08397223055362701, "learning_rate": 0.0028585511944625866, "loss": 1.6822, "step": 23780 }, { "epoch": 0.05135498143319902, "grad_norm": 0.0685010775923729, "learning_rate": 0.002858282653147024, "loss": 1.6926, "step": 23800 }, { "epoch": 0.051486660872771324, "grad_norm": 0.06479799002408981, "learning_rate": 0.0028580138697979237, "loss": 1.6875, "step": 23820 }, { "epoch": 0.05161834031234363, "grad_norm": 0.06732255220413208, "learning_rate": 0.002857744844463181, "loss": 1.6848, "step": 23840 }, { "epoch": 0.051750019751915934, "grad_norm": 0.06983063369989395, "learning_rate": 0.0028574755771907335, "loss": 1.6812, "step": 23860 }, { "epoch": 0.05188169919148824, "grad_norm": 0.07041189819574356, "learning_rate": 0.0028572060680285617, "loss": 1.6756, "step": 23880 }, { "epoch": 0.05201337863106054, "grad_norm": 0.06055330112576485, "learning_rate": 0.0028569363170246904, "loss": 1.6781, "step": 23900 }, { "epoch": 0.052145058070632855, "grad_norm": 0.07243553549051285, "learning_rate": 0.0028566663242271862, "loss": 1.6781, "step": 23920 }, { "epoch": 0.05227673751020516, "grad_norm": 0.08006641268730164, "learning_rate": 0.00285639608968416, "loss": 1.6846, "step": 23940 }, { "epoch": 0.052408416949777464, "grad_norm": 0.10588499903678894, "learning_rate": 0.0028561256134437647, "loss": 1.6757, "step": 23960 }, { "epoch": 0.05254009638934977, "grad_norm": 0.07262659072875977, "learning_rate": 0.0028558548955541965, "loss": 1.6781, "step": 23980 }, { "epoch": 0.052671775828922074, "grad_norm": 0.06767702847719193, "learning_rate": 0.002855583936063695, "loss": 1.672, "step": 24000 }, { "epoch": 0.052671775828922074, "eval_loss": 1.5004775524139404, "eval_runtime": 67.8841, "eval_samples_per_second": 14.731, "eval_steps_per_second": 14.731, "step": 24000 }, { "epoch": 0.05280345526849438, "grad_norm": 0.08169445395469666, "learning_rate": 0.002855312735020543, "loss": 1.675, "step": 24020 }, { "epoch": 0.05293513470806668, "grad_norm": 0.06959936767816544, "learning_rate": 0.0028550412924730657, "loss": 1.6778, "step": 24040 }, { "epoch": 0.05306681414763899, "grad_norm": 0.08186500519514084, "learning_rate": 0.002854769608469632, "loss": 1.6797, "step": 24060 }, { "epoch": 0.05319849358721129, "grad_norm": 0.07614962756633759, "learning_rate": 0.002854497683058653, "loss": 1.6682, "step": 24080 }, { "epoch": 0.0533301730267836, "grad_norm": 0.06458086520433426, "learning_rate": 0.002854225516288584, "loss": 1.6777, "step": 24100 }, { "epoch": 0.0534618524663559, "grad_norm": 0.07567057013511658, "learning_rate": 0.002853953108207922, "loss": 1.6709, "step": 24120 }, { "epoch": 0.05359353190592821, "grad_norm": 0.06437589973211288, "learning_rate": 0.002853680458865208, "loss": 1.672, "step": 24140 }, { "epoch": 0.05372521134550051, "grad_norm": 0.09382762014865875, "learning_rate": 0.0028534075683090254, "loss": 1.6754, "step": 24160 }, { "epoch": 0.05385689078507282, "grad_norm": 0.06308145076036453, "learning_rate": 0.002853134436588001, "loss": 1.6796, "step": 24180 }, { "epoch": 0.05398857022464512, "grad_norm": 0.07414955645799637, "learning_rate": 0.002852861063750804, "loss": 1.6753, "step": 24200 }, { "epoch": 0.054120249664217426, "grad_norm": 0.08207368105649948, "learning_rate": 0.0028525874498461475, "loss": 1.6737, "step": 24220 }, { "epoch": 0.05425192910378973, "grad_norm": 0.1388959437608719, "learning_rate": 0.0028523135949227864, "loss": 1.6711, "step": 24240 }, { "epoch": 0.05438360854336204, "grad_norm": 0.07871943712234497, "learning_rate": 0.0028520394990295193, "loss": 1.6799, "step": 24260 }, { "epoch": 0.05451528798293435, "grad_norm": 0.0691281110048294, "learning_rate": 0.0028517651622151884, "loss": 1.6845, "step": 24280 }, { "epoch": 0.05464696742250665, "grad_norm": 0.07609487324953079, "learning_rate": 0.002851490584528677, "loss": 1.7203, "step": 24300 }, { "epoch": 0.05477864686207896, "grad_norm": 0.07939011603593826, "learning_rate": 0.002851215766018913, "loss": 1.7355, "step": 24320 }, { "epoch": 0.05491032630165126, "grad_norm": 0.0882917046546936, "learning_rate": 0.0028509407067348652, "loss": 1.7458, "step": 24340 }, { "epoch": 0.05504200574122357, "grad_norm": 0.08259212225675583, "learning_rate": 0.0028506654067255487, "loss": 1.7469, "step": 24360 }, { "epoch": 0.05517368518079587, "grad_norm": 0.0653611272573471, "learning_rate": 0.0028503898660400175, "loss": 1.7565, "step": 24380 }, { "epoch": 0.055305364620368176, "grad_norm": 0.07420220971107483, "learning_rate": 0.002850114084727372, "loss": 1.7467, "step": 24400 }, { "epoch": 0.05543704405994048, "grad_norm": 0.12061482667922974, "learning_rate": 0.002849838062836753, "loss": 1.7476, "step": 24420 }, { "epoch": 0.055568723499512786, "grad_norm": 0.08582179993391037, "learning_rate": 0.0028495618004173453, "loss": 1.743, "step": 24440 }, { "epoch": 0.05570040293908509, "grad_norm": 0.11333516985177994, "learning_rate": 0.0028492852975183767, "loss": 1.7446, "step": 24460 }, { "epoch": 0.055832082378657395, "grad_norm": 0.06701093912124634, "learning_rate": 0.0028490085541891166, "loss": 1.7329, "step": 24480 }, { "epoch": 0.0559637618182297, "grad_norm": 0.07070864737033844, "learning_rate": 0.0028487315704788787, "loss": 1.741, "step": 24500 }, { "epoch": 0.056095441257802005, "grad_norm": 0.08799562603235245, "learning_rate": 0.0028484543464370187, "loss": 1.7349, "step": 24520 }, { "epoch": 0.05622712069737431, "grad_norm": 0.08984426409006119, "learning_rate": 0.002848176882112936, "loss": 1.7277, "step": 24540 }, { "epoch": 0.056358800136946614, "grad_norm": 0.08583886176347733, "learning_rate": 0.002847899177556072, "loss": 1.7304, "step": 24560 }, { "epoch": 0.05649047957651892, "grad_norm": 0.07309599220752716, "learning_rate": 0.0028476212328159105, "loss": 1.736, "step": 24580 }, { "epoch": 0.05662215901609123, "grad_norm": 0.10758428275585175, "learning_rate": 0.0028473430479419794, "loss": 1.7309, "step": 24600 }, { "epoch": 0.056753838455663536, "grad_norm": 0.07512976229190826, "learning_rate": 0.0028470646229838475, "loss": 1.7258, "step": 24620 }, { "epoch": 0.05688551789523584, "grad_norm": 0.09403645247220993, "learning_rate": 0.00284678595799113, "loss": 1.7245, "step": 24640 }, { "epoch": 0.057017197334808145, "grad_norm": 0.06885070353746414, "learning_rate": 0.0028465070530134797, "loss": 1.7257, "step": 24660 }, { "epoch": 0.05714887677438045, "grad_norm": 0.07384008169174194, "learning_rate": 0.0028462279081005967, "loss": 1.7237, "step": 24680 }, { "epoch": 0.057280556213952755, "grad_norm": 0.08138833940029144, "learning_rate": 0.0028459485233022215, "loss": 1.7216, "step": 24700 }, { "epoch": 0.05741223565352506, "grad_norm": 0.057137709110975266, "learning_rate": 0.002845668898668138, "loss": 1.7229, "step": 24720 }, { "epoch": 0.057543915093097364, "grad_norm": 0.06821935623884201, "learning_rate": 0.0028453890342481727, "loss": 1.7139, "step": 24740 }, { "epoch": 0.05767559453266967, "grad_norm": 0.07039092481136322, "learning_rate": 0.002845108930092195, "loss": 1.7257, "step": 24760 }, { "epoch": 0.057807273972241974, "grad_norm": 0.06676448881626129, "learning_rate": 0.0028448285862501164, "loss": 1.7204, "step": 24780 }, { "epoch": 0.05793895341181428, "grad_norm": 0.0648011863231659, "learning_rate": 0.0028445480027718922, "loss": 1.7128, "step": 24800 }, { "epoch": 0.05807063285138658, "grad_norm": 0.07681864500045776, "learning_rate": 0.0028442671797075194, "loss": 1.7201, "step": 24820 }, { "epoch": 0.05820231229095889, "grad_norm": 0.06368867307901382, "learning_rate": 0.0028439861171070386, "loss": 1.7169, "step": 24840 }, { "epoch": 0.05833399173053119, "grad_norm": 0.08015841245651245, "learning_rate": 0.0028437048150205322, "loss": 1.7143, "step": 24860 }, { "epoch": 0.0584656711701035, "grad_norm": 0.06920666247606277, "learning_rate": 0.0028434232734981255, "loss": 1.7262, "step": 24880 }, { "epoch": 0.0585973506096758, "grad_norm": 0.1089114099740982, "learning_rate": 0.002843141492589987, "loss": 1.7356, "step": 24900 }, { "epoch": 0.05872903004924811, "grad_norm": 0.06988651305437088, "learning_rate": 0.0028428594723463275, "loss": 1.7347, "step": 24920 }, { "epoch": 0.05886070948882042, "grad_norm": 0.076754629611969, "learning_rate": 0.0028425772128173998, "loss": 1.7332, "step": 24940 }, { "epoch": 0.058992388928392724, "grad_norm": 0.07548579573631287, "learning_rate": 0.0028422947140535008, "loss": 1.7258, "step": 24960 }, { "epoch": 0.05912406836796503, "grad_norm": 0.0791606530547142, "learning_rate": 0.0028420119761049687, "loss": 1.7298, "step": 24980 }, { "epoch": 0.05925574780753733, "grad_norm": 0.06826753914356232, "learning_rate": 0.0028417289990221853, "loss": 1.7286, "step": 25000 }, { "epoch": 0.05925574780753733, "eval_loss": 1.641815423965454, "eval_runtime": 66.1639, "eval_samples_per_second": 15.114, "eval_steps_per_second": 15.114, "step": 25000 }, { "epoch": 0.05938742724710964, "grad_norm": 0.06096088886260986, "learning_rate": 0.0028414457828555735, "loss": 1.7278, "step": 25020 }, { "epoch": 0.05951910668668194, "grad_norm": 0.0753740519285202, "learning_rate": 0.0028411623276556005, "loss": 1.7184, "step": 25040 }, { "epoch": 0.05965078612625425, "grad_norm": 0.06860582530498505, "learning_rate": 0.0028408786334727758, "loss": 1.7238, "step": 25060 }, { "epoch": 0.05978246556582655, "grad_norm": 0.08930736780166626, "learning_rate": 0.0028405947003576505, "loss": 1.717, "step": 25080 }, { "epoch": 0.05991414500539886, "grad_norm": 0.06507642567157745, "learning_rate": 0.002840310528360819, "loss": 1.7187, "step": 25100 }, { "epoch": 0.06004582444497116, "grad_norm": 0.07465964555740356, "learning_rate": 0.0028400261175329186, "loss": 1.7214, "step": 25120 }, { "epoch": 0.060177503884543466, "grad_norm": 0.08822104334831238, "learning_rate": 0.002839741467924628, "loss": 1.7129, "step": 25140 }, { "epoch": 0.06030918332411577, "grad_norm": 0.12070819735527039, "learning_rate": 0.00283945657958667, "loss": 1.7093, "step": 25160 }, { "epoch": 0.060440862763688076, "grad_norm": 0.06325086951255798, "learning_rate": 0.002839171452569808, "loss": 1.7043, "step": 25180 }, { "epoch": 0.06057254220326038, "grad_norm": 0.07239518314599991, "learning_rate": 0.00283888608692485, "loss": 1.7006, "step": 25200 }, { "epoch": 0.060704221642832686, "grad_norm": 0.08891430497169495, "learning_rate": 0.002838600482702645, "loss": 1.7102, "step": 25220 }, { "epoch": 0.06083590108240499, "grad_norm": 0.06925225257873535, "learning_rate": 0.0028383146399540856, "loss": 1.7128, "step": 25240 }, { "epoch": 0.060967580521977295, "grad_norm": 0.10547026246786118, "learning_rate": 0.0028380285587301054, "loss": 1.7051, "step": 25260 }, { "epoch": 0.06109925996154961, "grad_norm": 0.07027033716440201, "learning_rate": 0.0028377422390816823, "loss": 1.7204, "step": 25280 }, { "epoch": 0.06123093940112191, "grad_norm": 0.06962334364652634, "learning_rate": 0.0028374556810598357, "loss": 1.714, "step": 25300 }, { "epoch": 0.061362618840694216, "grad_norm": 0.09216281771659851, "learning_rate": 0.0028371688847156277, "loss": 1.7058, "step": 25320 }, { "epoch": 0.06149429828026652, "grad_norm": 0.07846725732088089, "learning_rate": 0.0028368818501001624, "loss": 1.712, "step": 25340 }, { "epoch": 0.061625977719838826, "grad_norm": 0.11076796799898148, "learning_rate": 0.002836594577264587, "loss": 1.7075, "step": 25360 }, { "epoch": 0.06175765715941113, "grad_norm": 0.07543148845434189, "learning_rate": 0.00283630706626009, "loss": 1.7033, "step": 25380 }, { "epoch": 0.061889336598983435, "grad_norm": 0.08785652369260788, "learning_rate": 0.002836019317137905, "loss": 1.7076, "step": 25400 }, { "epoch": 0.06202101603855574, "grad_norm": 0.0767190009355545, "learning_rate": 0.002835731329949305, "loss": 1.6997, "step": 25420 }, { "epoch": 0.062152695478128045, "grad_norm": 0.06853576004505157, "learning_rate": 0.002835443104745607, "loss": 1.7111, "step": 25440 }, { "epoch": 0.06228437491770035, "grad_norm": 0.07039535045623779, "learning_rate": 0.0028351546415781703, "loss": 1.6986, "step": 25460 }, { "epoch": 0.062416054357272654, "grad_norm": 0.06429757922887802, "learning_rate": 0.002834865940498396, "loss": 1.7016, "step": 25480 }, { "epoch": 0.06254773379684496, "grad_norm": 0.06879903376102448, "learning_rate": 0.0028345770015577275, "loss": 1.6425, "step": 25500 }, { "epoch": 0.06267941323641726, "grad_norm": 0.0694214403629303, "learning_rate": 0.0028342878248076527, "loss": 1.5967, "step": 25520 }, { "epoch": 0.06281109267598957, "grad_norm": 0.07605341076850891, "learning_rate": 0.002833998410299699, "loss": 1.5833, "step": 25540 }, { "epoch": 0.06294277211556187, "grad_norm": 0.06291548907756805, "learning_rate": 0.002833708758085438, "loss": 1.5772, "step": 25560 }, { "epoch": 0.06307445155513418, "grad_norm": 0.06334402412176132, "learning_rate": 0.0028334188682164825, "loss": 1.5762, "step": 25580 }, { "epoch": 0.06320613099470648, "grad_norm": 0.0940147116780281, "learning_rate": 0.002833128740744488, "loss": 1.5723, "step": 25600 }, { "epoch": 0.06333781043427879, "grad_norm": 0.0760306864976883, "learning_rate": 0.002832838375721154, "loss": 1.5759, "step": 25620 }, { "epoch": 0.06346948987385109, "grad_norm": 0.08564443141222, "learning_rate": 0.0028325477731982194, "loss": 1.5828, "step": 25640 }, { "epoch": 0.0636011693134234, "grad_norm": 0.07691756635904312, "learning_rate": 0.0028322569332274675, "loss": 1.5797, "step": 25660 }, { "epoch": 0.0637328487529957, "grad_norm": 0.07960242033004761, "learning_rate": 0.002831965855860723, "loss": 1.575, "step": 25680 }, { "epoch": 0.06386452819256801, "grad_norm": 0.08058685809373856, "learning_rate": 0.0028316745411498543, "loss": 1.5784, "step": 25700 }, { "epoch": 0.06399620763214031, "grad_norm": 0.07303532212972641, "learning_rate": 0.00283138298914677, "loss": 1.5821, "step": 25720 }, { "epoch": 0.06412788707171262, "grad_norm": 0.09177567064762115, "learning_rate": 0.002831091199903422, "loss": 1.5731, "step": 25740 }, { "epoch": 0.06425956651128492, "grad_norm": 0.07598966360092163, "learning_rate": 0.0028307991734718044, "loss": 1.5735, "step": 25760 }, { "epoch": 0.06439124595085724, "grad_norm": 0.07235264033079147, "learning_rate": 0.0028305069099039543, "loss": 1.5749, "step": 25780 }, { "epoch": 0.06452292539042954, "grad_norm": 0.08868271857500076, "learning_rate": 0.00283021440925195, "loss": 1.5741, "step": 25800 }, { "epoch": 0.06465460483000185, "grad_norm": 0.08162138611078262, "learning_rate": 0.0028299216715679124, "loss": 1.578, "step": 25820 }, { "epoch": 0.06478628426957415, "grad_norm": 0.0805659294128418, "learning_rate": 0.002829628696904005, "loss": 1.5809, "step": 25840 }, { "epoch": 0.06491796370914646, "grad_norm": 0.07114304602146149, "learning_rate": 0.0028293354853124327, "loss": 1.5869, "step": 25860 }, { "epoch": 0.06504964314871876, "grad_norm": 0.06668581813573837, "learning_rate": 0.0028290420368454433, "loss": 1.5876, "step": 25880 }, { "epoch": 0.06518132258829107, "grad_norm": 0.07414104044437408, "learning_rate": 0.0028287483515553272, "loss": 1.5846, "step": 25900 }, { "epoch": 0.06531300202786337, "grad_norm": 0.07118961215019226, "learning_rate": 0.002828454429494415, "loss": 1.5878, "step": 25920 }, { "epoch": 0.06544468146743568, "grad_norm": 0.08453836292028427, "learning_rate": 0.0028281602707150824, "loss": 1.5897, "step": 25940 }, { "epoch": 0.06557636090700798, "grad_norm": 0.07505936175584793, "learning_rate": 0.0028278658752697453, "loss": 1.5864, "step": 25960 }, { "epoch": 0.06570804034658029, "grad_norm": 0.07345987111330032, "learning_rate": 0.0028275712432108626, "loss": 1.5844, "step": 25980 }, { "epoch": 0.06583971978615259, "grad_norm": 0.09382303059101105, "learning_rate": 0.002827276374590934, "loss": 1.5951, "step": 26000 }, { "epoch": 0.06583971978615259, "eval_loss": 1.7229478359222412, "eval_runtime": 67.2917, "eval_samples_per_second": 14.861, "eval_steps_per_second": 14.861, "step": 26000 }, { "epoch": 0.0659713992257249, "grad_norm": 0.07171901315450668, "learning_rate": 0.0028269812694625036, "loss": 1.5965, "step": 26020 }, { "epoch": 0.0661030786652972, "grad_norm": 0.11737576127052307, "learning_rate": 0.002826685927878155, "loss": 1.5861, "step": 26040 }, { "epoch": 0.0662347581048695, "grad_norm": 0.1007668673992157, "learning_rate": 0.002826390349890517, "loss": 1.6206, "step": 26060 }, { "epoch": 0.06636643754444181, "grad_norm": 0.07489984482526779, "learning_rate": 0.0028260945355522583, "loss": 1.6584, "step": 26080 }, { "epoch": 0.06649811698401412, "grad_norm": 0.07443971931934357, "learning_rate": 0.0028257984849160895, "loss": 1.6751, "step": 26100 }, { "epoch": 0.06662979642358642, "grad_norm": 0.07076618820428848, "learning_rate": 0.0028255021980347654, "loss": 1.6871, "step": 26120 }, { "epoch": 0.06676147586315873, "grad_norm": 0.08177798986434937, "learning_rate": 0.0028252056749610804, "loss": 1.6991, "step": 26140 }, { "epoch": 0.06689315530273103, "grad_norm": 0.08380310237407684, "learning_rate": 0.0028249089157478735, "loss": 1.6959, "step": 26160 }, { "epoch": 0.06702483474230334, "grad_norm": 0.08319336175918579, "learning_rate": 0.0028246119204480232, "loss": 1.6876, "step": 26180 }, { "epoch": 0.06715651418187564, "grad_norm": 0.07932873070240021, "learning_rate": 0.0028243146891144518, "loss": 1.6902, "step": 26200 }, { "epoch": 0.06728819362144794, "grad_norm": 0.06260685622692108, "learning_rate": 0.0028240172218001233, "loss": 1.6899, "step": 26220 }, { "epoch": 0.06741987306102025, "grad_norm": 0.09259559959173203, "learning_rate": 0.002823719518558044, "loss": 1.6746, "step": 26240 }, { "epoch": 0.06755155250059255, "grad_norm": 0.08179523050785065, "learning_rate": 0.0028234215794412615, "loss": 1.6782, "step": 26260 }, { "epoch": 0.06768323194016486, "grad_norm": 0.08897533267736435, "learning_rate": 0.002823123404502866, "loss": 1.6725, "step": 26280 }, { "epoch": 0.06781491137973716, "grad_norm": 0.06979696452617645, "learning_rate": 0.0028228249937959893, "loss": 1.6782, "step": 26300 }, { "epoch": 0.06794659081930947, "grad_norm": 0.08062341064214706, "learning_rate": 0.002822526347373805, "loss": 1.6731, "step": 26320 }, { "epoch": 0.06807827025888177, "grad_norm": 0.08686768263578415, "learning_rate": 0.0028222274652895305, "loss": 1.6711, "step": 26340 }, { "epoch": 0.06820994969845408, "grad_norm": 0.07862361520528793, "learning_rate": 0.0028219283475964226, "loss": 1.6678, "step": 26360 }, { "epoch": 0.06834162913802638, "grad_norm": 0.08037963509559631, "learning_rate": 0.0028216289943477817, "loss": 1.6723, "step": 26380 }, { "epoch": 0.06847330857759869, "grad_norm": 0.06775148212909698, "learning_rate": 0.0028213294055969506, "loss": 1.6675, "step": 26400 }, { "epoch": 0.06860498801717099, "grad_norm": 0.07389701157808304, "learning_rate": 0.0028210295813973123, "loss": 1.6645, "step": 26420 }, { "epoch": 0.0687366674567433, "grad_norm": 0.0821567252278328, "learning_rate": 0.0028207295218022925, "loss": 1.664, "step": 26440 }, { "epoch": 0.06886834689631562, "grad_norm": 0.0829467922449112, "learning_rate": 0.0028204292268653604, "loss": 1.66, "step": 26460 }, { "epoch": 0.06900002633588792, "grad_norm": 0.07580474019050598, "learning_rate": 0.0028201286966400246, "loss": 1.6631, "step": 26480 }, { "epoch": 0.06913170577546023, "grad_norm": 0.07539396733045578, "learning_rate": 0.0028198279311798372, "loss": 1.6594, "step": 26500 }, { "epoch": 0.06926338521503253, "grad_norm": 0.08187814056873322, "learning_rate": 0.0028195269305383917, "loss": 1.6656, "step": 26520 }, { "epoch": 0.06939506465460483, "grad_norm": 0.08854663372039795, "learning_rate": 0.0028192256947693244, "loss": 1.6616, "step": 26540 }, { "epoch": 0.06952674409417714, "grad_norm": 0.08540527522563934, "learning_rate": 0.0028189242239263124, "loss": 1.6572, "step": 26560 }, { "epoch": 0.06965842353374944, "grad_norm": 0.07513197511434555, "learning_rate": 0.0028186225180630744, "loss": 1.658, "step": 26580 }, { "epoch": 0.06979010297332175, "grad_norm": 0.09598047286272049, "learning_rate": 0.002818320577233372, "loss": 1.667, "step": 26600 }, { "epoch": 0.06992178241289405, "grad_norm": 0.07224708050489426, "learning_rate": 0.0028180184014910082, "loss": 1.6529, "step": 26620 }, { "epoch": 0.07005346185246636, "grad_norm": 0.08062656968832016, "learning_rate": 0.0028177159908898282, "loss": 1.6542, "step": 26640 }, { "epoch": 0.07018514129203866, "grad_norm": 0.07291059195995331, "learning_rate": 0.0028174133454837193, "loss": 1.6783, "step": 26660 }, { "epoch": 0.07031682073161097, "grad_norm": 0.07700487226247787, "learning_rate": 0.002817110465326609, "loss": 1.7044, "step": 26680 }, { "epoch": 0.07044850017118327, "grad_norm": 0.23015104234218597, "learning_rate": 0.002816807350472469, "loss": 1.7165, "step": 26700 }, { "epoch": 0.07058017961075558, "grad_norm": 0.10937873274087906, "learning_rate": 0.00281650400097531, "loss": 1.7157, "step": 26720 }, { "epoch": 0.07071185905032788, "grad_norm": 0.0746932178735733, "learning_rate": 0.0028162004168891877, "loss": 1.7176, "step": 26740 }, { "epoch": 0.07084353848990019, "grad_norm": 0.07187461853027344, "learning_rate": 0.0028158965982681976, "loss": 1.7088, "step": 26760 }, { "epoch": 0.07097521792947249, "grad_norm": 0.0845644474029541, "learning_rate": 0.0028155925451664766, "loss": 1.7109, "step": 26780 }, { "epoch": 0.0711068973690448, "grad_norm": 0.0642613023519516, "learning_rate": 0.002815288257638205, "loss": 1.7109, "step": 26800 }, { "epoch": 0.0712385768086171, "grad_norm": 0.06674417108297348, "learning_rate": 0.0028149837357376033, "loss": 1.7072, "step": 26820 }, { "epoch": 0.0713702562481894, "grad_norm": 0.0797337219119072, "learning_rate": 0.0028146789795189353, "loss": 1.7036, "step": 26840 }, { "epoch": 0.07150193568776171, "grad_norm": 0.06999875605106354, "learning_rate": 0.0028143739890365053, "loss": 1.6998, "step": 26860 }, { "epoch": 0.07163361512733402, "grad_norm": 0.10101525485515594, "learning_rate": 0.0028140687643446603, "loss": 1.6987, "step": 26880 }, { "epoch": 0.07176529456690632, "grad_norm": 0.06726180762052536, "learning_rate": 0.002813763305497788, "loss": 1.7011, "step": 26900 }, { "epoch": 0.07189697400647863, "grad_norm": 0.07989557832479477, "learning_rate": 0.002813457612550319, "loss": 1.6982, "step": 26920 }, { "epoch": 0.07202865344605093, "grad_norm": 0.08156982809305191, "learning_rate": 0.0028131516855567236, "loss": 1.6946, "step": 26940 }, { "epoch": 0.07216033288562324, "grad_norm": 0.09064619243144989, "learning_rate": 0.0028128455245715173, "loss": 1.6942, "step": 26960 }, { "epoch": 0.07229201232519554, "grad_norm": 0.08123116940259933, "learning_rate": 0.0028125391296492533, "loss": 1.6931, "step": 26980 }, { "epoch": 0.07242369176476784, "grad_norm": 0.07538691908121109, "learning_rate": 0.00281223250084453, "loss": 1.6849, "step": 27000 }, { "epoch": 0.07242369176476784, "eval_loss": 1.7134445905685425, "eval_runtime": 66.2906, "eval_samples_per_second": 15.085, "eval_steps_per_second": 15.085, "step": 27000 }, { "epoch": 0.07255537120434015, "grad_norm": 0.07675933837890625, "learning_rate": 0.0028119256382119844, "loss": 1.6956, "step": 27020 }, { "epoch": 0.07268705064391245, "grad_norm": 0.07131894677877426, "learning_rate": 0.0028116185418062965, "loss": 1.6849, "step": 27040 }, { "epoch": 0.07281873008348476, "grad_norm": 0.07346808910369873, "learning_rate": 0.0028113112116821895, "loss": 1.6826, "step": 27060 }, { "epoch": 0.07295040952305706, "grad_norm": 0.10725018382072449, "learning_rate": 0.002811003647894426, "loss": 1.6802, "step": 27080 }, { "epoch": 0.07308208896262937, "grad_norm": 0.07160640507936478, "learning_rate": 0.0028106958504978113, "loss": 1.6832, "step": 27100 }, { "epoch": 0.07321376840220169, "grad_norm": 0.09838573634624481, "learning_rate": 0.0028103878195471915, "loss": 1.6867, "step": 27120 }, { "epoch": 0.07334544784177399, "grad_norm": 0.08039765805006027, "learning_rate": 0.0028100795550974555, "loss": 1.6859, "step": 27140 }, { "epoch": 0.0734771272813463, "grad_norm": 0.096266008913517, "learning_rate": 0.0028097710572035327, "loss": 1.6887, "step": 27160 }, { "epoch": 0.0736088067209186, "grad_norm": 0.08196264505386353, "learning_rate": 0.0028094623259203953, "loss": 1.681, "step": 27180 }, { "epoch": 0.0737404861604909, "grad_norm": 0.0661395713686943, "learning_rate": 0.002809153361303056, "loss": 1.6812, "step": 27200 }, { "epoch": 0.07387216560006321, "grad_norm": 0.07243622839450836, "learning_rate": 0.002808844163406569, "loss": 1.6778, "step": 27220 }, { "epoch": 0.07400384503963552, "grad_norm": 0.06151533126831055, "learning_rate": 0.002808534732286032, "loss": 1.684, "step": 27240 }, { "epoch": 0.07413552447920782, "grad_norm": 0.06907381862401962, "learning_rate": 0.0028082250679965803, "loss": 1.6891, "step": 27260 }, { "epoch": 0.07426720391878013, "grad_norm": 0.07179991155862808, "learning_rate": 0.0028079151705933955, "loss": 1.7013, "step": 27280 }, { "epoch": 0.07439888335835243, "grad_norm": 0.0859934464097023, "learning_rate": 0.002807605040131698, "loss": 1.6998, "step": 27300 }, { "epoch": 0.07453056279792473, "grad_norm": 0.05939393863081932, "learning_rate": 0.0028072946766667497, "loss": 1.7046, "step": 27320 }, { "epoch": 0.07466224223749704, "grad_norm": 0.08368372917175293, "learning_rate": 0.0028069840802538546, "loss": 1.7019, "step": 27340 }, { "epoch": 0.07479392167706934, "grad_norm": 0.06464136391878128, "learning_rate": 0.0028066732509483584, "loss": 1.7044, "step": 27360 }, { "epoch": 0.07492560111664165, "grad_norm": 0.08051209896802902, "learning_rate": 0.002806362188805648, "loss": 1.7057, "step": 27380 }, { "epoch": 0.07505728055621395, "grad_norm": 0.08102471381425858, "learning_rate": 0.0028060508938811514, "loss": 1.6942, "step": 27400 }, { "epoch": 0.07518895999578626, "grad_norm": 0.0877891480922699, "learning_rate": 0.002805739366230339, "loss": 1.6992, "step": 27420 }, { "epoch": 0.07532063943535856, "grad_norm": 0.0812918171286583, "learning_rate": 0.002805427605908722, "loss": 1.6922, "step": 27440 }, { "epoch": 0.07545231887493087, "grad_norm": 0.07641803473234177, "learning_rate": 0.0028051156129718538, "loss": 1.6876, "step": 27460 }, { "epoch": 0.07558399831450317, "grad_norm": 0.12771321833133698, "learning_rate": 0.0028048033874753277, "loss": 1.6847, "step": 27480 }, { "epoch": 0.07571567775407548, "grad_norm": 0.06846945732831955, "learning_rate": 0.00280449092947478, "loss": 1.6961, "step": 27500 }, { "epoch": 0.07584735719364778, "grad_norm": 0.0757148414850235, "learning_rate": 0.0028041782390258872, "loss": 1.6922, "step": 27520 }, { "epoch": 0.07597903663322009, "grad_norm": 0.07266736030578613, "learning_rate": 0.0028038653161843686, "loss": 1.6867, "step": 27540 }, { "epoch": 0.07611071607279239, "grad_norm": 0.10380854457616806, "learning_rate": 0.0028035521610059845, "loss": 1.686, "step": 27560 }, { "epoch": 0.0762423955123647, "grad_norm": 0.063069187104702, "learning_rate": 0.0028032387735465354, "loss": 1.6815, "step": 27580 }, { "epoch": 0.076374074951937, "grad_norm": 0.08514589071273804, "learning_rate": 0.0028029251538618646, "loss": 1.6811, "step": 27600 }, { "epoch": 0.0765057543915093, "grad_norm": 0.07171927392482758, "learning_rate": 0.002802611302007856, "loss": 1.6866, "step": 27620 }, { "epoch": 0.07663743383108161, "grad_norm": 0.07096509635448456, "learning_rate": 0.002802297218040436, "loss": 1.6754, "step": 27640 }, { "epoch": 0.07676911327065392, "grad_norm": 0.07615986466407776, "learning_rate": 0.0028019829020155696, "loss": 1.679, "step": 27660 }, { "epoch": 0.07690079271022622, "grad_norm": 0.09297886490821838, "learning_rate": 0.0028016683539892665, "loss": 1.6825, "step": 27680 }, { "epoch": 0.07703247214979853, "grad_norm": 0.07821375876665115, "learning_rate": 0.002801353574017576, "loss": 1.6857, "step": 27700 }, { "epoch": 0.07716415158937083, "grad_norm": 0.08595246821641922, "learning_rate": 0.002801038562156589, "loss": 1.6732, "step": 27720 }, { "epoch": 0.07729583102894313, "grad_norm": 0.08263617008924484, "learning_rate": 0.0028007233184624385, "loss": 1.6812, "step": 27740 }, { "epoch": 0.07742751046851544, "grad_norm": 0.06740175932645798, "learning_rate": 0.002800407842991296, "loss": 1.6786, "step": 27760 }, { "epoch": 0.07755918990808774, "grad_norm": 0.07347702234983444, "learning_rate": 0.002800092135799378, "loss": 1.6849, "step": 27780 }, { "epoch": 0.07769086934766006, "grad_norm": 0.06432320922613144, "learning_rate": 0.0027997761969429406, "loss": 1.6729, "step": 27800 }, { "epoch": 0.07782254878723237, "grad_norm": 0.06912487000226974, "learning_rate": 0.0027994600264782806, "loss": 1.6729, "step": 27820 }, { "epoch": 0.07795422822680467, "grad_norm": 0.07025229185819626, "learning_rate": 0.0027991436244617367, "loss": 1.6717, "step": 27840 }, { "epoch": 0.07808590766637698, "grad_norm": 0.06698182970285416, "learning_rate": 0.002798826990949689, "loss": 1.6741, "step": 27860 }, { "epoch": 0.07821758710594928, "grad_norm": 0.07972477376461029, "learning_rate": 0.0027985101259985594, "loss": 1.6626, "step": 27880 }, { "epoch": 0.07834926654552159, "grad_norm": 0.08026134967803955, "learning_rate": 0.0027981930296648084, "loss": 1.6533, "step": 27900 }, { "epoch": 0.07848094598509389, "grad_norm": 0.07009740173816681, "learning_rate": 0.002797875702004942, "loss": 1.6447, "step": 27920 }, { "epoch": 0.0786126254246662, "grad_norm": 0.0895591527223587, "learning_rate": 0.002797558143075504, "loss": 1.6316, "step": 27940 }, { "epoch": 0.0787443048642385, "grad_norm": 0.07302293926477432, "learning_rate": 0.00279724035293308, "loss": 1.6278, "step": 27960 }, { "epoch": 0.0788759843038108, "grad_norm": 0.06689465790987015, "learning_rate": 0.002796922331634298, "loss": 1.6277, "step": 27980 }, { "epoch": 0.07900766374338311, "grad_norm": 0.12900836765766144, "learning_rate": 0.002796604079235826, "loss": 1.6216, "step": 28000 }, { "epoch": 0.07900766374338311, "eval_loss": 1.57399582862854, "eval_runtime": 67.3732, "eval_samples_per_second": 14.843, "eval_steps_per_second": 14.843, "step": 28000 }, { "epoch": 0.07913934318295542, "grad_norm": 0.09559524804353714, "learning_rate": 0.002796285595794375, "loss": 1.6188, "step": 28020 }, { "epoch": 0.07927102262252772, "grad_norm": 0.09647485613822937, "learning_rate": 0.002795966881366694, "loss": 1.6111, "step": 28040 }, { "epoch": 0.07940270206210003, "grad_norm": 0.0804126113653183, "learning_rate": 0.002795647936009576, "loss": 1.624, "step": 28060 }, { "epoch": 0.07953438150167233, "grad_norm": 0.1041126698255539, "learning_rate": 0.0027953287597798538, "loss": 1.6142, "step": 28080 }, { "epoch": 0.07966606094124463, "grad_norm": 0.070301353931427, "learning_rate": 0.002795009352734402, "loss": 1.6135, "step": 28100 }, { "epoch": 0.07979774038081694, "grad_norm": 0.07575052231550217, "learning_rate": 0.0027946897149301354, "loss": 1.6113, "step": 28120 }, { "epoch": 0.07992941982038924, "grad_norm": 0.0882832482457161, "learning_rate": 0.0027943698464240117, "loss": 1.6073, "step": 28140 }, { "epoch": 0.08006109925996155, "grad_norm": 0.07412759959697723, "learning_rate": 0.002794049747273027, "loss": 1.6025, "step": 28160 }, { "epoch": 0.08019277869953385, "grad_norm": 0.10568110644817352, "learning_rate": 0.002793729417534221, "loss": 1.6053, "step": 28180 }, { "epoch": 0.08032445813910616, "grad_norm": 0.07552295923233032, "learning_rate": 0.002793408857264674, "loss": 1.6057, "step": 28200 }, { "epoch": 0.08045613757867846, "grad_norm": 0.07230095565319061, "learning_rate": 0.0027930880665215057, "loss": 1.6072, "step": 28220 }, { "epoch": 0.08058781701825077, "grad_norm": 0.07529731094837189, "learning_rate": 0.002792767045361879, "loss": 1.6136, "step": 28240 }, { "epoch": 0.08071949645782307, "grad_norm": 0.08432866632938385, "learning_rate": 0.0027924457938429967, "loss": 1.6122, "step": 28260 }, { "epoch": 0.08085117589739538, "grad_norm": 0.08389344066381454, "learning_rate": 0.002792124312022102, "loss": 1.6049, "step": 28280 }, { "epoch": 0.08098285533696768, "grad_norm": 0.08148514479398727, "learning_rate": 0.0027918025999564815, "loss": 1.6022, "step": 28300 }, { "epoch": 0.08111453477653999, "grad_norm": 0.07762300223112106, "learning_rate": 0.00279148065770346, "loss": 1.6088, "step": 28320 }, { "epoch": 0.08124621421611229, "grad_norm": 0.08115459978580475, "learning_rate": 0.0027911584853204056, "loss": 1.6068, "step": 28340 }, { "epoch": 0.0813778936556846, "grad_norm": 0.08367536962032318, "learning_rate": 0.0027908360828647265, "loss": 1.5971, "step": 28360 }, { "epoch": 0.0815095730952569, "grad_norm": 0.08000832796096802, "learning_rate": 0.002790513450393871, "loss": 1.6084, "step": 28380 }, { "epoch": 0.0816412525348292, "grad_norm": 0.08210103958845139, "learning_rate": 0.00279019058796533, "loss": 1.6077, "step": 28400 }, { "epoch": 0.08177293197440151, "grad_norm": 0.07329817861318588, "learning_rate": 0.002789867495636635, "loss": 1.61, "step": 28420 }, { "epoch": 0.08190461141397382, "grad_norm": 0.06839757412672043, "learning_rate": 0.002789544173465357, "loss": 1.6128, "step": 28440 }, { "epoch": 0.08203629085354612, "grad_norm": 0.06943529099225998, "learning_rate": 0.002789220621509109, "loss": 1.6285, "step": 28460 }, { "epoch": 0.08216797029311844, "grad_norm": 0.10486973077058792, "learning_rate": 0.0027888968398255467, "loss": 1.6335, "step": 28480 }, { "epoch": 0.08229964973269074, "grad_norm": 0.07937227934598923, "learning_rate": 0.0027885728284723628, "loss": 1.6372, "step": 28500 }, { "epoch": 0.08243132917226305, "grad_norm": 0.07697343081235886, "learning_rate": 0.002788248587507295, "loss": 1.6282, "step": 28520 }, { "epoch": 0.08256300861183535, "grad_norm": 0.08481860160827637, "learning_rate": 0.0027879241169881186, "loss": 1.6265, "step": 28540 }, { "epoch": 0.08269468805140766, "grad_norm": 0.08266434073448181, "learning_rate": 0.0027875994169726526, "loss": 1.628, "step": 28560 }, { "epoch": 0.08282636749097996, "grad_norm": 0.07758313417434692, "learning_rate": 0.0027872744875187547, "loss": 1.6168, "step": 28580 }, { "epoch": 0.08295804693055227, "grad_norm": 0.07969856262207031, "learning_rate": 0.002786949328684325, "loss": 1.6218, "step": 28600 }, { "epoch": 0.08308972637012457, "grad_norm": 0.06928009539842606, "learning_rate": 0.002786623940527303, "loss": 1.614, "step": 28620 }, { "epoch": 0.08322140580969688, "grad_norm": 0.08013467490673065, "learning_rate": 0.0027862983231056707, "loss": 1.6131, "step": 28640 }, { "epoch": 0.08335308524926918, "grad_norm": 0.07733161002397537, "learning_rate": 0.0027859724764774494, "loss": 1.6108, "step": 28660 }, { "epoch": 0.08348476468884149, "grad_norm": 0.10586979240179062, "learning_rate": 0.0027856464007007028, "loss": 1.6141, "step": 28680 }, { "epoch": 0.08361644412841379, "grad_norm": 0.07554934173822403, "learning_rate": 0.002785320095833534, "loss": 1.6104, "step": 28700 }, { "epoch": 0.0837481235679861, "grad_norm": 0.08737286925315857, "learning_rate": 0.0027849935619340873, "loss": 1.6126, "step": 28720 }, { "epoch": 0.0838798030075584, "grad_norm": 0.07767580449581146, "learning_rate": 0.002784666799060549, "loss": 1.6056, "step": 28740 }, { "epoch": 0.0840114824471307, "grad_norm": 0.09215500950813293, "learning_rate": 0.0027843398072711447, "loss": 1.605, "step": 28760 }, { "epoch": 0.08414316188670301, "grad_norm": 0.09147578477859497, "learning_rate": 0.002784012586624141, "loss": 1.6081, "step": 28780 }, { "epoch": 0.08427484132627532, "grad_norm": 0.09132102876901627, "learning_rate": 0.002783685137177846, "loss": 1.6054, "step": 28800 }, { "epoch": 0.08440652076584762, "grad_norm": 0.09715555608272552, "learning_rate": 0.0027833574589906087, "loss": 1.6011, "step": 28820 }, { "epoch": 0.08453820020541992, "grad_norm": 0.09655196219682693, "learning_rate": 0.0027830295521208176, "loss": 1.602, "step": 28840 }, { "epoch": 0.08466987964499223, "grad_norm": 0.09575804322957993, "learning_rate": 0.002782701416626903, "loss": 1.606, "step": 28860 }, { "epoch": 0.08480155908456453, "grad_norm": 0.08992674201726913, "learning_rate": 0.002782373052567336, "loss": 1.6016, "step": 28880 }, { "epoch": 0.08493323852413684, "grad_norm": 0.13212674856185913, "learning_rate": 0.002782044460000627, "loss": 1.6017, "step": 28900 }, { "epoch": 0.08506491796370914, "grad_norm": 0.08106255531311035, "learning_rate": 0.002781715638985329, "loss": 1.6053, "step": 28920 }, { "epoch": 0.08519659740328145, "grad_norm": 0.09823165833950043, "learning_rate": 0.002781386589580035, "loss": 1.6067, "step": 28940 }, { "epoch": 0.08532827684285375, "grad_norm": 0.07196325063705444, "learning_rate": 0.002781057311843379, "loss": 1.6017, "step": 28960 }, { "epoch": 0.08545995628242606, "grad_norm": 0.0797024518251419, "learning_rate": 0.0027807278058340334, "loss": 1.6051, "step": 28980 }, { "epoch": 0.08559163572199836, "grad_norm": 0.08300334960222244, "learning_rate": 0.0027803980716107147, "loss": 1.6088, "step": 29000 }, { "epoch": 0.08559163572199836, "eval_loss": 1.4939472675323486, "eval_runtime": 71.0831, "eval_samples_per_second": 14.068, "eval_steps_per_second": 14.068, "step": 29000 }, { "epoch": 0.08572331516157067, "grad_norm": 0.07488060742616653, "learning_rate": 0.0027800681092321785, "loss": 1.6085, "step": 29020 }, { "epoch": 0.08585499460114297, "grad_norm": 0.07563740015029907, "learning_rate": 0.0027797379187572205, "loss": 1.6419, "step": 29040 }, { "epoch": 0.08598667404071528, "grad_norm": 0.07274390012025833, "learning_rate": 0.0027794075002446775, "loss": 1.6611, "step": 29060 }, { "epoch": 0.08611835348028758, "grad_norm": 0.07751382887363434, "learning_rate": 0.0027790768537534283, "loss": 1.6802, "step": 29080 }, { "epoch": 0.08625003291985989, "grad_norm": 0.08200586587190628, "learning_rate": 0.0027787459793423897, "loss": 1.6833, "step": 29100 }, { "epoch": 0.08638171235943219, "grad_norm": 0.07423494756221771, "learning_rate": 0.002778414877070521, "loss": 1.6816, "step": 29120 }, { "epoch": 0.08651339179900451, "grad_norm": 0.09629736840724945, "learning_rate": 0.002778083546996822, "loss": 1.6779, "step": 29140 }, { "epoch": 0.08664507123857682, "grad_norm": 0.09053540974855423, "learning_rate": 0.002777751989180333, "loss": 1.6756, "step": 29160 }, { "epoch": 0.08677675067814912, "grad_norm": 0.08008238673210144, "learning_rate": 0.0027774202036801323, "loss": 1.6745, "step": 29180 }, { "epoch": 0.08690843011772142, "grad_norm": 0.07499855756759644, "learning_rate": 0.0027770881905553432, "loss": 1.669, "step": 29200 }, { "epoch": 0.08704010955729373, "grad_norm": 0.08784040063619614, "learning_rate": 0.002776755949865127, "loss": 1.6681, "step": 29220 }, { "epoch": 0.08717178899686603, "grad_norm": 0.10526277124881744, "learning_rate": 0.0027764234816686864, "loss": 1.6645, "step": 29240 }, { "epoch": 0.08730346843643834, "grad_norm": 0.08847960829734802, "learning_rate": 0.0027760907860252624, "loss": 1.659, "step": 29260 }, { "epoch": 0.08743514787601064, "grad_norm": 0.09215822070837021, "learning_rate": 0.00277575786299414, "loss": 1.6612, "step": 29280 }, { "epoch": 0.08756682731558295, "grad_norm": 0.08477826416492462, "learning_rate": 0.002775424712634642, "loss": 1.6656, "step": 29300 }, { "epoch": 0.08769850675515525, "grad_norm": 0.07661165297031403, "learning_rate": 0.002775091335006134, "loss": 1.6627, "step": 29320 }, { "epoch": 0.08783018619472756, "grad_norm": 0.06484279781579971, "learning_rate": 0.0027747577301680195, "loss": 1.6595, "step": 29340 }, { "epoch": 0.08796186563429986, "grad_norm": 0.0724259540438652, "learning_rate": 0.0027744238981797452, "loss": 1.6561, "step": 29360 }, { "epoch": 0.08809354507387217, "grad_norm": 0.07707709074020386, "learning_rate": 0.0027740898391007958, "loss": 1.6538, "step": 29380 }, { "epoch": 0.08822522451344447, "grad_norm": 0.08440696448087692, "learning_rate": 0.002773755552990697, "loss": 1.6546, "step": 29400 }, { "epoch": 0.08835690395301678, "grad_norm": 0.07948070019483566, "learning_rate": 0.0027734210399090174, "loss": 1.6462, "step": 29420 }, { "epoch": 0.08848858339258908, "grad_norm": 0.08475562930107117, "learning_rate": 0.002773086299915363, "loss": 1.6494, "step": 29440 }, { "epoch": 0.08862026283216139, "grad_norm": 0.0809844508767128, "learning_rate": 0.0027727513330693815, "loss": 1.6581, "step": 29460 }, { "epoch": 0.08875194227173369, "grad_norm": 0.07043874263763428, "learning_rate": 0.002772416139430761, "loss": 1.6499, "step": 29480 }, { "epoch": 0.088883621711306, "grad_norm": 0.079310841858387, "learning_rate": 0.0027720807190592302, "loss": 1.6508, "step": 29500 }, { "epoch": 0.0890153011508783, "grad_norm": 0.07824884355068207, "learning_rate": 0.002771745072014558, "loss": 1.6486, "step": 29520 }, { "epoch": 0.0891469805904506, "grad_norm": 0.06876828521490097, "learning_rate": 0.0027714091983565524, "loss": 1.6493, "step": 29540 }, { "epoch": 0.08927866003002291, "grad_norm": 0.09782326221466064, "learning_rate": 0.0027710730981450643, "loss": 1.654, "step": 29560 }, { "epoch": 0.08941033946959522, "grad_norm": 0.08521437644958496, "learning_rate": 0.0027707367714399837, "loss": 1.6469, "step": 29580 }, { "epoch": 0.08954201890916752, "grad_norm": 0.07844710350036621, "learning_rate": 0.0027704002183012405, "loss": 1.6494, "step": 29600 }, { "epoch": 0.08967369834873982, "grad_norm": 0.09010956436395645, "learning_rate": 0.002770063438788805, "loss": 1.6534, "step": 29620 }, { "epoch": 0.08980537778831213, "grad_norm": 0.07454434037208557, "learning_rate": 0.002769726432962689, "loss": 1.668, "step": 29640 }, { "epoch": 0.08993705722788443, "grad_norm": 0.09403835237026215, "learning_rate": 0.0027693892008829437, "loss": 1.6764, "step": 29660 }, { "epoch": 0.09006873666745674, "grad_norm": 0.09171565622091293, "learning_rate": 0.0027690517426096606, "loss": 1.6795, "step": 29680 }, { "epoch": 0.09020041610702904, "grad_norm": 0.08323973417282104, "learning_rate": 0.0027687140582029713, "loss": 1.6813, "step": 29700 }, { "epoch": 0.09033209554660135, "grad_norm": 0.06903329491615295, "learning_rate": 0.0027683761477230485, "loss": 1.6718, "step": 29720 }, { "epoch": 0.09046377498617365, "grad_norm": 0.06989486515522003, "learning_rate": 0.002768038011230105, "loss": 1.6684, "step": 29740 }, { "epoch": 0.09059545442574596, "grad_norm": 0.08322389423847198, "learning_rate": 0.002767699648784393, "loss": 1.6708, "step": 29760 }, { "epoch": 0.09072713386531826, "grad_norm": 0.09357618540525436, "learning_rate": 0.002767361060446206, "loss": 1.6716, "step": 29780 }, { "epoch": 0.09085881330489057, "grad_norm": 0.08602355420589447, "learning_rate": 0.0027670222462758774, "loss": 1.6658, "step": 29800 }, { "epoch": 0.09099049274446289, "grad_norm": 0.07419178634881973, "learning_rate": 0.0027666832063337806, "loss": 1.6682, "step": 29820 }, { "epoch": 0.09112217218403519, "grad_norm": 0.09919148683547974, "learning_rate": 0.0027663439406803293, "loss": 1.6616, "step": 29840 }, { "epoch": 0.0912538516236075, "grad_norm": 0.07616308331489563, "learning_rate": 0.002766004449375978, "loss": 1.661, "step": 29860 }, { "epoch": 0.0913855310631798, "grad_norm": 0.0842098742723465, "learning_rate": 0.002765664732481221, "loss": 1.6573, "step": 29880 }, { "epoch": 0.0915172105027521, "grad_norm": 0.09518759697675705, "learning_rate": 0.002765324790056592, "loss": 1.6638, "step": 29900 }, { "epoch": 0.09164888994232441, "grad_norm": 0.07474862039089203, "learning_rate": 0.002764984622162666, "loss": 1.66, "step": 29920 }, { "epoch": 0.09178056938189671, "grad_norm": 0.17661775648593903, "learning_rate": 0.0027646442288600578, "loss": 1.6541, "step": 29940 }, { "epoch": 0.09191224882146902, "grad_norm": 0.1082674190402031, "learning_rate": 0.002764303610209422, "loss": 1.6583, "step": 29960 }, { "epoch": 0.09204392826104132, "grad_norm": 0.0656692162156105, "learning_rate": 0.0027639627662714547, "loss": 1.6548, "step": 29980 }, { "epoch": 0.09217560770061363, "grad_norm": 0.06664387881755829, "learning_rate": 0.0027636216971068904, "loss": 1.6536, "step": 30000 }, { "epoch": 0.09217560770061363, "eval_loss": 1.593057632446289, "eval_runtime": 66.8776, "eval_samples_per_second": 14.953, "eval_steps_per_second": 14.953, "step": 30000 }, { "epoch": 0.09230728714018593, "grad_norm": 0.11122573167085648, "learning_rate": 0.0027632804027765048, "loss": 1.6526, "step": 30020 }, { "epoch": 0.09243896657975824, "grad_norm": 0.08378654718399048, "learning_rate": 0.0027629388833411133, "loss": 1.6516, "step": 30040 }, { "epoch": 0.09257064601933054, "grad_norm": 0.0903952419757843, "learning_rate": 0.0027625971388615714, "loss": 1.6495, "step": 30060 }, { "epoch": 0.09270232545890285, "grad_norm": 0.10157206654548645, "learning_rate": 0.002762255169398775, "loss": 1.6479, "step": 30080 }, { "epoch": 0.09283400489847515, "grad_norm": 0.06507019698619843, "learning_rate": 0.00276191297501366, "loss": 1.651, "step": 30100 }, { "epoch": 0.09296568433804746, "grad_norm": 0.07820893824100494, "learning_rate": 0.0027615705557672023, "loss": 1.6566, "step": 30120 }, { "epoch": 0.09309736377761976, "grad_norm": 0.07816014438867569, "learning_rate": 0.002761227911720418, "loss": 1.6532, "step": 30140 }, { "epoch": 0.09322904321719207, "grad_norm": 0.10330802947282791, "learning_rate": 0.002760885042934363, "loss": 1.6467, "step": 30160 }, { "epoch": 0.09336072265676437, "grad_norm": 0.07946458458900452, "learning_rate": 0.0027605419494701328, "loss": 1.651, "step": 30180 }, { "epoch": 0.09349240209633668, "grad_norm": 0.08045420050621033, "learning_rate": 0.002760198631388864, "loss": 1.6483, "step": 30200 }, { "epoch": 0.09362408153590898, "grad_norm": 0.08808773756027222, "learning_rate": 0.0027598550887517333, "loss": 1.6419, "step": 30220 }, { "epoch": 0.09375576097548129, "grad_norm": 0.12588857114315033, "learning_rate": 0.002759511321619956, "loss": 1.6357, "step": 30240 }, { "epoch": 0.09388744041505359, "grad_norm": 0.07971849292516708, "learning_rate": 0.002759167330054789, "loss": 1.6015, "step": 30260 }, { "epoch": 0.0940191198546259, "grad_norm": 0.09091313183307648, "learning_rate": 0.002758823114117527, "loss": 1.6004, "step": 30280 }, { "epoch": 0.0941507992941982, "grad_norm": 0.0841759741306305, "learning_rate": 0.0027584786738695083, "loss": 1.5936, "step": 30300 }, { "epoch": 0.0942824787337705, "grad_norm": 0.09897656738758087, "learning_rate": 0.0027581340093721075, "loss": 1.5878, "step": 30320 }, { "epoch": 0.09441415817334281, "grad_norm": 0.09095700830221176, "learning_rate": 0.002757789120686741, "loss": 1.5916, "step": 30340 }, { "epoch": 0.09454583761291512, "grad_norm": 0.07832010090351105, "learning_rate": 0.0027574440078748648, "loss": 1.589, "step": 30360 }, { "epoch": 0.09467751705248742, "grad_norm": 0.07373721152544022, "learning_rate": 0.0027570986709979746, "loss": 1.5799, "step": 30380 }, { "epoch": 0.09480919649205972, "grad_norm": 0.07081932574510574, "learning_rate": 0.002756753110117607, "loss": 1.5791, "step": 30400 }, { "epoch": 0.09494087593163203, "grad_norm": 0.08223600685596466, "learning_rate": 0.0027564073252953373, "loss": 1.5766, "step": 30420 }, { "epoch": 0.09507255537120433, "grad_norm": 0.08098476380109787, "learning_rate": 0.002756061316592781, "loss": 1.5818, "step": 30440 }, { "epoch": 0.09520423481077664, "grad_norm": 0.07812890410423279, "learning_rate": 0.002755715084071594, "loss": 1.5761, "step": 30460 }, { "epoch": 0.09533591425034894, "grad_norm": 0.07554410398006439, "learning_rate": 0.002755368627793472, "loss": 1.5781, "step": 30480 }, { "epoch": 0.09546759368992126, "grad_norm": 0.08680091798305511, "learning_rate": 0.002755021947820149, "loss": 1.5784, "step": 30500 }, { "epoch": 0.09559927312949357, "grad_norm": 0.08017537742853165, "learning_rate": 0.002754675044213402, "loss": 1.578, "step": 30520 }, { "epoch": 0.09573095256906587, "grad_norm": 0.08503107726573944, "learning_rate": 0.002754327917035045, "loss": 1.5727, "step": 30540 }, { "epoch": 0.09586263200863818, "grad_norm": 0.09204825013875961, "learning_rate": 0.002753980566346934, "loss": 1.5775, "step": 30560 }, { "epoch": 0.09599431144821048, "grad_norm": 0.07686753571033478, "learning_rate": 0.0027536329922109616, "loss": 1.5747, "step": 30580 }, { "epoch": 0.09612599088778279, "grad_norm": 0.08408256620168686, "learning_rate": 0.002753285194689064, "loss": 1.5722, "step": 30600 }, { "epoch": 0.09625767032735509, "grad_norm": 0.09992122650146484, "learning_rate": 0.0027529371738432154, "loss": 1.5725, "step": 30620 }, { "epoch": 0.0963893497669274, "grad_norm": 0.07421014457941055, "learning_rate": 0.0027525889297354295, "loss": 1.5709, "step": 30640 }, { "epoch": 0.0965210292064997, "grad_norm": 0.08402437716722488, "learning_rate": 0.0027522404624277606, "loss": 1.5711, "step": 30660 }, { "epoch": 0.096652708646072, "grad_norm": 0.10464178025722504, "learning_rate": 0.0027518917719823017, "loss": 1.5724, "step": 30680 }, { "epoch": 0.09678438808564431, "grad_norm": 0.09930146485567093, "learning_rate": 0.002751542858461187, "loss": 1.5768, "step": 30700 }, { "epoch": 0.09691606752521661, "grad_norm": 0.08711190521717072, "learning_rate": 0.0027511937219265896, "loss": 1.5783, "step": 30720 }, { "epoch": 0.09704774696478892, "grad_norm": 0.07746979594230652, "learning_rate": 0.0027508443624407217, "loss": 1.5724, "step": 30740 }, { "epoch": 0.09717942640436122, "grad_norm": 0.09594020992517471, "learning_rate": 0.0027504947800658366, "loss": 1.5755, "step": 30760 }, { "epoch": 0.09731110584393353, "grad_norm": 0.0837220624089241, "learning_rate": 0.002750144974864227, "loss": 1.5692, "step": 30780 }, { "epoch": 0.09744278528350583, "grad_norm": 0.07753045111894608, "learning_rate": 0.0027497949468982237, "loss": 1.5723, "step": 30800 }, { "epoch": 0.09757446472307814, "grad_norm": 0.0966426357626915, "learning_rate": 0.0027494446962302004, "loss": 1.5948, "step": 30820 }, { "epoch": 0.09770614416265044, "grad_norm": 0.0724552646279335, "learning_rate": 0.002749094222922567, "loss": 1.6, "step": 30840 }, { "epoch": 0.09783782360222275, "grad_norm": 0.07575785368680954, "learning_rate": 0.002748743527037775, "loss": 1.6046, "step": 30860 }, { "epoch": 0.09796950304179505, "grad_norm": 0.10300685465335846, "learning_rate": 0.0027483926086383156, "loss": 1.6014, "step": 30880 }, { "epoch": 0.09810118248136736, "grad_norm": 0.07341894507408142, "learning_rate": 0.0027480414677867188, "loss": 1.6002, "step": 30900 }, { "epoch": 0.09823286192093966, "grad_norm": 0.09823710471391678, "learning_rate": 0.002747690104545555, "loss": 1.5955, "step": 30920 }, { "epoch": 0.09836454136051197, "grad_norm": 0.08126625418663025, "learning_rate": 0.0027473385189774337, "loss": 1.5951, "step": 30940 }, { "epoch": 0.09849622080008427, "grad_norm": 0.08654072135686874, "learning_rate": 0.0027469867111450043, "loss": 1.592, "step": 30960 }, { "epoch": 0.09862790023965658, "grad_norm": 0.08610561490058899, "learning_rate": 0.002746634681110956, "loss": 1.5866, "step": 30980 }, { "epoch": 0.09875957967922888, "grad_norm": 0.10982340574264526, "learning_rate": 0.0027462824289380167, "loss": 1.5916, "step": 31000 }, { "epoch": 0.09875957967922888, "eval_loss": 1.4958887100219727, "eval_runtime": 65.9246, "eval_samples_per_second": 15.169, "eval_steps_per_second": 15.169, "step": 31000 }, { "epoch": 0.09889125911880119, "grad_norm": 0.08077514916658401, "learning_rate": 0.002745929954688955, "loss": 1.5905, "step": 31020 }, { "epoch": 0.09902293855837349, "grad_norm": 0.08327169716358185, "learning_rate": 0.0027455772584265782, "loss": 1.5853, "step": 31040 }, { "epoch": 0.0991546179979458, "grad_norm": 0.07334230840206146, "learning_rate": 0.0027452243402137345, "loss": 1.5903, "step": 31060 }, { "epoch": 0.0992862974375181, "grad_norm": 0.0786149725317955, "learning_rate": 0.0027448712001133095, "loss": 1.5844, "step": 31080 }, { "epoch": 0.0994179768770904, "grad_norm": 0.08628056943416595, "learning_rate": 0.00274451783818823, "loss": 1.5821, "step": 31100 }, { "epoch": 0.09954965631666271, "grad_norm": 0.09965677559375763, "learning_rate": 0.0027441642545014623, "loss": 1.5788, "step": 31120 }, { "epoch": 0.09968133575623501, "grad_norm": 0.09084340184926987, "learning_rate": 0.002743810449116011, "loss": 1.5821, "step": 31140 }, { "epoch": 0.09981301519580732, "grad_norm": 0.08165693283081055, "learning_rate": 0.002743456422094922, "loss": 1.5779, "step": 31160 }, { "epoch": 0.09994469463537964, "grad_norm": 0.08033919334411621, "learning_rate": 0.002743102173501278, "loss": 1.5799, "step": 31180 }, { "epoch": 0.10007637407495194, "grad_norm": 0.09969887882471085, "learning_rate": 0.0027427477033982045, "loss": 1.577, "step": 31200 }, { "epoch": 0.10020805351452425, "grad_norm": 0.08198243379592896, "learning_rate": 0.0027423930118488644, "loss": 1.5756, "step": 31220 }, { "epoch": 0.10033973295409655, "grad_norm": 0.08875197172164917, "learning_rate": 0.00274203809891646, "loss": 1.5766, "step": 31240 }, { "epoch": 0.10047141239366886, "grad_norm": 0.07156415283679962, "learning_rate": 0.002741682964664234, "loss": 1.5795, "step": 31260 }, { "epoch": 0.10060309183324116, "grad_norm": 0.1065966859459877, "learning_rate": 0.0027413276091554683, "loss": 1.5865, "step": 31280 }, { "epoch": 0.10073477127281347, "grad_norm": 0.08343872427940369, "learning_rate": 0.0027409720324534834, "loss": 1.58, "step": 31300 }, { "epoch": 0.10086645071238577, "grad_norm": 0.08024212718009949, "learning_rate": 0.00274061623462164, "loss": 1.5828, "step": 31320 }, { "epoch": 0.10099813015195808, "grad_norm": 0.08566683530807495, "learning_rate": 0.0027402602157233376, "loss": 1.5695, "step": 31340 }, { "epoch": 0.10112980959153038, "grad_norm": 0.08198649436235428, "learning_rate": 0.002739903975822016, "loss": 1.5811, "step": 31360 }, { "epoch": 0.10126148903110269, "grad_norm": 0.10375852882862091, "learning_rate": 0.0027395475149811542, "loss": 1.5786, "step": 31380 }, { "epoch": 0.10139316847067499, "grad_norm": 0.11077110469341278, "learning_rate": 0.0027391908332642704, "loss": 1.5964, "step": 31400 }, { "epoch": 0.1015248479102473, "grad_norm": 0.08183398842811584, "learning_rate": 0.0027388339307349205, "loss": 1.6251, "step": 31420 }, { "epoch": 0.1016565273498196, "grad_norm": 0.08363300561904907, "learning_rate": 0.002738476807456703, "loss": 1.6606, "step": 31440 }, { "epoch": 0.1017882067893919, "grad_norm": 0.07447555661201477, "learning_rate": 0.0027381194634932536, "loss": 1.6706, "step": 31460 }, { "epoch": 0.10191988622896421, "grad_norm": 0.10050380229949951, "learning_rate": 0.0027377618989082465, "loss": 1.6575, "step": 31480 }, { "epoch": 0.10205156566853651, "grad_norm": 0.07040868699550629, "learning_rate": 0.002737404113765398, "loss": 1.6624, "step": 31500 }, { "epoch": 0.10218324510810882, "grad_norm": 0.08749683946371078, "learning_rate": 0.002737046108128461, "loss": 1.6537, "step": 31520 }, { "epoch": 0.10231492454768112, "grad_norm": 0.09317103773355484, "learning_rate": 0.00273668788206123, "loss": 1.6564, "step": 31540 }, { "epoch": 0.10244660398725343, "grad_norm": 0.07827817648649216, "learning_rate": 0.0027363294356275367, "loss": 1.6535, "step": 31560 }, { "epoch": 0.10257828342682573, "grad_norm": 0.08093781024217606, "learning_rate": 0.002735970768891253, "loss": 1.643, "step": 31580 }, { "epoch": 0.10270996286639804, "grad_norm": 0.08157644420862198, "learning_rate": 0.00273561188191629, "loss": 1.6449, "step": 31600 }, { "epoch": 0.10284164230597034, "grad_norm": 0.09422040730714798, "learning_rate": 0.0027352527747665986, "loss": 1.6457, "step": 31620 }, { "epoch": 0.10297332174554265, "grad_norm": 0.08076277375221252, "learning_rate": 0.0027348934475061684, "loss": 1.641, "step": 31640 }, { "epoch": 0.10310500118511495, "grad_norm": 0.09262409806251526, "learning_rate": 0.0027345339001990272, "loss": 1.6404, "step": 31660 }, { "epoch": 0.10323668062468726, "grad_norm": 0.08169291168451309, "learning_rate": 0.0027341741329092446, "loss": 1.6405, "step": 31680 }, { "epoch": 0.10336836006425956, "grad_norm": 0.07819892466068268, "learning_rate": 0.002733814145700927, "loss": 1.6315, "step": 31700 }, { "epoch": 0.10350003950383187, "grad_norm": 0.07450778037309647, "learning_rate": 0.00273345393863822, "loss": 1.6268, "step": 31720 }, { "epoch": 0.10363171894340417, "grad_norm": 0.08458829671144485, "learning_rate": 0.0027330935117853106, "loss": 1.6344, "step": 31740 }, { "epoch": 0.10376339838297648, "grad_norm": 0.07392025738954544, "learning_rate": 0.0027327328652064233, "loss": 1.6322, "step": 31760 }, { "epoch": 0.10389507782254878, "grad_norm": 0.09063839167356491, "learning_rate": 0.002732371998965821, "loss": 1.636, "step": 31780 }, { "epoch": 0.10402675726212109, "grad_norm": 0.09151460975408554, "learning_rate": 0.002732010913127808, "loss": 1.6305, "step": 31800 }, { "epoch": 0.10415843670169339, "grad_norm": 0.07469334453344345, "learning_rate": 0.002731649607756726, "loss": 1.6291, "step": 31820 }, { "epoch": 0.10429011614126571, "grad_norm": 0.07378929853439331, "learning_rate": 0.0027312880829169564, "loss": 1.6337, "step": 31840 }, { "epoch": 0.10442179558083801, "grad_norm": 0.08763482421636581, "learning_rate": 0.002730926338672919, "loss": 1.6221, "step": 31860 }, { "epoch": 0.10455347502041032, "grad_norm": 0.09730922430753708, "learning_rate": 0.0027305643750890744, "loss": 1.6251, "step": 31880 }, { "epoch": 0.10468515445998262, "grad_norm": 0.0719449371099472, "learning_rate": 0.0027302021922299205, "loss": 1.6316, "step": 31900 }, { "epoch": 0.10481683389955493, "grad_norm": 0.08451465517282486, "learning_rate": 0.0027298397901599947, "loss": 1.6271, "step": 31920 }, { "epoch": 0.10494851333912723, "grad_norm": 0.07725101709365845, "learning_rate": 0.0027294771689438746, "loss": 1.6333, "step": 31940 }, { "epoch": 0.10508019277869954, "grad_norm": 0.10085799545049667, "learning_rate": 0.0027291143286461753, "loss": 1.6231, "step": 31960 }, { "epoch": 0.10521187221827184, "grad_norm": 0.10356923937797546, "learning_rate": 0.002728751269331552, "loss": 1.6268, "step": 31980 }, { "epoch": 0.10534355165784415, "grad_norm": 0.0808652937412262, "learning_rate": 0.0027283879910646983, "loss": 1.6371, "step": 32000 }, { "epoch": 0.10534355165784415, "eval_loss": 1.5755228996276855, "eval_runtime": 66.1417, "eval_samples_per_second": 15.119, "eval_steps_per_second": 15.119, "step": 32000 }, { "epoch": 0.10547523109741645, "grad_norm": 0.10892391949892044, "learning_rate": 0.002728024493910347, "loss": 1.6455, "step": 32020 }, { "epoch": 0.10560691053698876, "grad_norm": 0.08325547724962234, "learning_rate": 0.00272766077793327, "loss": 1.6526, "step": 32040 }, { "epoch": 0.10573858997656106, "grad_norm": 0.10805673897266388, "learning_rate": 0.0027272968431982787, "loss": 1.6663, "step": 32060 }, { "epoch": 0.10587026941613337, "grad_norm": 0.09780491143465042, "learning_rate": 0.0027269326897702223, "loss": 1.6522, "step": 32080 }, { "epoch": 0.10600194885570567, "grad_norm": 0.09470649063587189, "learning_rate": 0.0027265683177139896, "loss": 1.6546, "step": 32100 }, { "epoch": 0.10613362829527798, "grad_norm": 0.07851683348417282, "learning_rate": 0.002726203727094509, "loss": 1.6458, "step": 32120 }, { "epoch": 0.10626530773485028, "grad_norm": 0.0761096403002739, "learning_rate": 0.0027258389179767467, "loss": 1.6525, "step": 32140 }, { "epoch": 0.10639698717442259, "grad_norm": 0.1286764144897461, "learning_rate": 0.0027254738904257084, "loss": 1.6486, "step": 32160 }, { "epoch": 0.10652866661399489, "grad_norm": 0.0972808375954628, "learning_rate": 0.002725108644506438, "loss": 1.6394, "step": 32180 }, { "epoch": 0.1066603460535672, "grad_norm": 0.07394243031740189, "learning_rate": 0.0027247431802840207, "loss": 1.6393, "step": 32200 }, { "epoch": 0.1067920254931395, "grad_norm": 0.07845206558704376, "learning_rate": 0.0027243774978235775, "loss": 1.6381, "step": 32220 }, { "epoch": 0.1069237049327118, "grad_norm": 0.07898611575365067, "learning_rate": 0.00272401159719027, "loss": 1.6394, "step": 32240 }, { "epoch": 0.10705538437228411, "grad_norm": 0.08906087279319763, "learning_rate": 0.002723645478449298, "loss": 1.6368, "step": 32260 }, { "epoch": 0.10718706381185641, "grad_norm": 0.0694982185959816, "learning_rate": 0.0027232791416659016, "loss": 1.6367, "step": 32280 }, { "epoch": 0.10731874325142872, "grad_norm": 0.07341042160987854, "learning_rate": 0.0027229125869053577, "loss": 1.6301, "step": 32300 }, { "epoch": 0.10745042269100102, "grad_norm": 0.1038580909371376, "learning_rate": 0.0027225458142329834, "loss": 1.6339, "step": 32320 }, { "epoch": 0.10758210213057333, "grad_norm": 0.09001409262418747, "learning_rate": 0.002722178823714134, "loss": 1.6368, "step": 32340 }, { "epoch": 0.10771378157014563, "grad_norm": 0.07618994265794754, "learning_rate": 0.0027218116154142037, "loss": 1.6209, "step": 32360 }, { "epoch": 0.10784546100971794, "grad_norm": 0.08030746132135391, "learning_rate": 0.0027214441893986256, "loss": 1.6342, "step": 32380 }, { "epoch": 0.10797714044929024, "grad_norm": 0.07523296028375626, "learning_rate": 0.0027210765457328723, "loss": 1.6318, "step": 32400 }, { "epoch": 0.10810881988886255, "grad_norm": 0.08324859291315079, "learning_rate": 0.0027207086844824543, "loss": 1.6366, "step": 32420 }, { "epoch": 0.10824049932843485, "grad_norm": 0.09114082902669907, "learning_rate": 0.002720340605712921, "loss": 1.6323, "step": 32440 }, { "epoch": 0.10837217876800716, "grad_norm": 0.14000263810157776, "learning_rate": 0.0027199723094898606, "loss": 1.6284, "step": 32460 }, { "epoch": 0.10850385820757946, "grad_norm": 0.09753448516130447, "learning_rate": 0.0027196037958789002, "loss": 1.633, "step": 32480 }, { "epoch": 0.10863553764715177, "grad_norm": 0.09878184646368027, "learning_rate": 0.0027192350649457055, "loss": 1.6316, "step": 32500 }, { "epoch": 0.10876721708672409, "grad_norm": 0.08344288915395737, "learning_rate": 0.002718866116755981, "loss": 1.6188, "step": 32520 }, { "epoch": 0.10889889652629639, "grad_norm": 0.09065096825361252, "learning_rate": 0.00271849695137547, "loss": 1.6279, "step": 32540 }, { "epoch": 0.1090305759658687, "grad_norm": 0.08262189477682114, "learning_rate": 0.002718127568869954, "loss": 1.6301, "step": 32560 }, { "epoch": 0.109162255405441, "grad_norm": 0.11573157459497452, "learning_rate": 0.002717757969305254, "loss": 1.6204, "step": 32580 }, { "epoch": 0.1092939348450133, "grad_norm": 0.09369558840990067, "learning_rate": 0.002717388152747229, "loss": 1.6258, "step": 32600 }, { "epoch": 0.10942561428458561, "grad_norm": 0.08298981189727783, "learning_rate": 0.0027170181192617774, "loss": 1.597, "step": 32620 }, { "epoch": 0.10955729372415791, "grad_norm": 0.0729466900229454, "learning_rate": 0.0027166478689148355, "loss": 1.5801, "step": 32640 }, { "epoch": 0.10968897316373022, "grad_norm": 0.08472312241792679, "learning_rate": 0.002716277401772378, "loss": 1.574, "step": 32660 }, { "epoch": 0.10982065260330252, "grad_norm": 0.08250225335359573, "learning_rate": 0.00271590671790042, "loss": 1.5731, "step": 32680 }, { "epoch": 0.10995233204287483, "grad_norm": 0.07867790013551712, "learning_rate": 0.0027155358173650123, "loss": 1.5637, "step": 32700 }, { "epoch": 0.11008401148244713, "grad_norm": 0.10871689021587372, "learning_rate": 0.002715164700232247, "loss": 1.5652, "step": 32720 }, { "epoch": 0.11021569092201944, "grad_norm": 0.09244067221879959, "learning_rate": 0.002714793366568254, "loss": 1.564, "step": 32740 }, { "epoch": 0.11034737036159174, "grad_norm": 0.10256188362836838, "learning_rate": 0.0027144218164392012, "loss": 1.5575, "step": 32760 }, { "epoch": 0.11047904980116405, "grad_norm": 0.10790042579174042, "learning_rate": 0.0027140500499112956, "loss": 1.5585, "step": 32780 }, { "epoch": 0.11061072924073635, "grad_norm": 0.07326998561620712, "learning_rate": 0.002713678067050782, "loss": 1.5602, "step": 32800 }, { "epoch": 0.11074240868030866, "grad_norm": 0.12128879874944687, "learning_rate": 0.0027133058679239446, "loss": 1.5558, "step": 32820 }, { "epoch": 0.11087408811988096, "grad_norm": 0.0924782082438469, "learning_rate": 0.0027129334525971068, "loss": 1.5546, "step": 32840 }, { "epoch": 0.11100576755945327, "grad_norm": 0.10736776888370514, "learning_rate": 0.002712560821136628, "loss": 1.5555, "step": 32860 }, { "epoch": 0.11113744699902557, "grad_norm": 0.11395737528800964, "learning_rate": 0.0027121879736089097, "loss": 1.5535, "step": 32880 }, { "epoch": 0.11126912643859788, "grad_norm": 0.08395570516586304, "learning_rate": 0.0027118149100803877, "loss": 1.5501, "step": 32900 }, { "epoch": 0.11140080587817018, "grad_norm": 0.08537106215953827, "learning_rate": 0.0027114416306175397, "loss": 1.5457, "step": 32920 }, { "epoch": 0.11153248531774249, "grad_norm": 0.06968770921230316, "learning_rate": 0.002711068135286881, "loss": 1.5526, "step": 32940 }, { "epoch": 0.11166416475731479, "grad_norm": 0.10123132914304733, "learning_rate": 0.0027106944241549647, "loss": 1.5524, "step": 32960 }, { "epoch": 0.1117958441968871, "grad_norm": 0.11128298938274384, "learning_rate": 0.0027103204972883824, "loss": 1.5412, "step": 32980 }, { "epoch": 0.1119275236364594, "grad_norm": 0.08465181291103363, "learning_rate": 0.002709946354753765, "loss": 1.5507, "step": 33000 }, { "epoch": 0.1119275236364594, "eval_loss": 1.6168590784072876, "eval_runtime": 66.027, "eval_samples_per_second": 15.145, "eval_steps_per_second": 15.145, "step": 33000 }, { "epoch": 0.1120592030760317, "grad_norm": 0.09486215561628342, "learning_rate": 0.0027095719966177805, "loss": 1.5482, "step": 33020 }, { "epoch": 0.11219088251560401, "grad_norm": 0.09311071038246155, "learning_rate": 0.0027091974229471365, "loss": 1.5502, "step": 33040 }, { "epoch": 0.11232256195517631, "grad_norm": 0.16168630123138428, "learning_rate": 0.002708822633808579, "loss": 1.5475, "step": 33060 }, { "epoch": 0.11245424139474862, "grad_norm": 0.09388844668865204, "learning_rate": 0.002708447629268891, "loss": 1.5533, "step": 33080 }, { "epoch": 0.11258592083432092, "grad_norm": 0.08351096510887146, "learning_rate": 0.002708072409394896, "loss": 1.5522, "step": 33100 }, { "epoch": 0.11271760027389323, "grad_norm": 0.07432214170694351, "learning_rate": 0.0027076969742534543, "loss": 1.5471, "step": 33120 }, { "epoch": 0.11284927971346553, "grad_norm": 0.09724659472703934, "learning_rate": 0.002707321323911465, "loss": 1.5502, "step": 33140 }, { "epoch": 0.11298095915303784, "grad_norm": 0.08879043906927109, "learning_rate": 0.0027069454584358658, "loss": 1.5441, "step": 33160 }, { "epoch": 0.11311263859261014, "grad_norm": 0.07506344467401505, "learning_rate": 0.0027065693778936316, "loss": 1.5691, "step": 33180 }, { "epoch": 0.11324431803218246, "grad_norm": 0.10346978157758713, "learning_rate": 0.0027061930823517777, "loss": 1.5975, "step": 33200 }, { "epoch": 0.11337599747175477, "grad_norm": 0.08535962551832199, "learning_rate": 0.002705816571877355, "loss": 1.6033, "step": 33220 }, { "epoch": 0.11350767691132707, "grad_norm": 0.10019640624523163, "learning_rate": 0.002705439846537456, "loss": 1.6107, "step": 33240 }, { "epoch": 0.11363935635089938, "grad_norm": 0.08656740933656693, "learning_rate": 0.002705062906399209, "loss": 1.6062, "step": 33260 }, { "epoch": 0.11377103579047168, "grad_norm": 0.10879825055599213, "learning_rate": 0.0027046857515297808, "loss": 1.6123, "step": 33280 }, { "epoch": 0.11390271523004399, "grad_norm": 0.11161535233259201, "learning_rate": 0.002704308381996377, "loss": 1.6132, "step": 33300 }, { "epoch": 0.11403439466961629, "grad_norm": 0.07457931339740753, "learning_rate": 0.002703930797866242, "loss": 1.6062, "step": 33320 }, { "epoch": 0.1141660741091886, "grad_norm": 0.08514375239610672, "learning_rate": 0.002703552999206657, "loss": 1.6045, "step": 33340 }, { "epoch": 0.1142977535487609, "grad_norm": 0.07797901332378387, "learning_rate": 0.0027031749860849438, "loss": 1.6044, "step": 33360 }, { "epoch": 0.1144294329883332, "grad_norm": 0.10032613575458527, "learning_rate": 0.0027027967585684597, "loss": 1.6016, "step": 33380 }, { "epoch": 0.11456111242790551, "grad_norm": 0.07706362754106522, "learning_rate": 0.0027024183167246012, "loss": 1.5949, "step": 33400 }, { "epoch": 0.11469279186747781, "grad_norm": 0.07698775827884674, "learning_rate": 0.0027020396606208036, "loss": 1.6026, "step": 33420 }, { "epoch": 0.11482447130705012, "grad_norm": 0.09712442755699158, "learning_rate": 0.00270166079032454, "loss": 1.5968, "step": 33440 }, { "epoch": 0.11495615074662242, "grad_norm": 0.0798928514122963, "learning_rate": 0.002701281705903321, "loss": 1.5939, "step": 33460 }, { "epoch": 0.11508783018619473, "grad_norm": 0.09378674626350403, "learning_rate": 0.002700902407424697, "loss": 1.5946, "step": 33480 }, { "epoch": 0.11521950962576703, "grad_norm": 0.1083533987402916, "learning_rate": 0.0027005228949562544, "loss": 1.5982, "step": 33500 }, { "epoch": 0.11535118906533934, "grad_norm": 0.09362529218196869, "learning_rate": 0.00270014316856562, "loss": 1.5938, "step": 33520 }, { "epoch": 0.11548286850491164, "grad_norm": 0.10311439633369446, "learning_rate": 0.002699763228320457, "loss": 1.5909, "step": 33540 }, { "epoch": 0.11561454794448395, "grad_norm": 0.07770277559757233, "learning_rate": 0.0026993830742884674, "loss": 1.5921, "step": 33560 }, { "epoch": 0.11574622738405625, "grad_norm": 0.08439300209283829, "learning_rate": 0.002699002706537391, "loss": 1.5847, "step": 33580 }, { "epoch": 0.11587790682362856, "grad_norm": 0.09440808743238449, "learning_rate": 0.0026986221251350056, "loss": 1.5852, "step": 33600 }, { "epoch": 0.11600958626320086, "grad_norm": 0.08001919090747833, "learning_rate": 0.0026982413301491277, "loss": 1.5938, "step": 33620 }, { "epoch": 0.11614126570277317, "grad_norm": 0.11483153700828552, "learning_rate": 0.002697860321647611, "loss": 1.5927, "step": 33640 }, { "epoch": 0.11627294514234547, "grad_norm": 0.10114043205976486, "learning_rate": 0.0026974790996983486, "loss": 1.5898, "step": 33660 }, { "epoch": 0.11640462458191778, "grad_norm": 0.08223793655633926, "learning_rate": 0.002697097664369271, "loss": 1.5898, "step": 33680 }, { "epoch": 0.11653630402149008, "grad_norm": 0.0857810378074646, "learning_rate": 0.002696716015728345, "loss": 1.5936, "step": 33700 }, { "epoch": 0.11666798346106239, "grad_norm": 0.12150619924068451, "learning_rate": 0.0026963341538435775, "loss": 1.587, "step": 33720 }, { "epoch": 0.11679966290063469, "grad_norm": 0.09355217963457108, "learning_rate": 0.0026959520787830133, "loss": 1.5856, "step": 33740 }, { "epoch": 0.116931342340207, "grad_norm": 0.08837936073541641, "learning_rate": 0.0026955697906147344, "loss": 1.5895, "step": 33760 }, { "epoch": 0.1170630217797793, "grad_norm": 0.08591131120920181, "learning_rate": 0.002695187289406861, "loss": 1.5967, "step": 33780 }, { "epoch": 0.1171947012193516, "grad_norm": 0.11289795488119125, "learning_rate": 0.002694804575227551, "loss": 1.5971, "step": 33800 }, { "epoch": 0.11732638065892391, "grad_norm": 0.09001953154802322, "learning_rate": 0.002694421648145001, "loss": 1.6129, "step": 33820 }, { "epoch": 0.11745806009849621, "grad_norm": 0.10741370916366577, "learning_rate": 0.002694038508227445, "loss": 1.6142, "step": 33840 }, { "epoch": 0.11758973953806853, "grad_norm": 0.08802719414234161, "learning_rate": 0.0026936551555431553, "loss": 1.6164, "step": 33860 }, { "epoch": 0.11772141897764084, "grad_norm": 0.10249514877796173, "learning_rate": 0.002693271590160441, "loss": 1.6068, "step": 33880 }, { "epoch": 0.11785309841721314, "grad_norm": 0.12778210639953613, "learning_rate": 0.002692887812147651, "loss": 1.604, "step": 33900 }, { "epoch": 0.11798477785678545, "grad_norm": 0.10118341445922852, "learning_rate": 0.0026925038215731703, "loss": 1.6052, "step": 33920 }, { "epoch": 0.11811645729635775, "grad_norm": 0.12567481398582458, "learning_rate": 0.002692119618505423, "loss": 1.6026, "step": 33940 }, { "epoch": 0.11824813673593006, "grad_norm": 0.0919373631477356, "learning_rate": 0.0026917352030128698, "loss": 1.5962, "step": 33960 }, { "epoch": 0.11837981617550236, "grad_norm": 0.10136484354734421, "learning_rate": 0.002691350575164011, "loss": 1.5898, "step": 33980 }, { "epoch": 0.11851149561507467, "grad_norm": 0.07460084557533264, "learning_rate": 0.0026909657350273827, "loss": 1.5924, "step": 34000 }, { "epoch": 0.11851149561507467, "eval_loss": 1.5006837844848633, "eval_runtime": 66.9994, "eval_samples_per_second": 14.926, "eval_steps_per_second": 14.926, "step": 34000 }, { "epoch": 0.11864317505464697, "grad_norm": 0.09306183457374573, "learning_rate": 0.0026905806826715605, "loss": 1.5871, "step": 34020 }, { "epoch": 0.11877485449421928, "grad_norm": 0.08243928104639053, "learning_rate": 0.002690195418165158, "loss": 1.5946, "step": 34040 }, { "epoch": 0.11890653393379158, "grad_norm": 0.08196361362934113, "learning_rate": 0.002689809941576824, "loss": 1.5878, "step": 34060 }, { "epoch": 0.11903821337336389, "grad_norm": 0.09074049443006516, "learning_rate": 0.0026894242529752485, "loss": 1.5903, "step": 34080 }, { "epoch": 0.11916989281293619, "grad_norm": 0.08904928714036942, "learning_rate": 0.002689038352429157, "loss": 1.5858, "step": 34100 }, { "epoch": 0.1193015722525085, "grad_norm": 0.08144096285104752, "learning_rate": 0.0026886522400073136, "loss": 1.5845, "step": 34120 }, { "epoch": 0.1194332516920808, "grad_norm": 0.1431560218334198, "learning_rate": 0.00268826591577852, "loss": 1.5868, "step": 34140 }, { "epoch": 0.1195649311316531, "grad_norm": 0.09951731562614441, "learning_rate": 0.002687879379811615, "loss": 1.5827, "step": 34160 }, { "epoch": 0.11969661057122541, "grad_norm": 0.12058053910732269, "learning_rate": 0.0026874926321754766, "loss": 1.5822, "step": 34180 }, { "epoch": 0.11982829001079771, "grad_norm": 0.10634467750787735, "learning_rate": 0.0026871056729390196, "loss": 1.5869, "step": 34200 }, { "epoch": 0.11995996945037002, "grad_norm": 0.09280095249414444, "learning_rate": 0.002686718502171196, "loss": 1.5891, "step": 34220 }, { "epoch": 0.12009164888994232, "grad_norm": 0.11709116399288177, "learning_rate": 0.002686331119940997, "loss": 1.5816, "step": 34240 }, { "epoch": 0.12022332832951463, "grad_norm": 0.07095829397439957, "learning_rate": 0.00268594352631745, "loss": 1.5885, "step": 34260 }, { "epoch": 0.12035500776908693, "grad_norm": 0.0902029350399971, "learning_rate": 0.00268555572136962, "loss": 1.5819, "step": 34280 }, { "epoch": 0.12048668720865924, "grad_norm": 0.08400021493434906, "learning_rate": 0.0026851677051666113, "loss": 1.5836, "step": 34300 }, { "epoch": 0.12061836664823154, "grad_norm": 0.07917217165231705, "learning_rate": 0.002684779477777565, "loss": 1.5784, "step": 34320 }, { "epoch": 0.12075004608780385, "grad_norm": 0.10317684710025787, "learning_rate": 0.002684391039271659, "loss": 1.5754, "step": 34340 }, { "epoch": 0.12088172552737615, "grad_norm": 0.08167439699172974, "learning_rate": 0.0026840023897181098, "loss": 1.586, "step": 34360 }, { "epoch": 0.12101340496694846, "grad_norm": 0.0829315185546875, "learning_rate": 0.00268361352918617, "loss": 1.6143, "step": 34380 }, { "epoch": 0.12114508440652076, "grad_norm": 0.08923465013504028, "learning_rate": 0.0026832244577451336, "loss": 1.6303, "step": 34400 }, { "epoch": 0.12127676384609307, "grad_norm": 0.0999564528465271, "learning_rate": 0.002682835175464327, "loss": 1.632, "step": 34420 }, { "epoch": 0.12140844328566537, "grad_norm": 0.08035658299922943, "learning_rate": 0.002682445682413118, "loss": 1.6289, "step": 34440 }, { "epoch": 0.12154012272523768, "grad_norm": 0.06893916428089142, "learning_rate": 0.0026820559786609106, "loss": 1.6304, "step": 34460 }, { "epoch": 0.12167180216480998, "grad_norm": 0.10471726953983307, "learning_rate": 0.0026816660642771466, "loss": 1.6257, "step": 34480 }, { "epoch": 0.12180348160438229, "grad_norm": 0.06977444887161255, "learning_rate": 0.0026812759393313045, "loss": 1.6235, "step": 34500 }, { "epoch": 0.12193516104395459, "grad_norm": 0.0887407585978508, "learning_rate": 0.0026808856038929014, "loss": 1.6233, "step": 34520 }, { "epoch": 0.12206684048352691, "grad_norm": 0.09635386615991592, "learning_rate": 0.0026804950580314917, "loss": 1.6219, "step": 34540 }, { "epoch": 0.12219851992309921, "grad_norm": 0.0804891362786293, "learning_rate": 0.0026801043018166667, "loss": 1.619, "step": 34560 }, { "epoch": 0.12233019936267152, "grad_norm": 0.08388678729534149, "learning_rate": 0.0026797133353180557, "loss": 1.6072, "step": 34580 }, { "epoch": 0.12246187880224382, "grad_norm": 0.1082354336977005, "learning_rate": 0.0026793221586053255, "loss": 1.6141, "step": 34600 }, { "epoch": 0.12259355824181613, "grad_norm": 0.08664815127849579, "learning_rate": 0.0026789307717481805, "loss": 1.6101, "step": 34620 }, { "epoch": 0.12272523768138843, "grad_norm": 0.09746722877025604, "learning_rate": 0.002678539174816361, "loss": 1.6086, "step": 34640 }, { "epoch": 0.12285691712096074, "grad_norm": 0.08757676929235458, "learning_rate": 0.0026781473678796474, "loss": 1.6021, "step": 34660 }, { "epoch": 0.12298859656053304, "grad_norm": 0.10005202144384384, "learning_rate": 0.0026777553510078556, "loss": 1.6083, "step": 34680 }, { "epoch": 0.12312027600010535, "grad_norm": 0.0922529324889183, "learning_rate": 0.0026773631242708396, "loss": 1.6052, "step": 34700 }, { "epoch": 0.12325195543967765, "grad_norm": 0.0967714935541153, "learning_rate": 0.00267697068773849, "loss": 1.6057, "step": 34720 }, { "epoch": 0.12338363487924996, "grad_norm": 0.07341698557138443, "learning_rate": 0.002676578041480736, "loss": 1.6049, "step": 34740 }, { "epoch": 0.12351531431882226, "grad_norm": 0.09357757121324539, "learning_rate": 0.0026761851855675433, "loss": 1.6074, "step": 34760 }, { "epoch": 0.12364699375839457, "grad_norm": 0.07980691641569138, "learning_rate": 0.0026757921200689155, "loss": 1.6043, "step": 34780 }, { "epoch": 0.12377867319796687, "grad_norm": 0.1163335070014, "learning_rate": 0.002675398845054893, "loss": 1.6085, "step": 34800 }, { "epoch": 0.12391035263753918, "grad_norm": 0.08081631362438202, "learning_rate": 0.0026750053605955537, "loss": 1.6018, "step": 34820 }, { "epoch": 0.12404203207711148, "grad_norm": 0.0792580246925354, "learning_rate": 0.002674611666761013, "loss": 1.6092, "step": 34840 }, { "epoch": 0.12417371151668379, "grad_norm": 0.0822744071483612, "learning_rate": 0.002674217763621424, "loss": 1.6052, "step": 34860 }, { "epoch": 0.12430539095625609, "grad_norm": 0.10850385576486588, "learning_rate": 0.002673823651246976, "loss": 1.6001, "step": 34880 }, { "epoch": 0.1244370703958284, "grad_norm": 0.10312029719352722, "learning_rate": 0.002673429329707897, "loss": 1.599, "step": 34900 }, { "epoch": 0.1245687498354007, "grad_norm": 0.09553300589323044, "learning_rate": 0.0026730347990744506, "loss": 1.6001, "step": 34920 }, { "epoch": 0.124700429274973, "grad_norm": 0.07871738821268082, "learning_rate": 0.0026726400594169392, "loss": 1.5985, "step": 34940 }, { "epoch": 0.12483210871454531, "grad_norm": 0.1027330532670021, "learning_rate": 0.0026722451108057016, "loss": 1.5977, "step": 34960 }, { "epoch": 0.12496378815411761, "grad_norm": 0.08380601555109024, "learning_rate": 0.0026718499533111137, "loss": 1.6039, "step": 34980 }, { "epoch": 0.12509546759368992, "grad_norm": 0.09733425080776215, "learning_rate": 0.002671454587003589, "loss": 1.6059, "step": 35000 }, { "epoch": 0.12509546759368992, "eval_loss": 1.5703957080841064, "eval_runtime": 66.1504, "eval_samples_per_second": 15.117, "eval_steps_per_second": 15.117, "step": 35000 }, { "epoch": 0.12522714703326224, "grad_norm": 0.08837222307920456, "learning_rate": 0.0026710590119535787, "loss": 1.5829, "step": 35020 }, { "epoch": 0.12535882647283453, "grad_norm": 0.09444919973611832, "learning_rate": 0.0026706632282315706, "loss": 1.5766, "step": 35040 }, { "epoch": 0.12549050591240685, "grad_norm": 0.09045890718698502, "learning_rate": 0.0026702672359080887, "loss": 1.5706, "step": 35060 }, { "epoch": 0.12562218535197914, "grad_norm": 0.10616089403629303, "learning_rate": 0.002669871035053697, "loss": 1.5704, "step": 35080 }, { "epoch": 0.12575386479155146, "grad_norm": 0.08494651317596436, "learning_rate": 0.002669474625738993, "loss": 1.5693, "step": 35100 }, { "epoch": 0.12588554423112375, "grad_norm": 0.09198006242513657, "learning_rate": 0.0026690780080346143, "loss": 1.5588, "step": 35120 }, { "epoch": 0.12601722367069607, "grad_norm": 0.07722193002700806, "learning_rate": 0.0026686811820112346, "loss": 1.5653, "step": 35140 }, { "epoch": 0.12614890311026836, "grad_norm": 0.08537338674068451, "learning_rate": 0.002668284147739564, "loss": 1.5594, "step": 35160 }, { "epoch": 0.12628058254984068, "grad_norm": 0.10831312835216522, "learning_rate": 0.002667886905290351, "loss": 1.5523, "step": 35180 }, { "epoch": 0.12641226198941297, "grad_norm": 0.0943257287144661, "learning_rate": 0.00266748945473438, "loss": 1.553, "step": 35200 }, { "epoch": 0.12654394142898528, "grad_norm": 0.1066376119852066, "learning_rate": 0.0026670917961424735, "loss": 1.5569, "step": 35220 }, { "epoch": 0.12667562086855758, "grad_norm": 0.09195302426815033, "learning_rate": 0.0026666939295854905, "loss": 1.5524, "step": 35240 }, { "epoch": 0.1268073003081299, "grad_norm": 0.09674491733312607, "learning_rate": 0.002666295855134327, "loss": 1.5522, "step": 35260 }, { "epoch": 0.12693897974770219, "grad_norm": 0.12088479846715927, "learning_rate": 0.0026658975728599166, "loss": 1.5529, "step": 35280 }, { "epoch": 0.1270706591872745, "grad_norm": 0.09849090874195099, "learning_rate": 0.0026654990828332294, "loss": 1.5502, "step": 35300 }, { "epoch": 0.1272023386268468, "grad_norm": 0.08557942509651184, "learning_rate": 0.0026651003851252725, "loss": 1.5469, "step": 35320 }, { "epoch": 0.1273340180664191, "grad_norm": 0.0989651307463646, "learning_rate": 0.00266470147980709, "loss": 1.5467, "step": 35340 }, { "epoch": 0.1274656975059914, "grad_norm": 0.08966153860092163, "learning_rate": 0.002664302366949764, "loss": 1.5445, "step": 35360 }, { "epoch": 0.12759737694556372, "grad_norm": 0.0903390496969223, "learning_rate": 0.002663903046624412, "loss": 1.5489, "step": 35380 }, { "epoch": 0.12772905638513601, "grad_norm": 0.0847504660487175, "learning_rate": 0.0026635035189021892, "loss": 1.5421, "step": 35400 }, { "epoch": 0.12786073582470833, "grad_norm": 0.11433856189250946, "learning_rate": 0.0026631037838542883, "loss": 1.5404, "step": 35420 }, { "epoch": 0.12799241526428062, "grad_norm": 0.09573832899332047, "learning_rate": 0.0026627038415519386, "loss": 1.5505, "step": 35440 }, { "epoch": 0.12812409470385294, "grad_norm": 0.10996285080909729, "learning_rate": 0.002662303692066405, "loss": 1.5422, "step": 35460 }, { "epoch": 0.12825577414342523, "grad_norm": 0.13538189232349396, "learning_rate": 0.0026619033354689917, "loss": 1.5431, "step": 35480 }, { "epoch": 0.12838745358299755, "grad_norm": 0.09150131791830063, "learning_rate": 0.0026615027718310375, "loss": 1.5489, "step": 35500 }, { "epoch": 0.12851913302256984, "grad_norm": 0.08535768836736679, "learning_rate": 0.00266110200122392, "loss": 1.5474, "step": 35520 }, { "epoch": 0.12865081246214216, "grad_norm": 0.0952446460723877, "learning_rate": 0.002660701023719053, "loss": 1.5451, "step": 35540 }, { "epoch": 0.12878249190171448, "grad_norm": 0.1442309468984604, "learning_rate": 0.0026602998393878865, "loss": 1.5548, "step": 35560 }, { "epoch": 0.12891417134128677, "grad_norm": 0.08960012346506119, "learning_rate": 0.0026598984483019077, "loss": 1.5595, "step": 35580 }, { "epoch": 0.1290458507808591, "grad_norm": 0.09016614407300949, "learning_rate": 0.002659496850532641, "loss": 1.5564, "step": 35600 }, { "epoch": 0.12917753022043138, "grad_norm": 0.11049813777208328, "learning_rate": 0.0026590950461516482, "loss": 1.5583, "step": 35620 }, { "epoch": 0.1293092096600037, "grad_norm": 0.11803802847862244, "learning_rate": 0.002658693035230526, "loss": 1.5528, "step": 35640 }, { "epoch": 0.129440889099576, "grad_norm": 0.12277698516845703, "learning_rate": 0.00265829081784091, "loss": 1.5452, "step": 35660 }, { "epoch": 0.1295725685391483, "grad_norm": 0.08969718217849731, "learning_rate": 0.002657888394054471, "loss": 1.5436, "step": 35680 }, { "epoch": 0.1297042479787206, "grad_norm": 0.07710202783346176, "learning_rate": 0.002657485763942918, "loss": 1.5429, "step": 35700 }, { "epoch": 0.12983592741829292, "grad_norm": 0.10966431349515915, "learning_rate": 0.0026570829275779947, "loss": 1.5381, "step": 35720 }, { "epoch": 0.1299676068578652, "grad_norm": 0.09629274159669876, "learning_rate": 0.002656679885031484, "loss": 1.5386, "step": 35740 }, { "epoch": 0.13009928629743753, "grad_norm": 0.11513884365558624, "learning_rate": 0.0026562766363752042, "loss": 1.5343, "step": 35760 }, { "epoch": 0.13023096573700982, "grad_norm": 0.10110338777303696, "learning_rate": 0.0026558731816810105, "loss": 1.5315, "step": 35780 }, { "epoch": 0.13036264517658214, "grad_norm": 0.08176104724407196, "learning_rate": 0.0026554695210207944, "loss": 1.5365, "step": 35800 }, { "epoch": 0.13049432461615443, "grad_norm": 0.09711804240942001, "learning_rate": 0.0026550656544664848, "loss": 1.5305, "step": 35820 }, { "epoch": 0.13062600405572675, "grad_norm": 0.09326780587434769, "learning_rate": 0.0026546615820900467, "loss": 1.5236, "step": 35840 }, { "epoch": 0.13075768349529904, "grad_norm": 0.10439273715019226, "learning_rate": 0.002654257303963483, "loss": 1.5217, "step": 35860 }, { "epoch": 0.13088936293487136, "grad_norm": 0.09977664798498154, "learning_rate": 0.002653852820158832, "loss": 1.5241, "step": 35880 }, { "epoch": 0.13102104237444365, "grad_norm": 0.08770251274108887, "learning_rate": 0.0026534481307481685, "loss": 1.5319, "step": 35900 }, { "epoch": 0.13115272181401597, "grad_norm": 0.10881366580724716, "learning_rate": 0.002653043235803605, "loss": 1.5383, "step": 35920 }, { "epoch": 0.13128440125358826, "grad_norm": 0.09104442596435547, "learning_rate": 0.0026526381353972894, "loss": 1.5326, "step": 35940 }, { "epoch": 0.13141608069316058, "grad_norm": 0.12487766891717911, "learning_rate": 0.0026522328296014076, "loss": 1.5339, "step": 35960 }, { "epoch": 0.13154776013273287, "grad_norm": 0.15558366477489471, "learning_rate": 0.0026518273184881814, "loss": 1.5229, "step": 35980 }, { "epoch": 0.13167943957230518, "grad_norm": 0.1283443719148636, "learning_rate": 0.0026514216021298687, "loss": 1.5299, "step": 36000 }, { "epoch": 0.13167943957230518, "eval_loss": 1.617323875427246, "eval_runtime": 67.0387, "eval_samples_per_second": 14.917, "eval_steps_per_second": 14.917, "step": 36000 }, { "epoch": 0.13181111901187748, "grad_norm": 0.14764146506786346, "learning_rate": 0.0026510156805987645, "loss": 1.5301, "step": 36020 }, { "epoch": 0.1319427984514498, "grad_norm": 0.09800808131694794, "learning_rate": 0.0026506095539672006, "loss": 1.5251, "step": 36040 }, { "epoch": 0.13207447789102209, "grad_norm": 0.09196116775274277, "learning_rate": 0.0026502032223075446, "loss": 1.5279, "step": 36060 }, { "epoch": 0.1322061573305944, "grad_norm": 0.10031158477067947, "learning_rate": 0.0026497966856922016, "loss": 1.5282, "step": 36080 }, { "epoch": 0.1323378367701667, "grad_norm": 0.12328962981700897, "learning_rate": 0.0026493899441936124, "loss": 1.5328, "step": 36100 }, { "epoch": 0.132469516209739, "grad_norm": 0.1079377755522728, "learning_rate": 0.0026489829978842546, "loss": 1.5307, "step": 36120 }, { "epoch": 0.1326011956493113, "grad_norm": 0.08541183918714523, "learning_rate": 0.0026485758468366427, "loss": 1.5356, "step": 36140 }, { "epoch": 0.13273287508888362, "grad_norm": 0.10611236095428467, "learning_rate": 0.0026481684911233267, "loss": 1.5834, "step": 36160 }, { "epoch": 0.1328645545284559, "grad_norm": 0.087572380900383, "learning_rate": 0.0026477609308168944, "loss": 1.6016, "step": 36180 }, { "epoch": 0.13299623396802823, "grad_norm": 0.1034546047449112, "learning_rate": 0.002647353165989968, "loss": 1.6119, "step": 36200 }, { "epoch": 0.13312791340760055, "grad_norm": 0.09647917747497559, "learning_rate": 0.002646945196715209, "loss": 1.6142, "step": 36220 }, { "epoch": 0.13325959284717284, "grad_norm": 0.08855011314153671, "learning_rate": 0.002646537023065313, "loss": 1.6148, "step": 36240 }, { "epoch": 0.13339127228674516, "grad_norm": 0.10243046283721924, "learning_rate": 0.0026461286451130127, "loss": 1.6155, "step": 36260 }, { "epoch": 0.13352295172631745, "grad_norm": 0.105488620698452, "learning_rate": 0.0026457200629310777, "loss": 1.614, "step": 36280 }, { "epoch": 0.13365463116588977, "grad_norm": 0.08305686712265015, "learning_rate": 0.0026453112765923133, "loss": 1.6059, "step": 36300 }, { "epoch": 0.13378631060546206, "grad_norm": 0.09603402763605118, "learning_rate": 0.0026449022861695618, "loss": 1.6018, "step": 36320 }, { "epoch": 0.13391799004503438, "grad_norm": 0.11666828393936157, "learning_rate": 0.0026444930917357014, "loss": 1.6017, "step": 36340 }, { "epoch": 0.13404966948460667, "grad_norm": 0.1235344409942627, "learning_rate": 0.0026440836933636466, "loss": 1.5965, "step": 36360 }, { "epoch": 0.134181348924179, "grad_norm": 0.11957265436649323, "learning_rate": 0.002643674091126349, "loss": 1.5957, "step": 36380 }, { "epoch": 0.13431302836375128, "grad_norm": 0.11756687611341476, "learning_rate": 0.0026432642850967953, "loss": 1.5999, "step": 36400 }, { "epoch": 0.1344447078033236, "grad_norm": 0.10342928767204285, "learning_rate": 0.002642854275348009, "loss": 1.592, "step": 36420 }, { "epoch": 0.1345763872428959, "grad_norm": 0.10075769573450089, "learning_rate": 0.002642444061953051, "loss": 1.5932, "step": 36440 }, { "epoch": 0.1347080666824682, "grad_norm": 0.10493767261505127, "learning_rate": 0.002642033644985017, "loss": 1.5928, "step": 36460 }, { "epoch": 0.1348397461220405, "grad_norm": 0.1051807627081871, "learning_rate": 0.00264162302451704, "loss": 1.5842, "step": 36480 }, { "epoch": 0.13497142556161282, "grad_norm": 0.10073640197515488, "learning_rate": 0.0026412122006222883, "loss": 1.5831, "step": 36500 }, { "epoch": 0.1351031050011851, "grad_norm": 0.10793869942426682, "learning_rate": 0.0026408011733739674, "loss": 1.5888, "step": 36520 }, { "epoch": 0.13523478444075743, "grad_norm": 0.08608701080083847, "learning_rate": 0.002640389942845318, "loss": 1.588, "step": 36540 }, { "epoch": 0.13536646388032972, "grad_norm": 0.08790282160043716, "learning_rate": 0.0026399785091096176, "loss": 1.5869, "step": 36560 }, { "epoch": 0.13549814331990204, "grad_norm": 0.08713233470916748, "learning_rate": 0.002639566872240181, "loss": 1.5829, "step": 36580 }, { "epoch": 0.13562982275947433, "grad_norm": 0.08939250558614731, "learning_rate": 0.0026391550323103573, "loss": 1.582, "step": 36600 }, { "epoch": 0.13576150219904665, "grad_norm": 0.09528082609176636, "learning_rate": 0.0026387429893935327, "loss": 1.5845, "step": 36620 }, { "epoch": 0.13589318163861894, "grad_norm": 0.12500585615634918, "learning_rate": 0.0026383307435631294, "loss": 1.5823, "step": 36640 }, { "epoch": 0.13602486107819126, "grad_norm": 0.0984441414475441, "learning_rate": 0.0026379182948926055, "loss": 1.5762, "step": 36660 }, { "epoch": 0.13615654051776355, "grad_norm": 0.11194117367267609, "learning_rate": 0.0026375056434554565, "loss": 1.5809, "step": 36680 }, { "epoch": 0.13628821995733587, "grad_norm": 0.11597609519958496, "learning_rate": 0.002637092789325212, "loss": 1.5774, "step": 36700 }, { "epoch": 0.13641989939690816, "grad_norm": 0.07991953939199448, "learning_rate": 0.0026366797325754403, "loss": 1.581, "step": 36720 }, { "epoch": 0.13655157883648048, "grad_norm": 0.10064183175563812, "learning_rate": 0.0026362664732797426, "loss": 1.5853, "step": 36740 }, { "epoch": 0.13668325827605277, "grad_norm": 0.1042194738984108, "learning_rate": 0.0026358530115117595, "loss": 1.5975, "step": 36760 }, { "epoch": 0.13681493771562508, "grad_norm": 0.10666348040103912, "learning_rate": 0.002635439347345165, "loss": 1.6029, "step": 36780 }, { "epoch": 0.13694661715519738, "grad_norm": 0.1007642075419426, "learning_rate": 0.0026350254808536707, "loss": 1.6028, "step": 36800 }, { "epoch": 0.1370782965947697, "grad_norm": 0.08334644138813019, "learning_rate": 0.002634611412111024, "loss": 1.6097, "step": 36820 }, { "epoch": 0.13720997603434198, "grad_norm": 0.09047345817089081, "learning_rate": 0.0026341971411910077, "loss": 1.6055, "step": 36840 }, { "epoch": 0.1373416554739143, "grad_norm": 0.16159166395664215, "learning_rate": 0.002633782668167442, "loss": 1.5987, "step": 36860 }, { "epoch": 0.1374733349134866, "grad_norm": 0.10918816179037094, "learning_rate": 0.002633367993114181, "loss": 1.604, "step": 36880 }, { "epoch": 0.1376050143530589, "grad_norm": 0.10157617926597595, "learning_rate": 0.002632953116105116, "loss": 1.5927, "step": 36900 }, { "epoch": 0.13773669379263123, "grad_norm": 0.09241142123937607, "learning_rate": 0.0026325380372141756, "loss": 1.5981, "step": 36920 }, { "epoch": 0.13786837323220352, "grad_norm": 0.12108739465475082, "learning_rate": 0.002632122756515322, "loss": 1.592, "step": 36940 }, { "epoch": 0.13800005267177584, "grad_norm": 0.09442280977964401, "learning_rate": 0.0026317072740825545, "loss": 1.5884, "step": 36960 }, { "epoch": 0.13813173211134813, "grad_norm": 0.09058595448732376, "learning_rate": 0.0026312915899899085, "loss": 1.5859, "step": 36980 }, { "epoch": 0.13826341155092045, "grad_norm": 0.08916100859642029, "learning_rate": 0.002630875704311455, "loss": 1.5841, "step": 37000 }, { "epoch": 0.13826341155092045, "eval_loss": 1.493425726890564, "eval_runtime": 67.4059, "eval_samples_per_second": 14.836, "eval_steps_per_second": 14.836, "step": 37000 }, { "epoch": 0.13839509099049274, "grad_norm": 0.08742368966341019, "learning_rate": 0.0026304596171213015, "loss": 1.588, "step": 37020 }, { "epoch": 0.13852677043006506, "grad_norm": 0.07880369573831558, "learning_rate": 0.0026300433284935907, "loss": 1.5861, "step": 37040 }, { "epoch": 0.13865844986963735, "grad_norm": 0.08849447965621948, "learning_rate": 0.0026296268385025004, "loss": 1.5832, "step": 37060 }, { "epoch": 0.13879012930920967, "grad_norm": 0.08267071843147278, "learning_rate": 0.002629210147222247, "loss": 1.585, "step": 37080 }, { "epoch": 0.13892180874878196, "grad_norm": 0.08915061503648758, "learning_rate": 0.0026287932547270796, "loss": 1.5886, "step": 37100 }, { "epoch": 0.13905348818835428, "grad_norm": 0.11180838197469711, "learning_rate": 0.0026283761610912853, "loss": 1.5786, "step": 37120 }, { "epoch": 0.13918516762792657, "grad_norm": 0.14976435899734497, "learning_rate": 0.002627958866389186, "loss": 1.5809, "step": 37140 }, { "epoch": 0.1393168470674989, "grad_norm": 0.09413915127515793, "learning_rate": 0.002627541370695141, "loss": 1.5791, "step": 37160 }, { "epoch": 0.13944852650707118, "grad_norm": 0.10926341265439987, "learning_rate": 0.0026271236740835428, "loss": 1.5841, "step": 37180 }, { "epoch": 0.1395802059466435, "grad_norm": 0.09298263490200043, "learning_rate": 0.002626705776628822, "loss": 1.587, "step": 37200 }, { "epoch": 0.1397118853862158, "grad_norm": 0.1033315360546112, "learning_rate": 0.002626287678405443, "loss": 1.5787, "step": 37220 }, { "epoch": 0.1398435648257881, "grad_norm": 0.10745333135128021, "learning_rate": 0.002625869379487908, "loss": 1.5761, "step": 37240 }, { "epoch": 0.1399752442653604, "grad_norm": 0.11225748062133789, "learning_rate": 0.0026254508799507543, "loss": 1.5859, "step": 37260 }, { "epoch": 0.14010692370493272, "grad_norm": 0.09762544184923172, "learning_rate": 0.002625032179868554, "loss": 1.5775, "step": 37280 }, { "epoch": 0.140238603144505, "grad_norm": 0.0946531891822815, "learning_rate": 0.002624613279315916, "loss": 1.5794, "step": 37300 }, { "epoch": 0.14037028258407733, "grad_norm": 0.07943738996982574, "learning_rate": 0.0026241941783674842, "loss": 1.5804, "step": 37320 }, { "epoch": 0.14050196202364962, "grad_norm": 0.09314402937889099, "learning_rate": 0.0026237748770979387, "loss": 1.5749, "step": 37340 }, { "epoch": 0.14063364146322194, "grad_norm": 0.104873888194561, "learning_rate": 0.0026233553755819956, "loss": 1.5279, "step": 37360 }, { "epoch": 0.14076532090279423, "grad_norm": 0.09734835475683212, "learning_rate": 0.0026229356738944054, "loss": 1.4679, "step": 37380 }, { "epoch": 0.14089700034236655, "grad_norm": 0.10877981036901474, "learning_rate": 0.0026225157721099556, "loss": 1.4734, "step": 37400 }, { "epoch": 0.14102867978193884, "grad_norm": 0.10789605230093002, "learning_rate": 0.002622095670303469, "loss": 1.4646, "step": 37420 }, { "epoch": 0.14116035922151116, "grad_norm": 0.08844413608312607, "learning_rate": 0.0026216753685498035, "loss": 1.4594, "step": 37440 }, { "epoch": 0.14129203866108345, "grad_norm": 0.07974802702665329, "learning_rate": 0.0026212548669238534, "loss": 1.4563, "step": 37460 }, { "epoch": 0.14142371810065577, "grad_norm": 0.1050298884510994, "learning_rate": 0.002620834165500548, "loss": 1.4593, "step": 37480 }, { "epoch": 0.14155539754022806, "grad_norm": 0.11050856858491898, "learning_rate": 0.0026204132643548525, "loss": 1.4532, "step": 37500 }, { "epoch": 0.14168707697980037, "grad_norm": 0.09087752550840378, "learning_rate": 0.0026199921635617672, "loss": 1.4568, "step": 37520 }, { "epoch": 0.14181875641937267, "grad_norm": 0.08688180893659592, "learning_rate": 0.0026195708631963294, "loss": 1.4584, "step": 37540 }, { "epoch": 0.14195043585894498, "grad_norm": 0.08796868473291397, "learning_rate": 0.00261914936333361, "loss": 1.4513, "step": 37560 }, { "epoch": 0.1420821152985173, "grad_norm": 0.1213894784450531, "learning_rate": 0.002618727664048717, "loss": 1.4539, "step": 37580 }, { "epoch": 0.1422137947380896, "grad_norm": 0.11895439028739929, "learning_rate": 0.0026183057654167933, "loss": 1.4568, "step": 37600 }, { "epoch": 0.1423454741776619, "grad_norm": 0.10927541553974152, "learning_rate": 0.002617883667513017, "loss": 1.4576, "step": 37620 }, { "epoch": 0.1424771536172342, "grad_norm": 0.11971597373485565, "learning_rate": 0.0026174613704126027, "loss": 1.4586, "step": 37640 }, { "epoch": 0.14260883305680652, "grad_norm": 0.11147040128707886, "learning_rate": 0.0026170388741907995, "loss": 1.4556, "step": 37660 }, { "epoch": 0.1427405124963788, "grad_norm": 0.09948437660932541, "learning_rate": 0.0026166161789228917, "loss": 1.4559, "step": 37680 }, { "epoch": 0.14287219193595113, "grad_norm": 0.11996204406023026, "learning_rate": 0.0026161932846842013, "loss": 1.458, "step": 37700 }, { "epoch": 0.14300387137552342, "grad_norm": 0.1091773509979248, "learning_rate": 0.0026157701915500826, "loss": 1.4576, "step": 37720 }, { "epoch": 0.14313555081509574, "grad_norm": 0.27840930223464966, "learning_rate": 0.002615346899595928, "loss": 1.464, "step": 37740 }, { "epoch": 0.14326723025466803, "grad_norm": 0.09474640339612961, "learning_rate": 0.002614923408897164, "loss": 1.4745, "step": 37760 }, { "epoch": 0.14339890969424035, "grad_norm": 0.13245952129364014, "learning_rate": 0.002614499719529252, "loss": 1.4685, "step": 37780 }, { "epoch": 0.14353058913381264, "grad_norm": 0.10501421242952347, "learning_rate": 0.0026140758315676906, "loss": 1.4674, "step": 37800 }, { "epoch": 0.14366226857338496, "grad_norm": 0.10588248074054718, "learning_rate": 0.0026136517450880124, "loss": 1.4648, "step": 37820 }, { "epoch": 0.14379394801295725, "grad_norm": 0.10599175095558167, "learning_rate": 0.0026132274601657853, "loss": 1.4685, "step": 37840 }, { "epoch": 0.14392562745252957, "grad_norm": 0.11727793514728546, "learning_rate": 0.002612802976876614, "loss": 1.4643, "step": 37860 }, { "epoch": 0.14405730689210186, "grad_norm": 0.09941857308149338, "learning_rate": 0.0026123782952961363, "loss": 1.4645, "step": 37880 }, { "epoch": 0.14418898633167418, "grad_norm": 0.09774893522262573, "learning_rate": 0.0026119534155000274, "loss": 1.4684, "step": 37900 }, { "epoch": 0.14432066577124647, "grad_norm": 0.10435054451227188, "learning_rate": 0.002611528337563997, "loss": 1.4912, "step": 37920 }, { "epoch": 0.1444523452108188, "grad_norm": 0.1452368199825287, "learning_rate": 0.0026111030615637893, "loss": 1.5458, "step": 37940 }, { "epoch": 0.14458402465039108, "grad_norm": 0.1285165399312973, "learning_rate": 0.0026106775875751856, "loss": 1.5752, "step": 37960 }, { "epoch": 0.1447157040899634, "grad_norm": 0.11321987956762314, "learning_rate": 0.0026102519156740007, "loss": 1.5846, "step": 37980 }, { "epoch": 0.1448473835295357, "grad_norm": 0.0958334282040596, "learning_rate": 0.0026098260459360865, "loss": 1.5965, "step": 38000 }, { "epoch": 0.1448473835295357, "eval_loss": 1.5834728479385376, "eval_runtime": 67.4429, "eval_samples_per_second": 14.827, "eval_steps_per_second": 14.827, "step": 38000 }, { "epoch": 0.144979062969108, "grad_norm": 0.12879179418087006, "learning_rate": 0.0026093999784373273, "loss": 1.595, "step": 38020 }, { "epoch": 0.1451107424086803, "grad_norm": 0.10820400714874268, "learning_rate": 0.0026089737132536464, "loss": 1.5911, "step": 38040 }, { "epoch": 0.14524242184825262, "grad_norm": 0.09675215184688568, "learning_rate": 0.002608547250460999, "loss": 1.589, "step": 38060 }, { "epoch": 0.1453741012878249, "grad_norm": 0.11472152918577194, "learning_rate": 0.0026081205901353774, "loss": 1.5921, "step": 38080 }, { "epoch": 0.14550578072739723, "grad_norm": 0.12123990058898926, "learning_rate": 0.0026076937323528085, "loss": 1.5846, "step": 38100 }, { "epoch": 0.14563746016696952, "grad_norm": 0.11360788345336914, "learning_rate": 0.0026072666771893545, "loss": 1.586, "step": 38120 }, { "epoch": 0.14576913960654184, "grad_norm": 0.10187938064336777, "learning_rate": 0.0026068394247211126, "loss": 1.5779, "step": 38140 }, { "epoch": 0.14590081904611413, "grad_norm": 0.1109524741768837, "learning_rate": 0.002606411975024215, "loss": 1.582, "step": 38160 }, { "epoch": 0.14603249848568645, "grad_norm": 0.13011963665485382, "learning_rate": 0.0026059843281748298, "loss": 1.5822, "step": 38180 }, { "epoch": 0.14616417792525874, "grad_norm": 0.14091023802757263, "learning_rate": 0.0026055564842491596, "loss": 1.5789, "step": 38200 }, { "epoch": 0.14629585736483106, "grad_norm": 0.11127016693353653, "learning_rate": 0.002605128443323442, "loss": 1.5769, "step": 38220 }, { "epoch": 0.14642753680440337, "grad_norm": 0.11978462338447571, "learning_rate": 0.002604700205473951, "loss": 1.5744, "step": 38240 }, { "epoch": 0.14655921624397567, "grad_norm": 0.09419921040534973, "learning_rate": 0.002604271770776993, "loss": 1.5677, "step": 38260 }, { "epoch": 0.14669089568354798, "grad_norm": 0.10313443094491959, "learning_rate": 0.0026038431393089127, "loss": 1.5681, "step": 38280 }, { "epoch": 0.14682257512312027, "grad_norm": 0.12435714900493622, "learning_rate": 0.0026034143111460877, "loss": 1.5635, "step": 38300 }, { "epoch": 0.1469542545626926, "grad_norm": 0.09440986067056656, "learning_rate": 0.002602985286364931, "loss": 1.5695, "step": 38320 }, { "epoch": 0.14708593400226488, "grad_norm": 0.12459173798561096, "learning_rate": 0.0026025560650418914, "loss": 1.5649, "step": 38340 }, { "epoch": 0.1472176134418372, "grad_norm": 0.1102808341383934, "learning_rate": 0.0026021266472534515, "loss": 1.5629, "step": 38360 }, { "epoch": 0.1473492928814095, "grad_norm": 0.10280980169773102, "learning_rate": 0.00260169703307613, "loss": 1.5676, "step": 38380 }, { "epoch": 0.1474809723209818, "grad_norm": 0.1017128974199295, "learning_rate": 0.0026012672225864805, "loss": 1.5665, "step": 38400 }, { "epoch": 0.1476126517605541, "grad_norm": 0.11201263964176178, "learning_rate": 0.002600837215861091, "loss": 1.5607, "step": 38420 }, { "epoch": 0.14774433120012642, "grad_norm": 0.09382157772779465, "learning_rate": 0.0026004070129765845, "loss": 1.5699, "step": 38440 }, { "epoch": 0.1478760106396987, "grad_norm": 0.09265664219856262, "learning_rate": 0.00259997661400962, "loss": 1.5608, "step": 38460 }, { "epoch": 0.14800769007927103, "grad_norm": 0.13978609442710876, "learning_rate": 0.00259954601903689, "loss": 1.5632, "step": 38480 }, { "epoch": 0.14813936951884332, "grad_norm": 0.09976094961166382, "learning_rate": 0.0025991152281351223, "loss": 1.5662, "step": 38500 }, { "epoch": 0.14827104895841564, "grad_norm": 0.13578425347805023, "learning_rate": 0.002598684241381081, "loss": 1.5691, "step": 38520 }, { "epoch": 0.14840272839798793, "grad_norm": 0.09976605325937271, "learning_rate": 0.002598253058851563, "loss": 1.5962, "step": 38540 }, { "epoch": 0.14853440783756025, "grad_norm": 0.10971450805664062, "learning_rate": 0.0025978216806234015, "loss": 1.592, "step": 38560 }, { "epoch": 0.14866608727713254, "grad_norm": 0.11708176881074905, "learning_rate": 0.0025973901067734644, "loss": 1.5908, "step": 38580 }, { "epoch": 0.14879776671670486, "grad_norm": 0.08862312138080597, "learning_rate": 0.0025969583373786536, "loss": 1.5871, "step": 38600 }, { "epoch": 0.14892944615627715, "grad_norm": 0.12013594061136246, "learning_rate": 0.0025965263725159066, "loss": 1.5808, "step": 38620 }, { "epoch": 0.14906112559584947, "grad_norm": 0.093787781894207, "learning_rate": 0.0025960942122621963, "loss": 1.5854, "step": 38640 }, { "epoch": 0.14919280503542176, "grad_norm": 0.08362217992544174, "learning_rate": 0.0025956618566945287, "loss": 1.5826, "step": 38660 }, { "epoch": 0.14932448447499408, "grad_norm": 0.1498386114835739, "learning_rate": 0.002595229305889946, "loss": 1.5732, "step": 38680 }, { "epoch": 0.14945616391456637, "grad_norm": 0.09603530913591385, "learning_rate": 0.0025947965599255247, "loss": 1.5698, "step": 38700 }, { "epoch": 0.1495878433541387, "grad_norm": 0.0774497240781784, "learning_rate": 0.0025943636188783766, "loss": 1.5715, "step": 38720 }, { "epoch": 0.14971952279371098, "grad_norm": 0.08751595765352249, "learning_rate": 0.002593930482825647, "loss": 1.576, "step": 38740 }, { "epoch": 0.1498512022332833, "grad_norm": 0.0924377366900444, "learning_rate": 0.002593497151844518, "loss": 1.5715, "step": 38760 }, { "epoch": 0.1499828816728556, "grad_norm": 0.10947736352682114, "learning_rate": 0.0025930636260122044, "loss": 1.5582, "step": 38780 }, { "epoch": 0.1501145611124279, "grad_norm": 0.09718424081802368, "learning_rate": 0.0025926299054059567, "loss": 1.5644, "step": 38800 }, { "epoch": 0.1502462405520002, "grad_norm": 0.1110563725233078, "learning_rate": 0.0025921959901030597, "loss": 1.5656, "step": 38820 }, { "epoch": 0.15037791999157252, "grad_norm": 0.09171340614557266, "learning_rate": 0.0025917618801808333, "loss": 1.5597, "step": 38840 }, { "epoch": 0.1505095994311448, "grad_norm": 0.12216000258922577, "learning_rate": 0.0025913275757166324, "loss": 1.5548, "step": 38860 }, { "epoch": 0.15064127887071713, "grad_norm": 0.08841335028409958, "learning_rate": 0.002590893076787845, "loss": 1.5601, "step": 38880 }, { "epoch": 0.15077295831028942, "grad_norm": 0.10563861578702927, "learning_rate": 0.002590458383471896, "loss": 1.5535, "step": 38900 }, { "epoch": 0.15090463774986174, "grad_norm": 0.08755604177713394, "learning_rate": 0.0025900234958462433, "loss": 1.5501, "step": 38920 }, { "epoch": 0.15103631718943406, "grad_norm": 0.13694095611572266, "learning_rate": 0.0025895884139883795, "loss": 1.5627, "step": 38940 }, { "epoch": 0.15116799662900635, "grad_norm": 0.10837943106889725, "learning_rate": 0.002589153137975833, "loss": 1.5613, "step": 38960 }, { "epoch": 0.15129967606857866, "grad_norm": 0.08162432163953781, "learning_rate": 0.0025887176678861647, "loss": 1.5607, "step": 38980 }, { "epoch": 0.15143135550815096, "grad_norm": 0.14715518057346344, "learning_rate": 0.002588282003796973, "loss": 1.5544, "step": 39000 }, { "epoch": 0.15143135550815096, "eval_loss": 1.427059292793274, "eval_runtime": 66.7992, "eval_samples_per_second": 14.97, "eval_steps_per_second": 14.97, "step": 39000 }, { "epoch": 0.15156303494772327, "grad_norm": 0.10396742075681686, "learning_rate": 0.002587846145785888, "loss": 1.5584, "step": 39020 }, { "epoch": 0.15169471438729557, "grad_norm": 0.12578904628753662, "learning_rate": 0.002587410093930576, "loss": 1.5543, "step": 39040 }, { "epoch": 0.15182639382686788, "grad_norm": 0.12245041877031326, "learning_rate": 0.0025869738483087386, "loss": 1.5484, "step": 39060 }, { "epoch": 0.15195807326644017, "grad_norm": 0.10764380544424057, "learning_rate": 0.0025865374089981087, "loss": 1.5526, "step": 39080 }, { "epoch": 0.1520897527060125, "grad_norm": 0.10245970636606216, "learning_rate": 0.002586100776076457, "loss": 1.5609, "step": 39100 }, { "epoch": 0.15222143214558478, "grad_norm": 0.11582383513450623, "learning_rate": 0.0025856639496215873, "loss": 1.5789, "step": 39120 }, { "epoch": 0.1523531115851571, "grad_norm": 0.09922783076763153, "learning_rate": 0.0025852269297113382, "loss": 1.6029, "step": 39140 }, { "epoch": 0.1524847910247294, "grad_norm": 0.08174051344394684, "learning_rate": 0.002584789716423583, "loss": 1.5928, "step": 39160 }, { "epoch": 0.1526164704643017, "grad_norm": 0.14259853959083557, "learning_rate": 0.0025843523098362277, "loss": 1.6008, "step": 39180 }, { "epoch": 0.152748149903874, "grad_norm": 0.10020045936107635, "learning_rate": 0.0025839147100272155, "loss": 1.6035, "step": 39200 }, { "epoch": 0.15287982934344632, "grad_norm": 0.1230427622795105, "learning_rate": 0.002583476917074522, "loss": 1.6032, "step": 39220 }, { "epoch": 0.1530115087830186, "grad_norm": 0.0876646339893341, "learning_rate": 0.002583038931056159, "loss": 1.5921, "step": 39240 }, { "epoch": 0.15314318822259093, "grad_norm": 0.14442962408065796, "learning_rate": 0.0025826007520501704, "loss": 1.5894, "step": 39260 }, { "epoch": 0.15327486766216322, "grad_norm": 0.130369171500206, "learning_rate": 0.0025821623801346354, "loss": 1.5833, "step": 39280 }, { "epoch": 0.15340654710173554, "grad_norm": 0.09191744774580002, "learning_rate": 0.002581723815387669, "loss": 1.5819, "step": 39300 }, { "epoch": 0.15353822654130783, "grad_norm": 0.12108132243156433, "learning_rate": 0.002581285057887419, "loss": 1.5859, "step": 39320 }, { "epoch": 0.15366990598088015, "grad_norm": 0.09722419083118439, "learning_rate": 0.002580846107712068, "loss": 1.5811, "step": 39340 }, { "epoch": 0.15380158542045244, "grad_norm": 0.0996871218085289, "learning_rate": 0.0025804069649398324, "loss": 1.5806, "step": 39360 }, { "epoch": 0.15393326486002476, "grad_norm": 0.1356852501630783, "learning_rate": 0.002579967629648964, "loss": 1.5764, "step": 39380 }, { "epoch": 0.15406494429959705, "grad_norm": 0.0935957059264183, "learning_rate": 0.0025795281019177483, "loss": 1.5694, "step": 39400 }, { "epoch": 0.15419662373916937, "grad_norm": 0.10903099179267883, "learning_rate": 0.002579088381824505, "loss": 1.5665, "step": 39420 }, { "epoch": 0.15432830317874166, "grad_norm": 0.10038184374570847, "learning_rate": 0.0025786484694475882, "loss": 1.5714, "step": 39440 }, { "epoch": 0.15445998261831398, "grad_norm": 0.08461392670869827, "learning_rate": 0.002578208364865386, "loss": 1.5699, "step": 39460 }, { "epoch": 0.15459166205788627, "grad_norm": 0.09134264290332794, "learning_rate": 0.0025777680681563215, "loss": 1.5695, "step": 39480 }, { "epoch": 0.1547233414974586, "grad_norm": 0.11467129737138748, "learning_rate": 0.002577327579398851, "loss": 1.5743, "step": 39500 }, { "epoch": 0.15485502093703088, "grad_norm": 0.09146096557378769, "learning_rate": 0.002576886898671466, "loss": 1.5711, "step": 39520 }, { "epoch": 0.1549867003766032, "grad_norm": 0.08838360756635666, "learning_rate": 0.0025764460260526917, "loss": 1.5699, "step": 39540 }, { "epoch": 0.1551183798161755, "grad_norm": 0.09347314387559891, "learning_rate": 0.0025760049616210872, "loss": 1.568, "step": 39560 }, { "epoch": 0.1552500592557478, "grad_norm": 0.11676613986492157, "learning_rate": 0.002575563705455247, "loss": 1.5667, "step": 39580 }, { "epoch": 0.15538173869532013, "grad_norm": 0.11522109806537628, "learning_rate": 0.002575122257633798, "loss": 1.5708, "step": 39600 }, { "epoch": 0.15551341813489242, "grad_norm": 0.09783374518156052, "learning_rate": 0.0025746806182354023, "loss": 1.5925, "step": 39620 }, { "epoch": 0.15564509757446474, "grad_norm": 0.0943576991558075, "learning_rate": 0.0025742387873387567, "loss": 1.5825, "step": 39640 }, { "epoch": 0.15577677701403703, "grad_norm": 0.09120535105466843, "learning_rate": 0.0025737967650225906, "loss": 1.5754, "step": 39660 }, { "epoch": 0.15590845645360935, "grad_norm": 0.11549575626850128, "learning_rate": 0.0025733545513656683, "loss": 1.5741, "step": 39680 }, { "epoch": 0.15604013589318164, "grad_norm": 0.08214199542999268, "learning_rate": 0.0025729121464467897, "loss": 1.5684, "step": 39700 }, { "epoch": 0.15617181533275395, "grad_norm": 0.09407494962215424, "learning_rate": 0.0025724695503447853, "loss": 1.5623, "step": 39720 }, { "epoch": 0.15630349477232625, "grad_norm": 0.10400024056434631, "learning_rate": 0.0025720267631385227, "loss": 1.5565, "step": 39740 }, { "epoch": 0.15643517421189856, "grad_norm": 0.09701120853424072, "learning_rate": 0.002571583784906902, "loss": 1.5475, "step": 39760 }, { "epoch": 0.15656685365147086, "grad_norm": 0.09145724773406982, "learning_rate": 0.0025711406157288594, "loss": 1.5366, "step": 39780 }, { "epoch": 0.15669853309104317, "grad_norm": 0.10197409987449646, "learning_rate": 0.0025706972556833615, "loss": 1.5368, "step": 39800 }, { "epoch": 0.15683021253061546, "grad_norm": 0.10949882119894028, "learning_rate": 0.0025702537048494126, "loss": 1.5324, "step": 39820 }, { "epoch": 0.15696189197018778, "grad_norm": 0.08680877834558487, "learning_rate": 0.0025698099633060484, "loss": 1.5246, "step": 39840 }, { "epoch": 0.15709357140976007, "grad_norm": 0.09298034757375717, "learning_rate": 0.0025693660311323398, "loss": 1.5244, "step": 39860 }, { "epoch": 0.1572252508493324, "grad_norm": 0.08509939163923264, "learning_rate": 0.002568921908407392, "loss": 1.5269, "step": 39880 }, { "epoch": 0.15735693028890468, "grad_norm": 0.13192257285118103, "learning_rate": 0.002568477595210343, "loss": 1.5189, "step": 39900 }, { "epoch": 0.157488609728477, "grad_norm": 0.09820321202278137, "learning_rate": 0.0025680330916203653, "loss": 1.5172, "step": 39920 }, { "epoch": 0.1576202891680493, "grad_norm": 0.12466151267290115, "learning_rate": 0.0025675883977166656, "loss": 1.5168, "step": 39940 }, { "epoch": 0.1577519686076216, "grad_norm": 0.1055043414235115, "learning_rate": 0.002567143513578485, "loss": 1.5127, "step": 39960 }, { "epoch": 0.1578836480471939, "grad_norm": 0.0885360836982727, "learning_rate": 0.0025666984392850966, "loss": 1.5102, "step": 39980 }, { "epoch": 0.15801532748676622, "grad_norm": 0.09092732518911362, "learning_rate": 0.0025662531749158085, "loss": 1.5128, "step": 40000 }, { "epoch": 0.15801532748676622, "eval_loss": 1.5180437564849854, "eval_runtime": 66.3341, "eval_samples_per_second": 15.075, "eval_steps_per_second": 15.075, "step": 40000 }, { "epoch": 0.1581470069263385, "grad_norm": 0.11039165407419205, "learning_rate": 0.002565807720549964, "loss": 1.5056, "step": 40020 }, { "epoch": 0.15827868636591083, "grad_norm": 0.09053885191679001, "learning_rate": 0.002565362076266938, "loss": 1.5117, "step": 40040 }, { "epoch": 0.15841036580548312, "grad_norm": 0.10280958563089371, "learning_rate": 0.002564916242146141, "loss": 1.5026, "step": 40060 }, { "epoch": 0.15854204524505544, "grad_norm": 0.10042385011911392, "learning_rate": 0.0025644702182670153, "loss": 1.5079, "step": 40080 }, { "epoch": 0.15867372468462773, "grad_norm": 0.15328729152679443, "learning_rate": 0.0025640240047090394, "loss": 1.5084, "step": 40100 }, { "epoch": 0.15880540412420005, "grad_norm": 0.10443607717752457, "learning_rate": 0.002563577601551724, "loss": 1.5017, "step": 40120 }, { "epoch": 0.15893708356377234, "grad_norm": 0.1254567801952362, "learning_rate": 0.0025631310088746143, "loss": 1.5015, "step": 40140 }, { "epoch": 0.15906876300334466, "grad_norm": 0.11930776387453079, "learning_rate": 0.002562684226757289, "loss": 1.508, "step": 40160 }, { "epoch": 0.15920044244291695, "grad_norm": 0.08289260417222977, "learning_rate": 0.0025622372552793603, "loss": 1.5091, "step": 40180 }, { "epoch": 0.15933212188248927, "grad_norm": 0.10695404559373856, "learning_rate": 0.0025617900945204743, "loss": 1.5045, "step": 40200 }, { "epoch": 0.15946380132206156, "grad_norm": 0.11500686407089233, "learning_rate": 0.0025613427445603117, "loss": 1.5029, "step": 40220 }, { "epoch": 0.15959548076163388, "grad_norm": 0.09452733397483826, "learning_rate": 0.0025608952054785856, "loss": 1.5029, "step": 40240 }, { "epoch": 0.1597271602012062, "grad_norm": 0.10225624591112137, "learning_rate": 0.002560447477355043, "loss": 1.5061, "step": 40260 }, { "epoch": 0.1598588396407785, "grad_norm": 0.10620761662721634, "learning_rate": 0.002559999560269466, "loss": 1.5015, "step": 40280 }, { "epoch": 0.1599905190803508, "grad_norm": 0.11584058403968811, "learning_rate": 0.002559551454301669, "loss": 1.5255, "step": 40300 }, { "epoch": 0.1601221985199231, "grad_norm": 0.12006339430809021, "learning_rate": 0.0025591031595314996, "loss": 1.5512, "step": 40320 }, { "epoch": 0.16025387795949542, "grad_norm": 0.10483147948980331, "learning_rate": 0.0025586546760388413, "loss": 1.5584, "step": 40340 }, { "epoch": 0.1603855573990677, "grad_norm": 0.12490592896938324, "learning_rate": 0.002558206003903608, "loss": 1.5647, "step": 40360 }, { "epoch": 0.16051723683864003, "grad_norm": 0.09851817041635513, "learning_rate": 0.0025577571432057497, "loss": 1.558, "step": 40380 }, { "epoch": 0.16064891627821232, "grad_norm": 0.10723355412483215, "learning_rate": 0.0025573080940252497, "loss": 1.5505, "step": 40400 }, { "epoch": 0.16078059571778464, "grad_norm": 0.08668304234743118, "learning_rate": 0.002556858856442124, "loss": 1.5473, "step": 40420 }, { "epoch": 0.16091227515735693, "grad_norm": 0.13923218846321106, "learning_rate": 0.002556409430536423, "loss": 1.5451, "step": 40440 }, { "epoch": 0.16104395459692925, "grad_norm": 0.11584249883890152, "learning_rate": 0.00255595981638823, "loss": 1.5435, "step": 40460 }, { "epoch": 0.16117563403650154, "grad_norm": 0.09080822020769119, "learning_rate": 0.0025555100140776618, "loss": 1.5435, "step": 40480 }, { "epoch": 0.16130731347607385, "grad_norm": 0.0972919836640358, "learning_rate": 0.0025550600236848697, "loss": 1.5367, "step": 40500 }, { "epoch": 0.16143899291564615, "grad_norm": 0.10431429743766785, "learning_rate": 0.0025546098452900374, "loss": 1.5362, "step": 40520 }, { "epoch": 0.16157067235521846, "grad_norm": 0.1297275573015213, "learning_rate": 0.002554159478973383, "loss": 1.5287, "step": 40540 }, { "epoch": 0.16170235179479076, "grad_norm": 0.08693351596593857, "learning_rate": 0.002553708924815157, "loss": 1.5322, "step": 40560 }, { "epoch": 0.16183403123436307, "grad_norm": 0.10223674029111862, "learning_rate": 0.002553258182895645, "loss": 1.5283, "step": 40580 }, { "epoch": 0.16196571067393536, "grad_norm": 0.13661502301692963, "learning_rate": 0.0025528072532951646, "loss": 1.5335, "step": 40600 }, { "epoch": 0.16209739011350768, "grad_norm": 0.0959714725613594, "learning_rate": 0.0025523561360940666, "loss": 1.5409, "step": 40620 }, { "epoch": 0.16222906955307997, "grad_norm": 0.11499602347612381, "learning_rate": 0.0025519048313727365, "loss": 1.534, "step": 40640 }, { "epoch": 0.1623607489926523, "grad_norm": 0.10685988515615463, "learning_rate": 0.0025514533392115932, "loss": 1.5268, "step": 40660 }, { "epoch": 0.16249242843222458, "grad_norm": 0.12656660377979279, "learning_rate": 0.002551001659691088, "loss": 1.5253, "step": 40680 }, { "epoch": 0.1626241078717969, "grad_norm": 0.11715365201234818, "learning_rate": 0.002550549792891706, "loss": 1.5259, "step": 40700 }, { "epoch": 0.1627557873113692, "grad_norm": 0.1329299360513687, "learning_rate": 0.0025500977388939667, "loss": 1.525, "step": 40720 }, { "epoch": 0.1628874667509415, "grad_norm": 0.0944843739271164, "learning_rate": 0.00254964549777842, "loss": 1.5223, "step": 40740 }, { "epoch": 0.1630191461905138, "grad_norm": 0.09008379280567169, "learning_rate": 0.002549193069625653, "loss": 1.5215, "step": 40760 }, { "epoch": 0.16315082563008612, "grad_norm": 0.1306624561548233, "learning_rate": 0.0025487404545162825, "loss": 1.5174, "step": 40780 }, { "epoch": 0.1632825050696584, "grad_norm": 0.08844735473394394, "learning_rate": 0.0025482876525309618, "loss": 1.5239, "step": 40800 }, { "epoch": 0.16341418450923073, "grad_norm": 0.09808750450611115, "learning_rate": 0.0025478346637503764, "loss": 1.5219, "step": 40820 }, { "epoch": 0.16354586394880302, "grad_norm": 0.10559525340795517, "learning_rate": 0.002547381488255243, "loss": 1.5201, "step": 40840 }, { "epoch": 0.16367754338837534, "grad_norm": 0.09977331012487411, "learning_rate": 0.0025469281261263155, "loss": 1.5204, "step": 40860 }, { "epoch": 0.16380922282794763, "grad_norm": 0.11581449955701828, "learning_rate": 0.0025464745774443766, "loss": 1.5199, "step": 40880 }, { "epoch": 0.16394090226751995, "grad_norm": 0.10969722270965576, "learning_rate": 0.0025460208422902458, "loss": 1.5318, "step": 40900 }, { "epoch": 0.16407258170709224, "grad_norm": 0.12273216247558594, "learning_rate": 0.0025455669207447747, "loss": 1.5515, "step": 40920 }, { "epoch": 0.16420426114666456, "grad_norm": 0.09553756564855576, "learning_rate": 0.0025451128128888474, "loss": 1.5507, "step": 40940 }, { "epoch": 0.16433594058623688, "grad_norm": 0.1060953214764595, "learning_rate": 0.002544658518803382, "loss": 1.5528, "step": 40960 }, { "epoch": 0.16446762002580917, "grad_norm": 0.12041070312261581, "learning_rate": 0.00254420403856933, "loss": 1.5417, "step": 40980 }, { "epoch": 0.1645992994653815, "grad_norm": 0.09940062463283539, "learning_rate": 0.0025437493722676747, "loss": 1.5393, "step": 41000 }, { "epoch": 0.1645992994653815, "eval_loss": 1.5645551681518555, "eval_runtime": 67.891, "eval_samples_per_second": 14.729, "eval_steps_per_second": 14.729, "step": 41000 }, { "epoch": 0.16473097890495378, "grad_norm": 0.09117773175239563, "learning_rate": 0.0025432945199794343, "loss": 1.5385, "step": 41020 }, { "epoch": 0.1648626583445261, "grad_norm": 0.10133585333824158, "learning_rate": 0.0025428394817856585, "loss": 1.5357, "step": 41040 }, { "epoch": 0.1649943377840984, "grad_norm": 0.09552034735679626, "learning_rate": 0.0025423842577674315, "loss": 1.5355, "step": 41060 }, { "epoch": 0.1651260172236707, "grad_norm": 0.11098198592662811, "learning_rate": 0.00254192884800587, "loss": 1.5294, "step": 41080 }, { "epoch": 0.165257696663243, "grad_norm": 0.11762163043022156, "learning_rate": 0.0025414732525821243, "loss": 1.5263, "step": 41100 }, { "epoch": 0.16538937610281532, "grad_norm": 0.10004954785108566, "learning_rate": 0.0025410174715773766, "loss": 1.5232, "step": 41120 }, { "epoch": 0.1655210555423876, "grad_norm": 0.10917594283819199, "learning_rate": 0.0025405615050728427, "loss": 1.5209, "step": 41140 }, { "epoch": 0.16565273498195993, "grad_norm": 0.09700624644756317, "learning_rate": 0.002540105353149773, "loss": 1.5246, "step": 41160 }, { "epoch": 0.16578441442153222, "grad_norm": 0.1017017513513565, "learning_rate": 0.002539649015889448, "loss": 1.5235, "step": 41180 }, { "epoch": 0.16591609386110454, "grad_norm": 0.09013497084379196, "learning_rate": 0.002539192493373184, "loss": 1.5123, "step": 41200 }, { "epoch": 0.16604777330067683, "grad_norm": 0.117029570043087, "learning_rate": 0.0025387357856823277, "loss": 1.5192, "step": 41220 }, { "epoch": 0.16617945274024915, "grad_norm": 0.11237141489982605, "learning_rate": 0.002538278892898262, "loss": 1.5113, "step": 41240 }, { "epoch": 0.16631113217982144, "grad_norm": 0.09884624928236008, "learning_rate": 0.0025378218151024, "loss": 1.5188, "step": 41260 }, { "epoch": 0.16644281161939375, "grad_norm": 0.11448849737644196, "learning_rate": 0.002537364552376189, "loss": 1.5255, "step": 41280 }, { "epoch": 0.16657449105896605, "grad_norm": 0.12878195941448212, "learning_rate": 0.0025369071048011093, "loss": 1.5255, "step": 41300 }, { "epoch": 0.16670617049853836, "grad_norm": 0.12284272909164429, "learning_rate": 0.0025364494724586734, "loss": 1.5184, "step": 41320 }, { "epoch": 0.16683784993811066, "grad_norm": 0.0931035578250885, "learning_rate": 0.0025359916554304274, "loss": 1.5149, "step": 41340 }, { "epoch": 0.16696952937768297, "grad_norm": 0.09691374748945236, "learning_rate": 0.0025355336537979498, "loss": 1.5157, "step": 41360 }, { "epoch": 0.16710120881725526, "grad_norm": 0.09920854866504669, "learning_rate": 0.0025350754676428527, "loss": 1.5215, "step": 41380 }, { "epoch": 0.16723288825682758, "grad_norm": 0.13028231263160706, "learning_rate": 0.0025346170970467806, "loss": 1.5156, "step": 41400 }, { "epoch": 0.16736456769639987, "grad_norm": 0.09974183887243271, "learning_rate": 0.002534158542091411, "loss": 1.5231, "step": 41420 }, { "epoch": 0.1674962471359722, "grad_norm": 0.09403842687606812, "learning_rate": 0.0025336998028584546, "loss": 1.5189, "step": 41440 }, { "epoch": 0.16762792657554448, "grad_norm": 0.10986328125, "learning_rate": 0.0025332408794296528, "loss": 1.5196, "step": 41460 }, { "epoch": 0.1677596060151168, "grad_norm": 0.11757822334766388, "learning_rate": 0.0025327817718867837, "loss": 1.5365, "step": 41480 }, { "epoch": 0.1678912854546891, "grad_norm": 0.11819227039813995, "learning_rate": 0.002532322480311655, "loss": 1.5616, "step": 41500 }, { "epoch": 0.1680229648942614, "grad_norm": 0.12360888719558716, "learning_rate": 0.0025318630047861082, "loss": 1.5725, "step": 41520 }, { "epoch": 0.1681546443338337, "grad_norm": 0.09366869181394577, "learning_rate": 0.0025314033453920186, "loss": 1.5816, "step": 41540 }, { "epoch": 0.16828632377340602, "grad_norm": 0.09530407935380936, "learning_rate": 0.0025309435022112916, "loss": 1.5805, "step": 41560 }, { "epoch": 0.1684180032129783, "grad_norm": 0.12878450751304626, "learning_rate": 0.0025304834753258685, "loss": 1.5807, "step": 41580 }, { "epoch": 0.16854968265255063, "grad_norm": 0.1358455866575241, "learning_rate": 0.0025300232648177213, "loss": 1.5794, "step": 41600 }, { "epoch": 0.16868136209212295, "grad_norm": 0.12388956546783447, "learning_rate": 0.002529562870768855, "loss": 1.5766, "step": 41620 }, { "epoch": 0.16881304153169524, "grad_norm": 0.10921106487512589, "learning_rate": 0.002529102293261308, "loss": 1.5705, "step": 41640 }, { "epoch": 0.16894472097126756, "grad_norm": 0.1032082810997963, "learning_rate": 0.0025286415323771514, "loss": 1.5692, "step": 41660 }, { "epoch": 0.16907640041083985, "grad_norm": 0.10300302505493164, "learning_rate": 0.0025281805881984887, "loss": 1.567, "step": 41680 }, { "epoch": 0.16920807985041217, "grad_norm": 0.10055007040500641, "learning_rate": 0.002527719460807454, "loss": 1.566, "step": 41700 }, { "epoch": 0.16933975928998446, "grad_norm": 0.12738655507564545, "learning_rate": 0.0025272581502862185, "loss": 1.561, "step": 41720 }, { "epoch": 0.16947143872955678, "grad_norm": 0.10861164331436157, "learning_rate": 0.0025267966567169816, "loss": 1.567, "step": 41740 }, { "epoch": 0.16960311816912907, "grad_norm": 0.12459450215101242, "learning_rate": 0.0025263349801819784, "loss": 1.5651, "step": 41760 }, { "epoch": 0.1697347976087014, "grad_norm": 0.09590265899896622, "learning_rate": 0.0025258731207634753, "loss": 1.5661, "step": 41780 }, { "epoch": 0.16986647704827368, "grad_norm": 0.11365272849798203, "learning_rate": 0.002525411078543771, "loss": 1.5619, "step": 41800 }, { "epoch": 0.169998156487846, "grad_norm": 0.08910445868968964, "learning_rate": 0.0025249488536051965, "loss": 1.5585, "step": 41820 }, { "epoch": 0.1701298359274183, "grad_norm": 0.18229752779006958, "learning_rate": 0.0025244864460301176, "loss": 1.5526, "step": 41840 }, { "epoch": 0.1702615153669906, "grad_norm": 0.09740415215492249, "learning_rate": 0.0025240238559009307, "loss": 1.5529, "step": 41860 }, { "epoch": 0.1703931948065629, "grad_norm": 0.12560056149959564, "learning_rate": 0.0025235610833000644, "loss": 1.5509, "step": 41880 }, { "epoch": 0.17052487424613522, "grad_norm": 0.15917159616947174, "learning_rate": 0.002523098128309981, "loss": 1.5542, "step": 41900 }, { "epoch": 0.1706565536857075, "grad_norm": 0.13030411303043365, "learning_rate": 0.002522634991013175, "loss": 1.5513, "step": 41920 }, { "epoch": 0.17078823312527983, "grad_norm": 0.09367945790290833, "learning_rate": 0.0025221716714921728, "loss": 1.5559, "step": 41940 }, { "epoch": 0.17091991256485212, "grad_norm": 0.10787492990493774, "learning_rate": 0.0025217081698295342, "loss": 1.5554, "step": 41960 }, { "epoch": 0.17105159200442444, "grad_norm": 0.10562490671873093, "learning_rate": 0.0025212444861078503, "loss": 1.5504, "step": 41980 }, { "epoch": 0.17118327144399673, "grad_norm": 0.1048375815153122, "learning_rate": 0.0025207806204097464, "loss": 1.5566, "step": 42000 }, { "epoch": 0.17118327144399673, "eval_loss": 1.424837350845337, "eval_runtime": 66.5617, "eval_samples_per_second": 15.024, "eval_steps_per_second": 15.024, "step": 42000 }, { "epoch": 0.00013167943957230517, "grad_norm": 0.10541951656341553, "learning_rate": 0.0025203165728178776, "loss": 1.4444, "step": 42020 }, { "epoch": 0.00026335887914461035, "grad_norm": 0.12595529854297638, "learning_rate": 0.0025198523434149345, "loss": 1.435, "step": 42040 }, { "epoch": 0.00039503831871691555, "grad_norm": 0.1330813616514206, "learning_rate": 0.002519387932283637, "loss": 1.4314, "step": 42060 }, { "epoch": 0.0005267177582892207, "grad_norm": 0.10303393006324768, "learning_rate": 0.00251892333950674, "loss": 1.4189, "step": 42080 }, { "epoch": 0.0006583971978615259, "grad_norm": 0.13066118955612183, "learning_rate": 0.00251845856516703, "loss": 1.4188, "step": 42100 }, { "epoch": 0.0007900766374338311, "grad_norm": 0.09912826120853424, "learning_rate": 0.002517993609347324, "loss": 1.4279, "step": 42120 }, { "epoch": 0.0009217560770061363, "grad_norm": 0.16035521030426025, "learning_rate": 0.0025175284721304747, "loss": 1.4217, "step": 42140 }, { "epoch": 0.0010534355165784414, "grad_norm": 0.09864924103021622, "learning_rate": 0.002517063153599363, "loss": 1.4261, "step": 42160 }, { "epoch": 0.0011851149561507466, "grad_norm": 0.09063073992729187, "learning_rate": 0.002516597653836907, "loss": 1.4148, "step": 42180 }, { "epoch": 0.0013167943957230518, "grad_norm": 0.10235504806041718, "learning_rate": 0.0025161319729260527, "loss": 1.4225, "step": 42200 }, { "epoch": 0.001448473835295357, "grad_norm": 0.10286398977041245, "learning_rate": 0.002515666110949781, "loss": 1.4209, "step": 42220 }, { "epoch": 0.0015801532748676622, "grad_norm": 0.11597388982772827, "learning_rate": 0.002515200067991104, "loss": 1.4143, "step": 42240 }, { "epoch": 0.0017118327144399674, "grad_norm": 0.1071164458990097, "learning_rate": 0.0025147338441330663, "loss": 1.4171, "step": 42260 }, { "epoch": 0.0018435121540122726, "grad_norm": 0.11942466348409653, "learning_rate": 0.0025142674394587447, "loss": 1.4249, "step": 42280 }, { "epoch": 0.0019751915935845776, "grad_norm": 0.11480249464511871, "learning_rate": 0.002513800854051248, "loss": 1.4203, "step": 42300 }, { "epoch": 0.002106871033156883, "grad_norm": 0.10616378486156464, "learning_rate": 0.002513334087993718, "loss": 1.423, "step": 42320 }, { "epoch": 0.002238550472729188, "grad_norm": 0.09758572280406952, "learning_rate": 0.0025128671413693275, "loss": 1.4221, "step": 42340 }, { "epoch": 0.002370229912301493, "grad_norm": 0.16627156734466553, "learning_rate": 0.002512400014261283, "loss": 1.4268, "step": 42360 }, { "epoch": 0.0025019093518737984, "grad_norm": 0.11762084066867828, "learning_rate": 0.0025119327067528213, "loss": 1.436, "step": 42380 }, { "epoch": 0.0026335887914461036, "grad_norm": 0.11083631217479706, "learning_rate": 0.0025114652189272128, "loss": 1.4393, "step": 42400 }, { "epoch": 0.002765268231018409, "grad_norm": 0.521308183670044, "learning_rate": 0.0025109975508677594, "loss": 1.4376, "step": 42420 }, { "epoch": 0.002896947670590714, "grad_norm": 0.11644919961690903, "learning_rate": 0.0025105297026577953, "loss": 1.4641, "step": 42440 }, { "epoch": 0.003028627110163019, "grad_norm": 0.09482905268669128, "learning_rate": 0.002510061674380687, "loss": 1.4611, "step": 42460 }, { "epoch": 0.0031603065497353244, "grad_norm": 0.14098559319972992, "learning_rate": 0.0025095934661198333, "loss": 1.4756, "step": 42480 }, { "epoch": 0.0032919859893076296, "grad_norm": 0.10550355911254883, "learning_rate": 0.002509125077958663, "loss": 1.5066, "step": 42500 }, { "epoch": 0.003423665428879935, "grad_norm": 0.10194244980812073, "learning_rate": 0.00250865650998064, "loss": 1.5265, "step": 42520 }, { "epoch": 0.00355534486845224, "grad_norm": 0.12069813162088394, "learning_rate": 0.0025081877622692584, "loss": 1.5486, "step": 42540 }, { "epoch": 0.0036870243080245452, "grad_norm": 0.09516333788633347, "learning_rate": 0.002507718834908045, "loss": 1.5594, "step": 42560 }, { "epoch": 0.0038187037475968504, "grad_norm": 0.11514731496572495, "learning_rate": 0.002507249727980558, "loss": 1.5632, "step": 42580 }, { "epoch": 0.003950383187169155, "grad_norm": 0.10155905038118362, "learning_rate": 0.002506780441570388, "loss": 1.5779, "step": 42600 }, { "epoch": 0.004082062626741461, "grad_norm": 0.09767820686101913, "learning_rate": 0.002506310975761158, "loss": 1.5785, "step": 42620 }, { "epoch": 0.004213742066313766, "grad_norm": 0.09538809210062027, "learning_rate": 0.0025058413306365216, "loss": 1.5823, "step": 42640 }, { "epoch": 0.004345421505886071, "grad_norm": 0.09154420346021652, "learning_rate": 0.0025053715062801664, "loss": 1.5665, "step": 42660 }, { "epoch": 0.004477100945458376, "grad_norm": 0.1306425929069519, "learning_rate": 0.0025049015027758096, "loss": 1.5653, "step": 42680 }, { "epoch": 0.004608780385030682, "grad_norm": 0.12897877395153046, "learning_rate": 0.002504431320207203, "loss": 1.5562, "step": 42700 }, { "epoch": 0.004740459824602986, "grad_norm": 0.10444645583629608, "learning_rate": 0.002503960958658127, "loss": 1.5588, "step": 42720 }, { "epoch": 0.004872139264175292, "grad_norm": 0.11443938314914703, "learning_rate": 0.0025034904182123976, "loss": 1.5489, "step": 42740 }, { "epoch": 0.005003818703747597, "grad_norm": 0.11464277654886246, "learning_rate": 0.002503019698953859, "loss": 1.5547, "step": 42760 }, { "epoch": 0.0051354981433199024, "grad_norm": 0.13487665355205536, "learning_rate": 0.0025025488009663907, "loss": 1.5458, "step": 42780 }, { "epoch": 0.005267177582892207, "grad_norm": 0.11822563409805298, "learning_rate": 0.002502077724333901, "loss": 1.5472, "step": 42800 }, { "epoch": 0.005398857022464512, "grad_norm": 0.08794966340065002, "learning_rate": 0.002501606469140333, "loss": 1.5441, "step": 42820 }, { "epoch": 0.005530536462036818, "grad_norm": 0.09283588081598282, "learning_rate": 0.0025011350354696583, "loss": 1.5405, "step": 42840 }, { "epoch": 0.005662215901609122, "grad_norm": 0.11356227099895477, "learning_rate": 0.0025006634234058835, "loss": 1.534, "step": 42860 }, { "epoch": 0.005793895341181428, "grad_norm": 0.10243146866559982, "learning_rate": 0.0025001916330330454, "loss": 1.5381, "step": 42880 }, { "epoch": 0.005925574780753733, "grad_norm": 0.13794657588005066, "learning_rate": 0.0024997196644352114, "loss": 1.5302, "step": 42900 }, { "epoch": 0.006057254220326038, "grad_norm": 0.11851724237203598, "learning_rate": 0.0024992475176964834, "loss": 1.5267, "step": 42920 }, { "epoch": 0.006188933659898343, "grad_norm": 0.1327144056558609, "learning_rate": 0.002498775192900993, "loss": 1.5292, "step": 42940 }, { "epoch": 0.006320613099470649, "grad_norm": 0.09289969503879547, "learning_rate": 0.0024983026901329044, "loss": 1.5283, "step": 42960 }, { "epoch": 0.006452292539042954, "grad_norm": 0.10237723588943481, "learning_rate": 0.002497830009476413, "loss": 1.5254, "step": 42980 }, { "epoch": 0.006583971978615259, "grad_norm": 0.10176314413547516, "learning_rate": 0.0024973571510157467, "loss": 1.5199, "step": 43000 }, { "epoch": 0.006583971978615259, "eval_loss": 1.4149765968322754, "eval_runtime": 65.3786, "eval_samples_per_second": 15.296, "eval_steps_per_second": 15.296, "step": 43000 }, { "epoch": 0.006715651418187564, "grad_norm": 0.09919629245996475, "learning_rate": 0.0024968841148351635, "loss": 1.5191, "step": 43020 }, { "epoch": 0.00684733085775987, "grad_norm": 0.10323656350374222, "learning_rate": 0.0024964109010189557, "loss": 1.5233, "step": 43040 }, { "epoch": 0.006979010297332174, "grad_norm": 0.1806810349225998, "learning_rate": 0.002495937509651444, "loss": 1.5246, "step": 43060 }, { "epoch": 0.00711068973690448, "grad_norm": 0.11572176963090897, "learning_rate": 0.0024954639408169836, "loss": 1.5231, "step": 43080 }, { "epoch": 0.007242369176476785, "grad_norm": 0.11550699919462204, "learning_rate": 0.0024949901945999593, "loss": 1.5218, "step": 43100 }, { "epoch": 0.0073740486160490904, "grad_norm": 0.10549616813659668, "learning_rate": 0.002494516271084789, "loss": 1.5182, "step": 43120 }, { "epoch": 0.007505728055621395, "grad_norm": 0.09112010896205902, "learning_rate": 0.0024940421703559218, "loss": 1.5215, "step": 43140 }, { "epoch": 0.007637407495193701, "grad_norm": 0.10110776126384735, "learning_rate": 0.002493567892497837, "loss": 1.5225, "step": 43160 }, { "epoch": 0.007769086934766006, "grad_norm": 0.12719328701496124, "learning_rate": 0.002493093437595047, "loss": 1.5472, "step": 43180 }, { "epoch": 0.00790076637433831, "grad_norm": 0.13183355331420898, "learning_rate": 0.002492618805732096, "loss": 1.5569, "step": 43200 }, { "epoch": 0.008032445813910615, "grad_norm": 0.1020386666059494, "learning_rate": 0.0024921439969935585, "loss": 1.561, "step": 43220 }, { "epoch": 0.008164125253482922, "grad_norm": 0.14664006233215332, "learning_rate": 0.002491669011464041, "loss": 1.5541, "step": 43240 }, { "epoch": 0.008295804693055226, "grad_norm": 0.09918078035116196, "learning_rate": 0.0024911938492281813, "loss": 1.5547, "step": 43260 }, { "epoch": 0.008427484132627531, "grad_norm": 0.10724213719367981, "learning_rate": 0.0024907185103706497, "loss": 1.5512, "step": 43280 }, { "epoch": 0.008559163572199836, "grad_norm": 0.0950016900897026, "learning_rate": 0.0024902429949761468, "loss": 1.5441, "step": 43300 }, { "epoch": 0.008690843011772142, "grad_norm": 0.10287702083587646, "learning_rate": 0.002489767303129405, "loss": 1.5428, "step": 43320 }, { "epoch": 0.008822522451344447, "grad_norm": 0.09938202053308487, "learning_rate": 0.0024892914349151887, "loss": 1.5466, "step": 43340 }, { "epoch": 0.008954201890916752, "grad_norm": 0.09565220773220062, "learning_rate": 0.002488815390418293, "loss": 1.5379, "step": 43360 }, { "epoch": 0.009085881330489057, "grad_norm": 0.13361500203609467, "learning_rate": 0.0024883391697235442, "loss": 1.5327, "step": 43380 }, { "epoch": 0.009217560770061363, "grad_norm": 0.09708066284656525, "learning_rate": 0.002487862772915802, "loss": 1.5391, "step": 43400 }, { "epoch": 0.009349240209633668, "grad_norm": 0.10566909611225128, "learning_rate": 0.0024873862000799538, "loss": 1.5424, "step": 43420 }, { "epoch": 0.009480919649205973, "grad_norm": 0.08183527737855911, "learning_rate": 0.002486909451300922, "loss": 1.5419, "step": 43440 }, { "epoch": 0.009612599088778278, "grad_norm": 0.09500976651906967, "learning_rate": 0.0024864325266636587, "loss": 1.5366, "step": 43460 }, { "epoch": 0.009744278528350584, "grad_norm": 0.11120256781578064, "learning_rate": 0.0024859554262531467, "loss": 1.5349, "step": 43480 }, { "epoch": 0.009875957967922889, "grad_norm": 0.13951987028121948, "learning_rate": 0.0024854781501544017, "loss": 1.5282, "step": 43500 }, { "epoch": 0.010007637407495194, "grad_norm": 0.10958447307348251, "learning_rate": 0.0024850006984524693, "loss": 1.5272, "step": 43520 }, { "epoch": 0.010139316847067498, "grad_norm": 0.09942590445280075, "learning_rate": 0.002484523071232428, "loss": 1.5326, "step": 43540 }, { "epoch": 0.010270996286639805, "grad_norm": 0.1157267838716507, "learning_rate": 0.002484045268579386, "loss": 1.5296, "step": 43560 }, { "epoch": 0.01040267572621211, "grad_norm": 0.1331472247838974, "learning_rate": 0.0024835672905784835, "loss": 1.5249, "step": 43580 }, { "epoch": 0.010534355165784414, "grad_norm": 0.13041837513446808, "learning_rate": 0.0024830891373148916, "loss": 1.5287, "step": 43600 }, { "epoch": 0.01066603460535672, "grad_norm": 0.13223400712013245, "learning_rate": 0.0024826108088738122, "loss": 1.5229, "step": 43620 }, { "epoch": 0.010797714044929024, "grad_norm": 0.11160468310117722, "learning_rate": 0.002482132305340481, "loss": 1.5257, "step": 43640 }, { "epoch": 0.01092939348450133, "grad_norm": 0.1368405967950821, "learning_rate": 0.002481653626800161, "loss": 1.5232, "step": 43660 }, { "epoch": 0.011061072924073635, "grad_norm": 0.11044129729270935, "learning_rate": 0.002481174773338149, "loss": 1.5258, "step": 43680 }, { "epoch": 0.01119275236364594, "grad_norm": 0.11385578662157059, "learning_rate": 0.002480695745039773, "loss": 1.5252, "step": 43700 }, { "epoch": 0.011324431803218245, "grad_norm": 0.13926897943019867, "learning_rate": 0.00248021654199039, "loss": 1.5145, "step": 43720 }, { "epoch": 0.011456111242790551, "grad_norm": 0.10542988032102585, "learning_rate": 0.002479737164275391, "loss": 1.518, "step": 43740 }, { "epoch": 0.011587790682362856, "grad_norm": 0.19769559800624847, "learning_rate": 0.002479257611980196, "loss": 1.5328, "step": 43760 }, { "epoch": 0.01171947012193516, "grad_norm": 0.14825715124607086, "learning_rate": 0.002478777885190257, "loss": 1.5437, "step": 43780 }, { "epoch": 0.011851149561507466, "grad_norm": 0.12765994668006897, "learning_rate": 0.002478297983991057, "loss": 1.5491, "step": 43800 }, { "epoch": 0.011982829001079772, "grad_norm": 0.12340036034584045, "learning_rate": 0.00247781790846811, "loss": 1.5623, "step": 43820 }, { "epoch": 0.012114508440652077, "grad_norm": 0.12714795768260956, "learning_rate": 0.002477337658706961, "loss": 1.5452, "step": 43840 }, { "epoch": 0.012246187880224382, "grad_norm": 0.10861831903457642, "learning_rate": 0.0024768572347931856, "loss": 1.5451, "step": 43860 }, { "epoch": 0.012377867319796686, "grad_norm": 0.09523173421621323, "learning_rate": 0.002476376636812392, "loss": 1.5425, "step": 43880 }, { "epoch": 0.012509546759368993, "grad_norm": 0.09822442382574081, "learning_rate": 0.002475895864850217, "loss": 1.545, "step": 43900 }, { "epoch": 0.012641226198941298, "grad_norm": 0.11365661770105362, "learning_rate": 0.0024754149189923315, "loss": 1.5376, "step": 43920 }, { "epoch": 0.012772905638513602, "grad_norm": 0.10581135004758835, "learning_rate": 0.002474933799324434, "loss": 1.5364, "step": 43940 }, { "epoch": 0.012904585078085907, "grad_norm": 0.11580084264278412, "learning_rate": 0.002474452505932257, "loss": 1.5321, "step": 43960 }, { "epoch": 0.013036264517658214, "grad_norm": 0.08592469990253448, "learning_rate": 0.0024739710389015614, "loss": 1.5331, "step": 43980 }, { "epoch": 0.013167943957230518, "grad_norm": 0.10360794514417648, "learning_rate": 0.0024734893983181408, "loss": 1.5342, "step": 44000 }, { "epoch": 0.013167943957230518, "eval_loss": 1.4869463443756104, "eval_runtime": 63.1265, "eval_samples_per_second": 15.841, "eval_steps_per_second": 15.841, "step": 44000 }, { "epoch": 0.013299623396802823, "grad_norm": 0.11372421681880951, "learning_rate": 0.002473007584267819, "loss": 1.5213, "step": 44020 }, { "epoch": 0.013431302836375128, "grad_norm": 0.1096460372209549, "learning_rate": 0.002472525596836451, "loss": 1.5294, "step": 44040 }, { "epoch": 0.013562982275947433, "grad_norm": 0.12670129537582397, "learning_rate": 0.0024720434361099226, "loss": 1.5169, "step": 44060 }, { "epoch": 0.01369466171551974, "grad_norm": 0.09985670447349548, "learning_rate": 0.00247156110217415, "loss": 1.513, "step": 44080 }, { "epoch": 0.013826341155092044, "grad_norm": 0.1046002060174942, "learning_rate": 0.002471078595115081, "loss": 1.5224, "step": 44100 }, { "epoch": 0.013958020594664349, "grad_norm": 0.15750165283679962, "learning_rate": 0.0024705959150186944, "loss": 1.5242, "step": 44120 }, { "epoch": 0.014089700034236654, "grad_norm": 0.1028977781534195, "learning_rate": 0.0024701130619709986, "loss": 1.5234, "step": 44140 }, { "epoch": 0.01422137947380896, "grad_norm": 0.16695408523082733, "learning_rate": 0.0024696300360580337, "loss": 1.522, "step": 44160 }, { "epoch": 0.014353058913381265, "grad_norm": 0.12498366087675095, "learning_rate": 0.0024691468373658713, "loss": 1.5188, "step": 44180 }, { "epoch": 0.01448473835295357, "grad_norm": 0.09633167088031769, "learning_rate": 0.002468663465980612, "loss": 1.5245, "step": 44200 }, { "epoch": 0.014616417792525874, "grad_norm": 0.1630498468875885, "learning_rate": 0.002468179921988389, "loss": 1.5192, "step": 44220 }, { "epoch": 0.014748097232098181, "grad_norm": 0.11872150003910065, "learning_rate": 0.0024676962054753643, "loss": 1.5278, "step": 44240 }, { "epoch": 0.014879776671670486, "grad_norm": 0.17083382606506348, "learning_rate": 0.0024672123165277323, "loss": 1.5212, "step": 44260 }, { "epoch": 0.01501145611124279, "grad_norm": 0.12562261521816254, "learning_rate": 0.002466728255231718, "loss": 1.5217, "step": 44280 }, { "epoch": 0.015143135550815095, "grad_norm": 0.11627357453107834, "learning_rate": 0.002466244021673577, "loss": 1.521, "step": 44300 }, { "epoch": 0.015274814990387402, "grad_norm": 0.10252583771944046, "learning_rate": 0.0024657596159395937, "loss": 1.5237, "step": 44320 }, { "epoch": 0.015406494429959706, "grad_norm": 0.1185808777809143, "learning_rate": 0.0024652750381160865, "loss": 1.5174, "step": 44340 }, { "epoch": 0.015538173869532011, "grad_norm": 0.0919899195432663, "learning_rate": 0.002464790288289401, "loss": 1.5184, "step": 44360 }, { "epoch": 0.015669853309104316, "grad_norm": 0.16310234367847443, "learning_rate": 0.0024643053665459173, "loss": 1.5144, "step": 44380 }, { "epoch": 0.01580153274867662, "grad_norm": 0.16470354795455933, "learning_rate": 0.0024638202729720424, "loss": 1.4866, "step": 44400 }, { "epoch": 0.015933212188248926, "grad_norm": 0.12554654479026794, "learning_rate": 0.0024633350076542155, "loss": 1.4843, "step": 44420 }, { "epoch": 0.01606489162782123, "grad_norm": 0.13595227897167206, "learning_rate": 0.0024628495706789074, "loss": 1.4784, "step": 44440 }, { "epoch": 0.01619657106739354, "grad_norm": 0.10951948165893555, "learning_rate": 0.002462363962132618, "loss": 1.4678, "step": 44460 }, { "epoch": 0.016328250506965843, "grad_norm": 0.14208072423934937, "learning_rate": 0.0024618781821018785, "loss": 1.4665, "step": 44480 }, { "epoch": 0.016459929946538148, "grad_norm": 0.10121913254261017, "learning_rate": 0.0024613922306732506, "loss": 1.4681, "step": 44500 }, { "epoch": 0.016591609386110453, "grad_norm": 0.11362706124782562, "learning_rate": 0.0024609061079333256, "loss": 1.4584, "step": 44520 }, { "epoch": 0.016723288825682758, "grad_norm": 0.14318877458572388, "learning_rate": 0.0024604198139687268, "loss": 1.4655, "step": 44540 }, { "epoch": 0.016854968265255062, "grad_norm": 0.12110181897878647, "learning_rate": 0.002459933348866107, "loss": 1.4528, "step": 44560 }, { "epoch": 0.016986647704827367, "grad_norm": 0.11001115292310715, "learning_rate": 0.0024594467127121507, "loss": 1.4501, "step": 44580 }, { "epoch": 0.017118327144399672, "grad_norm": 0.16570629179477692, "learning_rate": 0.0024589599055935708, "loss": 1.4536, "step": 44600 }, { "epoch": 0.01725000658397198, "grad_norm": 0.11245054006576538, "learning_rate": 0.002458472927597112, "loss": 1.4548, "step": 44620 }, { "epoch": 0.017381686023544285, "grad_norm": 0.13176459074020386, "learning_rate": 0.0024579857788095505, "loss": 1.4485, "step": 44640 }, { "epoch": 0.01751336546311659, "grad_norm": 0.09991902112960815, "learning_rate": 0.002457498459317691, "loss": 1.4534, "step": 44660 }, { "epoch": 0.017645044902688894, "grad_norm": 0.0981200635433197, "learning_rate": 0.002457010969208369, "loss": 1.4469, "step": 44680 }, { "epoch": 0.0177767243422612, "grad_norm": 0.11083146929740906, "learning_rate": 0.0024565233085684507, "loss": 1.442, "step": 44700 }, { "epoch": 0.017908403781833504, "grad_norm": 0.09444429725408554, "learning_rate": 0.002456035477484834, "loss": 1.4514, "step": 44720 }, { "epoch": 0.01804008322140581, "grad_norm": 0.11763214319944382, "learning_rate": 0.0024555474760444445, "loss": 1.4521, "step": 44740 }, { "epoch": 0.018171762660978114, "grad_norm": 0.12316908687353134, "learning_rate": 0.00245505930433424, "loss": 1.449, "step": 44760 }, { "epoch": 0.018303442100550422, "grad_norm": 0.1016848236322403, "learning_rate": 0.0024545709624412093, "loss": 1.4494, "step": 44780 }, { "epoch": 0.018435121540122727, "grad_norm": 0.10764171183109283, "learning_rate": 0.002454082450452369, "loss": 1.4399, "step": 44800 }, { "epoch": 0.01856680097969503, "grad_norm": 0.11485065519809723, "learning_rate": 0.0024535937684547686, "loss": 1.4497, "step": 44820 }, { "epoch": 0.018698480419267336, "grad_norm": 0.1278896927833557, "learning_rate": 0.0024531049165354853, "loss": 1.4439, "step": 44840 }, { "epoch": 0.01883015985883964, "grad_norm": 0.14847633242607117, "learning_rate": 0.0024526158947816294, "loss": 1.4523, "step": 44860 }, { "epoch": 0.018961839298411946, "grad_norm": 0.105763278901577, "learning_rate": 0.00245212670328034, "loss": 1.4496, "step": 44880 }, { "epoch": 0.01909351873798425, "grad_norm": 0.1055736318230629, "learning_rate": 0.0024516373421187856, "loss": 1.446, "step": 44900 }, { "epoch": 0.019225198177556555, "grad_norm": 0.0994647964835167, "learning_rate": 0.002451147811384167, "loss": 1.4465, "step": 44920 }, { "epoch": 0.01935687761712886, "grad_norm": 0.10782650858163834, "learning_rate": 0.0024506581111637137, "loss": 1.4587, "step": 44940 }, { "epoch": 0.019488557056701168, "grad_norm": 0.12616658210754395, "learning_rate": 0.0024501682415446853, "loss": 1.496, "step": 44960 }, { "epoch": 0.019620236496273473, "grad_norm": 0.12615470588207245, "learning_rate": 0.002449678202614372, "loss": 1.5177, "step": 44980 }, { "epoch": 0.019751915935845778, "grad_norm": 0.10382698476314545, "learning_rate": 0.0024491879944600957, "loss": 1.5299, "step": 45000 }, { "epoch": 0.019751915935845778, "eval_loss": 1.5385295152664185, "eval_runtime": 66.2896, "eval_samples_per_second": 15.085, "eval_steps_per_second": 15.085, "step": 45000 }, { "epoch": 0.019883595375418082, "grad_norm": 0.11794433742761612, "learning_rate": 0.0024486976171692056, "loss": 1.528, "step": 45020 }, { "epoch": 0.020015274814990387, "grad_norm": 0.1409338116645813, "learning_rate": 0.002448207070829083, "loss": 1.5341, "step": 45040 }, { "epoch": 0.020146954254562692, "grad_norm": 0.12568840384483337, "learning_rate": 0.002447716355527138, "loss": 1.5318, "step": 45060 }, { "epoch": 0.020278633694134997, "grad_norm": 0.15237917006015778, "learning_rate": 0.0024472254713508133, "loss": 1.5449, "step": 45080 }, { "epoch": 0.0204103131337073, "grad_norm": 0.11090464144945145, "learning_rate": 0.002446734418387578, "loss": 1.5253, "step": 45100 }, { "epoch": 0.02054199257327961, "grad_norm": 0.11170685291290283, "learning_rate": 0.0024462431967249344, "loss": 1.5203, "step": 45120 }, { "epoch": 0.020673672012851915, "grad_norm": 0.10791482031345367, "learning_rate": 0.0024457518064504133, "loss": 1.5176, "step": 45140 }, { "epoch": 0.02080535145242422, "grad_norm": 0.09597095102071762, "learning_rate": 0.002445260247651576, "loss": 1.5193, "step": 45160 }, { "epoch": 0.020937030891996524, "grad_norm": 0.34346190094947815, "learning_rate": 0.0024447685204160145, "loss": 1.5182, "step": 45180 }, { "epoch": 0.02106871033156883, "grad_norm": 0.15261825919151306, "learning_rate": 0.0024442766248313494, "loss": 1.5151, "step": 45200 }, { "epoch": 0.021200389771141134, "grad_norm": 0.1070566177368164, "learning_rate": 0.0024437845609852314, "loss": 1.516, "step": 45220 }, { "epoch": 0.02133206921071344, "grad_norm": 0.10885826498270035, "learning_rate": 0.0024432923289653425, "loss": 1.5128, "step": 45240 }, { "epoch": 0.021463748650285743, "grad_norm": 0.13303355872631073, "learning_rate": 0.002442799928859394, "loss": 1.5122, "step": 45260 }, { "epoch": 0.021595428089858048, "grad_norm": 0.10217521339654922, "learning_rate": 0.002442307360755127, "loss": 1.5032, "step": 45280 }, { "epoch": 0.021727107529430356, "grad_norm": 0.11426650732755661, "learning_rate": 0.0024418146247403125, "loss": 1.5029, "step": 45300 }, { "epoch": 0.02185878696900266, "grad_norm": 0.09248542040586472, "learning_rate": 0.0024413217209027518, "loss": 1.4998, "step": 45320 }, { "epoch": 0.021990466408574966, "grad_norm": 0.12633563578128815, "learning_rate": 0.0024408286493302757, "loss": 1.4982, "step": 45340 }, { "epoch": 0.02212214584814727, "grad_norm": 0.16023258864879608, "learning_rate": 0.0024403354101107445, "loss": 1.5003, "step": 45360 }, { "epoch": 0.022253825287719575, "grad_norm": 0.12979178130626678, "learning_rate": 0.00243984200333205, "loss": 1.4963, "step": 45380 }, { "epoch": 0.02238550472729188, "grad_norm": 0.127953439950943, "learning_rate": 0.002439348429082112, "loss": 1.4973, "step": 45400 }, { "epoch": 0.022517184166864185, "grad_norm": 0.10096823424100876, "learning_rate": 0.002438854687448881, "loss": 1.4964, "step": 45420 }, { "epoch": 0.02264886360643649, "grad_norm": 0.1225760206580162, "learning_rate": 0.0024383607785203377, "loss": 1.5038, "step": 45440 }, { "epoch": 0.022780543046008798, "grad_norm": 0.15798920392990112, "learning_rate": 0.002437866702384491, "loss": 1.5002, "step": 45460 }, { "epoch": 0.022912222485581103, "grad_norm": 0.11615593731403351, "learning_rate": 0.0024373724591293827, "loss": 1.4992, "step": 45480 }, { "epoch": 0.023043901925153407, "grad_norm": 0.11516784876585007, "learning_rate": 0.0024368780488430806, "loss": 1.4973, "step": 45500 }, { "epoch": 0.023175581364725712, "grad_norm": 0.13365384936332703, "learning_rate": 0.002436383471613685, "loss": 1.4992, "step": 45520 }, { "epoch": 0.023307260804298017, "grad_norm": 0.13123133778572083, "learning_rate": 0.0024358887275293243, "loss": 1.5064, "step": 45540 }, { "epoch": 0.02343894024387032, "grad_norm": 0.106318898499012, "learning_rate": 0.0024353938166781584, "loss": 1.5163, "step": 45560 }, { "epoch": 0.023570619683442626, "grad_norm": 0.10438498854637146, "learning_rate": 0.0024348987391483753, "loss": 1.5152, "step": 45580 }, { "epoch": 0.02370229912301493, "grad_norm": 0.1130092591047287, "learning_rate": 0.0024344034950281933, "loss": 1.519, "step": 45600 }, { "epoch": 0.023833978562587236, "grad_norm": 0.12775199115276337, "learning_rate": 0.0024339080844058606, "loss": 1.5139, "step": 45620 }, { "epoch": 0.023965658002159544, "grad_norm": 0.09360072016716003, "learning_rate": 0.002433412507369654, "loss": 1.5066, "step": 45640 }, { "epoch": 0.02409733744173185, "grad_norm": 0.1027098149061203, "learning_rate": 0.002432916764007882, "loss": 1.5034, "step": 45660 }, { "epoch": 0.024229016881304154, "grad_norm": 0.11048934608697891, "learning_rate": 0.0024324208544088803, "loss": 1.4977, "step": 45680 }, { "epoch": 0.02436069632087646, "grad_norm": 0.11964282393455505, "learning_rate": 0.002431924778661017, "loss": 1.4941, "step": 45700 }, { "epoch": 0.024492375760448763, "grad_norm": 0.12463732808828354, "learning_rate": 0.002431428536852687, "loss": 1.4987, "step": 45720 }, { "epoch": 0.024624055200021068, "grad_norm": 0.13735800981521606, "learning_rate": 0.0024309321290723164, "loss": 1.4951, "step": 45740 }, { "epoch": 0.024755734639593373, "grad_norm": 0.11579196900129318, "learning_rate": 0.0024304355554083607, "loss": 1.4909, "step": 45760 }, { "epoch": 0.024887414079165678, "grad_norm": 0.1210319772362709, "learning_rate": 0.002429938815949304, "loss": 1.49, "step": 45780 }, { "epoch": 0.025019093518737986, "grad_norm": 0.11229152232408524, "learning_rate": 0.0024294419107836625, "loss": 1.4849, "step": 45800 }, { "epoch": 0.02515077295831029, "grad_norm": 0.09796669334173203, "learning_rate": 0.002428944839999978, "loss": 1.4831, "step": 45820 }, { "epoch": 0.025282452397882595, "grad_norm": 0.12028352171182632, "learning_rate": 0.0024284476036868256, "loss": 1.4836, "step": 45840 }, { "epoch": 0.0254141318374549, "grad_norm": 0.11071626096963882, "learning_rate": 0.002427950201932807, "loss": 1.4798, "step": 45860 }, { "epoch": 0.025545811277027205, "grad_norm": 0.10366615653038025, "learning_rate": 0.002427452634826556, "loss": 1.4781, "step": 45880 }, { "epoch": 0.02567749071659951, "grad_norm": 0.10610003024339676, "learning_rate": 0.0024269549024567333, "loss": 1.4838, "step": 45900 }, { "epoch": 0.025809170156171814, "grad_norm": 0.0969921201467514, "learning_rate": 0.002426457004912031, "loss": 1.4874, "step": 45920 }, { "epoch": 0.02594084959574412, "grad_norm": 0.11021365970373154, "learning_rate": 0.00242595894228117, "loss": 1.4853, "step": 45940 }, { "epoch": 0.026072529035316427, "grad_norm": 0.11574053019285202, "learning_rate": 0.0024254607146528993, "loss": 1.4812, "step": 45960 }, { "epoch": 0.026204208474888732, "grad_norm": 0.09534565359354019, "learning_rate": 0.002424962322116, "loss": 1.478, "step": 45980 }, { "epoch": 0.026335887914461037, "grad_norm": 0.10188112407922745, "learning_rate": 0.0024244637647592797, "loss": 1.4782, "step": 46000 }, { "epoch": 0.026335887914461037, "eval_loss": 1.558879017829895, "eval_runtime": 77.2288, "eval_samples_per_second": 12.949, "eval_steps_per_second": 12.949, "step": 46000 }, { "epoch": 2e-06, "grad_norm": 0.1454385668039322, "learning_rate": 0.000690285, "loss": 2.076281929016113, "step": 46020 }, { "epoch": 4e-06, "grad_norm": 0.07851192355155945, "learning_rate": 0.0006905850000000001, "loss": 2.036176300048828, "step": 46040 }, { "epoch": 6e-06, "grad_norm": 0.057373788207769394, "learning_rate": 0.000690885, "loss": 2.018076515197754, "step": 46060 }, { "epoch": 8e-06, "grad_norm": 0.058911461383104324, "learning_rate": 0.000691185, "loss": 2.0062496185302736, "step": 46080 }, { "epoch": 1e-05, "grad_norm": 0.08635017275810242, "learning_rate": 0.000691485, "loss": 2.0066757202148438, "step": 46100 }, { "epoch": 1.2e-05, "grad_norm": 0.0559137687087059, "learning_rate": 0.000691785, "loss": 1.999479103088379, "step": 46120 }, { "epoch": 1.4e-05, "grad_norm": 0.07066166400909424, "learning_rate": 0.000692085, "loss": 1.9976621627807618, "step": 46140 }, { "epoch": 1.6e-05, "grad_norm": 0.06597048789262772, "learning_rate": 0.000692385, "loss": 1.9841796875, "step": 46160 }, { "epoch": 1.8e-05, "grad_norm": 0.07282619923353195, "learning_rate": 0.000692685, "loss": 1.9873577117919923, "step": 46180 }, { "epoch": 2e-05, "grad_norm": 0.06868898123502731, "learning_rate": 0.000692985, "loss": 1.9878196716308594, "step": 46200 }, { "epoch": 2.2e-05, "grad_norm": 0.056995589286088943, "learning_rate": 0.000693285, "loss": 1.9771448135375977, "step": 46220 }, { "epoch": 2.4e-05, "grad_norm": 0.0641326829791069, "learning_rate": 0.000693585, "loss": 1.9761754989624023, "step": 46240 }, { "epoch": 2.6e-05, "grad_norm": 0.07175535708665848, "learning_rate": 0.000693885, "loss": 1.970853042602539, "step": 46260 }, { "epoch": 2.8e-05, "grad_norm": 0.06924993544816971, "learning_rate": 0.0006941849999999999, "loss": 1.9718612670898437, "step": 46280 }, { "epoch": 3e-05, "grad_norm": 0.06896559149026871, "learning_rate": 0.000694485, "loss": 1.9643774032592773, "step": 46300 }, { "epoch": 3.2e-05, "grad_norm": 0.058981869369745255, "learning_rate": 0.000694785, "loss": 1.9701652526855469, "step": 46320 }, { "epoch": 3.4e-05, "grad_norm": 0.06701400130987167, "learning_rate": 0.000695085, "loss": 1.957753562927246, "step": 46340 }, { "epoch": 3.6e-05, "grad_norm": 0.07226961851119995, "learning_rate": 0.000695385, "loss": 1.9627220153808593, "step": 46360 }, { "epoch": 3.8e-05, "grad_norm": 0.07805868238210678, "learning_rate": 0.000695685, "loss": 1.9605262756347657, "step": 46380 }, { "epoch": 4e-05, "grad_norm": 0.07272197306156158, "learning_rate": 0.000695985, "loss": 1.9611610412597655, "step": 46400 }, { "epoch": 4.2e-05, "grad_norm": 0.06122796609997749, "learning_rate": 0.000696285, "loss": 1.947123146057129, "step": 46420 }, { "epoch": 4.4e-05, "grad_norm": 0.08275068551301956, "learning_rate": 0.000696585, "loss": 1.9539257049560548, "step": 46440 }, { "epoch": 4.6e-05, "grad_norm": 0.0847841426730156, "learning_rate": 0.0006968850000000001, "loss": 1.9514825820922852, "step": 46460 }, { "epoch": 4.8e-05, "grad_norm": 0.05611637979745865, "learning_rate": 0.000697185, "loss": 1.948338508605957, "step": 46480 }, { "epoch": 5e-05, "grad_norm": 0.06900504976511002, "learning_rate": 0.0006974850000000001, "loss": 1.9451566696166993, "step": 46500 }, { "epoch": 5.2e-05, "grad_norm": 0.07195140421390533, "learning_rate": 0.000697785, "loss": 1.9498029708862306, "step": 46520 }, { "epoch": 5.4e-05, "grad_norm": 0.07324763387441635, "learning_rate": 0.0006980850000000001, "loss": 1.9459251403808593, "step": 46540 }, { "epoch": 5.6e-05, "grad_norm": 0.056651510298252106, "learning_rate": 0.000698385, "loss": 1.9457489013671876, "step": 46560 }, { "epoch": 5.8e-05, "grad_norm": 0.08276001363992691, "learning_rate": 0.000698685, "loss": 1.9360223770141602, "step": 46580 }, { "epoch": 6e-05, "grad_norm": 0.08096142113208771, "learning_rate": 0.0006989850000000001, "loss": 1.9375598907470704, "step": 46600 }, { "epoch": 6.2e-05, "grad_norm": 0.0721917450428009, "learning_rate": 0.000699285, "loss": 1.9336822509765625, "step": 46620 }, { "epoch": 6.4e-05, "grad_norm": 0.0872625857591629, "learning_rate": 0.0006995850000000001, "loss": 1.9410781860351562, "step": 46640 }, { "epoch": 6.6e-05, "grad_norm": 0.05740909278392792, "learning_rate": 0.000699885, "loss": 1.9338249206542968, "step": 46660 }, { "epoch": 6.8e-05, "grad_norm": 0.06273666769266129, "learning_rate": 0.000700185, "loss": 1.9296646118164062, "step": 46680 }, { "epoch": 7e-05, "grad_norm": 0.07139860838651657, "learning_rate": 0.000700485, "loss": 1.941641616821289, "step": 46700 }, { "epoch": 7.2e-05, "grad_norm": 0.07698002457618713, "learning_rate": 0.000700785, "loss": 1.9317914962768554, "step": 46720 }, { "epoch": 7.4e-05, "grad_norm": 0.062162358313798904, "learning_rate": 0.0007010850000000001, "loss": 1.9283344268798828, "step": 46740 }, { "epoch": 7.6e-05, "grad_norm": 0.0760132372379303, "learning_rate": 0.000701385, "loss": 1.9273748397827148, "step": 46760 }, { "epoch": 7.8e-05, "grad_norm": 0.09244687855243683, "learning_rate": 0.000701685, "loss": 1.9315763473510743, "step": 46780 }, { "epoch": 8e-05, "grad_norm": 0.06585084646940231, "learning_rate": 0.000701985, "loss": 1.9171140670776368, "step": 46800 }, { "epoch": 8.2e-05, "grad_norm": 0.07399197667837143, "learning_rate": 0.000702285, "loss": 1.9259872436523438, "step": 46820 }, { "epoch": 8.4e-05, "grad_norm": 0.0975058525800705, "learning_rate": 0.0007025849999999999, "loss": 1.9262987136840821, "step": 46840 }, { "epoch": 8.6e-05, "grad_norm": 0.062050431966781616, "learning_rate": 0.000702885, "loss": 1.9207113265991211, "step": 46860 }, { "epoch": 8.8e-05, "grad_norm": 0.06593676656484604, "learning_rate": 0.0007031849999999999, "loss": 1.9189161300659179, "step": 46880 }, { "epoch": 9e-05, "grad_norm": 0.0780588909983635, "learning_rate": 0.000703485, "loss": 1.9223506927490235, "step": 46900 }, { "epoch": 9.2e-05, "grad_norm": 0.06823083758354187, "learning_rate": 0.000703785, "loss": 1.912630844116211, "step": 46920 }, { "epoch": 9.4e-05, "grad_norm": 0.08263996988534927, "learning_rate": 0.000704085, "loss": 1.9180915832519532, "step": 46940 }, { "epoch": 9.6e-05, "grad_norm": 0.06720611453056335, "learning_rate": 0.000704385, "loss": 1.9188003540039062, "step": 46960 }, { "epoch": 9.8e-05, "grad_norm": 0.09634207934141159, "learning_rate": 0.000704685, "loss": 1.9179636001586915, "step": 46980 }, { "epoch": 0.0001, "grad_norm": 0.1031593307852745, "learning_rate": 0.0007049850000000001, "loss": 1.9118635177612304, "step": 47000 }, { "epoch": 0.0001, "eval_loss": 1.8519573211669922, "eval_runtime": 103.0547, "eval_samples_per_second": 9.704, "eval_steps_per_second": 9.704, "step": 47000 }, { "epoch": 0.000102, "grad_norm": 0.06469423323869705, "learning_rate": 0.000705285, "loss": 1.9127388000488281, "step": 47020 }, { "epoch": 0.000104, "grad_norm": 0.0648200586438179, "learning_rate": 0.000705585, "loss": 1.9220613479614257, "step": 47040 }, { "epoch": 0.000106, "grad_norm": 0.08908385783433914, "learning_rate": 0.0007058850000000001, "loss": 1.9115385055541991, "step": 47060 }, { "epoch": 0.000108, "grad_norm": 0.0783170759677887, "learning_rate": 0.000706185, "loss": 1.9148534774780273, "step": 47080 }, { "epoch": 0.00011, "grad_norm": 0.08982904255390167, "learning_rate": 0.0007064850000000001, "loss": 1.9030448913574218, "step": 47100 }, { "epoch": 0.000112, "grad_norm": 0.0841226652264595, "learning_rate": 0.000706785, "loss": 1.912649154663086, "step": 47120 }, { "epoch": 0.000114, "grad_norm": 0.08642134070396423, "learning_rate": 0.000707085, "loss": 1.9114418029785156, "step": 47140 }, { "epoch": 0.000116, "grad_norm": 0.06373965740203857, "learning_rate": 0.000707385, "loss": 1.9125936508178711, "step": 47160 }, { "epoch": 0.000118, "grad_norm": 0.07079387456178665, "learning_rate": 0.000707685, "loss": 1.9213525772094726, "step": 47180 }, { "epoch": 0.00012, "grad_norm": 0.07068858295679092, "learning_rate": 0.0007079850000000001, "loss": 1.9196317672729493, "step": 47200 }, { "epoch": 0.000122, "grad_norm": 0.0658358484506607, "learning_rate": 0.000708285, "loss": 1.928008460998535, "step": 47220 }, { "epoch": 0.000124, "grad_norm": 0.07867607474327087, "learning_rate": 0.000708585, "loss": 1.9092967987060547, "step": 47240 }, { "epoch": 0.000126, "grad_norm": 0.0598660483956337, "learning_rate": 0.000708885, "loss": 1.914600944519043, "step": 47260 }, { "epoch": 0.000128, "grad_norm": 0.06065090373158455, "learning_rate": 0.000709185, "loss": 1.9233844757080079, "step": 47280 }, { "epoch": 0.00013, "grad_norm": 0.09242924302816391, "learning_rate": 0.000709485, "loss": 1.9209175109863281, "step": 47300 }, { "epoch": 0.000132, "grad_norm": 0.06336706876754761, "learning_rate": 0.000709785, "loss": 1.9172807693481446, "step": 47320 }, { "epoch": 0.000134, "grad_norm": 0.06539217382669449, "learning_rate": 0.000710085, "loss": 1.921341896057129, "step": 47340 }, { "epoch": 0.000136, "grad_norm": 0.06496850401163101, "learning_rate": 0.000710385, "loss": 1.9217124938964845, "step": 47360 }, { "epoch": 0.000138, "grad_norm": 0.06589950621128082, "learning_rate": 0.000710685, "loss": 1.917654037475586, "step": 47380 }, { "epoch": 0.00014, "grad_norm": 0.10992733389139175, "learning_rate": 0.000710985, "loss": 1.909129524230957, "step": 47400 }, { "epoch": 0.000142, "grad_norm": 0.07374437898397446, "learning_rate": 0.000711285, "loss": 1.9101346969604491, "step": 47420 }, { "epoch": 0.000144, "grad_norm": 0.062163710594177246, "learning_rate": 0.0007115849999999999, "loss": 1.9079486846923828, "step": 47440 }, { "epoch": 0.000146, "grad_norm": 0.08394552022218704, "learning_rate": 0.000711885, "loss": 1.9161951065063476, "step": 47460 }, { "epoch": 0.000148, "grad_norm": 0.11592655628919601, "learning_rate": 0.000712185, "loss": 1.9125499725341797, "step": 47480 }, { "epoch": 0.00015, "grad_norm": 0.07041492313146591, "learning_rate": 0.000712485, "loss": 1.9119735717773438, "step": 47500 }, { "epoch": 0.000152, "grad_norm": 0.05417707934975624, "learning_rate": 0.0007127850000000001, "loss": 1.9030326843261718, "step": 47520 }, { "epoch": 0.000154, "grad_norm": 0.0702233612537384, "learning_rate": 0.000713085, "loss": 1.9038074493408204, "step": 47540 }, { "epoch": 0.000156, "grad_norm": 0.05859832465648651, "learning_rate": 0.0007133850000000001, "loss": 1.900547981262207, "step": 47560 }, { "epoch": 0.000158, "grad_norm": 0.08888107538223267, "learning_rate": 0.000713685, "loss": 1.9098312377929687, "step": 47580 }, { "epoch": 0.00016, "grad_norm": 0.0922444686293602, "learning_rate": 0.0007139850000000001, "loss": 1.902810287475586, "step": 47600 }, { "epoch": 0.000162, "grad_norm": 0.06493257731199265, "learning_rate": 0.000714285, "loss": 1.9034292221069335, "step": 47620 }, { "epoch": 0.000164, "grad_norm": 0.07373186200857162, "learning_rate": 0.000714585, "loss": 1.9035234451293945, "step": 47640 }, { "epoch": 0.000166, "grad_norm": 0.06822580099105835, "learning_rate": 0.0007148850000000001, "loss": 1.902390480041504, "step": 47660 }, { "epoch": 0.000168, "grad_norm": 0.06901398301124573, "learning_rate": 0.000715185, "loss": 1.89398136138916, "step": 47680 }, { "epoch": 0.00017, "grad_norm": 0.09062466770410538, "learning_rate": 0.0007154850000000001, "loss": 1.9004844665527343, "step": 47700 }, { "epoch": 0.000172, "grad_norm": 0.14246119558811188, "learning_rate": 0.000715785, "loss": 1.8940235137939454, "step": 47720 }, { "epoch": 0.000174, "grad_norm": 0.09346599876880646, "learning_rate": 0.000716085, "loss": 1.8926639556884766, "step": 47740 }, { "epoch": 0.000176, "grad_norm": 0.07609276473522186, "learning_rate": 0.000716385, "loss": 1.8961585998535155, "step": 47760 }, { "epoch": 0.000178, "grad_norm": 0.06778562813997269, "learning_rate": 0.000716685, "loss": 1.8936416625976562, "step": 47780 }, { "epoch": 0.00018, "grad_norm": 0.12500469386577606, "learning_rate": 0.0007169850000000001, "loss": 1.8971038818359376, "step": 47800 }, { "epoch": 0.000182, "grad_norm": 0.0834629014134407, "learning_rate": 0.000717285, "loss": 1.9050609588623046, "step": 47820 }, { "epoch": 0.000184, "grad_norm": 0.07134594768285751, "learning_rate": 0.000717585, "loss": 1.894935417175293, "step": 47840 }, { "epoch": 0.000186, "grad_norm": 0.06053246557712555, "learning_rate": 0.000717885, "loss": 1.8934173583984375, "step": 47860 }, { "epoch": 0.000188, "grad_norm": 0.07200822979211807, "learning_rate": 0.000718185, "loss": 1.895335578918457, "step": 47880 }, { "epoch": 0.00019, "grad_norm": 0.07255461066961288, "learning_rate": 0.000718485, "loss": 1.8858306884765625, "step": 47900 }, { "epoch": 0.000192, "grad_norm": 0.1142456904053688, "learning_rate": 0.000718785, "loss": 1.8956653594970703, "step": 47920 }, { "epoch": 0.000194, "grad_norm": 0.11873633414506912, "learning_rate": 0.000719085, "loss": 1.8932693481445313, "step": 47940 }, { "epoch": 0.000196, "grad_norm": 0.06071966513991356, "learning_rate": 0.000719385, "loss": 1.8919456481933594, "step": 47960 }, { "epoch": 0.000198, "grad_norm": 0.10144706070423126, "learning_rate": 0.000719685, "loss": 1.886199951171875, "step": 47980 }, { "epoch": 0.0002, "grad_norm": 0.07306289672851562, "learning_rate": 0.000719985, "loss": 1.886566734313965, "step": 48000 }, { "epoch": 0.0002, "eval_loss": 1.8350651264190674, "eval_runtime": 99.0695, "eval_samples_per_second": 10.094, "eval_steps_per_second": 10.094, "step": 48000 }, { "epoch": 0.000202, "grad_norm": 0.07433490455150604, "learning_rate": 0.000720285, "loss": 1.8901538848876953, "step": 48020 }, { "epoch": 0.000204, "grad_norm": 0.06506136059761047, "learning_rate": 0.000720585, "loss": 1.8856683731079102, "step": 48040 }, { "epoch": 0.000206, "grad_norm": 0.07532741129398346, "learning_rate": 0.000720885, "loss": 1.885334587097168, "step": 48060 }, { "epoch": 0.000208, "grad_norm": 0.08687019348144531, "learning_rate": 0.0007211850000000001, "loss": 1.8871675491333009, "step": 48080 }, { "epoch": 0.00021, "grad_norm": 0.06796624511480331, "learning_rate": 0.000721485, "loss": 1.88447265625, "step": 48100 }, { "epoch": 0.000212, "grad_norm": 0.07211881875991821, "learning_rate": 0.0007217850000000001, "loss": 1.8851350784301757, "step": 48120 }, { "epoch": 0.000214, "grad_norm": 0.09619178622961044, "learning_rate": 0.000722085, "loss": 1.8860481262207032, "step": 48140 }, { "epoch": 0.000216, "grad_norm": 0.09473865479230881, "learning_rate": 0.0007223850000000001, "loss": 1.8759679794311523, "step": 48160 }, { "epoch": 0.000218, "grad_norm": 0.06743013858795166, "learning_rate": 0.000722685, "loss": 1.8819561004638672, "step": 48180 }, { "epoch": 0.00022, "grad_norm": 0.08684151619672775, "learning_rate": 0.000722985, "loss": 1.877330207824707, "step": 48200 }, { "epoch": 0.000222, "grad_norm": 0.06397704780101776, "learning_rate": 0.000723285, "loss": 1.8899486541748047, "step": 48220 }, { "epoch": 0.000224, "grad_norm": 0.0900849923491478, "learning_rate": 0.000723585, "loss": 1.8874429702758788, "step": 48240 }, { "epoch": 0.000226, "grad_norm": 0.07488174736499786, "learning_rate": 0.0007238850000000001, "loss": 1.8861740112304688, "step": 48260 }, { "epoch": 0.000228, "grad_norm": 0.09316900372505188, "learning_rate": 0.000724185, "loss": 1.8858060836791992, "step": 48280 }, { "epoch": 0.00023, "grad_norm": 0.0723276361823082, "learning_rate": 0.000724485, "loss": 1.8740653991699219, "step": 48300 }, { "epoch": 0.000232, "grad_norm": 0.0841292217373848, "learning_rate": 0.000724785, "loss": 1.8807933807373047, "step": 48320 }, { "epoch": 0.000234, "grad_norm": 0.09044871479272842, "learning_rate": 0.000725085, "loss": 1.8928699493408203, "step": 48340 }, { "epoch": 0.000236, "grad_norm": 0.08968909084796906, "learning_rate": 0.000725385, "loss": 1.8885452270507812, "step": 48360 }, { "epoch": 0.000238, "grad_norm": 0.07492511719465256, "learning_rate": 0.000725685, "loss": 1.881599235534668, "step": 48380 }, { "epoch": 0.00024, "grad_norm": 0.06670362502336502, "learning_rate": 0.000725985, "loss": 1.886728858947754, "step": 48400 }, { "epoch": 0.000242, "grad_norm": 0.06100883707404137, "learning_rate": 0.000726285, "loss": 1.898359489440918, "step": 48420 }, { "epoch": 0.000244, "grad_norm": 0.07540082186460495, "learning_rate": 0.000726585, "loss": 1.8863595962524413, "step": 48440 }, { "epoch": 0.000246, "grad_norm": 0.06365904211997986, "learning_rate": 0.000726885, "loss": 1.8902715682983398, "step": 48460 }, { "epoch": 0.000248, "grad_norm": 0.07440081238746643, "learning_rate": 0.000727185, "loss": 1.8887521743774414, "step": 48480 }, { "epoch": 0.00025, "grad_norm": 0.06741853058338165, "learning_rate": 0.0007274849999999999, "loss": 1.8897829055786133, "step": 48500 }, { "epoch": 0.000252, "grad_norm": 0.06400787085294724, "learning_rate": 0.000727785, "loss": 1.892916488647461, "step": 48520 }, { "epoch": 0.000254, "grad_norm": 0.084056057035923, "learning_rate": 0.000728085, "loss": 1.8810224533081055, "step": 48540 }, { "epoch": 0.000256, "grad_norm": 0.07808465510606766, "learning_rate": 0.000728385, "loss": 1.8811614990234375, "step": 48560 }, { "epoch": 0.000258, "grad_norm": 0.06912193447351456, "learning_rate": 0.000728685, "loss": 1.8807933807373047, "step": 48580 }, { "epoch": 0.00026, "grad_norm": 0.11728200316429138, "learning_rate": 0.000728985, "loss": 1.8793157577514648, "step": 48600 }, { "epoch": 0.000262, "grad_norm": 0.07116056978702545, "learning_rate": 0.000729285, "loss": 1.8806476593017578, "step": 48620 }, { "epoch": 0.000264, "grad_norm": 0.07659170776605606, "learning_rate": 0.000729585, "loss": 1.8804895401000976, "step": 48640 }, { "epoch": 0.000266, "grad_norm": 0.05822935327887535, "learning_rate": 0.000729885, "loss": 1.8786319732666015, "step": 48660 }, { "epoch": 0.000268, "grad_norm": 0.07382626831531525, "learning_rate": 0.0007301850000000001, "loss": 1.8767101287841796, "step": 48680 }, { "epoch": 0.00027, "grad_norm": 0.07334620505571365, "learning_rate": 0.000730485, "loss": 1.8743818283081055, "step": 48700 }, { "epoch": 0.000272, "grad_norm": 0.07567453384399414, "learning_rate": 0.0007307850000000001, "loss": 1.8763639450073242, "step": 48720 }, { "epoch": 0.000274, "grad_norm": 0.08777511864900589, "learning_rate": 0.000731085, "loss": 1.8786584854125976, "step": 48740 }, { "epoch": 0.000276, "grad_norm": 0.09745394438505173, "learning_rate": 0.0007313850000000001, "loss": 1.8746225357055664, "step": 48760 }, { "epoch": 0.000278, "grad_norm": 0.06679695099592209, "learning_rate": 0.000731685, "loss": 1.8859651565551758, "step": 48780 }, { "epoch": 0.00028, "grad_norm": 0.054582711309194565, "learning_rate": 0.000731985, "loss": 1.8781494140625, "step": 48800 }, { "epoch": 0.000282, "grad_norm": 0.06270311772823334, "learning_rate": 0.000732285, "loss": 1.8780647277832032, "step": 48820 }, { "epoch": 0.000284, "grad_norm": 0.07959431409835815, "learning_rate": 0.000732585, "loss": 1.872858428955078, "step": 48840 }, { "epoch": 0.000286, "grad_norm": 0.08098466694355011, "learning_rate": 0.0007328850000000001, "loss": 1.8745456695556642, "step": 48860 }, { "epoch": 0.000288, "grad_norm": 0.0944877415895462, "learning_rate": 0.000733185, "loss": 1.8757490158081054, "step": 48880 }, { "epoch": 0.00029, "grad_norm": 0.09513352811336517, "learning_rate": 0.000733485, "loss": 1.886286735534668, "step": 48900 }, { "epoch": 0.000292, "grad_norm": 0.10484618693590164, "learning_rate": 0.000733785, "loss": 1.8716920852661132, "step": 48920 }, { "epoch": 0.000294, "grad_norm": 0.06396955996751785, "learning_rate": 0.000734085, "loss": 1.876509666442871, "step": 48940 }, { "epoch": 0.000296, "grad_norm": 0.06441602110862732, "learning_rate": 0.000734385, "loss": 1.8659820556640625, "step": 48960 }, { "epoch": 0.000298, "grad_norm": 0.08893131464719772, "learning_rate": 0.000734685, "loss": 1.865779495239258, "step": 48980 }, { "epoch": 0.0003, "grad_norm": 0.07854273170232773, "learning_rate": 0.000734985, "loss": 1.8671316146850585, "step": 49000 }, { "epoch": 0.0003, "eval_loss": 1.8231958150863647, "eval_runtime": 99.9569, "eval_samples_per_second": 10.004, "eval_steps_per_second": 10.004, "step": 49000 }, { "epoch": 0.000302, "grad_norm": 0.08891486376523972, "learning_rate": 0.000735285, "loss": 1.8616506576538085, "step": 49020 }, { "epoch": 0.000304, "grad_norm": 0.08781826496124268, "learning_rate": 0.000735585, "loss": 1.865854835510254, "step": 49040 }, { "epoch": 0.000306, "grad_norm": 0.12502416968345642, "learning_rate": 0.000735885, "loss": 1.8626695632934571, "step": 49060 }, { "epoch": 0.000308, "grad_norm": 0.06342129409313202, "learning_rate": 0.000736185, "loss": 1.8653135299682617, "step": 49080 }, { "epoch": 0.00031, "grad_norm": 0.08215075731277466, "learning_rate": 0.0007364849999999999, "loss": 1.8684637069702148, "step": 49100 }, { "epoch": 0.000312, "grad_norm": 0.09643544256687164, "learning_rate": 0.000736785, "loss": 1.8758543014526368, "step": 49120 }, { "epoch": 0.000314, "grad_norm": 0.08002220094203949, "learning_rate": 0.000737085, "loss": 1.8670568466186523, "step": 49140 }, { "epoch": 0.000316, "grad_norm": 0.05769426375627518, "learning_rate": 0.000737385, "loss": 1.8668659210205079, "step": 49160 }, { "epoch": 0.000318, "grad_norm": 0.09401297569274902, "learning_rate": 0.0007376850000000001, "loss": 1.8710269927978516, "step": 49180 }, { "epoch": 0.00032, "grad_norm": 0.1117960587143898, "learning_rate": 0.000737985, "loss": 1.870610237121582, "step": 49200 }, { "epoch": 0.000322, "grad_norm": 0.08143491297960281, "learning_rate": 0.0007382850000000001, "loss": 1.866176223754883, "step": 49220 }, { "epoch": 0.000324, "grad_norm": 0.0771065503358841, "learning_rate": 0.000738585, "loss": 1.867238426208496, "step": 49240 }, { "epoch": 0.000326, "grad_norm": 0.04945933073759079, "learning_rate": 0.000738885, "loss": 1.8657207489013672, "step": 49260 }, { "epoch": 0.000328, "grad_norm": 0.08263809978961945, "learning_rate": 0.0007391850000000001, "loss": 1.8570655822753905, "step": 49280 }, { "epoch": 0.00033, "grad_norm": 0.0943840742111206, "learning_rate": 0.000739485, "loss": 1.8613241195678711, "step": 49300 }, { "epoch": 0.000332, "grad_norm": 0.06208841875195503, "learning_rate": 0.0007397850000000001, "loss": 1.8662214279174805, "step": 49320 }, { "epoch": 0.000334, "grad_norm": 0.06485865265130997, "learning_rate": 0.000740085, "loss": 1.8635101318359375, "step": 49340 }, { "epoch": 0.000336, "grad_norm": 0.08560191094875336, "learning_rate": 0.000740385, "loss": 1.8564205169677734, "step": 49360 }, { "epoch": 0.000338, "grad_norm": 0.12357484549283981, "learning_rate": 0.000740685, "loss": 1.8634933471679687, "step": 49380 }, { "epoch": 0.00034, "grad_norm": 0.08451298624277115, "learning_rate": 0.000740985, "loss": 1.8603437423706055, "step": 49400 }, { "epoch": 0.000342, "grad_norm": 0.09098716825246811, "learning_rate": 0.0007412850000000001, "loss": 1.8705177307128906, "step": 49420 }, { "epoch": 0.000344, "grad_norm": 0.0718744546175003, "learning_rate": 0.000741585, "loss": 1.8548259735107422, "step": 49440 }, { "epoch": 0.000346, "grad_norm": 0.06135766953229904, "learning_rate": 0.000741885, "loss": 1.8501501083374023, "step": 49460 }, { "epoch": 0.000348, "grad_norm": 0.09332036226987839, "learning_rate": 0.000742185, "loss": 1.8546777725219727, "step": 49480 }, { "epoch": 0.00035, "grad_norm": 0.1360894739627838, "learning_rate": 0.000742485, "loss": 1.864227294921875, "step": 49500 }, { "epoch": 0.000352, "grad_norm": 0.08547444641590118, "learning_rate": 0.000742785, "loss": 1.8685710906982422, "step": 49520 }, { "epoch": 0.000354, "grad_norm": 0.10424457490444183, "learning_rate": 0.000743085, "loss": 1.8618698120117188, "step": 49540 }, { "epoch": 0.000356, "grad_norm": 0.09299690276384354, "learning_rate": 0.0007433849999999999, "loss": 1.8716371536254883, "step": 49560 }, { "epoch": 0.000358, "grad_norm": 0.06361870467662811, "learning_rate": 0.000743685, "loss": 1.8801010131835938, "step": 49580 }, { "epoch": 0.00036, "grad_norm": 0.08042526245117188, "learning_rate": 0.000743985, "loss": 1.8659257888793945, "step": 49600 }, { "epoch": 0.000362, "grad_norm": 0.10201700031757355, "learning_rate": 0.000744285, "loss": 1.8701637268066407, "step": 49620 }, { "epoch": 0.000364, "grad_norm": 0.10048798471689224, "learning_rate": 0.000744585, "loss": 1.8687246322631836, "step": 49640 }, { "epoch": 0.000366, "grad_norm": 0.10112548619508743, "learning_rate": 0.0007448849999999999, "loss": 1.867312240600586, "step": 49660 }, { "epoch": 0.000368, "grad_norm": 0.06898175179958344, "learning_rate": 0.000745185, "loss": 1.8694904327392579, "step": 49680 }, { "epoch": 0.00037, "grad_norm": 0.08607565611600876, "learning_rate": 0.000745485, "loss": 1.8709667205810547, "step": 49700 }, { "epoch": 0.000372, "grad_norm": 0.08153693377971649, "learning_rate": 0.000745785, "loss": 1.8627836227416992, "step": 49720 }, { "epoch": 0.000374, "grad_norm": 0.07933573424816132, "learning_rate": 0.0007460850000000001, "loss": 1.8717823028564453, "step": 49740 }, { "epoch": 0.000376, "grad_norm": 0.0822339653968811, "learning_rate": 0.000746385, "loss": 1.8707391738891601, "step": 49760 }, { "epoch": 0.000378, "grad_norm": 0.08838674426078796, "learning_rate": 0.0007466850000000001, "loss": 1.8709238052368165, "step": 49780 }, { "epoch": 0.00038, "grad_norm": 0.09605666249990463, "learning_rate": 0.000746985, "loss": 1.8747797012329102, "step": 49800 }, { "epoch": 0.000382, "grad_norm": 0.07646477222442627, "learning_rate": 0.0007472850000000001, "loss": 1.859670639038086, "step": 49820 }, { "epoch": 0.000384, "grad_norm": 0.07252638041973114, "learning_rate": 0.000747585, "loss": 1.856839942932129, "step": 49840 }, { "epoch": 0.000386, "grad_norm": 0.08199745416641235, "learning_rate": 0.000747885, "loss": 1.867083740234375, "step": 49860 }, { "epoch": 0.000388, "grad_norm": 0.07510737329721451, "learning_rate": 0.0007481850000000001, "loss": 1.8708480834960937, "step": 49880 }, { "epoch": 0.00039, "grad_norm": 0.10873018205165863, "learning_rate": 0.000748485, "loss": 1.8570371627807618, "step": 49900 }, { "epoch": 0.000392, "grad_norm": 0.07855768501758575, "learning_rate": 0.0007487850000000001, "loss": 1.8611907958984375, "step": 49920 }, { "epoch": 0.000394, "grad_norm": 0.0734357237815857, "learning_rate": 0.000749085, "loss": 1.8603155136108398, "step": 49940 }, { "epoch": 0.000396, "grad_norm": 0.11408625543117523, "learning_rate": 0.000749385, "loss": 1.862259292602539, "step": 49960 }, { "epoch": 0.000398, "grad_norm": 0.10029411315917969, "learning_rate": 0.000749685, "loss": 1.86767578125, "step": 49980 }, { "epoch": 0.0004, "grad_norm": 0.07305110991001129, "learning_rate": 0.000749985, "loss": 1.8574264526367188, "step": 50000 }, { "epoch": 0.0004, "eval_loss": 1.8127195835113525, "eval_runtime": 104.6958, "eval_samples_per_second": 9.551, "eval_steps_per_second": 9.551, "step": 50000 }, { "epoch": 0.000402, "grad_norm": 0.07434222847223282, "learning_rate": 0.0007502850000000001, "loss": 1.8548992156982422, "step": 50020 }, { "epoch": 0.000404, "grad_norm": 0.10143296420574188, "learning_rate": 0.000750585, "loss": 1.853312110900879, "step": 50040 }, { "epoch": 0.000406, "grad_norm": 0.08113838732242584, "learning_rate": 0.000750885, "loss": 1.8585927963256836, "step": 50060 }, { "epoch": 0.000408, "grad_norm": 0.06600955873727798, "learning_rate": 0.0007511849999999999, "loss": 1.853336715698242, "step": 50080 }, { "epoch": 0.00041, "grad_norm": 0.09208826720714569, "learning_rate": 0.0007514850000000001, "loss": 1.8564899444580079, "step": 50100 }, { "epoch": 0.000412, "grad_norm": 0.05692492425441742, "learning_rate": 0.000751785, "loss": 1.8583003997802734, "step": 50120 }, { "epoch": 0.000414, "grad_norm": 0.09818264096975327, "learning_rate": 0.000752085, "loss": 1.851161575317383, "step": 50140 }, { "epoch": 0.000416, "grad_norm": 0.11614762246608734, "learning_rate": 0.000752385, "loss": 1.8539705276489258, "step": 50160 }, { "epoch": 0.000418, "grad_norm": 0.06572745740413666, "learning_rate": 0.0007526849999999999, "loss": 1.862236785888672, "step": 50180 }, { "epoch": 0.00042, "grad_norm": 0.08823873102664948, "learning_rate": 0.0007529850000000001, "loss": 1.8488019943237304, "step": 50200 }, { "epoch": 0.000422, "grad_norm": 0.06876957416534424, "learning_rate": 0.000753285, "loss": 1.854522132873535, "step": 50220 }, { "epoch": 0.000424, "grad_norm": 0.1036091297864914, "learning_rate": 0.000753585, "loss": 1.8490419387817383, "step": 50240 }, { "epoch": 0.000426, "grad_norm": 0.08654841780662537, "learning_rate": 0.000753885, "loss": 1.8570022583007812, "step": 50260 }, { "epoch": 0.000428, "grad_norm": 0.0797325074672699, "learning_rate": 0.000754185, "loss": 1.852284049987793, "step": 50280 }, { "epoch": 0.00043, "grad_norm": 0.09358066320419312, "learning_rate": 0.000754485, "loss": 1.845249557495117, "step": 50300 }, { "epoch": 0.000432, "grad_norm": 0.09743467718362808, "learning_rate": 0.000754785, "loss": 1.8510974884033202, "step": 50320 }, { "epoch": 0.000434, "grad_norm": 0.07994414120912552, "learning_rate": 0.0007550850000000001, "loss": 1.8470056533813477, "step": 50340 }, { "epoch": 0.000436, "grad_norm": 0.07373213022947311, "learning_rate": 0.000755385, "loss": 1.8472797393798828, "step": 50360 }, { "epoch": 0.000438, "grad_norm": 0.07436708360910416, "learning_rate": 0.000755685, "loss": 1.8461109161376954, "step": 50380 }, { "epoch": 0.00044, "grad_norm": 0.06742985546588898, "learning_rate": 0.0007559850000000001, "loss": 1.8556638717651368, "step": 50400 }, { "epoch": 0.000442, "grad_norm": 0.07899279147386551, "learning_rate": 0.0007562850000000001, "loss": 1.8491823196411132, "step": 50420 }, { "epoch": 0.000444, "grad_norm": 0.0626215934753418, "learning_rate": 0.000756585, "loss": 1.8468595504760743, "step": 50440 }, { "epoch": 0.000446, "grad_norm": 0.07054529339075089, "learning_rate": 0.000756885, "loss": 1.8442632675170898, "step": 50460 }, { "epoch": 0.000448, "grad_norm": 0.08473960310220718, "learning_rate": 0.000757185, "loss": 1.8389867782592773, "step": 50480 }, { "epoch": 0.00045, "grad_norm": 0.08779094368219376, "learning_rate": 0.0007574850000000001, "loss": 1.847212028503418, "step": 50500 }, { "epoch": 0.000452, "grad_norm": 0.06304117292165756, "learning_rate": 0.0007577850000000001, "loss": 1.838887596130371, "step": 50520 }, { "epoch": 0.000454, "grad_norm": 0.07276386022567749, "learning_rate": 0.000758085, "loss": 1.8409353256225587, "step": 50540 }, { "epoch": 0.000456, "grad_norm": 0.07081222534179688, "learning_rate": 0.000758385, "loss": 1.8434917449951171, "step": 50560 }, { "epoch": 0.000458, "grad_norm": 0.09153230488300323, "learning_rate": 0.0007586849999999999, "loss": 1.8405410766601562, "step": 50580 }, { "epoch": 0.00046, "grad_norm": 0.08038565516471863, "learning_rate": 0.0007589850000000001, "loss": 1.8444704055786132, "step": 50600 }, { "epoch": 0.000462, "grad_norm": 0.08140019327402115, "learning_rate": 0.0007592850000000001, "loss": 1.8456674575805665, "step": 50620 }, { "epoch": 0.000464, "grad_norm": 0.07837044447660446, "learning_rate": 0.000759585, "loss": 1.8389007568359375, "step": 50640 }, { "epoch": 0.000466, "grad_norm": 0.08453674614429474, "learning_rate": 0.000759885, "loss": 1.8354032516479493, "step": 50660 }, { "epoch": 0.000468, "grad_norm": 0.08782172948122025, "learning_rate": 0.0007601849999999999, "loss": 1.8379409790039063, "step": 50680 }, { "epoch": 0.00047, "grad_norm": 0.06480462849140167, "learning_rate": 0.0007604850000000001, "loss": 1.8450876235961915, "step": 50700 }, { "epoch": 0.000472, "grad_norm": 0.09490370750427246, "learning_rate": 0.000760785, "loss": 1.8424947738647461, "step": 50720 }, { "epoch": 0.000474, "grad_norm": 0.09134998172521591, "learning_rate": 0.000761085, "loss": 1.8489044189453125, "step": 50740 }, { "epoch": 0.000476, "grad_norm": 0.08516672253608704, "learning_rate": 0.000761385, "loss": 1.8510494232177734, "step": 50760 }, { "epoch": 0.000478, "grad_norm": 0.09990148991346359, "learning_rate": 0.000761685, "loss": 1.8433395385742188, "step": 50780 }, { "epoch": 0.00048, "grad_norm": 0.07432044297456741, "learning_rate": 0.0007619850000000001, "loss": 1.8616621017456054, "step": 50800 }, { "epoch": 0.000482, "grad_norm": 0.07730050384998322, "learning_rate": 0.000762285, "loss": 1.857870101928711, "step": 50820 }, { "epoch": 0.000484, "grad_norm": 0.09263300895690918, "learning_rate": 0.000762585, "loss": 1.852854347229004, "step": 50840 }, { "epoch": 0.000486, "grad_norm": 0.1193644255399704, "learning_rate": 0.000762885, "loss": 1.8558570861816406, "step": 50860 }, { "epoch": 0.000488, "grad_norm": 0.06789831817150116, "learning_rate": 0.000763185, "loss": 1.8561784744262695, "step": 50880 }, { "epoch": 0.00049, "grad_norm": 0.09891850501298904, "learning_rate": 0.000763485, "loss": 1.8547218322753907, "step": 50900 }, { "epoch": 0.000492, "grad_norm": 0.07384803146123886, "learning_rate": 0.0007637850000000001, "loss": 1.856735610961914, "step": 50920 }, { "epoch": 0.000494, "grad_norm": 0.07126709073781967, "learning_rate": 0.0007640850000000001, "loss": 1.855617141723633, "step": 50940 }, { "epoch": 0.000496, "grad_norm": 0.0794643834233284, "learning_rate": 0.000764385, "loss": 1.851529312133789, "step": 50960 }, { "epoch": 0.000498, "grad_norm": 0.07430235296487808, "learning_rate": 0.000764685, "loss": 1.84918270111084, "step": 50980 }, { "epoch": 0.0005, "grad_norm": 0.05850321426987648, "learning_rate": 0.0007649850000000001, "loss": 1.8446617126464844, "step": 51000 }, { "epoch": 0.0005, "eval_loss": 1.8034069538116455, "eval_runtime": 99.2653, "eval_samples_per_second": 10.074, "eval_steps_per_second": 10.074, "step": 51000 } ], "logging_steps": 20, "max_steps": 10000000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8.94075150532608e+18, "train_batch_size": 32, "trial_name": null, "trial_params": null }